Transcrições
1. The Vision Architecting Your Personal News Factory: Oi, todo mundo. Bem-vindo. Estou
muito animada por você estar aqui porque hoje não estamos apenas construindo outro chatbot
chato Estamos construindo uma fábrica de notícias
personalizada, uma agência de mídia que trabalha exclusivamente para você
e para as pessoas que você ama. Imagine que seu pai acorda e, em vez de desaparecer
em um rabisco silencioso e
interminável em seu telefone, ele clica em play em um podcast de notícias personalizado enviado diretamente para São as manchetes matinais
transformadas em uma história que toda a família pode
realmente curtir junta Mas aqui está a mágica
que criamos. Ele escolhe as vozes, sejam elas calmas, narradoras
profissionais para começar o dia ou pessoas cheias de energia, como
Marcus e Sarah, para fazer Marcus e Sarah, para as crianças rirem enquanto
tomam café
da manhã Construíram a lógica para
dar vida à sua manhã. Podemos tornar o programa divertido,
divertido e rápido,
mas nunca comprometemos a
verdade Isso é notícia ao vivo do mundo real. Não estamos apenas deixando
um LLM inventar coisas. Nosso agente busca eventos atuais
reais que estão acontecendo agora e os
transforma em um roteiro. É uma mistura perfeita de personalidade e fatos 100%
verificados, e não se limita ao inglês. Trabalhamos
muito para garantir que esta fábrica
fale seu idioma. Seja em hindi, espanhol ou francês, suas notícias
devem soar como um lar Você ainda pode definir o clima, fazer disso um briefing sério para sua viagem matinal ou um programa divertido cheio
de fofocas Eu construo isso para
minha própria família e ver
a reação deles ao ouvir seus nomes e interesses em sua língua nativa foi o momento Aha que quero
dar a vocês hoje Neste curso, estou desenvolvendo
essa live com você. Você verá a lógica, os fios e como
lidamos com a tecnologia do mundo real. Usaremos Antin
para gerenciar o fluxo, abrir os olhos para o cérebro e 11 voltas para aquelas vozes humanas
deslumbrantes Ao final disso, você terá um sistema totalmente automatizado
que funciona enquanto você dorme. Pegue um café, abra seu laptop e vamos transformar essa
visão em realidade.
2. Naming the Mission & Building the AI Brain: Antes de escrevermos uma
única linha de lógica, precisamos começar do zero. Veja esta tela em branco. É aqui que sua
visão toma forma. Primeiro, vamos
nomear nosso fluxo de trabalho. Estou chamando o meu de Abri AI. Para quem não sabe, Kuber significa noche e
um cubículo é um jornalista, a pessoa que sempre
tem o Ao acrescentar, estamos sinalizando que isso não é apenas uma redação,
é uma força de notícias
automatizada inteligente Sim Esse é o
nome do meu fluxo de trabalho. Definindo a persona agora, vamos dar vida à Kubri AI Começamos colocando um nó de agente de IA em nossa tela e agora precisamos
definir o prompt Usaremos a
mensagem do usuário e a mensagem do sistema. Então, essas são as mensagens do usuário em que colocaremos
o material dinâmico,
certo, uma categoria de notícias que pode variar de acordo com as necessidades de cada
usuário. Então, vamos
levar isso para a bagunça dos usuários e, em seguida, a mensagem do sistema é o lugar para, você sabe, regras Portanto, esse é o
prompt do sistema que definimos. Se você observar, nosso aviso dá à IA uma identidade clara. Já dissemos que você é o produtor executivo
do programa Marcus e Sara Isso é algo que sempre
podemos personalizar. Se você quiser um nome diferente
para o programa, tudo bem. Então estamos dizendo que você
nunca inventa notícias. Você só discute o que
encontra em suas ferramentas. Isso é importante porque se não dermos
instruções como essa
, o LLM pode alucinar
e inventar as notícias sozinho, sem realmente navegar na Internet
e buscar as Não queremos alucinações de IA. Queremos notícias ao vivo. Queremos saber o que está
acontecendo nas ruas de Mumbai ou nos campos de
Manchester no momento Vamos copiar essas
mensagens para o nosso nó. Então eu vou fazer isso ser uma bagunça do usuário e aqui está a bagunça
do sistema E sistema. Escrevemos uma instrução especial no cerne de nossa mensagem. Antes de escrever
uma única caixa de diálogo, você deve usar sua ferramenta para
obter as manchetes mais recentes O Cabri AI agora está cego
e esperando por olhos. Na próxima etapa, criaremos a ferramenta fetch News Essa é a ponte que conecta cérebro do
nosso agente
à rede global de notícias, garantindo que cada palavra falada seja apoiada por fatos em tempo
real. Vamos mergulhar em nossos
parâmetros e dar uma olhada nossa IA Kubri.
3. The News Engine Fetching Real Time Truth: Deixe-me adicionar essa ferramenta, clique em Novo e eu quero
solicitar a ferramenta STTPRquest e o nome da ferramenta, conforme
definimos no prompt
do agente , deve ser fetch
News Agora que
definimos o cérebro AIS, precisamos dar a ele sua
principal fonte de verdade. Escolhendo o motor antes
de iniciar nossa configuração atual, avaliei várias opções, API de
notícias, o Google Notícias e até mesmo a criação de
um raspador personalizado Mas acabamos optando
por dados de notícias DTO. Por quê? Por causa da agilidade Ele nos permite passar
várias categorias em uma única solicitação aquela superconsulta que
discutimos anteriormente e dá ao agente controle
preciso sobre
o tamanho da resposta Se queremos cinco
manchetes ou 50, o agente pode decidir com base nas necessidades
do usuário se você
está usando a
API de dados de notícias, é claro Agora vamos falar sobre a arquitetura
plug and play. A beleza do
sistema que estamos construindo é que ele é independente do fornecedor Estou te ensinando a construir
um sistema reconfigurável. Se amanhã você quiser
mudar para um provedor de
notícias diferente, não
precisará reconstruir toda
a fábrica Você simplesmente troca o
endpoint da API e a chave secreta. O resto da sua lógica
permanece intocado. É assim que os sistemas profissionais são arquitetados, não é? No mundo real, usamos curl. Vou supor que você tenha uma compreensão básica do
que é um comando curl Mas para aqueles que
são novos nisso, quero desmistificar o que
você está vendo No mundo do desenvolvimento de IA, curl é nossa linguagem universal,
esteja você usando OpenAI, esteja você usando OpenAI, ElevenLabs ou IO de dados Todos eles fornecem um
comando curl em sua documentação. É basicamente a chamada
da API, certo? Pense em um comando curl como
uma nota de entrega digital. Ao enviar um pacote, você precisa de quatro coisas: o endereço ou o que chamamos de endpoint.
Para onde vai o pacote? Neste exemplo,
é newdata dot IO. Então, o método: estamos obtendo
informações ou publicando novos dados? Então, está definido aqui, e depois o passe de segurança, sua chave de API que
prova que você tem permissão
para entrar no prédio, depois a carga em si A categoria específica de notícias ou os nomes de
voz que você deseja que
a API processe. Basicamente, a carga útil.
Por que isso é importante para você, estou mostrando o método curl porque ele torna seu
sistema preparado para o futuro Se você encontrar uma API de
notícias melhor amanhã, não precisará
aprender uma nova ferramenta. Basta pegar o comando
curl deles, importá-lo para o Nitin e sua fábrica continua funcionando Você está construindo
um sistema modular, reconfigurável
e profissional Agora, para criar
a ferramenta fetch news, tudo o que precisamos é
esse comando curl. Em primeiro lugar, deixe-me
ter certeza de que está funcionando. Vou até aqui,
cole e aperte enter. E você pode ver
que começou a receber as notícias. Isso é uma boa notícia. Agora, talvez o que eu não
goste nesse esteja disponível apenas em planos profissionais
e corporativos. Isso é algo que eu quero evitar porque, se eu
não remover isso,
isso criará um ruído
extra
na resposta e esse ruído deverá ser processado pelo LLM, que consumirá tokens extras Não é bom, talvez o que eu possa
fazer é fazer com que seja assim. É a mesma afirmação novamente, exceto que queremos
excluir determinados campos e limitamos a
resposta ao tamanho de dez. Deixe-me apertar enter.
Todos esses avisos de que só estão disponíveis nos
planos corporativos foram removidos agora Isso é uma boa notícia, não é? Agora, vamos pegar essa declaração, ir para Nitin, e você não precisa preencher
nada manualmente Basta dizer Importar curl, colar a declaração aqui,
como está, e clicar em Importar Agora deixe-me fazer uma
pequena mudança aqui. Codificamos essas
categorias aqui. No momento, temos esse
valor codificado, mas no mundo real, queremos que
nosso agente conduza isso Basta clicar
nesse sinal mágico e deixar a IA fazer a mágica. Quão legal é isso? Com isso, nossa ferramenta de busca de
notícias está pronta. Vamos tentar executá-lo e ver se as coisas
estão bem até agora. Portanto, nosso agente de IA
deve ser capaz de usar a ferramenta fetch News receber as notícias e criar
uma conversa para nós Então, deixe-me deletar isso. Você não quer isso. Eu
quero acioná-lo manualmente. Vou selecionar o gatilho manual, conectá-lo ao
agente de IA. Isso é bom. Em seguida, o modelo de bate-papo, precisamos adicionar. Vou selecionar o modelo de bate-papo OpenAI e quero que ele seja criativo,
e vou selecionar o GPT five GPT cinco mais recentes. Para usar esse modelo, você precisará adicionar
sua chave OpenAI É muito simples. Basta clicar em
Criar novas credenciais,
acessar sua plataforma open.com,
criar uma nova chave secreta,
dar um nome, selecionar um projeto
e criar a chave secreta e, em seguida,
pegar a chave secreta,
acessar a ANATN novamente
e colar aqui acessar sua plataforma open.com,
criar uma nova chave secreta, dar um nome, selecionar um projeto
e criar a chave secreta e, em seguida,
pegar a chave secreta, acessar a ANATN novamente
e Isso é tudo que você precisa fazer para configurar a conta
OpenAI Espero que você consiga
fazer isso de forma independente. Ok, então com isso, o modelo é adicionado ao nosso agente. Então, basicamente, agora
o agente usará esse modelo específico para seu raciocínio, ação e
cadeia de pensamentos, certo? Ok, isso é bom. Agora estamos prontos
para acioná-lo. Então, deixe-me tentar. Então você pode ver que ele fez uso
dessa API de busca de notícias. É por isso que está em verde, deixe-me ir para o ASN
e pronto Veja, está falando
sobre o ano novo, que basicamente está
acontecendo agora, agente não saberá disso diretamente,
pelo que pude ver,
essas são notícias reais. Bingo, isso é uma boa notícia. Nosso agente de IA é capaz de
usar suas ferramentas para
buscar as notícias e, em seguida, criar a saída exatamente como
queríamos que fosse Com isso, implementamos e
testamos
com sucesso o cérebro e o
motor do nosso caber AI Bem, isso é um começo muito bom. Agora, na próxima palestra, vamos trabalhar para dar voz ao nosso cubre AI
. Veja lá.
4. Giving the Factory a Voice Integrating Human Like Speech: Construímos com sucesso nosso
cérebro e nosso mecanismo de notícias. Mas uma redação sem voz
é apenas um banco de dados silencioso. Agora vamos para uma etapa crítica, dando voz à fábrica. Não estamos procurando uma conversão
robótica de texto em fala. Queremos uma atuação humana que capture a espera por
uma história de última hora Para conseguir isso, estamos
integrando 11 laboratórios. Eles são líderes indiscutíveis
em IA de voz generativa, estabelecendo o padrão global de profundidade
emocional
e realismo profundidade
emocional
e Quando você ouve uma voz da
ElevenLabs, você não ouve apenas palavras Você ouve a amplitude,
a cadência e a autoridade de uma Agora, para nosso projeto, precisamos escolher a voz de nossos artistas para que possamos ir até as vozes e ver a
biblioteca das Isso é inteiramente para
sua criatividade. Não quero
recomendar duas vozes. Você pode usar duas
vozes masculinas, duas vozes femininas ,
uma voz masculina e uma voz feminina em qualquer combinação
que quiser usar, além de escolher uma
voz para crianças e talvez essa seja uma ideia
até fofa em que
as crianças discutem as notícias
e o mantêm atualizado. Além disso, você não
precisa escolher as vozes que falam inglês. Você pode usar uma grande variedade
de idiomas compatíveis com o
ElevenLabs, e o que estamos
pedindo é acessar qualquer voz
e copiar seu ID de voz Basicamente, você precisa encontrar
dois IDs de voz como esse, que podem ser fornecidos aos
artistas do programa Sim. Agora, antes de
automatizarmos todo o fluxo, precisamos provar
a conexão x. Pense nisso como o aperto de mão entre nossa lógica e nossa Eu já fiz o trabalho
pesado aqui. Passei um tempo
navegando pela documentação,
identificando os endpoints de API mais
responsivos e selecionando as vozes
específicas
que dominam a autoridade de nossa
redação Se você quiser experimentar essa jornada de pesquisa sozinho, fique à vontade para mergulhar na
documentação técnica. No entanto, nesta sessão, estou pulando a
tentativa e erro para mostrar o resultado final
otimizado Esse é o
comando curl que funciona. Deixe-me te mostrar imediatamente. Deixe-me ir para o terminal. Cole aqui. Parece que não
funciona no Powershell Tudo bem. E deixe-me
provar isso imediatamente. Então, deixe-me colar o
comando curl aqui, pressione Enter. Vá para este lugar. Você pode ver este arquivo: o podcast temp
three foi criado aqui É baixado do ElevenLabs.
Deixe-me tocar para você. Então você pode ver que já está
funcionando, certo? O comando curl funciona
e esse é o ponto. Talvez você queira executar o comando
curl sozinho baixar este podcast e
ouvi-lo. Está perfeitamente bem. O que eu quero fazer agora é começar a integrar o
Ant e o fluxo de trabalho
e, para isso,
precisaremos de um nó de solicitação Então STTPRquest clique aqui. E importe o comando curl, que eu já copiei Vou importá-lo
aqui imediatamente. Como você pode ver, sem precisar
preencher todas essas caixas, o nó é criado corretamente. Deixe-me tentar tomar medidas
executivas e garantir que tudo esteja
bem, e pronto. Você pode ver que este arquivo de podcast
dot MP three está sendo baixado. Significa que a solicitação foi para a ElevenLabs com a
conversa que queríamos
enviar e a ElevenLabs processou o texto e criou o arquivo
MP three para nós, que está Quão legal é isso? Bem, nós já fizemos o trabalho duro. Agora é sobre, veja, aqui está essa conversa que
estamos passando para 11 laboratórios. Em nosso cenário, não
será
codificado porque as notícias podem
mudar e, consequentemente, a discussão do podcast
mudará Então, o que quero dizer com
isso é que tudo o
que está dentro dessas
entradas mudará, e é por isso que
não podemos codificá-lo Vou deixar isso de lado. E a aparência dessa entrada
em tempo
real será essa
saída do agente. Deixe-me arrastar e soltar isso
e pronto. Não, minha cama. Deixe-me colocar aqui, cortar e
colocar aqui. É isso mesmo. Agora, toda vez que esse asient
gerar uma nova saída, automaticamente, os valores
atualizados serão passados para 11 laboratórios Deixe-me nomear isso como
11 laboratórios também. Isso é muito bom. Agora, a última coisa,
como você viu, ElevenLabs espera
essas entradas em um formato específico em que
nenhum ID de voz seja assim, depois o tom do
texto e depois o texto, não
há caracteres especiais permitidos nele e, tudo isso,
queremos garantir
que o agente de IA produza uma
saída que seja gravável
para 11 laboratórios, não é Isso é uma coisa muito importante. Por esse motivo,
iremos ao agente de IA,
acessaremos o prompt do sistema
e adicionaremos esta instrução. Queremos a saída somente nesse formato
específico. Não se preocupe, atualmente
codificamos o ID de voz, que corrigiremos
posteriormente, o que é bom Mas este é um exemplo de solicitação de algumas fotos
em que damos um exemplo de que
queremos a saída
nesse formato específico somente sem qualquer marcação ou E isso torna a saída
gravável para ElevenLabs, que será processada
sem Ao colocar esse formato de saída
obrigatório, garantimos que o agente de IA
produzirá uma saída, que será processada pela ElevenLabs sem problemas.
Quão legal é isso? Agora construímos
os códigos vocais de nossa
máquina e mapeamos os códigos vocais de nossa
máquina e mapeamos saída de
nossos agentes diretamente
em nosso nó de solicitação ElevenLabs Estamos oficialmente
prontos para ir além dos componentes
individuais e
analisar o ecossistema como um todo. Em nossa próxima sessão,
não estamos apenas testando
um único nó, estamos verificando todo o
pipeline, o mecanismo de notícias, o agente de IA, e
a ElevenLabs
está trabalhando em Vamos clicar em Executar para
testemunhar como os dados em tempo real fluem pelo cérebro e emergem como uma voz
humana sofisticada Não é mais apenas
um exercício técnico. É o momento em que essas ferramentas
independentes se tornam uma redação
viva unificada
5. The Moment of Truth Running Your First Pipeline: Os fios estão conectados, o cérebro está preparado, a voz está pronta Agora, apertamos o botão. Nesta sessão, estamos executando o pipeline completo
pela primeira vez. Vamos
acionar nosso agente, deixá-lo procurar os
últimos sinais de críquete notícias globais de segurança
e vê-lo entregar
esse roteiro à
ElevenLabs para criar nosso
primeiro Eu já estou empolgado. Vamos apertar o botão de execução. Ok, ElevenLabs está trabalhando. Só uma curiosidade. Quaisquer que sejam as operações de conversão de texto
em fala
que
estamos executando, podemos realmente verificá-las no ElevenLabs na guia de
histórico aqui 15 minutos atrás, essas são as operações que
executamos no passado. Isso é legal. Boa dica
de solução de problemas. Quanto eu vou pagar.
Sou um homem pobre. Eles continuam me implorando
por mais pagamentos. Por favor, me dê algum crédito. Tudo bem. Pude ver que o ElevenLabs
está concluído em verde Vamos ver o que está
lá. E Bingo, há um arquivo de 1,9 MB significa que meu podcast está
pronto, eu diria. Deixe-me ver isso. Sarah, você recebeu as
notícias sobre Usman Kawaja? Ele acaba de anunciar
sua aposentadoria após uma carreira de 15 anos
no Baggy Green, terminando sua série de contos com o
teste Fifth Ashes em Sydney Eu fiz, Marcus. É
um momento poderoso. Ele também não se
afastou silenciosamente. Kowaja também falou
sobre estereótipos raciais no críquete, lembrando a
todos que
os esportes têm trabalho a fazer fora
do É como se a tecnologia se
alimentasse da tecnologia para avançar E isso se liga
diretamente aos semicondutores. Os gigantes da tecnologia da Coreia do Sul
estão sentindo uma nova pressão. Oh, meu Deus. Veja essa
qualidade do nosso novo programa. Como é bom, não é? O bom é que funcionou
da primeira vez porque já
adicionamos esse formato de saída
obrigatório. Sem isso, era certo
que teria falhado. Tudo bem, a fábrica
está oficialmente aberta, mas como meus usuários vão
usar esse aplicativo Devo aconselhá-los a irem ao meu espaço de trabalho do Antin e
clicarem De jeito nenhum
tomaremos essa decisão estúpida. Bem, vamos nos encontrar
na próxima palestra e vamos ao vivo no
Telegram. Nos vemos lá.
6. Going Live Connecting Your Factory to Telegram: Até agora, nós
mesmos
puxávamos as alavancas para dentro de um bastão
. Isso muda agora. Estamos saindo
do laboratório para o mundo real conectando
nosso fluxo de trabalho ao Telegram Não estamos mais apenas
executando um script. Estamos lançando um serviço que
solicitações específicas dos usuários, como, me
dão as últimas
notícias sobre futebol ou o que está acontecendo em
Bollywood acionam toda
essa linha de
produção automatizada e fazem com que o podcast
seja entregue no mesmo Para dar uma
cara ao nosso cubre AI, decidimos usar o Telegram Vamos ao Telegram e precisamos ir
até o barco, pai Aqui teremos que
criar um novo barco. Dê essa instrução. Eu
quero criar um novo barco, um novo barco, como
vamos chamá-lo? Escolha um nome. Precisamos
dar um nome ao nosso bot, eu vou dizer, eu quero
dar esse nome. Bom. Vamos escolher um
nome de usuário para o seu bot. Vou selecionar o mesmo usuário sem nenhum
sinal. Esse é o nome de usuário. É isso mesmo. Quão legal é isso? Ok, então nosso bot
foi criado com sucesso. Temos a
API STTP e o token. Então, deixe-me copiar isso e
voltar ao fluxo de trabalho do Antin. Agora, remova esse trabalho ao
clicar em Executar, remova isso, adicione Telegram, o que nos interessa é
no gatilho de bagunça Tudo bem. Então, esse
é o gatilho, deixe-me adicionar ao novo
quadro do Telegram que criamos Então, vou apenas adicionar o
token de acesso aqui e salvá-lo. A conexão foi testada
com sucesso. Isso é bom. Volte e você pode ver, este é o gatilho do Telegram Vamos conectá-lo
ao agente de IA. Então, vamos
conectá-lo e é hora de testar o mesmo. Para isso, vou para o meu barco. Agora precisamos testar isso. Então, para testar,
salvarei o fluxo de trabalho
e clicarei em Executar fluxo de trabalho.
Agora vá para o Telegram E esse é meu barco. Vou apenas dizer comece
e você verá o barco já está
funcionando. Deixe-me parar com isso. Eu só queria testar se ele
está sendo acionado ou não. Agora, uma
coisa importante que precisamos fazer é
acessar o agente de IA na mensagem do usuário, acessar a expressão e
torná-la em tela cheia. Aqui, esse críquete, Bollywood, generativo I e semicondutor,
isso Toda vez que o usuário pode
alterar esse requisito. Eu gostaria de fazer isso
com base na mensagem do usuário. Desta vez, o usuário começa, então este é o texto.
Vou colocar desta forma. Que sempre que o usuário aciona
com um requisito diferente, esse prompt de mensagem do usuário é
atualizado adequadamente .
Isso é bom. Volte e, como você
pode entender, nossa intenção não é apenas acionar o
fluxo de trabalho com isso. Também queremos entregar o
resultado no mesmo lugar. Para isso, o que podemos fazer é adicionar outro nó e será o nó do
Telegram mais uma vez, enviando um arquivo de áudio Sim, é isso que queremos
enviar e quem acionou o ID do x hat terá
que ser colocado assim. O arquivo que queremos
enviar é o arquivo binário. Qual o nome
do arquivo? Bem, virá do
ElevenLabs ElevenLabs, como vimos, cria o arquivo com esse nome,
certo A ElevenLabs, como vimos,
cria o arquivo com esse nome,
certo? Podcast tempi three Onde está especificado, deixe-me mostrar nos 11 laboratórios, vamos aqui, está aqui. Saída de arquivo, já
configuramos para a terceira temperatura de podcast. Por esse motivo, o
mesmo nome de arquivo deve ser
usado no nó do Telegram para o
qual estamos enviando Essencialmente, o que esse
nó está fazendo é enviar um arquivo de áudio para a mesma pessoa que
acionou o fluxo de trabalho, e o arquivo de áudio será
nomeado como podcast tempi three, que você deve enviar como um arquivo
binário. É só isso. Deixe-me salvar isso e agora
é a hora da verdade. Deixe-me viver com isso. Vou apenas dizer de
inativo para ativo, deixe-me fazer assim Entendi para que eu não
precise executar todas as vezes. Estamos ao vivo com isso,
então vou para o Telegram. Vou dizer o que está
acontecendo no futebol, em Bollywood e na máscara de Elon Vamos ver, eu não quero ter nenhum
significado particular para isso. É só que eu quero testar,
por favor, não me interprete mal. Vamos ver se a execução foi
iniciada e de fato está. Está funcionando nos últimos 17
segundos, deixe-o terminar. Eu gostaria de poder ver
a execução ao vivo. É muito difícil para
mim ficar de braços cruzados e ver o que e esperar
pelos resultados Eu gostaria de poder ver qual nota
exatamente está funcionando corretamente. É muito difícil para mim sentar e esperar que esse
fluxo de trabalho seja concluído. Eu gostaria que houvesse uma maneira de ver exatamente qual aceno está sendo
executado no momento O feedback ao vivo é
algo que temos. Tudo bem. Aí estamos. O fluxo de trabalho está concluído. Então, vamos ver. Tudo bem, então o
agente de IA foi executado e tudo foi concluído
em verde no Telegram, deveríamos estar vendo
o arquivo do podcast E aí está. Sim, o tamanho de MB dura 2
minutos. Deixe-me ver o que está lá. Sarah, você viu
aquele drama afegão selvagem? A seleção do Gabão
acabou de ser
totalmente suspensa após sua
campanha desastrosa Eles até baniram
Pierre Emric Obama, você. Isso é uma consequência séria
depois de perder por 3-2 para a Costa do Marfim. Sim, isso é duro, mas mostra o quão alto é o
risco no futebol Enquanto isso, na cena universitária, Indiana fez história com uma derrota de 38 a três
contra o Alabama no Não adianta tocar
o áudio agora. Talvez eu apenas o anexe para
que você possa
examiná-lo mais tarde. Tudo bem. Dê uma segunda
olhada no que você alcançou. Você não acabou de
construir um corpo simples. Você projetou uma linha de produção de mídia de
ponta a ponta. Você combinou
arquitetura de API, filtragem em tempo real e síntese de voz neural em uma única experiência
responsiva ao usuário Você deixou de
ser um consumidor de IA e se tornou um
arquiteto dela. Sua redação pessoal está
oficialmente aberta para negócios. Vá em frente, envie
um comando ao seu quadro e ouça sua
criação responder a você. Por favor, não se esqueça de
enviar o feedback para mim. Eu realmente quero saber
se seu pai, filhos e todos na família
gostam dessa ferramenta familiar ou não. Bem, por enquanto é isso. Muito obrigado pelo seu tempo.
7. The Architecture of Memory Moving Beyond Hard Coded Logic: Tudo bem. A primeira fase foi sobre a
construção da fábrica de notícias
e essa parte funciona. Podemos buscar notícias, processá-las
e transformá-las em um podcast
ou em um novo programa exatamente
do jeito que quisermos Todo o pipeline
corre de ponta a ponta. A verdadeira limitação, no entanto, é que tudo está
codificado no prompt, no tom, no estilo,
no formato, em tudo Todos os ouvintes têm
a mesma experiência , independentemente de quem são
ou de como consomem notícias A fase dois é sobre
quebrar essa rigidez. Pessoas diferentes querem que as mesmas notícias
sejam entregues de forma diferente. Um pai que ouve
no final do dia prefere
algo calmo e profissional, enquanto seus filhos querem que as mesmas atualizações sejam
enérgicas e Alguns usuários querem dar instruções de
voz, outros querem enviar
usando mensagens de texto. Então prefira inglês,
outros outros idiomas. A mudança que estamos fazendo é de um sistema que simplesmente produz conteúdo para um que adapta a experiência à pessoa que
o consome Agora você vê o verdadeiro problema. Uma ferramenta não sabe
quem está falando com ela. Vamos corrigir isso na fase dois. Para que isso funcione para todos, precisamos nos afastar de
um código único para todos. Vamos usar
um conjunto simples do Google para atuar como
memória permanente de nossa fábrica. Eu configurei duas guias em
nosso assento no Google que
funcionarão como nosso centro de comando Primeiro, temos a guia do usuário. Isso rastreia IDs de bate-papo, nomes, idiomas e personas É assim que o sistema reconhece seu pai versus seus filhos
no momento em que eles começam a jogar Em seguida, temos a guia de
configuração de voz. Esta é nossa agência de elenco. Ele garante que, quando o
sistema fala hindi e é divertido, ele obtém o ID de voz exato do
ElevenLabs necessário para Agora, eu só consegui pegar
esses muitos IDs de voz, mas de acordo com sua necessidade, você pode simplesmente criar
seus próprios personagens, os idiomas que
deseja suportar,
personas e, consequentemente,
ir ao ElevenLabs, pesquisar Por exemplo, você mesmo
deseja pesquisar em espanhol e explorar algumas espanhol e explorar algumas
vozes e talvez, você sabe, escolha a
ID de voz e queira
atualizá-la na ID de
voz da âncora É assim que você começa a
apoiá-lo. É muito simples,
não é? Se nenhum dos
requisitos do usuário corresponder a
isso, isso será
atribuído ao usuário. Portanto, não vamos
decepcionar ninguém. Se não conseguirmos igualar,
ainda assim
veicularemos as notícias no tom padrão, pelo
menos, certo? Que gentileza nossa? E se você pensar bem, não se trata apenas
dos assentos espalhados. É uma questão de escalabilidade. Ao colocar essas
preferências em um assento, você pode adicionar 100
amigos ao seu corpo sem nunca tocar em
um único nó em dez Você está construindo um
sistema que se adapta
ao ser humano em vez de forçar o humano a se adaptar
à máquina Isso parece sensato, não é? Estamos prestes a criar uma cadeia lógica sofisticada
no bloco de registro e quero ter certeza de que
você está pronto para isso. Antes de prosseguirmos, reserve um momento para
criar sua fundação. Importe o
modelo do Google Set para sua conta e tente conectar seu fluxo de trabalho do NTN
ao Google Set É muito simples. Por favor, leia o documento e você verá que essa memória conectada é o que permite que o cérebro que estamos prestes a
construir realmente funcione. Vamos para a próxima
palestra e criaremos o agente de integração que finalmente dará voz à sua família
. Veja lá.
8. The Onboarding Agent Automating User Intent: Então, agora que preparamos
nosso conjunto do Google, você pode estar pensando: ótimo, vou enviar o link para
todas as centenas de pessoas que eu quero no meu barco do Telegram e pedir elas preencham seus
dados, certo? Você pensou assim? Quero dizer, com certeza, todo mundo vai
parar o que está fazendo, abrir uma planilha
e digitar perfeitamente suas preferências de
idioma da categoria de notícias em alguns minutos, Errado. Sejamos honestos, pedir que seu pai ou seus
amigos preencham uma planilha apenas para usar um quadro de bate-papo é uma receita
para uma cidade costeira Além disso, temos coisas muito
melhores para fazer com nossas vidas do que gerenciar manualmente
linhas de dados, não é? Então, em vez de fazermos o trabalho
pesado sozinhos, vamos integrar o processo de integração diretamente
em nosso fluxo de trabalho antin. Deixe a máquina fazer as coisas chatas para que
possamos manter o foco
no panorama geral Sim. Parece bom. Tudo bem, vamos tentar
reformular nosso fluxo de trabalho. Então, primeiro de tudo, vou tentar colocar essas coisas de lado. Então não é isso que eu
vou trabalhar no momento. Em vez disso, vou fazer apenas uma coisa. Vou chamá-lo, e vou
chamá-lo de fábrica de podcasts de notícias. Sim. Então, esse material está funcionando e quaisquer mudanças
necessárias, faremos separadamente mais tarde. Imediatamente, o que
eu quero fazer é sempre que um usuário envia uma
mensagem, em primeiro lugar, o que queremos fazer é
dar uma olhada neste assento do Google, se o usuário
já está presente, se está ativo ou em
estado de integração, certo? Então, basicamente, ou o usuário
não está presente
ou foi adicionado, mas ainda não recebeu as
preferências, certo? Então, dessa forma, queremos construir. Então, o que precisamos fazer é adicionar
esse nó do Google Seat, e o que queremos fazer é Gros Já adicionei minha
conta do Google Seat. Tudo o que preciso fazer é me sentar
dentro dos documentos. Vou ter que pesquisar o Cabri
AI e procurar o usuário Stab. Parece bom. O que é que estamos procurando neste assento? Bem, estamos
procurando um ID de bate-papo. Há um ID de bate-papo vindo
do gatilho do Telegram. Só precisamos garantir
se ele está presente
no Google Seat ou não.
Como fazemos isso? Em primeiro lugar, deixe-me acionar isso para que eu comece
a obter os valores aqui. Para obter valores, o que eu quero fazer é primeiro não concentrar nessa fábrica de podcasts de
notícias. Vou excluir isso e
executar o fluxo de trabalho
e, a partir do Telegram, tentarei
enviar uma mensagem de demonstração, talvez um simples ponto, certo? Só quero que o
fluxo de trabalho seja acionado. E agora, se eu for aqui, verei esses valores
sendo preenchidos, certo? Então, aqui o que
queremos fazer é adicionar um filtro na coluna ID do chat. E qual deve ser o ID do chat? Deve ser o que vem do gatilho
do Telegram, certo? Execute a etapa. E sim, viu? Agora, como meu usuário está presente, por isso
que ele está
indo para lá. Se eu excluir isso, deixe-me alterá-lo, certo? Então, agora a ideia do bate-papo não
estará presente. Então, deixe-me executá-lo novamente. E você pode ver que agora os dados
não foram encontrados porque, essencialmente ,
o ID de bate-papo proveniente
do gatilho do Telegram não
está mais presente no Google
Seat. Muito simples. Agora, com base nisso,
queremos criar nossa lógica. Portanto, pode haver
vários cenários. Uma delas é que o ID do chat nunca foi
adicionado ao sistema. Portanto, o usuário nunca fez parte disso
e, nesse caso, o usuário
não será adicionado aqui, então será um novo usuário. Ok. Agora, vamos ver qual lógica estamos tentando criar
para a integração Portanto, há três
cenários possíveis. Uma delas é que o ID do bate-papo que
acionou esse fluxo de trabalho
nunca faz parte do Google Seat. Nesse caso, o
chamaremos de novo usuário e o enviaremos para um nó específico, onde usuário poderá ser adicionado a
esse Google Seat. Essa é uma delas. Em segundo lugar, o
usuário faz parte do assento, mas ainda assim o Node
forneceu as categorias
de idioma, personalidade e notícias que são padrão para o usuário Nesse caso,
chamaremos isso de integração. Significa que o usuário está lá, mas ainda não o está usando ativamente e ainda não está ativado
em nosso sistema. Não sabemos quem é esse usuário. É só esse nome que
conhecemos, não as preferências. Nossa terceira regra é que o
usuário está lá , conhecemos suas preferências e está ativo
em nosso sistema. Três rotas possíveis. Correto. Então, para
criar essas regras, vamos adicionar um novo nó. Então, vamos adicionar um novo nó, switch. E com base na minha explicação, tenho certeza de que será muito
simples para Então, o que nos interessa é o ID do bate-papo
proveniente deste. Então, deixe-me
mudar momentaneamente, remover isso, salvá-lo e executá-lo novamente
para que os dados sejam preenchidos Com base nesses dados
provenientes do Google Set, queremos criar nossa lógica regra número um é que o ID do
chat está vazio, e isso significaria que
o usuário é um novo usuário, precisamos integrar o A segunda regra pode ser que
possamos ver o status. Veja o status e verifique se é igual ao embarque Certo? Terceira regra, vou dizer
integração nesta E a terceira regra é que esse usuário
está presente e ativo. String igual a dois é
igual a ativo porque o ID do chat é um número e
estamos usando a
operação de string aqui, então temos que
ativar esse botão e
converter tipos quando
necessário, converter tipos quando Muito simples. E agora
vamos executar essa etapa, e ela está dizendo que está ativa. Esse é um usuário ativo. Atento. E sim, de fato, os dados estão fluindo exatamente
como queríamos Este é um usuário ativo, então podemos ver que esse item é
mostrado na saída, certo? Só para minha referência, deixe-me executá-lo mais uma vez. O passo anterior é um bom passo. A coisa desaparecerá
e, nas rotas, se eu a executar agora, quero que você perceba
algo muito importante. Sempre que os dados não estão presentes
neste assento do Google, quando executamos o fluxo de trabalho, estamos tentando imitar
que o usuário não está presente Você vê que o controle
nunca foi trocado. Significa que, nesse caso, após essa configuração do Google, nenhum outro nó
será executado. Isso é um grande problema, não é? Bem, também não é um
grande problema. É muito simples. Como
já abrimos isso, deixe-me renomeá-lo também Devemos sempre
renomear nossos nós para que eles reflitam qual é
exatamente o propósito
desse nó em nossa ferramenta. Isso é cosmético. Vá para as configurações e
diga sempre gerar dados. Isso é imperdível. Agora, se você executar a etapa, alguns dados
serão enviados. Dados vazios também são bons, mas pelo menos o controle
passará para a próxima etapa. Se o executarmos agora, você poderá ver um novo usuário
porque o usuário
não está presente em nosso sistema de
qualquer maneira. Isso é legal. Acho que se você tiver clareza
sobre essa lógica, você se sairá perfeitamente
bem nesse fluxo de trabalho. Caso contrário,
talvez assista a esta
palestra desde o início, mas você precisa deixar bem claro o que esse switch
está fazendo aqui Não é muito complexo, mas
precisamos entender. Incrível. Agora, de acordo com
nossa arquitetura, há três
cenários possíveis. O usuário é novo, está sendo incorporado
ou é um usuário ativo, certo? O usuário ativo é, na verdade,
muito simples. Apenas conectaremos o usuário
ativo à nossa fábrica de notícias e eles usarão
nosso produto. Mas e o novo usuário? O que queremos fazer com eles se a solicitação do usuário não estiver
presente em nosso assento no Google? Bem, zero pontos para adivinhar que queremos adicionar
o usuário, Caso o usuário
ainda não esteja presente, vamos adicioná-lo, correto? Vamos fazer dessa maneira. Primeiro notificaremos o usuário de que
você foi integrado,
enviaremos uma mensagem de texto. Para quem queremos enviar as Bem, vá até o gatilho do bate-papo
e pegue o ID do bate-papo. Para essa pessoa, queremos enviar uma mensagem e qual
é a nossa mensagem? Bem, vá para make it big e x. Isso é o que enviaremos. Damos as boas-vindas à redação
pessoal e
pedimos que enviem por mensagem de texto ou voz suas
preferências para que mais notícias possam ser enviadas a
eles em seu próprio estilo Essa é uma mensagem de
embarque perfeita, eu acredito, e não apenas
precisamos parar por aqui, mas também adicionaremos a
mensagem ao nosso Google aqui. Muito simples.
Deixe-me fazer isso rapidamente. Veja, e eu direi que
veja et cheat add ou add add or update rose onde
queremos atualizar nossa IA Hubri Assento do usuário. E o
que é isso que queremos atualizar? Até o momento, teremos
apenas o ID do chat. Então, o ID do chat, que podemos obter a
partir do gatilho do Telegram, então eu vou simplesmente
pegá-lo aqui Também podemos obter o primeiro nome. Então, vamos pegar
esse também. O que mais? Talvez apenas
atualizemos o idioma usuário pessoal ainda não
forneceu , então não
podemos atualizar. Também não vale a pena atualizar
durante a última atualização. Então, para o status,
diremos apenas integração. Como o usuário já
foi adicionado, veja se, você sabe, o
status está aumentando. Então, integração.
Esse é o status. E não se esqueça disso. Temos que selecionar
tudo no ID do chat, que é nossa
chave primária no Google Set. Sim. Deixe-me voltar ao
Canvas para enviar uma mensagem de texto. Vou chamar esse nó de usuário do anúncio, e esse pode ser mais,
ele reflete melhor, o que exatamente esse nó está fazendo. Parece muito bom.
Deixe-me salvar isso e agora enviar minha linha inteira.
Quero remover, excluir a linha e permitir eu execute o fluxo de trabalho e envie
uma mensagem simples para esse
fluxo de trabalho para ser acionada. Você pode ver imediatamente que
temos essas bagunças e que nossos
dados agora estão adicionados aqui Ainda não foi fornecido nosso idioma,
personalidade ou categoria de notícias
preferidos , obviamente não foi adicionado, mas o que quer que pudesse acrescentar, nosso fluxo de trabalho Antin o adicionou e iniciou a
integração do usuário Quão legal é isso? Tenho certeza que você já
está impressionado com
esse trabalho e acredite,
após concluir esta palestra, após concluir esta palestra, você está muito perto de fazer com que
esse fluxo de trabalho da Antin
atenda aos requisitos de cada membro
da sua família ou
do seu círculo Bem, por enquanto é isso. Cuide bem de
si mesmo. Obrigada
9. The Text Based Onboarding Engine & Data Normalization: Tudo bem, temos o pé
do nosso usuário na porta. Eles acabaram de começar e estão sentados
em nosso assento no Google. Mas um ID de bate-papo por si só
não faz uma redação. Precisamos conhecer a alma deles, o que eles se importam,
que idioma falam e a vibração que desejam Sim Olhe para a tela. A maioria dos usuários simplesmente
responderá à nossa mensagem de boas-vindas com uma
mensagem de texto. Enviamos a mensagem
de integração. O mais provável é que
as pessoas enviem a mensagem. Como desenvolvedor de produtos, qual é nosso próximo objetivo? Bem, devemos sintetizar os detalhes necessários a
partir da mensagem do usuário Então você está dizendo que se é hindi, então precisamos enviar o
idioma para hindi Eles deram uma atmosfera divertida, então precisamos ver o que
está mais próximo da diversão Para o hindi, o mais próximo é brincalhão, não profissional precisamos definir a atmosfera
ou a personalidade como divertida
, e o Nesse caso, precisamos definir a atmosfera
ou a personalidade como divertida
, e o usuário
se preocupa com a IA e o Então, precisamos definir
a categoria de notícias para IA e críquete
nesse caso, correto Agora, como você pode perceber corretamente, será um desperdício de esforço
se eu escrever um programa para analisar esses detalhes e
obter a
intenção necessária disso Porque há uma
alternativa melhor disponível. Bem, você tem toda a razão. Estamos falando de um agente de IA que faz esse trabalho para nós. Basicamente, o que
queremos
é a bagunça e, a
partir daí, agente precisa examinar
essa configuração de voz,
combinar a intenção do usuário com a configuração combinar a intenção do usuário com a que oferecemos suporte e
inicializar
o usuário e ,
basicamente, alterar o status de
integração Essa é a intenção que queremos fazer. Se você entendeu, estamos
na mesma página. Vamos ver como vamos fazer isso. Para integrar as mensagens do usuário, simplesmente
adicionarei um agente Vou chamá-lo de agente
para integrar usuários como esse e precisamos definir
o sistema e o prompt do usuário Vamos trabalhar primeiro na
mensagem do sistema. Esses são os avisos que
escrevi. Conforme discutimos, essa solicitação consiste pedir ao agente que use
essa ferramenta específica para examinar o
conjunto do Google que fornecemos e, basicamente,
fazer a validação dos dados, independentemente de o idioma
e o usuário pessoal solicitados serem suportados
por nosso produto ou não. Se não estiver, ele
inicializará os detalhes
com um padrão Certo? Então é isso
que queremos fazer. Agora você pode ler esse aviso em detalhes e entender
o que estamos fazendo. Por enquanto, o que
vou fazer é colocar essa mensagem na mensagem
do sistema,
e a mensagem do usuário também é
muito direta Tudo o que estamos fazendo é receber essa mensagem do usuário. E, basicamente, você pode
obtê-lo no Telegram.
Qual é a mensagem? Aqui a mensagem era essa. Vou me livrar dessa agora e
pegá-la diretamente do Telegram, talvez eu diga que esta é a mensagem do
usuário. Justo o suficiente? Não, não, há um problema aqui porque a
NATN funciona, certo? Não conseguirei obter
esta mensagem do registrador
do Telegram Então, o que precisamos fazer é
basicamente adicionar um campo definido O e eu vou apenas dizer definido
na preferência de texto Essa é a preferência
do usuário, e aqui precisamos
primeiro receber
essas mensagens de gatilho do Telegram. Depois, a bagunça. Ok. Então, tudo o que fizemos aqui foi colocar um nó
definido no meio. Então, o que ele faz é basicamente olhar para o gatilho do
Telegram, pegar a mensagem e definir essa propriedade no JSON, E quando o controle
chegar à formiga, ela simplesmente pegará esse valor daqui e o usará, certo? Então, por que temos que colocar
esse nó definido no meio porque o AZN com as ferramentas é
executado em um contexto diferente e não será capaz de
acessar o
ponto de gatilho diretamente É por isso que precisamos
disso no meio. Está bem? Deixe-me adicionar a ferramenta. Então, qual é o nome da
ferramenta que estamos oferecendo? Dando suporte à
configuração de voz do Loup, certo? Muito bem. Vou
pegar a ferramenta Google Seat, nomeá-la assim e especificar qual assento
estamos usando, certo? Portanto, nossa configuração está
na configuração de voz. Então, vou especificar o assento do Google e a guia na qual
nossos dados estão lá, que o
agente de embarque deve consultar, e precisamos adicionar um modelo de bate-papo. Eu vou escolher o modelo de bate-papo ao
ar livre. Essa é uma pergunta muito básica. Não há muita cadeia
de pensamentos envolvida nisso,
então vou usar
este ChatGPT quatro, não cinco, neste caso Isso é bom. Vamos
salvá-lo e executar o fluxo de trabalho. Vou apenas enviar esta mensagem
padrão e primeiro lugar, está
tudo bem. Execute-o. Ok, o controle chegou ao usuário de
embarque e, de fato, minha mensagem foi passada corretamente,
o que é uma boa notícia. E sim, lá vamos nós. Com a ajuda do
aviso que fornecemos, ele conseguiu identificar o idioma, a personalidade
e o interesse Quão legal é isso, certo? Isso é algo que precisávamos.
A beleza disso é que ele seguiu exatamente o resultado que
pedimos que ele cedesse, certo? Isso é algo
muito bom, muito bom. Então, o que precisamos fazer a seguir? Agora, se você observar isso,
essa é uma string de linha única. Isso é basicamente
tudo que está dentro. Saída. Não
tenho necessariamente acesso direto à personalidade ou aos
interesses Então, exatamente o que precisamos fazer é pegar os campos exatos
dessa string. Algo que fazemos muito em
programação, certo? Então, eu só vou precisar escrever
um pequeno código para isso, e eu prefiro JavaScript. O Python ainda está na versão beta. E eu preciso colocar
esse código, ok? Então, a saída do Jason me
dará a saída, então eu só quero que
esses campos sejam escritos no
formato que eu quero E como o usuário
concluiu a integração, podemos chamá-la de ativa agora, certo? Isso é bom. Em seguida, o que precisamos fazer é adicionar os
dados ao conjunto do Google. Portanto, anexe ou atualize o site de Rowan. Vou chamar isso de atualizar os dados do usuário. E para onde esses dados irão, eles irão para a aba
AbriSuser. Então, queremos mapear
cada coluna manualmente. Nosso ID de bate-papo é a chave primária. primeiro nome já está atualizado, não quero tocá-lo,
e pronto, vamos fazer isso. Vou pegar o ID do chat aqui. O ID do bate-papo e
o restante dos detalhes estão
disponíveis neste código. O idioma é o idioma, a personalidade, interesse entrará o
interesse entrará na categoria de notícias e o
status será ativo última atualização que posso obter das variáveis e
do contexto, que é NAF, let me go go Isso é bom. Deixe-me executar a
etapa. E lá vamos nós. Ele é executado corretamente, então eu deveria ir ao Google Seat, e você pode ver que os
dados são preenchidos em nosso assento do Google exatamente
como queríamos que fosse. Quão legal é isso? Agora,
o que podemos fazer a seguir é basicamente parabenizar o
usuário pelo sucesso da integração.
Por isso, o que devemos fazer
é enviar uma mensagem do Telegram Esse é o modo de
comunicação. Ok. Então, deixe-me clicar aqui, adicionar um telegrama, enviar
uma mensagem de texto O nome que eu quero dar
está a bordo em saudações. Isso é bom e quem
queremos enviar? Agora, tenho certeza de que você está confortável com a
forma como estou arrastando e soltando os
detalhes neste nó A mensagem de texto que
queremos enviar é O usuário está pronto para
usar nossa plataforma. Se eles quiserem enviar mensagens
sob demanda, eles podem enviar esse formato
ou qualquer outro formato, tudo bem. Uh, porque é o agente no trabalho que
cuidará disso. Caso contrário, de qualquer forma enviaremos as mensagens nítidas às
oito da manhã. E como garantiremos que a
mensagem seja enviada ao usuário às oito da manhã,
trabalharemos para isso. Não se preocupe Eu prometo que você será capaz de entender isso
tão bem quanto se divertirá. Sim? Tudo bem,
deixe-me falar sobre isso também. Execute a etapa. Sim, a mensagem deveria ter sido enviada
e de fato é, certo? Então esta é a mensagem, o
usuário está a bordo, o fluxo está funcionando perfeitamente
bem. Quão legal é isso? Agora, amigos, eu
sei que a tela está começando a parecer uma
tigela de espaguete digital Está ficando complicado
porque vamos adicionar mais nós e só
vai
ficar um pouco mais
complexo gradualmente. Como instrutor,
garantirei que você entenda as coisas com clareza e
aumentarei gradualmente a complexidade Eu não vou jogar as coisas
em uma ordem aleatória em você. Tenho certeza que você está
comigo. Ainda assim, se você está achando difícil rastrear cada
conexão e a configuração do nó
que estou fazendo ao vivo, forneci a
versão exata disso para você. Então, basicamente, ok, deixe-me baixá-lo e eu
fornecerei isso neste estágio. Basicamente, o que você precisa fazer é acessar o fluxo de trabalho
e importar do arquivo. Isso é tudo que você
precisará fazer e esses nós serão
criados magicamente para você, certo? Eu diria que essa é
outra forma criativa de ficar em sincronia
comigo, certo? Agora, neste momento, o que eu peço que você perceba é o quão crucial é esse usuário de
integração Ele é capaz de analisar a
mensagem dos usuários, entender a
intenção e
atualizar exatamente esse assento de acordo com a necessidade do
usuário, Mas, ao fazer isso, ele garante
que qualquer pessoa ou idioma que esteja atribuindo seja fato suportado
pela configuração de voz Isso é muito, muito importante,
como você entende. Para nosso fluxo de trabalho.
Não estamos apenas enviando uma mensagem. Estamos construindo um
perfil. Mas espere. E se o usuário estiver dirigindo ou se ele simplesmente clicar em digitar Devemos fazer
algo com eles também. No momento, estamos, de
qualquer forma, apoiando a mensagem de texto para
integrar o usuário Na próxima palestra, também começaremos a oferecer suporte ao comando
de voz do usuário E acredite em mim, embora estejamos
tornando isso um pouco complexo
, na verdade é muito importante para aumentar a
adoção de nosso produto. Bem, nos vemos lá. Obrigada
10. Multi Modal Upgrades Implementing Voice Message Onboarding: Bem vindo de volta. Nós
dominamos as mensagens de texto, mas para criar um produto verdadeiramente de
elite, precisamos encontrar o usuário onde ele está e
onde
está , muitas vezes ocupado em movimento
e preferindo apenas conversar Estamos prestes a
transformar nosso bot em uma potência multimodal oferecendo suporte a
mensagens de voz Animado? Sim, é isso
que queremos. Ok, então começa com OK. Deixe-me minimizar um
pouco e vamos nos concentrar nessa
coisa de agente um pouco mais tarde. Então, vou colocar dessa forma, sem focar nisso
também por enquanto, então vou colocá-lo aqui. No momento, o que
estamos dizendo é que, se o usuário estiver embarcando, ele enviará a mensagem. Essa mensagem pode ser texto
ou voz. Agora, voz e texto precisam ser interpretados de
forma diferente, certo? A primeira coisa que precisamos
fazer aqui para tornar nosso fluxo de trabalho inteligente
é adicionar um nó de switch. Então, deixe-me adicionar aqui. E o nome disso
será voz ou texto. Se for voz, ela
entrará em um canal. Se for uma mensagem de texto, ela seguirá uma rota
diferente. Essa é a expectativa. Não há nada
de complicado nisso, certo? Então, vou dizer que se
forem mensagens de texto, adicione uma raiz de roteamento, deixe-me
adicionar um gatilho do Telegram Se for uma mensagem de texto, gatilho do
Telegram definitivamente
terá algum texto aqui Vamos fazer lógica
com base nisso. Se existir, significa que
é uma mensagem de texto, execute a etapa e
está funcionando bem. Isso é bom. De qualquer forma, também estava
funcionando bem anteriormente Agora deixe-me enviar uma mensagem de voz. Mas antes de fazermos isso, preciso mudar
isso para o
status de integração para que a mensagem
realmente chegue aqui Se estiver ativo,
definitivamente seguirá uma rota totalmente
diferente Agora vou enviar uma mensagem de voz. Quero as notícias em inglês, torne-as profissionais e me
preocupo muito com a ciência. Algumas mensagens que enviei. Deixe-me salvar e executar o fluxo de trabalho. OK. Veio aqui, mas não foi depois disso, certo? Vamos ver. Sim. Portanto, não havia texto
nele e
não havia nenhuma rota sem ele, ele
não ia a lugar nenhum. Eu fiz isso
exatamente para imitar isso porque queria
esse ID de voz Então, o ID do arquivo é esse. E se existir, se existir, então
é uma mensagem de voz. Muito simples,
muito inteligente. Deixe-me fazer
assim, execute a etapa. E, se forem mensagens de voz
, seguirá esse caminho. Se for uma mensagem de texto, ela
seguirá essa rota. Só pela aparência, quero fazer uma voz primeiro e depois
mensagens de texto, isso é bom. Isso soa bem. Se
for uma mensagem de texto, ela seguirá esta rota. Se for uma mensagem de voz, ela seguirá outra rota. Bom. Agora, isso é excelente, mas e se for
uma mensagem de voz Podemos entregá-lo diretamente ao
nosso agente? Não, nosso modelo ChatGPT é bom para processamento de
mensagens de texto, mas não entenderá
o áudio, não é? Então, precisamos primeiro
baixar o arquivo e entregá-lo a um modelo que
entenda voz, correto? Então, vamos primeiro baixar o arquivo e faremos
isso acessando o Telegram Obtenha um arquivo, não um arquivo para download, desculpe. Obtenha um arquivo. Qual arquivo é o mesmo arquivo cujo
ID de arquivo mantivemos aqui. Então pegue isso e baixe o
arquivo. Isso é o que nós queremos. OK. Exatamente. Isso é bom. O arquivo está sendo baixado. O próximo passo é
converter essa voz em texto. Eu vou dizer OpenAI. Precisamos fazer uma chamada OpenAI e o que queremos fazer
é transcrever Transcreva uma gravação. Tem que coincidir com esses dados. Sim, o campo de entrada está bom. Vou fazer essa execução. Minha conta já está conectada
e você pode ver isso. Essa é a mensagem que enviei na sua frente
alguns minutos atrás. E o OpenAI é capaz de detectar essa mensagem e nos
fornecer o texto Que legal. Isso ajuda muito. Agora podemos
enviar esse texto para o mesmo agente novamente e fazê-lo funcionar com comando de
voz também. Basicamente, não estamos usando outro agente apenas
para esse requisito. Então, para mesclar essa voz
e texto em uma mídia, usaremos o merge node e eu desconectarei Eu adiciono a mensagem de texto
também
somente a esse nó de mesclagem e, em seguida,
a defino na
preferência de embarque. OK. Basicamente, o que queremos fazer é se a mensagem
é voz ou texto, mesclá-la aqui e antes de irmos ao agente de
integração, ela deve ter a aparência Essa é a pergunta aqui e depois
na preferência de integração,
deixe-me executar isso Anteriormente, definimos essa preferência de
integração apenas para ler a mensagem de texto do
Telegram Mas agora também temos mensagens
provenientes do áudio. Precisamos criar uma condição
OR aqui. Vou receber essa mensagem e cortar
isso,
remover aqui, ir para este
Javascript, colar aqui. E bata. É isso mesmo. Se a mensagem estiver vindo do áudio, ela será retirada do
gatilho
do Telegram, o
que é bom É bom. Bom,
o resto da mensagem, não
descanse nada, precisamos mudar. Vou apenas executar isso e
executar esse agente também. Para ver, sim, de fato,
é capaz de reconhecer profissional
inglês e
meu interesse pela ciência. Isso é bom. Significa que o resto do
fluxo não precisamos tocar. Funcionará exatamente
da mesma maneira. Eu só, por que
isso é polo e tudo mais? OK. O que é isso? OK. Porque eu estava
movendo o texto um pouco para este lado para manter a tela menos
ocupada para você, certo? Esse é
um esforço adicional que estou fazendo. Por favor, agradeça isso, cara. Ok, deixe-me executar isso. Agora, o texto deve ser
passado da maneira que queremos
e, em seguida adicionar os dados ao Google Seat. Sim, trabalhando como Msic e
depois envie a mensagem de texto. Para o usuário do Telegram. Cada unidade está se unindo
e trabalhando como uma equipe. Esse é o poder da
formiga e do fluxo de trabalho, e esse é o poder da IA
generativa, eu diria Agora, caso você
esteja se perguntando por que estamos tendo essa fusão
e esse nó definido,
basicamente, se a entrada era texto ou uma transcrição de voz, ambos
deveriam se encontrar
nesse nó de mesclagem Nesta sessão,
apresentamos o suporte ao comando de voz
para
integrar um usuário Portanto, usar o OpenAI é o modelo
Whisper e esse nó de mesclagem garante que se a entrada foi texto
ou uma transcrição de voz, ambos se
encontrem no É uma bela engenharia. Reunimos duas formas
diferentes de comunicação em um
único fluxo Sim. Em seguida, usamos definir preferências de integração
para manter nossos dados limpos e passá-los para nosso agente de usuário de
integração Agora, deixe-me fazer um pouco de esforço para tornar nossa tela
menos confusa Então, o que eu quero fazer é isso, e isso tem que estar
aqui, e isso. A propósito, eu amo isso. Depois de se esforçar
muito para construir algo, é totalmente aceitável fazer algum esforço para
torná-lo mais apresentável Sim, espero
ter certeza de que você concorda com o
sticky, adicione uma nota adesiva. Mude a cor.
Eu prefiro esse. Não. Mude a cor para
esta, talvez. Vamos chamá-lo de agente de registro
e integração. É um bom nome. Torne-o grande e tudo estará
agrupado dentro dele. O que estamos fazendo aqui, até mesmo adicionar o usuário, foi
parte da integração Você pode chamar isso de registro entrada inicial
ou qualquer coisa, mas também fazia parte apenas
da integração.
Nós fizemos isso. Depois disso, o usuário enviar as preferências e
salvá-las é, novamente, parte da integração Estamos o nomeando como agente de registro
e integração, e isso fará com que
pareça melhor para Agora, se eu fizer isso, terei que
trazer este aqui porque deixei de lado
porque queríamos nos
concentrar no registro
e na integração do agente Mas o que concluímos
lindamente agora, então é hora de focar na fábrica de podcasts de
notícias mais uma vez para produzir as notícias reais Sim. Mas antes de prosseguirmos, estou baixando e disponibilizando esse fluxo de trabalho nesse
estado para você. Caso tenha achado
difícil acompanhar comigo, basta importar esse
arquivo para esse fluxo e entraremos em
sincronia mais uma vez. Sim. Tudo bem, o
registro está completo, usuário está no sistema. Agora é hora de começar a
produzir as notícias reais. Vamos passar para o mecanismo de notícias na próxima sessão.
Nos vemos lá.
11. Turning Chaos into Structure The 'Edit Fields' Translator: Olá, uma calorosa
recepção a esta seção. Integramos nossos
usuários com sucesso. Eles têm um perfil, um
idioma e uma vibração. Mas agora vem a parte
mais importante, dar a eles as notícias, seu podcast de notícias personalizado, que eles desejam Vamos trabalhar
nesse sentido nesta sessão. Tenho certeza que você está animado. Sim. OK. Olha isso. Ao concluir a
integração, compramos suporte para mensagens de texto
e voz A boa notícia é que
definitivamente queremos oferecer esse suporte quando um usuário
solicita notícias reais. Não queremos que
eles digitem que estão interessados em notícias sobre ciência
generativa
e futebol, ou que podem enviar uma
mensagem de voz para as mesmas, certo? A boa notícia é que não
será reformulado. Só teremos que copiar e colar. Vou fazer o Controle
D desta vez. Eu ainda estou fazendo isso
um por um para você. Esta mensagem chegará
aqui em voz ou texto. Consulta, Ls. Não gosto
dessa consulta por voz ou texto. Nomear é algo que todos
podem fazer melhor do que eu. Consulta por voz ou texto. Então, novamente, assim como antes, teremos que fazer isso. Eu vou fazer o Controle D, ele está aqui, e você
precisa colocá-lo assim. Se forem mensagens de voz, pegue o arquivo e
transcreva a notícia Isso é bom. Primeiro, categorizaremos se o usuário enviou uma mensagem de voz ou de texto com a
intenção de divulgar as notícias
e, em seguida, obteremos o arquivo, transcreveremos a gravação
exatamente como fizemos anteriormente
e, em seguida, enviaremos a mensagem para
o OK. Agora, há alguns truques Agora, esse conceito um pouco
complicado aqui. Quero que você entenda primeiro
o desafio para que, quando trabalharmos
para resolver
isso, você tenha uma boa ideia por que estamos fazendo isso
de uma certa maneira fábrica de podcasts de
notícias é uma, mas a forma de invocar
pode ser múltipla O usuário pode enviar uma mensagem de voz, o usuário pode enviar uma mensagem de texto. Ou também prometemos que
eles entregariam um podcast de notícias a cada
oito da manhã. O mesmo agente precisa receber
dados de maneiras diferentes. Às vezes, o recebemos diretamente
do assento porque a
mensagem está agendada, usuário nunca envia nada. Às vezes por voz e
às vezes por texto. Isso é compreensível.
Agora, para que isso aconteça
em escala em NA dez, temos que usar o nó definido. Deixe-me executar o
fluxo de trabalho para executar esses nós perfeitamente, para que tenhamos dados enquanto
adicionamos outros nós. Deixe-me executá-lo, e
eu direi notícias de futebol em 2026 Aqui está o texto. Isso é muito bom. Agora
precisamos adicionar um campo definido aqui. Chamaremos essa notícia de intenção
recebida no modo de voz e diremos que queremos
adicioná-la manualmente Precisamos buscar
a consulta de pesquisa, que é esse texto muito fácil, assim
como precisaremos
obter o ID do chat Então, vou chamá-lo de ID de bate-papo interno e vamos
obtê-lo do Telegram Você entenderá perfeitamente quando combinarmos com o agente de IA Então é isso que precisamos fazer. Agora, a mesma coisa que precisamos
repetir para a mensagem de
texto também. Então, por uma questão de tempo, vou fazer isso sozinho. Estou pausando a gravação, ok? OK. Aqui está. Basicamente, o que fizemos foi que,
se o usuário enviar uma mensagem de texto, obteremos a
consulta de pesquisa e obteremos o ID do bate-papo interno
com esse valor. E, uh, isso é bom. Então isso é algo aqui. Isso é lindo. Agora já estamos quase lá. Em seguida, o que precisamos fazer
é adicionar outro nó definido e agora estamos fazendo
a normalização Repetindo isso,
tenho uma consulta de pesquisa e os dados virão
da pesquisa diretamente
do JSON, assim
como tenho outro
campo para ID de bate-papo interno do qual os dados
virão. ID do chapéu interno. suposição é que, se o usuário
enviou mensagens de texto ou mensagens de voz
, eu não me importo Ao chegar até aqui,
tornou-se um. Agora está uniformizado. Isso é o que
chamamos de normalização. Agora, a próxima coisa que precisamos
fazer é examinar o conjunto do Google mais
uma vez e obter as preferências do usuário com
base no ID de bate-papo que
recebemos. Pegue a Rose. Nosso conjunto é Cabri AI e é a fachada do usuário que
precisamos examinar Aqui, vamos adicionar um filtro. Queremos verificar se o ID do
bate-papo corresponde ao ID do bate-papo do Jason Vindo do campo anterior. Execute o nó anterior. Vamos executar o
nó anterior. Existe esse ID de bate-papo. Isso é algo que
precisamos arrastar e soltar e, quando executarmos, ele prosseguirá e
fará com que os dados do Google Seat funcionem
como
o Mzic novamente. Deixe-me renomear isso
para buscar o usuário. Outro nó que
queremos buscar é C Ao obter os dados da facada
do usuário, temos a persona
e essa categoria de Ainda não temos a
configuração de voz para isso. Tipo, qual é o nome da
âncora? Qual é o
nome do âncora dois, seu ID de voz? Todos esses detalhes precisamos
obter da
configuração de voz. Obviamente, você perguntaria por que não colocar esses dados também somente
nesta guia. Bem, meu amigo, é necessário
porque não queremos
deixar repetir os mesmos IDs de voz para cada usuário várias vezes. Amanhã, se você quiser
fazer uma mudança nisso, este é um único lugar onde você pode simplesmente
fazer a mudança. Se forem usuários,
você precisará fazer isso em vários lugares, o que não é bom. É por isso que temos que
gerenciar os dois toques, caso você esteja pensando que
é apenas um trabalho chato. É necessário, por favor,
tenha paciência comigo. Sente-se e desta vez
vamos buscar
as vozes,
então busque E de onde
buscamos as vozes do Cabri AI, e
qual é a guia? É uma configuração de voz. Agora, os dados do usuário estão
disponíveis conosco, certo? Assim, podemos criar filtros
em torno disso com muita facilidade. O idioma deve ser
o idioma do usuário. Está bem? Em seguida, adicione outro filtro. A
persona deve ser aquela especificada
pelo usuário. E é isso. Com esses dois filtros, ele será capaz de identificar exatamente em qual voz âncora e, você sabe, estamos interessados Então isso é bom.
Deixe-me clicar em Executar. E você vê, sim. Então, inglês e profissional, esses são mágicos
na linha número cinco. Então, sim, aí está. Basicamente, o usuário está perguntando
por Brian e Sarah, nessas vozes,
essa é a mágica. Tudo bem, estamos
prontos para enviar esses dados para nosso agente de IA e fazer nosso show de nudez
personalizado Então, deixe-me me conectar a isso. E há algumas
mudanças necessárias no prompt
do agente de IA desde início até agora porque muitas coisas
fizemos agora, certo? Precisamos acomodá-los. Então, aqui estão as bagunças atualizadas de
usuários e sistemas que precisamos atualizar
dentro do nosso agente Basicamente, essa é
a solicitação
recebida pelo nosso agente, e esses são os interesses
dos usuários, certo, categoria de
notícias, etc vem do
assento do Google que precisamos fornecer ao nosso agente para obter o programa de
notícias personalizado Todas essas
mudanças imediatas são para apoiar os novos recursos
que estamos introduzindo para aumentar a
adoção com a chegada
do Google Seat e o suporte de áudio, texto e mensagens de
voz, integração, etc., trazendo uma complexidade
extra, que deve ser tratada
dentro do prompt Deixe-me copiar e colar
isso no prompt do nosso agente. Como você pode ver as notícias do
futebol em 2026, essa é a mensagem que
queríamos enviar ao agente, e ela está
chegando corretamente aqui O que é um bom sinal.
Deixe-me executá-lo agora. E lá vamos nós. A ferramenta foi invocada
pelo agente e fez o trabalho necessário para criar um podcast de notícias de futebol para nós Isso é exatamente o que
queríamos alcançar, correto? Bem, estamos quase terminando. A maioria dos recursos
que planejamos
já foram fornecidos .
Isso é uma boa notícia. Só
nos resta um recurso. Que tal enviar esse podcast
personalizado diariamente às oito da manhã para os usuários para que eles
possam consumir e
queremos trazer esse sorriso
no rosto de nossa
família e amigos. Vamos implementá-lo na
próxima sessão. Veja lá. Obrigada.
12. The Gift of Time Scheduling Automated Morning Shows: Oi, aí. Bem-vindo
a esta sessão. Construímos o cérebro, os ouvidos e a memória. Mas agora vamos
adicionar o coração. Pense sobre o motivo pelo qual
começamos essa jornada. Não era só para ver os nós
ficarem verdes na tela. Foi para trazer um sorriso para
nossa família e amigos. Imagine seu pai, sua irmã ou seu melhor amigo
acordando com uma notificação Eles clicam no play e ouvem um show
profissional de nudez de alta qualidade criado especificamente para eles em seu idioma, sobre
o assunto que amam Sem rolagem, sem ruído,
apenas valor puro. Não é que vamos
interromper as mensagens de texto ou voz, é só que queremos
agregar mais valor
ao nosso fluxo de trabalho. Para isso, o que
estamos esperando? Vamos implementá-lo imediatamente. Vou apenas adicionar um gatilho de agendamento. E com que frequência queremos
agendar, talvez diariamente às 8:00 da manhã,
eu serei automaticamente
acionado todos os dias às 8:00. eu serei automaticamente
acionado todos os dias às 8:00. Caso 8:00 da manhã seja de manhã
cedo para mim, mas se você quiser
aperfeiçoar ainda mais, escolha
é inteiramente sua gatilho de agendamento não vá para esse
lado, você vem aqui. Ok. Ou gatilho programado. Agora, o gatilho programado, embora seja muito interessante,
funcionará de forma diferente. Ele precisa escanear todos os usuários. Os usuários que estão integrados
ignorarão isso, mas o usuário que está ativo em nosso sistema deve ser escolhido e, de acordo com seu idioma e categoria de notícias pessoais, etc.,
temos que criar
o podcast e
enviá-los um etc.,
temos que criar o podcast e
enviá-los Um novo podcast para cada
novo membro, certo? Isso é algo que prometemos. Então, vamos adicionar isso
usando o Google Seat. Não há dados
provenientes do usuário, temos que confiar no que
temos em nosso Google Seat. Essa é a razão pela qual
queríamos construir essa memória
permanente. Tenho certeza que você está gostando dessa
maneira de conectar os pontos. Vou selecionar Cabri AI, vou selecionar os usuários,
vou selecionar Filtro O status deve estar ativo. Se você não está ativo em nosso sistema,
está perdendo muita coisa. E há oito itens
que satisfazem essa condição. Embora tenhamos
mais do que isso em nosso conjunto, mas apenas oito
deles estão ativos. Portanto, precisamos enviar
notícias personalizadas para cada um deles. Com a inclusão desses nós de conjunto, já
facilitamos muito. Vou apenas adicionar um campo definido
e, desta vez, vamos
chamá-lo de intenção de agendar notícias Desta vez, a consulta de pesquisa terá
um valor codificado. Será um briefing de agendamento porque
não há nenhuma consulta de pesquisa, mas ainda assim queremos
usar o mesmo agente Precisamos criar esse campo, mas teremos um valor
codificado para ele e já
solicitamos
ao agente que use o interesse do usuário
caso o resumo do cronograma seja
fornecido como uma consulta de pesquisa No momento em que o agente
ver
isso, saberá que precisa
obter os dados apenas do
Google Seat. Não há preferência
do usuário em entrar. Qual é a ID interna do chat? O ID de chapéu interno será o ID de
bate-papo que virá aqui. Desta vez, isso vem do site
do Google. Etapa de execução muito fácil
e temos os dados. Se tivermos esses dados, assim como fizemos com a intenção de voz e texto, podemos fornecê-los também para formatar a intenção de
pesquisa para que os dados
possam ser fornecidos ao Eu perdi isso mais cedo.
Deixe-me colocar desta forma. Veja, até mesmo buscar usuário e buscar voz está funcionando na fábrica interna
de notícias Na verdade, não depende se tratar de mensagens de voz
ou de texto. É uma
parte estritamente essencial do agente. Então, eu quero trazê-lo para
dentro disso e pronto. Olha essa beleza agora. Agora temos suporte de bot
para texto de voz, bem
como mensagens agendadas. Sem que o usuário
precise solicitar o podcast, ele será entregue
automaticamente manhã e tornará
suas manhãs Quão ondulado é isso? Importe esse fluxo de trabalho em sua antina
e não se esqueça de tentar E caso você
seja mais preguiçoso do que eu imagino, vamos nos conectar novamente mais
uma vez e testaremos
todos esses recursos e garantiremos que tudo esteja
em perfeita ordem Sente-se aí. Cuide-se.