Transcripciones
1. La visión de arquitectura: tu fábrica de noticias personal: Oigan, todos. Bienvenida. Estoy muy
emocionada de que estés aquí porque hoy no
solo estamos construyendo otro chatbot
aburrido Estamos construyendo una fábrica de noticias
personalizada, una media house que trabaja exclusivamente para ti
y las personas que amas. Imagina que tu papá se despierta y en lugar de desaparecer
en un garabato silencioso e
interminable en su teléfono, golpea play en un podcast de noticias personalizado enviado directamente a Son los titulares de la mañana
transformados en una historia que toda la familia
puede disfrutar juntos. Pero aquí está la magia
que hemos diseñado. Él elige las voces, ya sea tranquilo, narrador
profesional para comenzar el día o un do de alta energía como Marcus y Sarah para mantener a los niños riendo mientras
desayunan Han construido la lógica para
darle vida a su mañana. Podemos hacer que el espectáculo sea divertido, entretenido y ágil, pero nunca nos comprometemos con
la verdad Se trata de noticias en vivo del mundo real. No sólo estamos dejando que
un LLM invente las cosas. Nuestro agente busca eventos actuales
reales que suceden en este momento y los
convierte en un guión. Es una mezcla perfecta de personalidad y hechos 100%
verificados, y no se detiene en inglés. Hemos puesto
mucho trabajo duro para
asegurar que esta fábrica
hable su idioma. Ya sea hindi, español o francés, tus noticias
deberían sonar como en casa. Incluso puedes establecer la vibra, convertirlo en una sesión informativa seria para tu viaje matutino o un divertido
espectáculo lleno de chismes para tu descanso Construyo esto para
mi propia familia y ver su reacción
al escuchar su nombre y sus intereses en su lengua materna fue el momento Ajá que quiero
darte hoy. En este curso, estoy desarrollando
este vivir contigo. Verás la lógica, los cables y cómo
manejamos la tecnología del mundo real. Usaremos
a Antin para manejar el flujo, abrir el ojo para el cerebro y 11 vueltas para esas
impresionantes voces humanas Al final de esto, tendrás un sistema totalmente automatizado
que se ejecuta mientras duermes. Toma un café, abre tu laptop y convertimos esta
visión en realidad.
2. Definición de la misión y desarrollo del cerebro de la IA: Antes de escribir una
sola línea de lógica, necesitamos comenzar desde cero. Mira este lienzo en blanco. Aquí es donde toma forma tu
visión. Primero, vamos
a nombrar nuestro flujo de trabajo. Estoy llamando al mío abri AI. Para los que no saben, Kuber significa noche y un cubby es
un reportero, la persona que siempre
tiene
el Al agregar, estamos señalando que esto no es solo una sala de redacción, es una fuerza de noticias
automatizada inteligente Sí. Este es el
nombre de mi flujo de trabajo. Definiendo la persona ahora, demos vida a Kubri AI Comenzamos dejando caer un nodo agente de IA agente en nuestro lienzo y ahora necesitamos
definir el prompt. Utilizaremos tanto el
mensaje del usuario como el mensaje del sistema. Entonces estos son los mensajes de usuario donde pondremos
las cosas dinámicas, derecho, una categoría de noticias que puede variar para cada requerimiento
del usuario. Entonces vamos a tomar eso
en los líos de usuario y luego el mensaje del sistema es el lugar para, ya sabes, reglas Entonces este es el
prompt del sistema que hemos definido. Si lo miras, nuestro aviso le da a la IA una identidad clara. Nosotros le hemos dicho que usted es el productor ejecutivo
del show de Marcus y Sara. Esto es algo que siempre
podemos personalizar. Si quieres un nombre diferente
para el programa, está bien. Entonces estamos diciendo que
nunca inventas noticias. Solo discutes lo
que encuentras en tus herramientas. Esto es importante porque si no damos
instrucción como esta, entonces LLM puede alucinar
e inventar las noticias su cuenta sin realmente navegar por Internet
y buscar las No queremos alucinaciones de IA. Queremos noticias en vivo. Queremos saber qué está
pasando en las calles de Mumbai o los campos de
Manchester en estos momentos. Vamos a copiar estos
mensajes a nuestro nodo. Entonces voy a así que esto va a ser un usuario líos y aquí están los líos
del sistema Y sistema. escrito una instrucción especial en el corazón de nuestro aviso. Antes de escribir
un solo diálogo, debes usar tu herramienta para
obtener los últimos titulares Cabri AI ahora está ciego
y esperando ojos. En el siguiente paso, vamos a construir
la herramienta fetch News Este es el puente que conecta cerebro de
nuestro agente con
la red mundial de noticias, asegurando que cada palabra que habla esté respaldada por hechos en tiempo
real. Vamos a sumergirnos en nuestros
parámetros y darle a nuestra IA Kubri sus ojos.
3. El motor de noticias busca la verdad en tiempo real: Permítame agregar esta herramienta, haga clic en Nuevo y quiero
solicitar la herramienta STTPRquest y el nombre de la herramienta como
hemos definido dentro prompt
del Agente tiene que ser fetch
News Ahora que hemos
definido el cerebro AIS, necesitamos darle su fuente
primaria de verdad. Al elegir el motor antes de
aterrizar en nuestra configuración actual, evalué varias opciones, API de
noticias, Google News, e incluso construyendo
un raspador personalizado. Pero finalmente nos conformamos con
los datos de noticias DTO. ¿Por qué? Por azilidad Nos permite pasar
múltiples categorías en una sola solicitud esa superconsulta que
discutimos anteriormente, y le da al agente un control
preciso sobre el tamaño de
la respuesta Si queremos cinco
titulares o 50, el agente puede decidir en
función las necesidades del usuario si está utilizando la
API de datos de noticias, por supuesto. Ahora hablemos de la arquitectura
plug and play. La belleza del
sistema que estamos construyendo es que es agnóstico del proveedor Te estoy enseñando a construir
un sistema reconfigurable. Si mañana quieres cambiarte a otro proveedor de
noticias, no
tienes que reconstruir toda
la fábrica. Simplemente intercambia el
punto final de la API y la clave secreta. El resto de tu lógica
permanece intacta. Así es como se
diseñan los sistemas profesionales , ¿no? En el mundo real, usamos curl. Voy a asumir que tienes una comprensión básica de
lo que es un comando curl. Pero para los que
son nuevos en esto, quiero desmitificar lo que están
viendo En el mundo del desarrollo de IA, curl es nuestro lenguaje universal, ya sea que estés usando OpenAI, ElevenLabs o news Todos te dan un
comando curl en su documentación. Es básicamente la llamada
API, ¿verdad? Piense en un comando curl como
una nota de entrega digital. Cuando envías un paquete, necesitas cuatro cosas la dirección o lo que llamamos el punto final.
¿A dónde va el paquete? En este ejemplo,
es newdata dot IO. Entonces el método, ¿estamos obteniendo
información o publicando nuevos datos? Entonces se define aquí, y luego el pase de seguridad, tu clave API que
prueba que tienes permiso
para ingresar al edificio, luego la carga misma. La categoría de noticias específica o nombres de
voz que desea que procese
la API. Básicamente la carga útil.
Por qué esto te importa, te estoy mostrando el método curl porque hace que tu
sistema sea a prueba de futuro. Si encuentras una API de
noticias mejor mañana, no
necesitas
aprender una nueva herramienta. Simplemente toma su comando
curl, lo
importa a Nitin y su fábrica sigue funcionando Estás construyendo
un sistema modular, reconfigurable
y profesional Ahora, para crear
la herramienta fetch news, todo lo que necesitamos es
este comando curl En primer lugar, permítame
asegurarme de que está funcionando uno. Yo sólo voy a ir aquí,
pegarlo, golpear enter. Y puedes ver que
has empezado a recibir las noticias. Esa es una buena noticia. Ahora bien, quizás lo que no me
gusta de este solo está disponible en planes profesionales
y corporativos. Esto es algo que quiero
evitar porque si
no
lo quito, va a crear ruido
extra en
la respuesta y ese ruido tiene que ser procesado por el LLM, que consumirá tokens extra Nada bueno, quizá lo que pueda
hacer es hacerlo así. Es la misma afirmación otra vez, excepto que queremos
excluir ciertos campos, y hemos limitado la
respuesta a tamaño de diez. Déjame pegarme entrar.
Todas esas advertencias de solo disponibles en
planes corporativos se eliminan ahora. Esa es una buena noticia, ¿no? Ahora, tomemos esta declaración, vamos a Nitin, y
no tienes que llenar
nada manualmente Simplemente diga Import curl, pegue la declaración aquí,
tal cual y haga clic en Importar. Ahora déjame hacer un
pequeño cambio aquí. Tenemos codificadas estas
categorías por aquí. Ahora mismo, tenemos este
valor como codificado duro, pero en el mundo real, queremos que
nuestro agente impulse esto. Simplemente haces clic en
este signo mágico y dejas que la IA haga la magia. ¿Qué tan genial es eso? Con esto, nuestra herramienta de búsqueda de
noticias está lista. Intentemos ejecutarlo y ver si las cosas
están bien hasta ahora. Por lo que nuestro agente de IA
debería poder usar la herramienta fetch News y obtener las noticias y crear
una conversación para nosotros. Entonces déjame borrar esto. No lo quieres. Quiero
activarlo manualmente. Seleccionaré el disparador manual, conectaré esto al
agente de IA. Esto es bueno. Entonces modelo de chat, necesitamos agregar. Seleccionaré el modelo de chat OpenAI y quiero que sea creativo
y seleccionaré GPT cinco GPT cinco más reciente. Para poder utilizar este modelo, deberás agregar
tu clave OpenAI Es muy sencillo. Simplemente da clic en este
Crear nuevas credenciales, ir a su plataforma open.com, crear una nueva clave secreta,
dar un nombre, seleccionar un proyecto,
y crear la clave secreta, y luego agarrar la clave secreta, y luego agarrar la clave secreta, ir de nuevo a ANATN
y pegarla Eso es todo lo que necesitas hacer para configurar la cuenta
OpenAI Espero que lo puedas
hacer de forma independiente. Bien, entonces con esto, se le agrega
el modelo a nuestro agente. Entonces básicamente, ahora
el agente utilizará este modelo en particular para su razonamiento y acción y
cadena de pensamientos, ¿verdad? Bien, esto es bueno. Ahora estamos todos preparados
para activarlo. Entonces déjame probarlo. Para que puedas ver que hizo uso
de esta API de fetch news. Por eso esto está en verde, déjame ir a la ASN
y ahí vamos ver, se
trata del nuevo año, que básicamente está
sucediendo ahora, agente no lo sabrá directamente, así
como pude ver
estas son noticias reales. Bingo, esa es una buena noticia. Nuestro agente de IA es capaz de
usar sus herramientas para obtener las noticias y luego crear la salida exactamente como
queríamos que fuera Con esto, hemos implementado y
probado
con éxito el cerebro y el
motor de nuestra IA de caber Bueno ese es un muy buen comienzo. Ahora en la próxima conferencia, trabajemos para dar voz a nuestra
AI de cubierta. Ver ahí.
4. Dar a la fábrica una voz que integre el habla humana: Hemos construido con éxito nuestro
cerebro y nuestro motor de noticias. Pero una sala de redacción sin voz
es solo una base de datos silenciosa. Ahora pasamos a un paso crítico, dando voz a la fábrica. No estamos buscando texto
robótico a voz. Queremos una actuación humana que capture la espera de
una historia de última hora. Para lograrlo, estamos
integrando 11 laboratorios. Son líderes indiscutibles
en IA de voz generativa, estableciendo el estándar global para la profundidad
emocional
y el realismo de voz Cuando escuchas una voz de
ElevenLabs, no solo escuchas palabras Se escucha la amplitud,
la cadencia y la autoridad de un locutor
profesional Ahora, para nuestro proyecto, tenemos que elegir la voz de nuestros intérpretes para que podamos ir a las voces y mirar la
biblioteca de las voces. Esto es enteramente por
tu creatividad. No quiero
recomendar ninguna de las dos voces. Puedes ir con dos
voces masculinas, dos voces femeninas, una voz masculina y una voz femenina en cualquier combinación
que quieras usar, así
como puedes elegir
voz para niños y tal vez esa sea
incluso linda idea donde los niños están discutiendo las noticias
y manteniéndote al día. Así como no
tienes que elegir las voces que hablan inglés. Puedes ir con una amplia variedad de idiomas que soporta
ElevenLabs, y lo que te estamos
pidiendo es simplemente ir a cualquier voz
y copiar su ID de voz Básicamente, tienes que encontrar
dos identificaciones de voz como esta, que puedes dar a tus
intérpretes del programa. Sí. Ahora, antes de
automatizar todo el flujo, necesitamos probar
la conexión x
Piense en esto como el apretón de manos
entre nuestra lógica y nuestra voz. Piense en esto como el apretón de entre nuestra lógica y nuestra voz Ya he hecho el
trabajo pesado aquí. He pasado el tiempo
navegando por la documentación, identificando los puntos finales de API más
receptivos y seleccionando las voces
específicas
que disparan la autoridad de nuestras
salas de redacción Si quieres experimentar ese viaje de investigación tú mismo, eres más que bienvenido a sumergirte en la
documentación técnica. No obstante, para esta sesión, me estoy saltando la
prueba y error para mostrarte el resultado final
optimizado Este es el
comando curl que funciona. Déjame mostrarte enseguida. Déjame ir a la terminal. Pégalo aquí. No
funciona en Powershell, parece Eso está bien. Y déjame
probarlo enseguida. Entonces déjame pegar el
comando curl aquí, presiona Enter. Ve a este lugar. Puedes ver este archivo podcast temp
tres se crea por aquí. Se descarga de ElevenLabs.
Déjame tocarlo por ti. Entonces puedes ver que ya está
funcionando, ¿verdad? El comando curl funciona
y ese es el punto. Es posible que desee ejecutar el comando
curl usted mismo y descargar este podcast y
escucharlo. Eso está perfectamente bien. Lo que quiero hacer ahora mismo es comenzar a integrarme en
Ant y flujo de trabajo, y para eso,
necesitaremos un nodo de solicitud. Entonces STTPRquest da clic en esto. E importar el comando curl, que ya copié. Lo importaré
aquí enseguida. Como puedes ver, sin tener que
llenar todas estas casillas, el nodo se crea correctamente. Déjame tratar de dar pasos
ejecutivos y asegurarme de que las cosas estén
bien, y ahí vamos. Puedes ver este podcast
punto MP tres archivo se está descargando. Significa que la solicitud fue a ElevenLabs con la
conversación que queríamos
enviar y ElevenLabs procesa el texto y creó el archivo
MP three para nosotros, que está ¿Qué tan genial es eso? Bueno, ya
hemos hecho el trabajo duro. Ahora se trata de, mira, aquí está esta conversación que
estamos pasando a 11 laboratorios. En nuestro escenario, no
va a ser
codificado duro porque las noticias pueden
cambiar y en consecuencia, la discusión del podcast
cambiará. Entonces lo que quiero decir con
eso es lo que sea haya dentro de estas
entradas va a cambiar, y por eso
no podemos codificarlo por hardware Voy a dejar esto. Y lo que es esta entrada
se verá como en tiempo
real será esta
salida del agente. Déjame arrastrar y soltar esto
y ya está. No, mi cama. Déjame ponerlo aquí, cortarlo y
ponerlo aquí. Eso es. Ahora, cada vez que este asient
genera una nueva salida, automáticamente, los valores
actualizados se
pasarán a 11 laboratorios Déjame nombrar esto como
11 laboratorios también. Esto es bastante bueno. Ahora lo último,
como has visto, ElevenLabs espera
estas entradas en un formato específico donde
no hay ID de voz es así, luego el tono del
texto y luego el texto, no
hay caracteres especiales permitidos en él y todos estos,
queremos asegurar
que el agente de IA produzca una
salida que sea sootable
para 11 labs, Eso es algo muy importante. Por esta razón,
iremos al agente de IA, iremos al prompt del sistema
y agregaremos esta instrucción. Queremos salida en este formato en
particular solamente. No te preocupes, actualmente tenemos codificado
duro el ID de voz, que arreglaremos
más adelante, lo cual está bien. Pero este es un ejemplo de pocos disparos que incitan
donde hemos dado un ejemplo que
queremos sacar en
este formato en particular solo sin ningún tipo de rebaja o relleno Y eso hace que la salida sea
comprable para ElevenLabs, que se procesará
sin Al poner este formato de salida
obligatorio, nos hemos asegurado de que el agente
de IA produzca una salida, que será procesada por ElevenLabs sin ningún problema
. ¿Qué tan genial es eso? Ahora hemos construido los códigos vocales de nuestra
máquina y mapeamos salida de
nuestros agentes directamente en nuestro nodo de
solicitud ElevenLabs Estamos oficialmente
listos para ir más allá los componentes
individuales y
mirar el ecosistema como un todo. En nuestra próxima sesión,
no solo estamos probando
un solo nodo, estamos verificando todo el
pipeline, el motor de noticias, el agente de IA y ElevenLabs
está funcionando en perfecta sincronización Golpearemos Ejecutar para
presenciar cómo los datos en tiempo real fluyen a través del cerebro y emergen como voz
humana sofisticada Ya no es sólo
un ejercicio técnico. Es el momento en que estas herramientas
independientes se convierten en una
sala de redacción unificada
5. El momento de la verdad durante tu primer proceso: Los cables están conectados, el cerebro está cebado, la voz está lista Ahora volteamos el interruptor. En esta sesión, estamos ejecutando el pipeline completo
por primera vez. Vamos a
activar a nuestro agente, dejarlo buscar los
últimos carteles de cricket y noticias de seguridad global, y verlo entregar
ese guión a ElevenLabs para crear nuestro
primer podcast de noticias Ya estoy emocionada. Vamos a presionar el botón de ejecutar. Bien, ElevenLabs está en el trabajo. Sólo un dato divertido. Cualesquiera que sean las operaciones
de texto
a voz
que estemos ejecutando, podemos verificarlas en ElevenLabs en la pestaña de
historial de aquí Hace 15 minutos, estas son las operaciones que
realizamos en el pasado. Eso es genial. Buen consejo
de solución de problemas. Cuánto voy a pagar.
Soy un hombre pobre. Siguen rogándome
por más pago. Por favor, dame algo de crédito. Bien. Pude ver que ElevenLabs
está terminado en Verde Veamos qué hay
ahí. Y Bingo, hay archivo 1.9 MB significa que mi podcast está
listo, diría yo. Déjame verlo. Sarah, ¿te enteraste de
Usman kawaja? Acaba de anunciar
su retiro luego de 15 años de carrera en
el Baggy Green, terminando su carrera de libro de cuentos con la
prueba de Fifth Ashes en Sydney Lo hice, Marcus. Es
un momento poderoso. Tampoco se
alejó silenciosamente. Kowaja también habló
sobre los estereotipos raciales en el cricket, recordando
realmente a
todos que los deportes todavía tienen trabajo que hacer
fuera del campo Es como la tecnología
alimentándose de la tecnología para dar un salto adelante. Y eso se ata
directamente a semiconductores. Los gigantes tecnológicos de Corea del Sur
están sintiendo una nueva presión. Oh, Dios mío. Mira esta
cualidad de nuestro nuevo espectáculo. Qué bueno es, ¿no? Lo bueno es que funcionó
en first go porque ya
hemos agregado este formato de salida
obligatorio. Sin esto, era seguro
que habría fracasado. Muy bien, la fábrica
está oficialmente abierta, pero ¿cómo van
a usar mis usuarios esta aplicación ¿Debo aconsejarles que vengan a mi espacio de trabajo Antin y
hagan clic en esto manualmente? De ninguna manera vamos a
tomar esa estúpida decisión. Bueno, vamos a reunirnos en
la próxima conferencia y vamos en directo por
Telegram. Nos vemos ahí.
6. En directo conectando tu fábrica a Telegram: Hasta ahora, hemos estado
jalando las palancas nosotros mismos dentro de un
aten. Eso cambia ahora. Nos estamos mudando
del laboratorio y entrando en el mundo real conectando
nuestro flujo de trabajo a Telegram. Ya no solo estamos
ejecutando un guión. Estamos lanzando un servicio donde los usuarios específicos
solicitan, como, darme las últimas
noticias sobre fútbol o lo que está pasando en
Bollywood desencadena toda
esta línea de
producción automatizada y obtener el podcast
entregado en el mismo lugar Para darle una
cara a nuestra cubre AI, hemos decidido usar Telegram. Vamos al Telegrama y tenemos que ir
al barco padre. Aquí tendremos que
crear nueva embarcación. Dar esta instrucción.
Quiero crear un barco nuevo, un barco nuevo, ¿cómo lo
vamos a llamar? Por favor, elija un nombre. Tenemos que
darle un nombre a nuestro bot, voy a decir, quiero
darle este nombre. Bueno. Escojamos un
nombre de usuario para tu bot. Voy a seleccionar el mismo usuario sin
augurio. Este es el nombre de usuario. Eso es. ¿Qué tan genial es eso? Bien, entonces nuestro bot se
crea con éxito. Tenemos la
API STTP y el token. Entonces déjame copiar esto y
volver al flujo de trabajo de Antin. Ahora, eliminar esta obra al
hacer clic en Ejecutar, eliminar esto, agregar Telegram, lo que nos interesa es
en el disparador de líos. Todo bien. Entonces este
es el detonante, permítanme agregar al nuevo
tablero de Telegram que hemos creado. Así que solo agregaré el
token de acceso por aquí y lo guardaré. La conexión se prueba
con éxito. Eso es bueno. Regresa y ya puedes ver, este es el disparador de Telegram. Vamos a
conectarlo con el agente de IA. Entonces vamos a
conectarlo y es momento de probar lo mismo. Para esto, iré a mi bote. Ahora tenemos que probar esto. Entonces, para probar,
guardaré el flujo de trabajo y haré clic en Ejecutar flujo de trabajo.
Ahora ve a Telegram. Y este es mi barco. Yo solo diré inicio
y ya se puede ver el barco ya está
funcionando. Déjame detenerlo. Yo solo quería probar si se
está disparando o no. Ahora, una
cosa importante que tenemos que hacer ir al agente de IA en el mensaje del usuario, ir a expresión,
hacerlo a pantalla completa. Aquí, este cricket, Bollywood, yo
generativo, y semiconductor,
eso es algo dinámico Cada vez que el usuario puede
cambiar ese requisito. Me gustaría hacerlo
basado en el mensaje del usuario. Esta vez usuario head start, entonces este es el texto.
Lo voy a poner de esta manera. Que cada vez que el usuario se activa
con un requisito diferente, este mensaje de usuario se actualiza en consecuencia.
Eso es bueno. Vuelve atrás y como
puedes entender, nuestra intención no es solo activar el
flujo de trabajo con esto. También queremos entregar el
resultado en el mismo lugar. Para eso, lo que podemos hacer es agregar otro nodo y será nodo de
Telegram una vez más, enviar un archivo de audio. Sí, eso es lo que
queremos enviar y quien activó el x hat ID habrá
que ponerlo así. El archivo que queremos
enviar es el archivo binario. ¿Cuál es el nombre
del archivo? Bueno, va a venir de
los ElevenLabs ElevenLabs, como hemos visto, crea el archivo con este nombre, crea el archivo con este nombre,
¿verdad? Podcast tempi tres Donde se especifique, déjeme mostrarle en los 11 laboratorios, vamos aquí, está aquí. Salida de archivo, ya hemos
configurado en podcast temp tres. Por esta razón, se tiene que
usar el
mismo nombre de archivo en el nodo de Telegram
donde estamos enviando el archivo Esencialmente, lo que está haciendo este
nodo es enviar un archivo de audio a la misma persona que
activó el flujo de trabajo, y el archivo de audio se
denominará podcast tempi tres, que hay que enviar como archivo
binario. Eso es todo. Déjame guardar esto y ahora
es momento de la verdad. Et me voy a vivir con esto. Sólo voy a decir de
inactivo a activo, déjame hacerlo así. Lo tengo para que no tenga
que ejecutar cada vez. Estamos en vivo con esto,
así que iré a Telegram. Voy a decir lo que está
pasando en el fútbol, Bollywood y la máscara de Elon A ver, no quiero pretender ningún
significado particular para esto. Es solo que quiero probar, por favor no me tomes mal. Veamos si
se inicia la ejecución y efectivamente lo es. Está funcionando por los últimos 17
segundos, déjalo completar. Ojalá pudiera ver
la ejecución en vivo. Es muy difícil para
mí sentarme de brazos cruzados y ver qué y
esperar los resultados Ojalá pudiera ver qué nota
exactamente está funcionando bien. Muy difícil para mí sentarme y esperar a que se complete este
flujo de trabajo. Ojalá hubiera una manera de ver exactamente qué asentimiento se está
ejecutando en este momento La retroalimentación en vivo es
algo que tenemos. Todo bien. Ahí estamos. Se completa el flujo de trabajo. Entonces vamos a ver. Bien, entonces el
agente de IA fue ejecutado y todo se completa
en medios verdes en Telegram, deberíamos estar viendo
el archivo del podcast Y ahí está. Sí, es de 2
minutos de largo para MB en tamaño. Déjame ver qué hay ahí. Sarah, ¿cogiste
ese drama afgano salvaje? La selección de Gabón
acaba de quedar suspendida por completo tras su desastrosa
campaña en Marruecos Incluso prohibieron a
Pierre Emric Obama ya. Eso son algunas consecuencias graves
tras perder 32 ante Costa de Marfil Sí, eso es duro, pero muestra lo alto que está en
juego en el fútbol. tanto, en la escena universitaria, Indiana hizo historia con un reventón de 38 a tres
contra Alabama en el No tiene sentido reproducir
el audio ahora. A lo mejor sólo
lo voy a adjuntar para que puedas
pasar por él más tarde. Todo bien. Echa un segundo
vistazo a lo que has logrado. No solo has
construido un simple bod. Ha diseñado una línea de producción de medios de
extremo a extremo. Ha combinado la
arquitectura API, el filtrado en tiempo real y la síntesis de voz neuronal en una única experiencia
receptiva para el usuario. Estás más allá de
ser un consumidor de IA y convertirte en un
arquitecto de la misma. Su sala de redacción personal está
oficialmente abierta para los negocios. Adelante, envía
un comando a tu tablero y escucha que tu
creación te responde. Por favor, no olvide
enviarme los comentarios. Tengo muchas ganas de saber
si a tu padre, hijos y a todos en familia
les gusta esta herramienta familiar o no. Bueno, eso es todo por ahora. Muchas gracias por tu tiempo.
7. La arquitectura de la memoria que va más allá de la lógica codificada: Todo bien. La primera fase fue sobre la
construcción de la fábrica de noticias
y esa parte funciona. Podemos buscar noticias, procesarlas y convertirlas en un podcast
o un nuevo programa exactamente de
la manera que queramos Toda la tubería
corre de extremo a extremo. La verdadera limitación, sin embargo, es que todo está codificado
duro en el prompt, el tono, el estilo,
el formato, todo. Cada oyente obtiene
la misma experiencia independientemente de quiénes sean
o de cómo consuman las noticias La fase dos se trata de
romper esa rigidez. Diferentes personas quieren que las mismas noticias
se entreguen de manera diferente. Un padre escuchando al final
del día prefiere
algo tranquilo y profesional mientras que sus hijos quieren que las mismas actualizaciones sean
enérgicas y juguetonas. Algunos usuarios quieren dar instrucciones de
voz, otros quieren enviar
usando mensajes de texto. Así que prefiero el inglés,
otros otro idioma. El cambio que estamos haciendo es de un sistema que meramente produce contenido a uno que adapta la experiencia a
la persona que lo consume. Ahora ves el verdadero problema. Una herramienta no sabe
quién le está hablando. Arreglemos esto en la fase dos. Para que esto funcione para todos, tenemos que alejarnos del código de talla
única. Vamos a utilizar
un simple conjunto de Google para actuar como la
memoria permanente de nuestra fábrica. He configurado dos pestañas en nuestro asiento de Google que
actuarán como nuestro centro de comando. Primero, tenemos la pestaña del usuario. Esto rastrea los ID de chat, los nombres, los idiomas y las personas. Es como el sistema reconoce tu papá frente a tus hijos en
el momento en que golpean play. Entonces tenemos la pestaña de
configuración de voz. Esta es nuestra agencia de casting. Asegura que cuando el
sistema ve hindi y diversión, extrae la identificación de voz exacta de
ElevenLabs necesaria para esa Ahora, solo pude agarrar
estas muchas identificaciones de voz, pero según tu requerimiento, solo
puedes crear
tus propios personajes, los idiomas que
quieras apoyar, personas y en consecuencia,
ir a ElevenLabs, buscar las Por ejemplo,
quieres buscar en español y explorar un par de voces tú mismo y tal vez, ya
sabes, elegirlo
ID de voz y quieres
actualizarlo en tu ID de
voz para el ancla. Así es como comienzas a
apoyarlo. Es muy sencillo,
¿no? Si ninguno de los
requisitos del usuario coincide con esto, entonces esto se
asignará al usuario. Entonces no vamos a
defraudar a nadie. Si no podemos igualar,
aún vamos a servir la noticia en
el tono predeterminado, al
menos, ¿verdad? ¿Qué clase de nosotros? Y si lo piensas, no se trata sólo de
los asientos extendidos. Se trata de escalabilidad. Al poner estas
preferencias en un asiento, puedes agregar 100
amigos a tu tronco sin tocar nunca
un solo nodo en diez Estás construyendo un
sistema que se adapta
al ser humano en lugar de obligar al humano a adaptarse
a la máquina. Eso suena cuerdo, ¿no? Estamos a punto de construir una cadena lógica sofisticada
en el bloque de registro, y quiero asegurarme de
que esté listo para ello. Antes de seguir adelante, tómese un momento para
establecer sus cimientos. Importa la
plantilla de Google Set a tu cuenta e intenta conectar tu flujo de trabajo NTN
al conjunto de Google. Es muy sencillo. Por favor, repasa el documento y estarás teniendo esta memoria conectada es lo que permite que el cerebro que estamos a punto de
construir funcione realmente. Vamos a la siguiente
conferencia y construyamos el agente de incorporación que finalmente le dé voz
a tu familia. Ver ahí.
8. El agente de incorporación que automatiza la intención del usuario: Entonces ahora que tenemos
nuestro set de Google listo, podrías estar pensando, genial, solo
enviaré el enlace a
todas las cien personas que quiero en mi barco de Telegram y
les pediré que llenen sus
datos, ¿verdad? ¿Pensaste así? Quiero decir, seguramente, todos
dejarán de hacer lo que están haciendo, abrirán una hoja de cálculo
y teclearán perfectamente sus preferencias de
idioma de categoría de noticias en un par de minutos, ¿verdad Mal. Seamos honestos, pedirle a tu papá o a tus
amigos que llenen una hoja de cálculo solo para usar un tablero de chat es una receta
para un pueblo costero Además, tenemos cosas mucho
mejores que hacer con nuestras vidas que administrar manualmente
filas de datos, ¿no es así? Entonces, en lugar de hacer el
trabajo pesado nosotros mismos, vamos a integrar el proceso de
incorporación directamente en nuestro flujo de trabajo antin Deje que la máquina haga las cosas aburridas para que
podamos mantenernos enfocados en
el panorama general. Sí. Suena bien. Bien, intentemos
renovar nuestro flujo de trabajo. Entonces, antes que nada, trataré estas cosas
a un lado. Entonces esto no es lo que
voy a trabajar en este momento. Más bien, sólo voy a hacer una cosa. Voy a calarlo, y
lo llamaré Fábrica de podcasts de Noticias. Sí. Entonces estas cosas están funcionando y cualesquiera que
sean los cambios que se requieran en esto, lo
haremos por separado más adelante. inmediato, lo que
quiero hacer es cada vez que un usuario envía un
mensaje, antes que nada, lo que queremos hacer es una búsqueda en este asiento de Google, si el usuario
ya está presente, ya sea que esté activo o en
el estado de incorporación, ¿verdad Entonces básicamente, o el usuario
no está presente en absoluto
o se le agrega, pero aún no se le dan las
preferencias, ¿verdad? Así que de esa manera queremos construir. Entonces lo que tenemos que hacer es agregar
este nodo de Google seat, y lo que queremos hacer es Gros. Ya tengo mi
cuenta de Google Seat agregada. Todo lo que tengo que hacer es sentarme
dentro de los documentos. Voy a tener que buscar Cabri
AI y buscar usuario Puñalada. Suena bien. ¿Qué es lo que buscamos en este asiento? Bueno, estamos
buscando ID de chat. Hay un ID de chat
proveniente del disparador de Telegram. Solo tenemos que asegurarnos
si está presente en el Google Seat o no.
¿Cómo lo hacemos? En primer lugar, permítanme activar esto para que empiece a obtener
los valores aquí. Para conseguir valores, lo que quiero hacer es en primer lugar no concentrarme en esta fábrica de podcasts de
noticias. Eliminaré esto y
ejecutaré el flujo de trabajo, y desde Telegram,
intentaré enviar un mensaje demo, tal vez simple punto, ¿verdad? Solo quiero que se active el
flujo de trabajo. Y ahora si voy aquí, voy a ver estos valores por
poblar, ¿no? Entonces aquí lo que
queremos hacer es agregar un filtro en la columna de ID de chat. ¿Y cuál debería ser el ID de chat? Debería ser el que viene del disparador
de Telegram, ¿verdad? Ejecutar paso. Y si, ¿ves? Ahora, porque mi usuario está presente, por
eso
va por allá. Si acabo de borrar esto, déjame cambiarlo, ¿verdad? Para que ahora la idea del chat no
esté presente. Entonces déjame ejecutarlo de nuevo. Y puedes ver ahora los datos
no se encuentran porque esencialmente el ID de chat que viene
del disparador de Telegram ya no
está presente en el Google
Seat. Muy sencillo. Ahora, en base a esto,
queremos crear nuestra lógica. Entonces podría haber
múltiples escenarios. Una es que el ID de chat nunca se
agregó al sistema. Por lo que el usuario nunca fue parte de esto, y en ese caso, el usuario
no se agregará por aquí, por lo que será nuevo usuario. Bien. Ahora, veamos qué lógica estamos tratando de construir
para la incorporación Por lo que hay tres
escenarios posibles. Uno es el ID de chat que ha desencadenado este flujo de trabajo
nunca es parte de Google Seat. En ese caso,
lo llamaremos nuevo usuario y lo enviaremos a un nodo en particular donde se puede agregar
usuario a
este Google Seat. Esa es una. En segundo lugar, el
usuario es parte del asiento, pero aún nodo ha
dado las categorías de idioma, persona y noticias que son predeterminadas para el usuario. Ese caso, lo
llamaremos onboarding. Significa que el usuario está ahí, pero aún no lo usa activamente, y aún no está activado
en nuestro sistema. No sabemos quién es ese usuario. Es solo ese nombre que
conocemos, no las preferencias. O tercera regla es que el
usuario está ahí así
como conocemos sus preferencias y están activos
en nuestro sistema. Tres rutas posibles. Correcto. Entonces, para
crear estas reglas, vamos a agregar un nuevo nodo. Entonces agreguemos un nuevo nodo, switch. Y en base a mi explicación, estoy seguro de que será muy
sencillo para ti. Entonces lo que nos interesa es el ID de chat que
viene de este. Entonces permítanme
cambiar momentáneamente eliminar esto, guardarlo y ejecutarlo de nuevo
para que los datos se poblen En base a estos datos
provenientes de Google Set, queremos hacer nuestras lógicas, las reglas número uno es el ID de
chat está vacío, y esto significaría que
el usuario es nuevo usuario, necesitamos incorporar al usuario La segunda regla podría ser que
podamos mirar el estado. Mira el estado y comprueba si es igual a abordaje. ¿Correcto? Tercera regla, voy a decir
onboarding en esta Y tercera regla es que este usuario
está presente así como activo. String es
igual a dos es igual a active porque el ID de chat es un número y
estamos usando la
operación string por aquí, así que tenemos que
alternar este botón, convertir tipos donde
sea necesario, ¿verdad? Muy sencillo. Y ahora
vamos a ejecutar este paso, y es decir que esto está activo. Este es usuario activo. Atentos. Y sí, efectivamente los datos fluyen
exactamente como los queríamos. Este es un usuario activo, por lo que podemos ver que este ítem se
muestra en la salida, ¿verdad? Sólo para mi referencia, déjeme ejecutarlo una vez más. El anterior buen paso. La cosa va a ir
y en las rutas, si la ejecuto ahora, Ahora, quiero que noten
algo muy importante. Siempre que los datos no estén ahí
en este asiento de Google, cuando ejecutamos el flujo de trabajo, estamos tratando de imitar
que el usuario no está presente Ya ves que el control
nunca fue a cambiar. Significa que en este caso, después de este conjunto de Google, no se
ejecutará ningún otro nodo. Eso es un gran problema, ¿no? Bueno, no es un problema
tan grande también. Es muy sencillo. Desde que
ya abrimos esto, permítame cambiarle el nombre también. Siempre debemos
renombrar nuestros nodos para que reflejen cuál es
exactamente el propósito
de ese nodo en nuestra herramienta. Esto es cosmético. Vaya a la configuración y
diga siempre datos de salida. Esto es una necesidad. Ahora si ejecutas paso
habrá algunos datos yendo. Los datos vacíos también están bien, pero al menos el control
irá al siguiente paso. Si lo ejecutamos ahora, puedes ver nuevo usuario
porque el usuario
no está presente en nuestro sistema de
todos modos. Eso es genial. Creo que si tienes clara
esta lógica tanto, te va a ir absolutamente
bien en este flujo de trabajo. Si no, entonces por favor tal vez vea esta
conferencia desde el principio, pero hay que tener muy claro lo que este interruptor
está haciendo aquí. No muy complejo, pero hay
que entender. Impresionante. Ahora, según
nuestra arquitectura, hay tres
escenarios posibles. El usuario es nuevo, siendo incorporado
o usuario activo, ¿verdad? El usuario activo es en realidad
muy sencillo. Simplemente conectaremos al usuario
activo a nuestra fábrica de noticias y
solo estarán usando nuestro producto. Pero ¿qué pasa con el nuevo usuario? ¿Qué queremos hacer con ellos si la solicitud del usuario no está
presente en nuestro asiento de Google? Bueno, cero marcas por adivinar que queremos agregar
el usuario, ¿verdad? En caso de que el usuario no esté
ya presente, agreguémoslo, ¿correcto? Hagámoslo de esta manera. Primero le notificaremos al usuario que ha
sido incorporado, le enviaremos un mensaje de texto,
¿a quién queremos enviar los Bueno, ve al gatillo del chat
y agarra el ID del chat. A esta persona, queremos enviarle un mensaje y ¿cuál
es nuestro mensaje? Bueno, ve a hacerlo grande y x. Esto es lo que vamos a enviar. Damos la bienvenida a redacción
personal y les estamos
pidiendo que envíen por mensaje de texto o voz su
preferencia para que les puedan enviar
más noticias en su propio estilo Este es un mensaje perfecto al
abordar, creo, y no solo
tenemos que detenernos aquí, sino que también agregaremos el
mensaje a nuestro Google aquí. Muy sencillo.
Déjame hacerlo rápido. Verlo, y voy a decir
see et cheat add or add or add or update rose donde
queremos actualizar a nuestra IA Hubri Asiento de usuario. Y ¿qué es lo
que queremos actualizar? Hasta el momento,
solo tendremos el ID de chat. Entonces ID de chat, podemos obtener
del disparador de Telegram, así que simplemente lo
agarraré de aquí. También podemos obtener el nombre de pila. Entonces vamos a agarrar este
también. ¿Qué más? Tal vez solo vamos a
actualizar el idioma y el usuario personal aún no nos ha proporcionado, así que no
podemos actualizar. Tampoco hay actualización puntual
durante la última actualización. Entonces para el estado, solo
diremos onboarding. Debido a que el usuario ya ha
sido agregado, vea que, ya sabe, el
estado se está subiendo a bordo. Así que la incorporación.
Ese es el estatus. Y no te olvides de esto. Tenemos que seleccionar
todo en el ID de chat, que es nuestra
clave principal en Google Set. Sí. Déjame volver a
Canvas para enviar un mensaje de texto. Voy a llamar a este nodo como usuario publicitario, y este puede ser más
refleja mejor, qué es exactamente lo que está haciendo este nodo. Suena muy bien.
Déjame guardar esto y ahora enviar mi fila por completo, quiero eliminar,
eliminar fila y
dejarme ejecutar el flujo de trabajo y enviar un simple alto a este
flujo de trabajo para que se active. Se puede ver de inmediato que
tenemos estos líos así como nuestros
datos ahora se agregan por aquí Aún no se ha proporcionado nuestro idioma
preferido, persona o categoría de noticias, obviamente no se agrega, pero lo que sea que pudiera agregar, nuestro flujo de trabajo de Antin
lo ha agregado e iniciado la
incorporación del usuario ¿Qué tan genial es eso? Seguro que ya
estás impresionado con
este trabajo y créeme, después de completar esta conferencia, estás muy cerca de hacer
este flujo de trabajo de Antin para cumplir con los requisitos de cada miembro tu familia o
tu círculo de amigos. Bueno, eso es todo por ahora. Cuídate bien. Gracias.
9. El motor de incorporación basado en texto y la normalización de datos: Bien, tenemos el pie de nuestro
usuario en la puerta. Simplemente dieron el inicio y están sentados
en nuestro asiento de Google. Pero una identificación de chat por sí sola
no hace una sala de redacción. Necesitamos conocer su alma, lo que les importa,
qué idioma hablan y la vibra que quieren. Sí. Mira el lienzo. La mayoría de los usuarios simplemente
responderán a nuestro
mensaje de bienvenida con un mensaje de texto. Hemos enviado el mensaje de
incorporación. Lo más probable es
que la gente envíe el mensaje. Como desarrollador de productos, ¿cuál es nuestro próximo objetivo? Bueno, deberíamos sintetizar los detalles necesarios
a partir del mensaje del usuario Entonces estás diciendo que si es hindi, entonces tenemos que mandar el
idioma al hindi. Han dado la vibra como diversión, así que tenemos que mirar lo que
está más cerca de la diversión. Para el hindi lo más cercano es juguetón, no el profesional. Necesitamos establecer la vibra
o la persona
en juguetona en ese caso y el usuario
se preocupa por la IA y el cricket. Entonces necesitamos establecer
la categoría de noticias a AI y cricket en
ese caso, ¿correcto? Ahora bien, como bien puedes darte cuenta, será una pérdida de esfuerzo
si escribo un programa para analizar estos detalles y sacar la
intención necesaria de esto, ¿verdad? Porque hay alguna
alternativa mejor disponible. Bueno, tienes maldita razón. Estamos hablando de un agente de IA que hace este trabajo por nosotros. Básicamente, lo que
queremos que dé son los líos y
de ahí en adelante, ese agente tiene que investigar
esta configuración de voz, hacer coincidir la intención del usuario con la configuración
que soportamos e inicializar al usuario y
básicamente cambiar el estado de
incorporación Esa es la intención que queremos hacer. Si lo tienes, estamos
en la misma página. Veamos cómo lo hacemos. Para incorporar mensajes de usuario, simplemente
agregaré un agente Lo llamaré un agente
para la incorporación de usuario
así y necesitamos definir
el sistema y el prompt del usuario Trabajemos primero en el
mensaje del sistema. Estos son los pronósticos
que he escrito. Como comentamos, este prompt se trata de pedirle al agente que utilice
esta herramienta en particular para investigar el
conjunto de Google que le hemos dado y tiene que básicamente
hacer la validación de datos, ya sea que el idioma
y el usuario personal
que está pidiendo es apoyado
por nuestro producto o no. Si no lo es, entonces
inicializará los detalles
con un valor predeterminado ¿Correcto? Entonces eso es
lo que queremos hacer. Ahora puedes leer este prompt en detalle y entender
lo que estamos haciendo. Por ahora, lo que
voy a hacer es poner este mensaje en
el mensaje del sistema, y el mensaje del usuario también es
muy sencillo. Todo lo que estamos haciendo es uh, recibir este mensaje de usuario. Y básicamente, se puede obtener del Telegram.
¿Cuál es el mensaje? Aquí el mensaje fue este. solo me desharé de éste Ahora solo me desharé de éste y
lo conseguiré directamente del Telegram,
tal vez, voy a decir que este es el mensaje del
usuario. ¿Suficientemente justo? No, no,
aquí hay una trampa porque cómo funciona
NATN, ¿verdad No voy a poder recuperar este mensaje del regger
de Telegram Entonces, lo que tenemos que hacer es
básicamente agregar un campo de conjunto O y solo diré conjunto
en preferencia de redacción. Esa es la preferencia que
viene del usuario, y aquí necesitamos obtener primero
estos mensajes de activación de Telegram. Los líos. Bien. Entonces todo lo que hemos hecho aquí es que hemos puesto un nodo
conjunto en el medio. Entonces, lo que hace es básicamente mirar el disparador de
Telegram, agarrar el mensaje y establecer esta propiedad en el JSON, ¿de acuerdo? Y una vez que el control
llegue a la
hormiga, simplemente agarrará ese valor de aquí y lo usará, ¿verdad? Entonces por qué tenemos que poner
este nodo conjunto en el medio porque AZN con las herramientas se
ejecutan en un contexto diferente, y no podrá
acceder directamente al punto de activación Entonces por eso necesitamos
esto en el medio. ¿Bien? Déjame agregar la herramienta. Entonces, ¿cuál es el nombre de la
herramienta que estamos dando? Dando soporte Loup
configuración de voz, ¿verdad? Tan bien. Voy a
agarrar la herramienta de Google Seat, ponerle el
nombre así y especificar qué asiento
estamos usando, ¿verdad? Entonces nuestra configuración está en
la configuración de voz. Así que sólo voy a especificar el asiento de Google asiento y la pestaña dentro de la cual están
nuestros datos ahí, que nosotros en
agente de embarque para consultar, y necesitamos agregar un modelo de chat. Iré con modelo de chat
al aire libre. Esta es una pregunta muy básica. No hay mucha cadena
de pensamientos involucrados en esto, así que iré con
este ChatGPT cuatro,
no cinco, en este caso Esto está bien. Vamos a
guardarlo y ejecutar el flujo de trabajo. Simplemente enviaré este mensaje
predeterminado y primer lugar esto está
bien. Ejecutarlo. Bien, el control llegó al usuario de
embarque y efectivamente, mi mensaje se pasó correctamente,
lo cual es una buena noticia. Y si, ahí vamos. Con la ayuda del
aviso que hemos dado, fue capaz de identificar el idioma, la persona
y el interés. Qué genial es eso, ¿verdad? Eso es algo que necesitábamos.
Belleza de esto es que ha seguido salida exacta que
le pedimos que ceda, ¿verdad? Esto es algo
muy bueno, muy bonito. Entonces, ¿qué es lo siguiente que tenemos que hacer? Ahora bien, si nos fijamos en esto, esta es una cadena de una sola línea. Esto es básicamente
todo por dentro. Salida. No
tengo necesariamente acceso a persona o
interés directamente. Entonces precisamente lo que tenemos que hacer es tomar los campos exactos
de esta cadena. Algo que hacemos mucho en la
codificación, ¿verdad? Así que solo voy a necesitar escribir
un pequeño código para esto, y preferiré JavaScript. Python todavía está en Beta. Y necesito poner
este código, ¿de acuerdo? Entonces Jason output, me
va a conseguir la salida, entonces solo quiero que
estos campos se escriban en el
formato que yo quiera. Y porque el usuario ha
completado el onboarding, así podemos llamarlo activo ahora, ¿verdad? Esto está bien. Entonces lo siguiente lo que tenemos que hacer es simplemente agregar los
datos al conjunto de Google. Así que agrega o actualiza Rowan sit. Yo lo llamaré actualizar datos de usuario. Y a donde irán estos datos,
irá en la
puñalada AbrisUser Así que queremos mapear
cada columna manualmente. Nuestro ID de chat es la clave principal. El nombre ya está actualizado, no quiero tocarlo,
y descansar hagámoslo. Conseguiré el ID de chat desde aquí. ID de chat, y el resto de los detalles están
disponibles en este código. El idioma es el idioma, la persona, interés entrará en la categoría de noticias y el
estado está activo. Última actualización que puedo obtener de
las variables y contexto, que es NAF déjame ir Esta bien. Déjame ejecutar el
paso. Y ahí vamos. Se ejecuta correctamente, así que debería ir a Google Seat, y se puede ver que los
datos se llenan en nuestro asiento de Google de
manera exacta como queríamos que fuera. ¿Qué tan genial es eso? Ahora bien,
lo siguiente que podemos hacer es básicamente felicitar al
usuario por una incorporación exitosa, para eso, lo que debemos hacer
es enviar un mensaje de Telegram Ese es el modo de
comunicación. Bien. Entonces déjame hacer clic aquí, agregar un Telegram, enviar
un mensaje de texto. El nombre que quiero dar
está a bordo en saludos. Esto es bueno y
¿a quién queremos enviar? Por ahora, estoy seguro de que se siente cómodo con
cómo estoy arrastrando y soltando los
detalles en este nodo, el mensaje de texto que
queremos enviar es este El usuario está listo para
usar nuestra plataforma. Si quieren enviar
mensaje bajo demanda, pueden enviar este formato
o cualquier formato, está bien. Uh, porque es el agente en el trabajo el que se
encargará de esto. De lo contrario, de todos modos enviaremos los mensajes agudos a las
ocho de la mañana. Y cómo nos aseguraremos de que el
mensaje se envíe
al usuario a las ocho de la mañana
trabajaremos para ello. No te preocupes. Te prometo que vas a
poder entender esto
tan bien como lo vas a disfrutar. ¿Sí? Bien,
déjame darle a esto también. Ejecutar paso. Sí, el mensaje debió haber sido enviado
y efectivamente lo es, ¿verdad? Entonces este el mensaje, el
usuario está a bordo, el flujo está funcionando perfectamente
bien. ¿Qué tan genial es eso? Ahora, amigos,
sé que la pantalla empieza a parecer un
plato de espagueti digital. Se está complicando
porque vamos a agregar más nodos y sólo
va a llegar un poco más
complejo poco a poco. Como instructor, me
aseguraré de que obtengas las cosas con claridad y poco a poco voy a
aumentar la complejidad. No te tiraré las cosas
en orden aleatorio. Seguro que estás
conmigo. Aún así, si
te resulta difícil
rastrear cada
conexión y la configuración de nodo
que estoy haciendo en vivo, te
he proporcionado la
versión exacta de esto. Entonces básicamente, bien, déjame descargarla y te
proporcionaré esto en esta etapa. Básicamente lo que tienes que hacer es llegar al flujo de trabajo
e importar desde archivo. Eso es todo lo que
tendrás que hacer y estos nodos serán
creados mágicamente para ti, ¿verdad Yo diría que esta es
otra forma creativa de mantenerse sincronizado
conmigo, ¿verdad? Ahora bien, en este punto, lo que les pido que
se den cuenta es lo crucial que es este usuario
onboarding Es capaz de analizar el
mensaje de los usuarios, entender la
intención y
actualizar exactamente este asiento según el requisito del
usuario, ¿verdad? Pero al hacer esto, se asegura de
que cualquier persona o lenguaje que esté asignando, de
hecho esté recibiendo el apoyo de
la configuración de voz Eso es muy, muy importante,
como usted entiende. Para nuestro flujo de trabajo.
No solo estamos enviando un mensaje. Estamos construyendo un
perfil. Pero espera. ¿Qué pasa si el usuario está manejando o qué pasa si acaba de golpear escribiendo? Deberíamos hacer algo al
respecto también. este momento estamos de
todos modos apoyando el mensaje de texto
para incorporar al usuario En la siguiente conferencia, también comenzaremos a soportar el comando
de voz del usuario. Y créeme, aunque lo estamos
haciendo un poco complejo, pero de hecho es muy importante para incrementar la
adopción de nuestro producto. Bueno, nos vemos ahí. Gracias.
10. Actualizaciones multi modales y implementación de la incorporación de mensajes de voz: Bienvenido de nuevo. Hemos
dominado los mensajes de texto, pero para construir un producto verdaderamente de
élite, tenemos que encontrarnos con el usuario donde está y
donde está a menudo
está ocupado en movimiento
y prefiriendo simplemente hablar Estamos a punto de
convertir nuestro bot en una potencia multimodal al admitir
mensajes de voz al abordar ¿Emocionado? Sí, eso es
lo que queremos. Bien, entonces empieza con Bien. Déjame minimizarlo un
poco y nos
centraremos en esta
cosa del agente un poco más tarde. Así que lo voy a poner de esta manera, no enfocarme en
éste también por ahora, así que lo voy a poner aquí. Ahora mismo, lo que
estamos diciendo es que si el usuario está subiendo a bordo, ellos enviarán el mensaje. Ese mensaje podría ser texto
o voz. Ahora bien, la voz y el texto necesitan
ser interpretados de
manera diferente, ¿verdad? Lo primero que tenemos que
hacer aquí para que nuestro flujo de trabajo sea inteligente
es agregar un nodo switch. Entonces déjame agregar aquí. Y nombre de esto
será voz o texto. Si es voz,
irá a un canal. Si es un mensaje de texto
, seguirá una ruta
diferente. Esa es la expectativa. No tiene
nada complicado, ¿verdad? Entonces voy a decir si
se trata de mensajes de texto, agregar una raíz de enrutamiento déjame
agregar un disparador de Telegram. Si se trata de mensajes de texto, disparador de
Telegram definitivamente
tendrá algo de texto por aquí. Haremos lógica
basada en eso. Si existe, significa
que es un mensaje de texto, ejecuta el paso y
está funcionando bien. Esto es bueno. De todos modos
funcionaba bien antes también Ahora déjame mandar un mensaje de voz. Pero antes de hacer eso, necesito cambiar
esto al
estado de incorporación para que ese mensaje
efectivamente llegue aquí Si está activo,
definitivamente entrará en una ruta completamente
diferente. Ahora voy a enviar un mensaje de voz. Quiero la noticia en inglés, hacerla profesional, y me
importa mucho la ciencia. Algunos mensajes que he enviado. guardar y ejecutar el flujo de trabajo. Bien. Llegó aquí, pero no fue después de esto, ¿
verdad? A ver. Sí. Entonces no había texto
en él y
no había ruta sin él,
no iba a ningún lado. He hecho esto
exactamente para imitar esto porque quería
esta identificación de voz Entonces ID de archivo es esto. Y si existe, si existe, entonces
es un mensaje de voz. Muy sencillo,
muy inteligente. Déjame hacerlo
así, ejecutar paso. Y, si se trata de mensajes de voz, entrará en esta ruta. Si es mensaje de texto,
entrará en esta ruta. Sólo por mirar y
sentir quiero hacer una voz primero y después
mensajes de texto, esto es bueno. Esto suena bien. Si
es mensaje de texto , seguirá esta ruta. Si es mensaje de voz
, seguirá otra ruta. Bueno. Ahora bien esto es soberbio, pero ¿y si es
un mensaje de voz? ¿Se lo podemos dar directamente a
nuestro agente? No, nuestro modelo ChatGPT es bueno para el procesamiento de
mensajes de texto, pero no logrará entender
el audio, ¿no? Entonces necesitamos primero
descargar el archivo y dárselo a un modelo que
entienda la voz, ¿correcto? Entonces primero descarguemos el archivo y
lo haremos yendo a Telegram. Obtener un archivo, no un archivo de descarga, lo siento. Obtener un archivo. Qué archivo es el mismo archivo cuyo archivo
ID hemos guardado aquí. Así que consigue esto y descarga el
archivo. Eso es lo que queremos. Bien. Exactamente. Esto es bueno. El archivo se está descargando. Lo siguiente que tenemos que hacer es
convertir esta voz en texto. Diré OpenAI. Necesitamos hacer una llamada OpenAI y lo que queremos hacer
es transcribir el archivo Transcribir una grabación. Tiene que coincidir con estos datos. Sí, el campo de entrada está bien. Voy a golpear esta ejecución. Mi cuenta ya está conectada,
y puedes ver esto. Ese es el mensaje que envié justo frente a ti hace un
par de minutos. Y OpenAI es capaz de detectar ese mensaje y
darnos el texto Qué genial. Esto ayuda mucho. Ahora podemos darle de
nuevo este
texto al mismo agente y hacer que funcione también con comando de
voz. Básicamente, no estamos usando otro agente solo
para este requisito. Entonces, para fusionar esta voz
y texto en un solo medio, usaremos el nodo merge, y desconectaré esto. Agrego el mensaje de texto
también
solo a este nodo de fusión y luego lo doy para establecer la
preferencia de embarque. Bien. Básicamente lo que queremos hacer es si el mensaje
es de voz o texto, conseguir que se fusione aquí y antes de ir al agente de
onboarding, debería verse como uno Esa es la pregunta aquí y luego en la preferencia de incorporación,
déjame ejecutar esto Anteriormente habíamos establecido esta preferencia de
incorporación solo para leer el mensaje de texto de
Telegram Pero ahora también tenemos mensajes
provenientes del audio. Necesitamos crear una condición
o aquí. Voy a recibir este mensaje y
simplemente cortar este corte esto, eliminar aquí, ir a este
Javascript, pegarlo aquí. Y golpear. Eso es. Si el mensaje viene del audio, tomará esto más
que tomará del disparador
de Telegram,
lo cual está bien. Es bueno. Agradable y
resto del mensaje, descansar nada necesitamos cambiar. Simplemente ejecutaré esto y
ejecutaré a este agente también. A ver, sí, efectivamente
es capaz de reconocer al profesional
inglés y a
mi interés por la ciencia. Eso es bueno. Significa resto del
flujo que no necesitamos tocar. Funcionará exactamente
de la misma manera. Yo solo, ¿por qué es
este polo y todo eso? Bien. ¿Qué es esto? Bien. Porque estaba
moviendo el texto a un poco este lado para mantener la pantalla menos
ocupada para ti, ¿verdad? Eso es
esfuerzo adicional que estoy poniendo. Por favor, aprecie eso, hombre. Bien, déjame ejecutar esto. Ahora el texto se debe
pasar de la manera que queramos, y lo siguiente que queremos hacer es agregar los datos al asiento de Google. Sí, trabajando como Msic y
luego enviar el mensaje de texto. Al usuario de Telegram. Cada unidad se está uniendo
y trabajando como un solo equipo. Ese es el poder de la
hormiga y el flujo de trabajo, y ese es el poder de la IA
Generativa, diría yo Ahora bien, en caso de que se
esté preguntando por qué estamos teniendo esta fusión
y este nodo conjunto, básicamente, si la entrada era texto o una transcripción de voz, ambos
deberían reunirse
en este nodo de fusión En esta sesión, hemos
introducido el soporte para comandos de voz para la
incorporación de un usuario Entonces, usar OpenAI es el modelo
Whisper y este nodo de fusión se está asegurando de que si la entrada era texto
o una transcripción de voz, ambos
se encuentran en el nodo Mrs Esta es una ingeniería hermosa. Hemos canalizado dos formas
diferentes de comunicarnos en una
sola corriente de verdad Sí. Luego usamos preferencia de incorporación
establecida
para mantener nuestros datos limpios y pasarlos a nuestro agente de usuario de
incorporación Ahora, permítanme poner poco esfuerzo para que nuestra pantalla sea
menos abarrotada Entonces, como quiero hacer es esto, y esto tiene que estar
aquí, y esto. Esto me encanta, por cierto. Después de poner mucho esfuerzo
en construir algo, es totalmente aceptable hacer algún esfuerzo para que se
vea más presentable Sí, espero estoy seguro que estés de acuerdo con
sticky, agrega una nota adhesiva. Cambia el color.
Preferiré éste. No. Cambia de color a
éste, quizá. Llamémoslo agente de registro
e incorporación. Ese es un buen nombre. Hazlo grande y todo
está agrupado dentro de esto. Lo que estamos haciendo aquí incluso agregando al usuario fue
parte de la incorporación Se le puede llamar registro o entrada inicial o cualquier cosa, pero también fue parte
del onboarding solamente.
Eso lo hemos hecho. Después de eso, el usuario enviando las preferencias y
guardarlas es nuevamente, parte de la incorporación Lo estamos nombrando como agente de registro
e incorporación, y esto hará que se
vea mejor para usted Ahora bien, si hago esto, tengo que
traer este aquí porque había guardado a un lado
porque queríamos enfocarnos en agente de registro
e incorporación Pero que hemos completado
maravillosamente ahora, así que es el momento de centrarnos en la fábrica de podcasts de
noticias una
vez más para producir las noticias reales. Sí. Pero antes de seguir adelante, estoy descargando y poniendo a tu disposición
este flujo de trabajo en este
estado. En caso de que te haya resultado
difícil seguirme, solo
puedes importar este
archivo a este flujo de trabajo, y estaremos
sincronizados una vez más. Sí. Bien, el
registro está completo, el usuario está en el sistema. Ahora es el momento de comenzar a
producir las noticias reales. Pasemos al motor de noticias en la próxima sesión.
Nos vemos ahí.
11. Convertir el caos en estructura: el traductor "Editar campos": Oye, ahí, una cálida
bienvenida a esta sección. Hemos integrado con éxito
a nuestros usuarios. Tienen un perfil, un
idioma y una vibra. Pero ahora viene la parte
más importante, dándoles las noticias, su podcast de noticias personalizado, que anhelan Trabajemos hacia
eso en esta sesión. Seguro que estás entusiasmado. Sí. Bien. Mira esto. Al completar la
incorporación, compramos soporte tanto para mensajes de texto como
de voz La buena noticia es que
definitivamente queremos traer este soporte cuando un usuario está
pidiendo la noticia real. No queremos que
ellos quieran escribir que les interesa la ciencia
generativa
y las noticias de fútbol, o pueden mandar un
mensaje de voz para lo mismo, ¿verdad La buena noticia es que no
va a ser reelaborado. Sólo tendremos que copiar y pegar. Yo sólo voy a hacer Control
D en este caso. Todavía lo estoy haciendo
uno por uno para ti. Este mensaje llegará hasta
aquí y voz o texto. Consulta, Ls. No me gusta
esta consulta de voz o texto. Nombrar es algo que todos
pueden hacer mejor que yo. Consulta de voz o texto. Entonces otra vez, igual que antes, tendremos que hacer esto. Yo haré Control D, está aquí, y hay
que ponerlo así. Si se trata de mensajes de voz, obtenga el archivo y
transcriba la noticia Esto es bueno. En primer lugar, categorizaremos si el usuario ha enviado un mensaje de voz o mensajes de texto con
intención para las noticias, y luego obtendremos el archivo, transcribiremos la grabación
tal como lo hicimos antes, y luego enviaremos
el mensaje al agente de IA Bien. Ahora, hay algunos difíciles. Ahora bien, este concepto un poco
complicado aquí. Quiero que entiendas primero
el reto para que cuando trabajemos
hacia la resolución, tengas idea justa por qué lo
estamos haciendo de cierta manera, News podcast factory es una, pero la forma de invocar
podría ser múltiple El usuario puede enviar un mensaje de voz, el usuario puede enviar un mensaje de texto. O también
les hemos prometido entregar un podcast de noticias cada
ocho de la mañana. El mismo agente tiene que ser
alimentado con datos de diferentes maneras. A veces lo obtendremos
del asiento directamente porque el
mensaje está programado uno, el usuario nunca envía nada. A veces desde la voz y
otras por el texto. Esto es comprensible.
Ahora bien, para que suceda
a escala en NA diez, tenemos que usar el nodo set. Permítanme ejecutar el
flujo de trabajo para ejecutar estos nodos perfectamente para que tengamos datos mientras
agregamos los nodos adicionales. Déjame ejecutarlo, y
voy a decir noticias de fútbol en 2026 Aquí está el texto. Esto es bastante bueno. Ahora
necesitamos agregar un campo conjunto aquí. Llamaremos a esta intención de noticias
recibida en modo voz, y diremos que
queremos agregarla manualmente. Necesitamos buscar
la consulta de búsqueda, que es este texto muy fácil, así
como también necesitaremos
obtener el ID de chat Entonces lo llamaré chat ID interno y lo
obtendremos de Telegram. Entenderás perfectamente cuando lo
cosimos con el agente de IA. Entonces esto es lo que tenemos que hacer. Ahora, lo mismo tenemos que
repetir para el mensaje de
texto también. Entonces, en interés del tiempo, lo
haré yo mismo. Estoy haciendo una pausa en la grabación, ¿de acuerdo? Bien. Aquí está. Básicamente, lo que hemos hecho es, si el usuario envía un mensaje de texto, obtendremos la
consulta de búsqueda y obtendremos el ID de chat interno
con este valor. Y, uh, esto está bien. Entonces esto es algo aquí. Esto es hermoso. Ahora ya estamos casi ahí. A continuación, lo que tenemos que hacer
es agregar otro nodo conjunto, y ahora estamos haciendo
la normalización. Apenas una repetición de esto, tengo consulta de búsqueda y los datos van a venir de la búsqueda directamente
del JSON, así
como tengo otro
campo para chat ID interno al que
vendrán los datos. ID de sombrero interno. suposición es si el usuario ha enviado mensajes de texto o
mensajes de voz, no me importa. Al llegar hasta aquí, se
ha convertido en uno. Ahora es uniformado. Esto es lo que
llamamos normalización. Ahora lo siguiente que tenemos que
hacer es investigar el conjunto de Google una vez más y obtener las preferencias del usuario
en función del ID de chat que
hemos recibido. Consigue a Rose. Nuestro set es Cabri AI y es puñalada de usuario en la que
tenemos que mirar Aquí, agreguemos un filtro. Queremos investigar el ID de
chat donde
coincide con el ID de chat de Jason. Viniendo del campo anterior. Ejecutar nodo anterior. Ejecutemos el
nodo anterior. Ahí está esta ID de chat. Eso es algo que
necesitamos arrastrar y soltar y cuando ejecutemos, seguirá adelante y
obtendrá los datos
del Google Seat funcionando
como Mzic nuevamente Déjame cambiar el nombre de esto
para buscar usuario. Otro nodo que
queremos recuperar es C, al obtener los datos
de la puñalada
del usuario, tenemos la persona
y esta categoría de noticias Todavía tenemos que obtener la
configuración de voz para esto. Como, ¿cuál es el nombre del
ancla? ¿Cuál es el
nombre del ancla dos, su identificación de voz? Todos estos detalles los tenemos que
obtener de la
configuración de voz. Obviamente, se preguntaría por qué no poner estos datos también
en esta pestaña solamente. Bueno, amigo mío, es necesario
porque no queremos no repetir
las mismas identificaciones de voz para cada usuario varias veces. Mañana, si quieres
hacer un cambio en esto, este es un solo lugar donde simplemente puedes
hacer el cambio. Si se trata de usuarios,
entonces hay que hacerlo en varios lugares, no es bueno. Por eso tenemos que
manejar los dos grifos, si acaso estás pensando
que es solo trabajo aburrido. Se necesita, por favor
tengan un buen cuidado conmigo. Ponte como en el asiento y esta vez
vamos a buscar las voces
así que busquen Y de donde sacamos
las voces de Cabri AI, y
¿cuál es la ficha? Es configuración de voz. Ahora, los datos del usuario
están disponibles con nosotros, ¿verdad? Así podemos hacer los filtros
alrededor de esto muy fácilmente. El idioma tiene que ser
el idioma del usuario. ¿Bien? Después agrega otro filtro. Persona tiene que ser
la especificada por el usuario. Y eso es todo. Con estos dos filtros, podrá identificar exactamente qué voz de anclaje y, ya
sabes, nos interesa. Entonces esto es bueno.
Déjame golpear Ejecutar. Y ya ves, sí. Entonces ingleses y profesionales, estos son mágicos en
la fila número cinco. Entonces sí, ahí está. Básicamente, el usuario está preguntando
por Brian y Sarah, en estas voces,
esa es la magia. Bien, estamos todos
preparados para enviar estos datos a nuestro agente de IA y hacer nuestro show desnudo
personalizado. Entonces déjame conectarme a esto. Y hay algunos
cambios necesarios en el aviso del agente de IA desde antes hasta ahora porque muchas cosas que
hemos hecho ahora, ¿verdad? Tenemos que dar cabida a esos. Entonces aquí están los problemas actualizados de
usuario y sistema que necesitamos actualizar
dentro de nuestro agente Básicamente, esta es
la solicitud entrante que llega a nuestro agente, y estos son los intereses de
los usuarios, derecho , categoría de
noticias, etcétera vienen del
asiento de Google que tenemos que alimentar
a nuestro agente para obtener el programa de
noticias personalizado, ¿verdad? Todos estos
cambios puntuales son para apoyar las nuevas características
que estamos aportando para aumentar la
adopción con Google Seat entrando soporte de audio y mensajes de texto y
voz,
incorporación, etcétera, trayendo
algo de complejidad extra, que tiene que manejarse
dentro del prompt, Permítanme copiar y pegar
esto a nuestro aviso de agente. Como pueden ver las noticias de
fútbol en 2026, ese es el mensaje que
queríamos enviar al agente, y es correcto que
viene por aquí Lo cual es una buena señal.
Déjame ejecutarlo ahora. Y ahí vamos. La herramienta fue invocada por
el agente y ha hecho el trabajo necesario para crear un podcast de noticias de fútbol para nosotros. Eso es exactamente lo que
queríamos lograr, ¿correcto? Bueno, ya casi terminamos. La mayoría de las características
que planeamos
ya están entregadas.
Esta es una buena noticia. Solo
nos queda una característica. Qué tal enviar este podcast
personalizado diariamente ocho de la mañana a los usuarios para que
puedan consumir y
queremos traer esa sonrisa en el rostro de nuestra
familia y amigos. Vamos a implementarlo en
muy próxima sesión. Ver ahí. Gracias.
12. La entrega del tiempo: programación automatizada de shows matinales: Oye, ahí. Bienvenidos
a esta sesión. Hemos construido el cerebro, los oídos y la memoria. Pero ahora vamos a
sumar el corazón. Piensa en esto por qué
iniciamos este viaje. No fue sólo para ver los nodos
ponerse verdes en la pantalla. Era para traer una sonrisa a
nuestra familia y amigos. Imagina a tu papá, a tu hermana o a tu mejor amiga
despertando ante una notificación Golpean play y escuchan un show de desnudos
profesionales de alta calidad diseñado específicamente para ellos en su idioma sobre
el tema que aman. Sin desplazamiento, sin ruido,
solo valor puro. No es que vamos a detener los mensajes de texto o voz, es solo que queremos
agregar más valor
a nuestro flujo de trabajo. Para esto, ¿a qué
estamos esperando? Vamos a implementarlo de inmediato. Solo agregaré el disparador de horario. Y con qué frecuencia queremos
programar tal vez todos los días 8:00 A.M. Seré
activado automáticamente a cada día 8:00. En caso de que las 8:00 A.M. sea
temprano en la mañana para mí, pero si quieres
afinarlo más, esa es tu elección por completo. Horario disparador no vayas de ese
lado, tú vienes aquí. Bien. O disparador programado. Ahora el disparador programado, si bien es muy interesante
funcionará de manera diferente. Tiene que escanear a todos los usuarios. Los usuarios que estén incorporados
estarán omitiendo esto, pero el usuario que esté activo en nuestro sistema tiene que ser elegido y de acuerdo a su idioma y categoría de noticias de persona, etcétera, tenemos que crear el podcast y
enviarles Un nuevo podcast para cada
nuevo miembro, ¿verdad? Eso es algo que prometemos. Entonces agreguemos esto
usando Google Seat. No hay datos
provenientes del usuario, tenemos que confiar en lo que
tenemos en nuestro Google Seat. Esa es la razón por la
que queríamos construir esta memoria
permanente. Seguro que te está gustando esta
forma de conectar los puntos. Seleccionaré Cabri AI, seleccionaré los usuarios,
seleccionaré Filtrar El estado debe estar activo. Si no estás activo en nuestro sistema,
te falta mucho. Y hay ocho artículos
que satisfacen esta condición. Aunque tenemos
más que esto en nuestro set, pero sólo ocho de
ellos están activos. Por lo que necesitamos enviar
noticias personalizadas a cada uno de esos. Por la inclusión de estos nodos establecidos, ya lo
hemos
hecho muy fácil. Solo agregaré un campo establecido, y esta vez
lo llamaremos intención de Programar Noticias. La consulta de búsqueda será un valor
codificado duro esta vez. Será agendar briefing porque
no hay consulta de búsqueda, pero aún así queremos
usar el mismo agente. Tenemos que crear este campo, pero tendremos un valor codificado
duro para ello y ya
le hemos pedido
al agente que utilice el interés del usuario en
caso de que se
proporcione una sesión informativa de programación como consulta de búsqueda. En el momento en que el agente
vea
esto, sabrá que solo tiene que
obtener los datos de
Google Seat. No hay preferencia por
parte del usuario que entra. ¿Cuál es el ID de chat interno? Hat ID interno será ID de
chat viniendo aquí. Esto viene del sit de
Google en esta ocasión. Muy fácil Ejecutar paso
y tenemos los datos. Si tenemos estos datos, igual que los hemos hecho
por intención de voz y texto, podemos darle este
también para formatear intención de
búsqueda para que los datos se
puedan dar al agente. Me perdí esto antes.
Déjame ponerlo de esta manera. Ya ves, incluso buscar usuario y buscar voz está funcionando de
la fábrica interna de noticias Realmente no depende de si se trata de mensajes de voz
o de texto. Es estrictamente
parte central del agente. Entonces quiero traerlo
dentro de esto y ya está. Mira esta belleza ahora. Ahora tenemos soporte bot
para texto de voz, así
como mensajes programados. Sin que un usuario tenga que
pedir el podcast, éste se entregará
automáticamente en sus mañanas y hará que
sus mañanas ¿Qué rizo es eso? Por favor, importa este flujo de trabajo en tu antin
y no olvides probarlo. Y en caso de que seas más
perezoso de lo que puedo imaginar, volvamos a conectarnos
una vez más, y probaremos
todas estas características
y nos aseguraremos de que las cosas estén
en perfecto orden. Siéntate ahí. Cuídate.