Agentes con avatar en tiempo real: qué llevan por dentro
Hemos construido agentes avatarizados que hablan con usuarios en tiempo real para un cliente. Esta es la arquitectura: system prompt propio, RAG sobre el conocimiento de la empresa, voz y control de latencia.
Un agente con avatar es un asistente con cara y voz: el usuario habla, el avatar escucha, piensa y contesta en tiempo real, con gestos y sincronía labial. Hemos construido uno para un cliente y funciona en producción. Este artículo explica qué lleva por dentro, sin secretos de cocina pero con la honestidad de quien se ha peleado con cada pieza.
Las piezas
Un agente así son cinco sistemas coordinados:
- Voz a texto (STT): transcribe al usuario mientras habla, en streaming.
- El cerebro (LLM + system prompt): decide qué contestar.
- Recuperación (RAG): le da al cerebro el conocimiento de la empresa.
- Texto a voz (TTS): convierte la respuesta en audio con una voz consistente.
- El avatar: renderiza cara, gestos y sincronía labial sobre ese audio.
Cada pieza funciona sola en cualquier demo. El proyecto real es hacerlas funcionar juntas, rápido y sin decir tonterías.
El system prompt: la personalidad es trabajo de ingeniería
El system prompt define quién es el agente: qué sabe, qué no debe hacer nunca, cómo habla la marca, cuándo debe reconocer que no sabe y cuándo derivar a una persona. Algunas cosas que aprendimos:
- Los límites primero. Antes de escribir "eres un asistente amable", escribe lo que tiene prohibido: prometer precios, inventar políticas, opinar de la competencia, salirse de su ámbito.
- Ejemplos, no adjetivos. "Tono cercano y profesional" no significa nada para un modelo. Tres ejemplos de pregunta y respuesta bien resuelta valen más que un párrafo de adjetivos.
- Versionado y regresiones. Cada cambio del prompt pasa por una batería de preguntas de prueba. Un ajuste inocente de tono puede romper un límite de seguridad que costó afinar.
RAG: que responda con tu negocio, no con internet
Sin recuperación, el modelo contesta con su conocimiento general y suena a folleto. Con RAG, indexamos el conocimiento del cliente (catálogo, políticas, preguntas frecuentes, documentación interna) en una base vectorial; en cada pregunta se recuperan los fragmentos relevantes y el modelo responde citando esa base.
Los detalles que importan más de lo que parece: cómo se trocean los documentos, qué metadatos se guardan para filtrar, y qué hace el agente cuando la recuperación no encuentra nada (la respuesta correcta es admitirlo y ofrecer el contacto humano, no improvisar).
La latencia manda
En texto, dos segundos de espera se perdonan. En una conversación con voz y cara, medio segundo de silencio ya se nota y dos segundos matan la ilusión. Todo el diseño gira alrededor de eso:
- Streaming en cada etapa: se transcribe mientras el usuario habla, el modelo empieza a responder antes de tener el texto completo, el TTS sintetiza por frases y el avatar arranca con el primer fragmento de audio.
- Modelos por capas: uno pequeño y rápido clasifica y responde lo trivial; el grande entra solo en preguntas de fondo.
- Presupuesto de milisegundos por pieza, medido en producción, no en la demo.
Guardarraíles y salida a humanos
Un agente de cara al público necesita: filtros de entrada y salida (temas vetados, datos personales), un umbral de confianza por debajo del cual no improvisa, registro completo de conversaciones para revisión, y un botón visible de "hablar con una persona". El objetivo no es que el agente lo resuelva todo: es que resuelva lo frecuente y derive bien lo difícil.
¿Cuándo compensa?
Un agente avatarizado compensa cuando hay volumen de conversaciones repetitivas con valor real (soporte de primer nivel, cualificación comercial, onboarding guiado) y una marca a la que le aporta ponerle cara. Para un formulario de contacto, es matar moscas a cañonazos: un asistente de texto con RAG da el 80% del valor por una fracción del coste.
Si te planteas algo así (con avatar o sin él), hablemos. Ya hemos recorrido el camino completo: system prompt, RAG, voz y producción, y sabemos dónde están los baches.