Retour au blog
Intelligence artificielle15 juillet 20264 min readKrokanti Software

Agents avec avatar en temps réel : ce qu'il y a dedans

Nous avons construit pour un client des agents avatarisés qui parlent aux utilisateurs en temps réel. Voici l'architecture : system prompt sur mesure, RAG sur la connaissance de l'entreprise, voix et maîtrise de la latence.


Un agent avec avatar est un assistant doté d'un visage et d'une voix : l'utilisateur parle, l'avatar écoute, réfléchit et répond en temps réel, avec gestes et synchronisation labiale. Nous en avons construit un pour un client et il tourne en production. Cet article explique ce qu'il y a dedans, sans secrets de cuisine mais avec l'honnêteté de qui s'est battu avec chaque pièce.

Les pièces

Un tel agent, ce sont cinq systèmes coordonnés :

  1. Voix vers texte (STT) : transcrit l'utilisateur pendant qu'il parle, en streaming.
  2. Le cerveau (LLM + system prompt) : décide quoi répondre.
  3. Récupération (RAG) : fournit au cerveau la connaissance de l'entreprise.
  4. Texte vers voix (TTS) : transforme la réponse en audio avec une voix cohérente.
  5. L'avatar : rend le visage, les gestes et la synchronisation labiale sur cet audio.

Chaque pièce fonctionne seule dans n'importe quelle démo. Le vrai projet, c'est de les faire fonctionner ensemble, vite, sans dire de bêtises.

Le system prompt : la personnalité est un travail d'ingénierie

Le system prompt définit qui est l'agent : ce qu'il sait, ce qu'il ne doit jamais faire, comment parle la marque, quand il doit reconnaître qu'il ne sait pas et quand passer la main à une personne. Quelques enseignements :

  • Les limites d'abord. Avant d'écrire « tu es un assistant aimable », écrivez ce qui lui est interdit : promettre des prix, inventer des politiques, commenter la concurrence, sortir de son périmètre.
  • Des exemples, pas des adjectifs. « Ton chaleureux et professionnel » ne veut rien dire pour un modèle. Trois exemples de question bien traitée valent plus qu'un paragraphe d'adjectifs.
  • Versions et régressions. Chaque changement de prompt passe une batterie de questions de test. Un réglage de ton anodin peut casser une limite de sécurité difficile à obtenir.

RAG : répondre avec votre métier, pas avec internet

Sans récupération, le modèle répond avec sa connaissance générale et sonne comme une brochure. Avec le RAG, nous indexons la connaissance du client (catalogue, politiques, FAQ, documentation interne) dans une base vectorielle ; chaque question récupère les fragments pertinents et le modèle répond ancré dans cette base.

Les détails comptent plus qu'il n'y paraît : comment les documents sont découpés, quelles métadonnées servent au filtrage, et ce que fait l'agent quand la récupération ne trouve rien (la bonne réponse est de l'admettre et de proposer le contact humain, pas d'improviser).

La latence commande

À l'écrit, deux secondes d'attente se pardonnent. Dans une conversation avec voix et visage, une demi-seconde de silence se remarque et deux secondes tuent l'illusion. Toute la conception tourne autour de cela :

  • Streaming à chaque étape : la transcription se fait pendant que l'utilisateur parle, le modèle commence à répondre avant d'avoir tout le texte, le TTS synthétise phrase par phrase et l'avatar démarre avec le premier fragment audio.
  • Modèles étagés : un petit et rapide classifie et répond au trivial ; le grand n'intervient que sur les questions de fond.
  • Un budget de millisecondes par pièce, mesuré en production, pas en démo.

Garde-fous et passage à l'humain

Un agent face au public a besoin : de filtres en entrée et en sortie (sujets interdits, données personnelles), d'un seuil de confiance sous lequel il n'improvise pas, d'un journal complet des conversations pour révision, et d'un bouton visible « parler à une personne ». L'objectif n'est pas que l'agent résolve tout : c'est qu'il résolve le fréquent et route bien le difficile.

Quand est-ce rentable ?

Un agent avatarisé se justifie quand il y a un volume de conversations répétitives à valeur réelle (support de premier niveau, qualification commerciale, onboarding guidé) et une marque à qui un visage apporte quelque chose. Pour un formulaire de contact, c'est disproportionné : un assistant textuel avec RAG donne 80 % de la valeur pour une fraction du coût.

Si vous envisagez quelque chose de ce genre (avec ou sans avatar), parlons-en. Nous avons parcouru le chemin complet : system prompt, RAG, voix et production, et nous savons où sont les nids-de-poule.