Avatar-Agenten in Echtzeit: Was in ihnen steckt
Für einen Kunden haben wir Avatar-Agenten gebaut, die in Echtzeit mit Nutzern sprechen. Das ist die Architektur: eigener System-Prompt, RAG über das Unternehmenswissen, Stimme und Latenz-Engineering.
Ein Avatar-Agent ist ein Assistent mit Gesicht und Stimme: Der Nutzer spricht, der Avatar hört zu, denkt und antwortet in Echtzeit, mit Gesten und Lippensynchronisation. Wir haben einen für einen Kunden gebaut, und er läuft in Produktion. Dieser Artikel erklärt, was darin steckt, ohne Küchengeheimnisse, aber mit der Ehrlichkeit von jemandem, der mit jedem Teil gerungen hat.
Die Teile
So ein Agent besteht aus fünf koordinierten Systemen:
- Sprache zu Text (STT): transkribiert den Nutzer, während er spricht, im Streaming.
- Das Gehirn (LLM + System-Prompt): entscheidet, was zu antworten ist.
- Retrieval (RAG): versorgt das Gehirn mit dem Wissen des Unternehmens.
- Text zu Sprache (TTS): macht aus der Antwort Audio mit einer konsistenten Stimme.
- Der Avatar: rendert Gesicht, Gesten und Lippensynchronisation zu diesem Audio.
Jedes Teil funktioniert für sich in jeder Demo. Das eigentliche Projekt ist, sie zusammen funktionieren zu lassen, schnell und ohne Unsinn zu reden.
Der System-Prompt: Persönlichkeit ist Ingenieursarbeit
Der System-Prompt definiert, wer der Agent ist: was er weiß, was er nie tun darf, wie die Marke spricht, wann er zugeben soll, dass er etwas nicht weiß, und wann er an eine Person übergibt. Einige Erkenntnisse:
- Zuerst die Grenzen. Bevor Sie „du bist ein freundlicher Assistent" schreiben, schreiben Sie, was verboten ist: Preise versprechen, Richtlinien erfinden, die Konkurrenz kommentieren, den eigenen Bereich verlassen.
- Beispiele statt Adjektive. „Herzlicher, professioneller Ton" bedeutet für ein Modell nichts. Drei Beispiele gut beantworteter Fragen sind mehr wert als ein Absatz voller Adjektive.
- Versionierung und Regressionen. Jede Prompt-Änderung durchläuft eine Batterie von Testfragen. Eine harmlose Tonanpassung kann eine mühsam justierte Sicherheitsgrenze brechen.
RAG: Antworten mit Ihrem Geschäft, nicht mit dem Internet
Ohne Retrieval antwortet das Modell aus seinem Allgemeinwissen und klingt wie eine Broschüre. Mit RAG indexieren wir das Wissen des Kunden (Katalog, Richtlinien, FAQ, interne Dokumentation) in einer Vektordatenbank; jede Frage holt die relevanten Fragmente, und das Modell antwortet in dieser Basis verankert.
Die Details zählen mehr, als es scheint: wie Dokumente zerlegt werden, welche Metadaten zum Filtern gespeichert werden, und was der Agent tut, wenn das Retrieval nichts findet (die richtige Antwort ist, es zuzugeben und den menschlichen Kontakt anzubieten, nicht zu improvisieren).
Die Latenz regiert
Im Text verzeiht man zwei Sekunden Wartezeit. In einem Gespräch mit Stimme und Gesicht fällt eine halbe Sekunde Stille auf, und zwei Sekunden zerstören die Illusion. Das ganze Design dreht sich darum:
- Streaming in jeder Stufe: Transkription läuft, während der Nutzer spricht, das Modell beginnt zu antworten, bevor der volle Text existiert, TTS synthetisiert satzweise, und der Avatar startet mit dem ersten Audiofragment.
- Gestufte Modelle: ein kleines, schnelles klassifiziert und beantwortet das Triviale; das große kommt nur bei substanziellen Fragen zum Einsatz.
- Ein Millisekunden-Budget pro Teil, gemessen in Produktion, nicht in der Demo.
Leitplanken und Übergabe an Menschen
Ein öffentlich sichtbarer Agent braucht: Filter für Ein- und Ausgabe (verbotene Themen, personenbezogene Daten), eine Konfidenzschwelle, unter der er nicht improvisiert, vollständige Gesprächsprotokolle zur Überprüfung und einen sichtbaren Knopf „mit einer Person sprechen". Das Ziel ist nicht, dass der Agent alles löst: Er soll das Häufige lösen und das Schwierige gut weiterleiten.
Wann lohnt es sich?
Ein Avatar-Agent lohnt sich, wenn es ein Volumen repetitiver Gespräche mit echtem Wert gibt (First-Level-Support, Vertriebsqualifizierung, geführtes Onboarding) und eine Marke, der ein Gesicht etwas bringt. Für ein Kontaktformular ist er überdimensioniert: Ein Textassistent mit RAG liefert 80 % des Werts für einen Bruchteil der Kosten.
Wenn Sie so etwas erwägen (mit oder ohne Avatar), sprechen wir. Wir sind den ganzen Weg gegangen: System-Prompt, RAG, Stimme und Produktion, und wir wissen, wo die Schlaglöcher sind.