Zuletzt aktualisiert: 25. September 2026 · Version: 1.1
Redaktionshinweis: Dieser Artikel wurde mit KI-Unterstützung recherchiert und redaktionell überarbeitet. Produkt- und Leistungsangaben stammen überwiegend von Google; unabhängige Vergleichsdaten aus produktiven DACH-Einsätzen liegen zum Start nur begrenzt vor. Funktionen können je nach Tarif, Region, Client und Freigaben des Unternehmens abweichen. Quellenstand: 25. September 2026. Die technische Evidenz zu Live Avatar stammt bislang vorwiegend vom Anbieter; unabhängige DACH-Betriebsdaten liegen nicht vor.
In 30 Sekunden
- Google hat am 24. September 2026 „Gemini 3.8 Live with Live Avatar“ für Gemini Enterprise allgemein verfügbar gemacht. Eigene Avatare erfordern eine gesonderte Freigabe.
- Das Modell koppelt einen Sprachdialog mit synchronisiertem Avatarvideo. Google nennt 24 Bilder pro Sekunde für die Ausgabe und 97 unterstützte Sprachen.
- Die Modellkarte begrenzt fortlaufende Avatarinteraktionen auf wenige Minuten und nennt Halluzinationen sowie gelegentliche Verzögerungen als Risiken.
- Für Unternehmen zählt der Nachweis, dass ein sichtbarer Avatar den konkreten Vorgang verbessert. Audio- und Videokosten, Einwilligung, Datenflüsse und Übergabe an Menschen gehören in denselben Pilot.
Empfehlung für den Start: Einen begrenzten Anwendungsfall mit vorgefertigtem Avatar wählen, etwa eine geführte Produkterklärung. Gegen eine reine Sprachvariante testen: Abschlussquote, Verständlichkeit, Abbruchrate, Kosten je abgeschlossener Aufgabe und Übergaben an Mitarbeitende. Erst danach eigene Bild- oder Stimmvorlagen und schreibende Backend-Aktionen prüfen.
Ein Sprachagent kann eine Antwort geben. Ein Live Avatar gibt ihr zusätzlich ein Gesicht. Für Digital- und Serviceverantwortliche entsteht daraus eine konkrete Investitionsfrage: Hilft die visuelle Präsenz dem Kunden bei einer Aufgabe, oder erhöht sie nur Kosten, Komplexität und Erwartungen? Googles neue Funktion macht diese Entscheidung erstmals innerhalb der Gemini-Enterprise-Live-Architektur prüfbar. Sie ersetzt die fachliche und wirtschaftliche Prüfung nicht.
Was Google vorgestellt hat
Google nennt die Neuerung Gemini 3.8 Live with Live Avatar. Sie erweitert das bereits eingeführte Echtzeitmodell gemini-3.8-live um generiertes, zur Sprache synchronisiertes Video. In der Ankündigung für Unternehmen meldet Google allgemeine Verfügbarkeit in Gemini Enterprise sowie US- und EU-Endpunkte. Die separate Variante Extended Thinking befindet sich laut derselben Ankündigung weiterhin in einer privaten Vorschau.
Die Entwicklerdokumentation nennt 24 Bilder pro Sekunde für das ausgegebene Avatarvideo. Eingehendes Kameravideo wird dagegen in der Modellspezifikation mit einem Bild pro Sekunde beschrieben. Die beiden Zahlen betreffen verschiedene Richtungen der Verarbeitung: Ein flüssig animierter Avatar bedeutet nicht, dass jede Bewegung auf der Kundenseite mit 24 Bildern pro Sekunde analysiert wird. Der Agent kann Sprache, Kamerabilder und Bildschirmfreigaben aufnehmen, während er Audio und Avatarvideo ausgibt.
Google nennt außerdem asynchrone Werkzeugaufrufe. Ein Agent kann etwa Kontodaten abrufen, während der Dialog weiterläuft. Ob dies in einer konkreten Anwendung hilfreich ist, hängt von sauberer Statusanzeige, Fehlerbehandlung und begrenzten Rechten der angebundenen Systeme ab. Eine freundliche Figur darf keinen erledigten Vorgang suggerieren, solange die Buchung oder Änderung noch aussteht.
Wo ein Avatar geschäftlich sinnvoll sein kann
Der naheliegende Einsatz liegt bei erklärungsbedürftigen, visuellen Abläufen: Ein digitaler Berater führt durch eine Produktkonfiguration, zeigt auf einer Website den nächsten Schritt oder begleitet die Aufnahme eines Servicefalls. Googles Beispiel einer Schadenaufnahme ist eine Herstellerdemonstration, kein Nachweis einer messbaren Produktivitätssteigerung. Für standardisierte Hotline-Fragen ohne visuellen Bezug kann ein reiner Sprachagent wirtschaftlicher und barriereärmer sein.
Hypothetisches Pilotszenario: Ein Versicherer lässt Kundinnen und Kunden einen kleinen, nicht dringlichen Schaden per Video erläutern. Der Agent sammelt Angaben, zeigt fehlende Informationen an und erzeugt einen Entwurf für die Sachbearbeitung. Eine Auszahlung, Deckungszusage oder Ablehnung bleibt außerhalb seiner Befugnis. Im Test wird gemessen, ob mit Avatar mehr vollständige Fälle eingehen als mit derselben Sprachführung ohne Video. So lässt sich der Effekt der visuellen Ebene isolieren.
DACH-Testbeispiel (redaktioneller Testentwurf, keine gemessenen Ergebnisse): Derselbe Servicefall wird dreimal eingesprochen: „Meine Selbstbeteiligung beträgt 300 Euro“ (Deutschland), „Mein Selbstbehalt beträgt 300 Euro“ (Österreich) und „Wie hoch ist mein Selbstbehalt in Franken?“ (Schweiz). Das Team prüft, ob der Agent Betrag, Währung und Bedeutung korrekt übernimmt oder bei fehlendem Kontext nachfragt. Zusätzlich werden ein regionaler Akzent, ein unterbrochener Satz und ein undeutlich gesprochenes Aktenzeichen getestet. Diese Fälle belegen keine Modellqualität; sie machen die Prüfung im eigenen Kontext wiederholbar.
Einordnung der Herstellerangaben: Google nennt 97 Sprachen und nahtlose Sprachwechsel. Daraus folgt keine garantierte Qualität für Fachbegriffe, Dialekte oder rechtlich relevante Aussagen in Deutsch, Österreichisch oder Schweizer Hochdeutsch. Ein DACH-Pilot muss diese Fälle selbst testen. Unabhängige Vergleichsdaten für Live Avatar lagen zum Quellenstand nicht vor.
Zugang, Kosten und technische Grenzen
Vorgefertigte Avatare lassen sich laut Google-Dokumentation in der Cloud-Konsole und über die Live API auswählen. Ein Avatar auf Basis eines eigenen Referenzbilds ist nur für ausgewählte Kunden nach Freigabe verfügbar. Google verlangt, dass Kunden die erforderlichen Rechte und Einwilligungen für Bild- und Stimmproben sichern. Die allgemeine Verfügbarkeit des Produkts ist deshalb nicht mit freiem Zugang zu jeder Avatarfunktion gleichzusetzen.
Die Preisliste der Gemini Enterprise Agent Platform führt für Gemini 3.8 Live getrennte Posten je eine Million Token auf: 0,75 US-Dollar für Texteingaben, 1 US-Dollar für Bild- oder Videoeingaben, 3 US-Dollar für Audioeingaben, 4,50 US-Dollar für Textausgaben, 12 US-Dollar für Audioausgaben und 1 US-Dollar für Avatarvideoausgaben. Das sind Listenpreise am 24. September 2026 für den dort genannten nicht globalen Tarif, keine Kosten pro Gespräch. Für eine belastbare Kalkulation müssen Teams reale Gesprächslängen, Tokenverbrauch, Tool-Aufrufe, Netzwerkkosten und gegebenenfalls reservierten Durchsatz messen. Die Videoausgabe kommt zur Audioausgabe hinzu.
Illustrative Abrechnungsrechnung, keine typische Gesprächsdauer: Angenommen, ein Testlauf verbraucht 1.000 Audio-Eingabetoken, 1.000 Audio-Ausgabetoken, 1.000 Avatarvideo-Ausgabetoken, 500 Text-Ausgabetoken und 1.000 Text-Eingabetoken. Mit den genannten Listenpreisen ergibt das 0,003 + 0,012 + 0,001 + 0,00225 + 0,00075 = 0,019 US-Dollar Modellgebühr. Die Tokenmengen sind frei gewählte Rechenwerte und dürfen nicht in Minuten oder reale Gesprächskosten übersetzt werden. Kameraeingaben, zusätzliche Werkzeugaufrufe, Netzwerk und Betrieb sind in diesem Beispiel nicht enthalten. Für die Budgetplanung zählen die tatsächlich abgerechneten Token je Modalität und der Preis des gewählten Vertrags.
Ein besonders wichtiger Grenzwert steht in Googles Modellkarte für Gemini 3.8 Audio: Live Avatar unterstützt einige Minuten fortlaufender Interaktion, nicht stundenlange Sitzungen. Die Karte nennt außerdem mögliche Halluzinationen, gelegentliche Langsamkeit und Timeouts. Für längere Beratungsgespräche braucht es daher einen getesteten Sitzungswechsel oder einen anderen Kanal. Unternehmen sollten nicht aus einer kurzen Demo auf einen durchgehend stabilen Betrieb schließen.
Was die Architektur vor dem Pilot klären muss
Die Modellkarte nennt bis zu 128.000 Eingabetoken Kontext, für Live Avatar aber 24.000 Ausgabetoken. Das sind Kapazitätsangaben, keine Zusage für Gesprächsdauer oder Antwortzeit. Google veröffentlicht in den hier ausgewerteten Quellen keine verlässliche, für jede Sitzung gültige Avatar-Tokenrate pro Minute. Architekturteams sollten daher Zeit bis zum ersten hörbaren und sichtbaren Signal, Unterbrechungsreaktion, Token je Modalität, Timeout-Rate und Sitzungsabbruch in ihrer Zielregion selbst protokollieren. Nach einem Timeout muss der Client den bestätigten Vorgangsstand aus dem Backend wiederherstellen, eine neue Sitzung eröffnen und bei unklarem Zustand an einen Menschen übergeben; eine bloße Wiederholung einer schreibenden Aktion kann Doppelbuchungen auslösen.
Wer reservierten Durchsatz plant, muss eine zusätzliche Bedingung beachten: Laut Google-Dokumentation zum Provisioned Throughput benötigen Avatar-Sitzungen mindestens zehn gekaufte Generative AI Scale Units, damit sie über diesen reservierten Durchsatz laufen. Bei weniger Einheiten fällt die gesamte Avatar-Sitzung auf Pay-as-you-go zurück. Die dort genannten Durchsetzungsfenster sind ausdrücklich keine Latenzwerte.
Governance: Ein Gesicht erhöht die Verantwortung
Vor dem Rollout prüfen: Nutzende müssen erkennen, dass sie mit einem KI-System sprechen. Bei eigenen Gesichtern oder Stimmen sind Rechte und Einwilligungen vor der Erstellung zu dokumentieren. Kamera-, Sprach- und Transkriptdaten brauchen definierte Zwecke, Aufbewahrungsfristen, Zugriffsrechte und eine Prüfung der tatsächlich genutzten Region und Unterauftragsverarbeiter. Ob eine Datenschutz-Folgenabschätzung nötig ist, hängt vom konkreten Einsatz ab und gehört in die Prüfung durch die Datenschutzverantwortlichen.
Für den Umgang mit Sprachdaten bietet die Leitlinie 02/2021 des Europäischen Datenschutzausschusses zu virtuellen Sprachassistenten eine unabhängige datenschutzrechtliche Orientierung. Sie ist keine Bewertung von Gemini Live Avatar und ersetzt keine Prüfung des konkreten Datenflusses.
Google erklärt, generierte Audio- und Videoströme mit SynthID zu markieren. Diese Anbietermaßnahme kann Herkunftshinweise liefern; sie ersetzt keine sichtbare Kennzeichnung im Interface und keine organisatorische Freigabe. Gerade ein menschenähnliches Gesicht kann Vertrauen erzeugen, das die Genauigkeit des Agenten nicht verdient. Bei Preisen, Ansprüchen, Gesundheit oder Vertragsfolgen müssen Aussagen überprüfbar bleiben und bei Unsicherheit an Menschen übergehen.
Asynchrone Tool-Aufrufe verschärfen eine zweite Frage: Was darf der Agent tatsächlich tun? Lesezugriff auf einen freigegebenen Wissensbestand ist anders zu behandeln als eine Änderung im CRM. Schreibende Aktionen benötigen technisch eingeschränkte Identitäten, klare Ziele und Limits, verständliche Bestätigung durch zuständige Personen und Protokolle. Der Avatar darf den Status einer Aktion erst als abgeschlossen darstellen, wenn das Backend ihn bestätigt.
Ein Pilot, der eine Entscheidung ermöglicht
Ein zwei- bis vierwöchiger Test mit einem abgegrenzten Vorgang reicht oft, um die Grundfrage zu klären. Zuerst werden identische Inhalte mit und ohne Avatar angeboten. Danach folgen Tests mit deutscher Fachsprache, Unterbrechungen, schwacher Verbindung, Störgeräuschen, fehlerhaften Tool-Antworten und Gesprächen über die von Google genannte Mehrminutengrenze hinaus. Barrierefreiheit und eine jederzeit erreichbare Text- oder Mensch-Alternative gehören zum Testdesign.
Vor dem Test legt das Team Abnahmekriterien fest: Fachlich falsche Aussagen zu Deckung oder Preis dürfen nicht als abgeschlossen erscheinen; eine abgebrochene Sitzung darf keine doppelte Backend-Aktion auslösen; bei nicht bestätigtem Tool-Ergebnis muss der Avatar den offenen Status nennen. Die Zielwerte für Latenz, Abbruchrate und Kosten legt das Unternehmen anhand seines bestehenden Servicekanals fest, statt Herstellerdemos zu übernehmen.
Die Entscheidungsmatrix ist bewusst klein:
| Kriterium | Messung im Pilot | Entscheidung |
|---|---|---|
| Aufgabenerfolg | Vollständige, fachlich korrekte Vorgänge im Avatar- und Sprachkanal | Nur skalieren, wenn der Avatar einen klaren Zusatznutzen liefert |
| Dialogqualität | Unterbrechungen, Fachbegriffe, Wartezeiten und Sitzungsabbrüche | Fehlerfälle mit Übergabeweg absichern |
| Wirtschaftlichkeit | Gesamtkosten je abgeschlossenem Vorgang einschließlich Audio, Video und Betrieb | Gegen den reinen Sprachkanal rechnen |
| Vertrauen und Kontrolle | Erkennbarkeit als KI, Rechte an Vorlagen, Datenflüsse und Tool-Protokolle | Produktivsetzung erst nach fachlicher Freigabe |
Die Kriterien sind redaktionelle Empfehlungen, keine von Google belegten Erfolgswerte. Für kleine Servicefälle genügt zunächst ein enger Test mit Standardavatar und lesenden Werkzeugen. Bei sensiblen Daten oder schreibenden Aktionen muss die technische und organisatorische Prüfung deutlich tiefer gehen.
Fazit
Live Avatar macht aus dem Sprachagenten eine sichtbare Gesprächsoberfläche. Das kann eine komplexe Aufgabe leichter machen, ist aber kein eigener Geschäftswert. Die nächste Entscheidung für Unternehmen lautet daher: Welcher konkrete Vorgang wird durch visuelle Präsenz nachweislich besser abgeschlossen – und zu welchen zusätzlichen Kosten und Risiken? Bis dieser Nachweis im eigenen Kontext vorliegt, ist ein begrenzter Pilot mit Standardavatar die vernünftige Ausgangsbasis.
FAQ
Ist Live Avatar allgemein verfügbar?
Google meldet allgemeine Verfügbarkeit in Gemini Enterprise. Eigene Avatare auf Basis von Referenzbildern benötigen weiterhin eine gesonderte Freigabe.
Kann der Avatar stundenlang ununterbrochen sprechen?
Googles Modellkarte nennt wenige Minuten fortlaufender Interaktion und grenzt dies ausdrücklich von stundenlangen Sitzungen ab. Längere Prozesse benötigen einen geprüften Übergang.
Was kostet ein Gespräch?
Die öffentliche Preisliste rechnet verschiedene Eingabe- und Ausgabemodalitäten je Token ab. Ein Gesprächspreis ergibt sich erst aus gemessenem Verbrauch und dem konkreten Betriebsmodell.
Weiterführende Artikel auf AI-Fabrik
- Gemini 3.8 Live und Extended Thinking: Sprachagenten im Enterprise-Check
- Gemini 3.8 TTS im Unternehmen: Kosten, DACH-Grenzen und Pilotplan
Quellen
- Google: Introducing Gemini 3.8 Live with Live Avatar, 24. September 2026.
- Google Cloud: Power your agents: Gemini 3.8 Live with Live Avatar is now generally available, 24. September 2026.
- Google Cloud: Developer's guide to Gemini 3.8 Live, abgerufen am 24. September 2026.
- Google Cloud: Configure live avatars, abgerufen am 24. September 2026.
- Google DeepMind: Gemini 3.8 Audio – Model Card, abgerufen am 24. September 2026.
- Google Cloud: Agent Platform Pricing, geprüft am 25. September 2026.
- Google Cloud: Provisioned Throughput for Gemini Live API, geprüft am 25. September 2026.
- Europäischer Datenschutzausschuss: Leitlinie 02/2021 zu virtuellen Sprachassistenten, finale Fassung vom 7. Juli 2021.





