Zuletzt aktualisiert: 24. September 2026 · Version: 1.1
Redaktionshinweis: Dieser Artikel wurde mit KI-Unterstützung recherchiert und überarbeitet sowie redaktionell geprüft. Produktangaben und Preisangaben stammen überwiegend von Google; unabhängige Vergleichsdaten zur Sprachqualität liegen zum Start nur begrenzt vor. Funktionen und Verfügbarkeit können je nach Region, Produkt, Tarif und Freigabe abweichen. Quellenstand: 24. September 2026.
In 30 Sekunden
- Google hat Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vorgestellt. Die API-Release-Notes datieren die allgemeine Verfügbarkeit auf den 22. September, der Google-Blog erschien am 23. September 2026.
- Flash zielt auf aufwendige Sprecherführung und lange Inhalte; Flash-Lite auf hohe Stückzahlen und geringere Kosten. Beide wandeln vorgegebenen Text in Audio um.
- Die bezahlte Standard-API berechnet bis Ende 2026 9 beziehungsweise 6 US-Dollar je Million Audio-Output-Tokens; ab 2027 sind 18 beziehungsweise 12 US-Dollar ausgewiesen.
- Voice Replication in Google AI Studio ist laut Google im EWR, in Großbritannien und der Schweiz nicht verfügbar. Andere Zugangswege und die konkrete Unternehmenseignung müssen getrennt geprüft werden.
- Für DACH-Teams bietet sich zunächst ein Pilot mit freigegebenen Texten und synthetischen Stimmen an, mit Hörprüfung, Kostenmessung und klaren Nutzungsrechten.
Die Entscheidung für Unternehmen
Wer vertonte Schulungen, barriereärmere Inhalte oder mehrsprachige Produktinformationen produziert, sollte beide Modelle mit demselben Skript testen. Flash lohnt sich nur dort, wo die hörbare Qualitätsdifferenz den höheren Preis rechtfertigt. Für standardisierte Massenproduktion ist Flash-Lite der naheliegende Ausgangspunkt. Stimmenreplikation gehört erst nach Rechte-, Einwilligungs- und Verfügbarkeitsprüfung in den Pilot.
Eine Unternehmensakademie will 200 Lernmodule von jeweils rund zehn Minuten vertonen. Schon eine zusätzliche Korrekturschleife pro Modul verändert Aufwand und Kosten erheblich. Die entscheidende Frage lautet: Sind Fachbegriffe, Eigennamen und längere Passagen zuverlässig gesprochen, und lässt sich die Produktion rechtssicher betreiben?
Was Google mit Gemini 3.8 Text-to-Speech veröffentlicht hat
Google führt zwei eigenständige TTS-Modelle ein: gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts. Die Gemini-API-Release-Notes führen beide seit dem 22. September 2026 als allgemein verfügbar. Der Google-Blog vom 23. September erläutert die Produktrollen. Die Modelle nehmen Text entgegen und geben Audio aus. Sie sind daher von Gemini 3.8 Live zu unterscheiden, das für interaktive Spracheingaben und Dialoge entwickelt wurde.
Google positioniert Flash für ausdrucksstarke Sprecherrollen, regionale Akzente und längere Erzählformate. Flash-Lite soll niedrige Latenz und hohe Volumina bedienen. Laut den Flash- und Flash-Lite-Modellseiten decken sie 130 beziehungsweise 101 Sprachen ab. Das ist eine dokumentierte Sprachunterstützung, kein Qualitätsnachweis für jede Sprache oder jeden Dialekt.
| Kriterium | Flash TTS | Flash-Lite TTS |
|---|---|---|
| Vorrangiger Zweck | Aufwendige Sprecherführung, schwierige Aussprache, lange Formate | Hoher Durchsatz, Vorlesefunktionen, Standarddialoge |
| Dokumentierte Sprachen | 130 | 101 |
| Audio-Output, bezahlte Standard-API bis 31.12.2026 | 9 USD / 1 Mio. Tokens | 6 USD / 1 Mio. Tokens |
| Audio-Output ab 01.01.2027 laut Preisliste | 18 USD / 1 Mio. Tokens | 12 USD / 1 Mio. Tokens |
| Erster Pilottest | Anspruchsvolle Lern- oder Markenstimme | Wiederkehrende Audiofassungen in großer Zahl |
Beide Modelle nutzen nach Google dasselbe API-Schema. Das erleichtert einen direkten Vergleich mit identischem Text, identischer Stimme und denselben Bewertungskriterien. Die Tabelle zeigt Listenpreise für Audio-Output der bezahlten Standard-API; Text-Input, Speicherung, weitere Verarbeitung, Steuern und Vertragskonditionen kommen gegebenenfalls hinzu. Quelle: Google-Preisliste.
Für die technische Auswahl
| Prüfpunkt | Dokumentierter Stand |
|---|---|
| API-Status | Beide Modelle laut Gemini-API-Release-Notes allgemein verfügbar. |
| Ein- und Ausgabe | Text hinein, Audio heraus; einzelne Anfragen liefern standardmäßig WAV. |
| Zwei Sprecher in einer Anfrage | Bis zu zwei Sprecher mit vorgegebenen Stimmen; für entworfene oder replizierte Stimmen werden getrennte Sprecher-Turns benötigt. |
Für diese Punkte sind die Release-Notes und der TTS-Leitfaden maßgeblich. Eine pauschale Latenzzahl nennt Google hier nicht; sie gehört deshalb in den eigenen Test.
Was sich in der Produktion tatsächlich ändert
Die API spricht den übergebenen Text grundsätzlich wörtlich aus; Steuerungsinformationen müssen deshalb getrennt vom Sprechtext übergeben werden. Dauerhafte Vorgaben wie Tempo oder Tonfall gehören laut Google-TTS-Leitfaden in speech_metadata; kurze Lautereignisse und Pausen können als Inline-Tags markiert werden. Wer von Gemini 3.1 Flash TTS migriert, sollte Skripte und Parser prüfen: Frühere Anweisungen im Text können sonst mitgesprochen werden.
Merksatz: Eine texttreue Ausgabe ist kein redaktionell geprüfter Inhalt.
Namen, Zahlen, Produktbezeichnungen und deutsche Komposita brauchen eine Hörkontrolle. Die Freigabe bleibt beim Unternehmen.
Kosten: Die Ausgangsrechnung ist einfach, die Gesamtkosten sind es nicht
Google setzt für Audio-Output 25 Tokens pro Sekunde an. Daraus ergeben sich rechnerisch 1.500 Audio-Tokens pro Minute. Bei den bis Ende 2026 ausgewiesenen Standardpreisen entspricht das ungefähr 1,35 US-Cent pro Minute für Flash und 0,9 US-Cent pro Minute für Flash-Lite, jeweils nur für Audio-Output. Ab 2027 verdoppeln sich diese Werte laut Preisliste. Die Minutenwerte sind eine AI-Fabrik-Ableitung, keine verbindliche Abrechnung.
Ein belastbarer Business Case misst zusätzlich Text-Input, Fehlversuche, erneute Renderings nach Textkorrekturen, Review-Zeit, Hosting und Transkodierung. Für die 200 Lernmodule aus dem Beispiel sollte das Team zehn repräsentative Module mit beiden Modellen produzieren und die tatsächlich abrechenbaren Tokens sowie die menschliche Nacharbeit erfassen. Erst dann lässt sich der Kostenabstand gegen Qualitätsgewinn und Prozessaufwand stellen.
DACH-Grenze: Verfügbarkeit und Stimmenrechte getrennt prüfen
Governance-Hinweis
Google nennt für Voice Replication in AI Studio ausdrücklich eine Nichtverfügbarkeit im Europäischen Wirtschaftsraum, in Großbritannien und der Schweiz. Die Einschränkung gilt für diesen Zugangsweg; Verfügbarkeit über andere Wege muss separat geprüft werden.
Google beschreibt eine Replikation aus einem 30-Sekunden-Stimmbeispiel mit verbaler Einwilligungsprüfung. Laut Hersteller werden generierte Audios mit SynthID markiert; außerdem nennt Google C2PA-Nachweise. Unternehmen sollten dokumentierte Zustimmung, Zweckbindung, Lösch- und Widerrufsprozesse sowie Regeln zur Weitergabe vorsehen und rechtlich prüfen lassen. Bei Mitarbeiterstimmen sollten Datenschutz und gegebenenfalls Arbeitnehmervertretung früh beteiligt werden.
Auch bei synthetischen Stimmen gehören vertrauliche Skripte nicht ungeprüft in einen Entwicklungstest. IT und Datenschutz sollten Datenkategorien, Auftragsverarbeitung, Speicherort, Protokollierung, Zugriffsrechte und die Nutzung von Eingaben je Tarif klären. Laut Google-Preisliste unterscheiden sich kostenloses und bezahltes API-Tier bei der Verwendung von Daten zur Produktverbesserung. Das ist ein Grund, Test- und Produktionsumgebung bewusst zu trennen.
Verfügbarkeit: API heute, Enterprise-Integration angekündigt
Beide Modelle werden laut Google in Gemini API und AI Studio ausgerollt. Flash TTS ist für Gemini Notebook, Flash-Lite TTS für Google Vids angekündigt. Der API-Zugang über Gemini Enterprise ist dagegen noch als „coming soon“ gekennzeichnet. Rechte, Kontrollen und Konditionen sind für jeden Zugangsweg gesondert zu prüfen.
Googles Aussagen zu besonders ausdrucksstarker Sprache und stabilen langen Dialogen sind Herstellerpositionierung. Der Blog nennt Qualitätsrankings, aber für eine DACH-Entscheidung zählen eigene Blindhörtests auf Deutsch, österreichischen und schweizerischen Varianten, Branchenvokabular, längeren Passagen und schlechteren Ausgangstexten. Erst damit wird aus einem Demo-Eindruck eine belastbare Auswahl.
Ein Pilot in vier Schritten
- Fall und Material festlegen: Ein begrenzter Anwendungsfall mit freigegebenem Text, etwa ein internes Lernmodul. Keine personenbezogenen Stimmenproben im ersten Durchlauf.
- Gleiches Skript, beide Modelle: Testen Sie zehn unterschiedliche Textstücke mit Zahlen, Fachbegriffen, Abkürzungen und Dialogen. Halten Sie Stimme, Format und Sprechvorgaben konstant.
- Qualität und Aufwand messen: Blindbewertung durch Fachbereich und Zielgruppe; erfassen Sie Aussprachefehler, Nachbearbeitungszeit, Latenz, Re-Renderings und tatsächliche API-Kosten.
- Freigabegrenzen definieren: Benennen Sie Eigentümer für Skript, Stimme und Veröffentlichung. Legen Sie fest, wann eine neue Aufnahme, manuelle Korrektur oder menschliche Stimme nötig ist.
Ein sinnvoller Erfolgspunkt ist nicht „klingt menschlich“, sondern beispielsweise: fachlich korrekte Aussprache in allen Pflichtbegriffen, festgelegte maximale Korrekturzeit pro Minute Audio und ein nachvollziehbarer Preis je freigegebenem Modul.
FAQ
Sind Gemini 3.8 TTS und Gemini 3.8 Live dasselbe?
Nein. TTS erzeugt Audio aus einem vorgegebenen Text. Gemini 3.8 Live ist für interaktive Audio-Dialoge und multimodale Echtzeit-Anwendungen ausgelegt.
Welches Modell ist für Unternehmen günstiger?
Beim Audio-Output der bezahlten Standard-API ist Flash-Lite laut Google günstiger: bis Ende 2026 6 statt 9 US-Dollar je Million Tokens. Die bessere Wirtschaftlichkeit hängt aber von Qualität, Nacharbeit und Laufzeit des konkreten Falls ab.
Kann ich in Deutschland eine Mitarbeiterstimme replizieren?
Google schließt Voice Replication über AI Studio im EWR derzeit aus. Für andere Zugangswege muss die aktuelle Verfügbarkeit separat geprüft werden. Unabhängig davon sind Einwilligung, Nutzungsrechte, Datenschutz und interne Freigaben erforderlich.
Ersetzt TTS eine professionelle Sprecherin?
Bei standardisierten, häufig aktualisierten Inhalten kann TTS Aufwand senken. Für sensible Kommunikation, Markenstimmen und Inhalte mit hoher Wirkung sollte ein Hörtest und eine redaktionelle Freigabe entscheiden.
Fazit
Für Unternehmen ist Gemini 3.8 TTS zunächst ein Produktionswerkzeug. Starten Sie mit Flash-Lite als Kostenbaseline und testen Sie Flash dort, wo Aussprache, Ausdruck oder Markenwirkung entscheidend sind. Erst wenn Qualität, Datenverarbeitung und Rechtekette nachweislich passen, lohnt sich eine breitere Produktion.
Quellen
- Google AI for Developers: Gemini API Release Notes, 22. September 2026.
- Google Blog: Gemini 3.8 text-to-speech says hello, 23. September 2026, einschließlich regionaler Einschränkung in der Fußnote.
- Google AI for Developers: Text-to-speech generation, abgerufen am 24. September 2026.
- Google: Gemini 3.8 Flash TTS Modellseite und Flash-Lite TTS Modellseite, abgerufen am 24. September 2026.
- Google AI for Developers: Gemini Developer API Pricing, abgerufen am 24. September 2026.





