Google hat Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking am 15. September veröffentlicht. Der Konzern bezeichnet sie als seine bisher fortschrittlichsten Audio-Modelle.
Die beiden Modelle können sprechen, logisch denken und Aufgaben erledigen. Doch wie bewerten unabhängige Analysten sie? Die Extended Thinking-Version belegte mit 82,6 Punkten den ersten Platz im Speech-to-Speech-Index von Artificial Analysis, vor GPT-Live-1 und Grok Voice.
Folgen Sie uns auf X, um die aktuellsten Nachrichten sofort zu erhalten
So schneiden Googles neueste Sprach-KI-Modelle in den Benchmarks ab
Der Index von Artificial Analysis fasst Sprachverständnis, agentische Leistung, Arena-Präferenz und Erfolgsquote bei Aufgaben zusammen.
Gemini 3.8 Live Extended Thinking, das bei besonders anspruchsvoller Aufgabenbewältigung getestet wurde, belegte direkt den ersten Platz. GPT-Live-1 Astra erreichte 81,5 Punkte und Grok Voice Think Fast 2.0 High kam auf 81,3 Punkte.
Das Standardmodell Gemini 3.8 Live erreichte mit einer Punktzahl von 76,0 den fünften Platz. Beide Varianten schnitten besser ab als Gemini 3.1 Flash Live High, das auf 71,5 Punkte kam.
Im Bereich der Agentenfähigkeiten ist der Unterschied noch größer: Extended Thinking erzielte im Tau Voice Benchmark 68,6 %, während die vorherige Generation auf 37,7 % kam.
Beim Sprachverständnis-Benchmark erzielte Extended Thinking 97,7 % und lag damit vor Grok Voice mit 97,2 %. Allerdings lag es hinter Qwen Audio 3.0 Realtime Plus, das 99,2 % erreichte.
Menschen bevorzugen weiterhin das ältere Gemini-Modell
Beim Preis zeigen sich deutliche Unterschiede. Das Standardmodell kostet 0,84 USD pro Stunde Audiomaterial. Das ist ungefähr die Hälfte des Vorgängers mit 1,75 USD und auch der günstigste Satz im Index.
Extended Thinking kostet 3,50 USD pro Stunde. Damit ist es günstiger als GPT-Live-1 Sol mit 4,47 USD und Grok Voice Think Fast 2.0 High mit 4,80 USD.
Auch die Latenzzeit hat abgenommen. Durchschnittlich verstreichen bis zum ersten Audio-Ausgabe 1,18 Sekunden, beim älteren Gemini-Modell waren es 2,99 Sekunden.
Die Hörer sind jedoch noch nicht ganz überzeugt. Gemini 3.1 Flash Live führt weiterhin das Präferenz-Ranking in Blindtests der Speech Agent Arena an, mit einem Elo-Wert von 1096.
Gemini 3.8 Live liegt mit 1083 Punkten an zweiter Stelle. Die Extended Thinking-Variante folgt mit 990 Punkten, obwohl sie 89,1 % ihrer Aufgaben erfüllt hat.
Sprach-KIs werden daher aktuell nach zwei Kriterien bewertet, die unterschiedliche Ergebnisse liefern. Benchmarks belohnen das Modell mit der besten logischen Leistung, bei der Präferenz zählt jedoch, welches Modell am angenehmsten spricht. Google führt aktuell mit unterschiedlichen Modellen auf beiden Skalen.
Abonnieren Sie unseren YouTube-Kanal, um die Analysen von Experten und Journalistinnen und Journalisten zu sehen









