NewsSprach-KIGeminiGoogle

Google stellt Gemini 3.8 Live vor – Sprach-KI mit Echtzeit-Reasoning

Google hat zwei neue Audio-Modelle gelauncht, die Sprachagenten mit erweiterten Denkfähigkeiten ausstatten. Gemini 3.8 Live Extended Thinking führt Benchmarks an und soll OpenAIs GPT-Live-1 Konkurrenz machen.

Gemini 3.8 Live Extended Thinking führt Speech-to-Speech-Quality-Index mit 82,6 Punkten an

Google stellt Gemini 3.8 Live vor – Sprach-KI mit Echtzeit-Reasoning

Google hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt – zwei neue Sprach-KI-Modelle, die natürlichere und intelligentere Sprachinteraktionen ermöglichen sollen. Die Modelle können komplexe Aufgaben im Hintergrund bearbeiten, ohne das Gespräch zu unterbrechen, und sollen damit ein neuer Standard für sprachgesteuerte KI-Agenten werden.

Kurz & knapp

  • Gemini 3.8 Live Extended Thinking führt den Speech-to-Speech-Quality-Index von Artificial Analysis mit 82,6 Punkten an
  • Modell erreicht 68,6 % auf τ-Voice und 35,1 % auf Sierra's τ-Voice-banking-Benchmark bei Agentic-Task-Completion
  • Verfügbar ab sofort über Gemini API, Google Workspace und die Gemini App
  • Tom Ouyang (Principal Engineer) und Malini Jaganathan (Technical Staff) führen die Gemini Audio Team an

Zwei Modelle für unterschiedliche Anforderungen

Google differenziert zwischen zwei Varianten: Gemini 3.8 Live ist auf Skalierbarkeit und Kosteneffizienz ausgelegt und kombiniert Gesprächsintelligenz mit flüssigem Dialog und visueller Kontextualisierung. Gemini 3.8 Live Extended Thinking richtet sich an komplexe Aufgaben und bietet erhöhte Intelligenz sowie mehrstufiges Reasoning.

Besonders hervorzuheben ist die Fähigkeit beider Modelle, Unterbrechungen zu handhaben, zwischen Sprachen zu wechseln und ihren Denkprozess zu erklären, während sie arbeiten. Das soll die Interaktion mit KI intuitiver und weniger frustrierend machen.

Benchmark-Führerschaft und Leistung

Gemini 3.8 Live Extended Thinking punktet mit starken Messergebnissen: Das Modell erreicht 97,7 % auf Big Bench Audio und führt damit mehrere Industrie-Benchmarks an. Diese Zahlen deuten darauf hin, dass Google bei Sprach-KI-Qualität derzeit an der Spitze steht – besonders relevant im direkten Vergleich zu OpenAIs GPT-Live-1, das als Konkurrenzprodukt gilt.

Metrik Wert
Speech-to-Speech Quality Index 82,6
τ-Voice (Agentic Task Completion) 68,6 %
Sierra's τ-Voice-banking 35,1 %
Big Bench Audio 97,7 %

Verfügbarkeit und Zugang

Die neuen Modelle sind ab sofort für Entwickler und Unternehmen verfügbar – über die Gemini API für Custom-Integrationen, über Google Workspace für Geschäftsanwender und über die Gemini App für Einzelnutzer. Das bedeutet: Wer heute ein Sprach-Interface braucht, kann die neuen Modelle unmittelbar in Produktion nehmen.

Was das für deutsche Unternehmen bedeutet

Für deutsche Unternehmen eröffnet sich hier eine wichtige Entscheidung: Sprach-KI wird zum Commodity-Feature. Wer Kundensupport, interne Assistenten oder Voice-Commerce-Lösungen plant, kann jetzt auf bewährte, produktionsreife Modelle setzen – ohne lange auf Eigenentwicklung zu warten. Die Benchmark-Führerschaft von Gemini 3.8 Live Extended Thinking macht Google hier zum Favoriten, zumindest bei der reinen Sprachqualität. Offen bleibt, wie sich die Modelle bei deutschsprachigen Anwendungsfällen und branchenspezifischen Anforderungen verhalten – das werden die kommenden Wochen zeigen.

Quellen

Redaktionell verantwortet von Ideal Syka. Quellen und Arbeitsweise: Redaktion & Methode. Hinweise und Korrekturen: ai@i6eal.de.

Teilen
← Alle Beiträge

Alle Analysen basieren auf eigenen Messungen von i6eal oder auf klar gekennzeichneten Quellen. Zahlen sind Momentaufnahmen und können sich ändern; Korrekturen weisen wir transparent aus.