⏳ Curating articles…
Künstliche Intelligenz 3 min read 2h ago

Google KI löscht Füllwörter in Echtzeit

  • Google veröffentlicht drei neue Gemini-3.5-Audiomodelle mit Transkription in über 85 Sprachen und automatischer Entfernung von Füllwörtern.
  • Gemini 3.5 Transcribe ist eine vollständig neue Produktlinie und löst laut Google das Vorgängermodell Chirp 3 mit deutlich niedrigeren Fehlerquoten ab.
  • Der Rollout startet auf macOS und Android sowie für Entwickler via Gemini API; Chrome-Support und das angekündigte Gemini 3.5 Pro stehen noch aus.
Google KI löscht Füllwörter in Echtzeit

Google hat seine Gemini-Audio-Plattform mit drei neuen Modellen der Generation 3.5 aktualisiert: Gemini 3.5 Live, 3.5 Live Experimental und 3.5 Transcribe. Die Updates sollen die Präzision sprachgesteuerter KI-Funktionen deutlich verbessern und sind ab sofort für macOS-Nutzer der Gemini-App sowie für Entwickler über die Gemini API zugänglich.

Neues Transkriptionsmodell als eigenständige Produktlinie

Gemini 3.5 Transcribe ist eine vollständig neue Ergänzung der Gemini-Familie. Nach eigenen Angaben stellt das Modell gegenüber dem Vorgänger Chirp 3 einen erheblichen Fortschritt dar – insbesondere hinsichtlich mehrsprachiger Leistung und der sogenannten Wording Error Rate. Das System unterstützt nach Unternehmensangaben mehr als 85 Sprachen und erkennt automatisch Fachbegriffe und spezialisiertes Vokabular. Nutzer können dem Modell darüber hinaus ein individuell angepasstes Wörterbuch bereitstellen, um branchenspezifische Schreibweisen korrekt verarbeiten zu lassen.

Zu den deklarierten Kernfunktionen zählt die automatische Entfernung von Füllwörtern wie "äh" oder "ähm" sowie die automatische Textformatierung. Für voraufgezeichnete Audiodateien kann das Modell Redebeiträge von bis zu drei Sprechern getrennt erfassen und mit zeitstempelgenauen Wortmarkierungen versehen. Damit adressiert Google einen häufigen Schmerzpunkt professioneller Transkriptionsworkflows. Googles jüngste Modellstrategie deutet auf eine zunehmende Ausdifferenzierung der Gemini-Familie nach Anwendungsfall hin.

Advertisement
Ad Unit · 728×90 / Responsive

Live-Modelle verbessern Echtzeitinteraktion

Gemini 3.5 Live baut auf der bestehenden Spracherkennungstechnologie des Gemini-Sprachmodus auf und soll mid-sentence-Unterbrechungen, Spracherkennung und die gleichzeitige Verarbeitung von Live-Videoinhalten besser handhaben. Die experimentelle Variante, 3.5 Live Experimental, geht laut Google einen Schritt weiter: Sie erläutert ihre Zwischenschritte in Echtzeit, während sie komplexere Reasoning-Aufgaben bearbeitet.

Verfügbarkeit und offene Fragen

Die neuen Audiomodelle werden zunächst in englischer Sprache für macOS-Gemini-App-Nutzer sowie über die Rambler-Diktierfunktion auf Android in ausgewählten Ländern und Sprachen ausgerollt. Für Entwickler steht die Funktionalität in der öffentlichen Vorschau über die Gemini API sowie über AI Studio und Antigravity bereit. Chrome-Unterstützung hat Google für einen späteren Zeitpunkt angekündigt, ohne ein konkretes Datum zu nennen. Noch offen bleibt indes, wann das im Juni angekündigte Gemini 3.5 Pro erscheint – ein Termin steht weiterhin aus.

Advertisement
Ad Unit · 300×250 / Responsive

More in Künstliche Intelligenz

Read in another language

← Home