In den letzten Jahren hat sich die Technologie von KI-Assistenten wie ChatGPT stetig weiterentwickelt. Mit jeder neuen Version werden ihre Fähigkeiten verfeinert, die Genauigkeit verbessert und die Reaktionsgeschwindigkeit erhöht. Trotz ihrer Fortschritte ist generative KI nicht unfehlbar und sollte nicht als unantastbare Informationsquelle betrachtet werden. Dennoch bietet sie für viele Nutzer eine praktische Alternative zur herkömmlichen Texteingabe: die Sprachkommunikation. Ursprünglich basierte der Sprachmodus von ChatGPT auf einer dreistufigen Technologie, die gesprochene Sprache in Text umwandelte, eine Antwort mithilfe eines Sprachmodells generierte und diese dann wieder in gesprochene Sprache umsetzte.
Mit der Einführung des fortgeschrittenen Sprachmodus und dem neuen GPT-Live-Modell hat sich die Qualität von Sprachinteraktionen erheblich verbessert. OpenAI beschreibt dieses System als «Vollduplex-Architektur», die es ermöglicht, gleichzeitig zuzuhören und zu sprechen. Dies behebt ein häufiges Problem früherer Modelle, bei denen kurze Pausen als Ende der Sprechzeit missverstanden wurden, was zu vorzeitigen Antworten führte. Nutzer werden nun gelegentlich von kurzen Bestätigungen wie «mhmm» oder «ja» begleitet, um die Gespräche natürlicher zu gestalten. Zudem ist GPT-Live in der Lage, komplexe Aufgaben an andere Modelle wie GPT-5.5 weiterzugeben, wenn eine Anfrage erweiterte Recherchen oder Überlegungen erfordert.
Der Sprachmodus GPT-Live ist sowohl in der ChatGPT-App für Android und iOS als auch über Webbrowser verfügbar. Nutzer der kostenpflichtigen Pläne wie ChatGPT Pro, Plus und Go können auf das GPT-Live-1-Modell zugreifen, während das kostenlose Modell eine abgespeckte Version bietet. Der neue Sprachmodus ersetzt das vorherige turnusbasierte Modell als Standardoption. Um die Sprachfunktion zu aktivieren, genügt ein Tippen auf das Wellenform-Symbol im Chatfenster. Beim erstmaligen Gebrauch wird möglicherweise eine Erlaubnis zur Mikrofonfreigabe benötigt.
Sobald der Sprachmodus aktiv ist, erscheint auf dem Bildschirm eine reagierende Kugel, die anzeigt, dass das System bereit ist. In den Einstellungen, die über das Symbol in der rechten oberen Ecke zugänglich sind, können Nutzer die Intelligenzstufe des Modells anpassen. Zur Auswahl stehen die Optionen Sofort, Mittel und Hoch, wobei diese Anpassungsmöglichkeiten für das kostenlose Modell nicht verfügbar sind. Der Sprachmodus bleibt auch dann aktiv, wenn der Nutzer die App wechselt oder das Gerät sperrt.
Obwohl der neue Sprachmodus eine deutliche Verbesserung darstellt, unterstützt GPT-Live derzeit keine Bildschirm- oder Videoübertragung. Nutzer haben jedoch die Möglichkeit, in den Einstellungen auf ältere Sprachmodelle zurückzugreifen, wenn dies gewünscht ist. Dort kann auch die Stimme des Assistenten gewechselt oder die Standardsprache geändert werden.
Besonders beeindruckend ist, wie schnell man beim Gespräch mit GPT-Live vergisst, dass man mit einer Maschine kommuniziert. Das Modell unterbricht nicht mehr mitten im Satz und reagiert auf natürliche Weise auf längere Anfragen. Es eignet sich auch hervorragend für Live-Übersetzungen, wobei das Transkript der Unterhaltung jederzeit eingesehen werden kann. Bei Anfragen, die visuelle Unterstützung benötigen, erstellt ChatGPT interaktive Widgets, um die Antworten zu ergänzen.
Die voreingestellte Intelligenzstufe **Sofort** bewältigt alltägliche Fragen schnell und effizient, während komplexere Anfragen an im Hintergrund arbeitende Modelle weitergeleitet werden. Für detailliertere Diskussionen bieten die Stufen **Mittel** und **Hoch** mehr Tiefe, erfordern jedoch eine geringfügige Verlängerung der Reaktionszeit. Diese zusätzliche Bedenkzeit beeinträchtigt jedoch nicht den natürlichen Fluss der Gespräche.
Insgesamt stellt das GPT-Live-Modell einen signifikanten Fortschritt in der Sprachinteraktion mit KI-Assistenten dar und bietet Nutzern eine noch menschlichere und flüssigere Kommunikationserfahrung.