Das Wichtigste in Kürze
- OpenAI bringt das Echtzeit-Sprachmodell GPT-Live-1 in die API, um Entwicklern den Bau von interaktiven Voice-Agenten zu ermöglichen.
- Das System unterstützt echte Full-Duplex-Kommunikation, wodurch die KI gleichzeitig zuhören und sprechen kann – inklusive natürlicher Unterbrechungen.
- Die Nutzung der reinen Sprachschicht kostet 0,05 US-Dollar pro Minute und wird sekundengenau abgerechnet.
OpenAI, der Entwickler von ChatGPT, hat mit sofortiger Wirkung das Echtzeit-Sprachmodell GPT-Live-1 für Entwickler in seiner API veröffentlicht, um die Erstellung natürlicher, unterbrechungsfreier Sprachassistenten zu ermöglichen. Wie OpenAI in seiner aktuellen Ankündigung mitteilte, wandert damit die Technologie hinter dem Advanced Voice Mode direkt in die Hände von Entwicklern und Unternehmen.
Die Neuerungen im Detail
Laut OpenAI ermöglicht die neue GPT-Live-1 API echte Full-Duplex-Konversationen. Das bedeutet, dass das System gleichzeitig zuhören und sprechen kann, wodurch Nutzer den Agenten jederzeit natürlich unterbrechen können. Die Architektur trennt dabei die Sprachschicht strikt von der Logikschicht. Entwickler zahlen für diese Voice-Session-Ebene exakt 0,05 US-Dollar pro Minute, wobei die Abrechnung im Sekundentakt erfolgt. Backend-Modelle und Tool-Aufrufe werden separat berechnet.
Wie das Unternehmen mitteilte, erscheinen zeitgleich auch die Modelle GPT-Realtime-2.1 sowie eine kleinere, kostengünstigere Mini-Variante. Diese Modularität ist besonders relevant für die Entwicklung von Sprachassistenten, da sie Entwicklern mehr Kontrolle über Latenzen und das Verhalten der Agenten gibt. Das Modell zeichnet sich zudem durch verbesserte Instruction-Following-Fähigkeiten und integrierten Telefonie-Support aus.
Warum das wichtig ist
Der Schritt verwandelt ein reines Endkunden-Feature in eine mächtige Entwicklerplattform. Laut Branchenbeobachtern im OpenAI-Entwicklerforum markiert dies einen Wendepunkt: Sprachagenten wechseln von fehleranfälligen Demos in stabile Produktionsumgebungen. Der entscheidende Vorteil gegenüber klassischen Pipelines (erst Speech-to-Text, dann Text-to-Speech) ist der natürliche Gesprächsfluss ohne spürbare Latenzen.
GPT-Live-1 löst das Problem der unnatürlichen Gesprächspausen und macht KI-Agenten tauglich für den echten Kundenservice.
Allerdings müssen Entwickler die Kosten im Blick behalten: Da die 0,05 US-Dollar pro Minute nur das Frontend abdecken, können sich die Ausgaben bei intensiver Nutzung der OpenAI ChatGPT Modellauswahl im Backend schnell summieren. Kritiker aus der Reddit-Community weisen zudem darauf hin, dass sich die Full-Duplex-Fähigkeit erst noch in lauten Umgebungen und bei schlechten Telefonverbindungen im realen Einsatz beweisen muss.
Verfügbarkeit & Fazit
Die GPT-Live-1 API ist ab sofort allgemein verfügbar (General Availability). Mit einem Einstiegspreis von 0,05 US-Dollar pro Minute für die Audio-Schicht senkt OpenAI die technische Hürde für Echtzeit-Anwendungen massiv, erfordert aber eine präzise Kalkulation der Gesamtkosten. Wer agentenbasierte Anwendungen mit natürlicher Sprachinteraktion für den produktiven Einsatz bauen will, bekommt hier das derzeit fortschrittlichste Werkzeug an die Hand.
FAQ
Was ist die GPT-Live-1 API?
GPT-Live-1 ist ein neues API-Modell von OpenAI, das Entwicklern die Erstellung von Echtzeit-Sprachassistenten ermöglicht. Es unterstützt Full-Duplex-Audio, sodass die KI gleichzeitig zuhören und sprechen kann, was natürliche Unterbrechungen im Gespräch erlaubt.
Wie viel kostet die Nutzung von GPT-Live-1?
OpenAI berechnet 0,05 US-Dollar pro Minute für die reine Sprachschicht (Voice Session Layer), abgerechnet im Sekundentakt. Die Kosten für das Backend-Modell und eventuelle Tool-Aufrufe kommen separat hinzu, was eine genaue Budgetplanung erfordert.
Wie unterscheidet sich GPT-Live-1 von bisherigen Audio-APIs?
Im Gegensatz zu klassischen sequenziellen Systemen verarbeitet GPT-Live-1 den Gesprächsfluss in Echtzeit. Dies eliminiert unnatürliche Pausen und ermöglicht dynamische Dialoge, wie man sie aus dem Advanced Voice Mode von ChatGPT kennt.

Florian Schröder ist Gründer von AI Rockstars, KI-Stratege und Prompt Engineer. Er berät Unternehmen bei der praktischen Implementierung von generativer KI und Automation.









