Gepubliceerd op 11 september 2026
OpenAI zette GPT-Live-1 op 10 september 2026 in de API, voor $0,05 per minuut gesprek. Het model luistert en praat tegelijk, en volgens OpenAI tilt dat het resultaat op Full Duplex Bench 30 procentpunten boven GPT-Realtime-2.1. Die prijs dekt alleen de spraaklaag, dus het model dat het denkwerk erachter doet, komt er apart bovenop.
Wat is GPT-Live-1 en wat betekent full-duplex?
De meeste spraakagents rijgen vandaag drie dingen aan elkaar: spraakherkenning, een tekstmodel en spraaksynthese. Elke overdracht kost tijd, en het ritme van een gesprek raak je zo kwijt. GPT-Live-1 vervangt die keten door een enkel model dat inkomende en uitgaande audio samen verwerkt. Full-duplex is het woord daarvoor, en het betekent dat het model kan blijven luisteren terwijl het zelf nog praat.
Het redeneerwerk gebeurt niet in GPT-Live-1 zelf. Je kiest een tekstmodel dat erachter hangt en het denken en de tool-aanroepen doet. OpenAI noemt GPT-6 Astra, Luna en Terra als opties, naast modellen van derden. Het idee is dat je de diepte van het denkwerk bij de taak laat passen: iets goedkoops voor een orderstatus, iets sterkers voor een ingewikkelde klacht. GPT-Live-1 praat ondertussen door terwijl dat werk op de achtergrond loopt.
Het regelt ook het loodgieterswerk dat je anders zelf bouwt. Je krijgt standaard transcripties en antwoordtekst, keyword biasing, betere herkenning van dingen als ordernummers en postcodes, en beurtdetectie als jouw app toch met expliciete beurten wil werken. Telefonie wordt ondersteund, dus de agent kan een telefoon opnemen.
Prijs en specificaties van GPT-Live-1 tegenover GPT-Realtime-2.1
Je leest deze release het scherpst naast het model dat hij vervangt. Het prijsmodel verandert compleet van vorm, en een van de capaciteiten gaat achteruit.
| Wat er gemeten wordt | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Hoe je betaalt | $0,05 per minuut sessie | $32 per 1M audio-inputtokens, $64 per 1M output |
| Luistert en praat tegelijk | Ja | Nee, om de beurt |
| Full Duplex Bench (pauzes, beurtwisseling, onderbrekingen) | 30 punten hoger | Uitgangspunt |
| Beeld als input | Niet ondersteund | Ondersteund, $5 per 1M beeldtokens |
| Stemmen bij lancering | 12, eigen stemmen via sales | Aantal niet gepubliceerd |
| Gelijktijdige sessies, Tier 1 tot Tier 5 | 25 tot 500 | Begrensd op verzoeken per minuut |
Het cijfer voor Full Duplex Bench komt uit de eigen evaluatie van OpenAI, en het publiceert het verschil en niet de twee scores, dus je ziet niet waar beide modellen vandaan komen. De prijzen komen van de model- en prijspagina’s van OpenAI. De twee prijsregels zijn niet direct vergelijkbaar, en dat is precies het punt: je betaalt nu voor tijd aan de lijn in plaats van voor audiotokens, en de tokenrekening verhuist naar het model dat je erachter zet.
Wat OpenAI niet vertelt over GPT-Live-1
Die $0,05 per minuut koopt de voorkant en verder niets. OpenAI geeft geen uitgewerkt voorbeeld van wat een afgemaakte spraakagent per gesprek kost, en dat is nu net het getal dat een koper nodig heeft. De rekensom voor alleen de spraaklaag is simpel genoeg: duizend uur bellen komt op $3.000 voordat het model erachter een enkel token gelezen heeft.
De Tau3-uitslag is een ranglijst voor een duo, niet voor het spraakmodel. GPT-Live-1 staat daar eerste in combinatie met GPT-6 Astra op middelhoge denkkracht, en dat is ook het duurste model dat OpenAI nu verkoopt. Draai je het met iets goedkopers, dan koop je niet de benchmark waarover je las.
Een van de capaciteiten gaat achteruit. GPT-Realtime-2.1 accepteert beeld als input, GPT-Live-1 niet, en video ook niet. Kijkt jouw spraakagent naar een foto die een klant tijdens het gesprek stuurt, dan kan dit model dat werk niet zelfstandig doen.
Er staat ook nergens een latentiecijfer. Het argument van OpenAI is dat het weghalen van de overdrachten de vertraging verkleint, maar op de modelpagina staan snelheid en prestaties allebei als niet gespecificeerd, en in de aankondiging staat geen enkel getal in milliseconden. De klantresultaten die geciteerd worden, waaronder de daling van 80% in onderbrekingen bij Speak en de 23.000 regels code die bij een andere klant verdwenen, zijn cijfers die die bedrijven zelf aanleverden.
Wat je op dag een krijgt
- Prijs: $0,05 per minuut sessie, per seconde afgerekend, met het model en de tools erachter apart gefactureerd
- Input en output: alleen audio en tekst, geen beeld en geen video
- Stemmen: 12 bij lancering, verdeeld over accenten en talen, eigen stemmen alleen via sales van OpenAI
- Endpoint: v1/live/sessions, met streaming en function calling
- Limieten: 25 gelijktijdige sessies op Tier 1, oplopend tot 500 op Tier 5, en geen gratis laag
- Kennisgrens: 31 juli 2025
Wat dit betekent
Dit is het nu waard om te testen als je telefonische support of sales op volume draait en je huidige opzet een keten van drie diensten is. Denk aan een team van vijf dat een reserveringslijn of schadelijn draaiend houdt. De waarde zit hier niet in een benchmark, maar in het schrappen van de code die bepaalt wat er gebeurt als een beller je onderbreekt. Een klant zegt dat dat 23.000 regels uit de codebase haalde. Zit jij daar ergens in de buurt, dan verdient de migratie zich terug in onderhoud voordat hij zich terugverdient in gesprekskwaliteit.
Het is eerder iets om te volgen dan om nu over te nemen als jouw spraakproduct iets moet kunnen zien. Beeld als input laten vallen is een echte stap terug ten opzichte van GPT-Realtime-2.1, en OpenAI zegt niet wanneer het terugkomt. Het is ook geen goedkoper product dan wat je nu hebt. Het is een rekening met een andere vorm, en of hij lager uitvalt hangt volledig af van het model dat je erachter kiest. Dat is precies de beslissing die OpenAI bij jou legt, zonder er cijfers bij te geven. Het eerste dat wij zouden meten is de kostprijs per afgerond gesprek met een klein model erachter, en daarna hetzelfde gesprek met Astra, want het gat tussen die twee is de echte prijs van deze release.
Voor meer informatie, bekijk de officiële aankondiging van GPT-Live-1 op de blog van OpenAI.