Ga naar inhoud

Kostenmodel van de OpenAI Decisions API: prijs alleen op input en snelle getypeerde uitvoer

Bijgewerkt October 7, 2026 · eerst gepubliceerd October 7, 2026

Kort antwoord: De Decisions API van OpenAI is een betaversie-endpoint dat gedeeld tekst- of beeldbewijs omzet in getypeerde classificaties, keuzes of scores. Met GPT-6 Luna kost hij $0.10 per miljoen inputtokens en...

De Decisions API van OpenAI is een betaversie-endpoint dat gedeeld tekst- of beeldbewijs omzet in getypeerde classificaties, keuzes of scores. Met GPT-6 Luna kost hij $0.10 per miljoen inputtokens en worden geen cache- of outputtokens gerekend. Zie de claim '10x sneller' als latentiesignaal en test kwaliteit en totale taakkosten op je eigen workload.

Wat bracht OpenAI uit op 6 oktober 2026?

OpenAI voegde de Decisions API op 6 oktober 2026 toe als publieke bèta. De speciale Decisions-gids zegt dat hij getypeerde antwoorden ongeveer 10 keer sneller geeft dan de Responses API. Bij de lancering is GPT-6 Luna het enige ondersteunde model en gebruiken requests POST /v1/decisions. De snelheidsvergelijking is een gepubliceerde claim van OpenAI, geen belofte dat elke toepassing dezelfde end-to-endverbetering ziet.

Een request bevat één gedeelde input en één of meer vragen. Elke vraag kan een predicaat zijn (een kans dat een voorwaarde waar is), een keuze uit een aangeleverde set of een score tegen geordende niveaus. Het endpoint geeft die antwoorden getypeerd terug, met kansen of betrouwbaarheidsinformatie. Dat maakt hem geschikt voor afgebakende beslissingen zoals het routeren van een supportticket, het markeren van waarschijnlijke schade op een productfoto of het scoren van de ernst van een issue.

Hoe werkt de facturering van de Decisions API?

Voor het Decisions-endpoint noemt OpenAI $0.10 per miljoen inputtokens met GPT-6 Luna. De gids zegt dat alleen inputtokens worden gerekend: kosten voor cache-lezen, cache-schrijven en outputtokens zijn niet van toepassing. Dat verschilt van een gewoon GPT-6 Luna Responses-request, waar de standaardtarieven voor korte context $0.10 per miljoen niet-gecachete inputtokens, $0.01 gecachete input, $0.125 cache-schrijfacties en $0.50 outputtokens zijn. Gebruik de speciale Decisions-prijsvoorwaarden voor dit endpoint, niet de volledige tarievenkaart van het model.

Hier een hypothetische raming, vóór eventuele regionale of lange-contextcorrecties: als een gemiddeld request 1.200 inputtokens gebruikt, is de tokenvergoeding 1.200 ÷ 1.000.000 × $0.10 = $0.00012. Een miljoen van zulke requests zou 1,2 miljard inputtokens gebruiken en ongeveer $120 kosten. Dit is een planningsvoorbeeld, geen offerte; meet het echte tokengebruik en bevestig het actuele tarief voordat je een budget vaststelt.

Omdat outputtokens hier geen gefactureerde categorie zijn, moet je de volledige input zorgvuldig tellen: bewijs, in het request opgenomen systeemcontext en de instructies en keuzes van elke vraag. Stel onafhankelijke vragen over dezelfde input waar zinvol in één request. OpenAI documenteert dat onafhankelijke vragen bewijs kunnen delen; vragen die van eerdere antwoorden afhangen, moeten in aparte aanroepen worden verstuurd. Houd vragen kort en waarneembaar zodat het request geen tokens besteedt aan dubbelzinnige rubrics.

Wanneer gebruikt een team Decisions in plaats van Responses?

Gebruik Decisions wanneer het resultaat inherent afgebakend is: 'Is deze afbeelding zichtbaar beschadigd?', 'Welke van deze drie wachtrijen is eigenaar van dit ticket?' of 'Hoe ernstig is dit incident tegen deze expliciete niveaus?' Je krijgt een antwoord dat de applicatie kan routeren of tellen, zonder een algemeen model een alinea te laten schrijven die je dan moet parsen.

Houd Responses voor taken die uitleg, willekeurige JSON-schema's, gegenereerde tekst, toolaanroepen of een beslissing met een gesprek met het model vereisen. De gids van OpenAI verwijst ontwikkelaars expliciet naar Structured Outputs wanneer ze een eigen JSON-object nodig hebben, en naar function calling wanneer het model een toolaanroep moet aanvragen. Een getypeerde keuze vervangt geen beredeneerde uitleg of een uitvoerbare actie.

De juiste vergelijking is kosten per correct bedrijfsresultaat, niet tokens of latentie los bekeken. Een snelle classifier die dure valse positieven veroorzaakt, kan de reviewarbeid verhogen. Een goedkoop endpoint kan nog steeds verliezen als teams compenseren met herhaalde prompts, handmatige review of correctie achteraf. Volg de gebruiks- en antwoordvelden van de Decision-respons, vergelijk uitkomsten steekproefsgewijs met gelabelde voorbeelden en reken menselijke review en afhandeling achteraf mee in de kosten per succesvol gerouteerd geval.

Hoe kan FinOps de besparingsclaim valideren?

  1. Kies één afgebakende workload. Kies een classificatie- of scorestap met hoog volume, een duidelijke antwoordset en meetbare foutkosten.
  2. Bouw een gelabelde testset. Meet de nauwkeurigheid per categorie en inspecteer de kalibratie van betrouwbaarheid of kans. Stel drempels voor menselijke review in op basis van de kosten van valse positieven en valse negatieven, zoals OpenAI aanbeveelt.
  3. Draai een vergelijkbare pilot. Vergelijk het huidige productiepad en Decisions op gelijkwaardige input. Leg endpointlatentie, tokens, nieuwe pogingen, reviewpercentage en de kosten van gecorrigeerde fouten vast.
  4. Budgetteer de volledige route. Tel opslag, applicatiecompute, reviewertijd en eventuele latere Responses- of toolaanroepen erbij. De tokenprijs van Decisions maakt de rest van de workflow niet gratis.
  5. Houd een uitweg open. Het endpoint is in publieke bèta. Pin het endpoint en model in de configuratie, volg de changelog en test opnieuw vóór brede uitrol als gedrag of beschikbaarheid verandert.

OpenAI documenteert ondersteuning voor Zero Data Retention en HIPAA-gebruik voor in aanmerking komende klanten, plus opties voor dataresidentie in de VS en Europa (EER en Zwitserland), met vereisten voor geschiktheid en overeenkomsten. Bevestig die controles tegen de werkelijke configuratie van je organisatie voordat je gereguleerde data in een pilot zet.

Wat moet een koper onthouden over de prijs van de Decisions API?

De Decisions API biedt een nieuwe prijs- en latentievorm voor compacte, getypeerde beslissingen: tegen het gepubliceerde GPT-6 Luna-tarief kost input $0.10 per miljoen tokens en worden gegenereerde outputtokens niet gerekend. De beste kandidaat-workloads hebben herbruikbaar bewijs, duidelijke antwoordtypen en goedkope manieren om onzekere resultaten op te vangen. Meet taakkwaliteit en totale operationele kosten voordat je productievolume verschuift.

Welk verwant onderzoek moeten teams lezen?

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com