Saltar al contenido

Modelo de costes de la API Decisions de OpenAI: precio solo por entrada y salidas tipadas rápidas

Actualizado October 7, 2026 · publicado originalmente October 7, 2026

Respuesta rápida: La API Decisions de OpenAI es un endpoint en beta que convierte evidencia compartida de texto o imagen en clasificaciones, elecciones o puntuaciones tipadas. Con GPT-6 Luna, cobra $0.10 por millón de...

La API Decisions de OpenAI es un endpoint en beta que convierte evidencia compartida de texto o imagen en clasificaciones, elecciones o puntuaciones tipadas. Con GPT-6 Luna, cobra $0.10 por millón de tokens de entrada y no cobra tokens de caché ni de salida. Trate su afirmación de «10x más rápida» como una señal de latencia y después pruebe la calidad y el coste total de la tarea con su propia carga de trabajo.

¿Qué lanzó OpenAI el 6 de octubre de 2026?

OpenAI añadió la API Decisions en beta pública el 6 de octubre de 2026. La guía de Decisions indica que devuelve respuestas tipadas unas 10 veces más rápido que la API Responses. En el lanzamiento, GPT-6 Luna es el único modelo compatible y las solicitudes usan POST /v1/decisions. La comparación de velocidad es una afirmación publicada por OpenAI, no una promesa de que toda aplicación verá la misma mejora de extremo a extremo.

Una solicitud lleva una entrada compartida y una o más preguntas. Cada pregunta puede pedir un predicado (la probabilidad de que una condición sea verdadera), una elección de un conjunto proporcionado o una puntuación frente a niveles ordenados. El endpoint devuelve esas respuestas en forma tipada, con probabilidades o información de confianza. Eso lo hace adecuado para decisiones acotadas, como enrutar un ticket de soporte, señalar posibles daños en la foto de un producto o puntuar la gravedad de una incidencia.

¿Cómo funciona la facturación de la API Decisions?

Para el endpoint Decisions, OpenAI indica $0.10 por millón de tokens de entrada con GPT-6 Luna. La guía señala que solo se cobran los tokens de entrada: no se aplican cargos por lectura de caché, escritura de caché ni tokens de salida. Esto difiere de una solicitud Responses ordinaria a GPT-6 Luna, donde las tarifas estándar de contexto corto son $0.10 por millón de tokens de entrada sin caché, $0.01 de entrada en caché, $0.125 por escrituras de caché y $0.50 por tokens de salida. Use las condiciones de precios específicas de Decisions para este endpoint, no la tarifa completa del modelo.

Aquí tiene una estimación hipotética, antes de cualquier ajuste regional o de contexto largo aplicable: si una solicitud media usa 1,200 tokens de entrada, su cargo por tokens es 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Un millón de solicitudes de este tipo usaría 1.2 mil millones de tokens de entrada y costaría unos $120. Es un ejemplo de planificación, no un presupuesto; mida el uso real de tokens y confirme la tarifa vigente antes de fijar un presupuesto.

Como los tokens de salida no son una categoría facturada aquí, cuente con cuidado la entrada completa: la evidencia, el contexto de sistema incluido en la solicitud y las instrucciones y opciones de cada pregunta. Cuando tenga sentido, plantee en una sola solicitud preguntas independientes sobre la misma entrada. OpenAI documenta que las preguntas independientes pueden compartir evidencia; las preguntas que dependen de respuestas anteriores deben enviarse en llamadas separadas. Mantenga las preguntas cortas y observables para que la solicitud no gaste tokens en rúbricas ambiguas.

¿Cuándo debe un equipo usar Decisions en lugar de Responses?

Use Decisions cuando el resultado sea inherentemente acotado: «¿Esta imagen tiene daños visibles?», «¿Cuál de estas tres colas es responsable de este ticket?» o «¿Qué gravedad tiene esta incidencia según estos niveles explícitos?». Devuelve una respuesta que la aplicación puede enrutar o contabilizar sin pedir a un modelo de propósito general que escriba un párrafo y luego analizar esa prosa.

Reserve Responses para tareas que necesiten explicación, esquemas JSON arbitrarios, texto generado, llamadas a herramientas o una decisión que requiera una conversación con el modelo. La guía de OpenAI remite expresamente a los desarrolladores a Structured Outputs cuando necesitan un objeto JSON personalizado y a function calling cuando el modelo debe solicitar una llamada a una herramienta. Una elección tipada no sustituye a una explicación razonada ni a una acción ejecutable.

La comparación correcta es el coste por resultado de negocio correcto, no los tokens o la latencia por separado. Un clasificador rápido que genera costosos falsos positivos puede aumentar el trabajo de revisión. Un endpoint de bajo precio aún puede salir perdiendo si los equipos compensan con prompts repetidos, revisión manual o correcciones posteriores. Registre los campos de uso y de respuesta de Decisions, contraste una muestra de resultados con ejemplos etiquetados e incluya la revisión humana y el tratamiento posterior en el coste por caso enrutado con éxito.

¿Cómo puede FinOps validar la afirmación de ahorro?

  1. Elija una carga de trabajo acotada. Escoja un paso de clasificación o puntuación de alto volumen con un conjunto de respuestas claro y un coste de error medible.
  2. Construya un conjunto de pruebas etiquetado. Mida la precisión por categoría e inspeccione la calibración de la confianza o la probabilidad. Fije los umbrales de revisión humana a partir del coste de los falsos positivos y los falsos negativos, como recomienda OpenAI.
  3. Ejecute un piloto comparable. Compare la ruta actual de producción y Decisions con entradas equivalentes. Registre la latencia del endpoint, los tokens, los reintentos, la tasa de revisión y el coste de los errores corregidos.
  4. Presupueste la ruta completa. Añada almacenamiento, cómputo de la aplicación, tiempo de revisores y cualquier llamada posterior a Responses o a herramientas. El precio por tokens de Decisions no hace gratis el resto del flujo.
  5. Mantenga una vía de salida. El endpoint está en beta pública. Fije el endpoint y el modelo en la configuración, siga el changelog y vuelva a probar antes de un despliegue amplio si cambian el comportamiento o la disponibilidad.

OpenAI documenta la compatibilidad con Zero Data Retention y el uso con HIPAA para clientes elegibles, además de opciones de residencia en EE. UU. y Europa (EEE y Suiza) sujetas a requisitos de elegibilidad y acuerdo. Confirme esos controles con la configuración real de su organización antes de introducir datos regulados en un piloto.

¿Qué debe recordar un comprador sobre el precio de la API Decisions?

La API Decisions ofrece una nueva combinación de precio y latencia para decisiones tipadas y compactas: a la tarifa publicada de GPT-6 Luna, la entrada cuesta $0.10 por millón de tokens y los tokens de salida generados no tienen cargo. Sus mejores cargas candidatas tienen evidencia reutilizable, tipos de respuesta claros y formas económicas de detectar resultados inciertos. Mida la calidad de la tarea y el coste operativo total antes de trasladar volumen de producción.

¿Qué investigación relacionada deberían leer los equipos?

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com