Saltar al contenido

Modelo de costo de agentes siempre activos OpenAI O / AON

Actualizado September 27, 2026 · publicado originalmente September 27, 2026

Referencias filtradas revelan «O» de OpenAI (nombre en clave AON): un asistente siempre activo diseñado para tareas de largo horizonte. A diferencia de los modelos de chat, que responden y se detienen, O dispone de su propio entorno en la nube, puede preparar contextos de ejecución, escribir código, investigar y operar de forma continua durante horas, días o incluso semanas. Puede implicar varios agentes que se comunican en la misma tarea. Presentación esperada: OpenAI Dev Day, 29 de septiembre de 2026.

Qué cambia en el modelado de costos

Costo tradicional de un LLM: tokens por solicitud × tarifa. Costo de O/AON: tiempo × cómputo asignado + volumen de tokens.

DimensiónAPI de chat/completionsO / AON (proyectado)
Unidad de facturaciónPor 1M de tokensPor hora (cómputo) + por 1M de tokens
Costo en reposo$0>$0 (reserva del entorno)
Duración máximaMinutos (timeout)Días/semanas
ParalelismoSolicitudes secuencialesEnjambres multiagente
EstadoSe pasa en el contextoEntorno persistente

Modelo de costo proyectado (especulativo, basado en patrones de las filtraciones)

OpenAI no ha publicado precios. Dos estructuras probables:

Opción A: hora de cómputo + tokens (como Codespaces)

Una ejecución de agente de 24 horas con 5M de tokens de entrada / 2M de salida:

ComponenteCosto (bajo)Costo (alto)
Entorno 24 h ($1/h)$24$48
5M de entrada a $5/MTok$25$25
2M de salida a $15/MTok$30$30
Total$79$103

Opción B: suscripción fija (paquete Pro Max)

Estrategias de optimización de costos para agentes siempre activos

  1. Hibernar, no terminar. Si el entorno persiste, pause el bucle del agente en los periodos de inactividad en lugar de apagarlo: el arranque en frío cuesta más que la reserva en reposo.
  2. Agrupar los tokens de las subtareas. Acumule los resultados de las subtareas y escriba el contexto en bloques más grandes para mejorar la tasa de aciertos de caché en el entorno persistente.
  3. Enrutar las subtareas a modelos más baratos. O/AON orquesta; delegue la programación en Sonnet 5.5, la investigación en modelos Flash y escale a un modelo premium solo para decisiones críticas.
  4. Fijar presupuestos estrictos de tiempo y dinero por objetivo. «Resuelve este bug, máx. $10 / 2 horas»: hágalo cumplir desde el orquestador, no confíe en la suerte.

Cuándo usar O/AON y cuándo Opus 5.5 de larga duración

Lecturas relacionadas

Vea economía de ChatGPT Pro Max, precios de la API Ultra Fast de OpenAI, costo de 25 horas de agente con Opus 5.5 y economía de agentes.

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com