Перейти к содержанию

Модель стоимости постоянно работающего агента OpenAI O / AON

Обновлено September 27, 2026 · впервые опубликовано September 27, 2026

Утёкшие ссылки раскрывают «O» от OpenAI (кодовое имя AON) — постоянно работающего ассистента для задач с длинным горизонтом. В отличие от чат-моделей, которые отвечают и останавливаются, O получает собственную облачную среду, может создавать контексты выполнения, писать код, проводить исследования и работать непрерывно в течение часов, дней или, возможно, недель. Он может включать несколько агентов, которые общаются по одной задаче. Ожидаемое раскрытие: OpenAI Dev Day, 29 сентября 2026 года.

Что меняется для моделирования стоимости

Традиционная стоимость LLM: токены на запрос × тариф. Стоимость O/AON: время × выделенные вычисления + пропускная способность токенов.

ИзмерениеAPI chat/completionsO / AON (прогноз)
Единица тарификацииЗа 1M токеновЗа час (вычисления) + за 1M токенов
Стоимость простоя$0>$0 (резерв среды)
Максимальная длительностьМинуты (таймаут)Дни/недели
ПараллелизмПоследовательные запросыРои из нескольких агентов
СостояниеПередаётся в контекстеПостоянная среда

Прогнозная модель стоимости (умозрительная, по паттернам утечек)

OpenAI не опубликовала цены. Две вероятные структуры:

Вариант A: час вычислений + токены (как Codespaces)

Запуск агента на 24 часа с 5M входных и 2M выходных токенов:

КомпонентСтоимость (низкая)Стоимость (высокая)
Среда 24 ч ($1/ч)$24$48
5M входных по $5/MTok$25$25
2M выходных по $15/MTok$30$30
Итого$79$103

Вариант B: фиксированная подписка (пакет Pro Max)

Стратегии оптимизации стоимости для постоянно работающих агентов

  1. Переводить в спячку, а не завершать. Если среда сохраняется, приостанавливайте цикл агента в периоды простоя вместо остановки: холодный старт обходится дороже резерва на простое.
  2. Группировать токены подзадач. Накапливайте результаты подзадач и записывайте контекст большими блоками, чтобы повысить долю попаданий в кэш в постоянной среде.
  3. Направлять подзадачи на более дешёвые модели. O/AON оркестрирует; кодирование передавайте Sonnet 5.5, исследования — моделям Flash, а к премиальной модели переходите только для критических решений.
  4. Задавайте жёсткие бюджеты времени и денег на каждую цель. «Реши этот баг, макс. $10 / 2 часа» — обеспечивайте через оркестратор, а не на удачу.

Когда использовать O/AON, а когда Opus 5.5 для долгих запусков

Связанное чтение

См. экономику ChatGPT Pro Max, цены OpenAI Ultra Fast API, стоимость 25-часового агента на Opus 5.5 и экономику агентов.

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com