Модель стоимости Decisions API: только входные токены и быстрые ответы
Обновлено October 7, 2026 · впервые опубликовано October 7, 2026
Decisions API от OpenAI — бета-эндпоинт, который превращает общие текстовые или графические данные в типизированные классификации, выборы или оценки. С GPT-6 Luna он берёт $0.10 за миллион входных токенов и не берёт плату за кэш и выходные токены. Считайте заявление «10x faster» сигналом о задержке, а затем проверяйте качество и общую стоимость задачи на своей нагрузке.
Что OpenAI выпустила 6 октября 2026 года?
OpenAI добавила Decisions API в публичную бету 6 октября 2026 года. Отдельное руководство по Decisions сообщает, что он возвращает типизированные ответы примерно в 10 раз быстрее, чем Responses API. На запуске единственная поддерживаемая модель — GPT-6 Luna, а запросы идут на POST /v1/decisions. Сравнение скорости — это опубликованное утверждение OpenAI, а не обещание, что каждое приложение получит такое же улучшение от начала до конца.
Запрос содержит один общий вход и один или несколько вопросов. Каждый вопрос может запрашивать предикат (вероятность того, что условие истинно), выбор из заданного набора или оценку по упорядоченным уровням. Эндпоинт возвращает эти ответы в типизированном виде, с вероятностями или данными о уверенности. Поэтому он подходит для ограниченных решений, например для маршрутизации заявки в поддержку, пометки вероятных повреждений на фото товара или оценки серьёзности инцидента.
Как работает тарификация Decisions API?
Для эндпоинта Decisions OpenAI указывает $0.10 за миллион входных токенов с GPT-6 Luna. Руководство говорит, что оплачиваются только входные токены: плата за чтение кэша, запись в кэш и выходные токены не применяется. Это отличается от обычного запроса GPT-6 Luna через Responses, где стандартные тарифы для короткого контекста составляют $0.10 за миллион некэшированных входных токенов, $0.01 за кэшированный вход, $0.125 за запись в кэш и $0.50 за выходные токены. Для этого эндпоинта используйте отдельные условия цен Decisions, а не полную таблицу тарифов модели.
Вот гипотетическая оценка до любых региональных или длинноконтекстных корректировок: если средний запрос использует 1,200 входных токенов, плата за токены составит 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Миллион таких запросов потребует 1.2 млрд входных токенов и обойдётся примерно в $120. Это пример для планирования, а не котировка; измерьте реальное использование токенов и проверьте действующий тариф перед установкой бюджета.
Поскольку выходные токены здесь не тарифицируются, тщательно считайте весь вход: доказательства, системный контекст, включённый в запрос, а также инструкции и варианты каждого вопроса. Где это имеет смысл, задавайте независимые вопросы по одному и тому же входу в одном запросе. OpenAI документирует, что независимые вопросы могут разделять доказательства; вопросы, зависящие от предыдущих ответов, отправляйте отдельными вызовами. Делайте вопросы короткими и наблюдаемыми, чтобы запрос не тратил токены на неоднозначные рубрики.
Когда команде стоит использовать Decisions вместо Responses?
Используйте Decisions, когда результат по природе ограничен: «На этом изображении видны повреждения?», «Какая из этих трёх очередей отвечает за этот тикет?» или «Насколько серьёзен этот инцидент по этим явным уровням?». Он возвращает ответ, который приложение может маршрутизировать или подсчитать, без того чтобы универсальная модель писала абзац, а потом этот текст приходилось разбирать.
Оставляйте Responses для задач, которым нужны объяснения, произвольные JSON-схемы, генерируемый текст, вызовы инструментов или решение, требующее диалога с моделью. Руководство OpenAI прямо направляет разработчиков к Structured Outputs, когда нужен собственный JSON-объект, и к вызову функций, когда модель должна запросить вызов инструмента. Типизированный выбор не заменяет обоснованное объяснение или исполняемое действие.
Правильное сравнение — стоимость на правильный бизнес-результат, а не токены или задержка по отдельности. Быстрый классификатор, который создаёт дорогие ложноположительные срабатывания, может увеличить трудозатраты на проверку. Дешёвый эндпоинт всё равно может проиграть, если команды компенсируют это повторными промптами, ручной проверкой или исправлением на следующих этапах. Отслеживайте поля использования и ответа Decisions, сверяйте выборку результатов с размеченными примерами и включайте ручную проверку и последующую обработку в стоимость одного успешно маршрутизированного случая.
Как FinOps может проверить заявление об экономии?
- Выберите одну ограниченную нагрузку. Возьмите высокообъёмный шаг классификации или оценки с понятным набором ответов и измеримой ценой ошибки.
- Постройте размеченный тестовый набор. Измерьте точность по категориям и проверьте калибровку уверенности или вероятности. Установите пороги ручной проверки исходя из стоимости ложноположительных и ложноотрицательных результатов, как рекомендует OpenAI.
- Проведите сопоставимый пилот. Сравните текущий производственный путь и Decisions на эквивалентных входах. Фиксируйте задержку эндпоинта, токены, повторные запросы, долю ручной проверки и стоимость исправленных ошибок.
- Заложите в бюджет весь маршрут. Добавьте хранение, вычисления приложения, время проверяющих и любые последующие вызовы Responses или инструментов. Тарифы Decisions на токены не делают остальной workflow бесплатным.
- Держите путь отхода. Эндпоинт находится в публичной бете. Зафиксируйте эндпоинт и модель в конфигурации, следите за changelog и перепроверяйте перед широким развёртыванием, если меняется поведение или доступность.
OpenAI документирует поддержку Zero Data Retention и использование по HIPAA для подходящих клиентов, а также опции резидентности данных в США и Европе (EEA и Швейцария) с требованиями к праву на использование и соглашениям. Проверьте эти средства контроля по реальной конфигурации вашей организации, прежде чем отправлять регулируемые данные в пилот.
Что покупателю стоит помнить о ценах Decisions API?
Decisions API предлагает новую комбинацию цены и задержки для компактных типизированных решений: по опубликованному тарифу GPT-6 Luna вход стоит $0.10 за миллион токенов, а сгенерированные выходные токены не тарифицируются. Лучшие кандидаты на такие нагрузки имеют повторно используемые доказательства, понятные типы ответов и дешёвые способы поймать неуверенные результаты. Измеряйте качество задачи и общую операционную стоимость, прежде чем переносить производственный объём.
Какие связанные материалы стоит прочитать командам?
- Структурированный вывод не бесплатен
- Стоимость успешной задачи важнее стоимости запроса
- Снижение цен моделей не уменьшает ваш счёт за ИИ автоматически
По теме
- Структурированный вывод не бесплатен
- Стоимость успешной задачи
- Снижение цен моделей и бюджеты маршрутизации
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →