Адаптивное мышление и прогноз стоимости
Обновлено September 1, 2026 · впервые опубликовано September 1, 2026
Бюджет рассуждений раньше был числом, которое вы задавали сами. Вы передавали thinking: {type: "enabled", budget_tokens: N}, и N было одновременно и ограничением, и прогнозом: в худшем случае каждый запрос стоил N токенов рассуждений, и финансовая команда могла умножить это на объём.
Этот параметр устарел на Opus 4.6 и Sonnet 4.6, а на самых новых моделях — Fable 5 и 5.1, Sonnet 5, Opus 5, 4.8 и 4.7 — его отправка возвращает 400. Заменяет его thinking: {type: "adaptive"}, где модель сама решает, сколько думать, исходя из сложности запроса.
В среднем это даёт больше результата на доллар. Но это также снятие потолка, и если ваш прогноз строился на этом потолке, он теперь неверен таким образом, что проявится только по закрытии месяца.
Что меняется в цифрах
Средняя стоимость запроса обычно снижается, потому что простые запросы перестают платить за рассуждения, которые им не нужны. Дисперсия растёт, потому что трудные запросы больше не обрезаются по вашему лимиту. Эти величины движутся в противоположных направлениях, и бюджет, выраженный как максимум на запрос, опереться уже не на что.
Практический сбой происходит не в среднем, а в хвосте: изменение промпта, новый тип документа или пользователи, которые начинают задавать более сложные вопросы, переводят часть трафика на более глубокие рассуждения, и ничто в вашей конфигурации этого не ограничивает.
Прогнозируйте распределение, а не потолок
Три изменения, в порядке того, сколько они дают.
Ведите токены рассуждений как отдельный ряд. Они уже есть в объекте usage каждого ответа. Выделите их из входных и выходных токенов в телеметрии, и вы увидите сдвиг в день, когда он произошёл, а не в конце месяца.
Бюджетируйте по перцентилям. Замените «N токенов на запрос» на p50 и p99 для каждого маршрута. p50 показывает, сколько стоит нагрузка; разрыв между p50 и p99 показывает, насколько вы уязвимы для плохой недели.
Настраивайте алерты на долю, а не на итог. Доля токенов рассуждений в общем объёме по каждому маршруту — единственный показатель, который первым меняется, когда изменение промпта заставляет модель работать усерднее. Алерт по общим расходам срабатывает через несколько дней, когда объём уже накопился.
Где лимит всё ещё нужен
Удаление поручного лимита на запрос не означает отказа от всех ограничений. Лимиты расходов на уровне маршрута и арендатора по-прежнему работают, по-прежнему ловят неконтролируемые циклы и теперь должны стоять там, где проходит граница, которой вы владеете, а не внутри параметра запроса, которого больше нет. Для путей, чувствительных к задержке, где глубокие рассуждения никогда не стоят затрат, рычаг — выбор модели, а не бюджет токенов.
Связанное
По теме
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →