Тихое понижение модели и модели затрат
Обновлено September 27, 2026 · впервые опубликовано September 27, 2026
23 сентября 2026 года в ветке r/GroundTruthAINews обратили внимание на сноску, спрятанную в запускных заметках Anthropic по Opus 5.5: запрос к Opus 5.5 может обработать Opus 4.8. Anthropic и OpenAI в тот же день объявили о снижении цен. Обе лаборатории продавали одну идею: сохранить возможности и тратить заметно меньше. Для FinOps важна именно сноска.
Что произошло на самом деле
Claude Opus 5.5 вышел по цене $4/$20 за миллион токенов, примерно на 20% ниже Opus 5, а чтение из кеша снизили на 60% до $0.20. Anthropic утверждает, что меньшее число токенов на задачу и вывод на 30% быстрее делают типичные нагрузки примерно на 40% дешевле. Примерно через 90 минут OpenAI выпустила GPT-6 Sol по $2/$10 и Luna по $0.10/$0.50, то есть обе вдвое дешевле GPT-5.6.
Каждый анонс этого периода содержит сноску такого же рода: вызываемая вами точка входа — это алиас, и в переходный период алиас распределяет нагрузку между версиями модели. Это обычная практика управления мощностями. Но это и проблема для моделирования затрат.
Почему это ломает цифры
- Стоимость задачи уплывает. Ваш прогноз предполагал цену вывода Opus 5.5. Если часть вызовов уходит на 4.8, меняются и цена за единицу, и число токенов, причем в противоположных направлениях.
- Оценки измеряют смесь. Набор оценок, запущенный в переходном окне, показывает смесь версий. Результат потом не воспроизвести.
- Снижение цен атрибутируется неверно. Если экономия 40% выглядит как 15%, разрыв обычно объясняется смесью версий, а не сломанной оптимизацией.
- Базовые значения задержки устаревают. 4.8 не так быстр, как 5.5. Любой p50, снятый посреди перехода, не является вашим устойчивым p50.
Как обнаружить подмену
Каждый крупный провайдер возвращает в теле ответа фактически использованную модель. Логируйте ее. Одно поле, четыре строки кода:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSЗатем разбивайте каждую метрику затрат по фактически использованной модели, а не по запрошенной. Как только одна группа начнет уплывать, ответ найден: алиас смешивает версии, а ваша стоимость задачи является средневзвешенным двух разных продуктов.
Что это значит для бюджета
В переход планируйте по смешанной стоимости, а не по заголовочной цифре. Если 20% вызовов уходят на более старую модель, ваша фактическая ставка за вход — не $4.00 за миллион, а то, что получается в смеси. Та же логика относится и к заявленной экономии: «на 40% дешевле» — среднее для типичной нагрузки, которое уже предполагает меньшее число токенов. Это может не сохраниться, если более дешевая, но старая модель генерирует более длинные ответы.
Правила, которых стоит держаться
- Никогда не моделируйте по алиасу. Зафиксируйте ID модели с датой для всего, что бюджетируете или оцениваете.
- Логируйте фактическую модель в каждом запросе. Без этого не обойтись, если вы когда-либо повторите оценку.
- Пересчитайте базовые значения после переходного окна. Обычно это недели, а не кварталы, но проверьте.
- Оценивайте переход как смесь. Запросите у провайдера ожидаемое распределение или измерьте его сами.
Итог
Снижение цен и тихое понижение модели могут прийти в один и тот же день. Снижение — заголовок; понижение — сноска, которая незаметно обесценивает прогноз прошлого месяца. Логируйте фактическую модель, фиксируйте ID с датами и закладывайте в цену смесь.
По теме
- Модель затрат Claude Opus 5.5
- Цены GPT-6: Sol, Luna, Astra
- Снижение цен моделей и бюджеты маршрутизации
- Цены провайдеров несопоставимы
- Контроль затрат на оценки
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →