Перейти к содержанию

Как стиль промпта отражается в счёте

Обновлено September 1, 2026 · впервые опубликовано September 1, 2026

Краткий ответ: Промпты растут так же, как конфигурационные файлы. Кто-то добавляет инструкцию, чтобы устранить сбой. Кто-то другой добавляет пример. Третий пишет абзац о том, почему вторая инструкция важна. Ничего...

Промпты растут так же, как конфигурационные файлы. Кто-то добавляет инструкцию, чтобы устранить сбой. Кто-то другой добавляет пример. Третий пишет абзац о том, почему вторая инструкция важна. Ничего не удаляется, потому что удаление может вернуть баг, который никто не может воспроизвести. Через полгода системный промпт занимает три тысячи токенов, и никто не скажет, какие из них две сотни несущие.

Почему это накапливается

В отличие от вывода, который зависит от задачи, накладные расходы промпта платятся при каждом запросе, одинаково и навсегда. Тысяча лишних токенов в функции с десятью миллионами вызовов в месяц — это десять миллиардов токенов в месяц чистого оформления.

В многоходовых диалогах хуже: системный промпт отправляется заново на каждом ходе, так что его стоимость растёт с числом ходов, а не запросов. В циклах агентов одно действие пользователя может вызвать десяток обращений к модели, и один и тот же раздутый преамбул оплачивается десять раз за одну работу.

Что действительно расточительно

Не вежливость: это несколько токенов, которые иногда даже повышают соблюдение инструкций. Реальный вес создают: избыточные инструкции, которые трижды пересказывают одно и то же правило, защитный шаблонный текст, добавленный для поколения моделей, которому он уже не нужен, примеры, которые дублируют друг друга вместо того, чтобы покрывать разные случаи, и объяснения, адресованные людям, читающим файл с промптом, а не модели.

На практике последняя категория самая большая. Примеры few-shot дороги в пересчёте на токен, и команды редко проверяют, не справились бы два примера там, где работают пять.

Относитесь к промпту как к коду с бюджетом

Измерьте постоянную часть промпта как долю среднего размера запроса. Если она больше половины, это проблема стоимости, а не стиля. Поставьте стабильную часть в начало, чтобы сработал кэш, и остаток станет заметно дешевле без удаления чего-либо. Затем проведите абляцию: уберите один блок, прогоните свои evals и оставьте удаление, если качество не просело. Сокращение промпта без набора evals — это гадание, а сбой, который найдут клиенты, обойдётся дороже сэкономленных токенов.

Связанное

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com