Перейти к содержанию

Real-SWE: стоимость одной решенной задачи

Обновлено September 27, 2026 · впервые опубликовано September 27, 2026

Real-SWE вышел 12 сентября 2026 года и набрал 275 баллов и 158 комментариев на Hacker News. Исходная посылка — та часть, в которой большинство моделей стоимости ошибается: публичные наборы тестов открыты, запомнены моделями и не отражают код, с которым на самом деле работают ваши агенты. Real-SWE запускает модели на закрытых, реальных корпоративных репозиториях.

Почему число стоимости важнее оценки

Публичный бенчмарк дает долю успешных решений. Стоимость он не дает. Стоимость решенной задачи требует трех величин одновременно:

Перемножив их, вы получите единственную цифру, которая соответствует статье в счете. Модель, которая набирает на 4 пункта меньше лидера, но решает задачи за одну попытку на трети токенов, дешевле за решенную задачу, и на реальном бэклоге эта разница накапливается быстрее, чем предполагает разрыв в оценке.

Почему публичные бенчмарки завышают качество

Корпоративные кодовые базы обладают свойствами, которые ломают допущения публичных бенчмарков: длинные внутренние соглашения, недокументированные инварианты, тесты, кодирующие исторические случайности, и системы сборки, которые никто до конца не понимает. Модель, которая распознает шаблоны в публичном репозитории, не может распознать шаблоны в монорепо на 400 файлов с тремя годами накопленных решений. Поэтому показателен недавний в этом месяце результат: 27B открытая модель для креативного письма работает на уровне Fable 5 при заявленной цене в 40x ниже — это показывает, что открытые веса начинают с априорного знания о локальном репозитории, которого нет у API-моделей.

Расчет

Возьмем реальный бэкенд-репозиторий, где в работе 40 задач. Допустим, более дешевая модель решает 22 за одну попытку при 60K входа и 8K выхода, а премиальная решает 26 с коэффициентом повторов 1.4x при 90K входа и 14K выхода. По тарифам Opus 5.5 ($4/$20, чтение кэша $0.20):

МодельРешеноСтоимость на задачуИтого
Дешевый уровень22$0.32$7.04
Премиальный уровень26$0.61$15.86

Премиальный уровень стоит в 2.3x больше в сумме за на 18% больше решенных задач. На бэклоге из 40 задач это $9 дополнительно. Тот же обмен при 4,000 задач в месяц дает $880 — и все равно покупает лишь на 18% большую пропускную способность. Дешевый уровень не обязательно неверен: вы меняете долю решенных задач на объем, и правильный ответ зависит от того, стоит ли пропущенная задача больше доллара.

Что измерять

  1. Стоимость решенной задачи, а не попытки. Знаменатель — слитые PR, а не запросы.
  2. Коэффициент повторов для каждой модели. Модель с 1.4x на трети дороже своей списочной цены еще до учета всего остального.
  3. Токены на принятый diff, включая токены плана и самопроверки, которые diff не показывает.
  4. Минуты человеческой проверки. Модель на 12% дешевле, которая требует на 20% больше времени на проверку, оказывается дороже.

Итог

Публичные бенчмарки ранжируют способности на задачах, которые не похожи на ваш бэклог. Real-SWE — ранняя попытка честной версии. Пока вы не прогнали его на собственных репозиториях, рассматривайте каждое сравнение моделей как гипотезу о стоимости решенной задачи и оценивайте эту гипотезу по собственным счетчикам токенов.

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com