Real-SWE: стоимость одной решенной задачи
Обновлено September 27, 2026 · впервые опубликовано September 27, 2026
Real-SWE вышел 12 сентября 2026 года и набрал 275 баллов и 158 комментариев на Hacker News. Исходная посылка — та часть, в которой большинство моделей стоимости ошибается: публичные наборы тестов открыты, запомнены моделями и не отражают код, с которым на самом деле работают ваши агенты. Real-SWE запускает модели на закрытых, реальных корпоративных репозиториях.
Почему число стоимости важнее оценки
Публичный бенчмарк дает долю успешных решений. Стоимость он не дает. Стоимость решенной задачи требует трех величин одновременно:
- Доля успешных решений на сложных закрытых задачах.
- Токены на одну попытку, включая неудачные.
- Число попыток — понадобился ли повтор, пересмотр плана, цикл «diff и переосмысление»?
Перемножив их, вы получите единственную цифру, которая соответствует статье в счете. Модель, которая набирает на 4 пункта меньше лидера, но решает задачи за одну попытку на трети токенов, дешевле за решенную задачу, и на реальном бэклоге эта разница накапливается быстрее, чем предполагает разрыв в оценке.
Почему публичные бенчмарки завышают качество
Корпоративные кодовые базы обладают свойствами, которые ломают допущения публичных бенчмарков: длинные внутренние соглашения, недокументированные инварианты, тесты, кодирующие исторические случайности, и системы сборки, которые никто до конца не понимает. Модель, которая распознает шаблоны в публичном репозитории, не может распознать шаблоны в монорепо на 400 файлов с тремя годами накопленных решений. Поэтому показателен недавний в этом месяце результат: 27B открытая модель для креативного письма работает на уровне Fable 5 при заявленной цене в 40x ниже — это показывает, что открытые веса начинают с априорного знания о локальном репозитории, которого нет у API-моделей.
Расчет
Возьмем реальный бэкенд-репозиторий, где в работе 40 задач. Допустим, более дешевая модель решает 22 за одну попытку при 60K входа и 8K выхода, а премиальная решает 26 с коэффициентом повторов 1.4x при 90K входа и 14K выхода. По тарифам Opus 5.5 ($4/$20, чтение кэша $0.20):
| Модель | Решено | Стоимость на задачу | Итого |
|---|---|---|---|
| Дешевый уровень | 22 | $0.32 | $7.04 | Премиальный уровень | 26 | $0.61 | $15.86 |
Премиальный уровень стоит в 2.3x больше в сумме за на 18% больше решенных задач. На бэклоге из 40 задач это $9 дополнительно. Тот же обмен при 4,000 задач в месяц дает $880 — и все равно покупает лишь на 18% большую пропускную способность. Дешевый уровень не обязательно неверен: вы меняете долю решенных задач на объем, и правильный ответ зависит от того, стоит ли пропущенная задача больше доллара.
Что измерять
- Стоимость решенной задачи, а не попытки. Знаменатель — слитые PR, а не запросы.
- Коэффициент повторов для каждой модели. Модель с 1.4x на трети дороже своей списочной цены еще до учета всего остального.
- Токены на принятый diff, включая токены плана и самопроверки, которые diff не показывает.
- Минуты человеческой проверки. Модель на 12% дешевле, которая требует на 20% больше времени на проверку, оказывается дороже.
Итог
Публичные бенчмарки ранжируют способности на задачах, которые не похожи на ваш бэклог. Real-SWE — ранняя попытка честной версии. Пока вы не прогнали его на собственных репозиториях, рассматривайте каждое сравнение моделей как гипотезу о стоимости решенной задачи и оценивайте эту гипотезу по собственным счетчикам токенов.
По теме
- Реальная стоимость задачи: передовые модели
- Стоимость успешной задачи
- Стоимость тяжелой агентной разработки: Claude против Qwen
- Контроль стоимости оценок
- Ценообразование модели с открытыми весами
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →