Кодинг · Scale AI · 2025-09

SWE-bench Pro

SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?

Наследник SWE-bench, собранный так, чтобы задачи было трудно найти в обучающих данных: только GPL-репозитории плюс закрытые кодовые базы стартапов. Значительно сложнее Verified.

Что этот тест измеряет

Та же постановка, что у SWE-bench Verified — правка репозитория под описание проблемы, — но на задачах, требующих более длинной работы и на кодовых базах, которых модель почти наверняка не видела.

Защита от контаминации сделана юридически, а не технически: публичный срез набран исключительно из репозиториев под сильными копилефт-лицензиями вроде GPL. Такая лицензия работает как барьер против включения кода в обучающие корпуса. Коммерческий срез собран по договорённости со стартапами и не публиковался никогда.

Что внутри

Задач всего
1865
Публичный срез
731 задача, 11 репозиториев
Придержанный срез
858 задач, 12 репозиториев
Коммерческий срез
276 задач, 18 закрытых кодовых баз

Как считается балл

Доля решённых задач

Та же схема, что у Verified: доля задач, где после правки проходит скрытый тестовый набор.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

Не сравнивайте напрямую с Verified

Разрыв между ≈23% здесь и 70%+ на Verified — это разница в сложности набора, а не в качестве модели. Число «47,5 на SWE-bench Pro» и «70,6 на SWE-bench Verified» у одной модели не противоречат друг другу.

Публичный и приватный срезы дают разные лидерборды

У Scale три отдельных лидерборда — public, private и commercial. Если вендор пишет просто «SWE-bench Pro», уточняйте, какой срез: числа не взаимозаменяемы.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Кодинг»

Источники

Весь справочник — на витрине бенчмарков.