Не сравнивайте напрямую с Verified
Разрыв между ≈23% здесь и 70%+ на Verified — это разница в сложности набора, а не в качестве модели. Число «47,5 на SWE-bench Pro» и «70,6 на SWE-bench Verified» у одной модели не противоречат друг другу.
Кодинг · Scale AI · 2025-09
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
Наследник SWE-bench, собранный так, чтобы задачи было трудно найти в обучающих данных: только GPL-репозитории плюс закрытые кодовые базы стартапов. Значительно сложнее Verified.
Та же постановка, что у SWE-bench Verified — правка репозитория под описание проблемы, — но на задачах, требующих более длинной работы и на кодовых базах, которых модель почти наверняка не видела.
Защита от контаминации сделана юридически, а не технически: публичный срез набран исключительно из репозиториев под сильными копилефт-лицензиями вроде GPL. Такая лицензия работает как барьер против включения кода в обучающие корпуса. Коммерческий срез собран по договорённости со стартапами и не публиковался никогда.
Доля решённых задач
Та же схема, что у Verified: доля задач, где после правки проходит скрытый тестовый набор.
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
Разрыв между ≈23% здесь и 70%+ на Verified — это разница в сложности набора, а не в качестве модели. Число «47,5 на SWE-bench Pro» и «70,6 на SWE-bench Verified» у одной модели не противоречат друг другу.
У Scale три отдельных лидерборда — public, private и commercial. Если вендор пишет просто «SWE-bench Pro», уточняйте, какой срез: числа не взаимозаменяемы.
Значения — со слов вендоров моделей, своих замеров мы не делали.
Весь справочник — на витрине бенчмарков.