Низкие абсолютные числа здесь — норма
Порог 1.0 означает полное совпадение с рубрикой, частичное понимание не засчитывается. Поэтому 20,6 у девятимиллиардной модели не «провал», а ожидаемый порядок величины: у сильных моделей тут ≈30%.
Кодинг · Scale AI · 2026-05
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution (срез Codebase QnA)
Единственный тест в наборе Ornith, где не надо ничего чинить: агента спрашивают о чужой кодовой базе и проверяют, понял ли он, как система устроена.
Глубокое понимание production-кода: трассировку выполнения через несколько файлов, объяснение архитектурных решений, ответы на технические вопросы о работающей системе.
Вопросы устроены так, что ответить из головы нельзя: нужно запустить софт, пройти по коду и свести найденное. Каждая задача идёт с вопросом, эталонным ответом эксперта, рубрикой оценки и Docker-образом репозитория на закреплённом коммите.
Пять категорий вопросов: архитектура и системный дизайн, поиск первопричины странного поведения, онбординг в незнакомую кодовую базу, безопасность и связанные с ней свойства.
Оценка по рубрике
Ответ сравнивается с эталонным ответом эксперта по рубрике. Строгий порог — 1.0, то есть полное соответствие рубрике.
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
Порог 1.0 означает полное совпадение с рубрикой, частичное понимание не засчитывается. Поэтому 20,6 у девятимиллиардной модели не «провал», а ожидаемый порядок величины: у сильных моделей тут ≈30%.
Значения — со слов вендоров моделей, своих замеров мы не делали.
Весь справочник — на витрине бенчмарков.