Кодинг · Scale AI · 2026-05

SWE Atlas — QnA

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution (срез Codebase QnA)

Единственный тест в наборе Ornith, где не надо ничего чинить: агента спрашивают о чужой кодовой базе и проверяют, понял ли он, как система устроена.

Что этот тест измеряет

Глубокое понимание production-кода: трассировку выполнения через несколько файлов, объяснение архитектурных решений, ответы на технические вопросы о работающей системе.

Вопросы устроены так, что ответить из головы нельзя: нужно запустить софт, пройти по коду и свести найденное. Каждая задача идёт с вопросом, эталонным ответом эксперта, рубрикой оценки и Docker-образом репозитория на закреплённом коммите.

Пять категорий вопросов: архитектура и системный дизайн, поиск первопричины странного поведения, онбординг в незнакомую кодовую базу, безопасность и связанные с ней свойства.

Что внутри

Задач
124
Репозиториев
11
Языков
4 — Go, Python, C, TypeScript
Системы
почтовые серверы, эмуляторы терминала, распределённое хранилище, платформы наблюдаемости, сканеры секретов

Как считается балл

Оценка по рубрике

Ответ сравнивается с эталонным ответом эксперта по рубрике. Строгий порог — 1.0, то есть полное соответствие рубрике.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

Низкие абсолютные числа здесь — норма

Порог 1.0 означает полное совпадение с рубрикой, частичное понимание не засчитывается. Поэтому 20,6 у девятимиллиардной модели не «провал», а ожидаемый порядок величины: у сильных моделей тут ≈30%.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Кодинг»

Источники

Весь справочник — на витрине бенчмарков.