Справочник
Бенчмарки: что стоит за числом в таблице
Строка «NL2Repo 32,4» в карточке модели не значит ничего, пока не известно, что внутри теста, сколько там задач и как считается балл. Здесь каждый тест разобран отдельно: кто сделал, что проверяет, чем ограничен.
Названия тестов оставлены английскими: это имена собственные, по русскому переводу первоисточник не найти. Переводим суть, а не вывеску.
Кодинг
Правки в реальных репозиториях и работа в терминале: агенту дают issue или задачу, он меняет код, дальше решают тесты.
NL2Repo
Авторы NL2Repo-Bench (ICML 2026)
Самый жёсткий формат из кодовых: агент начинает с пустой папки и по одному документу требований должен собрать целую устанавливаемую Python-библиотеку.
Открытый
SWE Atlas — QnA
Scale AI
Единственный тест в наборе Ornith, где не надо ничего чинить: агента спрашивают о чужой кодовой базе и проверяют, понял ли он, как система устроена.
Открытый
SWE-bench Multilingual
Команда SWE-bench
Тот же формат, что у SWE-bench, но за пределами Python: 300 задач из 42 репозиториев на девяти языках. Набор намеренно небольшой, чтобы прогон был быстрым.
Открытый
SWE-bench Pro
Scale AI
Наследник SWE-bench, собранный так, чтобы задачи было трудно найти в обучающих данных: только GPL-репозитории плюс закрытые кодовые базы стартапов. Значительно сложнее Verified.
Частично закрытый
SWE-bench Verified
OpenAI совместно с командой SWE-bench
Отобранное вручную подмножество SWE-bench: 500 реальных issue из двенадцати Python-репозиториев, каждое со скрытым набором тестов. Самый цитируемый тест агентного кодинга.
Открытый
Terminal-Bench 2.1
Stanford University + Laude Institute
Тест на работу в командной строке: 89 задач, которые агент решает внутри контейнера, имея доступ к терминалу. Проверяется финальное состояние контейнера, а не текст ответа.
Открытый
Рассуждение
Закрытые вопросы уровня научной экспертизы. Проверяется не длина рассуждения, а верность единственного ответа.
GPQA Diamond
Авторы GPQA
Сто девяносто восемь вопросов по биологии, физике и химии, написанных обладателями PhD. Самый трудный срез GPQA: в него попали только те вопросы, где эксперты справились, а неэксперты — нет.
Открытый
HLE
Center for AI Safety и Scale AI
Две с половиной тысячи вопросов по сотне с лишним дисциплин, собранных примерно тысячей экспертов специально так, чтобы модели на них ошибались. Ответ на русский не переводим: имя собственное.
Открытый
Агентность
Вызов внешних инструментов, поиск в вебе и многошаговые сценарии, где никто не подсказывает следующий ход.
BrowseComp
OpenAI
1266 вопросов, ответ на каждый спрятан в вебе и требует нескольких переходов. Найти трудно, проверить легко — на этой асимметрии всё и построено.
Открытый
ClawEval
не установлен
Единственная строка в таблице Ornith, которую мы не смогли однозначно опознать. Оставляем страницу как есть — с описанием проблемы, а не с выдуманным ответом.
Неоднозначная идентификация
MCP-Atlas
Scale AI
Тысяча задач на живых MCP-серверах — не на заглушках. Проверяет, умеет ли агент сам найти нужный инструмент и связать несколько вызовов в цепочку.
Частично закрытый
Toolathlon
HKUST NLP (ICLR 2026)
Сто восемь задач в тридцати двух настоящих приложениях — от Google Calendar и Notion до Kubernetes и BigQuery. В среднем около двадцати ходов на задачу.
Открытый
WideSearch
ByteDance Seed
Зеркальная противоположность BrowseComp: не найти один труднодоступный факт, а собрать сотню легкодоступных и ничего не потерять.
Открытый