Кодинг · Авторы NL2Repo-Bench (ICML 2026) · 2025-12
NL2Repo
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
Самый жёсткий формат из кодовых: агент начинает с пустой папки и по одному документу требований должен собрать целую устанавливаемую Python-библиотеку.
Не правку существующего кода, а создание проекта с нуля: агент сам проектирует архитектуру, разбирается с зависимостями, реализует логику в нескольких модулях и доводит результат до устанавливаемого пакета.
Спецификации получены обратной разработкой реальных открытых Python-проектов, под каждую задачу собрано отдельное Docker-окружение для проверки.
Что внутри
Задач
104
По сложности
26 лёгких · 46 средних · 32 тяжёлых
Категорий библиотек
9
Средняя длина входа
≈18,8 тыс. токенов
Как считается балл
Доля решённых задач
Задача засчитывается, если получившаяся библиотека собирается, устанавливается и проходит проверки в подготовленном Docker-окружении.
Где подвох
Проверяет выносливость, а не сообразительность
Задачи длинные по горизонту: провал чаще случается не от незнания, а от потери контекста и рассинхрона между модулями на середине пути. Поэтому результат сильно зависит от размера окна и качества управления контекстом.