Кодинг · Авторы NL2Repo-Bench (ICML 2026) · 2025-12

NL2Repo

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

Самый жёсткий формат из кодовых: агент начинает с пустой папки и по одному документу требований должен собрать целую устанавливаемую Python-библиотеку.

Что этот тест измеряет

Не правку существующего кода, а создание проекта с нуля: агент сам проектирует архитектуру, разбирается с зависимостями, реализует логику в нескольких модулях и доводит результат до устанавливаемого пакета.

Спецификации получены обратной разработкой реальных открытых Python-проектов, под каждую задачу собрано отдельное Docker-окружение для проверки.

Что внутри

Задач
104
По сложности
26 лёгких · 46 средних · 32 тяжёлых
Категорий библиотек
9
Средняя длина входа
≈18,8 тыс. токенов

Как считается балл

Доля решённых задач

Задача засчитывается, если получившаяся библиотека собирается, устанавливается и проходит проверки в подготовленном Docker-окружении.

Где подвох

Проверяет выносливость, а не сообразительность

Задачи длинные по горизонту: провал чаще случается не от незнания, а от потери контекста и рассинхрона между модулями на середине пути. Поэтому результат сильно зависит от размера окна и качества управления контекстом.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Кодинг»

Источники

Весь справочник — на витрине бенчмарков.