Кодинг · Stanford University + Laude Institute · 2026

Terminal-Bench 2.1

Terminal-Bench v2.1

Тест на работу в командной строке: 89 задач, которые агент решает внутри контейнера, имея доступ к терминалу. Проверяется финальное состояние контейнера, а не текст ответа.

Что этот тест измеряет

Агенту дают письменную инструкцию и специально собранный контейнер с нужными файлами, софтом и инструментами. Дальше он предоставлен сам себе: смотрит окружение, запускает команды, правит файлы, ставит пакеты и переделывает подход, если что-то не сошлось.

Когда агент останавливается, автоматические тесты проверяют, в каком состоянии он оставил контейнер. Оценивается результат работы, а не рассуждение о ней.

Задачи покрывают шесть областей: разработку, машинное обучение, безопасность, обработку данных, научные вычисления и системное администрирование.

Что внутри

Задач
89
Среда
Docker-контейнер на задачу, песочница e2b
Области
SWE · ML · security · data · scientific computing · sysadmin
Референсный харнесс
Terminus 2

Как считается балл

pass@1

pass@1, усреднённый по трём прогонам каждой задачи. Прогоны идут в изолированной песочнице e2b.

Где подвох

Измеряет не модель, а пару «модель + харнесс»

Тест оценивает связку целиком: модель отвечает за рассуждение и генерацию, а харнесс — за управление контекстом, доступ к терминалу, вызов инструментов и восстановление после ошибок. Одна и та же модель под разными харнессами даёт разные баллы, и разрыв объясняется агентным циклом, а не самой моделью. Поэтому строку с этим тестом нельзя читать без указания харнесса.

У Ornith-1.5-9B две строки, и это не опечатка

DeepReinforce публикует два замера: под Terminus-2 (46,2) и под Claude Code (47). Это один и тот же тест на одной и той же модели, прогнанный двумя разными обвязками. Сравнивать чужие числа можно только внутри одного харнесса.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Кодинг»

Источники

Весь справочник — на витрине бенчмарков.