Агентность · HKUST NLP (ICLR 2026) · 2025-10

Toolathlon

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

Сто восемь задач в тридцати двух настоящих приложениях — от Google Calendar и Notion до Kubernetes и BigQuery. В среднем около двадцати ходов на задачу.

Что этот тест измеряет

Длинные многошаговые сценарии в реальном софте, а не в песочнице. Агент работает через 604 инструмента и должен довести дело до конца, переключаясь между приложениями.

Отличие от предшественников — не только реалистичные инструменты, но и реалистичные начальные состояния: курс в Canvas с десятками студентов, настоящая финансовая таблица. Модель не начинает с чистого листа, ей достаётся чужой беспорядок.

Что внутри

Задач
108
Приложений
32
Инструментов
604
Ходов на задачу
≈20 в среднем

Как считается балл

Доля решённых задач

Успех определяется исполнением: проверяется фактическое состояние приложений после работы агента, а не его отчёт о проделанном.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

DeepReinforce пишет «Toolathlon-Verified», а такого среза у авторов нет

В работе и репозитории HKUST NLP набор называется Toolathlon, без суффикса. Что именно означает «-Verified» в таблице Ornith — отобранное подмножество, собственный прогон или иную конфигурацию — не объясняется. Пока это не раскрыто, строку нельзя считать сопоставимой с числами из статьи.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Агентность»

Источники

Весь справочник — на витрине бенчмарков.