The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
Сто восемь задач в тридцати двух настоящих приложениях — от Google Calendar и Notion до Kubernetes и BigQuery. В среднем около двадцати ходов на задачу.
Длинные многошаговые сценарии в реальном софте, а не в песочнице. Агент работает через 604 инструмента и должен довести дело до конца, переключаясь между приложениями.
Отличие от предшественников — не только реалистичные инструменты, но и реалистичные начальные состояния: курс в Canvas с десятками студентов, настоящая финансовая таблица. Модель не начинает с чистого листа, ей достаётся чужой беспорядок.
Что внутри
Задач
108
Приложений
32
Инструментов
604
Ходов на задачу
≈20 в среднем
Как считается балл
Доля решённых задач
Успех определяется исполнением: проверяется фактическое состояние приложений после работы агента, а не его отчёт о проделанном.
Ориентиры
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
38,6%Claude 4.5 Sonnetлучший результат на момент публикации, ≈20,2 вызова инструментов в среднем
20,1%DeepSeek-V3.2-Expлучшая модель с открытыми весами на тот момент
Где подвох
DeepReinforce пишет «Toolathlon-Verified», а такого среза у авторов нет
В работе и репозитории HKUST NLP набор называется Toolathlon, без суффикса. Что именно означает «-Verified» в таблице Ornith — отобранное подмножество, собственный прогон или иную конфигурацию — не объясняется. Пока это не раскрыто, строку нельзя считать сопоставимой с числами из статьи.