Компетентность в вызове инструментов через Model Context Protocol — стандарт, по которому агенты обнаруживают и дёргают внешние инструменты.
Ключевой приём: формулировка задачи намеренно не называет ни серверов, ни инструментов. Агент должен сам понять, что ему нужно, и оркестрировать от трёх до шести вызовов, в том числе через разные серверы.
Помимо итогового балла считаются внутренние диагностики: как агент искал инструмент, правильно ли заполнил параметры, не сломал ли синтаксис, восстановился ли после ошибки и насколько экономно работал.
Что внутри
Задач
1000 (500 публичных + 500 закрытых)
MCP-серверов
36 реальных
Инструментов
220
Вызовов на задачу
3–6, часто через разные серверы
Как считается балл
Оценка по рубрике
Оценка по рубрике на уровне отдельных утверждений: балл начисляется за каждый фактический тезис итогового ответа, который подтвердился. Это даёт частичный кредит и отвязывает оценку от многословности модели.
Ориентиры
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
>50%Фронтирные моделина момент публикации; основные провалы — неверное использование инструмента и непонимание задачи
Где подвох
Оценка на живых серверах не полностью детерминирована
Тест ходит в реальные MCP-серверы, а не в моки. Это его сила — и одновременно источник шума: доступность и поведение внешних сервисов меняются со временем, поэтому замеры разных месяцев строго сопоставимы не всегда.