Агентность · Scale AI · 2026-02

MCP-Atlas

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

Тысяча задач на живых MCP-серверах — не на заглушках. Проверяет, умеет ли агент сам найти нужный инструмент и связать несколько вызовов в цепочку.

Что этот тест измеряет

Компетентность в вызове инструментов через Model Context Protocol — стандарт, по которому агенты обнаруживают и дёргают внешние инструменты.

Ключевой приём: формулировка задачи намеренно не называет ни серверов, ни инструментов. Агент должен сам понять, что ему нужно, и оркестрировать от трёх до шести вызовов, в том числе через разные серверы.

Помимо итогового балла считаются внутренние диагностики: как агент искал инструмент, правильно ли заполнил параметры, не сломал ли синтаксис, восстановился ли после ошибки и насколько экономно работал.

Что внутри

Задач
1000 (500 публичных + 500 закрытых)
MCP-серверов
36 реальных
Инструментов
220
Вызовов на задачу
3–6, часто через разные серверы

Как считается балл

Оценка по рубрике

Оценка по рубрике на уровне отдельных утверждений: балл начисляется за каждый фактический тезис итогового ответа, который подтвердился. Это даёт частичный кредит и отвязывает оценку от многословности модели.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

Оценка на живых серверах не полностью детерминирована

Тест ходит в реальные MCP-серверы, а не в моки. Это его сила — и одновременно источник шума: доступность и поведение внешних сервисов меняются со временем, поэтому замеры разных месяцев строго сопоставимы не всегда.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Агентность»

Источники

Весь справочник — на витрине бенчмарков.