Настойчивость и многошаговое рассуждение при поиске: нужную информацию приходится собирать по нескольким сайтам, а не брать из первой выдачи.
Вопросы созданы «наизнанку»: сначала человек находит проверяемый факт, потом придумывает к нему вопрос, ответ на который трудно найти. Затем вопрос проверяют на прочность — если его решает человек за десять минут или существующие модели, он выбывает.
Темы намеренно разношёрстные: технологии, искусство, спорт, география.
Что внутри
Вопросов
1266
Формат ответа
короткий, сверяется с эталоном
Порог отбора
человек не решает за 10 минут; GPT-4o и o1 не решают
Как считается балл
Точность ответа
Ответы короткие и сверяются с эталоном. Тест намеренно устроен так, что проверить ответ куда проще, чем найти его.
Ориентиры
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
1,9%Модель с доступом к браузеру, без агентной обвязкина момент публикации
51–78%Специализированные агентные системына момент публикации
Где подвох
Разрыв 1,9% против 78% — про обвязку, а не про модель
Это самый наглядный в подборке пример того, что доступ к инструменту сам по себе ничего не решает. Разницу делает агентный цикл: настойчивость, переформулировка запроса, возврат назад. Голая модель с браузером почти бесполезна.