Агентность · OpenAI · 2025-04

BrowseComp

BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents

1266 вопросов, ответ на каждый спрятан в вебе и требует нескольких переходов. Найти трудно, проверить легко — на этой асимметрии всё и построено.

Что этот тест измеряет

Настойчивость и многошаговое рассуждение при поиске: нужную информацию приходится собирать по нескольким сайтам, а не брать из первой выдачи.

Вопросы созданы «наизнанку»: сначала человек находит проверяемый факт, потом придумывает к нему вопрос, ответ на который трудно найти. Затем вопрос проверяют на прочность — если его решает человек за десять минут или существующие модели, он выбывает.

Темы намеренно разношёрстные: технологии, искусство, спорт, география.

Что внутри

Вопросов
1266
Формат ответа
короткий, сверяется с эталоном
Порог отбора
человек не решает за 10 минут; GPT-4o и o1 не решают

Как считается балл

Точность ответа

Ответы короткие и сверяются с эталоном. Тест намеренно устроен так, что проверить ответ куда проще, чем найти его.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

Разрыв 1,9% против 78% — про обвязку, а не про модель

Это самый наглядный в подборке пример того, что доступ к инструменту сам по себе ничего не решает. Разницу делает агентный цикл: настойчивость, переформулировка запроса, возврат назад. Голая модель с браузером почти бесполезна.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Агентность»

Источники

Весь справочник — на витрине бенчмарков.