Агентность · ByteDance Seed · 2025-08

WideSearch

WideSearch: Benchmarking Agentic Broad Info-Seeking

Зеркальная противоположность BrowseComp: не найти один труднодоступный факт, а собрать сотню легкодоступных и ничего не потерять.

Что этот тест измеряет

Широкий сбор информации: агенту нужно найти много разрозненных, по отдельности простых фактов и разложить их в аккуратную структуру.

Сложность здесь не интеллектуальная, а операционная — масштаб, монотонность и требование полноты. Достаточно пропустить одну строку, чтобы результат перестал быть пригодным.

Двести задач: сто на английском и сто на китайском, из более чем пятнадцати предметных областей, построены на реальных пользовательских запросах.

Что внутри

Задач
200 (100 EN + 100 ZH)
Областей
более 15
Формат ответа
структурированная таблица, проверяемая поэлементно

Как считается балл

Доля решённых задач

Проверяются полнота и фактическая точность итоговой таблицы: каждый собранный элемент сверяется отдельно. Частичный сбор задачу не засчитывает.

Ориентиры

Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.

Где подвох

Абсолютные числа несопоставимы со статьёй

В публикации ByteDance речь о полном успехе задачи, и там почти у всех ноль. Число 59,5 у Ornith-1.5-9B явно посчитано по другой метрике — вероятно, по доле верно собранных элементов, а не по доле полностью решённых задач. DeepReinforce методику не уточняет.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Агентность»

Источники

Весь справочник — на витрине бенчмарков.