Широкий сбор информации: агенту нужно найти много разрозненных, по отдельности простых фактов и разложить их в аккуратную структуру.
Сложность здесь не интеллектуальная, а операционная — масштаб, монотонность и требование полноты. Достаточно пропустить одну строку, чтобы результат перестал быть пригодным.
Двести задач: сто на английском и сто на китайском, из более чем пятнадцати предметных областей, построены на реальных пользовательских запросах.
Проверяются полнота и фактическая точность итоговой таблицы: каждый собранный элемент сверяется отдельно. Частичный сбор задачу не засчитывает.
Ориентиры
Числа приведены на момент публикации соответствующего источника и устаревают быстро. Нужны, чтобы понимать порядок величины, а не для сравнения моделей.
≈0%Более 10 агентных поисковых системна момент публикации; лучший результат — около 5%
Где подвох
Абсолютные числа несопоставимы со статьёй
В публикации ByteDance речь о полном успехе задачи, и там почти у всех ноль. Число 59,5 у Ornith-1.5-9B явно посчитано по другой метрике — вероятно, по доле верно собранных элементов, а не по доле полностью решённых задач. DeepReinforce методику не уточняет.