Агентность · не установлен

ClawEval

Единственная строка в таблице Ornith, которую мы не смогли однозначно опознать. Оставляем страницу как есть — с описанием проблемы, а не с выдуманным ответом.

Что этот тест измеряет

Все кандидаты так или иначе оценивают агентов вокруг экосистемы OpenClaw, но это разные наборы с разным составом, разным числом задач и разными метриками.

Что реально существует под близкими именами: claweval (35 задач в семи категориях — вызов инструментов, кодинг, рассуждение, письмо, исследование, память, скорость); Claw-Eval (300 задач в девяти категориях, проверенных людьми); ClawBench (оценивает всю связку целиком — харнесс, конфигурацию и модель); Claw-SWE-Bench (350 задач на issue-резолвинг, 8 языков, 43 репозитория).

Балл 66,5 у Ornith-1.5-9B может относиться к любому из них. Без указания набора это число не воспроизводимо и ни с чем не сравнимо.

Что внутри

Кандидатов с похожим именем
минимум 4
Указан ли набор вендором
нет
Воспроизводимость
отсутствует

Как считается балл

Доля решённых задач

Методику указать невозможно: неясно, о каком именно наборе идёт речь.

Где подвох

Так выглядит бенчмарк, который нельзя проверить

Мы оставляем строку в таблице модели, потому что вендор её опубликовал, но помечаем и объясняем. Молча убрать неудобное число — значит подправить чужую таблицу; молча принять — значит выдать непроверяемое за проверенное. Правильный ход третий: показать и назвать проблему.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Агентность»

Источники

Весь справочник — на витрине бенчмарков.