Что этот тест измеряет
Все кандидаты так или иначе оценивают агентов вокруг экосистемы OpenClaw, но это разные наборы с разным составом, разным числом задач и разными метриками.
Что реально существует под близкими именами: claweval (35 задач в семи категориях — вызов инструментов, кодинг, рассуждение, письмо, исследование, память, скорость); Claw-Eval (300 задач в девяти категориях, проверенных людьми); ClawBench (оценивает всю связку целиком — харнесс, конфигурацию и модель); Claw-SWE-Bench (350 задач на issue-резолвинг, 8 языков, 43 репозитория).
Балл 66,5 у Ornith-1.5-9B может относиться к любому из них. Без указания набора это число не воспроизводимо и ни с чем не сравнимо.