Измеряет не модель, а пару «модель + харнесс»
Тест оценивает связку целиком: модель отвечает за рассуждение и генерацию, а харнесс — за управление контекстом, доступ к терминалу, вызов инструментов и восстановление после ошибок. Одна и та же модель под разными харнессами даёт разные баллы, и разрыв объясняется агентным циклом, а не самой моделью. Поэтому строку с этим тестом нельзя читать без указания харнесса.