Рассуждение · Center for AI Safety и Scale AI · 2025-01

HLE

Humanity's Last Exam

Две с половиной тысячи вопросов по сотне с лишним дисциплин, собранных примерно тысячей экспертов специально так, чтобы модели на них ошибались. Ответ на русский не переводим: имя собственное.

Что этот тест измеряет

Потолок академических знаний и способность рассуждать на границе того, что вообще известно. Вопросы охватывают математику, физику, химию, биологию, медицину, информатику, гуманитарные и социальные науки — всего больше ста предметов.

Вклад внесли около тысячи специалистов из более чем пятисот организаций в пятидесяти странах: преимущественно профессора, исследователи и обладатели учёных степеней.

Набор мультимодальный: часть вопросов включает изображения.

Что внутри

Вопросов
2500
Предметов
более 100
Авторов
≈1000 экспертов из 500+ организаций

Как считается балл

Точность ответа

Доля правильных ответов. Замеряется в двух режимах: без доступа к инструментам и с доступом.

Где подвох

Набор специально отфильтрован против моделей

Если на этапе подготовки существующая модель отвечала на вопрос верно, вопрос выбрасывали. Это делает низкие абсолютные баллы ожидаемыми по построению: 20,2 без инструментов — не приговор модели, а свойство теста.

Режимы «с инструментами» и «без» несопоставимы

Разница между 20,2 и 30,5 у Ornith-1.5-9B — это не разброс замера, а два разных теста. Сравнивать чужие числа можно только внутри одного режима, и режим обязан быть указан.

Наши разборы с этим тестом

Значения — со слов вендоров моделей, своих замеров мы не делали.

Другие тесты в категории «Рассуждение»

Источники

Весь справочник — на витрине бенчмарков.