AI-лаборатория · семейство Ornith · лицензия MIT

DeepReinforce — лаборатория, которая учит модели учить себя

Лаборатория обучения с подкреплением, которая сначала научилась ускорять чужой код, а потом применила тот же приём к обучению собственных моделей.

«We’re the DeepReinforce team, fascinated by everything that could lead us toward superintelligence.»
Самоописание в профиле организации на Hugging Face

Кто основал

Джиуэй Ли

Jiwei Li · 李纪为

Исследователь NLP и предприниматель: PhD Стэнфорда, лауреат MIT Technology Review Innovators Under 35, профессор Чжэцзянского университета. Основал две компании — Shannon.AI, а затем DeepReinforce, чья команда выпустила семейство открытых моделей Ornith.

Полная карточка →

Что о них известно

Загрузки за месяц, тыс.
Ornith-1.0-9B-GGUF4766
Ornith-1.0-35B-GGUF3571
Ornith-1.0-9B2185
Ornith-1.5-9B-GGUF175
Ornith-1.5-9B15

Данные Hugging Face API на 23 августа 2026. Разрыв между линейками обманчив: 1.0 копит загрузки третий месяц, 1.5 вышла пять дней назад. Судить о приёме новой модели по абсолютному числу пока нельзя.

От самостроительства лесов к самоулучшению

Обычный цикл дообучения упирается в людей: кто-то должен придумать задачи и написать под них оснастку. DeepReinforce убирает человека из всех трёх звеньев сразу.

  1. Генерация задач

    Модель предлагает себе новые задачи, опираясь на историю того, что у неё уже получалось и что нет. Задачи растут в сложности вместе с самой моделью.

  2. Построение лесов

    Под каждую задачу генерируется или уточняется свой scaffold — инструкции и стратегия решения. Раньше эту оснастку писали руками под каждый бенчмарк.

  3. Прогоны решений

    Политика выдаёт решения, а вознаграждение распространяется обратно сразу на все три стадии: и на постановщика задач, и на конструктора лесов, и на решателя.

Вознаграждение за задачу считается как произведение трёх множителей: валидность V, сложность на границе возможностей D и новизна N. Произведение, а не сумма — значит любой нулевой множитель обнуляет всю задачу: невалидная, слишком лёгкая или повторяющая уже пройденное задача не приносит ничего.

Хронология

  1. Июль 2025

    CUDA-L1

    Контрастное обучение с подкреплением для оптимизации CUDA-ядер. Заявленный результат — средний прирост ×3,12 и медианный ×1,42 на всех 250 ядрах KernelBench, пиковые случаи до ×120.

  2. Декабрь 2025

    CUDA-L2

    Продолжение: RL применяется к матричному умножению с целью обойти cuBLAS. Тема та же — не «писать код», а находить более быстрый код, чем написал человек.

  3. Апрель 2026

    GrandCode

    Агентный RL для спортивного программирования. Система заняла первое место в трёх подряд живых раундах Codeforces — 1087, 1088 и 1089, — обойдя всех участников-людей, включая грандмастеров.

  4. Июнь 2026

    Ornith 1.0

    Первое семейство моделей: 397B, 35B и 9B. Собрано поверх Qwen3.5 и Gemma4 с дополнительным continued pretraining, mid-training и post-training. Идея self-scaffolding — модель сама строит себе строительные леса под задачу.

  5. 18 августа 2026

    Ornith 1.5

    Цикл замыкается: модель теперь не только строит леса, но и придумывает себе задачи, а вознаграждение считается по трём сигналам сразу — валидность, сложность относительно текущей границы возможностей и новизна.

Наши разборы их моделей

Чего мы про них не знаем

Этот блок существует, потому что соблазн заполнить пустоты чужими догадками велик, а цена ошибки — доверие. Ниже перечислено то, чего компания о себе не публикует. Мы не додумываем.

Источники · сверено 23 августа 2026

Соседние лаборатории — в общем каталоге.