AI-лаборатория · семейство Ornith · лицензия MIT
DeepReinforce — лаборатория, которая учит модели учить себя
Лаборатория обучения с подкреплением, которая сначала научилась ускорять чужой код, а потом применила тот же приём к обучению собственных моделей.
«We’re the DeepReinforce team, fascinated by everything that could lead us toward superintelligence.»
Кто основал
Джиуэй Ли
Jiwei Li · 李纪为
Исследователь NLP и предприниматель: PhD Стэнфорда, лауреат MIT Technology Review Innovators Under 35, профессор Чжэцзянского университета. Основал две компании — Shannon.AI, а затем DeepReinforce, чья команда выпустила семейство открытых моделей Ornith.
Полная карточка →Что о них известно
- Организация ornith-ai на Hugging Face держит 25 репозиториев моделей и два датасета (CUDA-L1 и CUDA-L2), у профиля 2 745 подписчиков.
- GitHub-организация ornith-ai заведена 17 июля 2025 года — за одиннадцать месяцев до первого публичного релиза Ornith.
- Всё семейство Ornith 1.5 выложено под MIT: коммерческое использование, дообучение и дистилляция разрешены без отдельного согласия.
- Линейка Ornith 1.0, вышедшая в июне 2026 года, за месяц набрала около 4,8 млн загрузок только на GGUF-сборке 9B — это не дебютант, которого никто не качает.
- Модели 1.5 выкладываются сразу пачкой форматов: BF16, GGUF, FP8, NVFP4 и MLX под Apple Silicon. Между релизом весов и запуском на ноутбуке нет паузы на комьюнити-квантизацию.
Данные Hugging Face API на 23 августа 2026. Разрыв между линейками обманчив: 1.0 копит загрузки третий месяц, 1.5 вышла пять дней назад. Судить о приёме новой модели по абсолютному числу пока нельзя.
От самостроительства лесов к самоулучшению
Обычный цикл дообучения упирается в людей: кто-то должен придумать задачи и написать под них оснастку. DeepReinforce убирает человека из всех трёх звеньев сразу.
Генерация задач
Модель предлагает себе новые задачи, опираясь на историю того, что у неё уже получалось и что нет. Задачи растут в сложности вместе с самой моделью.
Построение лесов
Под каждую задачу генерируется или уточняется свой scaffold — инструкции и стратегия решения. Раньше эту оснастку писали руками под каждый бенчмарк.
Прогоны решений
Политика выдаёт решения, а вознаграждение распространяется обратно сразу на все три стадии: и на постановщика задач, и на конструктора лесов, и на решателя.
Вознаграждение за задачу считается как произведение трёх множителей: валидность V, сложность на границе возможностей D и новизна N. Произведение, а не сумма — значит любой нулевой множитель обнуляет всю задачу: невалидная, слишком лёгкая или повторяющая уже пройденное задача не приносит ничего.
Хронология
Июль 2025
CUDA-L1 ↗
Контрастное обучение с подкреплением для оптимизации CUDA-ядер. Заявленный результат — средний прирост ×3,12 и медианный ×1,42 на всех 250 ядрах KernelBench, пиковые случаи до ×120.
Декабрь 2025
CUDA-L2 ↗
Продолжение: RL применяется к матричному умножению с целью обойти cuBLAS. Тема та же — не «писать код», а находить более быстрый код, чем написал человек.
Апрель 2026
GrandCode ↗
Агентный RL для спортивного программирования. Система заняла первое место в трёх подряд живых раундах Codeforces — 1087, 1088 и 1089, — обойдя всех участников-людей, включая грандмастеров.
Июнь 2026
Ornith 1.0 ↗
Первое семейство моделей: 397B, 35B и 9B. Собрано поверх Qwen3.5 и Gemma4 с дополнительным continued pretraining, mid-training и post-training. Идея self-scaffolding — модель сама строит себе строительные леса под задачу.
18 августа 2026
Ornith 1.5 ↗
Цикл замыкается: модель теперь не только строит леса, но и придумывает себе задачи, а вознаграждение считается по трём сигналам сразу — валидность, сложность относительно текущей границы возможностей и новизна.
Наши разборы их моделей
Чего мы про них не знаем
Этот блок существует, потому что соблазн заполнить пустоты чужими догадками велик, а цена ошибки — доверие. Ниже перечислено то, чего компания о себе не публикует. Мы не додумываем.
- Раунды и оценка. В открытых источниках цифры встречаются только в агрегаторах и пересказах; сама компания их не публикует.
- Численность команды. На Hugging Face в организации видно шесть участников — это состав профиля, а не штат.
- Юрлицо и адрес. Ни ornith.ai, ни профили на HF и GitHub не содержат ни адреса, ни реквизитов; сайт deep-reinforce.com отдаёт 403 при запросе без браузера.
- Состав обучающих данных. Указана только родословная — Qwen3.5 и Gemma4 плюс дополнительное обучение; сами корпуса не раскрыты.
Источники · сверено 23 августа 2026
- Профиль организации ornith-ai на Hugging Face
- Ornith-1.5: From Self-Scaffolding to Self-Improvement — блог Ornith
- CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning (arXiv)
- CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through RL (arXiv)
- GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic RL (arXiv)
- GitHub-организация deepreinforce-ai (CUDA-L1)
- Hugging Face API — метаданные 25 репозиториев ornith-ai
Соседние лаборатории — в общем каталоге.