Логотип DeepReinforce

DeepReinforce · Ornith 1.5

Релиз 18 августа 2026 г. · проверено 23 августа 2026 г.

Ornith-1.5-9B

Девятимиллиардная модель, которая училась на задачах, придуманных ею же самой.

Параметры

9,41 млрд

dense, BF16

Контекст

262 144

до ~1 млн с YaRN ×4

Лицензия

MIT

коммерческое использование разрешено

Вес в bf16

≈19 ГБ

5,63 ГБ в Q4_K_M

Что это за модель

Самый лёгкий представитель семейства Ornith 1.5 от DeepReinforce: dense-модель на 9,41 млрд параметров с окном 262 144 токена, режимом рассуждения, приёмом изображений и вызовом инструментов. Опубликована под MIT — веса можно брать в коммерческий продукт без переговоров. Главное отличие линейки не в размере, а в способе обучения: модель сама генерирует себе задачи, сама строит под них строительные леса и учится на собственных прогонах.

Тип параметров
Dense · 9,41 млрд

Все параметры активны на каждом токене — память считается по полному размеру.

Архитектура
Qwen3_5ForConditionalGeneration

Ornith-1.0 строился поверх Qwen3.5 и Gemma4 с дополнительным continued pretraining, mid-training и post-training. Ornith-1.5 продолжает эту же ветку.

Контекст
262 144 токенов

Штатное окно — 262 144 токена. До ~1 млн растягивается YaRN с factor 4.0; вендор честно предупреждает, что open-source-рантаймы применяют YaRN статически ко всем запросам, поэтому на обычных длинах качество слегка проседает.

Модальности
Текст · Код · Изображения на входе

Ход рассуждения по умолчанию открывается блоком <think>…</think>. Парсеры vLLM/SGLang выносят его в отдельное поле reasoning_content, так что в ответ он не протекает.

Лицензия
MIT

Разрешает коммерческое использование, дообучение и дистилляцию без отдельного согласия.

Размер весов
19 ГБ в BF16

Точное число из индекса safetensors на Hugging Face, а не округление из пресс-релиза.

Бенчмарки

Кодинг

Правки в реальных репозиториях и работа в терминале — то, ради чего модель ставят в агента.

БенчмаркOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B
Terminal-Bench 2.1Terminus-246,243,121,352,542,1
Terminal-Bench 2.1Claude Code4740,618,949,2
SWE-bench Verified70,669,453,273,452
SWE-bench Pro47,542,931,349,535,7
SWE-bench Multilingual54,45239,767,251,7
NL2Repo32,427,216,229,415,5
SWE Atlas — QnA20,617,99,215,5

Рассуждение

Закрытые вопросы уровня научной экспертизы. Проверяется не длина рассуждения, а верность единственного ответа.

БенчмаркOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B
HLEбез инструментов20,216,814,721,419,5
HLEс инструментами30,526,424,528,926,5
GPQA Diamond86,482,581,78684,3

Агентность

Вызов инструментов, поиск и работа в многошаговых сценариях без человека в цикле.

БенчмаркOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B
MCP-Atlas54,249,446,862,855
Toolathlon-Verified41,233,429,641,752,8
WideSearch59,555,853,660,154,2
BrowseComp56,444,841,562
ClawEval66,563,153,268,748,5

Все значения — из таблицы в карточке модели на Hugging Face. Прочерк означает, что вендор не публиковал замер для этой пары. Жирным в строке отмечен лучший результат, прочерк — замера нет. Название теста ведёт на разбор: что внутри набора и как считается балл.

Что мы заметили

График вендора противоречит его же таблице

В PNG-графике assets/ornith_9b_eval.png панель SWE-bench Pro показывает 8 у Ornith-1.5-9B и ровно 0 у всех трёх конкурентов. В HTML-таблице того же README — 47,5 / 42,9 / 31,3 / 49,5. Нули в графике физически невозможны для рабочих моделей: это дефект рендера, а не результат. Мы берём таблицу, а картинку публикуем с оговоркой.

Обещанного Mobile-варианта на Hub нет

Карточка описывает Ornith-1.5-9B как «edge-deployable на мобильных через квантованный вариант Ornith-1.5-9B-Mobile». На 23.08.2026 в организации ornith-ai 25 репозиториев, и репозитория с суффиксом -Mobile среди них нет. Ближайшее, что реально лежит и работает на телефоне и ноутбуке, — GGUF Q4_K_M на 5,63 ГБ и MLX-4bit на 5,04 ГБ.

Модель почти нигде не выигрывает у MoE вчетверо крупнее

Из 15 бенчмарков Ornith-1.5-9B обходит Qwen3.6-35B-A3B только на четырёх: NL2Repo, SWE Atlas — QnA, GPQA Diamond и HLE с инструментами. Правильная рамка — не «9B победила всех», а «9B подошла вплотную к 35B-MoE и уверенно обошла всё, что весит столько же».

Замеров с нашей стороны нет

Все числа в карточке — со слов DeepReinforce. Ни один бенчмарк мы не воспроизводили. Пока это не сделано, читать таблицу нужно как заявку вендора, а не как независимый результат.

График DeepReinforce: сравнение Ornith-1.5-9B с Ornith-1.0-9B, Qwen3.5-9B, Qwen3.6-35B-A3B и Gemma-4-31B по двенадцати бенчмаркам
Тот самый график из карточки модели (assets/ornith_9b_eval.png). Третья панель сверху — SWE-bench Pro — показывает 8 и три нуля; в таблице того же README на этом месте 47,5 / 42,9 / 31,3 / 49,5. Публикуем как есть, с пометкой. Источник: DeepReinforce.

Влезет ли на ваше железо

да1× H100 / A100 80 ГБ

Штатный сценарий вендора: bf16 плюс полное окно 262k.

частично1× RTX 4090 / 5090 24 ГБ

Веса bf16 (19 ГБ) влезают, но на KV-кэш почти ничего не остаётся. Для длинного контекста нужен FP8/AWQ или урезанное окно.

даMac 32 ГБ (Apple Silicon)

MLX 8bit ≈9,4 ГБ или GGUF Q6_K 7,36 ГБ — с запасом под контекст.

даНоутбук 16 ГБ RAM без GPU

GGUF Q4_K_M 5,63 ГБ на CPU. Скорость будет прогулочная, но модель поедет.

нетСмартфон

Обещанной сборки -Mobile в организации нет; Q4 на 5,63 ГБ в телефон штатно не кладётся.

Какие сборки существуют

СборкаРазмерКогда брать
BF16 (оригинал)≈19 ГБСервер с GPU, максимум качества
GGUF Q4_K_M5,63 ГБllama.cpp / Ollama на ноутбуке
GGUF Q8_09,53 ГБКогда Q4 уже видно на глаз
MLX 4bit5,04 ГБApple Silicon, LM Studio / mlx-lm
MLX 8bit≈9,4 ГБMac с 16+ ГБ единой памяти

В GGUF-репозитории лежит ещё и mmproj на 0,92 ГБ — это проектор зрения. Без него llama.cpp поднимет модель только как текстовую: картинки на вход перестанут работать.

Как запустить

Команды приведены как в карточке вендора. Минимальные версии рантаймов: Transformers ≥ 5.8.1 · vLLM ≥ 0.19.1 · SGLang ≥ 0.5.9.

vLLMvLLM ≥ 0.19.1
vllm serve ornith-ai/Ornith-1.5-9B \
  --served-model-name Ornith-1.5-9B \
  --host 0.0.0.0 --port 8000 \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.90 \
  --enable-prefix-caching \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_xml \
  --reasoning-parser qwen3 \
  --trust-remote-code
SGLangSGLang ≥ 0.5.9
python -m sglang.launch_server \
  --model-path ornith-ai/Ornith-1.5-9B \
  --served-model-name Ornith-1.5-9B \
  --host 0.0.0.0 --port 8000 \
  --context-length 262144 \
  --mem-fraction-static 0.85 \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3
OllamaЛокальный запуск в одну строку
ollama run ornith-1.5:9b
llama.cppOpenAI-совместимый сервер из GGUF
llama-server -hf hf.co/ornith-ai/Ornith-1.5-9B-GGUF --port 8000 -c 262144

Рекомендованный сэмплинг

Общие задачи
temperature 1.0 · top_p 0.95 · top_k 20 · min_p 0.0 · presence_penalty 1.5 · repetition_penalty 1.0
Точный код
temperature 0.6 · top_p 0.95 · top_k 20 · min_p 0.0 · presence_penalty 0.0 · repetition_penalty 1.0

Во что её ставят

Когда стоит брать

  • Локальный агент для кода, которому нельзя выпускать репозиторий в чужое облако.
  • Стенд, где нужен OpenAI-совместимый эндпоинт без счёта за токены.
  • Дообучение под свой домен: MIT снимает юридический вопрос ещё до старта.
  • Разбор больших логов и монорепозиториев — окно 262k покрывает почти любой контекст без RAG.

Когда не стоит

  • Задачи, где важен верхний потолок качества, — там всё ещё 397B или закрытые флагманы.
  • Продакшен без собственных замеров: заявленные цифры пока никем, кроме вендора, не подтверждены.
  • Мобильные сценарии «из коробки»: обещанной сборки для телефонов на Hub нет.

Семейство Ornith 1.5

Частые вопросы

Что такое Ornith-1.5-9B и кто её сделал?+
Это открытая языковая модель на 9,41 млрд параметров, выпущенная 18 августа 2026 года командой DeepReinforce — AI-лабораторией, основанной Джиуэй Ли (Jiwei Li). Модель опубликована на Hugging Face под лицензией MIT и входит в семейство Ornith 1.5 вместе с версиями на 397B и 35B-A3B.
Чем Ornith-1.5 отличается от обычной дообученной Qwen?+
Архитектурно это ветка Qwen3.5 (класс Qwen3_5ForConditionalGeneration). Отличие в способе обучения: вместо фиксированного набора человеческих задач модель сама генерирует новые задачи, сама строит под них строительные леса (scaffold) и учится на собственных прогонах через обучение с подкреплением. Вознаграждение считается как произведение трёх сигналов — валидности, сложности относительно текущей границы возможностей и новизны.
Какое железо нужно, чтобы её запустить?+
В bf16 модель весит около 19 ГБ и штатно разворачивается на одной карте 80 ГБ вместе с полным окном в 262 144 токена. На 24 ГБ веса влезают, но контекст придётся урезать. Для ноутбука есть GGUF Q4_K_M на 5,63 ГБ и MLX-4bit на 5,04 ГБ — этого хватает Mac с 16 ГБ единой памяти.
Можно ли использовать её в коммерческом продукте?+
Да. Лицензия MIT разрешает коммерческое использование, модификацию и распространение, включая дообучение и дистилляцию, без отдельного согласия правообладателя.
Насколько можно верить заявленным бенчмаркам?+
Это цифры вендора, независимой проверки на 23 августа 2026 года нет. Больше того, собственный график DeepReinforce противоречит собственной же таблице на SWE-bench Pro (8 против 47,5), что стоит держать в голове. До своих замеров таблицу правильно читать как заявку, а не как результат.
Работает ли она с картинками?+
Да, модель принимает изображения на вход — на Hugging Face у неё стоит тег image-text-to-text, а в GGUF-репозитории лежит отдельный файл проектора зрения mmproj на 0,92 ГБ. Без загрузки mmproj llama.cpp поднимет модель только в текстовом режиме.

Источники