CUDA-L1 / CUDA-L2 ↗
Обучение с подкреплением для автоматической оптимизации CUDA-ядер. CUDA-L1 заявляет средний ×3,12 и медианный ×1,42 прирост на 250 ядрах KernelBench.
Основатель DeepReinforce — лаборатории, которая выпустила Ornith
Jiwei Li · 李纪为
Исследователь NLP и предприниматель: PhD Стэнфорда, лауреат MIT Technology Review Innovators Under 35, профессор Чжэцзянского университета. Основал две компании — Shannon.AI, а затем DeepReinforce, чья команда выпустила семейство открытых моделей Ornith.
Основатель
AI-лаборатория, выпускающая CUDA-L1/L2, GrandCode и семейство моделей Ornith.
Faculty position
Чжэцзянский университет (Zhejiang University) ↗
Плюс позиция Adjunct Professor в Shanghai Institute for Advanced Study (SIAS).
Каждый пункт подтверждается источником из списка внизу страницы.
Обучение с подкреплением для автоматической оптимизации CUDA-ядер. CUDA-L1 заявляет средний ×3,12 и медианный ×1,42 прирост на 250 ядрах KernelBench.
Агентный RL для спортивного программирования: система заняла первое место в трёх подряд живых раундах Codeforces (1087, 1088, 1089), обойдя людей-грандмастеров.
Семейство открытых моделей под MIT: 397B MoE, 35B-A3B MoE и 9B dense. Основная идея — замкнуть цикл самоулучшения: модель сама придумывает задачи, сама строит под них строительные леса и сама учится на своих же прогонах.
Лаборатория, которую он основал, — DeepReinforce. Её модели разбираем в каталоге моделей.