qvib.pro
EN

Mixture-of-Kittens: open-source MoE мегакернел для NVL72

Mixture-of-Kittens: open-source MoE мегакернел для NVL72

Cursor выпустил Mixture-of-Kittens (MoK), высокооптимизированный open-source мегакернел для обучения моделей Mixture-of-Experts (MoE) на NVL72. Этот релиз направлен на устранение узких мест в производительности и повышение эффективности обучения крупномасштабных ИИ-моделей. MoK уже используется в продакшн-стеке Cursor, обеспечивая значительное ускорение.

Что произошло

Mixture-of-Kittens (MoK) — это мегакернел, разработанный Cursor для NVL72, который объединяет всю коммуникацию и вычисления MoE в единое, полностью детерминированное ядро. Это решение позволило увеличить пропускную способность токенов в секунду на 1.41x в продакшн-среде Cursor, работающей на нескольких стойках NVL72. MoK теперь является основой для обучения Composer на десятках тысяч GPU. Cursor утверждает, что MoK достигает передовой производительности по сравнению с публично доступными реализациями.

MoK был полностью открыт для сообщества, что позволяет исследователям и лабораториям более эффективно обучать модели. Разработчики Cursor отмечают, что агенты сыграли ключевую роль в создании MoK, автоматизируя простые задачи и помогая в более сложных, таких как написание распределенного MoE мегакернела. Это подчеркивает растущую роль ИИ-агентов в оптимизации низкоуровневого кода и разработке высокопроизводительных систем.

Почему это важно

Open-source выпуск MoK имеет огромное значение для ИИ-сообщества, поскольку он снижает барьер для исследований и позволяет большему числу лабораторий эффективно обучать крупномасштабные MoE-модели. Увеличение пропускной способности токенов в секунду на 41% по сравнению с предыдущими решениями означает, что модели могут быть обучены быстрее и с меньшими затратами ресурсов. Это особенно актуально для моделей, требующих огромных вычислительных мощностей, таких как MoE, которые становятся все более популярными.

Интересно отметить, что Cursor использовал ИИ-агентов для разработки MoK. Это демонстрирует, как ИИ может быть использован для создания высокооптимизированного низкоуровневого кода, который традиционно требовал значительных усилий от инженеров-специалистов. Способность агентов генерировать state-of-the-art ядра, получая правильные указания по дизайну, открывает новые возможности для автоматизации оптимизации производительности и ускорения разработки ИИ-систем.

Что это значит на практике

  • Ускорение обучения MoE-моделей: Разработчики и исследователи, использующие MoE-модели на NVL72, могут значительно сократить время обучения и вычислительные затраты, интегрировав MoK в свои рабочие процессы.
  • Доступ к передовым оптимизациям: Open-source характер MoK позволяет любому желающему изучать, модифицировать и адаптировать его под свои нужды, что способствует распространению лучших практик в области высокопроизводительных вычислений для ИИ.
  • Новые возможности для ИИ-агентов: Пример использования агентов для создания MoK показывает, что ИИ может не только писать высокоуровневый код, но и оптимизировать низкоуровневые ядра, что открывает путь к полностью автономной разработке высокопроизводительных систем.
  • Снижение затрат на исследования: Повышение эффективности обучения позволяет исследователям проводить больше экспериментов и быстрее итерировать, не требуя при этом пропорционального увеличения вычислительных ресурсов.
  • Развитие экосистемы NVL72: MoK, будучи оптимизированным для NVL72, способствует более полному использованию потенциала этой аппаратной платформы, что важно для тех, кто инвестирует в инфраструктуру NVIDIA.

Источники

Ещё по теме «Опенсорс»

Разобраться глубже