Разработка больших языковых моделей (LLM) с миллиардами параметров — дорогое удовольствие. AI2 представила Olmo-core 3, обновление своей открытой инфраструктуры, которое обещает сделать обучение моделей с архитектурой Mixture-of-Experts (MoE) на триллион параметров гораздо эффективнее.
Ключевое изменение в Olmo-core 3 — это переработанная система обучения MoE, способная масштабироваться до триллиона параметров. MoE-модели позволяют увеличить общую ёмкость модели, активируя лишь часть экспертов (специализированных компонентов) для каждого входного токена (единицы текста). Это снижает вычислительные затраты по сравнению с плотными моделями аналогичного размера, где активны все параметры.
Новая архитектура Olmo-core 3 основана на Distributed Data Parallelism (DDP) вместо прежней Fully Sharded Data Parallelism (FSDP). Это улучшает пропускную способность: в предварительных тестах на 47-миллиардной MoE-модели новая система показала прирост в 2.7 раза, обрабатывая 52 000 токенов в секунду на GPU против 19 400 у старой реализации.
Фреймворк включает несколько техник для распределения MoE по GPU-кластерам, таких как экспертный и пайплайн-параллелизм, а также оптимизации для маршрутизации и вычислений. Это позволяет сохранять высокую вычислительную эффективность даже при значительном увеличении пула экспертов (например, с 8 до 128) при почти неизменном количестве активных параметров на токен (около 3.2B). Инфраструктура уже протестирована на моделях с более чем триллионом параметров.
Olmo-core 3 продолжает миссию AI2 по демократизации доступа к инструментам для разработки LLM, предлагая открытое и высокопроизводительное решение для обучения MoE-моделей экстремального масштаба. Однако, детали о конкретных требованиях к оборудованию для достижения заявленных масштабов и производительности остаются в основном за кадром.