Разработка больших языковых моделей с триллионами параметров — дорогое и сложное предприятие. AI2 представила Olmo-core 3, открытый фреймворк, который переосмысливает обучение моделей с архитектурой Mixture-of-Experts (MoE, смесь экспертов), предлагая более эффективный и масштабируемый подход.
Ключевое улучшение Olmo-core 3 — это переработанная система обучения MoE, способная масштабироваться до триллиона параметров. Она призвана решить проблему растущих затрат и сложности координации при работе с MoE-моделями, позволяя увеличить число экспертов (специализированных компонентов) без пропорционального падения производительности.
Новая архитектура демонстрирует существенный прирост эффективности: в одном тесте 47-миллиардная MoE-модель показала 2.7-кратное увеличение пропускной способности (52 000 токенов в секунду на GPU против 19 400) по сравнению с предыдущей реализацией Olmo-core. Это стало возможным благодаря переходу на распределенное распараллеливание данных (DDP), которое удерживает экспертов на GPU и направляет к ним данные, избегая повторного сбора весов.
Фреймворк позволяет наращивать общую емкость модели, сохраняя при этом относительно фиксированное количество активных параметров на токен. Например, при увеличении пула экспертов с 8 до 128 (4 эксперта на токен, ~3.2B активных параметров) общая емкость выросла с 4.6B до 47B параметров, а пропускная способность снизилась менее чем на 5%.
Olmo-core 3 представляет собой шаг к демократизации разработки сверхбольших MoE-моделей, предлагая открытую и оптимизированную инфраструктуру, которая ранее была доступна лишь крупным игрокам. Однако AI2 не уточнила, когда именно эти возможности будут интегрированы в следующую версию самой модели Olmo.