AI News Watcher
Friday, Oct 2, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Oct 02, 2026 · 1 min read · HuggingFace ← Back to feed

AI2 Olmo-core 3: ускоряет обучение триллионных MoE-моделей в 2.7 раза daily

Открытая архитектура MoE снижает затраты на разработку гигантских LLM и делает их доступнее.

AI2 Olmo-core 3: ускоряет обучение триллионных MoE-моделей в 2.7 раза
Редакция · Daily briefing

Разработка больших языковых моделей (LLM) с миллиардами параметров — дорогое удовольствие. AI2 представила Olmo-core 3, обновление своей открытой инфраструктуры, которое обещает сделать обучение моделей с архитектурой Mixture-of-Experts (MoE) на триллион параметров гораздо эффективнее.

Ключевое изменение в Olmo-core 3 — это переработанная система обучения MoE, способная масштабироваться до триллиона параметров. MoE-модели позволяют увеличить общую ёмкость модели, активируя лишь часть экспертов (специализированных компонентов) для каждого входного токена (единицы текста). Это снижает вычислительные затраты по сравнению с плотными моделями аналогичного размера, где активны все параметры.

Новая архитектура Olmo-core 3 основана на Distributed Data Parallelism (DDP) вместо прежней Fully Sharded Data Parallelism (FSDP). Это улучшает пропускную способность: в предварительных тестах на 47-миллиардной MoE-модели новая система показала прирост в 2.7 раза, обрабатывая 52 000 токенов в секунду на GPU против 19 400 у старой реализации.

Фреймворк включает несколько техник для распределения MoE по GPU-кластерам, таких как экспертный и пайплайн-параллелизм, а также оптимизации для маршрутизации и вычислений. Это позволяет сохранять высокую вычислительную эффективность даже при значительном увеличении пула экспертов (например, с 8 до 128) при почти неизменном количестве активных параметров на токен (около 3.2B). Инфраструктура уже протестирована на моделях с более чем триллионом параметров.

Olmo-core 3 продолжает миссию AI2 по демократизации доступа к инструментам для разработки LLM, предлагая открытое и высокопроизводительное решение для обучения MoE-моделей экстремального масштаба. Однако, детали о конкретных требованиях к оборудованию для достижения заявленных масштабов и производительности остаются в основном за кадром.

Дополнительные источники

  1. GitHub - allenai/OLMo-core: Building blocks for OLMo modeling and training
  2. EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
  3. ibm.com

Источники

  1. https://huggingface.co/blog/ServiceNow-AI/autosynthdata external
  2. https://huggingface.co/blog/allenai/olmocore3 external
→ Опубликовано в Telegram: @agentic_ai_news/1143