AI News Watcher
Wednesday, Jul 22, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Jul 22, 2026 · 2 min read · Luma AI ← Back to feed

Luma перевела свои сложные видеомодели Ray3.2 на AMD — 90% кода без изменений daily

Перенос занял несколько недель, а 90% кода удалось портировать на AMD Instinct MI325X без изменений и потери качества.

Luma перевела свои сложные видеомодели Ray3.2 на AMD — 90% кода без изменений
Редакция · Daily briefing

Обслуживать современные видеомодели, состоящие из десятков подмоделей, — сложная инженерная задача. Luma, разработчик флагманской модели Ray3.2 и платформы Luma Agents, перевела инференс своих самых требовательных рабочих нагрузок на GPU AMD Instinct MI325X при поддержке Tensorwave.

Luma перенесла инференс всех своих основных моделей — флагманской видеомодели Ray3.2, мультимодальной модели Uni-1 и платформы Luma Agents — на GPU AMD Instinct MI325X. Эти GPU, предоставленные партнером Tensorwave, теперь обслуживают тысячи запросов на генерацию текста, изображений, видео и мультимодальных данных.

Современные видеомодели, такие как Ray3.2, — это не единичные нейросети, а сложные пайплайны из множества подмоделей. В их числе вариационные автокодировщики, ControlNets, LoRA и основной денойзер. Каждая из них имеет уникальный профиль вычислений и требования к памяти. Ray3.2 способна переосмыслить обычную сцену в совершенно новый мир, сохраняя при этом исходную структуру и движение, что делает ее обслуживание особенно сложным.

Для таких многокомпонентных пайплайнов критически важны два параметра оборудования: объем памяти и скорость интерконнекта. AMD Instinct MI325X обеспечивает оба. Большая емкость VRAM позволяет держать все подмодели в памяти, избегая медленного переноса данных на CPU или избыточного шаринга по устройствам, который увеличивает объем коммуникаций. Быстрые интерконнекты AMD обеспечивают эффективность, когда обмен данными неизбежен.

Перенос кодовой базы Luma на AMD удивил команду своей простотой. PyTorch-бэкенд AMD позволил запустить около 90% кода сразу. Все стандартные операции PyTorch, используемые Luma, уже поддерживались. Кастомные сети для видео-в-видео контроля и низкоточные форматы, включая FP8, перенеслись без проблем. Даже кастомные ядра Triton заработали через AMD-бэкенд Triton'а без доработок.

Единственное ручное вмешательство потребовалось для операции внимания. Инженеры Luma перенаправили вызовы с собственной реализации на имплементацию AMD из библиотеки AITER и подтвердили, что производительность соответствовала ожиданиям.

Для мультимодальной модели Uni-1, которая требует KV-кэширования и использует уникальную дезагрегированную архитектуру, Luma полагалась на поддержку AMD FlashInfer. Потребовалась дополнительная помощь от команды AMD для достижения целевой производительности, но в итоге цель была достигнута.

Миграция всего видео-в-видео пайплайна до готовности к продакшену заняла 2–3 инженера и около двух недель. Работа над мультимодальной моделью, с ее дополнительной сложностью обслуживания, потребовала трех инженеров и примерно четырех недель. Большая часть этого времени, однако, была связана с общими задачами по выводу новой мультимодальной модели в продакшен, а не со спецификой AMD.

Самым важным результатом стало отсутствие регрессии в качестве. Человеческие оценщики подтвердили, что видео, сгенерированные на оборудовании AMD, неотличимы от тех, что ранее производились на других пайплайнах Luma.

Luma отметила развитую программную экосистему AMD. Помимо широкой поддержки PyTorch, открытый исходный код включает такие инструменты, как HipKittens, FlyDSL и AMD-бэкенд Triton'а, что дает инженерам несколько путей для написания и оптимизации кастомных ядер. Кастомный форк vLLM также работает на AMD. Поддержка со стороны AMD была последовательно отзывчивой.

Успешный перевод требовательных моделей Luma на AMD Instinct MI325X демонстрирует, что AMD становится жизнеспособной альтернативой для сложного инференса, особенно для многокомпонентных моделей видеогенерации. При этом ключевую роль сыграли не только аппаратные возможности, но и зрелая программная экосистема и оперативная инженерная поддержка со стороны AMD.

Дополнительные источники

  1. https://lumalabs.ai/learning-center/articles/welcome-to-luma-agents
  2. https://lumalabs.ai/learning-center/articles/ray-3-2-introduction-and-core-concepts
  3. https://tensorwave.com/
  4. semianalysis.com

Источники

  1. https://lumalabs.ai/news/luma-runs-production-inference-on-amd-and-tensorwave news
→ Опубликовано в Telegram: @agentic_ai_news/741