В генерации AI-видео долгое время приходилось выбирать: либо высокое качество, либо быстрая скорость. Fal H3 Max впервые нарушает это правило, создавая 5-секундные ролики менее чем за 3 секунды, при этом опережая конкурентов по качеству.
Модель H3 Max генерирует 5-секундное видео за 2.78 секунды. Это на 180% быстрее, чем оригинальная MiniMax H3, которая тратила на аналогичную задачу 53.20 секунды. По результатам оценки предпочтений пользователей, H3 Max занимает первое место среди двенадцати видеомоделей по качеству, пониманию промптов и эстетике. Независимые бенчмарки от Artificial Analysis и Design Arena подтверждают лидерство fal.
Такие показатели стали возможны благодаря комплексной оптимизации как самой модели, так и инфраструктуры fal. Платформа состоит из трёх слоев:
- fal Compute — предоставляет инфраструктуру для обучения, включая кластеры из 16 и более узлов, объединенных через RDMA (удалённый прямой доступ к памяти) для длительных задач.
- fal Serverless — обеспечивает развертывание и обслуживание обученных моделей, обрабатывая миллиарды запросов в день через тысячи эндпоинтов. Эта система четыре года «обкатывалась» на внутренних командах fal. Она отвечает за автоскейлинг, управление очередями и обработку холодных стартов.
- fal Model APIs — предоставляет более 1300 эндпоинтов через единый программный интерфейс. Например, вызов
minimax/h3-max/image-to-videoиспользует этот API, а вся инфраструктура ниже (очереди, автоскейлинг, обработка ошибок) скрыта от пользователя.
Fal делает важное различие между двумя типами задержки. Задержка вывода (inference latency) — это время, которое требуется для одной генерации на уже запущенном GPU. Она зависит в основном от самой модели. Сквозная задержка (end-to-end latency) — это реальное время ожидания пользователя, которое включает в себя время в очереди и холодные старты (запуск новой инстанции модели). Первая является проблемой модели, а вторая — проблемой инфраструктуры, которую решает fal Serverless.
На рынке генерации видео существуют такие крупные игроки, как Runway ML Gen-3 Alpha и Pika Labs. Runway Gen-3 Alpha выделяется кинематографическим качеством (4K, 48 кадров в секунду) и детализированным контролем. Pika Labs фокусируется на быстрой итерации и стилистическом разнообразии для социальных сетей. H3 Max от fal предлагает сочетание, которое ранее было недоступно: высокое качество при скорости, которая превосходит конкурентов.
H3 Max демонстрирует, что прорывы в генеративном видео могут быть достигнуты не только за счёт увеличения размеров моделей, но и благодаря глубокой системной инженерии. Способность fal одновременно улучшать модель и создавать под неё масштабируемую, низколатентную инфраструктуру указывает на новый подход в индустрии.