Диффузионные модели, способные генерировать изображения высокого разрешения, обычно требуют 20–30 ГБ видеопамяти, что делает их недоступными для большинства обычных компьютеров. Hugging Face решил эту проблему, нативно интегрировав Nunchaku Lite в свою библиотеку Diffusers.
Интеграция Nunchaku Lite позволяет запускать эти модели с меньшим объемом памяти и повышенной скоростью инференса. В отличие от большинства методов квантизации, которые работают только с весами модели и лишь сокращают потребление VRAM, Nunchaku Lite использует метод SVDQuant. Он квантует как веса, так и активации до 4 бит (W4A4), что не только снижает требования к памяти, но и ускоряет процесс генерации.
Теперь загрузка моделей с Nunchaku Lite в Diffusers стала проще:
- Нативная загрузка — достаточно стандартной команды
from_pretrained, без необходимости устанавливать отдельные библиотеки для инференса или компилировать CUDA-ядра локально. - Автоматическая установка ядер — необходимые NVFP4-ядра загружаются из Hugging Face Hub при первом использовании через пакет
kernels. - Инструмент для квантизации — набор
diffuse-compressorпозволяет пользователям самостоятельно квантовать новые архитектуры и публиковать их как обычные репозитории Diffusers.
Например, при использовании ErnieImagePipeline с чекпойнтом Nunchaku Lite можно сгенерировать изображение 1024x1024 за 1.7 секунды на видеокарте RTX 5090, при этом пиковое потребление памяти составит около 12 ГБ. Для сравнения, аналогичный пайплайн в BF16-точности требует около 24 ГБ VRAM.
Интеграция Nunchaku Lite в Diffusers делает диффузионные модели доступнее, предлагая реальный прирост скорости и экономию памяти. Однако полные преимущества 4-битной квантизации NVFP4 пока доступны только владельцам новых видеокарт NVIDIA Blackwell (серии RTX 50, RTX PRO 6000, B200), что ограничивает массовое внедрение на старых поколениях GPU, для которых остаются доступны INT4-варианты.