Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.
AI-обработка оригинала Hugging Face Blog; редакция Hamidun News
Hugging Face 23 июля 2026 года выпустила Nunchaku Lite — нативную интеграцию 4-битного инференса диффузионных моделей в библиотеку Diffusers, которая снижает расход видеопамяти до 50% и ускоряет генерацию изображений примерно на 30%.
Что такое Nunchaku и SVDQuant
Nunchaku — это CUDA-движок инференса, реализующий метод квантизации SVDQuant для диффузионных трансформеров. Интеграция Nunchaku Lite впервые переносит эту технологию прямо в Diffusers: модель грузится обычным `from_pretrained()`, без отдельного pipeline и ручной компиляции, а нужные CUDA-ядра скачиваются автоматически через пакет `kernels` при первом запуске.
Ключевое отличие Nunchaku от большинства бэкендов — режим W4A4: в 4 бита сжимаются и веса, и активации. Обычные weight-only методы уменьшают память, но не ускоряют вычисления; здесь ускоряется сама петля денойзинга.
«SVDQuant переносит выбросы активаций в веса, представляет самую
тяжёлую часть каждой весовой матрицы небольшой 16-битной low-rank ветвью, а оставшийся остаток квантует до 4 бит», — говорится в техническом блоге Hugging Face.
Метод SVDQuant основан на статье, опубликованной в ноябре 2024 года на arXiv командой MIT HAN Lab. Для тяжёлых слоёв (attention и MLP) работает ядро `svdq_w4a4` с low-rank коррекцией, а для слоёв модуляции — `awq_w4a16` с 4-битными весами и 16-битными активациями.
Насколько ускоряется генерация
На видеокарте RTX PRO 6000 при разрешении 1024×1024 Nunchaku Lite даёт измеримый выигрыш по всем метрикам. Базовый прогон в BF16 занимает 3,00 секунды и 31,1 ГБ видеопамяти; в формате NVFP4 — уже 2,27 секунды и 20,6 ГБ.
- BF16 (эталон): 3,00 с, 31,1 ГБ памяти — ускорение 1,0x
- NVFP4: 2,27 с, 20,6 ГБ — ускорение 1,35x
- NVFP4 + torch.compile: 1,68 с, 20,6 ГБ — ускорение 1,8x
- NVFP4 + NF4-энкодер текста: 2,29 с, 16,0 ГБ памяти
- Модель ERNIE-Image-Turbo: 1024×1024 за ~1,7 с на RTX 5090 (~12 ГБ против ~24 ГБ в BF16)
Связка с `torch.compile` разгоняет генерацию до 1,8 раза, а замена текстового энкодера на NF4 роняет пик памяти до 16,0 ГБ — этого достаточно, чтобы запускать тяжёлые модели на потребительских картах.
Какое железо и модели поддержаны
Nunchaku Lite работает на большинстве современных NVIDIA-карт, но схема квантизации зависит от архитектуры. Формат NVFP4 через ядро `svdq_w4a4` требует Blackwell (RTX 50, RTX PRO 6000, B200), а на Turing, Ampere и Ada (RTX 30/40, A100, L40S) используется INT4. Архитектуры Volta и Hopper не поддерживаются — при загрузке валидатор сразу выдаёт понятную ошибку.
Готовые к запуску модели уже опубликованы в организации lite-infer на Hugging Face Hub: ERNIE-Image-Turbo (в вариантах INT4 и NVFP4), Krea 2 Turbo (NVFP4) и FLUX.2 Klein 4B. Для собственной квантизации команда выпустила инструментарий diffuse-compressor — он инспектирует модель, проводит калибровку SVDQuant, собирает Diffusers-pipeline и публикует результат на Hub.
Что это значит
4-битный инференс перестаёт быть уделом отдельных форков и приходит в основную библиотеку генерации изображений. Разработчики получают вдвое меньший расход VRAM и заметное ускорение фактически одной строкой кода — это делает флагманские диффузионные модели доступными на обычных игровых видеокартах.
Частые вопросы
На каких видеокартах работает Nunchaku Lite?
Формат NVFP4 требует карт Blackwell — RTX 50, RTX PRO 6000 или B200. На RTX 30/40, A100 и L40S работает схема INT4. Архитектуры Volta и Hopper не поддерживаются вовсе.
Насколько меньше видеопамяти нужно?
На RTX PRO 6000 пик VRAM падает с 31,1 ГБ в BF16 до 20,6 ГБ в NVFP4, а с NF4-энкодером текста — до 16,0 ГБ, то есть почти вдвое.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.