Hugging Face Blog→ оригинал

Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM

Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.

AI-обработка оригинала Hugging Face Blog; редакция Hamidun News
Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Источник: Hugging Face Blog. Коллаж: Hamidun News.
◐ Слушать статью

Hugging Face 23 июля 2026 года выпустила Nunchaku Lite — нативную интеграцию 4-битного инференса диффузионных моделей в библиотеку Diffusers, которая снижает расход видеопамяти до 50% и ускоряет генерацию изображений примерно на 30%.

Что такое Nunchaku и SVDQuant

Nunchaku — это CUDA-движок инференса, реализующий метод квантизации SVDQuant для диффузионных трансформеров. Интеграция Nunchaku Lite впервые переносит эту технологию прямо в Diffusers: модель грузится обычным `from_pretrained()`, без отдельного pipeline и ручной компиляции, а нужные CUDA-ядра скачиваются автоматически через пакет `kernels` при первом запуске.

Ключевое отличие Nunchaku от большинства бэкендов — режим W4A4: в 4 бита сжимаются и веса, и активации. Обычные weight-only методы уменьшают память, но не ускоряют вычисления; здесь ускоряется сама петля денойзинга.

«SVDQuant переносит выбросы активаций в веса, представляет самую

тяжёлую часть каждой весовой матрицы небольшой 16-битной low-rank ветвью, а оставшийся остаток квантует до 4 бит», — говорится в техническом блоге Hugging Face.

Метод SVDQuant основан на статье, опубликованной в ноябре 2024 года на arXiv командой MIT HAN Lab. Для тяжёлых слоёв (attention и MLP) работает ядро `svdq_w4a4` с low-rank коррекцией, а для слоёв модуляции — `awq_w4a16` с 4-битными весами и 16-битными активациями.

Насколько ускоряется генерация

На видеокарте RTX PRO 6000 при разрешении 1024×1024 Nunchaku Lite даёт измеримый выигрыш по всем метрикам. Базовый прогон в BF16 занимает 3,00 секунды и 31,1 ГБ видеопамяти; в формате NVFP4 — уже 2,27 секунды и 20,6 ГБ.

  • BF16 (эталон): 3,00 с, 31,1 ГБ памяти — ускорение 1,0x
  • NVFP4: 2,27 с, 20,6 ГБ — ускорение 1,35x
  • NVFP4 + torch.compile: 1,68 с, 20,6 ГБ — ускорение 1,8x
  • NVFP4 + NF4-энкодер текста: 2,29 с, 16,0 ГБ памяти
  • Модель ERNIE-Image-Turbo: 1024×1024 за ~1,7 с на RTX 5090 (~12 ГБ против ~24 ГБ в BF16)

Связка с `torch.compile` разгоняет генерацию до 1,8 раза, а замена текстового энкодера на NF4 роняет пик памяти до 16,0 ГБ — этого достаточно, чтобы запускать тяжёлые модели на потребительских картах.

Какое железо и модели поддержаны

Nunchaku Lite работает на большинстве современных NVIDIA-карт, но схема квантизации зависит от архитектуры. Формат NVFP4 через ядро `svdq_w4a4` требует Blackwell (RTX 50, RTX PRO 6000, B200), а на Turing, Ampere и Ada (RTX 30/40, A100, L40S) используется INT4. Архитектуры Volta и Hopper не поддерживаются — при загрузке валидатор сразу выдаёт понятную ошибку.

Готовые к запуску модели уже опубликованы в организации lite-infer на Hugging Face Hub: ERNIE-Image-Turbo (в вариантах INT4 и NVFP4), Krea 2 Turbo (NVFP4) и FLUX.2 Klein 4B. Для собственной квантизации команда выпустила инструментарий diffuse-compressor — он инспектирует модель, проводит калибровку SVDQuant, собирает Diffusers-pipeline и публикует результат на Hub.

Что это значит

4-битный инференс перестаёт быть уделом отдельных форков и приходит в основную библиотеку генерации изображений. Разработчики получают вдвое меньший расход VRAM и заметное ускорение фактически одной строкой кода — это делает флагманские диффузионные модели доступными на обычных игровых видеокартах.

Частые вопросы

На каких видеокартах работает Nunchaku Lite?

Формат NVFP4 требует карт Blackwell — RTX 50, RTX PRO 6000 или B200. На RTX 30/40, A100 и L40S работает схема INT4. Архитектуры Volta и Hopper не поддерживаются вовсе.

Насколько меньше видеопамяти нужно?

На RTX PRO 6000 пик VRAM падает с 31,1 ГБ в BF16 до 20,6 ГБ в NVFP4, а с NF4-энкодером текста — до 16,0 ГБ, то есть почти вдвое.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…