Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
Bild från huggingface.co
Hugging Face har integrerat Nunchaku, en teknik för att göra bildgenereringsmodeller snabbare och mindre minnesintensiva, direkt i sitt Diffusers-bibliotek.
Nunchaku använder en metod kallad SVDQuant som komprimerar både vikterna och beräkningarna i modellen till 4-bitar, vilket minskar minnesanvändningen med upp till 50 procent samtidigt som det gör genereringen omkring 30 procent snabbare. Med den nya integrationen kan utvecklare ladda dessa optimerade modeller med en enkel kommando utan att behöva installera separata verktyg eller kompilera kod lokalt.
SVDQuant, the quantization method behind the popular Nunchaku inference engine, takes a different approach. It runs the main transformer layers with 4-bit weights and activations (W4A4), reducing memory while also speeding up the denoising loop.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 6 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
v2.1.267
Claude Code för 2 tim sedan