Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
Bild från huggingface.co
Hugging Face presenterar en ny metod kallad Quantization-Aware Healing (QAH) som kan återhämta prestanda i AI-modeller som har både komprimerat sin struktur och konverterats till låg precision (4-bit).
Istället för vanliga metoder som QAT eller QAD, distillerar QAH direkt från den ursprungliga, fullstor modellen snarare än från en redan skadad återhämtad version. När de tillämpade metoden på en 120B-modell komprimerad till 60B och kvantiserad till MXFP4, slog den 4-bit-versionen sin egen 16-bit-motsvarighet på 7 av 9 benchmarks — en overkslig omvändning av hur dessa modeller normalt presterar.
The 4-bit model ends up smaller, cheaper to run, and more accurate than the checkpoint it was quantized from.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 6 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
v2.1.267
Claude Code för 2 tim sedan