Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

Artikelbild eller återanvändbart omslag för Hugging Face

Hugging Face presenterar en ny metod kallad Quantization-Aware Healing (QAH) som kan återhämta prestanda i AI-modeller som har både komprimerat sin struktur och konverterats till låg precision (4-bit).

Istället för vanliga metoder som QAT eller QAD, distillerar QAH direkt från den ursprungliga, fullstor modellen snarare än från en redan skadad återhämtad version. När de tillämpade metoden på en 120B-modell komprimerad till 60B och kvantiserad till MXFP4, slog den 4-bit-versionen sin egen 16-bit-motsvarighet på 7 av 9 benchmarks — en overkslig omvändning av hur dessa modeller normalt presterar.

The 4-bit model ends up smaller, cheaper to run, and more accurate than the checkpoint it was quantized from.
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.

Mer att läsa