Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
Artikelbild eller återanvändbart omslag för Hugging Face
Hugging Face presenterar en ny metod kallad Quantization-Aware Healing (QAH) som kan återhämta prestanda i AI-modeller som har både komprimerat sin struktur och konverterats till låg precision (4-bit).
Istället för vanliga metoder som QAT eller QAD, distillerar QAH direkt från den ursprungliga, fullstor modellen snarare än från en redan skadad återhämtad version. När de tillämpade metoden på en 120B-modell komprimerad till 60B och kvantiserad till MXFP4, slog den 4-bit-versionen sin egen 16-bit-motsvarighet på 7 av 9 benchmarks — en overkslig omvändning av hur dessa modeller normalt presterar.
The 4-bit model ends up smaller, cheaper to run, and more accurate than the checkpoint it was quantized from.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 10 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan