Making Knowledge Distillation Cheap Enough to Run at Scale
Artikelbild eller återanvändbart omslag för Hugging Face
Knowledge distillation — träning av mindre AI-modeller för att matcha större modellers prestanda — är dyrbar att genomföra i praktiken.
Forskare från Hugging Face har utvecklat två tekniker för att minska kostnaden drastiskt: att cacha lärarmodellens viktigaste förutsägelser en gång istället för att räkna om dem varje gång, och en ny sparsammare beräkningsmetod för träningsförlusten som aldrig håller hela ordförråds-matrisen i minnet samtidigt. Tillsammans minskar dessa förändringar minnesförbrukningen från omkring 250GB till omkring 128GB per träningssteg, vilket gör det möjligt att träna på en enda GPU istället för hundratals.
Our latest paper, Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss, tackles this with two systems changes: caching the teacher's top-K logits once so the teacher never has to sit in memory alongside the student, and a new, memory-efficient KL-divergence loss that avoids ever m
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 10 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan