Compression at the Edge — Chris Alexiuk, NVIDIA
En paneldiskussion om hur man kan krympa stora AI-modeller utan att de blir dummare.
Huvudinsikten är att modellernas lager är väldigt olika viktiga — de första och sista är kritiska medan många mittlager nästan inte spelar någon roll. GLM 5.2 kunde minskas från 1,5 terabyte till 250 GB (86 procent mindre) utan motsvarande försämring. NVIDIA förespråkar NVFP4, ett kompakt format för tal som delar precisionsinfo mellan grupper om 16 värden. Panelen betonar att riktiga testningar i faktiska användarfall är viktigare än abstrakta mätningar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 7 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 7 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 8 tim sedan