What's New in Inference Engineering — Philip Kiely, Baseten
Philip Kiely från Baseten beskriver hur inference engineering — processen att köra färdiga AI-modeller — utvecklas olika vägar för lokala datorer versus stora datacenter.
En teknik som TurboQuant, som minskar minneskravet för modeller, blev viral i mars, men Kiely visar att den är långsam för datacenter även om den fungerar bra hemma. Han presenterar tre huvudsakliga förbättringar: kvantisering (att göra modeller mindre genom att använda färre bitar per siffra), cacheoptimering (att lagra och komprimera beräkningsdata smart), och spekulation (att små hjälpmodeller gissar nästa tokens snabbt, vilket datacenter nu tränar speciellt för). Den största trenden är att dessa tekniker tränas upp som en egen process snarare än att appliceras efteråt.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan