Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

What's New in Inference Engineering — Philip Kiely, Baseten

Philip Kiely från Baseten beskriver hur inference engineering — processen att köra färdiga AI-modeller — utvecklas olika vägar för lokala datorer versus stora datacenter.

En teknik som TurboQuant, som minskar minneskravet för modeller, blev viral i mars, men Kiely visar att den är långsam för datacenter även om den fungerar bra hemma. Han presenterar tre huvudsakliga förbättringar: kvantisering (att göra modeller mindre genom att använda färre bitar per siffra), cacheoptimering (att lagra och komprimera beräkningsdata smart), och spekulation (att små hjälpmodeller gissar nästa tokens snabbt, vilket datacenter nu tränar speciellt för). Den största trenden är att dessa tekniker tränas upp som en egen process snarare än att appliceras efteråt.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa