Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Vertical Mobility: Inference from MVP to Trillion-Parameter Workloads — Sitanshu Gupta, CoreWeave

Sitanshu Gupta från CoreWeave beskriver hur man bygger en inferensstapel — systemet som kör AI-modeller — som hanterar helt olika typer av arbete effektivt.

Det viktigaste insikten är att när användare skickar många frågor i följd är mycket av informationen densamma, vilket gör det mycket dyrare att bearbeta den första gången än senare gånger. CoreWeave erbjuder tre sätt att betala: serverless där du betalar per token utan att se hårdvaran, en mellanväg för kunder som vet sin trafik, och dedikerad där du själv styr allt. Systemet matchar fyra olika arbetsmönster — chattfrågor, agentbeslut, röst och video, samt batchjobb — mot varandra som Tetris för att utnyttja hårdvaran maximalt. Två viktiga optimeringar är att komprimera modellvikter till fyra bitar och träna snabba gissare på kundens egen data för att minska latens.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa