Vertical Mobility: Inference from MVP to Trillion-Parameter Workloads — Sitanshu Gupta, CoreWeave
Sitanshu Gupta från CoreWeave beskriver hur man bygger en inferensstapel — systemet som kör AI-modeller — som hanterar helt olika typer av arbete effektivt.
Det viktigaste insikten är att när användare skickar många frågor i följd är mycket av informationen densamma, vilket gör det mycket dyrare att bearbeta den första gången än senare gånger. CoreWeave erbjuder tre sätt att betala: serverless där du betalar per token utan att se hårdvaran, en mellanväg för kunder som vet sin trafik, och dedikerad där du själv styr allt. Systemet matchar fyra olika arbetsmönster — chattfrågor, agentbeslut, röst och video, samt batchjobb — mot varandra som Tetris för att utnyttja hårdvaran maximalt. Två viktiga optimeringar är att komprimera modellvikter till fyra bitar och träna snabba gissare på kundens egen data för att minska latens.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 3 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 13 tim sedan
v0.40.0
Ollama för 13 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan