Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Operating Distributed Inference Systems at Scale — Nishant Gupta & Naman Ahuja, Meta

Meta hanterar redan mer inferensanrop än världens största mikrotjänster, och volymen växer snabbast av alla arbetsbelastningar de kör.

Nishant Gupta jämför utvecklingen med molnets historia 2008: värdet rörde sig från enskilda virtuella maskiner till orkestrerare som kan hantera komplexitet. För AI-inferens händer samma förskjutning på några år. Det nya är kopplingar mellan lager — en beslut om vart en förfrågan ska skickas påverkar cacheminnet, som påverkar GPU-belastningen, som påverkar autoskalering. Naman Ahuja förklarar att inferens behöver sin egen kontrolplan, ungefär som virtuella maskiner behövde Kubernetes.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa