Deep dive on LLM Inference at Scale — Harshul Jain, Audible & Tanmay Sah, Independent AI Researcher
Videon går igenom hur man kör stora språkmodeller effektivt på GPU:er — ett praktiskt problem många team stöter på.
Exempel: en vanlig modell kan behöva 42 GB minne bara för att lagra mellanresultat när 80 användare frågar samtidigt, vilket är varför servrar kraschar. Workshopen visar var flaskhalsen sitter (minne som växer med längre frågor, långsam första svar, låg genomströmning) och demonstrerar lösningar på två fronter: man kan göra själva modellen smalare genom tekniker som «flash attention», och man kan dela upp jobben smartare på servern genom «paged attention» och batch-bearbetning. Sist jämförs två populära servermotorer (vLLM och SGLang) och visar att de är likvärdiga för normalt bruk men vLLM är tre till fyra gånger snabbare när modellen tar egna beslut och grenar av sig.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan