Two Bugs That Hid in Plain Sight: A vLLM Debugging Detective Story — Asaf Gardin & Yuval Belfer
Asaf Gardin och Yuval Belfer berättar om två buggar de hittade i vLLM, ett verktyg för att köra stora språkmodeller snabbt.
Den första buggen gjorde att modellen ungefär en gång per tusen förfrågningar returnerade meningslös text — utan att krascha eller varna. De löste det genom att minska GPU-minnet för att reproducera felet, jämförde resultat mot en referensimplementering, och upptäckte att kernels kördes i fel ordning för fel förfrågan: decode innan prefill, vilket bara Mamba-modellen märkte eftersom den läser sitt cacheminne före den skriver. Den andra buggen orsakades av ett 32-bitars index som överflödade efter fyra miljarder — fixat genom att byta till en större datatyp. Båda buggorna gömde sig i Mamba-statens cache och väcktes av minnesbelastning.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 3 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 13 tim sedan
v0.40.0
Ollama för 13 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan