Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Two Bugs That Hid in Plain Sight: A vLLM Debugging Detective Story — Asaf Gardin & Yuval Belfer

Asaf Gardin och Yuval Belfer berättar om två buggar de hittade i vLLM, ett verktyg för att köra stora språkmodeller snabbt.

Den första buggen gjorde att modellen ungefär en gång per tusen förfrågningar returnerade meningslös text — utan att krascha eller varna. De löste det genom att minska GPU-minnet för att reproducera felet, jämförde resultat mot en referensimplementering, och upptäckte att kernels kördes i fel ordning för fel förfrågan: decode innan prefill, vilket bara Mamba-modellen märkte eftersom den läser sitt cacheminne före den skriver. Den andra buggen orsakades av ett 32-bitars index som överflödade efter fyra miljarder — fixat genom att byta till en större datatyp. Båda buggorna gömde sig i Mamba-statens cache och väcktes av minnesbelastning.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa