Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Weight Folding, CUDA Streams, and the Bug That Made My Model Speak Backwards — Filip Makraduli

Filip Makraduli presenterar FlashNorm, en optimering som snabbar upp RMS norm-lagret i transformermodeller med 33–35 procent.

Tricket är att vika normens vikt in i projektionsvikterna innan körning, skjuta upp divisionen så att GPU:ns olika enheter kan arbeta parallellt, och ta bort överflödig normalisering i nyare arkitekturer. När han implementerade detta i CUDA-kod upptäckte han en subtil bugg: modellen började repetera gamla utdata med en steg förskjutning. Problemet var en race condition mellan två parallella GPU-strömmar — den ena hade inte avslutats innan den andra läste från bufferten. Lösningen var att explicit markera slutet på varje ström och göra divisionssteget vänta på båda innan det fortsatte.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa