Weight Folding, CUDA Streams, and the Bug That Made My Model Speak Backwards — Filip Makraduli
Filip Makraduli presenterar FlashNorm, en optimering som snabbar upp RMS norm-lagret i transformermodeller med 33–35 procent.
Tricket är att vika normens vikt in i projektionsvikterna innan körning, skjuta upp divisionen så att GPU:ns olika enheter kan arbeta parallellt, och ta bort överflödig normalisering i nyare arkitekturer. När han implementerade detta i CUDA-kod upptäckte han en subtil bugg: modellen började repetera gamla utdata med en steg förskjutning. Problemet var en race condition mellan två parallella GPU-strömmar — den ena hade inte avslutats innan den andra läste från bufferten. Lösningen var att explicit markera slutet på varje ström och göra divisionssteget vänta på båda innan det fortsatte.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan