Profiling in PyTorch (Part 3): Attention is all you profile
Artikelbild eller återanvändbart omslag för Hugging Face
Det här är del tre i en serie om hur man läser profileringsdata från PyTorch — verktyg som visar vilka delar av kod som tar längst tid att köra.
Den här gången fokuserar de på attention-mekanismen, som är en viktig del av moderna AI-modeller. De visar hur attention består av några grundläggande operationer (matrismultiplikation, softmax och maskning), och hur man kan göra det snabbare genom att använda in-place-operationer — små ändringar som sparar både tid och minne. Till slut presenterar de PyTorchs färdiga SDPA-funktion, som redan är optimerad för detta.
In-place operations do not only save time (like we see in our case) but also memory (due to no extra copy) which is great for large tensors like logits!
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan