Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai
Gabriel Jorge Menezes från Krea.ai berättar hur man tränar stora AI-modeller på tusentals GPU:er.
Han visar att många standardmätningar är vilseledande — till exempel visade GPU-användningen 100 procent hela tiden även när klustret inte kördes effektivt, så istället följde han något som kallas tensor core utilization. När träningen kördes på större bilder (från 128 till 1024 pixlar) steg denna mätning märkbart. För att övervaka nätverkskommunikationen mellan servrar — en vanlig fehrkälla — byggde de egna verktyg eftersom inga färdiga lösningar fanns. En GPU som blir varmere än 78 grader dras omedelbar från systemet för att inte sakta ner hela träningen. Krea 2-modellen sparades ofta med checkpoints till en mycket snabb lagring som kunde skriva en terabyte på under 30 sekunder, så att träningen kunde återhämtas snabbt efter kraschar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan