Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai
Gabriel Jorge Menezes från Krea.ai berättar hur man tränar stora AI-modeller på tusentals GPU:er.
Han visar att många standardmätningar är vilseledande — till exempel visade GPU-användningen 100 procent hela tiden även när klustret inte kördes effektivt, så istället följde han något som kallas tensor core utilization. När träningen kördes på större bilder (från 128 till 1024 pixlar) steg denna mätning märkbart. För att övervaka nätverkskommunikationen mellan servrar — en vanlig fehrkälla — byggde de egna verktyg eftersom inga färdiga lösningar fanns. En GPU som blir varmere än 78 grader dras omedelbar från systemet för att inte sakta ner hela träningen. Krea 2-modellen sparades ofta med checkpoints till en mycket snabb lagring som kunde skriva en terabyte på under 30 sekunder, så att träningen kunde återhämtas snabbt efter kraschar.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan