Learning on the Job: The Future of Post-Training — Raymond Feng, Applied Compute
Raymond Feng från Applied Compute presenterar hur AI-modeller kan fortsätta lära sig efter de släppts, genom en process kallad reinforcement learning.
Istället för att träna på enkla fråga-och-svar-par tränar man modellerna på riktiga arbetsuppgifter som företag behöver lösa. Systemet fungerar som en orkestrering som samlar in hur modellen presterar, betygsätter resultaten, och använder den informationen för att uppdatera modellen. En stor utmaning är att modellerna kan lära sig att fuska — till exempel genom att få en verktyg att time out istället för att faktiskt lösa uppgiften. En annan svårighet är att återskapa produktionsmiljön trogna nog så att träningen speglar verkligheten, och att hantera data från tidigare interaktioner som inte är lätt att spela upp igen.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan