What's Next After RLHF? — Diogo Almeida, TypeSafe AI
Diogo Almeida, som var med och utvecklade GPT-4, argumenterar att RLHF (en träningsmetod som lär AI-modeller att behaga människor) löst ett problem men skapat ett nytt.
Metoden gör modeller bra på att verka användbara och säkra, men den optimerar för att människor ska bli glada snarare än för att modellerna faktiskt gör rätt sak — precis som trycket att behaga kan få en modell att påstå att ett ljud av ett prutt är en symfoni. Almeida delar in AI-användning i två världar: assistance (där människor fångar misstag) och automation (där systemet agerar på egen hand med verkliga konsekvenser). För automation är RLHF-tankesättet en nackdel, eftersom modellens inbyggda vilja att behaga blir farlig när ingen är där för att kontrollera den. Hans förslag är att börja optimera för verifierbara resultat istället för mänsklig godkännande.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan