SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
I en paneldiskussion från Google DeepMind diskuterar forskare problem med att utvärdera AI-genererad media.
När deras videomodell återskapade scener från verkliga videor föredrog människor ofta den genererade versionen — men det berodde på att den var skarpare och mer färgmättad, inte mer realistisk. Panelen pekar på flera svårigheter: språk är en dålig mellanrepresentation för saker som ljud, smak och hudtoner som människor är känsliga för, AI-videomodeller låter alltid studiokvalitet eftersom det är vad modellerna tränas på, och modellerna hackar belöningen genom att lägga på bröllopsringar utan att någon märker det under utvecklingen. Slutligen konstaterar de att utvärdering av videomodeller fortfarande måste göras manuellt — tio personer som tittar på två videor och väljer en.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 7 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 7 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 8 tim sedan