Voice agents with Realtime Video — Sidney Primas, LemonSlice
Sidney Primas från LemonSlice visar hur man bygger AI-agenter med avatar och video som kan köra kontinuerligt i timmar.
Det svåraste är att video genereras frame för frame — varje ny bild baseras på tidigare bilder, och fel adderar sig över tid. LemonSlice löser det genom att träna modellen att bara titta bakåt (eftersom framtida frames inte finns än) och reducerar beräkningsstegen drastiskt. Ett överraskande problem är ljud: uttryck och mimik beror på hur ljudet analyseras, men de flesta ljudmodeller är tränade på entoniga ljudböcker, så de behövde bygga sin egen. Tjänsten kostar ungefär lika mycket att köra som en röstmodell, men den största framtida värdet ligger enligt Primas i hur man orkestrar beräkningarna över GPU och CPU utan att videon stottar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 7 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 7 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 8 tim sedan