VideoAI Engineer
Voice Agents Can Just Do Things — Charlie Guo, OpenAI
Charlie Guo från OpenAI argumenterar att röstassistenter inte alltid behöver svara genom tal. Han pekar på att röstinteraktion finns i tre varianter — tal-till-tal (som gamla telefonväxlar), händelse-till-tal (som GPS), och tal-till-handling (där modellen utför saker istället för att svara). Den mest underskötta varianten är tal-till-handling: du talar och AI:n använder verktyg för att faktiskt göra något — fylla en regeringsformulär genom att prata i fem minuter istället för att skriva i en timme. Utvecklare kan enkelt bygga detta genom att exponera sin apps befintliga funktioner som verktyg som röstmodellen kan anropa.
15 sep. youtube.com