Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Voice Agents Can Just Do Things — Charlie Guo, OpenAI

Charlie Guo från OpenAI argumenterar att röstassistenter inte alltid behöver svara genom tal.

Han pekar på att röstinteraktion finns i tre varianter — tal-till-tal (som gamla telefonväxlar), händelse-till-tal (som GPS), och tal-till-handling (där modellen utför saker istället för att svara). Den mest underskötta varianten är tal-till-handling: du talar och AI:n använder verktyg för att faktiskt göra något — fylla en regeringsformulär genom att prata i fem minuter istället för att skriva i en timme. Utvecklare kan enkelt bygga detta genom att exponera sin apps befintliga funktioner som verktyg som röstmodellen kan anropa.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa