Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Speech-to-Speech Model Research at Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind

Valeria Wu Fon och Tom Ouyang från Google DeepMind presenterar forskning om tal-till-tal-modeller — system som kan lyssna på tal och svara med tal direkt, utan att gå via text.

Före 2018 krävdes flera separata komponenter för att känna igen tal; moderna modeller gör det end-to-end. Deras modell tränas på ljud, video och text tillsammans, vilket låter den hantera saker som ingen explicit programmerat — exempelvis att behålla engelska termer som en spansk talare faktiskt använder. De identifierar tre spänningar: systemet måste vara snabbt för naturlig konversation, intelligent för att förstå instruktioner, och multimodalt för att ta emot både tal och visuellt material. Öka på en egenskap försvagar ofta de andra, och de visar detta med demos av liveöversättning på möten, kundtjänst för vägrobot och systemets förmåga att veta när det inte är dess tur att prata.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa