Hoppa till innehåll
VibekollenBETAVibekollen
BloggGoogle Gemini

Intelligent transcription with Gemini 3.5 Transcribe

Artikelbild eller återanvändbart omslag för Google Gemini

Google presenterar Gemini 3.5 Transcribe, en ny tal-till-text-modell som omvandlar röst direkt till korrekt, formaterad text.

Den hanterar bakgrundsbrus, specialutryck och naturliga talfel bättre än tidigare modeller — och kan till exempel ta bort fyllnadsord som "uhm", fixa självkorrigeringar och känna igen över 85 språk. Utvecklare kan använda den genom två API:er: en för direktströmmad tal och en för inspelad ljud, och den är redan integrerad i Googles appar som Gemini och Android Rambler.

Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.
Ordagrant ur artikeln hos Google Gemini
Läs hela hos Google Gemini →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Google Gemini.

Mer att läsa