Intelligent transcription with Gemini 3.5 Transcribe
Artikelbild eller återanvändbart omslag för Google Gemini
Google presenterar Gemini 3.5 Transcribe, en ny tal-till-text-modell som omvandlar röst direkt till korrekt, formaterad text.
Den hanterar bakgrundsbrus, specialutryck och naturliga talfel bättre än tidigare modeller — och kan till exempel ta bort fyllnadsord som "uhm", fixa självkorrigeringar och känna igen över 85 språk. Utvecklare kan använda den genom två API:er: en för direktströmmad tal och en för inspelad ljud, och den är redan integrerad i Googles appar som Gemini och Android Rambler.
Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Google Gemini.
Mer att läsa
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan
Can ‘super intelligence’ and a non-binding safety pact solve AI’s image problem?
TechCrunch AI för 14 tim sedan