Skip to content
VibekollenBETAVibekollen
BloggGoogle DeepMind

Introducing agentic video understanding with Gemini

Bild från deepmind.google

Google DeepMind lanserar en ny funktion för videoanalys i Gemini-modellerna (3.7 Flash, 3.6 Flash och 3.5 Flash-Lite) som minskar energiförbrukningen med upp till 88 procent och kostnaderna med upp to 66 procent samtidigt som noggrannheten ökar med upp till 7 procent.

I stället för att analysera video i en fast takt analyserar denna "agentic" funktion intelligenta sökningar genom videofiler — den kan leta efter specifika ögonblick, upptäcka anomalier, eller räkna objekt utan att behöva ladda hela videon. Funktionen är tillgänglig nu via Gemini API och kommer snart till Gemini-appen för vanliga användare.

agentic video understanding pairs the model's core reasoning with native video tools to dynamically search, scan, and inspect target video segments across visual frames, audio, and transcripts.
Ordagrant ur artikeln hos Google DeepMind
Läs hela hos Google DeepMind →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Google DeepMind.

Mer att läsa