The Pulse
Google aggiunge a Gemini la comprensione agentica dei video
Google DeepMind ha aggiunto la comprensione agentica dei video a Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. La funzionalità permette a Gemini di cercare dinamicamente nei video, riducendo l’uso di token fino all’88% e i costi di analisi

AI.info Team ·
Google afferma che la sua nuova funzionalità agentica per i video riduce il consumo di token fino all’88%, abbassa i costi di analisi fino al 66% e migliora l’accuratezza fino al 7%. La funzionalità, annunciata il 1° settembre, permette a Gemini di cercare nei video invece di elaborare ogni momento a una frequenza di campionamento fissa.
La comprensione agentica dei video è disponibile tramite l’API Gemini in Google AI Studio e Gemini Enterprise Agent Platform. Google la sta introducendo su Gemini 3.7 Flash, Gemini 3.6 Flash e Gemini 3.5 Flash-Lite, senza costi aggiuntivi per la funzionalità oltre alla tariffazione standard dei token dell’API Gemini. L’annuncio di Google DeepMind afferma che il sistema funziona con i video caricati e con i video pubblici di YouTube.
L’88% di token in meno per i video lunghi
L’elaborazione standard dei video di Gemini estrae fotogrammi a una frequenza fissa, con un fotogramma al secondo come impostazione predefinita. Gli sviluppatori possono modificare la frequenza, ma una strategia di campionamento fissa comporta un compromesso: elaborare più fotogrammi fa aumentare i costi e l’uso di token, mentre elaborarne meno può far perdere movimenti rapidi, brevi cambi di scena o piccoli dettagli visivi.
L’elaborazione agentica modifica la sequenza. Gemini può decidere quali parti di un video meritano un esame più attento, quindi richiedere fotogrammi, audio o trascrizioni di quelle sezioni. Google afferma che questo approccio è particolarmente utile per video che vanno da tutorial di 10 minuti a lezioni di 90 minuti e registrazioni della durata di diverse ore.
«La comprensione agentica dei video permette a Gemini di assumere un ruolo attivo e orientato a un obiettivo nel determinare cosa guardare, a quale velocità e attraverso quale modalità (fotogrammi, audio o trascrizione), recuperando solo i momenti e i segnali necessari», scrivono nell’annuncio Rohan Doshi, senior product manager di Google DeepMind, e Mario Lučić, direttore della ricerca di Google DeepMind.
Gemini sceglie dove guardare
Il sistema funziona attraverso un ciclo agentico. L’utente fornisce un video e una domanda; Gemini individua le prove di cui ha bisogno, carica la parte pertinente del video e può esaminarla con una diversa frequenza dei fotogrammi o attraverso un’altra modalità. Il modello può combinare fotogrammi visivi con audio e trascrizioni, invece di trattare l’intero file come un flusso campionato in modo uniforme.
Google afferma che questo processo permette di svolgere diverse attività con maggiore precisione rispetto all’analisi a frequenza fissa. Gemini può recuperare un momento con una risoluzione inferiore al secondo, individuare anomalie ricampionando un breve intervallo di tempo, contare movimenti o oggetti ripetuti e cercare un evento specifico in registrazioni lunghe senza caricare l’intero video nel contesto.
Le dichiarazioni dell’azienda sui benchmark riguardano tutti e tre i modelli annunciati per la funzionalità; Gemini 3.7 Flash offre la qualità complessiva più elevata e il miglior equilibrio testato tra accuratezza e costo. Google non presenta queste cifre come una garanzia universale: i risultati dipendono dal video, dal prompt e dalle scelte di navigazione del modello.
La funzionalità arriva su tre modelli Flash
Gli sviluppatori possono attivare la funzionalità impostando l’elaborazione video su "agentic" nella configurazione dell’API. La documentazione per sviluppatori di Google mostra lo stesso approccio per i file più lunghi caricati tramite Files API, oltre che per gli URL di YouTube e altri input video supportati.
La documentazione dell’API Gemini descrive la modalità agentica come adatta alle domande sui video lunghi e alla ricerca di momenti specifici. L’elaborazione statica può comunque essere preferibile per i video brevi, quando uno sviluppatore ha bisogno di coprire l’intero file a livello di fotogramma o vuole ridurre al minimo il passaggio aggiuntivo di navigazione prima dell’inizio della generazione.
Nelle conversazioni a più turni, l’API conserva il contesto del video tramite lo stato dell’interazione o i passaggi di elaborazione restituiti. La documentazione di Google afferma che gli sviluppatori devono conservare questi passaggi nelle richieste successive senza stato; ometterli può far perdere a Gemini il contesto e indurlo a rielaborare il video.
Dalle chiamate API alle risposte su YouTube
Google presenta la funzionalità come un’infrastruttura per applicazioni che devono ragionare sui video, anziché limitarsi a riassumerli. Tra i possibili usi ci sono la ricerca nelle riunioni registrate, l’analisi di filmati didattici, l’esame di sequenze sportive, il rilevamento di attività insolite e la creazione di agenti basati sui video che rispondono a domande su momenti specifici.
Il rilascio iniziale è rivolto agli sviluppatori tramite Google AI Studio e Gemini Enterprise Agent Platform. Google afferma inoltre di voler offrire agli utenti dell’app Gemini i miglioramenti in termini di efficienza e qualità, sui modelli Flash e Flash-Lite.
Nei prossimi mesi, afferma Google, la comprensione agentica dei video supporterà anche la funzionalità «Ask YouTube» nelle pagine di visualizzazione dei video su YouTube. Il lancio porterebbe questa tecnologia dalle impostazioni dell’API a un sistema di domande e risposte rivolto ai consumatori e basato sul contenuto visivo dei video.
Il compromesso che Google lascia agli sviluppatori
L’elaborazione agentica non elimina la necessità di scegliere una modalità. L’ispezione dinamica può ridurre la quantità di video che Gemini esamina, ma introduce un ulteriore passaggio di ragionamento e uso degli strumenti prima della risposta finale. Per i video brevi o le attività che richiedono di esaminare ogni fotogramma, la documentazione di Google continua a indicare l’elaborazione statica come la soluzione più adatta.
Il cambiamento immediato è più circoscritto e pratico: Gemini non deve più trattare un video lungo come un flusso fisso di fotogrammi tutti ugualmente importanti. Gli sviluppatori possono chiedere una risposta e il modello può decidere quali secondi, segnali e frequenze di campionamento siano rilevanti prima di formularla.