Modelli, audio nativo, Flow, Gemini Omni, costi reali per secondo e confronto con Sora, Kling e Runway
Veo è il modello di generazione video di Google DeepMind, ed è quello che ha reso normale una cosa che due anni fa non esisteva: una clip generata che arriva già con il proprio audio sincronizzato — dialoghi, ambiente, effetti — invece che muta, da sonorizzare dopo. La versione di riferimento è Veo 3.1, uscita il 15 ottobre 2025, che genera in 1080p e 4K con clip fino a otto secondi, controlli di camera, riferimenti di stile e personaggio, estensione delle scene, inserimento e rimozione di oggetti.
Questa guida percorre la piattaforma per intero: che cosa fa davvero e con quali limiti, come funziona Flow — l'ambiente dove le clip diventano una sequenza — che cosa è arrivato al Google I/O del maggio 2026 con Gemini Omni, quanto si paga fra API e abbonamenti, con quali concorrenti va confrontata, come si costruisce un metodo di lavoro che regge su commessa e dove sta andando il settore. Una precisazione subito, perché è la fonte di metà della confusione in circolazione: Veo 4 non esiste. Non è stata annunciata, non è in listino, e i servizi che dicono di venderla stanno vendendo altro. Quello che è arrivato nel 2026 si chiama Gemini Omni, ed è un modello diverso con un mestiere diverso.
INDICE DEI CONTENUTI
- Che cos'è Veo, e che cosa non è
- Le caratteristiche principali
- Flow: il posto dove le clip diventano una sequenza
- Gemini Omni: la vera novità del 2026
- I vantaggi competitivi
- Costi
- Alternative a Google Veo e confronto
- Strategie di crescita usando Google Veo
- Tendenze future
-
Domande frequenti
- Esiste Google Veo 4?
- Quanto dura al massimo un video generato con Veo?
- Veo genera anche l'audio?
- Quanto costa Google Veo?
- Che cos'è Google Flow e serve davvero?
- Che differenza c'è fra Veo e Gemini Omni?
- I video generati con Veo sono riconoscibili come artificiali?
- Devo dichiarare che un video è stato generato con l'AI?
- In sintesi
Che cos'è Veo, e che cosa non è
Veo genera video da un testo, da un'immagine o da una combinazione delle due, e li restituisce con l'audio già dentro. Non è un programma di montaggio e non prova a esserlo: produce inquadrature che qualcun altro deve mettere in fila — o Flow, che è la risposta di Google a quel bisogno, o il vostro software di montaggio.
La linea del tempo, e la versione che non esiste
Il percorso è rapido e vale la pena averlo in testa, perché spiega dove siamo. Veo esce a maggio 2024 con video in 1080p. Veo 2 arriva a dicembre 2024 portando il 4K e una comprensione della fisica sensibilmente migliore, e sbarca sull'app Gemini nell'aprile 2025. Veo 3, a maggio 2025, introduce la novità che ha cambiato la categoria: l'audio sincronizzato generato insieme all'immagine. Veo 3.1 esce il 15 ottobre 2025 ed è la versione stabile attuale.
Poi si ferma. Al momento in cui scriviamo non esiste alcuna Veo 4 annunciata da Google: le pagine che ne promettono l'accesso vendono accessi ad altri modelli, o non vendono niente. È un dettaglio che conviene sapere prima di firmare un abbonamento trovato in una ricerca.
Dove vive Veo: quattro porte diverse
Lo stesso modello si raggiunge da quattro posti, e la scelta cambia costi e possibilità: l'app Gemini, per generare qualche clip senza pensarci troppo; Flow, l'ambiente di regia costruito attorno a Veo; l'API Gemini, per chi automatizza; e Vertex AI, per chi ha bisogno di fatturazione aziendale, controlli di accesso e residenza dei dati. Chi lavora a commessa userà quasi certamente Flow per produrre e l'API per industrializzare.
Il limite che decide tutto: otto secondi
Veo 3.1 genera clip fino a otto secondi. È il numero che va messo in cima a qualsiasi ragionamento di produzione, perché determina tutto il resto: uno spot da trenta secondi sono almeno quattro generazioni da raccordare, un video da novanta secondi sono dodici. Le funzioni di estensione allungano una scena mantenendo la continuità, ma il mattone base resta quello.
Va detto chiaramente perché la comunicazione tende a sfumarlo: otto secondi non sono un difetto temporaneo, sono l'unità di misura del mezzo. Chi progetta pensando a inquadrature da otto secondi ottiene risultati; chi progetta pensando a scene lunghe e spera di cucirle dopo, no.
Le caratteristiche principali
L'audio nativo, che è il vero spartiacque
Veo genera nativamente dialoghi, rumori d'ambiente ed effetti sonori sincronizzati con l'immagine. Non è un doppiaggio applicato dopo: il modello produce le due tracce insieme, ed è il motivo per cui il labiale regge e i passi cadono dove devono cadere.
Per chi produce contenuti brevi questo elimina un'intera fase di lavorazione. Per chi produce pubblicità è il punto in cui il risultato smette di sembrare una prova tecnica: un'inquadratura senza suono è sempre un fotogramma che si muove, con il suono diventa una scena.
Controlli di camera, riferimenti di stile e di personaggio
Il modello accetta indicazioni precise sul movimento di macchina — carrellate, zoom, angolazioni — e riferimenti visivi che vincolano stile e personaggi. La coerenza del personaggio fra più scene, con identità e voce preservate, è la funzione che separa una raccolta di clip da una sequenza: senza, il testimonial cambia faccia fra un'inquadratura e l'altra e il montaggio non sta in piedi.
Primo e ultimo fotogramma, estensione, outpainting
Tre strumenti che nella pratica quotidiana valgono più di molte funzioni più appariscenti. Il controllo di primo e ultimo fotogramma permette di costruire transizioni pulite fra due clip generate separatamente. L'estensione allunga una scena mantenendo continuità visiva e sonora. L'outpainting riadatta le proporzioni allargando l'inquadratura invece di ritagliarla — è quello che salva un 16:9 quando serve anche il verticale.
Inserimento e rimozione di oggetti
Si aggiunge un elemento che sul set non c'era, o si toglie qualcosa che non doveva esserci, mantenendo sfondo e illuminazione. È la funzione che avvicina Veo alla post-produzione vera e non solo alla generazione, e che nelle campagne serve più di quanto sembri: un prodotto che cambia etichetta fra un mercato e l'altro non richiede più di rigirare.
SynthID: la filigrana che non si vede
Tutti i video generati portano SynthID, la filigrana invisibile di Google che permette di verificarne l'origine artificiale. Non è un marchio visibile sull'immagine: è un segnale dentro il file, pensato per sopravvivere a compressione e ricodifica. Nel 2026 non è un dettaglio tecnico ma un elemento di conformità, e più avanti vediamo perché.
Flow: il posto dove le clip diventano una sequenza
Flow è l'ambiente costruito da Google attorno a Veo, presentato il 20 maggio 2025 come strumento di regia per chi racconta storie. È la risposta al problema degli otto secondi: da solo il modello produce frammenti, Flow serve a tenerli insieme.
Scenebuilder
Permette di disporre più clip in sequenza, riordinarle, rifilarne inizio e fine con le maniglie, estendere una scena esistente mantenendo personaggi e movimento coerenti, e scaricare la sequenza completa. Non è un montaggio professionale — non ci sono tracce multiple né mixer — ma è quanto basta per consegnare un'animatica o un contenuto social senza aprire altro.
Ingredients: gli elementi riutilizzabili
Si creano elementi visivi con Veo e con Imagen, si salvano, e si richiamano come riferimento in clip diverse. È il meccanismo che tiene insieme una campagna: lo stesso personaggio, lo stesso prodotto, lo stesso ambiente ricorrono senza doverli ridescrivere ogni volta sperando che il modello si ricordi.
Flow Agent e Flow Music
Dal Google I/O del maggio 2026 Flow ha un agente creativo che pianifica attività articolate, aiuta a esplorare idee e propone modifiche narrative, e una sezione musicale con controllo sezione per sezione e generazione di video musicali. Esiste anche un'app mobile in beta, Flow su Android e Flow Music su iOS.
I limiti di Flow, in numeri
Utili da conoscere prima di impostare un lavoro: i video caricati arrivano a 60 secondi e 1 GB, il ritaglio lavora su un massimo di 30 secondi, l'editing conversazionale regge fino a tre turni prima di perdere il contesto precedente e agisce su segmenti fino a dieci secondi per volta. Alcune funzioni — inserimento, rimozione, controlli di camera — non si applicano alle clip ottenute per estensione.
Gemini Omni: la vera novità del 2026
Chi cerca "Veo 4" sta in realtà cercando questo. Al Google I/O del 19-20 maggio 2026 Google ha presentato Gemini Omni, descritto come il modello capace di creare qualsiasi cosa a partire da qualsiasi input, a cominciare dai video.
Che cosa fa di diverso
La differenza sostanziale rispetto a Veo è il verbo: Veo genera, Omni modifica conversando. Si carica un video e si chiede a parole di cambiarlo, mantenendo coerenza dei personaggi e plausibilità fisica. Accetta immagini, audio, video e testo come input nella stessa richiesta, e applica una comprensione di fisica, gravità e dinamica per restituire risultati che stanno in piedi.
Gemini Omni Flash, la variante rapida, è disponibile per gli abbonati Google AI Plus, Pro e Ultra, è il motore dell'editing conversazionale dentro Flow ed è arrivato anche su YouTube Shorts e YouTube Create. Tutti i video prodotti portano SynthID.
Prezzo e vincoli
Omni Flash si paga a token, non a secondo, ed è una differenza che conta quando si fa il preventivo. Il listino ufficiale indica 17,50 dollari per milione di token video, con una base fissa di 5.792 token per ogni secondo di video a 720p: fanno circa 0,10 dollari al secondo. Un responsabile di prodotto Google lo ha posizionato allo stesso livello di Veo 3.1 Fast.
Tre vincoli vanno messi in conto: le clip si fermano a dieci secondi, non esistono sconti per l'elaborazione asincrona a differenza di altri modelli Gemini, e non c'è un livello gratuito. Va segnalato anche che questo modello è contrassegnato come uno di quelli i cui contenuti vengono usati per migliorare i prodotti Google, anche sulla versione a pagamento: per un lavoro su materiale riservato di un cliente è una domanda da porsi prima, non dopo.
Come si rapportano i due
Non si sostituiscono: si dividono il lavoro. Veo resta il modello per creare l'inquadratura che non esiste, con la sua qualità e il suo audio; Omni è quello per intervenire su materiale che c'è già, parlandogli. Nel flusso di lavoro dentro Flow convivono, e la scelta dipende da dove si parte — dal nulla o da un girato.
I vantaggi competitivi
L'audio arriva già attaccato
È il vantaggio che nessun concorrente diretto replica con la stessa qualità. Generare immagine e suono insieme non è la somma di due operazioni: è un'operazione sola, e il risultato lo si vede nella sincronia del labiale e nella coerenza dell'ambiente sonoro. Per chi produce contenuti parlati — testimonianze, brevi presentazioni, pubblicità con voce in scena — toglie dal flusso di lavoro doppiaggio, allineamento e sound design di base.
La fisica, che è quello che si nota senza saperlo
Il salto di Veo 2 sulla comprensione fisica e i miglioramenti successivi sono la ragione per cui questi video reggono lo sguardo più a lungo di altri. Un liquido che si versa, un tessuto che cade, un'ombra che segue la fonte di luce: quando sbagliano, lo spettatore non sa dire cosa non va ma smette di crederci. È il terreno su cui Veo compete con Sora e su cui la differenza si misura in revisioni risparmiate, non in premi.
Distribuzione: quattro porte e un'infrastruttura sotto
Veo non è un prodotto isolato: sta nell'app Gemini, in Flow, nell'API e in Vertex AI, con quest'ultima che porta con sé fatturazione aziendale, controlli di accesso, residenza dei dati e tutto ciò che un ufficio acquisti chiede prima di firmare. Per un freelance che lavora con clienti strutturati è spesso l'argomento che fa passare la proposta.
I limiti, detti chiaramente
Otto secondi per clip. Qualsiasi contenuto più lungo è un lavoro di raccordo, in Flow o nel vostro montaggio.
Flow non è un programma di montaggio. Niente tracce multiple, niente mixer, niente color grading professionale: serve comunque un software a valle per un lavoro da consegnare.
Il listino ufficiale non elenca ovunque le stesse versioni. La pagina prezzi di Vertex AI riporta i modelli Veo 3 e Veo 2: le tariffe di Veo 3.1 circolano soprattutto su fonti di terze parti, quindi vanno verificate nel proprio account prima di preventivare.
Gemini Omni usa i contenuti per migliorare i prodotti, anche a pagamento: su materiale riservato va valutato prima.
Nessun livello gratuito sull'API. Ogni clip generata costa dal primo secondo.
Disponibilità a scaglioni. Funzioni e piani arrivano nei diversi Paesi in tempi diversi: quello che si legge negli annunci non è sempre quello che si vede nel proprio account.
Costi
Ci sono due modi di pagare Veo e rispondono a due mestieri diversi: a consumo tramite API, o ad abbonamento tramite i piani Google AI. Chi produce volumi userà il primo, chi produce qualche decina di clip al mese il secondo.
A consumo: il listino per secondo
I prezzi ufficialmente pubblicati su Vertex AI per la famiglia Veo 3 sono questi, e restano il riferimento più solido perché vengono da Google:
Modello | Prezzo al secondo | Otto secondi costano | Quando usarlo |
|---|---|---|---|
Veo 3 Fast | 0,10 $ | 0,80 $ | Prove, varianti, ricerca dell'inquadratura |
Veo 3 Fast + audio | 0,15 $ | 1,20 $ | Bozze con parlato, per validare il ritmo |
Veo 3 | 0,20 $ | 1,60 $ | Inquadrature definitive senza suono |
Veo 3 + audio | 0,40 $ | 3,20 $ | Consegna finale con dialoghi ed effetti |
Veo 2 | 0,50 $ | 4,00 $ | Solo per compatibilità con lavori già impostati |
Gemini Omni Flash | circa 0,10 $ (a token) | 0,80 $ | Modifica conversazionale di materiale esistente |
Per Veo 3.1 le tariffe riportate da fonti di terze parti parlano di circa 0,15 dollari al secondo in modalità rapida e 0,40 in modalità standard, audio compreso. Non essendo confermate dalla pagina ufficiale che abbiamo consultato, vanno trattate come indicazioni e verificate prima di impegnarsi con un cliente.
Ad abbonamento: i piani Google AI
Le fonti indipendenti riportano tre livelli: Plus intorno agli 8 dollari al mese con accesso alla sola modalità rapida, Pro intorno ai 20 dollari con la rapida più una dotazione di crediti cloud, Ultra intorno ai 250 dollari al mese con accesso anche alla modalità standard e una dotazione più ampia. Flow è incluso nei piani Pro e Ultra, con limiti di generazione diversi.
La soglia di convenienza è più bassa di quanto si pensi: sotto le sette o otto clip da otto secondi al mese, l'API a consumo costa meno dell'abbonamento più economico. Sopra, l'abbonamento vince — e vince nettamente se si usa Flow, che a consumo non si compra.
La matematica che conta davvero
Il calcolo da fare non è il prezzo della clip, è il prezzo della clip approvata. Uno spot da trenta secondi sono almeno quattro inquadrature; con tre tentativi ciascuna, sono dodici generazioni. In modalità standard con audio fanno circa 38 dollari di solo modello: poco rispetto a una giornata di riprese, moltissimo rispetto a quello che si legge nei confronti fra listini.
La strategia che riduce il conto è una sola e vale ovunque: cercare in modalità rapida, consegnare in modalità standard. Le varianti servono a scegliere, non a consegnare, e pagarle quattro volte tanto è lo spreco più comune.
Alternative a Google Veo e confronto
Il campo si muove ogni trimestre e i prezzi cambiano: la tabella fotografa metà 2026 e va usata come mappa, non come verdetto.
Piattaforma | Prezzo indicativo | Durata e audio | Punto di forza | Quando sceglierla |
|---|---|---|---|---|
Google Veo 3.1 | 0,10-0,40 $/s via API; piani da ~8 a ~250 $/mese | 8 secondi, audio nativo sincronizzato | Audio generato insieme all'immagine, fisica, Flow, Vertex AI | Contenuti parlati e consegne che devono reggere il primo sguardo |
OpenAI Sora 2 | circa 0,10 $/s via API; in ChatGPT Plus da 20 $, Pro da 100 $ | Clip brevi con audio | Simulazione fisica e coerenza narrativa | Chi è già dentro l'ecosistema OpenAI |
Kling 3.0 | da pochi dollari al mese; API circa 0,07-0,14 $/s | Fino a 15 secondi, audio in 5 lingue | Costo per tentativo più basso, storyboard multi-inquadratura | Volumi alti, varianti, serialità |
Runway | da 15 $/mese; Team da 55 $/postazione | Clip brevi | Trasformazione del girato con Aleph, plugin Premiere e After Effects, uscite ProRes ed EXR | Post-produzione su materiale esistente |
Luma Ray 3 | da circa 10 $/mese | Fino a 10 secondi | Ancoraggio di primo e ultimo fotogramma | Continuità fra inquadrature consecutive |
Pika 2.5 | 10-70 $/mese | Fino a 10 secondi | Effetti pensati per diventare virali | Contenuti social d'impatto immediato |
Quando Veo non è la scelta giusta
Il budget è il vincolo principale. Kling fa cose paragonabili a una frazione del costo, se rinunciate all'audio nativo di questa qualità.
Dovete trasformare del girato, non generarlo. È il terreno di Runway con Aleph, o di Gemini Omni se restate in casa Google.
Vi serve una sequenza lunga in un colpo solo. Otto secondi sono otto secondi, e nessuna funzione di estensione cambia la natura del mattone.
Il cliente ha vincoli stretti sull'uso dei contenuti. Con Omni Flash i contenuti alimentano il miglioramento dei prodotti: su materiale riservato va verificato quale modello e quale canale state usando.
Serve una filiera di finitura professionale. Uscite ProRes, EXR e pipeline HDR stanno altrove.
Strategie di crescita usando Google Veo
La sequenza di adozione che funziona
Chi apre Flow e comincia a generare finisce con una cartella di clip belle che non si montano fra loro. La sequenza che porta risultati parte dal fondo.
Settimana 1. Scrivete lo storyboard a parole, inquadratura per inquadratura, con la durata di ciascuna. Se una scena supera gli otto secondi, spezzatela adesso: dopo sarà tardi.
Settimana 1-2. Generate solo in modalità rapida e senza audio. Serve a capire quali descrizioni rispondono bene, non a produrre.
Settimana 2. Costruite gli ingredients: personaggio, prodotto, ambiente. È l'investimento che tiene insieme tutto il resto e si riusa su ogni campagna successiva.
Settimana 3. Passate a Flow e lavorate per sequenze, usando primo e ultimo fotogramma per i raccordi fra clip.
Mese 2. Solo ora la modalità standard con audio, e solo sulle inquadrature approvate.
Mese 2-3. Se producete volumi, spostate le operazioni ripetitive sull'API: le varianti per formati e mercati diversi non si fanno a mano.
In continuo. Tenete un registro di quanto costa ogni clip consegnata, non generata. È l'unico numero che dice se il lavoro sta in piedi.
Per freelance e piccoli studi: dove sta il margine
Il margine non è nella clip, è in quello che non si gira più. Tre inserti di prodotto, un'ambientazione che non esiste, una scena con un attore che non va ingaggiato: erano una giornata di riprese, adesso sono qualche decina di dollari di modello e un pomeriggio. Non sempre il risultato è equivalente, e quando non lo è si gira: ma la scelta esiste e va messa a preventivo come alternativa esplicita.
La seconda voce è la fase di proposta. Presentarsi con un'animatica già in movimento e sonorizzata, invece che con uno storyboard disegnato, cambia il tasso di approvazione. Con la modalità rapida costa pochi dollari e si fa in mezza giornata: è il caso d'uso in cui il rapporto fra spesa e ritorno è più alto di tutti.
La terza è la localizzazione. Con l'audio generato insieme all'immagine, la stessa scena in lingue diverse non richiede né doppiatori né ri-sincronizzazione. Per un cliente che esporta è un servizio vendibile a sé, e il costo marginale per lingua è quello di una generazione.
Il vincolo da mettere in contratto
Due clausole, e conviene scriverle prima. La prima è il numero di varianti incluse: con strumenti che rendono le varianti rapide ma non gratuite, "proviamone un'altra" diventa una richiesta infinita se non ha un limite concordato.
La seconda riguarda la dichiarazione del contenuto sintetico. Dal 2 agosto 2026 si applica l'articolo 50 dell'AI Act: i fornitori devono marcare i contenuti generati in un formato leggibile dalle macchine — e SynthID, presente su tutti i video Veo e Omni, assolve proprio a quella funzione — mentre chi li pubblica deve dichiarare in modo chiaro e immediato che immagine, audio o video sono artificiali, salvo che una persona si assuma la responsabilità editoriale. Per le opere palesemente artistiche o satiriche l'obbligo è adattato. Le sanzioni arrivano a 15 milioni di euro o al 3% del fatturato mondiale annuo.
La marcatura tecnica, quindi, ve la dà Google. La dichiarazione al pubblico no: quella è vostra o del cliente, e stabilire in contratto chi la scrive evita una discussione a lavoro pubblicato.
Questo è un riepilogo tecnico, non un parere legale: per il vostro caso specifico serve un consulente.
Tendenze future
Guardando i dodici mesi appena passati, alcune direzioni sono leggibili.
Dalla generazione alla conversazione. Gemini Omni segna il passaggio: non si descrive più una scena da creare, si parla a una scena che esiste. È la stessa direzione presa da Runway con Aleph, e indica che il valore si sta spostando dal produrre il primo fotogramma al correggere quello sbagliato.
L'audio diventa parte del modello, non un accessorio. Veo ha aperto la strada, gli altri la stanno seguendo. Il prossimo terreno prevedibile è il controllo fine: scegliere la voce, la prosodia, il livello dell'ambiente senza rigenerare tutta la clip.
La provenienza diventa infrastruttura. SynthID è ormai un componente di serie e si affianca agli standard di provenienza dei contenuti. Nei prossimi due anni è ragionevole attendersi che le piattaforme di pubblicazione leggano automaticamente questi segnali e applichino l'etichetta senza chiederla a chi carica.
La durata resta il muro. Otto secondi su Veo, dieci su Omni e sulla maggior parte dei concorrenti: è il limite strutturale della categoria. Chi lo supererà mantenendo coerenza di personaggi e ambiente sposterà questi strumenti dal formato breve alla narrazione, ed è la ragione per cui oggi l'uso professionale si concentra su pubblicità e contenuti social.
Il video generativo entra nelle piattaforme di distribuzione. Omni Flash su YouTube Shorts e YouTube Create dice dove va il pezzo di mercato più grande: non negli strumenti per professionisti, ma dentro le app dove la gente pubblica già.
Una previsione che non facciamo: che questi modelli sostituiscano la produzione video. Generano inquadrature; il progetto, il ritmo e la decisione su quale versione va in onda restano dove sono sempre stati.
Domande frequenti
Esiste Google Veo 4?
No. Al momento Google non ha annunciato alcuna versione 4 di Veo: il modello di riferimento resta Veo 3.1, rilasciato il 15 ottobre 2025. I servizi che promettono accesso a "Veo 4" stanno vendendo accessi ad altri modelli o non stanno vendendo nulla. La novità effettiva del 2026 è Gemini Omni, presentato al Google I/O di maggio, che è un modello diverso con funzioni diverse.
Quanto dura al massimo un video generato con Veo?
Otto secondi per clip con Veo 3.1, in 1080p o 4K. È il vincolo da cui dipende tutta la progettazione: uno spot da trenta secondi sono almeno quattro generazioni da raccordare. Esistono funzioni di estensione che allungano una scena mantenendo continuità visiva e sonora, e Flow permette di comporre più clip in sequenza, ma l'unità di base resta quella.
Veo genera anche l'audio?
Sì, ed è la sua caratteristica distintiva: dialoghi, rumori d'ambiente ed effetti sonori vengono generati insieme all'immagine e sincronizzati con essa, non applicati dopo. È il motivo per cui il labiale regge. Sul listino Vertex AI le versioni con audio costano circa il doppio di quelle senza: 0,40 dollari al secondo contro 0,20 per Veo 3, 0,15 contro 0,10 per la variante rapida.
Quanto costa Google Veo?
Si paga in due modi. A consumo via API o Vertex AI, con prezzi ufficiali per la famiglia Veo 3 che vanno da 0,10 dollari al secondo della versione rapida senza audio a 0,40 della versione standard con audio. Ad abbonamento, con i piani Google AI riportati dalle fonti indipendenti intorno a 8 dollari al mese per Plus, 20 per Pro e 250 per Ultra. Sotto le sette-otto clip al mese conviene l'API; sopra, l'abbonamento, soprattutto se si usa Flow.
Che cos'è Google Flow e serve davvero?
È l'ambiente di regia costruito attorno a Veo, presentato nel maggio 2025. Serve a risolvere il problema degli otto secondi: con Scenebuilder si dispongono più clip in sequenza, si rifilano, si estendono mantenendo coerenza; con gli ingredients si salvano personaggi e oggetti da riusare fra clip diverse. Non è un programma di montaggio — niente tracce multiple né mixer — ma basta per consegnare un'animatica o un contenuto social.
Che differenza c'è fra Veo e Gemini Omni?
Veo genera video da zero a partire da testo o immagini; Gemini Omni modifica video esistenti conversando in linguaggio naturale, mantenendo coerenza dei personaggi e plausibilità fisica. Non si sostituiscono, si dividono il lavoro, e in Flow convivono. Omni Flash costa circa 0,10 dollari al secondo, si ferma a dieci secondi per clip e non ha un livello gratuito.
I video generati con Veo sono riconoscibili come artificiali?
Sì, tutti i video generati con Veo e con Gemini Omni portano SynthID, la filigrana invisibile di Google che ne certifica l'origine artificiale ed è pensata per resistere a compressione e ricodifica. Non è un marchio visibile sull'immagine. Assolve all'obbligo di marcatura leggibile dalle macchine previsto dall'articolo 50 dell'AI Act, ma non sostituisce la dichiarazione al pubblico, che resta a carico di chi pubblica.
Devo dichiarare che un video è stato generato con l'AI?
In Europa sì, dal 2 agosto 2026, quando è diventato applicabile l'articolo 50 dell'AI Act: chi pubblica deve dichiarare in modo chiaro e immediato che immagine, audio o video sono generati o manipolati artificialmente, salvo che una persona si assuma la responsabilità editoriale. Per le opere palesemente artistiche o satiriche l'obbligo è adattato. Le sanzioni arrivano a 15 milioni di euro o al 3% del fatturato mondiale annuo. La marcatura tecnica la fornisce SynthID; la dichiarazione visibile no.
In sintesi
Veo è il modello che ha reso normale il video generato con il suono già dentro, e resta il riferimento quando la clip deve reggere il primo sguardo — un parlato sincronizzato, un liquido che si versa come si versa davvero. Intorno gli è cresciuto un ecosistema che conta quanto il modello: Flow per costruire sequenze, l'API e Vertex AI per industrializzare, Gemini Omni per intervenire su quello che esiste già.
Per chi lavora su commessa la domanda utile non è se Veo sia migliore di Sora o di Kling, ma quante generazioni servono per una consegna approvata e quanto costa quel numero — cercando in modalità rapida e consegnando in standard, che è la singola regola che dimezza il conto. E poiché il limite degli otto secondi non è un difetto temporaneo ma l'unità di misura del mezzo, chi progetta per inquadrature corte ottiene risultati e chi spera di cucire scene lunghe, no.