Gemini 3.6 Flash punta sull'efficienza, ma i test indipendenti mostrano un miglioramento modesto dell'intelligenza
Google ha lanciato tre nuovi modelli Gemini, ciascuno mirato a diversi segmenti del mercato degli agenti:

Gemini 3.6 Flash punta sull'efficienza, ma i test indipendenti mostrano un miglioramento modesto dell'intelligenza
Introduzione
Google ha lanciato tre nuovi modelli Gemini, ciascuno mirato a diversi segmenti del mercato degli agenti:
- Gemini 3.6 Flash, posizionato come modello principale per coding, lavoro multimodale e flussi di lavoro multi-step con agenti
- Gemini 3.5 Flash-Lite, ottimizzato per carichi di lavoro ad alto throughput e sensibili alla latenza
- Gemini 3.5 Flash Cyber, un modello di cybersecurity a accesso limitato progettato per scoprire, verificare e correggere vulnerabilità software
Il comunicato di Google si concentra sull'efficienza. L'azienda afferma che il nuovo modello Flash completa le attività con meno token di output, meno chiamate agli strumenti e un minor overhead nei cicli di esecuzione. Anche i prezzi sono inferiori rispetto a Gemini 3.5 Flash.
Questa affermazione è supportata dai benchmark interni di Google e dai primi test indipendenti.
La questione più complessa è se Gemini 3.6 Flash rappresenti un miglioramento sostanziale nell'intelligenza rispetto al modello che sostituisce.
Artificial Analysis ha misurato nel suo indice di intelligenza composito lo stesso punteggio per il nuovo modello e per Gemini 3.5 Flash. Anche i primi utenti hanno riportato esperienze contrastanti, specialmente in ambiti come design visivo, generazione in cinese, selezione degli strumenti e aderenza alle istruzioni.
Il risultato non è un semplice fallimento. Gemini 3.6 Flash appare più veloce, con output più concisi e un costo inferiore per attività completata in molti carichi di lavoro. Ha inoltre migliorato diversi benchmark in ambito coding, uso del computer, machine learning e lavoro conoscitivo.
Ma questo lancio evidenzia una distinzione importante:
Un modello può diventare più efficiente senza un corrispondente miglioramento sostanziale nell'intelligenza generale o nella qualità soggettiva dell'output.

Panoramica dei tre nuovi modelli Gemini
| Modello | Ruolo principale | Prezzo API per milione di token | Livello di ragionamento predefinito | Disponibilità |
|---|---|---|---|---|
| Gemini 3.6 Flash | Coding, lavoro multimodale e flussi di lavoro complessi con agenti | Input $1,50 / Output $7,50 | Medio | Generalmente disponibile |
| Gemini 3.5 Flash-Lite | Estrazione ad alto volume, ricerca, traduzione, routing e sub-agenti | Input $0,30 / Output $2,50 | Minimo | Generalmente disponibile |
| Gemini 3.5 Flash Cyber | Scoperta, verifica e correzione di vulnerabilità | Non pubblicato | Specializzato | Pilot limitato per governi e partner fidati |
Sia Gemini 3.6 Flash che Gemini 3.5 Flash-Lite supportano:
- Contesto fino a 1 milione di token
- Fino a 64.000 token di output
- Input di testo, immagini, audio e video
- Output di testo
- Livelli di ragionamento configurabili
- Strumenti integrati, incluso l'uso del computer
- Accesso tramite Gemini API e Google AI Studio
La scheda tecnica di Google indica la data di cut-off delle conoscenze per entrambi i modelli generalmente disponibili come marzo 2026.
Gemini 3.6 Flash: Meno token e costi inferiori per attività
Gemini 3.6 Flash si basa su
Gemini 3.5 Flash ed è progettato per sostituirlo in molti carichi di lavoro di coding, lavoro conoscitivo, multimodali e con agenti.
Il miglioramento più consistente è l'efficienza.
Google riporta che, nell'indice di Artificial Analysis, Gemini 3.6 Flash utilizza il 17% in meno di token di output rispetto a Gemini 3.5 Flash. In alcune valutazioni di coding con agenti (incluso DeepSWE), Google ha osservato una riduzione dei token di output fino al 65%.
Il modello tende inoltre a utilizzare:
- Meno passaggi di ragionamento
- Meno chiamate agli strumenti
- Cicli di esecuzione più brevi
- Meno modifiche di codice non necessarie
- Output finali più concisi
Questi cambiamenti sono importanti perché il costo degli agenti non dipende solo dal prezzo per token pubblicato.
Un agente a lunga esecuzione può chiamare il modello ripetutamente, inviare definizioni di strumenti di grandi dimensioni, controllare file, eseguire codice, recuperare da guasti e generare grandi quantità di output di ragionamento. Anche se il prezzo per token cambia poco, ridurre il numero di cicli di chiamata e il numero di token abbassa il costo totale.
Prezzi di Gemini 3.6 Flash
Google elenca i seguenti prezzi API:
| Tipo di token | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Input | $1,50 per milione di token | $1,50 per milione di token |
| Output | $7,50 per milione di token | $9,00 per milione di token |
Il prezzo di input rimane invariato, mentre il prezzo di output scende di circa il 16,7%.
Nelle sue impostazioni di valutazione, Artificial Analysis ha misurato un costo medio per attività di circa $0,50 per Gemini 3.6 Flash, rispetto a $0,59 per Gemini 3.5 Flash. Ciò rappresenta una riduzione di circa il 18%, grazie al prezzo di output inferiore e al minor numero di token generati.
Queste cifre devono essere considerate specifiche per determinati carichi di lavoro, non universalmente applicabili. Il costo effettivo dipende da:
- Dimensione del prompt
- Livello di ragionamento
- Lunghezza dell'output
- Numero di cicli di chiamata
- Utilizzo degli strumenti
- Cache del contesto
- Comportamento di ripetizione
- Tipo di framework per agenti
- Se l'applicazione invia la conversazione completa a ogni ciclo
Completamenti più veloci, non solo generazione di token più rapida
Artificial Analysis riporta che il tempo medio per attività di Gemini 3.6 Flash è di circa 1,3 minuti, rispetto ai circa 2,7 minuti di Gemini 3.5 Flash.
Questo miglioramento deriva da un output più veloce e da un processo di ragionamento più economico.
Un modello che genera token rapidamente potrebbe comunque richiedere molto tempo se rimane bloccato in cicli ripetuti di chiamate agli strumenti. Al contrario, un modello leggermente più lento che trova la soluzione corretta con meno chiamate potrebbe completare prima.
Per gli sviluppatori di agenti, il tempo necessario per completare ogni attività è spesso più utile della velocità grezza di generazione dei token al secondo.
Coding, Machine Learning, Uso del Computer e Lavoro Conoscitivo
Google riporta miglioramenti in diverse categorie di benchmark.
Coding e Ingegneria del Software
Su DeepSWE, Gemini 3.6 Flash è passato dal 37% al 49% rispetto a Gemini 3.5 Flash.
Google afferma che il modello:
- Produce meno modifiche non necessarie
- Utilizza cicli di debug più brevi
- Segue più rigorosamente l'ambito richiesto
- Genera codice più vicino al livello di produzione
- Prima di apportare modifiche, tende a verificare il progetto a livello programmatico
Quest'ultimo punto presenta un compromesso.
La guida per sviluppatori di Google indica che Gemini 3.6 Flash potrebbe eseguire script diagnostici prima di modificare, il che può migliorare l'accuratezza in attività complesse. Ma in lavori front-end semplici, quei passaggi esplorativi aggiuntivi
potrebbero aumentare la latenza senza sempre migliorare i risultati.
Google ha inoltre osservato che i valutatori umani talvolta hanno preferito l'aspetto visivo e lo stile dei modelli precedenti, anche se Gemini 3.6 Flash generava codice più funzionale. Di conseguenza, gli sviluppatori che creano interfacce potrebbero dover fornire vincoli di design visivo più chiari.
Ricerca sul machine learning
Su MLE-Bench, Google ha riportato un miglioramento dal 49,7% al 63,9%.
Questa valutazione si concentra su compiti pratici di ingegneria del machine learning e ricerca, non su problemi di codifica isolati. Il miglioramento indica che il modello ha prestazioni migliori in flussi di lavoro che richiedono sperimentazione, elaborazione dati, implementazione e perfezionamento iterativo.
Capacità di utilizzo del computer
Su OSWorld-Verified, secondo il confronto pubblicato da Google, Gemini 3.6 Flash è passato dal 78,4% all'83,0%.
La capacità di utilizzo del computer è ora disponibile come strumento client integrato tramite l'API Gemini e Gemini Enterprise. Consente ai sistemi agente di interagire con interfacce grafiche, non solo di fare affidamento su API dirette.
I risultati dei benchmark per l'utilizzo del computer sono ancora influenzati dal framework dell'agente, dall'ambiente dello schermo, dalla progettazione delle attività e dalle strategie di ripristino dagli errori. Punteggi più alti sono utili, ma i sistemi di produzione necessitano ancora di autorizzazioni rigorose e passaggi di conferma per operazioni importanti.
Lavoro cognitivo
Su GDPval-AA v2, Gemini 3.6 Flash è passato da 1349 a 1421.
Google ha evidenziato i seguenti scenari applicativi:
- Analisi di documenti
- Interpretazione di grafici
- Analisi di dati finanziari
- Redazione di rapporti
- Analisi di registrazioni
- Migrazione di codice
- Flussi di lavoro di ricerca multimodali
Clienti tra cui Figma, Harvey, Hebbia e JetBrains hanno fornito feedback positivi per l'annuncio di Google. Queste testimonianze riflettono l'esperienza dei clienti e non devono essere considerate come benchmark indipendenti.
Data di aggiornamento delle conoscenze e finestra di contesto
Gemini 3.6 Flash supporta una finestra di contesto fino a 1 milione di token e un output massimo di 64.000 token.
La sua scheda tecnica indica una data di aggiornamento delle conoscenze a marzo 2026, un miglioramento rispetto alle versioni precedenti di Gemini (la cui data di aggiornamento era significativamente anteriore).
Una data di aggiornamento più recente riduce la quantità di informazioni di contesto recenti di base che gli sviluppatori devono fornire manualmente. Tuttavia, ciò non rende il modello in grado di gestire in modo affidabile notizie correnti, prezzi in tempo reale, leggi in evoluzione, rilasci di software o altre informazioni sensibili al fattore tempo.
Le applicazioni che gestiscono informazioni nuove dovrebbero comunque utilizzare recupero, ricerca, database verificati o chiamate a strumenti.
Una grande finestra di contesto non garantisce nemmeno che il modello possa utilizzare ogni parte di un documento lungo con la stessa efficacia. Gli sviluppatori dovrebbero testare:
- L'accuratezza del recupero su parti distanti
- La coerenza in conversazioni lunghe
- Se le regole chiave rimangono valide
- Le prestazioni quando sono presenti materiali irrilevanti
- Costi e latenza con lunghezze di contesto reali
Aggiornamenti sulla sicurezza di Gemini 3.6 Flash
Google afferma che Gemini 3.6 Flash include misure di sicurezza all'avanguardia più robuste contro:
- Abuso chimico, biologico, radiologico e nucleare
- Abuso informatico
- Resistenza al jailbreak
La scheda tecnica del modello riporta miglioramenti nei risultati automatici di sicurezza multilingue e dei contenuti rispetto a Gemini 3.5 Flash, mantenendo al contempo un tasso di rifiuto ingiustificato relativamente basso.
Google ha anche indicato
diverse limitazioni:
- Il modello può allucinare.
- Occasionalmente si verificano risposte lente o timeout.
- Alcuni test interni mostrano un leggero regresso nel tono.
- La protezione dal jailbreak rimane un'area di miglioramento continuo.
La valutazione della sicurezza all'avanguardia di Google ha concluso che Gemini 3.6 Flash è ancora al di sotto dei livelli di capacità critici stabiliti dall'azienda, inclusa la soglia di cybersecurity.
Questa conclusione si basa sul framework di valutazione di Google e dovrebbe essere interpretata insieme ai risultati dei test di sicurezza indipendenti che saranno disponibili in seguito.
Gemini 3.5 Flash-Lite: scelta per throughput elevato
Gemini 3.5 Flash-Lite è progettato per attività che danno priorità a velocità, throughput e costo, piuttosto che alla massima profondità di ragionamento.
Gli scenari applicativi tipici includono:
- Estrazione di documenti
- Classificazione
- Ricerca
- Traduzione
- Routing dei dati
- Generazione JSON strutturata
- Elaborazione di ricevute
- Analisi di dati e-commerce
- Esecuzione di sotto-attività ad alto volume
Google lo descrive come il modello più veloce e dal costo più basso della famiglia Gemini 3.5.
Prezzi di Gemini 3.5 Flash-Lite
| Tipo di token | Prezzo per milione di token |
|---|---|
| Input | $0.30 |
| Output | $2.50 |
Il suo livello di pensiero predefinito è Minimo, che privilegia throughput e bassa latenza.
Per sotto-attività autonome, esecuzione di codice, chiamate a strumenti o pianificazione multi-step, Google suggerisce di aumentare il livello di pensiero a Medio o Alto quando necessario. Impostazioni più elevate possono migliorare il tasso di completamento delle attività, ma solitamente aumentano l'utilizzo di token e la latenza.
Velocità
L'annuncio di Google cita dati di Artificial Analysis che in test pre-release hanno misurato circa 350 token di output al secondo.
Artificial Analysis ha successivamente registrato velocità specifiche del fornitore che potrebbero variare nel tempo. Il throughput dipende da:
- Capacità del fornitore
- Dimensione della richiesta
- Impostazioni di inferenza
- Lunghezza dell'output
- Routing regionale
- Domanda corrente
- Se la misurazione del test considera l'output visibile o il ragionamento nascosto
La conclusione stabile è che Flash-Lite è progettato per essere significativamente più veloce dei modelli Flash più grandi.
Miglioramenti nei benchmark
Google ha riportato i seguenti miglioramenti rispetto a Gemini 3.1 Flash-Lite:
| Benchmark | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31% | 54% |
| GDM-MRCR v2 | 60.1% | 72.2% |
| GDPval-AA v2 | 642 | 1140 |
Google ha anche riportato che Gemini 3.5 Flash-Lite supera Gemini 3 Flash in diversi benchmark su agenti e codifica:
- SWE-Bench Pro: 54.2% vs. 49.6%
- OSWorld-Verified: 74.0% vs. 65.1%
Questo rende Flash-Lite non solo un modello economico di bassa qualità. Per alcuni compiti specifici ad alto throughput per agenti, potrebbe offrire un equilibrio migliore rispetto al vecchio Gemini 3 Flash.
Incremento di intelligenza indipendente
Artificial Analysis ha assegnato a Gemini 3.5 Flash-Lite un punteggio di 36 nel suo indice di intelligenza, superiore al punteggio di 25 di Gemini 3.1 Flash-Lite.
Questo incremento di 11 punti è uno dei miglioramenti di intelligenza più significativi di questo rilascio.
Flash-Lite è ancora al di sotto dei modelli all'avanguardia più potenti, ma il suo obiettivo non è competere con loro in ogni compito di ragionamento complesso. Il suo ruolo è gestire volumi elevati di lavoro in modo rapido ed economico.
Gemini 3.5 Flash Cyber: modello di sicurezza vincolato
La terza versione rilasciata, Gemini 3.5 Flash
Cyber, ha uno scopo diverso.
È un modello specializzato basato su Gemini 3.5 Flash, ottimizzato per:
- Trovare vulnerabilità software
- Verificare se la vulnerabilità è reale
- Tracciare i percorsi di codice correlati
- Proporre soluzioni (patch)
- Supportare scansioni ripetute
- Analizzare grandi basi di codice a un costo inferiore rispetto ai modelli Cyber di grandi dimensioni
Il modello lavora in sinergia con l'agente per la sicurezza del codice di Google DeepMind, CodeMender.
In CodeMender, più agenti Flash Cyber possono esplorare diverse parti di una base di codice e integrare le loro scoperte in un unico rapporto.
Google ritiene che, nel campo della cybersecurity, l'uso di modelli più piccoli ed economici sia prezioso, poiché la ricerca di vulnerabilità spesso richiede l'esplorazione di un gran numero di possibili percorsi di esecuzione. Richiamare ripetutamente modelli grandi e costosi potrebbe diventare un collo di bottiglia.
Prestazioni su CyberGym
Google afferma che, se utilizzato tramite il sistema CodeMender, Gemini 3.5 Flash Cyber raggiunge prestazioni competitive a livello all'avanguardia su CyberGym.
Questo risultato dipende dall'intera infrastruttura dell'agente, non solo dal modello sottostante. Orchestrazione, strumenti, validazione e aggregazione dei report contribuiscono tutti al punteggio finale.
Disponibilità limitata
Gemini 3.5 Flash Cyber non sarà disponibile tramite l'API
L'API Gemini è ampiamente disponibile.
Google prevede di renderla disponibile tramite un programma pilota limitato chiamato CodeMender per:
- Agenzie governative
- Partner fidati
- Team di difesa della sicurezza in prima linea
Questo rilascio limitato riflette la duplice natura del modello. Un sistema in grado di trovare e verificare vulnerabilità può aiutare i difensori a correggere il software, ma capacità simili potrebbero anche supportare attività offensive.

Dov'è Gemini 3.5 Pro?
Google afferma che Gemini 3.5 Pro è in fase di test con i partner e verrà rilasciato più ampiamente quando sarà pronto.
Un articolo di AIBase collega questo ritardo a notizie esterne e voci online riguardanti le prestazioni di codifica e un possibile riaddestramento.
Google non ha confermato pubblicamente le voci secondo cui il piano di addestramento originale del modello sarebbe stato abbandonato o che il sistema sarebbe stato ricostruito da zero.
Le informazioni verificate sono limitate:
- Gemini 3.5 Pro è ancora in fase di test con i partner.
- Google non ha annunciato una data di rilascio generale.
- L'azienda ha avviato quella che definisce la sua più ambiziosa esecuzione di pre-addestramento per Gemini 4.
- Google afferma di essere incoraggiata dai progressi del modello di prossima generazione.
L'assenza del modello Pro di punta rende il rilascio di Flash strategicamente più importante. Fino a quando il modello di fascia alta non sarà disponibile, Gemini 3.6 Flash e Flash-Lite devono coprire una parte maggiore delle esigenze di produzione.
Ciò non significa necessariamente che Google abbia abbandonato Gemini 3.5 Pro o che Gemini 4 sia imminente.
Le tempistiche di sviluppo dei modelli possono cambiare; il pre-addestramento è solo una fase. Il post-addestramento, i test di sicurezza, l'integrazione degli strumenti, l'ottimizzazione della latenza e la preparazione per l'implementazione potrebbero richiedere molto tempo aggiuntivo.
Test indipendenti:
Miglioramento dell'efficienza, non aumento dell'intelligenza
Le conclusioni delle analisi manuali sono più prudenti degli annunci dei prodotti Google.
Indice di intelligenza
Gemini 3.6 Flash ottiene un punteggio di 50 nell'indice di intelligenza dell'analisi manuale.
Anche Gemini 3.5 Flash ottiene un punteggio di 50.
Pertanto, sebbene la valutazione mostri miglioramenti in alcune categorie, il punteggio composito di intelligenza del nuovo modello in questo test non è aumentato.
Il rapporto di Human Analysis afferma:
- Punteggio GDPval-AA v2 più alto
- Leggero regresso nell'Ultimo Esame Umano
- Livello di intelligenza complessivo simile
- Minore utilizzo di token di output
- Completamento delle attività più veloce
- Costo inferiore per attività
Si tratta di un aggiornamento credibile dell'efficienza, ma non di un salto diffuso nell'intelligenza.
Tempo per attività
Human Analysis ha misurato:
- Gemini 3.5 Flash: circa 2,7 minuti
- Gemini 3.6 Flash: circa 1,3 minuti
Il modello ha impiegato meno della metà del tempo per completare il carico di lavoro di valutazione.
Costo per attività
Stima di Human Analysis:
- Gemini 3.5 Flash: circa 0,59 $ per attività
- Gemini 3.6 Flash: circa 0,50 $ per attività
Per agenti IA su larga scala, questa riduzione dei costi è significativa, soprattutto quando i sistemi eseguono migliaia di attività.
I benchmark non dovrebbero essere considerati classifiche universali
Human Analysis combina più valutazioni in un unico indice. Il punteggio composito può essere utilizzato per un confronto approssimativo, ma potrebbe nascondere differenze significative tra diversi carichi di lavoro.
I modelli con lo stesso punteggio totale potrebbero essere superiori in alcuni aspetti, come:
- Programmazione
- Elaborazione di documenti multimodali
- Operazioni informatiche
- Agenti sensibili alla velocità
- Estrazione di contesti lunghi
Ma potrebbero essere più deboli in:
- Ragionamento astratto difficile
- Progettazione di stili visivi
- Elaborazione linguistica specifica
- Generazione creativa
- Attività che richiedono una pianificazione approfondita
La scelta del modello corretto dipende dallo scenario applicativo specifico.
Perché i primi feedback degli utenti sono più negativi
L'articolo originale ha raccolto diverse critiche dai social media.
I problemi segnalati dagli utenti includono:
- Scelte lessicali non naturali in cinese
- Scarsa coerenza mnemonica
- Errori nella selezione degli strumenti
- Scarsa progettazione dello stile visivo
- Qualità degradata delle texture dei giochi generate
- Mancata corrispondenza tra istruzioni e output visivo
- Limiti di utilizzo
- Nessun miglioramento evidente nell'intelligenza generale
Questi feedback sono importanti perché i benchmark non possono coprire tutti gli aspetti della qualità del prodotto.
Un modello potrebbe ottenere buoni risultati in compiti su codebase ma risultati scadenti nella generazione di layout; potrebbe utilizzare meno token ma diventare troppo conciso; potrebbe essere più accurato su un benchmark di programmazione ma meno affidabile in una lingua specifica.
Allo stesso tempo, i test sui social media presentano seri limiti:
- I prompt non sono sempre pubblici
- Le impostazioni del modello possono variare
- Gli utenti potrebbero confrontare diverse interfacce di prodotto
- Le versioni di anteprima e le API potrebbero utilizzare configurazioni diverse
- La disponibilità degli strumenti può influenzare i risultati
- Un singolo caso di fallimento non dimostra un regresso generalizzato
- Le critiche virali tendono ad amplificare i fallimenti più gravi
Pertanto, i primi feedback degli utenti dovrebbero essere considerati segnali per test mirati, non verdetti definitivi.
Quadro di valutazione pratico
I team che stanno valutando l'adozione di Gemini 3.6 Flash non dovrebbero prenderlo solo perché Google riporta benchmark più elevati, né dovrebbero rifiutarlo solo perché alcune demo online sono deludenti.
Un test di migrazione utile dovrebbe confrontare i modelli nuovo e vecchio sulla stessa applicazione.
1. Utilizzare compiti rappresentativi
Costruire un set di valutazione basato sul lavoro reale:
- Repository di codice effettivi
- Documenti reali
- Chiamate a strumenti tipiche
- Richieste utente comuni
- Casi di fallimento noti
- Prompt multilingue
- Esempi di contesto lungo
2. Misurare il completamento dell'attività, non solo la qualità dell'output
Tracciare:
- Tasso di successo delle attività
- Numero di chiamate a strumenti
- Numero di tentativi
- Modifiche non desiderate ai file
- Tempo di correzione manuale
- Latenza
- Token di output
- Costo totale
- Gravità del fallimento
3. Testare diversi livelli di pensiero
Gemini 3.6 Flash ha come impostazione predefinita un livello di pensiero medio.
Gemini 3.5 Flash-Lite ha come impostazione predefinita il livello di pensiero più basso.
Un modello potrebbe sembrare poco capace semplicemente perché l'impostazione di ragionamento è troppo bassa per l'attività corrente. Al contrario, utilizzare un livello di pensiero alto per compiti semplici di estrazione di informazioni potrebbe sprecare tempo e denaro.
4. Valutare separatamente la qualità visiva e linguistica
I benchmark di codifica non possono misurare se un sito web ha un aspetto gradevole o se la formulazione in cinese è naturale.
Utilizzare revisioni manuali dedicate per valutare:
- Gerarchia visiva
- Coerenza del marchio
- Stile del tono
- Qualità della traduzione
- Appropriatezza culturale
- Rispetto delle istruzioni
5. Testare l'intero stack dell'agente
Il risultato di un agente non dipende solo dal modello.
Confrontare:
- Definizioni degli strumenti
- Struttura del prompt
- Strategie di memoria
- Cache di contesto
- Regole di ripetizione
- Confini di approvazione
- Ambiente browser o computer
- Framework di orchestrazione
La migrazione del modello può richiedere un adeguamento corrispondente dell'intero ambiente di sistema.
Quale modello dovrebbero scegliere gli sviluppatori?
Scegli Gemini 3.6 Flash quando:
- L'attività richiede un ragionamento a più fasi.
- La qualità del codice è fondamentale.
- L'agente utilizza più strumenti.
- Il carico di lavoro include immagini, diagrammi, video o documenti di grandi dimensioni.
- È necessario utilizzare la funzionalità di controllo del computer (Computer Use).
- Meno turni e una minore latenza delle attività sono apprezzati.
- Gemini 3.5 Flash è attualmente disponibile ma è troppo prolisso o costoso.
Scegli Gemini 3.5 Flash-Lite quando:
- La produttività è la priorità principale.
- Il lavoro riguarda estrazione di informazioni, classificazione, traduzione o instradamento e distribuzione.
- Molti sub-agenti funzionano in parallelo.
L'applicazione deve gestire un grande volume di documenti.
- Mirare a ottenere un costo inferiore per token.
- Le attività complesse possono essere delegate a un modello principale più potente.
Utilizzo esclusivo di Gemini 3.5 Flash Cyber previa approvazione per l'accesso:
- L'organizzazione fa parte del programma pilota limitato di Google.
- Il carico di lavoro riguarda la sicurezza informatica difensiva.
- I risultati delle vulnerabilità scoperte sono stati verificati prima di intraprendere qualsiasi azione.
- I repository sensibili vengono gestiti con permessi rigorosi.
- L'organizzazione è in grado di gestire i rischi legati al duplice uso.
Il messaggio più ampio dal rilascio della versione Flash
È più facile considerare Gemini 3.6 Flash come un aggiornamento dell'esperienza operativa, piuttosto che una svolta drammatica in termini di intelligenza.
È progettato per ridurre gli sprechi che rendono costosi gli agenti:
- Ragionamento eccessivo
- Chiamate di strumenti ripetute
- Output prolissi
- Cicli di debug
- Modifiche di codice non necessarie
- Completamento lento delle attività
Questi miglioramenti possono avere un valore maggiore in produzione rispetto a piccoli avanzamenti nei benchmark astratti di ragionamento.
Tuttavia, l'efficienza non sostituisce la qualità in ogni applicazione.
Un modello in grado di svolgere compiti a basso costo è inutile se i risultati richiedono ampie correzioni manuali. Un modello con punteggi alti nella programmazione può comunque deludere per quanto riguarda la progettazione. Un modello con buone competenze in inglese potrebbe necessitare di ulteriori verifiche in cinese o in altre lingue.
La nuova serie Flash di Google crea opzioni più specializzate:
- 3.6 Flash: per lavori con agenti più potenti
- 3.5 Flash-Lite: per la scalabilità su larga scala
- Flash Cyber: per utilizzo di sicurezza controllato
Pertanto, questo rilascio riguarda meno la sostituzione di tutti gli altri modelli con uno solo, e più l'assegnazione del giusto livello di intelligenza e costo per ogni parte del sistema di agenti.
Domande frequenti
Cos'è Gemini 3.6 Flash?
Gemini 3.6 Flash è il modello multiuso principale di Google per programmazione, attività multimodali, lavoro cognitivo e flussi di lavoro con agenti. Si basa su Gemini 3.5 Flash, ma è progettato per utilizzare meno token, meno turni di interazione e meno chiamate di strumenti.
Gemini 3.6 Flash è più intelligente di Gemini 3.5 Flash?
Google riporta miglioramenti in diversi benchmark di programmazione, utilizzo del computer, apprendimento automatico e lavoro cognitivo. Artificial Analysis assegna a entrambi i modelli lo stesso punteggio complessivo di indice di intelligenza di 50, quindi i miglioramenti più evidenti sembrano essere nell'efficienza e nella velocità di completamento delle attività, piuttosto che in un aumento dell'intelligenza complessiva.
Quanto costa Gemini 3.6 Flash?
Google ha fissato il prezzo del modello a 1,50 dollari per milione di token di input e 7,50 dollari per milione di token di output. I prezzi possono variare e il costo totale per un agente dipende anche da ragionamento, dimensione del contesto, chiamate di strumenti, tentativi e lunghezza dell'output.
A cosa serve Gemini 3.5 Flash-Lite?
Flash-Lite è adatto per carichi di lavoro ad alta produttività e sensibili alla latenza, come estrazione, classificazione, ricerca, traduzione, instradamento, elaborazione di dati strutturati ed esecuzione di sotto-agenti. È più economico e veloce di Gemini 3.6 Flash, ma non è progettato per sostituire modelli più potenti in tutte le attività difficili.
Gemini 3.6 Flash supporta immagini e video?
Sì. La sua scheda tecnica elenca funzionalità che includono il supporto per input di testo, immagini, audio e video, con output di testo. Il modello ha una finestra di contesto fino a 1 milione di token.
Cos'è Gemini 3.5 Flash Cyber?
È una versione specializzata di Gemini 3.5 Flash, addestrata per la scoperta, la verifica e la correzione di vulnerabilità. Google prevede di offrire il modello a governi e partner di difesa fidati attraverso un progetto pilota con restrizioni chiamato CodeMender.
Gemini 3.5 Pro è stato cancellato?
Google non ha indicato che sia stato cancellato. L'azienda ha affermato che Gemini 3.5 Pro è in fase di test con partner e sarà ampiamente disponibile quando sarà pronto.
Dovrei migrare immediatamente da Gemini 3.5 Flash?
Non necessariamente subito. Prima di passare, esegui entrambi i modelli su attività di produzione rappresentative e confronta i tassi di successo, i tempi di correzione manuale, l'affidabilità degli strumenti, la latenza, l'utilizzo di token e il costo totale.
Strumenti correlati
- Google AI Studio: L'ambiente basato su browser di Google per testare modelli Gemini, prompt, strumenti e configurazioni API.
- API Gemini: L'API ufficiale per integrare i modelli Gemini in applicazioni e flussi di lavoro per agenti.
- App Gemini: L'interfaccia consumer di Google per l'utilizzo diretto dei modelli Gemini.
Antigravity (link: https://antigravity.google/): L'ambiente di sviluppo per agenti di Google, con Gemini 3.6 Flash integrato per flussi di lavoro di codifica.
- CodeMender (link: https://deepmind.google/models/codemender/): L'agente di Google DeepMind per trovare e correggere vulnerabilità software.
- Artificial Analysis (link: https://artificialanalysis.ai/): Una piattaforma indipendente di confronto modelli, che copre livello di intelligenza, velocità, latenza, utilizzo di token e informazioni sui prezzi.
Collegamenti correlati
- Annuncio ufficiale del rilascio di Gemini Flash: Specifiche, risultati dei benchmark, prezzi, casi studio dei clienti e informazioni sulla disponibilità forniti da Google.
- Scheda tecnica di Gemini 3.6 Flash: Dettagli ufficiali su input, lunghezza del contesto, limitazioni, test di sicurezza e data di conoscenza.
- Scheda tecnica di Gemini 3.5 Flash-Lite: Informazioni ufficiali su utilizzo previsto, limitazioni del modello, valutazione della sicurezza e distribuzione.
- Gemini 3.5 Flash Cyber: Spiegazione di Google DeepMind sul modello di cybersecurity dedicato e sul progetto pilota con restrizioni.
- Guida ai modelli più recenti dell'API Gemini: ID modello ufficiali, guide alla migrazione, modifiche API, prezzi e casi d'uso consigliati.
- Prezzi dell'API Gemini: Pagina ufficiale dei prezzi correnti per i modelli e i servizi dell'API Gemini.
- Analisi di Artificial Analysis: Analisi indipendente sul livello di intelligenza, costo per singola attività, velocità di output, efficienza dei token e durata delle attività.
Riepilogo
L'ultimo rilascio Flash di Google include tre prodotti distinti. Gemini 3.6 Flash è destinato ad agenti complessi e scenari di codifica, Gemini 3.5 Flash-Lite è focalizzato su esecuzione ad alta produttività, e
Gemini 3.5 Flash Cyber, in condizioni di accesso limitato, si concentra sulla ricerca di vulnerabilità difensive.
Gemini 3.6 Flash ha migliorato diversi benchmark a livello di task, ridotto l'uso di token di output, accelerato il completamento dei task degli agenti e abbassato i prezzi di output. Tuttavia, test indipendenti hanno rilevato che il suo punteggio complessivo di intelligenza non è migliorato rispetto a Gemini 3.5 Flash.
Pertanto, la complessa reazione del mercato è comprensibile. Questo rilascio è più una solida prova in termini di efficienza che un salto nelle capacità generali.
La migliore valutazione per Gemini 3.6 Flash è: si tratta di un modello produttivo più veloce e snello, non una dimostrazione che tutte le forme di intelligenza o qualità dell'output siano migliorate in modo sincrono.