Gemini 4 Argon AI

Google ha presentato Gemini 4 Argon AI, il nuovo modello di punta che, secondo l’azienda, supera i predecessori in ingegneria del software, lavoro aziendale e difesa informatica.

Alphabet ha distribuito il sistema mercoledì 30 settembre 2026, partendo da un gruppo ristretto di partner di cybersecurity di fiducia e non da un debutto pubblico completo. È il passo più ambizioso finora verso quella che l’azienda chiama intelligenza di frontiera, mentre Google deve dimostrare che i suoi modelli tengono il passo dei rivali su compiti reali e ad alto rischio.

Punti chiave

  • Il limite di token in output di Gemini 4 Argon AI sale a 1 milione, da 64.000, permettendo catene di ragionamento molto più lunghe.
  • Il modello fissa un nuovo stato dell’arte su DeepSWE v1.1 con un punteggio del 77,9% per i compiti di ingegneria software a lungo orizzonte.
  • Argon si piazza a pari merito al primo posto su CWE-bench v1 con un punteggio del 68%, basandosi sul lavoro del modello 3.8 Flash Cyber di Google.
  • Le implementazioni interne hanno già liberato oltre 300 TiB di memoria nei data center, con un risparmio totale stimato tra 500 TiB e 1 PiB.
  • Google rilascia Argon in fasi, partendo dai partner di cybersecurity.

Prestazioni di frontiera in ingegneria software e lavoro d’impresa

Gemini 4 Argon AI offre quello che Google definisce un livello di frontiera in flussi di lavoro complessi e reali, dalla programmazione alla ricerca legale e finanziaria fino alla difesa della sicurezza. L’azienda dice che il modello è già in uso nei propri team di ingegneria, con miglioramenti segnalati nella qualità della scrittura, nella capacità di ricerca e in compiti di coding specializzati.

I punteggi dei benchmark che fissano nuovi standard

Su DeepSWE v1.1, benchmark che misura le prestazioni di ingegneria software su compiti reali a lungo orizzonte, Argon ha ottenuto un punteggio del 77,9%, un nuovo stato dell’arte secondo Google. Oltre al coding, il modello guida il Vals Index, che misura l’impatto economico su finanza, programmazione, diritto e fiscalità, pesando ogni settore in base al contributo al PIL statunitense.

CNBC ha riportato che Argon si posiziona davanti a GPT-6 Astra di OpenAI e a Fable 5.1 di Anthropic su quello stesso indice. Il modello è anche primo su AutomationBench di Zapier, che valuta l’esecuzione end-to-end delle funzioni aziendali principali, con un punteggio del 51,3%, e raggiunge il 91,7% su LVBench, test di comprensione video a lungo termine che Google definisce stato dell’arte.

La forza di Argon nel ragionamento visivo si estende anche all’analisi professionale di grafici e alle decisioni basate su documenti, utile per chi deve gestire report densi e fascicoli con più pagine.

Questa varietà di risultati conta perché mostra che il modello non è solo uno specialista di coding. Un sistema che va bene in redazione legale, ricerca finanziaria e comprensione video allo stesso tempo suggerisce che Google punta Argon verso clienti enterprise che vogliono un unico modello per più reparti, non un mosaico di strumenti specializzati.

La difesa informatica e la collaborazione con Wiz

Argon è stato addestrato specificamente per rafforzare la difesa informatica e Google dice che riesce a individuare, validare e correggere in modo autonomo vulnerabilità critiche del software. Su CWE-bench v1, benchmark che valuta la capacità di un modello di correggere falle di sicurezza, Argon si piazza a pari merito al primo posto con un punteggio del 68%, sulla scia del modello 3.8 Flash Cyber, uscito a inizio settembre 2026 e già primo su CWE-bench v0.

CNBC ha riportato che Argon è anche a pari merito con GPT-6 Astra di OpenAI e con Grok 4.7 sui benchmark di valutazione della cybersecurity, posizionandosi come concorrente diretto in un’area della corsa all’AI che si muove molto velocemente. Per i difensori di fiducia e per i team interni di Google, l’azienda prevede di rilasciare Argon senza le barriere di sicurezza dedicate al cyber, dando accesso alle piene capacità difensive di frontiera del modello.

Scoperta autonoma di vulnerabilità in azione

La società di sicurezza Wiz sta già usando Argon tramite la sua iniziativa Scan for Good, un programma gratuito pensato per proteggere infrastrutture pubbliche critiche individuando e correggendo le esposizioni a più alto rischio. In un primo test, il modello ha scovato una vulnerabilità critica che esponeva informazioni personali sensibili nei software ospedalieri usati da ospedali in tutto il mondo, un rischio che secondo Google i precedenti modelli di frontiera avevano completamente mancato.

Sul benchmark interno di Google per le vulnerabilità, Argon ha individuato falle in codebase che coprono 20 linguaggi di programmazione. Sul benchmark di penetration testing black-box di Wiz, ha superato 3.8 Flash Cyber nell’identificare superfici di attacco e nel produrre prove concrete di exploit.

Innovazioni tecniche: dai token in output all’ottimizzazione quantistica

Per gestire compiti più lunghi e complessi, Google ha ampliato notevolmente il limite di token in output di Argon, portandolo a 1 milione, cifra leader nel settore, contro i precedenti 64.000. Questo margine in più permette al modello di generare centinaia di migliaia di token in un solo passaggio di ragionamento, aggiungendo profondità a problemi che prima richiedevano più sessioni avanti e indietro.

Il modello produce già risultati misurabili dentro l’infrastruttura stessa di Google. Nella ricerca sul quantum computing, Argon ha aiutato a ottimizzare le risorse spaziotemporali, qubit moltiplicati per porte logiche, di subroutine che rallentano applicazioni chiave, battendo una baseline pubblicata del 40% nel giro di pochi minuti.

Un team di agenti Argon ha inoltre analizzato la telemetria di tutta la flotta dei data center di Google, individuando e applicando in autonomia ottimizzazioni di memoria: oltre 300 TiB liberati una volta completato il rollout, con un risparmio totale stimato tra 500 TiB e 1 PiB. CNBC ha sottolineato che questi guadagni sono arrivati senza l’acquisto di nuovo hardware.

Gli agenti Argon si occupano anche di uno dei lavori più tediosi dell’ingegneria software: migrare codebase da C/C++ a Rust. L’intervento copre decine di migliaia di righe in librerie centrali come re2 e libgav1, arrivando a oltre 800.000 righe per il kernel Zircon del sistema operativo Fuchsia. Dato quanto sono critici questi sistemi, Google dice che le riscritture passano per controlli automatici e manuali rigorosi, test di emulazione e revisione prima di arrivare in produzione.

Per libgav1, la libreria open source di Google per la decodifica video, gli agenti Argon hanno preso un porting Rust già esistente e sostituito 32.000 righe di codice SIMD attraverso esperimenti ripetuti guidati da profilazione, producendo un decoder memory-safe che gira 2,7 volte più velocemente della versione Rust precedente, mantenendo output video identico.

Le tutele di frontiera prima di una disponibilità più ampia

Prima che Argon arrivi a un pubblico più ampio, Google dice di stare rafforzando le proprie tutele. Il modello è progettato per rifiutare richieste dannose legate a usi impropri in ambito cyber o CBRN, ossia chimico, biologico, radiologico e nucleare, continuando però a supportare la ricerca scientifica legittima a duplice uso, secondo il Frontier Safety Framework dell’azienda.

Google afferma di aver migliorato le tecniche di monitoraggio delle attivazioni interne del modello per individuare abusi, con le tutele testate da red team interni ed esterni con metodi di attacco manuali e automatizzati. Argon viene descritto anche come il modello più resistente finora contro gli attacchi indiretti di prompt injection, in cui istruzioni nascoste cercano di dirottare il comportamento di un modello.

Attraverso addestramento avversariale e red teaming automatizzato, Google dice che Argon guida il benchmark Indirect Prompt Injection di Gray Swan. Questo approccio su più livelli riflette una tensione più ampia nello sviluppo dell’AI di frontiera: le stesse capacità che rendono un modello utile per trovare e correggere vulnerabilità potrebbero, nelle mani sbagliate, essere usate per scoprirne di nuove. La scelta di Google di rilasciare Argon prima a un gruppo ristretto di partner di cybersecurity di fiducia, e non al pubblico, segnala quanto seriamente venga trattato questo rischio a duplice uso.

La strategia di rilascio e cosa succede adesso

Google non attiva Argon tutto in una volta. L’azienda dice di voler rilasciare il modello in fasi, partendo da un primo gruppo di difensori informatici e tester di fiducia il cui riscontro sul campo aiuterà a perfezionare il sistema prima che arrivi a sviluppatori, imprese e consumatori.

CNBC ha riportato anche che Google sta conducendo una valutazione di sicurezza pre-rilascio con il governo degli Stati Uniti come parte di questo percorso. Il momento scelto non è casuale: il lancio è arrivato un giorno dopo che l’amministratore delegato di Google Sundar Pichai ha firmato un accordo volontario sulla sicurezza dell’AI con il presidente Donald Trump, in seguito a un incontro alla Casa Bianca con i principali dirigenti tech incentrato sulle crescenti preoccupazioni per la sicurezza dell’AI.

Il lancio segna anche un cambio di strategia. Secondo CNBC, Google ha passato gran parte dell’ultimo anno a scalare modelli “flash” più veloci ed economici, mentre Gemini 4 Argon AI rappresenta una nuova spinta verso la frontiera, arrivando quasi un anno dopo che Gemini 3 aveva rimesso l’azienda in testa alla corsa ai modelli AI.

Se Argon riuscirà a mantenere quella posizione dipenderà meno dai punteggi nei benchmark e più da come si comporterà una volta nelle mani di sviluppatori esterni e clienti enterprise che non hanno fatto parte dei test interni di Google.

Contenuto realizzato con l’assistenza dell’intelligenza artificiale e con revisione editoriale umana.