Introduzione al lancio di Gemini 4 Argon
Il 30 settembre 2026 Google DeepMind ha annunciato il debutto di Gemini 4 Argon, il primo modello della nuova serie Gemini 4. L’annuncio, presentato come una pietra miliare per l’ingegneria del software, sottolinea le capacità di ragionamento profondo su flussi di lavoro complessi e multi‑step, secondo le parole di Koray Kavukcuoglu, responsabile del progetto.
Prestazioni sul benchmark DeepSWE v1.1
DeepSWE v1.1 è il benchmark più completo per valutare le prestazioni su attività reali di software engineering a lungo orizzonte. Argon ha ottenuto un punteggio del 77,9 %, superando il 74,1 % di GPT‑6 Astra (OpenAI) e il 74,2 % di Claude Opus 5.5 (Anthropic). Si tratta di un nuovo record assoluto per questo test, che misura la capacità di produrre codice di qualità, gestire refactoring e mantenere coerenza a lungo termine.
Confronti con i principali concorrenti
Su un totale di 19 benchmark dichiarati, Argon si posiziona al primo posto o a pari merito su 14. In particolare, eccelle nelle categorie di knowledge work—finanza, legale, codice e fisco—dove guida tutti i test con margini significativi. L’elenco sintetico dei risultati più rilevanti è il seguente:
- AutomationBench di Zapier: 51,3 % (primo posto)
- DeepSWE v1.1: 77,9 % (record)
- CWE‑bench v1 (cybersecurity): 68 % (pari al primo)
- Prompt‑injection indiretta: tasso di successo attacco 0,7 % (migliore di Claude Opus 5.5 e GPT‑6 Astra)
Limiti evidenziati da altri benchmark
Nonostante i risultati eccellenti, Argon non è dominante su tutti i fronti. Su FrontierSWE v2, ad esempio, il modello segna il 55,0 %, contro il 65,5 % di GPT‑6 Astra, indicando un divario di oltre dieci punti. Inoltre, su Terminal‑bench 4.0, Claude Opus 5.5 guida con il 66,4 %, mentre Argon raggiunge solo il 57,4 %. Queste discrepanze mostrano come le performance dipendano fortemente dalla natura specifica di ciascun test.
Sicurezza e resistenza agli attacchi
Nel contesto della cybersecurity, Argon ottiene il 68 % su CWE‑bench v1, dimostrando una buona capacità di individuare e correggere vulnerabilità note. Un aspetto particolarmente rilevante è la sua resistenza agli attacchi di prompt injection indiretta: solo lo 0,7 % delle richieste è stato manipolato con successo, a fronte dell’1 % di Claude Opus 5.5 e dell’8,5 % di GPT‑6 Astra. Google ha anche riportato un caso interno in cui Argon, applicato a ricerche sul quantum computing, ha superato una baseline del 40 % in pochi minuti.
Accesso, pricing e utilizzo interno
L’accesso a Gemini 4 Argon avviene tramite il Fairwind Program, che distribuisce il modello prima ai difensori della cybersecurity certificati, poi agli utenti dell’API a pagamento e infine agli abbonati Google AI Ultra. I prezzi di lancio sono fissati a 2 dollari per milione di token in input e 10 dollari per milione in output, con uno sconto del 95 % sull’input tramite caching. Il prezzo standard, previsto per il futuro, sarà di 4 dollari in input e 20 dollari in output. Migliaia di dipendenti Google già utilizzano Argon internamente per attività di ingegneria e ricerca.
Prospettive future e competitività del mercato
La vera sfida si presenterà quando l’accesso al modello sarà aperto al pubblico e quando benchmark indipendenti, non solo quelli selezionati da Google, forniranno una valutazione più completa. Anthropic e OpenAI continuano a investire in Claude Opus 5.5 e GPT‑6 Astra, mantenendo una competitività su più fronti. Argon, pur guidando su test chiave, non ha ancora chiuso definitivamente il divario con i concorrenti. La stagione dei modelli frontier del 2026 è quindi ancora aperta, con nuove versioni e test che potrebbero ridisegnare nuovamente la classifica.