Google porta la competizione tra modelli AI sul terreno dei processi professionali complessi. Presentato ieri, Gemini 4 Argon si rivolge allo sviluppo software, alle attività legali, a quelle finanziarie e alla difesa informatica. Come sta accadendo sempre più spesso, le paure sulle capacità d’attacco e sui limiti che spesso vengono ignorati hanno portato l’azienda a puntare su di un rilascio iniziale mirato e limitato alla cybersecurity che coinvolge un gruppo selezionato di operatori in quello che viene definito Fairwind Program; l’apertura successiva partirà dai clienti API a pagamento e dagli abbonati Google AI Ultra, senza avere, però, ancora una data precisa.
Un milione di token in output: cosa cambia
Una delle caratteristiche più importanti di Argon è quella di innalzare il limite di di token in output a milione, rispetto ai precedenti 64.000 permettendogli, secondo Google, di sostenere elaborazioni e ragionamenti più lunghi. Questa caratteristica ha implicazioni diverse dal limite della finestra di contesto perché comporta il potenziale vantaggio di lasciare più spazio a un’attività prima di doverla interrompere per poi ricomporla attraverso richieste successive. Una delle applicazioni che dovrebbe trarne maggior vantaggio è quella dello sviluppo software, soprattutto quando le elaborazioni interessano numerosi componenti collegati tra loro. Google porta come esempio alcune applicazioni interne già usate per migliorare l’infrastruttura e il software.
Un gruppo di agenti Argon ha analizzato i dati di profilazione dei sistemi individuando ottimizzazioni che, dopo l’implementazione, avrebbero liberato oltre 300 TB di memoria. Un altro filone riguarda la migrazione da C e C++ a Rust con attività che arrivano a coinvolgere oltre 800.000 righe del kernel Zircon di Fuchsia. Durante il processo, precisa Google, le riscritture attraversano controlli automatici e manuali, test di emulazione e revisioni prima della produzione. Gli umani, quindi, ancora non spariscono dall’operatività, ma il ruolo è molto ridotto e tutto diventa molto più veloce. Infine, nel decoder video libgav1, gli agenti hanno sostituito 32.000 righe di codice SIMD in un porting Rust esistente con il risultato di un’accelerazione di 2,7 volte rispetto a quel porting, a parità di output video.
Dove Argon mostra i suoi punti di forza
I risultati più interessanti riguardano la capacità di portare avanti il lavoro attraverso più passaggi. Nelle prove di sviluppo software citate da Google, Argon raggiunge il 77,9% su DeepSWE, un benchmark che mette alla prova i modelli su incarichi prolungati di ingegneria del software. Nell’automazione dei processi aziendali ottiene invece il 51,3% su AutomationBench: un risultato che Google presenta come il migliore della classifica, ma che mostra anche quanto spazio resti per migliorare l’esecuzione.
Infine, Argon conquista il primo posto nel Vals Index che valuta attività di programmazione, finanza, diritto e fiscalità. Con un punteggio del 68,9%, precede di circa due punti percentuali Claude Sonnet 5.5 e Claude Opus 5.5. Ovviamente, nessuno di questi benchmark è ancora stato replicato perché il modello è ancora ristretto, ma sappiamo anche che un punteggio alto non è garanzia di qualità assoluta. Attendiamo che venga rilasciato a tutte le aziende per vedere se davvero è in grado di surclassare gli altri.
Per il momento, gli unici che possono sperimentare, come detto, sono le aziende e organizzazioni che fanno parte del Fairwind Program, composto per lo più da difensori di infrastrutture e servizi essenziali. Google indica tra i partecipanti autorità pubbliche, operatori sanitari, telecomunicazioni e altre infrastrutture critiche per un totale di oltre 650 partner complessivi che può accedere anche a CodeMender, un agente specializzato nell’individuazione e correzione di problemi di sicurezza del codice. Le politiche di ammissione al programma sono molto stringenti, tanto come numero di misure per evitare usi da parte di entità non autorizzate, sia proprio nella scelta delle aziende.
Il controllo degli agenti diventa un problema infrastrutturale
Sebbene nell’uso aziendale quotidiano non ci si aspetti grandi colpi di testa da parte degli agenti AI, Google ha deciso di rinforzare le misure contro l’evasione degli agenti e le operazioni non autorizzate che potrebbero intraprendere. In primo luogo, è stati migliorati l’isolamento degli ambienti, il monitoraggio sui comportamenti che dovrebbero portare anche a una migliorata efficacia nel mitigare e rimediare alle eventuali azioni errate. Nella sua AI Control Roadmap, l’azienda considera anche lo scenario in cui un agente operi al di fuori degli obiettivi assegnati, trattandolo nel modello di minaccia alla stregua di un dipendente infedele in modo da coprire al meglio sia i malfunzionamenti indotti dal modello, sia quelli causati da eventuali attacchi informatici. Per questo il sistema prevede supervisori che esaminano piani e operazioni e possono bloccare comportamenti pericolosi.
Prezzi e sostenibilità economica
Google annuncia tariffe introduttive di 2 dollari per milione di token in ingresso e 10 in uscita, destinate a salire rispettivamente a 4 e 20 dollari. Per i token in ingresso recuperati dalla cache è previsto uno sconto del 95%. Si tratta di valori tutt’altro che “popolari” che implicano una grande attenzione da parte delle aziende nella scelta dei modelli a cui affidare i vari carichi. Per valutare Argon, una sperimentazione utile dovrebbe quindi partire da un processo circoscritto con risultati verificabili: una classe di difetti software, un’attività di analisi documentale o un insieme di controlli ripetitivi. Il confronto con il processo attuale dovrà mostrare quanto lavoro viene effettivamente risparmiato e quale quota richiede ancora intervento umano, incrociando il tutto con il costo vivo dei token. L’ottimizzazione, già importante oggi, sarà probabilmente la vera chiave di volta per l’automazione futura perché ne deciderà l’efficacia e la profondità dei risultati che andranno poi a guidare le scelte strategiche.