Google pianifica Gemini 4 Argon senza guardrail per la difesa informatica
Immagine generata dall'IA

Google pianifica Gemini 4 Argon senza guardrail per la difesa informatica

Google ha annunciato Gemini 4 Argon, un modello di IA di frontiera che trova e corregge falle critiche del software, con una versione senza guardrail pianificata per i difensori.

Google ha annunciato mercoledì il suo ultimo modello di intelligenza artificiale (IA) di frontiera, Gemini 4 Argon, e ha dichiarato che verrà distribuito a un gruppo di difensori informatici fidati attraverso il Fairwind Program dell'azienda. Un modello di IA di frontiera è uno dei sistemi più avanzati che un'azienda offre attualmente. Il modello è progettato per gestire flussi di lavoro complessi nell'ingegneria del software, nel lavoro di conoscenza aziendale come legale e finanza, e nella difesa della sicurezza informatica, secondo Koray Kavukcuoglu, vicepresidente senior di Google DeepMind e Chief AI Architect di Google. Kavukcuoglu ha affermato che il modello offre prestazioni di frontiera in quelle aree, sebbene l'annuncio non includesse punteggi benchmark specifici oltre a un confronto con il precedente modello di sicurezza informatica di Google.

Il rilascio arriva quasi un mese dopo che Google ha introdotto Gemini 3.8 Flash Cyber, che l'azienda ha descritto come il modello di sicurezza informatica più capace in quel momento. Google afferma che Argon, come modelli comparabili di Anthropic e OpenAI, è altamente capace di trovare, validare e correggere autonomamente vulnerabilità critiche del software. In un esempio, Google ha dichiarato che Argon ha trovato una vulnerabilità critica precedentemente sconosciuta che esponeva informazioni personali sensibili in un software sanitario utilizzato da ospedali in tutto il mondo. Google non ha nominato il software interessato né fornito dettagli su quante organizzazioni o pazienti sono stati colpiti. Secondo Google, Argon mostra progressi impressionanti nella scoperta di vulnerabilità rispetto a 3.8 Flash Cyber, e supera il modello precedente quando si tratta di scoprire la superficie d'attacco di un'applicazione, i punti di ingresso che un aggressore potrebbe bersagliare, e di generare proof-of-concept (PoC), che sono dimostrazioni funzionanti che confermano che una falla di sicurezza può essere sfruttata.

Google ha dichiarato di pianificare il rilascio di una versione di Argon senza guardrail informatici ai difensori fidati e ai suoi team interni. I guardrail informatici sono restrizioni integrate che limitano ciò che un modello di IA è autorizzato a fare, e rimuoverli consentirebbe a quei team di utilizzare le piene capacità del modello per i test di sicurezza. Prima di qualsiasi distribuzione più ampia, l'azienda ha affermato di lavorare per rafforzare le salvaguardie che impediscono al modello di essere disallineato rispetto ai suoi obiettivi previsti, fermare l'uso improprio da parte di malintenzionati e renderlo resistente alle iniezioni indirette di prompt (IPI). Un'iniezione indiretta di prompt è un attacco in cui un'istruzione dannosa è nascosta all'interno di contenuti che un sistema di IA legge in seguito, come una pagina web o un documento, per ingannare il modello inducendolo a fare qualcosa di non intenzionale.

Google ha rilasciato una valutazione del modello che mostra che Argon supera altri modelli e si posiziona al primo posto nel benchmark di iniezione indiretta di prompt di Gray Swan. In termini pratici, ciò significa che il modello era migliore dei rivali nel resistere agli attacchi in cui una terza parte cerca di controllarlo attraverso testo inserito. Google ha anche affermato di distribuire mitigazioni del disallineamento che monitorano la catena di pensiero di Argon, il ragionamento passo passo che un modello produce mentre lavora, e le sue azioni, interrompendo l'esecuzione quando necessario. L'azienda ha dichiarato di incoraggiare fortemente il resto del settore a preservare la trasparenza del ragionamento durante questi momenti di maggiore capacità mentre si affrontano i rischi di allineamento, in modo che i pensieri del modello rimangano utili per identificare e diagnosticare il disallineamento.

Per i proprietari di siti web e i team IT, lo sviluppo è importante perché i modelli di IA in grado di trovare e validare le vulnerabilità possono accelerare il rilevamento di difetti nelle applicazioni web, inclusi quelli nei sistemi di gestione dei contenuti, nei plugin e nel codice personalizzato. Tuttavia, le stesse capacità significano anche che i difensori, la gestione delle patch e la configurazione sicura diventano più importanti, perché un modello può dimostrare che una falla è reale e sfruttabile più rapidamente. Per le aziende che hanno bisogno di trasformare tali risultati in patch tempestive e configurazioni sicure, AEU-I fornisce supporto IT, infrastruttura e consulenza orientati alla sicurezza.

Come Proteggerti

  1. Aggiorna il software del tuo sito web, i plugin e i temi non appena sono disponibili gli aggiornamenti, così le falle di sicurezza note vengono chiuse rapidamente.
  2. Usa password robuste e uniche per gli account amministratore e di hosting del tuo sito web, e attiva l'accesso in due passaggi così una password rubata da sola non è sufficiente per entrare.
  3. Controlla l'elenco degli utenti del tuo sito web e rimuovi o disattiva vecchi account, app e integrazioni che non servono più.
  4. Esegui backup regolari del tuo sito web e conserva almeno una copia offline, così puoi ripristinarlo se qualcosa va storto.
  5. Chiedi al tuo sviluppatore o al provider di hosting di controllare il tuo sito web per dati sensibili esposti e di correggere eventuali problemi che trovano.
  6. Fai attenzione ad aprire link o documenti da mittenti sconosciuti, perché istruzioni nascoste all'interno dei contenuti possono indurre gli strumenti di IA e altri software a compiere azioni dannose.

I Termini Spiegati

  • frontier artificial intelligence (AI) model Il tipo più avanzato e capace di sistema di intelligenza artificiale attualmente disponibile, all'avanguardia di ciò che la tecnologia può fare.
  • proof-of-concepts (PoCs) Piccole dimostrazioni funzionanti che mostrano che una presunta falla di sicurezza è reale e può effettivamente essere sfruttata.
  • attack surface Tutti i punti di ingresso in un software o sistema che un aggressore potrebbe provare a utilizzare per entrare.
  • cyber guardrails Restrizioni integrate che limitano ciò che un sistema di intelligenza artificiale è autorizzato a fare, per mantenerlo sicuro.
  • indirect prompt injections (IPIs) Un trucco in cui istruzioni dannose sono nascoste all'interno di contenuti ordinari, come una pagina web o un documento, che un sistema di IA legge in seguito e potrebbe eseguire.
  • chain-of-thought Il ragionamento passo passo che un sistema di IA produce mentre lavora su un compito, che può aiutare le persone a capire perché ha preso una decisione.
  • misalignment Una situazione in cui un sistema di intelligenza artificiale agisce in un modo che non corrisponde più a ciò che i suoi creatori intendevano o a ciò che è sicuro.

Servizi AEU correlati