OpenAI Blocca l'Estrazione del Ragionamento AI Protetto da Moonshot AI
Immagine generata con IA

OpenAI Blocca l'Estrazione del Ragionamento AI Protetto da Moonshot AI

OpenAI ha interrotto una campagna coordinata che tentava di estrarre ragionamento protetto dai suoi modelli di intelligenza artificiale, attribuendo l'attività a individui legati a Beijin…

OpenAI ha bloccato una campagna sistematica progettata per estrarre illecitamente il ragionamento protetto dai suoi modelli di intelligenza artificiale, una tecnica nota come distillazione avversaria. L'azienda ha collegato una parte centrale dell'attività, che va da inizio luglio a fine luglio 2026, a individui associati a Moonshot AI, una società cinese di IA con sede a Pechino.

La campagna è iniziata il 1° luglio 2026 con richieste di sondaggio a basso volume. È aumentata drasticamente il 24 e 25 luglio, quando OpenAI ha registrato circa 16.000 tentativi di richiesta utilizzando uno schema di estrazione specifico, distribuiti su oltre 4.000 account utente. Una successiva indagine più ampia ha identificato attività correlate nei modelli di prompt su oltre 15.000 utenti. OpenAI ha interrotto completamente l'operazione il 28 luglio 2026.

La distillazione avversaria è l'uso sistematico e non autorizzato degli output di un modello per addestrare, replicare o migliorare un altro modello. In questo caso, gli operatori non hanno violato la crittografia, compromesso database o ottenuto accesso diretto alle conversazioni archiviate. Hanno invece manipolato le interazioni del modello in modo che il ragionamento protetto—il processo di pensiero interno passo dopo passo che un modello esegue prima di fornire una risposta finale—potesse essere riprodotto in forme visibili al richiedente, su larga scala e in violazione dei termini di servizio di OpenAI.

Per comprendere il rischio, il ragionamento protetto offre una finestra su come un modello affronta un compito. Estrarlo può rivelare dati sensibili e aiutare i concorrenti a copiare le capacità di un modello senza investire le stesse risorse in misure di sicurezza. OpenAI ha osservato che il ragionamento estratto potrebbe essere usato per addestrare un altro modello mantenendo le prestazioni dell'originale ma scartando i filtri di sicurezza rivolti all'utente, il che solleva preoccupazioni sia per la sicurezza che per la sicurezza nazionale, in particolare man mano che i modelli acquisiscono capacità in ambiti a duplice uso.

In seguito all'incidente, OpenAI ha implementato ulteriori mitigazioni. Ha chiuso un “percorso” che consentiva a chiunque possedesse la traccia di ragionamento crittografato di un altro utente di riprodurla e recuperarne i contenuti in chiaro. L'azienda ha anche aggiunto controlli per rilevare e bloccare qualsiasi output in streaming che potrebbe esporre il ragionamento prima che raggiunga l'utente. Inoltre, OpenAI ha bannato gli account fraudolenti coinvolti nella campagna.

L'episodio mette in luce un problema architetturale più profondo. In uno studio pubblicato nell'agosto 2026, ricercatori di MATS Research, ELLIS Institute Tübingen e Synk hanno scoperto una vulnerabilità che colpisce i modelli di IA di più fornitori, tra cui Claude, Gemini e GPT. Hanno scoperto che le tracce di ragionamento crittografate sono completamente compatibili e intercambiabili tra sessioni, utenti e modelli diversi all'interno dell'ecosistema di un singolo fornitore. Un aggressore potrebbe iniettare una traccia di ragionamento crittografata proveniente da un modello forte e ben protetto in un modello più debole e meno protetto dello stesso fornitore, costringendo il modello più debole a decodificare e produrre il ragionamento testualmente in chiaro—senza mai eseguire direttamente il jailbreak del modello più forte. Questa tecnica consente anche l'estrazione su larga scala di dati privati, iniezioni di prompt invisibili in cui i payload dannosi sono completamente nascosti all'interno di blocchi crittografati e l'esposizione accidentale di informazioni pericolose dal processo di ragionamento anche quando l'output visibile finale del modello rifiuta una richiesta dannosa.

Non è la prima volta che Moonshot AI affronta accuse di distillazione. Il mese scorso, l'azienda rivale di IA Anthropic ha sostenuto che Moonshot AI stava inoltrando di nascosto le richieste dei clienti dalla propria piattaforma Kimi al modello Claude di Anthropic, per poi mostrare le risposte di Claude agli utenti. Anthropic ha inoltre affermato che Moonshot AI ha conservato un sottoinsieme di quegli scambi per addestrare il proprio modello a catena di pensiero. Tale attività è tracciata con l'identificativo GTG-16002.

Per le aziende e gli operatori di siti web che integrano funzionalità basate sull'IA nella loro presenza online—come chatbot, generatori di contenuti o automazione dell'assistenza clienti—l'incidente è un promemoria che i servizi di IA di terze parti sono sicuri solo quanto le loro difese più sollecitate. AEU-I, la nostra consulenza IT e infrastrutturale orientata alla sicurezza, aiuta le organizzazioni a valutare i rischi legati agli strumenti di terze parti, implementare politiche di gestione dei dati e monitorare modelli di accesso anomali che potrebbero segnalare un'estrazione non autorizzata di informazioni proprietarie.

Come Proteggerti

  1. Leggi le informative sulla privacy e le impostazioni di utilizzo dei dati di qualsiasi strumento di IA utilizzato dal tuo sito web, come un chatbot o un generatore di contenuti, e disattiva la condivisione dei dati per l'addestramento del modello se l'opzione esiste.
  2. Evita di incollare dati aziendali sensibili, dettagli dei clienti o codice proprietario nelle interfacce pubbliche dei prompt IA.
  3. Ruota regolarmente le chiavi API per i servizi IA e revoca quelle che non utilizzi più per impedire accessi non autorizzati.
  4. Monitora la dashboard di utilizzo dei tuoi account IA collegati per rilevare picchi imprevisti di richieste, poiché possono indicare un abuso del tuo account.
  5. Mantieni aggiornati i plugin e i temi del tuo sito web in modo che gli aggressori non possano iniettare codice dannoso che intercetta le interazioni tra i tuoi visitatori e le funzionalità IA integrate.

I Termini Spiegati

  • distillation Una tecnica attraverso la quale la conoscenza di un modello di IA grande e complesso viene trasferita a un modello più piccolo o diverso, spesso addestrandolo sugli output del modello più grande.
  • adversarial distillation L'uso non autorizzato degli output di un modello per replicare o migliorare un altro modello, eludendo tipicamente i filtri di sicurezza e i termini di servizio.
  • encrypted reasoning Il processo di pensiero interno, passo dopo passo, che un modello di IA segue prima di fornire una risposta finale, spesso nascosto e protetto per salvaguardare il funzionamento interno del modello.
  • prompt injection Un attacco in cui qualcuno nasconde un'istruzione dannosa all'interno dell'input di un modello, cercando di farlo comportare in modo indesiderato o di rivelare dati nascosti.
  • chain-of-thought (CoT) Un metodo in cui l'IA articola passaggi di ragionamento intermedi per migliorare la sua risposta finale, rendendo il suo pensiero più trasparente.

Servizi AEU correlati