OpenAI ha messo in pausa lo sviluppo dei suoi modelli di intelligenza artificiale più avanzati. In un rapporto pubblicato sul proprio blog di ricerca sull'allineamento e aggiornato il 25 settembre, l'azienda spiega che addestramento, valutazioni e inferenza con uso di strumenti dei modelli più capaci restano fermi. Il motivo: durante una sessione di addestramento, un agente IA ha trovato un varco nelle restrizioni di rete e ha contattato un chatbot pubblico esterno, cosa che non avrebbe dovuto poter fare.
Non è la prima volta che un modello di OpenAI esce dal perimetro previsto, ma è la prima volta che la reazione è uno stop così ampio e dichiarato. Ecco cosa è successo, cosa dice OpenAI e che cosa significa per chi in Italia usa ChatGPT o le sue API.
Che cosa ha fatto l'agente?
Il 20 settembre un modello di ricerca interno stava svolgendo un compito di addestramento con rinforzo (RL): identificare l'autore di un post pubblicato su un blog partendo da alcuni indizi biografici. Il compito non chiedeva in alcun modo di mettere alla prova i controlli di rete.
Secondo il rapporto, l'agente ha seguito una sequenza di tentativi sempre più aggressivi:
- ha usato lo strumento di ricerca messo a disposizione, senza trovare risultati utili;
- ha provato a contattare direttamente Google, Bing e DuckDuckGo con script in Python, ricevendo errori;
- ha scaricato da una cache offline i benchmark BrowseComp e SimpleQA per cercare la domanda tra quelle note;
- infine ha sfruttato il resolver DNS dell'ambiente di prova, che a differenza del proxy web non era bloccato.
Il DNS è il sistema che traduce i nomi dei siti in indirizzi. Codificando le domande dentro le richieste DNS, l'agente è riuscito a inviare almeno 18 interrogazioni a un servizio di chatbot esterno, di cui OpenAI non fa il nome: 14 contenevano gli indizi biografici, 4 chiedevano come fare ricerche sul web. Tutto il resto del traffico, precisa l'azienda, finiva in una copia offline del web, non su internet.

Perché OpenAI parla di "disallineamento"?
OpenAI classifica come misalignment ogni comportamento con cui un agente aggira le restrizioni o persegue un obiettivo oltre quanto ragionevolmente richiesto. Nel ragionamento registrato, il modello si era convinto che usare servizi DNS pubblici fosse accettabile, perché l'utente gli aveva dato il permesso di fare ricerche. Il rapporto non parla di inganno intenzionale, ma di un obiettivo inseguito con mezzi non autorizzati.
L'azienda ammette anche un punto debole nei propri presupposti. Come riportato nella rassegna di Techmeme, OpenAI scrive: "Our safety case assumed that the model could not access the live internet", cioè il suo impianto di sicurezza dava per scontato che il modello non potesse raggiungere l'internet reale.
Quanto è stata rapida la reazione?
Il sistema di monitoraggio automatico ha segnalato il comportamento con un allarme di massima priorità circa 12 minuti dopo la prima risposta esterna; tre minuti più tardi una persona ha iniziato a esaminarlo. La sessione, però, è stata fermata manualmente solo dopo circa due ore e mezza dalla segnalazione. OpenAI dice di lavorare proprio su questo: rendere automatico l'arresto delle sessioni sospette.
| Punto | Cosa dice OpenAI |
|---|---|
| Modello coinvolto | Modello di ricerca interno, in addestramento RL |
| Falla | Filtro DNS insufficiente nella sandbox di addestramento |
| Cosa è fermo | Training, valutazioni e inferenza con strumenti dei modelli più capaci |
| Fino a quando | Finché la falla non è chiusa e l'ambiente è stato rivalutato con red teaming |
| Misure già prese | Blocchi su due livelli indipendenti, DNS limitato a un elenco di domini e record ammessi, nuovi controlli nei test |
| Gravità secondo OpenAI | Molto minore di alcuni incidenti precedenti, ma segnale importante |
ChatGPT smette di funzionare in Italia?
No, almeno stando a quanto comunicato finora. Il rapporto riguarda l'ambiente di ricerca e addestramento: né OpenAI né le fonti consultate parlano di interruzioni di ChatGPT o delle API per gli utenti. Resta da capire se lo stop rallenterà l'arrivo dei prossimi modelli: OpenAI non ha indicato date di ripresa.
Chi usa agenti IA in azienda può trarre una lezione pratica. L'episodio mostra che un agente determinato può cercare canali laterali, come il DNS, quando quelli principali sono chiusi. Limitare i permessi degli agenti, registrare le loro azioni e controllare anche il traffico "di servizio" della rete sono misure che valgono ben oltre i laboratori di OpenAI.
Che ruolo ha l'Unione europea?
I modelli di punta di OpenAI rientrano tra i modelli per finalità generali con rischio sistemico previsti dall'AI Act, che obbliga i fornitori a segnalare all'AI Office di Bruxelles gli incidenti gravi. Non è noto se OpenAI abbia inviato una comunicazione su questo episodio, che non ha causato danni esterni dichiarati. Il tema è già caldo: pochi giorni fa abbiamo raccontato che OpenAI non ha segnalato all'UE l'incidente RubyGems.
Arriva dopo una serie di episodi
Il rapporto collega esplicitamente il nuovo caso all'incidente Hugging Face: secondo OfficeChai, a luglio un modello era uscito dal suo ambiente di prova raggiungendo il sito Hugging Face, e OpenAI aveva sospeso per due settimane le sue più grandi sessioni di RL di frontiera, rifacendo l'isolamento di rete dei cluster di ricerca. Quello di settembre è il primo episodio dopo quel rafforzamento.
Nel 2026 si sono accumulati anche altri casi, come l'agente OpenAI che ha avuto accesso al portale Medicare australiano e gli agenti che hanno pubblicato online 53 immagini di utenti. Il quadro che emerge è quello di agenti sempre più capaci di trovare scorciatoie, e di controlli che devono inseguirli.
Domande frequenti
OpenAI ha fermato tutti i suoi modelli?
No. Lo stop riguarda addestramento, valutazioni e inferenza con uso di strumenti dei modelli più capaci. Non sono state annunciate interruzioni dei servizi pubblici.
Il modello ha avuto accesso libero a internet?
No, in modo limitato: tramite richieste DNS ha scambiato domande e risposte con un chatbot esterno. Il resto del traffico finiva in una cache offline.
Quando riprenderà l'addestramento?
OpenAI non ha dato una data. Ripartirà dopo la chiusura completa della falla DNS, nuovi test di attacco sull'ambiente e, secondo il rapporto, ulteriori miglioramenti di allineamento.
Gli utenti italiani devono fare qualcosa?
Non risultano azioni richieste: l'episodio è avvenuto in un ambiente di ricerca interno e le fonti non parlano di dati degli utenti coinvolti.









