Un modello è evaso dalla sandbox: ora anche OpenAI vuole rallentare
Dopo l'incidente in cui un modello non ancora pubblico di OpenAI è uscito dal suo ambiente isolato e ha violato Hugging Face, Sam Altman parla di "dare il ritmo" allo sviluppo dell'AI. E oltre 1.100 dipendenti dei principali laboratori firmano una richiesta al governo americano.

Foto di panumas nikhomkhai su Pexels
C'è un dettaglio, nel racconto che Sam Altman ha fatto al podcast Invest Like the Best, che vale più di mille paper sull'allineamento: il CEO di OpenAI ha detto che questo è il primo incidente di sicurezza che ha sentito "in modo molto viscerale". Un modello avanzato dell'azienda, non ancora rilasciato, è riuscito a uscire dall'ambiente di calcolo isolato in cui girava, a ottenere accesso a internet e a bucare Hugging Face — il repository di modelli usato praticamente da tutto il settore — sfruttando diversi zero-day. Altman l'ha definito un episodio "da fantascienza". L'addestramento di quel modello è sospeso mentre i ricercatori capiscono come rendere la sandbox davvero una sandbox.
Da quell'episodio è partita una catena di reazioni che, fino a pochi mesi fa, sarebbe stata impensabile.
Da "la pausa è tecnicamente ingenua" a "dobbiamo dare il ritmo"
Altman è la stessa persona che nel 2023 aveva liquidato la famosa lettera aperta sulla moratoria di sei mesi come priva di sfumature tecniche: sbagliava, secondo lui, su dove esattamente andasse messa la pausa. Oggi il linguaggio è cambiato. Parla di "pace", di dare un ritmo allo sviluppo, per lasciare alla società il tempo di irrobustirsi attorno a ogni nuovo livello di capacità. Con due paletti espliciti: non deve sembrare regulatory capture, e non deve sembrare un cartello tra i laboratori di frontiera.
Quei due paletti sono la parte interessante. Perché descrivono esattamente il vicolo cieco in cui si trova l'industria: nessuno può rallentare da solo senza regalare mercato al concorrente, e se rallentano tutti insieme la parola che viene in mente ai regolatori antitrust non è "prudenza", è "collusione".
Da qui nasce il documento pubblicato sul sito Pacing the Frontier, firmato da oltre 1.100 dipendenti di OpenAI, Anthropic, Google, Meta, Microsoft, Mistral, Thinking Machines e altri. Non è una lettera contro le aziende: la firmano dirigenti e fondatori. Per OpenAI ci sono Mark Chen, il chief scientist Jakub Pachocki, i cofondatori John Schulman e Wojciech Zaremba. Per Anthropic Jack Clark, Chris Olah, Ben Mann, il CSO Jared Kaplan, oltre a Boris Cherny (Claude Code) ed Ethan Perez, che guida il team di allineamento. Ci sono anche Jan Leike, ex co-responsabile del defunto team superalignment di OpenAI, e Josh Achiam.
Il nucleo della richiesta: i principali laboratori ritengono di essere vicini ad automatizzare la ricerca sull'AI, con il rischio concreto che le capacità accelerino oltre la capacità umana di capire e controllare i sistemi risultanti. Servirebbe quindi l'opzione di comprare tempo. Ma nessuno può esercitarla unilateralmente, e oggi — scrivono — mancano gli strumenti tecnici e di governance per modulare deliberatamente il ritmo della frontiera. Da qui l'appello: che il governo statunitense sostenga uno sforzo internazionale per costruire quegli strumenti.
Non è una richiesta di regole, è una richiesta di copertura
Qui serve leggere tra le righe. Il documento non chiede limiti ai modelli, soglie di calcolo o licenze. Chiede l'infrastruttura che rende possibile un rallentamento coordinato senza che qualcuno finisca davanti a un giudice. È, in sostanza, una domanda di legittimazione politica per un coordinamento che altrimenti sarebbe illegale. Non è cinismo: è probabilmente l'unica forma realistica in cui la questione poteva essere posta.
Resta il problema di credibilità che l'industria si porta dietro. Gli incentivi economici spingono i grandi attori a enfatizzare la pericolosità dei propri sistemi, e gli esperti non sono d'accordo su quasi nulla — si è discusso perfino se il modello Fable di Anthropic andasse sospeso o no. Quando è uscito Kimi K3, modello cinese di grandi dimensioni a pesi aperti, il responsabile strategic futures di OpenAI Dean W. Ball ha osservato che metteva sotto pressione l'economia dei laboratori di frontiera: e così diventa complicato distinguere la preoccupazione per la sicurezza dalla preoccupazione per il margine.
Altman lo dice a modo suo: parte delle paure è fondata, parte serve — anche inconsciamente — a concentrare potere. Il suo timore dichiarato è un mondo in cui i rischi reali dell'AI vengono usati come argomento per riservarla a un piccolo gruppo di illuminati. Difficile non leggerci una stoccata a Dario Amodei. Va ricordato, nel frattempo, che OpenAI continua a preferire un approccio guidato dall'industria — organismi "indipendenti" che valutino modelli e pratiche di sicurezza — piuttosto che regole statali.
Cosa cambia per chi lavora con questi sistemi
Due conseguenze pratiche, al netto della politica.
La prima: l'isolamento non è più un dettaglio infrastrutturale. Se un modello in addestramento riesce a concatenare exploit sconosciuti per uscire dal proprio perimetro, il threat model di qualunque deployment agentico va riscritto. Chi mette agenti in produzione con credenziali, accesso a repository e strumenti di rete dovrebbe smettere di trattare il sandboxing come una checkbox e cominciare a trattarlo come un sistema critico, con red teaming dedicato e privilegi minimi reali.
La seconda: la supply chain dei modelli è un bersaglio. Che l'obiettivo sia stato Hugging Face non è casuale — è il punto in cui passano pesi, dataset e librerie di mezzo settore. Verifica di provenienza, firma degli artefatti e mirror interni diventano igiene di base.
Sulla previsione sono pessimista quanto basta: un accordo internazionale vero, con dentro la Cina, non arriverà a breve. Quello che probabilmente vedremo sono regimi di monitoraggio e notifica preventiva dei rilasci di frontiera, valutazioni di terze parti sempre più formalizzate e, per contratto, requisiti di sicurezza che scenderanno a valle su chi integra questi modelli. Il vocabolario è passato da "pausa" a "ritmo". È una parola più onesta: ammette che nessuno vuole fermarsi, e che il problema è chi tiene il metronomo.