Gli agenti di OpenAI non hanno cospirato, ma eseguivano pericolosamente gli ordini

OpenAI ha chiuso il 26 agosto l'indagine sull'incidente che a luglio ha portato i suoi agenti dentro l'infrastruttura di Hugging Face. Il documento sposta l'inizio della vicenda al 12 maggio, due mesi pieni prima del 9 luglio, la data da cui si era partiti. Lo stesso giorno l'organizzazione indipendente METR ha pubblicato una propria ricostruzione, condotta senza compenso, e converge con il report su un punto: gli agenti stavano eseguendo il compito che gli era stato assegnato.
Quando l'abbiamo raccontato a luglio il quadro era una fuga dalla sandbox e quattro servizi raggiunti. Adesso il perimetro è più largo e la dinamica è diversa: il problema riguarda il modo in cui i modelli erano stati messi al lavoro.
Dieci settimane in cui nessuno guardava
La cronologia pubblicata comincia con un messaggio lasciato dentro Artifactory, il gestore di pacchetti dell'ambiente di test, usato come bacheca improvvisata. Il 26 maggio gli agenti ottengono un accesso a internet che nessuno aveva previsto, il 26 giugno i privilegi di amministratore, il 4 luglio la loro attività manda il servizio fuori uso. Fra il 10 e il 13 luglio arrivano le credenziali esposte, due vulnerabilità mai documentate prima e quattro regioni dell'infrastruttura di Hugging Face.
L'allarme scatta il 19 luglio, e a farlo scattare è un avviso su chiamate API anomale: il controllo sul comportamento dei modelli, su quel carico di lavoro, era spento. Nel report l'azienda ammette che il sistema di sorveglianza del ragionamento oggi in produzione avrebbe allertato la sicurezza più di un giorno prima della violazione.
Milleduecento agenti e una bacheca dentro un gestore di pacchetti
I numeri sul coinvolgimento arrivano da METR: circa 1.200 agenti hanno trovato la bacheca, e 700 hanno partecipato all'attacco. Il report di OpenAI si ferma a "decine di server", senza un conteggio complessivo. Le credenziali Hugging Face recuperate il 10 luglio, esposte in chiaro e con permesso di scrittura, sono quattordici.
Degli 898 compiti della suite di test usata, 198 restavano irrisolti, e secondo i dati del report il 93% di quelli discussi sulla bacheca veniva da quel gruppo. Gli agenti si passavano gli exploit funzionanti per quei compiti, da un'esecuzione di valutazione all'altra.
Gli agenti si passavano gli exploit funzionanti per quei compiti, da un'esecuzione di valutazione all'altra.
Il compito era trovare exploit, e lo hanno eseguito fino in fondo
La suite si chiama ExploitGym e serve a misurare quanto un modello sia capace di violare un sistema. L'obiettivo assegnato era esattamente quello che poi è stato fatto, con la differenza che doveva restare dentro un recinto.
METR conclude che gli agenti si muovevano come parte di uno sciame, quello formatosi sulla bacheca dentro Artifactory. Soprattutto, credevano di essere valutati da qualcuno che avrebbe esaminato le loro trascrizioni in cerca di metodi legittimi: quel valutatore se l'erano immaginato.
Nel materiale pubblicato compare un modello che si accorge della deriva e la registra così: "il compito era una sfida di exploit, siamo finiti in uno sciame ausiliario". Un altro rifiuta di partecipare quando la bacheca mostra tentativi di esecuzione di codice sui server di Hugging Face, e la definisce eticamente inaccettabile. La deliberazione c'era, e in qualche caso ha funzionato.
La deliberazione c'era, e in qualche caso ha funzionato.
Futurism ha rilanciato le trascrizioni il 29 agosto, presentandole come il verbale di un complotto già dal titolo. Che quel taglio sia diventato un formato lo abbiamo già scritto. Qui conta altro: un sistema che esegue alla lettera un compito mal delimitato è più preoccupante di uno che cospira, perché il primo sta funzionando come previsto.
Nessuno ha provato a nascondere il proprio ragionamento
METR osserva che gli agenti manipolavano le trascrizioni delle azioni, mentre il proprio ragionamento lo hanno lasciato intatto, pur sapendo che un valutatore con accesso completo lo avrebbe letto. È il motivo per cui oggi quel ragionamento si può leggere.
È il motivo per cui oggi quel ragionamento si può leggere.
Su questo poggia l'intera strategia di sorveglianza dei laboratori: leggere quello che il modello pensa mentre agisce. Funziona finché al modello conviene mostrarlo, e la lezione dell'incidente è che portarli in produzione richiede contenimenti indipendenti da quella cortesia.
Valutare il modo, e insegnare ai modelli a restare nel compito
Nel report ufficiale OpenAI dice che amplierà i valutatori automatici perché misurino il modo in cui un compito viene portato a termine, oltre al risultato, e che costruirà ambienti di addestramento per insegnare ai modelli a restare dentro il compito originale. Il resto riguarda l'isolamento: sandbox separate per il codice che i modelli generano, e reti che tengano lontani da internet i carichi a rischio.
Il monitoraggio del ragionamento diventa obbligatorio su tutto l'addestramento con strumenti sopra una certa soglia di capacità, con l'obbligo di fermare l'attività entro trenta minuti se un allarme resta senza spiegazione. L'azienda ha inoltre sospeso il più grande addestramento previsto e definisce l'episodio un colpo d'avvertimento per sé e per il mondo. Chi aveva letto gli annunci di aprile su come blindare gli agenti e la modalità con meno funzioni ritrova qui la stessa direzione, applicata all'interno invece che al prodotto.
Chi ha pagato il conto dell'esperimento
Nel bilancio finale chi conduceva il test ha perso qualche settimana di addestramento e un pezzo di reputazione. A rimetterci davvero sono stati due terzi: Hugging Face, che si è trovata quattro regioni della propria infrastruttura raggiunte e dati privati toccati, e il cliente di Modal a cui è stata violata l'applicazione. Nessuno dei due aveva firmato per fare da bersaglio, ed è lo stesso schema già visto quando gli agenti hanno provato a infettare un progetto.
È chi firma il budget della sicurezza a decidere dove finisce il perimetro. Quella decisione ogni direzione IT la prende, spesso senza scriverla da nessuna parte, e regge finché il carico chiuso in quel recinto è davvero soltanto un test.
Chi tiene un ambiente di collaudo con credenziali vere dentro ha già preso quella decisione, e quasi sempre senza saperlo. Il rischio esce dalla stanza: lo raccolgono i fornitori a valle e i clienti che condividono la stessa infrastruttura, e quella scelta l'hanno subita.
Sorvegliare anche lì costa, rallenta e toglie il gusto di vedere fin dove arriva il modello. Ma il conto, quando arriva, lo firma qualcun altro.





Commenti