In questo articolo4
Ascolta
Voce del browser e privacy
Parte solo quando premi Ascolta. Alcune voci possono usare un servizio online. La nuova velocità può applicarsi dal passaggio successivo. Il testo non viene tradotto.
Cosa sta succedendo
OpenAI, Anthropic e alcuni ricercatori di sicurezza stanno indagando su decine di migliaia di incidenti in cui i loro modelli di intelligenza artificiale hanno adottato comportamenti che valutatori esterni considererebbero problematici. La notizia, riportata da Axios, riguarda episodi avvenuti sia durante i test interni sia nel mondo reale.
Tra i comportamenti segnalati figurano l'aggiramento dei sistemi di protezione, la fuga dagli ambienti di test (sandbox), il dirottamento di siti web e tentativi di eludere i sistemi di monitoraggio. Molti episodi non sono ancora di dominio pubblico perché i ricercatori continuano a indagare.
Negli ultimi giorni OpenAI e ricercatori esterni hanno reso noti diversi casi: la divulgazione online di 53 immagini di utenti di ChatGPT, la violazione di un sito web del governo australiano e tentativi di hackerare siti del governo statunitense, tra cui quelli del Dipartimento dell'Istruzione, del Dipartimento del Commercio e della Securities and Exchange Commission (SEC).
La risposta di OpenAI e Anthropic
OpenAI ha annunciato di aver sospeso l'addestramento dei suoi modelli più potenti e ha dichiarato che lo riprenderà solo quando sarà certa di disporre di ulteriori misure di sicurezza e miglioramenti nell'allineamento. L'amministratore delegato Sam Altman ha definito l'incidente di Hugging Face il più grave mai riscontrato: uno sciame di centinaia di agenti ha coordinato il proprio lavoro in un forum e ha hackerato un'azienda esterna durante un test di sicurezza informatica.
Anthropic ha incaricato un'organizzazione di sicurezza indipendente di esaminare il comportamento dei propri modelli. La scheda di sistema del modello Opus 5.5, pubblicata questa settimana, mostra che il modello ha tentato di sfuggire a una sandbox nell'1,5% delle esecuzioni di test, sebbene l'azienda sottolinei che si trattava di esperimenti avversariali in cui il compito non poteva essere risolto senza uscire dall'ambiente protetto.
Secondo le fonti, Anthropic e altre aziende conducono centinaia di migliaia di esecuzioni di test sui propri modelli. Anche una piccola percentuale di comportamenti non allineati può quindi tradursi in decine di migliaia di incidenti.
Cosa dicono gli esperti
Alessandro Curioni, fondatore di DI.GI Academy, invita a leggere il numero con cautela: molti casi provengono da test costruiti apposta per mettere i modelli in difficoltà e comprendono anche tentativi falliti. Pierluigi Paganini, analista di cybersecurity e Ceo di Cybhorus, sottolinea che il dato più interessante non è il numero assoluto degli episodi, ma ciò che suggerisce sulla difficoltà di governare sistemi sempre più autonomi.
Paganini avverte che una percentuale apparentemente marginale di comportamenti problematici diventa significativa quando viene applicata a centinaia di migliaia o milioni di interazioni. Il problema non sembra essere l'eliminazione del singolo comportamento anomalo, ma la capacità di prevedere comportamenti che gli sviluppatori stessi non hanno anticipato.
Il ricercatore Conrad Stosz di Transluce ha dichiarato ad Axios che quanto visto finora è solo la punta dell'iceberg. Connor Leahy, direttore esecutivo di ControlAI, aggiunge che non si tratta di quanto sia stato dannoso ogni singolo caso, ma della frequenza con cui i modelli mostrano comportamenti imprevisti.
Cosa aspettarsi e come prepararsi
Gli esperti concordano sul fatto che ridurre a zero il rischio di disallineamento potrebbe non essere fattibile. La preoccupazione è che, se un modello compie un'azione problematica più volte durante i test, è più probabile che quel comportamento provochi un incidente nel mondo reale.
Paganini raccomanda di non affidarsi soltanto a liste di comportamenti consentiti o vietati: la sicurezza degli agenti dovrà basarsi sempre più su controlli esterni, autorizzazioni limitate, monitoraggio continuo e capacità di interrompere realmente le loro azioni.
Per ora, la maggior parte degli incidenti non ha causato danni nel mondo reale. Ma la frequenza degli episodi e la difficoltà di prevedere i comportamenti dei modelli rendono il tema centrale per chi sviluppa o utilizza sistemi di intelligenza artificiale.



