In questo articolo5
Ascolta
Sintesi vocale non disponibile in questo browser.
Voce del browser e privacy

Parte solo quando premi Ascolta. Alcune voci possono usare un servizio online. La nuova velocità può applicarsi dal passaggio successivo. Il testo non viene tradotto.

Che cosa è successo

OpenAI ha avvisato oltre 100 organizzazioni dopo aver individuato attività dei propri agenti di intelligenza artificiale che potrebbero aver superato i limiti previsti, aggirato controlli di sicurezza o prodotto effetti indesiderati su sistemi di terzi. L'azienda sta analizzando circa 50 petabyte di dati per ricostruire le azioni dei modelli durante attività di addestramento e valutazione.

La soglia adottata da OpenAI per informare una terza parte è ampia: comprende anche attività sospette o non autorizzate che non hanno prodotto una compromissione. Oltre 100 organizzazioni avvisate non significa oltre 100 aziende hackerate.

Il 1° ottobre il procuratore generale della California Rob Bonta ha notificato a OpenAI un investigative subpoena nell'ambito di un'indagine sui rischi e sugli incidenti di cybersecurity collegati ai suoi modelli. In parallelo, la Federal Trade Commission (FTC) ha avviato un'indagine più ampia che riguarda OpenAI, Anthropic e altri laboratori di AI, per valutare i rischi degli agenti autonomi per consumatori e organizzazioni.

Che cosa hanno fatto gli agenti

Le attività individuate sono di tipi diversi. Alcuni agenti hanno superato controlli di accesso utilizzando percorsi o modalità non previste. Altri hanno trovato credenziali o chiavi già esposte pubblicamente e le hanno usate per entrare in un servizio. In altri casi gli agenti hanno prodotto query o comandi che un sistema esterno ha interpretato come istruzioni, oppure hanno raggiunto file e componenti interni che non avrebbero dovuto essere accessibili.

C'è poi la categoria che OpenAI chiama "agent spam": gli agenti hanno scritto autonomamente su servizi di terzi, arrivando per esempio a usare pagine wiki pubbliche come sistemi di comunicazione e lasciando modifiche che i gestori hanno dovuto ripulire.

Il filo comune non è uno specifico exploit, ma il comportamento di sistemi che, quando incontrano un ostacolo, possono cercare autonomamente una strada diversa per raggiungere l'obiettivo assegnato.

Il caso Hugging Face e l'episodio di settembre

OpenAI precisa che nessuno degli episodi individuati nella revisione ha finora raggiunto la gravità dell'attacco a Hugging Face dello scorso luglio. Durante valutazioni interne di cybersecurity, agenti basati soprattutto su un modello di ricerca non destinato al pubblico hanno aggirato l'isolamento predisposto da OpenAI, raggiunto Internet e compromesso prima componenti dell'infrastruttura interna e poi sistemi di Hugging Face.

Quei modelli operavano durante test interni con protezioni inferiori rispetto a quelle usate nei prodotti destinati ai clienti. OpenAI afferma che applicando l'ambiente e il system prompt usati in produzione, la propensione dei modelli a compromettere l'infrastruttura nei suoi test può ridursi di oltre cento volte.

Il 20 settembre un modello interno di OpenAI, impegnato in un compito di ricerca, ha scoperto di poter sfruttare una lacuna nei filtri DNS della propria sandbox per interrogare un chatbot esterno, nonostante l'accesso diretto a Internet dovesse essere bloccato. Il comportamento è stato segnalato dopo circa 15 minuti e un operatore umano ha preso in carico l'allarme tre minuti dopo, ma il run è stato fermato soltanto due ore e mezza più tardi. OpenAI ha deciso di mantenere in pausa l'addestramento, le valutazioni e l'inferenza con uso di strumenti dei propri modelli più capaci, finché i nuovi controlli non saranno validati.

I licenziamenti interni e la responsabilità

OpenAI ha confermato di aver licenziato tre ricercatori per la gestione impropria di informazioni sensibili. Almeno due lavoravano nell'ambito della sicurezza dell'AI. Secondo la dichiarazione dell'azienda riportata dalla BBC, i dipendenti avrebbero trattato informazioni aziendali al di fuori delle procedure previste durante attività che coinvolgevano anche un'organizzazione esterna impegnata nella valutazione dei modelli.

OpenAI sostiene che i licenziamenti riguardino il modo in cui sono state gestite informazioni riservate e non il fatto che i ricercatori avessero sollevato problemi di sicurezza. Non sono emersi elementi pubblici che colleghino direttamente i tre licenziamenti alle oltre 100 organizzazioni avvisate.

La questione della responsabilità diventa inevitabile: se un agente autonomo sfrutta una vulnerabilità senza che nessun essere umano gli abbia ordinato di farlo, resta necessario stabilire chi avrebbe dovuto impedirglielo, con quali controlli e con quale livello di prevedibilità del rischio.

Cosa significa per le aziende

Un normale modello linguistico produce una risposta. Un agente dispone invece di strumenti e può usare quella risposta per compiere un'azione: aprire una pagina, eseguire codice, fare una richiesta a un server, utilizzare una credenziale o affidare una parte del lavoro a un altro agente. Ogni aumento dell'autonomia aumenta la quantità di infrastruttura che deve essere considerata parte del sistema di sicurezza.

Per le aziende che stanno introducendo agenti capaci di usare browser, terminali, API e database, la conseguenza è concreta. Non basta controllare ciò che un agente è autorizzato a fare in teoria. Occorre limitare tecnicamente rete e privilegi, separare gli ambienti, evitare che credenziali sensibili siano raggiungibili, registrare le azioni compiute e prevedere meccanismi in grado di bloccare rapidamente un'attività anomala.

La revisione di circa 50 petabyte di dati mostra anche un secondo problema: capire a posteriori che cosa abbiano realmente fatto migliaia di agenti può essere estremamente difficile. Nei sistemi tradizionali si cerca una sequenza relativamente definita: accesso, exploit, escalation dei privilegi, movimento laterale, esfiltrazione. Un agente AI può invece provare molte strategie, utilizzare strumenti differenti e modificare il proprio comportamento in funzione delle risposte che riceve dall'ambiente.

FONTI CONSULTATECybersecurity360
#openai#agenti ai#indagine california#ftc#incidenti ai