In questo articolo6
Ascolta
Sintesi vocale non disponibile in questo browser.
Voce del browser e privacy

Parte solo quando premi Ascolta. Alcune voci possono usare un servizio online. La nuova velocità può applicarsi dal passaggio successivo. Il testo non viene tradotto.

Il problema: non serve toccare il prompt

Un nuovo studio pubblicato su arXiv, intitolato "AgentLSD: Evaluating AI Security Agents Under Adversarial Task Contamination", introduce il concetto di adversarial task contamination. L'idea è che un agente AI incaricato di risolvere un problema di sicurezza esplora un ambiente, analizza dati, interroga strumenti e formula ipotesi. Se parte di quell'ambiente viene manipolata dall'attaccante, l'agente può essere spinto verso una falsa pista senza che sia necessario alterare direttamente le istruzioni che gli sono state impartite.

Non si tratta quindi della classica prompt injection, cioè l'inserimento di istruzioni malevole per convincere un modello a fare qualcosa che non dovrebbe. Qui l'attaccante sfrutta l'accesso ai sistemi della vittima per fornire informazioni false o fuorvianti, indebolendo deliberatamente gli strumenti di difesa e rendendo più difficile l'individuazione degli attacchi.

Come funziona l'attacco

I ricercatori hanno utilizzato 11 test di cyber security in stile "Capture The Flag", creando per ciascuno una versione normale e una contaminata. Il problema da risolvere e la soluzione corretta rimanevano gli stessi, cambiava soltanto l'ambiente nel quale l'agente si trovava a muoversi.

Le trappole comprendevano falsi messaggi di successo, endpoint esca, false procedure di validazione, informazioni apparentemente provenienti da fonti autorevoli e percorsi pensati per fare in modo che l'agente perdesse tempo in attività inutili.

  • Falsi messaggi di successo
  • Endpoint esca
  • False procedure di validazione
  • Informazioni da fonti apparentemente autorevoli
  • Percorsi che fanno perdere tempo
MAPPA DELL’ANALISI

Dalle evidenze alle implicazioni

  1. 01

    Il problema: non serve toccare il prompt — Un nuovo studio pubblicato su arXiv, intitolato "AgentLSD: Evaluating AI Security Agents Under Adversarial Task Contamination", introduce il concetto di adversarial…

  2. 02

    Come funziona l'attacco — Falsi messaggi di successo

  3. 03

    Le conseguenze: più lavoro, più costi — Le evidenze emerse indicano che la conseguenza non è necessariamente una risposta sbagliata. In molti casi la contaminazione dell'ambiente induce semplicemente l'agente…

  4. 04

    Perché proteggere il prompt non basta — Un agente AI di cyber security non prende decisioni soltanto sulla base delle istruzioni che riceve, ma costruisce progressivamente una rappresentazione dell'ambiente…

  5. 05

    Le contromisure possibili — Tracciamento della provenienza delle informazioni

Mappa di lettura costruita sulle sezioni dell’analisi.Cybersecurity360

Le conseguenze: più lavoro, più costi

Le evidenze emerse indicano che la conseguenza non è necessariamente una risposta sbagliata. In molti casi la contaminazione dell'ambiente induce semplicemente l'agente a lavorare molto di più. I ricercatori hanno osservato aumenti significativi nel numero di interazioni e nei token utilizzati per arrivare alla soluzione del problema.

In alcuni casi, le trappole riescono effettivamente a ridurre la capacità dell'agente di risolvere il problema. Le tecniche più efficaci sono quelle che dirottano l'esplorazione verso un obiettivo falso, oppure che attirano l'agente lungo percorsi apparentemente promettenti ma in realtà privi di valore.

L'attacco può trasformarsi in una sorta di Denial of Service cognitivo: l'agente continua a lavorare, ma viene costretto a sprecare tempo, capacità di calcolo e budget. Considerando che il consumo di token sta spingendo le aziende a porre dei "tetti" in ottica FinOps, la strategia dimostra una potenziale efficacia che va oltre la semplice tecnica di disturbo.

Perché proteggere il prompt non basta

Un agente AI di cyber security non prende decisioni soltanto sulla base delle istruzioni che riceve, ma costruisce progressivamente una rappresentazione dell'ambiente in cui si muove utilizzando log, pagine Web, risultati ottenuti attraverso gli strumenti di analisi, repository, ticket, indicatori di compromissione e altre fonti di informazione.

Se un attaccante riesce a contaminare una o più di queste fonti, può influenzare il processo decisionale dell'agente senza interagire direttamente con il suo prompt. Il problema si sposta dal modello alla catena delle informazioni utilizzate dal modello, con un impatto rilevante nell'implementazione di sistemi SOC automatizzati.

Estremizzando il concetto, un cyber criminale non dovrebbe necessariamente nascondere l'attacco, ma potrebbe più semplicemente spingere l'agente verso una falsa pista, facendogli analizzare un endpoint, un log o un indicatore apparentemente significativo. L'agente potrebbe accorgersi dell'errore solo dopo decine di interazioni e dopo aver già consumato una quantità significativa di risorse.

Le contromisure possibili

Secondo gli autori della ricerca, la mitigazione del rischio passa dall'implementazione di una serie di accorgimenti. Tra questi il tracciamento della provenienza delle informazioni, la distinzione tra dati verificati e dati non verificati, l'uso di conferme indipendenti per le decisioni più importanti e l'introduzione di meccanismi di bounded exploration e backtracking, che permettano all'agente di riconoscere rapidamente quando una pista investigativa non sta portando a risultati apprezzabili.

  • Tracciamento della provenienza delle informazioni
  • Distinzione tra dati verificati e non verificati
  • Conferme indipendenti per le decisioni più importanti
  • Meccanismi di bounded exploration e backtracking

I limiti dello studio

Gli stessi ricercatori sottolineano i limiti dello studio. L'esperimento ha riguardato un numero relativamente ridotto di test e, soprattutto, ha previsto l'utilizzo di un numero limitato di tipologie di vulnerabilità.

Il valore della ricerca rimane comunque intatto e ha il pregio di allargare gli orizzonti al nuovo scenario determinato dal contemporaneo avvento dell'intelligenza artificiale sul fronte offensivo e difensivo della cyber security. Gli addetti ai lavori stanno già lavorando su questi temi e la situazione è destinata a evolvere ulteriormente nel prossimo futuro.

FONTI CONSULTATECybersecurity360
#agenti ai#adversarial task contamination#cyber security#prompt injection#soc