In questo articolo4
Ascolta
Voce del browser e privacy
Parte solo quando premi Ascolta. Alcune voci possono usare un servizio online. La nuova velocità può applicarsi dal passaggio successivo. Il testo non viene tradotto.
Cosa ha rilevato Google
Il team Google Threat Intelligence ha condotto un'analisi su larga scala del web pubblico per valutare l'uso reale delle iniezioni indirette di prompt (IPI). L'obiettivo era capire se gli attaccanti stiano davvero sfruttando questa tecnica, considerata una delle principali minacce per gli agenti AI.
Per lo studio è stato utilizzato Common Crawl, un archivio mensile di 2-3 miliardi di pagine web. Il campione esclude però i social media e i siti protetti da login, quindi i risultati non coprono l'intero panorama del web.
L'analisi ha seguito un processo a tre fasi: pattern matching per individuare firme note, classificazione con Gemini per distinguere contenuti benigni da sospetti e verifica manuale finale. Nonostante il filtro, la maggior parte delle rilevazioni iniziali era composta da falsi positivi, spesso materiale educativo o articoli di sicurezza.
- Categorie osservate: scherzi innocui, indicazioni utili, SEO, deterrenza per agenti AI, esfiltrazione dati e tentativi distruttivi.
- La maggior parte degli esempi malevoli sembra opera di singoli autori che conducono esperimenti o scherzi.
- Tra novembre 2025 e febbraio 2026, i tentativi classificati come malevoli sono aumentati del 32%.
Le categorie di iniezioni trovate
Le iniezioni indirette di prompt osservate si dividono in sei categorie principali. Le più comuni sono quelle innocue: scherzi che modificano il tono di un assistente AI o istruzioni benigne che chiedono di aggiungere contesto ai riassunti. Queste ultime, pur essendo utili, potrebbero facilmente diventare malevole se usate per diffondere disinformazione.
Un'altra categoria rilevante è quella legata alla SEO: alcuni siti inseriscono istruzioni nascoste per spingere gli assistenti AI a promuovere i propri servizi. Sono stati osservati anche esempi più sofisticati, apparentemente generati da suite SEO automatizzate.
Tra i tentativi di deterrenza, alcuni siti cercano di impedire il crawling degli agenti AI con istruzioni esplicite, mentre altri usano tecniche più subdole, come pagine che generano testo infinito per causare timeout o sprecare risorse.
- Esfiltrazione dati: pochi esempi, con tecniche poco sofisticate rispetto alla ricerca pubblicata nel 2025.
- Tentativi distruttivi: istruzioni che proverebbero a cancellare file, ma considerati improbabili da riuscire.
- Nessuna evidenza di attacchi avanzati su larga scala.
Dati chiave
- Tra novembre 2025 e febbraio 2026, i tentativi classificati come malevoli sono aumentati del 32%.32%
- Il trend in aumento del 32% in tre mesi suggerisce un interesse crescente, anche se i tentativi attuali sembrano più esperimenti che operazioni…32%
- L'aumento relativo del 32% è basato su un confronto tra snapshot di Common Crawl di periodi diversi.32%
Limiti dell'analisi e interpretazione
I risultati vanno interpretati con cautela. L'analisi si basa su Common Crawl, che non include i social media, dove le iniezioni indirette sono già state osservate. Inoltre, il metodo di rilevazione potrebbe non cogliere firme non comuni, quindi il quadro potrebbe essere parziale.
La scarsa sofisticazione degli attacchi osservati non significa che la minaccia sia trascurabile. Il trend in aumento del 32% in tre mesi suggerisce un interesse crescente, anche se i tentativi attuali sembrano più esperimenti che operazioni coordinate.
Google ipotizza che il costo degli attacchi stia diminuendo grazie all'automazione con agenti AI, mentre il valore dei sistemi AI come bersagli aumenta. Questo potrebbe portare a un incremento sia della scala che della complessità degli attacchi nel prossimo futuro.
- I dati non coprono i social media, dove potrebbero esserci attività più sofisticate.
- La classificazione con LLM e la verifica manuale riducono i falsi positivi ma non li eliminano del tutto.
- L'aumento relativo del 32% è basato su un confronto tra snapshot di Common Crawl di periodi diversi.
Implicazioni e raccomandazioni
Per chi sviluppa o utilizza agenti AI, il messaggio è duplice: da un lato, la minaccia delle iniezioni indirette è reale e in crescita; dall'altro, gli attacchi osservati oggi sono per lo più a basso impatto. Questo lascia tempo per prepararsi, ma non per ignorare il problema.
Le organizzazioni dovrebbero adottare difese a più livelli, come suggerito da Google: hardening dei modelli, red teaming continuo e monitoraggio delle minacce. Per gli utenti finali, la prudenza resta la prima linea di difesa: non fidarsi ciecamente delle risposte di un assistente AI quando elabora contenuti esterni.
La ricerca di Google mostra che la comunità di sicurezza sta monitorando attivamente il fenomeno, ma la responsabilità di proteggere i sistemi AI ricade anche su chi li integra nei propri processi.
- Valutare il rischio di IPI quando si integrano agenti AI che elaborano contenuti web o documenti.
- Implementare controlli sugli output degli agenti, soprattutto quando possono eseguire azioni.
- Monitorare le ricerche e le linee guida pubblicate da Google e da altri vendor.



