La visibilità, la governance e la protezione dell'IA iniziano con la comprensione dell'attuale panorama del rischio. Il grafico qui sotto classifica i rischi più diffusi in base alla frequenza delle violazioni osservate all'interno delle organizzazioni. In cima a questa lista ci sono le violazioni della politica dei dati a monte, che un tempo rappresentavano quasi il 100% degli allerti ma sono scese sotto il 90% man mano che altri tipi di violazioni sono aumentati di volume. All'estremo opposto ci sono le violazioni del codice dannoso (dove un sistema IA restituisce codice malevole), che sono le meno numerose ma anche le più gravi.

Nel seguente elenco, esploriamo ciascuno di questi rischi in modo più dettagliato, inclusa direzione, intento e gravità.
Violazione della politica sui dati a monte
Regia: A monte
Profilo dell'intento: Insider/produttività/negligenza
Gravità: Cumulativo
Cos'è una violazione della politica dei dati a monte?
Il rischio più comune dell'IA è che un utente o un agente tenti di inviare dati a un sistema IA in violazione della Politica sull'uso dei dati dell'organizzazione, incluso l'invio di informazioni riservate o codice sorgente a servizi non approvati. Le organizzazioni tipicamente utilizzano questa Politica per indirizzare i loro utenti lontano dall'IA ombra e verso servizi di IA approvati, e per indirizzare i casi d'uso verso i servizi appropriati. Ad esempio, alcuni servizi di IA potrebbero essere autorizzati solo per compiti di codifica e sviluppo, mentre altri sono autorizzati esclusivamente a elaborare dati sensibili in documenti e fogli di calcolo. Le violazioni delle Politiche Dati provengono principalmente da insider di fiducia che cercano di aumentare la loro produttività ma lo fanno con negligenza (senza conoscenza delle Politiche organizzative). La gravità del rischio qui è cumulativa perché un flusso costante di esposizione di dati sensibili a terze parti può causare conformità o responsabilità normativa.
Violazione della politica sui dati a valle
Regia: A valle
Profilo dell'intento: Insider/produttività/negligenza
Gravità: Basso/moderato
Cos'è una violazione della politica sui dati a valle?
Le violazioni della Policy dei dati a valle si verificano quando un servizio IA restituisce dati che la Policy organizzativa vieta all'utente o all'agente di accedere. Tali violazioni si verificano quando un'organizzazione utilizza MCP, generazione aumentata al recupero (RAG) o modelli personalizzati addestrati su dati proprietari. In questi casi, un'app di IA potrebbe restituire dati sensibili da un sistema connesso a cui l'utente o l'agente non sono autorizzati ad accedere. Un altro esempio meno comune di violazione della politica dati a valle si verifica quando un'organizzazione autorizza un'app ma ne limita l'uso a un caso d'uso specifico. Ad esempio, utenti e agenti potrebbero essere autorizzati a usare l'app come chatbot generico, ma non a generare codice sorgente. Qualsiasi codice sorgente restituito dall'app sarebbe classificato come una violazione a valle. Come per le violazioni a monte, il profilo principale dell'intento per le violazioni a valle è un insider affidabile motivato dal guadagno di produttività, e la gravità del rischio dipende dal tipo di dati e dall'ampiezza dell'accesso.
Filtraggio dei contenuti
Regia: Bidirezionale
Profilo dell'intento: Insider/comportamento
Gravità: Basso
Cos'è il filtraggio dei contenuti nel contesto del rischio dell'IA?
Le violazioni del filtraggio dei contenuti sono bidirezionali e si verificano quando un utente o un agente invia un prompt o riceve una risposta da un sistema IA che contiene contenuti ritenuti inappropriati secondo la Politica dell'organizzazione. Questi tipi di violazioni sono simili alle violazioni del filtraggio degli URL da un gateway web sicuro (SWG): allo stesso modo in cui le organizzazioni bloccano contenuti sessuali o violenti sul web, di solito bloccano anche tali contenuti dal ritorno tramite app di IA. Le violazioni del filtraggio dei contenuti sono di bassa gravità perché rappresentano una minaccia minima per la rete o i dati dell'organizzazione. Invece, si tratta principalmente di risorse umane, conformità legale o questioni di allineamento culturale.
Iniezione tempestiva e evasione carceraria
Regia: Bidirezionale
Profilo dell'intento: Avversaria/evasione
Gravità: Critica
Cos'è l'iniezione pronta? Cos'è il jailbreak?
Le violazioni dell'iniezione prompta e del jailbreak si verificano quando un utente o un agente tenta di bypassare i guardrail, sovvertire le istruzioni di sistema sottostanti o comunque costringere un sistema IA a eseguire un'azione limitata. Tali violazioni derivano da azioni deliberate, avversarie o evasive da parte di un insider o di un avversario esterno. In molti casi, si tratta di attacchi di iniezione prompt indiretta, in cui un avversario incorpora istruzioni malevole in fonti di dati esterne accessibili da un sistema IA. La gravità è critica perché lo sfruttamento riuscito sovverte il piano di controllo del modello, potenzialmente attivando percorsi di esecuzione a cascata tra i servizi backend connessi.
Richieste di dati sensibili
Regia: A monte
Profilo dell'intento: Conflittuale/ricognizione/raccolta
Gravità: Alto
Cosa sono le richieste di dati sensibili nel contesto del rischio dell'IA?
Le richieste di dati sensibili sono violazioni a monte che avvengono quando un utente o un agente mostra segni di tentare deliberatamente di aggirare i controlli per accedervi. La gravità di una tale violazione è generalmente superiore a quella di una violazione della politica dati a valle a causa di un profilo di intenti diverso. Una violazione della politica dati a valle potrebbe verificarsi senza un richiesto deliberato semplicemente perché il sistema ha accesso a dati a cui l'utente non è autorizzato. Al contrario, le richieste di dati sensibili indicano che il richiedente intende accedere a tali dati. Le richieste di dati sensibili, combinate con violazioni dei dati a valle, indicano un rischio critico, poiché suggeriscono che il richiedente sta avendo successo nei propri sforzi.
Pirateria e copyright
Regia: A valle
Profilo dell'intento: Conformità/accidentale
Gravità: Basso
Quali sono i rischi di copyright associati all'IA?
Una violazione di pirateria e copyright è una violazione a valle che si verifica quando un'applicazione di IA restituisce materiale protetto, protetto da copyright o registrato senza una valida licenza di terze parti o senza l'attribuzione di permessi da parte di terzi. Tali materiali rappresentano un rischio legale e finanziario per l'organizzazione se utilizzati in modo inappropriato. Tuttavia, rappresenta una minaccia minima per la rete o i beni dati dell'organizzazione ed è quindi considerata a basso rischio.
Codice malevolo
Regia: A valle
Profilo dell'intento: Avversaria/armamento
Gravità: Critica
Che cos'è il codice malevolo nel contesto dell'IA?
Una violazione del codice malevolo si verifica quando un'applicazione IA restituisce codice malevolo nella sua risposta. Il codice malevolo potrebbe essere comandi shell che l'utente o l'agente può eseguire direttamente o qualche frammento di codice malevolo incorporato in una base di codice più ampia. Gli agenti di codifica autonomi, che stanno rapidamente guadagnando popolarità, amplificano questo rischio perché generano codice molto più velocemente degli umani ed eseguono autonomamente codice e comandi generati dall'IA. Un'app di IA potrebbe restituire codice malevolo a seguito di un'iniezione indiretta di prompt, di strumenti o modelli di IA trojanizzati, o addirittura in modo organico. Il codice organico malevolo potrebbe essere restituito come risultato dell'addestramento su dati vulnerabili, Disallineamento emergente, o allucinazioni. La gravità è critica perché l'esecuzione efficace di codice malevolo potrebbe portare a una compromessa diffusa del sistema. Le violazioni di codice dannose unite a violazioni di inserzione immediata e jailbreak rivelano l'intento e indicano un possibile successo.