La visibilité, la gouvernance et la protection de l’IA commencent par une compréhension du paysage actuel des risques. Le graphique ci-dessous classe les risques les plus répandus selon la fréquence des violations observées au sein des organisations. En tête de cette liste figurent les violations de la politique de données en amont, qui représentaient autrefois près de 100 % des alertes mais sont tombées en dessous de 90 % à mesure que d’autres types de violations ont augmenté en volume. À l’autre extrémité du spectre se trouvent les violations de codes malveillants (où un système d’IA renvoie du code malveillant), qui sont les moins nombreuses mais aussi les plus graves.

Dans la liste suivante, nous explorons chacun de ces risques plus en détail, y compris la direction, l’intention et la gravité.
Violation de la politique de données en amont
Réalisation : En amont
Profil d’intention : Initié/productivité/négligence
Gravité : Cumulatif
Qu’est-ce qu’une violation de la politique de données en amont ?
Le risque le plus courant en matière d’IA est qu’un utilisateur ou un agent tente d’envoyer des données à un système d’IA en violation des politiques d’utilisation des données de l’organisation, y compris l’envoi d’informations confidentielles ou de code source à des services non approuvés. Les organisations utilisent généralement ces politiques pour orienter leurs utilisateurs loin de l’IA parallèle vers des services d’IA approuvés, et pour orienter les cas d’utilisation vers les services appropriés. Par exemple, certains services d’IA peuvent être autorisés uniquement pour des tâches de codage et de développement, tandis que d’autres sont autorisés uniquement à traiter des données sensibles dans des documents et des tableurs. Les violations des politiques de données proviennent principalement d’initiés de confiance qui cherchent à augmenter leur productivité mais le font de manière négligente (sans connaissance des politiques organisationnelles). La gravité du risque ici est cumulative car une exposition constante de données sensibles à des tiers peut entraîner une conformité ou une responsabilité réglementaire.
Violation de la politique de données en aval
Réalisation : En aval
Profil d’intention : Initié/productivité/négligence
Gravité : Faible ou modéré
Qu’est-ce qu’une violation de la politique de données en aval ?
Les violations des politiques de données en aval surviennent lorsqu’un service d’IA retourne des données que les politiques organisationnelles interdisent à l’utilisateur ou à l’agent d’accéder. De telles violations surviennent lorsqu’une organisation utilise le MCP, la génération augmentée par récupération (RAG) ou des modèles personnalisés entraînés sur des données propriétaires. Dans ces cas, une application d’IA peut retourner des données sensibles provenant d’un système connecté auxquelles l’utilisateur ou l’agent n’est pas autorisé à accéder. Un autre exemple moins courant de violation de la politique de données en aval survient lorsqu’une organisation autorise une application mais en restreint son utilisation à un cas d’usage spécifique. Par exemple, les utilisateurs et agents peuvent être autorisés à utiliser l’application comme chatbot général, mais pas à générer du code source. Tout code source retourné par l’application serait classé comme une violation en aval. Comme pour les violations en amont, le profil d’intention principal pour les violations en aval est celui d’un insider de confiance motivé par le gain de productivité, et la gravité du risque dépend du type de données et de l’étendue des accès.
Filtrage de contenu
Réalisation : Bidirectionnel
Profil d’intention : Insider/comportement
Gravité : Low
Qu’est-ce que le filtrage de contenu dans le contexte du risque de l’IA ?
Les violations du filtrage de contenu sont bidirectionnelles et surviennent lorsqu’un utilisateur ou un agent envoie une invite à, ou reçoit une réponse d’un système d’IA contenant du contenu jugé inapproprié selon les politiques de l’organisation. Ces types de violations sont similaires aux violations de filtrage d’URL provenant d’une passerelle web sécurisée (SWG) : de la même manière que les organisations bloquent le contenu sexuel ou violent sur le web, elles bloquent généralement aussi ces contenus pour qu’ils ne soient pas retournés par les applications d’IA. Les violations du filtrage de contenu sont faibles en gravité car elles représentent une menace minimale pour le réseau ou les actifs de données de l’organisation. Il s’agit principalement des questions RH, de conformité juridique ou d’alignement culturel.
Injection rapide et déverrouillage
Réalisation : Bidirectionnel
Profil d’intention : Adversaire/évitement
Gravité : Critical
Qu’est-ce que l’injection rapide ? Qu’est-ce que le jailbreak ?
Les violations d’injection prompt et de jailbreak surviennent lorsqu’un utilisateur ou un agent tente de contourner les garde-fous, de contourner les instructions système sous-jacentes ou de forcer un système IA à effectuer une action restreinte. De telles violations résultent d’actions délibérées, adversaires ou d’évasion de la part d’un initié ou d’un adversaire externe. Dans de nombreux cas, il s’agit d’attaques d’injection indirecte par prompt, dans lesquelles un adversaire intègre des instructions malveillantes dans des sources de données externes accessibles par un système d’IA. La gravité est cruciale car l’exploitation réussie subvertit le plan de contrôle du modèle, déclenchant potentiellement des chemins d’exécution en cascade à travers des services backend connectés.
Demandes de données sensibles
Réalisation : En amont
Profil d’intention : Adversaire/reconnaissance/récolte
Gravité : High
Que sont les demandes de données sensibles dans le contexte du risque d’IA ?
Les demandes de données sensibles sont des violations en amont qui surviennent lorsqu’un utilisateur ou un agent montre des signes de tentative délibérée de contourner les contrôles pour y accéder. La gravité d’une telle violation est généralement supérieure à celle d’une violation de politique de données en aval en raison d’un profil d’intention différent. Une violation de la politique de données en aval peut survenir sans invitation délibérée, simplement parce que le système a accès à des données auxquelles l’utilisateur n’est pas autorisé. En revanche, les demandes de données sensibles indiquent que le demandeur a l’intention d’accéder à ces données. Les demandes de données sensibles, combinées aux violations de données en aval, indiquent un risque critique, car elles suggèrent que le demandeur réussit dans ses efforts.
Piraterie et droits d’auteur
Réalisation : En aval
Profil d’intention : Conformité/accident
Gravité : Low
Quels sont les risques liés au droit d’auteur liés à l’IA ?
Une violation de piratage et de droits d’auteur est une violation en aval qui survient lorsqu’une application d’IA retourne du matériel protégé, protégé par le droit d’auteur ou déposé sans licence valide d’un tiers ni attribution d’autorisation. Un tel matériel présente un risque juridique et financier pour l’organisation s’il est utilisé de manière inappropriée. Cela reste néanmoins une menace minimale pour le réseau ou les actifs de données de l’organisation et est donc considéré comme à faible risque.
Code malveillant
Réalisation : En aval
Profil d’intention : Adversaire/militarisation
Gravité : Critical
Qu’est-ce que le code malveillant dans le contexte de l’IA ?
Une violation de code malveillant se produit lorsqu’une application IA renvoie un code malveillant en réponse. Le code malveillant peut être des commandes shell que l’utilisateur ou l’agent exécute directement, ou un extrait de code malveillant intégré à une base de code plus large. Les agents de codage autonomes, qui gagnent rapidement en popularité, amplifient ce risque car ils génèrent du code beaucoup plus rapidement que les humains et exécutent de manière autonome du code et des commandes générés par l’IA. Une application d’IA peut renvoyer du code malveillant à la suite d’une injection indirecte d’invites, d’outils ou de modèles d’IA trojanisés, voire de manière organique. Du code malveillant organique peut être retourné à la suite d’un entraînement sur des données vulnérables, Désalignement émergent, ou hallucination. La gravité est cruciale car l’exécution réussie d’un code malveillant pourrait entraîner une compromission généralisée du système. Les violations malveillantes du code associées aux violations de l’injection rapide et du jailbreak révèlent l’intention et indiquent un succès possible.