A visibilidade, a governança e a proteção da IA começam com a compreensão do cenário de riscos atual. O gráfico abaixo classifica os riscos mais prevalentes de acordo com a frequência de violações observadas nas organizações. No topo dessa lista estão as violações das políticas de dados upstream, que antes representavam quase 100% dos alertas, mas caíram para menos de 90% à medida que outros tipos de violações aumentaram em volume. No outro extremo do espectro estão as violações de código malicioso (em que um sistema de IA retorna código malicioso), que são as menos frequentes, mas também as mais graves.

Na lista a seguir, exploramos cada um desses riscos com mais detalhes, incluindo a direção, a intenção e a gravidade.
Violação da política de dados upstream
Direção: A montante
Perfil de intenção: Informações internas/produtividade/negligência
Gravidade: Cumulativo
O que é uma violação da política de dados upstream?
O risco mais comum em IA é um usuário ou agente tentar enviar dados para um sistema de IA violando as políticas de uso de dados da organização, incluindo o envio de informações confidenciais ou código-fonte para serviços não aprovados. Normalmente, as organizações utilizam essas políticas para direcionar seus usuários para longe da IA paralela e em direção a serviços de IA aprovados, bem como para direcionar os casos de uso para os serviços apropriados. Por exemplo, alguns serviços de IA podem ser autorizados apenas para tarefas de codificação e desenvolvimento, enquanto outros são autorizados exclusivamente para processar dados confidenciais em documentos e planilhas. As violações das políticas de dados têm origem principalmente em funcionários de confiança que buscam aumentar sua produtividade, mas o fazem de forma negligente (sem conhecimento das políticas da organização). A gravidade do risco, neste caso, é cumulativa, pois a exposição constante de dados sensíveis a terceiros pode acarretar responsabilidades relacionadas ao cumprimento de normas ou à regulamentação.
Violação da política de dados downstream
Direção: A jusante
Perfil de intenção: Informações internas/produtividade/negligência
Gravidade: Baixo/moderado
O que é uma violação da política de dados downstream?
Violações de políticas de dados subsequentes ocorrem quando um serviço de IA retorna dados cujo acesso é proibido pelas políticas organizacionais ao usuário ou agente. Essas violações ocorrem quando uma organização usa MCP (Model-Copy-Point), geração aumentada por recuperação (RAG) ou modelos personalizados treinados em dados proprietários. Nesses casos, um aplicativo de IA pode retornar dados confidenciais de um sistema conectado ao qual o usuário ou agente não tem autorização de acesso. Outro exemplo menos comum de violação da política de dados subsequente ocorre quando uma organização autoriza um aplicativo, mas restringe seu uso a um caso de uso específico. Por exemplo, usuários e agentes podem ter permissão para usar o aplicativo como um chatbot de uso geral, mas não para gerar código-fonte. Qualquer código-fonte retornado pelo aplicativo seria classificado como uma violação subsequente. Assim como nas violações a montante, o perfil de intenção principal para violações a jusante é o de um funcionário de confiança motivado pelo ganho de produtividade, e a gravidade do risco depende do tipo de dados e da abrangência do acesso.
Filtragem de conteúdo
Direção: Bidirecional
Perfil de intenção: Comportamento interno
Gravidade: Low
O que é filtragem de conteúdo no contexto do risco da IA?
As violações de filtragem de conteúdo são bidirecionais e ocorrem quando um usuário ou agente envia uma solicitação ou recebe uma resposta de um sistema de IA que contém conteúdo considerado inadequado pelas políticas da organização. Esses tipos de violações são semelhantes às violações de filtragem de URL de um gateway web seguro (SWG): da mesma forma que as organizações bloqueiam conteúdo sexual ou violento na web, elas normalmente também bloqueiam esse tipo de conteúdo para que não seja retornado por aplicativos de IA. As violações de filtragem de conteúdo são consideradas de baixa gravidade, pois representam uma ameaça mínima à rede ou aos ativos de dados da organização. Em vez disso, são principalmente questões de RH, conformidade legal ou alinhamento cultural.
Injeção imediata e desbloqueio (jailbreak)
Direção: Bidirecional
Perfil de intenção: Adversarial/evasão
Gravidade: Critical
O que é injeção imediata? O que é jailbreak?
As violações de injeção imediata e de desbloqueio ocorrem quando um usuário ou agente tenta contornar as salvaguardas, subverter as instruções subjacentes do sistema ou, de alguma forma, forçar um sistema de IA a executar alguma ação restrita. Essas violações resultam de ações deliberadas de adversários ou evasivas por parte de um agente interno ou de um adversário externo. Em muitos casos, tratam-se de ataques indiretos de injeção de instruções, nos quais um adversário incorpora instruções maliciosas em fontes de dados externas acessadas por um sistema de IA. A gravidade é crítica porque a exploração bem-sucedida subverte o plano de controle do modelo, podendo desencadear caminhos de execução em cascata em serviços de backend conectados.
Solicitações de dados sensíveis
Direção: A montante
Perfil de intenção: Adversarial/reconhecimento/colheita
Gravidade: High
O que são pedidos de dados sensíveis no contexto do risco da IA?
Solicitações de dados sensíveis são violações a montante que ocorrem quando um usuário ou agente demonstra sinais de tentativa deliberada de burlar os controles para acessar esses dados. A gravidade de tal violação é geralmente maior do que a de uma violação de política de dados subsequente devido a um perfil de intenção diferente. Uma violação da política de dados subsequente pode ocorrer sem qualquer intenção deliberada, simplesmente porque o sistema tem acesso a dados aos quais o usuário não está autorizado. Em contrapartida, os pedidos de dados sensíveis indicam que o solicitante pretende ter acesso a esses dados. Solicitações de dados sensíveis, combinadas com violações subsequentes desses dados, indicam um risco crítico, pois sugerem que o solicitante está obtendo sucesso em seus esforços.
Pirataria e direitos autorais
Direção: A jusante
Perfil de intenção: Conformidade/acidental
Gravidade: Low
Quais são os riscos de direitos autorais associados à IA?
A pirataria e a violação de direitos autorais são infrações subsequentes que ocorrem quando um aplicativo de IA retorna material protegido, com direitos autorais ou marcas registradas, sem uma licença válida de terceiros ou atribuição de permissão. Esse material representa um risco legal e financeiro para a organização se usado de forma inadequada. Ainda assim, representa uma ameaça mínima para a rede ou os ativos de dados da organização e, portanto, é considerado de baixo risco.
Código malicioso
Direção: A jusante
Perfil de intenção: Adversarial/armamento
Gravidade: Critical
O que é código malicioso no contexto da IA?
Uma violação de código malicioso ocorre quando um aplicativo de IA retorna código malicioso em sua resposta. O código malicioso pode consistir em comandos de shell que o usuário ou agente pode executar diretamente, ou em trechos de código malicioso incorporados a uma base de código maior. Os agentes de codificação autônomos, que estão ganhando popularidade rapidamente, amplificam esse risco porque geram código muito mais rápido do que os humanos e executam autonomamente o código e os comandos gerados por IA. Um aplicativo de IA pode retornar código malicioso como resultado de uma injeção indireta de prompt, ferramentas ou modelos de IA infectados por cavalos de Troia, ou até mesmo de forma orgânica. Códigos maliciosos orgânicos podem ser retornados como resultado do treinamento em dados vulneráveis. desalinhamento emergenteou alucinação. A gravidade é crítica porque a execução bem-sucedida de código malicioso pode resultar em comprometimento generalizado do sistema. Violações maliciosas de código, juntamente com injeções imediatas e violações de jailbreak, revelam intenções e indicam possível sucesso.