La visibilidad, gobernanza y protección de la IA comienzan con la comprensión del panorama actual de riesgo. El gráfico siguiente clasifica los riesgos más prevalentes según la frecuencia de infracciones observadas dentro de la Organización. En la cima de esta lista están las violaciones de Datos Política en el upstream, que antes representaban casi el 100% de las alertas pero han caído por debajo del 90% a medida que otros tipos de infracciones han aumentado en volumen. En el otro extremo del espectro están las violaciones de código malicioso (cuando un sistema de IA devuelve código malicioso), que son las menos pero también las más graves.

En la siguiente lista, exploramos cada uno de estos riesgos con más detalle, incluyendo la dirección, la intención y la gravedad.
Infracción de Datos Política en el upstream
Dirección: Aguas arriba
Perfil de intención: Insider/productividad/negligencia
Gravedad: Acumulativo
¿Qué es una infracción de Datos Política a nivel upstream?
El riesgo más común de IA es que un usuario o agente intente enviar Datos a un sistema de IA en violación de los Datos Usar Política de la Organización, incluyendo el envío de información confidencial o código fuente a servicios no aprobados. Organización suele usar como política para desviar a sus usuarios de la IA en la sombra y dirigirlos hacia servicios de IA aprobados, y para orientar a Usar Caso hacia los servicios adecuados. Por ejemplo, algunos servicios de IA pueden estar autorizados solo para tareas de codificación y desarrollo, mientras que otros solo están autorizados para procesar datos sensibles en documentos y hojas de cálculo. Las violaciones de Datos Política provienen principalmente de personas de confianza que buscan aumentar su productividad pero lo hacen de forma negligente (sin conocimiento de la política organizativa). La gravedad del riesgo aquí es acumulativa porque una exposición constante de datos sensibles a terceros puede causar cumplimiento o responsabilidad regulatoria.
Infracción posterior de Datos Política
Dirección: Aguas abajo
Perfil de intención: Insider/productividad/negligencia
Gravedad: Bajo/moderado
¿Qué es una infracción posterior de Datos Política?
Las violaciones posteriores de Datos Política ocurren cuando un servicio de IA devuelve datos que la organización Política prohíbe al usuario o agente acceder. Estas violaciones ocurren cuando se realiza un MCP de Organización Usar, generación aumentada por recuperación (RAG) o modelos personalizados entrenados con datos propietarios. En estos casos, una aplicación de IA podría devolver algunos datos sensibles de un sistema conectado a los que el usuario o agente no está autorizado a acceder. Otro ejemplo menos común de una infracción posterior de Datos Política ocurre cuando una organización autoriza una aplicación pero restringe su Usar a un caso específico de Usar. Por ejemplo, los usuarios y agentes podrían tener permitido usar la aplicación como un chatbot de propósito general, pero no generar código fuente. Cualquier código fuente devuelto por la app se clasificaría como una infracción downstreaming. Como ocurre con las violaciones aguas arriba, el perfil principal de intención para las infracciones aguas abajo es un insider de confianza motivado por la ganancia de productividad, y la gravedad del riesgo depende del tipo de datos y la amplitud de acceso.
Filtrado de contenido
Dirección: Bidireccional
Perfil de intención: Insider/comportamiento
Gravedad: Bajo
¿Qué es el filtrado de contenidos en el contexto del riesgo de la IA?
Las violaciones del filtrado de contenido son bidireccionales y ocurren cuando un usuario o agente envía un prompt o recibe una respuesta de un sistema de IA que contiene contenido considerado inapropiado bajo la política organizacional. Este tipo de violaciones son similares a las violaciones de filtrado de URL desde una puerta web segura (SWG): de la misma manera que Organización bloquea contenido sexual o violento en la web, normalmente también bloquea que dicho contenido no sea devuelto por aplicaciones de IA. Las violaciones del filtrado de contenido son de baja gravedad porque suponen una amenaza mínima para la red de la Organización o los activos de Datos. En cambio, se centran principalmente en recursos humanos, cumplimiento legal o alineación cultural.
Inyección rápida y fuga de jails
Dirección: Bidireccional
Perfil de intención: Adversarial/evasión
Gravedad: Critical
¿Qué es la inyección inmediata? ¿Qué es el jailbreaking?
Las infracciones de inyección de prompt y jailbreak ocurren cuando un usuario o agente intenta saltarse barreras de seguridad, subvertir instrucciones subyacentes del sistema o forzar a un sistema de IA a realizar alguna acción restringida. Estas violaciones resultan de acciones deliberadas, adversariales o evasivas por parte de un interno o de un adversario externo. En muchos casos, estos son ataques indirectos de inyección prompt, en los que un adversario incrusta instrucciones maliciosas en fuentes externas de datos accedidas por un sistema de IA. La gravedad es crítica porque la explotación exitosa subvierte el plano de control del modelo, lo que puede desencadenar caminos de ejecución en cascada entre servicios backend conectados.
Solicitudes de datos sensibles
Dirección: Aguas arriba
Perfil de intención: Adversarial/reconocimiento/recolección
Gravedad: High
¿Qué son las solicitudes de datos sensibles en el contexto del riesgo de la IA?
Las solicitudes de datos sensibles son infracciones aguas arriba que ocurren cuando un usuario o agente muestra signos de intentar deliberadamente eludir los controles para acceder a ellos. La gravedad de dicha infracción suele ser mayor que la de una infracción posterior de Datos Política debido a un perfil de intención diferente. Una violación posterior de Datos Política podría ocurrir sin necesidad de que se le solicite deliberadamente, simplemente porque el sistema tiene acceso a Datos a los que el usuario no está autorizado a acceder. Por el contrario, las solicitudes de datos sensibles indican que el solicitante tiene la intención de acceder a dichos datos. Las solicitudes de datos sensibles, combinadas con violaciones posteriores de datos, indican un riesgo crítico, ya que sugieren que el solicitante está teniendo éxito en sus esfuerzos.
Piratería y derechos de autor
Dirección: Aguas abajo
Perfil de intención: Cumplimiento/accidental
Gravedad: Bajo
¿Cuáles son los riesgos de derechos de autor asociados a la IA?
Una violación de piratería y derechos de autor es una infracción posterior que ocurre cuando una aplicación de IA devuelve material protegido, protegido por derechos de autor o registrado como marca registrada sin licencia válida de terceros ni sin una atribución válida de permiso de terceros. Este tipo de material supone un riesgo legal y financiero para la Organización si utiliza el Usar de forma inapropiada. Aun así, representa una amenaza mínima para la red o los activos de Datos de la Organización y, por tanto, se considera de bajo riesgo.
Código malicioso
Dirección: Aguas abajo
Perfil de intención: Adversarial/armamento
Gravedad: Critical
¿Qué es el código malicioso en el contexto de la IA?
Una violación de código malicioso ocurre cuando una aplicación de IA devuelve código malicioso en su respuesta. El código malicioso puede ser algún comando de shell que el usuario o agente ejecute directamente o algún fragmento de código malicioso incorporado a una base de código más amplia. Los agentes de codificación autónoma, que están ganando popularidad rápidamente, amplifican este riesgo porque generan código mucho más rápido que los humanos y ejecutan código y comandos generados por IA de forma autónoma. Una aplicación de IA podría devolver código malicioso como resultado de una inyección indirecta de prompts, herramientas o modelos de IA trojanizados, o incluso de forma orgánica. El código malicioso orgánico podría ser devuelto como resultado del entrenamiento en datos vulnerables, Desalineación emergente, o alucinación. La gravedad es crítica porque la ejecución exitosa de código malicioso podría resultar en un compromiso generalizado del sistema. Las violaciones maliciosas de código junto con inyección inmediata y jailbreak revelan la intención e indican un posible éxito.