Mitigando los ataques de inyección de indicaciones con una estrategia de defensa en capas
Con la rápida adopción de la IA generativa, una nueva ola de amenazas está surgiendo en toda la industria con el objetivo de manipular los propios sistemas de IA. Una de estas nuevas vías de ataque es la inyección indirecta de prompts. A diferencia de la inyección directa de prompts, donde un atacante introduce directamente comandos maliciosos en un prompt, la inyección indirecta de prompts implica instrucciones maliciosas ocultas dentro de fuentes de datos externas. Estas pueden incluir correos electrónicos, documentos o invitaciones a calendario que instruyen a la IA para que exfiltre datos del usuario o ejecute otras acciones maliciosas. A medida que más gobiernos, empresas y particulares adoptan la IA generativa para hacer más cosas, esta sutil pero potencialmente poderosa amenaza se vuelve cada vez más relevante en toda la industria, lo que exige una atención inmediata y medidas de seguridad sólidas. En Google, nuestros equipos tienen una larga trayectoria de inversión en una estrategia de defensa en profundidad, que incluye una evaluación robusta, el análisis de amenazas, las mejores prácticas de seguridad de la IA, el “red teaming” de la IA, el entrenamiento adversarial y el fortalecimiento de modelos para herramientas de IA generativa. Este enfoque permite una adopción más segura de Gemini en Google Workspace y la aplicación Gemini (a los que nos referimos como “Gemini” en este blog por simplicidad). A continuación, describimos nuestra estrategia de producto de mitigación de inyección de prompts, que se basa en una extensa investigación, desarrollo y despliegue de mejores mitigaciones de seguridad. Un enfoque de seguridad en capas Google ha adoptado un enfoque de seguridad en capas, que introduce medidas de seguridad diseñadas para cada etapa del ciclo de vida del prompt. Desde el fortalecimiento del modelo Gemini 2.5, hasta modelos de aprendizaje automático (ML) diseñados específicamente para detectar instrucciones maliciosas, hasta salvaguardas a nivel de sistema, estamos aumentando significativamente la dificultad, el costo y la complejidad que enfrenta un atacante. Este enfoque obliga a los adversarios a recurrir a métodos que son más fácilmente identificables o que requieren mayores recursos. Nuestro entrenamiento de modelos con datos adversarios ha mejorado significativamente nuestras defensas contra ataques de inyección indirecta de prompts en los modelos Gemini 2.5 (detalles técnicos). Esta resiliencia inherente del modelo se complementa con defensas adicionales que hemos incorporado directamente en Gemini, que incluyen: Clasificadores de contenido de inyección de prompts Fortalecimiento del pensamiento de seguridad Sanitización de Markdown y redacción de URLs sospechosas Marco de confirmación del usuario Notificaciones de mitigación de seguridad para el usuario. Este enfoque en capas de nuestra estrategia de seguridad fortalece el marco de seguridad general para Gemini, a lo largo del ciclo de vida del prompt y en una variedad de técnicas de ataque. 1. Clasificadores de contenido de inyección de prompts A través de la colaboración con investigadores de IA de primer nivel a través del Programa de Recompensas de Vulnerabilidades de IA (VRP) de Google, hemos curado uno de los catálogos más avanzados del mundo de vulnerabilidades de IA generativa y datos adversarios. Utilizando este recurso, hemos creado y estamos implementando modelos de aprendizaje automático (ML) propietarios que pueden detectar instrucciones maliciosas y en varios formatos, como correos electrónicos y archivos, extrayendo ejemplos del mundo real. Como resultado, cuando los usuarios consultan datos de Workspace con Gemini, los clasificadores de contenido filtran los datos dañinos que contienen instrucciones maliciosas, lo que garantiza una experiencia de usuario segura y completa al mantener solo el contenido seguro. Por ejemplo, si un usuario recibe un correo electrónico en Gmail que contiene instrucciones maliciosas, nuestros clasificadores de contenido pueden detectar y descartar las instrucciones maliciosas, luego generar una respuesta segura para el usuario. Esto es además de las defensas incorporadas en Gmail que bloquean automáticamente más del 99.9 % de los intentos de spam, phishing y malware. Un diagrama de las acciones de Gemini basado en la detección de instrucciones maliciosas por los clasificadores de contenido. 2. Fortalecimiento del pensamiento de seguridad Esta técnica añade instrucciones de seguridad dirigidas alrededor del contenido del prompt para recordar al modelo de lenguaje grande (LLM) que realice la tarea dirigida por el usuario e ignore cualquier instrucción adversa que pueda estar presente en el contenido. Con este enfoque, dirigimos al LLM para que se mantenga enfocado en la tarea e ignore las solicitudes dañinas o maliciosas añadidas por un actor de amenaza para llevar a cabo ataques de inyección indirecta de prompts. Un diagrama de las acciones de Gemini basado en la protección adicional proporcionada por la técnica de refuerzo del pensamiento de seguridad. 3. Sanitización de Markdown y redacción de URLs sospechosas Nuestro sanitizador de Markdown identifica URLs de imágenes externas y no las renderiza, lo que hace que la vulnerabilidad de renderización de imagen “EchoLeak” 0-click no sea aplicable a Gemini. Desde allí, una protección clave contra los ataques de inyección de prompts y exfiltración de datos ocurre a nivel de URL. Con datos externos que contienen URLs dinámicas, los usuarios pueden encontrarse con riesgos desconocidos ya que estas URLs pueden estar diseñadas para la inyección indirecta de prompts y ataques de exfiltración de datos. Las instrucciones maliciosas ejecutadas en nombre del usuario también pueden generar URLs dañinas. Con Gemini, nuestro sistema de defensa incluye la detección de URLs sospechosas basada en Google Safe Browsing para diferenciar entre enlaces seguros y no seguros, proporcionando una experiencia segura al evitar los ataques basados en URLs. Por ejemplo, si un documento contiene URLs maliciosas y un usuario está resumiendo el contenido con Gemini, las URLs sospechosas serán redactadas en la respuesta de Gemini. Gemini en Gmail proporciona un resumen de un hilo de correo electrónico. En el resumen, hay una URL insegura. Esa URL se redacta en la respuesta y se reemplaza por el texto “enlace sospechoso eliminado”. 4. Marco de confirmación del usuario Gemini también cuenta con un marco de confirmación contextual del usuario. Este marco permite a Gemini exigir confirmación del usuario para ciertas acciones, también conocidas como “Human-In-The-Loop” (HITL), utilizando estas respuestas para reforzar la seguridad y optimizar la experiencia del usuario. Por ejemplo, las operaciones potencialmente riesgosas como eliminar un evento en el calendario pueden provocar una solicitud explícita de confirmación del usuario, lo que ayuda a prevenir la ejecución no detectada o inmediata de la operación. La aplicación Gemini con instrucciones para eliminar todos los eventos el sábado. Gemini responde con los eventos encontrados en Google Calendar y solicita la confirmación del usuario. 5. Notificaciones de mitigación de seguridad para el usuario Una parte clave para mantener a nuestros usuarios seguros es compartir detalles sobre los ataques que hemos detenido para que los usuarios puedan estar atentos a ataques similares en el futuro. Para este fin, cuando las soluciones de seguridad mitigan los problemas incorporados, se proporciona a los usuarios información contextual para que puedan informarse a través de artículos de ayuda dedicados. Por ejemplo, si Gemini resume un archivo que contiene instrucciones maliciosas y una defensa de inyección de prompts de Google mitiga la situación, se muestra una notificación de seguridad para el usuario con un enlace “Aprender más”. Se anima a los usuarios a familiarizarse con nuestras defensas contra la inyección de prompts leyendo el artículo de ayuda. Gemini en Docs con instrucciones para proporcionar un resumen de un archivo. Se detectó contenido sospechoso y no se proporcionó una respuesta. Hay una notificación de seguridad amarilla para el usuario y se declara que la respuesta de Gemini ha sido eliminada, con un enlace “Aprender más”. Avanzando Nuestra estrategia de seguridad integral contra la inyección de prompts fortalece el marco de seguridad general para Gemini. Además de las técnicas descritas anteriormente, esto también incluye pruebas rigurosas a través de red teaming manual y automatizado, eventos de seguridad de IA generativa BugSWAT, estándares de seguridad sólidos como nuestro Secure AI Framework (SAIF) y asociaciones con investigadores externos a través del Programa de Recompensas de Vulnerabilidades de IA (VRP) de Google y con socios de la industria a través de la Coalición para la IA Segura (CoSAI). Nuestro compromiso con la confianza implica colaborar con la comunidad de seguridad para divulgar de forma responsable las vulnerabilidades de la IA, compartir nuestro conocimiento más reciente sobre las formas en que los actores maliciosos están intentando aprovechar la IA y ofrecer información sobre nuestro trabajo para construir defensas más sólidas contra la inyección de prompts. Es crucial colaborar con socios de la industria para construir protecciones más sólidas para todos nuestros usuarios. Para este fin, tenemos sólidas asociaciones colaborativas con numerosos investigadores, como Ben Nassi (Confidentialidad), Stav Cohen (Technion) y Or Yair (SafeBreach), así como otros investigadores de IA que participan en nuestros eventos BugSWAT y en nuestro programa VRP. Agradecemos el trabajo de estos investigadores y de otros en la comunidad para ayudarnos a red teaming y a refinar nuestras defensas. Continuamos trabajando para hacer que los próximos modelos de Gemini sean inherentemente más resistentes y para añadir defensas adicionales contra la inyección de prompts directamente en Gemini más adelante este año. Para obtener más información sobre los avances y la investigación de Google sobre actores, técnicas de ataque y vulnerabilidades de IA generativa, consulte los siguientes recursos: Más allá de la especulación: información basada en datos sobre IA y ciberseguridad (conferencia RSAC 2025) del Grupo de Inteligencia de Amenazas (GTIG) Uso malicioso de la IA generativa (publicación del blog) del Grupo de Inteligencia de Amenazas (GTIG) Enfoque de Google para agentes de IA seguros (documento técnico) del equipo de Secure AI Framework (SAIF) Avanzando la seguridad de Gemini (publicación del blog) del equipo de DeepMind de Google Lecciones aprendidas defendiendo Gemini contra la inyección indirecta de prompts (documento técnico) del equipo de DeepMind de Google
Artículos relacionados
Nueva campaña norcoreana utiliza entrevistas de programación falsas para robar credenciales de desarrolladores
Hackers afiliados a Corea del Norte escondieron malware en imágenes de banderas SVG para realizar pruebas de programación durante las entrevistas para puestos de trabajo. Ninguna empresa de software antivirus lo detectó.
Abbott investiga dos incidentes cibernéticos a raíz de las denuncias de extorsión
Abbott Laboratories está investigando dos incidentes de ciberseguridad separados después de confirmar el acceso no autorizado a sistemas internos Exact Sciences de su negocio de diagnóstico del cáncer, así como una reclamación separada de que los atacantes accedieron al portal de LabCentral y robaron datos de la empresa.
La vulnerabilidad HollowByte de ataque DDoS infla la memoria del servidor OpenSSL con un payload de 11 bytes
Una vulnerabilidad denominada HollowByte permite a atacantes no autenticados provocar una condición de denegación de servicio (DoS) en servidores OpenSSL con una carga maliciosa de solo 11 bytes.