search

Amenazas de IA en el mundo real: El estado actual de las inyecciones de prompts en la web

person Por Kimberly Samra
source Fuente: Google Online Security Blog
calendar_today
schedule 9 min de lectura

Publicado por Thomas Brunner, Yu-Han Liu, Moni Pande En Google, nuestros equipos de inteligencia de amenazas se dedican a mantenerse por delante de la actividad adversarial del mundo real, monitoreando proactivamente las nuevas amenazas antes de que puedan afectar a los usuarios. Actualmente, la inyección indirecta de indicaciones (IPI) es una prioridad para la comunidad de seguridad, anticipando que es un vector de ataque principal para que los adversarios se dirijan y comprometan a los agentes de IA. Sin embargo, mientras que el peligro de la IPI se ha discutido ampliamente, ¿están realmente explotando los actores de amenazas este vector hoy en día – y si es así, cómo? Para responder a estas preguntas y descubrir el abuso en el mundo real, iniciamos una amplia revisión de la web pública para monitorear los patrones conocidos de inyección indirecta de indicaciones. Aquí está lo que encontramos. La amenaza de la inyección indirecta de indicaciones A diferencia de la inyección directa, donde un usuario “jailbreakea” un chatbot, la IPI ocurre cuando un sistema de IA procesa contenido, como un sitio web, un correo electrónico o un documento, que contiene instrucciones maliciosas. Cuando la IA lee este contenido envenenado, puede seguir silenciosamente los comandos del atacante en lugar de la intención original del usuario. Esto no es una nueva preocupación para nosotros y Google ha estado trabajando incansablemente para combatir estas amenazas. Nuestros esfuerzos involucran la colaboración interfuncional entre investigadores de Google DeepMind (GDM) y defensores como el Google Threat Intelligence Group (GTIG). Hemos detallado previamente nuestro trabajo en esta área, y los investigadores han destacado aún más la naturaleza evolutiva de estas vulnerabilidades. A pesar de este enfoque colectivo, sigue quedando una pregunta fundamental: ¿hasta qué grado están operando actualmente los actores maliciosos en el mundo real estos ataques? Monitoreo proactivo en Google El panorama de la IPI en la web Existen muchos canales a través de los cuales los atacantes pueden intentar enviar inyecciones de indicaciones. Sin embargo, una ubicación es particularmente fácil de observar: la web pública. Aquí, los actores de amenazas pueden simplemente sembrar inyecciones de indicaciones en sitios web con la esperanza de corromper los sistemas de IA que los acceden. La investigación pública confirma que estos ataques son posibles; por lo tanto, debemos esperar que los adversarios del mundo real exploten estas vulnerabilidades para causar daños. Por lo tanto, nos preguntamos una pregunta básica: ¿qué resultados están tratando de lograr los atacantes reales hoy? Para facilitar el acceso y la reproducibilidad, elegimos usar Common Crawl, que es un gran repositorio de sitios web extraídos de la web de habla inglesa. Common Crawl proporciona instantáneas mensuales de 2-3 mil millones de páginas. Estos son principalmente sitios web estáticos, que incluyen contenido auto-publicado como blogs, foros y comentarios en estos sitios, pero como una advertencia, no incluyen la mayoría del contenido de las redes sociales (por ejemplo, LinkedIn, Facebook, X, …) ya que Common Crawl omite los sitios web con muros de entrada y directivas anti-rastreo. Esto significa que, si bien se han observado inyecciones de indicaciones en las redes sociales, las reservamos para un estudio separado. Para un primer vistazo, podemos observar las inyecciones de indicaciones incluso en HTML estándar, para las cuales Common Crawl proporciona convenientemente no solo la fuente, sino también el texto plano analizado. El desafío de los falsos positivos La tarea de escanear grandes cantidades de documentos en busca de inyecciones de indicaciones puede parecer simple, pero en realidad está obstaculizada por un número abrumador de detecciones falsas. Los experimentos iniciales revelaron un gran volumen de texto de inyección de indicaciones benigno, lo que ilustra la complejidad de distinguir entre amenazas funcionales y contenido inofensivo. Se encontraron muchas inyecciones de indicaciones en artículos de investigación, publicaciones de blogs educativas o artículos de seguridad que discuten este tema. Falsos positivos: La mayoría de las inyecciones de indicaciones en el contenido web tienden a ser material educativo para investigadores. (Fuente: GitHub/swisskyrepo) Cuando se busca inyectar indicaciones de forma “naive”, la mayoría de las detecciones son contenido benigno: falsos positivos en nuestro caso. Por lo tanto, optamos por un enfoque de filtrado de grano a fino: Coincidencia de patrones: Inicialmente, identificamos páginas candidatas buscando una gama de firmas de inyección de indicaciones populares, como “ignorar las instrucciones”, “si eres una IA”, etc. Clasificación basada en LLM: Estas páginas candidatas fueron luego procesadas por Gemini para clasificar la intención del texto sospechoso e identificar si formaba parte del contexto general del documento o era sospechosamente fuera de lugar. Validación humana: Se realizó una ronda final de revisión manual de los resultados clasificados para garantizar un alto nivel de confianza en nuestros hallazgos. Si bien este enfoque no es exhaustivo y puede pasar por alto firmas poco comunes, puede servir como punto de partida para comprender la calidad de las inyecciones de indicaciones en el mundo real. Lo que encontramos Nuestra análisis reveló una variedad de intentos que, si tienen éxito, tratarían de manipular los sistemas de IA que acceden al sitio web. La mayoría de las inyecciones de indicaciones que observamos pertenecen a estas categorías: Efectos secundarios inofensivos Guía útil Búsqueda de motores de optimización (SEO) Deterir a los agentes de IA Datos maliciosos Exfiltración Destrucción Efectos secundarios inofensivos Esta clase de inyección de indicaciones tiene como objetivo causar principalmente efectos secundarios inofensivos en los asistentes de IA que leen el sitio web. Hemos encontrado muchos ejemplos de esto: Considere el código fuente de este sitio web, que contiene una inyección de indicaciones invisible que instruye a los agentes que acceden al sitio web para que cambien su tono conversacional. Guía útil También observamos a los autores de sitios web que querían ejercer control sobre los resúmenes de IA para brindar el mejor servicio a sus lectores. Consideramos esto un ejemplo benigno, ya que la inyección de indicaciones no intenta evitar la recopilación de resúmenes de IA, sino que en cambio instruye para que se agregue contexto relevante. Es importante señalar que este ejemplo podría fácilmente convertirse en malicioso si la instrucción intenta agregar información errónea o intentar redirigir al usuario a sitios web de terceros. Búsqueda de motores de optimización (SEO) Algunos sitios web incluyen inyecciones de indicaciones para el propósito de SEO, tratando de manipular a los asistentes de IA para que promuevan sus negocios sobre otros: Si bien el ejemplo anterior es simple, también hemos observado intentos más sofisticados de SEO inyecciones de indicaciones. Considere el complejo ejemplo anterior, que aparentemente fue generado por una suite de SEO automatizada e insertado en el texto del sitio web: Deterir a los agentes de IA Algunos sitios web intentan evitar que los agentes de IA recuperen el sitio a través de inyecciones de indicaciones. Existen muchos ejemplos de “Si eres una IA, entonces no rastreas este sitio web”. Sin embargo, también observamos implementaciones más insidiosas: Esta inyección intenta atraer a los lectores de IA a una página separada, la cual, cuando se abre, transmite un texto infinito que nunca termina de cargarse. De esta manera, el autor puede intentar desperdiciar recursos o causar errores de tiempo de espera durante el procesamiento del sitio web. Datos maliciosos Exfiltración Hemos podido observar un pequeño número de inyecciones de indicaciones que tienen como objetivo la exfiltración de datos. Sin embargo, para esta clase de ataques, la sofisticación parece ser mucho menor. Considere este ejemplo: Como podemos ver, este es un autor de sitios web que está realizando un experimento. No hemos observado cantidades significativas de ataques avanzados (por ejemplo, utilizando indicaciones de exfiltración de datos de 2025, que se publican por investigadores de seguridad). Esto parece indicar que los atacantes aún no han producido esto a escala. Malicioso: Destrucción Finalmente, hemos observado varios sitios web que intentan vandalizar a cualquiera que utilice asistentes de IA. Si se ejecutan, los comandos en este ejemplo intentan eliminar todos los archivos en la máquina del usuario: Si bien esto podría ser devastador, lo consideramos poco probable, lo que lo hace similar a las otras categorías. Hemos encontrado principalmente autores de sitios web individuales que parecen estar realizando experimentos o bromas, sin replicar estrategias avanzadas de IPI que se han encontrado en la investigación publicada recientemente. ¿Qué significa esto? Nuestros resultados indican que los atacantes están experimentando con la IPI en la web. Si bien la actividad observada sugiere una sofisticación limitada, esto podría ser solo una parte de la imagen completa. En primer lugar, solo hemos escaneado una colección de la web pública (Common Crawl), que no captura sitios de redes sociales importantes. Además, incluso si la sofisticación es baja, hemos observado un aumento en las detecciones con el tiempo: Hemos observado un aumento relativo del 32% en la categoría maliciosa entre noviembre de 2025 y febrero de 2026, repitiendo el escaneo en múltiples versiones del archivo. Esta tendencia ascendente indica un creciente interés en los ataques de IPI. En general, los actores de amenazas tienden a basarse en consideraciones de costo/beneficio. En el pasado, los ataques de IPI se consideraban exóticos y difíciles. Y aunque se comprometían, los sistemas de IA a menudo no eran capaces de ejecutar acciones maliciosas de forma fiable. Creemos que esto está a punto de cambiar. Los sistemas de IA actuales son mucho más capaces, lo que aumenta su valor como objetivos, mientras que los actores de amenazas han comenzado a automatizar sus operaciones con agentes de IA, reduciendo así el costo del ataque. Como resultado, esperamos que la escala y la sofisticación de los intentos de IPI aumenten en el futuro cercano. Nos estamos preparando para esta amenaza emergente, ya que continuamos invirtiendo en fortalecer nuestros modelos y productos de IA. Nuestros equipos de redacción han estado presionando constantemente nuestros sistemas para garantizar que Gemini sea resistente a la manipulación adversarial, y nuestro programa de recompensas por vulnerabilidades externas permite a los investigadores participar. Por último, la capacidad de Google para procesar datos a escala global en tiempo real nos permite identificar y neutralizar las amenazas antes de que puedan afectar a los usuarios. Nos comprometemos a mantener Internet seguro y seguiremos compartiendo información con la comunidad. Para obtener más información sobre el progreso y la investigación de Google sobre actores de amenazas, técnicas de ataque y vulnerabilidades de IA, consulta los siguientes recursos: Google Workspace: Enfoque continuo para mitigar las inyecciones de indicaciones Indirectas (publicación de blog) del equipo de GenAI de Google Mitigando los ataques de inyección de indicaciones con una estrategia de defensa en capas (publicación de blog) de Google sobre GenAI Mitigando los ataques de inyección de indicaciones con una estrategia de defensa en capas (publicación de blog) de Google sobre GenAI Más allá de la especulación: información basada en datos sobre IA y ciberseguridad (clave de la conferencia RSAC 2025) del grupo de inteligencia de amenazas de Google (GTIG) Rastreador de amenazas de IA (informe) del grupo de inteligencia de amenazas de Google (GTIG) El enfoque de Google para agentes de IA seguros (documento) del equipo de marco de IA seguro (SAIF) de Google Avanzando la seguridad de Gemini (publicación de blog) del equipo de DeepMind de Google Lecciones aprendidas de defender Gemini contra las inyecciones indirectas de indicaciones (documento) del equipo de DeepMind de Google

Artículos relacionados

cybersecurity

Nueva campaña norcoreana utiliza entrevistas de programación falsas para robar credenciales de desarrolladores

Hackers afiliados a Corea del Norte escondieron malware en imágenes de banderas SVG para realizar pruebas de programación durante las entrevistas para puestos de trabajo. Ninguna empresa de software antivirus lo detectó.

cybersecurity

Abbott investiga dos incidentes cibernéticos a raíz de las denuncias de extorsión

Abbott Laboratories está investigando dos incidentes de ciberseguridad separados después de confirmar el acceso no autorizado a sistemas internos Exact Sciences de su negocio de diagnóstico del cáncer, así como una reclamación separada de que los atacantes accedieron al portal de LabCentral y robaron datos de la empresa.

cybersecurity

La vulnerabilidad HollowByte de ataque DDoS infla la memoria del servidor OpenSSL con un payload de 11 bytes

Una vulnerabilidad denominada HollowByte permite a atacantes no autenticados provocar una condición de denegación de servicio (DoS) en servidores OpenSSL con una carga maliciosa de solo 11 bytes.