Diseñando la seguridad para capacidades basadas en agentes en Chrome
Publicado por Nathan Parker, equipo de seguridad de Chrome. Chrome ha estado mejorando la seguridad de la web durante más de 15 años, y estamos comprometidos a satisfacer nuevos desafíos y oportunidades con la IA. Miles de millones de personas confían en Chrome para que estén seguros de forma predeterminada, y tomamos esta responsabilidad en serio. Después del reciente lanzamiento de Gemini en Chrome y la vista previa de las capacidades de agente, queremos compartir nuestro enfoque y algunas nuevas innovaciones para mejorar la seguridad de la navegación basada en agentes. La nueva amenaza principal para todos los navegadores basados en agentes es la inyección indirecta de indicaciones. Esto puede aparecer en sitios maliciosos, contenido de terceros en iframes, o de contenido generado por el usuario, como las reseñas de usuarios, y puede hacer que el agente tome acciones no deseadas, como iniciar transacciones financieras o exfiltrar datos confidenciales. Dado este desafío, estamos invirtiendo en una defensa en capas que incluye tanto defensas deterministas como probabilísticas para dificultar y encarecer que los atacantes causen daños. El diseño de una navegación basada en agentes segura para Chrome ha implicado una profunda colaboración de expertos en seguridad en Google. Hemos construido sobre las protecciones y los principios de seguridad de Gemini y hemos implementado varias nuevas capas para Chrome. Estamos introduciendo un crítico de alineación del usuario, donde las acciones del agente son revisadas por un modelo separado que está aislado del contenido no confiable. También estamos extendiendo las capacidades de aislamiento de origen de Chrome para restringir con qué orígenes puede interactuar el agente, solo a aquellos que son relevantes para la tarea. Nuestra defensa en capas también incluye confirmaciones del usuario para pasos críticos, detección en tiempo real de amenazas y pruebas de red. Abordaremos estas capas a continuación. Revisar las salidas del agente con el crítico de alineación del usuario. El modelo principal para Gemini utiliza el contenido de la página que se comparte en Chrome para decidir qué acción tomar a continuación. La exposición al contenido web no confiable significa que es inherentemente vulnerable a la inyección indirecta de indicaciones. Utilizamos técnicas como el “spotlighting” que dirige al modelo para que dé una fuerte preferencia a seguir las instrucciones del usuario y del sistema, en lugar de lo que hay en la página, y hemos “upstreamed” ataques conocidos para entrenar al modelo de Gemini para que no caiga en ellos. Para fortalecer aún más la alineación del modelo más allá del “spotlighting”, estamos introduciendo el “crítico de alineación del usuario” — un modelo separado construido con Gemini que actúa como un componente de sistema de alta confianza. Esta arquitectura está parcialmente inspirada en el patrón de doble LLM, así como en la investigación CaMeL de Google DeepMind. Un diagrama de flujo que representa al “crítico de alineación del usuario”: un componente de confianza que revisa cada acción antes de que llegue al navegador. El “crítico de alineación del usuario” se ejecuta después de que la planificación esté completa para verificar cada acción propuesta. Su enfoque principal es la alineación de la tarea: determinar si la acción propuesta sirve al objetivo declarado del usuario. Si la acción está desalineada, el “crítico” la vetará. Este componente está diseñado para ver solo los metadatos sobre la acción propuesta, y no cualquier contenido web no confiable, para garantizar que no pueda ser envenenado directamente desde la web. Tiene menos contexto, pero también tiene un trabajo más simple: aprobar o rechazar una acción. Esto es una capa de defensa adicional poderosa contra el secuestro de objetivos y la exfiltración de datos dentro del paso de la acción. Cuando una acción es rechazada, el “crítico” proporciona comentarios al modelo de planificación para reformular su plan, y el planificador puede devolver el control al usuario si hay fallas repetidas. Aplicar límites de seguridad más estrictos con conjuntos de orígenes. El aislamiento de origen y la política del mismo origen son los límites fundamentales en el modelo de seguridad de Chrome, y estamos llevando estos conceptos al mundo de los agentes. Por naturaleza, los agentes deben operar en sitios web (por ejemplo, recopilar ingredientes en un sitio y rellenar un carrito de compras en otro). Pero si un agente no restringido se ve comprometido y puede interactuar con sitios arbitrarios, puede crear un “bypass” de aislamiento de sitio. Esto puede tener un impacto severo cuando el agente opera en un navegador como Chrome, con sitios conectados vulnerables a la exfiltración de datos. Para abordar esto, estamos extendiendo estos principios con “conjuntos de orígenes de agentes”. Nuestro diseño limita arquitectónicamente al agente para que solo acceda a datos de orígenes relacionados con la tarea, o a datos que el usuario ha elegido compartir con el agente. Esto previene que un agente comprometido actúe arbitrariamente en orígenes no relacionados. Para cada tarea en la web, una función de gating de confianza decide qué orígenes propuestos por el planificador son relevantes para la tarea. El diseño es separar esto en dos conjuntos, rastreados para cada sesión: orígenes de solo lectura son aquellos de los que puede consumir contenido Gemini. Si el origen de un iframe no está en la lista, el modelo no verá ese contenido. Los orígenes de escritura son aquellos en los que el agente puede actuar (por ejemplo, hacer clic, escribir) además de leer. Esto impone que solo se dispone de datos de un conjunto limitado de orígenes para el agente, y que estos datos solo pueden pasar a los orígenes de escritura. Esto limita el vector de amenazas de fugas de datos entre orígenes. Esto también da al navegador la capacidad de hacer cumplir algunas de estas separaciones, como no enviar siquiera datos a un modelo que esté fuera del conjunto de lectura. Esto reduce la exposición del modelo a datos innecesarios entre sitios. Como el “crítico de alineación”, las funciones de gating que calculan estos conjuntos de orígenes no están expuestas al contenido web. El planificador también puede utilizar contexto de páginas que el usuario ha compartido explícitamente en esa sesión, pero no puede agregar nuevos orígenes sin la aprobación de la función de gating. Fuera de los orígenes web, el modelo de planificación puede ingerir otros contenidos no web, como llamadas a herramientas, así que también definimos los llamados de solo lectura vs. escritura y también verificamos que estas llamadas sean apropiadas para la tarea. Si los orígenes de iframe que no están relacionados con la tarea del usuario no se muestran al modelo, la navegación de página puede ocurrir de varias maneras: Si el planificador decide navegar a un nuevo origen que aún no está en el conjunto de lectura, ese origen se verifica por una variante del “crítico de alineación del usuario” antes de que Chrome lo agregue y comience la navegación. Y dado que las URL generadas por el modelo podrían exfiltrar información privada, tenemos una comprobación determinista para restringirlas a URL públicas conocidas. Si una página en Chrome navega por sí sola a un nuevo origen, obtendrá una revisión por el mismo crítico. Obtener el equilibrio correcto en la primera iteración es difícil sin ver cómo interactúan las tareas de los usuarios con estas protecciones. Inicialmente, hemos implementado una versión más simple de gating de origen que simplemente rastrea el conjunto de escritura. Ajustaremos las funciones de gating y otros aspectos de este sistema para reducir la fricción innecesaria al tiempo que mejoramos la seguridad. Creemos que esta arquitectura proporcionará un poderoso primitivo de seguridad que se puede auditar y razonar dentro del cliente, ya que proporciona protecciones contra laelusión de datos sensibles y acciones no deseadas. Transparencia y control para acciones sensibles. Hemos diseñado las capacidades de agentes en Chrome para dar a los usuarios transparencia y control cuando es necesario. A medida que el agente está activo, detalla cada paso en un registro de trabajo, lo que permite al usuario observar las acciones del agente a medida que ocurren. El usuario puede pausar para tomar el control o detener una tarea en cualquier momento. Esta transparencia se combina con múltiples capas de comprobaciones deterministas y basadas en modelos para activar confirmaciones del usuario antes de que el agente tome una acción impactante. Estas funcionan como protecciones contra errores de modelo y entradas maliciosas, colocando al usuario en el bucle en momentos clave. Primero, el agente requerirá una confirmación del usuario antes de navegar a ciertos sitios sensibles, como los que manejan transacciones bancarias o información médica personal. Esto se basa en una comprobación determinista contra una lista de sitios sensibles. En segundo lugar, confirmará antes de permitir que Chrome se inicie sesión a través de Google Password Manager: el modelo no tiene acceso directo a las contraseñas almacenadas. Por último, antes de cualquier acción web sensible como completar una compra o pago, enviar mensajes o realizar otras acciones, el agente intentará pausar y obtener permiso del usuario antes de continuar o solicitar al usuario que complete el siguiente paso. Al igual que nuestras otras clasificaciones de seguridad, estamos trabajando continuamente para mejorar la precisión para capturar casos extremos y zonas grises. Ejemplo ilustrativo de cuando llega el agente a una página de pago, se detiene y pide al usuario que complete el paso final. Detectar la “ingeniería social” de los agentes Además de las defensas estructurales de comprobaciones de alineación, gating de orígenes y confirmaciones, tenemos varios procesos para detectar y responder a las amenazas. Mientras que el agente está activo, revisa cada página que ve para la inyección indirecta de indicaciones. Esto se añade a la revisión en tiempo real de Safe Browsing y la IA de dispositivo que detectan el engaño tradicional. Este clasificador de indicaciones se ejecuta en paralelo con la inferencia del modelo de planificación, y evitará que se tomen acciones basadas en contenido que el clasificador ha determinado que ha dirigido intencionalmente al modelo para que haga algo que no se alinee con el objetivo del usuario. Si bien no puede marcar todo lo que podría influir en el modelo con intenciones maliciosas, es una capa valiosa en nuestra defensa en profundidad. La auditoría, la supervisión y la respuesta continuas. Para validar la seguridad de este conjunto de defensas, hemos creado sistemas automatizados de red-teaming para generar sitios maliciosos en un entorno de sandbox que intentan desviar al agente en Chrome. Comenzamos con un conjunto diverso de ataques creados por investigadores de seguridad, y los expandimos utilizando LLMs siguiendo una técnica que hemos adaptado para los agentes del navegador. Nuestra prueba continua prioriza las defensas contra vectores de amplio alcance como el contenido generado por el usuario en sitios de redes sociales y el contenido entregado a través de anuncios. También priorizamos los ataques que podrían causar daños duraderos, como transacciones financieras o la fuga de contraseñas. El éxito en estos ataques proporciona una retroalimentación inmediata sobre cualquier cambio que hagamos, para que podamos evitar regresiones y dirigirse a las mejoras. La capacidad de actualización automática de Chrome nos permite obtener las correcciones para los usuarios de forma rápida, para que podamos mantenerse por delante de los atacantes. Colaborar con la comunidad. Tenemos un compromiso a largo plazo de trabajar con la comunidad de investigación de seguridad para avanzar en la seguridad juntos, y esto incluye la seguridad de los agentes. Hemos actualizado nuestras directrices del Programa de Recompensas por Vulnerabilidades (VRP) para aclarar cómo los investigadores externos pueden centrarse en las capacidades de agentes en Chrome. Queremos saber sobre cualquier vulnerabilidad grave en este sistema, y pagaremos hasta $20,000 por aquellas que demuestren que se han violado los límites de seguridad. Los detalles completos están disponibles en las reglas del VRP. Mirando al futuro La introducción de capacidades de agente en Chrome trae nuevos requisitos para la seguridad del navegador, y hemos abordado este desafío con el mismo rigor que ha definido el modelo de seguridad de Chrome desde sus inicios. Al extender algunos principios fundamentales como el aislamiento de origen y las defensas en capas, y al introducir una arquitectura basada en modelos de confianza, estamos construyendo una base segura para las experiencias de agentes de Gemini en Chrome. Esto es un espacio en evolución, y aunque estamos orgullosos de las protecciones iniciales que hemos implementado, reconocemos que la seguridad para los agentes de la web es aún un dominio emergente. Seguimos comprometidos con la innovación continua y la colaboración con la comunidad de seguridad para garantizar que los usuarios de Chrome puedan explorar esta nueva era de la web de forma segura.
Artículos relacionados
El nuevo malware Dolphin X utiliza la inteligencia artificial para priorizar objetivos de alto valor.
Un nuevo caballo de Troya de acceso remoto llamado Dolphin X afirma utilizar una función de perfilado impulsada por IA para puntuar y clasificar a los usuarios infectados, lo que ayuda a los ciberdelincuentes a identificar a qué víctimas deberían ser atacadas primero.
La empresa australiana de energía Origin afirma que una filtración de datos expuso datos de clientes.
Origin Energy ha confirmado que una parte no autorizada accedió y posteriormente divulgó datos de clientes en línea, exponiendo información personal sensible, entre otros datos.
Aplicación falsa de Claude promovida por anuncios de Bing, que distribuye el malware SectopRAT
Una campaña de malvertising en el servicio de búsqueda Bing está distribuyendo un instalador falso de la aplicación de escritorio de Claude, alojado en un dominio legítimo de Claude.ai, para distribuir el malware SectopRAT.