Investigadores de Zenity revelaron fallas en estos modelos de Inteligencia Artificial que permiten ataques mediante inyección indirecta de mensajes en otros agentes.
Investigadores de Zenity revelaron vulnerabilidades en ChatGPT Atlas y Claude que afectan a herramientas de inteligencia artificial integradas en navegadores y extensiones. Los hallazgos muestran cómo los agentes pueden ser manipulados mediante técnicas de inyección indirecta de mensajes para ejecutar acciones no previstas por los usuarios.
La compañía de seguridad presentó dos investigaciones separadas. Una analiza el navegador agente ChatGPT Atlas de OpenAI y otra examina la extensión oficial de Claude para Chrome de Anthropic.
Vulnerabilidades en ChatGPT Atlas y Claude evidencian nuevos riesgos para agentes de IA
En el caso de ChatGPT Atlas, Zenity explicó que la falla identificada corresponde a una inyección indirecta de mensajes sin clics. Los investigadores señalaron que el problema surge por decisiones de diseño arquitectónico y no por errores tradicionales de software.
La investigación describe una técnica basada en una “colisión de intenciones”, donde un atacante inserta instrucciones maliciosas en contenido aparentemente legítimo.
Zenity mostró dos escenarios. En el primero, un usuario pidió a Atlas realizar una tarea cotidiana, como suscribirse a un boletín informativo desde una publicación de X. El contenido malicioso llevó al agente a una página preparada por el atacante y pudo acceder a diferentes páginas donde el usuario ya tiene sesiones abiertas, por ejemplo a WhatsApp Web, donde leyó la lista de contactos y envió mensajes de phishing.
En el segundo escenario, Atlas fue dirigido a Amazon para agregar productos a un carrito y cambiar la dirección de envío por la ubicación del atacante. Para superar la restricción que impedía completar la compra, el agente utilizó el asistente de inteligencia artificial de Amazon, Rufus, para intentar realizar el pedido.
Zenity informó estos hallazgos a OpenAI en enero de 2026. La empresa reconoció el reporte, aunque los investigadores indicaron que no existe una solución sencilla debido a las capacidades centrales de los navegadores agentes.
Códigos maliciosos manipulan cuentas de usuarios
Las vulnerabilidades en ChatGPT Atlas también fueron analizadas en la extensión de Claude para Chrome. Zenity demostró una cadena de ataques sin clics que puede escalar una inyección indirecta de mensajes hasta la toma de control de cuentas en diferentes plataformas web.
Según la investigación, el ataque inicia con un correo electrónico malicioso que contiene estructuras invisibles. Cuando el usuario solicita a Claude un resumen de sus correos recientes, el agente puede interpretar esas instrucciones ocultas como comandos.
Zenity explicó que los atacantes pueden evadir mecanismos de seguridad mediante gestores de paquetes de Node personalizados alojados en una red de entrega fraudulenta. Así logran que Claude ejecute código malicioso a través de una importación aparentemente inofensiva.
Los investigadores demostraron que el atacante puede consultar información de Gmail, extraer identificadores de mensajes, analizar correos y enviar contenido de la bandeja de entrada a un servidor bajo su control. También mostraron acciones contra cuentas de Google Drive, Slack y X.
Las vulnerabilidades en ChatGPT Atlas y Claude fueron comunicadas a las compañías correspondientes.








