On 22 de diciembre de 2025, OpenAI publicó una entrada sobre seguridad de ChatGPT Atlas, su navegador web con un agente de IA integrado. La empresa escribió que la inyección de instrucciones (prompt injection), “al igual que las estafas y la ingeniería social en la web”, probablemente nunca se resolverá por completo.
Si dejas que un agente de IA lea tu correo o navegue con la sesión iniciada en tus cuentas, el problema también es tuyo. La propia lista de OpenAI sobre lo que podría hacer hipotéticamente un ataque exitoso incluye reenviar un correo sensible, enviar dinero y editar o eliminar archivos en la nube.
OpenAI no fue la única. A principios de ese mismo mes, el Centro Nacional de Ciberseguridad del Reino Unido (NCSC) advirtió que los ataques de inyección de instrucciones contra aplicaciones de IA generativa “puede que nunca se mitiguen del todo”, según informó TechCrunch.
Lo que dijo OpenAI
Según la descripción de OpenAI en diciembre de 2025, el modo agente de ChatGPT Atlas permitía a un agente del navegador ver páginas web y realizar acciones, clics y pulsaciones de teclas dentro de tu navegador. OpenAI explicó que, a medida que el agente hace más cosas por ti, también se convierte en “un objetivo de mayor valor para los ataques adversarios”.
La publicación anunciaba una actualización de seguridad del agente del navegador Atlas, que incluía un modelo recién entrenado de forma adversarial y salvaguardas reforzadas a su alrededor. OpenAI indicó que la actualización se debió a una nueva clase de ataques de inyección de instrucciones que su sistema interno de red teaming automatizado, es decir, pruebas de ataque contra su propio producto, había descubierto.
La empresa calificó la inyección de instrucciones como “un desafío de seguridad de la IA a largo plazo” y afirmó que el modo agente “amplía la superficie de amenazas de seguridad”. También escribió que la naturaleza del ataque “hace difíciles las garantías de seguridad deterministas”.
Un portavoz de OpenAI se negó a decirle a TechCrunch si la actualización había producido una reducción medible de las inyecciones exitosas.
Cómo funciona una inyección de instrucciones
OpenAI describe el ataque como la incrustación de instrucciones maliciosas en el contenido que procesa el agente, escritas para anular o redirigir lo que hace el agente.
El NCSC describe una versión conocida comúnmente como inyección indirecta de instrucciones: un atacante sin acceso directo al sistema de IA escribe algo que el sistema acaba procesando y tratando como una instrucción. Su ejemplo es el de un candidato a un empleo que oculta texto en un CV, o currículum, para decirle al modelo de selección que ignore las instrucciones anteriores y apruebe el CV para una entrevista.
La razón por la que es difícil de corregir está dentro del propio modelo. La publicación del NCSC afirma que los modelos de texto de IA actuales “simplemente no aplican una frontera de seguridad entre las instrucciones y los datos dentro de un prompt”. Según explica, un modelo predice el token más probable, o fragmento de texto, a partir del texto anterior, sin ninguna distinción inherente entre datos e instrucciones.
Ahí es donde se rompe la comparación con ataques más antiguos. La inyección SQL (Structured Query Language, lenguaje de consulta estructurado), un ataque conocido desde hace mucho contra las bases de datos que hay detrás de los sitios web, puede mitigarse adecuadamente con consultas parametrizadas, según el NCSC, mientras que es muy probable que la inyección de instrucciones nunca llegue a mitigarse correctamente de la misma manera. El objetivo realista, en palabras del NCSC, es “reducir la probabilidad o el impacto de los ataques”.
La demostración: un correo, una carta de renuncia
Para encontrar ataques antes que los externos, OpenAI creó un atacante automatizado, a su vez un modelo de IA, y lo entrenó con aprendizaje por refuerzo para que aprenda de sus propios aciertos y fallos. El atacante puede enviar una inyección candidata a un simulador, leer cómo razonaría y actuaría el agente objetivo, y luego revisarla y volver a intentarlo. OpenAI indicó que esa visión del razonamiento del objetivo no se revela a los usuarios externos, lo que da una ventaja a su atacante interno.
OpenAI publicó uno de los exploits que encontró el atacante. Un correo malicioso llega a una bandeja de entrada con una instrucción para que el agente envíe una carta de renuncia al director ejecutivo del dueño de la cuenta. Más tarde, el dueño le pide al agente que redacte una respuesta de fuera de la oficina. El agente se encuentra con el correo plantado durante la tarea, trata la instrucción inyectada como autoritativa y la sigue. La respuesta de fuera de la oficina nunca se escribe, y el agente renuncia en nombre del dueño.
El último paso de la demostración muestra al modo agente detectando el intento de inyección después de la actualización de seguridad.
El correo es solo una puerta entre muchas. OpenAI enumera los correos y sus archivos adjuntos, las invitaciones de calendario, los documentos compartidos, los foros, las publicaciones en redes sociales y las páginas web arbitrarias como lugares donde un agente puede toparse con instrucciones no confiables. Indicó que su atacante puede llevar a un agente a flujos de trabajo dañinos “que se desarrollan a lo largo de decenas (o incluso cientos) de pasos”.
Cómo reducir tu riesgo
La publicación de OpenAI de diciembre de 2025 daba tres recomendaciones para usar los agentes de forma más segura.
- Limita el acceso con sesión iniciada. Usa el modo sin sesión en Atlas cuando la tarea no necesite los sitios en los que has iniciado sesión.
- Lee las solicitudes de confirmación. OpenAI dijo que los agentes estaban diseñados para preguntar antes de ciertas acciones importantes, como completar una compra o enviar un correo. Comprueba que la acción sea correcta y que la información que se comparte sea apropiada.
- Da instrucciones concretas. OpenAI desaconsejó las indicaciones amplias que le piden a un agente revisar tu correo y tomar cualquier medida necesaria. Las tareas específicas y bien delimitadas son más seguras, según dijo.
OpenAI presentó esto como pasos para reducir el riesgo. Sobre las tareas bien delimitadas, dijo que el hábito “no elimina el riesgo, pero hace que los ataques sean más difíciles de llevar a cabo”.
Rami McCarthy, investigador principal de seguridad de la firma de ciberseguridad Wiz, le dio a TechCrunch una forma de sopesarlo en diciembre de 2025: el riesgo en los sistemas de IA como “autonomía multiplicada por acceso”. Los navegadores con agente, dijo, tienden a situarse en “autonomía moderada combinada con un acceso muy alto”. Su valoración en ese momento, para la mayoría de los usos cotidianos, era que los navegadores con agente “todavía no ofrecen suficiente valor como para justificar su perfil de riesgo actual”.
El NCSC, que escribe para profesionales de la ciberseguridad, recomienda salvaguardas deterministas fuera del modelo que limiten lo que el sistema puede hacer. Si la seguridad de un sistema no puede tolerar el riesgo restante, afirma, puede que ese sistema no sea un buen uso para este tipo de IA.
No es solo un problema de OpenAI
Tras el lanzamiento de Atlas en octubre de 2025, investigadores de seguridad publicaron demostraciones que mostraban que unas pocas palabras en Google Docs podían cambiar el comportamiento del navegador, según informó TechCrunch. Brave publicó una entrada que describe la inyección indirecta de instrucciones como un desafío sistemático para los navegadores con IA, incluido Comet de Perplexity. Anthropic y Google también han dicho que las defensas contra los ataques basados en instrucciones deben ser por capas y someterse a pruebas de estrés continuas, según TechCrunch.
La advertencia del NCSC mira más lejos. Los ataques de inyección SQL tuvieron su punto álgido hacia 2010, afirma, y hicieron falta una década de vulneraciones y filtraciones de datos para lograr las mejores configuraciones por defecto que los volvieron poco frecuentes. Si las aplicaciones de IA no se diseñan teniendo en cuenta la inyección de instrucciones, dice la publicación del NCSC, “podría seguir una oleada similar de brechas de seguridad”.
Lo que busca OpenAI
El objetivo declarado de OpenAI en esa publicación era que puedas confiar en un agente con tu navegador “como confiarías en un colega o amigo muy competente y consciente de la seguridad”. La misma publicación califica la inyección de instrucciones como un desafío abierto en el que OpenAI espera seguir trabajando “durante los próximos años”.
🦋 Discusión en Bluesky
Discutir en Bluesky