Link copiado!

OpenAI afirma que sequestro de navegadores por IA pode nunca ter solução

Em 22 de dezembro de 2025, a OpenAI declarou que a injeção de prompts — ataque que sequestra um agente de IA com instruções ocultas — dificilmente terá uma solução completa definitiva. A agência de segurança cibernética do Reino Unido havia emitido um alerta semelhante. Veja aqui como o ataque funciona, o que a própria demonstração da OpenAI exibiu e as três medidas que a empresa recomenda se você utiliza um agente.

🌐
Tradução automática

Este artigo foi traduzido automaticamente do original em inglês. Ler o original em inglês

Uma mulher em uma escrivaninha recua com as mãos levantadas enquanto um par de mãos fantasmagóricas e translúcidas digita sozinho no teclado do laptop

Em 22 de dezembro de 2025, a OpenAI publicou um post de segurança sobre o ChatGPT Atlas, seu navegador web com um agente de IA integrado. A empresa escreveu que a injeção de prompt, “assim como golpes e engenharia social na web”, dificilmente será totalmente resolvida.

Se você deixa um agente de IA ler seu e-mail ou navegar enquanto está conectado às suas contas, o problema também é seu. A própria lista da OpenAI do que um ataque bem-sucedido poderia, hipoteticamente, fazer inclui encaminhar um e-mail sensível, enviar dinheiro e editar ou excluir arquivos na nuvem.

A OpenAI não estava sozinha. No início daquele mês, o National Cyber Security Centre (NCSC) do Reino Unido havia alertado que ataques de injeção de prompt contra aplicações de IA generativa “podem nunca ser totalmente mitigados”, segundo o TechCrunch.

O que a OpenAI disse

Conforme a OpenAI descreveu em dezembro de 2025, o modo agente do ChatGPT Atlas permitia que um agente de navegador visse páginas da web e executasse ações, cliques e digitação dentro do seu navegador. A OpenAI afirmou que, à medida que o agente faz mais coisas por você, ele também se torna “um alvo de maior valor para ataques adversariais”.

Advertisement

O post anunciou uma atualização de segurança para o agente de navegador do Atlas, incluindo um modelo recém-treinado de forma adversarial e salvaguardas reforçadas em torno dele. A OpenAI disse que a atualização foi motivada por uma nova classe de ataques de injeção de prompt descoberta por seu red teaming automatizado interno, ou seja, testes de ataque contra o próprio produto.

A empresa chamou a injeção de prompt de “um desafio de segurança de IA de longo prazo” e disse que o modo agente “amplia a superfície de ameaças à segurança”. Também escreveu que a natureza do ataque “torna desafiadoras as garantias de segurança determinísticas”.

Um porta-voz da OpenAI se recusou a dizer ao TechCrunch se a atualização havia produzido uma redução mensurável nas injeções bem-sucedidas.

Como funciona uma injeção de prompt

A OpenAI descreve o ataque como a incorporação de instruções maliciosas em conteúdo que o agente processa, escritas para anular ou redirecionar o que o agente faz.

O NCSC descreve uma versão comumente chamada de injeção de prompt indireta: um invasor sem acesso direto ao sistema de IA escreve algo que o sistema acaba processando e tratando como uma instrução. O exemplo do órgão é o de um candidato a uma vaga que esconde um texto em um CV, ou currículo, dizendo ao modelo de triagem para ignorar as instruções anteriores e aprovar o CV para entrevista.

O motivo pelo qual isso é difícil de corrigir está dentro do modelo. O post do NCSC diz que os modelos de texto de IA atuais “simplesmente não impõem uma fronteira de segurança entre instruções e dados dentro de um prompt”. Um modelo, segundo o texto, prevê o próximo token mais provável, ou fragmento de texto, a partir do texto até aquele ponto, sem nenhuma distinção inerente entre dados e instrução.

Advertisement

É aí que a comparação com ataques mais antigos deixa de funcionar. A injeção de SQL (Structured Query Language), um ataque conhecido há muito tempo contra os bancos de dados por trás de sites, pode ser devidamente mitigada com consultas parametrizadas, afirma o NCSC, enquanto há uma boa chance de que a injeção de prompt nunca seja devidamente mitigada da mesma forma. O objetivo realista, nas palavras do post do NCSC, é “reduzir a probabilidade ou o impacto dos ataques”.

A demonstração: um e-mail, uma carta de demissão

Para encontrar ataques antes que pessoas de fora o façam, a OpenAI construiu um atacante automatizado, ele próprio um modelo de IA, e o treinou com aprendizado por reforço para que aprenda com seus próprios acertos e erros. O atacante pode enviar uma injeção candidata a um simulador, ler como o agente-alvo raciocinaria e agiria, e então revisar e tentar de novo. A OpenAI disse que essa visão do raciocínio do alvo não é divulgada a usuários externos, o que dá ao seu atacante interno uma vantagem.

A OpenAI publicou uma das explorações que o atacante encontrou. Um e-mail malicioso chega a uma caixa de entrada, trazendo uma instrução para que o agente envie uma carta de demissão ao diretor executivo do dono da conta. Mais tarde, o dono pede ao agente que redija uma resposta automática de ausência do escritório. O agente encontra o e-mail plantado durante a tarefa, trata o prompt injetado como autoridade e o segue. A resposta de ausência do escritório nunca é escrita, e o agente pede demissão em nome do dono.

A etapa final da demonstração mostra o modo agente detectando a tentativa de injeção após a atualização de segurança.

O e-mail é apenas uma porta entre muitas. A OpenAI lista e-mails e anexos, convites de calendário, documentos compartilhados, fóruns, publicações em redes sociais e páginas da web arbitrárias como lugares onde um agente pode encontrar instruções não confiáveis. Ela afirmou que seu atacante consegue conduzir um agente a fluxos de trabalho nocivos “que se desenrolam ao longo de dezenas (ou até centenas) de etapas”.

Advertisement

Como reduzir seu risco

O post da OpenAI de dezembro de 2025 deu três recomendações para usar agentes com mais segurança.

  • Limite o acesso com login. Use o modo sem login no Atlas quando a tarefa não precisar dos sites em que você está conectado.
  • Leia os pedidos de confirmação. A OpenAI disse que os agentes foram projetados para perguntar antes de certas ações importantes, como concluir uma compra ou enviar um e-mail. Verifique se a ação está correta e se as informações compartilhadas são apropriadas.
  • Dê instruções restritas. A OpenAI desaconselhou prompts amplos que mandam um agente revisar seu e-mail e tomar qualquer ação necessária. Tarefas específicas e bem delimitadas são mais seguras, afirmou.

A OpenAI apresentou essas medidas como passos para reduzir o risco. Sobre tarefas bem delimitadas, disse que o hábito “não elimina o risco, mas torna os ataques mais difíceis de executar”.

Rami McCarthy, pesquisador principal de segurança da empresa de cibersegurança Wiz, deu ao TechCrunch uma forma de avaliar a questão em dezembro de 2025: o risco em sistemas de IA como “autonomia multiplicada por acesso”. Navegadores com agentes, disse ele, tendem a ficar em “autonomia moderada combinada com acesso muito alto”. Sua avaliação na época, para a maioria dos usos cotidianos, era que os navegadores com agentes “ainda não entregam valor suficiente para justificar seu perfil de risco atual”.

O NCSC, escrevendo para profissionais de segurança cibernética, recomenda salvaguardas determinísticas fora do modelo que limitem o que o sistema pode fazer. Se a segurança de um sistema não tolera o risco restante, diz o órgão, talvez esse sistema não seja um bom uso para esse tipo de IA.

Não é só um problema da OpenAI

Depois que o Atlas foi lançado em outubro de 2025, pesquisadores de segurança publicaram demonstrações mostrando que poucas palavras em um Google Docs podiam mudar o comportamento do navegador, segundo o TechCrunch. A Brave publicou um post descrevendo a injeção de prompt indireta como um desafio sistemático para navegadores com IA, incluindo o Comet, da Perplexity. Anthropic e Google também afirmaram que as defesas contra ataques baseados em prompts precisam ser em camadas e testadas continuamente sob estresse, de acordo com o TechCrunch.

O alerta do NCSC olha mais adiante. Os ataques de injeção de SQL atingiram o pico por volta de 2010, diz o órgão, e foi preciso uma década de invasões e vazamentos de dados para chegar aos padrões melhores que os tornaram raros. Se as aplicações de IA não forem projetadas com a injeção de prompt em mente, afirma o post do NCSC, “uma onda semelhante de violações pode se seguir”.

O que a OpenAI almeja

A meta declarada da OpenAI naquele post era que você possa confiar em um agente para usar seu navegador “como confiaria em um colega ou amigo altamente competente e atento à segurança”. O mesmo post chama a injeção de prompt de um desafio em aberto no qual a OpenAI espera continuar trabalhando “por muitos anos”.

Ao vivo: qual modelo de IA é o nº 1 agora? O ranking às cegas da LMArena, quanto custa cada modelo por milhão de tokens e os lançamentos do mês. Atualizado diariamente. Ver o ranking →

Fontes (3)

Advertisement
Advertisement
Advertisement

Coloring books · All ages

Calm books for noisy days

Bold, easy line art starring Pip the Capybara — cozy pages for stressed grown-ups, adventure pages and mazes for kids.

See the books Free printable pages →

Scan with your phone camera

🦋 Discussão no Bluesky

Discutir no Bluesky

Procurando publicações...