링크가 복사되었습니다!

OpenAI, AI 브라우저 하이재킹 문제 영구히 해결되지 않을 수도

2025년 12월 22일, OpenAI는 숨겨진 명령으로 AI 에이전트를 탈취하는 공격인 '프롬프트 인젝션'이 영구히 완전히 해결되기는 어려울 것이라고 밝혔습니다. 영국 사이버 보안국도 이와 유사한 경고를 내놓은 바 있습니다. 본문에서는 이 공격의 작동 방식, OpenAI의 자체 데모가 보여준 내용, 그리고 에이전트를 사용할 때 OpenAI가 권장하는 세 가지 조치를 소개합니다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

책상에 앉은 여성이 손을 들고 뒤로 물러서는 사이, 반투명한 유령 같은 두 손이 노트북 키보드를 저절로 타이핑하고 있다

2025년 12월 22일, OpenAI는 AI 에이전트가 내장된 웹 브라우저 ChatGPT Atlas에 관한 보안 게시글을 발표했습니다. 회사는 프롬프트 인젝션이 “웹상의 사기나 사회공학과 마찬가지로” 완전히 해결될 가능성은 낮다고 밝혔습니다.

AI 에이전트에게 이메일을 읽게 하거나 계정에 로그인한 상태로 브라우징을 맡긴다면, 이는 여러분의 문제이기도 합니다. OpenAI가 직접 제시한 목록에 따르면, 공격이 성공할 경우 가정적으로 민감한 이메일을 전달하거나, 돈을 송금하거나, 클라우드의 파일을 수정하거나 삭제할 수 있습니다.

OpenAI만의 이야기는 아닙니다. TechCrunch에 따르면, 같은 달 초 영국 국가사이버보안센터(NCSC)도 생성형 AI 애플리케이션에 대한 프롬프트 인젝션 공격은 “완전히 완화되지 못할 수도 있다”고 경고했습니다.

OpenAI의 설명

OpenAI가 2025년 12월에 설명한 바에 따르면, ChatGPT Atlas의 에이전트 모드는 브라우저 에이전트가 웹페이지를 보고 브라우저 안에서 클릭과 키 입력 같은 동작을 수행할 수 있게 합니다. OpenAI는 에이전트가 여러분을 위해 더 많은 일을 처리할수록 “적대적 공격의 더 가치 높은 표적”이 된다고 말했습니다.

이 게시글은 Atlas 브라우저 에이전트의 보안 업데이트를 알렸습니다. 새롭게 적대적 학습을 거친 모델과 이를 둘러싼 강화된 보호 장치가 포함됩니다. OpenAI는 이번 업데이트가 자사의 내부 자동화 레드팀 활동, 즉 자사 제품을 대상으로 한 공격 테스트에서 발견된 새로운 유형의 프롬프트 인젝션 공격에서 비롯되었다고 밝혔습니다.

회사는 프롬프트 인젝션을 “장기적인 AI 보안 과제”라고 부르며, 에이전트 모드가 “보안 위협 표면을 넓힌다”고 말했습니다. 또한 이 공격의 성격상 “결정론적 보안 보장이 어렵다”고 썼습니다.

Advertisement

OpenAI 대변인은 이번 업데이트로 인젝션 성공 건수가 측정 가능할 만큼 줄었는지에 대해 TechCrunch에 답변하기를 거부했습니다.

프롬프트 인젝션은 어떻게 작동하나

OpenAI는 이 공격을 에이전트가 처리하는 콘텐츠에 악의적인 지시를 심어, 에이전트의 동작을 덮어쓰거나 다른 방향으로 돌리도록 만드는 것이라고 설명합니다.

NCSC는 흔히 간접 프롬프트 인젝션이라 불리는 형태를 설명합니다. AI 시스템에 직접 접근할 수 없는 공격자가 글을 작성하면, 시스템이 이를 처리하면서 지시로 취급해 버리는 방식입니다. NCSC가 든 예시는 구직자가 CV(이력서)에 텍스트를 숨겨, 심사 모델에게 이전 지시를 무시하고 해당 CV를 면접 대상으로 승인하라고 시키는 경우입니다.

이 문제를 패치하기 어려운 이유는 모델 내부에 있습니다. NCSC의 글은 현재의 AI 텍스트 모델이 “프롬프트 안의 지시와 데이터 사이에 보안 경계를 전혀 적용하지 않는다”고 말합니다. 모델은 지금까지의 텍스트를 바탕으로 가장 가능성이 높은 다음 토큰, 즉 텍스트 조각을 예측할 뿐이며, 데이터와 지시를 본질적으로 구분하지 않는다는 설명입니다.

바로 이 지점에서 과거의 공격과의 비교가 무너집니다. 웹사이트 뒤의 데이터베이스를 노리는 오래된 공격인 SQL(Structured Query Language) 인젝션은 매개변수화된 쿼리로 제대로 완화할 수 있지만, 프롬프트 인젝션은 같은 방식으로 제대로 완화되지 못할 가능성이 크다고 NCSC는 말합니다. NCSC 글의 표현에 따르면 현실적인 목표는 “공격의 가능성이나 영향을 줄이는 것”입니다.

시연: 이메일 한 통, 사직서 한 장

외부인보다 먼저 공격을 찾아내기 위해, OpenAI는 그 자체가 AI 모델인 자동화 공격자를 만들고 강화학습으로 훈련해 스스로의 성공과 실패에서 배우도록 했습니다. 이 공격자는 후보 인젝션을 시뮬레이터에 보내고, 대상 에이전트가 어떻게 추론하고 행동할지 읽어 낸 뒤, 수정해서 다시 시도할 수 있습니다. OpenAI는 대상의 추론 과정에 대한 이런 시야가 외부 사용자에게는 공개되지 않으며, 이것이 내부 공격자에게 유리하게 작용한다고 말했습니다.

OpenAI는 공격자가 찾아낸 익스플로잇 하나를 공개했습니다. 악성 이메일이 받은편지함에 도착하는데, 여기에는 계정 소유자의 최고경영자에게 사직서를 보내라는 에이전트용 지시가 담겨 있습니다. 나중에 소유자가 에이전트에게 부재중 자동 회신 초안을 작성해 달라고 요청합니다. 에이전트는 작업 도중 심어진 이메일을 만나고, 주입된 프롬프트를 권위 있는 지시로 받아들여 그대로 따릅니다. 부재중 회신은 끝내 작성되지 않고, 에이전트는 소유자를 대신해 사직합니다.

시연의 마지막 단계는 보안 업데이트 이후 에이전트 모드가 인젝션 시도를 탐지하는 모습을 보여 줍니다.

Advertisement

이메일은 여러 경로 중 하나일 뿐입니다. OpenAI는 이메일과 첨부 파일, 캘린더 초대, 공유 문서, 포럼, 소셜 미디어 게시물, 임의의 웹페이지를 에이전트가 신뢰할 수 없는 지시를 만날 수 있는 곳으로 꼽습니다. 또한 자사의 공격자가 에이전트를 “수십 단계(심지어 수백 단계)에 걸쳐 전개되는” 해로운 워크플로로 유도할 수 있다고 밝혔습니다.

위험을 낮추는 방법

OpenAI의 2025년 12월 게시글은 에이전트를 더 안전하게 사용하기 위한 세 가지 권고를 제시했습니다.

  • 로그인 상태의 접근을 제한하세요. 작업에 로그인된 사이트가 필요하지 않다면 Atlas의 로그아웃 모드를 사용하세요.
  • 확인 요청을 읽어 보세요. OpenAI는 에이전트가 구매 완료나 이메일 발송처럼 중대한 결과를 낳는 특정 행동 전에 먼저 묻도록 설계되었다고 말했습니다. 해당 행동이 올바른지, 공유되는 정보가 적절한지 확인하세요.
  • 좁은 범위로 지시하세요. OpenAI는 에이전트에게 이메일을 검토하고 필요한 조치를 알아서 하라는 식의 광범위한 프롬프트를 피하라고 권했습니다. 구체적이고 범위가 분명한 작업이 더 안전하다고 설명했습니다.

OpenAI는 이를 위험을 줄이는 조치로 제시했습니다. 범위가 분명한 작업에 대해서는 이런 습관이 “위험을 없애지는 못하지만, 공격을 수행하기 더 어렵게 만든다”고 말했습니다.

사이버보안 기업 Wiz의 수석 보안 연구원 Rami McCarthy는 2025년 12월 TechCrunch에 AI 시스템의 위험을 가늠하는 방법으로 “자율성 곱하기 접근 권한”이라는 틀을 제시했습니다. 그는 에이전트형 브라우저가 대체로 “중간 수준의 자율성에 매우 높은 접근 권한이 결합된” 위치에 있다고 말했습니다. 당시 그의 평가는, 대부분의 일상적인 용도에서 에이전트형 브라우저가 “현재의 위험 수준을 정당화할 만큼 아직 충분한 가치를 제공하지 못한다”는 것이었습니다.

NCSC는 사이버보안 전문가를 대상으로 쓴 글에서, 모델 바깥에서 시스템이 할 수 있는 일을 제한하는 결정론적 보호 장치를 권고합니다. 시스템의 보안이 남아 있는 위험을 감당할 수 없다면, 그 시스템은 이런 종류의 AI를 쓰기에 적합하지 않을 수 있다고 덧붙입니다.

OpenAI만의 문제가 아닙니다

TechCrunch에 따르면, 2025년 10월 Atlas 출시 이후 보안 연구원들은 Google Docs에 적힌 몇 마디 말만으로 브라우저의 동작을 바꿀 수 있음을 보여 주는 시연을 공개했습니다. Brave는 Perplexity의 Comet을 포함한 AI 기반 브라우저 전반에서 간접 프롬프트 인젝션이 체계적인 과제라고 설명하는 글을 게시했습니다. TechCrunch에 따르면 Anthropic과 Google 역시 프롬프트 기반 공격에 대한 방어는 여러 겹으로 구성되어야 하며 지속적으로 스트레스 테스트를 받아야 한다고 밝혔습니다.

NCSC의 경고는 더 먼 미래를 내다봅니다. SQL 인젝션 공격은 2010년경 정점에 달했고, 이를 드물게 만든 더 나은 기본 설정이 자리 잡기까지 10년에 걸친 침해와 데이터 유출이 필요했다고 설명합니다. AI 애플리케이션이 프롬프트 인젝션을 염두에 두고 설계되지 않는다면 “비슷한 침해의 물결이 이어질 수 있다”고 NCSC의 글은 말합니다.

OpenAI가 목표로 하는 것

해당 게시글에서 OpenAI가 밝힌 목표는, 여러분이 브라우저를 에이전트에게 맡기면서 “유능하고 보안 의식이 높은 동료나 친구를 믿듯” 신뢰할 수 있게 하는 것이었습니다. 같은 게시글은 프롬프트 인젝션을 해결되지 않은 과제로 규정하며, OpenAI가 “앞으로 수년간” 계속 매달릴 것으로 예상한다고 밝힙니다.

실시간: 지금 1위 AI 모델은? LMArena의 블라인드 맞대결 순위, 모델별 100만 토큰당 비용, 이달의 출시작. 매일 갱신. 순위 보기 →

출처 (3)

Advertisement
Advertisement
Advertisement

Coloring books · All ages

Calm books for noisy days

Bold, easy line art starring Pip the Capybara — cozy pages for stressed grown-ups, adventure pages and mazes for kids.

See the books Free printable pages →

Scan with your phone camera

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...