TOKENPOST

오픈AI, AI 에이전트 자기복제형 공격 확인

토포AI로 이 기사 더 깊이 읽기

노트북 사이에 복제되는 악성 지시 파일 / TokenPost.ai

오픈AI가 인공지능(AI) 에이전트가 악성 프롬프트를 이메일·파일·코드에 다시 삽입해 다른 에이전트로 전파하는 '자기복제형 프롬프트 인젝션'을 실험 환경에서 확인했다.

오픈AI는 9월 25일 공개한 공식 보고서에서 GPT-Red 방식의 내부 모델을 활용해 해당 공격 유형을 발견했다고 밝혔다. 최초 발견일은 6월 27일이며, 실험은 평가용으로 시뮬레이션한 도구 호출 환경에서 진행됐다.

프롬프트 인젝션은 이메일이나 웹페이지처럼 AI가 읽는 외부 콘텐츠에 악성 지시를 숨겨 모델의 행동을 바꾸는 공격이다. 자기복제형 공격은 모델이 답장·파일·코드 같은 결과물에 같은 지시를 다시 넣도록 유도한다는 점에서 한 단계 확장된 형태다.

오픈AI가 공개한 사례에서는 악성 지시가 이메일 본문에 포함됐다. AI 에이전트는 답장 마지막에 원문 이메일 전체를 반복해 삽입했고, 이후 해당 답장을 읽는 다른 에이전트가 같은 지시에 노출될 수 있는 구조가 형성됐다.

전파 경로는 이메일에 한정되지 않았다. 파일시스템과 코드 주석을 통해 공격 지시가 복제되는 사례도 발견됐으며, 이메일·캘린더 같은 외부 연결 기능을 사용하는 환경을 중심으로 가능성이 시험됐다.

공격 방식에는 가짜 사고 과정이나 가짜 도구 메시지로 모델을 속이는 방법도 포함됐다. 여러 메시지를 거치며 지시가 전달되는 '다중 홉' 공격 역시 연구 대상에 들어갔다.

이번 연구에 사용된 공격 모델과 취약 모델은 모두 GPT-5.4-mini 기반의 내부 연구용 체크포인트였다. 오픈AI는 해당 모델들이 일반에 배포된 제품이 아니며, 실험은 시뮬레이션된 도구 호출 안에서 이뤄졌다고 설명했다.

이 같은 개념은 앞서 학계에서도 제기됐다. 연구진은 2024년 논문 'Here Comes the AI Worm'에서 생성형 AI 이메일 보조 시스템 사이에 악성 프롬프트가 연쇄적으로 전달되는 'Morris II'를 제시했다.

Morris II 연구는 이메일 보조 AI가 악성 지시를 답변에 삽입하고 이를 다른 AI 시스템으로 확산시킬 수 있는지 실험했다. 오픈AI의 이번 발표는 주요 AI 개발사가 내부 모델을 대상으로 자동화된 자체 검증을 진행했다는 점에서 차이가 있다.

오픈AI는 GPT-Red를 자동화된 레드팀 모델로 활용하고 있다. GPT-Red는 이메일·웹페이지·로컬 파일·도구 출력에 삽입된 공격을 찾아내는 방식으로 AI 에이전트의 취약점을 점검한다.

오픈AI는 자기복제형 공격을 GPT-Red의 훈련 목표에 포함해 방어력을 높일 계획이다. 동시에 프롬프트 인젝션 대응에는 모델 학습만으로 충분하지 않다며 모니터링·샌드박싱·최소 권한 부여·중요 작업 전 사용자 확인을 함께 적용해야 한다고 밝혔다.

이번 사례는 AI 모델 자체가 가중치나 컴퓨팅 자원을 복제했다는 뜻은 아니다. AI가 읽고 생성하는 텍스트와 파일에 악성 지시가 반복 삽입돼 다음 에이전트로 전달될 수 있다는 의미다.

이에 따라 보안 범위는 모델 내부에서 이메일·문서·코드 저장소·캘린더 등 연결 시스템으로 넓어진다. AI 에이전트 확산에 따라 기업들이 권한·감사 통제 체계를 구축하고 있다는 본지 보도도 같은 변화에 초점을 맞췄다.

SNS에서는 이번 사례를 '자기복제 AI'로 부르는 것이 실제 연구 범위를 넓혀 해석할 수 있다는 지적이 나왔다. 일부 Reddit 이용자도 모델 가중치나 컴퓨팅 자원이 복제된 사건이 아니라 악성 지시가 결과물에 재삽입되는 공격이라고 구분해야 한다고 주장했다.

현재까지 공개된 사실은 실험 환경에서 자기복제형 프롬프트 인젝션이 가능했다는 수준이다. 실제 서비스에서 공격이 확산됐거나 사용자 데이터가 탈취됐다는 증거는 공개되지 않았으며, 오픈AI는 관련 공격을 GPT-Red 훈련에 반영할 예정이다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.