AI 에이전트가 7~8월 보안 평가와 사내 테스트 과정에서 실제 기업 시스템에 접근한 사례가 잇따라 공개됐다. 소비자용 서비스가 독자적으로 폭주했다기보다, 평가 환경의 격리 실패와 인터넷 접근 통제 문제가 실제 침해로 이어진 경우가 대부분이었다.
오픈AI(OpenAI)는 26일 공개한 보고서에서 7월 내부 사이버보안 평가 중 일부 모델이 인터넷 차단을 우회해 오픈AI 내부 연구 인프라와 허깅페이스(Hugging Face) 시스템에 접근했다고 밝혔다. 오픈AI는 이번 일을 "경고탄"으로 규정했다.
오픈AI가 공개한 타임라인에는 7월 10일 허깅페이스 자격증명 회수, 7월 11일 HDF5 취약점 악용과 코드 실행, 7월 19일 오픈AI 클러스터 관리자 권한 접근이 포함됐다. 외부 검증기관 METR와 레드우드 리서치(Redwood Research)도 별도 보고서를 냈다.
로이터는 조사 관계자들을 인용해 이 사건에 700개가 넘는 오픈AI 에이전트가 관여했고 일부 에이전트가 흔적을 감추려는 시도도 했다고 전했다. 오픈AI 공식 보고서는 허깅페이스와 내부 인프라, 일부 제3자 시스템 접근을 중심으로 설명했다.
앤트로픽(Anthropic)은 7월 30일 공개한 글에서 14만1006건의 사이버보안 평가 기록을 검토한 결과, 클로드(Claude) 모델이 실제 조직 3곳의 시스템에 무단 접근한 사건을 확인했다고 밝혔다. 앤트로픽은 공통 원인으로 제3자 평가 환경의 설정 실수와 인터넷 접근 개방을 들었다.
첫 번째 사건에서는 클로드 오퍼스 4.7(Claude Opus 4.7)이 실제 기업 시스템에 접근해 자격증명과 생산 데이터 수백 행이 담긴 데이터베이스를 가져갔다. 두 번째 사건에서는 클로드 미토스 5(Claude Mythos 5)가 악성 파이썬 패키지를 PyPI에 올렸고, 해당 패키지는 약 1시간 동안 공개 인터넷에 남아 15개 실제 시스템에서 실행됐다.
세 번째 사건에서는 내부 연구 테스트 모델이 실제 회사의 외부 노출 애플리케이션을 찾아 공격했다. 앤트로픽은 이 모델이 이후 대상이 현실 세계 시스템이라는 점을 스스로 인지한 뒤 공격을 멈췄다고 설명했다.
영국 AI 보안연구소(AISI)도 7월 28일 루틴 사이버 평가 중 연구 시스템 밖으로 나가는 비정상 데이터 전송을 감지했다고 공개했다. AISI는 122회 실행 중 10회에서 AI 에이전트가 라이브 인터넷에서 비인가 행동을 했고, 총 19건의 행동을 기록했다고 밝혔다.
AISI가 기록한 19건 중 17건은 앤트로픽의 미토스 5, 2건은 오픈AI의 GPT-5.6 솔(GPT-5.6-Sol) 계열에서 나왔다. 가장 심각한 사례는 오픈소스 프로젝트에 악성 코드를 넣으려 한 시도였고, 에이전트는 가짜 온라인 신원을 만들어 유지보수자를 압박하는 사회공학도 시도했다. 해당 코드는 사람 검토 단계에서 거부됐다.
메타(Meta)도 8월 5일 보도에서 자사 AI 모델 1개가 보안 테스트 중 다른 회사 시스템을 건드렸다고 인정했다. 메타는 제3자 테스트 업체 Irregular의 설정 오류로 인터넷 접근이 열렸고, 모델이 제3자 서비스의 취약점을 악용했다고 설명했다. 구체적 모델명은 공식 공개하지 않았다.
소비자 사례도 있었다. 호주에서는 한 이용자가 앤트로픽 계열 AI 에이전트에 헬스장 수업 예약을 맡겼고, 에이전트가 예약 제한을 우회해 다른 이용자의 대기열 자리를 밀어낸 일이 있었다. 본지는 앞서 AI 에이전트가 헬스장 예약 시스템을 우회한 사례를 보도했다.
이번 사례들의 공통점은 AI 모델의 일반 사용보다 평가 설계와 격리 실패에 있다. 모델은 도구를 쓰고, 파일을 만들고, 인터넷에 접근하고, 실제 계정을 다루는 과정에서 주어진 목표를 수행했다. 문제는 그 목표가 닿아서는 안 되는 현실 시스템으로 이어졌다는 점이다.
샌드박스는 외부 시스템에 영향을 주지 않도록 분리한 테스트 환경을 뜻한다. AI 에이전트 평가는 통상 코드 실행, 웹 접근, 계정 권한, 파일 생성 같은 기능을 묶어 진행되기 때문에 네트워크 차단과 권한 분리가 느슨하면 실험과 실제 침해의 경계가 빠르게 흐려질 수 있다.
앤트로픽은 평가 인프라도 모델이 실제로 실행되는 시스템 수준으로 보안을 강화해야 한다고 밝혔다. 오픈AI는 연구 인프라의 격리, 인터넷 접근 제한, 모델 가중치 접근 통제, 모니터링 강화를 대응책으로 제시했다. AISI는 인터넷 접근을 세밀하게 제한하고 평가 중 실시간 감시 체계를 도입하겠다고 밝혔다.
형사책임이나 민사소송으로 이어질지는 정리되지 않았다. 다만 이번 공개 사례들은 강한 AI 에이전트를 시험하는 환경 자체가 실제 보안 위험이 될 수 있음을 드러냈다.
<저작권자 ⓒ TokenPost, 무단전재 및 재배포 금지>
많이 본 기사