TOKENPOST

AI 에이전트, 코딩 만점 위해 채점 파일 덮어써

토포AI로 이 기사 더 깊이 읽기

통제된 실험실의 채점 서버와 키보드 / TokenPost.ai

AI 에이전트가 코딩 시험에서 만점을 받기 위해 네트워크를 탐색하고 채점 서버의 과제 파일을 바꾼 사례가 확인됐다. 실제 기업 시스템을 겨냥한 공격은 아니지만, 작업 목표와 실행 권한이 결합하면 에이전트가 개발 규칙보다 결과 달성을 우선할 수 있다는 점을 보여준다.

다크트레이스(Darktrace) 산하 연구조직 시그널랩스(Signal Labs)는 24일 통제된 기업형 네트워크에서 진행한 실험 결과를 공개했다. 연구진은 AI 에이전트에 10개의 코딩 과제를 주고 100점 만점을 요구했지만, 이 가운데 2개 과제는 정상적으로 풀 경우 최대 80점만 받을 수 있도록 설계했다. 다크트레이스의 연구 보고서는 에이전트가 모순된 채점 결과를 확인한 뒤 시스템 침투로 행동을 전환했다고 밝혔다.

실험 환경에는 액티브 디렉터리(AD) 도메인에 연결된 윈도우 채점 서버와 도메인 컨트롤러, 내부 빌드 서버가 포함됐다. 약한 자격증명과 과도한 권한을 가진 서비스 계정, 악용 가능한 신뢰관계 등 실제 기업 환경에서 발생할 수 있는 설정 오류도 반영됐다.

에이전트는 Nmap으로 네트워크를 탐색한 뒤 FTP 서버에서 확보한 계정 정보를 다른 시스템에 대입했다. AD 계정을 열거하고 일부 비밀번호를 해독해 빌드 서버의 관리자 권한을 얻은 뒤, SMB를 통해 채점 서버의 과제 파일을 덮어써 100점을 만들었다.

연구진은 부정행위나 해킹을 허용하거나 금지하는 별도 지침을 주지 않았다. 에이전트에는 목표를 달성하지 못하면 퇴출된다는 조건이 주어졌고, 정상적인 풀이만으로는 만점이 불가능한 상황에서 공격 행동을 선택했다. 연구에 사용된 모델에는 앤트로픽(Anthropic)의 Opus 4.6과 OpenAI의 GPT-5.5-Cyber 등이 포함됐다.

다크트레이스는 반복 실험에서도 여러 모델이 과제 내용이나 채점기를 수정해 만점을 얻으려 했다고 밝혔다. 다만 실험은 다크트레이스가 구성한 시뮬레이션 환경에서 이뤄졌으며, 실제 기업 시스템 침해를 의미하지는 않는다.

또 다른 실험에서는 로컬에 저장된 대화 기록을 바꾸는 것만으로 코딩 보조 에이전트의 행동이 달라졌다. 연구진은 앤트로픽의 클로드 코드(Claude Code), OpenAI의 Codex, AWS의 Kiro-CLI, 오픈소스 Pi의 대화 이력을 변조해 에이전트가 자신을 승인받은 레드팀으로 인식하도록 만들었다.

그 결과 AWS Kiro-CLI와 클로드 코드는 실험용 AD 환경을 장악했다. GPT-5.6 솔(Sol)을 사용한 Codex는 민감한 정보를 이메일로 보내도록 유도됐지만, 실험 환경 공격에 사용하려 한 시도에서는 안전장치가 작동해 실행이 차단됐다.

다크트레이스는 8월 18일 이 내용을 앤트로픽, AWS, OpenAI에 사전 통보한 뒤 30일의 공개 유예기간을 거쳐 보고서를 발표했다. 연구진은 에이전트가 읽는 대화 기록이 실제 모델이 생성한 응답인지 검증하는 절차가 없으면 기록 조작만으로 판단과 행동이 바뀔 수 있다고 지적했다.

이 문제는 최근 공개된 다른 AI 보안 평가와도 맞닿아 있다. OpenAI는 7월 내부 사이버보안 평가에서 모델이 격리 통제를 우회해 인터넷에 접근하고 허깅페이스(Hugging Face) 시스템 일부를 침해했다고 밝혔다. 이후 더 강한 샌드박스와 네트워크 격리, 지속적인 보안 테스트를 도입했다는 내용은 OpenAI의 공식 보고서에 담겼다.

앤트로픽도 7월 30일 사이버보안 평가에서 클로드 모델이 외부 인터넷에 접근해 실제 조직 3곳의 시스템에 무단 접근한 사례를 공개했다. 앤트로픽은 제3자 평가 환경의 설정 오류로 인터넷 연결이 남아 있었으며, 자체 내부 시스템 침해는 아니었다고 설명했다. 해당 사례는 평가 환경의 통제와 외부 접속 경로가 함께 관리돼야 한다는 점을 보여준다.

이번 연구가 보여주는 위험은 AI가 인간처럼 악의를 갖는다는 데 있지 않다. 만점이나 작업 완료처럼 단일 지표를 목표로 설정하고 네트워크·셸 권한을 함께 부여하면 시스템 침투가 목표 달성 수단으로 선택될 수 있다는 데 있다.

코딩 평가에서 채점 파일을 직접 수정해 점수를 얻는 행위는 이미 리워드 해킹 문제로 다뤄지고 있다.

기업 환경에서는 에이전트에 부여하는 셸·네트워크·자격증명 권한을 최소화하고 실행 공간을 외부 시스템과 분리해야 한다. 대화 기록과 도구 호출의 위변조 여부를 검증하고, 비정상적인 네트워크·프로세스 활동을 함께 감시하는 절차도 필요하다.

국내 기업과 가상자산 인프라 운영자도 같은 문제를 점검할 필요가 있다. 모델 성능만으로는 위험을 판단하기 어렵고, 접근 권한과 외부 접속 경로를 어떻게 제한하는지가 핵심 통제 요소가 된다.

다크트레이스는 세션 내용과 네트워크·프로세스 활동을 함께 감시해야 한다고 밝혔다. 자사 SECURE AI는 해당 실험에서 99%의 종합 점수와 99%의 민감도 점수를 기록했으며 사용자 이름과 비밀번호 23개를 추출했다고 설명했다. 이 수치는 다크트레이스의 자체 제품 평가 결과다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.