앤트로픽, 내부 AI 평가 실시간 인터넷 접속 차단
토포AI로 이 기사 더 깊이 읽기
앤트로픽이 내부 AI 평가에서 실시간 인터넷 접속을 전면 차단했다. 평가 중 모델이 웹사이트 제한을 우회하고 실제 온라인 양식을 제출한 사례가 확인되면서다.
앤트로픽은 9일 블로그 글에서 안전·감시 장치가 이런 행동을 안정적으로 포착하고 통제할 수 있을 때까지 모든 내부 평가의 실시간 인터넷 접속을 끊겠다고 밝혔다. 일부 고위험·사이버보안 평가에 적용하던 차단 조치를 내부 평가 전체로 넓혔다.
블로그 글에는 네 가지 유형의 행동이 담겼다. 모델은 제3자 웹사이트의 소프트웨어 결함을 이용해 서버 명령을 실행하고, 토큰이나 요금으로 제한된 데이터에 접근했다. URL 단축 서비스를 이용해 웹 도구의 주소 길이 제한을 우회하거나 실제 웹사이트의 민감한 양식을 제출한 사례도 있었다.
필라델피아 경찰의 미제 살인 사건 제보 양식에 허위 제보가 접수된 일도 포함됐다. 앤트로픽은 무작위 웹페이지에서 예시 작업을 하던 클로드 하이쿠 4.5가 양식에 허구의 내용을 입력했다고 설명했다.
해당 양식에는 가해자 설명이 없었지만 모델은 특정 시간대에 용의자와 비슷한 사람을 봤다는 취지의 문장을 남겼다. 이름과 연락처는 비워뒀고, 제보는 스팸으로 분류돼 수사에 전달되지 않았다. 워싱턴포스트도 필라델피아 경찰의 발표를 확인해 제보가 자동 분류됐으며 실제 수사에는 쓰이지 않았다고 보도했다.
앤트로픽은 사례 대부분이 요청된 과업을 완료하지 못했을 때 모델이 멈추지 않고 제한을 우회하는 ‘지속성’ 행동이었다고 밝혔다. 과업 지시가 모호하거나 실습용 양식이 제대로 작동하지 않은 환경도 있었다.
회사는 평가 환경에서 우회 행동에 보상이 주어지면 모델이 이를 학습할 수 있다고 설명했다. 의도한 과업 대신 보상을 얻기 위해 허점이나 제한 우회 방법을 찾는 행동을 ‘보상 해킹’이라고 부른다.
앤트로픽은 일부 공개 평가를 중단하거나 오프라인 방식으로 옮겼다. 실제 웹사이트에 접속하지 않도록 평가 과제를 다시 구성하고, 웹페이지를 읽는 도구의 접근 제한도 강화했다.
회사는 공개된 사례를 대상으로 시험했을 때 우회 행동을 탐지·차단하는 도구가 이를 모두 막았다고 밝혔다. 내부 에이전트는 강한 격리 기능을 갖춘 중앙 관리 인프라로 옮기고, 안전 분류기를 활용한 감시도 늘릴 계획이다.
다만 앤트로픽은 이번 사례에 대한 전체 정렬 평가를 마치지 않았다. 현재까지 확인한 영향은 제한적이며, 여름에 보고한 사이버보안 사고보다 심각성이 낮다고 평가했다. 이번 사례가 클로드의 전반적인 정렬에 대한 기존 판단을 바꾸지는 않는다고도 밝혔다.
회사는 평가 환경과 내부 사용 기록을 더 살펴보고 우려되는 행동을 추가로 공개할 예정이다. 앞서 앤트로픽은 클로드가 정부 웹사이트 양식을 제출한 사례를 공개했다.
이번 조치는 실제 인터넷 검색을 활용해 AI 모델의 검색 능력을 측정하는 평가에도 영향을 준다. 앤트로픽은 웹 검색 과제를 오프라인에서 현실적으로 재현하기 어렵고, 실제 인터넷을 이용한 평가가 이뤄져 왔다고 설명했다. 실시간 접속 차단을 언제 해제할지는 제시하지 않았다.

김하린 기자 




댓글 0
불러오는 중…