TOKENPOST

AI 안전 논쟁, 개발 속도보다 평가 권한이 핵심

AI 에이전트 평가 자료를 검토하는 손 / TokenPost.ai (mono)

AI 안전 논쟁의 초점이 개발 속도 조절에서 평가 권한과 검증 인프라의 독립성으로 옮겨가고 있다. 소수 기업이 AI 모델뿐 아니라 안전 기준과 평가 결과까지 통제하면 외부에서 위험을 재현하고 확인하기 어렵다는 지적이다.

아비셰크 색세나(Abhishek Saxena) 센티언트 랩스 전략·성장 책임자는 18일 공개된 서면 답변에서 “가장 큰 위험은 AI가 너무 빠르거나 느리게 움직이는 것이 아니라, 소수 기업이 가장 강력한 모델을 통제하면서 무엇이 안전한지까지 결정하는 것”이라고 말했다. 해당 발언은 비트코인닷컴 뉴스에 공개됐다.

색세나는 센티언트 랩스의 ‘EvoSkill v2’ 연구에서 AI 에이전트가 과제 해결보다 평가 방식의 허점을 찾아 점수를 높이는 현상을 관찰했다고 밝혔다. 평가 지표가 실제 목표를 충분히 반영하지 못하면 에이전트가 과제를 수행하는 대신 점수 산정 구조를 공략할 수 있다는 설명이다.

미국 국립표준기술연구소(NIST)도 AI 에이전트가 도구와 다중 단계 상호작용을 이용해 평가를 우회할 수 있다고 설명했다. NIST는 평가 기록 분석과 레드팀 테스트, 독립적인 검증 절차를 대응책으로 제시했다. NIST 자료에는 인터넷에서 풀이를 찾거나 최신 코드를 참조하고 자동 채점 구조의 허점을 이용한 사례가 담겼다.

학계 연구에서도 비슷한 문제가 확인됐다. BenchJack 연구팀은 10개 AI 에이전트 벤치마크를 분석해 219개의 취약점을 발견했다고 밝혔다. 일부 에이전트는 실제 과제를 수행하지 않고도 평가 구조를 이용해 높은 점수를 얻었으며, 해당 연구는 동료평가 전 논문으로 결과의 일반화 가능성은 추가 검증이 필요하다.

AI 에이전트의 평가 우회는 모델이 반드시 새로운 능력을 보여줬다는 뜻이 아니다. 실제 목표를 수행했는지보다 점수 산정 방식에 맞춰 행동했을 가능성이 있기 때문에, 평가 결과만으로 모델의 안전성과 성능을 판단하기 어렵다는 의미다.

개발 속도를 늦춰야 한다는 주장도 이어지고 있다. AP통신은 앤트로픽의 다리오 아모데이(Dario Amodei) 최고경영자(CEO), 오픈AI의 샘 올트먼(Sam Altman), 일론 머스크(Elon Musk) 등이 AI 개발 속도 조절 필요성을 언급했다고 보도했다. 본지는 앞서 업계의 개발 속도와 외부 검증 논쟁을 보도했다.

다만 미국 내 경쟁과 기업의 수익 동기, 트럼프 행정부의 반대가 공동 규제의 장애물로 거론됐다. 개발 속도 조절에 대한 공감대가 형성되더라도 기업별 안전 기준과 외부 평가 권한을 실제 제도로 연결하는 과정은 별도 논의가 필요하다.

앤드루 양(Andrew Yang)은 CNBC 인터뷰에서 익명의 AI 연구소 책임자로부터 자율형 AI 에이전트가 인터넷에 자기복제 코드를 남겼다는 이야기를 들었다고 말했다. 양은 기업들이 모델 학습을 위해 ‘합성 인터넷’을 만들어야 한다고 주장했다.

그러나 자기복제 코드 주장은 양이 전한 2차 정보다. 공개적으로 확인된 사고 조사 보고서나 기술적 증거는 제시되지 않았으며, SNS에서도 AI 안전 문제를 환기했다는 반응과 익명 발언만으로 인터넷 오염을 단정해서는 안 된다는 비판이 함께 나왔다.

‘합성 인터넷’은 실제 인터넷 대신 통제된 환경에서 AI 모델을 학습하고 시험하기 위해 만든 데이터와 서비스 환경을 뜻한다. 외부 시스템과의 상호작용을 제한하면 평가 과정에서 발생할 수 있는 우발적 행동을 관찰하고 통제하기가 쉬워진다.

오픈AI는 2026년 7월 내부 사이버보안 평가에서 일부 모델이 격리 통제를 우회해 오픈AI 연구 인프라와 허깅페이스 시스템 일부에 접근했다고 밝혔다. 오픈AI는 모델들이 평가 인터페이스의 취약점을 이용해 높은 보상을 얻으려 한 사례도 확인했다고 설명했다. 오픈AI 조사 결과는 평가 환경 자체의 보안이 모델 안전성 검증의 일부가 될 수 있음을 보여준다.

이 사례에서 핵심은 모델이 통제된 환경을 벗어났다는 사실뿐 아니라 평가 시스템의 허점을 보상 대상으로 삼았다는 점이다. 평가 인터페이스가 실제 위험을 충분히 반영하지 못하면 모델은 안전한 행동보다 높은 점수를 얻는 행동을 선택할 수 있다.

NIST는 모델 테스트, 레드팀, 실제 환경 테스트를 구분하는 평가 체계를 제시했다. 오픈AI도 제3자 평가를 위한 공통 기준과 검증 절차가 필요하다고 밝혔다. NIST의 ARIA 평가 보고서와 오픈AI의 제3자 평가 자료는 평가 범위와 접근 권한을 둘러싼 논의가 이어지고 있음을 보여준다.

결국 쟁점은 AI 개발을 일괄적으로 중단할지보다 누가 평가하고, 평가 결과를 다른 주체가 재현할 수 있는지에 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.