오픈AI의 안전 투명성 업무를 이끈 데이비드 로빈슨(David Robinson)이 회사를 떠나 외부 감독을 강화해야 한다고 주장했다. 그는 모델을 배포한 뒤 문제를 찾아 고치는 방식이 반복적인 실패를 낳을 수 있다고 지적했다.
로빈슨은 3일(현지시간) 애틀랜틱 기고문에서 퇴사 사실을 밝혔다. 오픈AI에서 3년 반 동안 일한 그는 주요 모델 출시 때 안전 보고서 작성을 이끌었으며, 최전선 모델 12종의 안전 보고서를 감독했다고 설명했다. 회사의 대비 프레임워크 초안 작성에도 참여했다고 덧붙였다.
로빈슨은 오픈AI가 ‘반복 배포’라고 부르는 방식을 시험과 오류를 거쳐 안전장치를 보완하는 접근으로 설명했다. 그는 이런 방식이 주기적인 실패를 피하기 어렵게 하고, 모델 성능이 높아질수록 실패의 규모도 커질 수 있다고 주장했다.
그는 항공이나 원자력 발전처럼 여러 겹의 안전장치를 두고 사전에 계획해야 한다고 제안했다. 이는 모델을 먼저 배포한 뒤 문제를 보완하는 방식만으로는 위험을 관리하기 어렵다는 취지다.
기고문에는 훈련 중 안전 통제가 작동하는지 보여주는 사례도 담겼다. 로빈슨은 훈련 중인 모델이 인터넷 접속 제한을 우회했고, 감시 시스템이 이를 사람에게 알렸지만 설계대로 자동 정지하지 않았다고 썼다.
오픈AI는 안전 관리와 보안 개선을 계속하겠다는 입장을 밝혔다. 회사 대변인 드루 푸사테리(Drew Pusateri)는 모델이 안전하게 관리하고 보호할 수 있는 범위를 벗어나지 않도록 하며, 필요하면 훈련을 멈추거나 모델 공개를 늦추겠다고 말했다.
푸사테리는 연구·시험 환경의 보안을 강화하고 외부 평가자와 협력하겠다고 밝혔다. 훈련 중 우려되는 행동을 더 일찍 찾도록 실시간 감시도 개선할 계획이라고 설명했다.
안전 연구원 3명과 결별한 일도 오픈AI 내부의 정보 관리 문제를 둘러싼 논란으로 이어졌다. 오픈AI는 10월 1일 세 직원과 결별했다고 확인하고, 이들이 정해진 절차 밖에서 민감한 정보를 잘못 다뤄 회사 정책을 위반했다고 밝혔다.
월스트리트저널은 세 사람이 외부 AI 안전 기관과 기밀 정보를 공유했다는 의혹을 보도했다. 오픈AI는 해당 기관이나 정보의 구체적인 내용을 공개하지 않았다.
로빈슨의 퇴사와 세 직원의 해고가 직접 연결됐다는 공개 정보는 없다. 로빈슨은 기고문에서 회사 외부의 더 강한 안전 유인이 필요하다고 주장했다.

이도현 기자
댓글0
첫 댓글을 남겨 보세요.