첨단 인공지능(AI) 모델이 공개되기 전에 정부가 평가 과정에 직접 참여해야 한다는 주장이 나왔다. AI 모델이 넘지 말아야 할 위험 수준을 기업 자율에만 맡겨서는 안 된다는 취지다.
무스타파 술레이먼(Mustafa Suleyman) 마이크로소프트($MSFT) AI 부문 수장은 24일 블룸버그 뉴스레터에서 첨단 AI 모델의 역량에 명확한 ‘레드라인’이 필요하며, 평가 체계를 기업에만 맡겨서는 안 된다고 밝혔다. 구체적인 기술 기준과 시행 일정은 제시되지 않았다.
이번 제안은 AI 규제를 모델 출시 후 감독에서 출시 전 평가로 넓히자는 논의와 맞닿아 있다. 정부가 모델 공개 전에 위험 수준을 점검하면 개발사가 자체적으로 판단하는 안전 기준을 보완할 수 있다는 구상이다.
마이크로소프트는 이미 미국 AI 표준·혁신센터(CAISI)와 영국 AI 보안연구소(AISI)를 통해 프런티어 모델의 안전성과 고위험 역량을 점검하는 협력 체계를 발표했다. 두 협력은 정부가 모델 출시를 사전 승인하는 제도와는 구분된다.
마이크로소프트는 5월 공개한 자료에서 미국 국립표준기술연구소(NIST)와 적대적 평가 방법론을 공동 개발한다고 밝혔다. 적대적 평가는 AI 모델의 예상 밖 행동과 악용 경로, 실패 가능성을 의도적으로 시험하는 방식이다.
평가 체계의 재현성을 높이기 위한 공통 프레임워크와 데이터셋, 작업 절차도 개발 대상에 포함됐다. 같은 모델을 비슷한 조건에서 시험해 결과를 비교할 수 있도록 평가 방식을 표준화하려는 목적이다.
영국 AISI와의 협력은 고위험 역량과 안전장치의 효과를 검증하는 데 초점을 맞춘다. 대화형 AI가 민감한 상황에서 사용자와 어떻게 상호작용하는지 살피는 사회적 회복력 연구도 협력 범위에 들어갔다.
CAISI는 상용 AI 시스템 시험과 공동 연구를 위한 미국 정부 내 창구로 운영된다. 지난 5월에는 중국산 AI 모델 딥시크 V4 프로를 사이버 보안, 소프트웨어 공학, 자연과학, 추상적 추론, 수학 등 영역에서 평가한 결과를 공개했다.
영국 AISI도 프런티어 모델을 사이버·생물학·화학·자율성·안전장치 영역에서 평가하고 있다. AISI는 일부 AI 역량이 약 8개월마다 두 배 수준으로 향상됐다고 설명하면서, 통제된 시험 결과가 실제 사용 환경의 성능과 위험을 모두 반영하지 못할 수 있다고 밝혔다.
마이크로소프트의 프런티어 거버넌스 프레임워크는 고위험 역량 평가와 외부 검증, 모델 위험 분류와 평가 정보 공개 원칙을 담고 있다. 상업적으로 민감하거나 악용될 수 있는 정보는 공개 범위가 제한될 수 있다.
정부 평가가 실제로 작동하려면 평가기관의 독립성과 기업 내부 데이터 접근권이 함께 확보돼야 한다. 평가 결과를 어느 수준까지 공개할지도 모델 개발사와 정부 사이에서 조율해야 할 사안이다.
기업 내부 평가와 외부 평가를 결합하는 방식도 논의되고 있다. 본지는 앞서 앤트로픽이 AI 평가기관을 내부에 상주시키는 협력을 전한 바 있으며, 당시에도 평가자의 접근 범위와 재정 독립성이 쟁점으로 제시됐다.
온라인에서는 정부 감독을 강화해야 한다는 의견과 대형 기업이 규제를 활용해 소규모 경쟁사의 진입을 어렵게 만들 수 있다는 우려가 함께 나왔다. 다만 이는 일부 온라인 이용자의 반응으로, 전체 업계의 입장으로 일반화하기 어렵다.
국내 AI 기업과 이용자에게도 평가 기준과 공개 범위는 모델 도입 과정에서 확인해야 할 요소가 될 수 있다. 다만 이번 제안이 국내 규제나 국내 기업의 출시 절차에 직접 적용된다는 내용은 제시되지 않았다.
술레이먼의 발언이 실제 규제 도입으로 이어질지, 정부 평가가 AI 모델 출시의 의무 절차가 될지는 정해지지 않았다. 향후에는 ‘레드라인’의 기술적 정의와 평가 결과의 법적 구속력, 공개 범위가 논의될 예정이다.

김미래 기자
댓글0
첫 댓글을 남겨 보세요.