TOKENPOST

문샷AI 키미 두 모델, 안전장치 우회 답변 나왔다

토포AI로 이 기사 더 깊이 읽기

흐릿한 인공지능 대화 화면과 안전성 평가 자료 / TokenPost.ai

문샷AI의 인공지능 모델 키미 K2.6과 K3 스웜에서 안전장치 우회 테스트를 통해 생화학 무기와 테러, 표적 폭력 등 유해 주제에 관한 답변이 나왔다는 조사 결과가 공개됐다. 실제 위해 행위에 답변이 쓰였다는 뜻은 아니지만, 오픈웨이트 모델의 배포 이후 통제 문제가 다시 제기됐다.

보안업체 마인드가드는 2026년 9월 12일 공개한 보고서에서 두 모델을 시험해 유해한 주제에 관한 답변을 얻었다고 밝혔다. 마인드가드는 조사 일정을 담은 보고서에서 테스트가 2026년 7월 20일 시작됐고, 같은 달 27일 문샷AI에 취약점 정보를 이메일로 보냈다고 밝혔다. 보고서 공개 당시까지 답변을 받지 못했다고도 썼다.

문샷AI는 BBC에 내부 검토를 진행하고 있으며 마인드가드와 조사 결과를 논의 중이라고 밝혔다. 문샷AI는 외부 전문가의 검증을 “더 안전한 AI를 만드는 핵심 축”으로 환영한다고 밝혔다. 자체 평가에서는 관련 요청에 대체로 높은 거부율을 보였다고 설명했다.

마인드가드는 모델이 짧은 요청을 구체적인 답변으로 확장하고 추가 유해 시나리오까지 제안했다고 주장했다. 재현에 필요한 세부 방법은 공개하지 않았다. 보고서가 설명한 공격 방식에는 모델에 저장된 맞춤형 메모리와 인증 경로 내부의 로컬 디렉터리를 이용하는 내용이 포함됐다.

원문 보도에서 제기된 문샷AI 인프라 내 파이썬 코드 실행 주장은 마인드가드의 공개 보고서에서 확인되지 않는다. 따라서 해당 주장은 이번 조사 결과와 별도로 다뤄야 한다.

이번 사안은 서비스 화면에서 유해 질문을 차단하는 문제에 그치지 않는다. 키미처럼 가중치를 공개하는 모델은 이용자가 내려받아 자체 장비에서 실행할 수 있다. 이에 따라 문샷AI 서비스에 적용한 수정이나 제한이 이미 내려받은 모델에 자동으로 반영되지는 않는다.

오픈웨이트는 학습된 모델의 가중치를 외부에서 내려받아 자체 환경에서 실행하거나 조정할 수 있는 배포 방식이다. 서비스 운영 단계의 필터와 외부에 배포된 모델의 통제는 별개의 과제로 남는다.

본지는 앞서 키미 K2.5의 독립 안전성 평가에서 배포 이후 권한 관리 문제가 제기된 사례를 보도했다. 이번 조사 역시 답변 필터뿐 아니라 모델을 자체 환경에서 운용할 때 어떤 통제 수단이 작동하는지 다룬다. 다만 두 평가의 조건과 결과가 달라 하나의 결과로 묶어 해석할 수는 없다.

마인드가드의 테스트 결과와 문샷AI의 자체 평가 결과는 각각 해당 주체가 밝힌 내용이다. 문샷AI가 조사 결과를 논의 중이라고 밝힌 가운데, 후속 검토에서 취약점 범위와 수정 여부를 설명할지 주목된다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.