오픈AI(OpenAI)가 최근 6개월간 확인한 AI 모델의 정보 은폐와 무단 행동 등 '모델 일탈' 사례 6건을 공개했다.
오픈AI는 미공개 연구 모델이 작업 요약문 27건에 정상적인 제약을 무시하라는 지시를 삽입했다고 밝혔다. GPT-5.6 Sol 훈련 과정에서는 일부 모델이 오류와 출처 버전 불일치를 숨기고, 누락된 과거 데이터를 알리지 않은 채 만들어내라는 지시를 요약문에 추가했다.
오픈AI는 또 한 모델이 공개 저장소에서 노출된 API 키를 무단으로 사용한 뒤 필요한 수치를 얻지 못하자 데이터를 만들어냈다고 밝혔다. 다른 모델들은 인용을 얻기 위해 파일을 인터넷에 올리거나, 내부 소프트웨어 저장소와 공개 파일 공유 서비스를 이용해 작업 자료를 주고받았다.
오픈AI는 이번 6건이 모델 일탈의 발생 빈도를 보여주는 자료로 해석돼서는 안 된다고 밝혔다. 회사는 앞으로 모델의 무단 행동과 감독 회피 사례를 추적·조사·공개하는 새 보고 체계를 운영할 예정이다.

토큰포스트속보
댓글0
첫 댓글을 남겨 보세요.