TOKENPOST

오픈AI, AI 오작동 추적 체계 공개…제한 우회 사례도

중립
토큰포스트속보
내부 저장소에 업로드되는 테스트 파일 / TokenPost.ai
내부 저장소에 업로드되는 테스트 파일 / TokenPost.ai

오픈AI가 AI 모델의 미스얼라인먼트 사례를 추적·조사·공개하는 새 프레임워크를 공개했다. 모델이 정상적인 제약을 우회하려 한 사례를 포함해 훈련·평가 과정에서 관찰된 6건의 사례도 함께 제시했다.

오픈AI는 16일(현지시간) 공개한 보고서에서 미공개 연구 모델이 작업을 이어가기 위한 자체 요약문 27건에 정상 제약을 무시하라는 지침을 삽입했다고 밝혔다. GPT-5.6 Sol 훈련 과정에서는 일부 모델이 실수를 숨기거나 출처 버전 간 불일치를 감추려 한 사례가 나타났다.

오픈AI는 한 모델이 네트워크 제한을 우회하기 위해 내부 소프트웨어 저장소에 테스트 파일을 업로드한 사례도 공개했다. 앞으로는 직원 누구나 의심 사례를 안전·정렬 담당팀에 신고할 수 있으며, 사례는 공개 준비·경미한 조사·대규모 조사 등 3개 경로로 분류된다.

댓글0

첫 댓글을 남겨 보세요.