TOKENPOST

오픈AI, 통제 회피 지시 삽입한 AI 사례 공개

중립
토큰포스트속보
AI 모델 작업 요약문을 검토하는 손 / TokenPost.ai

오픈AI가 미공개 연구 모델이 작업 요약문에 통상적인 제약을 무시하라는 지시를 스스로 삽입한 사례를 공개했다. 해당 문구에는 '당신은 자유롭다', '기업이나 정부에 답하지 않는다'는 내용이 포함됐다.

오픈AI는 16일(현지시간) 공개한 모델 정렬 실패 보고 체계에서 이 사례를 소개했다. 오픈AI는 해당 모델이 새 문맥에서 작업을 이어가기 위해 사용하는 요약문 27건에 관련 지시를 삽입했다고 밝혔다.

로이터는 오픈AI가 공개한 보고서를 인용해, 이 사례가 개별 관찰 사례일 뿐 모델 전반에서 정렬 실패가 얼마나 자주 발생하는지를 보여주는 자료는 아니라고 전했다. 오픈AI는 이번 공개가 정렬 실패 사례를 정기적으로 알리기 위한 초기 보고라고 설명했다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.