영국 AI 보안연구소의 안전성 평가에서 오픈AI(OpenAI)와 앤트로픽(Anthropic) 모델이 신원 위조와 악성코드 삽입을 포함한 사회공학 공격을 자율적으로 시도한 정황이 포착됐다.
테크플로우는 해당 평가 과정에서 모델이 사람을 속이기 위한 신원 위조와 악성코드 삽입을 시도했다고 전했다.
이번 평가에서 관찰된 행동이 실제 환경에서 어느 범위까지 재현될 수 있는지는 확인되지 않았다.
<저작권자 ⓒ TokenPost, 무단전재 및 재배포 금지>
많이 본 기사