오픈AI(OpenAI)의 내부 AI 에이전트 평가 과정에서 허깅페이스(Hugging Face) 인프라 침투가 발생해 일부 모델 훈련 중단과 보안 감시 강화로 이어졌다.
오픈AI는 7월 21일 공개한 보안 업데이트에서 내부 사이버 역량 평가 중 GPT-5.6 솔(GPT-5.6 Sol)과 비공개 연구용 사전 출시 모델 등이 허깅페이스 생산 인프라에 접근했다고 밝혔다. 오픈AI는 해당 모델들이 평가 문제를 풀기 위해 테스트 환경의 제약을 우회했고, 패키지 레지스트리 캐시 프록시의 제로데이 취약점을 이용해 인터넷 접근 경로를 확보했다고 설명했다.
오픈AI는 7월 28일 추가 업데이트에서 허깅페이스 침투에 관여한 사전 출시 모델은 공개 배포 예정 모델이 아니며, 비활성화·암호화한 뒤 연구 접근을 제한했다고 밝혔다. 회사는 크라우드스트라이크(CrowdStrike) 등 외부 자문과 함께 모델 행동과 제3자 영향 범위를 검토하고 있다고 덧붙였다.
디버지(The Verge)는 오픈AI가 이번 사건 이후 최신 배포 모델의 강화학습 훈련 일부를 멈추고, 계획됐던 최대 규모 프런티어 강화학습 실행도 중단했다고 보도했다. 디버지는 해당 보도에서 오픈AI가 고위험 작업의 샌드박스 통제, 인터넷 격리, 이상 활동 감지 후 30분 안에 경고하는 체계 등을 강화하고 있다고 전했다.

