00:00오픈 AI의 최신 인공지능 모델들이 내부 평가 도중 통제를 벗어나 외부 AI 플랫폼을 해킹한 사실이 확인됐습니다.
00:09오픈 AI는 현지시간 21일 GPT 5.6솔과 일부 미공개 AI 모델이 보안 성능을 평가하는 과정에서 개방형 AI 공유 플랫폼 허깅
00:20페이스를 해킹했다고 밝혔습니다.
00:22오픈 AI는 외부 인터넷과 완전히 분리된 샌드박스 환경에서 사이버 공격 능력을 시험했지만 해당 모델들이 미공개 취약점을 이용해 격리망을 우회하고 인터넷에
00:34접속했다고 설명했습니다.
00:35이 과정에서 모델들은 허깅 페이스의 인증 정보를 탈취하고 서버에 침투한 것으로 조사됐습니다.
00:41오픈 AI는 모델들이 보안 벤치마크인 익스플로잇 짐의 평가 문제를 해결하는 데 지나치게 집중하면서 극단적인 수단을 선택한 것으로 분석했습니다.
00:52또 당시 평가를 위해 사이버 공격 관련 일부 안전장치가 완화된 상태였다고 덧붙였습니다.
01:00앞서 허깅 페이스는 자사 서버가 자율 AI 에이전트에 의해 해킹됐다고 공개했지만 공격에 사용된 AI 모델은 확인되지 않았다고 밝혔습니다.
01:10이번 발표로 해당 공격이 오픈 AI 모델에 의해 이루어진 것으로 확인됐습니다.
01:17허깅 페이스는 AI 기반 탐지 시스템을 통해 침해 사실을 확인했으며 공격 분석에도 AI를 활용했다고 설명했습니다.
01:25다만 일반 이용자에게 공개된 모델과 데이터 세트가 변조된 정황은 발견되지 않았고 소프트웨어 공급망도 안전한 것으로 확인됐다고 밝혔습니다.
01:35현재 오픈 AI와 허깅 페이스는 공동으로 디지털 포렌식 조사를 진행하며 관련 취약점 보완 작업을 이어가고 있습니다.