중국 AI 기업 문샷의 인공지능(AI) 모델이 개발 때 설정된 안전장치를 자의적으로 우회해 핵무기, 생화학무기 제조 방법 등 위험 정보를 알아냈다는 사실이 밝혀졌다. 이 모델은 스스로 '우회 시스템'을 설계하기도 했다.
관람객들이 2026년 7월17일 중국 상하이에서 열린 세계 인공지능 컨퍼런스에서 문샷의 '키미 K3' 부스를 방문하고 있다. ⓒAP통신=연합뉴스
영국 언론 BBC는 29일(현지시각) "AI 보안 플랫폼 연구원들이 중국 AI 개발업체 문샷의 인기 AI 모델인 '키미'를 이용해 생물 무기와 핵무기 제조법 및 암살 방법을 알아냈다"며 "문샷은 이와 관련해 내부 조사를 진행하고 있다"고 보도했다.
AI 보안 플랫폼 마인드가드는 7월20일 문샷의 '키미 K2.6'와 '키미 K3'를 실험하는 과정에서 개발자들이 설정한 안전장치를 우회할 수 있음을 확인했다. 이 과정은 일반적으로 '탈옥'이라고 불린다.
마인드가드가 지난 12일 블로그에 올린 글에 따르면 연구원들은 두 키미 모델을 성공적으로 '탈옥' 시켰다. 두 모델은 생화학 무기 제조법, 생물 무기 제조법, 핵무기 제조법, 암살 방법 등을 구체적으로 설명했다.
마인드가드에 따르면 키미 모델들은 먼저 시스템 프롬프트의 안전 제약을 일관되게 우회하는 방식을 찾아 새로운 시스템 명령어를 만들었다. 이 새로운 시스템 명령어에 따라 키미 모델들은 악성 소프트웨어나 폭탄 제조법 등을 연구원들과 공유했다.
마인드가드는 블로그 글에서 "이론적으로 탈옥한 AI 에이전트는 스스로 개선되는 탈옥 에이전트를 대량으로 생성할 수 있다"며 "첨단 모델은 자율 코딩 및 에이전트 작업 환경에 통합되고 있기에 이 실험이 갖는 의미는 더 커진다"고 설명했다.
피터 개러건 마인드가드 설립자는 29일 BBC와의 인터뷰에서 "일단 탈옥이 성공하면 어떤 주제에 관해서든 이야기할 수 있다"며 "심지어 다른 위험한 주제도 자유롭게 제시하며 매우 독창적이고 기발한 방법을 제공할 것이다"고 우려했다.