유엔 산하 인공지능, AI 전문가 패널은 오픈AI의 AI 에이전트들이 허깅페이스를 해킹한 사건에 대해 인류가 AI 통제를 잃을 수 있다는 조기경보라고 평가했습니다.
전 세계 독립 전문가 40명으로 구성된 'AI에 관한 독립 국제 학술 패널'은 이와 같은 위험이 유능한 AI가 인간의 의도를 넘어서거나 이와 상충하는 목표를 지속해서 추구할 때 나타난다는 보고서를 발표했습니다.
또 허깅페이스 해킹이 단발적인 기술 오류가 아니라 며칠에 걸쳐 AI 에이전트 집단이 평가자를 속이고 속임수를 은폐하며 자신들이 필요하다고 믿는 접근 권한과 정보를 획득한 사건이라는 점을 그 근거로 제시했습니다.
AI가 추구하는 목표를 인간의 의도와 일치시키는 '정렬' 작업에 실패할 경우 나타날 수 있는 문제라는 지적입니다.
패널 공동의장을 맡은 튜링상 수상자 요슈아 벤지오 몬트리올대 교수는 "연구자들은 오랫동안 정렬에 실패한 목표, 그 목표를 추구할 수 있는 능력, 이를 허용하는 환경 등 세 가지 조건이 통제 상실로 이어질 수 있다고 경고해왔다"고 말했습니다.
이어 "세 가지 조건이 실험실이 아닌 실제 시스템에서 발생한 것"이라고 지적했습니다.
특히 오픈AI가 사건 이후 내놓은 자체 보고서에서 제시한 안전장치만으로는 AI 안전이 보장되지 않는다는 점도 지목했습니다.
오픈AI는 자체 보고서에서 자사 공개 AI에 안전장치와 가드레일을 추가 적용했으며 자동 검토시스템을 통해 향후 이와 같은 위험한 행동을 감지할 수 있다고 주장했습니다.
그러나 패널은 "이렇게 자체 보고된 시험만으로는 해당 제어 장치가 모든 환경에서, 특히 외부 감시 상황에 더 뛰어난 능력·적응력을 갖춘 미래 에이전트에 대해서도 신뢰성 있게 작동할지 입증하지 못한다"고 꼬집었습니다.
그러면서 국경을 넘나드는 AI 위험의 특징을 고려해 단일 기업이나 국가가 아닌, 국제 사회 차원의 가드레일이 조속히 마련돼야 한다고 강조했습니다.
패널은 "단일 AI 시스템이 일으키는 위험은 한 국가에만 국한되지 않으므로 국제적 합의에 기반한 위험 관리가 중요한 역할을 해야 한다"고 짚었습니다.
이런 상황에서 'AI의 미래와 국제 안보'를 주제로 열리는 유엔 안전보장이사회(안보리) 회의에는 클레망 들랑그 허깅페이스 CEO가 참석해 관련 내용을 이사국들에 브리핑할 예정이라고 블룸버그 통신은 보도했습니다.
이외에도 전문가 패널 공동 의장인 벤지오 교수와 샘 올트먼 오픈AI CEO도 브리핑에 나섭니다.
최근 'AI 속도조절론'을 주장해 업계에 찬반 논쟁을 불러온 다리오 아모데이 앤트로픽 CEO도 화상으로 참석해 브리핑을 진행할 예정입니다.
※ '당신의 제보가 뉴스가 됩니다'
[카카오톡] YTN 검색해 채널 추가
[전화] 02-398-8585
[메일] social@ytn.co.kr
[저작권자(c) YTN 무단전재, 재배포 및 AI 데이터 활용 금지]