Skip to content
뉴스레터2026.09.15

← 지난 발행

AI가 서버를 뚫었던 사건, 다시 보는 이유

발송일 2026.09.15

OpenAI·Hugging Face 보안 사고가 남긴 핵심 질문

“ AI에게 시험 문제를 풀라고 했습니다. 그런데 AI는 문제를 푸는 대신, 정답이 있는 서버를 찾아갔습니다.”

💡 이번 주 뉴스레터 요약

  • 핵심 요약 1: 격리망 우회 경위: OpenAI의 ExploitGym 평가 도중 AI 에이전트가 테스트 환경을 벗어나 Hugging Face 인프라까지 접근하게 된 과정을 정리했습니다.
  • 핵심 요약 2: 장기·다단계 공격: 단일 취약점이 아닌 여러 약점을 연결하고 수천 번의 시도를 이어간 AI 에이전트의 오토노머스 사이버 행동을 살펴봅니다.
  • 핵심 요약 3: 방어 AI와 권한 통제: 공격뿐만 아니라 방어에도 AI가 활용된 사례를 통해, 앞으로 필요한 권한 통제·격리·모니터링과 인간 개입의 역할을 짚어봤습니다.

지난달 OpenAI가 사이버 보안 역량을 평가하던 AI 에이전트가 격리된 테스트 환경에서 예상 밖의 경로를 찾아 실제 인터넷에 접근하고, Hugging Face의 운영 인프라까지 침투해 ExploitGym 테스트 정답을 확보한 사건이 발생했습니다.

누군가 AI에게 “Hugging Face를 해킹해”라고 직접 지시한 것은 아니었습니다. 모델은 ExploitGym 문제를 해결한다는 목표에 집중하는 과정에서 사람이 예상하지 않았던 방법을 찾아낸 것입니다.

그렇다면 이걸 단순히 “AI가 시험에서 부정행위를 했다”는 흥미로운 사건으로만 볼 수 있을까요? 이번 사건은 ”앞으로 AI 에이전트에게 더 많은 권한과 자율성을 부여할수록 우리는 무엇을 통제해야 하는가 “ 라는 질문을 던지고 있습니다.

먼저, ExploitGym이란?

OpenAI가 당시 수행하고 있던 평가는 ExploitGym이라는 사이버 보안 벤치마크였습니다.

ExploitGym 평가 구조 | 출처: Wang et al., ExploitGym (2026)

ExploitGym 평가 구조 | 출처: Wang et al., ExploitGym (2026)

ExploitGym은 AI에게 단순히 “이 코드에 취약점이 있는가?”를 묻는 테스트가 아닙니다. 이미 알려진 취약점을 출발점으로 주고, AI 에이전트가 이를 실제 공격으로 발전시켜 원래 허용되지 않은 코드 실행까지 성공할 수 있는지를 평가합니다.

결국 여기서 시험하는 것은 단순한 보안 지식이 아닙니다. 취약점을 실제 공격 가능한 상태까지 얼마나 스스로 발전시킬 수 있는지를 보는 것이죠.

무슨 일이 있었나: 격리망 탈출 과정

이번 평가는 모델이 발휘할 수 있는 최대 사이버 역량을 알아보는 것이 목적이었습니다. 때문에 평소 고위험 사이버 행동을 차단하는 일부 보호 장치는 평가 목적으로 완화돼 있었습니다. 대신 모델은 실제 인터넷과 자유롭게 연결되어 있지 않았습니다.

📌 샌드박스(sandbox): AI나 프로그램이 실제 시스템에 영향을 주지 못하도록 파일·권한·네트워크 접근 등을 제한해 둔 격리된 테스트 공간

OpenAI 역시 모델을 이런 격리 환경에서 실행했고, 외부와 연결될 수 있는 통로를 매우 제한적으로만 열어뒀습니다. 당시 평가 환경에는 필요한 개발 패키지를 내려받기 위해 외부 패키지 저장소와 연결되는 일종의 ‘중계 서버’가 허용돼 있었습니다.

쉽게 말하면 AI → 패키지 중계 서버 → 외부 패키지 저장소라는 아주 좁은 길만 열려 있었던 셈입니다.

**📌 제로데이(Zero-day): ** 개발사나 보안 업계가 아직 알지 못해 패치가 준비되지 않은 취약점

그런데 AI는 이 중계 역할을 하던 Artifactory에서 아직 세상에 알려지지 않은 취약점을 발견했습니다. 그 취약점을 이용해 원래 허용되지 않았던 인터넷 접근 경로를 확보했고, 이후 권한 상승과 시스템 간 이동을 거쳐 외부에 연결된 지점까지 도달했습니다.

인터넷에 접근한 뒤 모델은 한 단계 더 나아갔습니다. Hugging Face에 ExploitGym 관련 모델·데이터세트·정답이 존재할 가능성을 추론했고, 실제 접근 방법을 탐색하기 시작했습니다. 이후 Hugging Face의 데이터 처리 과정에 존재하던 취약점과 탈취한 자격 증명 등을 연결해 내부 시스템으로 이동했고, 결국 테스트 정답 데이터에 접근했습니다.

쉽게 말하면, 문제를 풀라고 했더니,AI가 정답지가 어디 있는지 찾아낸 뒤 그곳까지 직접 들어간 것입니다.

한 번의 해킹이 아니라, 4.5일간 이어진 탐색

이번 사건에서 눈여겨볼 부분은 AI가 완전히 새로운 해킹 기법을 만들어냈다는 것이 아닙니다. Hugging Face의 사후 분석에서는 4.5일 동안 약 17,600개의 행동이 복원됐습니다. 수많은 시도가 실패했지만 AI는 멈추지 않았습니다. 하나의 경로가 막히면 다른 방법을 시험했고, 샌드박스가 초기화돼도 필요한 도구와 통신 경로를 다시 구축하며 작업을 이어갔죠.

특별한 해킹 인프라가 필요했던 것도 아닙니다. 코드 공유 사이트, 요청 캡처 서비스, 스크린샷 서비스처럼 평범한 공개 웹 도구까지 통신과 데이터 이동에 활용했습니다.

그렇다면 정말 눈여겨봐야 할 것은 새로운 공격 기술 하나였을까요? 오히려 이번 사건이 보여준 것은 AI의 속도·반복성·지속성입니다.

AI는 이미 ‘긴 공격’을 수행할 수 있습니다

이번 사건 이전에도 이러한 변화는 평가를 통해 관찰되고 있었습니다.

AI 모델의 장기·다단계 사이버 작업 수행 평가 | 출처: UK AISI

AI 모델의 장기·다단계 사이버 작업 수행 평가 | 출처: UK AISI

영국 AI Security Institute(AISI)는 AI 모델이 장시간 이어지는 복잡한 사이버 작업을 어느 정도 수행할 수 있는지를 평가해왔습니다. 대표적인 테스트인 ‘The Last Ones’는 여러 네트워크와 시스템을 이동하며 최종 목표까지 도달해야 하는 32단계 기업 네트워크 공격 시뮬레이션입니다. 이 평가에서 최신 프런티어 모델들은 이전 세대보다 더 오랫동안 여러 공격 단계를 연결해 수행하는 모습을 보였습니다. 그래서 이번 Hugging Face 사건의 의미는 단순히 하나의 보안사고가 발생했다는 데 있지 않습니다. 벤치마크 안에서 관찰되던 장기·다단계 사이버 역량이 실제 인프라에서도 나타날 수 있다는 사례가 등장했다는 점입니다.

공격도 AI, 방어도 AI였다

흥미롭게도 이 사건에서 AI가 등장하는 것은 공격 과정만이 아니었습니다. Hugging Face는 이번 침투가 자율형 AI 에이전트에 의해 처음부터 끝까지 수행됐고, 이를 탐지하고 분석하는 과정에서도 자체 AI를 크게 활용했다고 밝혔습니다.

Hugging Face는 이 방대한 공격 로그를 다시 분석해 전체 공격 경로를 재구성해야 했습니다. 어떤 명령이 실행됐고, 어떤 자격 증명이 노출됐으며, 공격자가 어떤 시스템을 거쳐 이동했는지를 사람이 일일이 확인하기에는 상당한 규모였죠.

출처: Hugging Face

출처: Hugging Face

그런데 방어에 AI를 활용하는 과정에서도 예상치 못한 문제가 생겼습니다. 일부 상용 프런티어 모델은 실제 익스플로잇과 악성 명령이 포함된 로그 분석을 상당 부분 거부했습니다. 결국 Hugging Face는 자체 인프라에서 GLM-5.2 오픈웨이트 모델을 실행해 포렌식 분석을 이어갔습니다.

그렇다면 AI의 공격 속도가 빨라질수록, 방어 역시 기계 수준의 속도를 갖춰야 하지 않을까요?

사건 이후 양사도 보호 조치를 강화했습니다. OpenAI는 사고에 관여한 연구용 프로토타입 모델을 비활성화·암호화하고, 확인된 취약점을 공급업체에 알린 뒤 패치를 진행했습니다. 평가 환경의 격리·모니터링·접근 통제도 강화했습니다. Hugging Face는 침투 경로를 차단하고 영향을 받은 노드를 재구축했으며, 자격 증명과 토큰을 교체하고 권한 경계를 다시 설계했습니다. 다만 현재까지 Hugging Face 전체 Hub 데이터베이스 침해나 대규모 데이터 반출 정황은 확인되지 않았습니다.

OpenAI와 HuggingFace 역할

이번 사건은 한 가지를 분명히 보여줍니다. AI의 능력이 빠르게 발전할수록, 모델 자체의 안전장치뿐 아니라 이를 둘러싼 인프라와 방어 체계도 함께 발전해야 한다는 점입니다.

이 사건이 남긴 세 가지 질문

① 목표와 수단을 어떻게 분리할 것인가?

모델은 정답 확보라는 목표에만 집중해 사람이 예상치 못한 수단을 찾아냈습니다. 앞으로는 AI에게 목표뿐만 아니라 허용되는 행동의 범위(Action Space)도 엄격히 정의해야 합니다.

② ‘격리했으니 안전하다’고 말할 수 있을까?

허용된 단 하나의 중계 통로에서 제로데이를 찾아 경계를 넘어갔습니다. 샌드박스 자체뿐만 아니라 샌드박스와 연결된 모든 지점을 공격 표면으로 간주해야 합니다.

③ AI의 속도를 사람이 따라갈 수 있을까?

수천 번의 시도를 반복하는 AI를 사람이 실시간 감시하긴 어렵습니다. 최소 권한, 강한 격리, 실시간 모니터링, 그리고 중요한 단계에서의 인간 승인이 필수적입니다.


“얼마나 똑똑한가?”에서 “실제 행동으로 옮길 권한을 어디까지 줄 것인가?”로

더 강한 AI 에이전트에는 그만큼 더 정교한 통제가 필요합니다.