서론
인공지능(AI) 산업의 폭발적 성장과 함께 AI 가속기와 네오클라우드 환경이 빠르게 확산되고 있다. AI 가속기는 CPU나 GPU와 다른 전용 칩으로 AI 학습과 추론 워크로드를 최적화한 하드웨어이며, 네오클라우드란 AWS, Azure, Google Cloud 같은 전통적 하이퍼스케일과 구분되는 AI 우선 전용 클라우드 환경이다.
네오클라우드는 대규모 AI 모델 학습, 고처리량 추론, 저지연 웹 컴퓨팅, 유연한 배포, 예측 가능한 비용 구조 등 기존 클라우드가 제공하지 못한 장점을 제공한다. 하지만 급격한 성장 뒤에는 심각한 보안 사각지대가 도사리고 있다. 기존 사이버 보안 도구들은 수십 년간 CPU 중심 운영체제 위에서 발전해 왔다. AI 가속기의 고속 비디오키 메모리(VRAM)나 전용 가속 칩 내부에서 일어나는 일은 전통적 보안 솔루션이 감시하지 못한다.
네오클라우드 보안 사각지대
보안 전문가들은 "네오클라우드 환경에서 침입 탐지 모델이 적용되지 않는다"고 지적한다. Chris Hosking(Stealthium GTM Advisor)은 "우리는 '보이는 것이 없으면 Nothing happening'이라고 생각해 왔다. 가속기 환경에서는 이는 치명적 오류다. 사이버 보안에서 증거의 부재는 부재의 증거가 아닙니다"라고 경고한다.
구체적 사각지대는 세 가지다.
- 가속기 내부 감시 부재: 전통적 EDR/XDR, SIEM, 네트워크 IPS는 CPU 중심 OS에서 수집하는 로그와 트레이드에 기반한다. AI 가속기 내부에서 실행되는 커널, 워크로드, 메모리 접근 패턴은 시야에서 배제된다.
- 멀티테넌트 격리 취약성: 네오클라우드 환경은 단일 물리 노드에서 다수 고객의 AI 워크로드가 공유 실행된다. 가속기 레벨의 격리 메커니즘이 미비하면 한 고객의 침해가 인접 워크로드로 확장될 수 있다.
- 공급망 위험: 네오클라우드 노드가 은밀하게 침해당한 경우, 해당 노드를 사용하는 모든 고객에게 보이지 않는 공급망 위험이 전파된다. 특히 AI 개발 목적의 고객은 학습 데이터, 모델 가중치, IP(지식재산권)가 노출될 위험이 크다.
Januscape: 검증된 사실과 전제 조건
원문 기사는 Januscape(CVE-2026-53359) 사례를 통해 잠재적 위험을 설명한다. 이 섹션에서는 공개 자료에서 확인된 사실, 필요한 전제 조건, 그리고 여전히 이론에 머무는 시나리오를 명확히 구분한다.
검증된 사실
Januscape는 Linux KVM 하이퍼바이저의 shadow MMU 에뮬레이션 코드에 존재하는 use-after-free 취약점이다. 보안 연구원 Hyunwoo Kim(@v4bel)이 발견했으며, Google kvmCTF 버그바운티 프로그램에서 제로데이로 입증됐다. Intel과 AMD 아키텍처 모두에서 작동하는 첫 번째 KVM 악용 사례로 알려져 있다.
NVD는 CVSS 3.1 Score 8.8(High)로 평가했으며, CVSS 벡터는 AV:L/AC:L/PR:L/UI:N/S:C/C:H/I:H/A:H이다. 여기서 AV:L(Local)은 공격자가 게스트 VM 내에서 직접 실행해야 함을 의미하며, PR:L(Low)는 게스트 내에서 낮은 수준의 권한으로도 악용이 가능함을 나타낸다. 즉, 게스트-호스트 경계를 넘어 공격 영향이 확장된다.
공개 PoC가 입증한 결과는 다음과 같다.
- 활용 범위: x86 KVM 환경에만 국한됨
- 유발 결과: 게스트 측 동작만으로 호스트 커널 패닉을 유발(DoS). 즉, 물리 노드 전체가 다운되며 동일 노드의 모든 VM에 영향
- 패치: 커밋 81ccda30b4e8(2026년 6월 16일 메인라인 병합)
필수 전제 조건 — 중첩 가상화와 게스트 내 PoC 모듈 실행
Januscape의 악용에는 두 가지 명확한 전제 조건이 필요하다.
- 중첩 가상화(Nested Virtualization) 노출: x86 KVM에서 모던 호스트는 기본적으로 하드웨어 2단계 페이지링(Intel EPT, AMD NPT)을 사용하며 TDP MMU 경로를 따른다. Januscape가 타격하는 것은 레거시 shadow MMU 코드인데, 이는 L1 게스트가 자체 하이퍼바이저로서 L2 게스트를 EPT/NPT로 구동할 때, L0(호스트)가 소프트웨어로 L1이 구축한 EPT/NPT를 쉐도우해야 하는 경우에만 활성화된다. 즉, 중첩 가상화가 노출된 환경에서만 이 취약 코드가 실행된다. 중첩 가상화가 활성화되어 있는지 여부는 클라우드 공급자별 설정에 따라 다르며, 확인이 필요하다.
- 게스트 내 PoC 모듈 적재: 공개 PoC의 작동 절차는 게스트 VM 내에서 커널 모듈(
poc.ko)을 빌드하고insmod로 적재하는 것이다. 이때sudo rmmod kvm_intel(또는kvm_amd) 후sudo insmod poc.ko를 실행해야 한다. 이 전제는 PoC의 특정 실행 방식에 해당하며, CVE 자체의 공식 PR:L 조건과는 구분해야 한다.
조건부 위험 시나리오 — 아직 검증되지 않은 확장
공개 PoC가 실제로 입증한 것은 호스트 패닉(DoS)이다. 연구원은 동일한 취약점을 이용해 통제 환경에서 호스트 루트 권한으로 코드를 실행하는 풀 에스케이프 악용이 존재함을 언급했으나, 해당 익스플로잇은 공개되지 않았으며 본 보고서의 범위를 벗어난다.
아래 시나리오들은 "만약 풀 에스케이프가 성공한다면"이라는 가정 하에 상정할 수 있는 결과들이며, 공개 PoC의 검증된 사실이 아니다.
- 가상: 풀 에스케이프 성공 시 공격자는 동일 노드의 다른 테넌트 VM에 접근할 수 있으며, 교차 테넌트 데이터 유출이 발생할 수 있다.
- 가상: AI 모델 가중치나 학습 데이터에 접근해 모델 포지닝(Model Poisoning)을 유발하거나, 추론 결과를 특정 방향으로 왜곡할 수 있다.
- 가상: 침해된 가속기 자원을 활용해 암호화폐 채굴 또는 추가 공격의 스텝스톤으로 활용할 수 있다.
이 시나리오들은 기술적으로 타당한 우려이지만, Januscape의 공개 재현 사례로 단정해서는 안 된다. 현재 공개된 증거는 호스트 패닉(DoS) 수준이다.
기술적 배경: 가속기 런타임 보안
AI 가속기 환경에서 보안이 어려운 기술적 이유는 다음과 같다.
가속기 아키텍처의 이질성
GPU(NVIDIA CUDA), TPU(Google), Groq LPU, Cerebras WSE, Graphcore IPU, Tenstorrent TT 등 각 가속기마다 전용 명령어 세트, 메모리 아키텍처, 드라이버 스택이 다르다. 기존 보안 도구가 이 모든 플랫폼의 런타임 행위를 모니터링하는 것은 현실적으로 불가능에 가깝다.
VRAM 접근 제한
가속기의 고속 비디오 메모리는 호스트 OS와 별도의 메모리 공간으로 관리된다. 전통적 메모리 포렌식 도구는 VRAM 내부의 데이터 이동, 코드 실행, 모델 가중치 접근을 직접 관찰하지 못한다.
네트워크 레벨 감지의 한계
네오클라우드 환경에서 가속기 간 통신(NVLink, InfiniBand 등)은 고속 전용 인터커넥트를 통해 이루어지며, 이를 캡처하거나 분석하는 표준 도구가 없다.
CUDA/프레임워크 계층의 취약성
NVIDIA CUDA 드라이버, cuDNN, TensorRT 등 AI 소프트웨어 스택의 각 계층에 취약점이 존재할 수 있으나, 이는 일반 OS 패치 프로세스의 범위에서 다루어지지 않는다.
Stealthium의 접근 방식
Stealthium은 네오클라우드 하드웨어 내부에 직접 접근하지 않는다. 대신 고객의 인프라 내 에이전트(Agent)를 배포해 네오클라우드에서 발생하는 텔레메트리(Telemetry)를 수집·분석한다.
하이프린트(Hyperprints) 기술
원시 GPU 메트릭과 커널 추적(Kernel Traces)을 높은 수준의 실행 가능한 추상화인 '하이프린트'로 변환한다. "메트릭이 하락했다"는 단순 알람을 넘어, AI 워크로드 성능에 어떤 의미를 가지는지 명확히 파악할 수 있다.
미묘한 침해 신호 탐지
Stealthium 에이전트는 네오클라우드 텔레메트리에서 미묘한 이상 신호(Hints of Compromise)를 탐지하도록 특화 학습되었다. 교차 테넌트 누출, 모델 poisoning, 비정상 가속기 자원 사용 등 각 공격 유형별로 특징적인 텔레메트리 패턴이 존재하며, 이를 기반으로 침해를 식별한다.
전체 스택 가시성
GPU 옵저버빌리티, AI 워크로드 런타임 보안, 엔드투엔드 GPU 메트릭, 추적, 로그, 실시간 히스 모니터링을 통합해 툴스택 가시성을 제공한다. NVIDIA 소프트웨어 스택(드라이버, 훅, CUDA)과 주요 AI 프레임워크를 모두 지원한다.
영향 범위
이 보안 사각지대가 영향을 받는 대상은 다음과 같다.
- 네오클라우드 사용자: CoreWeave, Nebius 등 AI 전용 클라우드 서비스를 사용하는 기업 및 연구 기관
- AI 가속기 운영자: 전용 AI 칩(Tenstorrent, Groq, Cerebras 등)을 자체 데이터 센터에서 운영하는 조직
- 대규모 AI 모델 개발자: 클라우드 환경에서 모델 학습/추론 파이프라인을 운영하는 AI 기업
- 주권 AI(Sovereign AI) 구축 기관: 국가 차원에서 AI 인프라를 운영하며 데이터 주권을 중시하는 공공 기관
특히 멀티테넌트 환경에서 AI 모델을 학습하거나 추론 서비스를 운영하는 조직은 타 테넌트의 침해를 간접적으로 받을 가능성이 있으며, 이는 공급망 공격으로 확대될 수 있다.
대응 방안
네오클라우드·AI 가속기 환경의 보안 사각지대를 해소하기 위해 다음 점검 항목을 추천한다.
즉시 실행
- 중첩 가상화 노출 여부 확인: KVM 기반 인프라에서 중첩 가상화(nested virtualization)가 활성화된 노드를 점검한다. Januscape의 전제 조건이 중첩 가상화이므로, 불필요한 중첩 가상화 노드를 비활성화하면 영향 범위를 현저히 줄일 수 있다. 각 클라우드 공급자의 설정에 따라 다르므로 확인이 필요하다.
- KVM 하이퍼바이저 패치 상태 확인: Januscape(CVE-2026-53359)를 포함한 최신 KVM 관련 취약점에 대한 패치 적용 여부를 점검한다. 커밋 81ccda30b4e8(2026년 6월 16일 메인라인 병합) 이후 버전으로 업데이트한다.
- 네오클라우드 공급업체 보안 posture 확인: CoreWeave, Nebius 등 서비스 제공자의 멀티테넌트 격리 메커니즘, 가속기 레벨 보안 컨트롤, 인증/인가 프로세스를 확인한다.
단기 대응 (1~3개월)
- 가속기 텔레메트리 모니터링 도입: GPU/가속기 메트릭(CUDA 실행 시간, VRAM 사용 패턴, 커널 호출 빈도)을 수집해 베이스라인을 설정하고 이상 패턴을 탐지한다. Stealthium과 같은 전용 솔루션을 검토한다.
- AI 워크로드 격리 검증: 가속기 레벨에서 워크로드 간 격리가 올바르게 작동하는지 테스트한다. 가상화 계층의 네스팅(Nesting) 설정을 최소화하고, 불필요한 하이퍼바이저 기능을 비활성화한다.
- CUDA/프레임워크 스택 패치 관리: NVIDIA CUDA, cuDNN, TensorRT 등 AI 소프트웨어 스택의 취약점 패치 주기를 정의하고 실행한다. 일반 OS 패치 프로세스에 AI 스택 관리를 포함시킨다.
장기 대응 (3~6개월)
- 전용 가속기 보안 솔루션 도입: Stealthium과 같은 AI 가속기 런타임 보안 전용 솔루션을 평가·도입한다. 가속기 레벨의 옵저버빌리티를 확보해 침해를 조기에 탐지한다.
- AI 공급망 보안 프레임워크 수립: 네오클라우드 환경에서의 침입 탐지 모형을 명확히 정의하고, 공급업체 간 보안 SLA를 체결한다.
- 제로트러스트 아키텍처 적용: 가속기 환경에도 마이크로서그멘테이션, 최소 권한 원칙, 지속적인 인증을 적용한다. 특히 GPU 워크로드 간 접근 제어를 세분화한다.
결론
AI 가속기와 네오클라우드는 AI 산업의 필수 인프라로 자리 잡고 있다. 하지만 기존 보안 도구가 따라가지 못하면서, 가속기 내부와 네오클라우드 하드웨어 계층에 심각한 보안 사각지대가 형성되고 있다. Januscape 사례는 이 사각지대가 단순 이론적 우려가 아님을 보여준다.
보안팀과 AI 인프라 운영팀은 가속기 레벨의 옵저버빌리티를 확보해야 한다. "보이는 것이 없으면 문제가 없다"라는 접근은 이제 유효하지 않다. Stealthium과 같은 전용 솔루션 도입과 함께, 텔레메트리 기반 이상 탐지, 워크로드 격리 검증, 공급망 보안 점검을 통해 네오클라우드 환경의 보안을 체계적으로 강화해야 한다.
참고문헌
-
SecurityWeek - Stealthium Targets Security Blind Spots in AI Accelerators and Neo-Clouds
https://www.securityweek.com/stealthium-targets-security-blind-spots-in-ai-accelerators-and-neo-clouds/ -
Stealthium - GPU-Powered Security Intelligence
https://stealthium.io/ -
SecurityWeek - Linux Kernel Vulnerability Allows VM Escape on Intel and AMD Systems (Januscape)
https://www.securityweek.com/linux-kernel-vulnerability-allows-vm-escape-on-intel-and-amd-systems/ -
NVD - CVE-2026-53359 (Januscape)
https://nvd.nist.gov/vuln/detail/CVE-2026-53359 -
GitHub - V4bel/Januscape (PoC 및 Write-up)
https://github.com/V4bel/Januscape -
Linux Kernel Commit 81ccda30b4e8 (Januscape 패치)
https://git.kernel.org/pub/scm/linux/kernel/git/torvalds/linux.git/commit/?id=81ccda30b4e8
본 콘텐츠는 AI 기술로 작성된 분석 리포트를 포함하고 있습니다. 내용 중 사실과 다르거나 보완이 필요한 정보를 발견하셨으면 댓글을 통해 의견을 부탁드립니다. 여러분의 피드백은 더 정확한 보안 정보 공유에 큰 도움이 됩니다.
댓글 (0)
댓글을 작성하려면 로그인이 필요합니다.
로그인아직 댓글이 없습니다.
첫 번째 댓글을 작성해보세요!