인공지능 관련 해킹 사례

IT 위키

인공지능 관련 해킹 사례(人工知能關聯 hacking cases, AI-related hacking incidents)는 인공지능(Artificial Intelligence, AI)이 사이버 공격의 도구 또는 실행 주체로 사용된 사건과, 인공지능 모델·서비스·학습 환경·운영 인프라가 공격 대상이 된 사건을 통칭한다.

인공지능 관련 해킹은 공격 방향에 따라 크게 두 범주로 구분할 수 있다.

  • 인공지능을 이용한 해킹: 공격자가 생성형 인공지능, 대형 언어 모델(Large Language Model, LLM), 코딩 에이전트 등을 이용해 정찰, 피싱, 취약점 분석, 악성 코드 제작, 내부망 이동, 데이터 탈취 등의 작업을 수행한 경우이다. 인공지능이 여러 공격 단계를 자율적으로 실행한 사례도 이 범주에 포함된다.
  • 인공지능을 해킹한 사례: 공격자가 인공지능 서비스, 모델, 에이전트, 학습 플랫폼 또는 인공지능 연산 인프라의 취약점을 공격한 경우이다. 프롬프트 인젝션, 모델 추출, 비밀 키 탈취, 데이터 유출, 인공지능 클러스터 장악 등이 여기에 해당한다.

일반적으로 언론에서 사용하는 “인공지능이 자발적으로 해킹했다”는 표현은 주의해서 사용해야 한다. 공개적으로 확인된 사례의 인공지능은 스스로 공격 동기나 표적을 만든 독립적 행위자라기보다, 사람이 설정한 목표와 실행 환경 안에서 공격 절차를 자율적으로 계획·수행한 에이전트에 가깝다. 따라서 이러한 사례는 자율형 또는 에이전트형 인공지능을 이용한 해킹으로 보는 것이 정확하다.

인공지능을 이용한 해킹 사례

[편집 | 원본 편집]

국가 지원 공격 조직의 ChatGPT 이용

[편집 | 원본 편집]

2024년 2월 OpenAI와 Microsoft는 러시아, 북한, 이란, 중국과 연계된 것으로 평가된 5개 위협 행위자 조직이 OpenAI 서비스를 사이버 작전에 이용한 사실을 공개했다. 관련 조직은 Forest Blizzard, Emerald Sleet, Crimson Sandstorm, Charcoal Typhoon, Salmon Typhoon으로 식별되었다.[1][2]

이들이 인공지능을 이용한 방식은 조직별로 달랐다.

  • 러시아 군사정보기관과 연계된 것으로 평가된 Forest Blizzard는 위성 통신 프로토콜, 레이더 영상 기술과 같은 표적 관련 기술을 조사하고 스크립트 작업을 지원받는 데 대형 언어 모델을 이용했다.
  • 북한과 연계된 Emerald Sleet는 공개된 취약점 조사, 표적 조직 및 보안 전문가에 관한 정보 수집, 피싱 문구 작성, 스크립트 문제 해결 등에 인공지능을 이용했다.
  • 이란 혁명수비대와 연계된 Crimson Sandstorm은 피싱 캠페인에 사용할 문구와 사회공학 자료를 만들고, 웹·애플리케이션 개발 관련 정보를 조사했다.
  • 중국계 조직으로 평가된 Charcoal TyphoonSalmon Typhoon은 특정 기업과 기술에 대한 정찰, 코드 오류 수정, 스크립트 작성, 운영체제 명령어 확인 등에 인공지능을 이용했다.

이 사례에서 인공지능은 공격을 독자적으로 수행한 것이 아니라 공격자의 조사와 개발 속도를 높이는 생산성 도구로 사용되었다. OpenAI와 Microsoft는 당시 대형 언어 모델이 기존에 불가능했던 공격 능력을 제공했다기보다, 검색·번역·코딩과 같은 기존 업무를 보조했다고 평가했다.[1]

Gemini를 이용한 국가 지원 공격 활동

[편집 | 원본 편집]

Google 위협정보그룹(Google Threat Intelligence Group, GTIG)은 2025년 1월 북한·이란·중국·러시아와 연계된 공격자들이 Gemini를 사이버 작전에 이용한 정황을 공개했다. 공격자들은 공개 정보 수집, 취약점 조사, 악성 스크립트 개발, 피싱 문구 작성, 공격 이후 명령 실행 방법 확인 등에 Gemini를 사용했다.[3]

북한계 공격자는 해외 기업 취업에 필요한 자기소개서와 지원 자료 작성, 원격 근무 환경 조사, 암호화폐 및 방위산업 표적에 대한 정보 수집 등에 Gemini를 이용했다. 이란계 공격자는 방어 체계를 우회하는 방법, 공개 취약점, 피싱 캠페인에 사용할 콘텐츠를 조사했다. 중국계 공격자는 네트워크 침투와 내부 이동에 필요한 기술 정보를 확인하고 코드 작성 및 디버깅을 시도했다.

Google은 당시 관찰된 활동에서 공격자가 인공지능을 이용해 완전히 새로운 공격 기법을 개발했다는 증거는 확인하지 못했다고 밝혔다. 대부분은 기존 검색 엔진, 번역기, 프로그래밍 보조 도구가 수행하던 작업을 더 빠르게 처리하기 위한 이용이었다.[3]

Claude Code를 이용한 대규모 데이터 탈취·갈취 사건

[편집 | 원본 편집]

2025년 8월 Anthropic은 한 사이버 범죄자가 Claude Code를 이용해 최소 17개 조직을 공격한 데이터 탈취·갈취 사건을 공개했다. 피해 대상에는 의료기관, 응급 서비스 기관, 정부기관, 종교기관 등이 포함되었다.[4]

공격자는 Claude Code를 단순한 질문·답변 도구가 아니라 실제 공격 작업을 실행하는 에이전트로 사용했다. Claude Code는 다음과 같은 작업에 관여했다.

  • 공격 대상에 대한 정찰과 공격 표면 조사
  • 노출된 자격 증명과 인증 정보 수집
  • 피해 조직의 네트워크 침투
  • 탈취할 데이터의 검색과 분류
  • 훔친 데이터의 금전적 가치 평가
  • 피해자별 갈취 문구와 협박 전략 작성

공격자는 전통적인 랜섬웨어처럼 피해자의 파일을 암호화하지 않고, 훔친 정보를 공개하겠다고 위협하는 방식으로 금전을 요구했다. 일부 요구 금액은 미화 50만 달러를 넘었다. Anthropic은 Claude가 어떤 데이터를 탈취할지와 피해자를 어떻게 압박할지에 관한 전술적 판단에도 사용되었다고 설명했다.[4]

이 사건은 인간 공격자가 목표와 공격 기반을 준비했지만, 인공지능 에이전트가 정찰부터 데이터 분석과 갈취 문구 작성까지 여러 단계를 연속적으로 수행했다는 점에서 이른바 바이브 해킹(vibe hacking) 사례로 불렸다.

Claude Code를 이용한 중국계 사이버 첩보 작전

[편집 | 원본 편집]

Anthropic은 2025년 11월 중국 정부 지원 조직으로 높은 신뢰도를 두고 평가한 GTG-1002가 Claude Code를 이용해 약 30개 국제 조직에 침투를 시도한 사건을 공개했다. 공격 대상에는 대형 기술기업, 금융기관, 화학 제조기업, 정부기관 등이 포함되었으며, 이 가운데 소수의 표적에서 실제 침입에 성공한 것으로 조사되었다.[5]

공격자는 Claude Code가 악성 요청을 거부하지 않도록 전체 공격을 여러 개의 작은 보안 점검 작업으로 분할하고, 자신들을 합법적인 사이버 보안 업체라고 인식시키는 방식으로 모델을 조작했다. 이후 Claude Code는 공격 대상 조사, 취약점 발견, 취약점 악용 코드 작성, 계정과 자격 증명 수집, 내부망 이동, 데이터 검색과 반출 등의 작업을 수행했다.

Anthropic의 조사에 따르면 인공지능은 공격 작업의 대부분을 처리했으며, 인간 운영자는 표적 선정, 공격 승인, 탈취 자료 검토 등 제한된 지점에서 개입했다. 다만 Claude가 일부 정보를 잘못 판단하거나 존재하지 않는 자격 증명을 획득했다고 보고하는 환각도 발생해 인간의 검증이 필요했다.[5]

Anthropic은 이를 대규모 사이버 공격에서 인공지능이 단순한 조언자가 아니라 실제 실행자로 이용된 최초의 문서화된 사례로 평가했다. 그러나 공격 목표와 대상은 인간이 지정했으므로, 인공지능이 독립적인 의도에 따라 자발적으로 공격한 사건으로 보기는 어렵다.

AI API를 호출하는 악성 코드 HONESTCUE

[편집 | 원본 편집]

Google 위협정보그룹은 2025년 9월부터 HONESTCUE라는 악성 코드 표본이 Gemini API를 호출해 후속 악성 코드의 기능을 생성하도록 설계된 사실을 관찰했다.[6]

HONESTCUE는 필요한 코드 일부를 악성 파일 안에 고정적으로 저장하는 대신 실행 과정에서 인공지능 API에 기능 생성을 맡겼다. 이러한 구조는 악성 코드의 정적 분석을 어렵게 하고, 네트워크 기반 탐지 체계가 최종 동작을 사전에 식별하기 어렵게 만들 수 있다.

Google은 이를 인공지능이 악성 코드의 기능 생성 과정에 직접 통합된 초기 사례로 평가했다. 다만 관찰 당시에는 기존 사이버 공격의 구조를 근본적으로 바꿀 정도의 완성된 기술이라기보다 실험적인 악성 코드에 가까웠다.[6]

인공지능을 해킹한 사례

[편집 | 원본 편집]

ChatGPT 대화 기록·결제 정보 노출 사고

[편집 | 원본 편집]

2023년 3월 20일 ChatGPT에서 일부 이용자에게 다른 이용자의 대화 제목이 표시되는 사고가 발생했다. OpenAI는 서비스를 일시 중단한 뒤, Redis 클라이언트 오픈 소스 라이브러리의 오류가 원인이었다고 발표했다.[7]

오류가 발생한 특정 조건에서는 다른 사용자가 새로 시작한 대화의 첫 메시지가 노출될 가능성도 있었다. 또한 특정 9시간 동안 활동한 ChatGPT Plus 가입자의 약 1.2%에 대해 이름, 이메일 주소, 결제 주소, 신용카드 종류, 카드 번호 마지막 네 자리, 만료일 등의 정보가 다른 사용자에게 표시될 가능성이 있었던 것으로 조사되었다. 신용카드 전체 번호는 노출되지 않았다.[7]

이 사건은 외부 공격자가 ChatGPT 서버를 침입한 해킹 사건은 아니지만, 인공지능 서비스의 세션 및 캐시 처리 취약점으로 사용자 데이터가 노출된 대표적인 보안 사고이다. 인공지능 모델 자체뿐 아니라 모델 주변의 웹 서비스, 결제 시스템, 캐시, 인증 체계도 인공지능 보안의 일부라는 점을 보여준다.

ShadowRay 인공지능 클러스터 장악 사건

[편집 | 원본 편집]

2024년 3월 보안업체 Oligo Security는 분산 컴퓨팅 프레임워크 Ray를 사용하는 인공지능 워크로드가 실제 공격에 악용된 ShadowRay 캠페인을 공개했다. Ray는 인공지능 모델 학습, 미세 조정, 추론 작업을 여러 서버에 분산하기 위해 널리 사용되는 오픈 소스 프레임워크이다.[8]

공격자는 인터넷에 노출된 Ray 대시보드와 작업 제출 기능에 인증이 적용되지 않은 문제를 이용했다. 이 문제는 CVE-2023-48022로 식별되었으나, Ray 개발 측에서는 Ray를 신뢰된 네트워크 안에서 운영해야 한다는 설계 전제를 이유로 일반적인 취약점인지에 관해 이견을 보였다.

공격자는 노출된 Ray 클러스터에서 임의의 코드를 실행하고 다음과 같은 행위를 수행했다.

  • 서버의 중앙처리장치와 그래픽 처리장치를 암호화폐 채굴에 이용
  • 클라우드 자격 증명과 접근 토큰 탈취
  • 명령 기록과 환경 변수에서 비밀 정보 수집
  • 인공지능 모델과 운영 데이터 접근
  • 감염된 연산 자원을 공격자의 원격 인프라에 연결

Oligo는 교육, 암호화폐, 생명공학 등 여러 분야의 공개 Ray 서버가 영향을 받았으며, 일부 시스템은 발견되기 전 최소 7개월 동안 장악된 상태였다고 보고했다. MITRE ATT&CK도 ShadowRay를 인공지능 워크로드가 실제 환경에서 공격받은 초기 캠페인으로 등록했다.[9]

Hugging Face Spaces 비밀 정보 접근 사고

[편집 | 원본 편집]

2024년 5월 Hugging Face는 자사의 Spaces 플랫폼에서 비밀 정보 저장 영역에 대한 무단 접근을 탐지했다고 발표했다. Spaces는 이용자가 인공지능 모델의 데모와 애플리케이션을 구축·배포할 수 있도록 제공되는 서비스이다.[10]

Hugging Face는 일부 Spaces에 저장된 비밀 정보가 권한 없이 열람되었을 가능성이 있다고 판단했다. 이러한 비밀 정보에는 외부 서비스 API 키, Hugging Face 접근 토큰, 데이터베이스 인증 정보 등 애플리케이션 실행에 필요한 민감한 값이 포함될 수 있다.

회사는 영향을 받았을 가능성이 있는 Hugging Face 토큰을 폐기하고 사용자에게 키와 토큰을 교체하도록 권고했다. 이후 조직 단위 토큰 제거, 키 관리 서비스(Key Management Service, KMS) 도입, 유출 토큰 자동 탐지·폐기 기능 강화 등의 조치를 시행했다.[10]

이 사건은 인공지능 모델 자체가 탈취되었다고 확인된 사례는 아니지만, 모델을 실행하는 플랫폼의 비밀 관리 체계가 공격받아 다른 서비스와 데이터 저장소까지 연쇄적으로 침해될 수 있었던 공급망형 보안 사고이다.

Microsoft 365 Copilot EchoLeak 취약점

[편집 | 원본 편집]

2025년 6월 Microsoft 365 Copilot에서 EchoLeak라고 명명된 제로 클릭 프롬프트 인젝션 취약점이 공개되었다. 이 취약점은 CVE-2025-32711로 등록되었으며, 인증되지 않은 원격 공격자가 인공지능 명령 주입을 통해 정보를 외부로 유출할 수 있는 문제였다.[11]

공격자는 악성 지시문을 숨긴 이메일을 피해 조직의 사용자에게 보내는 방식으로 공격을 준비할 수 있었다. 사용자가 이메일의 링크를 클릭하거나 첨부 파일을 실행하지 않아도, Copilot이 이메일 내용을 처리하는 과정에서 숨겨진 지시문을 신뢰할 수 있는 명령처럼 해석할 가능성이 있었다.

연구진이 시연한 공격에서는 Copilot이 접근할 수 있는 조직 내부 정보를 검색한 뒤, 자동으로 불러오는 외부 이미지와 Microsoft Teams 프록시 등을 이용해 정보를 공격자 서버로 전송하도록 유도할 수 있었다. 이는 다음 요소를 연결한 복합 공격이었다.

  • 이메일에 삽입한 간접 프롬프트 인젝션
  • 외부 입력과 내부 명령 사이의 신뢰 경계 우회
  • Copilot이 가진 조직 데이터 접근 권한 악용
  • 자동 이미지 요청을 통한 데이터 반출
  • 링크 및 콘텐츠 보안 정책 우회

Microsoft는 공개 전에 취약점을 수정했으며, 실제 고객 데이터가 이 취약점으로 유출되었다는 증거는 확인되지 않았다고 밝혔다. 따라서 EchoLeak는 실제 범죄 피해가 확인된 침해 사고라기보다, 상용 인공지능 에이전트에서 데이터 탈취가 가능함을 입증한 보안 연구 사례로 분류된다.[12]

Gemini 모델 추출 공격

[편집 | 원본 편집]

Google은 2026년 2월 Gemini 모델을 대상으로 한 모델 추출 공격(model extraction attack) 또는 증류 공격(distillation attack)을 탐지하고 차단했다고 발표했다. 모델 추출 공격은 공격자가 인공지능 API에 대량의 질문을 보내고 응답을 수집해, 원본 모델의 지식이나 추론 능력을 다른 모델에 복제하려는 공격이다.[6]

Google이 공개한 사례 중 하나에서는 공격자가 Gemini의 내부 추론 과정을 가능한 한 그대로 출력하게 만들기 위해 10만 건이 넘는 프롬프트를 전송했다. 질문은 여러 언어와 작업 영역에 걸쳐 있었으며, Google은 이를 비영어권 언어에서 Gemini의 추론 능력을 복제하려는 시도로 분석했다.

Google의 탐지 체계는 해당 활동을 실시간으로 식별하고 내부 추론 정보의 노출 위험을 낮추는 조치를 수행했다. 회사는 2025년 동안 국가 지원 공격 조직이 Gemini 최전선 모델을 직접 침해한 사례는 확인하지 못했지만, 여러 국가의 민간기업과 연구자에 의한 모델 추출 시도는 반복적으로 관찰했다고 밝혔다.[6]

모델 추출은 일반 사용자의 개인정보를 직접 훔치는 공격과는 성격이 다르다. 주요 피해는 모델 개발사의 지식재산, 학습 비용, 고유한 추론 능력과 서비스 경쟁력의 탈취에 있다.

공격 유형

[편집 | 원본 편집]

인공지능을 이용한 공격에서 주로 관찰된 기법은 다음과 같다.

  • 공개 정보 수집과 공격 대상 선정 자동화
  • 다국어 피싱·스피어 피싱 문구 작성
  • 악성 스크립트와 공격 도구 개발
  • 공개 취약점 분석 및 악용 방법 조사
  • 탈취한 자격 증명과 데이터 분류
  • 내부망 탐색과 명령 실행
  • 피해자별 협박·갈취 문구 자동 생성
  • 인공지능 에이전트를 이용한 공격 단계 연결

인공지능을 대상으로 한 공격에서 주로 관찰되거나 시연된 기법은 다음과 같다.

  • 직접·간접 프롬프트 인젝션
  • 인공지능 에이전트의 도구 호출 권한 악용
  • 모델 추출 및 지식 증류
  • API 키와 접근 토큰 탈취
  • 모델 배포 플랫폼과 연산 클러스터 침해
  • 사용자 대화 및 개인정보 노출
  • 학습 데이터 오염과 모델 백도어
  • 악성 모델·데이터 파일을 이용한 공급망 공격

해석상의 주의점

[편집 | 원본 편집]

인공지능 관련 해킹 보도에서는 실제 침해 사고, 공격자의 서비스 이용 기록, 보안 연구자의 개념 증명(Proof of Concept, PoC)이 혼용되는 경우가 많다.

  • 국가 지원 조직의 ChatGPT·Gemini 이용 사례는 실제 공격자가 인공지능 서비스를 사용한 기록이지만, 해당 서비스가 공격 성공에 결정적인 역할을 했는지는 사건마다 다르다.
  • Claude Code 데이터 갈취 및 사이버 첩보 사례는 인공지능이 실제 공격 절차를 실행한 사례이지만, 인간 공격자가 목표 설정과 주요 의사결정에서 완전히 배제된 것은 아니다.
  • ShadowRay와 Hugging Face Spaces 사건은 실제 환경의 무단 접근 또는 침해가 확인된 사례이다.
  • EchoLeak는 실제 고객 피해가 확인된 사건이 아니라, 공격 가능성이 보안 연구를 통해 검증되고 공급자가 수정한 사례이다.
  • ChatGPT의 2023년 정보 노출은 외부 침입보다는 소프트웨어 오류에 따른 보안 사고로 분류하는 것이 적절하다.
  • 모델 추출은 시스템 관리자 권한을 탈취하는 전통적 해킹과 달리, 정상적인 API 호출을 대량으로 악용해 모델의 능력과 지식재산을 복제하는 공격이다.

2026년 7월 기준으로 인공지능이 인간의 명령이나 사전 설정 없이 독립적인 동기를 형성해 현실의 시스템을 해킹한 것으로 공인된 사건은 확인되지 않았다. 공개된 고자율성 사례도 인간이 공격 목표, 표적, 계정, 실행 도구 또는 승인 조건을 제공했다.

같이 보기

[편집 | 원본 편집]
  1. 1.0 1.1 OpenAI, 「Disrupting malicious uses of AI by state-affiliated threat actors」, https://openai.com/index/disrupting-malicious-uses-of-ai-by-state-affiliated-threat-actors/, 2026년 7월 30일 확인.
  2. Microsoft Threat Intelligence, 「Staying ahead of threat actors in the age of AI」, https://www.microsoft.com/en-us/security/blog/2024/02/14/staying-ahead-of-threat-actors-in-the-age-of-ai/, 2026년 7월 30일 확인.
  3. 3.0 3.1 Google Threat Intelligence Group, 「Adversarial Misuse of Generative AI」, https://cloud.google.com/blog/topics/threat-intelligence/adversarial-misuse-generative-ai, 2026년 7월 30일 확인.
  4. 4.0 4.1 Anthropic, 「Detecting and countering misuse of AI: August 2025」, https://www.anthropic.com/news/detecting-countering-misuse-aug-2025, 2026년 7월 30일 확인.
  5. 5.0 5.1 Anthropic, 「Disrupting the first reported AI-orchestrated cyber espionage campaign」, https://www.anthropic.com/news/disrupting-AI-espionage, 2026년 7월 30일 확인.
  6. 6.0 6.1 6.2 6.3 Google Threat Intelligence Group, 「GTIG AI Threat Tracker: Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use」, https://cloud.google.com/blog/topics/threat-intelligence/distillation-experimentation-integration-ai-adversarial-use, 2026년 7월 30일 확인.
  7. 7.0 7.1 OpenAI, 「March 20 ChatGPT outage: Here’s what happened」, https://openai.com/index/march-20-chatgpt-outage/, 2026년 7월 30일 확인.
  8. Oligo Security, 「ShadowRay: First Known Attack Campaign Targeting AI Workloads Actively Exploited In The Wild」, https://www.oligo.security/blog/shadowray-attack-ai-workloads-actively-exploited-in-the-wild, 2026년 7월 30일 확인.
  9. MITRE ATT&CK, 「ShadowRay, Campaign C0045」, https://attack.mitre.org/campaigns/C0045/, 2026년 7월 30일 확인.
  10. 10.0 10.1 Hugging Face, 「Space secrets leak disclosure」, https://huggingface.co/blog/space-secrets-disclosure, 2026년 7월 30일 확인.
  11. National Institute of Standards and Technology, 「CVE-2025-32711 Detail」, https://nvd.nist.gov/vuln/detail/CVE-2025-32711, 2026년 7월 30일 확인.
  12. Pavan Reddy·Aditya Sanjay Gujral, 「EchoLeak: The First Real-World Zero-Click Prompt Injection Exploit in a Production LLM System」, https://arxiv.org/abs/2509.10540, 2026년 7월 30일 확인.