카나나 세이프가드

IT 위키

카나나 세이프가드(Kanana Safeguard)는 카카오가 자체 대형 언어 모델 Kanana를 기반으로 개발한 한국어·한국 문화 특화 인공지능(AI) 가드레일 모델 시리즈로, 생성형 AI의 유해 콘텐츠, 법적·정책적 위험 및 프롬프트 공격을 탐지하기 위해 설계되었다.[1]

카나나 세이프가드는 생성형 AI 서비스에서 사용자가 입력하는 프롬프트와 AI가 생성하는 응답에 포함될 수 있는 위험 요소를 분류하는 AI 가드레일이다. 카카오는 2025년 5월 27일 카나나 세이프가드를 공개했으며, 모델을 허깅 페이스(Hugging Face)를 통해 오픈소스로 배포했다.[2]

카카오의 자체 언어 모델인 Kanana를 기반으로 하며, 한국어의 언어적 특성과 한국의 문화적 맥락을 반영한 자체 데이터셋을 사용한다. 카카오는 전문 라벨러가 작성한 데이터를 가공·증강하고 일부 공개 외부 데이터를 결합해 학습 데이터를 구성했다.[3]

카나나 세이프가드는 하나의 범용 모델이 모든 위험을 판단하는 구조가 아니라 위험의 성격과 필요한 입력 정보에 따라 세 종류의 모델로 나뉜다. 카카오는 서로 다른 위험을 하나의 모델에서 처리할 경우 판단 기준이 모호해지고 성능이 희석될 수 있다는 점 등을 이러한 설계의 이유로 설명하고 있다.[3]

카나나 세이프가드 시리즈는 Kanana Safeguard, Kanana Safeguard-Siren, Kanana Safeguard-Prompt의 세 모델로 구성된다.[4]

모델 규모 주요 입력 주요 탐지 대상
Kanana Safeguard 8B 사용자 발화, AI 응답 유해 콘텐츠
Kanana Safeguard-Siren 8B 사용자 발화 법적·정책적 위험
Kanana Safeguard-Prompt 2.1B 사용자 발화 프롬프트 공격

Kanana Safeguard

[편집 | 원본 편집]

Kanana Safeguard는 Kanana 8B를 기반으로 사용자의 발화 또는 AI 어시스턴트의 답변에 유해한 내용이 포함되어 있는지를 분류하는 모델이다.[5]

위험 분류 체계는 MLCommons의 분류 체계를 기반으로 한국 환경에 필요한 항목을 추가해 구성했으며, 다음 7개 범주를 탐지한다.[5]

코드 위험 범주
S1 증오(Hate)
S2 괴롭힘(Harassment)
S3 성적 콘텐츠(Sexual Content)
S4 범죄(Criminal Activities)
S5 아동 성착취(Child Sexual Exploitation)
S6 자살 및 자해(Suicide & Self-Harm)
S7 잘못된 정보(Misinformation)

사용자의 입력만 검사할 수도 있고, 사용자 입력과 그에 대한 AI의 답변을 함께 고려해 응답의 위험성을 판별하는 방식으로 사용할 수도 있다.

Kanana Safeguard-Siren

[편집 | 원본 편집]

Kanana Safeguard-Siren은 단순한 유해성보다 법적·정책적으로 주의가 필요한 사용자 요청을 탐지하는 8B 모델이다. 미성년자 제한 콘텐츠, 전문적인 조언이 필요한 영역, 개인정보, 지식재산권 등과 관련된 요청을 판별하도록 설계되었다.[6]

예를 들어 개인정보와 관련된 요청이나 전문적 판단이 요구되는 질문처럼, 그 자체가 일반적인 유해 콘텐츠에 해당하지 않더라도 서비스 제공 과정에서 별도의 주의가 필요한 요청을 탐지하는 데 활용할 수 있다.

Kanana Safeguard-Prompt

[편집 | 원본 편집]

Kanana Safeguard-Prompt는 2.1B 규모의 모델로, 사용자가 AI 시스템을 조작하거나 원래의 지시를 우회하도록 시도하는 적대적 프롬프트를 탐지한다. 주요 탐지 대상은 다음과 같다.[3]

  • A1 — Prompt Injection: 시스템이나 개발자가 설정한 원래 지시를 무시하거나 우회하도록 유도하는 프롬프트 인젝션 공격
  • A2 — Prompt Leaking: 공개되지 않은 시스템 프롬프트 등의 내부 지시를 노출하도록 유도하는 공격

다른 두 모델보다 작은 2.1B 모델을 사용하여 비교적 단순한 프롬프트 공격 분류를 효율적으로 처리하도록 구성했다.[3]

동작 방식

[편집 | 원본 편집]

카나나 세이프가드 시리즈는 입력 문장에 대해 장문의 자연어 설명을 생성하는 대신 안전 여부와 위험 유형을 나타내는 정해진 결과를 반환하는 분류 모델로 사용할 수 있다.

대표적인 출력 형태는 다음과 같다.[3]

출력 예 의미
<SAFE> 탐지된 위험 없음
<UNSAFE-S1> Kanana Safeguard에서 S1 유형의 유해 콘텐츠 탐지
<UNSAFE-I1> Kanana Safeguard-Siren에서 I1 유형의 법적·정책적 위험 탐지
<UNSAFE-A1> Kanana Safeguard-Prompt에서 A1 유형의 프롬프트 공격 탐지

이러한 문자열은 외관상 여러 토큰으로 보일 수 있으나 모델 학습 과정에서는 각각 하나의 고정된 단일 토큰으로 취급되도록 설계되었다. 따라서 여러 토큰에 걸쳐 설명을 생성하는 방식보다 출력 생성 횟수를 줄이고 결과 형식을 일정하게 유지할 수 있다. 카카오는 실제 AI 서비스에서 대량의 요청을 실시간으로 검사해야 한다는 점을 고려해 이러한 방식을 채택했다고 설명한다.[3]

한국어 특화

[편집 | 원본 편집]

카나나 세이프가드의 특징 가운데 하나는 한국어와 한국 문화에 특화된 학습 데이터를 사용한다는 점이다. 카카오는 영어 중심의 해외 가드레일 모델이 한국어의 어순, 높임말, 은유, 인터넷 유행어 및 한국의 문화적 맥락을 충분히 포착하기 어렵다는 문제를 고려해 자체 데이터셋을 구축했다.[3]

2025년 공개 당시 각 모델에 사용된 데이터 규모는 다음과 같이 설명되었다.[3]

모델 데이터 규모
Kanana Safeguard 약 36,000개
Kanana Safeguard-Siren 약 11,000개
Kanana Safeguard-Prompt 약 200,000개

카카오는 자체 구축한 독립적인 한국어 평가 데이터셋에서 정밀도(Precision), 재현율(Recall), F1 점수(F1 Score)를 이용해 모델을 평가했으며, 공개 당시 비교 대상으로 사용한 해외 가드레일 모델보다 높은 한국어 분류 성능을 기록했다고 밝혔다.[4] 다만 가드레일 모델마다 안전·위험을 구분하는 정책과 분류 체계가 다르므로 이러한 벤치마크 결과는 절대적인 모델 우열보다는 해당 평가 조건에서의 상대적 성능으로 해석할 필요가 있다.[3]

공개 및 라이선스

[편집 | 원본 편집]

카카오는 2025년 5월 세 모델을 Hugging Face에 공개했다. 공개 모델에는 Apache License 2.0이 적용되어 상업적 이용, 수정 및 재배포가 가능하다.[2]

카카오는 이를 국내 기업이 한국어 기반 AI 가드레일 모델을 오픈소스로 공개한 최초 사례라고 설명했으며, AI 안전 기술을 특정 서비스 내부에서만 사용하는 것이 아니라 외부 개발자와 기업도 활용할 수 있도록 공개한다는 취지를 밝혔다.[2]

카나나 세이프가드는 대형 언어 모델 자체를 대체하는 모델이 아니라, 생성형 AI 서비스의 입력이나 출력을 검사하는 안전 계층으로 활용할 수 있다. 예를 들어 사용자 입력을 LLM에 전달하기 전에 프롬프트 공격이나 위험 요청을 검사하고, LLM이 생성한 답변을 사용자에게 전달하기 전에 유해성을 다시 검사하는 방식으로 구성할 수 있다.

2026년에는 실제 카카오 기반 서비스에도 적용 사례가 확인되었다. 카카오와 행정안전부가 2026년 3월 공개한 카카오톡 기반 AI 국민비서 시범 서비스에는 자체 Kanana 모델과 함께 Kanana Safeguard가 적용되어 서비스의 안전성과 신뢰성을 보완했다.[7]

같이 보기

[편집 | 원본 편집]
  1. 카카오, 「카카오, AI 안전성 검증 위한 가드레일 모델 ‘Kanana Safeguard’ 공개... 생태계 활성화 위해 국내 기업 최초 오픈소스로 배포」, https://www.kakaocorp.com/page/detail/11568, 2026년 8월 11일 확인.
  2. 2.0 2.1 2.2 카카오, 「카카오, AI 안전성 검증 위한 가드레일 모델 ‘Kanana Safeguard’ 공개... 생태계 활성화 위해 국내 기업 최초 오픈소스로 배포」, https://www.kakaocorp.com/page/detail/11568, 2026년 8월 11일 확인.
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 3.8 카카오 기술블로그, 「카카오 AI 가드레일 모델, Kanana Safeguard 시리즈를 소개합니다.」, https://tech.kakao.com/posts/705, 2026년 8월 11일 확인.
  4. 4.0 4.1 카카오, 「안전한 AI 서비스를 위한 가드레일 'Safeguard by Kanana’」, https://www.kakaocorp.com/page/detail/11567, 2026년 8월 11일 확인.
  5. 5.0 5.1 Kakao Corp., 「kakaocorp/kanana-safeguard-8b」, https://huggingface.co/kakaocorp/kanana-safeguard-8b, 2026년 8월 11일 확인.
  6. 카카오, 「AI Hub」, https://www.kakaocorp.com/page/ai, 2026년 8월 11일 확인.
  7. 카카오, 「Kakao Launches “AI National Secretary” Pilot Service in Collaboration with Ministry of the Interior and Safety」, https://www.kakaocorp.com/page/detail/11991, 2026년 8월 11일 확인.