지니 지수

IT 위키
Gini Index; 지니 계수; 지니 불순도
집합에 서로 다른 범주가 얼마나 섞여 있는지를 나타내는 불순도(Impurity) 측정값

의사결정 나무에서 어떤 변수로 어떻게 나눌지 고를 때 쓴다.

범주가 k 개이고 각 범주의 비율이 p₁ … p_k 일 때

Gini = 1 − Σ pᵢ²
  • 모두 한 범주면(완전 순수) 0
  • 두 범주가 반반이면 1 − (0.5² + 0.5²) = 0.5 로 최대
  • 값이 작을수록 순수하다. 분리 후 지니 지수가 가장 많이 줄어드는 분할을 고른다

한 노드에 A 가 6개, B 가 4개 있으면

1 − (0.6² + 0.4²) = 1 − (0.36 + 0.16) = 0.48

의사결정나무의 분리 기준

[편집 | 원본 편집]
목표변수 분리 기준
범주형 (분류나무) 카이제곱 통계량, 지니 지수, 엔트로피 지수
연속형 (회귀나무) 분산 감소량, F-통계량
  • 분산 감소량은 연속형 목표변수에 쓴다. 범주형 변수의 분리 기준이 아니다.

경제학의 지니 계수와 다르다

[편집 | 원본 편집]

소득 불평등을 재는 지니 계수(로렌츠 곡선 기반)와 이름이 같지만 계산식과 용도가 다르다. 데이터 과학에서 지니 지수라 하면 위의 불순도 측정값을 말한다.

같이 보기

[편집 | 원본 편집]