연관 분석

IT 위키
(연관분석에서 넘어옴)
Association Analysis; 연관 규칙 분석; 장바구니 분석
함께 일어나는 항목들의 규칙을 찾아내는 기법

"기저귀를 사면 맥주도 산다" 처럼 항목 사이의 동시 발생 관계를 X → Y 형태의 규칙으로 나타낸다. 거래 데이터에 많이 쓰여 장바구니 분석이라고도 한다. 목적 변수가 따로 없어 비지도 학습에 속한다.

세 가지 척도

[편집 | 원본 편집]
  • 지지도(Support) : 전체 거래 중 X 와 Y 를 함께 포함한 거래의 비율. 규칙이 얼마나 흔한지
    • 지지도 = P(X ∩ Y)
  • 신뢰도(Confidence) : X 를 산 거래 중 Y 도 산 거래의 비율. 규칙이 얼마나 잘 맞는지
    • 신뢰도 = P(X ∩ Y) / P(X)
  • 향상도(Lift) : 신뢰도를 Y 의 지지도로 나눈 값. 규칙이 우연보다 나은지
    • 향상도 = P(X ∩ Y) / (P(X)P(Y))
    • 1 이면 두 항목이 서로 독립, 1 보다 크면 양의 상관, 1 보다 작으면 음의 상관
  • 최소 지지도와 최소 신뢰도를 정한다.
  • 최소 지지도를 넘는 빈발 항목집합을 찾는다. 아프리오리 알고리즘 등을 쓴다.
  • 빈발 항목집합에서 최소 신뢰도를 넘는 규칙을 뽑는다.
  • 향상도로 규칙의 유용성을 따져 정리한다.
  • 조건과 결과가 뚜렷해 결과를 해석하기 쉽다.
  • 계산이 단순하고 목적 변수가 필요 없다.
  • 항목 수가 늘면 계산량이 지수적으로 늘어난다.
  • 너무 세분화된 품목은 지지도가 낮아 규칙이 잡히지 않는다. 적절히 묶어야 한다.
  • 상관이 있다는 것과 인과가 있다는 것은 다르다.

같이 보기

[편집 | 원본 편집]