A/B 테스트 유의성 계산기
두 그룹의 전환율을 비교하여 통계적 유의성을 z-test로 판정합니다.
A/B 테스트 계산기는 두 버전(A안·B안)의 전환율 차이가 통계적으로 유의미한지 판정하는 도구입니다. 버튼 색상, 랜딩페이지 문구, 이메일 제목 등 마케팅 의사결정에 활용됩니다. 양측 z-검정으로 p-value를 산출하고, 설정한 신뢰수준(기본 95%)에서 전환율 차이가 우연이 아닌 실제 차이인지 검증합니다. 검정력(statistical power)도 함께 제공하여 표본 충분성을 확인할 수 있습니다. 실무에서는 각 그룹 최소 1,000명 이상을 권장하며, p-value 0.05 미만 + 검정력 80% 이상일 때 결과를 신뢰할 수 있습니다.
A안 (대조군)
A안에 노출된 총 방문자 수
A안에서 발생한 전환(구매/가입) 수
B안 (실험군)
B안에 노출된 총 방문자 수
B안에서 발생한 전환(구매/가입) 수
설정
통계적 유의성 판정 기준 (보통 95%)
p-value(0.0416)가 유의수준보다 작아 통계적으로 유의미한 차이가 있습니다.
B안 대비 A안 기준 전환율 변화
양측 z-검정 p-value
실제 차이를 탐지할 확률 (80% 이상 권장)
전환율 비교
workflow
사용 방법
약 1분
A안 데이터 입력
A안(대조군)의 방문수와 전환수를 입력합니다.
B안 데이터 입력
B안(실험군)의 방문수와 전환수를 입력합니다.
신뢰수준 설정
유의성 판정 기준을 설정합니다. 일반적으로 95%를 사용합니다.
결과 확인
p-value, 전환율 차이(Uplift), 검정력을 확인하고 통계적 유의성을 판정합니다.
principle
계산 원리
A/B 테스트의 통계적 유의성 검정은 양측 z-검정(two-tailed z-test)에 기반합니다. 두 그룹의 전환율 pA와 pB가 주어졌을 때, 귀무가설 H₀: pA = pB를 설정하고, 통합 비율(pooled proportion) p̂ = (xA + xB) / (nA + nB)을 구합니다. 검정 통계량 z = (pA - pB) / √(p̂(1-p̂)(1/nA + 1/nB))를 표준정규분포와 비교하여 p-value를 산출합니다.
검정력(statistical power)은 실제로 차이가 존재할 때 이를 올바르게 감지할 확률로, 1 - β로 정의됩니다. β는 제2종 오류(실제 차이를 놓치는 오류)의 확률입니다. 검정력 80% 이상이면 표본이 충분하다고 판단하며, 이를 달성하기 위한 최소 표본 크기는 효과 크기(effect size), 유의수준(α), 검정력(1-β) 세 요소로 결정됩니다.
Uplift는 (pB - pA) / pA × 100으로 계산되며, B안이 A안 대비 전환율이 몇 퍼센트 개선되었는지를 나타냅니다. 통계적 유의성과 실질적 의미(practical significance)를 함께 고려해야 올바른 의사결정이 가능합니다.
faq
자주 묻는 질문
cases
실생활 예시
쇼핑몰 결제 버튼 색상 테스트
기존 파란 버튼(A안) 5,000명 중 전환 200건(4.0%), 빨간 버튼(B안) 5,000명 중 전환 245건(4.9%). p-value 0.032로 95% 신뢰수준에서 유의미한 차이가 확인되었습니다.
빨간 버튼으로 변경 시 전환율이 약 22.5% 상승하는 효과가 통계적으로 검증되었습니다.
이메일 제목줄 A/B 테스트
"50% 할인" 제목(A안) 오픈율 18.2%, "오늘만 반값" 제목(B안) 오픈율 19.1%. 각 그룹 2,000명. p-value 0.45로 유의미한 차이가 없었습니다.
0.9%p 차이는 우연의 범위입니다. 더 큰 차이를 만드는 제목을 새로 테스트하거나, 표본을 10,000명 이상으로 늘려 재시도해야 합니다.
SaaS 무료체험 기간 테스트
7일 무료체험(A안) 유료전환 8.3%, 14일 무료체험(B안) 유료전환 11.7%. 각 그룹 800명. p-value 0.018, 검정력 84%.
14일 체험이 유료전환율을 41% 높이는 효과가 검증되었고 검정력도 충분합니다.
모바일 앱 온보딩 화면 테스트
기존 3단계 온보딩(A안) 가입 완료율 62%, 1단계 간소화 온보딩(B안) 가입 완료율 71%. 각 그룹 3,000명. p-value 0.001, 검정력 96%.
간소화 온보딩이 가입 완료율을 14.5% 향상시키는 결과가 높은 신뢰도로 검증되었습니다. 다만 가입 후 이탈률도 함께 모니터링해야 합니다.
뉴스레터 발송 시간대 테스트
오전 8시 발송(A안) 오픈율 22.3%, 오후 6시 발송(B안) 오픈율 21.8%. 각 그룹 5,000명. p-value 0.52로 유의미한 차이 없음.
발송 시간대에 따른 오픈율 차이는 통계적으로 무의미합니다. 시간 외 다른 변수(제목, 발신자명 등)를 테스트하는 것이 더 효과적입니다.
glossary
용어 사전
- p-value
- 귀무가설이 참일 때 관측된 결과 이상의 극단적 값이 나올 확률. 0.05 미만이면 통계적으로 유의미하다고 판정합니다.
- 검정력(Power)
- 실제 차이가 존재할 때 이를 올바르게 감지할 확률. 80% 이상이 권장됩니다.
- 신뢰수준(Confidence Level)
- 귀무가설을 기각하기 위한 기준. 95%는 5% 유의수준(α=0.05)에 해당합니다.
- 전환율(Conversion Rate)
- 전체 방문자 중 목표 행동(구매, 가입 등)을 완료한 비율.
- Uplift
- B안이 A안 대비 전환율이 개선된 비율. (pB-pA)/pA × 100으로 계산합니다.
- 귀무가설(H₀)
- 두 그룹 간 차이가 없다는 기본 가정. 이 가설을 기각해야 차이가 있다고 판정합니다.
- 제1종 오류(α)
- 차이가 없는데 있다고 잘못 판정하는 오류. 유의수준(보통 5%)으로 통제합니다.
next tools