몇%
myutper
calculator bench📊몇%
비즈니스 분석

A/B 테스트 유의성 계산기

두 그룹의 전환율을 비교하여 통계적 유의성을 z-test로 판정합니다.

A/B 테스트 계산기는 두 버전(A안·B안)의 전환율 차이가 통계적으로 유의미한지 판정하는 도구입니다. 버튼 색상, 랜딩페이지 문구, 이메일 제목 등 마케팅 의사결정에 활용됩니다. 양측 z-검정으로 p-value를 산출하고, 설정한 신뢰수준(기본 95%)에서 전환율 차이가 우연이 아닌 실제 차이인지 검증합니다. 검정력(statistical power)도 함께 제공하여 표본 충분성을 확인할 수 있습니다. 실무에서는 각 그룹 최소 1,000명 이상을 권장하며, p-value 0.05 미만 + 검정력 80% 이상일 때 결과를 신뢰할 수 있습니다.

input / result surfaceLIVE

A안 (대조군)

A안에 노출된 총 방문자 수

A안에서 발생한 전환(구매/가입) 수

B안 (실험군)

B안에 노출된 총 방문자 수

B안에서 발생한 전환(구매/가입) 수

설정

통계적 유의성 판정 기준 (보통 95%)

판정 결과
B안 우세

p-value(0.0416)가 유의수준보다 작아 통계적으로 유의미한 차이가 있습니다.

A안 전환율
5.00%
B안 전환율
6.50%
전환율 차이 (Uplift)
+30.00%

B안 대비 A안 기준 전환율 변화

p-value
0.0416

양측 z-검정 p-value

통계적 검정력 (Power)
23.2%

실제 차이를 탐지할 확률 (80% 이상 권장)

전환율 비교

차트 로딩중...

workflow

사용 방법

총 소요 시간: 약 1분
01

A안 데이터 입력

A안(대조군)의 방문수와 전환수를 입력합니다.

02

B안 데이터 입력

B안(실험군)의 방문수와 전환수를 입력합니다.

03

신뢰수준 설정

유의성 판정 기준을 설정합니다. 일반적으로 95%를 사용합니다.

04

결과 확인

p-value, 전환율 차이(Uplift), 검정력을 확인하고 통계적 유의성을 판정합니다.

principle

계산 원리

A/B 테스트의 통계적 유의성 검정은 양측 z-검정(two-tailed z-test)에 기반합니다. 두 그룹의 전환율 pA와 pB가 주어졌을 때, 귀무가설 H₀: pA = pB를 설정하고, 통합 비율(pooled proportion) p̂ = (xA + xB) / (nA + nB)을 구합니다. 검정 통계량 z = (pA - pB) / √(p̂(1-p̂)(1/nA + 1/nB))를 표준정규분포와 비교하여 p-value를 산출합니다.

검정력(statistical power)은 실제로 차이가 존재할 때 이를 올바르게 감지할 확률로, 1 - β로 정의됩니다. β는 제2종 오류(실제 차이를 놓치는 오류)의 확률입니다. 검정력 80% 이상이면 표본이 충분하다고 판단하며, 이를 달성하기 위한 최소 표본 크기는 효과 크기(effect size), 유의수준(α), 검정력(1-β) 세 요소로 결정됩니다.

Uplift는 (pB - pA) / pA × 100으로 계산되며, B안이 A안 대비 전환율이 몇 퍼센트 개선되었는지를 나타냅니다. 통계적 유의성과 실질적 의미(practical significance)를 함께 고려해야 올바른 의사결정이 가능합니다.

faq

자주 묻는 질문

cases

실생활 예시

CASE 01

쇼핑몰 결제 버튼 색상 테스트

기존 파란 버튼(A안) 5,000명 중 전환 200건(4.0%), 빨간 버튼(B안) 5,000명 중 전환 245건(4.9%). p-value 0.032로 95% 신뢰수준에서 유의미한 차이가 확인되었습니다.

빨간 버튼으로 변경 시 전환율이 약 22.5% 상승하는 효과가 통계적으로 검증되었습니다.

CASE 02

이메일 제목줄 A/B 테스트

"50% 할인" 제목(A안) 오픈율 18.2%, "오늘만 반값" 제목(B안) 오픈율 19.1%. 각 그룹 2,000명. p-value 0.45로 유의미한 차이가 없었습니다.

0.9%p 차이는 우연의 범위입니다. 더 큰 차이를 만드는 제목을 새로 테스트하거나, 표본을 10,000명 이상으로 늘려 재시도해야 합니다.

CASE 03

SaaS 무료체험 기간 테스트

7일 무료체험(A안) 유료전환 8.3%, 14일 무료체험(B안) 유료전환 11.7%. 각 그룹 800명. p-value 0.018, 검정력 84%.

14일 체험이 유료전환율을 41% 높이는 효과가 검증되었고 검정력도 충분합니다.

CASE 04

모바일 앱 온보딩 화면 테스트

기존 3단계 온보딩(A안) 가입 완료율 62%, 1단계 간소화 온보딩(B안) 가입 완료율 71%. 각 그룹 3,000명. p-value 0.001, 검정력 96%.

간소화 온보딩이 가입 완료율을 14.5% 향상시키는 결과가 높은 신뢰도로 검증되었습니다. 다만 가입 후 이탈률도 함께 모니터링해야 합니다.

CASE 05

뉴스레터 발송 시간대 테스트

오전 8시 발송(A안) 오픈율 22.3%, 오후 6시 발송(B안) 오픈율 21.8%. 각 그룹 5,000명. p-value 0.52로 유의미한 차이 없음.

발송 시간대에 따른 오픈율 차이는 통계적으로 무의미합니다. 시간 외 다른 변수(제목, 발신자명 등)를 테스트하는 것이 더 효과적입니다.

glossary

용어 사전

p-value
귀무가설이 참일 때 관측된 결과 이상의 극단적 값이 나올 확률. 0.05 미만이면 통계적으로 유의미하다고 판정합니다.
검정력(Power)
실제 차이가 존재할 때 이를 올바르게 감지할 확률. 80% 이상이 권장됩니다.
신뢰수준(Confidence Level)
귀무가설을 기각하기 위한 기준. 95%는 5% 유의수준(α=0.05)에 해당합니다.
전환율(Conversion Rate)
전체 방문자 중 목표 행동(구매, 가입 등)을 완료한 비율.
Uplift
B안이 A안 대비 전환율이 개선된 비율. (pB-pA)/pA × 100으로 계산합니다.
귀무가설(H₀)
두 그룹 간 차이가 없다는 기본 가정. 이 가설을 기각해야 차이가 있다고 판정합니다.
제1종 오류(α)
차이가 없는데 있다고 잘못 판정하는 오류. 유의수준(보통 5%)으로 통제합니다.

next tools

관련 계산기