#개념
A/B 테스트(A/B Testing)는 웹 페이지, 앱 화면, 추천 알고리즘, 가격 정책 등 서비스의 특정 변경 사항이 사용자 행동에 미치는 인과적 효과를 측정하기 위해, 사용자를 무작위(randomization)로 기존 안(A, 대조군)과 변경 안(B, 실험군)에 배정하고 두 집단의 지표 차이를 통계적으로 비교하는 실험 방법이다. 통계학에서는 이를 무작위 대조 실험(Randomized Controlled Trial, RCT)이라 부르며, 임상 시험과 농업 실험에서 발전한 실험 설계 이론이 온라인 서비스에 적용된 것이다. 무작위 배정이 핵심인 이유는 사용자의 연령, 기기, 활동성처럼 관측되거나 관측되지 않은 모든 교란 요인(confounder)이 두 집단에 기대값 기준으로 동일하게 분포하게 되어, 관찰된 지표 차이를 오직 처치(treatment)의 효과로 해석할 수 있기 때문이다. 단순히 변경 전후의 지표를 비교하는 방식은 계절성, 마케팅 캠페인, 경쟁사 동향 같은 시간 효과와 처치 효과를 분리할 수 없지만, 같은 기간에 동시에 운영되는 A/B 테스트는 이러한 교란을 설계 단계에서 제거한다. 배정은 보통 사용자 식별자를 해시하여 실험별로 독립적인 버킷(bucket)에 나누는 방식으로 구현되며, 같은 사용자는 실험 기간 내내 같은 안을 일관되게 경험해야 한다. Kohavi 등은 온라인 대조 실험이 아이디어의 가치를 가장 신뢰성 있게 평가하는 수단이라고 강조하면서도, 대부분의 아이디어가 실제로는 핵심 지표를 개선하지 못한다는 사실을 대규모 실험 경험으로 보여주었다.실험 결과의 해석은 가설 검정(Hypothesis Testing)의 틀을 따른다. 먼저 "두 안 사이에 차이가 없다"는 귀무가설(Null Hypothesis, $H_0$)을 세우고, 관측된 지표 차이가 귀무가설 아래에서 우연히 발생했을 확률인 p값(p-value)을 계산한다. p값이 사전에 정한 유의수준 $\alpha$(보통 0.05)보다 작으면 귀무가설을 기각하고 효과가 통계적으로 유의하다고 판단한다. 이때 실제로는 차이가 없는데 있다고 판단하는 오류를 제1종 오류(Type I Error), 실제로 차이가 있는데 탐지하지 못하는 오류를 제2종 오류(Type II Error)라 하며, 실제 효과가 존재할 때 이를 탐지할 확률 $1-\beta$를 검정력(Statistical Power)이라 한다. 관례적으로 검정력은 80% 이상을 목표로 한다. p값만으로는 효과의 크기를 알 수 없으므로, 효과의 추정값과 함께 그 불확실성을 나타내는 신뢰구간(Confidence Interval)을 반드시 함께 보고해야 한다. 실험을 시작하기 전에는 탐지하고자 하는 최소 효과 크기(Minimum Detectable Effect, MDE), 지표의 분산 $\sigma^2$, 유의수준, 검정력을 바탕으로 표본 크기(Sample Size)를 산정한다. 두 집단의 평균 차이를 검정하는 경우 집단당 필요한 표본 수는 근사적으로 $n \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2\sigma^2}{\delta^2}$로 계산되며, $\alpha=0.05$, 검정력 80%일 때 분자의 상수는 약 16이 되어 $n \approx 16\sigma^2/\delta^2$라는 경험 법칙으로 자주 인용된다. 이 식은 탐지하려는 효과 $\delta$가 절반으로 줄면 필요한 표본이 네 배로 늘어남을 보여 주며, 전환율처럼 분산이 큰 지표에서 작은 개선을 검증하려면 상당한 트래픽과 기간이 필요함을 뜻한다. 실험 기간은 표본 크기뿐 아니라 요일 효과와 신규성 효과(novelty effect), 사용자 학습 효과를 고려하여 최소 1~2주 이상의 완전한 주기를 포함하도록 설정하는 것이 일반적이다.실무에서 A/B 테스트의 신뢰성을 해치는 대표적인 함정은 조기 종료(peeking) 문제다. 고정 표본 검정은 실험 종료 시점에 한 번만 결과를 확인한다는 가정 위에 설계되었는데, 실험 대시보드를 매일 들여다보다가 p값이 0.05 아래로 내려가는 순간 실험을 멈추면 실제 제1종 오류율은 명목상의 5%를 훨씬 초과하게 된다. 이를 해결하는 방법으로는 표본 크기와 종료 시점을 사전에 고정하고 그 전에는 의사결정을 하지 않는 원칙적인 접근과, 여러 시점에 결과를 확인하더라도 전체 오류율이 유지되도록 설계된 순차 검정(Sequential Testing)이 있다. 순차 검정에는 임상 시험에서 발전한 그룹 순차 설계(group sequential design)와 O'Brien-Fleming 경계, 언제든지 검정할 수 있는 always-valid p값과 혼합 순차 확률비 검정(mSPRT), 그리고 사전 분포와 관측 데이터로 사후 분포를 갱신하며 판단하는 베이지안 접근이 포함된다. 또 다른 함정은 다중 비교(Multiple Comparisons) 문제다. 하나의 실험에서 수십 개의 지표와 여러 세그먼트를 동시에 검정하면 우연히 유의한 결과가 나오는 지표가 반드시 생기므로, 의사결정 지표를 사전에 소수로 한정하고 Bonferroni 보정이나 Benjamini-Hochberg의 거짓 발견율(False Discovery Rate, FDR) 통제를 적용해야 한다. 이 외에도 실험군과 대조군의 실제 배정 비율이 설계와 다르게 나타나는 표본 비율 불일치(Sample Ratio Mismatch, SRM)는 로깅 오류나 봇 트래픽, 리다이렉트 지연 같은 실험 인프라의 결함을 알리는 신호이므로, 결과를 해석하기 전에 카이제곱 검정으로 반드시 점검해야 한다. 실험군과 대조군에 동일한 처치를 적용하는 A/A 테스트는 실험 플랫폼이 명목 오류율대로 동작하는지, 배정과 로깅이 올바른지 검증하는 표준적인 방법이다.실험의 민감도를 높이는 것은 표본을 늘리는 것 외에 분산 감소(Variance Reduction) 기법으로도 가능하다. 대표적인 방법인 CUPED(Controlled-experiment Using Pre-Experiment Data)는 실험 시작 전 기간의 같은 지표(예: 실험 전 2주간의 사용자별 구매 금액)를 공변량 $X$로 사용하여 $\tilde{Y} = Y - \theta(X - \bar{X})$와 같이 조정된 지표를 만들며, 여기서 $\theta = \mathrm{Cov}(X, Y)/\mathrm{Var}(X)$이다. 실험 전 지표와 실험 중 지표의 상관이 높을수록 분산이 $1-\rho^2$의 비율로 줄어들어, 같은 표본으로 더 작은 효과를 탐지하거나 실험 기간을 크게 단축할 수 있다. 이는 실험 전 데이터가 처치와 독립이므로 편향을 만들지 않는다는 점에 근거하며, 층화(stratification)나 회귀 조정(regression adjustment), 머신러닝 모델로 공변량을 확장한 CUPAC 같은 변형도 널리 쓰인다. 지표 설계에서는 사용자 단위로 무작위화했으면서 페이지뷰나 세션 단위로 지표를 집계하면 관측치 간 상관 때문에 분산이 과소 추정되는 문제가 생기므로, 분석 단위와 무작위화 단위를 일치시키거나 델타 방법(delta method)으로 비율 지표의 분산을 올바르게 계산해야 한다. 한편 사용자 사이에 상호작용이 있는 소셜 네트워크, 양면 마켓플레이스, 배달·차량 호출 플랫폼에서는 간섭(Interference) 또는 네트워크 효과(Network Effect)가 발생하여, 한 사용자의 처치가 다른 사용자의 결과에 영향을 미치고 SUTVA(Stable Unit Treatment Value Assumption)가 깨진다. 예를 들어 실험군에게만 더 강력한 할인 쿠폰을 주면 한정된 재고나 배달 기사가 실험군으로 쏠려 대조군의 지표가 나빠지고 효과가 과대 추정된다. 이를 완화하기 위해 사용자 대신 지역이나 커뮤니티 단위로 무작위화하는 클러스터 무작위화(Cluster Randomization), 시간대를 교대로 배정하는 스위치백(switchback) 실험, 지역 단위 처치를 합성 대조군으로 평가하는 준실험 설계가 사용된다.실험을 조직적으로 운영하려면 어떤 지표로 성공을 판단할지 정하는 것이 가장 중요하다. 종합 평가 기준(Overall Evaluation Criterion, OEC)은 실험의 장기적 목표를 대변하는 하나 또는 소수의 핵심 지표로, 클릭률처럼 조작하기 쉬운 단기 지표보다 사용자 만족과 장기 가치를 반영하는 지표(예: 세션당 성공 검색 수, 재방문율, 구독 유지율)로 설계되어야 한다. OEC와 별도로 가드레일 지표(Guardrail Metric)는 실험이 개선해서는 안 되는 영역, 즉 페이지 지연 시간(Latency), 오류율, 이탈률, 매출, 광고 노출 같은 지표가 악화되지 않는지 감시하는 안전장치이며, 가드레일이 유의하게 나빠지면 OEC가 개선되어도 출시를 보류한다. 대규모 조직에서는 이러한 절차를 실험 플랫폼(Experimentation Platform)으로 자동화한다. Kohavi가 주도한 Microsoft의 ExP 플랫폼, Google, LinkedIn, Netflix 등의 플랫폼은 실험 배정과 트래픽 관리, 상호 배타적인 실험을 동시에 운영하기 위한 레이어(layer) 구조, 지표 계산 파이프라인, SRM 점검과 분산 감소를 포함한 자동 분석, 결과 대시보드를 제공하여 연간 수만 건의 실험을 소수의 분석가로 운영할 수 있게 한다. 오픈소스로는 GrowthBook, Unleash 같은 도구가 피처 플래그와 실험 분석 기능을 제공하며, 카나리 배포와 피처 플래그를 결합한 점진적 출시는 MLOps(Machine Learning Operations)의 배포 전략과도 밀접하게 연결된다.추천 시스템(Recommender System)이나 검색 랭킹 모델의 온라인 평가는 A/B 테스트의 대표적인 활용 사례다. 오프라인 평가에서는 로그 데이터로 NDCG나 정밀도 같은 모델 평가 지표(Model Evaluation Metrics)를 계산하지만, 로그가 기존 모델의 노출 정책에 의존하는 선택 편향을 안고 있어 오프라인 지표 개선이 실제 서비스 지표 개선으로 이어진다는 보장이 없다. 따라서 새 모델은 반드시 온라인 실험으로 클릭률, 전환율, 세션당 매출, 다양성 같은 지표에서 검증하며, 오프라인 지표와 온라인 지표의 상관을 지속적으로 점검하여 오프라인 평가의 신뢰성을 높인다. 랭킹 모델을 비교할 때는 인터리빙(Interleaving) 기법이 A/B 테스트보다 훨씬 민감한 대안으로 사용된다. 인터리빙은 두 랭킹 모델의 결과를 하나의 목록에 섞어 같은 사용자에게 보여주고 어느 모델이 제시한 항목이 더 많이 클릭되었는지를 세는 방식으로, 사용자 간 분산이 제거되어 A/B 테스트보다 수십에서 수백 배 적은 트래픽으로 두 모델의 상대적 우열을 판정할 수 있다. 다만 인터리빙은 어느 모델이 더 나은지는 알려주지만 매출이나 유지율 같은 비즈니스 지표의 절대적 변화량은 측정하지 못하므로, 후보 모델을 빠르게 선별한 뒤 최종 후보를 A/B 테스트로 검증하는 2단계 방식이 권장된다. 또 다른 대안은 다중 슬롯머신(Multi-Armed Bandit) 알고리즘이다. A/B 테스트가 실험 기간 내내 고정 비율로 트래픽을 나누어 열등한 안에도 계속 사용자를 노출시키는 것과 달리, 밴딧은 톰슨 샘플링이나 UCB 같은 전략으로 성과가 좋은 안에 트래픽을 점진적으로 몰아주어 실험 중 발생하는 기회비용을 줄이며, 이는 강화 학습(Reinforcement Learning)의 탐색-활용(exploration-exploitation) 문제와 직결된다. 그러나 밴딧은 적응적 배정 때문에 효과 크기의 편향 없는 추정과 신뢰구간 산출이 어렵고, 계절성이 있는 환경에서 조기에 특정 안으로 수렴할 위험이 있으므로, 인과 효과의 정밀한 측정과 장기 지표 검증이 목적이면 A/B 테스트가, 광고 소재나 제목처럼 수명이 짧은 선택지의 최적화가 목적이면 밴딧이 적합하다. 결론적으로 A/B 테스트는 데이터에 기반한 제품 의사결정의 근간이지만, 그 신뢰성은 올바른 무작위화, 사전에 정한 지표와 표본 크기, 함정에 대한 이해와 플랫폼 수준의 검증 절차 위에서만 확보된다.
#관련 용어
가설 검정
귀무가설 아래에서 관측 결과가 나타날 확률을 계산하여 처치 효과의 통계적 유의성을 판단하는 절차
검정력실제로 효과가 존재할 때 실험이 그 효과를 통계적으로 유의하게 탐지할 확률
CUPED실험 전 기간의 지표를 공변량으로 사용하여 지표의 분산을 줄이고 실험 민감도를 높이는 기법
종합 평가 기준(OEC)실험의 성공 여부를 판단하기 위해 사전에 정의한 장기 목표를 대변하는 핵심 지표
모델 평가 지표모델의 성능을 정량적으로 측정하는 지표로, 오프라인 평가와 온라인 실험 결과를 연결하는 기준
추천 시스템사용자에게 적합한 항목을 예측하여 제시하는 시스템으로, 온라인 A/B 테스트로 최종 성능을 검증하는 대표적 대상
#직무 연관도
DAData Analyst밀접
제품 변경의 효과를 측정하고 p값·신뢰구간·가드레일 지표를 해석하여 출시 여부를 판단하는 데이터 기반 의사결정의 근간
DSData Scientist밀접
새로운 모델과 알고리즘의 실제 효과를 인과적으로 검증하고, 실험 설계·표본 산정·분산 감소를 통해 신뢰할 수 있는 결론을 도출하는 핵심 방법론
DEData Engineer높음
실험 배정과 피처 플래그, 로깅 파이프라인, 지표 계산과 SRM 점검을 포함한 실험 플랫폼을 구축·운영하는 데 직접 활용된다
#사용 사례
전자상거래인터넷 서비스미디어금융게임교육
개요
A/B 테스트는 추천·검색 모델의 온라인 평가, UI·UX 변경, 가격과 프로모션 정책, 알림·이메일 마케팅 문구, 온보딩 흐름 개선 등 사용자 행동에 영향을 미치는 모든 제품 변경의 효과 검증에 활용되며, 실험 플랫폼을 통해 조직 전체의 데이터 기반 의사결정 문화를 뒷받침한다.
사례전자상거래 플랫폼이 새로운 추천 모델을 도입할 때, 사용자 식별자 해시로 50%를 기존 모델(대조군), 50%를 새 모델(실험군)에 배정하고 2주간 운영한다. 실험 전 2주간의 사용자별 구매 금액을 공변량으로 CUPED를 적용해 분산을 줄인 뒤, 세션당 구매 전환율을 OEC로, 페이지 로딩 시간과 반품률을 가드레일 지표로 삼아 분석한다. 표본 비율 불일치가 없음을 확인하고 전환율의 95% 신뢰구간이 0을 포함하지 않으며 가드레일 지표가 악화되지 않았을 때만 새 모델을 전면 배포한다.
#참고 자료
#추천 포스트
© 2024 diki All rights reserved.