일반화(Generalization)

•
2026년 10월 09일 발행•2026년 10월 09일 수정
요약

머신러닝 모델이 학습 데이터가 아닌 처음 보는 새로운 데이터에 대해서도 정확한 예측을 수행하는 능력

중급
손실 함수와 기댓값 등 기초 확률·통계 개념과 과대적합·과소적합, 정칙화, 교차 검증에 대한 이해가 필요하며, 일반화 경계와 이중 하강을 깊이 이해하려면 통계적 학습 이론의 기초를 알면 도움이 된다.

#개념

일반화(Generalization)는 머신러닝(Machine Learning) 모델이 학습에 사용한 데이터가 아니라 한 번도 본 적 없는 새로운 데이터에 대해서도 정확한 예측을 하는 능력이다. 모델의 목적은 학습 데이터를 암기하는 것이 아니라 데이터를 만들어 낸 숨은 규칙을 포착하는 것이므로, 일반화는 머신러닝의 핵심 목표이자 모델이 실제 서비스에서 가치를 가질 수 있는지를 결정하는 기준이 된다.
일반화를 정량적으로 다루기 위해서는 두 종류의 오차를 구분해야 한다. 데이터가 어떤 분포 $\mathcal{D}$에서 생성된다고 할 때, 모델 $f$가 그 분포 전체에서 범하는 기대 손실 $R(f) = \mathbb{E}_{(x,y)\sim\mathcal{D}}[\ell(f(x), y)]$를 일반화 오차(Generalization Error) 또는 기대 위험(expected risk)이라 하고, 학습 데이터 $n$개에서 측정한 평균 손실 $\hat{R}(f) = \frac{1}{n}\sum_{i=1}^{n}\ell(f(x_i), y_i)$를 경험 위험(empirical risk)이라 한다.
우리가 실제로 최소화할 수 있는 것은 경험 위험뿐이지만 정말 관심 있는 것은 일반화 오차이며, 두 값의 차이 $R(f) - \hat{R}(f)$를 일반화 격차(Generalization Gap)라고 부른다. 분포 $\mathcal{D}$를 직접 알 수 없으므로 일반화 오차는 학습에 쓰지 않은 별도의 테스트 데이터로 추정하며, 이때 테스트 데이터가 운영 환경의 분포를 대표해야 추정이 의미를 가진다.
일반화 격차가 크다는 것은 모델이 학습 데이터의 우연한 특징이나 잡음까지 외워 버렸다는 뜻이며, 이것이 과대적합(Overfitting)이다. 반대로 모델이 너무 단순하여 학습 데이터조차 제대로 설명하지 못하면 학습 오차와 일반화 오차가 모두 높은 과소적합(Underfitting) 상태가 된다. 따라서 좋은 일반화는 학습 오차를 충분히 낮추면서도 일반화 격차를 작게 유지하는 두 조건을 동시에 만족해야 하며, 모델 복잡도를 조절하는 일은 이 둘 사이의 균형을 찾는 과정이다.
이 균형을 설명하는 고전적인 틀이 편향-분산 트레이드오프(Bias-Variance Tradeoff)이다. 제곱 손실을 사용하는 회귀 문제에서, 학습 데이터를 다르게 추출할 때마다 달라지는 모델의 기대 예측 오차는 다음 세 항으로 분해된다. $\mathbb{E}[(y - \hat{f}(x))^2] = \text{Bias}[\hat{f}(x)]^2 + \text{Var}[\hat{f}(x)] + \sigma^2$
편향-분산 분해의 세 항
  • 편향(Bias): 여러 학습 데이터셋에서 얻은 모델의 평균 예측과 참값 사이의 체계적인 차이로, 모델이 너무 단순해 참 함수를 표현하지 못할 때 커진다.
  • 분산(Variance): 학습 데이터가 조금 바뀔 때 모델의 예측이 얼마나 흔들리는지를 나타내며, 모델이 복잡하여 데이터의 잡음에 민감하게 반응할 때 커진다.
  • 줄일 수 없는 오차(Irreducible Error): 데이터 자체에 내재한 잡음 $\sigma^2$로, 어떤 모델로도 제거할 수 없는 하한이다.
전통적인 관점에서 모델 복잡도를 높이면 편향은 줄고 분산은 늘어나므로, 테스트 오차는 U자 곡선을 그리며 그 최저점이 최적 복잡도가 된다. 이 그림은 결정 트리의 깊이나 다항식의 차수처럼 복잡도를 직접 조절하는 모델에서 잘 들어맞으며, 모델 선택과 하이퍼파라미터(Hyperparameter) 탐색의 직관적 근거로 널리 쓰인다.
학습 이론은 일반화 격차가 얼마나 커질 수 있는지를 확률적으로 보장하는 일반화 경계(Generalization Bound)를 제공한다. Valiant의 PAC 학습(Probably Approximately Correct Learning) 프레임워크는 "충분한 표본이 주어지면 높은 확률($1-\delta$)로 오차가 $\epsilon$ 이내인 가설을 찾을 수 있다"는 형태로 학습 가능성을 정의하고, 이를 위해 필요한 표본 수(표본 복잡도)를 가설 공간의 크기에 연결한다. 가설 공간이 유한하면 표본 복잡도는 가설 수의 로그에 비례한다.
무한한 가설 공간에는 Vapnik과 Chervonenkis가 제안한 VC 차원(VC Dimension)이 쓰인다. VC 차원은 가설 공간이 임의의 레이블 조합을 모두 완벽히 분리(shatter)할 수 있는 점의 최대 개수로, 모델의 표현력을 측정하는 조합적 척도이다. 이를 이용하면 높은 확률로 $R(f) \le \hat{R}(f) + O\!\left(\sqrt{\frac{d_{VC}\log n + \log(1/\delta)}{n}}\right)$ 꼴의 경계가 성립하며, 표본이 많을수록 격차가 줄고 표현력이 클수록 격차가 커진다는 직관을 수식으로 뒷받침한다. 이 밖에 라데마허 복잡도(Rademacher complexity), 안정성(stability), PAC-Bayes 등 더 정밀한 경계 이론이 발전해 왔다.
그러나 Zhang 등(2017)은 표준적인 심층 신경망(Deep Learning)이 레이블을 무작위로 뒤섞은 데이터조차 완벽히 암기할 수 있음을 보였다. 이는 신경망의 VC 차원이 사실상 표본 수를 훨씬 넘어서 고전적 경계가 무의미한 값(vacuous)이 된다는 뜻이며, 그런데도 같은 신경망이 실제 데이터에서는 잘 일반화하는 현상은 명시적 정칙화만으로 설명되지 않는다. 이후 연구는 확률적 경사 하강법이 평평한 최솟값(flat minima)이나 작은 노름의 해를 선호하는 암묵적 정칙화(implicit regularization), 그리고 데이터 자체의 구조에서 그 답을 찾고 있다.
이 현상을 극적으로 보여 주는 것이 이중 하강(Double Descent)이다. Belkin 등(2019)과 Nakkiran 등(2019)은 모델 크기를 계속 키우면 테스트 오차가 고전적 U자 곡선의 최저점을 지나 다시 상승하다가, 모델이 학습 데이터를 정확히 맞출 수 있는 보간 임계점(interpolation threshold)을 넘어서면 오히려 다시 감소함을 보였다. 매개변수 수가 표본 수와 비슷한 임계점 부근에서는 데이터를 겨우 맞추는 유일한 해가 매우 불안정해 분산이 폭발하지만, 과매개변수화 영역에서는 데이터를 맞추는 해가 무수히 많아지고 그중 가장 단순한 해가 선택되어 일반화가 좋아진다는 것이 핵심 설명이다.
이중 하강은 모델 크기뿐 아니라 학습 에포크 수와 데이터 양에 대해서도 나타나며, "더 큰 모델과 더 많은 데이터가 오히려 해로울 수 있는" 구간이 존재함을 경고한다. 실무적으로는 임계점 부근을 피해 모델을 충분히 크게 만들거나, 반대로 정칙화와 조기 종료로 임계점 아래에 머무르는 두 전략이 모두 가능하다.
지금까지의 논의는 학습 데이터와 테스트 데이터가 같은 분포에서 독립적으로 추출된다는 i.i.d. 가정 위에 서 있다. 그러나 실제 서비스에서는 시간이 흐르면서 데이터 드리프트(Data Drift)가 일어나고, 학습 당시와 다른 지역·기기·사용자층의 데이터가 유입되며, 학습 데이터에 없던 조합이 등장한다. 이렇게 분포가 바뀐 상황에서도 성능을 유지하는 능력을 분포 외 일반화(Out-of-Distribution Generalization, OOD Generalization)라 하며, 분포 내 일반화와 구분한다.
OOD 일반화가 어려운 근본 원인은 모델이 인과적 특징 대신 학습 데이터에만 존재하는 허위 상관(Spurious Correlation)에 의존하기 때문이다. 초원 배경으로 소를 인식하는 모델이 해변의 소를 놓치는 것이 전형적인 예다. 이를 완화하기 위해 여러 환경에서 공통적으로 유효한 불변 표현을 학습하는 불변 위험 최소화(Invariant Risk Minimization), 최악의 하위 집단 성능을 최적화하는 분포적 강건 최적화(Distributionally Robust Optimization), 대규모 전이 학습(Transfer Learning)과 사전 학습, 도메인 일반화를 위한 데이터 증강(Data Augmentation) 등이 연구되고 있으며, 테스트 분포가 어떻게 다른지에 따라 효과적인 방법이 달라진다.
실무에서 일반화를 높이는 전략은 모델, 데이터, 검증의 세 축으로 정리할 수 있다. 먼저 모델 측면의 정칙화(Regularization)는 모델이 학습 데이터에 과도하게 맞추지 못하도록 제약을 가하는 모든 기법을 가리키며, 대표적인 방법은 다음과 같다.
일반화를 위한 정칙화 전략
  • 가중치 벌점(Weight Penalty): L1·L2 정칙화처럼 손실 함수(Loss Function)에 가중치 노름 항을 더해 큰 가중치를 억제하고 모델을 단순하게 유지한다.
  • 드롭아웃(Dropout): 학습 중 뉴런을 무작위로 끄는 방식으로 특정 뉴런 조합에 의존하는 공적응(co-adaptation)을 막아 앙상블과 유사한 효과를 낸다.
  • 조기 종료(Early Stopping): 검증 오차가 더 이상 줄지 않으면 학습을 멈춰, 학습이 길어질수록 잡음까지 학습하는 것을 방지한다.
  • 구조적 제약: 합성곱의 가중치 공유나 어텐션의 구조처럼 문제의 성질에 맞는 귀납적 편향(inductive bias)을 모델 구조에 심어 탐색해야 할 가설 공간을 줄인다.
  • 앙상블(Ensemble Learning): 서로 다른 모델의 예측을 평균하여 분산을 줄이며, 배깅과 랜덤 포레스트가 대표적이다.
데이터 측면에서 가장 강력한 수단은 더 많고 더 다양한 데이터다. 일반화 경계가 보여 주듯 표본 수 $n$이 늘면 격차는 $1/\sqrt{n}$에 비례해 줄어들며, 데이터 증강은 레이블을 보존하는 변환으로 사실상 데이터를 늘리는 효과를 낸다. 또한 대규모 데이터로 사전 학습한 모델을 미세 조정(Fine-tuning)하면 적은 데이터로도 좋은 일반화에 도달할 수 있으며, 특징 정규화와 이상치 처리 같은 특징 공학(Feature Engineering)도 모델이 잡음에 휘둘리지 않도록 돕는다.
검증 측면에서는 일반화 오차를 편향 없이 추정하는 절차가 필요하다. 데이터를 학습·검증·테스트 집합으로 나누고, 하이퍼파라미터 선택은 검증 집합으로만 하며, 테스트 집합은 최종 보고에 단 한 번 사용하는 것이 원칙이다. 데이터가 적을 때는 교차 검증(Cross Validation)으로 추정의 분산을 줄이고, 시계열 데이터는 시간 순으로 분할하며, 같은 사용자나 환자의 샘플이 학습과 테스트에 함께 섞이지 않도록 그룹 단위로 분할해야 한다. 분할 전에 전처리 통계를 전체 데이터로 계산하는 데이터 누수(Data Leakage)는 일반화 성능을 실제보다 크게 부풀리는 흔한 실수이므로 특히 주의해야 한다.
추천 시스템(Recommender System)과 같은 서비스 모델에서 일반화는 오프라인 지표와 온라인 성과의 괴리로 나타나는 경우가 많다. 학습 데이터는 과거 모델이 노출한 상품에 대한 반응만 담고 있어 노출되지 않은 상품으로의 일반화를 보장하지 못하고, 신규 상품과 신규 사용자는 학습 분포 밖에 놓이며, 계절과 유행의 변화는 분포 이동을 일으킨다. 따라서 시간 순 검증, 콜드 스타트 집단에 대한 별도 평가, 그리고 A/B 테스트(AB Testing)를 통한 온라인 검증이 오프라인 지표를 보완하는 필수 절차가 된다.
결론적으로 일반화는 "학습 데이터를 얼마나 잘 맞추는가"가 아니라 "세상의 새로운 데이터를 얼마나 잘 다루는가"의 문제이다. 고전 이론은 복잡도와 표본 수의 관계를 설명하고, 심층 학습의 이중 하강과 암묵적 정칙화는 그 이론이 다시 쓰이고 있음을 보여 주며, 분포 이동은 i.i.d. 가정 바깥에서의 일반화를 요구한다. 실무자는 이 세 층위를 함께 염두에 두고 정칙화, 데이터, 검증 전략을 설계해야 한다.

#관련 용어

과대적합
모델이 학습 데이터의 잡음까지 학습하여 새로운 데이터에서 성능이 떨어지는 현상
과소적합
모델이 너무 단순하여 학습 데이터의 패턴조차 충분히 학습하지 못하는 현상
편향
여러 학습 데이터셋에서 얻은 모델의 평균 예측과 참값 사이의 체계적 차이
정칙화
모델의 복잡도에 제약을 가해 과대적합을 억제하고 일반화를 높이는 기법의 총칭
교차 검증
데이터를 여러 분할로 나누어 학습과 평가를 반복함으로써 일반화 오차를 추정하는 절차
데이터 드리프트
운영 데이터의 분포가 학습 시점과 달라져 분포 외 일반화가 요구되는 상황

#직무 연관도

DA
Data Analyst
보통
오프라인 지표와 실제 성과의 괴리를 해석하고, 검증 데이터 분할과 지표 해석이 타당한지 검토하는 데 활용된다
DS
Data Scientist
밀접
모델 복잡도 선택, 정칙화 설계, 검증 전략 수립과 분포 이동 대응 등 모델링의 모든 단계에서 핵심이 되는 개념
DE
Data Engineer
보통
학습·서빙 분포의 일관성 유지, 재학습 주기 설계, 온라인 성능 모니터링을 통해 배포 모델의 일반화를 보장하는 데 관여한다

#사용 사례

전자상거래금융의료제조인터넷 서비스자율주행
개요
일반화는 추천·검색 랭킹, 신용 평가, 의료 영상 진단, 설비 결함 검출, 자율주행 인지 모델처럼 학습 데이터와 다른 환경에서 모델이 안정적으로 동작해야 하는 모든 머신러닝 응용의 전제 조건이며, 모델 선택·정칙화·검증 설계의 기준으로 활용된다.
사례
패션 전자상거래의 상품 추천 모델이 오프라인 검증에서는 높은 정확도를 보였지만 온라인 A/B 테스트에서는 개선이 없었다. 원인을 분석한 결과 무작위 분할로 미래 데이터가 학습에 섞였고, 신규 상품에 대한 일반화가 부족했음이 드러나, 시간 순 분할과 콜드 스타트 상품 별도 평가로 검증 절차를 바꾸고 상품 속성 기반 특징과 드롭아웃을 추가해 격차를 줄였다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.