데이터 증강(Data Augmentation)

•
2026년 10월 09일 발행•2026년 10월 09일 수정
요약

기존 학습 데이터에 레이블을 보존하는 변환을 적용하거나 새 샘플을 합성하여 데이터의 양과 다양성을 늘려 모델의 일반화 성능을 높이는 기법

초급
머신러닝의 학습·검증 과정과 과대적합 개념에 대한 기본 이해가 필요하며, 이미지·텍스트·오디오 데이터의 표현 방식을 알면 각 도메인별 기법을 이해하는 데 도움이 된다.

#개념

데이터 증강(Data Augmentation)은 기존 학습 데이터에 레이블을 보존하는 변환을 적용하거나 새로운 샘플을 합성하여 학습 데이터의 양과 다양성을 인위적으로 늘리는 기법이다. 데이터 수집과 레이블링에는 큰 비용이 들고, 데이터가 부족하면 모델이 학습 데이터의 우연한 특성까지 외워 버리는 과대적합(Overfitting)이 발생하므로, 증강은 추가 레이블 없이 일반화(Generalization) 성능을 높이는 가장 비용 효율적인 수단으로 널리 쓰인다.
데이터 증강이 효과를 내는 원리는 정칙화(Regularization)로 설명된다. 이미지를 좌우로 뒤집어도 고양이는 고양이라는 사실처럼, 특정 변환에 대해 출력이 바뀌지 않아야 한다는 사전 지식을 데이터로 주입하면 모델은 그 변환에 불변인 특징을 학습하게 된다. 이론적으로는 각 학습 샘플 주변의 가상 분포에서 위험을 최소화하는 근방 위험 최소화(Vicinal Risk Minimization) 관점으로 해석되며, 가중치 감쇠나 드롭아웃과 보완적으로 작용한다.
컴퓨터 비전(Computer Vision)은 데이터 증강이 가장 체계적으로 발전한 분야다. 기본적인 이미지 증강 변환은 다음과 같다.
이미지 증강의 기본 변환
  • 기하 변환: 좌우·상하 뒤집기, 회전, 무작위 크롭과 크기 조정, 이동·전단·어파인 변환으로 객체의 위치와 자세 변화를 모사한다.
  • 색상 변환: 밝기·대비·채도·색조 조정, 그레이스케일 변환, 색상 지터로 조명과 카메라 차이를 모사한다.
  • 노이즈와 블러: 가우시안 노이즈, 가우시안 블러, JPEG 압축 열화를 더해 입력 품질 변화에 강건하게 만든다.
  • 지우기(Erasing): Cutout이나 Random Erasing처럼 이미지의 일부 영역을 가려서 모델이 한 부분에만 의존하지 않고 여러 단서를 보도록 유도한다.
두 샘플을 섞는 혼합 기반 증강은 더 강한 정칙화 효과를 낸다. Zhang 등(2018)의 Mixup은 두 이미지와 레이블을 $\tilde{x} = \lambda x_i + (1-\lambda) x_j$, $\tilde{y} = \lambda y_i + (1-\lambda) y_j$로 선형 보간하며, $\lambda$는 베타 분포 $\mathrm{Beta}(\alpha, \alpha)$에서 뽑는다. Yun 등(2019)의 CutMix는 한 이미지의 직사각형 패치를 잘라 다른 이미지에 붙이고 레이블을 패치 면적 비율로 섞어, 자연스럽지 않은 겹침 없이 지역화 능력과 분류 성능을 함께 높였다. 두 방법 모두 예측 확률의 보정(calibration)을 개선하는 부수 효과가 있다.
어떤 변환을 얼마나 강하게 적용할지는 하이퍼파라미터(Hyperparameter)이며, 이를 자동으로 찾으려는 시도가 자동 증강(AutoAugment)이다. AutoAugment는 강화 학습으로 데이터셋별 최적 증강 정책을 탐색했지만 탐색 비용이 매우 컸고, Cubuk 등(2020)의 RandAugment는 정책 탐색을 없애고 적용할 변환 수 $N$과 강도 $M$ 두 값만으로 거의 동등한 성능을 달성해 사실상의 표준이 되었다. 이후 TrivialAugment처럼 변환 하나를 무작위 강도로 적용하는 더 단순한 방법도 비슷한 효과를 보였다.
텍스트는 이산적인 기호의 열이라 작은 변화에도 문법이 깨지거나 의미가 바뀌기 쉬워 이미지보다 증강이 까다롭다. 자연어 처리(Natural Language Processing)에서 쓰이는 대표적 기법은 다음과 같다.
텍스트 증강 기법
  • EDA(Easy Data Augmentation): Wei와 Zou(2019)가 제안한 동의어 교체, 무작위 삽입, 무작위 교환, 무작위 삭제의 네 가지 단순 연산으로, 소규모 데이터 분류에서 효과가 있다.
  • 역번역(Back-translation): 문장을 다른 언어로 번역한 뒤 다시 원래 언어로 번역하여 의미는 같고 표현이 다른 문장을 얻는다.
  • 문맥 기반 교체: BERT 같은 마스크 언어 모델로 일부 단어를 가리고 문맥에 맞는 다른 단어로 바꿔 자연스러운 변형을 만든다.
  • LLM 합성: 대규모 언어 모델에 패러프레이즈, 소수 클래스 예시 생성, 지시-응답 쌍 생성을 요청하여 데이터를 대량으로 만든다.
한국어는 조사와 어미가 결합하는 교착어이므로 단어 단위 교체보다 형태소 분석(Morphological Analysis) 결과를 기준으로 증강하는 편이 문법을 덜 깨뜨린다. 대규모 언어 모델로 합성한 데이터는 가장 강력한 텍스트 증강 수단이 되었지만, 생성 모델의 편향과 오류가 그대로 학습되고, 합성 데이터로 학습한 모델의 출력으로 다시 학습하면 다양성이 줄어드는 모델 붕괴(model collapse)가 보고되며, 평가 세트와 유사한 문장이 섞여 성능이 부풀려질 수 있으므로 품질 필터링과 중복 제거가 필수다.
오디오 증강은 파형 수준과 스펙트로그램 수준으로 나뉜다. 파형 수준에서는 재생 속도와 피치 변경, 배경 잡음과 잔향 추가, 시간 이동, 음량 조절이 쓰이고, 스펙트로그램 수준에서는 Park 등(2019)의 SpecAugment가 표준이다. SpecAugment는 로그 멜 스펙트로그램에 시간 왜곡, 주파수 축의 연속 구간 마스킹, 시간 축의 연속 구간 마스킹을 적용하는 단순한 방법으로, 추가 데이터 없이 음성 인식(Speech Recognition) 오류율을 크게 낮추어 이후 거의 모든 음성 모델 학습에 포함되었다.
표 형식 데이터에서는 클래스 불균형을 완화하는 오버샘플링이 증강의 주된 형태다. Chawla 등(2002)의 SMOTE(Synthetic Minority Over-sampling Technique)는 소수 클래스 샘플과 그 k-최근접 이웃을 잇는 선분 위에서 새 샘플을 보간하여 단순 복제보다 다양한 소수 클래스 데이터를 만들며, 경계 근처에 집중하는 Borderline-SMOTE와 학습이 어려운 영역에 더 많이 생성하는 ADASYN 같은 변형이 있다. 다만 트리 기반 모델에서는 클래스 가중치 조정이 오버샘플링보다 나은 경우가 많고, 범주형 변수가 많은 표 데이터에는 CTGAN 같은 생성 모델이 쓰이기도 한다.
증강은 학습 데이터에만 적용해야 하며 검증·테스트 데이터에는 적용하지 않는다. 특히 SMOTE처럼 샘플을 합성하는 방법을 데이터 분할 전에 적용하면 같은 원본에서 나온 합성 샘플이 학습과 검증에 나뉘어 들어가 데이터 누수(Data Leakage)가 생기고 성능이 과대평가되므로, 반드시 분할 이후 또는 교차 검증(Cross Validation)의 각 폴드 내부에서만 수행해야 한다. 온라인 증강은 에포크마다 다른 변형을 보여 주므로 저장 공간 없이 사실상 무한한 변형을 만들지만 CPU 전처리가 병목이 될 수 있어, GPU에서 증강을 수행하는 라이브러리나 사전 변환 저장이 함께 고려된다.
증강의 가장 중요한 전제는 레이블 보존(Label Preservation)이다. 숫자 6을 180도 회전하면 9가 되고, 흉부 X선을 좌우 반전하면 심장 위치가 비정상으로 바뀌며, 감성 분석 문장에서 "않다"를 삭제하면 극성이 뒤집히듯이, 과제의 의미를 바꾸는 변환은 오히려 잘못된 신호를 학습시킨다. 따라서 증강 기법은 도메인 지식에 따라 선택해야 하고, 변환 강도가 지나치면 학습 데이터의 분포가 실제 테스트 분포에서 멀어지는 분포 왜곡이 일어나 성능이 떨어질 수 있으므로 검증 세트로 효과를 확인하며 조정한다.
테스트 시 증강(Test-Time Augmentation, TTA)은 추론 단계에서 입력에 여러 변환을 적용해 각각 예측한 뒤 평균을 내는 기법이다. 하나의 모델로 앙상블 학습(Ensemble Learning)과 비슷한 효과를 얻어 정확도와 예측 안정성이 높아지지만 추론 비용이 변환 수만큼 늘어나므로, 지연 시간 제약이 느슨한 의료 영상 분할이나 경진대회에서 주로 쓰이고 실시간 서비스에서는 제한적으로 사용된다.
증강은 자기지도 학습(Self-Supervised Learning)에서도 핵심 역할을 한다. SimCLR 같은 대조 학습은 한 이미지에 서로 다른 증강을 적용해 만든 두 뷰를 같은 것으로, 다른 이미지의 뷰를 다른 것으로 구분하도록 학습하므로 레이블 없이도 표현을 배울 수 있으며, 어떤 증강 조합을 쓰느냐가 학습되는 표현의 질을 결정한다.
변환이 아니라 처음부터 데이터를 만들어 내는 합성 데이터(Synthetic Data)는 증강의 확장이다. 생성적 적대 신경망(Generative Adversarial Network)과 확산 모델(Diffusion Model)로 희귀 사례의 이미지를 생성하거나, 자율주행처럼 실제 수집이 위험한 상황을 시뮬레이터로 만들며, 개인정보가 포함된 의료·금융 데이터를 통계적 성질만 유지한 합성 데이터로 대체해 공유한다. 다만 합성 데이터가 원본 샘플을 그대로 기억해 재현하면 프라이버시가 유출되고, 차분 프라이버시로 이를 막으면 유용성이 떨어지는 트레이드오프가 있어 멤버십 추론 공격 등으로 안전성을 검증해야 한다.
실무에서 자주 쓰이는 증강 도구는 다음과 같다.
데이터 증강 도구
  • torchvision transforms v2: 이미지·비디오·바운딩 박스·마스크를 함께 변환하며 RandAugment, Mixup, CutMix를 내장한다.
  • Kornia: GPU 상에서 미분 가능한 이미지 증강을 배치 단위로 수행하여 CPU 병목을 피한다.
  • nlpaug: 문자·단어·문장 수준의 텍스트 증강과 오디오 증강을 제공한다.
  • imbalanced-learn: SMOTE와 그 변형을 포함한 오버·언더샘플링 기법을 scikit-learn 호환 API로 제공한다.
전자상거래의 상품 이미지 분류와 속성 추출 모델은 판매자마다 다른 촬영 조건 때문에 증강의 효과가 크다. 배경 교체, 색상 지터, 크롭으로 조명과 구도 변화에 강건하게 만들되 색상 속성을 예측하는 모델에는 색조 변환을 빼는 식으로 레이블 보존을 지키고, 소수 카테고리는 CutMix와 LLM 합성 상품 설명으로 보강한다. 데이터 증강은 결국 "어떤 변화에 모델이 불변해야 하는가"라는 도메인 지식을 데이터로 표현하는 작업이며, 그 선택이 틀리면 데이터를 늘리고도 성능이 나빠질 수 있다는 점을 늘 염두에 두어야 한다.

#관련 용어

과대적합
모델이 학습 데이터의 우연한 특성까지 외워 새로운 데이터에서 성능이 떨어지는 현상으로, 데이터 증강이 완화하려는 주된 문제
정칙화
모델의 복잡도를 제한하거나 사전 지식을 주입하여 일반화 성능을 높이는 기법의 총칭
Mixup
두 샘플의 입력과 레이블을 선형 보간하여 새 학습 샘플을 만드는 혼합 기반 증강 기법
SMOTE
소수 클래스 샘플과 최근접 이웃 사이를 보간하여 합성 샘플을 만드는 표 데이터 오버샘플링 기법
테스트 시 증강(TTA)
추론 시 입력의 여러 변형에 대한 예측을 평균하여 정확도와 안정성을 높이는 기법
데이터 누수
검증·테스트 데이터의 정보가 학습에 섞여 성능이 과대평가되는 문제로, 분할 전 증강이 대표적 원인

#직무 연관도

DA
Data Analyst
낮음
클래스 불균형 데이터에서 오버샘플링 적용 여부를 판단하고, 증강이 모델 평가 결과에 미치는 영향을 해석한다
DS
Data Scientist
밀접
도메인별 증강 기법 선택과 강도 조정, 혼합·자동 증강 적용, 합성 데이터 생성과 효과 검증 등 모델 성능 개선의 핵심 수단으로 활용한다
DE
Data Engineer
높음
온라인 증강 파이프라인의 처리량 최적화, GPU 증강 적용, 합성 데이터 생성 파이프라인과 데이터 버전 관리를 구축한다

#사용 사례

전자상거래의료자율주행제조금융통신인터넷 서비스
개요
데이터 증강은 상품 이미지 분류와 속성 추출, 의료 영상 진단에서의 희귀 질환 데이터 보강, 자율주행 시뮬레이션 데이터 생성, 제조 라인 결함 검출의 불량 샘플 보강, 금융 사기 탐지의 불균형 완화, 음성 인식과 챗봇의 학습 데이터 확장 등 레이블 데이터가 부족하거나 불균형한 모든 머신러닝 과제에 활용된다.
사례
패션 전자상거래의 상품 카테고리 분류 모델에서 판매자별 촬영 조건 차이에 대응하기 위해 무작위 크롭, 배경 교체, 밝기·대비 조정과 CutMix를 학습 시 온라인으로 적용하고, 샘플이 적은 카테고리는 LLM으로 합성한 상품 설명으로 텍스트 입력을 보강한다. 색상 속성 예측 모델에는 색조 변환을 제외하여 레이블 보존을 지키고, 검증 세트에는 증강을 적용하지 않은 채 효과를 측정한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.