#개념
오토인코더(Autoencoder)는 입력 $x$를 그대로 출력으로 재현하도록 학습하는 신경망(Neural Network)으로, 입력을 저차원의 잠재 표현(Latent Representation) $z$로 압축하는 인코더(Encoder) $z = f(x)$와, 잠재 표현으로부터 입력을 복원하는 디코더(Decoder) $\hat{x} = g(z)$의 두 부분으로 구성된다. 인코더와 디코더 사이의 가장 좁은 층을 병목(Bottleneck)이라 부르며, 정답 레이블 없이 입력 자체를 목표로 삼기 때문에 비지도 학습(Unsupervised Learning) 또는 자기지도 학습(self-supervised learning)으로 분류된다. 학습 목표는 입력과 복원 결과의 차이인 재구성 손실(Reconstruction Loss)을 최소화하는 것으로, 연속값 입력에는 평균 제곱 오차 $\|x - \hat{x}\|^2$, 이진 또는 $[0, 1]$ 범위의 입력에는 이진 교차 엔트로피가 주로 사용되며, 역전파(Backpropagation)와 경사 하강법(Gradient Descent)으로 인코더와 디코더의 가중치(Weight)가 동시에 최적화된다. 만약 병목의 차원이 입력과 같거나 크고 아무 제약이 없다면 네트워크는 입력을 그대로 복사하는 항등 함수를 학습해 버리므로, 오토인코더 설계의 핵심은 항등 사상을 배우지 못하도록 어떤 제약을 두어 데이터의 본질적인 구조만 잠재 공간에 담게 만드는 데 있다. 가장 기본적인 제약은 병목 차원을 입력보다 작게 만드는 과소완전(Undercomplete) 오토인코더로, 제한된 용량 안에서 재구성 오차를 줄이려면 데이터의 가장 중요한 변동 방향을 우선적으로 부호화해야 하므로 자연스럽게 차원 축소(Dimensionality Reduction)가 이루어진다. 이때 인코더와 디코더가 모두 선형이고 손실이 평균 제곱 오차라면 오토인코더가 학습하는 부분 공간은 주성분 분석(Principal Component Analysis, PCA)의 상위 주성분이 생성하는 부분 공간과 동일하다는 사실이 알려져 있다. 즉 오토인코더는 PCA의 비선형 일반화이며, 활성화 함수(Activation Function)를 포함한 다층 구조를 통해 PCA가 포착하지 못하는 굽은 저차원 다양체(manifold)를 학습할 수 있다. Hinton과 Salakhutdinov(2006)는 제한 볼츠만 머신으로 층별 사전 학습한 심층 오토인코더가 PCA보다 훨씬 좋은 저차원 표현을 만든다는 것을 보여 딥러닝(Deep Learning) 부흥의 계기를 마련했다.병목의 차원을 줄이지 않고도 항등 사상을 막는 여러 정칙화된(Regularized) 오토인코더가 제안되었다. 희소 오토인코더(Sparse Autoencoder)는 잠재 차원이 입력보다 크더라도 손실 함수에 은닉 유닛 활성화의 L1 페널티나 평균 활성화가 작은 목표값을 따르도록 하는 KL 발산 항을 추가하여, 각 입력에 대해 소수의 유닛만 활성화되도록 강제한다. 이 방식은 뇌의 희소 부호화와 유사하게 해석 가능한 특징 검출기를 학습하며, 최근에는 대규모 언어 모델(Large Language Models, LLM)의 내부 활성화를 희소 오토인코더로 분해하여 개별 뉴런에 얽힌 개념을 분리하는 기계적 해석 가능성 연구에 활용된다. 디노이징 오토인코더(Denoising Autoencoder, DAE)는 Vincent 등(2008, 2010)이 제안한 방법으로, 입력에 가우시안 잡음이나 마스킹 잡음을 가해 손상시킨 $\tilde{x}$를 인코더에 넣고 원래의 깨끗한 $x$를 복원하도록 학습한다. 잡음이 섞인 입력에서 원본을 복구하려면 데이터 다양체의 구조를 알아야 하므로 단순 복사로는 손실을 줄일 수 없고, 결과적으로 잡음에 강건한 표현이 학습된다. Vincent 등은 디노이징 오토인코더를 층층이 쌓아 심층 신경망을 사전 학습하는 적층 디노이징 오토인코더(Stacked Denoising Autoencoder)가 분류 성능을 크게 향상시킨다는 것을 보였고, 이 아이디어는 입력 이미지 패치의 대부분을 가리고 복원하는 마스크드 오토인코더(Masked Autoencoder, MAE)로 이어져 비전 트랜스포머(Vision Transformer)의 자기지도 사전 학습 방법으로 발전했다. 축소 오토인코더(Contractive Autoencoder, CAE)는 인코더의 야코비 행렬 프로베니우스 노름 $\|\frac{\partial f(x)}{\partial x}\|_F^2$을 손실에 더하여, 입력의 작은 변화에 잠재 표현이 민감하게 반응하지 않도록 한다. 이는 데이터 다양체를 따라가는 방향의 변화만 표현에 반영하고 다양체에 수직인 방향의 변화는 무시하도록 유도하며, 디노이징 오토인코더가 확률적으로 달성하는 효과를 해석적으로 구현한 것으로 볼 수 있다. 이미지 데이터에는 완전 연결 층 대신 합성곱 신경망(Convolutional Neural Network, CNN)을 인코더로, 전치 합성곱이나 업샘플링을 디코더로 사용하는 합성곱 오토인코더가 표준적이며, 시계열이나 텍스트에는 순환 신경망(Recurrent Neural Network, RNN)이나 트랜스포머(Transformer) 기반 인코더-디코더가 사용된다.변분 오토인코더(Variational Autoencoder, VAE)는 Kingma와 Welling(2013)이 제안한 모델로, 오토인코더의 구조를 확률적 생성 모델의 틀에서 재해석한다. VAE는 데이터가 잠재 변수 $z \sim p(z)$(보통 표준 정규분포)로부터 디코더 $p_\theta(x \mid z)$를 거쳐 생성된다고 가정하고, 관측 데이터의 주변 우도 $\log p_\theta(x) = \log \int p_\theta(x \mid z)p(z)\,dz$를 최대화하려 한다. 이 적분은 계산이 불가능하므로 인코더 $q_\phi(z \mid x)$를 진짜 사후 분포 $p_\theta(z \mid x)$의 근사로 도입하여, 주변 우도의 하한인 증거 하한(Evidence Lower Bound, ELBO) $\mathcal{L}(\theta, \phi; x) = \mathbb{E}_{q_\phi(z \mid x)}[\log p_\theta(x \mid z)] - D_{KL}(q_\phi(z \mid x) \,\|\, p(z))$를 대신 최대화한다. 첫 항은 잠재 변수로부터 입력을 얼마나 잘 복원하는지를 나타내는 재구성 항이고, 두 번째 항은 인코더가 만든 분포가 사전 분포에서 너무 멀어지지 않도록 하는 정칙화 항으로, ELBO를 최대화하는 것은 재구성 오차와 KL 발산의 합을 최소화하는 것과 같다. 인코더는 잠재 벡터 자체가 아니라 정규분포의 평균 $\mu$와 분산 $\sigma^2$를 출력하는데, 분포에서 $z$를 표본 추출하는 연산은 미분이 불가능하여 기울기를 인코더로 전달할 수 없다. 재매개변수화 기법(Reparameterization Trick)은 이를 $z = \mu + \sigma \odot \epsilon$, $\epsilon \sim \mathcal{N}(0, I)$로 다시 쓰는 것으로, 무작위성을 매개변수와 무관한 잡음 $\epsilon$으로 분리하여 $\mu$와 $\sigma$에 대한 기울기를 자동 미분(Automatic Differentiation)으로 계산할 수 있게 한다. 학습된 VAE는 사전 분포에서 $z$를 뽑아 디코더에 통과시키는 것만으로 새로운 데이터를 생성할 수 있고, 잠재 공간이 연속적이고 매끄럽게 구성되어 두 잠재 벡터 사이를 보간하면 의미 있는 중간 결과가 얻어진다. KL 항의 가중치를 $\beta > 1$로 키운 $\beta$-VAE는 잠재 차원들이 서로 독립적인 생성 요인(예: 물체의 위치, 색상, 크기)을 각각 담당하도록 유도하는 얽힘 해소(disentanglement) 표현 학습에 사용된다. 다만 VAE는 가우시안 재구성 손실의 평균화 효과 때문에 생성 결과가 흐릿해지는 경향이 있으며, 이는 생성적 적대 신경망(Generative Adversarial Network, GAN)과 대비되는 대표적인 한계로 지적된다.오토인코더의 활용은 크게 네 가지로 정리된다. 첫째, 이상 탐지(Anomaly Detection)다. 정상 데이터만으로 오토인코더를 학습하면 모델은 정상 패턴의 다양체를 학습하므로, 학습 분포에서 벗어난 입력은 제대로 복원되지 않아 재구성 오차가 커진다. 이 재구성 오차를 이상 점수로 사용하고 임계치를 설정하면 신용카드 부정 거래, 제조 설비의 센서 이상, 네트워크 침입, 의료 영상의 병변처럼 정상 사례는 풍부하지만 이상 사례의 레이블은 희소한 문제에 효과적으로 적용할 수 있으며, VAE의 경우 재구성 확률을 점수로 사용하기도 한다. 둘째, 차원 축소와 시각화다. 병목 표현은 t-SNE나 UMAP과 결합해 고차원 데이터의 군집 구조를 탐색하거나, 하류 분류(Classification)·군집화(Clustering) 모델의 입력 특징으로 사용된다. 셋째, 사전 학습(Pre-training)과 표현 학습(Representation Learning)이다. 레이블이 부족한 상황에서 대량의 비레이블 데이터로 오토인코더를 학습한 뒤 인코더를 분류기의 초기 가중치로 사용하는 전이 학습(Transfer Learning) 방식은 딥러닝 초기의 층별 사전 학습에서 마스크드 오토인코더에 이르기까지 꾸준히 사용되어 왔다. 넷째, 생성과 데이터 압축이다. VAE는 이미지·분자 구조·음악 생성에 사용되었고, 학습된 인코더-디코더는 신경망 기반 이미지·오디오 압축 코덱의 기초가 된다. 추천 시스템에서는 사용자의 상호작용 벡터를 입력으로 하는 오토인코더가 협업 필터링 모델로 활용되며, 특히 다항 우도를 사용하는 Mult-VAE는 암시적 피드백 기반 추천의 강력한 기준선으로 알려져 있다.최근 오토인코더는 대규모 생성 모델의 핵심 구성 요소로서 새로운 중요성을 얻었다. van den Oord 등(2017)이 제안한 벡터 양자화 변분 오토인코더(Vector Quantized-VAE, VQ-VAE)는 연속적인 잠재 벡터 대신 학습 가능한 코드북(codebook)에서 가장 가까운 코드 벡터를 선택하는 이산 잠재 표현을 사용한다. 양자화 연산은 미분이 불가능하므로 디코더의 기울기를 인코더 출력에 그대로 복사하는 직통 추정기(straight-through estimator)로 학습하며, 코드북 손실과 커밋먼트 손실이 추가된다. 이산 잠재 코드는 언어의 토큰처럼 다룰 수 있어 이미지를 코드 격자로 변환한 뒤 자기회귀 트랜스포머로 코드의 분포를 모델링하는 방식(VQ-VAE-2, DALL·E의 dVAE, VQGAN)이 고품질 이미지 생성을 가능하게 했고, 음성 코덱과 음악 생성에서도 널리 쓰인다. 한편 디퓨전 모델(Diffusion Model)은 픽셀 공간에서 잡음을 제거하는 과정을 수백 번 반복해야 하므로 계산 비용이 매우 크다. Rombach 등(2022)의 잠재 디퓨전 모델(Latent Diffusion Model, LDM)은 먼저 지각 손실과 적대 손실로 학습한 오토인코더(VAE 또는 VQ 정칙화 버전)로 이미지를 수십 배 작은 잠재 표현으로 압축한 뒤, 그 잠재 공간에서 디퓨전 과정을 수행하고 마지막에 디코더로 이미지를 복원한다. Stable Diffusion을 비롯한 현대의 텍스트-이미지 생성 모델과 비디오 생성 모델 대부분이 이 구조를 따르며, 오토인코더가 만드는 잠재 공간의 품질이 생성 결과의 세부 묘사와 효율을 좌우한다. 이처럼 오토인코더는 압축된 잠재 공간을 통해 데이터를 표현하고 조작하는 가장 기본적인 도구로서, 차원 축소와 이상 탐지 같은 고전적 응용부터 대규모 생성 모델의 인프라에 이르기까지 폭넓게 활용되고 있다.
#관련 용어
잠재 공간
인코더가 입력을 사상하는 저차원 표현 공간으로, 데이터의 본질적인 변동 요인을 담는 벡터 공간
재구성 손실원본 입력과 디코더가 복원한 출력 사이의 차이를 측정하는 손실 함수
증거 하한(ELBO)변분 오토인코더가 최대화하는 로그 주변 우도의 하한으로, 재구성 항과 KL 발산 정칙화 항의 합
재매개변수화 기법확률 분포의 표본 추출을 결정적 함수와 외부 잡음으로 분리하여 기울기가 인코더로 전달되도록 하는 기법
주성분 분석데이터의 분산이 가장 큰 직교 방향을 찾아 차원을 축소하는 선형 기법으로, 선형 오토인코더와 동일한 부분 공간을 학습
디퓨전 모델잡음을 점진적으로 제거하여 데이터를 생성하는 모델로, 오토인코더의 잠재 공간에서 동작하는 잠재 디퓨전 모델로 확장
#직무 연관도
DAData Analyst낮음
재구성 오차 기반의 이상 탐지 결과와 잠재 공간 시각화를 해석하여 데이터의 구조와 이상 사례를 파악하는 데 활용할 수 있다
DSData Scientist밀접
표현 학습, 이상 탐지, 생성 모델 설계의 핵심 구조이며 VAE·VQ-VAE·잠재 디퓨전 등 최신 생성 모델을 이해하는 기초가 된다
DEData Engineer보통
이상 탐지 파이프라인과 임베딩 압축, 생성 모델 서빙에서 인코더·디코더를 배포·운영하는 데 활용된다
#사용 사례
제조금융의료전자상거래통신미디어
개요
오토인코더는 제조 설비와 네트워크의 이상 탐지, 부정 거래 탐지, 고차원 데이터의 차원 축소와 시각화, 레이블이 부족한 데이터의 사전 학습, 이미지 잡음 제거, 협업 필터링 추천, 그리고 VAE·VQ-VAE·잠재 디퓨전 모델을 통한 이미지·음성·분자 구조 생성에 폭넓게 활용된다.
사례반도체 제조 라인에서 정상 공정의 센서 데이터만으로 오토인코더를 학습한 뒤, 실시간으로 유입되는 센서 값의 재구성 오차가 임계치를 넘으면 설비 이상으로 판정하여 경보를 발생시킨다. 이상 사례의 레이블이 거의 없는 상황에서도 정상 패턴의 학습만으로 결함을 조기에 탐지할 수 있다.
#참고 자료
#추천 포스트
© 2024 diki All rights reserved.