시계열 예측(Time Series Forecasting)

•
2026년 10월 09일 발행•2026년 10월 09일 수정
요약

시간 순서대로 관측된 데이터의 과거 패턴을 바탕으로 미래의 값을 추정하는 기술

중급
평균·분산·자기상관 등 기초 통계와 회귀 분석, 정상성과 차분 개념을 이해해야 하며, 그래디언트 부스팅과 순환 신경망·트랜스포머 등 머신러닝 모델을 알면 이해에 도움이 된다.

#개념

시계열 예측(Time Series Forecasting)은 시간 순서대로 관측된 데이터의 과거 패턴을 바탕으로 미래의 값을 추정하는 기술이다. 매출, 수요, 트래픽, 주가, 기온, 센서 측정값처럼 일정한 간격으로 기록되는 데이터가 대상이며, 관측값 사이에 시간적 의존성이 있다는 점에서 각 표본이 독립이라고 가정하는 일반적인 회귀(Regression) 문제와 구별된다. 예측 결과는 재고 계획, 인력 배치, 예산 수립, 용량 산정 같은 의사 결정의 직접적인 입력이 된다.
시계열은 몇 가지 구성 요소의 결합으로 이해된다. 각 요소를 분리해 보면 데이터의 구조가 드러나고, 모델이 무엇을 학습해야 하는지가 명확해진다.
시계열의 구성 요소
  • 추세(Trend): 장기간에 걸쳐 값이 증가하거나 감소하는 방향성으로, 서비스 성장에 따른 주문량 증가가 그 예다.
  • 계절성(Seasonality): 하루·일주일·일 년처럼 고정된 주기로 반복되는 패턴으로, 주말에 높아지는 트래픽이나 겨울에 늘어나는 아우터 판매가 해당한다.
  • 불규칙 성분(Irregular Component): 위 요소로 설명되지 않는 무작위 변동이며 잔차(residual) 또는 잡음이라고도 한다.
분해(Decomposition)는 시계열을 이 성분들로 나누는 작업으로, 추세·계절·잔차를 더하는 가법 모형 $y_t = T_t + S_t + R_t$와 곱하는 승법 모형 $y_t = T_t \times S_t \times R_t$가 있다. 계절 변동의 폭이 수준에 비례해 커지면 승법 모형이나 로그 변환 후 가법 모형이 적합하며, 국소 회귀(LOESS)로 성분을 추정하는 STL 분해가 널리 쓰인다.
많은 통계 모델은 정상성(Stationarity), 즉 평균·분산·자기상관 구조가 시간에 따라 변하지 않는다는 가정을 요구한다. 추세가 있는 시계열은 인접 관측값의 차이를 취하는 차분(Differencing) $y'_t = y_t - y_{t-1}$으로, 계절성은 주기 $m$만큼 떨어진 값과의 계절 차분 $y_t - y_{t-m}$으로 정상 시계열에 가깝게 만들며, 정상성 여부는 ADF(Augmented Dickey-Fuller)나 KPSS 검정으로 확인한다. 자기상관 함수(ACF)와 편자기상관 함수(PACF) 그래프는 과거 몇 시점까지의 값이 현재에 영향을 주는지를 보여 주어 모델 차수를 정하는 근거가 된다.
ARIMA(AutoRegressive Integrated Moving Average)는 고전적 통계 예측의 대표 모델이다. 과거 $p$개 값의 선형 결합으로 현재를 설명하는 자기회귀(AR) 항, 과거 $q$개 오차의 선형 결합인 이동평균(MA) 항, 그리고 $d$번의 차분을 결합해 ARIMA($p, d, q$)로 표기한다. 예를 들어 ARIMA(1,1,1)은 $y'_t = c + \phi_1 y'_{t-1} + \theta_1 \varepsilon_{t-1} + \varepsilon_t$로 쓰인다.
계절 항을 추가한 SARIMA는 ARIMA($p,d,q$)($P,D,Q$)$_m$로 표기하며, 주기 $m$ 단위의 자기회귀·차분·이동평균을 함께 다룬다. 차수는 AIC 같은 정보 기준으로 자동 선택하는 auto.arima 절차가 일반적이며, 해석이 쉽고 예측 구간을 제공하지만 시계열마다 따로 적합해야 하고 비선형 관계를 포착하지 못한다.
지수 평활(Exponential Smoothing)은 최근 관측값에 더 큰 가중치를 두고 과거로 갈수록 지수적으로 감소하는 가중 평균으로 예측하는 방법이다. 수준만 추정하는 단순 지수 평활 $\hat{y}_{t+1} = \alpha y_t + (1 - \alpha)\hat{y}_t$에서 출발해 추세를 더한 Holt 선형 모형, 계절성까지 더한 Holt-Winters 모형으로 확장된다. Hyndman 등은 오차(Error)·추세(Trend)·계절(Seasonal) 성분의 조합으로 이를 체계화한 ETS 모형을 제시해 최대 우도로 매개변수를 추정하고 정보 기준으로 모형을 고를 수 있게 했으며, 예측 경진대회에서 꾸준히 강력한 기준 모델로 입증되었다.
Facebook(현 Meta)이 2017년 공개한 Prophet은 시계열을 추세, 여러 주기의 계절성, 휴일 효과의 합으로 모델링하는 가법 회귀 모형이다. 추세는 변화점(changepoint)을 갖는 조각별 선형 또는 로지스틱 성장 곡선으로, 계절성은 푸리에 급수로 표현하며, 결측과 이상치에 강하고 명절·프로모션 같은 사용자 정의 이벤트를 쉽게 추가할 수 있다. 통계 지식이 적어도 합리적인 예측을 빠르게 얻을 수 있지만, 자기회귀 구조가 없어 단기 변동에는 약하다는 평가를 받는다.
트리 기반 모델은 시계열 예측을 표 형식의 지도 학습 문제로 바꾸어 푼다. LightGBM·XGBoost 같은 그래디언트 부스팅 모델은 수천 개의 시계열을 하나의 모델로 학습하는 전역 모델(global model)로 쓰일 수 있고, 가격·날씨·프로모션 같은 외생 변수를 자연스럽게 포함하며, M5 수요 예측 경진대회의 상위 솔루션 대부분이 이 접근을 사용했다. 성능은 특징 공학(Feature Engineering)이 좌우하며 핵심 특징은 다음과 같다.
트리 기반 예측의 핵심 특징
  • 지연 특징(Lag Features): 1일 전, 7일 전, 28일 전 값처럼 예측 시점에 알 수 있는 과거 값으로 자기회귀 구조를 대신한다.
  • 이동 통계(Rolling Statistics): 최근 7일·28일 평균, 표준편차 등으로 수준과 변동성을 요약한다.
  • 달력 특징(Calendar Features): 요일, 월, 공휴일 여부처럼 계절성과 이벤트 효과를 표현한다.
  • 외생 변수와 범주 정보: 가격, 할인율, 날씨, 상품 카테고리 등으로 시계열 간 정보를 공유하게 한다.
딥러닝(Deep Learning) 모델은 대규모 다중 시계열에서 비선형 패턴과 긴 의존성을 학습한다. 초기에는 순환 신경망(Recurrent Neural Network) 계열이 주로 쓰였고, 이후 합성곱과 트랜스포머 기반 구조가 발전했다.
대표적인 딥러닝 예측 모델
  • LSTM(Long Short-Term Memory): 게이트 구조로 장기 의존성을 기억하는 순환 신경망으로, Amazon의 DeepAR은 LSTM으로 확률 분포의 매개변수를 출력해 수천 개 상품의 수요를 하나의 모델로 예측한다.
  • TCN(Temporal Convolutional Network): 인과적 팽창 합성곱을 쌓아 긴 수용 영역을 병렬로 처리하며, 순환 구조보다 학습이 빠르고 안정적이다.
  • N-BEATS: Oreshkin 등(2020)이 제안한 완전 연결 블록의 깊은 스택으로, 잔차 연결을 통해 추세와 계절성을 해석 가능한 기저 함수로 분해하며 M4 경진대회 데이터에서 통계 앙상블을 능가했다.
  • TFT(Temporal Fusion Transformer): 정적 공변량·과거 입력·미래에 알려진 입력을 구분해 처리하고, 변수 선택 네트워크와 어텐션 메커니즘(Attention Mechanism)으로 어떤 변수와 시점이 예측에 기여했는지 해석할 수 있다.
최근에는 대규모 언어 모델(Large Language Models)처럼 방대한 시계열 코퍼스로 사전 학습한 뒤 처음 보는 시계열도 추가 학습 없이 예측하는 시계열 파운데이션 모델(Time Series Foundation Model)이 등장했다. Google의 TimesFM은 시계열 패치를 토큰으로 삼는 디코더 전용 트랜스포머이고, Amazon의 Chronos는 값을 스케일링·양자화해 토큰 어휘로 바꾼 뒤 T5 계열 언어 모델 구조로 다음 토큰을 예측하여 확률적 예측을 생성한다. 제로샷 성능이 개별 적합 통계 모델과 대등한 경우가 보고되었으며, 데이터가 적은 신규 시계열이나 빠른 기준선 확보에 유용하지만 외생 변수 활용은 아직 제한적이다.
모델 검증에서 가장 중요한 원칙은 시간 순서를 지키는 것이다. 무작위로 데이터를 섞어 나누는 일반적인 교차 검증(Cross Validation)은 미래 정보가 학습에 섞여 들어가는 데이터 누수(Data Leakage)를 일으켜 성능을 과대평가한다. 대신 특정 시점까지를 학습, 그 이후 구간을 검증으로 삼고 기준 시점을 앞으로 이동시키며 반복하는 롤링 오리진 평가(Rolling Origin Evaluation)를 사용하며, 검증 구간의 길이는 실제 예측 범위(horizon)와 같게 맞추고 이동 통계나 정규화 통계도 각 시점의 과거 값만으로 계산해야 한다.
예측 정확도는 여러 모델 평가 지표(Model Evaluation Metrics)로 측정하며, 실제값 $y_t$와 예측값 $\hat{y}_t$, 예측 구간 길이 $h$에 대해 다음과 같이 정의된다.
시계열 예측의 주요 지표
  • MAE(Mean Absolute Error): $\frac{1}{h}\sum|y_t - \hat{y}_t|$로 오차의 크기를 원 단위로 보여 주어 해석이 쉽고 이상치에 덜 민감하다.
  • RMSE(Root Mean Squared Error): $\sqrt{\frac{1}{h}\sum(y_t - \hat{y}_t)^2}$로 큰 오차에 더 큰 벌점을 준다.
  • MAPE(Mean Absolute Percentage Error): $\frac{100}{h}\sum\left|\frac{y_t - \hat{y}_t}{y_t}\right|$로 척도가 다른 시계열을 비교할 수 있지만, 실제값이 0에 가까우면 발산하고 과대 예측에 더 큰 벌점을 준다.
  • sMAPE(symmetric MAPE): 분모를 $(|y_t| + |\hat{y}_t|)/2$로 바꾸어 MAPE의 비대칭을 완화한 지표로, 실제값과 예측값이 모두 0이면 정의되지 않는 한계가 남아 있다.
  • MASE(Mean Absolute Scaled Error): MAE를 학습 구간에서 계절 나이브 예측의 MAE로 나눈 값으로, 1보다 작으면 단순 기준보다 낫다는 뜻이며 척도에 독립적이고 0 문제가 없다.
점 예측만으로는 불확실성을 알 수 없으므로 확률적 예측(Probabilistic Forecasting)이 중요하다. 예측 구간이나 여러 분위수(예: 10%, 50%, 90%)를 함께 출력하면 안전 재고 수준 같은 결정을 위험 허용도에 맞추어 내릴 수 있으며, 분위수 예측은 핀볼 손실(pinball loss)로 학습하고 CRPS로 평가한다. 어떤 모델이든 마지막 값을 그대로 쓰는 나이브 예측과 계절 나이브 예측을 기준선으로 두고 비교해야 하며, 실무에서는 단순 모델을 이기지 못하는 복잡한 모델이 드물지 않다.
계층적 예측(Hierarchical Forecasting)은 전체 매출이 카테고리별, 다시 상품별로 쪼개지고 지역별로도 나뉘는 것처럼 시계열이 집계 구조를 이룰 때의 문제다. 각 수준을 따로 예측하면 하위 예측의 합이 상위 예측과 맞지 않으므로, 모든 수준을 예측한 뒤 계층 제약을 만족하도록 선형 결합으로 조정하는 조정(Reconciliation) 기법이 사용된다. 상위에서 비례 배분하는 하향식, 최하위를 더해 올리는 상향식, 모든 수준의 오차 공분산을 반영해 최적 결합하는 MinT가 대표적이며, 조정은 일관성뿐 아니라 정확도도 높이는 경우가 많다.
수요 예측(Demand Forecasting)은 시계열 예측의 가장 큰 응용 분야다. 전자상거래와 유통에서는 수십만 개 상품의 일별 판매량을 예측해 발주와 재고를 결정하는데, 대부분의 상품은 판매가 0인 날이 많은 간헐적 수요(intermittent demand)를 보여 Croston 방법 같은 전용 기법이나 0 과잉을 다루는 확률 분포가 필요하며, 품절로 수요가 관측되지 않는 검열 문제와 신상품의 콜드 스타트 문제도 함께 다루어야 한다. 예측 결과는 통계적 정확도보다 재고 비용과 결품률 같은 사업 지표로 최종 평가된다.
실무 도구로는 StatsForecast·sktime·Darts 같은 라이브러리가 통계 모델부터 딥러닝까지 공통 인터페이스로 제공한다. 어떤 도구를 쓰든 데이터의 주기와 외생 변수를 이해하고 올바른 검증 체계를 갖추는 것이 모델 선택보다 예측 품질을 더 크게 좌우한다.

#관련 용어

정상성
평균·분산·자기상관 구조가 시간에 따라 변하지 않는 시계열의 성질로, 차분으로 확보하는 통계 모델의 기본 가정
자기회귀 통합 이동평균(ARIMA)
자기회귀 항, 차분, 이동평균 항을 결합하여 시계열을 모델링하는 고전적 통계 예측 모델
지수 평활
최근 관측값에 지수적으로 큰 가중치를 두는 가중 평균으로 수준·추세·계절성을 추정하는 예측 방법
특징 공학
지연 값, 이동 통계, 달력 변수 등을 만들어 시계열 예측을 표 형식 지도 학습 문제로 바꾸는 작업
교차 검증
시계열에서는 시간 순서를 지키며 기준 시점을 이동시키는 롤링 오리진 방식으로 수행하는 모델 검증 절차
순환 신경망
시간 순서가 있는 입력을 순차적으로 처리하는 신경망으로, LSTM 기반 예측 모델의 기반

#직무 연관도

DA
Data Analyst
밀접
매출·트래픽·수요 지표의 추세와 계절성을 분해해 해석하고, 예측 결과를 예산·목표 수립과 사업 의사 결정에 연결하는 데 활용된다
DS
Data Scientist
밀접
통계 모델부터 딥러닝·파운데이션 모델까지 예측 모델을 선택·설계하고, 시간 순서를 지키는 검증 체계와 지표로 성능을 비교하는 핵심 모델링 영역
DE
Data Engineer
높음
수만 개 시계열의 특징 생성과 학습·예측 파이프라인을 자동화하고, 예측 결과를 재고·용량 계획 시스템에 주기적으로 공급하는 데 직접 활용된다

#사용 사례

전자상거래유통제조에너지금융인터넷 서비스통신물류
개요
시계열 예측은 상품 수요와 재고 계획, 전력·가스 수요와 발전량 예측, 콜센터 통화량과 인력 배치, 클라우드 자원 용량 계획, 교통량과 배달 시간 예측, 매출·트래픽 목표 수립, 금융 시장의 변동성 추정 등 미래 값을 근거로 계획을 세워야 하는 모든 분야에 활용된다.
사례
패션 전자상거래에서 수십만 개 상품의 향후 4주 일별 판매량을 예측하기 위해 지연·이동 통계·달력·할인율 특징으로 LightGBM 전역 모델을 학습하고, 10%·50%·90% 분위수를 출력해 안전 재고를 결정한다. 롤링 오리진 교차 검증으로 MASE와 분위수 손실을 계절 나이브 기준선과 비교하며, 카테고리·브랜드 합계와 상품별 예측이 일치하도록 MinT 조정을 적용해 발주와 마케팅 예산 계획에 공급한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.