#개념

기계 번역(Machine Translation, MT)은 원천 언어(source language)로 작성된 텍스트를 사람의 개입 없이 목표 언어(target language)의 텍스트로 변환하는 자연어 처리(Natural Language Processing, NLP)의 대표적인 과제다. 번역은 단어를 일대일로 치환하는 작업이 아니라 어순 차이, 다의어, 관용 표현, 문법적 성·수·시제 일치, 문맥에 따른 생략과 복원 등을 함께 처리해야 하는 문제이며, 정답이 하나로 정해지지 않는다는 점에서 평가 또한 어렵다. 기계 번역의 역사는 접근 방식에 따라 크게 세 시기로 나뉜다. 1950년대부터 시작된 규칙 기반 기계 번역(Rule-Based Machine Translation, RBMT)은 언어학자가 작성한 이중 언어 사전과 형태·구문 변환 규칙을 사용하여, 원문을 구문 분석(Syntactic Analysis)한 뒤 규칙에 따라 목표 언어의 구조로 변환(transfer)하고 다시 문장을 생성한다. 규칙 기반 방식은 동작이 투명하고 일관되지만 언어 쌍마다 방대한 규칙을 수작업으로 구축해야 하고, 규칙이 다루지 못하는 예외와 모호성 앞에서 품질이 급격히 떨어진다는 한계가 있었다.
1990년대 IBM 연구진이 제안한 통계 기반 기계 번역(Statistical Machine Translation, SMT)은 번역을 확률 문제로 재정의했다. 원문 $f$가 주어졌을 때 가장 그럴듯한 번역문 $e$를 찾는 문제는 베이즈 정리에 따라 $\hat{e} = \arg\max_e P(e \mid f) = \arg\max_e P(f \mid e)\,P(e)$로 분해되며, $P(f \mid e)$는 병렬 말뭉치에서 학습한 번역 모델(Translation Model), $P(e)$는 목표 언어의 단일 언어 말뭉치에서 학습한 n-gram 언어 모델(Language Model)이 담당한다. IBM 모델 1~5는 원문 단어와 번역문 단어 사이의 대응 관계인 단어 정렬(Word Alignment)을 잠재 변수로 두고 EM 알고리즘으로 추정하며, 모델 번호가 올라갈수록 단어 위치의 왜곡(distortion)과 한 단어가 여러 단어로 번역되는 다산성(fertility)을 점차 정교하게 모델링한다. 2000년대에는 단어가 아닌 연속된 단어 묶음을 번역 단위로 삼는 구 기반 SMT(Phrase-Based SMT)가 주류가 되었다. 구 기반 모델은 단어 정렬로부터 구 번역 테이블을 추출하고, 번역 확률·어휘 가중치·재배열(reordering) 모델·언어 모델 등 여러 특징 함수를 로그 선형 모델로 결합한 뒤 BLEU를 직접 최대화하는 MERT(Minimum Error Rate Training)로 가중치를 조정했다. 오픈소스 Moses가 이 방식을 대중화했고 Google 번역 초기 버전도 SMT를 사용했다. SMT는 데이터에서 자동으로 지식을 학습한다는 점에서 규칙 기반보다 확장성이 뛰어났지만, 지역적인 구 단위 결정을 이어 붙이는 구조 때문에 장거리 의존성과 문장 전체의 유창성을 포착하기 어려웠다.
2014년을 전후하여 등장한 신경망 기계 번역(Neural Machine Translation, NMT)은 번역 과정 전체를 하나의 신경망으로 학습하는 종단간(end-to-end) 접근이다. 초기 NMT는 순환 신경망(Recurrent Neural Network, RNN) 기반의 시퀀스-투-시퀀스(Sequence-to-Sequence, seq2seq) 구조를 사용하여, 인코더가 원문을 고정 길이 벡터로 압축하고 디코더가 그 벡터로부터 번역문을 한 토큰씩 생성했다. 그러나 문장이 길어질수록 고정 길이 벡터 하나에 모든 정보를 담기 어려워 품질이 떨어졌고, Bahdanau 등(2014)은 디코더가 각 출력 시점마다 원문의 모든 인코더 상태를 참조하여 관련 부분에 가중치를 두는 어텐션 메커니즘(Attention Mechanism)을 도입해 이 병목을 해소했다. 어텐션은 SMT의 단어 정렬을 미분 가능한 형태로 학습하는 것과 같은 효과를 냈다. 2017년 Vaswani 등이 제안한 트랜스포머(Transformer)는 순환 구조를 완전히 제거하고 셀프 어텐션과 다중 헤드 어텐션만으로 인코더-디코더를 구성하여 병렬 학습이 가능해졌고, 장거리 의존성 포착과 번역 품질 모두에서 RNN 기반 모델을 크게 앞섰다. 오늘날 상용 번역 서비스와 연구용 모델 대부분은 트랜스포머 계열이다. NMT의 어휘 문제를 해결한 것은 서브워드 토큰화(Subword Tokenization)다. 단어 단위 어휘는 크기가 수십만에 이르고 미등록 단어(OOV)를 처리하지 못하므로, 바이트 페어 인코딩(Byte Pair Encoding, BPE)·WordPiece·유니그램 언어 모델(SentencePiece)처럼 자주 등장하는 문자열 조각을 어휘로 삼아 희귀 단어를 조합 가능한 조각으로 분해한다. 한국어처럼 조사와 어미가 결합하는 교착어에서 서브워드 토큰화는 특히 효과적이다. 추론 시에는 각 시점에서 확률이 가장 높은 토큰 하나만 고르는 탐욕 탐색 대신, 상위 $k$개의 부분 가설을 유지하며 확장하는 빔 서치(Beam Search)를 사용해 전체 문장의 누적 확률이 높은 번역을 찾으며, 짧은 문장이 유리해지는 편향을 줄이기 위해 길이 정규화(length normalization)를 함께 적용한다.
번역 품질 평가는 사람이 적합성(adequacy)과 유창성(fluency)을 직접 판정하는 방식이 가장 정확하지만 비용이 크므로 자동 지표가 널리 쓰인다. Papineni 등(2002)이 제안한 BLEU(Bilingual Evaluation Understudy)는 기계 번역문과 참조 번역문 사이의 n-gram(보통 1~4-gram) 정밀도를 기하 평균하고, 지나치게 짧은 출력을 벌하는 간결성 페널티(brevity penalty)를 곱한 값이다. BLEU는 계산이 간단하고 말뭉치 수준에서 사람 평가와 상관이 있어 사실상의 표준이 되었으나, 토큰화 방식에 따라 점수가 달라지고 동의어나 어순 변화를 인정하지 않으며 문장 수준에서는 신뢰도가 낮다는 비판을 받는다. 토큰화를 표준화한 SacreBLEU 구현이 재현 가능한 비교를 위해 권장된다. chrF는 단어 대신 문자 n-gram의 F-score를 계산하므로 토큰화에 덜 민감하고 형태가 풍부한 언어에 강하며, 이후 단어 n-gram을 추가한 chrF++가 제안되었다. 최근에는 사전 학습 언어 모델 위에서 사람 평가 점수를 회귀하도록 학습한 COMET과 같은 신경망 기반 지표가 사람 판단과 가장 높은 상관을 보여 WMT 등 학술 평가에서 표준 지표로 자리 잡았으며, 참조 번역 없이 원문과 번역문만으로 품질을 추정하는 품질 추정(Quality Estimation, QE) 변형도 함께 활용된다. 이 밖에 편집 거리에 기반한 TER, 동의어와 어간 일치를 고려하는 METEOR, 임베딩 유사도를 사용하는 BERTScore 등이 보조 지표로 쓰인다.
NMT는 대량의 병렬 말뭉치에 의존하므로 데이터가 부족한 저자원 언어(Low-Resource Language)에서 품질이 크게 떨어진다. 이를 보완하는 대표적 기법이 역번역(Back-Translation)이다. 목표 언어의 풍부한 단일 언어 말뭉치를 목표→원천 방향 모델로 번역하여 합성 병렬 데이터를 만들고, 이를 실제 병렬 데이터와 섞어 원천→목표 모델을 학습하면 목표 언어 측 유창성이 향상되며, 여러 차례 반복하는 반복 역번역과 노이즈를 섞는 변형도 사용된다. 다국어 NMT는 여러 언어 쌍을 하나의 모델로 학습하여 언어 간 전이 학습(Transfer Learning) 효과를 얻고, 학습 데이터에 없던 언어 쌍을 번역하는 제로샷(zero-shot) 번역도 가능하게 한다. 목표 언어를 지시하는 특수 토큰을 입력에 추가하는 방식이 일반적이며, Meta의 NLLB(No Language Left Behind)는 200개 언어를 지원하는 단일 모델을 희소 게이트 전문가 혼합(Mixture-of-Experts) 구조와 저자원 언어를 위한 대규모 병렬 문장 채굴로 학습하여 다국어 번역의 범위를 크게 넓혔다. 최근에는 대규모 언어 모델(Large Language Models, LLM)이 별도의 번역 학습 없이도 프롬프트만으로 높은 품질의 번역을 수행하며, 문서 전체의 맥락과 문체·용어 지시를 반영하고 번역 결과를 스스로 수정하는 등 기존 NMT가 어려워하던 능력을 보이고 있다. 다만 LLM 번역은 추론 비용이 크고 응답 시간이 길며, 원문에 없는 내용을 지어내거나 일부 문장을 누락하는 환각(Hallucination)이 발생할 수 있어 신뢰성이 중요한 도메인에서는 검증 절차가 필요하다. 그 밖에도 법률·의료·특허처럼 전문 용어가 많은 도메인에서의 품질 저하, 학습 데이터의 성별·문화적 편향(Bias) 재생산, 문장 단위 번역이 문서 수준의 대명사 참조와 일관된 용어 사용을 놓치는 문제, 고유명사와 숫자 오류가 여전한 과제이며, 이러한 한계 때문에 실무에서는 기계 번역 결과를 사람이 검수·수정하는 사후 편집(Post-Editing) 흐름이 널리 쓰인다.

#관련 용어

트랜스포머
셀프 어텐션만으로 인코더-디코더를 구성하여 병렬 학습이 가능한 현대 기계 번역의 표준 신경망 구조
어텐션 메커니즘
디코더가 출력 토큰을 생성할 때마다 원문의 관련 부분에 가중치를 두어 참조하는 연산
토큰화
텍스트를 모델의 입력 단위인 토큰으로 분할하는 과정으로, 기계 번역에서는 서브워드 단위가 주로 사용됨
빔 서치
디코딩 시 상위 k개의 부분 가설을 유지하며 확장하여 누적 확률이 높은 출력 문장을 찾는 탐색 알고리즘
역번역
목표 언어의 단일 언어 데이터를 역방향 모델로 번역해 합성 병렬 데이터를 만드는 데이터 증강 기법
대규모 언어 모델
프롬프트만으로 번역을 수행하고 문맥·문체 지시를 반영할 수 있는 대규모 사전 학습 언어 모델

#직무 연관도

DA
Data Analyst
낮음
다국어 리뷰·문서 분석 전처리에 번역을 활용하고, BLEU·COMET 등 품질 지표를 해석하여 번역 품질을 검토할 수 있다
DS
Data Scientist
밀접
시퀀스-투-시퀀스 모델링, 토큰화, 디코딩 전략, 자동 평가 지표 설계와 저자원 언어 대응 등 자연어 처리 연구의 핵심 과제
DE
Data Engineer
높음
번역 API 통합, 대규모 번역 모델의 서빙·지연 시간 최적화, 다국어 서비스 파이프라인 구축에 직접 활용된다

#사용 사례

전자상거래인터넷 서비스미디어관광법률의료
개요
기계 번역은 상품 정보와 고객 리뷰의 다국어 현지화, 실시간 고객 상담과 채팅 번역, 자막·콘텐츠 번역, 다국어 검색 질의 처리, 법률·의료 문서의 초벌 번역, 여행자용 통역 앱 등에 폭넓게 활용된다.
사례
글로벌 전자상거래 플랫폼에서 국내 판매자가 등록한 한국어 상품명과 상세 설명을 트랜스포머 기반 번역 모델로 영어·일본어로 자동 변환하고, 패션 용어 사전과 역번역으로 증강한 도메인 데이터로 미세 조정하여 "오버핏 니트"와 같은 표현이 자연스럽게 번역되도록 한다. 번역 결과는 COMET 점수로 품질을 감시하고 점수가 낮은 문장만 사람이 사후 편집한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.