#개념

음성 인식(Speech Recognition) 또는 자동 음성 인식(Automatic Speech Recognition, ASR)은 마이크로 입력된 음성 파형을 분석하여 발화된 단어의 열, 즉 텍스트로 변환하는 기술이다. 음성은 화자·발화 속도·억양·주변 소음에 따라 같은 문장이라도 파형이 크게 달라지고, 단어 사이의 경계가 신호에 명시적으로 드러나지 않으며, 발음이 같은 단어(동음이의어)를 문맥으로 구분해야 하므로 오랫동안 어려운 문제로 여겨졌다. 음성 인식 시스템은 확률적으로 음향 신호 $X$가 주어졌을 때 가장 그럴듯한 단어열 $W$를 찾는 문제, 즉 $\hat{W} = \arg\max_W P(W \mid X) = \arg\max_W P(X \mid W)\,P(W)$로 정식화되며, $P(X \mid W)$를 음향 모델(Acoustic Model), $P(W)$를 언어 모델(Language Model)이 담당하고 두 모델을 결합해 최적의 단어열을 찾는 과정을 디코딩(Decoding)이라 한다. 처리의 첫 단계는 음향 특징 추출이다. 원시 파형을 20~25ms 길이의 프레임으로 잘라 10ms 간격으로 이동하며 짧은 시간 푸리에 변환을 적용하고, 사람의 청각이 저주파 영역에 민감한 특성을 반영한 멜 척도(mel scale) 필터뱅크를 거쳐 로그를 취하면 멜 스펙트로그램(Mel Spectrogram)이 얻어진다. 여기에 이산 코사인 변환을 추가로 적용해 차원 간 상관을 줄이고 압축한 계수가 MFCC(Mel-Frequency Cepstral Coefficients)로, 전통적인 통계 모델의 표준 입력이었다. 신경망 기반 모델은 압축 없이 로그 멜 필터뱅크 특징을 직접 사용하는 경우가 많으며, 최근에는 파형 자체를 입력으로 받는 모델도 등장했다.
1980년대부터 2010년대 초까지 음성 인식의 주류는 은닉 마르코프 모델(Hidden Markov Model, HMM)과 가우시안 혼합 모델(Gaussian Mixture Model, GMM)을 결합한 HMM-GMM 방식이었다. 단어는 발음 사전에 따라 음소열로 분해되고, 각 음소는 몇 개의 상태를 갖는 HMM으로 표현되어 시간에 따른 음향의 변화를 상태 전이로 모델링하며, 각 상태에서 특징 벡터가 관측될 확률을 GMM이 계산한다. 앞뒤 음소에 따라 발음이 달라지는 조음 결합 현상을 다루기 위해 트라이폰(triphone) 단위와 결정 트리 기반 상태 공유가 도입되었고, n-gram 언어 모델과 발음 사전을 가중 유한 상태 변환기(Weighted Finite-State Transducer, WFST)로 통합해 비터비 탐색으로 디코딩했다. 2010년대 초 Hinton 등의 연구를 계기로 GMM을 심층 신경망(Deep Neural Network, DNN)으로 대체한 하이브리드 DNN-HMM 방식이 오류율을 크게 낮추었다. DNN은 여러 프레임의 문맥을 입력받아 HMM 상태의 사후 확률을 출력하고, 이를 사전 확률로 나누어 우도로 변환한 뒤 기존 HMM 디코더에 그대로 사용한다. 이후 시간 지연 신경망(TDNN), LSTM 등이 음향 모델로 채택되었으며, Kaldi 툴킷이 이러한 파이프라인의 사실상 표준 구현체로 널리 사용되었다. 하이브리드 방식은 높은 정확도를 달성했지만 발음 사전 구축, HMM 상태 정렬, 음향·언어 모델의 개별 학습 등 여러 구성 요소를 전문 지식을 바탕으로 따로 설계해야 하는 복잡성이 있었다.
종단간(End-to-End) 음성 인식은 음향 특징에서 문자 또는 서브워드 열로 직접 대응시키는 단일 신경망을 학습하여 이 복잡성을 해소한다. 핵심 난제는 입력 프레임 수가 출력 토큰 수보다 훨씬 많고 둘 사이의 정렬을 알 수 없다는 점이며, 이를 해결하는 세 가지 대표적인 접근이 있다. CTC(Connectionist Temporal Classification)는 출력 어휘에 공백(blank) 토큰을 추가하고, 프레임마다 토큰을 예측한 뒤 반복 토큰과 공백을 제거하는 축약 규칙으로 정렬을 정의하며, 같은 출력으로 축약되는 모든 정렬 경로의 확률 합을 동적 계획법으로 계산해 학습한다. 구조가 단순하고 스트리밍에 적합하지만 프레임 간 출력이 조건부 독립이라는 가정 때문에 외부 언어 모델의 도움이 필요한 경우가 많다. RNN-T(RNN Transducer)는 음향 인코더에 이전 출력 토큰을 입력받는 예측 네트워크(prediction network)를 추가하고 두 출력을 결합 네트워크(joiner)로 합쳐 조건부 독립 가정을 완화하며, 입력을 순차적으로 처리하면서 출력을 낼 수 있어 온디바이스·스트리밍 음성 인식의 표준 구조가 되었다. 어텐션 기반 시퀀스-투-시퀀스(seq2seq) 모델은 기계 번역과 같이 인코더-디코더 구조에서 어텐션 메커니즘(Attention Mechanism)으로 정렬을 학습하며, LAS(Listen, Attend and Spell)가 대표적이다. 전체 입력을 본 뒤 출력하므로 정확도가 높지만 기본적으로 스트리밍이 어렵고, 이를 보완하기 위해 CTC와 어텐션 손실을 함께 학습하는 하이브리드 CTC/어텐션 방식이 널리 쓰인다. 인코더 구조로는 트랜스포머(Transformer)와, 셀프 어텐션에 합성곱 신경망(Convolutional Neural Network, CNN) 블록을 결합하여 전역 문맥과 지역 패턴을 함께 포착하는 Conformer가 높은 성능을 보인다.
최근 음성 인식의 성능 향상을 이끈 두 축은 자기지도 학습(Self-Supervised Learning)과 대규모 약지도 학습이다. Baevski 등(2020)의 wav2vec 2.0은 전사(transcript)가 없는 대량의 음성만으로 표현을 학습한다. 원시 파형을 CNN으로 잠재 표현으로 바꾸고 일부 구간을 마스킹한 뒤, 트랜스포머가 문맥으로부터 마스킹된 구간의 양자화된 표현을 여러 방해 후보 중에서 맞히는 대조 학습(contrastive learning)을 수행하며, 이렇게 사전 학습된 모델은 소량의 레이블 데이터로 CTC 미세 조정(Fine-tuning)만 해도 높은 정확도에 도달해 저자원 언어와 데이터 부족 상황에서 특히 유용하다. 같은 계열의 HuBERT는 군집화로 만든 이산 목표를 예측하는 방식으로 학습한다. 반면 Radford 등(2022)의 Whisper는 인터넷에서 수집한 68만 시간 분량의 다국어 음성-전사 쌍으로 인코더-디코더 트랜스포머를 지도 학습한 모델로, 데이터의 규모와 다양성 덕분에 별도의 미세 조정 없이도 잡음·억양·도메인 변화에 강건한 제로샷 성능을 보이며, 언어 식별·음성 번역·타임스탬프 예측을 디코더의 특수 토큰으로 지시하는 다중 과제 형식을 취한다. 디코딩 단계에서는 종단간 모델의 출력 확률에 외부 언어 모델의 점수를 가중 합산하는 얕은 융합(Shallow Fusion)으로 문맥 정보와 도메인 어휘를 반영하며, 빔 서치로 상위 가설을 유지하고 CTC의 경우 접두사 빔 서치(prefix beam search)를 사용한다. 인식 결과에 대해 여러 가설을 재순위화(rescoring)하거나 고유명사·제품명 목록을 디코딩에 주입하는 문맥 편향(contextual biasing)도 실무에서 자주 쓰인다.
음성 인식의 표준 평가 지표는 단어 오류율(Word Error Rate, WER)이다. 인식 결과와 정답 전사를 최소 편집 거리로 정렬한 뒤 치환(S)·삭제(D)·삽입(I) 횟수의 합을 정답 단어 수 $N$으로 나눈 값 $WER = \frac{S + D + I}{N}$으로 정의되며, 삽입 오류 때문에 100%를 넘을 수도 있다. 띄어쓰기 기준이 모호하거나 문자 단위가 중요한 언어에서는 문자 단위로 계산하는 문자 오류율(Character Error Rate, CER)을 함께 보고하고, 대소문자·문장 부호·숫자 표기를 통일하는 텍스트 정규화가 지표의 공정한 비교에 필수적이다. 실시간 서비스에서는 정확도 외에 발화 종료 후 결과가 나오기까지의 지연 시간(Latency)과 실시간 계수(Real-Time Factor)가 중요하며, 스트리밍 인식은 청크 단위의 제한된 미래 문맥만 참조하는 인코더와 RNN-T 같은 구조로 발화 도중에 부분 결과를 계속 갱신한다. 실제 환경의 배경 소음·잔향·원거리 마이크, 화자별 음색과 발화 습관, 지역 방언과 비원어민 억양, 여러 사람이 동시에 말하는 중첩 발화는 여전히 오류의 주요 원인이며, 이를 완화하기 위해 잡음 추가·속도 변화·SpecAugment 같은 데이터 증강, 다양한 화자와 억양을 포함한 학습 데이터 구성, 음성 향상 전처리와 화자 분리(diarization)가 함께 사용된다. 한국어 음성 인식에는 고유한 어려움이 있다. 연음·경음화·비음화 등 음운 변동으로 표기와 발음이 다르고, 조사와 어미가 결합하는 교착어 특성 때문에 단어 단위 어휘가 무한히 늘어나며, 띄어쓰기 규범이 실제 사용과 일치하지 않아 WER보다 CER이 더 안정적인 지표로 쓰인다. 출력 단위로는 음절, 자모, 또는 BPE 서브워드가 사용되고, 숫자·영어 약어·외래어의 표기 정규화가 별도로 필요하다. 음성 인식은 음성 비서, 회의록 자동 작성, 콜센터 통화 분석, 자막 생성, 차량·가전의 음성 제어, 의료 기록 구술 입력 등에 폭넓게 적용되며, 최근에는 음성 인식 결과를 대규모 언어 모델(Large Language Models, LLM)에 연결하거나 음성 인코더를 LLM에 직접 결합하는 음성 언어 모델로 확장되고 있다.

#관련 용어

오디오 처리
음성 파형을 프레임 단위로 분석하여 멜 스펙트로그램·MFCC 등 특징을 추출하는 신호 처리 과정
은닉 마르코프 모델(HMM)
음소의 시간적 변화를 상태 전이로 모델링하는 전통적 음향 모델의 기반 확률 모델
CTC
공백 토큰과 정렬 경로의 확률 합으로 입력 프레임과 출력 토큰의 길이 차이를 해결하는 종단간 학습 손실 함수
순환 신경망
시간 순서가 있는 음향 특징을 순차적으로 처리하는 신경망으로, LSTM 음향 모델과 RNN-T의 기반
트랜스포머
셀프 어텐션으로 긴 음성의 전역 문맥을 포착하는 인코더 구조로, Whisper와 wav2vec 2.0의 핵심
단어 오류율(WER)
치환·삭제·삽입 오류의 합을 정답 단어 수로 나눈 음성 인식의 표준 평가 지표

#직무 연관도

DA
Data Analyst
낮음
통화·회의 전사 데이터를 분석하고 WER·CER 지표를 해석하여 인식 품질과 서비스 영향을 검토할 수 있다
DS
Data Scientist
밀접
음향 특징 설계, 종단간 모델 구조 선택, 자기지도 사전 학습 활용, 언어 모델 결합과 오류 분석 등 음성 모델링 연구의 핵심 영역
DE
Data Engineer
높음
스트리밍 인식 서비스 구축, 모델 경량화와 온디바이스 배포, 지연 시간·처리량 최적화, 음성 파이프라인 운영에 직접 활용된다

#사용 사례

인터넷 서비스통신자동차의료금융미디어전자상거래
개요
음성 인식은 스마트폰·스피커의 음성 비서, 회의록과 강의 자막의 자동 생성, 콜센터 통화 분석과 품질 모니터링, 차량·가전의 음성 제어, 의료 진료 기록 구술 입력, 음성 검색과 음성 쇼핑 등에 활용된다.
사례
전자상거래 고객센터에서 상담 통화를 Conformer 기반 스트리밍 인식 모델로 실시간 전사하고, 상품명·브랜드명 목록을 문맥 편향으로 디코더에 주입하여 고유명사 오류를 줄인다. 전사된 텍스트는 상담 요약과 불만 유형 분류에 사용되며, 신규 상품명이 늘어날 때마다 CER을 감시하여 언어 모델을 갱신한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.