개체명 인식(Named Entity Recognition)

•
2025년 09월 08일 발행•2025년 09월 08일 수정
요약

텍스트에서 인물, 장소, 조직 등 특정 개체를 식별하고 분류하는 기술

중급
자연어 처리 기초 지식과 함께 시퀀스 태깅, 확률 모델 및 딥러닝 모델에 대한 이해가 필요하다.
태그
자연어 처리정보 추출

#개념

개체명 인식(Named Entity Recognition, NER)은 자연어 텍스트에서 특정한 의미를 가진 단어 또는 구를 찾아내어 미리 정의된 범주(예: 인물, 장소, 조직, 날짜, 수치 등)로 분류하는 기술이다. 이는 정보 추출(Information Extraction)의 핵심 과제 중 하나로, 문장 내에서 중요한 개체를 구조화된 데이터로 변환하는 역할을 한다. NER은 일반적으로 두 단계로 구성된다.
NER 구성 단계
  • 개체 경계 식별(Entity Boundary Detection): 문장에서 개체가 어디서 시작되고 끝나는지를 찾는다.
  • 개체 유형 분류(Entity Classification): 식별된 개체가 사람, 장소, 조직, 시간, 수치 등의 카테고리에 속하는지를 결정한다.
예를 들어, 문장 "스티브 잡스는 애플을 공동 창업했다"에서 스티브 잡스는 인물(Person), 애플은 조직(Organization)으로 인식된다. 이러한 NER 접근 방식은 크게 세 가지로 구분된다.
NER 접근 방식
  • 규칙 기반 방식: 정규 표현식이나 사전(Dictionary) 매칭 규칙을 이용하여 개체를 추출한다.
  • 통계 기반 방식: 은닉 마르코프 모델(Hidden Markov Model, HMM), 조건부 무작위장(Conditional Random Field, CRF)과 같은 확률적 시퀀스 모델을 학습하여 개체 경계와 유형을 추정한다.
  • 딥러닝 기반 방식: BiLSTM-CRF, 트랜스포머(Transformer), BERT 등의 신경망을 활용해 문맥 정보를 반영하여 높은 정확도의 개체 인식을 수행한다. 개체 경계와 유형은 보통 BIO 태깅(BIO Tagging)과 같은 시퀀스 태깅 방식으로 표현한다.
NER은 검색 엔진, 챗봇, 질의응답 시스템, 금융 데이터 분석, 소셜 미디어 모니터링 등 다양한 응용 분야에서 필수적인 기술로 활용된다.

#관련 용어

개체명
텍스트 내에서 특정 의미를 가진 이름(예: 인물명, 지명, 기관명, 시간, 수치 등)
시퀀스 태깅
문장 내 각 단어에 대해 태그를 부여하는 방식으로, 개체 경계와 유형을 식별하는 데 사용된다.
BIO 태깅
각 토큰을 개체의 시작(B), 내부(I), 개체 아님(O)으로 표기하여 개체 경계와 유형을 함께 나타내는 시퀀스 태깅 표기법

#직무 연관도

DA
Data Analyst
보통
문서, 뉴스, 소셜미디어 데이터에서 핵심 개체 추출 및 분석
DS
Data Scientist
밀접
NER 모델 설계, 개체 사전 구축, 딥러닝 기반 알고리즘 연구
DE
Data Engineer
높음
NER 모듈 개발, 검색 및 QA 시스템에 통합

#사용 사례

인터넷 서비스고객 서비스금융미디어의료법률
개요
NER은 비정형 텍스트를 구조화된 데이터로 변환하는 과정으로, 질의응답 시스템, 자동 요약, 추천 시스템, 리스크 분석, 법률 문서 검토 등에서 활용된다.
사례
검색 엔진은 질의와 웹 문서에서 인물, 장소, 기관 등의 개체명을 인식해 지식 그래프의 항목과 연결하고, 검색 결과 옆에 해당 개체의 요약 정보 패널을 표시한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.