AI 에이전트(AI Agent)

•
2026년 10월 09일 발행•2026년 10월 09일 수정
요약

대규모 언어 모델을 추론 엔진으로 삼아 계획을 세우고 도구를 호출하며 결과를 관찰하는 반복 과정을 통해 복잡한 과제를 자율적으로 수행하는 시스템

중급
대규모 언어 모델과 프롬프트 엔지니어링의 기본 개념, API 호출과 JSON 같은 구조화 데이터에 대한 이해가 필요하며, 검색 증강 생성과 소프트웨어 시스템 설계 경험이 있으면 이해에 도움이 된다.

#개념

AI 에이전트(AI Agent)는 환경을 인지하고 목표를 달성하기 위해 스스로 판단하여 행동하는 시스템을 가리키는 포괄적인 용어다. 최근에는 특히 대규모 언어 모델(Large Language Models, LLM)을 추론 엔진으로 삼아 계획을 세우고, 외부 도구를 호출하며, 그 결과를 관찰해 다음 행동을 결정하는 반복 과정을 통해 복잡한 과제를 자율적으로 수행하는 LLM 기반 에이전트를 뜻하는 경우가 많다. 단순히 질문에 한 번 답하는 챗봇과 달리, 에이전트는 여러 단계에 걸쳐 행동하고 중간 결과에 따라 경로를 바꾼다.
에이전트라는 용어는 분야에 따라 의미가 다르므로 구분이 필요하다. 전통적인 인공지능(Artificial Intelligence) 교과서에서는 센서로 환경을 인지하고 액추에이터로 행동하는 모든 주체를 에이전트라 불렀고, 강화 학습(Reinforcement Learning)에서는 환경과 상호작용하며 누적 보상을 최대화하도록 정책을 학습하는 주체를 에이전트라 한다. 강화 학습 에이전트가 수치 보상으로 정책 자체를 학습하는 반면, LLM 기반 에이전트는 사전 학습된 언어 모델의 추론 능력을 프롬프트와 도구로 확장하여 행동하며 대개 실행 중에 가중치를 갱신하지 않는다는 점에서 다르다.
또 하나 중요한 구분은 워크플로(Workflow)와 에이전트의 차이다. Anthropic(2024)은 LLM과 도구가 미리 정의된 코드 경로에 따라 조율되는 시스템을 워크플로로, LLM이 자신의 처리 과정과 도구 사용을 동적으로 결정하는 시스템을 에이전트로 정의했다. 프롬프트 체이닝, 라우팅, 병렬화, 오케스트레이터-워커, 평가자-최적화기 같은 워크플로 패턴은 예측 가능성과 비용 면에서 유리하므로, 단계 수를 미리 알 수 없는 열린 문제에만 에이전트를 적용하는 것이 권장된다.
LLM 기반 에이전트는 공통적으로 다음과 같은 구성 요소로 이루어진다.
LLM 기반 에이전트의 구성 요소
  • 계획(Planning): 목표를 하위 과제로 분해하고 실행 순서를 정하는 능력으로, 사고의 사슬(Chain-of-Thought) 추론이나 과제 분해 프롬프트로 구현된다.
  • 도구 사용(Tool Use): 웹 검색, 코드 실행, 데이터베이스 조회, API 호출처럼 모델 외부의 기능을 호출하여 언어 모델만으로는 할 수 없는 행동을 수행한다.
  • 메모리(Memory): 대화와 행동의 이력을 컨텍스트 윈도 안에 유지하는 단기 메모리와, 외부 저장소에 보관했다가 필요할 때 검색하는 장기 메모리로 나뉜다.
  • 반성(Reflection): 자신의 출력과 도구 실행 결과를 평가하여 오류를 수정하고 계획을 수정하는 자기 개선 과정이다.
이 구성 요소를 하나의 실행 루프로 묶은 대표적인 방식이 Yao 등(2022)의 ReAct(Reasoning and Acting)다. ReAct는 모델이 추론 흔적(thought)과 행동(action)을 교대로 생성하도록 프롬프트하고, 행동의 결과인 관찰(observation)을 다시 입력에 덧붙여 다음 추론으로 이어지게 한다. 추론만 하는 사고의 사슬은 외부 정보 없이 사실을 지어내기 쉽고 행동만 하는 방식은 계획이 부족한데, 둘을 결합하면 과제 해결률과 해석 가능성이 함께 높아진다. 오늘날 대부분의 에이전트 프레임워크가 채택한 기본 루프가 이 생각-행동-관찰 구조다.
도구 사용의 표준적인 구현 수단은 함수 호출(Function Calling)이다. 애플리케이션은 도구의 이름, 설명, 매개변수 스키마(JSON Schema)를 모델에 제공하고, 모델은 자유 텍스트 대신 호출할 함수와 인자를 구조화된 형식으로 출력하며, 애플리케이션이 실제 함수를 실행한 뒤 결과를 모델에 돌려준다. 도구의 설명과 인자 이름이 곧 모델이 읽는 인터페이스 문서이므로, 도구 설계는 사람에게 API 문서를 쓰듯 명확해야 한다.
모델 컨텍스트 프로토콜(Model Context Protocol, MCP)은 Anthropic이 2024년 공개한 개방형 표준으로, 도구·리소스·프롬프트를 제공하는 서버와 이를 사용하는 클라이언트(에이전트) 사이의 통신 방식을 통일한다. 이전에는 모델마다, 애플리케이션마다 도구 연동을 따로 구현해야 하는 M×N 통합 문제가 있었으나, MCP 서버 하나를 만들면 이를 지원하는 어떤 에이전트에서도 재사용할 수 있어 데이터베이스, 사내 시스템, 개발 도구를 연결하는 공용 규격으로 빠르게 자리 잡았다.
메모리는 에이전트가 긴 과제와 반복 사용에서 일관성을 유지하게 하는 요소다. 단기 메모리는 컨텍스트 윈도에 담긴 최근 대화와 도구 결과이며, 길어지면 요약이나 오래된 내용의 제거로 관리한다. 장기 메모리는 과거 상호작용과 사실, 사용자 선호를 임베딩(Embedding)으로 변환하여 벡터 데이터베이스(Vector Database)에 저장하고 관련 내용을 검색해 컨텍스트에 주입하는 방식이 일반적이며, 무엇을 언제 컨텍스트에 넣을지를 설계하는 일을 컨텍스트 엔지니어링이라 부르기도 한다.
에이전틱 RAG(Agentic RAG)는 검색 증강 생성(Retrieval-Augmented Generation)을 에이전트 루프 안에 넣은 형태다. 한 번 검색하고 한 번 생성하는 고정 파이프라인과 달리, 에이전트가 질문을 하위 질의로 분해하고, 검색이 필요한지 판단하며, 여러 검색 소스 중 적절한 것을 고르고, 검색 결과의 관련성을 평가해 부족하면 질의를 바꿔 다시 검색한다. 복합 질문과 다중 문서 추론에서 정확도가 높아지지만 지연 시간과 비용이 늘어나는 대가가 있다.
하나의 에이전트에 모든 역할을 맡기면 프롬프트와 도구가 비대해지고 컨텍스트가 혼잡해지므로, 역할을 나눈 멀티 에이전트 시스템(Multi-Agent System)이 쓰인다. 대표적인 구성 패턴은 다음과 같다.
멀티 에이전트 구성 패턴
  • 오케스트레이터-워커: 상위 에이전트가 과제를 분해해 하위 에이전트에 배분하고 결과를 종합하는 계층형 구조로, 하위 에이전트는 각자 독립된 컨텍스트에서 작업한다.
  • 역할 기반 협업: 기획자, 개발자, 검토자처럼 역할을 부여한 에이전트들이 대화를 주고받으며 산출물을 개선하는 구조로, 토론과 상호 비판을 통해 품질을 높인다.
  • 핸드오프(Handoff): 고객 응대처럼 상황에 따라 담당 에이전트를 바꾸는 구조로, 현재 에이전트가 판단하여 대화와 상태를 다른 전문 에이전트에게 넘긴다.
멀티 에이전트는 전문화와 컨텍스트 분리의 이점이 있지만, 에이전트 사이의 정보 전달에서 손실과 오해가 생기고 호출 횟수가 곱으로 늘어 비용이 커진다. 따라서 단일 에이전트로 충분한지 먼저 검증하고, 병렬화나 역할 분리가 측정 가능한 이득을 줄 때만 확장하는 것이 좋다. LangGraph, AutoGen, CrewAI 같은 프레임워크는 상태 그래프나 대화 기반으로 이런 구성을 선언적으로 정의하도록 돕는다.
에이전트의 평가는 단일 응답 평가보다 어렵다. 같은 입력에도 실행 경로가 달라지는 비결정성이 있어 여러 번 반복 실행한 성공률로 측정해야 하고, 최종 결과뿐 아니라 도구 호출의 정확성, 단계 수, 불필요한 행동 같은 궤적(trajectory) 품질도 함께 봐야 한다. SWE-bench, WebArena, GAIA, τ-bench 같은 벤치마크가 코딩, 웹 탐색, 범용 보조, 고객 응대 환경에서의 과제 완료율을 측정하며, 실제 서비스에서는 LLM을 심사자로 쓰는 자동 평가와 사람의 검토를 병행한다.
운영 단계에서는 관측성(Observability)이 필수다. 에이전트는 수십 번의 모델 호출과 도구 호출로 이루어지므로, 각 단계의 입력·출력·토큰 사용량·지연 시간을 하나의 트레이스로 기록해야 실패 원인을 추적할 수 있다. LangSmith, Langfuse, OpenTelemetry 기반 도구들이 이러한 트레이싱과 비용 집계, 프롬프트 버전 관리를 지원한다. 에이전트가 자율적으로 행동하는 만큼 안전성 위험도 커지며, 주요 위험과 대응은 다음과 같다.
에이전트 운영 시 주요 위험과 대응
  • 프롬프트 주입(Prompt Injection): 도구가 가져온 웹 페이지나 문서에 숨겨진 지시가 에이전트를 조종할 수 있으므로, 외부 콘텐츠를 데이터로만 취급하고 민감한 행동 전에 검증한다.
  • 과도한 권한과 비가역 행동: 파일 삭제, 결제, 메일 발송처럼 되돌릴 수 없는 행동에는 최소 권한 원칙과 사람의 승인(human-in-the-loop) 단계를 둔다.
  • 오류 누적과 무한 루프: 잘못된 중간 판단이 이후 단계로 전파되므로 최대 단계 수와 시간 제한을 두고 샌드박스 환경에서 실행한다.
  • 비용 폭증: 한 과제에 수십 회의 호출이 발생하므로 토큰 예산을 정하고 초과 시 중단하거나 사람에게 넘긴다.
비용과 지연은 에이전트 도입의 현실적인 제약이다. 단순 질의응답보다 토큰 사용량이 수십 배 늘 수 있으므로, 프롬프트 캐싱, 반복적이고 단순한 단계에 소형 모델을 배정하는 모델 라우팅, 결정적인 부분을 워크플로나 일반 코드로 대체하는 설계가 함께 쓰인다. 프롬프트 엔지니어링(Prompt Engineering)으로 도구 설명과 시스템 프롬프트를 다듬는 것만으로도 불필요한 호출이 크게 줄어드는 경우가 많다.
AI 에이전트는 코드 저장소를 탐색하고 수정·테스트하는 코딩 에이전트, 주문 조회와 환불 처리를 자동화하는 고객 지원 에이전트, 자연어 질문을 SQL로 바꿔 실행하고 결과를 해석하는 데이터 분석 에이전트, 웹을 탐색하며 자료를 수집하는 리서치 에이전트 등으로 활용된다. 전자상거래에서는 사용자의 취향을 묻고 추천 시스템(Recommender System)과 검색 API를 도구로 호출하여 상품을 찾아 주는 쇼핑 어시스턴트, 상품 설명과 이미지에서 속성을 추출하고 검증하는 카탈로그 정제 에이전트가 대표적이다.
결론적으로 AI 에이전트는 언어 모델을 단순한 텍스트 생성기에서 도구를 다루고 환경과 상호작용하는 행위자로 확장한 개념이지만, 자율성이 커질수록 예측 가능성과 비용, 안전성의 부담도 함께 커진다. 따라서 가장 단순한 워크플로에서 출발하여 측정 가능한 이득이 확인될 때만 자율성을 늘리고, 평가·관측·안전장치를 처음부터 설계에 포함하는 것이 실무의 원칙이다.

#관련 용어

대규모 언어 모델
에이전트의 추론·계획·도구 선택을 담당하는 핵심 엔진으로 쓰이는 대규모 사전 학습 언어 모델
ReAct
추론 흔적과 행동을 교대로 생성하고 관찰을 되먹이는 에이전트의 기본 실행 루프
함수 호출
모델이 도구의 스키마에 맞춰 호출할 함수와 인자를 구조화된 형식으로 출력하는 도구 사용 방식
모델 컨텍스트 프로토콜(MCP)
도구·리소스·프롬프트를 제공하는 서버와 에이전트 사이의 통신을 표준화한 개방형 프로토콜
검색 증강 생성
외부 지식을 검색하여 생성에 반영하는 기법으로, 에이전트 루프에 결합하면 에이전틱 RAG가 된다
강화 학습
보상을 최대화하도록 정책을 학습하는 주체를 에이전트라 부르는 분야로, LLM 기반 에이전트와 용어가 구분된다

#직무 연관도

DA
Data Analyst
보통
자연어로 데이터를 조회·분석하는 에이전트를 활용하고, 과제 완료율과 비용 같은 에이전트 성과 지표를 해석한다
DS
Data Scientist
높음
에이전트의 계획·도구 사용·메모리 구조 설계, 프롬프트와 평가 방법론 연구, 에이전틱 RAG와 멀티 에이전트 실험에 직접 관여한다
DE
Data Engineer
밀접
도구와 MCP 서버 구현, 에이전트 오케스트레이션, 트레이싱·비용 관리·안전장치 등 프로덕션 에이전트 시스템 구축과 운영의 핵심 영역이다

#사용 사례

인터넷 서비스전자상거래금융소프트웨어통신의료제조
개요
AI 에이전트는 코드 작성·수정·테스트를 수행하는 코딩 에이전트, 주문·환불을 처리하는 고객 지원 자동화, 자연어 질문을 SQL로 변환해 분석하는 데이터 에이전트, 웹 리서치와 보고서 작성, 쇼핑 어시스턴트와 상품 카탈로그 정제 등 여러 단계의 판단과 도구 사용이 필요한 업무에 활용된다.
사례
전자상거래 고객센터에서 주문 조회, 배송 추적, 환불 규정 확인 도구를 MCP 서버로 제공하고, 고객 문의를 받은 에이전트가 ReAct 루프로 필요한 도구를 호출해 상황을 파악한 뒤 답변한다. 환불 승인처럼 되돌릴 수 없는 행동은 상담사의 승인 단계를 거치도록 하고, 모든 도구 호출을 트레이싱하여 과제 완료율과 건당 토큰 비용을 모니터링한다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.