본문으로 건너뛰기
AIDevOps
  • Learn
  • Learning Paths
  • Practice
  • Open Source
  • Books
  • Engineering

    AI DevOpsAI 서비스 개발·운영 전체 지도LLMOpsLLM 배포·평가·관측실전 프로젝트AI Agent 프로젝트 실습

    Knowledge

    Docs기술 문서 모음Blog엔지니어링 아티클Plogger개발 기록 피드

    Validate

    Certification3단계 역량 인증 · 준비 중
AI Models
LlamaMistralGemmaDeepSeekQwen
🤖 AI 실전 개발
AI 실전 입문 & 로드맵Hugging FaceLangChainLlamaIndexLLMOps|LangGraphMCPMulti-AgentAgent Evaluation
🧠 AI Core
AI 입문 & 로드맵ML FundamentalsLLM Fundamentals|Python AIC++|PyTorchTensorFlowJAX
🧠 AI Agent 개발
금융 AI AgentLLM API 서버주식 투자 AgentAIOps AI Agent교육 AI Agent코딩 AI Agent
🌱 Spring Cloud
Spring 입문 & 로드맵Spring Cloud GatewaySpring BootJava|Spring AISpring SecuritySpring BatchSpring JPA
🐳 DevOps
DevOps 입문 & 로드맵LinuxDockerCI/CD|Kubernetes 기본K8s 심화/실무PrometheusGrafana
🧱 인프라
인프라 입문 & 로드맵NginxRedis
☁️ 클라우드
클라우드 입문 & 로드맵AWSGCPAzureNCPCloudflare
🎨 Frontend
Frontend 입문 & 로드맵JavaScriptTypeScript|ReactNext.js|VueNuxt
📱 Mobile
Mobile 입문 & 로드맵KotlinAndroidFlutter
⚙️ Backend
Backend 입문 & 로드맵Python 기본FastAPIDjangoFlask|CGoGinNode.js
💾 Database
DB 입문 & 로드맵공통 SQLOracleMySQLPostgreSQL|MongoDB벡터 DB
🧪 검증
k6JMeternGrinder
AIDevOps

Engineering AI. From Code to Production.
AI와 AI Agent를 개발하고 운영하기 위한 엔지니어링 학습 플랫폼

Learn

  • 전체 가이드
  • Learning Paths
  • Practice
  • Books

Resources

  • AI DevOps
  • LLMOps
  • 실전 프로젝트
  • Docs
  • Blog
  • Plogger
  • Open Source
  • Certification (준비 중)

Start Here

  • AI Core 로드맵
  • AI 실전 개발 로드맵
  • Spring Cloud 로드맵
  • DevOps 로드맵
  • 인프라 로드맵

 

  • 클라우드 로드맵
  • Frontend 로드맵
  • Mobile 로드맵
  • Backend 로드맵
  • Database 로드맵
© 2026 AI DevOps Korea. All rights reserved.
이용약관개인정보처리방침Sitemaptestforge.kr
  1. Home
  2. Learn
  3. AI 실전 개발
  4. Agent Evaluation
AI Agent 평가 가이드

📊 Agent Evaluation 완전 가이드

Visitors

AI Agent의 응답 품질, 도구 사용 정확도, 안전성을 정량적으로 평가하는 방법을 정리합니다. Golden Set 구축부터 LLM-as-Judge, 회귀 테스트까지 실무에서 바로 쓰는 평가 체계를 다룹니다.

  • Advanced · 심화
  • 업데이트 2026.09.19
  • 약 3분 읽기
  • 6개 섹션
  • 예제 코드 1개

포함된 Learning Path

이 가이드는 아래 경로의 한 단계입니다. 앞뒤 순서와 함께 학습해보세요.

  • AI Agent Engineer →
Golden Set 구축LLM-as-Judge 평가Agent 회귀 테스트프로덕션 품질 모니터링

목차

0 / 8
  1. 가이드 사용법
  2. 구조 다이어그램
  3. 왜 평가가 어려운가
  4. Golden Set 구축
  5. 정량 평가 지표
  6. LLM-as-Judge
  7. 회귀 테스트
  8. 프로덕션 모니터링
목차 8개 섹션
  1. 가이드 사용법
  2. 구조 다이어그램
  3. 왜 평가가 어려운가
  4. Golden Set 구축
  5. 정량 평가 지표
  6. LLM-as-Judge
  7. 회귀 테스트
  8. 프로덕션 모니터링

가이드 사용법

읽는 방향

Agent Evaluation를 실무 흐름으로 이해하기

AI Agent의 응답 품질, 도구 사용 정확도, 안전성을 정량적으로 평가하는 방법을 정리합니다. Golden Set 구축부터 LLM-as-Judge, 회귀 테스트까지 실무에서 바로 쓰는 평가 체계를 다룹니다. 이 가이드는 개념을 나열하기보다, 실제 프로젝트에서 판단해야 하는 순서대로 내용을 따라갈 수 있게 구성했습니다.

핵심 관점

AI / LLM 시스템

모델과 프롬프트만 보지 않고, 데이터 흐름, 평가, 배포 이후의 운영 지표까지 한 번에 연결해서 봅니다.

Golden Set 구축LLM-as-Judge 평가Agent 회귀 테스트프로덕션 품질 모니터링

구조 다이어그램

글로 읽은 내용을 머릿속에 오래 남기려면 먼저 흐름을 그림으로 잡는 편이 좋습니다. 아래 두 그림은 Agent Evaluation를 학습할 때 계속 되돌아볼 수 있는 기준 지도입니다.

학습 흐름

다이어그램 렌더링 중…

아키텍처 관점

다이어그램 렌더링 중…

왜 평가가 어려운가

Agent Evaluation를 처음 펼칠 때는 세부 명령보다 큰 그림이 먼저입니다. 이 섹션에서는 앞으로 배울 개념들이 어떤 문제를 풀기 위해 등장했는지부터 잡아봅니다.

LLM Agent는 같은 입력에도 매번 다른 출력을 낼 수 있고, "정답"이 하나로 고정되지 않는 경우가 많습니다. 단위 테스트의 assert equal 방식이 통하지 않기 때문에, Agent는 별도의 평가 체계 없이는 배포 후 품질 저하를 알아채기 어렵습니다.

Tip

평가 없이 배포한 Agent는 "체감상 괜찮아 보이는" 상태로 방치되다가, 모델·프롬프트를 바꾼 뒤에야 품질이 나빠졌다는 걸 뒤늦게 발견하는 경우가 흔합니다.

Golden Set 구축

Golden Set 구축은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

실제 사용자 질문 패턴을 대표하는 질문-기대 결과 세트를 먼저 만듭니다. 난이도와 유형을 나눠 구성하면 어떤 케이스에서 취약한지 파악하기 쉽습니다.
난이도비중예시
쉬움 (Happy path)50%표준적인 단일 도구 호출로 해결되는 질문
보통 (Multi-step)30%여러 도구를 순서대로 조합해야 하는 질문
어려움 (Edge case)20%모호한 질문, 도구가 실패했을 때의 처리

정량 평가 지표

정량 평가 지표은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

Golden Set으로 채점할 때는 하나의 점수만 보지 말고 여러 지표를 함께 추적해야 어느 부분이 약한지 구분할 수 있습니다.
지표측정 대상
Task Success Rate목표를 실제로 달성했는지 여부
Tool Call Accuracy올바른 도구를, 올바른 인자로 호출했는지
FaithfulnessRAG 답변이 검색된 근거 문서에 실제로 기반하는지
Latency (p50/p95)응답까지 걸린 시간 분포
Cost per task작업 하나를 완료하는 데 든 토큰 비용

LLM-as-Judge

여기서는 LLM-as-Judge을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

사람이 모든 응답을 채점할 수 없으므로, 별도의 LLM에 채점 기준을 명확히 제시해 자동으로 평가하게 합니다. 채점 기준을 구체적인 체크리스트로 줄수록 사람의 판단과 일치도가 높아집니다.
llm_judge.pyPYTHON
JUDGE_PROMPT = """다음 Agent 응답을 0~5점으로 채점하세요.

질문: {question}
기대 결과: {expected}
Agent 응답: {actual}

채점 기준:
- 5점: 기대 결과와 사실상 동일, 근거가 명확함
- 3점: 방향은 맞지만 일부 정보 누락/부정확
- 0점: 완전히 틀리거나 근거 없이 답변함

점수만 숫자로 답하세요."""

def judge(question: str, expected: str, actual: str) -> int:
    score = call_llm(JUDGE_PROMPT.format(
        question=question, expected=expected, actual=actual))
    return int(score.strip())

Tip

Judge 모델의 판정 자체도 가끔 흔들립니다 — 중요한 지표는 사람이 주기적으로 샘플링해 LLM-as-Judge 결과와 일치하는지 검증하세요.

회귀 테스트

이 섹션은 회귀 테스트을 실무 관점에서 정리합니다. 개념을 외우기보다, 어떤 상황에서 이 기준을 꺼내 쓸지에 초점을 맞춰보세요.

모델을 바꾸거나 프롬프트를 수정할 때마다 golden set 전체를 다시 돌려 이전 버전과 점수를 비교합니다. CI에 연동하면 품질 하락을 배포 전에 잡아낼 수 있습니다.

Tip

golden set 평균 점수뿐 아니라 "이전엔 통과했는데 이번엔 실패한 케이스"를 따로 추적하면 회귀를 훨씬 빨리 찾을 수 있습니다.

프로덕션 모니터링

이 섹션은 프로덕션 모니터링을 실무 관점에서 정리합니다. 개념을 외우기보다, 어떤 상황에서 이 기준을 꺼내 쓸지에 초점을 맞춰보세요.

골든셋은 배포 전 검증용이고, 실제 트래픽에서는 별도의 샘플링 평가가 필요합니다. 일부 실사용 응답을 무작위로 뽑아 LLM-as-Judge로 채점하고, 점수 추이·이상치를 추적합니다.

Tip

다음 단계로 llmops 가이드에서 이 평가 체계를 실제 운영 파이프라인(로깅, 알림, 대시보드)에 연결하는 방법을 다룹니다.

← 이전 가이드Multi-Agent