콤퓨타지식 AI 모델은 어떻게 검증할까? Benchmark·Eval·Red Teaming·독립 평가의 차이
페이지 정보
본문
작성일
AI 모델을 소개하는 자료를 보면 흔히 “벤치마크 점수”가 등장합니다.
수학 문제를 얼마나 잘 풀었는지,
코드를 얼마나 정확하게 작성했는지,
긴 문맥을 얼마나 잘 이해했는지
등을 숫자로 비교합니다.
하지만 AI를 검증하는 방법이 벤치마크 하나로 끝나는 것은 아닙니다.
실제 AI 시스템을 평가할 때는
Benchmark
Evaluation
Human Evaluation
Red Teaming
Independent Evaluation
Audit
등 서로 다른 목적을 가진 여러 검증 방식이 사용될 수 있습니다.
미국 NIST 역시 AI 시스템 평가를 단순한 성능 측정이 아니라 시험(Test), 평가(Evaluation), 검증(Verification), 확인(Validation)을 포함하는 TEVV 구조로 다루고 있습니다. 최근 공개한 TEVV-Athlon Framework는 대규모 언어 모델뿐 아니라 멀티모달 모델과 AI 에이전트 등 다양한 AI 시스템에 맞춰 평가 방법을 설계할 수 있도록 구성되어 있습니다.
■ AI Evaluation이란 무엇일까?
AI 평가(AI Evaluation)는 특정한 목적과 기준을 정하고 AI 모델이나 시스템이 그 기준을 얼마나 충족하는지 측정하는 과정입니다.
가장 단순한 구조는 다음과 같습니다.
평가할 능력 정의
↓
테스트 데이터 준비
↓
AI에게 과제 수행
↓
결과 수집
↓
정해진 기준으로 측정
↓
결과 분석
예를 들어 코딩 AI를 평가한다면 단순히 “코드를 잘 작성하는가?”라고 물어보는 것만으로는 충분하지 않습니다.
어떤 언어를 대상으로 할 것인지,
어떤 난이도의 문제를 사용할 것인지,
코드가 실행되는지만 볼 것인지,
정확성과 보안까지 확인할 것인지
등을 먼저 정의해야 합니다.
즉 Evaluation은 하나의 특정 시험 이름이라기보다 AI의 성능이나 행동을 측정하는 전체적인 평가 활동에 가까운 개념입니다.
Anthropic 역시 좋은 평가를 설계하는 것 자체가 어렵다고 설명합니다. 평가 문제가 충분히 어렵고 실제 측정하려는 능력과 관련되어 있어야 하며, 평가 데이터가 학습 데이터에 포함되어 단순 암기 능력을 측정하는 상황도 피해야 한다고 설명합니다.
■ Benchmark는 무엇일까?
벤치마크(Benchmark)는 AI 모델을 같은 문제와 같은 기준으로 비교하기 위해 만든 표준화된 평가 세트라고 이해할 수 있습니다.
예를 들어 세 개의 AI 모델에 동일한 1,000개의 문제를 주고 정답률을 측정한다면 결과를 비교할 수 있습니다.
Model A
82%
Model B
87%
Model C
91%
이처럼 같은 기준에서 모델의 상대적인 성능을 비교하는 것이 Benchmark의 대표적인 역할입니다.
장점은 명확합니다.
같은 조건에서 여러 모델을 비교하기 쉽습니다.
성능 변화도 숫자로 추적할 수 있습니다.
하지만 한계도 있습니다.
벤치마크에서 높은 점수를 받았다고 해서 실제 서비스에서도 항상 더 좋은 결과를 내는 것은 아닙니다.
평가 문제가 실제 사용 환경을 충분히 반영하지 못할 수도 있고, 이미 학습 과정에서 평가 문제나 유사한 데이터가 포함되었을 가능성도 있기 때문입니다.
따라서 Benchmark는 AI Evaluation을 수행하는 하나의 방법이지 Evaluation 전체를 의미하지는 않습니다.
■ Automated Evaluation은 사람이 직접 보지 않아도 평가할 수 있습니다
평가 결과를 자동으로 계산할 수 있는 경우도 있습니다.
이를 자동 평가(Automated Evaluation)라고 부를 수 있습니다.
예를 들어 수학 문제라면 정답과 모델의 답을 비교할 수 있습니다.
코딩 문제라면 생성된 코드를 실제로 실행해 테스트를 통과하는지 확인할 수 있습니다.
구조화 출력이라면 JSON Schema를 올바르게 지켰는지도 자동으로 검사할 수 있습니다.
AI
↓
답변 생성
↓
자동 테스트
↓
Pass / Fail
↓
점수 계산
이런 방식은 많은 결과를 빠르게 반복 평가할 수 있다는 장점이 있습니다.
하지만 모든 AI 품질을 자동으로 평가할 수 있는 것은 아닙니다.
예를 들어
답변이 자연스러운가?
상담원의 말투로 적절한가?
사용자의 의도를 잘 이해했는가?
설명이 설득력 있는가?
같은 문제는 단순 정답 비교로 평가하기 어렵습니다.
이 때문에 자동 평가와 사람 평가를 함께 사용하는 경우가 많습니다.
■ Human Evaluation은 왜 필요한가?
사람 평가(Human Evaluation)는 사람이 AI 결과를 직접 보고 품질을 판단하는 방식입니다.
예를 들어 두 AI 답변을 보여주고
어느 답변이 더 정확한가?
어느 쪽이 더 이해하기 쉬운가?
어느 답변이 더 안전한가?
어느 답변이 사용자 요청에 잘 맞는가?
를 사람이 판단할 수 있습니다.
특히 자연어 생성, 이미지 생성, 상담, 창작과 같이 단순한 정답 하나를 정의하기 어려운 영역에서 유용합니다.
전문적인 영역이라면 일반 사용자가 아니라 해당 분야 전문가가 평가할 수도 있습니다.
예를 들어 사이버보안 능력을 평가한다면 보안 전문가가 필요할 수 있고, 의료 분야에서는 의료 전문지식을 가진 평가자가 필요할 수 있습니다.
다만 사람 평가에도 단점이 있습니다.
평가자마다 판단 기준이 다를 수 있습니다.
많은 결과를 평가하려면 시간과 비용도 증가합니다.
따라서 Human Evaluation에서도 평가 기준과 절차를 명확하게 만드는 것이 중요합니다.
■ Red Teaming은 ‘잘하는가’보다 ‘어떻게 실패하는가’를 찾습니다
레드티밍(Red Teaming)은 일반적인 성능 평가와 목적이 다릅니다.
일반적인 Evaluation이
“AI가 이 작업을 얼마나 잘 수행하는가?”
를 측정한다면,
Red Teaming은 의도적으로
“AI가 어디에서 실패하는가?”
를 찾는 과정에 가깝습니다.
예를 들어 AI의 안전장치를 우회하려고 시도하거나,
잘못된 정보를 생성하도록 유도하거나,
제한된 기능을 사용하도록 공격적인 입력을 넣을 수 있습니다.
정상적인 사용자
↓
AI 사용
이 아니라
공격적 평가자
↓
의도적으로 취약점 탐색
↓
AI의 실패 행동 확인
이라는 구조입니다.
즉 Red Teaming은 평균적인 성능보다는 취약점, 극단적인 실패 상황, 예상하지 못한 행동을 발견하는 데 초점을 둡니다.
NIST의 생성형 AI 위험관리 자료도 Red Teaming을 생성형 AI 위험을 발견하고 관리하기 위한 중요한 평가 활동으로 다루고 있습니다.
■ Field Testing은 실제 사용 환경을 봅니다
실험실이나 벤치마크에서는 잘 작동하던 AI가 실제 서비스에서는 예상과 다르게 행동할 수 있습니다.
사용자의 질문은 평가 데이터처럼 정돈되어 있지 않고,
여러 기능이 동시에 연결되어 있으며,
외부 API나 데이터베이스 같은 실제 환경과 상호작용하기 때문입니다.
그래서 AI 평가에는 실제 사용 환경과 가까운 조건에서 시스템을 확인하는 현장 테스트(Field Testing)도 포함될 수 있습니다.
예를 들어 AI 상담 시스템이라면 벤치마크에서는 정확한 답변을 생성했더라도 실제 서비스에서는
사용자의 오타,
불완전한 질문,
긴 대화,
기존 고객 데이터,
외부 API 오류
등이 함께 발생합니다.
모델 자체의 능력을 평가하는 것과 AI가 들어간 전체 서비스가 정상적으로 작동하는지 평가하는 것은 다른 문제입니다.
NIST의 최근 TEVV 접근 역시 AI 시스템 평가를 실제 사용 목적과 영향까지 고려해 설계할 수 있도록 하는 방향을 제시하고 있습니다.
■ AI Agent는 평가하기가 더 어렵습니다
일반적인 챗봇은 질문을 받고 답변을 생성합니다.
하지만 AI 에이전트(AI Agent)는 여러 단계를 거쳐 행동할 수 있습니다.
사용자 요청
↓
상황 판단
↓
도구 선택
↓
API 호출
↓
결과 확인
↓
다음 행동 결정
↓
최종 결과
이런 시스템에서는 마지막 답변만 평가해서는 전체 행동을 이해하기 어려울 수 있습니다.
Anthropic도 AI Agent는 여러 번의 상호작용과 Tool Calling, 상태 변경 등을 수행하기 때문에 일반적인 단일 응답 모델보다 평가하기 어렵다고 설명합니다.
예를 들어 최종 답변은 맞았지만 중간 과정에서 잘못된 API를 호출했다면 평가를 어떻게 해야 할까요?
반대로 중간 과정은 올바르게 수행했지만 외부 서비스 오류 때문에 최종 결과가 실패했다면 모델의 문제라고 봐야 할까요?
Agent Evaluation에서는 따라서
최종 결과
뿐 아니라
도구 선택
행동 순서
중간 상태
오류 대응
작업 완료 여부
등을 함께 살펴볼 수 있습니다.
■ Independent Evaluation은 ‘누가 평가하는가’의 문제입니다
지금까지 살펴본 Benchmark, Human Evaluation, Red Teaming은 주로 어떻게 평가하는가에 대한 구분입니다.
독립 평가(Independent Evaluation)는 조금 다른 기준입니다.
누가 평가하는가에 관한 개념입니다.
AI 모델을 만든 기업이 자기 모델을 평가하면 내부 평가입니다.
반면 모델을 개발하지 않은 외부 연구기관이나 정부기관, 별도의 평가자가 평가한다면 독립 평가 또는 제3자 평가(Third-party Evaluation)의 형태가 될 수 있습니다.
AI 개발기업
↓
자체 Evaluation
과
AI 개발기업
↓
외부 평가기관
↓
Independent Evaluation
은 평가 주체가 다릅니다.
독립 평가라고 해서 자동으로 더 정확한 평가가 된다는 의미는 아닙니다.
외부 평가자 역시 적절한 데이터, 전문성, 평가 환경과 모델 접근권이 필요하기 때문입니다.
Anthropic 역시 과거 제3자 평가의 장점을 인정하면서도 실제로 외부 평가를 진행하기 위해 상당한 과학·엔지니어링 지원이 필요했다고 설명한 바 있습니다.
따라서 독립성은 평가의 한 요소이지 평가 품질 자체를 자동으로 보장하는 조건은 아닙니다.
■ Evaluation과 Audit은 같은 개념일까?
여기서 자주 혼동되는 개념이 AI Evaluation과 AI Audit입니다.
두 개념은 겹치는 영역이 있지만 동일한 의미로 보는 것은 어렵습니다.
Evaluation은 주로
AI 시스템이 무엇을 할 수 있는지, 얼마나 잘 작동하는지, 어떤 위험한 행동을 하는지 측정하는 활동
에 초점이 있습니다.
반면 Audit은 평가 범위를 조직과 관리 체계까지 넓힐 수 있습니다.
예를 들어 AI Audit에서는
AI 위험관리 정책이 존재하는가?
↓
담당자가 지정되어 있는가?
↓
평가 절차가 정의되어 있는가?
↓
그 절차를 실제로 실행했는가?
↓
평가 기록을 남겼는가?
↓
사고 대응 절차가 있는가?
등을 확인할 수 있습니다.
즉 단순히 모델에게 문제를 풀게 하는 것보다 AI를 개발하고 운영하는 조직의 프로세스까지 검토하는 성격이 강해질 수 있습니다.
국제표준 ISO/IEC 42001도 개별 AI 모델의 벤치마크 점수를 정하는 표준이 아니라, 조직이 AI와 관련된 정책·목표·프로세스를 만들고 유지·개선하는 AI 관리시스템(AI Management System)을 다룹니다.
■ Test·Evaluation·Verification·Validation은 무엇이 다를까?
AI 평가를 조금 더 넓게 보면 NIST가 사용하는 TEVV라는 개념도 있습니다.
TEVV는
Testing
Evaluation
Verification
Validation
의 앞 글자를 합친 표현입니다.
엄밀한 정의는 적용 분야와 방법론에 따라 달라질 수 있지만, 쉽게 이해하면 다음과 같습니다.
Testing
특정 조건을 주고 시스템이 어떻게 작동하는지 시험합니다.
↓
Evaluation
시험 결과를 기준과 지표에 따라 분석하고 성능이나 위험을 평가합니다.
↓
Verification
시스템이 정해진 요구사항이나 사양에 맞게 만들어졌는지 확인합니다.
↓
Validation
실제 사용 목적과 환경에서 해당 시스템이 필요한 역할을 제대로 수행하는지 확인합니다.
예를 들어 고객상담 AI를 생각해보겠습니다.
테스트에서는 1,000개의 질문을 입력합니다.
평가에서는 정확도와 응답 품질을 측정합니다.
검증에서는 회사가 정한 규칙과 출력 형식을 지키는지 확인합니다.
확인 단계에서는 실제 고객상담 업무에 사용할 수 있을 정도로 적합한지 살펴봅니다.
NIST는 이러한 TEVV를 다양한 AI 시스템에 맞게 조정할 수 있는 평가 구조로 발전시키고 있습니다.
■ 좋은 평가에는 ‘평가 데이터’도 중요합니다
AI 평가에서는 모델뿐 아니라 평가 문제 자체의 품질도 중요합니다.
예를 들어 한 모델이 특정 벤치마크에서 높은 점수를 얻었다고 해보겠습니다.
그런데 평가 문제가 이미 인터넷에 널리 공개되어 있고 모델이 학습 과정에서 같은 문제를 본 적이 있다면 어떻게 될까요?
모델의 일반적인 문제 해결 능력보다 평가 문제를 기억한 능력을 측정했을 가능성이 생깁니다.
이를 평가 데이터 오염(Evaluation Contamination) 또는 데이터 오염 문제와 연결해서 볼 수 있습니다.
Anthropic 역시 좋은 Evaluation의 조건 중 하나로 가능하면 평가 데이터가 학습 데이터에 포함되지 않아야 한다는 점을 강조합니다.
그래서 일부 평가에서는 문제를 외부에 공개하지 않는 방식도 사용됩니다.
NIST가 운영하는 AI Technology Evaluation 프로그램도 격리된 테스트 환경(Sequestered Testbed)을 활용해 AI 모델의 성능을 평가하는 방향을 제시하고 있습니다.
■ 평가를 많이 한다고 반드시 정확해지는 것은 아닙니다
AI 검증에서 중요한 것은 평가의 개수보다 무엇을 측정하려고 하는가입니다.
예를 들어 한 모델이
수학 Benchmark 95점
코딩 Benchmark 90점
이라고 해도,
그 모델이 고객 상담에서 회사 정책을 제대로 따르는지는 알 수 없습니다.
반대로 고객 상담 Eval을 잘 통과했다고 해서 사이버보안 위험이 낮다는 의미도 아닙니다.
측정하려는 질문이 다르기 때문입니다.
그래서 AI Evaluation을 설계할 때는 가장 먼저
“이 평가를 통해 무엇을 알고 싶은가?”
를 정의해야 합니다.
그 이후에 Benchmark를 사용할지,
사람 평가를 할지,
Red Teaming을 할지,
실제 환경 테스트를 할지
결정하는 구조가 됩니다.
■ 하나의 AI 시스템에는 여러 검증 방식이 함께 사용될 수 있습니다
AI 검증 방법을 하나의 흐름으로 정리하면 다음과 같습니다.
Benchmark
정해진 문제로 기본적인 능력과 성능을 비교합니다.
↓
Automated Evaluation
많은 결과를 자동화된 기준으로 반복 측정합니다.
↓
Human Evaluation
사람이 품질과 유용성 등 자동 측정하기 어려운 요소를 평가합니다.
↓
Red Teaming
의도적으로 공격적인 조건을 만들어 취약점과 실패 가능성을 찾습니다.
↓
Field Testing
실제 사용 환경과 비슷한 조건에서 시스템이 어떻게 작동하는지 확인합니다.
↓
Independent Evaluation
모델을 만든 조직과 분리된 평가자가 검증합니다.
↓
Audit
개별 모델뿐 아니라 조직의 정책·절차·위험관리 체계까지 검토할 수 있습니다.
이 방식들이 서로 경쟁하는 것은 아닙니다.
각각 확인하는 대상과 목적이 다르기 때문에 하나의 AI 시스템에서도 여러 방식이 함께 사용될 수 있습니다.
■ AI를 평가한다는 것은 점수 하나를 만드는 일이 아닙니다
AI 모델 평가를 흔히 Benchmark 순위와 연결해서 생각하기 쉽습니다.
하지만 실제 AI 검증의 범위는 훨씬 넓습니다.
모델이 얼마나 문제를 잘 해결하는가?
↓
실패하는 상황은 무엇인가?
↓
실제 환경에서도 같은 성능을 내는가?
↓
안전장치를 우회할 수 있는가?
↓
평가 결과는 사람이 봐도 적절한가?
↓
개발사 밖의 평가자가 같은 결과를 확인할 수 있는가?
↓
조직 내부에 위험을 관리하는 절차가 존재하는가?
까지 서로 다른 질문이 존재합니다.
그래서 Benchmark는 Evaluation의 일부이고, Red Teaming은 실패 가능성을 찾기 위한 별도의 평가 방식이며, Independent Evaluation은 평가 주체의 독립성을 다루고, Audit은 조직의 관리 체계까지 범위를 확장할 수 있습니다.
AI Evaluation의 핵심은 하나의 점수로 AI가 ‘좋다’ 또는 ‘안전하다’를 판정하는 것이 아니라, 확인하려는 질문에 맞는 평가 방법을 설계하고 여러 증거를 함께 확인하는 것에 있습니다.
────────────────────
■ 주요 용어 정리
AI 평가(AI Evaluation)
AI 모델이나 시스템이 특정 기준과 목적을 얼마나 충족하는지 측정하고 분석하는 과정.
벤치마크(Benchmark)
여러 AI 모델의 성능을 동일한 문제와 기준으로 비교하기 위해 구성한 표준화된 평가 방식.
자동 평가(Automated Evaluation)
사전에 정의된 규칙이나 테스트 프로그램 등을 이용해 AI 결과를 자동으로 측정하는 평가.
사람 평가(Human Evaluation)
사람이 AI의 출력이나 행동을 직접 확인하고 품질·유용성·안전성 등을 평가하는 방식.
레드티밍(Red Teaming)
AI 시스템에 의도적으로 어려운 조건이나 공격적인 입력을 적용해 취약점과 실패 가능성을 찾는 평가 활동.
현장 테스트(Field Testing)
실제 서비스 환경 또는 실제 사용 환경과 유사한 조건에서 AI 시스템을 평가하는 방식.
독립 평가(Independent Evaluation)
AI를 개발한 조직과 분리된 외부 평가자나 기관이 수행하는 평가.
제3자 평가(Third-party Evaluation)
AI 시스템의 개발·운영 주체가 아닌 별도의 외부 기관이 수행하는 평가.
AI 감사(AI Audit)
AI 모델의 결과뿐 아니라 조직의 정책, 절차, 통제, 기록, 위험관리 체계 등을 독립적으로 검토하는 활동을 포함할 수 있는 개념.
TEVV
Testing, Evaluation, Verification, Validation의 약자로 AI 시스템을 시험하고 평가·검증하는 일련의 활동을 설명할 때 사용되는 개념.
평가 데이터 오염(Evaluation Contamination)
평가에 사용되는 문제나 데이터가 모델의 학습 과정에 포함되어 실제 능력보다 평가 점수가 높아질 수 있는 문제.
────────────────────
■ 참고자료
NIST — The TEVV-Athlon Framework for Evaluating AI Systems
https://www.nist.gov/artificial-intelligence/ai-research/tevv-athlon-framework-evaluating-ai-systems
NIST — AI Measurement and Evaluation
https://www.nist.gov/ai-measurement-and-evaluation
NIST — Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
Anthropic — A new initiative for developing third-party model evaluations
https://www.anthropic.com/news/a-new-initiative-for-developing-third-party-model-evaluations
Anthropic — Challenges in evaluating AI systems
https://www.anthropic.com/news/evaluating-ai-systems
Anthropic — Demystifying evals for AI agents
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
ISO — ISO/IEC 42001:2023 AI management systems
https://www.iso.org/standard/42001
────────────────────
■ 함께 읽으면 좋은 글
콤퓨타이슈
