콤퓨타수선집은 문체부지정 공식
저작권대리중개업체 육하원칙과 함께합니다.

콤퓨타이슈 AI를 만든 회사 밖에서 AI를 평가한다 — Anthropic이 도입하는 ‘상주형 외부 평가자’란?

페이지 정보

본문

작성일

AI 모델의 성능과 안전성은 지금까지 주로 AI를 개발한 기업이 직접 테스트하고 그 결과를 공개하는 방식으로 관리되어 왔습니다.


그런데 최근에는 AI를 만든 회사와 AI를 평가하는 주체를 분리하려는 움직임이 보다 구체적인 형태로 나타나고 있습니다.


Anthropic 공동창업자이자 CEO인 Dario Amodei는 9월 공개한 글 「We Must Pace the Frontier」에서 AI 개발 속도와 안전 검증 사이의 균형을 맞추기 위한 3단계 방안을 제안했습니다.


그 첫 번째 단계가 바로 상주형 외부 평가자(Embedded Evaluator)입니다.


단순히 완성된 AI 모델을 외부 기관에 한번 테스트받는 것이 아니라, 외부 평가자가 AI 기업 내부에 지속적으로 접근하면서 모델 개발 과정과 안전 절차를 확인하는 방식입니다. Anthropic은 이 제안을 다른 기업의 참여와 관계없이 자사부터 시행하겠다고 밝혔습니다.  


■ Anthropic이 제안한 ‘Embedded Evaluator’란?


Amodei가 제안한 구조는 비교적 명확합니다.


AI 기업


↓


외부 제3자 평가팀


↓


기업 내부에 지속적으로 접근


↓


AI 안전 절차와 약속의 이행 여부 확인


↓


사고와 위험 요소 확인


↓


모델과 개발 과정 평가


Anthropic은 프런티어 AI 기업들이 외부 제3자 평가팀에 직원과 유사한 수준의 지속적인 접근권을 제공하는 방식을 제안했습니다.


평가 대상도 완성된 AI 모델만을 의미하지 않습니다.


Amodei는 외부 평가자가 모델의 정렬 상태뿐 아니라 학습 파이프라인(Training Pipeline), 개발 과정, 안전 절차와 운영 과정까지 확인할 수 있어야 한다고 설명했습니다.  


즉 기존의


AI 기업 → 모델 개발 → 외부에서 모델 테스트


보다


AI 기업 ↔ 내부에 접근하는 외부 평가자


에 가까운 구조입니다.


■ 외부 평가자에게 회사 내부 접근권도 제공할 계획입니다


Anthropic이 설명한 접근 범위는 일반적인 외부 테스트보다 넓습니다.


Anthropic은 향후 외부 검토팀에게 다음과 같은 환경을 제공할 계획이라고 밝혔습니다.


회사 사무실에서 사용할 자리


회사 출입 배지


회사 노트북


내부 위험평가팀과 상당 부분 유사한 작업공간과 도구


관련 정보를 확인할 수 있는 권한


직원들과 직접 대화할 수 있는 접근성


다만 법률이나 계약상 제한이 있거나 고객·파트너의 개인정보와 기밀정보를 보호해야 하는 경우에는 접근 범위에 예외를 둘 수 있다고 설명했습니다.  


이 때문에 이번 방안은 외부 기관에 완성된 모델만 전달해 평가받는 일반적인 제3자 테스트보다 기업 내부 운영에 더 가까이 접근하는 형태입니다.


■ 평가 결과를 Anthropic이 마음대로 수정하지 않는 구조도 제시했습니다


독립성을 확보하기 위한 조건도 제안됐습니다.


Amodei는 외부 평가자가


위험 수준


발생한 사고


회사의 안전 절차


실제로 제공받은 접근 범위


등에 관한 주요 결과를 공개할 수 있어야 한다고 설명했습니다.


그리고 이러한 공개 내용에 대해 Anthropic이 편집 권한(Editorial Control)을 가져서는 안 된다는 원칙을 제시했습니다.  


물론 보안상 민감한 내용이나 법적으로 보호되는 정보, 영업기밀, 제3자의 기밀정보 등은 제한적으로 가릴 수 있습니다.


다만 Anthropic에 불리하다는 이유만으로 결과를 삭제할 수는 없도록 하겠다는 것입니다.


외부 평가자는 회사가 가린 내용이 자신의 평가 결론에 중요한 영향을 미쳤는지도 공개적으로 밝힐 수 있도록 하는 방향이 제시됐습니다.  


■ 왜 회사 내부 평가와 별도의 평가자를 두려고 할까?


Amodei는 상주형 외부 평가자가 필요한 이유를 크게 세 가지로 설명합니다.


첫 번째는 검증 가능성(Verifiability)입니다.


기업이 특정 안전 절차를 지키고 있다고 발표하는 것과 실제 개발 과정에서 그 절차가 지켜지고 있는지를 다른 주체가 확인하는 것은 별개의 문제라는 것입니다.


두 번째는 투명성(Transparency)입니다.


AI 기업이 모델 카드나 위험 보고서를 공개하더라도 무엇을 공개하고 무엇을 제외할지는 기본적으로 해당 기업이 결정합니다.


외부 평가자가 내부 과정에 접근하면 이와 다른 형태의 확인이 가능해집니다.


세 번째는 두 번째 의견(Second Opinion)입니다.


기업 내부 연구자와 다른 입장에서 모델과 시스템을 살펴보는 평가자가 내부에서 발견하지 못했던 문제를 발견할 가능성이 있다는 설명입니다.  


■ 완성된 모델뿐 아니라 ‘만드는 과정’까지 평가 대상으로 넓어집니다


기존의 AI 평가에서는 완성된 모델이 특정 문제를 얼마나 잘 해결하는지를 측정하는 방식이 많이 사용됩니다.


예를 들어


코딩 능력


수학 문제 해결


사이버보안 능력


위험한 요청에 대한 반응


등을 테스트할 수 있습니다.


하지만 Anthropic이 이번에 제시한 Embedded Evaluator의 평가 범위는 그보다 넓습니다.


모델 결과


뿐 아니라


모델 학습 과정


안전장치


운영 절차


내부 AI 사용


사고 발생 여부


까지 검증 범위에 포함시키는 것입니다.  


Amodei는 이를 은행 산업에서 감독기관의 감독자가 기업 내부에 접근해 확인하는 구조와 비교했습니다.


■ AI에 대한 제3자 평가는 이미 진행되고 있습니다


AI 기업 외부의 기관이 모델을 평가하는 것 자체가 처음 등장한 개념은 아닙니다.


AI 평가 연구기관 METR은 올해 Anthropic, Google, Meta, OpenAI가 참여한 프런티어 AI 위험 평가를 진행했습니다.


참여 기업들은 당시 내부에서 사용 가능한 강력한 모델에 대한 접근권과 함께 모델의 능력, 내부에서 AI를 사용하는 방식, 모니터링 방식 등 일부 비공개 정보도 METR에 제공했습니다.


METR은 기존 제3자 AI 평가가 주로 공개 전 개별 모델의 위험한 능력을 테스트하는 데 집중했다면, 이번 평가에서는 AI 개발기업 내부에서 AI가 어떻게 사용되는지까지 살펴보는 기업 단위(Entity-based) 평가 방식을 시험했다고 설명했습니다.  


METR은 이러한 평가 과정에 Anthropic뿐 아니라 Google, Meta, OpenAI가 참여했다고 밝혔습니다.  


■ ‘일회성 외부 평가’에서 ‘지속적인 외부 평가’로


이번 Anthropic의 제안에서 구분해서 볼 부분은 지속성입니다.


기존에도 AI 기업과 외부 평가기관 간 협력은 존재했습니다.


하지만 Amodei가 이번에 제안한 방식은


모델 출시 전 외부 테스트


↓


평가 완료


↓


종료


와 같은 일회성 관계보다


외부 평가자


↓


기업 내부에 지속적으로 접근


↓


모델·학습·운영 과정 확인


↓


안전 절차 확인


↓


사고 발생 시 확인


이라는 상시적인 관계에 가깝습니다.


Amodei는 이러한 Embedded Evaluator를 자신의 3단계 계획 가운데 첫 번째 단계로 제시했으며, Anthropic은 다른 AI 기업의 참여를 기다리지 않고 자체적으로 시행하겠다는 입장을 밝혔습니다.  


■ 다른 AI 기업과 정부에도 공통 기준을 제안했습니다


Embedded Evaluator는 Amodei가 제시한 전체 계획 가운데 첫 번째 단계입니다.


두 번째 단계는 민주주의 국가 내 AI 기업 간 조정(Democratic Coordination)입니다.


프런티어 AI 기업들이 공통된 안전 기준을 만들고, 필요할 경우 정부가 이를 지원하는 구조입니다.


세 번째는 글로벌 조정(Global Coordination)입니다.


미국을 비롯한 여러 국가가 국제적으로 AI 위험 평가와 검증 기준을 조율하는 방향입니다.  


Amodei는 국제적인 협력의 한 예로 사이버보안, 생물학, AI 정렬(Alignment)처럼 위험도가 높은 영역에서 모델 출시 전 평가를 실시하는 방안도 제시했습니다.  


■ AI 평가에서 ‘누가 평가하는가’가 새로운 변수로 등장하고 있습니다


AI 모델을 검증할 때는 일반적으로 어떤 성능을 측정했는지, 어떤 테스트를 사용했는지가 중요합니다.


최근의 외부 평가 움직임에서는 여기에 하나의 요소가 추가되고 있습니다.


누가 평가했는가입니다.


AI 개발기업 내부 평가


↓


외부 평가기관의 모델 평가


↓


기업 내부 과정에 접근하는 제3자 평가


처럼 평가 주체와 접근 범위가 달라지고 있습니다.


Anthropic은 이번 제안을 통해 AI 기업이 자체적으로 안전성을 평가하고 결과를 공개하는 구조에 더해, 외부 평가자가 내부 과정에 지속적으로 접근하는 방식을 도입하겠다고 밝혔습니다.


METR에서도 이미 Anthropic, Google, Meta, OpenAI가 참여한 기업 단위의 외부 평가가 진행된 바 있습니다.  


현재 AI 업계에서는 무엇을 평가할 것인가뿐 아니라 평가 주체를 어떻게 구성할 것인가까지 AI 검증 방식의 한 요소로 다뤄지고 있습니다.


────────────────────


■ 주요 용어 정리


상주형 외부 평가자(Embedded Evaluator)

AI 기업 내부에 지속적으로 접근하면서 안전 절차, 사고, 모델과 개발 과정 등을 확인하는 제3자 평가자.


독립 평가(Independent Evaluation)

AI 모델을 개발한 주체와 분리된 외부 기관이나 평가자가 수행하는 평가.


검증 가능성(Verifiability)

기업이 주장하는 절차나 기준이 실제로 지켜졌는지를 제3자가 확인할 수 있는 정도.


투명성(Transparency)

AI 개발과 평가 과정 및 결과에 관한 정보를 외부에서 확인할 수 있도록 공개하는 정도.


학습 파이프라인(Training Pipeline)

데이터 준비부터 학습·평가까지 AI 모델을 만드는 과정과 시스템의 연결 구조.


AI 정렬(Alignment)

AI 시스템의 행동이 개발자가 의도한 목표와 안전 기준 등에 부합하도록 만드는 연구 및 기술 영역.


프런티어 AI(Frontier AI)

현재 기술 수준에서 가장 높은 수준의 능력을 가진 첨단 AI 모델이나 시스템을 지칭할 때 사용되는 표현.


────────────────────


■ 참고자료


Dario Amodei — We Must Pace the Frontier

https://darioamodei.com/post/we-must-pace-the-frontier


METR — Frontier Risk Report (February to March 2026)

https://metr.org/blog/2026-05-19-frontier-risk-report/


METR — Risk Assessment

https://metr.org/risk-assessment/


NIST — AI Technology Evaluation (AITE)

https://ai-challenges.nist.gov/aite