앤트로픽은 코딩 에이전트 플러그인이 실무에서 제대로 작동하는지를 검증할 수 있는 기능을 추가했다. 기존의 플러그인 유효성 검사는 설정 파일의 문법과 스키마 확인에 그쳤지만, 새로운 평가 기능은 플러그인이 실제 프롬프트에서 호출되고 기본 모델 성능을 상회하는지를 직접 측정할 수 있다는 점이 차별화된다.

앤트로픽은 10일(현지시간) 클로드 코드에 플러그인의 실제 성능을 검증하는 새 평가 기능을 추가했으며, 이는 클로드 코드 v2.1.269 버전부터 지원된다.

플러그인 개발자들은 이제 실무와 유사한 프롬프트로 플러그인의 동작을 확인하고, 플러그인 사용 시 결과와 미사용 시 결과를 비교해 플러그인이 얼마나 효과적인지 정량화할 수 있다.

'플러그인 평가(Plugin Evals)' 워크플로우는 'claude plugin eval' 명령으로 실행된다. 이 기능은 플러그인을 로드한 상태에서 클로드가 결과를 생성하도록 한 후 평가하고, 동일한 작업을 플러그인 없이 처리한 결과와 대비한다. 이전에는 확인하기 어려웠던 세 가지 질문, 즉 특정 스킬이 실제로 호출되는지, 코드나 모델 변경 후에도 스킬이 정상 작동하는지, 플러그인이 기본 모델보다 나은 성능을 보이는지를 명확히 판단할 수 있다.

평가 대상 플러그인은 'evals/' 디렉터리에 평가 사례를 저장하는 형태다. 각 사례에는 'prompt.md'와 'graders/' 폴더가 포함된다.

평가용 프롬프트는 실제 사용자의 자연스러운 질문을 모사해야 하며, 프롬프트 안에 스킬명을 직접 기입하지 않아야 에이전트가 자발적으로 스킬을 선택하는 능력을 정확하게 검증할 수 있다. 프롬프트 설정에서는 최대 턴 수, 실행 시간, 모델, 태그, 허용 도구 등을 지정할 수 있다.

평가자는 총 6가지 유형으로 구성된다. regex, tool_used, tool_order, file_exists 등 4개는 실행 기록과 파일을 분석해 결과를 산출하므로 추가 비용이 없다. 반면 llm은 별도의 평가 모델을 호출해 답변을 기준에 따라 채점하고, baseline은 참조 답변과 비교하므로 모델 호출 비용이 발생한다.

특히 이번 평가 방식의 핵심은 플러그인이 적용된 'WITH' 실행과 적용되지 않은 'W/OUT' 실행을 기본적으로 병렬로 수행한다는 것이다. 두 결과의 차이인 Δ(델타)가 플러그인의 실제 기여도를 나타낸다. 예를 들어 플러그인 사용과 미사용 모두 1.0점을 얻었다면 성공이 플러그인 덕분이 아니라는 뜻이다. 반대로 플러그인 적용 시 1.0, 미적용 시 0.33이라면 Δ는 +0.67로, 플러그인의 기여도가 명확해진다.

앤트로픽이 언급한 실제 평가에서 흔히 발견되는 문제는 Δ가 거의 0에 가깝고 'tool_used: Skill' 평가가 실패하는 경우다. 이는 사용자가 자연스런 표현으로 요청할 때 클로드가 해당 스킬을 선택하지 않는다는 의미다. 기존 'claude plugin validate' 명령은 플러그인의 매니페스트 문법과 스키마만 검증했기 때문에 이런 문제를 발견할 수 없었다.

평가 결과는 'evals/results//report.html'에 저장되며, 평가자별 판정과 모델 평가 결과를 확인할 수 있다. 지원되는 계정에서는 '--no-publish' 옵션을 사용하지 않으면 결과를 claude.ai에 게시할 수도 있다.

앤트로픽은 'claude plugin eval init' 명령도 제공한다. 이 명령은 플러그인을 분석하고 좋은 결과의 기준을 개발자에게 묻은 후, 평가 사례와 평가자를 제안하고 실제 실행을 통해 관련 파일을 생성한다. CI 환경에서는 '--bare' 옵션으로 빈 템플릿을 만들 수 있다.

개발자는 CI/CD 파이프라인 구축 시 '--threshold'(최소 점수 기준)와 '--max-cost-usd'(최대 평가 비용 제한) 옵션을 활용해 품질 기준 미달이나 비용 초과 시 빌드가 실패하도록 하는 통제 게이트(CI Gate)로 활용할 수 있다.

다만 모든 평가 실행은 실제 클로드 코드 에이전트와 모델 호출이 필요하다는 제약이 있다. 평가 사례 수와 실행 횟수, WITH/W/OUT 실행 수가 증가할수록 에이전트 실행량이 많아지며, llm이나 baseline 평가자가 포함되면 추가 평가 모델 호출 비용도 함께 발생한다.

출처 바로가기