Claude Code 2.1.269부터 플러그인과 스킬 디렉터리에 평가 과제를 두고 claude plugin eval로 실행할 수 있습니다. 같은 과제를 플러그인 적용 전후로 비교하며 정규식, 도구 사용과 순서, 파일 존재 여부는 추가 모델 없이 채점합니다. LLM 판정과 기준 실행은 별도 호출 비용이 듭니다. 기본 제한은 과제당 10턴과 300초로, 팀은 실제 작업에 맞는 사례와 통과 기준을 마련해 스킬 변경의 효과와 회귀를 점검할 수 있습니다.
Tech로 돌아가기
Tech
Claude Code, 플러그인 대조 평가 기능 제공
성공 횟수뿐 아니라 플러그인 없이 실행한 결과와 비용을 비교해야 스킬의 추가 가치를 알 수 있습니다.