Epoch AI가 주요 벤치마크 15개를 검토해 4개를 검증, 9개를 결함, 2개를 정보 부족으로 분류했다고 발표했다. 잘못된 정답, 채점 오류와 버전 비교의 일관성을 살핀 결과다. 결함 판정에 충분한 증거가 나오면 조사를 멈추므로 모든 오류를 찾아낸 감사는 아니다. 모델 선택 시 점수뿐 아니라 평가 버전과 도구 조건, 실제 업무와의 대응 범위를 확인해야 한다.