HarnessDev 연구는 모델이 만든 실행 가능한 에이전트 하네스를 5개 벤치마크 2,207개 과제로 평가했습니다. 개선 단계의 연속 수정 64건 중 개발 평가와 비공개 평가가 같은 방향으로 움직인 것은 34건이었고 최종 버전이 비공개 과제에서 최고였던 계보도 9개 중 2개였습니다. 실행 모델을 바꾸면 순위가 뒤집히거나 성능이 크게 떨어졌습니다. 외부 인간 설계 기준은 재실행한 수치가 아니므로 절대 우열보다 완료 검증과 독립 평가의 필요성을 보여줍니다.