Claude Code와 Codex를 ProgramBench 200개와 별도 18개 과제로 평가한 결과, Claude의 시간 추정은 실제보다 평균 3배, Codex는 6~10배 어긋났습니다. 같은 모델도 하네스에 따라 단계 수가 평균 2.5배 달랐고, 자기 성과는 실제보다 평균 20점 높게 평가했습니다. 장시간 작업의 일정과 완료 판정을 에이전트 자기보고에 맡기기 어렵다는 뜻입니다.