Mercor가 회계 업무 벤치마크에 사람의 비교 결과를 추가했다. 단순화한 과제에서는 경력 평균 5.5년의 회계사 12명보다 최신 AI 모델이 높은 점수를 얻었다고 소개했다. 그러나 10개 가상 기업의 160개 과제를 담은 전체 평가에서 Opus 5.5의 채점 기준 충족률은 61.8%였고, 약 60%의 과제는 어떤 모델도 완전하게 해결하지 못했다. 고객과의 소통과 조직 맥락 등도 평가에서 빠져 있어 단순 점수 차이를 회계 직무 전체의 대체 가능성으로 확대하기는 어렵다.