코딩 에이전트 하네스를 비교한 연구는 네 모델과 176개 설정, 두 벤치마크에서 계획 수립과 도구 구성, 문맥 관리의 효과를 살폈다. 같은 실행 루프에서도 3만2000토큰 조건의 문맥 관리 차이는 큰 성능 격차를 만들었지만 12만8000토큰에서는 영향이 작아졌다. 오래된 출력을 먼저 줄이고 필요할 때 요약하는 방식이 비용 측면에서 유리했으며, 계획 기능과 고정 도구의 이점은 모델에 따라 달랐다. 따라서 하나의 복잡한 하네스가 항상 우수하다는 결론보다 실제 모델과 예산으로 구성요소를 비교하는 것이 중요하다.