M4 MacBook Pro 24GB에서 Qwen 3.8 27B 3비트 모델과 llama.cpp를 공유한 비교에서 하네스별 첫 토큰 대기는 12.2~225.7초였습니다. Python 과제 8개를 3회씩 실행했으며 긴 시스템 지침과 도구 정의, 부가 요청이 프리필과 대기를 늘렸습니다. 접두사 캐시는 후속 응답 부담을 줄였습니다. 단순 과제여서 통과 수를 일반 성능 순위로 볼 수 없고 반복 간 처리량도 최대 50% 변했습니다. 실험자는 비교 도구 중 하나의 개발자입니다.
Tech로 돌아가기
Tech
로컬 코딩 하네스 9종, 첫 응답 대기 최대 18배 차이
모델의 초당 토큰 수만으로 체감 속도를 판단하기 어렵고, 작은 표본과 개발자의 이해관계도 고려해야 합니다.