Fiddler의 코딩 실험을 소개한 보도에서 토큰 단가가 낮은 모델이 더 긴 응답과 실패 때문에 성공한 수정당 비용이 높게 나타났다. 다섯 Python 과제와 응답당 명령 하나만 실행하는 제한된 환경에서 모델별 45회 시험을 진행했다. 실행되지 않은 명령 결과를 미리 쓰는 출력이 비용을 키웠다는 분석이다. 특정 모델의 보편적 우열이 아니라 실제 도구 실행 방식과 숨겨진 검증 시험을 포함한 비용 평가의 중요성을 보여 준다.
Tech
모델 가격은 토큰 단가보다 실패와 재시도를 포함한 작업 비용으로 비교해야 한다.
Fiddler의 코딩 실험을 소개한 보도에서 토큰 단가가 낮은 모델이 더 긴 응답과 실패 때문에 성공한 수정당 비용이 높게 나타났다. 다섯 Python 과제와 응답당 명령 하나만 실행하는 제한된 환경에서 모델별 45회 시험을 진행했다. 실행되지 않은 명령 결과를 미리 쓰는 출력이 비용을 키웠다는 분석이다. 특정 모델의 보편적 우열이 아니라 실제 도구 실행 방식과 숨겨진 검증 시험을 포함한 비용 평가의 중요성을 보여 준다.