애피어는 NeurIPS에 채택된 SMITH 연구가 에이전트의 도구 생성과 사용을 하나의 강화학습 루프에서 최적화한다고 밝혔습니다. 회사가 공개한 평가에서는 40억 파라미터 모델이 300억 모델보다 도구 생성 성능이 높았고, 기존 단계별 추론의 평균 출력량을 3206토큰에서 약 100토큰으로 줄였습니다. 호출 모델은 도구 내부 코드가 아니라 설명과 매개변수를 보고 사용하므로 설명의 명확성과 호출 성공이 피드백이 됩니다. 수치는 특정 연구 평가의 결과이며 일반 작업의 정확도와 총비용 절감을 보장하지는 않습니다.
Tech로 돌아가기
Tech
SMITH, 도구 생성, 활용 공동학습으로 추론 비용 절감 연구
도구 재사용으로 토큰을 줄일 가능성을 보였지만 보고된 배율을 모든 업무 비용에 적용할 수는 없습니다.