ToolGrad는 질문을 먼저 만든 뒤 해법을 탐색하던 방식과 달리 API를 실행해 유효한 호출 사슬을 만들고 그에 맞는 질문을 생성합니다. ToolBench 기반 데이터 생성 통과율은 연구진 평가에서 63.8%에서 99.8%로 높아졌고, 500개 샘플로 학습한 Gemma-3 12B는 BFCL에서 83.1점을 기록했습니다. 코드와 데이터 및 모델이 공개돼 소형 모델의 도구 학습에 활용할 수 있습니다. 다만 99.8%는 해당 생성 절차의 통과율이고 BFCL 비교도 연구 당시의 제한된 평가이므로 현재 모든 업무나 최상위 모델을 대체한다는 뜻은 아닙니다.