Apache 2.0 라이선스의 @huggingface/kernels는 JavaScript에서 Hub의 버전 고정 WebGPU 연산을 불러오며 각 저장소에 계약, 정확성 테스트, 벤치마크와 WGSL 템플릿을 함께 둡니다. Apple M4의 809개 비교 사례에서 ONNX Runtime Web보다 기하평균 2.57배, 중앙값 1.90배 빨랐지만 GPU 작업 시간만 잰 단일 기기 결과입니다. Fleet가 브라우저별 정확성과 성능 자료를 수집합니다.
Tech로 돌아가기
Tech
Hugging Face가 로컬 AI용 WebGPU 커널 207개를 공개했습니다
브라우저 로컬 추론의 재사용 기반은 좋아졌지만 전체 모델 속도는 실제 기기와 입출력 비용까지 재야 합니다.