Meta의 Muse Voice Transcribe는 음성을 80밀리초 단위로 처리하며 단어마다 대기 시간을 조절해 정확도와 지연을 맞춥니다. 한 시간 넘는 녹음에서 20명 이상 화자를 구분하고 70개 이상 언어로 학습했으며, 독립 평가의 영어 단어 오류율은 3.1%, 발화 종료 뒤 지연은 0.16초였습니다. 시간당 0.18달러로 API를 제공하지만 모델 크기와 학습 음성의 규모 및 출처는 공개하지 않았습니다.
Tech로 돌아가기
Tech
Meta가 실시간 음성 모델 Muse Voice Transcribe를 출시했습니다
낮은 지연과 다화자 처리를 제공하지만 학습 데이터 출처와 모델 규모는 공개하지 않았습니다.