알리바바가 음성 인식, 합성 및 실시간 상호작용을 맡는 Qwen Audio 3.1 모델 5종을 발표했다. ASR은 다국어와 방언 인식 및 군더더기 정리를, ASR-Next는 화자별 시간 정보와 감정 및 주변 소리 탐지를 제공한다. TTS는 언어 간 음색 이전과 지시문 기반 스타일 제어를, TTS-Next는 음성 및 효과음의 통합 생성을 지원한다. 실시간 모델은 동시 듣기와 말하기, 즉시 중단을 내세운다. 요금 인하 폭은 TTS 약 70%, 실시간 약 85%, ASR 최대 95%로 서로 다르며 실제 정확도와 지연은 서비스 조건에서 확인해야 한다.