Tencent가 자연어 지시와 참조 오디오로 음성을 만들고 편집하는 AuK 모델을 공개했습니다. 제로샷 TTS와 내용 삽입 및 삭제, 음색과 감정 변경, 속도와 음높이 조절 및 음질 개선을 하나의 인터페이스로 처리합니다. 잘못 녹음한 단어만 고치는 작업도 목표로 합니다. 학습에 약 195만 시간의 오디오를 사용했다고 설명했지만 소개된 기능과 데이터 규모만으로 실제 작업의 품질을 보장할 수는 없으므로 이용 조건과 자체 녹음에서의 결과를 확인해야 합니다.