VoiceStudio는 계정이나 API 키 없이 음성 복제, 합성, 받아쓰기, 번역 더빙과 오디오북 생성을 로컬에서 처리하는 AGPL-3.0 데스크톱 앱입니다. 5~15초 샘플로 목소리를 복제하고 16개 합성 엔진과 11개 인식 엔진, OpenAI 호환 API와 MCP 서버를 지원합니다. CPU 실행도 가능하지만 RAM 16GB와 GPU 사용 시 VRAM 8GB 이상을 권장하며 원격 백엔드를 선택하면 오디오가 해당 서버로 전송될 수 있습니다.
Tech로 돌아가기
Tech
VoiceStudio가 음성 복제와 더빙을 로컬 앱으로 묶었습니다
음성 작업을 한곳에서 오프라인 처리할 수 있지만 하드웨어 요구와 모델별 라이선스를 확인해야 합니다.