Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
오카다 와타루(w-okada)가 개발한 VCClient는 학습된 음성 변환 모델을 실시간으로 구동하는 데스크톱 소프트웨어다. RVC와 Beatrice v2 같은 외부 모델을 불러와 마이크 입력을 다른 화자의 목소리로 바꿔 출력하며, 변환된 오디오를 가상 오디오 장치로 내보내 통화나 방송 소프트웨어에 그대로 연결할 수 있다. 클라이언트와 서버가 분리된 구조라 음성을 입력하는 PC와 추론을 담당하는 PC를 다른 기기로 둘 수 있고, ONNX 추론과 청크 크기 조절로 지연 시간과 음질의 균형을 맞춘다. Windows, macOS(M1), Linux용 실행 파일을 배포해 별도 개발 환경 구성 없이 사용할 수 있다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI