Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
DiffSinger는 얕은 확산(diffusion) 메커니즘을 활용해 가창 음성(singing voice)과 일반 음성을 합성하는 오픈소스 프로젝트다. 가사와 MIDI 또는 실제 음높이 정보를 입력받아 멜 스펙트로그램을 생성하는 DiffSinger 파이프라인과, 텍스트를 입력받아 음성을 생성하는 DiffSpeech 파이프라인을 함께 제공한다. PNDM 등 가속 샘플링 기법을 적용해 확산 모델의 느린 추론 속도 문제를 완화했고, 보코더 연동까지 포함한 end-to-end 구성을 지원한다. 일반 TTS 프로젝트와 달리 노래 합성이라는 별도 도메인에 특화되어 있어, 음악 콘텐츠 제작이나 가상 가수 프로젝트 등에 활용된다. MIT 라이선스로 공개되어 있다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS