Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Pheme는 영국 PolyAI가 공개한 경량 대화형 텍스트-음성 변환(TTS) 모델이다. 트랜스포머 기반 아키텍처에서 의미론적 토큰과 음향 토큰을 분리해 처리하고, 자기회귀 방식 대신 MaskGit 스타일의 병렬(비자기회귀) 디코딩을 적용해 기존 자기회귀 TTS 대비 약 15배 빠른 추론 속도를 달성했다. 대규모 데이터 없이도 비교적 적은 학습 데이터로 준수한 품질의 대화체 음성을 생성할 수 있도록 설계되었으며, 사전학습 모델과 학습/추론 코드, 데이터 준비 스크립트를 함께 제공한다. 실시간성이 중요한 음성 어시스턴트나 대화형 서비스에 적합하며, CC-BY-4.0 라이선스로 배포된다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS