Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
SpeechT5는 마이크로소프트가 공개한 통합 인코더-디코더 기반 음성-텍스트 사전학습 프레임워크다. 음성 인식, 음성 합성(TTS), 음성 번역, 화자 식별, 음성 변환 등 여러 음성 처리 작업을 하나의 공유 네트워크와 모달리티별 사전/사후 처리 모듈로 수행한다. 대규모 음성-텍스트 페어 데이터로 사전학습된 후 각 태스크에 맞게 파인튜닝할 수 있으며, 사전학습된 체크포인트는 HuggingFace와 Azure Storage 등을 통해 배포된다. Speech2C, SpeechLM, SpeechUT 등 관련 모델도 같은 저장소에서 함께 제공되어 확장 실험이 용이하다. MIT 라이선스로 공개되어 있어 연구 및 상업적 활용에 제약이 적다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS