Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
abogen은 ePub, PDF, 텍스트, 마크다운, 자막 파일을 음성과 동기화된 자막으로 한 번에 변환하는 오픈소스 TTS 도구다. 음성 합성 엔진으로 Kokoro-82M을 사용하며 오디오북 제작은 물론 유튜브, 틱톡, 인스타그램 영상의 내레이션 작업에도 활용할 수 있다. 변환 결과로 오디오 파일과 함께 타이밍이 맞춰진 자막 파일을 동시에 생성하는 점이 특징이다. Windows, Linux, macOS를 지원하고 PyPI 패키지와 윈도우 설치 스크립트를 제공하며, NVIDIA CUDA와 AMD ROCm GPU 가속을 선택할 수 있다. 텍스트 전처리에는 espeak-ng를 함께 사용한다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS