Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
AudioSR은 임의의 샘플링 레이트로 입력된 오디오를 48kHz 고음질로 복원하는 범용 오디오 초해상도(super-resolution) 모델이다. 음악, 음성, 빗소리·동물 소리 같은 환경음까지 오디오 종류를 가리지 않고 동작하도록 설계되었으며, 잠재 확산(latent diffusion) 구조로 손실된 디테일과 고주파 성분을 복원한다. DDIM 샘플링 스텝과 가이던스 스케일을 조절해 품질과 다양성의 균형을 맞출 수 있고, 파일 목록을 한 번에 처리하는 배치 모드와 CLI, Gradio 데모를 함께 제공한다. 저음질 녹음이나 손상된 오디오를 복원해 리마스터링, 음원 복구, 후반 편집 등에 활용할 수 있으며, MIT 라이선스로 공개된다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI