Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
비디오·텍스트·오디오를 입력으로 소리를 생성하고 편집하는 Any2Audio 프레임워크로 NeurIPS 2025에 채택됐다. 멀티모달 LLM이 단계별 사고(Chain-of-Thought)로 장면에 필요한 소리를 추론하면, 그 결과를 조건으로 flow matching 기반 오디오 모델이 소리를 만든다. 작업은 영상에 맞춘 기본 폴리(Foley) 생성, 클릭한 객체 중심의 소리 보강, 자연어 지시 편집의 3단계로 이뤄진다. 학습·파인튜닝 코드와 CoT 주석 데이터셋 AudioCoT, Gradio UI를 제공하고 후속작 PrismAudio(ICLR 2026)는 별도 브랜치에 있다. README는 Apache 2.0을 표기하면서도 상업적 이용은 허용하지 않는다고 밝힌다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI