Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
MuScriptor는 Kyutai와 Mirelo가 함께 개발한 다중 악기 음악 채보(transcription) 모델이다. 오디오 녹음을 MIDI, MusicXML, 악기별 PDF 악보로 변환하며, 제작진은 이를 "가장 정확한 오픈소스 채보 모델"이라 소개한다. 디코더 온리 트랜스포머 구조로 Small(1.03억 파라미터), Medium(3.07억, 기본값), Large(14억) 세 가지 크기를 제공해 정확도와 속도를 상황에 맞게 선택할 수 있다. 자동 양자화로 노트 표기를 정리하고 MuseScore 4 이상과 연동해 파트별 태블러처까지 뽑아낼 수 있으며, 웹 인터페이스와 CLI, Python API를 함께 제공해 로컬 셀프호스팅을 지원한다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI