Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
MidiTok은 MIDI와 abc 악보 파일을 딥러닝 모델이 다룰 수 있는 토큰 시퀀스로 변환하는 파이썬 라이브러리다. REMI, Octuple, CPWord, MMM, PerTok 등 학계에서 제안된 주요 음악 토크나이제이션을 하나의 공통 인터페이스로 묶었고, BPE·Unigram·WordPiece 토크나이저 학습과 데이터 증강, PyTorch 데이터셋 유틸리티까지 함께 제공한다. ISMIR 2021 발표 이후 꾸준히 유지보수되고 있어, 음악 생성이나 자동 채보, MIR 연구를 시작할 때 전처리 단계를 직접 구현하지 않아도 되는 사실상의 표준 도구다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI