Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Essentia는 스페인 폼페우 파브라 대학 음악기술그룹(MTG)이 개발한 오디오 분석 및 음악 정보 검색(MIR) 라이브러리다. C++로 작성돼 처리 속도가 빠르고 Python 바인딩을 함께 제공한다. 오디오 입출력, 표준 디지털 신호처리 블록, 데이터 통계 분석부터 스펙트럼·시간·음조 기반 저수준 기술자, BPM·키·무드·장르 같은 고수준 음악 디스크립터까지 수백 개의 재사용 가능한 알고리즘을 담고 있다. TensorFlow 추론을 통합한 essentia-tensorflow 패키지를 쓰면 사전 학습된 음악 분류 모델을 바로 활용할 수 있다. Linux, macOS, Windows, iOS, Android를 모두 지원하며 Sonic Visualiser용 Vamp 플러그인과 명령줄 추출기도 제공한다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI