Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
테오도로스 지아나코풀로스(Theodoros Giannakopoulos)가 공개한 pyAudioAnalysis는 오디오 분석 작업 전반을 하나의 API로 묶은 파이썬 라이브러리다. MFCC와 스펙트로그램, 크로마그램 같은 특징을 추출하고 이를 이용해 오디오 구간 분류기를 학습·평가하며, 무음 제거와 오디오 이벤트 검출, 화자 분할 같은 세그멘테이션까지 처리한다. 감정 인식처럼 연속값을 예측하는 회귀 모델 학습과 차원 축소 기반 시각화도 함께 제공한다. 명령줄 도구가 포함돼 있어 코드를 작성하지 않고도 파일 단위 분석을 실행할 수 있고, 음향 이벤트 분류나 음성·음악 구분 과제의 베이스라인으로 오래 쓰여 왔다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI