Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
바이트댄스와 칭화대가 함께 개발해 온 오디오 이해 특화 멀티모달 LLM 계열입니다. 음성 인식만 하는 모델이 아니라 말소리, 환경음, 음악, 화자의 감정·말투 같은 파라언어 정보를 함께 듣고 자연어로 설명하거나 추론하는 것을 목표로 합니다. 최신판 SALMONN-2는 자기지도 학습으로 만든 SPEAR 오디오 인코더 위에 인코더 전 계층 표현을 합치는 다층 특징 융합 어댑터를 얹고 Qwen3 계열 LLM에 연결하는 구조입니다. 저장소는 초기 SALMONN부터 SALMONN-2, ELLSA, video-SALMONN 2까지 각 모델을 브랜치로 나눠 추론·학습 코드와 체크포인트를 함께 관리합니다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI