Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA가 공개한 실시간 풀듀플렉스(full-duplex) 음성 대 음성 대화 모델입니다. Kyutai의 Moshi 아키텍처와 가중치를 출발점으로 파인튜닝했고, 텍스트 롤 프롬프트로 역할과 배경 정보를 지정하고 오디오 임베딩으로 목소리를 고정하는 두 갈래 페르소나 제어를 제공합니다. 합성 대화와 Fisher English Corpus의 실제 대화를 함께 학습해 말이 겹치거나 끊기는 상황에서도 낮은 지연으로 대화를 이어가며, 논문은 2026년 2월 arXiv에 공개됐습니다. 코드는 MIT, 7B 가중치는 NVIDIA Open Model License로 배포됩니다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI