Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Confucius4-R2T2는 넷이즈 유다오가 공개한 실시간 스트리밍 음성 인식(ASR) 모델이다. Qwen3-ASR을 기반으로 안정 접두사 데이터, 강제 시간 정렬 데이터 등으로 학습했다. 한 번 출력한 텍스트를 다시 고치지 않는 append-only 방식이라 실시간 자막, 동시 통역, LLM 에이전트 입력처럼 텍스트를 바로 처리해야 하는 곳에서 깜빡임 없이 쓸 수 있다. 디코딩 청크는 80ms~2s 범위에서 조절하며, README 기준 평균 지연은 200~600ms다. 중국어와 영어에 최적화되어 있고 한국어·일본어 등 다른 언어도 인식한다. 코드는 Apache-2.0, 모델 가중치는 별도의 NetEase 모델 사용 라이선스를 따른다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI