Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Fluxions AI가 공개한 실시간 음성 비서 시스템으로, 마이크 입력부터 WebRTC 스트리밍, 음성 활동 감지, faster-whisper 기반 ASR, 로컬 LLM, TTS 출력까지 이어지는 파이프라인을 하나의 파이썬 서버로 구현했다. 핵심은 3억 파라미터 규모의 경량 TTS 모델 Vui Nano로, Llama 스타일 디코더와 RQ-Transformer 헤드로 구성되어 RTX 4090 기준 약 9배 실시간 속도로 동작한다. 네 가지 사전 학습된 프리셋을 포함한 음성 복제, 답변 도중 끼어들기(barge-in), 발화 속도·음질 조건 지정 등을 지원하며 OpenAI Realtime API와 호환된다. Linux(NVIDIA GPU) 및 Apple Silicon(MLX 백엔드) 환경을 모두 지원하고, ASR·LLM 백엔드를 자유롭게 교체할 수 있는 구조로 설계되어 있다. Apache-2.0 라이선스로 공개되어 있다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS