Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Edge0-AI가 공개한 네이티브 스트리밍 음성 인식 모델의 프리뷰 릴리스다. Voxtral Realtime 4B의 인과적 오디오 타워와 Qwen2.5-3B-Instruct 디코더를 결합한 구조로, 80/120/160ms 중 오디오 클럭을 고르고 240~560ms 범위에서 전사 지연을 설정할 수 있다. 롤링 KV 캐시로 메모리와 지연을 일정하게 유지해 길이 제한 없이 24시간 연속 전사가 가능하며, 생각하며 멈춘 구간·말더듬·실제 발화 종료를 구분하는 시맨틱 VAD를 포함한다. 중국어와 영어를 지원하고, 480ms 지연 기준 AISHELL-1 CER 1.75를 보고했다. vLLM 기반 Docker Compose 배포와 웹 데모, Torch 추론 예제를 제공한다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리