Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA가 공개한 Nemotron Speech 모델 패밀리용 경량 네이티브 C++ 추론 런타임으로, README에서 NVIDIA의 공식 로컬 음성 추론 솔루션이라고 소개한다. ggml 기반으로 동작하며 NVIDIA NeMo Speech의 최신 모델을 출시 당일부터 지원하는 것을 목표로 한다. 음성 인식은 Nemotron 3.5 ASR Streaming 0.6B, Parakeet TDT 0.6B v3, Parakeet CTC 1.1B 등을 지원하고, Sortformer 기반 화자 분리, Riva Translate 번역, MagpieTTS 음성 합성, 전이중 VoiceChat까지 하나의 nemo-speech CLI로 다룬다. 로컬 HTTP 서버는 OpenAI 호환 전사 엔드포인트와 실시간 WebSocket 전사를 제공한다. NVIDIA 작성 코드는 Apache-2.0이다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리