Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
GPU나 클라우드 API 없이 CPU만으로 동작하는 실시간 다국어 음성 인식 도구다. 말하는 동안 약 0.5초마다 부분 자막을 갱신하고, 발화가 끝나면 약 100ms 뒤 확정 문장을 낸다(일본어 기준). 발화마다 언어를 판별해 일본어는 ReazonSpeech, 중국어는 Paraformer, 한국어·광둥어는 SenseVoice, 영어·유럽 24개 언어는 Parakeet v3, 그 밖의 약 1600개 언어는 Omnilingual ASR로 보낸다. 모든 모델은 sherpa-onnx 기반 INT8 ONNX로 실행되며, 일본어 방송 음성에서 CER 3.8%(whisper-large-v3-turbo 13.8%)를 보고했다. 코드는 MIT 라이선스다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리