Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
카네기멜런대학교(CMU) Sphinx 프로젝트가 개발한 화자 독립형 오픈소스 음성인식 엔진이다. 1970년대부터 이어진 은닉마르코프모델(HMM) 기반 알고리즘을 뼈대로 삼아 연산량과 메모리 사용량을 최소화한 것이 특징으로, Whisper류의 대형 트랜스포머 모델과 달리 GPU 없이도 라즈베리파이 등 저사양 임베디드 기기에서 실시간으로 동작한다. CMake 기반 빌드 체계로 재정비되어 C 라이브러리와 파이썬 바인딩을 함께 제공하며, 명령줄 도구로 표준 입력이나 파일의 단일 채널 16비트 PCM 오디오를 바로 인식할 수 있다. 최신 버전은 자체 음성 활동 감지(VAD)에 WebRTC VAD 코드를 통합했고, 오프라인·저전력 환경에 특화된 경량 음성인식이 필요한 임베디드·IoT 애플리케이션에서 여전히 활용되고 있다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리