Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
교토대학교 가와하라 연구실과 나고야공업대학교 줄리어스 프로젝트팀이 1997년부터 개발해온 오픈소스 대어휘 연속 음성인식(LVCSR) 디코더 엔진이다. 단어 N-gram 언어모델과 문맥 종속 HMM 음향모델을 기반으로 트리 구조 어휘, 2-패스 트리-트렐리스 탐색, 빔 프루닝 등 고전적 디코딩 기법을 정교하게 구현했으며, 최근 버전부터는 프레임 단위 상태 확률 계산에 DNN을 결합한 하이브리드 디코딩도 지원한다. 마이크로컴퓨터부터 클라우드 서버까지 폭넓은 플랫폼에서 실시간 동작이 가능하며 작업 메모리 32MB 이하의 저사양 환경에서도 구동된다. Whisper 계열과 무관한 독자 아키텍처를 유지하면서도 HTK, SRILM 등 표준 포맷의 모델을 그대로 활용할 수 있어 연구·임베디드 음성인식 분야에서 꾸준히 쓰인다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리