Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
미국 전사 서비스 기업 Rev가 공개한 음성인식·화자분리 통합 오픈소스로, WeNet 기반 ASR 모델과 Pyannote 기반 화자분리(diarization) 모델을 하나의 저장소에서 함께 제공한다. Earnings21, Earnings22, Rev16 등 실제 업무 회의·실적발표 녹음 벤치마크에서 Whisper Large-v3, Canary-1B 등 경쟁 모델보다 우수한 정확도를 보였다고 밝히고 있다. CLI와 Python API를 모두 지원하고 Docker 컨테이너로 배포할 수 있으며, verbatimicity(비유창성 표현 포함 여부) 옵션을 조절해 문어체·구어체 전사를 선택할 수 있는 것이 특징이다. 추론 코드는 Apache-2.0 라이선스로 공개되지만, 사전학습 가중치는 별도의 비상업적 라이선스로 HuggingFace에서 배포된다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리