Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA가 공개한 6억 파라미터 규모의 다국어 스트리밍 음성인식 모델이다. Cache-Aware FastConformer-RNNT 구조에 언어 ID 프롬프트 조건화를 적용해 하나의 체크포인트로 40개 언어권 음성을 실시간 전사한다. 청크 크기를 80ms부터 1120ms까지 조절할 수 있어 지연시간과 처리량을 상황에 맞게 설정할 수 있고, 문장부호와 대소문자 표기를 별도 후처리 없이 모델 자체에서 생성한다. 기존 버퍼링 방식 스트리밍에서 발생하는 중복 연산을 캐시 재사용으로 줄여 처리량을 높였다. OpenMDW-1.1 라이선스로 가중치가 공개돼 상업적 활용도 가능하며, Hugging Face 기준 월간 다운로드가 80만 건을 넘어설 만큼 빠르게 채택되고 있다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리