Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA가 공개한 6억 파라미터 규모의 영어 전용 음성인식 모델로, FastConformer 인코더와 TDT(Token-and-Duration Transducer) 디코더를 결합해 정확도와 추론 속도를 동시에 확보했다. 단어 단위 타임스탬프와 자동 문장부호·대소문자 복원을 지원하며, 숫자나 노래 가사처럼 일반 모델이 취약한 발화에도 강한 것이 특징이다. 오디오 한 세그먼트를 최대 24분까지 한 번에 처리할 수 있어 긴 회의록이나 강연 전사에도 적합하다. LibriSpeech test-clean 기준 단어 오류율(WER) 1.69%, 8개 벤치마크 평균 6.05%를 기록해 HuggingFace Open ASR 리더보드 상위권에 올랐고, CC-BY-4.0 라이선스로 상업적 이용도 가능해 월간 다운로드가 26만 회를 넘는다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리