Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
IBM이 2026년 8월 공개한 4억7000만 파라미터급 영어 전용 음성인식 모델이다. 기존 Granite Speech 4.1 계열과 달리 자기회귀 디코더 없이 CTC 방식만으로 동작하는 인코더 단독 구조로, 오디오를 한 번의 순전파와 그리디 CTC 디코딩만 거쳐 텍스트로 변환해 지연시간을 크게 줄였다. 16개 레이어 컨포머 인코더에 블록 셀프어텐션과 자기조건화를 적용했고, 8배 시간축 다운샘플링 후 1만6384개 BPE 토큰으로 분류한다. 약 6만 시간 분량의 영어 음성 데이터로 학습됐으며 Open ASR 리더보드와 잡음·잔향 환경의 FFASR 리더보드에서 평가됐다. 엣지 기기 배포를 겨냥해 설계됐고 Apache-2.0 라이선스로 공개된다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리