Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA가 공개한 2.5B 규모의 영어 특화 음성인식 모델로, FastConformer 음성 인코더와 Qwen3-1.7B LLM을 LoRA 어댑터로 연결한 SALM(Speech-Augmented Language Model) 구조입니다. 오디오를 텍스트로 옮기는 ASR 모드와, 그 결과를 요약·질의응답까지 이어가는 LLM 모드를 하나의 체크포인트로 전환해 쓸 수 있는 것이 특징입니다. 26개 공개 데이터셋에서 뽑은 약 23만 4500시간 분량의 영어 음성으로 학습했고, 공개 당시 HuggingFace Open ASR 리더보드 상위권에 오른 모델입니다. NeMo 2.5.0 이상 환경과 16kHz 오디오 입력을 요구하며, CC-BY-4.0 라이선스로 상업적 이용도 허용합니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리