Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
러시아 스베르뱅크 산하 Salute Developers가 공개한 Conformer 기반 음성 파운데이션 모델 패밀리로, 음성인식(ASR)뿐 아니라 감정 인식까지 지원하는 것이 특징이다. v1부터 v3, 다국어(multilingual) 버전까지 2억~6억 파라미터 규모의 모델을 제공하며, 다국어 버전은 약 200만 시간 분량의 음성 데이터로 학습해 70개 이상 언어를 지원한다. CTC와 RNNT 두 방식의 디코더를 선택할 수 있고, v3 모델은 문장부호·정규화까지 포함한 종단간(end-to-end) 전사와 단어 단위 타임스탬프를 함께 제공한다. VAD를 활용한 장시간 오디오 처리, ONNX 내보내기, TensorRT·Triton Inference Server 배포를 지원해 프로덕션 환경에 최적화됐으며 MIT 라이선스로 공개된다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리