Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
DataoceanAI와 칭화대학교가 공동 개발한 다국어·다중작업 음성인식 모델로, 동아시아·남아시아·동남아시아·중동 지역의 40개 언어와 22개 중국어 방언을 지원하는 것이 특징이다. 21만 시간 이상의 음성 데이터로 학습됐으며 Whisper와 OWSM의 설계 방식을 계승해 E-Branchformer 인코더와 표준 Transformer 디코더를 결합한 CTC-Attention 결합 구조를 채택했다. 음성인식뿐 아니라 음성구간검출(VAD), 세그멘테이션, 언어식별(LID)까지 하나의 모델로 처리할 수 있다. base·small·medium·large 등 다양한 파라미터 규모의 모델을 제공해 자원 환경에 맞춰 선택할 수 있으며, pip 설치와 소스코드 모두 공개돼 있고 Apache 2.0 라이선스로 배포된다. 서구권 언어 중심의 기존 ASR 모델과 달리 저자원 아시아 언어권에 특화된 것이 강점이다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리