Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
AudarAI가 공개한 아랍어 우선 생성형 음성 인식 모델 패밀리로, CTC나 트랜스듀서 대신 오디오 조건부 다음 토큰 예측 방식의 언어 모델 디코더로 전사를 수행한다. Whisper 스타일 128-mel 오디오 인코더와 Qwen3 디코더 구조이며, 주로 아랍어와 영어로 된 30만 시간 이상의 라벨 오디오와 4단계 커리큘럼, 원어민 주석자 기반 KTO 선호 정렬로 학습했다. 현대 표준 아랍어와 걸프·이집트·레반트·마그레브 방언, 아랍어-영어 코드 스위칭을 포함해 총 30개 언어를 지원한다. README 기준 Open Universal Arabic ASR Leaderboard에서 2.35B Turbo가 평균 WER 24.78%로 36개 시스템 중 1위, 0.78B Flash가 33.31%로 11위를 기록했다. 저장소 코드는 Apache-2.0이며 모델 가중치는 별도의 AudarAI 라이선스를 따른다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리