Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
칭화대 연구진이 공개한 실환경 잡음 대응에 초점을 맞춘 파운데이션 음성인식 모델입니다. 소음·원거리 음성·차폐·잔향과 에코·녹음 아티팩트·전자적 왜곡·전송 끊김이라는 7가지 기본 음향 조건과 이를 조합한 54가지 복합 시나리오로 학습 데이터를 구성했고, 240만 건 규모의 Voices-in-the-Wild 데이터셋을 함께 공개했습니다. A2S-SFT 사전학습과 DG-WGPO 강화학습을 적용해 열악한 음향 환경에서 기존 오픈·클로즈드 SOTA 모델 대비 최대 약 30%의 성능 향상을 보고했습니다. 스튜디오 녹음이 아닌 현장 녹취, 콜센터, 야외 촬영 음성을 다루는 개발자에게 참고할 만한 프로젝트입니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리