Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
WeNet 팀이 공개한 화자 임베딩(speaker embedding) 학습 툴킷으로, 화자 검증(speaker verification)·화자 인식(speaker recognition)·화자 분리(speaker diarization)를 연구와 프로덕션 양쪽에서 지원하도록 설계됐다. ECAPA-TDNN, ResNet, WavLM 기반 self-supervised 임베딩 등 다양한 아키텍처를 지원하며 VoxCeleb, CN-Celeb 등 표준 벤치마크에서의 재현 가능한 학습 레시피를 제공한다. 온라인 특징 추출과 Kaldi 포맷의 사전 추출 특징을 모두 지원해 기존 Kaldi 기반 파이프라인과의 연동이 용이하고, PLDA 백엔드 스코어링까지 포함해 화자 검증 전체 파이프라인을 하나의 툴킷으로 완결한다. Apache 2.0 라이선스로 공개되며 통화 분석, 회의록 화자 분리, 생체 인증 등 다양한 실무 시나리오에 활용된다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리