Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
실시간 화자분리(speaker diarization)를 중심으로 스트리밍 오디오 애플리케이션을 만드는 파이썬 프레임워크입니다. 화자 분할 모델과 화자 임베딩 모델을 결합한 증분 클러스터링 파이프라인을 사용해, 대화가 길어질수록 화자 구분 정확도가 올라가는 구조를 택했습니다. diart.stream 명령으로 마이크 입력이나 녹음 파일을 곧바로 처리할 수 있고, 음성 활동 감지(VAD) 파이프라인도 기본 제공합니다. 사용자 정의 파이프라인 구성과 하이퍼파라미터 튜닝, 벤치마크, WebSocket 기반 웹 서빙까지 지원하며 기본 모델로는 pyannote.audio 계열을 사용합니다. JOSS에 논문이 등재된 연구 기반 프로젝트입니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리