Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
CrisperWhisper는 OpenAI Whisper를 기반으로 '들린 그대로(verbatim)'를 정확히 전사하는 데 초점을 맞춘 오픈소스 음성 인식 프로젝트입니다. 일반 Whisper가 말버릇이나 반복, 머뭇거림을 매끄럽게 다듬어 버리는 것과 달리, 'um·uh' 같은 필러(filler)와 말더듬, 반복까지 실제 발화 그대로 받아쓰도록 설계되었습니다. 특히 단어 단위 타임스탬프 정밀도가 매우 높아 낭독 음성에서 약 30ms, 대화 음성에서 약 41ms 수준의 경계 오차를 보이며, 정지 구간에서도 안정적인 정렬을 제공합니다. 다국어를 지원하고 기존 전사본을 오디오와 대조해 다듬는 Verbatimize 기능을 갖춰 자막 제작, 회의록, 음성 데이터 라벨링처럼 정확한 타이밍과 원문 보존이 중요한 작업에 적합합니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리