Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
영상 편집 워크플로에 바로 붙는 로컬 우선 AI 자막 생성 도구입니다. 단독 앱으로 쓸 수도 있고 DaVinci Resolve, Adobe Premiere Pro, After Effects와 연동해 타임라인 오디오를 전사한 뒤 스타일이 적용된 자막을 편집 프로그램으로 되돌려 보냅니다. 전사 엔진은 whisper-rs(GGML)와 ONNX Runtime을 통해 Whisper, Moonshine, Parakeet, SenseVoice 계열 모델을 온디바이스로 실행하며 오디오가 외부로 전송되지 않습니다. 화자분리로 발화자를 구분해 화자별 자막 스타일을 지정할 수 있고, 100개 이상 언어의 전사와 번역, SRT 내보내기, CLI 사용을 지원합니다. macOS, Windows, Linux를 모두 지원합니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리