Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Coqui STT는 딥러닝 기반 음성-텍스트 변환 모델을 손쉽게 학습하고 배포할 수 있도록 만든 오픈소스 툴킷으로, Mozilla DeepSpeech의 아키텍처를 계승해 발전시킨 프로젝트입니다. 사전학습된 다국어 음성 모델과 스코어러(언어 모델)를 제공해 별도 학습 없이도 바로 전사에 활용할 수 있으며, 자체 데이터로 파인튜닝하거나 새로운 언어를 위한 모델을 처음부터 학습하는 워크플로우도 지원합니다. 오프라인·온디바이스 추론에 적합해 라즈베리파이 같은 저전력 기기부터 서버까지 폭넓게 실행되며, Python·C·Java·JavaScript 등 다양한 언어 바인딩을 통해 애플리케이션에 쉽게 통합할 수 있습니다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리