Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Fermion Research가 공개한 음성 인식 엔진과 모델 패밀리다. 주력 모델 Phonon-2(164MB)는 NVIDIA parakeet-tdt-0.6b-v3 파생 모델(CC-BY-4.0)이고, Qwen3-ASR-0.6B 기반 Phonon-1·Big·Micro도 실행할 수 있다(Apache-2.0). Apple 실리콘 MLX, Linux·Windows·macOS의 x86-64/Arm CPU, NVIDIA CUDA 컨테이너에서 동작한다. 파일 전사, 마이크 실시간 전사(Apple 실리콘), OpenAI 호환 전사 서버, 핫워드 기반 고유명사 인식 유도를 제공하며 pip install fermion-research 로 설치한다.
ggml-org
OpenAI Whisper의 C/C++ 포팅 - 로컬 STT의 사실상 표준

microsoft
60분 음성 단일 패스 처리 보이스 AI
m-bain
단어 수준 타임스탬프와 화자 분리를 지원하는 70배 빠른 Whisper 기반 ASR 라이브러리

SYSTRAN
CTranslate2 기반 Whisper 4배 고속 음성 인식 라이브러리