Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OpenMOSS 팀과 MOSI.AI가 공개한 0.9B 규모 엔드투엔드 오디오 이해 모델로, 장시간 다중 화자 녹음을 한 번에 전사하고 화자 분리(diarization)까지 동시에 수행합니다. ASR 시스템과 화자분리 시스템을 따로 이어 붙이는 대신 두 작업을 함께 학습시켜, 시작 시각·화자 태그·발화 내용·종료 시각이 붙은 단일 스트림을 출력하는 것이 특징입니다. 50개 이상 언어를 지원하며 팟캐스트 셋에서 cpCER 7.37, AISHELL-4에서 15.83을 기록해 Gemini 3 Pro와 VibeVoice ASR을 앞섰다고 저장소가 밝힙니다. INTERSPEECH 2026 제2회 MLC-SLM 챌린지 1위. 라이선스는 Apache-2.0입니다.