Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요. LLM, Vision, Audio 등 다양한 카테고리의 프로젝트를 확인할 수 있습니다.
총 1086개의 프로젝트
showlab
프런티어 VLM은 제로샷으로, 작은 VLM은 소량 미세조정으로 로봇 팔을 조작하게 하는 NUS Show Lab의 임바디드 하네스
nv-tlabs
VAE·비전 인코더 없이 단일 트랜스포머로 이미지·비디오 이해와 생성을 모두 처리하는 NVIDIA의 픽셀 기반 통합 멀티모달 모델
OmniJev
스크린샷·사진·비디오에 대한 예/아니오·선택형 질문에 한 번의 순전파로 보정된 확률을 내는 0.8B~27B 멀티모달 판단 모델
tornikegomareli
Apple 온디바이스 음성 인식으로 fn 키 한 번에 받아쓰는 macOS 노치 받아쓰기 앱 — 번역·파일 전사·프롬프트 다듬기 포함
lokutor-ai
5달러 ESP32-S3에서 클라우드 없이 영어·스페인어 문장을 받아쓰는 int8 Conformer 음성 인식 엔진 (LibriSpeech WER 3.7%)
fermionresearch
Parakeet·Qwen3-ASR 기반 경량 ASR 모델 Phonon-2/Phonon-1을 MLX·CPU·CUDA에서 돌리는 CLI와 OpenAI 호환 서버
loudreader
10개 언어 28개 음성·10초 보이스 클로닝을 오프라인으로 — Python·Swift·Go·Rust·TS SDK를 갖춘 로컬 TTS 툴킷
nimaone
GPU 없이 CPU만으로 도는 페르시아어 TTS·보이스 클로닝 — torch 없는 ONNX 경로로 의존성 200MB
franciscocarloserra
코드·데이터·가중치를 모두 MIT/CC0로 공개하는 1억 파라미터 미만 소형 TTS 학습 레시피 — Kokoro·Supertonic 후속 지향
SonyResearch
단일 스텝 음원 분리 모델을 혼합 일관성 기반 반복 분리로 확장하는 Sony Research의 공식 구현
inikolax
ACE-Step 1.5와 YuE2-3B를 한 화면에서 쓰는 로컬 AI 음악 스튜디오 — 스템 분리·MIDI 채보·LoRA 학습·DAW 내장
kiri603
완성곡 오디오를 분리·채보·편곡해 5인조 밴드용 MIDI·PDF·MuseScore 총보로 만드는 에이전트 스킬