Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
로컬 비전 모델로 문서를 마크다운으로 바꾸는 단일 바이너리 CLI입니다. PDF, 오피스 파일, 스캔본, 스크린샷, 차트, 수식, 다이어그램을 문자 추출이 아니라 페이지 이미지 전체를 이해하는 방식으로 처리해, 별도 OCR·레이아웃·표 인식 스택 없이 OpenAI 호환 멀티모달 엔드포인트 하나만 요구합니다. LM Studio나 Ollama에 비전 모델을 띄우면 첫 실행 때 엔드포인트를 자동 탐색합니다. 자체 벤치마크에서는 텍스트 레이어가 없는 PDF 2건, 기계 검증 가능한 시각 정보 15개 항목 기준 doc7 15개, MarkItDown OCR 플러그인 9개, Docling 기본 파이프라인 3개를 복원했다고 밝힙니다. 품질과 속도는 선택한 모델과 양자화에 좌우됩니다.

Comfy-Org
노드 기반 디퓨전 모델 GUI
hacksider
단 한 장의 이미지로 실시간 얼굴 교체 및 딥페이크 구현 - 84K 스타 인기 프로젝트

opendatalab
PDF를 AI 워크플로우용 마크다운/JSON으로 변환하는 비전-언어 기반 문서 파싱 엔진

ultralytics
엣지 최적화 실시간 객체 감지 YOLO 프레임워크