Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OpenCLIP은 OpenAI CLIP을 오픈소스로 재구현하고 확장한 이미지-텍스트 대조 학습 프레임워크입니다. LAION-2B, DataComp-1B 같은 대규모 공개 데이터셋으로 학습한 ViT, ConvNeXt, SigLIP, MetaCLIP 계열 사전학습 가중치를 하나의 통일된 API로 제공하며, LAION-2B로 학습한 ViT-bigG-14는 ImageNet 제로샷 정확도 80.1%, 수록된 최상위 모델은 85%대에 도달합니다. 최신 main 브랜치는 FSDP2 기반 학습 스택과 가변 해상도를 처리하는 NaFlex 이미지 타워, 오디오-텍스트 대조 학습(CLAP), 캡셔닝용 CoCa·MaMMUT까지 지원해 멀티모달 임베딩 연구는 물론 이미지 검색과 제로샷 분류 파이프라인 구축에 널리 쓰입니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델
microsoft
작업, 언어, 모달리티 전반의 통일된 사전학습 모델