2026.10.09
1
0
0
오픈소스NEW

Google EmbeddingGemma 2 공개: 5개 모달리티를 한 공간에, Apache 2.0

Google DeepMind가 2026년 10월 6일 EmbeddingGemma 2를 공개했다. 텍스트·이미지·오디오·비디오·코드를 하나의 임베딩 공간에 매핑하는 Apache 2.0 오픈 모델이다.

#EmbeddingGemma 2#Google DeepMind#Gemma 4#임베딩#멀티모달
Google EmbeddingGemma 2 공개: 5개 모달리티를 한 공간에, Apache 2.0
AI 핵심 요약

Google DeepMind가 2026년 10월 6일 EmbeddingGemma 2를 공개했다. 텍스트·이미지·오디오·비디오·코드를 하나의 임베딩 공간에 매핑하는 Apache 2.0 오픈 모델이다.

핵심 요약

Google DeepMind가 2026년 10월 6일 EmbeddingGemma 2를 발표했다. 텍스트, 이미지, 오디오, 비디오, 코드를 하나의 공유 임베딩 공간에 매핑하는 오픈 멀티모달 임베딩 모델이다. Gemma 4 아키텍처 기반이며 상업적 사용이 가능한 Apache 2.0 라이선스로 공개됐다. 이 글의 벤치마크는 별도 표기가 없으면 Google 자체 보고 값이며 독립 검증은 확인되지 않았다.

주요 기능

1. 모듈식 구성

전체 파라미터는 740M이다. 텍스트만 쓰면 텍스트 백본 270M만 필요하다. 비전 인코더 170M과 오디오 인코더 300M은 선택적으로 붙인다. 필요한 모달리티만 골라 메모리를 아낄 수 있다.

2. Matryoshka 차원 축소

기본 임베딩은 768차원이다. Matryoshka Representation Learning(MRL)으로 512, 256, 128차원으로 줄일 수 있다. Google은 벡터 저장 비용을 최대 6배 줄일 수 있다고 밝혔다.

3. 8K 토큰 컨텍스트

컨텍스트는 8K 토큰으로 EmbeddingGemma 1의 4배다. Google 기준으로 오디오 5.5분, 이미지 29장, 비디오 58프레임에 해당한다.

4. 코드와 오디오 성능

MTEB Code 점수가 68.76에서 78.68로 9.92점 올랐다. Google은 1B 미만 멀티모달 임베더 중 MTEB Code와 MAEB(Massive Audio Embedding Benchmark)에서 선두라고 주장한다. 자체 보고이므로 재현 결과를 기다려야 한다.

5. 온디바이스 메모리

양자화하면 Google Pixel 11 Pro에서 활성 RAM이 텍스트 전용 191MB, 전체 멀티모달 567MB다.

모델카드 기준 보도 (2차 자료)

스페인어권 매체 donweb의 모델카드 요약 보도에 따르면 24개 층, 슬라이딩 윈도우 1024, 어휘 262,144 구성이다. 토큰 비용은 이미지 280토큰, 비디오 프레임당 140토큰, 오디오 초당 25토큰이다. MTEB 다국어 v2는 61.15에서 61.36으로 소폭 올랐다. 이미지 Hit@1은 MMEB v2 57.28, 비디오는 50.67, 오디오 MSEB MRR@10은 69.54다. 이 수치는 2차 보도이므로 공식 모델카드와 대조가 필요하다.

사용성 분석

가중치는 Hugging Face와 Kaggle에서 받을 수 있다. 도구는 transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama, LM Studio를 지원한다. 온디바이스는 MediaPipe, LiteRT, transformers.js, WebGPU를 쓴다. Ollama 라이브러리에는 270m(텍스트), 440m(텍스트+이미지), 570m(텍스트), 740m(텍스트+이미지) 태그가 올라와 있다. Gemini Enterprise Agent Platform의 Model Garden은 준비 중(coming soon)이다.

보도된 주의사항도 있다. float16에서 NaN이나 품질 저하가 생길 수 있고, 작업 프리픽스를 빼면 결과가 달라질 수 있다. 차원이 다른 벡터끼리는 비교하면 안 된다.

장점과 한계

장점은 Apache 2.0 라이선스, 모듈식 구성, 저장 비용 절감, 온디바이스 지원이다. 한계는 성능 수치가 대부분 자체 보고라는 점이다. 가격과 호스팅형 제공 조건은 확인되지 않았다. 전작 대비 이미지·오디오 임베딩 품질을 실제 데이터에서 따로 검증해야 한다.

커뮤니티 반응과 전망

Hacker News 논의(413점)에서는 오픈 라이선스를 환영하는 의견이 있었다. 호스팅형 독점 임베딩 모델은 서비스가 폐기되면 전체 재임베딩 비용이 든다는 지적도 나왔다. 이는 커뮤니티 의견이다. 전작 EmbeddingGemma는 다운로드 2천만 회 이상을 기록했다. 하나의 공간에서 여러 모달리티를 검색할 수 있어 멀티모달 RAG에 쓰일 여지가 있다. 다만 채택 규모는 아직 알 수 없다.

결론

EmbeddingGemma 2는 로컬과 온디바이스에서 멀티모달 검색을 구축하려는 개발자에게 시험해볼 만한 모델이다. 독립 벤치마크가 부족하므로 자체 데이터로 검증한 뒤 도입하길 권한다. 평점은 4점이다.

장점

  • Apache 2.0 라이선스로 상업적 사용 가능
  • 5개 모달리티를 하나의 공간에서 처리하고 모듈식으로 선택 가능
  • MRL 차원 축소로 벡터 저장 비용 절감
  • Hugging Face, Ollama, llama.cpp, vLLM 등 폭넓은 도구 지원

단점/한계

  • 성능 수치 대부분이 Google 자체 보고이며 독립 검증이 확인되지 않음
  • Model Garden 제공은 준비 중이고 호스팅형 가격은 확인되지 않음
  • float16 품질 저하, 작업 프리픽스 누락 등 사용 시 주의사항이 있음

댓글0개

주요 기능/특징

1. 텍스트·이미지·오디오·비디오·코드를 하나의 임베딩 공간에 매핑 2. 총 740M 파라미터, 텍스트 전용은 270M (비전 170M, 오디오 300M 선택) 3. 768차원 기본, MRL로 512/256/128차원 축소, 저장 비용 최대 6배 절감 4. 8K 토큰 컨텍스트 (EmbeddingGemma 1의 4배) 5. MTEB Code 68.76에서 78.68로 상승 (Google 자체 보고) 6. Apache 2.0, Hugging Face/Kaggle 배포, Ollama·llama.cpp·vLLM 지원

핵심 인사이트

  • 텍스트, 이미지, 오디오, 비디오, 코드를 하나의 임베딩 공간에 두어 모달리티 간 교차 검색 구조를 단순화한다
  • 텍스트 270M, 비전 170M, 오디오 300M으로 나뉜 모듈식 설계라 필요한 모달리티만 로드할 수 있다
  • 768차원에서 128차원까지 줄이는 MRL로 벡터 저장 비용을 최대 6배 낮출 수 있다고 Google은 밝혔다
  • MTEB Code가 68.76에서 78.68로 9.92점 올랐지만 Google 자체 보고 수치다
  • 양자화 시 Pixel 11 Pro에서 텍스트 전용 191MB, 멀티모달 567MB의 활성 RAM이 필요해 온디바이스 활용 여지가 있다
  • Apache 2.0 라이선스라 상업적 사용이 가능하며, 커뮤니티에서는 호스팅형 독점 모델의 폐기 시 재임베딩 위험과 대비해 환영하는 의견이 있었다
  • float16 NaN 가능성, 작업 프리픽스, 차원 불일치 등 보도된 주의사항은 운영 전 점검이 필요하다
  • 세부 모델카드 수치는 2차 보도 기준이며 독립 벤치마크 검증은 아직 확인되지 않았다

이 리뷰가 유용했나요?

공유하기