핵심 요약
구글이 EmbeddingGemma 2를 통해 텍스트·코드·이미지·비디오·오디오를 768차원 공간으로 매핑하는 멀티모달 임베딩 모델과 sentence-transformers 기반 모듈러 인코더를 활용해 메모리 사용을 최적화하고, Matryoshka Representation Learning으로 차원을 128d까지 축소해 벡터 DB 저장소를 대폭 줄이면서도 높은 검색 성능을 유지했습니다.
구현 방법
- EmbeddingGemma 2를 중심으로 텍스트/코드/이미지/비디오/오디오를 768-d 공간에 매핑하는 멀티모달 임베딩 구조
- sentence-transformers 라이브러리로 모듈형 모달리티 인코더를 선택적으로 로드(270M~740M 파라미터)
- Matryoshka Representation Learning으로 동적 차원 축소(128d)로 벡터 DB 저장소 대폭 감소하고 검색 성능 유지
주요 결과
- 벡터 DB 저장소 요구량 대폭 감소
- 검색 성능 유지/향상
- 메모리 사용 최적화로 시스템 규모 확장 용이



