EmbeddingGemma 2로 사내 자료 검색을 기기 안에서 하려면

Google이 2026년 10월 6일 공개한 EmbeddingGemma 2의 구성, 라이선스, 메모리 수치를 정리하고 사내 문서·사진·영상 검색을 기기 안에서 검토할 때 먼저 확인할 항목을 설명합니다.

휴대폰 안의 돋보기로 문서, 사진, 음성 파형, 필름 조각이 모이는 그림

1. 사내 자료를 밖으로 보내지 않고 찾을 수 있을까

회의 녹음, 현장 사진, 제품 설명 영상은 파일 이름만으로 찾기 어렵습니다. Google DeepMind 연구진은 2026년 10월 6일 Google 블로그에서 EmbeddingGemma 2를 공개했습니다. 텍스트·이미지·음성·영상을 의미에 따라 숫자 목록(벡터)으로 바꿔 주는 임베딩 모델이고, 회사 발표에 따르면 휴대폰과 노트북 같은 기기 안에서 실행하는 용도에 맞춰 만들었습니다. 의미가 비슷한 자료는 벡터도 가까워지기 때문에, 예를 들어 파일 이름이 IMG_0412인 사진도 "박람회 부스 사진"이라는 문장으로 찾게 만들 수 있습니다.

먼저 분명히 해 둘 점이 있습니다. Gemini 앱이나 Workspace에 새로 생긴 기능은 아닙니다. 공식 발표는 개발자가 내려받아 쓰는 오픈 모델로 소개했고, Gemini 앱 메뉴나 Workspace 요금제에 관한 내용은 없습니다. 개발자나 사내 IT 담당자가 검색 기능이나 RAG, 즉 사내 문서를 찾아 AI 답변의 근거로 붙이는 구조를 만들 때 넣는 부품이죠. 그래서 이 글은 직접 실행한 결과 대신, Workspace와 Gemini를 쓰는 회사가 기기 안 검색을 검토할 때 공식 발표와 모델 카드에서 무엇을 먼저 확인하면 되는지 정리했습니다.

2. 텍스트만 쓰면 270M, 모두 붙이면 740M

Google 블로그에 따르면 EmbeddingGemma 2는 Gemma 4 아키텍처를 바탕으로 만들었고 매개변수는 7억 4천만 개(740M)입니다. 라이선스는 상업적 사용을 허용하는 Apache 2.0입니다. 모델 카드는 이 740M이 텍스트 모델 270M에 비전 인코더 170M과 오디오 인코더 300M을 합친 값이라고 설명합니다. 비전과 오디오 인코더는 필요할 때 붙이는 구조라서, 텍스트 문서만 찾는다면 270M 모델로 시작할 수 있습니다.

메모리 수치도 공개됐습니다. 회사 발표에 따르면 Pixel 11 Pro에서 양자화를 적용했을 때 텍스트 전용 가중치는 적게는 약 191MB, 전체 멀티모달 모델은 약 567MB의 활성 RAM으로 실행할 수 있습니다. 양자화는 모델 숫자의 정밀도를 낮춰 크기를 줄이는 처리입니다. 이 값은 Google이 자사 휴대폰 1종에서 잰 것이고, 회사 노트북이나 다른 휴대폰에서 얼마가 드는지는 발표에 없습니다.

한 번에 넣을 수 있는 양은 8K 토큰으로, 1세대보다 4배 늘었습니다. 블로그는 이 한도 안에서 음성 최대 5.5분, 이미지 29장, 영상 프레임 58개, 또는 이들을 섞은 입력을 기기 안에서 처리할 수 있다고 밝혔습니다.

제 판단으로는 이 숫자를 회의 녹음 검색의 설계 조건으로 보는 편이 맞습니다. 1시간짜리 회의라면 5.5분을 넘지 않는 구간 여러 개로 잘라 각각 벡터를 만들어야 하기 때문입니다. 구간을 나누면 "예산 이야기가 나온 부분"처럼 녹음 안의 특정 구간을 찾는 검색도 가능해집니다.

텍스트 모델 270M에 선택형 비전 인코더 170M과 오디오 인코더 300M을 붙이면 740M이 되고, 활성 RAM 최소값은 텍스트만 약 191MB, 전체 멀티모달 약 567MB임을 보여 주는 구성도
원문 사실: 구성 수치는 Google 블로그와 모델 카드, RAM 최소값과 입력 한도는 Google 블로그 발표값(Pixel 11 Pro, 양자화 기준)입니다. 작성자 구성: 선택형 인코더를 점선으로 나누고 막대 길이를 두 RAM 수치의 비율에 맞춰 그렸습니다. 이미지를 열어 확대할 수 있습니다. 화면이 좁으면 도식을 가로로 스크롤해 글자를 확인하세요.

3. 글로 사진과 영상 장면을 찾는 교차 검색

블로그는 기기 안에서 임베딩을 만들면 데이터 보호에 도움이 되고, 처리 지연이 줄며, 인터넷 연결 없이도 형식이 다른 자료를 오가는 검색을 만들 수 있다고 설명합니다. 함께 안내한 데모는 텍스트나 이미지로 미디어 보관함에서 의미가 비슷한 자료를 찾고, 텍스트나 음성으로 영상 속 특정 장면을 찾는 내용입니다. 저는 이 데모 앱을 직접 실행하지 않았고, 한국에서 설치할 수 있는지도 확인하지 못했습니다.

업무에 대입하면 이렇게 쓸 수 있습니다. 예시로, 마케팅팀이 "파란 배경에서 제품을 든 사진"이라고 입력해 사내 사진 폴더를 찾거나, 교육팀이 "출결 규정을 설명하는 부분"이라고 입력해 강의 녹화본의 해당 구간을 찾는 검색입니다. 실제 검색 품질은 사내 자료로 시험해야 알 수 있습니다.

개발 조직이라면 코드 검색 수치도 볼 만합니다. 블로그에 따르면 MTEB Code 점수가 68.76에서 78.68로 9.92점 올랐습니다. 모델 카드는 코드 작업 개선 폭을 이전 모델 대비 약 14%로 적었는데, 68.76에서 78.68로 오른 비율을 계산하면 이 값과 맞습니다. 여러 언어 텍스트 성능은 MTEB multilingual v2 기준 1세대 61.15, 2세대 61.36으로 비슷한 수준을 유지했습니다. 모두 Google이 직접 측정한 결과이고, 모델 카드에 따르면 양자화하지 않은 전체 정밀도 모델로 잰 값입니다. 휴대폰에서 양자화해 실행할 때의 점수는 공개되지 않았습니다.

4. 벡터를 줄이면 저장 공간은 줄고 정확도도 내려갑니다

Matryoshka Representation Learning(MRL)이라는 학습 방식 덕분에 기본 768차원 벡터를 512, 256, 128차원으로 잘라 쓸 수 있습니다. 자료가 많아지면 벡터를 저장할 공간과 검색 속도를 신경 써야 하는데, 차원을 줄이면 이 부담이 작아집니다.

정확도가 얼마나 내려가는지도 모델 카드에 나와 있습니다. 모델 카드는 256차원까지는 품질 영향이 작다고 설명하고, 128차원은 텍스트 전용 작업에 가장 적합하다고 적었습니다. Google 자체 측정에서 멀티모달 종합 점수(MMEB v2 Overall)는 768차원 59.01, 256차원 56.24, 128차원 45.65였습니다. 256차원에서 128차원으로 줄일 때 점수가 크게 떨어지므로, 사진과 영상까지 찾으려면 128차원은 피하고 256차원 이상에서 시작하는 편이 안전하다고 봅니다. 아래 표의 저장 공간 비율은 모델 카드의 압축 비율 1:1.5, 1:3, 1:6을 768차원 대비 백분율로 바꾼 값입니다.

벡터 차원768차원 대비 저장 공간공식 자료 내용
768100%기본 출력, MMEB v2 Overall 59.01
512약 67%잘라 쓸 수 있는 크기, MMEB v2 Overall 58.38
256약 33%품질 영향이 작은 하한으로 안내, MMEB v2 Overall 56.24
128약 17%텍스트 전용 작업에 적합, MMEB v2 Overall 45.65

5. 발표에 적혀 있지 않은 것

모델 가중치는 Hugging Face와 Kaggle에서 받을 수 있습니다. Gemini Enterprise Agent Platform의 Model Garden 제공은 출시 예정(coming soon)으로만 적혀 있고, 제공 날짜와 요금은 공식 발표에 없습니다. 가중치는 내려받을 수 있지만, 회사 서버나 클라우드에서 실행한다면 그 비용은 각자의 인프라 기준으로 계산해야 합니다.

한국어 검색 품질도 따로 확인해야 합니다. 모델 카드는 100개가 넘는 언어를 이해한다고 밝히면서도, 언어마다 성능이 같지는 않을 수 있다고 적었습니다. 한국어만 따로 잰 점수는 공개하지 않았습니다. 지역이나 계정 제한도 발표에 적혀 있지 않습니다.

6. 이번 주에 해 볼 일: 검색 문장 10개 만들기

기술 검토 전에 업무 쪽에서 준비할 것이 있습니다. 직원들이 찾지 못해 자주 다시 묻는 자료 묶음 1개를 고르고, 그 자료가 텍스트 문서뿐인지, 사진이 섞였는지, 녹음과 영상까지 있는지 표시해 보세요. 텍스트뿐이라면 270M 모델과 작은 벡터로, 녹음과 영상이 있다면 전체 모델과 768차원으로 시작해 256차원까지 줄여 보며 검토하면 됩니다.

그다음 직원이 실제로 입력할 한국어 검색 문장 10개와 문장마다 찾아야 할 정답 파일을 적어 IT 담당자에게 전달하세요. 모델 카드에는 sentence-transformers 라이브러리를 설치해 시작하는 빠른 시작 절차가 있습니다. 모델 카드는 텍스트 입력 앞에 작업 종류를 알려 주는 짧은 접두어를 붙이면 품질이 좋아진다고 안내하므로, 시험할 때 검색용 접두어를 붙였는지도 함께 확인하면 됩니다. IT 담당자가 이 절차로 10개 문장을 시험하면, 발표에 없는 한국어 품질을 사내 자료로 직접 확인할 수 있습니다.

확인한 공식 출처

  1. EmbeddingGemma 2: an open, lightweight multimodal embedding model (Google 블로그, 2026년 10월 6일)
  2. EmbeddingGemma 2 model card (Google AI for Developers)
  3. EmbeddingGemma (Google DeepMind 모델 페이지)