roko.fans четверг, 8 октября 2026

Google выпустила открытую модель эмбеддингов EmbeddingGemma 2 для текста, кода, изображений, видео и аудио

Google проверяла новую модель на смартфоне Pixel 11 Pro. С квантованием модель на 740 млн параметров, которая ищет по тексту, коду, изображениям, видео и аудио, заняла около 567 МБ активной памяти. Такие цифры приводит The New Stack со ссылкой на компанию.[1][2]

Объекты:

Модель называется EmbeddingGemma 2, Google выпустила её во вторник. Она построена на архитектуре Gemma 4 и переводит все пять типов входных данных в одно 768-мерное векторное пространство. Веса выложены под лицензией Apache 2.0. Сама Google называет EmbeddingGemma 2 самой способной моделью для мультимодальных эмбеддингов на устройстве.[2][3][4][5]

Первая EmbeddingGemma вышла в сентябре 2025 года и работала только с текстом, напоминает SiliconANGLE. Во второй версии Google продолжает измерять прогресс на коде: по данным компании, оценка в бенчмарке MTEB Code выросла с 68.76 у первой версии до 78.68.[6][7]

Модель собирается из частей. Основу для текста и кода составляют 270 млн параметров: 130 млн приходится на трансформер, 140 млн на эмбеддер. Визуальный энкодер для изображений и видео весит 170 млн параметров, аудиоэнкодер 300 млн, и оба подключаются по желанию. С визуальным энкодером модель вырастает до 440 млн параметров, с аудиоэнкодером до 570 млн, с обоими до полных 740 млн. Одна текстовая основа, по замерам Google, расходует на том же Pixel 11 Pro около 191 МБ активной памяти.[8][9][10]

Контекстное окно выросло вчетверо, с 2048 до 8192 токенов. В один запрос, по словам компании, помещается до 5,5 минуты аудио, 29 изображений или 58 видеокадров. По умолчанию видео разбивается на кадры с частотой один кадр в секунду, так что 58 кадров дают чуть меньше минуты записи. Команда Google AI Edge замерила скорость на GPU ноутбука MacBook M5 Pro: одно изображение обрабатывается за 37,3 мс при бюджете в 70 токенов на визуальную часть.[11][12][13]

Модель обучали методом Matryoshka Representation Learning. Он позволяет обрезать векторы до 512, 256 или 128 измерений без переобучения. На 256 измерениях, по оценке Google, короткие эмбеддинги сохраняют большую часть качества на тексте и коде и около 95% на поиске по изображениям, видео и речи. На 128 измерениях потери заметнее: около 90% на тексте и коде и около 75% на мультимодальном поиске. Показатель MMEB в этом режиме падает до 45,65, поэтому Google советует брать 128 измерений в основном для текстовых задач, а перед мультимодальными запросами проверять такую настройку на реальных данных.[14][15][16][17]

От размерности зависит и объём индекса. Миллион 768-мерных векторов в формате bfloat16 занимает около 1,5 ГБ, а при сокращении до 256 измерений тот же индекс весит около 500 МБ.[18][19]

Компания показала модель в двух сценариях. В шахматной демонстрации на устройстве EmbeddingGemma 2 через MediaPipe Decision оценивала 500 вариантов за ход менее чем за 100 миллисекунд. В другом примере Google проиндексировала репозиторий Hugging Face Transformers одним текстовым энкодером и подключила этот индекс к модели Gemma 4 26B A4B, запущенной в Pi.[20][21]

MarkTechPost сравнивает новинку с Qwen3-VL-Embedding-2B. В собственном прогоне MMEB-V2 эта модель набрала 73.2. Параметров у неё примерно в 2,7 раза больше, а аудио она не поддерживает.[22]

Веса уже лежат на Hugging Face и Kaggle, есть сборки для Ollama, llama.cpp в формате GGUF и LiteRT. Запускать модель на устройстве можно уже сейчас через LiteRT и MediaPipe Tasks. Интеграцию с Android ML Kit, с ускорением на NPU там, где устройство его поддерживает, Google обещает в ближайшие недели.[23][4][24]

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 The New Stack — Your phone’s vector index might be bigger than the AI model running it ↗ 6 октября, 21:53 · сноски 1, 2, 3, 4, 7, 9, 10, 11, 12, 14, 15, 16, 18, 19, 20, 21, 24
  2. 2 Techmeme — Google DeepMind launches EmbeddingGemma 2, a 740M-parameter model to map code, images, video, and audio in a shared embedding space, under an Apache 2.0 license (Google) ↗ 6 октября, 19:20 · сноска 5
  3. 3 SiliconANGLE — Google expands EmbeddingGemma beyond text to images, audio and video ↗ вчера, 01:18 · сноска 6
  4. 4 MarkTechPost — Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4 ↗ 6 октября, 21:36 · сноски 8, 13, 17, 22, 23
  1. 5 Hacker News, ≥150 очков — EmbeddingGemma 2: An open, lightweight multimodal embedding model ↗ 6 октября, 19:03
  2. 6 Telegram: @ai_machinelearning_big_data — 🔎 Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на устройстве ↗ 6 октября, 21:41
  3. 7 Telegram: @data_secrets — Google выпустила мультимодальную EmbeddingGemma 2 ↗ 6 октября, 21:53
  4. 8 Google DeepMind Blog — EmbeddingGemma 2: an open, lightweight multimodal embedding model ↗ 6 октября, 22:57

Запись полезная?

Войдите, чтобы ответить

Anthropic выпустила Claude Haiku 5.5 по цене $0,10 за миллион входных токенов