Google проверяла новую модель на смартфоне Pixel 11 Pro. С квантованием модель на 740 млн параметров, которая ищет по тексту, коду, изображениям, видео и аудио, заняла около 567 МБ активной памяти. Такие цифры приводит The New Stack со ссылкой на компанию.[1][2]
Модель называется EmbeddingGemma 2, Google выпустила её во вторник. Она построена на архитектуре Gemma 4 и переводит все пять типов входных данных в одно 768-мерное векторное пространство. Веса выложены под лицензией Apache 2.0. Сама Google называет EmbeddingGemma 2 самой способной моделью для мультимодальных эмбеддингов на устройстве.[2][3][4][5]
Первая EmbeddingGemma вышла в сентябре 2025 года и работала только с текстом, напоминает SiliconANGLE. Во второй версии Google продолжает измерять прогресс на коде: по данным компании, оценка в бенчмарке MTEB Code выросла с 68.76 у первой версии до 78.68.[6][7]
Модель собирается из частей. Основу для текста и кода составляют 270 млн параметров: 130 млн приходится на трансформер, 140 млн на эмбеддер. Визуальный энкодер для изображений и видео весит 170 млн параметров, аудиоэнкодер 300 млн, и оба подключаются по желанию. С визуальным энкодером модель вырастает до 440 млн параметров, с аудиоэнкодером до 570 млн, с обоими до полных 740 млн. Одна текстовая основа, по замерам Google, расходует на том же Pixel 11 Pro около 191 МБ активной памяти.[8][9][10]
Контекстное окно выросло вчетверо, с 2048 до 8192 токенов. В один запрос, по словам компании, помещается до 5,5 минуты аудио, 29 изображений или 58 видеокадров. По умолчанию видео разбивается на кадры с частотой один кадр в секунду, так что 58 кадров дают чуть меньше минуты записи. Команда Google AI Edge замерила скорость на GPU ноутбука MacBook M5 Pro: одно изображение обрабатывается за 37,3 мс при бюджете в 70 токенов на визуальную часть.[11][12][13]
Модель обучали методом Matryoshka Representation Learning. Он позволяет обрезать векторы до 512, 256 или 128 измерений без переобучения. На 256 измерениях, по оценке Google, короткие эмбеддинги сохраняют большую часть качества на тексте и коде и около 95% на поиске по изображениям, видео и речи. На 128 измерениях потери заметнее: около 90% на тексте и коде и около 75% на мультимодальном поиске. Показатель MMEB в этом режиме падает до 45,65, поэтому Google советует брать 128 измерений в основном для текстовых задач, а перед мультимодальными запросами проверять такую настройку на реальных данных.[14][15][16][17]
От размерности зависит и объём индекса. Миллион 768-мерных векторов в формате bfloat16 занимает около 1,5 ГБ, а при сокращении до 256 измерений тот же индекс весит около 500 МБ.[18][19]
Компания показала модель в двух сценариях. В шахматной демонстрации на устройстве EmbeddingGemma 2 через MediaPipe Decision оценивала 500 вариантов за ход менее чем за 100 миллисекунд. В другом примере Google проиндексировала репозиторий Hugging Face Transformers одним текстовым энкодером и подключила этот индекс к модели Gemma 4 26B A4B, запущенной в Pi.[20][21]
MarkTechPost сравнивает новинку с Qwen3-VL-Embedding-2B. В собственном прогоне MMEB-V2 эта модель набрала 73.2. Параметров у неё примерно в 2,7 раза больше, а аудио она не поддерживает.[22]
Веса уже лежат на Hugging Face и Kaggle, есть сборки для Ollama, llama.cpp в формате GGUF и LiteRT. Запускать модель на устройстве можно уже сейчас через LiteRT и MediaPipe Tasks. Интеграцию с Android ML Kit, с ускорением на NPU там, где устройство его поддерживает, Google обещает в ближайшие недели.[23][4][24]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
putting text, code, image, video, and audio retrieval into a 740-million-parameter open model that used about 567MB of active RAM with quantization in the company’s testing on a Pixel 11 Pro.
With the vision encoder for images and video, the model reaches 440 million parameters; adding the audio encoder instead brings it to 570 million, while loading both takes it to the full 740 million.
Google also quadrupled the context window from 2,048 to 8,192 tokens, which the company says covers as much as 5.5 minutes of audio, 29 images or 58 video frames in a single input.
Google trained EmbeddingGemma 2 with Matryoshka Representation Learning, which lets developers truncate those embeddings to 512, 256 or 128 dimensions without retraining anything.
The trade gets steeper at 128 dimensions, where Google puts text and code at around 90% but multimodal retrieval at about 75%, and the company advises testing that setting on real data before relying on it for multimodal queries.