Google выпустила EmbeddingGemma 2 для локального поиска по тексту и мультимедиа

Изображение: OpenAI
Google 6 октября выпустила EmbeddingGemma 2 — открытую модель для поиска по смыслу в текстах и мультимедийных данных прямо на устройстве, сообщается в блоге компании.
Модель с 740 млн параметров построена на архитектуре Gemma 4 и доступна по лицензии Apache 2.0, допускающей коммерческое использование. Веса можно скачать на Hugging Face и Kaggle.
EmbeddingGemma 2 представляет разные типы данных в едином пространстве векторов. Это позволяет, например, найти фрагмент видео по голосовому запросу или нужное место в аудиозаписи по текстовому. В паре с генеративной моделью Gemma 4 её можно использовать для поиска данных в локальных системах RAG, работающих без подключения к интернету.
Модель можно загружать частями: для работы с текстом и кодом достаточно 270 млн параметров, а блоки обработки изображений и звука подключаются по необходимости. На Pixel 11 Pro модель с квантованием занимает около 191 МБ оперативной памяти для текста и около 567 МБ для всех типов данных.
Размерность векторов можно уменьшать с 768 до 128, и тогда они занимают до шести раз меньше места. До 256 измерений качество почти не теряется, а при 128 поиск по изображениям, звуку и видео заметно ухудшается, поэтому такой вариант советуют сначала проверить на своих данных.
Запускать модель нужно в форматах bfloat16 или float32. С float16 значения активаций выходят за допустимый диапазон, и модель без сообщения об ошибке выдаёт NaN или векторы худшего качества.



