Google выпустила EmbeddingGemma 2 для локального поиска по тексту, коду и медиа

EmbeddingGemma 2 преобразует текст, код и медиа в векторы для поиска по смыслу. Google открыла веса модели под Apache 2.0 для локальных AI-приложений.

Обложка: Google выпустила EmbeddingGemma 2 для локального поиска по тексту, коду и медиа

6 октября Google DeepMind представила EmbeddingGemma 2, открытую модель эмбеддингов для разработчиков семантического поиска и систем RAG, которые извлекают данные для генеративных моделей. В отличие от текстовой первой версии, новинка объединяет текст, код, изображения, аудио и видео в общем векторном пространстве. Это позволяет, например, искать видеоклип по голосовой заметке.

Полная модель содержит 740 млн параметров. Для текстовых задач требуется 270 млн параметров, а для полной мультимодальной поддержки добавляются энкодеры зрения на 170 млн и аудио на 300 млн параметров. Контекстное окно выросло вчетверо, до 8 тысяч токенов. По данным Google, оно вмещает до 5,5 минуты аудио, 29 изображений или 58 видеокадров.

Для разработчиков инструментов работы с кодом заметное изменение касается качества поиска: в опубликованных Google результатах MTEB Code оценка выросла с 68,76 до 78,68. Компания также заявляет о ведущих результатах среди мультимодальных моделей размером менее миллиарда параметров. Это оценки вендора, независимые проверки в источнике не приведены.

Локальная обработка позволяет строить поиск по файлам и медиа без отправки данных в облако. Веса доступны на Hugging Face и Kaggle под лицензией Apache 2.0, допускающей коммерческое использование. Стоимость развёртывания и доступность площадок из России в анонсе не указаны.

Источники