Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

6 октября 2026 года Google DeepMind представила EmbeddingGemma 2 — компактную мультимодальную модель эмбеддингов. Новинка способна преобразовывать текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство, что позволяет выполнять кросс-модальный поиск, например, находить видео по текстовому описанию. Ключевым преимуществом модели является её высокая эффективность: текстовая версия занимает около 191 МБ оперативной памяти, а полная мультимодальная — 567 МБ. Это делает возможным запуск продвинутых функций поиска непосредственно на мобильных устройствах, таких как Pixel 11 Pro, без необходимости обращения к облачным серверам. В статье подробно рассматривается архитектура модели, методы оптимизации её размера, а также практические аспекты интеграции и возможные технические сложности, с которыми могут столкнуться разработчики при внедрении EmbeddingGemma 2 в свои проекты.
This is a summary. Read the full article at the original source:
HabrПохожие
Odyssey-3: мировая модель, которая учит роботов физике по видео
Компания Odyssey представила Odyssey-3, инновационную мировую модель, предназначенную для обучения роботов пониманию физических законов через анализ в…
Сатья Наделла заявил, что мы должны считать все модели ИИ «скомпрометированными»
Генеральный директор Microsoft Сатья Наделла выступил с серьезным предупреждением относительно безопасности передовых моделей искусственного интеллект…
Нейросеть по рецепту: вычисляем веса вместо хранения матриц
Статья на Habr исследует альтернативные методы хранения параметров нейронных сетей. Вместо классического хранения огромных матриц весов, авторы предла…



