Назад
Искусственный интеллект и машинное обучение

Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

Habr
Advertisement468 × 90
Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

6 октября 2026 года Google DeepMind представила EmbeddingGemma 2 — компактную мультимодальную модель эмбеддингов. Новинка способна преобразовывать текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство, что позволяет выполнять кросс-модальный поиск, например, находить видео по текстовому описанию. Ключевым преимуществом модели является её высокая эффективность: текстовая версия занимает около 191 МБ оперативной памяти, а полная мультимодальная — 567 МБ. Это делает возможным запуск продвинутых функций поиска непосредственно на мобильных устройствах, таких как Pixel 11 Pro, без необходимости обращения к облачным серверам. В статье подробно рассматривается архитектура модели, методы оптимизации её размера, а также практические аспекты интеграции и возможные технические сложности, с которыми могут столкнуться разработчики при внедрении EmbeddingGemma 2 в свои проекты.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Генеральный директор Microsoft Сатья Наделла выступил с серьезным предупреждением относительно безопасности передовых моделей искусственного интеллект…

The Verge

Статья на Habr исследует альтернативные методы хранения параметров нейронных сетей. Вместо классического хранения огромных матриц весов, авторы предла…

Habr
Advertisement970 × 250