Google представила відкриту мультимодальну модель EmbeddingGemma 2
Google представила відкриту модель EmbeddingGemma 2 для локального пошуку в текстах, коді, зображеннях, аудіо та відео.
Google представила EmbeddingGemma 2 — відкриту модель із 740 млн параметрів, призначену для пошуку за змістом у текстах, коді, зображеннях, аудіо та відео без передавання даних із пристрою. Модель може працювати на смартфоні або компактній одноплатній системі, повідомляє The Next Web.
EmbeddingGemma 2 перетворює різні типи контенту на числові вектори в єдиному 768-вимірному просторі. Такий підхід дає змогу програмам знаходити матеріали за їхнім змістом, а не лише за збігом слів. Ліцензія Apache 2.0 дозволяє використовувати модель як відкритий інструмент.
Робота без хмари
Для обробки лише тексту на Pixel 11 Pro моделі потрібно близько 191 МБ оперативної пам’яті. Робота з усіма п’ятьма типами даних — текстом, кодом, зображеннями, аудіо та відео — потребує приблизно 567 МБ. За даними Google, текстовий компонент використовує 270 млн параметрів, модуль для зображень — 170 млн, а аудіокодер — 300 млн; останні два завантажуються лише за потреби.
Модель підтримує контекст до 8192 токенів для кожного типу даних. Це відповідає приблизно 29 зображенням, 58 відеокадрам або п’яти з половиною хвилинам аудіо. Вектори можна зменшувати з 768 до 128 вимірів, що, за оцінкою Google, скорочує необхідний обсяг сховища до шести разів.
Обмеження моделі
EmbeddingGemma 2 підтримує понад 100 мов, однак Google попереджає, що якість роботи не є однаковою для всіх із них. Компанія також зазначила, що модель не проходила налаштування безпеки та не має модерації вихідних даних: відповідні заходи застосовувалися на етапі підготовки навчальних даних.
Новинка побудована на архітектурі Gemma 4 і використовує спільні з нею текстовий токенізатор та аудіокодер. За даними Google, родина моделей Gemma перевищила 1 млрд завантажень, а на першу версію EmbeddingGemma припало 20 млн із них.