Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

Google випустила EmbeddingGemma 2: ШІ об’єднав текст, фото, звук і відео в одному пошуку

enovosty.com

Google випустила EmbeddingGemma 2: ШІ об’єднав текст, фото, звук і відео в одному пошуку

Google представила відкриту мультимодальну модель EmbeddingGemma 2, яка перетворює текст, зображення, аудіо та відео в єдиний простір числових представлень. Завдяки цьому система може шукати інформацію між різними форматами та працювати безпосередньо на пристрої без відправлення даних на віддалені сервери.

Про це пише Google.

EmbeddingGemma 2 розробили в Google DeepMind як розвиток попередньої EmbeddingGemma, яка працювала з текстовими ембедингами. Нова версія стала мультимодальною та отримала підтримку одразу кількох типів даних.

Ембединги перетворюють інформацію на числові представлення, між якими система може визначати смислову близькість. Завдяки цьому, наприклад, текстовий запит можна використовувати для пошуку потрібного моменту у відео або серед аудіозаписів.

Модель побудована на архітектурі Gemma 4 і має 740 млн параметрів. Вона поширюється за ліцензією Apache 2.0, яка дозволяє, зокрема, комерційне використання.

Для роботи лише з текстом достатньо близько 270 млн параметрів. Повна мультимодальна конфігурація додатково використовує кодировщик зображень на 170 млн і аудіокодировщик на 300 млн параметрів.

Google заявляє, що EmbeddingGemma 2 показує найкращі результати серед мультимодальних моделей ембедингів із кількістю параметрів менш як один мільярд. У низці тестів вона також конкурує з більшими спеціалізованими рішеннями.

Контекстне вікно збільшили до 8 тисяч токенів, що вчетверо більше, ніж у попередньої версії. Це дозволяє локально обробляти до 5,5 хвилини аудіо, 29 зображень або приблизно 58 кадрів відео, а також їхні комбінації.

Окремо покращили роботу з програмним кодом. Показник MTEB Code, за даними Google, зріс із 68,76 у EmbeddingGemma до 78,68 у нової моделі.

Це дозволяє використовувати систему для локального індексування кодових баз, семантичного пошуку та пошуку даних для програмних агентів.

Робота безпосередньо на пристрої має дві практичні переваги: дані не обов’язково передавати у хмару, а затримка під час пошуку може бути меншою. Такі системи також здатні працювати автономно без постійного доступу до інтернету.

EmbeddingGemma 2 можна поєднувати з генеративними моделями, зокрема Gemma 4, для побудови локальних RAG-систем. Спочатку така система знаходить потрібну інформацію у файлах користувача, а потім передає її генеративній моделі для формування відповіді.

EmbeddingGemma 2 і Gemma 4 використовують спільний текстовий токенізатор та аудіокодировщик. Google заявляє, що це дає змогу запускати їх в одному конвеєрі та зменшувати загальний обсяг необхідної пам’яті.

Серед можливих сценаріїв компанія називає пошук у медіатеці за текстом або зображенням, знаходження конкретного фрагмента відео за голосовою нотаткою та пошук серед багатьох годин аудіо за текстовим запитом.

Модель також можна використовувати у системах прийняття рішень у реальному часі. Через MediaPipe Decision Task розробники можуть створювати інструменти для класифікації, маршрутизації та прогнозування на основі мультимодальних даних.

Ваги EmbeddingGemma 2 уже доступні на Hugging Face і Kaggle. Для розгортання Google пропонує AI Edge MediaPipe та LiteRT, а надалі модель має з’явитися і в Model Garden на Gemini Enterprise Agent Platform.

  • Останні
Більше новин

Новини по днях

Сьогодні,
7 жовтня 2026

Новини на тему

Більше новин