Google: EmbeddingGemma 2 busca multimedia sin conexión

Google: EmbeddingGemma 2 busca multimedia sin conexión

Google lanza un modelo abierto para buscar fotos, audio y video sin conexión en teléfonos y computadoras.

Por Humberto Toledo el 6 de octubre del 2026 a las 6:36 pm PDT

✨︎ Resumen (TL;DR):

  • Google DeepMind lanzó EmbeddingGemma 2 para buscar texto, código, imágenes, audio y video directamente en el dispositivo.
  • El modelo completo tiene 740 millones de parámetros y usa la licencia Apache 2.0, que permite el uso comercial.
  • En pruebas con precisión completa, bajar los vectores de 768 a 128 dimensiones deteriora de forma sustancial la calidad multimodal.

Google DeepMind lanzó el 6 de octubre de 2026 EmbeddingGemma 2, un modelo abierto basado en Gemma 4 que permite buscar texto, código, imágenes, audio y video directamente en teléfonos y computadoras. Una consulta escrita puede localizar una grabación o un momento de un video sin enviar los archivos a la nube.

EmbeddingGemma 2 es un modelo abierto de embeddings que usa representaciones numéricas para comparar la similitud del contenido y recuperar coincidencias entre formatos distintos. El modelo completo tiene 740 millones de parámetros y se distribuye bajo Apache 2.0, una licencia que permite el uso comercial. Google ofrece sus pesos en Hugging Face y Kaggle.

Google pausa reportes de fallos de producto en OSS VRP
Te podría interesar:
Google pausa reportes de fallos de producto en OSS VRP
Impresionante toma aérea de olas del océano golpeando una orilla arenosa en un día despejado.
Foto: Parth Patel / Pexels

Buscar un archivo por lo que contiene

Los embeddings son representaciones numéricas del contenido. Al colocar una consulta, una foto o un fragmento de audio en el mismo espacio matemático, el sistema compara su similitud y recupera coincidencias entre formatos diferentes.

El resultado es una búsqueda que puede partir de texto y encontrar una grabación o un momento dentro de un video, sin depender de que los archivos se envíen a un servidor remoto.

Dos demostraciones buscan archivos y momentos

Google muestra este funcionamiento en dos nuevas demostraciones de AI Edge Gallery. Instant Media Search busca fotos y videos locales mediante texto o una imagen de referencia.

Video Moments Finder identifica momentos de grabaciones y devuelve sus marcas de tiempo, sin generar transcripciones ni descripciones escritas intermedias.

Para redactar respuestas, la búsqueda se combina con un modelo generativo. AI Edge Foresight, una app experimental para Mac, emplea EmbeddingGemma 2 y Gemma 4 para recuperar información local y enriquecer notas de reuniones, según Google.

La memoria se ajusta por módulos

El diseño permite cargar solo los componentes necesarios. La distribución de parámetros queda así:

  • Texto y código: 270 millones de parámetros.
  • Visión: añade 170 millones de parámetros.
  • Audio: añade 300 millones de parámetros.

En un Pixel 11 Pro, con cuantización, Google reporta unos 191 MB de RAM activa para los pesos de texto y unos 567 MB para el modelo multimodal completo. La cuantización reduce la precisión numérica de los pesos. Las cifras corresponden a ese dispositivo y a esa configuración.

El índice puede reducirse, pero la calidad cambia

El almacenamiento de las búsquedas se ajusta por separado. Los vectores tienen 768 dimensiones y pueden recortarse a 512, 256 o 128 mediante Matryoshka Representation Learning.

Pasar de 768 a 128 dimensiones deja una sexta parte de los valores por vector, a igualdad de precisión numérica. Ese ahorro tiene un costo en la calidad de las coincidencias.

En sus evaluaciones con pesos a precisión completa, la ficha técnica de Google indica que el sistema conserva casi toda la calidad hasta 256 dimensiones. Al bajar a 128, la calidad multimodal se deteriora sustancialmente.

Google presenta la opción de 128 dimensiones como más adecuada para tareas de texto y recomienda validarla con los archivos de cada aplicación. Cargar menos módulos limita los formatos disponibles; acortar los vectores modifica la calidad de las coincidencias. El ahorro de RAM y el ahorro de almacenamiento actúan sobre partes diferentes del sistema.

ML Kit prepara la integración en Android

Google prevé incorporar el modelo como servicio de Android mediante ML Kit en las semanas posteriores al anuncio. La integración busca facilitar que otras aplicaciones añadan búsquedas locales sin gestionar por su cuenta todo el modelo.

La decisión queda dividida en dos frentes: cargar módulos define qué formatos puede buscar una aplicación, mientras que reducir las dimensiones define el tamaño del índice y el nivel de calidad que conserva. ML Kit será la vía anunciada por Google para simplificar esa implementación en Android.

Fuentes: 1, 2, 3, 4

Más de AI

Feed