IA ● 6 oct 2026 ⏱ 4 min

EmbeddingGemma 2: búsqueda multimodal en tu dispositivo para pymes

Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal que unifica texto, código, imágenes, video y audio en un solo espacio vectorial, optimizado para ejecutarse en dispositivos locales. Esto abre nuevas posibilidades para pymes que buscan privacidad y eficiencia en sus aplicaciones.

AS
Altya Studio
equipo editorial
Patrón abstracto en blanco y negro que representa un modelo multimodal con formas geométricas entrelazadas

Foto: Google DeepMind · pexels

Google DeepMind ha presentado EmbeddingGemma 2, un modelo de embeddings de código abierto que amplía las capacidades de su predecesor, EmbeddingGemma, lanzado el año pasado. Mientras que la primera versión se centraba en texto, esta nueva entrega unifica en un mismo espacio vectorial texto, código, imágenes, video y audio. El modelo está construido sobre la arquitectura Gemma 4 y se distribuye bajo licencia Apache 2.0, lo que permite su uso comercial sin restricciones.

Con 740 millones de parámetros, EmbeddingGemma 2 está diseñado para ejecutarse directamente en dispositivos de consumo, como teléfonos o computadoras personales. Esto significa que las aplicaciones pueden realizar búsquedas y recuperación de información sin depender de la nube, lo que mejora la privacidad y reduce la latencia. La comunidad de desarrolladores ya había descargado la versión anterior más de 20 millones de veces, lo que refleja un interés creciente por soluciones de embeddings ligeras y locales.

¿Qué hace especial a EmbeddingGemma 2?

La principal novedad es su capacidad multimodal nativa. El modelo puede, por ejemplo, encontrar un fragmento específico de video a partir de una nota de voz, o buscar en horas de grabaciones de audio usando una consulta de texto. Todo esto se procesa localmente, sin necesidad de enviar datos a servidores externos. Además, su diseño modular permite adaptar el consumo de recursos: para tareas solo de texto requiere tan solo 270 millones de parámetros, y opcionalmente se pueden añadir codificadores de visión (170M) y audio (300M) para soporte completo.

Otra característica destacada es la eficiencia de almacenamiento. Gracias a Matryoshka Representation Learning (MRL), los desarrolladores pueden truncar dinámicamente los vectores de salida de 768 dimensiones a 512, 256 o 128 dimensiones. Esto reduce hasta seis veces el espacio necesario para bases de datos vectoriales locales, algo crucial en entornos con recursos limitados. En cuanto al rendimiento en dispositivo, con cuantización, el modelo requiere tan solo ~191 MB de RAM activa para pesos de solo texto y ~567 MB para la versión multimodal completa en un Google Pixel 11 Pro.

El contexto extendido también mejora: ahora soporta una ventana de 8K tokens, cuatro veces más que la versión anterior. Esto permite procesar hasta 5.5 minutos de audio, 29 imágenes, 58 fotogramas de video o combinaciones intercaladas, todo en hardware local.

Implicaciones para las pymes

Para las pequeñas y medianas empresas, este avance representa una oportunidad para incorporar capacidades avanzadas de búsqueda y recuperación de información sin grandes inversiones en infraestructura. Al ejecutarse en dispositivos locales, se eliminan los costos recurrentes de cómputo en la nube y se garantiza la privacidad de los datos, un aspecto cada vez más valorado por clientes y regulaciones.

Por ejemplo, una pyme podría implementar un sistema de búsqueda interna que indexe documentos, imágenes y videos de capacitación, permitiendo a los empleados encontrar rápidamente la información que necesitan. O bien, un negocio de servicios podría ofrecer a sus clientes una herramienta de búsqueda por voz en su aplicación móvil, todo sin conexión a internet. La naturaleza multimodal facilita casos de uso antes reservados a grandes empresas con presupuestos elevados.

Además, al ser de código abierto y compatible con herramientas populares como Hugging Face, transformers, Ollama o Qdrant, su integración en proyectos existentes es relativamente sencilla. Los desarrolladores pueden aprovechar guías y documentación proporcionadas por Google DeepMind para fine-tuning y despliegue.

Lectura práctica: cómo empezar

Si tu pyme está considerando dar sus primeros pasos en inteligencia artificial aplicada, EmbeddingGemma 2 ofrece un punto de entrada accesible. Podés comenzar descargando los pesos del modelo desde Hugging Face o Kaggle y experimentar con casos de uso simples, como la búsqueda semántica en tu base de conocimiento interna.

Para una implementación más robusta, es recomendable apoyarse en frameworks como LiteRT o MediaPipe, que facilitan la integración en aplicaciones móviles y web. También podés combinar EmbeddingGemma 2 con modelos generativos como Gemma 4 para crear pipelines de RAG (generación aumentada por recuperación) que operen completamente en el dispositivo, manteniendo los datos seguros y reduciendo la dependencia de servicios externos.

En Altya Studio podemos ayudarte a evaluar cómo estas tecnologías pueden adaptarse a las necesidades específicas de tu negocio. Ya sea para mejorar la atención al cliente, optimizar la búsqueda interna o desarrollar nuevas funcionalidades, el ecosistema de modelos abiertos y ligeros está madurando rápidamente. Mantenerse informado y experimentar con estas herramientas puede marcar la diferencia en la eficiencia y la experiencia de usuario de tu pyme.

Fuente: deepmind.google

EmbeddingGemmabúsqueda semánticamultimodalon-deviceRAG