OCTO+

EmbeddingGemma 2: Google lança modelo 740M multimodal

O modelo roda em smartphones com apenas 191 MB de RAM na versão de texto e 567 MB na versão completa multimodal.

06 de out., 21:02 8 fontes · 4 países Modelos Produto
ModelosGoogle
Sala de servidores com iluminação baixa mostrando racks e luzes piscantes Foto: Christina Morillo / Pexels

Google DeepMind lançou o EmbeddingGemma 2, modelo aberto de 740 milhões de parâmetros baseado na arquitetura Gemma 4 que transforma texto, código, imagem, vídeo e áudio em um único vetor de 768 dimensões, sob licença Apache 2.0. Segundo o Unite.AI, o lançamento ocorreu em 6 de outubro de 2026, enquanto a IT Home indica a data de 7 de outubro.

Detalhes técnicos e eficiência

Segundo o MarkTechPost, o modelo é modular: possui um núcleo de texto e código de 270 milhões de parâmetros (130 milhões de transformer mais 140 milhões de embedder), ao qual podem ser adicionados um codificador de visão de 170 milhões e um codificador de áudio de 300 milhões, todos projetando no mesmo espaço de 768 dimensões. O MarkTechPost também informa que a janela de contexto é de 8 192 tokens, quatro vezes maior que a versão anterior, permitindo processar até 29 imagens, 58 quadros de vídeo ou 5,5 minutos de áudio por entrada. Segundo a IT Home, com quantização em um Pixel 11 Pro, a versão apenas de texto consome cerca de 191 MB de RAM, enquanto o modelo completo multimodal requer aproximadamente 567 MB. O MarkTechPost acrescenta que, graças ao aprendizado de representação Matryoshka, os vetores de saída podem ser truncados para 512, 256 ou 128 dimensões, reduzindo o armazenamento até seis vezes.

Desempenho em benchmarks

De acordo com o MarkTechPost e a Unite.AI, o EmbeddingGemma 2 manteve o desempenho multilíngue de texto da versão anterior (61,36 no MTEB v2) e elevou a pontuação em código de 68,76 para 78,68 no MTEB Code, um ganho de 9,92 pontos. Nos testes de imagem, áudio e vídeo, o modelo obteve 64,64 no MIEB lite, 59,01 no MMEB v2 geral, 69,54 no MSEB de som e 49,39 no MAEB de áudio. O MarkTechPost observa que essas colocações lideram entre os embedders multimodais com menos de um bilhão de parâmetros e superam alguns modelos especializados com o dobro do tamanho.

Tela de smartphone exibindo gráficos de inteligência artificial e vetores de embutimento
Foto: Solen Feyissa / Pexels

Onde a cobertura diverge

A união das fontes mostra uma diferença quanto à data de lançamento. O Unite.AI afirma que o EmbeddingGemma 2 foi lançado em 6 de outubro de 2026, enquanto a IT Home informa a data de 7 de outubro de 2026. O MarkTechPost não especifica a data.

Disponibilidade e casos de uso

Segundo o MarkTechPost, os pesos do modelo já estão disponíveis no Hugging Face e no Kaggle, com builds para Ollama, llama.cpp GGUF e LiteRT. O modelo visa aplicações de busca on‑device, classificação e pipelines de geração aumentada por recuperação (RAG) com foco em privacidade. A IT Home acrescenta que o EmbeddingGemma 2 pode ser usado com o Google AI Edge MediaPipe, LiteRT, transformers.js, WebGPU, transformers, Ollama e LMStudio, permitindo desenvolvimento multiplataforma. O Unite.AI lembra que o modelo predecessor, o EmbeddingGemma, já superou 20 milhões de downloads, sendo utilizado em ferramentas de busca local e em sistemas RAG prioritários para privacidade.

Apurado em 8 fontes

IT之家 (IT Home) (China) · MarkTechPost (Estados Unidos) · Unite.AI (Estados Unidos)

ver as 8 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)