A Google revelou o novo EmbeddingGemma 2, um modelo AI multimodal compacto, criado para correr localmente com menos de 600 MB de RAM.
A Google apresentou o EmbeddingGemma 2, um novo modelo multimodal open source concebido para lidar com texto, código, imagens, áudio e vídeo num único espaço vectorial. Com 740 milhões de parâmetros e uma licença Apache 2.0, o modelo foi desenvolvido para funcionar localmente em smartphones e outros dispositivos com recursos limitados, permitindo criar sistemas de pesquisa e recuperação de informação sem depender da cloud.
O modelo pode, por exemplo, encontrar um vídeo específico a partir de um pedido de voz ou pesquisar horas de áudio através de uma pergunta em texto. Tudo isto num modelo bastante compacto: a Google diz que o modelo pode utilizar cerca de 191 MB de RAM para texto ou aproximadamente 567 MB na configuração multimodal completa num Pixel 11 Pro.
O EmbeddingGemma 2 também inclui uma janela de contexto de 8K tokens, quatro vezes superior à geração anterior, permitindo processar até 5.5 minutos de áudio, 29 imagens ou 58 frames de vídeo. Com modelos generativos como o Gemma 4, a Google vê o novo modelo como uma peça importante para criar sistemas AI totalmente locais, com menor latência, e maior privacidade.
2026/10/07
Subscrever:
Enviar feedback (Atom)



















Sem comentários:
Enviar um comentário (problemas a comentar?)