Gemini Omni (Google)
A Google revela o Gemini Omni, um modelo capaz de gerar a partir de qualquer tipo de entrada (imagem, áudio, vídeo, texto), começando pelo vídeo.
Pontos-chave
- Geração multimodal a partir de imagens, áudio, vídeo e texto.
- Implementação orientada primeiro para o vídeo.
- Enraizado nos conhecimentos do mundo real do Gemini.
Análise
O Gemini Omni marca um passo rumo a uma pesquisa generativa plenamente multimodal. A forma como a sua marca é representada nas imagens e vídeos, e como esses conteúdos são contextualizados, entra no campo da visibilidade generativa.
Para além do texto, a coerência da sua presença (nomeação, dados, conteúdos visuais de referência) torna-se um fator por direito próprio.
O que fazer
- Cuidar da coerência da sua marca nos conteúdos visuais e de vídeo.
- Documentar e estruturar as informações-chave de forma multimodal.
- Alargar o seu acompanhamento de visibilidade às respostas generativas multimodais.
A pesquisa generativa torna-se multimodal. As marcas devem pensar a sua visibilidade para além do texto, até aos conteúdos visuais e de vídeo.