Googlebot desmistificado: limites de bytes, rastreamento e indexação
O Google publicou um artigo técnico detalhado explicando o funcionamento interno da infraestrutura de rastreamento do Googlebot, com foco especial nos limites de bytes aplicados durante o fetch de URLs. O conteúdo esclarece que o Googlebot não é um programa único, mas sim um dos muitos clientes de uma plataforma centralizada de rastreamento, e detalha como o limite de 2MB impacta a indexação das páginas.
Pontos-chave
- O Googlebot não é um programa único: desde os primórdios do Google havia um rastreador, mas hoje o nome 'Googlebot' designa apenas um dos clientes de uma plataforma centralizada de rastreamento usada por dezenas de produtos do Google, como Google Shopping e AdSense.
- O limite de fetch para o Googlebot é de 2MB por URL para HTML, incluindo os cabeçalhos HTTP da requisição, o que significa que qualquer conteúdo além desse limiar é completamente ignorado durante o rastreamento e a indexação.
- Para arquivos PDF, o limite de fetch sobe para 64MB, enquanto rastreadores de imagem e vídeo possuem limites variáveis conforme o produto, e qualquer rastreador que não defina um limite utiliza por padrão 15MB independentemente do tipo de conteúdo.
- Cada recurso referenciado no HTML (excluindo mídias, fontes e alguns arquivos específicos) é buscado pelo Web Rendering Service com o Googlebot de forma independente, com seu próprio contador de bytes por URL, sem impactar o limite de 2MB da página pai.
- O Web Rendering Service (WRS) processa JavaScript e executa código client-side de forma similar a um navegador moderno, mas opera de forma stateless, limpando armazenamento local e dados de sessão entre as requisições.
- Elementos críticos como meta tags, title, canonicals e dados estruturados devem ser posicionados o mais alto possível no documento HTML para evitar que fiquem além do corte de 2MB e sejam ignorados pelo Googlebot.
Análise
A revelação de que o Googlebot é apenas um cliente dentro de uma infraestrutura de rastreamento centralizada representa uma mudança importante na forma como os profissionais de SEO devem interpretar os logs de servidor. Ao ver o Googlebot nos registros, trata-se especificamente do rastreamento para o Google Search, enquanto outros produtos do Google utilizam identificadores distintos e podem ter limites de bytes diferentes configurados em suas requisições.
O limite de 2MB aplicado ao fetch do Googlebot é talvez o dado mais crítico deste comunicado para fins práticos de otimização. O limite inclui os cabeçalhos HTTP da resposta, o que significa que o volume disponível para o conteúdo HTML em si pode ser ligeiramente inferior a 2MB. Na maioria dos sites, esse limiar é muito generoso, mas páginas com imagens embutidas em base64, grandes volumes de CSS e JavaScript inline, ou menus extensos no topo do documento podem facilmente ultrapassar esse limite e ter seu conteúdo principal ou dados estruturados ignorados pelo indexador.
Um aspecto relevante é que o Google não rejeita páginas que ultrapassam o limite: o Googlebot simplesmente para o download exatamente no corte de 2MB e passa esse fragmento ao sistema de indexação e ao WRS como se fosse o arquivo completo. Os bytes além desse ponto são tratados como inexistentes, o que pode causar falhas silenciosas na indexação de conteúdo que o proprietário do site acredita estar visível para o Google.
O comportamento stateless do WRS tem implicações diretas para sites com forte dependência de JavaScript dinâmico. Como o WRS limpa dados de localStorage e sessão entre cada requisição, qualquer conteúdo que dependa de estado persistido entre páginas ou de dados armazenados no lado do cliente pode não ser interpretado corretamente, afetando a qualidade da indexação de páginas renderizadas via client-side.
O Google deixa claro que o limite de 2MB não é definitivo e pode mudar conforme a web evolui. Isso indica que a equipe monitora o crescimento médio dos documentos HTML na web e que ajustes futuros são possíveis. Para os profissionais de SEO, isso reforça a importância de acompanhar os comunicados técnicos do Google Search Central e de manter boas práticas de otimização de peso de página de forma contínua.
O que fazer
- Mantenha o HTML das páginas enxuto, movendo blocos de CSS e JavaScript pesados para arquivos externos, pois cada recurso externo possui seu próprio limite de bytes independente e não consome o orçamento de 2MB do documento HTML principal.
- Posicione os elementos críticos de SEO, como meta tags, tag title, links de canonical, hreflang e dados estruturados em JSON-LD, o mais próximo possível do início do documento HTML para garantir que estejam dentro dos primeiros 2MB rastreados.
- Evite o uso de imagens em base64 embutidas diretamente no HTML, pois esse tipo de codificação pode aumentar drasticamente o peso do documento e empurrar conteúdo relevante para além do limite de rastreamento do Googlebot.
- Monitore regularmente os logs de servidor para identificar tempos de resposta elevados, pois o Google reduz automaticamente a frequência de rastreamento de sites lentos a fim de não sobrecarregar a infraestrutura, o que pode impactar negativamente o orçamento de rastreamento disponível.
- Para sites com renderização client-side baseada em JavaScript, revise como o conteúdo dinâmico é carregado considerando o comportamento stateless do WRS, priorizando a entrega de conteúdo essencial de forma server-side ou garantindo que ele esteja presente nos primeiros bytes do HTML.
- Realize auditorias periódicas do tamanho dos arquivos HTML das páginas mais importantes do site, utilizando as ferramentas de inspeção de URL disponíveis no Google Search Console para verificar o que está sendo rastreado e identificar possíveis cortes de conteúdo.
Sites com HTML pesado, imagens inline em base64 ou grandes blocos de CSS e JavaScript embutidos correm o risco de ter conteúdo crítico cortado antes da indexação, prejudicando diretamente a visibilidade orgânica. Compreender e respeitar o limite de 2MB é essencial para garantir que metadados, dados estruturados e conteúdo principal sejam sempre rastreados e indexados corretamente.