Googlebot entschlësselt: Crawling, Bytes a Limiten erkläert
Google

Googlebot entschlësselt: Crawling, Bytes a Limiten erkläert

A Kuerzem

Google huet an engem detailléierte Blogpost d'Funktionsweise vum Googlebot transparenter gemaach, mat engem besonnesche Fokus op d'Byte-Limiten beim Crawling. Fir SEO-Responsabel ass et entscheedend ze verstoen, wéi d'Infrastruktur Inhalt récupéréiert, wei vill Bytes veraarbecht ginn, a wéi eng Konsequenzen dat fir d'Indexéierung huet.

Haaptpunkten

  • Googlebot ass kee solitäre Programm mee eng zentraliséiert Crawling-Plattform, déi vu Dosende vu Google-Produkter wéi Google Shopping oder AdSense genotzt gëtt, jeeweils ënner engem eegenen Crawler-Numm.
  • Fir standard HTML-Säiten fetch Googlebot maximal 2MB pro URL, inklusiv den HTTP-Header, woubäi alles wat no dësem Schwellenwäert kënnt, komplett ignoréiert gëtt an net indexéiert gëtt.
  • Fir PDF-Fichieren gëllt eng méi héich Limit vun 64MB, wärend all anere Crawler ouni spezifescht Limit op 15MB par défaut gesat sinn, egal wéi eng Art vun Inhalt gefetch gëtt.
  • Den Web Rendering Service (WRS) kritt nëmmen déi éischt 2MB vum HTML-Dokument a veraarbecht JavaScript an CSS statelessly, dat heescht ouni lokal Stockage oder Session-Donnéeën tëscht de Requêten.
  • Extern Ressourcen wéi JavaScript- oder CSS-Fichieren hunn hiren eegene Byte-Compteur pro URL a ginn net am 2MB-Limit vun der Elterensäit abegraff, wat d'Auslagerungs-Strategie fir schwéiere Code wichteg mécht.
  • D'Crawl-Frequenz vun enger Säit kann automatesch erofgoen, wann de Server lues ass bei der Ausliwwerung vun de Bytes, well d'Crawler-Infrastruktur automatisch méi seelen ufreet fir d'Infrastruktur net ze iwwerbelaschten.

Analyse

Déi meescht SEO-Professioneller hunn d'Bild vum Googlebot als eenzegen, universelle Roboter am Kapp. D'Realitéit ass awer komplex: Google bedreibt eng zentraliséiert Crawling-Plattform, déi vun enger Villfalt vu Produkter genotzt gëtt. De Numm 'Googlebot' ass e Relikt aus den éischten Jore vum Suchdéngscht, wou et just ee Produkt an een Crawler gouf. Haut ass Googlebot nëmmen een Client ënner villen op dëser geteilter Infrastruktur, a wann ee Googlebot a sengen Server-Logs gesäit, gesäit ee konkret d'Aktivitéit vun der Google-Sich.

Déi 2MB-Limit fir HTML-Säiten ass ouni Zweiwel d'wichtegst technescht Detail aus dësem Blogpost fir SEO-Spezialisten. Google fetch nëmmen déi éischt 2MB vun engem HTML-Dokument, inklusive dem HTTP-Header. Alles no dëser Grenz gëtt schlicht net geholl, net gerenert an net indexéiert. Et geet net drëm, datt d'Säit refuséiert gëtt, mee datt de Googlebot den Download genee bei 2MB ofschneides an dëse partiellen Inhalt wéi eng komplett Fichier behandelt. Fir d'Mehrzuel vun de Websäiten ass dëst kee Problem, well 2MB HTML eng ganz grouss Quantitéit representéiert.

D'Risike fir d'Indexéierung trieden op bei Säiten, déi schwéier Inline-Inhalter hunn. Grouss Base64-kodiéiert Biller, déi direkt am HTML agebaut sinn, massiv Blöcke vun Inline-CSS oder Inline-JavaScript, oder kilometerlang Navigatiounsbeem, déi am ieweschten Deel vum Dokument plazéiert sinn, kënnen dazu féieren, datt den eegentleche Textinhalt oder d'strukturéierten Donnéeën ënner dem 2MB-Schwellenwäert leien. Fir Googlebot existéiere beispillsweis strukturéiert Donnéeën am JSON-LD-Format, déi am ënneschten Deel vun enger komplexer Säit plazéiert sinn, einfach net, wat direkte Konsequenzen op Rich Snippets an aner SERP-Features huet.

Den WRS, dee JavaScript a CSS veraarbecht fir d'Säit wéi en moderne Browser ze renderen, schaaft statelessly. Dat heescht, datt lokal Stockage an Session-Daten tëscht de Requête geläscht ginn. Fir dynamesch Säiten, déi staark op JavaScript-Rendering setzen, huet dat wichteg Implikatioune fir d'Interpretatioun vum Inhalt. Donieft kann den WRS nëmme Code ausféieren, deen de Crawler tatsächlech erofgelueden huet. Wann also eng JavaScript-Datei nom 2MB-Limit kënnt a net fetch gëtt, bleift dëse Code vum WRS net ausgefouert.

D'Crawl-Geschwindegkeet ass och eng wichteg Variabel, déi dacks ënnerschätzt gëtt. Wann e Server Schwieregkeeten huet, Bytes schnell ze servéieren, reduzéieren d'Google-Crawler automatesch hir Ufroefrequenz. Dëse Mechanismus schützt d'Server-Infrastruktur, kann awer deene Site schueden, déi souwisou schon eng niddreg Crawl-Frequenz hunn. D'Server-Performance ass dofir net nëmmen e User-Experience-Faktor, mee eng direkt SEO-Variabel déi d'Indexéierungsgeschwindegkeet vun neien Inhalter beaflosst.

Wat maachen

  • Kontrolléiert d'Gréisst vun Ärem HTML-Dokument regelméisseg mat den Entwéckleroutils a stellt sécher, datt d'Dateigréisst ënner 2MB bleift, besonnesch op Säiten mat komplexem Inhalt oder vill Inline-Code.
  • Lagert schwéiere CSS- a JavaScript-Code ëmmer a extern Fichieren aus, well dës Ressourcen hiren eegene Byte-Compteur hunn an d'Limite vun der Elterenséit net belaaschten, wat d'effektiv Kapazitéit vum HTML-Dokument fir Textinhalt erhéicht.
  • Plazéiert kritesch SEO-Elementer wéi den Titel-Tag, Meta-Beschreiwungen, kanonell Links a strukturéiert Donnéeën am JSON-LD-Format esou héich wéi méiglech am HTML-Dokument, fir sécherzestellen, datt dës am gehollene 2MB-Block abegraff sinn.
  • Vermeit Inline-Biller am Base64-Format am HTML-Quellcode, well dës d'Dateigréisst exponentiel erhéijen a séier de gréisste Deel vum Byte-Budget belaschten, ouni dass Googlebot dës Biller souwisou rendert.
  • Iwwerwaacht d'Server-Äntwerzäiten a sorgt fir eng séier Ausliwwerung vun de Bytes, fir datt d'Crawler hir Besuchsfrequenz net reduzéieren, wat d'Indexéierungsgeschwindegkeet vu neie Säiten a Mises-à-jour direkt beaflosst.
  • Lauschtert den Episode 105 vum 'Search Off the Record' Podcast a suivéiert den Google Search Central Blog fir déi neiste Ännerungen u Crawl-Limiten, well Google explizitt ugekënnegt huet, datt dës Limiten sech mat der Evolutioun vum Web kënne veränneren.
Impakt

Websäiten, déi méi wéi 2MB HTML-Inhalt generéieren, riskéieren datt kritesch Inhalter wéi strukturéiert Donnéeën oder Meta-Tags vum Googlebot einfach ignoréiert ginn, wat d'Visibilitéit am Siche markant beaflosse kann. D'Verständnis vun dësen techneschen Limiten erlaabt et, d'HTML-Struktur strategesch ze optimiséieren fir eng maximal Crawl-Effizienz ze garantéieren.

Offiziell Quell
Verpasst keng Neiegkeet

Produktneiegkeeten, Algorithmus-Updates a Best Practices, direkt an Är Mailbox.

Zréck zur Iwwersiicht

Bleift den Algorithmen ëmmer eng Nues laang viraus

Pulsar verfollegt är Google Positiounen, är Visibilitéit an de KI an är sozial Netzwierker an engem eenzegen Dashboard. 14 Deeg Testperiod, ouni Kredittkaart.

Eng Gratis-Testperiod starten