Crawling: Jak roboty Google skanują strony?

Crawling: Jak roboty Google skanują strony?

Ten artykuł rozwija temat z: Crawling, indeksowanie i ranking w Google: Jak działa wyszukiwarka

Crawling to fundamentalny proces, bez którego żadna strona internetowa nie mogłaby pojawić się w wynikach wyszukiwania Google. Zrozumienie, jak działają roboty Google, jest kluczowe dla każdego specjalisty SEO i właściciela witryny. To pierwszy krok do optymalizacji serwisu tak, by był on dla wyszukiwarki w pełni dostępny i zrozumiały.

Więcej o tym przeczytasz w: Indeksowanie stron w Google: Kompletny przewodnik

Co to jest crawling i kim jest Googlebot?

Crawling (nazywany też skanowaniem lub pełzaniem) to proces, w którym wyspecjalizowane programy, zwane robotami lub pająkami, odkrywają publicznie dostępne strony internetowe. W przypadku Google głównym bohaterem tego procesu jest Googlebot. Jego zadaniem jest przechodzenie od linku do linku, pobieranie treści stron i przekazywanie ich do dalszej analizy.

Crawling (skanowanie) to pierwszy z czterech etapów przetwarzania strony przez Google: poprzedza renderowanie i indeksowanie, bez których strona nie pojawi się w wynikach. Jeśli Googlebot nie znajdzie Twojej strony lub nie będzie w stanie jej pobrać, dla wyszukiwarki Twoja witryna po prostu nie istnieje.

Rodzaje Googlebotów (Smartphone vs Desktop)

Google używa kilku typów robotów, ale dwa najważniejsze to Googlebot Smartphone i Googlebot Desktop. Symulują one zachowanie użytkownika odpowiednio na urządzeniu mobilnym i komputerze stacjonarnym.

Wraz z upowszechnieniem się smartfonów, Google przeszło na strategię Mobile-First Indexing. Oznacza to, że podstawową wersją strony, którą Google analizuje i na podstawie której ustala ranking, jest wersja mobilna. Od 2023 roku Google skanuje witryny głównie robotem Googlebot Smartphone w ramach zasady Mobile-First Indexing. Dlatego kluczowe jest, aby Twoja strona była w pełni funkcjonalna i czytelna na urządzeniach mobilnych.

Więcej o tym przeczytasz w: Czym jest Googlebot i jak działa - pełny przewodnik

Proces skanowania krok po kroku

Proces przetwarzania strony przez Google można podzielić na cztery logiczne etapy, które następują po sobie. Crawling i renderowanie są warunkiem koniecznym do ostatniego etapu, czyli indeksacji.

Krok 1 - Odkrywanie (Discovery)

Google nie posiada gotowej listy wszystkich stron w sieci - Googlebot odkrywa adresy podążając za linkami i czytając pliki sitemap.xml. Proces odkrywania nowych lub zaktualizowanych adresów URL odbywa się na kilka sposobów:

  • Linki zewnętrzne: Googlebot podąża za linkami z już znanych mu stron do stron, których jeszcze nie odwiedził.
  • Mapy witryn (sitemap.xml): Właściciele witryn mogą przesłać do Google Search Console plik sitemap.xml, czyli listę wszystkich ważnych adresów URL w serwisie, co znacznie ułatwia i przyspiesza ich odkrycie.
  • Linki wewnętrzne: Po wejściu na jedną podstronę Twojej witryny, Googlebot skanuje jej zawartość w poszukiwaniu linków do innych podstron w obrębie tego samego serwisu.

Krok 2 - Skanowanie (Crawling)

Gdy Googlebot odkryje adres URL, umieszcza go w kolejce do skanowania, znanej jako crawl queue. Kiedy nadchodzi jego kolej, robot próbuje pobrać zawartość strony. Jednak zanim to zrobi, wykonuje kluczowy krok.

Zanim Googlebot pobierze jakąkolwiek podstronę, najpierw odczytuje plik robots.txt i sprawdza reguły Disallow. Ten plik tekstowy umieszczony w głównym katalogu serwera zawiera dyrektywy dla robotów, informujące je, których części witryny nie powinny odwiedzać. Jeśli dana strona jest zablokowana dyrektywą Disallow, Googlebot nie pobierze jej treści.

Krok 3 - Renderowanie (Rendering)

Samo pobranie kodu HTML to za mało. Współczesne strony internetowe w dużej mierze opierają się na JavaScript i CSS, które dynamicznie generują lub modyfikują treść i wygląd. Dlatego kolejnym etapem jest renderowanie.

Współczesny Evergreen Googlebot, oparty na silniku Chromium, wykonuje JavaScript i CSS, renderując stronę tak, jak zobaczyłby ją użytkownik w przeglądarce Chrome. Dzięki temu Google jest w stanie zobaczyć treść ładowaną dynamicznie i zrozumieć pełen kontekst wizualny strony.

Ponieważ renderowanie JavaScriptu jest zasobożerne, Google stosuje dwufalowe indeksowanie (ang. two-wave indexing) - najpierw analizuje statyczny kod HTML, a renderowanie JS następuje później, gdy zwolnią się zasoby obliczeniowe. Może to oznaczać, że treści generowane przez JavaScript pojawią się w indeksie z opóźnieniem.

Krok 4 - Indeksowanie (Indexing)

Po pomyślnym skanowaniu i wyrenderowaniu strony, jej zawartość jest analizowana i przetwarzana w celu dodania do ogromnej bazy danych Google, zwanej Indeksem. Na tym etapie Google ocenia m.in. jakość i unikalność treści, a także analizuje tagi canonical, aby poradzić sobie z duplikatami. Dopiero strona, która trafi do Indeksu, może pojawić się w wynikach wyszukiwania.

Więcej o tym przeczytasz w: Jak roboty odnajdują nowe strony w sieci

Kluczowe pojęcia związane z crawlingiem

Aby w pełni zrozumieć proces skanowania, warto poznać kilka specjalistycznych terminów, którymi posługuje się Google i specjaliści SEO.

Crawl Budget (budżet indeksowania)

Crawl Budget (budżet indeksowania) to liczba stron, które Googlebot może i chce przeskanować w danej witrynie w określonym czasie. Na budżet indeksowania składają się dwa czynniki: limit obciążenia serwera (crawl capacity limit) oraz zapotrzebowanie na skanowanie (crawl demand) wynikające z popularności i częstości aktualizacji strony. Google zawsze stara się skanować witrynę bez nadmiernego obciążania serwera.

Crawl Demand (zapotrzebowanie na skanowanie)

Crawl Demand (zapotrzebowanie na skanowanie) określa, jak często Google chce odwiedzać daną witrynę. Zależy to głównie od popularności (ważne, często linkowane strony są skanowane częściej) oraz od tego, jak często zmienia się treść. Przykładowo, duży portal newsowy może być skanowany co kilka minut, podczas gdy rzadko aktualizowany blog firmowy może być odwiedzany przez Googlebota raz na kilka tygodni.

User-Agent

Każdy robot, łącząc się ze stroną, przedstawia się za pomocą specjalnego identyfikatora zwanego User-Agent. Pozwala to administratorom serwerów zidentyfikować rodzaj bota. Pełny, aktualny User-Agent dla mobilnego Googlebota to:

Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)

Więcej o tym przeczytasz w: Crawl Budget: Budżet indeksowania w SEO

Jak ułatwić robotom Google skanowanie strony? (Dobre praktyki SEO)

Optymalizacja pod kątem crawlingu to fundament technicznego SEO. Oto lista działań, które zapewnią, że Googlebot będzie mógł efektywnie skanować Twoją witrynę:

  • Zoptymalizuj plik robots.txt: Upewnij się, że nie blokujesz dostępu do ważnych zasobów. Użyj go do zablokowania sekcji, które nie powinny być indeksowane, np. stron logowania, koszyka zakupowego czy wyników wewnętrznej wyszukiwarki.
  • Prześlij mapę witryny sitemap.xml: Zarejestruj swoją witrynę w Google Search Console i prześlij plik sitemap.xml. To najprostszy sposób, by poinformować Google o wszystkich istotnych adresach URL.
  • Zadbaj o szybkość serwera: Jeśli serwer odpowiada wolno lub zwraca błędy 5xx (np. 503 Service Unavailable), Googlebot ogranicza tempo skanowania, aby nie przeciążać witryny. Szybki hosting to podstawa.
  • Stwórz logiczną strukturę linków wewnętrznych: Każda ważna podstrona powinna być osiągalna maksymalnie w 3 kliknięciach od strony głównej - strony osierocone (orphan pages), czyli takie, do których nie prowadzą żadne linki wewnętrzne, mogą nigdy nie zostać zeskanowane.
  • Unikaj błędów i pętli: Regularnie sprawdzaj raporty w Google Search Console pod kątem błędów 404 (nie znaleziono strony) i unikaj długich łańcuchów przekierowań, które marnują Crawl Budget.
  • Odblokuj CSS i JavaScript: Blokowanie plików CSS i JavaScript w robots.txt uniemożliwia Googlebotowi poprawne wyrenderowanie strony i może zaszkodzić jej ocenie. Google musi widzieć stronę tak samo, jak widzi ją użytkownik.

Więcej o tym przeczytasz w: Ranking Google: Jak ustala się kolejność wyników?

Napisz do mnie

Chcesz takich efektów u siebie?