Crawler startuje od znanych URL-i i map witryny, pobiera każdą stronę, czyta HTML i podąża za znalezionymi linkami, by odkrywać kolejne strony. To, co zdoła osiągnąć i wyrenderować, decyduje o tym, co wyszukiwarki wiedzą o Twojej witrynie. Znaczenie mają tu odpowiedzi serwera: zdrowa strona zwraca HTTP 200, a błędy lub blokady uniemożliwiają robotowi zobaczenie treści.
Na crawling wpływasz przez robots.txt (które ścieżki boty mogą pobierać), linkowanie wewnętrzne (jak łatwo strony są odkrywane) oraz szybkość witryny. Na dużych serwisach wiąże się to bezpośrednio z budżetem indeksowania — ograniczoną uwagą, jaką Googlebot poświęca Twojej domenie.
Crawling to nie to samo co indeksacja. Strona może zostać zeskanowana, ale nie zindeksowana, jeśli jest uboga, zduplikowana lub zablokowana tagiem noindex. Dobrze ustawiony crawling to fundament, na którym opiera się cała reszta technicznego SEO.