Crawling a indexace: Komplexní průvodce v roce 2026
Crawling a indexace jsou dva oddělené procesy, na kterých stojí celé SEO = nejdřív robot vyhledávače stránku objeví a stáhne (crawling), pak vyhledávač její obsah zpracuje a uloží do svého indexu (indexace). Teprve zaindexovaná stránka se může zobrazit ve výsledcích vyhledávání. Pokud kterýkoli z těchto kroků selže, vaše stránka pro Google ani Seznam prakticky neexistuje – bez ohledu na to, jak kvalitní obsah na ní je.
V tomto článku si vysvětlíme, jak crawling a indexace fungují u Googlu i Seznamu, jak je řídit přes robots.txt, sitemap.xml, canonical a meta tagy, jak diagnostikovat nejčastější chyby a jak vše ověřit v Google Search Console i Seznam Webmaster.
Co je crawling a indexace a proč na nich záleží v SEO?
Crawling (procházení) je proces, při kterém robot vyhledávače systematicky navštěvuje URL adresy, čte jejich obsah a sleduje odkazy na další stránky.
Indexace je následný krok – vyhledávač zpracuje stažený obsah a uloží ho do indexu vyhledávače, tedy obrovské databáze, ze které se sestavují výsledky vyhledávání.
Pro SEO jsou oba procesy technickým základem všeho ostatního. Můžete mít nejlepší obsah na trhu, ale když ho crawler nenajde nebo když ho vyhledávač odmítne zařadit do indexu, nezískáte žádnou pozici ani návštěvnost z dané URL.
Rozdíl mezi crawlingem a indexací
Klíčové je pochopit, že crawling ≠ (není) indexace. Stránka může být procrawlovaná, ale nezaindexovaná – vyhledávač ji navštívil, ale rozhodl se ji do indexu nezařadit (např. kvůli nízké kvalitě nebo duplicitě).
A naopak = stránka může být zaindexovaná i bez čerstvého crawlu, pokud o ní vyhledávač už ví z dřívějška.
Tohle rozlišení je víc než akademické – určuje, kde hledat problém. Jiná je situace, kdy se robot na stránku vůbec nedostal, a úplně jiná, kdy se na ni dostal ale nezařadil ji.
💬 Tohle je první otázka, kterou si u klienta kladu, když jeho stránka není ve vyhledávači: nedostal se tam robot, nebo se tam dostal a stránku odmítl? Bez téhle odpovědi člověk jen střílí naslepo a opravuje věci, které s problémem nesouvisí.
Jak crawling a indexace ovlivňují pozice ve vyhledávání?
Crawling a indexace samy o sobě nejsou hodnoticí (ranking) faktor – nezvyšují vám pozice v organice.
Jsou ale vstupní branou: bez zaindexování se o pozici vůbec nesoutěží. Proto je technické SEO zaměřené na crawling a indexaci předpokladem, ne luxusem.
U malých webů (do tisíce URL) bývá vše bezproblémové = u velkých e-shopů a zpravodajských webů se z toho stává každodenní bitva o to, aby se ty správné stránky dostaly do indexu včas.
Jak funguje crawler vyhledávače?
Crawler (také vyhledávací robot nebo robot vyhledávače) je program, který automaticky prochází web.
Postupuje od známých URL po interních odkazech na další stránky a stahuje jejich obsah pro další zpracování.
Důležité je vědět, že každý velký vyhledávač má vlastního crawlera (a funguje každý trochu jinak).
Googlebot vs. Seznambot
Googlebot je crawler Googlu – celosvětově nejaktivnější robot, který prochází většinu webu a řídí se sofistikovanými algoritmy priority.
Seznambot je jeho český protějšek od Seznam.cz.
Oba fungují na stejném principu, ale liší se v detailech: Seznambot má menší kapacitu, prochází český web méně agresivně a respektuje některé direktivy (např. crawl-delay), které Googlebot ignoruje.
Pro klasické SEO na českém trhu to znamená, že byste měli sledovat chování obou robotů – Google přes Google Search Console, Seznam přes Seznam Webmaster.
Cesta robota od objevení URL po stažení obsahu
Robot se k vaší stránce dostane jednou ze tří cest: po interním nebo externím odkazu, z odeslané XML sitemapy, nebo přes notifikaci (např. protokol IndexNow).
Po objevení URL ji zařadí do fronty, později ji stáhne a u moderních webů následuje ještě jeden krok – renderování.
U JavaScriptových webů totiž probíhá tzv. dvoufázová indexace: Googlebot nejdřív stáhne HTML, ale obsah generovaný JavaScriptem zpracuje až ve druhé vlně, když má volnou renderovací kapacitu (rendering queue).
Mezi stažením a renderováním může vzniknout prodleva i několika dní.
Pokud má stránka pomalé nebo chybové JS, může se stát, že se v rámci časového rozpočtu renderování nedokončí a důležitý obsah se vůbec nezaindexuje.
💬 U jednoho e-shopu postaveného na Reactu jsme se divili, proč Google indexuje prázdné kategorie. Ukázalo se, že produkty se „donačítaly“ JavaScriptem a Googlebot je při renderování nestihl. Řešení bylo serverové vykreslování – a indexace naskočila během dvou týdnů.
Jak se stránky dostávají do indexu?
Po stažení a zpracování obsahu vyhledávač rozhoduje, jestli stránku zařadí do indexu. Není to automatické – Google i Seznam indexují jen část toho, co procrawlují.
Co rozhoduje o zařazení do indexu?
O zařazení do indexu rozhoduje hlavně kvalita a unikátnost obsahu, technická dostupnost stránky (správný HTTP stavový kód 200, žádná blokace) a absence direktiv, které indexaci zakazují (noindex, canonical odkazující jinam).
Google dnes navíc indexuje primárně mobilní verzi webu – tzv. mobile-first indexing – takže pokud se vám obsah na mobilu nezobrazuje stejně jako na desktopu, indexuje se ta mobilní (často chudší) verze.
Proč se některé stránky neindexují?
Nejčastější důvody, proč stránka nekončí v indexu, se v Google Search Console projeví jako konkrétní stavy (Index Coverage states):
- Discovered – currently not indexed – Google o URL ví, ale zatím se rozhodl ji neprocrawlovat. Typicky problém crawl budgetu nebo nízké vnímané hodnoty stránky.
- Crawled – currently not indexed – Google stránku stáhl, ale nezařadil ji. Skoro vždy signál nízké kvality nebo i duplicity obsahu.
Právě tyto dva stavy jsou nejcennější diagnostický nástroj, který běžné články o crawlingu vynechávají. Říkají vám přesně, ve které fázi se proces zasekl.
📊 [STUDIE]: Podle dat Ahrefs (analýza přes miliardu stránek) až 96,55 % všech webových stránek nezíská z Googlu žádný organický traffic – častou příčinou je vedle absence odkazů právě to, že obsah buď není zaindexovaný, nebo nemá pro vyhledávač dostatečnou hodnotu.
Řízení crawlingu pomocí robots.txt a sitemapy
Crawling lze do velké míry „řídit“.
Dva základní nástroje jsou soubor robots.txt a XML sitemapa – a je důležité chápat, že každý dělá tak trochu něco jiného.
Jak napsat a nasadit robots.txt?
Robots.txt je textový soubor umístěný v kořeni domény (např. vase-domena.cz/robots.txt), který říká crawlerům, které části webu mají, nebo nemají procházet. Základní zápis vypadá takto:
Plaintext
User-agent: *
Disallow: /admin/
Disallow: /kosik/
Allow: /
Sitemap: https://vase-domena.cz/sitemap.xml
Důležité je zmínit, že pokud máte web na WP, Shoptet nebo další jakékoliv CMS řešení – na 90% se vám automaticky vytvoří robots.txt a soubor sitemap automaticky. Více obezřetný bych byl u těch systémů, které jsou řešené na míru – z mé praxe musím říci, že zde se setkávám s tím, že z 50% není jeden nebo druhý soubor nastaven správně.
Zásadní upozornění: robots.txt blokuje crawling, ale ne indexaci. Pokud na blokovanou URL vede dostatek (externích/interních) odkazů, Google ji může zaindexovat i bez procházení – jen se ve výsledcích zobrazí bez popisku. Chcete-li stránku skutečně držet mimo index, použijte tag noindex (viz dále), ne robots.txt.
Jak vytvořit a odeslat XML sitemapu?
XML sitemapa (sitemap.xml) je seznam URL, které chcete, aby vyhledávač znal a procházel. Pomáhá hlavně velkým webům a stránkám se slabým interním prolinkováním.

Značka (datum poslední úpravy) je důležitější, než se zdá – když ji udržujete pravdivou, pomáháte vyhledávači efektivně plánovat recrawl a nepřehlížet aktualizovaný obsah. Lživý lastmod (měněný automaticky při každém buildu webu bez reálné změny obsahu) naopak důvěru vyhledávače snižuje.
Sitemapu odešlete v Google Search Console (sekce Sitemaps) i v Seznam Webmaster. Doplňkově lze využít protokol IndexNow, který Seznam podporuje a kterým můžete změněné URL oznámit okamžitě – Seznam navíc informaci přepošle dalším zapojeným vyhledávačům (Bing, Yandex).

📊 [STUDIE]: Podle dokumentace Seznam.cz zaručuje funkce „Přidat URL do hledání“ v Seznam Webmaster zařazení až 500 URL denně se zpožděním v řádu minut, zatímco protokol IndexNow tímto denním limitem omezen není.
Optimalizace crawl budgetu
Crawl budget je počet URL, které je robot ochotný a schopný na vašem webu projít za daný čas.
Vzniká kombinací crawl rate limitu (kolik paralelních spojení robot otevře, aby nezahltil server) a crawl demand (jak moc Google vaše stránky chce procházet).
Důležitá realita = crawl budget reálně řeší jen „velké weby“. Podle Googlu je relevantní zhruba u webů nad 1 milion URL s častými změnami, nebo nad 10 000 URL měněných denně.
Weby pod tisíc URL se s tímto limitem prakticky nikdy nepotkají….
Pokud do téhle kategorie velkých webů spadáte, šetřete rozpočet takto:
- Blokujte nebo odstraňte nepodstatné URL (filtry, řazení, interní vyhledávání).
- Opravujte chyby 404 a soft 404 (viz dále).
- Zrychlete server – rychlejší odezva (hosting) = víc procrawlovaných stránek za stejný čas.
- Pozor na faceted navigation (filtrované URL v e-shopech), které generují tisíce zbytečných kombinací.
Řízení indexace pomocí meta tagů a canonicalu
Zatímco robots.txt řídí crawling, indexaci řídíte primárně přes meta tag robots a tag canonical přímo v kódu konkrétní stránky.
noindex a nofollow – kdy a jak použít?
Meta tag robots umístěný v hlavičce stránky řídí, jak s ní vyhledávač naloží:
HTML
<meta name=“robots“ content=“noindex, follow“>
- noindex – řekne vyhledávači, aby stránku nezařazoval do indexu (ideální pro děkovací stránky, filtrované výpisy, interní vyhledávání).
- nofollow – řekne robotovi, aby nesledoval odkazy na této stránce.
Kombinace mají různý smysl = nastavení noindex, follow drží stránku mimo index, ale nechá protékat sílu odkazů (link equity) přes odkazy dál do webu – to je obvykle to, co chcete.
Nastavení noindex, nofollow stránku i odkazy zcela odřízne. Pro neHTML soubory (PDF, obrázky), kde meta tag nelze vložit, slouží HTTP hlavička X-Robots-Tag, kterou nastavíte přímo na serveru.
Pozor na častou chybu: noindex a blokace v robots.txt se vzájemně vylučují. Když stránku zablokujete v robots.txt, robot se k ní nedostane, takže neuvidí ani váš noindex – a stránka může v indexu paradoxně zůstat (pokud na ni vedou externí odkazy).
Canonical tag a řešení duplicitního obsahu
Duplicitní obsah – více URL se stejným nebo téměř shodným obsahem – brzdí indexaci, protože vyhledávač musí složitě rozhodovat, kterou verzi zařadit, a plýtvá tím crawl budget.
Řešením je canonical tag (kanonický tag), který určuje hlavní verzi URL, kterou má vyhledávač indexovat:
HTML
<link rel=“canonical“ href=“https://vase-domena.cz/produkt“>
Typický případ = produkt je dostupný pod více URL kvůli parametrům (např. ?barva=cervena, ?razeni=cena). Canonical směřující na čistou URL produktu vyhledávači řekne, že všechny varianty patří k jedné hlavní stránce, a ten provede deduplikaci obsahu – sjednotí všechny signály na kanonickou verzi.
💬 Canonical je nejčastěji špatně nasazený tag, který v praxi vídám. Buď ukazuje sám na sebe na každé variantě URL, nebo naopak všechny produkty kanonizují na homepage. Obojí dělá v indexaci obrovský nepořádek.
Časté technické chyby crawlingu a indexace
Většina problémů s crawlingem a indexací nevzniká kvůli chybě v algoritmu vyhledávače, ale kvůli technickým nedostatkům na webu, o kterých majitel často ani neví.
Chyby 404 a chybné stavové kódy
HTTP stavové kódy jsou způsob, jakým server crawlerovi sděluje stav stránky.
Nejproblematičtější jsou:
- HTTP stavový kód 404 (chyba 404) – stránka neexistuje. Občasné 404 jsou normální, ale velké množství chyb 404 z interních odkazů signalizuje zanedbaný web a roboty zbytečně zdržuje.
- Soft 404 – zákeřnější případ = stránka vrací kód 200 (OK), ale fakticky je prázdná nebo hlásí text „nenalezeno“. Crawler ji považuje za platnou, plýtvá na ni rozpočtem a může ji omylem indexovat jako plnohodnotný obsah.
Pro trvale odstraněný obsah používejte stavový kód 410 (Gone) – Google takovou stránku vyřadí z indexu rychleji než u kódu 404 a neplýtvá na ni dalším rozpočtem.
Moje rada: Pokud si nejste jistý nebo nerozumíte dané implementaci co můžou jednotlivé stavové kódy „způsobit“ a jak je správně nastavit, nepouštějte se do jejich implementace.
Špatné interní prolinkování a osiřelé stránky
Interní prolinkování je hlavní cesta, jak robot objevuje stránky a chápe jejich důležitost.
Osiřelé stránky (orphan pages) – URL, na které nevede žádný interní odkaz z celého webu – robot často vůbec nenajde, i když jsou uvedené v sitemapě – tento problém se nejčastěji stává u „obrovských webů“, které nemají správně řešenou navigaci v menu.
Zároveň se na webu může nechtěně vytvořit crawl trap (past na robota): nekonečné smyčky URL generované kalendáři, filtry nebo session ID, ve kterých robot zbytečně tone a vyčerpává svůj rozpočet.
💬 Nejlevnější SEO win, jaký znám, je dobré interní prolinkování. U klientů opakovaně vidím, že nejdůležitější stránky jsou zapadlé pět úrovní hluboko, zatímco bezvýznamné filtry mají desítky odkazů z hlavního menu. Stačí to obrátit a začít budovat systematické interní prolinkování.
Jak ověřit a monitorovat crawling a indexaci?
Diagnostika je polovina úspěchu. Naštěstí existují nástroje, které vám přesně ukážou, jak vyhledávač s vaším webem zachází.
Kontrola v Google Search Console a URL Inspection Tool
Google Search Console je primární a zdarma dostupný nástroj pro sledování indexace na Googlu. V sekci Stránky (Index Coverage) vidíte, kolik URL je zaindexovaných a proč ostatní ne (včetně zmíněných stavů Discovered / Crawled – currently not indexed).

URL Inspection Tool (Kontrola URL) vám pro konkrétní adresu ukáže, zda je v indexu, kdy ji Google naposledy procrawloval, a umožní vám ručně požádat o její opětovné zaindexování.
Pro automatické zpracování velkých objemů stránek (např. pracovní nabídky, livestreamy) existuje také Google Indexing API, kterým lze o (de)indexaci žádat programově.

Seznam Webmaster pro český trh
Seznam Webmaster je „obdoba“ Search Console pro Seznam.cz. Umožní vám odeslat sitemapu, sledovat, jak Seznambot web prochází, a přes funkci „Přidat URL do hledání“ (s limitem 500 URL/den) rychle zařadit nové stránky.
Pro český trh je to nástroj, který by žádný web cílící na Seznam neměl vynechat.
Operátor site: a audit přes Screaming Frog
Rychlý orientační test indexace nabízí vyhledávací operátor site:.
Zadáním site:vase-domena.cz do Googlu nebo Seznamu zhruba zjistíte, kolik stránek mají vyhledávače aktuálně v indexu (číslo je však pouze odhad, nikoliv přesný počet).
Pro hloubkový audit slouží Screaming Frog – desktopový crawler, který projde celý váš web přesně jako robot vyhledávače a odhalí nefunkční stránky (404), chybné canonicaly, noindex tagy, osiřelé stránky i nesprávná přesměrování.
Nejpřesnější obrázek o reálném chování robotů pak dává analýza logů (log file analysis) – rozbor serverových logů, ve kterých je doslova zaznamenané každé jednotlivé navštívení Googlebotem či Seznambotem.
Analýza access logů je u některých webů taková vyšší dívčí (vlastní zkušenost) a není lehké je analyzovat a ve většině případů je těžké je především získat. Některé hostingu či CMS systémy vám je ani nevygenerují.
Shrnutí a další kroky…
Crawling a indexace jsou dvě brány, kterými musí každá stránka projít, než vůbec začne soutěžit o pozice.
Crawling lze řídit přes robots.txt a sitemapu, indexaci přes noindex a canonical, a oba procesy spolehlivě diagnostikovat v Google Search Console a Seznam Webmaster.
Klíčové je rozlišovat, ve které fázi problém vzniká – jestli se robot na stránku vůbec nedostal, nebo ji stáhl a odmítl zařadit.
Pro většinu webů platí jednoduché pravidlo = udržujte čistou strukturu webu, aktuální sitemapu, opravujte chyby 404, hlídejte canonical a duplicity – a crawling i indexace poběží samy. Teprve u velkých webů přichází na řadu jemné ladění crawl budgetu, renderování JavaScriptu a detailní práce s logy.
Nejčastější otázky (FAQ)
Jak rychle Google zaindexuje novou stránku?
Od několika hodin po několik týdnů. Zrychlit to lze kvalitním interním prolinkováním, odesláním přes URL Inspection Tool v Search Console a u Seznamu přes protokol IndexNow nebo funkci „Přidat URL do hledání“.
Jaký je rozdíl mezi robots.txt a noindex?
Robots.txt blokuje crawling (robot na stránku vůbec nevstoupí), noindex blokuje indexaci (robot na stránku vstoupí, ale nezařadí ji do výsledků). Pro skutečné držení stránek mimo index používejte noindex, ne robots.txt.
Proč je moje stránka „Crawled – currently not indexed“ (procházeno – momentálně neindexováno)?
Google stránku úspěšně stáhl, ale rozhodl se ji nezařadit do výsledků – typicky kvůli její nízké kvalitě, malému množství textu nebo duplicitnímu obsahu. Řešením je zlepšit unikátní hodnotu stránky pro uživatele, nikoliv technické nastavení.
Musím řešit crawl budget?
U webů do několika tisíc URL prakticky ne – Google má dostatek kapacity a takový web projde bez potíží celý. Relevantní je to až u projektů nad statisíce až miliony URL nebo u webů s extrémně častou denní aktualizací obsahu.
Funguje crawling a indexace na Seznamu jinak než na Googlu?
Základní princip je stejný, ale Seznambot má menší celkovou kapacitu, respektuje direktivu crawl-delay a využívá vlastní specifické nástroje (Seznam Webmaster, IndexNow). Pro český trh je vždy vhodné optimalizovat a kontrolovat stav pro oba vyhledávače.
Nevíte si s něčím rady? Zeptej se mě.
Pravidelně píšu Blog a novinky ze světa seo, sdílím své know how a pro ty, kteří nerozumí tolik výrazům spojené se SEO, jsem vytvořil slovník pojmů.
Článek byl publikován: 21.6.2026. Autor článku: Jan Schlemmer.
- Interní prolinkování: návod, jak z něj vytěžit maximum - 28 července, 2026
- Drobečková navigace - 23 července, 2026
- Německo klasifikovalo AI Overviews jako mediální obsah – Co to znamená pro SEO? - 23 července, 2026