Crawling a indexace: Komplexní průvodce v roce 2026
Crawling a indexace jsou dva oddělené procesy, na kterých stojí celé SEO = nejdřív robot vyhledávače stránku objeví a stáhne (crawling), pak vyhledávač její obsah zpracuje a uloží do svého indexu (indexace). Teprve zaindexovaná stránka se může zobrazit ve výsledcích vyhledávání. Pokud kterýkoli z těchto kroků selže, vaše stránka pro Google ani Seznam prakticky neexistuje – bez ohledu na to, jak kvalitní obsah na ní je.
V tomto článku si vysvětlíme, jak crawling a indexace fungují u Googlu i Seznamu, jak je řídit přes robots.txt, sitemap.xml, canonical a meta tagy, jak diagnostikovat nejčastější chyby a jak vše ověřit v Google Search Console i Seznam Webmaster.
Co je crawling a indexace a proč na nich záleží v SEO?
Crawling (procházení) je proces, při kterém robot vyhledávače systematicky navštěvuje URL adresy, čte jejich obsah a sleduje odkazy na další stránky.
Indexace je následný krok – vyhledávač zpracuje stažený obsah a uloží ho do indexu vyhledávače, tedy obrovské databáze, ze které se sestavují výsledky vyhledávání.
Pro SEO jsou oba procesy technickým základem všeho ostatního. Můžete mít nejlepší obsah na trhu, ale když ho crawler nenajde nebo když ho vyhledávač odmítne zařadit do indexu, nezískáte žádnou pozici ani návštěvnost z dané URL.

Rozdíl mezi crawlingem a indexací
Klíčové je pochopit, že crawling ≠ (není) indexace. Stránka může být procrawlovaná, ale nezaindexovaná – vyhledávač ji navštívil, ale rozhodl se ji do indexu nezařadit (např. kvůli nízké kvalitě nebo duplicitě).
A naopak = stránka může být zaindexovaná i bez čerstvého crawlu, pokud o ní vyhledávač už ví z dřívějška.
Tohle rozlišení je víc než akademické – určuje, kde hledat problém. Jiná je situace, kdy se robot na stránku vůbec nedostal, a úplně jiná, kdy se na ni dostal ale nezařadil ji.
💬 Tohle je první otázka, kterou si u klienta kladu, když jeho stránka není ve vyhledávači: nedostal se tam robot, nebo se tam dostal a stránku odmítl? Bez téhle odpovědi člověk jen střílí naslepo a opravuje věci, které s problémem nesouvisí.
Jak crawling a indexace ovlivňují pozice ve vyhledávání?
Crawling a indexace samy o sobě nejsou hodnoticí (ranking) faktor – nezvyšují vám pozice v organice.
Jsou ale vstupní branou: bez zaindexování se o pozici vůbec nesoutěží. Proto je technické SEO zaměřené na crawling a indexaci předpokladem, ne luxusem.
U malých webů (do tisíce URL) bývá vše bezproblémové = u velkých e-shopů a zpravodajských webů se z toho stává každodenní bitva o to, aby se ty správné stránky dostaly do indexu včas.
Jak funguje crawler vyhledávače?
Crawler (také vyhledávací robot nebo robot vyhledávače) je program, který automaticky prochází web.
Postupuje od známých URL po interních odkazech na další stránky a stahuje jejich obsah pro další zpracování.
Důležité je vědět, že každý velký vyhledávač má vlastního crawlera (a funguje každý trochu jinak).
Googlebot vs. Seznambot
Googlebot je crawler Googlu – celosvětově nejaktivnější robot, který prochází většinu webu a řídí se sofistikovanými algoritmy priority.
Seznambot je jeho český protějšek od Seznam.cz.
Oba fungují na stejném principu, ale liší se v detailech: Seznambot má menší kapacitu, prochází český web méně agresivně a respektuje některé direktivy (např. crawl-delay), které Googlebot ignoruje.
Pro klasické SEO na českém trhu to znamená, že byste měli sledovat chování obou robotů – Google přes Google Search Console, Seznam přes Seznam Webmaster.
Cesta robota od objevení URL po stažení obsahu
Robot se k vaší stránce dostane jednou ze tří cest: po interním nebo externím odkazu, z odeslané XML sitemapy, nebo přes notifikaci (např. protokol IndexNow).
Po objevení URL ji zařadí do fronty, později ji stáhne a u moderních webů následuje ještě jeden krok – renderování.
U JavaScriptových webů totiž probíhá tzv. dvoufázová indexace: Googlebot nejdřív stáhne HTML, ale obsah generovaný JavaScriptem zpracuje až ve druhé vlně, když má volnou renderovací kapacitu (rendering queue).
Mezi stažením a renderováním může vzniknout prodleva i několika dní.
Pokud má stránka pomalé nebo chybové JS, může se stát, že se v rámci časového rozpočtu renderování nedokončí a důležitý obsah se vůbec nezaindexuje.
💬 U jednoho e-shopu postaveného na Reactu jsme se divili, proč Google indexuje prázdné kategorie. Ukázalo se, že produkty se „donačítaly“ JavaScriptem a Googlebot je při renderování nestihl. Řešení bylo serverové vykreslování – a indexace naskočila během dvou týdnů.
Jak se stránky dostávají do indexu?
Po stažení a zpracování obsahu vyhledávač rozhoduje, jestli stránku zařadí do indexu. Není to automatické – Google i Seznam indexují jen část toho, co procrawlují.
Co rozhoduje o zařazení do indexu?
O zařazení do indexu rozhoduje hlavně kvalita a unikátnost obsahu, technická dostupnost stránky (správný HTTP stavový kód 200, žádná blokace) a absence direktiv, které indexaci zakazují (noindex, canonical odkazující jinam).
Google dnes navíc indexuje primárně mobilní verzi webu – tzv. mobile-first indexing – takže pokud se vám obsah na mobilu nezobrazuje stejně jako na desktopu, indexuje se ta mobilní (často chudší) verze.
Proč se některé stránky neindexují?
Nejčastější důvody, proč stránka nekončí v indexu, se v Google Search Console projeví jako konkrétní stavy (Index Coverage states):
- Discovered – currently not indexed – Google o URL ví, ale zatím se rozhodl ji neprocrawlovat. Typicky problém crawl budgetu nebo nízké vnímané hodnoty stránky.
- Crawled – currently not indexed – Google stránku stáhl, ale nezařadil ji. Skoro vždy signál nízké kvality nebo i duplicity obsahu.
Právě tyto dva stavy jsou nejcennější diagnostický nástroj, který běžné články o crawlingu vynechávají. Říkají vám přesně, ve které fázi se proces zasekl.
📊 [STUDIE]: Podle dat Ahrefs (analýza přes miliardu stránek) až 96,55 % všech webových stránek nezíská z Googlu žádný organický traffic – častou příčinou je vedle absence odkazů právě to, že obsah buď není zaindexovaný, nebo nemá pro vyhledávač dostatečnou hodnotu.
Jak konkrétně opravit „Discovered – currently not indexed“?
Tenhle stav výše popisuju jako situaci, kdy Google o URL ví, ale zatím se nerozhodl ji procrawlovat – obvykle kvůli crawl budgetu nebo nízké vnímané hodnotě.
Na rozdíl od stavu „Crawled – currently not indexed“ tady nejde primárně o kvalitu obsahu (Google ho ještě ani nestáhl), ale o prioritizaci.
Konkrétní postup, jak se s tímhle stavem vypořádat:
- Posilte interní prolinkování na dané URL – pokud stránka nemá dostatek interních odkazů, signalizujete Googlu nízkou důležitost. Přidejte odkazy z relevantních kategorií nebo souvisejících článků.
- Zkontrolujte, jestli stránka není „zahrabaná“ hluboko ve struktuře – URL dostupná až po pěti kliknutích z homepage dostává v prioritizaci menší váhu než URL o dva kliky blíž.
- Ověřte technickou rychlost webu – pomalá odezva serveru snižuje crawl rate limit, takže Google má na „objevené, ale zatím neprocrawlované“ URL menší kapacitu.
- Nepoužívejte URL Inspection Tool jako plošné řešení – ruční žádost o crawlování funguje pro jednotky URL, ne pro stovky. U velkého množství stránek v tomhle stavu je potřeba řešit systémovou příčinu (prolinkování, budget), ne je odesílat jednu po druhé.
- Dejte tomu čas – u nových webů bez zavedené autority je tenhle stav u části URL normální i po vyřešení výše uvedeného. Google prioritizuje podle důvěryhodnosti webu jako celku, ne jen jednotlivé stránky.
Pokud stav přetrvává dlouhodobě u klíčových stránek i po těchto krocích, je to obvykle signál, že web jako celek ještě nemá dostatečnou autoritu na to, aby Google investoval crawl kapacitu rovnoměrně napříč celým jeho obsahem.
Řízení crawlingu pomocí robots.txt a sitemapy
Crawling lze do velké míry „řídit“.
Dva základní nástroje jsou soubor robots.txt a XML sitemapa – a je důležité chápat, že každý dělá tak trochu něco jiného.
Jak napsat a nasadit robots.txt?
Robots.txt je textový soubor umístěný v kořeni domény (např. vase-domena.cz/robots.txt), který říká crawlerům, které části webu mají, nebo nemají procházet. Základní zápis vypadá takto:
Plaintext
User-agent: *
Disallow: /admin/
Disallow: /kosik/
Allow: /
Sitemap: https://vase-domena.cz/sitemap.xml
Důležité je zmínit, že pokud máte web na WP, Shoptet nebo další jakékoliv CMS řešení – na 90% se vám automaticky vytvoří robots.txt a soubor sitemap automaticky. Více obezřetný bych byl u těch systémů, které jsou řešené na míru – z mé praxe musím říci, že zde se setkávám s tím, že z 50% není jeden nebo druhý soubor nastaven správně.
Zásadní upozornění: robots.txt blokuje crawling, ale ne indexaci. Pokud na blokovanou URL vede dostatek (externích/interních) odkazů, Google ji může zaindexovat i bez procházení – jen se ve výsledcích zobrazí bez popisku. Chcete-li stránku skutečně držet mimo index, použijte tag noindex (viz dále), ne robots.txt.
AI crawlery a robots.txt – samostatná kategorie pravidel
Vedle Googlebota a Seznambota, o kterých mluvím výše, dnes musíte v robots.txt počítat ještě s další kategorií crawlerů – roboty AI systémů, které sbírají data pro trénování modelů nebo pro odpovídání v reálném čase.
Nejběžnější jsou GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot a Google-Extended (samostatný crawler Googlu pro AI trénování, oddělený od klasického Googlebota).
Tyhle crawlery se řídí stejným standardem robots.txt jako klasické vyhledávače, ale mají vlastní user-agenty, takže obecné pravidlo User-agent: * je ovlivní stejně jako Googlebota – pokud je chcete řešit odděleně, potřebujete samostatné bloky:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Googlebot
Disallow: /interni-vyhledavani/
Praktický důsledek – celá řada webů má tyhle crawlery zablokované, aniž by o tom majitel webu věděl, typicky jako pozůstatek defaultní konfigurace nebo bezpečnostního pluginu, který blokuje „neznámé“ boty plošně.
Pokud vám záleží na viditelnosti v AI vyhledávačích (ChatGPT, Perplexity, Google AI Overviews), zkontrolujte robots.txt samostatně i z tohohle úhlu – blokace klasických vyhledávačů a blokace AI crawlerů jsou dvě oddělené věci, které se snadno spletou.
Jak vytvořit a odeslat XML sitemapu?
XML sitemapa (sitemap.xml) je seznam URL, které chcete, aby vyhledávač znal a procházel. Pomáhá hlavně velkým webům a stránkám se slabým interním prolinkováním.

Značka (datum poslední úpravy) je důležitější, než se zdá – když ji udržujete pravdivou, pomáháte vyhledávači efektivně plánovat recrawl a nepřehlížet aktualizovaný obsah. Lživý lastmod (měněný automaticky při každém buildu webu bez reálné změny obsahu) naopak důvěru vyhledávače snižuje.
Sitemapu odešlete v Google Search Console (sekce Sitemaps) i v Seznam Webmaster. Doplňkově lze využít protokol IndexNow, který Seznam podporuje a kterým můžete změněné URL oznámit okamžitě – Seznam navíc informaci přepošle dalším zapojeným vyhledávačům (Bing, Yandex).

📊 [STUDIE]: Podle dokumentace Seznam.cz zaručuje funkce „Přidat URL do hledání“ v Seznam Webmaster zařazení až 500 URL denně se zpožděním v řádu minut, zatímco protokol IndexNow tímto denním limitem omezen není.
Optimalizace crawl budgetu
Crawl budget je počet URL, které je robot ochotný a schopný na vašem webu projít za daný čas.
Vzniká kombinací crawl rate limitu (kolik paralelních spojení robot otevře, aby nezahltil server) a crawl demand (jak moc Google vaše stránky chce procházet).
Důležitá realita = crawl budget reálně řeší jen „velké weby“. Podle Googlu je relevantní zhruba u webů nad 1 milion URL s častými změnami, nebo nad 10 000 URL měněných denně.
Weby pod tisíc URL se s tímto limitem prakticky nikdy nepotkají….
Pokud do téhle kategorie velkých webů spadáte, šetřete rozpočet takto:
- Blokujte nebo odstraňte nepodstatné URL (filtry, řazení, interní vyhledávání).
- Opravujte chyby 404 a soft 404 (viz dále).
- Zrychlete server – rychlejší odezva (hosting) = víc procrawlovaných stránek za stejný čas.
- Pozor na faceted navigation (filtrované URL v e-shopech), které generují tisíce zbytečných kombinací.
Řízení indexace pomocí meta tagů a canonicalu
Zatímco robots.txt řídí crawling, indexaci řídíte primárně přes meta tag robots a tag canonical přímo v kódu konkrétní stránky.
Noindex a nofollow – kdy a jak použít?
Meta tag robots umístěný v hlavičce stránky řídí, jak s ní vyhledávač naloží:
HTML
<meta name=“robots“ content=“noindex, follow“>
- noindex – řekne vyhledávači, aby stránku nezařazoval do indexu (ideální pro děkovací stránky, filtrované výpisy, interní vyhledávání).
- nofollow – řekne robotovi, aby nesledoval odkazy na této stránce.
Kombinace mají různý smysl = nastavení noindex, follow drží stránku mimo index, ale nechá protékat sílu odkazů (link equity) přes odkazy dál do webu – to je obvykle to, co chcete.
Nastavení noindex, nofollow stránku i odkazy zcela odřízne. Pro neHTML soubory (PDF, obrázky), kde meta tag nelze vložit, slouží HTTP hlavička X-Robots-Tag, kterou nastavíte přímo na serveru.
Pozor na častou chybu: noindex a blokace v robots.txt se vzájemně vylučují. Když stránku zablokujete v robots.txt, robot se k ní nedostane, takže neuvidí ani váš noindex – a stránka může v indexu paradoxně zůstat (pokud na ni vedou externí odkazy).
Meta noindex vs. X-Robots-Tag – liší se rychlost zpracování?
X-Robots-Tag zmiňuji výše jako řešení pro neHTML soubory, kde meta tag vložit nejde (PDF, obrázky) – stojí za doplnění, že se dá použít i pro běžné HTML stránky, ne jen jako náhrada v případech, kdy meta tag technicky nejde vložit.
Rozdíl je v tom, kde se direktiva nachází. Meta tag robots je součástí HTML kódu stránky, takže ho Google zaregistruje až ve chvíli, kdy stránku skutečně stáhne a zpracuje.
X-Robots-Tag je součástí HTTP hlavičky, kterou server posílá ještě před samotným obsahem stránky – Google ho tak může zaznamenat i bez nutnosti parsovat celé HTML.
V praxi to znamená mírnou výhodu spolehlivosti u X-Robots-Tag, hlavně u webů s problematickým nebo pomalým renderováním (typicky JS weby zmíněné výše) – hlavička dorazí spolehlivě bez ohledu na to, jak dlouho trvá zpracování zbytku stránky.
Pro běžné weby na klasickém HTML je rozdíl v praxi zanedbatelný a meta tag je jednodušší na implementaci přes standardní SEO pluginy.
Canonical tag a řešení duplicitního obsahu
Duplicitní obsah – více URL se stejným nebo téměř shodným obsahem – brzdí indexaci, protože vyhledávač musí složitě rozhodovat, kterou verzi zařadit, a plýtvá tím crawl budget.
Řešením je canonical tag (kanonický tag), který určuje hlavní verzi URL, kterou má vyhledávač indexovat:
HTML
<link rel=“canonical“ href=“https://vase-domena.cz/produkt“>
Typický případ = produkt je dostupný pod více URL kvůli parametrům (např. ?barva=cervena, ?razeni=cena). Canonical směřující na čistou URL produktu vyhledávači řekne, že všechny varianty patří k jedné hlavní stránce, a ten provede deduplikaci obsahu – sjednotí všechny signály na kanonickou verzi.
💬 Canonical je nejčastěji špatně nasazený tag, který v praxi vídám. Buď ukazuje sám na sebe na každé variantě URL, nebo naopak všechny produkty kanonizují na homepage. Obojí dělá v indexaci obrovský nepořádek.
Hreflang a indexace mezinárodních verzí
U webů s víc jazykovými verzemi vstupuje do crawlingu a indexace ještě jeden prvek – hreflang tag, který propojuje jednotlivé jazykové mutace stejné stránky.
Na rozdíl od canonicalu hreflang neurčuje, kterou verzi indexovat místo jiné – naopak Googlu říká, že jde o legitimně odlišné verze pro různé jazyky nebo regiony, a všechny by měly zůstat v indexu současně.
Klíčové pravidlo, které se dobře doplňuje s tím, co popisuju u canonicalu výše – každá jazyková verze musí mít vlastní self-referencing canonical, nikdy canonical na jinou jazykovou mutaci.
Propojení mezi verzemi řeší výhradně hreflang, ne canonical.
Nejčastější technická chyba, která crawling a indexaci mezinárodních verzí kazí, je nekonzistence – hreflang tag na české verzi odkazuje na anglickou URL, ale anglická verze zpětně neodkazuje na tu českou (chybí tzv. return tag).
Google v takovém případě hreflang signál často ignoruje jako nespolehlivý, a s jazykovými verzemi pak nakládá jako s běžným duplicitním obsahem, ne jako se záměrně odlišenými regionálními variantami.
Ověřit správnost hreflang implementace jde nejspolehlivěji přes crawl ve Screaming Frogu, který nekonzistentní nebo chybějící return tagy přehledně odhalí.
Stránkování a indexace – aktuální doporučený přístup
Stránkování (URL typu /blog/page/2, /kategorie/strana-3) je klasický zdroj duplicitního obsahu i zbytečné spotřeby crawl budgetu, pokud se neřeší správně.
Google dnes doporučuje jednoduchý přístup – každá stránka výpisu (page/1, page/2, page/3…) by měla mít self-referencing canonical, tedy ukazovat sama na sebe, ne hromadně na první stránku výpisu.
Starší tagy rel=“prev“ a rel=“next“, které se dřív používaly k signalizaci posloupnosti stránek, Google už řadu let nepoužívá – jejich přítomnost v kódu dnes nemá žádný efekt.
Prakticky to znamená, že pokud chcete, aby Google indexoval jednotlivé stránkované URL samostatně (typicky u blogu, kde každá stránka výpisu vede na jiné články), nechte canonical self-referenční.
Pokud vám jde jen o to, aby se do indexu dostala hlavní přehledová stránka a zbytek byl brán jako technická nutnost, můžete zvážit noindex na stránkách 2 a dál – ale pozor, tenhle přístup zároveň sníží šanci, že se starší, hlouběji stránkované položky vůbec dostanou do indexu, protože noindex stránky časem přestávají být crawlovány stejně pravidelně.
Časté technické chyby crawlingu a indexace
Většina problémů s crawlingem a indexací nevzniká kvůli chybě v algoritmu vyhledávače, ale kvůli technickým nedostatkům na webu, o kterých majitel často ani neví.
Chyby 404 a chybné stavové kódy
HTTP stavové kódy jsou způsob, jakým server crawlerovi sděluje stav stránky.
Nejproblematičtější jsou:
- HTTP stavový kód 404 (chyba 404) – stránka neexistuje. Občasné 404 jsou normální, ale velké množství chyb 404 z interních odkazů signalizuje zanedbaný web a roboty zbytečně zdržuje.
- Soft 404 – zákeřnější případ = stránka vrací kód 200 (OK), ale fakticky je prázdná nebo hlásí text „nenalezeno“. Crawler ji považuje za platnou, plýtvá na ni rozpočtem a může ji omylem indexovat jako plnohodnotný obsah.
Pro trvale odstraněný obsah používejte stavový kód 410 (Gone) – Google takovou stránku vyřadí z indexu rychleji než u kódu 404 a neplýtvá na ni dalším rozpočtem.
Moje rada: Pokud si nejste jistý nebo nerozumíte dané implementaci co můžou jednotlivé stavové kódy „způsobit“ a jak je správně nastavit, nepouštějte se do jejich implementace.
Špatné interní prolinkování a osiřelé stránky
Interní prolinkování je hlavní cesta, jak robot objevuje stránky a chápe jejich důležitost.
Osiřelé stránky (orphan pages) – URL, na které nevede žádný interní odkaz z celého webu – robot často vůbec nenajde, i když jsou uvedené v sitemapě – tento problém se nejčastěji stává u „obrovských webů“, které nemají správně řešenou navigaci v menu.
Zároveň se na webu může nechtěně vytvořit crawl trap (past na robota): nekonečné smyčky URL generované kalendáři, filtry nebo session ID, ve kterých robot zbytečně tone a vyčerpává svůj rozpočet.
💬 Nejlevnější SEO win, jaký znám, je dobré interní prolinkování. U klientů opakovaně vidím, že nejdůležitější stránky jsou zapadlé pět úrovní hluboko, zatímco bezvýznamné filtry mají desítky odkazů z hlavního menu. Stačí to obrátit a začít budovat systematické interní prolinkování.
Jak ověřit a monitorovat crawling a indexaci?
Diagnostika je polovina úspěchu. Naštěstí existují nástroje, které vám přesně ukážou, jak vyhledávač s vaším webem zachází.
Kontrola v Google Search Console a URL Inspection Tool
Google Search Console je primární a zdarma dostupný nástroj pro sledování indexace na Googlu. V sekci Stránky (Index Coverage) vidíte, kolik URL je zaindexovaných a proč ostatní ne (včetně zmíněných stavů Discovered / Crawled – currently not indexed).

URL Inspection Tool (Kontrola URL) vám pro konkrétní adresu ukáže, zda je v indexu, kdy ji Google naposledy procrawloval, a umožní vám ručně požádat o její opětovné zaindexování.
Pro automatické zpracování velkých objemů stránek (např. pracovní nabídky, livestreamy) existuje také Google Indexing API, kterým lze o (de)indexaci žádat programově.

Crawl Stats report – přehled crawlování přímo od Googlu
Vedle Index Coverage a URL Inspection Tool má Google Search Console ještě jeden report, který se k tématu crawl budgetu váže přímo – Statistiky procházení (Crawl Stats), dostupné v Nastavení webu.
Tenhle report ukazuje konkrétní data o tom, jak Googlebot váš web reálně prochází:
- Celkový počet požadavků za posledních 90 dní – trend, jestli crawlování roste, klesá nebo stagnuje.
- Průměrnou dobu odezvy serveru – přímo souvisí s crawl rate limitem popsaným výše. Rostoucí response time bývá první signál, že server přestává crawlování zvládat.
- Rozdělení podle typu souboru a účelu – kolik požadavků směřuje na HTML stránky, kolik na obrázky, JS, CSS, a jestli jde o objevování nového obsahu nebo obnovování starého.
- Stavové kódy odpovědí – přehled, kolik požadavků skončilo 200, kolik 404, kolik přesměrováním.
Pro diagnostiku crawl budgetu je tenhle report přesnější než odhady z jiných zdrojů, protože jde o data přímo od Googlu, ne o odvozené metriky. Pokud řešíte, jestli je crawl budget u vašeho webu problém, je tohle první místo ke kontrole, ještě před sáhnutím po analýze access logů.
Seznam Webmaster pro český trh
Seznam Webmaster je „obdoba“ Search Console pro Seznam.cz. Umožní vám odeslat sitemapu, sledovat, jak Seznambot web prochází, a přes funkci „Přidat URL do hledání“ (s limitem 500 URL/den) rychle zařadit nové stránky.
Pro český trh je to nástroj, který by žádný web cílící na Seznam neměl vynechat.
Operátor site: a audit přes Screaming Frog
Rychlý orientační test indexace nabízí vyhledávací operátor site:.
Zadáním site:vase-domena.cz do Googlu nebo Seznamu zhruba zjistíte, kolik stránek mají vyhledávače aktuálně v indexu (číslo je však pouze odhad, nikoliv přesný počet).
Pro hloubkový audit slouží Screaming Frog – desktopový crawler, který projde celý váš web přesně jako robot vyhledávače a odhalí nefunkční stránky (404), chybné canonicaly, noindex tagy, osiřelé stránky i nesprávná přesměrování.
Nejpřesnější obrázek o reálném chování robotů pak dává analýza logů (log file analysis) – rozbor serverových logů, ve kterých je doslova zaznamenané každé jednotlivé navštívení Googlebotem či Seznambotem.
Analýza access logů je u některých webů taková vyšší dívčí (vlastní zkušenost) a není lehké je analyzovat a ve většině případů je těžké je především získat. Některé hostingu či CMS systémy vám je ani nevygenerují.
Shrnutí a další kroky…
Crawling a indexace jsou dvě brány, kterými musí každá stránka projít, než vůbec začne soutěžit o pozice.
Crawling lze řídit přes robots.txt a sitemapu, indexaci přes noindex a canonical, a oba procesy spolehlivě diagnostikovat v Google Search Console a Seznam Webmaster.
Klíčové je rozlišovat, ve které fázi problém vzniká – jestli se robot na stránku vůbec nedostal, nebo ji stáhl a odmítl zařadit.
Pro většinu webů platí jednoduché pravidlo = udržujte čistou strukturu webu, aktuální sitemapu, opravujte chyby 404, hlídejte canonical a duplicity – a crawling i indexace poběží samy. Teprve u velkých webů přichází na řadu jemné ladění crawl budgetu, renderování JavaScriptu a detailní práce s logy.
Nejčastější otázky (FAQ)
1) Jak rychle Google zaindexuje novou stránku?
Od několika hodin po několik týdnů. Zrychlit to lze kvalitním interním prolinkováním, odesláním přes URL Inspection Tool v Search Console a u Seznamu přes protokol IndexNow nebo funkci „Přidat URL do hledání“.
2) Jaký je rozdíl mezi robots.txt a noindex?
Robots.txt blokuje crawling (robot na stránku vůbec nevstoupí), noindex blokuje indexaci (robot na stránku vstoupí, ale nezařadí ji do výsledků). Pro skutečné držení stránek mimo index používejte noindex, ne robots.txt.
3) Proč je moje stránka „Crawled – currently not indexed“ (procházeno – momentálně neindexováno)?
Google stránku úspěšně stáhl, ale rozhodl se ji nezařadit do výsledků – typicky kvůli její nízké kvalitě, malému množství textu nebo duplicitnímu obsahu. Řešením je zlepšit unikátní hodnotu stránky pro uživatele, nikoliv technické nastavení.
4) Musím řešit crawl budget?
U webů do několika tisíc URL prakticky ne – Google má dostatek kapacity a takový web projde bez potíží celý. Relevantní je to až u projektů nad statisíce až miliony URL nebo u webů s extrémně častou denní aktualizací obsahu.
5) Funguje crawling a indexace na Seznamu jinak než na Googlu?
Základní princip je stejný, ale Seznambot má menší celkovou kapacitu, respektuje direktivu crawl-delay a využívá vlastní specifické nástroje (Seznam Webmaster, IndexNow). Pro český trh je vždy vhodné optimalizovat a kontrolovat stav pro oba vyhledávače.
Nevíte si s něčím rady? Zeptej se mě.
Pravidelně píšu Blog a novinky ze světa seo, sdílím své know how a pro ty, kteří nerozumí tolik výrazům spojené se SEO, jsem vytvořil slovník pojmů.
Článek byl publikován: 21.6.2026. Autor článku: Jan Schlemmer.
- llms.txt a SEO: Proč Google tenhle soubor ignoruje (a kdy má přesto smysl)? - 4 srpna, 2026
- Interní prolinkování: návod, jak z něj vytěžit maximum - 28 července, 2026
- Drobečková navigace - 23 července, 2026