Pokud váš web blokuje AI roboty, můžete v odpovědích ChatGPT, Claude nebo Perplexity zmizet. A často o tom ani nevíte. Blokace totiž vzniká na několika místech najednou: v robots.txt, ve firewallu, na CDN nebo v hostingu. Tento návod vás provede kontrolou krok za krokem. Zvládnete ji sami, bez programování.
TL;DR V osmi krocích ověříte, jestli se AI roboti (GPTBot, ClaudeBot, PerplexityBot) skutečně dostanou k vašemu obsahu. Řešit to má smysl: zablokovaný vyhledávací crawler znamená, že zmizíte z AI citací. Hlavní past: WAF nebo CDN blokuje požadavek dřív, než se vůbec dostane k WordPressu. Pamatujte: robots.txt je jen deklarace, ne vynucení. GPTBot není totéž co OAI-SearchBot. Změny se projeví až za zhruba 24 hodin. WordPress má často virtuální robots.txt. Kontrolu i průběžný monitoring zastřeší platforma Semly.
Jak zjistit přístup AI robotů na WordPress: co budete potřebovat
Než začnete, ujasněte si, do čeho jdete. AI crawler je robot, který čte váš web proto, aby jeho obsah mohl být použit v odpovědích umělé inteligence. Není to jen návštěvník navíc. Když ho zablokujete, AI o vašem webu prostě nebude vědět.
Tato kontrola je pro weby na WordPressu a WooCommerce. Hodí se správcům, marketérům i agenturám.
Co si připravte:
- URL webu (například
https://vasedomena.cz). - Přístup do administrace WordPressu, ideálně k SEO pluginu.
- Přístup k serverovým logům nebo k GA4.
- Přístup do Cloudflare, pokud web jede přes něj.
Kdy tato metoda nestačí: web za WAF s vlastními pravidly, jednostránková aplikace postavená jen na JavaScriptu nebo obsah za přihlášením. Tam je potřeba zásah technika.
A hlavní upozornění hned na začátek: robots.txt je deklarace, ne vynucení. Říká robotovi, co si přejete. Nezaručuje, že se tím bude řídit, a hlavně neřeší blokace, které vzniknou dřív.
Tréninkový vs. vyhledávací robot: proč na tom záleží
Tady dělá nejvíc lidí nejdražší chybu. Myslí si, že GPTBot a OAI-SearchBot je to samé. Nejsou.
| Kategorie | Co dělá | Příklady | Dopad blokace |
|---|---|---|---|
| Trénink | Sbírá data pro trénink modelů | GPTBot, ClaudeBot, CCBot, Bytespider | Obsah se nedostane do budoucích trénovacích dat. Malý okamžitý dopad na živé odpovědi. |
| Vyhledávací index | Buduje index pro AI vyhledávání | OAI-SearchBot, Claude-SearchBot, PerplexityBot | Přestanete se objevovat jako citovaný zdroj. Tohle je ta drahá blokace. |
| Živá návštěva | Načte stránku při dotazu konkrétního uživatele | ChatGPT-User, Claude-User, Perplexity-User | AI nemůže otevřít stránku uživateli, který se právě ptá. |
| Přepínač v robots.txt | Nikdy sám nefetchuje | Google-Extended, Applebot-Extended | Opt-out z tréninku bez dopadu na běžné vyhledávání. |
Zapamatujte si jednu větu: blokace tréninku není blokace vyhledávání. Když zablokujete GPTBot, nezmizíte z ChatGPT Search. Pro viditelnost ve vyhledávání ChatGPT je klíčový OAI-SearchBot.
A proč v logech nevidíte Google-Extended? Protože Google nikdy neposílá crawler s tímto jménem. Crawleruje přes Googlebot a Google-Extended respektuje jen jako samostatný opt-out token. Totéž platí pro Applebot-Extended.
Krok 1 – Zjistěte, jaký robots.txt váš web skutečně vrací
Cíl: ověřit reálný stav, ne soubor na disku.
Postup:
- Otevřete v prohlížeči
https://vasedomena.cz/robots.txt. - Zkontrolujte, co tam skutečně je.
- Všimněte si, jestli soubor obsahuje
User-agent: *a pod nímDisallow: /.
Na WordPressu je robots.txt často virtuální, tedy generovaný za běhu. Fyzický soubor v rootu ho ale přebije. Proto se stav v prohlížeči může lišit od toho, co vidíte v pluginu.
Kontrolní bod: vidíte v prohlížeči stejný obsah jako v SEO pluginu? Pokud ne, máte dva zdroje a jeden vyhrává.
Krok 2 – Zjistěte, kdo robots.txt generuje
Cíl: najít místo, kde se změny dělají.
Checklist, kde hledat:
- Yoast SEO: Tools → File editor.
- Rank Math: General Settings → Edit robots.txt.
- All in One SEO: Tools → robots.txt.
- Filtr
robots_txtve vašem tématu nebo pluginu. - Fyzický soubor
robots.txtv rootu webu.
Když máte dva pluginy, vyhrává ten, který se přihlásí později, nebo fyzický soubor. Nejlepší je mít jen jeden zdroj pravdy.
Varování: nemažte existující pravidla bez analýzy. Můžete omylem zablokovat Google a přijít o běžné vyhledávání.
Krok 3 – Přečtěte si pravidla pro AI roboty
Cíl: rozpoznat Allow a Disallow pro konkrétní roboty.
Hledejte tyto názvy: GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended, CCBot, Bytespider.
| Bot | Co dělá | Co znamená blokace |
|---|---|---|
| GPTBot | Trénink modelů OpenAI | Obsah mimo trénovací data |
| OAI-SearchBot | Index pro ChatGPT Search | Zmizení z citací v ChatGPT |
| ClaudeBot | Trénink modelů Anthropic | Obsah mimo trénovací data |
| Claude-SearchBot | Index pro vyhledávání Claude | Nižší viditelnost ve výsledcích |
| PerplexityBot | Index pro vyhledávání Perplexity | Zmizení z citací v Perplexity |
Důležité pravidlo: bot, který v robots.txt není uvedený, je defaultně povolený. Chybějící záznam tedy neznamená blokaci.
Pozor na syntaktické chyby. Cesta musí začínat lomítkem, tedy Disallow: /soukromi/, ne Disallow: soukromi/. Špatně napsaný řádek robot ignoruje nebo si ho vyloží jinak.
Krok 4 – Ověřte, že nejste blokováni omylem (WAF, CDN, hosting)
Cíl: odhalit blokaci, která nastane dřív než robots.txt.
Tohle je nejčastější důvod, proč robot nechodí, i když máte v robots.txt Allow. WAF se aplikuje před robots.txt. Požadavek se k WordPressu vůbec nedostane.
Kde hledat:
- Cloudflare: funkce „AI Crawl Control" blokuje na edge vrstvě.
- Wordfence, Sucuri, iThemes Security: mají výchozí pravidla, která mohou blokovat AI user-agenty.
- Managed hosting: některé hosty vrací AI robotům rovnou 429.
.htaccess: ruční blokace podle user-agenta.
Když blokuje WAF, robots.txt vám nepomůže. Potřebujete whitelist na úrovni user-agenta a IP adresy. Nemusíte vypínat celý firewall, stačí pustit konkrétní roboty.
Kontrolní bod: zkuste si v Cloudflare projít nastavení AI botů a zjistit, jestli tam není plošná blokace.
Krok 5 – Otestujte přístup zvenčí (curl a online nástroje)
Cíl: získat tvrdý důkaz, jestli se robot dostane k obsahu.
Použijte příkaz:
curl -A "GPTBot/1.4" -I https://vasesite.cz/
Alternativa bez terminálu: r.jina.ai/https://vasedomena.cz.
| Status kód | Co znamená | Co dělat |
|---|---|---|
| 200 | Robot může číst web | Vše v pořádku |
| 403 | Blokuje firewall nebo WAF | Zkontrolujte CDN a hosting |
| 429 | Blokuje hosting (rate limit) | Ověřte pravidla hostingu |
| 404 | Stránka neexistuje | Zkontrolujte URL |
Pozor na soft-404: server vrátí 200, ale obsah je prázdný, protože web vykresluje jen JavaScript. Robot si myslí, že stránka existuje, ale nic nepřečte. GPTBot, ClaudeBot ani PerplexityBot JavaScript nespouštějí.
Krok 6 – Zkontrolujte serverové logy a GA4
Cíl: zjistit, kdo web reálně crawluje.
V logu filtrujte AI roboty:
grep -Ei "GPTBot|ClaudeBot|OAI-SearchBot|ChatGPT-User|PerplexityBot" access.log
A pro počty hitů:
grep -Eoi "GPTBot|ClaudeBot|OAI-SearchBot|PerplexityBot" access.log | sort | uniq -c | sort -rn
Jeden záznam v logu čtěte takto:
66.249.66.1 - - [22/Sep/2026:10:14:02] "GET /blog/clanek" 200 45231 "-" "GPTBot/1.4"
Pořadí je: IP → čas → cesta → status → velikost → user-agent. Status 200 znamená úspěch, 403 blokaci.
V GA4 filtrujte podle user-agentů. Sledujte hlavně GPTBot, ClaudeBot, GoogleOther a PerplexityBot.
Pozor: user-agent lze podvrhnout. Skutečného bota od napodobitele rozeznáte jen ověřením IP proti publikovaným rozsahům (OpenAI a Perplexity je zveřejňují). Anthropic IP rozsahy nezveřejňuje, takže u ClaudeBotů se spolehněte na user-agent.
Krok 7 – Rozhodněte se vědomě: co povolit a co blokovat
Cíl: převést zjištění na konkrétní rozhodnutí.
| Chci... | Nastavím... |
|---|---|
| Být citován v ChatGPT Search | Povolit OAI-SearchBot |
| Být citován v Claude | Povolit Claude-SearchBot |
| Být citován v Perplexity | Povolit PerplexityBot |
| Nebýt v trénovacích datech | Zablokovat GPTBot a ClaudeBot |
| Být dostupný při dotazu uživatele | Povolit ChatGPT-User, Claude-User, Perplexity-User |
Praktický vzorec zní: „neber moje data na trénink, ale přijď, když se zákazník ptá." Je to obhajitelná strategie a weby ji používají běžně.
Tohle není SEO taktika, ale vědomé rozhodnutí o přístupu. Rozhodněte se podle toho, co od AI očekáváte.
Krok 8 – Po změně ověřte a nastavte monitoring
Cíl: uzavřít smyčku a nezůstat u jednorázové kontroly.
OpenAI i Perplexity uvádějí, že promítnutí změn v robots.txt může trvat až 24 hodin. Počkejte tedy den a porovnejte výsledky před a po.
Pak nastavte pravidelný monitoring. Tady se hodí Semly. Platforma sleduje, jak se vaše značka zobrazuje v odpovědích ChatGPT, Gemini, Claude, Grok a Google AI. AI agent Leon navíc kontroluje robots.txt, llms.txt, sitemapu a schema.org. Uvidíte metriky jako viditelnost, pozice, sentiment, podíl na hlasu a zdroje citací, s reportem každých 24 hodin.
Jako doplněk přidejte llms.txt a aktuální sitemap.xml. Každý soubor má jiný účel a nenahrazují se. Ilustrací, že to má smysl, je případová studie Obeg: po odemknutí přístupu pro GPTBot a Google-Extended vzrostly registrace o 280 %.
Nejčastější chyby a jak je napravit
- Blokace na CDN místo origin. WAF se aplikuje před robots.txt. Náprava: whitelist user-agenta a IP v Cloudflare.
- Cache robots.txt. Robot si soubor pamatuje. Náprava: počkejte až 24 hodin a ověřte znovu.
- 403 vs. soft-404. 403 znamená blokaci, soft-404 prázdný obsah. Náprava: u soft-404 nasaďte server-side rendering.
- Wildcard
Disallow: /. Zablokuje všechno včetně Googlebota. Náprava: odstraňte plošný zákaz a blokujte cíleně. - JS-only rendering. AI roboti nespouštějí JavaScript. Náprava: dodejte obsah v HTML.
- Login nebo paywall. Robot vidí přihlašovací stránku. Náprava: zpřístupněte klíčový obsah veřejně.
- IP blokace u Anthropic. Brání crawleru přečíst robots.txt. Náprava: blokujte podle user-agenta.
- Syntaktické chyby. Cesta nezačíná lomítkem. Náprava: zkontrolujte každý řádek.
Co dál
Po kontrole máte tři cesty podle situace:
- Web je v pořádku: doplňte
llms.txt, aktualizujtesitemap.xmla zkontrolujte schema.org (Product, FAQPage, Organization). - Web za WAF: nastavte whitelist user-agenta a IP adres.
- JS-only web: přejděte na server-side rendering.
Pak nastavte monitoring v Semly a sledujte, jestli vás AI skutečně cituje. Když si nejste jistí zásahem do technického nastavení, předejte změny technikovi. Technické změny se vyplatí dělat opatrně.
Rychlý checklist
- Ověřte reálný robots.txt v prohlížeči.
- Zjistěte, kdo ho generuje.
- Přečtěte pravidla pro AI roboty.
- Zkontrolujte WAF, CDN a hosting.
- Otestujte přístup přes curl.
- Projděte logy a GA4.
- Rozhodněte se, co povolit a co blokovat.
- Ověřte po 24 hodinách a nastavte monitoring.
Mini-slovníček
- AI crawler: robot, který čte web pro potřeby AI.
- robots.txt: soubor s přáním, co mají roboti navštěvovat.
- llms.txt: kurátorská mapa klíčových zdrojů pro AI.
- WAF: firewall, který filtruje požadavky před webem.
- soft-404: stav, kdy server vrátí 200, ale obsah chybí.
FAQ
Jak dlouho trvá změna? OpenAI i Perplexity uvádějí až 24 hodin.
Musím blokovat všechny AI roboty? Ne. Je to vědomé rozhodnutí. Pro citace potřebujete vyhledávací roboty povolit.
Co je llms.txt? Soubor, který AI nabízí přehled klíčových zdrojů. Nenahrazuje robots.txt ani sitemapu.