Jak zjistit, zda AI roboti (GPTBot, ClaudeBot, PerplexityBot) mají přístup k vašemu WordPress webu – kontrola krok za krokem

Pokud váš web blokuje AI roboty, můžete v odpovědích ChatGPT, Claude nebo Perplexity zmizet. A často o tom ani nevíte. Blokace totiž vzniká na několika místech najednou: v robots.txt, ve firewallu, na CDN nebo v hostingu. Tento návod vás provede kontrolou krok za krokem. Zvládnete ji sami, bez programování.

TL;DR V osmi krocích ověříte, jestli se AI roboti (GPTBot, ClaudeBot, PerplexityBot) skutečně dostanou k vašemu obsahu. Řešit to má smysl: zablokovaný vyhledávací crawler znamená, že zmizíte z AI citací. Hlavní past: WAF nebo CDN blokuje požadavek dřív, než se vůbec dostane k WordPressu. Pamatujte: robots.txt je jen deklarace, ne vynucení. GPTBot není totéž co OAI-SearchBot. Změny se projeví až za zhruba 24 hodin. WordPress má často virtuální robots.txt. Kontrolu i průběžný monitoring zastřeší platforma Semly.

Jak zjistit přístup AI robotů na WordPress: co budete potřebovat

Než začnete, ujasněte si, do čeho jdete. AI crawler je robot, který čte váš web proto, aby jeho obsah mohl být použit v odpovědích umělé inteligence. Není to jen návštěvník navíc. Když ho zablokujete, AI o vašem webu prostě nebude vědět.

Tato kontrola je pro weby na WordPressu a WooCommerce. Hodí se správcům, marketérům i agenturám.

Co si připravte:

  • URL webu (například https://vasedomena.cz).
  • Přístup do administrace WordPressu, ideálně k SEO pluginu.
  • Přístup k serverovým logům nebo k GA4.
  • Přístup do Cloudflare, pokud web jede přes něj.

Kdy tato metoda nestačí: web za WAF s vlastními pravidly, jednostránková aplikace postavená jen na JavaScriptu nebo obsah za přihlášením. Tam je potřeba zásah technika.

A hlavní upozornění hned na začátek: robots.txt je deklarace, ne vynucení. Říká robotovi, co si přejete. Nezaručuje, že se tím bude řídit, a hlavně neřeší blokace, které vzniknou dřív.

Tréninkový vs. vyhledávací robot: proč na tom záleží

Tady dělá nejvíc lidí nejdražší chybu. Myslí si, že GPTBot a OAI-SearchBot je to samé. Nejsou.

Kategorie Co dělá Příklady Dopad blokace
Trénink Sbírá data pro trénink modelů GPTBot, ClaudeBot, CCBot, Bytespider Obsah se nedostane do budoucích trénovacích dat. Malý okamžitý dopad na živé odpovědi.
Vyhledávací index Buduje index pro AI vyhledávání OAI-SearchBot, Claude-SearchBot, PerplexityBot Přestanete se objevovat jako citovaný zdroj. Tohle je ta drahá blokace.
Živá návštěva Načte stránku při dotazu konkrétního uživatele ChatGPT-User, Claude-User, Perplexity-User AI nemůže otevřít stránku uživateli, který se právě ptá.
Přepínač v robots.txt Nikdy sám nefetchuje Google-Extended, Applebot-Extended Opt-out z tréninku bez dopadu na běžné vyhledávání.

Zapamatujte si jednu větu: blokace tréninku není blokace vyhledávání. Když zablokujete GPTBot, nezmizíte z ChatGPT Search. Pro viditelnost ve vyhledávání ChatGPT je klíčový OAI-SearchBot.

A proč v logech nevidíte Google-Extended? Protože Google nikdy neposílá crawler s tímto jménem. Crawleruje přes Googlebot a Google-Extended respektuje jen jako samostatný opt-out token. Totéž platí pro Applebot-Extended.

Krok 1 – Zjistěte, jaký robots.txt váš web skutečně vrací

Cíl: ověřit reálný stav, ne soubor na disku.

Postup:

  1. Otevřete v prohlížeči https://vasedomena.cz/robots.txt.
  2. Zkontrolujte, co tam skutečně je.
  3. Všimněte si, jestli soubor obsahuje User-agent: * a pod ním Disallow: /.

Na WordPressu je robots.txt často virtuální, tedy generovaný za běhu. Fyzický soubor v rootu ho ale přebije. Proto se stav v prohlížeči může lišit od toho, co vidíte v pluginu.

Kontrolní bod: vidíte v prohlížeči stejný obsah jako v SEO pluginu? Pokud ne, máte dva zdroje a jeden vyhrává.

Krok 2 – Zjistěte, kdo robots.txt generuje

Cíl: najít místo, kde se změny dělají.

Checklist, kde hledat:

  • Yoast SEO: Tools → File editor.
  • Rank Math: General Settings → Edit robots.txt.
  • All in One SEO: Tools → robots.txt.
  • Filtr robots_txt ve vašem tématu nebo pluginu.
  • Fyzický soubor robots.txt v rootu webu.

Když máte dva pluginy, vyhrává ten, který se přihlásí později, nebo fyzický soubor. Nejlepší je mít jen jeden zdroj pravdy.

Varování: nemažte existující pravidla bez analýzy. Můžete omylem zablokovat Google a přijít o běžné vyhledávání.

Krok 3 – Přečtěte si pravidla pro AI roboty

Cíl: rozpoznat Allow a Disallow pro konkrétní roboty.

Hledejte tyto názvy: GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended, CCBot, Bytespider.

Bot Co dělá Co znamená blokace
GPTBot Trénink modelů OpenAI Obsah mimo trénovací data
OAI-SearchBot Index pro ChatGPT Search Zmizení z citací v ChatGPT
ClaudeBot Trénink modelů Anthropic Obsah mimo trénovací data
Claude-SearchBot Index pro vyhledávání Claude Nižší viditelnost ve výsledcích
PerplexityBot Index pro vyhledávání Perplexity Zmizení z citací v Perplexity

Důležité pravidlo: bot, který v robots.txt není uvedený, je defaultně povolený. Chybějící záznam tedy neznamená blokaci.

Pozor na syntaktické chyby. Cesta musí začínat lomítkem, tedy Disallow: /soukromi/, ne Disallow: soukromi/. Špatně napsaný řádek robot ignoruje nebo si ho vyloží jinak.

Krok 4 – Ověřte, že nejste blokováni omylem (WAF, CDN, hosting)

Cíl: odhalit blokaci, která nastane dřív než robots.txt.

Tohle je nejčastější důvod, proč robot nechodí, i když máte v robots.txt Allow. WAF se aplikuje před robots.txt. Požadavek se k WordPressu vůbec nedostane.

Kde hledat:

  • Cloudflare: funkce „AI Crawl Control" blokuje na edge vrstvě.
  • Wordfence, Sucuri, iThemes Security: mají výchozí pravidla, která mohou blokovat AI user-agenty.
  • Managed hosting: některé hosty vrací AI robotům rovnou 429.
  • .htaccess: ruční blokace podle user-agenta.

Když blokuje WAF, robots.txt vám nepomůže. Potřebujete whitelist na úrovni user-agenta a IP adresy. Nemusíte vypínat celý firewall, stačí pustit konkrétní roboty.

Kontrolní bod: zkuste si v Cloudflare projít nastavení AI botů a zjistit, jestli tam není plošná blokace.

Krok 5 – Otestujte přístup zvenčí (curl a online nástroje)

Cíl: získat tvrdý důkaz, jestli se robot dostane k obsahu.

Použijte příkaz:

curl -A "GPTBot/1.4" -I https://vasesite.cz/

Alternativa bez terminálu: r.jina.ai/https://vasedomena.cz.

Status kód Co znamená Co dělat
200 Robot může číst web Vše v pořádku
403 Blokuje firewall nebo WAF Zkontrolujte CDN a hosting
429 Blokuje hosting (rate limit) Ověřte pravidla hostingu
404 Stránka neexistuje Zkontrolujte URL

Pozor na soft-404: server vrátí 200, ale obsah je prázdný, protože web vykresluje jen JavaScript. Robot si myslí, že stránka existuje, ale nic nepřečte. GPTBot, ClaudeBot ani PerplexityBot JavaScript nespouštějí.

Krok 6 – Zkontrolujte serverové logy a GA4

Cíl: zjistit, kdo web reálně crawluje.

V logu filtrujte AI roboty:

grep -Ei "GPTBot|ClaudeBot|OAI-SearchBot|ChatGPT-User|PerplexityBot" access.log

A pro počty hitů:

grep -Eoi "GPTBot|ClaudeBot|OAI-SearchBot|PerplexityBot" access.log | sort | uniq -c | sort -rn

Jeden záznam v logu čtěte takto:

66.249.66.1 - - [22/Sep/2026:10:14:02] "GET /blog/clanek" 200 45231 "-" "GPTBot/1.4"

Pořadí je: IP → čas → cesta → status → velikost → user-agent. Status 200 znamená úspěch, 403 blokaci.

V GA4 filtrujte podle user-agentů. Sledujte hlavně GPTBot, ClaudeBot, GoogleOther a PerplexityBot.

Pozor: user-agent lze podvrhnout. Skutečného bota od napodobitele rozeznáte jen ověřením IP proti publikovaným rozsahům (OpenAI a Perplexity je zveřejňují). Anthropic IP rozsahy nezveřejňuje, takže u ClaudeBotů se spolehněte na user-agent.

Krok 7 – Rozhodněte se vědomě: co povolit a co blokovat

Cíl: převést zjištění na konkrétní rozhodnutí.

Chci... Nastavím...
Být citován v ChatGPT Search Povolit OAI-SearchBot
Být citován v Claude Povolit Claude-SearchBot
Být citován v Perplexity Povolit PerplexityBot
Nebýt v trénovacích datech Zablokovat GPTBot a ClaudeBot
Být dostupný při dotazu uživatele Povolit ChatGPT-User, Claude-User, Perplexity-User

Praktický vzorec zní: „neber moje data na trénink, ale přijď, když se zákazník ptá." Je to obhajitelná strategie a weby ji používají běžně.

Tohle není SEO taktika, ale vědomé rozhodnutí o přístupu. Rozhodněte se podle toho, co od AI očekáváte.

Krok 8 – Po změně ověřte a nastavte monitoring

Cíl: uzavřít smyčku a nezůstat u jednorázové kontroly.

OpenAI i Perplexity uvádějí, že promítnutí změn v robots.txt může trvat až 24 hodin. Počkejte tedy den a porovnejte výsledky před a po.

Pak nastavte pravidelný monitoring. Tady se hodí Semly. Platforma sleduje, jak se vaše značka zobrazuje v odpovědích ChatGPT, Gemini, Claude, Grok a Google AI. AI agent Leon navíc kontroluje robots.txt, llms.txt, sitemapu a schema.org. Uvidíte metriky jako viditelnost, pozice, sentiment, podíl na hlasu a zdroje citací, s reportem každých 24 hodin.

Jako doplněk přidejte llms.txt a aktuální sitemap.xml. Každý soubor má jiný účel a nenahrazují se. Ilustrací, že to má smysl, je případová studie Obeg: po odemknutí přístupu pro GPTBot a Google-Extended vzrostly registrace o 280 %.

Nejčastější chyby a jak je napravit

  • Blokace na CDN místo origin. WAF se aplikuje před robots.txt. Náprava: whitelist user-agenta a IP v Cloudflare.
  • Cache robots.txt. Robot si soubor pamatuje. Náprava: počkejte až 24 hodin a ověřte znovu.
  • 403 vs. soft-404. 403 znamená blokaci, soft-404 prázdný obsah. Náprava: u soft-404 nasaďte server-side rendering.
  • Wildcard Disallow: /. Zablokuje všechno včetně Googlebota. Náprava: odstraňte plošný zákaz a blokujte cíleně.
  • JS-only rendering. AI roboti nespouštějí JavaScript. Náprava: dodejte obsah v HTML.
  • Login nebo paywall. Robot vidí přihlašovací stránku. Náprava: zpřístupněte klíčový obsah veřejně.
  • IP blokace u Anthropic. Brání crawleru přečíst robots.txt. Náprava: blokujte podle user-agenta.
  • Syntaktické chyby. Cesta nezačíná lomítkem. Náprava: zkontrolujte každý řádek.

Co dál

Po kontrole máte tři cesty podle situace:

  • Web je v pořádku: doplňte llms.txt, aktualizujte sitemap.xml a zkontrolujte schema.org (Product, FAQPage, Organization).
  • Web za WAF: nastavte whitelist user-agenta a IP adres.
  • JS-only web: přejděte na server-side rendering.

Pak nastavte monitoring v Semly a sledujte, jestli vás AI skutečně cituje. Když si nejste jistí zásahem do technického nastavení, předejte změny technikovi. Technické změny se vyplatí dělat opatrně.

Rychlý checklist

  1. Ověřte reálný robots.txt v prohlížeči.
  2. Zjistěte, kdo ho generuje.
  3. Přečtěte pravidla pro AI roboty.
  4. Zkontrolujte WAF, CDN a hosting.
  5. Otestujte přístup přes curl.
  6. Projděte logy a GA4.
  7. Rozhodněte se, co povolit a co blokovat.
  8. Ověřte po 24 hodinách a nastavte monitoring.

Mini-slovníček

  • AI crawler: robot, který čte web pro potřeby AI.
  • robots.txt: soubor s přáním, co mají roboti navštěvovat.
  • llms.txt: kurátorská mapa klíčových zdrojů pro AI.
  • WAF: firewall, který filtruje požadavky před webem.
  • soft-404: stav, kdy server vrátí 200, ale obsah chybí.

FAQ

Jak dlouho trvá změna? OpenAI i Perplexity uvádějí až 24 hodin.

Musím blokovat všechny AI roboty? Ne. Je to vědomé rozhodnutí. Pro citace potřebujete vyhledávací roboty povolit.

Co je llms.txt? Soubor, který AI nabízí přehled klíčových zdrojů. Nenahrazuje robots.txt ani sitemapu.

Zdroje

Zjistěte, zda vás vidí

Zadejte adresu svého webu a získejte bezplatný report o viditelnosti v AI