Tři boti OpenAI, tři různé úkoly
Dobrým příkladem je ChatGPT. Často se setkáváme s obecným označením „ChatGPT bot“, jenže ve skutečnosti může jít o několik různých věcí. GPTBot souvisí s obsahem, který může OpenAI potenciálně využít při vývoji a trénování svých modelů. Pokud majitel webu nechce svůj obsah pro tento účel poskytovat, může GPTBot v robots.txt zablokovat. OpenAI tuto možnost přímo podporuje. Tady se docela hodí přirovnání k posilovně. Trénink neděláme kvůli tomu, abychom vyřešili jeden konkrétní úkol právě teď. Jeho smyslem je zlepšit naše schopnosti do budoucna. Podobně je dobré chápat roli GPTBotu – neslouží k tomu, aby ChatGPT právě teď vyhledal odpověď na konkrétní otázku uživatele. Pro aktuální vyhledávání má OpenAI OAI-SearchBot. Ten je z pohledu viditelnosti webu v ChatGPT Search podstatně zajímavější. OpenAI uvádí, že pokud má být obsah webu zahrnován do výsledků ChatGPT Search, provozovatel by OAI-SearchBot neměl blokovat. Třetím případem je ChatGPT-User. Ten souvisí s požadavkem konkrétního uživatele. Nejde tedy o klasického robota, který si systematicky prochází internet a vytváří vlastní databázi stránek. Rozdíl mezi těmito třemi přístupy je důležitější, než se může zdát. Firma totiž může mít naprosto legitimní důvod zakázat použití svého obsahu pro potenciální trénování modelů, ale současně chtít, aby její stránky mohl používat ChatGPT Search. Proto nedává příliš smysl hodnotit přístup GPTBotu a OAI-SearchBotu stejným způsobem.GPTBot
Obsah pro vývoj a potenciální trénování AI modelů.
OAI-SearchBot
Vyhledávání a získávání aktuálních informací pro ChatGPT Search.
ChatGPT-User
Přístup k webu na základě konkrétního požadavku uživatele.
Podobně to má vyřešené Claude
Anthropic, který provozuje Claude, rozlišuje jednotlivé účely ještě velmi přehledně. V jeho dokumentaci najdeme ClaudeBot, Claude-SearchBot a Claude-User. ClaudeBot je určen pro získávání veřejně dostupného webového obsahu, který může být použit při vývoji a trénování generativních AI modelů. Claude-SearchBot naopak souvisí s vyhledáváním. Anthropic přímo upozorňuje, že jeho blokování může omezit viditelnost webu ve výsledcích vyhledávání Claude. Claude-User se používá v situacích, kdy přístup k webu vyvolá požadavek konkrétního uživatele.ClaudeBot
Získávání veřejného obsahu pro vývoj a trénování AI modelů.
Claude-SearchBot
Vyhledávání a získávání informací pro výsledky Claude.
Claude-User
Přístup k webu vyvolaný konkrétním požadavkem uživatele.
Perplexity má vlastní crawler i přístup na žádost uživatele
Také Perplexity rozlišuje dva způsoby práce s webem. PerplexityBot prochází internet, aby mohl být obsah webů zobrazován a odkazován ve výsledcích Perplexity. Provozovatel přímo uvádí, že tento crawler není určen ke sběru obsahu pro trénování foundation modelů. Vedle něj existuje Perplexity-User. Ten se může na stránku dostat ve chvíli, kdy uživatel položí otázku a Perplexity potřebuje získat informace z konkrétního webu. Právě Perplexity-User ukazuje, že ani robots.txt není univerzální odpovědí na všechno. Perplexity ve své dokumentaci uvádí, že tento typ přístupu je vyvolán uživatelem a pravidla robots.txt obecně nerespektuje.Google-Extended není další Googlebot
Samostatnou kapitolou je Google. Tady je dobré opravit jeden poměrně rozšířený omyl: Google-Extended není speciální crawler pro AI Overviews. Pro AI funkce přímo ve Vyhledávání Google, mezi které patří AI Overviews a AI Mode, zůstává důležitý běžný Googlebot. Google uvádí, že není potřeba žádný zvláštní AI crawler ani speciální soubor nebo schema markup. Stránka musí splňovat standardní podmínky pro indexaci a zobrazování ve Vyhledávání Google. Google-Extended funguje jinak. Ve skutečnosti ani nejde o samostatného robota, který by pod tímto jménem navštěvoval web. Je to řídicí mechanismus v robots.txt, kterým může provozovatel ovlivnit využívání svého obsahu pro některé AI účely Googlu, například v souvislosti s Gemini. Google zároveň výslovně uvádí, že nastavení Google-Extended nemá vliv na zařazení webu do klasického Google Search ani na jeho pozice.Zablokování Google-Extended tedy nelze jednoduše interpretovat tak, že web nebude mít možnost zobrazit se v AI Overviews.
Bingbot možná zní trochu staromódně, ale stále má význam
Vedle všech nových názvů působí Bingbot skoro obyčejně. Přesto má své místo i při hodnocení připravenosti webu na svět AI vyhledávání. Microsoft svoji vyhledávací infrastrukturu propojuje s AI službami a sám upozorňuje, že dostupnost webu pro crawling, správná indexace, sitemap nebo aktuálnost obsahu zůstávají důležité i pro AI-powered Search. Od roku 2026 navíc Bing Webmaster Tools obsahuje AI Performance, kde mohou provozovatelé webů sledovat citace svého obsahu v Microsoft Copilot, AI odpovědích Bingu a některých partnerských službách.Crawling
Web musí být dostupný pro vyhledávací roboty.
Indexace
Obsah musí být správně zpracován a dostupný ve vyhledávacím systému.
AI Performance
Lze sledovat, jak se obsah objevuje v některých AI odpovědích.
Co vlastně dělá robots.txt?
Když už mluvíme o povolování a zakazování robotů, stojí za to krátce vysvětlit robots.txt. Je to jednoduchý textový soubor umístěný na webu, ve kterém může provozovatel stanovit pravidla pro automatické roboty. Tady se jedno přirovnání opravdu nabízí: robots.txt můžeme chápat jako pokyny pro vrátného. Říkají například, že OAI-SearchBot může dál, zatímco GPTBot má vstup zakázaný. Není to ale bezpečnostní zámek. Robots.txt je standard, který musí konkrétní provozovatel crawleru respektovat. Pokud potřebujeme obsah skutečně zabezpečit, používají se jiné prostředky. A jak už jsme viděli u Perplexity-User, existují také uživatelsky iniciované přístupy, které se od klasického automatického crawleru chovají jinak.Robots.txt říká robotům, jaký přístup na web jim provozovatel umožňuje. Není to však mechanismus pro skutečné zabezpečení obsahu.
Je tedy nejlepší všechny AI boty povolit?
Ne nutně. Tohle je podle nás jeden z nejdůležitějších závěrů celé problematiky. Povolený AI crawler automaticky neznamená lepší viditelnost firmy v AI. Pokud například povolíme OAI-SearchBot, dáváme ChatGPT Search technickou možnost s obsahem našeho webu pracovat. Neříká to ale nic o tom, jestli jej ChatGPT skutečně použije, ocituje nebo naši firmu doporučí potenciálnímu zákazníkovi. Stejně tak není nutné považovat blokování trénovacího crawleru automaticky za chybu. Firma může dojít k rozhodnutí, že svůj obsah nechce poskytovat pro potenciální trénování budoucích modelů, ale současně chce být dostupná pro aktuální AI vyhledávání. U OpenAI například může zakázat GPTBot a ponechat povolený OAI-SearchBot. Jde o dvě rozdílné věci a OpenAI je také samostatně umožňuje řídit.Technická dostupnost
Crawler se na web může dostat.
AI vyhledávání
Systém může obsah webu použít při hledání odpovědi.
AI Visibility
Web může být skutečně zmíněn nebo citován v odpovědi.
Přístupnost pro AI je jen začátek
Kontrola crawlerů je užitečná, ale sama o sobě o skutečné viditelnosti firmy v AI mnoho nevypovídá. V našem AI Visibility Framework™ proto kontrolu přístupu relevantních botů řadíme do části AI Readiness. Zajímá nás, jestli je web technicky připravený, zda jeho obsah mohou příslušné systémy načíst a jestli jim v tom například chybou v robots.txt nebráníme. Jenže technická připravenost je pouze jeden dílek celé skládačky. Web může být pro OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot perfektně dostupný, a přesto se jeho firma v odpovědích AI prakticky neobjevuje. A opačně jsme při našich testech narazili na weby, které po technické stránce rozhodně nejsou dokonalé, ale v konkrétních tématech je AI doporučuje poměrně často. Proto technickou připravenost oddělujeme od Real AI Visibility, kde už neřešíme, kdo smí přijít na web, ale co se skutečně děje v odpovědích AI. Pro firmu je totiž nakonec mnohem důležitější jiná otázka:Když se potenciální zákazník zeptá ChatGPT, Claude, Gemini nebo Perplexity na produkt či službu, kterou nabízím, objeví se mezi doporučenými firmami také ta moje?A odpověď na ni v robots.txt nenajdeme.
AI botů bude přibývat. Jejich názvy si pamatovat nemusíme
Seznam crawlerů a dalších mechanismů se bude s vývojem AI téměř jistě měnit. Některé přibudou, jiné mohou změnit funkci a jednotlivé společnosti budou upravovat pravidla, podle kterých s webovým obsahem pracují. Nemá proto velký význam učit se nazpaměť seznam všech názvů. Stačí si pamatovat podstatný rozdíl: některé systémy získávají obsah pro vývoj a trénování modelů, jiné ho potřebují pro aktuální vyhledávání a další přicházejí na web až na základě konkrétního požadavku uživatele. Pokud chceme, aby byl web dobře připravený pro AI, měli bychom vědět, komu dveře otevíráme a komu je naopak zavíráme. Samotné otevřené dveře ale nestačí. O skutečné AI Visibility nakonec rozhoduje až to, zda má AI důvod naši firmu použít jako zdroj, zmínit ji nebo doporučit člověku na druhé straně chatu.Oficiální zdroje
Informace v článku vycházejí z aktuální dokumentace jednotlivých provozovatelů AI a vyhledávacích systémů. Protože se tato oblast rychle mění, je vhodné při změnách robots.txt nebo jiných technických nastavení vždy zkontrolovat aktuální dokumentaci.- OpenAI – Publishers and Developers FAQ
- Anthropic – Claude crawlers a možnosti jejich blokování
- Perplexity – crawler documentation
- Google Search – AI features and your website
- Google – dokumentace crawlerů a Google-Extended
- Microsoft Bing – Keeping Content Discoverable with Sitemaps in AI-Powered Search
- Microsoft Bing – AI Performance in Bing Webmaster Tools
