Skip links

AI boti na vašem webu: Kdo přichází a proč?

Kdo klepe na dveře vašeho webu? AI boti nejsou všichni stejní GPTBot, OAI-SearchBot, ClaudeBot nebo PerplexityBot. Názvů robotů spojených s umělou inteligencí přibývá a snadno může vzniknout dojem, že všichni dělají přibližně totéž. Nedělají. Někteří souvisejí s trénováním AI, jiní s vyhledáváním aktuálních informací a další přicházejí na web až ve chvíli, kdy o to požádá konkrétní uživatel. Ještě před několika lety byla situace pro majitele webu docela přehledná. Pokud se zajímal o to, kdo jeho stránky automaticky prochází, znal především Googlebot a možná Bingbot. S nástupem ChatGPT, Claude, Gemini a Perplexity se seznam výrazně rozrostl. Jen OpenAI dnes rozlišuje GPTBot, OAI-SearchBot a ChatGPT-User. Anthropic má zase ClaudeBot, Claude-SearchBot a Claude-User. Perplexity používá PerplexityBot a Perplexity-User. K tomu můžeme přidat Googlebot, Google-Extended nebo Bingbot. Na první pohled je to docela slušný zmatek. Pro majitele běžného firemního webu ale není důležité znát všechny technické podrobnosti. Podstatnější je vědět, proč jednotliví roboti na web chodí a jestli jim v tom náhodou nebráníme.

Tři boti OpenAI, tři různé úkoly

Dobrým příkladem je ChatGPT. Často se setkáváme s obecným označením „ChatGPT bot“, jenže ve skutečnosti může jít o několik různých věcí. GPTBot souvisí s obsahem, který může OpenAI potenciálně využít při vývoji a trénování svých modelů. Pokud majitel webu nechce svůj obsah pro tento účel poskytovat, může GPTBot v robots.txt zablokovat. OpenAI tuto možnost přímo podporuje. Tady se docela hodí přirovnání k posilovně. Trénink neděláme kvůli tomu, abychom vyřešili jeden konkrétní úkol právě teď. Jeho smyslem je zlepšit naše schopnosti do budoucna. Podobně je dobré chápat roli GPTBotu – neslouží k tomu, aby ChatGPT právě teď vyhledal odpověď na konkrétní otázku uživatele. Pro aktuální vyhledávání má OpenAI OAI-SearchBot. Ten je z pohledu viditelnosti webu v ChatGPT Search podstatně zajímavější. OpenAI uvádí, že pokud má být obsah webu zahrnován do výsledků ChatGPT Search, provozovatel by OAI-SearchBot neměl blokovat. Třetím případem je ChatGPT-User. Ten souvisí s požadavkem konkrétního uživatele. Nejde tedy o klasického robota, který si systematicky prochází internet a vytváří vlastní databázi stránek. Rozdíl mezi těmito třemi přístupy je důležitější, než se může zdát. Firma totiž může mít naprosto legitimní důvod zakázat použití svého obsahu pro potenciální trénování modelů, ale současně chtít, aby její stránky mohl používat ChatGPT Search. Proto nedává příliš smysl hodnotit přístup GPTBotu a OAI-SearchBotu stejným způsobem.
GPTBot Obsah pro vývoj a potenciální trénování AI modelů.
OAI-SearchBot Vyhledávání a získávání aktuálních informací pro ChatGPT Search.
ChatGPT-User Přístup k webu na základě konkrétního požadavku uživatele.

Podobně to má vyřešené Claude

Anthropic, který provozuje Claude, rozlišuje jednotlivé účely ještě velmi přehledně. V jeho dokumentaci najdeme ClaudeBot, Claude-SearchBot a Claude-User. ClaudeBot je určen pro získávání veřejně dostupného webového obsahu, který může být použit při vývoji a trénování generativních AI modelů. Claude-SearchBot naopak souvisí s vyhledáváním. Anthropic přímo upozorňuje, že jeho blokování může omezit viditelnost webu ve výsledcích vyhledávání Claude. Claude-User se používá v situacích, kdy přístup k webu vyvolá požadavek konkrétního uživatele.
ClaudeBot Získávání veřejného obsahu pro vývoj a trénování AI modelů.
Claude-SearchBot Vyhledávání a získávání informací pro výsledky Claude.
Claude-User Přístup k webu vyvolaný konkrétním požadavkem uživatele.
Je na tom dobře vidět, proč označení „AI bot“ začíná být příliš obecné. Jeden provozovatel může mít několik robotů a každý řeší jinou část práce s webovým obsahem.

Perplexity má vlastní crawler i přístup na žádost uživatele

Také Perplexity rozlišuje dva způsoby práce s webem. PerplexityBot prochází internet, aby mohl být obsah webů zobrazován a odkazován ve výsledcích Perplexity. Provozovatel přímo uvádí, že tento crawler není určen ke sběru obsahu pro trénování foundation modelů. Vedle něj existuje Perplexity-User. Ten se může na stránku dostat ve chvíli, kdy uživatel položí otázku a Perplexity potřebuje získat informace z konkrétního webu. Právě Perplexity-User ukazuje, že ani robots.txt není univerzální odpovědí na všechno. Perplexity ve své dokumentaci uvádí, že tento typ přístupu je vyvolán uživatelem a pravidla robots.txt obecně nerespektuje.

Google-Extended není další Googlebot

Samostatnou kapitolou je Google. Tady je dobré opravit jeden poměrně rozšířený omyl: Google-Extended není speciální crawler pro AI Overviews. Pro AI funkce přímo ve Vyhledávání Google, mezi které patří AI Overviews a AI Mode, zůstává důležitý běžný Googlebot. Google uvádí, že není potřeba žádný zvláštní AI crawler ani speciální soubor nebo schema markup. Stránka musí splňovat standardní podmínky pro indexaci a zobrazování ve Vyhledávání Google. Google-Extended funguje jinak. Ve skutečnosti ani nejde o samostatného robota, který by pod tímto jménem navštěvoval web. Je to řídicí mechanismus v robots.txt, kterým může provozovatel ovlivnit využívání svého obsahu pro některé AI účely Googlu, například v souvislosti s Gemini. Google zároveň výslovně uvádí, že nastavení Google-Extended nemá vliv na zařazení webu do klasického Google Search ani na jeho pozice.
Zablokování Google-Extended tedy nelze jednoduše interpretovat tak, že web nebude mít možnost zobrazit se v AI Overviews.

Bingbot možná zní trochu staromódně, ale stále má význam

Vedle všech nových názvů působí Bingbot skoro obyčejně. Přesto má své místo i při hodnocení připravenosti webu na svět AI vyhledávání. Microsoft svoji vyhledávací infrastrukturu propojuje s AI službami a sám upozorňuje, že dostupnost webu pro crawling, správná indexace, sitemap nebo aktuálnost obsahu zůstávají důležité i pro AI-powered Search. Od roku 2026 navíc Bing Webmaster Tools obsahuje AI Performance, kde mohou provozovatelé webů sledovat citace svého obsahu v Microsoft Copilot, AI odpovědích Bingu a některých partnerských službách.
Crawling Web musí být dostupný pro vyhledávací roboty.
Indexace Obsah musí být správně zpracován a dostupný ve vyhledávacím systému.
AI Performance Lze sledovat, jak se obsah objevuje v některých AI odpovědích.
Staré SEO a nové AI vyhledávání tedy nejsou dva úplně oddělené světy. Část infrastruktury, na které dnešní AI vyhledávání stojí, vychází z klasického procházení a indexování webu.

Co vlastně dělá robots.txt?

Když už mluvíme o povolování a zakazování robotů, stojí za to krátce vysvětlit robots.txt. Je to jednoduchý textový soubor umístěný na webu, ve kterém může provozovatel stanovit pravidla pro automatické roboty. Tady se jedno přirovnání opravdu nabízí: robots.txt můžeme chápat jako pokyny pro vrátného. Říkají například, že OAI-SearchBot může dál, zatímco GPTBot má vstup zakázaný. Není to ale bezpečnostní zámek. Robots.txt je standard, který musí konkrétní provozovatel crawleru respektovat. Pokud potřebujeme obsah skutečně zabezpečit, používají se jiné prostředky. A jak už jsme viděli u Perplexity-User, existují také uživatelsky iniciované přístupy, které se od klasického automatického crawleru chovají jinak.
Robots.txt říká robotům, jaký přístup na web jim provozovatel umožňuje. Není to však mechanismus pro skutečné zabezpečení obsahu.

Je tedy nejlepší všechny AI boty povolit?

Ne nutně. Tohle je podle nás jeden z nejdůležitějších závěrů celé problematiky. Povolený AI crawler automaticky neznamená lepší viditelnost firmy v AI. Pokud například povolíme OAI-SearchBot, dáváme ChatGPT Search technickou možnost s obsahem našeho webu pracovat. Neříká to ale nic o tom, jestli jej ChatGPT skutečně použije, ocituje nebo naši firmu doporučí potenciálnímu zákazníkovi. Stejně tak není nutné považovat blokování trénovacího crawleru automaticky za chybu. Firma může dojít k rozhodnutí, že svůj obsah nechce poskytovat pro potenciální trénování budoucích modelů, ale současně chce být dostupná pro aktuální AI vyhledávání. U OpenAI například může zakázat GPTBot a ponechat povolený OAI-SearchBot. Jde o dvě rozdílné věci a OpenAI je také samostatně umožňuje řídit.
Technická dostupnost Crawler se na web může dostat.
AI vyhledávání Systém může obsah webu použít při hledání odpovědi.
AI Visibility Web může být skutečně zmíněn nebo citován v odpovědi.

Přístupnost pro AI je jen začátek

Kontrola crawlerů je užitečná, ale sama o sobě o skutečné viditelnosti firmy v AI mnoho nevypovídá. V našem AI Visibility Framework™ proto kontrolu přístupu relevantních botů řadíme do části AI Readiness. Zajímá nás, jestli je web technicky připravený, zda jeho obsah mohou příslušné systémy načíst a jestli jim v tom například chybou v robots.txt nebráníme. Jenže technická připravenost je pouze jeden dílek celé skládačky. Web může být pro OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot perfektně dostupný, a přesto se jeho firma v odpovědích AI prakticky neobjevuje. A opačně jsme při našich testech narazili na weby, které po technické stránce rozhodně nejsou dokonalé, ale v konkrétních tématech je AI doporučuje poměrně často. Proto technickou připravenost oddělujeme od Real AI Visibility, kde už neřešíme, kdo smí přijít na web, ale co se skutečně děje v odpovědích AI. Pro firmu je totiž nakonec mnohem důležitější jiná otázka:
Když se potenciální zákazník zeptá ChatGPT, Claude, Gemini nebo Perplexity na produkt či službu, kterou nabízím, objeví se mezi doporučenými firmami také ta moje?
A odpověď na ni v robots.txt nenajdeme.

AI botů bude přibývat. Jejich názvy si pamatovat nemusíme

Seznam crawlerů a dalších mechanismů se bude s vývojem AI téměř jistě měnit. Některé přibudou, jiné mohou změnit funkci a jednotlivé společnosti budou upravovat pravidla, podle kterých s webovým obsahem pracují. Nemá proto velký význam učit se nazpaměť seznam všech názvů. Stačí si pamatovat podstatný rozdíl: některé systémy získávají obsah pro vývoj a trénování modelů, jiné ho potřebují pro aktuální vyhledávání a další přicházejí na web až na základě konkrétního požadavku uživatele. Pokud chceme, aby byl web dobře připravený pro AI, měli bychom vědět, komu dveře otevíráme a komu je naopak zavíráme. Samotné otevřené dveře ale nestačí. O skutečné AI Visibility nakonec rozhoduje až to, zda má AI důvod naši firmu použít jako zdroj, zmínit ji nebo doporučit člověku na druhé straně chatu.

Oficiální zdroje

Informace v článku vycházejí z aktuální dokumentace jednotlivých provozovatelů AI a vyhledávacích systémů. Protože se tato oblast rychle mění, je vhodné při změnách robots.txt nebo jiných technických nastavení vždy zkontrolovat aktuální dokumentaci.