Vyhledávání na internetu se mění. Je váš web připraven?
Ještě před několika lety bylo hlavním cílem webových stránek získat dobrou pozici ve vyhledávačích, především na Googlu a Seznamu. Dnes se způsob hledání informací rychle mění.
Uživatel už nemusí zadat do Googlu několik klíčových slov, otevřít deset výsledků a jednotlivé weby postupně procházet. Stále častěji položí celou otázku přímo nástroji využívajícímu umělou inteligenci:
„Kdo mi vyrobí kuchyň na míru v Uherském Hradišti?“
„Najdi mi firmu na rekonstrukci střechy v okolí Zlína.“
„Který dodavatel nabízí průmyslové senzory pro měření tlaku?“
„Kde koupím dětské boty se širokou špičkou?“
AI systém následně vyhodnocuje informace z internetu a uživateli připraví konkrétní odpověď, doporučení nebo odkazy na relevantní firmy.
A právě zde vzniká nový požadavek na webové stránky:
Nestačí, aby web dobře vypadal. Musí být také technicky a obsahově připravený tak, aby jeho informace dokázaly správně načíst a pochopit vyhledávače, AI roboti a další automatizované systémy.
Neexistuje žádná úprava webu, která by garantovala, že bude firma v odpovědi ChatGPT, Gemini nebo Claude vždy doporučena. Správně připravený web však může významně zlepšit jeho dohledatelnost, strojovou čitelnost a schopnost AI systému pochopit, kdo firma je, co nabízí a kde působí.
Co se dnes při načítání webu mění
Klasický internetový vyhledávač využívá roboty, kteří stránky pravidelně procházejí, ukládají jejich obsah do indexu a následně je používají při vyhledávání.
S nástupem AI se k nim přidávají další systémy.
Web tak dnes mohou navštěvovat například:
- Googlebot,
- roboti OpenAI,
- roboti společnosti Anthropic,
- roboti společnosti Meta,
- roboti dalších AI vyhledávačů,
- systémy načítající stránku na přímý požadavek uživatele,
- nástroje vytvářející indexy pro AI vyhledávání.
To znamená, že web už není připravován pouze pro návštěvníka a Google.
Musí být dobře čitelný také strojově.
Jak web načítá ChatGPT
OpenAI dnes rozlišuje několik typů robotů.
Pro vyhledávání v ChatGPT je nejdůležitější robot OAI-SearchBot. OpenAI výslovně uvádí, že tento robot slouží k vyhledávání a k tomu, aby se webové stránky mohly objevit ve výsledcích vyhledávání ChatGPT. Pokud je OAI-SearchBot zablokovaný, obsah webu nemusí být možné v odpovědích ChatGPT běžně zobrazovat a citovat.
OpenAI dále používá například:
OAI-SearchBot slouží pro vyhledávání a zobrazování webových stránek ve výsledcích ChatGPT.
GPTBot slouží k získávání obsahu, který může být využíván při vývoji a trénování budoucích generativních modelů OpenAI.
ChatGPT-User může navštívit stránku přímo v situaci, kdy o to požádá uživatel ChatGPT. Nejde o klasického automatického indexovacího robota.
Pro majitele webu je tedy důležité rozlišovat mezi indexací pro vyhledávání a například souhlasem s využíváním obsahu pro vývoj AI modelů.
Je možné například povolit OAI-SearchBot a současně pomocí robots.txt nastavit jiná pravidla pro GPTBot. OpenAI tyto možnosti odděluje.
Jak web načítá Claude
Podobný princip používá také společnost Anthropic, která provozuje AI Claude.
Anthropic rozlišuje například:
Claude-SearchBot prochází internet za účelem zlepšení výsledků webového vyhledávání.
Claude-User může načítat webové stránky na základě konkrétního požadavku uživatele Claude.
ClaudeBot slouží k získávání obsahu, který může být použit při vývoji AI modelů.
Anthropic současně uvádí, že jeho roboti respektují pravidla uvedená v souboru robots.txt.
To znamená, že nevhodně nastavený robots.txt může způsobit, že určitý AI systém nebude mít k důležitému obsahu vůbec přístup.
Jak web využívá Google a Gemini
Google má jednu z nejrozsáhlejších indexovacích infrastruktur na internetu.
Klasické vyhledávání využívá především Googlebot.
U služeb souvisejících s Gemini se používá také řízení prostřednictvím tokenu Google-Extended. Google uvádí, že pomocí něj mohou provozovatelé webů řídit využití obsahu například při vývoji modelů Gemini a při některých způsobech jejich groundingu. Zároveň Google zdůrazňuje, že Google-Extended není klasický rankingový signál pro Google Search.
Zjednodušeně řečeno:
dobrá viditelnost webu v klasickém Google vyhledávání zůstává velmi důležitá i pro svět AI.
AI a klasické SEO proto nejsou dvě oddělené disciplíny. Naopak se stále více prolínají.
Meta AI, Facebook a další systémy
Také Meta používá několik různých robotů.
Vedle klasických systémů používaných například pro náhledy odkazů se dnes objevují také roboti související s AI produkty společnosti Meta.
Mezi ně patří například Meta-ExternalAgent, který je spojený se získáváním obsahu pro AI systémy společnosti Meta. Meta zároveň provozuje další oddělené roboty pro jiné účely.
Pro správce webu je proto stále důležitější vědět:
- kdo web prochází,
- které roboty chceme povolit,
- které části webu jim chceme zpřístupnit,
- zda je neblokuje firewall,
- zda je neblokuje CDN,
- zda nedostávají chybu 403,
- zda server jejich požadavky správně obslouží.
Správné nastavení robots.txt
Jedním ze základních souborů každého webu je:
/robots.txt
Najdeme jej například na adrese:
https://www.domena.cz/robots.txt
Soubor určuje pravidla pro roboty, kteří web procházejí.
Google například před načítáním webu kontroluje pravidla uvedená v robots.txt a podle nich rozhoduje, které části webu smí procházet.
Moderní konfigurace webu proto musí řešit nejen Googlebot, ale také jednotlivé AI roboty.
Příklad zjednodušeného nastavení může vypadat například takto:
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Googlebot
Allow: /
User-agent: *
Allow: /
Sitemap: https://www.domena.cz/sitemap.xmlKonkrétní konfiguraci je však potřeba připravit individuálně podle typu webu.
Například administraci, interní vyhledávání, košík, objednávkové procesy nebo některé parametrické adresy naopak není vhodné robotům zbytečně zpřístupňovat.
Sitemap.xml – mapa obsahu webu
Další důležitou součástí je soubor:
sitemap.xml
Ten robotům pomáhá zjistit:
- jaké stránky web obsahuje,
- jaké produkty existují,
- které články jsou dostupné,
- které stránky byly aktualizovány,
- jak je web strukturován.
U rozsáhlých webů nebo e-shopů mohou existovat samostatné mapy například pro:
- produkty,
- kategorie,
- články,
- obrázky,
- jazykové verze.
Sitemap musí být aktuální. Pokud web obsahuje 20 000 produktů, z nichž polovina už neexistuje, a sitemap stále odkazuje na staré adresy, vytváříme zbytečné požadavky a komplikujeme robotům práci.
Obsah musí být skutečně dostupný v HTML
Velmi důležitým tématem moderních webů je JavaScript.
Web může na monitoru vypadat perfektně, ale velká část jeho obsahu může vznikat až po spuštění JavaScriptu v internetovém prohlížeči.
To může pro některé automatizované systémy představovat problém.
Proto kontrolujeme, zda důležité informace existují přímo ve výsledném HTML dokumentu, případně zda je použito vhodné server-side rendering nebo jiné řešení.
Robot by měl být schopen jednoduše zjistit:
- název firmy,
- hlavní služby,
- produkty,
- ceny,
- lokality,
- kontaktní údaje,
- důležité parametry produktu,
- texty kategorií,
- FAQ,
- reference,
- další podstatné informace.
Web nesmí být „čitelný pouze pro člověka“.
Správná struktura HTML
Umělá inteligence dokáže zpracovávat text velmi dobře. Přesto jí výrazně pomáhá, pokud je stránka logicky strukturovaná.
Kontrolujeme proto například:
<title>
<meta name="description">
<h1>
<h2>
<h3>
<main>
<article>
<section>
<nav>
<header>
<footer>
Správně použitá struktura pomáhá určit:
- co je hlavní téma stránky,
- co je nadpis,
- co je doplňující informace,
- co je navigace,
- co je vlastní obsah,
- jak jednotlivé části textu spolu souvisejí.
Například stránka nazvaná pouze:
Služby
poskytuje stroji podstatně méně informace než:
Zakázková výroba kuchyní a nábytku – Uherské Hradiště a okolí
Metadata v hlavičce stránky
Důležitá je také správně připravená HTML hlavička.
Obsahuje například:
<title>Výroba kuchyní na míru | Firma XY</title>
<meta name="description"
content="Výroba kuchyní a nábytku na míru v Uherském Hradišti a okolí. Návrh, výroba a montáž.">
<link rel="canonical"
href="https://www.domena.cz/kuchyne-na-miru">Podle typu webu doplňujeme také:
- canonical URL,
- jazykové varianty pomocí
hreflang, - Open Graph metadata,
- metadata pro sociální sítě,
- informace pro roboty,
- správné stavové HTTP kódy.
Duplicita adres je problém nejen pro klasické SEO.
Pokud se například stejný obsah zobrazuje na pěti různých URL, robot musí řešit, která adresa je vlastně hlavní.
Strukturovaná data – Schema.org
Jednou z nejdůležitějších technických vrstev moderního webu jsou strukturovaná data.
Nejde o text určený návštěvníkovi.
Jedná se o strojově čitelnou informaci, která robotům explicitně říká:
Toto je firma.
Toto je produkt.
Toto je cena.
Toto je adresa firmy.
Toto je telefon.
Toto je článek.
Toto je FAQ.
Toto je autor.
Toto je služba.
Nejčastěji se používá formát JSON-LD podle standardu Schema.org.
Google přímo uvádí, že strukturovaná data používá k lepšímu pochopení obsahu stránky.
U lokální firmy lze například využít strukturu typu LocalBusiness. Schema.org umožňuje popsat například adresu, telefon, lokalitu, logo, nabízené služby a další údaje.
Zjednodušený příklad:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "LocalBusiness",
"name": "Firma XY",
"url": "https://www.domena.cz",
"telephone": "+420123456789",
"address": {
"@type": "PostalAddress",
"addressLocality": "Uherské Hradiště",
"addressCountry": "CZ"
}
}
</script>U e-shopu mohou být strukturovanými daty popsány například produkty, ceny, dostupnost nebo další parametry.
Pro stroje je to výrazně jednoznačnější než pokoušet se všechny informace odhadovat pouze z grafického vzhledu stránky.
Obsah musí odpovídat na skutečné otázky zákazníků
Nestačí technicky správný web.
AI vyhledávání je postavené na otázkách.
Proto se mění také způsob tvorby obsahu.
Uživatel nehledá pouze:
„truhlář Uherské Hradiště“
ale může se ptát:
„Kdo mi v Uherském Hradišti vyrobí vestavěnou skříň na míru?“
„Kolik stojí kuchyň na míru?“
„Kdo přijede zaměřit kuchyň přímo domů?“
„Která firma vyrábí nábytek v okolí Uherského Hradiště?“
Pokud web na podobné otázky poskytuje kvalitní a jednoznačné odpovědi, dává AI systému více použitelných informací.
Proto při optimalizaci kontrolujeme také:
- stránky jednotlivých služeb,
- lokality,
- FAQ,
- produktové popisy,
- reference,
- kontaktní informace,
- informace o firmě,
- odborné články,
- jasnost a jednoznačnost textů.
Lokální dohledatelnost
Velká část AI dotazů bude lokální.
Například:
„Najdi mi pneuservis v Kunovicích.“
„Kde si nechám vyrobit pergolu ve Zlíně?“
„Kdo opravuje tepelná čerpadla v Uherském Hradišti?“
Pokud z webu není jednoznačně patrné, kde firma působí, AI tuto informaci nemá z čeho bezpečně zjistit.
Proto kontrolujeme například:
- adresu,
- město,
- region,
- obsluhované lokality,
- kontaktní stránku,
- strukturovaná data LocalBusiness,
- propojení jednotlivých služeb s lokalitou.
Není však správné vytvářet stovky prakticky totožných stránek pouze se změněným názvem obce.
Obsah musí být především kvalitní a užitečný.
Rychlost webu
Rychlost má význam nejen pro uživatele, ale také pro automatizované systémy.
Pokud robot požaduje stránku a server odpovídá několik sekund nebo opakovaně vrací chyby, je zpracování webu složitější a nákladnější.
Proto kontrolujeme:
- velikost HTML,
- obrázky,
- WebP/AVIF,
- lazy loading,
- JavaScript,
- CSS,
- databázové dotazy,
- cache,
- kompresi Brotli/GZIP,
- HTTP/2 nebo HTTP/3,
- rychlost serveru,
- CDN,
- načítání externích skriptů.
Google používá pro hodnocení uživatelského zážitku mimo jiné Core Web Vitals.
Aktuálně mezi hlavní metriky patří:
LCP – Largest Contentful Paint doporučená hodnota do 2,5 sekundy.
INP – Interaction to Next Paint doporučená hodnota pod 200 ms.
CLS – Cumulative Layout Shift doporučená hodnota pod 0,1.
Vyšší počet automatizovaných přístupů
Dříve web navštěvovali především uživatelé a několik hlavních vyhledávačů.
Dnes přibývají další automatizované systémy.
AI vyhledávače, indexery, agenti a další služby vytvářejí další vrstvu automatizovaného provozu.
U některých webů může být počet těchto přístupů významný.
Proto je potřeba kontrolovat:
- serverovou kapacitu,
- databázi,
- cache,
- počet požadavků,
- logy serveru,
- rate limiting,
- ochranu proti nekontrolovaným robotům,
- rozdíl mezi legitimním robotem a škodlivým scraperem.
Cílem není jednoduše „povolit všechny roboty“.
Cílem je umožnit přístup těm systémům, které pro web dávají smysl, a současně web chránit před nežádoucí automatizovanou zátěží.
Firewall a CDN nesmí omylem blokovat AI roboty
Toto je dnes velmi častý problém.
Web může mít správně nastavený robots.txt, ale před serverem může fungovat například:
- Cloudflare,
- Web Application Firewall,
- ochrana proti DDoS,
- ochrana proti botům,
- vlastní firewall.
Ta může robota zablokovat ještě předtím, než se k webu vůbec dostane.
OpenAI například upozorňuje, že ochrany webů mohou legitimní roboty blokovat a vracet jim odpověď 403 Forbidden.
Proto nestačí zkontrolovat pouze HTML stránky.
Je nutné kontrolovat celou cestu:
robot → DNS → CDN → firewall → server → aplikace → databáze
Bezpečnost webových stránek
S rozvojem automatizace a AI rostou také možnosti automatizovaného vyhledávání zranitelností, generování požadavků a analyzování webových aplikací.
Bezpečnost webu je proto stále důležitější.
Při technickém auditu kontrolujeme například:
- zastaralé knihovny,
- verze PHP a dalších technologií,
- zabezpečení formulářů,
- SQL injection,
- XSS,
- CSRF,
- přístupová práva,
- administrační rozhraní,
- upload souborů,
- API,
- hlavičky HTTP,
- SSL/TLS,
- chybové stránky,
- logování,
- ochranu proti brute-force útokům,
- rate limiting.
Důležité je rozlišovat mezi legitimním AI robotem a automatizovaným útočníkem, který se za robota pouze vydává.
Samotný text v User-Agent hlavičce není spolehlivý důkaz identity návštěvníka.
HTTP stavové kódy, přesměrování a canonical
Robot musí také správně pochopit, co se s konkrétní adresou stalo.
Proto kontrolujeme například:
200 OK stránka existuje.
301 Redirect stránka byla trvale přesunuta.
404 Not Found stránka neexistuje.
410 Gone obsah byl odstraněn.
429 Too Many Requests příliš mnoho požadavků.
5xx chyba serveru.
Pokud web místo skutečné chyby 404 zobrazí stránku s textem „produkt neexistuje“, ale vrací HTTP 200, robot může chybnou stránku považovat za platný obsah.
Interní prolinkování
Robot se musí po webu umět pohybovat.
Proto analyzujeme:
- hlavní menu,
- drobečkovou navigaci,
- odkazy mezi službami,
- odkazy mezi kategoriemi,
- související produkty,
- články,
- reference.
Důležitá stránka by neměla existovat jako „ostrov“, na který z webu nikde nevede odkaz.
Obrázky a další média
Také obrázky musí být správně popsány.
Kontrolujeme například:
- názvy souborů,
alttext,- rozměry,
- kompresi,
- lazy loading,
- dostupnost obrázku robotům,
- přístup přes CDN.
Například soubor:
IMG_45892.jpg
nedává žádnou informaci.
Naproti tomu:
kuchyne-na-miru-uherske-hradiste.jpg
spolu se správným ALT popisem poskytuje podstatně více kontextu.
llms.txt – nový standard ve vývoji
V souvislosti s AI se stále častěji diskutuje také soubor:
/llms.txt
Jde o návrh standardu, jehož cílem je nabídnout AI agentům stručný a dobře strukturovaný přehled důležitých informací o webu.
Může obsahovat například:
- popis společnosti,
- hlavní části webu,
- důležité dokumenty,
- odkazy na služby,
- dokumentaci,
- další informace vhodné pro zpracování LLM.
Důležité je zdůraznit, že llms.txt zatím není univerzální internetový standard s garantovanou podporou všech AI systémů.
Jde však o zajímavý doplněk, který se rychle rozvíjí a u některých projektů má smysl jej připravit. Návrh vznikl v roce 2024 a postupně se dále vyvíjí.
Nesmí však nahrazovat kvalitní HTML, strukturovaná data, sitemap nebo správný robots.txt.
Monitoring AI robotů
Po provedení úprav je vhodné sledovat, kdo web skutečně navštěvuje.
Z logů serveru můžeme zjistit například:
- Googlebot,
- OAI-SearchBot,
- GPTBot,
- ClaudeBot,
- Claude-SearchBot,
- další roboty.
Můžeme sledovat:
- počet jejich návštěv,
- požadované URL,
- chybové odpovědi,
- rychlost serveru,
- množství přenesených dat,
- neobvyklou zátěž.
Díky tomu lze konfiguraci postupně upravovat podle skutečného provozu.
Co tedy znamená „připravit web na AI“?
Nejedná se o instalaci jednoho pluginu ani přidání jednoho META tagu.
Kompletní příprava webu zahrnuje kombinaci několika oblastí:
Obsah
- jasné popsání služeb a produktů,
- lokalita,
- FAQ,
- odborné informace,
- správná hierarchie textu.
Kód
- sémantické HTML,
- metadata,
- canonical,
- hreflang,
- správné HTTP odpovědi,
- strukturovaná data JSON-LD.
Přístup robotů
- robots.txt,
- sitemap.xml,
- kontrola OAI-SearchBot,
- Claude-SearchBot,
- Googlebot,
- dalších relevantních robotů.
Výkon
- rychlost,
- cache,
- databázové dotazy,
- obrázky,
- JavaScript,
- Core Web Vitals.
Bezpečnost
- ochrana aplikace,
- aktualizace technologií,
- firewall,
- ochrana proti škodlivým robotům,
- rate limiting.
Monitoring
- serverové logy,
- návštěvy AI robotů,
- chybové stavy,
- zatížení serveru.
Proč to řešit právě nyní?
Internetové vyhledávání prochází jednou z největších změn za poslední roky.
Google zůstává mimořádně důležitý, ale vedle něj se uživatelé stále více ptají přímo AI asistentů.
Firmy by proto měly připravovat web současně pro dva světy:
klasické vyhledávače
a
AI vyhledávání a AI asistenty.
Dobře připravený web má výhodu v tom, že jeho obsah mohou automatizované systémy snadněji:
- najít,
- načíst,
- pochopit,
- správně zařadit,
- spojit s konkrétní firmou,
- spojit s lokalitou,
- spojit s produktem nebo službou,
- použít jako zdroj odpovědi.
A právě o to při přípravě webu na umělou inteligenci jde.
Jak postupujeme při AI auditu webových stránek
V rámci našeho auditu nejprve web analyzujeme pomocí interního AI agenta a následně výsledky kontroluje náš tým.
Prověřujeme technickou, obsahovou i provozní část webu.
Následně provedeme odsouhlasené úpravy zaměřené zejména na:
- připravenost pro AI vyhledávače,
- klasické SEO,
- roboty a jejich přístup na web,
- strukturovaná data,
- kód a HTML strukturu,
- rychlost webu,
- bezpečnost,
- zatížení serveru,
- mobilní zobrazení,
- technickou kvalitu webu.
Po dokončení zákazník obdrží podrobný audit a report provedených úprav, ve kterém je uvedeno, co bylo na webu zkontrolováno, upraveno a optimalizováno.
Cílem není hledat chyby v původním webu.
Cílem je přizpůsobit existující web novému prostředí, které vzniká s rozvojem umělé inteligence, AI vyhledávání a automatizovaného zpracování internetového obsahu.
Chcete zjistit, zda je váš web připraven na AI?
Pokud máte webové stránky vytvořené před několika lety, je velmi pravděpodobné, že v době jejich vzniku dnešní AI vyhledávače, jejich roboti a současné požadavky ještě vůbec neexistovaly.
Proto nabízíme kompletní AI audit a modernizaci webových stránek, která připraví web na další vývoj internetového vyhledávání.
Součástí je samotná analýza, technické testování, realizace odsouhlasených úprav a závěrečný podrobný report.
Nastavení