Prejsť na hlavný obsah
TechSEO Vitals

Cloudflare čoskoro zablokuje Googlebota, ak ste zakázali trénovanie AI

Prepínač „Block AI bots“, ktorý ste vlani zapli, zablokuje aj Googlebota. Cloudflare posudzuje crawlery podľa všetkých účelov a platí to najprísnejšie pravidlo.

Zdieľať na

Vlani sa blokovanie AI botov zdalo ako jasný krok. Cloudflare to zjednodušil na jedno kliknutie. Kliklo veľa ľudí.

O pár týždňov začne to kliknutie blokovať Googlebota.

Žiadne varovanie. Žiadna preferencia v textovom súbore. Cloudflare zablokuje požiadavku ešte predtým, než si crawler stihne prečítať váš robots.txt.

Čo sa vlastne mení

Cloudflare teraz triedi boty podľa správania. Search, Agent, Training.

O pár týždňov sa zmenia dve veci. Tá, o ktorej sa píše všade, je nové predvolené nastavenie. Novým doménam Cloudflare zablokuje Training a Agent na stránkach s reklamou. Len novým doménam. Ak už váš web na Cloudflare beží, táto zmena sa vás nedotkne.

Tá druhá je dôvod, prečo toto čítate.

Cloudflare posudzuje crawlery podľa všetkého, čo robia, nie podľa jednej veci. Platí to najprísnejšie pravidlo.

Googlebot prechádza web pre Search. Prechádza ho aj pre Training. To isté platí pre Applebot a BingBot.

Takže ak máte zablokovaný Training, máte zablokovaného aj Googlebota. Cloudflare v oznámení priamo menuje všetky tri boty.

Vzťahuje sa to aj na starý prepínač „Block AI bots“. Nových nastavení ste sa nemuseli ani dotknúť. To staré tlačidlo sa počíta.

Zapli ste ho vlani. O pár týždňov prídete o Googlebota.

Najprv klesne crawl. Potom indexácia. Potom pozície. Search Console sa zaplní chybami, ktoré ukazujú na váš server. Nie na dashboard, ktorý ste od minulého leta neotvorili.

Prečo to robia

Takmer každý projekt, ktorý vediem, beží za Cloudflare. Stále je to najlepšia infraštruktúrna platforma, akú poznám. Jedno zlé predvolené nastavenie na tom nič nezmení.

A ich argument obstojí.

Ten istý crawler zbiera obsah pre vyhľadávanie aj pre tréning naraz. Povedať tréningu nie teda znamená prísť aj o vyhľadávanie. To nikdy nebola férová voľba.

Cloudflare sa rozhodol, že tréning sa už za vyhľadávanie schovávať nebude. Ak Google crawlera nerozdelí, Cloudflare ho berie ako oboje naraz.

Sám sa v tom ale neviem rozhodnúť.

Oddelené crawlery sú správny princíp. Ak si beriete môj obsah na tri účely, mal by som môcť jednému povedať áno a druhému nie.

Ani argument Googlu nie je hlúpy. Stránku už raz stiahli. Stiahnuť ju znova na iný účel znamená viac požiadaviek a väčšiu záťaž pre môj server, a to pre obsah, ktorý už majú.

Prejsť stránku raz a využiť ju viackrát je k vášmu webu šetrnejšie. Kto videl, ako mu AI crawlery búšia do servera, vie, prečo na tom záleží.

Obe strany majú kus pravdy. Rozdelením crawlera získate kontrolu, ale zaplatíte za ňu objemom prenesených dát. Nikto zatiaľ neprišiel s verziou, ktorá vyrieši oboje.

Jedno je isté. Cloudflare si vybral stranu. Tlak mieri na Google. V dosahu výbuchu ste aj vy.

Čo urobiť do 15. septembra

Otvorte si bezpečnostné nastavenia v Cloudflare. Skontrolujte, či nemáte zablokovaný Training, či už cez nové nastavenia AI trafficu, alebo cez starý prepínač.

Ak áno a chcete, aby Googlebot ďalej prechádzal váš web, nastavte si výnimku. Cloudflare má na to samostatné nastavenie: viacúčelové crawlery potom nechá na pokoji. Po tomto termíne to už nenastavíte.

A potom tá väčšia otázka. Čo vám blokovanie tréningu vlastne prinesie?

Ak je vaším produktom obsah, blokovanie tréningu je reálne biznisové rozhodnutie. Tú výnimku aj tak potrebujete. Blokovať tréning je jedna vec. Prísť o Google je druhá. Ešte do septembra sa dá urobiť to prvé bez toho druhého.

Takto by som to nastavil ja. Nastavte si výnimku z pravidla pre viacúčelové crawlery, aby Googlebot ďalej prechádzal váš web. A tréningové crawlery blokujte radšej podľa mena. Robots.txt pre tie, ktoré ho rešpektujú, a pravidlo na edge pre tie, ktoré nie.

Jednoúčelové boty blokujete podľa mena. Viacúčelové necháte na pokoji. Google si necháte a tréning nepustíte dnu.

Buďte však k sebe úprimní. Týka sa vás to vôbec? Pre väčšinu webov to nie je reálne rozhodnutie. SaaS, distribútor, e-shop. Za čítanie vášho obsahu by aj tak nikto nezaplatil. Blokovanie tréningu vás len vyradí z ďalšieho modelu.

Riadok, ktorý nerobí nič

Ak máte zapnutý managed robots.txt, Cloudflare vám do súboru zapísal blok, ktorý ste nenapísali vy. Text, ktorý znie ako právny dokument, a pod ním riadok typu Content-Signal: search=yes,ai-train=no.

Vyzerá to, že to máte pod kontrolou. Ale nemáte.

Muellera sa na to nedávno pýtali na Reddite. Pokiaľ vie, nepoužíva to žiadny crawler. Ani žiadny LLM. Nemá to vôbec žiadny účinok. Len vám to nafukuje súbor.

Cloudflare to ani veľmi nepopiera. Vo vlastnej dokumentácii označuje content signals za preferenciu, „namiesto priameho blokovania“.

Ak tréning povoľujete, tie riadky môžete nechať tak. Ničomu neuškodia. Len nič nerobia.

Ak ho blokujete, nespoliehajte sa na ne. Blokujte crawlery radšej podľa mena.

Chcem, aby to fungovalo

Tá myšlienka nie je zlá. Práve preto je to frustrujúce.

Robots.txt vznikol na to, aby povedal, kam crawler smie. Nikdy nevznikol na to, aby povedal, čo sa s vaším obsahom stane potom. Tá medzera je reálna a každý mesiac sa zväčšuje.

Riešenie nie je na papieri zložité. Cloudflare, Google, Microsoft a OpenAI v jednej miestnosti a dohoda na jednej sade pravidiel. Napísali by ich ľudia, ktorí crawlery vyvíjajú. A dodržiavali by ich preto, že si ich napísali sami.

Presne tak kedysi vznikol robots.txt. Nikto ho nevymáhal. Tí, na ktorých záležalo, sa jednoducho dohodli, že ho budú používať.

Také stretnutie si veľmi neviem predstaviť. Záujmy ťahajú opačným smerom. Google nemá dôvod pomáhať vám povedať tréningu nie. Cloudflare nemá dôvod čakať na Google.

Takže stavím na to, že to skončí v zákone. Nie v syntaxi, ktorú si vymyslela jedna firma. V reálnom pravidle, za ktorým stojí regulátor a ktoré crawlery dodržiavajú, lebo musia. Pri autorských právach sa Európa pohla prvá. Toto vyzerá na tú istú cestu.

Cloudflare nemá zlý nápad, len prišiel priskoro.

Niekto to ale musí napísať pre ľudí. Zatiaľ je to riadok s hodnotami oddelenými čiarkou v súbore, ktorý väčšina majiteľov webov nikdy neotvorila. Pod odsekom právneho textu.

Opýtal som sa pár kamarátov, ktorí majú vlastné weby, čo im ten riadok ai-train=no na webe robí. Nevedel nikto. Jeden ani netušil, že ho v robots.txt vôbec má.

Štandard, ktorý vám musí preložiť technický SEO špecialista, nie je hotový.

Postavte si tie dve nastavenia vedľa seba. To, ktoré znie ako oficiálne vyhlásenie, nerobí nič. To, ktoré znie ako drobný technický detail, vám dokáže stiahnuť Googlebota z webu.

Jedno z nich dostalo vlastné oznámenie, právny rámec a generátor. To druhé dostalo odsek.

Choďte si skontrolovať nastavenia.

Pôvodná verzia tohto článku je anglická. Do slovenčiny je preložená automaticky.

Martin Štěpánek

Martin Štěpánek

Konzultant enterprise technického SEO

Som konzultant enterprise technického SEO a vývojár. Vyše desať rokov som web staval, až potom som ho začal opravovať, a produkčný kód píšem dodnes. Čítam odpovede, ktoré váš web naozaj posiela, poviem vám, ktoré nálezy stoja za sprint, a opravu odovzdám vašim vývojárom sám.

Každé dva týždne

Newsletter o technickom SEO, ktorý vývojári aj SEO špecialisti naozaj dočítajú

Jeden konkrétny problém rozoberiem do detailu a poviem jasne, čo s ním. Porovnám to s primárnou dokumentáciou aj s tým, čo vidím v auditoch. A k tomu tri správy z posledných dvoch týždňov, ktoré vyberiem a vysvetlím.

Mersudin ForbesMersudin ForbesMark Williams-CookMark Williams-CookAleyda SolisAleyda Solis
Odporúčajú ho lídri v odbore

Prihlásiť sa

Nové vydanie každé dva týždne. Odhlásenie jedným klikom.

Iba v angličtine

Prihlásením súhlasím so Zásadami ochrany osobných údajov a Obchodnými podmienkami.

Žiadny spam. Odhlásenie kedykoľvek jedným klikom.
Poznámky z technického SEO