
Dauguma geriausių naujienų leidėjų blokuoja dirbtinio intelekto mokomuosius robotus naudodami robots.txt, tačiau jie taip pat blokuoja paieškos robotus, kurie nustato, ar svetainės rodomos AI sugeneruotuose atsakymuose.
„BuzzStream“ išanalizavo 100 populiariausių JAV ir JK naujienų svetainių robots.txt failus ir nustatė 79 % blokuoti bent vieną mokomąjį botą. Dar labiau 71 % taip pat blokuoti bent vieną paieškos arba tiesioginės paieškos robotą.
Mokomieji robotai renka turinį, kad sukurtų AI modelius, o paieškos robotai realiu laiku atneša turinį, kai vartotojai užduoda klausimus. Svetainės, blokuojančios paieškos robotus, gali nepasirodyti, kai dirbtinio intelekto įrankiai bando nurodyti šaltinius, net jei pagrindinis modelis buvo apmokytas jų turinio.
Ką rodo duomenys
„BuzzStream“ išnagrinėjo 50 geriausių naujienų svetainių kiekvienoje rinkoje, remdamasi „SmatherWeb“ srauto dalimi, tada panaikino sąrašo pasikartojimus. Tyrimo metu robotai buvo suskirstyti į tris kategorijas: mokymas, paieška / tiesioginė paieška ir indeksavimas.
Mokomieji botų blokai
Tarp mokomųjų robotų dažniausiai buvo užblokuotas „Common Crawl's CCBot“ – 75 proc., po to seka „Anthropic-ai“ – 72 proc., „ClaudeBot“ – 69 proc., o „GPTBot“ – 62 proc.
„Google-Extended“, kuri treniruoja Dvynius, buvo mažiausiai užblokuotas treniruočių robotas – 46 proc. JAV leidėjai užblokavo 58 %, beveik dvigubai daugiau nei 29 % JK leidėjų.
Harry Clarkson-Bennett, „The Telegraph“ SEO direktorius, sakė „BuzzStream“:
„Leidėjai blokuoja dirbtinio intelekto robotus naudodami robots.txt, nes beveik nėra keitimosi vertėmis. LLM nėra skirtos siųsti persiuntimo srautą, o leidėjams (vis tiek!) reikia srauto, kad išliktų.
Atkūrimo robotų blokai
Tyrimas parodė, kad 71% svetainių blokuoja bent vieną paieškos arba tiesioginės paieškos robotą.
„Claude-Web“ užblokavo 66% svetainių, o „OpenAI“ „OAI-SearchBot“, kuri palaiko „ChatGPT“ tiesioginę paiešką, užblokavo 49 proc. „ChatGPT“ naudotojas buvo užblokuotas 40 proc.
Perplexity-User, kuri apdoroja vartotojo inicijuotas paieškos užklausas, buvo mažiausiai užblokuotas – 17%.
Indeksavimo blokai
„PerplexityBot“, kurią „Perplexity“ naudoja savo paieškos korpuso puslapiams indeksuoti, užblokavo 67 % svetainių.
Tik 14% svetainių užblokavo visus tyrime stebėtus AI robotus, o 18% neužblokavo nė vieno.
Vykdymo spraga
Tyrime pripažįstama, kad robots.txt yra direktyva, o ne kliūtis, ir robotai gali į tai nepaisyti.
Mes pašalinome šią įgyvendinimo spragą, kai „Google“ Gary Illyes patvirtino, kad robots.txt negali apsaugoti nuo neteisėtos prieigos. Tai veikiau kaip ženklas „Prašome nesišalinti“, o ne kaip užrakintos durys.
Clarkson-Bennett iškėlė tą patį dalyką „BuzzStream“ ataskaitoje:
„Failas robots.txt yra direktyva. Tai tarsi ženklas, kuriame sakoma, prašome nesilaikyti, bet nestabdo nepaklusnaus ar piktybiškai prijungto roboto. Daugelis jų akivaizdžiai nepaiso šių nurodymų.”
„Cloudflare“ dokumentavo, kad „Perplexity“ naudojo slaptą tikrinimą, kad apeitų robots.txt apribojimus. Bendrovė pakeitė IP adresus, pakeitė ASN ir suklastojo savo vartotojo agentą, kad jis būtų rodomas kaip naršyklė.
„Cloudflare“ pašalino „Perplexity“ kaip patikrintą robotą ir dabar jį aktyviai blokuoja. „Perplexity“ užginčijo „Cloudflare“ teiginius ir paskelbė atsakymą.
Leidėjams, rimtai norintiems blokuoti AI tikrinimo programas, gali prireikti CDN lygio blokavimo arba roboto pirštų atspaudų, išskyrus robots.txt direktyvas.
Kodėl tai svarbu
Čia reikia atkreipti dėmesį į paieškos blokavimo numerius. Daugelis leidėjų ne tik atsisako dalyvauti AI mokymuose, bet ir atsisako citavimo ir atradimo sluoksnio, kurį AI paieškos įrankiai naudoja šaltiniams atskleisti.
OpenAI atskiria tikrinimo programas pagal funkcijas: GPTBot renka treniruočių duomenis, o OAI-SearchBot teikia tiesioginę paiešką ChatGPT. Vieno blokavimas neužblokuoja kito. „Perplexity“ panašiai skiria „PerplexityBot“, skirtą indeksavimui, ir „Perplexity-User“, skirtą paieškai.
Šie blokavimo pasirinkimai turi įtakos, iš kur AI įrankiai gali gauti citatas. Jei svetainė blokuoja paieškos robotus, jis gali nepasirodyti, kai naudotojai AI padėjėjų prašo atsakymų į šaltinį, net jei modelyje jau yra tos svetainės turinio iš mokymo.
Verta žiūrėti „Google Extended“ modelį. JAV leidėjai jį blokuoja beveik dvigubai didesne nei JK norma, tačiau iš duomenų neaišku, ar tai atspindi skirtingus rizikos skaičiavimus, susijusius su „Gemini“ augimu, ar skirtingus verslo santykius su „Google“.
Žvilgsnis į priekį
Robots.txt metodas turi apribojimų, o svetainėms, norinčioms blokuoti AI tikrintuvus, CDN lygio apribojimai gali būti veiksmingesni nei vien robots.txt.
„Cloudflare“ metų apžvalgoje nustatyta, kad „GPTBot“, „ClaudeBot“ ir „CCBot“ turėjo daugiausiai visiško neleidimo direktyvų populiariausiuose domenuose. Ataskaitoje taip pat pažymima, kad dauguma leidėjų naudoja dalinius „Googlebot“ ir „Bingbot“ blokus, o ne visus blokus, o tai atspindi dvigubą „Google“ tikrinimo programos vaidmenį paieškos indeksavime ir AI mokyme.
Tiems, kurie stebi AI matomumą, reikia žiūrėti paieškos robotų kategoriją. Mokymo blokai turi įtakos būsimiems modeliams, o gavimo blokai – tai, ar jūsų turinys rodomas AI atsakymuose šiuo metu.
Teminis vaizdas: Kitinut Jinapuck / Shutterstock




