„Google“ gali išplėsti nepalaikomų robots.txt taisyklių sąrašą savo dokumentuose, remdamasi realių robots.txt duomenų, surinktų naudojant HTTP archyvą, analize.
Gary Illyesas ir Martinas Splittas aprašė projektą naujausioje „Search Off the Record“ serijoje. Darbas prasidėjo po to, kai bendruomenės narys pateikė „Google“ robots.txt saugykloje užklausą, siūlydamas dvi naujas žymas įtraukti į nepalaikomą sąrašą.
Illyesas paaiškino, kodėl komanda išplėtė taikymo sritį ne tik dviejose PR žymose:
„Stengėmės nedaryti dalykų savavališkai, o rinkti duomenis.
Užuot pridėjusi tik dvi siūlomas žymas, komanda nusprendė pažvelgti į 10 ar 15 dažniausiai naudojamų nepalaikomų taisyklių. Illyesas teigė, kad tikslas buvo „padorus atskaitos taškas, tinkamas pradinis taškas“ dokumentuojant dažniausiai pasitaikančias nepalaikomas žymes laukinėje gamtoje.
Kaip veikė tyrimas
Komanda naudojo HTTP archyvą, kad ištirtų, kokias taisykles svetainės naudoja savo robots.txt failuose. HTTP archyvas kas mėnesį tikrina milijonus URL adresų naudodamas WebPageTest ir išsaugo rezultatus sistemoje „Google BigQuery“.
Pirmasis bandymas atsitrenkė į sieną. Komanda „greitai suprato, kad niekas iš tikrųjų neprašo robots.txt failų“ per numatytąjį tikrinimą, o tai reiškia, kad HTTP archyvo duomenų rinkiniuose paprastai nėra robots.txt turinio.
Pasikonsultavusi su Barry Pollardu ir HTTP archyvo bendruomene, komanda parašė tinkintą JavaScript analizatorių, kuris eilutė po eilutės ištraukia robots.txt taisykles. Tinkinta metrika buvo sujungta prieš vasario mėnesio tikrinimą, o gauti duomenys dabar pasiekiami „BigQuery“ duomenų rinkinyje custom_metrics.
Ką rodo duomenys
Analizatorius ištraukė kiekvieną eilutę, atitinkančią lauko, dvitaškio ir reikšmės šabloną. Illyesas aprašė gautą paskirstymą:
„Po leidimo ir neleidimo bei vartotojo agento sumažėjimas yra labai drastiškas.
Be šių trijų laukų, taisyklių naudojimas patenka į ilgą mažiau paplitusių direktyvų uodegą, taip pat nepageidaujamus duomenis iš sugadintų failų, kurie grąžina HTML, o ne paprastą tekstą.
Šiuo metu „Google“ palaiko keturis robots.txt laukus. Šie laukai yra vartotojo agentas, leisti, neleisti ir svetainės schema. Dokumentuose sakoma, kad kiti laukai „nepalaikomi“, neįvardijant, kurie nepalaikomi laukai dažniausiai pasitaiko laukinėje gamtoje.
„Google“ paaiškino, kad nepalaikomi laukai yra ignoruojami. Dabartinis projektas išplečia šį darbą nustatydamas konkrečias taisykles, kurias „Google“ planuoja dokumentuoti.
Tikimasi, kad 10–15 dažniausiai naudojamų taisyklių be keturių palaikomų laukų bus įtrauktos į „Google“ nepalaikomų taisyklių sąrašą. Illyesas neįvardijo konkrečių taisyklių, kurios bus įtrauktos.
Rašybos klaidų tolerancija gali padidėti
Illyesas teigė, kad analizė taip pat atskleidė dažnai pasitaikančias neleidimo taisyklės rašybos klaidas:
„Tikriausiai ketinu išplėsti rašybos klaidas, kurias mes priimame.”
Jo frazė reiškia, kad analizatorius jau priima kai kurias rašybos klaidas. Illyesas neįsipareigojo laikytis laiko juostos ir neįvardijo konkrečių rašybos klaidų.
Kodėl tai svarbu
„Search Console“ jau pateikia kai kurias neatpažintas robots.txt žymas. Jei „Google“ dokumentuoja daugiau nepalaikomų direktyvų, jos viešieji dokumentai gali labiau atspindėti neatpažintas žymas, kurias žmonės jau mato „Search Console“.
Žvilgsnis į priekį
Planuojamas atnaujinimas turės įtakos „Google“ viešiesiems dokumentams ir tai, kaip tvarkomos neleistinos rašybos klaidos. Kiekvienas, prižiūrintis failą robots.txt su taisyklėmis, išskyrus vartotojo agentą, leisti, neleisti ir svetainės schemą, turėtų patikrinti, ar nėra direktyvų, kurios niekada neveikė „Google“.
HTTP archyvo duomenys gali viešai pateikti užklausą „BigQuery“ visiems, kurie nori tiesiogiai ištirti platinimą.
Panašus vaizdas: ekrano kopija iš: YouTube.com/GoogleSearchCentral, 2026 m. balandžio mėn.


