„Google“ darbuotojai Gary Illyes ir Martin Splitt paskelbė podcast'ą apie Googlebot, paaiškindami, kad tai ne tik vienas atskiras dalykas, bet ir šimtai skirtingų produktų ir paslaugų tikrinimo programų, kurių dauguma nėra viešai dokumentuotos.
Kas yra Googlebot
Gary paaiškina, kad pavadinimas „Googlebot“ yra istorinis pavadinimas, kilęs iš pirmųjų dienų, kai „Google“ turėjo tik vieną tikrinimo programą. Taip nebėra, nes „Google“ naudoja daugybę tikrintuvų skirtinguose produktuose, tačiau „Googlebot“ pavadinimas įstrigo, nors tai nebėra vienas dalykas.
Be to, jis paaiškina, kad „Googlebot“ nėra pati tikrinimo infrastruktūra ar atskira sistema. „Googlebot“ iš tikrųjų yra vienas klientas, sąveikaujantis su didesne vidine tikrinimo paslauga – infrastruktūra.
Martinas Splittas paklausė:
„Kaip įsivaizduoju Googlebot? Kaip apytiksliai atrodo mūsų tikrinimo infrastruktūra?”
Gary atsakė:
„Turiu galvoje, vadinti jį Googlebotu, tai klaidinga pavardė. Ir tai yra kažkas, kas tais laikais, galbūt 2000-ųjų pradžioje, veikė gerai, nes tada tikriausiai turėjome vieną tikrintuvą, nes turėjome vieną produktą. Bet netrukus po to, kai pasirodė kitas produktas, manau, tai buvo AdWords. Tada pradėjome turėti daugiau tikrintuvų, tada atsirado daugiau produktų, o vėliau ir daugiau tikrintuvų.
Tačiau „Googlebot“ pavadinimas kažkaip įstrigo. Apskritai, kai kalbėjome apie mūsų tikrinimo infrastruktūrą, buvome linkę ją vadinti „Googlebot“, bet tai buvo labai netikslu, nes „Googlebot“ buvo tik vienas dalykas, kuris bendravo su mūsų tikrinimo infrastruktūra.
Nuskaitymo infrastruktūra turi pavadinimą
Toliau Gary paaiškina, kad tikrinimo infrastruktūra turi vidinį „Google“ pavadinimą, tačiau jis atsisakė pasakyti, koks tai pavadinimas.
Jis tęsė:
„Googlebot nėra mūsų tikrinimo infrastruktūra. Mūsų tikrinimo infrastruktūra neturi išorinio pavadinimo. Ji turi vidinį pavadinimą. Nesvarbu, kas tai yra. Pavadinkime jį Jack. Ir tai yra, nežinau, kaip tai apibūdinti. Tai programinė įranga kaip paslauga, jei norite. SaaS. Tiesa? Taigi, Jack turi tuos API galinius taškus, taip sakant. Ir tada galite iškviesti interneto API galinius taškus.
Ir tada, kai atliekate tuos API iškvietimus, taip pat turite nurodyti kai kuriuos parametrus, pvz., kiek laiko norite laukti, kol baitai sugrįš arba kokia yra jūsų vartotojo priemonė, kurią norite siųsti? Kas yra robots.txt produkto prieigos raktas, kuriam norite paklusti, ir visi šie parametrai.
Ir mes nustatome numatytąjį parametrą daugeliui šių dalykų, ne visiems, bet daugumai šių dalykų. Taigi paprastai galite jų praleisti, todėl, manau, šie skambučiai tampa paprastesni, nes jums nereikia nurodyti visų dalykų. Bet kitu atveju tai tik API iškvietimas į kažką debesyje arba atsitiktiniame duomenų centre. Ir tada tai atliks jums, kaip programinės įrangos kūrėjui ar gaminiui, parengimą.
Taigi šis produktas, nes šiuo metu galime jį vadinti produktu, net jei jis yra vidinis, jis egzistuoja labai, labai, labai, labai ilgą laiką. …Bet iš esmės ji visada darė tą patį. Iš esmės jūs tai pasakote, atsinešate ką nors iš interneto nepažeisdami interneto. Ir tada ji tai padarys, jei tai leis svetainės apribojimai. tiek. Lyg jei norėčiau tai išdėstyti vienu sakiniu, taip ir būtų.
Šimtai paieškos robotų SEO, kurių nežino
Ne visos „Googlebot“ tikrinimo programos yra dokumentuotos, yra daug tokių, apie kurias SEO nežino. Gary teigė, kad daugelis vidinių „Google“ komandų naudoja tikrinimo infrastruktūrą įvairiems tikslams. Jis sakė, kad potencialiai yra dešimtys ar šimtai vidinių tikrinimo programų, tačiau viešai dokumentuojamos tik pagrindinės tikrinimo programos.
Mažesnės arba mažos apimties tikrinimo programos dažnai nėra dokumentuojamos dėl praktinių apribojimų, tačiau jei tikrinimo programa tampa pakankamai didelė, ją galima peržiūrėti ir dokumentuoti.
Atsižvelgdamas į temą, kad yra keli klientai (tikrintuvai), Gary tęsė:
„… bandome dokumentuoti didelę jų dalį, bet „Google” yra didelė įmonė, todėl yra daug komandų, kurios nori gauti iš interneto. Taigi yra daug tikrintuvų, daug pavadintų tikrintuvų, o tai reiškia, kad mums reikės dokumentuoti dešimtis, jei ne šimtus skirtingų tikrintuvų arba specialių tikrintuvų ar paėmimų.”
Gary paaiškina, kad neįmanoma dokumentuoti šimtų skaitytuvų.
„Ir paprastame HTML puslapyje to padaryti neįmanoma. Taigi bandome nubrėžti liniją ir pasakyti, kad jei tikrinimo programa tikrai mažytė, t.
Galime pabandyti su tuo susidoroti kitaip, bet šiuo metu iš esmės dokumentuojami tik pagrindiniai skaitytuvai, specialūs tikrintuvai ir paėmimai, nes tiesiogine prasme dėl vietos trūkumo.
Skirtumas tarp tikrintuvų ir gaudyklių
Gary paaiškina, kad yra tikrintuvų ir gaudyklių, kurie patenka į „Googlebot“ kategoriją, bet iš tikrųjų yra skirtingi dalykai.
Jis paaiškina, kuo skiriasi:
„Taigi paprasčiausias būdas tai paaiškinti yra toks, kad tikrintuvai dirba paketiniu būdu, o tada gaudytojai dirba pagal individualų URL, o tai reiškia, kad jūs pateikiate URL gavimo priemonėms, o tada ji pateiks tik vieną URL. Negalite pateikti URL sąrašo, kurį reikia gauti.
Tada tikrintuvams tai yra nuolatinis URL srautas, kuris nuolat veikia jūsų komandai, o jūsų komandai siunčiamas iš interneto.
Be to, mes taip pat turime šią politiką, kurios gavimas turi būti tam tikru būdu kontroliuojamas naudotojo. Iš esmės kitame gale yra kažkas, kuris laukia gautojo atsakymo.
Naudojant skaitytuvus, tiesiog darykite tai, kai turite laiko.
Martinas ir Gary sako, kad yra daug tikrintuvų ir neštuvų, kuriuos jie naudoja viduje ir kurie nėra dokumentuoti. Gary paaiškino, kad turi įrankį, kuris suaktyvina įspėjimą, kai tikrinimo programa ir parsinešimo programa peržengia tam tikrą tikrinimų ir paėmimų per dieną slenkstį, o paskui kreipsis į komandą, atsakingą už tikrinimus, kad sužinotų, ką ji daro ir kodėl, taip pat patikrins, ar nieko nedaro netyčia. Jei tai tikrinimo programa, kuri pastebimai gauna daug URL, jis nuspręs, ar tai dokumentuoti, kad žiniatinklio ekosistema apie tai sužinotų.
Klausykite „Search Off The Record Podcast“ čia:
Teminis vaizdas, sukurtas Shutterstock / TarikVision




