
Paskutiniame DOJ vs Google bandomajame dokumente radau įdomių dalykų. „Google“ apskundė sprendimą, kuriame teigiama, kad konkurentams reikia pateikti patentuotą informaciją.

Pagrindiniai patiekalai:
- „Google“ buvo įpareigota teikti informaciją konkurentams, kad nebūtų neteisėta monopolija. „Google“ nenori atiduoti savo plačių naudotojo duomenų.
- „Google“ duomenys apie puslapio kokybę ir naujumą yra nuosavybės teise. Jie nenori to atiduoti.
- Indeksuoti puslapiai pažymėti komentaraisįskaitant signalus, identifikuojančius šlamšto puslapius.
- Jei nepageidaujamo e. pašto siuntėjai gautų tuos šlamšto signalus, būtų sunku sustabdyti šlamštą.
- Naudotojo duomenys yra svarbūs „Google“ klijų sistemai kurioje saugoma informacija apie kiekvieną ieškotą užklausą, ką naudotojas matė ir kaip jis sąveikavo su paieškos rezultatais.
- Vartotojo duomenys yra svarbūs treniruojant RankEmbed BERT – viena iš giluminio mokymosi sistemų už paieškos.
Gerai, pereikime prie įdomių dalykų!
„Google“ turi patentuotus puslapio kokybės ir šviežumo signalus
Tai tikrai nėra staigmena. Man buvo įdomu, kad šviežumo signalai yra „Google“ patentuotų paslapčių pagrindas.

Vėlgi, čia daugiau apie „Google“ patentuotų šviežumo signalų svarbą:

Puslapiai, kurie yra tikrinami, yra pažymėti „Patentuotais puslapių supratimo komentarais“
Kiekvienas „Google“ indekso puslapis yra pažymėtas komentarais, kad būtų lengviau suprasti puslapį. Tai yra signalai, skirti atpažinti šlamštą ir pasikartojančius puslapius. Jau rašiau apie tai, kaip kiekvienas indekso puslapis turi šlamšto balą.

Šlamšto balai gali būti naudojami inžinierių reitingavimo sistemoms pakeisti
„Google“ nenori dalytis informacija su savo konkurentais apie šiuos balus.

Jei šlamšto balai pasišalins, tai gali sukelti daugiau šlamšto siuntimo ir „Google“ sunkiau kovoti su šlamštu.

„Google“ sudaro indeksą naudodama šiuos pažymėtus puslapius
Puslapiai, prie kurių „Google“ pridėjo puslapių supratimo komentarus, yra suskirstyti pagal tai, kaip dažnai „Google“ tikisi, kad turinys turės būti pasiekiamas ir koks turinys turi būti šviežias.

Tik dalis puslapių patenka į „Google“ indeksą
„Google“ teigia, kad konkurentams suteikus indeksuotų URL sąrašą, jie galės „atsisakyti tikrinti ir analizuoti didesnį žiniatinklį, o sutelkti pastangas į tikrinti tik dalį puslapių, kuriuos „Google“ įtraukė į savo indeksą. Šio indekso kūrimas „Google“ kainuoja daug laiko ir pinigų. Jie nenori to duoti nemokamai.

Vartotojo duomenų vaidmuo „Google“ reitingavimo sistemose
Tai įdomiausia dalis. Manau, kad nekreipiame pakankamai dėmesio į tai, kaip „Google“ naudoja naudotojų duomenis. (Laikykitės mano YouTube kanalas nes netrukus išleisiu labai įdomų vaizdo įrašą su savo mintimis apie tai, kaip tokie svarbūs vartotojo duomenys – tikriausiai pats svarbiausias veiksnys „Google“ reitingavimo sistemose.)
Vartotojo duomenys naudojami GLUE ir RankĮdėjimo modeliams kurti
„Google Glue“ yra didžiulė vartotojų veiklos lentelė. Jame renkamas ieškomų užklausų tekstas, vartotojo kalba, vieta ir įrenginio tipas bei informacija apie tai, kas pasirodė SERP, ką vartotojas spustelėjo ar užvedė pelės žymeklį, kiek laiko jis išbuvo SERP ir kt.
RankEmbed BERT yra dar įdomesnis. RankEmbed BERT yra viena iš giluminio mokymosi sistemų, kuriomis grindžiama paieška. Į Pandu Najakas parodymus, sužinojome, kad RankEmbed BERT naudojamas perskirstant tradicinių reitingavimo sistemų pateiktus rezultatus. RankEmbed BERT yra apmokyta spustelėti ir pateikti užklausų duomenis iš tikrųjų vartotojų.
Paieškos AI sistemos nuolat mokosi tobulėti, kad ieškantiems būtų pateikti patenkinami rezultatai. „Google“ žiūri, ką jie spustelėja ir ar jie grįžta į SERP, ar ne. „Google“ taip pat vykdo tiesioginius eksperimentus, kuriuose atsižvelgiama į tai, ką ieškantys asmenys pasirenka spustelėti ir likti. Šie veiksmai padeda apmokyti RankEmbed BERT. Jis dar labiau patikslintas pagal kokybės vertintojų įvertinimus. Netrukus apie tai paskelbsiu daugiau. Noriu atkreipti dėmesį į tai, kad vartotojų pasitenkinimas yra pats svarbiausias dalykas, dėl kurio turėtume optimizuoti!
Iš Liz Reid dokumento, kurį šiandien analizuojame, matome, kad vartotojo duomenys naudojami mokant, kuriant ir valdant RankEmbed modelius.

Dar kartą sužinome, kad naudotojo duomenys, naudojami šiems modeliams mokyti, apima užklausą, vietą, paieškos laiką ir tai, kaip naudotojas sąveikavo su tuo, kas jiems buvo rodoma.

Čia kalbama apie veiksmus, kuriuos naudotojai atlieka „Google“ paieškos rezultatuose. Labai noriu sužinoti, kokį vaidmenį atlieka „Chrome“ duomenys. Ar „Google“ žiūri, ar žmonės domisi jūsų puslapiais, pildo jūsų formas, kuria jūsų receptus ir dar daugiau? Manau, kad taip. The šio teismo sprendimo santrauka užsimena, kad „Chrome“ duomenys naudojami reitingavimo sistemose, tačiau dalijamasi nedaug detalių.

„Google“ teigia, kad jei kas nors turėtų klijų ir įvertintų naudotojo duomenų įterpimą, jis galėtų išmokyti LLM.
Šie naudotojo duomenys yra „Google“ sėkmės raktas.

Verta perskaityti visą Liz Reid pareiškimas.
Daugiau išteklių:
Šis įrašas iš pradžių buvo paskelbtas Marie Haynes Consulting.
Teminis vaizdas: „N Universe“ / „Shutterstock“.


