AI matomumo stebėjimo duomenys nėra visiškai patikimi. Kadangi generatyvūs modeliai dažnai pateikia skirtingus atsakymus, informacijos suvestinėje pateikiamos citatos ir reitingai yra tik nuolat besikeičiančio tikslo momentinės nuotraukos, o ne fiksuoti faktai.
Skirtumas tarp jūsų ir konkurento gali būti tikras arba tik matavimų svyravimas. Naujame IQRush dokumente, kuris turi būti išleistas kitą savaitę (turėjome išankstinę prieigą), pateikiamas būdas juos atskirti, parodydamas, kad joks fiksuotas duomenų kiekis negali galutinai išspręsti klausimo.
Straipsnį parašė Ronas Sielinskis, vienas iš IQRush įkūrėjų, parduodančių programinę įrangą, kuri matuoja AI matomumą taip, kaip teigiama straipsnyje. Priežastis, dėl kurios verta skirti laiko, yra ta, kad atskira komanda balandžio mėn. paskelbė panašų pakartotinio matavimo rezultatą, todėl „IQRush“ nėra vienintelis, pateikęs šį atvejį.
Kiek juda šie skaičiai
Pakartotinai pateikiant užklausą SearchGPT, Gemini ar Perplexity tuo pačiu klausimu, kiekvieną kartą gali būti gaunami skirtingi šaltiniai. Jie sukurti taip, kad kiekvienas atsakymas būtų atsitiktinis, todėl kiekviena citata yra tik vienas iš daugelio galimų URL adresų, kuriuos ji galėjo gauti. Ankstesnis to paties autoriaus darbas ištyrė šį kintamumą, parodydamas, kad, pavyzdžiui, bandant SearchGPT su bėgimo įranga, Tom's Guide sudarė apie 9,5 % citatų, o Runner's World – maždaug 6,0 %. Prietaisų skydelyje Tom's Guide pasirodė dažniau, tačiau dėl didelės paklaidos skaičiai sutapo. Turint tik vieną pavyzdį, nebuvo tikslu sakyti, kad „Tom's Guide“ pranoko „Runner's World“, nes 3,5 taško skirtumas buvo paklaidos ribose. Naujajame dokumente siekiama užkirsti kelią šiai klaidai, sprendžiant paprastą, bet dažnai nepastebimą klausimą: kiek reikia duomenų, kad reitingai būtų tikrai prasmingi?
Kai reitingu verta pasitikėti
Atsakymas susideda iš dviejų dalių ir abi turi būti teisingos, kad reitingas būtų patikimas. Pirma, tvarka turi nustoti keistis.
Iš pradžių reitingai gali dažnai keistis, kai pridedami nauji atsakymai, nes dar nė viena svetainė neturi aiškios pranašumo. Tik surinkus pakankamai atsakymų geriausios svetainės pradeda aiškiai išsiskirti, todėl tvarka stabilizuojasi. Be to, svarbu, kad geriausios svetainės būtų gerai nutolusios viena nuo kitos; jei jie yra labai arti, reitingas gali būti nereikšmingas, nes įtempta konkurencija tikrai neparodo, kas iš tikrųjų yra priekyje. Straipsnyje nagrinėjama, ar skirtumas tarp geriausių svetainių yra didesnis nei kiekvienos iš jų paklaidos riba. Kai yra, reitingas atspindi tikrą skirtumą. Kai jo nėra, tai tikriausiai tik statistinis triukšmas. Abi sąlygos turi būti teisingos tuo pačiu metu, vienos vienos neužtenka. Atliekant 30 platformos temų testų, atsakymų, kurių reikėjo, kad būtų įvykdytos abi sąlygos, skaičius svyravo nuo 33 iki 94, skaičiuojant tik atsakymus su citatomis.
Trys iš 30 nepasiekė šio taško net po 125 klausimų – visi „SearchGPT“, kur populiariausios svetainės buvo per panašios, kad jas būtų galima atskirti. Visur nėra vienos ribos; tai, kas tinka vienai platformai ir temai, gali netikti kitai.
Mes apėjome tai
Sausio mėnesį aptariau „SparkToro“ atradimą, kad AI įrankiai pateikia skirtingą rekomenduojamų prekių ženklų sąrašą daugiau nei 99 % atvejų, kai užduodate tą patį klausimą. Tame straipsnyje vienas klausimas liko neatsakytas: kiek kartų reikia paklausti, kol rezultatai stabilizuosis? Šiame dokumente pateikiamas aiškiausias mano sutiktas atsakymas.
Tam tyrimui vadovavęs Randas Fishkinas dalijasi naudingais patarimais. Prieš išleidžiant pinigus dirbtinio intelekto matomumui stebėti, jis siūlo įsitikinti, kad jūsų paslaugų teikėjas „parodo savo matematiką“. IQRush popierius yra puikus būdas tai padaryti, nes jame pateikiama paprasta stabdymo taisyklė, todėl jums nereikia pasikliauti vien intuicija, kiek pabėgimų pakanka.
Tai taip pat atitinka daugybę tyrimų, kuriuos SEJ nagrinėjo per pastaruosius metus. Kiekvienas iš jų pateikia AI citatų numerius, tarsi jie būtų fiksuoti. Šis apsisuka, ištiria patį matavimą ir klausia, ar tie skaičiai pakankamai stabilūs, kad būtų galima palyginti.
Ką tai keičia jūsų ataskaitoms
Skaičius prietaisų skydelyje yra tik vienas pavyzdys. Prieš pasitikėdami, patikrinkite, ar jūsų stebėjimo priemonė pakartotinai atlieka tą patį patikrinimą ir praneša apie diapazoną, ar vieną kartą renka duomenis ir rodo švarų skaičių. Švari figūra iš tikrųjų gali būti įspėjamasis ženklas, o ne patikinimas.
Pakeitus turinį lengva suprasti neteisingai. Pavyzdžiui, „SearchGPT“ šaltinių dalies padidėjimas trimis taškais gali atrodyti kaip įrodymas, kad jūsų pastangos pasiteisino, tačiau toks pokytis gali priklausyti nuo natūralaus nuoseklių paleidimų kintamumo, remiantis pirminio dokumento duomenimis.
Norėdami gauti laimėjimą, matuokite prieš ir po daugiau nei vieną kartą. Vienas skaitymas prieš ir po negali atskirti jūsų pasikeitimo nuo įprasto triukšmo.
Platforma, kurią vertinate, pakeičia jums reikalingų duomenų kiekį, o ne taip, kaip spėtumėte. Tai priklauso nuo to, kiek kiekvienas atsakymas turi nepriklausomos informacijos, o ne nuo citatų, kurias jis jums pateikia. Dvyniai kaupia citatas tose pačiose saujelės svetainių viename atsakyme, todėl daugelis tų citatų jums sako tą patį. „SearchGPT“ pateikia mažiau citatų vienam atsakymui, bet jas paskirsto, todėl kiekvienas atsakymas pateikia daugiau nepriklausomos informacijos, nei rodo neapdorotas skaičius. Tas pats atsakymų skaičius dviejuose varikliuose nesuteikia tokio paties pasitikėjimo, o biudžetas, kuris nusistovėjo Dvyniams, gali leisti spėlioti „SearchGPT“.
Kartais sąžiningas atsakymas yra toks, kad dar negali pasakyti. Trys iš 30 testų niekada aiškiai neatskirdavo geriausių svetainių pagal biudžetą. Tiems tinkamas raginimas yra laikyti, o ne skelbti reitingą, kurio duomenys nepalaiko. Stebėjimo priemonė, galinti pasakyti, kad „nepakanka duomenų“, yra verta daugiau nei ta, kuri kiekvieną kartą paprašius atspausdina patikimą užsakymą.
Reitingo viršūnė yra ta dalis, kurią galite labiausiai apginti. Turėdami pakankamai atsakymų, lyderiai atsitraukia nuo vidurio ir uodegos, nors net ir jie nėra tikslūs. Klaidos ribos greitai plečiasi žemiau priekinės dalies, kol gretimos pozicijos yra apversta moneta, ir net 10 geriausių nebuvo be dėmių, o tipinė paklaida 10 geriausių svetainių yra maždaug penkios pozicijos, o viena iš penkių platesnė nei 10. Pasitikėk lyderiais, vertinkite vidurį ir apačią kaip grubią ir nepraneškite tikslių pozicijų už sąrašo priekio.
Ko popierius neįrodo
Nė vienas iš šių dalykų nėra baigtas, recenzuotas tyrimas. Tai išankstinis spausdinimas, sukurtas remiantis 30 platformos temų testų trijuose varikliuose, naudojant klausimus, sugeneruotus naudojant ChatGPT, o ne realias vartotojų paieškas, per vieną rinkinio atkarpą. Tikslūs skaičiai nebus aiškiai perkelti į jūsų temas, todėl traktuokite juos kaip problemos formą, o ne kaip paieškos lentelę.
Šie skaičiai apima tik atsakymus, kuriuose buvo citatos, o tai svarbiausia SearchGPT, nes dalis jo klausimų iš viso nepateikia citatų. Vienoje temoje 125 klausimai pateikė 104 tinkamus atsakymus, 17 proc. praleista, todėl jums reikės pateikti daugiau klausimų, nei rodo iš viso.
Metodo patikrinimas taip pat yra vidinis. Straipsnyje anksti paskelbtas reitingas lyginamas su tos pačios kolekcijos galutiniu reitingu, o ne su jokia išorine tiesa. Tai patikrina, ar stabdymo taisyklė atitinka pati save, todėl nesusijusios komandos atitikimo rezultatas čia tikrai veikia. To balandžio mėnesio darbo autoriai Julius Schulte, Malte Bleeker ir Philipp Kaufmann yra Sent Galeno universiteto mokslininkai. Jie paleido atskirą duomenų rinkinį ir padarė tą patį sprendimą, kad vienas rodmuo yra nepatikimas ir jūs turite pakartotinai imti variklio pavyzdžius, kad pasitikėtumėte tuo, ką jis jums sako.
Kur tai eina
Straipsnyje nutrūksta tai, ko norės dauguma žmonių. Tai yra būdas sužinoti savo vykdomąjį biudžetą prieš pradedant rinkti. Sielinskis palieka tai vėlesniam darbui ir pažymi, kad skaičius priklauso nuo kiekvienos platformos citavimo modelio formos, todėl vieno universalaus biudžeto tikriausiai nebus.
Didesnis pokytis yra tas, kad dirbtinio intelekto matomumo ataskaitos yra nukreiptos taip, kaip jau buvo teikiamos skelbimų ir analizės ataskaitos, link skaičių, kuriuose yra paklaida, o ne klaidingas kablelis. Taip nutinka, kol vis dar trūksta pagrindinės santechnikos, nes „Search Console“ vis tiek nenurodys, kurie paspaudimai buvo gauti iš AI. Kol to nepadarysite, jūs turite atlikti patikrinimą daugiau nei vieną kartą ir pranešti apie diapazoną, o ne vieną numerį, kurį jums įteikia jūsų prietaisų skydelis.
Daugiau išteklių
Teminis vaizdas: Lipnus/Shuttertstock


