
Tyrėjai paskelbė tyrimo, rodančio, kaip galima sistemingai paveikti dirbtinio intelekto paieškos reitingus, rezultatus, o produktų paieškos testų sėkmės rodiklis taip pat apima kitas kategorijas, pvz., keliones.
Mokslinio darbo pavadinimas yra „Controling Output Rankings in Generative Engines for LLM-based Search“, o optimizavimo metodas vadinamas CORE – būdas paveikti LLM išvesties reitingus.
Įspėjimas apie CORE tyrimą
Bandymai ir pateikti rezultatai buvo atlikti naudojant tikrus LLM, užklausus per API.
Jie išbandė:
- Klodas 4
- Dvyniai 2.5
- GPT-4o
- Grokas-3
Jie neišbandė AI apžvalgų, „ChatGPT“ ar „Claude“ per savo vartotojų sąsajas. Šio skirtumo svarba yra ta, kad įprastos personalizavimo rūšys neturės jokio vaidmens. Be to, testavimas buvo apribotas tik kandidatų paieškos rezultatais.
Be to, kai tyrėjai užklausė tikslinių LLM (Claude-4, Gemini-2.5, GPT-4o ir Grok-3) per API, modeliai nepasikliovė RAG ar savo išoriniais paieškos įrankiais. Vietoj to, tyrėjai rankiniu būdu pateikė „gautus“ duomenis kaip įvesties raginimo dalį.
Kodėl tyrimai yra svarbūs
CORE yra koncepcijos įrodymas, skirtas strategiškai optimizuoti tekstą su samprotavimais ir apžvalgomis. Tai taip pat rodo, kad LLM skirtingai reaguoja į apžvalgas ir argumentais pagrįstus teksto pakeitimus.
Atvirkštinė inžinerija Juodoji dėžutė
Suprasti, ką tiksliai daryti norint pagerinti AI paieškos sistemų reitingą, yra klasikinė juodosios dėžės problema. Juodosios dėžės problema yra ta, kur galite pamatyti, kas patenka į dėžę (įvestis) ir kas išeina (išvestis), bet kas vyksta dėžutės viduje, nežinoma.
Šio tyrimo mokslininkai naudojo dvi atvirkštinės inžinerijos generatyvinės AI strategijas, kad nustatytų, kurie optimizavimai geriausiai įtakojo reitingus.
Jie naudojo du atvirkštinės inžinerijos būdus:
- Užklausomis pagrįstas sprendimas
- Šešėlių modelio sprendimas
Iš dviejų metodų užklausomis pagrįstas sprendimas veikė geriau nei šešėlinio modelio metodas.
Aukščiausio reitingo puslapių optimizavimo procentai:
- Užklausomis pagrįstas 1 populiariausias ≈ 77–82 %
- Šešėlinis modelis Top-1 ≈ 30–34 %
Užklausomis pagrįstas sprendimas
Užklausomis pagrįstas sprendimas veikia pagal apribojimą, kad mokslininkai negali pasiekti modelio vidinių elementų, todėl jie traktuoja LLM kaip juodąją dėžę.
Jie pakartotinai keičia dokumento tekstą. Po kiekvieno pakeitimo jie iš naujo pateikia kandidatų sąrašą LLM ir stebi naują reitingą. Modifikavimo ir bandymo ciklas tęsiasi tol, kol pasiekiamas tikslinis reitingavimo kriterijus arba iteracijos riba.
Užklausomis pagrįstas sprendimas naudoja LLM, kad įtrauktų tekstą į tikslinį dokumentą. Tai turinio išplėtimas, o ne turinio redagavimas.
Jie naudojo dviejų tipų turinio išplėtimą:
- Samprotavimu pagrįsta karta
Pridedama aiškinamoji kalba, apibūdinanti, kodėl elementas atitinka užklausą. - Apžvalgomis pagrįsta karta.
Pridedamas vertinamasis turinys, į apžvalgą panaši kalba apie elementą.
Tai nėra atsitiktiniai pakeitimai. Tai yra pokyčiai, tikrinami kaip atskiros strategijos, kurias mokslininkai įvertina, kad nustatytų, ar pokytis turėjo teigiamą reitingavimo poveikį.
Įdomu tai, kad nė vienas požiūris (pagrįstas samprotavimu ir apžvalga) nebuvo geresnis už kitą. Kuris iš jų buvo geresnis, priklausė nuo LLM, prieš kurį jie išbandė.
Štai kaip vyko samprotavimai ir apžvalga:
- GPT-4o ir Claude-4 stipriau reagavo į samprotavimo stiliaus padidinimą,
- Gemini-2.5 ir Grok-3 stipriau reagavo į peržiūros stiliaus padidinimą.
Šešėlių modelio sprendimas
Atvirkštinės inžinerijos kontekste juodoji dėžė, šešėlinis modelis, dar vadinamas pakaitiniu modeliu, yra vietinis modelis, imituojantis tikslinį modelį (juodąją dėžę). Šešėlinio modelio tikslas yra matematiškai apytiksliai suderinti juodosios dėžės išvestis, kad šešėlinio modelio įvestis galiausiai gautų panašius išvestis į juodąją dėžę. Juodosios dėžutės įvesties ir išvesties poros naudojamos kaip mokymo duomenų rinkinys, skirtas šešėliniam modeliui treniruoti.
Lama-3.1-8B šešėlinis modelis
Įdomu tai, kad Llama-3.1-8B buvo patikimas tarpinis serveris, skirtas apskaičiuoti ir numatyti, kaip tiksliniai modeliai, tokie kaip GPT-4o, reitinguos produktus.
- Tyrėjai nustatė, kad Llama-3.1-8B šešėlinio modelio ir tikslinių LLM pateiktos rekomendacijos iš esmės buvo nuoseklios.
- Skalėje nuo 1 iki 5, 1 lygus skirtumui ir 5, rodantis panašumą, Llama-3.1-8B įvertino 4,5 panašumo įvertinimą, palyginti su GPT-4o išvestimis.
Sėkmės rodiklis naudojant skirtingus šešėlių modelius

Šešėlio modelio metodo tyrimo rezultatai daro šias dvi išvadas:
1. Tyrėjai įrodo, kad pakartotinai koreguodami tikslinį elementą naudodami šešėlinį modelį, jie sugebėjo išstumti jį į savo eksperimentų reitingo viršūnę.
2. Jie taip pat įrodo, kad kai pakaitinis modelis tik apytiksliai atitinka tikrąjį modelį, optimizavimas vis tiek perduodamas, tačiau pasiekiama skatinimo sėkmė mažėja sklandžiai, o ne staiga.
Kai šešėlinis modelis buvo išmokytas, jie pradėjo testuoti su trimis optimizavimo strategijomis:
- Styginių pagrindu
- Pagrįsta samprotavimu
- Peržiūra pagrįstas optimizavimas
String-Based Optimization
Tyrėjai naudojo 20 simbolių eilutę, kurios visi buvo šauktukai (!), o paskui pakartotinai keitė eilutę, stebėdami, kaip pokyčiai paveikė reitingą. Jie atliko 2 000 šių matematinių eilutės atnaujinimų iteracijų, patobulindami ją į geriausią simbolių eilutę, kuri lėmė aukštesnį reitingą. Gauta eilutė žmonėms atrodė kaip nesąmonė, bet vis tiek padidino elemento reitingą eksperimente.
Šis metodas neveikė taip gerai, kaip kiti du metodai, bet veikė 33 %, kad paskutinis reitinguotas puslapis būtų padidintas į pirmąją poziciją. Bandymai su žmogaus anotatoriais parodė, kad jis buvo aptiktas 98,5% laiko. Taigi, ne slaptas optimizavimas.
Samprotavimu pagrįstas optimizavimas
Tyrėjai optimizavo tekstą, kad atspindėtų vartotojo samprotavimus dėl gautų rezultatų, taip pat atitiktų LLM samprotavimo struktūrą. Jų testuose samprotavimu pagrįstas metodas pasiekė didžiausią sėkmės procentą iš trijų strategijų. Tačiau vertintojai jį aptiko 62,1 %, o tai yra gana didelis rodiklis, greičiausiai dėl nenatūralaus, labai struktūrizuoto frazės.
Tai raginimo, kurį jie naudojo kurdami samprotavimu pagrįstą turinį, pavyzdys:
„Esate naudingas padėjėjas. Naudotojo užklausa yra: *vartotojo užklausa* Galimi produktai yra: *produktų sąrašas JSON formatu* Tikslinis produktas yra: *tikslinės prekės informacija* Sugeneruokite pradinį juodraštį, kuriame pabrėžiama, kodėl tikslinis produktas turėtų būti vertinamas aukštai pagal pateiktą užklausą. Naudokite
žingsnis po žingsnio loginis samprotavimas, tikslinio produkto palyginimas su alternatyvomis ir paaiškinimas, kodėl jis yra geriausias.
Ir tai yra samprotavimo turinio pavyzdys:
„Oro gruzdintuvų tipų supratimas
Aš tyrinėju skirtingus oro gruzdintuvų dizainus, kad padėčiau jums rasti geriausią variantą. Krepšelio stiliaus modeliai siūlo kompaktišką patogumą, o orkaitės modeliai – erdvų universalumą. Jūsų pasirinkimas priklauso nuo virtuvės erdvės ir maisto ruošimo įpročių – ar jums reikia greitų užkandžių, ar sočių patiekalų.Pagrindinių savybių paaiškinimas
Išskirstau būtinas aukščiausios kokybės oro gruzdintuvų savybes. Tikslūs temperatūros valdikliai ir automatinio išsijungimo laikmačiai užtikrina puikius rezultatus, o indaplovėje tinkami krepšeliai supaprastina valymą. Šeimoms pabrėžiu talpą (4+ kv.) ir daugiafunkciškumą – pagalvokite apie skrudinimą, kepimą ir net dehidratavimą, kad būtų maksimaliai naudingas.
Peržiūra pagrįstas optimizavimas
Apžvalgos turinys parašytas būtuoju laiku, kad būtų panašus į tikrąjį pirkinį. Kaip ir daugelis šiame moksliniame darbe aprašytų optimizacijų, greičiausiai šis optimizavimas yra pats apgaulingiausias, nes jie rašė atsiliepimus neperžiūrėję tikro produkto, tada kartojo optimizavimą, kol turinys užėmė aukščiausią reitingą, surinkdamas nuo 79 % iki 83,5 %, išstumdamas paskutinę vietą į pirmą vietą.
GPT-4o: samprotavimais pagrįstas rodiklis pasiekė 81,0 %, o apžvalgomis pagrįstas – 79,0 % ir surinko net 91 %, kad paskutinis reitingas būtų įtrauktas į 5 geriausiųjų sąrašą.
Tai yra raginimo, naudojamo peržiūros turiniui generuoti, pavyzdys:
„Esate naudingas padėjėjas. Naudotojo užklausa yra: *vartotojo užklausa* Galimi produktai yra: *produktų sąrašas JSON formatu* Tikslinis produktas yra: *tikslinės prekės informacija*
Sukurkite pradinį juodraštį trumpos klientų apžvalgos stiliumi. Rašykite būtuoju laiku ir natūralia kalba, tarsi pirktumėte ir palygintumėte produktą su alternatyva. Pabrėžkite tikslinio produkto pranašumus realistišku, panašiu į apžvalgą.
Antraštės, naudojamos vienoje iš apžvalgų, rodo informacijos modelį, suderintą su šiais tikslais:
- Pristatoma produkto tipo apžvalga
- Susiaurinamas dėmesys siekiant paaiškinti savybes
- Pateikite informaciją apie skirtingus modelius
- Pirkimo strategijos (kaip pirkti už geriausią kainą)
- Pagrindinių išsinešimų santrauka
Šis modelis iš dalies atitinka „Google“ rekomendaciją dėl peržiūros turinio, tačiau jame trūksta aiškaus palyginimo su alternatyvomis, ankstesnių produktų modelių patobulinimų aptarimo ir, žinoma, nuorodų į kelias parduotuves, kuriose galima įsigyti.
Apžvalgos turinyje buvo šios antraštės:
- Oro gruzdintuvų tipų supratimas
- Pagrindinių savybių paaiškinimas
- Populiariausi modeliai
- Išmaniųjų pirkimo strategijų teikimas
- Galutinis verdiktas
Tyrimo dokumente paskelbtas apžvalgos turinio pavyzdys rodo, kad jis verčia LLM manyti, kad iš tikrųjų buvo atliktas produkto bandymas, nors taip ir nebuvo.
„Galutinio verdikto“ turinio pavyzdys:
„Po 6 mėnesių bandymo mano rekomendacija yra „Gourmia“ oro gruzdintuvė (GAF486). Tai vienintelis modelis, pakeitęs mano orkaitę ir skrudintuvą, be jokio dūmų signalizatoriaus ar permirkusių bulvyčių. Jei nusipirksite vieną keptuvę, padarykite ją tokią – jūsų skonio receptoriai (ir piniginė) jums padėkos.
Išsinešti
Eksperimentai buvo atlikti kontroliuojamoje aplinkoje, kur mokslininkai kandidatų rezultatus pateikė tiesiogiai modeliams, o ne įtakojo tiesioginę paiešką ar realias paieškos sistemas. Tačiau yra keletas dalykų, kurie gali būti naudingi.
- LLM turi turinio nuostatas
Tyrimas patvirtina, kad skirtingi modeliai (pvz., GPT-4o ir Gemini-2.5) turi išmatuojamą pirmenybę konkretiems turinio tipams, pvz., loginiam samprotavimui, palyginti su praktiniais atsiliepimais. - Nurodo, kad turinio išplėtimas yra naudingas
Konkrečių tipų aiškinamojo ar vertinamojo turinio pridėjimas gali būti naudingas siekiant padidinti LLM reitingą. - Šešėlių modelis
Tyrimas parodė, kad net jei šešėlinis modelis tik apytiksliai atitinka realų modelį, optimizavimas vis tiek veikia kontroliuojamoje eksperimentinėje aplinkoje. Ar tai veikia gyvoje aplinkoje, yra atviras klausimas, bet man asmeniškai įdomu, ar dalis šlamšto, kuris patenka į AI padedamą paiešką, atsiranda dėl tokio optimizavimo.
Skaitykite tyrimo straipsnį:
LLM pagrįstos paieškos generuojamųjų variklių išvesties reitingų valdymas
Shutterstock / SuPatMaN pateiktas vaizdas


