
„Google“ Johnas Muelleris atsakė į klausimą apie llms.txt, siūlomą standartą, skirtą parodyti svetainės turinį AI agentams ir nuskaitymams, sumenkinant jo naudingumą ir palygindamas jį su nenaudingu raktinių žodžių meta žyma, patvirtindama kitų, kurie ja naudojosi, patirtį.
Llms.txt
LLMS.TXT buvo lyginama su robotais.txt didelių kalbų modeliams, tačiau tai yra 100% neteisinga. Pagrindinis robotų.txt tikslas yra valdyti, kaip robotai nuskaito svetainę. LLMS.TXT pasiūlymas nėra susijęs su robotų valdymu. Tai būtų nereikalinga, nes standartas tam jau egzistuoja su robotais.txt.
LLMS.TXT pasiūlymas paprastai yra susijęs su LLM turinio rodymu su tekstiniu failu, kuriame naudojamas žymėjimo formatas, kad jie galėtų suvartoti tik pagrindinį tinklalapio turinį, visiškai neturintį reklamos ir svetainės navigacijos. „Markdown“ kalba yra žmogaus ir mašina skaitomas formatas, nurodantis antraštes su svaro ženklu (#), ir išvardija su minuso ženklu (-). Llms.txt daro keletą kitų dalykų, panašių į tą funkcionalumą, ir viskas, kas yra.
Kas yra llms.txt:
- Llms.txt nėra būdas valdyti AI robotus.
- Llms.txt yra būdas parodyti pagrindinį AI botų turinį.
- Llms.txt yra tik pasiūlymas, o ne plačiai naudojamas ir priimtas standartas.
Ši paskutinė dalis yra svarbi, nes ji susijusi su tuo, ką pasakė „Google“ Johnas Muelleris:
Llms.txt yra palyginamas su raktiniais žodžiais meta žyma
Kažkas pradėjo diskusiją „Reddit“ apie llms.txt paklausti, ar kas nors kitas pasidalino savo patirtimi, kad AI robotai nepatikrina savo llms.txt failų.
Jie rašė:
„Anksčiau šį mėnesį savo tinklaraščio„ Root AN LLM.TXT “failui pateikiau, tačiau dar nematau jokio poveikio mano nuskaitymo žurnalams. Tiesiog įdomu sužinoti, ar kas nors turi savo stebėjimo sistemą, E, ar tiesiog pasirinkote ką nors, kas vykdo įgyvendinimą.
Jei dar neįgyvendinote, man įdomu išgirsti jūsų mintis apie tai. “
Vienas toje diskusijoje asmuo pasidalino, kad juose yra daugiau nei 20 000 domenų ir kad jokie AI agentai ar robotai neatsisiunčia LLMS.TXT failų, tik nišiniai robotai, tokie kaip iš „Buildy“, yra tie failai.
Komentatorius rašė:
„Šiuo metu priglobia apie 20k domenų. Gali patvirtinti, kad jokie robotai iš tikrųjų nesigilina į juos, išskyrus kai kuriuos nišinius vartotojų agentus …”
Johnas Muelleris atsakė:
„Nei viena iš AI paslaugų nesakė, kad naudoja LLMS.TXT (ir jūs galite pasakyti, kai pažvelgsite į savo serverio žurnalus, kad jie net jo nepatikrina). Man tai yra panaši į raktinius žodžius meta-štai ką svetainės savininkas teigia, kad jų svetainė yra apie… (Ar svetainė tikrai tokia? Na, jūs galite ją patikrinti. Tuo metu, kodėl ne tik svetainė tiesiogiai?).
Jis teisus, nė viena iš pagrindinių AI paslaugų, „Anthropic“, „Openai“ ir „Google“, paskelbė apie siūlomo LLMS.TXT standarto palaikymą. Taigi, jei nė vienas iš jų iš tikrųjų nenaudoja to, kokia prasmė?
Muelleris taip pat iškelia tašką, kad failas llms.txt nereikalingas, nes kodėl verta naudoti tą žymėjimo failą, jei jau buvo atsisiųsta originalus turinys (ir struktūruoti duomenys)? Robotas, kuris naudoja LLMS.TXT, turės patikrinti kitą turinį, kad įsitikintumėte, jog jis nėra šlamštas, tad kodėl nerimauti?
Galiausiai, kas sustabdys leidėją ar SEO nuo vieno turinio rinkinio LLMS.txt iki „Spam AI Agents“ ir kito turinio rinkinio vartotojams ir paieškos sistemoms? Tokiu būdu sugeneruoti šlamštą yra per lengva, iš esmės užmaskuoti LLM.
Šiuo atžvilgiu labai panašu į raktinius žodžius meta žyma, kurios paieškos variklis nenaudoja, nes jis būtų per daug eskizinis, kad pasitikėtų svetaine, kad iš tikrųjų kalbama apie tuos raktinius žodžius, o paieškos varikliai yra geresni ir sudėtingesni šiais laikais apie turinio analizę, kad suprastų, apie ką kalbama.
Perskaitykite „LinkedIn“ diskusiją čia:
Llm.txt – kur mes esame?
Pateiktas „Shutterstock“/„Jemastock“ vaizdas

