
„Google“ paskelbė apie paieškos balsu atnaujinimą, kuris keičia paieškos balsu užklausų apdorojimą ir reitingavimą. Naujasis AI modelis naudoja kalbą kaip įvestį paieškos ir reitingavimo procese, visiškai apeinant etapą, kai balsas paverčiamas tekstu.
Senoji sistema buvo vadinama Cascade ASR, kai balso užklausa konvertuojama į tekstą, o tada atliekama įprasta reitingavimo procedūra. Šio metodo problema yra ta, kad jis linkęs į klaidas. Garso į tekstą konvertavimo procesas gali prarasti kai kurias kontekstines nuorodas, o tai gali sukelti klaidą.
Naujoji sistema vadinama „Speech-to-Retrieval“ (S2R). Tai neuroniniu tinklu pagrįstas mašininio mokymosi modelis, parengtas naudojant didelius suporuotų garso užklausų ir dokumentų duomenų rinkinius. Šie mokymai leidžia apdoroti žodines paieškos užklausas (nekonvertuojant jų į tekstą) ir tiesiogiai susieti jas su atitinkamais dokumentais.
Dviejų kodavimo įrenginių modelis: du neuroniniai tinklai
Sistema naudoja du neuroninius tinklus:
- Vienas iš neuroninių tinklų, vadinamas garso koduotuvu, paverčia žodines užklausas į jų reikšmės vektorinę erdvę.
- Antrasis tinklas, dokumentų kodavimo įrenginys, pateikia rašytinę informaciją to paties tipo vektoriniu formatu.
Du koduotuvai išmoksta susieti sakytines užklausas ir tekstinius dokumentus į bendrą semantinę erdvę, kad susiję garso ir teksto dokumentai būtų arti vienas kito pagal jų semantinį panašumą.
Garso kodavimo įrenginys
„Speech-to-Retrieval“ (S2R) paima kieno nors balso užklausos garsą ir paverčia jį vektoriumi (skaičiais), atspindinčiu prasmę to, ko asmuo prašo.
Skelbime panaudotas garsaus Edvardo Muncho paveikslo „Klyksmas“ pavyzdys. Šiame pavyzdyje ištarta frazė „klyksmo paveikslas“ tampa tašku vektorinėje erdvėje šalia informacijos apie Edvardo Muncho „Klyksmą“ (pvz., muziejų, kuriame jis yra ir pan.).
Dokumentų kodavimo įrenginys
Dokumentų koduotuvas atlieka panašų veiksmą su tekstiniais dokumentais, pvz., tinklalapiais, paversdamas juos savais vektoriais, atspindinčiais tų dokumentų turinį.
Modelio mokymo metu abu koduotuvai mokosi kartu, kad garso užklausų ir dokumentų atitikimo vektoriai atsidurtų šalia vienas kito, o nesusiję vektoriai yra toli vienas nuo kito vektorinėje erdvėje.
Turtingas vektorinis vaizdavimas
„Google“ pranešime sakoma, kad kodavimo įrenginiai paverčia garsą ir tekstą į „turtingas vektorines reprezentacijas“. Turtingas vektorinis vaizdavimas yra įterpimas, užkoduojantis garso ir teksto prasmę ir kontekstą. Jis vadinamas „turtingu“, nes jame yra ketinimas ir kontekstas.
S2R atveju tai reiškia, kad sistema nepasitiki raktinių žodžių atitikimu; ji konceptualiai „supranta“, ko vartotojas prašo. Taigi net jei kas nors pasakys „parodyk man rėkiantį Muncho veido piešinį“, tos užklausos vektorinis vaizdas vis tiek atsidurs šalia dokumentų apie „The Scream“.
Remiantis „Google“ pranešimu:
„Šio modelio raktas yra tai, kaip jis yra apmokytas. Naudodama didelį suporuotų garso užklausų ir susijusių dokumentų duomenų rinkinį, sistema išmoksta reguliuoti abiejų kodavimo įrenginių parametrus vienu metu.
Mokymo tikslas užtikrina, kad garso užklausos vektorius būtų geometriškai artimas atitinkamų dokumentų vektoriams vaizdavimo erdvėje. Ši architektūra leidžia modeliui išmokti kažką arčiau esminio tikslo, reikalingo norint gauti tiesiai iš garso, apeinant trapų tarpinį kiekvieno žodžio transkribavimo žingsnį, kuris yra pagrindinė pakopinio dizaino silpnybė.
Reitingavimo sluoksnis
S2R turi reitingavimo procesą, kaip ir įprasta teksto paieška. Kai kas nors pasako užklausą, garsą pirmiausia apdoroja iš anksto paruoštas garso kodavimo įrenginys, kuris paverčia jį skaitine forma (vektoriumi), fiksuojančiu, ką asmuo turi omenyje. Tada šis vektorius lyginamas su „Google“ indeksu, kad būtų rasti puslapiai, kurių reikšmės labiausiai panašios į ištartą užklausą.
Pavyzdžiui, jei kas nors sako „klyksmo paveikslas“, modelis paverčia šią frazę vektoriumi, atspindinčiu jos prasmę. Tada sistema peržiūri savo dokumentų rodyklę ir randa puslapius, kuriuose yra vektorių, kurie yra artimi, pvz., informaciją apie Edvardo Muncho klyksmą.
Nustačius tikėtinus atitikmenis, pradedamas atskiras reitingavimo etapas. Ši sistemos dalis sujungia pirmojo etapo panašumo balus su šimtais kitų reitingavimo signalų, susijusių su tinkamumu ir kokybe, kad nuspręstų, kurie puslapiai turėtų būti reitinguojami pirmiau.
Lyginamoji analizė
„Google“ išbandė naująją sistemą prieš „Cascade ASR“ ir „Cascade ASR“, vadinamą „Cascade Groundtruth“, puikiai įvertinusią versiją. S2R įveikė Cascade ASR ir beveik atitiko Cascade Groundtruth. „Google“ padarė išvadą, kad našumas yra daug žadantis, tačiau yra kur dar tobulinti.
Paieška balsu veikia tiesiogiai
Nors lyginamoji analizė atskleidė, kad yra kur tobulėti, „Google“ paskelbė, kad naujoji sistema veikia ir naudojama keliomis kalbomis, vadindama ją nauja paieškos era. Manoma, kad sistema naudojama anglų kalba.
Google paaiškina:
„Paiešką balsu dabar veikia naujasis kalbos atkūrimo variklis, kuris gauna atsakymus tiesiai iš jūsų žodinės užklausos, pirmiausia nekonvertuojant jos į tekstą, todėl paieška bus greitesnė ir patikimesnė visiems.
Skaityti daugiau:
„Speech-to-Retrieval“ (S2R): naujas požiūris į paiešką balsu
Teminis vaizdas, kurį sukūrė „Shutterstock“ / „ViDI Studio“.




