
Baltųjų rūmų patarėjas mokslo klausimais Michaelas Kratsiosas teigė, kad „Moonshot“, Kinijos įmonė, už Kimi K3, didžiausio turimo atviro svorio LLM, sukūrė savo modelį nukopijuodama „Anthropic's Fable LLM“ ir naudodama lustus, kurių eksportas į Kiniją nėra leidžiamas.
„Didelio masto, slaptas pramoninis distiliavimas, kuriuo siekiama pavogti patentuotas JAV technologijas ir pakenkti Amerikos moksliniams tyrimams, yra nepriimtinas“, – rašė Kratsiosas, vykstant diskusijoms dėl Kinijos atviro svorio modelių uždraudimo, sukrėtusių dirbtinio intelekto sektorių. „Moonshot“ neatsakė į klausimus apie savo mokymo procesą, o Kratsiosas nepasidalijo daugiau informacijos apie savo kaltinimų šaltinius.
Kratsios tviteryje atkartojo iždo sekretoriaus Scotto Bessento komentarus, kad „daugelyje Kinijos modelių randame savo JAV didelių kalbų modelių vandens ženklus, ir tai nepriimtina“. Neaišku, iš ko susideda tie vandens ženklai, o Iždo departamentas į užklausą neatsakė.
Tačiau ekspertai skeptiškai vertina tai, kad distiliavimas – LLM užklausos procesas, siekiant nustatyti jo vidinį veikimą ir nukopijuoti jo galimybes – yra atsakingas už pažangias Kimi K3 galimybes.
„Nemanau, kad toks stiprus ir toks greitas modelis atsirastų ant Fable, atliekančio griežtą distiliavimą“, – „TechCrunch“ sakė Lodo instituto mokslininkas ir „Snorkel AI“ vienas iš įkūrėjų Bradenas Hancockas. „Tiesiog net nėra laiko, tiesa? „Fable“ buvo viešai prieinama tik nuo liepos 1 d. Negalite distiliuoti tiek duomenų, išmokyti modelio ir išleisti jį per dvi savaites.
„Manau, kad distiliavimas laikui bėgant darosi vis mažiau įtakingas, nes Kinijos modeliai artėja prie sienos ir mokymo režimas pereina prie (mokymosi sustiprinimo)“, – vakar paskelbtoje podcast'e sakė Nathanas Lambertas, AI tyrėjas iš Alleno AI instituto. „Jei taip būtų, kiekvienas galėtų lengvai pasivyti GLM arba K3, naudodamas jo duomenis distiliavimui. Tačiau mes to nepastebime arba nematysime vien dėl prižiūrimo tikslaus derinimo.”
Norint atlikti distiliavimą, laboratorija turi sistemingai pateikti užklausą dėl savo tikslinio modelio, kad gautų duomenis, kurie gali būti naudojami po mokymo. Kartais tai aiškiai reiškia, kad modelio prašoma suformuluoti savo minčių grandinę, kad suprastų, kaip jis sprendžia problemas. Kitais atvejais modelio raginimai ir atsakymai naudojami naujam modeliui apmokyti procese, vadinamame prižiūrimu koregavimu arba SFT.
Būtent dėl šio koregavimo proceso gali atsirasti modelis, kurį tariamai sukūrė trečioji šalis, teigdama, kad tai Klodas. Tikslus derinimas yra vieta, kur, Lamberto nuomone, „modelis įgauna savo manieras“.
Tačiau Lambertas sako, kad SFT pranašumai tampa mažiau svarbūs, nes modeliai tampa sudėtingesni. Norint distiliuoti į Fable panašias galimybes, greičiausiai reikės sustiprinti mokymosi metodus. Daugeliu atvejų tai reiškia, kad didesnio modelio agentas įvertina mažesnio modelio atsakymus ir koreguoja pagal įvertinimą.
Pažangesnėms technologijoms taip pat reikalinga didesnė infrastruktūra. Dideliems mokymosi pastiprinimui gali prireikti dešimčių milijonų agentų. Naudojant pasienio laboratorijos API tai padaryti „būtų beprotiškai brangu ir galbūt tai būtų laiko kliūtis, nes šie modeliai yra gana lėti ir, tiesą pasakius, gali net nepadidinti našumo“.
Atrodo, kad ankstesni pasienio modeliai galėjo prisidėti prie Kimi; Anthropic viešai apkaltino Moonshot, DeepSeek ir MiniMax sistemingai distiliuojant savo modelius anksčiau šiais metais. „Anthropic“ teigė atradusi milijonus mainų tarp savo modelių ir vartotojų, kuriuos identifikavo tose įmonėse per IP adresus ir kitus metaduomenis. Šios užklausos buvo „skirtos nuo įprastų naudojimo būdų, atspindinčios tyčinį pajėgumų išgavimą, o ne teisėtą naudojimą“. Anthropic neatsakė į TechCrunch užklausas apie Fable distiliavimą.
Tačiau distiliavimas yra įprastas tarp AI įmonių, ne tik Kinijoje. Elonas Muskas anksčiau šiais metais paliudijo, kad jo įmonė „SpaceXAI“ distiliavo „OpenAI“ modelius, kad sukurtų „Grok“, ir kad ši praktika buvo įprasta pramonėje. Pavyzdžiui, linija tarp distiliavimo ir sintetinių duomenų rinkinių kūrimo gali būti gana neryški.
„Apskritai, amerikiečiai neįvertina šių Kinijos komandų techninės patirties“, – sakė Hancockas. „Vienas iš „Moonshot” įkūrėjų buvo CMU doktorantas. Tai teisėti tyrėjai ir inžinieriai, dirbantys tvirtą darbą. …jei amerikietiški modeliai sustotų, manau, kad Kinijos pažanga sulėtėtų, bet vis tiek tęstųsi. Jie čia ne tik jodinėja.
Taip pat sunku atskirti distiliavimą iš antrosios Kratsios komentaro dalies – kad „Moonshot“ įsigijo pažangius „Nvidia“ lustus, „Grace Blackwell 300“ ir taip pat pasiekė GB300 įrengtus serverius Tailande. Pasak Džordžtauno saugumo ir naujų technologijų centro mokslinio bendradarbio Samo Bresnicko, tuos lustus draudžiama eksportuoti į Kiniją, tačiau juodoji rinka egzistuoja. Gegužę JAV serverių kūrėjo Supermicro įkūrėjui buvo pareikšti kaltinimai dėl pažangių lustų kontrabandos į Kiniją.
„Esu šalininkas, kad žinotumėte savo klientų įstatymus duomenų centrams visame pasaulyje”, – sakė Bresnickas. „Jei leidžiate įmonei surengti didžiulius mokymus naudojant naujausią aparatinę įrangą, turi būti ataskaitų mechanizmas, nurodantis, kas ta įmonė yra ir ką ji daro.
Prezidento Joe Bideno Prekybos departamentas 2024 m. pasiūlė federalines duomenų centrų „pažink savo klientus“ taisykles, tačiau atrodo, kad Donaldo Trumpo valdymo metu jokios pažangos nepadaryta. Tačiau eksportuotojai, gabenantys pažangius lustus į užsienį, turėtų užtikrinti, kad jie būtų naudojami tik patvirtintiems tikslams.
Kai perkate per mūsų straipsniuose pateiktas nuorodas, galime uždirbti nedidelį komisinį atlyginimą. Tai neturi įtakos mūsų redakcinei nepriklausomybei.




