Ketvirtadienį „Google DeepMind“ pasidalijo SIMA 2, naujos kartos bendrojo dirbtinio intelekto agento, kuris integruoja „Gemini“ – didelio „Google“ kalbos modelio – kalbą ir samprotavimo galias, tyrimo apžvalga, kad būtų lengviau suprasti ir bendrauti su aplinka.
Kaip ir daugelis „DeepMind“ projektų, įskaitant „AlphaFold“, pirmoji SIMA versija buvo išmokyta naudoti šimtus valandų vaizdo žaidimų duomenų, kad išmoktų žaisti kelis 3D žaidimus kaip žmogus, net kai kuriuos žaidimus, kuriuose ji nebuvo mokoma. SIMA 1, pristatytas 2024 m. kovą, galėjo vadovautis pagrindinėmis instrukcijomis įvairiose virtualiose aplinkose, tačiau sudėtingų užduočių atlikimo sėkmės rodiklis buvo tik 31 %, o žmonėms – 71 %.
„SIMA 2 yra žingsnis pokytis ir patobulintos SIMA 1 galimybės“, – spaudos konferencijoje sakė DeepMind vyresnysis mokslo darbuotojas Joe Marino. „Tai bendresnis agentas. Jis gali atlikti sudėtingas užduotis anksčiau nematytoje aplinkoje. Ir tai yra save tobulinantis agentas. Taigi jis iš tikrųjų gali tobulėti remdamasis savo patirtimi, o tai yra žingsnis link bendresnės paskirties robotų ir AGI sistemų apskritai.”

SIMA 2 maitina Gemini 2.5 „flash-lite“ modelis, o AGI reiškia dirbtinį bendrąjį intelektą, kurį „DeepMind“ apibrėžia kaip sistemą, galinčią atlikti daugybę intelektualinių užduočių, galinčią išmokti naujų įgūdžių ir apibendrinti žinias įvairiose srityse.
„DeepMind“ mokslininkai teigia, kad darbas su vadinamaisiais „įkūnytais agentais“ yra labai svarbus bendram intelektui. Marino paaiškino, kad įkūnytas agentas sąveikauja su fiziniu ar virtualiu pasauliu per kūną – stebi įvestis ir atlieka veiksmus panašiai kaip robotas ar žmogus, o neįkūnytas agentas gali sąveikauti su jūsų kalendoriumi, užsirašyti pastabas ar vykdyti kodą.
DeepMind mokslininkė Jane Wang, turinti neurologijos išsilavinimą, sakė „TechCrunch“, kad „SIMA 2“ yra daug daugiau nei žaidimas.
„Prašome, kad ji iš tikrųjų suprastų, kas vyksta, suprastų, ko vartotojas jo prašo, ir tada galėtų reaguoti sveiku protu, o tai iš tikrųjų yra gana sunku“, – sakė Wang.
Techcrunch renginys
San Franciskas
|
2026 m. spalio 13-15 d
Integruodama Dvynius, SIMA 2 padvigubino savo pirmtako našumą, sujungdama pažangius Gemini kalbos ir samprotavimo gebėjimus su įkūnytais įgūdžiais, išugdytais treniruočių metu.
Marino demonstravo SIMA 2 filme „No Man's Sky“, kur agentas apibūdino jo apylinkes – uolėtą planetos paviršių – ir nustatė tolesnius veiksmus, atpažindamas nelaimės švyturį ir sąveikaudamas su juo. SIMA 2 taip pat naudoja Dvynius, kad galėtų samprotauti. Kitame žaidime, paprašytas nueiti iki prinokusio pomidoro spalvos namo, agentas parodė savo mąstymą – prinokę pomidorai raudoni, todėl turėčiau eiti į raudoną namą – tada jį rado ir priėjo.
Būti Dvynių varikliu taip pat reiškia, kad SIMA 2 vadovaujasi jaustukais pagrįstomis instrukcijomis: „Jūs jam nurodysite 🪓🌲 ir jis nukirs medį“, – sakė Marino.
Marino taip pat pademonstravo, kaip SIMA 2 gali naršyti naujai sukurtuose fotorealistiniuose pasauliuose, sukurtuose Genie, DeepMind pasaulio modelio, teisingai identifikuoti ir sąveikauti su tokiais objektais kaip suolai, medžiai ir drugeliai.

Marino pridūrė, kad Dvyniai taip pat leidžia tobulėti be daug žmonių duomenų. Kai SIMA 1 buvo apmokytas tik žmogaus žaidimo, SIMA 2 naudoja jį kaip pagrindą, kad sukurtų tvirtą pradinį modelį. Kai komanda perkelia agentą į naują aplinką, ji paprašo kito Dvynių modelio sukurti naujas užduotis ir atskiro atlygio modelio, kad įvertintų agento bandymus. Naudodamas šias savarankiškai sukurtas patirtis kaip mokymo duomenis, agentas mokosi iš savo klaidų ir palaipsniui veikia geriau, iš esmės mokydamas save naujo elgesio per bandymus ir klaidas, kaip tai darytų žmogus, vadovaudamasis DI, o ne žmonių atsiliepimais.
„DeepMind“ mano, kad SIMA 2 yra žingsnis link bendresnės paskirties robotų atrakinimo.
„Jei mes galvojame apie tai, ką sistema turi atlikti, kad atliktų užduotis realiame pasaulyje, pavyzdžiui, robotas, manau, kad ją sudaro du komponentai“, – per spaudos konferenciją sakė „DeepMind“ vyresnysis tyrimų inžinierius Fredericas Besse. „Pirma, yra aukšto lygio supratimas apie realų pasaulį ir tai, ką reikia padaryti, taip pat tam tikri samprotavimai.
Jei paprašysite roboto humanoidų jūsų namuose patikrinti, kiek pupelių skardinių turite spintoje, sistema turi suprasti visas skirtingas sąvokas – kas yra pupelės, kas yra spinta – ir nukeliauti į tą vietą. Besse sako, kad SIMA 2 labiau paliečia šį aukšto lygio elgesį nei žemesnio lygio veiksmus, kuriuos jis vadina valdant tokius dalykus kaip fiziniai sąnariai ir ratai.
Komanda atsisakė pasidalinti konkrečiu SIMA 2 diegimo fizinėse robotikos sistemose tvarkaraščiu. Besse pasakojo „TechCrunch“, kad „DeepMind“ neseniai pristatyti robotikos pagrindų modeliai, kurie taip pat gali mąstyti apie fizinį pasaulį ir sukurti daugiapakopius planus misijai užbaigti, buvo mokomi skirtingai ir atskirai nuo SIMA.
Nors taip pat nėra termino, kada išleisti daugiau nei SIMA 2 peržiūrą, Wang sakė „TechCrunch“, kad tikslas yra parodyti pasauliui, su kuo dirba „DeepMind“, ir pamatyti, koks bendradarbiavimas ir galimi panaudojimai yra įmanomi.




