Mistral AI je objavio Robostral Navigate, svoj prvi model namenjen takozvanoj embodied navigaciji, odnosno upravljanju robotima u fizičkom prostoru na osnovu vizuelnog unosa i tekstualnog zadatka. Model ima 8 milijardi parametara i, prema navodima kompanije, koristi samo jednu RGB kameru bez LiDAR-a i dubinskih senzora.
Kompanija tvrdi da je Robostral Navigate na R2R-CE testu, koji meri praćenje instrukcija u kontinuiranim okruženjima, ostvario 76,6 odsto uspeha na validacionom delu koji nije viđen tokom treninga. Mistral navodi i 79,4 odsto uspeha na viđenom validacionom skupu. Po tim rezultatima, model je, prema tvrdnji kompanije, bolji od najboljeg pristupa sa jednom kamerom za 9,7 poena i od najboljeg sistema sa dubinskim ili više kamera za 4,5 poena.
Šta model radi
Robostral Navigate je zamišljen za zadatke poput kretanja kroz kancelarije, stambene i poslovne objekte, kao i druge složene prostore. Korisnik zadaje instrukciju na prirodnom jeziku, a model treba da vodi robota do cilja i da ga zaustavi u odgovarajućem položaju. U demonstraciji koju je Mistral objavio, robot samostalno prolazi kroz više prostorija i prilagođava se preprekama u prostoru.
Prema kompaniji, ovakav pristup može da bude koristan u proizvodnji, logistici, dostavi i ugostiteljstvu. Ideja je da robot dobije jedan zadatak i izvrši ga bez dodatnog ljudskog vođenja tokom celog puta.
Kako funkcioniše navigacija
Mistral navodi da model koristi metodu zasnovanu na pokazivanju, odnosno pointing. To znači da Robostral Navigate predviđa koordinatu mesta ka kojem robot treba da se kreće u trenutnom prikazu kamere, zajedno sa željenom orijentacijom pri dolasku. U prevodu, model ne zavisi samo od metričkih pomeranja poput „idi dva metra napred“, već pokušava da razume gde se cilj nalazi u odnosu na ono što kamera trenutno vidi.
Kada cilj nije u kadru, model prelazi na lokalne pomeraje u koordinatnom sistemu robota. Mistral ističe da ovakav pristup može da pomogne pri robusnijem radu u različitim uslovima, jer je manje osetljiv na promene u kameri i razmeri prostora.
Trening i podaci
Kompanija tvrdi da je model razvijen potpuno interno i da ne zavisi od postojećih open-source vision-language modela, odnosno modela koji kombinuju obradu slike i jezika. Robostral Navigate je, prema opisu Mistrala, baziran na njihovom ranijem modelu za grounding zadatke, kao što su pokazivanje, brojanje i lokalizacija objekata.
Za trening je korišćena simulacija, a Mistral navodi da je skup podataka obuhvatio oko 2,4 miliona trajektorija prikupljenih u 350.000 scena. Kompanija dodaje i da je koristila prefix-caching, tehniku koja omogućava efikasnije treniranje tako što se celu epizodu obrađuje kao jednu sekvencu. Prema navodima Mistrala, to smanjuje broj tokena za trening 22 puta u odnosu na pristup sa jednim uzorkom po vremenskom koraku.
Mistral tvrdi i da je nakon nadgledanog treninga primenio online reinforcement learning, odnosno učenje potkrepljivanjem na osnovu povratne informacije iz izvršavanja zadataka. Kompanija navodi da je taj korak doneo dodatno poboljšanje uspešnosti od 3,2 procentna poena.
Šta sledeći koraci znače
Robostral Navigate je prvi model iz Mistralove linije za robotsku navigaciju, ali kompanija ga opisuje kao početak šireg rada na jedinstvenom embodied agentu, odnosno agentu koji kombinuje jezik, percepciju i delovanje u fizičkom svetu. U ovom trenutku, ključna poruka je da Mistral pokušava da pokaže da se navigacija robota može rešiti kompaktnijim modelom i samo jednom standardnom kamerom, bez dodatnih senzora.
Za industriju robotike to je važno jer smanjuje složenost sistema i potencijalno olakšava primenu u realnim okruženjima. Ipak, iz objave proizlazi da su rezultati za sada predstavljeni kroz Mistralove interne testove i demonstracije, pa će širu sliku o praktičnoj upotrebljivosti tek dati nezavisne provere i konkretne primene.
Na kraju objave Mistral navodi i da širi tim za robotiku i zapošljava istraživače i inženjere koji rade na navigaciji robota.

