NVIDIA je objavila da će platforma Vera Rubin biti usmerena na post-trening, fazu u kojoj se modeli doteruju nakon početnog treniranja, sa ciljem da se postigne što veća „inteligencija po dolaru“. Kompanija tvrdi da je taj pristup posebno važan za agentnu veštačku inteligenciju, gde modeli ne odgovaraju samo na upit, već planiraju, koriste alate i prilagođavaju se promenama tokom izvršavanja zadataka.
Prema Nvidia blogu, post-trening više nije završni korak posle pretraininga, već kontinuiran proces. Razlog je to što se okruženja u kojima rade AI agenti brzo menjaju, pa modeli moraju da se prilagođavaju novim alatima, greškama u radu i različitim pravilima u produkciji. Zbog toga računski zahtevi rastu i kada pojedinačni trening nije veći, jer se ovakvi ciklusi stalno ponavljaju.
Zašto je važan trošak po tokenu
NVIDIA objašnjava da je za inference, odnosno rad modela u praksi, ključna metrika trošak po tokenu. Token je osnovna jedinica teksta koju model obrađuje ili generiše. Kompanija taj trošak opisuje kao ukupni trošak isporuke milion tokena. U toj logici, „inteligencija po dolaru“ predstavlja širi pokazatelj: koliko košta izgradnja i održavanje modela koji vredi koristiti u promenljivom okruženju.
Drugim rečima, metrika troška po tokenu i metrika inteligencije po dolaru nisu suprotstavljene, već povezane. Ako infrastruktura smanji cenu izvođenja modela, ona istovremeno smanjuje i cenu svake dodatne sposobnosti koja je tokom post-treninga ugrađena u model.
Nemotron 3 Ultra kao primer
NVIDIA kao primer navodi otvoreni model Nemotron 3 Ultra sa 550 milijardi parametara, koji je post-treniran uz pomoć NeMo RL alata. Kompanija kaže da je model ostvario 71,7 odsto na SWE-bench Verified, standardnom testu za realne zadatke iz programiranja. Taj test proverava da li model može da pronađe ispravku za stvarne greške u otvorenom softveru, a uspeh se potvrđuje kroz testove samog projekta.
Prema Nvidiji, Vera Rubin platforma dalje smanjuje potreban broj GPU-ova u odnosu na Blackwell generaciju i omogućava više rolloutova po trening ciklusu, više paralelnih okruženja i češće post-trening iteracije. Rollout je, u ovom kontekstu, niz pokušaja koje model izvršava tokom učenja, a njihovo veće brojanje znači više prilika da se model poboljša.
Šta se menja u infrastrukturi
Kompanija navodi i primer partnera koji već koriste sličan pristup. Prime Intellect radi kontinuirani post-trening frontier otvorenih modela na Blackwell platformi i koristi Dynamo za orchestration inference-a, odnosno za upravljanje servisiranjem modela. NVIDIA tvrdi da će Vera Rubin pomoći da se takvi poslovi dodatno skaliraju.
Prime Intellect je, prema navodima kompanije, izmerio i oko 30 odsto veći throughput po CPU-u kada je Vera uporedio sa alternativnim x86 arhitekturama u realnim RL sandbox zadacima. Throughput označava koliko posla sistem može da obradi u jedinici vremena.
Perplexity, kako navodi NVIDIA, koristi asinkroni RL post-trening kroz stotine GPU-ova i RDMA baziran sistem za prenos težina modela, koji sinhronizuje trillion-parametarske modele za manje od dve sekunde između trening i inference čvorova. Nakon toga se modeli poslužuju na GB200 NVL72 sistemima.
Takođe, Together AI nudi post-trening kao uslugu, uključujući supervised fine-tuning, reinforcement learning i direct preference optimization, i kaže da planira dalje oslanjanje na Vera Rubin platformu.
Širi značaj za AI infrastrukturu
Poruka Nvidije je jasna: u eri agentne AI, najveći deo vrednosti ne nastaje samo tokom prvog treniranja modela, već u stalnom post-treningu i u tome koliko je taj proces jeftin i efikasan. Zbog toga kompanija Vera Rubin pozicionira kao platformu za AI fabrike, odnosno podatkovne centre optimizovane za stalno poboljšavanje modela i njihovo kasnije servisiranje.
Za tržište to znači da fokus sa same veličine modela sve više prelazi na ekonomiku njegove upotrebe. U praksi, važni postaju računarski kapaciteti, cena po tokenu, brzina iteracije i sposobnost infrastrukture da podrži neprekidan ciklus učenja i primene.

