
GR00T N1.7, Pi0.5, SmolVLA, ACT ili GR00T N1.5? Tablica odluka usklađena sa stvarnim situacijama, s objavljenim benchmark brojevima, latencijom, troškom po pokretanju i licencama iza svakog izbora.
Pet politika može se trenirati na robotskoj ruci klase SO-100 danas. Razlikuju se za faktor 24 u latenciji inferencije, 37 u broju parametara i 12 u cijeni pokretanja, te u tome smijete li isporučiti rezultat. Pet kartica modela to neće riješiti: nijedna ne odgovara na pitanje koje imate, koju da pokrenem prvu?
Svaki broj u nastavku pročitan je iz radova, repozitorija i kartica u kolovozu 2026. Brojevi platforme dolaze iz kataloga politika AY-Robots; gdje se ta dva ne slažu, prikazana su oba.
Kratka verzija
- •Prvo trenirajte ACT ako sumnjate u svoj skup podataka: 1 do 3 USD po pokretanju, ništa predtrenirano da prikrije loše podatke.
- •GR00T N1.7 i Pi0.5 su unutar pola boda na LIBERO-u, 97.0 naspram 96.85 do 97.5. To nije razlog za odabir bilo kojeg.
- •Pi0.5 je igra generalizacije, a ne točnosti, i najsporiji je s 485 ms.
- •SmolVLA, s 450 M parametara, jedini je VLA ovdje koji se fino podešava na jednoj 24 GB kartici.
- •ACT s 20 ms jedina je opcija za brzo reaktivno kretanje. Licence odlučuju o ostalom.
Tablica odluka
| Vaša situacija | Trenirajte ovo | Zašto |
|---|---|---|
| Kvaliteta skupa podataka neprovjerena | ACT | Ništa predtrenirano ne skriva pokvareni skup podataka, a neuspjeh košta 1 do 3 USD. |
| Bogat kontaktima, višestupanjski, uvjetovan jezikom | GR00T N1.7 | 97.0% preko četiri LIBERO paketa, plus relativni akcijski prostor krajnjeg efektora. |
| Brzo reaktivno kretanje, zaključivanje na servomotorima | ACT | 20 ms. Sljedeći najbrži je 7.6 puta sporiji. |
| Novi objekti, nova scena, otvoreni svijet | Pi0.5 | Izgrađen za ponašanje izvan distribucije, preko do 104 lokacije. |
| Jedna 24 GB kartica, još uvijek želite jezik | SmolVLA | 450 M parametara, minimalno 30 epizoda, radi lokalno. |
| Reprodukcija pokretanja snimljenog 2025. | GR00T N1.5 | Samo ako morate: LeRobot ga sada odbija, utezi su nekomercijalni. |
| Ovo će biti isporučeno kao proizvod | N1.7, SmolVLA or ACT | N1.5 je nekomercijalan, Pi0.5 nosi Gemma uvjete, SmolVLA kartica ne navodi ništa. |
Pet kandidata
Svih pet su politike: okviri kamere, pozicije zglobova i, za četiri od njih, jezična instrukcija, preslikana na dio budućih ciljeva zglobova. Ono što ih razdvaja je koliko je toga bilo naučeno prije vašeg dolaska.
| Politika | Parametri | Latencija | GPU razina | Lokalno? | Min. epizoda | Format | Cijena |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | da | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | da | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | ne | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-in trenutni model vizije, jezika i akcije, oko 3 milijarde parametara, otprilike 40 milijuna trenirano tijekom finog podešavanja. Repozitorij navodi razlike u odnosu na N1.6: okosnica s Eagle modela dobavljača na Cosmos-Reason2-2B na Qwen3-VL, difuzijski slojevi 32 na 16, dimenzije stanja i akcije 29 na 132, horizont akcije 16 na 40.
Ono što je važno kod male ruke je relativni akcijski prostor krajnjeg efektora: N1.7 predviđa delte od trenutne poze, što omogućuje prijenos 20K sati EgoScale ljudskog videa u robotsku politiku. Specifikacije na stranici N1.7, procedura u vodiču N1.7 na SO-100.
README datoteka Isaac-GR00T proglašava N1.7 izdanjem Opće dostupnosti, s potpunim mjerilima i podrškom. Njegova Hugging Face kartica nije ažurirana: polje Model Version i dalje glasi GR00T N1.7 EA. Repozitorij je noviji dokument.
GR00T N1.5
Ista skala od 3 B, Eagle 2 okosnica, SigLip2 i T5, flow-matching DiT glava. Postoji kako bi proširio koju već imate. Dvije stvari čine ga lošim zadanim odabirom: težine nose NVIDIA-inu jednosmjernu nekomercijalnu licencu, a trenutna izdanja LeRobot-a uklonila su podršku za N1.5. Pogledajte .
Pi0.5
Physical Intelligence-ov VLA, tip politike pi05. Rad predstavlja 2 B VLM inicijaliziran iz PaliGemma-e plus 300 M stručnjaka za akcije, koji pokreće robota na 50 Hz; LeRobot-ova pi05 konfiguracija zadano koristi blok od 50 koraka, jednu sekundu tom brzinom. Prodajna točka su neviđena mjesta: oko 400 sati mobilne manipulacije u stvarnim domovima, te studija skaliranja preko 3, 12, 22, 53, 82 i 104 lokacije, gdje je model s 104 lokacije odgovarao kontroli obučenoj na samim testnim domovima.
Jedno ograničenje, navedeno na lerobot/pi05_base kartici: port nosi samo glavu za usklađivanje toka akcije. Predviđanje podzadataka, tokenizacija akcija i RL nisu objavljeni uzvodno, a openpi isto kaže i za vlastito spremište. Stranica Pi0.5 i vodič za Pi0.5 na SO-100 imaju ostatak.
Pi0.5 treba ograničeni google/paligemma-3b-pt-224 tokenizator (gated: manual, iako Google kaže da se zahtjevi obrađuju odmah). Bez prihvaćanja i pokretanja hf auth login u okruženju za treniranje, posao započinje, preuzima neko vrijeme, a zatim umire zbog pogreške autorizacije koja izgleda kao mrežna greška. nvidia/GR00T-N1.7-3B nije ograničen, ali njegov nvidia/Cosmos-Reason2-2B temelj jest (gated: auto). Očistite oba prije stavljanja u red čekanja; ako se pokretanje neaktivno, stranica za zaglavljeni red čekanja navodi što provjeriti.
SmolVLA
450 M parametara, oko 100 M u akcijskom ekspertu, na SmolVLM-2 s zamrznutim VLM-om i samo njegovih prvih 16 slojeva jezičnog modela korišteno. Predtreniranje je bilo na podacima zajednice: 481 skup podataka, 10.6 M okvira, s istih jeftinih ruku koje koristite. Jedini VLA ovdje koji stane na jednu 24 GB karticu, i jedini 30 epizoda prag. Pogledajte stranicu SmolVLA.
ACT
Nije temeljni model. Action Chunking Transformer iz ALOHA-e ima oko 80 M parametara treniranih od nule po zadatku, na 50 demonstracija pri 50 Hz. Rad izvještava o šest stvarnih bimanualnih zadataka iz otprilike deset minuta demonstracija svaki, s 80 do 90 posto uspješnosti na primjerima koje ističe. Njegova ideja, grupiranje akcija, prisutna je u svakom modelu na ovoj stranici, a njegova ablacija i dalje najbolje mjeri učinak: na dva simulirana zadatka s isključenim vremenskim ansambliranjem, uspjeh raste s 1 posto pri k=1 na 44 posto pri k=100. Stranica ACT sadrži ostatak.
Što benchmarkovi zapravo govore
LIBERO je jedini benchmark o kojem izvještavaju tri od ovih pet: zadaci uvjetovani jezikom na simuliranoj Franka Panda, podijeljeni u četiri niže navedene skupine s po deset zadataka. NVIDIA je provela 200 pokusa po skupini.
| Model | Prostorno | Objekt | Cilj | 10 (Dugo) | Prosjek |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Svaki broj potječe iz različitog okruženja i budžeta. GR00T je izveo 20K koraka s globalnom serijom od 640; podatak za openpi je kontrolna točka od 30K; LeRobot port je dodao 6K koraka LIBERO baznom modelu. SmolVLA je daljnje neslaganje: njegov rad trenira taj redak na LIBERO-u od nule, bez VLA predtreniranja, dok tri iznad njega fino podešavaju predtrenirane kontrolne točke. Tretirajte 96.85 do 97.5 kao jedan klaster, a jaz do 87.3% kao stvaran, ali postignut s 6.7 puta više parametara.
SimplerEnv pokazuje raspon, što LIBERO ne čini. NVIDIA uspoređuje N1.7 s N1.6, što je najbliža javna stvar 'generacijskoj delti'.
| SimplerEnv paket | N1.6 prosjek | N1.7 prosjek | Najbolji pomak | Najgori pomak |
|---|---|---|---|---|
| Bridge (WidowX), 7 zadataka | 56.6% | 62.3% | stack_cube 5.0 do 48.0 | put_eggplant_in_basket 89.0 do 53.0 |
| Fractal (Google Robot), 6 zadataka | 52.0% | 72.5% | open_drawer 0.0 do 65.0 | nijedan, svaki zadatak je poboljšan |
Redak Bridge je koristan: prosječno je dobiveno 5,7 bodova, dok je put_eggplant_in_basket izgubio 36, a put_eggplant_in_sink pao s 33 na 2. Nova generacija pomiče distribuciju umjesto da je podiže, pa ako se vaš zadatak nalazi tamo gdje je N1.7 nazadovao, prosjek ne govori ništa.

Od pet, samo rad SmolVLA izvještava o ruci klase SO-100: 78,3 posto za SmolVLA i 61,7 za Pi0 kroz tri zadatka, oba višezadaćna, naspram 48,3 za ACT treniranog za jedan zadatak, što nije usporedivo. Čisto uparivanje je oba jednosadaćna na SO-101 pick-and-place: 90 naspram 70 u distribuciji, 50 naspram 40 izvan nje. Usporedite na ACT protiv SmolVLA i Pi0.5 protiv SmolVLA, ili pregledajte arenu.
Latencija i trošak odlučuju o implementaciji
Latencija inferencije je ograničenje koje ljudi otkriju posljednje i prvo požale. Politika koja je pet bodova bolja na benchmarku, ali traje pola sekunde po koraku akcije, izgleda lošije na vašem stolu: dinamika kontakta ne čeka.
Jedna napomena: brojka za GR00T se ne slaže s NVIDIA-inom karticom, koja mjeri 4 koraka denoiseinga i jednu kameru na 85.8 ms na H100 u eager modu, 48.6 ms s torch.compile, 27.9 ms kroz puni TensorRT. Ovdje navedenih 152 ms je brojka za cijeli stack s režijskim troškovima posluživanja i više od jedne kamere, a ne samo forward pass.
Petlja od 20 do 485 ms pripada modelu, a povratna putovanja javnim internetom tome doprinose. Udaljena inferencija je izvediva za sporo 'pick-and-place', ali ne i za brzo reaktivno kretanje. Ako vaš zadatak zahtijeva brzinu, inferencija se nalazi pored serva: ACT ili SmolVLA, lokalno. Povezano: politika se zamrzava usred kretanja.
Jedan način da se dobije na vremenu bez promjene modela: rad SmolVLA mjeri sinkrono izvršavanje, gdje politika završava jedan dio prije predviđanja sljedećeg, nasuprot asinkronom, gdje se predviđanje preklapa s izvršavanjem. Uspjeh je sličan, 78.3 naspram 73.3, ali isti 'pick-and-place' traje 9.7 sekundi umjesto 13.75, a u fiksnom prozoru robot uspijeva obaviti 19 ciklusa umjesto 9.
Licence, provjerene jer ih nitko ne provjerava
| Model | Licenca za težine | Licenca za kod | Komercijalna upotreba |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kartica dopušta komercijalnu upotrebu | Apache 2.0 | da |
| GR00T N1.5 | NVIDIA jednosmjerna nekomercijalna licenca | Apache 2.0 | ne |
| Pi0.5 | metapodaci kartice pi05_base navode licencu: gemma | Apache 2.0 (openpi, LeRobot dokumentacija) | pročitajte oba, ne slažu se |
| SmolVLA | nema polja licence na kartici smolvla_base | Apache 2.0 (LeRobot) | kod da, težine nenavedene |
| ACT | ne postoje osnovne težine | Apache 2.0 (LeRobot) | da |
Red Pi0.5 zahtijeva pažnju. LeRobot pi05 dokumentacija navodi Apache 2.0, što je u skladu s openpi, dok kartica Huba za lerobot/pi05_base sadrži license: gemma. Oba su aktivna. GR00T N1.7 ima blažu verziju: Isaac-GR00T README usput navodi da je N1.7 u potpunosti komercijalno licenciran pod Apache 2.0, dok njegov vlastiti odjeljak o licenci i kartica modela stavljaju samo kod pod Apache 2.0, a težine pod NVIDIA Open Model License.
Zadane postavke koje ćete stvarno pokrenuti
Svaki obrazac trenera dolazi sa zadanim postavkama, i one nisu proizvoljne. ACT-ovi su LeRobotovi vlastiti: batch 8, lr 1e-5, 100000 koraka treniranja, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Jedan stupac ispod je zamka.
| Politika | Skup | LR | Maks. koraka | Akum. grad. | Primjenjuje se? | Dodatne postavke |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | da | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | da | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | ne (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | ne | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | ne | chunkSize, nActionSteps, seed, logFreq |
Ulazna točka za fino podešavanje GR00T-a (launch_finetune.py, tyro CLI) nema polje za sjeme u svojoj konfiguracijskoj podatkovnoj klasi, tako da se izvođenja ne mogu reproducirati bit-za-bit. Repozitorij također upozorava na 5 do 6 posto varijacije između izvođenja zbog nedeterminističkih augmentacija slika, što je veće od većine razlika u benchmarkovima o kojima se raspravlja online. Zadano sjeme LeRobota je 1000. Stupac za akumulaciju gradijenta opisuje lerobot 0.5.1; uzvodna verzija 0.6.2 to izlaže kao --accelerator.gradient_accumulation.steps.
Postavka koja je važnija od izbora modela
To je akcijski blok. Duži blokovi daju glađe kretanje i manje kumulativnih pogrešaka, ali politika je predana dok se blok izvršava, pa kasno reagira na sve što se kreće: sigurna na statičnoj kocki, beznadna na kotrljajućoj. Ako pređe cilj, skraćivanje izvršenog dijela je bolje od ponovnog treniranja i besplatno je. Zglob koji se zaustavi prerano je drugačiji problem; pogledajte .
- ACT: ACTConfig zadano koristi
chunk_size 100in_action_steps 100. Vremensko spajanje je isključeno i zahtijevan_action_steps 1. - GR00T N1.7: unutarnji horizont je prešao s 16 na 40, no LeRobotov SO-101 primjer i dalje koristi
--policy.chunk_size=16 --policy.n_action_steps=16. Zastavica za izvođenje preimenovana je u--execution-horizon. - Pi0.5: blok od 50 koraka, od kojih LeRobotova LIBERO receptura izvršava 10 putem
--policy.n_action_steps=10; s--policy.pretrained_pathvraća se na 50 ako izostavite zastavicu. - SmolVLA: blokovi od 50 akcija, oba parametra su izložena.
Kako provjeriti svih pet u jednom popodnevu
Najjeftiniji odgovor nije više čitanja. Potrošite oko 15 USD i neka vam ruka kaže: snimite jednom, prvo trenirajte jeftini model, pa ga nadogradite kada se podaci pokažu pouzdanima. Struktura je važnija od volumena, to je poanta i .
- 1Snimite 50 epizoda jednom
Pedeset čisti teren za GR00T, Pi0.5 i ACT, te SmolVLA-ovih 30. Ponovite svaku varijaciju umjesto da se raspršite: 50 epizoda kroz 5 treniranih pozicija kocke gdje 25 nije. Pogledajte snimite svoj prvi skup podataka.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Prvo trenirajte ACT, jer vam ne može lagati
Nema prethodno treniranih težina, pa ako uopće obavlja zadatak, vaš skup podataka sadrži zadatak. Ako ACT zataji, popravite podatke. 1 do 3 USD, 2 do 5 sati na kartici od 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Pokrenite SmolVLA na istom skupu podataka, nepromijenjenom
Isti podaci, ista ruka, 450 M parametara umjesto 80 M, plus jezično uvjetovanje. LeRobot procjenjuje 20K koraka na otprilike 4 sata na jednom A100. To vam govori isplati li se prethodno treniranje.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Pretvorite na v2.1 prije nego što dodirnete GR00T
GR00T čita varijantu LeRobot v2 formata plus dodatnu
meta/modality.jsonmapu koja prikazuje kako se spojeni nizovi stanja i akcija dijele na imenovana polja. Skup podataka v3.0 ruši taj učitavač, jer v3.0 pakira mnoge epizode u zajedničke datoteke gdje je v2 pisao jednu po epizodi. Isaac-GR00T isporučuje pomoćnik za smanjenje verzije kaoscripts/lerobot_conversion/convert_v3_to_v2.py; stranica za odbijanje v3 je brzi put.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Pređite na GR00T N1.7 samo ako prva dva nisu dala potpune rezultate
Putem NVIDIA-inog CLI-ja, prikazanog ovdje, ili LeRobot-ovog tipa politike
groot. NVIDIA preporučuje 40 GB ili više VRAM-a za fino podešavanje, 16 GB za inferenciju. U slučaju OOM-a, pogledajte stranicu o OOM-u.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dva načina za pokretanje tog probnog prolaza
Tri okruženja, jer se lanci alata ne podudaraju. LeRobot na glavnom je 0.6.2 i treba Python 3.12 ili noviji; Isaac-GR00T i openpi su zasebni repozitoriji upravljani uv-om.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T koristi
torchcodec0.8.0 kao jedini video backend, zahtijevajući FFmpeg 4 do 7. FFmpeg 8 nije podržan, AV1 nije zajamčen. - Minimalni zahtjevi za memoriju openpi-ja: inferencija iznad 8 GB, LoRA iznad 22.5 GB, potpuno fino podešavanje iznad 70 GB. Ovo posljednje je razlog zašto je Pi0.5 posao za A100.
- Unajmite GPU sami, uništite ga nakon toga, ručno uskladite tri skupa putanja kontrolnih točaka.
Istih pet modela, jedan obrazac. Odaberite model, skup podataka i hiperparametre; pozadinski sustav unajmljuje GPU veličine prema potrebnom VRAM-u, pokreće trener i piše kontrolne točke u objektno skladište.
- Matrica treniranja je pet modela s četiri ruke, svaka ćelija je vodič: SmolVLA na SO-100, ACT na SO-101.
- Inferencijski podovi se automatski osiguravaju putem
/api/inference/pods nadzornikom neaktivnosti, tako da zaboravljeni pod ne naplaćuje tiho. - Osnovne kontrolne točke su vlastite od dobavljača:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nema nijednu. - Iste operacije iz CLI-ja i od AI agenata putem MCP poslužitelja.
- Nemate hardver? Ruka uživo prenosi fizički SO-100 bez prijave; stranica za isprobavanje prikazuje načine ulaska.
Temeljni model ili od nule
Prava dilema nije koji model od 3 B odabrati. Radi se o tome treba li uopće koristiti unaprijed trenirani VLA, s obzirom na to da je ACT naučio šest stvarnih bimanualnih zadataka iz otprilike deset minuta demonstracija za svaki, s 80 M parametara i ništa unaprijed trenirano.
- Jezično uvjetovanje. ACT ga nema; jedna ACT kontrolna točka obavlja jedan zadatak.
- Bolje na objektima koji nedostaju u vašim demonstracijama: na SO-101, 50% naspram ACT-ovih 40% izvan distribucije.
- Višezadaćnost uopće: SmolVLA postiže 78.3% kroz tri SO-100 zadatka s jednom kontrolnom točkom; ACT je pokretan samo za pojedinačne zadatke.
- 7.6x do 24x veća latencija: 152 do 485 ms po koraku akcije naspram ACT-ovih 20 ms.
- 4 do 12 USD po pokretanju umjesto 1 do 3, i A100 razina umjesto bilo koje kartice od 24 GB.
- Izloženost licencama, plus način kvara zbog ograničenog repozitorija koji ne postoji kod rješenja od nule.
- Unaprijed trenirane težine mogu maskirati loš skup podataka. Fino podešavanje koje djelomično radi na oštećenim podacima košta tjedan dana prije nego što pogledate podatke.
Slučaj reprodukcije starog pokretanja
Potraga za kontrolnom točkom iz 2025. godine donosi vam izbor modela i pretvara problem u fiksiranje verzije: trenutni LeRobot odbija N1.5, pa fiksirate lerobot==0.5.1. Bez polja za sjeme i s 5 do 6 posto varijance između pokretanja, reprodukcija je po konstrukciji približna. i imaju platformsku stranu.

Svedeno na dva? ACT protiv GR00T N1.7 i GR00T N1.7 protiv SmolVLA. Sirovi redovi nalaze se u unosima arene: GR00T N1.7, Pi0.5, SmolVLA i ACT.
Gdje vam ova platforma ne pomaže
- Ne može ubrzati udaljenu inferenciju. Petlja od 20 do 485 ms pripada modelu; internetska povratna putovanja dodaju se tome.
- Ne može fino podesiti GR00T ili Pi0.5 na vašem vlastitom hardveru. Oba su ovdje samo u oblaku; samo SmolVLA i ACT rade lokalno.
- Ne može popraviti skup podataka. Gubitak pada, ali politika ne radi ništa je problem s podacima, politika koja radi samo u jednom postavu je problem pokrivenosti.
- Ne može učiniti GR00T pokretanja ponovljivima: uzvodna konfiguracija nema polje za sjeme.
85 modela, 332 benchmark rezultata, svaki broj povezan s izvorom
Verzija tablica na ovoj stranici s mogućnošću sortiranja: 85 modela vizije-jezika-akcije, 332 rezultata benchmarka, svaki povezan s izvornim radom ili karticom modela.
Otvori arenuOdabir jednog i nastavak
Jedna zadana postavka: snimite 50 epizoda, trenirajte ACT za 1 do 3 USD kako biste dokazali skup podataka, zatim SmolVLA na istim podacima. Zajedno ispod 6 USD, i oni odgovaraju na pitanje koje je važno: pomaže li predtreniranje ovdje, ili je li usko grlo u podacima. Eskalirajte na GR00T N1.7 za višestupanjske zadatke bogate kontaktom, na Pi0.5 kada se scena mijenja.
Pregled platforme: trenirajte svoju prvu politiku, zatim pokrenite svoju prvu politiku. dokumentacija za treniranje i dokumentacija za skupove podataka pokrivaju formu i format; stranica SO-100 i potpuni vodič za SO-100 pokrivaju izradu i kalibraciju. Pozadina: pregled VLA modela i članak o Pi0 flow-matchingu. Onaj koji će poboljšati vašu stopu uspješnosti je vodič za kvalitetu podataka.
Koju VLA politiku bih trebao prvo trenirati na SO-100?▾
ACT, zatim SmolVLA. ACT trenira od nule, tako da ne može maskirati loš skup podataka, a pokretanje košta 1 do 3 USD na kartici od 24 GB. Ako ACT uopće obavi zadatak, 4 do 12 USD za pokretanje GR00T N1.7 ili Pi0.5 nije uzalud potrošeno.
Je li GR00T N1.7 zapravo bolji od Pi0.5?▾
Na LIBERO-u su unutar šuma: 97.0% kroz četiri paketa za GR00T N1.7, 96.85% za Pi0.5 na 30k koraka u openpi, 97.5% za LeRobot port, sve iz različitih okruženja. Stvarne razlike su 152 ms po koraku akcije naspram 485 ms, skupovi podataka v2.1 naspram v3.0, i točnost benchmarka naspram generalizacije u otvorenom svijetu.
Mogu li bilo koji od ovih fino podesiti na jednoj RTX 4090?▾
SmolVLA i ACT, da; oba su navedena za RTX 4090 ili bilo koju karticu od 24 GB i pokreću se lokalno. GR00T N1.7, N1.5 i Pi0.5 trebaju A100 ili H100 80 GB i ovdje su samo u oblaku. NVIDIA preporučuje 40 GB ili više za fino podešavanje GR00T-a; openpi-jev prag je iznad 70 GB za potpuno fino podešavanje Pi0.5, 22.5 GB za LoRA.
Koji od ovih pet mogu koristiti komercijalno?▾
Težine GR00T N1.7 su pod NVIDIA Open Model License Agreement, za koju kartica kaže da pokriva komercijalnu upotrebu. Težine N1.5 su nekomercijalne. Kod SmolVLA-e je Apache 2.0 u LeRobotu, ali kartica lerobot/smolvla_base nema polje licence, tako da težine nisu navedene. ACT nema osnovne težine za licenciranje. Pi0.5 je dvosmislen: LeRobotova dokumentacija kaže Apache 2.0, a metapodaci njegove kartice glase license: gemma.
Sources
- NVIDIA Isaac-GR00T repozitorij: GA status, promjene od N1.6 na N1.7, hardverski zahtjevi, ograničenja torchcodec-a i FFmpeg-a, launch_finetune.py, varijanca između pokretanja
- nvidia/GR00T-N1.7-3B kartica modela: Cosmos-Reason2-2B okosnica, 3 B parametara, tablica vremena inferencije, NVIDIA Open Model License, polje Model Version
- nvidia/GR00T-N1.5-3B kartica modela: Eagle 2 referenca, SigLip2 i T5, flow matching DiT, jednosmjerna nekomercijalna licenca
- Isaac-GR00T LIBERO primjer: stope uspješnosti po paketu na 20K koraka i veličini serije 640, 200 pokušaja po paketu
- Isaac-GR00T SimplerEnv primjer: stope uspješnosti Bridge i Fractal po zadatku, GR00T N1.6 naspram N1.7
- pi0.5: model vizije, jezika i akcije s generalizacijom u otvorenom svijetu (2 B VLM plus 300 M stručnjak za akciju, 50 Hz kontrola, oko 400 sati mobilne manipulacije, studija skaliranja preko 3 do 104 lokacije)
- openpi repozitorij: pragovi GPU memorije, opseg samo za flow-matching-head, i Pi0.5 LIBERO rezultati u examples/libero
- lerobot/pi05_base kartica modela: opseg LeRobot porta, license: gemma metapodaci, lerobot-train upotreba
- LeRobot pi0.5 dokumentacija: gated PaliGemma tokenizer, LIBERO tablica reprodukcije, n_action_steps fallback zamka, izjava Apache 2.0
- SmolVLA: model vizije, jezika i akcije za pristupačnu i učinkovitu robotiku (450 M parametara, LIBERO i Meta-World tablice, SO-100 i SO-101 rezultati, asinkrona inferencija)
- LeRobot SmolVLA dokumentacija: 50 epizoda preko 5 pozicija naspram 25, 20k koraka u oko 4 sata na A100
- Učenje fine-grained bimanualne manipulacije s niskobudžetnim hardverom (ACT i ALOHA): 6 zadataka s 80-90 posto, chunk size ablacija od k=1 do k=100
- LeRobot 0.6.2: ACTConfig i SmolVLAConfig zadane vrijednosti, zadani seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 zahtjev, Apache 2.0
- LeRobot GR00T dokumentacija: policy type groot, podrška za N1.5 uklonjena, pin lerobot==0.5.1, SO-101 primjer veličine bloka
- lerobot/smolvla_base kartica modela: SmolVLA osnovna kontrolna točka koju koristi --policy.path, i njezini metapodaci kartice, koji ne sadrže polje licence
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started