
GR00T N1.7, Pi0.5, SmolVLA, ACT ili GR00T N1.5? Tabela odluka usklađena sa stvarnim situacijama, sa objavljenim benchmark brojevima, latencijom, troškovima po pokretanju i licencama iza svakog izbora.
Pet politika se danas može obučiti na ruci klase SO-100. One se razlikuju za faktor 24 u inferenciji latencije, 37 u broju parametara i 12 u ceni pokretanja, kao i u tome da li smete da isporučite rezultat. Pet kartica modela neće rešiti dilemu: nijedna ne odgovara na pitanje koje imate, koju da pokrenem prvu?
Svaki broj ispod je pročitan iz radova, repozitorijuma i kartica u avgustu 2026. Brojevi platformi dolaze iz AY-Robots katalog politika; gde se ova dva ne slažu, prikazana su oba.
Kratka verzija
- •Obučite ACT prvo ako sumnjate u svoj skup podataka: 1 do 3 USD po pokretanju, ništa preobučeno da prikrije loše podatke.
- •GR00T N1.7 i Pi0.5 su unutar pola poena na LIBERO, 97.0 naspram 96.85 do 97.5. To nije razlog da izaberete bilo koji.
- •Pi0.5 je opcija za generalizaciju, ne za tačnost, i najsporiji je sa 485 ms.
- •SmolVLA, sa 450 M parametara, je jedini VLA ovde koji se fino podešava na jednoj 24 GB kartici.
- •ACT sa 20 ms je jedina opcija za brzo reaktivno kretanje. Licence odlučuju o ostalom.
Tabela odluka
| Vaša situacija | Obučite ovo | Zašto |
|---|---|---|
| Kvalitet skupa podataka neproveren | ACT | Ništa preobučeno ne može sakriti neispravan skup podataka, a neuspeh košta 1 do 3 USD. |
| Bogat kontaktima, višestepeni, uslovljen jezikom | GR00T N1.7 | 97.0% preko četiri LIBERO paketa, plus relativni akcioni prostor krajnjeg efektora. |
| Brzo reaktivno kretanje, inferencija na servomotorima | ACT | 20 ms. Sledeći najbrži je 7.6 puta sporiji. |
| Novi objekti, nova scena, otvoreni svet | Pi0.5 | Izgrađen za ponašanje van distribucije, na do 104 lokacije. |
| Jedna 24 GB kartica, i dalje želite jezik | SmolVLA | 450 M parametara, minimum 30 epizoda, radi lokalno. |
| Reprodukovanje pokretanja snimljenog 2025. | GR00T N1.5 | Samo ako morate: LeRobot ga sada odbija, težine su nekomercijalne. |
| Ovo će biti isporučeno kao proizvod | N1.7, SmolVLA ili ACT | N1.5 je nekomercijalan, Pi0.5 nosi Gemma uslove, kartica SmolVLA ne navodi ništa. |
Pet kandidata
Svih pet su politike: okviri kamere, pozicije zglobova i, za četiri od njih, jezička instrukcija, mapirana na deo budućih ciljeva zglobova. Ono što ih razdvaja je koliko je toga naučeno pre vašeg dolaska.
| Politika | Parametri | Kašnjenje | GPU nivo | Lokalno? | Min. epizoda | Format | Cena |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | da | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | da | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | ne | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-in trenutni vizuelno-jezički-akcioni model, oko 3 milijarde parametara, približno 40 miliona trenirano tokom finog podešavanja. Repozitorijum navodi razlike u odnosu na N1.6: okosnica je promenjena sa Eagle modela dobavljača na Cosmos-Reason2-2B na Qwen3-VL, difuzioni slojevi sa 32 na 16, dimenzije stanja i akcije sa 29 na 132, akcioni horizont sa 16 na 40.
Ono što je važno kod male ruke je relativni akcioni prostor krajnjeg efektora: N1.7 predviđa delte od trenutne poze, što omogućava prenos 20 hiljada sati EgoScale ljudskog videa u robotsku politiku. Specifikacije na stranici N1.7, procedura u uputstvu za N1.7 na SO-100.
README fajl Isaac-GR00T-a proglašava N1.7 izdanjem Opšte dostupnosti, sa kompletnim benčmarkovima i podrškom. Njegova Hugging Face kartica nije ažurirana: polje Model Version i dalje glasi GR00T N1.7 EA. Repozitorijum je noviji dokument.
GR00T N1.5
Ista skala od 3 B, Eagle 2 okosnica, SigLip2 i T5, DiT glava za usklađivanje protoka. Postoji da bi se proširio koji već imate. Dve stvari ga čine lošim podrazumevanim izborom: težine nose NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. See .
Pi0.5
Physical Intelligence-ov VLA, tip politike pi05. Rad predstavlja 2 B VLM inicijalizovan iz PaliGemme plus 300 M akcioni ekspert, koji pokreće robota na 50 Hz; LeRobot's pi05 config defaults to a 50-step chunk, one second at that rate. The selling point is unseen places: oko 400 sati mobilne manipulacije u stvarnim domovima, i studija skaliranja preko 3, 12, 22, 53, 82 i 104 lokacije, gde je model sa 104 lokacije odgovarao kontroli obučenoj na samim testnim domovima.
Jedno ograničenje, navedeno na lerobot/pi05_base kartici: port prenosi samo "flow-matching" action head. Predviđanje podzadataka, tokenizacija akcija i RL nisu objavljeni uzvodno, a openpi kaže isto za sopstveni repozitorijum. Stranica Pi0.5 i vodič za Pi0.5 na SO-100 imaju ostatak.
Pi0.5 zahteva zatvoreni google/paligemma-3b-pt-224 tokenizator (gated: manual, iako Google kaže da se zahtevi obrađuju odmah). Bez prihvatanja i pokretanja hf auth login u okruženju za obuku, posao počinje, preuzima neko vreme, a zatim umire zbog greške autorizacije koja izgleda kao mrežni kvar. nvidia/GR00T-N1.7-3B nije zatvoren, ali njegov nvidia/Cosmos-Reason2-2B "backbone" jeste (gated: auto). Očistite oba pre stavljanja u red; ako se pokretanje neaktivno, stranica za zaglavljene redove navodi šta treba proveriti.
SmolVLA
450 M parametara, oko 100 M u akcionom ekspertu, na SmolVLM-2 sa zamrznutim VLM-om i korišćenjem samo njegovih prvih 16 slojeva jezičkog modela. Predobuka je bila na podacima zajednice: 481 skup podataka, 10.6 M frejmova, sa istih jeftinih ruku koje koristite. Jedini VLA ovde koji staje na jednu 24 GB karticu, i jedini sa 30 epizoda nivoom. Pogledajte stranicu SmolVLA.
ACT
Nije osnovni model. The Action Chunking Transformer iz ALOHA-e ima oko 80 M parametara obučenih od nule po zadatku, na 50 demonstracija pri 50 Hz. Rad izveštava o šest stvarnih bimanualnih zadataka iz otprilike deset minuta demonstracija svaki, sa 80 do 90 procenata uspešnosti na primerima koje ističe. Njegova ideja, grupisanje akcija, prisutna je u svakom modelu na ovoj stranici, a njegova ablacija i dalje najbolje meri efekat: preko dva simulirana zadatka sa isključenim vremenskim ansamblom, uspeh raste sa 1 procenta pri k=1 na 44 procenta pri k=100. ACT stranica ima ostatak.
Šta benchmarkovi zapravo kažu
LIBERO je jedini benchmark o kojem izveštavaju tri od ovih pet: zadaci uslovljeni jezikom na simuliranom Franka Panda robotu, podeljeni u četiri dole navedene grupe po deset zadataka. NVIDIA je pokrenula 200 proba po grupi.
| Model | Prostorno | Objekat | Cilj | 10 (Dugo) | Prosečno |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Svaki broj potiče iz različitog okruženja i budžeta. GR00T je izvršio 20K koraka sa globalnom serijom 640; podatak za openpi je kontrolna tačka od 30K; LeRobot port je dodao 6K koraka osnovnom LIBERO modelu. SmolVLA je dalje neusklađenost: njegov rad obučava taj red na LIBERO-u od nule, bez VLA predtreniranja, dok tri iznad njega fino podešavaju prethodno obučene kontrolne tačke. Tretirajte 96.85 do 97.5 kao jedan klaster, a jaz do 87.3% kao stvaran, ali postignut sa 6.7 puta više parametara.
SimplerEnv pokazuje raspon, što LIBERO ne čini. NVIDIA poredi N1.7 sa N1.6, što je najbliža javna stvar "generacijskoj delti."
| SimplerEnv paket | N1.6 prosek | N1.7 prosek | Najbolji zamah | Najgori zamah |
|---|---|---|---|---|
| Bridge (WidowX), 7 zadataka | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 zadataka | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | nijedan, svaki zadatak je poboljšan |
Red Bridge je koristan: 5.7 poena dobijeno u proseku dok je put_eggplant_in_basket izgubio 36, a put_eggplant_in_sink pao sa 33 na 2. Nova generacija pomera distribuciju umesto da je podiže, tako da ako se vaš zadatak nalazi tamo gde je N1.7 nazadovao, prosek ne govori ništa.

Od pet, samo rad SmolVLA izveštava o ruci klase SO-100: 78.3 procenta za SmolVLA i 61.7 za Pi0 kroz tri zadatka, oba višenamenska, naspram 48.3 za ACT obučen za jedan zadatak, što nije uporedivo. Čisto poređenje je oba jednonamenska na SO-101 pick-and-place: 90 naspram 70 u distribuciji, 50 naspram 40 izvan nje. Uporedite na ACT naspram SmolVLA i Pi0.5 naspram SmolVLA, ili pretražite arenu.
Kašnjenje i cena odlučuju o implementaciji
Kašnjenje inferencije je ograničenje koje ljudi otkriju poslednje i prvo zažale. Politika koja je pet poena bolja na benčmarku, ali pola sekunde po koraku akcije, izgleda lošije na vašem stolu: dinamika kontakta ne čeka.
Jedna napomena: podatak za GR00T se ne slaže sa NVIDIA karticom, koja meri 4 koraka denoise-ovanja i jednu kameru na 85.8 ms na H100 u eager modu, 48.6 ms sa torch.compile, 27.9 ms kroz pun TensorRT. Ovde je 152 ms cifra za ceo stek sa režijskim troškovima serviranja i više od jedne kamere, a ne samo forward pass.
Petlja od 20 do 485 ms pripada modelu, a tome se dodaju i povratna putovanja preko javnog interneta. Udaljena inferencija je izvodljiva za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje. Ako vaš zadatak zahteva brzinu, inferencija se nalazi pored servo motora: ACT ili SmolVLA, lokalno. Povezano: politika se zamrzava usred kretanja.
Jedan način da se dobije na vremenu bez promene modela: rad SmolVLA meri sinhrono izvršavanje, gde politika završava deo pre predviđanja sledećeg, naspram asinhronog, gde se predviđanje preklapa sa izvršavanjem. Uspeh je sličan, 78.3 naspram 73.3, ali isto uzimanje i postavljanje (pick-and-place) traje 9.7 sekundi umesto 13.75, i u fiksnom prozoru robot uspeva da obavi 19 ciklusa umesto 9.
Licence, proverene jer ih niko ne proverava
| Model | Licenca za težine | Licenca za kod | Komercijalna upotreba |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kartica dozvoljava komercijalnu upotrebu | Apache 2.0 | da |
| GR00T N1.5 | NVIDIA jednosmerna nekomercijalna licenca | Apache 2.0 | ne |
| Pi0.5 | metapodaci kartice pi05_base navode licencu: gemma | Apache 2.0 (openpi, LeRobot dokumentacija) | pročitajte oba, ne slažu se |
| SmolVLA | nema polja za licencu na kartici smolvla_base | Apache 2.0 (LeRobot) | kod da, težine neizrečene |
| ACT | ne postoje osnovne težine | Apache 2.0 (LeRobot) | da |
Red za Pi0.5 zahteva pažnju. LeRobot pi05 dokumentacija navodi Apache 2.0, što je u skladu sa openpi, dok kartica Hub-a za lerobot/pi05_base sadrži license: gemma. Oba su aktivna. GR00T N1.7 ima blažu verziju: Isaac-GR00T README usput navodi da je N1.7 u potpunosti komercijalno licenciran pod Apache 2.0, dok njegov sopstveni odeljak za licencu i kartica modela stavljaju samo kod pod Apache 2.0, a težine pod NVIDIA Open Model License.
Podrazumevane vrednosti koje ćete zapravo pokrenuti
Svaki obrazac za obuku dolazi sa podrazumevanim vrednostima, i one nisu proizvoljne. ACT-ove su LeRobot-ove sopstvene: batch 8, lr 1e-5, 100000 koraka obuke, veličina čanka 100, što odgovara ACTConfig-u uzvodno i k=100 from the ACT paper. Jedna kolona ispod je zamka.
| Politika | Batch | LR | Maks. koraka | Akumulacija gradijenta | Primenjuje se? | Dodatne opcije |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Ulazna tačka za fino podešavanje GR00T-a (launch_finetune.py, tyro CLI) nema polje za seed u svojoj config dataclass klasi, tako da pokretanja nisu bit-po-bit reproduktivna. Repozitorijum takođe upozorava na 5 do 6 procenata varijacije između pokretanja zbog nedeterminističkih augmentacija slika, što je veće od većine razlika u benchmarkovima o kojima se raspravlja onlajn. Podrazumevani seed LeRobot-a je 1000. Kolona za akumulaciju gradijenta opisuje lerobot 0.5.1; uzvodna verzija 0.6.2 to izlaže kao --accelerator.gradient_accumulation.steps.
Opcija koja je važnija od izbora modela
To je akcioni blok. Duži blokovi daju glađe kretanje i manje kumulativnih grešaka, ali politika je fiksirana dok se blok izvršava, pa kasno reaguje na sve što se kreće: sigurna na statičnoj kocki, beznadežna na kotrljajućoj. Ako pređe cilj, skraćivanje izvršenog dela je bolje od ponovnog treniranja i besplatno je. Zglob koji se zaustavi prerano je drugačiji problem; pogledajte .
- ACT: ACTConfig podrazumevano koristi
chunk_size 100in_action_steps 100. Vremensko ansambliranje je isključeno i zahtevan_action_steps 1. - GR00T N1.7: interni horizont je prešao sa 16 na 40, ali LeRobot-ov SO-101 primer i dalje pokreće
--policy.chunk_size=16 --policy.n_action_steps=16. Zastavica za rollout je preimenovana u--execution-horizon. - Pi0.5: blok od 50 koraka, od kojih LeRobot-ov LIBERO recept izvršava 10 preko
--policy.n_action_steps=10; sa--policy.pretrained_pathvraća se na 50 ako izostavite zastavicu. - SmolVLA: blokovi od 50 akcija, obe opcije su izložene.
Kako testirati svih pet u jednom popodnevu
Najjeftiniji odgovor nije više čitanja. Potrošite oko 15 USD i neka vam ruka kaže: snimite jednom, prvo trenirajte jeftin model, pa pojačajte kada se podaci pokažu pouzdanim. Struktura pobeđuje volumen, to je poenta i .
- 1Snimite 50 epizoda jednom
Pedeset čisti teren za GR00T, Pi0.5 i ACT, i SmolVLA-ovih 30. Ponovite svaku varijaciju umesto da se rasipate: 50 epizoda na 5 pozicija kocke trenirano tamo gde 25 nije. Pogledajte snimite svoj prvi skup podataka.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Prvo trenirajte ACT, jer vam ne može lagati
Nema unapred obučenih težina, pa ako uopšte obavi zadatak, vaš skup podataka sadrži taj zadatak. Ako ACT ne reaguje, popravite podatke. 1 do 3 USD, 2 do 5 sati na kartici od 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Pokrenite SmolVLA na istom skupu podataka, nepromenjenom
Isti podaci, ista ruka, 450 M parametara umesto 80 M, plus jezičko uslovljavanje. LeRobot procenjuje pokretanje od 20K koraka na otprilike 4 sata na jednom A100. Ovo vam govori da li predtreniranje donosi bilo kakvu korist.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Pretvorite u v2.1 pre nego što dodirnete GR00T
GR00T čita varijantu LeRobot v2 formata plus dodatni
meta/modality.jsonkoji mapira kako se konkatenirani nizovi stanja i akcija dele na imenovana polja. Skup podataka v3.0 ruši taj učitavač, jer v3.0 pakuje mnoge epizode u deljene datoteke gde je v2 pisao jednu po epizodi. Isaac-GR00T isporučuje pomoćnik za downgrade kaoscripts/lerobot_conversion/convert_v3_to_v2.py; stranica za odbijanje v3 je brzi put.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Pređite na GR00T N1.7 samo ako prva dva nisu dala željene rezultate
Preko NVIDIA-inog CLI-ja, prikazanog ovde, ili LeRobot-ovog tipa politike
groot. NVIDIA preporučuje 40 GB ili više VRAM-a za fino podešavanje, 16 GB za inferenciju. U slučaju OOM-a, pogledajte stranicu o OOM-u.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dva načina za pokretanje tog skrining prolaza
Tri okruženja, jer se lanci alata ne podudaraju. LeRobot na glavnom je 0.6.2 i zahteva Python 3.12 ili noviji; Isaac-GR00T i openpi su odvojeni uv-upravljani repozitorijumi.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T koristi
torchcodec0.8.0 kao jedini video backend, zahtevajući FFmpeg 4 do 7. FFmpeg 8 nije podržan, AV1 nije zagarantovan. - Minimalni zahtevi za memoriju openpi: inferencija iznad 8 GB, LoRA iznad 22.5 GB, potpuno fino podešavanje iznad 70 GB. Ovo poslednje je razlog zašto je Pi0.5 posao za A100.
- Iznajmite GPU sami, uništite ga nakon toga, ručno uskladite tri skupa putanja kontrolnih tačaka.
Istih pet modela, jedan obrazac. Odaberite model, skup podataka i hiperparametre; backend iznajmljuje GPU veličine potrebne VRAM memorije, pokreće trener i piše u skladište objekata.
- Matrica obuke je pet modela sa četiri ruke, svaka ćelija je vodič: SmolVLA na SO-100, ACT na SO-101.
- Inferencioni podovi se automatski obezbeđuju pomoću
/api/inference/podsa nadzornikom neaktivnosti, tako da zaboravljeni pod ne naplaćuje tiho. - Osnovne kontrolne tačke su vlasništvo dobavljača:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nema nijednu. - Iste operacije sa CLI-ja i od AI agenata putem MCP servera.
- Nemate hardver? Ruka uživo strimuje fizički SO-100 bez prijave; stranica za isprobavanje prikazuje načine ulaska.
Osnovni model ili od nule
Prava dilema nije koji 3 B model odabrati. Pitanje je da li uopšte koristiti predtrenirani VLA, s obzirom na to da je ACT naučio šest stvarnih bimanualnih zadataka iz oko deset minuta demonstracija za svaki, sa 80 M parametara i ništa predtrenirano.
- Jezičko uslovljavanje. ACT ga nema; jedna ACT kontrolna tačka obavlja jedan zadatak.
- Bolje na objektima koji nedostaju u vašim demonstracijama: na SO-101, 50% u poređenju sa ACT-ovih 40% van distribucije.
- Više zadataka uopšte: SmolVLA dostiže 78.3% kroz tri SO-100 zadatka sa jednom kontrolnom tačkom; ACT je pokretan samo za jedan zadatak.
- 7.6x do 24x veća latencija: 152 do 485 ms po koraku akcije u poređenju sa ACT-ovih 20 ms.
- 4 do 12 USD po pokretanju umesto 1 do 3, i A100 nivo umesto bilo koje kartice od 24 GB.
- Izloženost licenci, plus režim kvara zatvorenog repozitorijuma koji ne postoji od nule.
- Predtrenirani tegovi mogu maskirati loš skup podataka. Fino podešavanje koje delimično radi na pokvarenim podacima košta nedelju dana pre nego što pogledate podatke.
Slučaj reprodukcije starog pokretanja
Potraga za kontrolnom tačkom iz 2025. godine donosi izbor modela za vas i pretvara problem u fiksiranje verzije: trenutni LeRobot odbija N1.5, pa fiksirate lerobot==0.5.1. Bez polja za seme i sa 5 do 6 procenata varijacije između pokretanja, reprodukcija je približna po konstrukciji. i imaju stranu platforme.

Svedeno na dva? ACT protiv GR00T N1.7 i GR00T N1.7 protiv SmolVLA. Sirovi podaci se nalaze u unosima arene: GR00T N1.7, Pi0.5, SmolVLA i ACT.
Gde vam ova platforma ne pomaže
- Ne može ubrzati udaljenu inferenciju. Petlja od 20 do 485 ms pripada modelu; internet povratna putovanja tome doprinose.
- Ne može fino podesiti GR00T ili Pi0.5 na vašem hardveru. Oba su ovde samo u oblaku; samo SmolVLA i ACT rade lokalno.
- Ne može popraviti skup podataka. Gubitak opada, ali politika ne radi ništa je problem sa podacima, politika koja radi samo u jednom podešavanju je problem pokrivenosti.
- Ne može učiniti GR00T pokretanja ponovljivim: uzvodna konfiguracija nema polje za seme.
85 modela, 332 rezultata benčmarka, svaki broj povezan sa svojim izvorom
Verzija tabela na ovoj stranici koja se može sortirati: 85 modela vida, jezika i akcije, 332 rezultata benčmarka, svaki povezan sa svojim radom ili karticom modela.
Otvori arenuOdabir jednog i nastavak
Jedna podrazumevana opcija: snimite 50 epizoda, trenirajte ACT za 1 do 3 USD da biste dokazali skup podataka, zatim SmolVLA na istim podacima. Zajedno ispod 6 USD, i oni odgovaraju na pitanje koje je važno: da li pretreniranje pomaže ovde, ili da li je usko grlo u podacima. Eskalirajte na GR00T N1.7 za višestepene zadatke bogate kontaktom, na Pi0.5 kada se scena menja.
Uputstvo za platformu: trenirajte svoju prvu politiku, zatim pokrenite svoju prvu politiku. dokumentacija za obuku i dokumentacija za skupove podataka pokrivaju formu i format; stranica SO-100 i kompletan SO-100 vodič pokrivaju izradu i kalibraciju. Pozadina: pregled VLA i članak o Pi0 flow-matchingu. Onaj koji će poboljšati vašu stopu uspešnosti je vodič za kvalitet podataka.
Koju VLA politiku da prvo treniram na SO-100?▾
ACT, zatim SmolVLA. ACT trenira od nule, tako da ne može maskirati loš skup podataka, a pokretanje košta 1 do 3 USD na kartici od 24 GB. Ako ACT uopšte obavi zadatak, 4 do 12 USD za pokretanje GR00T N1.7 ili Pi0.5 nije uzalud potrošeno.
Da li je GR00T N1.7 zaista bolji od Pi0.5?▾
Na LIBERO-u su unutar šuma: 97.0% u četiri paketa za GR00T N1.7, 96.85% za Pi0.5 na 30k koraka u openpi, 97.5% za LeRobot port, sve iz različitih okruženja. Prave razlike su 152 ms po koraku akcije naspram 485 ms, skupovi podataka v2.1 naspram v3.0, i tačnost benčmarka naspram generalizacije u otvorenom svetu.
Mogu li da fino podesim bilo koji od ovih na jednoj RTX 4090?▾
SmolVLA i ACT, da; oba su navedena za RTX 4090 ili bilo koju karticu od 24 GB i rade lokalno. GR00T N1.7, N1.5 i Pi0.5 zahtevaju A100 ili H100 80 GB i ovde su samo u oblaku. NVIDIA preporučuje 40 GB ili više za fino podešavanje GR00T-a; openpi-jev minimum je iznad 70 GB za potpuno fino podešavanje Pi0.5, 22.5 GB za LoRA.
Koji od ovih pet mogu komercijalno da koristim?▾
Težine GR00T N1.7 su pod NVIDIA Open Model License Agreement, za koju kartica kaže da pokriva komercijalnu upotrebu. Težine N1.5 su nekomercijalne. SmolVLA-ov kod je Apache 2.0 u LeRobot-u, ali lerobot/smolvla_base kartica ne sadrži polje za licencu, tako da težine nisu navedene. ACT nema osnovne težine za licenciranje. Pi0.5 je dvosmislen: LeRobot-ova dokumentacija kaže Apache 2.0, a njeni metapodaci kartice glase license: gemma.
Sources
- NVIDIA Isaac-GR00T repozitorijum: GA status, promene N1.6 u N1.7, hardverski zahtevi, torchcodec i FFmpeg ograničenja, launch_finetune.py, varijansa između pokretanja
- nvidia/GR00T-N1.7-3B kartica modela: Cosmos-Reason2-2B okosnica, 3 B parametara, tabela vremena inferencije, NVIDIA Open Model License, polje Model Version
- nvidia/GR00T-N1.5-3B kartica modela: Eagle 2 referenca, SigLip2 i T5, flow matching DiT, jednosmerna nekomercijalna licenca
- Isaac-GR00T LIBERO primer: stope uspešnosti po paketu na 20K koraka i veličini paketa 640, 200 pokušaja po paketu
- Isaac-GR00T SimplerEnv primer: stope uspešnosti Bridge i Fractal po zadatku, GR00T N1.6 naspram N1.7
- pi0.5: Model vizije-jezika-akcije sa generalizacijom u otvorenom svetu (2 B VLM plus 300 M akcioni ekspert, 50 Hz kontrola, oko 400 sati mobilne manipulacije, studija skaliranja preko 3 do 104 lokacije)
- openpi repozitorijum: minimalni zahtevi za GPU memoriju, opseg samo za flow-matching-head, i Pi0.5 LIBERO rezultati u examples/libero
- lerobot/pi05_base kartica modela: opseg LeRobot porta, license: gemma metapodaci, lerobot-train upotreba
- LeRobot pi0.5 dokumentacija: gated PaliGemma tokenizator, LIBERO tabela reprodukcije, n_action_steps fallback zamka, Apache 2.0 izjava
- SmolVLA: Model vizije-jezika-akcije za pristupačnu i efikasnu robotiku (450 M parametara, LIBERO i Meta-World tabele, SO-100 i SO-101 rezultati, asinhrona inferencija)
- LeRobot SmolVLA dokumentacija: 50 epizoda preko 5 pozicija naspram 25, 20k koraka za oko 4 sata na A100
- Učenje fine bimanualne manipulacije sa jeftinim hardverom (ACT i ALOHA): 6 zadataka sa 80-90 procenata, ablacija veličine bloka od k=1 do k=100
- LeRobot 0.6.2: ACTConfig i SmolVLAConfig podrazumevane vrednosti, podrazumevani seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 zahtev, Apache 2.0
- LeRobot GR00T dokumentacija: policy type groot, podrška za N1.5 uklonjena, pin lerobot==0.5.1, SO-101 primer veličine bloka
- lerobot/smolvla_base kartica modela: SmolVLA osnovna kontrolna tačka koju koristi --policy.path, i njeni metapodaci kartice, koji ne sadrže polje za licencu
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started