
GR00T N1.7, Pi0.5, SmolVLA, ACT ali GR00T N1.5? Tabela odločitev, usklajena z resničnimi situacijami, z objavljenimi referenčnimi številkami, zakasnitvijo, stroški na zagon in licencami za vsako izbiro.
Danes je mogoče usposobiti pet politik na roki razreda SO-100. Razlikujejo se za faktor 24 v inferenčni latenci, 37 v številu parametrov in 12 v stroških izvajanja ter v tem, ali smete rezultat poslati. Pet kartic modelov tega ne bo rešilo: nobena ne odgovarja na vprašanje, ki ga imate, katero naj najprej zaženem?
Vsaka spodnja številka je bila prebrana iz člankov, repozitorijev in kartic avgusta 2026. Številke platform prihajajo iz kataloga politik AY-Robots; kjer se obe ne ujemata, sta prikazani obe.
Kratka različica
- •Najprej usposobite ACT, če dvomite v svoj nabor podatkov: 1 do 3 USD na izvedbo, nič vnaprej usposobljenega za prikrivanje slabih podatkov.
- •GR00T N1.7 in Pi0.5 sta znotraj pol točke na LIBERO, 97.0 proti 96.85 do 97.5. To ni razlog za izbiro katerega koli.
- •Pi0.5 je namenjen generalizaciji, ne natančnosti, in je najpočasnejši pri 485 ms.
- •SmolVLA, s 450 M parametri, je edini VLA tukaj, ki se fino nastavi na eni 24 GB kartici.
- •ACT pri 20 ms je edina možnost za hitro reaktivno gibanje. Licence odločajo o ostalem.
Tabela odločitev
| Vaša situacija | Usposobite to | Zakaj |
|---|---|---|
| Kakovost podatkovnega nabora nedokazana | ACT | Nobena predhodno usposobljena rešitev ne more skriti pokvarjenega podatkovnega nabora, neuspeh pa stane 1 do 3 USD. |
| Bogato s stiki, večstopenjsko, pogojeno z jezikom | GR00T N1.7 | 97,0 % v štirih paketih LIBERO, plus relativni akcijski prostor končnega efektorja. |
| Hitro reaktivno gibanje, sklepanje pri servomotorjih | ACT | 20 ms. Naslednji najhitrejši je 7,6-krat počasnejši. |
| Novi objekti, nova scena, odprt svet | Pi0.5 | Zgrajeno za obnašanje izven distribucije, na do 104 lokacijah. |
| Ena 24 GB kartica, še vedno želite jezik | SmolVLA | 450 M parametrov, minimalno 30 epizod, deluje lokalno. |
| Reprodukcija izvedbe, posnete leta 2025 | GR00T N1.5 | Samo če morate: LeRobot ga zdaj zavrača, uteži so nekomercialne. |
| To bo dobavljeno kot izdelek | N1.7, SmolVLA or ACT | N1.5 je nekomercialen, Pi0.5 vključuje pogoje Gemma, kartica SmolVLA ne navaja nobenih. |
Pet kandidatov
Vseh pet je politik: sličice kamere, položaji sklepov in, za štiri od njih, jezikovno navodilo, preslikano v del prihodnjih ciljev sklepov. Kar jih ločuje, je, koliko je bilo naučenega, preden ste prišli.
| Politika | Parametri | Latenca | Razred GPU | Lokalno? | Min. epizod | Format | Cena |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | da | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | da | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | ne | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-in trenutni model vida, jezika in dejanj, približno 3 B parametrov, približno 40 M usposobljenih med fino nastavitvijo. Repozitorij navaja razlike od N1.6: hrbtenica iz modela Eagle dobavitelja v Cosmos-Reason2-2B na Qwen3-VL, difuzijske plasti 32 na 16, dimenzije stanja in dejanj 29 na 132, akcijski horizont 16 na 40.
Pri majhni roki je pomemben relativni akcijski prostor končnega efektorja: N1.7 napoveduje delte iz trenutne poze, kar omogoča prenos 20K ur človeškega videa EgoScale v robotsko politiko. Specifikacije na strani N1.7, postopek v vodniku N1.7 na SO-100.
README datoteka Isaac-GR00T razglaša N1.7 za izdajo Splošne razpoložljivosti, s popolnimi merili uspešnosti in podporo. Njena kartica Hugging Face še ni posodobljena: polje Model Version še vedno prikazuje GR00T N1.7 EA. Repozitorij je novejši dokument.
GR00T N1.5
Ista lestvica 3 B, hrbtenica Eagle 2, SigLip2 in T5, glava DiT za ujemanje toka. Obstaja za razširitev ki jo že imate. Dve stvari ga delata slabo privzeto izbiro: uteži nosijo NVIDIA-ino enosmerno nekomercialno licenco, in trenutne izdaje LeRobot so odstranile podporo za N1.5. Glejte .
Pi0.5
VLA podjetja Physical Intelligence, ki uporablja VLA, tip politike pi05. Članek opisuje 2 B VLM, inicializiran iz PaliGemma, plus 300 M akcijskega strokovnjaka, ki poganja robota pri 50 Hz; konfiguracija pi05 v LeRobot privzeto uporablja 50-korakovni del, eno sekundo pri tej hitrosti. Prodajna točka so nevidna mesta: približno 400 ur mobilne manipulacije v resničnih domovih in študija skaliranja na 3, 12, 22, 53, 82 in 104 lokacijah, kjer se je model s 104 lokacijami ujemal s kontrolo, usposobljeno na samih testnih domovih.
Ena omejitev, navedena na lerobot/pi05_base kartici: vrata prenašajo samo glavo za ujemanje toka akcijske glave. Predvidevanje podnalog, tokenizacija akcij in RL niso bili objavljeni navzgor, in openpi pravi enako za svoje lastno repozitorij. Stran Pi0.5 in vodnik Pi0.5 na SO-100 imata ostalo.
Pi0.5 potrebuje zaprt google/paligemma-3b-pt-224 tokenizator (gated: manual, čeprav Google pravi, da so zahteve obdelane takoj). Brez sprejetja in zagona hf auth login v okolju za usposabljanje, se naloga začne, se nekaj časa prenaša, nato pa se ustavi zaradi napake pri avtorizaciji, ki izgleda kot omrežna napaka. nvidia/GR00T-N1.7-3B ni zaprt, vendar je njegov nvidia/Cosmos-Reason2-2B hrbtenica je (gated: auto). Počistite oba pred uvrstitvijo v čakalno vrsto; če se zagon ustavi, stran o zataknjeni čakalni vrsti navaja, kaj preveriti.
SmolVLA
450 M parametrov, približno 100 M v akcijskem strokovnjaku, na SmolVLM-2 z zamrznjenim VLM in uporabljenih le njegovih prvih 16 plasti jezikovnega modela. Predusposabljanje je potekalo na podatkih skupnosti: 481 naborov podatkov, 10.6 M sličic, iz istih poceni rok, ki jih uporabljate. Edini VLA tukaj, ki se prilega eni 24 GB kartici, in edini 30 epizoda dno. Glej stran SmolVLA.
ACT
Ni temeljni model. Action Chunking Transformer iz ALOHA ima približno 80 milijonov parametrov, usposobljenih od začetka za vsako nalogo, na 50 demonstracijah pri 50 Hz. Članek poroča o šestih resničnih bimanualnih nalogah, vsaka iz približno desetih minut demonstracij, z uspešnostjo od 80 do 90 odstotkov na primerih, ki jih izpostavlja. Njegova ideja, razdelitev dejanj na dele, je prisotna v vsakem modelu na tej strani, in njegova ablacija še vedno meri učinek najbolje: pri dveh simuliranih nalogah z izklopljenim časovnim združevanjem, uspešnost naraste z 1 odstotka pri k=1 na 44 odstotkov pri k=100. Stran ACT ima preostalo.
Kaj dejansko pravijo merila uspešnosti
LIBERO je edino merilo uspešnosti, o katerem poročajo trije od teh petih: naloge, pogojene z jezikom, na simulirani Franka Panda, razdeljene v štiri spodnje zbirke po deset nalog. NVIDIA je izvedla 200 poskusov na zbirko.
| Model | Prostorsko | Predmet | Cilj | 10 (Dolgo) | Povprečje |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Vsaka številka izvira iz drugačnega preizkusa in proračuna. GR00T je izvedel 20K korakov pri globalni seriji 640; podatek openpi je kontrolna točka 30K; LeRobot port je dodal 6K korakov osnovnemu modelu LIBERO. SmolVLA je nadaljnje neskladje: njegova raziskava trenira to vrstico na LIBERO od začetka, brez predhodnega usposabljanja VLA, medtem ko trije nad njim natančno prilagodijo predhodno usposobljene kontrolne točke. Obravnavajte 96.85 do 97.5 kot eno skupino, in vrzel do 87.3% kot resnično, vendar pridobljeno s 6.7-krat več parametri.
SimplerEnv prikazuje razpon, česar LIBERO ne. NVIDIA primerja N1.7 z N1.6, kar je najbližje javni "generacijski delti."
| Zbirka SimplerEnv | Povprečje N1.6 | Povprečje N1.7 | Najboljše nihanje | Najslabše nihanje |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Vrstica Bridge je uporabna: povprečno pridobljenih 5,7 točk, medtem ko put_eggplant_in_basket izgubil 36 in put_eggplant_in_sink padel s 33 na 2. Nova generacija premika distribucijo, namesto da bi jo dvignila, zato če vaša naloga spada tja, kjer je N1.7 nazadoval, povprečje ne pove ničesar.

Od petih, le članek SmolVLA poroča o roki razreda SO-100: 78,3 odstotka za SmolVLA in 61,7 za Pi0 pri treh nalogah, obe večopravilni, proti 48,3 za ACT, usposobljenega za eno nalogo, kar ni primerljivo. Čista primerjava je oboje eno-naložno na SO-101 pick-and-place: 90 proti 70 v distribuciji, 50 proti 40 izven nje. Primerjajte na ACT proti SmolVLA in Pi0.5 proti SmolVLA, ali brskajte po areni.
Latenca in stroški odločajo o uvedbi
Latenca sklepanja je omejitev, ki jo ljudje odkrijejo zadnjo in najprej obžalujejo. Politika, ki je na merilu uspešnosti pet točk boljša, a potrebuje pol sekunde na korak dejanja, izgleda slabše na vaši mizi: kontaktna dinamika ne čaka.
Ena opomba: številka GR00T se ne ujema s kartico NVIDIA, ki meri 4 korake odstranjevanja šuma in eno kamero pri 85.8 ms na H100 v nestrpnem načinu, 48.6 ms s torch.compile, 27.9 ms skozi celoten TensorRT. Tukajšnjih 152 ms je celotna številka sklada z režijskimi stroški strežbe in več kot eno kamero, ne pa samo prehod naprej.
Zanka od 20 do 485 ms je modelova, in povratna potovanja po javnem internetu se ji prištevajo. Oddaljeno sklepanje je izvedljivo za počasno pobiranje in odlaganje, ne pa za hitro reaktivno gibanje. Če vaša naloga potrebuje hitrost, sklepanje poteka poleg servomotorjev: ACT ali SmolVLA, lokalno. Povezano: politika zamrzne med gibanjem.
En način za pridobitev časa brez spreminjanja modela: članek SmolVLA meri sinhrono izvajanje, kjer politika dokonča del pred napovedovanjem naslednjega, v primerjavi z asinhronim, kjer se napovedovanje prekriva z izvajanjem. Uspeh je podoben, 78.3 proti 73.3, vendar isto pobiranje in odlaganje traja 9.7 sekund namesto 13.75, in v fiksnem oknu robot opravi 19 ciklov namesto 9.
Licence, preverjene, ker jih nihče ne preverja
| Model | Licenca uteži | Licenca kode | Komercialna uporaba |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kartica omogoča komercialno uporabo | Apache 2.0 | da |
| GR00T N1.5 | NVIDIA enosmerna nekomercialna licenca | Apache 2.0 | ne |
| Pi0.5 | metapodatki kartice pi05_base navajajo licenco: gemma | Apache 2.0 (openpi, LeRobot docs) | preberite obe, nista skladni |
| SmolVLA | ni polja za licenco na kartici smolvla_base | Apache 2.0 (LeRobot) | koda da, uteži neopredeljene |
| ACT | osnovne uteži ne obstajajo | Apache 2.0 (LeRobot) | da |
Vrstica Pi0.5 zahteva pozornost. Dokumentacija LeRobot pi05 navaja Apache 2.0, kar je skladno z openpi, medtem ko kartica Hub za lerobot/pi05_base, vsebuje license: gemma. Obe sta aktivni. GR00T N1.7 ima milejšo različico: README datoteka Isaac-GR00T mimogrede navaja, da je N1.7 v celoti komercialno licenciran pod Apache 2.0, medtem ko njegov lastni licenčni oddelek in kartica modela postavljata kodo le pod Apache 2.0 in uteži pod NVIDIA Open Model License.
Privzete nastavitve, ki jih boste dejansko poganjali
Vsak obrazec za usposabljanje privzeto vključuje nastavitve, ki niso poljubne. ACT-jeve so lastne LeRobotu: serija 8, lr 1e-5, 100000 korakov usposabljanja, velikost bloka 100, kar ustreza ACTConfig-u navzgor in k=100 iz ACT članka. Eden od stolpcev spodaj je past.
| Politika | Serija | LR | Maks. koraki | Akumulacija gradienta | Velja? | Dodatne nastavitve |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Vhodna točka za fino uglasitev GR00T-a (launch_finetune.py, tyro CLI) nima polja za seme v svojem konfiguracijskem podatkovnem razredu, zato izvedbe niso bitno ponovljive. Repozitorij opozarja tudi na 5 do 6 odstotkov variacije med izvedbami zaradi nedeterminističnih obogatitev slik, kar je več kot večina razlik v merilih uspešnosti, o katerih se razpravlja na spletu. Privzeto seme LeRobota je 1000. Stolpec za akumulacijo gradienta opisuje lerobot 0.5.1; zgornji tok 0.6.2 ga razkriva kot --accelerator.gradient_accumulation.steps.
Nastavitev, ki je pomembnejša od izbire modela
To je akcijski kos. Daljši kosi zagotavljajo bolj gladko gibanje in manj kumulativnih napak, vendar je politika zavezana, medtem ko se blok izvaja, zato se pozno odziva na vse, kar se premika: samozavestna na statični kocki, brezupna na premikajoči se. Če preseže cilj, skrajšanje izvedenega dela premaga ponovno učenje in je brezplačno. Spoj, ki se ustavi prekmalu, je drugačen problem; glej .
- ACT: ACTConfig privzeto uporablja
chunk_size 100inn_action_steps 100. Časovno združevanje je izklopljeno in zahtevan_action_steps 1. - GR00T N1.7: notranji horizont se je povečal iz 16 na 40, vendar LeRobotov primer SO-101 še vedno izvaja
--policy.chunk_size=16 --policy.n_action_steps=16. Zastavica za izvedbo je bila preimenovana v--execution-horizon. - Pi0.5: 50-korakovni kos, od katerega LeRobotov recept LIBERO izvede 10 preko
--policy.n_action_steps=10; z--policy.pretrained_pathse vrne na 50, če izpustite zastavico. - SmolVLA: 50-akcijski kosi, oba gumba izpostavljena.
Kako pregledati vseh pet v enem popoldnevu
Najcenejši odgovor ni več branja. Porabite približno 15 USD in pustite, da vam roka pove: posnemite enkrat, najprej trenirajte poceni model, nato pa stopnjujte, ko se podatki izkažejo za zanesljive. Struktura premaga količino, kar je bistvo in .
- 1Posnemite 50 epizod enkrat
Petdeset epizod pripravi teren za GR00T, Pi0.5 in ACT, ter 30 za SmolVLA. Ponovite vsako variacijo, namesto da se razpršite: 50 epizod na 5 pozicijah kocke, kjer 25 ni bilo treniranih. Glejte posnemite svoj prvi nabor podatkov.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Najprej trenirajte ACT, ker vam ne more lagati
Brez predhodno treniranih uteži, zato če nalogo sploh opravi, vaš nabor podatkov vsebuje nalogo. Če ACT ne napreduje, popravite podatke. 1 do 3 USD, 2 do 5 ur na 24 GB kartici.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Zaženite SmolVLA na istem naboru podatkov, nespremenjenem
Isti podatki, ista roka, 450 M parametrov namesto 80 M, plus jezikovno pogojevanje. LeRobot ocenjuje 20K korakov na približno 4 ure na enem A100. To vam pove, ali predhodno treniranje prinaša kakršne koli koristi.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Pretvorite na v2.1, preden se lotite GR00T-a
GR00T bere različico formata LeRobot v2 plus dodatno datoteko
meta/modality.json, ki preslikuje, kako se združeni nizi stanj in dejanj razdelijo v poimenovana polja. Nabor podatkov v3.0 povzroči sesutje nalagalnika, ker v3.0 pakira veliko epizod v skupne datoteke, medtem ko je v2 pisal eno na epizodo. Isaac-GR00T dobavlja pomočnika za znižanje različice kotscripts/lerobot_conversion/convert_v3_to_v2.py; stran za zavrnitev v3 je hitra pot.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Uporabite GR00T N1.7 le, če prvi dve možnosti nista bili dovolj učinkoviti
Prek NVIDIA-jevega CLI, prikazanega tukaj, ali LeRobotovega tipa politike
groot. NVIDIA priporoča 40 GB ali več VRAM-a za fino uglasitev, 16 GB za sklepanje. Ob napaki OOM si oglejte stran OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dva načina za izvedbo tega presejalnega pregleda
Tri okolja, ker se orodja ne ujemajo. LeRobot na glavni veji je 0.6.2 in potrebuje Python 3.12 ali novejši; Isaac-GR00T in openpi sta ločena repozitorija, upravljana z uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T uporablja
torchcodec0.8.0 kot edini video zaledje, ki potrebuje FFmpeg 4 do 7. FFmpeg 8 ni podprt, AV1 ni zagotovljen. - openpi pomnilniške zahteve: sklepanje nad 8 GB, LoRA nad 22.5 GB, popolna fina uglasitev nad 70 GB. Slednje je razlog, zakaj je Pi0.5 naloga za A100.
- Najemite GPU sami, ga nato uničite, ročno uskladite tri nize poti do kontrolnih točk.
Istih pet modelov, ena oblika. Izberite model, nabor podatkov in hiperparametre; zaledje najame GPU, določenega z zahtevanim VRAM-om, zažene trenerja in zapiše v shrambo objektov.
- Matrika usposabljanja je pet modelov s štirimi rokami, vsaka celica je vodnik: SmolVLA na SO-100, ACT na SO-101.
- Sklepalni podi se samodejno zagotovijo z
/api/inference/podz nadzornikom mirovanja, tako da pozabljen pod ne zaračunava tiho. - Osnovne kontrolne točke so lastne prodajalcem:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT jih nima. - Iste operacije iz CLI-ja in od AI agentov prek strežnika MCP.
- Nimate strojne opreme? Roka v živo pretaka fizični SO-100 brez prijave; stran za preizkus prikazuje načine dostopa.
Temeljni model ali od začetka
Prava dilema ni, kateri model 3 B izbrati. Gre za to, ali sploh uporabiti predhodno usposobljen VLA, glede na to, da se je ACT naučil šestih resničnih bimanualnih nalog iz približno desetih minut demonstracij za vsako, z 80 M parametri in nič predhodno usposobljenega.
- Jezikovno pogojevanje. ACT ga nima; ena kontrolna točka ACT opravi eno nalogo.
- Boljše pri objektih, ki niso prisotni v vaših demonstracijah: na SO-101, 50% proti ACT-jevim 40% izven distribucije.
- Večopravilnost sploh: SmolVLA doseže 78,3% pri treh nalogah SO-100 z eno kontrolno točko; ACT je bil zagnan samo za eno nalogo.
- 7,6- do 24-kratna zakasnitev: 152 do 485 ms na korak dejanja v primerjavi z ACT-jevimi 20 ms.
- 4 do 12 USD na zagon namesto 1 do 3, in raven A100 namesto katere koli 24 GB kartice.
- Izpostavljenost licencam, plus način odpovedi z omejenim dostopom do repozitorija, ki ne obstaja pri razvoju od začetka.
- Predhodno usposobljene uteži lahko prikrijejo slab nabor podatkov. Fino uglaševanje, ki delno deluje na pokvarjenih podatkih, stane teden dni, preden si ogledate podatke.
Primer reprodukcije starega zagona
Zasledovanje kontrolne točke iz leta 2025 določa izbiro modela za vas in problem spremeni v pripenjanje različice: trenutni LeRobot zavrača N1.5, zato pripnete lerobot==0.5.1. Brez polja za seme in s 5 do 6 odstotki variance med zagoni, je reprodukcija po zasnovi približna. in imata platformno stran.

Zmanjšalo se je na dva? ACT proti GR00T N1.7 in GR00T N1.7 proti SmolVLA. Neobdelane vrstice so v vnosih arene: GR00T N1.7, Pi0.5, SmolVLA in ACT.
Kje vam ta platforma ne pomaga
- Ne more pospešiti oddaljenega sklepanja. Zanka od 20 do 485 ms pripada modelu; internetni povratni časi se ji prištejejo.
- Ne more natančno uglasiti GR00T ali Pi0.5 na vaši strojni opremi. Oba sta tukaj samo v oblaku; samo SmolVLA in ACT delujeta lokalno.
- Ne more popraviti podatkovnega nabora. Izguba pada, vendar politika ne dela nič je problem s podatki, politika, ki deluje samo v eni nastavitvi je problem pokritosti.
- Ne more zagotoviti ponovljivosti izvajanj GR00T: nadrejena konfiguracija nima polja za seme.
85 modelov, 332 rezultatov meritev, vsaka številka povezana z virom
Razvrstljiva različica tabel na tej strani: 85 modelov vida, jezika in akcije, 332 rezultatov meritev, vsak povezan z izvirnim člankom ali kartico modela.
Odpri arenoIzbira in nadaljevanje
Ena privzeta možnost: posnemite 50 epizod, trenirajte ACT za 1 do 3 USD, da dokažete nabor podatkov, nato SmolVLA na istih podatkih. Skupaj pod 6 USD, in odgovorita na pomembno vprašanje: ali predhodno učenje tukaj pomaga, ali je ozko grlo v podatkih. Stopnjujte na GR00T N1.7 za večstopenjske naloge z bogatim stikom, na Pi0.5, ko se scena spremeni.
Predstavitev platforme: trenirajte svojo prvo politiko, nato zaženite svojo prvo politiko. Dokumentacija za usposabljanje in dokumentacija za nabore podatkov pokrivata obliko in format; stran SO-100 in celoten vodnik za SO-100 pokrivata izdelavo in kalibracijo. Ozadje: pregled VLA in članek o ujemanju toka Pi0. Tisto, kar bo izboljšalo vašo stopnjo uspešnosti, je vodnik za kakovost podatkov.
Katero politiko VLA naj najprej treniram na SO-100?▾
ACT, nato SmolVLA. ACT se trenira od začetka, zato ne more prikriti slabega nabora podatkov, in zagon stane 1 do 3 USD na 24 GB kartici. Če ACT sploh opravi nalogo, potem 4 do 12 USD za zagon GR00T N1.7 ali Pi0.5 ni zapravljenih.
Je GR00T N1.7 dejansko boljši od Pi0.5?▾
Na LIBERO so znotraj šuma: 97.0% v štirih sklopih za GR00T N1.7, 96.85% za Pi0.5 pri 30k korakih v openpi, 97.5% za LeRobot port, vse iz različnih testnih okolij. Prave razlike so 152 ms na korak dejanja proti 485 ms, nabori podatkov v2.1 proti v3.0, in natančnost merilnikov proti posploševanju v odprtem svetu.
Ali lahko katero od teh fino uglasim na eni sami RTX 4090?▾
SmolVLA in ACT, da; oba sta navedena za RTX 4090 ali katero koli 24 GB kartico in se izvajata lokalno. GR00T N1.7, N1.5 in Pi0.5 potrebujejo A100 ali H100 80 GB in so tukaj samo v oblaku. NVIDIA priporoča 40 GB ali več za fino uglaševanje GR00T; spodnja meja openpi je nad 70 GB za popolno fino uglaševanje Pi0.5, 22.5 GB za LoRA.
Katere od teh petih lahko uporabljam komercialno?▾
Teže GR00T N1.7 so pod licenčno pogodbo NVIDIA Open Model License Agreement, ki po navedbah kartice pokriva komercialno uporabo. Teže N1.5 so nekomercialne. Koda SmolVLA je Apache 2.0 v LeRobot, vendar kartica lerobot/smolvla_base nima polja za licenco, zato teže niso navedene. ACT nima osnovnih tež za licenciranje. Pi0.5 je dvoumen: dokumentacija LeRobot navaja Apache 2.0, njeni metapodatki kartice pa kažejo licenco: gemma.
Sources
- Repozitorij NVIDIA Isaac-GR00T: status GA, spremembe N1.6 v N1.7, strojne zahteve, omejitve torchcodec in FFmpeg, launch_finetune.py, varianca med zagoni
- Kartica modela nvidia/GR00T-N1.7-3B: hrbtenica Cosmos-Reason2-2B, 3 B parametrov, tabela časov izvajanja sklepanja, licenca NVIDIA Open Model License, polje Model Version
- Kartica modela nvidia/GR00T-N1.5-3B: referenca Eagle 2, SigLip2 in T5, ujemanje toka DiT, enosmerna nekomercialna licenca
- Primer Isaac-GR00T LIBERO: stopnje uspešnosti po sklopih pri 20K korakih in velikosti paketa 640, 200 poskusov na sklop
- Primer Isaac-GR00T SimplerEnv: stopnje uspešnosti Bridge in Fractal po nalogah, GR00T N1.6 proti N1.7
- pi0.5: model vida, jezika in dejanja z generalizacijo v odprtem svetu (2 B VLM plus 300 M strokovnjak za dejanja, 50 Hz nadzor, približno 400 ur mobilne manipulacije, študija skaliranja na 3 do 104 lokacijah)
- Repozitorij openpi: spodnje meje pomnilnika GPU, obseg samo za glavo ujemanja toka, in rezultati Pi0.5 LIBERO v examples/libero
- Kartica modela lerobot/pi05_base: obseg LeRobot porta, licenca: metapodatki gemma, uporaba lerobot-train
- Dokumentacija LeRobot pi0.5: gated PaliGemma tokenizer, tabela reprodukcije LIBERO, n_action_steps fallback trap, izjava Apache 2.0
- SmolVLA: model vida, jezika in dejanja za cenovno ugodno in učinkovito robotiko (450 M parametrov, tabele LIBERO in Meta-World, rezultati SO-100 in SO-101, asinhrono sklepanje)
- Dokumentacija LeRobot SmolVLA: 50 epizod na 5 pozicijah proti 25, 20k korakov v približno 4 urah na A100
- Učenje fine bimanualne manipulacije z nizkocenovno strojno opremo (ACT in ALOHA): 6 nalog z 80-90 odstotki, ablacija velikosti bloka od k=1 do k=100
- LeRobot 0.6.2: privzete nastavitve ACTConfig in SmolVLAConfig, privzeti seed 1000, --accelerator.gradient_accumulation.steps, zahteva Python 3.12, Apache 2.0
- Dokumentacija LeRobot GR00T: tip politike groot, podpora za N1.5 odstranjena, pin lerobot==0.5.1, primer velikosti bloka SO-101
- Kartica modela lerobot/smolvla_base: osnovna kontrolna točka SmolVLA, ki jo uporablja --policy.path, in njeni metapodatki kartice, ki ne vsebujejo polja za licenco
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started