
GR00T N1.7, Pi0.5, SmolVLA, ACT au GR00T N1.5? Jedwali la uamuzi linalolingana na hali halisi, likiwa na nambari za vigezo vilivyochapishwa, muda wa kuchelewa, gharama kwa kila utekelezaji na leseni nyuma ya kila chaguo.
Sera tano zinaweza kufunzwa kwenye mkono wa darasa la SO-100 leo. Zinatofautiana kwa sababu ya 24 katika utekelezaji wa kuchelewa, 37 katika idadi ya vigezo na 12 katika gharama ya utekelezaji, na katika kama unaweza kusafirisha matokeo. Kadi tano za mfano hazitatatua hili: hakuna inayojibu swali ulilo nalo, ni ipi nianze kuendesha kwanza?
Kila nambari hapa chini ilisomwa kutoka kwenye karatasi, repos na kadi mnamo Agosti 2026. Nambari za jukwaa zinatoka from the orodha ya sera za AY-Robots; ambapo zote mbili hazikubaliani, zote zinaonyeshwa.
Toleo fupi
- •Funza ACT kwanza ikiwa una shaka na seti yako ya data: 1 hadi 3 USD kwa utekelezaji, hakuna kilichofunzwa awali kuficha data mbaya.
- •GR00T N1.7 na Pi0.5 ziko ndani ya nusu pointi kwenye LIBERO, 97.0 dhidi ya 96.85 hadi 97.5. Hiyo si sababu ya kuchagua mojawapo.
- •Pi0.5 inalenga ujumuishaji, si usahihi, na ndiyo polepole zaidi kwa 485 ms.
- •SmolVLA, ikiwa na vigezo 450 M, ndiyo VLA pekee hapa inayofanya urekebishaji mzuri kwenye kadi moja ya 24 GB.
- •ACT kwa 20 ms ndiyo chaguo pekee kwa mwendo wa haraka wa kuitikia. Leseni huamua mengine.
Jedwali la maamuzi
| Hali yako | Funza hii | Kwa nini |
|---|---|---|
| Ubora wa data haujathibitishwa | ACT | Hakuna kilichofunzwa awali kinachoficha data iliyoharibika, na kushindwa kunagharimu 1 hadi 3 USD. |
| Inayohitaji mguso mwingi, hatua nyingi, inayoelekezwa na lugha | GR00T N1.7 | 97.0% katika seti nne za LIBERO, pamoja na nafasi ya hatua ya kiishio cha mkono wa roboti. |
| Mwendo wa haraka wa kuitikia, utambuzi kwenye servomotor | ACT | 20 ms. Inayofuata kwa kasi ni polepole mara 7.6. |
| Vitu vipya, mandhari mpya, ulimwengu wazi | Pi0.5 | Imejengwa kwa tabia isiyo ya kawaida, katika hadi maeneo 104. |
| Kadi moja ya 24 GB, bado unataka lugha | SmolVLA | Vigezo milioni 450, kiwango cha chini cha vipindi 30, inaendeshwa ndani. |
| Kuzalisha upya uendeshaji uliorekodiwa mwaka 2025 | GR00T N1.5 | Ikiwa tu lazima: LeRobot sasa inaikataa, uzito si wa kibiashara. |
| Hii itasafirishwa kama bidhaa | N1.7, SmolVLA or ACT | N1.5 si ya kibiashara, Pi0.5 inatumia masharti ya Gemma, kadi ya SmolVLA haisemi chochote. |
Wagombea watano
Zote tano ni sera: fremu za kamera, nafasi za viungo na, kwa nne kati yao, maelekezo ya lugha, yaliyopangwa kwa kundi la malengo ya viungo ya baadaye. Kinachowatenganisha ni kiasi gani kilijifunzwa kabla hujafika.
| Sera | Vigezo | Ucheleweshaji | Kiwango cha GPU | Ndani? | Vipindi vya chini | Umbizo | Gharama |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ndiyo | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ndiyo | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | hapana | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | hapana | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | hapana | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Muundo wa sasa wa NVIDIA wa muundo wa kuona-lugha-vitendo, takriban vigezo bilioni 3, takriban milioni 40 vilivyofunzwa wakati wa ufunzwaji-laini. Hifadhi inaorodhesha tofauti kutoka N1.6: uti wa mgongo kutoka kwa muundo wa Eagle uliouzwa hadi Cosmos-Reason2-2B kwenye Qwen3-VL, tabaka za usambaaji 32 hadi 16, vipimo vya hali na vitendo 29 hadi 132, upeo wa vitendo 16 hadi 40.
Kinachojalisha kwenye mkono mdogo ni nafasi ya vitendo ya kiishio-mwisho: N1.7 inatabiri tofauti kutoka mkao wa sasa, jambo linaloruhusu saa 20K za video za binadamu za EgoScale kuhamishiwa kwenye sera ya roboti. Maelezo kwenye ukurasa wa N1.7, utaratibu katika mwongozo wa N1.7 kwenye SO-100.
README ya Isaac-GR00T inatangaza N1.7 kuwa toleo la Upatikanaji wa Jumla, lenye vigezo kamili na usaidizi. Kadi yake ya Hugging Face bado haijasasishwa: sehemu ya Model Version bado inasomeka GR00T N1.7 EA. Hifadhi ndio hati mpya zaidi.
GR00T N1.5
Kiwango sawa cha 3 B, uti wa mgongo wa Eagle 2, SigLip2 na T5, kichwa cha DiT kinacholingana na mtiririko. Ipo ili kupanua ulichonacho tayari. Mambo mawili yanaifanya kuwa chaguo-msingi duni: uzito hubeba leseni ya NVIDIA ya matumizi yasiyo ya kibiashara ya njia moja, na matoleo ya sasa ya LeRobot yaliondoa usaidizi wa N1.5. Tazama .
Pi0.5
Ya Physical Intelligence VLA, aina ya sera pi05. Karatasi inatoa VLM ya 2 B iliyoanzishwa kutoka PaliGemma pamoja na mtaalamu wa vitendo wa 300 M, ikiendesha roboti kwa 50 Hz; usanidi wa pi05 wa LeRobot huweka chaguo-msingi kwa kipande cha hatua 50, sekunde moja kwa kiwango hicho. Hoja kuu ya mauzo ni maeneo yasiyoonekana: takriban saa 400 za udanganyifu wa simu katika nyumba halisi, na utafiti wa kuongeza ukubwa juu ya maeneo 3, 12, 22, 53, 82 na 104, ambapo mfumo wa maeneo 104 ulilingana na udhibiti uliofundishwa kwenye nyumba za majaribio zenyewe.
Kikomo kimoja, kilichoelezwa kwenye lerobot/pi05_base kadi: bandari hubeba tu kichwa cha hatua kinacholingana na mtiririko. Utabiri wa kazi ndogo, uwekaji tokeni wa hatua na RL hazikutolewa hapo awali, na openpi inasema vivyo hivyo kuhusu hazina yake. Ukurasa wa Pi0.5 na mwongozo wa Pi0.5 kwenye SO-100 vina mengine.
Pi0.5 inahitaji kitoa tokeni kilichofungwa google/paligemma-3b-pt-224 (gated: manual, ingawa Google inasema maombi huchakatwa mara moja). Bila kukikubali na kuendesha hf auth login katika mazingira ya mafunzo, kazi huanza, inapakua kwa muda, kisha inakufa kwa hitilafu ya uidhinishaji inayoonekana kama hitilafu ya mtandao. nvidia/GR00T-N1.7-3B haijafungwa, lakini uti wake wa mgongo nvidia/Cosmos-Reason2-2B umefungwa (gated: auto). Futa zote mbili kabla ya kupanga foleni; ikiwa kazi inakaa bila kufanya kitu, ukurasa wa foleni iliyokwama unaorodhesha nini cha kuangalia.
SmolVLA
Vigezo milioni 450, takriban milioni 100 katika mtaalamu wa hatua, kwenye SmolVLM-2 na VLM ikiwa imegandishwa na tu tabaka zake 16 za kwanza za lugha-modeli zimetumika. Mafunzo ya awali yalikuwa data ya jamii: seti za data 481, fremu milioni 10.6, kutoka kwa mikono ya bei nafuu unayotumia. VLA pekee hapa inayotoshea kadi moja ya 24 GB, na sakafu pekee ya kipindi ya sakafu. Tazama ukurasa wa SmolVLA.
ACT
Sio mfumo msingi. Action Chunking Transformer kutoka ALOHA ina takriban vigezo 80 M vilivyofunzwa kutoka mwanzo kwa kila kazi, kwa maonyesho 50 kwa 50 Hz. Karatasi inaripoti kazi sita halisi za mikono miwili kutoka takriban kumi dakika za maonyesho kila moja, kwa asilimia 80 hadi 90 kwenye mifano inayoangazia. Wazo lake, action chunking, liko katika kila mfumo kwenye ukurasa huu, na upunguzaji wake bado unapima athari bora: zaidi ya kazi mbili zilizosimuliwa na temporal ensembling imezimwa, mafanikio huongezeka kutoka asilimia 1 kwa k=1 hadi 44 asilimia kwa k=100. Ukurasa wa ACT una mengine.
Kile ambacho vigezo vya utendaji vinasema kweli
LIBERO ndicho kigezo kimoja kati ya hivi vitano vinavyoripotiwa: kazi zinazotegemea lugha kwenye mfumo uliosimuliwa wa Franka Panda, zilizogawanywa katika seti nne zifuatazo za kazi kumi kila moja. NVIDIA ilifanya majaribio 200 kwa kila seti.
| Modeli | Kihisi cha Nafasi | Kihisi cha Kitu | Lengo | 10 (Muda Mrefu) | Wastani |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Kila nambari inatokana na mfumo na bajeti tofauti. GR00T iliendesha hatua 20K kwa kundi la kimataifa la 640; takwimu ya openpi ni hatua muhimu ya 30K; bandari ya LeRobot iliongeza hatua 6K kwa mfumo msingi wa LIBERO. SmolVLA ina tofauti zaidi: karatasi yake inafundisha safu hiyo kwenye LIBERO kutoka mwanzo, bila mafunzo ya awali ya VLA, wakati zile tatu zilizo juu yake zinasawazisha hatua muhimu zilizofunzwa awali. Chukulia 96.85 hadi 97.5 kama kundi moja, na pengo hadi 87.3% kama halisi lakini lililopatikana kwa vigezo mara 6.7.
SimplerEnv inaonyesha mtawanyiko, ambao LIBERO haionyeshi. NVIDIA inalinganisha N1.7 dhidi ya N1.6, kitu cha karibu zaidi hadharani na delta ya vizazi.
| Seti ya SimplerEnv | Wastani wa N1.6 | Wastani wa N1.7 | Mabadiliko Bora | Mabadiliko Mabaya Zaidi |
|---|---|---|---|---|
| Bridge (WidowX), kazi 7 | 56.6% | 62.3% | stack_cube 5.0 hadi 48.0 | put_eggplant_in_basket 89.0 hadi 53.0 |
| Fractal (Google Robot), kazi 6 | 52.0% | 72.5% | open_drawer 0.0 hadi 65.0 | hakuna, kila kazi iliboreshwa |
Safu ya Bridge ndiyo yenye manufaa: pointi 5.7 zilizopatikana kwa wastani wakati put_eggplant_in_basket ilipoteza 36 na put_eggplant_in_sink ilishuka kutoka 33 hadi 2. Kizazi kipya husogeza usambazaji badala ya kuuinua, hivyo ikiwa kazi yako iko mahali ambapo N1.7 ilirudi nyuma, wastani hausemi chochote.

Kati ya tano, ni karatasi ya SmolVLA pekee inayoripoti juu ya mkono wa darasa la SO-100: asilimia 78.3 kwa SmolVLA na 61.7 kwa Pi0 katika kazi tatu, zote za kazi nyingi, dhidi ya 48.3 kwa ACT iliyefunzwa kazi moja, ambayo si kama kwa kama. Ulinganifu safi ni kazi moja kwa SO-101 ya kuchukua na kuweka: 90 dhidi ya 70 katika usambazaji, 50 dhidi ya 40 nje yake. Linganisha kwenye ACT dhidi ya SmolVLA na Pi0.5 dhidi ya SmolVLA, au chunguza uwanja.
Ucheleweshaji na gharama huamua usambazaji
Ucheleweshaji wa utambuzi ndio kikwazo ambacho watu hugundua mwisho na hujuta kwanza. Sera iliyo bora kwa pointi tano kwenye kipimo cha utendaji lakini nusu sekunde kwa kila hatua ya kitendo huonekana mbaya zaidi kwenye dawati lako: mwingiliano wa nguvu haungoji.
Tahadhari moja: takwimu ya GR00T haikubaliani na kadi ya NVIDIA, ambayo hupima hatua 4 za kuondoa kelele na kamera moja kwa 85.8 ms kwenye H100 katika hali ya eager, 48.6 ms na torch.compile, 27.9 ms kupitia TensorRT kamili. 152 ms hapa ni takwimu ya mfumo mzima ikiwa na gharama za huduma na kamera zaidi ya moja, sio pasi ya mbele.
Mzunguko wa 20 hadi 485 ms ni wa modeli, na safari za kwenda na kurudi kwenye intaneti ya umma huongeza muda. Utambuzi wa mbali unawezekana kwa kazi za polepole za kuchukua na kuweka, sio kwa mwendo wa haraka wa kuitikia. Ikiwa kazi yako inahitaji kasi, utambuzi hukaa karibu na servomotor: ACT au SmolVLA, ndani. Inayohusiana: sera inaganda katikati ya mwendo.
Njia moja ya kununua muda bila kubadilisha modeli: karatasi ya SmolVLA inapima utekelezaji wa synchronous, ambapo sera inamaliza sehemu kabla ya kutabiri inayofuata, dhidi ya asynchronous, ambapo utabiri unaingiliana na utekelezaji. Mafanikio ni sawa, 78.3 dhidi ya 73.3, lakini kazi hiyo hiyo ya kuchukua na kuweka inachukua sekunde 9.7 badala ya 13.75, na katika dirisha maalum roboti inasimamia mizunguko 19 badala ya 9.
Leseni, zimekaguliwa kwa sababu hakuna anayezikagua
| Modeli | Leseni ya Uzito | Leseni ya Msimbo | Matumizi ya kibiashara |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kadi inaruhusu matumizi ya kibiashara | Apache 2.0 | ndiyo |
| GR00T N1.5 | Leseni ya NVIDIA ya matumizi yasiyo ya kibiashara ya njia moja | Apache 2.0 | hapana |
| Pi0.5 | Metadata ya kadi ya pi05_base inasoma leseni: gemma | Apache 2.0 (openpi, LeRobot docs) | soma zote mbili, zinatofautiana |
| SmolVLA | hakuna sehemu ya leseni kwenye kadi ya smolvla_base | Apache 2.0 (LeRobot) | msimbo ndiyo, uzito haujaelezwa |
| ACT | hakuna uzito wa msingi uliopo | Apache 2.0 (LeRobot) | ndiyo |
Safu ya Pi0.5 inahitaji uangalifu. Nyaraka za LeRobot pi05 zinasema Apache 2.0 inayoendana na openpi, wakati kadi ya Hub ya lerobot/pi05_base inabeba license: gemma. Zote mbili ziko hai. GR00T N1.7 ina toleo laini zaidi: README ya Isaac-GR00T inasema kwa kupita kwamba N1.7 ina leseni kamili ya kibiashara chini ya Apache 2.0, wakati sehemu yake ya leseni na kadi ya modeli huweka msimbo tu chini ya Apache 2.0 na uzito chini ya NVIDIA Open Model License.
Mipangilio chaguomsingi utakayoendesha
Kila fomu ya mkufunzi huja na mipangilio chaguomsingi, na si ya kiholela. Ya ACT ni ya LeRobot yenyewe: batch 8, lr 1e-5, 100000 hatua za mafunzo, ukubwa wa chunk 100, unaolingana na ACTConfig ya juu na k=100 kutoka karatasi ya ACT. Safu moja hapa chini ni mtego.
| Sera | Kundi | LR | Hatua za juu | Grad accum | Inatumika? | Vifundo vya ziada |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Sehemu ya kuanzia ya GR00T ya kurekebisha (launch_finetune.py, CLI ya tyro) haina sehemu ya seed katika dataclass yake ya usanidi, kwa hivyo uendeshaji hauwezi kurudiwa kwa usahihi wa biti kwa biti. Repo pia inaonya kuhusu tofauti ya asilimia 5 hadi 6 kati ya uendeshaji kutokana na nyongeza za picha zisizo za uhakika, kubwa kuliko mapengo mengi ya vigezo yanayojadiliwa mtandaoni. Seed chaguomsingi ya LeRobot ni 1000. Safu ya grad-accum inaelezea lerobot 0.5.1; toleo la juu 0.6.2 linaionyesha kama --accelerator.gradient_accumulation.steps.
Kifundo kinachojalisha zaidi kuliko chaguo la modeli
Huu ni mrundiko wa vitendo. Mirundiko mirefu hutoa mwendo laini zaidi na makosa machache yanayojirudia, lakini sera inatekelezwa wakati kizuizi kinapofanya kazi, kwa hivyo hujibu polepole kwa chochote kinachotembea: inajiamini kwenye mchemraba tuli, haina matumaini kwenye mchemraba unaozunguka. Ikiwa itapita kiasi, kufupisha sehemu iliyotekelezwa ni bora kuliko kufundisha upya na ni bure. Kiungo kinachosimama ghafla ni tatizo tofauti; angalia .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. Ukusanyaji wa muda umezimwa na unahitajin_action_steps 1. - GR00T N1.7: upeo wa ndani ulienda kutoka 16 hadi 40, lakini mfano wa SO-101 wa LeRobot bado unaendesha
--policy.chunk_size=16 --policy.n_action_steps=16. Bendera ya rollout ilibadilishwa jina kuwa--execution-horizon. - Pi0.5: mrundiko wa hatua 50, ambapo mapishi ya LIBERO ya LeRobot hutekeleza 10 kupitia
--policy.n_action_steps=10; nayo hurudi kwenye 50 ukikosa kuweka bendera--policy.pretrained_path. - SmolVLA: mirundiko ya vitendo 50, vifundo vyote viwili vimefichuliwa.
Jinsi ya kuchunguza zote tano kwa alasiri moja
Jibu la bei nafuu si kusoma zaidi. Tumia takriban 15 USD na uache mkono ukueleze: rekodi mara moja, fundisha kielelezo cha bei nafuu kwanza, kisha ongeza kiwango mara tu data imethibitishwa kuwa sahihi. Muundo ni bora kuliko wingi, lengo la na .
- 1Rekodi vipindi 50 mara moja
Hamsini husafisha njia kwa GR00T, Pi0.5 na ACT, na 30 ya SmolVLA. Rudia kila tofauti badala ya kusambaza kidogo: vipindi 50 katika nafasi 5 za mchemraba vilivyofunzwa ambapo 25 havikuwa. Tazama rekodi seti yako ya kwanza ya data.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Funza ACT kwanza, kwa sababu haiwezi kukudanganya
Hakuna uzito uliofunzwa awali, kwa hivyo ikiwa inafanya kazi kabisa, seti yako ya data ina kazi hiyo. Ikiwa ACT itashindwa, rekebisha data. 1 hadi 3 USD, saa 2 hadi 5 kwenye kadi ya 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Endesha SmolVLA kwenye seti ya data ileile, bila kubadilishwa
Data sawa, mkono sawa, vigezo milioni 450 badala ya milioni 80, pamoja na masharti ya lugha. LeRobot huweka hatua 20K kukimbia kwa takriban saa 4 kwenye A100 moja. Hii ndiyo inayokuambia kama mafunzo ya awali yanaleta faida yoyote.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Badilisha hadi v2.1 kabla ya kugusa GR00T
GR00T husoma toleo la umbizo la LeRobot v2 pamoja na
meta/modality.jsonya ziada inayoonyesha jinsi hali iliyounganishwa na safu za vitendo zinavyogawanyika katika sehemu zenye majina. Seti ya data ya v3.0 huangusha kipakiaji hicho, kwa sababu v3.0 huweka vipindi vingi kwenye faili zilizoshirikiwa ambapo v2 iliandika kimoja kwa kila kipindi. Isaac-GR00T husafirisha msaidizi wa kupunguza toleo kamascripts/lerobot_conversion/convert_v3_to_v2.py; ukurasa wa kukataa v3 ndiyo njia ya haraka.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Panda hadi GR00T N1.7 tu ikiwa zile mbili za kwanza ziliacha kitu mezani
Kupitia CLI ya NVIDIA, iliyoonyeshwa hapa, au aina ya sera ya LeRobot ya
groot. NVIDIA inapendekeza 40 GB au zaidi ya VRAM kwa urekebishaji mzuri, 16 GB kwa inference. Katika OOM, tazama ukurasa wa OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Njia mbili za kuendesha uchunguzi huo
Mazingira matatu, kwa sababu minyororo ya zana haipo pamoja. LeRobot kwenye main ni 0.6.2 na inahitaji Python 3.12 au mpya zaidi; Isaac-GR00T na openpi ni repos tofauti zinazosimamiwa na uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T huweka
torchcodec0.8.0 kama backend yake pekee ya video, ikihitaji FFmpeg 4 hadi 7. FFmpeg 8 haitumiki, AV1 haijahakikishiwa. - Viwango vya chini vya kumbukumbu vya openpi: inference zaidi ya 8 GB, LoRA zaidi ya 22.5 GB, fine-tuning kamili zaidi ya 70 GB. Hiyo ya mwisho ndiyo sababu Pi0.5 ni kazi ya A100.
- Kodisha GPU mwenyewe, iharibu baadaye, linganisha seti tatu za njia za checkpoint kwa mkono.
Miundo mitano ileile, fomu moja. Chagua modeli, seti ya data na hyperparameters; backend hukodisha GPU yenye ukubwa kulingana na VRAM inayohitajika, huendesha mkufunzi na kuandika kwenye hifadhi ya kitu.
- Matrix ya mafunzo ni miundo mitano kwa mikono minne, kila seli ni mwongozo: SmolVLA kwenye SO-100, ACT kwenye SO-101.
- Pods za inference huwekwa kiotomatiki na
/api/inference/podna watchdog isiyofanya kazi, kwa hivyo pod iliyosahaulika haitozi bili kimya kimya. - Checkpoints za msingi ni za wachuuzi wenyewe:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT haina yoyote. - Operesheni zilezile kutoka CLI na kutoka kwa mawakala wa AI kupitia seva ya MCP.
- Hakuna vifaa? Mkono wa moja kwa moja hutiririsha SO-100 halisi bila kujisajili; ukurasa wa kujaribu unaonyesha njia za kuingia.
Mfumo wa msingi au kuanzia mwanzo
Mgawanyiko halisi si kuchagua modeli gani ya 3 B. Ni kama kutumia VLA iliyefunzwa awali kabisa, kutokana na kwamba ACT ilijifunza kazi sita halisi za mikono miwili kutoka takriban dakika kumi za maonyesho kila moja, ikiwa na vigezo 80 M na hakuna kilichofunzwa awali.
- Masharti ya lugha. ACT haina; kituo kimoja cha ukaguzi cha ACT hufanya kazi moja.
- Bora kwenye vitu visivyokuwepo kwenye maonyesho yako: kwenye SO-101, 50% dhidi ya 40% ya ACT nje ya usambazaji.
- Kazi nyingi kabisa: SmolVLA inafikia 78.3% katika kazi tatu za SO-100 na kituo kimoja cha ukaguzi; ACT iliendeshwa kazi moja tu.
- Ucheleweshaji mara 7.6 hadi 24: 152 hadi 485 ms kwa hatua ya kitendo dhidi ya 20 ms ya ACT.
- 4 hadi 12 USD kwa kila utekelezaji badala ya 1 hadi 3, na kiwango cha A100 badala ya kadi yoyote ya 24 GB.
- Mfiduo wa leseni, pamoja na hali ya kushindwa ya repo iliyofungwa ambayo haipo kutoka mwanzo.
- Uzito uliofunzwa awali unaweza kuficha seti mbaya ya data. Marekebisho yanayofanya kazi nusu kwenye data iliyoharibika hugharimu wiki kabla ya kuangalia data.
Kesi ya kurudia utekelezaji wa zamani
Kufuatilia kituo cha ukaguzi cha 2025 kunakufanyia uchaguzi wa modeli na kugeuza tatizo kuwa uwekaji wa toleo: LeRobot ya sasa inakataa N1.5, kwa hivyo unaweka lerobot==0.5.1. Bila uga wa mbegu na tofauti ya asilimia 5 hadi 6 kati ya utekelezaji, uzazi ni wa kukadiria kwa ujenzi. na zina upande wa jukwaa.

Imepungua hadi miwili? ACT dhidi ya GR00T N1.7 na GR00T N1.7 dhidi ya SmolVLA. Safu wima ghafi ziko kwenye viingilio vya uwanja: GR00T N1.7, Pi0.5, SmolVLA na ACT.
Ambapo jukwaa hili halikusaidii
- Haliwezi kufanya utambuzi wa mbali kuwa wa haraka. Mzunguko wa 20 hadi 485 ms ni wa mfumo; safari za mtandao huongeza muda huo.
- Haliwezi kurekebisha GR00T au Pi0.5 kwenye maunzi yako mwenyewe. Zote hapa ni za wingu pekee; ni SmolVLA na ACT pekee zinazofanya kazi ndani ya nchi.
- Haliwezi kurekebisha seti ya data. Hasara inapungua lakini sera haifanyi chochote ni tatizo la data, sera inayofanya kazi katika mpangilio mmoja tu ni tatizo la chanjo.
- Haliwezi kufanya uendeshaji wa GR00T uweze kurudiwa: usanidi wa juu hauna sehemu ya mbegu.
Mifumo 85, matokeo 332 ya vigezo, kila nambari imeunganishwa na chanzo chake
Toleo linaloweza kupangwa la majedwali kwenye ukurasa huu: mifumo 85 ya maono-lugha-vitendo, matokeo 332 ya vigezo, kila moja ikiwa imeunganishwa na karatasi yake au kadi ya mfumo.
Fungua uwanjaKuchagua moja na kuendelea
Chaguo-msingi moja: rekodi vipindi 50, fundisha ACT kwa 1 hadi 3 USD ili kuthibitisha seti ya data, kisha SmolVLA kwenye data hiyo hiyo. Chini ya 6 USD kwa pamoja, na zinajibu swali muhimu: kama mafunzo ya awali yanasaidia hapa, au kama kikwazo ni data. Tumia GR00T N1.7 kwa kazi zenye hatua nyingi na zenye mguso, tumia Pi0.5 wakati mandhari inabadilika.
Mwongozo wa jukwaa: fundisha sera yako ya kwanza, kisha endesha sera yako ya kwanza. Ya nyaraka za mafunzo na nyaraka za seti ya data inashughulikia fomu na umbizo; ukurasa wa SO-100 na mwongozo kamili wa SO-100 inashughulikia ujenzi na usawazishaji. Mandharinyuma: muhtasari wa VLA na makala ya Pi0 flow-matching. Ile itakayoboresha kiwango chako cha mafanikio ni mwongozo wa ubora wa data.
Ni sera gani ya VLA ninapaswa kufundisha kwanza kwenye SO-100?▾
ACT, kisha SmolVLA. ACT hufundisha kuanzia mwanzo, kwa hivyo haiwezi kuficha seti mbaya ya data, na uendeshaji unagharimu 1 hadi 3 USD kwenye kadi ya 24 GB. Ikiwa ACT inafanya kazi hiyo kabisa, 4 hadi 12 USD kwa uendeshaji wa GR00T N1.7 au Pi0.5 haipotei.
Je, GR00T N1.7 ni bora zaidi kuliko Pi0.5?▾
Kwenye LIBERO ziko ndani ya kelele: 97.0% katika seti nne za GR00T N1.7, 96.85% kwa Pi0.5 kwa hatua 30k katika openpi, 97.5% kwa toleo la LeRobot, zote kutoka kwa mifumo tofauti. Tofauti halisi ni 152 ms kwa kila hatua ya kitendo dhidi ya 485 ms, seti za data za v2.1 dhidi ya v3.0, na usahihi wa benchmark dhidi ya ujumuishaji wa ulimwengu wazi.
Je, ninaweza kurekebisha yoyote kati ya hizi kwenye RTX 4090 moja?▾
SmolVLA na ACT, ndiyo; zote zimeorodheshwa kwa RTX 4090 au kadi yoyote ya 24 GB na huendeshwa ndani. GR00T N1.7, N1.5 na Pi0.5 zinahitaji A100 au H100 80 GB na zinapatikana tu kwenye wingu hapa. NVIDIA inapendekeza 40 GB au zaidi kwa kurekebisha GR00T; kiwango cha chini cha openpi ni zaidi ya 70 GB kwa kurekebisha kamili kwa Pi0.5, 22.5 GB kwa LoRA.
Ni ipi kati ya hizi tano ninaweza kutumia kibiashara?▾
Uzito wa GR00T N1.7 uko chini ya Mkataba wa Leseni ya Mfumo Huria wa NVIDIA, ambao kadi inasema unajumuisha matumizi ya kibiashara. Uzito wa N1.5 sio wa kibiashara. Msimbo wa SmolVLA ni Apache 2.0 katika LeRobot, lakini kadi ya lerobot/smolvla_base haina sehemu ya leseni, kwa hivyo uzito haujaelezwa. ACT haina uzito wa msingi wa kutoa leseni. Pi0.5 ina utata: nyaraka za LeRobot zinasema Apache 2.0, metadata ya kadi yake inasomeka license: gemma.
Sources
- Hifadhi ya NVIDIA Isaac-GR00T: Hali ya GA, mabadiliko ya N1.6 hadi N1.7, mahitaji ya maunzi, vikwazo vya torchcodec na FFmpeg, launch_finetune.py, tofauti ya uendeshaji kwa uendeshaji
- Kadi ya mfumo wa nvidia/GR00T-N1.7-3B: Msingi wa Cosmos-Reason2-2B, vigezo 3 B, jedwali la muda wa inference, Leseni ya Mfumo Huria ya NVIDIA, sehemu ya Toleo la Mfumo
- Kadi ya mfumo wa nvidia/GR00T-N1.5-3B: Marejeleo ya Eagle 2, SigLip2 na T5, flow matching DiT, leseni ya njia moja isiyo ya kibiashara
- Mfano wa Isaac-GR00T LIBERO: viwango vya mafanikio kwa kila seti kwa hatua 20K na ukubwa wa batch 640, majaribio 200 kwa kila seti
- Mfano wa Isaac-GR00T SimplerEnv: viwango vya mafanikio vya Bridge na Fractal kwa kila kazi, GR00T N1.6 dhidi ya N1.7
- pi0.5: Mfumo wa Maono-Lugha-Kitendo wenye Ujumuishaji wa Ulimwengu Wazi (2 B VLM pamoja na mtaalamu wa vitendo 300 M, udhibiti wa 50 Hz, takriban saa 400 za udhibiti wa simu, utafiti wa kuongeza ukubwa katika maeneo 3 hadi 104)
- Hifadhi ya openpi: viwango vya chini vya kumbukumbu ya GPU, upeo wa flow-matching-head-only, na matokeo ya Pi0.5 LIBERO katika examples/libero
- Kadi ya mfumo wa lerobot/pi05_base: upeo wa toleo la LeRobot, metadata ya license: gemma, matumizi ya lerobot-train
- Nyaraka za LeRobot pi0.5: PaliGemma tokenizer iliyofungwa, jedwali la uzalishaji wa LIBERO, mtego wa n_action_steps fallback, taarifa ya Apache 2.0
- SmolVLA: Mfumo wa Maono-Lugha-Kitendo kwa Roboti za Gharama Nafuu na Zenye Ufanisi (vigezo 450 M, majedwali ya LIBERO na Meta-World, matokeo ya SO-100 na SO-101, async inference)
- Nyaraka za LeRobot SmolVLA: vipindi 50 katika nafasi 5 dhidi ya 25, hatua 20k katika takriban saa 4 kwenye A100
- Kujifunza Udhibiti wa Mikono Miwili kwa Usahihi na Maunzi ya Gharama Nafuu (ACT na ALOHA): kazi 6 kwa asilimia 80-90, upunguzaji wa ukubwa wa chunk kutoka k=1 hadi k=100
- LeRobot 0.6.2: ACTConfig na SmolVLAConfig chaguomsingi, seed chaguomsingi 1000, --accelerator.gradient_accumulation.steps, mahitaji ya Python 3.12, Apache 2.0
- Nyaraka za LeRobot GR00T: aina ya sera groot, usaidizi wa N1.5 umeondolewa, pin lerobot==0.5.1, mfano wa ukubwa wa chunk wa SO-101
- Kadi ya mfumo wa lerobot/smolvla_base: checkpoint ya msingi ya SmolVLA inayotumiwa na --policy.path, na metadata ya kadi yake, ambayo haina sehemu ya leseni
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started