
GR00T N1.7, Pi0.5, SmolVLA, ACT eða GR00T N1.5? Ákvarðanatöflur sem passa við raunverulegar aðstæður, með birtum viðmiðunartölum, töf, kostnaði á keyrslu og leyfum á bak við hvern valkost.
Fimm stefnur eru þjálfanlegar á SO-100 flokks armi í dag. Þær eru ólíkar um stuðulinn 24 í ályktunar-töf, 37 í fjölda færibreyta og 12 í því hvað keyrsla kostar, og hvort þú mátt senda niðurstöðuna. Fimm líkanakort munu ekki leysa það: ekkert svarar spurningunni sem þú hefur, hvaða keyri ég fyrst?
Sérhver tala hér að neðan var lesin úr greinum, geymslum og kortum í ágúst 2026. Vettvangsnúmer koma frá AY-Robots stefnuskrá; þar sem þau tvö eru ósammála, eru bæði sýnd.
Stutta útgáfan
- •Þjálfaðu ACT fyrst ef þú efast um gagnasafnið þitt: 1 til 3 USD á keyrslu, ekkert forþjálfað til að hylja slæm gögn.
- •GR00T N1.7 og Pi0.5 eru innan hálfs punkts á LIBERO, 97.0 á móti 96.85 til 97.5. Það er ekki ástæða til að velja annað hvort.
- •Pi0.5 snýst um alhæfinguna, ekki nákvæmnina, og er hægast á 485 ms.
- •SmolVLA, með 450 M færibreytur, er eina VLA hér sem fínstillir á einu 24 GB korti.
- •ACT á 20 ms er eini kosturinn fyrir hraða viðbragðshreyfingu. Leyfi ráða restinni.
Ákvarðanatöflan
| Þín staða | Þjálfa þetta | Af hverju |
|---|---|---|
| Gæði gagnasetts óprófuð | ACT | Ekkert forþjálfað felur bilað gagnasett, og mistök kosta 1 til 3 USD. |
| Snertiríkt, fjölþrepa, tungumálsbundin | GR00T N1.7 | 97.0% yfir fjórum LIBERO svítum, auk hlutfallslegs virkjunarsvæðis endabúnaðar. |
| Hröð viðbragðshreyfing, ályktun á servóum | ACT | 20 ms. Næst hraðasta er 7.6 sinnum hægara. |
| Nýir hlutir, nýtt umhverfi, opinn heimur | Pi0.5 | Byggt fyrir hegðun utan dreifingar, yfir allt að 104 staði. |
| Eitt 24 GB kort, vill samt tungumál | SmolVLA | 450 M færibreytur, 30 þátta lágmark, keyrir staðbundið. |
| Endurgera keyrslu sem var skráð árið 2025 | GR00T N1.5 | Aðeins ef þú verður: LeRobot hafnar því núna, þyngdir eru ekki í viðskiptalegum tilgangi. |
| Þetta verður sent sem vara | N1.7, SmolVLA or ACT | N1.5 er ekki í viðskiptalegum tilgangi, Pi0.5 ber Gemma skilmála, kort SmolVLA segir ekkert. |
Fimm frambjóðendurnir
Allir fimm eru stefnur: myndavélarrámar, liðstaðsetningar og, fyrir fjóra þeirra, tungumálsleiðbeiningar, kortlagðar í hluta af framtíðar liðmarkmiðum. Það sem aðgreinir þá er hversu mikið var lært áður en þú komst.
| Stefna | Færibreytur | Seinkun | GPU flokkur | Staðbundið? | Lágmarksþættir | Snið | Kostnaður |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB kort | já | 50 | v3.0 | 1 til 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB kort | já | 30 | v3.0 | 1 til 3 USD |
| GR00T N1.7 | ~3 B, ~40 M stillt | 152 ms | A100/H100 80 GB | nei | 50 | v2.0/v2.1 | 4 til 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | nei | 50 | v2.0/v2.1 | 4 til 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | nei | 50 | v3.0 | 4 til 12 USD |
GR00T N1.7
Núverandi sjón-tungumál-aðgerðarlíkan NVIDIA, um 3 milljarðar færibreytna, um það bil 40 milljónir þjálfaðar meðan á fínstillingu. Geymslan listar breytingarnar frá N1.6: burðarvirki frá Eagle líkani frá söluaðila yfir í Cosmos-Reason2-2B á Qwen3-VL, dreifingarlög 32 í 16, ástands- og aðgerðarvíddir 29 í 132, aðgerðarsjóndeildarhringur 16 í 40.
Það sem skiptir máli á litlum armi er hlutfallslegt aðgerðarrými endabúnaðar: N1.7 spáir fyrir um breytingar frá núverandi stöðu, sem er það sem gerir 20 þúsund klukkustundum af EgoScale mannlegu myndbandi kleift að flytjast yfir í vélmennisstefnu. Upplýsingar á N1.7 síðunni, ferli í leiðbeiningunum um N1.7 á SO-100.
Isaac-GR00T README lýsir N1.7 sem General Availability útgáfu, með fullkomnum viðmiðum og stuðningi. Hugging Face kortið hefur ekki verið uppfært: Model Version reiturinn sýnir enn GR00T N1.7 EA. Geymslan er nýrra skjalið.
GR00T N1.5
Sami 3 B kvarði, Eagle 2 burðarás, SigLip2 og T5, flæðisjöfnunar DiT haus. Hann er til staðar til að framlengja sem þú hefur nú þegar. Tvennt gerir hann að lélegum sjálfgefnum valkosti: vigtirnar bera einstefnu, óviðskiptalegt leyfi NVIDIA, og núverandi útgáfur LeRobot fjarlægðu stuðning við N1.5. Sjá .
Pi0.5
Physical Intelligence's VLA, stefnutegund pi05. Greinin lýsir 2 B VLM sem er frumstillt frá PaliGemma ásamt 300 M aðgerðasérfræðingi, sem stýrir vélmenninu á 50 Hz; sjálfgefin pi05 stilling LeRobot er 50 skrefa bútur, ein sekúnda á þeim hraða. Sölustaðurinn er óséðir staðir: um 400 klukkustundir af hreyfanlegri meðhöndlun á raunverulegum heimilum, og stækkunarrannsókn yfir 3, 12, 22, 53, 82 og 104 staði, þar sem 104 staða líkanið passaði við stjórnun sem var þjálfuð á prófunarheimilunum sjálfum.
Eitt takmörk, sem fram kemur á lerobot/pi05_base kortinu: tengið ber aðeins flæðis-samsvarandi aðgerðarhausinn. Spá um undirverkefni, aðgerðartákngerving og RL voru ekki gefin út uppstreymis, og openpi segir það sama um eigið geymslusvæði. Pi0.5 síðan og leiðbeiningarnar um Pi0.5 á SO-100 hafa afganginn.
Pi0.5 þarf hliðstýrða `google/paligemma-3b-pt-224` tákngervilinn (`gated: manual`, þó Google segi að beiðnir séu afgreiddar strax). Án þess að samþykkja hann og keyra `hf auth login` í þjálfunarumhverfinu, byrjar verkið, hleður niður um stund, deyr síðan vegna heimildarvillu sem lítur út eins og netbilun. `nvidia/GR00T-N1.7-3B` er ekki hliðstýrður, en `nvidia/Cosmos-Reason2-2B` burðarásinn hans er það (`gated: auto`). Hreinsaðu báða áður en þú setur í biðröð; ef keyrsla situr aðgerðarlaus, síðan um fasta biðröð listar upp hvað á að athuga.
SmolVLA
450 M færibreytur, um 100 M í aðgerðasérfræðingnum, á SmolVLM-2 með VLM frosið og aðeins fyrstu 16 tungumálalags-lög notuð. Forþjálfun voru samfélagsgögn: 481 gagnasöfn, 10.6 M rammar, frá sömu ódýru örmunum sem þú notar. Eina VLA hér sem passar á eitt 24 GB kort, og eina 30 þátta gólf. Sjá SmolVLA síðuna.
ACT
Ekki grunngerð. Action Chunking Transformer frá ALOHA er um 80 M færibreytur þjálfaðar frá grunni fyrir hvert verkefni, á 50 sýnikennslum við 50 Hz. Greinin greinir frá sex raunverulegum tvíhöfða verkefnum úr um það bil tíu mínútum af sýnikennslum hvoru, með 80 til 90 prósent á þeim dæmum sem hún dregur fram. Hugmynd hennar, aðgerðaskipting, er í hverri gerð á þessari síðu, og frálag hennar mælir enn áhrifin best: yfir tvö hermd verkefni með tímabundinni samsetningu óvirkri, hækkar árangur úr 1 prósenti við k=1 í 44 prósent við k=100. ACT síðan hefur afganginn.
Hvað viðmiðin segja í raun
LIBERO er eina viðmiðið sem þrír af þessum fimm greina frá: tungumálaskilyrt verkefni á hermdum Franka Panda, skipt í fjórar svítur hér að neðan með tíu verkefnum hvorri. NVIDIA keyrði 200 tilraunir á hverja svítu.
| Líkan | Rýmislegt | Hlutur | Markmið | 10 (Langt) | Meðaltal |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Hver tala kemur frá mismunandi prófunarumhverfi og fjárveitingu. GR00T keyrði 20K skref með alþjóðlegri lotustærð 640; openpi talan er 30K stöðupunktur; LeRobot útfærslan bætti 6K skrefum við LIBERO grunnlíkan. SmolVLA er enn frekari ósamræmi: grein þess þjálfar þá röð á LIBERO frá grunni, án VLA forþjálfunar, á meðan þau þrjú fyrir ofan fínstilla forþjálfaða stöðupunkta. Líta skal á 96.85 til 97.5 sem einn klasa, og bilið upp í 87.3% sem raunverulegt en fengið með 6.7x fleiri færibreytum.
SimplerEnv sýnir dreifinguna, sem LIBERO gerir ekki. NVIDIA ber N1.7 saman við N1.6, það næstopinbera sem líkist kynslóðabreytingu.
| SimplerEnv svíta | N1.6 meðaltal | N1.7 meðaltal | Besta sveifla | Versta sveifla |
|---|---|---|---|---|
| Brú (WidowX), 7 verkefni | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 verkefni | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ekkert, hvert verkefni batnaði |
Bridge röðin er sú gagnlega: 5,7 stigum bætt að meðaltali á meðan put_eggplant_in_basket tapaði 36 og put_eggplant_in_sink féll úr 33 í 2. Ný kynslóð færir dreifinguna frekar en að lyfta henni, svo ef verkefnið þitt er þar sem N1.7 dróst saman, segir meðaltalið ekkert.

Af þeim fimm greinir aðeins SmolVLA greinin frá SO-100 flokks armi: 78,3 prósent fyrir SmolVLA og 61,7 fyrir Pi0 yfir þrjú verkefni, bæði fjölverkefni, á móti 48,3 fyrir ACT þjálfað eitt verkefni, sem er ekki sambærilegt. Hrein pörun er bæði eitt verkefni á SO-101 pick-and-place: 90 á móti 70 í dreifingu, 50 á móti 40 utan hennar. Berðu saman á ACT á móti SmolVLA og Pi0.5 á móti SmolVLA, eða skoðaðu vettvanginn.
Seinkun og kostnaður ráða útfærslu
Ályktunartöf er sú takmörkun sem fólk uppgötvar síðast og sér eftir fyrst. Stefna sem er fimm stigum betri á viðmiðun en tekur hálfa sekúndu á hverju aðgerðarskrefi lítur verr út á skrifborðinu þínu: snertidynamík bíður ekki.
Eitt fyrirvari: GR00T talan er ósammála korti NVIDIA, sem mælir 4 afhávaðaskref og eina myndavél á 85.8 ms á H100 í eager mode, 48.6 ms með torch.compile, 27.9 ms í gegnum fullt TensorRT. 152 ms hér er heildarstafla með þjónustuálagi og fleiri en einni myndavél, ekki framsending.
Lykkjan sem tekur 20 til 485 ms er líkansins, og ferðir fram og til baka um almennt internet bætast við hana. Fjarályktun er raunhæf fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka hreyfingu. Ef verkefnið þitt þarf hraða, situr ályktun við hliðina á servóunum: ACT eða SmolVLA, staðbundið. Tengt: stefna frýs í miðri hreyfingu.
Ein leið til að spara tíma án þess að breyta líkani: SmolVLA greinin mælir samstillta framkvæmd, þar sem stefnan klárar einn hluta áður en hún spáir fyrir um næsta, á móti ósamstilltri, þar sem spá skarast við framkvæmd. Árangur er svipaður, 78.3 á móti 73.3, en sama tínslan og staðsetningin tekur 9.7 sekúndur í stað 13.75, og í föstu tímabili stýrir vélmennið 19 hringrásum í stað 9.
Leyfi, athuguð vegna þess að enginn athugar þau
| Líkan | Leyfi fyrir þyngdir | Leyfi fyrir kóða | Notkun í atvinnuskyni |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kort leyfir notkun í atvinnuskyni | Apache 2.0 | já |
| GR00T N1.5 | NVIDIA one-way non-commercial licence | Apache 2.0 | nei |
| Pi0.5 | pi05_base kort metadata les leyfi: gemma | Apache 2.0 (openpi, LeRobot docs) | lesið bæði, þau eru ósammála |
| SmolVLA | ekkert leyfissvið á smolvla_base kortinu | Apache 2.0 (LeRobot) | kóði já, þyngdir ótilgreindar |
| ACT | engar grunnþyngdir eru til | Apache 2.0 (LeRobot) | já |
Pi0.5 röðin þarfnast athygli. LeRobot pi05 skjölun segir Apache 2.0 í samræmi við openpi, á meðan Hub kortið fyrir lerobot/pi05_base inniheldur license: gemma. Bæði eru virk. GR00T N1.7 hefur mildari útgáfu: Isaac-GR00T README segir í framhjáhlaupi að N1.7 sé að fullu leyfilegt til notkunar í atvinnuskyni undir Apache 2.0, á meðan eigin leyfissvið og líkanakort setja aðeins kóðann undir Apache 2.0 og þyngdirnar undir NVIDIA Open Model License.
Sjálfgefnar stillingar sem þú munt í raun keyra
Hvert þjálfunarform kemur með sjálfgefna stillingu, og þær eru ekki handahófskenndar. ACT's eru eigin LeRobot: batch 8, lr 1e-5, 100000 þjálfunarskref, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Einn dálkur hér að neðan er gildra.
| Stýring | Lotustærð | Námshraði | Hámarksskref | Uppsöfnun halla | Gildir? | Auka stillingar |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T's fine-tuning entry point (launch_finetune.py, a tyro CLI) has ekkert fræsvið in its config dataclass, so runs are not bit-for-bit reproducible. Geymslan varar einnig við 5 to 6 percent variance between runs vegna ósjálfráðra myndaukninga, sem er meira en flest bil í viðmiðum sem deilt er um á netinu. LeRobot's default seed is 1000. The grad-accum column describes lerobot 0.5.1; útgáfa 0.6.2 sýnir það sem --accelerator.gradient_accumulation.steps.
Stillingin sem skiptir meira máli en val á líkani
Þetta er aðgerðarhlutinn. Lengri hlutar gefa mýkri hreyfingu og færri uppsafnaðar villur, en stefnan er bindandi á meðan blokkin keyrir, svo hún bregst seint við öllu sem hreyfist: örugg á kyrrstæðum teningi, vonlaus á rúllandi. Ef hún fer yfir markið, er stytting á framkvæmdum hluta betri en endurþjálfun og er ókeypis. Liður sem stoppar of snemma er annað vandamál; sjá .
- ACT: ACTConfig notar sjálfgefið
chunk_size 100ogn_action_steps 100. Tímabundin samsetning er óvirk og krefstn_action_steps 1. - GR00T N1.7: innri sjóndeildarhringur fór úr 16 í 40, en dæmi LeRobot SO-101 keyrir enn
--policy.chunk_size=16 --policy.n_action_steps=16. Rollout flaggið var endurnefnt í--execution-horizon. - Pi0.5: 50-skrefa hluti, þar af keyrir LIBERO uppskrift LeRobot 10 í gegnum
--policy.n_action_steps=10; með--policy.pretrained_pathfellur það aftur í 50 ef þú sleppir flagginu. - SmolVLA: 50-aðgerða hlutar, báðir hnappar sýnilegir.
Hvernig á að skima alla fimm á einum eftirmiðdegi
Ódýrasta svarið er ekki meiri lestur. Eyddu um 15 USD og láttu arminn segja þér: taktu upp einu sinni, þjálfaðu ódýra líkanið fyrst, stækkaðu þegar það hefur sannað að gögnin séu traust. Uppbygging sigrar magn, tilgangurinn með og .
- 1Skráðu 50 þætti einu sinni
Fimmtíu hreinsar gólfið fyrir GR00T, Pi0.5 og ACT, og 30 frá SmolVLA. Endurtaktu hverja afbrigði frekar en að dreifa þunnt: 50 þættir yfir 5 teningastöður þjálfaðir þar sem 25 voru það ekki. Sjá skráðu fyrsta gagnasafnið þitt.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Þjálfaðu ACT fyrst, því það getur ekki logið að þér
Engar forþjálfaðar þyngdir, svo ef það framkvæmir verkefnið yfirhöfuð, inniheldur gagnasafnið þitt verkefnið. Ef ACT stöðvast, lagaðu gögnin. 1 til 3 USD, 2 til 5 klukkustundir á 24 GB korti.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Keyrðu SmolVLA á sama gagnasafni, óbreyttu
Sömu gögn, sami armur, 450 M færibreytur í stað 80 M, auk tungumálaskilyrðingar. LeRobot setur 20K skrefa keyrslu í um það bil 4 klukkustundir á einum A100. Þetta er það sem segir þér hvort forþjálfun skilar einhverju.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Umbreyttu niður í v2.1 áður en þú snertir GR00T
GR00T les útgáfu af LeRobot v2 sniðinu auk aukalegrar
meta/modality.jsonkortlagningar á því hvernig samsett ástand og aðgerðafylki skiptast í nefnd svið. V3.0 gagnasafn veldur því að hleðslutækið hrynur, því v3.0 pakkar mörgum þáttum í sameiginlegar skrár þar sem v2 skrifaði einn á hvern þátt. Isaac-GR00T sendir niðurfærsluhjálparann semscripts/lerobot_conversion/convert_v3_to_v2.py; v3 höfnunarsíðan er fljótasta leiðin.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Færðu þig yfir í GR00T N1.7 aðeins ef fyrstu tveir skildu eitthvað eftir á borðinu
Í gegnum CLI NVIDIA, sýnt hér, eða
grootstefnugerð LeRobot. NVIDIA mælir með 40 GB eða meira af VRAM fyrir fínstillingu, 16 GB fyrir ályktun. Ef OOM kemur upp, sjá OOM síðuna.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Tvær leiðir til að keyra þessa skimun
Þrjú umhverfi, því verkfærakeðjurnar eru ekki samhæfðar. LeRobot á aðal er 0.6.2 og þarf Python 3.12 eða nýrra; Isaac-GR00T og openpi eru aðskilin uv-stýrð geymslur.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T festir
torchcodec0.8.0 sem eina myndbandsbakenda sinn, sem þarf FFmpeg 4 til 7. FFmpeg 8 er ekki stutt, AV1 ekki tryggt. - openpi minnismörk: ályktun yfir 8 GB, LoRA yfir 22.5 GB, full fínstilling yfir 70 GB. Þetta síðasta er ástæðan fyrir því að Pi0.5 er A100 verkefni.
- Leigðu GPU sjálfur, eyðileggðu hana eftir á, samræmdu þrjú sett af gátpunktaleiðum handvirkt.
Sömu fimm líkön, eitt form. Veldu líkan, gagnasafn og ofurbreytur; bakendinn leigir GPU sem er stærðar eftir nauðsynlegu VRAM, keyrir þjálfarann og skrifar gátpunkta í hlutageymslu.
- Þjálfunarfylkið er fimm líkön eftir fjórum örmum, hver reitur leiðbeining: SmolVLA á SO-100, ACT á SO-101.
- Ályktunarpúðar eru sjálfvirkt úthlutaðir af
/api/inference/podmeð aðgerðalausum vaktara, svo gleymdur púði reiknast ekki hljóðlaust. - Grunngátpunktar eru frá söluaðilum sjálfum:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT hefur enga. - Sömu aðgerðir frá CLI og frá gervigreindarmiðlum í gegnum MCP netþjóninn.
- Enginn vélbúnaður? Lifandi armurinn streymir líkamlegum SO-100 án skráningar; reynslusíðan sýnir leiðirnar inn.
Grunnlíkan eða frá grunni
Sanna valið er ekki hvaða 3 B líkan á að velja. Það er hvort nota eigi forþjálfað VLA yfirleitt, miðað við að ACT lærði sex raunveruleg tvíhend verkefni úr um tíu mínútna sýnikennslu hverju, með 80 M færibreytum og ekkert forþjálfað.
- Tungumálaskilyrðing. ACT hefur enga; einn ACT gátpunktur framkvæmir eitt verkefni.
- Betra á hlutum sem vantar í sýnikennsluna þína: á SO-101, 50% á móti 40% hjá ACT utan dreifingar.
- Fjölverkefni yfirleitt: SmolVLA nær 78.3% yfir þrjú SO-100 verkefni með einum gátpunkti; ACT var aðeins keyrt sem eitt verkefni.
- 7.6x til 24x seinkun: 152 til 485 ms á hverju aðgerðarskrefi samanborið við 20 ms hjá ACT.
- 4 til 12 USD á hverri keyrslu í stað 1 til 3, og A100 flokkur í stað hvaða 24 GB korts sem er.
- Leyfisáhætta, auk bilunarhamur í lokuðu geymslu sem er ekki til frá grunni.
- Forþjálfaðar vigtir geta falið slæmt gagnasafn. Fínstilling sem virkar hálfvegis á gölluðum gögnum kostar viku áður en þú skoðar gögnin.
Tilfellið að endurtaka gamla keyrslu
Að elta 2025 gátpunkt velur líkanið fyrir þig og breytir vandamálinu í útgáfufestingu: núverandi LeRobot hafnar N1.5, svo þú festir lerobot==0.5.1. Án fræreits og með 5 til 6 prósent frávik milli keyrslna, er endurgerðin nálægt samkvæmt hönnun. Leiðbeiningar fyrir N1.5 á SO-100 og N1.5 stefnusíðan hafa pallhliðina.

Niður í tvö? ACT á móti GR00T N1.7 og GR00T N1.7 á móti SmolVLA. Hráar raðir eru í vettvangsfærslunum: GR00T N1.7, Pi0.5, SmolVLA og ACT.
Hvar þessi vettvangur hjálpar þér ekki
- Það getur ekki flýtt fyrir fjárhæðarályktun. Lykkjan sem tekur 20 til 485 ms tilheyrir líkaninu; internetferðir bætast við það.
- Það getur ekki fínstillt GR00T eða Pi0.5 á þínum eigin vélbúnaði. Bæði eru eingöngu í skýinu hér; aðeins SmolVLA og ACT keyra staðbundið.
- Það getur ekki lagað gagnasafn. Tap minnkar en stefnan gerir ekkert er gagnamál, stefna sem virkar aðeins í einni uppsetningu er umfjöllunarmál.
- Það getur ekki gert GR00T keyrslur endurgeranlegar: uppstreymisstillingin hefur ekkert fræreit.
85 líkön, 332 viðmiðunarniðurstöður, hver tala tengd uppruna sínum
Raðanleg útgáfa af töflunum á þessari síðu: 85 sjón-tungumál-aðgerð líkön, 332 viðmiðunarniðurstöður, hver tengd aftur við grein sína eða líkanakort.
Opnaðu vettvanginnAð velja einn og halda áfram
Einn sjálfgefinn valkostur: skráðu 50 þætti, þjálfaðu ACT fyrir 1 til 3 USD til að sanna gagnasafnið, síðan SmolVLA á sömu gögnum. Samtals undir 6 USD, og þau svara spurningunni sem skiptir máli: hvort forþjálfun hjálpar hér, eða hvort flöskuhálsinn sé gögnin. Farið yfir í GR00T N1.7 fyrir snertiríkar fjölþrepa verkefni, í Pi0.5 þegar senan breytist.
Yfirlit yfir vettvang: þjálfaðu fyrstu stefnu þína, síðan keyrðu fyrstu stefnu þína. þjálfunarskjölin og gagnasafnsskjölin fjalla um form og snið; SO-100 síðan og heildarleiðbeiningar SO-100 fjalla um smíði og kvörðun. Bakgrunnur: VLA yfirlitið og Pi0 flæðisamsvörunargreinin. Það sem mun auka árangurshlutfall þitt er leiðbeiningar um gæði gagna.
Hvaða VLA stefnu ætti ég að þjálfa fyrst á SO-100?▾
ACT, síðan SmolVLA. ACT þjálfar frá grunni, svo það getur ekki falið slæmt gagnasafn, og keyrsla kostar 1 til 3 USD á 24 GB korti. Ef ACT framkvæmir verkefnið yfirhöfuð, þá eru 4 til 12 USD fyrir GR00T N1.7 eða Pi0.5 keyrslu ekki sóuð.
Er GR00T N1.7 í raun betri en Pi0.5?▾
Á LIBERO eru þau innan hávaða: 97.0% yfir fjórar svítur fyrir GR00T N1.7, 96.85% fyrir Pi0.5 við 30k skref í openpi, 97.5% fyrir LeRobot útgáfuna, allt frá mismunandi prófunarumhverfum. Raunverulegur munur er 152 ms á aðgerðarskrefi á móti 485 ms, v2.1 gagnasöfn á móti v3.0, og nákvæmni viðmiðunar á móti almennri getu í opnum heimi.
Get ég fínstillt eitthvað af þessu á einu RTX 4090?▾
SmolVLA og ACT, já; bæði eru skráð fyrir RTX 4090 eða hvaða 24 GB kort sem er og keyra staðbundið. GR00T N1.7, N1.5 og Pi0.5 þurfa A100 eða H100 80 GB og eru eingöngu í skýinu hér. NVIDIA mælir með 40 GB eða meira fyrir GR00T fínstillingu; lágmark openpi er yfir 70 GB fyrir fulla Pi0.5 fínstillingu, 22.5 GB fyrir LoRA.
Hvaða af þessum fimm get ég notað í atvinnuskyni?▾
GR00T N1.7 þyngdir eru undir NVIDIA Open Model License Agreement, sem kortið segir að nái yfir notkun í atvinnuskyni. N1.5 þyngdir eru ekki til notkunar í atvinnuskyni. Kóði SmolVLA er Apache 2.0 í LeRobot, en lerobot/smolvla_base kortið inniheldur ekkert leyfissvið, svo þyngdirnar eru ótilgreindar. ACT hefur engar grunnþyngdir til að leyfa. Pi0.5 er óljóst: skjöl LeRobot segja Apache 2.0, en lýsigögn kortsins segja license: gemma.
Sources
- NVIDIA Isaac-GR00T geymsla: GA staða, N1.6 til N1.7 breytingar, vélbúnaðarkröfur, torchcodec og FFmpeg takmarkanir, launch_finetune.py, breytileiki milli keyrslna
- nvidia/GR00T-N1.7-3B líkanakort: Cosmos-Reason2-2B burðarás, 3 B færibreytur, tímatöflu fyrir ályktun, NVIDIA Open Model License, Model Version svið
- nvidia/GR00T-N1.5-3B líkanakort: Eagle 2 tilvísun, SigLip2 og T5, flæðisamsvörun DiT, einhliða leyfi án atvinnunotkunar
- Isaac-GR00T LIBERO dæmi: árangurshlutfall á hverja svítu við 20K skref og lotustærð 640, 200 tilraunir á hverja svítu
- Isaac-GR00T SimplerEnv dæmi: árangurshlutfall Bridge og Fractal á verkefni, GR00T N1.6 á móti N1.7
- pi0.5: sjón-mál-aðgerð líkan með almennri getu í opnum heimi (2 B VLM plús 300 M aðgerðasérfræðingur, 50 Hz stýring, um 400 klukkustundir af farsíma meðhöndlun, stækkunarrannsókn yfir 3 til 104 staði)
- openpi geymsla: lágmörk GPU minnis, umfang eingöngu fyrir flæðisamsvörunarhaus, og Pi0.5 LIBERO niðurstöður í examples/libero
- lerobot/pi05_base líkanakort: umfang LeRobot útgáfunnar, license: gemma lýsigögn, lerobot-train notkun
- LeRobot pi0.5 skjöl: hliðstýrður PaliGemma táknari, LIBERO endurgerðartafla, n_action_steps varagildisgildra, Apache 2.0 yfirlýsing
- SmolVLA: sjón-mál-aðgerð líkan fyrir hagkvæma og skilvirka vélfærafræði (450 M færibreytur, LIBERO og Meta-World töflur, SO-100 og SO-101 niðurstöður, ósamstillt ályktun)
- LeRobot SmolVLA skjöl: 50 þættir yfir 5 stöður á móti 25, 20k skref á um 4 klukkustundum á A100
- Að læra fínstillta tvíhenda meðhöndlun með ódýrum vélbúnaði (ACT og ALOHA): 6 verkefni á 80-90 prósent, stærðarfrádráttur frá k=1 til k=100
- LeRobot 0.6.2: ACTConfig og SmolVLAConfig sjálfgefin gildi, sjálfgefið fræ 1000, --accelerator.gradient_accumulation.steps, Python 3.12 krafa, Apache 2.0
- LeRobot GR00T skjöl: stefnutegund groot, N1.5 stuðningur fjarlægður, pin lerobot==0.5.1, SO-101 dæmi um stærð hluta
- lerobot/smolvla_base líkanakort: SmolVLA grunnathugunarpunkturinn sem notaður er af --policy.path, og lýsigögn kortsins, sem inniheldur ekkert leyfissvið
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started