
GR00T N1.7, Pi0.5, SmolVLA, ACT o GR00T N1.5? Isang talahanayan ng pagpapasya na tumutugma sa mga totoong sitwasyon, kasama ang mga nailathalang numero ng benchmark, latency, gastos bawat pagpapatakbo at mga lisensya sa likod ng bawat pagpipilian.
Limang patakaran ang maaaring sanayin sa isang SO-100 class arm ngayon. Nagkakaiba sila sa factor na 24 sa inference latency, 37 sa parameter count at 12 sa kung magkano ang gastos ng isang run, at kung maaari mong ipadala ang resulta. Limang model card ang hindi makakapagpasya nito: wala sa mga ito ang sumasagot sa tanong mo, alin ang una kong patatakbuhin?
Ang bawat numero sa ibaba ay nabasa mula sa mga papel, repo at card noong Agosto 2026. Ang mga numero ng platform ay nagmula sa katalogo ng patakaran ng AY-Robots; kung saan hindi nagkakasundo ang dalawa, pareho silang ipinapakita.
Ang maikling bersyon
- •Sanayin ang ACT muna kung nagdududa ka sa iyong dataset: 1 hanggang 3 USD bawat run, walang pretrained na magtatakip sa masamang data.
- •Ang GR00T N1.7 at Pi0.5 ay nasa loob ng kalahating punto sa LIBERO, 97.0 laban sa 96.85 hanggang 97.5. Hindi iyan dahilan para pumili ng alinman.
- •Ang Pi0.5 ay para sa generalization, hindi para sa accuracy, at ang pinakamabagal sa 485 ms.
- •Ang SmolVLA, sa 450 M parameters, ang tanging VLA dito na nag-fine-tune sa isang 24 GB card.
- •Ang ACT sa 20 ms ang tanging opsyon para sa mabilis na reactive motion. Ang mga lisensya ang nagpapasya sa iba pa.
Ang talahanayan ng desisyon
| Ang iyong sitwasyon | Sanayin ito | Bakit |
|---|---|---|
| Hindi pa napatunayan ang kalidad ng dataset | ACT | Walang pre-trained na nagtatago ng sirang dataset, at ang pagkabigo ay nagkakahalaga ng 1 hanggang 3 USD. |
| Mayaman sa kontak, maraming hakbang, nakakondisyon sa wika | GR00T N1.7 | 97.0% sa apat na LIBERO suite, kasama ang isang relative end-effector action space. |
| Mabilis na reaktibong galaw, inference sa mga servo | ACT | 20 ms. Ang susunod na pinakamabilis ay 7.6 beses na mas mabagal. |
| Mga bagong bagay, bagong eksena, open-world | Pi0.5 | Ginawa para sa out-of-distribution na pag-uugali, sa hanggang 104 na lokasyon. |
| Isang 24 GB card, gusto pa rin ng wika | SmolVLA | 450 M parameter, isang 30 episode floor, tumatakbo nang lokal. |
| Pag-reproduce ng isang run na naitala noong 2025 | GR00T N1.5 | Kung kinakailangan lamang: Tinatanggihan na ito ng LeRobot, ang mga weights ay non-commercial. |
| Ito ay ipapadala bilang isang produkto | N1.7, SmolVLA or ACT | Ang N1.5 ay non-commercial, ang Pi0.5 ay may Gemma terms, ang card ng SmolVLA ay nagsasaad na wala. |
Ang limang kandidato
Ang limang ito ay na mga polisiya: camera frames, joint positions at, para sa apat sa kanila, isang instruksyon sa wika, na naka-map sa isang bahagi ng mga target ng joint sa hinaharap. Ang naghihiwalay sa kanila ay kung gaano karami ang natutunan bago ka dumating.
| Polisiya | Mga Parameter | Latency | Antas ng GPU | Lokal? | Minimum na episode | Format | Gastos |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | oo | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | oo | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | hindi | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | hindi | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | hindi | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Ang kasalukuyang modelo ng vision-language-action ng NVIDIA, humigit-kumulang 3 B na parameter, halos 40 M ang sinanay sa panahon ng fine-tuning. Nakalista sa repo ang mga delta mula sa N1.6: backbone mula sa isang Eagle model na binili sa Cosmos-Reason2-2B sa Qwen3-VL, diffusion layers 32 hanggang 16, state at action dimensions 29 hanggang 132, action horizon 16 hanggang 40.
Ang mahalaga sa isang maliit na braso ay ang relative end-effector action space: Hinuhulaan ng N1.7 ang mga delta mula sa kasalukuyang pose, na siyang nagpapahintulot sa 20K oras ng EgoScale human video na mailipat sa isang robot policy. Ang spec ay nasa pahina ng N1.7, ang pamamaraan ay nasa gabay ng N1.7 sa SO-100.
Idinedeklara ng Isaac-GR00T README ang N1.7 bilang isang Pangkalahatang Availability release, na may kumpletong benchmarks at suporta. Hindi pa updated ang Hugging Face card nito: ang Bersyon ng Modelo field ay nakasaad pa rin GR00T N1.7 EA. Ang repo ang mas bagong dokumento.
GR00T N1.5
Parehong 3 B scale, Eagle 2 backbone, SigLip2 at T5, flow-matching DiT head. Ito ay umiiral upang palawigin ang isang na mayroon ka na. Dalawang bagay ang nagpapahirap dito bilang default: ang mga weights ay may NVIDIA's one-way non-commercial licence, at ang kasalukuyang mga release ng LeRobot ay inalis ang suporta sa N1.5. Tingnan ang .
Pi0.5
Ang Physical Intelligence's VLA, uri ng patakaran pi05. Ang papel ay nagbibigay ng isang 2 B VLM na sinimulan mula sa PaliGemma kasama ang isang 300 M action expert, na nagpapatakbo ng robot sa 50 Hz; Ang pi05 config ng LeRobot ay nagde-default sa isang 50-step chunk, isang segundo sa bilis na iyon. Ang pangunahing bentahe ay ang mga hindi pa nakikitang lugar: humigit-kumulang 400 oras ng mobile manipulation sa totoong mga tahanan, at isang pag-aaral sa scaling sa mahigit 3, 12, 22, 53, 82 at 104 na lokasyon, kung saan ang 104-lokasyon na modelo ay tumugma sa isang kontrol na sinanay sa mismong mga tahanan ng pagsubok.
Isang limitasyon, nakasaad sa lerobot/pi05_base card: ang port ay nagdadala lamang ng flow-matching action head. Ang subtask prediction, action tokenization at RL ay hindi inilabas sa upstream, at sinasabi ng openpi ang pareho para sa sarili nitong repository. Ang pahina ng Pi0.5 at ang gabay ng Pi0.5 sa SO-100 ang may iba pa.
Kailangan ng Pi0.5 ang gated google/paligemma-3b-pt-224 tokenizer (gated: manual, bagaman sinasabi ng Google na ang mga kahilingan ay agad na pinoproseso). Kung hindi ito tatanggapin at patakbuhin ang hf auth login sa training environment, magsisimula ang trabaho, magda-download sandali, pagkatapos ay mamamatay dahil sa error sa awtorisasyon na parang network fault. nvidia/GR00T-N1.7-3B ay hindi gated, ngunit ang nvidia/Cosmos-Reason2-2B backbone nito ay (gated: auto). I-clear ang pareho bago i-queue; kung ang isang run ay nakaupo lang, ang pahina ng stuck-queue ay naglilista ng mga dapat suriin.
SmolVLA
450 M na parameter, humigit-kumulang 100 M sa action expert, sa SmolVLM-2 na ang VLM ay frozen at tanging ang unang 16 na language-model layer lamang ang ginamit. Ang pretraining ay data ng komunidad: 481 dataset, 10.6 M frame, mula sa parehong murang braso na ginagamit mo. Ang tanging VLA dito na kasya sa isang 24 GB card, at ang tanging 30 yugto limitasyon. Tingnan ang pahina ng SmolVLA.
ACT
Hindi isang foundation model. Ang Action Chunking Transformer mula sa ALOHA ay humigit-kumulang 80 M na parameter na sinanay mula sa simula bawat gawain, sa 50 demonstrasyon sa 50 Hz. Ang papel ay nag-uulat ng anim na tunay na bimanual na gawain mula sa humigit-kumulang sampung minuto ng mga demonstrasyon bawat isa, sa 80 hanggang 90 porsiyento sa mga halimbawang binibigyang-diin nito. Ang ideya nito, action chunking, ay nasa bawat modelo sa pahinang ito, at ang ablation nito ay sumusukat pa rin ang epekto nang pinakamahusay: sa dalawang simulated na gawain na naka-off ang temporal ensembling, ang tagumpay ay tumataas mula 1 porsiyento sa k=1 hanggang 44 porsiyento sa k=100. Ang pahina ng ACT ay may iba pa.
Ano ang tunay na sinasabi ng mga benchmark
LIBERO ang isang benchmark na iniuulat ng tatlo sa limang ito: mga gawaing nakabatay sa wika sa isang simulated na Franka Panda, hinati sa apat na suite sa ibaba na may sampung gawain bawat isa. Ang NVIDIA ay nagpatakbo ng 200 pagsubok bawat suite.
| Modelo | Spatial | Bagay | Layunin | 10 (Mahaba) | Average |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Ang bawat numero ay nagmula sa iba't ibang harness at badyet. Ang GR00T ay tumakbo ng 20K steps sa global batch na 640; ang figure ng openpi ay isang 30K checkpoint; ang LeRobot port ay nagdagdag ng 6K steps sa isang LIBERO base model. Ang SmolVLA ay isang karagdagang pagkakaiba: ang papel nito ay nagsasanay sa hanay na iyon sa LIBERO mula sa simula, nang walang VLA pretraining, habang ang tatlo sa itaas nito ay nag-fine-tune ng mga pretrained checkpoint. Ituring ang 96.85 hanggang 97.5 bilang isang cluster, at ang agwat sa 87.3% bilang totoo ngunit nakuha sa 6.7x ng mga parameter.
Ipinapakita ng SimplerEnv ang pagkalat, na hindi ipinapakita ng LIBERO. Inihahambing ng NVIDIA ang N1.7 laban sa N1.6, ang pinakamalapit na pampublikong bagay sa isang generational delta.
| SimplerEnv suite | N1.6 average | N1.7 average | Pinakamahusay na pagbabago | Pinakamasamang pagbabago |
|---|---|---|---|---|
| Bridge (WidowX), 7 gawain | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 gawain | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | wala, bawat gawain ay bumuti |
Ang row ng Bridge ang kapaki-pakinabang: 5.7 puntos ang nakuha sa average habang ang put_eggplant_in_basket ay nawalan ng 36 at ang put_eggplant_in_sink ay bumaba mula 33 patungong 2. Isang bagong henerasyon ang naglilipat ng distribusyon sa halip na itaas ito, kaya kung ang iyong gawain ay nasa kung saan bumaba ang N1.7, walang sinasabi ang average.

Sa lima, tanging ang papel ng SmolVLA ang nag-uulat tungkol sa isang SO-100 class arm: 78.3 porsyento para sa SmolVLA at 61.7 para sa Pi0 sa tatlong gawain, parehong multi-task, laban sa 48.3 para sa ACT na sinanay na single-task, na hindi pareho. Ang malinis na pagpapares ay parehong single-task sa SO-101 pick-and-place: 90 laban sa 70 sa distribusyon, 50 laban sa 40 sa labas nito. Ikumpara sa ACT laban sa SmolVLA at Pi0.5 laban sa SmolVLA, o i-browse ang arena.
Ang latency at gastos ang nagpapasya sa deployment
Latency ng Inference ay ang limitasyon na huling nadiskubre ng mga tao at unang pinagsisisihan. Ang isang patakaran na limang puntos na mas mahusay sa isang benchmark ngunit kalahating segundo bawat hakbang ng aksyon ay mukhang mas masahol sa iyong mesa: hindi naghihintay ang dinamika ng kontak.
Isang paalala: ang figure ng GR00T ay hindi sumasang-ayon sa card ng NVIDIA, na nagtatala ng 4 na hakbang ng denoising at isang camera sa 85.8 ms sa isang H100 sa eager mode, 48.6 ms sa torch.compile, 27.9 ms sa buong TensorRT. Ang 152 ms dito ay isang buong-stack na figure na may serving overhead at higit sa isang camera, hindi isang forward pass.
Ang 20 hanggang 485 ms na loop ay sa modelo, at ang mga round trip sa pampublikong internet ay nagdaragdag dito. Ang remote inference ay magagawa para sa mabagal na pick-and-place, hindi para sa mabilis na reactive motion. Kung ang iyong gawain ay nangangailangan ng bilis, ang inference ay nakalagay sa tabi ng mga servo: ACT o SmolVLA, lokal. Kaugnay: nag-freeze ang patakaran sa gitna ng paggalaw.
Isang paraan upang makatipid ng oras nang hindi binabago ang modelo: sinusukat ng papel ng SmolVLA ang synchronous execution, kung saan tinatapos ng patakaran ang isang bahagi bago hulaan ang susunod, laban sa asynchronous, kung saan ang prediksyon ay nagsasapawan sa execution. Ang tagumpay ay magkatulad, 78.3 laban sa 73.3, ngunit ang parehong pick-and-place ay tumatagal ng 9.7 segundo sa halip na 13.75, at sa isang nakapirming window, ang robot ay nakakagawa ng 19 na cycle sa halip na 9.
Mga Lisensya, sinuri dahil walang sumusuri sa kanila
| Model | Lisensya ng Weights | Lisensya ng Code | Komersyal na paggamit |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; pinapayagan ng card ang komersyal na paggamit | Apache 2.0 | oo |
| GR00T N1.5 | NVIDIA one-way non-commercial licence | Apache 2.0 | hindi |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | basahin pareho, hindi sila magkasundo |
| SmolVLA | walang field ng lisensya sa smolvla_base card | Apache 2.0 (LeRobot) | code oo, hindi nakasaad ang weights |
| ACT | walang umiiral na base weights | Apache 2.0 (LeRobot) | oo |
Ang row ng Pi0.5 ay nangangailangan ng pag-iingat. Ang dokumentasyon ng LeRobot pi05 ay nagsasaad ng Apache 2.0 na naaayon sa openpi, habang ang Hub card para sa lerobot/pi05_base ay naglalaman ng license: gemma. Pareho silang aktibo. Ang GR00T N1.7 ay may mas malumanay na bersyon: ang Isaac-GR00T README ay nagsasaad na ang N1.7 ay ganap na komersyal na lisensyado sa ilalim ng Apache 2.0, habang ang sarili nitong seksyon ng lisensya at ang model card ay inilalagay lamang ang code sa ilalim ng Apache 2.0 at ang weights sa ilalim ng NVIDIA Open Model License.
Ang mga default na aktwal mong patatakbuhin
Bawat form ng trainer ay may default, at hindi ito arbitraryo. Ang sa ACT ay sariling LeRobot: batch 8, lr 1e-5, 100000 mga hakbang sa pagsasanay, chunk size 100, na tumutugma sa ACTConfig upstream at k=100 mula sa ACT paper. Ang isang column sa ibaba ay isang bitag.
| Patakaran | Batch | LR | Pinakamataas na hakbang | Pag-ipon ng Grad | Naaangkop? | Karagdagang kontrol |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Ang entry point ng fine-tuning ng GR00T (launch_finetune.py, isang tyro CLI) ay walang seed field sa config dataclass nito, kaya ang mga pagpapatakbo ay hindi bit-for-bit reproducible. Nagbabala rin ang repo ng 5 hanggang 6 porsyentong pagkakaiba sa pagitan ng mga pagpapatakbo mula sa non-deterministic na pagpapahusay ng imahe, na mas malaki kaysa sa karamihan ng mga agwat ng benchmark na pinagtatalunan online. Ang default seed ng LeRobot ay 1000. Inilalarawan ng column ng grad-accum ang lerobot 0.5.1; inilalantad ito ng upstream 0.6.2 bilang --accelerator.gradient_accumulation.steps.
Ang kontrol na mas mahalaga kaysa sa pagpili ng modelo
Ito ang action chunk. Ang mas mahabang chunks ay nagbibigay ng mas makinis na galaw at mas kaunting nagpapataas na error, ngunit ang patakaran ay nakatuon habang isinasagawa ang block, kaya huli itong tumutugon sa anumang gumagalaw: kumpiyansa sa isang static na cube, walang pag-asa sa gumugulong. Kung ito ay lumampas, ang pagpapaikli ng isinagawang bahagi ay mas mahusay kaysa sa muling pagsasanay at libre. Ang isang joint na humihinto nang maaga ay ibang problema; tingnan ang .
- ACT: Ang ACTConfig ay nagde-default sa
chunk_size 100atn_action_steps 100. Ang temporal ensembling ay naka-off at nangangailangan ngn_action_steps 1. - GR00T N1.7: Ang internal horizon ay naging 16 hanggang 40, gayunpaman ang halimbawa ng SO-101 ng LeRobot ay tumatakbo pa rin ng
--policy.chunk_size=16 --policy.n_action_steps=16. Ang rollout flag ay pinalitan ng pangalan sa--execution-horizon. - Pi0.5: isang 50-step chunk, kung saan ang LIBERO recipe ng LeRobot ay nagsasagawa ng 10 sa pamamagitan ng
--policy.n_action_steps=10; sa--policy.pretrained_pathito ay babalik sa 50 kung aalisin mo ang flag. - SmolVLA: 50-action chunks, parehong knobs ang nakalantad.
Paano i-screen ang lahat ng lima sa isang hapon
Ang pinakamurang sagot ay hindi mas maraming pagbabasa. Gumastos ng humigit-kumulang 15 USD at hayaang sabihin sa iyo ng braso: mag-record nang isang beses, sanayin muna ang murang modelo, itaas ang antas kapag napatunayan na nito na tama ang data. Ang istraktura ay mas mahalaga kaysa sa dami, ang punto ng at ang .
- 1Mag-record ng 50 episode nang isang beses
Limampu ang nagbibigay-daan para sa GR00T, Pi0.5 at ACT, at 30 para sa SmolVLA. Ulitin ang bawat variation sa halip na kumalat: 50 episode sa 5 posisyon ng cube ang sinanay, kumpara sa 25 na hindi. Tingnan ang pag-record ng iyong unang dataset.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Sanayin muna ang ACT, dahil hindi ito maaaring magsinungaling sa iyo
Walang pretrained weights, kaya kung nagagawa nito ang gawain, ang iyong dataset ay naglalaman ng gawain. Kung mag-flatline ang ACT, ayusin ang data. 1 to 3 USD, 2 to 5 oras sa isang 24 GB card.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Patakbuhin ang SmolVLA sa parehong dataset, nang walang pagbabago
Parehong data, parehong braso, 450 M parameter sa halip na 80 M, kasama ang language conditioning. Ang LeRobot ay nagpapatakbo ng 20K step sa humigit-kumulang 4 na oras sa isang A100. Ito ang magsasabi sa iyo kung may pakinabang ang pretraining.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4I-convert pababa sa v2.1 bago mo galawin ang GR00T
Binabasa ng GR00T ang isang bersyon ng LeRobot v2 format kasama ang isang karagdagang
meta/modality.jsonna nagmamapa kung paano nahahati ang pinagsamang state at action arrays sa mga pinangalanang field. Nagka-crash ang loader sa isang v3.0 dataset, dahil ang v3.0 ay naglalagay ng maraming episode sa mga shared file kung saan ang v2 ay sumusulat ng isa bawat episode. Ipinapadala ng Isaac-GR00T ang downgrade helper bilangscripts/lerobot_conversion/convert_v3_to_v2.py; ang pahina ng pagtanggi sa v3 ang mabilis na daan.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Mag-escalate sa GR00T N1.7 lamang kung may naiwan ang unang dalawa
Sa pamamagitan ng CLI ng NVIDIA, na ipinapakita dito, o ang
grootpolicy type ng LeRobot. Inirerekomenda ng NVIDIA ang 40 GB o higit pa ng VRAM para sa fine-tuning, 16 GB para sa inference. Sa isang OOM, tingnan ang pahina ng OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dalawang paraan upang patakbuhin ang screening pass na iyon
Tatlong environment, dahil hindi magkasama ang mga toolchain. Ang LeRobot sa main ay 0.6.2 at nangangailangan ng Python 3.12 o mas bago; ang Isaac-GR00T at openpi ay magkahiwalay na uv-managed repos.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- Ang GR00T ay nagtatakda ng
torchcodec0.8.0 bilang tanging video backend nito, nangangailangan ng FFmpeg 4 hanggang 7. Hindi suportado ang FFmpeg 8, hindi garantisado ang AV1. - Mga memory floor ng openpi: inference na higit sa 8 GB, LoRA na higit sa 22.5 GB, full fine-tuning na higit sa 70 GB. Ang huling iyon ang dahilan kung bakit ang Pi0.5 ay isang A100 job.
- Umuupa ka ng GPU, sirain ito pagkatapos, at manu-manong i-reconcile ang tatlong set ng checkpoint paths.
Parehong limang modelo, isang form. Pumili ng modelo, dataset at hyperparameters; ang backend ay umuupa ng GPU na ang laki ay batay sa kinakailangang VRAM, pinapatakbo ang trainer at isinusulat ang mga checkpoint sa object storage.
- Ang training matrix ay limang modelo sa apat na braso, bawat cell ay isang gabay: SmolVLA sa SO-100, ACT sa SO-101.
- Ang mga inference pod ay awtomatikong inilalaan ng
/api/inference/podna may idle watchdog, kaya ang nakalimutang pod ay hindi tahimik na magbabayad. - Ang mga base checkpoint ay pag-aari ng mga vendor:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. Walang ACT. - Parehong operasyon mula sa CLI at mula sa mga AI agent sa pamamagitan ng MCP server.
- Walang hardware? Ang live arm ay nag-stream ng pisikal na SO-100 nang walang pagpaparehistro; ipinapakita ng pahina ng pagsubok ang mga paraan upang makapasok.
Foundation model o mula sa simula
Ang tunay na pagpipilian ay hindi kung aling 3 B model ang pipiliin. Ito ay kung gagamit ba ng pretrained VLA, kung isasaalang-alang na ang ACT ay natuto ng anim na tunay na bimanual na gawain mula sa humigit-kumulang sampung minutong demonstrasyon bawat isa, na may 80 M na parameter at walang anumang pretrained.
- Pagkondisyon ng wika. Walang ganito ang ACT; isang ACT checkpoint ang gumagawa ng isang gawain.
- Mas mahusay sa mga bagay na wala sa iyong mga demonstrasyon: sa SO-101, 50% laban sa 40% ng ACT na wala sa distribusyon.
- Multi-task sa lahat: Naabot ng SmolVLA ang 78.3% sa tatlong SO-100 na gawain na may isang checkpoint; ang ACT ay pinatakbo lamang bilang single-task.
- 7.6x hanggang 24x ang latency: 152 hanggang 485 ms bawat hakbang ng aksyon laban sa 20 ms ng ACT.
- 4 hanggang 12 USD bawat pagtakbo sa halip na 1 hanggang 3, at isang A100 tier sa halip na anumang 24 GB card.
- Pagkakalantad sa lisensya, kasama ang isang gated-repo failure mode na hindi umiiral mula sa simula.
- Maaaring itago ng mga pretrained na timbang ang isang masamang dataset. Ang isang fine-tune na kalahating gumagana sa sirang data ay nagkakahalaga ng isang linggo bago mo tingnan ang data.
Ang kaso ng pagkopya ng isang lumang pagtakbo
Ang paghabol sa isang 2025 checkpoint ay gumagawa ng pagpili ng modelo para sa iyo at ginagawang version pinning ang problema: tinatanggihan ng kasalukuyang LeRobot ang N1.5, kaya i-pin mo ang lerobot==0.5.1. Nang walang seed field at 5 hanggang 6 porsiyentong pagkakaiba sa pagitan ng mga pagtakbo, ang reproduksyon ay tinatayang ayon sa konstruksyon. at ay may panig ng platform.

Dalawa na lang? ACT laban sa GR00T N1.7 at GR00T N1.7 laban sa SmolVLA. Ang mga hilaw na row ay nasa mga entry ng arena: GR00T N1.7, Pi0.5, SmolVLA at ACT.
Kung saan hindi ka matutulungan ng platform na ito
- Hindi nito kayang pabilisin ang remote inference. Ang 20 hanggang 485 ms na loop ay pagmamay-ari ng modelo; nadaragdag dito ang mga round trip sa internet.
- Hindi nito kayang i-fine-tune ang GR00T o Pi0.5 sa sarili mong hardware. Pareho silang cloud-only dito; tanging SmolVLA at ACT lang ang tumatakbo nang lokal.
- Hindi nito kayang ayusin ang isang dataset. Ang pagbaba ng loss ngunit walang ginagawa ang policy ay problema sa data, ang isang policy na gumagana lamang sa isang setup ay problema sa coverage.
- Hindi nito kayang gawing reproducible ang mga GR00T run: walang seed field ang upstream config.
85 modelo, 332 resulta ng benchmark, bawat numero ay naka-link sa pinagmulan nito
Ang naiaayos na bersyon ng mga talahanayan sa pahinang ito: 85 vision-language-action models, 332 benchmark results, bawat isa ay naka-link pabalik sa papel o model card nito.
Buksan ang arenaPagpili ng isa at pagpapatuloy
Isang default: mag-record ng 50 episode, sanayin ang ACT sa halagang 1 hanggang 3 USD upang patunayan ang dataset, pagkatapos ay ang SmolVLA sa parehong data. Wala pang 6 USD ang kabuuan, at sinasagot nila ang mahalagang tanong: kung nakakatulong ba ang pretraining dito, o kung ang bottleneck ay ang data. Mag-escalate sa GR00T N1.7 para sa mga contact-rich multi-step tasks, sa Pi0.5 kapag nagbabago ang eksena.
Platform walkthrough: sanayin ang iyong unang polisiya, pagkatapos ay patakbuhin ang iyong unang polisiya. Ang mga dokumento sa pagsasanay at mga dokumento ng dataset ay sumasaklaw sa porma at format; ang pahina ng SO-100 at ang kumpletong gabay sa SO-100 ay sumasaklaw sa pagbuo at kalibrasyon. Background: ang pangkalahatang-ideya ng VLA at ang artikulo ng Pi0 flow-matching. Ang makakapagpataas ng iyong success rate ay ang gabay sa kalidad ng data.
Aling VLA policy ang dapat kong sanayin muna sa isang SO-100?▾
ACT, pagkatapos ay SmolVLA. Ang ACT ay nagsasanay mula sa simula, kaya hindi nito kayang takpan ang isang masamang dataset, at ang isang pagpapatakbo ay nagkakahalaga ng 1 hanggang 3 USD sa isang 24 GB card. Kung magagawa ng ACT ang gawain, ang 4 hanggang 12 USD para sa isang GR00T N1.7 o Pi0.5 na pagpapatakbo ay hindi masasayang.
Mas mahusay ba talaga ang GR00T N1.7 kaysa sa Pi0.5?▾
Sa LIBERO, nasa loob sila ng ingay: 97.0% sa apat na suite para sa GR00T N1.7, 96.85% para sa Pi0.5 sa 30k steps sa openpi, 97.5% para sa LeRobot port, lahat mula sa iba't ibang harnesses. Ang tunay na pagkakaiba ay 152 ms bawat action step laban sa 485 ms, v2.1 datasets laban sa v3.0, at benchmark accuracy laban sa open-world generalization.
Maaari ko bang i-fine-tune ang alinman sa mga ito sa isang solong RTX 4090?▾
SmolVLA at ACT, oo; pareho silang nakalista para sa isang RTX 4090 o anumang 24 GB card at tumatakbo nang lokal. Ang GR00T N1.7, N1.5 at Pi0.5 ay nangangailangan ng A100 o H100 80 GB at cloud-only dito. Inirerekomenda ng NVIDIA ang 40 GB o higit pa para sa GR00T fine-tuning; ang floor ng openpi ay higit sa 70 GB para sa isang buong Pi0.5 fine-tune, 22.5 GB para sa LoRA.
Alin sa limang ito ang maaari kong gamitin sa komersyal?▾
Ang mga weights ng GR00T N1.7 ay nasa ilalim ng NVIDIA Open Model License Agreement, na sinasabi ng card na sumasaklaw sa komersyal na paggamit. Ang mga weights ng N1.5 ay non-commercial. Ang code ng SmolVLA ay Apache 2.0 sa LeRobot, ngunit ang lerobot/smolvla_base card ay walang license field, kaya ang mga weights ay hindi nakasaad. Ang ACT ay walang base weights na lisensyado. Ang Pi0.5 ay malabo: sinasabi ng docs ng LeRobot na Apache 2.0, ang metadata ng card nito ay nababasa na license: gemma.
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 na pagbabago, mga kinakailangan sa hardware, torchcodec at FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 at T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates sa 20K steps at batch size 640, 200 trials bawat suite
- Isaac-GR00T SimplerEnv example: per-task Bridge at Fractal success rates, GR00T N1.6 laban sa N1.7
- pi0.5: isang Vision-Language-Action Model na may Open-World Generalization (2 B VLM plus 300 M action expert, 50 Hz control, humigit-kumulang 400 oras ng mobile manipulation, scaling study sa 3 hanggang 104 na lokasyon)
- openpi repository: GPU memory floors, flow-matching-head-only scope, at ang Pi0.5 LIBERO results sa examples/libero
- lerobot/pi05_base model card: saklaw ng LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: Isang Vision-Language-Action Model para sa Abot-kaya at Mahusay na Robotics (450 M parameters, LIBERO at Meta-World tables, SO-100 at SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes sa 5 posisyon laban sa 25, 20k steps sa humigit-kumulang 4 na oras sa isang A100
- Pag-aaral ng Fine-Grained Bimanual Manipulation gamit ang Low-Cost Hardware (ACT at ALOHA): 6 na gawain sa 80-90 porsyento, chunk size ablation mula k=1 hanggang k=100
- LeRobot 0.6.2: ACTConfig at SmolVLAConfig defaults, default seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 requirement, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support tinanggal, pin lerobot==0.5.1, SO-101 chunk size example
- lerobot/smolvla_base model card: ang SmolVLA base checkpoint na ginamit ng --policy.path, at ang metadata ng card nito, na walang license field
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started