
GR00T N1.7, Pi0.5, SmolVLA, ACT vai GR00T N1.5? Lēmumu tabula, kas pielāgota reālām situācijām, ar publicētajiem etalonu rādītājiem, latentumu, izmaksām par izpildi un licencēm katrai izvēlei.
Piecas politikas šodien ir apmācāmas uz SO-100 klases rokas. Tās atšķiras par 24 reizēm secinājumu latentumā, 37 parametru skaitā un 12 izmaksās par vienu izpildi, kā arī tajā, vai drīkstat piegādāt rezultātu. Piecas modeļu kartes to neatrisinās: neviena neatbild uz jūsu jautājumu, kuru man palaist pirmo?
Katrs zemāk norādītais skaitlis tika nolasīts no dokumentiem, repozitorijiem un kartēm 2026. gada augustā. Platformas skaitļi nāk no AY-Robots politiku kataloga; kur abi atšķiras, tiek parādīti abi.
Īsā versija
- •Vispirms apmāciet ACT, ja šaubāties par savu datu kopu: 1 līdz 3 USD par izpildi, nekas iepriekš apmācīts, lai slēptu sliktus datus.
- •GR00T N1.7 un Pi0.5 atrodas puspunkta robežās LIBERO, 97.0 pret 96.85 līdz 97.5. Tas nav iemesls izvēlēties nevienu no tiem.
- •Pi0.5 ir vispārināšanas spēle, nevis precizitātes spēle, un lēnākais ar 485 ms.
- •SmolVLA, ar 450 M parametriem, ir vienīgais VLA šeit, kas precīzi noskaņojas uz vienas 24 GB kartes.
- •ACT ar 20 ms ir vienīgā iespēja ātrai reaktīvai kustībai. Licences izlemj pārējo.
Lēmumu tabula
| Jūsu situācija | Apmācīt šo | Kāpēc |
|---|---|---|
| Datu kopas kvalitāte nav pierādīta | ACT | Nekas iepriekš apmācīts neslēpj bojātu datu kopu, un kļūmes izmaksā 1 līdz 3 USD. |
| Bagāts ar kontaktiem, daudzpakāpju, valodu kondicionēts | GR00T N1.7 | 97.0% četrās LIBERO komplektācijās, plus relatīva gala efektora darbības telpa. |
| Ātra reaktīva kustība, secinājumi pie servomotoriem | ACT | 20 ms. Nākamais ātrākais ir 7.6 reizes lēnāks. |
| Jauni objekti, jauna aina, atvērta pasaule | Pi0.5 | Radīts ārpus izplatīšanas uzvedībai, līdz pat 104 vietām. |
| Viena 24 GB karte, joprojām vēlas valodu | SmolVLA | 450 M parametri, 30 epizožu grīda, darbojas lokāli. |
| 2025. gadā ierakstīta izpildes reproducēšana | GR00T N1.5 | Tikai, ja jums tas ir jādara: LeRobot tagad to noraida, svari nav komerciāli. |
| Tas tiks piegādāts kā produkts | N1.7, SmolVLA or ACT | N1.5 nav komerciāls, Pi0.5 ietver Gemma noteikumus, SmolVLA kartē nav norādīts nekas. |
Pieci kandidāti
Visi pieci ir politikas: kameras kadri, savienojumu pozīcijas un, četriem no tiem, valodu instrukcija, kas kartēta uz nākotnes savienojumu mērķu bloku. Tas, kas tos atšķir, ir tas, cik daudz tika apgūts pirms jūsu ierašanās.
| Politika | Parametri | Latentums | GPU līmenis | Lokāli? | Min. epizodes | Formāts | Izmaksas |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA pašreizējais redzes-valodu-darbības modelis, aptuveni 3 miljardi parametru, aptuveni 40 miljoni apmācīti precizēšanas. Repozitorijs uzskaita atšķirības no N1.6: pamats no piegādātāja Eagle modeļa uz Cosmos-Reason2-2B uz Qwen3-VL, difūzijas slāņi no 32 uz 16, stāvokļa un darbības dimensijas no 29 uz 132, darbības horizonts no 16 uz 40.
Mazam manipulatoram svarīga ir relatīvā gala efektora darbības telpa: N1.7 prognozē atšķirības no pašreizējās pozas, kas ļauj 20 tūkstošiem stundu EgoScale cilvēka video pārnest uz robota politiku. Specifikācija N1.7 lapā, procedūra N1.7 uz SO-100 ceļvedī.
Isaac-GR00T README deklarē N1.7 kā Vispārējās pieejamības izlaidumu, ar pilnīgiem etaloniem un atbalstu. Tā Hugging Face karte vēl nav atjaunināta: Model Version lauks joprojām rāda GR00T N1.7 EA. Repozitorijs ir jaunākais dokuments.
GR00T N1.5
Tāda pati 3 B mēroga, Eagle 2 mugurkauls, SigLip2 un T5, plūsmas saskaņošanas DiT galva. Tā pastāv, lai paplašinātu kontrolpunktu jums jau ir. Divas lietas padara to par sliktu noklusējuma izvēli: svariem ir NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. Skatīt N1.7 pret N1.5.
Pi0.5
Physical Intelligence's plūsmas saskaņošanas VLA, politikas tips pi05. Rakstā aprakstīts 2 B VLM, kas inicializēts no PaliGemma, plus 300 M darbības eksperts, kas vada robotu ar 50 Hz; LeRobot's pi05 konfigurācija pēc noklusējuma izmanto 50 soļu gabalu, vienu sekundi ar šādu ātrumu. Pārdošanas arguments ir neredzētas vietas: apmēram 400 stundas mobilās manipulācijas reālās mājās un mērogošanas pētījums par 3, 12, 22, 53, 82 un 104 vietām, kur 104 vietu modelis atbilda kontrolei, kas apmācīta pašās testa mājās.
Viens ierobežojums, norādīts uz lerobot/pi05_base kartes: ports nodrošina tikai plūsmai atbilstošu darbības galviņu. Apakšuzdevumu prognozēšana, darbību tokenizācija un RL netika izlaisti augšup, un openpi to pašu saka par savu repozitoriju. Pi0.5 lapa un Pi0.5 uz SO-100 ceļvedis ir pārējais.
Pi0.5 ir nepieciešams aizsargātais google/paligemma-3b-pt-224 tokenizators (gated: manual, lai gan Google apgalvo, ka pieprasījumi tiek apstrādāti nekavējoties). Neapstiprinot to un nepalaižot hf auth login apmācības vidē, darbs sākas, kādu laiku lejupielādē, pēc tam apstājas ar autorizācijas kļūdu, kas izskatās pēc tīkla kļūmes. nvidia/GR00T-N1.7-3B nav aizsargāts, bet tā nvidia/Cosmos-Reason2-2B pamatne ir (gated: auto). Notīriet abus pirms ievietošanas rindā; ja izpilde stāv dīkā, iestrēgušo rindu lapa uzskaita, kas jāpārbauda.
SmolVLA
450 M parametri, aptuveni 100 M darbības ekspertā, uz SmolVLM-2 ar iesaldētu VLM un izmantojot tikai tā pirmos 16 valodu modeļa slāņus. Iepriekšējā apmācība bija kopienas dati: 481 datu kopas, 10.6 M kadri, no tiem pašiem lētajiem manipulatoriem, ko izmantojat. Vienīgais VLA šeit, kas der vienai 24 GB kartei, un vienīgais 30 epizodes grīda. Skatīt SmolVLA lapu.
ACT
Nav pamata modelis. ALOHA Action Chunking Transformer ir aptuveni 80 M parametru, kas apmācīti no nulles katram uzdevumam, balstoties uz 50 demonstrācijām ar 50 Hz. Rakstā ziņots par sešiem reāliem divroku uzdevumiem no aptuveni desmit minūtēm demonstrāciju katram, ar 80 līdz 90 procentu veiksmi izceltajos piemēros. Tā ideja, darbību sadalīšana, ir katrā modelī šajā lapā, un tā ablācija joprojām mēra efektu vislabāk: divos simulētos uzdevumos ar izslēgtu laika ansamblēšanu, veiksme pieaug no 1 procenta pie k=1 līdz 44 procentiem pie k=100. ACT lapa ir pārējais.
Ko patiesībā saka etaloni
LIBERO ir viens etalons, par kuru ziņo trīs no šiem pieciem: valodu vadīti uzdevumi uz simulēta Franka Panda, sadalīts četrās zemāk norādītajās svītās pa desmit uzdevumiem katrā. NVIDIA veica 200 izmēģinājumus katrā svītā.
| Modelis | Telpisks | Objekts | Mērķis | 10 (Garš) | Vidējais |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Katrs skaitlis nāk no atšķirīgas testēšanas sistēmas un budžeta. GR00T veica 20K soļus ar globālo partiju 640; openpi rādītājs ir 30K kontrolpunkts; LeRobot ports pievienoja 6K soļus LIBERO bāzes modelim. SmolVLA ir vēl viena neatbilstība: tā raksts apmāca šo rindu uz LIBERO no nulles, bez VLA iepriekšējas apmācības, kamēr trīs iepriekšējie precizē iepriekš apmācītus kontrolpunktus. Uztveriet 96.85 līdz 97.5 kā vienu klasteri, un atšķirību līdz 87.3% kā reālu, bet iegūtu ar 6.7x vairāk parametriem.
SimplerEnv parāda izkliedi, ko LIBERO nedara. NVIDIA salīdzina N1.7 ar N1.6, kas ir tuvākais publiskais "paaudžu deltas" analogs.
| SimplerEnv komplekts | N1.6 vidējais | N1.7 vidējais | Labākā svārstība | Sliktākā svārstība |
|---|---|---|---|---|
| Bridge (WidowX), 7 uzdevumi | 56.6% | 62.3% | stack_cube 5.0 līdz 48.0 | put_eggplant_in_basket 89.0 līdz 53.0 |
| Fractal (Google Robot), 6 uzdevumi | 52.0% | 72.5% | open_drawer 0.0 līdz 65.0 | nav, katrs uzdevums uzlabojās |
Rinda Bridge ir noderīgā: vidēji iegūti 5,7 punkti, kamēr put_eggplant_in_basket zaudēja 36 un put_eggplant_in_sink samazinājās no 33 līdz 2. Jauna paaudze pārvieto sadalījumu, nevis to paceļ, tāpēc, ja jūsu uzdevums atrodas tur, kur N1.7 regresēja, vidējais rādītājs neko nepasaka.

No pieciem tikai SmolVLA raksts ziņo par SO-100 klases robotu roku: 78,3 procenti SmolVLA un 61,7 Pi0 trīs uzdevumos, abi daudzuzdevumu, pret 48,3 ACT apmācītam viena uzdevuma modelim, kas nav salīdzināms. Tīrais pāris ir abi viena uzdevuma modeļi SO-101 paņemšanas un novietošanas uzdevumā: 90 pret 70 sadalījumā, 50 pret 40 ārpus tā. Salīdziniet ar ACT pret SmolVLA un Pi0.5 pret SmolVLA, vai pārlūkojiet arēnu.
Latentums un izmaksas nosaka izvietošanu
Inferences latentums ir ierobežojums, ko cilvēki atklāj pēdējo un nožēlo pirmo. Politika, kas ir piecus punktus labāka etalonā, bet pussekundi uz darbības soli, izskatās sliktāk uz jūsu galda: kontakta dinamika negaida.
Viens brīdinājums: GR00T rādītājs nesakrīt ar NVIDIA kartes datiem, kas mēra 4 trokšņu samazināšanas soļus un vienu kameru pie 85.8 ms uz H100 in eager mode, 48.6 ms ar torch.compile, 27.9 ms caur full TensorRT. Šeit minētie 152 ms ir visa steka rādītājs ar apkalpošanas izmaksām un vairākām kamerām, nevis tikai forward pass.
20 līdz 485 ms cilpa ir modeļa, un publiskā interneta apmaiņas laiks to papildina. Attālā secināšana ir piemērota lēnai pick-and-place darbībai, nevis ātrai reaktīvai kustībai. Ja jūsu uzdevumam nepieciešams ātrums, secināšana atrodas blakus servomotoriem: ACT vai SmolVLA, lokāli. Saistīts: politika sastingst kustības vidū.
Viens veids, kā iegūt laiku, nemainot modeli: SmolVLA rakstā tiek mērīta sinhrona izpilde, kur politika pabeidz vienu daļu pirms nākamās prognozēšanas, pretstatā asinhronai, kur prognozēšana pārklājas ar izpildi. Veiksme ir līdzīga, 78.3 pret 73.3, bet tas pats pick-and-place aizņem 9.7 sekundes, nevis 13.75, un fiksētā logā robots veic 19 ciklus, nevis 9.
Licences, pārbaudītas, jo neviens tās nepārbauda
| Modelis | Svaru licence | Koda licence | Komerciāla izmantošana |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; karte atļauj komerciālu izmantošanu | Apache 2.0 | jā |
| GR00T N1.5 | NVIDIA vienvirziena nekomerciāla licence | Apache 2.0 | nē |
| Pi0.5 | pi05_base kartes metadatos norādīta licence: gemma | Apache 2.0 (openpi, LeRobot dokumentācija) | izlasiet abus, tie atšķiras |
| SmolVLA | smolvla_base kartē nav licences lauka | Apache 2.0 (LeRobot) | kods jā, svari nav norādīti |
| ACT | nav pamata svaru | Apache 2.0 (LeRobot) | jā |
Pi0.5 rinda prasa uzmanību. LeRobot pi05 dokumentācija norāda Apache 2.0, kas atbilst openpi, kamēr Hub karte priekš lerobot/pi05_base satur license: gemma. Abi ir aktīvi. GR00T N1.7 ir maigāka versija: Isaac-GR00T README garāmejot norāda, ka N1.7 ir pilnībā komerciāli licencējams saskaņā ar Apache 2.0, kamēr tā paša licences sadaļa un modeļa karte kodu iekļauj tikai zem Apache 2.0 un svarus zem NVIDIA Open Model License.
Noklusējuma iestatījumi, ko jūs faktiski palaidīsiet
Katrs apmācības veids nāk ar noklusējuma iestatījumiem, un tie nav patvaļīgi. ACT ir LeRobot pašu: 8. partija, lr 1e-5, 100000 apmācības soļi, bloka izmērs 100, atbilstoši ACTConfig augšupējai versijai un k=100 no ACT dokumenta. Viena kolonna zemāk ir slazds.
| Politika | Pakešu izmērs | LR | Maksimālie soļi | Grada akumulācija | Piemērojams? | Papildu parametri |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T smalkās pielāgošanas sākumpunktam (launch_finetune.py, tyro CLI) tā konfigurācijas datu klasē nav sēklas lauka, tāpēc izpildes nav bitu-pa-bitam atkārtojamas. Repozitorijs arī brīdina par 5 līdz 6 procentu atšķirībām starp izpildēm, ko rada nedeterminētas attēlu paplašināšanas, kas ir lielākas nekā vairums tiešsaistē apspriesto etalonu atšķirību. LeRobot noklusējuma sēkla ir 1000. Grada akumulācijas kolonna apraksta lerobot 0.5.1; augšupējā versija 0.6.2 to atklāj kā --accelerator.gradient_accumulation.steps.
Parametrs, kas ir svarīgāks par modeļa izvēli
Tas ir darbības bloks. Garāki bloki nodrošina vienmērīgāku kustību un mazāk kumulatīvu kļūdu, taču politika tiek apstiprināta, kamēr bloks izpildās, tāpēc tā reaģē vēlu uz jebko, kas kustas: pārliecināta uz statiska kuba, bezcerīga uz ritoša kuba. Ja tā pārsniedz mērķi, izpildītās daļas saīsināšana ir labāka par atkārtotu apmācību un ir bez maksas. Savienojums, kas apstājas par agru, ir cita problēma; skatiet .
- ACT: ACTConfig noklusējuma iestatījumi ir
chunk_size 100unn_action_steps 100. Laika ansamblis ir izslēgts un prasan_action_steps 1. - GR00T N1.7: iekšējais horizonts mainījās no 16 uz 40, tomēr LeRobot SO-101 piemērs joprojām izpilda
--policy.chunk_size=16 --policy.n_action_steps=16. Izpildes karogs tika pārdēvēts par--execution-horizon. - Pi0.5: 50 soļu bloks, no kura LeRobot LIBERO recepte izpilda 10, izmantojot
--policy.n_action_steps=10; ar--policy.pretrained_pathtas atgriežas pie 50, ja karogs tiek izlaists. - SmolVLA: 50 darbību bloki, abas vadības pogas pieejamas.
Kā pārbaudīt visus piecus vienā pēcpusdienā
Lētākā atbilde nav vairāk lasīšanas. Iztērējiet apmēram 15 USD un ļaujiet robotam jums pateikt: ierakstiet vienreiz, vispirms apmāciet lēto modeli, eskalējiet, kad tas ir pierādījis datu pamatotību. Struktūra pārspēj apjomu, kas ir un .
- 1Ierakstiet 50 epizodes vienu reizi
Piecdesmit atbrīvo vietu GR00T, Pi0.5 un ACT, un SmolVLA 30. Atkārtojiet katru variāciju, nevis izkliedējiet: 50 epizodes piecās kuba pozīcijās, kur 25 netika apmācītas. Skatīt ierakstiet savu pirmo datu kopu.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Vispirms apmāciet ACT, jo tas nevar jums melot
Nav iepriekš apmācītu svaru, tāpēc, ja tas vispār veic uzdevumu, jūsu datu kopa satur uzdevumu. Ja ACT rādītāji ir nemainīgi, labojiet datus. 1 līdz 3 USD, 2 līdz 5 stundas uz 24 GB kartes.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Palaidiet SmolVLA uz tās pašas datu kopas, nemainītu
Tie paši dati, tā pati roka, 450 M parametri 80 M vietā, plus valodu kondicionēšana. LeRobot 20K soļu izpildei uz viena A100 nepieciešamas aptuveni 4 stundas. Tas jums parāda, vai iepriekšēja apmācība dod kādu labumu.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Pārvērtiet uz v2.1, pirms sākat lietot GR00T
GR00T nolasa LeRobot v2 formāta paveidu, kā arī papildu
meta/modality.json, kas kartē, kā savienotie stāvokļa un darbības masīvi sadalās nosauktos laukos. V3.0 datu kopa sabojā šo ielādētāju, jo v3.0 daudzas epizodes iepako koplietojamos failos, kur v2 rakstīja vienu epizodi. Isaac-GR00T piegādā atpakaļejošās versijas palīgu kāscripts/lerobot_conversion/convert_v3_to_v2.py; v3 noraidīšanas lapa ir ātrākais ceļš.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Pārejiet uz GR00T N1.7 tikai tad, ja pirmie divi atstāja kaut ko neizmantotu
Izmantojot NVIDIA CLI, kas parādīts šeit, vai LeRobot
grootpolitikas tipu. NVIDIA iesaka 40 GB vai vairāk VRAM smalkai pielāgošanai, 16 GB secinājumiem. Ja rodas OOM, skatiet OOM lapu.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Divi veidi, kā veikt šo skrīninga pārbaudi
Trīs vides, jo rīku ķēdes nesadarbojas. LeRobot galvenajā versijā ir 0.6.2 un tam nepieciešams Python 3.12 vai jaunāks; Isaac-GR00T un openpi ir atsevišķas uv pārvaldītas repozitorijas.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T piesaista
torchcodec0.8.0 kā savu vienīgo video aizmugursistēmu, kam nepieciešams FFmpeg 4 līdz 7. FFmpeg 8 netiek atbalstīts, AV1 netiek garantēts. - openpi atmiņas sliekšņi: secinājumi virs 8 GB, LoRA virs 22.5 GB, pilna smalka pielāgošana virs 70 GB. Pēdējais ir iemesls, kāpēc Pi0.5 ir A100 darbs.
- Iznomājiet GPU pats, pēc tam iznīciniet to, manuāli saskaņojiet trīs kontrolpunktu ceļu kopas.
Tie paši pieci modeļi, viena forma. Izvēlieties modeli, datu kopu un hiperparametrus; aizmugursistēma iznomā GPU, kura izmērs atbilst nepieciešamajai VRAM, palaiž apmācītāju un raksta kontrolpunktus objektu krātuvē.
- Apmācību matrica ir pieci modeļi ar četrām rokām, katra šūna ir ceļvedis: SmolVLA uz SO-100, ACT uz SO-101.
- Secinājumu podi tiek automātiski nodrošināti ar
/api/inference/podar dīkstāves sargsuņu, tāpēc aizmirsts pods netiek klusi apmaksāts. - Bāzes kontrolpunkti ir pašu piegādātāju:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nav neviena. - Tās pašas darbības no CLI un no AI aģentiem, izmantojot MCP serveri.
- Nav aparatūras? Tiešraides roka straumē fizisku SO-100 bez reģistrācijas; izmēģinājuma lapa parāda ieejas veidus.
Pamata modelis vai no nulles
Īstais jautājums nav, kuru 3 B modeli izvēlēties. Tas ir, vai vispār izmantot iepriekš apmācītu VLA, ņemot vērā, ka ACT apguva sešus reālus divroku uzdevumus no aptuveni desmit minūšu demonstrācijām katram, ar 80 M parametriem un neko iepriekš neapmācot.
- Valodu kondicionēšana. ACT tādas nav; viens ACT kontrolpunkts veic vienu uzdevumu.
- Labāk ar objektiem, kas nav jūsu demonstrācijās: SO-101, 50% pret ACT 40% ārpus izplatīšanas.
- Vispārēja daudzuzdevumu veikšana: SmolVLA sasniedz 78.3% trīs SO-100 uzdevumos ar vienu kontrolpunktu; ACT tika palaists tikai viena uzdevuma režīmā.
- 7.6x līdz 24x lielāka latentums: 152 līdz 485 ms uz darbības soli pret ACT 20 ms.
- 4 līdz 12 USD par izpildi, nevis 1 līdz 3, un A100 līmenis, nevis jebkura 24 GB karte.
- Licences riski, kā arī slēgta repozitorija kļūmes režīms, kas neeksistē, sākot no nulles.
- Iepriekš apmācīti svari var maskēt sliktu datu kopu. Precizēšana, kas daļēji darbojas ar bojātiem datiem, izmaksā nedēļu, pirms jūs aplūkojat datus.
Vecas izpildes reproducēšanas gadījums
2025. gada kontrolpunkta meklēšana nosaka modeļa izvēli jūsu vietā un pārvērš problēmu versiju fiksēšanā: pašreizējais LeRobot noraida N1.5, tāpēc jūs fiksējat lerobot==0.5.1. Bez sēklas lauka un ar 5 līdz 6 procentu variāciju starp izpildēm, reproducēšana ir aptuvena pēc konstrukcijas. un ir platformas puse.

Palikuši divi? ACT pret GR00T N1.7 un GR00T N1.7 pret SmolVLA. Neapstrādātas rindas atrodas arēnas ierakstos: GR00T N1.7, Pi0.5, SmolVLA un ACT.
Kur šī platforma jums nepalīdz
- Tā nevar paātrināt attālinātu secinājumu veikšanu. 20 līdz 485 ms cilpa pieder modelim; interneta savienojuma aizkave to palielina.
- Tā nevar precizēt GR00T vai Pi0.5 uz jūsu pašu aparatūras. Abi šeit ir tikai mākoņpakalpojumi; tikai SmolVLA un ACT darbojas lokāli.
- Tā nevar labot datu kopu. Zudums samazinās, bet politika neko nedara ir datu problēma, politika, kas darbojas tikai vienā iestatījumā ir pārklājuma problēma.
- Tā nevar padarīt GR00T izpildes reproducējamas: augšupējā konfigurācijā nav sēklas lauka.
85 modeļi, 332 etalonuzdevumu rezultāti, katrs skaitlis saistīts ar tā avotu
Šīs lapas tabulu šķirojamā versija: 85 redzes-valodas-darbības modeļi, 332 etalonuzdevumu rezultāti, katrs saistīts ar savu rakstu vai modeļa karti.
Atvērt arēnuIzvēlēties vienu un doties tālāk
Viens noklusējums: ierakstiet 50 epizodes, apmāciet ACT par 1 līdz 3 USD, lai pierādītu datu kopu, pēc tam SmolVLA uz tiem pašiem datiem. Kopā zem 6 USD, un tie atbild uz svarīgo jautājumu: vai iepriekšēja apmācība šeit palīdz, vai vai vājā vieta ir dati. Palieliniet līdz GR00T N1.7 sarežģītiem daudzpakāpju uzdevumiem ar daudz kontaktiem, līdz Pi0.5, kad aina mainās.
Platformas apskats: apmāciet savu pirmo politiku, pēc tam palaidiet savu pirmo politiku. apmācības dokumentācija un datu kopu dokumentācija aptver formu un formātu; SO-100 lapa un pilnīgais SO-100 ceļvedis aptver uzbūvi un kalibrēšanu. Fons: VLA pārskats un Pi0 plūsmas saskaņošanas raksts. Tas, kas uzlabos jūsu veiksmes rādītāju, ir datu kvalitātes ceļvedis.
Kuru VLA politiku man vajadzētu apmācīt vispirms uz SO-100?▾
ACT, tad SmolVLA. ACT apmāca no nulles, tāpēc tas nevar maskēt sliktu datu kopu, un viena palaišana maksā 1 līdz 3 USD uz 24 GB kartes. Ja ACT vispār veic uzdevumu, tad 4 līdz 12 USD par GR00T N1.7 vai Pi0.5 palaišanu nav izšķērdēti.
Vai GR00T N1.7 patiešām ir labāks par Pi0.5?▾
Uz LIBERO tie ir trokšņa robežās: 97.0% četrās svītās GR00T N1.7, 96.85% Pi0.5 pie 30k soļiem openpi, 97.5% LeRobot portam, visi no dažādām testēšanas sistēmām. Reālās atšķirības ir 152 ms uz darbības soli pret 485 ms, v2.1 datu kopas pret v3.0, un etalona precizitāte pret atvērtās pasaules vispārināšanu.
Vai es varu precīzi noregulēt kādu no šiem uz vienas RTX 4090?▾
SmolVLA un ACT, jā; abi ir norādīti RTX 4090 vai jebkurai 24 GB kartei un darbojas lokāli. GR00T N1.7, N1.5 un Pi0.5 nepieciešama A100 vai H100 80 GB un šeit ir tikai mākoņpakalpojumi. NVIDIA iesaka 40 GB vai vairāk GR00T precīzai noregulēšanai; openpi minimālā prasība ir virs 70 GB pilnai Pi0.5 precīzai noregulēšanai, 22.5 GB LoRA.
Kuru no šiem pieciem es varu izmantot komerciāli?▾
GR00T N1.7 svari ir saskaņā ar NVIDIA atvērtā modeļa licences līgumu, kas, kā norādīts kartē, aptver komerciālu izmantošanu. N1.5 svari ir nekomerciāli. SmolVLA kods ir Apache 2.0 LeRobot, bet lerobot/smolvla_base kartē nav licences lauka, tāpēc svari nav norādīti. ACT nav pamatsvaru, ko licencēt. Pi0.5 ir neskaidrs: LeRobot dokumentācija norāda Apache 2.0, tā kartes metadati norāda license: gemma.
Sources
- NVIDIA Isaac-GR00T repozitorijs: GA statuss, N1.6 līdz N1.7 izmaiņas, aparatūras prasības, torchcodec un FFmpeg ierobežojumi, launch_finetune.py, palaišanas-palaišanas variācija
- nvidia/GR00T-N1.7-3B modeļa karte: Cosmos-Reason2-2B pamats, 3 B parametri, secinājumu laika tabula, NVIDIA atvērtā modeļa licence, modeļa versijas lauks
- nvidia/GR00T-N1.5-3B modeļa karte: Eagle 2 atsauce, SigLip2 un T5, plūsmas saskaņošanas DiT, vienvirziena nekomerciāla licence
- Isaac-GR00T LIBERO piemērs: veiksmes rādītāji katrai svītai pie 20K soļiem un partijas lieluma 640, 200 izmēģinājumi katrai svītai
- Isaac-GR00T SimplerEnv piemērs: Bridge un Fractal veiksmes rādītāji katram uzdevumam, GR00T N1.6 pret N1.7
- pi0.5: Vīzijas-Valodas-Darbības modelis ar atvērtās pasaules vispārināšanu (2 B VLM plus 300 M darbības eksperts, 50 Hz vadība, aptuveni 400 stundas mobilās manipulācijas, mērogošanas pētījums vairāk nekā 3 līdz 104 vietās)
- openpi repozitorijs: GPU atmiņas minimālās prasības, tikai plūsmas saskaņošanas galvas darbības joma un Pi0.5 LIBERO rezultāti examples/libero
- lerobot/pi05_base modeļa karte: LeRobot porta darbības joma, license: gemma metadati, lerobot-train lietojums
- LeRobot pi0.5 dokumentācija: vārtu PaliGemma tokenizators, LIBERO reproducēšanas tabula, n_action_steps atkritumu slazds, Apache 2.0 paziņojums
- SmolVLA: Vīzijas-Valodas-Darbības modelis pieejamai un efektīvai robotikai (450 M parametri, LIBERO un Meta-World tabulas, SO-100 un SO-101 rezultāti, asinhronā secināšana)
- LeRobot SmolVLA dokumentācija: 50 epizodes piecās pozīcijās pret 25, 20k soļi aptuveni 4 stundās uz A100
- Smalkgraudainas divroku manipulācijas apguve ar zemu izmaksu aparatūru (ACT un ALOHA): 6 uzdevumi ar 80-90 procentiem, bloka lieluma ablācija no k=1 līdz k=100
- LeRobot 0.6.2: ACTConfig un SmolVLAConfig noklusējuma iestatījumi, noklusējuma sēkla 1000, --accelerator.gradient_accumulation.steps, Python 3.12 prasība, Apache 2.0
- LeRobot GR00T dokumentācija: politikas tips groot, N1.5 atbalsts noņemts, pin lerobot==0.5.1, SO-101 bloka lieluma piemērs
- lerobot/smolvla_base modeļa karte: SmolVLA bāzes kontrolpunkts, ko izmanto --policy.path, un tā kartes metadati, kas nesatur licences lauku
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started