
GR00T N1.7, Pi0.5, SmolVLA, ACT eller GR00T N1.5? En beslutningstabel matchet til virkelige situationer, med de offentliggjorte benchmark-tal, latenstid, omkostninger pr. kørsel og licenser bag hvert valg.
Fem politikker kan trænes på en SO-100-klassearm i dag. De adskiller sig med en faktor 24 i inferens latens, 37 i antal parametre og 12 i, hvad en kørsel koster, og i, om du må levere resultatet. Fem modelkort vil ikke afgøre det: ingen besvarer det spørgsmål, du har, hvilken skal jeg køre først?
Hvert tal nedenfor blev læst ud af artiklerne, repos og kortene i august 2026. Platformnumre kommer fra AY-Robots politik-katalog; hvor de to er uenige, vises begge.
Den korte version
- •Træn ACT først, hvis du tvivler på dit datasæt: 1 til 3 USD pr. kørsel, intet fortrænet til at dække over dårlige data.
- •GR00T N1.7 og Pi0.5 ligger inden for et halvt point på LIBERO, 97.0 mod 96.85 til 97.5. Det er ikke en grund til at vælge nogen af dem.
- •Pi0.5 er generaliseringsspillet, ikke nøjagtighedsspillet, og den langsomste med 485 ms.
- •SmolVLA, med 450 M parametre, er den eneste VLA her, der finjusterer på ét 24 GB kort.
- •ACT med 20 ms er den eneste mulighed for hurtig reaktiv bevægelse. Licenser afgør resten.
Beslutningstabellen
| Din situation | Træn denne | Hvorfor |
|---|---|---|
| Udokumenteret datasætkvalitet | ACT | Intet fortrænet skjuler et ødelagt datasæt, og fejl koster 1 til 3 USD. |
| Kontaktintensiv, flertrinnet, sprogkonditioneret | GR00T N1.7 | 97,0% over fire LIBERO-suiter, plus et relativt end-effector-handlingsrum. |
| Hurtig reaktiv bevægelse, inferens ved servoerne | ACT | 20 ms. Den næsthurtigste er 7,6 gange langsommere. |
| Nye objekter, ny scene, åben verden | Pi0.5 | Bygget til adfærd uden for distribution, på tværs af op til 104 lokationer. |
| Ét 24 GB kort, ønsker stadig sprog | SmolVLA | 450 M parametre, et minimum på 30 episoder, kører lokalt. |
| Reproduktion af en kørsel optaget i 2025 | GR00T N1.5 | Kun hvis du absolut skal: LeRobot afviser det nu, vægte er ikke-kommercielle. |
| Dette vil blive sendt som et produkt | N1.7, SmolVLA or ACT | N1.5 er ikke-kommerciel, Pi0.5 er underlagt Gemma-vilkår, SmolVLA's kort angiver ingen. |
De fem kandidater
Alle fem er politikker: kamerabilleder, ledpositioner og, for fire af dem, en sproginstruktion, der er kortlagt til en del af fremtidige ledmål. Det, der adskiller dem, er hvor meget der blev lært, før du ankom.
| Politik | Parametre | Latenstid | GPU-niveau | Lokalt? | Min. episoder | Format | Omkostning |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIAs nuværende syns-sprog-handlingsmodel, ca. 3 mia. parametre, hvoraf ca. 40 mio. er trænet under finjustering. Repositoryet angiver deltaerne fra N1.6: backbone fra en Eagle-model fra tredjepart til Cosmos-Reason2-2B på Qwen3-VL, diffusionslag 32 til 16, tilstands- og handlingsdimensioner 29 til 132, handlingshorisont 16 til 40.
Hvad der betyder noget på en lille arm, er det relative handlingsrum for end-effektoren: N1.7 forudsiger deltaer fra den nuværende position, hvilket er det, der lader 20K timers EgoScale menneskelig video overføres til en robotpolitik. Specifikationer på N1.7-siden, procedure i N1.7 på SO-100 guiden.
Isaac-GR00T README erklærer N1.7 for en Generel Tilgængelighed-udgivelse med komplette benchmarks og support. Dets Hugging Face-kort er ikke opdateret: feltet Model Version læser stadig GR00T N1.7 EA. Repositoryet er det nyere dokument.
GR00T N1.5
Samme 3 B skala, Eagle 2 backbone, SigLip2 og T5, flow-matching DiT head. Den eksisterer for at udvide et du allerede har. To ting gør den til et dårligt standardvalg: vægtene bærer NVIDIAs ensrettede ikke-kommercielle licens, og nuværende LeRobot-udgivelser har fjernet N1.5-understøttelse. Se .
Pi0.5
Physical Intelligences VLA, politiktype pi05. Artiklen beskriver en 2 B VLM initialiseret fra PaliGemma plus en 300 M handlings-ekspert, der driver robotten med 50 Hz; LeRobots pi05-konfiguration er som standard en 50-trins chunk, et sekund ved den hastighed. Salgsargumentet er usete steder: omkring 400 timers mobil manipulation i rigtige hjem, og en skaleringsundersøgelse over 3, 12, 22, 53, 82 og 104 lokationer, hvor 104-lokationsmodellen matchede en kontrol trænet på testhjemmene selv.
Én begrænsning, angivet på lerobot/pi05_base kortet: porten bærer kun det flow-matchende action head. Subtask-forudsigelse, action-tokenisering og RL blev ikke frigivet upstream, og openpi siger det samme om sit eget repository. Pi0.5-siden og guiden til Pi0.5 på SO-100 har resten.
Pi0.5 kræver den gatede google/paligemma-3b-pt-224 tokenizer (gated: manual, selvom Google siger, at anmodninger behandles øjeblikkeligt). Uden at acceptere den og køre hf auth login i træningsmiljøet, starter jobbet, downloader et stykke tid, og dør derefter på en autorisationsfejl, der ligner en netværksfejl. nvidia/GR00T-N1.7-3B er ikke gated, men dens nvidia/Cosmos-Reason2-2B backbone er (gated: auto). Ryd begge, før du sætter i kø; hvis et kørsel sidder inaktivt, viser siden for fastlåste kø-jobs, hvad du skal tjekke.
SmolVLA
450 M parametre, omkring 100 M i action-eksperten, på SmolVLM-2 med VLM frosset og kun dens første 16 sprogmodel-lag brugt. Forudtræning var fællesskabsdata: 481 datasæt, 10.6 M frames, fra de samme billige arme, du bruger. Den eneste VLA her, der passer til ét 24 GB kort, og den eneste med 30 episode gulv. Se SmolVLA-siden.
ACT
Ikke en grundmodel. Action Chunking Transformer fra ALOHA er omkring 80 M parametre trænet fra bunden per opgave, på 50 demonstrationer ved 50 Hz. Artiklen rapporterer seks virkelige bimanuelle opgaver fra cirka ti minutter af demonstrationer hver, med 80 til 90 procent på de eksempler den fremhæver. Dens idé, handlingssegmentering, er i enhver model på denne side, og dens ablation måler stadig effekten bedst: over to simulerede opgaver med temporal ensembling slået fra, succesraten stiger fra 1 procent ved k=1 til 44 procent ved k=100. ACT-siden har resten.
Hvad benchmarks faktisk siger
LIBERO er den ene benchmark, som tre af disse fem rapporterer om: sprogkonditionerede opgaver på en simuleret Franka Panda, opdelt i de fire suiter nedenfor med ti opgaver hver. NVIDIA kørte 200 forsøg per suite.
| Model | Rumlig | Objekt | Mål | 10 (Lang) | Gennemsnit |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Hvert tal stammer fra et forskelligt testmiljø og budget. GR00T kørte 20K trin med global batch 640; openpi-tallet er et 30K checkpoint; LeRobot-porten tilføjede 6K trin til en LIBERO-basemodel. SmolVLA er en yderligere uoverensstemmelse: dets paper træner den række på LIBERO fra bunden, uden VLA-forudtræning, mens de tre ovenfor finjusterer forudtrænede checkpoints. Betragt 96.85 til 97.5 som én klynge, og hullet til 87.3% som reelt, men opnået med 6.7x parametrene.
SimplerEnv viser spredningen, hvilket LIBERO ikke gør. NVIDIA sammenligner N1.7 med N1.6, det nærmeste offentlige til en generationel delta.
| SimplerEnv suite | N1.6 gennemsnit | N1.7 gennemsnit | Bedste udsving | Værste udsving |
|---|---|---|---|---|
| Bridge (WidowX), 7 opgaver | 56.6% | 62.3% | stack_cube 5.0 til 48.0 | put_eggplant_in_basket 89.0 til 53.0 |
| Fractal (Google Robot), 6 opgaver | 52.0% | 72.5% | open_drawer 0.0 til 65.0 | ingen, hver opgave forbedret |
Bridge-rækken er den nyttige: 5,7 point opnået i gennemsnit, mens put_eggplant_in_basket tabte 36, og put_eggplant_in_sink faldt fra 33 til 2. En ny generation flytter distributionen snarere end at løfte den, så hvis din opgave ligger, hvor N1.7 er regredieret, siger gennemsnittet intet.

Af de fem rapporterer kun SmolVLA-artiklen om en SO-100-klassearm: 78,3 procent for SmolVLA og 61,7 for Pi0 på tværs af tre opgaver, begge multi-task, mod 48,3 for ACT trænet single-task, hvilket ikke er æbler og pærer. Den rene parring er begge single-task på SO-101 pick-and-place: 90 mod 70 i distribution, 50 mod 40 uden for den. Sammenlign på ACT mod SmolVLA og Pi0.5 mod SmolVLA, eller gennemse arenaen.
Latenstid og omkostninger afgør implementering
Inference-latens er den begrænsning, folk opdager sidst og fortryder først. En politik, der er fem point bedre på en benchmark, men et halvt sekund per handlingstrin, ser værre ud på dit skrivebord: kontaktdynamik venter ikke.
Én forbehold: GR00T-tallet stemmer ikke overens med NVIDIAs kort, som måler 4 denoising-trin og ét kamera til 85,8 ms på en H100 i eager mode, 48,6 ms med torch.compile, 27,9 ms gennem fuld TensorRT. De 152 ms her er et tal for hele stacken med serving overhead og mere end ét kamera, ikke et forward pass.
Løkken på 20 til 485 ms er modellens, og offentlige internet-round trips lægger til den. Fjerninferens er brugbar til langsom pick-and-place, ikke til hurtig reaktiv bevægelse. Hvis din opgave kræver hastighed, sidder inferensen ved siden af servoerne: ACT eller SmolVLA, lokalt. Relateret: politik fryser midt i bevægelsen.
Én måde at vinde tid på uden at ændre model: SmolVLA-artiklen måler synkron udførelse, hvor politikken afslutter en del, før den forudsiger den næste, mod asynkron, hvor forudsigelse overlapper udførelse. Succesen er ens, 78,3 mod 73,3, men den samme pick-and-place tager 9,7 sekunder i stedet for 13,75, og i et fast vindue klarer robotten 19 cyklusser i stedet for 9.
Licenser, kontrolleret fordi ingen kontrollerer dem
| Model | Vægtlicens | Kodelicens | Kommerciel brug |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kortet tillader kommerciel brug | Apache 2.0 | ja |
| GR00T N1.5 | NVIDIA ensrettet ikke-kommerciel licens | Apache 2.0 | nej |
| Pi0.5 | pi05_base kortets metadata angiver licens: gemma | Apache 2.0 (openpi, LeRobot docs) | læs begge, de er uenige |
| SmolVLA | intet licensfelt på smolvla_base kortet | Apache 2.0 (LeRobot) | kode ja, vægte uspecificeret |
| ACT | ingen basisvægte eksisterer | Apache 2.0 (LeRobot) | ja |
Rækken for Pi0.5 kræver opmærksomhed. LeRobot pi05-dokumentationen angiver Apache 2.0 i overensstemmelse med openpi, mens Hub-kortet for lerobot/pi05_base indeholder license: gemma. Begge er aktive. GR00T N1.7 har en mildere version: Isaac-GR00T README nævner i forbifarten, at N1.7 er fuldt kommercielt licenserbar under Apache 2.0, mens dens egen licenssektion og modelkort kun placerer koden under Apache 2.0 og vægtene under NVIDIA Open Model License.
Standardindstillingerne du faktisk vil køre
Hver trænerform leveres med en standard, og de er ikke vilkårlige. ACT's er LeRobot's egne: batch 8, lr 1e-5, 100000 træningstrin, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Én kolonne nedenfor er en fælde.
| Politik | Batch | LR | Maksimale trin | Grad-akkumulering | Gælder? | Ekstra indstillinger |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ja | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ja | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nej (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nej | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nej | chunkSize, nActionSteps, seed, logFreq |
GR00T's finetuning-indgangspunkt (launch_finetune.py, en tyro CLI) har intet seed-felt i sin config-dataclass, så kørsler er ikke bit-for-bit reproducerbare. Repoet advarer også om 5 til 6 procents variation mellem kørsler fra ikke-deterministiske billedaugmentationer, hvilket er større end de fleste benchmark-forskelle, der diskuteres online. LeRobots standard seed er 1000. Grad-akkumuleringskolonnen beskriver lerobot 0.5.1; upstream 0.6.2 eksponerer den som --accelerator.gradient_accumulation.steps.
Den indstilling, der betyder mere end modelvalget
Det er handlingsklumpen. Længere klumper giver jævnere bevægelse og færre akkumulerende fejl, men politikken er fastlagt, mens blokken udføres, så den reagerer sent på alt, der bevæger sig: selvsikker på en statisk terning, håbløs på en rullende. Hvis den overskyder, er forkortelse af den udførte del bedre end genoptræning og er gratis. Et led, der stopper for tidligt, er et andet problem; se .
- ACT: ACTConfig standardindstiller til
chunk_size 100ogn_action_steps 100. Temporal ensembling er slået fra og krævern_action_steps 1. - GR00T N1.7: intern horisont gik fra 16 til 40, men LeRobots SO-101 eksempel kører stadig
--policy.chunk_size=16 --policy.n_action_steps=16. Rollout-flagget blev omdøbt til--execution-horizon. - Pi0.5: en 50-trins klump, hvoraf LeRobots LIBERO-opskrift udfører 10 via
--policy.n_action_steps=10; med--policy.pretrained_pathfalder den tilbage til 50, hvis du udelader flaget. - SmolVLA: 50-handlingsklumper, begge indstillinger eksponeret.
Sådan screener du alle fem på én eftermiddag
Det billigste svar er ikke mere læsning. Brug omkring 15 USD og lad armen fortælle dig: optag én gang, træn den billige model først, eskaler når den har bevist, at dataene er solide. Struktur slår volumen, pointen med og .
- 1Optag 50 episoder én gang
Halvtreds rydder gulvet for GR00T, Pi0.5 og ACT, og SmolVLAs 30. Gentag hver variation i stedet for at sprede tyndt: 50 episoder på tværs af 5 terningpositioner trænet, hvor 25 ikke gjorde. Se optag dit første datasæt.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Træn ACT først, for den kan ikke lyve for dig
Ingen fortrænede vægte, så hvis den overhovedet udfører opgaven, indeholder dit datasæt opgaven. Hvis ACT flader ud, skal dataene rettes. 1 til 3 USD, 2 til 5 timer på et 24 GB kort.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Kør SmolVLA på det samme datasæt, uændret
Samme data, samme arm, 450 M parametre i stedet for 80 M, plus sprogkonditionering. LeRobot anslår en 20K-trins kørsel til cirka 4 timer på en A100. Dette er, hvad der fortæller dig, om fortræning giver noget.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konverter ned til v2.1, før du rører GR00T
GR00T læser en variant af LeRobot v2-formatet plus en ekstra
meta/modality.json, der mapper, hvordan sammenkædede tilstands- og handlingsarrays opdeles i navngivne felter. Et v3.0-datasæt får den loader til at crashe, fordi v3.0 pakker mange episoder i delte filer, hvor v2 skrev én per episode. Isaac-GR00T leverer nedgraderingshjælperen somscripts/lerobot_conversion/convert_v3_to_v2.py; v3-afvisningssiden er den hurtige vej.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Eskaler til GR00T N1.7 kun hvis de første to efterlod noget på bordet
Via NVIDIAs CLI, vist her, eller LeRobots
grootpolicy-type. NVIDIA anbefaler 40 GB eller mere VRAM til finjustering, 16 GB til inferens. Ved en OOM, se OOM-siden.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
To måder at køre den screening på
Tre miljøer, fordi værktøjskæderne ikke sameksisterer. LeRobot på main er 0.6.2 og kræver Python 3.12 eller nyere; Isaac-GR00T og openpi er separate uv-administrerede repositorier.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fastlåser
torchcodec0.8.0 som sin eneste video-backend, hvilket kræver FFmpeg 4 til 7. FFmpeg 8 understøttes ikke, AV1 er ikke garanteret. - openpi hukommelsesgrænser: inferens over 8 GB, LoRA over 22.5 GB, fuld finjustering over 70 GB. Sidstnævnte er grunden til, at Pi0.5 er en A100-opgave.
- Lej GPU'en selv, destruer den bagefter, afstem tre sæt checkpoint-stier manuelt.
Samme fem modeller, én formular. Vælg model, datasæt og hyperparametre; backend lejer en GPU dimensioneret efter påkrævet VRAM, kører træneren og skriver checkpoints til objektlager.
- Træningsmatricen er fem modeller med fire arme, hver celle en guide: SmolVLA på SO-100, ACT på SO-101.
- Inferens-pods auto-provisioneres af
/api/inference/podmed en inaktiv watchdog, så en glemt pod ikke faktureres lydløst. - Basis-checkpoints er leverandørernes egne:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT har ingen. - Samme operationer fra CLI'en og fra AI-agenter via MCP-serveren.
- Ingen hardware? Den levende arm streamer en fysisk SO-100 uden tilmelding; prøvesiden viser vejene ind.
Grundmodel eller fra bunden
Den virkelige udfordring er ikke, hvilken 3 B-model man skal vælge. Det er, om man overhovedet skal bruge en fortrænet VLA, givet at ACT lærte seks virkelige bimanuelle opgaver fra omkring ti minutters demonstrationer hver, med 80 M parametre og intet fortrænet.
- Sprogkonditionering. ACT har ingen; ét ACT-checkpoint udfører én opgave.
- Bedre på objekter, der mangler i dine demonstrationer: på SO-101, 50% mod ACT's 40% uden for distribution.
- Multi-task overhovedet: SmolVLA når 78.3% på tværs af tre SO-100-opgaver med ét checkpoint; ACT blev kun kørt som enkelt-opgave.
- 7.6x til 24x latenstiden: 152 til 485 ms per handlingstrin mod ACT's 20 ms.
- 4 til 12 USD per kørsel i stedet for 1 til 3, og et A100-niveau i stedet for ethvert 24 GB kort.
- Licenseksponering, plus en 'gated-repo' fejlfunktion, der ikke eksisterer fra bunden.
- Fortrænede vægte kan maskere et dårligt datasæt. En finjustering, der kun virker halvt på ødelagte data, koster en uge, før du ser på dataene.
Tilfældet med at reproducere en gammel kørsel
At jagte et 2025-checkpoint træffer modelvalget for dig og gør problemet til versionsfastgørelse: nuværende LeRobot afviser N1.5, så du fastgør lerobot==0.5.1. Uden et seed-felt og 5 til 6 procents varians mellem kørsler er reproduktionen omtrentlig per konstruktion. N1.5 på SO-100 guiden og N1.5 politikside har platformsiden.

Nede på to? ACT mod GR00T N1.7 og GR00T N1.7 mod SmolVLA. Rå rækker findes i arena-indgangene: GR00T N1.7, Pi0.5, SmolVLA og ACT.
Hvor denne platform ikke hjælper dig
- Den kan ikke gøre fjerninferens hurtig. Løkken på 20 til 485 ms tilhører modellen; internet-roundtrips lægger til.
- Den kan ikke finjustere GR00T eller Pi0.5 på din egen hardware. Begge er kun cloud-baserede her; kun SmolVLA og ACT kører lokalt.
- Den kan ikke rette et datasæt. Tabet falder, men politikken gør intet er et dataproblem, en politik, der kun virker i én opsætning er et dækningsproblem.
- Den kan ikke gøre GR00T-kørsler reproducerbare: den opstrøms konfiguration har intet seed-felt.
85 modeller, 332 benchmarkresultater, hvert tal linket til dets kilde
Den sorterbare version af tabellerne på denne side: 85 vision-sprog-handlingsmodeller, 332 benchmarkresultater, hver linket tilbage til dens artikel eller modelkort.
Åbn arenaenAt vælge én og komme videre
Én standard: optag 50 episoder, træn ACT for 1 til 3 USD for at bevise datasættet, derefter SmolVLA på det samme data. Under 6 USD i alt, og de besvarer det spørgsmål, der betyder noget: om fortræning hjælper her, eller om flaskehalsen er dataene. Eskaler til GR00T N1.7 for kontaktintensive flertrinssopgaver, til Pi0.5 når scenen ændrer sig.
Platform gennemgang: træn din første politik, derefter kør din første politik. De træningsdokumenter og datasætdokumenter dækker form og format; SO-100 siden og den komplette SO-100 guide dækker opbygning og kalibrering. Baggrund: VLA-oversigten og Pi0 flow-matching artiklen. Den, der vil forbedre din succesrate, er guiden til datakvalitet.
Hvilken VLA-politik skal jeg træne først på en SO-100?▾
ACT, derefter SmolVLA. ACT træner fra bunden, så den kan ikke maskere et dårligt datasæt, og en kørsel koster 1 til 3 USD på et 24 GB kort. Hvis ACT overhovedet udfører opgaven, er de 4 til 12 USD for en GR00T N1.7- eller Pi0.5-kørsel ikke spildt.
Er GR00T N1.7 faktisk bedre end Pi0.5?▾
På LIBERO er de inden for støjgrænsen: 97,0 % på tværs af fire suiter for GR00T N1.7, 96,85 % for Pi0.5 ved 30k trin i openpi, 97,5 % for LeRobot-porten, alle fra forskellige testmiljøer. De reelle forskelle er 152 ms pr. handlingstrin mod 485 ms, v2.1 datasæt mod v3.0, og benchmark-nøjagtighed mod generalisering i åben verden.
Kan jeg finjustere nogen af disse på et enkelt RTX 4090?▾
SmolVLA og ACT, ja; begge er angivet til et RTX 4090 eller ethvert 24 GB kort og kører lokalt. GR00T N1.7, N1.5 og Pi0.5 kræver en A100 eller H100 80 GB og er kun tilgængelige i skyen her. NVIDIA anbefaler 40 GB eller mere til GR00T finjustering; openpis minimumskrav er over 70 GB for en fuld Pi0.5 finjustering, 22,5 GB for LoRA.
Hvilke af disse fem kan jeg bruge kommercielt?▾
GR00T N1.7-vægte er under NVIDIA Open Model License Agreement, som kortet angiver dækker kommerciel brug. N1.5-vægte er ikke-kommercielle. SmolVLAs kode er Apache 2.0 i LeRobot, men lerobot/smolvla_base-kortet indeholder intet licensfelt, så vægtene er uspecificerede. ACT har ingen basisvægte at licensere. Pi0.5 er tvetydig: LeRobots dokumentation siger Apache 2.0, dets kortmetadata angiver license: gemma.
Sources
- NVIDIA Isaac-GR00T-repository: GA-status, N1.6 til N1.7 ændringer, hardwarekrav, torchcodec- og FFmpeg-begrænsninger, launch_finetune.py, variation fra kørsel til kørsel
- nvidia/GR00T-N1.7-3B modelkort: Cosmos-Reason2-2B backbone, 3 B parametre, inferens timing-tabel, NVIDIA Open Model License, Model Version-felt
- nvidia/GR00T-N1.5-3B modelkort: Eagle 2 reference, SigLip2 og T5, flow matching DiT, ensrettet ikke-kommerciel licens
- Isaac-GR00T LIBERO-eksempel: succesrater pr. suite ved 20K trin og batchstørrelse 640, 200 forsøg pr. suite
- Isaac-GR00T SimplerEnv-eksempel: Bridge- og Fractal-succesrater pr. opgave, GR00T N1.6 mod N1.7
- pi0.5: en Vision-Language-Action Model med Open-World Generalization (2 B VLM plus 300 M action-ekspert, 50 Hz kontrol, omkring 400 timers mobil manipulation, skaleringsstudie over 3 til 104 lokationer)
- openpi-repository: GPU-hukommelsesminimum, flow-matching-head-only omfang, og Pi0.5 LIBERO-resultaterne i examples/libero
- lerobot/pi05_base modelkort: omfanget af LeRobot-porten, license: gemma metadata, lerobot-train brug
- LeRobot pi0.5-dokumentation: gated PaliGemma tokenizer, LIBERO reproduktionstabel, n_action_steps fallback-fælde, Apache 2.0 erklæring
- SmolVLA: En Vision-Language-Action Model for Overkommelig og Effektiv Robotik (450 M parametre, LIBERO og Meta-World tabeller, SO-100 og SO-101 resultater, asynkron inferens)
- LeRobot SmolVLA-dokumentation: 50 episoder på tværs af 5 positioner mod 25, 20k trin på omkring 4 timer på en A100
- Læring af Finmasket Bimanuel Manipulation med Lavpris Hardware (ACT og ALOHA): 6 opgaver med 80-90 procent, chunk size ablation fra k=1 til k=100
- LeRobot 0.6.2: ACTConfig og SmolVLAConfig standardindstillinger, standard seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 krav, Apache 2.0
- LeRobot GR00T-dokumentation: policy type groot, N1.5 support fjernet, pin lerobot==0.5.1, SO-101 chunk size eksempel
- lerobot/smolvla_base modelkort: SmolVLA basis checkpoint brugt af --policy.path, og dets kortmetadata, som ikke indeholder et licensfelt
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started