
GR00T N1.7, Pi0.5, SmolVLA, ACT eller GR00T N1.5? En beslutningstabell tilpasset reelle situasjoner, med publiserte benchmark-tall, latens, kostnad per kjøring og lisenser bak hvert valg.
Fem retningslinjer kan trenes på en SO-100-klassearm i dag. De skiller seg med en faktor på 24 i inferensforsinkelse, 37 i antall parametere og 12 i hva en kjøring koster, og i om du kan sende resultatet. Fem modellkort vil ikke avgjøre det: ingen svarer på spørsmålet du har, hvilken skal jeg kjøre først?
Hvert tall nedenfor ble hentet fra artikler, repos og kort i august 2026. Plattformtall kommer fra AY-Robots retningslinjekatalog; der de to er uenige, vises begge.
Kortversjonen
- •Tren ACT først hvis du tviler på datasettet ditt: 1 til 3 USD per kjøring, ingenting forhåndstrent for å dekke over dårlige data.
- •GR00T N1.7 og Pi0.5 ligger innenfor et halvt poeng på LIBERO, 97.0 mot 96.85 til 97.5. Det er ingen grunn til å velge noen av dem.
- •Pi0.5 handler om generalisering, ikke nøyaktighet, og er den tregeste med 485 ms.
- •SmolVLA, med 450 M parametere, er den eneste VLA her som finjusteres på ett 24 GB kort.
- •ACT på 20 ms er det eneste alternativet for rask reaktiv bevegelse. Lisenser avgjør resten.
Beslutningstabellen
| Din situasjon | Tren denne | Hvorfor |
|---|---|---|
| Dataset quality unproven | ACT | Ingenting forhåndstrent skjuler et ødelagt datasett, og feil koster 1 til 3 USD. |
| Contact-rich, multi-step, language-conditioned | GR00T N1.7 | 97.0% over fire LIBERO-suiter, pluss et relativt end-effector-handlingsrom. |
| Fast reactive motion, inference at the servos | ACT | 20 ms. Den nest raskeste er 7.6 ganger tregere. |
| New objects, new scene, open-world | Pi0.5 | Bygget for atferd utenfor distribusjon, på tvers av opptil 104 lokasjoner. |
| One 24 GB card, still want language | SmolVLA | 450 M parametere, et gulv på 30 episoder, kjører lokalt. |
| Reproducing a run recorded in 2025 | GR00T N1.5 | Bare hvis du må: LeRobot avviser det nå, vekter er ikke-kommersielle. |
| This will ship as a product | N1.7, SmolVLA or ACT | N1.5 er ikke-kommersiell, Pi0.5 har Gemma-vilkår, SmolVLAs kort angir ingen. |
De fem kandidatene
Alle fem er policyer: kamerarammer, leddposisjoner og, for fire av dem, en språkinstruksjon, kartlagt til en del av fremtidige leddmål. Det som skiller dem er hvor mye som ble lært før du ankom.
| Policy | Parametere | Latens | GPU-nivå | Lokalt? | Min episoder | Format | Kostnad |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIAs nåværende visjon-språk-handling-modell, omtrent 3 milliarder parametere, hvorav rundt 40 millioner er trent under finjustering. Repositoriet lister opp forskjellene fra N1.6: ryggrad fra en Eagle-modell fra tredjepart til Cosmos-Reason2-2B på Qwen3-VL, diffusjonslag 32 til 16, tilstands- og handlingsdimensjoner 29 til 132, handlingshorisont 16 til 40.
Det som betyr noe på en liten arm er det relative handlingsrommet for endeeffektor: N1.7 forutsier deltaer fra den nåværende posituren, noe som gjør at 20K timer med EgoScale menneskevideo kan overføres til en robotpolicy. Spesifikasjoner på N1.7-siden, prosedyre i N1.7 på SO-100-guiden.
Isaac-GR00T README erklærer N1.7 som en Generell Tilgjengelighet-utgivelse, med komplette ytelsestester og støtte. Dets Hugging Face-kort har ikke blitt oppdatert: Model Version-feltet viser fortsatt GR00T N1.7 EA. Repositoriet er det nyere dokumentet.
GR00T N1.5
Samme 3 B-skala, Eagle 2-ryggrad, SigLip2 og T5, flow-matching DiT-hode. Den eksisterer for å utvide et du allerede har. To ting gjør den til et dårlig standardvalg: vektene har NVIDIAs enveis ikke-kommersielle lisens, og nåværende LeRobot-utgivelser fjernet N1.5-støtte. Se .
Pi0.5
Physical Intelligence sin VLA, policy-type pi05. Artikkelen beskriver en 2 B VLM initialisert fra PaliGemma pluss en 300 M handlings-ekspert, som driver roboten med 50 Hz; LeRobots pi05-konfigurasjon er som standard et 50-trinns segment, ett sekund med den hastigheten. Salgsargumentet er usette steder: omtrent 400 timer med mobil manipulering i virkelige hjem, og en skaleringsstudie over 3, 12, 22, 53, 82 og 104 lokasjoner, hvor 104-lokasjonsmodellen matchet en kontroll trent på testhjemmene selv.
Én begrensning, angitt på lerobot/pi05_base kortet: porten bærer kun den flyt-matchende handlingshodet. Deloppgaveprediksjon, handlingstokenisering og RL ble ikke utgitt oppstrøms, og openpi sier det samme om sitt eget depot. Pi0.5-siden og Pi0.5 på SO-100-guiden har resten.
Pi0.5 trenger den lukkede google/paligemma-3b-pt-224 tokenisereren (gated: manual, selv om Google sier at forespørsler behandles umiddelbart). Uten å akseptere den og kjøre hf auth login i treningsmiljøet, starter jobben, laster ned en stund, og dør deretter på en autorisasjonsfeil som ser ut som en nettverksfeil. nvidia/GR00T-N1.7-3B er ikke lukket, men dens nvidia/Cosmos-Reason2-2B ryggrad er (gated: auto). Rydd begge før køing; hvis en kjøring sitter ledig, siden for fastlåst kø lister hva du skal sjekke.
SmolVLA
450 M parametere, omtrent 100 M i handlingseksperten, på SmolVLM-2 med VLM frosset og kun dens første 16 språkmodell-lag brukt. Førtrening var samfunnsdata: 481 datasett, 10.6 M rammer, fra de samme billige armene du bruker. Den eneste VLA-en her som passer på ett 24 GB kort, og den eneste 30 episode gulv. Se SmolVLA-siden.
ACT
Ikke en grunnmodell. Action Chunking Transformer fra ALOHA er omtrent 80 M parametere trent fra bunnen av per oppgave, på 50 demonstrasjoner ved 50 Hz. Artikkelen rapporterer seks virkelige bimanuelle oppgaver fra omtrent ti minutter med demonstrasjoner hver, med 80 til 90 prosent på eksemplene den fremhever. Dens idé, handlingssegmentering, er i hver modell på denne siden, og dens ablasjon måler fortsatt effekten best: over to simulerte oppgaver med temporal ensembling av, stiger suksessen fra 1 prosent ved k=1 til 44 prosent ved k=100. ACT-siden har resten.
Hva benchmarkene faktisk sier
LIBERO er den ene benchmarken tre av disse fem rapporterer om: språk-kondisjonerte oppgaver på en simulert Franka Panda, delt inn i de fire suitene nedenfor med ti oppgaver hver. NVIDIA kjørte 200 forsøk per suite.
| Modell | Romlig | Objekt | Mål | 10 (Lang) | Gjennomsnitt |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Hvert tall kommer fra et forskjellig testoppsett og budsjett. GR00T kjørte 20K steg med global batch 640; openpi-tallet er et 30K sjekkpunkt; LeRobot-porten la til 6K steg til en LIBERO grunnmodell. SmolVLA er en ytterligere uoverensstemmelse: dens artikkel trener den raden på LIBERO fra bunnen av, uten VLA-forhåndstrening, mens de tre over den finjusterer forhåndstrente sjekkpunkter. Behandle 96.85 til 97.5 som én klynge, og gapet til 87.3% som reelt, men kjøpt med 6.7x parametrene.
SimplerEnv viser spredningen, noe LIBERO ikke gjør. NVIDIA sammenligner N1.7 mot N1.6, det nærmeste offentlige til en generasjonsdelta.
| SimplerEnv-suite | N1.6 gjennomsnitt | N1.7 gjennomsnitt | Beste sving | Verste sving |
|---|---|---|---|---|
| Bridge (WidowX), 7 oppgaver | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 oppgaver | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ingen, hver oppgave forbedret seg |
Bridge-raden er den nyttige: 5,7 poeng oppnådd i gjennomsnitt mens put_eggplant_in_basket tapte 36 og put_eggplant_in_sink falt fra 33 til 2. En ny generasjon flytter distribusjonen i stedet for å løfte den, så hvis oppgaven din ligger der N1.7 regredierte, sier gjennomsnittet ingenting.

Av de fem rapporterer kun SmolVLA-artikkelen om en SO-100-klassearm: 78,3 prosent for SmolVLA og 61,7 for Pi0 over tre oppgaver, begge multi-task, mot 48,3 for ACT trent single-task, noe som ikke er sammenlignbart. Den rene sammenkoblingen er begge single-task på SO-101 pick-and-place: 90 mot 70 i distribusjon, 50 mot 40 utenfor den. Sammenlign på ACT mot SmolVLA og Pi0.5 mot SmolVLA, eller bla gjennom arenaen.
Latens og kostnad avgjør utrulling
Inferensforsinkelse er begrensningen folk oppdager sist og angrer først. En policy som er fem poeng bedre på en benchmark, men et halvt sekund per handlingstrinn, ser verre ut på skrivebordet ditt: kontaktdynamikk venter ikke.
Én advarsel: GR00T-tallet stemmer ikke overens med NVIDIAs kort, som måler 4 denoising-trinn og ett kamera til 85.8 ms på en H100 i eager-modus, 48.6 ms med torch.compile, 27.9 ms gjennom full TensorRT. De 152 ms her er et tall for hele stakken med serving-overhead og mer enn ett kamera, ikke et forward pass.
Løkken på 20 til 485 ms er modellens, og tur-retur-turer over offentlig internett legger til dette. Fjerninferens er levedyktig for langsom pick-and-place, ikke for rask reaktiv bevegelse. Hvis oppgaven din krever hastighet, sitter inferensen ved siden av servoene: ACT eller SmolVLA, lokalt. Relatert: policy fryser midt i bevegelsen.
Én måte å kjøpe tid på uten å endre modell: SmolVLA-artikkelen måler synkron utførelse, der policyen fullfører en del før den predikerer den neste, mot asynkron, der prediksjon overlapper utførelse. Suksessen er lik, 78.3 mot 73.3, men den samme pick-and-place tar 9.7 sekunder i stedet for 13.75, og i et fast vindu klarer roboten 19 sykluser i stedet for 9.
Lisenser, sjekket fordi ingen sjekker dem
| Modell | Vektlisens | Kodelisens | Kommersiell bruk |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kortet tillater kommersiell bruk | Apache 2.0 | ja |
| GR00T N1.5 | NVIDIA ensidig ikke-kommersiell lisens | Apache 2.0 | nei |
| Pi0.5 | pi05_base kortmetadata leser license: gemma | Apache 2.0 (openpi, LeRobot dokumentasjon) | les begge, de er uenige |
| SmolVLA | ingen lisensfelt på smolvla_base-kortet | Apache 2.0 (LeRobot) | kode ja, vekter uspesifisert |
| ACT | ingen basisvekter eksisterer | Apache 2.0 (LeRobot) | ja |
Pi0.5-raden krever forsiktighet. LeRobot pi05-dokumentasjonen angir Apache 2.0 i samsvar med openpi, mens Hub-kortet for lerobot/pi05_base inneholder license: gemma. Begge er aktive. GR00T N1.7 har en mildere versjon: Isaac-GR00T README sier i forbifarten at N1.7 er fullt kommersielt lisensierbar under Apache 2.0, mens dens egen lisensseksjon og modellkortet kun plasserer koden under Apache 2.0 og vektene under NVIDIA Open Model License.
Standardinnstillingene du faktisk vil kjøre
Hver trenerform leveres med en standard, og de er ikke vilkårlige. ACTs er LeRobots egne: batch 8, lr 1e-5, 100000 treningssteg, chunkstørrelse 100, som matcher ACTConfig oppstrøms og k=100 fra ACT-artikkelen. Én kolonne nedenfor er en felle.
| Policy | Batch | LR | Maks steg | Grad akkum | Gjelder? | Ekstra innstillinger |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ja | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ja | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nei (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nei | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nei | chunkSize, nActionSteps, seed, logFreq |
GR00Ts finjusterings-inngangspunkt (launch_finetune.py, en tyro CLI) har ingen seed-felt i sin config dataclass, så kjøringer er ikke bit-for-bit reproduserbare. Repoet advarer også om 5 til 6 prosent varians mellom kjøringer fra ikke-deterministiske bildeaugmenteringer, større enn de fleste benchmark-gap som diskuteres på nett. LeRobots standard seed er 1000. Grad-akkum-kolonnen beskriver lerobot 0.5.1; oppstrøms 0.6.2 eksponerer den som --accelerator.gradient_accumulation.steps.
Innstillingen som betyr mer enn modellvalget
Det er handlingsbiten. Lengre biter gir jevnere bevegelse og færre sammensatte feil, men politikken er forpliktet mens blokken utføres, så den reagerer sent på alt som beveger seg: selvsikker på en statisk kube, håpløs på en rullende. Hvis den overskyter, slår forkorting av den utførte delen omskolering og er gratis. Et ledd som stopper for tidlig er et annet problem; se .
- ACT: ACTConfig standardinnstillinger er
chunk_size 100ogn_action_steps 100. Temporal ensembling er av og krevern_action_steps 1. - GR00T N1.7: intern horisont gikk fra 16 til 40, men LeRobots SO-101 eksempel kjører fortsatt
--policy.chunk_size=16 --policy.n_action_steps=16. Rollout-flagget ble omdøpt til--execution-horizon. - Pi0.5: en 50-trinns bit, hvorav LeRobots LIBERO-oppskrift utfører 10 via
--policy.n_action_steps=10; med--policy.pretrained_pathfaller den tilbake til 50 hvis du utelater flagget. - SmolVLA: 50-handlingsbiter, begge innstillinger eksponert.
Hvordan teste alle fem på én ettermiddag
Det billigste svaret er ikke mer lesing. Bruk rundt 15 USD og la armen fortelle deg: ta opp én gang, tren den billige modellen først, eskaler når den har bevist at dataene er solide. Struktur slår volum, poenget med og .
- 1Ta opp 50 episoder én gang
Femti rydder gulvet for GR00T, Pi0.5 og ACT, og SmolVLAs 30. Gjenta hver variasjon i stedet for å spre tynt: 50 episoder over 5 kubeposisjoner trent der 25 ikke gjorde det. Se ta opp ditt første datasett.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Tren ACT først, fordi den ikke kan lyve for deg
Ingen forhåndstrente vekter, så hvis den utfører oppgaven i det hele tatt, inneholder datasettet ditt oppgaven. Hvis ACT flater ut, fiks dataene. 1 til 3 USD, 2 til 5 timer på et 24 GB kort.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Kjør SmolVLA på samme datasett, uendret
Samme data, samme arm, 450 M parametere i stedet for 80 M, pluss språkkondisjonering. LeRobot anslår en 20K-trinns kjøring til omtrent 4 timer på én A100. Dette er det som forteller deg om forhåndstrening gir noe.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konverter ned til v2.1 før du rører GR00T
GR00T leser en variant av LeRobot v2-formatet pluss en ekstra
meta/modality.jsonsom mapper hvordan sammenkoblede tilstands- og handlingsarrayer deles inn i navngitte felt. Et v3.0-datasett krasjer den innlasteren, fordi v3.0 pakker mange episoder inn i delte filer der v2 skrev én per episode. Isaac-GR00T leverer nedgraderingshjelperen somscripts/lerobot_conversion/convert_v3_to_v2.py; siden for v3-avvisning er den raske veien.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Eskaler til GR00T N1.7 bare hvis de to første etterlot noe på bordet
Via NVIDIAs CLI, vist her, eller LeRobots
grootpolicy-type. NVIDIA anbefaler 40 GB eller mer VRAM for finjustering, 16 GB for inferens. Ved en OOM, se OOM-siden.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
To måter å kjøre den screeningrunden på
Tre miljøer, fordi verktøykjedene ikke sameksisterer. LeRobot på main er 0.6.2 og krever Python 3.12 eller nyere; Isaac-GR00T og openpi er separate uv-administrerte repositorier.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fester
torchcodec0.8.0 som sin eneste videobackend, og krever FFmpeg 4 til 7. FFmpeg 8 støttes ikke, AV1 er ikke garantert. - openpi minnekrav: inferens over 8 GB, LoRA over 22.5 GB, full finjustering over 70 GB. Det siste er grunnen til at Pi0.5 er en A100-jobb.
- Lei GPU-en selv, ødelegg den etterpå, avstem tre sett med sjekkpunktstier manuelt.
Samme fem modeller, ett skjema. Velg modell, datasett og hyperparametere; backend leier en GPU dimensjonert etter nødvendig VRAM, kjører treneren og skriver sjekkpunkter til objektlagring.
- Den treningsmatrisen er fem modeller med fire armer, hver celle en veiledning: SmolVLA på SO-100, ACT på SO-101.
- Inferens-pods blir automatisk provisjonert av
/api/inference/podmed en inaktiv vaktbikkje, slik at en glemt pod ikke faktureres i stillhet. - Grunnleggende sjekkpunkter er leverandørenes egne:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT har ingen. - Samme operasjoner fra CLI-en og fra AI-agenter via MCP-serveren.
- Ingen maskinvare? Den levende armen strømmer en fysisk SO-100 uten registrering; prøvesiden viser veiene inn.
Grunnmodell eller fra bunnen av
Den virkelige utfordringen er ikke hvilken 3 B-modell man skal velge. Det er om man skal bruke en forhåndstrent VLA i det hele tatt, gitt at ACT lærte seks virkelige bimanuelle oppgaver fra omtrent ti minutter med demonstrasjoner hver, med 80 M parametere og ingenting forhåndstrent.
- Språkkondisjonering. ACT har ingen; ett ACT-sjekkpunkt utfører én oppgave.
- Bedre på objekter som mangler i demonstrasjonene dine: på SO-101, 50 % mot ACTs 40 % utenfor distribusjon.
- Multi-task i det hele tatt: SmolVLA når 78,3 % på tvers av tre SO-100-oppgaver med ett sjekkpunkt; ACT ble kun kjørt som enkelt-oppgave.
- 7,6x til 24x forsinkelsen: 152 til 485 ms per handlingstrinn mot ACTs 20 ms.
- 4 til 12 USD per kjøring i stedet for 1 til 3, og et A100-nivå i stedet for et hvilket som helst 24 GB-kort.
- Lisenseksponering, pluss en feilmodus for gated-repo som ikke eksisterer fra bunnen av.
- Forhåndstrente vekter kan maskere et dårlig datasett. En finjustering som fungerer halvveis på ødelagte data koster en uke før du ser på dataene.
Tilfellet med å reprodusere en gammel kjøring
Å jage et 2025-sjekkpunkt gjør modellvalget for deg og gjør problemet til versjonslåsing: nåværende LeRobot avviser N1.5, så du låser lerobot==0.5.1. Uten et seed-felt og 5 til 6 prosent varians mellom kjøringer, er reproduksjonen omtrentlig av konstruksjon. N1.5 på SO-100-guiden og N1.5-policy-siden har plattform-siden.

Nede på to? ACT mot GR00T N1.7 og GR00T N1.7 mot SmolVLA. Rådata finnes i arenaoppføringene: GR00T N1.7, Pi0.5, SmolVLA og ACT.
Hvor denne plattformen ikke hjelper deg
- Den kan ikke gjøre fjerninferens rask. Løkken på 20 til 485 ms tilhører modellen; internett-rundturer legger til dette.
- Den kan ikke finjustere GR00T eller Pi0.5 på din egen maskinvare. Begge er kun skybaserte her; kun SmolVLA og ACT kjører lokalt.
- Den kan ikke fikse et datasett. Tapet faller, men policyen gjør ingenting er et dataproblem, en policy som bare fungerer i ett oppsett er et dekningsproblem.
- Den kan ikke gjøre GR00T-kjøringer reproduserbare: oppstrømskonfigurasjonen har ingen felt for 'seed'.
85 modeller, 332 benchmark-resultater, hvert tall lenket til sin kilde
Den sorterbare versjonen av tabellene på denne siden: 85 syn-språk-handling-modeller, 332 benchmark-resultater, hver lenket tilbake til sin artikkel eller modellkort.
Åpne arenaenVelge én og gå videre
Ett utgangspunkt: ta opp 50 episoder, tren ACT for 1 til 3 USD for å bevise datasettet, deretter SmolVLA på samme data. Under 6 USD totalt, og de svarer på spørsmålet som betyr noe: om forhåndstrening hjelper her, eller om flaskehalsen er dataene. Eskaler til GR00T N1.7 for kontaktrike flertrinns oppgaver, til Pi0.5 når scenen endres.
Gjennomgang av plattformen: tren din første policy, deretter kjør din første policy. treningsdokumentasjonen og datasett-dokumentasjonen dekker form og format; SO-100-siden og den komplette SO-100-guiden dekker bygging og kalibrering. Bakgrunn: VLA-oversikten og Pi0 flow-matching-artikkelen. Den som vil forbedre suksessraten din er guiden for datakvalitet.
Hvilken VLA-policy bør jeg trene først på en SO-100?▾
ACT, deretter SmolVLA. ACT trener fra bunnen av, så den kan ikke maskere et dårlig datasett, og en kjøring koster 1 til 3 USD på et 24 GB-kort. Hvis ACT i det hele tatt utfører oppgaven, er de 4 til 12 USD for en GR00T N1.7- eller Pi0.5-kjøring ikke bortkastet.
Er GR00T N1.7 faktisk bedre enn Pi0.5?▾
På LIBERO er de innenfor støygrensen: 97.0% over fire suiter for GR00T N1.7, 96.85% for Pi0.5 ved 30k trinn i openpi, 97.5% for LeRobot-porten, alle fra forskjellige testrammer. De virkelige forskjellene er 152 ms per handlingstrinn mot 485 ms, v2.1 datasett mot v3.0, og benchmark-nøyaktighet mot generalisering i åpen verden.
Kan jeg finjustere noen av disse på et enkelt RTX 4090?▾
SmolVLA og ACT, ja; begge er oppført for et RTX 4090 eller et hvilket som helst 24 GB-kort og kjører lokalt. GR00T N1.7, N1.5 og Pi0.5 trenger en A100 eller H100 80 GB og er kun skybaserte her. NVIDIA anbefaler 40 GB eller mer for GR00T finjustering; openpis minimum er over 70 GB for en full Pi0.5 finjustering, 22.5 GB for LoRA.
Hvilke av disse fem kan jeg bruke kommersielt?▾
GR00T N1.7-vekter er under NVIDIA Open Model License Agreement, som kortet sier dekker kommersiell bruk. N1.5-vekter er ikke-kommersielle. SmolVLAs kode er Apache 2.0 i LeRobot, men lerobot/smolvla_base-kortet har ingen lisensfelt, så vektene er uoppgitte. ACT har ingen basisvekter å lisensiere. Pi0.5 er tvetydig: LeRobots dokumentasjon sier Apache 2.0, mens kortets metadata leser license: gemma.
Sources
- NVIDIA Isaac-GR00T-arkiv: GA-status, N1.6 til N1.7-endringer, maskinvarekrav, torchcodec- og FFmpeg-begrensninger, launch_finetune.py, variasjon fra kjøring til kjøring
- nvidia/GR00T-N1.7-3B modellkort: Cosmos-Reason2-2B ryggrad, 3 B parametere, tidsplan for inferens, NVIDIA Open Model License, Model Version-felt
- nvidia/GR00T-N1.5-3B modellkort: Eagle 2-referanse, SigLip2 og T5, flow matching DiT, enveis ikke-kommersiell lisens
- Isaac-GR00T LIBERO-eksempel: suksessrater per suite ved 20K trinn og batchstørrelse 640, 200 forsøk per suite
- Isaac-GR00T SimplerEnv-eksempel: suksessrater per oppgave for Bridge og Fractal, GR00T N1.6 mot N1.7
- pi0.5: en syns-, språk- og handlingsmodell med generalisering i åpen verden (2 B VLM pluss 300 M handlingsspesialist, 50 Hz kontroll, omtrent 400 timer med mobil manipulasjon, skaleringsstudie over 3 til 104 steder)
- openpi-arkiv: GPU-minnebegrensninger, omfang for kun flow-matching-hode, og Pi0.5 LIBERO-resultatene i examples/libero
- lerobot/pi05_base modellkort: omfanget av LeRobot-porten, license: gemma metadata, lerobot-train bruk
- LeRobot pi0.5-dokumentasjon: gated PaliGemma-tokeniserer, LIBERO-reproduksjonstabell, n_action_steps fallback-felle, Apache 2.0-erklæring
- SmolVLA: En syns-, språk- og handlingsmodell for rimelig og effektiv robotikk (450 M parametere, LIBERO- og Meta-World-tabeller, SO-100- og SO-101-resultater, asynkron inferens)
- LeRobot SmolVLA-dokumentasjon: 50 episoder over 5 posisjoner mot 25, 20k trinn på omtrent 4 timer på en A100
- Læring av finmasket tohendt manipulasjon med lavkost maskinvare (ACT og ALOHA): 6 oppgaver med 80-90 prosent, chunk size-ablasjon fra k=1 til k=100
- LeRobot 0.6.2: ACTConfig- og SmolVLAConfig-standarder, standard seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12-krav, Apache 2.0
- LeRobot GR00T-dokumentasjon: policy type groot, N1.5-støtte fjernet, pin lerobot==0.5.1, SO-101 chunk size-eksempel
- lerobot/smolvla_base modellkort: SmolVLA-basis-sjekkpunktet brukt av --policy.path, og dets kortmetadata, som ikke inneholder noe lisensfelt
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started