
GR00T N1.7, Pi0.5, SmolVLA, ACT eller GR00T N1.5? En beslutstabell anpassad till verkliga situationer, med publicerade benchmark-siffror, latens, kostnad per körning och licenser bakom varje val.
Fem policyer kan tränas på en SO-100-klassad arm idag. De skiljer sig åt med en faktor 24 i inferens-latens, 37 i antal parametrar och 12 i vad en körning kostar, samt i huruvida du får leverera resultatet. Fem modellkort kommer inte att lösa det: inget svarar på frågan du har, vilken ska jag köra först?
Alla siffror nedan lästes ur artiklar, repos och kort i augusti 2026. Plattformssiffror kommer från AY-Robots policykatalog; där de två skiljer sig åt, visas båda.
Den korta versionen
- •Träna ACT först om du tvivlar på din datamängd: 1 till 3 USD per körning, inget förtränat för att dölja dålig data.
- •GR00T N1.7 och Pi0.5 ligger inom en halv poäng på LIBERO, 97.0 mot 96.85 till 97.5. Det är ingen anledning att välja någon av dem.
- •Pi0.5 är generaliseringsalternativet, inte noggrannhetsalternativet, och den långsammaste på 485 ms.
- •SmolVLA, med 450 M parametrar, är den enda VLA här som finjusteras på ett 24 GB-kort.
- •ACT på 20 ms är det enda alternativet för snabb reaktiv rörelse. Licenser avgör resten.
Beslutstabellen
| Din situation | Träna detta | Varför |
|---|---|---|
| Datakvalitet obeprövad | ACT | Ingenting förtränat döljer en trasig datamängd, och misslyckanden kostar 1 till 3 USD. |
| Kontaktrik, flerstegs, språkstyrd | GR00T N1.7 | 97,0 % över fyra LIBERO-sviter, plus ett relativt handlingsutrymme för ändeffektorn. |
| Snabb reaktiv rörelse, inferens vid servona | ACT | 20 ms. Näst snabbast är 7,6 gånger långsammare. |
| Nya objekt, ny scen, öppen värld | Pi0.5 | Byggd för beteende utanför distributionen, över upp till 104 platser. |
| Ett 24 GB-kort, vill ändå ha språk | SmolVLA | 450 M parametrar, ett golv på 30 episoder, körs lokalt. |
| Reproducera en körning inspelad 2025 | GR00T N1.5 | Endast om du måste: LeRobot avvisar det nu, vikter icke-kommersiella. |
| Detta kommer att levereras som en produkt | N1.7, SmolVLA eller ACT | N1.5 är icke-kommersiell, Pi0.5 har Gemma-villkor, SmolVLA:s kort anger inga. |
De fem kandidaterna
Alla fem är policyer: kamerabilder, ledpositioner och, för fyra av dem, en språkanvisning, mappad till en del av framtida ledmål. Vad som skiljer dem åt är hur mycket som lärdes innan du anlände.
| Policy | Parametrar | Latens | GPU-nivå | Lokal? | Min episoder | Format | Kostnad |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIAs nuvarande visions-, språk- och handlingsmodell, cirka 3 miljarder parametrar, varav ungefär 40 miljoner tränades under finjustering. Arkivet listar skillnaderna från N1.6: ryggrad från en levererad Eagle-modell till Cosmos-Reason2-2B på Qwen3-VL, diffusionslager 32 till 16, tillstånds- och handlingsdimensioner 29 till 132, handlingshorisont 16 till 40.
Vad som är viktigt på en liten arm är det relativa handlingsutrymmet för ändeffektorn: N1.7 förutsäger deltan från den nuvarande positionen, vilket är det som gör att 20 000 timmar av EgoScale mänsklig video kan överföras till en robotpolicy. Specifikationer finns på N1.7-sidan, procedur i guiden för N1.7 på SO-100.
Isaac-GR00T README deklarerar N1.7 som en version med Allmän tillgänglighet, med kompletta benchmark-tester och support. Dess Hugging Face-kort har inte uppdaterats: fältet Model Version visar fortfarande GR00T N1.7 EA. Arkivet är det nyare dokumentet.
GR00T N1.5
Samma 3 B-skala, Eagle 2-ryggrad, SigLip2 och T5, flow-matching DiT-huvud. Den finns för att utöka en du redan har. Två saker gör den till ett dåligt standardval: vikterna har NVIDIAs enkelriktade icke-kommersiella licens, och nuvarande LeRobot-utgåvor har tagit bort N1.5-stöd. Se .
Pi0.5
Physical Intelligence's VLA, policy type pi05. Artikeln beskriver en 2 B VLM initierad från PaliGemma plus en 300 M actionexpert, som driver roboten i 50 Hz; LeRobots pi05-konfiguration använder som standard en 50-stegs chunk, en sekund i den hastigheten. Försäljningsargumentet är okända platser: cirka 400 timmar mobil manipulation i verkliga hem, och en skalningsstudie över 3, 12, 22, 53, 82 och 104 platser, där modellen för 104 platser matchade en kontroll tränad på testhushållen själva.
En begränsning, angiven på lerobot/pi05_base kortet: porten bär endast den flödesmatchande action head. Förutsägelse av deluppgifter, action tokenization och RL släpptes inte uppströms, och openpi säger detsamma om sitt eget repository. Pi0.5-sidan och guiden för Pi0.5 på SO-100 har resten.
Pi0.5 behöver den gated google/paligemma-3b-pt-224 tokenizer (gated: manual, även om Google säger att förfrågningar behandlas omedelbart). Utan att acceptera den och köra hf auth login i träningsmiljön, startar jobbet, laddar ner en stund, för att sedan dö på ett auktoriseringsfel som ser ut som ett nätverksfel. nvidia/GR00T-N1.7-3B är inte gated, men dess nvidia/Cosmos-Reason2-2B ryggrad är (gated: auto). Rensa båda innan köning; om en körning står stilla, sidan för fastnade köer listar vad som ska kontrolleras.
SmolVLA
450 M parametrar, cirka 100 M i action-experten, på SmolVLM-2 med VLM fryst och endast dess första 16 språkmodellager används. Förträning var gemenskapsdata: 481 dataset, 10.6 M ramar, från samma billiga armar du använder. Den enda VLA här som passar ett 24 GB kort, och den enda 30 episod golv. Se SmolVLA-sidan.
ACT
Inte en grundmodell. Action Chunking Transformer från ALOHA har cirka 80 M parametrar tränade från grunden per uppgift, på 50 demonstrationer vid 50 Hz. Artikeln rapporterar sex verkliga tvåhandsuppgifter från ungefär tio minuter demonstrationer vardera, med 80 till 90 procent på de exempel den lyfter fram. Dess idé, åtgärdssegmentering, finns i varje modell på denna sida, och dess ablation mäter fortfarande effekten bäst: över två simulerade uppgifter med temporal ensembling avstängd, framgången ökar från 1 procent vid k=1 till 44 procent vid k=100. ACT-sidan har resten.
Vad benchmark-testerna faktiskt säger
LIBERO är det enda benchmark som tre av dessa fem rapporterar om: språkstyrda uppgifter på en simulerad Franka Panda, uppdelade i de fyra sviterna nedan med tio uppgifter vardera. NVIDIA körde 200 försök per svit.
| Modell | Spatial | Objekt | Mål | 10 (Lång) | Genomsnitt |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Varje siffra kommer från en annan testmiljö och budget. GR00T körde 20K steg med global batch 640; openpi-siffran är en 30K checkpoint; LeRobot-porten lade till 6K steg till en LIBERO basmodell. SmolVLA är ytterligare en avvikelse: dess publikation tränar den raden på LIBERO från grunden, utan VLA-förträning, medan de tre ovanför finjusterar förtränade checkpoints. Behandla 96.85 till 97.5 som ett kluster, och gapet till 87.3% som verkligt men uppnått med 6.7x parametrarna.
SimplerEnv visar spridningen, vilket LIBERO inte gör. NVIDIA jämför N1.7 med N1.6, det närmaste offentliga till en generationsdelta.
| SimplerEnv-svit | N1.6 genomsnitt | N1.7 genomsnitt | Bästa förändring | Sämsta förändring |
|---|---|---|---|---|
| Bridge (WidowX), 7 uppgifter | 56.6% | 62.3% | stack_cube 5.0 till 48.0 | put_eggplant_in_basket 89.0 till 53.0 |
| Fractal (Google Robot), 6 uppgifter | 52.0% | 72.5% | open_drawer 0.0 till 65.0 | ingen, varje uppgift förbättrades |
Raden Bridge är den användbara: 5.7 poäng i genomsnitt medan put_eggplant_in_basket förlorade 36 och put_eggplant_in_sink föll från 33 till 2. En ny generation flyttar distributionen snarare än lyfter den, så om din uppgift ligger där N1.7 regrederade, säger genomsnittet ingenting.

Av de fem rapporterar endast SmolVLA-publikationen om en SO-100-klass arm: 78.3 procent för SmolVLA och 61.7 för Pi0 över tre uppgifter, båda multi-task, mot 48.3 för ACT tränad single-task, vilket inte är jämförbart. Den rena parningen är båda single-task på SO-101 pick-and-place: 90 mot 70 i distribution, 50 mot 40 utanför den. Jämför på ACT mot SmolVLA och Pi0.5 mot SmolVLA, eller bläddra i arenan.
Latens och kostnad avgör driftsättning
Inferenslatens är den begränsning folk upptäcker sist och ångrar först. En policy som är fem poäng bättre på ett benchmark men tar en halv sekund per åtgärdssteg ser sämre ut på ditt skrivbord: kontaktdynamik väntar inte.
En brasklapp: GR00T-siffran stämmer inte överens med NVIDIAs kort, som mäter 4 denoisingssteg och en kamera till 85.8 ms på en H100 i eager mode, 48.6 ms med torch.compile, 27.9 ms genom full TensorRT. De 152 ms här är en helstackssiffra med serving overhead och mer än en kamera, inte en forward pass.
Loopen på 20 till 485 ms tillhör modellen, och rundresor över det publika internet lägger till tid. Fjärrinferens är gångbart för långsam pick-and-place, inte för snabb reaktiv rörelse. Om din uppgift kräver hastighet, sitter inferensen bredvid servona: ACT eller SmolVLA, lokalt. Relaterat: policyn fryser mitt i rörelsen.
Ett sätt att vinna tid utan att ändra modell: SmolVLA-artikeln mäter synkron exekvering, där policyn avslutar en del innan den förutsäger nästa, jämfört med asynkron, där förutsägelse överlappar exekvering. Framgången är liknande, 78.3 mot 73.3, men samma pick-and-place tar 9.7 sekunder istället för 13.75, och i ett fast fönster klarar roboten 19 cykler istället för 9.
Licenser, kontrollerade eftersom ingen kontrollerar dem
| Modell | Licens för vikter | Licens för kod | Kommersiell användning |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kortet tillåter kommersiell användning | Apache 2.0 | ja |
| GR00T N1.5 | NVIDIA envägs icke-kommersiell licens | Apache 2.0 | nej |
| Pi0.5 | pi05_base-kortets metadata anger licens: gemma | Apache 2.0 (openpi, LeRobot docs) | läs båda, de är oense |
| SmolVLA | inget licensfält på smolvla_base-kortet | Apache 2.0 (LeRobot) | kod ja, vikter ospecificerade |
| ACT | inga basvikter existerar | Apache 2.0 (LeRobot) | ja |
Raden för Pi0.5 kräver uppmärksamhet. LeRobot pi05-dokumentationen anger Apache 2.0 i överensstämmelse med openpi, medan Hub-kortet för lerobot/pi05_base anger license: gemma. Båda är aktiva. GR00T N1.7 har en mildare version: Isaac-GR00T README nämner i förbigående att N1.7 är fullt kommersiellt licensierbar under Apache 2.0, medan dess egen licenssektion och modellkort endast placerar koden under Apache 2.0 och vikterna under NVIDIA Open Model License.
Standardinställningarna du faktiskt kommer att köra
Varje träningsformulär levereras med en standardinställning, och dessa är inte godtyckliga. ACT:s är LeRobots egna: batch 8, lr 1e-5, 100000 träningssteg, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. En kolumn nedan är en fälla.
| Policy | Batch | LR | Max steg | Grad-ackumulering | Gäller? | Extra inställningar |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ja | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ja | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nej (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nej | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nej | chunkSize, nActionSteps, seed, logFreq |
GR00T:s startpunkt för finjustering (launch_finetune.py, en tyro CLI) har inget seed-fält i sin config-dataclass, så körningar är inte bit-för-bit reproducerbara. Repot varnar också för 5 till 6 procents variation mellan körningar på grund av icke-deterministiska bildförbättringar, vilket är större än de flesta benchmark-skillnader som diskuteras online. LeRobots standard-seed är 1000. Kolumnen för grad-ackumulering beskriver lerobot 0.5.1; uppströms 0.6.2 exponerar den som --accelerator.gradient_accumulation.steps.
Inställningen som betyder mer än modellvalet
Det är åtgärdsbiten. Längre bitar ger jämnare rörelse och färre ackumulerande fel, men policyn är låst medan blocket exekveras, så den reagerar sent på allt som rör sig: självsäker på en statisk kub, hopplös på en rullande. Om den skjuter över målet, är det bättre att förkorta den exekverade delen än att omskola och det är gratis. En led som stannar för tidigt är ett annat problem; se .
- ACT: ACTConfig standardinställningar är
chunk_size 100ochn_action_steps 100. Temporär ensembling är avstängd och krävern_action_steps 1. - GR00T N1.7: intern horisont gick från 16 till 40, men LeRobots SO-101-exempel kör fortfarande
--policy.chunk_size=16 --policy.n_action_steps=16. Rollout-flaggan döptes om till--execution-horizon. - Pi0.5: en 50-stegsbit, varav LeRobots LIBERO-recept exekverar 10 via
--policy.n_action_steps=10; med--policy.pretrained_pathåtergår den till 50 om du utelämnar flaggan. - SmolVLA: 50-åtgärdsbitar, båda inställningarna exponerade.
Hur man granskar alla fem på en eftermiddag
Det billigaste svaret är inte mer läsning. Spendera cirka 15 USD och låt armen berätta: spela in en gång, träna den billiga modellen först, eskalera när den har bevisat att datan är sund. Struktur slår volym, poängen med och .
- 1Spela in 50 episoder en gång
Femtio banar väg för GR00T, Pi0.5 och ACT, och SmolVLAs 30. Upprepa varje variation istället för att sprida ut tunt: 50 episoder över 5 kubpositioner tränades där 25 inte gjorde det. Se spela in din första datamängd.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Träna ACT först, eftersom den inte kan ljuga för dig
Inga förtränade vikter, så om den överhuvudtaget utför uppgiften, innehåller din datamängd uppgiften. Om ACT inte ger resultat, åtgärda datan. 1 to 3 USD, 2 to 5 hours on a 24 GB card.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Kör SmolVLA på samma datamängd, oförändrad
Samma data, samma arm, 450 M parametrar istället för 80 M, plus språkkonditionering. LeRobot uppskattar en körning på 20K steg till ungefär 4 timmar på en A100. Detta är vad som talar om för dig om förträning ger något.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konvertera ner till v2.1 innan du rör GR00T
GR00T läser en variant av LeRobot v2-formatet plus en extra
meta/modality.jsonsom mappar hur sammanfogade tillstånds- och åtgärdsarrayer delas upp i namngivna fält. En v3.0-datamängd kraschar den laddaren, eftersom v3.0 packar många episoder i delade filer där v2 skrev en per episod. Isaac-GR00T levererar nedgraderingshjälpen somscripts/lerobot_conversion/convert_v3_to_v2.py; sidan för v3-avvisning är den snabba vägen.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Eskalera till GR00T N1.7 endast om de första två lämnade något kvar
Via NVIDIAs CLI, som visas här, eller LeRobots
grootpolicytyp. NVIDIA rekommenderar 40 GB eller mer VRAM för finjustering, 16 GB för inferens. Vid ett OOM, se OOM-sidan.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Två sätt att köra den screeningpassagen
Tre miljöer, eftersom verktygskedjorna inte samexisterar. LeRobot på main är 0.6.2 och kräver Python 3.12 eller nyare; Isaac-GR00T och openpi är separata uv-hanterade repos.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T låser
torchcodec0.8.0 som sin enda videobackend, vilket kräver FFmpeg 4 till 7. FFmpeg 8 stöds inte, AV1 garanteras inte. - openpi minneskrav: inferens över 8 GB, LoRA över 22.5 GB, full finjustering över 70 GB. Det sistnämnda är anledningen till att Pi0.5 är ett A100-jobb.
- Hyr GPU:n själv, förstör den efteråt, stäm av tre uppsättningar av kontrollpunktsökvägar manuellt.
Samma fem modeller, ett formulär. Välj modell, datamängd och hyperparametrar; backend hyr en GPU dimensionerad efter nödvändigt VRAM, kör tränaren och skriver kontrollpunkter till objektlagring.
- Träningsmatrisen är fem modeller med fyra armar, varje cell en guide: SmolVLA på SO-100, ACT på SO-101.
- Inferens-pods provisioneras automatiskt av
/api/inference/podmed en inaktiv vakthund, så en bortglömd pod faktureras inte tyst. - Bas-kontrollpunkter är leverantörernas egna:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT har inga. - Samma operationer från CLI och från AI-agenter via MCP-servern.
- Ingen hårdvara? Live-armen strömmar en fysisk SO-100 med ingen registrering; testsidan visar vägarna in.
Grundmodell eller från grunden
Den verkliga frågan är inte vilken 3 B-modell man ska välja. Det är snarare om man överhuvudtaget ska använda en förtränad VLA, med tanke på att ACT lärde sig sex verkliga tvåhandsuppgifter från cirka tio minuters demonstrationer vardera, med 80 M parametrar och inget förtränat.
- Språkkonditionering. ACT har ingen; en ACT-checkpoint utför en uppgift.
- Bättre på objekt som saknas i dina demonstrationer: på SO-101, 50% jämfört med ACT:s 40% utanför distributionen.
- Överhuvudtaget multi-task: SmolVLA når 78.3% över tre SO-100-uppgifter med en checkpoint; ACT kördes endast som enskild uppgift.
- 7.6x till 24x högre latens: 152 till 485 ms per åtgärdssteg jämfört med ACT:s 20 ms.
- 4 till 12 USD per körning istället för 1 till 3, och en A100-nivå istället för vilket 24 GB-kort som helst.
- Licensexponering, plus ett felscenario med begränsat repo som inte existerar från grunden.
- Förtränade vikter kan maskera en dålig datamängd. En finjustering som fungerar halvdant på trasig data kostar en vecka innan du tittar på datan.
Fallet med att reproducera en gammal körning
Att jaga en 2025-checkpoint gör modellvalet åt dig och förvandlar problemet till versionslåsning: nuvarande LeRobot avvisar N1.5, så du låser lerobot==0.5.1. Utan ett seed-fält och med 5 till 6 procents varians mellan körningar är reproduktionen approximativ per konstruktion. Guidingen för N1.5 på SO-100 och N1.5 policy-sidan hanterar plattformssidan.

Ner till två? ACT mot GR00T N1.7 och GR00T N1.7 mot SmolVLA. Rådata finns i arena-posterna: GR00T N1.7, Pi0.5, SmolVLA och ACT.
Där denna plattform inte hjälper dig
- Den kan inte göra fjärrinferens snabb. Loopen på 20 till 485 ms tillhör modellen; internetrundresor lägger till detta.
- Den kan inte finjustera GR00T eller Pi0.5 på din egen hårdvara. Båda är endast molnbaserade här; endast SmolVLA och ACT körs lokalt.
- Den kan inte fixa ett dataset. Förlusten minskar men policyn gör ingenting är ett dataprobem, en policy som bara fungerar i en inställning är ett täckningsproblem.
- Den kan inte göra GR00T-körningar reproducerbara: den uppströms konfigurationen har inget seed-fält.
85 modeller, 332 benchmarkresultat, varje siffra länkad till sin källa
Den sorterbara versionen av tabellerna på denna sida: 85 vision-språk-aktion-modeller, 332 benchmarkresultat, var och en länkad tillbaka till sin publikation eller modellkort.
Öppna arenanVälja en och gå vidare
En standard: spela in 50 episoder, träna ACT för 1 till 3 USD för att bevisa datasetet, sedan SmolVLA på samma data. Under 6 USD totalt, och de svarar på den viktiga frågan: om förträning hjälper här, eller om flaskhalsen är datan. Eskalera till GR00T N1.7 för kontaktrika flerstegsuppgifter, till Pi0.5 när scenen ändras.
Plattformsgenomgång: träna din första policy, sedan köra din första policy. De träningsdokumenten och datasetdokumenten täcker form och format; SO-100-sidan och den kompletta SO-100-guiden täcker konstruktion och kalibrering. Bakgrund: VLA-översikten och Pi0 flow-matching-artikeln. Den som kommer att förbättra din framgångsfrekvens är guiden för datakvalitet.
Vilken VLA-policy ska jag träna först på en SO-100?▾
ACT, sedan SmolVLA. ACT tränar från grunden, så den kan inte maskera en dålig datamängd, och en körning kostar 1 till 3 USD på ett 24 GB-kort. Om ACT överhuvudtaget utför uppgiften, är de 4 till 12 USD för en GR00T N1.7- eller Pi0.5-körning inte bortkastade.
Är GR00T N1.7 faktiskt bättre än Pi0.5?▾
På LIBERO ligger de inom brusnivån: 97.0% över fyra sviter för GR00T N1.7, 96.85% för Pi0.5 vid 30k steg i openpi, 97.5% för LeRobot-porten, alla från olika testmiljöer. De verkliga skillnaderna är 152 ms per åtgärdssteg mot 485 ms, v2.1-datamängder mot v3.0, och benchmark-noggrannhet mot generalisering i öppen värld.
Kan jag finjustera någon av dessa på ett enda RTX 4090?▾
SmolVLA och ACT, ja; båda är listade för ett RTX 4090 eller vilket 24 GB-kort som helst och körs lokalt. GR00T N1.7, N1.5 och Pi0.5 behöver en A100 eller H100 80 GB och är endast molnbaserade här. NVIDIA rekommenderar 40 GB eller mer för GR00T-finjustering; openpis gräns ligger över 70 GB för en fullständig Pi0.5-finjustering, 22.5 GB för LoRA.
Vilka av dessa fem kan jag använda kommersiellt?▾
GR00T N1.7-vikter omfattas av NVIDIA Open Model License Agreement, som kortet anger täcker kommersiell användning. N1.5-vikter är icke-kommersiella. SmolVLAs kod är Apache 2.0 i LeRobot, men lerobot/smolvla_base-kortet har inget licensfält, så vikterna är ospecificerade. ACT har inga basvikter att licensiera. Pi0.5 är tvetydig: LeRobots dokumentation säger Apache 2.0, dess kortmetadata anger license: gemma.
Sources
- NVIDIA Isaac-GR00T-förråd: GA-status, N1.6 till N1.7-ändringar, hårdvarukrav, torchcodec- och FFmpeg-begränsningar, launch_finetune.py, variation mellan körningar
- nvidia/GR00T-N1.7-3B modellkort: Cosmos-Reason2-2B ryggrad, 3 B parametrar, tabell för inferenstider, NVIDIA Open Model License, fält för modellversion
- nvidia/GR00T-N1.5-3B modellkort: Eagle 2 referens, SigLip2 och T5, flow matching DiT, enkelriktad icke-kommersiell licens
- Isaac-GR00T LIBERO-exempel: framgångsfrekvenser per svit vid 20K steg och batchstorlek 640, 200 försök per svit
- Isaac-GR00T SimplerEnv-exempel: framgångsfrekvenser per uppgift för Bridge och Fractal, GR00T N1.6 mot N1.7
- pi0.5: en Vision-Språk-Åtgärdsmodell med generalisering i öppen värld (2 B VLM plus 300 M åtgärdsexpert, 50 Hz kontroll, cirka 400 timmar mobil manipulation, skalningsstudie över 3 till 104 platser)
- openpi-förråd: GPU-minnesgränser, flow-matching-head-only omfång, och Pi0.5 LIBERO-resultaten i examples/libero
- lerobot/pi05_base modellkort: omfång för LeRobot-porten, license: gemma metadata, lerobot-train användning
- LeRobot pi0.5-dokumentation: gated PaliGemma tokenizer, LIBERO reproduktionstabell, n_action_steps fallback-fälla, Apache 2.0-uttalande
- SmolVLA: En Vision-Språk-Åtgärdsmodell för prisvärd och effektiv robotik (450 M parametrar, LIBERO- och Meta-World-tabeller, SO-100- och SO-101-resultat, asynkron inferens)
- LeRobot SmolVLA-dokumentation: 50 episoder över 5 positioner mot 25, 20k steg på cirka 4 timmar på en A100
- Lärande av finmaskig bimanual manipulation med lågkostnadshårdvara (ACT och ALOHA): 6 uppgifter med 80-90 procent, chunk size ablation från k=1 till k=100
- LeRobot 0.6.2: ACTConfig- och SmolVLAConfig-standardinställningar, standardfrö 1000, --accelerator.gradient_accumulation.steps, Python 3.12-krav, Apache 2.0
- LeRobot GR00T-dokumentation: policytyp groot, N1.5-stöd borttaget, pin lerobot==0.5.1, SO-101 chunk size-exempel
- lerobot/smolvla_base modellkort: SmolVLA bas-checkpoint som används av --policy.path, och dess kortmetadata, som inte innehåller något licensfält
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started