
GR00T N1.7, Pi0.5, SmolVLA, ACT nebo GR00T N1.5? Rozhodovací tabulka přizpůsobená reálným situacím, s publikovanými benchmarkovými čísly, latencí, náklady na spuštění a licencemi za každou volbou.
Dnes je na rameni třídy SO-100 trénovatelných pět politik. Liší se faktorem 24 v latenci inference, 37 v počtu parametrů a 12 v nákladech na spuštění, a také v tom, zda smíte výsledek expedovat. Pět modelových karet to nevyřeší: žádná neodpovídá na otázku, kterou máte, kterou spustit jako první?
Každé číslo níže bylo převzato z článků, repozitářů a karet v srpnu 2026. Čísla platformy pocházejí z AY-Robots katalog politik; kde se obě neshodují, jsou zobrazeny obě.
Stručná verze
- •Trénujte ACT jako první, pokud pochybujete o svém datovém souboru: 1 až 3 USD za spuštění, nic předtrénovaného k zakrytí špatných dat.
- •GR00T N1.7 a Pi0.5 se na LIBERO pohybují v rozmezí půl bodu, 97.0 proti 96.85 až 97.5. To není důvod k výběru ani jednoho.
- •Pi0.5 je sázka na generalizaci, nikoli na přesnost, a je nejpomalejší s 485 ms.
- •SmolVLA, s 450 M parametry, je zde jediná VLA, která se dolaďuje na jedné 24 GB kartě.
- •ACT s 20 ms je jedinou možností pro rychlý reaktivní pohyb. Licence rozhodují o zbytku.
Rozhodovací tabulka
| Vaše situace | Trénujte toto | Proč |
|---|---|---|
| Kvalita datové sady neprokázána | ACT | Žádný předtrénovaný model nezakryje poškozenou datovou sadu a selhání stojí 1 to 3 USD. |
| Bohatý na kontakty, vícekrokový, podmíněný jazykem | GR00T N1.7 | 97.0% napříč čtyřmi sadami LIBERO, plus relativní akční prostor koncového efektoru. |
| Rychlý reaktivní pohyb, inference na servech | ACT | 20 ms. Další nejrychlejší je 7.6krát pomalejší. |
| Nové objekty, nová scéna, otevřený svět | Pi0.5 | Navrženo pro chování mimo distribuci, napříč až 104 lokacemi. |
| Jedna 24 GB karta, stále chcete jazyk | SmolVLA | 450 M parametrů, minimálně 30 epizod, běží lokálně. |
| Reprodukce běhu zaznamenaného v roce 2025 | GR00T N1.5 | Pouze pokud musíte: LeRobot to nyní odmítá, váhy jsou nekomerční. |
| Toto bude dodáno jako produkt | N1.7, SmolVLA nebo ACT | N1.5 je nekomerční, Pi0.5 podléhá podmínkám Gemma, karta SmolVLA neuvádí žádné. |
Pět kandidátů
Všech pět jsou politiky: snímky z kamery, pozice kloubů a, pro čtyři z nich, jazyková instrukce, mapovaná na část budoucích cílů kloubů. Co je odlišuje, je, kolik toho bylo naučeno, než jste dorazili.
| Politika | Parametry | Latence | Úroveň GPU | Lokální? | Min. epizody | Formát | Cena |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ano | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ano | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | ne | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | ne | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Aktuální model NVIDIA vizuálně-jazykově-akční model, s přibližně 3 miliardami parametrů, z nichž zhruba 40 milionů bylo trénováno během jemného ladění. Repozitář uvádí rozdíly oproti N1.6: páteřní síť z dodaného modelu Eagle na Cosmos-Reason2-2B na Qwen3-VL, difuzní vrstvy z 32 na 16, dimenze stavu a akce z 29 na 132, akční horizont z 16 na 40.
U malého ramene je důležitý relativní akční prostor koncového efektoru: N1.7 předpovídá rozdíly od aktuální pozice, což umožňuje přenos 20K hodin lidského videa EgoScale do robotické politiky. Specifikace na stránce N1.7, postup v průvodci N1.7 na SO-100.
Soubor README projektu Isaac-GR00T prohlašuje N1.7 za vydání s obecnou dostupností, s kompletními benchmarky a podporou. Karta na Hugging Face se ještě neaktualizovala: pole Model Version stále uvádí GR00T N1.7 EA. Repozitář je novější dokument.
GR00T N1.5
Stejná škála 3 B, páteř Eagle 2, SigLip2 a T5, hlava DiT s flow-matching. Existuje k rozšíření , který již máte. Dvě věci z něj dělají špatnou výchozí volbu: váhy nesou jednosměrnou nekomerční licenci NVIDIA a aktuální vydání LeRobot odstranila podporu N1.5. Viz .
Pi0.5
VLA od Physical Intelligence s VLA, typ politiky pi05. Článek popisuje 2 B VLM inicializovaný z PaliGemma plus 300 M akční expert, řídící robota na 50 Hz; konfigurace pi05 LeRobotu standardně používá 50krokový blok, jednu sekundu při této rychlosti. Prodejním argumentem jsou neviděná místa: přibližně 400 hodin mobilní manipulace ve skutečných domácnostech a studie škálování přes 3, 12, 22, 53, 82 a 104 lokací, kde model se 104 lokacemi odpovídal kontrole trénované na samotných testovacích domácnostech.
Jedno omezení, uvedené na lerobot/pi05_base kartě: port přenáší pouze tokem odpovídající action head. Predikce podúkolů, tokenizace akcí a RL nebyly uvolněny upstream, a openpi uvádí totéž o svém vlastním repozitáři. Stránka Pi0.5 a průvodce Pi0.5 na SO-100 mají zbytek.
Pi0.5 potřebuje gated google/paligemma-3b-pt-224 tokenizer (gated: manual, i když Google říká, že požadavky jsou zpracovány okamžitě). Bez jeho přijetí a spuštění hf auth login v tréninkovém prostředí se úloha spustí, chvíli stahuje, a pak zemře na chybu autorizace, která vypadá jako síťová chyba. nvidia/GR00T-N1.7-3B není gated, ale jeho páteř nvidia/Cosmos-Reason2-2B je (gated: auto). Vymažte obojí před zařazením do fronty; pokud běh zůstane nečinný, stránka se zaseknutou frontou uvádí, co zkontrolovat.
SmolVLA
450 M parametrů, asi 100 M v akčním expertovi, na SmolVLM-2 s VLM zmrazeným a pouze jeho prvních 16 vrstev jazykového modelu. Předtrénink proběhl na komunitních datech: 481 datových sad, 10.6 M snímků, ze stejných levných ramen, která používáte. Jediný VLA zde, který se vejde na jednu 24 GB kartu, a jediný s 30 epizod podlahou. Viz stránka SmolVLA.
ACT
Není to základní model. Action Chunking Transformer z ALOHA má přibližně 80 milionů parametrů trénovaných od nuly pro každý úkol, na 50 demonstracích při 50 Hz. Článek uvádí šest skutečných bimanálních úkolů zhruba z deseti minut demonstrací každý, s úspěšností 80 až 90 procent u příkladů, které zdůrazňuje. Jeho myšlenka, chunkování akcí, je v každém modelu na této stránce a jeho ablace stále nejlépe měří účinek: u dvou simulovaných úkolů s vypnutým časovým ensemblingem se úspěšnost zvyšuje z 1 procenta při k=1 na 44 procent při k=100. Stránka ACT obsahuje zbytek.
Co benchmarky skutečně říkají
LIBERO je jediný benchmark, o kterém referují tři z těchto pěti: jazykově podmíněné úkoly na simulovaném robotu Franka Panda, rozdělené do čtyř níže uvedených sad po deseti úkolech. NVIDIA provedla 200 pokusů na sadu.
| Model | Prostorové | Objektové | Cílové | 10 (Dlouhé) | Průměr |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Každé číslo pochází z jiného testovacího prostředí a rozpočtu. GR00T běžel 20K kroků s globální dávkou 640; údaj openpi je kontrolní bod 30K; port LeRobot přidal 6K kroků k základnímu modelu LIBERO. SmolVLA je další nesoulad: jeho článek trénuje tento řádek na LIBERO od začátku, bez předtrénování VLA, zatímco tři nad ním dolaďují předtrénované kontrolní body. Považujte 96.85 až 97.5 za jeden shluk a rozdíl k 87.3% za reálný, ale získaný s 6.7x více parametry.
SimplerEnv ukazuje rozptyl, což LIBERO ne. NVIDIA porovnává N1.7 s N1.6, což je nejbližší veřejná věc k generačnímu rozdílu.
| Sada SimplerEnv | Průměr N1.6 | Průměr N1.7 | Nejlepší výkyv | Nejhorší výkyv |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | žádný, každý úkol se zlepšil |
Řádek Bridge je ten užitečný: v průměru získal 5,7 bodu, zatímco put_eggplant_in_basket ztratil 36 a put_eggplant_in_sink klesl z 33 na 2. Nová generace posouvá distribuci spíše než ji zvedá, takže pokud váš úkol spadá tam, kde N1.7 regredoval, průměr nic neříká.

Z pěti pouze článek SmolVLA uvádí rameno třídy SO-100: 78,3 procenta pro SmolVLA a 61,7 pro Pi0 napříč třemi úkoly, oba víceúlohové, oproti 48,3 pro ACT trénovaný jednoúlohově, což není srovnatelné. Čisté srovnání je obojí jednoúlohové na SO-101 pick-and-place: 90 proti 70 v distribuci, 50 proti 40 mimo ni. Porovnejte na ACT proti SmolVLA a Pi0.5 proti SmolVLA, nebo si prohlédněte arénu.
Latence a náklady rozhodují o nasazení
Latence inference je omezení, které lidé objeví jako poslední a litují jako první. Politika o pět bodů lepší v benchmarku, ale s půlsekundovou prodlevou na krok akce, vypadá na vašem stole hůře: dynamika kontaktu nečeká.
Jedna výhrada: údaj GR00T se neshoduje s kartou NVIDIA, která měří 4 kroky odšumění a jednu kameru na 85.8 ms na H100 v eager režimu, 48.6 ms s torch.compile, 27.9 ms přes plný TensorRT. Zde uvedených 152 ms je údaj pro celý stack s režijními náklady na obsluhu a více než jednou kamerou, nikoli jen pro forward pass.
Smyčka 20 až 485 ms je záležitostí modelu a k tomu se přidávají zpáteční cesty přes veřejný internet. Vzdálená inference je životaschopná pro pomalé pick-and-place, nikoli pro rychlý reaktivní pohyb. Pokud váš úkol vyžaduje rychlost, inference se nachází vedle serv: ACT nebo SmolVLA, lokálně. Související: politika zamrzá uprostřed pohybu.
Jeden způsob, jak získat čas bez změny modelu: článek SmolVLA měří synchronní provádění, kde politika dokončí jeden blok před predikcí dalšího, oproti asynchronnímu, kde se predikce překrývá s prováděním. Úspěšnost je podobná, 78.3 proti 73.3, ale stejné pick-and-place trvá 9.7 sekundy místo 13.75, a v pevném okně robot zvládne 19 cyklů místo 9.
Licence, zkontrolováno, protože je nikdo nekontroluje
| Model | Licence vah | Licence kódu | Komerční použití |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; karta umožňuje komerční použití | Apache 2.0 | ano |
| GR00T N1.5 | NVIDIA jednosměrná nekomerční licence | Apache 2.0 | ne |
| Pi0.5 | metadata karty pi05_base uvádí licenci: gemma | Apache 2.0 (openpi, LeRobot docs) | přečtěte si obě, neshodují se |
| SmolVLA | na kartě smolvla_base není pole licence | Apache 2.0 (LeRobot) | kód ano, váhy neuvedeny |
| ACT | neexistují žádné základní váhy | Apache 2.0 (LeRobot) | ano |
Řádek Pi0.5 vyžaduje pozornost. Dokumentace LeRobot pi05 uvádí Apache 2.0 v souladu s openpi, zatímco karta Hub pro lerobot/pi05_base nese license: gemma. Obě jsou aktivní. GR00T N1.7 má mírnější verzi: README soubor Isaac-GR00T mimochodem uvádí, že N1.7 je plně komerčně licencovatelný pod Apache 2.0, zatímco jeho vlastní licenční sekce a karta modelu umisťují pouze kód pod Apache 2.0 a váhy pod NVIDIA Open Model License.
Výchozí nastavení, která skutečně spustíte
Každá forma tréninku obsahuje výchozí nastavení, která nejsou libovolná. Nastavení ACT jsou vlastní LeRobotu: dávka 8, lr 1e-5, 100000 tréninkových kroků, velikost bloku 100, odpovídající ACTConfig upstream a k=100 from the ACT paper. Jeden sloupec níže je past.
| Politika | Dávka | LR | Max. kroky | Akumulace gradientu | Používá se? | Další parametry |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Vstupní bod pro jemné doladění GR00T (launch_finetune.py, CLI tyro) nemá ve své konfigurační datové třídě žádné pole pro seed, takže spuštění nejsou bitově reprodukovatelná. Repozitář také varuje před 5 až 6 procentní variabilitou mezi spuštěními způsobenou nedeterministickými augmentacemi obrazu, což je více než většina rozdílů v benchmarcích, o kterých se online diskutuje. Výchozí seed LeRobotu je 1000. Sloupec akumulace gradientu popisuje lerobot 0.5.1; upstream 0.6.2 jej zpřístupňuje jako --accelerator.gradient_accumulation.steps.
Parametr, který je důležitější než volba modelu
Jedná se o akční blok. Delší bloky poskytují plynulejší pohyb a méně kumulativních chyb, ale politika je závazná po dobu provádění bloku, takže reaguje pozdě na cokoli, co se pohybuje: je si jistá na statické kostce, beznadějná na té valící se. Pokud přejede cíl, zkrácení provedené části je lepší než přeškolení a je zdarma. Kloub, který se zastaví předčasně, je jiný problém; viz .
- ACT: ACTConfig má výchozí nastavení
chunk_size 100an_action_steps 100. Časové ensembling je vypnuto a vyžadujen_action_steps 1. - GR00T N1.7: interní horizont se změnil z 16 na 40, přesto LeRobot's SO-101 example stále spouští
--policy.chunk_size=16 --policy.n_action_steps=16. Příznak pro rollout byl přejmenován na--execution-horizon. - Pi0.5: 50krokový blok, z něhož recept LeRobot's LIBERO provádí 10 pomocí
--policy.n_action_steps=10; s--policy.pretrained_pathse vrátí na 50, pokud příznak vynecháte. - SmolVLA: 50akční bloky, oba ovladače jsou přístupné.
Jak prověřit všech pět za jedno odpoledne
Nejlevnější odpovědí není více čtení. Utraťte asi 15 USD a nechte rameno, ať vám to řekne: nahrajte jednou, nejprve trénujte levný model, eskalujte, jakmile se data prokážou jako spolehlivá. Struktura vítězí nad objemem, což je smyslem a .
- 1Zaznamenejte 50 epizod najednou
Padesát epizod připravuje půdu pro GR00T, Pi0.5 a ACT, a 30 epizod pro SmolVLA. Opakujte každou variaci, místo abyste se rozptylovali: 50 epizod napříč 5 pozicemi kostky bylo trénováno tam, kde 25 nebylo. Viz zaznamenejte svůj první dataset.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Nejprve trénujte ACT, protože vám nemůže lhát
Žádné předtrénované váhy, takže pokud úkol vůbec splní, váš dataset úkol obsahuje. Pokud ACT stagnuje, opravte data. 1 až 3 USD, 2 až 5 hodin na 24 GB kartě.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Spusťte SmolVLA na stejném datasetu, beze změn
Stejná data, stejné rameno, 450 M parametrů místo 80 M, plus jazykové podmínění. LeRobot odhaduje běh 20K kroků na zhruba 4 hodiny na jedné A100. To vám řekne, zda předtrénování něco přináší.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Převeďte na v2.1, než se dotknete GR00T
GR00T čte variantu formátu LeRobot v2 plus dodatečný soubor
meta/modality.json, který mapuje, jak se zřetězené pole stavů a akcí rozdělují do pojmenovaných polí. Dataset v3.0 tento loader zhroutí, protože v3.0 balí mnoho epizod do sdílených souborů, zatímco v2 zapisoval jednu na epizodu. Isaac-GR00T dodává pomocníka pro downgrade jakoscripts/lerobot_conversion/convert_v3_to_v2.py; stránka o odmítnutí v3 je rychlá cesta.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Přejděte na GR00T N1.7 pouze v případě, že první dva modely něco zanechaly na stole
Prostřednictvím CLI od NVIDIA, zde zobrazeného, nebo typu politiky
grootod LeRobot. NVIDIA doporučuje 40 GB nebo více VRAM pro jemné doladění, 16 GB pro inferenci. Při OOM viz stránka OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dva způsoby, jak spustit tento screeningový průchod
Tři prostředí, protože sady nástrojů neexistují souběžně. LeRobot na main je 0.6.2 a vyžaduje Python 3.12 nebo novější; Isaac-GR00T a openpi jsou samostatná úložiště spravovaná uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fixuje
torchcodec0.8.0 jako svůj jediný video backend, vyžadující FFmpeg 4 až 7. FFmpeg 8 není podporován, AV1 není zaručen. - Minimální požadavky na paměť openpi: inference nad 8 GB, LoRA nad 22.5 GB, plné jemné doladění nad 70 GB. Ten poslední je důvod, proč je Pi0.5 úlohou pro A100.
- Pronajměte si GPU sami, poté ji zničte, ručně srovnejte tři sady cest k checkpointům.
Stejných pět modelů, jeden formulář. Vyberte model, dataset a hyperparametry; backend pronajme GPU dimenzovanou podle požadované VRAM, spustí trénink a zapíše checkpoints do objektového úložiště.
- Tréninková matice obsahuje pět modelů pro čtyři ramena, každá buňka je průvodcem: SmolVLA na SO-100, ACT na SO-101.
- Inference pody jsou automaticky zřizovány pomocí
/api/inference/pods hlídačem nečinnosti, takže zapomenutý pod nebude tiše účtován. - Základní checkpointy jsou vlastní dodavatelům:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT žádné nemá. - Stejné operace z CLI a od AI agentů prostřednictvím serveru MCP.
- Nemáte hardware? Živé rameno streamuje fyzické SO-100 bez registrace; stránka vyzkoušení ukazuje možnosti.
Základní model nebo od nuly
Skutečná volba není, který 3B model vybrat. Jde o to, zda vůbec použít předtrénovaný VLA, vzhledem k tomu, že ACT se naučil šest skutečných bimanálních úloh z přibližně deseti minut demonstrací každá, s 80 M parametry a bez jakéhokoli předtrénování.
- Jazykové podmínění. ACT žádné nemá; jeden checkpoint ACT provádí jednu úlohu.
- Lepší na objektech chybějících ve vašich demonstracích: na SO-101, 50% oproti 40% ACT mimo distribuci.
- Vůbec multi-task: SmolVLA dosahuje 78,3% napříč třemi úlohami SO-100 s jedním checkpointem; ACT byl spuštěn pouze jako single-task.
- 7.6x až 24x vyšší latence: 152 až 485 ms na akční krok oproti 20 ms u ACT.
- 4 až 12 USD za běh namísto 1 až 3, a úroveň A100 namísto jakékoli 24 GB karty.
- Riziko licencí, plus režim selhání s omezeným repozitářem, který od nuly neexistuje.
- Předtrénované váhy mohou maskovat špatný datový soubor. Jemné doladění, které částečně funguje na poškozených datech, stojí týden, než se na data podíváte.
Případ reprodukce starého běhu
Snaha o dosažení checkpointu z roku 2025 za vás vyřeší výběr modelu a změní problém na fixaci verze: aktuální LeRobot odmítá N1.5, takže fixujete lerobot==0.5.1. Bez pole pro seed a s 5 až 6 procentní variabilitou mezi běhy je reprodukce z podstaty přibližná. Průvodce N1.5 na SO-100 a stránka zásad N1.5 mají platformní stranu.

Zůstaly dva? ACT proti GR00T N1.7 a GR00T N1.7 proti SmolVLA. Nezpracované řádky jsou v záznamech arény: GR00T N1.7, Pi0.5, SmolVLA a ACT.
Kde vám tato platforma nepomůže
- Nemůže zrychlit vzdálenou inferenci. Smyčka 20 to 485 ms patří modelu; internetové odezvy k tomu přispívají.
- Nemůže doladit GR00T nebo Pi0.5 na vašem vlastním hardwaru. Oba jsou zde pouze cloudové; lokálně běží pouze SmolVLA a ACT.
- Nemůže opravit datovou sadu. Ztráta klesá, ale politika nic nedělá je problém s daty, politika, která funguje pouze v jednom nastavení je problém s pokrytím.
- Nemůže zajistit reprodukovatelnost běhů GR00T: upstream konfigurace nemá pole pro seed.
85 modelů, 332 výsledků benchmarků, každé číslo s odkazem na svůj zdroj
Seřaditelná verze tabulek na této stránce: 85 vizuálně-jazykově-akčních modelů, 332 výsledků benchmarků, každý s odkazem na svůj článek nebo modelovou kartu.
Otevřít arénuVybrat si jeden a pokračovat
Jeden výchozí stav: zaznamenejte 50 epizod, trénujte ACT za 1 až 3 USD k ověření datové sady, poté SmolVLA na stejných datech. Dohromady pod 6 USD a odpoví na důležitou otázku: zda zde pomáhá předtrénování, nebo zda je úzkým hrdlem data. Eskalujte na GR00T N1.7 pro vícestupňové úlohy s bohatým kontaktem, na Pi0.5, když se scéna mění.
Prohlídka platformy: natrénujte svou první politiku, poté spusťte svou první politiku. dokumentace k trénování a dokumentace k datovým sadám pokrývají formu a formát; stránka SO-100 a kompletní průvodce SO-100 pokrývají sestavení a kalibraci. Pozadí: přehled VLA a článek o Pi0 flow-matching. Ten, který posune vaši úspěšnost, je průvodce kvalitou dat.
Kterou VLA politiku bych měl trénovat jako první na SO-100?▾
ACT, pak SmolVLA. ACT trénuje od začátku, takže nemůže maskovat špatný datový soubor, a jeden běh stojí 1 to 3 USD na 24 GB kartě. Pokud ACT úkol vůbec zvládne, 4 to 12 USD za běh GR00T N1.7 nebo Pi0.5 není promarněno.
Je GR00T N1.7 skutečně lepší než Pi0.5?▾
Na LIBERO jsou v rámci šumu: 97.0% napříč čtyřmi sadami pro GR00T N1.7, 96.85% pro Pi0.5 při 30k krocích v openpi, 97.5% pro port LeRobot, vše z různých testovacích prostředí. Skutečné rozdíly jsou 152 ms na akční krok oproti 485 ms, datové sady v2.1 oproti v3.0 a přesnost benchmarku oproti generalizaci v otevřeném světě.
Mohu některý z nich doladit na jedné RTX 4090?▾
SmolVLA a ACT, ano; oba jsou uvedeny pro RTX 4090 nebo jakoukoli 24 GB kartu a běží lokálně. GR00T N1.7, N1.5 a Pi0.5 potřebují A100 nebo H100 80 GB a jsou zde pouze cloudové. NVIDIA doporučuje 40 GB nebo více pro doladění GR00T; spodní hranice openpi je nad 70 GB pro plné doladění Pi0.5, 22.5 GB pro LoRA.
Který z těchto pěti mohu použít komerčně?▾
Váhy GR00T N1.7 jsou pod licencí NVIDIA Open Model License Agreement, která podle karty pokrývá komerční použití. Váhy N1.5 jsou nekomerční. Kód SmolVLA je Apache 2.0 v LeRobot, ale karta lerobot/smolvla_base neobsahuje pole licence, takže váhy nejsou uvedeny. ACT nemá žádné základní váhy k licencování. Pi0.5 je nejednoznačný: dokumentace LeRobot uvádí Apache 2.0, jeho metadata karty uvádí license: gemma.
Sources
- Repozitář NVIDIA Isaac-GR00T: stav GA, změny z N1.6 na N1.7, hardwarové požadavky, omezení torchcodec a FFmpeg, launch_finetune.py, variabilita mezi spuštěními
- Karta modelu nvidia/GR00T-N1.7-3B: páteř Cosmos-Reason2-2B, 3 B parametry, tabulka časování inference, NVIDIA Open Model License, pole Model Version
- Karta modelu nvidia/GR00T-N1.5-3B: reference Eagle 2, SigLip2 a T5, flow matching DiT, jednosměrná nekomerční licence
- Příklad Isaac-GR00T LIBERO: míra úspěšnosti pro každou sadu při 20K krocích a velikosti dávky 640, 200 pokusů na sadu
- Příklad Isaac-GR00T SimplerEnv: míra úspěšnosti Bridge a Fractal pro každý úkol, GR00T N1.6 proti N1.7
- pi0.5: model Vision-Language-Action s generalizací v otevřeném světě (2 B VLM plus 300 M akční expert, 50 Hz řízení, přibližně 400 hodin mobilní manipulace, studie škálování přes 3 až 104 lokací)
- Repozitář openpi: minimální požadavky na paměť GPU, rozsah pouze pro flow-matching-head a výsledky Pi0.5 LIBERO v examples/libero
- Karta modelu lerobot/pi05_base: rozsah portu LeRobot, metadata license: gemma, použití lerobot-train
- Dokumentace LeRobot pi0.5: gated PaliGemma tokenizer, reprodukční tabulka LIBERO, n_action_steps fallback trap, prohlášení Apache 2.0
- SmolVLA: model Vision-Language-Action pro cenově dostupnou a efektivní robotiku (450 M parametrů, tabulky LIBERO a Meta-World, výsledky SO-100 a SO-101, asynchronní inference)
- Dokumentace LeRobot SmolVLA: 50 epizod napříč 5 pozicemi proti 25, 20k kroků za přibližně 4 hodiny na A100
- Učení jemnozrnné bimanipulace s nízkonákladovým hardwarem (ACT a ALOHA): 6 úkolů s 80-90 procenty, ablace velikosti bloku od k=1 do k=100
- LeRobot 0.6.2: výchozí nastavení ACTConfig a SmolVLAConfig, výchozí seed 1000, --accelerator.gradient_accumulation.steps, požadavek Python 3.12, Apache 2.0
- Dokumentace LeRobot GR00T: typ politiky groot, podpora N1.5 odstraněna, pin lerobot==0.5.1, příklad velikosti bloku SO-101
- Karta modelu lerobot/smolvla_base: základní kontrolní bod SmolVLA použitý --policy.path a jeho metadata karty, která neobsahují pole licence
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started