
GR00T N1.7, Pi0.5, SmolVLA, ACT vagy GR00T N1.5? Egy döntési táblázat valós helyzetekhez igazítva, a közzétett benchmark számokkal, késleltetéssel, futásonkénti költséggel és az egyes választások mögötti licencekkel.
Öt irányelv képezhető ki ma egy SO-100 osztályú karon. Ezek 24-szeres eltérést mutatnak a következtetési késleltetésben, 37-szereset a paraméterek számában és 12-szereset a futtatás költségében, valamint abban, hogy szállítható-e az eredmény. Öt modellkártya nem fogja eldönteni: egyik sem válaszolja meg azt a kérdést, ami Önt érdekli, melyiket futtassam először?
Minden alábbi számot a tanulmányokból, repókból és kártyákból olvastunk ki 2026 augusztusában. A platformszámok a AY-Robots irányelv katalógusából; ahol a kettő eltér, mindkettő látható.
A rövid változat
- •Képezze ki először az ACT-t, ha kétségei vannak az adatkészletével kapcsolatban: 1-3 USD futtatásonként, nincs előre betanított modell a rossz adatok elfedésére.
- •A GR00T N1.7 és a Pi0.5 fél ponton belül van a LIBERO-n, 97.0 szemben 96.85-97.5-tel. Ez nem ok arra, hogy bármelyiket is válassza.
- •A Pi0.5 a generalizációra fókuszál, nem a pontosságra, és a leglassabb 485 ms-mal.
- •A SmolVLA, 450 M paraméterrel, az egyetlen VLA itt, amely egyetlen 24 GB-os kártyán finomhangolható.
- •Az ACT 20 ms-mal az egyetlen opció a gyors reaktív mozgáshoz. A licencek döntenek a többiről.
A döntési táblázat
| Az Ön helyzete | Ezt tanítsa | Miért |
|---|---|---|
| Adatkészlet minősége nem bizonyított | ACT | Egyetlen előre betanított modell sem rejti el a hibás adatkészletet, és a kudarc 1-3 USD-be kerül. |
| Érintésgazdag, többlépéses, nyelvi alapú | GR00T N1.7 | 97,0% négy LIBERO csomagban, plusz egy relatív végrehajtó-akciótér. |
| Gyors reaktív mozgás, következtetés a szervóknál | ACT | 20 ms. A következő leggyorsabb 7,6-szor lassabb. |
| Új tárgyak, új jelenet, nyílt világ | Pi0.5 | Eloszlásból kilógó viselkedésre épült, akár 104 helyszínen. |
| Egy 24 GB-os kártya, mégis nyelvet szeretne | SmolVLA | 450 millió paraméter, 30 epizódos minimum, helyben fut. |
| Egy 2025-ben rögzített futtatás reprodukálása | GR00T N1.5 | Csak ha muszáj: a LeRobot most már elutasítja, a súlyok nem kereskedelmi célúak. |
| Ez termékként kerül forgalomba | N1.7, SmolVLA or ACT | Az N1.5 nem kereskedelmi célú, a Pi0.5 Gemma feltételeket tartalmaz, a SmolVLA kártyája nem említ ilyet. |
Az öt jelölt
Mind az öt irányelv: kamera képkockák, ízületi pozíciók és, négyük esetében egy nyelvi utasítás, amely a jövőbeli ízületi célok egy részéhez van rendelve. Ami megkülönbözteti őket, az az, hogy mennyi volt megtanulva, mielőtt megérkezett.
| Irányelv | Paraméterek | Késleltetés | GPU szint | Helyi? | Min. epizódok | Formátum | Költség |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | igen | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | igen | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | nem | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | nem | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | nem | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Az NVIDIA jelenlegi látás-nyelv-akció modellje, körülbelül 3 milliárd paraméterrel, melyből nagyjából 40 millió lett betanítva a finomhangolás során. A repóban szerepelnek az N1.6-hoz képesti eltérések: a gerinc egy szállítói Eagle modellről Cosmos-Reason2-2B-re változott Qwen3-VL-en, diffúziós rétegek 32-ről 16-ra, állapot- és akciódimenziók 29-ről 132-re, akcióhorizont 16-ról 40-re.
Ami egy kis kar esetében számít, az a relatív végrehajtó akciótér: az N1.7 a jelenlegi pózból származó deltákat jósolja, ami lehetővé teszi 20 ezer órányi EgoScale emberi videó átvitelét egy robot irányelvbe. A specifikáció az N1.7 oldalon, az eljárás pedig az N1.7 az SO-100-on útmutatóban.
Az Isaac-GR00T README az N1.7-et egy általánosan elérhető kiadásnak nyilvánítja, teljesítménytesztekkel és támogatással. A Hugging Face kártyája még nem frissült: a Model Version mező továbbra is GR00T N1.7 EA. A repó a frissebb dokumentum.
GR00T N1.5
Ugyanaz a 3 B skála, Eagle 2 gerinc, SigLip2 és T5, flow-matching DiT fej. Arra szolgál, hogy kiterjessze egy amit már birtokolsz. Két dolog miatt nem jó alapértelmezett választás: a súlyok NVIDIA egyirányú, nem kereskedelmi licencét hordozzák, és a jelenlegi LeRobot kiadások eltávolították az N1.5 támogatását. Lásd .
Pi0.5
Physical Intelligence VLA-ja, házirend típusa pi05. A tanulmány egy 2 B VLM-et mutat be, amely PaliGemma-ból inicializált, plusz egy 300 M akció szakértővel, amely 50 Hz-en vezérli a robotot; A LeRobot pi05 konfigurációja alapértelmezetten egy 50 lépéses darabot használ, ami ezen a sebességen egy másodpercet jelent. Az értékesítési pont az ismeretlen helyek: körülbelül 400 órányi mobil manipuláció valós otthonokban, és egy skálázási tanulmány 3, 12, 22, 53, 82 és 104 helyszínen, ahol a 104 helyszínes modell megegyezett a tesztotthonokon képzett vezérléssel.
Egy korlát, amely a lerobot/pi05_base kártyán szerepel: a port csak az áramlás-illesztő akciófejet hordozza. Az alfeladat-előrejelzés, az akció-tokenizálás és az RL nem került kiadásra upstream, és az openpi ugyanezt állítja a saját tárolójáról. A Pi0.5 oldal és a Pi0.5 SO-100 útmutató tartalmazza a többit.
A Pi0.5-nek szüksége van a zárt google/paligemma-3b-pt-224 tokenizálóra (gated: manual, bár a Google szerint a kéréseket azonnal feldolgozzák). Anélkül, hogy elfogadnánk és futtatnánk a hf auth login parancsot a képzési környezetben, a feladat elindul, egy ideig letölt, majd egy olyan hitelesítési hibával leáll, ami hálózati hibának tűnik. A nvidia/GR00T-N1.7-3B nincs lezárva, de a nvidia/Cosmos-Reason2-2B gerince igen (gated: auto). Tisztítsa meg mindkettőt a sorba állítás előtt; ha egy futás tétlenül áll, az elakadt sor oldal felsorolja, mit kell ellenőrizni.
SmolVLA
450 M paraméter, ebből körülbelül 100 M az akció-szakértőben, SmolVLM-2-n, a VLM befagyasztva és csak az első 16 nyelvi modell rétegét használva. Az előképzés közösségi adatokból történt: 481 adatkészlet, 10.6 M képkocka, ugyanazokból a olcsó karokból, amiket Ön is használ. Az egyetlen VLA itt, ami elfér egy 24 GB-os kártyán, és az egyetlen 30 epizód alsó határ. Lásd a SmolVLA oldalt.
ACT
Nem alapmodell. Az ALOHA Action Chunking Transformerje körülbelül 80 millió paraméterrel rendelkezik, és feladatonként a nulláról lett betanítva, 50 demonstráció alapján 50 Hz-en. A tanulmány hat valós kétkezes feladatot ír le, mindegyikhez körülbelül tíz percnyi demonstrációval, 80-90 százalékos sikerrel a kiemelt példákon. Az ötlete, akció darabolás, minden modellen megtalálható ezen az oldalon, és az ablációs vizsgálata még mindig a hatást méri a legjobban: két szimulált feladatnál, kikapcsolt időbeli együttes alkalmazás (temporal ensembling) mellett, a siker 1 százalékról (k=1) 44 százalékra (k=100) nő. Az ACT oldal tartalmazza a többit.
Amit a benchmarkok valójában mondanak
A LIBERO az az egyetlen benchmark, amelyről ezen öt közül három beszámol: nyelvi feltételekhez kötött feladatok egy szimulált Franka Pandán, az alábbi négy csomagra osztva, tíz feladattal mindegyikben. Az NVIDIA 200 próbát futtatott csomagonként.
| Modell | Térbeli | Objektum | Cél | 10 (Long) | Átlag |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Minden szám különböző tesztkörnyezetből és költségvetésből származik. A GR00T 20K lépést futott globális batch 640-nel; az openpi adat egy 30K-s ellenőrzőpont; a LeRobot port 6K lépést adott egy LIBERO alapmodellhez. A SmolVLA további eltérést mutat: a tanulmánya azt a sort a LIBERO-n a nulláról képzi, VLA előképzés nélkül, míg a felette lévő három előképzett ellenőrzőpontokat finomhangol. Kezelje a 96.85 és 97.5 közötti tartományt egy klaszterként, és a 87.3%-ig tartó különbséget valósnak, de 6.7-szeres paraméterköltséggel megvásároltnak.
A SimplerEnv mutatja a szóródást, amit a LIBERO nem. Az NVIDIA az N1.7-et az N1.6-hoz hasonlítja, ami a legközelebbi nyilvános dolog egy generációs deltához.
| SimplerEnv csomag | N1.6 átlag | N1.7 átlag | Legjobb ingadozás | Legrosszabb ingadozás |
|---|---|---|---|---|
| Bridge (WidowX), 7 feladat | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 feladat | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | nincs, minden feladat javult |
A Bridge sor a hasznos: átlagosan 5,7 pontot szerzett, míg a put_eggplant_in_basket 36-ot vesztett, és a put_eggplant_in_sink 33-ról 2-re esett. Egy új generáció inkább eltolja az eloszlást, mint felemelné, így ha a feladata ott van, ahol az N1.7 visszaesett, az átlag semmit sem mond.

Az ötből csak a SmolVLA tanulmány számol be SO-100 osztályú karról: 78,3 százalék a SmolVLA és 61,7 a Pi0 számára három feladaton keresztül, mindkettő többfeladatos, szemben az ACT egyfeladatos képzésével, ami nem összehasonlítható. A tiszta párosítás mindkettő egyfeladatos az SO-101 pick-and-place feladaton: 90 a 70 ellen az eloszlásban, 50 a 40 ellen azon kívül. Hasonlítsa össze itt: ACT a SmolVLA ellen és Pi0.5 a SmolVLA ellen, vagy böngéssze az arénát.
A késleltetés és a költség dönti el a telepítést
Inferenciakésleltetés az a korlát, amit az emberek utoljára fedeznek fel és először bánnak meg. Egy irányelv, amely öt ponttal jobb egy benchmarkon, de fél másodpercet igényel akciónként, rosszabbul néz ki az asztalán: az érintkezési dinamika nem vár.
Egy megjegyzés: a GR00T adat nem egyezik az NVIDIA kártyájával, amely 4 zajszűrő lépést és egy kamerát 85.8 ms alatt mér H100-on eager módban, 48.6 ms-ot torch.compile-lal, 27.9 ms-ot teljes TensorRT-vel. Az itt szereplő 152 ms egy teljes stackre vonatkozó adat, amely tartalmazza a kiszolgálási többletköltséget és több kamerát, nem pedig egy előremenő passz.
A 20-485 ms-os ciklus a modellé, és a nyilvános internetes oda-vissza utak hozzáadódnak ehhez. A távoli inferencia lassú pick-and-place feladatokhoz életképes, de nem gyors reaktív mozgáshoz. Ha a feladata sebességet igényel, az inferencia a szervók mellett helyezkedik el: ACT vagy SmolVLA, helyben. Kapcsolódó: az irányelv mozgás közben lefagy.
Egy módja annak, hogy időt nyerjünk a modell megváltoztatása nélkül: a SmolVLA tanulmány szinkron végrehajtást mér, ahol az irányelv befejez egy darabot, mielőtt a következőt előrejelezné, szemben az aszinkronnal, ahol az előrejelzés átfedi a végrehajtást. A siker hasonló, 78.3 a 73.3 ellenében, de ugyanaz a pick-and-place 9.7 másodpercet vesz igénybe 13.75 helyett, és egy rögzített időablakban a robot 19 ciklust hajt végre 9 helyett.
Licencek, ellenőrizve, mert senki sem ellenőrzi őket
| Modell | Súlyok licence | Kód licence | Kereskedelmi használat |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; a kártya engedélyezi a kereskedelmi használatot | Apache 2.0 | igen |
| GR00T N1.5 | NVIDIA egyirányú, nem kereskedelmi licenc | Apache 2.0 | nem |
| Pi0.5 | pi05_base kártya metaadatai szerint a licenc: gemma | Apache 2.0 (openpi, LeRobot dokumentáció) | olvassa el mindkettőt, nem egyeznek |
| SmolVLA | nincs licenc mező a smolvla_base kártyán | Apache 2.0 (LeRobot) | kód igen, súlyok megjelöletlenek |
| ACT | nincsenek alap súlyok | Apache 2.0 (LeRobot) | igen |
A Pi0.5 sorra oda kell figyelni. A LeRobot pi05 dokumentációja Apache 2.0 licencet említ, ami összhangban van az openpi-vel, míg a Hub kártya a lerobot/pi05_base tartalmazza a license: gemma. Mindkettő érvényben van. A GR00T N1.7 egy enyhébb verzióval rendelkezik: az Isaac-GR00T README mellékesen megjegyzi, hogy az N1.7 teljes mértékben kereskedelmi célra licencelhető Apache 2.0 alatt, míg a saját licencszekciója és a modellkártya csak a kódot helyezi Apache 2.0 alá, a súlyokat pedig az NVIDIA Open Model License.
Az alapértelmezések, amiket ténylegesen futtatni fog
Minden tréner űrlap alapértelmezettet szállít, és ezek nem önkényesek. Az ACT-k a LeRobot sajátjai: batch 8, lr 1e-5, 100000 képzési lépések, chunk méret 100, illeszkedve az ACTConfig upstreamhez és k=100 from the ACT paper. Az alábbi egyik oszlop csapda.
| Szabályzat | Batch | LR | Max lépések | Grad accum | Alkalmazható? | Extra beállítások |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | igen | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | igen | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nem (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nem | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nem | chunkSize, nActionSteps, seed, logFreq |
A GR00T finomhangolási belépési pontja (launch_finetune.py, egy tyro CLI) nincs seed mező a konfigurációs adatosztályában, így a futtatások nem bitről bitre reprodukálhatók. A tároló figyelmeztet továbbá 5-6 százalékos eltérésre a futtatások között a nem determinisztikus képaugmentációk miatt, ami nagyobb, mint a legtöbb online vitatott benchmark különbség. A LeRobot alapértelmezett seedje 1000. A grad-accum oszlop a következőket írja le: lerobot 0.5.1; az upstream 0.6.2 a következőképpen teszi elérhetővé: --accelerator.gradient_accumulation.steps.
Az a beállítás, ami jobban számít, mint a modellválasztás
Ez az akció-darab. A hosszabb darabok simább mozgást és kevesebb halmozódó hibát eredményeznek, de a házirend elkötelezett, amíg a blokk végrehajtódik, így későn reagál minden mozgó dologra: magabiztos egy statikus kockán, reménytelen egy gurulón. Ha túllő, a végrehajtott rész rövidítése jobb, mint az újratanítás és ingyenes. Egy korán megálló ízület más probléma; lásd .
- ACT: Az ACTConfig alapértelmezett értéke
chunk_size 100ésn_action_steps 100. Az időbeli együttes alkalmazás ki van kapcsolva, és megköveteli an_action_steps 1. - GR00T N1.7: A belső horizont 16-ról 40-re nőtt, mégis a LeRobot SO-101 példája továbbra is futtatja a
--policy.chunk_size=16 --policy.n_action_steps=16. A rollout flag átnevezésre került--execution-horizon. - Pi0.5: Egy 50 lépéses darab, amelyből a LeRobot LIBERO receptje 10-et hajt végre a
--policy.n_action_steps=10segítségével; a--policy.pretrained_pathesetén visszatér 50-re, ha kihagyja a flaget. - SmolVLA: 50 akcióból álló darabok, mindkét szabályzó elérhető.
Hogyan szűrjük le mind az ötöt egy délután alatt
A legolcsóbb válasz nem több olvasás. Költsön körülbelül 15 USD-t, és hagyja, hogy a kar megmondja: rögzítsen egyszer, képezze be először az olcsó modellt, majd fokozza, miután az adatok megbízhatónak bizonyultak. A struktúra felülmúlja a mennyiséget, ez a lényege a és a .
- 1Rögzítsen 50 epizódot egyszer
Az ötven epizód előkészíti a terepet a GR00T, Pi0.5 és ACT, valamint a SmolVLA 30 epizódjának. Ismételje meg az egyes variációkat ahelyett, hogy szétterítené: 50 epizód 5 kockapozícióban, ahol 25 nem történt meg. Lásd: az első adatkészlet rögzítése.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Először az ACT-t tanítsa be, mert az nem hazudhat Önnek
Nincsenek előre betanított súlyok, így ha egyáltalán elvégzi a feladatot, az adatkészlete tartalmazza a feladatot. Ha az ACT nem mutat fejlődést, javítsa az adatokat. 1-3 USD, 2-5 óra egy 24 GB-os kártyán.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Futtassa a SmolVLA-t ugyanazon az adatkészleten, változatlanul
Ugyanazok az adatok, ugyanaz a kar, 450 M paraméter 80 M helyett, plusz nyelvi kondicionálás. A LeRobot egy 20K lépéses futtatást nagyjából 4 órára becsül egy A100-ason. Ez az, ami megmondja, hogy az előzetes betanítás hoz-e bármilyen előnyt.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konvertálja vissza v2.1-re, mielőtt a GR00T-hez nyúlna
A GR00T a LeRobot v2 formátum egy változatát olvassa, plusz egy extra
meta/modality.jsonfájlt, amely leképezi, hogyan oszlanak el az összefűzött állapot- és akciótömbök elnevezett mezőkre. Egy v3.0 adatkészlet összeomlasztja ezt a betöltőt, mert a v3.0 sok epizódot közös fájlokba csomagol, míg a v2 epizódonként egyet írt. Az Isaac-GR00T a visszaminősítő segédprogramotscripts/lerobot_conversion/convert_v3_to_v2.pynéven szállítja; a v3 elutasítási oldal a gyorsabb út.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Csak akkor lépjen fel a GR00T N1.7-re, ha az első kettő hagyott még lehetőséget
Az itt látható NVIDIA CLI-n keresztül, vagy a LeRobot
grootpolicy típusával. Az NVIDIA 40 GB vagy több VRAM-ot aján finomhangoláshoz, 16 GB-ot következtetéshez. OOM esetén lásd: az OOM oldal.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Két módja van ennek a szűrővizsgálatnak a futtatására
Három környezet, mert az eszközláncok nem léteznek együtt. A LeRobot fő ága 0.6.2-es verziójú, és Python 3.12 vagy újabb verziót igényel; az Isaac-GR00T és az openpi különálló, uv által kezelt repók.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- A GR00T a
torchcodec0.8.0-t rögzíti egyetlen videó háttérrendszerként, amelyhez FFmpeg 4-től 7-ig szükséges. Az FFmpeg 8 nem támogatott, az AV1 nem garantált. - openpi memóriaigények: következtetéshez 8 GB felett, LoRA-hoz 22.5 GB felett, teljes finomhangoláshoz 70 GB felett. Ez utóbbi az oka annak, hogy a Pi0.5 egy A100-as feladat.
- Bérelje ki a GPU-t saját maga, utána törölje, és kézzel egyeztesse a három ellenőrzőpont útvonalat.
Ugyanaz az öt modell, egyetlen űrlap. Válassza ki a modellt, az adatkészletet és a hiperparamétereket; a háttérrendszer a szükséges VRAM-nak megfelelő méretű GPU-t bérel, futtatja a betanítót, és ír az objektumtárolóba.
- A betanítási mátrix öt modellből és négy karból áll, minden cella egy útmutató: SmolVLA az SO-100-on, ACT az SO-101-en.
- A következtetési podok automatikusan kiépülnek a
/api/inference/podsegítségével, tétlen figyelővel, így egy elfelejtett pod nem számláz csendben. - Az alap ellenőrzőpontok a gyártók sajátjai:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. Az ACT-nek nincs. - Ugyanazok a műveletek a CLI-ből és AI ügynököktől az MCP szerveren keresztül.
- Nincs hardver? Az élő kar regisztráció nélkül streamel egy fizikai SO-100-at; a kipróbálási oldal mutatja a belépési módokat.
Alapmodell vagy a nulláról
Az igazi dilemma nem az, hogy melyik 3 B modellt válasszuk. Hanem az, hogy egyáltalán használjunk-e előre betanított VLA-t, tekintettel arra, hogy az ACT hat valós kétkezes feladatot tanult meg, mindegyiket körülbelül tíz percnyi demonstrációból, 80 M paraméterrel és semmi előzetes betanítás nélkül.
- Nyelvi kondicionálás. Az ACT-nek nincs ilyen; egy ACT ellenőrzőpont egy feladatot végez.
- Jobb a demonstrációkból hiányzó objektumokon: SO-101-en 50% az ACT 40%-ával szemben, eloszlásból kívül eső adatokon.
- Egyáltalán több feladat: A SmolVLA 78,3%-ot ér el három SO-100 feladaton egy ellenőrzőponttal; az ACT-t csak egyfeladatos módban futtatták.
- 7,6-szorostól 24-szeresig terjedő késleltetés: 152-485 ms műveleti lépésenként az ACT 20 ms-ével szemben.
- 4-12 USD futtatásonként 1-3 helyett, és A100 szint bármely 24 GB-os kártya helyett.
- Licenckockázat, plusz egy zárt tároló hibamód, ami nulláról indulva nem létezik.
- Az előre betanított súlyok elfedhetnek egy rossz adatkészletet. Egy félig működő finomhangolás hibás adatokon egy hétbe kerül, mielőtt megnézné az adatokat.
Egy régi futtatás reprodukálásának esete
Egy 2025-ös ellenőrzőpont üldözése eldönti a modellválasztást, és a problémát verziórögzítéssé alakítja: a jelenlegi LeRobot elutasítja az N1.5-öt, ezért rögzíti a lerobot==0.5.1. Mivel nincs seed mező és 5-6 százalékos eltérés van a futtatások között, a reprodukció eleve csak közelítő. és tartalmazzák a platform oldalt.

Kettőre szűkült a kör? ACT a GR00T N1.7 ellen és GR00T N1.7 a SmolVLA ellen. Nyers adatok találhatók az aréna bejegyzésekben: GR00T N1.7, Pi0.5, SmolVLA és ACT.
Amiben ez a platform nem segít
- Nem tudja felgyorsítani a távoli inferenciát. A 20-485 ms-os ciklus a modellhez tartozik; az internetes oda-vissza utak hozzáadódnak ehhez.
- Nem tudja finomhangolni a GR00T vagy Pi0.5 modelleket a saját hardverén. Mindkettő csak felhőben érhető el itt; csak a SmolVLA és az ACT fut helyben.
- Nem tudja javítani az adathalmazt. A veszteség csökken, de a policy nem csinál semmit adatprobléma, egy policy, ami csak egy beállításban működik lefedettségi probléma.
- Nem tudja reprodukálhatóvá tenni a GR00T futtatásokat: az upstream konfiguráció nem tartalmaz seed mezőt.
85 modell, 332 benchmark eredmény, minden szám forrásra hivatkozva
Az oldalon található táblázatok rendezhető változata: 85 látás-nyelv-akció modell, 332 benchmark eredmény, mindegyik hivatkozással a saját tanulmányára vagy modellkártyájára.
Nyissa meg az arénátVálasszon egyet és lépjen tovább
Egy alapértelmezés: rögzítsen 50 epizódot, képezze az ACT-t 1-3 USD-ért az adatkészlet igazolására, majd a SmolVLA-t ugyanazon a ugyanazon adatokon. Együtt kevesebb mint 6 USD, és megválaszolják a fontos kérdést: segít-e itt az előképzés, vagy az adatok jelentik-e a szűk keresztmetszetet. Lépjen fel a GR00T N1.7-re érintésgazdag többlépéses feladatokhoz, a Pi0.5-re, amikor a jelenet változik.
Platform áttekintés: képezze az első irányelvet, majd futtassa az első irányelvet. A képzési dokumentáció és adatkészlet dokumentáció tárgyalja az űrlapot és a formátumot; az SO-100 oldal és a teljes SO-100 útmutató tárgyalja az építést és a kalibrálást. Háttér: a VLA áttekintés és a Pi0 áramlásillesztési cikk. Az, ami növelni fogja a sikerességi rátáját, az az adatminőségi útmutató.
Melyik VLA irányelvet érdemes először betanítanom egy SO-100-on?▾
ACT, majd SmolVLA. Az ACT a nulláról tanul, így nem tudja elfedni a rossz adatkészletet, és egy futtatás 1-3 USD-be kerül egy 24 GB-os kártyán. Ha az ACT egyáltalán elvégzi a feladatot, akkor a GR00T N1.7 vagy Pi0.5 futtatásáért fizetett 4-12 USD nem vész kárba.
Valóban jobb a GR00T N1.7, mint a Pi0.5?▾
LIBERO-n belül zajszinten vannak: 97,0% négy csomagban a GR00T N1.7 esetében, 96,85% a Pi0.5 esetében 30k lépésnél az openpi-ben, 97,5% a LeRobot port esetében, mind különböző tesztkörnyezetekből. A valós különbségek 152 ms akció lépésenként 485 ms-hez képest, v2.1 adatkészletek v3.0-hoz képest, és benchmark pontosság a nyílt világú általánosíthatósággal szemben.
Finomhangolhatom bármelyiket egyetlen RTX 4090-en?▾
SmolVLA és ACT, igen; mindkettő RTX 4090-hez vagy bármely 24 GB-os kártyához van listázva, és helyben futtatható. A GR00T N1.7, N1.5 és Pi0.5 A100 vagy H100 80 GB-ot igényel, és itt csak felhőben érhető el. Az NVIDIA 40 GB-ot vagy többet ajánl a GR00T finomhangolásához; az openpi alsó határa 70 GB felett van egy teljes Pi0.5 finomhangoláshoz, 22,5 GB LoRA-hoz.
Ezek közül melyiket használhatom kereskedelmi célra?▾
A GR00T N1.7 súlyok az NVIDIA Open Model License Agreement hatálya alá tartoznak, amely a kártya szerint kiterjed a kereskedelmi használatra. Az N1.5 súlyok nem kereskedelmi célúak. A SmolVLA kódja Apache 2.0 a LeRobot-ban, de a lerobot/smolvla_base kártya nem tartalmaz licencmezőt, így a súlyok nincsenek megadva. Az ACT-nek nincsenek alap súlyai licencelésre. A Pi0.5 kétértelmű: a LeRobot dokumentációja Apache 2.0-t említ, a kártya metaadatai pedig license: gemma-t.
Sources
- NVIDIA Isaac-GR00T adattár: GA állapot, N1.6-ról N1.7-re történő változások, hardverkövetelmények, torchcodec és FFmpeg korlátozások, launch_finetune.py, futtatások közötti variancia
- nvidia/GR00T-N1.7-3B modellkártya: Cosmos-Reason2-2B gerinc, 3 B paraméter, következtetési időzítési táblázat, NVIDIA Open Model License, Model Version mező
- nvidia/GR00T-N1.5-3B modellkártya: Eagle 2 referencia, SigLip2 és T5, flow matching DiT, egyirányú nem kereskedelmi licenc
- Isaac-GR00T LIBERO példa: csomagonkénti sikerességi arányok 20K lépésnél és 640-es kötegméretnél, 200 próba csomagonként
- Isaac-GR00T SimplerEnv példa: feladatonkénti Bridge és Fractal sikerességi arányok, GR00T N1.6 a N1.7 ellen
- pi0.5: egy látás-nyelv-akció modell nyílt világú általánosíthatósággal (2 B VLM plusz 300 M akció szakértő, 50 Hz vezérlés, körülbelül 400 óra mobil manipuláció, skálázási tanulmány 3-tól 104 helyszínig)
- openpi adattár: GPU memória alsó határai, csak flow-matching-head hatókör, és a Pi0.5 LIBERO eredmények az examples/libero-ban
- lerobot/pi05_base modellkártya: a LeRobot port hatóköre, license: gemma metaadatok, lerobot-train használat
- LeRobot pi0.5 dokumentáció: gated PaliGemma tokenizáló, LIBERO reprodukciós táblázat, n_action_steps fallback csapda, Apache 2.0 nyilatkozat
- SmolVLA: Egy látás-nyelv-akció modell megfizethető és hatékony robotikához (450 M paraméter, LIBERO és Meta-World táblázatok, SO-100 és SO-101 eredmények, aszinkron következtetés)
- LeRobot SmolVLA dokumentáció: 50 epizód 5 pozícióban 25 ellenében, 20k lépés körülbelül 4 óra alatt egy A100-on
- Finomhangolt kétkezes manipuláció tanulása alacsony költségű hardverrel (ACT és ALOHA): 6 feladat 80-90 százalékos sikerességgel, chunk méret abláció k=1-től k=100-ig
- LeRobot 0.6.2: ACTConfig és SmolVLAConfig alapértelmezések, alapértelmezett seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 követelmény, Apache 2.0
- LeRobot GR00T dokumentáció: policy type groot, N1.5 támogatás eltávolítva, pin lerobot==0.5.1, SO-101 chunk méret példa
- lerobot/smolvla_base modellkártya: a --policy.path által használt SmolVLA alap ellenőrzőpont, és annak kártya metaadatai, amelyek nem tartalmaznak licencmezőt
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started