Az AY-Robots irányelvek összehasonlító táblázata, amely GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT modelleket mutat be egymás mellett paraméterszámokkal, GPU szinttel, inferencia késleltetéssel és minimális epizódszámokkal
vla-modellekirányelv-betanításmodellválasztáslerobotso-100

Melyik VLA irányelvet érdemes betanítani 2026-ban?

AY-Robots ResearchAugust 23, 202618 perc olvasás

GR00T N1.7, Pi0.5, SmolVLA, ACT vagy GR00T N1.5? Egy döntési táblázat valós helyzetekhez igazítva, a közzétett benchmark számokkal, késleltetéssel, futásonkénti költséggel és az egyes választások mögötti licencekkel.

Öt irányelv képezhető ki ma egy SO-100 osztályú karon. Ezek 24-szeres eltérést mutatnak a következtetési késleltetésben, 37-szereset a paraméterek számában és 12-szereset a futtatás költségében, valamint abban, hogy szállítható-e az eredmény. Öt modellkártya nem fogja eldönteni: egyik sem válaszolja meg azt a kérdést, ami Önt érdekli, melyiket futtassam először?

Minden alábbi számot a tanulmányokból, repókból és kártyákból olvastunk ki 2026 augusztusában. A platformszámok a AY-Robots irányelv katalógusából; ahol a kettő eltér, mindkettő látható.

A rövid változat

  • Képezze ki először az ACT-t, ha kétségei vannak az adatkészletével kapcsolatban: 1-3 USD futtatásonként, nincs előre betanított modell a rossz adatok elfedésére.
  • A GR00T N1.7 és a Pi0.5 fél ponton belül van a LIBERO-n, 97.0 szemben 96.85-97.5-tel. Ez nem ok arra, hogy bármelyiket is válassza.
  • A Pi0.5 a generalizációra fókuszál, nem a pontosságra, és a leglassabb 485 ms-mal.
  • A SmolVLA, 450 M paraméterrel, az egyetlen VLA itt, amely egyetlen 24 GB-os kártyán finomhangolható.
  • Az ACT 20 ms-mal az egyetlen opció a gyors reaktív mozgáshoz. A licencek döntenek a többiről.

A döntési táblázat

Az Ön helyzeteEzt tanítsaMiért
Adatkészlet minősége nem bizonyítottACTEgyetlen előre betanított modell sem rejti el a hibás adatkészletet, és a kudarc 1-3 USD-be kerül.
Érintésgazdag, többlépéses, nyelvi alapúGR00T N1.797,0% négy LIBERO csomagban, plusz egy relatív végrehajtó-akciótér.
Gyors reaktív mozgás, következtetés a szervóknálACT20 ms. A következő leggyorsabb 7,6-szor lassabb.
Új tárgyak, új jelenet, nyílt világPi0.5Eloszlásból kilógó viselkedésre épült, akár 104 helyszínen.
Egy 24 GB-os kártya, mégis nyelvet szeretneSmolVLA450 millió paraméter, 30 epizódos minimum, helyben fut.
Egy 2025-ben rögzített futtatás reprodukálásaGR00T N1.5Csak ha muszáj: a LeRobot most már elutasítja, a súlyok nem kereskedelmi célúak.
Ez termékként kerül forgalombaN1.7, SmolVLA or ACTAz N1.5 nem kereskedelmi célú, a Pi0.5 Gemma feltételeket tartalmaz, a SmolVLA kártyája nem említ ilyet.

Az öt jelölt

Mind az öt irányelv: kamera képkockák, ízületi pozíciók és, négyük esetében egy nyelvi utasítás, amely a jövőbeli ízületi célok egy részéhez van rendelve. Ami megkülönbözteti őket, az az, hogy mennyi volt megtanulva, mielőtt megérkezett.

IrányelvParaméterekKésleltetésGPU szintHelyi?Min. epizódokFormátumKöltség
ACT~80 M20 ms24 GB cardigen50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardigen30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBnem50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBnem50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBnem50v3.04 to 12 USD

GR00T N1.7

Az NVIDIA jelenlegi látás-nyelv-akció modellje, körülbelül 3 milliárd paraméterrel, melyből nagyjából 40 millió lett betanítva a finomhangolás során. A repóban szerepelnek az N1.6-hoz képesti eltérések: a gerinc egy szállítói Eagle modellről Cosmos-Reason2-2B-re változott Qwen3-VL-en, diffúziós rétegek 32-ről 16-ra, állapot- és akciódimenziók 29-ről 132-re, akcióhorizont 16-ról 40-re.

Ami egy kis kar esetében számít, az a relatív végrehajtó akciótér: az N1.7 a jelenlegi pózból származó deltákat jósolja, ami lehetővé teszi 20 ezer órányi EgoScale emberi videó átvitelét egy robot irányelvbe. A specifikáció az N1.7 oldalon, az eljárás pedig az N1.7 az SO-100-on útmutatóban.

GA a repóban, EA a modellkártyán

Az Isaac-GR00T README az N1.7-et egy általánosan elérhető kiadásnak nyilvánítja, teljesítménytesztekkel és támogatással. A Hugging Face kártyája még nem frissült: a Model Version mező továbbra is GR00T N1.7 EA. A repó a frissebb dokumentum.

GR00T N1.5

Ugyanaz a 3 B skála, Eagle 2 gerinc, SigLip2 és T5, flow-matching DiT fej. Arra szolgál, hogy kiterjessze egy amit már birtokolsz. Két dolog miatt nem jó alapértelmezett választás: a súlyok NVIDIA egyirányú, nem kereskedelmi licencét hordozzák, és a jelenlegi LeRobot kiadások eltávolították az N1.5 támogatását. Lásd .

Pi0.5

Physical Intelligence VLA-ja, házirend típusa pi05. A tanulmány egy 2 B VLM-et mutat be, amely PaliGemma-ból inicializált, plusz egy 300 M akció szakértővel, amely 50 Hz-en vezérli a robotot; A LeRobot pi05 konfigurációja alapértelmezetten egy 50 lépéses darabot használ, ami ezen a sebességen egy másodpercet jelent. Az értékesítési pont az ismeretlen helyek: körülbelül 400 órányi mobil manipuláció valós otthonokban, és egy skálázási tanulmány 3, 12, 22, 53, 82 és 104 helyszínen, ahol a 104 helyszínes modell megegyezett a tesztotthonokon képzett vezérléssel.

Egy korlát, amely a lerobot/pi05_base kártyán szerepel: a port csak az áramlás-illesztő akciófejet hordozza. Az alfeladat-előrejelzés, az akció-tokenizálás és az RL nem került kiadásra upstream, és az openpi ugyanezt állítja a saját tárolójáról. A Pi0.5 oldal és a Pi0.5 SO-100 útmutató tartalmazza a többit.

A csapda, ami elvisz egy délutánt: zárt tárolók

A Pi0.5-nek szüksége van a zárt google/paligemma-3b-pt-224 tokenizálóra (gated: manual, bár a Google szerint a kéréseket azonnal feldolgozzák). Anélkül, hogy elfogadnánk és futtatnánk a hf auth login parancsot a képzési környezetben, a feladat elindul, egy ideig letölt, majd egy olyan hitelesítési hibával leáll, ami hálózati hibának tűnik. A nvidia/GR00T-N1.7-3B nincs lezárva, de a nvidia/Cosmos-Reason2-2B gerince igen (gated: auto). Tisztítsa meg mindkettőt a sorba állítás előtt; ha egy futás tétlenül áll, az elakadt sor oldal felsorolja, mit kell ellenőrizni.

SmolVLA

450 M paraméter, ebből körülbelül 100 M az akció-szakértőben, SmolVLM-2-n, a VLM befagyasztva és csak az első 16 nyelvi modell rétegét használva. Az előképzés közösségi adatokból történt: 481 adatkészlet, 10.6 M képkocka, ugyanazokból a olcsó karokból, amiket Ön is használ. Az egyetlen VLA itt, ami elfér egy 24 GB-os kártyán, és az egyetlen 30 epizód alsó határ. Lásd a SmolVLA oldalt.

ACT

Nem alapmodell. Az ALOHA Action Chunking Transformerje körülbelül 80 millió paraméterrel rendelkezik, és feladatonként a nulláról lett betanítva, 50 demonstráció alapján 50 Hz-en. A tanulmány hat valós kétkezes feladatot ír le, mindegyikhez körülbelül tíz percnyi demonstrációval, 80-90 százalékos sikerrel a kiemelt példákon. Az ötlete, akció darabolás, minden modellen megtalálható ezen az oldalon, és az ablációs vizsgálata még mindig a hatást méri a legjobban: két szimulált feladatnál, kikapcsolt időbeli együttes alkalmazás (temporal ensembling) mellett, a siker 1 százalékról (k=1) 44 százalékra (k=100) nő. Az ACT oldal tartalmazza a többit.

Amit a benchmarkok valójában mondanak

A LIBERO az az egyetlen benchmark, amelyről ezen öt közül három beszámol: nyelvi feltételekhez kötött feladatok egy szimulált Franka Pandán, az alábbi négy csomagra osztva, tíz feladattal mindegyikben. Az NVIDIA 200 próbát futtatott csomagonként.

ModellTérbeliObjektumCél10 (Long)Átlag
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Ezek a sorok nem szigorúan összehasonlíthatók

Minden szám különböző tesztkörnyezetből és költségvetésből származik. A GR00T 20K lépést futott globális batch 640-nel; az openpi adat egy 30K-s ellenőrzőpont; a LeRobot port 6K lépést adott egy LIBERO alapmodellhez. A SmolVLA további eltérést mutat: a tanulmánya azt a sort a LIBERO-n a nulláról képzi, VLA előképzés nélkül, míg a felette lévő három előképzett ellenőrzőpontokat finomhangol. Kezelje a 96.85 és 97.5 közötti tartományt egy klaszterként, és a 87.3%-ig tartó különbséget valósnak, de 6.7-szeres paraméterköltséggel megvásároltnak.

A SimplerEnv mutatja a szóródást, amit a LIBERO nem. Az NVIDIA az N1.7-et az N1.6-hoz hasonlítja, ami a legközelebbi nyilvános dolog egy generációs deltához.

SimplerEnv csomagN1.6 átlagN1.7 átlagLegjobb ingadozásLegrosszabb ingadozás
Bridge (WidowX), 7 feladat56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 feladat52.0%72.5%open_drawer 0.0 to 65.0nincs, minden feladat javult

A Bridge sor a hasznos: átlagosan 5,7 pontot szerzett, míg a put_eggplant_in_basket 36-ot vesztett, és a put_eggplant_in_sink 33-ról 2-re esett. Egy új generáció inkább eltolja az eloszlást, mint felemelné, így ha a feladata ott van, ahol az N1.7 visszaesett, az átlag semmit sem mond.

Az AY-Robots aréna ranglistája, egy rendezhető táblázat 85 látás-nyelv-akció modellről 332 benchmark eredménnyel, minden érték a tanulmányra vagy modellkártyára hivatkozik, ahonnan származik
Az aréna 85 VLA modellt és 332 benchmark eredményt tartalmaz, mindegyik visszavezethető a saját tanulmányára vagy modellkártyájára. Hasznos annak ellenőrzésére, hogy egy blogbejegyzésben idézett szám valós-e.

Az ötből csak a SmolVLA tanulmány számol be SO-100 osztályú karról: 78,3 százalék a SmolVLA és 61,7 a Pi0 számára három feladaton keresztül, mindkettő többfeladatos, szemben az ACT egyfeladatos képzésével, ami nem összehasonlítható. A tiszta párosítás mindkettő egyfeladatos az SO-101 pick-and-place feladaton: 90 a 70 ellen az eloszlásban, 50 a 40 ellen azon kívül. Hasonlítsa össze itt: ACT a SmolVLA ellen és Pi0.5 a SmolVLA ellen, vagy böngéssze az arénát.

A késleltetés és a költség dönti el a telepítést

Inferenciakésleltetés az a korlát, amit az emberek utoljára fedeznek fel és először bánnak meg. Egy irányelv, amely öt ponttal jobb egy benchmarkon, de fél másodpercet igényel akciónként, rosszabbul néz ki az asztalán: az érintkezési dinamika nem vár.

Egy megjegyzés: a GR00T adat nem egyezik az NVIDIA kártyájával, amely 4 zajszűrő lépést és egy kamerát 85.8 ms alatt mér H100-on eager módban, 48.6 ms-ot torch.compile-lal, 27.9 ms-ot teljes TensorRT-vel. Az itt szereplő 152 ms egy teljes stackre vonatkozó adat, amely tartalmazza a kiszolgálási többletköltséget és több kamerát, nem pedig egy előremenő passz.

A távoli inferencia kemény korlátokkal rendelkezik

A 20-485 ms-os ciklus a modellé, és a nyilvános internetes oda-vissza utak hozzáadódnak ehhez. A távoli inferencia lassú pick-and-place feladatokhoz életképes, de nem gyors reaktív mozgáshoz. Ha a feladata sebességet igényel, az inferencia a szervók mellett helyezkedik el: ACT vagy SmolVLA, helyben. Kapcsolódó: az irányelv mozgás közben lefagy.

Egy módja annak, hogy időt nyerjünk a modell megváltoztatása nélkül: a SmolVLA tanulmány szinkron végrehajtást mér, ahol az irányelv befejez egy darabot, mielőtt a következőt előrejelezné, szemben az aszinkronnal, ahol az előrejelzés átfedi a végrehajtást. A siker hasonló, 78.3 a 73.3 ellenében, de ugyanaz a pick-and-place 9.7 másodpercet vesz igénybe 13.75 helyett, és egy rögzített időablakban a robot 19 ciklust hajt végre 9 helyett.

Licencek, ellenőrizve, mert senki sem ellenőrzi őket

ModellSúlyok licenceKód licenceKereskedelmi használat
GR00T N1.7NVIDIA Open Model License; a kártya engedélyezi a kereskedelmi használatotApache 2.0igen
GR00T N1.5NVIDIA egyirányú, nem kereskedelmi licencApache 2.0nem
Pi0.5pi05_base kártya metaadatai szerint a licenc: gemmaApache 2.0 (openpi, LeRobot dokumentáció)olvassa el mindkettőt, nem egyeznek
SmolVLAnincs licenc mező a smolvla_base kártyánApache 2.0 (LeRobot)kód igen, súlyok megjelöletlenek
ACTnincsenek alap súlyokApache 2.0 (LeRobot)igen

A Pi0.5 sorra oda kell figyelni. A LeRobot pi05 dokumentációja Apache 2.0 licencet említ, ami összhangban van az openpi-vel, míg a Hub kártya a lerobot/pi05_base tartalmazza a license: gemma. Mindkettő érvényben van. A GR00T N1.7 egy enyhébb verzióval rendelkezik: az Isaac-GR00T README mellékesen megjegyzi, hogy az N1.7 teljes mértékben kereskedelmi célra licencelhető Apache 2.0 alatt, míg a saját licencszekciója és a modellkártya csak a kódot helyezi Apache 2.0 alá, a súlyokat pedig az NVIDIA Open Model License.

Az alapértelmezések, amiket ténylegesen futtatni fog

Minden tréner űrlap alapértelmezettet szállít, és ezek nem önkényesek. Az ACT-k a LeRobot sajátjai: batch 8, lr 1e-5, 100000 képzési lépések, chunk méret 100, illeszkedve az ACTConfig upstreamhez és k=100 from the ACT paper. Az alábbi egyik oszlop csapda.

SzabályzatBatchLRMax lépésekGrad accumAlkalmazható?Extra beállítások
GR00T N1.7321e-4200001igensaveSteps
GR00T N1.511e-5200016igensaveSteps
Pi0.515e-53000016nem (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008nemseed, logFreq
ACT81e-51000001nemchunkSize, nActionSteps, seed, logFreq
Reprodukálhatóság, dátum: 2026. augusztus

A GR00T finomhangolási belépési pontja (launch_finetune.py, egy tyro CLI) nincs seed mező a konfigurációs adatosztályában, így a futtatások nem bitről bitre reprodukálhatók. A tároló figyelmeztet továbbá 5-6 százalékos eltérésre a futtatások között a nem determinisztikus képaugmentációk miatt, ami nagyobb, mint a legtöbb online vitatott benchmark különbség. A LeRobot alapértelmezett seedje 1000. A grad-accum oszlop a következőket írja le: lerobot 0.5.1; az upstream 0.6.2 a következőképpen teszi elérhetővé: --accelerator.gradient_accumulation.steps.

Az a beállítás, ami jobban számít, mint a modellválasztás

Ez az akció-darab. A hosszabb darabok simább mozgást és kevesebb halmozódó hibát eredményeznek, de a házirend elkötelezett, amíg a blokk végrehajtódik, így későn reagál minden mozgó dologra: magabiztos egy statikus kockán, reménytelen egy gurulón. Ha túllő, a végrehajtott rész rövidítése jobb, mint az újratanítás és ingyenes. Egy korán megálló ízület más probléma; lásd .

  • ACT: Az ACTConfig alapértelmezett értéke chunk_size 100 és n_action_steps 100. Az időbeli együttes alkalmazás ki van kapcsolva, és megköveteli a n_action_steps 1.
  • GR00T N1.7: A belső horizont 16-ról 40-re nőtt, mégis a LeRobot SO-101 példája továbbra is futtatja a --policy.chunk_size=16 --policy.n_action_steps=16. A rollout flag átnevezésre került --execution-horizon.
  • Pi0.5: Egy 50 lépéses darab, amelyből a LeRobot LIBERO receptje 10-et hajt végre a --policy.n_action_steps=10 segítségével; a --policy.pretrained_path esetén visszatér 50-re, ha kihagyja a flaget.
  • SmolVLA: 50 akcióból álló darabok, mindkét szabályzó elérhető.

Hogyan szűrjük le mind az ötöt egy délután alatt

A legolcsóbb válasz nem több olvasás. Költsön körülbelül 15 USD-t, és hagyja, hogy a kar megmondja: rögzítsen egyszer, képezze be először az olcsó modellt, majd fokozza, miután az adatok megbízhatónak bizonyultak. A struktúra felülmúlja a mennyiséget, ez a lényege a és a .

  1. 1
    Rögzítsen 50 epizódot egyszer

    Az ötven epizód előkészíti a terepet a GR00T, Pi0.5 és ACT, valamint a SmolVLA 30 epizódjának. Ismételje meg az egyes variációkat ahelyett, hogy szétterítené: 50 epizód 5 kockapozícióban, ahol 25 nem történt meg. Lásd: az első adatkészlet rögzítése.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Először az ACT-t tanítsa be, mert az nem hazudhat Önnek

    Nincsenek előre betanított súlyok, így ha egyáltalán elvégzi a feladatot, az adatkészlete tartalmazza a feladatot. Ha az ACT nem mutat fejlődést, javítsa az adatokat. 1-3 USD, 2-5 óra egy 24 GB-os kártyán.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Futtassa a SmolVLA-t ugyanazon az adatkészleten, változatlanul

    Ugyanazok az adatok, ugyanaz a kar, 450 M paraméter 80 M helyett, plusz nyelvi kondicionálás. A LeRobot egy 20K lépéses futtatást nagyjából 4 órára becsül egy A100-ason. Ez az, ami megmondja, hogy az előzetes betanítás hoz-e bármilyen előnyt.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Konvertálja vissza v2.1-re, mielőtt a GR00T-hez nyúlna

    A GR00T a LeRobot v2 formátum egy változatát olvassa, plusz egy extra meta/modality.json fájlt, amely leképezi, hogyan oszlanak el az összefűzött állapot- és akciótömbök elnevezett mezőkre. Egy v3.0 adatkészlet összeomlasztja ezt a betöltőt, mert a v3.0 sok epizódot közös fájlokba csomagol, míg a v2 epizódonként egyet írt. Az Isaac-GR00T a visszaminősítő segédprogramot scripts/lerobot_conversion/convert_v3_to_v2.py néven szállítja; a v3 elutasítási oldal a gyorsabb út.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Csak akkor lépjen fel a GR00T N1.7-re, ha az első kettő hagyott még lehetőséget

    Az itt látható NVIDIA CLI-n keresztül, vagy a LeRobot groot policy típusával. Az NVIDIA 40 GB vagy több VRAM-ot aján finomhangoláshoz, 16 GB-ot következtetéshez. OOM esetén lásd: az OOM oldal.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Két módja van ennek a szűrővizsgálatnak a futtatására

Három környezet, mert az eszközláncok nem léteznek együtt. A LeRobot fő ága 0.6.2-es verziójú, és Python 3.12 vagy újabb verziót igényel; az Isaac-GR00T és az openpi különálló, uv által kezelt repók.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • A GR00T a torchcodec 0.8.0-t rögzíti egyetlen videó háttérrendszerként, amelyhez FFmpeg 4-től 7-ig szükséges. Az FFmpeg 8 nem támogatott, az AV1 nem garantált.
  • openpi memóriaigények: következtetéshez 8 GB felett, LoRA-hoz 22.5 GB felett, teljes finomhangoláshoz 70 GB felett. Ez utóbbi az oka annak, hogy a Pi0.5 egy A100-as feladat.
  • Bérelje ki a GPU-t saját maga, utána törölje, és kézzel egyeztesse a három ellenőrzőpont útvonalat.

Alapmodell vagy a nulláról

Az igazi dilemma nem az, hogy melyik 3 B modellt válasszuk. Hanem az, hogy egyáltalán használjunk-e előre betanított VLA-t, tekintettel arra, hogy az ACT hat valós kétkezes feladatot tanult meg, mindegyiket körülbelül tíz percnyi demonstrációból, 80 M paraméterrel és semmi előzetes betanítás nélkül.

Előre betanított VLA finomhangolása az ACT nulláról való betanítása helyett
Mit nyer vele
  • Nyelvi kondicionálás. Az ACT-nek nincs ilyen; egy ACT ellenőrzőpont egy feladatot végez.
  • Jobb a demonstrációkból hiányzó objektumokon: SO-101-en 50% az ACT 40%-ával szemben, eloszlásból kívül eső adatokon.
  • Egyáltalán több feladat: A SmolVLA 78,3%-ot ér el három SO-100 feladaton egy ellenőrzőponttal; az ACT-t csak egyfeladatos módban futtatták.
Mi az ára
  • 7,6-szorostól 24-szeresig terjedő késleltetés: 152-485 ms műveleti lépésenként az ACT 20 ms-ével szemben.
  • 4-12 USD futtatásonként 1-3 helyett, és A100 szint bármely 24 GB-os kártya helyett.
  • Licenckockázat, plusz egy zárt tároló hibamód, ami nulláról indulva nem létezik.
  • Az előre betanított súlyok elfedhetnek egy rossz adatkészletet. Egy félig működő finomhangolás hibás adatokon egy hétbe kerül, mielőtt megnézné az adatokat.

Egy régi futtatás reprodukálásának esete

Egy 2025-ös ellenőrzőpont üldözése eldönti a modellválasztást, és a problémát verziórögzítéssé alakítja: a jelenlegi LeRobot elutasítja az N1.5-öt, ezért rögzíti a lerobot==0.5.1. Mivel nincs seed mező és 5-6 százalékos eltérés van a futtatások között, a reprodukció eleve csak közelítő. és tartalmazzák a platform oldalt.

Az AY-Robots fej-fej melletti összehasonlító oldala a GR00T N1.7 és Pi0.5 modellekhez, amely egymás mellett mutatja a paraméterek számát, a GPU-követelményeket, az inferencia késleltetését, az adathalmaz formátumát és a minimális epizódok számát.
Fej-fej mellett a /compare/groot-n1-7-vs-pi0-5 oldalon. A két 3 B modell felcserélhetőnek tűnik egy specifikációs lapon, de nem azok: az egyik LeRobot v2.1-et, a másik v3.0-t igényel.

Kettőre szűkült a kör? ACT a GR00T N1.7 ellen és GR00T N1.7 a SmolVLA ellen. Nyers adatok találhatók az aréna bejegyzésekben: GR00T N1.7, Pi0.5, SmolVLA és ACT.

Amiben ez a platform nem segít

  • Nem tudja felgyorsítani a távoli inferenciát. A 20-485 ms-os ciklus a modellhez tartozik; az internetes oda-vissza utak hozzáadódnak ehhez.
  • Nem tudja finomhangolni a GR00T vagy Pi0.5 modelleket a saját hardverén. Mindkettő csak felhőben érhető el itt; csak a SmolVLA és az ACT fut helyben.
  • Nem tudja javítani az adathalmazt. A veszteség csökken, de a policy nem csinál semmit adatprobléma, egy policy, ami csak egy beállításban működik lefedettségi probléma.
  • Nem tudja reprodukálhatóvá tenni a GR00T futtatásokat: az upstream konfiguráció nem tartalmaz seed mezőt.

85 modell, 332 benchmark eredmény, minden szám forrásra hivatkozva

Az oldalon található táblázatok rendezhető változata: 85 látás-nyelv-akció modell, 332 benchmark eredmény, mindegyik hivatkozással a saját tanulmányára vagy modellkártyájára.

Nyissa meg az arénát

Válasszon egyet és lépjen tovább

Egy alapértelmezés: rögzítsen 50 epizódot, képezze az ACT-t 1-3 USD-ért az adatkészlet igazolására, majd a SmolVLA-t ugyanazon a ugyanazon adatokon. Együtt kevesebb mint 6 USD, és megválaszolják a fontos kérdést: segít-e itt az előképzés, vagy az adatok jelentik-e a szűk keresztmetszetet. Lépjen fel a GR00T N1.7-re érintésgazdag többlépéses feladatokhoz, a Pi0.5-re, amikor a jelenet változik.

Platform áttekintés: képezze az első irányelvet, majd futtassa az első irányelvet. A képzési dokumentáció és adatkészlet dokumentáció tárgyalja az űrlapot és a formátumot; az SO-100 oldal és a teljes SO-100 útmutató tárgyalja az építést és a kalibrálást. Háttér: a VLA áttekintés és a Pi0 áramlásillesztési cikk. Az, ami növelni fogja a sikerességi rátáját, az az adatminőségi útmutató.

Melyik VLA irányelvet érdemes először betanítanom egy SO-100-on?

ACT, majd SmolVLA. Az ACT a nulláról tanul, így nem tudja elfedni a rossz adatkészletet, és egy futtatás 1-3 USD-be kerül egy 24 GB-os kártyán. Ha az ACT egyáltalán elvégzi a feladatot, akkor a GR00T N1.7 vagy Pi0.5 futtatásáért fizetett 4-12 USD nem vész kárba.

Valóban jobb a GR00T N1.7, mint a Pi0.5?

LIBERO-n belül zajszinten vannak: 97,0% négy csomagban a GR00T N1.7 esetében, 96,85% a Pi0.5 esetében 30k lépésnél az openpi-ben, 97,5% a LeRobot port esetében, mind különböző tesztkörnyezetekből. A valós különbségek 152 ms akció lépésenként 485 ms-hez képest, v2.1 adatkészletek v3.0-hoz képest, és benchmark pontosság a nyílt világú általánosíthatósággal szemben.

Finomhangolhatom bármelyiket egyetlen RTX 4090-en?

SmolVLA és ACT, igen; mindkettő RTX 4090-hez vagy bármely 24 GB-os kártyához van listázva, és helyben futtatható. A GR00T N1.7, N1.5 és Pi0.5 A100 vagy H100 80 GB-ot igényel, és itt csak felhőben érhető el. Az NVIDIA 40 GB-ot vagy többet ajánl a GR00T finomhangolásához; az openpi alsó határa 70 GB felett van egy teljes Pi0.5 finomhangoláshoz, 22,5 GB LoRA-hoz.

Ezek közül melyiket használhatom kereskedelmi célra?

A GR00T N1.7 súlyok az NVIDIA Open Model License Agreement hatálya alá tartoznak, amely a kártya szerint kiterjed a kereskedelmi használatra. Az N1.5 súlyok nem kereskedelmi célúak. A SmolVLA kódja Apache 2.0 a LeRobot-ban, de a lerobot/smolvla_base kártya nem tartalmaz licencmezőt, így a súlyok nincsenek megadva. Az ACT-nek nincsenek alap súlyai licencelésre. A Pi0.5 kétértelmű: a LeRobot dokumentációja Apache 2.0-t említ, a kártya metaadatai pedig license: gemma-t.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started