AY-Robots poliitikate võrdlustabel, mis näitab GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT-d kõrvuti parameetrite arvu, GPU taseme, järeldamise latentsuse ja minimaalsete episoodide arvuga
vla-mudelidpoliitika-treeningmudeli-valiklerobotso-100

Millist VLA poliitikat peaksite 2026. aastal treenima?

AY-Robots ResearchAugust 23, 202618 min lugemist

GR00T N1.7, Pi0.5, SmolVLA, ACT või GR00T N1.5? Otsustustabel, mis on kohandatud reaalsete olukordadega, koos avaldatud võrdlusandmete, latentsuse, käituskulude ja litsentsidega iga valiku taga.

Täna on SO-100 klassi robotkäel treenitavad viis poliitikat. Need erinevad 24-kordselt järeldamise latentsusajas, 37-kordselt parameetrite arvus ja 12-kordselt käituse maksumuses, samuti selles, kas tulemust tohib tarnida. Viis mudelikaarti seda ei lahenda: ükski neist ei vasta teie küsimusele, millist neist peaksin esimesena käitama?

Kõik alltoodud numbrid on loetud paberitest, repositooriumitest ja kaartidelt 2026. aasta augustis. Platvormi numbrid pärinevad AY-Robots poliitikate kataloog; kus need kaks ei kattu, on näidatud mõlemad.

Lühiversioon

  • Treenige ACT-d esimesena, kui kahtlete oma andmestikus: 1 kuni 3 USD käituse kohta, puudub eelnevalt treenitud mudel halbade andmete varjamiseks.
  • GR00T N1.7 ja Pi0.5 jäävad LIBERO-l poole punkti sisse, 97.0 versus 96.85 kuni 97.5. See ei ole põhjus kummagi valimiseks.
  • Pi0.5 on üldistamise, mitte täpsuse valik, ja aeglaseim 485 ms juures.
  • SmolVLA, 450 M parameetriga, on siin ainus VLA, mis peenhäälestub ühel 24 GB kaardil.
  • ACT 20 ms juures on ainus valik kiireks reaktiivseks liikumiseks. Litsentsid otsustavad ülejäänu.

Otsustustabel

Sinu olukordTreeni sedaMiks
Andmestiku kvaliteet tõestamataACTMiski eelnevalt treenitu ei varja rikkis andmestikku ja ebaõnnestumine maksab 1 kuni 3 USD.
Kontaktirikas, mitmeastmeline, keeleliselt tingitudGR00T N1.797,0% nelja LIBERO sviidi ulatuses, pluss suhteline lõppefektori tegevusruum.
Kiire reaktiivne liikumine, järeldamine servodelACT20 ms. Järgmine kiireim on 7,6 korda aeglasem.
Uued objektid, uus stseen, avatud maailmPi0.5Ehitatud jaotusvälise käitumise jaoks, kuni 104 asukohas.
Üks 24 GB kaart, ikka tahad keeltSmolVLA450 M parameetrit, 30 episoodi piir, töötab lokaalselt.
2025. aastal salvestatud käivituse reprodutseerimineGR00T N1.5Ainult kui pead: LeRobot lükkab selle nüüd tagasi, kaalud on mitteärilised.
See tarnitakse tootenaN1.7, SmolVLA or ACTN1.5 on mitteäriline, Pi0.5-l on Gemma tingimused, SmolVLA kaardil pole ühtegi märgitud.

Viis kandidaati

Kõik viis on poliitikad: kaamera kaadrid, liigeste positsioonid ja, nelja puhul keeleline juhis, mis on kaardistatud tulevaste liigeste sihtmärkide plokiks. Mis neid eristab, on see, kui palju oli õpitud enne sinu saabumist.

PoliitikaParameetridLatentsusGPU taseLokaalne?Min episoodidFormaatMaksumus
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA praegune nägemis-keele-tegevuse mudel, umbes 3 miljardit parameetrit, millest ligikaudu 40 miljonit on treenitud peenhäälestuse käigus. Reposatoorium loetleb N1.6-st pärit erinevused: selgroog on muudetud tarnitud Eagle mudelist Cosmos-Reason2-2B-ks Qwen3-VL-il, difusioonikihid 32-lt 16-le, oleku- ja tegevusdimensioonid 29-lt 132-le, tegevushorisont 16-lt 40-le.

Väikese roboti käe puhul on oluline suhteline otsaefektori tegevusruum: N1.7 ennustab erinevusi praegusest asendist, mis võimaldab 20K tundi EgoScale inimvideot üle kanda roboti poliitikasse. Spetsifikatsioon on N1.7 lehel, protseduur on kirjeldatud N1.7 SO-100 juhendis.

GA reposatooriumis, EA mudelikaardil

Isaac-GR00T README kuulutab N1.7 a üldiselt kättesaadavaks väljalaskeks, täielike võrdlusuuringute ja toega. Selle Hugging Face'i kaart ei ole veel ajakohastatud: the Model Version väli näitab endiselt GR00T N1.7 EA. Reposatoorium on uuem dokument.

GR00T N1.5

Sama 3 B skaala, Eagle 2 selgroog, SigLip2 ja T5, voolu sobitamise DiT pea. See on olemas selleks, et laiendada kontrollpunkti mida teil juba on. Kaks asja muudavad selle kehvaks vaikeseadeks: kaalud kannavad NVIDIA ühesuunalist mitteärilist litsentsi ja praegused LeRoboti väljalasked eemaldasid N1.5 toe. Vaata N1.7 versus N1.5.

Pi0.5

Physical Intelligence'i voolu sobitamise VLA, poliitika tüüp pi05. Artikkel kirjeldab 2 B VLM-i, mis on initsialiseeritud PaliGemma-st pluss 300 M tegevusekspert, juhtides robotit 50 Hz juures; LeRoboti pi05 konfiguratsioon vaikimisi kasutab 50-sammulist tükki, üks sekund selle kiirusega. Müügiargument on nägemata kohad: umbes 400 tundi mobiilset manipulatsiooni reaalsetes kodudes ja skaleerimisuuring 3, 12, 22, 53, 82 ja 104 asukoha kohta, kus 104 asukohaga mudel vastas kontrollile, mis oli treenitud testkodudes endis.

Üks piirang, mis on märgitud lerobot/pi05_base kaardil: port edastab ainult voo sobitamise action head. Alamülesannete ennustamine, tegevuste tokeniseerimine ja RL-i ei avaldatud ülesvoolu ning openpi ütleb sama oma hoidla kohta. Pi0.5 leht ja Pi0.5 SO-100 juhend sisaldavad ülejäänut.

Lõks, mis neelab pärastlõuna: piiratud juurdepääsuga hoidlad

Pi0.5 vajab piiratud juurdepääsuga google/paligemma-3b-pt-224 tokeniseerijat (gated: manual, kuigi Google ütleb, et taotlusi töödeldakse koheselt). Ilma seda aktsepteerimata ja hf auth login käivitamata treeningkeskkonnas, töö käivitub, laeb mõnda aega alla, seejärel sureb autoriseerimisvea tõttu, mis näib võrguveana. nvidia/GR00T-N1.7-3B ei ole piiratud juurdepääsuga, kuid selle nvidia/Cosmos-Reason2-2B selgroog on (gated: auto). Tühjendage mõlemad enne järjekorda panemist; kui käivitus jääb jõude, kinni jäänud järjekorra leht loetleb, mida kontrollida.

SmolVLA

450 miljonit parameetrit, umbes 100 miljonit tegevuseksperdis, SmolVLM-2 peal, kus VLM on külmutatud ja kasutatakse ainult selle esimest 16 keelemudeli kihti. Eeltreeninguks kasutati kogukonna andmeid: 481 andmekogumit, 10,6 miljonit kaadrit, samadelt odavatelt robotkäppadelt, mida te kasutate. Ainus VLA siin, mis mahub ühele 24 GB kaardile, ja ainus 30 episoodi piir. Vaata SmolVLA lehte.

ACT

Mitte alusmudel. ALOHA Action Chunking Transformer on umbes 80 miljoni parameetriga mudel, mis on treenitud nullist iga ülesande jaoks, 50 demonstratsiooni põhjal sagedusega 50 Hz. Artikkel kirjeldab kuut reaalset kahekäelist ülesannet, mis põhinevad umbes kümneminutilistel demonstratsioonidel, saavutades 80–90-protsendilise edukuse esiletoodud näidetel. Selle idee, tegevuste tükeldamine, on sellel lehel igas mudelis kasutusel ja selle ablatsioonimõõtmised näitavad endiselt mõju kõige paremini: kahel simuleeritud ülesandel, kus ajaline ansambel oli välja lülitatud, tõusis edukus 1 protsendilt (k=1) 44 protsendini (k=100). ACT lehelon ülejäänu.

Mida võrdlusnäitajad tegelikult ütlevad

LIBERO on ainus võrdlusnäitaja, millest kolm neist viiest aru annavad: keeleliselt tingitud ülesanded simuleeritud Franka Panda robotil, jagatud neljaks allpool toodud komplektiks, milles on kümme ülesannet. NVIDIA viis läbi 200 katset komplekti kohta.

MudelRuumilineObjektEesmärk10 (Pikk)Keskmine
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Need read ei ole rangelt võrreldavad

Iga number pärineb erinevast rakendusest ja eelarvest. GR00T käitas 20K sammu globaalse partii suurusega 640; openpi näitaja on 30K kontrollpunkt; LeRoboti port lisas LIBERO baasmudelile 6K sammu. SmolVLA on veelgi ebakõlaline: selle artikkel treenib seda rida LIBERO-l nullist, ilma VLA eeltreeninguta, samas kui kolm ülaltoodut peenhäälestavad eeltreenitud kontrollpunkte. Käsitlege 96.85 kuni 97.5 ühe klastrina ja vahet 87.3%-ni reaalsena, kuid saavutatud 6.7x parameetritega.

SimplerEnv näitab hajuvust, mida LIBERO ei näita. NVIDIA võrdleb N1.7 N1.6-ga, mis on lähim avalik asi generatsioonilisele deltale.

SimplerEnv sviitN1.6 keskmineN1.7 keskmineParim kõikumineHalvim kõikumine
Bridge (WidowX), 7 ülesannet56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 ülesannet52.0%72.5%open_drawer 0.0 to 65.0puudub, iga ülesanne paranes

Rida Bridge on kasulik: keskmiselt 5,7 punkti võideti, samal ajal kui put_eggplant_in_basket kaotas 36 ja put_eggplant_in_sink langes 33-lt 2-le. Uus põlvkond nihutab jaotust, mitte tõstes seda, nii et kui teie ülesanne asub seal, kus N1.7 taandus, ei ütle keskmine midagi.

AY-Robots areeni edetabel, sorteeritav tabel 85 nägemis-keele-tegevuse mudelist 332 võrdlustulemusega, iga väärtus on lingitud artikli või mudelikaardiga, kust see pärineb
Areenis on 85 VLA mudelit ja 332 võrdlustulemust, millest igaüks on lingitud tagasi oma artikli või mudelikaardi juurde. Kasulik kontrollimaks, kas blogipostituses tsiteeritud number on tõeline.

Viie hulgast teatab ainult SmolVLA artikkel SO-100 klassi käe kohta: 78,3 protsenti SmolVLA-le ja 61,7 Pi0-le kolme ülesande lõikes, mõlemad mitme ülesandega, võrreldes 48,3-ga ACT-le, mis on treenitud ühe ülesandega, mis ei ole võrreldav võrreldavaga. Puhas paardumine on mõlemad ühe ülesandega SO-101 pick-and-place: 90 versus 70 jaotuses, 50 versus 40 väljaspool seda. Võrdle ACT versus SmolVLA ja Pi0.5 versus SmolVLA, või sirvi areeni.

Latentsus ja maksumus otsustavad juurutamise

Järelduse latentsus on piirang, mille inimesed avastavad viimasena ja kahetsevad esimesena. Poliitika, mis on võrdlusalusel viis punkti parem, kuid võtab poole sekundi tegevussammu kohta, näeb teie laual halvem välja: kontaktdünaamika ei oota.

Üks hoiatus: GR00T näitaja ei ühti NVIDIA kaardiga, mis mõõdab 4 müra eemaldamise sammu ja ühe kaamera puhul 85.8 ms H100-l eager režiimis, 48.6 ms torch.compile'iga, 27.9 ms läbi täieliku TensorRT. Siinne 152 ms on kogu süsteemi näitaja koos teeninduse üldkulude ja rohkem kui ühe kaameraga, mitte edasikäik.

Kaugjäreldusel on range ülempiir

20 kuni 485 ms tsükkel on mudeli oma ja avaliku interneti edasi-tagasi reisid lisavad sellele. Kaugjäreldus on teostatav aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks. Kui teie ülesanne vajab kiirust, asub järeldus servode kõrval: ACT või SmolVLA, lokaalselt. Seotud: poliitika hangub liikumise keskel.

Üks viis aega võita mudelit muutmata: SmolVLA paber mõõdab sünkroonset täitmist, kus poliitika lõpetab tüki enne järgmise ennustamist, võrreldes asünkroonsega, kus ennustus kattub täitmisega. Edu on sarnane, 78.3 vs 73.3, kuid sama valimine ja paigutamine võtab 9.7 sekundit 13.75 asemel, ja fikseeritud aknas suudab robot 19 tsüklit 9 asemel.

Litsentsid, kontrollitud, sest keegi ei kontrolli neid

MudelKaalude litsentsKoodi litsentsÄriline kasutus
GR00T N1.7NVIDIA avatud mudeli litsents; kaart lubab ärilist kasutustApache 2.0jah
GR00T N1.5NVIDIA ühesuunaline mitteäriline litsentsApache 2.0ei
Pi0.5pi05_base kaardi metaandmed näitavad litsentsi: gemmaApache 2.0 (openpi, LeRobot docs)lugege mõlemat, need on vastuolus
SmolVLAsmolvla_base kaardil puudub litsentsiväliApache 2.0 (LeRobot)kood jah, kaalud märkimata
ACTbaaskaalusid ei eksisteeriApache 2.0 (LeRobot)jah

Pi0.5 rida vajab tähelepanu. LeRoboti pi05 dokumentatsioon väidab Apache 2.0, mis on kooskõlas openpi-ga, samal ajal kui Hubi kaart lerobot/pi05_base sisaldab license: gemma. Mõlemad on aktiivsed. GR00T N1.7-l on leebem versioon: Isaac-GR00T README märgib möödaminnes, et N1.7 on täielikult äriliselt litsentseeritav Apache 2.0 alusel, samal ajal kui selle enda litsentsiosa ja mudelikaart paigutavad koodi ainult Apache 2.0 alla ja kaalud NVIDIA Open Model License'i alla.

Vaikeseaded, mida te tegelikult käitate

Iga treeneri vormiga on kaasas vaikeseade ja need ei ole meelevaldsed. ACT-i omad on LeRoboti enda omad: partii 8, lr 1e-5, 100000 treeningusammud, tüki suurus 100, mis vastab ACTConfig-ile ülesvoolu ja k=100 ACT-i artiklist. Üks veerg allpool on lõks.

PoliitikaPartiiLRMaksimaalsed sammudGradiendi akumulatsioonKehtib?Lisaseaded
GR00T N1.7321e-4200001jahsaveSteps
GR00T N1.511e-5200016jahsaveSteps
Pi0.515e-53000016ei (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008eiseed, logFreq
ACT81e-51000001eichunkSize, nActionSteps, seed, logFreq
Reprodutseeritavus, kuupäevastatud august 2026

GR00T-i peenhäälestuse sisenemispunktil (launch_finetune.py, tyro CLI) puudub seemnevälja selle konfiguratsiooni andmeklassis, seega ei ole käivitused bitipõhiselt reprodutseeritavad. Hoidla hoiatab ka 5 kuni 6 protsendi varieeruvuse eest käivituste vahel mitteterministlike pilditäienduste tõttu, mis on suurem kui enamik veebis vaieldud võrdlusaluste erinevusi. LeRoboti vaikimisi seeme on 1000. Gradiendi akumulatsiooni veerg kirjeldab lerobot 0.5.1; ülesvoolu 0.6.2 eksponeerib seda kui --accelerator.gradient_accumulation.steps.

Seade, mis loeb rohkem kui mudeli valik

See on tegevuse tükk. Pikemad tükid annavad sujuvama liikumise ja vähem kuhjuvaid vigu, kuid poliitika on pühendunud ploki täitmise ajal, seega reageerib see hilja kõigele, mis liigub: kindel staatilisel kuubikul, lootusetu veereval. Kui see ületab sihtmärgi, on täidetud osa lühendamine parem kui ümberõpe ja on tasuta. Liigend, mis peatub liiga vara, on teine probleem; vaata .

  • ACT: ACTConfig vaikimisi on chunk_size 100 ja n_action_steps 100. Ajaline ansambel on välja lülitatud ja nõuab n_action_steps 1.
  • GR00T N1.7: sisemine horisont kasvas 16-lt 40-le, kuid LeRoboti SO-101 näide töötab endiselt --policy.chunk_size=16 --policy.n_action_steps=16. Väljarullimise lipp nimetati ümber --execution-horizon.
  • Pi0.5: 50-sammuline tükk, millest LeRoboti LIBERO retsept täidab 10 --policy.n_action_steps=10 kaudu; --policy.pretrained_path korral langeb see tagasi 50-le, kui lipu ära jätate.
  • SmolVLA: 50-tegevuse tükid, mõlemad nupud on avatud.

Kuidas kõik viis ühe pärastlõunaga läbi vaadata

Kõige odavam vastus ei ole rohkem lugemist. Kulutage umbes 15 USD ja laske robotkäel endale öelda: salvestage üks kord, treenige esmalt odavat mudelit, eskaleerige, kui see on andmete usaldusväärsust tõestanud. Struktuur võidab mahu, mis on ja .

  1. 1
    Salvesta 50 episoodi korraga

    Viiskümmend episoodi on aluseks GR00T-le, Pi0.5-le ja ACT-le, ning SmolVLA 30-le. Korda iga variatsiooni, selle asemel et laiali valguda: 50 episoodi treeniti viies kuubiku asendis, kus 25 episoodi ei treenitud. Vaata salvesta oma esimene andmestik.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Treeni ACT-d esimesena, sest see ei saa sulle valetada

    Eeltreenitud kaalusid pole, nii et kui see üldse ülesannet täidab, sisaldab teie andmestik ülesannet. Kui ACT ei anna tulemusi, paranda andmed. 1 kuni 3 USD, 2 kuni 5 tundi 24 GB kaardil.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Käivita SmolVLA samal andmestikul, muutmata kujul

    Samad andmed, sama käsi, 450 miljonit parameetrit 80 miljoni asemel, pluss keeleline tingimine. LeRobot hindab 20K sammu läbimist umbes 4 tunnile ühel A100-l. See näitab, kas eeltreenimine annab midagi.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Teisenda v2.1-le enne, kui GR00T-i puudutad

    GR00T loeb LeRobot v2 formaadi varianti pluss täiendavat meta/modality.json faili, mis kaardistab, kuidas ühendatud oleku- ja tegevusmassiivid jagunevad nimetatud väljadeks. v3.0 andmestik põhjustab selle laadija kokkujooksmise, sest v3.0 pakib palju episoode jagatud failidesse, kus v2 kirjutas ühe episoodi kohta. Isaac-GR00T tarnib allapoole teisendamise abivahendi kui scripts/lerobot_conversion/convert_v3_to_v2.py; v3 tagasilükkamise leht on kiireim tee.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Kasuta GR00T N1.7-t ainult siis, kui esimesed kaks jätsid midagi lauale

    NVIDIA CLI kaudu, mis on siin näidatud, või LeRoboti groot poliitika tüübi kaudu. NVIDIA soovitab peenhäälestamiseks 40 GB või rohkem VRAM-i, järelduste tegemiseks 16 GB. OOM-i korral vaata OOM-i lehte.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Kaks viisi selle sõelumise läbiviimiseks

Kolm keskkonda, sest tööriistaketid ei eksisteeri koos. LeRobot peaharus on 0.6.2 ja vajab Python 3.12 või uuemat; Isaac-GR00T ja openpi on eraldi uv-hallatavad repositooriumid.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fikseerib torchcodec 0.8.0 oma ainsa videotaustaprogrammina, vajades FFmpeg 4 kuni 7. FFmpeg 8 ei ole toetatud, AV1 ei ole garanteeritud.
  • openpi mälu miinimumnõuded: järelduste tegemine üle 8 GB, LoRA üle 22.5 GB, täielik peenhäälestamine üle 70 GB. See viimane on põhjus, miks Pi0.5 on A100 töö.
  • Rendi GPU ise, hävita see pärast, ühtlusta kolm kontrollpunkti teede komplekti käsitsi.

Alusmudel või nullist

Tegelik valikukoht ei ole see, millist 3 B mudelit valida. See on pigem see, kas üldse kasutada eelkoolitatud VLA-d, arvestades et ACT õppis kuus reaalset kahekäelist ülesannet umbes kümne minuti pikkuste demonstratsioonide põhjal, 80 miljoni parameetriga ja mitte midagi eelkoolitatut.

Eelkoolitatud VLA peenhäälestamine ACT nullist treenimise asemel
Mida te võidate
  • Keeleline tingimine. ACT-l puudub see; üks ACT kontrollpunkt täidab ühe ülesande.
  • Parem objektide puhul, mis puuduvad teie demonstratsioonidest: SO-101 puhul 50% võrreldes ACT 40%-ga jaotusest väljaspool.
  • Üldse mitme ülesande täitmine: SmolVLA saavutab 78,3% kolme SO-100 ülesande puhul ühe kontrollpunktiga; ACT-d käivitati ainult ühe ülesande jaoks.
Mida see teile maksma läheb
  • 7,6x kuni 24x suurem latentsus: 152 kuni 485 ms tegevussammu kohta võrreldes ACT 20 ms-ga.
  • 4 kuni 12 USD jooksu kohta 1 kuni 3 asemel, ja A100 tase mis tahes 24 GB kaardi asemel.
  • Litsentsirisk, pluss piiratud hoidla rikkerežiim, mida nullist alustades ei eksisteeri.
  • Eelkoolitatud kaalud võivad varjata halba andmestikku. Peenhäälestus, mis poolikult töötab katkiste andmetega, maksab nädala, enne kui andmeid vaatate.

Vana käivituse reprodutseerimise juhtum

2025. aasta kontrollpunkti tagaajamine teeb mudelivaliku teie eest ja muudab probleemi versiooni lukustamiseks: praegune LeRobot lükkab N1.5 tagasi, seega lukustate lerobot==0.5.1. Ilma seemneväljaga ja 5 kuni 6 protsendi variatsiooniga käivituste vahel on reprodutseerimine konstruktsiooni poolest ligikaudne. N1.5 SO-100 juhend ja N1.5 poliitika leht on platvormi poolel.

AY-Robotsi võrdlusleht GR00T N1.7 ja Pi0.5 jaoks, näidates kõrvuti parameetrite arvu, GPU nõudeid, järeldamise latentsust, andmestiku formaati ja minimaalset episoodide arvu.
Võrdlus /compare/groot-n1-7-vs-pi0-5. Kaks 3 B mudelit tunduvad spetsifikatsioonilehel vahetatavad, kuid seda nad ei ole: üks vajab LeRobot v2.1, teine v3.0.

Kas jäi kaks? ACT GR00T N1.7 vastu ja GR00T N1.7 SmolVLA vastu. Toores read asuvad areeni kirjete juures: GR00T N1.7, Pi0.5, SmolVLA ja ACT.

Milles see platvorm teid ei aita

  • See ei saa muuta kaugjäreldamist kiireks. 20 kuni 485 ms tsükkel kuulub mudelile; interneti edasi-tagasi reisid lisavad sellele aega.
  • See ei saa peenhäälestada GR00T-d ega Pi0.5-d teie enda riistvaral. Mõlemad on siin ainult pilvepõhised; ainult SmolVLA ja ACT töötavad lokaalselt.
  • See ei saa andmestikku parandada. Kadu langeb, kuid poliitika ei tee midagi on andmeprobleem, poliitika, mis töötab ainult ühes seadistuses on katvuse probleem.
  • See ei saa muuta GR00T käitusi reprodutseeritavaks: ülesvoolu konfiguratsioonis puudub seemnevälja (seed field).

85 mudelit, 332 võrdlustulemust, iga number lingitud oma allikaga

Selle lehe tabelite sorteeritav versioon: 85 nägemis-keele-tegevuse mudelit, 332 võrdlustulemust, millest igaüks on lingitud tagasi oma artikli või mudelikaardi juurde.

Ava areen

Ühe valimine ja edasi liikumine

Üks vaikeseade: salvestage 50 episoodi, treenige ACT-i 1 kuni 3 USD eest andmestiku tõestamiseks, seejärel SmolVLA-d samade andmetega. Kokku alla 6 USD, ja need vastavad olulisele küsimusele: kas eelkoolitus aitab siin, või kas kitsaskohaks on andmed. Kontaktirikaste mitmeastmeliste ülesannete puhul kasutage GR00T N1.7, Pi0.5-i aga siis, kui stseen muutub.

Platvormi ülevaade: treenige oma esimene poliitika, seejärel käivitage oma esimene poliitika. treeningu dokumendid ja andmestiku dokumendid käsitlevad vormi ja formaati; SO-100 leht ja täielik SO-100 juhend käsitlevad ehitust ja kalibreerimist. Taust: VLA ülevaade ja Pi0 voolu sobitamise artikkel. See, mis teie edukuse määra tõstab, on andmete kvaliteedi juhend.

Millist VLA poliitikat peaksin SO-100 peal esimesena treenima?

ACT, siis SmolVLA. ACT treenib nullist, seega ei saa see halba andmestikku varjata, ja üks käitus maksab 1 kuni 3 USD 24 GB kaardil. Kui ACT ülesande üldse täidab, siis 4 kuni 12 USD GR00T N1.7 või Pi0.5 käituse eest ei ole raisatud.

Kas GR00T N1.7 on tegelikult parem kui Pi0.5?

LIBERO-s on need müra piires: 97.0% nelja sviidi peale GR00T N1.7 puhul, 96.85% Pi0.5 puhul 30k sammu juures openpi-s, 97.5% LeRoboti pordi puhul, kõik erinevatest rakendustest. Tõelised erinevused on 152 ms tegevussammu kohta võrreldes 485 ms-ga, v2.1 andmestikud võrreldes v3.0-ga ja võrdlusaluse täpsus võrreldes avatud maailma üldistusega.

Kas ma saan mõnda neist peenhäälestada ühel RTX 4090-l?

SmolVLA ja ACT, jah; mõlemad on loetletud RTX 4090 või mis tahes 24 GB kaardi jaoks ja töötavad lokaalselt. GR00T N1.7, N1.5 ja Pi0.5 vajavad A100 või H100 80 GB ja on siin ainult pilvepõhised. NVIDIA soovitab GR00T peenhäälestuseks 40 GB või rohkem; openpi piir on üle 70 GB täieliku Pi0.5 peenhäälestuse jaoks, 22.5 GB LoRA jaoks.

Milliseid neist viiest saan ma äriliselt kasutada?

GR00T N1.7 kaalud on NVIDIA avatud mudeli litsentsilepingu all, mis kaardi kohaselt hõlmab ärilist kasutust. N1.5 kaalud on mitteärilised. SmolVLA kood on LeRobotis Apache 2.0, kuid lerobot/smolvla_base kaardil puudub litsentsiväli, seega kaalud on määratlemata. ACT-l puuduvad litsentsitavad baaskaalud. Pi0.5 on ebaselge: LeRoboti dokumendid ütlevad Apache 2.0, selle kaardi metaandmed näitavad litsentsi: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started