AY-Robots politikų palyginimo lentelė, rodanti GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ir ACT greta su parametrų skaičiumi, GPU lygiu, išvadų vėlavimu ir minimaliu epizodų skaičiumi
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Kokią VLA politiką turėtumėte treniruoti 2026 m.?

AY-Robots ResearchAugust 23, 202618 min. skaitymo

GR00T N1.7, Pi0.5, SmolVLA, ACT ar GR00T N1.5? Sprendimų lentelė, pritaikyta realioms situacijoms, su paskelbtais etaloniniais skaičiais, vėlavimu, kaina už paleidimą ir licencijomis, susijusiomis su kiekvienu pasirinkimu.

Šiandien ant SO-100 klasės roboto rankos galima apmokyti penkias politikas. Jos skiriasi 24 kartus inferencijos vėlavimu, 37 kartus parametrų skaičiumi ir 12 kartų vykdymo kaina, taip pat tuo, ar galite pristatyti rezultatą. Penkios modelių kortelės to neišspręs: nė viena neatsako į jūsų klausimą, kurią paleisti pirmiausia?

Kiekvienas toliau pateiktas skaičius buvo paimtas iš straipsnių, saugyklų ir kortelių 2026 m. rugpjūčio mėn. Platformos skaičiai paimti iš AY-Robots politikų katalogo; kur jie nesutampa, rodomi abu.

Trumpoji versija

  • Pirmiausia apmokykite ACT, jei abejojate savo duomenų rinkiniu: 1–3 USD už paleidimą, nieko iš anksto apmokyto, kad paslėptų blogus duomenis.
  • GR00T N1.7 ir Pi0.5 LIBERO skalėje skiriasi puse balo: 97.0 prieš 96.85–97.5. Tai nėra priežastis rinktis nė vieno.
  • Pi0.5 yra skirtas apibendrinimui, o ne tikslumui, ir yra lėčiausias – 485 ms.
  • SmolVLA, turintis 450 M parametrų, yra vienintelis VLA, kurį galima tikslinti vienoje 24 GB kortelėje.
  • ACT su 20 ms yra vienintelis pasirinkimas greitam reaktyviam judesiui. Licencijos nulemia visa kita.

Sprendimų lentelė

Jūsų situacijaTreniruokite šįKodėl
Duomenų rinkinio kokybė nepatvirtintaACTJoks iš anksto apmokytas modelis nepaslėps sugedusio duomenų rinkinio, o nesėkmė kainuoja nuo 1 iki 3 USD.
Daug kontaktų, daugiapakopis, valdomas kalbaGR00T N1.797,0% per keturis LIBERO rinkinius, plius santykinė galinio efektoriaus veiksmų erdvė.
Greitas reaktyvus judesys, išvados servo varikliuoseACT20 ms. Kitas greičiausias yra 7,6 karto lėtesnis.
Nauji objektai, nauja scena, atviras pasaulisPi0.5Sukurta elgesiui už pasiskirstymo ribų, iki 104 vietų.
Viena 24 GB kortelė, vis dar norite kalbosSmolVLA450 M parametrų, 30 epizodų minimumas, veikia lokaliai.
Atkartojant 2025 m. įrašytą paleidimąGR00T N1.5Tik jei privalote: LeRobot dabar jį atmeta, svoriai nekomerciniai.
Tai bus pristatyta kaip produktasN1.7, SmolVLA or ACTN1.5 yra nekomercinis, Pi0.5 taikomos Gemma sąlygos, SmolVLA kortelėje nurodyta, kad jokių.

Penki kandidatai

Visi penki yra politikos: kameros kadrai, jungčių pozicijos ir, keturiems iš jų – kalbos instrukcija, susieta su būsimų jungčių tikslų bloku. Tai, kas juos skiria, yra tai, kiek buvo išmokta prieš jums atvykstant.

PolitikaParametraiVėlavimasGPU lygisVietinis?Min. epizodųFormatasKaina
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

Dabartinis NVIDIA regos-kalbos-veiksmų modelis, apie 3 mlrd. parametrų, maždaug 40 mln. apmokyta per derinimą. Repozitorijoje nurodomi skirtumai nuo N1.6: pagrindas nuo parduodamo Eagle modelio iki Cosmos-Reason2-2B ant Qwen3-VL, difuzijos sluoksniai nuo 32 iki 16, būsenos ir veiksmo matmenys nuo 29 iki 132, veiksmo horizontas nuo 16 iki 40.

Mažai rankai svarbi santykinė galinio efektoriaus veiksmų erdvė: N1.7 prognozuoja skirtumus nuo dabartinės pozos, o tai leidžia 20 tūkst. valandų EgoScale žmogaus vaizdo įrašų perkelti į roboto politiką. Specifikacija N1.7 puslapyje, procedūra N1.7 SO-100 vadove.

GA repozitorijoje, EA modelio kortelėje

Isaac-GR00T README skelbia N1.7 Bendrojo prieinamumo versija, su išsamiais etalonais ir palaikymu. Jos Hugging Face kortelė dar neatnaujinta: Modelio versijos laukelyje vis dar rašoma GR00T N1.7 EA. Repozitorija yra naujesnis dokumentas.

GR00T N1.5

Tas pats 3 B mastelis, Eagle 2 pagrindas, SigLip2 ir T5, srauto derinimo DiT galvutė. Jis skirtas išplėsti kurį jau turite. Dėl dviejų dalykų tai yra prastas numatytasis pasirinkimas: svoriai turi NVIDIA vienpusę nekomercinę licenciją, o dabartiniai LeRobot leidimai pašalino N1.5 palaikymą. Žr. .

Pi0.5

Physical Intelligence VLA, politikos tipas pi05. Straipsnyje aprašomas 2 B VLM, inicializuotas iš PaliGemma, plius 300 M veiksmų ekspertas, valdantis robotą 50 Hz dažniu; LeRobot pi05 konfigūracija numato 50 žingsnių gabalą, vieną sekundę tokiu greičiu. Pardavimo argumentas yra nematytos vietos: apie 400 valandų mobilios manipuliacijos realiose namuose ir mastelio tyrimas, apimantis 3, 12, 22, 53, 82 ir 104 vietas, kur 104 vietų modelis atitiko valdymą, apmokytą pačiuose bandomuosiuose namuose.

Vienas apribojimas, nurodytas lerobot/pi05_base kortelėje: prievadas perduoda tik srauto atitikimo action head. Užduočių prognozavimas, veiksmo tokenizavimas ir RL nebuvo išleisti aukščiau, ir openpi tą patį sako apie savo saugyklą. Pi0.5 puslapis ir Pi0.5 SO-100 vadovas turi likusią dalį.

Spąstai, suvalgantys popietę: uždaros saugyklos

Pi0.5 needs the gated google/paligemma-3b-pt-224 tokenizer (gated: manual, though Google says requests are processed immediately). Nepriėmus jo ir nepaleidus hf auth login mokymo aplinkoje, užduotis prasideda, kurį laiką siunčiasi, o tada miršta dėl autorizacijos klaidos, kuri atrodo kaip tinklo gedimas. nvidia/GR00T-N1.7-3B is not gated, but its nvidia/Cosmos-Reason2-2B backbone is (gated: auto). Išvalykite abu prieš įtraukdami į eilę; jei vykdymas stovi be darbo, įstrigusios eilės puslapis nurodo, ką patikrinti.

SmolVLA

450 M parametrų, apie 100 M veiksmo eksperte, ant SmolVLM-2 su užšaldytu VLM ir naudojant tik jo pirmus 16 kalbos modelio sluoksnių. Išankstinis apmokymas buvo bendruomenės duomenys: 481 duomenų rinkinys, 10,6 M kadrų, iš tų pačių pigų manipuliatorių, kuriuos naudojate. Vienintelis VLA čia, kuris telpa į vieną 24 GB kortelę, ir vienintelis 30 epizodo grindys. Žr. SmolVLA puslapį.

ACT

Ne bazinis modelis. „Action Chunking Transformer“ iš ALOHA yra apie 80 M parametrų, apmokytas nuo nulio kiekvienai užduočiai, naudojant 50 demonstracijų 50 Hz dažniu. Straipsnyje aprašomos šešios realios dvirankės užduotys, kurių kiekviena truko maždaug dešimt minučių demonstracijų, pasiekiant 80–90 procentų sėkmę pavyzdžiuose, kuriuos jis pabrėžia. Jo idėja, veiksmų suskaidymas, yra kiekviename šiame puslapyje esančiame modelyje, o jo abliacija vis dar geriausiai matuoja efektą: atliekant dvi imituotas užduotis su išjungtu laiko ansambliu, sėkmė pakyla nuo 1 procento esant k=1 iki 44 procentų esant k=100. ACT puslapis turi likusią informaciją.

Ką iš tikrųjų sako etalonai

LIBERO yra vienas etalonas, apie kurį praneša trys iš šių penkių: kalba sąlygotos užduotys su imituotu Franka Panda robotu, suskirstytos į keturis toliau nurodytus rinkinius po dešimt užduočių. NVIDIA atliko 200 bandymų kiekvienam rinkiniui.

ModelisErdvinisObjektasTikslas10 (Ilgas)Vidurkis
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Šios eilutės nėra griežtai palyginamos

Kiekvienas skaičius gaunamas iš skirtingos testavimo aplinkos ir biudžeto. GR00T vykdė 20K žingsnių su globaliu paketu 640; openpi rodiklis yra 30K kontrolinis taškas; LeRobot prievadas pridėjo 6K žingsnių prie LIBERO bazinio modelio. SmolVLA yra dar vienas neatitikimas: jo straipsnyje ta eilutė apmokoma LIBERO nuo nulio, be VLA išankstinio apmokymo, o trys aukščiau esantys modeliai tikslina iš anksto apmokytus kontrolinius taškus. Laikykite 96.85 iki 97.5 vienu klasteriu, o atotrūkį iki 87.3% – realiu, bet pasiektu su 6.7 karto daugiau parametrų.

SimplerEnv rodo pasiskirstymą, ko LIBERO nedaro. NVIDIA lygina N1.7 su N1.6, kas yra artimiausia viešai prieinama „kartų skirtumo“ išraiška.

SimplerEnv rinkinysN1.6 vidurkisN1.7 vidurkisGeriausias pokytisBlogiausias pokytis
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Eilutė „Bridge“ yra naudinga: vidutiniškai 5.7 taško pelnyta, o put_eggplant_in_basket prarado 36, o put_eggplant_in_sink nukrito nuo 33 iki 2. Nauja karta perkelia pasiskirstymą, o ne jį pakelia, todėl jei jūsų užduotis yra ten, kur N1.7 regresavo, vidurkis nieko nesako.

AY-Robots arenos lyderių lentelė, rūšiuojama 85 regos-kalbos-veiksmų modelių lentelė su 332 etaloniniais rezultatais, kiekviena vertė susieta su straipsniu ar modelio kortele, iš kurios ji kilusi
Arena talpina 85 VLA modelius ir 332 etaloninius rezultatus, kiekvienas susietas su savo straipsniu ar modelio kortele. Naudinga patikrinti, ar tinklaraščio įraše cituojamas skaičius yra tikras.

Iš penkių, tik SmolVLA straipsnis praneša apie SO-100 klasės ranką: 78.3 procento SmolVLA ir 61.7 Pi0 trims užduotims, abi daugiafunkcinės, palyginti su 48.3 ACT apmokytam vienos užduoties modeliui, kas nėra lyginama vienas su vienu. Švarus poravimas yra abiejų vienos užduoties modelių palyginimas SO-101 paėmimo ir padėjimo užduotyje: 90 prieš 70 pasiskirstyme, 50 prieš 40 už jo ribų. Palyginkite ACT prieš SmolVLA ir Pi0.5 prieš SmolVLA, arba naršykite areną.

Vėlavimas ir kaina lemia diegimą

Inferencijos vėlavimas yra apribojimas, kurį žmonės atranda paskutinį ir apgailestauja pirmiausia. Politika, penkiais punktais geresnė pagal etaloną, bet pusė sekundės vienam veiksmo žingsniui, atrodo blogiau ant jūsų stalo: kontaktinė dinamika nelaukia.

Vienas įspėjimas: GR00T duomenys nesutampa su NVIDIA kortelės duomenimis, kuri matuoja 4 triukšmo šalinimo žingsnius ir vieną kamerą per 85.8 ms H100 kortelėje „eager“ režimu, 48.6 ms su torch.compile, 27.9 ms per visą TensorRT. Čia nurodyti 152 ms yra viso sistemos sluoksnio duomenys su aptarnavimo sąnaudomis ir daugiau nei viena kamera, o ne tik „forward pass“.

Nuotolinė inferencija turi griežtą viršutinę ribą

20–485 ms ciklas priklauso modeliui, ir viešojo interneto kelionės pirmyn ir atgal jį pailgina. Nuotolinė inferencija tinkama lėtam paėmimui ir padėjimui, bet ne greitam reaktyviam judesiui. Jei jūsų užduočiai reikia greičio, inferencija turi būti šalia servovariklių: ACT arba SmolVLA, lokaliai. Susiję: politika sustingsta judesio metu.

Vienas būdas sutaupyti laiko nekeičiant modelio: SmolVLA straipsnyje lyginamas sinchroninis vykdymas, kai politika baigia vieną dalį prieš prognozuodama kitą, su asinchroniniu, kai prognozavimas persidengia su vykdymu. Sėkmė panaši, 78.3 prieš 73.3, tačiau tas pats paėmimas ir padėjimas užtrunka 9.7 sekundės vietoj 13.75, ir fiksuotame lange robotas atlieka 19 ciklų vietoj 9.

Licencijos, patikrintos, nes niekas jų netikrina

ModelisSvorių licencijaKodo licencijaKomercinis naudojimas
GR00T N1.7NVIDIA Open Model License; kortelė leidžia komercinį naudojimąApache 2.0taip
GR00T N1.5NVIDIA vienpusė nekomercinė licencijaApache 2.0ne
Pi0.5pi05_base kortelės metaduomenyse nurodyta licencija: gemmaApache 2.0 (openpi, LeRobot docs)perskaitykite abu, jie nesutampa
SmolVLAnėra licencijos lauko smolvla_base kortelėjeApache 2.0 (LeRobot)kodas taip, svoriai nenurodyti
ACTbazinių svorių nėraApache 2.0 (LeRobot)taip

Pi0.5 eilutei reikia dėmesio. LeRobot pi05 dokumentacijoje nurodoma Apache 2.0, atitinkanti openpi, o Hub kortelėje, skirtoje lerobot/pi05_base nurodoma license: gemma. Abu yra aktyvūs. GR00T N1.7 turi švelnesnę versiją: Isaac-GR00T README dokumente tarp kitko minima, kad N1.7 yra visiškai komerciškai licencijuojama pagal Apache 2.0, o jos pačios licencijos skyrius ir modelio kortelė nurodo, kad tik kodas yra pagal Apache 2.0, o svoriai – pagal NVIDIA Open Model License.

Numatytosios reikšmės, kurias iš tikrųjų paleisite

Kiekviena treniruoklio forma turi numatytąsias reikšmes, ir jos nėra atsitiktinės. ACT yra LeRobot nuosavos: paketas 8, lr 1e-5, 100000 mokymo žingsniai, bloko dydis 100, atitinkantis ACTConfig aukščiau ir k=100 from the ACT paper. Vienas stulpelis žemiau yra spąstai.

PolitikaPaketasLRMaks. žingsniaiGrad. akum.Taikoma?Papildomi nustatymai
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Atkuriamumas, 2026 m. rugpjūčio mėn.

GR00T smulkaus derinimo įvesties taškas (launch_finetune.py, tyro CLI) neturi sėklos lauko savo konfigūracijos duomenų klasėje, todėl paleidimai nėra bitas po bito atkuriami. Repozitorija taip pat įspėja apie 5–6 procentų skirtumą tarp paleidimų dėl nedeterministinių vaizdo papildymų, didesnį nei dauguma etaloninių skirtumų, dėl kurių ginčijamasi internete. LeRobot numatytoji sėkla yra 1000. Grad-akum stulpelis aprašo lerobot 0.5.1; aukščiau esanti 0.6.2 versija jį atskleidžia kaip --accelerator.gradient_accumulation.steps.

Nustatymas, kuris svarbesnis už modelio pasirinkimą

Tai yra veiksmo gabalas. Ilgesni gabalai užtikrina sklandesnį judesį ir mažiau sudėtinių klaidų, tačiau politika yra įsipareigojusi, kol blokas vykdomas, todėl ji vėlai reaguoja į bet ką, kas juda: užtikrinta ant statinio kubo, beviltiška ant riedančio. Jei jis peršoka, sutrumpinus vykdomą dalį, nereikia perkvalifikuoti ir tai nieko nekainuoja. Sąnarys, kuris sustoja per anksti, yra kita problema; žr. .

  • ACT: ACTConfig numatytosios reikšmės yra chunk_size 100 ir n_action_steps 100. Laikinis ansambliavimas yra išjungtas ir reikalauja n_action_steps 1.
  • GR00T N1.7: vidinis horizontas padidėjo nuo 16 iki 40, tačiau LeRobot SO-101 pavyzdys vis dar vykdo --policy.chunk_size=16 --policy.n_action_steps=16. Išskleidimo vėliavėlė buvo pervadinta į --execution-horizon.
  • Pi0.5: 50 žingsnių gabalas, iš kurio LeRobot LIBERO receptas vykdo 10 per --policy.n_action_steps=10; su --policy.pretrained_path jis grįžta prie 50, jei praleidžiate vėliavėlę.
  • SmolVLA: 50 veiksmų gabalai, abu valdikliai atviri.

Kaip patikrinti visus penkis per vieną popietę

Pigiausias atsakymas nėra daugiau skaitymo. Išleiskite apie 15 USD ir leiskite rankai jums pasakyti: įrašykite vieną kartą, pirmiausia apmokykite pigų modelį, eskaluokite, kai jis įrodys duomenų patikimumą. Struktūra nugali apimtį, tai yra esmė ir .

  1. 1
    Įrašykite 50 epizodų vieną kartą

    Penkiasdešimt paruošia dirvą GR00T, Pi0.5 ir ACT, bei SmolVLA 30. Kartokite kiekvieną variaciją, o ne sklaidykite: 50 epizodų per 5 kubo pozicijas, kur 25 nebuvo apmokyti. Žr. įrašykite savo pirmąjį duomenų rinkinį.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Pirmiausia apmokykite ACT, nes jis negali jums meluoti

    Nėra iš anksto apmokytų svorių, tad jei užduotis apskritai atliekama, jūsų duomenų rinkinyje yra užduotis. Jei ACT rezultatai nekinta, pataisykite duomenis. 1–3 USD, 2–5 valandos su 24 GB kortele.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Paleiskite SmolVLA su tuo pačiu duomenų rinkiniu, nepakeistu

    Tie patys duomenys, ta pati ranka, 450 M parametrų vietoj 80 M, plius kalbos sąlygojimas. LeRobot 20K žingsnių vykdymą įvertina maždaug 4 valandomis su viena A100. Tai parodo, ar išankstinis apmokymas duoda naudos.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Konvertuokite į v2.1, prieš liesdami GR00T

    GR00T skaito LeRobot v2 formato variantą, plius papildomą meta/modality.json, nurodantį, kaip sujungti būsenos ir veiksmo masyvai suskirstomi į pavadintus laukus. V3.0 duomenų rinkinys sugadina tą įkroviklį, nes v3.0 supakuoja daug epizodų į bendrus failus, kur v2 rašė po vieną epizodą. Isaac-GR00T pateikia atnaujinimo pagalbininką kaip scripts/lerobot_conversion/convert_v3_to_v2.py; v3 atmetimo puslapis yra greitasis kelias.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Pereikite prie GR00T N1.7 tik tuo atveju, jei pirmieji du paliko neišspręstų klausimų

    Per NVIDIA CLI, parodytą čia, arba LeRobot groot politikos tipą. NVIDIA rekomenduoja 40 GB ar daugiau VRAM smulkiam derinimui, 16 GB – išvadoms. Esant OOM, žr. OOM puslapį.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Du būdai atlikti tą atrankos patikrinimą

Trys aplinkos, nes įrankių grandinės nesuderinamos. LeRobot pagrindinėje versijoje yra 0.6.2 ir reikalauja Python 3.12 ar naujesnės versijos; Isaac-GR00T ir openpi yra atskiri uv valdomi repozitoriumai.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T naudoja torchcodec 0.8.0 kaip vienintelį vaizdo įrašų posistemį, reikalaujantį FFmpeg 4–7. FFmpeg 8 nepalaikomas, AV1 negarantuojamas.
  • openpi atminties reikalavimai: išvadoms virš 8 GB, LoRA virš 22.5 GB, pilnam smulkiam derinimui virš 70 GB. Pastarasis yra priežastis, kodėl Pi0.5 yra A100 užduotis.
  • Išsinuomokite GPU patys, sunaikinkite ją po to, suderinkite tris kontrolinių taškų kelių rinkinius rankiniu būdu.

Pagrindinis modelis arba nuo nulio

Tikrasis pasirinkimas nėra, kurį 3 B modelį pasirinkti. Tai yra, ar apskritai naudoti iš anksto apmokytą VLA, atsižvelgiant į tai, kad ACT išmoko šešias realias dvirankes užduotis iš maždaug dešimties minučių demonstracijų kiekvienai, su 80 M parametrų ir nieko iš anksto neapmokyto.

Iš anksto apmokyto VLA derinimas vietoj ACT apmokymo nuo nulio
Ką jūs gaunate
  • Kalbos sąlygojimas. ACT jo neturi; vienas ACT kontrolinis taškas atlieka vieną užduotį.
  • Geriau veikia su objektais, kurių nėra jūsų demonstracijose: SO-101, 50% prieš ACT 40% už pasiskirstymo ribų.
  • Apskritai daugiafunkcinis: SmolVLA pasiekia 78,3% trijose SO-100 užduotyse su vienu kontroliniu tašku; ACT buvo paleistas tik vienos užduoties režimu.
Ką tai jums kainuoja
  • 7.6x iki 24x didesnis vėlavimas: nuo 152 iki 485 ms vienam veiksmo žingsniui, palyginti su ACT 20 ms.
  • Nuo 4 iki 12 USD už paleidimą vietoj 1 iki 3, ir A100 lygis vietoj bet kurios 24 GB kortelės.
  • Licencijos rizika, plius uždaro repozitoriumo gedimo režimas, kuris neegzistuoja nuo nulio.
  • Iš anksto apmokyti svoriai gali užmaskuoti blogą duomenų rinkinį. Derinimas, kuris pusiau veikia su sugadintais duomenimis, kainuoja savaitę, kol peržiūrite duomenis.

Seno paleidimo atkartojimo atvejis

Siekiant 2025 m. kontrolinio taško, modelio pasirinkimas tampa aiškus ir problema virsta versijos fiksavimu: dabartinis LeRobot atmeta N1.5, todėl jūs fiksuojate lerobot==0.5.1. Neturint sėklos lauko ir esant 5–6 procentų dispersijai tarp paleidimų, atkartojimas yra apytikslis pagal konstrukciją. ir turi platformos pusę.

AY-Robots tiesioginio palyginimo puslapis, skirtas GR00T N1.7 ir Pi0.5, kuriame greta rodomas parametrų skaičius, GPU reikalavimai, išvadų vėlavimas, duomenų rinkinio formatas ir minimalus epizodų skaičius.
Tiesioginis palyginimas /compare/groot-n1-7-vs-pi0-5. Du 3 B modeliai specifikacijų lape atrodo keičiami, tačiau taip nėra: vienam reikia LeRobot v2.1, kitam – v3.0.

Liko du? ACT prieš GR00T N1.7 ir GR00T N1.7 prieš SmolVLA. Neapdorotos eilutės yra arenos įrašuose: GR00T N1.7, Pi0.5, SmolVLA ir ACT.

Kuo ši platforma jums nepadeda

  • Ji negali pagreitinti nuotolinio išvadų darymo. 20–485 ms ciklas priklauso modeliui; interneto kelionės pirmyn ir atgal prideda laiko.
  • Ji negali patobulinti GR00T ar Pi0.5 jūsų pačių aparatinėje įrangoje. Abu čia yra tik debesyje; tik SmolVLA ir ACT veikia lokaliai.
  • Ji negali pataisyti duomenų rinkinio. Nuostolis mažėja, bet politika nieko nedaro yra duomenų problema, politika, kuri veikia tik vienoje sąrankoje yra aprėpties problema.
  • Ji negali padaryti GR00T vykdymų atkuriamų: aukštesnio lygio konfigūracijoje nėra sėklos lauko.

85 modeliai, 332 etaloniniai rezultatai, kiekvienas skaičius susietas su šaltiniu

Rūšiuojama šio puslapio lentelių versija: 85 regos-kalbos-veiksmo modeliai, 332 etaloniniai rezultatai, kiekvienas susietas su savo straipsniu ar modelio kortele.

Atidaryti areną

Pasirinkti vieną ir judėti toliau

Vienas numatytasis: įrašyti 50 epizodų, apmokyti ACT už 1–3 USD, kad įrodytumėte duomenų rinkinį, tada SmolVLA ant tų pačių duomenų. Iš viso mažiau nei 6 USD, ir jie atsako į svarbų klausimą: ar išankstinis apmokymas čia padeda, ar arba ar kliūtis yra duomenys. Pereiti prie GR00T N1.7 sudėtingoms daugiapakopėms užduotims, prie Pi0.5, kai keičiasi scena.

Platformos apžvalga: apmokyti savo pirmąją politiką, tada paleisti savo pirmąją politiką. mokymo dokumentacija ir duomenų rinkinių dokumentacija apima formą ir formatą; SO-100 puslapis ir išsamus SO-100 vadovas apima konstravimą ir kalibravimą. Fonas: VLA apžvalga ir Pi0 srauto derinimo straipsnis. Tas, kuris padidins jūsų sėkmės rodiklį, yra duomenų kokybės vadovas.

Kurią VLA politiką turėčiau pirmiausia apmokyti SO-100?

ACT, tada SmolVLA. ACT apmokoma nuo nulio, todėl negali paslėpti blogo duomenų rinkinio, o paleidimas kainuoja nuo 1 iki 3 USD su 24 GB kortele. Jei ACT apskritai atlieka užduotį, 4–12 USD už GR00T N1.7 arba Pi0.5 paleidimą nėra iššvaistyti.

Ar GR00T N1.7 iš tiesų geresnis už Pi0.5?

LIBERO platformoje jie yra triukšmo ribose: 97.0% keturiose rinkiniuose GR00T N1.7, 96.85% Pi0.5 esant 30k žingsnių openpi, 97.5% LeRobot portui, visi iš skirtingų testavimo sistemų. Tikrieji skirtumai yra 152 ms vienam veiksmo žingsniui prieš 485 ms, v2.1 duomenų rinkiniai prieš v3.0, ir etaloninis tikslumas prieš apibendrinimą atvirame pasaulyje.

Ar galiu patikslinti bet kurį iš jų vienoje RTX 4090?

SmolVLA ir ACT, taip; abu nurodyti RTX 4090 arba bet kuriai 24 GB kortelei ir veikia lokaliai. GR00T N1.7, N1.5 ir Pi0.5 reikia A100 arba H100 80 GB ir čia yra tik debesies paslauga. NVIDIA rekomenduoja 40 GB ar daugiau GR00T patikslinimui; openpi minimalus reikalavimas yra virš 70 GB pilnam Pi0.5 patikslinimui, 22.5 GB LoRA.

Kurį iš šių penkių galiu naudoti komerciniais tikslais?

GR00T N1.7 svoriai yra pagal NVIDIA atvirojo modelio licencijos sutartį, kuri, kaip nurodo kortelė, apima komercinį naudojimą. N1.5 svoriai yra nekomerciniai. SmolVLA kodas yra Apache 2.0 LeRobot, tačiau lerobot/smolvla_base kortelėje nėra licencijos lauko, todėl svoriai nenurodyti. ACT neturi bazinių svorių, kuriuos reikėtų licencijuoti. Pi0.5 yra dviprasmiškas: LeRobot dokumentuose rašoma Apache 2.0, o jo kortelės metaduomenyse nurodyta licencija: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started