Samanburðartafla AY-Robots stefna sem sýnir GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT hlið við hlið með fjölda færibreyta, GPU flokki, ályktunartöf og lágmarksfjölda þátta
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Hvaða VLA stefnu ættir þú að þjálfa árið 2026?

AY-Robots ResearchAugust 23, 202618 mínútna lestur

GR00T N1.7, Pi0.5, SmolVLA, ACT eða GR00T N1.5? Ákvarðanatöflur sem passa við raunverulegar aðstæður, með birtum viðmiðunartölum, töf, kostnaði á keyrslu og leyfum á bak við hvern valkost.

Fimm stefnur eru þjálfanlegar á SO-100 flokks armi í dag. Þær eru ólíkar um stuðulinn 24 í ályktunar-töf, 37 í fjölda færibreyta og 12 í því hvað keyrsla kostar, og hvort þú mátt senda niðurstöðuna. Fimm líkanakort munu ekki leysa það: ekkert svarar spurningunni sem þú hefur, hvaða keyri ég fyrst?

Sérhver tala hér að neðan var lesin úr greinum, geymslum og kortum í ágúst 2026. Vettvangsnúmer koma frá AY-Robots stefnuskrá; þar sem þau tvö eru ósammála, eru bæði sýnd.

Stutta útgáfan

  • Þjálfaðu ACT fyrst ef þú efast um gagnasafnið þitt: 1 til 3 USD á keyrslu, ekkert forþjálfað til að hylja slæm gögn.
  • GR00T N1.7 og Pi0.5 eru innan hálfs punkts á LIBERO, 97.0 á móti 96.85 til 97.5. Það er ekki ástæða til að velja annað hvort.
  • Pi0.5 snýst um alhæfinguna, ekki nákvæmnina, og er hægast á 485 ms.
  • SmolVLA, með 450 M færibreytur, er eina VLA hér sem fínstillir á einu 24 GB korti.
  • ACT á 20 ms er eini kosturinn fyrir hraða viðbragðshreyfingu. Leyfi ráða restinni.

Ákvarðanatöflan

Þín staðaÞjálfa þettaAf hverju
Gæði gagnasetts óprófuðACTEkkert forþjálfað felur bilað gagnasett, og mistök kosta 1 til 3 USD.
Snertiríkt, fjölþrepa, tungumálsbundinGR00T N1.797.0% yfir fjórum LIBERO svítum, auk hlutfallslegs virkjunarsvæðis endabúnaðar.
Hröð viðbragðshreyfing, ályktun á servóumACT20 ms. Næst hraðasta er 7.6 sinnum hægara.
Nýir hlutir, nýtt umhverfi, opinn heimurPi0.5Byggt fyrir hegðun utan dreifingar, yfir allt að 104 staði.
Eitt 24 GB kort, vill samt tungumálSmolVLA450 M færibreytur, 30 þátta lágmark, keyrir staðbundið.
Endurgera keyrslu sem var skráð árið 2025GR00T N1.5Aðeins ef þú verður: LeRobot hafnar því núna, þyngdir eru ekki í viðskiptalegum tilgangi.
Þetta verður sent sem varaN1.7, SmolVLA or ACTN1.5 er ekki í viðskiptalegum tilgangi, Pi0.5 ber Gemma skilmála, kort SmolVLA segir ekkert.

Fimm frambjóðendurnir

Allir fimm eru stefnur: myndavélarrámar, liðstaðsetningar og, fyrir fjóra þeirra, tungumálsleiðbeiningar, kortlagðar í hluta af framtíðar liðmarkmiðum. Það sem aðgreinir þá er hversu mikið var lært áður en þú komst.

StefnaFæribreyturSeinkunGPU flokkurStaðbundið?LágmarksþættirSniðKostnaður
ACT~80 M20 ms24 GB kort50v3.01 til 3 USD
SmolVLA~450 M245 ms24 GB kort30v3.01 til 3 USD
GR00T N1.7~3 B, ~40 M stillt152 msA100/H100 80 GBnei50v2.0/v2.14 til 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBnei50v2.0/v2.14 til 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBnei50v3.04 til 12 USD

GR00T N1.7

Núverandi sjón-tungumál-aðgerðarlíkan NVIDIA, um 3 milljarðar færibreytna, um það bil 40 milljónir þjálfaðar meðan á fínstillingu. Geymslan listar breytingarnar frá N1.6: burðarvirki frá Eagle líkani frá söluaðila yfir í Cosmos-Reason2-2B á Qwen3-VL, dreifingarlög 32 í 16, ástands- og aðgerðarvíddir 29 í 132, aðgerðarsjóndeildarhringur 16 í 40.

Það sem skiptir máli á litlum armi er hlutfallslegt aðgerðarrými endabúnaðar: N1.7 spáir fyrir um breytingar frá núverandi stöðu, sem er það sem gerir 20 þúsund klukkustundum af EgoScale mannlegu myndbandi kleift að flytjast yfir í vélmennisstefnu. Upplýsingar á N1.7 síðunni, ferli í leiðbeiningunum um N1.7 á SO-100.

GA í geymslunni, EA á líkanakortinu

Isaac-GR00T README lýsir N1.7 sem General Availability útgáfu, með fullkomnum viðmiðum og stuðningi. Hugging Face kortið hefur ekki verið uppfært: Model Version reiturinn sýnir enn GR00T N1.7 EA. Geymslan er nýrra skjalið.

GR00T N1.5

Sami 3 B kvarði, Eagle 2 burðarás, SigLip2 og T5, flæðisjöfnunar DiT haus. Hann er til staðar til að framlengja sem þú hefur nú þegar. Tvennt gerir hann að lélegum sjálfgefnum valkosti: vigtirnar bera einstefnu, óviðskiptalegt leyfi NVIDIA, og núverandi útgáfur LeRobot fjarlægðu stuðning við N1.5. Sjá .

Pi0.5

Physical Intelligence's VLA, stefnutegund pi05. Greinin lýsir 2 B VLM sem er frumstillt frá PaliGemma ásamt 300 M aðgerðasérfræðingi, sem stýrir vélmenninu á 50 Hz; sjálfgefin pi05 stilling LeRobot er 50 skrefa bútur, ein sekúnda á þeim hraða. Sölustaðurinn er óséðir staðir: um 400 klukkustundir af hreyfanlegri meðhöndlun á raunverulegum heimilum, og stækkunarrannsókn yfir 3, 12, 22, 53, 82 og 104 staði, þar sem 104 staða líkanið passaði við stjórnun sem var þjálfuð á prófunarheimilunum sjálfum.

Eitt takmörk, sem fram kemur á lerobot/pi05_base kortinu: tengið ber aðeins flæðis-samsvarandi aðgerðarhausinn. Spá um undirverkefni, aðgerðartákngerving og RL voru ekki gefin út uppstreymis, og openpi segir það sama um eigið geymslusvæði. Pi0.5 síðan og leiðbeiningarnar um Pi0.5 á SO-100 hafa afganginn.

Gildran sem étur eftirmiðdag: hliðstýrð geymslusvæði

Pi0.5 þarf hliðstýrða `google/paligemma-3b-pt-224` tákngervilinn (`gated: manual`, þó Google segi að beiðnir séu afgreiddar strax). Án þess að samþykkja hann og keyra `hf auth login` í þjálfunarumhverfinu, byrjar verkið, hleður niður um stund, deyr síðan vegna heimildarvillu sem lítur út eins og netbilun. `nvidia/GR00T-N1.7-3B` er ekki hliðstýrður, en `nvidia/Cosmos-Reason2-2B` burðarásinn hans er það (`gated: auto`). Hreinsaðu báða áður en þú setur í biðröð; ef keyrsla situr aðgerðarlaus, síðan um fasta biðröð listar upp hvað á að athuga.

SmolVLA

450 M færibreytur, um 100 M í aðgerðasérfræðingnum, á SmolVLM-2 með VLM frosið og aðeins fyrstu 16 tungumálalags-lög notuð. Forþjálfun voru samfélagsgögn: 481 gagnasöfn, 10.6 M rammar, frá sömu ódýru örmunum sem þú notar. Eina VLA hér sem passar á eitt 24 GB kort, og eina 30 þátta gólf. Sjá SmolVLA síðuna.

ACT

Ekki grunngerð. Action Chunking Transformer frá ALOHA er um 80 M færibreytur þjálfaðar frá grunni fyrir hvert verkefni, á 50 sýnikennslum við 50 Hz. Greinin greinir frá sex raunverulegum tvíhöfða verkefnum úr um það bil tíu mínútum af sýnikennslum hvoru, með 80 til 90 prósent á þeim dæmum sem hún dregur fram. Hugmynd hennar, aðgerðaskipting, er í hverri gerð á þessari síðu, og frálag hennar mælir enn áhrifin best: yfir tvö hermd verkefni með tímabundinni samsetningu óvirkri, hækkar árangur úr 1 prósenti við k=1 í 44 prósent við k=100. ACT síðan hefur afganginn.

Hvað viðmiðin segja í raun

LIBERO er eina viðmiðið sem þrír af þessum fimm greina frá: tungumálaskilyrt verkefni á hermdum Franka Panda, skipt í fjórar svítur hér að neðan með tíu verkefnum hvorri. NVIDIA keyrði 200 tilraunir á hverja svítu.

LíkanRýmislegtHluturMarkmið10 (Langt)Meðaltal
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Þessar raðir eru ekki nákvæmlega sambærilegar

Hver tala kemur frá mismunandi prófunarumhverfi og fjárveitingu. GR00T keyrði 20K skref með alþjóðlegri lotustærð 640; openpi talan er 30K stöðupunktur; LeRobot útfærslan bætti 6K skrefum við LIBERO grunnlíkan. SmolVLA er enn frekari ósamræmi: grein þess þjálfar þá röð á LIBERO frá grunni, án VLA forþjálfunar, á meðan þau þrjú fyrir ofan fínstilla forþjálfaða stöðupunkta. Líta skal á 96.85 til 97.5 sem einn klasa, og bilið upp í 87.3% sem raunverulegt en fengið með 6.7x fleiri færibreytum.

SimplerEnv sýnir dreifinguna, sem LIBERO gerir ekki. NVIDIA ber N1.7 saman við N1.6, það næstopinbera sem líkist kynslóðabreytingu.

SimplerEnv svítaN1.6 meðaltalN1.7 meðaltalBesta sveiflaVersta sveifla
Brú (WidowX), 7 verkefni56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 verkefni52.0%72.5%open_drawer 0.0 to 65.0ekkert, hvert verkefni batnaði

Bridge röðin er sú gagnlega: 5,7 stigum bætt að meðaltali á meðan put_eggplant_in_basket tapaði 36 og put_eggplant_in_sink féll úr 33 í 2. Ný kynslóð færir dreifinguna frekar en að lyfta henni, svo ef verkefnið þitt er þar sem N1.7 dróst saman, segir meðaltalið ekkert.

AY-Robots vettvangurinn, raðanleg tafla yfir 85 sjón-tungumál-aðgerð módel með 332 viðmiðunarniðurstöðum, þar sem hvert gildi er tengt við greinina eða módelkortið sem það kom frá
Vettvangurinn geymir 85 VLA módel og 332 viðmiðunarniðurstöður, hver tengd aftur við grein sína eða módelkort. Gagnlegt til að athuga hvort tala sem vitnað er í í bloggfærslu sé raunveruleg.

Af þeim fimm greinir aðeins SmolVLA greinin frá SO-100 flokks armi: 78,3 prósent fyrir SmolVLA og 61,7 fyrir Pi0 yfir þrjú verkefni, bæði fjölverkefni, á móti 48,3 fyrir ACT þjálfað eitt verkefni, sem er ekki sambærilegt. Hrein pörun er bæði eitt verkefni á SO-101 pick-and-place: 90 á móti 70 í dreifingu, 50 á móti 40 utan hennar. Berðu saman á ACT á móti SmolVLA og Pi0.5 á móti SmolVLA, eða skoðaðu vettvanginn.

Seinkun og kostnaður ráða útfærslu

Ályktunartöf er sú takmörkun sem fólk uppgötvar síðast og sér eftir fyrst. Stefna sem er fimm stigum betri á viðmiðun en tekur hálfa sekúndu á hverju aðgerðarskrefi lítur verr út á skrifborðinu þínu: snertidynamík bíður ekki.

Eitt fyrirvari: GR00T talan er ósammála korti NVIDIA, sem mælir 4 afhávaðaskref og eina myndavél á 85.8 ms á H100 í eager mode, 48.6 ms með torch.compile, 27.9 ms í gegnum fullt TensorRT. 152 ms hér er heildarstafla með þjónustuálagi og fleiri en einni myndavél, ekki framsending.

Fjarályktun hefur hátt þak

Lykkjan sem tekur 20 til 485 ms er líkansins, og ferðir fram og til baka um almennt internet bætast við hana. Fjarályktun er raunhæf fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka hreyfingu. Ef verkefnið þitt þarf hraða, situr ályktun við hliðina á servóunum: ACT eða SmolVLA, staðbundið. Tengt: stefna frýs í miðri hreyfingu.

Ein leið til að spara tíma án þess að breyta líkani: SmolVLA greinin mælir samstillta framkvæmd, þar sem stefnan klárar einn hluta áður en hún spáir fyrir um næsta, á móti ósamstilltri, þar sem spá skarast við framkvæmd. Árangur er svipaður, 78.3 á móti 73.3, en sama tínslan og staðsetningin tekur 9.7 sekúndur í stað 13.75, og í föstu tímabili stýrir vélmennið 19 hringrásum í stað 9.

Leyfi, athuguð vegna þess að enginn athugar þau

LíkanLeyfi fyrir þyngdirLeyfi fyrir kóðaNotkun í atvinnuskyni
GR00T N1.7NVIDIA Open Model License; kort leyfir notkun í atvinnuskyniApache 2.0
GR00T N1.5NVIDIA one-way non-commercial licenceApache 2.0nei
Pi0.5pi05_base kort metadata les leyfi: gemmaApache 2.0 (openpi, LeRobot docs)lesið bæði, þau eru ósammála
SmolVLAekkert leyfissvið á smolvla_base kortinuApache 2.0 (LeRobot)kóði já, þyngdir ótilgreindar
ACTengar grunnþyngdir eru tilApache 2.0 (LeRobot)

Pi0.5 röðin þarfnast athygli. LeRobot pi05 skjölun segir Apache 2.0 í samræmi við openpi, á meðan Hub kortið fyrir lerobot/pi05_base inniheldur license: gemma. Bæði eru virk. GR00T N1.7 hefur mildari útgáfu: Isaac-GR00T README segir í framhjáhlaupi að N1.7 sé að fullu leyfilegt til notkunar í atvinnuskyni undir Apache 2.0, á meðan eigin leyfissvið og líkanakort setja aðeins kóðann undir Apache 2.0 og þyngdirnar undir NVIDIA Open Model License.

Sjálfgefnar stillingar sem þú munt í raun keyra

Hvert þjálfunarform kemur með sjálfgefna stillingu, og þær eru ekki handahófskenndar. ACT's eru eigin LeRobot: batch 8, lr 1e-5, 100000 þjálfunarskref, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Einn dálkur hér að neðan er gildra.

StýringLotustærðNámshraðiHámarksskrefUppsöfnun hallaGildir?Auka stillingar
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Endurgerðanleiki, dagsett ágúst 2026

GR00T's fine-tuning entry point (launch_finetune.py, a tyro CLI) has ekkert fræsvið in its config dataclass, so runs are not bit-for-bit reproducible. Geymslan varar einnig við 5 to 6 percent variance between runs vegna ósjálfráðra myndaukninga, sem er meira en flest bil í viðmiðum sem deilt er um á netinu. LeRobot's default seed is 1000. The grad-accum column describes lerobot 0.5.1; útgáfa 0.6.2 sýnir það sem --accelerator.gradient_accumulation.steps.

Stillingin sem skiptir meira máli en val á líkani

Þetta er aðgerðarhlutinn. Lengri hlutar gefa mýkri hreyfingu og færri uppsafnaðar villur, en stefnan er bindandi á meðan blokkin keyrir, svo hún bregst seint við öllu sem hreyfist: örugg á kyrrstæðum teningi, vonlaus á rúllandi. Ef hún fer yfir markið, er stytting á framkvæmdum hluta betri en endurþjálfun og er ókeypis. Liður sem stoppar of snemma er annað vandamál; sjá .

  • ACT: ACTConfig notar sjálfgefið chunk_size 100 og n_action_steps 100. Tímabundin samsetning er óvirk og krefst n_action_steps 1.
  • GR00T N1.7: innri sjóndeildarhringur fór úr 16 í 40, en dæmi LeRobot SO-101 keyrir enn --policy.chunk_size=16 --policy.n_action_steps=16. Rollout flaggið var endurnefnt í --execution-horizon.
  • Pi0.5: 50-skrefa hluti, þar af keyrir LIBERO uppskrift LeRobot 10 í gegnum --policy.n_action_steps=10; með --policy.pretrained_path fellur það aftur í 50 ef þú sleppir flagginu.
  • SmolVLA: 50-aðgerða hlutar, báðir hnappar sýnilegir.

Hvernig á að skima alla fimm á einum eftirmiðdegi

Ódýrasta svarið er ekki meiri lestur. Eyddu um 15 USD og láttu arminn segja þér: taktu upp einu sinni, þjálfaðu ódýra líkanið fyrst, stækkaðu þegar það hefur sannað að gögnin séu traust. Uppbygging sigrar magn, tilgangurinn með og .

  1. 1
    Skráðu 50 þætti einu sinni

    Fimmtíu hreinsar gólfið fyrir GR00T, Pi0.5 og ACT, og 30 frá SmolVLA. Endurtaktu hverja afbrigði frekar en að dreifa þunnt: 50 þættir yfir 5 teningastöður þjálfaðir þar sem 25 voru það ekki. Sjá skráðu fyrsta gagnasafnið þitt.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Þjálfaðu ACT fyrst, því það getur ekki logið að þér

    Engar forþjálfaðar þyngdir, svo ef það framkvæmir verkefnið yfirhöfuð, inniheldur gagnasafnið þitt verkefnið. Ef ACT stöðvast, lagaðu gögnin. 1 til 3 USD, 2 til 5 klukkustundir á 24 GB korti.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Keyrðu SmolVLA á sama gagnasafni, óbreyttu

    Sömu gögn, sami armur, 450 M færibreytur í stað 80 M, auk tungumálaskilyrðingar. LeRobot setur 20K skrefa keyrslu í um það bil 4 klukkustundir á einum A100. Þetta er það sem segir þér hvort forþjálfun skilar einhverju.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Umbreyttu niður í v2.1 áður en þú snertir GR00T

    GR00T les útgáfu af LeRobot v2 sniðinu auk aukalegrar meta/modality.json kortlagningar á því hvernig samsett ástand og aðgerðafylki skiptast í nefnd svið. V3.0 gagnasafn veldur því að hleðslutækið hrynur, því v3.0 pakkar mörgum þáttum í sameiginlegar skrár þar sem v2 skrifaði einn á hvern þátt. Isaac-GR00T sendir niðurfærsluhjálparann sem scripts/lerobot_conversion/convert_v3_to_v2.py; v3 höfnunarsíðan er fljótasta leiðin.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Færðu þig yfir í GR00T N1.7 aðeins ef fyrstu tveir skildu eitthvað eftir á borðinu

    Í gegnum CLI NVIDIA, sýnt hér, eða groot stefnugerð LeRobot. NVIDIA mælir með 40 GB eða meira af VRAM fyrir fínstillingu, 16 GB fyrir ályktun. Ef OOM kemur upp, sjá OOM síðuna.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Tvær leiðir til að keyra þessa skimun

Þrjú umhverfi, því verkfærakeðjurnar eru ekki samhæfðar. LeRobot á aðal er 0.6.2 og þarf Python 3.12 eða nýrra; Isaac-GR00T og openpi eru aðskilin uv-stýrð geymslur.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T festir torchcodec 0.8.0 sem eina myndbandsbakenda sinn, sem þarf FFmpeg 4 til 7. FFmpeg 8 er ekki stutt, AV1 ekki tryggt.
  • openpi minnismörk: ályktun yfir 8 GB, LoRA yfir 22.5 GB, full fínstilling yfir 70 GB. Þetta síðasta er ástæðan fyrir því að Pi0.5 er A100 verkefni.
  • Leigðu GPU sjálfur, eyðileggðu hana eftir á, samræmdu þrjú sett af gátpunktaleiðum handvirkt.

Grunnlíkan eða frá grunni

Sanna valið er ekki hvaða 3 B líkan á að velja. Það er hvort nota eigi forþjálfað VLA yfirleitt, miðað við að ACT lærði sex raunveruleg tvíhend verkefni úr um tíu mínútna sýnikennslu hverju, með 80 M færibreytum og ekkert forþjálfað.

Fínstilling á forþjálfuðu VLA í stað þess að þjálfa ACT frá grunni
Hvað þú færð
  • Tungumálaskilyrðing. ACT hefur enga; einn ACT gátpunktur framkvæmir eitt verkefni.
  • Betra á hlutum sem vantar í sýnikennsluna þína: á SO-101, 50% á móti 40% hjá ACT utan dreifingar.
  • Fjölverkefni yfirleitt: SmolVLA nær 78.3% yfir þrjú SO-100 verkefni með einum gátpunkti; ACT var aðeins keyrt sem eitt verkefni.
Hvað það kostar þig
  • 7.6x til 24x seinkun: 152 til 485 ms á hverju aðgerðarskrefi samanborið við 20 ms hjá ACT.
  • 4 til 12 USD á hverri keyrslu í stað 1 til 3, og A100 flokkur í stað hvaða 24 GB korts sem er.
  • Leyfisáhætta, auk bilunarhamur í lokuðu geymslu sem er ekki til frá grunni.
  • Forþjálfaðar vigtir geta falið slæmt gagnasafn. Fínstilling sem virkar hálfvegis á gölluðum gögnum kostar viku áður en þú skoðar gögnin.

Tilfellið að endurtaka gamla keyrslu

Að elta 2025 gátpunkt velur líkanið fyrir þig og breytir vandamálinu í útgáfufestingu: núverandi LeRobot hafnar N1.5, svo þú festir lerobot==0.5.1. Án fræreits og með 5 til 6 prósent frávik milli keyrslna, er endurgerðin nálægt samkvæmt hönnun. Leiðbeiningar fyrir N1.5 á SO-100 og N1.5 stefnusíðan hafa pallhliðina.

Samanburðarsíða AY-Robots fyrir GR00T N1.7 á móti Pi0.5, sem sýnir fjölda færibreyta, kröfur um GPU, ályktunartöf, gagnasnið og lágmarksfjölda þátta hlið við hlið.
Bein samanburður á /compare/groot-n1-7-vs-pi0-5. Líkanin tvö (3 B) virðast skiptanleg á tækniblaði en eru það ekki: annað vill LeRobot v2.1, hitt vill v3.0.

Niður í tvö? ACT á móti GR00T N1.7 og GR00T N1.7 á móti SmolVLA. Hráar raðir eru í vettvangsfærslunum: GR00T N1.7, Pi0.5, SmolVLA og ACT.

Hvar þessi vettvangur hjálpar þér ekki

  • Það getur ekki flýtt fyrir fjárhæðarályktun. Lykkjan sem tekur 20 til 485 ms tilheyrir líkaninu; internetferðir bætast við það.
  • Það getur ekki fínstillt GR00T eða Pi0.5 á þínum eigin vélbúnaði. Bæði eru eingöngu í skýinu hér; aðeins SmolVLA og ACT keyra staðbundið.
  • Það getur ekki lagað gagnasafn. Tap minnkar en stefnan gerir ekkert er gagnamál, stefna sem virkar aðeins í einni uppsetningu er umfjöllunarmál.
  • Það getur ekki gert GR00T keyrslur endurgeranlegar: uppstreymisstillingin hefur ekkert fræreit.

85 líkön, 332 viðmiðunarniðurstöður, hver tala tengd uppruna sínum

Raðanleg útgáfa af töflunum á þessari síðu: 85 sjón-tungumál-aðgerð líkön, 332 viðmiðunarniðurstöður, hver tengd aftur við grein sína eða líkanakort.

Opnaðu vettvanginn

Að velja einn og halda áfram

Einn sjálfgefinn valkostur: skráðu 50 þætti, þjálfaðu ACT fyrir 1 til 3 USD til að sanna gagnasafnið, síðan SmolVLA á sömu gögnum. Samtals undir 6 USD, og þau svara spurningunni sem skiptir máli: hvort forþjálfun hjálpar hér, eða hvort flöskuhálsinn sé gögnin. Farið yfir í GR00T N1.7 fyrir snertiríkar fjölþrepa verkefni, í Pi0.5 þegar senan breytist.

Yfirlit yfir vettvang: þjálfaðu fyrstu stefnu þína, síðan keyrðu fyrstu stefnu þína. þjálfunarskjölin og gagnasafnsskjölin fjalla um form og snið; SO-100 síðan og heildarleiðbeiningar SO-100 fjalla um smíði og kvörðun. Bakgrunnur: VLA yfirlitið og Pi0 flæðisamsvörunargreinin. Það sem mun auka árangurshlutfall þitt er leiðbeiningar um gæði gagna.

Hvaða VLA stefnu ætti ég að þjálfa fyrst á SO-100?

ACT, síðan SmolVLA. ACT þjálfar frá grunni, svo það getur ekki falið slæmt gagnasafn, og keyrsla kostar 1 til 3 USD á 24 GB korti. Ef ACT framkvæmir verkefnið yfirhöfuð, þá eru 4 til 12 USD fyrir GR00T N1.7 eða Pi0.5 keyrslu ekki sóuð.

Er GR00T N1.7 í raun betri en Pi0.5?

Á LIBERO eru þau innan hávaða: 97.0% yfir fjórar svítur fyrir GR00T N1.7, 96.85% fyrir Pi0.5 við 30k skref í openpi, 97.5% fyrir LeRobot útgáfuna, allt frá mismunandi prófunarumhverfum. Raunverulegur munur er 152 ms á aðgerðarskrefi á móti 485 ms, v2.1 gagnasöfn á móti v3.0, og nákvæmni viðmiðunar á móti almennri getu í opnum heimi.

Get ég fínstillt eitthvað af þessu á einu RTX 4090?

SmolVLA og ACT, já; bæði eru skráð fyrir RTX 4090 eða hvaða 24 GB kort sem er og keyra staðbundið. GR00T N1.7, N1.5 og Pi0.5 þurfa A100 eða H100 80 GB og eru eingöngu í skýinu hér. NVIDIA mælir með 40 GB eða meira fyrir GR00T fínstillingu; lágmark openpi er yfir 70 GB fyrir fulla Pi0.5 fínstillingu, 22.5 GB fyrir LoRA.

Hvaða af þessum fimm get ég notað í atvinnuskyni?

GR00T N1.7 þyngdir eru undir NVIDIA Open Model License Agreement, sem kortið segir að nái yfir notkun í atvinnuskyni. N1.5 þyngdir eru ekki til notkunar í atvinnuskyni. Kóði SmolVLA er Apache 2.0 í LeRobot, en lerobot/smolvla_base kortið inniheldur ekkert leyfissvið, svo þyngdirnar eru ótilgreindar. ACT hefur engar grunnþyngdir til að leyfa. Pi0.5 er óljóst: skjöl LeRobot segja Apache 2.0, en lýsigögn kortsins segja license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started