Jedwali la kulinganisha sera za AY-Robots likionyesha GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA na ACT sambamba na idadi ya vigezo, kiwango cha GPU, muda wa kuchelewa wa inference na idadi ndogo ya vipindi
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Ni Sera Ipi ya VLA Unayopaswa Kufunza Mnamo 2026?

AY-Robots ResearchAugust 23, 202618 dakika za kusoma

GR00T N1.7, Pi0.5, SmolVLA, ACT au GR00T N1.5? Jedwali la uamuzi linalolingana na hali halisi, likiwa na nambari za vigezo vilivyochapishwa, muda wa kuchelewa, gharama kwa kila utekelezaji na leseni nyuma ya kila chaguo.

Sera tano zinaweza kufunzwa kwenye mkono wa darasa la SO-100 leo. Zinatofautiana kwa sababu ya 24 katika utekelezaji wa kuchelewa, 37 katika idadi ya vigezo na 12 katika gharama ya utekelezaji, na katika kama unaweza kusafirisha matokeo. Kadi tano za mfano hazitatatua hili: hakuna inayojibu swali ulilo nalo, ni ipi nianze kuendesha kwanza?

Kila nambari hapa chini ilisomwa kutoka kwenye karatasi, repos na kadi mnamo Agosti 2026. Nambari za jukwaa zinatoka from the orodha ya sera za AY-Robots; ambapo zote mbili hazikubaliani, zote zinaonyeshwa.

Toleo fupi

  • Funza ACT kwanza ikiwa una shaka na seti yako ya data: 1 hadi 3 USD kwa utekelezaji, hakuna kilichofunzwa awali kuficha data mbaya.
  • GR00T N1.7 na Pi0.5 ziko ndani ya nusu pointi kwenye LIBERO, 97.0 dhidi ya 96.85 hadi 97.5. Hiyo si sababu ya kuchagua mojawapo.
  • Pi0.5 inalenga ujumuishaji, si usahihi, na ndiyo polepole zaidi kwa 485 ms.
  • SmolVLA, ikiwa na vigezo 450 M, ndiyo VLA pekee hapa inayofanya urekebishaji mzuri kwenye kadi moja ya 24 GB.
  • ACT kwa 20 ms ndiyo chaguo pekee kwa mwendo wa haraka wa kuitikia. Leseni huamua mengine.

Jedwali la maamuzi

Hali yakoFunza hiiKwa nini
Ubora wa data haujathibitishwaACTHakuna kilichofunzwa awali kinachoficha data iliyoharibika, na kushindwa kunagharimu 1 hadi 3 USD.
Inayohitaji mguso mwingi, hatua nyingi, inayoelekezwa na lughaGR00T N1.797.0% katika seti nne za LIBERO, pamoja na nafasi ya hatua ya kiishio cha mkono wa roboti.
Mwendo wa haraka wa kuitikia, utambuzi kwenye servomotorACT20 ms. Inayofuata kwa kasi ni polepole mara 7.6.
Vitu vipya, mandhari mpya, ulimwengu waziPi0.5Imejengwa kwa tabia isiyo ya kawaida, katika hadi maeneo 104.
Kadi moja ya 24 GB, bado unataka lughaSmolVLAVigezo milioni 450, kiwango cha chini cha vipindi 30, inaendeshwa ndani.
Kuzalisha upya uendeshaji uliorekodiwa mwaka 2025GR00T N1.5Ikiwa tu lazima: LeRobot sasa inaikataa, uzito si wa kibiashara.
Hii itasafirishwa kama bidhaaN1.7, SmolVLA or ACTN1.5 si ya kibiashara, Pi0.5 inatumia masharti ya Gemma, kadi ya SmolVLA haisemi chochote.

Wagombea watano

Zote tano ni sera: fremu za kamera, nafasi za viungo na, kwa nne kati yao, maelekezo ya lugha, yaliyopangwa kwa kundi la malengo ya viungo ya baadaye. Kinachowatenganisha ni kiasi gani kilijifunzwa kabla hujafika.

SeraVigezoUcheleweshajiKiwango cha GPUNdani?Vipindi vya chiniUmbizoGharama
ACT~80 M20 ms24 GB cardndiyo50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardndiyo30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBhapana50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBhapana50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBhapana50v3.04 to 12 USD

GR00T N1.7

Muundo wa sasa wa NVIDIA wa muundo wa kuona-lugha-vitendo, takriban vigezo bilioni 3, takriban milioni 40 vilivyofunzwa wakati wa ufunzwaji-laini. Hifadhi inaorodhesha tofauti kutoka N1.6: uti wa mgongo kutoka kwa muundo wa Eagle uliouzwa hadi Cosmos-Reason2-2B kwenye Qwen3-VL, tabaka za usambaaji 32 hadi 16, vipimo vya hali na vitendo 29 hadi 132, upeo wa vitendo 16 hadi 40.

Kinachojalisha kwenye mkono mdogo ni nafasi ya vitendo ya kiishio-mwisho: N1.7 inatabiri tofauti kutoka mkao wa sasa, jambo linaloruhusu saa 20K za video za binadamu za EgoScale kuhamishiwa kwenye sera ya roboti. Maelezo kwenye ukurasa wa N1.7, utaratibu katika mwongozo wa N1.7 kwenye SO-100.

GA kwenye hifadhi, EA kwenye kadi ya muundo

README ya Isaac-GR00T inatangaza N1.7 kuwa toleo la Upatikanaji wa Jumla, lenye vigezo kamili na usaidizi. Kadi yake ya Hugging Face bado haijasasishwa: sehemu ya Model Version bado inasomeka GR00T N1.7 EA. Hifadhi ndio hati mpya zaidi.

GR00T N1.5

Kiwango sawa cha 3 B, uti wa mgongo wa Eagle 2, SigLip2 na T5, kichwa cha DiT kinacholingana na mtiririko. Ipo ili kupanua ulichonacho tayari. Mambo mawili yanaifanya kuwa chaguo-msingi duni: uzito hubeba leseni ya NVIDIA ya matumizi yasiyo ya kibiashara ya njia moja, na matoleo ya sasa ya LeRobot yaliondoa usaidizi wa N1.5. Tazama .

Pi0.5

Ya Physical Intelligence VLA, aina ya sera pi05. Karatasi inatoa VLM ya 2 B iliyoanzishwa kutoka PaliGemma pamoja na mtaalamu wa vitendo wa 300 M, ikiendesha roboti kwa 50 Hz; usanidi wa pi05 wa LeRobot huweka chaguo-msingi kwa kipande cha hatua 50, sekunde moja kwa kiwango hicho. Hoja kuu ya mauzo ni maeneo yasiyoonekana: takriban saa 400 za udanganyifu wa simu katika nyumba halisi, na utafiti wa kuongeza ukubwa juu ya maeneo 3, 12, 22, 53, 82 na 104, ambapo mfumo wa maeneo 104 ulilingana na udhibiti uliofundishwa kwenye nyumba za majaribio zenyewe.

Kikomo kimoja, kilichoelezwa kwenye lerobot/pi05_base kadi: bandari hubeba tu kichwa cha hatua kinacholingana na mtiririko. Utabiri wa kazi ndogo, uwekaji tokeni wa hatua na RL hazikutolewa hapo awali, na openpi inasema vivyo hivyo kuhusu hazina yake. Ukurasa wa Pi0.5 na mwongozo wa Pi0.5 kwenye SO-100 vina mengine.

Mtego unaokula mchana mzima: hazina zilizofungwa

Pi0.5 inahitaji kitoa tokeni kilichofungwa google/paligemma-3b-pt-224 (gated: manual, ingawa Google inasema maombi huchakatwa mara moja). Bila kukikubali na kuendesha hf auth login katika mazingira ya mafunzo, kazi huanza, inapakua kwa muda, kisha inakufa kwa hitilafu ya uidhinishaji inayoonekana kama hitilafu ya mtandao. nvidia/GR00T-N1.7-3B haijafungwa, lakini uti wake wa mgongo nvidia/Cosmos-Reason2-2B umefungwa (gated: auto). Futa zote mbili kabla ya kupanga foleni; ikiwa kazi inakaa bila kufanya kitu, ukurasa wa foleni iliyokwama unaorodhesha nini cha kuangalia.

SmolVLA

Vigezo milioni 450, takriban milioni 100 katika mtaalamu wa hatua, kwenye SmolVLM-2 na VLM ikiwa imegandishwa na tu tabaka zake 16 za kwanza za lugha-modeli zimetumika. Mafunzo ya awali yalikuwa data ya jamii: seti za data 481, fremu milioni 10.6, kutoka kwa mikono ya bei nafuu unayotumia. VLA pekee hapa inayotoshea kadi moja ya 24 GB, na sakafu pekee ya kipindi ya sakafu. Tazama ukurasa wa SmolVLA.

ACT

Sio mfumo msingi. Action Chunking Transformer kutoka ALOHA ina takriban vigezo 80 M vilivyofunzwa kutoka mwanzo kwa kila kazi, kwa maonyesho 50 kwa 50 Hz. Karatasi inaripoti kazi sita halisi za mikono miwili kutoka takriban kumi dakika za maonyesho kila moja, kwa asilimia 80 hadi 90 kwenye mifano inayoangazia. Wazo lake, action chunking, liko katika kila mfumo kwenye ukurasa huu, na upunguzaji wake bado unapima athari bora: zaidi ya kazi mbili zilizosimuliwa na temporal ensembling imezimwa, mafanikio huongezeka kutoka asilimia 1 kwa k=1 hadi 44 asilimia kwa k=100. Ukurasa wa ACT una mengine.

Kile ambacho vigezo vya utendaji vinasema kweli

LIBERO ndicho kigezo kimoja kati ya hivi vitano vinavyoripotiwa: kazi zinazotegemea lugha kwenye mfumo uliosimuliwa wa Franka Panda, zilizogawanywa katika seti nne zifuatazo za kazi kumi kila moja. NVIDIA ilifanya majaribio 200 kwa kila seti.

ModeliKihisi cha NafasiKihisi cha KituLengo10 (Muda Mrefu)Wastani
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Safu hizi hazilinganishwi kikamilifu

Kila nambari inatokana na mfumo na bajeti tofauti. GR00T iliendesha hatua 20K kwa kundi la kimataifa la 640; takwimu ya openpi ni hatua muhimu ya 30K; bandari ya LeRobot iliongeza hatua 6K kwa mfumo msingi wa LIBERO. SmolVLA ina tofauti zaidi: karatasi yake inafundisha safu hiyo kwenye LIBERO kutoka mwanzo, bila mafunzo ya awali ya VLA, wakati zile tatu zilizo juu yake zinasawazisha hatua muhimu zilizofunzwa awali. Chukulia 96.85 hadi 97.5 kama kundi moja, na pengo hadi 87.3% kama halisi lakini lililopatikana kwa vigezo mara 6.7.

SimplerEnv inaonyesha mtawanyiko, ambao LIBERO haionyeshi. NVIDIA inalinganisha N1.7 dhidi ya N1.6, kitu cha karibu zaidi hadharani na delta ya vizazi.

Seti ya SimplerEnvWastani wa N1.6Wastani wa N1.7Mabadiliko BoraMabadiliko Mabaya Zaidi
Bridge (WidowX), kazi 756.6%62.3%stack_cube 5.0 hadi 48.0put_eggplant_in_basket 89.0 hadi 53.0
Fractal (Google Robot), kazi 652.0%72.5%open_drawer 0.0 hadi 65.0hakuna, kila kazi iliboreshwa

Safu ya Bridge ndiyo yenye manufaa: pointi 5.7 zilizopatikana kwa wastani wakati put_eggplant_in_basket ilipoteza 36 na put_eggplant_in_sink ilishuka kutoka 33 hadi 2. Kizazi kipya husogeza usambazaji badala ya kuuinua, hivyo ikiwa kazi yako iko mahali ambapo N1.7 ilirudi nyuma, wastani hausemi chochote.

Ubao wa wanaoongoza wa AY-Robots, jedwali linaloweza kupangwa la mifumo 85 ya kuona-lugha-vitendo na matokeo 332 ya vigezo, kila thamani ikiwa imeunganishwa na karatasi au kadi ya mfumo iliyotoka
Uwanja una mifumo 85 ya VLA na matokeo 332 ya vigezo, kila moja ikiwa imeunganishwa na karatasi yake au kadi ya mfumo. Inafaa kwa kuangalia kama nambari iliyonukuliwa kwenye chapisho la blogu ni halisi.

Kati ya tano, ni karatasi ya SmolVLA pekee inayoripoti juu ya mkono wa darasa la SO-100: asilimia 78.3 kwa SmolVLA na 61.7 kwa Pi0 katika kazi tatu, zote za kazi nyingi, dhidi ya 48.3 kwa ACT iliyefunzwa kazi moja, ambayo si kama kwa kama. Ulinganifu safi ni kazi moja kwa SO-101 ya kuchukua na kuweka: 90 dhidi ya 70 katika usambazaji, 50 dhidi ya 40 nje yake. Linganisha kwenye ACT dhidi ya SmolVLA na Pi0.5 dhidi ya SmolVLA, au chunguza uwanja.

Ucheleweshaji na gharama huamua usambazaji

Ucheleweshaji wa utambuzi ndio kikwazo ambacho watu hugundua mwisho na hujuta kwanza. Sera iliyo bora kwa pointi tano kwenye kipimo cha utendaji lakini nusu sekunde kwa kila hatua ya kitendo huonekana mbaya zaidi kwenye dawati lako: mwingiliano wa nguvu haungoji.

Tahadhari moja: takwimu ya GR00T haikubaliani na kadi ya NVIDIA, ambayo hupima hatua 4 za kuondoa kelele na kamera moja kwa 85.8 ms kwenye H100 katika hali ya eager, 48.6 ms na torch.compile, 27.9 ms kupitia TensorRT kamili. 152 ms hapa ni takwimu ya mfumo mzima ikiwa na gharama za huduma na kamera zaidi ya moja, sio pasi ya mbele.

Utambuzi wa mbali una kikomo kigumu

Mzunguko wa 20 hadi 485 ms ni wa modeli, na safari za kwenda na kurudi kwenye intaneti ya umma huongeza muda. Utambuzi wa mbali unawezekana kwa kazi za polepole za kuchukua na kuweka, sio kwa mwendo wa haraka wa kuitikia. Ikiwa kazi yako inahitaji kasi, utambuzi hukaa karibu na servomotor: ACT au SmolVLA, ndani. Inayohusiana: sera inaganda katikati ya mwendo.

Njia moja ya kununua muda bila kubadilisha modeli: karatasi ya SmolVLA inapima utekelezaji wa synchronous, ambapo sera inamaliza sehemu kabla ya kutabiri inayofuata, dhidi ya asynchronous, ambapo utabiri unaingiliana na utekelezaji. Mafanikio ni sawa, 78.3 dhidi ya 73.3, lakini kazi hiyo hiyo ya kuchukua na kuweka inachukua sekunde 9.7 badala ya 13.75, na katika dirisha maalum roboti inasimamia mizunguko 19 badala ya 9.

Leseni, zimekaguliwa kwa sababu hakuna anayezikagua

ModeliLeseni ya UzitoLeseni ya MsimboMatumizi ya kibiashara
GR00T N1.7NVIDIA Open Model License; kadi inaruhusu matumizi ya kibiasharaApache 2.0ndiyo
GR00T N1.5Leseni ya NVIDIA ya matumizi yasiyo ya kibiashara ya njia mojaApache 2.0hapana
Pi0.5Metadata ya kadi ya pi05_base inasoma leseni: gemmaApache 2.0 (openpi, LeRobot docs)soma zote mbili, zinatofautiana
SmolVLAhakuna sehemu ya leseni kwenye kadi ya smolvla_baseApache 2.0 (LeRobot)msimbo ndiyo, uzito haujaelezwa
ACThakuna uzito wa msingi uliopoApache 2.0 (LeRobot)ndiyo

Safu ya Pi0.5 inahitaji uangalifu. Nyaraka za LeRobot pi05 zinasema Apache 2.0 inayoendana na openpi, wakati kadi ya Hub ya lerobot/pi05_base inabeba license: gemma. Zote mbili ziko hai. GR00T N1.7 ina toleo laini zaidi: README ya Isaac-GR00T inasema kwa kupita kwamba N1.7 ina leseni kamili ya kibiashara chini ya Apache 2.0, wakati sehemu yake ya leseni na kadi ya modeli huweka msimbo tu chini ya Apache 2.0 na uzito chini ya NVIDIA Open Model License.

Mipangilio chaguomsingi utakayoendesha

Kila fomu ya mkufunzi huja na mipangilio chaguomsingi, na si ya kiholela. Ya ACT ni ya LeRobot yenyewe: batch 8, lr 1e-5, 100000 hatua za mafunzo, ukubwa wa chunk 100, unaolingana na ACTConfig ya juu na k=100 kutoka karatasi ya ACT. Safu moja hapa chini ni mtego.

SeraKundiLRHatua za juuGrad accumInatumika?Vifundo vya ziada
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Uwezo wa Kurudia, tarehe Agosti 2026

Sehemu ya kuanzia ya GR00T ya kurekebisha (launch_finetune.py, CLI ya tyro) haina sehemu ya seed katika dataclass yake ya usanidi, kwa hivyo uendeshaji hauwezi kurudiwa kwa usahihi wa biti kwa biti. Repo pia inaonya kuhusu tofauti ya asilimia 5 hadi 6 kati ya uendeshaji kutokana na nyongeza za picha zisizo za uhakika, kubwa kuliko mapengo mengi ya vigezo yanayojadiliwa mtandaoni. Seed chaguomsingi ya LeRobot ni 1000. Safu ya grad-accum inaelezea lerobot 0.5.1; toleo la juu 0.6.2 linaionyesha kama --accelerator.gradient_accumulation.steps.

Kifundo kinachojalisha zaidi kuliko chaguo la modeli

Huu ni mrundiko wa vitendo. Mirundiko mirefu hutoa mwendo laini zaidi na makosa machache yanayojirudia, lakini sera inatekelezwa wakati kizuizi kinapofanya kazi, kwa hivyo hujibu polepole kwa chochote kinachotembea: inajiamini kwenye mchemraba tuli, haina matumaini kwenye mchemraba unaozunguka. Ikiwa itapita kiasi, kufupisha sehemu iliyotekelezwa ni bora kuliko kufundisha upya na ni bure. Kiungo kinachosimama ghafla ni tatizo tofauti; angalia .

  • ACT: ACTConfig defaults to chunk_size 100 and n_action_steps 100. Ukusanyaji wa muda umezimwa na unahitaji n_action_steps 1.
  • GR00T N1.7: upeo wa ndani ulienda kutoka 16 hadi 40, lakini mfano wa SO-101 wa LeRobot bado unaendesha --policy.chunk_size=16 --policy.n_action_steps=16. Bendera ya rollout ilibadilishwa jina kuwa --execution-horizon.
  • Pi0.5: mrundiko wa hatua 50, ambapo mapishi ya LIBERO ya LeRobot hutekeleza 10 kupitia --policy.n_action_steps=10; nayo hurudi kwenye 50 ukikosa kuweka bendera --policy.pretrained_path.
  • SmolVLA: mirundiko ya vitendo 50, vifundo vyote viwili vimefichuliwa.

Jinsi ya kuchunguza zote tano kwa alasiri moja

Jibu la bei nafuu si kusoma zaidi. Tumia takriban 15 USD na uache mkono ukueleze: rekodi mara moja, fundisha kielelezo cha bei nafuu kwanza, kisha ongeza kiwango mara tu data imethibitishwa kuwa sahihi. Muundo ni bora kuliko wingi, lengo la na .

  1. 1
    Rekodi vipindi 50 mara moja

    Hamsini husafisha njia kwa GR00T, Pi0.5 na ACT, na 30 ya SmolVLA. Rudia kila tofauti badala ya kusambaza kidogo: vipindi 50 katika nafasi 5 za mchemraba vilivyofunzwa ambapo 25 havikuwa. Tazama rekodi seti yako ya kwanza ya data.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Funza ACT kwanza, kwa sababu haiwezi kukudanganya

    Hakuna uzito uliofunzwa awali, kwa hivyo ikiwa inafanya kazi kabisa, seti yako ya data ina kazi hiyo. Ikiwa ACT itashindwa, rekebisha data. 1 hadi 3 USD, saa 2 hadi 5 kwenye kadi ya 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Endesha SmolVLA kwenye seti ya data ileile, bila kubadilishwa

    Data sawa, mkono sawa, vigezo milioni 450 badala ya milioni 80, pamoja na masharti ya lugha. LeRobot huweka hatua 20K kukimbia kwa takriban saa 4 kwenye A100 moja. Hii ndiyo inayokuambia kama mafunzo ya awali yanaleta faida yoyote.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Badilisha hadi v2.1 kabla ya kugusa GR00T

    GR00T husoma toleo la umbizo la LeRobot v2 pamoja na meta/modality.json ya ziada inayoonyesha jinsi hali iliyounganishwa na safu za vitendo zinavyogawanyika katika sehemu zenye majina. Seti ya data ya v3.0 huangusha kipakiaji hicho, kwa sababu v3.0 huweka vipindi vingi kwenye faili zilizoshirikiwa ambapo v2 iliandika kimoja kwa kila kipindi. Isaac-GR00T husafirisha msaidizi wa kupunguza toleo kama scripts/lerobot_conversion/convert_v3_to_v2.py; ukurasa wa kukataa v3 ndiyo njia ya haraka.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Panda hadi GR00T N1.7 tu ikiwa zile mbili za kwanza ziliacha kitu mezani

    Kupitia CLI ya NVIDIA, iliyoonyeshwa hapa, au aina ya sera ya LeRobot ya groot. NVIDIA inapendekeza 40 GB au zaidi ya VRAM kwa urekebishaji mzuri, 16 GB kwa inference. Katika OOM, tazama ukurasa wa OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Njia mbili za kuendesha uchunguzi huo

Mazingira matatu, kwa sababu minyororo ya zana haipo pamoja. LeRobot kwenye main ni 0.6.2 na inahitaji Python 3.12 au mpya zaidi; Isaac-GR00T na openpi ni repos tofauti zinazosimamiwa na uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T huweka torchcodec 0.8.0 kama backend yake pekee ya video, ikihitaji FFmpeg 4 hadi 7. FFmpeg 8 haitumiki, AV1 haijahakikishiwa.
  • Viwango vya chini vya kumbukumbu vya openpi: inference zaidi ya 8 GB, LoRA zaidi ya 22.5 GB, fine-tuning kamili zaidi ya 70 GB. Hiyo ya mwisho ndiyo sababu Pi0.5 ni kazi ya A100.
  • Kodisha GPU mwenyewe, iharibu baadaye, linganisha seti tatu za njia za checkpoint kwa mkono.

Mfumo wa msingi au kuanzia mwanzo

Mgawanyiko halisi si kuchagua modeli gani ya 3 B. Ni kama kutumia VLA iliyefunzwa awali kabisa, kutokana na kwamba ACT ilijifunza kazi sita halisi za mikono miwili kutoka takriban dakika kumi za maonyesho kila moja, ikiwa na vigezo 80 M na hakuna kilichofunzwa awali.

Kurekebisha VLA iliyefunzwa awali badala ya kufunza ACT kutoka mwanzo
Unachopata
  • Masharti ya lugha. ACT haina; kituo kimoja cha ukaguzi cha ACT hufanya kazi moja.
  • Bora kwenye vitu visivyokuwepo kwenye maonyesho yako: kwenye SO-101, 50% dhidi ya 40% ya ACT nje ya usambazaji.
  • Kazi nyingi kabisa: SmolVLA inafikia 78.3% katika kazi tatu za SO-100 na kituo kimoja cha ukaguzi; ACT iliendeshwa kazi moja tu.
Gharama kwako
  • Ucheleweshaji mara 7.6 hadi 24: 152 hadi 485 ms kwa hatua ya kitendo dhidi ya 20 ms ya ACT.
  • 4 hadi 12 USD kwa kila utekelezaji badala ya 1 hadi 3, na kiwango cha A100 badala ya kadi yoyote ya 24 GB.
  • Mfiduo wa leseni, pamoja na hali ya kushindwa ya repo iliyofungwa ambayo haipo kutoka mwanzo.
  • Uzito uliofunzwa awali unaweza kuficha seti mbaya ya data. Marekebisho yanayofanya kazi nusu kwenye data iliyoharibika hugharimu wiki kabla ya kuangalia data.

Kesi ya kurudia utekelezaji wa zamani

Kufuatilia kituo cha ukaguzi cha 2025 kunakufanyia uchaguzi wa modeli na kugeuza tatizo kuwa uwekaji wa toleo: LeRobot ya sasa inakataa N1.5, kwa hivyo unaweka lerobot==0.5.1. Bila uga wa mbegu na tofauti ya asilimia 5 hadi 6 kati ya utekelezaji, uzazi ni wa kukadiria kwa ujenzi. na zina upande wa jukwaa.

Ukurasa wa kulinganisha wa AY-Robots wa GR00T N1.7 dhidi ya Pi0.5, ukionyesha idadi ya vigezo, mahitaji ya GPU, muda wa kusababisha, muundo wa seti ya data na idadi ya chini ya vipindi sambamba.
Ulinganisho wa moja kwa moja kwenye /compare/groot-n1-7-vs-pi0-5. Miundo miwili ya 3 B inaonekana inaweza kubadilishana kwenye karatasi ya vipimo lakini sivyo: mmoja anataka LeRobot v2.1, mwingine anataka v3.0.

Imepungua hadi miwili? ACT dhidi ya GR00T N1.7 na GR00T N1.7 dhidi ya SmolVLA. Safu wima ghafi ziko kwenye viingilio vya uwanja: GR00T N1.7, Pi0.5, SmolVLA na ACT.

Ambapo jukwaa hili halikusaidii

  • Haliwezi kufanya utambuzi wa mbali kuwa wa haraka. Mzunguko wa 20 hadi 485 ms ni wa mfumo; safari za mtandao huongeza muda huo.
  • Haliwezi kurekebisha GR00T au Pi0.5 kwenye maunzi yako mwenyewe. Zote hapa ni za wingu pekee; ni SmolVLA na ACT pekee zinazofanya kazi ndani ya nchi.
  • Haliwezi kurekebisha seti ya data. Hasara inapungua lakini sera haifanyi chochote ni tatizo la data, sera inayofanya kazi katika mpangilio mmoja tu ni tatizo la chanjo.
  • Haliwezi kufanya uendeshaji wa GR00T uweze kurudiwa: usanidi wa juu hauna sehemu ya mbegu.

Mifumo 85, matokeo 332 ya vigezo, kila nambari imeunganishwa na chanzo chake

Toleo linaloweza kupangwa la majedwali kwenye ukurasa huu: mifumo 85 ya maono-lugha-vitendo, matokeo 332 ya vigezo, kila moja ikiwa imeunganishwa na karatasi yake au kadi ya mfumo.

Fungua uwanja

Kuchagua moja na kuendelea

Chaguo-msingi moja: rekodi vipindi 50, fundisha ACT kwa 1 hadi 3 USD ili kuthibitisha seti ya data, kisha SmolVLA kwenye data hiyo hiyo. Chini ya 6 USD kwa pamoja, na zinajibu swali muhimu: kama mafunzo ya awali yanasaidia hapa, au kama kikwazo ni data. Tumia GR00T N1.7 kwa kazi zenye hatua nyingi na zenye mguso, tumia Pi0.5 wakati mandhari inabadilika.

Mwongozo wa jukwaa: fundisha sera yako ya kwanza, kisha endesha sera yako ya kwanza. Ya nyaraka za mafunzo na nyaraka za seti ya data inashughulikia fomu na umbizo; ukurasa wa SO-100 na mwongozo kamili wa SO-100 inashughulikia ujenzi na usawazishaji. Mandharinyuma: muhtasari wa VLA na makala ya Pi0 flow-matching. Ile itakayoboresha kiwango chako cha mafanikio ni mwongozo wa ubora wa data.

Ni sera gani ya VLA ninapaswa kufundisha kwanza kwenye SO-100?

ACT, kisha SmolVLA. ACT hufundisha kuanzia mwanzo, kwa hivyo haiwezi kuficha seti mbaya ya data, na uendeshaji unagharimu 1 hadi 3 USD kwenye kadi ya 24 GB. Ikiwa ACT inafanya kazi hiyo kabisa, 4 hadi 12 USD kwa uendeshaji wa GR00T N1.7 au Pi0.5 haipotei.

Je, GR00T N1.7 ni bora zaidi kuliko Pi0.5?

Kwenye LIBERO ziko ndani ya kelele: 97.0% katika seti nne za GR00T N1.7, 96.85% kwa Pi0.5 kwa hatua 30k katika openpi, 97.5% kwa toleo la LeRobot, zote kutoka kwa mifumo tofauti. Tofauti halisi ni 152 ms kwa kila hatua ya kitendo dhidi ya 485 ms, seti za data za v2.1 dhidi ya v3.0, na usahihi wa benchmark dhidi ya ujumuishaji wa ulimwengu wazi.

Je, ninaweza kurekebisha yoyote kati ya hizi kwenye RTX 4090 moja?

SmolVLA na ACT, ndiyo; zote zimeorodheshwa kwa RTX 4090 au kadi yoyote ya 24 GB na huendeshwa ndani. GR00T N1.7, N1.5 na Pi0.5 zinahitaji A100 au H100 80 GB na zinapatikana tu kwenye wingu hapa. NVIDIA inapendekeza 40 GB au zaidi kwa kurekebisha GR00T; kiwango cha chini cha openpi ni zaidi ya 70 GB kwa kurekebisha kamili kwa Pi0.5, 22.5 GB kwa LoRA.

Ni ipi kati ya hizi tano ninaweza kutumia kibiashara?

Uzito wa GR00T N1.7 uko chini ya Mkataba wa Leseni ya Mfumo Huria wa NVIDIA, ambao kadi inasema unajumuisha matumizi ya kibiashara. Uzito wa N1.5 sio wa kibiashara. Msimbo wa SmolVLA ni Apache 2.0 katika LeRobot, lakini kadi ya lerobot/smolvla_base haina sehemu ya leseni, kwa hivyo uzito haujaelezwa. ACT haina uzito wa msingi wa kutoa leseni. Pi0.5 ina utata: nyaraka za LeRobot zinasema Apache 2.0, metadata ya kadi yake inasomeka license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started