AY-Robots politiku salīdzināšanas tabula, kas blakus rāda GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT ar parametru skaitu, GPU līmeni, secinājumu latentumu un minimālo epizožu skaitu
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Kuru VLA politiku jums vajadzētu apmācīt 2026. gadā?

AY-Robots ResearchAugust 23, 202618 minūtes lasīšanai

GR00T N1.7, Pi0.5, SmolVLA, ACT vai GR00T N1.5? Lēmumu tabula, kas pielāgota reālām situācijām, ar publicētajiem etalonu rādītājiem, latentumu, izmaksām par izpildi un licencēm katrai izvēlei.

Piecas politikas šodien ir apmācāmas uz SO-100 klases rokas. Tās atšķiras par 24 reizēm secinājumu latentumā, 37 parametru skaitā un 12 izmaksās par vienu izpildi, kā arī tajā, vai drīkstat piegādāt rezultātu. Piecas modeļu kartes to neatrisinās: neviena neatbild uz jūsu jautājumu, kuru man palaist pirmo?

Katrs zemāk norādītais skaitlis tika nolasīts no dokumentiem, repozitorijiem un kartēm 2026. gada augustā. Platformas skaitļi nāk no AY-Robots politiku kataloga; kur abi atšķiras, tiek parādīti abi.

Īsā versija

  • Vispirms apmāciet ACT, ja šaubāties par savu datu kopu: 1 līdz 3 USD par izpildi, nekas iepriekš apmācīts, lai slēptu sliktus datus.
  • GR00T N1.7 un Pi0.5 atrodas puspunkta robežās LIBERO, 97.0 pret 96.85 līdz 97.5. Tas nav iemesls izvēlēties nevienu no tiem.
  • Pi0.5 ir vispārināšanas spēle, nevis precizitātes spēle, un lēnākais ar 485 ms.
  • SmolVLA, ar 450 M parametriem, ir vienīgais VLA šeit, kas precīzi noskaņojas uz vienas 24 GB kartes.
  • ACT ar 20 ms ir vienīgā iespēja ātrai reaktīvai kustībai. Licences izlemj pārējo.

Lēmumu tabula

Jūsu situācijaApmācīt šoKāpēc
Datu kopas kvalitāte nav pierādītaACTNekas iepriekš apmācīts neslēpj bojātu datu kopu, un kļūmes izmaksā 1 līdz 3 USD.
Bagāts ar kontaktiem, daudzpakāpju, valodu kondicionētsGR00T N1.797.0% četrās LIBERO komplektācijās, plus relatīva gala efektora darbības telpa.
Ātra reaktīva kustība, secinājumi pie servomotoriemACT20 ms. Nākamais ātrākais ir 7.6 reizes lēnāks.
Jauni objekti, jauna aina, atvērta pasaulePi0.5Radīts ārpus izplatīšanas uzvedībai, līdz pat 104 vietām.
Viena 24 GB karte, joprojām vēlas valoduSmolVLA450 M parametri, 30 epizožu grīda, darbojas lokāli.
2025. gadā ierakstīta izpildes reproducēšanaGR00T N1.5Tikai, ja jums tas ir jādara: LeRobot tagad to noraida, svari nav komerciāli.
Tas tiks piegādāts kā produktsN1.7, SmolVLA or ACTN1.5 nav komerciāls, Pi0.5 ietver Gemma noteikumus, SmolVLA kartē nav norādīts nekas.

Pieci kandidāti

Visi pieci ir politikas: kameras kadri, savienojumu pozīcijas un, četriem no tiem, valodu instrukcija, kas kartēta uz nākotnes savienojumu mērķu bloku. Tas, kas tos atšķir, ir tas, cik daudz tika apgūts pirms jūsu ierašanās.

PolitikaParametriLatentumsGPU līmenisLokāli?Min. epizodesFormātsIzmaksas
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA pašreizējais redzes-valodu-darbības modelis, aptuveni 3 miljardi parametru, aptuveni 40 miljoni apmācīti precizēšanas. Repozitorijs uzskaita atšķirības no N1.6: pamats no piegādātāja Eagle modeļa uz Cosmos-Reason2-2B uz Qwen3-VL, difūzijas slāņi no 32 uz 16, stāvokļa un darbības dimensijas no 29 uz 132, darbības horizonts no 16 uz 40.

Mazam manipulatoram svarīga ir relatīvā gala efektora darbības telpa: N1.7 prognozē atšķirības no pašreizējās pozas, kas ļauj 20 tūkstošiem stundu EgoScale cilvēka video pārnest uz robota politiku. Specifikācija N1.7 lapā, procedūra N1.7 uz SO-100 ceļvedī.

GA repozitorijā, EA modeļa kartē

Isaac-GR00T README deklarē N1.7 kā Vispārējās pieejamības izlaidumu, ar pilnīgiem etaloniem un atbalstu. Tā Hugging Face karte vēl nav atjaunināta: Model Version lauks joprojām rāda GR00T N1.7 EA. Repozitorijs ir jaunākais dokuments.

GR00T N1.5

Tāda pati 3 B mēroga, Eagle 2 mugurkauls, SigLip2 un T5, plūsmas saskaņošanas DiT galva. Tā pastāv, lai paplašinātu kontrolpunktu jums jau ir. Divas lietas padara to par sliktu noklusējuma izvēli: svariem ir NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. Skatīt N1.7 pret N1.5.

Pi0.5

Physical Intelligence's plūsmas saskaņošanas VLA, politikas tips pi05. Rakstā aprakstīts 2 B VLM, kas inicializēts no PaliGemma, plus 300 M darbības eksperts, kas vada robotu ar 50 Hz; LeRobot's pi05 konfigurācija pēc noklusējuma izmanto 50 soļu gabalu, vienu sekundi ar šādu ātrumu. Pārdošanas arguments ir neredzētas vietas: apmēram 400 stundas mobilās manipulācijas reālās mājās un mērogošanas pētījums par 3, 12, 22, 53, 82 un 104 vietām, kur 104 vietu modelis atbilda kontrolei, kas apmācīta pašās testa mājās.

Viens ierobežojums, norādīts uz lerobot/pi05_base kartes: ports nodrošina tikai plūsmai atbilstošu darbības galviņu. Apakšuzdevumu prognozēšana, darbību tokenizācija un RL netika izlaisti augšup, un openpi to pašu saka par savu repozitoriju. Pi0.5 lapa un Pi0.5 uz SO-100 ceļvedis ir pārējais.

Slazds, kas apēd pēcpusdienu: aizsargātie repozitoriji

Pi0.5 ir nepieciešams aizsargātais google/paligemma-3b-pt-224 tokenizators (gated: manual, lai gan Google apgalvo, ka pieprasījumi tiek apstrādāti nekavējoties). Neapstiprinot to un nepalaižot hf auth login apmācības vidē, darbs sākas, kādu laiku lejupielādē, pēc tam apstājas ar autorizācijas kļūdu, kas izskatās pēc tīkla kļūmes. nvidia/GR00T-N1.7-3B nav aizsargāts, bet tā nvidia/Cosmos-Reason2-2B pamatne ir (gated: auto). Notīriet abus pirms ievietošanas rindā; ja izpilde stāv dīkā, iestrēgušo rindu lapa uzskaita, kas jāpārbauda.

SmolVLA

450 M parametri, aptuveni 100 M darbības ekspertā, uz SmolVLM-2 ar iesaldētu VLM un izmantojot tikai tā pirmos 16 valodu modeļa slāņus. Iepriekšējā apmācība bija kopienas dati: 481 datu kopas, 10.6 M kadri, no tiem pašiem lētajiem manipulatoriem, ko izmantojat. Vienīgais VLA šeit, kas der vienai 24 GB kartei, un vienīgais 30 epizodes grīda. Skatīt SmolVLA lapu.

ACT

Nav pamata modelis. ALOHA Action Chunking Transformer ir aptuveni 80 M parametru, kas apmācīti no nulles katram uzdevumam, balstoties uz 50 demonstrācijām ar 50 Hz. Rakstā ziņots par sešiem reāliem divroku uzdevumiem no aptuveni desmit minūtēm demonstrāciju katram, ar 80 līdz 90 procentu veiksmi izceltajos piemēros. Tā ideja, darbību sadalīšana, ir katrā modelī šajā lapā, un tā ablācija joprojām mēra efektu vislabāk: divos simulētos uzdevumos ar izslēgtu laika ansamblēšanu, veiksme pieaug no 1 procenta pie k=1 līdz 44 procentiem pie k=100. ACT lapa ir pārējais.

Ko patiesībā saka etaloni

LIBERO ir viens etalons, par kuru ziņo trīs no šiem pieciem: valodu vadīti uzdevumi uz simulēta Franka Panda, sadalīts četrās zemāk norādītajās svītās pa desmit uzdevumiem katrā. NVIDIA veica 200 izmēģinājumus katrā svītā.

ModelisTelpisksObjektsMērķis10 (Garš)Vidējais
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Šīs rindas nav stingri salīdzināmas

Katrs skaitlis nāk no atšķirīgas testēšanas sistēmas un budžeta. GR00T veica 20K soļus ar globālo partiju 640; openpi rādītājs ir 30K kontrolpunkts; LeRobot ports pievienoja 6K soļus LIBERO bāzes modelim. SmolVLA ir vēl viena neatbilstība: tā raksts apmāca šo rindu uz LIBERO no nulles, bez VLA iepriekšējas apmācības, kamēr trīs iepriekšējie precizē iepriekš apmācītus kontrolpunktus. Uztveriet 96.85 līdz 97.5 kā vienu klasteri, un atšķirību līdz 87.3% kā reālu, bet iegūtu ar 6.7x vairāk parametriem.

SimplerEnv parāda izkliedi, ko LIBERO nedara. NVIDIA salīdzina N1.7 ar N1.6, kas ir tuvākais publiskais "paaudžu deltas" analogs.

SimplerEnv komplektsN1.6 vidējaisN1.7 vidējaisLabākā svārstībaSliktākā svārstība
Bridge (WidowX), 7 uzdevumi56.6%62.3%stack_cube 5.0 līdz 48.0put_eggplant_in_basket 89.0 līdz 53.0
Fractal (Google Robot), 6 uzdevumi52.0%72.5%open_drawer 0.0 līdz 65.0nav, katrs uzdevums uzlabojās

Rinda Bridge ir noderīgā: vidēji iegūti 5,7 punkti, kamēr put_eggplant_in_basket zaudēja 36 un put_eggplant_in_sink samazinājās no 33 līdz 2. Jauna paaudze pārvieto sadalījumu, nevis to paceļ, tāpēc, ja jūsu uzdevums atrodas tur, kur N1.7 regresēja, vidējais rādītājs neko nepasaka.

AY-Robots arēnas līderu saraksts, šķirojama tabula ar 85 redzes-valodas-darbības modeļiem un 332 etalonuzdevumu rezultātiem, katra vērtība ir saistīta ar rakstu vai modeļa karti, no kuras tā nākusi
Arēnā ir 85 VLA modeļi un 332 etalonuzdevumu rezultāti, katrs no tiem ir saistīts ar tā rakstu vai modeļa karti. Noderīgi, lai pārbaudītu, vai bloga ierakstā citētais skaitlis ir patiess.

No pieciem tikai SmolVLA raksts ziņo par SO-100 klases robotu roku: 78,3 procenti SmolVLA un 61,7 Pi0 trīs uzdevumos, abi daudzuzdevumu, pret 48,3 ACT apmācītam viena uzdevuma modelim, kas nav salīdzināms. Tīrais pāris ir abi viena uzdevuma modeļi SO-101 paņemšanas un novietošanas uzdevumā: 90 pret 70 sadalījumā, 50 pret 40 ārpus tā. Salīdziniet ar ACT pret SmolVLA un Pi0.5 pret SmolVLA, vai pārlūkojiet arēnu.

Latentums un izmaksas nosaka izvietošanu

Inferences latentums ir ierobežojums, ko cilvēki atklāj pēdējo un nožēlo pirmo. Politika, kas ir piecus punktus labāka etalonā, bet pussekundi uz darbības soli, izskatās sliktāk uz jūsu galda: kontakta dinamika negaida.

Viens brīdinājums: GR00T rādītājs nesakrīt ar NVIDIA kartes datiem, kas mēra 4 trokšņu samazināšanas soļus un vienu kameru pie 85.8 ms uz H100 in eager mode, 48.6 ms ar torch.compile, 27.9 ms caur full TensorRT. Šeit minētie 152 ms ir visa steka rādītājs ar apkalpošanas izmaksām un vairākām kamerām, nevis tikai forward pass.

Attālajai secināšanai ir stingrs ierobežojums

20 līdz 485 ms cilpa ir modeļa, un publiskā interneta apmaiņas laiks to papildina. Attālā secināšana ir piemērota lēnai pick-and-place darbībai, nevis ātrai reaktīvai kustībai. Ja jūsu uzdevumam nepieciešams ātrums, secināšana atrodas blakus servomotoriem: ACT vai SmolVLA, lokāli. Saistīts: politika sastingst kustības vidū.

Viens veids, kā iegūt laiku, nemainot modeli: SmolVLA rakstā tiek mērīta sinhrona izpilde, kur politika pabeidz vienu daļu pirms nākamās prognozēšanas, pretstatā asinhronai, kur prognozēšana pārklājas ar izpildi. Veiksme ir līdzīga, 78.3 pret 73.3, bet tas pats pick-and-place aizņem 9.7 sekundes, nevis 13.75, un fiksētā logā robots veic 19 ciklus, nevis 9.

Licences, pārbaudītas, jo neviens tās nepārbauda

ModelisSvaru licenceKoda licenceKomerciāla izmantošana
GR00T N1.7NVIDIA Open Model License; karte atļauj komerciālu izmantošanuApache 2.0
GR00T N1.5NVIDIA vienvirziena nekomerciāla licenceApache 2.0
Pi0.5pi05_base kartes metadatos norādīta licence: gemmaApache 2.0 (openpi, LeRobot dokumentācija)izlasiet abus, tie atšķiras
SmolVLAsmolvla_base kartē nav licences laukaApache 2.0 (LeRobot)kods jā, svari nav norādīti
ACTnav pamata svaruApache 2.0 (LeRobot)

Pi0.5 rinda prasa uzmanību. LeRobot pi05 dokumentācija norāda Apache 2.0, kas atbilst openpi, kamēr Hub karte priekš lerobot/pi05_base satur license: gemma. Abi ir aktīvi. GR00T N1.7 ir maigāka versija: Isaac-GR00T README garāmejot norāda, ka N1.7 ir pilnībā komerciāli licencējams saskaņā ar Apache 2.0, kamēr tā paša licences sadaļa un modeļa karte kodu iekļauj tikai zem Apache 2.0 un svarus zem NVIDIA Open Model License.

Noklusējuma iestatījumi, ko jūs faktiski palaidīsiet

Katrs apmācības veids nāk ar noklusējuma iestatījumiem, un tie nav patvaļīgi. ACT ir LeRobot pašu: 8. partija, lr 1e-5, 100000 apmācības soļi, bloka izmērs 100, atbilstoši ACTConfig augšupējai versijai un k=100 no ACT dokumenta. Viena kolonna zemāk ir slazds.

PolitikaPakešu izmērsLRMaksimālie soļiGrada akumulācijaPiemērojams?Papildu parametri
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Atkārtojamība, datēta ar 2026. gada augustu

GR00T smalkās pielāgošanas sākumpunktam (launch_finetune.py, tyro CLI) tā konfigurācijas datu klasē nav sēklas lauka, tāpēc izpildes nav bitu-pa-bitam atkārtojamas. Repozitorijs arī brīdina par 5 līdz 6 procentu atšķirībām starp izpildēm, ko rada nedeterminētas attēlu paplašināšanas, kas ir lielākas nekā vairums tiešsaistē apspriesto etalonu atšķirību. LeRobot noklusējuma sēkla ir 1000. Grada akumulācijas kolonna apraksta lerobot 0.5.1; augšupējā versija 0.6.2 to atklāj kā --accelerator.gradient_accumulation.steps.

Parametrs, kas ir svarīgāks par modeļa izvēli

Tas ir darbības bloks. Garāki bloki nodrošina vienmērīgāku kustību un mazāk kumulatīvu kļūdu, taču politika tiek apstiprināta, kamēr bloks izpildās, tāpēc tā reaģē vēlu uz jebko, kas kustas: pārliecināta uz statiska kuba, bezcerīga uz ritoša kuba. Ja tā pārsniedz mērķi, izpildītās daļas saīsināšana ir labāka par atkārtotu apmācību un ir bez maksas. Savienojums, kas apstājas par agru, ir cita problēma; skatiet .

  • ACT: ACTConfig noklusējuma iestatījumi ir chunk_size 100 un n_action_steps 100. Laika ansamblis ir izslēgts un prasa n_action_steps 1.
  • GR00T N1.7: iekšējais horizonts mainījās no 16 uz 40, tomēr LeRobot SO-101 piemērs joprojām izpilda --policy.chunk_size=16 --policy.n_action_steps=16. Izpildes karogs tika pārdēvēts par --execution-horizon.
  • Pi0.5: 50 soļu bloks, no kura LeRobot LIBERO recepte izpilda 10, izmantojot --policy.n_action_steps=10; ar --policy.pretrained_path tas atgriežas pie 50, ja karogs tiek izlaists.
  • SmolVLA: 50 darbību bloki, abas vadības pogas pieejamas.

Kā pārbaudīt visus piecus vienā pēcpusdienā

Lētākā atbilde nav vairāk lasīšanas. Iztērējiet apmēram 15 USD un ļaujiet robotam jums pateikt: ierakstiet vienreiz, vispirms apmāciet lēto modeli, eskalējiet, kad tas ir pierādījis datu pamatotību. Struktūra pārspēj apjomu, kas ir un .

  1. 1
    Ierakstiet 50 epizodes vienu reizi

    Piecdesmit atbrīvo vietu GR00T, Pi0.5 un ACT, un SmolVLA 30. Atkārtojiet katru variāciju, nevis izkliedējiet: 50 epizodes piecās kuba pozīcijās, kur 25 netika apmācītas. Skatīt ierakstiet savu pirmo datu kopu.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Vispirms apmāciet ACT, jo tas nevar jums melot

    Nav iepriekš apmācītu svaru, tāpēc, ja tas vispār veic uzdevumu, jūsu datu kopa satur uzdevumu. Ja ACT rādītāji ir nemainīgi, labojiet datus. 1 līdz 3 USD, 2 līdz 5 stundas uz 24 GB kartes.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Palaidiet SmolVLA uz tās pašas datu kopas, nemainītu

    Tie paši dati, tā pati roka, 450 M parametri 80 M vietā, plus valodu kondicionēšana. LeRobot 20K soļu izpildei uz viena A100 nepieciešamas aptuveni 4 stundas. Tas jums parāda, vai iepriekšēja apmācība dod kādu labumu.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Pārvērtiet uz v2.1, pirms sākat lietot GR00T

    GR00T nolasa LeRobot v2 formāta paveidu, kā arī papildu meta/modality.json, kas kartē, kā savienotie stāvokļa un darbības masīvi sadalās nosauktos laukos. V3.0 datu kopa sabojā šo ielādētāju, jo v3.0 daudzas epizodes iepako koplietojamos failos, kur v2 rakstīja vienu epizodi. Isaac-GR00T piegādā atpakaļejošās versijas palīgu kā scripts/lerobot_conversion/convert_v3_to_v2.py; v3 noraidīšanas lapa ir ātrākais ceļš.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Pārejiet uz GR00T N1.7 tikai tad, ja pirmie divi atstāja kaut ko neizmantotu

    Izmantojot NVIDIA CLI, kas parādīts šeit, vai LeRobot groot politikas tipu. NVIDIA iesaka 40 GB vai vairāk VRAM smalkai pielāgošanai, 16 GB secinājumiem. Ja rodas OOM, skatiet OOM lapu.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Divi veidi, kā veikt šo skrīninga pārbaudi

Trīs vides, jo rīku ķēdes nesadarbojas. LeRobot galvenajā versijā ir 0.6.2 un tam nepieciešams Python 3.12 vai jaunāks; Isaac-GR00T un openpi ir atsevišķas uv pārvaldītas repozitorijas.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T piesaista torchcodec 0.8.0 kā savu vienīgo video aizmugursistēmu, kam nepieciešams FFmpeg 4 līdz 7. FFmpeg 8 netiek atbalstīts, AV1 netiek garantēts.
  • openpi atmiņas sliekšņi: secinājumi virs 8 GB, LoRA virs 22.5 GB, pilna smalka pielāgošana virs 70 GB. Pēdējais ir iemesls, kāpēc Pi0.5 ir A100 darbs.
  • Iznomājiet GPU pats, pēc tam iznīciniet to, manuāli saskaņojiet trīs kontrolpunktu ceļu kopas.

Pamata modelis vai no nulles

Īstais jautājums nav, kuru 3 B modeli izvēlēties. Tas ir, vai vispār izmantot iepriekš apmācītu VLA, ņemot vērā, ka ACT apguva sešus reālus divroku uzdevumus no aptuveni desmit minūšu demonstrācijām katram, ar 80 M parametriem un neko iepriekš neapmācot.

Iepriekš apmācīta VLA precizēšana, nevis ACT apmācība no nulles
Ko jūs iegūstat
  • Valodu kondicionēšana. ACT tādas nav; viens ACT kontrolpunkts veic vienu uzdevumu.
  • Labāk ar objektiem, kas nav jūsu demonstrācijās: SO-101, 50% pret ACT 40% ārpus izplatīšanas.
  • Vispārēja daudzuzdevumu veikšana: SmolVLA sasniedz 78.3% trīs SO-100 uzdevumos ar vienu kontrolpunktu; ACT tika palaists tikai viena uzdevuma režīmā.
Ko tas jums izmaksā
  • 7.6x līdz 24x lielāka latentums: 152 līdz 485 ms uz darbības soli pret ACT 20 ms.
  • 4 līdz 12 USD par izpildi, nevis 1 līdz 3, un A100 līmenis, nevis jebkura 24 GB karte.
  • Licences riski, kā arī slēgta repozitorija kļūmes režīms, kas neeksistē, sākot no nulles.
  • Iepriekš apmācīti svari var maskēt sliktu datu kopu. Precizēšana, kas daļēji darbojas ar bojātiem datiem, izmaksā nedēļu, pirms jūs aplūkojat datus.

Vecas izpildes reproducēšanas gadījums

2025. gada kontrolpunkta meklēšana nosaka modeļa izvēli jūsu vietā un pārvērš problēmu versiju fiksēšanā: pašreizējais LeRobot noraida N1.5, tāpēc jūs fiksējat lerobot==0.5.1. Bez sēklas lauka un ar 5 līdz 6 procentu variāciju starp izpildēm, reproducēšana ir aptuvena pēc konstrukcijas. un ir platformas puse.

AY-Robots tiešā salīdzinājuma lapa GR00T N1.7 pret Pi0.5, kurā blakus parādīts parametru skaits, GPU prasības, secinājumu latentums, datu kopas formāts un minimālais epizožu skaits.
Tiešā salīdzinājumā vietnē /compare/groot-n1-7-vs-pi0-5. Abi 3 B modeļi specifikāciju lapā izskatās savstarpēji aizstājami, taču tā nav: viens prasa LeRobot v2.1, otrs – v3.0.

Palikuši divi? ACT pret GR00T N1.7 un GR00T N1.7 pret SmolVLA. Neapstrādātas rindas atrodas arēnas ierakstos: GR00T N1.7, Pi0.5, SmolVLA un ACT.

Kur šī platforma jums nepalīdz

  • Tā nevar paātrināt attālinātu secinājumu veikšanu. 20 līdz 485 ms cilpa pieder modelim; interneta savienojuma aizkave to palielina.
  • Tā nevar precizēt GR00T vai Pi0.5 uz jūsu pašu aparatūras. Abi šeit ir tikai mākoņpakalpojumi; tikai SmolVLA un ACT darbojas lokāli.
  • Tā nevar labot datu kopu. Zudums samazinās, bet politika neko nedara ir datu problēma, politika, kas darbojas tikai vienā iestatījumā ir pārklājuma problēma.
  • Tā nevar padarīt GR00T izpildes reproducējamas: augšupējā konfigurācijā nav sēklas lauka.

85 modeļi, 332 etalonuzdevumu rezultāti, katrs skaitlis saistīts ar tā avotu

Šīs lapas tabulu šķirojamā versija: 85 redzes-valodas-darbības modeļi, 332 etalonuzdevumu rezultāti, katrs saistīts ar savu rakstu vai modeļa karti.

Atvērt arēnu

Izvēlēties vienu un doties tālāk

Viens noklusējums: ierakstiet 50 epizodes, apmāciet ACT par 1 līdz 3 USD, lai pierādītu datu kopu, pēc tam SmolVLA uz tiem pašiem datiem. Kopā zem 6 USD, un tie atbild uz svarīgo jautājumu: vai iepriekšēja apmācība šeit palīdz, vai vai vājā vieta ir dati. Palieliniet līdz GR00T N1.7 sarežģītiem daudzpakāpju uzdevumiem ar daudz kontaktiem, līdz Pi0.5, kad aina mainās.

Platformas apskats: apmāciet savu pirmo politiku, pēc tam palaidiet savu pirmo politiku. apmācības dokumentācija un datu kopu dokumentācija aptver formu un formātu; SO-100 lapa un pilnīgais SO-100 ceļvedis aptver uzbūvi un kalibrēšanu. Fons: VLA pārskats un Pi0 plūsmas saskaņošanas raksts. Tas, kas uzlabos jūsu veiksmes rādītāju, ir datu kvalitātes ceļvedis.

Kuru VLA politiku man vajadzētu apmācīt vispirms uz SO-100?

ACT, tad SmolVLA. ACT apmāca no nulles, tāpēc tas nevar maskēt sliktu datu kopu, un viena palaišana maksā 1 līdz 3 USD uz 24 GB kartes. Ja ACT vispār veic uzdevumu, tad 4 līdz 12 USD par GR00T N1.7 vai Pi0.5 palaišanu nav izšķērdēti.

Vai GR00T N1.7 patiešām ir labāks par Pi0.5?

Uz LIBERO tie ir trokšņa robežās: 97.0% četrās svītās GR00T N1.7, 96.85% Pi0.5 pie 30k soļiem openpi, 97.5% LeRobot portam, visi no dažādām testēšanas sistēmām. Reālās atšķirības ir 152 ms uz darbības soli pret 485 ms, v2.1 datu kopas pret v3.0, un etalona precizitāte pret atvērtās pasaules vispārināšanu.

Vai es varu precīzi noregulēt kādu no šiem uz vienas RTX 4090?

SmolVLA un ACT, jā; abi ir norādīti RTX 4090 vai jebkurai 24 GB kartei un darbojas lokāli. GR00T N1.7, N1.5 un Pi0.5 nepieciešama A100 vai H100 80 GB un šeit ir tikai mākoņpakalpojumi. NVIDIA iesaka 40 GB vai vairāk GR00T precīzai noregulēšanai; openpi minimālā prasība ir virs 70 GB pilnai Pi0.5 precīzai noregulēšanai, 22.5 GB LoRA.

Kuru no šiem pieciem es varu izmantot komerciāli?

GR00T N1.7 svari ir saskaņā ar NVIDIA atvērtā modeļa licences līgumu, kas, kā norādīts kartē, aptver komerciālu izmantošanu. N1.5 svari ir nekomerciāli. SmolVLA kods ir Apache 2.0 LeRobot, bet lerobot/smolvla_base kartē nav licences lauka, tāpēc svari nav norādīti. ACT nav pamatsvaru, ko licencēt. Pi0.5 ir neskaidrs: LeRobot dokumentācija norāda Apache 2.0, tā kartes metadati norāda license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started