Tabela poređenja politika AY-Robots koja prikazuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT jednu pored druge sa brojem parametara, GPU nivoom, latencijom inferencije i minimalnim brojem epizoda
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Koju VLA politiku biste trebali trenirati 2026.?

AY-Robots ResearchAugust 23, 202618 min čitanja

GR00T N1.7, Pi0.5, SmolVLA, ACT ili GR00T N1.5? Tabela odluka usklađena sa stvarnim situacijama, sa objavljenim benchmark brojevima, latencijom, troškom po pokretanju i licencama iza svakog izbora.

Pet politika se danas može trenirati na ruci klase SO-100. Razlikuju se za faktor 24 u inferenciji latencije, 37 u broju parametara i 12 u cijeni pokretanja, te u tome smijete li isporučiti rezultat. Pet kartica modela neće riješiti dilemu: nijedna ne odgovara na pitanje koje imate, koju da pokrenem prvu?

Svaki broj ispod je pročitan iz radova, repozitorija i kartica u augustu 2026. Brojevi platforme dolaze iz AY-Robots katalog politika; gdje se ta dva ne slažu, prikazana su oba.

Kratka verzija

  • Prvo trenirajte ACT ako sumnjate u svoj skup podataka: 1 do 3 USD po pokretanju, ništa predtrenirano da prikrije loše podatke.
  • GR00T N1.7 i Pi0.5 su unutar pola boda na LIBERO-u, 97.0 naspram 96.85 do 97.5. To nije razlog da odaberete bilo koji.
  • Pi0.5 je opcija za generalizaciju, a ne za preciznost, i najsporiji je sa 485 ms.
  • SmolVLA, sa 450 M parametara, jedini je VLA ovdje koji se fino podešava na jednoj 24 GB kartici.
  • ACT sa 20 ms je jedina opcija za brzo reaktivno kretanje. Licence odlučuju o ostalom.

Tabela odluka

Vaša situacijaTrenirajte ovoZašto
Kvalitet skupa podataka nedokazanACTNišta prethodno trenirano ne može sakriti neispravan skup podataka, a neuspjeh košta 1 do 3 USD.
Bogat kontaktima, višestepeni, uslovljen jezikomGR00T N1.797.0% preko četiri LIBERO paketa, plus relativni akcioni prostor krajnjeg efektora.
Brzo reaktivno kretanje, zaključivanje na servomotorimaACT20 ms. Sljedeći najbrži je 7.6 puta sporiji.
Novi objekti, nova scena, otvoreni svijetPi0.5Izgrađen za ponašanje izvan distribucije, na do 104 lokacije.
Jedna 24 GB kartica, i dalje želite jezikSmolVLA450 M parametara, minimalno 30 epizoda, radi lokalno.
Reprodukcija pokretanja snimljenog 2025.GR00T N1.5Samo ako morate: LeRobot ga sada odbija, težine su nekomercijalne.
Ovo će biti isporučeno kao proizvodN1.7, SmolVLA or ACTN1.5 je nekomercijalan, Pi0.5 nosi Gemma uslove, kartica SmolVLA ne navodi ništa.

Pet kandidata

Svih pet su politike: okviri kamere, pozicije zglobova i, za četiri od njih, jezička instrukcija, mapirana na dio budućih ciljeva zglobova. Ono što ih razdvaja je koliko je naučeno prije vašeg dolaska.

PolitikaParametriLatencijaGPU nivoLokalno?Min epizodaFormatCijena
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA-in trenutni model vizije, jezika i akcije, oko 3 milijarde parametara, otprilike 40 miliona trenirano tokom finog podešavanja. Repozitorijum navodi delte iz N1.6: okosnica od Eagle modela dobavljača do Cosmos-Reason2-2B na Qwen3-VL, difuzioni slojevi 32 na 16, dimenzije stanja i akcije 29 na 132, horizont akcije 16 na 40.

Ono što je važno na maloj ruci je relativni akcioni prostor krajnjeg efektora: N1.7 predviđa delte iz trenutne poze, što omogućava prenos 20K sati EgoScale ljudskog videa u robotsku politiku. Specifikacija na stranici N1.7, procedura u vodiču N1.7 na SO-100.

GA u repozitorijumu, EA na kartici modela

README Isaac-GR00T-a proglašava N1.7 Opšta dostupnost izdanjem, sa kompletnim benchmarkovima i podrškom. Njegova Hugging Face kartica nije ažurirana: polje Model Version i dalje glasi GR00T N1.7 EA. Repozitorijum je noviji dokument.

GR00T N1.5

Ista skala od 3 B, Eagle 2 okosnica, SigLip2 i T5, flow-matching DiT glava. Postoji da bi se proširio koji već imate. Dvije stvari ga čine lošim podrazumijevanim izborom: težine nose NVIDIA-inu jednosmjernu nekomercijalnu licencu, a trenutna izdanja LeRobota su uklonila podršku za N1.5. Pogledajte .

Pi0.5

Physical Intelligence-ov VLA, tip politike pi05. Rad predstavlja 2 B VLM inicijalizovan iz PaliGemme plus 300 M akcioni ekspert, koji pokreće robota na 50 Hz; konfiguracija LeRobota pi05 podrazumevano koristi blok od 50 koraka, jednu sekundu po toj stopi. Prodajna tačka su neviđena mesta: oko 400 sati mobilne manipulacije u stvarnim domovima, i studija skaliranja preko 3, 12, 22, 53, 82 i 104 lokacije, gde je model sa 104 lokacije odgovarao kontroli obučenoj na samim testnim domovima.

Jedno ograničenje, navedeno na lerobot/pi05_base kartici: port nosi samo glavu za podudaranje toka akcije. Predviđanje podzadataka, tokenizacija akcije i RL nisu objavljeni uzvodno, a openpi kaže isto za svoj repozitorijum. Stranica Pi0.5 i vodič za Pi0.5 na SO-100 imaju ostatak.

Zamka koja pojede popodne: gated repozitorijumi

Pi0.5 treba gated google/paligemma-3b-pt-224 tokenizator (gated: manual, iako Google kaže da se zahtjevi obrađuju odmah). Bez prihvatanja i pokretanja hf auth login u okruženju za obuku, posao počinje, preuzima neko vrijeme, a zatim umire zbog greške autorizacije koja izgleda kao mrežni kvar. nvidia/GR00T-N1.7-3B nije gated, ali njegov nvidia/Cosmos-Reason2-2B backbone jeste (gated: auto). Očistite oba prije stavljanja u red; ako pokretanje miruje, stranica zaglavljenog reda navodi šta treba provjeriti.

SmolVLA

450 M parametara, oko 100 M u akcionom ekspertu, na SmolVLM-2 sa zamrznutim VLM-om i korištenjem samo njegovih prvih 16 slojeva jezičkog modela. Predobuka je bila na podacima zajednice: 481 skup podataka, 10.6 M okvira, sa istih jeftinih ruku koje koristite. Jedini VLA ovdje koji staje na jednu 24 GB karticu, i jedini sa 30 epizoda pod. Pogledajte stranicu SmolVLA.

ACT

Nije temeljni model. Action Chunking Transformer iz ALOHA-e ima oko 80 M parametara treniranih od nule po zadatku, na 50 demonstracija pri 50 Hz. Rad izvještava o šest stvarnih bimanualnih zadataka iz otprilike deset minuta demonstracija svaki, sa 80 do 90 posto uspješnosti na primjerima koje ističe. Njegova ideja, action chunking, nalazi se u svakom modelu na ovoj stranici, a njegova ablacija i dalje mjeri učinak najbolje: preko dva simulirana zadatka s isključenim vremenskim ansamblom, uspjeh raste s 1 posto pri k=1 na 44 posto pri k=100. Stranica ACT ima ostatak.

Što zapravo govore benchmarkovi

LIBERO je jedini benchmark o kojem izvještavaju tri od ovih pet: zadaci uvjetovani jezikom na simuliranoj Franka Panda, podijeljeni u četiri niže navedene svite po deset zadataka svaka. NVIDIA je provela 200 pokušaja po sviti.

ModelProstornoObjektnoCilj10 (Dugo)Prosjek
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Ovi redovi nisu strogo uporedivi

Svaki broj potiče iz različitog okruženja i budžeta. GR00T je izvršio 20K koraka sa globalnom serijom 640; podatak openpi je kontrolna tačka od 30K; LeRobot port je dodao 6K koraka LIBERO baznom modelu. SmolVLA je dalje neusklađenost: njegov rad obučava taj red na LIBERO-u od nule, bez VLA predtreniranja, dok tri iznad njega fino podešavaju prethodno obučene kontrolne tačke. Tretirajte 96.85 do 97.5 kao jedan klaster, a jaz do 87.3% kao stvaran, ali postignut sa 6.7x više parametara.

SimplerEnv pokazuje raspon, što LIBERO ne čini. NVIDIA upoređuje N1.7 sa N1.6, što je najbliže javnoj stvari generacijskoj delti.

SimplerEnv paketN1.6 prosjekN1.7 prosjekNajbolji zamahNajgori zamah
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0nijedan, svaki zadatak je poboljšan

Red Bridge je koristan: 5.7 bodova dobijeno u prosjeku dok je put_eggplant_in_basket izgubio 36, a put_eggplant_in_sink pao sa 33 na 2. Nova generacija pomjera distribuciju umjesto da je podiže, tako da ako se vaš zadatak nalazi tamo gdje je N1.7 regresirao, prosjek ne govori ništa.

AY-Robots tabela lidera arene, sortirana tabela od 85 modela vida-jezika-akcije sa 332 rezultata benchmarka, svaka vrijednost povezana sa radom ili karticom modela iz koje potiče
Arena sadrži 85 VLA modela i 332 rezultata benchmarka, svaki povezan sa svojim radom ili karticom modela. Korisno za provjeru da li je broj citiran u blog postu stvaran.

Od pet, samo SmolVLA rad izvještava o ruci klase SO-100: 78.3 posto za SmolVLA i 61.7 za Pi0 kroz tri zadatka, oba višezadaćna, naspram 48.3 za ACT treniran jednim zadatkom, što nije uporedivo. Čisto uparivanje je oba jednim zadatkom na SO-101 pick-and-place: 90 naspram 70 u distribuciji, 50 naspram 40 izvan nje. Uporedite na ACT protiv SmolVLA i Pi0.5 protiv SmolVLA, ili pregledajte arenu.

Latencija i trošak odlučuju o implementaciji

Latencija inferencije je ograničenje koje ljudi otkriju posljednje i prvo požale. Politika koja je pet bodova bolja na benchmarku, ali pola sekunde po koraku akcije, izgleda lošije na vašem stolu: dinamika kontakta ne čeka.

Jedna napomena: GR00T podatak se ne slaže sa NVIDIA karticom, koja mjeri 4 koraka denoisinga i jednu kameru na 85.8 ms na H100 u eager modu, 48.6 ms sa torch.compile, 27.9 ms kroz puni TensorRT. Ovdje navedenih 152 ms je podatak za cijeli stack sa serving overheadom i više od jedne kamere, a ne samo forward pass.

Udaljena inferencija ima strogo ograničenje

Petlja od 20 do 485 ms pripada modelu, a povratna putovanja javnim internetom tome doprinose. Udaljena inferencija je izvodljiva za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje. Ako vaš zadatak zahtijeva brzinu, inferencija se nalazi pored serva: ACT ili SmolVLA, lokalno. Povezano: politika se zamrzava usred kretanja.

Jedan način da se dobije na vremenu bez promjene modela: SmolVLA rad mjeri sinhrono izvršavanje, gdje politika završava jedan dio prije predviđanja sljedećeg, naspram asinhronog, gdje se predviđanje preklapa sa izvršavanjem. Uspjeh je sličan, 78.3 naspram 73.3, ali isto uzimanje i postavljanje (pick-and-place) traje 9.7 sekundi umjesto 13.75, i u fiksnom prozoru robot uspijeva 19 ciklusa umjesto 9.

Licence, provjerene jer ih niko ne provjerava

ModelLicenca za težineLicenca za kodKomercijalna upotreba
GR00T N1.7NVIDIA Open Model License; kartica dozvoljava komercijalnu upotrebuApache 2.0da
GR00T N1.5NVIDIA jednosmjerna nekomercijalna licencaApache 2.0ne
Pi0.5metapodaci kartice pi05_base navode licencu: gemmaApache 2.0 (openpi, LeRobot docs)pročitajte oba, ne slažu se
SmolVLAnema polja za licencu na kartici smolvla_baseApache 2.0 (LeRobot)kod da, težine neizrečene
ACTne postoje osnovne težineApache 2.0 (LeRobot)da

Red za Pi0.5 zahtijeva pažnju. Dokumentacija LeRobot pi05 navodi Apache 2.0, što je u skladu sa openpi, dok kartica Huba za lerobot/pi05_base sadrži license: gemma. Oba su aktivna. GR00T N1.7 ima blažu verziju: Isaac-GR00T README usput navodi da je N1.7 u potpunosti komercijalno licenciran pod Apache 2.0, dok njegov vlastiti odjeljak za licencu i kartica modela stavljaju samo kod pod Apache 2.0, a težine pod NVIDIA Open Model License.

Podrazumijevane postavke koje ćete stvarno pokrenuti

Svaki obrazac trenera dolazi sa zadanim postavkama, i one nisu proizvoljne. ACT-ovi su LeRobot-ovi vlastiti: batch 8, lr 1e-5, 100000 koraka obuke, veličina bloka 100, podudaranje sa ACTConfig uzvodno i k=100 from the ACT paper. Jedna kolona ispod je zamka.

PolitikaBatchLRMaksimalni koraciAkumulacija gradijentaPrimjenjuje se?Dodatne postavke
GR00T N1.7321e-4200001dasaveSteps
GR00T N1.511e-5200016dasaveSteps
Pi0.515e-53000016ne (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008neseed, logFreq
ACT81e-51000001nechunkSize, nActionSteps, seed, logFreq
Reproducibilnost, datum avgust 2026

GR00T-ova ulazna tačka za fino podešavanje (launch_finetune.py, tyro CLI) nema polje za seed u svojoj config dataclass, tako da pokretanja nisu bit-za-bit reproducibilna. Repozitorij takođe upozorava na 5 do 6 posto varijacije između pokretanja zbog nedeterminističkih augmentacija slika, što je veće od većine razlika u benchmarkovima o kojima se raspravlja online. LeRobot-ov zadani seed je 1000. Kolona za akumulaciju gradijenta opisuje lerobot 0.5.1; uzvodna verzija 0.6.2 je izlaže kao --accelerator.gradient_accumulation.steps.

Postavka koja je važnija od izbora modela

To je akcioni blok. Duži blokovi daju glađe kretanje i manje kumulativnih grešaka, ali politika je posvećena dok se blok izvršava, tako da kasno reaguje na sve što se kreće: samouverena na statičnoj kocki, beznadežna na onoj koja se kotrlja. Ako pređe cilj, skraćivanje izvršenog dela je bolje od ponovnog treniranja i besplatno je. Zglob koji se zaustavi prerano je drugačiji problem; pogledajte .

  • ACT: ACTConfig podrazumevano koristi chunk_size 100 i n_action_steps 100. Vremensko ensembliranje je isključeno i zahteva n_action_steps 1.
  • GR00T N1.7: interni horizont je prešao sa 16 na 40, ali LeRobot-ov SO-101 primer i dalje pokreće --policy.chunk_size=16 --policy.n_action_steps=16. Zastavica za rollout je preimenovana u --execution-horizon.
  • Pi0.5: blok od 50 koraka, od kojih LeRobot-ov LIBERO recept izvršava 10 putem --policy.n_action_steps=10; sa --policy.pretrained_path vraća se na 50 ako izostavite zastavicu.
  • SmolVLA: blokovi od 50 akcija, obe opcije su dostupne.

Kako testirati svih pet u jednom popodnevu

Najjeftiniji odgovor nije više čitanja. Potrošite oko 15 USD i neka vam ruka kaže: snimite jednom, prvo trenirajte jeftin model, pa ga nadogradite kada se podaci pokažu pouzdanim. Struktura pobeđuje volumen, što je poenta i .

  1. 1
    Snimite 50 epizoda jednom

    Pedeset čisti teren za GR00T, Pi0.5 i ACT, te SmolVLA-ovih 30. Ponovite svaku varijaciju umjesto da se raspršite: 50 epizoda kroz 5 pozicija kocke trenirano tamo gdje 25 nije. Pogledajte snimite svoj prvi skup podataka.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Prvo trenirajte ACT, jer vam ne može lagati

    Nema prethodno obučenih težina, pa ako uopšte obavlja zadatak, vaš skup podataka sadrži zadatak. Ako ACT zataji, popravite podatke. 1 do 3 USD, 2 do 5 sati na kartici od 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Pokrenite SmolVLA na istom skupu podataka, nepromijenjeno

    Isti podaci, ista ruka, 450 M parametara umjesto 80 M, plus jezičko uslovljavanje. LeRobot procjenjuje pokretanje od 20K koraka na otprilike 4 sata na jednom A100. Ovo vam govori da li prethodno treniranje donosi ikakvu korist.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Pretvorite na v2.1 prije nego što dodirnete GR00T

    GR00T čita varijantu LeRobot v2 formata plus dodatnu meta/modality.json mapu koja prikazuje kako se konkatenirani nizovi stanja i akcija dijele na imenovana polja. Skup podataka v3.0 ruši taj učitavač, jer v3.0 pakuje mnoge epizode u zajedničke datoteke gdje je v2 pisao jednu po epizodi. Isaac-GR00T isporučuje pomoćnik za povratak na stariju verziju kao scripts/lerobot_conversion/convert_v3_to_v2.py; stranica za odbijanje v3 je brzi put.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Pređite na GR00T N1.7 samo ako prva dva nisu dala potpune rezultate

    Preko NVIDIA-inog CLI-ja, prikazanog ovdje, ili LeRobot-ovog groot tipa politike. NVIDIA preporučuje 40 GB ili više VRAM-a za fino podešavanje, 16 GB za inferenciju. U slučaju OOM-a, pogledajte OOM stranicu.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dva načina za pokretanje tog skrining prolaza

Tri okruženja, jer se lanci alata ne podudaraju. LeRobot na glavnom je 0.6.2 i zahtijeva Python 3.12 ili noviji; Isaac-GR00T i openpi su odvojeni uv-upravljani repozitoriji.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T koristi torchcodec 0.8.0 kao jedini video backend, zahtijevajući FFmpeg 4 do 7. FFmpeg 8 nije podržan, AV1 nije zagarantovan.
  • Minimalni zahtjevi za memoriju openpi-ja: inferencija iznad 8 GB, LoRA iznad 22.5 GB, potpuno fino podešavanje iznad 70 GB. Ovo posljednje je razlog zašto je Pi0.5 posao za A100.
  • Iznajmite GPU sami, uništite ga nakon toga, ručno uskladite tri skupa putanja kontrolnih tačaka.

Temeljni model ili od nule

Prava dilema nije koji 3 B model odabrati. Pitanje je da li uopšte koristiti preobučeni VLA, s obzirom na to da je ACT naučio šest stvarnih bimanualnih zadataka iz otprilike deset minuta demonstracija za svaki, sa 80 M parametara i ništa preobučeno.

Fino podešavanje preobučenog VLA umesto obuke ACT-a od nule
Šta dobijate
  • Jezičko uslovljavanje. ACT ga nema; jedna ACT kontrolna tačka obavlja jedan zadatak.
  • Bolje na objektima koji nedostaju u vašim demonstracijama: na SO-101, 50% u poređenju sa ACT-ovih 40% van distribucije.
  • Višezadaćnost uopšte: SmolVLA dostiže 78.3% kroz tri SO-100 zadatka sa jednom kontrolnom tačkom; ACT je pokretan samo kao jednosložni zadatak.
Šta vas košta
  • 7.6x do 24x veća latencija: 152 do 485 ms po koraku akcije u poređenju sa ACT-ovih 20 ms.
  • 4 do 12 USD po pokretanju umesto 1 do 3, i A100 nivo umesto bilo koje kartice od 24 GB.
  • Izloženost licenci, plus režim kvara zatvorenog repozitorijuma koji ne postoji od nule.
  • Preobučene težine mogu maskirati loš skup podataka. Fino podešavanje koje delimično radi na oštećenim podacima košta nedelju dana pre nego što pogledate podatke.

Slučaj reprodukcije starog pokretanja

Potraga za kontrolnom tačkom iz 2025. godine donosi izbor modela za vas i pretvara problem u fiksiranje verzije: trenutni LeRobot odbija N1.5, pa fiksirate lerobot==0.5.1. Bez polja za seme i sa 5 do 6 procenata varijacije između pokretanja, reprodukcija je po konstrukciji približna. i imaju stranu platforme.

AY-Robots stranica za direktno poređenje GR00T N1.7 protiv Pi0.5, prikazujući broj parametara, GPU zahtjeve, latenciju inferencije, format skupa podataka i minimalan broj epizoda uporedo.
Poređenje na /compare/groot-n1-7-vs-pi0-5. Dva modela od 3 B izgledaju zamjenjivo na specifikacijskom listu, ali nisu: jedan zahtijeva LeRobot v2.1, drugi v3.0.

Svedeno na dva? ACT protiv GR00T N1.7 i GR00T N1.7 protiv SmolVLA. Sirovi redovi se nalaze u unosima arene: GR00T N1.7, Pi0.5, SmolVLA i ACT.

Gdje vam ova platforma ne pomaže

  • Ne može ubrzati udaljenu inferenciju. Petlja od 20 do 485 ms pripada modelu; internet povratna putovanja tome doprinose.
  • Ne može fino podesiti GR00T ili Pi0.5 na vašem hardveru. Oba su ovdje samo u oblaku; samo SmolVLA i ACT rade lokalno.
  • Ne može popraviti skup podataka. Gubitak opada, ali politika ne radi ništa je problem sa podacima, politika koja radi samo u jednom podešavanju je problem pokrivenosti.
  • Ne može učiniti GR00T pokretanja ponovljivim: uzvodna konfiguracija nema polje za sjeme.

85 modela, 332 rezultata benčmarka, svaki broj povezan sa svojim izvorom

Sortabilna verzija tabela na ovoj stranici: 85 modela vizije-jezika-akcije, 332 rezultata benčmarka, svaki povezan sa svojim radom ili karticom modela.

Otvorite arenu

Odabir jednog i nastavak

Jedna podrazumevana opcija: snimite 50 epizoda, trenirajte ACT za 1 do 3 USD da biste dokazali skup podataka, zatim SmolVLA na istim podacima. Zajedno ispod 6 USD, i oni odgovaraju na pitanje koje je važno: da li pretreniranje pomaže ovde, ili da li je usko grlo u podacima. Pređite na GR00T N1.7 za višestepene zadatke bogate kontaktima, na Pi0.5 kada se scena menja.

Uputstvo za platformu: trenirajte svoju prvu politiku, zatim pokrenite svoju prvu politiku. dokumentacija za obuku i dokumentacija za skupove podataka pokrivaju formu i format; stranica SO-100 i kompletan vodič za SO-100 pokrivaju izradu i kalibraciju. Pozadina: pregled VLA i članak o Pi0 flow-matching-u. Onaj koji će poboljšati vašu stopu uspeha je vodič za kvalitet podataka.

Koju VLA politiku bih trebao prvo trenirati na SO-100?

ACT, zatim SmolVLA. ACT trenira od nule, tako da ne može maskirati loš skup podataka, a jedno pokretanje košta 1 do 3 USD na kartici od 24 GB. Ako ACT uopšte obavi zadatak, 4 do 12 USD za pokretanje GR00T N1.7 ili Pi0.5 nije uzalud potrošeno.

Je li GR00T N1.7 zaista bolji od Pi0.5?

Na LIBERO-u su unutar šuma: 97.0% kroz četiri paketa za GR00T N1.7, 96.85% za Pi0.5 na 30k koraka u openpi, 97.5% za LeRobot port, sve iz različitih okruženja. Stvarne razlike su 152 ms po koraku akcije naspram 485 ms, skupovi podataka v2.1 naspram v3.0, i tačnost benchmarka naspram generalizacije u otvorenom svijetu.

Mogu li bilo koji od ovih fino podesiti na jednoj RTX 4090?

SmolVLA i ACT, da; oba su navedena za RTX 4090 ili bilo koju karticu od 24 GB i pokreću se lokalno. GR00T N1.7, N1.5 i Pi0.5 trebaju A100 ili H100 80 GB i ovdje su samo u oblaku. NVIDIA preporučuje 40 GB ili više za fino podešavanje GR00T-a; donja granica openpi-ja je iznad 70 GB za potpuno fino podešavanje Pi0.5, 22.5 GB za LoRA.

Koji od ovih pet mogu koristiti komercijalno?

Težine GR00T N1.7 su pod NVIDIA Open Model License Agreement, za koju kartica kaže da pokriva komercijalnu upotrebu. Težine N1.5 su nekomercijalne. SmolVLA-ov kod je Apache 2.0 u LeRobotu, ali kartica lerobot/smolvla_base ne sadrži polje za licencu, tako da težine nisu navedene. ACT nema osnovne težine za licenciranje. Pi0.5 je dvosmislen: LeRobot-ova dokumentacija kaže Apache 2.0, njeni metapodaci kartice glase license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started