Tabelul de comparație a politicilor AY-Robots care prezintă GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA și ACT cot la cot cu numărul de parametri, nivelul GPU, latența inferenței și numărul minim de episoade
modele-vlaantrenare-politiciselecție-modellerobotso-100

Ce politică VLA ar trebui să antrenați în 2026?

AY-Robots ResearchAugust 23, 202618 min de citit

GR00T N1.7, Pi0.5, SmolVLA, ACT sau GR00T N1.5? Un tabel de decizie adaptat la situații reale, cu numerele de referință publicate, latența, costul per rulare și licențele din spatele fiecărei alegeri.

Cinci politici pot fi antrenate astăzi pe un braț de clasă SO-100. Acestea diferă printr-un factor de 24 în inferență latență, 37 în numărul de parametri și 12 în costul unei rulări, precum și în posibilitatea de a livra rezultatul. Cinci carduri de model nu vor rezolva problema: niciunul nu răspunde la întrebarea pe care o aveți, pe care o rulez mai întâi?

Fiecare număr de mai jos a fost extras din documente, depozite și carduri în august 2026. Numerele platformei provin de la catalogul de politici AY-Robots; acolo unde cele două nu concordă, ambele sunt afișate.

Versiunea scurtă

  • Antrenați ACT mai întâi dacă vă îndoiți de setul de date: 1 până la 3 USD per rulare, nimic preantrenat pentru a masca datele proaste.
  • GR00T N1.7 și Pi0.5 se situează la jumătate de punct pe LIBERO, 97.0 față de 96.85 până la 97.5. Acesta nu este un motiv pentru a alege niciunul.
  • Pi0.5 este opțiunea pentru generalizare, nu pentru acuratețe, și cel mai lent la 485 ms.
  • SmolVLA, la 450 M parametri, este singurul VLA de aici care se ajustează fin pe un singur card de 24 GB.
  • ACT la 20 ms este singura opțiune pentru mișcare reactivă rapidă. Licențele decid restul.

Tabelul de decizie

Situația dumneavoastrăAntrenați acest modelDe ce
Calitatea setului de date nedemonstratăACTNimic pre-antrenat nu ascunde un set de date defect, iar eșecul costă 1 până la 3 USD.
Bogat în contact, multi-pas, condiționat de limbajGR00T N1.797,0% pe patru suite LIBERO, plus un spațiu de acțiune relativ al efectorului final.
Mișcare reactivă rapidă, inferență la servomotoareACT20 ms. Următorul cel mai rapid este de 7,6 ori mai lent.
Obiecte noi, scenă nouă, lume deschisăPi0.5Construit pentru comportament în afara distribuției, pe până la 104 locații.
O placă de 24 GB, totuși doriți limbajSmolVLA450 M parametri, un prag de 30 de episoade, rulează local.
Reproducerea unei rulări înregistrate în 2025GR00T N1.5Doar dacă este absolut necesar: LeRobot o respinge acum, ponderile sunt necomerciale.
Acesta va fi livrat ca produsN1.7, SmolVLA or ACTN1.5 este necomercial, Pi0.5 include termenii Gemma, placa SmolVLA nu specifică nimic.

Cei cinci candidați

Toate cele cinci sunt politici: cadre de cameră, poziții ale articulațiilor și, pentru patru dintre ele, o instrucțiune de limbaj, mapată la o secțiune de ținte viitoare ale articulațiilor. Ceea ce le diferențiază este cât de mult a fost învățat înainte de a ajunge dumneavoastră.

PoliticăParametriLatențăNivel GPULocal?Episoade minimeFormatCost
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

Modelul actual al NVIDIA model de viziune-limbaj-acțiune, aproximativ 3 miliarde de parametri, aproximativ 40 de milioane antrenați în timpul ajustării fine. Repozitoriul listează diferențele față de N1.6: backbone de la un model Eagle furnizat la Cosmos-Reason2-2B pe Qwen3-VL, straturi de difuzie de la 32 la 16, dimensiuni de stare și acțiune de la 29 la 132, orizont de acțiune de la 16 la 40.

Ceea ce contează la un braț mic este spațiul relativ de acțiune al efectorului final: N1.7 prezice diferențe față de poziția curentă, ceea ce permite transferul a 20.000 de ore de înregistrări video umane EgoScale într-o politică de robot. Specificații pe pagina N1.7, procedură în ghidul N1.7 pe SO-100.

GA în repozitoriu, EA pe cardul modelului

Fișierul README al Isaac-GR00T declară N1.7 o versiune General Availability, cu benchmark-uri complete și suport. Cardul său Hugging Face nu a fost actualizat: câmpul Model Version încă afișează GR00T N1.7 EA. Repozitoriul este documentul mai nou.

GR00T N1.5

Aceeași scară de 3 B, backbone Eagle 2, SigLip2 și T5, cap DiT de flow-matching. Există pentru a extinde un pe care îl aveți deja. Două lucruri îl fac o opțiune implicită slabă: ponderile poartă licența non-comercială unidirecțională a NVIDIA, iar versiunile curente LeRobot au eliminat suportul pentru N1.5. Vezi .

Pi0.5

VLA-ul de al Physical Intelligence, tip de politică pi05. Lucrarea prezintă un VLM de 2 B inițializat din PaliGemma plus un expert de acțiune de 300 M, care conduce robotul la 50 Hz; configurația pi05 a LeRobot utilizează implicit un bloc de 50 de pași, o secundă la acea rată. Punctul forte este reprezentat de locurile neexplorate: aproximativ 400 de ore de manipulare mobilă în case reale și un studiu de scalare pe 3, 12, 22, 53, 82 și 104 locații, unde modelul cu 104 locații a egalat un control antrenat pe casele de testare înseși.

O limită, menționată pe lerobot/pi05_base card: portul transportă doar capul de acțiune de potrivire a fluxului. Predicția sub-sarcinii, tokenizarea acțiunii și RL nu au fost lansate în amonte, iar openpi spune același lucru despre propriul său depozit. Pagina Pi0.5 și ghidul Pi0.5 pe SO-100 conțin restul.

Capcana care îți mănâncă o după-amiază: depozite cu acces restricționat

Pi0.5 necesită tokenizatorul cu acces restricționat google/paligemma-3b-pt-224 (gated: manual, deși Google spune că cererile sunt procesate imediat). Fără a-l accepta și a rula hf auth login în mediul de antrenament, sarcina pornește, descarcă o perioadă, apoi se oprește din cauza unei erori de autorizare care pare o defecțiune de rețea. nvidia/GR00T-N1.7-3B nu este restricționat, dar baza sa nvidia/Cosmos-Reason2-2B este (gated: auto). Curățați ambele înainte de a le pune în coadă; dacă o rulare stă inactivă, pagina de coadă blocată listează ce trebuie verificat.

SmolVLA

450 M parametri, aproximativ 100 M în expertul de acțiune, pe SmolVLM-2 cu VLM-ul înghețat și doar primele 16 straturi ale modelului de limbaj utilizate. Pre-antrenarea a fost realizată cu date din comunitate: 481 seturi de date, 10.6 M cadre, de la aceleași brațe ieftine pe care le folosiți. Singurul VLA de aici care încape pe o placă de 24 GB și singurul cu un prag de 30 de episoade. Vezi pagina SmolVLA.

ACT

Nu este un model fundamental. Action Chunking Transformer de la ALOHA are aproximativ 80 M parametri antrenați de la zero pentru fiecare sarcină, pe 50 de demonstrații la 50 Hz. Lucrarea raportează șase sarcini bimanuale reale din aproximativ zece minute de demonstrații fiecare, cu o rată de succes de 80 până la 90 la sută pe exemplele evidențiate. Ideea sa, fragmentarea acțiunilor, se regăsește în fiecare model de pe această pagină, iar ablația sa măsoară în continuare cel mai bine efectul: pe parcursul a două sarcini simulate cu ensembling temporal dezactivat, succesul crește de la 1 la sută la k=1 la 44 la sută la k=100. Pagina ACT conține restul.

Ce spun de fapt benchmark-urile

LIBERO este singurul benchmark raportat de trei dintre aceste cinci: sarcini condiționate de limbaj pe un robot simulat Franka Panda, împărțite în cele patru suite de mai jos, cu câte zece sarcini fiecare. NVIDIA a rulat 200 de încercări per suită.

ModelSpațialObiectScop10 (Lung)Medie
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Aceste rânduri nu sunt strict comparabile

Fiecare număr provine dintr-un set de testare și un buget diferit. GR00T a rulat 20K pași cu un lot global de 640; cifra openpi este un punct de control de 30K; portul LeRobot a adăugat 6K pași unui model de bază LIBERO. SmolVLA reprezintă o altă nepotrivire: lucrarea sa antrenează acel rând pe LIBERO de la zero, fără preantrenare VLA, în timp ce cele trei de mai sus ajustează puncte de control preantrenate. Tratați 96.85 până la 97.5 ca un singur cluster, iar decalajul până la 87.3% ca fiind real, dar obținut cu 6.7x mai mulți parametri.

SimplerEnv arată dispersia, ceea ce LIBERO nu face. NVIDIA compară N1.7 cu N1.6, cel mai apropiat lucru public de o diferență generațională.

Suita SimplerEnvMedia N1.6Media N1.7Cea mai bună variațieCea mai proastă variație
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0niciuna, fiecare sarcină s-a îmbunătățit

Rândul Bridge este cel util: 5.7 puncte câștigate în medie, în timp ce put_eggplant_in_basket a pierdut 36 și put_eggplant_in_sink a scăzut de la 33 la 2. O nouă generație mută distribuția mai degrabă decât să o ridice, așa că dacă sarcina dvs. se află acolo unde N1.7 a regresat, media nu spune nimic.

Clasamentul arenei AY-Robots, un tabel sortabil cu 85 de modele viziune-limbaj-acțiune cu 332 de rezultate de benchmark, fiecare valoare fiind legată de lucrarea sau cardul de model de la care provine
Arena conține 85 de modele VLA și 332 de rezultate de benchmark, fiecare legat de lucrarea sau cardul său de model. Util pentru a verifica dacă un număr citat într-o postare de blog este real.

Dintre cele cinci, doar lucrarea SmolVLA raportează despre un braț de clasă SO-100: 78.3 procente pentru SmolVLA și 61.7 pentru Pi0 pe trei sarcini, ambele multi-task, față de 48.3 pentru ACT antrenat single-task, ceea ce nu este comparabil. Potrivirea curată este ambele single-task pe SO-101 pick-and-place: 90 față de 70 în distribuție, 50 față de 40 în afara ei. Comparați pe ACT împotriva SmolVLA și Pi0.5 împotriva SmolVLA, sau navigați la arena.

Latența și costul decid implementarea

Latența inferenței este constrângerea pe care oamenii o descoperă ultima și o regretă prima. O politică cu cinci puncte mai bună pe un benchmark, dar cu o jumătate de secundă pe pas de acțiune, arată mai rău pe biroul tău: dinamica contactului nu așteaptă.

O precizare: cifra GR00T nu este în concordanță cu placa NVIDIA, care măsoară 4 pași de denoising și o cameră la 85.8 ms pe un H100 în modul eager, 48.6 ms cu torch.compile, 27.9 ms prin TensorRT complet. Cei 152 ms de aici reprezintă o cifră pentru întregul stack, incluzând overhead-ul de servire și mai mult de o cameră, nu o trecere înainte (forward pass).

Inferența la distanță are o limită superioară strictă

Bucla de 20 până la 485 ms aparține modelului, iar călătoriile dus-întors prin internetul public se adaugă la aceasta. Inferența la distanță este viabilă pentru operațiuni lente de tip pick-and-place, nu pentru mișcări reactive rapide. Dacă sarcina ta necesită viteză, inferența se află lângă servomotoare: ACT sau SmolVLA, local. Legat de: politica se blochează în timpul mișcării.

O modalitate de a câștiga timp fără a schimba modelul: lucrarea SmolVLA măsoară execuția sincronă, unde politica finalizează o secțiune înainte de a o prezice pe următoarea, versus execuția asincronă, unde predicția se suprapune cu execuția. Succesul este similar, 78.3 față de 73.3, dar aceeași operațiune de pick-and-place durează 9.7 secunde în loc de 13.75, iar într-o fereastră fixă robotul gestionează 19 cicluri în loc de 9.

Licențe, verificate pentru că nimeni nu le verifică

ModelLicență ponderiLicență codUtilizare comercială
GR00T N1.7NVIDIA Open Model License; cardul permite utilizare comercialăApache 2.0da
GR00T N1.5Licență NVIDIA unidirecțională necomercialăApache 2.0nu
Pi0.5metadatele cardului pi05_base indică licența: gemmaApache 2.0 (openpi, LeRobot docs)citiți ambele, nu sunt de acord
SmolVLAnu există câmp de licență pe cardul smolvla_baseApache 2.0 (LeRobot)cod da, ponderi nedeclarate
ACTnu există ponderi de bazăApache 2.0 (LeRobot)da

Rândul Pi0.5 necesită atenție. Documentația LeRobot pi05 menționează Apache 2.0, în concordanță cu openpi, în timp ce cardul Hub pentru lerobot/pi05_base conține license: gemma. Ambele sunt active. GR00T N1.7 are o versiune mai blândă: README-ul Isaac-GR00T menționează în treacăt că N1.7 este pe deplin licențiabil comercial sub Apache 2.0, în timp ce propria sa secțiune de licență și cardul modelului plasează doar codul sub Apache 2.0 și ponderile sub NVIDIA Open Model License.

Setările implicite pe care le veți rula de fapt

Fiecare formă de antrenor vine cu o valoare implicită, iar acestea nu sunt arbitrare. ACT's are LeRobot's own: batch 8, lr 1e-5, 100000 pași de antrenament, dimensiunea blocului 100, potrivindu-se cu ACTConfig upstream și k=100 from the ACT paper. O coloană de mai jos este o capcană.

PoliticăBatchLRPași max.Acum. grad.Se aplică?Parametri suplimentari
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Reproductibilitate, datat august 2026

Punctul de intrare pentru fine-tuning al GR00T (launch_finetune.py, un CLI tyro) nu are câmp de seed în dataclass-ul său de configurare, astfel încât rulările nu sunt reproductibile bit-cu-bit. Repo-ul avertizează, de asemenea, asupra unei variante de 5 până la 6 procente între rulări din cauza augmentărilor de imagine non-deterministe, mai mare decât majoritatea diferențelor de benchmark disputate online. Seed-ul implicit al LeRobot este 1000. Coloana de acum. grad. descrie lerobot 0.5.1; versiunea upstream 0.6.2 o expune ca --accelerator.gradient_accumulation.steps.

Parametrul care contează mai mult decât alegerea modelului

Este bucata de acțiune. Bucățile mai lungi oferă o mișcare mai lină și mai puține erori cumulative, dar politica este angajată în timp ce blocul se execută, așa că reacționează târziu la orice se mișcă: încrezătoare pe un cub static, fără speranță pe unul care se rostogolește. Dacă depășește, scurtarea porțiunii executate este mai bună decât reantrenarea și este gratuită. O articulație care se oprește prea devreme este o altă problemă; vezi .

  • ACT: ACTConfig utilizează implicit chunk_size 100 și n_action_steps 100. Agregarea temporală este dezactivată și necesită n_action_steps 1.
  • GR00T N1.7: orizontul intern a trecut de la 16 la 40, totuși exemplul SO-101 al LeRobot rulează în continuare --policy.chunk_size=16 --policy.n_action_steps=16. Flag-ul de rollout a fost redenumit în --execution-horizon.
  • Pi0.5: o bucată de 50 de pași, din care rețeta LIBERO a LeRobot execută 10 prin --policy.n_action_steps=10; cu --policy.pretrained_path revine la 50 dacă omiteți flag-ul.
  • SmolVLA: bucăți de 50 de acțiuni, ambii parametri expuși.

Cum să le testezi pe toate cinci într-o singură după-amiază

Cel mai ieftin răspuns nu este mai multă lectură. Cheltuiește aproximativ 15 USD și lasă brațul să-ți spună: înregistrează o dată, antrenează mai întâi modelul ieftin, extinde odată ce datele s-au dovedit valide. Structura învinge volumul, scopul și .

  1. 1
    Înregistrează 50 de episoade o singură dată

    Cincizeci de episoade pregătesc terenul pentru GR00T, Pi0.5 și ACT, și 30 pentru SmolVLA. Repetați fiecare variație în loc să le răspândiți: 50 de episoade pe 5 poziții de cub antrenate, unde 25 nu au fost. Vezi înregistrează primul tău set de date.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Antrenează ACT mai întâi, pentru că nu te poate minți

    Fără ponderi pre-antrenate, deci dacă îndeplinește sarcina, setul tău de date conține sarcina. Dacă ACT nu progresează, corectează datele. 1 to 3 USD, 2 to 5 ore pe o placă de 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Rulează SmolVLA pe același set de date, neschimbat

    Aceleași date, același braț, 450 M parametri în loc de 80 M, plus condiționare lingvistică. LeRobot estimează o rulare de 20K pași la aproximativ 4 ore pe un A100. Aceasta îți spune dacă pre-antrenarea aduce vreun beneficiu.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Convertește la v2.1 înainte de a utiliza GR00T

    GR00T citește o variantă a formatului LeRobot v2 plus un fișier suplimentar meta/modality.json care mapează modul în care array-urile concatenate de stare și acțiune se împart în câmpuri denumite. Un set de date v3.0 blochează acel încărcător, deoarece v3.0 împachetează multe episoade în fișiere partajate, unde v2 scria unul pe episod. Isaac-GR00T include utilitarul de retrogradare ca scripts/lerobot_conversion/convert_v3_to_v2.py; pagina de respingere v3 este calea rapidă.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Treci la GR00T N1.7 doar dacă primele două au lăsat ceva de dorit

    Prin CLI-ul NVIDIA, prezentat aici, sau tipul de politică groot al LeRobot. NVIDIA recomandă 40 GB sau mai mult de VRAM pentru fine-tuning, 16 GB pentru inferență. În caz de OOM, vezi pagina OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Două moduri de a rula această verificare inițială

Trei medii, deoarece lanțurile de instrumente nu coexistă. LeRobot pe main este 0.6.2 și necesită Python 3.12 sau mai nou; Isaac-GR00T și openpi sunt depozite separate gestionate de uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fixează torchcodec 0.8.0 ca singurul său backend video, necesitând FFmpeg 4 până la 7. FFmpeg 8 nu este suportat, AV1 nu este garantat.
  • Cerințe de memorie openpi: inferență peste 8 GB, LoRA peste 22.5 GB, fine-tuning complet peste 70 GB. Aceasta din urmă este motivul pentru care Pi0.5 este o sarcină pentru A100.
  • Închiriază GPU-ul singur, distruge-l după aceea, reconciliază manual trei seturi de căi de checkpoint.

Model fundamental sau de la zero

Adevărata dilemă nu este ce model 3B să alegi. Este dacă să folosești un VLA preantrenat, având în vedere că ACT a învățat șase sarcini bimanuale reale din aproximativ zece minute de demonstrații fiecare, cu 80 M parametri și nimic preantrenat.

Reglarea fină a unui VLA preantrenat în loc de antrenarea ACT de la zero
Ce câștigi
  • Condiționare lingvistică. ACT nu are; un singur checkpoint ACT îndeplinește o singură sarcină.
  • Mai bun pe obiecte absente din demonstrațiile tale: pe SO-101, 50% față de 40% pentru ACT în afara distribuției.
  • Multi-sarcină în general: SmolVLA atinge 78.3% pe trei sarcini SO-100 cu un singur checkpoint; ACT a fost rulat doar pe o singură sarcină.
Ce te costă
  • Latență de 7.6x până la 24x: 152 până la 485 ms per pas de acțiune față de 20 ms pentru ACT.
  • 4 până la 12 USD per rulare în loc de 1 până la 3, și un nivel A100 în loc de orice placă de 24 GB.
  • Expunere la licență, plus un mod de eșec al depozitului restricționat care nu există de la zero.
  • Ponderile preantrenate pot masca un set de date slab. O reglare fină care funcționează pe jumătate pe date defecte costă o săptămână înainte de a analiza datele.

Cazul reproducerii unei rulări vechi

Urmărirea unui checkpoint din 2025 îți dictează alegerea modelului și transformă problema în fixarea versiunii: LeRobot curent respinge N1.5, așa că fixezi lerobot==0.5.1. Fără un câmp de seed și cu o varianță de 5 până la 6 procente între rulări, reproducerea este aproximativă prin construcție. și au partea de platformă.

Pagina de comparație directă AY-Robots pentru GR00T N1.7 versus Pi0.5, arătând numărul de parametri, cerințele GPU, latența inferenței, formatul setului de date și numărul minim de episoade, prezentate una lângă alta.
Comparație directă pe /compare/groot-n1-7-vs-pi0-5. Cele două modele de 3 B par interschimbabile pe o fișă de specificații, dar nu sunt: unul necesită LeRobot v2.1, celălalt v3.0.

Rămân două? ACT versus GR00T N1.7 și GR00T N1.7 versus SmolVLA. Rândurile brute se găsesc în intrările arenei: GR00T N1.7, Pi0.5, SmolVLA și ACT.

Unde această platformă nu vă ajută

  • Nu poate accelera inferența la distanță. Bucla de 20 până la 485 ms aparține modelului; călătoriile dus-întors pe internet se adaugă la aceasta.
  • Nu poate ajusta fin GR00T sau Pi0.5 pe propriul hardware. Ambele sunt doar în cloud aici; doar SmolVLA și ACT rulează local.
  • Nu poate repara un set de date. Pierderea scade, dar politica nu face nimic este o problemă de date, o politică ce funcționează doar într-o singură configurație este o problemă de acoperire.
  • Nu poate face rulările GR00T reproductibile: configurația upstream nu are un câmp pentru seed.

85 de modele, 332 de rezultate benchmark, fiecare număr legat de sursa sa

Versiunea sortabilă a tabelelor de pe această pagină: 85 de modele viziune-limbaj-acțiune, 332 de rezultate benchmark, fiecare legat de lucrarea sau cardul său de model.

Deschideți arena

Alegerea unuia și continuarea

O setare implicită: înregistrați 50 de episoade, antrenați ACT pentru 1 până la 3 USD pentru a valida setul de date, apoi SmolVLA pe aceleași date. Sub 6 USD în total, și ele răspund la întrebarea care contează: dacă preantrenarea ajută aici, sau dacă blocajul este reprezentat de date. Scalați la GR00T N1.7 pentru sarcini multi-pas cu contact intens, la Pi0.5 când scena se schimbă.

Prezentare platformă: antrenați prima dumneavoastră politică, apoi rulați prima dumneavoastră politică. Documentația de antrenament și documentația de seturi de date acoperă forma și formatul; pagina SO-100 și ghidul complet SO-100 acoperă construcția și calibrarea. Context: prezentarea generală VLA și articolul Pi0 despre potrivirea fluxului. Cel care vă va îmbunătăți rata de succes este ghidul de calitate a datelor.

Ce politică VLA ar trebui să antrenez mai întâi pe un SO-100?

ACT, apoi SmolVLA. ACT se antrenează de la zero, deci nu poate masca un set de date slab, iar o rulare costă 1 până la 3 USD pe o placă de 24 GB. Dacă ACT îndeplinește sarcina, atunci cei 4 până la 12 USD pentru o rulare GR00T N1.7 sau Pi0.5 nu sunt irosiți.

Este GR00T N1.7 într-adevăr mai bun decât Pi0.5?

Pe LIBERO, sunt în marja de eroare: 97.0% pe patru suite pentru GR00T N1.7, 96.85% pentru Pi0.5 la 30k pași în openpi, 97.5% pentru portul LeRobot, toate din diferite medii de testare. Diferențele reale sunt 152 ms per pas de acțiune față de 485 ms, seturi de date v2.1 față de v3.0, și precizia benchmark față de generalizarea în lumea reală.

Pot să ajustez fin oricare dintre acestea pe un singur RTX 4090?

SmolVLA și ACT, da; ambele sunt listate pentru un RTX 4090 sau orice placă de 24 GB și rulează local. GR00T N1.7, N1.5 și Pi0.5 necesită un A100 sau H100 de 80 GB și sunt disponibile doar în cloud aici. NVIDIA recomandă 40 GB sau mai mult pentru ajustarea fină a GR00T; limita inferioară a openpi este peste 70 GB pentru o ajustare fină completă a Pi0.5, 22.5 GB pentru LoRA.

Care dintre aceste cinci pot fi utilizate comercial?

Ponderile GR00T N1.7 sunt sub Acordul de Licență NVIDIA Open Model, care, conform fișei, acoperă utilizarea comercială. Ponderile N1.5 sunt non-comerciale. Codul SmolVLA este Apache 2.0 în LeRobot, dar fișa lerobot/smolvla_base nu conține un câmp de licență, deci ponderile nu sunt specificate. ACT nu are ponderi de bază de licențiat. Pi0.5 este ambiguu: documentația LeRobot menționează Apache 2.0, iar metadatele fișei sale indică licență: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started