
GR00T N1.7, Pi0.5, SmolVLA, ACT sau GR00T N1.5? Un tabel de decizie adaptat la situații reale, cu numerele de referință publicate, latența, costul per rulare și licențele din spatele fiecărei alegeri.
Cinci politici pot fi antrenate astăzi pe un braț de clasă SO-100. Acestea diferă printr-un factor de 24 în inferență latență, 37 în numărul de parametri și 12 în costul unei rulări, precum și în posibilitatea de a livra rezultatul. Cinci carduri de model nu vor rezolva problema: niciunul nu răspunde la întrebarea pe care o aveți, pe care o rulez mai întâi?
Fiecare număr de mai jos a fost extras din documente, depozite și carduri în august 2026. Numerele platformei provin de la catalogul de politici AY-Robots; acolo unde cele două nu concordă, ambele sunt afișate.
Versiunea scurtă
- •Antrenați ACT mai întâi dacă vă îndoiți de setul de date: 1 până la 3 USD per rulare, nimic preantrenat pentru a masca datele proaste.
- •GR00T N1.7 și Pi0.5 se situează la jumătate de punct pe LIBERO, 97.0 față de 96.85 până la 97.5. Acesta nu este un motiv pentru a alege niciunul.
- •Pi0.5 este opțiunea pentru generalizare, nu pentru acuratețe, și cel mai lent la 485 ms.
- •SmolVLA, la 450 M parametri, este singurul VLA de aici care se ajustează fin pe un singur card de 24 GB.
- •ACT la 20 ms este singura opțiune pentru mișcare reactivă rapidă. Licențele decid restul.
Tabelul de decizie
| Situația dumneavoastră | Antrenați acest model | De ce |
|---|---|---|
| Calitatea setului de date nedemonstrată | ACT | Nimic pre-antrenat nu ascunde un set de date defect, iar eșecul costă 1 până la 3 USD. |
| Bogat în contact, multi-pas, condiționat de limbaj | GR00T N1.7 | 97,0% pe patru suite LIBERO, plus un spațiu de acțiune relativ al efectorului final. |
| Mișcare reactivă rapidă, inferență la servomotoare | ACT | 20 ms. Următorul cel mai rapid este de 7,6 ori mai lent. |
| Obiecte noi, scenă nouă, lume deschisă | Pi0.5 | Construit pentru comportament în afara distribuției, pe până la 104 locații. |
| O placă de 24 GB, totuși doriți limbaj | SmolVLA | 450 M parametri, un prag de 30 de episoade, rulează local. |
| Reproducerea unei rulări înregistrate în 2025 | GR00T N1.5 | Doar dacă este absolut necesar: LeRobot o respinge acum, ponderile sunt necomerciale. |
| Acesta va fi livrat ca produs | N1.7, SmolVLA or ACT | N1.5 este necomercial, Pi0.5 include termenii Gemma, placa SmolVLA nu specifică nimic. |
Cei cinci candidați
Toate cele cinci sunt politici: cadre de cameră, poziții ale articulațiilor și, pentru patru dintre ele, o instrucțiune de limbaj, mapată la o secțiune de ținte viitoare ale articulațiilor. Ceea ce le diferențiază este cât de mult a fost învățat înainte de a ajunge dumneavoastră.
| Politică | Parametri | Latență | Nivel GPU | Local? | Episoade minime | Format | Cost |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Modelul actual al NVIDIA model de viziune-limbaj-acțiune, aproximativ 3 miliarde de parametri, aproximativ 40 de milioane antrenați în timpul ajustării fine. Repozitoriul listează diferențele față de N1.6: backbone de la un model Eagle furnizat la Cosmos-Reason2-2B pe Qwen3-VL, straturi de difuzie de la 32 la 16, dimensiuni de stare și acțiune de la 29 la 132, orizont de acțiune de la 16 la 40.
Ceea ce contează la un braț mic este spațiul relativ de acțiune al efectorului final: N1.7 prezice diferențe față de poziția curentă, ceea ce permite transferul a 20.000 de ore de înregistrări video umane EgoScale într-o politică de robot. Specificații pe pagina N1.7, procedură în ghidul N1.7 pe SO-100.
Fișierul README al Isaac-GR00T declară N1.7 o versiune General Availability, cu benchmark-uri complete și suport. Cardul său Hugging Face nu a fost actualizat: câmpul Model Version încă afișează GR00T N1.7 EA. Repozitoriul este documentul mai nou.
GR00T N1.5
Aceeași scară de 3 B, backbone Eagle 2, SigLip2 și T5, cap DiT de flow-matching. Există pentru a extinde un pe care îl aveți deja. Două lucruri îl fac o opțiune implicită slabă: ponderile poartă licența non-comercială unidirecțională a NVIDIA, iar versiunile curente LeRobot au eliminat suportul pentru N1.5. Vezi .
Pi0.5
VLA-ul de al Physical Intelligence, tip de politică pi05. Lucrarea prezintă un VLM de 2 B inițializat din PaliGemma plus un expert de acțiune de 300 M, care conduce robotul la 50 Hz; configurația pi05 a LeRobot utilizează implicit un bloc de 50 de pași, o secundă la acea rată. Punctul forte este reprezentat de locurile neexplorate: aproximativ 400 de ore de manipulare mobilă în case reale și un studiu de scalare pe 3, 12, 22, 53, 82 și 104 locații, unde modelul cu 104 locații a egalat un control antrenat pe casele de testare înseși.
O limită, menționată pe lerobot/pi05_base card: portul transportă doar capul de acțiune de potrivire a fluxului. Predicția sub-sarcinii, tokenizarea acțiunii și RL nu au fost lansate în amonte, iar openpi spune același lucru despre propriul său depozit. Pagina Pi0.5 și ghidul Pi0.5 pe SO-100 conțin restul.
Pi0.5 necesită tokenizatorul cu acces restricționat google/paligemma-3b-pt-224 (gated: manual, deși Google spune că cererile sunt procesate imediat). Fără a-l accepta și a rula hf auth login în mediul de antrenament, sarcina pornește, descarcă o perioadă, apoi se oprește din cauza unei erori de autorizare care pare o defecțiune de rețea. nvidia/GR00T-N1.7-3B nu este restricționat, dar baza sa nvidia/Cosmos-Reason2-2B este (gated: auto). Curățați ambele înainte de a le pune în coadă; dacă o rulare stă inactivă, pagina de coadă blocată listează ce trebuie verificat.
SmolVLA
450 M parametri, aproximativ 100 M în expertul de acțiune, pe SmolVLM-2 cu VLM-ul înghețat și doar primele 16 straturi ale modelului de limbaj utilizate. Pre-antrenarea a fost realizată cu date din comunitate: 481 seturi de date, 10.6 M cadre, de la aceleași brațe ieftine pe care le folosiți. Singurul VLA de aici care încape pe o placă de 24 GB și singurul cu un prag de 30 de episoade. Vezi pagina SmolVLA.
ACT
Nu este un model fundamental. Action Chunking Transformer de la ALOHA are aproximativ 80 M parametri antrenați de la zero pentru fiecare sarcină, pe 50 de demonstrații la 50 Hz. Lucrarea raportează șase sarcini bimanuale reale din aproximativ zece minute de demonstrații fiecare, cu o rată de succes de 80 până la 90 la sută pe exemplele evidențiate. Ideea sa, fragmentarea acțiunilor, se regăsește în fiecare model de pe această pagină, iar ablația sa măsoară în continuare cel mai bine efectul: pe parcursul a două sarcini simulate cu ensembling temporal dezactivat, succesul crește de la 1 la sută la k=1 la 44 la sută la k=100. Pagina ACT conține restul.
Ce spun de fapt benchmark-urile
LIBERO este singurul benchmark raportat de trei dintre aceste cinci: sarcini condiționate de limbaj pe un robot simulat Franka Panda, împărțite în cele patru suite de mai jos, cu câte zece sarcini fiecare. NVIDIA a rulat 200 de încercări per suită.
| Model | Spațial | Obiect | Scop | 10 (Lung) | Medie |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Fiecare număr provine dintr-un set de testare și un buget diferit. GR00T a rulat 20K pași cu un lot global de 640; cifra openpi este un punct de control de 30K; portul LeRobot a adăugat 6K pași unui model de bază LIBERO. SmolVLA reprezintă o altă nepotrivire: lucrarea sa antrenează acel rând pe LIBERO de la zero, fără preantrenare VLA, în timp ce cele trei de mai sus ajustează puncte de control preantrenate. Tratați 96.85 până la 97.5 ca un singur cluster, iar decalajul până la 87.3% ca fiind real, dar obținut cu 6.7x mai mulți parametri.
SimplerEnv arată dispersia, ceea ce LIBERO nu face. NVIDIA compară N1.7 cu N1.6, cel mai apropiat lucru public de o diferență generațională.
| Suita SimplerEnv | Media N1.6 | Media N1.7 | Cea mai bună variație | Cea mai proastă variație |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | niciuna, fiecare sarcină s-a îmbunătățit |
Rândul Bridge este cel util: 5.7 puncte câștigate în medie, în timp ce put_eggplant_in_basket a pierdut 36 și put_eggplant_in_sink a scăzut de la 33 la 2. O nouă generație mută distribuția mai degrabă decât să o ridice, așa că dacă sarcina dvs. se află acolo unde N1.7 a regresat, media nu spune nimic.

Dintre cele cinci, doar lucrarea SmolVLA raportează despre un braț de clasă SO-100: 78.3 procente pentru SmolVLA și 61.7 pentru Pi0 pe trei sarcini, ambele multi-task, față de 48.3 pentru ACT antrenat single-task, ceea ce nu este comparabil. Potrivirea curată este ambele single-task pe SO-101 pick-and-place: 90 față de 70 în distribuție, 50 față de 40 în afara ei. Comparați pe ACT împotriva SmolVLA și Pi0.5 împotriva SmolVLA, sau navigați la arena.
Latența și costul decid implementarea
Latența inferenței este constrângerea pe care oamenii o descoperă ultima și o regretă prima. O politică cu cinci puncte mai bună pe un benchmark, dar cu o jumătate de secundă pe pas de acțiune, arată mai rău pe biroul tău: dinamica contactului nu așteaptă.
O precizare: cifra GR00T nu este în concordanță cu placa NVIDIA, care măsoară 4 pași de denoising și o cameră la 85.8 ms pe un H100 în modul eager, 48.6 ms cu torch.compile, 27.9 ms prin TensorRT complet. Cei 152 ms de aici reprezintă o cifră pentru întregul stack, incluzând overhead-ul de servire și mai mult de o cameră, nu o trecere înainte (forward pass).
Bucla de 20 până la 485 ms aparține modelului, iar călătoriile dus-întors prin internetul public se adaugă la aceasta. Inferența la distanță este viabilă pentru operațiuni lente de tip pick-and-place, nu pentru mișcări reactive rapide. Dacă sarcina ta necesită viteză, inferența se află lângă servomotoare: ACT sau SmolVLA, local. Legat de: politica se blochează în timpul mișcării.
O modalitate de a câștiga timp fără a schimba modelul: lucrarea SmolVLA măsoară execuția sincronă, unde politica finalizează o secțiune înainte de a o prezice pe următoarea, versus execuția asincronă, unde predicția se suprapune cu execuția. Succesul este similar, 78.3 față de 73.3, dar aceeași operațiune de pick-and-place durează 9.7 secunde în loc de 13.75, iar într-o fereastră fixă robotul gestionează 19 cicluri în loc de 9.
Licențe, verificate pentru că nimeni nu le verifică
| Model | Licență ponderi | Licență cod | Utilizare comercială |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; cardul permite utilizare comercială | Apache 2.0 | da |
| GR00T N1.5 | Licență NVIDIA unidirecțională necomercială | Apache 2.0 | nu |
| Pi0.5 | metadatele cardului pi05_base indică licența: gemma | Apache 2.0 (openpi, LeRobot docs) | citiți ambele, nu sunt de acord |
| SmolVLA | nu există câmp de licență pe cardul smolvla_base | Apache 2.0 (LeRobot) | cod da, ponderi nedeclarate |
| ACT | nu există ponderi de bază | Apache 2.0 (LeRobot) | da |
Rândul Pi0.5 necesită atenție. Documentația LeRobot pi05 menționează Apache 2.0, în concordanță cu openpi, în timp ce cardul Hub pentru lerobot/pi05_base conține license: gemma. Ambele sunt active. GR00T N1.7 are o versiune mai blândă: README-ul Isaac-GR00T menționează în treacăt că N1.7 este pe deplin licențiabil comercial sub Apache 2.0, în timp ce propria sa secțiune de licență și cardul modelului plasează doar codul sub Apache 2.0 și ponderile sub NVIDIA Open Model License.
Setările implicite pe care le veți rula de fapt
Fiecare formă de antrenor vine cu o valoare implicită, iar acestea nu sunt arbitrare. ACT's are LeRobot's own: batch 8, lr 1e-5, 100000 pași de antrenament, dimensiunea blocului 100, potrivindu-se cu ACTConfig upstream și k=100 from the ACT paper. O coloană de mai jos este o capcană.
| Politică | Batch | LR | Pași max. | Acum. grad. | Se aplică? | Parametri suplimentari |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Punctul de intrare pentru fine-tuning al GR00T (launch_finetune.py, un CLI tyro) nu are câmp de seed în dataclass-ul său de configurare, astfel încât rulările nu sunt reproductibile bit-cu-bit. Repo-ul avertizează, de asemenea, asupra unei variante de 5 până la 6 procente între rulări din cauza augmentărilor de imagine non-deterministe, mai mare decât majoritatea diferențelor de benchmark disputate online. Seed-ul implicit al LeRobot este 1000. Coloana de acum. grad. descrie lerobot 0.5.1; versiunea upstream 0.6.2 o expune ca --accelerator.gradient_accumulation.steps.
Parametrul care contează mai mult decât alegerea modelului
Este bucata de acțiune. Bucățile mai lungi oferă o mișcare mai lină și mai puține erori cumulative, dar politica este angajată în timp ce blocul se execută, așa că reacționează târziu la orice se mișcă: încrezătoare pe un cub static, fără speranță pe unul care se rostogolește. Dacă depășește, scurtarea porțiunii executate este mai bună decât reantrenarea și este gratuită. O articulație care se oprește prea devreme este o altă problemă; vezi .
- ACT: ACTConfig utilizează implicit
chunk_size 100șin_action_steps 100. Agregarea temporală este dezactivată și necesităn_action_steps 1. - GR00T N1.7: orizontul intern a trecut de la 16 la 40, totuși exemplul SO-101 al LeRobot rulează în continuare
--policy.chunk_size=16 --policy.n_action_steps=16. Flag-ul de rollout a fost redenumit în--execution-horizon. - Pi0.5: o bucată de 50 de pași, din care rețeta LIBERO a LeRobot execută 10 prin
--policy.n_action_steps=10; cu--policy.pretrained_pathrevine la 50 dacă omiteți flag-ul. - SmolVLA: bucăți de 50 de acțiuni, ambii parametri expuși.
Cum să le testezi pe toate cinci într-o singură după-amiază
Cel mai ieftin răspuns nu este mai multă lectură. Cheltuiește aproximativ 15 USD și lasă brațul să-ți spună: înregistrează o dată, antrenează mai întâi modelul ieftin, extinde odată ce datele s-au dovedit valide. Structura învinge volumul, scopul și .
- 1Înregistrează 50 de episoade o singură dată
Cincizeci de episoade pregătesc terenul pentru GR00T, Pi0.5 și ACT, și 30 pentru SmolVLA. Repetați fiecare variație în loc să le răspândiți: 50 de episoade pe 5 poziții de cub antrenate, unde 25 nu au fost. Vezi înregistrează primul tău set de date.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Antrenează ACT mai întâi, pentru că nu te poate minți
Fără ponderi pre-antrenate, deci dacă îndeplinește sarcina, setul tău de date conține sarcina. Dacă ACT nu progresează, corectează datele. 1 to 3 USD, 2 to 5 ore pe o placă de 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Rulează SmolVLA pe același set de date, neschimbat
Aceleași date, același braț, 450 M parametri în loc de 80 M, plus condiționare lingvistică. LeRobot estimează o rulare de 20K pași la aproximativ 4 ore pe un A100. Aceasta îți spune dacă pre-antrenarea aduce vreun beneficiu.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Convertește la v2.1 înainte de a utiliza GR00T
GR00T citește o variantă a formatului LeRobot v2 plus un fișier suplimentar
meta/modality.jsoncare mapează modul în care array-urile concatenate de stare și acțiune se împart în câmpuri denumite. Un set de date v3.0 blochează acel încărcător, deoarece v3.0 împachetează multe episoade în fișiere partajate, unde v2 scria unul pe episod. Isaac-GR00T include utilitarul de retrogradare cascripts/lerobot_conversion/convert_v3_to_v2.py; pagina de respingere v3 este calea rapidă.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Treci la GR00T N1.7 doar dacă primele două au lăsat ceva de dorit
Prin CLI-ul NVIDIA, prezentat aici, sau tipul de politică
grootal LeRobot. NVIDIA recomandă 40 GB sau mai mult de VRAM pentru fine-tuning, 16 GB pentru inferență. În caz de OOM, vezi pagina OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Două moduri de a rula această verificare inițială
Trei medii, deoarece lanțurile de instrumente nu coexistă. LeRobot pe main este 0.6.2 și necesită Python 3.12 sau mai nou; Isaac-GR00T și openpi sunt depozite separate gestionate de uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fixează
torchcodec0.8.0 ca singurul său backend video, necesitând FFmpeg 4 până la 7. FFmpeg 8 nu este suportat, AV1 nu este garantat. - Cerințe de memorie openpi: inferență peste 8 GB, LoRA peste 22.5 GB, fine-tuning complet peste 70 GB. Aceasta din urmă este motivul pentru care Pi0.5 este o sarcină pentru A100.
- Închiriază GPU-ul singur, distruge-l după aceea, reconciliază manual trei seturi de căi de checkpoint.
Aceleași cinci modele, un singur formular. Alege modelul, setul de date și hiperparametrii; backend-ul închiriază un GPU dimensionat în funcție de VRAM-ul necesar, rulează antrenorul și scrie în stocarea de obiecte.
- Matricea de antrenament este de cinci modele pe patru brațe, fiecare celulă un ghid: SmolVLA pe SO-100, ACT pe SO-101.
- Pod-urile de inferență sunt auto-provisionate de
/api/inference/podcu un watchdog de inactivitate, astfel încât un pod uitat nu facturează în tăcere. - Checkpoint-urile de bază sunt cele ale furnizorilor:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nu are niciunul. - Aceleași operațiuni din CLI și de la agenți AI prin serverul MCP.
- Nu ai hardware? Brațul live transmite un SO-100 fizic fără înregistrare; pagina de încercare arată modalitățile de acces.
Model fundamental sau de la zero
Adevărata dilemă nu este ce model 3B să alegi. Este dacă să folosești un VLA preantrenat, având în vedere că ACT a învățat șase sarcini bimanuale reale din aproximativ zece minute de demonstrații fiecare, cu 80 M parametri și nimic preantrenat.
- Condiționare lingvistică. ACT nu are; un singur checkpoint ACT îndeplinește o singură sarcină.
- Mai bun pe obiecte absente din demonstrațiile tale: pe SO-101, 50% față de 40% pentru ACT în afara distribuției.
- Multi-sarcină în general: SmolVLA atinge 78.3% pe trei sarcini SO-100 cu un singur checkpoint; ACT a fost rulat doar pe o singură sarcină.
- Latență de 7.6x până la 24x: 152 până la 485 ms per pas de acțiune față de 20 ms pentru ACT.
- 4 până la 12 USD per rulare în loc de 1 până la 3, și un nivel A100 în loc de orice placă de 24 GB.
- Expunere la licență, plus un mod de eșec al depozitului restricționat care nu există de la zero.
- Ponderile preantrenate pot masca un set de date slab. O reglare fină care funcționează pe jumătate pe date defecte costă o săptămână înainte de a analiza datele.
Cazul reproducerii unei rulări vechi
Urmărirea unui checkpoint din 2025 îți dictează alegerea modelului și transformă problema în fixarea versiunii: LeRobot curent respinge N1.5, așa că fixezi lerobot==0.5.1. Fără un câmp de seed și cu o varianță de 5 până la 6 procente între rulări, reproducerea este aproximativă prin construcție. și au partea de platformă.

Rămân două? ACT versus GR00T N1.7 și GR00T N1.7 versus SmolVLA. Rândurile brute se găsesc în intrările arenei: GR00T N1.7, Pi0.5, SmolVLA și ACT.
Unde această platformă nu vă ajută
- Nu poate accelera inferența la distanță. Bucla de 20 până la 485 ms aparține modelului; călătoriile dus-întors pe internet se adaugă la aceasta.
- Nu poate ajusta fin GR00T sau Pi0.5 pe propriul hardware. Ambele sunt doar în cloud aici; doar SmolVLA și ACT rulează local.
- Nu poate repara un set de date. Pierderea scade, dar politica nu face nimic este o problemă de date, o politică ce funcționează doar într-o singură configurație este o problemă de acoperire.
- Nu poate face rulările GR00T reproductibile: configurația upstream nu are un câmp pentru seed.
85 de modele, 332 de rezultate benchmark, fiecare număr legat de sursa sa
Versiunea sortabilă a tabelelor de pe această pagină: 85 de modele viziune-limbaj-acțiune, 332 de rezultate benchmark, fiecare legat de lucrarea sau cardul său de model.
Deschideți arenaAlegerea unuia și continuarea
O setare implicită: înregistrați 50 de episoade, antrenați ACT pentru 1 până la 3 USD pentru a valida setul de date, apoi SmolVLA pe aceleași date. Sub 6 USD în total, și ele răspund la întrebarea care contează: dacă preantrenarea ajută aici, sau dacă blocajul este reprezentat de date. Scalați la GR00T N1.7 pentru sarcini multi-pas cu contact intens, la Pi0.5 când scena se schimbă.
Prezentare platformă: antrenați prima dumneavoastră politică, apoi rulați prima dumneavoastră politică. Documentația de antrenament și documentația de seturi de date acoperă forma și formatul; pagina SO-100 și ghidul complet SO-100 acoperă construcția și calibrarea. Context: prezentarea generală VLA și articolul Pi0 despre potrivirea fluxului. Cel care vă va îmbunătăți rata de succes este ghidul de calitate a datelor.
Ce politică VLA ar trebui să antrenez mai întâi pe un SO-100?▾
ACT, apoi SmolVLA. ACT se antrenează de la zero, deci nu poate masca un set de date slab, iar o rulare costă 1 până la 3 USD pe o placă de 24 GB. Dacă ACT îndeplinește sarcina, atunci cei 4 până la 12 USD pentru o rulare GR00T N1.7 sau Pi0.5 nu sunt irosiți.
Este GR00T N1.7 într-adevăr mai bun decât Pi0.5?▾
Pe LIBERO, sunt în marja de eroare: 97.0% pe patru suite pentru GR00T N1.7, 96.85% pentru Pi0.5 la 30k pași în openpi, 97.5% pentru portul LeRobot, toate din diferite medii de testare. Diferențele reale sunt 152 ms per pas de acțiune față de 485 ms, seturi de date v2.1 față de v3.0, și precizia benchmark față de generalizarea în lumea reală.
Pot să ajustez fin oricare dintre acestea pe un singur RTX 4090?▾
SmolVLA și ACT, da; ambele sunt listate pentru un RTX 4090 sau orice placă de 24 GB și rulează local. GR00T N1.7, N1.5 și Pi0.5 necesită un A100 sau H100 de 80 GB și sunt disponibile doar în cloud aici. NVIDIA recomandă 40 GB sau mai mult pentru ajustarea fină a GR00T; limita inferioară a openpi este peste 70 GB pentru o ajustare fină completă a Pi0.5, 22.5 GB pentru LoRA.
Care dintre aceste cinci pot fi utilizate comercial?▾
Ponderile GR00T N1.7 sunt sub Acordul de Licență NVIDIA Open Model, care, conform fișei, acoperă utilizarea comercială. Ponderile N1.5 sunt non-comerciale. Codul SmolVLA este Apache 2.0 în LeRobot, dar fișa lerobot/smolvla_base nu conține un câmp de licență, deci ponderile nu sunt specificate. ACT nu are ponderi de bază de licențiat. Pi0.5 este ambiguu: documentația LeRobot menționează Apache 2.0, iar metadatele fișei sale indică licență: gemma.
Sources
- Depozitul NVIDIA Isaac-GR00T: stare GA, modificări de la N1.6 la N1.7, cerințe hardware, constrângeri torchcodec și FFmpeg, launch_finetune.py, varianță de la o rulare la alta
- Fișa modelului nvidia/GR00T-N1.7-3B: backbone Cosmos-Reason2-2B, 3 B parametri, tabel de timpi de inferență, Licență NVIDIA Open Model, câmp Versiune Model
- Fișa modelului nvidia/GR00T-N1.5-3B: referință Eagle 2, SigLip2 și T5, flow matching DiT, licență non-comercială unidirecțională
- Exemplu Isaac-GR00T LIBERO: rate de succes per suită la 20K pași și dimensiune lot 640, 200 încercări per suită
- Exemplu Isaac-GR00T SimplerEnv: rate de succes Bridge și Fractal per sarcină, GR00T N1.6 versus N1.7
- pi0.5: un Model Viziune-Limbaj-Acțiune cu Generalizare în Lumea Reală (2 B VLM plus 300 M expert în acțiune, control la 50 Hz, aproximativ 400 de ore de manipulare mobilă, studiu de scalare pe 3 până la 104 locații)
- Depozitul openpi: limite inferioare de memorie GPU, scop doar pentru flow-matching-head, și rezultatele Pi0.5 LIBERO în examples/libero
- Fișa modelului lerobot/pi05_base: scopul portului LeRobot, metadate licență: gemma, utilizare lerobot-train
- Documentația LeRobot pi0.5: tokenizator PaliGemma cu poartă, tabel de reproducere LIBERO, capcană de rezervă n_action_steps, declarație Apache 2.0
- SmolVLA: Un Model Viziune-Limbaj-Acțiune pentru Robotică Accesibilă și Eficientă (450 M parametri, tabele LIBERO și Meta-World, rezultate SO-100 și SO-101, inferență asincronă)
- Documentația LeRobot SmolVLA: 50 de episoade pe 5 poziții față de 25, 20k pași în aproximativ 4 ore pe un A100
- Învățarea Manipulării Bimanuale Detaliate cu Hardware cu Cost Redus (ACT și ALOHA): 6 sarcini la 80-90 la sută, ablație a dimensiunii chunk de la k=1 la k=100
- LeRobot 0.6.2: valori implicite ACTConfig și SmolVLAConfig, seed implicit 1000, --accelerator.gradient_accumulation.steps, cerință Python 3.12, Apache 2.0
- Documentația LeRobot GR00T: tip de politică groot, suport N1.5 eliminat, pin lerobot==0.5.1, exemplu de dimensiune chunk SO-101
- Fișa modelului lerobot/smolvla_base: checkpoint-ul de bază SmolVLA utilizat de --policy.path, și metadatele fișei sale, care nu conține un câmp de licență
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started