
GR00T N1.7, Pi0.5, SmolVLA, ACT o GR00T N1.5? Una tabella decisionale abbinata a situazioni reali, con i numeri di benchmark pubblicati, la latenza, il costo per esecuzione e le licenze dietro ogni scelta.
Oggi, cinque politiche sono addestrabili su un braccio di classe SO-100. Differiscono per un fattore di 24 nella latenza di inferenza, 37 nel numero di parametri e 12 nel costo di un'esecuzione, e nella possibilità di spedire il risultato. Cinque schede modello non risolveranno la questione: nessuna risponde alla domanda che hai, quale eseguo per primo?
Ogni numero riportato di seguito è stato estratto da articoli, repository e schede nell'agosto 2026. I numeri della piattaforma provengono dal catalogo delle politiche AY-Robots; dove i due non concordano, entrambi sono mostrati.
La versione breve
- •Addestra ACT per primo se dubiti del tuo dataset: da 1 a 3 USD per esecuzione, nulla di pre-addestrato per coprire dati scadenti.
- •GR00T N1.7 e Pi0.5 si trovano entro mezzo punto su LIBERO, 97.0 contro 96.85 a 97.5. Questo non è un motivo per scegliere l'uno o l'altro.
- •Pi0.5 è la scelta per la generalizzazione, non per la precisione, ed è il più lento a 485 ms.
- •SmolVLA, con 450 M di parametri, è l'unico VLA qui che si ottimizza su una singola scheda da 24 GB.
- •ACT a 20 ms è l'unica opzione per un movimento reattivo veloce. Le licenze decidono il resto.
La tabella decisionale
| La tua situazione | Addestra questo | Perché |
|---|---|---|
| Qualità del dataset non provata | ACT | Nessun pre-addestramento nasconde un dataset difettoso, e il fallimento costa da 1 a 3 USD. |
| Ricco di contatti, multi-step, condizionato dal linguaggio | GR00T N1.7 | 97,0% su quattro suite LIBERO, più uno spazio di azione relativo dell'end-effector. |
| Movimento reattivo veloce, inferenza ai servi | ACT | 20 ms. Il successivo più veloce è 7,6 volte più lento. |
| Nuovi oggetti, nuova scena, mondo aperto | Pi0.5 | Costruito per comportamenti fuori distribuzione, attraverso fino a 104 posizioni. |
| Una scheda da 24 GB, vuoi ancora il linguaggio | SmolVLA | 450 M parametri, un minimo di 30 episodi, funziona localmente. |
| Riprodurre un'esecuzione registrata nel 2025 | GR00T N1.5 | Solo se necessario: LeRobot ora lo rifiuta, pesi non commerciali. |
| Questo sarà spedito come prodotto | N1.7, SmolVLA or ACT | N1.5 non è commerciale, Pi0.5 include i termini Gemma, la scheda di SmolVLA non ne indica alcuno. |
I cinque candidati
Tutti e cinque sono politiche: frame della telecamera, posizioni delle giunture e, per quattro di essi, un'istruzione linguistica, mappata a un blocco di futuri obiettivi di giuntura. Ciò che li distingue è quanto è stato appreso prima del tuo arrivo.
| Politica | Parametri | Latenza | Livello GPU | Locale? | Episodi minimi | Formato | Costo |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | Scheda da 24 GB | sì | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | Scheda da 24 GB | sì | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
L'attuale modello visione-linguaggio-azione, circa 3 miliardi di parametri, circa 40 milioni addestrati durante fine-tuning. Il repository elenca i delta da N1.6: backbone da un modello Eagle proprietario a Cosmos-Reason2-2B su Qwen3-VL, strati di diffusione da 32 a 16, dimensioni dello stato e dell'azione da 29 a 132, orizzonte d'azione da 16 a 40.
Ciò che conta su un braccio piccolo è lo spazio d'azione relativo dell'end-effector: N1.7 predice i delta dalla posa attuale, il che permette a 20K ore di video umani EgoScale di essere trasferite in una policy robotica. Specifiche su la pagina di N1.7, procedura nella guida N1.7 su SO-100.
Il README di Isaac-GR00T dichiara N1.7 una release Disponibilità Generale con benchmark e supporto completi. La sua scheda Hugging Face non è stata aggiornata: il campo Model Version legge ancora GR00T N1.7 EA. Il repository è il documento più recente.
GR00T N1.5
Stessa scala 3 B, backbone Eagle 2, SigLip2 e T5, testa DiT con flow-matching. Esiste per estendere un che hai già. Due cose lo rendono una scelta predefinita scadente: i pesi sono soggetti a licenza non commerciale unidirezionale di NVIDIA, e le attuali release di LeRobot hanno rimosso il supporto per N1.5. Vedi .
Pi0.5
VLA di Physical Intelligence con VLA, tipo di policy pi05. Il paper presenta un VLM da 2 B inizializzato da PaliGemma più un esperto di azioni da 300 M, che guida il robot a 50 Hz; la configurazione pi05 di LeRobot prevede di default un chunk di 50 passi, un secondo a quella velocità. Il punto di forza sono i luoghi mai visti: circa 400 ore di manipolazione mobile in case reali, e uno studio di scalabilità su 3, 12, 22, 53, 82 e 104 località, dove il modello a 104 località ha eguagliato un controllo addestrato sulle case di test stesse.
Un limite, dichiarato sulla lerobot/pi05_base scheda: la porta trasporta solo la testa d'azione con corrispondenza di flusso. La previsione di sottocompiti, la tokenizzazione delle azioni e l'RL non sono stati rilasciati a monte, e openpi afferma lo stesso per il proprio repository. La pagina di Pi0.5 e la guida di Pi0.5 su SO-100 contengono il resto.
Pi0.5 richiede il tokenizer con accesso controllato google/paligemma-3b-pt-224 (gated: manual, anche se Google afferma che le richieste vengono elaborate immediatamente). Senza accettarlo ed eseguire hf auth login nell'ambiente di addestramento, il lavoro si avvia, scarica per un po', quindi si interrompe a causa di un errore di autorizzazione che sembra un guasto di rete. nvidia/GR00T-N1.7-3B non ha accesso controllato, ma il suo backbone nvidia/Cosmos-Reason2-2B sì (gated: auto). Autorizza entrambi prima di metterli in coda; se un'esecuzione rimane inattiva, la pagina delle code bloccate elenca cosa controllare.
SmolVLA
450 M parametri, circa 100 M nell'esperto di azione, su SmolVLM-2 con il VLM congelato e solo i suoi primi 16 strati del modello linguistico utilizzati. Il pre-addestramento è stato basato su dati della comunità: 481 dataset, 10.6 M frame, dagli stessi bracci economici che usi. L'unico VLA qui che si adatta a una scheda da 24 GB, e l'unico con un minimo di 30 episodi come minimo. Vedi la pagina di SmolVLA.
ACT
Non è un modello di base. L'Action Chunking Transformer di ALOHA è un modello di circa 80 milioni di parametri addestrato da zero per ogni compito, su 50 dimostrazioni a 50 Hz. Il documento riporta sei compiti bimani reali da circa dieci minuti di dimostrazioni ciascuno, con una percentuale di successo dall'80 al 90 percento sugli esempi evidenziati. La sua idea, suddivisione delle azioni, è presente in ogni modello di questa pagina, e la sua ablazione misura ancora l'effetto migliore: su due compiti simulati con l'ensembling temporale disattivato, il successo sale dall'1 percento a k=1 al 44 percento a k=100. La pagina di ACT contiene il resto.
Cosa dicono realmente i benchmark
LIBERO è l'unico benchmark su cui tre di questi cinque modelli riportano: compiti condizionati dal linguaggio su un Franka Panda simulato, suddivisi nelle quattro suite sottostanti con dieci compiti ciascuna. NVIDIA ha eseguito 200 prove per suite.
| Model | Spatial | Object | Goal | 10 (Long) | Average |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Ogni numero proviene da un diverso ambiente di test e budget. GR00T ha eseguito 20K passi con un batch globale di 640; il dato openpi è un checkpoint a 30K; la porta LeRobot ha aggiunto 6K passi a un modello base LIBERO. SmolVLA presenta un'ulteriore discrepanza: il suo articolo addestra quella riga su LIBERO da zero, senza pre-addestramento VLA, mentre i tre modelli sopra di esso affinano checkpoint pre-addestrati. Considerare il range da 96.85 a 97.5 come un unico cluster, e il divario fino all'87.3% come reale ma ottenuto con 6.7 volte i parametri.
SimplerEnv mostra la dispersione, cosa che LIBERO non fa. NVIDIA confronta N1.7 con N1.6, la cosa pubblica più vicina a un delta generazionale.
| Suite SimplerEnv | Media N1.6 | Media N1.7 | Miglior variazione | Peggior variazione |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | nessuno, ogni compito è migliorato |
La riga Bridge è quella utile: 5.7 punti guadagnati in media mentre put_eggplant_in_basket ha perso 36 e put_eggplant_in_sink è sceso da 33 a 2. Una nuova generazione sposta la distribuzione piuttosto che sollevarla, quindi se il tuo compito si trova dove N1.7 ha regredito, la media non dice nulla.

Dei cinque, solo il paper SmolVLA riporta un braccio di classe SO-100: 78.3 percento per SmolVLA e 61.7 per Pi0 su tre compiti, entrambi multi-task, contro 48.3 per ACT addestrato single-task, il che non è un confronto equo. L'abbinamento pulito è entrambi single-task su SO-101 pick-and-place: 90 contro 70 in distribuzione, 50 contro 40 fuori distribuzione. Confronta su ACT contro SmolVLA e Pi0.5 contro SmolVLA, o sfoglia l'arena.
Latenza e costo decidono il deployment
Latenza di inferenza è il vincolo che le persone scoprono per ultimo e rimpiangono per primo. Una policy cinque punti migliore su un benchmark ma con mezzo secondo per passo d'azione sembra peggio sulla tua scrivania: le dinamiche di contatto non aspettano.
Un'avvertenza: la cifra di GR00T non concorda con la scheda NVIDIA, che misura 4 passi di denoising e una telecamera a 85.8 ms su un H100 in modalità eager, 48.6 ms con torch.compile, 27.9 ms tramite TensorRT completo. I 152 ms qui sono un dato dell'intera stack con overhead di servizio e più di una telecamera, non un forward pass.
Il loop da 20 a 485 ms è del modello, e i round trip su internet pubblico si aggiungono ad esso. L'inferenza remota è fattibile per operazioni lente di pick-and-place, non per movimenti reattivi veloci. Se il tuo compito richiede velocità, l'inferenza si trova accanto ai servi: ACT o SmolVLA, localmente. Correlato: la policy si blocca a metà movimento.
Un modo per guadagnare tempo senza cambiare modello: il paper SmolVLA misura l'esecuzione sincrona, dove la policy termina un blocco prima di predire il successivo, rispetto all'asincrona, dove la predizione si sovrappone all'esecuzione. Il successo è simile, 78.3 contro 73.3, ma lo stesso pick-and-place richiede 9.7 secondi invece di 13.75, e in una finestra fissa il robot gestisce 19 cicli invece di 9.
Licenze, verificate perché nessuno le verifica
| Model | Licenza pesi | Licenza codice | Uso commerciale |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; la scheda consente l'uso commerciale | Apache 2.0 | sì |
| GR00T N1.5 | Licenza non commerciale unidirezionale NVIDIA | Apache 2.0 | no |
| Pi0.5 | i metadati della scheda pi05_base riportano license: gemma | Apache 2.0 (openpi, documentazione LeRobot) | leggere entrambi, non concordano |
| SmolVLA | nessun campo licenza sulla scheda smolvla_base | Apache 2.0 (LeRobot) | codice sì, pesi non dichiarati |
| ACT | non esistono pesi di base | Apache 2.0 (LeRobot) | sì |
La riga Pi0.5 richiede attenzione. La documentazione LeRobot pi05 dichiara Apache 2.0, coerente con openpi, mentre la scheda Hub per lerobot/pi05_base riporta license: gemma. Entrambi sono attivi. GR00T N1.7 ha una versione più blanda: il README di Isaac-GR00T afferma di sfuggita che N1.7 è completamente licenziabile commercialmente sotto Apache 2.0, mentre la sua sezione licenze e la scheda del modello pongono solo il codice sotto Apache 2.0 e i pesi sotto la NVIDIA Open Model License.
Le impostazioni predefinite che verranno effettivamente eseguite
Ogni modulo di addestramento include un valore predefinito, e questi non sono arbitrari. Quelli di ACT sono propri di LeRobot: batch 8, lr 1e-5, 100000 passi di addestramento, dimensione del chunk 100, corrispondente a ACTConfig upstream e k=100 dal paper ACT. Una colonna qui sotto è una trappola.
| Policy | Batch | LR | Max passi | Accumulazione grad. | Si applica? | Parametri aggiuntivi |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Il punto di ingresso per il fine-tuning di GR00T (launch_finetune.py, una CLI tyro) non ha un campo seed nella sua dataclass di configurazione, quindi le esecuzioni non sono riproducibili bit per bit. Il repository avverte anche di una varianza del 5-6 percento tra le esecuzioni dovuta ad aumenti di immagine non deterministici, maggiore della maggior parte dei divari di benchmark discussi online. Il seed predefinito di LeRobot è 1000. La colonna 'Accumulazione grad.' descrive lerobot 0.5.1; la versione upstream 0.6.2 la espone come --accelerator.gradient_accumulation.steps.
Il parametro che conta più della scelta del modello
È il chunk di azione. Chunk più lunghi producono movimenti più fluidi e meno errori cumulativi, ma la policy è impegnata mentre il blocco viene eseguito, quindi reagisce in ritardo a qualsiasi cosa si muova: sicura su un cubo statico, senza speranza su uno in movimento. Se va in overshoot, accorciare la porzione eseguita è meglio del retraining ed è gratuito. Un'articolazione che si ferma in anticipo è un problema diverso; vedi .
- ACT: ACTConfig predefinisce
chunk_size 100en_action_steps 100. L'ensembling temporale è disattivato e richieden_action_steps 1. - GR00T N1.7: l'orizzonte interno è passato da 16 a 40, eppure l'esempio SO-101 di LeRobot esegue ancora
--policy.chunk_size=16 --policy.n_action_steps=16. Il flag di rollout è stato rinominato in--execution-horizon. - Pi0.5: un chunk di 50 passi, di cui la ricetta LIBERO di LeRobot ne esegue 10 tramite
--policy.n_action_steps=10; con--policy.pretrained_pathtorna a 50 se si omette il flag. - SmolVLA: chunk di 50 azioni, entrambi i parametri esposti.
Come testare tutti e cinque in un pomeriggio
La risposta più economica non è leggere di più. Spendi circa 15 USD e lascia che il braccio ti dica: registra una volta, addestra prima il modello economico, scala una volta che ha dimostrato che i dati sono validi. La struttura batte il volume, il punto di e il .
- 1Registra 50 episodi una volta
Cinquanta libera il campo per GR00T, Pi0.5 e ACT, e i 30 di SmolVLA. Ripetere ogni variazione piuttosto che diluire: 50 episodi su 5 posizioni del cubo addestrate dove 25 non lo erano. Vedi registra il tuo primo dataset.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Addestra ACT per primo, perché non può mentirti
Nessun peso pre-addestrato, quindi se esegue il compito, il tuo dataset contiene il compito. Se ACT si appiattisce, correggi i dati. Da 1 a 3 USD, da 2 a 5 ore su una scheda da 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Esegui SmolVLA sullo stesso dataset, invariato
Stessi dati, stesso braccio, 450 M parametri invece di 80 M, più condizionamento linguistico. LeRobot stima un'esecuzione di 20K passi a circa 4 ore su una A100. Questo è ciò che ti dice se il pre-addestramento porta benefici.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Converti a v2.1 prima di usare GR00T
GR00T legge una variante del formato LeRobot v2 più un file extra
meta/modality.jsonche mappa come gli array concatenati di stato e azione si dividono in campi nominati. Un dataset v3.0 blocca quel caricatore, perché v3.0 impacchetta molti episodi in file condivisi dove v2 ne scriveva uno per episodio. Isaac-GR00T fornisce l'utility di downgrade comescripts/lerobot_conversion/convert_v3_to_v2.py; la pagina di rifiuto v3 è il percorso più veloce.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Passa a GR00T N1.7 solo se i primi due hanno lasciato qualcosa in sospeso
Tramite la CLI di NVIDIA, mostrata qui, o il tipo di policy
grootdi LeRobot. NVIDIA raccomanda 40 GB o più di VRAM per il fine-tuning, 16 GB per l'inferenza. In caso di OOM, vedi la pagina OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Due modi per eseguire quel passaggio di screening
Tre ambienti, perché le toolchain non coesistono. LeRobot su main è 0.6.2 e richiede Python 3.12 o più recente; Isaac-GR00T e openpi sono repository separati gestiti da uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T blocca
torchcodec0.8.0 come unico backend video, richiedendo FFmpeg da 4 a 7. FFmpeg 8 non è supportato, AV1 non garantito. - Requisiti minimi di memoria per openpi: inferenza sopra 8 GB, LoRA sopra 22.5 GB, fine-tuning completo sopra 70 GB. Quest'ultimo è il motivo per cui Pi0.5 è un lavoro da A100.
- Noleggia la GPU da solo, distruggila dopo, riconcilia manualmente tre set di percorsi di checkpoint.
Stessi cinque modelli, un'unica forma. Scegli modello, dataset e iperparametri; il backend noleggia una GPU dimensionata in base alla VRAM richiesta, esegue il trainer e scrive nell'object storage.
- La matrice di addestramento è composta da cinque modelli per quattro bracci, ogni cella una guida: SmolVLA su SO-100, ACT su SO-101.
- I pod di inferenza sono auto-provisionati da
/api/inference/podcon un watchdog di inattività, in modo che un pod dimenticato non fatturi silenziosamente. - I checkpoint di base sono quelli dei fornitori:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT non ne ha. - Stesse operazioni dalla CLI e dagli agenti AI tramite il server MCP.
- Nessun hardware? Il braccio live trasmette un SO-100 fisico senza registrazione; la pagina di prova mostra i modi per iniziare.
Modello di base o da zero
Il vero bivio non è quale modello 3B scegliere. È se usare o meno un VLA pre-addestrato, dato che ACT ha imparato sei compiti bimani reali da circa dieci minuti di dimostrazioni ciascuno, con 80 M di parametri e nulla di pre-addestrato.
- Condizionamento linguistico. ACT non ne ha; un checkpoint ACT esegue un solo compito.
- Migliore su oggetti assenti dalle tue dimostrazioni: su SO-101, 50% contro il 40% di ACT fuori distribuzione.
- Multi-task in generale: SmolVLA raggiunge il 78.3% su tre compiti SO-100 con un unico checkpoint; ACT è stato eseguito solo in modalità single-task.
- Latenza da 7.6x a 24x: da 152 a 485 ms per passo d'azione contro i 20 ms di ACT.
- Da 4 a 12 USD per esecuzione invece di 1 a 3, e un livello A100 invece di qualsiasi scheda da 24 GB.
- Esposizione alla licenza, più una modalità di fallimento del repository con accesso controllato che non esiste partendo da zero.
- I pesi pre-addestrati possono mascherare un dataset scadente. Un'ottimizzazione che funziona a metà su dati corrotti costa una settimana prima di esaminare i dati.
Il caso della riproduzione di un'esecuzione precedente
Inseguire un checkpoint del 2025 fa la scelta del modello per te e trasforma il problema in un blocco di versione: l'attuale LeRobot rifiuta N1.5, quindi blocchi la versione a lerobot==0.5.1. Senza un campo seed e con una varianza del 5-6 percento tra le esecuzioni, la riproduzione è approssimativa per costruzione. e hanno il lato piattaforma.

Rimanere con due? e . Le righe grezze si trovano nelle voci dell'arena: , , e .
Dove questa piattaforma non ti aiuta
- Non può rendere l'inferenza remota veloce. Il ciclo da 20 a 485 ms appartiene al modello; i round trip di internet si aggiungono a questo.
- Non può effettuare il fine-tuning di GR00T o Pi0.5 sul tuo hardware. Entrambi sono solo cloud qui; solo SmolVLA e ACT funzionano localmente.
- Non può correggere un dataset. La perdita diminuisce ma la policy non fa nulla è un problema di dati, una policy che funziona solo in una configurazione è un problema di copertura.
- Non può rendere riproducibili le esecuzioni di GR00T: la configurazione upstream non ha un campo seed.
85 modelli, 332 risultati di benchmark, ogni numero collegato alla sua fonte
La versione ordinabile delle tabelle in questa pagina: 85 modelli visione-linguaggio-azione, 332 risultati di benchmark, ognuno collegato al suo paper o alla sua model card.
Apri l'arenaScegliere e procedere
Un'impostazione predefinita: registra 50 episodi, addestra ACT per 1 a 3 USD per convalidare il dataset, poi SmolVLA sugli stessi dati. Meno di 6 USD in totale, e rispondono alla domanda che conta: se il pre-addestramento sia utile qui, o se il collo di bottiglia siano i dati. Passa a GR00T N1.7 per compiti multi-step ricchi di contatto, a Pi0.5 quando la scena cambia.
Panoramica della piattaforma: addestra la tua prima policy, poi esegui la tua prima policy. I documenti di addestramento e i documenti sui dataset coprono forma e formato; la pagina SO-100 e la guida completa SO-100 coprono costruzione e calibrazione. Contesto: la panoramica VLA e l'articolo sul flow-matching di Pi0. Quello che aumenterà il tuo tasso di successo è la guida alla qualità dei dati.
Quale policy VLA dovrei addestrare per prima su un SO-100?▾
ACT, poi SmolVLA. ACT si addestra da zero, quindi non può mascherare un dataset scadente, e un'esecuzione costa da 1 a 3 USD su una scheda da 24 GB. Se ACT esegue il compito, i 4-12 USD per un'esecuzione di GR00T N1.7 o Pi0.5 non sono sprecati.
GR00T N1.7 è effettivamente migliore di Pi0.5?▾
Su LIBERO sono entro il rumore: 97.0% su quattro suite per GR00T N1.7, 96.85% per Pi0.5 a 30k passi in openpi, 97.5% per il porting LeRobot, tutti da diversi harness. Le vere differenze sono 152 ms per passo d'azione contro 485 ms, dataset v2.1 contro v3.0, e accuratezza del benchmark contro generalizzazione nel mondo reale.
Posso effettuare il fine-tuning di uno qualsiasi di questi su una singola RTX 4090?▾
SmolVLA e ACT, sì; entrambi sono elencati per una RTX 4090 o qualsiasi scheda da 24 GB e funzionano localmente. GR00T N1.7, N1.5 e Pi0.5 richiedono una A100 o H100 da 80 GB e sono qui solo cloud. NVIDIA raccomanda 40 GB o più per il fine-tuning di GR00T; il requisito minimo di openpi è superiore a 70 GB per un fine-tuning completo di Pi0.5, 22.5 GB per LoRA.
Quale di questi cinque posso usare commercialmente?▾
I pesi di GR00T N1.7 sono sotto l'Accordo di Licenza del Modello Aperto NVIDIA, che la scheda indica coprire l'uso commerciale. I pesi di N1.5 sono non commerciali. Il codice di SmolVLA è Apache 2.0 in LeRobot, ma la scheda lerobot/smolvla_base non contiene un campo di licenza, quindi i pesi non sono dichiarati. ACT non ha pesi base da licenziare. Pi0.5 è ambiguo: la documentazione di LeRobot dice Apache 2.0, i suoi metadati della scheda riportano license: gemma.
Sources
- Repository NVIDIA Isaac-GR00T: stato GA, modifiche da N1.6 a N1.7, requisiti hardware, vincoli torchcodec e FFmpeg, launch_finetune.py, varianza tra le esecuzioni
- Scheda modello nvidia/GR00T-N1.7-3B: backbone Cosmos-Reason2-2B, 3 B parametri, tabella tempi di inferenza, Licenza Modello Aperto NVIDIA, campo Versione Modello
- Scheda modello nvidia/GR00T-N1.5-3B: riferimento Eagle 2, SigLip2 e T5, flow matching DiT, licenza non commerciale unidirezionale
- Esempio Isaac-GR00T LIBERO: tassi di successo per suite a 20K passi e dimensione batch 640, 200 prove per suite
- Esempio Isaac-GR00T SimplerEnv: tassi di successo per compito Bridge e Fractal, GR00T N1.6 contro N1.7
- pi0.5: un modello Visione-Linguaggio-Azione con Generalizzazione nel Mondo Reale (2 B VLM più 300 M esperto di azione, controllo a 50 Hz, circa 400 ore di manipolazione mobile, studio di scalabilità su 3 a 104 posizioni)
- Repository openpi: requisiti minimi di memoria GPU, ambito solo flow-matching-head, e i risultati Pi0.5 LIBERO in examples/libero
- Scheda modello lerobot/pi05_base: ambito del porting LeRobot, metadati license: gemma, utilizzo di lerobot-train
- Documentazione LeRobot pi0.5: tokenizer PaliGemma gated, tabella di riproduzione LIBERO, n_action_steps fallback trap, dichiarazione Apache 2.0
- SmolVLA: un modello Visione-Linguaggio-Azione per la Robotica Accessibile ed Efficiente (450 M parametri, tabelle LIBERO e Meta-World, risultati SO-100 e SO-101, inferenza asincrona)
- Documentazione LeRobot SmolVLA: 50 episodi su 5 posizioni contro 25, 20k passi in circa 4 ore su una A100
- Apprendimento della Manipolazione Bimanuale Dettagliata con Hardware a Basso Costo (ACT e ALOHA): 6 compiti all'80-90 percento, ablazione della dimensione del chunk da k=1 a k=100
- LeRobot 0.6.2: valori predefiniti ACTConfig e SmolVLAConfig, seed predefinito 1000, --accelerator.gradient_accumulation.steps, requisito Python 3.12, Apache 2.0
- Documentazione LeRobot GR00T: tipo di policy groot, supporto N1.5 rimosso, pin lerobot==0.5.1, esempio di dimensione chunk SO-101
- Scheda modello lerobot/smolvla_base: il checkpoint base SmolVLA usato da --policy.path, e i suoi metadati della scheda, che non contengono un campo di licenza
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started