La tabella di confronto delle politiche di AY-Robots che mostra GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA e ACT affiancati con il conteggio dei parametri, il livello GPU, la latenza di inferenza e il conteggio minimo degli episodi
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Quale politica VLA dovresti addestrare nel 2026?

AY-Robots ResearchAugust 23, 202618 min di lettura

GR00T N1.7, Pi0.5, SmolVLA, ACT o GR00T N1.5? Una tabella decisionale abbinata a situazioni reali, con i numeri di benchmark pubblicati, la latenza, il costo per esecuzione e le licenze dietro ogni scelta.

Oggi, cinque politiche sono addestrabili su un braccio di classe SO-100. Differiscono per un fattore di 24 nella latenza di inferenza, 37 nel numero di parametri e 12 nel costo di un'esecuzione, e nella possibilità di spedire il risultato. Cinque schede modello non risolveranno la questione: nessuna risponde alla domanda che hai, quale eseguo per primo?

Ogni numero riportato di seguito è stato estratto da articoli, repository e schede nell'agosto 2026. I numeri della piattaforma provengono dal catalogo delle politiche AY-Robots; dove i due non concordano, entrambi sono mostrati.

La versione breve

  • Addestra ACT per primo se dubiti del tuo dataset: da 1 a 3 USD per esecuzione, nulla di pre-addestrato per coprire dati scadenti.
  • GR00T N1.7 e Pi0.5 si trovano entro mezzo punto su LIBERO, 97.0 contro 96.85 a 97.5. Questo non è un motivo per scegliere l'uno o l'altro.
  • Pi0.5 è la scelta per la generalizzazione, non per la precisione, ed è il più lento a 485 ms.
  • SmolVLA, con 450 M di parametri, è l'unico VLA qui che si ottimizza su una singola scheda da 24 GB.
  • ACT a 20 ms è l'unica opzione per un movimento reattivo veloce. Le licenze decidono il resto.

La tabella decisionale

La tua situazioneAddestra questoPerché
Qualità del dataset non provataACTNessun pre-addestramento nasconde un dataset difettoso, e il fallimento costa da 1 a 3 USD.
Ricco di contatti, multi-step, condizionato dal linguaggioGR00T N1.797,0% su quattro suite LIBERO, più uno spazio di azione relativo dell'end-effector.
Movimento reattivo veloce, inferenza ai serviACT20 ms. Il successivo più veloce è 7,6 volte più lento.
Nuovi oggetti, nuova scena, mondo apertoPi0.5Costruito per comportamenti fuori distribuzione, attraverso fino a 104 posizioni.
Una scheda da 24 GB, vuoi ancora il linguaggioSmolVLA450 M parametri, un minimo di 30 episodi, funziona localmente.
Riprodurre un'esecuzione registrata nel 2025GR00T N1.5Solo se necessario: LeRobot ora lo rifiuta, pesi non commerciali.
Questo sarà spedito come prodottoN1.7, SmolVLA or ACTN1.5 non è commerciale, Pi0.5 include i termini Gemma, la scheda di SmolVLA non ne indica alcuno.

I cinque candidati

Tutti e cinque sono politiche: frame della telecamera, posizioni delle giunture e, per quattro di essi, un'istruzione linguistica, mappata a un blocco di futuri obiettivi di giuntura. Ciò che li distingue è quanto è stato appreso prima del tuo arrivo.

PoliticaParametriLatenzaLivello GPULocale?Episodi minimiFormatoCosto
ACT~80 M20 msScheda da 24 GB50v3.01 to 3 USD
SmolVLA~450 M245 msScheda da 24 GB30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

L'attuale modello visione-linguaggio-azione, circa 3 miliardi di parametri, circa 40 milioni addestrati durante fine-tuning. Il repository elenca i delta da N1.6: backbone da un modello Eagle proprietario a Cosmos-Reason2-2B su Qwen3-VL, strati di diffusione da 32 a 16, dimensioni dello stato e dell'azione da 29 a 132, orizzonte d'azione da 16 a 40.

Ciò che conta su un braccio piccolo è lo spazio d'azione relativo dell'end-effector: N1.7 predice i delta dalla posa attuale, il che permette a 20K ore di video umani EgoScale di essere trasferite in una policy robotica. Specifiche su la pagina di N1.7, procedura nella guida N1.7 su SO-100.

GA nel repository, EA sulla scheda del modello

Il README di Isaac-GR00T dichiara N1.7 una release Disponibilità Generale con benchmark e supporto completi. La sua scheda Hugging Face non è stata aggiornata: il campo Model Version legge ancora GR00T N1.7 EA. Il repository è il documento più recente.

GR00T N1.5

Stessa scala 3 B, backbone Eagle 2, SigLip2 e T5, testa DiT con flow-matching. Esiste per estendere un che hai già. Due cose lo rendono una scelta predefinita scadente: i pesi sono soggetti a licenza non commerciale unidirezionale di NVIDIA, e le attuali release di LeRobot hanno rimosso il supporto per N1.5. Vedi .

Pi0.5

VLA di Physical Intelligence con VLA, tipo di policy pi05. Il paper presenta un VLM da 2 B inizializzato da PaliGemma più un esperto di azioni da 300 M, che guida il robot a 50 Hz; la configurazione pi05 di LeRobot prevede di default un chunk di 50 passi, un secondo a quella velocità. Il punto di forza sono i luoghi mai visti: circa 400 ore di manipolazione mobile in case reali, e uno studio di scalabilità su 3, 12, 22, 53, 82 e 104 località, dove il modello a 104 località ha eguagliato un controllo addestrato sulle case di test stesse.

Un limite, dichiarato sulla lerobot/pi05_base scheda: la porta trasporta solo la testa d'azione con corrispondenza di flusso. La previsione di sottocompiti, la tokenizzazione delle azioni e l'RL non sono stati rilasciati a monte, e openpi afferma lo stesso per il proprio repository. La pagina di Pi0.5 e la guida di Pi0.5 su SO-100 contengono il resto.

La trappola che ti ruba un pomeriggio: repository con accesso controllato

Pi0.5 richiede il tokenizer con accesso controllato google/paligemma-3b-pt-224 (gated: manual, anche se Google afferma che le richieste vengono elaborate immediatamente). Senza accettarlo ed eseguire hf auth login nell'ambiente di addestramento, il lavoro si avvia, scarica per un po', quindi si interrompe a causa di un errore di autorizzazione che sembra un guasto di rete. nvidia/GR00T-N1.7-3B non ha accesso controllato, ma il suo backbone nvidia/Cosmos-Reason2-2B sì (gated: auto). Autorizza entrambi prima di metterli in coda; se un'esecuzione rimane inattiva, la pagina delle code bloccate elenca cosa controllare.

SmolVLA

450 M parametri, circa 100 M nell'esperto di azione, su SmolVLM-2 con il VLM congelato e solo i suoi primi 16 strati del modello linguistico utilizzati. Il pre-addestramento è stato basato su dati della comunità: 481 dataset, 10.6 M frame, dagli stessi bracci economici che usi. L'unico VLA qui che si adatta a una scheda da 24 GB, e l'unico con un minimo di 30 episodi come minimo. Vedi la pagina di SmolVLA.

ACT

Non è un modello di base. L'Action Chunking Transformer di ALOHA è un modello di circa 80 milioni di parametri addestrato da zero per ogni compito, su 50 dimostrazioni a 50 Hz. Il documento riporta sei compiti bimani reali da circa dieci minuti di dimostrazioni ciascuno, con una percentuale di successo dall'80 al 90 percento sugli esempi evidenziati. La sua idea, suddivisione delle azioni, è presente in ogni modello di questa pagina, e la sua ablazione misura ancora l'effetto migliore: su due compiti simulati con l'ensembling temporale disattivato, il successo sale dall'1 percento a k=1 al 44 percento a k=100. La pagina di ACT contiene il resto.

Cosa dicono realmente i benchmark

LIBERO è l'unico benchmark su cui tre di questi cinque modelli riportano: compiti condizionati dal linguaggio su un Franka Panda simulato, suddivisi nelle quattro suite sottostanti con dieci compiti ciascuna. NVIDIA ha eseguito 200 prove per suite.

ModelSpatialObjectGoal10 (Long)Average
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Queste righe non sono strettamente comparabili

Ogni numero proviene da un diverso ambiente di test e budget. GR00T ha eseguito 20K passi con un batch globale di 640; il dato openpi è un checkpoint a 30K; la porta LeRobot ha aggiunto 6K passi a un modello base LIBERO. SmolVLA presenta un'ulteriore discrepanza: il suo articolo addestra quella riga su LIBERO da zero, senza pre-addestramento VLA, mentre i tre modelli sopra di esso affinano checkpoint pre-addestrati. Considerare il range da 96.85 a 97.5 come un unico cluster, e il divario fino all'87.3% come reale ma ottenuto con 6.7 volte i parametri.

SimplerEnv mostra la dispersione, cosa che LIBERO non fa. NVIDIA confronta N1.7 con N1.6, la cosa pubblica più vicina a un delta generazionale.

Suite SimplerEnvMedia N1.6Media N1.7Miglior variazionePeggior variazione
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0nessuno, ogni compito è migliorato

La riga Bridge è quella utile: 5.7 punti guadagnati in media mentre put_eggplant_in_basket ha perso 36 e put_eggplant_in_sink è sceso da 33 a 2. Una nuova generazione sposta la distribuzione piuttosto che sollevarla, quindi se il tuo compito si trova dove N1.7 ha regredito, la media non dice nulla.

La classifica dell'arena AY-Robots, una tabella ordinabile di 85 modelli visione-linguaggio-azione con 332 risultati di benchmark, ogni valore collegato al paper o alla model card da cui proviene
L'arena contiene 85 modelli VLA e 332 risultati di benchmark, ciascuno collegato al suo paper o alla sua model card. Utile per verificare se un numero citato in un post di blog è reale.

Dei cinque, solo il paper SmolVLA riporta un braccio di classe SO-100: 78.3 percento per SmolVLA e 61.7 per Pi0 su tre compiti, entrambi multi-task, contro 48.3 per ACT addestrato single-task, il che non è un confronto equo. L'abbinamento pulito è entrambi single-task su SO-101 pick-and-place: 90 contro 70 in distribuzione, 50 contro 40 fuori distribuzione. Confronta su ACT contro SmolVLA e Pi0.5 contro SmolVLA, o sfoglia l'arena.

Latenza e costo decidono il deployment

Latenza di inferenza è il vincolo che le persone scoprono per ultimo e rimpiangono per primo. Una policy cinque punti migliore su un benchmark ma con mezzo secondo per passo d'azione sembra peggio sulla tua scrivania: le dinamiche di contatto non aspettano.

Un'avvertenza: la cifra di GR00T non concorda con la scheda NVIDIA, che misura 4 passi di denoising e una telecamera a 85.8 ms su un H100 in modalità eager, 48.6 ms con torch.compile, 27.9 ms tramite TensorRT completo. I 152 ms qui sono un dato dell'intera stack con overhead di servizio e più di una telecamera, non un forward pass.

L'inferenza remota ha un limite invalicabile

Il loop da 20 a 485 ms è del modello, e i round trip su internet pubblico si aggiungono ad esso. L'inferenza remota è fattibile per operazioni lente di pick-and-place, non per movimenti reattivi veloci. Se il tuo compito richiede velocità, l'inferenza si trova accanto ai servi: ACT o SmolVLA, localmente. Correlato: la policy si blocca a metà movimento.

Un modo per guadagnare tempo senza cambiare modello: il paper SmolVLA misura l'esecuzione sincrona, dove la policy termina un blocco prima di predire il successivo, rispetto all'asincrona, dove la predizione si sovrappone all'esecuzione. Il successo è simile, 78.3 contro 73.3, ma lo stesso pick-and-place richiede 9.7 secondi invece di 13.75, e in una finestra fissa il robot gestisce 19 cicli invece di 9.

Licenze, verificate perché nessuno le verifica

ModelLicenza pesiLicenza codiceUso commerciale
GR00T N1.7NVIDIA Open Model License; la scheda consente l'uso commercialeApache 2.0
GR00T N1.5Licenza non commerciale unidirezionale NVIDIAApache 2.0no
Pi0.5i metadati della scheda pi05_base riportano license: gemmaApache 2.0 (openpi, documentazione LeRobot)leggere entrambi, non concordano
SmolVLAnessun campo licenza sulla scheda smolvla_baseApache 2.0 (LeRobot)codice sì, pesi non dichiarati
ACTnon esistono pesi di baseApache 2.0 (LeRobot)

La riga Pi0.5 richiede attenzione. La documentazione LeRobot pi05 dichiara Apache 2.0, coerente con openpi, mentre la scheda Hub per lerobot/pi05_base riporta license: gemma. Entrambi sono attivi. GR00T N1.7 ha una versione più blanda: il README di Isaac-GR00T afferma di sfuggita che N1.7 è completamente licenziabile commercialmente sotto Apache 2.0, mentre la sua sezione licenze e la scheda del modello pongono solo il codice sotto Apache 2.0 e i pesi sotto la NVIDIA Open Model License.

Le impostazioni predefinite che verranno effettivamente eseguite

Ogni modulo di addestramento include un valore predefinito, e questi non sono arbitrari. Quelli di ACT sono propri di LeRobot: batch 8, lr 1e-5, 100000 passi di addestramento, dimensione del chunk 100, corrispondente a ACTConfig upstream e k=100 dal paper ACT. Una colonna qui sotto è una trappola.

PolicyBatchLRMax passiAccumulazione grad.Si applica?Parametri aggiuntivi
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Riproducibilità, aggiornato ad agosto 2026

Il punto di ingresso per il fine-tuning di GR00T (launch_finetune.py, una CLI tyro) non ha un campo seed nella sua dataclass di configurazione, quindi le esecuzioni non sono riproducibili bit per bit. Il repository avverte anche di una varianza del 5-6 percento tra le esecuzioni dovuta ad aumenti di immagine non deterministici, maggiore della maggior parte dei divari di benchmark discussi online. Il seed predefinito di LeRobot è 1000. La colonna 'Accumulazione grad.' descrive lerobot 0.5.1; la versione upstream 0.6.2 la espone come --accelerator.gradient_accumulation.steps.

Il parametro che conta più della scelta del modello

È il chunk di azione. Chunk più lunghi producono movimenti più fluidi e meno errori cumulativi, ma la policy è impegnata mentre il blocco viene eseguito, quindi reagisce in ritardo a qualsiasi cosa si muova: sicura su un cubo statico, senza speranza su uno in movimento. Se va in overshoot, accorciare la porzione eseguita è meglio del retraining ed è gratuito. Un'articolazione che si ferma in anticipo è un problema diverso; vedi .

  • ACT: ACTConfig predefinisce chunk_size 100 e n_action_steps 100. L'ensembling temporale è disattivato e richiede n_action_steps 1.
  • GR00T N1.7: l'orizzonte interno è passato da 16 a 40, eppure l'esempio SO-101 di LeRobot esegue ancora --policy.chunk_size=16 --policy.n_action_steps=16. Il flag di rollout è stato rinominato in --execution-horizon.
  • Pi0.5: un chunk di 50 passi, di cui la ricetta LIBERO di LeRobot ne esegue 10 tramite --policy.n_action_steps=10; con --policy.pretrained_path torna a 50 se si omette il flag.
  • SmolVLA: chunk di 50 azioni, entrambi i parametri esposti.

Come testare tutti e cinque in un pomeriggio

La risposta più economica non è leggere di più. Spendi circa 15 USD e lascia che il braccio ti dica: registra una volta, addestra prima il modello economico, scala una volta che ha dimostrato che i dati sono validi. La struttura batte il volume, il punto di e il .

  1. 1
    Registra 50 episodi una volta

    Cinquanta libera il campo per GR00T, Pi0.5 e ACT, e i 30 di SmolVLA. Ripetere ogni variazione piuttosto che diluire: 50 episodi su 5 posizioni del cubo addestrate dove 25 non lo erano. Vedi registra il tuo primo dataset.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Addestra ACT per primo, perché non può mentirti

    Nessun peso pre-addestrato, quindi se esegue il compito, il tuo dataset contiene il compito. Se ACT si appiattisce, correggi i dati. Da 1 a 3 USD, da 2 a 5 ore su una scheda da 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Esegui SmolVLA sullo stesso dataset, invariato

    Stessi dati, stesso braccio, 450 M parametri invece di 80 M, più condizionamento linguistico. LeRobot stima un'esecuzione di 20K passi a circa 4 ore su una A100. Questo è ciò che ti dice se il pre-addestramento porta benefici.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Converti a v2.1 prima di usare GR00T

    GR00T legge una variante del formato LeRobot v2 più un file extra meta/modality.json che mappa come gli array concatenati di stato e azione si dividono in campi nominati. Un dataset v3.0 blocca quel caricatore, perché v3.0 impacchetta molti episodi in file condivisi dove v2 ne scriveva uno per episodio. Isaac-GR00T fornisce l'utility di downgrade come scripts/lerobot_conversion/convert_v3_to_v2.py; la pagina di rifiuto v3 è il percorso più veloce.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Passa a GR00T N1.7 solo se i primi due hanno lasciato qualcosa in sospeso

    Tramite la CLI di NVIDIA, mostrata qui, o il tipo di policy groot di LeRobot. NVIDIA raccomanda 40 GB o più di VRAM per il fine-tuning, 16 GB per l'inferenza. In caso di OOM, vedi la pagina OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Due modi per eseguire quel passaggio di screening

Tre ambienti, perché le toolchain non coesistono. LeRobot su main è 0.6.2 e richiede Python 3.12 o più recente; Isaac-GR00T e openpi sono repository separati gestiti da uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T blocca torchcodec 0.8.0 come unico backend video, richiedendo FFmpeg da 4 a 7. FFmpeg 8 non è supportato, AV1 non garantito.
  • Requisiti minimi di memoria per openpi: inferenza sopra 8 GB, LoRA sopra 22.5 GB, fine-tuning completo sopra 70 GB. Quest'ultimo è il motivo per cui Pi0.5 è un lavoro da A100.
  • Noleggia la GPU da solo, distruggila dopo, riconcilia manualmente tre set di percorsi di checkpoint.

Modello di base o da zero

Il vero bivio non è quale modello 3B scegliere. È se usare o meno un VLA pre-addestrato, dato che ACT ha imparato sei compiti bimani reali da circa dieci minuti di dimostrazioni ciascuno, con 80 M di parametri e nulla di pre-addestrato.

Ottimizzazione di un VLA pre-addestrato invece di addestrare ACT da zero
Cosa guadagni
  • Condizionamento linguistico. ACT non ne ha; un checkpoint ACT esegue un solo compito.
  • Migliore su oggetti assenti dalle tue dimostrazioni: su SO-101, 50% contro il 40% di ACT fuori distribuzione.
  • Multi-task in generale: SmolVLA raggiunge il 78.3% su tre compiti SO-100 con un unico checkpoint; ACT è stato eseguito solo in modalità single-task.
Cosa ti costa
  • Latenza da 7.6x a 24x: da 152 a 485 ms per passo d'azione contro i 20 ms di ACT.
  • Da 4 a 12 USD per esecuzione invece di 1 a 3, e un livello A100 invece di qualsiasi scheda da 24 GB.
  • Esposizione alla licenza, più una modalità di fallimento del repository con accesso controllato che non esiste partendo da zero.
  • I pesi pre-addestrati possono mascherare un dataset scadente. Un'ottimizzazione che funziona a metà su dati corrotti costa una settimana prima di esaminare i dati.

Il caso della riproduzione di un'esecuzione precedente

Inseguire un checkpoint del 2025 fa la scelta del modello per te e trasforma il problema in un blocco di versione: l'attuale LeRobot rifiuta N1.5, quindi blocchi la versione a lerobot==0.5.1. Senza un campo seed e con una varianza del 5-6 percento tra le esecuzioni, la riproduzione è approssimativa per costruzione. e hanno il lato piattaforma.

La pagina di confronto diretto di AY-Robots per GR00T N1.7 contro Pi0.5, che mostra fianco a fianco il conteggio dei parametri, i requisiti della GPU, la latenza di inferenza, il formato del dataset e il numero minimo di episodi
Confronto diretto su /compare/groot-n1-7-vs-pi0-5. I due modelli 3 B sembrano interscambiabili su una scheda tecnica e non lo sono: uno richiede LeRobot v2.1, l'altro v3.0.

Rimanere con due? e . Le righe grezze si trovano nelle voci dell'arena: , , e .

Dove questa piattaforma non ti aiuta

  • Non può rendere l'inferenza remota veloce. Il ciclo da 20 a 485 ms appartiene al modello; i round trip di internet si aggiungono a questo.
  • Non può effettuare il fine-tuning di GR00T o Pi0.5 sul tuo hardware. Entrambi sono solo cloud qui; solo SmolVLA e ACT funzionano localmente.
  • Non può correggere un dataset. La perdita diminuisce ma la policy non fa nulla è un problema di dati, una policy che funziona solo in una configurazione è un problema di copertura.
  • Non può rendere riproducibili le esecuzioni di GR00T: la configurazione upstream non ha un campo seed.

85 modelli, 332 risultati di benchmark, ogni numero collegato alla sua fonte

La versione ordinabile delle tabelle in questa pagina: 85 modelli visione-linguaggio-azione, 332 risultati di benchmark, ognuno collegato al suo paper o alla sua model card.

Apri l'arena

Scegliere e procedere

Un'impostazione predefinita: registra 50 episodi, addestra ACT per 1 a 3 USD per convalidare il dataset, poi SmolVLA sugli stessi dati. Meno di 6 USD in totale, e rispondono alla domanda che conta: se il pre-addestramento sia utile qui, o se il collo di bottiglia siano i dati. Passa a GR00T N1.7 per compiti multi-step ricchi di contatto, a Pi0.5 quando la scena cambia.

Panoramica della piattaforma: addestra la tua prima policy, poi esegui la tua prima policy. I documenti di addestramento e i documenti sui dataset coprono forma e formato; la pagina SO-100 e la guida completa SO-100 coprono costruzione e calibrazione. Contesto: la panoramica VLA e l'articolo sul flow-matching di Pi0. Quello che aumenterà il tuo tasso di successo è la guida alla qualità dei dati.

Quale policy VLA dovrei addestrare per prima su un SO-100?

ACT, poi SmolVLA. ACT si addestra da zero, quindi non può mascherare un dataset scadente, e un'esecuzione costa da 1 a 3 USD su una scheda da 24 GB. Se ACT esegue il compito, i 4-12 USD per un'esecuzione di GR00T N1.7 o Pi0.5 non sono sprecati.

GR00T N1.7 è effettivamente migliore di Pi0.5?

Su LIBERO sono entro il rumore: 97.0% su quattro suite per GR00T N1.7, 96.85% per Pi0.5 a 30k passi in openpi, 97.5% per il porting LeRobot, tutti da diversi harness. Le vere differenze sono 152 ms per passo d'azione contro 485 ms, dataset v2.1 contro v3.0, e accuratezza del benchmark contro generalizzazione nel mondo reale.

Posso effettuare il fine-tuning di uno qualsiasi di questi su una singola RTX 4090?

SmolVLA e ACT, sì; entrambi sono elencati per una RTX 4090 o qualsiasi scheda da 24 GB e funzionano localmente. GR00T N1.7, N1.5 e Pi0.5 richiedono una A100 o H100 da 80 GB e sono qui solo cloud. NVIDIA raccomanda 40 GB o più per il fine-tuning di GR00T; il requisito minimo di openpi è superiore a 70 GB per un fine-tuning completo di Pi0.5, 22.5 GB per LoRA.

Quale di questi cinque posso usare commercialmente?

I pesi di GR00T N1.7 sono sotto l'Accordo di Licenza del Modello Aperto NVIDIA, che la scheda indica coprire l'uso commerciale. I pesi di N1.5 sono non commerciali. Il codice di SmolVLA è Apache 2.0 in LeRobot, ma la scheda lerobot/smolvla_base non contiene un campo di licenza, quindi i pesi non sono dichiarati. ACT non ha pesi base da licenziare. Pi0.5 è ambiguo: la documentazione di LeRobot dice Apache 2.0, i suoi metadati della scheda riportano license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started