
Prezzi reali delle GPU sul mercato spot, quanto tempo impiega l'esecuzione di ciascuna delle cinque policy, il costo del braccio e delle dimostrazioni, e i quattro punti in cui il denaro scompare silenziosamente.
La versione breve
- •Un'esecuzione sul livello A100 80 GB o H100 richiede da 3 a 6 ore e costa circa da 4 a 12 USD. Sul livello RTX 4090 richiede da 2 a 5 ore e costa circa da 1 a 3 USD.
- •Misurato su vast.ai alle 13:44 UTC del 23 agosto 2026: una RTX 4090 completa su richiesta per 0.13 a 0.38 USD/h, una A100 80 GB per 0.44 a 0.67, una H100 80 GB per 1.34 a 2.34. Le schede complete da 80 GB sono scarse, rispettivamente due e cinque offerte per singola scheda.
- •La GPU è la voce più economica. La distinta base del SO-ARM100 stima una coppia leader più follower a 229.88 USD, il che equivale a 77-230 esecuzioni sul livello da 24 GB.
- •Due ore di una persona che registra 50 episodi costano più dell'esecuzione di addestramento a cui quegli episodi alimentano.
- •Il denaro scompare in quattro punti: esecuzioni su dati corrotti, modelli 3B su compiti gestiti da una policy 80M, GPU che nessuno ha distrutto e riesecuzioni di un risultato che non si è riusciti a conservare.
- •AY-Robots dimensiona la scheda in base alla VRAM necessaria al modello e la noleggia sullo stesso mercato spot, quindi il costo dell'esecuzione è il costo di mercato.
Il conto ha quattro voci, e la GPU è la più piccola
Quando le persone chiedono quanto costa ottimizzare un modello visione-linguaggio-azione, per un SO-100, quasi sempre si riferiscono al noleggio della GPU. Questo è il numero che appare come addebito su una carta, quindi è quello che sembra reale. È anche, con ampio margine, il più piccolo dei quattro numeri che decidono quanto una strategia effettivamente ti costa.
| Voce | Cos'è | Dimensione tipica per una strategia funzionante |
|---|---|---|
| Tempo GPU | noleggio di una scheda per l'esecuzione | da 1 a 12 USD per esecuzione, e ne farai da 3 a 5 |
| Il robot | servi, telaio stampato, telecamere, cavi, alimentazione | una tantum, da 110 a 500 EUR per braccio |
| Ore umane | una persona che guida il braccio per registrare demo | da 1 a 4 ore per dataset, ripetute per compito |
| Sprechi | dati errati, modelli sovradimensionati, pod dimenticati | illimitati, e l'unica voce che controlli |
I tempi di training riportati di seguito provengono dai documenti e dai repository dei cinque modelli, il costo dell'hardware dalla distinta base pubblicata, i numeri della piattaforma dai catalogo delle policy di AY-Robots e dalla pagina dei prezzi. Laddove la piattaforma non sia d'aiuto, questo articolo lo specifica.
Quanto costa effettivamente un'ora di GPU sul mercato spot
Non esiste un prezzo unico per un'ora di A100. Su un marketplace come vast.ai ogni host imposta la propria tariffa, e l'esecuzione di training che avvii viene assegnata alla macchina più economica e disponibile in quel momento. La risposta onesta è una distribuzione. Eccola, misurata il 23 agosto 2026 alle 13:44 UTC: schede singole complete, on demand, filtrate per VRAM reale.
| Scheda | vast.ai on demand USD/h (basso / mediano / alto) | Offerte per schede complete | Prezzo minimo di offerta vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
Offerte on-demand per una singola GPU completa (gpu_frac == 1.0) dall'API pubblica di vast.ai, che non richiede un account, filtrate per gpu_ram in modo che solo le schede originali da 80 GB finiscano nelle righe da 80 GB. Questo filtro è importante: in questa lettura, tutte e tre le offerte di schede singole A100 SXM4 erano parti da 40 GB, così come due delle quattro offerte A100 PCIE, quindi raggrupparle in un'unica riga "A100" avrebbe dimezzato il prezzo qui riportato. La colonna Hugging Face mescola due prodotti: 2.50 USD/h è l'hardware Nvidia A100 - large Spaces e 4.50 USD/h è una singola H100 80 GB sotto Inference Endpoints, che Spaces non offre. Considerare le mediane come indicative: la riga A100 80 GB si basa su due offerte e la riga H100 su cinque, e la query identica 36 secondi dopo ha restituito un conteggio 4090 diverso e un prezzo massimo diverso su tre delle cinque righe. I prezzi di listino di RunPod sono il numero più stabile su cui basare la pianificazione.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Perché i modelli 3B non possono usare la scheda economica
Un'ora di 4090 e un'ora di H100 80 GB differiscono di circa sei volte rispetto alle mediane sopra. Ciò che ti costringe a usare la scheda costosa non è la velocità, è la memoria. openpi stabilisce un minimo di 70 GB per un fine-tune completo di Pi0.5, e NVIDIA raccomanda 40 GB o più per GR00T. Nota cosa non è il numero di GR00T. La sua configurazione di fine-tuning blocca il modello linguistico e l'encoder visivo per impostazione predefinita (tune_llm e tune_visual sono False, il proiettore e la testa di diffusione True), motivo per cui il catalogo elenca circa 40 M di parametri addestrati su 3 B. I 40 GB non sono lo stato dell'ottimizzatore per 3 B di pesi, ma il backbone congelato più le attivazioni. Le varianti a portata ridotta scendono più in basso: il percorso LoRA di openpi richiede 22.5 GB e nomina la 4090, e il flusso di lavoro Isaac Lab Arena di NVIDIA elenca un'opzione single-GPU da 24 GB per il post-training di GR00T. La piattaforma si basa sui requisiti minimi che ogni fornitore pubblica per la configurazione che effettivamente esegue. L'articolo sul flow-matching di pi0 spiega da dove proviene l'ingombro del flow-matching.
| Lavoro | Memoria richiesta dal progetto a monte | Fonte |
|---|---|---|
| Inferenza pi0 / pi0.5 | more than 8 GB, example RTX 4090 | openpi |
| Fine-tuning LoRA pi0 / pi0.5 | more than 22.5 GB, example RTX 4090 | openpi |
| Fine-tuning completo pi0 / pi0.5 | more than 70 GB, example A100 80 GB or H100 | openpi |
| Inferenza GR00T N1.7 | 1 GPU with 16 GB or more | Isaac-GR00T |
| Fine-tuning GR00T N1.7 | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| Fine-tuning GR00T, cosa addestra | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| Post-training GR00T, ridotto | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| Fine-tuning SmolVLA | single A100 for the reference 20,000-step run | lerobot docs |
| Addestramento ACT | a single 11 GB RTX 2080 Ti | ACT paper |
Questa tabella spiega perché la piattaforma divide i cinque modelli in due livelli. GR00T N1.7, GR00T N1.5 e Pi0.5 vanno su A100 80 GB o H100 perché è ciò che i fornitori richiedono. SmolVLA e ACT vanno su una RTX 4090 o qualsiasi scheda da 24 GB perché è effettivamente sufficiente.
Un'esecuzione di GR00T o Pi0.5 su una scheda da 24 GB non fallisce al secondo zero. Scarica il checkpoint di base, costruisce l'indice del dataset, avvia il primo passaggio forward e si blocca dopo poche centinaia di passi con un errore CUDA di esaurimento della memoria. Hai pagato per il download e la configurazione e non hai ottenuto nulla. Soluzioni: esaurimento della memoria durante l'addestramento.
Durata di esecuzione effettiva di ciascuno dei cinque modelli
Il tempo di esecuzione è l'altra metà del costo: 2.00 USD all'ora è irrilevante se il lavoro dura 40 minuti e rovinoso se dura 40 ore. Questi sono i valori predefiniti che AY-Robots invia effettivamente al trainer, con la finestra di esecuzione e il costo per ogni livello.
| Policy | Livello GPU | Passi massimi predefiniti | Batch predefinito (accum. grad.) | Finestra di esecuzione | Costo per esecuzione |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applicabile | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applicabile | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, nessun effetto | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, nessun effetto | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Da dove provengono quelle finestre di esecuzione a monte
- SmolVLA: la documentazione di lerobot afferma che 20.000 passi richiedono circa 4 ore su una singola A100. La piattaforma esegue gli stessi 20.000 passi sul livello più economico da 24 GB, quindi una finestra piuttosto che 4 ore fisse.
- ACT: il paper originale ALOHA riporta circa 5 ore su una singola RTX 2080 Ti da 11 GB per un modello da 80M parametri. Una 4090 è di diverse generazioni più recente, ma la piattaforma prevede 100.000 passi, quindi la finestra si posiziona nello stesso punto.
- GR00T: il workflow di riferimento di NVIDIA per la generazione N1.6 cita circa 4-8 ore per 20.000 passi con batch 24 su otto schede L40S, e 2-3 ore per 30.000 passi con batch 16 su una singola Ada 6000. Il fine-tuning su singola scheda di un VLA da 3B in poche ore è normale, non ottimistico.
- Pi0.5: openpi non pubblica alcuna cifra di tempo effettivo, ma pubblica il limite inferiore di 70 GB per un fine-tuning completo, il che fissa la scheda e quindi la tariffa.
Vale la pena soffermarsi sul costo che non state pagando. Il paper GR00T N1 riporta circa 50.000 ore GPU H100 per il pre-addestramento del modello 2.2B, su un cluster di fino a 1024 GPU, con una dimensione del batch di pre-addestramento di 16.384 per 200.000 passi di gradiente. Al costo di 1,34-2,34 USD all'ora misurato sopra, si tratta di un costo di calcolo noleggiato dell'ordine di 67.000-117.000 USD. Il paper SmolVLA stima il suo progetto a circa 30.000 ore GPU su 481 dataset della comunità, 22.9K episodi e 10.6M frame. Voi ereditate tutto questo al prezzo di un download; i vostri 8 USD acquistano gli ultimi 20.000 passi. Perché i VLA sono costruiti in questo modo copre questa divisione.
Il braccio: un costo una tantum che sminuisce la fattura della GPU
Un ciclo di addestramento costa meno di un pranzo. Il robot no. Ecco perché il SO-100 è importante: è il braccio più economico che l'intera apprendimento per imitazione catena di strumenti supporta effettivamente.
| Braccio | Servi | Voltaggio | Costo dei pezzi | Supporto su AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | completo, braccio di riferimento |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | completo |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatibile |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatibile |
La distinta base a monte nel repository SO-ARM100 è più granulare e vale la pena verificarla in base alla propria regione: il suo elenco Pezzi per Due Bracci ammonta a 229.88 USD o 226.30 EUR per una configurazione leader più follower, e il suo elenco Pezzi per un Braccio Follower ammonta a 121.94 USD o 124.30 EUR. Sei servi STS3215 a 13.89 USD ciascuno fanno 83.34 di quei 121.94, quindi i servi sono il braccio. A 1 a 3 USD per ciclo SmolVLA o ACT, un paio di bracci vale tra 77 e 230 cicli di addestramento. Se stai ancora scegliendo, SO-100 contro SO-101 è il confronto che conta, perché i due sono abbastanza simili da rendere la decisione una questione di disponibilità piuttosto che di capacità.
L'STS3215 è disponibile in una variante da 7.4 V e una da 12 V; il repository nota che la parte da 12 V necessita anche di un'alimentazione da 12 V 5 A invece di quella da 5 V, quindi le due non sono intercambiabili. Alimentare i servi da 7.4 V con 12 V li distrugge, e sei servi rappresentano due terzi del costo dei pezzi di un braccio follower. Controlla l'etichetta su ogni servo prima della prima accensione. Se i servi si comportano già in modo strano: servo non risponde, il braccio si contrae e poi cede.
Ore umane: la riga che nessuno inserisce nel foglio di calcolo
Questo è il numero che ribalta la discussione sui costi. Registrare dimostrazioni significa una persona che muove un braccio robotico, un episodio alla volta, in tempo reale. Non è possibile eseguirle in batch né noleggiarle al secondo. Il dataset LeRobot registratore viene fornito con impostazioni predefinite che semplificano l'aritmetica, tutte e tre confermate in DatasetRecordConfig: 60 secondi per episodio, 60 secondi per resettare la scena, 50 episodi. La colonna del denaro qui sotto assume 15 USD per un'ora del tempo di una persona, il che è un'ipotesi piuttosto che un numero della piattaforma. Sostituisci la tua tariffa; il rapporto è il punto.
- 1Registra il dataset con le impostazioni predefinite per cui ti verrà effettivamente addebitato
Questa è lerobot 0.6.1, la versione su PyPI al 3 agosto 2026. Si noti la forma della CLI: la registrazione avviene tramite il punto di ingresso della console
lerobot-record(lerobot.scripts.lerobot_record), non il vecchio percorso del modulopython -m lerobot.scripts.record. AY-Robots si basa sulla versione 0.5.1, e il wheel 0.5.1 dichiara gli stessi punti di ingressolerobot-recordelerobot-train, quindi la forma seguente è stabile per entrambi. I tre flag di temporizzazione sono le impostazioni predefinite a monte, quindi questo è anche il comando che l'aritmetica nella tabella successiva assume.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Guarda cosa hai registrato prima di noleggiare un singolo minuto di GPU
Ispezionare un dataset costa zero USD all'ora. Scoprire lo stesso problema da una curva di perdita costa 2.00 USD all'ora sul livello H100 e te lo dice con quattro ore di ritardo. Carica il dataset e analizzalo nel visualizzatore LeRobot, oppure sfoglia la directory dei dataset di AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Addestra e assicurati che il checkpoint sopravviva al pod
Una macchina noleggiata è temporanea per definizione, quindi scrivi i checkpoint in un luogo duraturo durante l'esecuzione. Due flag decidono se mantieni ciò per cui hai pagato.
--save_freqha un valore predefinito di 20.000 passi, quindi un'esecuzione predefinita di SmolVLA di 20.000 passi scrive il suo primo checkpoint quando l'esecuzione è già terminata; abbassalo prima di noleggiare qualsiasi cosa interrompibile.--save_checkpoint_to_hubrichiede--policy.repo_ide non esiste in lerobot 0.5.1, quindi su quella versione devi copiare tu stesso la directory di output dalla macchina. La dimensione del batch qui sotto è l'esempio della documentazione a monte; il modulo AY-Robots invia 2 per SmolVLA e scrive nell'object storage man mano che i checkpoint appaiono.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episodi | Registrazione a 60 s | Reset a 60 s | Tempo effettivo | Più 20 percento di ri-registrazioni | A 15 USD per ora umana |
|---|---|---|---|---|---|
| 30, il minimo di SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | circa 18 USD |
| 50, gli altri quattro minimi | 50 min | 50 min | 1 h 40 min | 2 h 00 min | circa 30 USD |
| 100, un dataset confortevole | 100 min | 100 min | 3 h 20 min | 4 h 00 min | circa 60 USD |
Confronta la colonna di destra con i costi di esecuzione da 1 a 12 USD. A quel tasso ipotizzato, un dataset di 50 episodi costa da due a sette volte di più per essere registrato di quanto costi per l'addestramento, prima della calibrazione, della configurazione della telecamera e degli episodi che vengono scartati. Ecco perché ha un valore economico diretto. La guida di lerobot suggerisce almeno 50 episodi con 10 per posizione dell'oggetto; la documentazione di SmolVLA riporta che una versione di 25 episodi dello stesso compito non era sufficiente.
Dove i soldi vanno effettivamente persi
1. Esecuzioni su dati che non avrebbero mai funzionato
Un'esecuzione GR00T di 20.000 passi su un dataset con due stream di telecamere scambiati costa quanto una su un dataset pulito, impiega lo stesso tempo e produce una curva di perdita che sembra a posto. Il fallimento si manifesta sul braccio, ore dopo. vengono fatturati all'ora e la diagnosi viene fatturata in giorni. Due sintomi da memorizzare: di solito significa che le osservazioni non contengono ciò che il compito richiede, e significa che il dataset aveva meno variazione di quanto pensassi.
2. Pagare prezzi da modello di fondazione per un compito con telecamera fissa
ACT ha circa 80M parametri ed è stato progettato per essere addestrato da zero su 50 dimostrazioni di un singolo compito. GR00T N1.7 ha circa 3B parametri con un backbone pre-addestrato. Per una telecamera fissa, un tavolo fisso e un oggetto, il modello da 80M spesso raggiunge l'obiettivo, funziona a circa 20 ms per passo d'azione invece di 152 ms, e costa da 1 a 3 USD per esecuzione invece di 4 a 12. Spendi 3 USD per scoprire se il modello economico funziona prima di spendere 12 USD per quello costoso. ACT contro SmolVLA e GR00T N1.7 contro Pi0.5 mostrano dove ciascuno smette di essere la risposta giusta; l' arena dei modelli ha 85 modelli e 332 risultati di benchmark.
3. La GPU che hai dimenticato
L'errore più economico da prevenire e il più comune da commettere. Un'istanza avviata di venerdì per il debug di qualcosa fattura per tutto il fine settimana alla stessa tariffa di un'esecuzione reale.
| Scheda | Tariffa media nello snapshot | Inattiva per 24 h | Inattiva per 7 giorni | Ciò equivale a |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | circa 27 esecuzioni SmolVLA o ACT a 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | circa 12 esecuzioni GR00T a 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | circa 38 esecuzioni GR00T a 8 USD |
Su AY-Robots questo tipo di errore è stato eliminato per l'inferenza: i pod forniti dall'API di inferenza includono un watchdog per l'inattività e si autodistruggono dopo un periodo di inattività. Se noleggi la scheda tu stesso, quel watchdog è il tuo promemoria sul calendario.
4. Pagare due volte per la stessa risposta
Il punto di ingresso per il fine-tuning di GR00T è una CLI tyro che non espone alcun seed. Questa non è una limitazione della piattaforma, è lo strumento a monte: non esiste un campo seed in gr00t/configs/finetune_config.py, e i suggerimenti di training del repository stesso avvertono che le esecuzioni variano dal 5 al 6 percento perché le aumentazioni delle immagini non sono deterministiche. lerobot imposta il seed a 1000 sia in 0.5.1 che in 0.6.1, quindi le esecuzioni di ACT, SmolVLA e Pi0.5 possono almeno essere rieseguite dalla stessa inizializzazione e ordine dei dati. Questa non è una promessa di pesi bit-identici su una GPU, ma è la differenza tra una riesecuzione e un nuovo esperimento. Se un'esecuzione GR00T produce una policy che funziona e non hai conservato il checkpoint, paghi il prezzo intero per un risultato che potrebbe differire più della differenza che stavi cercando. Esiste un secondo modo per perdere un checkpoint per cui hai pagato: la CLI imposta di default --save-total-limit 5, documentato come il numero massimo di checkpoint conservati prima che quelli più vecchi vengano eliminati. Lo storage costa pochi centesimi; una riesecuzione costa da 4 a 12 USD e sei ore.
I prezzi minimi di offerta sopra sono una frazione della tariffa on-demand, e vast.ai afferma che il sistema di offerta può ridurre i costi per i clienti del cinquanta percento o più. Il problema, secondo le loro stesse parole: un'istanza interrompibile può essere messa in pausa in qualsiasi momento se un altro utente offre di più o viene creato un noleggio on-demand per le stesse risorse, e quella pausa "ferma tutti i processi in esecuzione". L'on-demand ha sempre la precedenza. Va bene per un'esecuzione che scrive un checkpoint ogni poche centinaia di passi, una perdita totale per una che scrive alla fine, che è esattamente ciò che ti danno le impostazioni predefinite: la CLI di Isaac-GR00T scrive ogni --save-steps (predefinito 1000), ma --save_freq di lerobot è predefinito a 20.000 passi, quindi un'esecuzione predefinita di SmolVLA salva un checkpoint una volta, al traguardo. Abbassalo, o non fare offerte. Il modulo di training di AY-Robots espone il parametro GR00T come saveSteps.
- La tariffa oraria più bassa disponibile.
- Controllo completo dell'immagine, della versione CUDA, della revisione di lerobot o Isaac-GR00T e di ogni flag.
- L'offerta interrompibile dimezza la tariffa se la tua esecuzione salva checkpoint abbastanza spesso da sopravvivere a una pausa.
- Nulla è astratto, quindi quando un'esecuzione si comporta in modo strano puoi capirne il motivo.
- Il setup viene fatturato alle tariffe GPU: driver, dipendenze, il checkpoint base di diversi gigabyte e il download del dataset costano tutti la stessa tariffa oraria del training.
- Un'istanza interrompibile superata in offerta viene messa in pausa e i suoi processi terminati. Un'esecuzione non salvata è denaro bruciato, e l'impostazione predefinita di lerobot scrive il suo primo checkpoint al passo 20.000.
- Nessuno distrugge il pod per te. La tabella dei costi di inattività sopra è la fattura per aver dimenticato.
- L'offerta di singole schede complete da 80 GB è scarsa: due offerte A100 80 GB e cinque H100 80 GB a scheda intera in questa lettura. L'elenco cambia anche frequentemente, quindi il prezzo più basso elencato e il prezzo che puoi effettivamente noleggiare non sono lo stesso numero.
- Ogni ora spesa sull'infrastruttura è un'ora non spesa a registrare gli episodi che decidono se la policy funziona.
Far da sé contro lasciare che la piattaforma noleggi la scheda
Scegli la macchina, costruisci l'ambiente e distruggi il pod. La tariffa oraria è quella di mercato sopra; tutto il resto è il tuo tempo.
- Trova una scheda che corrisponda alla VRAM richiesta dal modello: 24 GB per ACT e SmolVLA, 80 GB per GR00T e Pi0.5.
- Noleggia on-demand se l'esecuzione non può sopravvivere a una pausa, interrompibile se salva checkpoint spesso.
- Installa la toolchain: lerobot per ACT, SmolVLA e Pi0.5, il repository Isaac-GR00T con il suo launcher tyro per GR00T.
- Converti il dataset se necessario. Un dataset LeRobot v3.0 fa crashare il loader GR00T e deve essere convertito alla v2.1.
- Avvia, osserva la perdita, spingi i checkpoint in un luogo duraturo man mano che vengono scritti.
- Distruggi l'istanza, quindi verifica di averla distrutta.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Costo realistico per un'esecuzione GR00T: da 3 a 6 ore su una H100 80 GB a 1.34 a 2.34 USD all'ora sono da 4 a 14 USD, più da 20 a 40 minuti di setup che viene anch'esso fatturato, più il tuo tempo.
Scegli il modello, il dataset e gli iperparametri in un modulo. Il backend noleggia una GPU spot dimensionata in base alla VRAM richiesta dal modello, esegue il trainer e scrive i checkpoint su object storage.
- Scegli la tua combinazione sulla matrice di training: cinque modelli, quattro bracci, una guida per cella.
- Puntalo a un dataset: uno registrato con il client desktop, un ID repo di Hugging Face, o uno dalla tua macchina.
- Accetta le impostazioni predefinite o regolale. La tabella sopra è ciò che viene effettivamente inviato al trainer.
- Il backend sceglie la scheda in base alla VRAM richiesta, quindi non devi mai cercare GPU.
- I checkpoint finiscono nell'object storage man mano che vengono scritti, quindi un'esecuzione interrotta non è un'esecuzione persa.
| Livello | Modelli | Tempo di esecuzione | Costo per esecuzione |
|---|---|---|---|
| A100 80 GB o H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 o any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
Ciò che non fa: rendere buono un dataset cattivo, dare a GR00T un seed che non ha mai avuto, o rimuovere il limite di latenza descritto di seguito. Rimuove la ricerca di GPU, la costruzione dell'ambiente e il pod che hai dimenticato di distruggere. I dettagli sono nelle documentazione di training.
Cosa addebita la piattaforma e come sceglie la scheda
La logica è volutamente semplice. Ogni modello nel catalogo, dichiara un livello di GPU; il backend prende la VRAM richiesta e noleggia una scheda corrispondente sullo stesso mercato spot misurato sopra. Ecco perché il costo quotato è un intervallo, non un prezzo. GR00T e Pi0.5 sono qui solo cloud a causa dei limiti inferiori di 40 GB e 70 GB. SmolVLA e ACT funzionano anche localmente sulla tua scheda da 24 GB, dove il costo del cloud è zero e l'elettricità è un tuo problema.

Un parametro merita un avvertimento. L'accumulo del gradiente si applica effettivamente a entrambe le varianti GR00T, quindi aumentarlo consente di ottenere un batch effettivo più grande sulla stessa scheda. Per Pi0.5 e SmolVLA non si applica affatto: lerobot 0.5.1 non ha un'opzione di accumulo del gradiente nella sua configurazione di training, quindi impostare il campo a 16 non costa nulla e non produce alcun risultato. Se un lavoro in coda non si avvia mai, la pagina sui lavori bloccati in coda, spiega cosa controllare; se il dataset viene rifiutato prima dell'inizio dell'esecuzione, è quasi sempre il problema del formato v3.0.
Una GPU a noleggio che serve la tua policy tramite internet pubblico aggiunge round trip a un ciclo di controllo che è già di 20-485 ms per passo d'azione. Va bene per operazioni lente di pick-and-place, non per movimenti reattivi veloci. L'inferenza cloud valuta bene un checkpoint ma esegue male la manipolazione in produzione: se il compito richiede velocità, la computazione deve essere vicina ai servi, e questo è un costo che questo articolo non può far sparire. Vedi latenza di inferenza.
Un budget elaborato per una prima policy funzionante
Tutte e quattro le righe insieme, partendo da zero. Il totale della GPU presuppone 3-5 esecuzioni: la prima dimostra che la pipeline funziona, la seconda espone un problema di dati, la terza o la quarta è quella che mantieni.
| Voce | Percorso snello | Percorso confortevole |
|---|---|---|
| Braccio | Solo follower SO-100, 121.94 USD nella distinta base | leader più follower, 229.88 USD nella distinta base |
| Modello | SmolVLA o ACT, livello 24 GB | GR00T N1.7, A100 80 GB o livello H100 |
| Episodi registrati | 30, il minimo per SmolVLA | 50-100 |
| Tempo umano per registrare | circa 1 h 12 min | 2-4 ore |
| Costo di una singola esecuzione | 1-3 USD | 4-12 USD |
| Esecuzioni prima che funzioni | 3-5 | 3-5 |
| Spesa totale GPU | 3-15 USD | 12-60 USD |
| Voce più grande sulla fattura | il braccio, poi il tuo tempo | il braccio, poi il tuo tempo |
Il modello si mantiene anche per robot di queste dimensioni: il calcolo è un errore di arrotondamento, l'hardware è un costo una tantum reale, le ore umane sono la spesa ricorrente. Per testare la parte di addestramento prima di acquistare qualsiasi cosa, i punti di accesso senza hardware ti permettono di confrontare modelli e noleggiare una GPU senza un braccio, e il braccio live è un SO-100 fisico che puoi controllare nel browser senza registrazione. Per l'intera pipeline end-to-end, la guida completa SO-100 copre la configurazione, la teleoperazione e l'addestramento, e addestra la tua prima policy è la versione breve.

Quanto costa un'esecuzione completa di fine-tuning VLA?▾
Circa 4-12 USD per GR00T N1.7, GR00T N1.5 o Pi0.5 sul livello A100 80 GB o H100 (3-6 ore a 1.20-2.00 USD all'ora), e circa 1-3 USD per SmolVLA o ACT sul livello RTX 4090 (2-5 ore a 0.30-0.60 USD all'ora). Noleggiare la scheda da soli rientra nello stesso intervallo una volta conteggiato il tempo di configurazione, poiché viene fatturato alla tariffa di addestramento.
Vale la pena pagare per una H100 rispetto a una A100 80 GB?▾
Per una singola policy SO-100, di solito no. Entrambe superano il limite di memoria richiesto da GR00T e Pi0.5, e nella lettura del 23 agosto 2026 una A100 80 GB completa partiva da 0.44 USD all'ora contro 1.34 per una H100 80 GB. La H100 termina prima, quindi parte del costo si recupera con meno ore, ma il totale è comunque più alto per un'esecuzione così piccola. Il vero argomento a favore della H100 è la disponibilità: cinque offerte di singole H100 80 GB su quel mercato contro due A100 80 GB, e una scheda che non puoi noleggiare non ha prezzo.
Quante esecuzioni sono necessarie prima che una policy funzioni effettivamente?▾
Pianifica da tre a cinque. La prima dimostra che la pipeline è configurata correttamente. La seconda espone comunemente un problema del dataset, come un flusso della telecamera che si è interrotto a metà. La terza o la quarta è quella che mantieni.
Posso addestrare SmolVLA o ACT sulla mia GPU invece di noleggiarla?▾
Sì. Entrambi sono supportati localmente su AY-Robots ed entrambi si adattano comodamente a 24 GB; il paper originale di ACT ha addestrato il suo modello da 80M in circa 5 ore su una RTX 2080 Ti da 11 GB. GR00T e Pi0.5 sono solo cloud qui perché i requisiti minimi di fine-tuning documentati dai fornitori sono 40 GB e 70 GB, e la più grande scheda consumer sul mercato è la RTX 5090 da 32 GB.
Perché lo stesso numero di passi costa importi diversi tra i modelli?▾
I passi non sono comparabili tra le policy. ACT utilizza 100.000 passi con batch 8 su una scheda da 24 GB; GR00T N1.5 utilizza 2.000 passi con batch 1 e accumulo del gradiente 16 su una scheda da 80 GB. Il costo è dato dalle ore moltiplicate per la tariffa della scheda che l'impronta di memoria ti impone, non dal contatore dei passi.
Scopri quanto costerebbe la tua esecuzione prima di avviarla
Ciascuna delle cinque policy elenca il suo livello GPU, il tempo di esecuzione e il prezzo per esecuzione, e il backend di addestramento noleggia la scheda sullo stesso mercato spot su cui sono stati misurati questi numeri.
Verifica i prezziSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started