
Prețuri reale ale GPU-urilor pe piața spot, cât durează rularea fiecăreia dintre cele cinci politici, cât costă brațul și demonstrațiile, și cele patru locuri unde banii dispar în liniște.
Pe scurt
- •O rulare pe nivelul A100 80 GB sau H100 durează 3 până la 6 ore și costă aproximativ 4 până la 12 USD. Pe nivelul RTX 4090, durează 2 până la 5 ore și costă aproximativ 1 până la 3 USD.
- •Măsurat pe vast.ai la 13:44 UTC pe 23 august 2026: un RTX 4090 complet la cerere pentru 0.13 până la 0.38 USD/h, un A100 80 GB pentru 0.44 până la 0.67, un H100 80 GB pentru 1.34 până la 2.34. Plăcile complete de 80 GB sunt rare, cu două, respectiv cinci oferte de plăci individuale.
- •GPU-ul este cea mai ieftină linie. Lista de materiale SO-ARM100 plasează o pereche lider plus urmăritor la 229.88 USD, ceea ce înseamnă 77 până la 230 de rulări pe nivelul de 24 GB.
- •Două ore în care o persoană înregistrează 50 de episoade costă mai mult decât rularea de antrenament pe care o alimentează acele episoade.
- •Banii dispar în patru locuri: rulări pe date corupte, modele 3B pe sarcini gestionate de o politică 80M, GPU-uri pe care nimeni nu le-a distrus și re-rulări ale unui rezultat pe care nu ați reușit să-l păstrați.
- •AY-Robots dimensionează placa în funcție de VRAM-ul necesar modelului și o închiriază pe aceeași piață spot, astfel încât costul rulării este costul pieței.
Factura are patru linii, iar GPU-ul este cea mai mică
Când oamenii întreabă cât costă să ajustezi fin un model viziune-limbaj-acțiune pentru un SO-100, aproape întotdeauna se referă la închirierea GPU-ului. Acesta este numărul care apare ca o taxă pe un card, deci este cel care pare real. Este, de asemenea, la o marjă largă, cel mai mic dintre cele patru numere care decid cât costă de fapt o politică funcțională.
| Linie | Ce este | Dimensiune tipică pentru o politică funcțională |
|---|---|---|
| GPU time | închirierea unei plăci pentru rulare | 1 până la 12 USD per rulare, și veți face 3 până la 5 |
| The robot | servo-uri, cadru imprimat, camere, cabluri, alimentare | o singură dată, 110 până la 500 EUR pe braț |
| Human hours | o persoană care operează brațul pentru a înregistra demonstrații | 1 până la 4 ore per set de date, repetat per sarcină |
| Waste | date proaste, modele supradimensionate, pod-uri uitate | nelimitat, și singura linie pe care o controlați |
Timpii de antrenament de mai jos provin din documentele și depozitele proprii ale celor cinci modele, costul hardware din lista de materiale publicată, numerele platformei de la AY-Robots catalogul de politici și pagina de prețuri. Acolo unde platforma nu ajută, acest articol o menționează.
Cât costă de fapt o oră de GPU pe piața spot
Nu există un preț unic pentru o oră de A100. Pe o piață precum vast.ai, fiecare gazdă își stabilește propria rată, iar rula de antrenament pe care o lansați ajunge pe orice mașină este ieftină și disponibilă în acel moment. Răspunsul sincer este o distribuție. Iată-l, măsurat pe 23 august 2026 la 13:44 UTC: plăci complete individuale, la cerere, filtrate după VRAM real.
| Placă | vast.ai la cerere USD/h (minim / median / maxim) | Oferte de plăci complete | Preț minim vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | nu este oferit |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | nu este oferit |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 ca Spațiu |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 ca punct final |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | nu este oferit |
Oferte la cerere pentru un singur GPU complet (gpu_frac == 1.0) de la API-ul public vast.ai, care nu necesită cont, filtrate după gpu_ram astfel încât doar plăcile autentice de 80 GB să apară în rândurile de 80 GB. Acest filtru contează: în această citire, toate cele trei oferte de A100 SXM4 cu o singură placă erau de 40 GB, la fel ca două dintre cele patru oferte de A100 PCIE, deci gruparea lor într-un singur rând „A100” ar fi înjumătățit prețul raportat aici. Coloana Hugging Face combină două produse: 2.50 USD/h este hardware-ul Nvidia A100 - large Spaces, iar 4.50 USD/h este un singur H100 80 GB sub Inference Endpoints, pe care Spaces nu îl oferă. Tratați medianele ca fiind indicative: rândul A100 80 GB se bazează pe două oferte, iar rândul H100 pe cinci, iar aceeași interogare, 36 de secunde mai târziu, a returnat un număr diferit de 4090 și un preț maxim diferit pe trei dintre cele cinci rânduri. Prețurile de listă RunPod sunt numerele mai stabile pe care să vă bazați planificarea.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
De ce modelele 3B nu pot folosi placa ieftină
O oră de 4090 și o oră de H100 80 GB diferă de aproximativ șase ori la mediile de mai sus. Ceea ce te forțează să folosești placa scumpă nu este viteza, ci memoria. openpi stabilește un minim pentru un Pi0.5 complet fine-tune la 70 GB, iar NVIDIA recomandă 40 GB sau mai mult pentru GR00T. Rețineți ce nu este numărul GR00T. Configurația sa de fine-tune îngheață modelul lingvistic și encoderul vizual implicit (tune_llm și tune_visual sunt False, iar proiectorul și capul de difuzie True), motiv pentru care catalogul listează aproximativ 40 M parametri antrenați din 3 B. Cei 40 GB nu reprezintă starea optimizatorului pentru 3 B ponderi, ci backbone-ul înghețat plus activările. Variantele cu scop redus necesită mai puțin: calea LoRA a openpi necesită 22.5 GB și menționează 4090, iar fluxul de lucru Isaac Lab Arena de la NVIDIA listează o opțiune cu un singur GPU de 24 GB pentru post-antrenarea GR00T. Platforma se bazează pe cerințele minime pe care fiecare furnizor le publică pentru configurația pe care o rulează efectiv. Articolul despre flow-matching al pi0 explică de unde provine acea flow-matching amprentă.
| Sarcină | Memoria cerută de proiectul upstream | Sursă |
|---|---|---|
| Inferență pi0 / pi0.5 | mai mult de 8 GB, exemplu RTX 4090 | openpi |
| Fine-tune LoRA pi0 / pi0.5 | mai mult de 22.5 GB, exemplu RTX 4090 | openpi |
| Fine-tune complet pi0 / pi0.5 | mai mult de 70 GB, exemplu A100 80 GB sau H100 | openpi |
| Inferență GR00T N1.7 | 1 GPU cu 16 GB sau mai mult | Isaac-GR00T |
| Fine-tune GR00T N1.7 | 40 GB sau mai mult recomandat, noduri H100 sau L40 | Isaac-GR00T |
| Fine-tune GR00T, ce antrenează | proiector și cap de difuzie; LLM și encoder vizual înghețate implicit | finetune_config.py |
| Post-antrenare GR00T, redus | 1 GPU cu 24 GB, model lingvistic înghețat | Isaac Lab Arena |
| Fine-tune SmolVLA | un singur A100 pentru rularea de referință de 20.000 de pași | lerobot docs |
| Antrenare ACT | un singur 11 GB RTX 2080 Ti | ACT paper |
Acest tabel explică de ce platforma împarte cele cinci modele în două niveluri. GR00T N1.7, GR00T N1.5 și Pi0.5 rulează pe A100 80 GB sau H100, deoarece asta cer furnizorii. SmolVLA și ACT rulează pe un RTX 4090 sau orice placă de 24 GB, deoarece asta este suficient.
O rulare GR00T sau Pi0.5 pe o placă de 24 GB nu eșuează imediat. Descarcă checkpoint-ul de bază, construiește indexul setului de date, începe prima trecere înainte și se oprește după câteva sute de pași cu o eroare CUDA de lipsă de memorie. Ai plătit pentru descărcare și configurare și nu ai obținut nimic. Soluții: lipsă de memorie în timpul antrenării.
Cât timp rulează efectiv fiecare dintre cele cinci modele
Timpul de rulare este cealaltă jumătate a costului: 2.00 USD pe oră este irelevant dacă sarcina durează 40 de minute și ruinător dacă durează 40 de ore. Acestea sunt valorile implicite pe care AY-Robots le trimite antrenorului, împreună cu fereastra de rulare și costul pentru fiecare nivel.
| Politică | Nivel GPU | Pași maximi impliciți | Batch implicit (acumulare gradient) | Fereastră de rulare | Cost per rulare |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

De unde provin acele ferestre de execuție din amonte
- SmolVLA: documentația lerobot afirmă că 20,000 de pași durează aproximativ 4 ore pe un singur A100. Platforma rulează aceiași 20,000 de pași pe nivelul mai ieftin de 24 GB, de unde o fereastră în loc de 4 ore fixe.
- ACT: lucrarea originală ALOHA raportează aproximativ 5 ore pe un singur 11 GB RTX 2080 Ti pentru un model cu 80M de parametri. Un 4090 este cu câteva generații mai nou, dar platforma alocă 100,000 de pași, astfel încât fereastra se încadrează în același loc.
- GR00T: fluxul de lucru de referință NVIDIA pentru generația N1.6 citează aproximativ 4 până la 8 ore pentru 20,000 de pași la batch 24 pe opt plăci L40S, și 2 până la 3 ore pentru 30,000 de pași la batch 16 pe o singură Ada 6000. Ajustarea fină a unui VLA de 3B pe o singură placă în câteva ore este normală, nu optimistă.
- Pi0.5: openpi nu publică nicio cifră de timp real, dar publică pragul de 70 GB pentru o ajustare fină completă, ceea ce fixează placa și, prin urmare, rata.
Merită să ne oprim asupra numărului pe care nu îl plătiți. Lucrarea GR00T N1 raportează aproximativ 50,000 de ore GPU H100 pentru a preantrena modelul 2.2B, pe un cluster de până la 1024 de GPU-uri, la o dimensiune a batch-ului de preantrenare de 16,384 pentru 200,000 de pași de gradient. La 1.34 până la 2.34 USD pe oră, măsurat mai sus, aceasta înseamnă aproximativ 67,000 până la 117,000 USD de putere de calcul închiriată. Lucrarea SmolVLA estimează proiectul său la aproximativ 30,000 de ore GPU pe 481 de seturi de date comunitare, 22.9K episoade și 10.6M cadre. Moșteniți toate acestea la prețul unei descărcări; cei 8 USD ai dumneavoastră cumpără ultimii 20,000 de pași. De ce sunt construite astfel VLA-urile acoperă această diviziune.
Brațul: un cost unic care eclipsează factura GPU
O rulare de antrenament costă mai puțin decât prânzul. Robotul nu. De aceea SO-100 contează: este cel mai ieftin braț pe care îl suportă de fapt întregul învățare prin imitație set de instrumente.
| Braț | Servomotoare | Tensiune | Cost piese | Suport pe AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | braț complet, de referință |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | complet |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatibil |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatibil |
Lista de materiale din depozitul SO-ARM100 este mai granulară și merită verificată în funcție de regiunea dumneavoastră: lista sa Piese pentru două brațe totalizează 229.88 USD sau 226.30 EUR pentru o configurație lider plus urmăritor, iar lista sa Piese pentru un braț urmăritor totalizează 121.94 USD sau 124.30 EUR. Șase servomotoare STS3215 la 13.89 USD fiecare reprezintă 83.34 din cei 121.94, deci servomotoarele sunt brațul. La 1 până la 3 USD per rulare SmolVLA sau ACT, o pereche de brațe valorează între 77 și 230 de rulări de antrenament. Dacă încă alegeți, SO-100 versus SO-101 este comparația care contează, deoarece cele două sunt suficient de apropiate încât decizia se referă la disponibilitate, mai degrabă decât la capacitate.
STS3215 este livrat într-o variantă de 7.4 V și una de 12 V; depozitul menționează că piesa de 12 V necesită și o sursă de alimentare de 12 V 5 A în loc de cea de 5 V, deci cele două nu sunt interschimbabile. Alimentarea servomotoarelor de 7.4 V cu 12 V le distruge, iar șase servomotoare reprezintă două treimi din costul pieselor unui braț urmăritor. Verificați eticheta fiecărui servomotor înainte de prima pornire. Dacă servomotoarele se comportă deja ciudat: servomotorul nu răspunde, brațul se smucește apoi se lasă.
Ore umane: rândul pe care nimeni nu-l include în foaia de calcul
Acesta este numărul care răstoarnă discuția despre costuri. Înregistrarea demonstrațiilor înseamnă o persoană care mișcă un braț robotic, câte un episod pe rând, în timp real. Nu există procesare în loturi și nici închiriere la secundă. Înregistratorul setul de date LeRobot vine cu setări implicite care simplifică aritmetica, toate trei confirmate în DatasetRecordConfig: 60 de secunde per episod, 60 de secunde pentru a reseta scena, 50 de episoade. Coloana de costuri de mai jos presupune 15 USD pentru o oră de muncă a unei persoane, ceea ce este o presupunere, nu o valoare a platformei. Înlocuiți cu propria rată; raportul este esențial.
- 1Înregistrați setul de date cu setările implicite pentru care veți fi de fapt facturat
Aceasta este lerobot 0.6.1, versiunea de pe PyPI începând cu 3 august 2026. Rețineți forma CLI: înregistrarea se realizează prin punctul de intrare al consolei
lerobot-record(lerobot.scripts.lerobot_record), nu prin vechea cale a modululuipython -m lerobot.scripts.record. AY-Robots vizează 0.5.1, iar pachetul 0.5.1 declară aceleași puncte de intrarelerobot-recordșilerobot-train, deci forma de mai jos este stabilă pentru ambele. Cele trei flag-uri de temporizare sunt setările implicite upstream, deci aceasta este și comanda pe care o presupune aritmetica din tabelul următor.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Verificați ce ați înregistrat înainte de a închiria un singur minut de GPU
Inspectarea unui set de date costă zero USD pe oră. Descoperirea aceleiași probleme dintr-o curbă de pierdere costă 2.00 USD pe oră pe nivelul H100 și vă anunță cu patru ore întârziere. Încărcați setul de date și examinați-l în vizualizatorul LeRobot, sau navigați în directorul de seturi de date AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Antrenați și asigurați-vă că punctul de control supraviețuiește pod-ului
O mașină închiriată este temporară prin definiție, așa că scrieți punctele de control undeva durabil în timpul rulării. Două flag-uri decid dacă păstrați ceea ce ați plătit.
--save_freqare o valoare implicită de 20.000 de pași, deci o rulare SmolVLA implicită de 20.000 de pași scrie primul său punct de control când rularea este deja terminată; reduceți-l înainte de a închiria ceva întreruptibil.--save_checkpoint_to_hubnecesită--policy.repo_idși nu există în lerobot 0.5.1, deci pe acea versiune copiați singur directorul de ieșire de pe mașină. Dimensiunea lotului de mai jos este exemplul din documentația upstream; formularul AY-Robots trimite 2 pentru SmolVLA și scrie în stocarea de obiecte pe măsură ce apar punctele de control.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episoade | Înregistrare la 60 s | Resetare la 60 s | Timp real | Plus 20 la sută reînregistrări | La 15 USD pe oră umană |
|---|---|---|---|---|---|
| 30, the SmolVLA minimum | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, the other four minimums | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, a comfortable dataset | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Comparați coloana din dreapta cu costurile de rulare de 1 până la 12 USD. La această rată estimată, un set de date de 50 de episoade costă de două până la șapte ori mai mult pentru a fi înregistrat decât pentru a fi antrenat, înainte de calibrare, configurarea camerei și episoadele pe care le aruncați. De aceea are o valoare monetară directă. Ghidul lerobot sugerează cel puțin 50 de episoade cu 10 pe locație de obiect; documentația SmolVLA raportează că o versiune de 25 de episoade a aceleiași sarcini nu a fost suficientă.
Unde dispar de fapt banii
1. Rulări pe date care nu ar fi funcționat niciodată
O rulare GR00T de 20.000 de pași pe un set de date cu două fluxuri de cameră inversate costă la fel ca una pe un set de date curat, durează același timp și produce o curbă de pierdere care arată bine. Eșecul apare pe braț, ore mai târziu. sunt facturate la oră, iar diagnosticul este facturat în zile. Două simptome demne de reținut: înseamnă de obicei că observațiile nu conțin ceea ce este necesar pentru sarcină, și înseamnă că setul de date a avut mai puțină variație decât ați crezut.
2. Plătirea prețurilor de model fundamental pentru o sarcină cu cameră fixă
ACT are aproximativ 80M de parametri și a fost proiectat să se antreneze de la zero pe 50 de demonstrații ale unei singure sarcini. GR00T N1.7 are aproximativ 3B de parametri cu un backbone pre-antrenat. Pentru o cameră fixată, o masă fixă și un singur obiect, modelul de 80M ajunge frecvent la rezultat, rulează la aproximativ 20 ms per pas de acțiune în loc de 152 ms și costă 1 până la 3 USD per rulare în loc de 4 până la 12. Cheltuiți 3 USD pentru a afla dacă modelul ieftin funcționează înainte de a cheltui 12 USD pe cel scump. ACT versus SmolVLA și GR00T N1.7 versus Pi0.5 arată unde fiecare încetează să mai fie răspunsul corect; arena de modele are 85 de modele și 332 de rezultate de benchmark.
3. GPU-ul pe care l-ați uitat
Cea mai ieftină greșeală de prevenit și cea mai comună de făcut. O instanță pornită vineri pentru a depana ceva facturează pe tot parcursul weekendului la aceeași rată ca o rulare reală.
| Card | Rata mediană în instantaneu | Inactiv timp de 24 h | Inactiv timp de 7 zile | Aceasta valorează |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | aproximativ 27 de rulări SmolVLA sau ACT la 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | aproximativ 12 rulări GR00T la 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | aproximativ 38 de rulări GR00T la 8 USD |
Pe AY-Robots, această eroare este eliminată pentru inferență: podurile provizionate de API-ul de inferență conțin un watchdog de inactivitate și se autodistrug după o perioadă de inactivitate. Dacă închiriați singur placa, acel watchdog este memento-ul dvs. din calendar.
4. Plătind de două ori pentru același răspuns
Punctul de intrare pentru fine-tuning al GR00T este un CLI tyro care nu expune nicio valoare seed. Aceasta nu este o limitare a platformei, ci a instrumentului upstream: nu există un câmp seed în gr00t/configs/finetune_config.py, iar sfaturile de antrenament ale depozitului avertizează că rulările variază cu 5 până la 6 procente deoarece augmentările de imagine sunt non-deterministice. lerobot utilizează implicit seed 1000 atât în 0.5.1, cât și în 0.6.1, astfel încât rulările ACT, SmolVLA și Pi0.5 pot fi cel puțin reluate de la aceeași inițializare și ordine a datelor. Aceasta nu este o promisiune de ponderi identice la nivel de bit pe un GPU, dar este diferența dintre o reluare și un nou experiment. Dacă o rulare GR00T produce o politică funcțională și nu ați păstrat checkpoint-ul, plătiți prețul integral pentru un rezultat care poate diferi cu mai mult decât diferența pe care o urmăreați. Există o a doua modalitate de a pierde un checkpoint pentru care ați plătit: CLI-ul utilizează implicit --save-total-limit 5, documentat ca numărul maxim de checkpoint-uri păstrate înainte ca cele mai vechi să fie șterse. Stocarea costă cenți; o reluare costă între 4 și 12 USD și șase ore.
Plafoanele de licitație de mai sus reprezintă o fracțiune din rata la cerere și vast.ai afirmă că sistemul de licitație poate reduce costurile clienților cu cincizeci la sută sau mai mult. Dezavantajul, în propriile cuvinte: o instanță întreruptibilă poate fi întreruptă în orice moment dacă un alt utilizator licitează mai mult sau dacă o închiriere la cerere este creată pentru aceleași resurse, iar acea întrerupere "oprește toate procesele care rulează". La cerere are întotdeauna prioritate. Este bine pentru o rulare care scrie un punct de control la fiecare câteva sute de pași, o pierdere totală pentru una care scrie la final, ceea ce este exact ceea ce îți oferă setările implicite: Isaac-GR00T CLI scrie la fiecare --save-steps (implicit 1000), dar --save_freq de la lerobot are o valoare implicită de 20.000 de pași, astfel încât o rulare implicită SmolVLA salvează un punct de control o singură dată, la linia de sosire. Reduceți-o, sau nu licitați. Formularul de antrenament AY-Robots expune parametrul GR00T ca saveSteps.
- Cea mai mică rată orară existentă.
- Control complet asupra imaginii, versiunii CUDA, reviziei lerobot sau Isaac-GR00T și a fiecărui flag.
- Licitația întreruptibilă reduce la jumătate rata dacă rularea ta salvează puncte de control suficient de des pentru a supraviețui unei întreruperi.
- Nimic nu este abstractizat, așa că atunci când o rulare se comportă ciudat poți vedea de ce.
- Configurarea este facturată la tarifele GPU: driverele, dependențele, punctul de control de bază de mai mulți gigabytes și descărcarea setului de date costă toate la fel pe oră ca și antrenamentul.
- O instanță întreruptibilă depășită la licitație este întreruptă și procesele sale sunt oprite. O rulare nesalvată înseamnă bani arși, iar setarea implicită lerobot scrie primul său punct de control la pasul 20.000.
- Nimic nu distruge pod-ul pentru tine. Tabelul de inactivitate de mai sus reprezintă factura pentru uitare.
- Oferta pentru plăci complete de 80 GB este redusă: două oferte A100 80 GB și cinci oferte H100 80 GB de plăci complete în această lectură. Lista se modifică, de asemenea, astfel încât cel mai mic preț listat și prețul pe care îl poți închiria efectiv nu sunt același număr.
- Fiecare oră petrecută pe infrastructură este o oră nepetrecută înregistrând episoadele care decid dacă politica funcționează.
A face singur versus a lăsa platforma să închirieze placa
Tu alegi mașina, construiești mediul și distrugi pod-ul. Tariful orar este cel de piață menționat mai sus; orice altceva este timpul tău.
- Găsește o placă ce corespunde VRAM-ului necesar modelului: 24 GB pentru ACT și SmolVLA, 80 GB pentru GR00T și Pi0.5.
- Închiriază la cerere dacă rularea nu poate supraviețui unei pauze, sau întreruptibil dacă salvează puncte de control des.
- Instalează setul de instrumente (toolchain): lerobot pentru ACT, SmolVLA și Pi0.5, depozitul Isaac-GR00T cu propriul său lansator tyro pentru GR00T.
- Convertește setul de date dacă este necesar. Un set de date LeRobot v3.0 blochează încărcătorul GR00T și trebuie convertit la v2.1.
- Lansează, urmărește pierderea (loss), împinge punctele de control într-un loc durabil pe măsură ce sunt scrise.
- Distruge instanța, apoi verifică dacă ai distrus-o.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Cost realist pentru o rulare GR00T: 3 până la 6 ore pe un H100 80 GB la 1.34 până la 2.34 USD pe oră înseamnă 4 până la 14 USD, plus 20 până la 40 de minute de configurare care se taxează de asemenea, plus timpul tău.
Tu alegi modelul, setul de date și hiperparametrii într-un formular. Backend-ul închiriază un GPU spot dimensionat în funcție de VRAM-ul necesar modelului, rulează antrenorul și scrie punctele de control în stocarea de obiecte.
- Alege combinația ta pe matricea de antrenament: cinci modele, patru brațe, un ghid per celulă.
- Indică un set de date: unul înregistrat cu clientul desktop, un ID de depozit Hugging Face, sau unul de pe propria mașină.
- Acceptă valorile implicite sau ajustează-le. Tabelul de mai sus este ceea ce este trimis efectiv antrenorului.
- Backend-ul alege placa în funcție de VRAM-ul necesar, deci nu trebuie să cauți niciodată GPU-uri.
- Punctele de control ajung în stocarea de obiecte pe măsură ce sunt scrise, deci o rulare întreruptă nu este o rulare pierdută.
| Nivel | Modele | Timp de rulare | Cost per rulare |
|---|---|---|---|
| A100 80 GB sau H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 până la 6 ore | aproximativ 4 până la 12 USD |
| RTX 4090 sau orice placă de 24 GB | SmolVLA, ACT | 2 până la 5 ore | aproximativ 1 până la 3 USD |
Ce nu face: nu transformă un set de date prost într-unul bun, nu oferă GR00T un seed pe care nu l-a avut niciodată, sau nu elimină limita de latență descrisă mai jos. Elimină căutarea de GPU-uri, construirea mediului și pod-ul pe care ai uitat să-l distrugi. Mecanismele sunt în documentația de antrenament.
Ce taxează platforma și cum alege placa
Logica este în mod deliberat plictisitoare. Fiecare model din catalog, declară un nivel de GPU; backend-ul preia VRAM-ul necesar și închiriază o placă potrivită pe aceeași piață spot măsurată mai sus. De aceea costul cotat este o plajă, nu un preț. GR00T și Pi0.5 sunt disponibile doar în cloud aici din cauza limitelor inferioare de 40 GB și 70 GB. SmolVLA și ACT rulează și local pe propria placă de 24 GB, unde costul cloud este zero și electricitatea este problema dumneavoastră.

O setare merită o avertizare. Acumularea de gradient se aplică într-adevăr pentru ambele variante GR00T, astfel încât creșterea acesteia cumpără un batch efectiv mai mare pe aceeași placă. Pentru Pi0.5 și SmolVLA nu se aplică deloc: lerobot 0.5.1 nu are o opțiune de acumulare de gradient în configurația sa de antrenament, deci setarea câmpului la 16 nu costă nimic și nu aduce nimic. Dacă o sarcină în așteptare nu pornește niciodată, pagina despre blocarea în coadă acoperă ce trebuie verificat; dacă setul de date este respins înainte de începerea rulării, este aproape întotdeauna problema formatului v3.0.
Un GPU închiriat care servește politica dvs. prin internetul public adaugă runde de comunicare la o buclă de control care este deja de 20 până la 485 ms per pas de acțiune. Bun pentru operațiuni lente de tip pick-and-place, nu pentru mișcări reactive rapide. Inferența în cloud evaluează bine un punct de control și rulează prost manipularea în producție: dacă sarcina necesită viteză, calculul trebuie să fie lângă servomotoare, iar acesta este un cost pe care acest articol nu-l poate face să dispară. Vezi latența inferenței.
Un buget detaliat pentru o primă politică funcțională
Toate cele patru linii împreună, pornind de la zero. Totalul GPU presupune 3 până la 5 rulări: prima dovedește că pipeline-ul funcționează, a doua expune o problemă de date, a treia sau a patra este cea pe care o păstrați.
| Linie | Cale economică | Cale confortabilă |
|---|---|---|
| Braț | SO-100 doar follower, 121.94 USD în lista de materiale | leader plus follower, 229.88 USD în lista de materiale |
| Model | SmolVLA sau ACT, nivel 24 GB | GR00T N1.7, nivel A100 80 GB sau H100 |
| Episoade înregistrate | 30, minimul SmolVLA | 50 până la 100 |
| Timp uman pentru înregistrare | aproximativ 1 h 12 min | 2 până la 4 ore |
| Costul unei rulări | 1 până la 3 USD | 4 până la 12 USD |
| Rulări înainte de a funcționa | 3 până la 5 | 3 până la 5 |
| Cheltuieli totale GPU | 3 până la 15 USD | 12 până la 60 USD |
| Cea mai mare linie pe factură | brațul, apoi timpul dvs. | brațul, apoi timpul dvs. |
Modelul se menține la această dimensiune de robot: calculul este o eroare de rotunjire, hardware-ul este un cost real unic, orele umane sunt cheltuiala recurentă. Pentru a testa jumătatea de antrenament înainte de a cumpăra ceva, vă permit să comparați modele și să închiriați un GPU fără un braț, iar este un SO-100 fizic pe care îl puteți controla în browser fără înregistrare. Pentru întregul flux de lucru cap la coadă, acoperă configurarea, și antrenamentul, iar este versiunea scurtă.

Cât costă o rulare completă de fine-tuning VLA?▾
Aproximativ 4 până la 12 USD pentru GR00T N1.7, GR00T N1.5 sau Pi0.5 pe nivelul A100 80 GB sau H100 (3 până la 6 ore la 1.20 până la 2.00 USD pe oră), și aproximativ 1 până la 3 USD pentru SmolVLA sau ACT pe nivelul RTX 4090 (2 până la 5 ore la 0.30 până la 0.60 USD pe oră). Închirierea plăcii dvs. se încadrează în același interval odată ce timpul de configurare este luat în considerare, deoarece se facturează la rata de antrenament.
Merită să plătiți pentru un H100 în detrimentul unui A100 80 GB?▾
Pentru o singură politică SO-100, de obicei nu. Ambele depășesc pragul de memorie necesar pentru GR00T și Pi0.5, iar la data de 23 august 2026, un A100 80 GB complet a început de la 0.44 USD pe oră față de 1.34 pentru un H100 80 GB. H100 termină mai repede, deci o parte din cost se recuperează prin mai puține ore, dar totalul este totuși mai mare pentru o rulare atât de mică. Argumentul real pentru H100 este disponibilitatea: cinci oferte de H100 80 GB pe acea piață față de două A100 80 GB, iar o placă pe care nu o puteți închiria nu are preț.
Câte rulări sunt necesare înainte ca o politică să funcționeze efectiv?▾
Planificați trei până la cinci. Prima dovedește că fluxul de lucru este conectat corect. A doua expune de obicei o problemă a setului de date, cum ar fi un flux de cameră care s-a oprit pe parcurs. A treia sau a patra este cea pe care o păstrați.
Pot antrena SmolVLA sau ACT pe propriul meu GPU în loc să închiriez?▾
Da. Ambele sunt suportate local pe AY-Robots și ambele se încadrează confortabil în 24 GB; lucrarea originală ACT a antrenat modelul său de 80M în aproximativ 5 ore pe un RTX 2080 Ti de 11 GB. GR00T și Pi0.5 sunt doar în cloud aici, deoarece pragurile de fine-tuning documentate de furnizori sunt de 40 GB și 70 GB, iar cea mai mare placă de consum de pe piață este RTX 5090 de 32 GB.
De ce același număr de pași costă sume diferite la modele diferite?▾
Pașii nu sunt comparabili între politici. ACT utilizează implicit 100.000 de pași la batch 8 pe o placă de 24 GB; GR00T N1.5 utilizează implicit 2.000 de pași la batch 1 cu acumulare de gradient 16 pe o placă de 80 GB. Factura este orele înmulțite cu rata plăcii pe care amprenta de memorie vă forțează să o utilizați, nu contorul de pași.
Vedeți cât ar costa rularea dvs. înainte de a o începe
Fiecare dintre cele cinci politici listează nivelul GPU, timpul de rulare și prețul per rulare, iar backend-ul de antrenament închiriază placa de pe aceeași piață spot pe care au fost măsurate aceste numere.
Verificați prețurileSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started