
Reelle spotmarkeds-GPU-priser, hvor længe hver af de fem politikker kører, hvad armen og demonstrationerne koster, og de fire steder pengene stille forsvinder.
Den korte version
- •En kørsel på A100 80 GB eller H100-niveau tager 3 til 6 timer og koster omkring 4 til 12 USD. På RTX 4090-niveau er det 2 til 5 timer og omkring 1 til 3 USD.
- •Målt på vast.ai kl. 13:44 UTC den 23. august 2026: et fuldt RTX 4090 on demand for 0.13 til 0.38 USD/t, et A100 80 GB for 0.44 til 0.67, et H100 80 GB for 1.34 til 2.34. Fuld 80 GB-kort er knappe, henholdsvis to og fem enkeltkortstilbud.
- •GPU'en er den billigste post. SO-ARM100's stykliste angiver et leder- plus følgerpar til 229.88 USD, hvilket svarer til 77 til 230 kørsler på 24 GB-niveauet.
- •To timers optagelse af 50 episoder koster mere end den træningskørsel, disse episoder bruges til.
- •Penge forsvinder fire steder: kørsler på ødelagte data, 3B-modeller på opgaver, som en 80M-politik kan håndtere, GPU'er som ingen ødelagde, og genkørsler af et resultat, du ikke fik gemt.
- •AY-Robots dimensionerer kortet efter den VRAM, modellen har brug for, og lejer det på det samme spotmarked, så kørselsomkostningen er markedets pris.
Regningen har fire poster, og GPU'en er den mindste
Når folk spørger, hvad det koster at finjustere en vision-sprog-handlingsmodel, til en SO-100, mener de næsten altid GPU-lejen. Det er det tal, der vises som en opkrævning på et kort, så det er det, der føles virkeligt. Det er også, med stor margin, det mindste af de fire tal, der afgør, hvad en fungerende politik faktisk koster dig.
| Post | Hvad det er | Typisk størrelse for én fungerende politik |
|---|---|---|
| GPU-tid | leje af et kort til kørslen | 1 til 12 USD per kørsel, og du vil udføre 3 til 5 |
| Robotten | servoer, printet ramme, kameraer, kabler, strøm | én gang, 110 til 500 EUR per arm |
| Mennesketimer | en person, der styrer armen for at optage demoer | 1 til 4 timer per datasæt, gentaget per opgave |
| Spild | dårlige data, overdimensionerede modeller, glemte pods | ubegrænset, og den eneste post du kontrollerer |
Træningstiderne nedenfor kommer fra de fem modellers egne papirer og repositories, hardwareomkostninger fra den offentliggjorte stykliste, platformstal fra AY-Robots politik-katalog og prisside. Hvor platformen ikke hjælper, er det angivet i denne artikel.
Hvad en GPU-time faktisk koster på spotmarkedet
Der er ingen enkeltpris for en A100-time. På en markedsplads som vast.ai sætter hver vært sin egen pris, og den træningskørsel du starter, lander på den maskine, der er billig og ledig i det øjeblik. Det ærlige svar er en fordeling. Her er den, målt den 23. august 2026 kl. 13:44 UTC: enkelte fulde kort, on demand, filtreret efter reel VRAM.
| Kort | vast.ai on demand USD/t (lav / median / høj) | Tilbud om fulde kort | vast.ai budgulv | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | ikke tilbudt |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | ikke tilbudt |
| A100 80 GB, PCIe eller SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM eller PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | ikke tilbudt |
On-demand-tilbud for en enkelt fuld GPU (gpu_frac == 1.0) fra vast.ai's offentlige bundle-API, som ikke kræver en konto, filtreret på gpu_ram, så kun ægte 80 GB kort lander i 80 GB rækkerne. Dette filter er vigtigt: i denne aflæsning var alle tre enkeltkort A100 SXM4-tilbud 40 GB dele, ligesom to af de fire A100 PCIE-tilbud, så at samle dem i én "A100"-række ville have halveret den pris, der rapporteres her. Hugging Face-kolonnen blander to produkter: 2.50 USD/h er Nvidia A100 - large Spaces-hardware, og 4.50 USD/h er en enkelt H100 80 GB under Inference Endpoints, som Spaces ikke tilbyder. Betragt medianerne som vejledende: A100 80 GB-rækken hviler på to tilbud, og H100-rækken på fem, og den identiske forespørgsel 36 sekunder senere returnerede et andet 4090-antal og en anden toppris på tre af de fem rækker. RunPods listepriser er det mere stabile tal at planlægge ud fra.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Hvorfor 3B-modellerne ikke kan bruge det billige kort
En 4090-time og en H100 80 GB-time adskiller sig med cirka seks gange ved de ovenstående medianer. Det, der tvinger dig over på det dyre kort, er ikke hastighed, det er hukommelse. openpi sætter minimumskravet for en fuld Pi0.5 finjustering til 70 GB, og NVIDIA anbefaler 40 GB eller mere til GR00T. Bemærk, hvad GR00T-tallet ikke er. Dets finjusteringskonfiguration fryser sprogmodellen og den visuelle encoder som standard (tune_llm og tune_visual er False, projektoren og diffusion head True), hvilket er grunden til, at kataloget angiver cirka 40 M trænede parametre ud af 3 B. De 40 GB er ikke optimizer-tilstand for 3 B vægte, det er den frosne backbone plus aktiveringer. Varianter med reduceret omfang falder lavere: openpis LoRA-sti kræver 22,5 GB og nævner 4090, og NVIDIAs Isaac Lab Arena-workflow angiver en 24 GB single-GPU-mulighed for GR00T eftertræning. Platformen inddeler sig efter det minimumskrav, hver leverandør offentliggør for den konfiguration, den faktisk kører. pi0 flow-matching-artiklen forklarer, hvor det flow-matching fodaftryk kommer fra.
| Opgave | Hukommelse det oprindelige projekt kræver | Kilde |
|---|---|---|
| pi0 / pi0.5 inferens | more than 8 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 LoRA finjustering | more than 22.5 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 fuld finjustering | more than 70 GB, example A100 80 GB or H100 | openpi |
| GR00T N1.7 inferens | 1 GPU with 16 GB or more | Isaac-GR00T |
| GR00T N1.7 finjustering | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| GR00T finjustering, hvad den træner | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| GR00T eftertræning, reduceret | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| SmolVLA finjustering | single A100 for the reference 20,000-step run | lerobot docs |
| ACT træning | a single 11 GB RTX 2080 Ti | ACT paper |
Denne tabel er grunden til, at platformen opdeler de fem modeller i to niveauer. GR00T N1.7, GR00T N1.5 og Pi0.5 kører på A100 80 GB eller H100, fordi det er, hvad leverandørerne kræver. SmolVLA og ACT kører på et RTX 4090 eller et hvilket som helst 24 GB kort, fordi det er tilstrækkeligt.
En GR00T- eller Pi0.5-kørsel på et 24 GB kort fejler ikke med det samme. Den downloader base checkpointet, bygger datasætindekset, starter den første forward pass og dør efter et par hundrede trin med en CUDA out-of-memory fejl. Du betalte for download og opsætning og fik intet. Løsninger: hukommelsesmangel under træning.
Hvor længe hver af de fem modeller faktisk kører
Køretid er den anden halvdel af omkostningen: 2.00 USD per time er irrelevant, hvis jobbet er 40 minutter, og ødelæggende, hvis det er 40 timer. Dette er standardindstillingerne, som AY-Robots faktisk sender til træneren, med kørselsvinduet og omkostningerne for hvert niveau.
| Politik | GPU-niveau | Standard maks. trin | Standard batch (grad accum) | Kørselsvindue | Omkostning pr. kørsel |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, gælder | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, gælder | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, ingen effekt | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, ingen effekt | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Hvor disse kørselsvinduer kommer fra opstrøms
- SmolVLA: lerobot-dokumentationen angiver, at 20.000 trin tager cirka 4 timer på en enkelt A100. Platformen kører de samme 20.000 trin på den billigere 24 GB-tier, deraf et vindue snarere end flade 4 timer.
- ACT: den originale ALOHA-artikel rapporterer omkring 5 timer på et enkelt 11 GB RTX 2080 Ti for en model med 80M parametre. Et 4090 er flere generationer nyere, men platformen budgetterer 100.000 trin, så vinduet lander samme sted.
- GR00T: NVIDIAs reference-workflow for N1.6-generationen angiver cirka 4 til 8 timer for 20.000 trin ved batch 24 på otte L40S-kort, og 2 til 3 timer for 30.000 trin ved batch 16 på et enkelt Ada 6000. Enkeltkort-finjustering af en 3B VLA på få timer er normalt, ikke optimistisk.
- Pi0.5: openpi offentliggør ingen wall-clock-tal, men den offentliggør dog 70 GB-gulvet for en fuld finjustering, hvilket fastlægger kortet og dermed hastigheden.
Det er værd at stoppe op ved det tal, du ikke betaler. GR00T N1-artiklen rapporterer cirka 50.000 H100 GPU-timer til fortræning af 2.2B-modellen på en klynge af op til 1024 GPU'er, med en fortræningsbatchstørrelse på 16.384 for 200.000 gradienttrin. Med de 1.34 til 2.34 USD per time målt ovenfor er det i størrelsesordenen 67.000 til 117.000 USD i lejet computerkraft. SmolVLA-artiklen anslår sit projekt til cirka 30.000 GPU-timer fordelt på 481 fællesskabsdatasæt, 22.9K episoder og 10.6M frames. Du arver det hele til prisen for en download; dine 8 USD køber de sidste 20.000 trin. Hvorfor VLA'er er bygget på denne måde dækker den opdeling.
Armen: en engangsomkostning, der overskygger GPU-regningen
En træningskørsel koster mindre end frokost. Robotten gør ikke. Derfor er SO-100 vigtig: det er den billigste arm, som hele imitation learning værktøjskæden faktisk understøtter.
| Arm | Servomotorer | Spænding | Delepris | Support på AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | fuld, referencearm |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | fuld |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | kompatibel |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | kompatibel |
Den overordnede stykliste i SO-ARM100-lageret er mere detaljeret og værd at tjekke op mod din region: dens Parts For Two Arms liste udgør i alt 229,88 USD eller 226,30 EUR for en leder- plus følgeropsætning, og dens Parts for One Follower Arm liste udgør i alt 121,94 USD eller 124,30 EUR. Seks STS3215 servomotorer til 13,89 USD stykket udgør 83,34 af de 121,94, så servomotorerne er armen. Med 1 til 3 USD pr. SmolVLA- eller ACT-kørsel er et par arme mellem 77 og 230 træningskørsler værd. Hvis du stadig vælger, er SO-100 mod SO-101 den sammenligning, der betyder noget, fordi de to er tæt nok på hinanden til, at beslutningen handler om tilgængelighed snarere end kapacitet.
STS3215 leveres i en 7,4 V og en 12 V variant; lageret bemærker, at 12 V-delen også kræver en 12 V 5 A strømforsyning i stedet for 5 V-en, så de to er ikke udskiftelige. At føre 12 V ind i 7,4 V servomotorer ødelægger dem, og seks servomotorer udgør to tredjedele af en følgerarms delepris. Tjek etiketten på hver servomotor før første opstart. Hvis servomotorer allerede opfører sig mærkeligt: servomotor reagerer ikke, arm trækker sig sammen og falder derefter.
Mennesketimer: den linje ingen sætter i regnearket
Dette er tallet, der vender omkostningsdiskussionen på hovedet. Optagelse af demonstrationer er en person, der bevæger en robotarm, én episode ad gangen, i realtid. Der er ingen batching af det, og ingen udlejning på sekundbasis. LeRobot datasæt optageren leveres med standardindstillinger, der gør regnestykket nemt, alle tre bekræftet i DatasetRecordConfig: 60 sekunder pr. episode, 60 sekunder til at nulstille scenen, 50 episoder. Pengekolonnen nedenfor antager 15 USD for en times arbejde, hvilket er en antagelse snarere end et platformstal. Erstat med din egen sats; forholdet er pointen.
- 1Optag datasættet med de standardindstillinger, du faktisk vil blive faktureret for
Dette er lerobot 0.6.1, versionen på PyPI pr. 3. august 2026. Bemærk CLI-formen: optagelse kører via
lerobot-recordkonsolindgangspunktet (lerobot.scripts.lerobot_record), ikke den gamlepython -m lerobot.scripts.recordmodulsti. AY-Robots sigter mod 0.5.1, og 0.5.1-hjulet erklærer de sammelerobot-recordoglerobot-trainindgangspunkter, så formen nedenfor er stabil på tværs af begge. De tre timing-flags er standardindstillingerne, så dette er også kommandoen, som regnestykket i den næste tabel antager.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Se på, hvad du har optaget, før du lejer et eneste GPU-minut
Inspektion af et datasæt koster nul USD i timen. At opdage det samme problem fra en tabskurve koster 2.00 USD i timen på H100-niveauet og fortæller dig det fire timer for sent. Push datasættet og gennemgå det i LeRobot-viseren, eller gennemse AY-Robots datasætmappe.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Træn, og sørg for, at checkpointet overlever pod'en
En lejet maskine er pr. definition midlertidig, så skriv checkpoints et holdbart sted under kørslen. To flags afgør, om du beholder det, du har betalt for.
--save_freqer som standard 20.000 trin, så en standard 20.000-trins SmolVLA-kørsel skriver sit første checkpoint, når kørslen allerede er slut; sænk det, før du lejer noget, der kan afbrydes.--save_checkpoint_to_hubkræver--policy.repo_idog findes ikke i lerobot 0.5.1, så på den version kopierer du selv outputmappen fra maskinen. Batchstørrelsen nedenfor er eksemplet fra den oprindelige dokumentation; AY-Robots-formularen sender 2 for SmolVLA og skriver til objektlager, efterhånden som checkpoints vises.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episoder | Optagelse ved 60 s | Nulstilling ved 60 s | Realtid | Plus 20 procent genoptagelser | Ved 15 USD pr. mennesketime |
|---|---|---|---|---|---|
| 30, SmolVLA-minimum | 30 min | 30 min | 1 t 00 min | 1 t 12 min | ca. 18 USD |
| 50, de fire andre minimummer | 50 min | 50 min | 1 t 40 min | 2 t 00 min | ca. 30 USD |
| 100, et komfortabelt datasæt | 100 min | 100 min | 3 t 20 min | 4 t 00 min | ca. 60 USD |
Sammenlign den højre kolonne med de 1 til 12 USD, som kørslen koster. Med den antagne sats koster et datasæt med 50 episoder to til syv gange så meget at optage, som det koster at træne på, før kalibrering, kameraopsætning og de episoder, du kasserer. Derfor har en direkte økonomisk værdi. LeRobot-guiden foreslår mindst 50 episoder med 10 pr. objektplacering; SmolVLA-dokumentationen rapporterer, at en 25-episode version af den samme opgave ikke var nok.
Hvor pengene reelt forsvinder
1. Kørsel på data, der aldrig ville have virket
En 20.000-trins GR00T-kørsel på et datasæt med to ombyttede kamerastrømme koster det samme som en på et rent datasæt, tager lige lang tid og producerer en tabskurve, der ser fin ud. Fejlen viser sig på armen, timer senere. faktureres pr. time, og diagnose faktureres i dage. To symptomer, der er værd at huske: betyder normalt, at observationerne ikke indeholder det, opgaven kræver, og betyder, at datasættet havde mindre variation, end du troede.
2. Betaling af grundmodelpriser for en opgave med fast kamera
ACT er cirka 80M parametre og blev designet til at træne fra bunden på 50 demonstrationer af én opgave. GR00T N1.7 er cirka 3B med en fortrænet backbone. For et fastmonteret kamera, et fast bord og ét objekt, når 80M-modellen ofte målet, kører med omkring 20 ms per handlingstrin i stedet for 152 ms, og koster 1 til 3 USD per kørsel i stedet for 4 til 12. Brug 3 USD på at finde ud af, om den billige model virker, før du bruger 12 USD på den dyre. ACT mod SmolVLA og GR00T N1.7 mod Pi0.5 viser, hvor hver især holder op med at være det rigtige svar; modelarenaen har 85 modeller og 332 benchmarkresultater.
3. Den GPU, du glemte
Den billigste fejl at forhindre og den mest almindelige at begå. En instans, der startes en fredag for at fejlfinde noget, faktureres gennem weekenden til samme pris som en reel kørsel.
| Kort | Medianpris i øjebliksbillede | Inaktiv i 24 t | Inaktiv i 7 dage | Det svarer til |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | ca. 27 SmolVLA- eller ACT-kørsler til 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | ca. 12 GR00T-kørsler til 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | ca. 38 GR00T-kørsler til 8 USD |
På AY-Robots er denne fejl elimineret for inferens: pods, der er klargjort af inferens-API'en, har en inaktiv watchdog og ødelægger sig selv efter en inaktiv periode. Hvis du selv lejer kortet, er den watchdog din kalenderpåmindelse.
4. Betaling to gange for det samme svar
GR00T's finjusteringsindgangspunkt er en tyro CLI, der ikke eksponerer noget seed. Dette er ikke en platformsbegrænsning, det er det opstrøms værktøj: der er intet seed-felt i gr00t/configs/finetune_config.py, og repositoryets egne træningstips advarer om, at kørsler varierer med 5 til 6 procent, fordi billedforbedringerne er ikke-deterministiske. lerobot bruger som standard seed 1000 i både 0.5.1 og 0.6.1, så ACT-, SmolVLA- og Pi0.5-kørsler kan i det mindste genkøres fra den samme initialisering og datarækkefølge. Dette er ikke et løfte om bit-identiske vægte på en GPU, men det er forskellen mellem en genkørsel og et nyt eksperiment. Hvis en GR00T-kørsel producerer en politik, der virker, og du ikke gemte kontrolpunkt, betaler du fuld pris for et resultat, der kan afvige mere end den forskel, du jagtede. Der er en anden måde at miste et kontrolpunkt, du har betalt for: CLI'en bruger som standard --save-total-limit 5, dokumenteret som det maksimale antal kontrolpunkter, der beholdes, før ældre slettes. Lagring koster øre; en genkørsel koster 4 til 12 USD og seks timer.
De ovenstående budgulve er en brøkdel af on-demand-prisen, og vast.ai siger, at budsystemet kan reducere klientomkostningerne med halvtreds procent eller mere. Haken, med deres egne ord: en afbrydelig instans kan sættes på pause når som helst, hvis en anden bruger byder højere, eller en on-demand-leje oprettes for de samme ressourcer, og den pause "stopper alle kørende processer". On-demand har altid forrang. Fint for en kørsel, der skriver et kontrolpunkt hvert par hundrede trin, et totalt tab for en, der skriver til sidst, hvilket er præcis, hvad standardindstillingerne giver dig: Isaac-GR00T CLI skriver hvert --save-steps (standard 1000), men lerobots --save_freq er som standard 20.000 trin, så en standard SmolVLA-kørsel gemmer et kontrolpunkt én gang, ved målstregen. Sænk det, eller byd ikke. AY-Robots træningsformularen eksponerer GR00T-knappen som saveSteps.
- Den laveste timepris, der findes.
- Fuld kontrol over image, CUDA-version, lerobot- eller Isaac-GR00T-revision og hvert flag.
- Afbrydelig budgivning halverer prisen, hvis din kørsel gemmer kontrolpunkter ofte nok til at overleve en pause.
- Intet er abstraheret væk, så når en kørsel opfører sig mærkeligt, kan du se hvorfor.
- Opsætning faktureres til GPU-priser: drivere, afhængigheder, det multi-gigabyte basiskontrolpunkt og datasætdownload koster alt sammen det samme pr. time som træning.
- En overbudt afbrydelig instans sættes på pause, og dens processer afsluttes. En ikke-gemt kørsel er spildte penge, og lerobot-standarden skriver sit første kontrolpunkt ved trin 20.000.
- Intet ødelægger pod'en for dig. Den inaktive tabel ovenfor er regningen for at glemme.
- Udbuddet af enkelte fulde 80 GB kort er tyndt: to A100 80 GB og fem H100 80 GB fuldkortstilbud i denne læsning. Listen ændrer sig også, så den billigste anførte pris og den pris, du faktisk kan leje, er ikke det samme tal.
- Hver time på infrastruktur er en time, der ikke bruges på at optage de episoder, der afgør, om politikken virker.
Gør det selv versus at lade platformen leje kortet
Du vælger maskinen, bygger miljøet og ødelægger pod'en. Timeprisen er markedsprisen ovenfor; alt andet er din tid.
- Find et kort, der matcher den VRAM, modellen kræver: 24 GB til ACT og SmolVLA, 80 GB til GR00T og Pi0.5.
- Lej on-demand, hvis kørslen ikke kan overleve en pause, afbrydelig hvis den ofte gemmer kontrolpunkter.
- Installer værktøjskæden: lerobot til ACT, SmolVLA og Pi0.5, Isaac-GR00T-repository'et med sin egen tyro-launcher til GR00T.
- Konverter datasættet om nødvendigt. Et LeRobot v3.0-datasæt får GR00T-loaderen til at crashe og skal konverteres ned til v2.1.
- Start, overvåg tabet, skub kontrolpunkter et holdbart sted hen, efterhånden som de skrives.
- Ødelæg instansen, og kontroller derefter, at du har ødelagt den.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Realistisk omkostning for én GR00T-kørsel: 3 til 6 timer på en H100 80 GB til 1.34 til 2.34 USD pr. time er 4 til 14 USD, plus 20 til 40 minutters opsætning, der også faktureres, plus din egen tid.
Du vælger modellen, datasættet og hyperparametrene i en formular. Backend'en lejer en spot-GPU dimensioneret efter den VRAM, modellen kræver, kører træneren og skriver kontrolpunkter til objektlager.
- Vælg din kombination på træningsmatricen: fem modeller, fire arme, én guide pr. celle.
- Peg den mod et datasæt: et optaget med desktopklienten, et Hugging Face repo id, eller et fra din egen maskine.
- Accepter standardindstillingerne eller juster dem. Tabellen ovenfor er, hvad der faktisk sendes til træneren.
- Backend'en vælger kortet ud fra den krævede VRAM, så du behøver aldrig at shoppe efter GPU'er.
- Kontrolpunkter lander i objektlager, efterhånden som de skrives, så en afbrudt kørsel er ikke en tabt kørsel.
| Niveau | Modeller | Køretid | Omkostning pr. kørsel |
|---|---|---|---|
| A100 80 GB eller H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 til 6 timer | ca. 4 til 12 USD |
| RTX 4090 eller ethvert 24 GB kort | SmolVLA, ACT | 2 til 5 timer | ca. 1 til 3 USD |
Hvad den ikke gør: gøre et dårligt datasæt godt, give GR00T et seed, den aldrig har haft, eller fjerne den latensgrænse, der er beskrevet nedenfor. Den fjerner GPU-shopping, miljøopbygningen og den pod, du glemte at ødelægge. Mekanikken findes i træningsdokumentationen.
Hvad platformen opkræver, og hvordan den vælger kortet
Logikken er bevidst kedelig. Hver model i kataloget erklærer et GPU-niveau; backend tager den nødvendige VRAM og lejer et matchende kort på det samme spotmarked, som målt ovenfor. Derfor er den angivne pris et interval, ikke en fast pris. GR00T og Pi0.5 er kun tilgængelige i skyen her på grund af grænserne på 40 GB og 70 GB. SmolVLA og ACT kører også lokalt på dit eget 24 GB kort, hvor cloud-omkostningerne er nul, og elektriciteten er dit problem.

Én indstilling fortjener en advarsel. Gradientakkumulering gælder reelt for begge GR00T-varianter, så ved at øge den opnår man en større effektiv batch på det samme kort. For Pi0.5 og SmolVLA gælder det slet ikke: lerobot 0.5.1 har ingen gradientakkumuleringsmulighed i sin træningskonfiguration, så at sætte feltet til 16 koster intet og giver intet. Hvis et job i kø aldrig starter, siden om fastlåste job i køen dækker, hvad man skal tjekke; hvis datasættet afvises, før kørslen begynder, er det næsten altid v3.0 formatproblemet.
En lejet GPU, der leverer din politik over det offentlige internet, tilføjer rundture til en kontrolsløjfe, der allerede er 20 til 485 ms pr. handlingstrin. Fint til langsom pick-and-place, ikke til hurtig reaktiv bevægelse. Cloud-inferens evaluerer et checkpoint godt og udfører produktionsmanipulation dårligt: hvis opgaven kræver hastighed, skal computeren sidde ved siden af servoerne, og det er en omkostning, denne artikel ikke kan få til at forsvinde. Se inferenslatenstid.
Et udarbejdet budget for en første fungerende politik
Alle fire linjer samlet, startende fra ingenting. GPU-totalen antager 3 til 5 kørsler: den første beviser, at pipelinen virker, den anden afslører et dataproblem, den tredje eller fjerde er den, du beholder.
| Linje | Slank vej | Komfortabel vej |
|---|---|---|
| Arm | Kun SO-100 følger, 121.94 USD i BOM | leder plus følger, 229.88 USD i BOM |
| Model | SmolVLA eller ACT, 24 GB tier | GR00T N1.7, A100 80 GB eller H100 tier |
| Optagede episoder | 30, SmolVLA-minimum | 50 til 100 |
| Menneskelig tid til at optage | ca. 1 t 12 min | 2 til 4 timer |
| Omkostning pr. kørsel | 1 til 3 USD | 4 til 12 USD |
| Kørsler før det virker | 3 til 5 | 3 til 5 |
| Samlet GPU-forbrug | 3 til 15 USD | 12 til 60 USD |
| Største post på regningen | armen, derefter din tid | armen, derefter din tid |
Mønsteret holder ved denne robotstørrelse: beregning er en afrundingsfejl, hardware er en reel engangsomkostning, menneskelige timer er den tilbagevendende udgift. For at teste træningsdelen, før du køber noget, lader dig sammenligne modeller og leje en GPU uden en arm, og er en fysisk SO-100, du kan styre i browseren uden tilmelding. For hele pipelinen fra start til slut, dækker den opsætning, og træning, og er den korte version.

Hvad koster en VLA finjusteringskørsel fra start til slut?▾
Omkring 4 til 12 USD for GR00T N1.7, GR00T N1.5 eller Pi0.5 på A100 80 GB eller H100-niveau (3 til 6 timer til 1.20 til 2.00 USD per time), og omkring 1 til 3 USD for SmolVLA eller ACT på RTX 4090-niveau (2 til 5 timer til 0.30 til 0.60 USD per time). At leje kortet selv lander i samme prisleje, når opsætningstid er medregnet, da det faktureres til træningsraten.
Er en H100 værd at betale for frem for en A100 80 GB?▾
For en enkelt SO-100 politik, som regel ikke. Begge opfylder det hukommelseskrav, GR00T og Pi0.5 behøver, og i den 23. august 2026 læsning startede en fuld A100 80 GB til 0.44 USD per time mod 1.34 for en H100 80 GB. H100'eren bliver færdig hurtigere, så en del af prisen kommer tilbage som færre timer, men totalen er stadig højere for en så lille kørsel. Det virkelige argument for H100 er tilgængelighed: fem enkelt H100 80 GB tilbud på det marked mod to A100 80 GB, og et kort du ikke kan leje har ingen pris.
Hvor mange kørsler tager det, før en politik faktisk virker?▾
Planlæg tre til fem. Den første beviser, at pipelinen er korrekt forbundet. Den anden afslører ofte et datasætproblem, såsom en kamerastrøm, der døde undervejs. Den tredje eller fjerde er den, du beholder.
Kan jeg træne SmolVLA eller ACT på min egen GPU i stedet for at leje?▾
Ja. Begge understøttes lokalt på AY-Robots, og begge passer komfortabelt i 24 GB; det originale ACT-papir trænede sin 80M-model på omkring 5 timer på et 11 GB RTX 2080 Ti. GR00T og Pi0.5 er kun cloud-baserede her, fordi leverandørernes dokumenterede finjusteringskrav er 40 GB og 70 GB, og det største forbrugerkort på markedet er 32 GB RTX 5090.
Hvorfor koster det samme antal trin forskellige beløb på tværs af modeller?▾
Trin er ikke sammenlignelige på tværs af politikker. ACT standardindstiller til 100.000 trin ved batch 8 på et 24 GB kort; GR00T N1.5 standardindstiller til 2.000 trin ved batch 1 med gradientakkumulering 16 på et 80 GB kort. Regningen er timer multipliceret med prisen for det kort, hukommelsesforbruget tvinger dig til at bruge, ikke trin-tælleren.
Se hvad din kørsel ville koste, før du starter den
Hver af de fem politikker angiver sit GPU-niveau, køretid og pris per kørsel, og trænings-backend lejer kortet på det samme spotmarked, hvor disse tal blev målt.
Tjek priserneSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started