
Werkelijke spotmarkt GPU-prijzen, hoe lang elk van de vijf beleidsregels draait, wat de robotarm en de demonstraties kosten, en de vier plaatsen waar het geld stilletjes verdwijnt.
De korte versie
- •Een run op de A100 80 GB of H100-tier duurt 3 tot 6 uur en kost ongeveer 4 tot 12 USD. Op de RTX 4090-tier is dit 2 tot 5 uur en ongeveer 1 tot 3 USD.
- •Gemeten op vast.ai om 13:44 UTC op 23 augustus 2026: een volledige RTX 4090 on demand voor 0.13 tot 0.38 USD/u, een A100 80 GB voor 0.44 tot 0.67, een H100 80 GB voor 1.34 tot 2.34. Volledige 80 GB kaarten zijn schaars, respectievelijk twee en vijf aanbiedingen voor één kaart.
- •De GPU is de goedkoopste post. De materiaallijst van de SO-ARM100 schat een leider-plus-volger-paar op 229.88 USD, wat neerkomt op 77 tot 230 runs op de 24 GB-tier.
- •Twee uur van een persoon die 50 afleveringen opneemt, kost meer dan de trainingsrun waar die afleveringen voor dienen.
- •Geld verdwijnt op vier plaatsen: runs met kapotte data, 3B-modellen voor taken die een 80M-beleid aankan, GPU's die niemand heeft vernietigd, en herhalingen van een resultaat dat je niet hebt bewaard.
- •AY-Robots bepaalt de grootte van de kaart op basis van het VRAM dat het model nodig heeft en huurt deze op dezelfde spotmarkt, dus de runkosten zijn de marktkosten.
De rekening heeft vier posten, en de GPU is de kleinste
Wanneer mensen vragen wat het kost om een visie-taal-actie-model voor een SO-100 te fine-tunenen, bedoelen ze bijna altijd de GPU-huur. Dat is het bedrag dat als kostenpost op een kaart verschijnt, dus dat voelt reëel. Het is ook, met een ruime marge, het kleinste van de vier getallen die bepalen wat een werkend beleid je daadwerkelijk kost.
| Post | Wat het is | Typische omvang voor één werkend beleid |
|---|---|---|
| GPU-tijd | een kaart huren voor de run | 1 tot 12 USD per run, en je zult er 3 tot 5 doen |
| De robot | servo's, geprint frame, camera's, kabels, stroom | eenmalig, 110 tot 500 EUR per arm |
| Menselijke uren | een persoon die de arm bestuurt om demo's op te nemen | 1 tot 4 uur per dataset, herhaald per taak |
| Verspilling | slechte data, te grote modellen, vergeten pods | onbegrensd, en de enige post die je controleert |
De trainingstijden hieronder komen uit de eigen papers en repositories van de vijf modellen, de hardwarekosten uit de gepubliceerde stuklijst, en de platformnummers van de AY-Robots beleidscatalogus en prijslijstpagina. Waar het platform niet helpt, vermeldt dit artikel dat.
Wat een GPU-uur daadwerkelijk kost op de spotmarkt
Er is geen vaste prijs voor een A100-uur. Op een marktplaats zoals vast.ai stelt elke host zijn eigen tarief in, en de trainingsrun die u start, komt terecht op de machine die op dat moment goedkoop en vrij is. Het eerlijke antwoord is een verdeling. Hier is het, gemeten op 23 augustus 2026 om 13:44 UTC: enkele volledige kaarten, on demand, gefilterd op werkelijk VRAM.
| Kaart | vast.ai on demand USD/u (laag / mediaan / hoog) | Volledige-kaart aanbiedingen | vast.ai bodemtarief | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | niet aangeboden |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | niet aangeboden |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 als een Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 als een endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | niet aangeboden |
On-demand aanbiedingen voor één volledige GPU (gpu_frac == 1.0) van de vast.ai openbare bundel API, waarvoor geen account nodig is, gefilterd op gpu_ram zodat alleen echte 80 GB kaarten in de 80 GB rijen terechtkomen. Dat filter is belangrijk: in deze meting waren alle drie de single-card A100 SXM4 aanbiedingen 40 GB onderdelen, evenals twee van de vier A100 PCIE aanbiedingen, dus het samenvoegen ervan in één "A100" rij zou de hier gerapporteerde prijs hebben gehalveerd. De Hugging Face kolom combineert twee producten: 2.50 USD/h is de Nvidia A100 - large Spaces hardware en 4.50 USD/h is een enkele H100 80 GB onder Inference Endpoints, wat Spaces niet aanbiedt. Beschouw de medianen als indicatief: de A100 80 GB rij is gebaseerd op twee aanbiedingen en de H100 rij op vijf, en dezelfde query 36 seconden later gaf een ander 4090 aantal en een andere topprijs op drie van de vijf rijen. RunPod catalogusprijzen zijn het stabielere getal om mee te plannen.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Waarom de 3B modellen de goedkope kaart niet kunnen gebruiken
Een 4090-uur en een H100 80 GB-uur verschillen ruwweg zes keer bij de bovengenoemde medianen. Wat je dwingt tot de dure kaart is niet snelheid, het is geheugen. openpi stelt de ondergrens voor een volledige Pi0.5 fine-tune op 70 GB, en NVIDIA beveelt 40 GB of meer aan voor GR00T. Merk op wat het GR00T-getal niet is. De fine-tune configuratie bevriest standaard het taalmodel en de visuele encoder (tune_llm en tune_visual zijn False, de projector en de diffusiekop True), daarom vermeldt de catalogus ruwweg 40 M getrainde parameters van de 3 B. De 40 GB is geen optimizer-status voor 3 B gewichten, het is de bevroren backbone plus activaties. Varianten met een kleinere scope vragen minder: openpi's LoRA-pad wil 22.5 GB en noemt de 4090, en NVIDIA's Isaac Lab Arena workflow vermeldt een 24 GB single-GPU optie voor GR00T post-training. Het platform baseert de lagen op de ondergrens die elke leverancier publiceert voor de configuratie die het daadwerkelijk draait. De pi0 flow-matching uiteenzetting legt uit waar die flow-matching voetafdruk vandaan komt.
| Taak | Geheugen dat het upstream project vraagt | Bron |
|---|---|---|
| pi0 / pi0.5 inferentie | meer dan 8 GB, voorbeeld RTX 4090 | openpi |
| pi0 / pi0.5 LoRA fine-tune | meer dan 22.5 GB, voorbeeld RTX 4090 | openpi |
| pi0 / pi0.5 volledige fine-tune | meer dan 70 GB, voorbeeld A100 80 GB of H100 | openpi |
| GR00T N1.7 inferentie | 1 GPU met 16 GB of meer | Isaac-GR00T |
| GR00T N1.7 fine-tune | 40 GB of meer aanbevolen, H100 of L40 nodes | Isaac-GR00T |
| GR00T fine-tune, wat het traint | projector en diffusiekop; LLM en visuele encoder standaard bevroren | finetune_config.py |
| GR00T post-training, gereduceerd | 1 GPU met 24 GB, taalmodel bevroren | Isaac Lab Arena |
| SmolVLA fine-tune | enkele A100 voor de referentie 20.000-stappen run | lerobot docs |
| ACT training | een enkele 11 GB RTX 2080 Ti | ACT paper |
Die tabel is de reden waarom het platform de vijf modellen in twee lagen verdeelt. GR00T N1.7, GR00T N1.5 en Pi0.5 draaien op A100 80 GB of H100 omdat dat is wat de leveranciers vragen. SmolVLA en ACT draaien op een RTX 4090 of elke 24 GB kaart omdat dat echt voldoende is.
Een GR00T- of Pi0.5-run op een 24 GB kaart faalt niet direct. Het downloadt het basischeckpoint, bouwt de datasetindex, start de eerste forward pass en sterft na een paar honderd stappen met een CUDA out-of-memory fout. Je hebt betaald voor de download en de setup en kreeg niets. Oplossingen: onvoldoende geheugen tijdens training.
Hoe lang elk van de vijf modellen daadwerkelijk draait
De looptijd is de andere helft van de kosten: 2.00 USD per uur is irrelevant als de taak 40 minuten duurt en ruïneus als deze 40 uur duurt. Dit zijn de standaardinstellingen die AY-Robots daadwerkelijk naar de trainer stuurt, met het uitvoervenster en de kosten voor elke laag.
| Beleid | GPU-laag | Standaard max. stappen | Standaard batch (grad accum) | Uitvoervenster | Kosten per uitvoering |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, van toepassing | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, van toepassing | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, geen effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, geen effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Waar die uitvoervensters vandaan komen stroomopwaarts
- SmolVLA: de lerobot-documentatie stelt dat 20.000 stappen ongeveer 4 uur duren op een enkele A100. Het platform draait dezelfde 20.000 stappen op de goedkopere 24 GB-laag, vandaar een venster in plaats van een vaste 4 uur.
- ACT: het originele ALOHA-paper rapporteert ongeveer 5 uur op een enkele 11 GB RTX 2080 Ti voor een model met 80M parameters. Een 4090 is enkele generaties nieuwer, maar het platform budgetteert 100.000 stappen, dus het venster komt op dezelfde plek uit.
- GR00T: NVIDIA's referentieworkflow voor de N1.6-generatie vermeldt ongeveer 4 tot 8 uur voor 20.000 stappen bij batch 24 op acht L40S-kaarten, en 2 tot 3 uur voor 30.000 stappen bij batch 16 op een enkele Ada 6000. Fine-tuning van een 3B VLA op één kaart in een paar uur is normaal, niet optimistisch.
- Pi0.5: openpi publiceert geen 'wall-clock' cijfer, maar het publiceert wel de 70 GB ondergrens voor een volledige fine-tune, wat de kaart en daarmee de snelheid vastlegt.
Het is de moeite waard stil te staan bij het bedrag dat u niet betaalt. Het GR00T N1-paper rapporteert ongeveer 50.000 H100 GPU-uren om het 2.2B-model voor te trainen, op een cluster van maximaal 1024 GPU's, met een pretraining batchgrootte van 16.384 voor 200.000 gradiëntstappen. Tegen de hierboven gemeten 1,34 tot 2,34 USD per uur komt dat neer op ongeveer 67.000 tot 117.000 USD aan gehuurde rekenkracht. Het SmolVLA-paper schat het project op ongeveer 30.000 GPU-uren verdeeld over 481 community-datasets, 22.9K afleveringen en 10.6M frames. U erft dit alles voor de prijs van een download; uw 8 USD koopt de laatste 20.000 stappen. Waarom VLA's op deze manier zijn gebouwd behandelt die opsplitsing.
De arm: een eenmalige kostenpost die de GPU-rekening overschaduwt
Een trainingsrun kost minder dan lunch. De robot niet. Daarom is de SO-100 belangrijk: het is de goedkoopste arm die de hele imitatieleer toolchain daadwerkelijk ondersteunt.
| Arm | Servo's | Voltage | Onderdeelkosten | Ondersteuning op AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | volledige, referentiearm |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | volledig |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatibel |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatibel |
De upstream stuklijst in de SO-ARM100 repository is gedetailleerder en de moeite waard om te controleren voor uw regio: de Onderdelen Voor Twee Armen lijst bedraagt in totaal 229.88 USD of 226.30 EUR voor een leider-plus-volger opstelling, en de Onderdelen voor Eén Volgerarm lijst bedraagt in totaal 121.94 USD of 124.30 EUR. Zes STS3215 servo's van elk 13.89 USD zijn 83.34 van die 121.94, dus de servo's zijn de arm. Met 1 tot 3 USD per SmolVLA of ACT run is één paar armen tussen de 77 en 230 trainingsruns waard. Als u nog steeds kiest, SO-100 versus SO-101 is de vergelijking die ertoe doet, omdat de twee dicht genoeg bij elkaar liggen dat de beslissing gaat over beschikbaarheid in plaats van capaciteit.
De STS3215 wordt geleverd in een 7.4 V en een 12 V variant; de repository vermeldt dat het 12 V onderdeel ook een 12 V 5 A voeding nodig heeft in plaats van de 5 V, dus de twee zijn niet uitwisselbaar. Het voeden van 12 V aan 7.4 V servo's vernietigt ze, en zes servo's zijn twee derde van de onderdeelkosten van een volgerarm. Controleer het label op elke servo vóór de eerste inschakeling. Als servo's zich al vreemd gedragen: servo reageert niet, arm trilt dan zakt.
Menselijke uren: de regel die niemand in de spreadsheet zet
Dit is het getal dat de kostenbespreking op zijn kop zet. Het opnemen van demonstraties is een persoon die een robotarm beweegt, één episode tegelijk, in realtime. Er is geen batchverwerking en geen verhuur per seconde. De LeRobot dataset recorder wordt geleverd met standaardinstellingen die de berekening eenvoudig maken, alle drie bevestigd in DatasetRecordConfig: 60 seconden per episode, 60 seconden om de scène te resetten, 50 episodes. De geldkolom hieronder gaat uit van 15 USD voor een uur van iemands tijd, wat een aanname is in plaats van een platformgetal. Vervang dit door uw eigen tarief; de verhouding is het punt.
- 1Neem de dataset op met de standaardinstellingen waarvoor u daadwerkelijk wordt gefactureerd
Dit is lerobot 0.6.1, de versie op PyPI per 3 augustus 2026. Let op de CLI-vorm: opnemen gebeurt via het
lerobot-recordconsole-ingangspunt (lerobot.scripts.lerobot_record), niet via het oudepython -m lerobot.scripts.recordmodulepad. AY-Robots richt zich op 0.5.1, en de 0.5.1 wheel declareert dezelfdelerobot-recordenlerobot-trainingangspunten, dus de onderstaande vorm is stabiel voor beide. De drie timing-flags zijn de upstream-standaardwaarden, dus dit is ook de opdracht die de berekening in de volgende tabel aanneemt.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Bekijk wat u heeft opgenomen voordat u één GPU-minuut huurt
Het inspecteren van een dataset kost nul USD per uur. Het ontdekken van hetzelfde probleem aan de hand van een loss curve kost 2.00 USD per uur op de H100-tier en vertelt u vier uur te laat. Push de dataset en bekijk deze in de LeRobot viewer, of blader door de AY-Robots dataset directory.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Train, en zorg ervoor dat het checkpoint de pod overleeft
Een gehuurde machine is per definitie tijdelijk, dus schrijf checkpoints ergens duurzaam weg tijdens de uitvoering. Twee flags bepalen of u behoudt waarvoor u heeft betaald.
--save_freqis standaard 20.000 stappen, dus een standaard 20.000-stappen SmolVLA-run schrijft zijn eerste checkpoint wanneer de run al voorbij is; verlaag dit voordat u iets onderbreekbaars huurt.--save_checkpoint_to_hubvereist--policy.repo_iden bestaat niet in lerobot 0.5.1, dus op die versie kopieert u de uitvoermap zelf van de machine. De batchgrootte hieronder is het voorbeeld uit de upstream-documentatie; het AY-Robots formulier stuurt 2 voor SmolVLA en schrijft naar objectopslag zodra checkpoints verschijnen.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episodes | Opnemen met 60 s | Resetten met 60 s | Totale tijd | Plus 20 procent heropnames | Tegen 15 USD per menselijk uur |
|---|---|---|---|---|---|
| 30, het SmolVLA minimum | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, de andere vier minimums | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, een comfortabele dataset | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Vergelijk de rechterkolom met de 1 tot 12 USD die de run kost. Tegen dat veronderstelde tarief kost een dataset van 50 afleveringen twee tot zeven keer zoveel om op te nemen als om op te trainen, vóór kalibratie, camera-instelling en de afleveringen die je weggooit. Daarom heeft een directe geldwaarde. De lerobot-gids suggereert minstens 50 afleveringen met 10 per objectlocatie; de SmolVLA-documentatie meldt dat een 25-afleveringenversie van dezelfde taak niet voldoende was.
Waar het geld daadwerkelijk verdwijnt
1. Runs op gegevens die nooit zouden werken
Een GR00T-run van 20.000 stappen op een dataset met twee verwisselde camerastreams kost hetzelfde als een run op een schone dataset, duurt even lang en produceert een verliescurve die er goed uitziet. De storing verschijnt uren later op de arm. worden per uur gefactureerd en diagnose wordt in dagen gefactureerd. Twee symptomen die het waard zijn om te onthouden: betekent meestal dat de waarnemingen niet bevatten wat de taak nodig heeft, en betekent dat de dataset minder variatie had dan je dacht.
2. Foundation-model prijzen betalen voor een taak met vaste camera
ACT heeft ongeveer 80M parameters en is ontworpen om vanaf nul te trainen op 50 demonstraties van één taak. GR00T N1.7 heeft ongeveer 3B parameters met een voorgegetrainde backbone. Voor een vastgeschroefde camera, een vaste tafel en één object, bereikt het 80M model vaak het doel, draait het met ongeveer 20 ms per actiestap in plaats van 152 ms, en kost het 1 tot 3 USD per run in plaats van 4 tot 12. Besteed 3 USD om erachter te komen of het goedkope model werkt voordat u 12 USD uitgeeft aan het dure model. ACT versus SmolVLA en GR00T N1.7 versus Pi0.5 laten zien waar elk ophoudt het juiste antwoord te zijn; de modelarena heeft 85 modellen en 332 benchmarkresultaten.
3. De GPU die u vergeten bent
De goedkoopste fout om te voorkomen en de meest voorkomende om te maken. Een instantie die op een vrijdag is gestart om iets te debuggen, wordt het hele weekend gefactureerd tegen hetzelfde tarief als een echte run.
| Kaart | Mediane prijs in de momentopname | Inactief gedurende 24 uur | Inactief gedurende 7 dagen | Dat is waard |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | ongeveer 27 SmolVLA of ACT runs à 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | ongeveer 12 GR00T runs à 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | ongeveer 38 GR00T runs à 8 USD |
Op AY-Robots is deze fout voor inferentie uitgesloten: pods die door de inferentie-API worden geleverd, hebben een inactieve watchdog en vernietigen zichzelf na een inactieve periode. Als u de kaart zelf huurt, is die watchdog uw agendaherinnering.
4. Twee keer betalen voor hetzelfde antwoord
Het fine-tuning toegangspunt van GR00T is een tyro CLI die geen seed blootstelt. Dat is geen platformbeperking, het is de upstream tool: er is geen seed-veld in gr00t/configs/finetune_config.py, en de eigen trainingstips van de repository waarschuwen dat runs 5 tot 6 procent variëren omdat de beeldaugmentaties niet-deterministisch zijn. lerobot gebruikt standaard seed 1000 in zowel 0.5.1 als 0.6.1, zodat ACT, SmolVLA en Pi0.5 runs op zijn minst opnieuw kunnen worden uitgevoerd met dezelfde initialisatie en datavolgorde. Dat is geen belofte van bit-identieke gewichten op een GPU, maar het is het verschil tussen een heruitvoering en een nieuw experiment. Als een GR00T run een beleid produceert dat werkt en u hebt de checkpoint, betaalt u de volle prijs voor een resultaat dat meer kan verschillen dan het verschil dat u zocht. Er is een tweede manier om een betaald checkpoint te verliezen: de CLI gebruikt standaard --save-total-limit 5, gedocumenteerd als het maximale aantal checkpoints dat wordt bewaard voordat oudere worden verwijderd. Opslag kost centen; een heruitvoering kost 4 tot 12 USD en zes uur.
De hierboven genoemde biedprijzen zijn een fractie van het on-demand tarief, en vast.ai stelt dat het biedsysteem de kosten voor klanten met vijftig procent of meer kan verlagen. De keerzijde, in hun eigen woorden: een onderbreekbare instantie kan op elk moment worden gepauzeerd als een andere gebruiker hoger biedt of als er een on-demand huur wordt aangemaakt voor dezelfde resources, en die pauze "stopt alle draaiende processen". On-demand heeft altijd voorrang. Prima voor een run die elke paar honderd stappen een checkpoint wegschrijft, een totaal verlies voor een run die pas aan het einde wegschrijft, wat precies is wat de standaardinstellingen je geven: de Isaac-GR00T CLI schrijft elke --save-steps (standaard 1000), maar lerobot's --save_freq is standaard 20.000 stappen, dus een standaard SmolVLA run checkpoint één keer, aan de finish. Verlaag het, of bied niet. Het AY-Robots trainingsformulier toont de GR00T-instelling als saveSteps.
- Het laagste uurtarief dat er is.
- Volledige controle over de image, CUDA-versie, lerobot of Isaac-GR00T revisie en elke flag.
- Onderbreekbaar bieden halveert het tarief als je run vaak genoeg checkpoints opslaat om een pauze te overleven.
- Niets is geabstraheerd, dus wanneer een run zich vreemd gedraagt, kun je zien waarom.
- Setup wordt gefactureerd tegen GPU-tarieven: drivers, afhankelijkheden, het multi-gigabyte basischeckpoint en de datasetdownload kosten allemaal hetzelfde per uur als training.
- Een overboden onderbreekbare instantie wordt gepauzeerd en de processen worden beëindigd. Een niet-opgeslagen run is weggegooid geld, en de lerobot-standaard schrijft zijn eerste checkpoint bij stap 20.000.
- Niets vernietigt de pod voor je. De bovenstaande idle-tabel is de rekening voor het vergeten.
- Het aanbod voor enkele volledige 80 GB kaarten is schaars: twee A100 80 GB en vijf H100 80 GB full-card aanbiedingen in deze lezing. De lijst verandert ook voortdurend, dus de goedkoopste vermelde prijs en de prijs die je daadwerkelijk kunt huren zijn niet hetzelfde.
- Elk uur op infrastructuur is een uur dat niet wordt besteed aan het opnemen van de episodes die bepalen of het beleid werkt.
Zelf doen versus het platform de kaart laten huren
Je kiest de machine, bouwt de omgeving en vernietigt de pod. Het uurtarief is het markttarief hierboven; al het andere is jouw tijd.
- Zoek een kaart die overeenkomt met het VRAM dat het model nodig heeft: 24 GB voor ACT en SmolVLA, 80 GB voor GR00T en Pi0.5.
- Huur on-demand als de run een pauze niet kan overleven, onderbreekbaar als deze vaak checkpoints opslaat.
- Installeer de toolchain: lerobot voor ACT, SmolVLA en Pi0.5, de Isaac-GR00T repository met zijn eigen tyro launcher voor GR00T.
- Converteer de dataset indien nodig. Een LeRobot v3.0 dataset crasht de GR00T loader en moet worden geconverteerd naar v2.1.
- Start, observeer het verlies, push checkpoints naar een duurzame locatie zodra ze worden geschreven.
- Vernietig de instantie en controleer vervolgens of je deze hebt vernietigd.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Realistische kosten voor één GR00T run: 3 tot 6 uur op een H100 80 GB tegen 1.34 tot 2.34 USD per uur is 4 tot 14 USD, plus 20 tot 40 minuten setup die ook wordt gefactureerd, plus je eigen tijd.
Je kiest het model, de dataset en de hyperparameters in een formulier. De backend huurt een spot GPU op basis van het VRAM dat het model nodig heeft, draait de trainer en schrijft checkpoints naar objectopslag.
- Kies je combinatie op de trainingsmatrix: vijf modellen, vier armen, één gids per cel.
- Wijs het naar een dataset: één opgenomen met de desktopclient, een Hugging Face repo id, of één van je eigen machine.
- Accepteer de standaardinstellingen of pas ze aan. De bovenstaande tabel is wat daadwerkelijk naar de trainer wordt gestuurd.
- De backend kiest de kaart op basis van het benodigde VRAM, dus je hoeft nooit te zoeken naar GPU's.
- Checkpoints komen in objectopslag terecht zodra ze worden geschreven, dus een onderbroken run is geen verloren run.
| Tier | Modellen | Uitvoeringstijd | Kosten per run |
|---|---|---|---|
| A100 80 GB of H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 tot 6 uur | ongeveer 4 tot 12 USD |
| RTX 4090 of elke 24 GB kaart | SmolVLA, ACT | 2 tot 5 uur | ongeveer 1 tot 3 USD |
Wat het niet doet: een slechte dataset goed maken, GR00T een seed geven die het nooit heeft gehad, of de hieronder beschreven latentielimiet verwijderen. Het verwijdert het zoeken naar GPU's, het bouwen van de omgeving en de pod die je bent vergeten te vernietigen. De mechanismen staan in de trainingsdocumentatie.
Wat het platform in rekening brengt en hoe het de kaart kiest
De logica is opzettelijk saai. Elk model in de catalogus declareert een GPU-tier; de backend neemt het benodigde VRAM en huurt een bijpassende kaart op dezelfde hierboven gemeten spotmarkt. Daarom is de opgegeven kosten een bereik, geen prijs. GR00T en Pi0.5 zijn hier alleen cloud-gebaseerd vanwege de 40 GB en 70 GB ondergrenzen. SmolVLA en ACT draaien ook lokaal op je eigen 24 GB kaart, waar de cloudkosten nul zijn en de elektriciteit jouw probleem is.

Eén instelling verdient een waarschuwing. Gradiëntaccumulatie is werkelijk van toepassing op beide GR00T-varianten, dus het verhogen ervan levert een grotere effectieve batch op dezelfde kaart op. Voor Pi0.5 en SmolVLA is het helemaal niet van toepassing: lerobot 0.5.1 heeft geen gradiëntaccumulatie-optie in zijn trainingsconfiguratie, dus het instellen van het veld op 16 kost niets en levert niets op. Als een in de wachtrij geplaatst proces nooit start, de pagina over vastgelopen taken in de wachtrij behandelt wat je moet controleren; als de dataset wordt geweigerd voordat de run begint, is het bijna altijd het v3.0 formaatprobleem.
Een gehuurde GPU die uw beleid via het openbare internet aanbiedt, voegt round trips toe aan een besturingslus die al 20 tot 485 ms per actiestap bedraagt. Prima voor langzame pick-and-place, niet voor snelle reactieve beweging. Cloud-inferentie evalueert een checkpoint goed en voert productiemanipulatie slecht uit: als de taak snelheid vereist, moet de rekenkracht naast de servo's zitten, en dat zijn kosten die dit artikel niet kan laten verdwijnen. Zie inferentielatentie.
Een uitgewerkt budget voor een eerste werkend beleid
Alle vier de regels samen, beginnend vanaf nul. Het GPU-totaal gaat uit van 3 tot 5 runs: de eerste bewijst dat de pijplijn werkt, de tweede legt een dataprobbleem bloot, de derde of vierde is degene die u behoudt.
| Post | Slanke aanpak | Comfortabele aanpak |
|---|---|---|
| Arm | Alleen SO-100 follower, 121.94 USD in de BOM | leader plus follower, 229.88 USD in de BOM |
| Model | SmolVLA of ACT, 24 GB tier | GR00T N1.7, A100 80 GB of H100 tier |
| Opgenomen afleveringen | 30, het SmolVLA minimum | 50 tot 100 |
| Menselijke tijd om op te nemen | ongeveer 1 u 12 min | 2 tot 4 uur |
| Kosten van één run | 1 tot 3 USD | 4 tot 12 USD |
| Runs voordat het werkt | 3 tot 5 | 3 tot 5 |
| Totaal GPU-uitgaven | 3 tot 15 USD | 12 tot 60 USD |
| Grootste post op de rekening | de arm, dan uw tijd | de arm, dan uw tijd |
Het patroon geldt ook voor robots van dit formaat: rekenkracht is een afrondingsfout, hardware is een reële eenmalige kostenpost, menselijke uren zijn de terugkerende uitgave. Om de trainingshelft te testen voordat u iets koopt, laten u modellen vergelijken en een GPU huren zonder een arm, en is een fysieke SO-100 die u in de browser kunt besturen zonder aanmelding. Voor de gehele end-to-end pijplijn, de behandelt de installatie, en training, en is de korte versie.

Wat kost één VLA fine-tuning run van begin tot eind?▾
Ongeveer 4 tot 12 USD voor GR00T N1.7, GR00T N1.5 of Pi0.5 op de A100 80 GB of H100 tier (3 tot 6 uur à 1.20 tot 2.00 USD per uur), en ongeveer 1 tot 3 USD voor SmolVLA of ACT op de RTX 4090 tier (2 tot 5 uur à 0.30 tot 0.60 USD per uur). Zelf de kaart huren komt in dezelfde prijsklasse uit zodra de insteltijd is meegerekend, aangezien het wordt gefactureerd tegen het trainingstarief.
Is een H100 het waard om voor te betalen boven een A100 80 GB?▾
Voor één SO-100 beleid, meestal niet. Beide voldoen aan de geheugenvereisten die GR00T en Pi0.5 nodig hebben, en op 23 augustus 2026 begon een volledige A100 80 GB bij 0.44 USD per uur tegen 1.34 voor een H100 80 GB. De H100 is sneller klaar, dus een deel van het tarief komt terug als minder uren, maar het totaal is nog steeds hoger voor zo'n kleine run. Het echte argument voor de H100 is beschikbaarheid: vijf aanbiedingen voor een enkele H100 80 GB op die markt tegenover twee voor een A100 80 GB, en een kaart die u niet kunt huren heeft geen prijs.
Hoeveel runs zijn er nodig voordat een beleid daadwerkelijk werkt?▾
Reken op drie tot vijf. De eerste bewijst dat de pijplijn correct is aangesloten. De tweede legt vaak een datasetprobleem bloot, zoals een camerastream die halverwege uitviel. De derde of vierde is degene die u behoudt.
Kan ik SmolVLA of ACT trainen op mijn eigen GPU in plaats van te huren?▾
Ja. Beide worden lokaal ondersteund op AY-Robots en passen comfortabel in 24 GB; het originele ACT-paper trainde zijn 80M model in ongeveer 5 uur op een 11 GB RTX 2080 Ti. GR00T en Pi0.5 zijn hier alleen cloud-gebaseerd omdat de gedocumenteerde fine-tuning vereisten van de leveranciers 40 GB en 70 GB zijn, en de grootste consumentenkaart op de markt de 32 GB RTX 5090 is.
Waarom kosten hetzelfde aantal stappen verschillende bedragen bij verschillende modellen?▾
Stappen zijn niet vergelijkbaar tussen beleidsregels. ACT gebruikt standaard 100.000 stappen met batch 8 op een 24 GB kaart; GR00T N1.5 gebruikt standaard 2.000 stappen met batch 1 en gradiëntaccumulatie 16 op een 80 GB kaart. De rekening is uren vermenigvuldigd met het tarief van de kaart waar de geheugenvoetafdruk u toe dwingt, niet de stappenteller.
Bekijk wat uw run zou kosten voordat u begint
Elk van de vijf beleidsregels vermeldt de GPU-tier, de looptijd en de prijs per run, en de trainingsbackend huurt de kaart op dezelfde spotmarkt waar deze cijfers zijn gemeten.
Bekijk de prijzenSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started