AY-Robots kostentabel die toont welke GPU elk van de vijf beleidsregels nodig heeft, de typische looptijd en prijs per run, en hoeveel afleveringen nodig zijn voordat het beleid bruikbaar is
VLA trainingGPU kostenSO-100fine-tuningrobotlerenbudgettering

VLA Trainingskosten: Wat een Fine-Tuning Run Echt Kost

AY-Robots ResearchAugust 23, 202623 min leestijd

Werkelijke spotmarkt GPU-prijzen, hoe lang elk van de vijf beleidsregels draait, wat de robotarm en de demonstraties kosten, en de vier plaatsen waar het geld stilletjes verdwijnt.

De korte versie

  • Een run op de A100 80 GB of H100-tier duurt 3 tot 6 uur en kost ongeveer 4 tot 12 USD. Op de RTX 4090-tier is dit 2 tot 5 uur en ongeveer 1 tot 3 USD.
  • Gemeten op vast.ai om 13:44 UTC op 23 augustus 2026: een volledige RTX 4090 on demand voor 0.13 tot 0.38 USD/u, een A100 80 GB voor 0.44 tot 0.67, een H100 80 GB voor 1.34 tot 2.34. Volledige 80 GB kaarten zijn schaars, respectievelijk twee en vijf aanbiedingen voor één kaart.
  • De GPU is de goedkoopste post. De materiaallijst van de SO-ARM100 schat een leider-plus-volger-paar op 229.88 USD, wat neerkomt op 77 tot 230 runs op de 24 GB-tier.
  • Twee uur van een persoon die 50 afleveringen opneemt, kost meer dan de trainingsrun waar die afleveringen voor dienen.
  • Geld verdwijnt op vier plaatsen: runs met kapotte data, 3B-modellen voor taken die een 80M-beleid aankan, GPU's die niemand heeft vernietigd, en herhalingen van een resultaat dat je niet hebt bewaard.
  • AY-Robots bepaalt de grootte van de kaart op basis van het VRAM dat het model nodig heeft en huurt deze op dezelfde spotmarkt, dus de runkosten zijn de marktkosten.

De rekening heeft vier posten, en de GPU is de kleinste

Wanneer mensen vragen wat het kost om een visie-taal-actie-model voor een SO-100 te fine-tunenen, bedoelen ze bijna altijd de GPU-huur. Dat is het bedrag dat als kostenpost op een kaart verschijnt, dus dat voelt reëel. Het is ook, met een ruime marge, het kleinste van de vier getallen die bepalen wat een werkend beleid je daadwerkelijk kost.

PostWat het isTypische omvang voor één werkend beleid
GPU-tijdeen kaart huren voor de run1 tot 12 USD per run, en je zult er 3 tot 5 doen
De robotservo's, geprint frame, camera's, kabels, stroomeenmalig, 110 tot 500 EUR per arm
Menselijke ureneen persoon die de arm bestuurt om demo's op te nemen1 tot 4 uur per dataset, herhaald per taak
Verspillingslechte data, te grote modellen, vergeten podsonbegrensd, en de enige post die je controleert

De trainingstijden hieronder komen uit de eigen papers en repositories van de vijf modellen, de hardwarekosten uit de gepubliceerde stuklijst, en de platformnummers van de AY-Robots beleidscatalogus en prijslijstpagina. Waar het platform niet helpt, vermeldt dit artikel dat.

Wat een GPU-uur daadwerkelijk kost op de spotmarkt

Er is geen vaste prijs voor een A100-uur. Op een marktplaats zoals vast.ai stelt elke host zijn eigen tarief in, en de trainingsrun die u start, komt terecht op de machine die op dat moment goedkoop en vrij is. Het eerlijke antwoord is een verdeling. Hier is het, gemeten op 23 augustus 2026 om 13:44 UTC: enkele volledige kaarten, on demand, gefilterd op werkelijk VRAM.

Kaartvast.ai on demand USD/u (laag / mediaan / hoog)Volledige-kaart aanbiedingenvast.ai bodemtariefRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74niet aangeboden
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99niet aangeboden
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 als een Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 als een endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19niet aangeboden
Hoe deze momentopname is gemaakt, en wat het niet is

On-demand aanbiedingen voor één volledige GPU (gpu_frac == 1.0) van de vast.ai openbare bundel API, waarvoor geen account nodig is, gefilterd op gpu_ram zodat alleen echte 80 GB kaarten in de 80 GB rijen terechtkomen. Dat filter is belangrijk: in deze meting waren alle drie de single-card A100 SXM4 aanbiedingen 40 GB onderdelen, evenals twee van de vier A100 PCIE aanbiedingen, dus het samenvoegen ervan in één "A100" rij zou de hier gerapporteerde prijs hebben gehalveerd. De Hugging Face kolom combineert twee producten: 2.50 USD/h is de Nvidia A100 - large Spaces hardware en 4.50 USD/h is een enkele H100 80 GB onder Inference Endpoints, wat Spaces niet aanbiedt. Beschouw de medianen als indicatief: de A100 80 GB rij is gebaseerd op twee aanbiedingen en de H100 rij op vijf, en dezelfde query 36 seconden later gaf een ander 4090 aantal en een andere topprijs op drie van de vijf rijen. RunPod catalogusprijzen zijn het stabielere getal om mee te plannen.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
De exacte query achter de bovenstaande tabel, twee keer uitgevoerd tijdens het schrijven van deze sectie. Voer deze uit voordat u een GPU-prijsartikel vertrouwt, inclusief dit artikel.
AY-Robots kostentabel die toont welke GPU elk beleid nodig heeft, typische looptijd en prijs per run, en hoeveel afleveringen nodig zijn voordat het beleid bruikbaar is
De kostentabel op /try: kaart, looptijd, prijs per run en minimale afleveringen per beleid.

Waarom de 3B modellen de goedkope kaart niet kunnen gebruiken

Een 4090-uur en een H100 80 GB-uur verschillen ruwweg zes keer bij de bovengenoemde medianen. Wat je dwingt tot de dure kaart is niet snelheid, het is geheugen. openpi stelt de ondergrens voor een volledige Pi0.5 fine-tune op 70 GB, en NVIDIA beveelt 40 GB of meer aan voor GR00T. Merk op wat het GR00T-getal niet is. De fine-tune configuratie bevriest standaard het taalmodel en de visuele encoder (tune_llm en tune_visual zijn False, de projector en de diffusiekop True), daarom vermeldt de catalogus ruwweg 40 M getrainde parameters van de 3 B. De 40 GB is geen optimizer-status voor 3 B gewichten, het is de bevroren backbone plus activaties. Varianten met een kleinere scope vragen minder: openpi's LoRA-pad wil 22.5 GB en noemt de 4090, en NVIDIA's Isaac Lab Arena workflow vermeldt een 24 GB single-GPU optie voor GR00T post-training. Het platform baseert de lagen op de ondergrens die elke leverancier publiceert voor de configuratie die het daadwerkelijk draait. De pi0 flow-matching uiteenzetting legt uit waar die flow-matching voetafdruk vandaan komt.

TaakGeheugen dat het upstream project vraagtBron
pi0 / pi0.5 inferentiemeer dan 8 GB, voorbeeld RTX 4090openpi
pi0 / pi0.5 LoRA fine-tunemeer dan 22.5 GB, voorbeeld RTX 4090openpi
pi0 / pi0.5 volledige fine-tunemeer dan 70 GB, voorbeeld A100 80 GB of H100openpi
GR00T N1.7 inferentie1 GPU met 16 GB of meerIsaac-GR00T
GR00T N1.7 fine-tune40 GB of meer aanbevolen, H100 of L40 nodesIsaac-GR00T
GR00T fine-tune, wat het traintprojector en diffusiekop; LLM en visuele encoder standaard bevrorenfinetune_config.py
GR00T post-training, gereduceerd1 GPU met 24 GB, taalmodel bevrorenIsaac Lab Arena
SmolVLA fine-tuneenkele A100 voor de referentie 20.000-stappen runlerobot docs
ACT trainingeen enkele 11 GB RTX 2080 TiACT paper

Die tabel is de reden waarom het platform de vijf modellen in twee lagen verdeelt. GR00T N1.7, GR00T N1.5 en Pi0.5 draaien op A100 80 GB of H100 omdat dat is wat de leveranciers vragen. SmolVLA en ACT draaien op een RTX 4090 of elke 24 GB kaart omdat dat echt voldoende is.

De valkuil die een dag kost: de goedkope kaart huren voor het grote model

Een GR00T- of Pi0.5-run op een 24 GB kaart faalt niet direct. Het downloadt het basischeckpoint, bouwt de datasetindex, start de eerste forward pass en sterft na een paar honderd stappen met een CUDA out-of-memory fout. Je hebt betaald voor de download en de setup en kreeg niets. Oplossingen: onvoldoende geheugen tijdens training.

Hoe lang elk van de vijf modellen daadwerkelijk draait

De looptijd is de andere helft van de kosten: 2.00 USD per uur is irrelevant als de taak 40 minuten duurt en ruïneus als deze 40 uur duurt. Dit zijn de standaardinstellingen die AY-Robots daadwerkelijk naar de trainer stuurt, met het uitvoervenster en de kosten voor elke laag.

BeleidGPU-laagStandaard max. stappenStandaard batch (grad accum)UitvoervensterKosten per uitvoering
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, van toepassing3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, van toepassing3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, geen effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, geen effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Vergelijkingstabel van de vijf trainbare beleidsregels op AY-Robots met het aantal parameters, vereiste GPU, inferentielatentie en minimum aantal afleveringen
De vijf beleidsregels naast elkaar: parameters, GPU-laag, latentie per actiestap, minimum aantal afleveringen.

Waar die uitvoervensters vandaan komen stroomopwaarts

  • SmolVLA: de lerobot-documentatie stelt dat 20.000 stappen ongeveer 4 uur duren op een enkele A100. Het platform draait dezelfde 20.000 stappen op de goedkopere 24 GB-laag, vandaar een venster in plaats van een vaste 4 uur.
  • ACT: het originele ALOHA-paper rapporteert ongeveer 5 uur op een enkele 11 GB RTX 2080 Ti voor een model met 80M parameters. Een 4090 is enkele generaties nieuwer, maar het platform budgetteert 100.000 stappen, dus het venster komt op dezelfde plek uit.
  • GR00T: NVIDIA's referentieworkflow voor de N1.6-generatie vermeldt ongeveer 4 tot 8 uur voor 20.000 stappen bij batch 24 op acht L40S-kaarten, en 2 tot 3 uur voor 30.000 stappen bij batch 16 op een enkele Ada 6000. Fine-tuning van een 3B VLA op één kaart in een paar uur is normaal, niet optimistisch.
  • Pi0.5: openpi publiceert geen 'wall-clock' cijfer, maar het publiceert wel de 70 GB ondergrens voor een volledige fine-tune, wat de kaart en daarmee de snelheid vastlegt.

Het is de moeite waard stil te staan bij het bedrag dat u niet betaalt. Het GR00T N1-paper rapporteert ongeveer 50.000 H100 GPU-uren om het 2.2B-model voor te trainen, op een cluster van maximaal 1024 GPU's, met een pretraining batchgrootte van 16.384 voor 200.000 gradiëntstappen. Tegen de hierboven gemeten 1,34 tot 2,34 USD per uur komt dat neer op ongeveer 67.000 tot 117.000 USD aan gehuurde rekenkracht. Het SmolVLA-paper schat het project op ongeveer 30.000 GPU-uren verdeeld over 481 community-datasets, 22.9K afleveringen en 10.6M frames. U erft dit alles voor de prijs van een download; uw 8 USD koopt de laatste 20.000 stappen. Waarom VLA's op deze manier zijn gebouwd behandelt die opsplitsing.

De arm: een eenmalige kostenpost die de GPU-rekening overschaduwt

Een trainingsrun kost minder dan lunch. De robot niet. Daarom is de SO-100 belangrijk: het is de goedkoopste arm die de hele imitatieleer toolchain daadwerkelijk ondersteunt.

ArmServo'sVoltageOnderdeelkostenOndersteuning op AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURvolledige, referentiearm
SO-101Feetech STS32157.4 V130 to 170 EURvolledig
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURcompatibel
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURcompatibel

De upstream stuklijst in de SO-ARM100 repository is gedetailleerder en de moeite waard om te controleren voor uw regio: de Onderdelen Voor Twee Armen lijst bedraagt in totaal 229.88 USD of 226.30 EUR voor een leider-plus-volger opstelling, en de Onderdelen voor Eén Volgerarm lijst bedraagt in totaal 121.94 USD of 124.30 EUR. Zes STS3215 servo's van elk 13.89 USD zijn 83.34 van die 121.94, dus de servo's zijn de arm. Met 1 tot 3 USD per SmolVLA of ACT run is één paar armen tussen de 77 en 230 trainingsruns waard. Als u nog steeds kiest, SO-100 versus SO-101 is de vergelijking die ertoe doet, omdat de twee dicht genoeg bij elkaar liggen dat de beslissing gaat over beschikbaarheid in plaats van capaciteit.

7.4 V, geen 12 V

De STS3215 wordt geleverd in een 7.4 V en een 12 V variant; de repository vermeldt dat het 12 V onderdeel ook een 12 V 5 A voeding nodig heeft in plaats van de 5 V, dus de twee zijn niet uitwisselbaar. Het voeden van 12 V aan 7.4 V servo's vernietigt ze, en zes servo's zijn twee derde van de onderdeelkosten van een volgerarm. Controleer het label op elke servo vóór de eerste inschakeling. Als servo's zich al vreemd gedragen: servo reageert niet, arm trilt dan zakt.

Menselijke uren: de regel die niemand in de spreadsheet zet

Dit is het getal dat de kostenbespreking op zijn kop zet. Het opnemen van demonstraties is een persoon die een robotarm beweegt, één episode tegelijk, in realtime. Er is geen batchverwerking en geen verhuur per seconde. De LeRobot dataset recorder wordt geleverd met standaardinstellingen die de berekening eenvoudig maken, alle drie bevestigd in DatasetRecordConfig: 60 seconden per episode, 60 seconden om de scène te resetten, 50 episodes. De geldkolom hieronder gaat uit van 15 USD voor een uur van iemands tijd, wat een aanname is in plaats van een platformgetal. Vervang dit door uw eigen tarief; de verhouding is het punt.

  1. 1
    Neem de dataset op met de standaardinstellingen waarvoor u daadwerkelijk wordt gefactureerd

    Dit is lerobot 0.6.1, de versie op PyPI per 3 augustus 2026. Let op de CLI-vorm: opnemen gebeurt via het lerobot-record console-ingangspunt (lerobot.scripts.lerobot_record), niet via het oude python -m lerobot.scripts.record modulepad. AY-Robots richt zich op 0.5.1, en de 0.5.1 wheel declareert dezelfde lerobot-record en lerobot-train ingangspunten, dus de onderstaande vorm is stabiel voor beide. De drie timing-flags zijn de upstream-standaardwaarden, dus dit is ook de opdracht die de berekening in de volgende tabel aanneemt.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Bekijk wat u heeft opgenomen voordat u één GPU-minuut huurt

    Het inspecteren van een dataset kost nul USD per uur. Het ontdekken van hetzelfde probleem aan de hand van een loss curve kost 2.00 USD per uur op de H100-tier en vertelt u vier uur te laat. Push de dataset en bekijk deze in de LeRobot viewer, of blader door de AY-Robots dataset directory.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Train, en zorg ervoor dat het checkpoint de pod overleeft

    Een gehuurde machine is per definitie tijdelijk, dus schrijf checkpoints ergens duurzaam weg tijdens de uitvoering. Twee flags bepalen of u behoudt waarvoor u heeft betaald. --save_freq is standaard 20.000 stappen, dus een standaard 20.000-stappen SmolVLA-run schrijft zijn eerste checkpoint wanneer de run al voorbij is; verlaag dit voordat u iets onderbreekbaars huurt. --save_checkpoint_to_hub vereist --policy.repo_id en bestaat niet in lerobot 0.5.1, dus op die versie kopieert u de uitvoermap zelf van de machine. De batchgrootte hieronder is het voorbeeld uit de upstream-documentatie; het AY-Robots formulier stuurt 2 voor SmolVLA en schrijft naar objectopslag zodra checkpoints verschijnen.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpisodesOpnemen met 60 sResetten met 60 sTotale tijdPlus 20 procent heropnamesTegen 15 USD per menselijk uur
30, het SmolVLA minimum30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, de andere vier minimums50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, een comfortabele dataset100 min100 min3 h 20 min4 h 00 minabout 60 USD

Vergelijk de rechterkolom met de 1 tot 12 USD die de run kost. Tegen dat veronderstelde tarief kost een dataset van 50 afleveringen twee tot zeven keer zoveel om op te nemen als om op te trainen, vóór kalibratie, camera-instelling en de afleveringen die je weggooit. Daarom heeft een directe geldwaarde. De lerobot-gids suggereert minstens 50 afleveringen met 10 per objectlocatie; de SmolVLA-documentatie meldt dat een 25-afleveringenversie van dezelfde taak niet voldoende was.

Waar het geld daadwerkelijk verdwijnt

1. Runs op gegevens die nooit zouden werken

Een GR00T-run van 20.000 stappen op een dataset met twee verwisselde camerastreams kost hetzelfde als een run op een schone dataset, duurt even lang en produceert een verliescurve die er goed uitziet. De storing verschijnt uren later op de arm. worden per uur gefactureerd en diagnose wordt in dagen gefactureerd. Twee symptomen die het waard zijn om te onthouden: betekent meestal dat de waarnemingen niet bevatten wat de taak nodig heeft, en betekent dat de dataset minder variatie had dan je dacht.

2. Foundation-model prijzen betalen voor een taak met vaste camera

ACT heeft ongeveer 80M parameters en is ontworpen om vanaf nul te trainen op 50 demonstraties van één taak. GR00T N1.7 heeft ongeveer 3B parameters met een voorgegetrainde backbone. Voor een vastgeschroefde camera, een vaste tafel en één object, bereikt het 80M model vaak het doel, draait het met ongeveer 20 ms per actiestap in plaats van 152 ms, en kost het 1 tot 3 USD per run in plaats van 4 tot 12. Besteed 3 USD om erachter te komen of het goedkope model werkt voordat u 12 USD uitgeeft aan het dure model. ACT versus SmolVLA en GR00T N1.7 versus Pi0.5 laten zien waar elk ophoudt het juiste antwoord te zijn; de modelarena heeft 85 modellen en 332 benchmarkresultaten.

3. De GPU die u vergeten bent

De goedkoopste fout om te voorkomen en de meest voorkomende om te maken. Een instantie die op een vrijdag is gestart om iets te debuggen, wordt het hele weekend gefactureerd tegen hetzelfde tarief als een echte run.

KaartMediane prijs in de momentopnameInactief gedurende 24 uurInactief gedurende 7 dagenDat is waard
RTX 40900.32 USD/h7.68 USD53.76 USDongeveer 27 SmolVLA of ACT runs à 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDongeveer 12 GR00T runs à 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDongeveer 38 GR00T runs à 8 USD

Op AY-Robots is deze fout voor inferentie uitgesloten: pods die door de inferentie-API worden geleverd, hebben een inactieve watchdog en vernietigen zichzelf na een inactieve periode. Als u de kaart zelf huurt, is die watchdog uw agendaherinnering.

4. Twee keer betalen voor hetzelfde antwoord

Het fine-tuning toegangspunt van GR00T is een tyro CLI die geen seed blootstelt. Dat is geen platformbeperking, het is de upstream tool: er is geen seed-veld in gr00t/configs/finetune_config.py, en de eigen trainingstips van de repository waarschuwen dat runs 5 tot 6 procent variëren omdat de beeldaugmentaties niet-deterministisch zijn. lerobot gebruikt standaard seed 1000 in zowel 0.5.1 als 0.6.1, zodat ACT, SmolVLA en Pi0.5 runs op zijn minst opnieuw kunnen worden uitgevoerd met dezelfde initialisatie en datavolgorde. Dat is geen belofte van bit-identieke gewichten op een GPU, maar het is het verschil tussen een heruitvoering en een nieuw experiment. Als een GR00T run een beleid produceert dat werkt en u hebt de checkpoint, betaalt u de volle prijs voor een resultaat dat meer kan verschillen dan het verschil dat u zocht. Er is een tweede manier om een betaald checkpoint te verliezen: de CLI gebruikt standaard --save-total-limit 5, gedocumenteerd als het maximale aantal checkpoints dat wordt bewaard voordat oudere worden verwijderd. Opslag kost centen; een heruitvoering kost 4 tot 12 USD en zes uur.

Onderbreekbare capaciteit is de helft van de prijs en zal je run beëindigen

De hierboven genoemde biedprijzen zijn een fractie van het on-demand tarief, en vast.ai stelt dat het biedsysteem de kosten voor klanten met vijftig procent of meer kan verlagen. De keerzijde, in hun eigen woorden: een onderbreekbare instantie kan op elk moment worden gepauzeerd als een andere gebruiker hoger biedt of als er een on-demand huur wordt aangemaakt voor dezelfde resources, en die pauze "stopt alle draaiende processen". On-demand heeft altijd voorrang. Prima voor een run die elke paar honderd stappen een checkpoint wegschrijft, een totaal verlies voor een run die pas aan het einde wegschrijft, wat precies is wat de standaardinstellingen je geven: de Isaac-GR00T CLI schrijft elke --save-steps (standaard 1000), maar lerobot's --save_freq is standaard 20.000 stappen, dus een standaard SmolVLA run checkpoint één keer, aan de finish. Verlaag het, of bied niet. Het AY-Robots trainingsformulier toont de GR00T-instelling als saveSteps.

Zelf de kaart huren
Voordelen
  • Het laagste uurtarief dat er is.
  • Volledige controle over de image, CUDA-versie, lerobot of Isaac-GR00T revisie en elke flag.
  • Onderbreekbaar bieden halveert het tarief als je run vaak genoeg checkpoints opslaat om een pauze te overleven.
  • Niets is geabstraheerd, dus wanneer een run zich vreemd gedraagt, kun je zien waarom.
Afwegingen
  • Setup wordt gefactureerd tegen GPU-tarieven: drivers, afhankelijkheden, het multi-gigabyte basischeckpoint en de datasetdownload kosten allemaal hetzelfde per uur als training.
  • Een overboden onderbreekbare instantie wordt gepauzeerd en de processen worden beëindigd. Een niet-opgeslagen run is weggegooid geld, en de lerobot-standaard schrijft zijn eerste checkpoint bij stap 20.000.
  • Niets vernietigt de pod voor je. De bovenstaande idle-tabel is de rekening voor het vergeten.
  • Het aanbod voor enkele volledige 80 GB kaarten is schaars: twee A100 80 GB en vijf H100 80 GB full-card aanbiedingen in deze lezing. De lijst verandert ook voortdurend, dus de goedkoopste vermelde prijs en de prijs die je daadwerkelijk kunt huren zijn niet hetzelfde.
  • Elk uur op infrastructuur is een uur dat niet wordt besteed aan het opnemen van de episodes die bepalen of het beleid werkt.

Zelf doen versus het platform de kaart laten huren

Je kiest de machine, bouwt de omgeving en vernietigt de pod. Het uurtarief is het markttarief hierboven; al het andere is jouw tijd.

  1. Zoek een kaart die overeenkomt met het VRAM dat het model nodig heeft: 24 GB voor ACT en SmolVLA, 80 GB voor GR00T en Pi0.5.
  2. Huur on-demand als de run een pauze niet kan overleven, onderbreekbaar als deze vaak checkpoints opslaat.
  3. Installeer de toolchain: lerobot voor ACT, SmolVLA en Pi0.5, de Isaac-GR00T repository met zijn eigen tyro launcher voor GR00T.
  4. Converteer de dataset indien nodig. Een LeRobot v3.0 dataset crasht de GR00T loader en moet worden geconverteerd naar v2.1.
  5. Start, observeer het verlies, push checkpoints naar een duurzame locatie zodra ze worden geschreven.
  6. Vernietig de instantie en controleer vervolgens of je deze hebt vernietigd.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Het huidige Isaac-GR00T fine-tune entry point, overeenkomend met de opdracht in de repository README. Deze CLI heeft geen seed flag, dus GR00T runs zijn niet bit-voor-bit reproduceerbaar.

Realistische kosten voor één GR00T run: 3 tot 6 uur op een H100 80 GB tegen 1.34 tot 2.34 USD per uur is 4 tot 14 USD, plus 20 tot 40 minuten setup die ook wordt gefactureerd, plus je eigen tijd.

Wat het platform in rekening brengt en hoe het de kaart kiest

De logica is opzettelijk saai. Elk model in de catalogus declareert een GPU-tier; de backend neemt het benodigde VRAM en huurt een bijpassende kaart op dezelfde hierboven gemeten spotmarkt. Daarom is de opgegeven kosten een bereik, geen prijs. GR00T en Pi0.5 zijn hier alleen cloud-gebaseerd vanwege de 40 GB en 70 GB ondergrenzen. SmolVLA en ACT draaien ook lokaal op je eigen 24 GB kaart, waar de cloudkosten nul zijn en de elektriciteit jouw probleem is.

De AY-Robots prijspagina die toont wat een trainingsrun en platformtoegang kosten
De prijspagina. Cijfers per run volgen de spotmarkt in plaats van een vaste catalogusprijs.

Eén instelling verdient een waarschuwing. Gradiëntaccumulatie is werkelijk van toepassing op beide GR00T-varianten, dus het verhogen ervan levert een grotere effectieve batch op dezelfde kaart op. Voor Pi0.5 en SmolVLA is het helemaal niet van toepassing: lerobot 0.5.1 heeft geen gradiëntaccumulatie-optie in zijn trainingsconfiguratie, dus het instellen van het veld op 16 kost niets en levert niets op. Als een in de wachtrij geplaatst proces nooit start, de pagina over vastgelopen taken in de wachtrij behandelt wat je moet controleren; als de dataset wordt geweigerd voordat de run begint, is het bijna altijd het v3.0 formaatprobleem.

De beperking die dit platform niet oplost: latentie

Een gehuurde GPU die uw beleid via het openbare internet aanbiedt, voegt round trips toe aan een besturingslus die al 20 tot 485 ms per actiestap bedraagt. Prima voor langzame pick-and-place, niet voor snelle reactieve beweging. Cloud-inferentie evalueert een checkpoint goed en voert productiemanipulatie slecht uit: als de taak snelheid vereist, moet de rekenkracht naast de servo's zitten, en dat zijn kosten die dit artikel niet kan laten verdwijnen. Zie inferentielatentie.

Een uitgewerkt budget voor een eerste werkend beleid

Alle vier de regels samen, beginnend vanaf nul. Het GPU-totaal gaat uit van 3 tot 5 runs: de eerste bewijst dat de pijplijn werkt, de tweede legt een dataprobbleem bloot, de derde of vierde is degene die u behoudt.

PostSlanke aanpakComfortabele aanpak
ArmAlleen SO-100 follower, 121.94 USD in de BOMleader plus follower, 229.88 USD in de BOM
ModelSmolVLA of ACT, 24 GB tierGR00T N1.7, A100 80 GB of H100 tier
Opgenomen afleveringen30, het SmolVLA minimum50 tot 100
Menselijke tijd om op te nemenongeveer 1 u 12 min2 tot 4 uur
Kosten van één run1 tot 3 USD4 tot 12 USD
Runs voordat het werkt3 tot 53 tot 5
Totaal GPU-uitgaven3 tot 15 USD12 tot 60 USD
Grootste post op de rekeningde arm, dan uw tijdde arm, dan uw tijd

Het patroon geldt ook voor robots van dit formaat: rekenkracht is een afrondingsfout, hardware is een reële eenmalige kostenpost, menselijke uren zijn de terugkerende uitgave. Om de trainingshelft te testen voordat u iets koopt, laten u modellen vergelijken en een GPU huren zonder een arm, en is een fysieke SO-100 die u in de browser kunt besturen zonder aanmelding. Voor de gehele end-to-end pijplijn, de behandelt de installatie, en training, en is de korte versie.

De AY-Robots trainingsmatrix met vijf beleidsregels als rijen en vier robotarmen als kolommen, waarbij elke cel linkt naar een specifieke trainingsgids
De /train matrix: rij voor uw budget, kolom voor uw arm, cel voor de gids met de standaardinstellingen en kosten van die combinatie.
Wat kost één VLA fine-tuning run van begin tot eind?

Ongeveer 4 tot 12 USD voor GR00T N1.7, GR00T N1.5 of Pi0.5 op de A100 80 GB of H100 tier (3 tot 6 uur à 1.20 tot 2.00 USD per uur), en ongeveer 1 tot 3 USD voor SmolVLA of ACT op de RTX 4090 tier (2 tot 5 uur à 0.30 tot 0.60 USD per uur). Zelf de kaart huren komt in dezelfde prijsklasse uit zodra de insteltijd is meegerekend, aangezien het wordt gefactureerd tegen het trainingstarief.

Is een H100 het waard om voor te betalen boven een A100 80 GB?

Voor één SO-100 beleid, meestal niet. Beide voldoen aan de geheugenvereisten die GR00T en Pi0.5 nodig hebben, en op 23 augustus 2026 begon een volledige A100 80 GB bij 0.44 USD per uur tegen 1.34 voor een H100 80 GB. De H100 is sneller klaar, dus een deel van het tarief komt terug als minder uren, maar het totaal is nog steeds hoger voor zo'n kleine run. Het echte argument voor de H100 is beschikbaarheid: vijf aanbiedingen voor een enkele H100 80 GB op die markt tegenover twee voor een A100 80 GB, en een kaart die u niet kunt huren heeft geen prijs.

Hoeveel runs zijn er nodig voordat een beleid daadwerkelijk werkt?

Reken op drie tot vijf. De eerste bewijst dat de pijplijn correct is aangesloten. De tweede legt vaak een datasetprobleem bloot, zoals een camerastream die halverwege uitviel. De derde of vierde is degene die u behoudt.

Kan ik SmolVLA of ACT trainen op mijn eigen GPU in plaats van te huren?

Ja. Beide worden lokaal ondersteund op AY-Robots en passen comfortabel in 24 GB; het originele ACT-paper trainde zijn 80M model in ongeveer 5 uur op een 11 GB RTX 2080 Ti. GR00T en Pi0.5 zijn hier alleen cloud-gebaseerd omdat de gedocumenteerde fine-tuning vereisten van de leveranciers 40 GB en 70 GB zijn, en de grootste consumentenkaart op de markt de 32 GB RTX 5090 is.

Waarom kosten hetzelfde aantal stappen verschillende bedragen bij verschillende modellen?

Stappen zijn niet vergelijkbaar tussen beleidsregels. ACT gebruikt standaard 100.000 stappen met batch 8 op een 24 GB kaart; GR00T N1.5 gebruikt standaard 2.000 stappen met batch 1 en gradiëntaccumulatie 16 op een 80 GB kaart. De rekening is uren vermenigvuldigd met het tarief van de kaart waar de geheugenvoetafdruk u toe dwingt, niet de stappenteller.

Bekijk wat uw run zou kosten voordat u begint

Elk van de vijf beleidsregels vermeldt de GPU-tier, de looptijd en de prijs per run, en de trainingsbackend huurt de kaart op dezelfde spotmarkt waar deze cijfers zijn gemeten.

Bekijk de prijzen

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started