Tabelul de costuri AY-Robots care arată ce GPU necesită fiecare dintre cele cinci politici, timpul tipic de rulare și prețul per rulare, și câte episoade sunt necesare înainte ca politica să devină utilă
antrenament VLAcosturi GPUSO-100fine-tuningînvățare roboticăbugetare

Costul Antrenamentului VLA: Cât Costă cu Adevărat o Rulare de Fine-Tuning

AY-Robots ResearchAugust 23, 202623 min de citit

Prețuri reale ale GPU-urilor pe piața spot, cât durează rularea fiecăreia dintre cele cinci politici, cât costă brațul și demonstrațiile, și cele patru locuri unde banii dispar în liniște.

Pe scurt

  • O rulare pe nivelul A100 80 GB sau H100 durează 3 până la 6 ore și costă aproximativ 4 până la 12 USD. Pe nivelul RTX 4090, durează 2 până la 5 ore și costă aproximativ 1 până la 3 USD.
  • Măsurat pe vast.ai la 13:44 UTC pe 23 august 2026: un RTX 4090 complet la cerere pentru 0.13 până la 0.38 USD/h, un A100 80 GB pentru 0.44 până la 0.67, un H100 80 GB pentru 1.34 până la 2.34. Plăcile complete de 80 GB sunt rare, cu două, respectiv cinci oferte de plăci individuale.
  • GPU-ul este cea mai ieftină linie. Lista de materiale SO-ARM100 plasează o pereche lider plus urmăritor la 229.88 USD, ceea ce înseamnă 77 până la 230 de rulări pe nivelul de 24 GB.
  • Două ore în care o persoană înregistrează 50 de episoade costă mai mult decât rularea de antrenament pe care o alimentează acele episoade.
  • Banii dispar în patru locuri: rulări pe date corupte, modele 3B pe sarcini gestionate de o politică 80M, GPU-uri pe care nimeni nu le-a distrus și re-rulări ale unui rezultat pe care nu ați reușit să-l păstrați.
  • AY-Robots dimensionează placa în funcție de VRAM-ul necesar modelului și o închiriază pe aceeași piață spot, astfel încât costul rulării este costul pieței.

Factura are patru linii, iar GPU-ul este cea mai mică

Când oamenii întreabă cât costă să ajustezi fin un model viziune-limbaj-acțiune pentru un SO-100, aproape întotdeauna se referă la închirierea GPU-ului. Acesta este numărul care apare ca o taxă pe un card, deci este cel care pare real. Este, de asemenea, la o marjă largă, cel mai mic dintre cele patru numere care decid cât costă de fapt o politică funcțională.

LinieCe esteDimensiune tipică pentru o politică funcțională
GPU timeînchirierea unei plăci pentru rulare1 până la 12 USD per rulare, și veți face 3 până la 5
The robotservo-uri, cadru imprimat, camere, cabluri, alimentareo singură dată, 110 până la 500 EUR pe braț
Human hourso persoană care operează brațul pentru a înregistra demonstrații1 până la 4 ore per set de date, repetat per sarcină
Wastedate proaste, modele supradimensionate, pod-uri uitatenelimitat, și singura linie pe care o controlați

Timpii de antrenament de mai jos provin din documentele și depozitele proprii ale celor cinci modele, costul hardware din lista de materiale publicată, numerele platformei de la AY-Robots catalogul de politici și pagina de prețuri. Acolo unde platforma nu ajută, acest articol o menționează.

Cât costă de fapt o oră de GPU pe piața spot

Nu există un preț unic pentru o oră de A100. Pe o piață precum vast.ai, fiecare gazdă își stabilește propria rată, iar rula de antrenament pe care o lansați ajunge pe orice mașină este ieftină și disponibilă în acel moment. Răspunsul sincer este o distribuție. Iată-l, măsurat pe 23 august 2026 la 13:44 UTC: plăci complete individuale, la cerere, filtrate după VRAM real.

Placăvast.ai la cerere USD/h (minim / median / maxim)Oferte de plăci completePreț minim vast.aiRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74nu este oferit
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99nu este oferit
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 ca Spațiu
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 ca punct final
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19nu este oferit
Cum a fost realizată această captură și ce nu este ea

Oferte la cerere pentru un singur GPU complet (gpu_frac == 1.0) de la API-ul public vast.ai, care nu necesită cont, filtrate după gpu_ram astfel încât doar plăcile autentice de 80 GB să apară în rândurile de 80 GB. Acest filtru contează: în această citire, toate cele trei oferte de A100 SXM4 cu o singură placă erau de 40 GB, la fel ca două dintre cele patru oferte de A100 PCIE, deci gruparea lor într-un singur rând „A100” ar fi înjumătățit prețul raportat aici. Coloana Hugging Face combină două produse: 2.50 USD/h este hardware-ul Nvidia A100 - large Spaces, iar 4.50 USD/h este un singur H100 80 GB sub Inference Endpoints, pe care Spaces nu îl oferă. Tratați medianele ca fiind indicative: rândul A100 80 GB se bazează pe două oferte, iar rândul H100 pe cinci, iar aceeași interogare, 36 de secunde mai târziu, a returnat un număr diferit de 4090 și un preț maxim diferit pe trei dintre cele cinci rânduri. Prețurile de listă RunPod sunt numerele mai stabile pe care să vă bazați planificarea.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Interogarea exactă din spatele tabelului de mai sus, rulată de două ori în timpul scrierii acestei secțiuni. Rulați-o înainte de a avea încredere în orice articol despre prețurile GPU, inclusiv în acesta.
Tabelul de costuri AY-Robots care arată ce GPU necesită fiecare politică, timpul tipic de rulare și prețul per rulare, și câte episoade sunt necesare înainte ca politica să devină utilă
Tabelul de costuri de pe /try: placă, timp de rulare, preț per rulare și număr minim de episoade per politică.

De ce modelele 3B nu pot folosi placa ieftină

O oră de 4090 și o oră de H100 80 GB diferă de aproximativ șase ori la mediile de mai sus. Ceea ce te forțează să folosești placa scumpă nu este viteza, ci memoria. openpi stabilește un minim pentru un Pi0.5 complet fine-tune la 70 GB, iar NVIDIA recomandă 40 GB sau mai mult pentru GR00T. Rețineți ce nu este numărul GR00T. Configurația sa de fine-tune îngheață modelul lingvistic și encoderul vizual implicit (tune_llm și tune_visual sunt False, iar proiectorul și capul de difuzie True), motiv pentru care catalogul listează aproximativ 40 M parametri antrenați din 3 B. Cei 40 GB nu reprezintă starea optimizatorului pentru 3 B ponderi, ci backbone-ul înghețat plus activările. Variantele cu scop redus necesită mai puțin: calea LoRA a openpi necesită 22.5 GB și menționează 4090, iar fluxul de lucru Isaac Lab Arena de la NVIDIA listează o opțiune cu un singur GPU de 24 GB pentru post-antrenarea GR00T. Platforma se bazează pe cerințele minime pe care fiecare furnizor le publică pentru configurația pe care o rulează efectiv. Articolul despre flow-matching al pi0 explică de unde provine acea flow-matching amprentă.

SarcinăMemoria cerută de proiectul upstreamSursă
Inferență pi0 / pi0.5mai mult de 8 GB, exemplu RTX 4090openpi
Fine-tune LoRA pi0 / pi0.5mai mult de 22.5 GB, exemplu RTX 4090openpi
Fine-tune complet pi0 / pi0.5mai mult de 70 GB, exemplu A100 80 GB sau H100openpi
Inferență GR00T N1.71 GPU cu 16 GB sau mai multIsaac-GR00T
Fine-tune GR00T N1.740 GB sau mai mult recomandat, noduri H100 sau L40Isaac-GR00T
Fine-tune GR00T, ce antreneazăproiector și cap de difuzie; LLM și encoder vizual înghețate implicitfinetune_config.py
Post-antrenare GR00T, redus1 GPU cu 24 GB, model lingvistic înghețatIsaac Lab Arena
Fine-tune SmolVLAun singur A100 pentru rularea de referință de 20.000 de pașilerobot docs
Antrenare ACTun singur 11 GB RTX 2080 TiACT paper

Acest tabel explică de ce platforma împarte cele cinci modele în două niveluri. GR00T N1.7, GR00T N1.5 și Pi0.5 rulează pe A100 80 GB sau H100, deoarece asta cer furnizorii. SmolVLA și ACT rulează pe un RTX 4090 sau orice placă de 24 GB, deoarece asta este suficient.

Capcana care îți mănâncă o zi: închirierea plăcii ieftine pentru modelul mare

O rulare GR00T sau Pi0.5 pe o placă de 24 GB nu eșuează imediat. Descarcă checkpoint-ul de bază, construiește indexul setului de date, începe prima trecere înainte și se oprește după câteva sute de pași cu o eroare CUDA de lipsă de memorie. Ai plătit pentru descărcare și configurare și nu ai obținut nimic. Soluții: lipsă de memorie în timpul antrenării.

Cât timp rulează efectiv fiecare dintre cele cinci modele

Timpul de rulare este cealaltă jumătate a costului: 2.00 USD pe oră este irelevant dacă sarcina durează 40 de minute și ruinător dacă durează 40 de ore. Acestea sunt valorile implicite pe care AY-Robots le trimite antrenorului, împreună cu fereastra de rulare și costul pentru fiecare nivel.

PoliticăNivel GPUPași maximi implicițiBatch implicit (acumulare gradient)Fereastră de rulareCost per rulare
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Tabel comparativ al celor cinci politici antrenabile pe AY-Robots, arătând numărul de parametri, GPU-ul necesar, latența de inferență și numărul minim de episoade
Cele cinci politici una lângă alta: parametri, nivel GPU, latență per pas de acțiune, episoade minime.

De unde provin acele ferestre de execuție din amonte

  • SmolVLA: documentația lerobot afirmă că 20,000 de pași durează aproximativ 4 ore pe un singur A100. Platforma rulează aceiași 20,000 de pași pe nivelul mai ieftin de 24 GB, de unde o fereastră în loc de 4 ore fixe.
  • ACT: lucrarea originală ALOHA raportează aproximativ 5 ore pe un singur 11 GB RTX 2080 Ti pentru un model cu 80M de parametri. Un 4090 este cu câteva generații mai nou, dar platforma alocă 100,000 de pași, astfel încât fereastra se încadrează în același loc.
  • GR00T: fluxul de lucru de referință NVIDIA pentru generația N1.6 citează aproximativ 4 până la 8 ore pentru 20,000 de pași la batch 24 pe opt plăci L40S, și 2 până la 3 ore pentru 30,000 de pași la batch 16 pe o singură Ada 6000. Ajustarea fină a unui VLA de 3B pe o singură placă în câteva ore este normală, nu optimistă.
  • Pi0.5: openpi nu publică nicio cifră de timp real, dar publică pragul de 70 GB pentru o ajustare fină completă, ceea ce fixează placa și, prin urmare, rata.

Merită să ne oprim asupra numărului pe care nu îl plătiți. Lucrarea GR00T N1 raportează aproximativ 50,000 de ore GPU H100 pentru a preantrena modelul 2.2B, pe un cluster de până la 1024 de GPU-uri, la o dimensiune a batch-ului de preantrenare de 16,384 pentru 200,000 de pași de gradient. La 1.34 până la 2.34 USD pe oră, măsurat mai sus, aceasta înseamnă aproximativ 67,000 până la 117,000 USD de putere de calcul închiriată. Lucrarea SmolVLA estimează proiectul său la aproximativ 30,000 de ore GPU pe 481 de seturi de date comunitare, 22.9K episoade și 10.6M cadre. Moșteniți toate acestea la prețul unei descărcări; cei 8 USD ai dumneavoastră cumpără ultimii 20,000 de pași. De ce sunt construite astfel VLA-urile acoperă această diviziune.

Brațul: un cost unic care eclipsează factura GPU

O rulare de antrenament costă mai puțin decât prânzul. Robotul nu. De aceea SO-100 contează: este cel mai ieftin braț pe care îl suportă de fapt întregul învățare prin imitație set de instrumente.

BrațServomotoareTensiuneCost pieseSuport pe AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURbraț complet, de referință
SO-101Feetech STS32157.4 V130 to 170 EURcomplet
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURcompatibil
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURcompatibil

Lista de materiale din depozitul SO-ARM100 este mai granulară și merită verificată în funcție de regiunea dumneavoastră: lista sa Piese pentru două brațe totalizează 229.88 USD sau 226.30 EUR pentru o configurație lider plus urmăritor, iar lista sa Piese pentru un braț urmăritor totalizează 121.94 USD sau 124.30 EUR. Șase servomotoare STS3215 la 13.89 USD fiecare reprezintă 83.34 din cei 121.94, deci servomotoarele sunt brațul. La 1 până la 3 USD per rulare SmolVLA sau ACT, o pereche de brațe valorează între 77 și 230 de rulări de antrenament. Dacă încă alegeți, SO-100 versus SO-101 este comparația care contează, deoarece cele două sunt suficient de apropiate încât decizia se referă la disponibilitate, mai degrabă decât la capacitate.

7.4 V, nu 12 V

STS3215 este livrat într-o variantă de 7.4 V și una de 12 V; depozitul menționează că piesa de 12 V necesită și o sursă de alimentare de 12 V 5 A în loc de cea de 5 V, deci cele două nu sunt interschimbabile. Alimentarea servomotoarelor de 7.4 V cu 12 V le distruge, iar șase servomotoare reprezintă două treimi din costul pieselor unui braț urmăritor. Verificați eticheta fiecărui servomotor înainte de prima pornire. Dacă servomotoarele se comportă deja ciudat: servomotorul nu răspunde, brațul se smucește apoi se lasă.

Ore umane: rândul pe care nimeni nu-l include în foaia de calcul

Acesta este numărul care răstoarnă discuția despre costuri. Înregistrarea demonstrațiilor înseamnă o persoană care mișcă un braț robotic, câte un episod pe rând, în timp real. Nu există procesare în loturi și nici închiriere la secundă. Înregistratorul setul de date LeRobot vine cu setări implicite care simplifică aritmetica, toate trei confirmate în DatasetRecordConfig: 60 de secunde per episod, 60 de secunde pentru a reseta scena, 50 de episoade. Coloana de costuri de mai jos presupune 15 USD pentru o oră de muncă a unei persoane, ceea ce este o presupunere, nu o valoare a platformei. Înlocuiți cu propria rată; raportul este esențial.

  1. 1
    Înregistrați setul de date cu setările implicite pentru care veți fi de fapt facturat

    Aceasta este lerobot 0.6.1, versiunea de pe PyPI începând cu 3 august 2026. Rețineți forma CLI: înregistrarea se realizează prin punctul de intrare al consolei lerobot-record (lerobot.scripts.lerobot_record), nu prin vechea cale a modulului python -m lerobot.scripts.record. AY-Robots vizează 0.5.1, iar pachetul 0.5.1 declară aceleași puncte de intrare lerobot-record și lerobot-train, deci forma de mai jos este stabilă pentru ambele. Cele trei flag-uri de temporizare sunt setările implicite upstream, deci aceasta este și comanda pe care o presupune aritmetica din tabelul următor.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Verificați ce ați înregistrat înainte de a închiria un singur minut de GPU

    Inspectarea unui set de date costă zero USD pe oră. Descoperirea aceleiași probleme dintr-o curbă de pierdere costă 2.00 USD pe oră pe nivelul H100 și vă anunță cu patru ore întârziere. Încărcați setul de date și examinați-l în vizualizatorul LeRobot, sau navigați în directorul de seturi de date AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Antrenați și asigurați-vă că punctul de control supraviețuiește pod-ului

    O mașină închiriată este temporară prin definiție, așa că scrieți punctele de control undeva durabil în timpul rulării. Două flag-uri decid dacă păstrați ceea ce ați plătit. --save_freq are o valoare implicită de 20.000 de pași, deci o rulare SmolVLA implicită de 20.000 de pași scrie primul său punct de control când rularea este deja terminată; reduceți-l înainte de a închiria ceva întreruptibil. --save_checkpoint_to_hub necesită --policy.repo_id și nu există în lerobot 0.5.1, deci pe acea versiune copiați singur directorul de ieșire de pe mașină. Dimensiunea lotului de mai jos este exemplul din documentația upstream; formularul AY-Robots trimite 2 pentru SmolVLA și scrie în stocarea de obiecte pe măsură ce apar punctele de control.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpisoadeÎnregistrare la 60 sResetare la 60 sTimp realPlus 20 la sută reînregistrăriLa 15 USD pe oră umană
30, the SmolVLA minimum30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, the other four minimums50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, a comfortable dataset100 min100 min3 h 20 min4 h 00 minabout 60 USD

Comparați coloana din dreapta cu costurile de rulare de 1 până la 12 USD. La această rată estimată, un set de date de 50 de episoade costă de două până la șapte ori mai mult pentru a fi înregistrat decât pentru a fi antrenat, înainte de calibrare, configurarea camerei și episoadele pe care le aruncați. De aceea are o valoare monetară directă. Ghidul lerobot sugerează cel puțin 50 de episoade cu 10 pe locație de obiect; documentația SmolVLA raportează că o versiune de 25 de episoade a aceleiași sarcini nu a fost suficientă.

Unde dispar de fapt banii

1. Rulări pe date care nu ar fi funcționat niciodată

O rulare GR00T de 20.000 de pași pe un set de date cu două fluxuri de cameră inversate costă la fel ca una pe un set de date curat, durează același timp și produce o curbă de pierdere care arată bine. Eșecul apare pe braț, ore mai târziu. sunt facturate la oră, iar diagnosticul este facturat în zile. Două simptome demne de reținut: înseamnă de obicei că observațiile nu conțin ceea ce este necesar pentru sarcină, și înseamnă că setul de date a avut mai puțină variație decât ați crezut.

2. Plătirea prețurilor de model fundamental pentru o sarcină cu cameră fixă

ACT are aproximativ 80M de parametri și a fost proiectat să se antreneze de la zero pe 50 de demonstrații ale unei singure sarcini. GR00T N1.7 are aproximativ 3B de parametri cu un backbone pre-antrenat. Pentru o cameră fixată, o masă fixă și un singur obiect, modelul de 80M ajunge frecvent la rezultat, rulează la aproximativ 20 ms per pas de acțiune în loc de 152 ms și costă 1 până la 3 USD per rulare în loc de 4 până la 12. Cheltuiți 3 USD pentru a afla dacă modelul ieftin funcționează înainte de a cheltui 12 USD pe cel scump. ACT versus SmolVLA și GR00T N1.7 versus Pi0.5 arată unde fiecare încetează să mai fie răspunsul corect; arena de modele are 85 de modele și 332 de rezultate de benchmark.

3. GPU-ul pe care l-ați uitat

Cea mai ieftină greșeală de prevenit și cea mai comună de făcut. O instanță pornită vineri pentru a depana ceva facturează pe tot parcursul weekendului la aceeași rată ca o rulare reală.

CardRata mediană în instantaneuInactiv timp de 24 hInactiv timp de 7 zileAceasta valorează
RTX 40900.32 USD/h7.68 USD53.76 USDaproximativ 27 de rulări SmolVLA sau ACT la 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDaproximativ 12 rulări GR00T la 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDaproximativ 38 de rulări GR00T la 8 USD

Pe AY-Robots, această eroare este eliminată pentru inferență: podurile provizionate de API-ul de inferență conțin un watchdog de inactivitate și se autodistrug după o perioadă de inactivitate. Dacă închiriați singur placa, acel watchdog este memento-ul dvs. din calendar.

4. Plătind de două ori pentru același răspuns

Punctul de intrare pentru fine-tuning al GR00T este un CLI tyro care nu expune nicio valoare seed. Aceasta nu este o limitare a platformei, ci a instrumentului upstream: nu există un câmp seed în gr00t/configs/finetune_config.py, iar sfaturile de antrenament ale depozitului avertizează că rulările variază cu 5 până la 6 procente deoarece augmentările de imagine sunt non-deterministice. lerobot utilizează implicit seed 1000 atât în 0.5.1, cât și în 0.6.1, astfel încât rulările ACT, SmolVLA și Pi0.5 pot fi cel puțin reluate de la aceeași inițializare și ordine a datelor. Aceasta nu este o promisiune de ponderi identice la nivel de bit pe un GPU, dar este diferența dintre o reluare și un nou experiment. Dacă o rulare GR00T produce o politică funcțională și nu ați păstrat checkpoint-ul, plătiți prețul integral pentru un rezultat care poate diferi cu mai mult decât diferența pe care o urmăreați. Există o a doua modalitate de a pierde un checkpoint pentru care ați plătit: CLI-ul utilizează implicit --save-total-limit 5, documentat ca numărul maxim de checkpoint-uri păstrate înainte ca cele mai vechi să fie șterse. Stocarea costă cenți; o reluare costă între 4 și 12 USD și șase ore.

Capacitatea întreruptibilă costă jumătate de preț și îți va opri rularea

Plafoanele de licitație de mai sus reprezintă o fracțiune din rata la cerere și vast.ai afirmă că sistemul de licitație poate reduce costurile clienților cu cincizeci la sută sau mai mult. Dezavantajul, în propriile cuvinte: o instanță întreruptibilă poate fi întreruptă în orice moment dacă un alt utilizator licitează mai mult sau dacă o închiriere la cerere este creată pentru aceleași resurse, iar acea întrerupere "oprește toate procesele care rulează". La cerere are întotdeauna prioritate. Este bine pentru o rulare care scrie un punct de control la fiecare câteva sute de pași, o pierdere totală pentru una care scrie la final, ceea ce este exact ceea ce îți oferă setările implicite: Isaac-GR00T CLI scrie la fiecare --save-steps (implicit 1000), dar --save_freq de la lerobot are o valoare implicită de 20.000 de pași, astfel încât o rulare implicită SmolVLA salvează un punct de control o singură dată, la linia de sosire. Reduceți-o, sau nu licitați. Formularul de antrenament AY-Robots expune parametrul GR00T ca saveSteps.

Închirierea plăcii pe cont propriu
Avantaje
  • Cea mai mică rată orară existentă.
  • Control complet asupra imaginii, versiunii CUDA, reviziei lerobot sau Isaac-GR00T și a fiecărui flag.
  • Licitația întreruptibilă reduce la jumătate rata dacă rularea ta salvează puncte de control suficient de des pentru a supraviețui unei întreruperi.
  • Nimic nu este abstractizat, așa că atunci când o rulare se comportă ciudat poți vedea de ce.
Compromisuri
  • Configurarea este facturată la tarifele GPU: driverele, dependențele, punctul de control de bază de mai mulți gigabytes și descărcarea setului de date costă toate la fel pe oră ca și antrenamentul.
  • O instanță întreruptibilă depășită la licitație este întreruptă și procesele sale sunt oprite. O rulare nesalvată înseamnă bani arși, iar setarea implicită lerobot scrie primul său punct de control la pasul 20.000.
  • Nimic nu distruge pod-ul pentru tine. Tabelul de inactivitate de mai sus reprezintă factura pentru uitare.
  • Oferta pentru plăci complete de 80 GB este redusă: două oferte A100 80 GB și cinci oferte H100 80 GB de plăci complete în această lectură. Lista se modifică, de asemenea, astfel încât cel mai mic preț listat și prețul pe care îl poți închiria efectiv nu sunt același număr.
  • Fiecare oră petrecută pe infrastructură este o oră nepetrecută înregistrând episoadele care decid dacă politica funcționează.

A face singur versus a lăsa platforma să închirieze placa

Tu alegi mașina, construiești mediul și distrugi pod-ul. Tariful orar este cel de piață menționat mai sus; orice altceva este timpul tău.

  1. Găsește o placă ce corespunde VRAM-ului necesar modelului: 24 GB pentru ACT și SmolVLA, 80 GB pentru GR00T și Pi0.5.
  2. Închiriază la cerere dacă rularea nu poate supraviețui unei pauze, sau întreruptibil dacă salvează puncte de control des.
  3. Instalează setul de instrumente (toolchain): lerobot pentru ACT, SmolVLA și Pi0.5, depozitul Isaac-GR00T cu propriul său lansator tyro pentru GR00T.
  4. Convertește setul de date dacă este necesar. Un set de date LeRobot v3.0 blochează încărcătorul GR00T și trebuie convertit la v2.1.
  5. Lansează, urmărește pierderea (loss), împinge punctele de control într-un loc durabil pe măsură ce sunt scrise.
  6. Distruge instanța, apoi verifică dacă ai distrus-o.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Punctul de intrare actual pentru fine-tuning Isaac-GR00T, corespunzător comenzii din README-ul depozitului. Acest CLI nu are un flag de seed, deci rulările GR00T nu sunt reproductibile bit-cu-bit.

Cost realist pentru o rulare GR00T: 3 până la 6 ore pe un H100 80 GB la 1.34 până la 2.34 USD pe oră înseamnă 4 până la 14 USD, plus 20 până la 40 de minute de configurare care se taxează de asemenea, plus timpul tău.

Ce taxează platforma și cum alege placa

Logica este în mod deliberat plictisitoare. Fiecare model din catalog, declară un nivel de GPU; backend-ul preia VRAM-ul necesar și închiriază o placă potrivită pe aceeași piață spot măsurată mai sus. De aceea costul cotat este o plajă, nu un preț. GR00T și Pi0.5 sunt disponibile doar în cloud aici din cauza limitelor inferioare de 40 GB și 70 GB. SmolVLA și ACT rulează și local pe propria placă de 24 GB, unde costul cloud este zero și electricitatea este problema dumneavoastră.

Pagina de prețuri AY-Robots care arată costul unei rulări de antrenament și al accesului la platformă
Pagina de prețuri. Cifrele per-rulare urmăresc piața spot, nu un preț fix de listă.

O setare merită o avertizare. Acumularea de gradient se aplică într-adevăr pentru ambele variante GR00T, astfel încât creșterea acesteia cumpără un batch efectiv mai mare pe aceeași placă. Pentru Pi0.5 și SmolVLA nu se aplică deloc: lerobot 0.5.1 nu are o opțiune de acumulare de gradient în configurația sa de antrenament, deci setarea câmpului la 16 nu costă nimic și nu aduce nimic. Dacă o sarcină în așteptare nu pornește niciodată, pagina despre blocarea în coadă acoperă ce trebuie verificat; dacă setul de date este respins înainte de începerea rulării, este aproape întotdeauna problema formatului v3.0.

Limita pe care această platformă nu o rezolvă: latența

Un GPU închiriat care servește politica dvs. prin internetul public adaugă runde de comunicare la o buclă de control care este deja de 20 până la 485 ms per pas de acțiune. Bun pentru operațiuni lente de tip pick-and-place, nu pentru mișcări reactive rapide. Inferența în cloud evaluează bine un punct de control și rulează prost manipularea în producție: dacă sarcina necesită viteză, calculul trebuie să fie lângă servomotoare, iar acesta este un cost pe care acest articol nu-l poate face să dispară. Vezi latența inferenței.

Un buget detaliat pentru o primă politică funcțională

Toate cele patru linii împreună, pornind de la zero. Totalul GPU presupune 3 până la 5 rulări: prima dovedește că pipeline-ul funcționează, a doua expune o problemă de date, a treia sau a patra este cea pe care o păstrați.

LinieCale economicăCale confortabilă
BrațSO-100 doar follower, 121.94 USD în lista de materialeleader plus follower, 229.88 USD în lista de materiale
ModelSmolVLA sau ACT, nivel 24 GBGR00T N1.7, nivel A100 80 GB sau H100
Episoade înregistrate30, minimul SmolVLA50 până la 100
Timp uman pentru înregistrareaproximativ 1 h 12 min2 până la 4 ore
Costul unei rulări1 până la 3 USD4 până la 12 USD
Rulări înainte de a funcționa3 până la 53 până la 5
Cheltuieli totale GPU3 până la 15 USD12 până la 60 USD
Cea mai mare linie pe facturăbrațul, apoi timpul dvs.brațul, apoi timpul dvs.

Modelul se menține la această dimensiune de robot: calculul este o eroare de rotunjire, hardware-ul este un cost real unic, orele umane sunt cheltuiala recurentă. Pentru a testa jumătatea de antrenament înainte de a cumpăra ceva, vă permit să comparați modele și să închiriați un GPU fără un braț, iar este un SO-100 fizic pe care îl puteți controla în browser fără înregistrare. Pentru întregul flux de lucru cap la coadă, acoperă configurarea, și antrenamentul, iar este versiunea scurtă.

The AY-Robots training matrix with five policies as rows and four robot arms as columns, every cell linking to a specific training guide
Matricea /train: rând pentru bugetul dvs., coloană pentru brațul dvs., celulă pentru ghidul cu setările implicite și costul acelei perechi.
Cât costă o rulare completă de fine-tuning VLA?

Aproximativ 4 până la 12 USD pentru GR00T N1.7, GR00T N1.5 sau Pi0.5 pe nivelul A100 80 GB sau H100 (3 până la 6 ore la 1.20 până la 2.00 USD pe oră), și aproximativ 1 până la 3 USD pentru SmolVLA sau ACT pe nivelul RTX 4090 (2 până la 5 ore la 0.30 până la 0.60 USD pe oră). Închirierea plăcii dvs. se încadrează în același interval odată ce timpul de configurare este luat în considerare, deoarece se facturează la rata de antrenament.

Merită să plătiți pentru un H100 în detrimentul unui A100 80 GB?

Pentru o singură politică SO-100, de obicei nu. Ambele depășesc pragul de memorie necesar pentru GR00T și Pi0.5, iar la data de 23 august 2026, un A100 80 GB complet a început de la 0.44 USD pe oră față de 1.34 pentru un H100 80 GB. H100 termină mai repede, deci o parte din cost se recuperează prin mai puține ore, dar totalul este totuși mai mare pentru o rulare atât de mică. Argumentul real pentru H100 este disponibilitatea: cinci oferte de H100 80 GB pe acea piață față de două A100 80 GB, iar o placă pe care nu o puteți închiria nu are preț.

Câte rulări sunt necesare înainte ca o politică să funcționeze efectiv?

Planificați trei până la cinci. Prima dovedește că fluxul de lucru este conectat corect. A doua expune de obicei o problemă a setului de date, cum ar fi un flux de cameră care s-a oprit pe parcurs. A treia sau a patra este cea pe care o păstrați.

Pot antrena SmolVLA sau ACT pe propriul meu GPU în loc să închiriez?

Da. Ambele sunt suportate local pe AY-Robots și ambele se încadrează confortabil în 24 GB; lucrarea originală ACT a antrenat modelul său de 80M în aproximativ 5 ore pe un RTX 2080 Ti de 11 GB. GR00T și Pi0.5 sunt doar în cloud aici, deoarece pragurile de fine-tuning documentate de furnizori sunt de 40 GB și 70 GB, iar cea mai mare placă de consum de pe piață este RTX 5090 de 32 GB.

De ce același număr de pași costă sume diferite la modele diferite?

Pașii nu sunt comparabili între politici. ACT utilizează implicit 100.000 de pași la batch 8 pe o placă de 24 GB; GR00T N1.5 utilizează implicit 2.000 de pași la batch 1 cu acumulare de gradient 16 pe o placă de 80 GB. Factura este orele înmulțite cu rata plăcii pe care amprenta de memorie vă forțează să o utilizați, nu contorul de pași.

Vedeți cât ar costa rularea dvs. înainte de a o începe

Fiecare dintre cele cinci politici listează nivelul GPU, timpul de rulare și prețul per rulare, iar backend-ul de antrenament închiriază placa de pe aceeași piață spot pe care au fost măsurate aceste numere.

Verificați prețurile

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started