AY-Robots izmaksu tabula, parādot, kurš GPU nepieciešams katrai no piecām politikām, tipisko izpildes laiku un cenu par izpildi, un cik daudz epizožu ir nepieciešams, pirms politika kļūst noderīga
VLA apmācībaGPU izmaksasSO-100precizēšanarobotu mācīšanāsbudžeta plānošana

VLA apmācības izmaksas: Cik patiesībā maksā precizēšanas palaišana

AY-Robots ResearchAugust 23, 202623 min lasīšanai

Reālās GPU tūlītējā tirgus cenas, cik ilgi darbojas katra no piecām politikām, cik maksā roka un demonstrācijas, un četras vietas, kur nauda klusi pazūd.

Īsā versija

  • Izpilde A100 80 GB vai H100 līmenī aizņem 3 līdz 6 stundas un maksā aptuveni 4 līdz 12 USD. RTX 4090 līmenī tas ir 2 līdz 5 stundas un aptuveni 1 līdz 3 USD.
  • Mērīts vietnē vast.ai 2026. gada 23. augustā plkst. 13:44 UTC: pilna RTX 4090 pēc pieprasījuma par 0.13 līdz 0.38 USD/h, A100 80 GB par 0.44 līdz 0.67, H100 80 GB par 1.34 līdz 2.34. Pilnas 80 GB kartes ir retas, attiecīgi divi un pieci vienas kartes piedāvājumi.
  • GPU ir lētākā pozīcija. SO-ARM100 materiālu saraksts nosaka līdera un sekotāja pāri par 229.88 USD, kas ir 77 līdz 230 izpildes 24 GB līmenī.
  • Divas stundas, kurās persona ieraksta 50 epizodes, maksā vairāk nekā apmācības izpilde, ko šīs epizodes baro.
  • Nauda pazūd četrās vietās: izpildes ar bojātiem datiem, 3B modeļi uzdevumiem, ko apstrādā 80M politika, GPU, ko neviens nav iznīcinājis, un rezultātu atkārtotas izpildes, ko neizdevās saglabāt.
  • AY-Robots kartes izmēru nosaka pēc modeļa nepieciešamās VRAM un iznomā to tajā pašā tūlītējā tirgū, tāpēc izpildes izmaksas ir tirgus izmaksas.

Rēķinam ir četras pozīcijas, un GPU ir mazākā

Kad cilvēki jautā, cik maksā precīza redzes-valodas-darbības modeļa precizēšana SO-100, viņi gandrīz vienmēr domā GPU nomu. Tas ir skaitlis, kas parādās kā maksa kartē, tāpēc tas šķiet reāls. Tas ir arī, ar lielu starpību, mazākais no četriem skaitļiem, kas nosaka, cik patiesībā maksā strādājoša politika.

PozīcijaKas tas irTipiskais apjoms vienai strādājošai politikai
GPU laikskartes noma izpildei1 līdz 12 USD par izpildi, un jūs veiksiet 3 līdz 5
Robotsservomotori, drukāts rāmis, kameras, kabeļi, barošanavienreizēji, 110 līdz 500 EUR par roku
Cilvēkstundaspersona, kas vada roku, lai ierakstītu demonstrācijas1 līdz 4 stundas par datu kopu, atkārtoti par katru uzdevumu
Zudumislikti dati, pārmērīgi lieli modeļi, aizmirsti podineierobežoti, un vienīgā pozīcija, ko jūs kontrolējat

Tālāk norādītie apmācības laiki nāk no piecu modeļu pašu publikācijām un repozitorijiem, aparatūras izmaksas no publicētajiem materiālu sarakstiem, platformas numuri no AY-Robots politikas katalogs un cenu lapa. Ja platforma nepalīdz, šis raksts to norāda.

Cik patiesībā maksā GPU stunda tūlītējā tirgū

Nav vienas cenas par A100 stundu. Tādos tirgos kā vast.ai katrs saimnieks nosaka savu likmi, un apmācības palaišana ko palaižat, nonāk uz tās mašīnas, kas tajā sekundē ir lēta un brīva. Godīga atbilde ir sadalījums. Lūk, tas ir, mērīts 2026. gada 23. augustā plkst. 13:44 UTC: atsevišķas pilnas kartes, pēc pieprasījuma, filtrētas pēc reālās VRAM.

Kartevast.ai pēc pieprasījuma USD/h (zema / vidēja / augsta)Pilnas kartes piedāvājumivast.ai minimālā cenaRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74netiek piedāvāts
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99netiek piedāvāts
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 kā telpa
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 kā galapunkts
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19netiek piedāvāts
Kā tika iegūts šis momentuzņēmums un kas tas nav

Pēc pieprasījuma piedāvājumi vienai pilnai GPU (gpu_frac == 1.0) no vast.ai publiskā pakotņu API, kam nav nepieciešams konts, filtrēti pēc gpu_ram, lai tikai īstas 80 GB kartes nonāktu 80 GB rindās. Šis filtrs ir svarīgs: šajā lasījumā visi trīs vienas kartes A100 SXM4 piedāvājumi bija 40 GB daļas, tāpat kā divi no četriem A100 PCIE piedāvājumiem, tāpēc to apvienošana vienā "A100" rindā būtu samazinājusi šeit norādīto cenu uz pusi. Hugging Face kolonna apvieno divus produktus: 2.50 USD/h ir Nvidia A100 - large Spaces aparatūra un 4.50 USD/h ir viena H100 80 GB zem Inference Endpoints, ko Spaces nepiedāvā. Mediānas jāuztver kā indikatīvas: A100 80 GB rinda balstās uz diviem piedāvājumiem un H100 rinda uz pieciem, un identisks vaicājums 36 sekundes vēlāk atgrieza atšķirīgu 4090 skaitu un atšķirīgu augstāko cenu trīs no piecām rindām. RunPod saraksta cenas ir stabilāks skaitlis, ar ko rēķināties.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Precīzs vaicājums, kas ir pamatā iepriekšējai tabulai, palaists divreiz, rakstot šo sadaļu. Palaidiet to pirms uzticaties jebkuram GPU cenu rakstam, ieskaitot šo.
AY-Robots izmaksu tabula, kas parāda, kura GPU ir nepieciešama katrai politikai, tipisko izpildes laiku un cenu par izpildi, kā arī to, cik daudz epizožu ir nepieciešams, pirms politika kļūst noderīga.
Izmaksu tabula vietnē /try: karte, izpildes laiks, cena par izpildi un minimālais epizožu skaits katrai politikai.

Kāpēc 3B modeļi nevar izmantot lēto karti

4090 stunda un H100 80 GB stunda atšķiras aptuveni sešas reizes, ņemot vērā iepriekš minētās mediānas. Tas, kas liek izmantot dārgo karti, nav ātrums, bet gan atmiņa. openpi nosaka minimālo prasību pilnai Pi0.5 precizēšanai pie 70 GB, un NVIDIA iesaka 40 GB vai vairāk GR00T. Ņemiet vērā, kas GR00T skaitlis nav. Tā precizēšanas konfigurācija pēc noklusējuma iesaldē valodu modeli un vizuālo kodētāju (tune_llm un tune_visual ir False, projektors un difūzijas galva True), tāpēc katalogā ir uzskaitīti aptuveni 40 M apmācīti parametri no 3 B. 40 GB nav optimizatora stāvoklis 3 B svariem, tas ir iesaldētais pamats plus aktivizācijas. Samazināta apjoma varianti prasa mazāk: openpi LoRA ceļš prasa 22.5 GB un nosauc 4090, un NVIDIA Isaac Lab Arena darbplūsma uzskaita 24 GB viena GPU opciju GR00T pēcapmācībai. Platforma balstās uz minimālajām prasībām, ko katrs piegādātājs publicē par konfigurāciju, ko tas faktiski izmanto. pi0 plūsmas saskaņošanas apraksts izskaidro, no kurienes nāk šis plūsmas saskaņošanas nospiedums.

UzdevumsAtmiņa, ko prasa augšupējais projektsAvots
pi0 / pi0.5 secinājumimore than 8 GB, example RTX 4090openpi
pi0 / pi0.5 LoRA precizēšanamore than 22.5 GB, example RTX 4090openpi
pi0 / pi0.5 pilna precizēšanamore than 70 GB, example A100 80 GB or H100openpi
GR00T N1.7 secinājumi1 GPU with 16 GB or moreIsaac-GR00T
GR00T N1.7 precizēšana40 GB or more recommended, H100 or L40 nodesIsaac-GR00T
GR00T precizēšana, ko tā apmācaprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
GR00T pēcapmācība, samazināta1 GPU with 24 GB, language model frozenIsaac Lab Arena
SmolVLA precizēšanasingle A100 for the reference 20,000-step runlerobot docs
ACT apmācībaa single 11 GB RTX 2080 TiACT paper

Šī tabula ir iemesls, kāpēc platforma sadala piecus modeļus divos līmeņos. GR00T N1.7, GR00T N1.5 un Pi0.5 tiek izmantoti ar A100 80 GB vai H100, jo to pieprasa piegādātāji. SmolVLA un ACT tiek izmantoti ar RTX 4090 vai jebkuru 24 GB karti, jo tas ir patiešām pietiekami.

Dienu apēdošās lamatas: lētas kartes īre lielam modelim

GR00T vai Pi0.5 palaišana uz 24 GB kartes neizdodas ne uzreiz. Tā lejupielādē bāzes kontrolpunktu, izveido datu kopas indeksu, sāk pirmo pārsūtīšanu un pēc dažiem simtiem soļu apstājas ar CUDA atmiņas trūkuma kļūdu. Jūs samaksājāt par lejupielādi un iestatīšanu, bet neko nesaņēmāt. Labojumi: atmiņas trūkums apmācības laikā.

Cik ilgi katrs no pieciem modeļiem faktiski darbojas

Izpildes laiks ir otra izmaksu puse: 2.00 USD stundā ir nenozīmīgi, ja darbs ilgst 40 minūtes, un postoši, ja tas ilgst 40 stundas. Šīs ir noklusējuma vērtības, ko AY-Robots patiešām nosūta apmācītājam, ar izpildes logu un izmaksām katram līmenim.

PolitikaGPU līmenisNoklusējuma maksimālais soļu skaitsNoklusējuma partija (grad. akum.)Izpildes logsIzmaksas par izpildi
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Salīdzinājuma tabula piecām apmācāmām politikām AY-Robots, kas parāda parametru skaitu, nepieciešamo GPU, secinājumu latentumu un minimālo epizožu skaitu
Piecas politikas blakus: parametri, GPU līmenis, latentums uz darbības soli, minimālais epizožu skaits.

No kurienes nāk šie izpildes logi augšup pa straumi

  • SmolVLA: lerobot dokumentācija norāda, ka 20 000 soļu aizņem aptuveni 4 stundas uz vienas A100 kartes. Platforma veic tos pašus 20 000 soļus lētākajā 24 GB līmenī, tādēļ tiek norādīts logs, nevis fiksētas 4 stundas.
  • ACT: oriģinālajā ALOHA rakstā tiek ziņots par aptuveni 5 stundām uz vienas 11 GB RTX 2080 Ti kartes 80M parametru modelim. 4090 ir vairākas paaudzes jaunāka, taču platforma paredz 100 000 soļu, tāpēc logs nonāk tajā pašā vietā.
  • GR00T: NVIDIA atsauces darbplūsma N1.6 paaudzei norāda aptuveni 4 līdz 8 stundas 20 000 soļiem ar partiju 24 uz astoņām L40S kartēm, un 2 līdz 3 stundas 30 000 soļiem ar partiju 16 uz vienas Ada 6000 kartes. Viena kartes smalkā pielāgošana 3B VLA dažu stundu laikā ir normāla, nevis optimistiska.
  • Pi0.5: openpi nepublicē reālo laika rādītāju, taču publicē 70 GB minimālo prasību pilnai smalkai pielāgošanai, kas nosaka karti un līdz ar to arī ātrumu.

Ir vērts apstāties pie skaitļa, par kuru nemaksājat. GR00T N1 raksts ziņo par aptuveni 50 000 H100 GPU stundām, lai iepriekš apmācītu 2.2B modeli, klasterī ar līdz pat 1024 GPU, ar iepriekšējas apmācības partijas izmēru 16 384 200 000 gradienta soļiem. Pie iepriekš minētās 1.34 līdz 2.34 USD par stundu, tas ir aptuveni 67 000 līdz 117 000 USD nomātas skaitļošanas jaudas. SmolVLA raksts novērtē savu projektu aptuveni 30 000 GPU stundās, izmantojot 481 kopienas datu kopas, 22.9K epizodes un 10.6M kadrus. Jūs to visu mantojat par lejupielādes cenu; jūsu 8 USD nopērk pēdējos 20 000 soļus. Kāpēc VLA tiek veidoti šādā veidā aptver šo sadalījumu.

Roka: vienreizējas izmaksas, kas pārsniedz GPU rēķinu

Viena apmācības sesija maksā mazāk nekā pusdienas. Robots – ne. Tāpēc SO-100 ir svarīgs: tā ir lētākā roka, ko visa imitācijas mācīšanās rīku ķēde patiešām atbalsta.

RokaServomotoriSpriegumsDetaļu izmaksasAtbalsts AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURpilna, atsauces roka
SO-101Feetech STS32157.4 V130 to 170 EURpilna
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURsaderīga
LeKiwiFeetech STS3215 roka, riteņu bāze7.4 V roka, 12 V bāze400 to 500 EURsaderīga

SO-ARM100 repozitorija augšupējais materiālu saraksts ir detalizētāks un ir vērts to pārbaudīt atbilstoši jūsu reģionam: tā Detaļas divām rokām saraksts kopā veido 229.88 USD vai 226.30 EUR līdera un sekotāja konfigurācijai, un tā Detaļas vienai sekotāja rokai saraksts kopā veido 121.94 USD vai 124.30 EUR. Seši STS3215 servomotori par 13.89 USD katrs veido 83.34 no šiem 121.94, tātad servomotori ir roka. Pie 1 līdz 3 USD par SmolVLA vai ACT sesiju, viens roku pāris ir vērts starp 77 un 230 apmācības sesijām. Ja jūs vēl joprojām izvēlaties, SO-100 pret SO-101 ir salīdzinājums, kas ir svarīgs, jo abi ir pietiekami līdzīgi, lai lēmums būtu par pieejamību, nevis spējām.

7.4 V, nevis 12 V

STS3215 tiek piegādāts 7.4 V un 12 V variantā; repozitorijā norādīts, ka 12 V detaļai nepieciešams arī 12 V 5 A barošanas avots, nevis 5 V, tāpēc abi nav savstarpēji aizstājami. Pievadot 12 V 7.4 V servomotoriem, tie tiek sabojāti, un seši servomotori veido divas trešdaļas no sekotāja rokas detaļu izmaksām. Pirms pirmās ieslēgšanas pārbaudiet etiķeti uz katra servomotora. Ja servomotori jau uzvedas dīvaini: servomotors nereaģē, roka raustās un tad nokarājas.

Cilvēkstundas: rinda, ko neviens neievieto izklājlapā

Šis ir skaitlis, kas apgriež izmaksu diskusiju kājām gaisā. Demonstrāciju ierakstīšana ir cilvēks, kas reāllaikā pārvieto robota roku, pa vienai epizodei. To nevar apstrādāt partijās un nevar iznomāt pa sekundēm. LeRobot datu kopa ierakstītājs tiek piegādāts ar noklusējuma iestatījumiem, kas atvieglo aprēķinus, visi trīs apstiprināti DatasetRecordConfig: 60 sekundes uz epizodi, 60 sekundes, lai atiestatītu ainu, 50 epizodes. Zemāk esošajā naudas kolonnā tiek pieņemts 15 USD par stundu kāda cilvēka laika, kas ir pieņēmums, nevis platformas skaitlis. Aizstājiet ar savu likmi; attiecība ir būtiska.

  1. 1
    Ierakstiet datu kopu ar noklusējuma iestatījumiem, par kuriem jums faktiski tiks izrakstīts rēķins

    Šī ir lerobot 0.6.1, versija PyPI no 2026. gada 3. augusta. Ņemiet vērā CLI formu: ierakstīšana notiek caur lerobot-record konsoles sākumpunktu (lerobot.scripts.lerobot_record), nevis veco python -m lerobot.scripts.record moduļa ceļu. AY-Robots mērķē uz 0.5.1, un 0.5.1 pakotne deklarē tos pašus lerobot-record un lerobot-train sākumpunktus, tāpēc zemāk redzamā forma ir stabila abām versijām. Trīs laika iestatījumu karodziņi ir augšupējie noklusējuma iestatījumi, tāpēc šī ir arī komanda, ko pieņem aprēķini nākamajā tabulā.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Apskatiet ierakstīto, pirms iznomājat kaut vienu GPU minūti

    Datu kopas pārbaude maksā nulli USD stundā. Tās pašas problēmas atklāšana no zudumu līknes maksā 2.00 USD stundā H100 līmenī un paziņo jums četras stundas vēlāk. Ievietojiet datu kopu un pārbaudiet to LeRobot skatītājā, vai pārlūkojiet AY-Robots datu kopu direktoriju.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Apmāciet un pārliecinieties, ka kontrolpunkts pārdzīvo podu

    Iznomāta mašīna pēc definīcijas ir pagaidu, tāpēc izpildes laikā saglabājiet kontrolpunktus kaut kur izturīgā vietā. Divi karodziņi nosaka, vai jūs saglabājat to, par ko maksājāt. --save_freq noklusējuma vērtība ir 20 000 soļu, tāpēc noklusējuma 20 000 soļu SmolVLA izpilde ieraksta savu pirmo kontrolpunktu, kad izpilde jau ir beigusies; samaziniet to, pirms iznomājat kaut ko pārtraucamu. --save_checkpoint_to_hub prasa --policy.repo_id un nepastāv lerobot 0.5.1, tāpēc šajā versijā jums pašam ir jākopē izvades direktorijs no mašīnas. Zemāk norādītais partijas lielums ir augšupējā dokumenta piemērs; AY-Robots forma nosūta 2 SmolVLA un raksta uz objektu krātuvi, kad parādās kontrolpunkti.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpizodesIerakstīšana 60 sAtiestatīšana 60 sReālais laiksPlus 20 procenti atkārtotu ierakstuPie 15 USD par cilvēkstundu
30, SmolVLA minimums30 min30 min1 h 00 min1 h 12 minaptuveni 18 USD
50, pārējie četri minimumi50 min50 min1 h 40 min2 h 00 minaptuveni 30 USD
100, ērta datu kopa100 min100 min3 h 20 min4 h 00 minaptuveni 60 USD

Salīdziniet labo kolonnu ar 1 līdz 12 USD, ko maksā izpilde. Pie šīs pieņemtās likmes 50 epizožu datu kopas ierakstīšana maksā divas līdz septiņas reizes vairāk nekā apmācība, pirms kalibrēšanas, kameras iestatīšanas un izmestajām epizodēm. Tāpēc ir tieša dolāru vērtība. LeRobot ceļvedis iesaka vismaz 50 epizodes ar 10 katrā objekta atrašanās vietā; SmolVLA dokumentācija ziņo, ka 25 epizožu versija tai pašai uzdevumam nebija pietiekama.

Kur nauda patiesībā pazūd

1. Izpildes ar datiem, kas nekad nedarbotos

20 000 soļu GR00T izpilde ar datu kopu, kurā ir divas apmainītas kameras plūsmas, maksā tikpat, cik izpilde ar tīru datu kopu, aizņem to pašu laiku un rada zaudējumu līkni, kas izskatās labi. Kļūme parādās uz rokas, stundas vēlāk. tiek rēķināti pa stundām, un diagnostika tiek rēķināta pa dienām. Divi simptomi, ko vērts iegaumēt: parasti nozīmē, ka novērojumi nesatur to, kas nepieciešams uzdevumam, un nozīmē, ka datu kopai bija mazāka variācija, nekā jūs domājāt.

2. Maksāt pamata modeļa cenas par fiksētas kameras uzdevumu

ACT ir aptuveni 80M parametru un tika izstrādāts, lai apmācītu no nulles, izmantojot 50 vienas uzdevuma demonstrācijas. GR00T N1.7 ir aptuveni 3B ar iepriekš apmācītu mugurkaulu. Fiksētai kamerai, fiksētam galdam un vienam objektam 80M modelis bieži vien sasniedz mērķi, darbojas ar aptuveni 20 ms uz darbības soli, nevis 152 ms, un maksā no 1 līdz 3 USD par izpildi, nevis no 4 līdz 12. Iztērējiet 3 USD, lai noskaidrotu, vai lētais modelis darbojas, pirms tērējat 12 USD dārgajam. ACT pret SmolVLA un GR00T N1.7 pret Pi0.5 parāda, kur katrs pārstāj būt pareizā atbilde; modeļu arēna ir 85 modeļi un 332 etalonuzdevumu rezultāti.

3. GPU, ko aizmirsāt

Lētākā kļūda, ko novērst, un visbiežāk pieļautā. Instance, kas sākta piektdien, lai atkļūdotu kaut ko, tiek rēķināta visu nedēļas nogali ar tādu pašu likmi kā reāla izpilde.

KarteVidējā likme momentuzņēmumāDīkstāve 24 hDīkstāve 7 dienasTas ir vērts
RTX 40900.32 USD/h7.68 USD53.76 USDaptuveni 27 SmolVLA vai ACT izpildes par 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDaptuveni 12 GR00T izpildes par 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDaptuveni 38 GR00T izpildes par 8 USD

AY-Robots šī kļūme ir novērsta secinājumu veikšanai: podi, ko nodrošina secinājumu API, satur dīkstāves sargsuņa funkciju un iznīcina sevi pēc dīkstāves perioda. Ja karti nomājat pats, šis sargsuns ir jūsu kalendāra atgādinājums.

4. Maksāt divreiz par to pašu atbildi

GR00T smalkās pielāgošanas sākumpunkts ir tyro CLI, kas neatklāj sēklu. Tā nav platformas ierobežojums, tas ir augšupējais rīks: nav sēklas lauka gr00t/configs/finetune_config.py, un repozitorija pašu apmācības padomi brīdina, ka izpildes atšķiras par 5 līdz 6 procentiem, jo attēlu papildinājumi nav deterministiski. lerobot pēc noklusējuma izmanto sēklu 1000 gan 0.5.1, gan 0.6.1 versijās, tāpēc ACT, SmolVLA un Pi0.5 izpildes var vismaz atkārtoti palaist no tās pašas inicializācijas un datu secības. Tas nav solījums par bitu identiskiem svariem uz GPU, bet tā ir atšķirība starp atkārtotu palaišanu un jaunu eksperimentu. Ja GR00T izpilde rada politiku, kas darbojas, un jūs neesat saglabājis kontrolpunktu, jūs maksājat pilnu cenu par rezultātu, kas var atšķirties vairāk nekā atšķirība, ko jūs meklējāt. Ir otrs veids, kā zaudēt kontrolpunktu, par kuru esat maksājis: CLI pēc noklusējuma izmanto --save-total-limit 5, kas dokumentēts kā maksimālais saglabāto kontrolpunktu skaits pirms vecāko dzēšanas. Krātuve maksā centus; atkārtota palaišana ir 4 līdz 12 USD un sešas stundas.

Pārtraucamā jauda ir par puscenu un apturēs jūsu izpildi

Iepriekš minētās minimālās cenas ir daļa no pieprasījuma likmes, un vast.ai apgalvo, ka solīšanas sistēma var samazināt klientu izmaksas par piecdesmit procentiem vai vairāk. Āķis, pēc viņu pašu vārdiem: pārtraucamu instanci var apturēt jebkurā laikā, ja cits lietotājs piedāvā augstāku cenu vai tiek izveidots pieprasījuma nomas pakalpojums tiem pašiem resursiem, un šī pauze "aptur visus darbojošos procesus". Pieprasījums vienmēr ir prioritāte. Labi der izpildei, kas raksta kontrolpunktu ik pēc dažiem simtiem soļu, bet pilnīgs zaudējums tai, kas raksta beigās, kas ir tieši tas, ko nodrošina noklusējuma iestatījumi: Isaac-GR00T CLI raksta ik pēc --save-steps (noklusējums 1000), bet lerobot --save_freq noklusējums ir 20 000 soļu, tāpēc noklusējuma SmolVLA izpilde kontrolpunktu raksta vienreiz, finiša taisnē. Samaziniet to, vai nesoliet. AY-Robots apmācības veidlapa GR00T iestatījumu atklāj kā saveSteps.

Kartes noma pašam
Priekšrocības
  • Zemākā stundas likme, kāda vien ir.
  • Pilnīga kontrole pār attēlu, CUDA versiju, lerobot vai Isaac-GR00T revīziju un katru karodziņu.
  • Pārtraucamā solīšana samazina likmi uz pusi, ja jūsu izpilde pietiekami bieži veido kontrolpunktus, lai izdzīvotu pauzi.
  • Nekas nav abstrahēts, tāpēc, ja izpilde uzvedas dīvaini, jūs varat redzēt, kāpēc.
Kompromisi
  • Iestatīšana tiek rēķināta pēc GPU likmēm: draiveri, atkarības, daudzgigabaitu bāzes kontrolpunkts un datu kopas lejupielāde – viss maksā tikpat stundā kā apmācība.
  • Pārtraucama instance, kas zaudējusi solīšanā, tiek apturēta un tās procesi tiek pārtraukti. Nesaglabāta izpilde ir iztērēta nauda, un lerobot noklusējuma iestatījums raksta pirmo kontrolpunktu 20 000. solī.
  • Neviens neiznīcina podu jūsu vietā. Iepriekš redzamā dīkstāves tabula ir rēķins par aizmāršību.
  • Vienu pilnu 80 GB karšu piedāvājums ir ierobežots: šajā lasījumā divi A100 80 GB un pieci H100 80 GB pilnas kartes piedāvājumi. Saraksts arī mainās, tāpēc lētākā norādītā cena un cena, par kuru jūs faktiski varat nomāt, nav viens un tas pats skaitlis.
  • Katru stundu, kas pavadīta infrastruktūrā, nav pavadīta epizožu ierakstīšanā, kas nosaka, vai politika darbojas.

Darīt to pašam pretī ļaujot platformai nomāt karti

Jūs izvēlaties mašīnu, veidojat vidi un iznīcināt podu. Stundas likme ir iepriekš minētā tirgus likme; viss pārējais ir jūsu laiks.

  1. Atrodiet karti, kas atbilst modeļa nepieciešamajai VRAM: 24 GB ACT un SmolVLA, 80 GB GR00T un Pi0.5.
  2. Nomājiet pēc pieprasījuma, ja izpilde nevar izdzīvot pauzi, pārtraucami, ja tā bieži veido kontrolpunktus.
  3. Instalējiet rīku ķēdi: lerobot ACT, SmolVLA un Pi0.5, Isaac-GR00T repozitoriju ar savu tyro palaidēju GR00T.
  4. Pārveidojiet datu kopu, ja nepieciešams. LeRobot v3.0 datu kopa avarē GR00T ielādētāju un ir jāpārveido uz v2.1.
  5. Palaidiet, vērojiet zudumu, saglabājiet kontrolpunktus kaut kur izturīgā vietā, tiklīdz tie tiek rakstīti.
  6. Iznīciniet instanci, pēc tam pārbaudiet, vai esat to iznīcinājis.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Pašreizējais Isaac-GR00T smalkās pielāgošanas sākumpunkts, kas atbilst komandai repozitorija README. Šim CLI nav sēklas karodziņa, tāpēc GR00T izpildes nav bitu-par-bitu reproducējamas.

Reālistiskas izmaksas vienai GR00T izpildei: 3 līdz 6 stundas uz H100 80 GB par 1.34 līdz 2.34 USD stundā ir 4 līdz 14 USD, plus 20 līdz 40 minūtes iestatīšanas, kas arī tiek rēķinātas, plus jūsu pašu laiks.

Ko platforma iekasē un kā tā izvēlas karti

Loģika ir apzināti garlaicīga. Katrs modelis katalogā, deklarē GPU līmeni; aizmugursistēma paņem nepieciešamo VRAM un iznomā atbilstošu karti tajā pašā iepriekš minētajā tūlītējā tirgū. Tāpēc norādītās izmaksas ir diapazons, nevis cena. GR00T un Pi0.5 šeit ir pieejami tikai mākonī 40 GB un 70 GB minimālo prasību dēļ. SmolVLA un ACT darbojas arī lokāli uz jūsu pašu 24 GB kartes, kur mākoņa izmaksas ir nulle un elektrība ir jūsu problēma.

AY-Robots cenu lapa, kas parāda apmācības izpildes un platformas piekļuves izmaksas
Cenu lapa. Izpildes izmaksas seko tūlītējam tirgum, nevis fiksētai cenai.

Vienam parametram ir jāpievērš uzmanība. Gradientu akumulācija patiešām attiecas uz abiem GR00T variantiem, tāpēc tās palielināšana nodrošina lielāku efektīvo partiju uz tās pašas kartes. Pi0.5 un SmolVLA gadījumā tā vispār nav piemērojama: lerobot 0.5.1 apmācības konfigurācijā nav gradientu akumulācijas opcijas, tāpēc lauka iestatīšana uz 16 neko nemaksā un neko nedod. Ja rindā esošs darbs nekad nesākas, lapā par iestrēgušiem darbiem rindā, ir aprakstīts, kas jāpārbauda; ja datu kopa tiek noraidīta pirms izpildes sākuma, tas gandrīz vienmēr ir v3.0 formāta problēma.

Ierobežojums, ko šī platforma neatrisina: latentums

Nomāts GPU, kas apkalpo jūsu politiku, izmantojot publisko internetu, pievieno papildu ceļojumus vadības cilpai, kas jau ir no 20 līdz 485 ms par katru darbības soli. Piemērots lēnai paņemšanai un novietošanai, bet ne ātrai reaktīvai kustībai. Mākoņdatošanas secinājumi labi novērtē kontrolpunktu un slikti veic ražošanas manipulācijas: ja uzdevumam nepieciešams ātrums, aprēķiniem jāatrodas blakus servomotoriem, un tās ir izmaksas, ko šis raksts nevar likvidēt. Skatiet secinājumu latentumu.

Izstrādāts budžets pirmajai strādājošai politikai

Visas četras rindas kopā, sākot no nulles. Kopējais GPU apjoms pieņem 3 līdz 5 palaišanas reizes: pirmā pierāda, ka konveijers darbojas, otrā atklāj datu problēmu, trešā vai ceturtā ir tā, ko jūs paturat.

RindaEkonomiskais ceļšĒrtais ceļš
RokaTikai SO-100 sekotājs, 121.94 USD materiālu sarakstāvadītājs plus sekotājs, 229.88 USD materiālu sarakstā
ModelisSmolVLA vai ACT, 24 GB līmenisGR00T N1.7, A100 80 GB vai H100 līmenis
Ierakstītās epizodes30, SmolVLA minimums50 līdz 100
Cilvēka laiks ierakstīšanaiapmēram 1 h 12 min2 līdz 4 stundas
Vienas palaišanas izmaksas1 līdz 3 USD4 līdz 12 USD
Palaišanas reizes pirms tas darbojas3 līdz 53 līdz 5
Kopējie GPU izdevumi3 līdz 15 USD12 līdz 60 USD
Lielākā rinda rēķināroka, tad jūsu laiksroka, tad jūsu laiks

Šis princips attiecas arī uz šāda izmēra robotiem: aprēķini ir niecīga kļūda, aparatūra ir reālas vienreizējas izmaksas, cilvēkstundas ir atkārtoti izdevumi. Lai pārbaudītu apmācības pusi pirms jebkā iegādes, ļauj salīdzināt modeļus un nomāt GPU bez robota rokas, un ir fizisks SO-100, ko var vadīt pārlūkprogrammā bez reģistrācijas. Lai izmantotu visu cauruļvadu no sākuma līdz beigām, aptver iestatīšanu, un apmācību, un ir īsā versija.

AY-Robots apmācības matrica ar piecām politikām kā rindām un četrām robotu rokām kā kolonnām, katra šūna ved uz konkrētu apmācības rokasgrāmatu
Apmācības matrica: rinda jūsu budžetam, kolonna jūsu rokai, šūna rokasgrāmatai ar šī pāra noklusējuma iestatījumiem un izmaksām.
Cik maksā viena VLA precizēšanas palaišana no sākuma līdz beigām?

Apmēram 4 līdz 12 USD par GR00T N1.7, GR00T N1.5 vai Pi0.5 A100 80 GB vai H100 līmenī (3 līdz 6 stundas par 1.20 līdz 2.00 USD stundā), un apmēram 1 līdz 3 USD par SmolVLA vai ACT RTX 4090 līmenī (2 līdz 5 stundas par 0.30 līdz 0.60 USD stundā). Kartes nomāšana pašam izmaksās aptuveni tikpat, ja tiek ieskaitīts iestatīšanas laiks, jo rēķins tiek aprēķināts pēc apmācības tarifa.

Vai ir vērts maksāt par H100, nevis A100 80 GB?

Vienai SO-100 politikai parasti nē. Abi nodrošina GR00T un Pi0.5 nepieciešamo atmiņas apjomu, un 2026. gada 23. augusta dati liecina, ka pilna A100 80 GB sākās ar 0.44 USD stundā, salīdzinot ar 1.34 USD par H100 80 GB. H100 pabeidz ātrāk, tāpēc daļa no tarifa atgriežas kā mazāk stundu, taču kopējā summa joprojām ir augstāka tik mazam darbam. Patiesais arguments par H100 ir pieejamība: pieci atsevišķi H100 80 GB piedāvājumi šajā tirgū pret diviem A100 80 GB, un kartei, ko nevar iznomāt, nav cenas.

Cik palaišanas reizes ir nepieciešamas, pirms politika patiešām darbojas?

Plānojiet trīs līdz piecas. Pirmā pierāda, ka cauruļvads ir pareizi savienots. Otrā parasti atklāj datu kopas problēmu, piemēram, kameras straumi, kas pārtrauca darboties pusceļā. Trešā vai ceturtā ir tā, ko jūs paturat.

Vai es varu apmācīt SmolVLA vai ACT uz sava GPU, nevis nomāt?

Jā. Abi tiek atbalstīti lokāli AY-Robots un abi ērti iekļaujas 24 GB; oriģinālais ACT dokuments apmācīja savu 80M modeli apmēram 5 stundās uz 11 GB RTX 2080 Ti. GR00T un Pi0.5 šeit ir tikai mākoņpakalpojumu versijas, jo pārdevēju dokumentētie precizēšanas minimālie apjomi ir 40 GB un 70 GB, un lielākā patērētāju karte tirgū ir 32 GB RTX 5090.

Kāpēc vienāds soļu skaits dažādiem modeļiem maksā atšķirīgi?

Soļi nav salīdzināmi dažādās politikās. ACT noklusējuma iestatījumi ir 100 000 soļu ar partiju 8 uz 24 GB kartes; GR00T N1.5 noklusējuma iestatījumi ir 2000 soļu ar partiju 1 un gradienta akumulāciju 16 uz 80 GB kartes. Rēķins ir stundas, reizinātas ar kartes likmi, uz kuru jūs spiež atmiņas nospiedums, nevis soļu skaitītājs.

Uzziniet, cik maksās jūsu izpilde pirms tās sākšanas

Katrā no piecām politikām ir norādīts tās GPU līmenis, izpildes laiks un cena par vienu izpildi, un apmācības aizmugursistēma nomā karti tajā pašā tūlītējā tirgū, kurā tika mērīti šie skaitļi.

Pārbaudīt cenas

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started