
Mga tunay na presyo ng GPU sa spot market, gaano katagal tumatakbo ang bawat isa sa limang patakaran, magkano ang gastos ng braso at ng mga demonstrasyon, at ang apat na lugar kung saan tahimik na nawawala ang pera.
Ang maikling bersyon
- •Ang isang pagpapatakbo sa A100 80 GB o H100 tier ay tumatagal ng 3 hanggang 6 na oras at nagkakahalaga ng humigit-kumulang 4 hanggang 12 USD. Sa RTX 4090 tier, ito ay 2 hanggang 5 oras at humigit-kumulang 1 hanggang 3 USD.
- •Sinukat sa vast.ai noong 13:44 UTC ng 23 Agosto 2026: isang buong RTX 4090 on demand sa halagang 0.13 hanggang 0.38 USD/h, isang A100 80 GB sa 0.44 hanggang 0.67, isang H100 80 GB sa 1.34 hanggang 2.34. Bihira ang buong 80 GB na card, dalawa at limang single-card na alok ayon sa pagkakabanggit.
- •Ang GPU ang pinakamurang linya. Ang bill of materials ng SO-ARM100 ay naglalagay ng leader plus follower pair sa 229.88 USD, na katumbas ng 77 hanggang 230 na pagpapatakbo sa 24 GB tier.
- •Ang dalawang oras ng isang tao na nagre-record ng 50 episode ay mas mahal kaysa sa training run na pinagkukunan ng mga episode na iyon.
- •Nawawala ang pera sa apat na lugar: pagpapatakbo sa sirang data, 3B na modelo sa mga gawain na kayang hawakan ng 80M na policy, mga GPU na walang sinumang sumira, at mga rerun ng resulta na hindi mo napanatili.
- •Ang AY-Robots ay nagtatakda ng laki ng card batay sa VRAM na kailangan ng modelo at inuupahan ito sa parehong spot market, kaya ang gastos sa pagpapatakbo ay ang gastos sa merkado.
Ang bill ay may apat na linya, at ang GPU ang pinakamaliit
Kapag tinatanong ng mga tao kung magkano ang gastos sa pag-fine-tune ng isang modelo ng vision-language-action para sa isang SO-100, halos palagi nilang ibig sabin ang pag-upa ng GPU. Iyan ang numerong lumalabas bilang singil sa isang card, kaya iyan ang nararamdaman na totoo. Ito rin, sa malaking pagkakaiba, ang pinakamaliit sa apat na numero na nagpapasya kung ano ang aktwal na gastos sa iyo ng isang gumaganang patakaran.
| Linya | Ano ito | Karaniwang laki para sa isang gumaganang patakaran |
|---|---|---|
| Oras ng GPU | pag-upa ng card para sa pagpapatakbo | 1 hanggang 12 USD bawat pagpapatakbo, at gagawa ka ng 3 hanggang 5 |
| Ang robot | servos, naka-print na frame, camera, kable, kuryente | isang beses, 110 hanggang 500 EUR bawat braso |
| Oras ng tao | isang tao na nagmamaneho ng braso upang mag-record ng mga demo | 1 hanggang 4 na oras bawat dataset, inuulit bawat gawain |
| Basura | masamang data, malalaking modelo, nakalimutang pods | walang hangganan, at ang tanging linya na kontrolado mo |
Ang mga oras ng pagsasanay sa ibaba ay mula sa sariling mga papel at repositoryo ng limang modelo, ang gastos sa hardware mula sa nailathalang bill of materials, ang mga numero ng platform mula sa AY-Robots katalogo ng patakaran at pahina ng pagpepresyo. Kung saan hindi nakakatulong ang platform, sinasabi ito ng artikulong ito.
Magkano talaga ang halaga ng isang oras ng GPU sa spot market
Walang iisang presyo para sa isang oras ng A100. Sa isang marketplace tulad ng vast.ai, bawat host ay nagtatakda ng sarili nitong rate, at ang pagpapatakbo ng pagsasanay na inilunsad mo ay mapupunta sa anumang makina na mura at libre sa sandaling iyon. Ang tapat na sagot ay isang distribusyon. Narito ito, sinukat noong 23 Agosto 2026 ng 13:44 UTC: solong buong card, on demand, na sinala ayon sa tunay na VRAM.
| Card | vast.ai on demand USD/h (mababa / median / mataas) | Mga Alok ng Buong Card | vast.ai bid floor | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | hindi inaalok |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | hindi inaalok |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 bilang isang Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 bilang isang endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | hindi inaalok |
Mga on-demand na alok para sa isang buong GPU (gpu_frac == 1.0) mula sa vast.ai public bundle API, na hindi nangangailangan ng account, na-filter sa gpu_ram upang tanging ang tunay na 80 GB na card ang mapunta sa mga row ng 80 GB. Mahalaga ang filter na iyon: sa pagbabasang ito, lahat ng tatlong single-card na alok ng A100 SXM4 ay 40 GB na bahagi, gayundin ang dalawa sa apat na alok ng A100 PCIE, kaya ang pagsasama-sama ng mga ito sa isang row na "A100" ay magpapababa ng kalahati sa presyong iniulat dito. Ang Hugging Face column ay naghahalo ng dalawang produkto: ang 2.50 USD/h ay ang Nvidia A100 - large Spaces hardware at ang 4.50 USD/h ay isang solong H100 80 GB sa ilalim ng Inference Endpoints, na hindi inaalok ng Spaces. Ituring ang mga median bilang indikasyon: ang row ng A100 80 GB ay nakabatay sa dalawang alok at ang row ng H100 ay sa lima, at ang magkaparehong query 36 segundo pagkatapos ay nagbalik ng ibang bilang ng 4090 at ibang pinakamataas na presyo sa tatlo sa limang row. Ang mga presyo sa listahan ng RunPod ang mas matatag na numero na pagbabatayan ng pagpaplano.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Bakit hindi magagamit ng mga 3B model ang murang card
Ang isang 4090 oras at isang H100 80 GB oras ay nagkakaiba ng humigit-kumulang anim na beses sa mga median sa itaas. Ang nagtutulak sa iyo sa mamahaling card ay hindi bilis, kundi memorya. Itinatakda ng openpi ang minimum para sa isang buong Pi0.5 pag-fine-tune sa 70 GB, at inirerekomenda ng NVIDIA ang 40 GB o higit pa para sa GR00T. Tandaan kung ano ang hindi ang numero ng GR00T. Ang fine-tune config nito ay nagpi-freeze sa language model at visual encoder bilang default (tune_llm at tune_visual ay False, ang projector at diffusion head ay True), kaya naman ang katalogo ay naglilista ng humigit-kumulang 40 M na sinanay na parameter mula sa 3 B. Ang 40 GB ay hindi optimizer state para sa 3 B weights, ito ay ang frozen backbone kasama ang mga activation. Ang mga variant na may pinababang saklaw ay bumababa: ang LoRA path ng openpi ay nangangailangan ng 22.5 GB at binabanggit ang 4090, at ang workflow ng Isaac Lab Arena ng NVIDIA ay naglilista ng 24 GB single-GPU na opsyon para sa GR00T post-training. Ang platform ay nagtatakda ng mga tier batay sa minimum na inilalathala ng bawat vendor para sa configuration na talagang pinapatakbo nito. Ang pi0 flow-matching na sulatin nagpapaliwanag kung saan nagmula ang flow-matching footprint.
| Trabaho | Memorya na hinihingi ng upstream project | Pinagmulan |
|---|---|---|
| pi0 / pi0.5 inference | more than 8 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 LoRA pag-fine-tune | more than 22.5 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 buong pag-fine-tune | more than 70 GB, example A100 80 GB or H100 | openpi |
| GR00T N1.7 inference | 1 GPU with 16 GB or more | Isaac-GR00T |
| GR00T N1.7 pag-fine-tune | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| GR00T pag-fine-tune, kung ano ang sinasanay nito | projector and diffusion head; LLM at visual encoder ay frozen bilang default | finetune_config.py |
| GR00T post-training, pinababa | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| SmolVLA pag-fine-tune | single A100 for the reference 20,000-step run | lerobot docs |
| ACT pagsasanay | a single 11 GB RTX 2080 Ti | ACT paper |
Iyan ang dahilan kung bakit hinahati ng platform ang limang modelo sa dalawang tier. GR00T N1.7, GR00T N1.5 at Pi0.5 ay gumagamit ng A100 80 GB o H100 dahil iyon ang hinihingi ng mga vendor. SmolVLA at ACT ay gumagamit ng RTX 4090 o anumang 24 GB card dahil iyon ay sapat na.
Ang isang GR00T o Pi0.5 na tumatakbo sa isang 24 GB card ay hindi bumabagsak sa simula pa lang. Dina-download nito ang base checkpoint, binubuo ang dataset index, sinisimulan ang unang forward pass at bumabagsak pagkatapos ng ilang daang hakbang na may CUDA out-of-memory error. Nagbayad ka para sa download at setup at wala kang nakuha. Mga solusyon: out of memory habang nagsasanay.
Gaano katagal tumatakbo ang bawat isa sa limang modelo
Ang oras ng pagtakbo ay ang kabilang kalahati ng gastos: Ang 2.00 USD kada oras ay walang saysay kung ang trabaho ay 40 minuto at nakakapinsala kung ito ay 40 oras. Ito ang mga default na talagang ipinapadala ng AY-Robots sa trainer, kasama ang run window at gastos para sa bawat tier.
| Patakaran | Antas ng GPU | Default na pinakamataas na hakbang | Default na batch (grad accum) | Run window | Gastos kada pagtakbo |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Saan nagmumula ang mga run window na iyon mula sa upstream
- SmolVLA: Ayon sa dokumentasyon ng lerobot, ang 20,000 steps ay tumatagal ng humigit-kumulang 4 na oras sa isang A100. Pinapatakbo ng platform ang parehong 20,000 steps sa mas murang 24 GB tier, kaya't isang window sa halip na isang flat na 4 na oras.
- ACT: Ang orihinal na papel ng ALOHA ay nag-uulat ng humigit-kumulang 5 oras sa isang 11 GB RTX 2080 Ti para sa isang 80M-parameter na modelo. Ang isang 4090 ay ilang henerasyon na mas bago ngunit ang platform ay naglalaan ng 100,000 steps, kaya't ang window ay napupunta sa parehong lugar.
- GR00T: Ang reference workflow ng NVIDIA para sa henerasyon ng N1.6 ay nagbanggit ng humigit-kumulang 4 hanggang 8 oras para sa 20,000 steps sa batch 24 sa walong L40S card, at 2 hanggang 3 oras para sa 30,000 steps sa batch 16 sa isang Ada 6000. Ang single-card fine-tuning ng isang 3B VLA sa loob ng ilang oras ay normal, hindi optimistiko.
- Pi0.5: Walang inilalathala ang openpi na wall-clock figure, ngunit inilalathala nito ang 70 GB floor para sa isang buong fine-tune, na nagtatakda ng card at samakatuwid ang rate.
Sulit na pagtuunan ng pansin ang halagang hindi mo binabayaran. Ang papel ng GR00T N1 ay nag-uulat ng humigit-kumulang 50,000 H100 GPU hours upang i-pretrain ang 2.2B na modelo, sa isang cluster ng hanggang 1024 GPU, sa isang pretraining batch size na 16,384 para sa 200,000 gradient steps. Sa 1.34 hanggang 2.34 USD kada oras na sinukat sa itaas, ito ay nasa hanay ng 67,000 hanggang 117,000 USD ng inupahang compute. Ang papel ng SmolVLA ay naglalagay ng proyekto nito sa humigit-kumulang 30,000 GPU hours sa 481 community datasets, 22.9K episodes at 10.6M frames. Minana mo ang lahat ng ito sa presyo ng isang download; ang iyong 8 USD ay bumibili ng huling 20,000 steps. Bakit ganito ang pagkakagawa ng mga VLA ay sumasaklaw sa paghahating iyon.
Ang braso: isang one-time na gastos na mas malaki pa sa bayarin ng GPU
Ang isang training run ay mas mura kaysa tanghalian. Ang robot ay hindi. Kaya naman ang SO-100 ay mahalaga: ito ang pinakamurang braso na sinusuportahan ng buong pag-aaral sa pamamagitan ng panggagaya toolchain.
| Braso | Mga Servo | Boltahe | Halaga ng Bahagi | Suporta sa AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | buo, reference arm |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | buo |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatible |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatible |
Ang upstream na bill of materials sa SO-ARM100 repository ay mas detalyado at nararapat suriin ayon sa iyong rehiyon: ang Mga Bahagi Para sa Dalawang Braso na listahan ay may kabuuang 229.88 USD o 226.30 EUR para sa isang leader plus follower setup, at ang Mga Bahagi Para sa Isang Follower Arm na listahan ay may kabuuang 121.94 USD o 124.30 EUR. Anim na STS3215 servo sa 13.89 USD bawat isa ay 83.34 ng 121.94 na iyon, kaya ang mga servo ang braso. Sa 1 hanggang 3 USD bawat SmolVLA o ACT run, ang isang pares ng braso ay nagkakahalaga sa pagitan ng 77 at 230 training run. Kung ikaw ay nagpipili pa rin, SO-100 laban sa SO-101 ang paghahambing na mahalaga, dahil ang dalawa ay sapat na magkalapit kaya ang desisyon ay tungkol sa availability sa halip na kakayahan.
Ang STS3215 ay ipinapadala sa isang 7.4 V at isang 12 V na variant; sinasaad ng repository na ang 12 V na bahagi ay nangangailangan din ng 12 V 5 A supply sa halip na ang 5 V, kaya ang dalawa ay hindi mapagpapalit. Ang pagpapakain ng 12 V sa 7.4 V na mga servo ay sumisira sa mga ito, at anim na servo ay dalawang-katlo ng halaga ng mga bahagi ng isang follower arm. Suriin ang label sa bawat servo bago ang unang pag-power-up. Kung ang mga servo ay kumikilos na nang kakaiba: servo ay hindi tumutugon, braso ay kumikibot pagkatapos ay lumalaylay.
Oras ng tao: ang linyang walang naglalagay sa spreadsheet
Ito ang bilang na nagpapabaliktad sa diskusyon tungkol sa gastos. Ang pagre-record ng mga demonstrasyon ay isang tao na nagpapagalaw ng robot arm, isang episode sa bawat pagkakataon, sa real time. Walang pagpapangkat-pangkat dito at walang pag-upa nito kada segundo. Ang LeRobot dataset recorder ay may kasamang mga default na nagpapadali sa aritmetika, lahat ng tatlo ay nakumpirma sa DatasetRecordConfig: 60 segundo bawat episode, 60 segundo upang i-reset ang eksena, 50 episode. Ang column ng pera sa ibaba ay nagpapalagay ng 15 USD para sa isang oras ng oras ng isang tao, na isang pagpapalagay sa halip na isang numero ng platform. Palitan ng sarili mong rate; ang ratio ang punto.
- 1I-record ang dataset gamit ang mga default na aktwal mong babayaran
Ito ang lerobot 0.6.1, ang bersyon sa PyPI noong 3 Agosto 2026. Tandaan ang hugis ng CLI: ang pagre-record ay tumatakbo sa pamamagitan ng
lerobot-recordconsole entry point (lerobot.scripts.lerobot_record), hindi ang lumangpython -m lerobot.scripts.recordmodule path. Ang AY-Robots ay nagta-target ng 0.5.1, at ang 0.5.1 wheel ay nagdedeklara ng parehonglerobot-recordatlerobot-trainentry points, kaya ang hugis sa ibaba ay matatag sa pareho. Ang tatlong timing flags ay ang mga upstream default, kaya ito rin ang command na ipinapalagay ng aritmetika sa susunod na talahanayan.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Tingnan ang iyong na-record bago ka umupa ng isang minuto ng GPU
Ang pag-inspeksyon ng dataset ay walang gastos na zero USD kada oras. Ang pagtuklas ng parehong problema mula sa isang loss curve ay nagkakahalaga ng 2.00 USD kada oras sa H100 tier at sinasabi sa iyo nang apat na oras na huli. I-push ang dataset at suriin ito sa LeRobot viewer, o i-browse ang AY-Robots dataset directory.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Mag-train, at tiyaking mas matagal ang checkpoint kaysa sa pod
Ang inupahang makina ay pansamantala ayon sa depinisyon, kaya isulat ang mga checkpoint sa isang matibay na lugar sa panahon ng pagpapatakbo. Dalawang flag ang nagpapasya kung pananatilihin mo ang iyong binayaran. Ang
--save_freqay nagde-default sa 20,000 steps, kaya ang isang default na 20,000-step na SmolVLA run ay isinusulat ang unang checkpoint nito kapag tapos na ang pagpapatakbo; babaan ito bago ka umupa ng anumang maaaring maantala. Ang--save_checkpoint_to_hubay nangangailangan ng--policy.repo_idat hindi umiiral sa lerobot 0.5.1, kaya sa bersyon na iyon ay kailangan mong kopyahin ang output directory mula sa makina nang ikaw mismo. Ang batch size sa ibaba ay ang halimbawa ng upstream doc; ang AY-Robots form ay nagpapadala ng 2 para sa SmolVLA at nagsusulat sa object storage habang lumalabas ang mga checkpoint.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Mga Episode | Pagre-record sa 60 s | Pag-reset sa 60 s | Oras ng Orasan | Plus 20 porsyento na muling pagre-record | Sa 15 USD kada oras ng tao |
|---|---|---|---|---|---|
| 30, ang minimum ng SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | mga 18 USD |
| 50, ang iba pang apat na minimum | 50 min | 50 min | 1 h 40 min | 2 h 00 min | mga 30 USD |
| 100, isang kumportableng dataset | 100 min | 100 min | 3 h 20 min | 4 h 00 min | mga 60 USD |
Ikumpara ang kanang column sa 1 to 12 USD na gastos ng pagpapatakbo. Sa inaasahang rate na iyon, ang isang 50-episode dataset ay nagkakahalaga ng dalawa hanggang pitong beses na mas mahal irekord kaysa sa gastos ng pag-train dito, bago ang calibration, camera setup at ang mga episode na itinatapon mo. Kaya naman ang ay may direktang halaga sa dolyar. Ang gabay ng lerobot ay nagmumungkahi ng hindi bababa sa 50 episode na may 10 bawat lokasyon ng bagay; ang mga dokumento ng SmolVLA ay nag-uulat na ang isang 25-episode na bersyon ng parehong gawain ay hindi sapat.
Kung saan talaga nawawala ang pera
1. Mga pagpapatakbo sa data na hindi kailanman gagana
Ang isang 20,000-step na pagpapatakbo ng GR00T sa isang dataset na may dalawang pinagpalit na camera stream ay pareho ang gastos sa isang malinis na dataset, pareho ang oras na kinakailangan, at gumagawa ng loss curve na mukhang maayos. Ang pagkabigo ay lumalabas sa braso, pagkalipas ng ilang oras. Ang ay sinisingil kada oras at ang diagnosis ay sinisingil sa mga araw. Dalawang sintomas na dapat tandaan: ang ay karaniwang nangangahulugang ang mga obserbasyon ay hindi nagdadala ng kailangan ng gawain, at ang ay nangangahulugang ang dataset ay may mas kaunting variation kaysa sa iyong inakala.
2. Pagbabayad ng presyo ng foundation-model para sa isang gawain na may nakapirming kamera
Ang ACT ay humigit-kumulang 80M na parameter at idinisenyo upang magsanay mula sa simula sa 50 demonstrasyon ng isang gawain. Ang GR00T N1.7 ay humigit-kumulang 3B na may pretrained na backbone. Para sa isang nakakabit na kamera, isang nakapirming mesa at isang bagay, ang 80M na modelo ay madalas na nakakamit ang layunin, tumatakbo sa humigit-kumulang 20 ms bawat hakbang ng aksyon sa halip na 152 ms, at nagkakahalaga ng 1 hanggang 3 USD bawat pagtakbo sa halip na 4 hanggang 12. Gumastos ng 3 USD upang malaman kung gumagana ang murang modelo bago gumastos ng 12 USD sa mahal na modelo. ACT laban sa SmolVLA at GR00T N1.7 laban sa Pi0.5 ay nagpapakita kung saan humihinto ang bawat isa sa pagiging tamang sagot; ang arena ng modelo ay may 85 modelo at 332 resulta ng benchmark.
3. Ang GPU na nakalimutan mo
Ang pinakamurang pagkakamali na maiiwasan at ang pinakakaraniwan na nagagawa. Ang isang instance na sinimulan noong Biyernes upang mag-debug ng isang bagay ay sinisingil sa buong weekend sa parehong rate ng isang tunay na pagtakbo.
| Card | Median na rate sa snapshot | Idle sa loob ng 24 h | Idle sa loob ng 7 araw | Katumbas nito |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | humigit-kumulang 27 SmolVLA o ACT na pagtakbo sa 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | humigit-kumulang 12 GR00T na pagtakbo sa 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | humigit-kumulang 38 GR00T na pagtakbo sa 8 USD |
Sa AY-Robots, ang pagkabigong ito ay idinisenyo upang maiwasan para sa inference: ang mga pod na inilaan ng inference API ay may idle watchdog at sinisira ang kanilang sarili pagkatapos ng isang idle period. Kung ikaw mismo ang umupa ng card, ang watchdog na iyon ay ang iyong paalala sa kalendaryo.
4. Pagbabayad nang dalawang beses para sa parehong sagot
Ang entry point ng fine-tuning ng GR00T ay isang tyro CLI na hindi naglalantad ng seed. Hindi ito limitasyon ng platform, ito ay ang upstream tool: walang seed field sa gr00t/configs/finetune_config.py, at ang sariling training tips ng repository ay nagbabala na ang mga pagtakbo ay nag-iiba ng 5 to 6 percent dahil ang mga image augmentation ay non-deterministic. Ang lerobot ay nagde-default sa seed 1000 sa parehong 0.5.1 at 0.6.1, kaya ang mga pagtakbo ng ACT, SmolVLA at Pi0.5 ay maaaring ulitin mula sa parehong initialization at data order. Hindi ito pangako ng bit-identical na weights sa isang GPU, ngunit ito ang pagkakaiba sa pagitan ng isang rerun at isang bagong eksperimento. Kung ang isang pagtakbo ng GR00T ay gumagawa ng isang policy na gumagana at hindi mo napanatili ang checkpoint, babayaran mo ang buong presyo para sa isang resulta na maaaring magkaiba nang higit pa sa pagkakaiba na iyong hinahabol. Mayroong pangalawang paraan upang mawala ang isang checkpoint na binayaran mo: ang CLI ay nagde-default sa --save-total-limit 5, na idinokumento bilang ang maximum na bilang ng mga checkpoint na pinananatili bago burahin ang mga mas luma. Ang storage ay sentimo; ang isang rerun ay 4 to 12 USD at anim na oras.
Ang mga bid floor sa itaas ay isang bahagi lamang ng on-demand na rate, at sinasabi ng vast.ai na ang sistema ng pagbi-bid ay maaaring magpababa ng gastos ng kliyente ng limampung porsyento o higit pa. Ang catch, sa kanilang sariling salita: ang isang interruptible instance ay maaaring i-pause anumang oras kung may ibang user na mag-bid ng mas mataas o kung may on-demand na rental na nilikha para sa parehong resources, at ang pag-pause na iyon ay "humihinto sa lahat ng proseso na tumatakbo". Palaging inuuna ang on-demand. Ayos lang para sa isang run na nagsusulat ng checkpoint bawat ilang daang hakbang, isang ganap na pagkalugi para sa isang run na nagsusulat sa dulo, na siyang eksaktong ibinibigay sa iyo ng mga default: ang Isaac-GR00T CLI ay nagsusulat bawat --save-steps (default 1000), ngunit ang --save_freq ng lerobot ay may default na 20,000 hakbang, kaya ang isang default na SmolVLA run ay nagche-checkpoint minsan, sa finish line. Babaan ito, o huwag mag-bid. Ang AY-Robots training form ay naglalabas ng GR00T knob bilang saveSteps.
- Ang pinakamababang hourly rate na mayroon.
- Buong kontrol sa image, CUDA version, lerobot o Isaac-GR00T revision at bawat flag.
- Ang interruptible bidding ay naghahati sa rate kung ang iyong run ay madalas mag-checkpoint upang makaligtas sa isang pag-pause.
- Walang inilalayo, kaya kapag ang isang run ay kumilos nang kakaiba, makikita mo kung bakit.
- Ang setup ay sinisingil sa mga rate ng GPU: ang mga driver, dependencies, ang multi-gigabyte na base checkpoint at ang pag-download ng dataset ay pare-pareho ang gastos kada oras tulad ng training.
- Ang isang outbid na interruptible instance ay naka-pause at ang mga proseso nito ay pinatay. Ang isang hindi na-save na run ay nasunog na pera, at ang default ng lerobot ay nagsusulat ng unang checkpoint nito sa hakbang 20,000.
- Walang sumisira sa pod para sa iyo. Ang idle table sa itaas ay ang singil sa pagkalimot.
- Manipis ang supply para sa mga single full 80 GB card: dalawang A100 80 GB at limang H100 80 GB full-card na alok sa pagbabasang ito. Ang listahan ay nagbabago rin, kaya ang pinakamurang nakalistang presyo at ang presyo na maaari mong aktwal na rentahan ay hindi pareho.
- Bawat oras sa imprastraktura ay isang oras na hindi ginugol sa pagre-record ng mga episode na nagpapasya kung gumagana ang patakaran.
Ang paggawa nito nang mag-isa kumpara sa pagpaparenta ng platform ng card
Ikaw ang pumipili ng makina, bumubuo ng kapaligiran at sumisira sa pod. Ang hourly rate ay ang market rate sa itaas; ang lahat ng iba pa ay ang iyong oras.
- Maghanap ng card na tumutugma sa VRAM na kailangan ng modelo: 24 GB para sa ACT at SmolVLA, 80 GB para sa GR00T at Pi0.5.
- Mag-renta on demand kung ang run ay hindi makakaligtas sa isang pag-pause, interruptible kung madalas itong mag-checkpoint.
- I-install ang toolchain: lerobot para sa ACT, SmolVLA at Pi0.5, ang Isaac-GR00T repository na may sariling tyro launcher para sa GR00T.
- I-convert ang dataset kung kinakailangan. Ang isang LeRobot v3.0 dataset ay nagka-crash sa GR00T loader at dapat i-convert pababa sa v2.1.
- Ilunsad, bantayan ang pagkalugi, itulak ang mga checkpoint sa isang matibay na lugar habang isinusulat ang mga ito.
- Sirain ang instance, pagkatapos ay suriin na sinira mo ito.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Makakatotohanang gastos para sa isang GR00T run: 3 hanggang 6 na oras sa isang H100 80 GB at 1.34 hanggang 2.34 USD kada oras ay 4 hanggang 14 USD, kasama ang 20 hanggang 40 minuto ng setup na sinisingil din, kasama ang iyong sariling oras.
Pinipili mo ang modelo, ang dataset at ang mga hyperparameter sa isang form. Ang backend ay nagre-renta ng isang spot GPU na ang laki ay batay sa VRAM na kailangan ng modelo, pinapatakbo ang trainer at nagsusulat ng mga checkpoint sa object storage.
- Piliin ang iyong kombinasyon sa training matrix: limang modelo, apat na braso, isang gabay bawat cell.
- Ituro ito sa isang dataset: isang na-record gamit ang desktop client, isang Hugging Face repo id, o isa mula sa iyong sariling makina.
- Tanggapin ang mga default o ayusin ang mga ito. Ang talahanayan sa itaas ay ang aktwal na ipinapadala sa trainer.
- Pinipili ng backend ang card batay sa kinakailangang VRAM, kaya hindi ka na mamimili ng mga GPU.
- Ang mga checkpoint ay napupunta sa object storage habang isinusulat ang mga ito, kaya ang isang naantalang run ay hindi isang nawalang run.
| Tier | Mga Modelo | Oras ng Pagpapatakbo | Gastos kada run |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
Ang hindi nito ginagawa: gawing maganda ang isang masamang dataset, bigyan ang GR00T ng seed na hindi nito kailanman nagkaroon, o alisin ang limitasyon sa latency na inilarawan sa ibaba. Inaalis nito ang pamimili ng GPU, ang pagbuo ng kapaligiran at ang pod na nakalimutan mong sirain. Ang mga mekanika ay nasa mga docs ng training.
Ano ang sinisingil ng platform at paano nito pinipili ang card
Ang lohika ay sadyang simple. Bawat modelo sa katalogo, ay nagdedeklara ng GPU tier; kinukuha ng backend ang kinakailangang VRAM at umuupa ng katugmang card sa parehong spot market na sinusukat sa itaas. Iyan ang dahilan kung bakit ang nakasaad na gastos ay isang saklaw, hindi isang presyo. Ang GR00T at Pi0.5 ay cloud-only dito dahil sa 40 GB at 70 GB na minimum. Ang SmolVLA at ACT ay tumatakbo rin nang lokal sa iyong sariling 24 GB card, kung saan ang gastos sa cloud ay zero at ang kuryente ay iyong problema.

Isang setting ang nangangailangan ng babala. Ang gradient accumulation ay tunay na nalalapat para sa parehong variant ng GR00T, kaya ang pagtaas nito ay nagbibigay ng mas malaking effective batch sa parehong card. Para sa Pi0.5 at SmolVLA, hindi ito nalalapat: ang lerobot 0.5.1 ay walang opsyon sa gradient-accumulation sa training config nito, kaya ang pagtatakda ng field sa 16 ay walang gastos at walang benepisyo. Kung ang isang queued job ay hindi kailanman nagsisimula, ang pahina ng stuck-in-queue, ay sumasaklaw sa kung ano ang dapat suriin; kung ang dataset ay tinanggihan bago magsimula ang pagpapatakbo, halos palaging ito ay ang problema sa format ng v3.0.
Ang isang inupahang GPU na naghahatid ng iyong patakaran sa pampublikong internet ay nagdaragdag ng mga round trip sa isang control loop na mayroon nang 20 hanggang 485 ms bawat hakbang ng aksyon. Ayos para sa mabagal na pick-and-place, hindi para sa mabilis na reaktibong paggalaw. Mahusay na sinusuri ng cloud inference ang isang checkpoint at masama ang pagpapatakbo ng manipulasyon sa produksyon: kung ang gawain ay nangangailangan ng bilis, ang compute ay kailangang nasa tabi ng mga servo, at iyon ay isang gastos na hindi kayang alisin ng artikulong ito. Tingnan ang inference latency.
Isang detalyadong badyet para sa unang gumaganang patakaran
Lahat ng apat na linya nang magkasama, simula sa wala. Ang kabuuang GPU ay nagpapalagay ng 3 hanggang 5 pagtakbo: ang una ay nagpapatunay na gumagana ang pipeline, ang pangalawa ay naglalantad ng problema sa data, ang pangatlo o ikaapat ang siyang pananatilihin mo.
| Linya | Mabilis na landas | Kumportableng landas |
|---|---|---|
| Braso | SO-100 follower lamang, 121.94 USD sa BOM | leader plus follower, 229.88 USD sa BOM |
| Modelo | SmolVLA or ACT, 24 GB tier | GR00T N1.7, A100 80 GB or H100 tier |
| Mga naitalang episode | 30, ang minimum ng SmolVLA | 50 hanggang 100 |
| Oras ng tao para mag-record | mga 1 h 12 min | 2 hanggang 4 na oras |
| Halaga ng isang pagtakbo | 1 hanggang 3 USD | 4 hanggang 12 USD |
| Mga pagtakbo bago ito gumana | 3 hanggang 5 | 3 hanggang 5 |
| Kabuuang gastos sa GPU | 3 hanggang 15 USD | 12 hanggang 60 USD |
| Pinakamalaking linya sa bill | ang braso, pagkatapos ang iyong oras | ang braso, pagkatapos ang iyong oras |
Ang pattern ay nananatili sa laki ng robot na ito: ang compute ay isang rounding error, ang hardware ay isang tunay na one-time cost, ang oras ng tao ang paulit-ulit na gastos. Upang subukan ang kalahati ng pagsasanay bago bumili ng anuman, hinahayaan kang maghambing ng mga modelo at magrenta ng GPU nang walang braso, at ay isang pisikal na SO-100 na maaari mong paandarin sa browser nang walang pagpaparehistro. Para sa buong pipeline mula simula hanggang dulo, ang sumasaklaw sa setup, at pagsasanay, at ang maikling bersyon.

Magkano ang gastos ng isang VLA fine-tuning run mula simula hanggang dulo?▾
Humigit-kumulang 4 hanggang 12 USD para sa GR00T N1.7, GR00T N1.5 o Pi0.5 sa A100 80 GB o H100 tier (3 hanggang 6 na oras sa 1.20 hanggang 2.00 USD bawat oras), at humigit-kumulang 1 hanggang 3 USD para sa SmolVLA o ACT sa RTX 4090 tier (2 hanggang 5 oras sa 0.30 hanggang 0.60 USD bawat oras). Ang pagrenta ng card mismo ay nasa parehong saklaw kapag nabibilang na ang oras ng setup, dahil ito ay sinisingil sa rate ng pagsasanay.
Sulit ba ang pagbabayad para sa isang H100 kaysa sa isang A100 80 GB?▾
Para sa isang solong patakaran ng SO-100, kadalasan ay hindi. Parehong nililinis ang memory floor na kailangan ng GR00T at Pi0.5, at sa pagbasa noong 23 Agosto 2026, ang isang buong A100 80 GB ay nagsimula sa 0.44 USD bawat oras laban sa 1.34 para sa isang H100 80 GB. Mas mabilis matapos ang H100, kaya ang bahagi ng rate ay bumabalik bilang mas kaunting oras, ngunit ang kabuuan ay mas mataas pa rin para sa isang maliit na run na ito. Ang tunay na argumento para sa H100 ay ang availability: limang solong H100 80 GB na alok sa merkado na iyon laban sa dalawang A100 80 GB, at ang isang card na hindi mo kayang rentahan ay walang presyo.
Ilang run ang kailangan bago gumana ang isang patakaran?▾
Magplano ng tatlo hanggang lima. Ang una ay nagpapatunay na tama ang pagkakakabit ng pipeline. Ang pangalawa ay karaniwang naglalantad ng problema sa dataset tulad ng isang camera stream na namatay sa kalagitnaan. Ang pangatlo o ikaapat ang siyang pananatilihin mo.
Maaari ko bang sanayin ang SmolVLA o ACT sa sarili kong GPU sa halip na umarkila?▾
Oo. Parehong sinusuportahan nang lokal sa AY-Robots at parehong kumportable sa 24 GB; ang orihinal na papel ng ACT ay nagsanay ng 80M model nito sa humigit-kumulang 5 oras sa isang 11 GB RTX 2080 Ti. Ang GR00T at Pi0.5 ay cloud-only dito dahil ang dokumentadong fine-tuning floors ng mga vendor ay 40 GB at 70 GB, at ang pinakamalaking consumer card sa merkado ay ang 32 GB RTX 5090.
Bakit magkaiba ang gastos ng parehong bilang ng mga hakbang sa iba't ibang modelo?▾
Ang mga hakbang ay hindi maihahambing sa iba't ibang patakaran. Ang ACT ay nagde-default sa 100,000 hakbang sa batch 8 sa isang 24 GB card; ang GR00T N1.5 ay nagde-default sa 2,000 hakbang sa batch 1 na may gradient accumulation 16 sa isang 80 GB card. Ang singil ay oras na pinarami ng rate ng card na pinipilit kang gamitin ng memory footprint, hindi ang step counter.
Tingnan kung magkano ang magiging gastos ng iyong run bago mo ito simulan
Bawat isa sa limang patakaran ay naglilista ng GPU tier nito, run time at presyo bawat run, at ang training backend ay nagre-renta ng card sa parehong spot market kung saan sinukat ang mga numerong ito.
Tingnan ang pagpepresyoSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started