
Harga GPU pasaran spot sebenar, berapa lama setiap satu daripada lima polisi berjalan, berapa kos lengan robot dan demonstrasi, dan empat tempat wang itu senyap-senyap hilang.
Versi ringkas
- •Satu larian pada peringkat A100 80 GB atau H100 mengambil masa 3 hingga 6 jam dan berharga kira-kira 4 hingga 12 USD. Pada peringkat RTX 4090, ia adalah 2 hingga 5 jam dan kira-kira 1 hingga 3 USD.
- •Diukur di vast.ai pada 13:44 UTC pada 23 Ogos 2026: RTX 4090 penuh atas permintaan untuk 0.13 hingga 0.38 USD/j, A100 80 GB untuk 0.44 hingga 0.67, H100 80 GB untuk 1.34 hingga 2.34. Kad 80 GB penuh adalah terhad, masing-masing dua dan lima tawaran kad tunggal.
- •GPU adalah barisan paling murah. Senarai bahan SO-ARM100 meletakkan sepasang pemimpin dan pengikut pada 229.88 USD, iaitu 77 hingga 230 larian pada peringkat 24 GB.
- •Dua jam seseorang merakam 50 episod menelan belanja lebih daripada larian latihan yang digunakan oleh episod-episod tersebut.
- •Wang hilang di empat tempat: larian pada data rosak, model 3B pada tugas yang dikendalikan oleh polisi 80M, GPU yang tidak dimusnahkan oleh sesiapa, dan larian semula hasil yang gagal anda simpan.
- •AY-Robots menentukan saiz kad mengikut VRAM yang diperlukan oleh model dan menyewanya di pasaran spot yang sama, jadi kos larian adalah kos pasaran.
Bil mempunyai empat barisan, dan GPU adalah yang terkecil
Apabila orang bertanya berapa kos untuk menala halus model tindakan bahasa-penglihatan untuk SO-100, mereka hampir selalu bermaksud sewa GPU. Itulah nombor yang muncul sebagai caj pada kad, jadi itulah yang terasa nyata. Ia juga, dengan perbezaan yang ketara, nombor terkecil daripada empat nombor yang menentukan berapa kos sebenar polisi yang berfungsi.
| Barisan | Apa itu | Saiz tipikal untuk satu polisi yang berfungsi |
|---|---|---|
| Masa GPU | menyewa kad untuk larian | 1 hingga 12 USD setiap larian, dan anda akan melakukan 3 hingga 5 |
| Robot | servos, rangka bercetak, kamera, kabel, kuasa | sekali, 110 hingga 500 EUR setiap lengan |
| Jam manusia | seseorang menggerakkan lengan untuk merakam demo | 1 hingga 4 jam setiap set data, diulang setiap tugas |
| Pembaziran | data buruk, model bersaiz besar, pod yang terlupa | tidak terhad, dan satu-satunya barisan yang anda kawal |
Masa latihan di bawah diambil daripada kertas kerja dan repositori lima model itu sendiri, kos perkakasan daripada bil bahan yang diterbitkan, nombor platform daripada AY-Robots katalog polisi dan halaman harga. Jika platform tidak membantu, artikel ini menyatakan demikian.
Berapa kos sebenar satu jam GPU di pasaran spot
Tiada satu harga tunggal untuk satu jam A100. Di pasaran seperti vast.ai, setiap hos menetapkan kadar sendiri, dan pelancaran latihan yang anda lancarkan akan mendarat pada mana-mana mesin yang murah dan percuma pada saat itu. Jawapan jujur adalah satu taburan. Berikut adalah data yang diukur pada 23 Ogos 2026 jam 13:44 UTC: kad penuh tunggal, atas permintaan, ditapis mengikut VRAM sebenar.
| Kad | vast.ai atas permintaan USD/j (rendah / median / tinggi) | Tawaran Kad Penuh | Harga Bidaan Minimum vast.ai | RunPod Komuniti / Selamat | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
Tawaran atas permintaan untuk satu GPU penuh (gpu_frac == 1.0) daripada API bundle awam vast.ai, yang tidak memerlukan akaun, ditapis berdasarkan gpu_ram supaya hanya kad 80 GB tulen mendarat dalam baris 80 GB. Penapis itu penting: dalam bacaan ini, ketiga-tiga tawaran A100 SXM4 kad tunggal adalah bahagian 40 GB, begitu juga dua daripada empat tawaran A100 PCIE, jadi menggabungkannya ke dalam satu baris "A100" akan mengurangkan separuh harga yang dilaporkan di sini. Lajur Hugging Face mencampurkan dua produk: 2.50 USD/j adalah perkakasan Spaces Nvidia A100 - large dan 4.50 USD/j adalah satu H100 80 GB di bawah Inference Endpoints, yang tidak ditawarkan oleh Spaces. Anggap median sebagai petunjuk: baris A100 80 GB berdasarkan dua tawaran dan baris H100 berdasarkan lima, dan pertanyaan yang sama 36 saat kemudian mengembalikan kiraan 4090 yang berbeza dan harga tertinggi yang berbeza pada tiga daripada lima baris. Harga senarai RunPod adalah nombor yang lebih stabil untuk dirancang.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Mengapa model 3B tidak boleh menggunakan kad murah
Satu jam 4090 dan satu jam H100 80 GB berbeza kira-kira enam kali ganda pada median di atas. Apa yang memaksa anda menggunakan kad yang mahal bukanlah kelajuan, tetapi memori. openpi menetapkan had bawah untuk Pi0.5 penuh penalaan halus pada 70 GB, dan NVIDIA mengesyorkan 40 GB atau lebih untuk GR00T. Perhatikan apa yang bukan nombor GR00T. Konfigurasi penalaan halusnya membekukan model bahasa dan pengekod visual secara lalai (tune_llm dan tune_visual adalah False, manakala projektor dan kepala resapan adalah True), sebab itulah katalog menyenaraikan kira-kira 40 J parameter terlatih daripada 3 B. 40 GB itu bukan keadaan pengoptimum untuk berat 3 B, ia adalah tulang belakang beku ditambah pengaktifan. Varian skop yang dikurangkan memerlukan lebih rendah: laluan LoRA openpi memerlukan 22.5 GB dan menamakan 4090, dan aliran kerja Isaac Lab Arena NVIDIA menyenaraikan pilihan GPU tunggal 24 GB untuk pasca-latihan GR00T. Platform ini mengikut tahap yang diterbitkan oleh setiap vendor untuk konfigurasi yang sebenarnya dijalankan. Penulisan padanan aliran pi0 menerangkan dari mana datangnya padanan aliran jejak itu.
| Tugas | Memori yang diminta oleh projek huluan | Sumber |
|---|---|---|
| inferens pi0 / pi0.5 | lebih daripada 8 GB, contoh RTX 4090 | openpi |
| penalaan halus LoRA pi0 / pi0.5 | lebih daripada 22.5 GB, contoh RTX 4090 | openpi |
| penalaan halus penuh pi0 / pi0.5 | lebih daripada 70 GB, contoh A100 80 GB atau H100 | openpi |
| inferens GR00T N1.7 | 1 GPU dengan 16 GB atau lebih | Isaac-GR00T |
| penalaan halus GR00T N1.7 | 40 GB atau lebih disyorkan, nod H100 atau L40 | Isaac-GR00T |
| penalaan halus GR00T, apa yang dilatih | projektor dan kepala resapan; LLM dan pengekod visual dibekukan secara lalai | finetune_config.py |
| pasca-latihan GR00T, dikurangkan | 1 GPU dengan 24 GB, model bahasa dibekukan | Isaac Lab Arena |
| penalaan halus SmolVLA | satu A100 untuk larian rujukan 20,000 langkah | lerobot docs |
| latihan ACT | satu 11 GB RTX 2080 Ti | ACT paper |
Jadual itu adalah sebab mengapa platform membahagikan lima model kepada dua peringkat. GR00T N1.7, GR00T N1.5 dan Pi0.5 menggunakan A100 80 GB atau H100 kerana itulah yang diminta oleh vendor. SmolVLA dan ACT menggunakan RTX 4090 atau mana-mana kad 24 GB kerana itu memang mencukupi.
Larian GR00T atau Pi0.5 pada kad 24 GB tidak akan gagal pada saat sifar. Ia memuat turun titik semak asas, membina indeks set data, memulakan laluan ke hadapan pertama dan terhenti beberapa ratus langkah kemudian dengan ralat CUDA kehabisan memori. Anda membayar untuk muat turun dan persediaan tetapi tidak mendapat apa-apa. Penyelesaian: kehabisan memori semasa latihan.
Berapa lama setiap satu daripada lima model sebenarnya berjalan
Masa jalan adalah separuh lagi daripada kos: 2.00 USD sejam tidak relevan jika kerja itu 40 minit dan membinasakan jika ia 40 jam. Ini adalah tetapan lalai yang AY-Robots benar-benar hantar kepada pelatih, bersama dengan tetingkap jalan dan kos untuk setiap peringkat.
| Polisi | Peringkat GPU | Langkah maksimum lalai | Kelompok lalai (pengumpulan grad) | Tetingkap jalan | Kos setiap jalan |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, kumpul 1, terpakai | 3 hingga 6 j | 4 hingga 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, kumpul 16, terpakai | 3 hingga 6 j | 4 hingga 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, kumpul 16, tiada kesan | 3 hingga 6 j | 4 hingga 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, kumpul 8, tiada kesan | 2 hingga 5 j | 1 hingga 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, kumpul 1 | 2 hingga 5 j | 1 hingga 3 USD |
Dari mana datangnya jangka masa larian tersebut dari sumber asal
- SmolVLA: dokumentasi lerobot menyatakan bahawa 20,000 langkah mengambil masa kira-kira 4 jam pada satu A100. Platform ini menjalankan 20,000 langkah yang sama pada peringkat 24 GB yang lebih murah, oleh itu, ia adalah jangka masa larian dan bukannya 4 jam yang tetap.
- ACT: kertas ALOHA asal melaporkan kira-kira 5 jam pada satu 11 GB RTX 2080 Ti untuk model 80M-parameter. A 4090 adalah beberapa generasi lebih baru tetapi platform ini memperuntukkan 100,000 langkah, jadi jangka masa larian tersebut berada di tempat yang sama.
- GR00T: Aliran kerja rujukan NVIDIA untuk generasi N1.6 menyatakan kira-kira 4 hingga 8 jam untuk 20,000 langkah pada kelompok 24 pada lapan kad L40S, dan 2 hingga 3 jam untuk 30,000 langkah pada kelompok 16 pada satu Ada 6000. Penalaan halus satu kad bagi 3B VLA dalam beberapa jam adalah normal, bukan optimistik.
- Pi0.5: openpi tidak menerbitkan angka masa sebenar, tetapi ia menerbitkan had minimum 70 GB untuk penalaan halus penuh, yang menentukan kad dan oleh itu kadar.
Wajar untuk berhenti seketika memikirkan angka yang anda tidak bayar. Kertas GR00T N1 melaporkan kira-kira 50,000 jam GPU H100 untuk melatih awal model 2.2B, pada kluster sehingga 1024 GPU, dengan saiz kelompok pra-latihan 16,384 untuk 200,000 langkah gradien. Pada kadar 1.34 hingga 2.34 USD sejam yang diukur di atas, itu adalah dalam lingkungan 67,000 hingga 117,000 USD untuk pengkomputeran sewa. Kertas SmolVLA meletakkan projeknya pada kira-kira 30,000 jam GPU merentasi 481 set data komuniti, 22.9K episod dan 10.6M bingkai. Anda mewarisi semua itu dengan harga muat turun; 8 USD anda membeli 20,000 langkah terakhir. Mengapa VLA dibina dengan cara ini meliputi pembahagian itu.
Lengan robot: kos sekali sahaja yang mengatasi bil GPU
Satu sesi latihan berharga kurang daripada makan tengah hari. Robot tidak. Itulah sebabnya SO-100 penting: ia adalah lengan termurah yang disokong oleh keseluruhan pembelajaran tiruan rantaian alat sebenarnya menyokong.
| Lengan | Servo | Voltan | Kos alat ganti | Sokongan pada AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | penuh, lengan rujukan |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | penuh |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | serasi |
| LeKiwi | Lengan Feetech STS3215, tapak beroda | Lengan 7.4 V, tapak 12 V | 400 to 500 EUR | serasi |
Senarai bahan huluan dalam repositori SO-ARM100 lebih terperinci dan wajar disemak mengikut rantau anda: senarai Alat Ganti Untuk Dua Lengan berjumlah 229.88 USD atau 226.30 EUR untuk persediaan pemimpin dan pengikut, dan senarai Alat Ganti Untuk Satu Lengan Pengikut berjumlah 121.94 USD atau 124.30 EUR. Enam servo STS3215 pada 13.89 USD setiap satu adalah 83.34 daripada 121.94 itu, jadi servo adalah lengan. Pada 1 hingga 3 USD setiap sesi SmolVLA atau ACT, sepasang lengan bernilai antara 77 hingga 230 sesi latihan. Jika anda masih memilih, SO-100 berbanding SO-101 adalah perbandingan yang penting, kerana kedua-duanya cukup dekat sehingga keputusan adalah mengenai ketersediaan dan bukannya keupayaan.
STS3215 dihantar dalam varian 7.4 V dan 12 V; repositori menyatakan bahawa bahagian 12 V juga memerlukan bekalan 12 V 5 A dan bukannya 5 V, jadi kedua-duanya tidak boleh ditukar ganti. Memberi 12 V kepada servo 7.4 V akan merosakkannya, dan enam servo adalah dua pertiga daripada kos alat ganti lengan pengikut. Periksa label pada setiap servo sebelum dihidupkan buat kali pertama. Jika servo sudah berkelakuan pelik: servo tidak bertindak balas, lengan berkedut kemudian kendur.
Jam manusia: baris yang tiada siapa letakkan dalam hamparan kerja
Ini adalah angka yang membalikkan perbincangan kos. Merekod demonstrasi melibatkan seseorang menggerakkan lengan robot, satu episod pada satu masa, dalam masa nyata. Tiada pengumpulan secara kelompok dan tiada penyewaan mengikut saat. Perakam set data LeRobot dihantar dengan tetapan lalai yang memudahkan pengiraan, ketiga-tiganya disahkan dalam DatasetRecordConfig: 60 saat setiap episod, 60 saat untuk menetapkan semula adegan, 50 episod. Lajur wang di bawah mengandaikan 15 USD untuk satu jam masa seseorang, yang merupakan andaian dan bukannya nombor platform. Gantikan kadar anda sendiri; nisbah adalah intinya.
- 1Rakam set data dengan tetapan lalai yang anda akan dibilkan
Ini adalah lerobot 0.6.1, versi di PyPI setakat 3 Ogos 2026. Perhatikan bentuk CLI: rakaman dijalankan melalui titik masuk konsol
lerobot-record(lerobot.scripts.lerobot_record), bukan laluan modul lamapython -m lerobot.scripts.record. AY-Robots menyasarkan 0.5.1, dan roda 0.5.1 mengisytiharkan titik masuklerobot-recorddanlerobot-trainyang sama, jadi bentuk di bawah adalah stabil merentasi kedua-duanya. Tiga bendera masa adalah tetapan lalai hulu, jadi ini juga merupakan arahan yang diandaikan oleh pengiraan dalam jadual seterusnya.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Lihat apa yang anda rakam sebelum anda menyewa satu minit GPU pun
Memeriksa set data tidak memerlukan kos USD per jam. Mendapati masalah yang sama daripada lengkung kerugian berharga 2.00 USD per jam pada peringkat H100 dan memberitahu anda empat jam lewat. Tolak set data dan semaknya dalam pemapar LeRobot, atau semak imbas direktori set data AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Latih, dan pastikan titik semak kekal lebih lama daripada pod
Mesin sewaan adalah sementara mengikut definisi, jadi tulis titik semak di tempat yang tahan lama semasa larian. Dua bendera menentukan sama ada anda menyimpan apa yang anda bayar.
--save_freqlalai kepada 20,000 langkah, jadi larian SmolVLA 20,000 langkah lalai menulis titik semak pertamanya apabila larian sudah tamat; turunkannya sebelum anda menyewa apa-apa yang boleh diganggu.--save_checkpoint_to_hubmemerlukan--policy.repo_iddan tidak wujud dalam lerobot 0.5.1, jadi pada versi itu anda menyalin direktori output dari mesin sendiri. Saiz kelompok di bawah adalah contoh dokumen hulu; borang AY-Robots menghantar 2 untuk SmolVLA dan menulis ke storan objek apabila titik semak muncul.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episod | Merekod pada 60 s | Menetapkan semula pada 60 s | Jam dinding | Ditambah 20 peratus rakaman semula | Pada 15 USD per jam manusia |
|---|---|---|---|---|---|
| 30, minimum SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | kira-kira 18 USD |
| 50, empat minimum yang lain | 50 min | 50 min | 1 h 40 min | 2 h 00 min | kira-kira 30 USD |
| 100, set data yang selesa | 100 min | 100 min | 3 h 20 min | 4 h 00 min | kira-kira 60 USD |
Bandingkan lajur kanan dengan kos larian 1 hingga 12 USD. Pada kadar yang diandaikan itu, set data 50 episod menelan belanja dua hingga tujuh kali ganda untuk direkodkan berbanding kos untuk melatihnya, sebelum penentukuran, persediaan kamera dan episod yang anda buang. Itulah sebabnya mempunyai nilai dolar langsung. Panduan lerobot mencadangkan sekurang-kurangnya 50 episod dengan 10 setiap lokasi objek; dokumen SmolVLA melaporkan bahawa versi 25 episod bagi tugas yang sama tidak mencukupi.
Di mana wang sebenarnya hilang
1. Larian pada data yang tidak akan berfungsi
Larian GR00T 20,000 langkah pada set data dengan dua aliran kamera yang bertukar ganti menelan belanja yang sama seperti pada set data yang bersih, mengambil masa yang sama, dan menghasilkan lengkung kerugian yang kelihatan baik. Kegagalan muncul pada lengan, beberapa jam kemudian. dibilkan mengikut jam dan diagnosis dibilkan dalam hari. Dua simptom yang patut diingat: biasanya bermakna pemerhatian tidak membawa apa yang diperlukan oleh tugas, dan bermakna set data mempunyai variasi yang kurang daripada yang anda sangka.
2. Membayar harga model asas untuk tugas kamera tetap
ACT mempunyai kira-kira 80M parameter dan direka untuk dilatih dari awal berdasarkan 50 demonstrasi satu tugas. GR00T N1.7 mempunyai kira-kira 3B dengan tulang belakang pra-latihan. Untuk kamera yang dipasang, meja tetap dan satu objek, model 80M sering berjaya, berjalan pada kira-kira 20 ms setiap langkah tindakan berbanding 152 ms, dan berharga 1 hingga 3 USD setiap larian berbanding 4 hingga 12. Belanjakan 3 USD untuk mengetahui sama ada model murah berfungsi sebelum membelanjakan 12 USD untuk model yang mahal. ACT berbanding SmolVLA dan GR00T N1.7 berbanding Pi0.5 menunjukkan di mana setiap satu berhenti menjadi jawapan yang betul; arena model mempunyai 85 model dan 332 hasil penanda aras.
3. GPU yang anda terlupa
Kesilapan paling murah untuk dicegah dan yang paling biasa dilakukan. Sebuah instans yang dimulakan pada hari Jumaat untuk menyahpepijat sesuatu akan dibilkan sepanjang hujung minggu pada kadar yang sama dengan larian sebenar.
| Kad | Kadar median dalam tangkapan | Terbiar selama 24 j | Terbiar selama 7 hari | Nilainya |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | kira-kira 27 larian SmolVLA atau ACT pada 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | kira-kira 12 larian GR00T pada 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | kira-kira 38 larian GR00T pada 8 USD |
Pada AY-Robots, kegagalan ini direka bentuk untuk inferens: pod yang disediakan oleh API inferens membawa pengawas terbiar dan memusnahkan diri selepas tempoh terbiar. Jika anda menyewa kad itu sendiri, pengawas itu adalah peringatan kalendar anda.
4. Membayar dua kali untuk jawapan yang sama
Titik masuk penalaan halus GR00T ialah CLI tyro yang tidak mendedahkan sebarang benih. Itu bukan batasan platform, ia adalah alat huluan: tiada medan benih dalam gr00t/configs/finetune_config.py, dan petua latihan repositori sendiri memberi amaran bahawa larian berbeza sebanyak 5 hingga 6 peratus kerana augmentasi imej adalah tidak deterministik. lerobot lalai kepada benih 1000 dalam kedua-dua 0.5.1 dan 0.6.1, jadi larian ACT, SmolVLA dan Pi0.5 sekurang-kurangnya boleh dijalankan semula dari inisialisasi dan susunan data yang sama. Itu bukan janji berat bit-identik pada GPU, tetapi ia adalah perbezaan antara larian semula dan eksperimen baharu. Jika larian GR00T menghasilkan polisi yang berfungsi dan anda tidak menyimpan titik semak, anda membayar harga penuh untuk hasil yang mungkin berbeza lebih daripada perbezaan yang anda kejar. Terdapat cara kedua untuk kehilangan titik semak yang anda bayar: CLI lalai kepada --save-total-limit 5, didokumenkan sebagai bilangan maksimum titik semak yang disimpan sebelum yang lebih lama dipadamkan. Storan adalah sen; larian semula adalah 4 hingga 12 USD dan enam jam.
Harga bidaan di atas adalah sebahagian kecil daripada kadar atas permintaan, dan vast.ai mengatakan sistem bidaan boleh mengurangkan kos pelanggan sebanyak lima puluh peratus atau lebih. Kekurangannya, dalam kata-kata mereka sendiri: instans boleh diganggu boleh dijeda pada bila-bila masa jika pengguna lain membida lebih tinggi atau penyewaan atas permintaan dicipta untuk sumber yang sama, dan jeda itu "menghentikan semua proses yang sedang berjalan". Atas permintaan sentiasa diutamakan. Ini baik untuk jalankan yang menulis checkpoint setiap beberapa ratus langkah, tetapi kerugian besar untuk yang menulis pada akhir, yang mana itulah yang diberikan oleh tetapan lalai: Isaac-GR00T CLI menulis setiap --save-steps (lalai 1000), tetapi --save_freq lerobot lalai kepada 20,000 langkah, jadi jalankan SmolVLA lalai membuat checkpoint sekali, di garisan penamat. Turunkannya, atau jangan membida. Borang latihan AY-Robots mendedahkan tombol GR00T sebagai saveSteps.
- Kadar jam terendah yang ada.
- Kawalan penuh imej, versi CUDA, semakan lerobot atau Isaac-GR00T dan setiap bendera.
- Bidaan boleh diganggu mengurangkan kadar separuh jika jalankan anda membuat checkpoint cukup kerap untuk bertahan daripada jeda.
- Tiada apa-apa yang diabstrakkan, jadi apabila jalankan berkelakuan pelik anda boleh melihat sebabnya.
- Persediaan dibilkan pada kadar GPU: pemacu, kebergantungan, checkpoint asas berbilang gigabait dan muat turun set data semuanya berharga sama setiap jam seperti latihan.
- Instans boleh diganggu yang dibida lebih tinggi dijeda dan prosesnya dihentikan. Jalankan yang tidak disimpan adalah wang yang dibakar, dan lalai lerobot menulis checkpoint pertamanya pada langkah 20,000.
- Tiada apa-apa yang memusnahkan pod untuk anda. Jadual terbiar di atas adalah bil untuk terlupa.
- Bekalan untuk kad 80 GB penuh tunggal adalah nipis: dua tawaran kad penuh A100 80 GB dan lima H100 80 GB dalam bacaan ini. Penyenaraian juga berubah-ubah, jadi harga tersenarai termurah dan harga yang anda boleh sewa sebenarnya bukan nombor yang sama.
- Setiap jam pada infrastruktur adalah jam yang tidak dihabiskan untuk merekodkan episod yang menentukan sama ada polisi berfungsi.
Melakukannya sendiri berbanding membiarkan platform menyewa kad
Anda memilih mesin, membina persekitaran dan memusnahkan pod. Kadar jam adalah kadar pasaran di atas; selebihnya adalah masa anda.
- Cari kad yang sepadan dengan VRAM yang diperlukan oleh model: 24 GB untuk ACT dan SmolVLA, 80 GB untuk GR00T dan Pi0.5.
- Sewa atas permintaan jika jalankan tidak dapat bertahan daripada jeda, boleh diganggu jika ia kerap membuat checkpoint.
- Pasang toolchain: lerobot untuk ACT, SmolVLA dan Pi0.5, repositori Isaac-GR00T dengan pelancar tyro sendiri untuk GR00T.
- Tukar set data jika perlu. Set data LeRobot v3.0 menyebabkan pemuat GR00T ranap dan mesti ditukar kepada v2.1.
- Lancarkan, perhatikan kerugian, tolak checkpoint ke tempat yang tahan lama semasa ia ditulis.
- Musnahkan instans, kemudian semak bahawa anda telah memusnahkannya.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Kos realistik untuk satu jalankan GR00T: 3 hingga 6 jam pada H100 80 GB pada 1.34 hingga 2.34 USD sejam adalah 4 hingga 14 USD, ditambah 20 hingga 40 minit persediaan yang juga dibilkan, ditambah masa anda sendiri.
Anda memilih model, set data dan hiperparameter dalam borang. Backend menyewa GPU spot bersaiz mengikut VRAM yang diperlukan oleh model, menjalankan trainer dan menulis checkpoint ke storan objek.
- Pilih kombinasi anda pada matriks latihan: lima model, empat lengan, satu panduan setiap sel.
- Halakan ia ke set data: yang direkodkan dengan klien desktop, ID repo Hugging Face, atau satu dari mesin anda sendiri.
- Terima tetapan lalai atau laraskannya. Jadual di atas adalah apa yang sebenarnya dihantar kepada trainer.
- Backend memilih kad mengikut VRAM yang diperlukan, jadi anda tidak perlu mencari GPU.
- Checkpoint mendarat dalam storan objek semasa ia ditulis, jadi jalankan yang terganggu bukanlah jalankan yang hilang.
| Tahap | Model | Masa jalankan | Kos setiap jalankan |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | kira-kira 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | kira-kira 1 to 3 USD |
Apa yang tidak dilakukannya: menjadikan set data yang buruk menjadi baik, memberikan GR00T seed yang tidak pernah dimilikinya, atau menghapuskan had latensi yang diterangkan di bawah. Ia menghapuskan pencarian GPU, pembinaan persekitaran dan pod yang anda terlupa untuk musnahkan. Mekanismenya ada dalam dokumen latihan.
Apa yang dicaj oleh platform dan bagaimana ia memilih kad
Logiknya sengaja membosankan. Setiap model dalam katalog, mengisytiharkan tahap GPU; bahagian belakang mengambil VRAM yang diperlukan dan menyewa kad yang sepadan di pasaran spot yang sama seperti yang diukur di atas. Itulah sebabnya kos yang disebut adalah julat, bukan harga. GR00T dan Pi0.5 adalah khusus awan di sini kerana had bawah 40 GB dan 70 GB. SmolVLA dan ACT juga berjalan secara tempatan pada kad 24 GB anda sendiri, di mana kos awan adalah sifar dan elektrik adalah masalah anda.

Satu tetapan memerlukan amaran. Pengumpulan gradien benar-benar terpakai untuk kedua-dua varian GR00T, jadi meningkatkannya akan membeli kelompok efektif yang lebih besar pada kad yang sama. Untuk Pi0.5 dan SmolVLA ia tidak terpakai sama sekali: lerobot 0.5.1 tidak mempunyai pilihan pengumpulan gradien dalam konfigurasi latihannya, jadi menetapkan medan kepada 16 tidak menelan belanja apa-apa dan tidak membeli apa-apa. Jika pekerjaan yang beratur tidak pernah bermula, halaman tersekat dalam barisan meliputi apa yang perlu diperiksa; jika set data ditolak sebelum larian bermula, ia hampir selalu masalah format v3.0.
GPU sewaan yang menghidangkan polisi anda melalui internet awam menambah perjalanan pergi balik kepada gelung kawalan yang sudah pun 20 hingga 485 ms setiap langkah tindakan. Baik untuk pilih-dan-letak yang perlahan, tidak sesuai untuk gerakan reaktif yang pantas. Inferens awan menilai titik semak dengan baik dan menjalankan manipulasi pengeluaran dengan teruk: jika tugas memerlukan kelajuan, pengiraan perlu berada di sebelah servo, dan itu adalah kos yang tidak dapat dihilangkan oleh artikel ini. Lihat kependaman inferens.
Anggaran terperinci untuk polisi kerja pertama
Kesemua empat baris bersama, bermula dari kosong. Jumlah GPU mengandaikan 3 hingga 5 larian: yang pertama membuktikan saluran paip berfungsi, yang kedua mendedahkan masalah data, yang ketiga atau keempat adalah yang anda simpan.
| Baris | Laluan Jimat | Laluan Selesa |
|---|---|---|
| Lengan | SO-100 pengikut sahaja, 121.94 USD dalam BOM | pemimpin tambah pengikut, 229.88 USD dalam BOM |
| Model | SmolVLA atau ACT, peringkat 24 GB | GR00T N1.7, A100 80 GB atau peringkat H100 |
| Episod direkodkan | 30, minimum SmolVLA | 50 hingga 100 |
| Masa manusia untuk merekod | kira-kira 1 j 12 min | 2 hingga 4 jam |
| Kos satu larian | 1 hingga 3 USD | 4 hingga 12 USD |
| Larian sebelum ia berfungsi | 3 hingga 5 | 3 hingga 5 |
| Jumlah perbelanjaan GPU | 3 hingga 15 USD | 12 hingga 60 USD |
| Baris terbesar dalam bil | lengan, kemudian masa anda | lengan, kemudian masa anda |
Corak ini kekal pada saiz robot ini: pengiraan adalah ralat pembundaran, perkakasan adalah kos sekali sahaja yang sebenar, jam manusia adalah perbelanjaan berulang. Untuk menguji separuh latihan sebelum membeli apa-apa, membolehkan anda membandingkan model dan menyewa GPU tanpa lengan, dan ialah SO-100 fizikal yang boleh anda pandu dalam pelayar tanpa pendaftaran. Untuk keseluruhan saluran paip dari hujung ke hujung, merangkumi persediaan, dan latihan, dan ialah versi ringkas.

Berapakah kos satu larian penalaan halus VLA dari hujung ke hujung?▾
Kira-kira 4 hingga 12 USD untuk GR00T N1.7, GR00T N1.5 atau Pi0.5 pada tier A100 80 GB atau H100 (3 hingga 6 jam pada 1.20 hingga 2.00 USD sejam), dan kira-kira 1 hingga 3 USD untuk SmolVLA atau ACT pada tier RTX 4090 (2 hingga 5 jam pada 0.30 hingga 0.60 USD sejam). Menyewa kad sendiri akan berada dalam julat yang sama setelah masa persediaan diambil kira, kerana ia dibilkan pada kadar latihan.
Adakah H100 berbaloi untuk dibayar berbanding A100 80 GB?▾
Untuk satu polisi SO-100, biasanya tidak. Kedua-duanya melepasi had memori yang diperlukan oleh GR00T dan Pi0.5, dan pada 23 Ogos 2026, A100 80 GB penuh bermula pada 0.44 USD sejam berbanding 1.34 untuk H100 80 GB. H100 selesai lebih cepat, jadi sebahagian daripada kadar itu kembali sebagai jam yang lebih sedikit, tetapi jumlah keseluruhan masih lebih tinggi untuk larian sekecil ini. Hujah sebenar untuk H100 adalah ketersediaan: lima tawaran H100 80 GB tunggal di pasaran itu berbanding dua A100 80 GB, dan kad yang tidak boleh anda sewa tiada harga.
Berapa banyak larian yang diperlukan sebelum polisi benar-benar berfungsi?▾
Rancang untuk tiga hingga lima. Yang pertama membuktikan saluran paip disambungkan dengan betul. Yang kedua biasanya mendedahkan masalah set data seperti aliran kamera yang terhenti di tengah jalan. Yang ketiga atau keempat adalah yang anda simpan.
Bolehkah saya melatih SmolVLA atau ACT pada GPU saya sendiri dan bukannya menyewa?▾
Ya. Kedua-duanya disokong secara tempatan pada AY-Robots dan kedua-duanya muat dengan selesa dalam 24 GB; kertas ACT asal melatih model 80Mnya dalam kira-kira 5 jam pada RTX 2080 Ti 11 GB. GR00T dan Pi0.5 adalah khusus awan di sini kerana had penalaan halus yang didokumenkan oleh vendor adalah 40 GB dan 70 GB, dan kad pengguna terbesar di pasaran ialah RTX 5090 32 GB.
Mengapa bilangan langkah yang sama mempunyai kos yang berbeza merentasi model?▾
Langkah-langkah tidak boleh dibandingkan merentasi polisi. ACT lalai kepada 100,000 langkah pada kelompok 8 pada kad 24 GB; GR00T N1.5 lalai kepada 2,000 langkah pada kelompok 1 dengan pengumpulan gradien 16 pada kad 80 GB. Bil adalah jam didarab dengan kadar kad yang memaksa anda menggunakannya berdasarkan jejak memori, bukan pembilang langkah.
Lihat kos larian anda sebelum anda memulakannya
Setiap daripada lima polisi menyenaraikan tier GPU, masa larian dan harga setiap larian, dan bahagian belakang latihan menyewa kad di pasaran spot yang sama di mana nombor-nombor ini diukur.
Semak hargaSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started