
Harga GPU pasar spot yang sebenarnya, berapa lama setiap dari lima kebijakan berjalan, berapa biaya lengan robot dan demonstrasi, dan empat tempat di mana uang diam-diam menghilang.
Versi singkat
- •Satu kali proses pada tingkat A100 80 GB atau H100 membutuhkan waktu 3 hingga 6 jam dan biaya sekitar 4 hingga 12 USD. Pada tingkat RTX 4090, dibutuhkan 2 hingga 5 jam dan sekitar 1 hingga 3 USD.
- •Diukur di vast.ai pada 13:44 UTC tanggal 23 Agustus 2026: RTX 4090 penuh sesuai permintaan seharga 0.13 hingga 0.38 USD/jam, A100 80 GB seharga 0.44 hingga 0.67, H100 80 GB seharga 1.34 hingga 2.34. Kartu 80 GB penuh langka, masing-masing dua dan lima penawaran kartu tunggal.
- •GPU adalah lini termurah. Daftar bahan SO-ARM100 menempatkan pasangan leader plus follower seharga 229.88 USD, yang setara dengan 77 hingga 230 kali proses pada tingkat 24 GB.
- •Dua jam seseorang merekam 50 episode biayanya lebih mahal daripada proses pelatihan yang menggunakan episode-episode tersebut.
- •Uang hilang di empat tempat: proses pada data yang rusak, model 3B pada tugas yang ditangani oleh kebijakan 80M, GPU yang tidak dihancurkan siapa pun, dan pengulangan hasil yang gagal Anda simpan.
- •AY-Robots menentukan ukuran kartu berdasarkan VRAM yang dibutuhkan model dan menyewanya di pasar spot yang sama, sehingga biaya proses adalah biaya pasar.
Tagihan memiliki empat lini, dan GPU adalah yang terkecil
Ketika orang bertanya berapa biaya untuk menyempurnakan model visi-bahasa-aksi untuk SO-100, mereka hampir selalu berarti sewa GPU. Itu adalah angka yang muncul sebagai tagihan pada kartu, jadi itu yang terasa nyata. Ini juga, dengan selisih yang lebar, yang terkecil dari empat angka yang menentukan berapa biaya sebenarnya dari kebijakan yang berfungsi.
| Lini | Apa itu | Ukuran tipikal untuk satu kebijakan yang berfungsi |
|---|---|---|
| GPU time | menyewa kartu untuk proses | 1 hingga 12 USD per proses, dan Anda akan melakukan 3 hingga 5 |
| The robot | servo, rangka cetak, kamera, kabel, daya | satu kali, 110 hingga 500 EUR per lengan |
| Human hours | seseorang menggerakkan lengan untuk merekam demo | 1 hingga 4 jam per dataset, diulang per tugas |
| Waste | data buruk, model terlalu besar, pod yang terlupakan | tidak terbatas, dan satu-satunya lini yang Anda kendalikan |
Waktu pelatihan di bawah ini berasal dari makalah dan repositori kelima model itu sendiri, biaya perangkat keras dari daftar bahan yang dipublikasikan, angka platform dari AY-Robots katalog kebijakan dan halaman harga. Jika platform tidak membantu, artikel ini menyatakannya.
Berapa biaya sebenarnya satu jam GPU di pasar spot
Tidak ada satu harga pun untuk satu jam A100. Di pasar seperti vast.ai, setiap host menetapkan tarifnya sendiri, dan jalur pelatihan yang Anda luncurkan akan mendarat di mesin mana pun yang murah dan tersedia pada saat itu. Jawaban jujurnya adalah sebuah distribusi. Berikut adalah datanya, diukur pada 23 Agustus 2026 pukul 13:44 UTC: kartu penuh tunggal, sesuai permintaan, disaring berdasarkan VRAM nyata.
| Kartu | vast.ai sesuai permintaan USD/jam (rendah / median / tinggi) | Penawaran kartu penuh | Harga dasar vast.ai | RunPod Komunitas / Aman | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | tidak ditawarkan |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | tidak ditawarkan |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 sebagai Ruang |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 sebagai titik akhir |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | tidak ditawarkan |
Penawaran sesuai permintaan untuk satu GPU penuh (gpu_frac == 1.0) dari API bundel publik vast.ai, yang tidak memerlukan akun, difilter berdasarkan gpu_ram sehingga hanya kartu 80 GB asli yang masuk ke baris 80 GB. Filter itu penting: dalam pembacaan ini, ketiga penawaran A100 SXM4 kartu tunggal adalah bagian 40 GB, begitu juga dua dari empat penawaran A100 PCIE, jadi menggabungkannya ke dalam satu baris "A100" akan mengurangi separuh harga yang dilaporkan di sini. Kolom Hugging Face mencampur dua produk: 2.50 USD/h adalah perangkat keras Spaces Nvidia A100 - large dan 4.50 USD/h adalah satu H100 80 GB di bawah Inference Endpoints, yang tidak ditawarkan oleh Spaces. Perlakukan median sebagai indikatif: baris A100 80 GB didasarkan pada dua penawaran dan baris H100 pada lima, dan kueri identik 36 detik kemudian mengembalikan jumlah 4090 yang berbeda dan harga tertinggi yang berbeda pada tiga dari lima baris. Harga daftar RunPod adalah angka yang lebih stabil untuk perencanaan.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Mengapa model 3B tidak dapat menggunakan kartu murah
Satu jam 4090 dan satu jam H100 80 GB berbeda kira-kira enam kali lipat pada median di atas. Yang memaksa Anda menggunakan kartu mahal bukanlah kecepatan, melainkan memori. openpi menetapkan batas bawah untuk fine-tune penuh Pi0.5 fine-tune sebesar 70 GB, dan NVIDIA merekomendasikan 40 GB atau lebih untuk GR00T. Perhatikan apa yang bukan merupakan angka GR00T. Konfigurasi fine-tune-nya membekukan model bahasa dan encoder visual secara default (tune_llm dan tune_visual adalah False, sedangkan proyektor dan diffusion head True), itulah sebabnya katalog mencantumkan sekitar 40 M parameter terlatih dari 3 B. 40 GB tersebut bukan merupakan status optimizer untuk bobot 3 B, melainkan backbone yang dibekukan ditambah aktivasi. Varian dengan cakupan yang lebih kecil membutuhkan lebih sedikit: jalur LoRA openpi membutuhkan 22.5 GB dan menyebutkan 4090, dan alur kerja Isaac Lab Arena NVIDIA mencantumkan opsi GPU tunggal 24 GB untuk GR00T pasca-pelatihan. Platform ini mengelompokkan berdasarkan batas bawah yang diterbitkan setiap vendor untuk konfigurasi yang benar-benar dijalankannya. Penjelasan flow-matching pi0 menjelaskan dari mana flow-matching jejak memori berasal.
| Pekerjaan | Memori yang dibutuhkan proyek hulu | Sumber |
|---|---|---|
| Inferensi pi0 / pi0.5 | lebih dari 8 GB, contoh RTX 4090 | openpi |
| Fine-tune LoRA pi0 / pi0.5 | lebih dari 22.5 GB, contoh RTX 4090 | openpi |
| Fine-tune penuh pi0 / pi0.5 | lebih dari 70 GB, contoh A100 80 GB atau H100 | openpi |
| Inferensi GR00T N1.7 | 1 GPU dengan 16 GB atau lebih | Isaac-GR00T |
| Fine-tune GR00T N1.7 | 40 GB atau lebih direkomendasikan, node H100 atau L40 | Isaac-GR00T |
| Fine-tune GR00T, apa yang dilatihnya | proyektor dan diffusion head; LLM dan encoder visual dibekukan secara default | finetune_config.py |
| Pasca-pelatihan GR00T, dikurangi | 1 GPU dengan 24 GB, model bahasa dibekukan | Isaac Lab Arena |
| Fine-tune SmolVLA | satu A100 untuk referensi 20.000 langkah | lerobot docs |
| Pelatihan ACT | satu RTX 2080 Ti 11 GB | ACT paper |
Tabel tersebut adalah alasan mengapa platform membagi kelima model menjadi dua tingkatan. GR00T N1.7, GR00T N1.5 dan Pi0.5 menggunakan A100 80 GB atau H100 karena itulah yang diminta oleh vendor. SmolVLA dan ACT menggunakan RTX 4090 atau kartu 24 GB lainnya karena itu memang sudah cukup.
GR00T atau Pi0.5 yang dijalankan pada kartu 24 GB tidak akan langsung gagal. Ia akan mengunduh checkpoint dasar, membangun indeks dataset, memulai forward pass pertama, dan kemudian mati setelah beberapa ratus langkah dengan kesalahan CUDA out-of-memory. Anda membayar untuk unduhan dan penyiapan tetapi tidak mendapatkan apa-apa. Perbaikan: memori habis selama pelatihan.
Berapa lama setiap dari lima model benar-benar berjalan
Waktu berjalan adalah separuh biaya lainnya: 2.00 USD per jam tidak relevan jika pekerjaan berlangsung 40 menit dan merugikan jika berlangsung 40 jam. Ini adalah pengaturan default yang benar-benar dikirim AY-Robots ke pelatih, beserta jendela waktu berjalan dan biaya untuk setiap tingkatan.
| Kebijakan | Tingkat GPU | Langkah maks default | Batch default (akumulasi gradien) | Jendela waktu berjalan | Biaya per jalankan |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, akum 1, berlaku | 3 hingga 6 jam | 4 hingga 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, akum 16, berlaku | 3 hingga 6 jam | 4 hingga 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, akum 16, tidak berpengaruh | 3 hingga 6 jam | 4 hingga 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, akum 8, tidak berpengaruh | 2 hingga 5 jam | 1 hingga 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, akum 1 | 2 hingga 5 jam | 1 hingga 3 USD |

Dari mana jendela waktu eksekusi tersebut berasal dari hulu
- SmolVLA: dokumentasi lerobot menyatakan bahwa 20.000 langkah membutuhkan waktu sekitar 4 jam pada satu A100. Platform menjalankan 20.000 langkah yang sama pada tingkatan 24 GB yang lebih murah, oleh karena itu ada jendela waktu daripada 4 jam datar.
- ACT: makalah ALOHA asli melaporkan sekitar 5 jam pada satu RTX 2080 Ti 11 GB untuk model 80M-parameter. Sebuah 4090 beberapa generasi lebih baru tetapi platform menganggarkan 100.000 langkah, sehingga jendela waktu berada di tempat yang sama.
- GR00T: alur kerja referensi NVIDIA untuk generasi N1.6 mengutip sekitar 4 hingga 8 jam untuk 20.000 langkah pada batch 24 di delapan kartu L40S, dan 2 hingga 3 jam untuk 30.000 langkah pada batch 16 di satu Ada 6000. Fine-tuning satu kartu dari VLA 3B dalam beberapa jam adalah normal, bukan optimis.
- Pi0.5: openpi tidak mempublikasikan angka waktu nyata, tetapi mempublikasikan batas bawah 70 GB untuk fine-tune penuh, yang menentukan kartu dan oleh karena itu lajunya.
Penting untuk berhenti sejenak pada angka yang tidak Anda bayar. Makalah GR00T N1 melaporkan sekitar 50.000 jam GPU H100 untuk melatih model 2.2B, pada kluster hingga 1024 GPU, dengan ukuran batch pelatihan 16.384 untuk 200.000 langkah gradien. Dengan biaya 1.34 hingga 2.34 USD per jam yang diukur di atas, itu setara dengan 67.000 hingga 117.000 USD untuk komputasi sewaan. Makalah SmolVLA menempatkan proyeknya sekitar 30.000 jam GPU di atas 481 dataset komunitas, 22.9K episode, dan 10.6M frame. Anda mewarisi semua itu dengan harga unduhan; 8 USD Anda membeli 20.000 langkah terakhir. Mengapa VLA dibangun dengan cara ini membahas pembagian tersebut.
Lengan robot: biaya satu kali yang jauh lebih besar daripada tagihan GPU
Satu sesi pelatihan berharga kurang dari makan siang. Robot tidak. Itulah mengapa SO-100 penting: ini adalah lengan termurah yang didukung oleh seluruh pembelajaran imitasi toolchain.
| Lengan | Servo | Tegangan | Biaya Komponen | Dukungan di AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | penuh, lengan referensi |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | penuh |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | kompatibel |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | kompatibel |
Daftar bahan baku (bill of materials) hulu di repositori SO-ARM100 lebih rinci dan patut diperiksa sesuai wilayah Anda: daftar Komponen Untuk Dua Lengan berjumlah 229.88 USD atau 226.30 EUR untuk konfigurasi pemimpin plus pengikut, dan daftar Komponen untuk Satu Lengan Pengikut berjumlah 121.94 USD atau 124.30 EUR. Enam servo STS3215 masing-masing seharga 13.89 USD adalah 83.34 dari 121.94 tersebut, jadi servo adalah lengan itu sendiri. Dengan biaya 1 hingga 3 USD per sesi SmolVLA atau ACT, sepasang lengan bernilai antara 77 hingga 230 sesi pelatihan. Jika Anda masih memilih, SO-100 versus SO-101 adalah perbandingan yang penting, karena keduanya cukup mirip sehingga keputusan lebih tentang ketersediaan daripada kemampuan.
STS3215 tersedia dalam varian 7.4 V dan 12 V; repositori mencatat bahwa komponen 12 V juga memerlukan catu daya 12 V 5 A alih-alih yang 5 V, sehingga keduanya tidak dapat dipertukarkan. Memberi daya 12 V ke servo 7.4 V akan merusaknya, dan enam servo merupakan dua pertiga dari biaya komponen lengan pengikut. Periksa label pada setiap servo sebelum penyalaan pertama. Jika servo sudah berperilaku aneh: servo tidak merespons, lengan berkedut lalu melorot.
Jam kerja manusia: baris yang tidak pernah dimasukkan siapa pun ke dalam spreadsheet
Inilah angka yang membalikkan diskusi biaya. Merekam demonstrasi adalah seseorang yang menggerakkan lengan robot, satu episode pada satu waktu, secara real-time. Tidak ada pemrosesan batch dan tidak ada penyewaan per detik. Perekam dataset LeRobot dilengkapi dengan pengaturan default yang membuat perhitungan mudah, ketiganya dikonfirmasi dalam DatasetRecordConfig: 60 detik per episode, 60 detik untuk mengatur ulang adegan, 50 episode. Kolom uang di bawah mengasumsikan 15 USD untuk satu jam waktu seseorang, yang merupakan asumsi daripada angka platform. Ganti dengan tarif Anda sendiri; rasio adalah intinya.
- 1Rekam dataset dengan pengaturan default yang sebenarnya akan Anda bayar
Ini adalah lerobot 0.6.1, versi di PyPI per 3 Agustus 2026. Perhatikan bentuk CLI: perekaman berjalan melalui titik masuk konsol
lerobot-record(lerobot.scripts.lerobot_record), bukan jalur modul lamapython -m lerobot.scripts.record. AY-Robots menargetkan 0.5.1, dan wheel 0.5.1 mendeklarasikan titik masuklerobot-recorddanlerobot-trainyang sama, sehingga bentuk di bawah ini stabil di keduanya. Tiga flag waktu adalah default upstream, jadi ini juga perintah yang diasumsikan dalam perhitungan tabel berikutnya.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Lihat apa yang Anda rekam sebelum Anda menyewa satu menit GPU pun
Memeriksa dataset tidak memakan biaya nol USD per jam. Menemukan masalah yang sama dari kurva kerugian memakan biaya 2.00 USD per jam pada tingkat H100 dan memberi tahu Anda empat jam terlambat. Dorong dataset dan periksa di penampil LeRobot, atau jelajahi direktori dataset AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Latih, dan pastikan checkpoint bertahan lebih lama dari pod
Mesin sewaan bersifat sementara berdasarkan definisi, jadi tulis checkpoint di tempat yang tahan lama selama proses berjalan. Dua flag menentukan apakah Anda menyimpan apa yang Anda bayar.
--save_freqdefaultnya adalah 20.000 langkah, jadi proses SmolVLA default 20.000 langkah menulis checkpoint pertamanya saat proses sudah selesai; turunkan sebelum Anda menyewa apa pun yang dapat diinterupsi.--save_checkpoint_to_hubmemerlukan--policy.repo_iddan tidak ada di lerobot 0.5.1, jadi pada versi tersebut Anda menyalin direktori output dari mesin sendiri. Ukuran batch di bawah adalah contoh dari dokumen upstream; formulir AY-Robots mengirimkan 2 untuk SmolVLA dan menulis ke penyimpanan objek saat checkpoint muncul.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episode | Perekaman pada 60 d | Reset pada 60 d | Waktu nyata | Ditambah 20 persen perekaman ulang | Dengan 15 USD per jam kerja manusia |
|---|---|---|---|---|---|
| 30, minimum SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, empat minimum lainnya | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, dataset yang nyaman | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Bandingkan kolom kanan dengan biaya operasional 1 hingga 12 USD. Dengan asumsi tarif tersebut, dataset 50 episode membutuhkan biaya perekaman dua hingga tujuh kali lipat dari biaya pelatihannya, sebelum kalibrasi, pengaturan kamera, dan episode yang Anda buang. Itulah mengapa memiliki nilai finansial langsung. Panduan lerobot menyarankan setidaknya 50 episode dengan 10 per lokasi objek; dokumen SmolVLA melaporkan bahwa versi 25 episode dari tugas yang sama tidak cukup.
Di Mana Uang Sebenarnya Hilang
1. Berjalan pada data yang tidak akan pernah berhasil
Sebuah eksekusi GR00T 20.000 langkah pada dataset dengan dua aliran kamera yang tertukar biayanya sama dengan eksekusi pada dataset bersih, memakan waktu yang sama, dan menghasilkan kurva kerugian yang terlihat baik-baik saja. Kegagalan muncul pada lengan robot, beberapa jam kemudian. ditagih per jam dan diagnosis ditagih dalam hitungan hari. Dua gejala yang patut diingat: biasanya berarti observasi tidak membawa apa yang dibutuhkan tugas, dan berarti dataset memiliki variasi yang lebih sedikit dari yang Anda kira.
2. Membayar harga model dasar untuk tugas kamera tetap
ACT memiliki sekitar 80 juta parameter dan dirancang untuk dilatih dari awal dengan 50 demonstrasi satu tugas. GR00T N1.7 memiliki sekitar 3 miliar parameter dengan backbone yang sudah dilatih. Untuk kamera yang terpasang, meja tetap, dan satu objek, model 80 juta seringkali berhasil, berjalan sekitar 20 ms per langkah tindakan alih-alih 152 ms, dan biayanya 1 hingga 3 USD per eksekusi alih-alih 4 hingga 12. Habiskan 3 USD untuk mencari tahu apakah model murah berfungsi sebelum menghabiskan 12 USD untuk model yang mahal. ACT melawan SmolVLA dan GR00T N1.7 melawan Pi0.5 menunjukkan di mana masing-masing berhenti menjadi jawaban yang tepat; arena model memiliki 85 model dan 332 hasil benchmark.
3. GPU yang Anda lupakan
Kesalahan termurah untuk dicegah dan yang paling umum dilakukan. Sebuah instance yang dimulai pada hari Jumat untuk melakukan debug akan ditagih sepanjang akhir pekan dengan tarif yang sama dengan eksekusi nyata.
| Kartu | Tarif median dalam snapshot | Menganggur selama 24 jam | Menganggur selama 7 hari | Itu bernilai |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | sekitar 27 kali jalankan SmolVLA atau ACT seharga 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | sekitar 12 kali jalankan GR00T seharga 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | sekitar 38 kali jalankan GR00T seharga 8 USD |
Pada AY-Robots, kegagalan ini dihilangkan untuk inferensi: pod yang disediakan oleh API inferensi membawa pengawas idle dan menghancurkan dirinya sendiri setelah periode idle. Jika Anda menyewa kartu itu sendiri, pengawas itu adalah pengingat kalender Anda.
4. Membayar dua kali untuk jawaban yang sama
Titik masuk fine-tuning GR00T adalah CLI tyro yang tidak mengekspos seed apa pun. Itu bukan batasan platform, melainkan alat hulu: tidak ada bidang seed di gr00t/configs/finetune_config.py, dan tips pelatihan repositori itu sendiri memperingatkan bahwa hasil jalankan bervariasi 5 hingga 6 persen karena augmentasi gambar bersifat non-deterministik. lerobot secara default menggunakan seed 1000 di 0.5.1 dan 0.6.1, sehingga jalankan ACT, SmolVLA, dan Pi0.5 setidaknya dapat dijalankan ulang dari inisialisasi dan urutan data yang sama. Itu bukan janji bobot yang identik bit pada GPU, tetapi itu adalah perbedaan antara jalankan ulang dan eksperimen baru. Jika jalankan GR00T menghasilkan kebijakan yang berfungsi dan Anda tidak menyimpan titik pemeriksaan, Anda membayar harga penuh untuk hasil yang mungkin berbeda lebih dari perbedaan yang Anda kejar. Ada cara kedua untuk kehilangan titik pemeriksaan yang Anda bayar: CLI secara default menggunakan --save-total-limit 5, yang didokumentasikan sebagai jumlah maksimum titik pemeriksaan yang disimpan sebelum yang lebih lama dihapus. Penyimpanan hanya sen; jalankan ulang adalah 4 hingga 12 USD dan enam jam.
Batas tawaran di atas adalah sebagian kecil dari tarif sesuai permintaan, dan vast.ai mengatakan sistem penawaran dapat memangkas biaya klien hingga lima puluh persen atau lebih. Kendalanya, dalam kata-katanya sendiri: instans yang dapat diinterupsi dapat dijeda kapan saja jika pengguna lain menawar lebih tinggi atau sewa sesuai permintaan dibuat untuk sumber daya yang sama, dan jeda tersebut "menghentikan semua proses yang sedang berjalan". Sesuai permintaan selalu diutamakan. Baik untuk proses yang menulis checkpoint setiap beberapa ratus langkah, kerugian total untuk proses yang menulis di akhir, yang persis seperti yang diberikan oleh pengaturan default: CLI Isaac-GR00T menulis setiap --save-steps (default 1000), tetapi --save_freq lerobot defaultnya 20.000 langkah, jadi proses SmolVLA default membuat checkpoint sekali, di garis akhir. Turunkan, atau jangan menawar. Formulir pelatihan AY-Robots mengekspos pengaturan GR00T sebagai saveSteps.
- Tarif per jam terendah yang ada.
- Kontrol penuh atas citra, versi CUDA, revisi lerobot atau Isaac-GR00T, dan setiap flag.
- Penawaran yang dapat diinterupsi memangkas tarif menjadi setengah jika proses Anda membuat checkpoint cukup sering untuk bertahan dari jeda.
- Tidak ada yang diabstraksikan, jadi ketika proses berjalan aneh Anda bisa melihat alasannya.
- Penyiapan ditagih dengan tarif GPU: driver, dependensi, checkpoint dasar multi-gigabyte, dan unduhan dataset semuanya berharga sama per jam dengan pelatihan.
- Instans yang dapat diinterupsi yang kalah tawaran dijeda dan prosesnya dihentikan. Proses yang tidak disimpan adalah uang yang terbuang, dan default lerobot menulis checkpoint pertamanya pada langkah 20.000.
- Tidak ada yang menghancurkan pod untuk Anda. Tabel idle di atas adalah tagihan karena lupa.
- Pasokan untuk kartu 80 GB penuh tunggal tipis: dua penawaran kartu penuh A100 80 GB dan lima H100 80 GB dalam bacaan ini. Daftar juga berputar, jadi harga terdaftar termurah dan harga yang sebenarnya dapat Anda seewa bukanlah angka yang sama.
- Setiap jam pada infrastruktur adalah jam yang tidak dihabiskan untuk merekam episode yang menentukan apakah kebijakan berfungsi.
Melakukannya sendiri versus membiarkan platform menyewa kartu
Anda memilih mesin, membangun lingkungan, dan menghancurkan pod. Tarif per jam adalah tarif pasar di atas; selebihnya adalah waktu Anda.
- Temukan kartu yang sesuai dengan VRAM yang dibutuhkan model: 24 GB untuk ACT dan SmolVLA, 80 GB untuk GR00T dan Pi0.5.
- Sewa sesuai permintaan jika proses tidak dapat bertahan dari jeda, dapat diinterupsi jika sering membuat checkpoint.
- Instal toolchain: lerobot untuk ACT, SmolVLA, dan Pi0.5, repositori Isaac-GR00T dengan peluncur tyro-nya sendiri untuk GR00T.
- Konversi dataset jika diperlukan. Dataset LeRobot v3.0 menyebabkan loader GR00T crash dan harus dikonversi ke v2.1.
- Luncurkan, pantau loss, dorong checkpoint ke tempat yang tahan lama saat ditulis.
- Hancurkan instance, lalu periksa apakah Anda sudah menghancurkannya.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Biaya realistis untuk satu proses GR00T: 3 hingga 6 jam pada H100 80 GB dengan tarif 1.34 hingga 2.34 USD per jam adalah 4 hingga 14 USD, ditambah 20 hingga 40 menit pengaturan yang juga dikenakan biaya, ditambah waktu Anda sendiri.
Anda memilih model, dataset, dan hyperparameter dalam sebuah formulir. Backend menyewa GPU spot yang ukurannya disesuaikan dengan VRAM yang dibutuhkan model, menjalankan trainer, dan menulis checkpoint ke penyimpanan objek.
- Pilih kombinasi Anda di matriks pelatihan: lima model, empat lengan, satu panduan per sel.
- Arahkan ke dataset: yang direkam dengan klien desktop, ID repo Hugging Face, atau dari mesin Anda sendiri.
- Terima pengaturan default atau sesuaikan. Tabel di atas adalah apa yang sebenarnya dikirim ke trainer.
- Backend memilih kartu berdasarkan VRAM yang dibutuhkan, jadi Anda tidak perlu mencari GPU.
- Checkpoint disimpan di penyimpanan objek saat ditulis, jadi proses yang terinterupsi bukanlah proses yang hilang.
| Tingkat | Model | Waktu proses | Biaya per proses |
|---|---|---|---|
| A100 80 GB atau H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 hingga 6 jam | sekitar 4 hingga 12 USD |
| RTX 4090 atau kartu 24 GB lainnya | SmolVLA, ACT | 2 hingga 5 jam | sekitar 1 hingga 3 USD |
Apa yang tidak dilakukannya: membuat dataset yang buruk menjadi baik, memberi GR00T seed yang tidak pernah dimilikinya, atau menghilangkan batas latensi yang dijelaskan di bawah. Ini menghilangkan pencarian GPU, pembangunan lingkungan, dan pod yang Anda lupa hancurkan. Mekanismenya ada di dokumen pelatihan.
Berapa biaya platform dan bagaimana platform memilih kartu
Logikanya sengaja dibuat sederhana. Setiap model di katalog menyatakan tingkatan GPU; backend mengambil VRAM yang dibutuhkan dan menyewa kartu yang cocok di pasar spot yang sama seperti yang diukur di atas. Itulah mengapa biaya yang dikutip adalah rentang, bukan harga. GR00T dan Pi0.5 hanya tersedia di cloud di sini karena batas bawah 40 GB dan 70 GB. SmolVLA dan ACT juga berjalan secara lokal di kartu 24 GB Anda sendiri, di mana biaya cloud adalah nol dan listrik adalah masalah Anda.

Satu pengaturan perlu diperhatikan. Akumulasi gradien benar-benar berlaku untuk kedua varian GR00T, jadi meningkatkannya akan menghasilkan batch efektif yang lebih besar pada kartu yang sama. Untuk Pi0.5 dan SmolVLA, ini sama sekali tidak berlaku: lerobot 0.5.1 tidak memiliki opsi akumulasi gradien dalam konfigurasi pelatihannya, jadi mengatur bidang ke 16 tidak memakan biaya dan tidak menghasilkan apa-apa. Jika pekerjaan yang diantrekan tidak pernah dimulai, halaman pekerjaan yang macet dalam antrean membahas apa yang harus diperiksa; jika dataset ditolak sebelum proses dimulai, itu hampir selalu masalah format v3.0.
GPU sewaan yang melayani kebijakan Anda melalui internet publik menambah waktu bolak-balik ke loop kontrol yang sudah 20 hingga 485 ms per langkah tindakan. Baik untuk tugas pick-and-place yang lambat, tidak untuk gerakan reaktif yang cepat. Inferensi cloud mengevaluasi checkpoint dengan baik tetapi menjalankan manipulasi produksi dengan buruk: jika tugas membutuhkan kecepatan, komputasi harus berada di dekat servo, dan itu adalah biaya yang tidak dapat dihilangkan oleh artikel ini. Lihat latensi inferensi.
Anggaran terperinci untuk kebijakan kerja pertama
Keempat baris secara bersamaan, dimulai dari nol. Total GPU mengasumsikan 3 hingga 5 kali percobaan: yang pertama membuktikan pipeline berfungsi, yang kedua mengungkap masalah data, yang ketiga atau keempat adalah yang Anda pertahankan.
| Baris | Jalur hemat | Jalur nyaman |
|---|---|---|
| Lengan | SO-100 follower only, 121.94 USD in the BOM | leader plus follower, 229.88 USD in the BOM |
| Model | SmolVLA or ACT, 24 GB tier | GR00T N1.7, A100 80 GB or H100 tier |
| Episode direkam | 30, minimum SmolVLA | 50 hingga 100 |
| Waktu manusia untuk merekam | sekitar 1 j 12 mnt | 2 hingga 4 jam |
| Biaya satu kali percobaan | 1 hingga 3 USD | 4 hingga 12 USD |
| Percobaan sebelum berhasil | 3 hingga 5 | 3 hingga 5 |
| Total pengeluaran GPU | 3 hingga 15 USD | 12 hingga 60 USD |
| Item terbesar di tagihan | lengan, lalu waktu Anda | lengan, lalu waktu Anda |
Pola ini berlaku pada ukuran robot ini: komputasi adalah kesalahan pembulatan, perangkat keras adalah biaya satu kali yang nyata, jam kerja manusia adalah pengeluaran berulang. Untuk menguji bagian pelatihan sebelum membeli apa pun, titik masuk tanpa perangkat keras memungkinkan Anda membandingkan model dan menyewa GPU tanpa lengan robot, dan lengan robot langsung adalah SO-100 fisik yang dapat Anda kendalikan di browser tanpa perlu mendaftar. Untuk seluruh pipeline secara menyeluruh, panduan SO-100 lengkap mencakup pengaturan, teleoperasi dan pelatihan, dan latih kebijakan pertama Anda adalah versi singkatnya.

Berapa biaya satu kali proses fine-tuning VLA secara menyeluruh?▾
Sekitar 4 hingga 12 USD untuk GR00T N1.7, GR00T N1.5, atau Pi0.5 pada tier A100 80 GB atau H100 (3 hingga 6 jam dengan biaya 1.20 hingga 2.00 USD per jam), dan sekitar 1 hingga 3 USD untuk SmolVLA atau ACT pada tier RTX 4090 (2 hingga 5 jam dengan biaya 0.30 hingga 0.60 USD per jam). Menyewa kartu sendiri akan berada dalam kisaran yang sama setelah waktu penyiapan dihitung, karena ditagih dengan tarif pelatihan.
Apakah H100 sepadan untuk dibayar dibandingkan A100 80 GB?▾
Untuk satu kebijakan SO-100, biasanya tidak. Keduanya memenuhi batas memori yang dibutuhkan GR00T dan Pi0.5, dan pada pembacaan 23 Agustus 2026, A100 80 GB penuh dimulai dari 0.44 USD per jam dibandingkan 1.34 untuk H100 80 GB. H100 selesai lebih cepat, jadi sebagian dari tarif kembali sebagai jam yang lebih sedikit, tetapi totalnya masih lebih tinggi untuk proses sekecil ini. Argumen sebenarnya untuk H100 adalah ketersediaan: lima penawaran H100 80 GB tunggal di pasar tersebut dibandingkan dua A100 80 GB, dan kartu yang tidak dapat Anda sewa tidak memiliki harga.
Berapa kali percobaan yang dibutuhkan sebelum sebuah kebijakan benar-benar berfungsi?▾
Rencanakan tiga hingga lima. Yang pertama membuktikan bahwa pipeline terhubung dengan benar. Yang kedua umumnya mengungkap masalah dataset seperti aliran kamera yang mati di tengah jalan. Yang ketiga atau keempat adalah yang Anda pertahankan.
Bisakah saya melatih SmolVLA atau ACT di GPU saya sendiri alih-alih menyewa?▾
Ya. Keduanya didukung secara lokal di AY-Robots dan keduanya muat dengan nyaman di 24 GB; makalah ACT asli melatih model 80M-nya dalam sekitar 5 jam pada RTX 2080 Ti 11 GB. GR00T dan Pi0.5 hanya berbasis cloud di sini karena batas fine-tuning yang didokumentasikan vendor adalah 40 GB dan 70 GB, dan kartu konsumen terbesar di pasar adalah RTX 5090 32 GB.
Mengapa jumlah langkah yang sama memiliki biaya yang berbeda di antara model?▾
Langkah-langkah tidak dapat dibandingkan antar kebijakan. ACT secara default menggunakan 100.000 langkah pada batch 8 di kartu 24 GB; GR00T N1.5 secara default menggunakan 2.000 langkah pada batch 1 dengan akumulasi gradien 16 di kartu 80 GB. Tagihan adalah jam dikalikan dengan tarif kartu yang dipaksakan oleh jejak memori, bukan penghitung langkah.
Lihat berapa biaya proses Anda sebelum memulainya
Setiap dari lima kebijakan mencantumkan tier GPU, waktu berjalan, dan harga per proses, dan backend pelatihan menyewa kartu di pasar spot yang sama tempat angka-angka ini diukur.
Periksa hargaSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started