Tabel biaya AY-Robots yang menunjukkan GPU mana yang dibutuhkan oleh setiap dari lima kebijakan, waktu berjalan tipikal dan harga per jalannya, dan berapa banyak episode yang dibutuhkan sebelum kebijakan tersebut berguna
pelatihan VLAbiaya GPUSO-100fine-tuningpembelajaran robotpenganggaran

Biaya Pelatihan VLA: Berapa Biaya Sebenarnya dari Satu Kali Fine-Tuning

AY-Robots ResearchAugust 23, 202623 menit baca

Harga GPU pasar spot yang sebenarnya, berapa lama setiap dari lima kebijakan berjalan, berapa biaya lengan robot dan demonstrasi, dan empat tempat di mana uang diam-diam menghilang.

Versi singkat

  • Satu kali proses pada tingkat A100 80 GB atau H100 membutuhkan waktu 3 hingga 6 jam dan biaya sekitar 4 hingga 12 USD. Pada tingkat RTX 4090, dibutuhkan 2 hingga 5 jam dan sekitar 1 hingga 3 USD.
  • Diukur di vast.ai pada 13:44 UTC tanggal 23 Agustus 2026: RTX 4090 penuh sesuai permintaan seharga 0.13 hingga 0.38 USD/jam, A100 80 GB seharga 0.44 hingga 0.67, H100 80 GB seharga 1.34 hingga 2.34. Kartu 80 GB penuh langka, masing-masing dua dan lima penawaran kartu tunggal.
  • GPU adalah lini termurah. Daftar bahan SO-ARM100 menempatkan pasangan leader plus follower seharga 229.88 USD, yang setara dengan 77 hingga 230 kali proses pada tingkat 24 GB.
  • Dua jam seseorang merekam 50 episode biayanya lebih mahal daripada proses pelatihan yang menggunakan episode-episode tersebut.
  • Uang hilang di empat tempat: proses pada data yang rusak, model 3B pada tugas yang ditangani oleh kebijakan 80M, GPU yang tidak dihancurkan siapa pun, dan pengulangan hasil yang gagal Anda simpan.
  • AY-Robots menentukan ukuran kartu berdasarkan VRAM yang dibutuhkan model dan menyewanya di pasar spot yang sama, sehingga biaya proses adalah biaya pasar.

Tagihan memiliki empat lini, dan GPU adalah yang terkecil

Ketika orang bertanya berapa biaya untuk menyempurnakan model visi-bahasa-aksi untuk SO-100, mereka hampir selalu berarti sewa GPU. Itu adalah angka yang muncul sebagai tagihan pada kartu, jadi itu yang terasa nyata. Ini juga, dengan selisih yang lebar, yang terkecil dari empat angka yang menentukan berapa biaya sebenarnya dari kebijakan yang berfungsi.

LiniApa ituUkuran tipikal untuk satu kebijakan yang berfungsi
GPU timemenyewa kartu untuk proses1 hingga 12 USD per proses, dan Anda akan melakukan 3 hingga 5
The robotservo, rangka cetak, kamera, kabel, dayasatu kali, 110 hingga 500 EUR per lengan
Human hoursseseorang menggerakkan lengan untuk merekam demo1 hingga 4 jam per dataset, diulang per tugas
Wastedata buruk, model terlalu besar, pod yang terlupakantidak terbatas, dan satu-satunya lini yang Anda kendalikan

Waktu pelatihan di bawah ini berasal dari makalah dan repositori kelima model itu sendiri, biaya perangkat keras dari daftar bahan yang dipublikasikan, angka platform dari AY-Robots katalog kebijakan dan halaman harga. Jika platform tidak membantu, artikel ini menyatakannya.

Berapa biaya sebenarnya satu jam GPU di pasar spot

Tidak ada satu harga pun untuk satu jam A100. Di pasar seperti vast.ai, setiap host menetapkan tarifnya sendiri, dan jalur pelatihan yang Anda luncurkan akan mendarat di mesin mana pun yang murah dan tersedia pada saat itu. Jawaban jujurnya adalah sebuah distribusi. Berikut adalah datanya, diukur pada 23 Agustus 2026 pukul 13:44 UTC: kartu penuh tunggal, sesuai permintaan, disaring berdasarkan VRAM nyata.

Kartuvast.ai sesuai permintaan USD/jam (rendah / median / tinggi)Penawaran kartu penuhHarga dasar vast.aiRunPod Komunitas / AmanHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74tidak ditawarkan
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99tidak ditawarkan
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 sebagai Ruang
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 sebagai titik akhir
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19tidak ditawarkan
Cara snapshot ini diambil, dan apa yang bukan

Penawaran sesuai permintaan untuk satu GPU penuh (gpu_frac == 1.0) dari API bundel publik vast.ai, yang tidak memerlukan akun, difilter berdasarkan gpu_ram sehingga hanya kartu 80 GB asli yang masuk ke baris 80 GB. Filter itu penting: dalam pembacaan ini, ketiga penawaran A100 SXM4 kartu tunggal adalah bagian 40 GB, begitu juga dua dari empat penawaran A100 PCIE, jadi menggabungkannya ke dalam satu baris "A100" akan mengurangi separuh harga yang dilaporkan di sini. Kolom Hugging Face mencampur dua produk: 2.50 USD/h adalah perangkat keras Spaces Nvidia A100 - large dan 4.50 USD/h adalah satu H100 80 GB di bawah Inference Endpoints, yang tidak ditawarkan oleh Spaces. Perlakukan median sebagai indikatif: baris A100 80 GB didasarkan pada dua penawaran dan baris H100 pada lima, dan kueri identik 36 detik kemudian mengembalikan jumlah 4090 yang berbeda dan harga tertinggi yang berbeda pada tiga dari lima baris. Harga daftar RunPod adalah angka yang lebih stabil untuk perencanaan.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Kueri persis di balik tabel di atas, dijalankan dua kali saat menulis bagian ini. Jalankan sebelum mempercayai artikel harga GPU apa pun, termasuk yang ini.
Tabel biaya AY-Robots menunjukkan GPU mana yang dibutuhkan setiap kebijakan, waktu berjalan tipikal dan harga per jalankan, serta berapa banyak episode yang dibutuhkan sebelum kebijakan tersebut berguna
Tabel biaya di /try: kartu, waktu berjalan, harga per jalankan, dan episode minimum per kebijakan.

Mengapa model 3B tidak dapat menggunakan kartu murah

Satu jam 4090 dan satu jam H100 80 GB berbeda kira-kira enam kali lipat pada median di atas. Yang memaksa Anda menggunakan kartu mahal bukanlah kecepatan, melainkan memori. openpi menetapkan batas bawah untuk fine-tune penuh Pi0.5 fine-tune sebesar 70 GB, dan NVIDIA merekomendasikan 40 GB atau lebih untuk GR00T. Perhatikan apa yang bukan merupakan angka GR00T. Konfigurasi fine-tune-nya membekukan model bahasa dan encoder visual secara default (tune_llm dan tune_visual adalah False, sedangkan proyektor dan diffusion head True), itulah sebabnya katalog mencantumkan sekitar 40 M parameter terlatih dari 3 B. 40 GB tersebut bukan merupakan status optimizer untuk bobot 3 B, melainkan backbone yang dibekukan ditambah aktivasi. Varian dengan cakupan yang lebih kecil membutuhkan lebih sedikit: jalur LoRA openpi membutuhkan 22.5 GB dan menyebutkan 4090, dan alur kerja Isaac Lab Arena NVIDIA mencantumkan opsi GPU tunggal 24 GB untuk GR00T pasca-pelatihan. Platform ini mengelompokkan berdasarkan batas bawah yang diterbitkan setiap vendor untuk konfigurasi yang benar-benar dijalankannya. Penjelasan flow-matching pi0 menjelaskan dari mana flow-matching jejak memori berasal.

PekerjaanMemori yang dibutuhkan proyek huluSumber
Inferensi pi0 / pi0.5lebih dari 8 GB, contoh RTX 4090openpi
Fine-tune LoRA pi0 / pi0.5lebih dari 22.5 GB, contoh RTX 4090openpi
Fine-tune penuh pi0 / pi0.5lebih dari 70 GB, contoh A100 80 GB atau H100openpi
Inferensi GR00T N1.71 GPU dengan 16 GB atau lebihIsaac-GR00T
Fine-tune GR00T N1.740 GB atau lebih direkomendasikan, node H100 atau L40Isaac-GR00T
Fine-tune GR00T, apa yang dilatihnyaproyektor dan diffusion head; LLM dan encoder visual dibekukan secara defaultfinetune_config.py
Pasca-pelatihan GR00T, dikurangi1 GPU dengan 24 GB, model bahasa dibekukanIsaac Lab Arena
Fine-tune SmolVLAsatu A100 untuk referensi 20.000 langkahlerobot docs
Pelatihan ACTsatu RTX 2080 Ti 11 GBACT paper

Tabel tersebut adalah alasan mengapa platform membagi kelima model menjadi dua tingkatan. GR00T N1.7, GR00T N1.5 dan Pi0.5 menggunakan A100 80 GB atau H100 karena itulah yang diminta oleh vendor. SmolVLA dan ACT menggunakan RTX 4090 atau kartu 24 GB lainnya karena itu memang sudah cukup.

Jebakan yang menghabiskan waktu sehari: menyewa kartu murah untuk model besar

GR00T atau Pi0.5 yang dijalankan pada kartu 24 GB tidak akan langsung gagal. Ia akan mengunduh checkpoint dasar, membangun indeks dataset, memulai forward pass pertama, dan kemudian mati setelah beberapa ratus langkah dengan kesalahan CUDA out-of-memory. Anda membayar untuk unduhan dan penyiapan tetapi tidak mendapatkan apa-apa. Perbaikan: memori habis selama pelatihan.

Berapa lama setiap dari lima model benar-benar berjalan

Waktu berjalan adalah separuh biaya lainnya: 2.00 USD per jam tidak relevan jika pekerjaan berlangsung 40 menit dan merugikan jika berlangsung 40 jam. Ini adalah pengaturan default yang benar-benar dikirim AY-Robots ke pelatih, beserta jendela waktu berjalan dan biaya untuk setiap tingkatan.

KebijakanTingkat GPULangkah maks defaultBatch default (akumulasi gradien)Jendela waktu berjalanBiaya per jalankan
GR00T N1.7, ~3BA100 80 GB or H10020,00032, akum 1, berlaku3 hingga 6 jam4 hingga 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, akum 16, berlaku3 hingga 6 jam4 hingga 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, akum 16, tidak berpengaruh3 hingga 6 jam4 hingga 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, akum 8, tidak berpengaruh2 hingga 5 jam1 hingga 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, akum 12 hingga 5 jam1 hingga 3 USD
Tabel perbandingan lima kebijakan yang dapat dilatih di AY-Robots menunjukkan jumlah parameter, GPU yang dibutuhkan, latensi inferensi, dan jumlah episode minimum
Lima kebijakan berdampingan: parameter, tingkat GPU, latensi per langkah tindakan, episode minimum.

Dari mana jendela waktu eksekusi tersebut berasal dari hulu

  • SmolVLA: dokumentasi lerobot menyatakan bahwa 20.000 langkah membutuhkan waktu sekitar 4 jam pada satu A100. Platform menjalankan 20.000 langkah yang sama pada tingkatan 24 GB yang lebih murah, oleh karena itu ada jendela waktu daripada 4 jam datar.
  • ACT: makalah ALOHA asli melaporkan sekitar 5 jam pada satu RTX 2080 Ti 11 GB untuk model 80M-parameter. Sebuah 4090 beberapa generasi lebih baru tetapi platform menganggarkan 100.000 langkah, sehingga jendela waktu berada di tempat yang sama.
  • GR00T: alur kerja referensi NVIDIA untuk generasi N1.6 mengutip sekitar 4 hingga 8 jam untuk 20.000 langkah pada batch 24 di delapan kartu L40S, dan 2 hingga 3 jam untuk 30.000 langkah pada batch 16 di satu Ada 6000. Fine-tuning satu kartu dari VLA 3B dalam beberapa jam adalah normal, bukan optimis.
  • Pi0.5: openpi tidak mempublikasikan angka waktu nyata, tetapi mempublikasikan batas bawah 70 GB untuk fine-tune penuh, yang menentukan kartu dan oleh karena itu lajunya.

Penting untuk berhenti sejenak pada angka yang tidak Anda bayar. Makalah GR00T N1 melaporkan sekitar 50.000 jam GPU H100 untuk melatih model 2.2B, pada kluster hingga 1024 GPU, dengan ukuran batch pelatihan 16.384 untuk 200.000 langkah gradien. Dengan biaya 1.34 hingga 2.34 USD per jam yang diukur di atas, itu setara dengan 67.000 hingga 117.000 USD untuk komputasi sewaan. Makalah SmolVLA menempatkan proyeknya sekitar 30.000 jam GPU di atas 481 dataset komunitas, 22.9K episode, dan 10.6M frame. Anda mewarisi semua itu dengan harga unduhan; 8 USD Anda membeli 20.000 langkah terakhir. Mengapa VLA dibangun dengan cara ini membahas pembagian tersebut.

Lengan robot: biaya satu kali yang jauh lebih besar daripada tagihan GPU

Satu sesi pelatihan berharga kurang dari makan siang. Robot tidak. Itulah mengapa SO-100 penting: ini adalah lengan termurah yang didukung oleh seluruh pembelajaran imitasi toolchain.

LenganServoTeganganBiaya KomponenDukungan di AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURpenuh, lengan referensi
SO-101Feetech STS32157.4 V130 to 170 EURpenuh
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURkompatibel
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURkompatibel

Daftar bahan baku (bill of materials) hulu di repositori SO-ARM100 lebih rinci dan patut diperiksa sesuai wilayah Anda: daftar Komponen Untuk Dua Lengan berjumlah 229.88 USD atau 226.30 EUR untuk konfigurasi pemimpin plus pengikut, dan daftar Komponen untuk Satu Lengan Pengikut berjumlah 121.94 USD atau 124.30 EUR. Enam servo STS3215 masing-masing seharga 13.89 USD adalah 83.34 dari 121.94 tersebut, jadi servo adalah lengan itu sendiri. Dengan biaya 1 hingga 3 USD per sesi SmolVLA atau ACT, sepasang lengan bernilai antara 77 hingga 230 sesi pelatihan. Jika Anda masih memilih, SO-100 versus SO-101 adalah perbandingan yang penting, karena keduanya cukup mirip sehingga keputusan lebih tentang ketersediaan daripada kemampuan.

7.4 V, bukan 12 V

STS3215 tersedia dalam varian 7.4 V dan 12 V; repositori mencatat bahwa komponen 12 V juga memerlukan catu daya 12 V 5 A alih-alih yang 5 V, sehingga keduanya tidak dapat dipertukarkan. Memberi daya 12 V ke servo 7.4 V akan merusaknya, dan enam servo merupakan dua pertiga dari biaya komponen lengan pengikut. Periksa label pada setiap servo sebelum penyalaan pertama. Jika servo sudah berperilaku aneh: servo tidak merespons, lengan berkedut lalu melorot.

Jam kerja manusia: baris yang tidak pernah dimasukkan siapa pun ke dalam spreadsheet

Inilah angka yang membalikkan diskusi biaya. Merekam demonstrasi adalah seseorang yang menggerakkan lengan robot, satu episode pada satu waktu, secara real-time. Tidak ada pemrosesan batch dan tidak ada penyewaan per detik. Perekam dataset LeRobot dilengkapi dengan pengaturan default yang membuat perhitungan mudah, ketiganya dikonfirmasi dalam DatasetRecordConfig: 60 detik per episode, 60 detik untuk mengatur ulang adegan, 50 episode. Kolom uang di bawah mengasumsikan 15 USD untuk satu jam waktu seseorang, yang merupakan asumsi daripada angka platform. Ganti dengan tarif Anda sendiri; rasio adalah intinya.

  1. 1
    Rekam dataset dengan pengaturan default yang sebenarnya akan Anda bayar

    Ini adalah lerobot 0.6.1, versi di PyPI per 3 Agustus 2026. Perhatikan bentuk CLI: perekaman berjalan melalui titik masuk konsol lerobot-record (lerobot.scripts.lerobot_record), bukan jalur modul lama python -m lerobot.scripts.record. AY-Robots menargetkan 0.5.1, dan wheel 0.5.1 mendeklarasikan titik masuk lerobot-record dan lerobot-train yang sama, sehingga bentuk di bawah ini stabil di keduanya. Tiga flag waktu adalah default upstream, jadi ini juga perintah yang diasumsikan dalam perhitungan tabel berikutnya.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Lihat apa yang Anda rekam sebelum Anda menyewa satu menit GPU pun

    Memeriksa dataset tidak memakan biaya nol USD per jam. Menemukan masalah yang sama dari kurva kerugian memakan biaya 2.00 USD per jam pada tingkat H100 dan memberi tahu Anda empat jam terlambat. Dorong dataset dan periksa di penampil LeRobot, atau jelajahi direktori dataset AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Latih, dan pastikan checkpoint bertahan lebih lama dari pod

    Mesin sewaan bersifat sementara berdasarkan definisi, jadi tulis checkpoint di tempat yang tahan lama selama proses berjalan. Dua flag menentukan apakah Anda menyimpan apa yang Anda bayar. --save_freq defaultnya adalah 20.000 langkah, jadi proses SmolVLA default 20.000 langkah menulis checkpoint pertamanya saat proses sudah selesai; turunkan sebelum Anda menyewa apa pun yang dapat diinterupsi. --save_checkpoint_to_hub memerlukan --policy.repo_id dan tidak ada di lerobot 0.5.1, jadi pada versi tersebut Anda menyalin direktori output dari mesin sendiri. Ukuran batch di bawah adalah contoh dari dokumen upstream; formulir AY-Robots mengirimkan 2 untuk SmolVLA dan menulis ke penyimpanan objek saat checkpoint muncul.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpisodePerekaman pada 60 dReset pada 60 dWaktu nyataDitambah 20 persen perekaman ulangDengan 15 USD per jam kerja manusia
30, minimum SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, empat minimum lainnya50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, dataset yang nyaman100 min100 min3 h 20 min4 h 00 minabout 60 USD

Bandingkan kolom kanan dengan biaya operasional 1 hingga 12 USD. Dengan asumsi tarif tersebut, dataset 50 episode membutuhkan biaya perekaman dua hingga tujuh kali lipat dari biaya pelatihannya, sebelum kalibrasi, pengaturan kamera, dan episode yang Anda buang. Itulah mengapa memiliki nilai finansial langsung. Panduan lerobot menyarankan setidaknya 50 episode dengan 10 per lokasi objek; dokumen SmolVLA melaporkan bahwa versi 25 episode dari tugas yang sama tidak cukup.

Di Mana Uang Sebenarnya Hilang

1. Berjalan pada data yang tidak akan pernah berhasil

Sebuah eksekusi GR00T 20.000 langkah pada dataset dengan dua aliran kamera yang tertukar biayanya sama dengan eksekusi pada dataset bersih, memakan waktu yang sama, dan menghasilkan kurva kerugian yang terlihat baik-baik saja. Kegagalan muncul pada lengan robot, beberapa jam kemudian. ditagih per jam dan diagnosis ditagih dalam hitungan hari. Dua gejala yang patut diingat: biasanya berarti observasi tidak membawa apa yang dibutuhkan tugas, dan berarti dataset memiliki variasi yang lebih sedikit dari yang Anda kira.

2. Membayar harga model dasar untuk tugas kamera tetap

ACT memiliki sekitar 80 juta parameter dan dirancang untuk dilatih dari awal dengan 50 demonstrasi satu tugas. GR00T N1.7 memiliki sekitar 3 miliar parameter dengan backbone yang sudah dilatih. Untuk kamera yang terpasang, meja tetap, dan satu objek, model 80 juta seringkali berhasil, berjalan sekitar 20 ms per langkah tindakan alih-alih 152 ms, dan biayanya 1 hingga 3 USD per eksekusi alih-alih 4 hingga 12. Habiskan 3 USD untuk mencari tahu apakah model murah berfungsi sebelum menghabiskan 12 USD untuk model yang mahal. ACT melawan SmolVLA dan GR00T N1.7 melawan Pi0.5 menunjukkan di mana masing-masing berhenti menjadi jawaban yang tepat; arena model memiliki 85 model dan 332 hasil benchmark.

3. GPU yang Anda lupakan

Kesalahan termurah untuk dicegah dan yang paling umum dilakukan. Sebuah instance yang dimulai pada hari Jumat untuk melakukan debug akan ditagih sepanjang akhir pekan dengan tarif yang sama dengan eksekusi nyata.

KartuTarif median dalam snapshotMenganggur selama 24 jamMenganggur selama 7 hariItu bernilai
RTX 40900.32 USD/h7.68 USD53.76 USDsekitar 27 kali jalankan SmolVLA atau ACT seharga 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDsekitar 12 kali jalankan GR00T seharga 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDsekitar 38 kali jalankan GR00T seharga 8 USD

Pada AY-Robots, kegagalan ini dihilangkan untuk inferensi: pod yang disediakan oleh API inferensi membawa pengawas idle dan menghancurkan dirinya sendiri setelah periode idle. Jika Anda menyewa kartu itu sendiri, pengawas itu adalah pengingat kalender Anda.

4. Membayar dua kali untuk jawaban yang sama

Titik masuk fine-tuning GR00T adalah CLI tyro yang tidak mengekspos seed apa pun. Itu bukan batasan platform, melainkan alat hulu: tidak ada bidang seed di gr00t/configs/finetune_config.py, dan tips pelatihan repositori itu sendiri memperingatkan bahwa hasil jalankan bervariasi 5 hingga 6 persen karena augmentasi gambar bersifat non-deterministik. lerobot secara default menggunakan seed 1000 di 0.5.1 dan 0.6.1, sehingga jalankan ACT, SmolVLA, dan Pi0.5 setidaknya dapat dijalankan ulang dari inisialisasi dan urutan data yang sama. Itu bukan janji bobot yang identik bit pada GPU, tetapi itu adalah perbedaan antara jalankan ulang dan eksperimen baru. Jika jalankan GR00T menghasilkan kebijakan yang berfungsi dan Anda tidak menyimpan titik pemeriksaan, Anda membayar harga penuh untuk hasil yang mungkin berbeda lebih dari perbedaan yang Anda kejar. Ada cara kedua untuk kehilangan titik pemeriksaan yang Anda bayar: CLI secara default menggunakan --save-total-limit 5, yang didokumentasikan sebagai jumlah maksimum titik pemeriksaan yang disimpan sebelum yang lebih lama dihapus. Penyimpanan hanya sen; jalankan ulang adalah 4 hingga 12 USD dan enam jam.

Kapasitas yang dapat diinterupsi berharga setengah dan akan menghentikan proses Anda

Batas tawaran di atas adalah sebagian kecil dari tarif sesuai permintaan, dan vast.ai mengatakan sistem penawaran dapat memangkas biaya klien hingga lima puluh persen atau lebih. Kendalanya, dalam kata-katanya sendiri: instans yang dapat diinterupsi dapat dijeda kapan saja jika pengguna lain menawar lebih tinggi atau sewa sesuai permintaan dibuat untuk sumber daya yang sama, dan jeda tersebut "menghentikan semua proses yang sedang berjalan". Sesuai permintaan selalu diutamakan. Baik untuk proses yang menulis checkpoint setiap beberapa ratus langkah, kerugian total untuk proses yang menulis di akhir, yang persis seperti yang diberikan oleh pengaturan default: CLI Isaac-GR00T menulis setiap --save-steps (default 1000), tetapi --save_freq lerobot defaultnya 20.000 langkah, jadi proses SmolVLA default membuat checkpoint sekali, di garis akhir. Turunkan, atau jangan menawar. Formulir pelatihan AY-Robots mengekspos pengaturan GR00T sebagai saveSteps.

Menyewa kartu sendiri
Keuntungan
  • Tarif per jam terendah yang ada.
  • Kontrol penuh atas citra, versi CUDA, revisi lerobot atau Isaac-GR00T, dan setiap flag.
  • Penawaran yang dapat diinterupsi memangkas tarif menjadi setengah jika proses Anda membuat checkpoint cukup sering untuk bertahan dari jeda.
  • Tidak ada yang diabstraksikan, jadi ketika proses berjalan aneh Anda bisa melihat alasannya.
Pertimbangan
  • Penyiapan ditagih dengan tarif GPU: driver, dependensi, checkpoint dasar multi-gigabyte, dan unduhan dataset semuanya berharga sama per jam dengan pelatihan.
  • Instans yang dapat diinterupsi yang kalah tawaran dijeda dan prosesnya dihentikan. Proses yang tidak disimpan adalah uang yang terbuang, dan default lerobot menulis checkpoint pertamanya pada langkah 20.000.
  • Tidak ada yang menghancurkan pod untuk Anda. Tabel idle di atas adalah tagihan karena lupa.
  • Pasokan untuk kartu 80 GB penuh tunggal tipis: dua penawaran kartu penuh A100 80 GB dan lima H100 80 GB dalam bacaan ini. Daftar juga berputar, jadi harga terdaftar termurah dan harga yang sebenarnya dapat Anda seewa bukanlah angka yang sama.
  • Setiap jam pada infrastruktur adalah jam yang tidak dihabiskan untuk merekam episode yang menentukan apakah kebijakan berfungsi.

Melakukannya sendiri versus membiarkan platform menyewa kartu

Anda memilih mesin, membangun lingkungan, dan menghancurkan pod. Tarif per jam adalah tarif pasar di atas; selebihnya adalah waktu Anda.

  1. Temukan kartu yang sesuai dengan VRAM yang dibutuhkan model: 24 GB untuk ACT dan SmolVLA, 80 GB untuk GR00T dan Pi0.5.
  2. Sewa sesuai permintaan jika proses tidak dapat bertahan dari jeda, dapat diinterupsi jika sering membuat checkpoint.
  3. Instal toolchain: lerobot untuk ACT, SmolVLA, dan Pi0.5, repositori Isaac-GR00T dengan peluncur tyro-nya sendiri untuk GR00T.
  4. Konversi dataset jika diperlukan. Dataset LeRobot v3.0 menyebabkan loader GR00T crash dan harus dikonversi ke v2.1.
  5. Luncurkan, pantau loss, dorong checkpoint ke tempat yang tahan lama saat ditulis.
  6. Hancurkan instance, lalu periksa apakah Anda sudah menghancurkannya.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Titik masuk fine-tune Isaac-GR00T saat ini, sesuai dengan perintah di README repositori. CLI ini tidak memiliki flag seed, sehingga proses GR00T tidak dapat direproduksi bit-per-bit.

Biaya realistis untuk satu proses GR00T: 3 hingga 6 jam pada H100 80 GB dengan tarif 1.34 hingga 2.34 USD per jam adalah 4 hingga 14 USD, ditambah 20 hingga 40 menit pengaturan yang juga dikenakan biaya, ditambah waktu Anda sendiri.

Berapa biaya platform dan bagaimana platform memilih kartu

Logikanya sengaja dibuat sederhana. Setiap model di katalog menyatakan tingkatan GPU; backend mengambil VRAM yang dibutuhkan dan menyewa kartu yang cocok di pasar spot yang sama seperti yang diukur di atas. Itulah mengapa biaya yang dikutip adalah rentang, bukan harga. GR00T dan Pi0.5 hanya tersedia di cloud di sini karena batas bawah 40 GB dan 70 GB. SmolVLA dan ACT juga berjalan secara lokal di kartu 24 GB Anda sendiri, di mana biaya cloud adalah nol dan listrik adalah masalah Anda.

Halaman harga AY-Robots yang menunjukkan biaya satu kali pelatihan dan akses platform
Halaman harga. Angka per-jalankan melacak pasar spot daripada harga daftar tetap.

Satu pengaturan perlu diperhatikan. Akumulasi gradien benar-benar berlaku untuk kedua varian GR00T, jadi meningkatkannya akan menghasilkan batch efektif yang lebih besar pada kartu yang sama. Untuk Pi0.5 dan SmolVLA, ini sama sekali tidak berlaku: lerobot 0.5.1 tidak memiliki opsi akumulasi gradien dalam konfigurasi pelatihannya, jadi mengatur bidang ke 16 tidak memakan biaya dan tidak menghasilkan apa-apa. Jika pekerjaan yang diantrekan tidak pernah dimulai, halaman pekerjaan yang macet dalam antrean membahas apa yang harus diperiksa; jika dataset ditolak sebelum proses dimulai, itu hampir selalu masalah format v3.0.

Batas yang tidak dipecahkan oleh platform ini: latensi

GPU sewaan yang melayani kebijakan Anda melalui internet publik menambah waktu bolak-balik ke loop kontrol yang sudah 20 hingga 485 ms per langkah tindakan. Baik untuk tugas pick-and-place yang lambat, tidak untuk gerakan reaktif yang cepat. Inferensi cloud mengevaluasi checkpoint dengan baik tetapi menjalankan manipulasi produksi dengan buruk: jika tugas membutuhkan kecepatan, komputasi harus berada di dekat servo, dan itu adalah biaya yang tidak dapat dihilangkan oleh artikel ini. Lihat latensi inferensi.

Anggaran terperinci untuk kebijakan kerja pertama

Keempat baris secara bersamaan, dimulai dari nol. Total GPU mengasumsikan 3 hingga 5 kali percobaan: yang pertama membuktikan pipeline berfungsi, yang kedua mengungkap masalah data, yang ketiga atau keempat adalah yang Anda pertahankan.

BarisJalur hematJalur nyaman
LenganSO-100 follower only, 121.94 USD in the BOMleader plus follower, 229.88 USD in the BOM
ModelSmolVLA or ACT, 24 GB tierGR00T N1.7, A100 80 GB or H100 tier
Episode direkam30, minimum SmolVLA50 hingga 100
Waktu manusia untuk merekamsekitar 1 j 12 mnt2 hingga 4 jam
Biaya satu kali percobaan1 hingga 3 USD4 hingga 12 USD
Percobaan sebelum berhasil3 hingga 53 hingga 5
Total pengeluaran GPU3 hingga 15 USD12 hingga 60 USD
Item terbesar di tagihanlengan, lalu waktu Andalengan, lalu waktu Anda

Pola ini berlaku pada ukuran robot ini: komputasi adalah kesalahan pembulatan, perangkat keras adalah biaya satu kali yang nyata, jam kerja manusia adalah pengeluaran berulang. Untuk menguji bagian pelatihan sebelum membeli apa pun, titik masuk tanpa perangkat keras memungkinkan Anda membandingkan model dan menyewa GPU tanpa lengan robot, dan lengan robot langsung adalah SO-100 fisik yang dapat Anda kendalikan di browser tanpa perlu mendaftar. Untuk seluruh pipeline secara menyeluruh, panduan SO-100 lengkap mencakup pengaturan, teleoperasi dan pelatihan, dan latih kebijakan pertama Anda adalah versi singkatnya.

Matriks pelatihan AY-Robots dengan lima kebijakan sebagai baris dan empat lengan robot sebagai kolom, setiap sel terhubung ke panduan pelatihan tertentu
Matriks /train: baris untuk anggaran Anda, kolom untuk lengan robot Anda, sel untuk panduan dengan pengaturan default dan biaya pasangan tersebut.
Berapa biaya satu kali proses fine-tuning VLA secara menyeluruh?

Sekitar 4 hingga 12 USD untuk GR00T N1.7, GR00T N1.5, atau Pi0.5 pada tier A100 80 GB atau H100 (3 hingga 6 jam dengan biaya 1.20 hingga 2.00 USD per jam), dan sekitar 1 hingga 3 USD untuk SmolVLA atau ACT pada tier RTX 4090 (2 hingga 5 jam dengan biaya 0.30 hingga 0.60 USD per jam). Menyewa kartu sendiri akan berada dalam kisaran yang sama setelah waktu penyiapan dihitung, karena ditagih dengan tarif pelatihan.

Apakah H100 sepadan untuk dibayar dibandingkan A100 80 GB?

Untuk satu kebijakan SO-100, biasanya tidak. Keduanya memenuhi batas memori yang dibutuhkan GR00T dan Pi0.5, dan pada pembacaan 23 Agustus 2026, A100 80 GB penuh dimulai dari 0.44 USD per jam dibandingkan 1.34 untuk H100 80 GB. H100 selesai lebih cepat, jadi sebagian dari tarif kembali sebagai jam yang lebih sedikit, tetapi totalnya masih lebih tinggi untuk proses sekecil ini. Argumen sebenarnya untuk H100 adalah ketersediaan: lima penawaran H100 80 GB tunggal di pasar tersebut dibandingkan dua A100 80 GB, dan kartu yang tidak dapat Anda sewa tidak memiliki harga.

Berapa kali percobaan yang dibutuhkan sebelum sebuah kebijakan benar-benar berfungsi?

Rencanakan tiga hingga lima. Yang pertama membuktikan bahwa pipeline terhubung dengan benar. Yang kedua umumnya mengungkap masalah dataset seperti aliran kamera yang mati di tengah jalan. Yang ketiga atau keempat adalah yang Anda pertahankan.

Bisakah saya melatih SmolVLA atau ACT di GPU saya sendiri alih-alih menyewa?

Ya. Keduanya didukung secara lokal di AY-Robots dan keduanya muat dengan nyaman di 24 GB; makalah ACT asli melatih model 80M-nya dalam sekitar 5 jam pada RTX 2080 Ti 11 GB. GR00T dan Pi0.5 hanya berbasis cloud di sini karena batas fine-tuning yang didokumentasikan vendor adalah 40 GB dan 70 GB, dan kartu konsumen terbesar di pasar adalah RTX 5090 32 GB.

Mengapa jumlah langkah yang sama memiliki biaya yang berbeda di antara model?

Langkah-langkah tidak dapat dibandingkan antar kebijakan. ACT secara default menggunakan 100.000 langkah pada batch 8 di kartu 24 GB; GR00T N1.5 secara default menggunakan 2.000 langkah pada batch 1 dengan akumulasi gradien 16 di kartu 80 GB. Tagihan adalah jam dikalikan dengan tarif kartu yang dipaksakan oleh jejak memori, bukan penghitung langkah.

Lihat berapa biaya proses Anda sebelum memulainya

Setiap dari lima kebijakan mencantumkan tier GPU, waktu berjalan, dan harga per proses, dan backend pelatihan menyewa kartu di pasar spot yang sama tempat angka-angka ini diukur.

Periksa harga

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started