Tabel perbandingan kebijakan AY-Robots yang menampilkan GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA, dan ACT secara berdampingan dengan jumlah parameter, tingkatan GPU, latensi inferensi, dan jumlah episode minimum
model-vlapelatihan-kebijakanpemilihan-modellerobotso-100

Kebijakan VLA Mana yang Seharusnya Anda Latih pada Tahun 2026?

AY-Robots ResearchAugust 23, 202618 menit baca

GR00T N1.7, Pi0.5, SmolVLA, ACT atau GR00T N1.5? Sebuah tabel keputusan yang disesuaikan dengan situasi nyata, lengkap dengan angka benchmark yang dipublikasikan, latensi, biaya per eksekusi, dan lisensi di balik setiap pilihan.

Lima kebijakan dapat dilatih pada lengan kelas SO-100 saat ini. Perbedaannya adalah faktor 24 dalam inferensi latensi, 37 dalam jumlah parameter, dan 12 dalam biaya satu kali jalankan, serta dalam apakah Anda boleh mengirimkan hasilnya. Lima kartu model tidak akan menyelesaikannya: tidak ada yang menjawab pertanyaan Anda, mana yang harus saya jalankan terlebih dahulu?

Setiap angka di bawah ini diambil dari makalah, repositori, dan kartu pada Agustus 2026. Angka platform berasal dari katalog kebijakan AY-Robots; jika keduanya tidak sesuai, keduanya ditampilkan.

Versi singkat

  • Latih ACT terlebih dahulu jika Anda meragukan dataset Anda: 1 hingga 3 USD per jalankan, tidak ada yang dilatih sebelumnya untuk menutupi data yang buruk.
  • GR00T N1.7 dan Pi0.5 berada dalam setengah poin pada LIBERO, 97.0 berbanding 96.85 hingga 97.5. Itu bukan alasan untuk memilih salah satu.
  • Pi0.5 adalah strategi generalisasi, bukan strategi akurasi, dan yang paling lambat pada 485 ms.
  • SmolVLA, dengan 450 J parameter, adalah satu-satunya VLA di sini yang melakukan fine-tuning pada satu kartu 24 GB.
  • ACT pada 20 ms adalah satu-satunya pilihan untuk gerakan reaktif cepat. Lisensi menentukan sisanya.

Tabel keputusan

Situasi AndaLatih iniMengapa
Kualitas dataset belum terbuktiACTTidak ada yang dilatih sebelumnya yang dapat menyembunyikan dataset yang rusak, dan kegagalan memakan biaya 1 hingga 3 USD.
Kaya kontak, multi-langkah, terkondisi bahasaGR00T N1.797.0% di atas empat suite LIBERO, ditambah ruang aksi end-effector relatif.
Gerakan reaktif cepat, inferensi pada servoACT20 ms. Yang tercepat berikutnya 7.6 kali lebih lambat.
Objek baru, adegan baru, dunia terbukaPi0.5Dibangun untuk perilaku di luar distribusi, di hingga 104 lokasi.
Satu kartu 24 GB, masih menginginkan bahasaSmolVLA450 M parameter, batas bawah 30 episode, berjalan secara lokal.
Mereproduksi jalankan yang direkam pada tahun 2025GR00T N1.5Hanya jika Anda harus: LeRobot sekarang menolaknya, bobot non-komersial.
Ini akan dikirim sebagai produkN1.7, SmolVLA or ACTN1.5 bersifat non-komersial, Pi0.5 membawa ketentuan Gemma, kartu SmolVLA menyatakan tidak ada.

Lima kandidat

Kelima-limanya adalah kebijakan: bingkai kamera, posisi sendi dan, untuk empat di antaranya, instruksi bahasa, dipetakan ke sebagian target sendi di masa depan. Yang membedakan mereka adalah seberapa banyak yang telah dipelajari sebelum Anda tiba.

KebijakanParameterLatensiTingkat GPULokal?Episode MinFormatBiaya
ACT~80 M20 ms24 GB cardya50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardya30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBtidak50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBtidak50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBtidak50v3.04 to 12 USD

GR00T N1.7

Model aksi bahasa-visi NVIDIA saat ini model aksi bahasa-visi, sekitar 3 miliar parameter, sekitar 40 juta dilatih selama penyetelan halus. Repositori mencantumkan delta dari N1.6: backbone dari model Eagle yang dijual ke Cosmos-Reason2-2B pada Qwen3-VL, lapisan difusi 32 menjadi 16, dimensi keadaan dan aksi 29 menjadi 132, horizon aksi 16 menjadi 40.

Yang penting pada lengan kecil adalah ruang aksi end-effector relatif: N1.7 memprediksi delta dari pose saat ini, yang memungkinkan 20 ribu jam video manusia EgoScale ditransfer ke kebijakan robot. Spesifikasi di halaman N1.7, prosedur dalam panduan N1.7 pada SO-100.

GA di repo, EA di kartu model

README Isaac-GR00T menyatakan N1.7 sebagai rilis Ketersediaan Umum, dengan benchmark dan dukungan lengkap. Kartu Hugging Face-nya belum diperbarui: bidang Model Version masih bertuliskan GR00T N1.7 EA. Repositori adalah dokumen yang lebih baru.

GR00T N1.5

Skala 3 B yang sama, backbone Eagle 2, SigLip2 dan T5, head DiT flow-matching. Ini ada untuk memperluas yang sudah Anda miliki. Dua hal membuatnya menjadi pilihan default yang buruk: bobotnya membawa lisensi non-komersial satu arah NVIDIA, dan rilis LeRobot saat ini menghapus dukungan N1.5. Lihat .

Pi0.5

VLA dari Physical Intelligence, tipe kebijakan pi05. Makalah ini menyajikan VLM 2 B yang diinisialisasi dari PaliGemma ditambah ahli tindakan 300 M, menggerakkan robot pada 50 Hz; konfigurasi pi05 LeRobot secara default menggunakan potongan 50 langkah, satu detik pada kecepatan tersebut. Keunggulan utamanya adalah tempat-tempat yang belum pernah terlihat: sekitar 400 jam manipulasi seluler di rumah-rumah nyata, dan studi penskalaan di lebih dari 3, 12, 22, 53, 82, dan 104 lokasi, di mana model 104 lokasi cocok dengan kontrol yang dilatih di rumah-rumah uji itu sendiri.

Satu batasan, yang disebutkan pada kartu lerobot/pi05_base: port hanya membawa kepala aksi pencocokan aliran. Prediksi subtugas, tokenisasi aksi, dan RL tidak dirilis secara upstream, dan openpi mengatakan hal yang sama untuk repositorinya sendiri. Halaman Pi0.5 dan panduan Pi0.5 di SO-100 memiliki sisanya.

Jebakan yang menghabiskan sore hari: repositori berpagar

Pi0.5 memerlukan tokenizer google/paligemma-3b-pt-224 yang berpagar (gated: manual, meskipun Google mengatakan permintaan diproses segera). Tanpa menerimanya dan menjalankan hf auth login di lingkungan pelatihan, pekerjaan akan dimulai, mengunduh sebentar, lalu mati karena kesalahan otorisasi yang terbaca seperti kegagalan jaringan. nvidia/GR00T-N1.7-3B tidak berpagar, tetapi tulang punggungnya nvidia/Cosmos-Reason2-2B berpagar (gated: auto). Bersihkan keduanya sebelum mengantre; jika sebuah proses berjalan diam, halaman antrean macet mencantumkan apa yang harus diperiksa.

SmolVLA

450 M parameter, sekitar 100 M di pakar aksi, pada SmolVLM-2 dengan VLM dibekukan dan hanya 16 lapisan model bahasanya yang pertama digunakan. Pelatihan awal adalah data komunitas: 481 dataset, 10.6 M frame, dari lengan murah yang sama yang Anda gunakan. Satu-satunya VLA di sini yang muat di satu kartu 24 GB, dan satu-satunya lantai 30 episode. Lihat halaman SmolVLA.

ACT

Bukan model dasar. Action Chunking Transformer dari ALOHA memiliki sekitar 80 juta parameter yang dilatih dari awal per tugas, pada 50 demonstrasi pada 50 Hz. Makalah ini melaporkan enam tugas bimanual nyata dari sekitar sepuluh menit demonstrasi masing-masing, pada 80 hingga 90 persen pada contoh-contoh yang disorotnya. Idenya, pemotongan aksi, ada di setiap model di halaman ini, dan ablasinya masih mengukur efek terbaik: pada dua tugas simulasi dengan temporal ensembling dimatikan, keberhasilan meningkat dari 1 persen pada k=1 menjadi 44 persen pada k=100. Halaman ACT memiliki sisanya.

Apa yang sebenarnya dikatakan oleh benchmark

LIBERO adalah satu-satunya benchmark yang dilaporkan oleh tiga dari lima ini: tugas-tugas yang dikondisikan bahasa pada simulasi Franka Panda, dibagi menjadi empat suite di bawah ini dengan masing-masing sepuluh tugas. NVIDIA menjalankan 200 percobaan per suite.

ModelSpatialObjectGoal10 (Long)Average
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Baris-baris ini tidak sepenuhnya sebanding

Setiap angka berasal dari harness dan anggaran yang berbeda. GR00T berjalan 20K langkah pada batch global 640; angka openpi adalah checkpoint 30K; port LeRobot menambahkan 6K langkah ke model dasar LIBERO. SmolVLA adalah ketidakcocokan lebih lanjut: makalahnya melatih baris tersebut pada LIBERO dari awal, tanpa pra-pelatihan VLA, sementara tiga di atasnya melakukan fine-tuning checkpoint yang sudah dilatih sebelumnya. Perlakukan 96.85 hingga 97.5 sebagai satu kluster, dan celah ke 87.3% sebagai nyata tetapi diperoleh dengan 6.7x parameter.

SimplerEnv menunjukkan penyebaran, yang tidak dilakukan LIBERO. NVIDIA membandingkan N1.7 dengan N1.6, hal publik terdekat dengan delta generasi.

SimplerEnv suiteN1.6 averageN1.7 averageBest swingWorst swing
Bridge (WidowX), 7 tugas56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tugas52.0%72.5%open_drawer 0.0 to 65.0tidak ada, setiap tugas meningkat

Baris Bridge adalah yang berguna: rata-rata 5.7 poin diperoleh sementara put_eggplant_in_basket kehilangan 36 dan put_eggplant_in_sink turun dari 33 menjadi 2. Generasi baru menggeser distribusi daripada mengangkatnya, jadi jika tugas Anda berada di mana N1.7 mengalami regresi, rata-rata tidak mengatakan apa-apa.

Papan peringkat arena AY-Robots, tabel yang dapat diurutkan dari 85 model visi-bahasa-aksi dengan 332 hasil benchmark, setiap nilai terhubung ke makalah atau kartu model asalnya
Arena ini menampung 85 model VLA dan 332 hasil benchmark, masing-masing terhubung kembali ke makalah atau kartu modelnya. Berguna untuk memeriksa apakah angka yang dikutip dalam postingan blog itu nyata.

Dari kelimanya, hanya makalah SmolVLA yang melaporkan lengan kelas SO-100: 78.3 persen untuk SmolVLA dan 61.7 untuk Pi0 di tiga tugas, keduanya multi-tugas, dibandingkan 48.3 untuk ACT yang dilatih tugas tunggal, yang tidak sebanding. Pasangan yang bersih adalah keduanya tugas tunggal pada SO-101 pick-and-place: 90 berbanding 70 dalam distribusi, 50 berbanding 40 di luarnya. Bandingkan pada ACT against SmolVLA dan Pi0.5 against SmolVLA, atau jelajahi arena.

Latensi dan biaya menentukan penerapan

Latensi inferensi adalah batasan yang orang temukan terakhir dan sesali pertama kali. Sebuah kebijakan yang lima poin lebih baik pada benchmark tetapi setengah detik per langkah aksi terlihat lebih buruk di meja Anda: dinamika kontak tidak menunggu.

Satu peringatan: angka GR00T tidak sesuai dengan kartu NVIDIA, yang mencatat 4 langkah denoising dan satu kamera pada 85.8 ms pada H100 dalam mode eager, 48.6 ms dengan torch.compile, 27.9 ms melalui TensorRT penuh. Angka 152 ms di sini adalah angka seluruh tumpukan dengan overhead penyajian dan lebih dari satu kamera, bukan forward pass.

Inferensi jarak jauh memiliki batas keras

Loop 20 hingga 485 ms adalah milik model, dan perjalanan pulang-pergi internet publik menambahnya. Inferensi jarak jauh dapat dilakukan untuk pick-and-place yang lambat, bukan untuk gerakan reaktif yang cepat. Jika tugas Anda membutuhkan kecepatan, inferensi berada di samping servo: ACT atau SmolVLA, secara lokal. Terkait: kebijakan membeku di tengah gerakan.

Salah satu cara untuk menghemat waktu tanpa mengubah model: makalah SmolVLA mengukur eksekusi sinkron, di mana kebijakan menyelesaikan satu bagian sebelum memprediksi yang berikutnya, dibandingkan dengan asinkron, di mana prediksi tumpang tindih dengan eksekusi. Keberhasilan serupa, 78.3 berbanding 73.3, tetapi pick-and-place yang sama membutuhkan 9.7 detik alih-alih 13.75, dan dalam jendela tetap robot mengelola 19 siklus alih-alih 9.

Lisensi, diperiksa karena tidak ada yang memeriksanya

ModelLisensi BobotLisensi KodePenggunaan Komersial
GR00T N1.7NVIDIA Open Model License; kartu mengizinkan penggunaan komersialApache 2.0yes
GR00T N1.5Lisensi non-komersial satu arah NVIDIAApache 2.0no
Pi0.5metadata kartu pi05_base membaca lisensi: gemmaApache 2.0 (openpi, LeRobot docs)baca keduanya, ada perbedaan
SmolVLAtidak ada bidang lisensi pada kartu smolvla_baseApache 2.0 (LeRobot)kode ya, bobot tidak disebutkan
ACTtidak ada bobot dasar yang adaApache 2.0 (LeRobot)yes

Baris Pi0.5 perlu perhatian. Dokumentasi LeRobot pi05 menyatakan Apache 2.0 konsisten dengan openpi, sementara kartu Hub untuk lerobot/pi05_base membawa license: gemma. Keduanya aktif. GR00T N1.7 memiliki versi yang lebih ringan: README Isaac-GR00T menyebutkan secara sepintas bahwa N1.7 sepenuhnya dapat dilisensikan secara komersial di bawah Apache 2.0, sementara bagian lisensinya sendiri dan kartu model hanya menempatkan kode di bawah Apache 2.0 dan bobot di bawah NVIDIA Open Model License.

Default yang akan Anda jalankan

Setiap formulir pelatih dilengkapi dengan pengaturan default, dan pengaturan tersebut tidak sembarangan. Pengaturan ACT adalah milik LeRobot sendiri: batch 8, lr 1e-5, 100000 langkah pelatihan, ukuran chunk 100, sesuai dengan ACTConfig upstream dan k=100 dari makalah ACT. Salah satu kolom di bawah ini adalah jebakan.

KebijakanBatchLRLangkah maksAkumulasi gradienBerlaku?Pengaturan tambahan
GR00T N1.7321e-4200001yasaveSteps
GR00T N1.511e-5200016yasaveSteps
Pi0.515e-53000016tidak (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008tidakseed, logFreq
ACT81e-51000001tidakchunkSize, nActionSteps, seed, logFreq
Reproduksibilitas, tertanggal Agustus 2026

Titik masuk fine-tuning GR00T (launch_finetune.py, CLI tyro) tidak memiliki bidang seed dalam dataclass konfigurasinya, sehingga eksekusi tidak dapat direproduksi secara bit-per-bit. Repositori juga memperingatkan adanya variansi 5 hingga 6 persen antar eksekusi dari augmentasi gambar non-deterministik, lebih besar dari sebagian besar celah benchmark yang diperdebatkan secara daring. Seed default LeRobot adalah 1000. Kolom akumulasi gradien menjelaskan lerobot 0.5.1; versi upstream 0.6.2 mengeksposnya sebagai --accelerator.gradient_accumulation.steps.

Pengaturan yang lebih penting daripada pilihan model

Ini adalah *action chunk*. *Chunk* yang lebih panjang memberikan gerakan yang lebih halus dan lebih sedikit kesalahan yang menumpuk, tetapi kebijakan diterapkan saat blok dieksekusi, sehingga ia bereaksi lambat terhadap apa pun yang bergerak: percaya diri pada kubus statis, tidak berdaya pada kubus yang bergulir. Jika terjadi *overshoot*, memperpendek bagian yang dieksekusi lebih baik daripada melatih ulang dan gratis. Sendi yang berhenti mendadak adalah masalah yang berbeda; lihat .

  • ACT: ACTConfig secara default menggunakan chunk_size 100 dan n_action_steps 100. *Temporal ensembling* mati dan membutuhkan n_action_steps 1.
  • GR00T N1.7: *Horizon* internal berubah dari 16 menjadi 40, namun contoh SO-101 LeRobot masih menjalankan --policy.chunk_size=16 --policy.n_action_steps=16. *Flag rollout* diganti namanya menjadi --execution-horizon.
  • Pi0.5: *Chunk* 50 langkah, di mana resep LIBERO LeRobot mengeksekusi 10 melalui --policy.n_action_steps=10; dengan --policy.pretrained_path, ia akan kembali ke 50 jika Anda menghilangkan *flag* tersebut.
  • SmolVLA: *Chunk* 50 aksi, kedua *knob* terekspos.

Cara menyaring kelima model dalam satu sore

Jawaban termurah bukanlah dengan lebih banyak membaca. Habiskan sekitar 15 USD dan biarkan lengan robot memberi tahu Anda: rekam sekali, latih model yang murah terlebih dahulu, tingkatkan setelah data terbukti valid. Struktur mengalahkan volume, inti dari dan .

  1. 1
    Rekam 50 episode sekali

    Lima puluh membersihkan jalan untuk GR00T, Pi0.5, dan ACT, serta 30 untuk SmolVLA. Ulangi setiap variasi daripada menyebar tipis: 50 episode di 5 posisi kubus yang dilatih, di mana 25 tidak. Lihat rekam dataset pertama Anda.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Latih ACT terlebih dahulu, karena ia tidak bisa berbohong kepada Anda

    Tidak ada bobot praterlatih, jadi jika ia melakukan tugas sama sekali, dataset Anda berisi tugas tersebut. Jika ACT datar, perbaiki datanya. 1 hingga 3 USD, 2 hingga 5 jam pada kartu 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Jalankan SmolVLA pada dataset yang sama, tanpa perubahan

    Data yang sama, lengan yang sama, 450 juta parameter alih-alih 80 juta, ditambah pengkondisian bahasa. LeRobot menjalankan 20 ribu langkah sekitar 4 jam pada satu A100. Ini yang memberi tahu Anda apakah praterlatih memberikan keuntungan.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Konversi ke v2.1 sebelum Anda menyentuh GR00T

    GR00T membaca format LeRobot v2 ditambah meta/modality.json tambahan yang memetakan bagaimana array status dan aksi yang digabungkan terbagi menjadi bidang bernama. Dataset v3.0 akan membuat loader tersebut crash, karena v3.0 mengemas banyak episode ke dalam file bersama di mana v2 menulis satu per episode. Isaac-GR00T mengirimkan pembantu penurunan versi sebagai scripts/lerobot_conversion/convert_v3_to_v2.py; halaman penolakan v3 adalah jalur cepat.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Eskalasi ke GR00T N1.7 hanya jika dua yang pertama menyisakan sesuatu yang belum optimal

    Melalui CLI NVIDIA, yang ditunjukkan di sini, atau tipe kebijakan groot LeRobot. NVIDIA merekomendasikan VRAM 40 GB atau lebih untuk fine-tuning, 16 GB untuk inferensi. Jika terjadi OOM, lihat halaman OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dua cara untuk menjalankan pemeriksaan awal itu

Tiga lingkungan, karena toolchain tidak dapat hidup berdampingan. LeRobot di main adalah 0.6.2 dan membutuhkan Python 3.12 atau yang lebih baru; Isaac-GR00T dan openpi adalah repositori terpisah yang dikelola uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T mengunci torchcodec 0.8.0 sebagai satu-satunya backend videonya, membutuhkan FFmpeg 4 hingga 7. FFmpeg 8 tidak didukung, AV1 tidak dijamin.
  • Batas memori openpi: inferensi di atas 8 GB, LoRA di atas 22.5 GB, fine-tuning penuh di atas 70 GB. Yang terakhir itulah mengapa Pi0.5 adalah pekerjaan A100.
  • Sewa GPU sendiri, hancurkan setelahnya, rekonsiliasi tiga set jalur checkpoint secara manual.

Model dasar atau dari awal

Pilihan sebenarnya bukanlah model 3 B mana yang akan dipilih. Ini adalah apakah akan menggunakan VLA yang sudah dilatih sebelumnya sama sekali, mengingat bahwa ACT mempelajari enam tugas bimanual nyata dari sekitar sepuluh menit demonstrasi masing-masing, dengan 80 M parameter dan tanpa pelatihan sebelumnya.

Penyetelan halus VLA yang sudah dilatih sebelumnya alih-alih melatih ACT dari awal
Apa yang Anda dapatkan
  • Pengkondisian bahasa. ACT tidak memilikinya; satu checkpoint ACT melakukan satu tugas.
  • Lebih baik pada objek yang tidak ada dalam demonstrasi Anda: pada SO-101, 50% dibandingkan 40% milik ACT di luar distribusi.
  • Multi-tugas sama sekali: SmolVLA mencapai 78.3% di tiga tugas SO-100 dengan satu checkpoint; ACT hanya dijalankan satu tugas.
Apa yang harus Anda bayar
  • Latensi 7.6x hingga 24x: 152 hingga 485 ms per langkah tindakan dibandingkan 20 ms milik ACT.
  • 4 hingga 12 USD per eksekusi alih-alih 1 hingga 3, dan tingkat A100 alih-alih kartu 24 GB mana pun.
  • Risiko lisensi, ditambah mode kegagalan repositori berpagar yang tidak ada dari awal.
  • Bobot yang sudah dilatih sebelumnya dapat menutupi dataset yang buruk. Penyetelan halus yang setengah berhasil pada data yang rusak membutuhkan waktu seminggu sebelum Anda melihat datanya.

Kasus mereproduksi eksekusi lama

Mengejar checkpoint 2025 membuat pilihan model untuk Anda dan mengubah masalah menjadi penguncian versi: LeRobot saat ini menolak N1.5, jadi Anda mengunci lerobot==0.5.1. Tanpa bidang seed dan variansi 5 hingga 6 persen antar eksekusi, reproduksi bersifat perkiraan berdasarkan konstruksi. Panduan N1.5 di SO-100 dan halaman kebijakan N1.5 memiliki sisi platform.

Halaman perbandingan langsung AY-Robots untuk GR00T N1.7 melawan Pi0.5, menampilkan jumlah parameter, persyaratan GPU, latensi inferensi, format dataset, dan jumlah episode minimum secara berdampingan.
Perbandingan langsung di /compare/groot-n1-7-vs-pi0-5. Kedua model 3 B terlihat dapat dipertukarkan pada lembar spesifikasi namun tidak: satu membutuhkan LeRobot v2.1, satu lagi membutuhkan v3.0.

Tersisa dua? ACT melawan GR00T N1.7 dan GR00T N1.7 melawan SmolVLA. Baris mentah ada di entri arena: GR00T N1.7, Pi0.5, SmolVLA dan ACT.

Di mana platform ini tidak membantu Anda

  • Ini tidak dapat membuat inferensi jarak jauh menjadi cepat. Loop 20 hingga 485 ms adalah milik model; perjalanan bolak-balik internet menambah waktu tersebut.
  • Ini tidak dapat melakukan fine-tuning GR00T atau Pi0.5 pada perangkat keras Anda sendiri. Keduanya hanya berbasis cloud di sini; hanya SmolVLA dan ACT yang berjalan secara lokal.
  • Ini tidak dapat memperbaiki dataset. Loss turun tetapi kebijakan tidak melakukan apa-apa adalah masalah data, kebijakan yang hanya berfungsi dalam satu pengaturan adalah masalah cakupan.
  • Ini tidak dapat membuat GR00T berjalan secara reproduktif: konfigurasi hulu tidak memiliki bidang seed.

85 model, 332 hasil benchmark, setiap angka terhubung ke sumbernya

Versi tabel yang dapat diurutkan di halaman ini: 85 model visi-bahasa-aksi, 332 hasil benchmark, masing-masing terhubung kembali ke makalah atau kartu modelnya.

Buka arena

Memilih satu dan melanjutkan

Satu default: rekam 50 episode, latih ACT seharga 1 hingga 3 USD untuk membuktikan dataset, lalu SmolVLA pada data yang sama. Bersama-sama di bawah 6 USD, dan mereka menjawab pertanyaan penting: apakah pretraining membantu di sini, atau apakah hambatan utamanya adalah data. Eskalasi ke GR00T N1.7 untuk tugas multi-langkah yang kaya kontak, ke Pi0.5 saat adegan berubah.

Panduan platform: latih kebijakan pertama Anda, lalu jalankan kebijakan pertama Anda. dokumen pelatihan dan dokumen dataset mencakup bentuk dan format; halaman SO-100 dan panduan lengkap SO-100 mencakup pembangunan dan kalibrasi. Latar belakang: ikhtisar VLA dan artikel pencocokan aliran Pi0. Yang akan meningkatkan tingkat keberhasilan Anda adalah panduan kualitas data.

Kebijakan VLA mana yang harus saya latih terlebih dahulu pada SO-100?

ACT, lalu SmolVLA. ACT melatih dari awal, sehingga tidak dapat menutupi dataset yang buruk, dan satu kali jalankan membutuhkan biaya 1 hingga 3 USD pada kartu 24 GB. Jika ACT dapat melakukan tugas tersebut, biaya 4 hingga 12 USD untuk menjalankan GR00T N1.7 atau Pi0.5 tidak akan sia-sia.

Apakah GR00T N1.7 benar-benar lebih baik dari Pi0.5?

Pada LIBERO, perbedaannya berada dalam batas noise: 97.0% di empat suite untuk GR00T N1.7, 96.85% untuk Pi0.5 pada 30k langkah di openpi, 97.5% untuk port LeRobot, semuanya dari harness yang berbeda. Perbedaan sebenarnya adalah 152 ms per langkah aksi dibandingkan 485 ms, dataset v2.1 dibandingkan v3.0, dan akurasi benchmark dibandingkan generalisasi dunia terbuka.

Bisakah saya melakukan fine-tuning salah satu dari ini pada satu RTX 4090?

SmolVLA dan ACT, ya; keduanya terdaftar untuk RTX 4090 atau kartu 24 GB apa pun dan berjalan secara lokal. GR00T N1.7, N1.5, dan Pi0.5 membutuhkan A100 atau H100 80 GB dan hanya tersedia di cloud di sini. NVIDIA merekomendasikan 40 GB atau lebih untuk fine-tuning GR00T; batas bawah openpi di atas 70 GB untuk fine-tune Pi0.5 penuh, 22.5 GB untuk LoRA.

Manakah dari kelima ini yang dapat saya gunakan secara komersial?

Bobot GR00T N1.7 berada di bawah NVIDIA Open Model License Agreement, yang menurut kartu tersebut mencakup penggunaan komersial. Bobot N1.5 bersifat non-komersial. Kode SmolVLA adalah Apache 2.0 di LeRobot, tetapi kartu lerobot/smolvla_base tidak memiliki bidang lisensi, sehingga bobotnya tidak disebutkan. ACT tidak memiliki bobot dasar untuk dilisensikan. Pi0.5 ambigu: dokumen LeRobot mengatakan Apache 2.0, metadata kartunya bertuliskan license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started