
GR00T N1.7, Pi0.5, SmolVLA, ACT atau GR00T N1.5? Sebuah tabel keputusan yang disesuaikan dengan situasi nyata, lengkap dengan angka benchmark yang dipublikasikan, latensi, biaya per eksekusi, dan lisensi di balik setiap pilihan.
Lima kebijakan dapat dilatih pada lengan kelas SO-100 saat ini. Perbedaannya adalah faktor 24 dalam inferensi latensi, 37 dalam jumlah parameter, dan 12 dalam biaya satu kali jalankan, serta dalam apakah Anda boleh mengirimkan hasilnya. Lima kartu model tidak akan menyelesaikannya: tidak ada yang menjawab pertanyaan Anda, mana yang harus saya jalankan terlebih dahulu?
Setiap angka di bawah ini diambil dari makalah, repositori, dan kartu pada Agustus 2026. Angka platform berasal dari katalog kebijakan AY-Robots; jika keduanya tidak sesuai, keduanya ditampilkan.
Versi singkat
- •Latih ACT terlebih dahulu jika Anda meragukan dataset Anda: 1 hingga 3 USD per jalankan, tidak ada yang dilatih sebelumnya untuk menutupi data yang buruk.
- •GR00T N1.7 dan Pi0.5 berada dalam setengah poin pada LIBERO, 97.0 berbanding 96.85 hingga 97.5. Itu bukan alasan untuk memilih salah satu.
- •Pi0.5 adalah strategi generalisasi, bukan strategi akurasi, dan yang paling lambat pada 485 ms.
- •SmolVLA, dengan 450 J parameter, adalah satu-satunya VLA di sini yang melakukan fine-tuning pada satu kartu 24 GB.
- •ACT pada 20 ms adalah satu-satunya pilihan untuk gerakan reaktif cepat. Lisensi menentukan sisanya.
Tabel keputusan
| Situasi Anda | Latih ini | Mengapa |
|---|---|---|
| Kualitas dataset belum terbukti | ACT | Tidak ada yang dilatih sebelumnya yang dapat menyembunyikan dataset yang rusak, dan kegagalan memakan biaya 1 hingga 3 USD. |
| Kaya kontak, multi-langkah, terkondisi bahasa | GR00T N1.7 | 97.0% di atas empat suite LIBERO, ditambah ruang aksi end-effector relatif. |
| Gerakan reaktif cepat, inferensi pada servo | ACT | 20 ms. Yang tercepat berikutnya 7.6 kali lebih lambat. |
| Objek baru, adegan baru, dunia terbuka | Pi0.5 | Dibangun untuk perilaku di luar distribusi, di hingga 104 lokasi. |
| Satu kartu 24 GB, masih menginginkan bahasa | SmolVLA | 450 M parameter, batas bawah 30 episode, berjalan secara lokal. |
| Mereproduksi jalankan yang direkam pada tahun 2025 | GR00T N1.5 | Hanya jika Anda harus: LeRobot sekarang menolaknya, bobot non-komersial. |
| Ini akan dikirim sebagai produk | N1.7, SmolVLA or ACT | N1.5 bersifat non-komersial, Pi0.5 membawa ketentuan Gemma, kartu SmolVLA menyatakan tidak ada. |
Lima kandidat
Kelima-limanya adalah kebijakan: bingkai kamera, posisi sendi dan, untuk empat di antaranya, instruksi bahasa, dipetakan ke sebagian target sendi di masa depan. Yang membedakan mereka adalah seberapa banyak yang telah dipelajari sebelum Anda tiba.
| Kebijakan | Parameter | Latensi | Tingkat GPU | Lokal? | Episode Min | Format | Biaya |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ya | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ya | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | tidak | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | tidak | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | tidak | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Model aksi bahasa-visi NVIDIA saat ini model aksi bahasa-visi, sekitar 3 miliar parameter, sekitar 40 juta dilatih selama penyetelan halus. Repositori mencantumkan delta dari N1.6: backbone dari model Eagle yang dijual ke Cosmos-Reason2-2B pada Qwen3-VL, lapisan difusi 32 menjadi 16, dimensi keadaan dan aksi 29 menjadi 132, horizon aksi 16 menjadi 40.
Yang penting pada lengan kecil adalah ruang aksi end-effector relatif: N1.7 memprediksi delta dari pose saat ini, yang memungkinkan 20 ribu jam video manusia EgoScale ditransfer ke kebijakan robot. Spesifikasi di halaman N1.7, prosedur dalam panduan N1.7 pada SO-100.
README Isaac-GR00T menyatakan N1.7 sebagai rilis Ketersediaan Umum, dengan benchmark dan dukungan lengkap. Kartu Hugging Face-nya belum diperbarui: bidang Model Version masih bertuliskan GR00T N1.7 EA. Repositori adalah dokumen yang lebih baru.
GR00T N1.5
Skala 3 B yang sama, backbone Eagle 2, SigLip2 dan T5, head DiT flow-matching. Ini ada untuk memperluas yang sudah Anda miliki. Dua hal membuatnya menjadi pilihan default yang buruk: bobotnya membawa lisensi non-komersial satu arah NVIDIA, dan rilis LeRobot saat ini menghapus dukungan N1.5. Lihat .
Pi0.5
VLA dari Physical Intelligence, tipe kebijakan pi05. Makalah ini menyajikan VLM 2 B yang diinisialisasi dari PaliGemma ditambah ahli tindakan 300 M, menggerakkan robot pada 50 Hz; konfigurasi pi05 LeRobot secara default menggunakan potongan 50 langkah, satu detik pada kecepatan tersebut. Keunggulan utamanya adalah tempat-tempat yang belum pernah terlihat: sekitar 400 jam manipulasi seluler di rumah-rumah nyata, dan studi penskalaan di lebih dari 3, 12, 22, 53, 82, dan 104 lokasi, di mana model 104 lokasi cocok dengan kontrol yang dilatih di rumah-rumah uji itu sendiri.
Satu batasan, yang disebutkan pada kartu lerobot/pi05_base: port hanya membawa kepala aksi pencocokan aliran. Prediksi subtugas, tokenisasi aksi, dan RL tidak dirilis secara upstream, dan openpi mengatakan hal yang sama untuk repositorinya sendiri. Halaman Pi0.5 dan panduan Pi0.5 di SO-100 memiliki sisanya.
Pi0.5 memerlukan tokenizer google/paligemma-3b-pt-224 yang berpagar (gated: manual, meskipun Google mengatakan permintaan diproses segera). Tanpa menerimanya dan menjalankan hf auth login di lingkungan pelatihan, pekerjaan akan dimulai, mengunduh sebentar, lalu mati karena kesalahan otorisasi yang terbaca seperti kegagalan jaringan. nvidia/GR00T-N1.7-3B tidak berpagar, tetapi tulang punggungnya nvidia/Cosmos-Reason2-2B berpagar (gated: auto). Bersihkan keduanya sebelum mengantre; jika sebuah proses berjalan diam, halaman antrean macet mencantumkan apa yang harus diperiksa.
SmolVLA
450 M parameter, sekitar 100 M di pakar aksi, pada SmolVLM-2 dengan VLM dibekukan dan hanya 16 lapisan model bahasanya yang pertama digunakan. Pelatihan awal adalah data komunitas: 481 dataset, 10.6 M frame, dari lengan murah yang sama yang Anda gunakan. Satu-satunya VLA di sini yang muat di satu kartu 24 GB, dan satu-satunya lantai 30 episode. Lihat halaman SmolVLA.
ACT
Bukan model dasar. Action Chunking Transformer dari ALOHA memiliki sekitar 80 juta parameter yang dilatih dari awal per tugas, pada 50 demonstrasi pada 50 Hz. Makalah ini melaporkan enam tugas bimanual nyata dari sekitar sepuluh menit demonstrasi masing-masing, pada 80 hingga 90 persen pada contoh-contoh yang disorotnya. Idenya, pemotongan aksi, ada di setiap model di halaman ini, dan ablasinya masih mengukur efek terbaik: pada dua tugas simulasi dengan temporal ensembling dimatikan, keberhasilan meningkat dari 1 persen pada k=1 menjadi 44 persen pada k=100. Halaman ACT memiliki sisanya.
Apa yang sebenarnya dikatakan oleh benchmark
LIBERO adalah satu-satunya benchmark yang dilaporkan oleh tiga dari lima ini: tugas-tugas yang dikondisikan bahasa pada simulasi Franka Panda, dibagi menjadi empat suite di bawah ini dengan masing-masing sepuluh tugas. NVIDIA menjalankan 200 percobaan per suite.
| Model | Spatial | Object | Goal | 10 (Long) | Average |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Setiap angka berasal dari harness dan anggaran yang berbeda. GR00T berjalan 20K langkah pada batch global 640; angka openpi adalah checkpoint 30K; port LeRobot menambahkan 6K langkah ke model dasar LIBERO. SmolVLA adalah ketidakcocokan lebih lanjut: makalahnya melatih baris tersebut pada LIBERO dari awal, tanpa pra-pelatihan VLA, sementara tiga di atasnya melakukan fine-tuning checkpoint yang sudah dilatih sebelumnya. Perlakukan 96.85 hingga 97.5 sebagai satu kluster, dan celah ke 87.3% sebagai nyata tetapi diperoleh dengan 6.7x parameter.
SimplerEnv menunjukkan penyebaran, yang tidak dilakukan LIBERO. NVIDIA membandingkan N1.7 dengan N1.6, hal publik terdekat dengan delta generasi.
| SimplerEnv suite | N1.6 average | N1.7 average | Best swing | Worst swing |
|---|---|---|---|---|
| Bridge (WidowX), 7 tugas | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tugas | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | tidak ada, setiap tugas meningkat |
Baris Bridge adalah yang berguna: rata-rata 5.7 poin diperoleh sementara put_eggplant_in_basket kehilangan 36 dan put_eggplant_in_sink turun dari 33 menjadi 2. Generasi baru menggeser distribusi daripada mengangkatnya, jadi jika tugas Anda berada di mana N1.7 mengalami regresi, rata-rata tidak mengatakan apa-apa.

Dari kelimanya, hanya makalah SmolVLA yang melaporkan lengan kelas SO-100: 78.3 persen untuk SmolVLA dan 61.7 untuk Pi0 di tiga tugas, keduanya multi-tugas, dibandingkan 48.3 untuk ACT yang dilatih tugas tunggal, yang tidak sebanding. Pasangan yang bersih adalah keduanya tugas tunggal pada SO-101 pick-and-place: 90 berbanding 70 dalam distribusi, 50 berbanding 40 di luarnya. Bandingkan pada ACT against SmolVLA dan Pi0.5 against SmolVLA, atau jelajahi arena.
Latensi dan biaya menentukan penerapan
Latensi inferensi adalah batasan yang orang temukan terakhir dan sesali pertama kali. Sebuah kebijakan yang lima poin lebih baik pada benchmark tetapi setengah detik per langkah aksi terlihat lebih buruk di meja Anda: dinamika kontak tidak menunggu.
Satu peringatan: angka GR00T tidak sesuai dengan kartu NVIDIA, yang mencatat 4 langkah denoising dan satu kamera pada 85.8 ms pada H100 dalam mode eager, 48.6 ms dengan torch.compile, 27.9 ms melalui TensorRT penuh. Angka 152 ms di sini adalah angka seluruh tumpukan dengan overhead penyajian dan lebih dari satu kamera, bukan forward pass.
Loop 20 hingga 485 ms adalah milik model, dan perjalanan pulang-pergi internet publik menambahnya. Inferensi jarak jauh dapat dilakukan untuk pick-and-place yang lambat, bukan untuk gerakan reaktif yang cepat. Jika tugas Anda membutuhkan kecepatan, inferensi berada di samping servo: ACT atau SmolVLA, secara lokal. Terkait: kebijakan membeku di tengah gerakan.
Salah satu cara untuk menghemat waktu tanpa mengubah model: makalah SmolVLA mengukur eksekusi sinkron, di mana kebijakan menyelesaikan satu bagian sebelum memprediksi yang berikutnya, dibandingkan dengan asinkron, di mana prediksi tumpang tindih dengan eksekusi. Keberhasilan serupa, 78.3 berbanding 73.3, tetapi pick-and-place yang sama membutuhkan 9.7 detik alih-alih 13.75, dan dalam jendela tetap robot mengelola 19 siklus alih-alih 9.
Lisensi, diperiksa karena tidak ada yang memeriksanya
| Model | Lisensi Bobot | Lisensi Kode | Penggunaan Komersial |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kartu mengizinkan penggunaan komersial | Apache 2.0 | yes |
| GR00T N1.5 | Lisensi non-komersial satu arah NVIDIA | Apache 2.0 | no |
| Pi0.5 | metadata kartu pi05_base membaca lisensi: gemma | Apache 2.0 (openpi, LeRobot docs) | baca keduanya, ada perbedaan |
| SmolVLA | tidak ada bidang lisensi pada kartu smolvla_base | Apache 2.0 (LeRobot) | kode ya, bobot tidak disebutkan |
| ACT | tidak ada bobot dasar yang ada | Apache 2.0 (LeRobot) | yes |
Baris Pi0.5 perlu perhatian. Dokumentasi LeRobot pi05 menyatakan Apache 2.0 konsisten dengan openpi, sementara kartu Hub untuk lerobot/pi05_base membawa license: gemma. Keduanya aktif. GR00T N1.7 memiliki versi yang lebih ringan: README Isaac-GR00T menyebutkan secara sepintas bahwa N1.7 sepenuhnya dapat dilisensikan secara komersial di bawah Apache 2.0, sementara bagian lisensinya sendiri dan kartu model hanya menempatkan kode di bawah Apache 2.0 dan bobot di bawah NVIDIA Open Model License.
Default yang akan Anda jalankan
Setiap formulir pelatih dilengkapi dengan pengaturan default, dan pengaturan tersebut tidak sembarangan. Pengaturan ACT adalah milik LeRobot sendiri: batch 8, lr 1e-5, 100000 langkah pelatihan, ukuran chunk 100, sesuai dengan ACTConfig upstream dan k=100 dari makalah ACT. Salah satu kolom di bawah ini adalah jebakan.
| Kebijakan | Batch | LR | Langkah maks | Akumulasi gradien | Berlaku? | Pengaturan tambahan |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ya | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ya | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | tidak (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | tidak | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | tidak | chunkSize, nActionSteps, seed, logFreq |
Titik masuk fine-tuning GR00T (launch_finetune.py, CLI tyro) tidak memiliki bidang seed dalam dataclass konfigurasinya, sehingga eksekusi tidak dapat direproduksi secara bit-per-bit. Repositori juga memperingatkan adanya variansi 5 hingga 6 persen antar eksekusi dari augmentasi gambar non-deterministik, lebih besar dari sebagian besar celah benchmark yang diperdebatkan secara daring. Seed default LeRobot adalah 1000. Kolom akumulasi gradien menjelaskan lerobot 0.5.1; versi upstream 0.6.2 mengeksposnya sebagai --accelerator.gradient_accumulation.steps.
Pengaturan yang lebih penting daripada pilihan model
Ini adalah *action chunk*. *Chunk* yang lebih panjang memberikan gerakan yang lebih halus dan lebih sedikit kesalahan yang menumpuk, tetapi kebijakan diterapkan saat blok dieksekusi, sehingga ia bereaksi lambat terhadap apa pun yang bergerak: percaya diri pada kubus statis, tidak berdaya pada kubus yang bergulir. Jika terjadi *overshoot*, memperpendek bagian yang dieksekusi lebih baik daripada melatih ulang dan gratis. Sendi yang berhenti mendadak adalah masalah yang berbeda; lihat .
- ACT: ACTConfig secara default menggunakan
chunk_size 100dann_action_steps 100. *Temporal ensembling* mati dan membutuhkann_action_steps 1. - GR00T N1.7: *Horizon* internal berubah dari 16 menjadi 40, namun contoh SO-101 LeRobot masih menjalankan
--policy.chunk_size=16 --policy.n_action_steps=16. *Flag rollout* diganti namanya menjadi--execution-horizon. - Pi0.5: *Chunk* 50 langkah, di mana resep LIBERO LeRobot mengeksekusi 10 melalui
--policy.n_action_steps=10; dengan--policy.pretrained_path, ia akan kembali ke 50 jika Anda menghilangkan *flag* tersebut. - SmolVLA: *Chunk* 50 aksi, kedua *knob* terekspos.
Cara menyaring kelima model dalam satu sore
Jawaban termurah bukanlah dengan lebih banyak membaca. Habiskan sekitar 15 USD dan biarkan lengan robot memberi tahu Anda: rekam sekali, latih model yang murah terlebih dahulu, tingkatkan setelah data terbukti valid. Struktur mengalahkan volume, inti dari dan .
- 1Rekam 50 episode sekali
Lima puluh membersihkan jalan untuk GR00T, Pi0.5, dan ACT, serta 30 untuk SmolVLA. Ulangi setiap variasi daripada menyebar tipis: 50 episode di 5 posisi kubus yang dilatih, di mana 25 tidak. Lihat rekam dataset pertama Anda.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Latih ACT terlebih dahulu, karena ia tidak bisa berbohong kepada Anda
Tidak ada bobot praterlatih, jadi jika ia melakukan tugas sama sekali, dataset Anda berisi tugas tersebut. Jika ACT datar, perbaiki datanya. 1 hingga 3 USD, 2 hingga 5 jam pada kartu 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Jalankan SmolVLA pada dataset yang sama, tanpa perubahan
Data yang sama, lengan yang sama, 450 juta parameter alih-alih 80 juta, ditambah pengkondisian bahasa. LeRobot menjalankan 20 ribu langkah sekitar 4 jam pada satu A100. Ini yang memberi tahu Anda apakah praterlatih memberikan keuntungan.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konversi ke v2.1 sebelum Anda menyentuh GR00T
GR00T membaca format LeRobot v2 ditambah
meta/modality.jsontambahan yang memetakan bagaimana array status dan aksi yang digabungkan terbagi menjadi bidang bernama. Dataset v3.0 akan membuat loader tersebut crash, karena v3.0 mengemas banyak episode ke dalam file bersama di mana v2 menulis satu per episode. Isaac-GR00T mengirimkan pembantu penurunan versi sebagaiscripts/lerobot_conversion/convert_v3_to_v2.py; halaman penolakan v3 adalah jalur cepat.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Eskalasi ke GR00T N1.7 hanya jika dua yang pertama menyisakan sesuatu yang belum optimal
Melalui CLI NVIDIA, yang ditunjukkan di sini, atau tipe kebijakan
grootLeRobot. NVIDIA merekomendasikan VRAM 40 GB atau lebih untuk fine-tuning, 16 GB untuk inferensi. Jika terjadi OOM, lihat halaman OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dua cara untuk menjalankan pemeriksaan awal itu
Tiga lingkungan, karena toolchain tidak dapat hidup berdampingan. LeRobot di main adalah 0.6.2 dan membutuhkan Python 3.12 atau yang lebih baru; Isaac-GR00T dan openpi adalah repositori terpisah yang dikelola uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T mengunci
torchcodec0.8.0 sebagai satu-satunya backend videonya, membutuhkan FFmpeg 4 hingga 7. FFmpeg 8 tidak didukung, AV1 tidak dijamin. - Batas memori openpi: inferensi di atas 8 GB, LoRA di atas 22.5 GB, fine-tuning penuh di atas 70 GB. Yang terakhir itulah mengapa Pi0.5 adalah pekerjaan A100.
- Sewa GPU sendiri, hancurkan setelahnya, rekonsiliasi tiga set jalur checkpoint secara manual.
Lima model yang sama, satu formulir. Pilih model, dataset, dan hyperparameter; backend menyewa GPU yang ukurannya disesuaikan dengan VRAM yang dibutuhkan, menjalankan trainer, dan menulis checkpoint ke penyimpanan objek.
- Matriks pelatihan adalah lima model dengan empat lengan, setiap sel adalah panduan: SmolVLA di SO-100, ACT di SO-101.
- Pod inferensi secara otomatis disediakan oleh
/api/inference/poddengan watchdog idle, sehingga pod yang terlupakan tidak akan menagih secara diam-diam. - Checkpoint dasar adalah milik vendor sendiri:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT tidak memiliki. - Operasi yang sama dari CLI dan dari agen AI melalui server MCP.
- Tidak ada perangkat keras? Lengan langsung mengalirkan SO-100 fisik tanpa pendaftaran; halaman coba menunjukkan cara-cara masuk.
Model dasar atau dari awal
Pilihan sebenarnya bukanlah model 3 B mana yang akan dipilih. Ini adalah apakah akan menggunakan VLA yang sudah dilatih sebelumnya sama sekali, mengingat bahwa ACT mempelajari enam tugas bimanual nyata dari sekitar sepuluh menit demonstrasi masing-masing, dengan 80 M parameter dan tanpa pelatihan sebelumnya.
- Pengkondisian bahasa. ACT tidak memilikinya; satu checkpoint ACT melakukan satu tugas.
- Lebih baik pada objek yang tidak ada dalam demonstrasi Anda: pada SO-101, 50% dibandingkan 40% milik ACT di luar distribusi.
- Multi-tugas sama sekali: SmolVLA mencapai 78.3% di tiga tugas SO-100 dengan satu checkpoint; ACT hanya dijalankan satu tugas.
- Latensi 7.6x hingga 24x: 152 hingga 485 ms per langkah tindakan dibandingkan 20 ms milik ACT.
- 4 hingga 12 USD per eksekusi alih-alih 1 hingga 3, dan tingkat A100 alih-alih kartu 24 GB mana pun.
- Risiko lisensi, ditambah mode kegagalan repositori berpagar yang tidak ada dari awal.
- Bobot yang sudah dilatih sebelumnya dapat menutupi dataset yang buruk. Penyetelan halus yang setengah berhasil pada data yang rusak membutuhkan waktu seminggu sebelum Anda melihat datanya.
Kasus mereproduksi eksekusi lama
Mengejar checkpoint 2025 membuat pilihan model untuk Anda dan mengubah masalah menjadi penguncian versi: LeRobot saat ini menolak N1.5, jadi Anda mengunci lerobot==0.5.1. Tanpa bidang seed dan variansi 5 hingga 6 persen antar eksekusi, reproduksi bersifat perkiraan berdasarkan konstruksi. Panduan N1.5 di SO-100 dan halaman kebijakan N1.5 memiliki sisi platform.

Tersisa dua? ACT melawan GR00T N1.7 dan GR00T N1.7 melawan SmolVLA. Baris mentah ada di entri arena: GR00T N1.7, Pi0.5, SmolVLA dan ACT.
Di mana platform ini tidak membantu Anda
- Ini tidak dapat membuat inferensi jarak jauh menjadi cepat. Loop 20 hingga 485 ms adalah milik model; perjalanan bolak-balik internet menambah waktu tersebut.
- Ini tidak dapat melakukan fine-tuning GR00T atau Pi0.5 pada perangkat keras Anda sendiri. Keduanya hanya berbasis cloud di sini; hanya SmolVLA dan ACT yang berjalan secara lokal.
- Ini tidak dapat memperbaiki dataset. Loss turun tetapi kebijakan tidak melakukan apa-apa adalah masalah data, kebijakan yang hanya berfungsi dalam satu pengaturan adalah masalah cakupan.
- Ini tidak dapat membuat GR00T berjalan secara reproduktif: konfigurasi hulu tidak memiliki bidang seed.
85 model, 332 hasil benchmark, setiap angka terhubung ke sumbernya
Versi tabel yang dapat diurutkan di halaman ini: 85 model visi-bahasa-aksi, 332 hasil benchmark, masing-masing terhubung kembali ke makalah atau kartu modelnya.
Buka arenaMemilih satu dan melanjutkan
Satu default: rekam 50 episode, latih ACT seharga 1 hingga 3 USD untuk membuktikan dataset, lalu SmolVLA pada data yang sama. Bersama-sama di bawah 6 USD, dan mereka menjawab pertanyaan penting: apakah pretraining membantu di sini, atau apakah hambatan utamanya adalah data. Eskalasi ke GR00T N1.7 untuk tugas multi-langkah yang kaya kontak, ke Pi0.5 saat adegan berubah.
Panduan platform: latih kebijakan pertama Anda, lalu jalankan kebijakan pertama Anda. dokumen pelatihan dan dokumen dataset mencakup bentuk dan format; halaman SO-100 dan panduan lengkap SO-100 mencakup pembangunan dan kalibrasi. Latar belakang: ikhtisar VLA dan artikel pencocokan aliran Pi0. Yang akan meningkatkan tingkat keberhasilan Anda adalah panduan kualitas data.
Kebijakan VLA mana yang harus saya latih terlebih dahulu pada SO-100?▾
ACT, lalu SmolVLA. ACT melatih dari awal, sehingga tidak dapat menutupi dataset yang buruk, dan satu kali jalankan membutuhkan biaya 1 hingga 3 USD pada kartu 24 GB. Jika ACT dapat melakukan tugas tersebut, biaya 4 hingga 12 USD untuk menjalankan GR00T N1.7 atau Pi0.5 tidak akan sia-sia.
Apakah GR00T N1.7 benar-benar lebih baik dari Pi0.5?▾
Pada LIBERO, perbedaannya berada dalam batas noise: 97.0% di empat suite untuk GR00T N1.7, 96.85% untuk Pi0.5 pada 30k langkah di openpi, 97.5% untuk port LeRobot, semuanya dari harness yang berbeda. Perbedaan sebenarnya adalah 152 ms per langkah aksi dibandingkan 485 ms, dataset v2.1 dibandingkan v3.0, dan akurasi benchmark dibandingkan generalisasi dunia terbuka.
Bisakah saya melakukan fine-tuning salah satu dari ini pada satu RTX 4090?▾
SmolVLA dan ACT, ya; keduanya terdaftar untuk RTX 4090 atau kartu 24 GB apa pun dan berjalan secara lokal. GR00T N1.7, N1.5, dan Pi0.5 membutuhkan A100 atau H100 80 GB dan hanya tersedia di cloud di sini. NVIDIA merekomendasikan 40 GB atau lebih untuk fine-tuning GR00T; batas bawah openpi di atas 70 GB untuk fine-tune Pi0.5 penuh, 22.5 GB untuk LoRA.
Manakah dari kelima ini yang dapat saya gunakan secara komersial?▾
Bobot GR00T N1.7 berada di bawah NVIDIA Open Model License Agreement, yang menurut kartu tersebut mencakup penggunaan komersial. Bobot N1.5 bersifat non-komersial. Kode SmolVLA adalah Apache 2.0 di LeRobot, tetapi kartu lerobot/smolvla_base tidak memiliki bidang lisensi, sehingga bobotnya tidak disebutkan. ACT tidak memiliki bobot dasar untuk dilisensikan. Pi0.5 ambigu: dokumen LeRobot mengatakan Apache 2.0, metadata kartunya bertuliskan license: gemma.
Sources
- Repositori NVIDIA Isaac-GR00T: status GA, perubahan N1.6 ke N1.7, persyaratan perangkat keras, batasan torchcodec dan FFmpeg, launch_finetune.py, varians antar-jalankan
- Kartu model nvidia/GR00T-N1.7-3B: backbone Cosmos-Reason2-2B, 3 B parameter, tabel waktu inferensi, NVIDIA Open Model License, bidang Model Version
- Kartu model nvidia/GR00T-N1.5-3B: referensi Eagle 2, SigLip2 dan T5, flow matching DiT, lisensi non-komersial satu arah
- Contoh Isaac-GR00T LIBERO: tingkat keberhasilan per-suite pada 20K langkah dan ukuran batch 640, 200 percobaan per suite
- Contoh Isaac-GR00T SimplerEnv: tingkat keberhasilan Bridge dan Fractal per-tugas, GR00T N1.6 dibandingkan N1.7
- pi0.5: Model Visi-Bahasa-Aksi dengan Generalisasi Dunia Terbuka (2 B VLM ditambah 300 M ahli aksi, kontrol 50 Hz, sekitar 400 jam manipulasi seluler, studi penskalaan lebih dari 3 hingga 104 lokasi)
- Repositori openpi: batas bawah memori GPU, cakupan flow-matching-head-only, dan hasil Pi0.5 LIBERO di examples/libero
- Kartu model lerobot/pi05_base: cakupan port LeRobot, metadata license: gemma, penggunaan lerobot-train
- Dokumentasi LeRobot pi0.5: tokenizer PaliGemma berpagar, tabel reproduksi LIBERO, jebakan fallback n_action_steps, pernyataan Apache 2.0
- SmolVLA: Model Visi-Bahasa-Aksi untuk Robotika yang Terjangkau dan Efisien (450 M parameter, tabel LIBERO dan Meta-World, hasil SO-100 dan SO-101, inferensi asinkron)
- Dokumentasi LeRobot SmolVLA: 50 episode di 5 posisi dibandingkan 25, 20k langkah dalam sekitar 4 jam pada A100
- Mempelajari Manipulasi Bimanual Berbutir Halus dengan Perangkat Keras Berbiaya Rendah (ACT dan ALOHA): 6 tugas pada 80-90 persen, ablasi ukuran chunk dari k=1 hingga k=100
- LeRobot 0.6.2: default ACTConfig dan SmolVLAConfig, seed default 1000, --accelerator.gradient_accumulation.steps, persyaratan Python 3.12, Apache 2.0
- Dokumentasi LeRobot GR00T: tipe kebijakan groot, dukungan N1.5 dihapus, pin lerobot==0.5.1, contoh ukuran chunk SO-101
- Kartu model lerobot/smolvla_base: checkpoint dasar SmolVLA yang digunakan oleh --policy.path, dan metadata kartunya, yang tidak memiliki bidang lisensi
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started