
GR00T N1.7, Pi0.5, SmolVLA, ACT atau GR00T N1.5? Jadual keputusan yang dipadankan dengan situasi sebenar, dengan nombor penanda aras yang diterbitkan, kependaman, kos setiap larian dan lesen di sebalik setiap pilihan.
Lima polisi boleh dilatih pada lengan kelas SO-100 hari ini. Ia berbeza dengan faktor 24 dalam inferens latensi, 37 dalam kiraan parameter dan 12 dalam kos satu larian, dan sama ada anda boleh menghantar hasilnya. Lima kad model tidak akan menyelesaikannya: tiada satu pun yang menjawab soalan anda, yang mana satu patut saya jalankan dahulu?
Setiap nombor di bawah dibaca daripada kertas kerja, repositori dan kad pada Ogos 2026. Nombor platform datang daripada katalog polisi AY-Robots; di mana kedua-duanya tidak bersetuju, kedua-duanya ditunjukkan.
Versi ringkas
- •Latih ACT dahulu jika anda meragui set data anda: 1 hingga 3 USD setiap larian, tiada pra-latihan untuk menutupi data buruk.
- •GR00T N1.7 dan Pi0.5 berada dalam lingkungan setengah mata pada LIBERO, 97.0 berbanding 96.85 hingga 97.5. Itu bukan sebab untuk memilih mana-mana satu.
- •Pi0.5 adalah untuk generalisasi, bukan untuk ketepatan, dan yang paling perlahan pada 485 ms.
- •SmolVLA, pada 450 M parameter, adalah satu-satunya VLA di sini yang melakukan penalaan halus pada satu kad 24 GB.
- •ACT pada 20 ms adalah satu-satunya pilihan untuk gerakan reaktif pantas. Lesen menentukan selebihnya.
Jadual keputusan
| Situasi anda | Latih ini | Mengapa |
|---|---|---|
| Kualiti set data tidak terbukti | ACT | Tiada pra-latihan yang dapat menyembunyikan set data yang rosak, dan kegagalan menelan kos 1 hingga 3 USD. |
| Kaya sentuhan, berbilang langkah, berkeadaan bahasa | GR00T N1.7 | 97.0% merentasi empat suite LIBERO, ditambah ruang tindakan hujung efektor relatif. |
| Gerakan reaktif pantas, inferens pada servo | ACT | 20 ms. Yang terpantas seterusnya adalah 7.6 kali lebih perlahan. |
| Objek baharu, pemandangan baharu, dunia terbuka | Pi0.5 | Dibina untuk tingkah laku luar taburan, merentasi sehingga 104 lokasi. |
| Satu kad 24 GB, masih mahukan bahasa | SmolVLA | 450 M parameter, lantai 30 episod, berjalan secara tempatan. |
| Menghasilkan semula larian yang direkodkan pada tahun 2025 | GR00T N1.5 | Hanya jika perlu: LeRobot kini menolaknya, pemberat bukan komersial. |
| Ini akan dihantar sebagai produk | N1.7, SmolVLA or ACT | N1.5 adalah bukan komersial, Pi0.5 membawa terma Gemma, kad SmolVLA menyatakan tiada. |
Lima calon
Kesemua lima adalah polisi: bingkai kamera, kedudukan sendi dan, untuk empat daripadanya, arahan bahasa, dipetakan kepada sebahagian sasaran sendi masa depan. Apa yang membezakan mereka adalah berapa banyak yang telah dipelajari sebelum anda tiba.
| Polisi | Parameter | Latensi | Tahap GPU | Tempatan? | Min episod | Format | Kos |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ya | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ya | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | tidak | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | tidak | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | tidak | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Model semasa NVIDIA model tindakan bahasa-penglihatan, kira-kira 3 bilion parameter, lebih kurang 40 juta dilatih semasa penalaan halus. Repositori menyenaraikan delta daripada N1.6: tulang belakang daripada model Eagle yang dibekalkan kepada Cosmos-Reason2-2B pada Qwen3-VL, lapisan resapan 32 kepada 16, dimensi keadaan dan tindakan 29 kepada 132, ufuk tindakan 16 kepada 40.
Apa yang penting pada lengan kecil ialah ruang tindakan hujung-efektor relatif: N1.7 meramalkan delta daripada kedudukan semasa, yang membolehkan 20K jam video manusia EgoScale dipindahkan ke dalam polisi robot. Spesifikasi di halaman N1.7, prosedur dalam panduan N1.7 pada SO-100.
README Isaac-GR00T mengisytiharkan N1.7 sebagai keluaran Ketersediaan Umum, dengan penanda aras dan sokongan lengkap. Kad Hugging Face-nya belum dikemas kini: medan Model Version masih berbunyi GR00T N1.7 EA. Repositori adalah dokumen yang lebih baharu.
GR00T N1.5
Skala 3 B yang sama, tulang belakang Eagle 2, SigLip2 dan T5, kepala DiT padanan aliran. Ia wujud untuk melanjutkan yang anda sudah ada. Dua perkara menjadikannya pilihan lalai yang kurang baik: pemberatnya membawa lesen bukan komersial sehala NVIDIA, dan keluaran LeRobot semasa telah mengalih keluar sokongan N1.5. Lihat .
Pi0.5
VLA Physical Intelligence, jenis polisi pi05. Kertas kerja ini memberikan VLM 2 B yang dimulakan daripada PaliGemma ditambah pakar tindakan 300 M, memacu robot pada 50 Hz; konfigurasi pi05 LeRobot lalai kepada segmen 50 langkah, satu saat pada kadar itu. Kelebihan utamanya adalah tempat yang belum pernah dilihat: kira-kira 400 jam manipulasi mudah alih di rumah sebenar, dan kajian penskalaan merangkumi 3, 12, 22, 53, 82 dan 104 lokasi, di mana model 104 lokasi sepadan dengan kawalan yang dilatih pada rumah ujian itu sendiri.
Satu had, dinyatakan pada lerobot/pi05_base kad: port hanya membawa kepala tindakan yang sepadan dengan aliran. Ramalan subtugas, tokenisasi tindakan dan RL tidak dikeluarkan di hulu, dan openpi menyatakan perkara yang sama untuk repositorinya sendiri. Halaman Pi0.5 dan panduan Pi0.5 pada SO-100 mempunyai selebihnya.
Pi0.5 memerlukan tokenizer google/paligemma-3b-pt-224 yang berpagar (gated: manual, walaupun Google mengatakan permintaan diproses serta-merta). Tanpa menerimanya dan menjalankan hf auth login dalam persekitaran latihan, tugas akan bermula, memuat turun seketika, kemudian terhenti kerana ralat kebenaran yang kelihatan seperti kerosakan rangkaian. nvidia/GR00T-N1.7-3B tidak berpagar, tetapi tulang belakang nvidia/Cosmos-Reason2-2Bnya berpagar (gated: auto). Kosongkan kedua-duanya sebelum beratur; jika larian terbiar, halaman barisan terhenti menyenaraikan perkara yang perlu diperiksa.
SmolVLA
450 Juta parameter, kira-kira 100 Juta dalam pakar tindakan, pada SmolVLM-2 dengan VLM dibekukan dan hanya 16 lapisan model bahasa pertamanya digunakan. Pra-latihan adalah data komuniti: 481 set data, 10.6 Juta bingkai, daripada lengan murah yang sama yang anda gunakan. Satu-satunya VLA di sini yang muat pada satu kad 24 GB, dan satu-satunya 30 episod lantai. Lihat halaman SmolVLA.
ACT
Bukan model asas. Action Chunking Transformer dari ALOHA mempunyai kira-kira 80 M parameter yang dilatih dari awal untuk setiap tugas, berdasarkan 50 demonstrasi pada 50 Hz. Kertas kerja ini melaporkan enam tugas bimanual sebenar dari kira-kira sepuluh minit demonstrasi setiap satu, pada 80 hingga 90 peratus pada contoh yang diserlahkannya. Ideanya, pemecahan tindakan, terdapat dalam setiap model di halaman ini, dan ablasinya masih mengukur kesan terbaik: melalui dua tugas simulasi dengan ensembling temporal dimatikan, kejayaan meningkat dari 1 peratus pada k=1 kepada 44 peratus pada k=100. Halaman ACT mempunyai selebihnya.
Apa yang sebenarnya dikatakan oleh penanda aras
LIBERO adalah satu penanda aras yang dilaporkan oleh tiga daripada lima ini: tugas-tugas berkeadaan bahasa pada simulasi Franka Panda, dibahagikan kepada empat suite di bawah dengan sepuluh tugas setiap satu. NVIDIA menjalankan 200 percubaan bagi setiap suite.
| Model | Spatial | Objek | Matlamat | 10 (Panjang) | Purata |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Setiap nombor berasal daripada harness dan bajet yang berbeza. GR00T berjalan 20K langkah pada kelompok global 640; angka openpi adalah titik semak 30K; port LeRobot menambah 6K langkah kepada model asas LIBERO. SmolVLA adalah ketidakpadanan selanjutnya: kertas kerjanya melatih baris tersebut pada LIBERO dari awal, tanpa pra-latihan VLA, manakala tiga di atasnya melakukan penalaan halus pada titik semak yang telah dilatih. Anggap 96.85 hingga 97.5 sebagai satu kluster, dan jurang kepada 87.3% sebagai nyata tetapi dicapai dengan 6.7x parameter.
SimplerEnv menunjukkan penyebaran, yang LIBERO tidak. NVIDIA membandingkan N1.7 dengan N1.6, perkara awam yang paling hampir dengan delta generasi.
| Suite SimplerEnv | Purata N1.6 | Purata N1.7 | Ayunan Terbaik | Ayunan Terburuk |
|---|---|---|---|---|
| Bridge (WidowX), 7 tugas | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tugas | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | tiada, setiap tugas bertambah baik |
Baris Bridge adalah yang berguna: 5.7 mata diperoleh secara purata sementara put_eggplant_in_basket hilang 36 dan put_eggplant_in_sink jatuh dari 33 kepada 2. Generasi baharu menggerakkan taburan dan bukannya mengangkatnya, jadi jika tugas anda berada di mana N1.7 merosot, purata tidak mengatakan apa-apa.

Daripada lima, hanya kertas kerja SmolVLA melaporkan tentang lengan kelas SO-100: 78.3 peratus untuk SmolVLA dan 61.7 untuk Pi0 merentasi tiga tugas, kedua-duanya berbilang tugas, berbanding 48.3 untuk ACT yang dilatih satu tugas, yang tidak setara. Pasangan yang bersih adalah kedua-duanya satu tugas pada SO-101 pick-and-place: 90 berbanding 70 dalam taburan, 50 berbanding 40 di luar itu. Bandingkan pada ACT berbanding SmolVLA dan Pi0.5 berbanding SmolVLA, atau layari arena.
Latensi dan kos menentukan penempatan
Kependaman inferens adalah kekangan yang orang temui terakhir dan sesali dahulu. Polisi yang lima mata lebih baik pada penanda aras tetapi setengah saat setiap langkah tindakan kelihatan lebih teruk di meja anda: dinamik sentuhan tidak menunggu.
Satu peringatan: angka GR00T tidak bersetuju dengan kad NVIDIA, yang mengukur 4 langkah penyahbisingan dan satu kamera pada 85.8 ms pada H100 dalam mod eager, 48.6 ms dengan torch.compile, 27.9 ms melalui TensorRT penuh. Angka 152 ms di sini adalah angka keseluruhan tumpukan dengan overhed penyediaan dan lebih daripada satu kamera, bukan laluan ke hadapan.
Gelung 20 hingga 485 ms adalah milik model, dan perjalanan pergi balik internet awam menambahnya. Inferens jauh boleh dilaksanakan untuk pilih-dan-letak yang perlahan, bukan untuk gerakan reaktif yang pantas. Jika tugas anda memerlukan kelajuan, inferens berada di sebelah servo: ACT atau SmolVLA, secara tempatan. Berkaitan: polisi membeku di tengah-tengah gerakan.
Satu cara untuk menjimatkan masa tanpa menukar model: kertas SmolVLA mengukur pelaksanaan segerak, di mana polisi menyelesaikan satu bahagian sebelum meramalkan yang seterusnya, berbanding tak segerak, di mana ramalan bertindih dengan pelaksanaan. Kejayaan adalah serupa, 78.3 berbanding 73.3, tetapi pilih-dan-letak yang sama mengambil masa 9.7 saat berbanding 13.75, dan dalam tetingkap tetap robot menguruskan 19 kitaran berbanding 9.
Lesen, diperiksa kerana tiada siapa yang memeriksanya
| Model | Lesen berat | Lesen kod | Penggunaan komersial |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kad membenarkan penggunaan komersial | Apache 2.0 | ya |
| GR00T N1.5 | Lesen bukan komersial sehala NVIDIA | Apache 2.0 | tidak |
| Pi0.5 | metadata kad pi05_base menyatakan lesen: gemma | Apache 2.0 (openpi, LeRobot docs) | baca kedua-duanya, ia tidak bersetuju |
| SmolVLA | tiada medan lesen pada kad smolvla_base | Apache 2.0 (LeRobot) | kod ya, berat tidak dinyatakan |
| ACT | tiada berat asas wujud | Apache 2.0 (LeRobot) | ya |
Baris Pi0.5 memerlukan perhatian. Dokumentasi LeRobot pi05 menyatakan Apache 2.0 konsisten dengan openpi, manakala kad Hub untuk lerobot/pi05_base membawa license: gemma. Kedua-duanya masih aktif. GR00T N1.7 mempunyai versi yang lebih ringan: README Isaac-GR00T menyatakan secara sepintas lalu bahawa N1.7 boleh dilesenkan sepenuhnya secara komersial di bawah Apache 2.0, manakala bahagian lesennya sendiri dan kad model meletakkan hanya kod di bawah Apache 2.0 dan berat di bawah NVIDIA Open Model License.
Lalai yang akan anda jalankan
Setiap borang pelatih disertakan dengan tetapan lalai, dan ia bukan sewenang-wenangnya. ACT adalah milik LeRobot sendiri: batch 8, lr 1e-5, 100000 langkah latihan, chunk size 100, sepadan dengan ACTConfig hulu dan k=100 dari kertas ACT. Satu lajur di bawah adalah perangkap.
| Dasar | Batch | LR | Langkah maksimum | Akumulasi gradien | Berlaku? | Tombol tambahan |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Titik masuk penalaan halus GR00T (launch_finetune.py, CLI tyro) tiada medan seed dalam dataclass konfigurasinya, jadi larian tidak boleh diulang bit-demi-bit. Repositori juga memberi amaran tentang varians 5 hingga 6 peratus antara larian daripada augmentasi imej yang tidak deterministik, lebih besar daripada kebanyakan jurang penanda aras yang dibahaskan secara dalam talian. Seed lalai LeRobot ialah 1000. Lajur grad-accum menerangkan lerobot 0.5.1; hulu 0.6.2 mendedahkannya sebagai --accelerator.gradient_accumulation.steps.
Tombol yang lebih penting daripada pilihan model
Ia adalah 'action chunk'. Ketulan yang lebih panjang memberikan gerakan yang lebih lancar dan kurang ralat terkumpul, tetapi polisi itu komited semasa blok dilaksanakan, jadi ia bertindak balas lewat terhadap apa sahaja yang bergerak: yakin pada kiub statik, tidak berdaya pada kiub yang bergolek. Jika ia terlebih sasaran, memendekkan bahagian yang dilaksanakan adalah lebih baik daripada melatih semula dan percuma. Sendi yang berhenti awal adalah masalah yang berbeza; lihat .
- ACT: ACTConfig lalai kepada
chunk_size 100dann_action_steps 100. Ensembling temporal dimatikan dan memerlukann_action_steps 1. - GR00T N1.7: horizon dalaman meningkat dari 16 kepada 40, namun contoh SO-101 LeRobot masih berjalan dengan
--policy.chunk_size=16 --policy.n_action_steps=16. Bendera 'rollout' telah dinamakan semula kepada--execution-horizon. - Pi0.5: 'chunk' 50 langkah, di mana resipi LIBERO LeRobot melaksanakan 10 melalui
--policy.n_action_steps=10; dengan--policy.pretrained_pathia kembali kepada 50 jika anda meninggalkan bendera tersebut. - SmolVLA: 'chunk' 50 tindakan, kedua-dua tombol terdedah.
Cara menyaring kelima-limanya dalam satu petang
Jawapan termurah bukanlah dengan membaca lebih banyak. Belanjakan sekitar 15 USD dan biarkan lengan robot memberitahu anda: rekod sekali, latih model murah terlebih dahulu, tingkatkan setelah ia membuktikan data itu kukuh. Struktur mengatasi jumlah, intipati dan .
- 1Rakam 50 episod sekali
Lima puluh membersihkan ruang untuk GR00T, Pi0.5 dan ACT, serta 30 SmolVLA. Ulangi setiap variasi daripada menyebarkan nipis: 50 episod merentasi 5 kedudukan kiub yang dilatih di mana 25 tidak. Lihat rekod set data pertama anda.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Latih ACT dahulu, kerana ia tidak boleh menipu anda
Tiada pemberat pra-latihan, jadi jika ia melakukan tugas sama sekali, set data anda mengandungi tugas tersebut. Jika ACT mendatar, betulkan data. 1 hingga 3 USD, 2 hingga 5 jam pada kad 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Jalankan SmolVLA pada set data yang sama, tidak berubah
Data yang sama, lengan yang sama, 450 J parameter berbanding 80 J, ditambah pengkondisian bahasa. LeRobot meletakkan larian 20K langkah pada kira-kira 4 jam pada satu A100. Ini yang memberitahu anda sama ada pra-latihan memberikan apa-apa faedah.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Tukar kepada v2.1 sebelum anda menyentuh GR00T
GR00T membaca versi format LeRobot v2 ditambah
meta/modality.jsontambahan yang memetakan bagaimana tatasusunan keadaan dan tindakan yang digabungkan berpecah kepada medan bernama. Set data v3.0 merosakkan pemuat itu, kerana v3.0 membungkus banyak episod ke dalam fail kongsi di mana v2 menulis satu setiap episod. Isaac-GR00T menghantar pembantu penurunan versi sebagaiscripts/lerobot_conversion/convert_v3_to_v2.py; halaman penolakan v3 adalah laluan pantas.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Tingkatkan kepada GR00T N1.7 hanya jika dua yang pertama meninggalkan sesuatu yang belum selesai
Melalui CLI NVIDIA, seperti yang ditunjukkan di sini, atau jenis polisi
grootLeRobot. NVIDIA mengesyorkan 40 GB atau lebih VRAM untuk penalaan halus, 16 GB untuk inferens. Jika berlaku OOM, lihat halaman OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dua cara untuk menjalankan saringan itu
Tiga persekitaran, kerana rantaian alat tidak wujud bersama. LeRobot pada main adalah 0.6.2 dan memerlukan Python 3.12 atau lebih baru; Isaac-GR00T dan openpi adalah repositori berasingan yang diuruskan oleh uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T menetapkan
torchcodec0.8.0 sebagai satu-satunya backend videonya, memerlukan FFmpeg 4 hingga 7. FFmpeg 8 tidak disokong, AV1 tidak dijamin. - Had memori openpi: inferens melebihi 8 GB, LoRA melebihi 22.5 GB, penalaan halus penuh melebihi 70 GB. Yang terakhir itulah sebabnya Pi0.5 adalah tugas A100.
- Sewa GPU sendiri, musnahkannya selepas itu, selaraskan tiga set laluan titik semak secara manual.
Lima model yang sama, satu bentuk. Pilih model, set data dan hiperparameter; backend menyewa GPU bersaiz mengikut VRAM yang diperlukan, menjalankan pelatih dan menulis ke storan objek.
- Matriks latihan adalah lima model oleh empat lengan, setiap sel adalah panduan: SmolVLA pada SO-100, ACT pada SO-101.
- Pod inferens diperuntukkan secara automatik oleh
/api/inference/poddengan pengawas terbiar, jadi pod yang terlupa tidak akan dibilkan secara senyap. - Titik semak asas adalah milik vendor sendiri:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT tiada. - Operasi yang sama dari CLI dan dari agen AI melalui pelayan MCP.
- Tiada perkakasan? Lengan langsung menstrim SO-100 fizikal tanpa pendaftaran; halaman cuba menunjukkan cara-cara untuk masuk.
Model asas atau dari awal
Persimpangan sebenar bukanlah model 3 B mana yang hendak dipilih. Ia adalah sama ada untuk menggunakan VLA pra-latih sama sekali, memandangkan bahawa ACT mempelajari enam tugas bimanual sebenar daripada kira-kira sepuluh minit demonstrasi setiap satu, dengan 80 M parameter dan tiada apa-apa yang pra-latih.
- Pengkondisian bahasa. ACT tiada; satu checkpoint ACT melakukan satu tugas.
- Lebih baik pada objek yang tiada dalam demonstrasi anda: pada SO-101, 50% berbanding 40% ACT di luar pengedaran.
- Pelbagai tugas sama sekali: SmolVLA mencapai 78.3% merentasi tiga tugas SO-100 dengan satu checkpoint; ACT hanya dijalankan satu tugas.
- Kependaman 7.6x hingga 24x: 152 hingga 485 ms setiap langkah tindakan berbanding 20 ms ACT.
- 4 hingga 12 USD setiap larian berbanding 1 hingga 3, dan peringkat A100 berbanding mana-mana kad 24 GB.
- Pendedahan lesen, ditambah mod kegagalan repo berpagar yang tidak wujud dari awal.
- Bobot pra-latih boleh menyembunyikan set data yang buruk. Penalaan halus yang separuh berfungsi pada data rosak memerlukan seminggu sebelum anda melihat data tersebut.
Kes menghasilkan semula larian lama
Mengejar checkpoint 2025 membuat pilihan model untuk anda dan mengubah masalah menjadi penetapan versi: LeRobot semasa menolak N1.5, jadi anda tetapkan lerobot==0.5.1. Dengan tiada medan seed dan varians 5 hingga 6 peratus antara larian, penghasilan semula adalah anggaran mengikut pembinaan. dan mempunyai sisi platform.

Tinggal dua? ACT berbanding GR00T N1.7 dan GR00T N1.7 berbanding SmolVLA. Baris mentah terdapat dalam entri arena: GR00T N1.7, Pi0.5, SmolVLA dan ACT.
Di mana platform ini tidak membantu anda
- Ia tidak dapat mempercepatkan inferens jarak jauh. Gelung 20 hingga 485 ms adalah milik model; perjalanan pergi balik internet menambah kepadanya.
- Ia tidak dapat menala halus GR00T atau Pi0.5 pada perkakasan anda sendiri. Kedua-duanya hanya berasaskan awan di sini; hanya SmolVLA dan ACT berjalan secara tempatan.
- Ia tidak dapat membetulkan set data. Kerugian menurun tetapi polisi tidak melakukan apa-apa adalah masalah data, polisi yang hanya berfungsi dalam satu persediaan adalah masalah liputan.
- Ia tidak dapat menjadikan larian GR00T boleh dihasilkan semula: konfigurasi huluan tidak mempunyai medan benih.
85 model, 332 keputusan penanda aras, setiap nombor dipautkan ke sumbernya
Versi boleh isih bagi jadual di halaman ini: 85 model visi-bahasa-tindakan, 332 keputusan penanda aras, setiap satu dipautkan kembali ke kertas kerja atau kad modelnya.
Buka arenaMemilih satu dan meneruskan
Satu lalai: rekod 50 episod, latih ACT untuk 1 hingga 3 USD untuk membuktikan set data, kemudian SmolVLA pada data yang sama. Bersama-sama di bawah 6 USD, dan ia menjawab soalan penting: sama ada pra-latihan membantu di sini, atau sama ada kesesakan adalah data. Tingkatkan kepada GR00T N1.7 untuk tugas berbilang langkah yang kaya dengan sentuhan, kepada Pi0.5 apabila pemandangan berubah.
Panduan platform: latih polisi pertama anda, kemudian jalankan polisi pertama anda. Dokumen latihan dan set data meliputi bentuk dan format; halaman SO-100 dan panduan lengkap SO-100 meliputi pembinaan dan penentukuran. Latar belakang: gambaran keseluruhan VLA dan artikel padanan aliran Pi0. Yang akan meningkatkan kadar kejayaan anda ialah panduan kualiti data.
Dasar VLA manakah yang patut saya latih dahulu pada SO-100?▾
ACT, kemudian SmolVLA. ACT melatih dari awal, jadi ia tidak boleh menyembunyikan set data yang buruk, dan satu larian berharga 1 hingga 3 USD pada kad 24 GB. Jika ACT berjaya melakukan tugas itu, 4 hingga 12 USD untuk larian GR00T N1.7 atau Pi0.5 tidak akan sia-sia.
Adakah GR00T N1.7 sebenarnya lebih baik daripada Pi0.5?▾
Pada LIBERO, ia berada dalam julat hingar: 97.0% merentasi empat suite untuk GR00T N1.7, 96.85% untuk Pi0.5 pada 30k langkah dalam openpi, 97.5% untuk port LeRobot, semuanya dari harness yang berbeza. Perbezaan sebenar adalah 152 ms setiap langkah tindakan berbanding 485 ms, set data v2.1 berbanding v3.0, dan ketepatan penanda aras berbanding generalisasi dunia terbuka.
Bolehkah saya melakukan penalaan halus mana-mana daripada ini pada satu RTX 4090?▾
SmolVLA dan ACT, ya; kedua-duanya disenaraikan untuk RTX 4090 atau mana-mana kad 24 GB dan berjalan secara tempatan. GR00T N1.7, N1.5 dan Pi0.5 memerlukan A100 atau H100 80 GB dan hanya tersedia di awan di sini. NVIDIA mengesyorkan 40 GB atau lebih untuk penalaan halus GR00T; had minimum openpi adalah melebihi 70 GB untuk penalaan halus Pi0.5 penuh, 22.5 GB untuk LoRA.
Yang manakah antara lima ini boleh saya gunakan secara komersial?▾
Berat GR00T N1.7 adalah di bawah Perjanjian Lesen Model Terbuka NVIDIA, yang menurut kad tersebut meliputi penggunaan komersial. Berat N1.5 adalah bukan komersial. Kod SmolVLA adalah Apache 2.0 dalam LeRobot, tetapi kad lerobot/smolvla_base tidak mempunyai medan lesen, jadi beratnya tidak dinyatakan. ACT tidak mempunyai berat asas untuk dilesenkan. Pi0.5 adalah samar-samar: dokumen LeRobot menyatakan Apache 2.0, metadata kadnya terbaca license: gemma.
Sources
- Repositori NVIDIA Isaac-GR00T: status GA, perubahan N1.6 ke N1.7, keperluan perkakasan, kekangan torchcodec dan FFmpeg, launch_finetune.py, varians larian ke larian
- Kad model nvidia/GR00T-N1.7-3B: tulang belakang Cosmos-Reason2-2B, 3 B parameter, jadual masa inferens, Lesen Model Terbuka NVIDIA, medan Versi Model
- Kad model nvidia/GR00T-N1.5-3B: rujukan Eagle 2, SigLip2 dan T5, DiT padanan aliran, lesen bukan komersial sehala
- Contoh Isaac-GR00T LIBERO: kadar kejayaan setiap suite pada 20K langkah dan saiz kelompok 640, 200 percubaan setiap suite
- Contoh Isaac-GR00T SimplerEnv: kadar kejayaan Bridge dan Fractal setiap tugas, GR00T N1.6 berbanding N1.7
- pi0.5: Model Visi-Bahasa-Tindakan dengan Generalisasi Dunia Terbuka (2 B VLM ditambah 300 M pakar tindakan, kawalan 50 Hz, kira-kira 400 jam manipulasi mudah alih, kajian penskalaan merentasi 3 hingga 104 lokasi)
- Repositori openpi: had minimum memori GPU, skop hanya kepala padanan aliran, dan hasil Pi0.5 LIBERO dalam examples/libero
- Kad model lerobot/pi05_base: skop port LeRobot, metadata license: gemma, penggunaan lerobot-train
- Dokumentasi LeRobot pi0.5: tokenizer PaliGemma berpagar, jadual reproduksi LIBERO, perangkap fallback n_action_steps, pernyataan Apache 2.0
- SmolVLA: Model Visi-Bahasa-Tindakan untuk Robotik Mampu Milik dan Cekap (450 M parameter, jadual LIBERO dan Meta-World, hasil SO-100 dan SO-101, inferens tak segerak)
- Dokumentasi LeRobot SmolVLA: 50 episod merentasi 5 posisi berbanding 25, 20k langkah dalam kira-kira 4 jam pada A100
- Pembelajaran Manipulasi Bimanual Terperinci dengan Perkakasan Kos Rendah (ACT dan ALOHA): 6 tugas pada 80-90 peratus, ablasi saiz chunk dari k=1 hingga k=100
- LeRobot 0.6.2: lalai ACTConfig dan SmolVLAConfig, seed lalai 1000, --accelerator.gradient_accumulation.steps, keperluan Python 3.12, Apache 2.0
- Dokumentasi LeRobot GR00T: jenis dasar groot, sokongan N1.5 dialih keluar, pin lerobot==0.5.1, contoh saiz chunk SO-101
- Kad model lerobot/smolvla_base: titik semak asas SmolVLA yang digunakan oleh --policy.path, dan metadata kadnya, yang tidak mempunyai medan lesen
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started