Jadual perbandingan dasar AY-Robots menunjukkan GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT bersebelahan dengan kiraan parameter, tahap GPU, kependaman inferens dan kiraan episod minimum
vla-modelspolicy-trainingmodel-selectionlerobotso-100

Dasar VLA Mana Yang Patut Anda Latih pada 2026?

AY-Robots ResearchAugust 23, 202618 minit bacaan

GR00T N1.7, Pi0.5, SmolVLA, ACT atau GR00T N1.5? Jadual keputusan yang dipadankan dengan situasi sebenar, dengan nombor penanda aras yang diterbitkan, kependaman, kos setiap larian dan lesen di sebalik setiap pilihan.

Lima polisi boleh dilatih pada lengan kelas SO-100 hari ini. Ia berbeza dengan faktor 24 dalam inferens latensi, 37 dalam kiraan parameter dan 12 dalam kos satu larian, dan sama ada anda boleh menghantar hasilnya. Lima kad model tidak akan menyelesaikannya: tiada satu pun yang menjawab soalan anda, yang mana satu patut saya jalankan dahulu?

Setiap nombor di bawah dibaca daripada kertas kerja, repositori dan kad pada Ogos 2026. Nombor platform datang daripada katalog polisi AY-Robots; di mana kedua-duanya tidak bersetuju, kedua-duanya ditunjukkan.

Versi ringkas

  • Latih ACT dahulu jika anda meragui set data anda: 1 hingga 3 USD setiap larian, tiada pra-latihan untuk menutupi data buruk.
  • GR00T N1.7 dan Pi0.5 berada dalam lingkungan setengah mata pada LIBERO, 97.0 berbanding 96.85 hingga 97.5. Itu bukan sebab untuk memilih mana-mana satu.
  • Pi0.5 adalah untuk generalisasi, bukan untuk ketepatan, dan yang paling perlahan pada 485 ms.
  • SmolVLA, pada 450 M parameter, adalah satu-satunya VLA di sini yang melakukan penalaan halus pada satu kad 24 GB.
  • ACT pada 20 ms adalah satu-satunya pilihan untuk gerakan reaktif pantas. Lesen menentukan selebihnya.

Jadual keputusan

Situasi andaLatih iniMengapa
Kualiti set data tidak terbuktiACTTiada pra-latihan yang dapat menyembunyikan set data yang rosak, dan kegagalan menelan kos 1 hingga 3 USD.
Kaya sentuhan, berbilang langkah, berkeadaan bahasaGR00T N1.797.0% merentasi empat suite LIBERO, ditambah ruang tindakan hujung efektor relatif.
Gerakan reaktif pantas, inferens pada servoACT20 ms. Yang terpantas seterusnya adalah 7.6 kali lebih perlahan.
Objek baharu, pemandangan baharu, dunia terbukaPi0.5Dibina untuk tingkah laku luar taburan, merentasi sehingga 104 lokasi.
Satu kad 24 GB, masih mahukan bahasaSmolVLA450 M parameter, lantai 30 episod, berjalan secara tempatan.
Menghasilkan semula larian yang direkodkan pada tahun 2025GR00T N1.5Hanya jika perlu: LeRobot kini menolaknya, pemberat bukan komersial.
Ini akan dihantar sebagai produkN1.7, SmolVLA or ACTN1.5 adalah bukan komersial, Pi0.5 membawa terma Gemma, kad SmolVLA menyatakan tiada.

Lima calon

Kesemua lima adalah polisi: bingkai kamera, kedudukan sendi dan, untuk empat daripadanya, arahan bahasa, dipetakan kepada sebahagian sasaran sendi masa depan. Apa yang membezakan mereka adalah berapa banyak yang telah dipelajari sebelum anda tiba.

PolisiParameterLatensiTahap GPUTempatan?Min episodFormatKos
ACT~80 M20 ms24 GB cardya50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardya30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBtidak50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBtidak50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBtidak50v3.04 to 12 USD

GR00T N1.7

Model semasa NVIDIA model tindakan bahasa-penglihatan, kira-kira 3 bilion parameter, lebih kurang 40 juta dilatih semasa penalaan halus. Repositori menyenaraikan delta daripada N1.6: tulang belakang daripada model Eagle yang dibekalkan kepada Cosmos-Reason2-2B pada Qwen3-VL, lapisan resapan 32 kepada 16, dimensi keadaan dan tindakan 29 kepada 132, ufuk tindakan 16 kepada 40.

Apa yang penting pada lengan kecil ialah ruang tindakan hujung-efektor relatif: N1.7 meramalkan delta daripada kedudukan semasa, yang membolehkan 20K jam video manusia EgoScale dipindahkan ke dalam polisi robot. Spesifikasi di halaman N1.7, prosedur dalam panduan N1.7 pada SO-100.

GA dalam repositori, EA pada kad model

README Isaac-GR00T mengisytiharkan N1.7 sebagai keluaran Ketersediaan Umum, dengan penanda aras dan sokongan lengkap. Kad Hugging Face-nya belum dikemas kini: medan Model Version masih berbunyi GR00T N1.7 EA. Repositori adalah dokumen yang lebih baharu.

GR00T N1.5

Skala 3 B yang sama, tulang belakang Eagle 2, SigLip2 dan T5, kepala DiT padanan aliran. Ia wujud untuk melanjutkan yang anda sudah ada. Dua perkara menjadikannya pilihan lalai yang kurang baik: pemberatnya membawa lesen bukan komersial sehala NVIDIA, dan keluaran LeRobot semasa telah mengalih keluar sokongan N1.5. Lihat .

Pi0.5

VLA Physical Intelligence, jenis polisi pi05. Kertas kerja ini memberikan VLM 2 B yang dimulakan daripada PaliGemma ditambah pakar tindakan 300 M, memacu robot pada 50 Hz; konfigurasi pi05 LeRobot lalai kepada segmen 50 langkah, satu saat pada kadar itu. Kelebihan utamanya adalah tempat yang belum pernah dilihat: kira-kira 400 jam manipulasi mudah alih di rumah sebenar, dan kajian penskalaan merangkumi 3, 12, 22, 53, 82 dan 104 lokasi, di mana model 104 lokasi sepadan dengan kawalan yang dilatih pada rumah ujian itu sendiri.

Satu had, dinyatakan pada lerobot/pi05_base kad: port hanya membawa kepala tindakan yang sepadan dengan aliran. Ramalan subtugas, tokenisasi tindakan dan RL tidak dikeluarkan di hulu, dan openpi menyatakan perkara yang sama untuk repositorinya sendiri. Halaman Pi0.5 dan panduan Pi0.5 pada SO-100 mempunyai selebihnya.

Perangkap yang memakan masa petang: repositori berpagar

Pi0.5 memerlukan tokenizer google/paligemma-3b-pt-224 yang berpagar (gated: manual, walaupun Google mengatakan permintaan diproses serta-merta). Tanpa menerimanya dan menjalankan hf auth login dalam persekitaran latihan, tugas akan bermula, memuat turun seketika, kemudian terhenti kerana ralat kebenaran yang kelihatan seperti kerosakan rangkaian. nvidia/GR00T-N1.7-3B tidak berpagar, tetapi tulang belakang nvidia/Cosmos-Reason2-2Bnya berpagar (gated: auto). Kosongkan kedua-duanya sebelum beratur; jika larian terbiar, halaman barisan terhenti menyenaraikan perkara yang perlu diperiksa.

SmolVLA

450 Juta parameter, kira-kira 100 Juta dalam pakar tindakan, pada SmolVLM-2 dengan VLM dibekukan dan hanya 16 lapisan model bahasa pertamanya digunakan. Pra-latihan adalah data komuniti: 481 set data, 10.6 Juta bingkai, daripada lengan murah yang sama yang anda gunakan. Satu-satunya VLA di sini yang muat pada satu kad 24 GB, dan satu-satunya 30 episod lantai. Lihat halaman SmolVLA.

ACT

Bukan model asas. Action Chunking Transformer dari ALOHA mempunyai kira-kira 80 M parameter yang dilatih dari awal untuk setiap tugas, berdasarkan 50 demonstrasi pada 50 Hz. Kertas kerja ini melaporkan enam tugas bimanual sebenar dari kira-kira sepuluh minit demonstrasi setiap satu, pada 80 hingga 90 peratus pada contoh yang diserlahkannya. Ideanya, pemecahan tindakan, terdapat dalam setiap model di halaman ini, dan ablasinya masih mengukur kesan terbaik: melalui dua tugas simulasi dengan ensembling temporal dimatikan, kejayaan meningkat dari 1 peratus pada k=1 kepada 44 peratus pada k=100. Halaman ACT mempunyai selebihnya.

Apa yang sebenarnya dikatakan oleh penanda aras

LIBERO adalah satu penanda aras yang dilaporkan oleh tiga daripada lima ini: tugas-tugas berkeadaan bahasa pada simulasi Franka Panda, dibahagikan kepada empat suite di bawah dengan sepuluh tugas setiap satu. NVIDIA menjalankan 200 percubaan bagi setiap suite.

ModelSpatialObjekMatlamat10 (Panjang)Purata
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Baris-baris ini tidak boleh dibandingkan secara ketat

Setiap nombor berasal daripada harness dan bajet yang berbeza. GR00T berjalan 20K langkah pada kelompok global 640; angka openpi adalah titik semak 30K; port LeRobot menambah 6K langkah kepada model asas LIBERO. SmolVLA adalah ketidakpadanan selanjutnya: kertas kerjanya melatih baris tersebut pada LIBERO dari awal, tanpa pra-latihan VLA, manakala tiga di atasnya melakukan penalaan halus pada titik semak yang telah dilatih. Anggap 96.85 hingga 97.5 sebagai satu kluster, dan jurang kepada 87.3% sebagai nyata tetapi dicapai dengan 6.7x parameter.

SimplerEnv menunjukkan penyebaran, yang LIBERO tidak. NVIDIA membandingkan N1.7 dengan N1.6, perkara awam yang paling hampir dengan delta generasi.

Suite SimplerEnvPurata N1.6Purata N1.7Ayunan TerbaikAyunan Terburuk
Bridge (WidowX), 7 tugas56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tugas52.0%72.5%open_drawer 0.0 to 65.0tiada, setiap tugas bertambah baik

Baris Bridge adalah yang berguna: 5.7 mata diperoleh secara purata sementara put_eggplant_in_basket hilang 36 dan put_eggplant_in_sink jatuh dari 33 kepada 2. Generasi baharu menggerakkan taburan dan bukannya mengangkatnya, jadi jika tugas anda berada di mana N1.7 merosot, purata tidak mengatakan apa-apa.

Papan pendahulu arena AY-Robots, jadual yang boleh diisih bagi 85 model visi-bahasa-tindakan dengan 332 hasil penanda aras, setiap nilai dipautkan ke kertas kerja atau kad model asalnya
Arena ini menempatkan 85 model VLA dan 332 hasil penanda aras, setiap satu dipautkan kembali ke kertas kerja atau kad modelnya. Berguna untuk menyemak sama ada nombor yang dipetik dalam catatan blog adalah benar.

Daripada lima, hanya kertas kerja SmolVLA melaporkan tentang lengan kelas SO-100: 78.3 peratus untuk SmolVLA dan 61.7 untuk Pi0 merentasi tiga tugas, kedua-duanya berbilang tugas, berbanding 48.3 untuk ACT yang dilatih satu tugas, yang tidak setara. Pasangan yang bersih adalah kedua-duanya satu tugas pada SO-101 pick-and-place: 90 berbanding 70 dalam taburan, 50 berbanding 40 di luar itu. Bandingkan pada ACT berbanding SmolVLA dan Pi0.5 berbanding SmolVLA, atau layari arena.

Latensi dan kos menentukan penempatan

Kependaman inferens adalah kekangan yang orang temui terakhir dan sesali dahulu. Polisi yang lima mata lebih baik pada penanda aras tetapi setengah saat setiap langkah tindakan kelihatan lebih teruk di meja anda: dinamik sentuhan tidak menunggu.

Satu peringatan: angka GR00T tidak bersetuju dengan kad NVIDIA, yang mengukur 4 langkah penyahbisingan dan satu kamera pada 85.8 ms pada H100 dalam mod eager, 48.6 ms dengan torch.compile, 27.9 ms melalui TensorRT penuh. Angka 152 ms di sini adalah angka keseluruhan tumpukan dengan overhed penyediaan dan lebih daripada satu kamera, bukan laluan ke hadapan.

Inferens jauh mempunyai had yang ketat

Gelung 20 hingga 485 ms adalah milik model, dan perjalanan pergi balik internet awam menambahnya. Inferens jauh boleh dilaksanakan untuk pilih-dan-letak yang perlahan, bukan untuk gerakan reaktif yang pantas. Jika tugas anda memerlukan kelajuan, inferens berada di sebelah servo: ACT atau SmolVLA, secara tempatan. Berkaitan: polisi membeku di tengah-tengah gerakan.

Satu cara untuk menjimatkan masa tanpa menukar model: kertas SmolVLA mengukur pelaksanaan segerak, di mana polisi menyelesaikan satu bahagian sebelum meramalkan yang seterusnya, berbanding tak segerak, di mana ramalan bertindih dengan pelaksanaan. Kejayaan adalah serupa, 78.3 berbanding 73.3, tetapi pilih-dan-letak yang sama mengambil masa 9.7 saat berbanding 13.75, dan dalam tetingkap tetap robot menguruskan 19 kitaran berbanding 9.

Lesen, diperiksa kerana tiada siapa yang memeriksanya

ModelLesen beratLesen kodPenggunaan komersial
GR00T N1.7NVIDIA Open Model License; kad membenarkan penggunaan komersialApache 2.0ya
GR00T N1.5Lesen bukan komersial sehala NVIDIAApache 2.0tidak
Pi0.5metadata kad pi05_base menyatakan lesen: gemmaApache 2.0 (openpi, LeRobot docs)baca kedua-duanya, ia tidak bersetuju
SmolVLAtiada medan lesen pada kad smolvla_baseApache 2.0 (LeRobot)kod ya, berat tidak dinyatakan
ACTtiada berat asas wujudApache 2.0 (LeRobot)ya

Baris Pi0.5 memerlukan perhatian. Dokumentasi LeRobot pi05 menyatakan Apache 2.0 konsisten dengan openpi, manakala kad Hub untuk lerobot/pi05_base membawa license: gemma. Kedua-duanya masih aktif. GR00T N1.7 mempunyai versi yang lebih ringan: README Isaac-GR00T menyatakan secara sepintas lalu bahawa N1.7 boleh dilesenkan sepenuhnya secara komersial di bawah Apache 2.0, manakala bahagian lesennya sendiri dan kad model meletakkan hanya kod di bawah Apache 2.0 dan berat di bawah NVIDIA Open Model License.

Lalai yang akan anda jalankan

Setiap borang pelatih disertakan dengan tetapan lalai, dan ia bukan sewenang-wenangnya. ACT adalah milik LeRobot sendiri: batch 8, lr 1e-5, 100000 langkah latihan, chunk size 100, sepadan dengan ACTConfig hulu dan k=100 dari kertas ACT. Satu lajur di bawah adalah perangkap.

DasarBatchLRLangkah maksimumAkumulasi gradienBerlaku?Tombol tambahan
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Kebolehulangan, bertarikh Ogos 2026

Titik masuk penalaan halus GR00T (launch_finetune.py, CLI tyro) tiada medan seed dalam dataclass konfigurasinya, jadi larian tidak boleh diulang bit-demi-bit. Repositori juga memberi amaran tentang varians 5 hingga 6 peratus antara larian daripada augmentasi imej yang tidak deterministik, lebih besar daripada kebanyakan jurang penanda aras yang dibahaskan secara dalam talian. Seed lalai LeRobot ialah 1000. Lajur grad-accum menerangkan lerobot 0.5.1; hulu 0.6.2 mendedahkannya sebagai --accelerator.gradient_accumulation.steps.

Tombol yang lebih penting daripada pilihan model

Ia adalah 'action chunk'. Ketulan yang lebih panjang memberikan gerakan yang lebih lancar dan kurang ralat terkumpul, tetapi polisi itu komited semasa blok dilaksanakan, jadi ia bertindak balas lewat terhadap apa sahaja yang bergerak: yakin pada kiub statik, tidak berdaya pada kiub yang bergolek. Jika ia terlebih sasaran, memendekkan bahagian yang dilaksanakan adalah lebih baik daripada melatih semula dan percuma. Sendi yang berhenti awal adalah masalah yang berbeza; lihat .

  • ACT: ACTConfig lalai kepada chunk_size 100 dan n_action_steps 100. Ensembling temporal dimatikan dan memerlukan n_action_steps 1.
  • GR00T N1.7: horizon dalaman meningkat dari 16 kepada 40, namun contoh SO-101 LeRobot masih berjalan dengan --policy.chunk_size=16 --policy.n_action_steps=16. Bendera 'rollout' telah dinamakan semula kepada --execution-horizon.
  • Pi0.5: 'chunk' 50 langkah, di mana resipi LIBERO LeRobot melaksanakan 10 melalui --policy.n_action_steps=10; dengan --policy.pretrained_path ia kembali kepada 50 jika anda meninggalkan bendera tersebut.
  • SmolVLA: 'chunk' 50 tindakan, kedua-dua tombol terdedah.

Cara menyaring kelima-limanya dalam satu petang

Jawapan termurah bukanlah dengan membaca lebih banyak. Belanjakan sekitar 15 USD dan biarkan lengan robot memberitahu anda: rekod sekali, latih model murah terlebih dahulu, tingkatkan setelah ia membuktikan data itu kukuh. Struktur mengatasi jumlah, intipati dan .

  1. 1
    Rakam 50 episod sekali

    Lima puluh membersihkan ruang untuk GR00T, Pi0.5 dan ACT, serta 30 SmolVLA. Ulangi setiap variasi daripada menyebarkan nipis: 50 episod merentasi 5 kedudukan kiub yang dilatih di mana 25 tidak. Lihat rekod set data pertama anda.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Latih ACT dahulu, kerana ia tidak boleh menipu anda

    Tiada pemberat pra-latihan, jadi jika ia melakukan tugas sama sekali, set data anda mengandungi tugas tersebut. Jika ACT mendatar, betulkan data. 1 hingga 3 USD, 2 hingga 5 jam pada kad 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Jalankan SmolVLA pada set data yang sama, tidak berubah

    Data yang sama, lengan yang sama, 450 J parameter berbanding 80 J, ditambah pengkondisian bahasa. LeRobot meletakkan larian 20K langkah pada kira-kira 4 jam pada satu A100. Ini yang memberitahu anda sama ada pra-latihan memberikan apa-apa faedah.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Tukar kepada v2.1 sebelum anda menyentuh GR00T

    GR00T membaca versi format LeRobot v2 ditambah meta/modality.json tambahan yang memetakan bagaimana tatasusunan keadaan dan tindakan yang digabungkan berpecah kepada medan bernama. Set data v3.0 merosakkan pemuat itu, kerana v3.0 membungkus banyak episod ke dalam fail kongsi di mana v2 menulis satu setiap episod. Isaac-GR00T menghantar pembantu penurunan versi sebagai scripts/lerobot_conversion/convert_v3_to_v2.py; halaman penolakan v3 adalah laluan pantas.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Tingkatkan kepada GR00T N1.7 hanya jika dua yang pertama meninggalkan sesuatu yang belum selesai

    Melalui CLI NVIDIA, seperti yang ditunjukkan di sini, atau jenis polisi groot LeRobot. NVIDIA mengesyorkan 40 GB atau lebih VRAM untuk penalaan halus, 16 GB untuk inferens. Jika berlaku OOM, lihat halaman OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dua cara untuk menjalankan saringan itu

Tiga persekitaran, kerana rantaian alat tidak wujud bersama. LeRobot pada main adalah 0.6.2 dan memerlukan Python 3.12 atau lebih baru; Isaac-GR00T dan openpi adalah repositori berasingan yang diuruskan oleh uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T menetapkan torchcodec 0.8.0 sebagai satu-satunya backend videonya, memerlukan FFmpeg 4 hingga 7. FFmpeg 8 tidak disokong, AV1 tidak dijamin.
  • Had memori openpi: inferens melebihi 8 GB, LoRA melebihi 22.5 GB, penalaan halus penuh melebihi 70 GB. Yang terakhir itulah sebabnya Pi0.5 adalah tugas A100.
  • Sewa GPU sendiri, musnahkannya selepas itu, selaraskan tiga set laluan titik semak secara manual.

Model asas atau dari awal

Persimpangan sebenar bukanlah model 3 B mana yang hendak dipilih. Ia adalah sama ada untuk menggunakan VLA pra-latih sama sekali, memandangkan bahawa ACT mempelajari enam tugas bimanual sebenar daripada kira-kira sepuluh minit demonstrasi setiap satu, dengan 80 M parameter dan tiada apa-apa yang pra-latih.

Penalaan halus VLA pra-latih berbanding melatih ACT dari awal
Apa yang anda peroleh
  • Pengkondisian bahasa. ACT tiada; satu checkpoint ACT melakukan satu tugas.
  • Lebih baik pada objek yang tiada dalam demonstrasi anda: pada SO-101, 50% berbanding 40% ACT di luar pengedaran.
  • Pelbagai tugas sama sekali: SmolVLA mencapai 78.3% merentasi tiga tugas SO-100 dengan satu checkpoint; ACT hanya dijalankan satu tugas.
Apa yang anda rugi
  • Kependaman 7.6x hingga 24x: 152 hingga 485 ms setiap langkah tindakan berbanding 20 ms ACT.
  • 4 hingga 12 USD setiap larian berbanding 1 hingga 3, dan peringkat A100 berbanding mana-mana kad 24 GB.
  • Pendedahan lesen, ditambah mod kegagalan repo berpagar yang tidak wujud dari awal.
  • Bobot pra-latih boleh menyembunyikan set data yang buruk. Penalaan halus yang separuh berfungsi pada data rosak memerlukan seminggu sebelum anda melihat data tersebut.

Kes menghasilkan semula larian lama

Mengejar checkpoint 2025 membuat pilihan model untuk anda dan mengubah masalah menjadi penetapan versi: LeRobot semasa menolak N1.5, jadi anda tetapkan lerobot==0.5.1. Dengan tiada medan seed dan varians 5 hingga 6 peratus antara larian, penghasilan semula adalah anggaran mengikut pembinaan. dan mempunyai sisi platform.

Halaman perbandingan langsung AY-Robots untuk GR00T N1.7 berbanding Pi0.5, menunjukkan kiraan parameter, keperluan GPU, kependaman inferens, format set data dan kiraan episod minimum secara bersebelahan.
Perbandingan langsung di /compare/groot-n1-7-vs-pi0-5. Kedua-dua model 3 B kelihatan boleh ditukar ganti pada lembaran spesifikasi tetapi sebenarnya tidak: satu memerlukan LeRobot v2.1, satu lagi memerlukan v3.0.

Tinggal dua? ACT berbanding GR00T N1.7 dan GR00T N1.7 berbanding SmolVLA. Baris mentah terdapat dalam entri arena: GR00T N1.7, Pi0.5, SmolVLA dan ACT.

Di mana platform ini tidak membantu anda

  • Ia tidak dapat mempercepatkan inferens jarak jauh. Gelung 20 hingga 485 ms adalah milik model; perjalanan pergi balik internet menambah kepadanya.
  • Ia tidak dapat menala halus GR00T atau Pi0.5 pada perkakasan anda sendiri. Kedua-duanya hanya berasaskan awan di sini; hanya SmolVLA dan ACT berjalan secara tempatan.
  • Ia tidak dapat membetulkan set data. Kerugian menurun tetapi polisi tidak melakukan apa-apa adalah masalah data, polisi yang hanya berfungsi dalam satu persediaan adalah masalah liputan.
  • Ia tidak dapat menjadikan larian GR00T boleh dihasilkan semula: konfigurasi huluan tidak mempunyai medan benih.

85 model, 332 keputusan penanda aras, setiap nombor dipautkan ke sumbernya

Versi boleh isih bagi jadual di halaman ini: 85 model visi-bahasa-tindakan, 332 keputusan penanda aras, setiap satu dipautkan kembali ke kertas kerja atau kad modelnya.

Buka arena

Memilih satu dan meneruskan

Satu lalai: rekod 50 episod, latih ACT untuk 1 hingga 3 USD untuk membuktikan set data, kemudian SmolVLA pada data yang sama. Bersama-sama di bawah 6 USD, dan ia menjawab soalan penting: sama ada pra-latihan membantu di sini, atau sama ada kesesakan adalah data. Tingkatkan kepada GR00T N1.7 untuk tugas berbilang langkah yang kaya dengan sentuhan, kepada Pi0.5 apabila pemandangan berubah.

Panduan platform: latih polisi pertama anda, kemudian jalankan polisi pertama anda. Dokumen latihan dan set data meliputi bentuk dan format; halaman SO-100 dan panduan lengkap SO-100 meliputi pembinaan dan penentukuran. Latar belakang: gambaran keseluruhan VLA dan artikel padanan aliran Pi0. Yang akan meningkatkan kadar kejayaan anda ialah panduan kualiti data.

Dasar VLA manakah yang patut saya latih dahulu pada SO-100?

ACT, kemudian SmolVLA. ACT melatih dari awal, jadi ia tidak boleh menyembunyikan set data yang buruk, dan satu larian berharga 1 hingga 3 USD pada kad 24 GB. Jika ACT berjaya melakukan tugas itu, 4 hingga 12 USD untuk larian GR00T N1.7 atau Pi0.5 tidak akan sia-sia.

Adakah GR00T N1.7 sebenarnya lebih baik daripada Pi0.5?

Pada LIBERO, ia berada dalam julat hingar: 97.0% merentasi empat suite untuk GR00T N1.7, 96.85% untuk Pi0.5 pada 30k langkah dalam openpi, 97.5% untuk port LeRobot, semuanya dari harness yang berbeza. Perbezaan sebenar adalah 152 ms setiap langkah tindakan berbanding 485 ms, set data v2.1 berbanding v3.0, dan ketepatan penanda aras berbanding generalisasi dunia terbuka.

Bolehkah saya melakukan penalaan halus mana-mana daripada ini pada satu RTX 4090?

SmolVLA dan ACT, ya; kedua-duanya disenaraikan untuk RTX 4090 atau mana-mana kad 24 GB dan berjalan secara tempatan. GR00T N1.7, N1.5 dan Pi0.5 memerlukan A100 atau H100 80 GB dan hanya tersedia di awan di sini. NVIDIA mengesyorkan 40 GB atau lebih untuk penalaan halus GR00T; had minimum openpi adalah melebihi 70 GB untuk penalaan halus Pi0.5 penuh, 22.5 GB untuk LoRA.

Yang manakah antara lima ini boleh saya gunakan secara komersial?

Berat GR00T N1.7 adalah di bawah Perjanjian Lesen Model Terbuka NVIDIA, yang menurut kad tersebut meliputi penggunaan komersial. Berat N1.5 adalah bukan komersial. Kod SmolVLA adalah Apache 2.0 dalam LeRobot, tetapi kad lerobot/smolvla_base tidak mempunyai medan lesen, jadi beratnya tidak dinyatakan. ACT tidak mempunyai berat asas untuk dilesenkan. Pi0.5 adalah samar-samar: dokumen LeRobot menyatakan Apache 2.0, metadata kadnya terbaca license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started