AY-Robots politikaları karşılaştırma tablosu, GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ve ACT'yi parametre sayıları, GPU katmanı, çıkarım gecikmesi ve minimum bölüm sayıları ile yan yana gösteriyor
vla-modelleripolitika-eğitimimodel-seçimilerobotso-100

2026'da Hangi VLA Politikasını Eğitmelisiniz?

AY-Robots ResearchAugust 23, 202618 dk okuma

GR00T N1.7, Pi0.5, SmolVLA, ACT veya GR00T N1.5? Gerçek durumlara uygun bir karar tablosu, yayınlanmış kıyaslama sayıları, gecikme süresi, her çalıştırma başına maliyet ve her seçimin arkasındaki lisanslarla birlikte.

Bugün bir SO-100 sınıfı kol üzerinde beş politika eğitilebilir. Çıkarım gecikmesinde 24, parametre sayısında 37 ve bir çalıştırmanın maliyetinde 12 kat farklılık gösterirler ve sonucu gönderip gönderemeyeceğinize göre değişirler. Beş model kartı bunu çözmeyecektir: hiçbiri sizin sorunuzu, yani hangisini önce çalıştırmalıyım sorusunu yanıtlamaz.

Aşağıdaki her sayı Ağustos 2026'da makalelerden, depolardan ve kartlardan okunmuştur. Platform numaraları şuradan alınmıştır: AY-Robots politika kataloğu; ikisi arasında bir uyuşmazlık olduğunda, her ikisi de gösterilir.

Kısa versiyon

  • Veri setinizden şüphe ediyorsanız önce ACT'yi eğitin: çalıştırma başına 1 ila 3 USD, kötü verileri örtbas etmek için önceden eğitilmiş hiçbir şey yok.
  • GR00T N1.7 ve Pi0.5, LIBERO'da yarım puan içinde yer alır, 97.0'a karşı 96.85 ila 97.5. Bu, ikisinden birini seçmek için bir neden değildir.
  • Pi0.5, doğruluk oyunu değil, genelleme oyunudur ve 485 ms ile en yavaşıdır.
  • SmolVLA, 450 M parametre ile, burada tek bir 24 GB kart üzerinde ince ayar yapan tek VLA'dır.
  • ACT, 20 ms ile hızlı reaktif hareket için tek seçenektir. Gerisini lisanslar belirler.

Karar tablosu

DurumunuzBunu eğitinNeden
Veri seti kalitesi kanıtlanmamışACTÖnceden eğitilmiş hiçbir şey bozuk bir veri setini gizleyemez ve başarısızlık 1 ila 3 USD'ye mal olur.
Temas yoğun, çok adımlı, dil koşulluGR00T N1.7Dört LIBERO paketinde %97,0, ayrıca göreceli bir uç efektör eylem alanı.
Hızlı reaktif hareket, servo motorlarda çıkarımACT20 ms. Sonraki en hızlısı 7,6 kat daha yavaş.
Yeni nesneler, yeni sahne, açık dünyaPi0.5Dağıtım dışı davranışlar için, 104'e kadar farklı konumda geliştirildi.
Tek bir 24 GB kart, yine de dil desteği isteniyorSmolVLA450 M parametre, 30 bölümlük taban, yerel olarak çalışır.
2025'te kaydedilmiş bir çalışmayı yeniden üretmekGR00T N1.5Sadece zorunluysanız: LeRobot artık bunu reddediyor, ağırlıklar ticari değil.
Bu bir ürün olarak piyasaya sürülecekN1.7, SmolVLA or ACTN1.5 ticari değildir, Pi0.5 Gemma şartlarını taşır, SmolVLA'nın kartında hiçbir şey belirtilmemiştir.

Beş aday

Beşinin hepsi de politikalarıdır: kamera kareleri, eklem pozisyonları ve, dördü için, gelecekteki eklem hedeflerinin bir bölümüne eşlenen bir dil talimatı. Onları ayıran şey, ne kadarının siz gelmeden önce öğrenilmiş olmasıdır.

PolitikaParametrelerGecikmeGPU seviyesiYerel mi?Min. bölüm sayısıBiçimMaliyet
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA'nın mevcut görsel-dil-eylem modeli, yaklaşık 3 milyar parametre, yaklaşık 40 milyon parametre ince ayar sırasında eğitildi. Depo, N1.6'dan farkları listeler: tedarikçi Eagle modelinden Qwen3-VL üzerindeki Cosmos-Reason2-2B'ye omurga, difüzyon katmanları 32'den 16'ya, durum ve eylem boyutları 29'dan 132'ye, eylem ufku 16'dan 40'a.

Küçük bir kolda önemli olan, göreceli uç efektör eylem alanıdır: N1.7, mevcut pozdan farkları tahmin eder; bu da 20 bin saatlik EgoScale insan videosunun bir robot politikasına aktarılmasını sağlar. Özellikler N1.7 sayfasında, prosedür ise SO-100 kılavuzundaki N1.7'de.

Depoda GA, model kartında EA

Isaac-GR00T README'si N1.7'yi Genel Kullanılabilirlik sürümü olarak ilan eder, eksiksiz karşılaştırmalar ve destekle birlikte. Hugging Face kartı henüz güncellenmedi: Model Version alanı hala GR00T N1.7 EA okuyor. Depo daha yeni belgedir.

GR00T N1.5

Aynı 3 B ölçeği, Eagle 2 omurgası, SigLip2 ve T5, akış eşleşmeli DiT başlığı. Mevcut bir nı genişletmek için mevcuttur. İki şey onu kötü bir varsayılan yapar: ağırlıklar NVIDIA'nın tek yönlü ticari olmayan lisansını taşır ve mevcut LeRobot sürümleri N1.5 desteğini kaldırmıştır. Bkz. .

Pi0.5

Physical Intelligence'ın VLA'sı, politika türü pi05. Makale, PaliGemma'dan başlatılan 2 B VLM ve 300 M'lik bir eylem uzmanı sunar, robotu 50 Hz'de sürer; LeRobot'un pi05 yapılandırması varsayılan olarak 50 adımlık bir parçaya, bu hızda bir saniyeye ayarlanmıştır. Satış noktası, daha önce görülmemiş yerlerdir: gerçek evlerde yaklaşık 400 saatlik mobil manipülasyon ve 3, 12, 22, 53, 82 ve 104 konum üzerinde bir ölçeklendirme çalışması, burada 104 konumlu model, test evlerinin kendilerinde eğitilmiş bir kontrolle eşleşti.

Bir sınırlama, lerobot/pi05_base kartında belirtilmiştir: bağlantı noktası yalnızca akış eşleştirmeli action head taşır. Alt görev tahmini, eylem belirteçleştirme ve RL yukarı akışta yayınlanmadı ve openpi kendi deposu için de aynısını söylüyor. Pi0.5 sayfası ve SO-100 üzerindeki Pi0.5 kılavuzu geri kalanını içerir.

Bir öğleden sonrayı yutan tuzak: geçitli depolar

Pi0.5, geçitli `google/paligemma-3b-pt-224` belirteçleyiciye ihtiyaç duyar (`gated: manual`, ancak Google isteklerin anında işlendiğini belirtiyor). Bunu kabul etmeden ve eğitim ortamında `hf auth login` komutunu çalıştırmadan, iş başlar, bir süre indirir, ardından bir ağ hatası gibi görünen bir yetkilendirme hatasıyla durur. `nvidia/GR00T-N1.7-3B` geçitli değildir, ancak `nvidia/Cosmos-Reason2-2B` omurgası geçitlidir (`gated: auto`). Kuyruğa almadan önce her ikisini de temizleyin; bir çalıştırma boşta kalırsa, takılı kalan kuyruk sayfası neleri kontrol etmeniz gerektiğini listeler.

SmolVLA

450 M parametre, eylem uzmanında yaklaşık 100 M, VLM dondurulmuş ve yalnızca ilk 16 dil modeli katmanı kullanılarak SmolVLM-2 üzerinde. Ön eğitim topluluk verileriydi: aynı kullandığınız ucuz kollardan 481 veri kümesi, 10.6 M kare. Burada tek bir 24 GB karta sığan tek VLA ve tek 30 bölüm tabanı. Bkz. SmolVLA sayfası.

ACT

Bir temel model değildir. ALOHA'dan Action Chunking Transformer, yaklaşık 80 M parametreye sahiptir ve her görev için sıfırdan, 50 Hz'de 50 gösterimle eğitilmiştir. Makale, vurguladığı örneklerde %80 ila %90 başarıyla, her biri yaklaşık on dakikalık gösterimlerden altı gerçek iki elle yapılan görevi rapor etmektedir. Fikri, eylem parçalama, bu sayfadaki her modelde mevcuttur ve ablasyonu hala etkiyi en iyi şekilde ölçmektedir: zamansal topluluk kapalıyken iki simüle edilmiş görevde, başarı k=1'de %1'den k=100'de %44'e yükselmektedir. ACT sayfası geri kalanını içerir.

Kıyaslamalar aslında ne diyor

LIBERO, bu beşinden üçünün raporladığı kıyaslamadır: simüle edilmiş bir Franka Panda üzerindeki dil koşullu görevler, her biri on görevden oluşan aşağıdaki dört süite ayrılmıştır. NVIDIA, her süit için 200 deneme gerçekleştirdi.

ModelUzamsalNesneHedef10 (Uzun)Ortalama
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Bu satırlar kesin olarak karşılaştırılabilir değil

Her sayı farklı bir test düzeneği ve bütçeden gelmektedir. GR00T, global batch 640 ile 20K adım çalıştı; openpi rakamı 30K'lık bir kontrol noktasıdır; LeRobot portu, bir LIBERO temel modeline 6K adım ekledi. SmolVLA daha da uyumsuz: makalesi, o satırı LIBERO üzerinde sıfırdan, VLA ön eğitimi olmadan eğitiyor, oysa üstündeki üçü önceden eğitilmiş kontrol noktalarını ince ayar yapıyor. 96.85 ila 97.5'i tek bir küme olarak, 87.3%'e olan farkı ise gerçek ancak 6.7 kat daha fazla parametreyle elde edilmiş olarak değerlendirin.

SimplerEnv, LIBERO'nun göstermediği yayılımı gösteriyor. NVIDIA, N1.7'yi N1.6 ile karşılaştırıyor; bu, bir nesilsel farka en yakın halka açık şeydir.

SimplerEnv paketiN1.6 ortalamasıN1.7 ortalamasıEn iyi değişimEn kötü değişim
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 ila 48.0put_eggplant_in_basket 89.0 ila 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 ila 65.0hiçbiri, her görev iyileşti

Bridge satırı kullanışlı olanıdır: put_eggplant_in_basket ortalama 5.7 puan kazanırken 36 kaybetti ve put_eggplant_in_sink 33'ten 2'ye düştü. Yeni bir nesil, dağıtımı yükseltmek yerine hareket ettiriyor, bu nedenle göreviniz N1.7'nin gerilediği yerde bulunuyorsa, ortalama hiçbir şey ifade etmez.

AY-Robots arena liderlik tablosu, 85 görme-dil-eylem modelinin sıralanabilir bir tablosu ve 332 kıyaslama sonucu, her değer geldiği makaleye veya model kartına bağlıdır.
Arena, her biri kendi makalesine veya model kartına bağlı 85 VLA modeli ve 332 kıyaslama sonucu barındırır. Bir blog yazısında alıntılanan bir sayının gerçek olup olmadığını kontrol etmek için kullanışlıdır.

Beşinden sadece SmolVLA makalesi bir SO-100 sınıfı kol hakkında rapor veriyor: SmolVLA için yüzde 78.3 ve üç görevde Pi0 için 61.7, her ikisi de çok görevli, tek görevli eğitilmiş ACT için 48.3'e karşı, ki bu birebir aynı değil. Temiz eşleştirme, SO-101 seç-ve-yerleştir görevinde her ikisi de tek görevli: dağıtımda 70'e karşı 90, dışında 40'a karşı 50. Karşılaştırın: ACT ile SmolVLA ve Pi0.5 ile SmolVLA, veya göz atın: arena.

Gecikme ve maliyet dağıtımı belirler

Çıkarım gecikmesi insanların en son keşfettiği ve ilk pişmanlık duyduğu kısıtlamadır. Bir karşılaştırmada beş puan daha iyi olan ancak eylem adımı başına yarım saniye süren bir politika masanızda daha kötü görünür: temas dinamikleri beklemez.

Bir uyarı: GR00T rakamı, NVIDIA'nın kartıyla çelişiyor; bu kart, 4 gürültü giderme adımı ve bir kamera için H100 üzerinde eager modda 85.8 ms, torch.compile ile 48.6 ms, tam TensorRT ile 27.9 ms süre ölçüyor. Buradaki 152 ms, hizmet verme yükü ve birden fazla kamera içeren tüm yığın için bir rakamdır, bir ileri geçiş değil.

Uzaktan çıkarımın katı bir üst sınırı var

20 ila 485 ms'lik döngü modele aittir ve genel internet gidiş-dönüş süreleri buna eklenir. Uzaktan çıkarım, yavaş alma-yerleştirme işlemleri için uygulanabilir, ancak hızlı reaktif hareketler için değildir. Göreviniz hız gerektiriyorsa, çıkarım servoların yanında yer alır: ACT veya SmolVLA, yerel olarak. İlgili: politika hareketin ortasında donuyor.

Modeli değiştirmeden zaman kazanmanın bir yolu: SmolVLA makalesi, senkronize yürütmeyi, yani politikanın bir sonraki tahmini yapmadan önce bir bölümü bitirdiği durumu, tahminin yürütmeyle çakıştığı asenkronize duruma karşı ölçüyor. Başarı benzerdir, 78.3'e karşı 73.3, ancak aynı alma-yerleştirme işlemi 13.75 yerine 9.7 saniye sürüyor ve sabit bir pencerede robot 9 yerine 19 döngü yönetiyor.

Lisanslar, kimse kontrol etmediği için kontrol edildi

ModelAğırlık LisansıKod LisansıTicari Kullanım
GR00T N1.7NVIDIA Open Model License; kart ticari kullanıma izin veriyorApache 2.0evet
GR00T N1.5NVIDIA tek yönlü ticari olmayan lisansApache 2.0hayır
Pi0.5pi05_base kart meta verileri lisansı okuyor: gemmaApache 2.0 (openpi, LeRobot docs)ikisini de okuyun, çelişiyorlar
SmolVLAsmolvla_base kartında lisans alanı yokApache 2.0 (LeRobot)kod evet, ağırlıklar belirtilmemiş
ACTtemel ağırlıklar mevcut değilApache 2.0 (LeRobot)evet

Pi0.5 satırı dikkat gerektiriyor. LeRobot pi05 dokümantasyonu, openpi ile tutarlı olarak Apache 2.0'ı belirtiyor, oysa Hub kartı lerobot/pi05_base şunu taşıyor license: gemma. Her ikisi de aktif. GR00T N1.7'nin daha hafif bir sürümü var: Isaac-GR00T README'si, N1.7'nin Apache 2.0 altında tamamen ticari olarak lisanslanabilir olduğunu belirtiyor, oysa kendi lisans bölümü ve model kartı, yalnızca kodu Apache 2.0 altında ve ağırlıkları NVIDIA Open Model License altına koyuyor.

Gerçekte çalıştıracağınız varsayılanlar

Her eğitmen formu bir varsayılanla gelir ve bunlar rastgele değildir. ACT'ler LeRobot'un kendisidir: batch 8, lr 1e-5, 100000 eğitim adımları, 100'lük öbek boyutu, yukarı akış ACTConfig ile eşleşen ve k=100 from the ACT paper. Aşağıdaki bir sütun bir tuzaktır.

PolitikaPartiLRMaksimum adımGrad birikimiUygulanır mı?Ek ayarlar
GR00T N1.7321e-4200001evetsaveSteps
GR00T N1.511e-5200016evetsaveSteps
Pi0.515e-53000016hayır (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008hayırseed, logFreq
ACT81e-51000001hayırchunkSize, nActionSteps, seed, logFreq
Tekrarlanabilirlik, Ağustos 2026 tarihli

GR00T'un ince ayar giriş noktası (launch_finetune.py, bir tyro CLI), yapılandırma veri sınıfında tohum alanı içermez, bu nedenle çalıştırmalar birebir tekrarlanabilir değildir. Depo ayrıca, deterministik olmayan görüntü büyütmelerinden kaynaklanan çalıştırmalar arasında %5 ila %6 varyans konusunda uyarıyor; bu, çevrimiçi tartışılan çoğu kıyaslama farkından daha büyüktür. LeRobot'un varsayılan tohumu 1000'dir. Grad birikimi sütunu lerobot 0.5.1'i tanımlar; yukarı akış 0.6.2 bunu --accelerator.gradient_accumulation.steps olarak sunar.

Model seçiminden daha önemli olan ayar

Bu, eylem öbeğidir. Daha uzun öbekler daha akıcı hareket ve daha az birikimli hata sağlar, ancak öbek yürütülürken ilke taahhüt edildiği için, hareket eden her şeye geç tepki verir: statik bir küpte kendinden emin, yuvarlanan bir küpte ise çaresizdir. Eğer aşarsa, yürütülen kısmı kısaltmak yeniden eğitmeyi yener ve ücretsizdir. Erken duran bir eklem farklı bir sorundur; bkz. .

  • ACT: ACTConfig varsayılan olarak chunk_size 100 ve n_action_steps 100 kullanır. Zamansal topluluk kapalıdır ve n_action_steps 1 gerektirir.
  • GR00T N1.7: dahili ufuk 16'dan 40'a çıktı, ancak LeRobot'un SO-101 örneği hala --policy.chunk_size=16 --policy.n_action_steps=16 ile çalışıyor. Rollout bayrağı --execution-horizon olarak yeniden adlandırıldı.
  • Pi0.5: LeRobot'un LIBERO tarifinin --policy.n_action_steps=10 aracılığıyla 10 adımını yürüttüğü 50 adımlık bir öbek; --policy.pretrained_path ile bayrağı atlarsanız 50'ye geri döner.
  • SmolVLA: 50 eylemli öbekler, her iki ayar da açıkta.

Beşini birden bir öğleden sonra nasıl tararsınız?

En ucuz cevap daha fazla okumak değil. Yaklaşık 15 USD harcayın ve kolun size söylemesine izin verin: bir kez kaydedin, önce ucuz modeli eğitin, verilerin sağlam olduğunu kanıtladıktan sonra ölçeği büyütün. Yapı hacmi yener, ve nın amacı budur.

  1. 1
    50 bölümü bir kez kaydedin

    GR00T, Pi0.5 ve ACT için 50, SmolVLA için 30 ile zemin hazırlanır. Her varyasyonu yaymak yerine tekrarlayın: 5 küp pozisyonunda 50 bölüm eğitildi, 25'i eğitilmedi. Bkz. ilk veri setinizi kaydedin.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ACT'yi önce eğitin, çünkü size yalan söyleyemez

    Önceden eğitilmiş ağırlıklar yok, bu yüzden görevi yapıyorsa, veri setiniz görevi içeriyor demektir. ACT düz çizgi çekerse (performans göstermezse), veriyi düzeltin. 24 GB'lık bir kartta 1 ila 3 USD, 2 ila 5 saat.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA'yı aynı veri setinde, değişmeden çalıştırın

    Aynı veri, aynı kol, 80 M yerine 450 M parametre, artı dil koşullandırması. LeRobot, bir A100 üzerinde 20 bin adımlık bir çalıştırmayı yaklaşık 4 saat olarak belirtiyor. Ön eğitimin bir faydası olup olmadığını size söyleyen budur.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T'ye dokunmadan önce v2.1'e dönüştürün

    GR00T, LeRobot v2 formatının bir çeşidini ve birleştirilmiş durum ve eylem dizilerinin adlandırılmış alanlara nasıl ayrıldığını gösteren ek bir meta/modality.json dosyasını okur. Bir v3.0 veri seti bu yükleyiciyi çökertecektir, çünkü v3.0 birçok bölümü paylaşılan dosyalara paketlerken, v2 her bölüm için bir dosya yazıyordu. Isaac-GR00T, düşürme yardımcısını scripts/lerobot_conversion/convert_v3_to_v2.py olarak sunar; v3 reddetme sayfası hızlı yoldur.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    GR00T N1.7'ye yalnızca ilk ikisi bir şeyler eksik bıraktıysa geçin

    Burada gösterilen NVIDIA CLI'ı aracılığıyla veya LeRobot'un groot politika türüyle. NVIDIA, ince ayar için 40 GB veya daha fazla VRAM, çıkarım için ise 16 GB VRAM önerir. Bir OOM durumunda, OOM sayfasına bakın.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Bu tarama geçişini çalıştırmanın iki yolu

Üç ortam, çünkü araç zincirleri bir arada bulunmuyor. Ana daldaki LeRobot 0.6.2 sürümüdür ve Python 3.12 veya daha yenisini gerektirir; Isaac-GR00T ve openpi ayrı uv tarafından yönetilen depolardır.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T, tek video arka ucu olarak torchcodec 0.8.0'ı kullanır ve FFmpeg 4 ila 7 gerektirir. FFmpeg 8 desteklenmez, AV1 garanti edilmez.
  • openpi bellek tabanları: çıkarım 8 GB üzeri, LoRA 22.5 GB üzeri, tam ince ayar 70 GB üzeri. Sonuncusu, Pi0.5'in neden bir A100 işi olduğunu açıklıyor.
  • GPU'yu kendiniz kiralayın, sonra yok edin, üç kontrol noktası yolunu manuel olarak uzlaştırın.

Temel model veya sıfırdan

Asıl ikilem, hangi 3 B modelini seçeceğimiz değil. Önceden eğitilmiş bir VLA kullanıp kullanmayacağımızdır, zira ACT, her biri yaklaşık on dakikalık gösterimlerden altı gerçek iki elli görevi 80 M parametreyle ve hiçbir ön eğitim olmadan öğrendi.

ACT'yi sıfırdan eğitmek yerine önceden eğitilmiş bir VLA'yı ince ayar yapmak
Kazançlarınız
  • Dil koşullandırması. ACT'de bu yok; bir ACT kontrol noktası bir görevi yapar.
  • Gösterimlerinizde bulunmayan nesnelerde daha iyi: SO-101'de, ACT'nin dağıtım dışı %40'ına karşılık %50.
  • Çoklu görev yeteneği: SmolVLA, tek bir kontrol noktasıyla üç SO-100 görevinde %78.3'e ulaşır; ACT yalnızca tek görevli olarak çalıştırıldı.
Size maliyeti
  • 7.6x ila 24x daha fazla gecikme: ACT'nin 20 ms'sine karşılık eylem adımı başına 152 ila 485 ms.
  • 1 ila 3 yerine çalıştırma başına 4 ila 12 USD ve herhangi bir 24 GB kart yerine bir A100 seviyesi.
  • Lisans riski, ayrıca sıfırdan mevcut olmayan, erişimi kısıtlı depo arıza modu.
  • Önceden eğitilmiş ağırlıklar kötü bir veri setini maskeleyebilir. Bozuk veriler üzerinde yarı çalışan bir ince ayar, verilere bakmadan önce bir haftaya mal olur.

Eski bir çalıştırmayı yeniden üretme durumu

2025 kontrol noktasını takip etmek, model seçimini sizin için yapar ve sorunu sürüm sabitlemeye dönüştürür: mevcut LeRobot, N1.5'i reddeder, bu yüzden siz lerobot==0.5.1. Tohum alanı olmaması ve çalıştırmalar arasında %5 ila %6 varyans ile , yeniden üretim yapı gereği yaklaşıktır. SO-100'deki N1.5 kılavuzu ve N1.5 politika sayfası platform tarafını içerir.

AY-Robots'un GR00T N1.7 ile Pi0.5 arasındaki karşılaştırma sayfası; parametre sayıları, GPU gereksinimleri, çıkarım gecikmesi, veri kümesi formatı ve minimum bölüm sayılarını yan yana gösteriyor.
Karşılaştırma: /compare/groot-n1-7-vs-pi0-5. İki 3 B model, teknik özellikler sayfasında birbirinin yerine geçebilir gibi görünse de öyle değildir: biri LeRobot v2.1, diğeri v3.0 gerektirir.

İki modele mi düştünüz? ACT ile GR00T N1.7 ve GR00T N1.7 ile SmolVLA. Ham veriler arena girişlerinde yer almaktadır: GR00T N1.7, Pi0.5, SmolVLA ve ACT.

Bu platformun size yardımcı olmadığı durumlar

  • Uzaktan çıkarımı hızlandıramaz. 20 ila 485 ms'lik döngü modele aittir; internet gidiş-dönüş süreleri buna eklenir.
  • GR00T veya Pi0.5'i kendi donanımınızda ince ayar yapamaz. Her ikisi de burada yalnızca bulut tabanlıdır; yalnızca SmolVLA ve ACT yerel olarak çalışır.
  • Bir veri kümesini düzeltemez. Kayıp düşüyor ama politika hiçbir şey yapmıyor bir veri sorunudur, yalnızca tek bir kurulumda çalışan bir politika bir kapsama sorunudur.
  • GR00T çalıştırmalarını tekrarlanabilir hale getiremez: üst akım yapılandırmasında 'seed' alanı yoktur.

85 model, 332 kıyaslama sonucu, her sayı kaynağına bağlı

Bu sayfadaki tabloların sıralanabilir versiyonu: 85 görme-dil-eylem modeli, 332 kıyaslama sonucu, her biri kendi makalesine veya model kartına bağlantılıdır.

Arenayı aç

Birini seçip devam etmek

Bir varsayılan: 50 bölüm kaydedin, veri setini kanıtlamak için ACT'yi 1 ila 3 USD karşılığında eğitin, ardından SmolVLA'yı aynı veriler üzerinde. Toplamda 6 USD'nin altında, ve önemli olan soruyu yanıtlıyorlar: ön eğitimin burada yardımcı olup olmadığı, veya darboğazın veri olup olmadığı. Temas yoğun çok adımlı görevler için GR00T N1.7'ye, sahne değiştiğinde Pi0.5'e yükseltin.

Platform tanıtımı: ilk politikanızı eğitin, ardından ilk politikanızı çalıştırın. eğitim belgeleri ve veri seti belgeleri form ve formatı kapsar; SO-100 sayfası ve eksiksiz SO-100 rehberi kurulum ve kalibrasyonu kapsar. Arka plan: VLA genel bakışı ve Pi0 akış eşleştirme makalesi. Başarı oranınızı artıracak olan ise veri kalitesi rehberi.

SO-100 üzerinde hangi VLA politikasını önce eğitmeliğim?

ACT, sonra SmolVLA. ACT sıfırdan eğitim yapar, bu yüzden kötü bir veri setini maskeleyemez ve bir çalıştırma 24 GB'lık bir kartta 1 ila 3 USD'ye mal olur. Eğer ACT görevi hiç yapabiliyorsa, bir GR00T N1.7 veya Pi0.5 çalıştırması için harcanan 4 ila 12 USD boşa gitmez.

GR00T N1.7 gerçekten Pi0.5'ten daha mı iyi?

LIBERO üzerinde gürültü seviyesindeler: GR00T N1.7 için dört süitte %97.0, openpi'de 30k adımda Pi0.5 için %96.85, LeRobot portu için %97.5, hepsi farklı test düzeneklerinden. Gerçek farklar, eylem adımı başına 152 ms'ye karşı 485 ms, v2.1 veri setlerine karşı v3.0 ve kıyaslama doğruluğuna karşı açık dünya genellemesi.

Bunlardan herhangi birini tek bir RTX 4090 üzerinde ince ayar yapabilir miyim?

SmolVLA ve ACT, evet; her ikisi de bir RTX 4090 veya herhangi bir 24 GB kart için listelenmiştir ve yerel olarak çalışır. GR00T N1.7, N1.5 ve Pi0.5 bir A100 veya H100 80 GB'a ihtiyaç duyar ve burada yalnızca bulut tabanlıdır. NVIDIA, GR00T ince ayarı için 40 GB veya daha fazlasını önerir; openpi'nin tabanı, tam bir Pi0.5 ince ayarı için 70 GB'ın üzerinde, LoRA için 22.5 GB'tır.

Bu beşinden hangisini ticari olarak kullanabilirim?

GR00T N1.7 ağırlıkları, kartın ticari kullanımı kapsadığını belirttiği NVIDIA Açık Model Lisans Anlaşması altındadır. N1.5 ağırlıkları ticari değildir. SmolVLA'nın kodu LeRobot'ta Apache 2.0'dır, ancak lerobot/smolvla_base kartında lisans alanı bulunmadığından ağırlıklar belirtilmemiştir. ACT'nin lisanslanacak temel ağırlıkları yoktur. Pi0.5 belirsizdir: LeRobot'un belgeleri Apache 2.0 derken, kart meta verileri lisans: gemma olarak okunur.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started