
GR00T N1.7, Pi0.5, SmolVLA, ACT veya GR00T N1.5? Gerçek durumlara uygun bir karar tablosu, yayınlanmış kıyaslama sayıları, gecikme süresi, her çalıştırma başına maliyet ve her seçimin arkasındaki lisanslarla birlikte.
Bugün bir SO-100 sınıfı kol üzerinde beş politika eğitilebilir. Çıkarım gecikmesinde 24, parametre sayısında 37 ve bir çalıştırmanın maliyetinde 12 kat farklılık gösterirler ve sonucu gönderip gönderemeyeceğinize göre değişirler. Beş model kartı bunu çözmeyecektir: hiçbiri sizin sorunuzu, yani hangisini önce çalıştırmalıyım sorusunu yanıtlamaz.
Aşağıdaki her sayı Ağustos 2026'da makalelerden, depolardan ve kartlardan okunmuştur. Platform numaraları şuradan alınmıştır: AY-Robots politika kataloğu; ikisi arasında bir uyuşmazlık olduğunda, her ikisi de gösterilir.
Kısa versiyon
- •Veri setinizden şüphe ediyorsanız önce ACT'yi eğitin: çalıştırma başına 1 ila 3 USD, kötü verileri örtbas etmek için önceden eğitilmiş hiçbir şey yok.
- •GR00T N1.7 ve Pi0.5, LIBERO'da yarım puan içinde yer alır, 97.0'a karşı 96.85 ila 97.5. Bu, ikisinden birini seçmek için bir neden değildir.
- •Pi0.5, doğruluk oyunu değil, genelleme oyunudur ve 485 ms ile en yavaşıdır.
- •SmolVLA, 450 M parametre ile, burada tek bir 24 GB kart üzerinde ince ayar yapan tek VLA'dır.
- •ACT, 20 ms ile hızlı reaktif hareket için tek seçenektir. Gerisini lisanslar belirler.
Karar tablosu
| Durumunuz | Bunu eğitin | Neden |
|---|---|---|
| Veri seti kalitesi kanıtlanmamış | ACT | Önceden eğitilmiş hiçbir şey bozuk bir veri setini gizleyemez ve başarısızlık 1 ila 3 USD'ye mal olur. |
| Temas yoğun, çok adımlı, dil koşullu | GR00T N1.7 | Dört LIBERO paketinde %97,0, ayrıca göreceli bir uç efektör eylem alanı. |
| Hızlı reaktif hareket, servo motorlarda çıkarım | ACT | 20 ms. Sonraki en hızlısı 7,6 kat daha yavaş. |
| Yeni nesneler, yeni sahne, açık dünya | Pi0.5 | Dağıtım dışı davranışlar için, 104'e kadar farklı konumda geliştirildi. |
| Tek bir 24 GB kart, yine de dil desteği isteniyor | SmolVLA | 450 M parametre, 30 bölümlük taban, yerel olarak çalışır. |
| 2025'te kaydedilmiş bir çalışmayı yeniden üretmek | GR00T N1.5 | Sadece zorunluysanız: LeRobot artık bunu reddediyor, ağırlıklar ticari değil. |
| Bu bir ürün olarak piyasaya sürülecek | N1.7, SmolVLA or ACT | N1.5 ticari değildir, Pi0.5 Gemma şartlarını taşır, SmolVLA'nın kartında hiçbir şey belirtilmemiştir. |
Beş aday
Beşinin hepsi de politikalarıdır: kamera kareleri, eklem pozisyonları ve, dördü için, gelecekteki eklem hedeflerinin bir bölümüne eşlenen bir dil talimatı. Onları ayıran şey, ne kadarının siz gelmeden önce öğrenilmiş olmasıdır.
| Politika | Parametreler | Gecikme | GPU seviyesi | Yerel mi? | Min. bölüm sayısı | Biçim | Maliyet |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA'nın mevcut görsel-dil-eylem modeli, yaklaşık 3 milyar parametre, yaklaşık 40 milyon parametre ince ayar sırasında eğitildi. Depo, N1.6'dan farkları listeler: tedarikçi Eagle modelinden Qwen3-VL üzerindeki Cosmos-Reason2-2B'ye omurga, difüzyon katmanları 32'den 16'ya, durum ve eylem boyutları 29'dan 132'ye, eylem ufku 16'dan 40'a.
Küçük bir kolda önemli olan, göreceli uç efektör eylem alanıdır: N1.7, mevcut pozdan farkları tahmin eder; bu da 20 bin saatlik EgoScale insan videosunun bir robot politikasına aktarılmasını sağlar. Özellikler N1.7 sayfasında, prosedür ise SO-100 kılavuzundaki N1.7'de.
Isaac-GR00T README'si N1.7'yi Genel Kullanılabilirlik sürümü olarak ilan eder, eksiksiz karşılaştırmalar ve destekle birlikte. Hugging Face kartı henüz güncellenmedi: Model Version alanı hala GR00T N1.7 EA okuyor. Depo daha yeni belgedir.
GR00T N1.5
Aynı 3 B ölçeği, Eagle 2 omurgası, SigLip2 ve T5, akış eşleşmeli DiT başlığı. Mevcut bir nı genişletmek için mevcuttur. İki şey onu kötü bir varsayılan yapar: ağırlıklar NVIDIA'nın tek yönlü ticari olmayan lisansını taşır ve mevcut LeRobot sürümleri N1.5 desteğini kaldırmıştır. Bkz. .
Pi0.5
Physical Intelligence'ın VLA'sı, politika türü pi05. Makale, PaliGemma'dan başlatılan 2 B VLM ve 300 M'lik bir eylem uzmanı sunar, robotu 50 Hz'de sürer; LeRobot'un pi05 yapılandırması varsayılan olarak 50 adımlık bir parçaya, bu hızda bir saniyeye ayarlanmıştır. Satış noktası, daha önce görülmemiş yerlerdir: gerçek evlerde yaklaşık 400 saatlik mobil manipülasyon ve 3, 12, 22, 53, 82 ve 104 konum üzerinde bir ölçeklendirme çalışması, burada 104 konumlu model, test evlerinin kendilerinde eğitilmiş bir kontrolle eşleşti.
Bir sınırlama, lerobot/pi05_base kartında belirtilmiştir: bağlantı noktası yalnızca akış eşleştirmeli action head taşır. Alt görev tahmini, eylem belirteçleştirme ve RL yukarı akışta yayınlanmadı ve openpi kendi deposu için de aynısını söylüyor. Pi0.5 sayfası ve SO-100 üzerindeki Pi0.5 kılavuzu geri kalanını içerir.
Pi0.5, geçitli `google/paligemma-3b-pt-224` belirteçleyiciye ihtiyaç duyar (`gated: manual`, ancak Google isteklerin anında işlendiğini belirtiyor). Bunu kabul etmeden ve eğitim ortamında `hf auth login` komutunu çalıştırmadan, iş başlar, bir süre indirir, ardından bir ağ hatası gibi görünen bir yetkilendirme hatasıyla durur. `nvidia/GR00T-N1.7-3B` geçitli değildir, ancak `nvidia/Cosmos-Reason2-2B` omurgası geçitlidir (`gated: auto`). Kuyruğa almadan önce her ikisini de temizleyin; bir çalıştırma boşta kalırsa, takılı kalan kuyruk sayfası neleri kontrol etmeniz gerektiğini listeler.
SmolVLA
450 M parametre, eylem uzmanında yaklaşık 100 M, VLM dondurulmuş ve yalnızca ilk 16 dil modeli katmanı kullanılarak SmolVLM-2 üzerinde. Ön eğitim topluluk verileriydi: aynı kullandığınız ucuz kollardan 481 veri kümesi, 10.6 M kare. Burada tek bir 24 GB karta sığan tek VLA ve tek 30 bölüm tabanı. Bkz. SmolVLA sayfası.
ACT
Bir temel model değildir. ALOHA'dan Action Chunking Transformer, yaklaşık 80 M parametreye sahiptir ve her görev için sıfırdan, 50 Hz'de 50 gösterimle eğitilmiştir. Makale, vurguladığı örneklerde %80 ila %90 başarıyla, her biri yaklaşık on dakikalık gösterimlerden altı gerçek iki elle yapılan görevi rapor etmektedir. Fikri, eylem parçalama, bu sayfadaki her modelde mevcuttur ve ablasyonu hala etkiyi en iyi şekilde ölçmektedir: zamansal topluluk kapalıyken iki simüle edilmiş görevde, başarı k=1'de %1'den k=100'de %44'e yükselmektedir. ACT sayfası geri kalanını içerir.
Kıyaslamalar aslında ne diyor
LIBERO, bu beşinden üçünün raporladığı kıyaslamadır: simüle edilmiş bir Franka Panda üzerindeki dil koşullu görevler, her biri on görevden oluşan aşağıdaki dört süite ayrılmıştır. NVIDIA, her süit için 200 deneme gerçekleştirdi.
| Model | Uzamsal | Nesne | Hedef | 10 (Uzun) | Ortalama |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Her sayı farklı bir test düzeneği ve bütçeden gelmektedir. GR00T, global batch 640 ile 20K adım çalıştı; openpi rakamı 30K'lık bir kontrol noktasıdır; LeRobot portu, bir LIBERO temel modeline 6K adım ekledi. SmolVLA daha da uyumsuz: makalesi, o satırı LIBERO üzerinde sıfırdan, VLA ön eğitimi olmadan eğitiyor, oysa üstündeki üçü önceden eğitilmiş kontrol noktalarını ince ayar yapıyor. 96.85 ila 97.5'i tek bir küme olarak, 87.3%'e olan farkı ise gerçek ancak 6.7 kat daha fazla parametreyle elde edilmiş olarak değerlendirin.
SimplerEnv, LIBERO'nun göstermediği yayılımı gösteriyor. NVIDIA, N1.7'yi N1.6 ile karşılaştırıyor; bu, bir nesilsel farka en yakın halka açık şeydir.
| SimplerEnv paketi | N1.6 ortalaması | N1.7 ortalaması | En iyi değişim | En kötü değişim |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 ila 48.0 | put_eggplant_in_basket 89.0 ila 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 ila 65.0 | hiçbiri, her görev iyileşti |
Bridge satırı kullanışlı olanıdır: put_eggplant_in_basket ortalama 5.7 puan kazanırken 36 kaybetti ve put_eggplant_in_sink 33'ten 2'ye düştü. Yeni bir nesil, dağıtımı yükseltmek yerine hareket ettiriyor, bu nedenle göreviniz N1.7'nin gerilediği yerde bulunuyorsa, ortalama hiçbir şey ifade etmez.

Beşinden sadece SmolVLA makalesi bir SO-100 sınıfı kol hakkında rapor veriyor: SmolVLA için yüzde 78.3 ve üç görevde Pi0 için 61.7, her ikisi de çok görevli, tek görevli eğitilmiş ACT için 48.3'e karşı, ki bu birebir aynı değil. Temiz eşleştirme, SO-101 seç-ve-yerleştir görevinde her ikisi de tek görevli: dağıtımda 70'e karşı 90, dışında 40'a karşı 50. Karşılaştırın: ACT ile SmolVLA ve Pi0.5 ile SmolVLA, veya göz atın: arena.
Gecikme ve maliyet dağıtımı belirler
Çıkarım gecikmesi insanların en son keşfettiği ve ilk pişmanlık duyduğu kısıtlamadır. Bir karşılaştırmada beş puan daha iyi olan ancak eylem adımı başına yarım saniye süren bir politika masanızda daha kötü görünür: temas dinamikleri beklemez.
Bir uyarı: GR00T rakamı, NVIDIA'nın kartıyla çelişiyor; bu kart, 4 gürültü giderme adımı ve bir kamera için H100 üzerinde eager modda 85.8 ms, torch.compile ile 48.6 ms, tam TensorRT ile 27.9 ms süre ölçüyor. Buradaki 152 ms, hizmet verme yükü ve birden fazla kamera içeren tüm yığın için bir rakamdır, bir ileri geçiş değil.
20 ila 485 ms'lik döngü modele aittir ve genel internet gidiş-dönüş süreleri buna eklenir. Uzaktan çıkarım, yavaş alma-yerleştirme işlemleri için uygulanabilir, ancak hızlı reaktif hareketler için değildir. Göreviniz hız gerektiriyorsa, çıkarım servoların yanında yer alır: ACT veya SmolVLA, yerel olarak. İlgili: politika hareketin ortasında donuyor.
Modeli değiştirmeden zaman kazanmanın bir yolu: SmolVLA makalesi, senkronize yürütmeyi, yani politikanın bir sonraki tahmini yapmadan önce bir bölümü bitirdiği durumu, tahminin yürütmeyle çakıştığı asenkronize duruma karşı ölçüyor. Başarı benzerdir, 78.3'e karşı 73.3, ancak aynı alma-yerleştirme işlemi 13.75 yerine 9.7 saniye sürüyor ve sabit bir pencerede robot 9 yerine 19 döngü yönetiyor.
Lisanslar, kimse kontrol etmediği için kontrol edildi
| Model | Ağırlık Lisansı | Kod Lisansı | Ticari Kullanım |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; kart ticari kullanıma izin veriyor | Apache 2.0 | evet |
| GR00T N1.5 | NVIDIA tek yönlü ticari olmayan lisans | Apache 2.0 | hayır |
| Pi0.5 | pi05_base kart meta verileri lisansı okuyor: gemma | Apache 2.0 (openpi, LeRobot docs) | ikisini de okuyun, çelişiyorlar |
| SmolVLA | smolvla_base kartında lisans alanı yok | Apache 2.0 (LeRobot) | kod evet, ağırlıklar belirtilmemiş |
| ACT | temel ağırlıklar mevcut değil | Apache 2.0 (LeRobot) | evet |
Pi0.5 satırı dikkat gerektiriyor. LeRobot pi05 dokümantasyonu, openpi ile tutarlı olarak Apache 2.0'ı belirtiyor, oysa Hub kartı lerobot/pi05_base şunu taşıyor license: gemma. Her ikisi de aktif. GR00T N1.7'nin daha hafif bir sürümü var: Isaac-GR00T README'si, N1.7'nin Apache 2.0 altında tamamen ticari olarak lisanslanabilir olduğunu belirtiyor, oysa kendi lisans bölümü ve model kartı, yalnızca kodu Apache 2.0 altında ve ağırlıkları NVIDIA Open Model License altına koyuyor.
Gerçekte çalıştıracağınız varsayılanlar
Her eğitmen formu bir varsayılanla gelir ve bunlar rastgele değildir. ACT'ler LeRobot'un kendisidir: batch 8, lr 1e-5, 100000 eğitim adımları, 100'lük öbek boyutu, yukarı akış ACTConfig ile eşleşen ve k=100 from the ACT paper. Aşağıdaki bir sütun bir tuzaktır.
| Politika | Parti | LR | Maksimum adım | Grad birikimi | Uygulanır mı? | Ek ayarlar |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | evet | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | evet | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | hayır (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | hayır | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | hayır | chunkSize, nActionSteps, seed, logFreq |
GR00T'un ince ayar giriş noktası (launch_finetune.py, bir tyro CLI), yapılandırma veri sınıfında tohum alanı içermez, bu nedenle çalıştırmalar birebir tekrarlanabilir değildir. Depo ayrıca, deterministik olmayan görüntü büyütmelerinden kaynaklanan çalıştırmalar arasında %5 ila %6 varyans konusunda uyarıyor; bu, çevrimiçi tartışılan çoğu kıyaslama farkından daha büyüktür. LeRobot'un varsayılan tohumu 1000'dir. Grad birikimi sütunu lerobot 0.5.1'i tanımlar; yukarı akış 0.6.2 bunu --accelerator.gradient_accumulation.steps olarak sunar.
Model seçiminden daha önemli olan ayar
Bu, eylem öbeğidir. Daha uzun öbekler daha akıcı hareket ve daha az birikimli hata sağlar, ancak öbek yürütülürken ilke taahhüt edildiği için, hareket eden her şeye geç tepki verir: statik bir küpte kendinden emin, yuvarlanan bir küpte ise çaresizdir. Eğer aşarsa, yürütülen kısmı kısaltmak yeniden eğitmeyi yener ve ücretsizdir. Erken duran bir eklem farklı bir sorundur; bkz. .
- ACT: ACTConfig varsayılan olarak
chunk_size 100ven_action_steps 100kullanır. Zamansal topluluk kapalıdır ven_action_steps 1gerektirir. - GR00T N1.7: dahili ufuk 16'dan 40'a çıktı, ancak LeRobot'un SO-101 örneği hala
--policy.chunk_size=16 --policy.n_action_steps=16ile çalışıyor. Rollout bayrağı--execution-horizonolarak yeniden adlandırıldı. - Pi0.5: LeRobot'un LIBERO tarifinin
--policy.n_action_steps=10aracılığıyla 10 adımını yürüttüğü 50 adımlık bir öbek;--policy.pretrained_pathile bayrağı atlarsanız 50'ye geri döner. - SmolVLA: 50 eylemli öbekler, her iki ayar da açıkta.
Beşini birden bir öğleden sonra nasıl tararsınız?
En ucuz cevap daha fazla okumak değil. Yaklaşık 15 USD harcayın ve kolun size söylemesine izin verin: bir kez kaydedin, önce ucuz modeli eğitin, verilerin sağlam olduğunu kanıtladıktan sonra ölçeği büyütün. Yapı hacmi yener, ve nın amacı budur.
- 150 bölümü bir kez kaydedin
GR00T, Pi0.5 ve ACT için 50, SmolVLA için 30 ile zemin hazırlanır. Her varyasyonu yaymak yerine tekrarlayın: 5 küp pozisyonunda 50 bölüm eğitildi, 25'i eğitilmedi. Bkz. ilk veri setinizi kaydedin.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACT'yi önce eğitin, çünkü size yalan söyleyemez
Önceden eğitilmiş ağırlıklar yok, bu yüzden görevi yapıyorsa, veri setiniz görevi içeriyor demektir. ACT düz çizgi çekerse (performans göstermezse), veriyi düzeltin. 24 GB'lık bir kartta 1 ila 3 USD, 2 ila 5 saat.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA'yı aynı veri setinde, değişmeden çalıştırın
Aynı veri, aynı kol, 80 M yerine 450 M parametre, artı dil koşullandırması. LeRobot, bir A100 üzerinde 20 bin adımlık bir çalıştırmayı yaklaşık 4 saat olarak belirtiyor. Ön eğitimin bir faydası olup olmadığını size söyleyen budur.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T'ye dokunmadan önce v2.1'e dönüştürün
GR00T, LeRobot v2 formatının bir çeşidini ve birleştirilmiş durum ve eylem dizilerinin adlandırılmış alanlara nasıl ayrıldığını gösteren ek bir
meta/modality.jsondosyasını okur. Bir v3.0 veri seti bu yükleyiciyi çökertecektir, çünkü v3.0 birçok bölümü paylaşılan dosyalara paketlerken, v2 her bölüm için bir dosya yazıyordu. Isaac-GR00T, düşürme yardımcısınıscripts/lerobot_conversion/convert_v3_to_v2.pyolarak sunar; v3 reddetme sayfası hızlı yoldur.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5GR00T N1.7'ye yalnızca ilk ikisi bir şeyler eksik bıraktıysa geçin
Burada gösterilen NVIDIA CLI'ı aracılığıyla veya LeRobot'un
grootpolitika türüyle. NVIDIA, ince ayar için 40 GB veya daha fazla VRAM, çıkarım için ise 16 GB VRAM önerir. Bir OOM durumunda, OOM sayfasına bakın.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Bu tarama geçişini çalıştırmanın iki yolu
Üç ortam, çünkü araç zincirleri bir arada bulunmuyor. Ana daldaki LeRobot 0.6.2 sürümüdür ve Python 3.12 veya daha yenisini gerektirir; Isaac-GR00T ve openpi ayrı uv tarafından yönetilen depolardır.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T, tek video arka ucu olarak
torchcodec0.8.0'ı kullanır ve FFmpeg 4 ila 7 gerektirir. FFmpeg 8 desteklenmez, AV1 garanti edilmez. - openpi bellek tabanları: çıkarım 8 GB üzeri, LoRA 22.5 GB üzeri, tam ince ayar 70 GB üzeri. Sonuncusu, Pi0.5'in neden bir A100 işi olduğunu açıklıyor.
- GPU'yu kendiniz kiralayın, sonra yok edin, üç kontrol noktası yolunu manuel olarak uzlaştırın.
Aynı beş model, tek bir form. Modeli, veri setini ve hiperparametreleri seçin; arka uç, gerekli VRAM'e göre boyutlandırılmış bir GPU kiralar, eğiticiyi çalıştırır ve nesne depolamaya yazar.
- Eğitim matrisi beş model ve dört koldan oluşur, her hücre bir rehberdir: SO-100 üzerinde SmolVLA, SO-101 üzerinde ACT.
- Çıkarım podları, boşta kalma izleyicisi ile
/api/inference/podtarafından otomatik olarak sağlanır, böylece unutulan bir pod sessizce faturalandırılmaz. - Temel kontrol noktaları satıcıların kendilerine aittir:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT'nin hiçbiri yoktur. - CLI'dan ve AI ajanlarından MCP sunucusu aracılığıyla aynı işlemler.
- Donanımınız yok mu? Canlı kol, kayıt olmadan fiziksel bir SO-100 yayınlar; deneme sayfası giriş yollarını gösterir.
Temel model veya sıfırdan
Asıl ikilem, hangi 3 B modelini seçeceğimiz değil. Önceden eğitilmiş bir VLA kullanıp kullanmayacağımızdır, zira ACT, her biri yaklaşık on dakikalık gösterimlerden altı gerçek iki elli görevi 80 M parametreyle ve hiçbir ön eğitim olmadan öğrendi.
- Dil koşullandırması. ACT'de bu yok; bir ACT kontrol noktası bir görevi yapar.
- Gösterimlerinizde bulunmayan nesnelerde daha iyi: SO-101'de, ACT'nin dağıtım dışı %40'ına karşılık %50.
- Çoklu görev yeteneği: SmolVLA, tek bir kontrol noktasıyla üç SO-100 görevinde %78.3'e ulaşır; ACT yalnızca tek görevli olarak çalıştırıldı.
- 7.6x ila 24x daha fazla gecikme: ACT'nin 20 ms'sine karşılık eylem adımı başına 152 ila 485 ms.
- 1 ila 3 yerine çalıştırma başına 4 ila 12 USD ve herhangi bir 24 GB kart yerine bir A100 seviyesi.
- Lisans riski, ayrıca sıfırdan mevcut olmayan, erişimi kısıtlı depo arıza modu.
- Önceden eğitilmiş ağırlıklar kötü bir veri setini maskeleyebilir. Bozuk veriler üzerinde yarı çalışan bir ince ayar, verilere bakmadan önce bir haftaya mal olur.
Eski bir çalıştırmayı yeniden üretme durumu
2025 kontrol noktasını takip etmek, model seçimini sizin için yapar ve sorunu sürüm sabitlemeye dönüştürür: mevcut LeRobot, N1.5'i reddeder, bu yüzden siz lerobot==0.5.1. Tohum alanı olmaması ve çalıştırmalar arasında %5 ila %6 varyans ile , yeniden üretim yapı gereği yaklaşıktır. SO-100'deki N1.5 kılavuzu ve N1.5 politika sayfası platform tarafını içerir.

İki modele mi düştünüz? ACT ile GR00T N1.7 ve GR00T N1.7 ile SmolVLA. Ham veriler arena girişlerinde yer almaktadır: GR00T N1.7, Pi0.5, SmolVLA ve ACT.
Bu platformun size yardımcı olmadığı durumlar
- Uzaktan çıkarımı hızlandıramaz. 20 ila 485 ms'lik döngü modele aittir; internet gidiş-dönüş süreleri buna eklenir.
- GR00T veya Pi0.5'i kendi donanımınızda ince ayar yapamaz. Her ikisi de burada yalnızca bulut tabanlıdır; yalnızca SmolVLA ve ACT yerel olarak çalışır.
- Bir veri kümesini düzeltemez. Kayıp düşüyor ama politika hiçbir şey yapmıyor bir veri sorunudur, yalnızca tek bir kurulumda çalışan bir politika bir kapsama sorunudur.
- GR00T çalıştırmalarını tekrarlanabilir hale getiremez: üst akım yapılandırmasında 'seed' alanı yoktur.
85 model, 332 kıyaslama sonucu, her sayı kaynağına bağlı
Bu sayfadaki tabloların sıralanabilir versiyonu: 85 görme-dil-eylem modeli, 332 kıyaslama sonucu, her biri kendi makalesine veya model kartına bağlantılıdır.
Arenayı açBirini seçip devam etmek
Bir varsayılan: 50 bölüm kaydedin, veri setini kanıtlamak için ACT'yi 1 ila 3 USD karşılığında eğitin, ardından SmolVLA'yı aynı veriler üzerinde. Toplamda 6 USD'nin altında, ve önemli olan soruyu yanıtlıyorlar: ön eğitimin burada yardımcı olup olmadığı, veya darboğazın veri olup olmadığı. Temas yoğun çok adımlı görevler için GR00T N1.7'ye, sahne değiştiğinde Pi0.5'e yükseltin.
Platform tanıtımı: ilk politikanızı eğitin, ardından ilk politikanızı çalıştırın. eğitim belgeleri ve veri seti belgeleri form ve formatı kapsar; SO-100 sayfası ve eksiksiz SO-100 rehberi kurulum ve kalibrasyonu kapsar. Arka plan: VLA genel bakışı ve Pi0 akış eşleştirme makalesi. Başarı oranınızı artıracak olan ise veri kalitesi rehberi.
SO-100 üzerinde hangi VLA politikasını önce eğitmeliğim?▾
ACT, sonra SmolVLA. ACT sıfırdan eğitim yapar, bu yüzden kötü bir veri setini maskeleyemez ve bir çalıştırma 24 GB'lık bir kartta 1 ila 3 USD'ye mal olur. Eğer ACT görevi hiç yapabiliyorsa, bir GR00T N1.7 veya Pi0.5 çalıştırması için harcanan 4 ila 12 USD boşa gitmez.
GR00T N1.7 gerçekten Pi0.5'ten daha mı iyi?▾
LIBERO üzerinde gürültü seviyesindeler: GR00T N1.7 için dört süitte %97.0, openpi'de 30k adımda Pi0.5 için %96.85, LeRobot portu için %97.5, hepsi farklı test düzeneklerinden. Gerçek farklar, eylem adımı başına 152 ms'ye karşı 485 ms, v2.1 veri setlerine karşı v3.0 ve kıyaslama doğruluğuna karşı açık dünya genellemesi.
Bunlardan herhangi birini tek bir RTX 4090 üzerinde ince ayar yapabilir miyim?▾
SmolVLA ve ACT, evet; her ikisi de bir RTX 4090 veya herhangi bir 24 GB kart için listelenmiştir ve yerel olarak çalışır. GR00T N1.7, N1.5 ve Pi0.5 bir A100 veya H100 80 GB'a ihtiyaç duyar ve burada yalnızca bulut tabanlıdır. NVIDIA, GR00T ince ayarı için 40 GB veya daha fazlasını önerir; openpi'nin tabanı, tam bir Pi0.5 ince ayarı için 70 GB'ın üzerinde, LoRA için 22.5 GB'tır.
Bu beşinden hangisini ticari olarak kullanabilirim?▾
GR00T N1.7 ağırlıkları, kartın ticari kullanımı kapsadığını belirttiği NVIDIA Açık Model Lisans Anlaşması altındadır. N1.5 ağırlıkları ticari değildir. SmolVLA'nın kodu LeRobot'ta Apache 2.0'dır, ancak lerobot/smolvla_base kartında lisans alanı bulunmadığından ağırlıklar belirtilmemiştir. ACT'nin lisanslanacak temel ağırlıkları yoktur. Pi0.5 belirsizdir: LeRobot'un belgeleri Apache 2.0 derken, kart meta verileri lisans: gemma olarak okunur.
Sources
- NVIDIA Isaac-GR00T deposu: GA durumu, N1.6'dan N1.7'ye değişiklikler, donanım gereksinimleri, torchcodec ve FFmpeg kısıtlamaları, launch_finetune.py, çalıştırmadan çalıştırmaya varyans
- nvidia/GR00T-N1.7-3B model kartı: Cosmos-Reason2-2B omurgası, 3 B parametre, çıkarım zamanlama tablosu, NVIDIA Açık Model Lisansı, Model Sürümü alanı
- nvidia/GR00T-N1.5-3B model kartı: Eagle 2 referansı, SigLip2 ve T5, akış eşleştirme DiT, tek yönlü ticari olmayan lisans
- Isaac-GR00T LIBERO örneği: 20K adımda ve 640 toplu iş boyutunda süit başına başarı oranları, süit başına 200 deneme
- Isaac-GR00T SimplerEnv örneği: görev başına Köprü ve Fraktal başarı oranları, GR00T N1.6'ya karşı N1.7
- pi0.5: Açık Dünya Genellemesi ile Bir Görsel-Dil-Eylem Modeli (2 B VLM artı 300 M eylem uzmanı, 50 Hz kontrol, yaklaşık 400 saat mobil manipülasyon, 3 ila 104 konum üzerinde ölçeklendirme çalışması)
- openpi deposu: GPU bellek tabanları, yalnızca akış eşleştirme başlığı kapsamı ve examples/libero'daki Pi0.5 LIBERO sonuçları
- lerobot/pi05_base model kartı: LeRobot portunun kapsamı, lisans: gemma meta verileri, lerobot-train kullanımı
- LeRobot pi0.5 dokümantasyonu: geçitli PaliGemma belirteçleyici, LIBERO yeniden üretim tablosu, n_action_steps geri dönüş tuzağı, Apache 2.0 bildirimi
- SmolVLA: Uygun Fiyatlı ve Verimli Robotik için Bir Görsel-Dil-Eylem Modeli (450 M parametre, LIBERO ve Meta-World tabloları, SO-100 ve SO-101 sonuçları, eşzamansız çıkarım)
- LeRobot SmolVLA dokümantasyonu: 25'e karşı 5 konumda 50 bölüm, bir A100 üzerinde yaklaşık 4 saatte 20k adım
- Düşük Maliyetli Donanım ile İnce Taneli İki Elle Manipülasyon Öğrenimi (ACT ve ALOHA): %80-90 oranında 6 görev, k=1'den k=100'e kadar öbek boyutu ablasyonu
- LeRobot 0.6.2: ACTConfig ve SmolVLAConfig varsayılanları, varsayılan tohum 1000, --accelerator.gradient_accumulation.steps, Python 3.12 gereksinimi, Apache 2.0
- LeRobot GR00T dokümantasyonu: politika türü groot, N1.5 desteği kaldırıldı, lerobot==0.5.1'i sabitle, SO-101 öbek boyutu örneği
- lerobot/smolvla_base model kartı: --policy.path tarafından kullanılan SmolVLA temel kontrol noktası ve lisans alanı içermeyen kart meta verileri
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started