AY-Robots siyosatlarini taqqoslash jadvali GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT'ni parametrlar soni, GPU darajasi, inferens kechikishi va minimal epizodlar soni bilan yonma-yon ko'rsatadi
vla-modelspolicy-trainingmodel-selectionlerobotso-100

2026-yilda qaysi VLA siyosatini o'rgatish kerak?

AY-Robots ResearchAugust 23, 202618 daqiqalik o'qish

GR00T N1.7, Pi0.5, SmolVLA, ACT yoki GR00T N1.5? Haqiqiy vaziyatlarga mos keladigan qaror jadvali, har bir tanlov ortidagi e'lon qilingan benchmark raqamlari, kechikish, har bir ishga tushirish narxi va litsenziyalari bilan.

Bugungi kunda SO-100 klassli qo'lda beshta siyosatni o'rgatish mumkin. Ular inferensiyada 24 barobar farq qiladi kechikish, parametrlar sonida 37 va bir ishlanmaning narxida 12 barobar farq qiladi, shuningdek, natijani jo'natishingiz mumkinmi yoki yo'qmi. Beshta model kartasi buni hal qilmaydi: hech biri sizda mavjud bo'lgan savolga javob bermaydi, qaysi birini birinchi ishga tushiray?

Quyidagi har bir raqam 2026-yil avgust oyida maqolalar, repolar va kartalardan olingan. Platforma raqamlari dan olingan; AY-Robots siyosat katalogi; ikkalasi mos kelmagan joyda, ikkalasi ham ko'rsatilgan.

Qisqa versiya

  • Agar ma'lumotlar to'plamingizga shubha qilsangiz, avval ACTni o'rgating: bir ishlanma uchun 1 dan 3 USD gacha, yomon ma'lumotlarni yashirish uchun oldindan o'rgatilgan hech narsa yo'q.
  • GR00T N1.7 va Pi0.5 LIBEROda yarim ball ichida joylashgan, 97.0 ga qarshi 96.85 dan 97.5 gacha. Bu ulardan birini tanlash uchun sabab emas.
  • Pi0.5 aniqlik emas, balki umumlashtirish uchun mo'ljallangan va 485 ms bilan eng sekinidir.
  • SmolVLA, 450 M parametrga ega bo'lib, bu yerda bitta 24 GB kartada nozik sozlash imkonini beruvchi yagona VLA hisoblanadi.
  • 20 ms tezlikdagi ACT tez reaktiv harakat uchun yagona variantdir. Qolganini litsenziyalar hal qiladi.

Qaror jadvali

Sizning vaziyatingizBuni oʻrgatingNima uchun
Maʼlumotlar toʻplami sifati tasdiqlanmaganACTOldindan oʻqitilgan hech narsa buzilgan maʼlumotlar toʻplamini yashirmaydi va muvaffaqiyatsizlik 1 dan 3 USD gacha turadi.
Kontaktga boy, koʻp bosqichli, tilga asoslanganGR00T N1.7Toʻrtta LIBERO toʻplamida 97.0%, shuningdek, nisbiy oxirgi effektorni harakatlantirish maydoni.
Tez reaktiv harakat, servolarda xulosa chiqarishACT20 ms. Keyingi eng tezkor 7.6 barobar sekinroq.
Yangi obyektlar, yangi sahna, ochiq dunyoPi0.5104 tagacha joylashuv boʻylab, taqsimotdan tashqari xatti-harakatlar uchun qurilgan.
Bitta 24 GB karta, hali ham tilni xohlaysizSmolVLA450 M parametr, 30 epizodli minimal talab, mahalliy ishlaydi.
2025 yilda yozilgan ishni takrorlashGR00T N1.5Faqat agar shart boʻlsa: LeRobot endi uni rad etadi, ogʻirliklar tijorat maqsadlarida emas.
Bu mahsulot sifatida joʻnatiladiN1.7, SmolVLA yoki ACTN1.5 tijorat maqsadlarida emas, Pi0.5 Gemma shartlarini oʻz ichiga oladi, SmolVLA kartasida hech narsa koʻrsatilmagan.

Besh nomzod

Beshalasi ham siyosatlari: kamera kadrlari, boʻgʻin pozitsiyalari va, ularning toʻrttasi uchun, kelajakdagi boʻgʻin nishonlarining bir qismiga xaritalangan til koʻrsatmasi. Ularni ajratib turadigan narsa – siz kelishdan oldin qancha narsa oʻrganilganligi.

SiyosatParametrlarKechikishGPU darajasiMahalliy?Min. epizodlarFormatNarx
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA'ning joriy vizual-til-harakat modeli, taxminan 3 milliard parametr, shundan taxminan 40 millioni nozik sozlash davomida o'qitilgan. Repozitoriy N1.6 dan farqlarni sanab o'tadi: Eagle modelidan Cosmos-Reason2-2B ga Qwen3-VL da o'zgartirilgan asosiy qism, diffuziya qatlamlari 32 dan 16 ga, holat va harakat o'lchamlari 29 dan 132 ga, harakat gorizonti 16 dan 40 ga.

Kichik qo'lda muhim bo'lgan narsa nisbiy oxirgi effektorni harakatlantirish maydonidir: N1.7 joriy holatdan farqlarni bashorat qiladi, bu esa 20 ming soatlik EgoScale inson videosini robot siyosatiga o'tkazish imkonini beradi. Texnik xususiyatlar N1.7 sahifasida, tartib esa N1.7 ni SO-100 da o'rnatish bo'yicha qo'llanmada.

Repozitoriyda GA, model kartasida EA

Isaac-GR00T README N1.7 ni Umumiy Mavjudlik relizi deb e'lon qiladi, to'liq benchmarklar va qo'llab-quvvatlash bilan. Uning Hugging Face kartasi hali yangilanmagan: Model Version maydoni hali ham GR00T N1.7 EA deb ko'rsatilgan. Repozitoriy yangiroq hujjatdir.

GR00T N1.5

Bir xil 3 B masshtab, Eagle 2 tayanch, SigLip2 va T5, oqimga mos keluvchi DiT boshi. U mavjud bo'lgan ni kengaytirish uchun mavjud. Ikki narsa uni yomon standart qiladi: og'irliklar NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. Qarang .

Pi0.5

Physical Intelligence kompaniyasining VLA, siyosat turi pi05. Maqolada PaliGemma'dan boshlangan 2 B VLM va 300 M harakat eksperti berilgan bo'lib, robotni 50 Hz chastotada boshqaradi; LeRobot's pi05 config sukut bo'yicha 50 qadamli bo'lakka, bu tezlikda bir soniyaga o'rnatilgan. Sotish nuqtasi ko'rilmagan joylardir: haqiqiy uylarda taxminan 400 soat mobil manipulyatsiya va 3, 12, 22, 53, 82 va 104 joylashuv bo'yicha masshtablash tadqiqoti, bu yerda 104 joylashuvli model sinov uylarining o'zida o'qitilgan nazoratga mos keldi.

Bir cheklov, lerobot/pi05_base kartasida ko'rsatilgan: port faqat oqimga mos keladigan harakat boshini olib boradi. Kichik vazifalarni bashorat qilish, harakatni tokenizatsiya qilish va RL yuqori oqimda chiqarilmagan va openpi o'zining ombori haqida ham shunday deydi. Pi0.5 sahifasi va SO-100 dagi Pi0.5 qo'llanmasi qolganini o'z ichiga oladi.

Bir kunni yutib yuboradigan tuzoq: himoyalangan omborlar

Pi0.5 himoyalangan google/paligemma-3b-pt-224 tokenizatoriga muhtoj (gated: manual, garchi Google so'rovlar darhol qayta ishlanadi desa ham). Uni qabul qilmasdan va o'quv muhitida hf auth login ni ishga tushirmasdan, ish boshlanadi, biroz yuklab olinadi, so'ngra tarmoq xatosi kabi ko'rinadigan avtorizatsiya xatosi tufayli to'xtaydi. nvidia/GR00T-N1.7-3B himoyalanmagan, ammo uning nvidia/Cosmos-Reason2-2B tayanch modeli himoyalangan (gated: auto). Navbatga qo'yishdan oldin ikkalasini ham tozalang; agar ish bo'sh turgan bo'lsa, tiqilib qolgan navbat sahifasi nimani tekshirish kerakligini ko'rsatadi.

SmolVLA

450 M parametr, harakat ekspertida taxminan 100 M, SmolVLM-2 da VLM muzlatilgan va faqat uning birinchi 16 ta til modeli qatlami ishlatilgan. Oldindan o'qitish jamoat ma'lumotlari edi: 481 ta ma'lumotlar to'plami, 10.6 M kadr, siz foydalanadigan bir xil arzon qo'llardan. Bu yerda bitta 24 GB kartaga sig'adigan yagona VLA va yagona 30 epizod chegarasi. Qarang SmolVLA sahifasi.

ACT

Asosiy model emas. ALOHA'dan Action Chunking Transformer taxminan 80 M parametrga ega bo'lib, har bir vazifa uchun noldan, 50 ta namoyishda 50 Hz chastotada o'qitilgan. Maqolada har biri taxminan o'n daqiqa namoyishlardan olingan oltita haqiqiy ikki qo'lli vazifalar, u ta'kidlagan misollarda 80 dan 90 foizgacha muvaffaqiyat bilan qayd etilgan. Uning g'oyasi, action chunking, ushbu sahifadagi har bir modelda mavjud bo'lib, uning ablasyonu hali ham eng yaxshi ta'sirni o'lchaydi: vaqtinchalik ansambl o'chirilgan ikkita simulyatsiya qilingan vazifada muvaffaqiyat k=1 da 1 foizdan k=100 da 44 foizgacha ko'tariladi. ACT sahifasida qolganlari bor.

Benchmarklar aslida nima deydi

LIBERO bu beshtadan uchtasi hisobot beradigan yagona benchmarkdir: simulyatsiya qilingan Franka Panda'dagi tilga asoslangan vazifalar, quyida har biri o'nta vazifadan iborat to'rtta to'plamga bo'lingan. NVIDIA har bir to'plam uchun 200 ta sinov o'tkazdi.

ModelFazoviyObyektMaqsad10 (Uzoq)Oʻrtacha
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Bu qatorlar qat'iy taqqoslanmaydi

Har bir raqam turli sinov tizimi va byudjetdan kelib chiqqan. GR00T global batch 640 bilan 20K qadam ishladi; openpi ko'rsatkichi 30K nazorat nuqtasidir; LeRobot porti LIBERO bazaviy modeliga 6K qadam qo'shdi. SmolVLA yana bir nomuvofiqlikdir: uning maqolasi ushbu qatorni LIBEROda noldan boshlab, VLA oldindan o'qitishsiz o'rgatadi, yuqoridagi uchta esa oldindan o'qitilgan nazorat nuqtalarini nozik sozlaydi. 96.85 dan 97.5 gacha bo'lgan oraliqni bitta klaster deb hisoblang va 87.3% gacha bo'lgan farqni haqiqiy, ammo 6.7 barobar ko'proq parametrlar bilan erishilgan deb biling.

SimplerEnv tarqalishni ko'rsatadi, LIBERO esa yo'q. NVIDIA N1.7 ni N1.6 bilan taqqoslaydi, bu generational delta.

SimplerEnv to'plamiN1.6 o'rtachasiN1.7 o'rtachasiEng yaxshi o'zgarishEng yomon o'zgarish
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 dan 48.0 gachaput_eggplant_in_basket 89.0 dan 53.0 gacha
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 dan 65.0 gachayo'q, har bir vazifa yaxshilandi

Bridge qatori foydali: oʻrtacha 5.7 ball qoʻlga kiritilgan, put_eggplant_in_basket 36 ball yoʻqotgan va put_eggplant_in_sink 33 dan 2 ga tushgan. Yangi avlod taqsimotni koʻtarish oʻrniga uni siljitadi, shuning uchun agar sizning vazifangiz N1.7 regressiya qilgan joyda boʻlsa, oʻrtacha koʻrsatkich hech narsa demaydi.

AY-Robots arena peshqadami, 85 ta koʻrish-til-harakat modellarining saralanadigan jadvali, 332 ta benchmark natijalari bilan, har bir qiymat oʻzi kelgan maqola yoki model kartasiga bogʻlangan
Arena 85 ta VLA modelini va 332 ta benchmark natijalarini oʻz ichiga oladi, ularning har biri oʻz maqolasi yoki model kartasiga bogʻlangan. Blog postida keltirilgan raqamning haqiqiy ekanligini tekshirish uchun foydali.

Beshinchisidan, faqat SmolVLA maqolasi SO-100 sinfidagi qoʻl haqida hisobot beradi: SmolVLA uchun 78.3 foiz va Pi0 uchun uchta vazifada 61.7 foiz, ikkalasi ham koʻp vazifali, bir vazifali oʻqitilgan ACT uchun 48.3 foizga qarshi, bu bir xil emas. Toza juftlik SO-101 pick-and-place boʻyicha ikkalasi ham bir vazifali: taqsimotda 90 ga qarshi 70, undan tashqarida 50 ga qarshi 40. Solishtiring ACT va SmolVLA va Pi0.5 va SmolVLA, yoki koʻrib chiqing arenani.

Kechikish va xarajat joylashtirishni hal qiladi

Inference kechikishi odamlar eng oxirida kashf etadigan va birinchi bo'lib afsuslanadigan cheklovdir. Benchmarkingda besh ballga yaxshiroq, ammo har bir harakat qadami uchun yarim soniya sarflaydigan siyosat stolingizda yomonroq ko'rinadi: kontakt dinamikasi kutmaydi.

Bir ogohlantirish: GR00T ko'rsatkichi NVIDIA kartasi bilan mos kelmaydi, u 4 ta shovqinni yo'qotish bosqichini va bitta kamerani H100 da eager rejimida 85.8 ms, torch.compile bilan 48.6 ms, to'liq TensorRT orqali 27.9 ms vaqt bilan o'lchaydi. Bu yerdagi 152 ms xizmat ko'rsatish xarajatlari va bir nechta kamera bilan butun stek ko'rsatkichidir, bu faqat oldinga o'tish emas.

Masofaviy inference qattiq chegaraga ega

20 dan 485 ms gacha bo'lgan tsikl modelga tegishli bo'lib, ommaviy internet orqali borib-kelish vaqtlari unga qo'shiladi. Masofaviy inference sekin tanlash va joylashtirish uchun maqbul, tez reaktiv harakat uchun emas. Agar vazifangiz tezlikni talab qilsa, inference servolar yonida joylashadi: ACT yoki SmolVLA, mahalliy. Bog'liq: siyosat harakat o'rtasida muzlab qoladi.

Modelni o'zgartirmasdan vaqt yutishning bir usuli: SmolVLA maqolasi sinxron ijroni o'lchaydi, bunda siyosat keyingisini bashorat qilishdan oldin bir qismni tugatadi, asinxron ijroga qarshi, bunda bashorat ijro bilan ustma-ust tushadi. Muvaffaqiyat o'xshash, 78.3 ga qarshi 73.3, ammo xuddi shu tanlash va joylashtirish 13.75 o'rniga 9.7 soniya davom etadi va belgilangan vaqt oralig'ida robot 9 o'rniga 19 tsiklni boshqaradi.

Litsenziyalar, tekshirilgan, chunki ularni hech kim tekshirmaydi

ModelOg'irliklar litsenziyasiKod litsenziyasiTijorat maqsadida foydalanish
GR00T N1.7NVIDIA Open Model License; karta tijorat maqsadida foydalanishga ruxsat beradiApache 2.0ha
GR00T N1.5NVIDIA bir tomonlama notijorat litsenziyaApache 2.0yo'q
Pi0.5pi05_base karta metama'lumotlari litsenziyani o'qiydi: gemmaApache 2.0 (openpi, LeRobot docs)ikkalasini ham o'qing, ular bir-biriga mos kelmaydi
SmolVLAsmolvla_base kartasida litsenziya maydoni yo'qApache 2.0 (LeRobot)kod ha, og'irliklar ko'rsatilmagan
ACTasosiy og'irliklar mavjud emasApache 2.0 (LeRobot)ha

Pi0.5 qatori e'tibor talab qiladi. LeRobot pi05 hujjatlari openpi bilan mos keladigan Apache 2.0 ni ko'rsatadi, shu bilan birga Hub kartasi lerobot/pi05_base da license: gemma. Ikkalasi ham faol. GR00T N1.7 ning yumshoqroq versiyasi bor: Isaac-GR00T README faylida N1.7 Apache 2.0 ostida to'liq tijorat maqsadida litsenziyalanishi mumkinligi aytilgan, shu bilan birga uning o'z litsenziya bo'limi va model kartasi faqat kodni Apache 2.0 ostiga va og'irliklarni NVIDIA Open Model License.

Siz amalda ishga tushiradigan standart sozlamalar

Har bir o'qituvchi shakli sukut bo'yicha keladi va ular o'zboshimchalik bilan emas. ACT'lar LeRobot'ning o'ziniki: batch 8, lr 1e-5, 100000 o'qitish bosqichlari, chunk size 100, ACTConfig upstream bilan mos keladi va k=100 from the ACT paper. Quyidagi bir ustun tuzoqdir.

SiyosatPaketLRMaksimal bosqichlarGrad yig'ishQo'llaniladimi?Qo'shimcha sozlamalar
GR00T N1.7321e-4200001hasaveSteps
GR00T N1.511e-5200016hasaveSteps
Pi0.515e-53000016yo'q (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008yo'qseed, logFreq
ACT81e-51000001yo'qchunkSize, nActionSteps, seed, logFreq
Takrorlanuvchanlik, 2026 yil avgust holatiga

GR00T'ning nozik sozlash kirish nuqtasi (launch_finetune.py, tyro CLI)da seed maydoni yo'q o'zining config dataclass'ida, shuning uchun ishlar bitma-bit takrorlanuvchan emas. Repozitoriy shuningdek ishlar orasida 5 dan 6 foizgacha farq deterministik bo'lmagan tasvirni kengaytirishlardan kelib chiqishini ogohlantiradi, bu onlayn muhokama qilinadigan ko'pgina benchmark farqlaridan kattaroqdir. LeRobot'ning sukut bo'yicha seed qiymati 1000. Grad-accum ustuni lerobot 0.5.1ni tavsiflaydi; upstream 0.6.2 uni --accelerator.gradient_accumulation.steps sifatida ko'rsatadi.

Model tanlovidan ko'ra muhimroq bo'lgan sozlama

Bu harakat bo'lagi. Uzunroq bo'laklar silliqroq harakat va kamroq yig'iluvchi xatoliklarni beradi, ammo blok bajarilayotganda siyosat qabul qilinadi, shuning uchun u harakatlanuvchi narsalarga kech reaksiyaga kirishadi: statik kubda ishonchli, aylanuvchi kubda umidsiz. Agar u haddan tashqari oshib ketsa, bajarilgan qismni qisqartirish qayta o'qitishdan yaxshiroq va bepuldir. Erta to'xtaydigan bo'g'in boshqa muammo; qarang .

  • ACT: ACTConfig sukut bo'yicha chunk_size 100 va n_action_steps 100 ga sozlanadi. Vaqtinchalik ansambl o'chirilgan va n_action_steps 1 ni talab qiladi.
  • GR00T N1.7: ichki gorizont 16 dan 40 gacha o'zgardi, ammo LeRobot'ning SO-101 misoli hali ham --policy.chunk_size=16 --policy.n_action_steps=16 bilan ishlaydi. Rollout bayrog'i --execution-horizon deb qayta nomlandi.
  • Pi0.5: 50 qadamli bo'lak, uning 10 tasini LeRobot'ning LIBERO retsepti --policy.n_action_steps=10 orqali bajaradi; --policy.pretrained_path bilan, agar siz bayroqni qoldirsangiz, u 50 ga qaytadi.
  • SmolVLA: 50 harakatli bo'laklar, ikkala sozlama ham ochiq.

Beshalasini bir tushdan keyin qanday tekshirish mumkin

Eng arzon javob ko'proq o'qish emas. Taxminan 15 USD sarflang va qo'l sizga aytsin: bir marta yozib oling, avval arzon modelni o'rgating, ma'lumotlar to'g'ri ekanligini isbotlagandan so'ng kuchaytiring. Tuzilma hajmga qaraganda muhimroq, va nuqtasi.

  1. 1
    50 ta epizodni bir marta yozib oling

    GR00T, Pi0.5 va ACT uchun 50 ta, SmolVLA uchun 30 ta maydonni tozalaydi. Har bir variantni yoyib yubormasdan takrorlang: 5 ta kub pozitsiyasida 50 ta epizod oʻrgatildi, 25 tasida esa yoʻq. Birinchi maʼlumotlar toʻplamingizni yozib olishni koʻring.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Avval ACTni oʻrgating, chunki u sizga yolgʻon gapira olmaydi

    Oldindan oʻrgatilgan ogʻirliklar yoʻq, shuning uchun agar u vazifani bajarsa, maʼlumotlar toʻplamingizda vazifa mavjud. Agar ACT ishlamay qolsa, maʼlumotlarni tuzating. 24 GB kartada 1 dan 3 USD gacha, 2 dan 5 soatgacha.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA ni bir xil maʼlumotlar toʻplamida, oʻzgartirmasdan ishga tushiring

    Bir xil maʼlumotlar, bir xil qoʻl, 80 M oʻrniga 450 M parametrlar, shuningdek, til shartlari. LeRobot bitta A100 da 20K qadamli ishni taxminan 4 soatga baholaydi. Bu sizga oldindan oʻrgatish biror narsa beradimi yoki yoʻqligini aytadi.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00Tga tegishdan oldin v2.1 ga tushiring

    GR00T LeRobot v2 formatining bir turini, shuningdek, birlashtirilgan holat va harakat massivlari nomlangan maydonlarga qanday boʻlinishini koʻrsatuvchi qoʻshimcha meta/modality.json faylini oʻqiydi. v3.0 maʼlumotlar toʻplami ushbu yuklovchini ishdan chiqaradi, chunki v3.0 koʻplab epizodlarni umumiy fayllarga joylashtiradi, v2 esa har bir epizod uchun bittadan yozgan. Isaac-GR00T pasaytirish yordamchisini scripts/lerobot_conversion/convert_v3_to_v2.py sifatida yetkazib beradi; v3 rad etish sahifasi tezkor yoʻldir.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Faqat dastlabki ikkitasi biror narsa qoldirgan boʻlsa, GR00T N1.7 ga oʻting

    Bu yerda koʻrsatilgan NVIDIA CLI orqali yoki LeRobotning groot siyosat turi orqali. NVIDIA nozik sozlash uchun 40 GB yoki undan koʻproq VRAM, inferensiya uchun 16 GB tavsiya qiladi. OOM holatida OOM sahifasini koʻring.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Ushbu skrining oʻtkazmasini ishga tushirishning ikki yoʻli

Uchta muhit, chunki asboblar zanjirlari birga mavjud emas. Asosiy LeRobot 0.6.2 versiyasida va Python 3.12 yoki undan yangiroq versiyani talab qiladi; Isaac-GR00T va openpi alohida uv-boshqariladigan repozitoriylardir.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0 ni yagona video backend sifatida belgilaydi, buning uchun FFmpeg 4 dan 7 gacha versiyalari kerak. FFmpeg 8 qoʻllab-quvvatlanmaydi, AV1 kafolatlanmaydi.
  • openpi xotira chegaralari: inferensiya 8 GB dan yuqori, LoRA 22.5 GB dan yuqori, toʻliq nozik sozlash 70 GB dan yuqori. Oxirgisi Pi0.5 ning A100 ishi ekanligining sababidir.
  • GPU ni oʻzingiz ijaraga oling, keyin uni yoʻq qiling, uchta nazorat nuqtasi yoʻlini qoʻlda moslashtiring.

Asosiy model yoki noldan

Haqiqiy tanlov qaysi 3 B modelini tanlashda emas. Balki umuman oldindan o'qitilgan VLA'dan foydalanish kerakmi, yo'qmi, chunki ACT har biri taxminan o'n daqiqalik namoyishlardan oltita haqiqiy ikki qo'lli vazifani 80 M parametr bilan o'rgangan va hech narsa oldindan o'qitilmagan.

ACT'ni noldan o'qitish o'rniga oldindan o'qitilgan VLA'ni nozik sozlash
Siz nimaga erishasiz
  • Til shartlashuvi. ACT'da bunday yo'q; bitta ACT nazorat nuqtasi bitta vazifani bajaradi.
  • Namoyishlaringizda bo'lmagan obyektlarda yaxshiroq: SO-101'da, ACT'ning taqsimotdan tashqari 40% ga qarshi 50%.
  • Umuman ko'p vazifali: SmolVLA bitta nazorat nuqtasi bilan uchta SO-100 vazifasida 78.3% ga erishadi; ACT faqat bitta vazifada ishga tushirilgan.
Sizga qancha turadi
  • 7.6x dan 24x gacha kechikish: ACT'ning 20 ms'iga qarshi har bir harakat bosqichi uchun 152 dan 485 ms gacha.
  • 1 dan 3 USD o'rniga har bir ishga tushirish uchun 4 dan 12 USD, va har qanday 24 GB karta o'rniga A100 darajasi.
  • Litsenziya ta'siri, shuningdek, noldan mavjud bo'lmagan yopiq-repo nosozlik rejimi.
  • Oldindan o'qitilgan og'irliklar yomon ma'lumotlar to'plamini yashirishi mumkin. Buzilgan ma'lumotlarda yarim ishlaydigan nozik sozlash ma'lumotlarga qarashdan oldin bir hafta vaqt oladi.

Eski ishga tushirishni takrorlash holati

2025 nazorat nuqtasini ta'qib qilish siz uchun model tanlovini amalga oshiradi va muammoni versiyani qotirishga aylantiradi: joriy LeRobot N1.5'ni rad etadi, shuning uchun siz lerobot==0.5.1. Urug' maydoni yo'qligi va ishga tushirishlar orasida 5 dan 6 foizgacha farq bilan , takrorlash qurilish bo'yicha taxminiydir. SO-100'dagi N1.5 qo'llanmasi va N1.5 siyosat sahifasi platforma tomoniga ega.

AY-Robots ning GR00T N1.7 ni Pi0.5 ga qarshi boshma-bosh taqqoslash sahifasi, parametrlar sonini, GPU talablarini, xulosa chiqarish kechikishini, ma'lumotlar to'plami formatini va minimal epizodlar sonini yonma-yon ko'rsatadi
Qiyosiy bahs /compare/groot-n1-7-vs-pi0-5. Ikki 3 B model texnik xususiyatlar varag'ida bir-birini almashtiradigandek ko'rinadi, ammo unday emas: biri LeRobot v2.1 ni, ikkinchisi v3.0 ni talab qiladi.

Ikkita qoldimi? ACT GR00T N1.7 ga qarshi va GR00T N1.7 SmolVLA ga qarshi. Xom qatorlar arena yozuvlarida joylashgan: GR00T N1.7, Pi0.5, SmolVLA va ACT.

Bu platforma sizga qayerda yordam bera olmaydi

  • U masofaviy xulosa chiqarishni tezlashtira olmaydi. 20 dan 485 ms gacha bo'lgan sikl modelga tegishli; internetdagi borib-kelishlar bunga qo'shimcha bo'ladi.
  • U GR00T yoki Pi0.5 ni o'zingizning uskunangizda nozik sozlay olmaydi. Bu yerda ikkalasi ham faqat bulutda ishlaydi; faqat SmolVLA va ACT mahalliy ishlaydi.
  • U ma'lumotlar to'plamini tuzata olmaydi. Yo'qotish kamayadi, lekin siyosat hech narsa qilmaydi ma'lumotlar muammosi, faqat bitta sozlamada ishlaydigan siyosat qamrov muammosidir.
  • U GR00T ishlarini takrorlanadigan qila olmaydi: yuqori oqim konfiguratsiyasida 'seed' maydoni yo'q.

85 ta model, 332 ta benchmark natijalari, har bir raqam o'z manbasiga bog'langan

Ushbu sahifadagi jadvallarning saralanishi mumkin bo'lgan versiyasi: 85 ta ko'rish-til-harakat modellari, 332 ta benchmark natijalari, har biri o'z maqolasi yoki model kartasiga bog'langan.

Arenani ochish

Birini tanlash va davom etish

Bir standart: 50 ta epizodni yozib oling, ma'lumotlar to'plamini tasdiqlash uchun ACTni 1 dan 3 USD gacha o'rgating, so'ngra SmolVLA ni xuddi shu ma'lumotlar ustida. Jami 6 USD dan kam, va ular muhim savolga javob beradi: bu yerda oldindan o'qitish yordam beradimi yoki muammo ma'lumotlardami. Kontaktga boy ko'p bosqichli vazifalar uchun GR00T N1.7 ga, Pi0.5 ga esa sahna o'zgarganda o'ting.

Platforma bo'yicha qo'llanma: birinchi siyosatingizni o'rgating, so'ng birinchi siyosatingizni ishga tushiring. o'qitish hujjatlari va ma'lumotlar to'plami hujjatlari shakl va formatni qamrab oladi; SO-100 sahifasi va to'liq SO-100 qo'llanmasi qurish va kalibrlashni qamrab oladi. Fon: VLA ga umumiy nuqtai va Pi0 oqim moslashuvi maqolasi. Sizning muvaffaqiyat darajangizni oshiradigan narsa ma'lumotlar sifati bo'yicha qo'llanma.

SO-100 da qaysi VLA siyosatini birinchi bo'lib o'rgatishim kerak?

ACT, keyin SmolVLA. ACT noldan o'rgatadi, shuning uchun u yomon ma'lumotlar to'plamini niqoblay olmaydi va bir marta ishlatish 24 GB kartada 1 dan 3 USD gacha turadi. Agar ACT vazifani bajarsa, GR00T N1.7 yoki Pi0.5 uchun 4 dan 12 USD gacha bo'lgan xarajat behuda ketmaydi.

GR00T N1.7 haqiqatan ham Pi0.5 dan yaxshiroqmi?

LIBERO da ular shovqin chegarasida: GR00T N1.7 uchun to'rtta to'plam bo'yicha 97.0%, openpi da 30k qadamda Pi0.5 uchun 96.85%, LeRobot porti uchun 97.5%, barchasi turli xil sinov tizimlaridan olingan. Haqiqiy farqlar har bir harakat qadami uchun 152 ms ga qarshi 485 ms, v2.1 ma'lumotlar to'plamlari v3.0 ga qarshi va benchmark aniqligi ochiq dunyo umumlashtirishiga qarshi.

Ulardan birortasini bitta RTX 4090 da nozik sozlashim mumkinmi?

SmolVLA va ACT, ha; ikkalasi ham RTX 4090 yoki har qanday 24 GB karta uchun ko'rsatilgan va mahalliy ishlaydi. GR00T N1.7, N1.5 va Pi0.5 uchun A100 yoki H100 80 GB kerak va bu yerda faqat bulutda ishlaydi. NVIDIA GR00T ni nozik sozlash uchun 40 GB yoki undan ko'proq tavsiya qiladi; openpi ning minimal talabi to'liq Pi0.5 ni nozik sozlash uchun 70 GB dan yuqori, LoRA uchun 22.5 GB.

Bu beshtadan qaysi birini tijorat maqsadlarida ishlata olaman?

GR00T N1.7 og'irliklari NVIDIA Open Model License Agreement ostida bo'lib, karta tijorat maqsadlarida foydalanishni qamrab oladi deb aytadi. N1.5 og'irliklari notijoratdir. SmolVLA kodi LeRobot da Apache 2.0, ammo lerobot/smolvla_base kartasida litsenziya maydoni yo'q, shuning uchun og'irliklar ko'rsatilmagan. ACT ning litsenziyalash uchun asosiy og'irliklari yo'q. Pi0.5 noaniq: LeRobot hujjatlarida Apache 2.0 deyilgan, uning karta metama'lumotlarida license: gemma deb yozilgan.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started