AY-Robots саясаттарын салыстыру кестесі GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT-ті параметрлер санымен, GPU деңгейімен, инференс кешігуімен және минималды эпизод сандарымен қатар көрсетеді
vla-модельдерісаясатты-үйретумодель-таңдауlerobotso-100

2026 жылы қай VLA саясатын үйрету керек?

AY-Robots ResearchAugust 23, 202618 мин оқу

GR00T N1.7, Pi0.5, SmolVLA, ACT немесе GR00T N1.5? Нақты жағдайларға сәйкестендірілген шешім кестесі, жарияланған бенчмарк көрсеткіштерімен, кешігуімен, бір іске қосу құнымен және әр таңдаудың артындағы лицензияларымен.

Бүгінде SO-100 кластық қолда бес саясатты үйретуге болады. Олар инференцияда 24 есе айырмашылық жасайды кешігу, параметрлер санында 37 және бір іске қосу құнында 12 есе, сондай-ақ нәтижені жеткізуге болатындығында. Бес модель картасы оны шешпейді: ешқайсысы сіздің сұрағыңызға жауап бермейді, мен қайсысын бірінші іске қосамын?

Төмендегі әрбір сан 2026 жылдың тамызындағы құжаттардан, репозиторийлерден және карталардан оқылды. Платформа нөмірлері мына жерден алынған AY-Robots саясат каталогы; егер екеуі келіспесе, екеуі де көрсетіледі.

Қысқа нұсқасы

  • Егер деректер жинағыңызға күмәндансаңыз, алдымен ACT-ті үйретіңіз: бір іске қосу 1-ден 3 USD, нашар деректерді жабу үшін алдын ала үйретілген ештеңе жоқ.
  • GR00T N1.7 және Pi0.5 LIBERO-да жарты ұпай ішінде орналасқан, 97.0 қарсы 96.85-тен 97.5-ке дейін. Бұл екеуін де таңдауға себеп емес.
  • Pi0.5 – дәлдікке емес, жалпылауға арналған, және 485 мс-пен ең баяу.
  • SmolVLA, 450 M параметрлерімен, мұнда бір 24 ГБ картада дәл баптайтын жалғыз VLA болып табылады.
  • 20 мс ACT жылдам реактивті қозғалыс үшін жалғыз нұсқа. Қалғанын лицензиялар шешеді.

Шешім кестесі

Сіздің жағдайыңызМұны үйретіңізНеліктен
Деректер жинағының сапасы дәлелденбегенACTАлдын ала оқытылған ештеңе бұзылған деректер жинағын жасырмайды, ал сәтсіздік 1-ден 3 USD-ға дейін тұрады.
Байланысқа бай, көп қадамды, тілмен шартталғанGR00T N1.7Төрт LIBERO жиынтығы бойынша 97.0%, сонымен қатар салыстырмалы соңғы эффектілі әрекет кеңістігі.
Жылдам реактивті қозғалыс, сервоприводтардағы қорытындыACT20 ms. Келесі ең жылдам 7.6 есе баяу.
Жаңа нысандар, жаңа көрініс, ашық әлемPi0.5104 орынға дейін таралудан тыс мінез-құлыққа арналған.
Бір 24 GB карта, әлі де тіл қажетSmolVLA450 M параметр, 30 эпизодтық шек, жергілікті жерде жұмыс істейді.
2025 жылы жазылған іске қосуды қайталауGR00T N1.5Тек қажет болса: LeRobot қазір оны қабылдамайды, салмақтары коммерциялық емес.
Бұл өнім ретінде жеткізіледіN1.7, SmolVLA or ACTN1.5 коммерциялық емес, Pi0.5 Gemma шарттарын қамтиды, SmolVLA картасында ештеңе көрсетілмеген.

Бес үміткер

Барлығы бесеуі де саясаттары: камера кадрлары, буын позициялары және, олардың төртеуі үшін, болашақ буын нысаналарының бөлігіне сәйкестендірілген тілдік нұсқау. Оларды бөлетін нәрсе – сіз келгенге дейін қаншалықты үйретілгені.

СаясатПараметрлерКідірісGPU деңгейіЖергілікті ме?Мин. эпизодтарПішімҚұны
ACT~80 M20 ms24 GB cardиә50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardиә30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBжоқ50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBжоқ50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBжоқ50v3.04 to 12 USD

GR00T N1.7

NVIDIA-ның қазіргі көру-тіл-әрекет моделі, шамамен 3 миллиард параметр, шамамен 40 миллионы жетілдіру кезінде оқытылған. Репозиторий N1.6-дан айырмашылықтарды көрсетеді: Eagle моделінен Cosmos-Reason2-2B-ге Qwen3-VL-дегі негізгі құрылым, диффузиялық қабаттар 32-ден 16-ға, күй және әрекет өлшемдері 29-дан 132-ге, әрекет көкжиегі 16-дан 40-қа дейін.

Шағын қолда маңыздысы – салыстырмалы соңғы эффектінің әрекет кеңістігі: N1.7 ағымдағы қалыптан айырмашылықтарды болжайды, бұл 20 мың сағаттық EgoScale адам бейнесін робот саясатына ауыстыруға мүмкіндік береді. N1.7 бетіндегі сипаттама, процедурасы SO-100 нұсқаулығындағы N1.7.

Репозиторийде GA, модель картасында EA

Isaac-GR00T README N1.7-ні Жалпы қолжетімділік шығарылымы деп жариялайды, толық бенчмарктармен және қолдаумен. Оның Hugging Face картасы әлі жаңартылмаған: Model Version өрісі әлі де GR00T N1.7 EA деп жазылған. Репозиторий – жаңа құжат.

GR00T N1.5

Бірдей 3 B масштабы, Eagle 2 негізі, SigLip2 және T5, ағынды сәйкестендіру DiT басы. Ол сізде бар кеңейту үшін бар. Оны нашар әдепкі етіп көрсететін екі нәрсе бар: салмақтар NVIDIA's one-way non-commercial licence, және LeRobot-тың қазіргі шығарылымдары N1.5 қолдауын алып тастады. Қараңыз .

Pi0.5

Physical Intelligence компаниясының VLA, саясат түрі pi05. Мақалада PaliGemma-дан бастапқыда іске қосылған 2 B VLM және 300 M әрекет сарапшысы берілген, ол роботты 50 Hz жиілікте басқарады; LeRobot's pi05 config әдепкі бойынша 50-step chunk, сол жылдамдықта one second-қа орнатылған. Оның басты артықшылығы – бұрын-соңды болмаған жерлер: нақты үйлердегі шамамен 400 hours мобильді манипуляция және 3, 12, 22, 53, 82 және 104 locations бойынша масштабтау зерттеуі, мұнда 104-location model сынақ үйлерінде оқытылған басқарумен сәйкес келді.

Бір шектеу, көрсетілген lerobot/pi05_base картасында: порт тек ағынға сәйкес келетін әрекет басын ғана тасымалдайды. Қосалқы тапсырманы болжау, әрекетті токенизациялау және RL жоғары ағында шығарылмаған, және openpi өз репозиторийі туралы да солай дейді. Pi0.5 беті және SO-100-дегі Pi0.5 нұсқаулығы қалғанын қамтиды.

Түстен кейінгі уақытты жейтін тұзақ: қақпалы репозиторийлер

Pi0.5 қақпалы google/paligemma-3b-pt-224 токенизаторын қажет етеді (gated: manual, дегенмен Google сұраныстар дереу өңделеді дейді). Оны қабылдамай және оқыту ортасында hf auth login іске қоспай, жұмыс басталады, біраз жүктеледі, содан кейін желі ақауы сияқты көрінетін авторизация қатесінен тоқтап қалады. nvidia/GR00T-N1.7-3B қақпалы емес, бірақ оның nvidia/Cosmos-Reason2-2B негізі қақпалы (gated: auto). Кезекке қоймас бұрын екеуін де тазалаңыз; егер іске қосу бос тұрса, кезекте тұрып қалған бет нені тексеру керектігін көрсетеді.

SmolVLA

450 М параметр, шамамен 100 М әрекет сарапшысында, SmolVLM-2-де VLM қатырылған және тек оның алғашқы 16 тілдік модель қабаты қолданылған. Алдын ала оқыту қауымдастық деректері болды: 481 деректер жиынтығы, 10.6 М кадр, сіз қолданатын сол арзан қолдардан. Мұнда бір 24 ГБ картаға сыятын жалғыз VLA, және жалғыз 30 эпизод едені. Қараңыз SmolVLA бетін.

ACT

Негізгі модель емес. ALOHA-дан Action Chunking Transformer шамамен 80 М параметрді құрайды, ол әр тапсырма үшін нөлден бастап, 50 демонстрацияда 50 Гц жиілікпен оқытылған. Мақалада шамамен он минуттық демонстрациялардан алты нақты екі қолды тапсырмалар туралы хабарланады, ол бөлектелген мысалдарда 80-90 пайызды құрайды. Оның идеясы, әрекетті бөліктеу, осы беттегі әрбір модельде бар, және оның абляциясы әлі де әсерді ең жақсы өлшейді: уақытша ансамбльдеу өшірілген екі модельделген тапсырмада, сәттілік k=1 кезінде 1 пайыздан k=100 кезінде 44 пайызға дейін өседі. ACT бетінде қалғаны бар.

Бенчмарктар шын мәнінде не дейді

LIBERO - бұл бес модельдің үшеуі хабарлайтын бір бенчмарк: модельделген Franka Panda роботындағы тілге негізделген тапсырмалар, төмендегі төрт жиынтыққа бөлінген, әрқайсысында он тапсырма бар. NVIDIA әр жиынтық үшін 200 сынақ өткізді.

МодельКеңістіктікНысанМақсат10 (Ұзын)Орташа
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Бұл қатарлар қатаң түрде салыстырылмайды

Әрбір сан әртүрлі сынақ жиынтығы мен бюджеттен алынған. GR00T 20K қадамды 640 жаһандық пакетпен орындады; openpi көрсеткіші 30K бақылау нүктесі болып табылады; LeRobot порты LIBERO базалық моделіне 6K қадам қосты. SmolVLA одан әрі сәйкессіздік: оның мақаласы сол қатарды LIBERO-да нөлден бастап, VLA алдын ала оқытусыз оқытады, ал оның үстіндегі үшеуі алдын ала оқытылған бақылау нүктелерін дәлдейді. 96.85-тен 97.5-ке дейінгі мәндерді бір кластер ретінде қарастырыңыз, ал 87.3% дейінгі айырмашылықты нақты, бірақ 6.7 есе көп параметрлермен алынған деп есептеңіз.

SimplerEnv LIBERO көрсетпейтін таралуды көрсетеді. NVIDIA N1.7-ні N1.6-мен салыстырады, бұл ұрпақтық дельтаға ең жақын көпшілікке қолжетімді нәрсе.

SimplerEnv жиынтығыN1.6 орташаN1.7 орташаЕң жақсы ауытқуЕң нашар ауытқу
Bridge (WidowX), 7 тапсырма56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 тапсырма52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Bridge қатары пайдалы: орташа есеппен 5.7 ұпай жиналды, ал put_eggplant_in_basket 36 ұпай жоғалтты және put_eggplant_in_sink 33-тен 2-ге дейін төмендеді. Жаңа буын таратуды көтерудің орнына оны жылжытады, сондықтан егер сіздің тапсырмаңыз N1.7 регрессияға ұшыраған жерде болса, орташа көрсеткіш ештеңе айтпайды.

AY-Robots аренасының көшбасшылар тақтасы, 85 көру-тіл-әрекет модельдерінің және 332 бенчмарк нәтижелерінің сұрыпталатын кестесі, әрбір мән өзі шыққан мақалаға немесе модель картасына сілтеме жасайды.
Аренада 85 VLA моделі және 332 бенчмарк нәтижесі бар, олардың әрқайсысы өзінің мақаласына немесе модель картасына сілтеме жасайды. Блог жазбасында келтірілген санның шынайы екенін тексеру үшін пайдалы.

Бесеуінің ішінен тек SmolVLA мақаласы SO-100 кластық қолы туралы хабарлайды: SmolVLA үшін 78.3 пайыз және Pi0 үшін үш тапсырма бойынша 61.7, екеуі де көп тапсырмалы, ACT үшін 48.3-ке қарсы бір тапсырмалы оқытылған, бұл бірдей емес. Таза жұптастыру SO-101 pick-and-place бойынша екеуі де бір тапсырмалы: таратуда 90-ға қарсы 70, одан тыс 50-ге қарсы 40. Салыстырыңыз: ACT-ті SmolVLA-ға қарсы және Pi0.5-ті SmolVLA-ға қарсы, немесе аренаны шолыңыз.

Кідіріс пен құны орналастыруды шешеді

Инференс кідірісі - бұл адамдар ең соңында табатын және бірінші өкінетін шектеу. Бенчмаркта бес ұпайға жақсырақ, бірақ әрекет қадамына жарты секунд кететін саясат үстеліңізде нашар көрінеді: контакт динамикасы күтпейді.

Бір ескерту: GR00T көрсеткіші NVIDIA картасымен сәйкес келмейді, ол 4 шуды азайту қадамын және бір камераны H100-де eager режимінде 85.8 ms, torch.compile арқылы 48.6 ms, толық TensorRT арқылы 27.9 ms уақытпен өлшейді. Мұндағы 152 ms - бұл қызмет көрсету шығындарымен және бірнеше камерамен есептелген толық стек көрсеткіші, алға бағытталған өту емес.

Қашықтағы инференстің қатаң шегі бар

20-дан 485 ms-ге дейінгі цикл модельдікі, және оған жалпы интернеттің айналымдары қосылады. Қашықтағы инференс баяу таңдау-орналастыру үшін жарамды, жылдам реактивті қозғалыс үшін емес. Егер сіздің тапсырмаңыз жылдамдықты қажет етсе, инференс сервоприводтардың жанында орналасады: ACT немесе SmolVLA, жергілікті. Қатысты: саясат қозғалыс ортасында қатып қалады.

Модельді өзгертпей уақытты үнемдеудің бір жолы: SmolVLA мақаласы синхронды орындауды өлшейді, мұнда саясат келесіні болжаудан бұрын бір бөлікті аяқтайды, асинхронды орындауға қарсы, мұнда болжау орындаумен қабаттасады. Нәтиже ұқсас, 78.3-ке қарсы 73.3, бірақ бірдей таңдау-орналастыру 13.75 секунд орнына 9.7 секундты алады, және белгіленген уақыт аралығында робот 9 цикл орнына 19 циклді басқарады.

Лицензиялар, ешкім тексермейтіндіктен тексерілді

МодельСалмақ лицензиясыКод лицензиясыКоммерциялық пайдалану
GR00T N1.7NVIDIA Open Model License; карта коммерциялық пайдалануға рұқсат бередіApache 2.0иә
GR00T N1.5NVIDIA бір жақты коммерциялық емес лицензиясыApache 2.0жоқ
Pi0.5pi05_base картасының метадеректерінде license: gemma деп жазылғанApache 2.0 (openpi, LeRobot docs)екеуін де оқыңыз, олар келіспейді
SmolVLAsmolvla_base картасында лицензия өрісі жоқApache 2.0 (LeRobot)код иә, салмақтар көрсетілмеген
ACTнегізгі салмақтар жоқApache 2.0 (LeRobot)иә

Pi0.5 жолына мұқият болу керек. LeRobot pi05 құжаттамасы openpi-мен сәйкес Apache 2.0 деп көрсетеді, ал Hub картасы lerobot/pi05_base келесіні қамтиды: license: gemma. Екеуі де қолданыста. GR00T N1.7-де жеңілірек нұсқасы бар: Isaac-GR00T README-де N1.7 Apache 2.0 лицензиясы бойынша толық коммерциялық пайдалануға рұқсат етілген деп айтылған, ал оның жеке лицензия бөлімі мен модель картасы тек кодты Apache 2.0 лицензиясы бойынша, ал салмақтарды NVIDIA Open Model License лицензиясы бойынша орналастырады.

Сіз іс жүзінде іске қосатын әдепкі параметрлер

Әрбір тренажер формасы әдепкі мәнді жібереді, және олар ерікті емес. ACT-тікі LeRobot-тың өзінікі: batch 8, lr 1e-5, 100000 оқыту қадамдары, chunk size 100, ACTConfig upstream-ға сәйкес және k=100 ACT мақаласынан. Төмендегі бір баған – тұзақ.

СаясатПакетLRМакс қадамдарГрад жинақтауҚолданылады ма?Қосымша реттегіштер
GR00T N1.7321e-4200001иәsaveSteps
GR00T N1.511e-5200016иәsaveSteps
Pi0.515e-53000016жоқ (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008жоқseed, logFreq
ACT81e-51000001жоқchunkSize, nActionSteps, seed, logFreq
Қайталанғыштық, 2026 жылғы тамыз

GR00T-тың дәл баптау кіру нүктесі (launch_finetune.py, tyro CLI) өзінің конфигурациялық деректер класында seed өрісі жоқ, сондықтан іске қосулар бит-битпен қайталанбайды. Репозиторий сонымен қатар детерминистік емес кескін кеңейтулерінен іске қосулар арасында 5-тен 6 пайызға дейін ауытқу туралы ескертеді, бұл онлайн режимінде талқыланатын көптеген эталондық айырмашылықтардан үлкен. LeRobot-тың әдепкі seed мәні 1000. grad-accum бағаны lerobot 0.5.1 сипаттайды; upstream 0.6.2 оны --accelerator.gradient_accumulation.steps ретінде көрсетеді.

Модель таңдауынан да маңыздырақ реттегіш

Бұл әрекет бөлігі. Ұзағырақ бөліктер қозғалысты тегістейді және жинақталатын қателерді азайтады, бірақ блок орындалып жатқанда саясат бекітіледі, сондықтан ол қозғалатын кез келген нәрсеге кеш әрекет етеді: статикалық текшеде сенімді, домалап бара жатқанда үмітсіз. Егер ол артық кетсе, орындалған бөлікті қысқарту қайта оқытудан артық және тегін. Ерте тоқтайтын буын басқа мәселе; қараңыз .

  • ACT: ACTConfig әдепкі бойынша chunk_size 100 және n_action_steps 100 мәндерін қолданады. Уақытша ансамбль өшірулі және n_action_steps 1 қажет етеді.
  • GR00T N1.7: ішкі горизонт 16-дан 40-қа дейін өсті, бірақ LeRobot-тың SO-101 мысалы әлі де --policy.chunk_size=16 --policy.n_action_steps=16 арқылы жұмыс істейді. Rollout флагы --execution-horizon болып өзгертілді.
  • Pi0.5: 50 қадамдық бөлік, оның ішінде LeRobot-тың LIBERO рецепті --policy.n_action_steps=10 арқылы 10-ын орындайды; --policy.pretrained_path болса, егер сіз флагты қалдырсаңыз, ол 50-ге оралады.
  • SmolVLA: 50 әрекеттік бөліктер, екі реттегіш те қолжетімді.

Бесеуін бір түсте қалай тексеруге болады

Ең арзан жауап – көп оқу емес. Шамамен 15 USD жұмсаңыз және робот қолына айтқызыңыз: бір рет жазыңыз, алдымен арзан модельді үйретіңіз, деректердің дұрыстығы дәлелденгеннен кейін ғана күшейтіңіз. Құрылым көлемнен артық, бұл және .

  1. 1
    50 эпизодты бір рет жазыңыз

    Fifty GR00T, Pi0.5 және ACT, сондай-ақ SmolVLA-ның 30-ы үшін алаңды тазартады. Әрбір вариацияны жұқа таратпай қайталаңыз: 25-і орындалмаған 5 текше позициясы бойынша оқытылған 50 эпизод. Алғашқы деректер жинағыңызды жазыңыз бөлімін қараңыз.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Алдымен ACT-ті үйретіңіз, өйткені ол сізге өтірік айта алмайды

    Алдын ала оқытылған салмақтар жоқ, сондықтан егер ол тапсырманы орындайтын болса, деректер жинағыңызда тапсырма бар. Егер ACT тегіс болса, деректерді түзетіңіз. 1-ден 3 USD, 24 ГБ картада 2-ден 5 сағат.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA-ны бірдей деректер жинағында, өзгеріссіз іске қосыңыз

    Бірдей деректер, бірдей қол, 80 М орнына 450 М параметр, сонымен қатар тілдік шарттау. LeRobot бір A100-де шамамен 4 сағатта 20K қадамдық жұмысты орындайды. Бұл алдын ала оқытудың қандай да бір пайдасы бар-жоғын көрсетеді.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T-ке кіріспес бұрын v2.1 нұсқасына түрлендіріңіз

    GR00T LeRobot v2 форматының бір түрін, сонымен қатар қосымша meta/modality.json файлын оқиды, ол біріктірілген күй мен әрекет массивтерінің атаулы өрістерге қалай бөлінетінін көрсетеді. v3.0 деректер жинағы бұл жүктегішті істен шығарады, өйткені v3.0 көптеген эпизодтарды ортақ файлдарға жинайды, ал v2 әр эпизодқа бір файл жазды. Isaac-GR00T төмендету көмекшісін scripts/lerobot_conversion/convert_v3_to_v2.py ретінде жеткізеді; v3 қабылдамау беті жылдам жол болып табылады.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    GR00T N1.7-ге тек алғашқы екеуі бірдеңе қалдырған жағдайда ғана көтеріліңіз

    NVIDIA CLI арқылы, мұнда көрсетілгендей, немесе LeRobot-тың groot саясат түрі арқылы. NVIDIA дәл баптау үшін 40 ГБ немесе одан да көп VRAM, ал инференция үшін 16 ГБ ұсынады. OOM болған жағдайда, OOM бетін қараңыз.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Бұл скринингтік өтуді іске қосудың екі жолы

Үш орта, өйткені құралдар тізбегі бірге өмір сүрмейді. Негізгі LeRobot 0.6.2 нұсқасы және Python 3.12 немесе одан жаңа нұсқасын қажет етеді; Isaac-GR00T және openpi бөлек uv-басқарылатын репозиторийлер.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0 нұсқасын өзінің жалғыз бейне бэкэнды ретінде бекітеді, ол FFmpeg 4-тен 7-ге дейінгі нұсқаларды қажет етеді. FFmpeg 8 қолдау көрсетілмейді, AV1 кепілдендірілмейді.
  • openpi жады шектеулері: инференция 8 ГБ-тан жоғары, LoRA 22.5 ГБ-тан жоғары, толық дәл баптау 70 ГБ-тан жоғары. Соңғысы Pi0.5-тің A100 жұмысы болуының себебі.
  • GPU-ны өзіңіз жалға алыңыз, кейін жойыңыз, үш бақылау нүктесі жолын қолмен келістіріңіз.

Негізгі модель немесе нөлден бастап

Нақты таңдау 3 B моделін таңдау емес. Ол алдын ала оқытылған VLA-ны мүлдем қолдану-қолданбау, ескере отырып, ACT әрқайсысы он минутқа жуық демонстрациядан алты нақты бимануалды тапсырманы 80 М параметрмен үйренгенін және ешқандай алдын ала оқытусыз.

ACT-ті нөлден бастап оқытудың орнына алдын ала оқытылған VLA-ны дәлдеп баптау
Сіз не ұтасыз
  • Тілдік шарттау. ACT-те ондай жоқ; бір ACT бақылау нүктесі бір тапсырманы орындайды.
  • Демонстрацияларыңызда жоқ нысандарда жақсырақ: SO-101-де, ACT-тің таралудан тыс 40%-на қарсы 50%.
  • Жалпы көп тапсырмалы: SmolVLA бір бақылау нүктесімен үш SO-100 тапсырмасы бойынша 78.3% жетеді; ACT тек бір тапсырмалы режимде іске қосылды.
Сізге қанша шығын болады
  • 7.6x-тен 24x-ке дейін кідіріс: ACT-тің 20 мс-на қарсы әрекет қадамына 152-ден 485 мс-қа дейін.
  • 1-ден 3-тің орнына әр іске қосуға 4-тен 12 USD, және кез келген 24 ГБ картаның орнына A100 деңгейі.
  • Лицензиялық тәуекел, сонымен қатар нөлден бастап болмайтын, шектеулі репозиторийдің істен шығу режимі.
  • Алдын ала оқытылған салмақтар нашар деректер жиынтығын жасыруы мүмкін. Бұзылған деректерде жартылай жұмыс істейтін дәлдеп баптау деректерді қарамас бұрын бір апта уақытты қажет етеді.

Ескі іске қосуды қайталау жағдайы

2025 жылғы бақылау нүктесін іздеу модель таңдауын сіз үшін жасайды және мәселені нұсқаны бекітуге айналдырады: ағымдағы LeRobot N1.5-ті қабылдамайды, сондықтан сіз бекітесіз lerobot==0.5.1. Тұқым өрісі жоқ және іске қосулар арасында 5-тен 6 пайызға дейін ауытқу болғандықтан, қайталау құрылымы бойынша шамалы болады. және платформалық жағын қамтиды.

AY-Robots компаниясының GR00T N1.7 мен Pi0.5-ті бетпе-бет салыстыру беті, параметрлер санын, GPU талаптарын, инференс кідірісін, деректер жиынтығының форматын және минималды эпизод санын қатар көрсетеді
Бетпе-бет салыстыру /compare/groot-n1-7-vs-pi0-5. Екі 3 B моделі сипаттамалар парағында өзара алмастырылатын болып көрінеді, бірақ олай емес: біреуі LeRobot v2.1-ді қажет етеді, екіншісі v3.0-ді қажет етеді.

Екіге дейін қысқарды ма? ACT GR00T N1.7-ге қарсы және GR00T N1.7 SmolVLA-ға қарсы. Арена жазбаларындағы бастапқы жолдар: GR00T N1.7, Pi0.5, SmolVLA және ACT.

Бұл платформа сізге қай жерде көмеспейді

  • Ол қашықтағы инференсті жылдамдата алмайды. 20-дан 485 мс-қа дейінгі цикл модельге тиесілі; интернеттегі айналымдар оған қосылады.
  • Ол GR00T немесе Pi0.5-ті өз жабдығыңызда дәл баптай алмайды. Екеуі де мұнда тек бұлтта жұмыс істейді; тек SmolVLA мен ACT жергілікті жерде іске қосылады.
  • Ол деректер жинағын түзете алмайды. Жоғалту азаяды, бірақ саясат ештеңе істемейді – деректер мәселесі, тек бір конфигурацияда жұмыс істейтін саясат – қамту мәселесі.
  • Ол GR00T іске қосуларын қайталанатын ете алмайды: жоғарғы ағындағы конфигурацияда seed өрісі жоқ.

85 модель, 332 бенчмарк нәтижесі, әрбір сан өзінің дереккөзіне сілтемеленген

Бұл беттегі кестелердің сұрыпталатын нұсқасы: 85 көру-тіл-әрекет модельдері, 332 бенчмарк нәтижелері, әрқайсысы өзінің мақаласына немесе модель картасына сілтемеленген.

Аренаны ашу

Біреуін таңдап, әрі қарай жалғастыру

Бір әдепкі: 50 эпизодты жазып алу, деректер жинағын дәлелдеу үшін ACT-ті 1-ден 3 USD-ға дейін оқыту, содан кейін SmolVLA-ны бірдей деректерде. Жалпы 6 USD-дан аз, және олар маңызды сұраққа жауап береді: алдын ала оқыту мұнда көмектесе ме, әлде тар мойын деректерде ме. Байланысқа бай көп қадамды тапсырмалар үшін GR00T N1.7-ге, ал көрініс өзгерген кезде Pi0.5-ке көтеріліңіз.

Платформаға шолу: алғашқы саясатыңызды үйретіңіз, содан кейін алғашқы саясатыңызды іске қосыңыз. оқыту құжаттары және деректер жинағы құжаттары нысаны мен форматын қамтиды; SO-100 беті және толық SO-100 нұсқаулығы құрастыру мен калибрлеуді қамтиды. Анықтама: VLA шолуы және Pi0 ағынға сәйкестендіру мақаласы. Сіздің сәттілік деңгейіңізді арттыратын нәрсе – деректер сапасы бойынша нұсқаулық.

SO-100-де алдымен қай VLA саясатын үйретуім керек?

ACT, содан кейін SmolVLA. ACT нөлден бастап үйретеді, сондықтан ол нашар деректер жиынтығын жасыра алмайды, және бір іске қосу 24 GB картада 1 to 3 USD тұрады. Егер ACT тапсырманы орындай алса, GR00T N1.7 немесе Pi0.5 іске қосу үшін 4 to 12 USD босқа кетпейді.

GR00T N1.7 шынымен Pi0.5-тен жақсы ма?

LIBERO-да олар шу деңгейінде: GR00T N1.7 үшін төрт жиынтықта 97.0%, openpi-де 30k қадамда Pi0.5 үшін 96.85%, LeRobot порты үшін 97.5%, барлығы әртүрлі жүйелерден. Нақты айырмашылықтар 152 ms әрекет қадамына қарсы 485 ms, v2.1 деректер жиынтығына қарсы v3.0, және эталондық дәлдікке қарсы ашық әлемдік жалпылау.

Осылардың кез келгенін бір RTX 4090-да дәл баптай аламын ба?

SmolVLA және ACT, иә; екеуі де RTX 4090 немесе кез келген 24 GB карта үшін көрсетілген және жергілікті жерде жұмыс істейді. GR00T N1.7, N1.5 және Pi0.5 үшін A100 немесе H100 80 GB қажет және мұнда тек бұлтта жұмыс істейді. NVIDIA GR00T дәл баптау үшін 40 GB немесе одан да көп ұсынады; openpi-дің ең төменгі шегі толық Pi0.5 дәл баптау үшін 70 GB-тан жоғары, LoRA үшін 22.5 GB.

Осы бесеуінің қайсысын коммерциялық мақсатта қолдана аламын?

GR00T N1.7 салмақтары NVIDIA Open Model License Agreement лицензиясы бойынша, ол картада коммерциялық қолдануды қамтиды деп көрсетілген. N1.5 салмақтары коммерциялық емес. SmolVLA коды LeRobot-та Apache 2.0, бірақ lerobot/smolvla_base картасында лицензия өрісі жоқ, сондықтан салмақтары көрсетілмеген. ACT-тің лицензияланатын негізгі салмақтары жоқ. Pi0.5 екіұшты: LeRobot құжаттамасында Apache 2.0 делінген, оның карта метадеректерінде license: gemma деп жазылған.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started