
GR00T N1.7, Pi0.5, SmolVLA, ACT немесе GR00T N1.5? Нақты жағдайларға сәйкестендірілген шешім кестесі, жарияланған бенчмарк көрсеткіштерімен, кешігуімен, бір іске қосу құнымен және әр таңдаудың артындағы лицензияларымен.
Бүгінде SO-100 кластық қолда бес саясатты үйретуге болады. Олар инференцияда 24 есе айырмашылық жасайды кешігу, параметрлер санында 37 және бір іске қосу құнында 12 есе, сондай-ақ нәтижені жеткізуге болатындығында. Бес модель картасы оны шешпейді: ешқайсысы сіздің сұрағыңызға жауап бермейді, мен қайсысын бірінші іске қосамын?
Төмендегі әрбір сан 2026 жылдың тамызындағы құжаттардан, репозиторийлерден және карталардан оқылды. Платформа нөмірлері мына жерден алынған AY-Robots саясат каталогы; егер екеуі келіспесе, екеуі де көрсетіледі.
Қысқа нұсқасы
- •Егер деректер жинағыңызға күмәндансаңыз, алдымен ACT-ті үйретіңіз: бір іске қосу 1-ден 3 USD, нашар деректерді жабу үшін алдын ала үйретілген ештеңе жоқ.
- •GR00T N1.7 және Pi0.5 LIBERO-да жарты ұпай ішінде орналасқан, 97.0 қарсы 96.85-тен 97.5-ке дейін. Бұл екеуін де таңдауға себеп емес.
- •Pi0.5 – дәлдікке емес, жалпылауға арналған, және 485 мс-пен ең баяу.
- •SmolVLA, 450 M параметрлерімен, мұнда бір 24 ГБ картада дәл баптайтын жалғыз VLA болып табылады.
- •20 мс ACT жылдам реактивті қозғалыс үшін жалғыз нұсқа. Қалғанын лицензиялар шешеді.
Шешім кестесі
| Сіздің жағдайыңыз | Мұны үйретіңіз | Неліктен |
|---|---|---|
| Деректер жинағының сапасы дәлелденбеген | ACT | Алдын ала оқытылған ештеңе бұзылған деректер жинағын жасырмайды, ал сәтсіздік 1-ден 3 USD-ға дейін тұрады. |
| Байланысқа бай, көп қадамды, тілмен шартталған | GR00T N1.7 | Төрт LIBERO жиынтығы бойынша 97.0%, сонымен қатар салыстырмалы соңғы эффектілі әрекет кеңістігі. |
| Жылдам реактивті қозғалыс, сервоприводтардағы қорытынды | ACT | 20 ms. Келесі ең жылдам 7.6 есе баяу. |
| Жаңа нысандар, жаңа көрініс, ашық әлем | Pi0.5 | 104 орынға дейін таралудан тыс мінез-құлыққа арналған. |
| Бір 24 GB карта, әлі де тіл қажет | SmolVLA | 450 M параметр, 30 эпизодтық шек, жергілікті жерде жұмыс істейді. |
| 2025 жылы жазылған іске қосуды қайталау | GR00T N1.5 | Тек қажет болса: LeRobot қазір оны қабылдамайды, салмақтары коммерциялық емес. |
| Бұл өнім ретінде жеткізіледі | N1.7, SmolVLA or ACT | N1.5 коммерциялық емес, Pi0.5 Gemma шарттарын қамтиды, SmolVLA картасында ештеңе көрсетілмеген. |
Бес үміткер
Барлығы бесеуі де саясаттары: камера кадрлары, буын позициялары және, олардың төртеуі үшін, болашақ буын нысаналарының бөлігіне сәйкестендірілген тілдік нұсқау. Оларды бөлетін нәрсе – сіз келгенге дейін қаншалықты үйретілгені.
| Саясат | Параметрлер | Кідіріс | GPU деңгейі | Жергілікті ме? | Мин. эпизодтар | Пішім | Құны |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | иә | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | иә | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | жоқ | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | жоқ | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | жоқ | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-ның қазіргі көру-тіл-әрекет моделі, шамамен 3 миллиард параметр, шамамен 40 миллионы жетілдіру кезінде оқытылған. Репозиторий N1.6-дан айырмашылықтарды көрсетеді: Eagle моделінен Cosmos-Reason2-2B-ге Qwen3-VL-дегі негізгі құрылым, диффузиялық қабаттар 32-ден 16-ға, күй және әрекет өлшемдері 29-дан 132-ге, әрекет көкжиегі 16-дан 40-қа дейін.
Шағын қолда маңыздысы – салыстырмалы соңғы эффектінің әрекет кеңістігі: N1.7 ағымдағы қалыптан айырмашылықтарды болжайды, бұл 20 мың сағаттық EgoScale адам бейнесін робот саясатына ауыстыруға мүмкіндік береді. N1.7 бетіндегі сипаттама, процедурасы SO-100 нұсқаулығындағы N1.7.
Isaac-GR00T README N1.7-ні Жалпы қолжетімділік шығарылымы деп жариялайды, толық бенчмарктармен және қолдаумен. Оның Hugging Face картасы әлі жаңартылмаған: Model Version өрісі әлі де GR00T N1.7 EA деп жазылған. Репозиторий – жаңа құжат.
GR00T N1.5
Бірдей 3 B масштабы, Eagle 2 негізі, SigLip2 және T5, ағынды сәйкестендіру DiT басы. Ол сізде бар кеңейту үшін бар. Оны нашар әдепкі етіп көрсететін екі нәрсе бар: салмақтар NVIDIA's one-way non-commercial licence, және LeRobot-тың қазіргі шығарылымдары N1.5 қолдауын алып тастады. Қараңыз .
Pi0.5
Physical Intelligence компаниясының VLA, саясат түрі pi05. Мақалада PaliGemma-дан бастапқыда іске қосылған 2 B VLM және 300 M әрекет сарапшысы берілген, ол роботты 50 Hz жиілікте басқарады; LeRobot's pi05 config әдепкі бойынша 50-step chunk, сол жылдамдықта one second-қа орнатылған. Оның басты артықшылығы – бұрын-соңды болмаған жерлер: нақты үйлердегі шамамен 400 hours мобильді манипуляция және 3, 12, 22, 53, 82 және 104 locations бойынша масштабтау зерттеуі, мұнда 104-location model сынақ үйлерінде оқытылған басқарумен сәйкес келді.
Бір шектеу, көрсетілген lerobot/pi05_base картасында: порт тек ағынға сәйкес келетін әрекет басын ғана тасымалдайды. Қосалқы тапсырманы болжау, әрекетті токенизациялау және RL жоғары ағында шығарылмаған, және openpi өз репозиторийі туралы да солай дейді. Pi0.5 беті және SO-100-дегі Pi0.5 нұсқаулығы қалғанын қамтиды.
Pi0.5 қақпалы google/paligemma-3b-pt-224 токенизаторын қажет етеді (gated: manual, дегенмен Google сұраныстар дереу өңделеді дейді). Оны қабылдамай және оқыту ортасында hf auth login іске қоспай, жұмыс басталады, біраз жүктеледі, содан кейін желі ақауы сияқты көрінетін авторизация қатесінен тоқтап қалады. nvidia/GR00T-N1.7-3B қақпалы емес, бірақ оның nvidia/Cosmos-Reason2-2B негізі қақпалы (gated: auto). Кезекке қоймас бұрын екеуін де тазалаңыз; егер іске қосу бос тұрса, кезекте тұрып қалған бет нені тексеру керектігін көрсетеді.
SmolVLA
450 М параметр, шамамен 100 М әрекет сарапшысында, SmolVLM-2-де VLM қатырылған және тек оның алғашқы 16 тілдік модель қабаты қолданылған. Алдын ала оқыту қауымдастық деректері болды: 481 деректер жиынтығы, 10.6 М кадр, сіз қолданатын сол арзан қолдардан. Мұнда бір 24 ГБ картаға сыятын жалғыз VLA, және жалғыз 30 эпизод едені. Қараңыз SmolVLA бетін.
ACT
Негізгі модель емес. ALOHA-дан Action Chunking Transformer шамамен 80 М параметрді құрайды, ол әр тапсырма үшін нөлден бастап, 50 демонстрацияда 50 Гц жиілікпен оқытылған. Мақалада шамамен он минуттық демонстрациялардан алты нақты екі қолды тапсырмалар туралы хабарланады, ол бөлектелген мысалдарда 80-90 пайызды құрайды. Оның идеясы, әрекетті бөліктеу, осы беттегі әрбір модельде бар, және оның абляциясы әлі де әсерді ең жақсы өлшейді: уақытша ансамбльдеу өшірілген екі модельделген тапсырмада, сәттілік k=1 кезінде 1 пайыздан k=100 кезінде 44 пайызға дейін өседі. ACT бетінде қалғаны бар.
Бенчмарктар шын мәнінде не дейді
LIBERO - бұл бес модельдің үшеуі хабарлайтын бір бенчмарк: модельделген Franka Panda роботындағы тілге негізделген тапсырмалар, төмендегі төрт жиынтыққа бөлінген, әрқайсысында он тапсырма бар. NVIDIA әр жиынтық үшін 200 сынақ өткізді.
| Модель | Кеңістіктік | Нысан | Мақсат | 10 (Ұзын) | Орташа |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Әрбір сан әртүрлі сынақ жиынтығы мен бюджеттен алынған. GR00T 20K қадамды 640 жаһандық пакетпен орындады; openpi көрсеткіші 30K бақылау нүктесі болып табылады; LeRobot порты LIBERO базалық моделіне 6K қадам қосты. SmolVLA одан әрі сәйкессіздік: оның мақаласы сол қатарды LIBERO-да нөлден бастап, VLA алдын ала оқытусыз оқытады, ал оның үстіндегі үшеуі алдын ала оқытылған бақылау нүктелерін дәлдейді. 96.85-тен 97.5-ке дейінгі мәндерді бір кластер ретінде қарастырыңыз, ал 87.3% дейінгі айырмашылықты нақты, бірақ 6.7 есе көп параметрлермен алынған деп есептеңіз.
SimplerEnv LIBERO көрсетпейтін таралуды көрсетеді. NVIDIA N1.7-ні N1.6-мен салыстырады, бұл ұрпақтық дельтаға ең жақын көпшілікке қолжетімді нәрсе.
| SimplerEnv жиынтығы | N1.6 орташа | N1.7 орташа | Ең жақсы ауытқу | Ең нашар ауытқу |
|---|---|---|---|---|
| Bridge (WidowX), 7 тапсырма | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 тапсырма | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Bridge қатары пайдалы: орташа есеппен 5.7 ұпай жиналды, ал put_eggplant_in_basket 36 ұпай жоғалтты және put_eggplant_in_sink 33-тен 2-ге дейін төмендеді. Жаңа буын таратуды көтерудің орнына оны жылжытады, сондықтан егер сіздің тапсырмаңыз N1.7 регрессияға ұшыраған жерде болса, орташа көрсеткіш ештеңе айтпайды.

Бесеуінің ішінен тек SmolVLA мақаласы SO-100 кластық қолы туралы хабарлайды: SmolVLA үшін 78.3 пайыз және Pi0 үшін үш тапсырма бойынша 61.7, екеуі де көп тапсырмалы, ACT үшін 48.3-ке қарсы бір тапсырмалы оқытылған, бұл бірдей емес. Таза жұптастыру SO-101 pick-and-place бойынша екеуі де бір тапсырмалы: таратуда 90-ға қарсы 70, одан тыс 50-ге қарсы 40. Салыстырыңыз: ACT-ті SmolVLA-ға қарсы және Pi0.5-ті SmolVLA-ға қарсы, немесе аренаны шолыңыз.
Кідіріс пен құны орналастыруды шешеді
Инференс кідірісі - бұл адамдар ең соңында табатын және бірінші өкінетін шектеу. Бенчмаркта бес ұпайға жақсырақ, бірақ әрекет қадамына жарты секунд кететін саясат үстеліңізде нашар көрінеді: контакт динамикасы күтпейді.
Бір ескерту: GR00T көрсеткіші NVIDIA картасымен сәйкес келмейді, ол 4 шуды азайту қадамын және бір камераны H100-де eager режимінде 85.8 ms, torch.compile арқылы 48.6 ms, толық TensorRT арқылы 27.9 ms уақытпен өлшейді. Мұндағы 152 ms - бұл қызмет көрсету шығындарымен және бірнеше камерамен есептелген толық стек көрсеткіші, алға бағытталған өту емес.
20-дан 485 ms-ге дейінгі цикл модельдікі, және оған жалпы интернеттің айналымдары қосылады. Қашықтағы инференс баяу таңдау-орналастыру үшін жарамды, жылдам реактивті қозғалыс үшін емес. Егер сіздің тапсырмаңыз жылдамдықты қажет етсе, инференс сервоприводтардың жанында орналасады: ACT немесе SmolVLA, жергілікті. Қатысты: саясат қозғалыс ортасында қатып қалады.
Модельді өзгертпей уақытты үнемдеудің бір жолы: SmolVLA мақаласы синхронды орындауды өлшейді, мұнда саясат келесіні болжаудан бұрын бір бөлікті аяқтайды, асинхронды орындауға қарсы, мұнда болжау орындаумен қабаттасады. Нәтиже ұқсас, 78.3-ке қарсы 73.3, бірақ бірдей таңдау-орналастыру 13.75 секунд орнына 9.7 секундты алады, және белгіленген уақыт аралығында робот 9 цикл орнына 19 циклді басқарады.
Лицензиялар, ешкім тексермейтіндіктен тексерілді
| Модель | Салмақ лицензиясы | Код лицензиясы | Коммерциялық пайдалану |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; карта коммерциялық пайдалануға рұқсат береді | Apache 2.0 | иә |
| GR00T N1.5 | NVIDIA бір жақты коммерциялық емес лицензиясы | Apache 2.0 | жоқ |
| Pi0.5 | pi05_base картасының метадеректерінде license: gemma деп жазылған | Apache 2.0 (openpi, LeRobot docs) | екеуін де оқыңыз, олар келіспейді |
| SmolVLA | smolvla_base картасында лицензия өрісі жоқ | Apache 2.0 (LeRobot) | код иә, салмақтар көрсетілмеген |
| ACT | негізгі салмақтар жоқ | Apache 2.0 (LeRobot) | иә |
Pi0.5 жолына мұқият болу керек. LeRobot pi05 құжаттамасы openpi-мен сәйкес Apache 2.0 деп көрсетеді, ал Hub картасы lerobot/pi05_base келесіні қамтиды: license: gemma. Екеуі де қолданыста. GR00T N1.7-де жеңілірек нұсқасы бар: Isaac-GR00T README-де N1.7 Apache 2.0 лицензиясы бойынша толық коммерциялық пайдалануға рұқсат етілген деп айтылған, ал оның жеке лицензия бөлімі мен модель картасы тек кодты Apache 2.0 лицензиясы бойынша, ал салмақтарды NVIDIA Open Model License лицензиясы бойынша орналастырады.
Сіз іс жүзінде іске қосатын әдепкі параметрлер
Әрбір тренажер формасы әдепкі мәнді жібереді, және олар ерікті емес. ACT-тікі LeRobot-тың өзінікі: batch 8, lr 1e-5, 100000 оқыту қадамдары, chunk size 100, ACTConfig upstream-ға сәйкес және k=100 ACT мақаласынан. Төмендегі бір баған – тұзақ.
| Саясат | Пакет | LR | Макс қадамдар | Град жинақтау | Қолданылады ма? | Қосымша реттегіштер |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | иә | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | иә | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | жоқ (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | жоқ | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | жоқ | chunkSize, nActionSteps, seed, logFreq |
GR00T-тың дәл баптау кіру нүктесі (launch_finetune.py, tyro CLI) өзінің конфигурациялық деректер класында seed өрісі жоқ, сондықтан іске қосулар бит-битпен қайталанбайды. Репозиторий сонымен қатар детерминистік емес кескін кеңейтулерінен іске қосулар арасында 5-тен 6 пайызға дейін ауытқу туралы ескертеді, бұл онлайн режимінде талқыланатын көптеген эталондық айырмашылықтардан үлкен. LeRobot-тың әдепкі seed мәні 1000. grad-accum бағаны lerobot 0.5.1 сипаттайды; upstream 0.6.2 оны --accelerator.gradient_accumulation.steps ретінде көрсетеді.
Модель таңдауынан да маңыздырақ реттегіш
Бұл әрекет бөлігі. Ұзағырақ бөліктер қозғалысты тегістейді және жинақталатын қателерді азайтады, бірақ блок орындалып жатқанда саясат бекітіледі, сондықтан ол қозғалатын кез келген нәрсеге кеш әрекет етеді: статикалық текшеде сенімді, домалап бара жатқанда үмітсіз. Егер ол артық кетсе, орындалған бөлікті қысқарту қайта оқытудан артық және тегін. Ерте тоқтайтын буын басқа мәселе; қараңыз .
- ACT: ACTConfig әдепкі бойынша
chunk_size 100жәнеn_action_steps 100мәндерін қолданады. Уақытша ансамбль өшірулі жәнеn_action_steps 1қажет етеді. - GR00T N1.7: ішкі горизонт 16-дан 40-қа дейін өсті, бірақ LeRobot-тың SO-101 мысалы әлі де
--policy.chunk_size=16 --policy.n_action_steps=16арқылы жұмыс істейді. Rollout флагы--execution-horizonболып өзгертілді. - Pi0.5: 50 қадамдық бөлік, оның ішінде LeRobot-тың LIBERO рецепті
--policy.n_action_steps=10арқылы 10-ын орындайды;--policy.pretrained_pathболса, егер сіз флагты қалдырсаңыз, ол 50-ге оралады. - SmolVLA: 50 әрекеттік бөліктер, екі реттегіш те қолжетімді.
Бесеуін бір түсте қалай тексеруге болады
Ең арзан жауап – көп оқу емес. Шамамен 15 USD жұмсаңыз және робот қолына айтқызыңыз: бір рет жазыңыз, алдымен арзан модельді үйретіңіз, деректердің дұрыстығы дәлелденгеннен кейін ғана күшейтіңіз. Құрылым көлемнен артық, бұл және .
- 150 эпизодты бір рет жазыңыз
Fifty GR00T, Pi0.5 және ACT, сондай-ақ SmolVLA-ның 30-ы үшін алаңды тазартады. Әрбір вариацияны жұқа таратпай қайталаңыз: 25-і орындалмаған 5 текше позициясы бойынша оқытылған 50 эпизод. Алғашқы деректер жинағыңызды жазыңыз бөлімін қараңыз.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Алдымен ACT-ті үйретіңіз, өйткені ол сізге өтірік айта алмайды
Алдын ала оқытылған салмақтар жоқ, сондықтан егер ол тапсырманы орындайтын болса, деректер жинағыңызда тапсырма бар. Егер ACT тегіс болса, деректерді түзетіңіз. 1-ден 3 USD, 24 ГБ картада 2-ден 5 сағат.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA-ны бірдей деректер жинағында, өзгеріссіз іске қосыңыз
Бірдей деректер, бірдей қол, 80 М орнына 450 М параметр, сонымен қатар тілдік шарттау. LeRobot бір A100-де шамамен 4 сағатта 20K қадамдық жұмысты орындайды. Бұл алдын ала оқытудың қандай да бір пайдасы бар-жоғын көрсетеді.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T-ке кіріспес бұрын v2.1 нұсқасына түрлендіріңіз
GR00T LeRobot v2 форматының бір түрін, сонымен қатар қосымша
meta/modality.jsonфайлын оқиды, ол біріктірілген күй мен әрекет массивтерінің атаулы өрістерге қалай бөлінетінін көрсетеді. v3.0 деректер жинағы бұл жүктегішті істен шығарады, өйткені v3.0 көптеген эпизодтарды ортақ файлдарға жинайды, ал v2 әр эпизодқа бір файл жазды. Isaac-GR00T төмендету көмекшісінscripts/lerobot_conversion/convert_v3_to_v2.pyретінде жеткізеді; v3 қабылдамау беті жылдам жол болып табылады.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5GR00T N1.7-ге тек алғашқы екеуі бірдеңе қалдырған жағдайда ғана көтеріліңіз
NVIDIA CLI арқылы, мұнда көрсетілгендей, немесе LeRobot-тың
grootсаясат түрі арқылы. NVIDIA дәл баптау үшін 40 ГБ немесе одан да көп VRAM, ал инференция үшін 16 ГБ ұсынады. OOM болған жағдайда, OOM бетін қараңыз.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Бұл скринингтік өтуді іске қосудың екі жолы
Үш орта, өйткені құралдар тізбегі бірге өмір сүрмейді. Негізгі LeRobot 0.6.2 нұсқасы және Python 3.12 немесе одан жаңа нұсқасын қажет етеді; Isaac-GR00T және openpi бөлек uv-басқарылатын репозиторийлер.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 нұсқасын өзінің жалғыз бейне бэкэнды ретінде бекітеді, ол FFmpeg 4-тен 7-ге дейінгі нұсқаларды қажет етеді. FFmpeg 8 қолдау көрсетілмейді, AV1 кепілдендірілмейді. - openpi жады шектеулері: инференция 8 ГБ-тан жоғары, LoRA 22.5 ГБ-тан жоғары, толық дәл баптау 70 ГБ-тан жоғары. Соңғысы Pi0.5-тің A100 жұмысы болуының себебі.
- GPU-ны өзіңіз жалға алыңыз, кейін жойыңыз, үш бақылау нүктесі жолын қолмен келістіріңіз.
Бірдей бес модель, бір форма. Модельді, деректер жинағын және гиперпараметрлерді таңдаңыз; бэкэнд қажетті VRAM мөлшеріне сәйкес GPU жалға алады, тренажерді іске қосады және бақылау нүктелерін объектілік сақтау қоймасына жазады.
- Оқыту матрицасы бес модельден және төрт қолдан тұрады, әр ұяшық нұсқаулық болып табылады: SO-100-дегі SmolVLA, SO-101-дегі ACT.
- Инференция подтары
/api/inference/podарқылы бос тұрған бақылаушымен автоматты түрде қамтамасыз етіледі, сондықтан ұмытылған под үнсіз есептелмейді. - Негізгі бақылау нүктелері сатушылардың өзінікі:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT-те жоқ. - CLI және AI агенттерінен MCP сервері арқылы бірдей операциялар.
- Жабдық жоқ па? Тікелей қол тіркелусіз физикалық SO-100-ді ағынмен жібереді; әрекет ету беті кіру жолдарын көрсетеді.
Негізгі модель немесе нөлден бастап
Нақты таңдау 3 B моделін таңдау емес. Ол алдын ала оқытылған VLA-ны мүлдем қолдану-қолданбау, ескере отырып, ACT әрқайсысы он минутқа жуық демонстрациядан алты нақты бимануалды тапсырманы 80 М параметрмен үйренгенін және ешқандай алдын ала оқытусыз.
- Тілдік шарттау. ACT-те ондай жоқ; бір ACT бақылау нүктесі бір тапсырманы орындайды.
- Демонстрацияларыңызда жоқ нысандарда жақсырақ: SO-101-де, ACT-тің таралудан тыс 40%-на қарсы 50%.
- Жалпы көп тапсырмалы: SmolVLA бір бақылау нүктесімен үш SO-100 тапсырмасы бойынша 78.3% жетеді; ACT тек бір тапсырмалы режимде іске қосылды.
- 7.6x-тен 24x-ке дейін кідіріс: ACT-тің 20 мс-на қарсы әрекет қадамына 152-ден 485 мс-қа дейін.
- 1-ден 3-тің орнына әр іске қосуға 4-тен 12 USD, және кез келген 24 ГБ картаның орнына A100 деңгейі.
- Лицензиялық тәуекел, сонымен қатар нөлден бастап болмайтын, шектеулі репозиторийдің істен шығу режимі.
- Алдын ала оқытылған салмақтар нашар деректер жиынтығын жасыруы мүмкін. Бұзылған деректерде жартылай жұмыс істейтін дәлдеп баптау деректерді қарамас бұрын бір апта уақытты қажет етеді.
Ескі іске қосуды қайталау жағдайы
2025 жылғы бақылау нүктесін іздеу модель таңдауын сіз үшін жасайды және мәселені нұсқаны бекітуге айналдырады: ағымдағы LeRobot N1.5-ті қабылдамайды, сондықтан сіз бекітесіз lerobot==0.5.1. Тұқым өрісі жоқ және іске қосулар арасында 5-тен 6 пайызға дейін ауытқу болғандықтан, қайталау құрылымы бойынша шамалы болады. және платформалық жағын қамтиды.

Екіге дейін қысқарды ма? ACT GR00T N1.7-ге қарсы және GR00T N1.7 SmolVLA-ға қарсы. Арена жазбаларындағы бастапқы жолдар: GR00T N1.7, Pi0.5, SmolVLA және ACT.
Бұл платформа сізге қай жерде көмеспейді
- Ол қашықтағы инференсті жылдамдата алмайды. 20-дан 485 мс-қа дейінгі цикл модельге тиесілі; интернеттегі айналымдар оған қосылады.
- Ол GR00T немесе Pi0.5-ті өз жабдығыңызда дәл баптай алмайды. Екеуі де мұнда тек бұлтта жұмыс істейді; тек SmolVLA мен ACT жергілікті жерде іске қосылады.
- Ол деректер жинағын түзете алмайды. Жоғалту азаяды, бірақ саясат ештеңе істемейді – деректер мәселесі, тек бір конфигурацияда жұмыс істейтін саясат – қамту мәселесі.
- Ол GR00T іске қосуларын қайталанатын ете алмайды: жоғарғы ағындағы конфигурацияда seed өрісі жоқ.
85 модель, 332 бенчмарк нәтижесі, әрбір сан өзінің дереккөзіне сілтемеленген
Бұл беттегі кестелердің сұрыпталатын нұсқасы: 85 көру-тіл-әрекет модельдері, 332 бенчмарк нәтижелері, әрқайсысы өзінің мақаласына немесе модель картасына сілтемеленген.
Аренаны ашуБіреуін таңдап, әрі қарай жалғастыру
Бір әдепкі: 50 эпизодты жазып алу, деректер жинағын дәлелдеу үшін ACT-ті 1-ден 3 USD-ға дейін оқыту, содан кейін SmolVLA-ны бірдей деректерде. Жалпы 6 USD-дан аз, және олар маңызды сұраққа жауап береді: алдын ала оқыту мұнда көмектесе ме, әлде тар мойын деректерде ме. Байланысқа бай көп қадамды тапсырмалар үшін GR00T N1.7-ге, ал көрініс өзгерген кезде Pi0.5-ке көтеріліңіз.
Платформаға шолу: алғашқы саясатыңызды үйретіңіз, содан кейін алғашқы саясатыңызды іске қосыңыз. оқыту құжаттары және деректер жинағы құжаттары нысаны мен форматын қамтиды; SO-100 беті және толық SO-100 нұсқаулығы құрастыру мен калибрлеуді қамтиды. Анықтама: VLA шолуы және Pi0 ағынға сәйкестендіру мақаласы. Сіздің сәттілік деңгейіңізді арттыратын нәрсе – деректер сапасы бойынша нұсқаулық.
SO-100-де алдымен қай VLA саясатын үйретуім керек?▾
ACT, содан кейін SmolVLA. ACT нөлден бастап үйретеді, сондықтан ол нашар деректер жиынтығын жасыра алмайды, және бір іске қосу 24 GB картада 1 to 3 USD тұрады. Егер ACT тапсырманы орындай алса, GR00T N1.7 немесе Pi0.5 іске қосу үшін 4 to 12 USD босқа кетпейді.
GR00T N1.7 шынымен Pi0.5-тен жақсы ма?▾
LIBERO-да олар шу деңгейінде: GR00T N1.7 үшін төрт жиынтықта 97.0%, openpi-де 30k қадамда Pi0.5 үшін 96.85%, LeRobot порты үшін 97.5%, барлығы әртүрлі жүйелерден. Нақты айырмашылықтар 152 ms әрекет қадамына қарсы 485 ms, v2.1 деректер жиынтығына қарсы v3.0, және эталондық дәлдікке қарсы ашық әлемдік жалпылау.
Осылардың кез келгенін бір RTX 4090-да дәл баптай аламын ба?▾
SmolVLA және ACT, иә; екеуі де RTX 4090 немесе кез келген 24 GB карта үшін көрсетілген және жергілікті жерде жұмыс істейді. GR00T N1.7, N1.5 және Pi0.5 үшін A100 немесе H100 80 GB қажет және мұнда тек бұлтта жұмыс істейді. NVIDIA GR00T дәл баптау үшін 40 GB немесе одан да көп ұсынады; openpi-дің ең төменгі шегі толық Pi0.5 дәл баптау үшін 70 GB-тан жоғары, LoRA үшін 22.5 GB.
Осы бесеуінің қайсысын коммерциялық мақсатта қолдана аламын?▾
GR00T N1.7 салмақтары NVIDIA Open Model License Agreement лицензиясы бойынша, ол картада коммерциялық қолдануды қамтиды деп көрсетілген. N1.5 салмақтары коммерциялық емес. SmolVLA коды LeRobot-та Apache 2.0, бірақ lerobot/smolvla_base картасында лицензия өрісі жоқ, сондықтан салмақтары көрсетілмеген. ACT-тің лицензияланатын негізгі салмақтары жоқ. Pi0.5 екіұшты: LeRobot құжаттамасында Apache 2.0 делінген, оның карта метадеректерінде license: gemma деп жазылған.
Sources
- NVIDIA Isaac-GR00T репозиторийі: GA статусы, N1.6-дан N1.7-ге өзгерістер, аппараттық талаптар, torchcodec және FFmpeg шектеулері, launch_finetune.py, іске қосудан іске қосуға дейінгі айырмашылық
- nvidia/GR00T-N1.7-3B модель картасы: Cosmos-Reason2-2B негізі, 3 B параметрлер, инференс уақыты кестесі, NVIDIA Open Model License, Model Version өрісі
- nvidia/GR00T-N1.5-3B модель картасы: Eagle 2 сілтемесі, SigLip2 және T5, flow matching DiT, бір жақты коммерциялық емес лицензия
- Isaac-GR00T LIBERO мысалы: 20K қадамдағы және 640 пакет өлшеміндегі әр жиынтық бойынша сәттілік көрсеткіштері, әр жиынтыққа 200 сынақ
- Isaac-GR00T SimplerEnv мысалы: тапсырма бойынша Bridge және Fractal сәттілік көрсеткіштері, GR00T N1.6 қарсы N1.7
- pi0.5: Ашық Әлемдік Жалпылауы бар Көру-Тіл-Әрекет Моделі (2 B VLM плюс 300 M әрекет сарапшысы, 50 Hz басқару, шамамен 400 сағат мобильді манипуляция, 3-тен 104 орынға дейінгі масштабтау зерттеуі)
- openpi репозиторийі: GPU жадының ең төменгі шектері, flow-matching-head-only ауқымы және Pi0.5 LIBERO нәтижелері examples/libero ішінде
- lerobot/pi05_base модель картасы: LeRobot портының ауқымы, license: gemma метадеректері, lerobot-train қолданылуы
- LeRobot pi0.5 құжаттамасы: gated PaliGemma токенизаторы, LIBERO қайталау кестесі, n_action_steps кері қайтару тұзағы, Apache 2.0 мәлімдемесі
- SmolVLA: Қолжетімді және Тиімді Робототехникаға арналған Көру-Тіл-Әрекет Моделі (450 M параметрлер, LIBERO және Meta-World кестелері, SO-100 және SO-101 нәтижелері, асинхронды инференс)
- LeRobot SmolVLA құжаттамасы: 25-ке қарсы 5 позиция бойынша 50 эпизод, A100-де шамамен 4 сағатта 20k қадам
- Төмен Құны Бар Аппараттық Құралдармен Жіңішке Екі Қолмен Манипуляцияны Үйрену (ACT және ALOHA): 80-90 пайыздық 6 тапсырма, k=1-ден k=100-ге дейінгі бөлік өлшемін абляциялау
- LeRobot 0.6.2: ACTConfig және SmolVLAConfig әдепкі мәндері, әдепкі seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 талабы, Apache 2.0
- LeRobot GR00T құжаттамасы: policy type groot, N1.5 қолдауы жойылды, pin lerobot==0.5.1, SO-101 бөлік өлшемі мысалы
- lerobot/smolvla_base модель картасы: --policy.path арқылы қолданылатын SmolVLA негізгі бақылау нүктесі және оның лицензия өрісі жоқ карта метадеректері
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started