AY-Robots-ийн бодлогын харьцуулах хүснэгт нь GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT-ийг параметрийн тоо, GPU түвшин, таамаглалын хоцролт болон хамгийн бага үеийн тоог зэрэгцүүлэн харуулсан байна.
vla-загваруудбодлого-сургалтзагвар-сонголтlerobotso-100

2026 онд аль VLA бодлогыг сургах ёстой вэ?

AY-Robots ResearchAugust 23, 202618 мин унших

GR00T N1.7, Pi0.5, SmolVLA, ACT эсвэл GR00T N1.5? Бодит нөхцөл байдалд тохируулсан шийдвэрийн хүснэгт, нийтлэгдсэн бенчмарк үзүүлэлтүүд, хоцролт, гүйцэтгэл тутамд гарах зардал болон сонголт бүрийн ард байгаа лицензүүдийн хамт.

Өнөөдөр SO-100 ангиллын робот гар дээр таван бодлогыг сургах боломжтой. Эдгээр нь таамаглалын хоцролт (inference latency) 24 дахин, параметрийн тоо 37 дахин, нэг удаагийн ажиллагааны зардал 12 дахин ялгаатай бөгөөд үр дүнг хүргэх эсэхээс хамаарна. Таван загварын карт үүнийг шийдэхгүй: аль нь ч таны асуултад хариулахгүй, би алийг нь эхлээд ажиллуулах вэ?

Доорх бүх тоог 2026 оны 8-р сард гарсан баримт бичиг, репо, картуудаас авсан болно. Платформын тоог AY-Robots бодлогын каталог; хэрэв хоёр нь зөрчилдвөл хоёуланг нь харуулсан болно.

Товч хувилбар

  • Хэрэв та өөрийн өгөгдлийн багцад эргэлзэж байвал эхлээд ACT-ийг сурга: нэг удаагийн ажиллагаа 1-3 ам.доллар, муу өгөгдлийг далдлах урьдчилан сургасан зүйл байхгүй.
  • GR00T N1.7 болон Pi0.5 нь LIBERO дээр хагас онооны дотор, 97.0-96.85-97.5 хооронд байна. Энэ нь аль нэгийг нь сонгох шалтгаан биш.
  • Pi0.5 нь нарийвчлал биш, харин ерөнхийлөх чадварт чиглэсэн бөгөөд 485 мс-ээр хамгийн удаан нь юм.
  • SmolVLA нь 450 сая параметр бүхий, нэг 24 ГБ карт дээр нарийн тааруулах боломжтой цорын ганц VLA юм.
  • 20 мс-ийн ACT нь хурдан хариу үйлдэл үзүүлэх хөдөлгөөний цорын ганц сонголт юм. Лиценз нь бусдыг шийднэ.

Шийдвэрийн хүснэгт

Таны нөхцөл байдалҮүнийг сургахЯагаад
Өгөгдлийн багцын чанар батлагдаагүйACTУрьдчилан сургасан зүйл нь эвдэрсэн өгөгдлийн багцыг нуухгүй, алдаа гаргахад 1-3 USD зардалтай.
Холбоо барих, олон алхамт, хэлээр нөхцөлдсөнGR00T N1.7Дөрвөн LIBERO багцад 97.0%, нэмэх нь харьцангуй төгсгөлийн-эффекторын үйлдлийн зай.
Хурдан урвалж хөдөлгөөн, серво дээрх дүгнэлтACT20 ms. Дараагийн хамгийн хурдан нь 7.6 дахин удаан.
Шинэ объектууд, шинэ орчин, нээлттэй ертөнцPi0.5Түгээлтийн гаднах зан үйлд зориулагдсан, 104 хүртэлх байршилд.
Нэг 24 ГБ карт, хэлний дэмжлэг хэвээрSmolVLA450 сая параметр, 30 ангийн доод хязгаар, локал байдлаар ажиллана.
2025 онд бичигдсэн гүйцэтгэлийг давтахGR00T N1.5Зөвхөн шаардлагатай бол: LeRobot одоо үүнийг татгалзаж байна, жин нь арилжааны бус.
Энэ нь бүтээгдэхүүн болж гарах болноN1.7, SmolVLA or ACTN1.5 нь арилжааны бус, Pi0.5 нь Gemma нөхцөлийг агуулдаг, SmolVLA-ийн карт нь юу ч заагаагүй.

Таван нэр дэвшигч

Бүх тав нь бодлого юм: камерын фрейм, үений байрлал болон, тэдний дөрөвт нь хэлний зааварчилгаа, ирээдүйн үений зорилтуудын хэсэгт зураглагдсан. Тэднийг ялгаж буй зүйл бол та ирэхээс өмнө хэр их зүйлийг сургасан явдал юм.

БодлогоПараметрүүдХоцролтGPU зэрэглэлОрон нутгийн?Хамгийн бага ангиФорматЗардал
ACT~80 M20 ms24 GB карттийм50v3.01-3 USD
SmolVLA~450 M245 ms24 GB карттийм30v3.01-3 USD
GR00T N1.7~3 B, ~40 M тааруулсан152 msA100/H100 80 GBүгүй50v2.0/v2.14-12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBүгүй50v2.0/v2.14-12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBүгүй50v3.04-12 USD

GR00T N1.7

NVIDIA-ийн одоогийн хараа, хэл, үйлдлийн загвар, ойролцоогоор 3 тэрбум параметр, үүнээс 40 сая орчим нь нарийн тааруулалт хийх явцад сургагдсан. Репо нь N1.6-аас хойшхи өөрчлөлтүүдийг жагсаасан: Eagle загвараас Cosmos-Reason2-2B (Qwen3-VL дээр суурилсан) руу шилжсэн, диффузийн давхаргууд 32-оос 16 болсон, төлөв болон үйлдлийн хэмжээсүүд 29-өөс 132 болсон, үйлдлийн хэтийн төлөв 16-аас 40 болсон.

Жижиг гарт чухал зүйл бол харьцангуй төгсгөлийн-эффекторын үйлдлийн зай юм: N1.7 нь одоогийн байрлалаас ялгааг таамагладаг бөгөөд энэ нь 20 мянган цагийн EgoScale хүний ​​видеог роботын бодлого руу шилжүүлэх боломжийг олгодог. Дэлгэрэнгүй мэдээллийг N1.7 хуудас-аас, журам нь N1.7 SO-100 дээр гарын авлага-д бий.

Репо дээр GA, загварын карт дээр EA

Isaac-GR00T README нь N1.7-г Бүрэн бэлэн байдалтай хувилбар гэж зарласан бөгөөд бүрэн гүйцэд бенчмарк болон дэмжлэгтэй. Түүний Hugging Face карт нь хараахан шинэчлэгдээгүй байна: Model Version талбар нь одоо ч GR00T N1.7 EA гэж бичигдсэн хэвээр байна. Репо нь илүү шинэ баримт бичиг юм.

GR00T N1.5

Ижил 3 B масштаб, Eagle 2 нуруу, SigLip2 болон T5, flow-matching DiT толгойтой. Энэ нь таны аль хэдийн байгаа -ийг өргөтгөх зорилготой. Хоёр зүйл үүнийг муу анхдагч болгодог: жингүүд нь NVIDIA-ийн нэг талын арилжааны бус лицензийг агуулдаг бөгөөд одоогийн LeRobot хувилбарууд N1.5-ийн дэмжлэгийг хассан. Үзнэ үү: .

Pi0.5

Physical Intelligence-ийн VLA, бодлогын төрөл pi05. Энэхүү баримт бичигт PaliGemma-аас эхлүүлсэн 2 B VLM болон 300 M үйлдлийн эксперт багтсан бөгөөд роботыг 50 Гц хурдтайгаар удирддаг; LeRobot-ийн pi05 тохиргоо нь 50 алхамтай хэсэг, тухайн хурдаар нэг секундээр анхдагчаар тохируулагдсан байдаг. Үүний гол давуу тал нь урьд өмнө үзэгдээгүй газрууд юм: бодит айл өрхүүдэд 400 орчим цагийн хөдөлгөөнт манипуляци, мөн 3, 12, 22, 53, 82, 104 байршилд хийсэн масштаблах судалгаа, үүнд 104 байршилтай загвар нь туршилтын айл өрхүүдэд өөрсдөө сургагдсан хяналттай таарч байсан.

Нэг хязгаар, lerobot/pi05_base карт дээр дурдсан: порт нь зөвхөн урсгалд тохирох үйлдлийн толгойг дамжуулдаг. Дэд даалгаврын таамаглал, үйлдлийн токенжуулалт болон RL нь эх үүсвэрээс гараагүй бөгөөд openpi өөрийн репозиторийн талаар мөн адил зүйлийг хэлсэн. Pi0.5 хуудас болон SO-100 дээрх Pi0.5 гарын авлага нь үлдсэнийг агуулна.

Үдээс хойшх цагийг залгидаг урхи: хаалттай репо

Pi0.5 нь хаалттай google/paligemma-3b-pt-224 токенжуулагчийг шаарддаг (gated: manual, хэдийгээр Google хүсэлтүүдийг нэн даруй боловсруулдаг гэж хэлсэн). Үүнийг хүлээн зөвшөөрч, сургалтын орчинд hf auth login командыг ажиллуулахгүйгээр ажил эхэлж, хэсэг хугацаанд татаж аваад, дараа нь сүлжээний алдаа мэт харагдах зөвшөөрлийн алдаанаас болж зогсдог. nvidia/GR00T-N1.7-3B нь хаалттай биш боловч түүний nvidia/Cosmos-Reason2-2B үндсэн бүтэц нь хаалттай (gated: auto). Дараалалд оруулахаас өмнө хоёуланг нь цэвэрлээрэй; хэрэв ажил зогсонги байдалд байвал, гацсан дарааллын хуудас нь юуг шалгахыг жагсаасан байна.

SmolVLA

450 сая параметр, үйл ажиллагааны экспертэд ойролцоогоор 100 сая, SmolVLM-2 дээр VLM-ийг хөлдөөж, зөвхөн түүний эхний 16 хэлний загварын давхаргыг ашигласан. Урьдчилсан сургалт нь олон нийтийн өгөгдөл байсан: 481 өгөгдлийн багц, 10.6 сая фрэйм, таны ашигладаг ижил хямд гарнаас. Энд байгаа нэг 24 ГБ карт багтах цорын ганц VLA, мөн цорын ганц 30 эпизод давхар. Үзнэ үү SmolVLA хуудас.

ACT

Суурь загвар биш. ALOHA-ийн Action Chunking Transformer нь 50 Hz давтамжтай 50 үзүүлбэр дээр, даалгавар бүрт шинээр сургагдсан 80 сая орчим параметр юм. Тус баримт бичигт тус бүр ойролцоогоор арван минутын үзүүлбэрээс авсан зургаан бодит хос гар ажиллагаатай даалгаврыг, онцолсон жишээнүүд дээр 80-90 хувийн амжилттай гүйцэтгэсэн тухай мэдээлсэн. Түүний санаа болох үйлдэл хуваах, нь энэ хуудсан дээрх загвар бүрд байдаг бөгөөд түүний абляци нь одоо ч гэсэн үр нөлөөг хамгийн сайн хэмждэг: цаг хугацааны ансамблийг унтраасан хоёр симуляцийн даалгавар дээр амжилт k=1 үед 1 хувиас k=100 үед 44 хувь хүртэл өсдөг. ACT хуудас дээр үлдсэн мэдээлэл бий.

Үнэлгээний шалгуурууд үнэндээ юу хэлж байна вэ

LIBERO нь эдгээр тавын гурав нь мэдээлдэг нэг үнэлгээний шалгуур юм: симуляцийн Franka Panda дээрх хэлээр нөхцөлдсөн даалгаврууд, доорх дөрвөн багцад тус бүр арван даалгавар болгон хуваагдсан. NVIDIA багц бүрт 200 туршилт хийсэн.

ЗагварОрон зайнОбъектЗорилго10 (Урт)Дундаж
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Эдгээр мөрүүд нь хатуу харьцуулагдах боломжгүй

Тоо бүр өөр өөр туршилтын орчин болон төсвөөс гарсан. GR00T нь 20K алхамыг 640-ийн глобал багцаар гүйцэтгэсэн; openpi-ийн үзүүлэлт нь 30K шалгах цэг юм; LeRobot порт нь LIBERO суурь загварт 6K алхам нэмсэн. SmolVLA нь цаашдын үл нийцэл юм: түүний судалгааны ажил нь тухайн мөрийг LIBERO дээр тэгээс эхлэн, VLA урьдчилсан сургалтгүйгээр сургадаг бол, дээрх гурав нь урьдчилан сургасан шалгах цэгүүдийг нарийн тааруулдаг. 96.85-аас 97.5-ыг нэг бүлэг гэж үзэх ба 87.3%-ийн зөрүүг бодит боловч 6.7 дахин их параметрүүдээр олж авсан гэж үзнэ.

SimplerEnv нь тархалтыг харуулдаг бол LIBERO харуулдаггүй. NVIDIA нь N1.7-г N1.6-тай харьцуулсан нь үе хоорондын ялгааг харуулсан хамгийн ойрын олон нийтийн зүйл юм.

SimplerEnv багцN1.6 дундажN1.7 дундажХамгийн сайн өөрчлөлтХамгийн муу өөрчлөлт
Bridge (WidowX), 7 даалгавар56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 даалгавар52.0%72.5%open_drawer 0.0 to 65.0байхгүй, даалгавар бүр сайжирсан

Bridge мөр нь ашигтай нь: дунджаар 5.7 оноо нэмэгдсэн бол put_eggplant_in_basket 36 оноо алдаж, put_eggplant_in_sink 33-аас 2 болж буурсан. Шинэ үеийнхэн тархалтыг өргөх бус хөдөлгөдөг тул таны даалгавар N1.7 ухарсан газарт байвал дундаж нь юу ч хэлэхгүй.

AY-Robots талбарын тэргүүлэгчдийн самбар, 85 хараа-хэл-үйлдэл загварын эрэмбэлэгдэх хүснэгт бөгөөд 332 бенчмарк үр дүнтэй, үр дүн бүр нь гарсан судалгааны ажил эсвэл загварын карттай холбогдсон
Тус талбар нь 85 VLA загвар болон 332 бенчмарк үр дүнг агуулдаг бөгөөд тус бүр нь өөрийн судалгааны ажил эсвэл загварын карттай холбогдсон байдаг. Блог нийтлэлд дурдсан тоо бодит эсэхийг шалгахад ашигтай.

Таваас зөвхөн SmolVLA-ийн судалгааны ажил SO-100 ангиллын гарны талаар мэдээлсэн: SmolVLA-д 78.3 хувь, Pi0-д 61.7 хувь гурван даалгаврын хувьд, хоёулаа олон даалгавартай, харин ACT-ийн нэг даалгаварт сургасан 48.3 хувьтай харьцуулахад адил биш юм. Цэвэр хослол нь SO-101 pick-and-place дээр хоёулаа нэг даалгавартай: тархалтад 90-ийн эсрэг 70, түүнээс гадуур 50-ийн эсрэг 40. Харьцуулахдаа ACT-ийг SmolVLA-тай харьцуулах болон Pi0.5-ийг SmolVLA-тай харьцуулах, эсвэл талбарыг үзэх.

Хоцролт болон зардал нь байршуулалтыг шийднэ

Дүгнэлт гаргах хоцрогдол нь хүмүүсийн хамгийн сүүлд олж мэддэг бөгөөд хамгийн түрүүнд харамсдаг хязгаарлалт юм. Үнэлгээний шалгуур үзүүлэлт дээр таван оноогоор илүү боловч үйлдлийн алхам тутамд хагас секунд зарцуулдаг бодлого таны ширээн дээр муу харагдана: холбоо барих динамик хүлээхгүй.

Нэг анхааруулга: GR00T-ийн үзүүлэлт нь NVIDIA-ийн карттай зөрчилдөж байна. Учир нь NVIDIA-ийн карт нь 4 дуу шуугиан арилгах алхам болон нэг камерыг H100 дээр eager горимд 85.8 мс, torch.compile-ээр 48.6 мс, бүрэн TensorRT-ээр 27.9 мс-ээр хэмждэг. Энд байгаа 152 мс нь зөвхөн урагш дамжуулалт биш, харин үйлчилгээний нэмэлт зардал болон нэгээс олон камертай бүхэл бүтэн системийн үзүүлэлт юм.

Алсын зайн дүгнэлт гаргахад хязгаарлалт бий

20-485 мс-ийн давталт нь загварынх бөгөөд олон нийтийн интернетийн эргэлтийн хугацаа үүнд нэмэгддэг. Алсын зайн дүгнэлт гаргах нь удаан сонгох-байрлуулах үйлдлийн хувьд боломжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй. Хэрэв таны даалгавар хурд шаарддаг бол дүгнэлт гаргах нь сервогийн хажууд байрлана: ACT эсвэл SmolVLA, орон нутагт. Холбогдох: бодлого хөдөлгөөний дунд хөлддөг.

Загварыг өөрчлөхгүйгээр цаг хугацаа хэмнэх нэг арга: SmolVLA-ийн баримт бичигт синхрон гүйцэтгэлийг хэмждэг бөгөөд энэ нь бодлого нь дараагийнхийг таамаглахаас өмнө нэг хэсгийг дуусгадаг, харин асинхрон гүйцэтгэлд таамаглал нь гүйцэтгэлтэй давхцдаг. Амжилт нь ижил төстэй, 78.3-ын эсрэг 73.3, гэхдээ ижил сонгох-байрлуулах үйлдэл 13.75 секундын оронд 9.7 секунд зарцуулдаг бөгөөд тогтмол хугацаанд робот 9 циклийн оронд 19 циклийг гүйцэтгэдэг.

Лицензүүд, хэн ч шалгадаггүй учраас шалгасан

МодельЖингийн лицензКодын лицензАрилжааны зориулалт
GR00T N1.7NVIDIA Open Model License; карт нь арилжааны зориулалтаар ашиглахыг зөвшөөрдөгApache 2.0тийм
GR00T N1.5NVIDIA-ийн нэг талын арилжааны бус лицензApache 2.0үгүй
Pi0.5pi05_base картын мета өгөгдөл нь license: gemma гэж заасанApache 2.0 (openpi, LeRobot docs)хоёуланг нь уншсан, зөрчилдөж байна
SmolVLAsmolvla_base карт дээр лицензийн талбар байхгүйApache 2.0 (LeRobot)код тийм, жин тодорхойгүй
ACTүндсэн жин байхгүйApache 2.0 (LeRobot)тийм

Pi0.5 мөрөнд анхаарал хандуулах шаардлагатай. LeRobot pi05 баримт бичиг нь openpi-тай нийцтэйгээр Apache 2.0 гэж заасан, харин Hub карт нь lerobot/pi05_base нь license: gemma гэж заасан байна. Хоёулаа идэвхтэй байна. GR00T N1.7 нь зөөлөн хувилбартай: Isaac-GR00T README нь N1.7 нь Apache 2.0-ийн дагуу бүрэн арилжааны зориулалтаар лицензтэй гэж дурдагдсан, харин түүний өөрийн лицензийн хэсэг болон загварын карт нь зөвхөн кодыг Apache 2.0-ийн дор, жинг NVIDIA-ийн Open Model License-ийн дор байрлуулсан.

Таны бодитоор ажиллуулах үндсэн тохиргоонууд

Сургагч бүр өгөгдмөл тохиргоотой ирдэг бөгөөд тэдгээр нь дур зоргынх биш юм. ACT-ийнх нь LeRobot-ийн өөрийнх: batch 8, lr 1e-5, 100000 сургалтын алхамууд, chunk size 100, ACTConfig-тэй дээд урсгалд таарч байгаа бөгөөд k=100 ACT баримт бичгээс. Доорх нэг багана нь урхи юм.

БодлогоБагцLRХамгийн их алхамГрадиент хуримтлалХэрэгжих үү?Нэмэлт тохируулгууд
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Дахин давтагдах чадвар, 2026 оны 8-р сарын байдлаар

GR00T-ийн нарийн тааруулах эхлэлийн цэг (launch_finetune.py, tyro CLI) нь өөрийн тохиргооны dataclass-д seed талбаргүй тул ажиллагаанууд бит-битээр давтагдах боломжгүй юм. Репо нь мөн тодорхой бус зургийн өргөтгөлөөс үүдэлтэй ажиллагаа хоорондын 5-6 хувийн зөрүү байж болзошгүйг анхааруулдаг бөгөөд энэ нь онлайн хэлэлцэгддэг ихэнх бенчмаркийн ялгаанаас том юм. LeRobot-ийн өгөгдмөл seed нь 1000. Градиент хуримтлалын багана нь lerobot 0.5.1-ийг тайлбарладаг; дээд урсгалын 0.6.2 нь үүнийг --accelerator.gradient_accumulation.steps хэлбэрээр ил гаргадаг.

Моделийн сонголтоос илүү чухал тохируулга

Энэ бол үйлдлийн хэсэг юм. Урт хэсгүүд нь илүү жигд хөдөлгөөн, бага давхцах алдааг өгдөг боловч блок ажиллаж байх үед бодлого хэрэгждэг тул хөдөлж буй зүйлд хоцорч хариу үйлдэл үзүүлдэг: хөдөлгөөнгүй куб дээр итгэлтэй, өнхөрч буй куб дээр найдваргүй. Хэрэв хэтрүүлбэл, гүйцэтгэсэн хэсгийг богиносгох нь дахин сургахаас илүү үр дүнтэй бөгөөд үнэгүй. Дутуу зогссон үе нь өөр асуудал юм; үзнэ үү .

  • ACT: ACTConfig нь анхдагчаар chunk_size 100 болон n_action_steps 100-тай байна. Цаг хугацааны хамтын ажиллагаа идэвхгүй бөгөөд n_action_steps 1 шаарддаг.
  • GR00T N1.7: дотоод хязгаар нь 16-аас 40 болсон боловч LeRobot-ын SO-101 жишээ нь одоо ч --policy.chunk_size=16 --policy.n_action_steps=16-аар ажиллаж байна. Rollout флагийг --execution-horizon болгон өөрчилсөн.
  • Pi0.5: 50 алхамтай хэсэг, үүнээс LeRobot-ын LIBERO жор нь --policy.n_action_steps=10-аар 10-ыг гүйцэтгэдэг; --policy.pretrained_path-тай бол, хэрэв та флагийг орхигдуулбал 50 руу буцдаг.
  • SmolVLA: 50 үйлдлийн хэсгүүд, хоёр тохиргоо хоёулаа ил.

Тавууланг нь нэг үдээс хойш хэрхэн шалгах вэ

Хамгийн хямд хариулт бол илүү их унших биш. Ойролцоогоор 15 USD зарцуулж, гарт тань хэлүүлээрэй: нэг удаа бичлэг хийж, эхлээд хямд загварыг сургаж, өгөгдөл нь зөв болохыг баталсны дараа өргөжүүлээрэй. Бүтэц нь хэмжээнээс илүү чухал, энэ нь болон .

  1. 1
    50 эпизодыг нэг удаа бүртгэх

    GR00T, Pi0.5, ACT-д 50, SmolVLA-д 30-аар эхлэх нь хангалттай. Олон янзын хувилбаруудыг нимгэн тараахын оронд тус бүрийг нь давт: 5 шоо байрлалд 50 эпизод сургасан бөгөөд 25 нь сургагдаагүй байсан. Анхны өгөгдлийн сангаа бүртгэх-ийг үзнэ үү.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ACT-ийг эхлээд сурга, учир нь энэ нь танд худал хэлэхгүй

    Урьдчилан сургасан жин байхгүй тул, хэрэв энэ нь даалгаврыг гүйцэтгэж чадвал таны өгөгдлийн сан тухайн даалгаврыг агуулж байна гэсэн үг. Хэрэв ACT үр дүнгүй болвол өгөгдлийг засна уу. 24 ГБ карт дээр 1-3 ам.доллар, 2-5 цаг.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA-г ижил өгөгдлийн санд, өөрчлөлтгүйгээр ажиллуулах

    Ижил өгөгдөл, ижил гар, 80 саяын оронд 450 сая параметр, дээр нь хэлний нөхцөл байдал. LeRobot нь нэг A100 дээр 20K алхамтай ажиллагааг ойролцоогоор 4 цагт гүйцэтгэдэг. Энэ нь урьдчилан сургалт ямар нэгэн үр өгөөжтэй эсэхийг танд хэлж өгнө.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T-д хүрэхээсээ өмнө v2.1 руу хөрвүүлэх

    GR00T нь LeRobot v2 форматын хувилбарыг уншдаг бөгөөд нэмэлт meta/modality.json нь нэгтгэсэн төлөв болон үйлдлийн массивуудыг нэрлэсэн талбаруудад хэрхэн хуваахыг харуулдаг. v3.0 өгөгдлийн сан нь уг ачаалагчийг унагадаг, учир нь v3.0 нь олон эпизодыг хуваалцсан файлуудад багцалдаг бол v2 нь эпизод тутамд нэгийг бичдэг байсан. Isaac-GR00T нь доошлуулах туслах хэрэгслийг scripts/lerobot_conversion/convert_v3_to_v2.py хэлбэрээр нийлүүлдэг; v3-ийг татгалзах хуудас нь хурдан зам юм.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Эхний хоёр нь үр дүнгүй бол GR00T N1.7 руу шилжих

    Энд үзүүлсэн NVIDIA-ийн CLI эсвэл LeRobot-ийн groot бодлогын төрлөөр. NVIDIA нь нарийн тааруулахад 40 ГБ ба түүнээс дээш VRAM, дүгнэлт хийхэд 16 ГБ VRAM-ийг зөвлөж байна. OOM тохиолдолд OOM хуудас-ыг үзнэ үү.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Уг шалгалтын дамжуулалтыг ажиллуулах хоёр арга

Гурван орчин, учир нь хэрэгслийн гинжүүд хамт оршдоггүй. Үндсэн LeRobot нь 0.6.2 хувилбар бөгөөд Python 3.12 эсвэл түүнээс шинэ хувилбар шаарддаг; Isaac-GR00T болон openpi нь тусдаа uv-ээр удирддаг репозиториуд юм.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T нь torchcodec 0.8.0-ийг цорын ганц видео бэкэндээр ашигладаг бөгөөд FFmpeg 4-7 шаарддаг. FFmpeg 8 дэмжигддэггүй, AV1 баталгаагүй.
  • openpi санах ойн доод хязгаар: дүгнэлт хийхэд 8 ГБ-аас дээш, LoRA-д 22.5 ГБ-аас дээш, бүрэн нарийн тааруулахад 70 ГБ-аас дээш. Сүүлийнх нь Pi0.5-ийг A100-ийн ажил болгодог шалтгаан юм.
  • GPU-г өөрөө түрээсэлж, дараа нь устгаж, гурван багц шалгалтын цэгийн замыг гараар тохируулна уу.

Суурь загвар эсвэл эхнээс нь

Жинхэнэ сонголт бол аль 3B загварыг сонгох биш. Харин урьдчилан сургасан VLA-г ашиглах эсэх юм, учир нь ACT нь тус бүр арван минутын туршлагаас зургаан бодит хоёр гар ажиллагаатай даалгаврыг 80 сая параметр ашиглан сурсан бөгөөд юу ч урьдчилан сургагдаагүй байсан.

Урьдчилан сургасан VLA-г ACT-г эхнээс нь сургахын оронд нарийн тааруулах нь
Таны олох ашиг
  • Хэлний нөхцөл байдал. ACT-д байхгүй; нэг ACT шалгах цэг нэг даалгавар гүйцэтгэдэг.
  • Таны туршлагад байхгүй объектууд дээр илүү сайн: SO-101 дээр, ACT-ийн тархалтаас гадуурх 40%-ийн эсрэг 50%.
  • Олон даалгаварт: SmolVLA нь нэг шалгах цэгээр гурван SO-100 даалгаврын 78.3%-д хүрдэг; ACT-г зөвхөн нэг даалгаварт ажиллуулсан.
Таны гарах зардал
  • 7.6-24 дахин их хоцрогдол: ACT-ийн 20 мс-ийн эсрэг үйлдлийн алхам тутамд 152-485 мс.
  • 1-3-ын оронд ажиллагаа тутамд 4-12 ам.доллар, мөн 24 ГБ картны оронд A100 түвшний карт шаардагдана.
  • Лицензийн эрсдэл, мөн эхнээс нь хийхэд байдаггүй хаалттай репо-гийн алдааны горим.
  • Урьдчилан сургасан жин нь муу өгөгдлийн багцыг халхалж болно. Эвдэрсэн өгөгдөл дээр хагас ажилладаг нарийн тааруулалт нь таныг өгөгдлийг харахаас өмнө долоо хоногийн хугацаа шаардана.

Хуучин ажиллагааг давтах тохиолдол

2025 оны шалгах цэгийг хөөх нь таны загварын сонголтыг хийж, асуудлыг хувилбарын тогтоолт болгон хувиргадаг: одоогийн LeRobot нь N1.5-ыг хүлээн зөвшөөрөхгүй тул та lerobot==0.5.1. Үрийн талбар байхгүй, ажиллагаа хооронд 5-6 хувийн зөрүүтэй тул давталт нь бүтцийн хувьд ойролцоо байна. болон нь платформын талыг харуулна.

The AY-Robots head to head comparison page for GR00T N1.7 against Pi0.5, showing parameter counts, GPU requirements, inference latency, dataset format and minimum episode counts side by side
Head to head on /compare/groot-n1-7-vs-pi0-5. The two 3 B models look interchangeable on a spec sheet and are not: one wants LeRobot v2.1, one wants v3.0.

Хоёр болж буурав уу? ACT эсрэг GR00T N1.7 болон GR00T N1.7 эсрэг SmolVLA. Түүхий мөрүүд нь аренагийн бичлэгүүдэд байна: GR00T N1.7, Pi0.5, SmolVLA болон ACT.

Энэхүү платформ танд юугаар туслахгүй вэ

  • Энэ нь алсын зайн дүгнэлтийг хурдан хийх боломжгүй. 20-485 мс-ийн давталт нь загварт хамаарах бөгөөд интернетийн эргэлтийн хугацаа үүнд нэмэгдэнэ.
  • Энэ нь GR00T эсвэл Pi0.5-ийг таны өөрийн техник хангамж дээр нарийн тааруулах боломжгүй. Энд хоёулаа зөвхөн үүлэн системд ажиллах бөгөөд зөвхөн SmolVLA болон ACT л локал байдлаар ажиллана.
  • Энэ нь өгөгдлийн багцыг засах боломжгүй. Алдагдал буурч байгаа ч бодлого юу ч хийхгүй байх нь өгөгдлийн асуудал, зөвхөн нэг тохиргоонд ажилладаг бодлого нь хамрах хүрээний асуудал юм.
  • Энэ нь GR00T-ийн ажиллагааг давтагдахуйц болгох боломжгүй: эх үүсвэрийн тохиргоонд seed талбар байхгүй.

85 загвар, 332 бенчмарк үр дүн, тоо бүр нь эх сурвалжтайгаа холбогдсон

Энэ хуудасны хүснэгтүүдийн эрэмбэлэгдэх хувилбар: 85 хараа-хэл-үйлдэл загвар, 332 бенчмарк үр дүн, тус бүр нь өөрийн эх баримт бичиг эсвэл загварын карттай холбогдсон.

Ареныг нээх

Нэгийг сонгож, цааш үргэлжлүүлэх

Нэг үндсэн тохиргоо: 50 эпизод бичиж, өгөгдлийн багцыг батлахын тулд ACT-ийг 1-3 USD-ээр сургана, дараа нь SmolVLA-г ижил өгөгдөл дээр сургана. Нийтдээ 6 USD-ээс бага зардлаар, тэд хамгийн чухал асуултад хариулна: урьдчилсан сургалт энд тус болох уу, эсвэл саад бэрхшээл нь өгөгдөл үү. Хүрэлцээ ихтэй олон шатлалт даалгавруудад GR00T N1.7-г, үзэгдэл өөрчлөгдөхөд Pi0.5-г ашиглана.

Платформын тойм: анхны бодлогоо сургах, дараа нь анхны бодлогоо ажиллуулах. сургалтын баримт бичиг болон өгөгдлийн багцын баримт бичиг нь хэлбэр, форматыг хамарна; SO-100 хуудас болон SO-100-ийн иж бүрэн гарын авлага нь угсралт болон тохируулгыг хамарна. Үндсэн мэдээлэл: VLA-ийн тойм болон Pi0 урсгал тааруулах нийтлэл. Таны амжилтын хувийг нэмэгдүүлэх зүйл бол өгөгдлийн чанарын гарын авлага.

SO-100 дээр би эхлээд аль VLA бодлогыг сургах ёстой вэ?

ACT, дараа нь SmolVLA. ACT нь тэгээс эхлэн сургадаг тул муу өгөгдлийн багцыг нууж чадахгүй бөгөөд 24 GB карт дээр нэг ажиллуулалт 1-ээс 3 USD үнэтэй. Хэрэв ACT нь уг даалгаврыг гүйцэтгэж чадвал GR00T N1.7 эсвэл Pi0.5-ийн ажиллуулалтад зарцуулах 4-өөс 12 USD үнэ дэмий хоосон болохгүй.

GR00T N1.7 нь Pi0.5-аас үнэхээр илүү юу?

LIBERO дээр тэд дуу чимээний хязгаарт байна: GR00T N1.7-ийн хувьд дөрвөн багцад 97.0%, openpi-д 30k алхам дээр Pi0.5-ийн хувьд 96.85%, LeRobot портын хувьд 97.5%, бүгд өөр өөр хэрэгслээс. Жинхэнэ ялгаа нь нэг үйлдлийн алхамд 152 ms, 485 ms-ийн эсрэг, v2.1 өгөгдлийн багц v3.0-ийн эсрэг, мөн бенчмаркийн нарийвчлал нээлттэй ертөнцийн ерөнхийлөлтийн эсрэг байна.

Би эдгээрийн аль нэгийг нь нэг RTX 4090 дээр нарийн тааруулах боломжтой юу?

SmolVLA болон ACT, тийм ээ; хоёулаа RTX 4090 эсвэл ямар ч 24 GB карт дээр ажиллахаар жагсаагдсан бөгөөд локал байдлаар ажилладаг. GR00T N1.7, N1.5 болон Pi0.5 нь A100 эсвэл H100 80 GB шаарддаг бөгөөд энд зөвхөн үүлэн дээр ажилладаг. NVIDIA нь GR00T-ийг нарийн тааруулахад 40 GB ба түүнээс дээш хэмжээг зөвлөж байна; openpi-ийн доод хязгаар нь Pi0.5-ийг бүрэн нарийн тааруулахад 70 GB-аас дээш, LoRA-д 22.5 GB байна.

Эдгээр тавын алийг нь би арилжааны зорилгоор ашиглаж болох вэ?

GR00T N1.7-ийн жингүүд нь NVIDIA Open Model License Agreement-ийн дор байдаг бөгөөд энэ нь арилжааны зорилгоор ашиглахыг зөвшөөрдөг гэж карт дээр бичсэн байна. N1.5-ийн жингүүд нь арилжааны бус. SmolVLA-ийн код нь LeRobot-д Apache 2.0 боловч lerobot/smolvla_base карт нь лицензийн талбаргүй тул жингүүд нь тодорхойгүй байна. ACT нь лицензлэх суурь жингүй. Pi0.5 нь тодорхойгүй: LeRobot-ийн баримт бичигт Apache 2.0 гэж бичсэн байхад, түүний картын мета өгөгдөл нь license: gemma гэж заасан байна.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started