
GR00T N1.7, Pi0.5, SmolVLA, ACT эсвэл GR00T N1.5? Бодит нөхцөл байдалд тохируулсан шийдвэрийн хүснэгт, нийтлэгдсэн бенчмарк үзүүлэлтүүд, хоцролт, гүйцэтгэл тутамд гарах зардал болон сонголт бүрийн ард байгаа лицензүүдийн хамт.
Өнөөдөр SO-100 ангиллын робот гар дээр таван бодлогыг сургах боломжтой. Эдгээр нь таамаглалын хоцролт (inference latency) 24 дахин, параметрийн тоо 37 дахин, нэг удаагийн ажиллагааны зардал 12 дахин ялгаатай бөгөөд үр дүнг хүргэх эсэхээс хамаарна. Таван загварын карт үүнийг шийдэхгүй: аль нь ч таны асуултад хариулахгүй, би алийг нь эхлээд ажиллуулах вэ?
Доорх бүх тоог 2026 оны 8-р сард гарсан баримт бичиг, репо, картуудаас авсан болно. Платформын тоог AY-Robots бодлогын каталог; хэрэв хоёр нь зөрчилдвөл хоёуланг нь харуулсан болно.
Товч хувилбар
- •Хэрэв та өөрийн өгөгдлийн багцад эргэлзэж байвал эхлээд ACT-ийг сурга: нэг удаагийн ажиллагаа 1-3 ам.доллар, муу өгөгдлийг далдлах урьдчилан сургасан зүйл байхгүй.
- •GR00T N1.7 болон Pi0.5 нь LIBERO дээр хагас онооны дотор, 97.0-96.85-97.5 хооронд байна. Энэ нь аль нэгийг нь сонгох шалтгаан биш.
- •Pi0.5 нь нарийвчлал биш, харин ерөнхийлөх чадварт чиглэсэн бөгөөд 485 мс-ээр хамгийн удаан нь юм.
- •SmolVLA нь 450 сая параметр бүхий, нэг 24 ГБ карт дээр нарийн тааруулах боломжтой цорын ганц VLA юм.
- •20 мс-ийн ACT нь хурдан хариу үйлдэл үзүүлэх хөдөлгөөний цорын ганц сонголт юм. Лиценз нь бусдыг шийднэ.
Шийдвэрийн хүснэгт
| Таны нөхцөл байдал | Үүнийг сургах | Яагаад |
|---|---|---|
| Өгөгдлийн багцын чанар батлагдаагүй | ACT | Урьдчилан сургасан зүйл нь эвдэрсэн өгөгдлийн багцыг нуухгүй, алдаа гаргахад 1-3 USD зардалтай. |
| Холбоо барих, олон алхамт, хэлээр нөхцөлдсөн | GR00T N1.7 | Дөрвөн LIBERO багцад 97.0%, нэмэх нь харьцангуй төгсгөлийн-эффекторын үйлдлийн зай. |
| Хурдан урвалж хөдөлгөөн, серво дээрх дүгнэлт | ACT | 20 ms. Дараагийн хамгийн хурдан нь 7.6 дахин удаан. |
| Шинэ объектууд, шинэ орчин, нээлттэй ертөнц | Pi0.5 | Түгээлтийн гаднах зан үйлд зориулагдсан, 104 хүртэлх байршилд. |
| Нэг 24 ГБ карт, хэлний дэмжлэг хэвээр | SmolVLA | 450 сая параметр, 30 ангийн доод хязгаар, локал байдлаар ажиллана. |
| 2025 онд бичигдсэн гүйцэтгэлийг давтах | GR00T N1.5 | Зөвхөн шаардлагатай бол: LeRobot одоо үүнийг татгалзаж байна, жин нь арилжааны бус. |
| Энэ нь бүтээгдэхүүн болж гарах болно | N1.7, SmolVLA or ACT | N1.5 нь арилжааны бус, Pi0.5 нь Gemma нөхцөлийг агуулдаг, SmolVLA-ийн карт нь юу ч заагаагүй. |
Таван нэр дэвшигч
Бүх тав нь бодлого юм: камерын фрейм, үений байрлал болон, тэдний дөрөвт нь хэлний зааварчилгаа, ирээдүйн үений зорилтуудын хэсэгт зураглагдсан. Тэднийг ялгаж буй зүйл бол та ирэхээс өмнө хэр их зүйлийг сургасан явдал юм.
| Бодлого | Параметрүүд | Хоцролт | GPU зэрэглэл | Орон нутгийн? | Хамгийн бага анги | Формат | Зардал |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB карт | тийм | 50 | v3.0 | 1-3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB карт | тийм | 30 | v3.0 | 1-3 USD |
| GR00T N1.7 | ~3 B, ~40 M тааруулсан | 152 ms | A100/H100 80 GB | үгүй | 50 | v2.0/v2.1 | 4-12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | үгүй | 50 | v2.0/v2.1 | 4-12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | үгүй | 50 | v3.0 | 4-12 USD |
GR00T N1.7
NVIDIA-ийн одоогийн хараа, хэл, үйлдлийн загвар, ойролцоогоор 3 тэрбум параметр, үүнээс 40 сая орчим нь нарийн тааруулалт хийх явцад сургагдсан. Репо нь N1.6-аас хойшхи өөрчлөлтүүдийг жагсаасан: Eagle загвараас Cosmos-Reason2-2B (Qwen3-VL дээр суурилсан) руу шилжсэн, диффузийн давхаргууд 32-оос 16 болсон, төлөв болон үйлдлийн хэмжээсүүд 29-өөс 132 болсон, үйлдлийн хэтийн төлөв 16-аас 40 болсон.
Жижиг гарт чухал зүйл бол харьцангуй төгсгөлийн-эффекторын үйлдлийн зай юм: N1.7 нь одоогийн байрлалаас ялгааг таамагладаг бөгөөд энэ нь 20 мянган цагийн EgoScale хүний видеог роботын бодлого руу шилжүүлэх боломжийг олгодог. Дэлгэрэнгүй мэдээллийг N1.7 хуудас-аас, журам нь N1.7 SO-100 дээр гарын авлага-д бий.
Isaac-GR00T README нь N1.7-г Бүрэн бэлэн байдалтай хувилбар гэж зарласан бөгөөд бүрэн гүйцэд бенчмарк болон дэмжлэгтэй. Түүний Hugging Face карт нь хараахан шинэчлэгдээгүй байна: Model Version талбар нь одоо ч GR00T N1.7 EA гэж бичигдсэн хэвээр байна. Репо нь илүү шинэ баримт бичиг юм.
GR00T N1.5
Ижил 3 B масштаб, Eagle 2 нуруу, SigLip2 болон T5, flow-matching DiT толгойтой. Энэ нь таны аль хэдийн байгаа -ийг өргөтгөх зорилготой. Хоёр зүйл үүнийг муу анхдагч болгодог: жингүүд нь NVIDIA-ийн нэг талын арилжааны бус лицензийг агуулдаг бөгөөд одоогийн LeRobot хувилбарууд N1.5-ийн дэмжлэгийг хассан. Үзнэ үү: .
Pi0.5
Physical Intelligence-ийн VLA, бодлогын төрөл pi05. Энэхүү баримт бичигт PaliGemma-аас эхлүүлсэн 2 B VLM болон 300 M үйлдлийн эксперт багтсан бөгөөд роботыг 50 Гц хурдтайгаар удирддаг; LeRobot-ийн pi05 тохиргоо нь 50 алхамтай хэсэг, тухайн хурдаар нэг секундээр анхдагчаар тохируулагдсан байдаг. Үүний гол давуу тал нь урьд өмнө үзэгдээгүй газрууд юм: бодит айл өрхүүдэд 400 орчим цагийн хөдөлгөөнт манипуляци, мөн 3, 12, 22, 53, 82, 104 байршилд хийсэн масштаблах судалгаа, үүнд 104 байршилтай загвар нь туршилтын айл өрхүүдэд өөрсдөө сургагдсан хяналттай таарч байсан.
Нэг хязгаар, lerobot/pi05_base карт дээр дурдсан: порт нь зөвхөн урсгалд тохирох үйлдлийн толгойг дамжуулдаг. Дэд даалгаврын таамаглал, үйлдлийн токенжуулалт болон RL нь эх үүсвэрээс гараагүй бөгөөд openpi өөрийн репозиторийн талаар мөн адил зүйлийг хэлсэн. Pi0.5 хуудас болон SO-100 дээрх Pi0.5 гарын авлага нь үлдсэнийг агуулна.
Pi0.5 нь хаалттай google/paligemma-3b-pt-224 токенжуулагчийг шаарддаг (gated: manual, хэдийгээр Google хүсэлтүүдийг нэн даруй боловсруулдаг гэж хэлсэн). Үүнийг хүлээн зөвшөөрч, сургалтын орчинд hf auth login командыг ажиллуулахгүйгээр ажил эхэлж, хэсэг хугацаанд татаж аваад, дараа нь сүлжээний алдаа мэт харагдах зөвшөөрлийн алдаанаас болж зогсдог. nvidia/GR00T-N1.7-3B нь хаалттай биш боловч түүний nvidia/Cosmos-Reason2-2B үндсэн бүтэц нь хаалттай (gated: auto). Дараалалд оруулахаас өмнө хоёуланг нь цэвэрлээрэй; хэрэв ажил зогсонги байдалд байвал, гацсан дарааллын хуудас нь юуг шалгахыг жагсаасан байна.
SmolVLA
450 сая параметр, үйл ажиллагааны экспертэд ойролцоогоор 100 сая, SmolVLM-2 дээр VLM-ийг хөлдөөж, зөвхөн түүний эхний 16 хэлний загварын давхаргыг ашигласан. Урьдчилсан сургалт нь олон нийтийн өгөгдөл байсан: 481 өгөгдлийн багц, 10.6 сая фрэйм, таны ашигладаг ижил хямд гарнаас. Энд байгаа нэг 24 ГБ карт багтах цорын ганц VLA, мөн цорын ганц 30 эпизод давхар. Үзнэ үү SmolVLA хуудас.
ACT
Суурь загвар биш. ALOHA-ийн Action Chunking Transformer нь 50 Hz давтамжтай 50 үзүүлбэр дээр, даалгавар бүрт шинээр сургагдсан 80 сая орчим параметр юм. Тус баримт бичигт тус бүр ойролцоогоор арван минутын үзүүлбэрээс авсан зургаан бодит хос гар ажиллагаатай даалгаврыг, онцолсон жишээнүүд дээр 80-90 хувийн амжилттай гүйцэтгэсэн тухай мэдээлсэн. Түүний санаа болох үйлдэл хуваах, нь энэ хуудсан дээрх загвар бүрд байдаг бөгөөд түүний абляци нь одоо ч гэсэн үр нөлөөг хамгийн сайн хэмждэг: цаг хугацааны ансамблийг унтраасан хоёр симуляцийн даалгавар дээр амжилт k=1 үед 1 хувиас k=100 үед 44 хувь хүртэл өсдөг. ACT хуудас дээр үлдсэн мэдээлэл бий.
Үнэлгээний шалгуурууд үнэндээ юу хэлж байна вэ
LIBERO нь эдгээр тавын гурав нь мэдээлдэг нэг үнэлгээний шалгуур юм: симуляцийн Franka Panda дээрх хэлээр нөхцөлдсөн даалгаврууд, доорх дөрвөн багцад тус бүр арван даалгавар болгон хуваагдсан. NVIDIA багц бүрт 200 туршилт хийсэн.
| Загвар | Орон зайн | Объект | Зорилго | 10 (Урт) | Дундаж |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Тоо бүр өөр өөр туршилтын орчин болон төсвөөс гарсан. GR00T нь 20K алхамыг 640-ийн глобал багцаар гүйцэтгэсэн; openpi-ийн үзүүлэлт нь 30K шалгах цэг юм; LeRobot порт нь LIBERO суурь загварт 6K алхам нэмсэн. SmolVLA нь цаашдын үл нийцэл юм: түүний судалгааны ажил нь тухайн мөрийг LIBERO дээр тэгээс эхлэн, VLA урьдчилсан сургалтгүйгээр сургадаг бол, дээрх гурав нь урьдчилан сургасан шалгах цэгүүдийг нарийн тааруулдаг. 96.85-аас 97.5-ыг нэг бүлэг гэж үзэх ба 87.3%-ийн зөрүүг бодит боловч 6.7 дахин их параметрүүдээр олж авсан гэж үзнэ.
SimplerEnv нь тархалтыг харуулдаг бол LIBERO харуулдаггүй. NVIDIA нь N1.7-г N1.6-тай харьцуулсан нь үе хоорондын ялгааг харуулсан хамгийн ойрын олон нийтийн зүйл юм.
| SimplerEnv багц | N1.6 дундаж | N1.7 дундаж | Хамгийн сайн өөрчлөлт | Хамгийн муу өөрчлөлт |
|---|---|---|---|---|
| Bridge (WidowX), 7 даалгавар | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 даалгавар | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | байхгүй, даалгавар бүр сайжирсан |
Bridge мөр нь ашигтай нь: дунджаар 5.7 оноо нэмэгдсэн бол put_eggplant_in_basket 36 оноо алдаж, put_eggplant_in_sink 33-аас 2 болж буурсан. Шинэ үеийнхэн тархалтыг өргөх бус хөдөлгөдөг тул таны даалгавар N1.7 ухарсан газарт байвал дундаж нь юу ч хэлэхгүй.

Таваас зөвхөн SmolVLA-ийн судалгааны ажил SO-100 ангиллын гарны талаар мэдээлсэн: SmolVLA-д 78.3 хувь, Pi0-д 61.7 хувь гурван даалгаврын хувьд, хоёулаа олон даалгавартай, харин ACT-ийн нэг даалгаварт сургасан 48.3 хувьтай харьцуулахад адил биш юм. Цэвэр хослол нь SO-101 pick-and-place дээр хоёулаа нэг даалгавартай: тархалтад 90-ийн эсрэг 70, түүнээс гадуур 50-ийн эсрэг 40. Харьцуулахдаа ACT-ийг SmolVLA-тай харьцуулах болон Pi0.5-ийг SmolVLA-тай харьцуулах, эсвэл талбарыг үзэх.
Хоцролт болон зардал нь байршуулалтыг шийднэ
Дүгнэлт гаргах хоцрогдол нь хүмүүсийн хамгийн сүүлд олж мэддэг бөгөөд хамгийн түрүүнд харамсдаг хязгаарлалт юм. Үнэлгээний шалгуур үзүүлэлт дээр таван оноогоор илүү боловч үйлдлийн алхам тутамд хагас секунд зарцуулдаг бодлого таны ширээн дээр муу харагдана: холбоо барих динамик хүлээхгүй.
Нэг анхааруулга: GR00T-ийн үзүүлэлт нь NVIDIA-ийн карттай зөрчилдөж байна. Учир нь NVIDIA-ийн карт нь 4 дуу шуугиан арилгах алхам болон нэг камерыг H100 дээр eager горимд 85.8 мс, torch.compile-ээр 48.6 мс, бүрэн TensorRT-ээр 27.9 мс-ээр хэмждэг. Энд байгаа 152 мс нь зөвхөн урагш дамжуулалт биш, харин үйлчилгээний нэмэлт зардал болон нэгээс олон камертай бүхэл бүтэн системийн үзүүлэлт юм.
20-485 мс-ийн давталт нь загварынх бөгөөд олон нийтийн интернетийн эргэлтийн хугацаа үүнд нэмэгддэг. Алсын зайн дүгнэлт гаргах нь удаан сонгох-байрлуулах үйлдлийн хувьд боломжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй. Хэрэв таны даалгавар хурд шаарддаг бол дүгнэлт гаргах нь сервогийн хажууд байрлана: ACT эсвэл SmolVLA, орон нутагт. Холбогдох: бодлого хөдөлгөөний дунд хөлддөг.
Загварыг өөрчлөхгүйгээр цаг хугацаа хэмнэх нэг арга: SmolVLA-ийн баримт бичигт синхрон гүйцэтгэлийг хэмждэг бөгөөд энэ нь бодлого нь дараагийнхийг таамаглахаас өмнө нэг хэсгийг дуусгадаг, харин асинхрон гүйцэтгэлд таамаглал нь гүйцэтгэлтэй давхцдаг. Амжилт нь ижил төстэй, 78.3-ын эсрэг 73.3, гэхдээ ижил сонгох-байрлуулах үйлдэл 13.75 секундын оронд 9.7 секунд зарцуулдаг бөгөөд тогтмол хугацаанд робот 9 циклийн оронд 19 циклийг гүйцэтгэдэг.
Лицензүүд, хэн ч шалгадаггүй учраас шалгасан
| Модель | Жингийн лиценз | Кодын лиценз | Арилжааны зориулалт |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; карт нь арилжааны зориулалтаар ашиглахыг зөвшөөрдөг | Apache 2.0 | тийм |
| GR00T N1.5 | NVIDIA-ийн нэг талын арилжааны бус лиценз | Apache 2.0 | үгүй |
| Pi0.5 | pi05_base картын мета өгөгдөл нь license: gemma гэж заасан | Apache 2.0 (openpi, LeRobot docs) | хоёуланг нь уншсан, зөрчилдөж байна |
| SmolVLA | smolvla_base карт дээр лицензийн талбар байхгүй | Apache 2.0 (LeRobot) | код тийм, жин тодорхойгүй |
| ACT | үндсэн жин байхгүй | Apache 2.0 (LeRobot) | тийм |
Pi0.5 мөрөнд анхаарал хандуулах шаардлагатай. LeRobot pi05 баримт бичиг нь openpi-тай нийцтэйгээр Apache 2.0 гэж заасан, харин Hub карт нь lerobot/pi05_base нь license: gemma гэж заасан байна. Хоёулаа идэвхтэй байна. GR00T N1.7 нь зөөлөн хувилбартай: Isaac-GR00T README нь N1.7 нь Apache 2.0-ийн дагуу бүрэн арилжааны зориулалтаар лицензтэй гэж дурдагдсан, харин түүний өөрийн лицензийн хэсэг болон загварын карт нь зөвхөн кодыг Apache 2.0-ийн дор, жинг NVIDIA-ийн Open Model License-ийн дор байрлуулсан.
Таны бодитоор ажиллуулах үндсэн тохиргоонууд
Сургагч бүр өгөгдмөл тохиргоотой ирдэг бөгөөд тэдгээр нь дур зоргынх биш юм. ACT-ийнх нь LeRobot-ийн өөрийнх: batch 8, lr 1e-5, 100000 сургалтын алхамууд, chunk size 100, ACTConfig-тэй дээд урсгалд таарч байгаа бөгөөд k=100 ACT баримт бичгээс. Доорх нэг багана нь урхи юм.
| Бодлого | Багц | LR | Хамгийн их алхам | Градиент хуримтлал | Хэрэгжих үү? | Нэмэлт тохируулгууд |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T-ийн нарийн тааруулах эхлэлийн цэг (launch_finetune.py, tyro CLI) нь өөрийн тохиргооны dataclass-д seed талбаргүй тул ажиллагаанууд бит-битээр давтагдах боломжгүй юм. Репо нь мөн тодорхой бус зургийн өргөтгөлөөс үүдэлтэй ажиллагаа хоорондын 5-6 хувийн зөрүү байж болзошгүйг анхааруулдаг бөгөөд энэ нь онлайн хэлэлцэгддэг ихэнх бенчмаркийн ялгаанаас том юм. LeRobot-ийн өгөгдмөл seed нь 1000. Градиент хуримтлалын багана нь lerobot 0.5.1-ийг тайлбарладаг; дээд урсгалын 0.6.2 нь үүнийг --accelerator.gradient_accumulation.steps хэлбэрээр ил гаргадаг.
Моделийн сонголтоос илүү чухал тохируулга
Энэ бол үйлдлийн хэсэг юм. Урт хэсгүүд нь илүү жигд хөдөлгөөн, бага давхцах алдааг өгдөг боловч блок ажиллаж байх үед бодлого хэрэгждэг тул хөдөлж буй зүйлд хоцорч хариу үйлдэл үзүүлдэг: хөдөлгөөнгүй куб дээр итгэлтэй, өнхөрч буй куб дээр найдваргүй. Хэрэв хэтрүүлбэл, гүйцэтгэсэн хэсгийг богиносгох нь дахин сургахаас илүү үр дүнтэй бөгөөд үнэгүй. Дутуу зогссон үе нь өөр асуудал юм; үзнэ үү .
- ACT: ACTConfig нь анхдагчаар
chunk_size 100болонn_action_steps 100-тай байна. Цаг хугацааны хамтын ажиллагаа идэвхгүй бөгөөдn_action_steps 1шаарддаг. - GR00T N1.7: дотоод хязгаар нь 16-аас 40 болсон боловч LeRobot-ын SO-101 жишээ нь одоо ч
--policy.chunk_size=16 --policy.n_action_steps=16-аар ажиллаж байна. Rollout флагийг--execution-horizonболгон өөрчилсөн. - Pi0.5: 50 алхамтай хэсэг, үүнээс LeRobot-ын LIBERO жор нь
--policy.n_action_steps=10-аар 10-ыг гүйцэтгэдэг;--policy.pretrained_path-тай бол, хэрэв та флагийг орхигдуулбал 50 руу буцдаг. - SmolVLA: 50 үйлдлийн хэсгүүд, хоёр тохиргоо хоёулаа ил.
Тавууланг нь нэг үдээс хойш хэрхэн шалгах вэ
Хамгийн хямд хариулт бол илүү их унших биш. Ойролцоогоор 15 USD зарцуулж, гарт тань хэлүүлээрэй: нэг удаа бичлэг хийж, эхлээд хямд загварыг сургаж, өгөгдөл нь зөв болохыг баталсны дараа өргөжүүлээрэй. Бүтэц нь хэмжээнээс илүү чухал, энэ нь болон .
- 150 эпизодыг нэг удаа бүртгэх
GR00T, Pi0.5, ACT-д 50, SmolVLA-д 30-аар эхлэх нь хангалттай. Олон янзын хувилбаруудыг нимгэн тараахын оронд тус бүрийг нь давт: 5 шоо байрлалд 50 эпизод сургасан бөгөөд 25 нь сургагдаагүй байсан. Анхны өгөгдлийн сангаа бүртгэх-ийг үзнэ үү.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACT-ийг эхлээд сурга, учир нь энэ нь танд худал хэлэхгүй
Урьдчилан сургасан жин байхгүй тул, хэрэв энэ нь даалгаврыг гүйцэтгэж чадвал таны өгөгдлийн сан тухайн даалгаврыг агуулж байна гэсэн үг. Хэрэв ACT үр дүнгүй болвол өгөгдлийг засна уу. 24 ГБ карт дээр 1-3 ам.доллар, 2-5 цаг.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA-г ижил өгөгдлийн санд, өөрчлөлтгүйгээр ажиллуулах
Ижил өгөгдөл, ижил гар, 80 саяын оронд 450 сая параметр, дээр нь хэлний нөхцөл байдал. LeRobot нь нэг A100 дээр 20K алхамтай ажиллагааг ойролцоогоор 4 цагт гүйцэтгэдэг. Энэ нь урьдчилан сургалт ямар нэгэн үр өгөөжтэй эсэхийг танд хэлж өгнө.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T-д хүрэхээсээ өмнө v2.1 руу хөрвүүлэх
GR00T нь LeRobot v2 форматын хувилбарыг уншдаг бөгөөд нэмэлт
meta/modality.jsonнь нэгтгэсэн төлөв болон үйлдлийн массивуудыг нэрлэсэн талбаруудад хэрхэн хуваахыг харуулдаг. v3.0 өгөгдлийн сан нь уг ачаалагчийг унагадаг, учир нь v3.0 нь олон эпизодыг хуваалцсан файлуудад багцалдаг бол v2 нь эпизод тутамд нэгийг бичдэг байсан. Isaac-GR00T нь доошлуулах туслах хэрэгслийгscripts/lerobot_conversion/convert_v3_to_v2.pyхэлбэрээр нийлүүлдэг; v3-ийг татгалзах хуудас нь хурдан зам юм.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Эхний хоёр нь үр дүнгүй бол GR00T N1.7 руу шилжих
Энд үзүүлсэн NVIDIA-ийн CLI эсвэл LeRobot-ийн
grootбодлогын төрлөөр. NVIDIA нь нарийн тааруулахад 40 ГБ ба түүнээс дээш VRAM, дүгнэлт хийхэд 16 ГБ VRAM-ийг зөвлөж байна. OOM тохиолдолд OOM хуудас-ыг үзнэ үү.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Уг шалгалтын дамжуулалтыг ажиллуулах хоёр арга
Гурван орчин, учир нь хэрэгслийн гинжүүд хамт оршдоггүй. Үндсэн LeRobot нь 0.6.2 хувилбар бөгөөд Python 3.12 эсвэл түүнээс шинэ хувилбар шаарддаг; Isaac-GR00T болон openpi нь тусдаа uv-ээр удирддаг репозиториуд юм.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T нь
torchcodec0.8.0-ийг цорын ганц видео бэкэндээр ашигладаг бөгөөд FFmpeg 4-7 шаарддаг. FFmpeg 8 дэмжигддэггүй, AV1 баталгаагүй. - openpi санах ойн доод хязгаар: дүгнэлт хийхэд 8 ГБ-аас дээш, LoRA-д 22.5 ГБ-аас дээш, бүрэн нарийн тааруулахад 70 ГБ-аас дээш. Сүүлийнх нь Pi0.5-ийг A100-ийн ажил болгодог шалтгаан юм.
- GPU-г өөрөө түрээсэлж, дараа нь устгаж, гурван багц шалгалтын цэгийн замыг гараар тохируулна уу.
Ижил таван загвар, нэг хэлбэр. Загвар, өгөгдлийн сан, хэт параметрүүдийг сонгоно; бэкэнд нь шаардлагатай VRAM-аар хэмжигдсэн GPU-г түрээсэлж, сургагчийг ажиллуулж, объектын санах ойд бичдэг.
- Сургалтын матриц нь таван загвар, дөрвөн гар бөгөөд нэг нүд бүр нь гарын авлага юм: SO-100 дээрх SmolVLA, SO-101 дээрх ACT.
- Дүгнэлтийн подууд нь
/api/inference/pod-оор идэвхгүй хяналттайгаар автоматаар хангагддаг тул мартагдсан под чимээгүйгээр төлбөр тооцохгүй. - Үндсэн шалгалтын цэгүүд нь үйлдвэрлэгчдийн өөрсдийнх нь:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT-д байхгүй. - CLI-аас болон AI агентуудаас MCP сервер-ээр дамжуулан ижил үйлдлүүд.
- Тоног төхөөрөмж байхгүй юу? Шууд гар нь бүртгэлгүйгээр физик SO-100-г дамжуулдаг; турших хуудас нь орох аргуудыг харуулдаг.
Суурь загвар эсвэл эхнээс нь
Жинхэнэ сонголт бол аль 3B загварыг сонгох биш. Харин урьдчилан сургасан VLA-г ашиглах эсэх юм, учир нь ACT нь тус бүр арван минутын туршлагаас зургаан бодит хоёр гар ажиллагаатай даалгаврыг 80 сая параметр ашиглан сурсан бөгөөд юу ч урьдчилан сургагдаагүй байсан.
- Хэлний нөхцөл байдал. ACT-д байхгүй; нэг ACT шалгах цэг нэг даалгавар гүйцэтгэдэг.
- Таны туршлагад байхгүй объектууд дээр илүү сайн: SO-101 дээр, ACT-ийн тархалтаас гадуурх 40%-ийн эсрэг 50%.
- Олон даалгаварт: SmolVLA нь нэг шалгах цэгээр гурван SO-100 даалгаврын 78.3%-д хүрдэг; ACT-г зөвхөн нэг даалгаварт ажиллуулсан.
- 7.6-24 дахин их хоцрогдол: ACT-ийн 20 мс-ийн эсрэг үйлдлийн алхам тутамд 152-485 мс.
- 1-3-ын оронд ажиллагаа тутамд 4-12 ам.доллар, мөн 24 ГБ картны оронд A100 түвшний карт шаардагдана.
- Лицензийн эрсдэл, мөн эхнээс нь хийхэд байдаггүй хаалттай репо-гийн алдааны горим.
- Урьдчилан сургасан жин нь муу өгөгдлийн багцыг халхалж болно. Эвдэрсэн өгөгдөл дээр хагас ажилладаг нарийн тааруулалт нь таныг өгөгдлийг харахаас өмнө долоо хоногийн хугацаа шаардана.
Хуучин ажиллагааг давтах тохиолдол
2025 оны шалгах цэгийг хөөх нь таны загварын сонголтыг хийж, асуудлыг хувилбарын тогтоолт болгон хувиргадаг: одоогийн LeRobot нь N1.5-ыг хүлээн зөвшөөрөхгүй тул та lerobot==0.5.1. Үрийн талбар байхгүй, ажиллагаа хооронд 5-6 хувийн зөрүүтэй тул давталт нь бүтцийн хувьд ойролцоо байна. болон нь платформын талыг харуулна.

Хоёр болж буурав уу? ACT эсрэг GR00T N1.7 болон GR00T N1.7 эсрэг SmolVLA. Түүхий мөрүүд нь аренагийн бичлэгүүдэд байна: GR00T N1.7, Pi0.5, SmolVLA болон ACT.
Энэхүү платформ танд юугаар туслахгүй вэ
- Энэ нь алсын зайн дүгнэлтийг хурдан хийх боломжгүй. 20-485 мс-ийн давталт нь загварт хамаарах бөгөөд интернетийн эргэлтийн хугацаа үүнд нэмэгдэнэ.
- Энэ нь GR00T эсвэл Pi0.5-ийг таны өөрийн техник хангамж дээр нарийн тааруулах боломжгүй. Энд хоёулаа зөвхөн үүлэн системд ажиллах бөгөөд зөвхөн SmolVLA болон ACT л локал байдлаар ажиллана.
- Энэ нь өгөгдлийн багцыг засах боломжгүй. Алдагдал буурч байгаа ч бодлого юу ч хийхгүй байх нь өгөгдлийн асуудал, зөвхөн нэг тохиргоонд ажилладаг бодлого нь хамрах хүрээний асуудал юм.
- Энэ нь GR00T-ийн ажиллагааг давтагдахуйц болгох боломжгүй: эх үүсвэрийн тохиргоонд seed талбар байхгүй.
85 загвар, 332 бенчмарк үр дүн, тоо бүр нь эх сурвалжтайгаа холбогдсон
Энэ хуудасны хүснэгтүүдийн эрэмбэлэгдэх хувилбар: 85 хараа-хэл-үйлдэл загвар, 332 бенчмарк үр дүн, тус бүр нь өөрийн эх баримт бичиг эсвэл загварын карттай холбогдсон.
Ареныг нээхНэгийг сонгож, цааш үргэлжлүүлэх
Нэг үндсэн тохиргоо: 50 эпизод бичиж, өгөгдлийн багцыг батлахын тулд ACT-ийг 1-3 USD-ээр сургана, дараа нь SmolVLA-г ижил өгөгдөл дээр сургана. Нийтдээ 6 USD-ээс бага зардлаар, тэд хамгийн чухал асуултад хариулна: урьдчилсан сургалт энд тус болох уу, эсвэл саад бэрхшээл нь өгөгдөл үү. Хүрэлцээ ихтэй олон шатлалт даалгавруудад GR00T N1.7-г, үзэгдэл өөрчлөгдөхөд Pi0.5-г ашиглана.
Платформын тойм: анхны бодлогоо сургах, дараа нь анхны бодлогоо ажиллуулах. сургалтын баримт бичиг болон өгөгдлийн багцын баримт бичиг нь хэлбэр, форматыг хамарна; SO-100 хуудас болон SO-100-ийн иж бүрэн гарын авлага нь угсралт болон тохируулгыг хамарна. Үндсэн мэдээлэл: VLA-ийн тойм болон Pi0 урсгал тааруулах нийтлэл. Таны амжилтын хувийг нэмэгдүүлэх зүйл бол өгөгдлийн чанарын гарын авлага.
SO-100 дээр би эхлээд аль VLA бодлогыг сургах ёстой вэ?▾
ACT, дараа нь SmolVLA. ACT нь тэгээс эхлэн сургадаг тул муу өгөгдлийн багцыг нууж чадахгүй бөгөөд 24 GB карт дээр нэг ажиллуулалт 1-ээс 3 USD үнэтэй. Хэрэв ACT нь уг даалгаврыг гүйцэтгэж чадвал GR00T N1.7 эсвэл Pi0.5-ийн ажиллуулалтад зарцуулах 4-өөс 12 USD үнэ дэмий хоосон болохгүй.
GR00T N1.7 нь Pi0.5-аас үнэхээр илүү юу?▾
LIBERO дээр тэд дуу чимээний хязгаарт байна: GR00T N1.7-ийн хувьд дөрвөн багцад 97.0%, openpi-д 30k алхам дээр Pi0.5-ийн хувьд 96.85%, LeRobot портын хувьд 97.5%, бүгд өөр өөр хэрэгслээс. Жинхэнэ ялгаа нь нэг үйлдлийн алхамд 152 ms, 485 ms-ийн эсрэг, v2.1 өгөгдлийн багц v3.0-ийн эсрэг, мөн бенчмаркийн нарийвчлал нээлттэй ертөнцийн ерөнхийлөлтийн эсрэг байна.
Би эдгээрийн аль нэгийг нь нэг RTX 4090 дээр нарийн тааруулах боломжтой юу?▾
SmolVLA болон ACT, тийм ээ; хоёулаа RTX 4090 эсвэл ямар ч 24 GB карт дээр ажиллахаар жагсаагдсан бөгөөд локал байдлаар ажилладаг. GR00T N1.7, N1.5 болон Pi0.5 нь A100 эсвэл H100 80 GB шаарддаг бөгөөд энд зөвхөн үүлэн дээр ажилладаг. NVIDIA нь GR00T-ийг нарийн тааруулахад 40 GB ба түүнээс дээш хэмжээг зөвлөж байна; openpi-ийн доод хязгаар нь Pi0.5-ийг бүрэн нарийн тааруулахад 70 GB-аас дээш, LoRA-д 22.5 GB байна.
Эдгээр тавын алийг нь би арилжааны зорилгоор ашиглаж болох вэ?▾
GR00T N1.7-ийн жингүүд нь NVIDIA Open Model License Agreement-ийн дор байдаг бөгөөд энэ нь арилжааны зорилгоор ашиглахыг зөвшөөрдөг гэж карт дээр бичсэн байна. N1.5-ийн жингүүд нь арилжааны бус. SmolVLA-ийн код нь LeRobot-д Apache 2.0 боловч lerobot/smolvla_base карт нь лицензийн талбаргүй тул жингүүд нь тодорхойгүй байна. ACT нь лицензлэх суурь жингүй. Pi0.5 нь тодорхойгүй: LeRobot-ийн баримт бичигт Apache 2.0 гэж бичсэн байхад, түүний картын мета өгөгдөл нь license: gemma гэж заасан байна.
Sources
- NVIDIA Isaac-GR00T репозитори: GA статус, N1.6-аас N1.7 хүртэлх өөрчлөлтүүд, техник хангамжийн шаардлага, torchcodec болон FFmpeg хязгаарлалтууд, launch_finetune.py, ажиллуулалт хоорондын ялгаа
- nvidia/GR00T-N1.7-3B загварын карт: Cosmos-Reason2-2B үндсэн бүтэц, 3 B параметр, дүгнэлтийн хугацааны хүснэгт, NVIDIA Open Model License, Model Version талбар
- nvidia/GR00T-N1.5-3B загварын карт: Eagle 2 лавлагаа, SigLip2 болон T5, урсгалын тааруулагч DiT, нэг талын арилжааны бус лиценз
- Isaac-GR00T LIBERO жишээ: багц тус бүрийн амжилтын хувь 20K алхам болон 640 багц хэмжээтэй, багц тус бүрт 200 туршилт
- Isaac-GR00T SimplerEnv жишээ: даалгавар тус бүрийн Bridge болон Fractal амжилтын хувь, GR00T N1.6 N1.7-ийн эсрэг
- pi0.5: Нээлттэй ертөнцийн ерөнхийлөлттэй Хараа-Хэл-Үйлдлийн Загвар (2 B VLM нэмэх нь 300 M үйлдлийн мэргэжилтэн, 50 Hz хяналт, ойролцоогоор 400 цагийн хөдөлгөөнт манипуляци, 3-аас 104 байршилд хийсэн өргөтгөлийн судалгаа)
- openpi репозитори: GPU санах ойн доод хязгаар, зөвхөн урсгалын тааруулагч толгойн хамрах хүрээ, мөн examples/libero дахь Pi0.5 LIBERO үр дүнгүүд
- lerobot/pi05_base загварын карт: LeRobot портын хамрах хүрээ, license: gemma мета өгөгдөл, lerobot-train ашиглалт
- LeRobot pi0.5 баримт бичиг: хаалттай PaliGemma токенизатор, LIBERO нөхөн үржих хүснэгт, n_action_steps буцах хавх, Apache 2.0 мэдэгдэл
- SmolVLA: Хямд бөгөөд Үр Ашигтай Роботын Хараа-Хэл-Үйлдлийн Загвар (450 M параметр, LIBERO болон Meta-World хүснэгтүүд, SO-100 болон SO-101 үр дүнгүүд, асинхрон дүгнэлт)
- LeRobot SmolVLA баримт бичиг: 5 байршилд 50 анги 25-ын эсрэг, A100 дээр ойролцоогоор 4 цагийн дотор 20k алхам
- Бага зардлын техник хангамжтай нарийн хоёр гарны манипуляци сурах (ACT болон ALOHA): 80-90 хувийн амжилттай 6 даалгавар, k=1-ээс k=100 хүртэлх хэсгийн хэмжээний абляци
- LeRobot 0.6.2: ACTConfig болон SmolVLAConfig-ийн анхдагч утгууд, анхдагч seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 шаардлага, Apache 2.0
- LeRobot GR00T баримт бичиг: бодлогын төрөл groot, N1.5 дэмжлэг хасагдсан, pin lerobot==0.5.1, SO-101 хэсгийн хэмжээний жишээ
- lerobot/smolvla_base загварын карт: --policy.path-аар ашиглагддаг SmolVLA суурь чекпойнт, болон түүний картын мета өгөгдөл, энэ нь лицензийн талбаргүй
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started