Бодлого сургалт

AY-Robots манипуляцийн бодлогыг удирдагдсан GPU дээр сургадаг тул та бичигдсэн эпизодоос гар дээрээ ажиллаж буй бодлого хүртэл өөрийн сургалтын техник хангамжгүйгээр хүрч болно. Энэ хуудас дэмжигддэг бодлогын төрлүүд, сургалтын явцын хуудас, checkpoint, эпизодын тооноос бодитоор юу хүлээж болохыг хамардаг.

Сүүлд шинэчилсэн 2026-08-09

Өөрийн GPU-гүйгээр сургах

Манипуляцийн бодлого сургах нь GPU ачаалал бөгөөд орчин үеийн vision-language-action загварууд ердийн ажлын станцаас илүү VRAM шаарддаг. AY-Robots дээр сургалт платформ удирддаг үүлэн GPU дээр явагддаг: та өгөгдлийн багц, бодлогын төрлийг сонгоод, явцыг эхлүүлж, түүний явцыг браузераасаа ажиглана. CUDA тохиргоо, драйверийн зохицуулга, арчлах орчин байхгүй.

Оруулга ямагт Dashboard > Datasets дэх үүлэн өгөгдлийн багц юм. Телеудирдлагын сешнээр бичсэн эсвэл LeRobot форматаар байршуулсан аливаа зүйл, нэгтгэсэн өгөгдлийн багц ч оролцоно. Сургахаасаа өмнө сонгож сайжруул: Failure тэмдэглэгээтэй эпизодууд ихэвчлэн сургалтын багцад орох ёсгүй, эпизодын хөтчид арван минут шалгах нь муу демонстрациас сурахад зарцуулагдах олон цагийн GPU хугацааг хэмнэдэг.

Дэмжигддэг бодлогууд

Дөрвөн бодлогын гэр бүл дэмжигддэг. Тэдгээр хэмжээ, сургалтын өртөг, өгөгдлөөс тань хэр их шингээж чадах талаараа ялгаатай тул зөв сонголт нь ямар ч ерөнхий чансаанаас илүү таны даалгавар, өгөгдлийн багцаас хамаардаг.

БодлогоТөрөлОнцлог
ACTTransformer, action chunkingГанц алхмуудын оронд ирээдүйн үйлдлүүдийн богино блокуудыг таамаглана. Компакт, харьцангуй хурдан сургагддаг бөгөөд нэг сайн тодорхойлогдсон даалгаврын хувьд найдвартай эхний сонголт.
Diffusion PolicyҮйлдлийн дараалал дээрх diffusionДемонстрацласан үйлдлүүдийн бүрэн тархалтыг загварчилдаг бөгөөд энэ нь демонстрациуд чинь даалгаврыг нэгээс олон зөв аргаар шийддэг үед тустай. ACT-аас илүү хүнд сургагддаг, inference дээр удаан.
SmolVLAЖижиг vision-language-action загварХэлээр нөхцөлдсөн: эпизодуудын тань даалгаврын мөр оруулгын нэг хэсэг болдог. Том foundation загваргүйгээр хэлний нөхцөлдлийг хүсэж байгаа үед сайн дундаж зам.
GR00T нарийн тохируулгаFoundation загварын нарийн тохируулгаУрьдчилан сургагдсан том робот техникийн foundation загварыг эпизодууд дээр тань нарийн тохируулдаг. Дөрвийн дундаас хамгийн өндөр таазтай, хамгийн өндөр сургалтын өртөгтэй, өгөгдлийн форматын хатуу шаардлагатай.
GR00T-д LeRobot v2.1 өгөгдлийн багц шаардлагатай

GR00T нарийн тохируулга зөвхөн LeRobot формат хувилбар 2.1 дахь өгөгдлийн багцыг хүлээн авдаг. v3.0 өгөгдлийн багц илгээхэд биш, өгөгдөл ачаалах үед амжилтгүй болдог тул явцыг эхлүүлэхээсээ өмнө форматын хувилбарыг шалга. Платформ дээр бичигдсэн өгөгдлийн багцуудыг байгаа хэвээр нь ашиглаж болно; гадаад байршуулалтын хувьд эхлээд meta/info.json дахь хувилбарыг шалгаарай.

Явц эхлүүлэх

  1. 1
    Өгөгдлийн багцыг сонго

    Dashboard > Training-ийг нээж сургах өгөгдлийн багцаа сонго. Зөв сонгосон эсэхийг батлахын тулд эпизодын тоо, роботын төрөл харагдана.

  2. 2
    Бодлогыг сонго

    Дэмжигддэг бодлогын төрлүүдийн нэгийг сонго. Итгэлгүй байвал ACT-аас эхэл: энэ бол өгөгдлийн багц тань ямар нэг зүйлийг сургахад хангалттай сайн эсэхийг мэдэх хамгийн хямд арга.

  3. 3
    Эхлүүл

    Явцыг эхлүүл. Энэ нь job id, өөрийн явцын хуудсыг авдаг тул браузерээ хааж болно: сургалт серверийн талд үргэлжилж, буцаж ирэх бүрт хуудас шууд төлөвийг харуулдаг.

Сургалтын явцын хуудас

Явц бүр сургалтын явцад бодитоор гарч ирдэг хоёр асуултад хариулдаг тусгай хуудастай: энэ сурч байгаа юу, машин эрүүл юу. Суралцах явц loss, learning rate хуваарь, gradient норм графикаар харагдана. Шууд тэгш болох loss эсвэл дэлбэрч буй gradient норм явцыг хүлээх нь зохисгүй гэдгийг эрт харуулдаг.

Машины эрүүл байдал хажууд харагддаг: GPU ачаалал, санах ой, түүнчлэн сургалтын машины host метрик. Шатны хугацааны шугам явц одоо хаана байгааг харуулдаг, орчин бэлтгэхээс эхлээд өгөгдөл ачаалах, сургалтын циклийн өөрийг нь дамжин, checkpoint байршуулах хүртэл. Ямар нэг зүйл эвгүй харагдвал суулгагдсан лог үзэгч SSH хандалтгүйгээр түүхий сургалтын логуудыг өгдөг, энэ нь ихэвчлэн алдаа өгөгдлийн багцад тань юу эсвэл явцад тань юу байгааг харахад хангалттай.

Checkpoint ба үргэлжлүүлэх

Checkpoint нэгдсэн санд биш, явц бүрд тусад нь хадгалагддаг тул явцын хуудсанд жагссан checkpoint нь ямагт яг тэр явц болон түүний тохиргоонд харьяалагддаг. Энэ харагдахаас илүү чухал: өөр өөр тохиргоотой явцуудын checkpoint-ийг холих нь чимээгүйхэн эвдэрсэн бодлогын сонгодог шалтгаан юм.

Явц тасалдвал шинээр эхлэхийн оронд түүний сүүлийн checkpoint-оос үргэлжлүүлж болно. Завсрын checkpoint нь өөрөө ч ашигтай: урт явц төгсгөл рүүгээ overfitting эхлэхэд өмнөх checkpoint ихэвчлэн жинхэнэ гар дээр эцсийнхээс сайн ажилладаг.

Сургагдсан бодлогыг гар дээрээ ажиллуулах

Дуусгасан бодлогыг шууд роботруу тань буцааж байршуулж болно. Кокпитод холбогдсон гартаа зориулсан сургагдсан бодлогыг сонгож inference эхлүүл: бодлого одоо өмнө нь та телеудирдлагаар үйлдвэрлэдэг байсан үений тушаалуудыг гаргадаг болно. Гар өгөгдлийн багц бичигдсэн яг тэр роботын төрөл байх ёстой, дэлгэц нь камерын байрлал орсон, сургалтын дэлгэцтэй төстэй байх ёстой.

Эхний inference явцуудыг үзүүлэн гэлтгүй туршилт гэж хандаарай. Яаралтай зогсоолтыг гар хүрэх зайд байлга, та демонстрацласан зүйлд ойрхон эхлэх төлөвөөс эхэл, бодлого чиний анзаарахгүй зүйлд мэдрэмтгий байхыг хүлээж бай: зөрсөн камер, өөр гэрэлтүүлэг, эсвэл өгөгдлийн багцад хэзээ ч байгаагүй объект.

Хэдэн эпизод хэрэгтэй вэ

Платформ дээрх хамгийн түгээмэл сургалтын алдаа буруу гиперпараметр биш, хэт бага өгөгдөл дээр сургаад бодлогын төрөл ажиллахгүй гэсэн дүгнэлт хийх явдал юм. Нэг ширээний даалгаврын хувьд ерөнхий дүрэм: ойролцоогоор 50 эпизод демонстрацласантайгаа ойрхон эхлэх төлөвөөс амжилттай ажилладаг нарийн ерөнхийлөлттэй бодлого өгдөг. 100-200 эпизод, эпизодуудын хооронд объектын байрлалыг өөрчилсөн бол, тэр нэг даалгаврын хувьд ажлын орон зайд ашиглах боломжтой бат бэхийг өгдөг.

Илүү чадвартай бодлогын төрлүүд ч энэ дүрмийг цуцалдаггүй. 20 эпизод дээрх GR00T нарийн тохируулга нэвтэрхий байдлаараа муу ерөнхийлөлттэй хэвээр байна; илүү том загварууд чамд юу худалддаг вэ гэвэл өгөгдөл байгаа үед илүү өндөр таазыг л худалддаг. Төсөв тань хязгаарлагдмал бол эхлээд илүү олон, олон янзын эпизодэд, дараа нь илүү том загварт зарцуул.

Түгээмэл асуултууд

Сургалтын явц хэр удаан үргэлжилдэг вэ?

Энэ бодлогын төрөл, өгөгдлийн багцын хэмжээнээс хамаарна тул шударга ганц тоо байхгүй. ACT дөрвийн дундаас ихэвчлэн хамгийн хурдан, GR00T нарийн тохируулга хамгийн удаан. Явцын хуудсан дахь шатны хугацааны шугам, loss график явц урагшилж байгаа эсэхийг эрт харуулдаг.

Нэгтгэсэн өгөгдлийн багц дээр сургаж болох уу?

Тийм. Нэгтгэсэн өгөгдлийн багц энгийн өгөгдлийн багц; нэгтгэлтийн баталгаажуулалт fps, шинж чанар, роботын төрлийн тогтвортой байдлыг аль хэдийн баталсан. Ижил даалгаврын бичлэгүүдийг нэгтгэх нь 100-200 эпизодын мужид хүрэх хамгийн үр дүнтэй аргуудын нэг юм.

GR00T явц маань өгөгдөл ачаалахад амжилтгүй болж байна. Юуг эхлээд шалгах вэ?

Өгөгдлийн багцын форматын хувилбар. GR00T нарийн тохируулга LeRobot v2.1 шаарддаг бөгөөд v3.0 өгөгдлийн багц яг энэ цэгт амжилтгүй болдог. Өгөгдлийн багцынхаа meta/info.json дахь хувилбарыг шалгаарай.

Сургахаасаа өмнө амжилтгүй эпизодуудыг устгах ёстой юу?

Ихэвчлэн тийм. Failure тэмдэглэгээтэй эпизодууд бодлогод амжилтгүй зан үйлийг заадаг. Recovery эпизодууд өөр: тэдгээр нь алдааг хэрхэн засахыг харуулдаг тул хадгалахад ихэвчлэн үнэ цэнэтэй.

Сургалтын явцад браузерээ нээлттэй байлгах шаардлагатай юу?

Үгүй. Явцууд серверийн талд ажилладаг. Явцын хуудас буцаж ирэх бүрд одоогийн төлөв, график, логуудыг харуулдаг бөгөөд checkpoint хэн нэг харж байгаа эсэхээс үл хамааран хадгалагддаг.