Policy oʻqitish
AY-Robots manipulyatsiya policylarini boshqariladigan GPU'larda oʻqitadi, shuning uchun yozib olingan epizodlardan qoʻlingizda ishlaydigan policygacha oʻz oʻqitish uskunangizsiz yeta olasiz. Bu sahifa qoʻllab-quvvatlanadigan policy turlarini, oʻqitish jarayoni sahifasini, checkpointlarni va epizod sonidan realistik nima kutish mumkinligini yoritadi.
Oxirgi yangilangan 2026-08-09
Oʻz GPU'ngizsiz oʻqitish
Manipulyatsiya policysini oʻqitish GPU yuklamasi, zamonaviy vision-language-action modellari esa odatiy workstation'dan koʻra koʻproq VRAM talab qiladi. AY-Robots'da oʻqitish platforma boshqaradigan bulutli GPU'larda ishlaydi: dataset va policy turini tanlaysiz, jarayonni ishga tushirasiz va uning borishini brauzerdan kuzatasiz. CUDA sozlash, drayver moslashtirish yoki saqlash kerak boʻlgan muhit yoʻq.
Kiritma har doim Dashboard > Datasets dagi bulutli dataset. Teleoperatsiya sessiyalari orqali yozib olgan yoki LeRobot formatida yuklagan har qanday narsa, jumladan birlashtirilgan datasetlar ham, mos keladi. Oʻqitishdan oldin kuratsiya qiling: Failure deb belgilangan epizodlar odatda oʻqitish toʻplamidan tashqarida qolishi kerak, epizod brauzerida oʻn daqiqalik koʻrib chiqish esa yomon demonstratsiyalardan oʻrganishga sarflanadigan soatlab GPU vaqtini tejaydi.
Qoʻllab-quvvatlanadigan policylar
Toʻrtta policy oilasi qoʻllab-quvvatlanadi. Ular hajmi, oʻqitish narxi va maʼlumotingizdan qancha oʻzlashtira olishida farq qiladi, shuning uchun toʻgʻri tanlov har qanday umumiy reytingdan koʻra vazifangiz va datasetingizga koʻproq bogʻliq.
| Policy | Turi | Xususiyatlari |
|---|---|---|
| ACT | Transformer, action chunking | Yakka qadamlar oʻrniga kelajak harakatlarining qisqa boʻlaklarini bashorat qiladi. Ixcham, nisbatan tez oʻqitiladi va yagona, aniq belgilangan vazifa uchun ishonchli birinchi tanlov. |
| Diffusion Policy | Harakat ketma-ketliklari boʻyicha diffusion | Demonstratsiya qilingan harakatlarning toʻliq taqsimotini modellashtiradi, bu esa demonstratsiyalaringiz vazifani bir necha toʻgʻri usulda yechganda foydali. ACT ga qaraganda oʻqitish ogʻirroq va inference'da sekinroq. |
| SmolVLA | Kichik vision-language-action modeli | Til bilan shartlangan: epizodlaringizdagi vazifa matni kiritmaning bir qismiga aylanadi. Katta foundation modelsiz til shartlanishini istaganingizda yaxshi oʻrta yoʻl. |
| GR00T fine-tune | Foundation model fine-tune | Katta oldindan oʻqitilgan robotika foundation modelini epizodlaringizda fine-tune qiladi. Toʻrttasi orasida eng yuqori chegara, eng yuqori oʻqitish narxi va qat'iy dataset format talabi bilan. |
GR00T fine-tuning faqat LeRobot format versiyasi 2.1 dagi datasetlarni qabul qiladi. v3.0 dataseti topshirishda emas, maʼlumot yuklanayotganda muvaffaqiyatsiz boʻladi, shuning uchun jarayonni boshlashdan oldin format versiyasini tekshiring. Platformada yozilgan datasetlar boʻlgan holicha ishlatilishi mumkin; tashqi yuklamalar uchun avval meta/info.json dagi versiyani tekshiring.
Jarayonni boshlash
- 1Datasetni tanlang
Dashboard > Training ni oching va qaysi datasetda oʻqitish kerakligini tanlang. Toʻgʻri tanlaganingizni tasdiqlash uchun epizod soni va robot turi koʻrsatiladi.
- 2Policyni tanlang
Qoʻllab-quvvatlanadigan policy turlaridan birini tanlang. Ishonchingiz komil boʻlmasa, ACT dan boshlang: bu datasetingiz umuman biror narsani oʻqitishga yetarlicha yaxshimi yoki yoʻqligini bilishning eng arzon yoʻli.
- 3Ishga tushiring
Jarayonni boshlang. U job id va oʻzining jarayon sahifasini oladi, brauzerni yopishingiz mumkin: oʻqitish serverda davom etadi, sahifa esa qaytganingizda jonli holatni koʻrsatadi.
Oʻqitish jarayoni sahifasi
Har bir jarayon oʻqitish davomida haqiqatan koʻngilda boʻladigan ikkita savolga javob beradigan alohida sahifaga ega: u oʻrganyaptimi, va mashina soglommi. Oʻrganish jarayoni loss, learning rate jadvali va gradient normasi grafiklari sifatida koʻrsatiladi. Darhol tekislanib qoladigan loss yoki portlab ketadigan gradient normasi jarayonni kutish arzimasligini erta bildiradi.
Mashina soglomligi yonida koʻrsatiladi: GPU yuklamasi va xotirasi, shuningdek oʻqitish mashinasining host metrikasi. Bosqich vaqt jadvali jarayon hozir qayerda ekanini koʻrsatadi, muhit tayyorlashdan tortib maʼlumot yuklashgacha, oʻqitish siklining oʻzigacha va checkpoint yuklashgacha. Nimadir notoʻgʻri koʻrinsa, oʻrnatilgan log koʻruvchi SSH kirishisiz xom oʻqitish loglarini beradi, bu esa odatda muvaffaqiyatsizlik datasetingizdami yoki jarayonning oʻzidami ekanini koʻrish uchun yetarli.
Checkpointlar va davom ettirish
Checkpointlar umumiy pulda emas, har bir jarayon boʻyicha alohida saqlanadi, shuning uchun jarayon sahifasida sanab oʻtilgan checkpointlar doim aynan shu jarayonga va uning konfiguratsiyasiga tegishli. Bu koʻrinishidan koʻra muhimroq: turli sozlamalarga ega jarayonlar orasida checkpointlarni aralashtirish sezilmasdan buzilgan policylarning klassik sababi.
Jarayon uzilib qolsa, boshidan boshlash oʻrniga uning oxirgi checkpointidan davom ettira olasiz. Oraliq checkpointlar oʻzlari ham foydali: uzun jarayon oxiriga yaqin overfitting boshlasa, oldingi checkpoint koʻpincha haqiqiy qoʻlda yakuniysiga qaraganda yaxshiroq ishlaydi.
Oʻqitilgan policyni qoʻlingizda ishga tushirish
Tugallangan policy toʻgʻridan-toʻgʻri robotingizga qaytarib joylashtirilishi mumkin. Kokpitda ulangan qoʻlingiz uchun oʻqitilgan policyni tanlang va inference ni boshlang: policy endi avval teleoperatsiya orqali siz yaratgan boʻgʻim buyruqlarini yaratadi. Qoʻl dataset yozilgan aynan shu robot turi boʻlishi kerak, sahna esa, jumladan kamera joylashuvi, oʻqitish sahnalariga oʻxshash boʻlishi kerak.
Birinchi inference jarayonlarini namoyish emas, tajriba deb qarang. Favqulodda toʻxtatishni qoʻl yetadigan joyda saqlang, siz demonstratsiya qilganingizga yaqin boshlangʻich holatdan boshlang va policy siz sezmaydigan narsalarga sezgir boʻlishini kuting: koʻchgan kamera, boshqa yoritish yoki datasetda hech qachon boʻlmagan predmet.
Sizga qancha epizod kerak
Platformadagi eng koʻp uchraydigan oʻqitish xatosi notoʻgʻri giperparametr emas, juda kam maʼlumotda oʻqitib, policy turi ishlamaydi degan xulosaga kelish. Yagona stol vazifasi uchun taxminiy qoida: taxminan 50 epizod sizga demonstratsiya qilganingizga yaqin boshlangʻich holatlardan muvaffaqiyatga erishadigan tor generalizatsiyali policy beradi. Taxminan 100 dan 200 gacha epizod esa, epizodlar orasida predmet joylashuvini oʻzgartirgan boʻlsangiz, shu bitta vazifa uchun ish maydoni boʻylab foydali barqarorlikni beradi.
Qobiliyatliroq policy turlari bu qoidani bekor qilmaydi. 20 epizoddagi GR00T fine-tune baribir yomon generalizatsiya qiladi; kattaroq modellar sizga sotadigan narsa maʼlumot mavjud boʻlgach yuqoriroq chegara. Byudjetingiz cheklangan boʻlsa, uni avval koʻproq va xilma-xil epizodlarga, keyin kattaroq modelga sarflang.
Koʻp beriladigan savollar
Oʻqitish jarayoni qancha vaqt oladi?▾
Bu policy turi va dataset hajmiga bogʻliq, shuning uchun halol yagona raqam yoʻq. ACT toʻrttasi orasida odatda eng tezi, GR00T fine-tune esa eng sekini. Jarayon sahifasidagi bosqich vaqt jadvali va loss grafiklari jarayon rivojlanayotganini erta koʻrsatadi.
Birlashtirilgan datasetda oʻqita olamanmi?▾
Ha. Birlashtirilgan datasetlar oddiy datasetlar; birlashtirish tekshiruvi izchil fps, xususiyatlar va robot turini allaqachon kafolatlagan. Bir xil vazifaning yozuvlarini birlashtirish 100 dan 200 gacha epizod diapazoniga yetishning eng samarali usullaridan biri.
GR00T jarayonim maʼlumot yuklashda muvaffaqiyatsiz boʻlyapti. Birinchi nimani tekshirishim kerak?▾
Dataset format versiyasini. GR00T fine-tuning LeRobot v2.1 ni talab qiladi, v3.0 dataseti esa aynan shu yerda muvaffaqiyatsiz boʻladi. Datasetingizning meta/info.json dagi versiyasini tekshiring.
Oʻqitishdan oldin muvaffaqiyatsiz epizodlarni olib tashlashim kerakmi?▾
Odatda ha. Failure deb belgilangan epizodlar policyga muvaffaqiyatsiz xatti-harakatni oʻrgatadi. Recovery epizodlari boshqacha: ular xatoni qanday tuzatishni koʻrsatadi va koʻpincha saqlab qolishga arziydi.
Oʻqitish davomida brauzerni ochiq saqlashim kerakmi?▾
Yoʻq. Jarayonlar serverda ishlaydi. Jarayon sahifasi qaytganingizda joriy holatni, grafiklarni va loglarni koʻrsatadi, checkpointlar esa kimdir kuzatib turadimi yoki yoʻqmi, bundan qat'i nazar saqlanadi.
AY-Robots teleoperatsiya yozuvlarini LeRobot formatida qanday saqlaydi: epizod tuzilishi, boshqaruv panelidagi epizod brauzeri, yuklamalarni birlashtirish va bozor.
AY-Robots'da qoʻllab-quvvatlanadigan har bir robot qoʻli va uning texnik xususiyatlari: SO-100, Koch v1.1, Franka FR3, FP3 va Panda, WidowX-250, ALOHA ViperX-300.