Stol ustidagi arzon SO-100 robot qo'li, teleoperatsiya va siyosatni o'qitish uchun sozlangan
DAggerSO-100Taqlid orqali o'rganishVLATeleoperatsiya

SO-100'da VLA siyosati bilan DAgger tsiklini ishga tushirish

AY-Robots ResearchAugust 27, 202615 daqiqalik o'qish

SO-100 qo'lida inson nazorati ostidagi bitta DAgger bosqichining bosqichma-bosqich tavsifi: siyosatni ishga tushirib yozib olish, xato ketganda nazoratni qo'lga olish, ishlashni tuzatish sifatida qayd etish, aralash dataset tuzish va checkpointdan o'qitishni davom ettirish. Leader qo'l bo'lmaganlar uchun klaviatura va slayder orqali nazoratni qo'lga olish yo'li, shuningdek, bosqichni foydasiz qiladigan to'rtta xatoni ham o'z ichiga oladi.

Sizning siyosatingiz ishlayapti. U kubga cho'ziladi, greyferni bir santimetr erta yopadi va xuddi uni ushlagandek davom etadi. Hech qanday xato chiqmaydi, va o'qitish yo'qotishiga qancha tikilmang, buni tushuntirib bera olmaysiz. Yechim xuddi shu namoyishlar ustida yana 20 000 gradient qadami emas. Yechim - qo'lingizni aynan xato ketgan joyda qo'lga qaytarib qo'yish, o'rniga nima qilganingizni yozib olish va keyingi checkpointni eski ma'lumotlar ustiga o'sha tuzatishni qo'shib o'qitish. Bu DAgger bosqichi, va mana shunday bosqich SO-100 qurilmasida vision-language-action siyosati bilan qanday ishlashi shu.

Nazariya boshqa joyda: dataset agregatsiyasi umuman nega ishlaydi va inson nazorati unda nimani o'zgartiradi degan savollarga javob beradi. Bu ishlatish qo'llanmasi bo'lib, o'qitilgan checkpoint, ishlaydigan kamera to'plami va harakatlanadigan qo'l borligini nazarda tutadi. Quyidagi olti qadam ushbu platformaning DAgger sahifasida amalga oshirilgan tsikl bo'lib, ammo ketma-ketlik o'zingizning skriptlaringizda ham xuddi shunday bo'ladi.

Bir bosqich qisqacha

  • O'qitilgan siyosatni ishga tushiring va uni umumiy teleoperatsiya belgisi emas, balki o'sha ishlash uchun vazifa matni bilan yozib oling.
  • Xatti-harakat xato ketgan zahoti nazoratni qo'lga oling: leader qo'l bilan ko'zgu (mirror) orqali topshirish, u bo'lmasa klaviatura yoki slayderlar orqali darhol va qo'lda.
  • Har bir ishlashni saralang: uni tuzatish sifatida qayd eting, baholash epizodi sifatida saqlang yoki bekor qiling.
  • Aralashmani qo'lda tuzing - asl namoyishlar ustiga tuzatishlar qo'shiladi, epizodlar har bir manba bo'yicha tanlanadi. Hech qachon faqat tuzatishlar ustida o'qitmang.
  • So'nggi checkpointdan o'qitishni davom ettiring va qaysi checkpoint qaysi aralashmani hosil qilganini qayd eting.
  • Bosqichning foydali bo'lgan-bo'lmaganini ko'rsatadigan raqam - bu o'qitish yo'qotishi emas, aralashuv darajasidir.

Nega ikkinchi bosqich shunchaki ko'proq ma'lumot emas

Behavior cloning inson tashrif buyurgan holatlar ustida o'qitiladi. Test vaqtida esa siyosat o'zi keltirib chiqargan holatlarga tashrif buyuradi, va kichik harakat xatolari birlashib, hech qanday namoyish qamrab olmagan holatlarga olib keladi. Ross, Gordon va Bagnell bu muammoni AISTATS 2011 uchun rasmiylashtirdi va uni statsionar deterministik siyosatni o'qitadigan iterativ algoritm bilan hal qildi - ularning qisqartirishi bo'yicha bu siyosat o'zi keltirib chiqargan holatlar taqsimoti ostida yaxshi ishlashi kerak: joriy siyosatni ishga tushiring, ekspertga u haqiqatan yetib borgan holatlarni belgilashini so'rang, ularni datasetga qo'shing, qayta o'qiting, takrorlang. Kelly va boshqalar bu so'rovni HG-DAgger bilan amaliy qildilar - unda inson boshqaruv dastagini ushlab turmasdan holatlarni belgilash o'rniga, qachon nazoratni qo'lga olishni o'zi hal qiladi; ular simulyatsiya qilingan va real avtonom haydash vazifasida ham DAgger, ham behavior cloning'dan yaxshiroq natija berganini xabar qiladilar. Inson nazorati aynan stol usti qo'lida tsiklni chidab bo'ladigan qiladi - qo'llaringizni faqat nimadir noto'g'ri ketayotganda harakatlantirasiz.

Amaliyotda nazariyaga qaraganda ikkita natija ko'proq ahamiyatga ega. Tuzatishlar oddiy namoyishlar emas: ular Mandlekar va boshqalar tasvirlagan tor joy (bottleneck) hududlarida to'planadi, u yerda kichik og'ish siyosatni namoyishlar hech qachon qamrab olmagan holatlarga tushiradi. Va faqat o'sha qiyin qismlardan iborat dataset yomon shakllangan dataset hisoblanadi - Belkhale, Cui va Sadigh ma'lumot tomonidan holat xilma-xilligi har doim ham foydali emasligini, balki harakat farqlanishi va o'tish xilma-xilligi birgalikda dataset sifatini belgilashini ta'kidlaydilar. Aralash dataset kelishuv emas, u aynan maqsaddir.

Birinchi bosqichdan oldin quyidagilarni qat'iy saqlang

DAgger bosqichi siyosatni vaqt bo'ylab o'zi bilan solishtiradi. Bosqichlar orasida dataset bo'lmagan har qanday o'zgartirish bu solishtirishni mazmunsiz qiladi.

  • Kamera joylashuvi va mahkamlagichlari, bilak kamerasi ham shu jumladan. Bitta qisqichni bo'shatsangiz, siyosatni emas, kuzatuv taqsimotini o'zgartirgan bo'lasiz.
  • Ekspozitsiya va oq balans, agar sizning yozib olish tizimingiz ularni qotirishga imkon bersa. Bosqichlar orasida avto-ekspozitsiyaning siljishi sekin va ko'zga ko'rinmaydigan domen siljishidir.
  • Qo'l kalibrovkasi va servolarning nol holatlari. Agar qayta kalibrovka qilishga majbur bo'lsangiz, undan oldin yozilgan hamma narsani alohida dataset sifatida ko'ring.
  • Vazifa matni. Bu yerdagi har bir VLA aynan shunga asoslanadi; tsikl o'rtasida uni qayta ta'riflash boshqa vazifa demakdir.
  • Yoritish, stol yuzasi, buyumlar to'plami. Yangi buyum - bu yangi tajriba, keyingi bosqich emas.
  • Yozib olish kadr chastotasi. Ikki xil namuna olish rasteri bo'yicha aralashuv darajalarini solishtirish rasterdan kelib chiqadigan farqlarni beradi.
Bilak kamerasi ixtiyoriy jihoz emas

Hsu va boshqalar qo'lga markazlashgan ko'rinishni odatdagi uchinchi shaxs ko'rinishi bilan solishtirdilar va sahnaning kamroq qismini ko'rishiga qaramay, «ko'z-qo'lda» nuqtai nazari o'qitish samaradorligi va taqsimotdan tashqari umumlashtirishni izchil yaxshilaganini aniqladilar. Besh bo'g'inli qo'lda, odatda tuzatishlaringiz greyfer vaqtini to'g'rilaydi, va aynan greyfer vaqtini bilak ko'rinishi tashiydi.

Bosqich, boshidan oxirigacha

  1. 1
    Inferensiyani ishga tushiring va yozib oling

    Yaxshilamoqchi bo'lgan checkpointga qarshi ishlashni boshlang, so'ngra yozib olishni inferensiya ildiziga boshlang. Shunday yozib olinganda u standart teleoperatsiya belgisi o'rniga siyosat o'qitilgan, ishlashning o'ziga xos vazifa matnini meros qilib oladi. Yozib olishsiz muvaffaqiyatsizlikni ko'rishingiz mumkin, lekin uning ustida o'qita olmaysiz.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Xato ketganda nazoratni qo'lga oling

    «Nazoratni qo'lga olish» tugmasini bosing va kirish rejimini tanlang: leader qo'l, klaviatura yoki slayderlar. Ishga tushirish to'xtatiladi, siz tuzatasiz, so'ng qaytarib berasiz. Siz boshqargan vaqtdagi kadrlar avtomatik ravishda aralashuv sifatida belgilanadi.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Epizodlarni saralang

    Har bir epizod uchun qaror qiling: tuzatish sifatida qayd eting, baholash sifatida saqlang yoki bekor qiling. Siyosat yordamisiz bajargan ishlash baholash ma'lumoti hisoblanadi.

  4. 4
    Tuzatish datasetini sinxronlang

    Tuzatishlar har bir siyosat uchun mahalliy datasetda to'planadi va avtomatik sinxronlash orqali bulutli xotiraga boradi. Siz qo'ymagan hech narsa unga aralashmaydi.

  5. 5
    Aralash datasetni tuzing

    Asl datasetni tuzatishlar bilan birlashtiring, epizodlarni har bir manba bo'yicha aniq tanlab. Natija shu nuqtadan boshlab oddiy datasetga aylanadi.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Checkpointdan o'qitishni davom ettiring

    Aralashmani asosiy model o'rniga oldingi checkpointdan o'qiting. Qaysi checkpoint va qaysi aralashma ekanligini qayd eting; bu juftliksiz bosqichni qayta takrorlab bo'lmaydi.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

2-qadam batafsil: nazoratni qo'lga olishning ikki usuli

Leader qo'l bilan

Bunda leader-follower rejimida nazoratni qo'lga olish bir xil pozada bo'lmagan ikki qo'l o'rtasidagi topshiriqdir. «Nazoratni qo'lga olish» tugmasi bosilganda ishga tushirish to'xtaydi va leaderni followerning joriy pozasiga olib boradi, shunda moment (torque) uzatilganda hech narsa sakramaydi. Agar bu tekislash harakati vaqt tugashi bilan tugasa, leaderni qo'lda tekislaysiz va ikkalasi besh darajadan farq qilmaguncha qo'yib yubormaysiz. Shundan keyin odatdagidek teleoperatsiya qilasiz va harakat ustuni siz buyurgan narsani yozib boradi.

Bu yo'l haqida rostgo'y bo'laylik: tekislash harakati va moment topshirish - real texnikada tsiklning eng kam sinovdan o'tgan qismidir. Sizga muhim bo'lgan ishlashda unga tayanishdan oldin topshirishni sekin va zararsiz pozada sinab ko'ring. Leader qo'l uchta rejim orasida eng silliq tuzatishlarni beradi, ammo mexanik jihatdan noto'g'ri ketishi mumkin bo'lgan narsalar ham eng ko'p aynan unda.

Leader qo'lsiz: klaviatura va slayderlar

Buni o'qiyotganlarning ko'pchiligida bitta qo'l bor. Bu yetarli. «Nazoratni qo'lga olish» tugmasini bosgan zahoti klaviatura yoki slayder kirishini tanlang, va nazoratni qo'lga olish darhol va qo'lda amalga oshiriladi - tekislash uchun ikkinchi qo'l yo'q, shuning uchun tekislash bosqichi ham yo'q. Follower o'z pozasini ushlab turadi va kirishni kutadi.

Kirish rejimiQo'l qanday harakatlanadiServer tomonidan har bir chaqiruv uchun belgilangan chegaraQachon bloklanadi
Leader qo'lKo'zgu (mirror) followerni leaderning bo'g'im burchaklaridan boshqaradiBu rejimda nudge yoki set chaqiruvlari yo'q; ko'zgu follower maqsadlarini uzluksiz yozib boradiHech qachon bloklanmaydi va kirish rejimi berilmasa standart holat hisoblanadi - ammo ikkinchi qo'l talab qilinadi; leader id bo'lmasa nazoratni qo'lga olish rad etiladi
KlaviaturaHar bir tugma bosilganda nisbiy siljish (nudge), takeover nudge endpointiga yuboriladiHar bir bo'g'im uchun 2 daraja, greyfer uchun 4 darajada qat'iy chegaralanadiAgar nazoratni qo'lga olish leader rejimida boshlangan bo'lsa, 409 xatosi bilan rad etiladi
SlayderlarMutlaq maqsad poza, takeover set endpointiga yuboriladiHar bir chaqiruvda maqsad tomon eng ko'pi bilan 6 daraja harakat; interfeys esa taxminan soniyasiga o'n marta yuborishda davom etadiAgar nazoratni qo'lga olish leader rejimida boshlangan bo'lsa, 409 xatosi bilan rad etiladi

Chegaralar interfeysda emas, server tomonida amalga oshiriladi, chunki bus-servoli qo'lda noto'g'ri kiritilgan delta to'qnashuvga olib keladi. Klaviatura orqali tuzatishlar bosqichma-bosqich va biroz qo'pol chiqadi; slayder orqali tuzatishlar esa silliqroq, chunki interfeys uzatishda davom etar ekan, server maqsad tomon asta-sekin yuradi. Har ikkala holatda ham harakat ustuni to'liq buyurilgan poza vektorini oladi va aralashuv belgilanishi leader yo'liga o'xshash bo'ladi, shuning uchun klaviatura orqali tuzatishlar formatida farq bo'lmagan holda xuddi shu datasetga tushadi.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Tizimning boshqa joylarida ishlatiladigan xuddi shu tugmalar tartibi, shuning uchun yozib olishdan qolgan mushak xotirasi shu yerda ham ishlaydi.
SO-100 dataseti ustida GR00T fine-tuning ishlashining tartiblangan qadamlarini ko'rsatuvchi o'qitish qo'llanmasi
Bosqichning o'qitish tomoni birinchi ishlashdagi bilan bir xil boshqariluvchi ketma-ketlik; faqat checkpoint maydoni farq qiladi.

Tugmani qachon bosish kerak

Kech emas, erta. Greyfer hech narsani ushlamay yopilganidan keyin boshlangan tuzatish siyosat kirmasligi kerak bo'lgan xatodan tiklanishni o'rgatadi, va tiklanish ma'lumoti oldini olish ma'lumotidan ancha kam qimmatga ega. Traektoriya noto'g'ri ekanligiga ishonch hosil qilgan birinchi lahzada to'xtating, qiyin qism orqali tuzating, holat siyosat ilgari uddalagan holatga aylangan zahoti qaytarib bering. ThriftyDAgger bu qarorni belgilangan inson byudjeti ostida yangilik va taxmin qilingan xavf asosida aralashuvlarni cheklab avtomatlashtiradi, ammo allaqachon kuzatib turgan inson bilan yakka qo'lda inson nazorati siz sozlaydigan har qanday narsadan arzonroq va yaxshiroq kalibrlangan.

Ochiq manbali tizim va bir nechta skript bilan bajarish mumkin. Bunga to'lanadigan narx - hisob-kitob yuritish, va aynan hisob-kitob yuritishda DAgger bosqichlari barbod bo'ladi.

  1. O'zingizning inferensiya skriptingizdan kadrlarni siyosat o'qitilgan vazifa satri bilan birga LeRobot datasetiga yozing.
  2. Siyosat tsiklini to'xtating, buyruq manbasini almashtiring va siz boshqargan har bir kadrni aralashuv sifatida belgilang. Belgisiz tuzatishlar oddiy namoyishlarga o'xshab ko'rinadi.
  3. Siyosat nazoratni bo'shatishi va sizning birinchi kirishingiz orasidagi o'tish kadrlariga nima bo'lishini ongli ravishda hal qiling.
  4. Tuzatishlarni har bir siyosat uchun o'z datasetida saqlang va aralashmani qayta tiklash mumkin bo'lishi uchun epizod indekslarini qo'lda kuzatib boring.
  5. Fine-tuning kirish nuqtasini oldingi checkpointga yo'naltiring va logda o'sha og'irliklar yuklanganini tekshiring.

3-qadam batafsil: saralash sifatni belgilaydi

Ishlashdan keyin sizda ba'zi kadrlari aralashuv sifatida belgilangan yozuv bo'ladi. Uchta yo'nalish mavjud, va noto'g'risini tanlash keyingi bosqichni sezdirmasdan buzadi.

  • Aralashuv haqiqiy tuzatish bo'lgan bo'lsa, tuzatish sifatida qayd eting: siyosat noto'g'ri tomonga ketayotgan edi va sizning kirishingiz siyosatning o'zi hosil qilgan holatdan to'g'ri narsani ko'rsatdi.
  • Toza avtonom ishlashlar va ehtiyot yuzasidan nazoratni qo'lga olgan ishlashlar uchun baholash sifatida saqlang. Baholash epizodlari orqali keyingi checkpointni o'lchaysiz, va ularni hech qachon o'qitishda ishlatmang.
  • Aloqasi bo'lmagan narsa tufayli buzilgan ishlashlarni bekor qiling - tushib qolgan kamera kadri, to'xtab qolgan servo, siz ag'darib yuborgan buyum. Tartibsiz tuzatish tuzatish yo'qligidan yomonroqdir.
Qotib qolgan kadrlar xom yozuvda bo'lishi kerak, o'qitish ma'lumotida emas

Siyosat nazoratni bo'shatishi va sizning birinchi kirishingiz orasida, yozuvchi yozishda davom etar ekan, qo'l qimirlamay turadi - bir xil pozalar ketma-ketligi biroz farqli tasvirlar bilan birga. Bu yerda o'sha topshirish kadrlari xom yozuvda qoladi va tuzatish datasetiga kirmaydi. Agar tsiklni o'zingiz qursangiz, ularni ongli ravishda kesib tashlang: ularda o'qitilgan siyosat harakat qilishi kerak bo'lgan joyda to'xtashni o'rganib oladi.

5-qadam batafsil: aralashmani tuzish

Tuzish jarayoni asl datasetni tuzatish dataseti bilan birlashtirib, yangi, oddiy LeRobot dataseti hosil qiladi, u boshqa har qanday dataset kabi o'qitiladi. Muhim xususiyat shuki, epizod tanlash har bir manba bo'yicha aniq bo'ladi - hech narsa avtomatik ravishda aralashtirilmaydi. Bu siyosat g'alati harakat qilib, uni nimada o'qitilganini qayta tiklashga to'g'ri kelguningizcha ahamiyatsizdek tuyuladi.

Ochiq savol - bu nisbat, va hech kimda ko'chiriladigan raqam yo'q. Adabiyot rozi bo'lgan narsa shuki, tuzatishlar o'zining kadr ulushidan ko'proq hisobga olinishi kerak. Mandlekar va boshqalar o'zlarining aralashuv tizimi to'plagan ma'lumotlar ustida iterativ ravishda qayta o'qitadilar, shunda siyosat tor joylardan (bottleneck) o'tishni o'rganadi, va shu tarzda o'qitilgan agentlar aralashuvsiz namoyish beruvchilardan olingan teng miqdordagi namunalar ustida o'qitilgan agentlardan yaxshiroq natija berishini xabar qiladilar. Sirius bundan ham nariga borib, o'qitish namunalarini taxminiy inson ishonchi bo'yicha qayta og'irliklaydi va solishtirilgan usullarga nisbatan siyosat muvaffaqiyat darajasida simulyatsiyada 8 foiz, real texnikada 27 foiz o'sish, shu bilan birga ikki barobar tezroq yaqinlashish haqida xabar beradi. Bu yerdagi o'qitish kirish nuqtalarining hech biri namuna og'irliklash sozlamasini taqdim etmaydi, shuning uchun qo'pol o'rinbosar - har bir tuzatish epizodini saqlab, asl namoyishlarni subsampling qilishdir - va nima qilganingizni yozib qo'yishdir.

Kamera oqimlari bilan SO-100 dataseti epizodlarini ko'rsatuvchi dataset yozib olish ko'rinishi
Tuzatish epizodlari har bir kadr uchun aralashuv belgisiga ega oddiy epizodlardir, shuning uchun ular hech qanday o'zgartirishsiz asl dataset bilan birlashadi.

6-qadam batafsil: checkpointdan davom ettirish aslida nimani anglatadi

Aralashmani asosiy modeldan o'qitish ishlaydi, ammo oldingi bosqichni yo'qqa chiqaradi va to'liq ishlash narxiga tushadi. Oldingi checkpointdan davom ettirish tezroq va odatda yaxshiroq. Ammo bu iboraning o'zi taklif qilganidan ko'ra ko'proq cheklangan.

Og'irliklarni ishga tushirish optimizatorni davom ettirish emas

Faqat og'irliklardan iborat checkpointda faqat parametrlar bo'ladi, boshqa hech narsa yo'q. Uni yuklash keyingi ishlashga asosiy modelga qaraganda yaxshiroq boshlang'ich nuqta beradi, ammo optimizator momentlari, o'rganish tezligi jadvalining holati va ma'lumotlar tartibi nolda boshlanadi. Davom ettirilgan ishlashning boshida yo'qotishning keskin ko'tarilishini kuting, buni muvaffaqiyatsizlik deb o'qimang va bosqichni «davom ettirish» deb atamang. Bu - «iliq boshlanish» (warm start).

SiyosatHajmGPU darajasiHar bir harakat qadami uchun inferensiyaDataset formatiSinab ko'rishga arziydigan epizodlar soni
GR00T N1.7taxminan 3 mlrd, fine-tuning davomida taxminan 40 mln o'qitilganA100 80 GB yoki H100 80 GBtaxminan 152 msLeRobot v2.0 yoki v2.150
GR00T N1.5taxminan 3 mlrdA100 80 GB yoki H100 80 GBtaxminan 165 msLeRobot v2.0 yoki v2.150
Pi0.5PaliGemma asosida taxminan 3 mlrdA100 80 GB yoki H100 80 GBtaxminan 485 msLeRobot v3.050
SmolVLAtaxminan 450 mlnRTX 4090 yoki har qanday 24 GB kartasitaxminan 245 msLeRobot v3.030
ACTtaxminan 80 mln, noldan o'qitilganRTX 4090 yoki har qanday 24 GB kartasitaxminan 20 msLeRobot v3.050

Kechikish DAgger tsiklida namoyish paytidagidan farqli tarzda to'planib boradi: harakat qadami uchun taxminan 485 ms bo'lganda, siz qo'l xato qilgani uchun emas, ikkilangani uchun nazoratni qo'lga olasiz, va ikkilanish tuzatishlari foydali o'qitish ma'lumoti emas. Agar siz yakuniy muvaffaqiyat darajasini emas, balki ma'lumot ustida iteratsiyani kuzatayotgan bo'lsangiz, tez model ustida iteratsiya qiling. Shukor va boshqalar SmolVLA'ni bitta GPU'da o'qitish va iste'molchi GPU yoki CPU'larda joylashtirish uchun mo'ljallangan deb tasvirlaydilar, unda harakat bashoratini bajarilishdan ajratib, yuqoriroq boshqaruv tezligiga imkon beruvchi asinxron inferensiya tizimi mavjud - bu xususiyat nazoratni qo'lga olish tsiklini javob beruvchan qilib turadi.

Dataset formatlari ham bir-birining o'rnini bosa olmaydi. GR00T LeRobot v2.0 yoki v2.1'ni qabul qiladi, va Isaac-GR00T repozitoriyasi o'z kirishini qo'shimcha modallik tavsif fayli bilan LeRobot v2 formatining bir turi sifatida tasvirlaydi; bu yerdagi yangiroq o'qituvchilar esa v3.0'ni kutadi. Noto'g'ri versiyada tuzilgan aralashma yomon siyosat hosil qilish o'rniga yuklash vaqtida ishlamay qoladi - bu yaxshiroq muvaffaqiyatsizlik turi, lekin baribir navbatdagi bo'sh joyni behuda sarflaydi. dataset hujjatlari har bir o'qituvchi qaysi formatni qabul qilishini sanab o'tadi.

Hisob-kitobi allaqachon bajarilgan tsikl

Leader qo'l, klaviatura yoki slayderlar bilan nazoratni qo'lga olish; har bir kadr uchun aralashuv belgilash; ishlashlarni tuzatish yoki baholash sifatida qayd etish; har bir manba bo'yicha aniq epizod tanlovi bilan aralash dataset tuzish; va asosiy model o'rniga checkpointdan o'qitishni davom ettirish. Sizning qaroringizda qoladigan narsa - qaysi ishlash tuzatish hisoblanishi, aralashmaga nima kirishi va aralashuv darajasi qachon pasayishni to'xtatgani.

DAgger tsikli qanday qurilganini ko'ring

Bosqichni isrof qilishning to'rt yo'li

1. Faqat tuzatishlar ustida o'qitish

Eng ko'p uchraydigan xato va eng jozibali qisqa yo'l. Faqat tuzatishlardan iborat dataset deyarli to'liq vazifaning qiyin o'rta qismidan iborat bo'lib, yaqinlashish va chekinish qismlari yo'qoladi; siyosat qiyin qismda yaxshilanadi, ammo u yerga qanday yetib borishni unutadi. Agregatsiya usulning amalga oshirish tafsiloti emas, u mexanizmning o'zi: tuzatishlar xatti-harakatning bir qismini siljitib turgan vaqtda, eski ma'lumot esa qolgan xatti-harakatni joyida ushlab turadi.

2. Bosqichlar orasida kamerani surish

Bosqichlar orasida ikki santimetrga siljigan kamera boshlagan siyosatingizdan yomonroq siyosat hosil qiladi, va tashxis qo'yish bir kunni oladi. Bu yerdagi har bir VLA tasvirlarga asoslanadi; faqat bo'g'im holati buyum qayerda ekanligini aniqlab bermaydi. Birinchi bosqichdan oldin sozlamani suratga oling va har bir keyingi bosqichdan oldin o'sha suratni tekshiring.

3. Topshirish artefaktlarini o'qitishga qo'shib yuborish

Yuqorida ko'rib chiqilgan, va ro'yxatda turishining sababi u ko'zga ko'rinmasligidir. Belgisi - siyosat aynan oldingi bosqichda operator nazoratni qo'lga olgan joyda soniyaning bir ulushiga to'xtab qoladi. Bu ikkilanishga o'xshaydi; aslida esa taqliddir.

4. Iliq boshlanishni davom ettirish deb atash

Agar optimizator holati saqlanib qolgan deb hisoblasangiz, boshlang'ich yo'qotish sakrashi xato sifatida o'qiladi va siz buzilgan ma'lumot qidirishga tushib ketasiz. Agar optimizator noldan boshlaganini bilsangiz, sakrash kutilgan holat bo'ladi va siz undan keyin nima bo'lishiga qaraysiz. Bir xil raqamlar, qarama-qarshi xulosalar.

Bosqichni o'lchash

Inson nazorati ostidagi tsikl uchun metrika - bu aralashuv darajasi: siz nazorat qilgan vaqtda yozilgan kadrlarning ishlashning umumiy kadrlariga nisbati. U nazoratni qo'lga olish holatida ko'rsatiladi, va bu bosqich bergan savolga javob beradigan yagona raqamdir. O'qitish yo'qotishi siyosat yaxshilangan-yaxshilanmaganidan qat'iy nazar pasayadi; muvaffaqiyat darajasi esa ikkilik (binar) bo'lib, stol usti qo'li hosil qiladigan namuna hajmlarida shovqinli bo'ladi. Aralashuv darajasi esa uzluksiz, siyosatning o'zi keltirib chiqargan holatlar ustida o'lchanadi, va siyosatga bo'lgan ehtiyoj kamayishi bilan pasayib boradi.

Uni faqat bir xil sharoitlarda yozilgan ishlashlar bo'yicha solishtiring. To'liq dalil, va ikki bosqichdan ortiq davom etadigan baholash to'plamini qanday qurish haqida DAgger tsiklini o'lchash haqidagi maqolada bor. Birinchi bosqich haqiqatda ishlash imkoniyatini tekshirish testidir: siz nazoratni qo'lga olish o'z texnikangizda ishlashini, tuzatishlar o'z belgilari bilan tushishini va davom ettirilgan ishlash siz nomlagan checkpointni yuklaganini tekshirasiz. Ikkinchi va uchinchi bosqichlarda daraja harakatlana boshlashi kerak. Agar u to'rtinchi bosqichgacha harakatlanmagan bo'lsa, muammo DAggerdan oldinroqda joylashgan.

Har bir bosqich uchun yozib qo'yingBu keyinchalik nima uchun muhim
Foydalanilgan checkpointBusiz yaxshilanishni qaysi aralashmaga bog'lab bo'lmaydi
Nazoratni qo'lga olish uchun ishlatilgan kirish rejimiKlaviatura orqali tuzatishlar leader orqali tuzatishlardan qo'polroq, va bu ma'lumotlarda ko'rinadi
Ishlashlar soni va har biri qanday saralanganiBosqichda ahamiyatli bo'lish uchun yetarli tuzatish bo'lgan-bo'lmagani
Har bir ishlash uchun aralashuv darajasi, va o'rtacha qiymatTsiklning taraqqiyot metrikasi
Har bir manba bo'yicha aniq epizod tanloviBosqichni qayta takrorlash yoki bekor qilishning yagona yo'li
Iliq boshlanish yoki noldan o'qitishBir haftadan keyin ko'radigan yo'qotish egri chizig'ini tushuntiradi

Agar hali checkpointingiz bo'lmasa

Tsiklning busiz kirish nuqtasi yo'q. Birinchi datasetni yozib oling, birinchi siyosatni o'qiting, uni ishga tushiring - recording, training va running the policy ushbu yo'lni qamrab oladi. Yozib olish klienti yuklab olish sahifasida, GPU darajalari va soatlik narxlar esa narxlar sahifasida, va foydalanish mumkin bo'lgan epizod qanday ko'rinishi esa SO-100 ma'lumot to'plash qo'llanmasida berilgan. Tuzatishlardan oldin namoyishlarni to'g'ri qiling: DAgger - bu tuzatish mexanizmi, va u allaqachon deyarli to'g'ri bo'lgan narsa ustida ancha yaxshiroq ishlaydi.

Leader qo'lsiz DAgger tsiklini ishga tushira olamanmi?

Ha. «Nazoratni qo'lga olish» tugmasini bosganingizda klaviatura yoki slayder kirishini tanlang: nazoratni qo'lga olish darhol va qo'lda amalga oshadi, tekislash uchun ikkinchi qo'l kerak emas. Klaviatura server har bir bo'g'im uchun 2 daraja va greyfer uchun 4 darajada qat'iy chegaralaydigan nisbiy siljishlarni yuboradi; slayderlar esa mutlaq maqsadni yuboradi va server har bir chaqiruvda unga tomon eng ko'pi bilan 6 daraja harakatlanadi, interfeys esa uzatishda davom etadi. Harakat ustuni va aralashuv belgilanishi leader rejimidagi bilan bir xil, shuning uchun tuzatishlar datasetda farqlanmaydi.

Bitta bosqichga nechta tuzatish kerak?

Asoslab bo'ladigan universal raqam yo'q, va epizodlar sonidan ko'ra kadrlar soni muhimroq. Amaldagi qoida shuki, tuzatishlar aralashmada yo'qolib ketmasligi kerak: 200 ta asl epizod va uchta tuzatish epizodi bilan hech narsa o'zgarmaydi. Bir xil qutqarishni uch marta takrorlash o'rniga, xato xatti-harakatni bir nechta boshlang'ich holatdan qamrab oladigan tuzatishlarga intiling.

Nega faqat tuzatishlar ustida o'qitish shunchalik yomon fikr?

Chunki tuzatishlar deyarli to'liq vazifaning qiyin o'rta qismidan iborat. Yaqinlashish, tekislash va chekinish yo'qoladi, shuning uchun siyosat siz tuzatgan qismda yaxshilanayotgan bo'lsa-da, avval yaxshi bajargan narsasini yo'qotadi. Eski ma'lumotni saqlab, unga qo'shib borish mexanizmning o'zi, ixtiyoriy qo'shimcha emas.

Checkpointdan davom ettirish oldingi o'qitish ishlashini davom ettiradimi?

Yo'q. Faqat og'irliklardan iborat checkpoint faqat parametrlarni tiklaydi, boshqa hech narsani emas: optimizator momentlari, o'rganish tezligi jadvalining holati va ma'lumotlar tartibi noldan boshlanadi. Bu iliq boshlanish, va boshlang'ich yo'qotish sakrashi belgidan ko'ra kutilgan holat hisoblanadi. Ikkalasidan qaysi birini aslida qilganingizni yozib qo'ying, shunda bir haftadan keyin egri chiziqni to'g'ri o'qiysiz.

Agar aralashuv darajasi pasaymasa nima bo'ladi?

Bosqich qo'shishni to'xtating. O'zgarmas daraja tuzatishlar siz o'ylagan narsani o'rgatmayotganini bildiradi. Odatiy sabablar bundan oldinroqda: kamera surilgan, tuzatishlar oldini olish ma'lumoti bo'lish uchun juda kech boshlanadi, topshirish kadrlari o'qitish to'plamida qolib ketgan, yoki vazifa siyosat haqiqatan olayotgan kuzatuvlardan yetarlicha aniqlanmagan.

Bularning hech biri hal qilingan muammo emas, va hech biri bir marta bosish bilan bajarilmaydi. Interaktiv taqlid orqali o'rganish faol tadqiqot sohasi bo'lib qolayotganining sababi aynan shuki - qachon aralashish kerak, inson qilgan ishni qanday og'irliklash kerak, qancha eski ma'lumotni saqlash kerak - degan savollarning aniq javobi yo'q; Celemin va boshqalarning sharhi hali ochiq qolgan narsalarni xaritalaydi. Tsiklda mavjud bo'lgan narsa - ehtiyotkorlik bilan, bir necha yuz yevroga tushadigan texnikada ishga tushirilganda o'lchanadigan yaqinlashishdir. Sozlamani qat'iy saqlang, erta aralashing, halol saralang, ongli ravishda aralashtiring va har safar aralashuv darajasini yozib boring.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started