Human-gated DAgger, boshidan oxirigacha

Policy xato qilganda boshqaruvni qoʻlga oling, soʻng aynan shu tuzatish asosida oʻqiting.

Behavior Cloning orqali oʻqitilgan policy faqat sizning demonstratsiyalaringiz bosib oʻtgan holatlarni biladi. DAgger bu boʻshliqni policyning oʻzi yetib boradigan holatlardagi maʼlumotlar bilan yopadi. AY-Robots butun tsiklni SO-100 qoʻlida ishga tushiradi: checkpointni boshqaring, jarayon davomida qoʻlga oling, tuzatilgan epizodlarni saqlang, aralashmani tuzing va aynan boshqargan checkpointdan oʻqitishni davom ettiring.

  • HG-DAgger, inson tomonidan boshqariladi
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • Har bir raund uchun intervensiya darajasi

Nega oʻqitilgan policy hech qachon koʻrsatilmagan narsani qiladi

Behavior Cloning boshqaruvni oddiy nazoratli oʻqitish sifatida koʻradi: kuzatuv kiradi, boʻgʻin maqsadi chiqadi, inson yozib olgan kadrlarga moslashtiriladi. Bu faqat robot inson bosib oʻtgan holatlarda qolganda toʻgʻri ishlaydi, aslida esa bunday boʻlmaydi. Qirq millisekund erta yopiladigan grayfer kubni namoyish etilgan pozadan ikki millimetrga suradi. Keyingi kuzatuv trening toʻplamida yoʻq, shuning uchun u yerdagi harakat ekstrapolyatsiya boʻladi, undan keyingi holat esa yanada uzoqroqqa chiqib ketadi. Trening taqsimoti va oʻqitilgan policy amalda hosil qiladigan taqsimot ikki xil narsa, va epizod davom etgan sari ikkinchisi birinchisidan tobora uzoqlashadi.

Ross, Gordon va Bagnell aynan shu muvaffaqiyatsizlikni 2011-yilda tasvirlab, zararni sonlarda ifodalashdi: ekspert taqsimoti ostida ehtimoli e bilan xato qiladigan klassifikator, T qadamlik gorizontda oʻzi hosil qilgan taqsimot ostida T ning kvadrati marta e tartibida xato qilishi mumkin, chunki bitta xato ekspert hech qachon hosil qilmagan kuzatuvlarni yuzaga keltiradi va xatolar bir-birining ustiga qalanadi. Ularning yechimi aynan shu sahifada gap ketayotgan algoritm: joriy policyni ishga tushiring, u bosib oʻtgan holatlar uchun ekspert belgilarini yigʻing, ularni shu paytgacha yigʻilgan hamma narsa bilan birlashtiring, qayta oʻqiting, takrorlang. Bir xil turdagi qoʻshimcha demonstratsiyalar yordam bermaydi, chunki ular xuddi shu taqsimotdan qayta namuna oladi. Policy yetib boradigan holatlardagi belgilar esa yordam beradi. Bu yerda amalga oshirilgan variant inson tomonidan boshqariladigan (HG-DAgger, Kelly va boshqalar): biror kishi ish xato ketayotganini aniqlab qoʻlga olguncha policy boshqaruvni saqlab qoladi, shu tufayli tuzatishlar faqat kerakli joylarda yuzaga keladi va qoʻlga hech qachon operator ruxsat bermaydigan holatga borish talab qilinmaydi.

  • Behavior Cloning faqat oʻzi oʻqitilgan holatlar taqsimotida amal qiladi.
  • Xato oʻz-oʻzini kuchaytiradi: kichik chetlanish notanish holatni keltirib chiqaradi, u esa kattaroq chetlanishni.
  • Davo koʻproq demonstratsiya emas, balki policyning oʻzi yetib boradigan holatlardagi belgilardir.
  • Inson tomonidan boshqariladi, demak: aralashuv vaqtini avtonomiya bahosi emas, operator hal qiladi.

Nega xato oʻz-oʻzini kuchaytiradi

Gorizontni suring. Behavior Cloning ostida kutilayotgan qoʻshimcha xarajat taxminan qadamlar sonining kvadratiga proportsional oʻsadi, chunki har bir xato demonstratsiyalar hech qachon qamrab olmagan holatlarni yuzaga keltiradi; agregatsiya tsikli esa oʻsishni chiziqliga yaqin ushlab turadi (Ross va b., 2011).

200
1.0 %
Behavior Cloning
400
DAgger
2.00
200×
Behavior Cloning ÷ DAgger
0.000100200300400050100150200Kutilayotgan qoʻshimcha xarajat (chegara)
Topshiriq gorizonti (qadamlar)

Ross va boshqalar (2011) dagi chegaralardan olingan koʻrgazmali egri chiziqlar, sizning robotingizdan olingan oʻlchov emas. Gap sonlarda emas, shaklda.

Bitta DAgger raundi, olti qadam

Bu tsikl platformada aynan shunday ishlaydi, sxema emas. Quyidagi har bir qadam kokpitdagi boshqaruv elementiga mos keladi.

Tsiklni qadamma-qadam koʻrib chiqing

Xuddi shu olti qadam, birma-bir, har birida qoʻlda va datasetda nima sodir boʻlishi bilan.

01

Policyni ishga tushiring va yozib oling

Oʻzingiz oʻqitgan checkpointga qarshi inferens jarayonini boshlang. Jarayon davom etayotganda, aynan shu jarayonning topshiriq matni bilan birga yoziladi, shunda kadrlar keyinchalik faqat tomosha qilinadigan video emas, balki trening maʼlumoti sifatida ishlatiladigan boʻladi.

1 / 6

Platforma sizning oʻrningizga nimalarni bajaradi

Bu yerdagi har bir band — aks holda oʻzingiz qurib, qoʻllab-quvvatlashingiz kerak boʻladigan tsikl qadami.

Leader qoʻlsiz qoʻlga olish

Jarayon boshida klaviatura yoki slider kirishini tanlang, shunda faqat noutbuk bilan tuzatishingiz mumkin boʻladi. Klaviatura siljishlari serverda har bir boʻgʻin uchun ikki darajaga, grayferda esa toʻrt darajaga qattiq cheklangan; slider maqsadlari mutlaq qiymat boʻlib, server har chaqiriqda ularga tomon koʻpi bilan olti daraja harakatlanadi. Cheklovlar interfeysda emas, serverda amalga oshiriladi, shuning uchun qotib qolgan tugma qoʻlni notoʻgʻri tashlab yubora olmaydi.

Teleoperatsiya hujjatlari

Har bir kadrda belgilangan intervensiyalar

Siz qoʻlni ushlab turgan paytda yozilgan har bir kadr intervensiya belgisini oʻzida tashiydi, action ustuni esa toʻliq buyurilgan pozani saqlaydi. Siz belgi ustunini qoʻlda yuritmaysiz va uni keyinchalik kadr indekslariga moslashtirmaysiz.

LeRobot dataset formati

Saralash: tuzatish, baholash yoki chiqindi

Har bir jarayon saqlash kartochkasida bitta qarorga ega boʻladi. Tuzatish jarayonlari keyingi trening raundini taʼminlaydi, baholash jarayonlari treningdan tashqarida qolib toza oʻlchov boʻlib qoladi, yomon jarayonlar esa aralashmani sezdirmay buzish oʻrniga shunchaki yoʻqoladi.

Sessiyalar va epizodlar

Aralashmani aniq tuzish

n-raund uchun trening toʻplamini siz tuzasiz: asl dataset qoʻshimcha tuzatishlar bilan, epizodlar har bir manbadan tanlanadi. Avtomatik aralashtirish yoʻq, yashirin simulyatsiya maʼlumotlari yoʻq, va tuzilgan natija boshqa har qanday dataset kabi ishlaydi.

Datasetlar

Checkpointdan davom ettirish

Trening jarayonini baza modeli oʻrniga aynan siz boshqargan checkpointga yoʻnaltiring, shunda har bir raund oldingisi tugagan joydan boshlanadi. Faqat vaznlar initsializatsiya qilinadi; optimizer holati tiklanmaydi, shu sababli birinchi raundni imkoniyat testi sifatida koʻrish toʻgʻri boʻladi.

Trening

Har raund uchun ijaraga olinadigan GPU

ACT va SmolVLA 4090 video kartasida, Pi0 hamda GR00T N1.5 yoki N1.7 esa 80 GB xotiraga ega A100 video kartasida ishlaydi. Siz raundni boshlaysiz, pod ishga tushadi, checkpointlar bucketingizga tushadi, va siz faqat raund uchun ketgan soatlarga toʻlaysiz.

GPU narxlari

Raundlaringizni rejalashtiring

Intervensiya darajasi — tsiklning taraqqiyot koʻrsatkichi: tuzatilgan kadrlar sonini jarayon kadrlariga boʻlish natijasi. Boshlanish nuqtasini va har bir raund qancha yutuq berishini belgilang va kerakli natijaga necha raundda yetishingizni koʻring.

30 %
25 %
3 000
RaundIntervensiya darajasiTuzatilgan kadrlar
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

Bu model, prognoz emas. Haqiqiy raundlar notekis boʻladi, va darajani oʻzgartirmagan raund sizga hech narsa bermagan; aynan shuni kuzatish kerak.

Tsiklni oʻzingiz qurish yoki bu yerda ishga tushirish

Bularning hech biri qoʻlda qilib boʻlmaydigan narsa emas. Gap shunda — qancha kechangiz infratuzilmaga, qancha kechangiz raundlarga ketishida, va bitta qator borki, unda qoʻlda qilish aniq yaxshiroq javob.

Tsikl qadamiQoʻlda sozlashAY-Robots orqali
Jarayon davomida qoʻlga olishLeader qoʻl yoki servo shinasi uchun oʻz kodingiz. Klaviatura va slider orqali qoʻlga olishni, shu jumladan xavfsiz chegaralarni, siz yozasiz va haqiqiy jihozda disk raskadrovka qilasiz.Jarayon boshida tanlanadigan leader qoʻl, klaviatura yoki sliderlar. Burchak cheklovlari serverda joylashgan.
Intervensiyalarni belgilashBelgi ustunini oʻzingiz qoʻshasiz, uni kadr indeksiga moslab turasiz va yozib olish formati oʻzgargan sari qayta tekshirasiz.Qoʻlga olish vaqtida yozilgan har bir kadr avtomatik belgilanadi, buyurilgan poza action ustunida keladi.
Jarayonlarni saralashJild konventsiyalari va shell skriptlari. Topshirish atrofidagi qotgan kadrlarni oʻzingiz topib, chiqarib tashlashingiz kerak.Saqlash kartochkasida har bir jarayon uchun bitta qaror. Topshirish kadrlari raw jildida qoladi.
Aralashtirilgan datasetni qurishFormat versiyasiga qarab merge skriptlari. Epizod indekslari, metamaʼlumot va video havolalarini bir-biriga mos qilib saqlash — eng mashaqqatli qismi.Asl dataset va tuzatishlardan, har bir manbadan epizod tanlash bilan tuzish; natija — oddiy dataset.
Keyingi raundni oxirgi policydan boshlashCheckpointni treynerga oʻzingiz ulaysiz va xohlasangiz haqiqiy davom ettirish uchun optimizer holatini ham tiklashingiz mumkin.Baza checkpoint uchun bitta maydon. Faqat vaznlar: checkpointdan initsializatsiya qiladi, optimizer resume emas.
Trening tsikli ustidan nazoratToʻliq. Oʻz lossingiz, oʻz jadvalingiz, oʻz ablatsiyalaringiz, oʻz instrumentatsiyangiz, orada hech qanday platforma yoʻq. Agar tadqiqot savoli aynan trening tsiklining oʻzi boʻlsa, buni qoʻlda qiling.Belgilangan policylar roʻyxati va forma taqdim etadigan giperparametrlar bilan qattiq belgilangan yoʻl, ixtiyoriy kod emas.

Bu nimaga asoslanganini koʻrsatuvchi ishlar

Tsikl bilan bahslashishdan oldin shularni oʻqing. Har bir havola toʻlov devori ortiga emas, annotatsiya sahifasiga olib boradi.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    DAgger haqidagi asl maqola: xatoning oʻz-oʻzini kuchaytirish muammosini bayon qiladi, sof nazoratli yondashuv uchun T-kvadrat chegarasini beradi va oʻrganuvchining oʻzi bosib oʻtgan holatlardan maʼlumot agregatsiya qilishni taklif qiladi.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    Inson tomonidan boshqariladigan variant: policy tanlagan holatlar boʻyicha soʻralish oʻrniga, ekspert qachon boshqaruvni olishni oʻzi hal qiladi — aynan shu rejim ushbu platformada amalga oshirilgan.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    Aralashuvlarni boshqarishning boshqa yoʻli: oʻrganuvchi yolgʻiz harakat qilishi mumkin boʻlgan payt uchun ishonch signali sifatida ansambl kelishmovchiligi. Bu yerda insonga hal qildirishga qaraganda oʻrganish uchun foydali qarama-qarshilik.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    Inson diqqatini tanqis resurs sifatida koʻradi va yordamni faqat yangi yoki xavfli holatlarda soʻraydi — bir kishi butun kun davomida qoʻlni nazorat qilganda toʻgʻri yondashuv aynan shu.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    Halol muqobil variant: policyni jarayon davomida tuzatish oʻrniga, demonstratsiyalarni bezovta qilib, ekspertga qaytishni koʻrsatishga majbur qiladi. Aralashuvlarga oʻtishdan oldin bilib qoʻyish kerak boʻlgan narsa.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    Soha xaritasi: inson fikr-mulohazasining qanday shakllari mavjud, ular qaysi interfeyslar orqali uzatiladi va DAgger uslubidagi aralashuv ular orasida qayerda turadi.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    ACT haqidagi maqola. Action chunking arzon qoʻlni umuman imitatsion policy bilan boshqarish mumkin boʻlishining sababi, va ACT — DAgger raundini eng tez sinab koʻrish mumkin boʻlgan policy.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    Oldindan oʻqitilgan vision-language modeli asosida qurilgan flow-matching VLA, va bu yerda fine-tuning qilish mumkin boʻlgan checkpointlardan biri; maqola yangi koʻnikmalar faqat fine-tuningdan kelishini, baza modelning oʻzidan emasligini aniq taʼkidlaydi.

Odamlar haqiqatan ham beradigan savollar

DAgger uchun leader qoʻl kerakmi?

Yoʻq. Jarayonni boshlashda klaviatura yoki slider kirishini tanlang, shunda qoʻlga olish birinchi kadrdan boshlab qoʻlbola boʻladi va brauzerdan boshqariladi. Leader qoʻl nozik harakatlar uchun qulayroq va qoʻl topshirishdan oldin oʻzini avtomatik tekislaydigan yagona rejim, ammo tsikl usiz ham ishlaydi.

Nechta DAgger raundi kerak boʻladi?

Halol qatʼiy son yoʻq. Intervensiya darajasini kuzating: agar u bir raunddan ikkinchisiga tushmasa, bu raund hech narsa bermagan, va muammo odatda raundlar sonida emas, topshiriq sozlamasida, kameralarda yoki asl datasetda boʻladi.

Bu haqiqiy DAgger yondashuvimi yoki shunga oʻxshash narsami?

Bu HG-DAgger, inson tomonidan boshqariladigan variant. Klassik DAgger policy tanlagan holatlar boʻyicha ekspertdan soʻraydi, shu jumladan hech qanday oqil operator haqiqiy qoʻlni yubormaydigan holatlarni ham. Bu yerda inson qachon aralashishni hal qiladi, va faqat shu qismlar belgilarga aylanadi.

Faqat tuzatishlarda oʻqitamanmi?

Yoʻq, va bunday qilmasligingiz kerak. Faqat tuzatishlarda oʻqitish sizga faqat tiklanishni biladigan policy beradi. Tuzilgan dataset — asl maʼlumot qoʻshimcha tuzatishlar bilan, har bir manbadan epizodlar aniq tanlangan holda.

Checkpointdan davom ettirish trening jarayonini davom ettiradimi?

U vaznlarni shu checkpointdan initsializatsiya qiladi. Optimizer holati tiklanmaydi, shuning uchun bu qatʼiy maʼnoda davom ettirish emas. Amalda oʻrganilgan xatti-harakatni raund boʻylab vaznlar tashiydi, ammo ikkisidan qaysi birini olayotganingizni bilish kerak.

Intervensiya darajasi qanday hisoblanadi?

Intervensiya deb belgilangan kadrlar sonini jarayonning umumiy kadrlar soniga boʻlish orqali. Bu qoʻlga olish holatida koʻrsatiladi va bu — har raund boʻyicha boshqargan checkpoint va oʻqitgan aralashma bilan birga yozib qoʻyishga arziydigan yagona son.

Bu tsiklni qaysi policylar bilan ishga tushirsam boʻladi?

ACT, SmolVLA, Pi0 hamda GR00T N1.5 yoki N1.7. Tsiklning oʻzi policydan mustaqil, chunki u faqat datasetlar va checkpointlar hosil qiladi; amaliy farq — raund qancha davom etishi va qaysi GPU kerakligida.

Buni oʻz robotimsiz qila olamanmi?

Bozordan dataset sotib olish yoki operatorlarga buyurtma berish orqali robotsiz ham yozib olish va oʻqitish mumkin, va haqiqiy SO-100 qoʻlini live sahifada brauzer orqali boshqarishingiz mumkin. DAgger raundi boshqacha — u jarayon davomida qoʻlga olish mumkin boʻlgan qoʻlni talab qiladi, shuning uchun tsiklning oʻzi uchun jihoz oʻz stolingizda boʻlishi kerak.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

Birinchi raundingizni shu hafta oʻtkazing

Klientni oʻrnating, allaqachon mavjud checkpointni boshqaring va qoʻl kubdan oshib ketgan birinchi safar qoʻlga oling. Aynan shu bitta jarayon — kichik miqyosdagi DAgger raundi; undan keyingi hammasi aralashmani tuzish va GPU soatlari uchun toʻlashdan iborat.