
Behavior cloning siyosatni ekspertning holat taqsimotiga moslaydi, so'ngra u mustaqil ravishda ishga tushiriladi. Ana shu ikki taqsimot o'rtasidagi farq — validatsiyada yaxshi ko'ringan siyosat 300-qadamda stoldan yiqilib tushishining sababi. Bu bizning DAgger seriyamizning nazariy bobi: kvadratik xato hadi qayerdan kelib chiqadi, dataset aggregation nimani o'zgartiradi, no-regret isboti nimani taxmin qiladi va hisobning qaysi qismini inson-ekspert hali ham to'lashi kerak.
Manipulatsiya siyosatini o'qitgan har bir kishi ertami-kechmi duch keladigan o'ziga xos nosozlik bor. Siyosat kubga cho'ziladi, ikki santimetrgacha yaqinlashadi, ikkilanadi, yon tomonga siljiydi, so'ng vazifaga aloqasi bo'lmagan biror narsa qiladi. Validatsiya xatosi yaxshi edi. Ajratib qo'yilgan epizodlarga nisbatan open-loop qayta ishga tushirish ham yaxshi edi. Va shunga qaramay, qo'l o'quv ma'lumotlarida hech qayerda uchramaydigan holatga tushib qoladi, va bu nuqtadan boshlab uning aytadigan mantiqiy gapi qolmaydi.
Bu nosozlikning nomi va ortida joylashgan barqaror bir nazariyasi bor. Bu quyidagi mavzu bo'yicha to'rtta maqoladan birinchisi: DAgger — bu yerda argumentning o'zi yoritiladi: nima uchun siyosatni namoyish etuvchining o'z traektoriyalariga moslash epizod uzunligining kvadrati bilan o'sishi mumkin bo'lgan xato keltirib chiqaradi, dataset aggregation nimani o'zgartiradi va no-regret isboti nimani va'da qilmaydi. Haqiqiy uskunadagi tsikl quyida yoritilgan: SO-100'da DAgger tsiklini ishga tushirish, inson tomonidan boshqariladigan variant esa quyida: HG-DAgger va inson tomonidan boshqariladigan aralashuvlar, o'lchash masalasi esa quyida: DAgger tsiklini o'lchash.
Qisqacha
- •Behavior cloning ekspertning holat taqsimotida o'qitiladi va siyosatning o'zinikida baholanadi. Nomuvofiqlik epizod davomida to'planib boradi.
- •Ross va Bagnell qo'shimcha xarajat T ning kvadrati va har bir qadamdagi xato ko'paytmasi sifatida o'sishi mumkinligini ko'rsatishdi; DAgger maqolasi bu chegarani qayta bayon qiladi va uning qat'iy ekanligini ta'kidlaydi.
- •DAgger siyosatning o'zi tashrif buyurgan holatlarni belgilaydi va faqat eng yangisida emas, balki shu paytgacha to'plangan har bir ma'lumotlar to'plamida qayta o'qitadi.
- •Kafolat no-regret onlayn o'rganishga qisqartirish orqali beriladi: agregatsiya qilish va qayta o'qitish Follow-The-Leaderning o'zi.
- •Bu siyosat sinfida erishish mumkin bo'lgan eng yaxshi xatoga nisbatan amal qiladi, nolga nisbatan emas — va ekspert baribir o'zi hech qachon hosil qilmaydigan holatlarni belgilashi kerak bo'ladi.
Behavior cloning sezdirmasdan qiladigan taxmin
Namoyish ma'lumotlar to'plami — bu kuzatuv-harakat juftliklari to'plami. Behavior cloning oddiy supervised learning yordamida shu to'plamga funksiya moslaydi va shu bilan to'xtaydi. Bu sohadagi eng eski g'oya. Pomerleau'ning ALVINN'i, 1988-yilda, kamera va lazer masofa o'lchagichdan olingan tasvirlarni qabul qilib, transport vositasi harakatlanishi kerak bo'lgan yo'nalishni chiqaradigan uch qatlamli teskari tarqalish tarmog'i edi; u simulyatsiya qilingan yo'l tasvirlarida o'qitilgan va ba'zi dala sharoitlarida haqiqiy yo'llarga ergashgan. Retsept unchalik o'zgargani yo'q; tarmoqlar o'zgardi.
E'tibordan chetda qoladigan narsa — bu juftliklar qayerdan kelganini tekshirishdir. Ularning har biri namoyish etuvchi hosil qilgan traektoriyada yotadi. Siz ishga tushiradigan siyosat esa o'zinikini hosil qiladi. U chetga chiqqan zahoti, o'qitish taqsimotida bo'lmagan holatlar haqida so'ralayotgan bo'ladi, va uning javobi uni yanada uzoqlashtiradi. Ross, Gordon va Bagnell DAgger maqolasini aynan shu bilan boshlaydilar: ketma-ket bashorat qilish statistik o'rganish asosidagi i.i.d. taxminini buzadi, chunki o'rganuvchining o'z bashoratlari u keyingi ko'radigan kirishlarni belgilaydi.
O'sha maqoladagi eng aniq misol umuman robot emas. Super Mario Bros. uchun deyarli optimal rejalashtiruvchini klonlash to'siqdan sakrash o'rniga unga qarshi qayta-qayta tiqilib qoladigan siyosat hosil qildi. Sababi butun argumentni bitta jumlada ifodalaydi: ekspert har doim qulay masofadan sakragan, shuning uchun ma'lumotlar to'plamida Mario to'siqqa tiqilib qolgan holat umuman bo'lmagan, demak, u shunday holatga tushganda nima qilish kerakligi haqida hech qanday yorliq ham bo'lmagan.
Marioni SO-100 qo'liga almashtiring — tuzilma bir xil bo'lib qoladi. Namoyishlaringiz toza yaqinlashish va toza ushlab olishni ko'rsatadi, greyferning ikki santimetr yetmay yopilishini emas — shuning uchun siyosat bu nuqtadan nima qilishni bilmaydi va uning taxmin qilgan har qanday harakati uni yanada uzoqlashtiradi. Kovariat siljish ma'lumot to'plash tartibining xususiyati, tarmoq arxitekturasining emas.
Kvadratik had qayerdan kelib chiqadi
Ross va Bagnellning 2010-yilgi AISTATS maqolasi — Efficient Reductions for Imitation Learning — to'planishni aniq ifodalaydi. T vazifa gorizonti, vazifa xarajati birlik oraliqda chegaralangan, va epsilon quyidagi bo'yicha o'lchangan surrogat xato bo'lsin: ekspertning holat taqsimoti — bu sizning validatsiya to'plamingiz bergan son. Shunda ushbu siyosatni T qadam davomida ishga tushirishning ekspertga nisbatan qo'shimcha xarajati T ning kvadrati va epsilonning ko'paytmasi bilan chegaralanadi. Ross, Gordon va Bagnell buni DAgger maqolasida 2.1-teorema sifatida qayta bayon qiladilar va muhim jumlani qo'shadilar: chegara qat'iy. Ekspert taqsimotida epsilon xatoga ega siyosat T bo'yicha haqiqatan ham kvadratik o'sadigan qo'shimcha xarajatga duch keladigan masalalar mavjud.
Qat'iy — bu odatiy degani emas. Kvadratik had masalalar sinfi bo'yicha eng yomon holat, sizning pick-and-place vazifangiz haqidagi bashorat emas. Bu isbotlaydigan narsa shuki, ko'proq ekspert namoyishi muammoni bartaraf eta olmaydi: u faqat siyosat sinalmaydigan taqsimotdagi epsilon bahosini aniqlashtiradi.
Chiqish yo'li xuddi shu maqolada, 2.2-teorema sifatida qayta bayon qilingan. Agar siyosat o'zining holat taqsimoti ostida epsilon xatoga erishsa va bitta noto'g'ri harakat ekspert bo'yicha cost-to-go'da ko'pi bilan u ga teng xarajat qilsa, qo'shimcha xarajat u, T va epsilonning ko'paytmasi bilan chegaralanadi — gorizontga nisbatan chiziqli. u konstantasi qiziqarli kattalik: ekspert bilan 0-1 kelishmovchiligi uchun ko'pi bilan 1, va ekspert bir necha qadam ichida tiklana olsa har doim O(1). Eng yomon holatda u O(T) bo'ladi va bu holda chiziqli chegara kvadratikdan yaxshiroq bo'lmay qoladi.
| Vaziyat | Ekspertga nisbatan qo'shimcha xarajat chegarasi | Nimaga asoslanadi |
|---|---|---|
| Behavior cloning (Ross va Bagnell 2010, Ross va boshq. 2011'da 2.1-teorema sifatida qayta bayon qilingan) | T ning kvadrati va epsilon ko'paytmasi | epsilon ekspertning holat taqsimotida o'lchangan; xarajat [0,1] oralig'ida; chegara qat'iy |
| O'z taqsimoti ostida epsilon xatoga ega bo'lgan istalgan siyosat (2.2-teorema) | u, T va epsilon ko'paytmasi | u bitta noto'g'ri harakatning cost-to-go jazosini chegaralaydi; 0-1 xato uchun ko'pi bilan 1, eng yomon holatda O(T) |
| Forward training (Ross va Bagnell 2010) | u, T va epsilon ko'paytmasi | har bir vaqt qadami uchun bitta siyosat; T ta siyosat va ma'lum, chekli T talab qilinadi |
| SMILe (Ross va Bagnell 2010) | ba'zi masala sinflarida T va epsilonga deyarli chiziqli | alpha O(1/T kvadrat) da, N O(T kvadrat log T) da; stoxastik aralashma hosil qiladi |
| DAgger (3.2-teorema, Ross va boshq. 2011) | u, T va epsilon_N ko'paytmasi, qo'shimcha O(1) | N taxminan uT tartibida; qat'iy qavariq chegaralangan xato; no-regret o'rganuvchi; epsilon_N — orqaga qarab eng yaxshi xato |

DAgger'dan oldingi ikkita urinish
Forward training — halol, ammo amaliy bo'lmagan javob. Har bir vaqt qadami uchun alohida siyosatni tartib bilan, oldingi qadamlar uchun allaqachon belgilangan siyosatlar keltirib chiqargan holat taqsimotida o'qiting, shunda har bir siyosat aynan duch keladigan taqsimotni ko'radi. Muammo tavsifning o'zida: T ta siyosat, ketma-ket o'qitilgan, erta to'xtatish yo'q. Manipulatsiya epizodi uchun soniyasiga 30 kadrda, T yuzlab bo'ladi.
Xuddi shu maqoladagi SMILe va Daume, Langford va Marcuning strukturaviy bashorat bo'yicha ishidan SEARN boshqa yo'lni tanlaydi: bitta statsionar, ammo stoxastik siyosat. Har bir iteratsiya bir komponentni o'qitadi va uni aralashmaga qo'shadi, ehtimollik massasini ekspertdan uzoqlashtiradi. Natija — ba'zi komponentlari boshqalaridan yomonroq bo'lgan aralashma; jismoniy qo'lda esa bu harakat davomida yomon komponentni tanlab olishi mumkin bo'lgan boshqaruvchi degani. Aynan shu sabab statsionar deterministik siyosatni xohlashning asosiy sababi sifatida keltirilgan.
DAgger: bitta g'oya, bitta quti
Dataset Aggregation deterministik siyosatni saqlab qoladi va yechimni ma'lumot to'plash bosqichiga ko'chiradi. Har bir raund: joriy siyosatni ishga tushiring, u tashrif buyurgan holatlarni yozib oling, ekspertdan har birida to'g'ri harakat qanday bo'lishi kerakligini so'rang, o'sha juftliklarni allaqachon mavjud ma'lumotlar to'plamiga qo'shing, birlashmada qayta o'qiting. Nomning o'zi algoritmni ifodalaydi — siz agregatsiya qilasiz, hech qachon tashlab yubormaysiz.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setUchta detal ko'rinishidan ko'ra ko'proq ahamiyatga ega. Yorliqlar aralash siyosat tashrif buyurgan holatlar uchun, ammo harakatlar ekspertdan keladi — siyosat savollarni, ekspert esa javoblarni beradi. Qayta o'qitish butun agregat bo'yicha amalga oshiriladi, bu esa har bir raundni Follow-The-Leader qadamiga aylantiradi: n-raundda siz shu paytgacha bo'lgan barcha traektoriyalar bo'yicha orqaga qarab eng yaxshi siyosatni tanlaysiz. Isbot aynan shu tuzilishga tayanadi. Va algoritm validatsiya to'plamida tanlangan ketma-ketlikdagi eng yaxshi siyosatni qaytarish bilan yakunlanadi, chunki teoremalar ketma-ketlikda biror siyosat yaxshi ekanligini kafolatlaydi, oxirgisi yaxshi ekanligini emas.
Beta jadvali va nega u sozlash tugmasi emas
Aralash siyosat beta_i ko'paytirilgan ekspert va (bir minus beta_i) ko'paytirilgan o'rganuvchidan iborat. Bu amaliy nuqta: dastlabki bir necha o'rgatilgan siyosatlar juda oz ma'lumotda o'qitiladi, ko'p xato qiladi va aks holda siyosat yaxshilanganda ahamiyatsiz bo'lib qoladigan holatlarda rolloutni sarflaydi.
Nazariya aynan bitta shartni qo'yadi: betalarning yig'ma o'rtachasi nolga intilishi kerak. Tahlil beta_i ni T ga bog'liq bo'lmagan alpha konstantasi uchun (1 - alpha) ning (i-1)-darajasi bilan chegaralangan holda ko'rib chiqadi.
| Jadval | Nima qiladi | Maqola nima haqida xabar beradi |
|---|---|---|
| beta_1 = 1 | Birinchi raund sof ekspert namoyishi; boshlang'ich siyosat kerak emas | Har bir variantda tavsiya etilgan boshlang'ich nuqta |
| beta_i = 1 if i = 1, else 0 | Faqat birinchi raundda ekspert; erkin parametr yo'q | Maqolaning parametrsiz versiyasi, u amaliyotda ko'pincha eng yaxshi natija berishi aytilgan; 20 iteratsiyadan so'ng Super Mario Bros.'da 2980 |
| beta_i = p^(i-1) with p = 0.5 | Ekspert ehtimoli geometrik tarzda kamayadi | Xuddi shu benchmarkda 3030, parametrsiz versiyadan biroz oldinda |
| beta_i = p^(i-1) with p = 0.9 | Ekspert tsiklda ancha uzoqroq qoladi | Sezilarli darajada sekinroq yaqinlashish; 20 iteratsiya tugaganda hali ham yaxshilanmoqda edi |
Taxminan 4300 gacha boradigan shkalada 2980 va 3030 orasidagi farq kichik, ammo maqolaning bunga izohi ushbu bo'limdagi eng foydali amaliy eslatma. Parametrsiz jadval bilan Mario erta bosqichda bir joyda tiqilib qolgan va o'sha bitta joydan deyarli bir xil ma'lumotlar massasini hosil qilgan; ekspertga vaqtning bir qismida boshqarish imkonini berish uni ham tiqilib qolishdan chiqargan, ham holatlar xilma-xilligini kengaytirgan. Jadval ko'proq aralashtirish nisbatiga emas, balki sizning ma'lumot to'plashingiz yangi holatlar hosil qilishda davom etayotganiga yoki bir xil nosozlikni takrorlayotganiga bog'liq.
Har bir vaqt qadamida stoxastik aralashma boshqaruv vakolatini boshqaruv chastotasida, odatiy SO-100 sozlamasida soniyasiga 30 marta almashtirish degani. Hech qanday teleoperatsiya interfeysi buni xavfsiz yoki mantiqiy qilmaydi. Haqiqiy uskunada beta jadvali o'rnini qachon boshqaruvni qo'lga olish haqidagi inson qarori egallaydi: boshqa tahlilga ega boshqa algoritm.
Kafolat: no-regret onlayn o'rganishga qisqartirish
Mana bu maqolani aynan shunday qiladigan qadam. Har bir DAgger raundini onlayn o'rganish masalasidagi bitta misol sifatida ko'ring, bunda i-raunddagi xato i-raundda ishlatilgan siyosatning holat taqsimoti ostidagi surrogat xato hisoblanadi. O'rganuvchi shu xatoni ko'rishdan oldin siyosatga sodiq bo'ladi, va ketma-ketlik nostatsionar, chunki u shu paytgacha hosil qilingan siyosatlarga bog'liq.
Agar algoritmning N raund bo'yicha o'rtacha xatosi orqaga qarab olingan eng yaxshi bitta siyosatning xatosiga yaqinlashsa, u no-regret hisoblanadi. Qat'iy qavariq xatolar bo'yicha Follow-The-Leader aynan shunday algoritm bo'lib, o'rtacha regret 1/N tartibida kamayadi — va to'liq agregat bo'yicha qayta o'qitish aynan Follow-The-Leaderning o'zi. Boshqa istalgan no-regret o'rganuvchi ham xuddi shunday ishlaydi: tahlil bitta optimallashtiruvchining xususiyati emas, balki qisqartirish hisoblanadi.
Bitta lemma ma'lumotni to'plagan aralash siyosat bilan ishga tushiriladigan o'rgatilgan siyosat orasidagi bo'shliqni ko'priklaydi: 4.1-lemma ularning holat taqsimotlari orasidagi L1 masofasini 2 T beta_i bilan chegaralaydi. Aynan shuning uchun betalar kamayishi kerak — ekspert hali ham sezilarli boshqaruv vakolatiga ega bo'lganida, siz to'playotgan holatlar sizning siyosatingiz hosil qiladigan holatlar emas. Lemmani regret chegarasi bilan birlashtiring va asosiy natija kelib chiqadi: taxminan T iteratsiyadan so'ng, ketma-ketlikdagi biror siyosat o'z taqsimoti ostida epsilon_N dan O(1/T) farq bilan surrogat xatoga ega bo'ladi. Buni chiziqli chegaraga qo'ying va 3.2-teoremaga kelasiz.
Empirik tomoni hozirgi standartlarga ko'ra kamtarona. Super Tux Kart'da supervised bazaviy usul ko'proq ma'lumot kelganida bir aylanishdagi o'rtacha yiqilishlarni yaxshilamadi, DAgger o'n besh iteratsiyadan so'ng hech qachon trekdan chiqmaydigan siyosatga erishdi, SMILe esa yigirmadan so'ng ham bir aylanishda taxminan ikki marta yiqildi. Qo'lyozma benchmarkida belgi aniqligi strukturasiz 82 foiz, supervised bilan 83,6 foiz, DAgger bilan 85,5 foiz bo'ldi. Bularning hech biri manipulatsiya natijasi emas.
Isbot nimani va'da qilmaydi
Teorema bayonotlari shartli, va bu shartlar tayanch ahamiyatga ega.
- Ko'rsatilgan taxminlar ostida T bo'yicha kvadratik emas, chiziqli chegara.
- Stoxastik aralashma emas, statsionar deterministik siyosat.
- Haqiqiy qisqartirish: istalgan no-regret onlayn o'rganuvchi mos keladi.
- Aniq iteratsiyalar soni — regret hadi ahamiyatsiz bo'lib qolguncha taxminan T raund.
- Ketma-ketlikda kamida bitta siyosat uchun kafolat, shuning uchun yakuniy validatsiya bosqichi kerak.
- Bu nolga nisbatan emas, balki sinfdagi orqaga qarab eng yaxshi xato bo'lgan epsilon_N ga nisbatan. Agar sizning sinfingiz ekspertni ifodalay olmasa, bu amalda bo'sh bo'ladi.
- Bu no-regret usuli yoki qat'iy qavariq surrogat xatoni talab qiladi — mualliflar ta'kidlaganidek, bu asos bo'lgan klassifikatsiya qisqartirishlaridan kuchliroq.
- u konstantasi eng yomon holatda O(T) bo'lishi mumkin, va bu holda chiziqli chegara yana kvadratikka qaytadi.
- Bu iteratsiyalarni chegaralaydi, ekspert yorliqlarini emas. Robotda esa yorliqlar — byudjet.
- Bu ekspertdan har bir tashrif buyurilgan holatda so'rash mumkinligini va u to'g'ri javob berishini taxmin qiladi. Aynan shu taxmin — butun xarajat.
Yana bir natija ko'pincha rad etish sifatida keltiriladi, ammo aslida bunday emas. Rajaraman, Yang, Jiao va Ramachandran chekli S holat maydoni va H gorizontga ega epizodik MDP'larda taqlid orqali o'rganishning minimaks chegaralarini o'rganadilar va o'rganuvchi tashrif buyurilgan holatlarda ekspertdan faol so'rasa ham amal qiladigan, |S| H kvadrat / N tartibidagi suboptimallikning quyi chegarasini isbotlaydilar. Bu belgilangan epizod byudjetida MDP'lar sinfi bo'yicha eng yomon holat tezligi, va bu inkor etadigan narsa — interaktsiya minimaks tezlikni yaxshilaydi degan g'oya; DAgger teoremasi esa boshqa bayonot bo'lib, ishga tushirilgan siyosatni uning o'z siyosat sinfi erisha oladigan narsaga nisbatan chegaralaydi.
Swamy, Choudhury, Bagnell va Wu keyinchalik bu algoritmlarni ekspert xatti-harakatining qaysi momentlariga mos kelishiga qarab tasnifladilar va har bir oila to'planib boruvchi xatoni qanchalik yaxshi yumshatishini belgilaydigan moment recoverability tushunchasini kiritdilar. Osa va Celeminning sharhlari algoritmik manzarani va inson-fikr-mulohaza interfeyslarini qamrab oladi.
Hisob: ekspert hech qachon hosil qilmagan holatlarni belgilash
Yuqoridagilarning barchasi istalgan joyda so'ralishi mumkin bo'lgan ekspertni taxmin qiladi. O'yin holatiga to'liq kirish huquqiga ega deyarli optimal rejalashtiruvchi ishlatilgan Mario tajribalaridagi kabi, simulyatsiyada bu deyarli bepul. Robotdagi inson bilan esa bu ustuvor xarajat, va o'ziga xosi shundaki: inson o'zining malakasi hech qachon yaratmagan konfiguratsiyada to'g'ri harakat hosil qilishi kerak.
Kelly, Sidrane, Driggs-Campbell va Kochenderfer HG-DAgger maqolasida e'tirozni to'g'ridan-to'g'ri bildiradilar. Oddiy DAgger ekspertdan tizimni to'liq boshqarmasdan turib harakat yorliqlarini taqdim etishni talab qiladi. Bu xavfsizlikni kamaytiradi, va inson ekspertlar bilan bu to'plangan yorliqlar sifatini pasaytirishi ehtimoli katta, buni ular sezilgan aktuator kechikishiga bog'laydilar. Sizga qaytib keladigan yorliq algoritm taxmin qilgan yorliq emas.
Laskey va hamkasblari muammoga boshqa tomondan DART bilan hujum qiladilar, va ularning ta'rifi ochiq-oydin: on-policy texnikalar inson nazoratchilari uchun zerikarli, hisoblash yukini oshiradi va o'qitish davomida xavfli holatlarga tushishi mumkin. Ularning muqobili nazoratchining o'z namoyishlariga kalibrlangan shovqin kiritadi, shunda robot hech qachon ishonchsiz siyosatni ishga tushirmasdan tiklanish namoyish etiladi. MuJoCo Humanoid'da ular DART o'qitish davomida nazoratchining kumulyativ mukofotini 5 foizga kamaytirishini xabar qiladilar, DAgger esa nazoratchidan 80 foiz kamroq kumulyativ mukofotli siyosatlarni bajaradi; Toyota HSR bilan tartibsizlikda ushlab olishda behavior cloning'ga nisbatan o'rtacha 62 foiz o'sish.
Zhang va Choning SafeDAgger'i mos yozuvlar siyosatiga so'rovlarni tanqis resurs sifatida ko'radi: alohida xavfsizlik siyosati, so'ramasdan, asosiy siyosat mos yozuvlardan chegaradan tashqari chetlanish arafasida ekanligini bashorat qiladi, va faqat o'sha holatlar topshiriladi. Barcha uchtasi bir xil faktga javob beradi — DAgger tahlili ekspert yorliqlari uchun hech narsa hisobga olmaydi, haqiqat esa buning uchun ko'p narsa talab qiladi.
Taqsimotdan tashqari holatlarni belgilash vazifani namoyish qilishdan ruhiy jihatdan qiyinroq. Oddiy namoyish allaqachon mavjud bo'lgan motor rejasini bajarish degani. Greyferni siz hech qachon qo'ymaydigan joyga qo'yib qo'ygan siyosatni tuzatish esa vaqt bosimi ostida, robot hali ham harakatlanayotganida, o'sha yerda tiklanishni qurishni anglatadi. Bir sessiyada oddiy yozib olish sessiyasiga qaraganda kamroq foydali daqiqalarni kuting va o'z tuzatish sifatingiz bir sessiya davomida pasayib borishini kuzating.

Bu stolingizdagi SO-100 uchun nimani anglatadi
Gorizontni o'z birliklaringizga o'tkazing. Soniyasiga 30 kadrda yigirma soniyalik epizod 600 ta qaror qadamini tashkil qiladi, va yuqoridagi har bir chegaradagi T aynan shu son. T = 600 da, T bilan masshtablanadigan had va T kvadrati bilan masshtablanadigan had orasidagi farq — yomon yaqinlashishdan tiklana oladigan siyosat bilan tiklana olmaydigan siyosat orasidagi farqdir.
Bu action chunking nima uchun yordam berishining bir qismi: siyosat har bir inference qadamida qisqa harakatlar ketma-ketligini chiqarganda, qaror nuqtalari soni kamayadi, shu bilan birga to'planish imkoniyatlari soni ham kamayadi. Zhao, Kumar, Levine va Finn to'planib boruvchi xatoni Action Chunking with Transformers'ning asosiy sababi sifatida ko'rsatadilar va o'n daqiqalik namoyishlardan arzon ikki qo'lli uskunada olti qiyin real dunyo vazifasida 80 dan 90 foizgacha muvaffaqiyatni xabar qiladilar. Chunking kovariat siljishni bartaraf etmaydi — holatlar hamon siyosatning o'zinikicha qoladi — ammo u samarali gorizontni qisqartiradi. Qarang: action chunking va SO-100 taqlid orqali o'rganish qo'llanmasi.
Ikkinchi tarjima — progress metrikasi. Siyosatning o'z taqsimoti ostida epsilonni to'g'ridan-to'g'ri o'lchay olmaysiz — bu har bir tashrif buyurilgan holat uchun ground-truth ekspert harakatlarini talab qiladi, aynan siz hosil qilishdan qochmoqchi bo'lgan narsani. Inson tomonidan boshqariladigan tsikl o'rniga sizga beradigan narsa — aralashuv darajasi: bir ishga tushirishda inson boshqaruvni qo'lga olgan kadrlar ulushi. Bu proksi, va u siyosatga aloqasi bo'lmagan sabablarga ko'ra ham o'zgaradi — sabr-toqatli operator kamroq aralashadi. Izchil qo'llanilganda, bu raund kunni sarflashga arzigan-arzimaganini aytadigan yagona son.
Uchinchi tarjima — tahlil qamrab olmagan ma'lumot sifati haqidagi ogohlantirish. Mandlekar va hamkasblari beshta simulyatsiya va uchta real dunyo ko'p bosqichli manipulatsiya vazifasida oltita offline o'rganish algoritmini o'rgandilar va algoritmik dizayn tanlovlariga sezgirlik, namoyishlar sifatiga bog'liqlik va to'xtatish mezoni sabab bo'lgan o'zgaruvchanlikni xabar qiladilar. Belkhale, Cui va Sadigh ma'lumotlar to'plami sifati harakat farqlanishi va o'tish xilma-xilligi orqali rasmiylashtirilishi kerakligini ta'kidlaydilar va holat xilma-xilligi har doim ham foydali emasligini qayd etadilar. DAgger raundi hech kim ataylab tanlamagan holatlarni qo'shadi: ba'zilari sizga kerak bo'lgan tiklanish ma'lumotlari, ba'zilari esa siz boshqaruvni qo'lga olish tugmasini paypaslayotganingizda robotning bezovta harakatlari.
Mexanik jihatdan raund olti qadamdan iborat: yozib olish yoqilgan holda inference'ni ishga tushiring, siyosat noto'g'ri harakat qilganda boshqaruvni qo'lga oling, ishga tushirishni ko'rib chiqing va har bir epizodni faylga joylashtiring, tuzatishlarni sinxronlang, asl nusxalar va tuzatishlardan har bir manba uchun aniq epizod tanlovi bilan aralash ma'lumotlar to'plamini tuzing va oldingi checkpointdan davom eting, bazaviy modeldan emas. ay-robots'da bu qadamlar tugmalar sifatida mavjud, bu ichki jarayonlarni olib tashlaydi, ammo qaror qabul qilishni emas. Ikkita ogohlantirish: checkpoint'dan davom etish og'irliklarni ishga tushiradi va optimizer'ni davom ettirish emas, va leader-arm moslashtirish harakati hali ham uskunada yengil sinovdan o'tgan. Qarang: o'qitish va ma'lumotlar to'plamlari.
DAgger tsikli, allaqachon ulangan
Jonli inference ishga tushirish davomida boshqaruvni qo'lga olish, har bir kadr uchun aralashuvni belgilash, epizodlarni tuzatish yoki baholash sifatida faylga joylashtirish, har bir manba uchun aniq epizod tanlovi bilan aralash ma'lumotlar to'plamini tuzish va mavjud checkpoint'dan o'qitishni davom ettirishning barchasi o'rnatilgan. Qachon boshqaruvni qo'lga olish va nimani saqlashni hali ham siz hal qilasiz — bu qism avtomatlashtirilmaydi.
DAgger tsikli qanday ishlashini ko'ringOilaviy daraxt, bitta jadvalda
| Usul | Holatlarni kim tanlaydi | Ekspert nimani taqdim etadi | Asosiy xarajat |
|---|---|---|---|
| Behavior cloning | Ekspert | Toza namoyishlar | Tiklanish ma'lumotlari yo'q; xato T bo'yicha kvadratik to'planishi mumkin |
| Forward training | O'rganuvchi, har bir vaqt qadamida | Keltirib chiqarilgan taqsimot bo'yicha yorliqlar | T ta alohida siyosat; uzoq gorizontlar uchun yaroqsiz |
| SMILe / SEARN | Ekspert va o'rganuvchining stoxastik aralashmasi | Aralashma taqsimoti bo'yicha yorliqlar | Aralashma komponentlari sifat jihatidan farq qiladi |
| DAgger | Aralash siyosat, beta nolga kamayadi | Har bir tashrif buyurilgan holat uchun to'g'ri harakat | Boshqaruvda bo'lmagan holda ekspert hech qachon hosil qilmaydigan holatlarni belgilash |
| DART | Kiritilgan shovqin bilan bezovtalangan ekspert | Kalibrlangan shovqin ostidagi namoyishlar | Shovqin o'rganuvchining xatosiga kalibrlangan bo'lishi kerak |
| HG-DAgger | O'rganuvchi, inson boshqaruvni qo'lga olguncha | Faqat inson tomonidan boshqariladigan segmentlarda tuzatishlar | Qachon aralashish haqidagi insonning fikriga bog'liq |
| SafeDAgger | Xavfsizlik darvozasi bilan filtrlangan o'rganuvchi | Faqat darvoza so'raganda yorliqlar | Darvozaning o'zi o'qitilgan va ishonchli bo'lishi kerak |
Tez-tez so'raladigan savollar
Men o'z robotimda haqiqatan ham kvadratik xato o'sishini kuzatamanmi?▾
Toza egri chiziq sifatida emas. Chegara eng yomon holat: qat'iy, ya'ni ba'zi masala unga erishadi, sizniki erishadi degani emas. Siz ko'radigan narsa — oqibat: ajratib qo'yilgan kadrlarda yaxshi natija ko'rsatadigan, ammo real vazifada muvaffaqiyatsizlikka uchraydigan va xuddi shunday ma'lumotni ko'proq yozib olganingizda yaxshilanmaydigan siyosat. Agar ko'proq toza ma'lumot yordam berishni to'xtatsa, bu ma'lumot hajmi muammosi emas, kovariat siljishdir.
DAgger deb atash uchun beta aralashmasini amalga oshirishim shartmi?▾
Parametrsiz versiya — birinchi raundda ekspert, keyin sof o'rganuvchi — qonuniy alohida holat bo'lib, asl tajribalarda ko'pincha eng yaxshi natija bergan. Siz tashlab bo'lmaydigan narsa — agregatsiya: faqat eng yangi tuzatishlarda qayta o'qitish Follow-The-Leader talqinini buzadi, aynan shu yerdan no-regret argumenti kelib chiqadi. Faqat tuzatishlarda o'qitish ancha zaifroq protsedura.
Nega oxirgisi o'rniga validatsiya to'plamidagi eng yaxshi siyosat qaytariladi?▾
Chunki teoremalar ketma-ketlikning biror joyida yaxshi siyosat mavjudligini kafolatlaydi, u oxirgi iteratsiya ekanligini emas — chegara ketma-ketlik bo'yicha minimumga tegishli. Oxirgi raunddan chiqqan narsani ishlatish natijaning bayon qilingan shartini rad etadi, va oxirgi raund ishonchli tarzda eng yaxshisi bo'lmaydi.
Nechta raund rejalashtirishim kerak?▾
Nazariya T tartibida iteratsiyalarni xohlaydi, bu esa 600 qadamli epizod uchun hech kim uskunada ishga tushirmaydigan son. Asl tajribalar har bir benchmarkda yigirmata iteratsiya bilan o'tkazilgan. Amalda esa siz aralashuv darajasi kamayishni to'xtatguncha, tahlil taxmin qilgan sondan ancha kam raund o'tkazasiz — nazariya va amaliyot orasidagi haqiqiy farq.
Agar mening siyosat sinfim ekspertni umuman ifodalay olmasa-chi?▾
U holda DAgger sizni qutqarmaydi, va chegara buni aytadi — u sinfdagi orqaga qarab eng yaxshi xato bo'lgan epsilon_N ga nisbatan ifodalanadi. Agar bu noto'g'ri arxitektura, yetishmayotgan kuzatuv yoki sahnani ko'ra olmaydigan kamera sababli katta bo'lsa, agregatsiya sizga vazifani bajara olmaydigan sinf ichida optimal bo'lgan siyosatni beradi. Tuzatishlarni to'plashdan oldin ajratib qo'yilgan epizodlarga nisbatan open-loop qayta ishga tushirishni bajaring.
Bu yerdan qayerga borish kerak
Agar hali siyosat o'qitmagan bo'lsangiz, bu nazariya erta: avval ma'lumotlar to'plamini yozib oling, buning uchun birinchi siyosatingizni o'qitish va desktop mijoz bilan boshlang. Agar yana yuz ta toza namoyish bilan tuzatishlarni boshlash orasida ikkilanayotgan bo'lsangiz: toza namoyishlar taqsimot muammosini tuzatmaydi. Mexanika uchun davom eting: inson tomonidan boshqariladigan variant va keyin SO-100 bo'yicha qo'llanma.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started