Operator teleoperatsiya interfeysi orqali robot qo'lini nazorat qilmoqda, qo'llari boshqaruv pultida va istalgan payt boshqaruvni qo'lga olishga tayyor
DAggerInteraktiv Taqlid Qilish Orqali O'rganishHG-DAggerRobot SiyosatlariSO-100

HG-DAgger va Darvozali Variantlar: Robot Siyosatini Kim, Qachon Qo'lga Oladi

AY-Robots ResearchAugust 27, 202615 daqiqalik o'qish

Oddiy DAgger robot hali harakatni boshqarayotgan paytda insondan holatlarni yorliqlashni so'raydi. Haqiqiy uskunada bu xavfsiz emas va sifatsiz yorliqlar hosil qiladi. Darvozali variantlar ko'r-ko'rona yorliqlashni kimdir ushlab turishi kerak bo'lgan darvoza bilan almashtiradi: HG-DAgger'da — inson, SafeDAgger'da — xavfsizlik klassifikatori, EnsembleDAgger'da — ansambl ichidagi kelishmovchilik, ThriftyDAgger'da — byudjetlashtirilgan yangilik-va-risk bahosi. Ushbu maqola ularni darvozani kim boshqarishi, uni qaysi signal ochishi va har birining narxi bo'yicha taqqoslaydi — hamda nima uchun aynan inson-darvozali shakl haqiqiy robot qo'li bilan aloqada omon qolishini ko'rsatadi.

Klonlangan siyosat o'qitish ma'lumotlari tugagan joyda ishlamay qoladi. Yechim — namoyish beruvchining emas, balki siyosatning o'z holat taqsimoti asosida ma'lumot yig'ishda davom etishdir; aynan buni DAgger amalga oshiradi va buni dataset agregatsiyasiga kirish asosiy tamoyillardan boshlab yoritadi. U asl algoritmning noqulay tomonini ochiq qoldiradi: o'quvchi boshqarayotgan paytda ekspert, boshqaruvda bo'lmasa-da, har bir holat uchun o'zi nima qilgan bo'lardi — shuni aytib turishi kerak.

Skriptlangan ekspert bilan simulyatorda bu bepul. Haqiqiy qo'l turgan stolda esa bu na bepul, na xavfsiz. HG-DAgger mualliflari e'tirozni aniq bildiradi: bunday tanlash sxemalari "ekspertdan tizimni to'liq boshqarmasdan turib harakat yorliqlarini berishni talab qiladi", bu esa "xavfsizlikni pasaytirishi mumkin va ekspert sifatida inson ishlatilganda, sezilgan aktuator kechikishi tufayli yig'ilgan yorliqlar sifatini pasaytirishi ehtimoli katta" (Kelly et al., 2019). Bu gapda ikkita muammo yashiringan: siyosat hech kim xohlamaydigan holatlarga kirishda davom etadi, va shu risk evaziga olingan yorliqlar inson boshqaruvni ushlab turgan paytda yaratgan yorliqlaridan yomonroq bo'ladi. Quyidagi har bir variant xuddi shu savolga javob beradi — boshqaruvga darvoza qo'yish va kimgadir uni qachon ochishni hal qilishga ruxsat berish. Ular faqat o'sha kim ekanligida farqlanadi.

Qisqacha

  • Darvozali variantlar ko'r-ko'rona yorliqlashni siyosat boshqaruvi va ekspert boshqaruvi o'rtasidagi kalit bilan almashtiradi. Ularni ajratib turadigan narsa — bu kalitni kim egallashi.
  • HG-DAgger kalitni insonga beradi va faqat inson uzluksiz boshqaruvga ega bo'lgan paytda yozib olingan ma'lumotlarnigina to'playdi.
  • SafeDAgger uni etalon siyosatdan chetlanishni bashorat qiluvchi binar klassifikatorga beradi; EnsembleDAgger esa bir vaqtning o'zida past ansambl dispersiyasini va ekspert harakatigacha kichik masofani talab qiladi.
  • LazyDAgger boshqaruv u yoqdan-bu yoqqa sakramasligi uchun gisterezis qo'shadi; ThriftyDAgger esa aniq aralashuv byudjeti ostida yangilik yoki baholangan risk asosida darvozani ochadi.
  • Robot-darvozali signallar hobbi darajasidagi qo'lda fine-tuning qilingan VLA'da odatda yetishmaydigan narsaga muhtoj: etalon siyosat, arzon ansambl yoki kalibrlangan epistemik noaniqlik.
  • Darvoza usulning yarmi xolos. Aralashuv segmentlariga keyinchalik nima qilinishi — aralashtirish, vaznlash, to'plash — round biror narsani yaxshilaganmi-yo'qmi, shuni hal qiladi.

Inson-darvozali va robot-darvozali: muhim bo'linish

Interaktiv taqlid qilish orqali o'rganishning o'z sharhi bor; Celemin va hamkasblari uni fikr-mulohaza turi, interfeys, o'rganish modeli, foydalanuvchi tajribasi, qo'llanilishi va benchmark bo'yicha tasniflaydi. Sizning muhandislik yechimingizni belgilaydigan farq esa shu o'qlarning har qandayidan ham soddaroq, va yaqinda chiqqan ish uni to'g'ridan-to'g'ri nomlaydi: usul inson-darvozali deb ataladi, agar nazoratchi qachon aralashishni hal qilsa, va robot-darvozali deb ataladi, agar agent qachon yordam so'rashni hal qilsa (Cai va boshq., 2025). Qolgan hammasi shu ikki tanlovdan biriga xizmat qiluvchi mexanizm xolos. Almashinuv boshidanoq ko'rinadi: inson darvozasi uzluksiz e'tibor talab qiladi, robot darvozasi esa o'sha e'tiborni qaytarib berishni va'da qiladi — lekin faqat u tayanadigan signal ishonchli bo'lsa; va bunday signalni qurish o'zining alohida tadqiqot muammosi.

SafeDAgger: o'z chetlanishini bashorat qiluvchi klassifikator

Zhang va Cho'ning SafeDAgger'i (2016) bu darvozalar orasida eng birinchisi. Etalon siyosatga so'rov yuborish qimmat qism bo'lgani uchun, ikkinchi, kichik tarmoq — xavfsizlik siyosati — umuman so'rov yuborishga arziydimi-yo'qmi, shuni bashorat qiladi. U "asosiy siyosat etalon siyosatga so'rov yubormasdan undan chetlanishi ehtimoli borligini ko'rsatuvchi binar yorliq qaytaradi". Yorliq ikki siyosat harakatlari orasidagi kvadratik L2 chetlanish asosida tau chegarasi bilan aniqlanadi, klassifikator esa binar kross-entropiya bilan o'qitiladi. Ishlash vaqtida u har bir holat uchun o'quvchi boshqarishda davom etishi yoki etalon boshqaruvni qo'lga olishini hal qiladi. Annotatsiyada mashina poygasi simulyatorida kamroq etalon so'rovlari va mualliflar avtomatlashtirilgan kurikulum effektiga bog'laydigan yaqinlashuv tezlashuvi haqida xabar berilgan, biroq ikkalasi uchun ham raqam keltirilmagan.

Muammo natijalarda emas, ta'rifda. Klassifikatorni o'qitish uchun uni moslashtirishda ishlatilgan har bir holatda etalon siyosatning harakati kerak bo'ladi, bu esa etalonning boshqa bir dastur ekanligini taxmin qiladi. Agar sizning etaloningiz yetakchi qo'lga ega inson bo'lsa, bu yorliqlar to'plami arzon bo'lmaydi va usul mo'ljallangan xususiyatini yo'qotadi.

EnsembleDAgger: shubha va farq — ikkalasi ham

Menda, Driggs-Campbell va Kochenderfer (2019) darvozani ehtimollik masalasi sifatida ko'radi. EnsembleDAgger "neyron tarmoqlar ansambli yordamida Gauss jarayonini taxminlaydi" va ansambl dispersiyasini ishonch o'lchovi sifatida o'qiydi: yuqori dispersiya o'qitish ma'lumotlariga o'xshamaydigan hududni bildiradi, bu esa — ekspert muvaffaqiyatsizlik holatlaridan qochadi deb faraz qilinsa — muvaffaqiyatsizlikka yaqinlik bilan bog'liq. Qoida — bu birikma (konyunksiya). O'quvchi faqat o'zining o'rtacha harakati bilan ekspert harakati orasidagi L2 masofa bitta chegaradan (farq) past bo'lganda va uning bashorat qilingan harakati dispersiyasi ikkinchi chegaradan (shubha) past bo'lgandagina harakat qilishi mumkin. Ikkisidan biri bajarilmasa, ekspert boshqaruvni qo'lga oladi. Maqsad — muvaffaqiyatsizlik ehtimolini cheklab turgan holda o'quvchining harakatlar ulushini maksimallashtirish; maqola teskari mayatnik va MuJoCo HalfCheetah'da boshqa DAgger variantlariga nisbatan yaxshilangan xavfsizlik va o'rganish haqida xabar beradi.

Farq hadi ekspert harakatini talab qiladi

Bu jimgina to'liq qoidani qo'l tegmagan nazoratdan chetlashtiradi. O'quvchi harakati bilan ekspert harakati orasidagi masofa o'sha holatda, o'sha lahzada ekspertning harakatini talab qiladi. Skriptlangan ekspert bilan bu muammo emas. Inson bilan esa inson uzluksiz harakat ishlab chiqarishi kerak — bu aynan darvozali variantlar bartaraf etmoqchi bo'lgan yuk. Shubha hadi yolg'iz holda qo'l tegmasdan ishlaydi; birikma esa unday emas.

LazyDAgger: kalitning tez-tez tebranishiga chek qo'yish

Hoque va hamkasblari (2021) avvalgi maqolalar o'lchamagan xarajatga — kalitning o'ziga — hujum qildi. Har bir aralashuv "insonning bajarayotgan boshqa ishini to'xtatadi, nazoratchi va avtonom boshqaruv orasidagi har bir kontekst almashinuvida kechikishga sabab bo'ladi va bajarilishi uchun vaqt talab qiladi". Bir daqiqada o'n marta ochilib-yopiladigan darvoza, xuddi shu avtonom ulush bilan, bir marta o'n soniyaga ochiladigan darvozadan yomonroq. LazyDAgger SafeDAgger'ni assimetrik chegaralar bilan kengaytiradi — nazoratchi boshqaruviga kirish undan chiqishdan qiyinroq — shunda tizim chegarada tebranmaydi. Simulyatsiyada u "3 ta uzluksiz boshqaruv vazifasida SafeDAgger'ga nisbatan kontekst almashinuvlarini o'rtacha 60% ga kamaytiradi, siyosat samaradorligini eng yuqori darajada saqlagan holda"; ABB YuMi bilan mato manipulyatsiyasida esa u "kontekst almashinuvlarini 60% ga kamaytiradi, bajarish vaqtida SafeDAgger'ga nisbatan 60% yuqori muvaffaqiyat darajasiga erishgan holda".

ThriftyDAgger: byudjet ostida yangilik yoki risk

ThriftyDAgger (Hoque et al., CoRL 2021) siyosatdan emas, nazoratchining byudjetidan boshlanadi. U "aralashuvlarni faqat (1) yetarlicha yangi — robot siyosati taqlid qiladigan etalon xatti-harakatga ega bo'lmagan, yoki (2) xavfli — robot vazifani bajarishga ishonchi past bo'lgan holatlardagina so'rash uchun o'rganilgan almashtirish siyosatidan foydalanadi", bu risk baholanishi uchun yangi metrika bilan birga. Byudjet natija emas, kirish ma'lumoti: siz qancha inson vaqtini sarflashingizni o'zingiz belgilaysiz. Bajarish vaqtida qo'llanilganda usul "ham simulyatsiya, ham jismoniy vazifalarda 100% muvaffaqiyat darajasiga erishadi", uch robotdan iborat flotni diqqat talab qiluvchi vazifa bilan bir vaqtda boshqargan o'nta ishtirokchi bilan o'tkazilgan foydalanuvchi tadqiqoti esa "nazoratchi yukini kamaytirgan holda inson va robot samaradorligini navbatdagi eng yaxshi algoritmga nisbatan mos ravishda 58% va 80% ga oshiradi" deb xabar beradi. Flot sharoiti bu ish uchun tabiiy makon; Fleet-DAgger keyinchalik ko'plab robotlar va nazoratchilar bilan interaktiv flot o'rganishini rasmiylashtirdi va optimallashtirish uchun miqdor sifatida Return on Human Effort'ni (inson mehnati samaradorligini) taklif qildi.

HG-DAgger: darvozani inson ushlab turadi

Kelly et al. (2019) boshqa yo'ldan boradi. Bu yerda almashtirish siyosati yo'q. O'quvchi "ekspert yangi boshlovchining holat fazosining xavfsiz bo'lmagan hududiga kirganini kuzatguncha" ishga tushiriladi, shu paytda ekspert boshqaruvni qo'lga oladi va tizimni orqaga qaytaradi. To'plash qoidasi qat'iy qism: "Ekspert harakat yorliqlari faqat shu tiklanish traektoriyalari davomida — inson ekspert tizimni uzluksiz boshqargan paytda — yig'iladi va datasetga qo'shiladi." Inson tomoshabin bo'lgan paytda hech narsa yorliqlanmaydi.

Bu faqat kalit bilan cheklanmaydi. HG-DAgger shuningdek "to'liq o'qitilgan yangi boshlovchining holat fazosining turli hududlaridagi samaradorligini bashorat qilish uchun ishlatilishi mumkin bo'lgan model-noaniqlikka asoslangan risk metrikasi uchun xavfsizlik chegarasini o'rganadi": u inson aralashgan lahzalarda o'quvchi qanchalik noaniq bo'lganini qayd etadi va o'quvchi o'zining yakuniy shakliga eng yaqin bo'lgan yozuvlarning oxirgi choragini o'rtachalaydi. Bu robot boshqaradigan darvoza emas, balki tugallangan siyosatning qayerda ishonchli bo'lishi kutilayotganini ko'rsatuvchi diagnostika. Baholash simulyatsiya qilingan va real dunyodagi haydash vazifasini qamrab oladi va ham DAgger'ga, ham behavior cloning'ga nisbatan yaxshilangan samaradorlik haqida xabar beradi.

Bir bog'liq yo'nalish nima yorliq hisoblanishini o'zgartiradi. Spencer va hamkasblarining Expert Intervention Learning'i "ekspertning har qanday miqdordagi fikr-mulohazasi — aralashuv orqalimi yoki aralashmaslik orqalimi — joriy holatning sifati, harakatning optimalligi yoki ikkalasi haqida ham ma'lumot beradi" deb hisoblaydi; bu o'quvchining qiymat funksiyasiga cheklov sifatida rasmiylashtiriladi va afsuslanmaydigan (no-regret) onlayn o'rganish bilan yechiladi. Shu talqinga ko'ra, inson kuzatib turgan va hech narsa qilmagan bo'laklar bo'sh emas, balki zaif ijobiy dalildir. EIL to'qnashuvdan qochishni taxminan bir daqiqalik ekspert boshqaruvidan o'rganadi.

Nazorat qilinayotgan siyosat rollout'i davomida ma'lumot yig'ish uchun joylashtirilgan kameralar bilan robot qo'li ish maydoni
Inson-darvozali round — bu yozib oluvchi ulangan oddiy inference ishga tushirilishi. Operator boshqargan freymlar belgilanadi; qolgani o'zgarishsiz qoladi.

Variantlar yonma-yon

UsulDarvozani kim ochadiSignalKerakli resurslarXabar qilingan natijalar
DAgger (Ross et al., 2011)Hech kim — o'quvchi doim boshqaradiYo'q; ekspert tashrif buyurilgan har bir holatni yorliqlaydiBoshqaruvda bo'lmasa-da off-policy holatlarni yorliqlay oladigan ekspertO'quvchining holat taqsimoti ostida kafolatlangan afsuslanmaydigan (no-regret) reduksiya
HG-DAgger (Kelly et al., 2019)Inson nazoratchiNazoratchining holat xavfsiz emasligi haqidagi mulohazasiKuzatib turuvchi kimdir va boshqaruvning toza topshirilishiSimulyatsiya qilingan va real haydash vazifasida DAgger va behavior cloning'dan ustun; shuningdek risk chegarasini ham o'rganadi
SafeDAgger (Zhang & Cho, 2016)RobotTau chegarasidan yuqori bo'lgan etalondan L2 chetlanish uchun binar klassifikatorKlassifikator yorliqlari uchun so'rov yuborish mumkin bo'lgan etalon siyosatPoyga simulyatorida kamroq etalon so'rovlari, tezroq yaqinlashuv (raqam berilmagan)
EnsembleDAgger (Menda et al., 2019)RobotAnsambl dispersiyasi va ekspert harakatigacha bo'lgan masofa, ikkalasi ham chegaradan pastTarmoqlar ansambli va har bir qadamdagi ekspert harakatiMayatnik va HalfCheetah'da yaxshilangan xavfsizlik va o'rganish
LazyDAgger (Hoque et al., 2021)Robot, gisterezis bilanAlohida kirish va chiqish chegaralariga ega SafeDAgger signaliSafeDAgger talab qilgan hamma narsa, plyus sozlanadigan ikkinchi chegara3 ta vazifada ~60% kamroq kontekst almashinuvi; YuMi matosida 60% yuqori muvaffaqiyat
ThriftyDAgger (Hoque et al., 2021)Robot, byudjet ostidaYangilik yoki vazifani bajarmaslikning baholangan riskiO'rganilgan risk baholovchisi va belgilangan aralashuv byudjetiBajarish vaqtida 100% muvaffaqiyat; foydalanuvchi tadqiqoti (N=10): navbatdagi eng yaxshiga nisbatan 58% va 80% yutuq
EIL (Spencer et al., 2020)Inson — aralashmaslik ham hisobga olinadiQiymat funksiyasiga cheklov sifatida aralashuv va uning yo'qligiQiymat cheklovi ustida onlayn afsuslanmaydigan (no-regret) o'rganishTaxminan bir daqiqalik ekspert boshqaruvidan to'qnashuvdan qochishni o'rganish

Har bir darvoza nima beradi va nimaga tushadi

"Kerakli resurslar" ustunini o'qib chiqing va bir naqsh ko'rinadi: har bir robot-darvozali signal — bu ishlab chiqarilishi kerak bo'lgan proksi, va har bir proksining o'z hisobi bor.

  • Farq signallari (SafeDAgger, LazyDAgger, EnsembleDAgger qoidasining yarmi) etalon siyosatga muhtoj. Yo sizda skriptlangan ekspert bor — bu holda qiziqarli muammo allaqachon yechilgan, yoki fonda inson doimiy ravishda harakatlar ishlab chiqarib turadi, shunda masofa hisoblanishi mumkin.
  • Shubha signallari kalibrlangan epistemik noaniqlikka muhtoj. Kichik boshqaruv tarmoqlari ansambli buni taxminlashtiradi; uch milliard parametrli vision-language-action modelning ansambli esa avvalambor xotira va kechikish muammosidir.
  • Yangilik va risk signallari yetarlicha muvaffaqiyatli va muvaffaqiyatsiz rollout'larga moslashtirilgan, vazifa bajarilishini o'rganilgan baholovchisiga muhtoj. Siz hali ishga tushirayotgan vazifada bu ma'lumot birinchi roundda mavjud emas.
  • Inson darvozasiga faqat e'tibor kerak, boshqa hech narsa — birinchi kundanoq, istalgan siyosat arxitekturasida mavjud bo'lgan yagona signal, o'qitish uchun qo'shimcha model talab qilmaydi.
  • Hech qanday robot darvoza insonni xonadan chiqarib yubormaydi. Ular insonning qanchalik tez-tez harakat qilishi kerakligini kamaytiradi, uning hozir bo'lishi shart emasligini emas.

Darvoza nima ishlab chiqarishida ham sokinroq farq bor. Traektoriya o'rtasida ishga tushadigan robot darvozasi insonga o'zboshimcha pozadagi harakatlanuvchi qo'lni topshiradi. Inson darvozasi esa operatorga lahzani tanlash imkonini beradi — cho'zilishdan keyin, ushlab olishdan oldin, silkinish o'rtasida emas. Ikkalasidan olingan tiklanish segmentlari bir xil darajada toza emas, va aynan shu segmentlar roundning butun mahsulotidir.

Nima uchun inson-darvozali shakl haqiqiy uskunada g'alaba qozonadi

Bu muhandislik dalili, benchmark natijasi emas — biz topgan hech qanday maqola barcha beshta darvozani bir xil manipulyatorda bir xil siyosat klassi bilan sinamagan. U to'rtta nuqtaga tayanadi.

Birinchidan, nazoratchi baribir shu yerda. Hech kim SO-100 qo'lini ag'darib yuborishi mumkin bo'lgan buyumlar yonida nazoratsiz qoldirmaydi. Kimdir kuzatib turgan ekan, unga qo'lga olish tugmasini berishning qo'shimcha xarajati deyarli nolga teng; kalibrlangan risk baholovchisini qurish esa alohida loyiha.

Ikkinchidan, zamonaviy siyosatda haqiqatan o'lchash mumkin bo'lgan noaniqlik ko'pincha noto'g'ri miqdordir. Diffuziya yoki flow-matching boshi tanlangan harakat bo'laklari (action chunks) bo'yicha dispersiya hosil qiladi, va bu dispersiya bosh o'rgatilgan multimodallikni aks ettiradi, holat haqidagi epistemik bilmaslikni emas. EnsembleDAgger'ning shubha hadi aynan shu ikkinchisini tutish uchun ansambldan foydalanadi. Ikkalasi bir xil raqamdek ko'rinadi, lekin unday emas; action chunking va flow matching maqolalari bu boshlar harakatlarni qanday chiqarishini yoritadi.

Uchinchidan, manipulyatsiyada muhim bo'lgan xatolar ko'pincha statistik jihatdan g'ayrioddiy emas, balki semantik xarakterga ega bo'ladi. Griferni ikki santimetr erta yopayotgan yoki ikkita bir xil kubdan noto'g'risiga ishonch bilan cho'zilayotgan siyosat yuqori dispersiyali holatda emas — u ishonchli va noto'g'ri. Hech qanday dispersiya chegarasi buni tutmaydi; kuzatib turgan inson esa buni darhol payqaydi.

To'rtinchidan, yorliq sifati — HG-DAgger'ning asl fikri, va ko'pincha e'tibordan chetda qoladigan narsa. Inson uzluksiz boshqaruvga ega bo'lgan paytda yig'ilgan yorliqlar harakatlanayotgan tizim ustidan sharh qilingan yorliqlardan ustun turadi. Agar maqsad to'plashga arziydigan tuzatuvchi ma'lumot bo'lsa, isbotlash yuki avtomatlashtirilgan darvozaning zimmasida.

Robot darvozalari qayerda o'zini oqlaydi

Bitta nazoratchi ko'plab robotlar uchun javobgar bo'lganda manzara teskarisiga aylanadi — bu ThriftyDAgger'ning foydalanuvchi tadqiqoti va Fleet-DAgger'ning rasmiylashtirishi mo'ljallagan rejim. Flotda inson e'tibori tanqis resurs, va nomukammal taqsimot hech narsa yo'qligidan yaxshiroq. Bitta stolda bitta qo'l bilan esa siz bu rejimda emassiz.

Allaqachon o'rnatilgan inson-darvozali sikl

Ishlayotgan inference sessiyasi davomida qo'lga olish, tuzatilgan segmentlarda freym-bo'yicha aralashuv belgilari, har bir runni tuzatishlar yoki baholashga kuratsiya qilish, siz tanlagan manbalardan aralash dataset tuzish va mavjud checkpoint'dan o'qitishni davom ettirish — bularning barchasi qo'lda skript yozish o'rniga tizimga o'rnatilgan. Qo'lga olish yetakchi qo'l bilan, yoki u bo'lmasa klaviatura va slayderlar bilan ishlaydi.

DAgger sikli qanday ishlashini ko'ring

Darvoza usulning yarmi; ma'lumotlarni boshqarish esa qolgan yarmi

Darvoza insonning qaysi freymlarni boshqarganini hal qiladi, ular bilan nima qilishni emas, va aynan shu ikkinchi qaror roundlar ko'pincha behuda ketadigan joy. Birinchi qoida — DAgger'dagi "D" nimani anglatishi: to'pla, almashtirma. checkpoint'ni faqat bir necha yuzta tuzatish freymida fine-tuning qilish sizga deyarli faqat tiklanishlarni ko'rgan va nominal traektoriyani unutgan modelni beradi.

Ikkinchi qoida — aralashuv freymlari oddiy freymlar emasligi. Mandlekar et al. operatorlarga siyosatlarni kuzatish va muvaffaqiyatsizlikda boshqaruvni qo'lga olish imkonini beruvchi 6-DoF manipulyatsiya uchun masofaviy teleoperatsiya tizimini qurdi, so'ng "siyosatni aralashuvlar orqali tor joylardan (bottleneck) qanday o'tishni o'rganishga undaydigan" algoritm bilan iterativ o'qitdi; shu ma'lumotda o'qitilgan agentlar teng miqdordagi oddiy namoyish namunalarida o'qitilgan agentlardan ustun chiqdi. Sirius bu g'oyani joriy qilishga olib boradi, "o'qitish namunalarini taxminiy inson ishonchi bilan qayta vaznlash va siyosatlarni vaznlangan behavior cloning bilan optimallashtirish" orqali. Ikkalasiga ham qaysi freym inson tomonidan boshqarilganini ko'rsatuvchi freym-bo'yicha belgi kerak, shuning uchun ham aralashuv bayrog'i ko'ringanidan ko'ra muhimroq.

Uchinchi qoida — avtomatik aralashtirish tuzoq ekanligi. Manbalarini sanab bo'lmaydigan tuzilgan dataset — bu keyingi round yomonlashganda tuzata olmaydigan datasetdir. Shu platformada compose bosqichi aynan shu sababdan aniq ko'rsatiladi — asl dataset plyus tuzatishlar, har bir manba bo'yicha epizod tanlovi, va natija boshqa har qanday dataset kabi sinxronlanadigan va o'qitiladigan oddiy LeRobot dataset bo'ladi; dataset hujjatlari format tomonini yoritadi.

Rounddagi qadamNima ishlab chiqaradiEng ko'p uchraydigan xato usuli
Yozib olish yoqilgan holda inference'ni ishga tushirishSiyosatning o'z holat taqsimoti ostidagi runOddiy teleoperatsiya sifatida yozib olinadi, siyosat boshqarganligi haqidagi ma'lumot yo'qoladi
Muvaffaqiyatsizlikda qo'lga olishFreym-bo'yicha aralashuv bayrog'iga ega tuzatish segmentlariTiklanish o'rniga kosmetik tebranishni tuzatish, uslubni o'rgatish
Har bir epizodni kuratsiya qilishTuzatishlar, baholash yoki chiqarib tashlashHammasini saqlab qolish; buzilgan qo'lga olish epizodning o'ziga qaraganda qimmatroqqa tushadi
Tuzatishlarni sinxronlashAsl nusxa yonida versiyalangan datasetHech qachon lokal mashinadan chiqmaydigan tuzatishlar
Aralash datasetni tuzish (compose)Asl nusxa plyus tuzatishlar, aniq tanlovSokin avtomatik aralashtirish, shu sababli keyingi regressiyani manbaga qadar kuzatib bo'lmaydi
Checkpoint'dan davom ettirishAvvalgisidan initsializatsiya qilingan checkpointOptimizatorning davom etishini kutish; vaznlar modelni initsializatsiya qiladi, optimizator holatini tiklamaydi

Inson haqiqatan ushlab tura oladigan darvoza o'rnatish

"Inson hal qiladi" degani spetsifikatsiya emas. Har xil chegaralarga ega ikki operator solishtirib bo'lmaydigan roundlar hosil qiladi, va siljib turuvchi chegara o'qib bo'lmaydigan trend hosil qiladi. Triggerlarni birinchi rundan oldin yozib qo'ying.

  1. Darvozani ochadigan shartlarni aniq belgilang — yaqinlashish belgilangan chegaradan ko'proq chetga chiqishi, griferning bo'sh joyni yopishi, bo'g'imning chegaraga tomon siljishi, bir-ikki soniyadan ortiq to'xtalib qolish — va roundlar davomida bu ro'yxatni o'zgartirmang.
  2. Darvozani ochmaydigan holatlarni ham aniqlang. Siyosat o'zi tiklanadigan oshiqcha siljish — bu o'qitish signali; o'sha yerda qo'lga olish uning allaqachon bilgan tiklanishini o'chirib tashlaydi.
  3. Toza topshirish uchun yetarlicha erta qo'lga oling, holat tiklanishi mumkin bo'lishi bilanoq qaytarib bering.
  4. Har bir epizod uchun nima uchun qo'lga olganingizni yozib boring. Uch round o'tgach, bu xuddi shu xato qaytadimi-yo'qmi haqidagi yagona yozuv bo'ladi.
  5. Kameralar, vazifa matni va operatorni roundlar davomida o'zgarmas saqlang. Birontasini o'zgartirsangiz, raqamlar solishtirib bo'lmaydigan bo'lib qoladi.

Mexanik jihatdan topshirish ikki xil bo'ladi. Yetakchi qo'l bilan, moment (torque) uzatilishidan oldin yetakchi ergashuvchining joriy pozasiga yetib borishi kerak, aks holda qo'l sakraydi; bu tekislash harakati haqiqiy uskunada zanjirning eng kam sinalgan qismidir. Yetakchi qo'lsiz esa qo'lga olish birinchi tugma bosilishidanoq qo'lda amalga oshiriladi: ergashuvchi ushlab turiladi va operator uni klaviaturadan bo'g'im-bo'g'im surib boshqaradi yoki slayderlarni tortadi, server tomonidagi cheklovlar esa har bir kirishni kichik ushlab turadi — tugma bosilishiga bir necha gradus, slayder yangilanishiga bir hovuch gradus, chunki ushlab turilgan pozaga katta qadam bilan kirish servoni ishdan chiqarish usulidir. Tugma biriktirmalari bilan qadam-baqadam versiyasi SO-100'da DAgger roundining qo'llanmasida joylashgan; ikkala teleoperatsiya rejimi haqidagi ma'lumot esa teleoperatsiya hujjatlarida va yetakchi-ergashuvchi maqolasida.

Qo'llab-quvvatlanadigan siyosat arxitekturalarining o'qitish va inference xususiyatlari bo'yicha taqqoslash
Darvoza arxitekturadan mustaqil. Qaysi siyosatni tuzatishingiz roundning o'qitish xarajatini o'zgartiradi, qo'lga olish qanday ishlashini emas.

Darvoza biror narsaga foyda berdimi-yo'qmi, buni tushunish

Inson-darvozali roundning metrikasi — aralashuv darajasi: aralashuv freymlarining run freymlariga nisbati. Uning bitta vazifasi bor — agar u roundlar davomida pasaymasa, round hech narsa bermagan, va keyingisi ma'lumot miqdoridan boshqa narsani o'zgartirishi kerak.

Bu noxolis (biased) metrika, va buni qanday ekanini bilishingiz kerak. U siyosat malakasi qanchalik bo'lsa, operator chegarasini ham shunchalik o'lchaydi, shuning uchun ham trigger ro'yxati o'zgarmas qoladi; sessiya davomida talablarini bo'shashtiradigan operator ortida hech narsa bo'lmagan pasayuvchi egri chiziq hosil qiladi. U shuningdek jiddiylikni ham e'tiborga olmaydi — to'qnashuvni to'xtatish uchun o'nta freym va ushlashni bir oz tuzatish uchun o'nta freym bir xil ko'rinadi. Buni hech qachon tuzatish ma'lumoti olinmagan qat'iy baholash to'plami bilan birga ishlating. DAgger siklini o'lchash haqidagi maqola baholash dizaynini batafsil ko'rib chiqadi, shu jumladan baholash epizodlarini o'qitish aralashmasidan qanday chetda tutish mumkinligini ham.

Inson darvozasi, ochig'ini aytganda
U sizga nima beradi
  • Birinchi kunidanoq, istalgan siyosat arxitekturasida, kalibrlash uchun qo'shimcha model talab qilmasdan ishlaydi
  • Hech qanday dispersiya chegarasi aniqlay olmaydigan "ishonchli, lekin noto'g'ri" xatolarni ushlaydi
  • Operator to'liq boshqaruvga ega bo'lgan paytda, o'zi tanlagan lahzada yozib olingan tuzatishlarni ishlab chiqaradi
  • IWR va Sirius kabi aralashuv-vaznli usullar foydalanadigan freym-bo'yicha belgini beradi
Nimani bermaydi
  • Uzluksiz nazoratni talab qiladi; bitta inson va ko'plab robotlar holatiga masshtablanmaydi
  • Operatorning izchilligiga bog'liq — siljib turuvchi chegara aralashuv darajasini buzadi
  • O'zi hech qanday risk modelini ishlab chiqarmaydi; HG-DAgger'ning o'rganilgan chegarasi va ThriftyDAgger'ning baholovchisi qo'shimcha mexanizmlardir
  • Oqibatlarni emas, freymlarni sanaydi
  • Xatoligi boshqaruvdan oldingi bosqichda bo'lgan siyosatni qutqara olmaydi — masalan, almashtirilgan kamera yoki noto'g'ri yorliqlangan vazifa satri

Nazarda tutish kerak bo'lgan ochiq savollar

Benchmarklar zaif. Spencer va hamkasblari taqlid qilish orqali o'rganish yondashuvlarini sinash uchun ishlatiladigan benchmarklarni tekshirdi va ularni "amalga oshirilishi mumkin va sodda, shuning uchun real dunyodagi qaror qabul qilish muammolarida ko'rinadigan xato to'planishining qiyinroq rejimlarini qamrab olish uchun yetarli emas" deb topdi — va atrofdagi adabiyotga zid ravishda, oddiy behavior cloning ularda yaxshi natija ko'rsatishini aniqladi. Bu, yuqoridagi jadvaldagi ba'zi raqamlar ham kiritilgan holda, shu vazifalarga tayanadigan DAgger variantlarining har qanday reytingiga shubha bilan qarash uchun sabab.

Katta siyosatlardagi robot darvozalari ham hal qilingan muammo emas. AIM ishi noaniqlikni inson aralashuv qoidasini taqlid qiluvchi proksi Q-funksiya bilan almashtiradi va ThriftyDAgger'ga nisbatan qo'lga olish xarajati va o'rganish samaradorligida 40% yaxshilanish haqida xabar beradi — bu uzluksiz va diskret boshqaruvda, manipulyatorni boshqaruvchi vision-language-action modelda emas. Bu darvozalardan birortasi fine-tuning qilingan VLA'ga o'tkaziladimi-yo'qmi, bu ochiq savol. Sharh yana bir bog'liq fikrni ta'kidlaydi: sohaning terminologiyasi va tuzilishi adabiyot bo'ylab birlashtirilmagan, bu esa usullarni solishtirishni qiyinlashtiradi. O'z qo'lingizda esa loglaringiz — qo'lingizdagi yagona dalil.

Agar inson faqat aralashuvlar paytida yorliqlasa, HG-DAgger haqiqatan ham DAgger hisoblanadimi?

U muhim qismni saqlab qoladi — o'quvchi keltirib chiqaradigan holat taqsimoti ostida yig'ilgan va avvalgi ma'lumotlar bilan to'plangan ma'lumotni — va uskuna bilan aloqada omon qolmaydigan qismni tashlab yuboradi. Kelly et al. buni variant sifatida taqdim etadi; 2011-yilgi afsuslanmaydigan (no-regret) kafolat o'zgarishsiz ko'chib o'tmaydi.

SO-100'dagi fine-tuning qilingan VLA siyosatida robot darvozasidan foydalana olamanmi?

To'g'ridan-to'g'ri emas. SafeDAgger'ning klassifikatori sizda bo'lmagan, so'rov yuborish mumkin bo'lgan etalon siyosatni talab qiladi. EnsembleDAgger ansamblni talab qiladi, bu esa ko'p milliardli parametrga ega model uchun xotirada bir necha nusxa saqlash va ularning inference xarajatini anglatadi. ThriftyDAgger esa birinchi roundlaringizdan oldin mavjud bo'lmagan muvaffaqiyat va muvaffaqiyatsizliklarga moslashtirilgan risk baholovchisini talab qiladi.

Bitta qo'lga olish qancha davom etishi kerak?

Siyosat davom ettira oladigan holatga yetguncha, va undan ortiq emas: cho'zilgan qo'lga olishlar runni namoyish sessiyasiga aylantiradi va tuzatish to'plamini nominal xatti-harakat bilan to'ldirib yuboradi. LazyDAgger'ning topilmasi teskari tomondan ham amal qiladi — juda ko'p qisqa almashinuvlarning ham o'z narxi bor.

Faqat tuzatilgan segmentlarda o'qitishim kerakmi?

Yo'q — bu roundni behuda ketkazishning eng ko'p uchraydigan usuli. Faqat tiklanishlarda fine-tuning qilingan model deyarli faqat tiklanishlarnigina ko'rgan bo'ladi. Tuzatishlarni aniq tanlangan manbalar bilan asl datasetga aralashtiring; yanada oldinga borish uchun IWR yoki Sirius kabi, inson boshqargan freymlarni ajratib qo'yish o'rniga ularning vaznini oshiradigan aralashuv-vaznli yondashuvlarga qarang.

Agar round o'tgach aralashuv darajasi pasaymasa-chi?

Buni bor holicha qabul qiling: round yordam bermadi. Tuzatishlar qo'shishdan oldin arzonroq tushuntirishlarni tekshiring — operatorning chegarasi siljidimi, tuzatishlar kosmetik edimi, tuzilgan dataset ularni haqiqatan o'z ichiga oldimi, o'qitish mo'ljallangan checkpoint'dan boshlandimi. Sokingina baza modeldan boshlangan round xuddi o'rganolmagan roundday ko'rinadi.

Aralashmaslik ham ma'lumot tashiydimi?

Expert Intervention Learning nuqtai nazaridan — ha: nazoratchi kuzatib turgan va harakat qilmagan bo'laklar holat va harakat qabul qilingan ekanligining zaif dalili sifatida o'qiladi, bu qiymat funksiyasiga cheklov sifatida rasmiylashtiriladi. Ko'pgina amaliy pipeline'lar, jumladan mana shu ham, faqat inson boshqargan qismnigina belgilaydi.

Stoldagi bitta qo'l uchun tanlov qilingan: darvozani o'zingiz ushlab turing, uni nima ochishini yozib qo'ying, va kuchni kalitni avtomatlashtirishga emas, uning ortidagi ma'lumotlarni boshqarishga sarflang. Platforma tomoni DAgger sikli sahifasida tasvirlangan, siyosat oilalari bo'yicha o'qitish variantlari esa o'qitish va narxlar ostida. Zaruriy bilim uchun taqlid qilish orqali o'rganish va SO-100'da taqlid qilish orqali o'rganishdan boshlang; birinchi run uchun esa birinchi siyosatingizni ishga tushirish qisqaroq yo'ldir.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started