
Қарапайым DAgger робот әлі қозғалыста кезінде адамнан күйлерді белгілеуді талап етеді. Нақты жабдықта бұл қауіпсіз емес және сапасыз белгілер береді. Қақпалы нұсқалар соқыр белгілеуді біреу ұстап тұруы керек қақпамен алмастырады: HG-DAgger-де — адам, SafeDAgger-де — қауіпсіздік классификаторы, EnsembleDAgger-де — ансамбльдің келіспеушілігі, ThriftyDAgger-де — бюджеттелген жаңалық пен тәуекел бағасы. Бұл мақала оларды қақпаны кім иеленетініне, қандай сигнал оны ашатынына және әрқайсысының қанша тұратынына қарай салыстырады — және неге адам басқаратын нұсқа нақты манипуляторға тигенде аман қалатынын түсіндіреді.
Клондалған саясат оқыту деректері таусылған жерде сәтсіздікке ұшырайды. Шешім — деректерді демонстратордың емес, саясаттың өз күй үлестірімі бойынша жинауды жалғастыру, дәл осыны DAgger жасайды және мұны деректер жиынын біріктіруге кіріспе негізгі принциптерден бастап баяндайды. Ол бастапқы алгоритмнің ыңғайсыз бөлігін ашық қалдырады: үйренуші басқарып жатқанда, сарапшы басқаруда болмай тұрып әрбір күй үшін өзі не істеген болар едім деп айтуы керек.
Скрипттелген сарапшысы бар симуляторда бұл тегін. Үстінде нақты қол тұрған үстелде бұл не тегін, не қауіпсіз емес. HG-DAgger авторлары қарсылықты дәл тұжырымдайды: мұндай іріктеу схемалары "сарапшыдан жүйені толық бақыламай тұрып әрекет белгілерін беруді талап етеді", бұл "қауіпсіздікті төмендетуі мүмкін, ал адамдарды сарапшы ретінде пайдаланғанда, атқарушы механизмнің кешігуін сезінуге байланысты жиналған белгілердің сапасын нашарлатуы ықтимал" (Kelly және т.б., 2019). Бұл сөйлемде екі кемшілік жасырылған: саясат ешкім қаламайтын күйлерге түсуін жалғастырады, ал сол тәуекелмен сатып алынған белгілер адам басқару элементтерін ұстап тұрып шығарған белгілерден нашар. Төмендегі әрбір нұсқа сол бір сұраққа жауап береді — басқаруға қақпа қойып, оны қашан ашу керектігін біреу шешсін. Олар тек сол «біреудің» кім екенімен ерекшеленеді.
Қысқаша мазмұны
- •Қақпалы нұсқалар соқыр белгілеуді саясат басқаруы мен сарапшы басқаруы арасындағы ауыстырғышпен алмастырады. Оларды ажырататыны — ауыстырғышты кім иеленетіні.
- •HG-DAgger ауыстырғышты адамға береді және тек адам үздіксіз бақылауда болған кезде жазылған деректерді ғана біріктіреді.
- •SafeDAgger оны эталондық саясаттан ауытқуды болжайтын бинарлық классификаторға береді; EnsembleDAgger бір мезгілде ансамбльдің төмен дисперсиясын және сарапшы әрекетіне аз қашықтықты талап етеді.
- •LazyDAgger басқару шайқалмас үшін гистерезис қосады; ThriftyDAgger нақты белгіленген араласу бюджеті аясында жаңалық немесе бағаланған тәуекел бойынша қақпаны ашады.
- •Робот басқаратын сигналдарға әуесқойлық деңгейдегі қолда дәл баптанған VLA-да әдетте жоқ нәрсе қажет: эталондық саясат, арзан ансамбль немесе калибрленген эпистемиялық белгісіздік.
- •Қақпа — әдістің жартысы ғана. Араласу сегменттеріне кейін не болатыны — араластыру, салмақтау, біріктіру — раундтың бірдеңені жақсартқан-жақсартпағанын шешеді.
Адам басқаратын және робот басқаратын: маңызды бөліну
Интерактивті имитациялық оқытудың өз шолуы бар; Селемин және әріптестері оны кері байланыс түрі, интерфейс, оқыту моделі, пайдаланушы тәжірибесі, қолданылу саласы және бенчмарк бойынша жүйелейді. Сіздің инженерлік шешіміңізді анықтайтын айырмашылық осы өлшемдердің кез келгенінен қарапайымырақ, және соңғы жұмыстар оны тікелей атайды: егер бақылаушы қашан араласуды өзі шешсе, әдіс адам басқаратын деп аталады, ал егер агент өзі қашан көмек сұрау керектігін шешсе, робот басқаратын деп аталады (Cai және т.б., 2025). Қалғанның бәрі осы екі таңдаудың біріне қызмет ететін механизм. Айырбас басынан-ақ көрінеді: адам қақпасы үздіксіз назарды талап етеді, ал робот қақпасы сол назарды қайтаруға уәде береді — бірақ тек ол негізделетін сигнал сенімді болған жағдайда ғана, ал мұндай сигналды құру — бөлек зерттеу мәселесі.
SafeDAgger: өз ауытқуын болжайтын классификатор
Чжан мен Чоудың SafeDAgger-і (2016) осы қақпалардың ішіндегі ең ертеректі. Эталондық саясатқа сұрау салу қымбат бөлігі болғандықтан, екінші, кіші желі — қауіпсіздік саясаты — сұрау салудың жалпы мағынасы бар-жоғын болжайды. Ол "негізгі саясаттың оған сұрау салмай-ақ эталондық саясаттан ауытқу ықтималдығын көрсететін бинарлық белгі қайтарады". Белгі екі саясаттың әрекеттері арасындағы квадраттық L2 ауытқуы бойынша tau шегімен анықталады, ал классификатор бинарлық кросс-энтропиямен оқытылады. Жұмыс кезінде ол әрбір күй үшін үйренушінің басқаруды жалғастыруы керек пе, әлде эталон оны қолға алуы керек пе екенін шешеді. Аннотацияда автокөлік жарысы симуляторында эталонға аз сұраныс жасалғаны және авторлар автоматтандырылған оқу бағдарламасы әсеріне жатқызатын жинақталу жылдамдығының артуы туралы айтылады, бірақ екеуіне де сан келтірілмейді.
Түйткіл нәтижелерде емес, анықтамада жатыр. Классификаторды оқыту оны баптау үшін пайдаланылатын әрбір күй бойынша эталондық саясаттың әрекетін талап етеді, бұл эталонның басқа бағдарлама болуын болжайды. Егер сіздің эталоныңыз лидер қолы бар адам болса, бұл белгілер жиынтығы арзан емес, әрі әдіс өзі арналған қасиетінен айырылады.
EnsembleDAgger: күмән мен алшақтық, екеуі бірге
Менда, Дриггс-Кэмпбелл және Коченддерфер (2019) қақпаны ықтималдық мәселесі ретінде қарастырады. EnsembleDAgger "нейрондық желілер ансамблін пайдаланып Гаусс процесін жуықтайды" және ансамбль дисперсиясын сенімділік прокси ретінде оқиды: жоғары дисперсия оқыту деректеріне ұқсамайтын аймақты білдіреді, ал бұл — сарапшы сәтсіздік күйлерінен аулақ жүреді деп есептегенде — сәтсіздікке жақындықпен байланысты. Ереже — бір мезгілде орындалатын шарт. Үйренуші тек оның орташа әрекеті мен сарапшы әрекеті арасындағы L2 қашықтығы бір шектен (алшақтық) төмен болғанда және оның болжанған әрекетінің дисперсиясы екінші шектен (күмән) төмен болғанда ғана әрекет ете алады. Осылардың бірі орындалмаса, сарапшы басқаруды қолға алады. Мақсат — сәтсіздік ықтималдығын шектей отырып, үйренушінің әрекеттер үлесін барынша арттыру; мақалада аударылған маятник пен MuJoCo HalfCheetah-та басқа DAgger нұсқаларымен салыстырғанда жақсарған қауіпсіздік пен оқыту туралы айтылады.
Бұл толық ережені қолсыз қадағалау үшін үнсіз жарамсыз етеді. Үйренуші әрекеті мен сарапшы әрекеті арасындағы қашықтық сол күйдегі, сол сәттегі сарапшы әрекетін талап етеді. Скрипттелген сарапшымен бәрі жақсы. Адаммен болса, адам әрекеттерді үздіксіз шығаруы керек — бұл дәл қақпалы нұсқалар жоюға арналған жүктеме. Тек күмән мүшесінің өзі қолсыз жұмыс істейді; ал шарттың толық түрі олай емес.
LazyDAgger: ауыстырғыштың дірілдеуін тоқтату
Хоке және әріптестері (2021) бұрынғы мақалалар өлшемеген шығынға назар аударды: ауыстырғыштың өзіне. Әрбір араласу "адам істеп жатқан басқа жұмысты үзеді, бақылаушы мен автономды басқару арасындағы әрбір контекст ауысуында кідіріс тудырады және орындауға уақыт талап етеді". Минутына он рет ашылып-жабылатын қақпа бірдей автономды үлеспен он секундқа бір рет ашылатын қақпадан нашарырақ. LazyDAgger SafeDAgger-ді асимметриялық шектермен кеңейтеді — бақылаушы басқаруына кіру онда қалудан қиынырақ — осылайша жүйе шекарада тербелмейді. Симуляцияда ол "үздіксіз басқарудың 3 тапсырмасында SafeDAgger-мен салыстырғанда контекст ауысуларын орта есеппен 60%-ға азайта отырып, заманауи деңгейдегі саясат өнімділігін сақтай алады"; ABB YuMi-мен мата манипуляциясында ол "орындау уақытында SafeDAgger-ге қарағанда 60%-ға жоғары сәттілік деңгейіне жете отырып, контекст ауысуларын 60%-ға азайтады".
ThriftyDAgger: бюджет аясындағы жаңалық немесе тәуекел
ThriftyDAgger (Хоке және т.б., CoRL 2021) саясаттан емес, бақылаушының бюджетінен бастайды. Ол "тек жеткілікті дәрежеде (1) жаңа, яғни робот саясатында еліктейтін эталондық мінез-құлық жоқ, немесе (2) тәуекелді, яғни роботтың тапсырманы орындауға сенімі төмен күйлерде ғана араласуды сұрау үшін үйретілген ауыстыру саясатын пайдаланады", әрі осы тәуекелді бағалауға арналған жаңа метрикамен жабдықталған. Бюджет — нәтиже емес, кіріс параметр: сіз қанша адам уақытын жұмсайтыныңызды алдын ала белгілейсіз. Орындау кезінде қолданылған әдіс "симуляциялық та, физикалық тапсырмаларда да 100% сәттілік деңгейіне жетеді", ал үш роботтан тұратын флотты бір мезгілде зейін талап ететін тапсырмамен басқаратын он қатысушымен жүргізілген пайдаланушы зерттеуі оның "келесі үздік алгоритммен салыстырғанда адам мен робот өнімділігін сәйкесінше 58% және 80%-ға арттыра отырып, бақылаушы жүктемесін азайтатынын" хабарлайды. Флот жағдайы бұл жұмыс үшін табиғи орта; кейінірек Fleet-DAgger бірнеше робот пен бақылаушысы бар интерактивті флот оқытуын формализациялап, оңтайландырылатын шама ретінде адам күшінің қайтарымын (Return on Human Effort) ұсынды.
HG-DAgger: қақпаны адам ұстайды
Келли және т.б. (2019) басқа жолмен жүреді. Ешқандай ауыстыру саясаты жоқ. Үйренуші "сарапшы жаңадан үйренушінің күй кеңістігінің қауіпсіз емес аймағына кіргенін байқағанға дейін" жұмыс істейді, содан кейін сарапшы басқаруды қолға алып, жүйені кері бағыттайды. Біріктіру ережесі — қатаң бөлігі: "Сарапшы әрекет белгілері тек осы қалпына келтіру траекторияларында ғана жиналып, деректер жиынына қосылады, ол кезде сарапшы жүйені үздіксіз бақылайды." Адам көрермен болып тұрған кезде ештеңе белгіленбейді.
Бұл тек ауыстырғышпен шектелмейді. HG-DAgger сонымен қатар "толық оқытылған жаңадан үйренушінің күй кеңістігінің әртүрлі аймақтарындағы өнімділігін болжау үшін пайдалануға болатын, модель белгісіздігіне негізделген тәуекел метрикасы үшін қауіпсіздік шегін үйренеді": ол адам араласқан сәттерде үйренушінің қаншалықты белгісіз болғанын жазып, үйренуші өзінің соңғы түріне ең көп ұқсайтын осы жазбалардың соңғы ширегін орташалайды. Бұл роботтың пайдаланатын қақпасы емес, дайын саясаттың қай жерде тұрақты болатынын болжайтын диагностика. Бағалау симуляциялық және нақты дүниедегі жүргізу тапсырмасын қамтиды және DAgger мен мінез-құлықты клондаудан жақсырақ өнімділікті хабарлайды.
Байланысты бір бағыт белгі деп есептелетінді өзгертеді. Спенсер және әріптестерінің Expert Intervention Learning әдісі "сарапшының кез келген көлемдегі кері байланысы, араласу арқылы болсын, араласпау арқылы болсын, ағымдағы күйдің сапасы, әрекеттің оңтайлылығы немесе екеуі туралы да ақпарат береді" деп есептейді, бұл үйренушінің құндылық функциясына қойылатын шектеу ретінде формализацияланып, өкінусіз (no-regret) онлайн оқытумен шешіледі. Осы түсінік бойынша адам бақылап, ештеңе жасамаған кезеңдер бос емес, әлсіз оң дәлел болып саналады. EIL соқтығысудан аулақ болуды сарапшының шамамен бір минуттық басқаруынан үйренеді.

Нұсқалар қатар-қатар
| Әдіс | Қақпаны кім ашады | Сигнал | Не қажет | Хабарланған нәтиже |
|---|---|---|---|---|
| DAgger (Росс және т.б., 2011) | Ешкім — үйренуші үнемі өзі басқарады | Жоқ; сарапшы барлық барылған күйді белгілейді | Басқаруда болмай тұрып саясаттан тыс күйлерді белгілей алатын сарапшы | Үйренушінің күй үлестірімі бойынша кепілдіктері бар өкінусіз редукция |
| HG-DAgger (Келли және т.б., 2019) | Адам бақылаушы | Бақылаушының күйдің қауіпсіз еместігі туралы пікірі | Бақылап тұрған адам және басқаруды таза беру | Симуляциялық және нақты жүргізу тапсырмасында DAgger пен мінез-құлықты клондаудан асып түседі; сонымен қатар тәуекел шегін үйренеді |
| SafeDAgger (Чжан және Чо, 2016) | Робот | Эталоннан tau-дан жоғары L2 ауытқуы үшін бинарлық классификатор | Классификатор белгілері үшін сұрау салуға болатын эталондық саясат | Жарыс симуляторында аз эталондық сұраныс, жылдамырақ жинақталу (сан келтірілмеген) |
| EnsembleDAgger (Менда және т.б., 2019) | Робот | Ансамбль дисперсиясы мен сарапшы әрекетіне қашықтық, екеуі де шектен төмен | Желілер ансамблі және әрбір қадамдағы сарапшы әрекеті | Маятник пен HalfCheetah-та жақсарған қауіпсіздік пен оқыту |
| LazyDAgger (Хоке және т.б., 2021) | Робот, гистерезиспен | Кіру мен шығуға бөлек шектері бар SafeDAgger сигналы | SafeDAgger-ге қажеттінің бәрі, әрі баптауға арналған екінші шек | 3 тапсырмада ~60%-ға аз контекст ауысуы; YuMi матасында 60%-ға жоғары сәттілік |
| ThriftyDAgger (Хоке және т.б., 2021) | Робот, бюджет аясында | Жаңалық немесе тапсырманы орындамау тәуекелінің бағасы | Үйретілген тәуекел бағалаушысы және белгіленген араласу бюджеті | Орындау уақытында 100% сәттілік; пайдаланушы зерттеуі (N=10): келесі үздіктен 58% және 80% артық |
| EIL (Спенсер және т.б., 2020) | Адам — араласпау да есепке алынады | Араласу және оның болмауы құндылық функциясына шектеу ретінде | Құндылық шектеуі бойынша онлайн өкінусіз оқыту | Сарапшының шамамен бір минуттық басқаруынан соқтығысудан аулақ болуды үйрену |
Әрбір қақпа не береді және не тұрады
"Не қажет" бағанын оқып шықсаңыз, заңдылық көрінеді: онда келтірілген әрбір робот басқаратын сигнал жасанды түрде құрылуы керек прокси, әрі әрбір проксидің өз бағасы бар.
- Алшақтық сигналдарына (SafeDAgger, LazyDAgger, EnsembleDAgger ережесінің жартысы) эталондық саясат қажет. Не сізде скрипттелген сарапшы бар — бұл жағдайда қызықты мәселе бұрыннан шешілген, не адам фонда әрекеттер шығаруды жалғастырады, сол арқылы қашықтықты есептеуге болады.
- Күмән сигналдарына калибрленген эпистемиялық белгісіздік қажет. Кіші басқару желілерінің ансамблі оны жуықтайды; ал үш миллиард параметрлі көру-тіл-әрекет моделінің ансамблі бірінші кезекте жад пен кідіріс мәселесіне айналады.
- Жаңалық пен тәуекел сигналдарына жеткілікті сәтті және сәтсіз жүгірістерге баптанған, тапсырманың орындалуын бағалайтын үйретілген бағалаушы қажет. Сіз әлі жұмыс істетіп жатқан тапсырма үшін бұл дерек бірінші раундта жоқ.
- Адам қақпасына тек назар қажет, басқа ештеңе емес — бұл кез келген саясат архитектурасында, бірінші күннен-ақ, қосымша модель оқытпай-ақ қолжетімді жалғыз сигнал.
- Ешбір робот қақпасы адамды бөлмеден шығармайды. Олар адамның қаншалықты жиі әрекет етуі керектігін азайтады, бірақ оның қатысу қажеттілігін жоймайды.
Қақпа нені шығаратынында байқала бермейтін айырмашылық бар. Траектория ортасында іске қосылатын робот қақпасы адамға еркін позадағы қозғалып тұрған қолды тапсырады. Адам қақпасы операторға сәтті таңдауға мүмкіндік береді — созылудан кейін, ұстаудан бұрын, айналу жолының ортасында емес. Екеуінен алынған қалпына келтіру сегменттері бірдей таза емес, ал бұл сегменттер раундтың бүкіл өнімі.
Неге адам басқаратын нұсқа нақты жабдықта жеңеді
Бұл бенчмарк нәтижесі емес, инженерлік дәлел — біз тапқан ешбір мақала бес қақпаны да бір манипуляторда, бір саясат класымен тексермейді. Ол төрт нүктеге негізделеді.
Біріншіден, бақылаушы бәрібір сол жерде болады. Ешкім SO-100 қолын ол құлатып жіберуі мүмкін заттардың қасында қараусыз қалдырмайды. Біреу бақылап тұрған кезде оған басқаруды қолға алу түймесін берудің қосымша құны нөлге жақын; ал калибрленген тәуекел бағалаушысын құру — жеке жоба.
Екіншіден, заманауи саясатта нақты өлшей алатын белгісіздік жиі қате шама болып шығады. Диффузиялық немесе flow-matching басы іріктелген әрекет үзінділері бойынша дисперсия шығарады, ал бұл дисперсия бас білдіруге үйретілген мультимодальдықты көрсетеді, күй туралы эпистемиялық білместікті емес. EnsembleDAgger-дің күмән мүшесі дәл соңғысын ұстап алу үшін ансамбльді пайдаланады. Бұл екеуі бір сан сияқты көрінгенімен, олай емес; әрекетті бөлікке бөлу (action chunking) мен flow matching мақалалары бұл бастардың әрекеттерді қалай шығаратынын алдымен түсіндіреді.
Үшіншіден, манипуляцияда маңызды сәтсіздіктер жиі статистикалық тұрғыдан ерекше емес, семантикалық сипатта болады. Ұстағышты екі сантиметр ерте жабатын немесе екі бірдей текшенің қате біреуіне сеніммен созылатын саясат жоғары дисперсиялы күйде тұрған жоқ — ол сенімді әрі қате. Ешбір дисперсия шегі мұны ұстамайды; бақылап тұрған адам мұны бірден байқайды.
Төртіншіден, белгі сапасы — HG-DAgger-дің бастапқы тезисі, әрі ең жиі назардан тыс қалатыны. Адам үздіксіз басқаруда болған кезде жиналған белгілер қозғалып тұрған жүйе үстінен айтылған белгілерден жақсы. Егер мақсат — біріктіруге тұрарлық түзету деректері болса, дәлелдеу міндеті автоматтандырылған қақпаға жүктеледі.
Бір бақылаушы көптеген роботтарға жауап беретін болғанда сурет керісінше өзгереді — бұл ThriftyDAgger-дің пайдаланушы зерттеуі мен Fleet-DAgger-дің формализациясы нысанаға алатын режим. Флотта адам назары тапшы ресурс болғандықтан, кемел емес бөлу мүлдем болмағаннан жақсы. Бір үстелдегі бір қолмен сіз бұл режимде емессіз.
Адам басқаратын цикл, дайын күйде орнатылған
Жұмыс істеп тұрған инференс сеансы кезінде басқаруды қолға алу, түзетілген сегменттердегі кадр бойынша араласу белгілері, әрбір жұмысты түзету немесе бағалау санатына жіктеу, өзіңіз таңдаған дереккөздерден аралас деректер жиынын құрастыру және бар чекпоинттен оқытуды жалғастыру қолмен жазылған сценарий емес, кірістірілген мүмкіндіктер. Басқаруды қолға алу лидер қолымен, ал ол болмаса пернетақта мен слайдерлермен жұмыс істейді.
DAgger циклінің қалай жұмыс істейтінін көріңізҚақпа — әдістің жартысы; деректерді өңдеу — екінші жартысы
Қақпа қай кадрларды адам басқарғанын шешеді, оларды не істеу керектігін емес, ал раундтар көбіне дәл осы екінші шешімде далаға кетеді. Бірінші ереже — DAgger-дегі D әрпінің мағынасы: біріктір, алмастырма. чекпоинтті тек бірнеше жүз түзету кадрымен ғана дәл баптау сізге дерлік тек қалпына келтірулерді ғана көрген және қалыпты траекторияны ұмытып қалған модель береді.
Екінші ереже — араласу кадрлары қарапайым кадрлар емес екені. Мандлекар және т.б. операторларға саясаттарды бақылап, сәтсіздік кезінде басқаруды қолға алуға мүмкіндік беретін 6-DoF манипуляциясына арналған қашықтан телеоперация жүйесін құрып, содан кейін "саясатты араласулар арқылы тар жерлерден өтуді үйренуге ынталандыратын" алгоритммен итеративті түрде оқытты; осы деректермен оқытылған агенттер тең мөлшердегі қарапайым демонстрация үлгілерімен оқытылған агенттерден асып түсті. Sirius бұл идеяны өндіріске жеткізіп, "оқыту үлгілерін жуықталған адам сеніміне қарай қайта салмақтап, саясаттарды салмақталған мінез-құлықты клондаумен оңтайландырады". Екеуіне де адам басқарғанын көрсететін кадр бойынша белгі қажет, сондықтан intervention жалауы көрінгеннен гөрі маңыздырақ.
Үшінші ереже — автоматты араластыру тұзақ екені. Дереккөздерін санамалай алмайтын құрастырылған деректер жиыны келесі раунд нашарлаған кезде түзете алмайтын жиын болады. Осы платформада құрастыру қадамы дәл осы себепті анық көрсетілген — бастапқы деректер жиыны плюс түзетулер, дереккөз бойынша эпизод таңдау, ал нәтиже кез келген басқа сияқты синхрондалатын және оқытылатын қарапайым LeRobot деректер жиыны болып табылады; деректер жиыны құжаттамасы формат жағын қамтиды.
| Раундтағы қадам | Ол не шығарады | Ең жиі кездесетін қате |
|---|---|---|
| Жазуды қосып инференсті іске қосу | Саясаттың өз күй үлестірімі бойынша жұмыс | Қарапайым телеоперация ретінде жазылып, саясаттың басқарғаны жоғалады |
| Сәтсіздік кезінде басқаруды қолға алу | Кадр бойынша араласу белгісі бар түзету сегменттері | Қалпына келтірудің орнына косметикалық шайқалуды түзетіп, стильді үйрету |
| Әрбір эпизодты сұрыптау | Түзетулер, бағалау немесе алып тастау | Бәрін сақтап қалу; сәтсіз басқаруды қолға алу эпизодтың құнынан қымбатқа түседі |
| Түзетулерді синхрондау | Бастапқысының қасында нұсқасы бар деректер жиыны | Жергілікті машинадан ешқашан шықпайтын түзетулер |
| Аралас деректер жиынын құрастыру | Бастапқысы плюс түзетулер, анық таңдау | Үнсіз автоараластыру, сондықтан кейінгі регрессияны дереккөзге дейін бақылау мүмкін болмайды |
| Чекпоинттен жалғастыру | Алдыңғысынан инициализацияланған чекпоинт | Оптимизатордың жалғасуын күту; салмақтар модельді инициализациялайды, оптимизатор күйін қалпына келтірмейді |
Адам нақты ұстай алатын қақпаны орнату
"Адам шешеді" деген нақты спецификация емес. Әртүрлі шектері бар екі оператор салыстыруға келмейтін раундтар шығарады, ал ауытқитын шек оқи алмайтын үрдіс тудырады. Триггерлерді бірінші жұмыс алдында жазып алыңыз.
- Қақпаны ашатын жағдайларды атаңыз — белгіленген шектен көп ауытқыған жақындау, ұстағыштың бос жерде жабылуы, буынның шекке қарай ауытқуы, бір-екі секундтан ұзақ тоқтап қалу — және тізімді раунд бойы өзгеріссіз сақтаңыз.
- Оны ашпайтынды да атаңыз. Саясат өзі түзейтін артық жүрісі — оқыту сигналы; сол жерде басқаруды қолға алу оның бұрыннан білетін қалпына келтіруін жояды.
- Таза беру үшін жеткілікті ерте басқаруды қолға алыңыз, күй қалпына келтірілетін болысымен қайтарыңыз.
- Әрбір эпизод бойынша неге басқаруды қолға алғаныңызды жазып отырыңыз. Үш раундтан кейін бұл дәл сол сәтсіздіктің қайталанып-қайталанбағанының жалғыз жазбасы болады.
- Камераларды, тапсырма мәтінін және операторды раундтар бойы өзгеріссіз сақтаңыз. Біреуін өзгертсеңіз, сандар салыстыруға келмей қалады.
Механикалық тұрғыдан беру екі нұсқада жүзеге асады. Лидер қолымен жұмыс істегенде, айналдыру моменті берілместен бұрын лидер follower-дің ағымдағы позасына жетуі керек, әйтпесе қол секіріп кетеді; бұл туралау қимылы нақты жабдықта тізбектің ең аз тексерілген бөлігі болып табылады. Лидер қол болмағанда, басқаруды қолға алу бірінші перне басудан бастап толық қолмен жүзеге асады: follower ұсталып тұрады, ал оператор оны пернетақтадан буын-буынымен жылжытады немесе слайдерлерді сүйрейді, ал сервер жағындағы шектеулер әрбір енгізуді кішкентай ұстап тұрады — перне басуына бірнеше градус, слайдер жаңартуына бірнеше градус, себебі ұсталып тұрған позаға жасалған үлкен қадам сервоны зақымдап алудың тура жолы. Пернелер тіркесімі бар қадамдық нұсқаулық SO-100-дегі DAgger раундының нұсқаулығында бар; екі телеоперация режимі туралы негізгі ақпарат телеоперация құжаттамасында және лидер-follower мақаласында.

Қақпаның бірдеңе істегенін қалай білуге болады
Адам басқаратын раундтың метрикасы — араласу жиілігі: жұмыстың жалпы кадр санына бөлінген араласу кадрлары. Оның бір міндеті бар — егер ол раундтар бойы төмендемесе, раунд ешнәрсе бермеген, ал келесісінде деректер көлемінен басқа бірдеңе өзгертілуі керек.
Бұл біржақты метрика, және мұны білу керек. Ол саясаттың құзыреттілігі сияқты оператордың шегін де өлшейді, сондықтан триггер тізімі өзгеріссіз қалдырылады; сеанс барысында босаңсыған оператор артында ешнәрсе жоқ құлдырайтын қисық шығарады. Ол сонымен қатар ауырлықты елемейді — соқтығысуды тоқтатуға арналған он кадр мен ұстауды түзетуге арналған он кадр бірдей көрінеді. Оны ешқашан түзету деректері алынбаған тұрақты бағалау жиынымен қосыңыз. DAgger циклін өлшеу туралы мақала бағалау дизайнын, соның ішінде бағалау эпизодтарын оқыту қоспасынан сырт ұстау тәсілін толық қарастырады.
- Кез келген саясат архитектурасында, бірінші күннен-ақ, калибрлеуге қосымша модель қажет етпей жұмыс істейді
- Ешбір дисперсия шегі анықтамайтын сенімді әрі қате сәтсіздіктерді ұстайды
- Оператор толық бақылауда болған кезде, өзі таңдаған сәтте жазылған түзетулер шығарады
- IWR және Sirius сияқты араласуды салмақтайтын әдістер пайдаланатын кадр бойынша белгі береді
- Үздіксіз қадағалауды талап етеді; бір адам мен көп роботқа масштабталмайды
- Оператордың тұрақтылығына тәуелді — ауытқитын шек араласу жиілігін бұзады
- Өз бетінше ешбір тәуекел моделін бермейді; HG-DAgger-дің үйренген шегі мен ThriftyDAgger-дің бағалаушысы қосымша механизм
- Кадрларды санайды, салдарларды емес
- Ауыстырылған камера немесе қате белгіленген тапсырма жолы сияқты, сәтсіздігі басқарудан жоғары тұрған саясатты құтқара алмайды
Назарда ұстауға тұрарлық ашық сұрақтар
Бенчмарктер әлсіз. Спенсер және әріптестері имитациялық оқыту тәсілдерін тексеру үшін пайдаланылатындарды қарап шығып, оларды "іске асырылатын әрі қарапайым, сондықтан нақты дүниедегі шешім қабылдау мәселелерінде байқалатын қате жинақталуының қиынырақ режимдерін көрсетуге жеткіліксіз" деп тапты — әрі қоршаған әдебиетке қарама-қайшы, қарапайым мінез-құлықты клондау оларда жақсы нәтиже көрсеткенін анықтады. Бұл жоғарыдағы кестедегі кейбір сандарды қоса, осы тапсырмаларға негізделген DAgger нұсқаларының кез келген рейтингіне күмәнмен қарауға негіз береді.
Ірі саясаттардағы робот қақпалары да толық шешілген жоқ. AIM жұмысы белгісіздікті адамның араласу ережесін еліктейтін прокси Q-функциясымен алмастырады және ThriftyDAgger-мен салыстырғанда басқаруды қолға алу құны мен оқыту тиімділігінде 40%-ға жақсарғанын хабарлайды — бірақ бұл үздіксіз және дискретті басқаруда, манипуляторды басқаратын көру-тіл-әрекет моделінде емес. Осы қақпалардың қайсысы дәл баптанған VLA-ға ауысатыны ашық сұрақ. Шолу мақала байланысты бір мәселені атап көрсетеді: саланың терминологиясы мен құрылымы әдебиет бойынша біріктірілмеген, бұл әдістерді салыстыруды қиындатады. Өз қолыңызда сіздің логтарыңыз — қолыңыздағы жалғыз дәлел.
Адам тек араласу кезінде ғана белгі қойса, HG-DAgger шынымен де DAgger бола ма?▾
Ол маңызды бөлікті сақтайды — үйренуші тудыратын күй үлестірімі бойынша жиналған, бұрынғымен біріктірілген деректерді — және жабдықпен тигенде аман қалмайтын бөлікті алып тастайды. Келли және т.б. оны нұсқа ретінде ұсынады; 2011 жылғы өкінусіздік кепілдігі өзгеріссіз көшпейді.
SO-100-де дәл баптанған VLA саясатында робот қақпасын пайдалана аламын ба?▾
Тікелей жоқ. SafeDAgger-дің классификаторына сізде жоқ, сұрау салуға болатын эталондық саясат қажет. EnsembleDAgger-ге ансамбль қажет, ал бұл көп миллиард параметрлі модель үшін жадта бірнеше көшірме әрі олардың инференс құнын білдіреді. ThriftyDAgger-ге бірінші раундтарыңызға дейін жоқ сәттіліктер мен сәтсіздіктерге баптанған тәуекел бағалаушысы қажет.
Бір рет басқаруды қолға алу қанша уақытқа созылуы керек?▾
Саясат жалғастыра алатын күйге жету үшін жеткілікті, одан артық емес: ұзартылған басқаруды қолға алулар жұмысты демонстрация сеансына айналдырып, түзету жиынын қалыпты мінез-құлықпен толтырады. LazyDAgger-дің қорытындысы кері бағытта да жұмыс істейді — өте қысқа ауысулардың көптігі де өз бағасын алады.
Тек түзетілген сегменттерде ғана оқыту керек пе?▾
Жоқ — бұл раундты далаға кетірудің ең жиі кездесетін тәсілі. Тек қалпына келтірулерде ғана дәл баптанған модель дерлік тек қалпына келтірулерді ғана көреді. Түзетулерді анық таңдалған дереккөздермен бастапқы деректер жиынына араластырыңыз; одан әрі жету үшін адам басқарған кадрларды бөлектеудің орнына оларға көбірек салмақ беретін IWR немесе Sirius сияқты араласуды салмақтайтын тәсілдерге қараңыз.
Раундтан кейін араласу жиілігі төмендемесе не істеу керек?▾
Мұны сол күйінде қабылдаңыз: раунд көмектеспеді. Түзетулер қосудан бұрын арзанырақ түсініктемелерді тексеріңіз — оператордың шегі ауытқыды ма, түзетулер косметикалық болды ма, құрастырылған деректер жиынында олар нақты бар ма, оқыту көзделген чекпоинттен инициализацияланды ма. Үнсіз базалық модельден басталған раунд оқи алмаған раундпен дәл бірдей көрінеді.
Араласпау ақпарат бере ме?▾
Expert Intervention Learning бойынша иә: бақылаушы қарап тұрып ешнәрсе жасамаған кезеңдер күй мен әрекеттің қолайлы болғанының әлсіз дәлелі ретінде оқылады, бұл құндылық функциясына қойылатын шектеу ретінде формализацияланады. Осыны қоса алғанда, көпшілік практикалық конвейерлер тек адам басқарғанды ғана белгілейді.
Үстелдегі бір қол үшін таңдау жасалған: қақпаны өзіңіз ұстаңыз, оны нені ашатынын жазып алыңыз және күш-жігеріңізді ауыстырғышты автоматтандырудың орнына оның артындағы деректерді өңдеуге жұмсаңыз. Платформа жағы DAgger циклі бетінде сипатталған, ал саясат отбасы бойынша оқыту опциялары оқыту және бағалар бөлімінде берілген. Негіз үшін имитациялық оқытудан және SO-100-дегі имитациялық оқытудан бастаңыз; алғашқы жұмыс үшін алғашқы саясатыңызды іске қосыңыз қысқарақ жол болып табылады.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started