
Behavior cloning саясатты сарапшының күй-таралымына бейімдейді, ал кейін ол өз бетінше іске қосылады. Осы екі таралымның арасындағы алшақтық — валидацияда мінсіз көрінетін саясаттың 300-ші қадамда үстелден құлап түсуінің себебі. Бұл — DAgger сериямыздың теориялық тарауы: квадраттық қате мүшесі қайдан шығады, dataset aggregation нені өзгертеді, no-regret дәлелі нені болжайды және есептің қай бөлігін адам-сарапшы бәрібір өз мойнына алуға тиіс.
Манипуляция саясатын оқытатын әркім ерте ме, кеш пе кездесетін нақты бір ақаулық бар. Саясат текшеге қол созады, одан екі сантиметр қалғанда кібіртіктеп, бүйірге қарай ауытқып, содан кейін тапсырмаға қатысы жоқ нәрсе жасайды. Валидация қатесі жақсы болды. Бөлек қалдырылған эпизодтарға қарсы ашық циклді қайта ойнату да жақсы болды. Дегенмен қол оқыту деректерінде мүлдем кездеспейтін позада аяқталады, және сол жерден бастап оның айтары ештеңе қалмайды.
Бұл ақаулықтың атауы бар және оның артында қалыптасқан теория тұр. Бұл — DAgger туралы төрт мақаланың біріншісі, ол дәлелдің өзін қамтиды: демонстратордың өз траекторияларына саясатты бейімдеу неге эпизод ұзындығының квадратына пропорционал өсе алатын қате тудыратыны, dataset aggregation нені өзгертетіні және no-regret дәлелі нені уәде етпейтіні. Нақты құрылғыдағы циклді SO-100-де DAgger циклін жүргізу мақаласы қамтиды, адам басқаратын нұсқасын HG-DAgger және адам басқаратын араласулар мақаласынан, ал өлшеу мәселесін DAgger циклін өлшеу мақаласынан таба аласыз.
Қысқаша нұсқасы
- •Behavior cloning сарапшының күй-таралымында оқытылады, ал бағалау саясаттың өз таралымында жүргізіледі. Бұл сәйкессіздік эпизод бойы жинақтала береді.
- •Росс пен Багнелл қосымша шығынның қадам сайынғы қатенің T квадратына көбейтіндісіндей өсуі мүмкін екенін көрсетті; DAgger мақаласы осы шектеуді қайта тұжырымдап, оның дәл (tight) екенін атап өтеді.
- •DAgger саясаттың өзі баратын күйлерге белгі қояды және тек соңғы деректерге ғана емес, осы кезге дейін жиналған барлық деректер жиынтығына қайта оқытады.
- •Кепілдік no-regret онлайн оқытуға дейін редукциялануымен беріледі: жинақтап қайта оқыту дегеніміз — Follow-The-Leader.
- •Ол нөлге қатысты емес, саясат класында қол жеткізуге болатын ең жақсы шығынға қатысты орындалады — әрі сарапшы өзі ешқашан тудырмайтын күйлерге бәрібір белгі қоюға тиіс.
Behavior cloning үнсіз қабылдайтын болжам
Демонстрация деректер жиынтығы — бақылау-әрекет жұптарының үйіндісі. Behavior cloning осы үйіндіге әдеттегі бақыланатын оқыту арқылы функция бейімдеп, сонымен тоқтайды. Бұл — саладағы ең көне идея. Помероның 1988 жылғы ALVINN жүйесі камера мен лазерлік қашықтық өлшегіштен алынған суреттерді қабылдап, көліктің жүруі керек бағытын шығаратын үш қабатты кері таралу желісі болды; ол симуляцияланған жол суреттерінде оқытылып, кейбір далалық жағдайларда нақты жолдармен жүре алды. Рецепт онша өзгерген жоқ; өзгергені — желілер.
Өткізіп жіберілетіні — сол жұптардың қайдан шыққанын тексеру. Олардың әрқайсысы демонстратор жасаған траекторияда жатыр. Ал сіз іске қосатын саясат өз траекториясын өзі тудырады. Ол ауытқыған сәтте оқыту таралымында болмаған күйлер туралы сұралады, және оның жауабы оны одан әрі алшақтатады. Росс, Гордон және Багнелл DAgger мақаласын дәл осыдан бастайды: тізбектелген болжам статистикалық оқытудың негізіндегі i.i.d. болжамын бұзады, өйткені оқытушының өз болжамдары келесі көретін кірістерін анықтайды.
Сол мақаладағы ең түсінікті мысал робот емес. Super Mario Bros. үшін жасалған оптималдыға жақын жоспарлаушыны клондау кедергіден секіріп өтудің орнына оған қайта-қайта тіреліп қалатын саясат тудырды. Себебі бір сөйлемге сыятын бүкіл дәлел: сарапшы әрдайым қолайлы қашықтықтан секірген, сондықтан деректер жиынтығында Марионың кедергіге тірелген күйі мүлдем болмаған, демек, ол тірелгеннен кейін не істеу керегі туралы белгі де болмаған.
Марионы SO-100 қолымен ауыстырыңыз — құрылым дәл сондай. Сіздің демонстрацияларыңыз таза жақындауды және таза ұстауды көрсетеді, ал грипердің екі сантиметр жетпей жабылуын емес — сондықтан саясат бұдан кейін не істеу керегін білмейді, әрі оның кез келген болжамы оны одан сайын алшақтатады. Ковариаттық ығысу — деректер жинау процедурасының қасиеті, желі архитектурасының емес.
Квадраттық мүше қайдан шығады
Росс пен Багнеллдің 2010 жылғы AISTATS мақаласы — Efficient Reductions for Imitation Learning — жинақталуды дәл тұжырымдайды. T тапсырма горизонты болсын, тапсырма шығыны бірлік аралықпен шектелген болсын, ал эпсилон сарапшының күй-таралымы бойынша өлшенген сурогат шығын болсын — бұл валидация жиынтығыңыз хабарлайтын сан. Онда сол саясатты T қадам жүргізудің сарапшыға қатысты қосымша шығыны T квадратының эпсилонға көбейтіндісімен шектеледі. Росс, Гордон және Багнелл мұны DAgger мақаласында 2.1-теорема ретінде қайта тұжырымдап, маңызды сөйлемді қосады: шектеу дәл (tight). Сарапшы таралымында эпсилон шығыны бар саясаттың қосымша шығыны T бойынша шынымен квадраттық өсетін есептер бар.
Дәл (tight) болу — типтік болу дегенді білдірмейді. Квадраттық мүше — есептер класы бойынша ең нашар жағдай, сіздің pick-and-place тапсырмаңыз туралы болжам емес. Бұл нәтиже көрсететіні: сарапшы демонстрациясын көбейту мәселені жоя алмайды — ол тек саясат сыналмайтын таралымдағы эпсилон бағасын дәлірек етеді.
Шығар жол сол мақаланың өзінде, 2.2-теорема ретінде қайта тұжырымдалған. Егер саясат өзінің күй-таралымында эпсилон шығынына қол жеткізсе, әрі бір қате әрекет сарапшы бойынша cost-to-go шамасында ең көбі u тұратын болса, қосымша шығын u мен T мен эпсилонның көбейтіндісімен шектеледі — горизонт бойынша сызықтық. Қызықты шама — u тұрақтысы: сарапшымен 0-1 келіспеушілік үшін ол ең көбі 1, ал сарапшы бірнеше қадамда қалпына келе алатын кез келген жағдайда O(1). Ең нашар жағдайда ол O(T), және сол кезде сызықтық шектеу квадраттыдан жақсы бола алмайды.
| Жағдай | Сарапшыға қатысты қосымша шығын шегі | Немен негізделеді |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, Ross т.б. 2011-де 2.1-теорема ретінде қайта тұжырымдалған) | T квадрат көбейту эпсилон | эпсилон сарапшының күй-таралымында өлшенген; шығын [0,1] аралығында; шектеу дәл (tight) |
| Өз таралымында эпсилон шығыны бар кез келген саясат (2.2-теорема) | u көбейту T көбейту эпсилон | u бір қате әрекеттің cost-to-go айыппұлын шектейді; 0-1 шығын үшін ең көбі 1, ең нашар жағдайда O(T) |
| Forward training (Ross & Bagnell 2010) | u көбейту T көбейту эпсилон | әр уақыт қадамына бір саясат; T саясат және белгілі, ақырлы T қажет |
| SMILe (Ross & Bagnell 2010) | кейбір есеп кластарында T мен эпсилон бойынша сызықтыққа жақын | альфа O(1/T квадрат) ішінде, N O(T квадрат log T) ішінде; стохастикалық қоспа береді |
| DAgger (3.2-теорема, Ross т.б. 2011) | u көбейту T көбейту эпсилон_N, қосу O(1) | N шамасы uT ретті; қатаң дөңес шектелген шығын; no-regret оқытушы; эпсилон_N — кейін қарағанда ең жақсы шығын |

DAgger-ге дейінгі екі әрекет
Forward training — адал, бірақ практикалық емес жауап. Әр уақыт қадамы үшін ретімен бөлек саясат оқытылады, әрқайсысы алдыңғы қадамдар үшін бекітілген саясаттар тудыратын күй-таралымында, сөйтіп әр саясат кездесетін таралымды дәл көреді. Мәселе сипаттаманың өзінде: T саясат, ретімен оқытылады, ерте тоқтату жоқ. Секундына 30 кадрлық манипуляция эпизодында T жүздеген шамасында болады.
Сол мақаладағы SMILe, және Дауме, Лэнгфорд пен Мардудың құрылымдық болжам бойынша жұмысындағы SEARN басқа жолды таңдайды: бір стационар, бірақ стохастикалық саясат. Әр итерация бір компонент оқытып, оны қоспаға қосады, ықтималдық массасын сарапшыдан алшақтатады. Нәтиже — кейбір компоненттері басқаларынан нашар қоспа: физикалық қолда бұл қозғалыс ортасында нашар компонентті таңдап алуы мүмкін контроллер дегенді білдіреді. Дәл осы стационар детерминистік саясатты қалау себебі ретінде айтылған.
DAgger: бір идея, бір қорап
Dataset Aggregation детерминистік саясатты сақтап, шешімді деректер жинауға көшіреді. Әр раунд: ағымдағы саясатты жүргізу, ол баратын күйлерді жазып алу, әр күйде дұрыс әрекет не болатыны туралы сарапшыдан сұрау, сол жұптарды бар деректер жиынтығына қосу, біріктірілген жиынтықта қайта оқыту. Атауының өзі алгоритм — сіз жинақтайсыз, ешқашан тастамайсыз.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setҮш деталь көрінгеннен гөрі маңыздырақ. Белгілер аралас саясат баратын күйлер үшін қойылады, ал әрекеттер сарапшыдан келеді — саясат сұрақтар қояды, сарапшы жауап береді. Қайта оқыту толық жиынтықта жүргізіледі, бұл әр раундты Follow-The-Leader қадамына айналдырады: n раундында сіз осы кезге дейінгі барлық траектория бойынша кейін қарағанда ең жақсы саясатты таңдайсыз. Дәлел дәл осы тұжырымдамаға сүйенеді. Ал алгоритм валидация жиынтығында таңдалған тізбектегі ең жақсы саясатты қайтарумен аяқталады, өйткені теоремалар тізбектегі белгілі бір саясаттың жақсы болатынына кепілдік береді, соңғысының жақсы болатынына емес.
Бета-кесте және оның неге баптау тұтқасы емес екені
Аралас саясат — бета_i көбейту сарапшы, қосу бір минус бета_i көбейту оқытушы. Мұның мәні практикалық: алғашқы бірнеше оқытылған саясат өте аз деректерде оқытылады, көп қате жасайды, әйтпесе саясат жақсарған соң маңызын жоятын күйлерде уақыт өткізер еді.
Теория тек бір ғана шарт қояды: бета мәндерінің жүгіру орташасы нөлге ұмтылуы керек. Талдау бета_i мәні (1 - альфа) дәрежесі i-1 арқылы шектелген жағдайда жұмыс істейді, мұндағы альфа — T-ге тәуелсіз тұрақты.
| Кесте | Не істейді | Мақала не хабарлайды |
|---|---|---|
| beta_1 = 1 | Бірінші раунд — таза сарапшы демонстрациясы; бастапқы саясат қажет емес | Әр нұсқада ұсынылатын бастапқы нүкте |
| beta_i = 1, егер i = 1 болса, әйтпесе 0 | Сарапшы тек бірінші раундта; еркін параметр жоқ | Мақаланың параметрсіз нұсқасы, ол көбіне практикада ең жақсы нәтиже беретіні айтылады; Super Mario Bros.-та 20 итерациядан кейін 2980 ұпай |
| beta_i = p^(i-1), p = 0.5 болғанда | Сарапшы ықтималдығы геометриялық түрде кемиді | Сол эталонда 3030, параметрсіз нұсқадан сәл алда |
| beta_i = p^(i-1), p = 0.9 болғанда | Сарапшы циклде әлдеқайда ұзақ қалады | Айтарлықтай баяу жинақталу; 20 итерация аяқталғанда әлі де жақсарып жатты |
Шкаласы шамамен 4300-ге дейін жететін жүйеде 2980 бен 3030 арасындағы алшақтық шағын, бірақ мақаланың оған берген түсіндірмесі осы бөлімдегі ең пайдалы практикалық ескерту. Параметрсіз кестеде Марио ерте кезден бір жерде тұрып қалды және сол бір орыннан дерлік қайталанатын деректердің үлкен массасын тудырды; сарапшыға уақыттың бір бөлігінде басқаруға мүмкіндік беру оны бұғаттан босатып қана қоймай, күй әртүрлілігін де кеңейтті. Кесте қоспа қатынасына қарағанда деректер жинауыңыз жаңа күйлер тудырып жатыр ма, әлде сол бір ақаулықты қайталап жатыр ма дегенге көбірек байланысты.
Әр уақыт қадамындағы стохастикалық қоспа басқару өкілеттігін басқару жиілігімен, әдепкі SO-100 құрылымында секундына 30 рет ауыстыруды білдіреді. Ешбір телеоперация интерфейсі мұны қауіпсіз немесе мағыналы ете алмайды. Нақты құрылғыда бета-кесте орнын адамның қашан басқаруды қолға алу керегі туралы шешіміне береді: басқа талдауы бар басқа алгоритм.
Кепілдік: no-regret онлайн оқытуға редукция
Мақаланы мақала ететін қадам — осы. Әр DAgger раундын онлайн оқыту есебіндегі бір мысал ретінде қарастырыңыз, мұндағы i раундындағы шығын — i раундында қолданылған саясаттың күй-таралымы бойынша сурогат шығын. Оқытушы сол шығынды көрмей тұрып саясатты бекітеді, ал тізбек стационар емес, өйткені ол осы кезге дейін шығарылған саясаттарға тәуелді.
Алгоритм no-regret болады, егер оның N раунд бойынша орташа шығыны кейін қарағанда ең жақсы жалғыз саясаттың шығынына жақындаса. Қатаң дөңес шығындардағы Follow-The-Leader дәл осындай алгоритм, орташа өкініші 1/N ретімен кемиді — ал толық жиынтықта қайта оқыту дәл Follow-The-Leader болып табылады. Кез келген басқа no-regret оқытушы да сол дәрежеде жарайды: талдау — редукция, бір оптимизатордың қасиеті емес.
Бір лемма деректерді жинаған аралас саясат пен іске қосылатын оқытылған саясат арасындағы алшақтықты жалғайды: 4.1-лемма олардың күй-таралымдары арасындағы L1 қашықтығын 2 T бета_i арқылы шектейді. Дәл осы себепті бета мәндері кему керек — сарапшы әлі айтарлықтай басқару өкілеттігін ұстап тұрған кезде, сіз жинайтын күйлер саясатыңыз тудыратын күйлер емес. Лемманы өкініш шегімен біріктірсеңіз, негізгі нәтиже шығады: шамамен T итерациядан кейін тізбектегі белгілі бір саясаттың өз таралымы бойынша сурогат шығыны эпсилон_N-нен O(1/T) шамасында ғана асады. Мұны сызықтық шектеуге қойсаңыз, 3.2-теоремаға келесіз.
Эмпирикалық жағы қазіргі стандарттар бойынша қарапайым. Super Tux Kart ойынында деректер көбейген сайын бақыланатын базалық үлгінің айналымға шаққандағы орташа құлау саны жақсармады, DAgger он бес итерациядан кейін трассадан ешқашан шықпайтын саясатқа жетті, ал SMILe жиырма итерациядан кейін де айналымға шамамен екі рет құлап жатты. Қолжазба эталонында таңба дәлдігі құрылымсыз 82 пайыз, бақыланатын түрде 83,6 пайыз, DAgger-мен 85,5 пайыз болды. Бұлардың ешқайсысы манипуляция нәтижесі емес.
Дәлел нені уәде етпейді
Теорема тұжырымдары шартты, әрі шарттар маңызды жүк көтереді.
- Айтылған болжамдар бойынша T-ге қатысты квадраттық емес, сызықтық шектеу.
- Стохастикалық қоспа емес, стационар детерминистік саясат.
- Нағыз редукция: кез келген no-regret онлайн оқытушы сай келеді.
- Нақты итерация саны — өкініш мүшесі маңызын жоймас бұрын шамамен T раунд.
- Тізбектегі кемінде бір саясатқа кепілдік, сондықтан соңында валидация өткізіледі.
- Ол нөлге емес, кейін қарағанда класстағы ең жақсы шығын — эпсилон_N-ге қатысты. Егер класыңыз сарапшыны бейнелей алмаса, бұл кепілдік іс жүзінде бос.
- Оған no-regret әдісі немесе қатаң дөңес сурогат шығын қажет — авторлар атап өткендей, бұл негізделген классификация редукцияларынан қатаңырақ талап.
- u тұрақтысы ең нашар жағдайда O(T) болуы мүмкін, сол кезде сызықтық шектеу қайтадан квадраттыққа айналады.
- Ол итерацияларды шектейді, сарапшы белгілерін емес. Роботта белгілер — бюджет.
- Ол сарапшыдан барылған әр күйде сұрауға болады және ол сол жерде дұрыс жауап береді деп болжайды. Осы болжамның өзі — бүкіл шығын.
Тағы бір нәтиже жиі теріске шығару ретінде келтіріледі, бірақ ол олай емес. Раджараман, Ян, Цзяо және Рамачандран ақырлы S күй кеңістігі мен H горизонты бар эпизодтық MDP-терде имитациялық оқытудың минимакс шектерін зерттеп, оқытушы барылған күйлерде сарапшыдан белсенді сұрай алатын жағдайда да орындалатын, |S| H квадратын N-ге бөлу ретті субоптималдылықтың төменгі шегін дәлелдейді. Бұл — тұрақты эпизод бюджетіндегі MDP класы бойынша ең нашар жағдай жылдамдығы, ал ол жоққа шығаратыны — интерактивтіліктің минимакс жылдамдығын жақсартады деген идея; DAgger теоремасы басқа тұжырым, ол іске қосылған саясатты оның өз саясат класы қол жеткізе алатынға қатысты шектейді.
Свами, Чоудхури, Багнелл және Ву кейінірек бұл алгоритмдерді сарапшы мінез-құлқының қай сәттерін сәйкестендіретініне қарай жіктеп, әр отбасының жинақталған қатені қаншалықты жеңілдететінін көрсететін moment recoverability ұғымын енгізді. Оса мен Селеминнің шолулары алгоритмдік ландшафт пен адам кері байланысы интерфейстерін қамтиды.
Есеп-шот: сарапшы ешқашан тудырмаған күйлерге белгі қою
Жоғарыдағының бәрі кез келген жерден сұрауға болатын сарапшыны болжайды. Іс жүзінде тегінге жақын жоспарлаушысы бар симуляцияда — Марио эксперименттерінде ойын күйіне толық қолжетімділігі бар оптималдыға жақын жоспарлаушы қолданылды. Роботтағы адаммен бұл басым шығын, әрі ерекше: адам өз құзыреттілігі ешқашан тудырмайтын конфигурацияда дұрыс әрекет жасауға тиіс.
Келли, Сидрейн, Дриггс-Кэмпбелл және Коченлерфер HG-DAgger мақаласында қарсылықты тікелей айтады. Кәдімгі DAgger сарапшыдан жүйені толық бақыламай тұрып әрекет белгілерін беруді талап етеді. Бұл қауіпсіздікті төмендетеді, ал адам сарапшылармен жиналған белгілердің сапасын нашарлатуы мүмкін, мұны олар сезілетін актуатор кешігуіне жатқызады. Сіз алатын белгі алгоритм болжаған белгі емес.
Ласки мен әріптестері мәселеге DART арқылы басқа жақтан шабуыл жасайды, олардың тұжырымдамасы қатаң: on-policy әдістері адам-бақылаушылар үшін жалықтырады, есептеу жүктемесін арттырады және оқыту барысында қауіпті күйлерге баруы мүмкін. Олардың балама шешімі бақылаушының өз демонстрацияларына калибрленген шу қосады, сөйтіп робот сенімсіз саясатты бір рет те жүргізбей қалпына келтіру демонстрацияланады. MuJoCo Humanoid-те олар DART оқыту кезінде бақылаушының жинақталған сыйақысын 5 пайызға азайтатынын хабарлайды, ал DAgger бақылаушыдан 80 пайызға аз жинақталған сыйақымен саясаттар орындайды; Toyota HSR-мен тығыз ортадан ұстауда behavior cloning-пен салыстырғанда орташа 62 пайыз артық нәтиже.
Чжан мен Чоның SafeDAgger жүйесі анықтамалық саясатқа сұрауларды тапшы ресурс ретінде қарастырады: бөлек қауіпсіздік саясаты сұрамай-ақ негізгі саясаттың анықтамалықтан шектен тыс ауытқитынын болжайды, әрі тек сол күйлер ғана беріледі. Үшеуі де бір фактіге жауап береді — DAgger талдауы сарапшы белгілері үшін ешнәрсе алмайды, ал шындық көп нәрсе алады.
Таралымнан тыс күйлерге белгі қою тапсырманы демонстрациялаудан психологиялық тұрғыда қиынырақ. Қалыпты демонстрация — сізде бұрыннан бар моторлық жоспарды орындау дегенді білдіреді. Грипперді сіз ешқашан қоймайтын жерге қойған саясатты түзету — уақыт қысымында, робот әлі қозғалып тұрған кезде дереу қалпына келтіруді құрастыруды білдіреді. Әдеттегі жазу сеансымен салыстырғанда сеанс сайын пайдалы минуттардың азырақ болуын күтіңіз, әрі бір сеанс ішінде өз түзету сапаңыздың төмендеуін бақылаңыз.

Бұл сіздің үстеліңіздегі SO-100 үшін нені білдіреді
Горизонтты өз бірліктеріңізге аударыңыз. Секундына 30 кадрлық жиырма секундтық эпизод — 600 шешім қадамы, әрі жоғарыдағы әр шектеудегі T дәл осы сан. T = 600 болғанда, T бойынша масштабталатын мүше мен T квадраты бойынша масштабталатын мүше арасындағы айырмашылық — нашар жақындаудан қалпына келе алатын саясат пен келе алмайтын саясат арасындағы айырмашылық.
Бұл action chunking-тің неге пайдалы екенінің бір бөлігі: саясат әр инференс қадамында әрекеттердің қысқа тізбегін шығарғанда, шешім нүктелерінің саны азаяды, демек, жинақталу мүмкіндіктерінің саны да азаяды. Чжао, Кумар, Левин және Финн жинақталған қатені Action Chunking with Transformers-тің негіздемесі ретінде атайды, әрі он минуттық демонстрациядан арзан қолды екі қолды құрылғыда алты қиын нақты әлем тапсырмасында 80-90 пайыз табысқа жеткенін хабарлайды. Chunking ковариаттық ығысуды жоймайды — күйлер бәрібір саясаттың өзінікі — бірақ ол тиімді горизонтты қысқартады. Қараңыз: action chunking және SO-100 имитациялық оқыту нұсқаулығы.
Екінші аударма — прогресс метрикасы. Саясаттың өз таралымы бойынша эпсилонды тікелей өлшей алмайсыз — бұл барылған әр күй үшін нақты сарапшы әрекетін талап етеді, дәл сол нәрсені сіз тудырмауға тырысасыз. Адам басқаратын цикл орнына сізге беретіні — араласу жиілігі: жүгіру кезінде адам басқаруды қолға алған кадрлар үлесі. Бұл — жанама көрсеткіш, ол саясатқа қатысы жоқ себептермен өзгереді — шыдамды оператор азырақ араласады. Тұрақты қолданылса, бұл раунд түскі уақытты жұмсауға тұрарлық болғанын айтатын жалғыз сан.
Үшінші аударма — талдау қамтымайтын деректер сапасы туралы ескерту. Мандлекар мен әріптестері бес симуляцияланған және үш нақты әлемдегі көп сатылы манипуляция тапсырмасында алты офлайн оқыту алгоритмін зерттеп, алгоритмдік жобалау таңдауларына сезімталдықты, демонстрация сапасына тәуелділікті және тоқтату критерийінен туындайтын өзгермелілікті хабарлайды. Белхале, Цуй және Садиг деректер жиынтығының сапасы әрекет ауытқуы мен өтпелі әртүрлілік арқылы формализациялануы керек деп дәлелдейді және күй әртүрлілігі әрдайым пайдалы бола бермейтінін атап өтеді. DAgger раунды ешкім әдейі таңдамаған күйлерді қосады: кейбірі сізге қажет қалпына келтіру деректері, кейбірі — сіз басқаруды қолға алу тетігін іздеп жатқанда роботтың дал-дұлы.
Механикалық тұрғыда раунд алты қадамнан тұрады: жазуды қосып инференсті жүргізу, саясат дұрыс әрекет етпегенде басқаруды қолға алу, жүгірісті қарап шығып әр эпизодты тіркеу, түзетулерді синхрондау, түпнұсқалар мен түзетулерден әр қайнар көз бойынша эпизод таңдауы анық жасалған аралас деректер жиынтығын құрастыру, әрі базалық үлгіден емес, алдыңғы чекпоинттен бастап оқытуды жалғастыру. ay-robots-та бұл қадамдар түймелер түрінде бар, бұл құбыр жүйесін алып тастайды, бірақ пайымдауды алып тастамайды. Екі ескерту бар: чекпоинттен жалғастыру салмақтарды инициализациялайды, оптимизатордың қайта жалғасуы емес, әрі leader-қол туралайтын әрекет құрылғыда әлі жеңіл тексерілген. Қараңыз: оқыту және деректер жиынтықтары.
DAgger циклі, дайын қосылған
Тірі инференс жүгірісі кезінде басқаруды қолға алу, кадр бойынша араласуды белгілеу, эпизодтарды түзету немесе бағалау ретінде тіркеу, әр қайнар көз бойынша эпизод таңдауы анық жасалған аралас деректер жиынтығын құрастыру және бар чекпоинттен оқытуды жалғастыру — бәрі кірістірілген. Қашан басқаруды қолға алу керегін және нені сақтау керегін бәрібір сіз шешесіз — бұл бөлігі автоматтандырылмайды.
DAgger циклі қалай жұмыс істейтінін қараңызОтбасы ағашы, бір кестеде
| Әдіс | Күйлерді кім таңдайды | Сарапшы нені береді | Негізгі шығын |
|---|---|---|---|
| Behavior cloning | Сарапшы | Таза демонстрациялар | Қалпына келтіру деректері жоқ; қате T бойынша квадраттық жинақталуы мүмкін |
| Forward training | Оқытушы, әр уақыт қадамы бойынша | Тудырылған таралым бойынша белгілер | T бөлек саясат; ұзақ горизонттар үшін жарамсыз |
| SMILe / SEARN | Сарапшы мен оқытушының стохастикалық қоспасы | Қоспаның таралымы бойынша белгілер | Қоспа компоненттерінің сапасы әртүрлі |
| DAgger | Аралас саясат, бета нөлге кемиді | Барылған әр күй үшін дұрыс әрекет | Басқармай тұрып, сарапшы ешқашан тудырмайтын күйлерге белгі қою |
| DART | Енгізілген шумен бұзылған сарапшы | Калибрленген шу астындағы демонстрациялар | Шу оқытушының қатесіне сай калибрленуі керек |
| HG-DAgger | Адам басқаруды қолға алғанша дейін оқытушы | Тек адам басқаратын сегменттердегі түзетулер | Адамның қашан араласу керегі туралы пайымдауына тәуелді |
| SafeDAgger | Қауіпсіздік қақпасымен сүзілген оқытушы | Тек қақпа сұрағанда ғана белгілер | Қақпаның өзі оқытылып, сенімді болуы керек |
Жиі қойылатын сұрақтар
Өз роботымда квадраттық қате өсуін шынымен байқай аламын ба?▾
Таза қисық түрінде емес. Шектеу — ең нашар жағдай: ол дәл (tight), өйткені кейбір есеп оған жетеді, сіздікінің де жететініне кепілдік емес. Сіз көретін нәрсе — салдары: бөлек қалдырылған кадрларда жақсы ұпай алатын, бірақ нақты тапсырмада сәтсіздікке ұшырайтын және сол типтес деректерді көбірек жазғанда жақсармайтын саясат. Егер қосымша таза деректер көмектеспей қалса, бұл — деректер көлемінің мәселесі емес, ковариаттық ығысу.
DAgger деп атау үшін бета-қоспаны іске асыруым керек пе?▾
Параметрсіз нұсқа — бірінші раундта сарапшы, кейін таза оқытушы — заңды жеке жағдай, әрі бастапқы эксперименттерде көбіне ең жақсы нәтиже берген. Тастауға болмайтыны — жинақтау: тек ең соңғы түзетулерде қайта оқыту Follow-The-Leader түсіндірмесін бұзады, ал no-regret дәлелі дәл содан шығады. Тек түзетулерде ғана оқыту әлдеқайда әлсіз процедура.
Неге соңғы саясаттың орнына валидация жиынтығындағы ең жақсысын қайтару керек?▾
Өйткені теоремалар жақсы саясаттың тізбектің қандай да бір жерінде бар екеніне кепілдік береді, ол соңғы итерация болатынына емес — шектеу тізбек бойынша минимумға қойылған. Соңғы раундтан не шықса, соны жіберу нәтиженің айтылған шартын елемеу болып табылады, әрі соңғы раунд әрдайым ең жақсысы бола бермейді.
Қанша раундқа жоспарлауым керек?▾
Теория T ретті итерацияларды қалайды, ал 600 қадамдық эпизод үшін бұл ешкім құрылғыда жүргізбейтін сан. Бастапқы эксперименттер әр эталонда жиырма итерация жүргізді. Іс жүзінде сіз араласу жиілігі кему тоқтағанша раунд жүргізесіз, бұл талдау болжайтын саннан әлдеқайда төмен — теория мен практика арасындағы нағыз алшақтық.
Егер саясат класым сарапшыны мүлдем бейнелей алмаса ше?▾
Онда DAgger сізді құтқармайды, әрі шектеу дәл осыны айтады — ол кейін қарағанда класстағы ең жақсы шығын, эпсилон_N-ге қатысты өрнектеледі. Егер бұл қате архитектура, жетіспейтін бақылау немесе сахнаны көре алмайтын камера себебінен үлкен болса, жинақтау сізге тапсырманы орындай алмайтын класс шеңберінде оптималды саясат береді. Түзетулер жинамас бұрын бөлек қалдырылған эпизодтарға қарсы ашық циклді қайта ойнатуды жүргізіңіз.
Бұдан кейін қайда бару керек
Егер сіз әлі саясат оқытпаған болсаңыз, бұл теория ертерек: алдымен деректер жиынтығын жазыңыз, алғашқы саясатыңызды оқыту мен жұмыс үстелі клиентінен бастаңыз. Егер тағы жүз таза демонстрация мен түзетулерді бастау арасында таңдап жатсаңыз: таза демонстрациялар таралым мәселесін шешпейді. Механика бойынша адам басқаратын нұсқа мен, содан кейін SO-100 бойынша жетекшіні жалғастырыңыз.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started