Робот манипуляциясы сахнасының дерексіз бейнесі — үйретілген саясат орындау барысында баратын күй-таралымын көрсетеді
DAggerИмитациялық оқытуBehavior CloningРобот оқытуТеория

DAgger түсіндірмесі: Behavior Cloning неге ауытқиды және Dataset Aggregation іс жүзінде нені дәлелдейді

AY-Robots ResearchAugust 27, 2026Оқу уақыты — 15 минут

Behavior cloning саясатты сарапшының күй-таралымына бейімдейді, ал кейін ол өз бетінше іске қосылады. Осы екі таралымның арасындағы алшақтық — валидацияда мінсіз көрінетін саясаттың 300-ші қадамда үстелден құлап түсуінің себебі. Бұл — DAgger сериямыздың теориялық тарауы: квадраттық қате мүшесі қайдан шығады, dataset aggregation нені өзгертеді, no-regret дәлелі нені болжайды және есептің қай бөлігін адам-сарапшы бәрібір өз мойнына алуға тиіс.

Манипуляция саясатын оқытатын әркім ерте ме, кеш пе кездесетін нақты бір ақаулық бар. Саясат текшеге қол созады, одан екі сантиметр қалғанда кібіртіктеп, бүйірге қарай ауытқып, содан кейін тапсырмаға қатысы жоқ нәрсе жасайды. Валидация қатесі жақсы болды. Бөлек қалдырылған эпизодтарға қарсы ашық циклді қайта ойнату да жақсы болды. Дегенмен қол оқыту деректерінде мүлдем кездеспейтін позада аяқталады, және сол жерден бастап оның айтары ештеңе қалмайды.

Бұл ақаулықтың атауы бар және оның артында қалыптасқан теория тұр. Бұл — DAgger туралы төрт мақаланың біріншісі, ол дәлелдің өзін қамтиды: демонстратордың өз траекторияларына саясатты бейімдеу неге эпизод ұзындығының квадратына пропорционал өсе алатын қате тудыратыны, dataset aggregation нені өзгертетіні және no-regret дәлелі нені уәде етпейтіні. Нақты құрылғыдағы циклді SO-100-де DAgger циклін жүргізу мақаласы қамтиды, адам басқаратын нұсқасын HG-DAgger және адам басқаратын араласулар мақаласынан, ал өлшеу мәселесін DAgger циклін өлшеу мақаласынан таба аласыз.

Қысқаша нұсқасы

  • Behavior cloning сарапшының күй-таралымында оқытылады, ал бағалау саясаттың өз таралымында жүргізіледі. Бұл сәйкессіздік эпизод бойы жинақтала береді.
  • Росс пен Багнелл қосымша шығынның қадам сайынғы қатенің T квадратына көбейтіндісіндей өсуі мүмкін екенін көрсетті; DAgger мақаласы осы шектеуді қайта тұжырымдап, оның дәл (tight) екенін атап өтеді.
  • DAgger саясаттың өзі баратын күйлерге белгі қояды және тек соңғы деректерге ғана емес, осы кезге дейін жиналған барлық деректер жиынтығына қайта оқытады.
  • Кепілдік no-regret онлайн оқытуға дейін редукциялануымен беріледі: жинақтап қайта оқыту дегеніміз — Follow-The-Leader.
  • Ол нөлге қатысты емес, саясат класында қол жеткізуге болатын ең жақсы шығынға қатысты орындалады — әрі сарапшы өзі ешқашан тудырмайтын күйлерге бәрібір белгі қоюға тиіс.

Behavior cloning үнсіз қабылдайтын болжам

Демонстрация деректер жиынтығы — бақылау-әрекет жұптарының үйіндісі. Behavior cloning осы үйіндіге әдеттегі бақыланатын оқыту арқылы функция бейімдеп, сонымен тоқтайды. Бұл — саладағы ең көне идея. Помероның 1988 жылғы ALVINN жүйесі камера мен лазерлік қашықтық өлшегіштен алынған суреттерді қабылдап, көліктің жүруі керек бағытын шығаратын үш қабатты кері таралу желісі болды; ол симуляцияланған жол суреттерінде оқытылып, кейбір далалық жағдайларда нақты жолдармен жүре алды. Рецепт онша өзгерген жоқ; өзгергені — желілер.

Өткізіп жіберілетіні — сол жұптардың қайдан шыққанын тексеру. Олардың әрқайсысы демонстратор жасаған траекторияда жатыр. Ал сіз іске қосатын саясат өз траекториясын өзі тудырады. Ол ауытқыған сәтте оқыту таралымында болмаған күйлер туралы сұралады, және оның жауабы оны одан әрі алшақтатады. Росс, Гордон және Багнелл DAgger мақаласын дәл осыдан бастайды: тізбектелген болжам статистикалық оқытудың негізіндегі i.i.d. болжамын бұзады, өйткені оқытушының өз болжамдары келесі көретін кірістерін анықтайды.

Сол мақаладағы ең түсінікті мысал робот емес. Super Mario Bros. үшін жасалған оптималдыға жақын жоспарлаушыны клондау кедергіден секіріп өтудің орнына оған қайта-қайта тіреліп қалатын саясат тудырды. Себебі бір сөйлемге сыятын бүкіл дәлел: сарапшы әрдайым қолайлы қашықтықтан секірген, сондықтан деректер жиынтығында Марионың кедергіге тірелген күйі мүлдем болмаған, демек, ол тірелгеннен кейін не істеу керегі туралы белгі де болмаған.

Марионы SO-100 қолымен ауыстырыңыз — құрылым дәл сондай. Сіздің демонстрацияларыңыз таза жақындауды және таза ұстауды көрсетеді, ал грипердің екі сантиметр жетпей жабылуын емес — сондықтан саясат бұдан кейін не істеу керегін білмейді, әрі оның кез келген болжамы оны одан сайын алшақтатады. Ковариаттық ығысу — деректер жинау процедурасының қасиеті, желі архитектурасының емес.

Квадраттық мүше қайдан шығады

Росс пен Багнеллдің 2010 жылғы AISTATS мақаласы — Efficient Reductions for Imitation Learning — жинақталуды дәл тұжырымдайды. T тапсырма горизонты болсын, тапсырма шығыны бірлік аралықпен шектелген болсын, ал эпсилон сарапшының күй-таралымы бойынша өлшенген сурогат шығын болсын — бұл валидация жиынтығыңыз хабарлайтын сан. Онда сол саясатты T қадам жүргізудің сарапшыға қатысты қосымша шығыны T квадратының эпсилонға көбейтіндісімен шектеледі. Росс, Гордон және Багнелл мұны DAgger мақаласында 2.1-теорема ретінде қайта тұжырымдап, маңызды сөйлемді қосады: шектеу дәл (tight). Сарапшы таралымында эпсилон шығыны бар саясаттың қосымша шығыны T бойынша шынымен квадраттық өсетін есептер бар.

Дәл (tight) болу — типтік болу дегенді білдірмейді. Квадраттық мүше — есептер класы бойынша ең нашар жағдай, сіздің pick-and-place тапсырмаңыз туралы болжам емес. Бұл нәтиже көрсететіні: сарапшы демонстрациясын көбейту мәселені жоя алмайды — ол тек саясат сыналмайтын таралымдағы эпсилон бағасын дәлірек етеді.

Шығар жол сол мақаланың өзінде, 2.2-теорема ретінде қайта тұжырымдалған. Егер саясат өзінің күй-таралымында эпсилон шығынына қол жеткізсе, әрі бір қате әрекет сарапшы бойынша cost-to-go шамасында ең көбі u тұратын болса, қосымша шығын u мен T мен эпсилонның көбейтіндісімен шектеледі — горизонт бойынша сызықтық. Қызықты шама — u тұрақтысы: сарапшымен 0-1 келіспеушілік үшін ол ең көбі 1, ал сарапшы бірнеше қадамда қалпына келе алатын кез келген жағдайда O(1). Ең нашар жағдайда ол O(T), және сол кезде сызықтық шектеу квадраттыдан жақсы бола алмайды.

ЖағдайСарапшыға қатысты қосымша шығын шегіНемен негізделеді
Behavior cloning (Ross & Bagnell 2010, Ross т.б. 2011-де 2.1-теорема ретінде қайта тұжырымдалған)T квадрат көбейту эпсилонэпсилон сарапшының күй-таралымында өлшенген; шығын [0,1] аралығында; шектеу дәл (tight)
Өз таралымында эпсилон шығыны бар кез келген саясат (2.2-теорема)u көбейту T көбейту эпсилонu бір қате әрекеттің cost-to-go айыппұлын шектейді; 0-1 шығын үшін ең көбі 1, ең нашар жағдайда O(T)
Forward training (Ross & Bagnell 2010)u көбейту T көбейту эпсилонәр уақыт қадамына бір саясат; T саясат және белгілі, ақырлы T қажет
SMILe (Ross & Bagnell 2010)кейбір есеп кластарында T мен эпсилон бойынша сызықтыққа жақынальфа O(1/T квадрат) ішінде, N O(T квадрат log T) ішінде; стохастикалық қоспа береді
DAgger (3.2-теорема, Ross т.б. 2011)u көбейту T көбейту эпсилон_N, қосу O(1)N шамасы uT ретті; қатаң дөңес шектелген шығын; no-regret оқытушы; эпсилон_N — кейін қарағанда ең жақсы шығын
Демонстрация жиынтығында ешқашан кездеспеген, саясат баратын күйлерді бейнелейтін робот жұмыс кеңістігі
DAgger раундында маңызды болатын күйлер — ешкім демонстрация жасамаған күйлер: сәтсіз ұстау әрекеті, жартылай ашық грипер, объектіден өтіп кеткен қол.

DAgger-ге дейінгі екі әрекет

Forward training — адал, бірақ практикалық емес жауап. Әр уақыт қадамы үшін ретімен бөлек саясат оқытылады, әрқайсысы алдыңғы қадамдар үшін бекітілген саясаттар тудыратын күй-таралымында, сөйтіп әр саясат кездесетін таралымды дәл көреді. Мәселе сипаттаманың өзінде: T саясат, ретімен оқытылады, ерте тоқтату жоқ. Секундына 30 кадрлық манипуляция эпизодында T жүздеген шамасында болады.

Сол мақаладағы SMILe, және Дауме, Лэнгфорд пен Мардудың құрылымдық болжам бойынша жұмысындағы SEARN басқа жолды таңдайды: бір стационар, бірақ стохастикалық саясат. Әр итерация бір компонент оқытып, оны қоспаға қосады, ықтималдық массасын сарапшыдан алшақтатады. Нәтиже — кейбір компоненттері басқаларынан нашар қоспа: физикалық қолда бұл қозғалыс ортасында нашар компонентті таңдап алуы мүмкін контроллер дегенді білдіреді. Дәл осы стационар детерминистік саясатты қалау себебі ретінде айтылған.

DAgger: бір идея, бір қорап

Dataset Aggregation детерминистік саясатты сақтап, шешімді деректер жинауға көшіреді. Әр раунд: ағымдағы саясатты жүргізу, ол баратын күйлерді жазып алу, әр күйде дұрыс әрекет не болатыны туралы сарапшыдан сұрау, сол жұптарды бар деректер жиынтығына қосу, біріктірілген жиынтықта қайта оқыту. Атауының өзі алгоритм — сіз жинақтайсыз, ешқашан тастамайсыз.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger мета-алгоритмі, Ross, Gordon & Bagnell (2011) мақаласының 3.1-алгоритмі.

Үш деталь көрінгеннен гөрі маңыздырақ. Белгілер аралас саясат баратын күйлер үшін қойылады, ал әрекеттер сарапшыдан келеді — саясат сұрақтар қояды, сарапшы жауап береді. Қайта оқыту толық жиынтықта жүргізіледі, бұл әр раундты Follow-The-Leader қадамына айналдырады: n раундында сіз осы кезге дейінгі барлық траектория бойынша кейін қарағанда ең жақсы саясатты таңдайсыз. Дәлел дәл осы тұжырымдамаға сүйенеді. Ал алгоритм валидация жиынтығында таңдалған тізбектегі ең жақсы саясатты қайтарумен аяқталады, өйткені теоремалар тізбектегі белгілі бір саясаттың жақсы болатынына кепілдік береді, соңғысының жақсы болатынына емес.

Бета-кесте және оның неге баптау тұтқасы емес екені

Аралас саясат — бета_i көбейту сарапшы, қосу бір минус бета_i көбейту оқытушы. Мұның мәні практикалық: алғашқы бірнеше оқытылған саясат өте аз деректерде оқытылады, көп қате жасайды, әйтпесе саясат жақсарған соң маңызын жоятын күйлерде уақыт өткізер еді.

Теория тек бір ғана шарт қояды: бета мәндерінің жүгіру орташасы нөлге ұмтылуы керек. Талдау бета_i мәні (1 - альфа) дәрежесі i-1 арқылы шектелген жағдайда жұмыс істейді, мұндағы альфа — T-ге тәуелсіз тұрақты.

КестеНе істейдіМақала не хабарлайды
beta_1 = 1Бірінші раунд — таза сарапшы демонстрациясы; бастапқы саясат қажет емесӘр нұсқада ұсынылатын бастапқы нүкте
beta_i = 1, егер i = 1 болса, әйтпесе 0Сарапшы тек бірінші раундта; еркін параметр жоқМақаланың параметрсіз нұсқасы, ол көбіне практикада ең жақсы нәтиже беретіні айтылады; Super Mario Bros.-та 20 итерациядан кейін 2980 ұпай
beta_i = p^(i-1), p = 0.5 болғандаСарапшы ықтималдығы геометриялық түрде кемидіСол эталонда 3030, параметрсіз нұсқадан сәл алда
beta_i = p^(i-1), p = 0.9 болғандаСарапшы циклде әлдеқайда ұзақ қаладыАйтарлықтай баяу жинақталу; 20 итерация аяқталғанда әлі де жақсарып жатты

Шкаласы шамамен 4300-ге дейін жететін жүйеде 2980 бен 3030 арасындағы алшақтық шағын, бірақ мақаланың оған берген түсіндірмесі осы бөлімдегі ең пайдалы практикалық ескерту. Параметрсіз кестеде Марио ерте кезден бір жерде тұрып қалды және сол бір орыннан дерлік қайталанатын деректердің үлкен массасын тудырды; сарапшыға уақыттың бір бөлігінде басқаруға мүмкіндік беру оны бұғаттан босатып қана қоймай, күй әртүрлілігін де кеңейтті. Кесте қоспа қатынасына қарағанда деректер жинауыңыз жаңа күйлер тудырып жатыр ма, әлде сол бір ақаулықты қайталап жатыр ма дегенге көбірек байланысты.

Кесте физикалық қолға жазылғанындай неге көшпейді

Әр уақыт қадамындағы стохастикалық қоспа басқару өкілеттігін басқару жиілігімен, әдепкі SO-100 құрылымында секундына 30 рет ауыстыруды білдіреді. Ешбір телеоперация интерфейсі мұны қауіпсіз немесе мағыналы ете алмайды. Нақты құрылғыда бета-кесте орнын адамның қашан басқаруды қолға алу керегі туралы шешіміне береді: басқа талдауы бар басқа алгоритм.

Кепілдік: no-regret онлайн оқытуға редукция

Мақаланы мақала ететін қадам — осы. Әр DAgger раундын онлайн оқыту есебіндегі бір мысал ретінде қарастырыңыз, мұндағы i раундындағы шығын — i раундында қолданылған саясаттың күй-таралымы бойынша сурогат шығын. Оқытушы сол шығынды көрмей тұрып саясатты бекітеді, ал тізбек стационар емес, өйткені ол осы кезге дейін шығарылған саясаттарға тәуелді.

Алгоритм no-regret болады, егер оның N раунд бойынша орташа шығыны кейін қарағанда ең жақсы жалғыз саясаттың шығынына жақындаса. Қатаң дөңес шығындардағы Follow-The-Leader дәл осындай алгоритм, орташа өкініші 1/N ретімен кемиді — ал толық жиынтықта қайта оқыту дәл Follow-The-Leader болып табылады. Кез келген басқа no-regret оқытушы да сол дәрежеде жарайды: талдау — редукция, бір оптимизатордың қасиеті емес.

Бір лемма деректерді жинаған аралас саясат пен іске қосылатын оқытылған саясат арасындағы алшақтықты жалғайды: 4.1-лемма олардың күй-таралымдары арасындағы L1 қашықтығын 2 T бета_i арқылы шектейді. Дәл осы себепті бета мәндері кему керек — сарапшы әлі айтарлықтай басқару өкілеттігін ұстап тұрған кезде, сіз жинайтын күйлер саясатыңыз тудыратын күйлер емес. Лемманы өкініш шегімен біріктірсеңіз, негізгі нәтиже шығады: шамамен T итерациядан кейін тізбектегі белгілі бір саясаттың өз таралымы бойынша сурогат шығыны эпсилон_N-нен O(1/T) шамасында ғана асады. Мұны сызықтық шектеуге қойсаңыз, 3.2-теоремаға келесіз.

Эмпирикалық жағы қазіргі стандарттар бойынша қарапайым. Super Tux Kart ойынында деректер көбейген сайын бақыланатын базалық үлгінің айналымға шаққандағы орташа құлау саны жақсармады, DAgger он бес итерациядан кейін трассадан ешқашан шықпайтын саясатқа жетті, ал SMILe жиырма итерациядан кейін де айналымға шамамен екі рет құлап жатты. Қолжазба эталонында таңба дәлдігі құрылымсыз 82 пайыз, бақыланатын түрде 83,6 пайыз, DAgger-мен 85,5 пайыз болды. Бұлардың ешқайсысы манипуляция нәтижесі емес.

Дәлел нені уәде етпейді

Теорема тұжырымдары шартты, әрі шарттар маңызды жүк көтереді.

DAgger кепілдігі, мұқият оқығанда
Ол сізге не береді
  • Айтылған болжамдар бойынша T-ге қатысты квадраттық емес, сызықтық шектеу.
  • Стохастикалық қоспа емес, стационар детерминистік саясат.
  • Нағыз редукция: кез келген no-regret онлайн оқытушы сай келеді.
  • Нақты итерация саны — өкініш мүшесі маңызын жоймас бұрын шамамен T раунд.
  • Тізбектегі кемінде бір саясатқа кепілдік, сондықтан соңында валидация өткізіледі.
Ол сізге не бермейді
  • Ол нөлге емес, кейін қарағанда класстағы ең жақсы шығын — эпсилон_N-ге қатысты. Егер класыңыз сарапшыны бейнелей алмаса, бұл кепілдік іс жүзінде бос.
  • Оған no-regret әдісі немесе қатаң дөңес сурогат шығын қажет — авторлар атап өткендей, бұл негізделген классификация редукцияларынан қатаңырақ талап.
  • u тұрақтысы ең нашар жағдайда O(T) болуы мүмкін, сол кезде сызықтық шектеу қайтадан квадраттыққа айналады.
  • Ол итерацияларды шектейді, сарапшы белгілерін емес. Роботта белгілер — бюджет.
  • Ол сарапшыдан барылған әр күйде сұрауға болады және ол сол жерде дұрыс жауап береді деп болжайды. Осы болжамның өзі — бүкіл шығын.

Тағы бір нәтиже жиі теріске шығару ретінде келтіріледі, бірақ ол олай емес. Раджараман, Ян, Цзяо және Рамачандран ақырлы S күй кеңістігі мен H горизонты бар эпизодтық MDP-терде имитациялық оқытудың минимакс шектерін зерттеп, оқытушы барылған күйлерде сарапшыдан белсенді сұрай алатын жағдайда да орындалатын, |S| H квадратын N-ге бөлу ретті субоптималдылықтың төменгі шегін дәлелдейді. Бұл — тұрақты эпизод бюджетіндегі MDP класы бойынша ең нашар жағдай жылдамдығы, ал ол жоққа шығаратыны — интерактивтіліктің минимакс жылдамдығын жақсартады деген идея; DAgger теоремасы басқа тұжырым, ол іске қосылған саясатты оның өз саясат класы қол жеткізе алатынға қатысты шектейді.

Свами, Чоудхури, Багнелл және Ву кейінірек бұл алгоритмдерді сарапшы мінез-құлқының қай сәттерін сәйкестендіретініне қарай жіктеп, әр отбасының жинақталған қатені қаншалықты жеңілдететінін көрсететін moment recoverability ұғымын енгізді. Оса мен Селеминнің шолулары алгоритмдік ландшафт пен адам кері байланысы интерфейстерін қамтиды.

Есеп-шот: сарапшы ешқашан тудырмаған күйлерге белгі қою

Жоғарыдағының бәрі кез келген жерден сұрауға болатын сарапшыны болжайды. Іс жүзінде тегінге жақын жоспарлаушысы бар симуляцияда — Марио эксперименттерінде ойын күйіне толық қолжетімділігі бар оптималдыға жақын жоспарлаушы қолданылды. Роботтағы адаммен бұл басым шығын, әрі ерекше: адам өз құзыреттілігі ешқашан тудырмайтын конфигурацияда дұрыс әрекет жасауға тиіс.

Келли, Сидрейн, Дриггс-Кэмпбелл және Коченлерфер HG-DAgger мақаласында қарсылықты тікелей айтады. Кәдімгі DAgger сарапшыдан жүйені толық бақыламай тұрып әрекет белгілерін беруді талап етеді. Бұл қауіпсіздікті төмендетеді, ал адам сарапшылармен жиналған белгілердің сапасын нашарлатуы мүмкін, мұны олар сезілетін актуатор кешігуіне жатқызады. Сіз алатын белгі алгоритм болжаған белгі емес.

Ласки мен әріптестері мәселеге DART арқылы басқа жақтан шабуыл жасайды, олардың тұжырымдамасы қатаң: on-policy әдістері адам-бақылаушылар үшін жалықтырады, есептеу жүктемесін арттырады және оқыту барысында қауіпті күйлерге баруы мүмкін. Олардың балама шешімі бақылаушының өз демонстрацияларына калибрленген шу қосады, сөйтіп робот сенімсіз саясатты бір рет те жүргізбей қалпына келтіру демонстрацияланады. MuJoCo Humanoid-те олар DART оқыту кезінде бақылаушының жинақталған сыйақысын 5 пайызға азайтатынын хабарлайды, ал DAgger бақылаушыдан 80 пайызға аз жинақталған сыйақымен саясаттар орындайды; Toyota HSR-мен тығыз ортадан ұстауда behavior cloning-пен салыстырғанда орташа 62 пайыз артық нәтиже.

Чжан мен Чоның SafeDAgger жүйесі анықтамалық саясатқа сұрауларды тапшы ресурс ретінде қарастырады: бөлек қауіпсіздік саясаты сұрамай-ақ негізгі саясаттың анықтамалықтан шектен тыс ауытқитынын болжайды, әрі тек сол күйлер ғана беріледі. Үшеуі де бір фактіге жауап береді — DAgger талдауы сарапшы белгілері үшін ешнәрсе алмайды, ал шындық көп нәрсе алады.

Ешкім ескертпейтін бөлігі

Таралымнан тыс күйлерге белгі қою тапсырманы демонстрациялаудан психологиялық тұрғыда қиынырақ. Қалыпты демонстрация — сізде бұрыннан бар моторлық жоспарды орындау дегенді білдіреді. Грипперді сіз ешқашан қоймайтын жерге қойған саясатты түзету — уақыт қысымында, робот әлі қозғалып тұрған кезде дереу қалпына келтіруді құрастыруды білдіреді. Әдеттегі жазу сеансымен салыстырғанда сеанс сайын пайдалы минуттардың азырақ болуын күтіңіз, әрі бір сеанс ішінде өз түзету сапаңыздың төмендеуін бақылаңыз.

Дискіде сақталған эпизодтар, кадрлар және кадр бойынша бағандарды көрсететін LeRobot деректер жиынтығының құрылымы
Түзетулер тек араласу кадрлары белгіленгенде ғана деректер жиынтығына айналады — LeRobot форматында бұл бақылау мен әрекеттің жанындағы кадр бойынша баған.

Бұл сіздің үстеліңіздегі SO-100 үшін нені білдіреді

Горизонтты өз бірліктеріңізге аударыңыз. Секундына 30 кадрлық жиырма секундтық эпизод — 600 шешім қадамы, әрі жоғарыдағы әр шектеудегі T дәл осы сан. T = 600 болғанда, T бойынша масштабталатын мүше мен T квадраты бойынша масштабталатын мүше арасындағы айырмашылық — нашар жақындаудан қалпына келе алатын саясат пен келе алмайтын саясат арасындағы айырмашылық.

Бұл action chunking-тің неге пайдалы екенінің бір бөлігі: саясат әр инференс қадамында әрекеттердің қысқа тізбегін шығарғанда, шешім нүктелерінің саны азаяды, демек, жинақталу мүмкіндіктерінің саны да азаяды. Чжао, Кумар, Левин және Финн жинақталған қатені Action Chunking with Transformers-тің негіздемесі ретінде атайды, әрі он минуттық демонстрациядан арзан қолды екі қолды құрылғыда алты қиын нақты әлем тапсырмасында 80-90 пайыз табысқа жеткенін хабарлайды. Chunking ковариаттық ығысуды жоймайды — күйлер бәрібір саясаттың өзінікі — бірақ ол тиімді горизонтты қысқартады. Қараңыз: action chunking және SO-100 имитациялық оқыту нұсқаулығы.

Екінші аударма — прогресс метрикасы. Саясаттың өз таралымы бойынша эпсилонды тікелей өлшей алмайсыз — бұл барылған әр күй үшін нақты сарапшы әрекетін талап етеді, дәл сол нәрсені сіз тудырмауға тырысасыз. Адам басқаратын цикл орнына сізге беретіні — араласу жиілігі: жүгіру кезінде адам басқаруды қолға алған кадрлар үлесі. Бұл — жанама көрсеткіш, ол саясатқа қатысы жоқ себептермен өзгереді — шыдамды оператор азырақ араласады. Тұрақты қолданылса, бұл раунд түскі уақытты жұмсауға тұрарлық болғанын айтатын жалғыз сан.

Үшінші аударма — талдау қамтымайтын деректер сапасы туралы ескерту. Мандлекар мен әріптестері бес симуляцияланған және үш нақты әлемдегі көп сатылы манипуляция тапсырмасында алты офлайн оқыту алгоритмін зерттеп, алгоритмдік жобалау таңдауларына сезімталдықты, демонстрация сапасына тәуелділікті және тоқтату критерийінен туындайтын өзгермелілікті хабарлайды. Белхале, Цуй және Садиг деректер жиынтығының сапасы әрекет ауытқуы мен өтпелі әртүрлілік арқылы формализациялануы керек деп дәлелдейді және күй әртүрлілігі әрдайым пайдалы бола бермейтінін атап өтеді. DAgger раунды ешкім әдейі таңдамаған күйлерді қосады: кейбірі сізге қажет қалпына келтіру деректері, кейбірі — сіз басқаруды қолға алу тетігін іздеп жатқанда роботтың дал-дұлы.

Механикалық тұрғыда раунд алты қадамнан тұрады: жазуды қосып инференсті жүргізу, саясат дұрыс әрекет етпегенде басқаруды қолға алу, жүгірісті қарап шығып әр эпизодты тіркеу, түзетулерді синхрондау, түпнұсқалар мен түзетулерден әр қайнар көз бойынша эпизод таңдауы анық жасалған аралас деректер жиынтығын құрастыру, әрі базалық үлгіден емес, алдыңғы чекпоинттен бастап оқытуды жалғастыру. ay-robots-та бұл қадамдар түймелер түрінде бар, бұл құбыр жүйесін алып тастайды, бірақ пайымдауды алып тастамайды. Екі ескерту бар: чекпоинттен жалғастыру салмақтарды инициализациялайды, оптимизатордың қайта жалғасуы емес, әрі leader-қол туралайтын әрекет құрылғыда әлі жеңіл тексерілген. Қараңыз: оқыту және деректер жиынтықтары.

DAgger циклі, дайын қосылған

Тірі инференс жүгірісі кезінде басқаруды қолға алу, кадр бойынша араласуды белгілеу, эпизодтарды түзету немесе бағалау ретінде тіркеу, әр қайнар көз бойынша эпизод таңдауы анық жасалған аралас деректер жиынтығын құрастыру және бар чекпоинттен оқытуды жалғастыру — бәрі кірістірілген. Қашан басқаруды қолға алу керегін және нені сақтау керегін бәрібір сіз шешесіз — бұл бөлігі автоматтандырылмайды.

DAgger циклі қалай жұмыс істейтінін қараңыз

Отбасы ағашы, бір кестеде

ӘдісКүйлерді кім таңдайдыСарапшы нені бередіНегізгі шығын
Behavior cloningСарапшыТаза демонстрацияларҚалпына келтіру деректері жоқ; қате T бойынша квадраттық жинақталуы мүмкін
Forward trainingОқытушы, әр уақыт қадамы бойыншаТудырылған таралым бойынша белгілерT бөлек саясат; ұзақ горизонттар үшін жарамсыз
SMILe / SEARNСарапшы мен оқытушының стохастикалық қоспасыҚоспаның таралымы бойынша белгілерҚоспа компоненттерінің сапасы әртүрлі
DAggerАралас саясат, бета нөлге кемидіБарылған әр күй үшін дұрыс әрекетБасқармай тұрып, сарапшы ешқашан тудырмайтын күйлерге белгі қою
DARTЕнгізілген шумен бұзылған сарапшыКалибрленген шу астындағы демонстрацияларШу оқытушының қатесіне сай калибрленуі керек
HG-DAggerАдам басқаруды қолға алғанша дейін оқытушыТек адам басқаратын сегменттердегі түзетулерАдамның қашан араласу керегі туралы пайымдауына тәуелді
SafeDAggerҚауіпсіздік қақпасымен сүзілген оқытушыТек қақпа сұрағанда ғана белгілерҚақпаның өзі оқытылып, сенімді болуы керек

Жиі қойылатын сұрақтар

Өз роботымда квадраттық қате өсуін шынымен байқай аламын ба?

Таза қисық түрінде емес. Шектеу — ең нашар жағдай: ол дәл (tight), өйткені кейбір есеп оған жетеді, сіздікінің де жететініне кепілдік емес. Сіз көретін нәрсе — салдары: бөлек қалдырылған кадрларда жақсы ұпай алатын, бірақ нақты тапсырмада сәтсіздікке ұшырайтын және сол типтес деректерді көбірек жазғанда жақсармайтын саясат. Егер қосымша таза деректер көмектеспей қалса, бұл — деректер көлемінің мәселесі емес, ковариаттық ығысу.

DAgger деп атау үшін бета-қоспаны іске асыруым керек пе?

Параметрсіз нұсқа — бірінші раундта сарапшы, кейін таза оқытушы — заңды жеке жағдай, әрі бастапқы эксперименттерде көбіне ең жақсы нәтиже берген. Тастауға болмайтыны — жинақтау: тек ең соңғы түзетулерде қайта оқыту Follow-The-Leader түсіндірмесін бұзады, ал no-regret дәлелі дәл содан шығады. Тек түзетулерде ғана оқыту әлдеқайда әлсіз процедура.

Неге соңғы саясаттың орнына валидация жиынтығындағы ең жақсысын қайтару керек?

Өйткені теоремалар жақсы саясаттың тізбектің қандай да бір жерінде бар екеніне кепілдік береді, ол соңғы итерация болатынына емес — шектеу тізбек бойынша минимумға қойылған. Соңғы раундтан не шықса, соны жіберу нәтиженің айтылған шартын елемеу болып табылады, әрі соңғы раунд әрдайым ең жақсысы бола бермейді.

Қанша раундқа жоспарлауым керек?

Теория T ретті итерацияларды қалайды, ал 600 қадамдық эпизод үшін бұл ешкім құрылғыда жүргізбейтін сан. Бастапқы эксперименттер әр эталонда жиырма итерация жүргізді. Іс жүзінде сіз араласу жиілігі кему тоқтағанша раунд жүргізесіз, бұл талдау болжайтын саннан әлдеқайда төмен — теория мен практика арасындағы нағыз алшақтық.

Егер саясат класым сарапшыны мүлдем бейнелей алмаса ше?

Онда DAgger сізді құтқармайды, әрі шектеу дәл осыны айтады — ол кейін қарағанда класстағы ең жақсы шығын, эпсилон_N-ге қатысты өрнектеледі. Егер бұл қате архитектура, жетіспейтін бақылау немесе сахнаны көре алмайтын камера себебінен үлкен болса, жинақтау сізге тапсырманы орындай алмайтын класс шеңберінде оптималды саясат береді. Түзетулер жинамас бұрын бөлек қалдырылған эпизодтарға қарсы ашық циклді қайта ойнатуды жүргізіңіз.

Бұдан кейін қайда бару керек

Егер сіз әлі саясат оқытпаған болсаңыз, бұл теория ертерек: алдымен деректер жиынтығын жазыңыз, алғашқы саясатыңызды оқыту мен жұмыс үстелі клиентінен бастаңыз. Егер тағы жүз таза демонстрация мен түзетулерді бастау арасында таңдап жатсаңыз: таза демонстрациялар таралым мәселесін шешпейді. Механика бойынша адам басқаратын нұсқа мен, содан кейін SO-100 бойынша жетекшіні жалғастырыңыз.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started