Mchoro wa dhahania wa eneo la kushughulikia vitu kwa roboti, unaoonyesha usambazaji wa hali ambao sera iliyofunzwa hupitia wakati wa utendaji
DAggerKujifunza kwa KuigaBehavior CloningKujifunza kwa RobotiNadharia

DAgger Kwa Undani: Kwa Nini Behavior Cloning Hupotea Njiani, na Ukusanyaji wa Seti za Data Unathibitisha Nini Hasa

AY-Robots ResearchAugust 27, 2026Dakika 15 za kusoma

Behavior cloning hulenga sera kwenye usambazaji wa hali za mtaalamu kisha inatumika peke yake baadaye. Pengo kati ya usambazaji huo wawili ndilo linaloelezea kwa nini sera inayoonekana sawa wakati wa uthibitishaji inatoka mezani kwenye hatua ya 300. Huu ni sura ya kinadharia ya mfululizo wetu wa DAgger: chanzo cha neno la hitilafu la mraba, mabadiliko yanayoletwa na ukusanyaji wa seti za data, mawazo yanayotegemewa na uthibitisho wa 'no-regret', na sehemu ya gharama ambayo mtaalamu wa kibinadamu bado anapaswa kulipa.

Kuna hitilafu maalum ambayo kila mtu anayefunza sera ya kushughulikia vitu hukutana nayo mapema au baadaye. Sera inafikia mchemraba, inakaribia ndani ya sentimita mbili, inasitasita, inateleza kando, kisha inafanya kitu kisichohusiana na kazi husika. Hasara ya uthibitishaji ilikuwa sawa. Uchezaji upya wa open-loop dhidi ya vipindi vilivyowekwa kando ulikuwa sawa. Na hata hivyo mkono huishia katika mkao usiotokea popote katika data za mafunzo, na kutoka hapo hauna jambo la maana la kufanya.

Hitilafu hiyo ina jina na nadharia thabiti nyuma yake. Huu ni wa kwanza kati ya makala nne kuhusu DAgger, na unashughulikia hoja yenyewe: kwa nini kulenga sera kwenye njia za mwendo za mwonyeshaji mwenyewe hutoa hitilafu inayoweza kuongezeka kwa mraba wa urefu wa kipindi, mabadiliko yanayoletwa na ukusanyaji wa seti za data, na kile ambacho uthibitisho wa 'no-regret' hakiahidi. Mzunguko kwenye vifaa halisi umeshughulikiwa katika kuendesha mzunguko wa DAgger kwenye SO-100, toleo linalodhibitiwa na binadamu katika HG-DAgger na uingiliaji unaodhibitiwa na binadamu, na swali la upimaji katika kupima mzunguko wa DAgger.

Toleo fupi

  • Behavior cloning hufunza kwenye usambazaji wa hali za mtaalamu na hutathminiwa kwenye usambazaji wa sera yenyewe. Tofauti hiyo hulimbikizika katika kipindi kizima.
  • Ross na Bagnell walionyesha kuwa gharama ya ziada inaweza kuongezeka kama T mraba mara hitilafu kwa kila hatua; karatasi ya DAgger inarudia kikomo hicho na kubainisha kuwa ni kikali.
  • DAgger huweka lebo kwenye hali ambazo sera yenyewe hutembelea, na hufunza upya kwenye kila seti ya data iliyokusanywa hadi sasa, si tu ile mpya zaidi.
  • Uhakikisho ni upunguzaji hadi kujifunza mtandaoni kusiko na majuto: kukusanya na kufunza upya ni Follow-The-Leader.
  • Kikomo hicho kinatumika kuhusiana na hasara bora zaidi inayowezekana ndani ya darasa la sera, si kuhusiana na sifuri - na mtaalamu bado anapaswa kuweka lebo kwenye hali ambazo asingezitoa kamwe.

Dhana ambayo behavior cloning huifanya kimya kimya

Seti ya data ya maonyesho ni rundo la jozi za uchunguzi-na-kitendo. Behavior cloning hulenga chaguo la kazi kwenye rundo hilo kwa kutumia kujifunza kwa usimamizi wa kawaida kisha huishia hapo. Ni wazo la zamani zaidi katika uwanja huu. ALVINN ya Pomerleau, mwaka 1988, ilikuwa mtandao wa tabaka tatu wa back-propagation uliochukua picha kutoka kwenye kamera na kipima-umbali cha leza na kutoa mwelekeo ambao gari lilipaswa kusafiri; ulifunzwa kwa picha za barabara zilizoigwa na ukafuata barabara halisi chini ya baadhi ya masharti ya uwandani. Mtindo huo haujabadilika sana; mitandao ndiyo iliyobadilika.

Kinachorukwa ni ukaguzi wa mahali ambapo jozi hizo zilitoka. Kila moja yao iko kwenye njia ya mwendo ambayo mwonyeshaji alitoa. Sera unayoitumia hutoa yake mwenyewe. Mara inapopotoka, huulizwa kuhusu hali ambazo hazikuwa katika usambazaji wa mafunzo, na jibu lake huisogeza mbali zaidi. Ross, Gordon na Bagnell hufungua karatasi ya DAgger na hoja hii hasa: utabiri wa mfululizo hukiuka dhana ya i.i.d. iliyo chini ya kujifunza kwa takwimu, kwa sababu utabiri wa mjifunzaji mwenyewe ndio huamua ingizo atakalolipokea baadaye.

Mfano ulio wazi zaidi katika karatasi hiyo si roboti hata kidogo. Kuiga mpangaji aliye karibu na bora kwa ajili ya Super Mario Bros. kulizalisha sera iliyokwama mara kwa mara dhidi ya kizuizi badala ya kukiruka. Sababu ndiyo hoja nzima kwa sentensi moja: mtaalamu aliruka kila wakati akiwa umbali wa kustarehesha, hivyo seti ya data haikuwa na hali yoyote ambapo Mario alikuwa amebanwa dhidi ya kizuizi, na hivyo hapakuwa na lebo ya nini cha kufanya mara alipofika hapo.

Badilisha Mario na mkono wa SO-100 na muundo ni ule ule. Maonyesho yako yanaonyesha ufikiaji safi na ushikaji safi, si gripper ikifunga ikikosa sentimita mbili - hivyo sera haina wazo la nini cha kufanya kutoka hapo, na chochote inachokisia humsogeza mbali zaidi. Mgeuko wa usambazaji ni sifa ya utaratibu wa ukusanyaji wa data, si ya muundo wa mtandao.

Chanzo cha neno la mraba

Karatasi ya AISTATS ya 2010 ya Ross na Bagnell, Efficient Reductions for Imitation Learning, inaeleza ulimbikizaji huo kwa usahihi. Hebu T iwe upeo wa kazi, gharama ya kazi iwe na kikomo ndani ya muda wa kitengo, na epsilon iwe hasara mbadala inayopimwa chini ya usambazaji wa hali za mtaalamu - nambari ambayo seti yako ya uthibitishaji inaripoti. Basi gharama ya ziada ya kuendesha sera hiyo kwa hatua T, ikilinganishwa na mtaalamu, ina kikomo cha T mraba mara epsilon. Ross, Gordon na Bagnell wanarudia hili kama Nadharia 2.1 katika karatasi ya DAgger na kuongeza sentensi muhimu: kikomo hicho ni kikali. Kuna matatizo ambapo sera yenye hasara ya epsilon kwenye usambazaji wa mtaalamu hupata kweli gharama ya ziada inayoongezeka kwa njia ya mraba kulingana na T.

Kikali hakimaanishi kawaida. Neno la mraba ni hali mbaya zaidi juu ya darasa la matatizo, si utabiri kuhusu kazi yako ya pick-and-place. Kile linalothibitisha ni kwamba maonyesho zaidi ya mtaalamu hayawezi kuondoa tatizo hilo: yanaboresha tu makadirio ya epsilon kwenye usambazaji ambao sera haitajaribiwa juu yake.

Njia ya kutoroka iko kwenye karatasi ile ile, ikirudiwa kama Nadharia 2.2. Ikiwa sera inapata hasara ya epsilon chini ya usambazaji wa hali zake yenyewe, na kitendo kimoja kibaya kina gharama ya kiasi cha u kwenye gharama-ya-kuendelea chini ya mtaalamu, gharama ya ziada ina kikomo cha u mara T mara epsilon - ya mstari kulingana na upeo. Kiasi u ndicho kinachovutia: kiwango cha juu ni 1 kwa kutokubaliana kwa 0-1 na mtaalamu, na O(1) wakati wowote mtaalamu anapoweza kupona ndani ya hatua chache. Katika hali mbaya zaidi ni O(T), na kikomo cha mstari basi hakizidi kile cha mraba.

HaliKikomo cha gharama ya ziada juu ya mtaalamuKinachotegemea
Behavior cloning (Ross & Bagnell 2010, iliyorudiwa kama Nadharia 2.1 katika Ross et al. 2011)T mraba mara epsilonepsilon inapimwa kwenye usambazaji wa hali za mtaalamu; gharama iko ndani ya [0,1]; kikomo ni kikali
Sera yoyote yenye hasara ya epsilon chini ya usambazaji wake yenyewe (Nadharia 2.2)u mara T mara epsilonu ina kikomo cha adhabu ya gharama-ya-kuendelea ya kitendo kimoja kibaya; kiwango cha juu ni 1 kwa hasara ya 0-1, hali mbaya zaidi ni O(T)
Forward training (Ross & Bagnell 2010)u mara T mara epsilonsera moja kwa kila hatua ya muda; inahitaji sera T na T inayojulikana, yenye kikomo
SMILe (Ross & Bagnell 2010)karibu na mstari kulingana na T na epsilon katika baadhi ya madarasa ya matatizoalpha katika O(1/T mraba), N katika O(T mraba log T); huzalisha mchanganyiko wa kibahatishi
DAgger (Nadharia 3.2, Ross et al. 2011)u mara T mara epsilon_N, pamoja na O(1)N katika kiwango cha uT; hasara yenye kikomo iliyo convex kwa nguvu; mjifunzaji asiye na majuto; epsilon_N ni hasara bora zaidi ukiangalia nyuma
Eneo la kazi la roboti linaloonyesha hali ambazo sera hutembelea ambazo hazikuwahi kutokea katika seti ya maonyesho
Hali zinazohusika zaidi kwa raundi ya DAgger ni zile ambazo hakuna aliyeonyesha: ushikaji uliokosa kidogo, gripper iliyofunguka nusu, mkono uliopita kitu husika.

Majaribio mawili yaliyotangulia DAgger

Forward training ni jibu la uaminifu lakini lisilo la vitendo. Funza sera tofauti kwa kila hatua ya muda, kwa mfuatano, kila moja kwenye usambazaji wa hali unaozalishwa na sera zilizokwisha kukubaliwa kwa hatua za awali, ili kila sera ione hasa usambazaji itakaokutana nao. Tatizo liko kwenye maelezo yenyewe: sera T, zilizofunzwa kwa mfuatano, bila kusimama mapema. Kwa kipindi cha kushughulikia vitu kwa fremu 30 kwa sekunde, T iko kwenye mamia.

SMILe, kutoka karatasi ile ile, na SEARN, kutoka kazi ya Daume, Langford na Marcu kuhusu utabiri wenye muundo, hupitia njia nyingine: sera moja tuli, lakini ya kibahatishi. Kila marudio hufunza sehemu moja na kuiongeza kwenye mchanganyiko, ikihamisha uzito wa uwezekano mbali na mtaalamu. Matokeo ni mchanganyiko ambao baadhi ya sehemu zake ni mbaya zaidi kuliko nyingine - kwenye mkono halisi, kidhibiti kinachoweza kuchagua sehemu mbaya katikati ya mwendo. Hiyo ndiyo sababu iliyotajwa ya kutaka sera tuli iliyobainika kikamilifu badala yake.

DAgger: wazo moja, sanduku moja

Ukusanyaji wa Seti za Data huhifadhi sera iliyobainika kikamilifu na kuhamisha suluhisho kwenye ukusanyaji wa data. Kila raundi: endesha sera ya sasa, rekodi hali inazotembelea, muulize mtaalamu kitendo sahihi kingekuwa nini kwa kila moja, ongeza jozi hizo kwenye seti ya data uliyo nayo tayari, funza upya kwenye muungano huo. Jina ndilo algoriti - unakusanya, kamwe hutupi.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Meta-algoriti ya DAgger, Algoriti 3.1 ya Ross, Gordon & Bagnell (2011).

Maelezo matatu yana uzito zaidi kuliko yanavyoonekana. Lebo ni za hali zinazotembelewa na sera iliyochanganyika, lakini vitendo hutoka kwa mtaalamu - sera hutoa maswali, mtaalamu hutoa majibu. Ufunzaji upya ni kwenye muungano mzima, jambo linalofanya kila raundi kuwa hatua ya Follow-The-Leader: kwenye raundi n unachagua sera bora zaidi ukiangalia nyuma juu ya kila njia ya mwendo hadi sasa. Muundo huo ndio uthibitisho unategemea. Na algoriti humalizika kwa kurudisha sera bora zaidi katika mfuatano kama ilivyochaguliwa kwenye seti ya uthibitishaji, kwa sababu nadharia zinahakikisha kuwa baadhi ya sera katika mfuatano ni nzuri, si kwamba ile ya mwisho ndiyo.

Ratiba ya beta, na kwa nini si kitufe cha kurekebisha

Sera iliyochanganyika ni beta_i mara mtaalamu, pamoja na (moja - beta_i) mara mjifunzaji. Hoja ni ya vitendo: sera chache za kwanza zilizojifunzwa hufunzwa kwa data kidogo sana, hufanya makosa mengi, na vinginevyo zingetumia muda wa utekelezaji kwenye hali ambazo zitakuwa hazina umuhimu mara sera itakapoboreka.

Nadharia inaweka sharti moja tu: wastani unaoendelea wa beta lazima uelekee sifuri. Uchambuzi hufanya kazi na beta_i yenye kikomo cha (1 - alpha) kwa kipeo cha i-1, kwa kigezo alpha kisichotegemea T.

RatibaInafanya niniKaratasi inaripoti nini
beta_1 = 1Raundi ya kwanza ni maonyesho safi ya mtaalamu tu; hakuna sera ya awali inayohitajikaSehemu ya kuanzia inayopendekezwa katika kila toleo
beta_i = 1 kama i = 1, vinginevyo 0Mtaalamu tu kwenye raundi ya kwanza; hakuna kigezo huruToleo la karatasi lisilo na kigezo, ambalo inasema mara nyingi hufanya vizuri zaidi kivitendo; 2980 kwenye Super Mario Bros. baada ya marudio 20
beta_i = p^(i-1) na p = 0.5Uwezekano wa mtaalamu hupungua kwa kasi ya kijiometri3030 kwenye kigezo kile kile, ikiwa mbele kidogo ya toleo lisilo na kigezo
beta_i = p^(i-1) na p = 0.9Mtaalamu hubaki kwenye mzunguko kwa muda mrefu zaidiMuungano wa polepole kwa kiasi kikubwa; ulikuwa bado unaboreka wakati marudio 20 yalipomalizika

Pengo kati ya 2980 na 3030 kwenye kipimo kinachofikia takribani 4300 ni dogo, lakini maelezo ya karatasi kuhusu hilo ndiyo dokezo la vitendo lenye manufaa zaidi katika sehemu hii. Kwa ratiba isiyo na kigezo, Mario alikwama mahali pale pale mapema na kuzalisha wingi wa data zinazofanana kutoka eneo hilo moja; kumruhusu mtaalamu kuendesha sehemu ya muda kulimtoa kwenye kukwama na pia kulipanua aina ya hali. Ratiba haihusiani sana na uwiano wa uchanganyaji bali na kama ukusanyaji wako wa data unaendelea kuzalisha hali mpya au hitilafu ile ile.

Kwa nini ratiba haihamishiki kwenye mkono halisi kama ilivyoandikwa

Mchanganyiko wa kibahatishi kwa kila hatua ya muda unamaanisha kubadilisha mamlaka ya udhibiti kwa kasi ya udhibiti, mara 30 kwa sekunde kwenye mpangilio wa kawaida wa SO-100. Hakuna kiolesura cha teleoperesheni kinachofanya hilo kuwa salama au lenye maana. Kwenye vifaa halisi, ratiba ya beta inampisha binadamu afanye uamuzi kuhusu lini achukue udhibiti: algoriti tofauti yenye uchambuzi tofauti.

Uhakikisho: upunguzaji hadi kujifunza mtandaoni kusiko na majuto

Hii ndiyo hatua inayofanya karatasi hii kuwa vile ilivyo. Chukulia kila raundi ya DAgger kama mfano mmoja katika tatizo la kujifunza mtandaoni, ambapo hasara kwenye raundi i ni hasara mbadala chini ya usambazaji wa hali za sera iliyotumika kwenye raundi i. Mjifunzaji hujitolea kwa sera kabla ya kuona hasara hiyo, na mfuatano si tuli kwa sababu unategemea sera zilizotolewa hadi sasa.

Algoriti ni isiyo na majuto ikiwa wastani wa hasara yake juu ya raundi N unakaribia ule wa sera bora moja pekee ukiangalia nyuma. Follow-The-Leader kwenye hasara zilizo convex kwa nguvu ni algoriti kama hiyo, huku majuto ya wastani yakipungua kwa kiwango cha 1/N - na ufunzaji upya kwenye muungano mzima ni hasa Follow-The-Leader. Mjifunzaji mwingine yeyote asiye na majuto angefaa vile vile: uchambuzi ni upunguzaji, si sifa ya kiboreshaji kimoja.

Lema moja huziba pengo kati ya sera iliyochanganyika iliyokusanya data na sera iliyojifunzwa itakayotumika: Lema 4.1 inaweka kikomo cha umbali wa L1 kati ya usambazaji wao wa hali kwa 2 T beta_i. Hii ndiyo sababu beta lazima zipungue - wakati mtaalamu bado ana mamlaka kubwa ya udhibiti, hali unazokusanya si hali ambazo sera yako itazalisha. Unganisha lema hiyo na kikomo cha majuto na matokeo makuu yanafuata: baada ya takribani marudio T, baadhi ya sera katika mfuatano ina hasara mbadala chini ya usambazaji wake yenyewe ndani ya O(1/T) ya epsilon_N. Ingiza hilo kwenye kikomo cha mstari na unafika kwenye Nadharia 3.2.

Upande wa kimajaribio ni wa kawaida kwa viwango vya sasa. Katika Super Tux Kart kigezo cha msingi cha usimamizi hakikuboresha wastani wa maanguko yake kwa kila duru data zaidi zilipoongezwa, DAgger ilifikia sera isiyoanguka nje ya njia baada ya marudio kumi na tano, na SMILe baada ya ishirini bado ilikuwa ikianguka takribani mara mbili kwa kila duru. Kwenye kigezo cha maandishi ya mkono, usahihi wa herufi ulikuwa asilimia 82 bila muundo, asilimia 83.6 kwa usimamizi, asilimia 85.5 kwa DAgger. Hakuna hata moja ya haya ni matokeo ya kushughulikia vitu.

Kile ambacho uthibitisho hakiahidi

Kauli za nadharia ni za masharti, na masharti hayo ni ya msingi.

Uhakikisho wa DAgger, ukisomwa kwa makini
Kile unachopata
  • Kikomo cha mstari badala ya cha mraba kulingana na T, chini ya mawazo yaliyotajwa.
  • Sera tuli iliyobainika kikamilifu badala ya mchanganyiko wa kibahatishi.
  • Upunguzaji halisi: mjifunzaji yeyote wa mtandaoni asiye na majuto unaweza kuingizwa.
  • Idadi maalum ya marudio - takribani raundi T kabla neno la majuto halijaacha kuwa na umuhimu.
  • Uhakikisho kwa angalau sera moja katika mfuatano, ndiyo sababu ya pasi ya uthibitishaji ya mwisho.
Kile usichopata
  • Ni kuhusiana na epsilon_N, hasara bora zaidi katika darasa ukiangalia nyuma, si kuhusiana na sifuri. Ikiwa darasa lako haliwezi kuwakilisha mtaalamu, ni tupu kivitendo.
  • Inahitaji mbinu isiyo na majuto au hasara mbadala iliyo convex kwa nguvu - kali zaidi kuliko upunguzaji wa uainishaji unaojengwa juu yake, kama waandishi wanavyobainisha.
  • Kigezo u kinaweza kuwa O(T) katika hali mbaya zaidi, na kikomo cha mstari basi hurudi nyuma na kuwa cha mraba.
  • Kinaweka kikomo cha marudio, si lebo za mtaalamu. Kwenye roboti, lebo ndizo bajeti.
  • Kinadhania kuwa mtaalamu anaweza kuulizwa kwenye kila hali inayotembelewa na kujibu kwa usahihi hapo. Dhana hiyo ndiyo gharama yote.

Matokeo mengine mara nyingi yamenukuliwa kama kanusho na si hivyo. Rajaraman, Yang, Jiao na Ramachandran wanasoma mipaka ya minimax ya kujifunza kwa kuiga katika MDP za kipindi zenye nafasi ya hali yenye kikomo S na upeo H, na kuthibitisha kikomo cha chini cha upungufu wa ubora kwa kiwango cha |S| H mraba juu ya N kinachoshikilia hata pale mjifunzaji anapoweza kumuuliza mtaalamu kikamilifu kwenye hali zinazotembelewa. Hicho ni kiwango cha hali mbaya zaidi juu ya darasa la MDP kwa bajeti maalum ya kipindi, na kile kinachoondolewa ni wazo kwamba mwingiliano huboresha kiwango cha minimax; nadharia ya DAgger ni kauli tofauti, inayoweka kikomo cha sera iliyotumika kuhusiana na kile darasa lake la sera linaloweza kufikia.

Swamy, Choudhury, Bagnell na Wu baadaye waliainisha algoriti hizi kulingana na vipimo vipi vya tabia ya mtaalamu vinavyolingana, na kuanzisha dhana ya uwezo wa kurejesha vipimo inayoainisha jinsi kila familia inavyopunguza hitilafu inayolimbikizika. Tafiti za Osa na za Celemin zinashughulikia mandhari ya kialgoriti na violesura vya maoni ya kibinadamu.

Gharama: kuweka lebo kwenye hali ambazo mtaalamu hakuwahi kuzitoa

Kila kitu hapo juu kinadhania mtaalamu anayeweza kuulizwa mahali popote. Katika uigaji na mpangaji ambaye ni karibu bure - majaribio ya Mario yalitumia mpangaji aliye karibu na bora mwenye ufikiaji kamili wa hali ya mchezo. Kwa binadamu kwenye roboti ndiyo gharama kubwa zaidi, na yenye kigeugeu: binadamu anapaswa kutoa kitendo sahihi katika hali ambayo uwezo wake mwenyewe usingewahi kuunda.

Kelly, Sidrane, Driggs-Campbell na Kochenderfer wanaeleza pingamizi hilo moja kwa moja katika karatasi ya HG-DAgger. DAgger ya kawaida inahitaji mtaalamu kutoa lebo za kitendo wakati hana udhibiti kamili wa mfumo. Hili hupunguza usalama, na kwa wataalamu wa kibinadamu kuna uwezekano wa kupunguza ubora wa lebo zilizokusanywa, jambo wanaloliambatanisha na uchelewaji unaohisiwa wa vitendaji. Lebo unayoipata siyo lebo ambayo algoriti ilidhania.

Laskey na wenzake wanashambulia tatizo hilo kutoka upande mwingine kwa DART, na mtazamo wao ni wa wazi: mbinu za on-policy ni za kuchosha kwa wasimamizi wa kibinadamu, huongeza mzigo wa kikokotozi, na zinaweza kutembelea hali hatari wakati wa mafunzo. Mbadala wao huingiza kelele iliyorekebishwa katika maonyesho ya msimamizi mwenyewe, hivyo upatanisho huonyeshwa bila roboti kuwahi kuendesha sera isiyoaminika. Kwenye MuJoCo Humanoid wanaripoti DART ikipunguza zawadi jumla ya msimamizi kwa asilimia 5 wakati wa mafunzo, huku DAgger ikitekeleza sera zenye asilimia 80 pungufu ya zawadi jumla kuliko msimamizi; kwenye ushikaji katikati ya vitu vilivyosongamana na Toyota HSR, ongezeko la wastani la asilimia 62 kuliko behavior cloning.

SafeDAgger ya Zhang na Cho huchukulia maswali kwa sera rejea kama rasilimali adimu: sera tofauti ya usalama hutabiri, bila kuuliza, kama sera kuu iko karibu kupotoka kutoka kwa rejea kupita kiwango fulani, na hali hizo tu ndizo hukabidhiwa. Wote watatu wanajibu ukweli ule ule - uchambuzi wa DAgger haulipishi chochote kwa lebo za mtaalamu, na uhalisia hulipisha sana.

Sehemu ambayo hakuna anayekuonya kuihusu

Kuweka lebo kwenye hali zilizo nje ya usambazaji ni ngumu zaidi kiakili kuliko kuonyesha kazi hiyo. Onyesho la kawaida linamaanisha kutekeleza mpango wa kimwendo ambao tayari unao. Kurekebisha sera ambayo imeweka gripper mahali usingepafikia kamwe kunamaanisha kuunda upatanisho papo hapo, chini ya shinikizo la muda, huku roboti ikiwa bado inasogea. Tarajia dakika chache zinazoweza kutumika kwa kila kipindi kuliko katika kipindi cha kawaida cha kurekodi, na angalia ubora wa marekebisho yako mwenyewe ukipungua katika kipindi kimoja.

Muundo wa seti ya data ya LeRobot unaonyesha vipindi, fremu na safu za kila fremu kama zilivyohifadhiwa kwenye diski
Marekebisho huwa seti ya data tu baada ya fremu za uingiliaji kuwekwa alama - katika mfumo wa LeRobot, safu ya kila fremu kando ya uchunguzi na kitendo.

Hii inamaanisha nini kwa SO-100 iliyo mezani kwako

Badilisha upeo huo kwenda kwenye vipimo vyako mwenyewe. Kipindi cha sekunde ishirini kwa fremu 30 kwa sekunde ni hatua 600 za maamuzi, na T katika kila kikomo hapo juu ni nambari hiyo. Kwenye T = 600, tofauti kati ya neno linaloongezeka kwa T na lile linaloongezeka kwa T mraba ndiyo tofauti kati ya sera inayopona kutoka ufikiaji mbaya na ile isiyopona.

Hii ni sehemu ya sababu action chunking husaidia: wakati sera inatoa mfuatano mfupi wa vitendo kwa kila hatua ya utabiri, idadi ya vituo vya maamuzi hupungua, na hivyo hivyo idadi ya nafasi za kulimbikiza. Zhao, Kumar, Levine na Finn wanataja hitilafu inayolimbikizika kama sababu ya Action Chunking with Transformers, na kuripoti mafanikio ya asilimia 80 hadi 90 kwenye kazi sita ngumu za ulimwengu halisi, kwenye vifaa vya mikono-miwili vya gharama nafuu, kutoka maonyesho ya dakika kumi tu. Chunking haiondoi mgeuko wa usambazaji - hali bado ni za sera yenyewe - lakini hupunguza upeo halisi. Angalia action chunking na mwongozo wa kujifunza kwa kuiga wa SO-100.

Tafsiri ya pili ni kipimo cha maendeleo. Huwezi kupima epsilon chini ya usambazaji wa sera yenyewe moja kwa moja - hilo linahitaji vitendo halisi vya mtaalamu kwa kila hali inayotembelewa, kitu unachojaribu kuepuka kukizalisha. Kile ambacho mzunguko unaodhibitiwa na binadamu hukupa badala yake ni kiwango cha uingiliaji: sehemu ya fremu katika mwendesho ambapo binadamu alikuwa amechukua udhibiti. Ni kipimo mbadala, na hubadilika kwa sababu zisizohusiana na sera - opereta mwenye subira huingilia kidogo. Ikitumika kwa uthabiti, ndicho nambari moja inayosema kama raundi ilistahili muda uliotumika.

Tafsiri ya tatu ni onyo la ubora wa data ambalo uchambuzi haulishughulikii. Mandlekar na wenzake walisoma algoriti sita za kujifunza nje ya mtandao kwenye kazi tano za kuigwa na tatu za ulimwengu halisi za kushughulikia vitu za hatua nyingi, na kuripoti unyeti kwa chaguo za muundo wa kialgoriti, utegemezi kwa ubora wa maonyesho, na tofauti zinazosababishwa na kigezo cha kusimamisha. Belkhale, Cui na Sadigh wanahoji kuwa ubora wa seti ya data unapaswa kuwekwa rasmi kupitia tofauti ya vitendo na utofauti wa mabadiliko, na kubainisha kuwa utofauti wa hali si wa manufaa kila wakati. Raundi ya DAgger huongeza hali ambazo hakuna aliyezichagua kwa makusudi: baadhi ni data ya upatanisho unayohitaji, baadhi ni roboti ikipepesuka wakati unatafuta kidhibiti cha kuchukua udhibiti.

Kimfumo raundi ina hatua sita: endesha utabiri na urekodi ukiwa umewashwa, chukua udhibiti sera inapofanya vibaya, pitia mwendesho na uweke kila kipindi kwenye jalada, sawazisha marekebisho, tunga seti ya data iliyochanganyika kutoka kwa asili pamoja na marekebisho ukichagua vipindi kwa uwazi kwa kila chanzo, na endelea na mafunzo kutoka kwa checkpoint iliyotangulia badala ya mfano wa msingi. Kwenye ay-robots hatua hizo zipo kama vitufe, jambo linaloondoa kazi ya kiufundi lakini si hukumu yako. Tahadhari mbili: kuendelea kutoka kwa checkpoint huanzisha uzito upya na si kuendelea kwa kiboreshaji; na hatua ya upatanisho wa mkono-kiongozi bado inajaribiwa kidogo tu kwenye vifaa halisi. Angalia mafunzo na seti za data.

Mzunguko wa DAgger, tayari umeunganishwa

Kuchukua udhibiti wakati wa utabiri wa moja kwa moja, uwekaji alama wa uingiliaji kwa kila fremu, uwekaji wa vipindi kwenye jalada kama marekebisho au tathmini, utungaji wa seti ya data iliyochanganyika kwa uchaguzi wa wazi wa vipindi kwa kila chanzo, na kuendelea na mafunzo kutoka kwa checkpoint iliyopo - vyote vimejengwa ndani. Bado wewe ndiye unayeamua lini kuchukua udhibiti na nini cha kuhifadhi - sehemu hiyo haijiendeshi yenyewe.

Angalia jinsi mzunguko wa DAgger unavyofanya kazi

Ukoo wa mbinu, katika jedwali moja

MbinuNani anayechagua haliMtaalamu hutoa niniGharama kuu
Behavior cloningMtaalamuMaonyesho safiHakuna data ya upatanisho; hitilafu inaweza kulimbikizika kwa mraba kulingana na T
Forward trainingMjifunzaji, kwa kila hatua ya mudaLebo kwenye usambazaji uliozalishwaSera T tofauti; haifai kwa upeo mrefu
SMILe / SEARNMchanganyiko wa kibahatishi wa mtaalamu na mjifunzajiLebo kwenye usambazaji wa mchanganyiko huoSehemu za mchanganyiko hutofautiana kwa ubora
DAggerSera iliyochanganyika, beta ikipungua kuelekea sifuriKitendo sahihi kwa kila hali inayotembelewaKuweka lebo kwenye hali ambazo mtaalamu asingewahi kuzitoa, wakati hana udhibiti
DARTMtaalamu, aliyeathiriwa na kelele iliyoingizwaMaonyesho chini ya kelele iliyorekebishwaKelele lazima irekebishwe kulingana na hitilafu ya mjifunzaji
HG-DAggerMjifunzaji, hadi binadamu achukue udhibitiMarekebisho tu katika sehemu zinazodhibitiwa na binadamuInategemea uamuzi wa binadamu kuhusu wakati wa kuingilia
SafeDAggerMjifunzaji, aliyechujwa na lango la usalamaLebo tu wakati lango linapoulizaLango lenyewe lazima lifunzwe na kuaminiwa

Maswali yanayoulizwa mara kwa mara

Je, nitaona kweli ongezeko la hitilafu la kimraba kwenye roboti yangu?

Si kama mkondo safi. Kikomo hicho ni hali mbaya zaidi: kikali kwa maana kwamba tatizo fulani hufikia hicho, si kwamba lako litafikia. Unachokiona ni matokeo - sera inayopata alama nzuri kwenye fremu zilizowekwa kando, inashindwa kwenye kazi halisi, na haiboreki unaporekodi zaidi ya kitu kile kile. Ikiwa data safi zaidi zinaacha kusaidia, huo ni mgeuko wa usambazaji, si tatizo la kiasi cha data.

Je, ni lazima nitekeleze mchanganyiko wa beta ili kuiita DAgger?

Toleo lisilo na kigezo - mtaalamu kwenye raundi ya kwanza, mjifunzaji safi baadaye - ni hali maalum halali na mara nyingi ilifanya vizuri zaidi katika majaribio ya awali. Kile usichoweza kuacha ni ukusanyaji: kufunza upya kwenye marekebisho mapya zaidi tu huvunja tafsiri ya Follow-The-Leader, ambayo ndiyo chanzo cha hoja ya 'no-regret'. Kufunza kwenye marekebisho pekee ni utaratibu dhaifu zaidi.

Kwa nini kurudisha sera bora zaidi kwenye seti ya uthibitishaji badala ya ile ya mwisho?

Kwa sababu nadharia zinahakikisha sera nzuri ipo mahali fulani katika mfuatano, si kwamba ni marudio ya mwisho - kikomo hicho kiko juu ya kiwango cha chini kabisa juu ya mfuatano. Kutuma chochote kilichotoka kwenye raundi ya mwisho hutupilia mbali sharti lililotajwa la matokeo, na raundi ya mwisho si ya kuaminika kuwa bora zaidi.

Nipange raundi ngapi?

Nadharia inataka marudio kwa kiwango cha T, jambo ambalo kwa kipindi cha hatua 600 si nambari ambayo mtu yeyote huendesha kwenye vifaa halisi. Majaribio ya awali yaliendesha marudio ishirini kwenye kila kigezo. Kivitendo unaendesha raundi hadi kiwango cha uingiliaji kiache kupungua, chini sana ya idadi ambayo uchambuzi hudhania - pengo halisi kati ya nadharia na vitendo.

Je, ikiwa darasa langu la sera haliwezi kabisa kumwakilisha mtaalamu?

Basi DAgger haikuokoi, na kikomo hicho kinasema hivyo - kinaonyeshwa kuhusiana na epsilon_N, hasara bora zaidi katika darasa hilo ukiangalia nyuma. Ikiwa hiyo ni kubwa kwa sababu ya muundo mbaya, uchunguzi unaokosekana au kamera isiyoweza kuona eneo husika, ukusanyaji hukupa sera iliyo bora ndani ya darasa lisiloweza kufanya kazi hiyo. Endesha uchezaji upya wa open-loop dhidi ya vipindi vilivyowekwa kando kabla ya kukusanya marekebisho.

Wapi kuendelea kutoka hapa

Ikiwa bado hujafunza sera, nadharia hii ni mapema mno: rekodi seti ya data kwanza, ukianzia na kufunza sera yako ya kwanza na programu tumizi ya desktop. Ikiwa unawazua kati ya maonyesho safi mengine mia moja dhidi ya kuanza marekebisho: maonyesho safi hayarekebishi tatizo la usambazaji. Kwa mambo ya kiufundi, endelea na toleo linalodhibitiwa na binadamu kisha mwongozo wa SO-100.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started