
Uzvedības klonēšana pielāgo politiku eksperta stāvokļu sadalījumam un tad to izvietot patstāvīgi. Atšķirība starp šiem diviem sadalījumiem ir iemesls, kāpēc politika, kas derīgi izskatās validācijā, 300. solī nokrīt no galda. Šī ir mūsu DAgger sērijas teorijas nodaļa: kur nāk kvadrātiskais kļūdas termins, ko mainīs datu kopas agregācija, ko pieņem bez žēlības pierādījums un kādu daļu no rēķina cilvēka eksperts vēl joprojām ir jāmaksā.
Ir īpaša neveiksme, ar kuru ikkatrs, kurš trenē manipulācijas politiku, vēlāk vai agrāk satiekas. Politika sniedzas pēc kuba, nonāk divu centimetru attālumā, pauzojas, novirzās uz sāniem, tad dara kaut ko nesaistītu ar uzdevumu. Validācijas zudums bija labs. Atvērta cilpa atskaņošana pret turētajiem episodiem bija laba. Un tomēr roka beidzas pozā, kura nekur neparādās apmācības datos, un no turienes tai nav jēgas, ko pateikt.
Šai neveiksmei ir vārds un noskaidrojis teorijas gabals aiz tā. Šis ir pirmais no četriem rakstiem par DAgger, un tas aptver pašu argumentu: kāpēc politikas pielāgošana demonstratora pašu trajektorijām rada kļūdu, kas var augt ar episoda garuma kvadrātu, ko mainīs datu kopas agregācija un ko bez žēlības pierādījums nespēj solīt. Cilpa uz reālas aparatūras ir apsegta DAgger cilpas palaišana SO-100, cilvēka vārtspīlē variantu HG-DAgger un cilvēka vārtspīlē iejaukšanās, un mērīšanas jautājums DAgger cilpas mērīšana.
Īsā versija
- •Uzvedības klonēšana trenējas eksperta stāvokļu sadalījumā un tiek novērtēta politikas savā. Neatbilstība pasliktinās episodē.
- •Ross un Bagnell parādīja, ka papildu izmaksas var augt kā T kvadrātā reizes uz soļa kļūdu; DAgger papīrs to ierobežojumu un noto, ka tas ir stingrs.
- •DAgger marķē stāvokļus, kurus pati politika apmeklē, un pālikolīto uz katru datu kopu, ko līdz šim savākta, nevis tikai jaunāko.
- •Garantija ir samazinājums uz bez žēlības tiešsaistes mācību: agregēšana un pālikolīšana ir Seko vadītājam.
- •Tas notur attiecībā pret labāko zudumu, kas sasniedzams politikas klasē, nevis attiecībā uz nulli - un eksperts joprojām ir jāmarķē stāvokļi, kurus tas nekad nebūtu radījis.
Pieņēmums, ko uzvedības klonēšana klusi pieņem
Demonstrācijas datu kopa ir stāvokļu-rīcības pāru kaudze. Uzvedības klonēšana pielāgo funkciju šai kauzei ar parasto uzraudzītu mācību un apstājas tur. Tas ir vecākais idejas lauks. Pomerleau ALVINN, 1988. gadā, bija trīs slāņu atpakaļpropagācijas tīkls, kas paņēma attēlus no kameras un lāzera diapazona meklētāja un radīja virzienu, kurā transportlīdzeklis būtu jābrauc; tas tika trenēts simulētos ceļu attēlos un sekoja reāliem ceļiem dažos lauka apstākļos. Recepšu nav daudz mainījies; tīkli ir.
Kas tiek izlaists, ir pārbaude par to, kur šie pāri nāca. Katrs no tiem atrodas trajektorijā, ko demonstrators radīja. Politika, ko jūs esat izvietojis, rada savu. Brīdī, kad tas novirzās, tas tiek jautāts par stāvokļiem, kuri nebija apmācības sadalījumā, un tā atbilde to pārvieto tālāk. Ross, Gordons un Bagnell atvērt DAgger papīru ar tieši to: secīgā paredzēšana pārkāpj i.i.d. pieņēmumu zem statistikas mācību, jo learner pašu prognozēšana nosaka ieejus, kurus tas nāk tālāk.
Skaidrākais ilustrācija šajā papīrā nav robots vispār. Klonējot tuvu optimālu plānotāju Super Mario Bros. radīja politiku, kas atkārtoti ieslēdzās šķērsli nevis lēcot to. Iemesls ir viss arguments vienā teikumā: eksperts vienmēr lēca no ērta attāluma, tāpēc datu kopa nesaturēja stāvokļa, kurā Mario bija piesvītrots pret šķērsli, un tāpēc bez etiķetes par to, ko darīt, kad viņš bija.
Nomainiet Mario SO-100 roka un struktūra ir identiska. Jūsu demonstrācijas parāda tīru pieeju un tīru sagrābt, nevis gripi tuvo divas centimetru - tāpēc politikai nav idejas, ko darīt no turienes, un neatkarīgi no tā, ko tas minējums to pārvieto tālāk. Kovariāta nobīde ir rīpojums datu savākšanas procedūra, nevis tīkla arhitektūra.
Kur nāk kvadrātiskais termins
2010. gada AISTATS papīrs Rosss un Bagnell, Efektīvi imitācijas mācību samazinājumi, padarīs saliktie precīzi. Ļaujiet T būt uzdevuma horizontu, pieņemiet, ka uzdevuma izmaksas ir ierobežotas vienības intervālā un ļaujiet epsilon būt aizstāvniecības zudumam, ko mēra eksperta stāvokļu sadalījuma - numurs, ko validācijas komplekts ziņo. Tad papildu izmaksas, kad šo politiku palaist T soļi, salīdzinājumā ar ekspertu, ir ierobežoti T kvadrātā reizes epsilon. Ross, Gordons un Bagnell pārstāv to kā Teorēmu 2.1 DAgger papīrā un pievieno teikumu, kas svarīgs: ierobežojums ir stingrs. Problēmas pastāv, kur politika ar epsilon zudumu eksperta sadalījuma saskaņā ar papildu izmaksas audzēšanu kvadrātiski T.
Stingrs nenozīmē tipiski. Kvadrātiskais termins ir sliktākais gadījums problēmu klases dēļ, nevis paredzējums par jūsu izvēlēto un izvietošanas uzdevumu. Tas, ko tas nosaka, ir tas, ka vairāk eksperta demonstrācija nevar noņemt problēmu: tas tikai asina epsilon novērtējumu uz sadalījuma, uz kura politiku netiks pārbaudīts.
Evakuācijas maršruts ir tajā pašā papīrā, pārstāvēts kā Teorēmu 2.2. Ja politika sasniedz zudumu epsilon zem tā paša stāvokļu sadalījuma, un viena nepareiza darbība maksā ne vairāk kā u izmaksās līdz alternatīvai ekspertam, papildu izmaksas ir ierobežoti u reizes T reizes epsilon - lineāri horizontā. Konstante u ir interesantais daudzums: ne vairāk kā 1 par 0-1 domstarpībām ar ekspertu un O(1), kad eksperts var atgūties dažu soļu laikā. Sliktākajā gadījumā tas ir O(T) un lineārais ierobežojums tad nav labāks par kvadrātiskiem.
| Iestatīšana | Pieņemšanas robeža uz papildu izmaksām pār ekspertu | Ko tas atbilsta |
|---|---|---|
| Uzvedības klonēšana (Ross & Bagnell 2010, pārstāvēta kā Thm. 2.1 Ross et al. 2011) | T kvadrātā reizes epsilon | epsilon mērīts eksperta stāvokļu sadalījumā; izmaksas [0,1]; ierobežojums ir stingrs |
| Jebkura politika ar epsilon zudumu zem tā paša sadalījuma (Thm. 2.2) | u reizes T reizes epsilon | u ierobežo vienas nepareizas darbības izmaksas līdz alternatīvai; ne vairāk kā 1 par 0-1 zudumu, O(T) sliktākais gadījums |
| Priekšu apmācība (Ross & Bagnell 2010) | u reizes T reizes epsilon | viena politika par laika soli; vajag T politikas un zināmu, galīgu T |
| SMILe (Ross & Bagnell 2010) | tuvu-lineāri T un epsilon dažas problēmu klasēs | alfa O(1/T kvadrātā), N O(T kvadrātā log T); dod stohastiskas maisījuma |
| DAgger (Thm. 3.2, Ross et al. 2011) | u reizes T reizes epsilon_N, plus O(1) | N aptuveni uT; stingri izliekts ierobežots zudums; bez žēlības learner; epsilon_N ir labākais zudums retrospektīvi |

Divas mēģinājumi, kas nāca pirms DAgger
Priekšu apmācības ir godīga, bet nepraktiska atbilde. Trenējiet atsevišķu politiku katram laika soļa, kārtībā, katrai uz stāvokļu sadalījuma, ko inducētu politikas jau fiksēti agrīnajiem soļiem, tāpēc katra politika redz tieši sadalījuma, kas tas saskaras. Problēma ir aprakstā: T politikas, trenētas secīgi, bez agrīnas apstāšanās. Par manipulāciju episods 30 kadrus sekundē, T ir simtos.
SMILe, no tā paša papīra, un SEARN, no Daume, Langford un Marcu darba par strukturētu prognozēšanu, paņemiet otru maršrutu: viens stacionārs politika, bet stohastisks. Katru iterāciju trenē komponentu un pievienošana maisījuma, maiņu varbūtību masas prom no eksperta. Rezultāts ir maisījums, kurā daži komponenti ir sliktāki nekā citi - uz fiziska rokas, kontrolieris, kas var paraugu ļaunā komponenta vidus kustībā. Tas ir norādīts motivācija, lai vēlētos stacionāru noteiktā politika tā vietā.
DAgger: viena idejas, viena kaste
Datu kopas agregācija uztur noteikto politiku un pārvieto taisīt datu savākšanā. Katra raunda: rullī pašreizējais politika, ierakstu stāvokļi, ko tas apmeklē, jautā ekspertam, kas būtu pareizā darbība katrā, pievienot tos pārus pie datu kopas, kas jums jau ir, pālikolīto par savienojuma. Vārds ir algoritms - jūs agregāt, jūs nekad neizvēršana.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setTrīs detaļas nēsā vairāk svara nekā viņi izskatās. Etiķetes ir stāvokļiem, ko apmeklēja jauktā politika, bet darbības nāk no eksperta - politika sniedz jautājumus, eksperts atbildes. Pālikolīšana ir uz visas apkopojuma, kas padara katra raunda seko-vadītāja soļa: n raundā jūs izvēlieties labāko politiku retrospektīvi par katru trajektoriju līdz šim. Tā ietvars ir tas, kas pierādījums karājas uz. Un algoritms beidzas, atgriežot labāko politiku secībā, kā izvēlēts uz validācijas komplekta, jo teorēmu garantijas dažas politika secībā ir laba, nevis ka pēdējā ir.
Beta grafiks, un kāpēc tas nav tuning pogas
Jauktā politika ir beta_i reizes eksperts plus viens mīnus beta_i reizes learner. Punkts ir praktisks: pirmie daži uzzinātos politikas trenētas uz ļoti maz dati, padarīt daudz kļūdu, un pretējā gadījumā pavadītu rollout stāvokļos, kas kļūst neatbilstoši, tikai politika uzlabojas.
Teorija uzspiež tieši viens nosacījums: skrejošā vidējā beta jāiet uz nulli. Analīze darbi ar beta_i ierobežots ar (1 - alfa) uz jaudu i-1, konstante alfa neatkarīgs no T.
| Grafiks | Ko tas dara | Ko papīrs ziņo |
|---|---|---|
| beta_1 = 1 | Pirmā raunda ir tīrs eksperta demonstrācija; bez sākotnējās politikas nepieciešams | Ieteiktais sākuma punkts katrā variantā |
| beta_i = 1, ja i = 1, cits 0 | Eksperts tikai pirmajā raundā; bez brīva parametra | Papīra bezparametra versija, kas viņu saka bieži uzrāda labāk praksi; 2980 Super Mario Bros. pēc 20 iterācijas |
| beta_i = p^(i-1) ar p = 0.5 | Eksperta varbūtība sabrūk ģeometriski | 3030 tas pats benchmark, nedaudz priekšā bez parametra versijas |
| beta_i = p^(i-1) ar p = 0.9 | Eksperts paliek cilpā daudz ilgāk | Ievērojami lēnāka konverģence; joprojām uzlabojas, kad 20 iterācijas beigās |
Atšķirība starp 2980 un 3030 uz skalas, kas darbojas līdz aptuveni 4300, ir maza, bet papīra skaidrojums par to ir visnoderīgākā praktiskā piezīme šajā sadaļā. Ar bezparametra grafiku, Mario ieslēdzās tajā pašā vietā agri un radīja masu tuvu duplikātu dati no tā viena vieta; ļaujot ekspertam braukt frakcija no laika gan unstuck viņu un paplašinātas dažādu stāvokļu. Grafiks ir mazāk par sajaukšanas koeficientu nekā vai jūsu datu savākšanas turpina radīja jaunos stāvokļus vai tā paša neveiksmes.
Stohastisks uz-laika-soli maisījums nozīmē vadības iestādes pārsūtīšanu pa vadības ātrumu, 30 reizes sekundē uz tipisku SO-100 kursu. Nav teleoperation saskarne padara to draudzīgs vai nozīmīgs. Uz reālā aparatūra beta grafiks dod uz cilvēka lēmumu par kad pārsūtīšanas vadības: atšķirīgs algoritms ar atšķirīgu analīzi.
Garantija: samazinājums uz bez žēlības tiešsaistes mācību
Šeit ir solis, kas padara papīru, ko tas ir. Ārstēt katru DAgger raunds kā vienu piemērs tiešsaistes mācību problēmu, kur zaudējums i raundā ir aizstāvniecības zudums zem stāvokļu sadalījuma politikas izmanto i raundā. Mācību apstiprinājies politiku pirms redzējums, ka zaudējums, un secība ir ne-stacionāra, jo tas ir atkarīgs no politikas radīti līdz šim.
Algoritms ir bez žēlības, ja vidējais zaudējums viņu N raundi tuvi labākais viens politika retrospektīvi. Seko-vadītājs uz stingri izliekts zaudējums ir tāds algoritms, ar vidējā žēlības sarukuma uz sakārtu 1/N - un pālikolīšana uz pilnā apkopojums ir tieši seko-vadītājs. Jebkuri citi bez žēlības learner būtu kalpot: analīze ir samazinājums, nevis īpašums vienu optimiser.
Viena lemma tilts priekšā starp jaukto politiku, kas savākta dati un uzzinātos politiku, kas būs izvietots: Lemma 4.1 ierobežo L1 attālu starp viņu stāvokļu sadalījumu ar 2 T beta_i. Tas ir kāpēc beta jāju - kamēr eksperts vēl satur pieņemams vadības iestādi, stāvokļi savākt ir ne stāvokļu politiku radīs. Kombinēt lemma ar žēlības ierobežojums un galvenais rezultāts seko: pēc aptuveni T iterācijas, dažas politika secībā ir aizstāvniecības zudums zem tā paša sadalījuma izlaika O(1/T) epsilon_N. Barošanu, ka lineāro ierobežojums un jūs land uz Teorēmu 3.2.
Empīriskā puse ir nedaudz pēc pašreizējā standarta. Super Tux Kart pārraudzīta bāzlīnija nekur uzlabot vidējo kritumus par apļa kā vairāk dati tika, DAgger sasniedza politiku, kas nekad nedrīfa pēc piecpadsmit iterācijas un SMILe pēc divdesmit joprojām krīta aptuveni divas reizes apļa. Par rokraksta benchmark, rakstzīme precizitāte ran 82 procenti bez struktūras, 83.6 procenti pārraudzīta, 85.5 procenti ar DAgger. Neviens no šīm ir manipulāciju rezultātu.
Ko pierādījums nedara solīt
Teorēmu paziņojumi ir nosacīti, un nosacījumi ir slogumujoši.
- Lineārs nevis kvadrāts ierobežojums T, pēc norādītajiem pieņēmumiem.
- Stacionārs noteiktā politika, nevis stohastisks maisījums.
- Genuine samazinājums: jebkuri bez žēlības tiešsaistes learner vietas.
- Konkrēts iterāciju skaits - aptuveni T raundi pirms žēlības termins apstājas nozīmes.
- Garantija vismaz viena politika secībā, tāpēc slēgšanas validācijas pārlaide.
- Tas ir attiecībā pret epsilon_N, labākais zudums klasē retrospektīvi, ne attiecībā uz nulli. Ja jūsu klase nevar reprezentēt ekspertu, tas ir tukšs prakti.
- Tas vajag bez žēlības metodi vai stingri izliekts aizstāvniecības zaudējumi - stiprāka nekā klasifikācija samazinājumi tas pamatne par, kā autori atzīmēt.
- Konstante u var būt O(T) sliktākais gadījums, un lineārs ierobežojums tad sabrūk atpakaļ uz kvadrāts.
- Tas ierobežo iterācijas, nevis eksperta etiķetes. Uz robota, etiķetes ir budžets.
- Tas pieņem eksperts var būt jautāts uz katra apmeklēti stāvokļa un atbildes pareizi tur. Tas pieņēmums ir visa izmaksas.
Viens cits rezultāts ir bieži citēts kā refutācija un nav vienas. Rajaraman, Yang, Jiao un Ramachandran pētīr minimax robežas imitācijas mācību episodā MDPs ar galīgu stāvokli vieta S un horizontu H, un pierāda suboptimality apakšējo savu uz sakārtu |S| H kvadrātā viņu N, pat kad mācību var aktīvi jautāt ekspertam uz apmeklēti stāvokļi. Tas ir sliktākais gadījums likme pār klasi MDPs pie fiksēti episods budžets, un ko tas izslēdz, ir idejas, ka interakcija uzlabo minimax likme; DAgger teorēmu ir atšķirīgs paziņojums, starp ierobežojumi izvietota politiku attiecībā uz to, ko tas pats politika klase var sasniegt.
Swamy, Choudhury, Bagnell un Wu vēlāk klasificēti šie algoritmi pēc kuriem brīži eksperta viņu atbilstoši, un ieviests jēdziens brīdi atguvumiem, kas deleimit, cik labi katra ģimene ierobežo saliktie kļūdu. Apkopojums ar Osa un ar Celemin segt algoritmiski ainava un cilvēka-feedback saskarnes.
Rēķins: etiķetēšanas stāvokļi eksperts nekad radīti
Viss iepriekš pieņem ekspertu, kas var būt jautāts jebkur. Simulācijā ar plānotāju, kas ir tuvu bez maksas - Mario eksperimenti izmantoja tuvu optimālu plānotāju ar pilnīgu piekļuvi spēles stāvokļa. Ar cilvēka uz robota tas ir dominējošais izmaksas, un dīvaini vienas: cilvēks ir jāizraisa pareizo darbību konfigurāciju viņu pašu kompetenču nekad bija radījis.
Kelly, Sidrane, Driggs-Campbell un Kochenderfer stāvoklis keļļīgs tieši HG-DAgger papīra. Vanila DAgger pieprasa ekspertam sniegtu darbības etiķetes, turklāt nebūtu pilnībā vadības sistēmu. Tas samazina drošību, un ar cilvēka ekspertiem tas ir iespējams, lai pasliktinātu savāktā marķējuma kvalitāte, kuru viņi noņem līdz vērtējums aktuators aizkave. Marķējums, ko jūs saņemat atpakaļ ir ne marķējums algoritms pieņem.
Laskey un kolēģi uzbrukumu problēmu no otras puses ar DART, un to ietvars ir tiešs: uz politiku paņēmieni ir garlaicīga par cilvēka vadības, pievienot skaitļošanas slogu, un var vizītēt bīstamus stāvokļus apmācību. Viņu alternatīva injicē kalibrēta trokšņa vadības pašu demonstrācija, tāpēc atgūšanās saņem parādīti, bez robota kādreiz skrējis neuzticiemais politiku. Par MuJoCo Humanoid viņi ziņo DART samazinājums vadības kumulatīvā atlīdzība par 5 procenti apmācību, kamēr DAgger izpilda politikas ar 80 procenti mazāk kumulatīvā atlīdzība nekā vadības; par grābtuvējamās priekšmetu ar Toyota HSR, vidēji 62 procenti pieaugums viņu uzvedības klonēšanas.
Zhang un Cho SafeDAgger uztver jautājumus uz atsauci politika kā dārgā resursa: atsevišķa drošības politika prognozēti, bez jautājuma, vai galvenais politika ir tuvojās novirzās no atsauci viņu ierobežojums, un tikai tos stāvokļus nodoti. Visi trīs reaģēt uz tā paša fakts - DAgger analīze maksas neko eksperta etiķetes, un realitātes maksas lielu skaitu.
Etiķetēšana no-izplatības stāvokļi ir garīgi grūtāk nekā demonstrējot uzdevuma. Normāls demonstrācija nozīmē izpilda motora plānu jums jau ir. Koriģējot politiku, kā ir likts gripu jūs nekad neizbaudītu nozīmē konstruējot atgūšanu uz vietu, zem laika spiediena, ar robota vēl kustīga. Ceriet mazāk izmantojams minūtes par sesiju nekā vienkāršu ierakstīšanu sesiju, un skatīties savu korekciju kvalitāte pasliktinātu vēl viens kursam vienas.

Ko tas nozīmē SO-100 uz savu galds
Tulkot horizonts jūsu paši vienības. Divdesmit sekund episods uz 30 kadrus sekundē ir 600 lēmuma soļi, un T katrā ierobežojums ir tas skaitlis. Pie T = 600, atšķirība starp izteiksmi skalošanu ar T un viena skalošanu ar T kvadrātā ir atšķirība starp politiku, kas atkopjas no sliktā pieejot un viena, kas nav.
Tas ir daļa iemesla kāpēc darbības chunking palīdz: kad politika emitē īsa secību darbības per secinājums soļa, numurs lēmuma punkti krīt, un tāpēc arī numurs iespējas uz savienojuma. Zhao, Kumar, Levine un Finn vārds saliktie kļūdu kā motivācija par Darbības Chunking ar Transformeriem, un ziņu 80 uz 90 procenti panākumu uz sešu grūti reālie pasaules uzdevumi, uz zemā izmaksu bimanual aparatūra, no desmit minūtes vērts demonstrācija. Chunking nedara noņemt kovariāta nobīde - stāvokļi ir vēl politikas pašas - bet tas īsina efektīvo horizonts. Skat darbības chunking un SO-100 imitācijas mācību ceļvedis.
Otrais tulkošanu ir progresa metriku. Jūs nevar mērīt epsilon zem politikas paša sadalījuma tieši - tas ir nepieciešams zemes patiesums eksperta darbības uz katra apmeklēti stāvokļa, lieta jūs mēģināt izvairīties no produkcija. Ko cilvēka vārtspīlē cilpa dod jums tā vietā ir iejaukšanās likmi: daļu no kadru akmeni līdz lapas cilvēks bija pārsūtīšanas vadības. Tas ir naxys, un tas kustās iemeslu nesaistītu uz politiku - pacients operators iejaucas mazāk. Piemērot konsekventi, tas ir viens skaitlis, kas saka, vai raunds bija vērts par pēcpusdienu.
Trešais tulkošanu ir datu-kvalitāte brīdinājums analīze neklāj. Mandlekar un kolēģi pētīja sešas bezsaistes mācību algoritmi uz piecu simulēta un trīs reālo pasauli daudz-stadiju manipulācija uzdevumi, un ziņu jutību uz algoritmiski dizains izvēles, atkarību uz demonstrācija kvalitāte, un mainīgums izraisīts ar apturēšanas kritēriju. Belkhale, Cui un Sadigh apgalvo, ka datu kopas kvalitāte jāformalizēts caur darbības divergencēšanu un pārejas daudzveidību, un ņem vērā, ka valsts daudzveidību ir ne vienmēr labvēlīga. DAgger raunds pievieno stāvokļus neviens izvēlēti apzināti: daži ir atgūšanu dati jums ir nepieciešams, daži robota svārstās, kamēr jūs nofumbles par takeover vadības.
Mehāniski raunds ir sešas darbības: palaist secinājums ar ierakstīšanu uz, pārsūtīšanas vadības politika neparīpojošanas, pārskatīt akmeni un failu katra episods, sinhronizēšanas korekcijas, komponuves jaukta datu kopas no oriģinālajiem pluss korekcijas ar episods atlase, kas izdarīta skaidri uz avots, un turpinājumā apmācības no iepriekšējās checkpoint nevis bāzes modeli. Par ay-robots šīs darbības pastāvēt kā pogas, kas noņem cauruļvadi, bet ne spriestspēj. Divi brīdinājumi: turpinājumā no checkpoint sākas svarus un nav optimizers atjauno, un vadītāja-roka izlīdzināšana pārvietošanās ir vēl viegli pārbaudīts uz aparatūra. Skat apmācības un datu kopas.
DAgger cilpa, jau vadu uz
Takeover līdz dzīvu secinājums palaist, per-kadrs iejaukšanās marķējums, filing episods kā korekcijas vai evaluācijas, komponējošos jauktu datu kopas ar skaidru episods atlase uz avots, un turpinājumu apmācības no esošā checkpoint ir visas paradas. Jūs joprojām lemt, kad pārsūtīšanas vadības un ko paturēt - tas daļu ne automates.
Skat, kā DAgger cilpa darbiĢimenes koka, vienas tabulas
| Metode | Kas izvēlas stāvokļus | Ko eksperts sniedz | Galvenie izmaksas |
|---|---|---|---|
| Uzvedības klonēšana | Eksperts | Tīrs demonstrācija | Neviens atgūšanu dati; kļūdu var savienojuma kvadrātiski T |
| Priekšu apmācības | Mācību, uz laika-soli | Marķējumi gar inducētu sadalījums | T atsevišķi politikas; unusable gara horizonts |
| SMILe / SEARN | Stohastisks maisījums eksperts un mācību | Marķējumi gar maisījuma sadalījums | Komponenti maisījuma atšķirties kvalitāte |
| DAgger | Jauktā politika, beta pasliktināts uz nulli | Pareizu darbību par katru apmeklēti valsts | Etiķetēšanas stāvokļi eksperts nekad radīti, turklāt ne kontrolu |
| DART | Eksperts, graut injicēts trokšņa | Demonstrācija zem kalibrēta trokšņa | Trokšņa jākalibriē uz mācību kļūdu |
| HG-DAgger | Mācību, līdz cilvēka pārsūtīšanas vadības | Korekcijas tikai cilvēka vārtspīlē segmenti | Atkarību uz cilvēka spriestspēj par kad iejaucas |
| SafeDAgger | Mācību, filtrēti drošības vārti | Marķējumi tikai, kad vārti prasa | Vārti paši jāapmāca un uzticību |
Bieži jautājumi
Vai es faktiski novērot kvadrāts kļūdu augšanu uz manu robota?▾
Ne kā tīrs līkne. Ierobežojums ir sliktākais gadījums: stingrs, ka daži problēmu sasniedz to, ne tas jūsu būtu. Ko jūs redzat ir sekas - politiku punkti skaits uz turētajiem kadru, neizdodas uz reālās uzdevuma, un nedara uzlabot, kad jūs ierakstu vēl viens tā paša. Ja vairāk tīrs dati apstājas palīdz, tas ir kovariāta nobīde, nevis datu-skaitu problēmu.
Vai es ir jāīsteno beta maisījuma, lai to izsaukt DAgger?▾
Bez parametra versijas - eksperts pirmajā raundā, tīrs mācību pēc tam - ir likumīgiem speciāls gadījums un bieži palaist labākais oriģināls eksperimenti. Ko jūs nevar nometne ir apkopojums: retraining tikai uz jaunākās korekcijas pauzes sekošanā-vadītāja tulkošanu, kas ir kur nav žēlības arguments nāk. Apmācības tikai uz korekcijas vien ir daudz vājāks procedūru.
Kāpēc atgriez labāko politiku uz validācijas komplekts nevis vēlā vienas?▾
Jo teorēmu garantijas labais politiku pastāvēs kaut kur secībā, ne tas tas ir finālā atkārtots - ierobežojums ir uz minimums pār secībā. Piegādi neatkarīgi no tā, ko nāk no viņu pēdējās raund apmet norādīts nosacījums rezultāts, un vēlā raunds nav uzticami labāks.
Cik daudz raundi es plānu?▾
Teorija grib iterāciju uz sakārtu T, kas par 600 solis episods nav skaitlis ikviens gaida uz aparatūra. Oriģināls eksperimenti gaita divdesmit iterācijas uz ikviena benchmark. Praksē jūs gaita raundi līdz iejaukšanās likmi apstājas krīt, daudz zem skaits analīze pieņem - reāls priekšstats starp teoriju un praksi.
Ko, ja manu politika klase vienkārši nevar attēlot ekspertu?▾
Tad DAgger nedara glābt jums, un ierobežojums saka tā - tas ir izteikta attiecībā uz epsilon_N, labākais zudums klasē retrospektīvi. Ja tas ir liels, jo nepareizu arhitektūru, trūkst stāvokļu vai kamera, kas nevar redzēt skaņ, apkopojums dod jums politiku, kas ir optimāla par klasi, kas nevar darīt uzdevuma. Gaita atvērta cilpa atskaņošanā pret turētajiem episodiem pirms jūs savākt korekcijas.
Kur iet no šejienes
Ja jūs nav trenējis politiku vēl, šo teoriju ir priekšlaicīgi: ierakstu datu kopas vispirms, sākot no apmācības jūsu pirmā politika un galda klients. Ja jūs svērž cita simts tīri demonstrācija pret sākot korekcijas: tīri demonstrācija nedara uzlabot sadalījuma problēmu. Par mehāniku, turpinājums ar cilvēka vārtspīlē variant un tad SO-100 pastaiga pa.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started