
Behavior cloning ले विशेषज्ञको अवस्था वितरणमा एक नीति फिट गर्छ र त्यसपछी यसलाई आफ्नै रूपमा तैनाथ गरिन्छ। ती दुई वितरणहरू बीचको अन्तराल यो हो कि किन एक नीति जो सत्यापनमा ठीक देखिन्छ, चरण 300 मा टेबलबाट खस्छ। यो हाम्रो DAgger श्रृङ्खलाको सिद्धान्त अध्याय हो: जहाँ द्विघाती त्रुटि शब्द आउँछ, डेटासेट एकीकरणले के परिवर्तन गर्छ, कस्तो कोई-खेद प्रमाणले मान्यता दिन्छ, र मानव विशेषज्ञ अझै पनि कुन भाग भुक्तानी गर्न हुँदै छ।
त्यहाँ एक विशेष विफलता छ जो हरेक प्रबन्धन नीति प्रशिक्षण गर्ने व्यक्तिले कहिले न कहिले भेट्छ। नीति घनको लागि पहुँच गर्छ, दुई सेन्टिमिटर भित्र आउँछ, झिझक्छ, छेउमा विचलित हुन्छ, त्यसपछी कार्यसँग सम्बन्धित गर्दैन। सत्यापन हानि ठीक थियो। होल्ड-आउट एपिसोडहरू विरुद्ध खुला-लुप रिप्ले ठीक थियो। र अझै पनि बाह्य अवस्थामा समाप्त हुन्छ जो प्रशिक्षण डेटामा कहीँ देखिँदैन, र वहाँबाट यसको कुनै बुद्धिमान कुरा छैन।
यो विफलताको एक नाम र यसको पछाडी एक सम्पन्न सिद्धान्त छ। यो चार लेखहरूमा DAgger को पहिलो हो DAgger, र यसले तर्क आफैलाई कभर गर्छ: किन प्रदर्शकको आफ्नै ट्र्याजेक्टोरीहरूमा एक नीति फिट गर्नु एक त्रुटि उत्पन्न गर्छ जो एपिसोड लम्बाइको वर्गसँग बढ्न सक्छ, डेटासेट एकीकरणले के परिवर्तन गर्छ, र कस्तो कोई-खेद प्रमाण वास्तविक हार्डवेयरमा DAgger लुप चलाइरहेको हरेक वस्तु कभर गर्दैन। SO-100 मा एक DAgger लुप चलाइरहेको, मानव-गेटेड भेरियन्ट HG-DAgger र मानव-गेटेड अवरोधहरू, र मापन प्रश्न DAgger लुप मापन गरिरहेको।
छोटो संस्करण
- •Behavior cloning विशेषज्ञको अवस्था वितरणमा प्रशिक्षण दिन्छ र नीतिको आफ्नैमा मूल्यांकन गरिन्छ। बेमेलमा एपिसोडमा वर्धित हुन्छ।
- •Ross र Bagnell ले दिखाए कि अतिरिक्त लागत T वर्गको समय प्रति-चरण त्रुटि वर्तमान बढ्न सक्छ; DAgger कागजले यो बाउन्ड पुन:बयान गर्छ र नोट गर्छ कि यो कड़ा छ।
- •DAgger ले अवस्थाहरु लेबल गर्छ जो नीति आफैले भ्रमण गर्छ, र सबै डेटासेट एकत्रीकृत मा retrains गर्छ, केवल सबैभन्दा नयाँ होइन।
- •गारान्टी कोई-खेद अनलाइन शिक्षामा एक कमी हो: एकीकृत र retraining Follow-The-Leader हो।
- •यो नीति वर्गमा प्राप्य सबैभन्दा राम्रो हानिको सापेक्षमा राखिन्छ, शून्यको सापेक्षमा होइन - र विशेषज्ञ अझै पनि अवस्थालाई लेबल गर्न हुँदै छ जो यसले कहिले उत्पादन गरे नथे।
Behavior cloning शान्तै मान्यता दिने धारणा
एक प्रदर्शन डेटासेट अवलोकन-कार्य जोडीको एक थुप हो। Behavior cloning यो थुपमा एक कार्य फिट गर्छ साधारण पर्यवेक्षित शिक्षा र त्यहीं रोक्छ। यो क्षेत्रमा सबैभन्दा पुरानो विचार हो। Pomerleau को ALVINN, 1988 मा, एक तीन-तह पश्चप्रसार नेटवर्क थियो जसले क्यामेराबाट छविहरु र लेजर दायरा फाइन्डर लिएको र गाडीले यात्रा गर्नुपर्ने दिशा उत्पादन गर्यो; यो सिमुलेट गरिएका सडक छविहरुमा प्रशिक्षण दिइएको थियो र केहि क्षेत्र अवस्थामा वास्तविक सडकहरु पछ्याएको थियो। नुस्खा धेरै परिवर्तन भएको छैन; नेटवर्कहरु भेको छन्।
जो छोडिएको छ त्यो एक जाँच हो कि ती जोडीहरु कहाँबाट आए। तिनीहरुमा प्रत्येक एक प्रदर्शकले उत्पादन गरेको ट्र्याजेक्टोरीमा राखिन्छ। तपाईले तैनाथ गर्ने नीति आफ्नै उत्पादन गर्छ। मुहूर्त यो विचलित हुन्छ, यो अवस्थाहरु बारे सोधिएको छ जो प्रशिक्षण वितरणमा थिएनन्, र यसको उत्तर यसलाई अझै पढ छ। Ross, Gordon र Bagnell DAgger कागजलाई सटीक रूपमा खोल्छन्: क्रमिक भविष्यवाणी i.i.d. धारणा अधीन सांख्यिकीय शिक्षा को उल्लङ्घन गर्छ, किनकि शिक्षार्थी को आफ्नै भविष्यवाणीहरु इनपुट निर्धारण गर्छ यो अगल देख्छ।
यो कागजमा सबैभन्दा स्पष्ट चित्र एक रोबोट सबै होइन। Super Mario Bros को नजिक-इष्टतम योजनाकार क्लोनिङ गर्नु एक नीति उत्पादन गर्यो जो बारबार एक अवरोध विरुद्ध फँस्यो र यो जम्प गर्नुको सट्टा। कारण सम्पूर्ण तर्क एक वाक्यमा: विशेषज्ञ सधैं एक आरामदायक दूरीबाट जम्प गर्यो, त्यसैले डेटासेटमा कुनै अवस्था थिएन जसमा Mario एक अवरोध विरुद्ध दबिएको थियो, र यसैले अवरोध विरुद्ध दबिएको पछि के गर्ने कोनो लेबल थिएनन्।
Mario को सट्टा एक SO-100 बाह्य र संरचना एकै छ। तपाईको प्रदर्शनहरु एक सफा दृष्टिकोण र सफा पकड दिखाउँछन्, दो सेन्टिमिटर कम् को ग्रिपर बन्द होइन - त्यसैले नीतिको वहाँबाट के गर्ने कुनो विचार छैन, र जो कुनै अनुमान गर्छ यसलाई अझै पढ छ। Covariate shift एक सम्पत्ति हो डेटा संग्रह प्रक्रिया, नेटवर्क आर्किटेक्चर होइन।
जहाँ द्विघाती शब्द आउँछ
Ross र Bagnell द्वारा 2010 AISTATS कागज, Efficient Reductions for Imitation Learning, compounding सटीक गर्छ। T लाई कार्य दिगोता होन दिन, कार्य लागत एकाइ अन्तराल मा बाउन्ड होन दिन, र epsilon विशेषज्ञ को अवस्था वितरणमा मापन गरिएको surrogate हानि होन दिन - संख्या तपाईको सत्यापन सेट रिपोर्ट गर्छ। त्यसपछी यो नीति T चरणहरु को लागि चलाइरहेको अतिरिक्त लागत, विशेषज्ञको सापेक्षमा, T वर्ग गुणा epsilon द्वारा बाउन्ड गरिएको छ। Ross, Gordon र Bagnell यसलाई DAgger कागजमा प्रमेय 2.1 को रूपमा पुन:बयान गर्छन् र वाक्य जो महत्वपूर्ण छ थप्छन्: बाउन्ड कड़ा छ। समस्याहरु अस्तित्वमा छन् जहाँ विशेषज्ञको वितरणमा epsilon हानि भएको नीति वास्तवमा अतिरिक्त लागत द्विघाती रूपमा T मा वर्धित हुन्छ।कड़ा विशिष्ट मतलब होइन। द्विघाती शब्द समस्याहरु को एक वर्ग मा एक सबैभन्दा खराब केस हो, तपाईको पिक-र-स्थान कार्य को बारे एक भविष्यवाणी होइन। यो स्थापित गर्छ कि थप विशेषज्ञ प्रदर्शन समस्या हटाए पार्न सकदैन: यो सटीकता को केवल शार्प गर्छ epsilon एक वितरण मा नीति परीक्षा गरिने छैन।
पलायन मार्ग एकै कागजमा छ, प्रमेय 2.2 को रूपमा पुन:बयान गरिएको। यदि एक नीति हानि epsilon अर्जन गर्छ
आफ्नै अवस्था वितरणमा, र एक गलत कार्य विशेषज्ञ अधीन लागत-देखभाल मा अधिकतम u लागत गर्छ, अतिरिक्त लागत u गुणा T गुणा epsilon द्वारा बाउन्ड गरिएको छ - दिगोताको सापेक्षमा रैखिक। स्थिरांक u दिलचस्प मात्रा हो: विशेषज्ञको साथ 0-1 असहमति को लागि अधिकतम 1, र विशेषज्ञ केहि चरण भित्र पुनः प्राप्त गर्न सक्न जहाँ O(1)। सबैभन्दा खराब केस मा यो O(T) छ, र रैखिक बाउन्ड त्यसपछी द्विघाती भन्दा कोनो बेहतर छैन।सेटिङ्
| विशेषज्ञ मा अतिरिक्त लागत को बाउन्ड | यो के मा रहन्छ | Behavior cloning (Ross & Bagnell 2010, प्रमेय 2.1 को रूपमा पुन:बयान गरिएको Ross et al. 2011 मा) |
|---|---|---|
| T वर्ग गुणा epsilon | epsilon विशेषज्ञको अवस्था वितरणमा मापन गरिएको; [0,1] मा लागत; बाउन्ड कड़ा छ | कोनो नीति epsilon हानि भएको आफ्नो वितरणमा (प्रमेय 2.2) |
| u गुणा T गुणा epsilon | u एक गलत कार्य को लागत-देखभाल पेनाल्टी सीमाबद्ध गर्छ; 0-1 हानि को लागि अधिकतम 1, O(T) सबैभन्दा खराब केस | फरवर्ड प्रशिक्षण (Ross & Bagnell 2010) |
| u गुणा T गुणा epsilon | एक नीति प्रति timestep; T नीतिहरु र एक ज्ञात, परिमित T चाहिन्छ | SMILe (Ross & Bagnell 2010) |
| केहि समस्या वर्गहरु मा T र epsilon मा लगभग रैखिक | alpha O(1/T वर्ग) मा, N O(T वर्ग लग T) मा; एक स्टोकास्टिक मिश्रण उपज | DAgger (प्रमेय 3.2, Ross et al. 2011) |
| u गुणा T गुणा epsilon_N, प्लस O(1) | N uT को क्रममा; दृढ़ता-उत्तल बाउन्ड हानि; कोनो-खेद शिक्षार्थी; epsilon_N अन्तःदृष्टि सबैभन्दा राम्रो हानि हो | रोबोट कार्यस्थान प्रदर्शन अवस्थाहरु एक नीति भ्रमण गर्छ जो कहिले प्रदर्शन सेट मा दिखिएन |

फरवर्ड प्रशिक्षण इमान्दार र अव्यावहारिक जवाब छ। एक अलग नीति प्रशिक्षण प्रत्येक timestep को लागि, अनुक्रमे, हरेक अवस्था वितरण मा प्रेरित प्रदर्शन नीति पहिले चरणहरु को लागि, त्यसैले हरेक नीति वास्तविक अवस्था अवस्था देख्छ। पकड विवरण मा: T नीति, क्रमिक रूपमा प्रशिक्षण, कोनो जल्दी स्टप। एक हेराफेरी
एपिसोड 30 फ्रेम प्रति सेकन्दमा, T सय मा हजार।SMILe, एकै कागज बाट, र SEARN, Daume, Langford र Marcu को संरचित भविष्यवाणी काम बाट, अन्य मार्ग लिन: एक स्थिर नीति, तर स्टोकास्टिक। हरेक पुनरावृत्ति एक घटक प्रशिक्षण र एक मिश्रण मा जोड्छ, विशेषज्ञ बाट दूर सम्भावना द्रव्य पार। परिणाम एक मिश्रण हो जसमा केहि घटक अन्यहरु भन्दा राम्रो छन् - एक भौतिक बाह्य पर, एक नियन्त्रक एक खराब घटक नमुना गर्न सक्छ गति-प्रदर्शन। यो एक स्थिर चाहना को कथित प्रेरणा हो
निर्धारणीय नीति सट्टा।DAgger: एक विचार, एक बाकस
डेटासेट एकीकरण निर्धारणीय नीति राख्छ र डेटा संग्रह मा सुधार सार्छ। हरेक राउन्ड: सर्त वर्तमान नीति, अवस्था रेकर्ड गर्छ यो भ्रमण गर्छ, विशेषज्ञ सोध्छ सही कार्य के हुन हुन्दछ हरेक मा, ती जोडीहरु डेटासेट सार्छ तपाई पहिले देखि छन्, पुन:प्रशिक्षण। नाम एल्गोरिथ्म हो - तपाई एकीकृत, तपाई कहिले बिस्मरण।
DAgger मेटा-एल्गोरिथ्म, एल्गोरिथ्म 3.1 Ross, Gordon & Bagnell (2011)।
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setकेहि क्रम मा नीति राम्रो हो, अन्तिम एक नहोय।Beta schedule, र किन यो एक ट्यूनिङ्ग नब हो
मिश्रित नीति beta_i गुणा विशेषज्ञ प्लस एक माइनस beta_i गुणा शिक्षार्थी हो। बिन्दु व्यावहारिक हो: पहिला केहि सिकेको नीति धेरै कम डेटा मा प्रशिक्षण, धेरै गलती, र अन्यथा राउन्डआउट राज्य मा खर्च हुन्छ जो अप्रासंगिक अनु नीति सुधार।
सिद्धान्त सटीक एक शर्त लागु गर्छ: बेटा चलमान औसत शून्य मा जान हुँदै छ। विश्लेषण एक स्थिरांक alpha स्वतन्त्र T को साथ (1 - alpha) को शक्ति i-1 द्वारा बाउन्ड beta_i साथ काम गर्छ।
अनुसूची
| यो के गर्छ | कागज के रिपोर्ट | beta_1 = 1 |
|---|---|---|
| पहिला राउन्ड शुद्ध विशेषज्ञ प्रदर्शन; कोनो प्रारम्भिक नीति आवश्यक छैन | हरेक भेरियन्ट मा सुझाव दिइएको शुरुवात बिन्दु | beta_i = 1 यदि i = 1, अन्य 0 |
| विशेषज्ञ केवल राउन्ड एक मा; कोनो मुक्त प्यारामिटर | कागज को प्यारामिटर-मुक्त संस्करण, जो यो कहे को सर्वश्रेष्ठ व्यवहार मा; 20 पुनरावृत्ति पछि Super Mario Bros मा 2980 | beta_i = p^(i-1) p = 0.5 को साथ |
| विशेषज्ञ सम्भावना ज्यामितिमा क्षय हुन्छ | समान बेन्चमार्क मा 3030, प्यारामिटर-मुक्त संस्करण अग्रिम थोरै | beta_i = p^(i-1) p = 0.9 को साथ |
| विशेषज्ञ लुप मा अधिक ठहरिन्छ | उल्लेख्य रूपमा धीमो अभिसरण; अझै सुधार जब 20 पुनरावृत्ति समाप्त | 2980 र 3030 बीच अन्तर मोटा रूपमा 4300 को पैमाने मा सानो छ, तर कागजको व्याख्या हो सबैभन्दा उपयोगी व्यावहारिक नोट खण्डमा। प्यारामिटर-मुक्त अनुसूचीको साथ, Mario प्रारम्भिक मा एकै स्थानमा फँस्यो र यो एक स्थान बाट यसो-नकल डेटा एक द्रव्य उत्पादन; विशेषज्ञ ड्राइभ अंश समय दुवै unst उसे र widened विविधता अवस्थाहरु। अनुसूची मिश्रण अनुपात भन्दा कम राख्छ कि तपाईको डेटा संग्रह नयाँ राज्य उत्पादन राख्छ वा समान विफलता। |
किन अनुसूची एक भौतिक बाह्य लिन् को रूपमा हस्तान्तरण गर्दैन
गारान्टी: कोनो-खेद अनलाइन शिक्षामा एक कमी
यहाँ चाल जो कागज क्या हो बनाउँछ। हरेक DAgger राउन्ड एक अनलाइन शिक्षा समस्या मा एक उदाहरण को रूपमा दिमित्र, जहाँ राउन्ड i मा हानि surrogate हानि अवस्था वितरण अधीन नीति प्रयुक्त राउन्ड i मा। शिक्षार्थी प्रतिबद्ध एक नीति लाई पहिले देखि कि हानि, र क्रम गैर-स्थिर हो किनकि यो नीति उत्पादन पहिले अवलम्बित।
एक एल्गोरिथ्म कोनो-खेद हो यदि यो औसत हानि N राउंड अग्रसर सबैभन्दा एकल नीति अन्तःदृष्टि। Follow-The-Leader दृढ़ता-उत्तल हानि अनु एक एल्गोरिथ्म हो, औसत खेद 1/N को क्रममा सिकुड़ा - र पूर्ण एकत्रीकृत पर पुन:प्रशिक्षण सटीक Follow-The-Leader हो। कोनो अन्य कोनो-खेद शिक्षार्थी सेवा हुन सक्छ: विश्लेषण एक कमी, एक संपत्ति एक अप्टिमाइजर हो।
एक लेमा मिश्रित नीति बीच अन्तर पुल्छ जो डेटा संग्रहीत र सिकेको नीति जो तैनाथ हुन हुन्दछ: लेमा 4.1 L1 दूरी बाध्य गर्छ उनीहरु अवस्था वितरण द्वारा 2 T beta_i। यो किन बेटा क्षय हुँदै छ - जब विशेषज्ञ अझै पनि सराहनीय नियन्त्रण अधिकार राख्छन्, राज्य तपाई संग्रह नीति उत्पादन छैन। लेमा संयोजन खेद बाउन्ड र मुख्य परिणाम अनु मुक्त: पछि मोटा T पुनरावृत्ति, केहि नीति अनुक्रम मा विशेषष हानि आफ्नो वितरण अधीन O(1/T) को भित्र epsilon_N। कि रैखिक बाउन्ड मा फीड र तपाई लैंड प्रमेय 3.2।
अनुभवजन्य पक्ष वर्तमान मान द्वारा साधारण हो। Super Tux Kart मा पर्यवेक्षित बेसलाइन अपने औसत पड़ गिरने सुधार गर्न सकेनन् प्रति lapas अधिक डेटा पहुँचे, DAgger एक नीति पहुँचे जो कहिले ट्र्याक बाट पड़ 15 पुनरावृत्ति पछि, र SMILe पछि 20 अझै लगभग दुई प्रति lapas पड़। हस्तलेखन बेन्चमार्क पर, वर्ण परिशुद्धता 82 प्रतिशत सन्दर्भ बिना, 83.6 प्रतिशत पर्यवेक्षित, 85.5 प्रतिशत DAgger साथ। ती कोनो हेराफेरी परिणाम हो।
प्रमाण क्या प्रतिशत गर्दैन
प्रमेय बयान सशर्त, र शर्त अधिभार हुन्छन्।
DAgger गारान्टी, करीबी पढ्न
- एक स्थिर निर्धारणीय नीति एक स्टोकास्टिक मिश्रण को सट्टा।
- एक सच्चा कमी: कोनो कोनो-खेद अनलाइन शिक्षार्थी स्लॉट मा।
- एक ठोस पुनरावृत्ति गणना - मोटा T राउंड खेद शब्द विषय बाँध अघि।
- अनुक्रम मा अन्तरिम एक नीति को लागि गारान्टी, यसैले बन्द सत्यापन पास।
- यो epsilon_N सापेक्ष, सबैभन्दा राम्रो हानि वर्ग मा अन्तःदृष्टि, शून्य सापेक्ष नहोय। यदि तपाई वर्ग विशेषज्ञ प्रतिनिधित्व गर्न सकदैन, यो व्यावहार मा खाली हो।
- यो एक कोनो-खेद विधि वा एक दृढ़ता-उत्तल surrogate हानि चाहिन्छ - वर्गीकरण कमी भन्दा मजबूत यो निर्माण, लेखक नोट को रूपमा।
- स्थिरांक u O(T) हो सकदै छ सबैभन्दा खराब केस, र रैखिक बाउन्ड त्यसपछी द्विघाती ढह।
- यो पुनरावृत्ति, विशेषज्ञ लेबल बाध्य। एक रोबोट पर, लेबल बजेट हुन्छन्।
- यो मान्यता दिन्छ विशेषज्ञ सोध्न सक्छन् प्रत्येक भ्रमण अवस्था र सटीक वहाँ उत्तर। कि धारणा सम्पूर्ण लागत हो।
- एक अन्य परिणाम अक्सर उद्धृत एक अस्वीकृति को रूपमा र यो नहो एक। Rajaraman, Yang, Jiao र Ramachandran अध्ययन minimax सीमा imitation शिक्षा episodic MDPs मा परिमित अवस्था अंतरिक्ष S र दिगोता H को साथ, र प्रमाणित एक suboptimality कम बाउन्ड आदेश |S| H वर्ग अधीन N भी जब शिक्षार्थी सक्ष क्रियाकलाप भ्रमण अवस्था। कि एक सबैभन्दा खराब केस दर MDPs वर्ग एक निश्चित एपिसोड बजेट मा, र यो क्या शासन किंवा अन्तः क्रिया सुधार minimax दर; DAgger प्रमेय एक अलग बयान, तैनाथ नीति बाध्य अपने नीति वर्ग अर्जन गर्न सकदैन।
Swamy, Choudhury, Bagnell र Wu बाद वर्गीकृत ये एल्गोरिथ्म जो क्षण विशेषज्ञ आचरण मा मिलाप, र एक विचार moment recoverability प्रस्तुत जो delineate कस्तो राम्रो हरेक परिवार compounding त्रुटि कम। सर्वेक्षण द्वारा Osa र द्वारा Celemin कभर एल्गोरिथ्मिक परिदृश्य र मानव-प्रतिक्रिया इन्टरफेस।
बिल: अवस्था लेबलिङ विशेषज्ञ कहिले उत्पादन
सब अग्रिम मान्यता दिन्छ एक विशेषज्ञ जो कहीँ सोध्न सक्छन्। सिमुलेशन मा एक योजनाकार लगभग मुक्त - Mario प्रयोग एक लगभग-इष्टतम योजनाकार पूर्ण खेल अवस्था प्रवेश साथ। एक मानव एक रोबोट पर यो प्रभुत्वशाली लागत, र एक विचित्र: मानव सही कार्य उत्पादन एक कॉन्फ़िगरेशन अपने नीति कहिले होल्ड गर्ने पर।
Kelly, Sidrane, Driggs-Campbell र Kochenderfer कथन आपत्ति सीधे HG-DAgger कागज मा। Vanilla DAgger आवश्यकता विशेषज्ञ कार्य लेबल आपूर्ति जब पूर्ण नियन्त्रण प्रणाली। यह कम सुरक्षा, र मानव विशेषज्ञ अधिकार शोषण संग्रहीत लेबल गुणवत्ता, जो तिनीहरु कम गर्छन् कथित प्रवर्तक lag को। लेबल तपाई वापस प्राप्त लेबल एल्गोरिथ्म धारणा नहो।
Laskey र साथीहरु हमला समस्या अन्य पक्ष DART साथ, र उनको फ्रेमिङ्ग तीव्र: on-policy तकनीक नीरस मानव प्रशिक्षकहरु, योग खसरा बोझ, र दौरा खतरनाक अवस्था प्रशिक्षण। उनको वैकल्पिक इंजेक्ट calibrated शोर निरीक्षक आफ्नै प्रदर्शन, तो पुनः प्राप्त हुन्छ बिना रोबोट कभी चलाइरहेको अविश्वसनीय नीति। MuJoCo Humanoid पर तिनीहरु रिपोर्ट DART कम निरीक्षक संचयी पुरस्कार 5 प्रतिशत प्रशिक्षण दौरान, जब DAgger निष्पादन नीति साथ 80 प्रतिशत कम संचयी पुरस्कार निरीक्षक; अस्पष्टता मा grasping साथ एक Toyota HSR, एक औसत 62 प्रतिशत वृद्धि behavior cloning अधीन।
Zhang र Cho SafeDAgger व्यवहार साथ क्वेरीहरु दुर्लभ संसाधन: एक अलग सुरक्षा नीति भविष्यवाणी, बिना क्वेरी, प्राथमिक नीति विषय विचलित होने अनु एक दहलीज, र केवल ती अवस्था सार्छन्। सब तीन प्रतिक्रिया अनु एकै तथ्य - DAgger विश्लेषण दायरे कुछ विशेषज्ञ लेबल, र वास्तविकता एक महान सौदा।
भाग कोनो एक चेतावनी अनु
LeRobot डेटासेट संरचना दर्शन एपिसोड, फ्रेम र प्रति-फ्रेम कॉलम डिस्क स्टोर

अनुवाद दिगोता अपने इकाई में। एक बीस-सेकंड एपिसोड 30 फ्रेम प्रति सेकन्द है 600 निर्णय चरण, और T प्रत्येक बाध्य अधीन कि संख्या। T = 600 पर, अंतर एक पद स्केलिंग T और एक स्केलिंग T वर्ग के बीच अंतर नीति नीति है जो खराब दृष्टिकोण से पुनः प्राप्त करता है और एक है जो नहीं।
यह भाग किस प्रकार कार्रवाई chunking मदद करता है: जब एक नीति एक छोटा अनुक्रम कार्य प्रति अनुमान चरण उत्सर्जन, निर्णय बिंदु संख्या ड्रॉप, और अवसर compounding के रूप। Zhao, Kumar, Levine और Finn नाम compounding त्रुटि कारण Action Chunking साथ Transformers, और रिपोर्ट 80 करने के लिए 90 प्रतिशत सफलता छह मुश्किल वास्तविक दुनिया कार्य पर, कम लागत bimanual हार्डवेयर, दस मिनट प्रदर्शन लायक। chunking नहीं निकालता covariate अपरिवर्तक - राज्य अभी भी नीति आपका - लेकिन यह shortens प्रभावी दिगोता। देखो
action chunking और SO-100 imitation learning गाइड।दूसरा अनुवाद प्रगति मीट्रिक है। तपाई उपाय सकदैन epsilon अवस्था नीति वितरण अधीन सीधे - कि आवश्यकता भू-सत्य विशेषज्ञ कार्य हरेक भ्रमण अवस्था, कि आप कोशिश कर रहे हैं। क्या मानव-gated लूप आप देश को सट्टा है हस्तक्षेप दर: अंश फ्रेम एक रन मानव अंदर ले अधीन। यह एक प्रॉक्सी है, और यह चाल कारण unrelated नीति - एक धैर्य संचालक हस्तक्षेप कम। इस्तेमाल सुसंगतता, यह एक संख्या कहता है क्या एक राउंड दोपहर लायक ही था।
एक तीसरा अनुवाद एक डेटा-गुणवत्ता चेतावनी विश्लेषण कभर नहीं करता है। Mandlekar र साथीहरु अध्ययन छह ऑफलाइन शिक्षा एल्गोरिथ्म पर पाँच सिमुलेट और तीन वास्तविक दुनिया बहु-स्तर हेराफेरी कार्य, और रिपोर्ट एक संवेदनशीलता एल्गोरिथ्मिक डिजाइन विकल्प, एक निर्भरता प्रदर्शन गुणवत्ता, और variability कारण समाप्ति कसौटी। Belkhale, Cui और Sadigh तर्क कि डेटासेट गुणवत्ता औपचारिक होना चाहिए कार्य विचलन और संक्रमण विविधता के माध्यम से, और नोट कि राज्य विविधता हमेशा नहीं लाभकारी है। एक DAgger राउंड जोड़ता राज्य कोनो चुना अभिप्राय: कुछ पुनः प्राप्त डेटा तपाई चाहिए, कुछ रोबोट flailing है जब आप fumble नियन्त्रण के लिए।
यांत्रिक रूप से एक राउंड छह कदम: चलाएं अनुमान रिकॉर्डिङ साथ, ले कब्जा जब नीति misbehaves, समीक्षा चलाता है और फाइल प्रत्येक एपिसोड, सिंक सुधार, रचना एक मिश्रित डेटासेट मूल प्लस सुधार साथ एपिसोड चयन किए स्पष्ट प्रति स्रोत, और जारी रखना प्रशिक्षण से पहले
checkpoint यथार्थ आधार मॉडल। ay-robots पर वे कदम बटन के रूप में मौजूद, जो हटाता है नली लेकिन निर्णय नहीं। दो caveats: जारी रखना एक checkpoint initialises वजन है और एक अप्टिमाइजर जारी रहता है, और नेता बाह्य संरेखण चल अभी भी हल्के परीक्षा पर हार्डवेयर। देखो training और datasets।DAgger लूप, पहले से ही तारबद्ध
ले कब्जा लाइव अनुमान दौरान चलाता है, प्रति-फ्रेम हस्तक्षेप चिह्नित, फाइलिङ एपिसोड सुधार या मूल्यांकन के रूप में, रचना एक मिश्रित डेटासेट स्पष्ट एपिसोड चयन प्रति स्रोत, और जारी रखना प्रशिक्षण एक मौजूदा checkpoint से सब बनाया। तपाई अभी भी निर्णय कब लाया कब और क्या रखना - कि भाग नहीं automate।
देखो कैसे DAgger लूप काम करता है
परिवार वृक्ष, एक तालिका मेविधि
| जो अवस्था चुनता है | विशेषज्ञ आपूर्ति क्या | मुख्य लागत | Behavior cloning |
|---|---|---|---|
| विशेषज्ञ | स्वच्छ प्रदर्शन | कोनो पुनः प्राप्त डेटा; त्रुटि द्विघाती T मा compounding हो सकदै | Forward training |
| शिक्षार्थी, प्रति timestep | लेबल अनुप्रेरित वितरण अधीन | T अलग नीति; लंबे horizon के लिए अनुपयोगी | SMILe / SEARN |
| विशेषज्ञ और शिक्षार्थी एक स्टोकास्टिक मिश्रण | लेबल मिश्रण वितरण अधीन | मिश्रण घटक की गुणवत्ता में विभिन्न | DAgger |
| मिश्रित नीति, beta शून्य को क्षय | एक सही कार्य हरेक भ्रमण अवस्था | Labeling अवस्था विशेषज्ञ कहिले उत्पादन, जब नीति नियन्त्रण | DART |
| विशेषज्ञ, injected शोर अनु परेशान | प्रदर्शन अधीन calibrated शोर | शोर calibrated होना चाहिए शिक्षार्थी त्रुटि को | HG-DAgger |
| शिक्षार्थी, जब तक मानव ले कब्जा | सुधार केवल मानव-gated खंड | हस्तक्षेप के समय निर्णय पर निर्भर | SafeDAgger |
| शिक्षार्थी, सुरक्षा गेट फ़िल्टर | लेबल केवल जब गेट पूछता है | गेट स्वयं प्रशिक्षित और विश्वास किया जाना चाहिए | अक्सर पूछे जाने वाले सवाल |
क्या मैं वास्तव में द्विघाती त्रुटि वृद्धि अपने रोबोट पर देख?
नहीं एक स्वच्छ वक्र के रूप में। बाध्य एक सबैभन्दा खराब केस: कड़ा कि कुछ समस्या यह attains, आपका नहीं कि। तपाई देख्न है परिणाम - एक नीति जो अच्छा अंक फ्रेम को hold-out, विफल वास्तविक कार्य, और नहीं सुधार जब तपाई रिकॉर्ड अधिक समान। अगर अधिक स्वच्छ डेटा मदद रोक देते हैं, कि covariate shift है, डेटा-मात्रा समस्या नहीं।▾
क्या मुझे beta मिश्रण लागू करना पड़ता है इसे DAgger कहने के लिए?
पैरामीटर-मुक्त संस्करण - विशेषज्ञ राउंड एक, शुद्ध शिक्षार्थी इसके बाद - एक वैध विशेष केस है और अक्सर मूल प्रयोग मे सेरा किया। क्या तपाई खस्न सकदैन एकीकरण: पुन:प्रशिक्षण केवल सबैभन्दा नयाँ सुधार Follow-The-Leader व्याख्या तोड़, जो जहाँ कोनो-खेद तर्क आता है। प्रशिक्षण सुधार अकेले एक अनु कमजोर प्रक्रिया है।▾
किसे वापस सबसे अच्छा नीति एक सत्यापन सेट पर अन्तिम एक के सट्टा?
किनकि प्रमेय एक अच्छा नीति गारंटी मौजूद क्रम मे कहीँ, अन्तिम iterate नहीं - बाध्य अनु क्रम। भेज जो आया अन्तिम राउंड बाहर एक कथित शर्त discard परिणाम, और अन्तिम राउंड सुबह विश्वास सबैभन्दा नहीं।▾
मुझे कितने राउंड के लिए योजना बनानी चाहिए?
सिद्धान्त आदेश पुनरावृत्ति चाहता है T, जो 600-चरण एपिसोड के लिए एक संख्या कोनो एक हार्डवेयर पर चलाता है। मूल प्रयोग हरेक बेन्चमार्क मे 20 पुनरावृत्ति चलाएं। व्यावहार में तपाई राउंड चलाएं जब तक हस्तक्षेप दर अपरिवर्तित पड़ता है, दूर विश्लेषण मान्यता अधीन - एक वास्तविक अन्तराल सिद्धान्त र व्यवहार के बीच।▾
क्या यदि मेरी नीति वर्ग सरल नहीं विशेषज्ञ का प्रतिनिधित्व?
तब DAgger आपको नहीं बचाता है, और बाउंड कहता है - यह व्यक्त सापेक्ष epsilon_N, सबैभन्दा राम्रो हानि वर्ग मा अन्तःदृष्टि। यदि कि वर्ग है क्योंकि गलत आर्किटेक्चर, एक गायब अवलोकन वा एक कैमरा कि परिदृश्य देख सकदैन, एकीकरण आप एक नीति देता है कि एक वर्ग वर्ग अधीन इष्टतम छ कि कार्य गर्न सकदैन। चलाएं खुला-लुप रिप्ले विरुद्ध होल्ड-आउट एपिसोड अग्रिम तपाई सुधार संग्रह।▾
कहाँ यहाँ जाने को
यदि तपाई एक नीति प्रशिक्षण पहिले भएको नहीं, यो सिद्धान्त अकाल: एक डेटासेट रिकॉर्ड पहिले, शुरुवात
training your first policy और desktop client। यदि तपाई वजन एक सय अधिक स्वच्छ प्रदर्शन विरुद्ध शुरुवात सुधार: स्वच्छ प्रदर्शन वितरण समस्या सुधार गर्दैन। यांत्रिकी के लिए, जारी रखना the human-gated variant और तब the SO-100 walkthrough।।
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started