रोबोट हेराफेरी दृश्यको अमूर्त रेन्डरिङ्, कार्यान्वयनको समयमा सिकेको नीति भ्रमण गरेको अवस्था वितरण दर्शाउँदै
DAggerImitation LearningBehavior Cloningरोबोट शिक्षासिद्धान्त

DAgger व्याख्यात: Behavior Cloning किन विचलित हुन्छ र Dataset Aggregation वास्तवमा के प्रमाणित गर्छ

AY-Robots ResearchAugust 27, 2026१५ मिनेट पढ्न

Behavior cloning ले विशेषज्ञको अवस्था वितरणमा एक नीति फिट गर्छ र त्यसपछी यसलाई आफ्नै रूपमा तैनाथ गरिन्छ। ती दुई वितरणहरू बीचको अन्तराल यो हो कि किन एक नीति जो सत्यापनमा ठीक देखिन्छ, चरण 300 मा टेबलबाट खस्छ। यो हाम्रो DAgger श्रृङ्खलाको सिद्धान्त अध्याय हो: जहाँ द्विघाती त्रुटि शब्द आउँछ, डेटासेट एकीकरणले के परिवर्तन गर्छ, कस्तो कोई-खेद प्रमाणले मान्यता दिन्छ, र मानव विशेषज्ञ अझै पनि कुन भाग भुक्तानी गर्न हुँदै छ।

त्यहाँ एक विशेष विफलता छ जो हरेक प्रबन्धन नीति प्रशिक्षण गर्ने व्यक्तिले कहिले न कहिले भेट्छ। नीति घनको लागि पहुँच गर्छ, दुई सेन्टिमिटर भित्र आउँछ, झिझक्छ, छेउमा विचलित हुन्छ, त्यसपछी कार्यसँग सम्बन्धित गर्दैन। सत्यापन हानि ठीक थियो। होल्ड-आउट एपिसोडहरू विरुद्ध खुला-लुप रिप्ले ठीक थियो। र अझै पनि बाह्य अवस्थामा समाप्त हुन्छ जो प्रशिक्षण डेटामा कहीँ देखिँदैन, र वहाँबाट यसको कुनै बुद्धिमान कुरा छैन।

यो विफलताको एक नाम र यसको पछाडी एक सम्पन्न सिद्धान्त छ। यो चार लेखहरूमा DAgger को पहिलो हो DAgger, र यसले तर्क आफैलाई कभर गर्छ: किन प्रदर्शकको आफ्नै ट्र्याजेक्टोरीहरूमा एक नीति फिट गर्नु एक त्रुटि उत्पन्न गर्छ जो एपिसोड लम्बाइको वर्गसँग बढ्न सक्छ, डेटासेट एकीकरणले के परिवर्तन गर्छ, र कस्तो कोई-खेद प्रमाण वास्तविक हार्डवेयरमा DAgger लुप चलाइरहेको हरेक वस्तु कभर गर्दैन। SO-100 मा एक DAgger लुप चलाइरहेको, मानव-गेटेड भेरियन्ट HG-DAgger र मानव-गेटेड अवरोधहरू, र मापन प्रश्न DAgger लुप मापन गरिरहेको

छोटो संस्करण

  • Behavior cloning विशेषज्ञको अवस्था वितरणमा प्रशिक्षण दिन्छ र नीतिको आफ्नैमा मूल्यांकन गरिन्छ। बेमेलमा एपिसोडमा वर्धित हुन्छ।
  • Ross र Bagnell ले दिखाए कि अतिरिक्त लागत T वर्गको समय प्रति-चरण त्रुटि वर्तमान बढ्न सक्छ; DAgger कागजले यो बाउन्ड पुन:बयान गर्छ र नोट गर्छ कि यो कड़ा छ।
  • DAgger ले अवस्थाहरु लेबल गर्छ जो नीति आफैले भ्रमण गर्छ, र सबै डेटासेट एकत्रीकृत मा retrains गर्छ, केवल सबैभन्दा नयाँ होइन।
  • गारान्टी कोई-खेद अनलाइन शिक्षामा एक कमी हो: एकीकृत र retraining Follow-The-Leader हो।
  • यो नीति वर्गमा प्राप्य सबैभन्दा राम्रो हानिको सापेक्षमा राखिन्छ, शून्यको सापेक्षमा होइन - र विशेषज्ञ अझै पनि अवस्थालाई लेबल गर्न हुँदै छ जो यसले कहिले उत्पादन गरे नथे।

Behavior cloning शान्तै मान्यता दिने धारणा

एक प्रदर्शन डेटासेट अवलोकन-कार्य जोडीको एक थुप हो। Behavior cloning यो थुपमा एक कार्य फिट गर्छ साधारण पर्यवेक्षित शिक्षा र त्यहीं रोक्छ। यो क्षेत्रमा सबैभन्दा पुरानो विचार हो। Pomerleau को ALVINN, 1988 मा, एक तीन-तह पश्चप्रसार नेटवर्क थियो जसले क्यामेराबाट छविहरु र लेजर दायरा फाइन्डर लिएको र गाडीले यात्रा गर्नुपर्ने दिशा उत्पादन गर्यो; यो सिमुलेट गरिएका सडक छविहरुमा प्रशिक्षण दिइएको थियो र केहि क्षेत्र अवस्थामा वास्तविक सडकहरु पछ्याएको थियो। नुस्खा धेरै परिवर्तन भएको छैन; नेटवर्कहरु भेको छन्।

जो छोडिएको छ त्यो एक जाँच हो कि ती जोडीहरु कहाँबाट आए। तिनीहरुमा प्रत्येक एक प्रदर्शकले उत्पादन गरेको ट्र्याजेक्टोरीमा राखिन्छ। तपाईले तैनाथ गर्ने नीति आफ्नै उत्पादन गर्छ। मुहूर्त यो विचलित हुन्छ, यो अवस्थाहरु बारे सोधिएको छ जो प्रशिक्षण वितरणमा थिएनन्, र यसको उत्तर यसलाई अझै पढ छ। Ross, Gordon र Bagnell DAgger कागजलाई सटीक रूपमा खोल्छन्: क्रमिक भविष्यवाणी i.i.d. धारणा अधीन सांख्यिकीय शिक्षा को उल्लङ्घन गर्छ, किनकि शिक्षार्थी को आफ्नै भविष्यवाणीहरु इनपुट निर्धारण गर्छ यो अगल देख्छ।

यो कागजमा सबैभन्दा स्पष्ट चित्र एक रोबोट सबै होइन। Super Mario Bros को नजिक-इष्टतम योजनाकार क्लोनिङ गर्नु एक नीति उत्पादन गर्यो जो बारबार एक अवरोध विरुद्ध फँस्यो र यो जम्प गर्नुको सट्टा। कारण सम्पूर्ण तर्क एक वाक्यमा: विशेषज्ञ सधैं एक आरामदायक दूरीबाट जम्प गर्यो, त्यसैले डेटासेटमा कुनै अवस्था थिएन जसमा Mario एक अवरोध विरुद्ध दबिएको थियो, र यसैले अवरोध विरुद्ध दबिएको पछि के गर्ने कोनो लेबल थिएनन्।

Mario को सट्टा एक SO-100 बाह्य र संरचना एकै छ। तपाईको प्रदर्शनहरु एक सफा दृष्टिकोण र सफा पकड दिखाउँछन्, दो सेन्टिमिटर कम् को ग्रिपर बन्द होइन - त्यसैले नीतिको वहाँबाट के गर्ने कुनो विचार छैन, र जो कुनै अनुमान गर्छ यसलाई अझै पढ छ। Covariate shift एक सम्पत्ति हो डेटा संग्रह प्रक्रिया, नेटवर्क आर्किटेक्चर होइन।

जहाँ द्विघाती शब्द आउँछ

Ross र Bagnell द्वारा 2010 AISTATS कागज, Efficient Reductions for Imitation Learning, compounding सटीक गर्छ। T लाई कार्य दिगोता होन दिन, कार्य लागत एकाइ अन्तराल मा बाउन्ड होन दिन, र epsilon विशेषज्ञ को अवस्था वितरणमा मापन गरिएको surrogate हानि होन दिन - संख्या तपाईको सत्यापन सेट रिपोर्ट गर्छ। त्यसपछी यो नीति T चरणहरु को लागि चलाइरहेको अतिरिक्त लागत, विशेषज्ञको सापेक्षमा, T वर्ग गुणा epsilon द्वारा बाउन्ड गरिएको छ। Ross, Gordon र Bagnell यसलाई DAgger कागजमा प्रमेय 2.1 को रूपमा पुन:बयान गर्छन् र वाक्य जो महत्वपूर्ण छ थप्छन्: बाउन्ड कड़ा छ। समस्याहरु अस्तित्वमा छन् जहाँ विशेषज्ञको वितरणमा epsilon हानि भएको नीति वास्तवमा अतिरिक्त लागत द्विघाती रूपमा T मा वर्धित हुन्छ।कड़ा विशिष्ट मतलब होइन। द्विघाती शब्द समस्याहरु को एक वर्ग मा एक सबैभन्दा खराब केस हो, तपाईको पिक-र-स्थान कार्य को बारे एक भविष्यवाणी होइन। यो स्थापित गर्छ कि थप विशेषज्ञ प्रदर्शन समस्या हटाए पार्न सकदैन: यो सटीकता को केवल शार्प गर्छ epsilon एक वितरण मा नीति परीक्षा गरिने छैन।

पलायन मार्ग एकै कागजमा छ, प्रमेय 2.2 को रूपमा पुन:बयान गरिएको। यदि एक नीति हानि epsilon अर्जन गर्छ

आफ्नै अवस्था वितरणमा, र एक गलत कार्य विशेषज्ञ अधीन लागत-देखभाल मा अधिकतम u लागत गर्छ, अतिरिक्त लागत u गुणा T गुणा epsilon द्वारा बाउन्ड गरिएको छ - दिगोताको सापेक्षमा रैखिक। स्थिरांक u दिलचस्प मात्रा हो: विशेषज्ञको साथ 0-1 असहमति को लागि अधिकतम 1, र विशेषज्ञ केहि चरण भित्र पुनः प्राप्त गर्न सक्न जहाँ O(1)। सबैभन्दा खराब केस मा यो O(T) छ, र रैखिक बाउन्ड त्यसपछी द्विघाती भन्दा कोनो बेहतर छैन।सेटिङ्

विशेषज्ञ मा अतिरिक्त लागत को बाउन्डयो के मा रहन्छBehavior cloning (Ross & Bagnell 2010, प्रमेय 2.1 को रूपमा पुन:बयान गरिएको Ross et al. 2011 मा)
T वर्ग गुणा epsilonepsilon विशेषज्ञको अवस्था वितरणमा मापन गरिएको; [0,1] मा लागत; बाउन्ड कड़ा छकोनो नीति epsilon हानि भएको आफ्नो वितरणमा (प्रमेय 2.2)
u गुणा T गुणा epsilonu एक गलत कार्य को लागत-देखभाल पेनाल्टी सीमाबद्ध गर्छ; 0-1 हानि को लागि अधिकतम 1, O(T) सबैभन्दा खराब केसफरवर्ड प्रशिक्षण (Ross & Bagnell 2010)
u गुणा T गुणा epsilonएक नीति प्रति timestep; T नीतिहरु र एक ज्ञात, परिमित T चाहिन्छSMILe (Ross & Bagnell 2010)
केहि समस्या वर्गहरु मा T र epsilon मा लगभग रैखिकalpha O(1/T वर्ग) मा, N O(T वर्ग लग T) मा; एक स्टोकास्टिक मिश्रण उपजDAgger (प्रमेय 3.2, Ross et al. 2011)
u गुणा T गुणा epsilon_N, प्लस O(1)N uT को क्रममा; दृढ़ता-उत्तल बाउन्ड हानि; कोनो-खेद शिक्षार्थी; epsilon_N अन्तःदृष्टि सबैभन्दा राम्रो हानि होरोबोट कार्यस्थान प्रदर्शन अवस्थाहरु एक नीति भ्रमण गर्छ जो कहिले प्रदर्शन सेट मा दिखिएन
DAgger राउन्डको लागि मायने राख्ने अवस्थाहरु ती हुन् कहिले कोई प्रदर्शन गरे: पास-मिस पकड, आधा-खुला ग्रिपर, वस्तु अतीतको बाह्य।
दुई प्रयास जो DAgger अघि आए

फरवर्ड प्रशिक्षण इमान्दार र अव्यावहारिक जवाब छ। एक अलग नीति प्रशिक्षण प्रत्येक timestep को लागि, अनुक्रमे, हरेक अवस्था वितरण मा प्रेरित प्रदर्शन नीति पहिले चरणहरु को लागि, त्यसैले हरेक नीति वास्तविक अवस्था अवस्था देख्छ। पकड विवरण मा: T नीति, क्रमिक रूपमा प्रशिक्षण, कोनो जल्दी स्टप। एक हेराफेरी

एपिसोड 30 फ्रेम प्रति सेकन्दमा, T सय मा हजार।SMILe, एकै कागज बाट, र SEARN, Daume, Langford र Marcu को संरचित भविष्यवाणी काम बाट, अन्य मार्ग लिन: एक स्थिर नीति, तर स्टोकास्टिक। हरेक पुनरावृत्ति एक घटक प्रशिक्षण र एक मिश्रण मा जोड्छ, विशेषज्ञ बाट दूर सम्भावना द्रव्य पार। परिणाम एक मिश्रण हो जसमा केहि घटक अन्यहरु भन्दा राम्रो छन् - एक भौतिक बाह्य पर, एक नियन्त्रक एक खराब घटक नमुना गर्न सक्छ गति-प्रदर्शन। यो एक स्थिर चाहना को कथित प्रेरणा हो

निर्धारणीय नीति सट्टा।DAgger: एक विचार, एक बाकस

डेटासेट एकीकरण निर्धारणीय नीति राख्छ र डेटा संग्रह मा सुधार सार्छ। हरेक राउन्ड: सर्त वर्तमान नीति, अवस्था रेकर्ड गर्छ यो भ्रमण गर्छ, विशेषज्ञ सोध्छ सही कार्य के हुन हुन्दछ हरेक मा, ती जोडीहरु डेटासेट सार्छ तपाई पहिले देखि छन्, पुन:प्रशिक्षण। नाम एल्गोरिथ्म हो - तपाई एकीकृत, तपाई कहिले बिस्मरण।

DAgger मेटा-एल्गोरिथ्म, एल्गोरिथ्म 3.1 Ross, Gordon & Bagnell (2011)।

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
तीन विवरण अधिक वजन गर्छन् तिनीहरु देख्न भन्दा। लेबलहरु मिश्रित नीति द्वारा भ्रमण अवस्थाहरु को लागि हुन्छन्, तर कार्यहरु विशेषज्ञ बाट आउँछन् - नीति प्रश्न प्रदान गर्छ, विशेषज्ञ उत्तर। पुन:प्रशिक्षण पूर्ण एकत्रीकृत मा हो, जो हरेक राउन्ड एक Follow-The-Leader चरण बनाउँछ: राउन्ड n मा तपाई सबैभन्दा राम्रो नीति अन्तःदृष्टि छान्छ हरेक ट्र्याजेक्टोरी अग्रगामी देखि। यो फ्रेमिङ्ग प्रमाण राखिन्छ। र एल्गोरिथ्म सबैभन्दा राम्रो नीति क्रम मा लौट्छ एक सत्यापन सेट मा चयन गरिएको रूपमा, किनकि प्रमेय गारान्टी गर्छन् कि

केहि क्रम मा नीति राम्रो हो, अन्तिम एक नहोय।Beta schedule, र किन यो एक ट्यूनिङ्ग नब हो

मिश्रित नीति beta_i गुणा विशेषज्ञ प्लस एक माइनस beta_i गुणा शिक्षार्थी हो। बिन्दु व्यावहारिक हो: पहिला केहि सिकेको नीति धेरै कम डेटा मा प्रशिक्षण, धेरै गलती, र अन्यथा राउन्डआउट राज्य मा खर्च हुन्छ जो अप्रासंगिक अनु नीति सुधार।

सिद्धान्त सटीक एक शर्त लागु गर्छ: बेटा चलमान औसत शून्य मा जान हुँदै छ। विश्लेषण एक स्थिरांक alpha स्वतन्त्र T को साथ (1 - alpha) को शक्ति i-1 द्वारा बाउन्ड beta_i साथ काम गर्छ।

अनुसूची

यो के गर्छकागज के रिपोर्टbeta_1 = 1
पहिला राउन्ड शुद्ध विशेषज्ञ प्रदर्शन; कोनो प्रारम्भिक नीति आवश्यक छैनहरेक भेरियन्ट मा सुझाव दिइएको शुरुवात बिन्दुbeta_i = 1 यदि i = 1, अन्य 0
विशेषज्ञ केवल राउन्ड एक मा; कोनो मुक्त प्यारामिटरकागज को प्यारामिटर-मुक्त संस्करण, जो यो कहे को सर्वश्रेष्ठ व्यवहार मा; 20 पुनरावृत्ति पछि Super Mario Bros मा 2980beta_i = p^(i-1) p = 0.5 को साथ
विशेषज्ञ सम्भावना ज्यामितिमा क्षय हुन्छसमान बेन्चमार्क मा 3030, प्यारामिटर-मुक्त संस्करण अग्रिम थोरैbeta_i = p^(i-1) p = 0.9 को साथ
विशेषज्ञ लुप मा अधिक ठहरिन्छउल्लेख्य रूपमा धीमो अभिसरण; अझै सुधार जब 20 पुनरावृत्ति समाप्त2980 र 3030 बीच अन्तर मोटा रूपमा 4300 को पैमाने मा सानो छ, तर कागजको व्याख्या हो सबैभन्दा उपयोगी व्यावहारिक नोट खण्डमा। प्यारामिटर-मुक्त अनुसूचीको साथ, Mario प्रारम्भिक मा एकै स्थानमा फँस्यो र यो एक स्थान बाट यसो-नकल डेटा एक द्रव्य उत्पादन; विशेषज्ञ ड्राइभ अंश समय दुवै unst उसे र widened विविधता अवस्थाहरु। अनुसूची मिश्रण अनुपात भन्दा कम राख्छ कि तपाईको डेटा संग्रह नयाँ राज्य उत्पादन राख्छ वा समान विफलता।

किन अनुसूची एक भौतिक बाह्य लिन् को रूपमा हस्तान्तरण गर्दैन

एक स्टोकास्टिक प्रति-timestep मिश्रण मतलब 30 गुणा एक सेकन्दमा नियन्त्रण कर्तृत्व स्विच, SO-100 सेटअप को एक विशिष्ट पर। कोनो teleoperation इन्टरफेस कि सुरक्षित वा अर्थपूर्ण। वास्तविक हार्डवेयर मा बेटा अनुसूची एक मानव निर्णय गर्छ <em>कहिले</em> ले कब्जा: एक अलग एल्गोरिथ्म एक अलग विश्लेषण को साथ।

गारान्टी: कोनो-खेद अनलाइन शिक्षामा एक कमी

यहाँ चाल जो कागज क्या हो बनाउँछ। हरेक DAgger राउन्ड एक अनलाइन शिक्षा समस्या मा एक उदाहरण को रूपमा दिमित्र, जहाँ राउन्ड i मा हानि surrogate हानि अवस्था वितरण अधीन नीति प्रयुक्त राउन्ड i मा। शिक्षार्थी प्रतिबद्ध एक नीति लाई पहिले देखि कि हानि, र क्रम गैर-स्थिर हो किनकि यो नीति उत्पादन पहिले अवलम्बित।

एक एल्गोरिथ्म कोनो-खेद हो यदि यो औसत हानि N राउंड अग्रसर सबैभन्दा एकल नीति अन्तःदृष्टि। Follow-The-Leader दृढ़ता-उत्तल हानि अनु एक एल्गोरिथ्म हो, औसत खेद 1/N को क्रममा सिकुड़ा - र पूर्ण एकत्रीकृत पर पुन:प्रशिक्षण सटीक Follow-The-Leader हो। कोनो अन्य कोनो-खेद शिक्षार्थी सेवा हुन सक्छ: विश्लेषण एक कमी, एक संपत्ति एक अप्टिमाइजर हो।

एक लेमा मिश्रित नीति बीच अन्तर पुल्छ जो डेटा संग्रहीत र सिकेको नीति जो तैनाथ हुन हुन्दछ: लेमा 4.1 L1 दूरी बाध्य गर्छ उनीहरु अवस्था वितरण द्वारा 2 T beta_i। यो किन बेटा क्षय हुँदै छ - जब विशेषज्ञ अझै पनि सराहनीय नियन्त्रण अधिकार राख्छन्, राज्य तपाई संग्रह नीति उत्पादन छैन। लेमा संयोजन खेद बाउन्ड र मुख्य परिणाम अनु मुक्त: पछि मोटा T पुनरावृत्ति, केहि नीति अनुक्रम मा विशेषष हानि आफ्नो वितरण अधीन O(1/T) को भित्र epsilon_N। कि रैखिक बाउन्ड मा फीड र तपाई लैंड प्रमेय 3.2।

अनुभवजन्य पक्ष वर्तमान मान द्वारा साधारण हो। Super Tux Kart मा पर्यवेक्षित बेसलाइन अपने औसत पड़ गिरने सुधार गर्न सकेनन् प्रति lapas अधिक डेटा पहुँचे, DAgger एक नीति पहुँचे जो कहिले ट्र्याक बाट पड़ 15 पुनरावृत्ति पछि, र SMILe पछि 20 अझै लगभग दुई प्रति lapas पड़। हस्तलेखन बेन्चमार्क पर, वर्ण परिशुद्धता 82 प्रतिशत सन्दर्भ बिना, 83.6 प्रतिशत पर्यवेक्षित, 85.5 प्रतिशत DAgger साथ। ती कोनो हेराफेरी परिणाम हो।

प्रमाण क्या प्रतिशत गर्दैन

प्रमेय बयान सशर्त, र शर्त अधिभार हुन्छन्।

DAgger गारान्टी, करीबी पढ्न

यो के तपाई देश
यो के गर्दैन देश
  • एक स्थिर निर्धारणीय नीति एक स्टोकास्टिक मिश्रण को सट्टा।
  • एक सच्चा कमी: कोनो कोनो-खेद अनलाइन शिक्षार्थी स्लॉट मा।
  • एक ठोस पुनरावृत्ति गणना - मोटा T राउंड खेद शब्द विषय बाँध अघि।
  • अनुक्रम मा अन्तरिम एक नीति को लागि गारान्टी, यसैले बन्द सत्यापन पास।
  • यो epsilon_N सापेक्ष, सबैभन्दा राम्रो हानि वर्ग मा अन्तःदृष्टि, शून्य सापेक्ष नहोय। यदि तपाई वर्ग विशेषज्ञ प्रतिनिधित्व गर्न सकदैन, यो व्यावहार मा खाली हो।
रैखिक यथार्थ द्विघाती T मा, अवस्था अधिमानहरु अधीन।
  • यो एक कोनो-खेद विधि वा एक दृढ़ता-उत्तल surrogate हानि चाहिन्छ - वर्गीकरण कमी भन्दा मजबूत यो निर्माण, लेखक नोट को रूपमा।
  • स्थिरांक u O(T) हो सकदै छ सबैभन्दा खराब केस, र रैखिक बाउन्ड त्यसपछी द्विघाती ढह।
  • यो पुनरावृत्ति, विशेषज्ञ लेबल बाध्य। एक रोबोट पर, लेबल बजेट हुन्छन्।
  • यो मान्यता दिन्छ विशेषज्ञ सोध्न सक्छन् प्रत्येक भ्रमण अवस्था र सटीक वहाँ उत्तर। कि धारणा सम्पूर्ण लागत हो।
  • एक अन्य परिणाम अक्सर उद्धृत एक अस्वीकृति को रूपमा र यो नहो एक। Rajaraman, Yang, Jiao र Ramachandran अध्ययन minimax सीमा imitation शिक्षा episodic MDPs मा परिमित अवस्था अंतरिक्ष S र दिगोता H को साथ, र प्रमाणित एक suboptimality कम बाउन्ड आदेश |S| H वर्ग अधीन N भी जब शिक्षार्थी सक्ष क्रियाकलाप भ्रमण अवस्था। कि एक सबैभन्दा खराब केस दर MDPs वर्ग एक निश्चित एपिसोड बजेट मा, र यो क्या शासन किंवा अन्तः क्रिया सुधार minimax दर; DAgger प्रमेय एक अलग बयान, तैनाथ नीति बाध्य अपने नीति वर्ग अर्जन गर्न सकदैन।

Swamy, Choudhury, Bagnell र Wu बाद वर्गीकृत ये एल्गोरिथ्म जो क्षण विशेषज्ञ आचरण मा मिलाप, र एक विचार moment recoverability प्रस्तुत जो delineate कस्तो राम्रो हरेक परिवार compounding त्रुटि कम। सर्वेक्षण द्वारा Osa र द्वारा Celemin कभर एल्गोरिथ्मिक परिदृश्य र मानव-प्रतिक्रिया इन्टरफेस।

बिल: अवस्था लेबलिङ विशेषज्ञ कहिले उत्पादन

सब अग्रिम मान्यता दिन्छ एक विशेषज्ञ जो कहीँ सोध्न सक्छन्। सिमुलेशन मा एक योजनाकार लगभग मुक्त - Mario प्रयोग एक लगभग-इष्टतम योजनाकार पूर्ण खेल अवस्था प्रवेश साथ। एक मानव एक रोबोट पर यो प्रभुत्वशाली लागत, र एक विचित्र: मानव सही कार्य उत्पादन एक कॉन्फ़िगरेशन अपने नीति कहिले होल्ड गर्ने पर।

Kelly, Sidrane, Driggs-Campbell र Kochenderfer कथन आपत्ति सीधे HG-DAgger कागज मा। Vanilla DAgger आवश्यकता विशेषज्ञ कार्य लेबल आपूर्ति जब पूर्ण नियन्त्रण प्रणाली। यह कम सुरक्षा, र मानव विशेषज्ञ अधिकार शोषण संग्रहीत लेबल गुणवत्ता, जो तिनीहरु कम गर्छन् कथित प्रवर्तक lag को। लेबल तपाई वापस प्राप्त लेबल एल्गोरिथ्म धारणा नहो।

Laskey र साथीहरु हमला समस्या अन्य पक्ष DART साथ, र उनको फ्रेमिङ्ग तीव्र: on-policy तकनीक नीरस मानव प्रशिक्षकहरु, योग खसरा बोझ, र दौरा खतरनाक अवस्था प्रशिक्षण। उनको वैकल्पिक इंजेक्ट calibrated शोर निरीक्षक आफ्नै प्रदर्शन, तो पुनः प्राप्त हुन्छ बिना रोबोट कभी चलाइरहेको अविश्वसनीय नीति। MuJoCo Humanoid पर तिनीहरु रिपोर्ट DART कम निरीक्षक संचयी पुरस्कार 5 प्रतिशत प्रशिक्षण दौरान, जब DAgger निष्पादन नीति साथ 80 प्रतिशत कम संचयी पुरस्कार निरीक्षक; अस्पष्टता मा grasping साथ एक Toyota HSR, एक औसत 62 प्रतिशत वृद्धि behavior cloning अधीन।

Zhang र Cho SafeDAgger व्यवहार साथ क्वेरीहरु दुर्लभ संसाधन: एक अलग सुरक्षा नीति भविष्यवाणी, बिना क्वेरी, प्राथमिक नीति विषय विचलित होने अनु एक दहलीज, र केवल ती अवस्था सार्छन्। सब तीन प्रतिक्रिया अनु एकै तथ्य - DAgger विश्लेषण दायरे कुछ विशेषज्ञ लेबल, र वास्तविकता एक महान सौदा।

भाग कोनो एक चेतावनी अनु

Labeling अवस्था वितरण मानसिक कठिन हो प्रदर्शन कार्य। एक सामान्य प्रदर्शन मतलब निष्पादन एक मोटर योजना तपाई पहिले। सुधार नीति जो gripper राज्य में डाल तपाई कहिले मतलब निर्माण पुनः तत्काल अधीन, समय दबाव, रोबोट अझै गति। कम प्रत्याशा उपयोगी मिनेट प्रति सेशन एक सरल रिकॉर्डिङ सेशन में, र देख आपकी सुधार गुणवत्ता क्षय अधीन सेशन कोर्स।

LeRobot डेटासेट संरचना दर्शन एपिसोड, फ्रेम र प्रति-फ्रेम कॉलम डिस्क स्टोर

सुधार एक डेटासेट केवल एक बार हस्तक्षेप फ्रेम चिह्नित - LeRobot प्रारूप, एक प्रति-फ्रेम कॉलम अवलोकन साथ और कार्य।
यह का मतलब एक SO-100 अपने डेस्क

अनुवाद दिगोता अपने इकाई में। एक बीस-सेकंड एपिसोड 30 फ्रेम प्रति सेकन्द है 600 निर्णय चरण, और T प्रत्येक बाध्य अधीन कि संख्या। T = 600 पर, अंतर एक पद स्केलिंग T और एक स्केलिंग T वर्ग के बीच अंतर नीति नीति है जो खराब दृष्टिकोण से पुनः प्राप्त करता है और एक है जो नहीं।

यह भाग किस प्रकार कार्रवाई chunking मदद करता है: जब एक नीति एक छोटा अनुक्रम कार्य प्रति अनुमान चरण उत्सर्जन, निर्णय बिंदु संख्या ड्रॉप, और अवसर compounding के रूप। Zhao, Kumar, Levine और Finn नाम compounding त्रुटि कारण Action Chunking साथ Transformers, और रिपोर्ट 80 करने के लिए 90 प्रतिशत सफलता छह मुश्किल वास्तविक दुनिया कार्य पर, कम लागत bimanual हार्डवेयर, दस मिनट प्रदर्शन लायक। chunking नहीं निकालता covariate अपरिवर्तक - राज्य अभी भी नीति आपका - लेकिन यह shortens प्रभावी दिगोता। देखो

action chunking और SO-100 imitation learning गाइडदूसरा अनुवाद प्रगति मीट्रिक है। तपाई उपाय सकदैन epsilon अवस्था नीति वितरण अधीन सीधे - कि आवश्यकता भू-सत्य विशेषज्ञ कार्य हरेक भ्रमण अवस्था, कि आप कोशिश कर रहे हैं। क्या मानव-gated लूप आप देश को सट्टा है हस्तक्षेप दर: अंश फ्रेम एक रन मानव अंदर ले अधीन। यह एक प्रॉक्सी है, और यह चाल कारण unrelated नीति - एक धैर्य संचालक हस्तक्षेप कम। इस्तेमाल सुसंगतता, यह एक संख्या कहता है क्या एक राउंड दोपहर लायक ही था।

एक तीसरा अनुवाद एक डेटा-गुणवत्ता चेतावनी विश्लेषण कभर नहीं करता है। Mandlekar र साथीहरु अध्ययन छह ऑफलाइन शिक्षा एल्गोरिथ्म पर पाँच सिमुलेट और तीन वास्तविक दुनिया बहु-स्तर हेराफेरी कार्य, और रिपोर्ट एक संवेदनशीलता एल्गोरिथ्मिक डिजाइन विकल्प, एक निर्भरता प्रदर्शन गुणवत्ता, और variability कारण समाप्ति कसौटी। Belkhale, Cui और Sadigh तर्क कि डेटासेट गुणवत्ता औपचारिक होना चाहिए कार्य विचलन और संक्रमण विविधता के माध्यम से, और नोट कि राज्य विविधता हमेशा नहीं लाभकारी है। एक DAgger राउंड जोड़ता राज्य कोनो चुना अभिप्राय: कुछ पुनः प्राप्त डेटा तपाई चाहिए, कुछ रोबोट flailing है जब आप fumble नियन्त्रण के लिए।

यांत्रिक रूप से एक राउंड छह कदम: चलाएं अनुमान रिकॉर्डिङ साथ, ले कब्जा जब नीति misbehaves, समीक्षा चलाता है और फाइल प्रत्येक एपिसोड, सिंक सुधार, रचना एक मिश्रित डेटासेट मूल प्लस सुधार साथ एपिसोड चयन किए स्पष्ट प्रति स्रोत, और जारी रखना प्रशिक्षण से पहले

checkpoint यथार्थ आधार मॉडल। ay-robots पर वे कदम बटन के रूप में मौजूद, जो हटाता है नली लेकिन निर्णय नहीं। दो caveats: जारी रखना एक checkpoint initialises वजन है और एक अप्टिमाइजर जारी रहता है, और नेता बाह्य संरेखण चल अभी भी हल्के परीक्षा पर हार्डवेयर। देखो training और datasetsDAgger लूप, पहले से ही तारबद्ध

ले कब्जा लाइव अनुमान दौरान चलाता है, प्रति-फ्रेम हस्तक्षेप चिह्नित, फाइलिङ एपिसोड सुधार या मूल्यांकन के रूप में, रचना एक मिश्रित डेटासेट स्पष्ट एपिसोड चयन प्रति स्रोत, और जारी रखना प्रशिक्षण एक मौजूदा checkpoint से सब बनाया। तपाई अभी भी निर्णय कब लाया कब और क्या रखना - कि भाग नहीं automate।

देखो कैसे DAgger लूप काम करता है

परिवार वृक्ष, एक तालिका मे

विधि

जो अवस्था चुनता हैविशेषज्ञ आपूर्ति क्यामुख्य लागतBehavior cloning
विशेषज्ञस्वच्छ प्रदर्शनकोनो पुनः प्राप्त डेटा; त्रुटि द्विघाती T मा compounding हो सकदैForward training
शिक्षार्थी, प्रति timestepलेबल अनुप्रेरित वितरण अधीनT अलग नीति; लंबे horizon के लिए अनुपयोगीSMILe / SEARN
विशेषज्ञ और शिक्षार्थी एक स्टोकास्टिक मिश्रणलेबल मिश्रण वितरण अधीनमिश्रण घटक की गुणवत्ता में विभिन्नDAgger
मिश्रित नीति, beta शून्य को क्षयएक सही कार्य हरेक भ्रमण अवस्थाLabeling अवस्था विशेषज्ञ कहिले उत्पादन, जब नीति नियन्त्रणDART
विशेषज्ञ, injected शोर अनु परेशानप्रदर्शन अधीन calibrated शोरशोर calibrated होना चाहिए शिक्षार्थी त्रुटि कोHG-DAgger
शिक्षार्थी, जब तक मानव ले कब्जासुधार केवल मानव-gated खंडहस्तक्षेप के समय निर्णय पर निर्भरSafeDAgger
शिक्षार्थी, सुरक्षा गेट फ़िल्टरलेबल केवल जब गेट पूछता हैगेट स्वयं प्रशिक्षित और विश्वास किया जाना चाहिएअक्सर पूछे जाने वाले सवाल

क्या मैं वास्तव में द्विघाती त्रुटि वृद्धि अपने रोबोट पर देख?

नहीं एक स्वच्छ वक्र के रूप में। बाध्य एक सबैभन्दा खराब केस: कड़ा कि कुछ समस्या यह attains, आपका नहीं कि। तपाई देख्न है परिणाम - एक नीति जो अच्छा अंक फ्रेम को hold-out, विफल वास्तविक कार्य, और नहीं सुधार जब तपाई रिकॉर्ड अधिक समान। अगर अधिक स्वच्छ डेटा मदद रोक देते हैं, कि covariate shift है, डेटा-मात्रा समस्या नहीं।

क्या मुझे beta मिश्रण लागू करना पड़ता है इसे DAgger कहने के लिए?

पैरामीटर-मुक्त संस्करण - विशेषज्ञ राउंड एक, शुद्ध शिक्षार्थी इसके बाद - एक वैध विशेष केस है और अक्सर मूल प्रयोग मे सेरा किया। क्या तपाई खस्न सकदैन एकीकरण: पुन:प्रशिक्षण केवल सबैभन्दा नयाँ सुधार Follow-The-Leader व्याख्या तोड़, जो जहाँ कोनो-खेद तर्क आता है। प्रशिक्षण सुधार अकेले एक अनु कमजोर प्रक्रिया है।

किसे वापस सबसे अच्छा नीति एक सत्यापन सेट पर अन्तिम एक के सट्टा?

किनकि प्रमेय एक अच्छा नीति गारंटी मौजूद क्रम मे कहीँ, अन्तिम iterate नहीं - बाध्य अनु क्रम। भेज जो आया अन्तिम राउंड बाहर एक कथित शर्त discard परिणाम, और अन्तिम राउंड सुबह विश्वास सबैभन्दा नहीं।

मुझे कितने राउंड के लिए योजना बनानी चाहिए?

सिद्धान्त आदेश पुनरावृत्ति चाहता है T, जो 600-चरण एपिसोड के लिए एक संख्या कोनो एक हार्डवेयर पर चलाता है। मूल प्रयोग हरेक बेन्चमार्क मे 20 पुनरावृत्ति चलाएं। व्यावहार में तपाई राउंड चलाएं जब तक हस्तक्षेप दर अपरिवर्तित पड़ता है, दूर विश्लेषण मान्यता अधीन - एक वास्तविक अन्तराल सिद्धान्त र व्यवहार के बीच।

क्या यदि मेरी नीति वर्ग सरल नहीं विशेषज्ञ का प्रतिनिधित्व?

तब DAgger आपको नहीं बचाता है, और बाउंड कहता है - यह व्यक्त सापेक्ष epsilon_N, सबैभन्दा राम्रो हानि वर्ग मा अन्तःदृष्टि। यदि कि वर्ग है क्योंकि गलत आर्किटेक्चर, एक गायब अवलोकन वा एक कैमरा कि परिदृश्य देख सकदैन, एकीकरण आप एक नीति देता है कि एक वर्ग वर्ग अधीन इष्टतम छ कि कार्य गर्न सकदैन। चलाएं खुला-लुप रिप्ले विरुद्ध होल्ड-आउट एपिसोड अग्रिम तपाई सुधार संग्रह।

कहाँ यहाँ जाने को

यदि तपाई एक नीति प्रशिक्षण पहिले भएको नहीं, यो सिद्धान्त अकाल: एक डेटासेट रिकॉर्ड पहिले, शुरुवात

training your first policy और desktop client। यदि तपाई वजन एक सय अधिक स्वच्छ प्रदर्शन विरुद्ध शुरुवात सुधार: स्वच्छ प्रदर्शन वितरण समस्या सुधार गर्दैन। यांत्रिकी के लिए, जारी रखना the human-gated variant और तब the SO-100 walkthrough

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started