
सादा DAgger ले रोबोट अझै चलिरहँदा मानिसलाई अवस्था लेबल गर्न भन्छ। वास्तविक हार्डवेयरमा यो असुरक्षित छ र यसले कमजोर लेबल उत्पन्न गर्छ। गेटेड भेरिएन्ट्सले अन्धा लेबलिङलाई गेट संग बदल्छन् जुन कोइले राख्नु पर्छ: HG-DAgger मा मानिस, SafeDAgger मा सुरक्षा वर्गीकरण, EnsembleDAgger मा ensemble को असहमति, ThriftyDAgger मा बजेटेड उपन्यास-र-जोखिम अनुमान। यो लेख तिनलाई तुलना गर्छ कि कसले गेट राख्छ, के संकेतले यसलाई खोल्छ, र प्रत्येकको लागत कति छ — र किन मानव-गेटेड रूप वास्तविक आर्मसंग सम्पर्कमा रहन्छ।
क्लोन गरिएको नीति त्यहाँ असफल हुन्छ जहाँ यसको प्रशिक्षण डेटा समाप्त भयो। सुधार भनेको प्रदर्शनकर्ताको अवस्था वितरणको सट्टामा नीतिको आफ्नै अवस्था वितरणमा डेटा सङ्कलन जारी राख्नु हो, जुन DAgger गर्छ र के dataset aggregation को परिचय को पहिलो सिद्धान्तबाट कभर गर्छ। यो मूल एल्गोरिदमको अनौठो भाग खुला राख्छ: जब शिक्षार्थी चलाउँदै छ, विशेषज्ञ भन्ने छ कि तिनीहरूले के गरेको हुन्थ्यो, हरेक अवस्थाको लागि, नियन्त्रणमा नभई।
सिमुलेटरमा स्क्रिप्टेड विशेषज्ञसंग यो सस्तो छ। टेबलमा वास्तविक आर्मको साथ यो न सस्तो छ न सुरक्षित। HG-DAgger लेखकहरूले आपत्तिलाई सटीकतासंग बयान गर्छन्: यस्तो नमुना योजनाहरू "विशेषज्ञलाई सिस्टमको पूर्ण नियन्त्रणमा नभई कार्य लेबल प्रदान गर्न आवश्यक छ", जुन "सुरक्षा घटा सक्छ र, मानिस विशेषज्ञ प्रयोग गर्दा, कथित एक्चुएटर ल्यागको कारणले सङ्कलन गरिएको लेबलको गुणस्तर खराब गर्न सक्छ" (Kelly et al., 2019)। त्यो वाक्यमा दुई असफलता छन्: नीति अवस्थामा चलिरहन्छ कोइले चाहदैन, र त्यो जोखिमको साथ खरिद गरिएको लेबल मानिसले नियन्त्रणमा राखेर उत्पादन गर्ने भन्दा खराब छन्। तलको हरेक भेरिएन्ट एउटै प्रश्नको उत्तर दिन्छ — नियन्त्रणमा गेट राख र कसले यसलाई खोल्ने भन्ने निर्णय गर्न दिन्छ। तिनीहरू भिन्न हुन्छन् कि अलिकति।
छोटो संस्करण
- •गेटेड भेरिएन्ट्सले अन्धा लेबलिङलाई नीति नियन्त्रण र विशेषज्ञ नियन्त्रणको बीचमा स्विच संग बदल्छन्। तिनीहरूलाई अलग गर्ने कुरा भनेको कसले स्विच राख्छ।
- •HG-DAgger स्विच मानिसलाई दिन्छ र केवल डेटा सङ्कलन गर्छ मानिसले अबाधित नियन्त्रण गर्दा।
- •SafeDAgger यसलाई बाइनरी वर्गीकरणलाई दिन्छ जुन नीति को विचलन अनुमान गर्छ; EnsembleDAgger कम ensemble भिन्नता र एक पटकमा विशेषज्ञ कार्यमा सानो दूरी आवश्यक छ।
- •LazyDAgger ले hysteresis थपिन्छ ताकि नियन्त्रण पिङ-पङ नगर्छ; ThriftyDAgger ले उपन्यास र अनुमान गरिएको जोखिममा गेट गर्छ स्पष्ट हस्तक्षेप बजेटमा।
- •रोबोट-गेटेड संकेत आवश्यक छ कहिलेकाहिँ एक fine-tuned VLA मा एक hobby-class आर्मले सामान्यतया कमी: एक नीति, एक सस्तो ensemble, वा क्यालिब्रेटेड epistemic अनिश्चितता।
- •गेट विधि को आधा हो। हस्तक्षेप खण्डहरूको साथ के हुन्छ पछि — मिश्रण, वजन, एकत्र — निर्धारण गर्छ कि राउन्ड सुधार गर्यो कि गर्यो।
मानव-गेटेड र रोबोट-गेटेड: विभाजन जो मतलब राख्छ
इन्टरएक्टिभ इमिटेसन लर्निङ को आफ्नै सर्भे छ; Celemin र सहकर्मीहरूले यसलाई सङ्कलन गर्छन् feedback प्रकार, इन्टरफेस, लर्निङ मडेल, प्रयोगकर्ता अनुभव, आवेदन र benchmark अनुसार। भिन्नता जुन तपाइङ्को ईन्जिनियरिङ को निर्णय गर्छ ती सबै अक्ष भन्दा सरल छ, र हालको कार्यले यसलाई सीधै नाम दिन्छ: एक विधि human-gated हुन्छ जब निरीक्षक हस्तक्षेप गर्ने समय निर्णय गर्छ, र robot-gated जब एजेन्ट सहायता माग्ने समय निर्णय गर्छ (Cai et al., 2025)। अन्य सबै सेवा एक वा अर्को चयन। वापस्ता स्पष्ट छ शुरु देखि: मानव गेट लगातार ध्यान दिन को खर्च गर्छ, र रोबोट गेट ध्यान फिर्ता दिन को वचन दिन्छ — पर गेट द्वारा संकेत विश्वस्त छ भनी मात्र, र त्यो संकेत निर्माण यसको आफ्नै अनुसन्धान समस्या हो।
SafeDAgger: एक वर्गीकरण जुन आफ्नो विचलन अनुमान गर्छ
Zhang र Cho को SafeDAgger (2016) यी गेट को सबै भन्दा प्राचीन हो। नीति को क्वेरी गर्ने महँगो भाग हो, त्यसैले दोस्रो, साना नेटवर्क — सुरक्षा नीति — अनुमान गर्छ कि क्वेरी गर्न सार्थक छ वा छैन। यो "एक बाइनरी लेबल फर्काउँछ जुन संकेत गर्छ कि प्राथमिक नीति क्वेरी बिना सन्दर्भ नीति देखी विचलन हुन सक्छ". लेबल दुई नीति को कार्य को बीच squared L2 विचलन बिरुद्ध परिभाषित छ एक threshold tau संग, र वर्गीकरण बाइनरी क्रस-एन्ट्रोपी संग fit छ। रन समय यो हरेक अवस्थामा निर्णय गर्छ कि शिक्षार्थी चल्ने रहन्छ वा सन्दर्भ लिन्छ। अमूर्त कम सन्दर्भ क्वेरी एक कार गिरी सिमुलेटरमा रिपोर्ट गर्छ प्लस एक अभिसरण गति-अप जुन लेखकहरू एक स्वचालित पाठ्यक्रम प्रभाव को विशेषता दिन्छन्, दुबै को लागि आँकडा दिए बिना।
क्याच परिभाषामा छ, परिणामहरूमा छैन। वर्गीकरण प्रशिक्षण नीति को कार्य आवश्यक छ हरेक अवस्थामा यसलाई fit गर्न, जुन नीति भन्ने अर्को कार्यक्रम हो। यदि तपाइङ्को सन्दर्भ एक नेता आर्म को साथ एक व्यक्ति हो, त्यो लेबल सेट सस्तो छैन र विधि आफ्नो लागि डिजाइन गरिएको सम्पत्ति खराब गर्छ।
EnsembleDAgger: संदेह र भिन्नता, दुबै
Menda, Driggs-Campbell र Kochenderfer (2019) गेट लाई संभाव्यता प्रश्न को रूपमा व्यवहार गर्छन्। EnsembleDAgger "एक ensemble को neural networks को प्रयोग गर्छ एक Gaussian Process अनुमान गर्न" र ensemble variance लाई confidence proxy को रूपमा पढ्छ: उच्च भिन्नता अर्थ एक क्षेत्र प्रशिक्षण डेटा जस्तो नछ, जुन — विशेषज्ञ असफलता अवस्था बचाउँछ मानी — असफलतामा निकटता संग सम्बद्ध छ। नियम एक conjunction हो। शिक्षार्थी कार्य गर्न सक्छ मात्र जब यसको मतलब कार्य र विशेषज्ञको कार्य को बीचमा L2 दूरी एक threshold (discrepancy) भन्दा तल रहन्छ र यसको अनुमान गरिएको कार्यको भिन्नता दोस्रो (doubt) भन्दा तल रहन्छ। यदि कुनै असफल हुन्छ, विशेषज्ञ नियन्त्रण लिन्छ। लक्ष्य शिक्षार्थीको कार्य को अंश अधिकतम गर्न असफलता को संभाव्यता बाध्य गर्दा; कागजात उन्नत सुरक्षा र लर्निङ रिपोर्ट गर्छ inverted pendulum र MuJoCo HalfCheetah मा अन्य DAgger भेरिएन्ट विरुद्ध।
यो quietly पूर्ण नियम disqualify गर्छ हातमा बिना निरीक्षण को लागि। दूरी शिक्षार्थीको कार्य र विशेषज्ञको कार्य को बीचमा विशेषज्ञको कार्य आवश्यक छ त्यो अवस्थामा, त्यो पल मा। scripted विशेषज्ञ संग, ठीक छ। मानिस संग, मानिस continuous कार्य उत्पादन गर्नु पर्छ — ठीक त्यो बोझ गेटेड भेरिएन्ट हटाउन यसको अभिप्राय थियो। doubt term एकछत्र हातमा बिना; conjunction छैन।
LazyDAgger: स्विच को चकचके रोक्छ
Hoque र सहकर्मीहरू (2021) एक लागत आक्रमण गर्छन् पहिलेको कागजात नापे नथे: स्विच आफै। हरेक हस्तक्षेप "अन्य काम निरीक्षक गरिरहेको छ, संदर्भ स्विच को हरेक पल latency incur, र समय प्रदर्शन गर्न आवश्यक छ". एक गेट जुन एक मिनेट मा दश समय खुल्छ र बन्द हुन्छ एक बन्द एक मिनेट दस सेकन्ड को लागि भन्दा खराब छ, समान autonomous साझा मा। LazyDAgger SafeDAgger को साथ extend गर्छ asymmetric thresholds — निरीक्षक नियन्त्रण प्रवेश गर्न कठिन भन्दा यो भित्र रहन गर्न सरल — त्यसैले सिस्टम सीमामा oscillate गर्दैन। simulation मा यो "तीन continuous नियन्त्रण काम मा SafeDAgger को आधार ६०% संदर्भ स्विच कम गर्न सक्छ नीति प्रदर्शन अग्रणी को बीच बनाए"; fabric manipulation ABB YuMi को साथ यो "६०% संदर्भ स्विच कम गर्छ execution समय मा SafeDAgger भन्दा ६०% उच्च सफलता दर अर्जन गर्दा।"
ThriftyDAgger: उपन्यास वा जोखिम, बजेट अन्तर्गत
ThriftyDAgger (Hoque et al., CoRL 2021) निरीक्षक को बजेट भन्दा शुरु गर्छ नीति भन्दा। यो "एक शिखर switching नीति प्रयोग गर्छ heuristic गर्न केवल अवस्था मा जुन पर्याप्त हुन (1) उपन्यास, जहाँ रोबोट नीति कम गर्न को सन्दर्भ आचरण छैन, वा (2) risky, जहाँ रोबोट कार्य पूरा मा कम विश्वास छ", एक नयाँ metric संग त्यो जोखिम अनुमान। बजेट एक इनपुट हो, एक परिणाम छैन: तपाइङ्को कति मानिस समय खर्च गरिहाल्ने भन्ने बयान गर्दछ। execution समय मा प्रयोग गरिएको विधि "दुबै simulation र भौतिक काज मा १००% सफलता दर प्राप्त गर्छ", र दस प्रतिभागी संग एक प्रयोगकर्ता अध्ययन एक concentration कार्य संग एक तीन-रोबोट fleet नियन्त्रण गरिरहेको छ कि यो "मानिस र रोबोट प्रदर्शन ५८% र ८०% अनुक्रमे वृद्धि गर्छ अगलो सबै भन्दा अच्छो algorithm तुलना गर्दा जबकि निरीक्षक बोझ कम गर्दा"। fleet सेटिङ यो काम को लागि प्राकृतिक घर हो; Fleet-DAgger पछि interactive fleet लर्निङ formalise गरेको बहु-रोबोट र निरीक्षक, Return on Human Effort को रूपमा अनुकूलन गर्न मात्रा प्रस्ताव गरेको।
HG-DAgger: मानिस गेट राख्छ
Kelly et al. (2019) अन्य तरफ जान्छन्। को कुनै switching नीति छैन। शिक्षार्थी rollout गरिन्छ "यहाँ सम्म विशेषज्ञ observe गर्छ novice एक unsafe क्षेत्र को अवस्था स्पेस मा प्रवेश गर्यो", त्यो बिन्दुमा विशेषज्ञ नियन्त्रण लिन्छ र सिस्टम पछाडि मार्गदर्शन गर्छ। aggregation नियम कठोर भाग हो: "विशेषज्ञ कार्य लेबल केवल सङ्कलन र dataset मा थपिन्छ यो पुनरुद्धार trajectories को समय मा, समय को दरमियान मानिस विशेषज्ञ को अबाधित नियन्त्रण हो।" कुनै लेबल गरिन्छ मानिस spectator हो को समय।
यो स्विच मा रोक्नु छैन। HG-DAgger पनि "एक सुरक्षा threshold शिख्छ एक मडेल-अनिश्चितता-आधारित जोखिम metric को लागि जुन सकिएको novice को प्रदर्शन अनुमान गर्न प्रयोग गर्न सकिन्छ विभिन्न क्षेत्र मा राज्य स्पेस को": यो लग गर्छ कति uncertain शिक्षार्थी थिएको पल मा मानिस हस्तक्षेप गरेको र यो अवस्थित रेकर्ड को अन्तिम क्वार्टर average गर्छ, जहाँ शिक्षार्थी सबै भन्दा यसको अन्तिम रूप जस्तो दिखिन्छ। त्यो छैन एक गेट रोबोट संचालन गर्छ पर एक diagnostic कि तपाइङ्को सञ्चितचि नीति कहाँ राख्ने छ। मूल्यांकन एक simulated र एक वास्तविक संसार ड्राइविङ काज सम्पृक्ष गर्छ र improved प्रदर्शन रिपोर्ट गर्छ दुबै DAgger र behavior cloning।
एक सम्बन्धित लाइन कुन गणना गरिन्छ परिवर्तन गर्छ लेबल को रूपमा। Spencer र सहकर्मीहरू को Expert Intervention Learning hold गर्छ कि "कुनै पनि मात्रा मा विशेषज्ञ प्रतिक्रिया, कि हस्तक्षेप वा non-intervention, जानकारी प्रदान गर्छ वर्तमान अवस्था को गुणस्तर को, कार्य को इष्टमता को, वा दुबै", formalised एक constraint को रूपमा शिक्षार्थी को value function मा र no-regret अनलाइन लर्निङ संग सुलझ। त्यो पढाइ अन्तर्गत, stretches जहाँ मानिस watched र केही नथे कमजोर positive साक्ष्य भन्दा खाली। EIL collision avoidance लर्छ लगभग एक मिनेट मा विशेषज्ञ नियन्त्रण को।

भेरिएन्ट्स side by side
| विधि | कसले गेट खोल्छ | संकेत | उपलब्ध आवश्यक | रिपोर्ट गरिएको |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | कसै पनि छैन — शिक्षार्थी सर्वदा ड्राइभ गर्छ | कुनै छैन; विशेषज्ञ प्रत्येक visited अवस्था लेबल गर्छ | एक विशेषज्ञ सक्षम नियन्त्रणमा नभई off-policy अवस्था लेबल गर्न | कुनै छैन-regret reduction शिक्षार्थीको अवस्था वितरण अन्तर्गत guarantee संग |
| HG-DAgger (Kelly et al., 2019) | मानिस निरीक्षक | निरीक्षक को निर्णय कि अवस्था असुरक्षित हो | कोइ watching, र नियन्त्रण को एक स्वच्छ handover | Beats DAgger र behavior cloning एक simulated र वास्तविक ड्राइविङ काज मा; पनि एक जोखिम threshold लर्छ |
| SafeDAgger (Zhang & Cho, 2016) | रोबोट | बाइनरी वर्गीकरण L2 विचलन को लागि सन्दर्भ को उपर tau | एक queryable सन्दर्भ नीति वर्गीकरण को लेबल को लागि | कम सन्दर्भ क्वेरी एक racing सिमुलेटर मा, तीव्र अभिसरण (कुनै आँकडा छैन) |
| EnsembleDAgger (Menda et al., 2019) | रोबोट | Ensemble भिन्नता र दूरी विशेषज्ञ कार्य को, दुबै threshold अन्तर्गत | एक ensemble नेटवर्क को + विशेषज्ञ को कार्य प्रत्येक पग मा | उन्नत सुरक्षा र लर्निङ pendulum र HalfCheetah मा |
| LazyDAgger (Hoque et al., 2021) | रोबोट, hysteresis संग | SafeDAgger को संकेत अलग entry र exit threshold संग | के SafeDAgger आवश्यक छ, प्लस दोस्रो threshold tune गर्न | ~60% कम संदर्भ स्विच 3 काज मा; ६०% उच्च सफलता YuMi fabric मा |
| ThriftyDAgger (Hoque et al., 2021) | रोबोट, एक बजेट अन्तर्गत | उपन्यास, वा काज पूरा को अनुमान गरिएको जोखिम | एक शिखर जोखिम estimator र एक बयान हस्तक्षेप बजेट | १००% सफलता execution समय मा; प्रयोगकर्ता अध्ययन (N=10): ५८% र ८०% लाभ अगलो सबै भन्दा अच्छो को मुकाबले |
| EIL (Spencer et al., 2020) | मानिस — non-intervention पनि गणना गर्छ | हस्तक्षेप र यसको अनुपस्थिति constraint को रूपमा value function मा | अनलाइन no-regret लर्निङ एक value constraint को उपर | Collision avoidance लगभग एक मिनेट मा विशेषज्ञ नियन्त्रण को |
हरेक गेट किन कमा, र के यो चार्ज गर्छ
"आवश्यक" स्तम्भ नीचे पढ गर्दा एक pattern बाहिर आउँछ: हरेक रोबोट-गेटेड संकेत को अन्दर एक proxy हो जो निर्माण गर्नु पर्छ, र प्रत्येक proxy यसको आफ्नो बिल छ।
- Discrepancy संकेत (SafeDAgger, LazyDAgger, आधा EnsembleDAgger को नियम को) एक सन्दर्भ नीति आवश्यक छ। या तपाइङ्को एक scripted विशेषज्ञ छ, केस जो दिलचस्प समस्या पहिले ही समाधान गरिन्छ, वा एक मानिस continuous कार्य उत्पादन गर्दा background मा त्यसैले एक दूरी calculated हो।
- Doubt संकेत calibrated epistemic अनिश्चितता आवश्यक छ। एक ensemble साना नियन्त्रण नेटवर्क को approximate गर्छ यो; एक ensemble एक तीन-अरब-parameter vision-language-action मडेल को एक स्मृति र latency समस्या पहिलो हो।
- Novelty र जोखिम संकेत एक शिखर अनुमान गर्न आवश्यक छ काज पूरा को, fit गरिएको पर्याप्त सफल र असफल rollout मा। एक काज तपाइङ्को अझै काम गर्न हो, कि डेटा round एक मा छैन।
- मानिस गेट ध्यान र केही अन्य आवश्यक छैन — केवल संकेत उपलब्ध दिन एक, कुनै नीति आर्किटेक्चर, कुनै अतिरिक्त मडेल प्रशिक्षण को।
- कुनै रोबोट गेट मानिस को कक्ष से हटाएको हो। तिनीहरू कम्म कम गर्छन् कति अक्सर मानिस act गर्नु पर्छ, कि कि गर्नु पर्छ उपस्थित।
एक quieter भिन्नता छ के गेट उत्पादन गर्छ। एक रोबोट गेट firing mid-trajectory हात एक व्यक्ति एक moving आर्म एक arbitrary pose मा। एक मानिस गेट अपरेटर क्षण छान्छ — पछि reach, पहिलो grasp, swing को माध्यम मा गर्न। दुबै बाट recovery segment समान रूपमा स्वच्छ नहु, र ती segment entire उत्पाद छन् राउन्ड को।
किन मानव-गेटेड रूप वास्तविक हार्डवेयर मा जित्छ
यो एक ईन्जिनियरिङ तर्क हो, benchmark परिणाम छैन — कुनै कागजात हामी found सब पाँच गेट को एक ही manipulator मा चल गर्दा एक ही नीति वर्ग संग। यो चार बिन्दु मा आराम गर्छ।
पहिलो, निरीक्षक को अन्दर पहिले ही छ। कसे एक SO-100 आर्म चलिरहेको छ attended बिना सामग्री को अगल्तिर जुन यो hit गर्न सक्छ। एक पल कोइ watching छ, marginal लागत राखेको तिनीहरू एक takeover बटन छ शून्य को करिब छ; एक calibrated जोखिम estimator निर्माण एक प्रकल्प हो।
दोस्रो, अनिश्चितता तपाइङ्को वास्तविक मा measure गर्न सक्दछ एक आधुनिक नीति अक्सर गलत मात्रा हो। एक diffusion वा flow-matching सिर प्राप्ति होमिओस्टेसिस emit गर्छ विभिन्न कार्य chunks को बीचमा, र त्यो variance सिर को लागि multimodality को प्रतिनिधित्व गर्न प्रशिक्षित गरिएको हो, epistemic ignorance अवस्था को बारे मा। EnsembleDAgger को doubt term एक ensemble प्रयोग गर्छ precisely पछाडि capture गर्न। दुबै दिखिन्छ एक ही सङ्ख्या र छैन; कार्य chunking र flow matching प्रविष्टि cover कसरी ती सिर कार्य emit गर्छ पहिलो स्थान मा।
तीसरो, असफलता कि matter गर्छ manipulation मा अक्सर semantic भन्दा statistically असामान्य। एक नीति closing gripper दुई centimetre जल्दी, वा reaching confidently गलत एक को लागि दुई समान cube, एक high-variance अवस्था मा छैन — यो confident र गलत छ। कुनै variance threshold त्यो catches; एक व्यक्ति watching catches यो तुरुन्त।
चौथो, लेबल गुणस्तर — original HG-DAgger बिन्दु, र सबै भन्दा अक्सर छोडिएको। लेबल सङ्कलन जो मानिस को अबाधित नियन्त्रण छ beat लेबल narrated एक moving सिस्टम मा। यदि लक्ष्य corrective डेटा मूल्य aggregating, proof को बोझ automated गेट संग छ।
चित्र flip गर्छ जब एक निरीक्षक जिम्मेवार छ धेरै रोबोट को लागि — regime ThriftyDAgger को प्रयोगकर्ता अध्ययन र Fleet-DAgger को formalisation target। एक fleet, मानिस ध्यान एक scarce संसाधन छ र एक imperfect आवंटन कुनै beat गर्छ। एक आर्म एक डेस्क मा तपाइङ्को त्यो regime मा छैन।
मानव-गेटेड loop, पहिले ही wired अप
Takeover एक चलिरहेको inference सत्र को समय, प्रत्येक-frame हस्तक्षेप flag चिह्नमा corrected segment, curating हरेक run गर्न correction वा मूल्यांकन, मिश्रण composing एक dataset स्रोत को तपाइङ्को छान, र जारी प्रशिक्षण एक existing checkpoint देखि built मा छन् भन्दा scripted हातमा। Takeover काम गर्छ एक नेता आर्म संग, वा keyboard र slider संग यदि तपाइङ्को एक छैन।
हेर्नुस् कसरी DAgger loop चल्छगेट आधा विधि हो; डेटा handling अर्को आधा हो
एक गेट frames निर्णय गर्छ कि मानिस drove, कि गर्न को साथ छैन, र दोस्रो निर्णय जहाँ राउन्ड सबी भन्दा अक्सर wasted छन्। पहिलो नियम एक D को DAgger मा stands: aggregate, replace गर्न छैन। Fine-tuning एक checkpoint शुद्ध रूपमा केही सय correction frame मा एक मडेल दिन्छ जो लगभग कुनै छैन देख्न वसूली र भुल्न को नाममात्र trajectory।
दोस्रो नियम कि हस्तक्षेप frame सामान्य frame छैन। Mandlekar et al. built एक दूर-teleoperation प्रणाली 6-DoF manipulation को लागि let अपरेटर monitor नीति र take over असफलता मा, तब प्रशिक्षित iteratively एक एल्गोरिदम संग कि "encourage नीति सिख्छ कसरी bottleneck traverse गर्न interventions द्वारा"; एजेन्ट trained ति डेटा पर outperformed एजेन्ट trained एक equal सङ्ख्या मा सामान्य प्रदर्शन नमूना। Sirius push विचार deployment मा, "re-weighing प्रशिक्षण नमूना approximated मानिस विश्वास को साथ र optimizing नीति weighted behavioral cloning संग"। दुबै आवश्यक प्रत्येक-frame marker हुन कि driven गरिएको मानिस, कारण किन intervention flag महत्व को बढी छ।
तीसरो नियम कि automatic मिश्रण एक trap हो। एक composed dataset जसको स्रोत तपाइङ्को enumerate गर्न सक्दन्न एक तपाइङ्को गर्न सक्दन्न debug जब अगलो राउन्ड बदतर हुन्छ। यो प्लेटफर्ममा compose पग स्पष्ट छ त्यो कारण — original dataset प्लस correction, episode selection प्रत्येक स्रोत प्रति, र परिणाम एक सामान्य छ LeRobot dataset कि sync र प्रशिक्षण गर्छ कुनै अन्य जस्तो; dataset documentation cover गर्छ format पक्ष।
| चरण एक राउन्ड मा | के यो उत्पादन गर्छ | सबी भन्दा सामान्य तरीकामा गलत गर्छ |
|---|---|---|
| Inference चल्छ recording संग चल | एक run नीति को आफ्नै अवस्था वितरणमा | Recorded सादा teleoperation को रूपमा, खोएको कि नीति चल रहेको थिएको |
| असफलता मा over लो | Correction segment एक प्रत्येक-frame हस्तक्षेप flag संग | Correcting cosmetic wobble, सिखाउँदै शैली भन्दा वसूली |
| Curate हरेक episode | सुधार, मूल्यांकन, वा discard | खोएको सबै कुनै; एक botched takeover खर्च अधिक episode भन्दा मूल्य थिएको |
| Sync correction | एक versioned dataset मूल को अगल्तिर | सुधार कि कहिले local मेसिन को छोड |
| Compose mixed dataset | मूल प्लस सुधार, स्पष्ट चयन | Silent auto-mixing, त्यसैले एक पछि regression trace गर्न सक्दन्न एक स्रोतमा |
| जारी एक checkpoint देखि | एक checkpoint initialised पहिलेको एक देखि | Expecting अनुकूलकर्ता resume; weight initialise मडेल, restore गर्दन अनुकूलकर्ता स्थिति |
एक गेट राखेको एक व्यक्ति वास्तविक गर्न सक्छ सेटिङ गर्न
"मानिस निर्णय गर्छ" एक specification छैन। दुई अपरेटर भिन्न threshold को साथ produce अतुलनीय राउन्ड, र एक दरिङ threshold produce एक trend तपाइङ्को पढ्न सक्दन्न। पहिलो राउन्ड अघि लिख trigger।
- नाम शर्त कि खुल्छ गेट — दृष्टिकोण off एक fixed मार्जिन भन्दा अधिक, gripper बन्द गर्दै केही मा, एक joint दरिङ एक limit गर्न, एक stall एक दोस्रो वा दुई को — र राख नयाँ unchanged राउन्ड को लागि।
- नाम के गर्दैन खुल्छ यो। Overshoot नीति recover गर्छ आफ्नो मा एक प्रशिक्षण सङ्केत; taking over त्यहाँ delete एक वसूली यो पहिले ही जान्दछ।
- Take over पहिलो एक स्वच्छ handover को लागि, हात वापस तुरुन्त अवस्था recoverable छ।
- लग किन तपाइङ्को took over, प्रत्येक episode प्रति। तीन राउन्ड पछि यो एक मात्र रेकर्ड छ कि लौर त्यो असफलता।
- राख क्यामेरा, task पाठ र अपरेटर constant राउन्ड को बीचमा। परिवर्तन एक र सङ्ख्या अतुलनीय हुन।
यांत्रिक रूपमा handover दुई भेरिएन्ट छन्। एक नेता आर्म संग, नेता को reach पर्नु पर्छ follower को वर्तमान pose पहिलो torque transfer, वा आर्म jump; यो alignment move को सबी भन्दा least-tested भाग हो वास्तविक हार्डवेयर मा chain को। एक नेता आर्म बिना takeover manual हो पहिलो keypress देखि: follower राखिएको छ अपरेटर nudges यो joint द्वारा joint keyboard देखि वा drag slider, सर्भर-पक्ष clamp को साथ राख प्रत्येक input साना — दम्पति degree प्रत्येक keypress, handful हरेक slider update, एक मानिस भन्दा एक large step एक राखिएको pose कसरी तपाइङ्को strip एक servo हो। चरण-दर-चरण संस्करण key binding को साथ छ SO-100 मा एक DAgger राउन्ड को walkthrough; background दुबै teleoperation mode मा छ teleoperation दस्तावेज र नेता-follower प्रविष्टि।

पढिराख् कि गेट केही गरेको
मानव-गेटेड राउन्ड को metric हस्तक्षेप दर: हस्तक्षेप frame डिभाइड गरिएको frame राउन्ड को द्वारा। यो एक काम छ — यदि यो fall गर्दैन राउन्ड को बीचमा, राउन्ड केही खरीद नथे, र अगलो एक परिवर्तन गर्नु पर्छ अन्य केही भन्दा डेटा को मात्रा।
यो एक biased metric छ र तपाइङ्को जान्नु पर्छ कसरी। यो measure अपरेटर को threshold का रूपमा नीति को competence, कारण किन trigger सूची राख fix; एक अपरेटर को relax एक सत्र को समय produce एक फेलिङ curve सेक किछ को साथ। यो पनि ignore गर्छ गम्भीरता — दस frame एक collision रोक्न र दस nudge एक grasp दिखिन्छ समान। जोडी यो साथ एक fixed मूल्यांकन सेट कुनै सुधार डेटा कहिले खीन्चिएको थिएको। लेख लगाउँदै एक DAgger loop काम गर्छ मूल्यांकन डिजाइन, सहित कसरी राख मूल्यांकन episode प्रशिक्षण मिश्रण को बाहिर।
- दिन एक काज गर्छ, कुनै अतिरिक्त मडेल calibrate गर्न
- Catches confident-र-गलत असफलता कुनै variance threshold detect गर्दैन
- उत्पादन सुधार recorded अपरेटर को अबाधित नियन्त्रण थिएको समय, एक क्षण तिनीहरू छान
- yield एक प्रत्येक-frame marker हस्तक्षेप-weighted विधि जस्तो IWR र Sirius consume
- लागत निरन्तर निरीक्षण; यो छैन scale एक व्यक्ति र धेरै रोबोट को।
- Depends अपरेटर consistency — एक दरिङ threshold corrupt हस्तक्षेप दर
- उत्पादन नहीं जोखिम मडेल आफ्नो मा; HG-DAgger को शिखर threshold र ThriftyDAgger को estimator अतिरिक्त machinery छन्
- गणना frame, परिणाम छैन
- सक्दैन रक्षा एक नीति जसको असफलता छ upstream नियन्त्रण को, जस्तो एक swapped क्यामेरा वा एक mislabelled काज स्ट्रिङ
खुल प्रश्न राख मा दृश्य मूल्य
benchmark कमजोर छन्। Spencer र सहकर्मीहरू परीक्षा गर्यो ती प्रयोग गरिएको test imitation लर्निङ दृष्टिकोण र ढूंढ "realizable र सरल र यस अपर्याप्त भन्दा बढी कठिन regime को त्रुटि compounding वास्तविक-विश्व निर्णय गर्दै समस्या" — र, आसपास साहित्य विरुद्ध, ढूंढ सादा behavior cloning गरेको राम्रो ती काज मा। त्यो कारण हुन skeptical कुनै ranking DAgger भेरिएन्ट rest ती काज मा, केही सङ्ख्या सहित तालिका को मा।
रोबोट गेट बड़े नीति नभेट्टिएको पनि। AIM काम replace अनिश्चितता एक proxy Q-function को साथ mimicking मानिस हस्तक्षेप नियम र रिपोर्ट एक ४०% सुधार take-over खर्च र लर्निङ दक्षता को मा ThriftyDAgger को — continuous र discrete नियन्त्रण मा, एक vision-language-action मडेल manipulator ड्राइभ मा नहीं। कि कोइ यी गेट ट्रान्सफर एक fine-tuned VLA ड्राइभ करने एक manipulator को लागि खुला छ। सर्भे एक सम्बन्धित बिन्दु गर्छ: क्षेत्रको terminology र संरचना unified नहु साहित्य बीचमा, जो बनाउँछ विधि compare गर्न कठिन। तपाइङ्को आफ्नो आर्म मा, तपाइङ्को लग एक साक्ष्य हुन छ तपाइङ्को।
छ HG-DAgger साच्चै DAgger यदि मानिस केवल लेबल मध्यम interventions।▾
यो राख भाग कि matter — डेटा सङ्कलन अन्तर्गत अवस्था वितरण शिक्षार्थी induce, aggregated के आएको पहिलो — र drop भाग कि गर्दैन हार्डवेयर संग सम्पर्क survive। Kelly et al. present यो एक भेरिएन्ट को रूपमा; २०११ को कुनै छैन-regret guarantee carry गर्दैन over unchanged।
गर्न सक्छ मैले एक रोबोट गेट उपयोग एक fine-tuned VLA नीति एक SO-100 को उपर।▾
सीधाफोरवर्ड नहीं। SafeDAgger को वर्गीकरण आवश्यक एक queryable सन्दर्भ नीति तपाइङ्को छैन। EnsembleDAgger आवश्यक एक ensemble, जो एक बहु-अरब-parameter मडेल को लागि मतलब एक दोस्रे कपिज स्मृति मा प्लस तिनीहरू को inference लागत। ThriftyDAgger आवश्यक एक जोखिम estimator fit सफलता र असफलता मा कि अस्तित्व मा छैन तपाइङ्को पहिलो राउन्ड।
कति लामो एक एकल takeover हुनु पर्छ।▾
लामो पर्याप्त एक अवस्था को लागि नीति जारी रहन सक्छ, र अन्य छैन: extended takeover गर्न राउन्ड एक प्रदर्शन सत्र र flood सुधार सेट को साथ नाममात्र आचरण। LazyDAgger को निष्कर्ष काट अन्य तरीकामा पनि — कम बहुत छोटो स्विच एक तिनीहरू आफ्नै लागत।
चाहिँ मैले प्रशिक्षण केवल corrected segment मा।▾
नहीं — त्यो सबी भन्दा सामान्य तरीकामा हो एक राउन्ड waste गर्न। एक मडेल fine-tuned केवल मा वसूली देख्न लगभग केही भन्दा वसूली। मिश्रण सुधार मूल dataset मा स्रोत छान explicitly; अगलो चल, हेर्नुस् हस्तक्षेप-weighted दृष्टिकोण जस्तो IWR वा Sirius, जो up-weight मानिस-driven frame भन्दा अलग गर।
के यदि हस्तक्षेप दर fall नहीं एक राउन्ड पछि।▾
लिन यो face मूल्य: राउन्ड मदत नथे। पहिलो सुधार जोडी गर्न पहिलो, सस्तो व्याख्या — गर अपरेटर को threshold drift, थे सुधार cosmetic, गर composed dataset वास्तविक गर्न सक्छ, थे प्रशिक्षण initialised intended checkpoint देखि। एक राउन्ड कि silent शुरु भएको base मडेल देख ठीक एक राउन्ड कि लर्न गर्न असफल।
गर non-intervention गर जानकारी।▾
अन्तर्गत Expert Intervention लर्निङ, छ: stretches जहाँ निरीक्षक watched र नथे कार्य weak साक्ष्य को रूपमा पढ छन कि अवस्था र कार्य acceptable थे, formalised एक constraint को रूपमा value function मा। अधिकांश व्यावहारिक pipeline, यो सहित, निशान मात्र के मानिस drove।
एक एकल आर्म एक डेस्क मा पर्न छान: गेट आफ्नो साथ राख, लिख के खुल्छ यो, र खर्च प्रयास डेटा handling मा यसको पछाडि भन्दा स्विच स्वचालित। प्लेटफर्म पक्ष described छ DAgger loop पेज, प्रशिक्षण विकल्प प्रत्येक नीति परिवार अन्तर्गत प्रशिक्षण र pricing। पृष्ठभूमि को लागि, शुरु imitation लर्निङ र imitation लर्निङ SO-100 उपर; एक पहिलो राउन्ड को लागि, राउन्ड तपाइङ्को पहिलो नीति को छोटो पथ हो।
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started