
साधारण DAgger एखाद्या मानवाला रोबोट अजूनही चालत असताना स्थितींना लेबल करण्यास सांगते. वास्तविक हार्डवेअरवर हे असुरक्षित आहे आणि ते खराब लेबल तयार करते. गेटेड व्यतिक्रम अंध लेबलिंगला गेटने बदलतात ज्याला कोणी धरून ठेवले पाहिजे: HG-DAgger मध्ये मानव, SafeDAgger मध्ये सुरक्षा वर्गीकारक, EnsembleDAgger मध्ये ensemble चे मतभेद, ThriftyDAgger मध्ये बजेटेड नवीनता-आणि-जोखीम अनुमान. हा लेख त्यांची तुलना करतो कोण गेट मालकी करतो, कोणता सिग्नल ते उघडतो, आणि प्रत्येकाचा खर्च किती आहे - आणि वास्तविक बाहूसह संपर्क सुरक्षित राहणारा मानव-गेटेड फॉर्म का आहे.
क्लोन केलेली पॉलिसी जिथे तिचा प्रशिक्षण डेटा संपला तिथे अपयशी होते. निराकरण म्हणजे प्रदर्शकाच्या स्थिती वितरणाऐवजी पॉलिसीच्या स्वतःच्या स्थिती वितरणाखाली डेटा संग्रह करणे सुरू ठेवणे, जे DAgger करते आणि डेटासेट एकत्रीकरणाचा परिचय प्रथम तत्वांपासून कव्हर करते. हे मूळ अल्गोरिदमचा अस्ताव्यस्त भाग खुला सोडते: शिक्षक चालत असताना, तज्ञाने प्रत्येक स्थितीसाठी ते काय केले असते हे सांगणे अपेक्षित आहे, नियंत्रणाशिवाय.
सिम्युलेटरमध्ये लिपिबद्ध तज्ञासह हे विनामूल्य आहे. टेबलवर त्याच्या पुढे वास्तविक बाहू असलेली जागा ही मुक्त किंवा सुरक्षित नाही. HG-DAgger लेखक एखादा आक्षेप अचूकपणे सांगतात: अशा नमुना योजना "तज्ञाला प्रणालीच्या पूर्ण नियंत्रणाशिवाय क्रिया लेबल प्रदान करण्याची आवश्यकता आहे", ज्या "सुरक्षा कमी करू शकतात आणि मानव तज्ञांचा वापर करताना, संवेदनशील अॅक्ट्युएटर लेग मुळे संग्रहीत लेबलची गुणवत्ता खराब करणे शक्य आहे" (Kelly et al., 2019). दोन अपयश त्या वाक्यात लपलेले आहेत: पॉलिसी अशा स्थितींमध्ये ड्राइव करणे सुरू ठेवते ज्या कोणीही हवेत नाहीत, आणि त्या जोखमीसह खरेदी केलेले लेबल नियंत्रण धारण करताना मानव तयार करतात त्याच्यापेक्षा वाईट आहेत. खाली दिलेला प्रत्येक व्यतिक्रम समान प्रश्नाचे उत्तर देतो - नियंत्रणावर गेट ठेवा आणि ते कधी उघडते हे कोणीतरी ठरवू द्या. ते भिन्न आहेत कोण तो कोणीतरी आहे त्यामध्ये.
लहान आवृत्ती
- •गेटेड व्यतिक्रम अंध लेबलिंगला पॉलिसी नियंत्रण आणि तज्ञ नियंत्रणामध्ये स्विच करून बदलतात. त्यांना वेगळे करणे हे कोण स्विच मालकी करतो.
- •HG-DAgger मानवाला स्विच देते आणि फक्त डेटा एकत्रित करते जे मानवाकडे अखंड नियंत्रण होते अशा वेळी रेकॉर्ड केलेले.
- •SafeDAgger हे एक बायनरी वर्गीकारकाला देते जो संदर्भ पॉलिसीपासून विचलनाचा अंदाज लावतो; EnsembleDAgger एकाच वेळी कमी ensemble भिन्नता आणि तज्ञ क्रिया पर्यंत लहान अंतर आवश्यक करते.
- •LazyDAgger हिस्टेरेसिस जोडते जेणेकरून नियंत्रण पिंग-पॉंग होत नाही; ThriftyDAgger स्पष्ट हस्तक्षेप बजेटाखाली नवीनता किंवा अनुमानित जोखमावर गेट करते.
- •रोबोट-गेटेड सिग्नलांना एखाद्या बारीक-ट्यून केलेल्या VLA ला शौकीन-वर्गीय बाहूवर सामान्यतः कमी आहे असे गरज आहे: एक संदर्भ पॉलिसी, एक स्वस्त ensemble, किंवा कॅलिब्रेटेड epistemic अनिश्चितता.
- •गेट अर्धा पद्धती आहे. हस्तक्षेप सेगमेंटला त्यानंतर काय होते - मिश्रण, वजन, एकत्र - हे ठरवते की गोल सुधारली की नाही.
मानव-गेटेड आणि रोबोट-गेटेड: फरक जो महत्त्वाचा आहे
संवाद करणारे अनुकरण शिक्षणाचा स्वतःचा सर्वेक्षण आहे; Celemin आणि सहकर्मी त्यांची सूची फिडबॅक प्रकार, इंटरफेस, शिक्षण मॉडल, वापरकर्ता अनुभव, अनुप्रयोग आणि बेंचमार्कसह तैयार करतात. आपल्या अभियांत्रिकीला निर्णय घेणारा फरक त्या अक्षांपेक्षा सरळ आहे, आणि अलीकडील काम त्याला थेट नाव देते: एक पद्धती human-gated असते जेव्हा पर्यवेक्षक हस्तक्षेप कधी करायचे हे ठरवते, आणि robot-gated असते जेव्हा एजेंट साहाय्य मागण्याचा वेळ कधी असा अनुभव होता (Cai et al., 2025). सर्व काही ते दोन पर्यायांपैकी एका सेवा करणार्या यंत्रसंरचना आहे. व्यापार सुरुवातीपासून दृश्यमान आहे: मानव गेटला सतत लक्ष खर्च होतो, आणि रोबोट गेट त्या लक्षला परत देण्याचे वचन देते - परंतु केवळ तर सिग्नल जो तो गेट करतो तो विश्वसनीय असेल, आणि त्या सिग्नलची निर्माण करणे हे स्वतःचे संशोधन समस्या आहे.
SafeDAgger: एक वर्गीकारक जो त्याचे स्वतःचे विचलन अंदाज लावतो
Zhang आणि Cho यांचे SafeDAgger (2016) हे या गेटांचे सर्वात लवकरचे आहे. संदर्भ पॉलिसीचा प्रश्न करणे हा महाग भाग आहे, म्हणून दुसरा, लहान नेटवर्क - सुरक्षा पॉलिसी - प्रश्न करणे मूल्यवान आहे का हे अंदाज लावते. हे "एक बायनरी लेबल परत करते ज्यासह प्राथमिक पॉलिसी प्रश्नाशिवाय संदर्भ पॉलिसीपासून विचलन होण्याची शक्यता आहे". लेबल दोन पॉलिसीच्या क्रियांमधील वर्गीय L2 विचलन आणि थ्रेसहोल्ड tau विरुद्ध परिभाषित केले जाते, आणि वर्गीकारक बायनरी क्रॉस-एन्ट्रॉपी सह फिट केले जाते. रन वेळी हे प्रत्येक स्थितीसाठी ठरवते की शिक्षक चालणे सुरू ठेवते किंवा संदर्भ ओव्हरटेक करते. अमूर्त अनुसूचीत संदर्भ प्रश्नांमध्ये कमी संख्या अहवाल देते आणि convergence गती-अप असे म्हणतात कि लेखकांना एक स्वचलित अभ्यासक्रम प्रभाव दिला आहे, दोन्हीसाठी एक आकृती न देता.
पकड परिभाषामध्ये आहे, परिणामांमध्ये नाही. वर्गीकारक प्रशिक्षण करण्यासाठी त्याला फिट करण्यासाठी वापरली जाणारी प्रत्येक स्थितीवर संदर्भ पॉलिसीची क्रिया आवश्यक आहे, जे हे गृहीत धरते की संदर्भ दुसरा प्रोग्राम आहे. जर आपला संदर्भ नेता बाहूसह एक व्यक्ती असेल, तर त्या लेबल सेटची किंमत कमी नाही आणि पद्धती ती पद्धती ज्यासाठी डिজाइन केली होती त्यापासून वंचित होते.
EnsembleDAgger: संदेह आणि विसंगति, दोन्ही
Menda, Driggs-Campbell आणि Kochenderfer (2019) गेटला संभाव्य प्रश्नासह हाताळतात. EnsembleDAgger "न्यूरल नेटवर्कचे ensemble वापरून Gaussian Process अंदाज लावतो" आणि ensemble भिन्नतेला आत्मविश्वास प्रॉक्सी म्हणून वाचतो: उच्च भिन्नता म्हणजे प्रशिक्षण डेटा विपरीत एक क्षेत्र, जे - हे गृहीत धरून की तज्ञ अपयश स्थितीचे परिहार करतो - अपयशाच्या जवळ असणे सह संबंधित आहे. नियम एक conjunction आहे. शिक्षकाला त्याच्या माध्य क्रिया आणि तज्ञाच्या क्रिया दरम्यान L2 अंतर एक थ्रेसहोल्डाखाली राहते (विसंगति) तेव्हा कार्य करू शकते आणि त्याच्या अनुमानित क्रियाची भिन्नता दुसऱ्या (संदेह) अंतर्गत राहते. दोन्हीपैकी एकही अपयशी झाल्यास, तज्ञ नियंत्रण घेतो. उद्देश शिक्षकाचा साझा वाढवणे आहे अपयशाची संभाव्यता मर्यादित करताना; कागदपत्र उलट पेंडुलम आणि MuJoCo HalfCheetah वर DAgger व्यतिक्रमांच्या विरुद्ध सुधारीत सुरक्षा आणि शिक्षण अहवाल देते.
हे शांतपणे पूर्ण नियम हाताशिवाय पर्यवेक्षणासाठी disqualifies करते. शिक्षकाची क्रिया आणि तज्ञांची दरम्यान अंतर त्या स्थितीवर, त्या क्षणी तज्ञांची क्रिया आवश्यक आहे. लिपिबद्ध तज्ञासह, ठीक आहे. एक मानवाबरोबर, मानवाने सतत क्रिया तयार करायला हवी - यथार्थात गेटेड व्यतिक्रम दूर करायचे असे अचूक बोझ. संदेह शब्द हाताशिवाय आहे; conjunction नाही.
LazyDAgger: स्विच चॅटरिंग बंद करा
Hoque आणि सहकर्मी (2021) स्विच स्वतःचा खर्च आक्रमण केले. प्रत्येक हस्तक्षेप "इतर काम व्यापृत करते ज्या मानव करत आहे, पर्यवेक्षक आणि स्वायत्त नियंत्रणामधील context स्विचीसह latency होते, आणि कार्य करण्यासाठी वेळ लागतो". एक गेट जो मिनिटाला दहा वेळा उघडते आणि बंद होते तो दहा सेकंदांसाठी एकदा उघडल्या असेल त्यापेक्षा वाईट आहे, समान स्वायत्त साझेला. LazyDAgger SafeDAgger असममित थ्रेसहोल्डसह विस्तारते - पर्यवेक्षक नियंत्रण प्रविष्ट करणे कठीण आहे ते मध्ये राहणे - म्हणून प्रणाली सीमा येथे थरथर करत नाही. सिम्युलेशनमध्ये हे "3 continuous नियंत्रण कार्यांवर SafeDAgger च्या तुलनेत सरासरी 60% context स्विचेस कमी करू शकते जबकि state-of-the-art पॉलिसी कार्यक्षमता राखते"; ABB YuMi सह तंतू मॅनिपुलेशनमध्ये हे "60% context स्विचेस कमी करते वेळी execution वेळी SafeDAgger च्या तुलनेत 60% उच्च यश दर साध्य करते".
ThriftyDAgger: नवीनता किंवा जोखीम, बजेट अंतर्गत
ThriftyDAgger (Hoque et al., CoRL 2021) पर्यवेक्षकाच्या बजेटपासून सुरुवात करते पॉलिसीच्या ऐवजी. हे "हस्तक्षेप मागण्यासाठी एक शिखरित स्विचिंग पॉलिसी वापरते केवळ स्थितीपर्यंत जी पुरेशी (1) नवीन आहे, जिथे रोबोट पॉलिसीकडे अनुकरण करण्यासाठी कोणती संदर्भ वर्तन नाही, किंवा (2) opaque, जिथे रोबोटाला कार्य संपूर्ण करण्यामध्ये कमी आत्मविश्वास आहे", त्या जोखमी अनुमान करण्यासाठी नवीन मेट्रिकसह. बजेट एक इनपुट आहे, परिणाम नाही: तुम्ही किती मानव वेळ खर्च कराल असे राज्य करते. Execution वेळी लागू केल्यानंतर पद्धती "सिम्युलेशन आणि शारीरिक कार्य दोन्हीवर 100% सफलता दर साधते", आणि एक दहा भाग अभ्यास नियंत्रण तीन-रोबोट fleet एक concentration कार्य सह अहवाल देते की हे "58% आणि 80% अनुक्रमे मानव आणि रोबोट कार्यक्षमता वाढवते पुढील सर्वश्रेष्ठ अल्गोरिदमच्या तुलनेत पर्यवेक्षक बोझ कमी करते". fleet सेटिंग हे या कार्याचे natural होम आहे; Fleet-DAgger नंतर multiple रोबोट आणि पर्यवेक्षकांसह interactive fleet शिक्षण formalized, Return on Human Effort हे प्रमाण optimize करण्याचा प्रस्ताव देते.
HG-DAgger: मानव गेट धारण करते
Kelly et al. (2019) दुसऱ्या मार्गापर्यंत जाते. कोणतीही switching पॉलिसी नाही. शिक्षकाची rollout होते "तज्ञ हे पाहण्यापर्यंत की नवजात स्थितीच्या state space चे unsafe क्षेत्रामध्ये प्रविष्ट केले", ज्यानंतर तज्ञ नियंत्रण घेते आणि प्रणाली परत guide करते. एकत्रीकरण नियम कठीण भाग आहे: "तज्ञांची क्रिया लेबले केवळ या recovery trajectories दरम्यान संग्रहीत आणि dataset मध्ये जोडली जातात, ज्यात मानव तज्ञाकडे अखंड नियंत्रण असते." काहीही लेबल केले जाते नाही जेव्हा मानव एक दर्शक असतो.
हे स्विचवर थांबत नाही. HG-DAgger हे "एक सुरक्षा थ्रेसहोल्ड शिका एक मॉडल-अनिश्चितता-आधारित जोखीम मेट्रिकसाठी जो पूर्ण प्रशिक्षण नवजातांची कार्यक्षमता state space चे भिन्न क्षेत्रांमध्ये अंदाज लावण्यासाठी वापरला जाऊ शकतो": हे logs की कसे अनिश्चित शिक्षक होता क्षणांमध्ये तज्ञ intervened आणि average करते शिक्षक सर्वात समान शिक्षक त्याच्या अंतिम फॉर्मला मध्ये शेवटचा quarter त्या रेकॉर्डच. हे नाही एक गेट रोबोट operates परंतु एक diagnostic तुम्हाला सांगते जिथे तयार पॉलिसी expected राखून आहे. मूल्यांकन एक simulated आणि real-world ड्राइविंग कार्य covers आणि अहवाल depart सुधारीत कार्यक्षमता दोन्ही DAgger आणि behavior क्लोनिंग विरुद्ध.
एक संबंधित line बदलते काय counts लेबल म्हणून. Spencer आणि सहकर्मीचे Expert Intervention Learning दृढ करते की "कोणतीही quantity तज्ञ feedback, intervention किंवा गैर-हस्तक्षेप द्वारे, bilaterally information चालू quality वर्तमान state, optimality क्रिया, किंवा दोन्ही", formalized value फंक्शन वर एक constraint असे आणि no-regret online learning सह solve. त्या reading अंतर्गत, stretches जिथे मानव watched आणि nothing केले weak positive प्रमाण ऐवजी empty. EIL learns collision avoidance लगभग एक मिनिट तज्ञ नियंत्रण पासून.

व्यतिक्रम बाजूला बाजू
| पद्धती | गेट कोण उघडतो | सिग्नल | उपलब्ध गरज | रिपोर्ट केले |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | कोणी नाही - शिक्षक नेहमी drives | कोणीही नाही; तज्ञ हर एक visited state लेबल करते | एक तज्ञ सक्षम label off-policy states नियंत्रणाशिवाय | No-regret reduction शिक्षकाचे state distribution अंतर्गत गॅरेंटी सह |
| HG-DAgger (Kelly et al., 2019) | मानव पर्यवेक्षक | पर्यवेक्षकाचे판断की state unsafe आहे | कोणीतरी watch, आणि एक clean handover नियंत्रणचे | Beats DAgger आणि behavior cloning simulated आणि real ड्राइविंग कार्य वर; साथे learns एक जोखीम threshold |
| SafeDAgger (Zhang & Cho, 2016) | रोबोट | बायनरी classifier L2 deviation साठी संदर्भ above tau पासून | एक queryable संदर्भ पॉलिसी classifier लेबल साठी | कमी संदर्भ queries racing सिम्युलेटर मध्ये, faster convergence (कोणती आकृती दिली नाही) |
| EnsembleDAgger (Menda et al., 2019) | रोबोट | Ensemble भिन्नता आणि दूरी तज्ञ क्रिया दोन्ही, दोन्ही threshold अंतर्गत | एक ensemble नेटवर्क plus तज्ञ क्रिया प्रत्येक step वर | सुधारीत सुरक्षा आणि शिक्षण pendulum आणि HalfCheetah वर |
| LazyDAgger (Hoque et al., 2021) | रोबोट, hysteresis सह | SafeDAgger सिग्नल अलग entry आणि exit thresholds सह | काय SafeDAgger गरज, plus दुसरी threshold tune करण्यासाठी | ~60% कमी context switches 3 कार्य वर; 60% उच्च सफलता YuMi fabric वर |
| ThriftyDAgger (Hoque et al., 2021) | रोबोट, बजेट अंतर्गत | नवीनता, किंवा अनुमानित जोखीम कार्य पूर्ण नकरण्याची | एक learned जोखीम estimator आणि एक राज्य हस्तक्षेप बजेट | 100% सफलता execution वेळी; user study (N=10): 58% आणि 80% gains पुढील-best विरुद्ध |
| EIL (Spencer et al., 2020) | मानव - non-intervention गणनाए बरोबर | हस्तक्षेप आणि त्याचे absence constraints value फंक्शन वर | Online no-regret learning value constraint वर | Collision avoidance लगभग एक मिनिट तज्ञ नियंत्रण पासून |
प्रत्येक गेट काय खरेदी करता, आणि काय हे शुल्क करते
"needs" column खाली read आणि एक pattern बाहेर पडता: हर एक रोबोट-gated सिग्नल तिथे एक proxy आहे असे manufactured गरज, आणि प्रत्येक proxy त्याचे स्वतःचे बिल आहे.
- Discrepancy सिग्नल (SafeDAgger, LazyDAgger, half EnsembleDAgger नियम) एक संदर्भ पॉलिसी आवश्यक. किंवा तुम्हाला एक लिपिबद्ध तज्ञ आहे, ज्यामध्ये interesting समस्या आधीच हल केली आहे, किंवा एक मानव क्रिया तयार ठेवणे background मध्ये जेणेकरून अंतर computed असू शकेल.
- Doubt सिग्नल grained epistemic अनिश्चितता आवश्यक. एक छोटा नियंत्रण नेटवर्क ensemble त्यांची approximate; एक तीन-अरब-parameter vision-language-action मॉडल एक memory आणि latency समस्या पहिले.
- नवीनता आणि जोखीम सिग्नल एक learned estimator कार्य पूर्ण आवश्यक, fitted enough सफल आणि failed rollouts वर. एक कार्य वर तुम्ही अजून काम पाचन, वह डेटा राउंड एक मध्ये मौजूद नाही.
- मानव गेट ध्यान आणि काहीही else आवश्यक - एकमात्र सिग्नल उपलब्ध दिन एक, कोणती पॉलिसी आर्किटेक्चर, कोणती extra मॉडल साथ train.
- कोई भी रोबोट गेट मानव कमरा हटाता नाही. ते कमी कर्ण अक्सर मानव कार्य गरज, नहीं अगर ते मौजूद होना चाहिए.
एक quieter difference आहे काय gate produces. एक robot gate mid-trajectory firing हाते एक person एक moving बाहू arbitrary pose अंदाजे. एक human gate ऑपरेटर क्षण निवडणे द्या - reach नंतर, grasp अगोदर, नहीं अर्ध swing. recovery segments दोनपासून नहीं equally clean, आणि those segments पूरा product राउंड आहे.
का मानव-gated फॉर्म जीतते real hardware वर
हे एक अभियांत्रिकी argument आहे, नहीं एक benchmark result - कोणही paper आम्ही found runs सर्व पाच gates same manipulator वर same policy class सह. हे रेस्ट चार points वर.
पहिली, पर्यवेक्षक तिथे anyway आहे. कोणी नहीं leaves एक SO-100 arm चालणे unattended objects पुढे जी ते knock-over करू शकते. एक बार कोणीतरी watching आहे, marginal cost देणे त्यांना एक takeover बटण नजीक शून्य आहे; एक grained जोखीम estimator निर्माण एक project आहे.
दुसरी, uncertainty तुम्ही actual measure वर एक आधुनिक policy अक्सर wrong quantity आहे. एक diffusion किंवा flow-matching head उत्पादन variance across sampled क्रिया chunks, आणि वह variance reflects multimodality head train किया होता represent करण्यासाठी, नहीं epistemic ignorance state सर्वोच्च. EnsembleDAgger doubt अवधि वापरते एक ensemble precisely capture latter. दोन्ही लाइन same number लगो नहीं; action chunking आणि flow matching entries cover कसे those heads emit क्रिया पहिली जागा मध्ये.
तीसरा, failures ते मायने manipulation मध्ये अक्सर semantic ऐवजी statistically unusual. एक policy closing gripper दोन centimeters लवकर, किंवा reaching confidently लवकर wrong एक दोन identical cubes, नहीं high-variance state - ते confident आणि गलत. कोणही variance threshold catches वह; एक person watching catches ते तुरंत.
चौथा, label गुणवत्ता - original HG-DAgger point, आणि one सबसे often लंघन. Labels संग्रहीत अगर मानव uninterrupted control हराते beat labels narrated over एक moving system. अगर goal सुधारात्मक डेटा worth aggregating, burden proof lies साथ automatic gate.
picture flips अगर one पर्यवेक्षक responsible बहुत सारी robots - regime ThriftyDAgger user study आणि Fleet-DAgger formalization target. साथ एक fleet, human attention scarce संसाधन आहे आणि एक अपूर्ण allocation beats कोणही. साथ एक arm एक desk तुम्ही नहीं आहे उस regime मध्ये.
मानव-gated loop, already wired up
Takeover चलते inference सत्र दरम्यान, per-frame हस्तक्षेप flags सुधारात्मक segments वर, curating हर एक run सुधार किंवा मूल्यांकन, composing मिश्रित dataset स्रोत तुम्ही निवडता, आणि सुरू करणे प्रशिक्षण existing checkpoint पासून built-in आहेत ऐवजी scripted hand द्वारा. Takeover काम नेता arm सह, किंवा keyboard आणि sliders साथ अगर तुम्ही एक नहीं है.
पहा कसे DAgger loop चलतेgate अर्ध method आहे; डेटा handling अन्य अर्ध
एक gate decides जो frames एक मानव drove, नहीं क्या गर्न त्यांना सह, आणि वह दूसरा decision जहाँ rounds सबसे अक्सर wasted आहे. पहिली नियम है one D मध्ये DAgger stands साथ: aggregate, नहीं बदलना. Fine-tuning एक checkpoint विशुद्ध एक कुछ सौ correction frames वर देता तुम्हाला एक model असे seen लगभग कुछ नहीं परंतु recoveries आणि अनुभव forgotten nominal trajectory.
दूसरी नियम है intervention frames नहीं ordinary frames. Mandlekar et al. तयार एक remote-teleoperation system 6-DoF manipulation साथ operatorsRus monitor करण्यासाठी policies आणि take over failure वर, तब प्रशिक्षण iteratively एक algorithm साथ असे "encourages policy शिखरित कसे traverse bottlenecks through interventions"; agents प्रशिक्षण अन ডেটा outperformed agents प्रशिक्षण एक equal संख्या ordinary demonstration नमुना. Sirius धक्का idea deployment मध्ये, "re-weighing training नमुना साथ approximated human trust आणि optimizing policies साथ weighted behavioral cloning". दोन्ही गरज एक per-frame marker काय human-driven, जो का intervention flag गुणार अधिक यह दिखता।
तीसरी नियम जो automatic mixing एक trap आहे. एक composed dataset किसका स्रोत तुम्ही नहीं enumerate एक तुम्ही नहीं debug कर सकता जब अगला गोल खराब मिलता. पर इस प्लेटफॉर्म compose step स्पष्ट है कि कारण - मूल dataset प्लस सुधार, episode चयन प्रति source, आणि result एक ordinary LeRobot dataset असे syncs आणि trains याचे किसी अन्य जैसे; dataset documentation covers format side.
| कदम एक राउंड मध्ये | काय यह produces | सबसे आम तरीका यह गलत चला जाता है |
|---|---|---|
| चलाते inference रिकॉर्डिंग साथ ऑन | एक चलाता पॉलिसी स्वतःचे state distribution अंतर्गत | रिकॉर्ड साथ सादा teleoperation, खोना एक policy चालणे |
| ले ओवर failure वर | सुधार segments साथ एक per-frame हस्तक्षेप flag | सुधार cosmetic wobble, शिक्षण शैली ऐवजी एक recovery |
| क्यूरेट हर एक episode | सुधार, मूल्यांकन, किंवा discards | रखना सब; एक botched takeover खर्च अधिक तुलना episode योग्य होता |
| सिंक सुधार | एक versioned dataset बजे original | सुधार असे कभी छोड़ना local machine |
| Compose मिश्रित dataset | मूल प्लस सुधार, explicit चयन | मूक auto-mixing, तो एक बाद regression नहीं ट्रेस हो सकता source को |
| जारी रखें एक checkpoint पासून | एक checkpoint initialised पिछली एक से | उम्मीद एक optimizer फिर; वजन initialize model, वह नहीं restore अनुकूलक state |
सेटिंग एक गेट एक व्यक्ति actually hold कर सकता
"मानव decides" नहीं एक विनिर्देश. दोन operators विभिन्न threshold के साथ produce incomparable राउंड, आणि एक दर्फिंग threshold produces एक ट्रेंड तुम नहीं read कर सकता. लिखते trigger list गर्न पहले पहिली चलाता.
- नाम condition जो खुले gate - दृष्टिकोण अप निश्चित margin से, gripper बंद करने पर नहीं, एक joint दर्फिंग की ओर एक सीमा, एक stall अधिक सेकंड या दोन - आणि रखना list अपरिवर्तित राउंड से.
- नाम काय नहीं खुले. Overshoot पॉलिसी recovers पासून अपने ऑन है प्रशिक्षण सिग्नल; लेते ओवर वहाँ deletes एक recovery यह आधीं करे।
- ले ओवर जल्दी clean handover के लिए, हाथ वापस तुरंत state recoverable हो है।
- लॉग क्यो तुम ले ओवर, प्रति episode. तीन राउंड बाद यह केवल रिकॉर्ड है अगर same failure रिटर्न.
- रखना कैमेरा, कार्य पाठ, आणि ऑपरेटर constant भर राउंड. बदलना एक आणि संख्या बंद हो जाता है तुलनीय.
यांत्रिकली handover दोन variant आहे. साथ एक नेता arm, नेता पहुंचना गरज follower वर्तमान pose अगर torque transfer, या arm jumps; यह alignment चले is least-परीक्षण भाग chain वर real hardware. बिना एक नेता arm takeover मैनुअल पहली keypress से: follower है आयोजित आणि ऑपरेटर nudges यह joint द्वारा joint keyboard पासून किंवा drags sliders, साथ server-side clamps राखना प्रत्येक input छोटा - एक कुछ डिग्री प्रति keypress, एक handful प्रति slider अपडेट, कारण एक large कदम एक held pose मध्ये कसे तुम strip एक servo. step-by-step version साथ key bindings है मध्ये walkthrough एक DAgger राउंड एक SO-100 वर; पृष्ठभूमि दोन्ही teleoperation modes है मध्ये teleoperation docs आणि leader-follower entry.

पढ़ना अगर gate किया कुछ
metric एक मानव-gated राउंड है intervention दर: हस्तक्षेप frames विभाजन frames चलाता. यह एक job - अगर यह नहीं राउंड भर गिरता, राउंड खरीद कुछ नहीं, आणि अगला एक गरज बदलना कुछ ऐवजी डेटा की राशि.
यह एक biased मेट्रिक आणि तुम जाणून आणि कसे. यह measure ऑपरेटर threshold ज्यादा पॉलिसी अनुभव, जो क्यों trigger list रहता fixed; एक ऑपरेटर कौन relax सत्र वर produces एक गिरता वक्र साथ कुछ नहीं पीछे. यह भी ignores गंभीरता - दस frames बंद एक टकराव आणि दस nudge एक grasp दिखना identical. जोड़ी यह साथ एक fixed मूल्यांकन सेट कोणी correction डेटा कभी खींचा गया.लेख वर measuring एक DAgger loop काम through मूल्यांकन design, समेत कसे रखना मूल्यांकन episode बाहर प्रशिक्षण मिश्रण.
- काम दिन एक पर, कोणी पॉलिसी आर्किटेक्चर, कोणी extra मॉडल कैलिब्रेट करने के लिए
- Catches confident-and-wrong failures कोई variance threshold detects
- Produces सुधार रिकॉर्ड जबकि ऑपरेटर होता full नियंत्रण, एक क्षण वह चुने
- दाखला एक per-frame मार्कर असे हस्तक्षेप-weighted तरीका IWR आणि Sirius खपत
- Cost निरंतर पर्यवेक्षण; यह नहीं scale एक व्यक्ति आणि बहुत सारी robots को
- Depends ऑपरेटर सामंजस्य - एक दर्फिंग threshold corrupts हस्तक्षेप दर
- Produces नहीं जोखीम मॉडल अपने आप पर; HG-DAgger learned threshold आणि ThriftyDAgger estimator अतिरिक्त यंत्रसंरचना हैं
- Counts frames, नहीं परिणाम
- कर नहीं बचा सकते एक पॉलिसी किसका असफल upstream है नियंत्रण, जैसे एक swapped कैमेरा किंवा एक mislabelled कार्य स्ट्रिंग
खुली सवाल योग्य रखना दृष्टि मध्ये
benchmark कमजोर हैं. Spencer आणि सहकर्मी परीक्षा किया वह imitation शिक्षण परीक्षण दृष्टिकोण आणि found वह "realizable आणि सरल आणि इस प्रकार अपर्याप्त सर्वोच्च विशेषताएं harder regime त्रुटि चक्रवृद्धि देख real-world निर्णय करने समस्या" - आणि, चारों ओर साहित्य, found सादा behavior cloning किया अच्छा वह. असे reason संदेहपूर्ण किसी DAgger variant ranking आराम के लिए उन कार्य, समेत कुछ अंक ऊपर टेबल मध्ये.
Robot gate बड़ी policy हल नहीं. AIM काम बदलें अनिश्चितता साथ एक proxy Q-function नकल मानव हस्तक्षेप नियम आणि अहवाल एक 40% सुधार मध्ये ले-ओवर लागत आणि शिक्षण क्षमता ThriftyDAgger के तुलना मध्ये - निरंतर आणि असतत नियंत्रण, नहीं एक vision-language-action मॉडल चलाते एक manipulator वर. अगर कोई इन gate transfer एक fine-tuned VLA खुला है. सर्वेक्षण एक संबंधित बिंदु करते: क्षेत्र शब्दावली आणि संरचना नहीं unified साहित्य भर, जो बनाता method मुश्किल तुलना करने के लिए. अपनी बाहु वर, अपनी log आहे प्रमाण तुम्हाला है.
है HG-DAgger वास्तव में DAgger अगर मानव केवल label दरम्यान हस्तक्षेप?▾
यह रखता हिस्सा असे मायने - डेटा संग्रहीत अंतर्गत state वितरण शिक्षक induce, एकीकृत साथ काय पहले आया - आणि ड्रॉप हिस्सा वह नहीं survive संपर्क साथ hardware. Kelly et al. प्रस्तुत यह एक variant; 2011 no-regret गारंटी नहीं आ unchanged वर.
करू सकता मैं एक robot gate एक fine-tuned VLA पॉलिसी एक SO-100 पर?▾
नहीं सीधा. SafeDAgger classifier गरज एक queryable संदर्भ पॉलिसी तुम्हाला नहीं है. EnsembleDAgger गरज एक ensemble, जो एक multi-अरब-parameter मॉडल मतलब कुछ प्रतियां मेमोरी मध्ये प्लस उनकी inference लागत. ThriftyDAgger गरज एक जोखीम estimator फिट सफल आणि failure वह नहीं मौजूद पहले राउंड.
कितना लंबा होना चाहिए एक एकल takeover?▾
लंबा पर्याप्त पहुंचने एक state पॉलिसी कर सकते जारी रहते, आणि कोई अधिक: विस्तारित takeover बदल चलाता एक प्रदर्शन सत्र में और बाढ़ सुधार सेट साथ nominal व्यवहार. LazyDAgger खोज कटता दूसरी रास्ता भी - बहुत सारी बहुत छोटा स्विच उनकी स्वतःचे लागत.
जरूर मैं प्रशिक्षण केवल सुधार segment वर?▾
नहीं - वह सबसे आम तरीका गर्न एक round. एक model fine-tuned केवल recovery देख लगभग कुछ नहीं परंतु recovery. मिश्रण सुधार मूल dataset साथ स्रोत चुने स्पष्टता; जाते अधिक दूर, देखो intervention-weighted दृष्टिकोण जैसे IWR या Sirius, जो up-weight human-driven frame ऐवजी अलग करने उन्हें.
क्या अगर हस्तक्षेप दर नहीं गिरता एक round के बाद?▾
ले यह चेहरा मूल्य पर: राउंड किया नहीं सहायता. पहले जोड़ने सुधार, चेक सस्ती व्याख्या - किया ऑपरेटर threshold दर्फिंग, थे सुधार cosmetic, किया composed dataset सचमुच contain उन्हें, होता प्रशिक्षण initialised से intended checkpoint. एक राउंड असे मूक चलाता गया आधार मॉडल दिखता ठीक वैसे एक राउंड असे विफल सीख.
क्या non-हस्तक्षेप carry सूचना?▾
अंतर्गत Expert हस्तक्षेप शिक्षण, हां: stretch जहाँ निरीक्षक watched आणि किया नहीं अधिनियम पढ़ो कमजोर सबूत असे state आणि क्रिया स्वीकार्य, formalized constraint value फंक्शन वर. सबसे practical पाइपलाइन, समेत यह एक, mark केवल काय मानव drove.
एक एकल बाहु एक desk के लिए विकल्प बनाया गया है: पकड़ गेट स्वयं, लिखते क्या खुला यह, आणि खर्च प्रयास डेटा हाथ पीछे ऐवजी स्विच स्वचालन वर. platform side है वर्णन DAgger loop page, प्रशिक्षण विकल्प प्रति पॉलिसी परिवार अंतर्गत प्रशिक्षण आणि मूल्य निर्धारण. पृष्ठभूमि के लिए, शुरु साथ अनुकरण शिक्षण आणि अनुकरण शिक्षण SO-100 वर; एक पहली चलाता के लिए, चलाते आपकी पहली पॉलिसी छोटा रास्ता है.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started