टेलीऑपरेशन इंटरफेसद्वारे रोबोट बाहू पर्यवेक्षण करणारा ऑपरेटर, नियंत्रणांवर हात आणि ओव्हरटेक करण्यास तयार
DAggerसंवाद करणारे अनुकरण शिक्षणHG-DAggerरोबोट पॉलिसीSO-100

HG-DAgger आणि गेटेड व्यतिक्रम: रोबोट पॉलिसी कधी ओव्हरटेक करायचे हे कोण ठरवते

AY-Robots ResearchAugust 27, 202615 मिनिटांचे वाचन

साधारण DAgger एखाद्या मानवाला रोबोट अजूनही चालत असताना स्थितींना लेबल करण्यास सांगते. वास्तविक हार्डवेअरवर हे असुरक्षित आहे आणि ते खराब लेबल तयार करते. गेटेड व्यतिक्रम अंध लेबलिंगला गेटने बदलतात ज्याला कोणी धरून ठेवले पाहिजे: HG-DAgger मध्ये मानव, SafeDAgger मध्ये सुरक्षा वर्गीकारक, EnsembleDAgger मध्ये ensemble चे मतभेद, ThriftyDAgger मध्ये बजेटेड नवीनता-आणि-जोखीम अनुमान. हा लेख त्यांची तुलना करतो कोण गेट मालकी करतो, कोणता सिग्नल ते उघडतो, आणि प्रत्येकाचा खर्च किती आहे - आणि वास्तविक बाहूसह संपर्क सुरक्षित राहणारा मानव-गेटेड फॉर्म का आहे.

क्लोन केलेली पॉलिसी जिथे तिचा प्रशिक्षण डेटा संपला तिथे अपयशी होते. निराकरण म्हणजे प्रदर्शकाच्या स्थिती वितरणाऐवजी पॉलिसीच्या स्वतःच्या स्थिती वितरणाखाली डेटा संग्रह करणे सुरू ठेवणे, जे DAgger करते आणि डेटासेट एकत्रीकरणाचा परिचय प्रथम तत्वांपासून कव्हर करते. हे मूळ अल्गोरिदमचा अस्ताव्यस्त भाग खुला सोडते: शिक्षक चालत असताना, तज्ञाने प्रत्येक स्थितीसाठी ते काय केले असते हे सांगणे अपेक्षित आहे, नियंत्रणाशिवाय.

सिम्युलेटरमध्ये लिपिबद्ध तज्ञासह हे विनामूल्य आहे. टेबलवर त्याच्या पुढे वास्तविक बाहू असलेली जागा ही मुक्त किंवा सुरक्षित नाही. HG-DAgger लेखक एखादा आक्षेप अचूकपणे सांगतात: अशा नमुना योजना "तज्ञाला प्रणालीच्या पूर्ण नियंत्रणाशिवाय क्रिया लेबल प्रदान करण्याची आवश्यकता आहे", ज्या "सुरक्षा कमी करू शकतात आणि मानव तज्ञांचा वापर करताना, संवेदनशील अ‍ॅक्ट्युएटर लेग मुळे संग्रहीत लेबलची गुणवत्ता खराब करणे शक्य आहे" (Kelly et al., 2019). दोन अपयश त्या वाक्यात लपलेले आहेत: पॉलिसी अशा स्थितींमध्ये ड्राइव करणे सुरू ठेवते ज्या कोणीही हवेत नाहीत, आणि त्या जोखमीसह खरेदी केलेले लेबल नियंत्रण धारण करताना मानव तयार करतात त्याच्यापेक्षा वाईट आहेत. खाली दिलेला प्रत्येक व्यतिक्रम समान प्रश्नाचे उत्तर देतो - नियंत्रणावर गेट ठेवा आणि ते कधी उघडते हे कोणीतरी ठरवू द्या. ते भिन्न आहेत कोण तो कोणीतरी आहे त्यामध्ये.

लहान आवृत्ती

  • गेटेड व्यतिक्रम अंध लेबलिंगला पॉलिसी नियंत्रण आणि तज्ञ नियंत्रणामध्ये स्विच करून बदलतात. त्यांना वेगळे करणे हे कोण स्विच मालकी करतो.
  • HG-DAgger मानवाला स्विच देते आणि फक्त डेटा एकत्रित करते जे मानवाकडे अखंड नियंत्रण होते अशा वेळी रेकॉर्ड केलेले.
  • SafeDAgger हे एक बायनरी वर्गीकारकाला देते जो संदर्भ पॉलिसीपासून विचलनाचा अंदाज लावतो; EnsembleDAgger एकाच वेळी कमी ensemble भिन्नता आणि तज्ञ क्रिया पर्यंत लहान अंतर आवश्यक करते.
  • LazyDAgger हिस्टेरेसिस जोडते जेणेकरून नियंत्रण पिंग-पॉंग होत नाही; ThriftyDAgger स्पष्ट हस्तक्षेप बजेटाखाली नवीनता किंवा अनुमानित जोखमावर गेट करते.
  • रोबोट-गेटेड सिग्नलांना एखाद्या बारीक-ट्यून केलेल्या VLA ला शौकीन-वर्गीय बाहूवर सामान्यतः कमी आहे असे गरज आहे: एक संदर्भ पॉलिसी, एक स्वस्त ensemble, किंवा कॅलिब्रेटेड epistemic अनिश्चितता.
  • गेट अर्धा पद्धती आहे. हस्तक्षेप सेगमेंटला त्यानंतर काय होते - मिश्रण, वजन, एकत्र - हे ठरवते की गोल सुधारली की नाही.

मानव-गेटेड आणि रोबोट-गेटेड: फरक जो महत्त्वाचा आहे

संवाद करणारे अनुकरण शिक्षणाचा स्वतःचा सर्वेक्षण आहे; Celemin आणि सहकर्मी त्यांची सूची फिडबॅक प्रकार, इंटरफेस, शिक्षण मॉडल, वापरकर्ता अनुभव, अनुप्रयोग आणि बेंचमार्कसह तैयार करतात. आपल्या अभियांत्रिकीला निर्णय घेणारा फरक त्या अक्षांपेक्षा सरळ आहे, आणि अलीकडील काम त्याला थेट नाव देते: एक पद्धती human-gated असते जेव्हा पर्यवेक्षक हस्तक्षेप कधी करायचे हे ठरवते, आणि robot-gated असते जेव्हा एजेंट साहाय्य मागण्याचा वेळ कधी असा अनुभव होता (Cai et al., 2025). सर्व काही ते दोन पर्यायांपैकी एका सेवा करणार्या यंत्रसंरचना आहे. व्यापार सुरुवातीपासून दृश्यमान आहे: मानव गेटला सतत लक्ष खर्च होतो, आणि रोबोट गेट त्या लक्षला परत देण्याचे वचन देते - परंतु केवळ तर सिग्नल जो तो गेट करतो तो विश्वसनीय असेल, आणि त्या सिग्नलची निर्माण करणे हे स्वतःचे संशोधन समस्या आहे.

SafeDAgger: एक वर्गीकारक जो त्याचे स्वतःचे विचलन अंदाज लावतो

Zhang आणि Cho यांचे SafeDAgger (2016) हे या गेटांचे सर्वात लवकरचे आहे. संदर्भ पॉलिसीचा प्रश्न करणे हा महाग भाग आहे, म्हणून दुसरा, लहान नेटवर्क - सुरक्षा पॉलिसी - प्रश्न करणे मूल्यवान आहे का हे अंदाज लावते. हे "एक बायनरी लेबल परत करते ज्यासह प्राथमिक पॉलिसी प्रश्नाशिवाय संदर्भ पॉलिसीपासून विचलन होण्याची शक्यता आहे". लेबल दोन पॉलिसीच्या क्रियांमधील वर्गीय L2 विचलन आणि थ्रेसहोल्ड tau विरुद्ध परिभाषित केले जाते, आणि वर्गीकारक बायनरी क्रॉस-एन्ट्रॉपी सह फिट केले जाते. रन वेळी हे प्रत्येक स्थितीसाठी ठरवते की शिक्षक चालणे सुरू ठेवते किंवा संदर्भ ओव्हरटेक करते. अमूर्त अनुसूचीत संदर्भ प्रश्नांमध्ये कमी संख्या अहवाल देते आणि convergence गती-अप असे म्हणतात कि लेखकांना एक स्वचलित अभ्यासक्रम प्रभाव दिला आहे, दोन्हीसाठी एक आकृती न देता.

पकड परिभाषामध्ये आहे, परिणामांमध्ये नाही. वर्गीकारक प्रशिक्षण करण्यासाठी त्याला फिट करण्यासाठी वापरली जाणारी प्रत्येक स्थितीवर संदर्भ पॉलिसीची क्रिया आवश्यक आहे, जे हे गृहीत धरते की संदर्भ दुसरा प्रोग्राम आहे. जर आपला संदर्भ नेता बाहूसह एक व्यक्ती असेल, तर त्या लेबल सेटची किंमत कमी नाही आणि पद्धती ती पद्धती ज्यासाठी डिজाइन केली होती त्यापासून वंचित होते.

EnsembleDAgger: संदेह आणि विसंगति, दोन्ही

Menda, Driggs-Campbell आणि Kochenderfer (2019) गेटला संभाव्य प्रश्नासह हाताळतात. EnsembleDAgger "न्यूरल नेटवर्कचे ensemble वापरून Gaussian Process अंदाज लावतो" आणि ensemble भिन्नतेला आत्मविश्वास प्रॉक्सी म्हणून वाचतो: उच्च भिन्नता म्हणजे प्रशिक्षण डेटा विपरीत एक क्षेत्र, जे - हे गृहीत धरून की तज्ञ अपयश स्थितीचे परिहार करतो - अपयशाच्या जवळ असणे सह संबंधित आहे. नियम एक conjunction आहे. शिक्षकाला त्याच्या माध्य क्रिया आणि तज्ञाच्या क्रिया दरम्यान L2 अंतर एक थ्रेसहोल्डाखाली राहते (विसंगति) तेव्हा कार्य करू शकते आणि त्याच्या अनुमानित क्रियाची भिन्नता दुसऱ्या (संदेह) अंतर्गत राहते. दोन्हीपैकी एकही अपयशी झाल्यास, तज्ञ नियंत्रण घेतो. उद्देश शिक्षकाचा साझा वाढवणे आहे अपयशाची संभाव्यता मर्यादित करताना; कागदपत्र उलट पेंडुलम आणि MuJoCo HalfCheetah वर DAgger व्यतिक्रमांच्या विरुद्ध सुधारीत सुरक्षा आणि शिक्षण अहवाल देते.

विसंगति शब्दांना तज्ञांची क्रिया आवश्यक आहे

हे शांतपणे पूर्ण नियम हाताशिवाय पर्यवेक्षणासाठी disqualifies करते. शिक्षकाची क्रिया आणि तज्ञांची दरम्यान अंतर त्या स्थितीवर, त्या क्षणी तज्ञांची क्रिया आवश्यक आहे. लिपिबद्ध तज्ञासह, ठीक आहे. एक मानवाबरोबर, मानवाने सतत क्रिया तयार करायला हवी - यथार्थात गेटेड व्यतिक्रम दूर करायचे असे अचूक बोझ. संदेह शब्द हाताशिवाय आहे; conjunction नाही.

LazyDAgger: स्विच चॅटरिंग बंद करा

Hoque आणि सहकर्मी (2021) स्विच स्वतःचा खर्च आक्रमण केले. प्रत्येक हस्तक्षेप "इतर काम व्यापृत करते ज्या मानव करत आहे, पर्यवेक्षक आणि स्वायत्त नियंत्रणामधील context स्विचीसह latency होते, आणि कार्य करण्यासाठी वेळ लागतो". एक गेट जो मिनिटाला दहा वेळा उघडते आणि बंद होते तो दहा सेकंदांसाठी एकदा उघडल्या असेल त्यापेक्षा वाईट आहे, समान स्वायत्त साझेला. LazyDAgger SafeDAgger असममित थ्रेसहोल्डसह विस्तारते - पर्यवेक्षक नियंत्रण प्रविष्ट करणे कठीण आहे ते मध्ये राहणे - म्हणून प्रणाली सीमा येथे थरथर करत नाही. सिम्युलेशनमध्ये हे "3 continuous नियंत्रण कार्यांवर SafeDAgger च्या तुलनेत सरासरी 60% context स्विचेस कमी करू शकते जबकि state-of-the-art पॉलिसी कार्यक्षमता राखते"; ABB YuMi सह तंतू मॅनिपुलेशनमध्ये हे "60% context स्विचेस कमी करते वेळी execution वेळी SafeDAgger च्या तुलनेत 60% उच्च यश दर साध्य करते".

ThriftyDAgger: नवीनता किंवा जोखीम, बजेट अंतर्गत

ThriftyDAgger (Hoque et al., CoRL 2021) पर्यवेक्षकाच्या बजेटपासून सुरुवात करते पॉलिसीच्या ऐवजी. हे "हस्तक्षेप मागण्यासाठी एक शिखरित स्विचिंग पॉलिसी वापरते केवळ स्थितीपर्यंत जी पुरेशी (1) नवीन आहे, जिथे रोबोट पॉलिसीकडे अनुकरण करण्यासाठी कोणती संदर्भ वर्तन नाही, किंवा (2) opaque, जिथे रोबोटाला कार्य संपूर्ण करण्यामध्ये कमी आत्मविश्वास आहे", त्या जोखमी अनुमान करण्यासाठी नवीन मेट्रिकसह. बजेट एक इनपुट आहे, परिणाम नाही: तुम्ही किती मानव वेळ खर्च कराल असे राज्य करते. Execution वेळी लागू केल्यानंतर पद्धती "सिम्युलेशन आणि शारीरिक कार्य दोन्हीवर 100% सफलता दर साधते", आणि एक दहा भाग अभ्यास नियंत्रण तीन-रोबोट fleet एक concentration कार्य सह अहवाल देते की हे "58% आणि 80% अनुक्रमे मानव आणि रोबोट कार्यक्षमता वाढवते पुढील सर्वश्रेष्ठ अल्गोरिदमच्या तुलनेत पर्यवेक्षक बोझ कमी करते". fleet सेटिंग हे या कार्याचे natural होम आहे; Fleet-DAgger नंतर multiple रोबोट आणि पर्यवेक्षकांसह interactive fleet शिक्षण formalized, Return on Human Effort हे प्रमाण optimize करण्याचा प्रस्ताव देते.

HG-DAgger: मानव गेट धारण करते

Kelly et al. (2019) दुसऱ्या मार्गापर्यंत जाते. कोणतीही switching पॉलिसी नाही. शिक्षकाची rollout होते "तज्ञ हे पाहण्यापर्यंत की नवजात स्थितीच्या state space चे unsafe क्षेत्रामध्ये प्रविष्ट केले", ज्यानंतर तज्ञ नियंत्रण घेते आणि प्रणाली परत guide करते. एकत्रीकरण नियम कठीण भाग आहे: "तज्ञांची क्रिया लेबले केवळ या recovery trajectories दरम्यान संग्रहीत आणि dataset मध्ये जोडली जातात, ज्यात मानव तज्ञाकडे अखंड नियंत्रण असते." काहीही लेबल केले जाते नाही जेव्हा मानव एक दर्शक असतो.

हे स्विचवर थांबत नाही. HG-DAgger हे "एक सुरक्षा थ्रेसहोल्ड शिका एक मॉडल-अनिश्चितता-आधारित जोखीम मेट्रिकसाठी जो पूर्ण प्रशिक्षण नवजातांची कार्यक्षमता state space चे भिन्न क्षेत्रांमध्ये अंदाज लावण्यासाठी वापरला जाऊ शकतो": हे logs की कसे अनिश्चित शिक्षक होता क्षणांमध्ये तज्ञ intervened आणि average करते शिक्षक सर्वात समान शिक्षक त्याच्या अंतिम फॉर्मला मध्ये शेवटचा quarter त्या रेकॉर्डच. हे नाही एक गेट रोबोट operates परंतु एक diagnostic तुम्हाला सांगते जिथे तयार पॉलिसी expected राखून आहे. मूल्यांकन एक simulated आणि real-world ड्राइविंग कार्य covers आणि अहवाल depart सुधारीत कार्यक्षमता दोन्ही DAgger आणि behavior क्लोनिंग विरुद्ध.

एक संबंधित line बदलते काय counts लेबल म्हणून. Spencer आणि सहकर्मीचे Expert Intervention Learning दृढ करते की "कोणतीही quantity तज्ञ feedback, intervention किंवा गैर-हस्तक्षेप द्वारे, bilaterally information चालू quality वर्तमान state, optimality क्रिया, किंवा दोन्ही", formalized value फंक्शन वर एक constraint असे आणि no-regret online learning सह solve. त्या reading अंतर्गत, stretches जिथे मानव watched आणि nothing केले weak positive प्रमाण ऐवजी empty. EIL learns collision avoidance लगभग एक मिनिट तज्ञ नियंत्रण पासून.

रोबोट बाहू workspace कॅमेरा positioned डेटा संग्रह दरम्यान एक supervised पॉलिसी rollout
एक मानव-gated दौर एक ordinary inference run सह एक रेकॉर्डर attached आहे. frames ऑपरेटर drove flagged आहेत; बाकी यथावत रहते.

व्यतिक्रम बाजूला बाजू

पद्धतीगेट कोण उघडतोसिग्नलउपलब्ध गरजरिपोर्ट केले
DAgger (Ross et al., 2011)कोणी नाही - शिक्षक नेहमी drivesकोणीही नाही; तज्ञ हर एक visited state लेबल करतेएक तज्ञ सक्षम label off-policy states नियंत्रणाशिवायNo-regret reduction शिक्षकाचे state distribution अंतर्गत गॅरेंटी सह
HG-DAgger (Kelly et al., 2019)मानव पर्यवेक्षकपर्यवेक्षकाचे판断की state unsafe आहेकोणीतरी watch, आणि एक clean handover नियंत्रणचेBeats DAgger आणि behavior cloning simulated आणि real ड्राइविंग कार्य वर; साथे learns एक जोखीम threshold
SafeDAgger (Zhang & Cho, 2016)रोबोटबायनरी classifier L2 deviation साठी संदर्भ above tau पासूनएक queryable संदर्भ पॉलिसी classifier लेबल साठीकमी संदर्भ queries racing सिम्युलेटर मध्ये, faster convergence (कोणती आकृती दिली नाही)
EnsembleDAgger (Menda et al., 2019)रोबोटEnsemble भिन्नता आणि दूरी तज्ञ क्रिया दोन्ही, दोन्ही threshold अंतर्गतएक ensemble नेटवर्क plus तज्ञ क्रिया प्रत्येक step वरसुधारीत सुरक्षा आणि शिक्षण pendulum आणि HalfCheetah वर
LazyDAgger (Hoque et al., 2021)रोबोट, hysteresis सहSafeDAgger सिग्नल अलग entry आणि exit thresholds सहकाय SafeDAgger गरज, plus दुसरी threshold tune करण्यासाठी~60% कमी context switches 3 कार्य वर; 60% उच्च सफलता YuMi fabric वर
ThriftyDAgger (Hoque et al., 2021)रोबोट, बजेट अंतर्गतनवीनता, किंवा अनुमानित जोखीम कार्य पूर्ण नकरण्याचीएक learned जोखीम estimator आणि एक राज्य हस्तक्षेप बजेट100% सफलता execution वेळी; user study (N=10): 58% आणि 80% gains पुढील-best विरुद्ध
EIL (Spencer et al., 2020)मानव - non-intervention गणनाए बरोबरहस्तक्षेप आणि त्याचे absence constraints value फंक्शन वरOnline no-regret learning value constraint वरCollision avoidance लगभग एक मिनिट तज्ञ नियंत्रण पासून

प्रत्येक गेट काय खरेदी करता, आणि काय हे शुल्क करते

"needs" column खाली read आणि एक pattern बाहेर पडता: हर एक रोबोट-gated सिग्नल तिथे एक proxy आहे असे manufactured गरज, आणि प्रत्येक proxy त्याचे स्वतःचे बिल आहे.

  • Discrepancy सिग्नल (SafeDAgger, LazyDAgger, half EnsembleDAgger नियम) एक संदर्भ पॉलिसी आवश्यक. किंवा तुम्हाला एक लिपिबद्ध तज्ञ आहे, ज्यामध्ये interesting समस्या आधीच हल केली आहे, किंवा एक मानव क्रिया तयार ठेवणे background मध्ये जेणेकरून अंतर computed असू शकेल.
  • Doubt सिग्नल grained epistemic अनिश्चितता आवश्यक. एक छोटा नियंत्रण नेटवर्क ensemble त्यांची approximate; एक तीन-अरब-parameter vision-language-action मॉडल एक memory आणि latency समस्या पहिले.
  • नवीनता आणि जोखीम सिग्नल एक learned estimator कार्य पूर्ण आवश्यक, fitted enough सफल आणि failed rollouts वर. एक कार्य वर तुम्ही अजून काम पाचन, वह डेटा राउंड एक मध्ये मौजूद नाही.
  • मानव गेट ध्यान आणि काहीही else आवश्यक - एकमात्र सिग्नल उपलब्ध दिन एक, कोणती पॉलिसी आर्किटेक्चर, कोणती extra मॉडल साथ train.
  • कोई भी रोबोट गेट मानव कमरा हटाता नाही. ते कमी कर्ण अक्सर मानव कार्य गरज, नहीं अगर ते मौजूद होना चाहिए.

एक quieter difference आहे काय gate produces. एक robot gate mid-trajectory firing हाते एक person एक moving बाहू arbitrary pose अंदाजे. एक human gate ऑपरेटर क्षण निवडणे द्या - reach नंतर, grasp अगोदर, नहीं अर्ध swing. recovery segments दोनपासून नहीं equally clean, आणि those segments पूरा product राउंड आहे.

का मानव-gated फॉर्म जीतते real hardware वर

हे एक अभियांत्रिकी argument आहे, नहीं एक benchmark result - कोणही paper आम्ही found runs सर्व पाच gates same manipulator वर same policy class सह. हे रेस्ट चार points वर.

पहिली, पर्यवेक्षक तिथे anyway आहे. कोणी नहीं leaves एक SO-100 arm चालणे unattended objects पुढे जी ते knock-over करू शकते. एक बार कोणीतरी watching आहे, marginal cost देणे त्यांना एक takeover बटण नजीक शून्य आहे; एक grained जोखीम estimator निर्माण एक project आहे.

दुसरी, uncertainty तुम्ही actual measure वर एक आधुनिक policy अक्सर wrong quantity आहे. एक diffusion किंवा flow-matching head उत्पादन variance across sampled क्रिया chunks, आणि वह variance reflects multimodality head train किया होता represent करण्यासाठी, नहीं epistemic ignorance state सर्वोच्च. EnsembleDAgger doubt अवधि वापरते एक ensemble precisely capture latter. दोन्ही लाइन same number लगो नहीं; action chunking आणि flow matching entries cover कसे those heads emit क्रिया पहिली जागा मध्ये.

तीसरा, failures ते मायने manipulation मध्ये अक्सर semantic ऐवजी statistically unusual. एक policy closing gripper दोन centimeters लवकर, किंवा reaching confidently लवकर wrong एक दोन identical cubes, नहीं high-variance state - ते confident आणि गलत. कोणही variance threshold catches वह; एक person watching catches ते तुरंत.

चौथा, label गुणवत्ता - original HG-DAgger point, आणि one सबसे often लंघन. Labels संग्रहीत अगर मानव uninterrupted control हराते beat labels narrated over एक moving system. अगर goal सुधारात्मक डेटा worth aggregating, burden proof lies साथ automatic gate.

जहाँ robot gates करता भुगतान

picture flips अगर one पर्यवेक्षक responsible बहुत सारी robots - regime ThriftyDAgger user study आणि Fleet-DAgger formalization target. साथ एक fleet, human attention scarce संसाधन आहे आणि एक अपूर्ण allocation beats कोणही. साथ एक arm एक desk तुम्ही नहीं आहे उस regime मध्ये.

मानव-gated loop, already wired up

Takeover चलते inference सत्र दरम्यान, per-frame हस्तक्षेप flags सुधारात्मक segments वर, curating हर एक run सुधार किंवा मूल्यांकन, composing मिश्रित dataset स्रोत तुम्ही निवडता, आणि सुरू करणे प्रशिक्षण existing checkpoint पासून built-in आहेत ऐवजी scripted hand द्वारा. Takeover काम नेता arm सह, किंवा keyboard आणि sliders साथ अगर तुम्ही एक नहीं है.

पहा कसे DAgger loop चलते

gate अर्ध method आहे; डेटा handling अन्य अर्ध

एक gate decides जो frames एक मानव drove, नहीं क्या गर्न त्यांना सह, आणि वह दूसरा decision जहाँ rounds सबसे अक्सर wasted आहे. पहिली नियम है one D मध्ये DAgger stands साथ: aggregate, नहीं बदलना. Fine-tuning एक checkpoint विशुद्ध एक कुछ सौ correction frames वर देता तुम्हाला एक model असे seen लगभग कुछ नहीं परंतु recoveries आणि अनुभव forgotten nominal trajectory.

दूसरी नियम है intervention frames नहीं ordinary frames. Mandlekar et al. तयार एक remote-teleoperation system 6-DoF manipulation साथ operatorsRus monitor करण्यासाठी policies आणि take over failure वर, तब प्रशिक्षण iteratively एक algorithm साथ असे "encourages policy शिखरित कसे traverse bottlenecks through interventions"; agents प्रशिक्षण अन ডেটा outperformed agents प्रशिक्षण एक equal संख्या ordinary demonstration नमुना. Sirius धक्का idea deployment मध्ये, "re-weighing training नमुना साथ approximated human trust आणि optimizing policies साथ weighted behavioral cloning". दोन्ही गरज एक per-frame marker काय human-driven, जो का intervention flag गुणार अधिक यह दिखता।

तीसरी नियम जो automatic mixing एक trap आहे. एक composed dataset किसका स्रोत तुम्ही नहीं enumerate एक तुम्ही नहीं debug कर सकता जब अगला गोल खराब मिलता. पर इस प्लेटफॉर्म compose step स्पष्ट है कि कारण - मूल dataset प्लस सुधार, episode चयन प्रति source, आणि result एक ordinary LeRobot dataset असे syncs आणि trains याचे किसी अन्य जैसे; dataset documentation covers format side.

कदम एक राउंड मध्येकाय यह producesसबसे आम तरीका यह गलत चला जाता है
चलाते inference रिकॉर्डिंग साथ ऑनएक चलाता पॉलिसी स्वतःचे state distribution अंतर्गतरिकॉर्ड साथ सादा teleoperation, खोना एक policy चालणे
ले ओवर failure वरसुधार segments साथ एक per-frame हस्तक्षेप flagसुधार cosmetic wobble, शिक्षण शैली ऐवजी एक recovery
क्यूरेट हर एक episodeसुधार, मूल्यांकन, किंवा discardsरखना सब; एक botched takeover खर्च अधिक तुलना episode योग्य होता
सिंक सुधारएक versioned dataset बजे originalसुधार असे कभी छोड़ना local machine
Compose मिश्रित datasetमूल प्लस सुधार, explicit चयनमूक auto-mixing, तो एक बाद regression नहीं ट्रेस हो सकता source को
जारी रखें एक checkpoint पासूनएक checkpoint initialised पिछली एक सेउम्मीद एक optimizer फिर; वजन initialize model, वह नहीं restore अनुकूलक state

सेटिंग एक गेट एक व्यक्ति actually hold कर सकता

"मानव decides" नहीं एक विनिर्देश. दोन operators विभिन्न threshold के साथ produce incomparable राउंड, आणि एक दर्फिंग threshold produces एक ट्रेंड तुम नहीं read कर सकता. लिखते trigger list गर्न पहले पहिली चलाता.

  1. नाम condition जो खुले gate - दृष्टिकोण अप निश्चित margin से, gripper बंद करने पर नहीं, एक joint दर्फिंग की ओर एक सीमा, एक stall अधिक सेकंड या दोन - आणि रखना list अपरिवर्तित राउंड से.
  2. नाम काय नहीं खुले. Overshoot पॉलिसी recovers पासून अपने ऑन है प्रशिक्षण सिग्नल; लेते ओवर वहाँ deletes एक recovery यह आधीं करे।
  3. ले ओवर जल्दी clean handover के लिए, हाथ वापस तुरंत state recoverable हो है।
  4. लॉग क्यो तुम ले ओवर, प्रति episode. तीन राउंड बाद यह केवल रिकॉर्ड है अगर same failure रिटर्न.
  5. रखना कैमेरा, कार्य पाठ, आणि ऑपरेटर constant भर राउंड. बदलना एक आणि संख्या बंद हो जाता है तुलनीय.

यांत्रिकली handover दोन variant आहे. साथ एक नेता arm, नेता पहुंचना गरज follower वर्तमान pose अगर torque transfer, या arm jumps; यह alignment चले is least-परीक्षण भाग chain वर real hardware. बिना एक नेता arm takeover मैनुअल पहली keypress से: follower है आयोजित आणि ऑपरेटर nudges यह joint द्वारा joint keyboard पासून किंवा drags sliders, साथ server-side clamps राखना प्रत्येक input छोटा - एक कुछ डिग्री प्रति keypress, एक handful प्रति slider अपडेट, कारण एक large कदम एक held pose मध्ये कसे तुम strip एक servo. step-by-step version साथ key bindings है मध्ये walkthrough एक DAgger राउंड एक SO-100 वर; पृष्ठभूमि दोन्ही teleoperation modes है मध्ये teleoperation docs आणि leader-follower entry.

तुलना supported पॉलिसी architecture साथ उनकी प्रशिक्षण आणि inference विशेषता
gate है आर्किटेक्चर-agnostic. कौन policy तुम सुधार बदलता प्रशिक्षण लागत राउंड, नहीं कसे takeover काम करता.

पढ़ना अगर gate किया कुछ

metric एक मानव-gated राउंड है intervention दर: हस्तक्षेप frames विभाजन frames चलाता. यह एक job - अगर यह नहीं राउंड भर गिरता, राउंड खरीद कुछ नहीं, आणि अगला एक गरज बदलना कुछ ऐवजी डेटा की राशि.

यह एक biased मेट्रिक आणि तुम जाणून आणि कसे. यह measure ऑपरेटर threshold ज्यादा पॉलिसी अनुभव, जो क्यों trigger list रहता fixed; एक ऑपरेटर कौन relax सत्र वर produces एक गिरता वक्र साथ कुछ नहीं पीछे. यह भी ignores गंभीरता - दस frames बंद एक टकराव आणि दस nudge एक grasp दिखना identical. जोड़ी यह साथ एक fixed मूल्यांकन सेट कोणी correction डेटा कभी खींचा गया.लेख वर measuring एक DAgger loop काम through मूल्यांकन design, समेत कसे रखना मूल्यांकन episode बाहर प्रशिक्षण मिश्रण.

मानव gate, ईमानदारी से
काय यह गर्न तुम्हाला
  • काम दिन एक पर, कोणी पॉलिसी आर्किटेक्चर, कोणी extra मॉडल कैलिब्रेट करने के लिए
  • Catches confident-and-wrong failures कोई variance threshold detects
  • Produces सुधार रिकॉर्ड जबकि ऑपरेटर होता full नियंत्रण, एक क्षण वह चुने
  • दाखला एक per-frame मार्कर असे हस्तक्षेप-weighted तरीका IWR आणि Sirius खपत
काय यह नहीं
  • Cost निरंतर पर्यवेक्षण; यह नहीं scale एक व्यक्ति आणि बहुत सारी robots को
  • Depends ऑपरेटर सामंजस्य - एक दर्फिंग threshold corrupts हस्तक्षेप दर
  • Produces नहीं जोखीम मॉडल अपने आप पर; HG-DAgger learned threshold आणि ThriftyDAgger estimator अतिरिक्त यंत्रसंरचना हैं
  • Counts frames, नहीं परिणाम
  • कर नहीं बचा सकते एक पॉलिसी किसका असफल upstream है नियंत्रण, जैसे एक swapped कैमेरा किंवा एक mislabelled कार्य स्ट्रिंग

खुली सवाल योग्य रखना दृष्टि मध्ये

benchmark कमजोर हैं. Spencer आणि सहकर्मी परीक्षा किया वह imitation शिक्षण परीक्षण दृष्टिकोण आणि found वह "realizable आणि सरल आणि इस प्रकार अपर्याप्त सर्वोच्च विशेषताएं harder regime त्रुटि चक्रवृद्धि देख real-world निर्णय करने समस्या" - आणि, चारों ओर साहित्य, found सादा behavior cloning किया अच्छा वह. असे reason संदेहपूर्ण किसी DAgger variant ranking आराम के लिए उन कार्य, समेत कुछ अंक ऊपर टेबल मध्ये.

Robot gate बड़ी policy हल नहीं. AIM काम बदलें अनिश्चितता साथ एक proxy Q-function नकल मानव हस्तक्षेप नियम आणि अहवाल एक 40% सुधार मध्ये ले-ओवर लागत आणि शिक्षण क्षमता ThriftyDAgger के तुलना मध्ये - निरंतर आणि असतत नियंत्रण, नहीं एक vision-language-action मॉडल चलाते एक manipulator वर. अगर कोई इन gate transfer एक fine-tuned VLA खुला है. सर्वेक्षण एक संबंधित बिंदु करते: क्षेत्र शब्दावली आणि संरचना नहीं unified साहित्य भर, जो बनाता method मुश्किल तुलना करने के लिए. अपनी बाहु वर, अपनी log आहे प्रमाण तुम्हाला है.

है HG-DAgger वास्तव में DAgger अगर मानव केवल label दरम्यान हस्तक्षेप?

यह रखता हिस्सा असे मायने - डेटा संग्रहीत अंतर्गत state वितरण शिक्षक induce, एकीकृत साथ काय पहले आया - आणि ड्रॉप हिस्सा वह नहीं survive संपर्क साथ hardware. Kelly et al. प्रस्तुत यह एक variant; 2011 no-regret गारंटी नहीं आ unchanged वर.

करू सकता मैं एक robot gate एक fine-tuned VLA पॉलिसी एक SO-100 पर?

नहीं सीधा. SafeDAgger classifier गरज एक queryable संदर्भ पॉलिसी तुम्हाला नहीं है. EnsembleDAgger गरज एक ensemble, जो एक multi-अरब-parameter मॉडल मतलब कुछ प्रतियां मेमोरी मध्ये प्लस उनकी inference लागत. ThriftyDAgger गरज एक जोखीम estimator फिट सफल आणि failure वह नहीं मौजूद पहले राउंड.

कितना लंबा होना चाहिए एक एकल takeover?

लंबा पर्याप्त पहुंचने एक state पॉलिसी कर सकते जारी रहते, आणि कोई अधिक: विस्तारित takeover बदल चलाता एक प्रदर्शन सत्र में और बाढ़ सुधार सेट साथ nominal व्यवहार. LazyDAgger खोज कटता दूसरी रास्ता भी - बहुत सारी बहुत छोटा स्विच उनकी स्वतःचे लागत.

जरूर मैं प्रशिक्षण केवल सुधार segment वर?

नहीं - वह सबसे आम तरीका गर्न एक round. एक model fine-tuned केवल recovery देख लगभग कुछ नहीं परंतु recovery. मिश्रण सुधार मूल dataset साथ स्रोत चुने स्पष्टता; जाते अधिक दूर, देखो intervention-weighted दृष्टिकोण जैसे IWR या Sirius, जो up-weight human-driven frame ऐवजी अलग करने उन्हें.

क्या अगर हस्तक्षेप दर नहीं गिरता एक round के बाद?

ले यह चेहरा मूल्य पर: राउंड किया नहीं सहायता. पहले जोड़ने सुधार, चेक सस्ती व्याख्या - किया ऑपरेटर threshold दर्फिंग, थे सुधार cosmetic, किया composed dataset सचमुच contain उन्हें, होता प्रशिक्षण initialised से intended checkpoint. एक राउंड असे मूक चलाता गया आधार मॉडल दिखता ठीक वैसे एक राउंड असे विफल सीख.

क्या non-हस्तक्षेप carry सूचना?

अंतर्गत Expert हस्तक्षेप शिक्षण, हां: stretch जहाँ निरीक्षक watched आणि किया नहीं अधिनियम पढ़ो कमजोर सबूत असे state आणि क्रिया स्वीकार्य, formalized constraint value फंक्शन वर. सबसे practical पाइपलाइन, समेत यह एक, mark केवल काय मानव drove.

एक एकल बाहु एक desk के लिए विकल्प बनाया गया है: पकड़ गेट स्वयं, लिखते क्या खुला यह, आणि खर्च प्रयास डेटा हाथ पीछे ऐवजी स्विच स्वचालन वर. platform side है वर्णन DAgger loop page, प्रशिक्षण विकल्प प्रति पॉलिसी परिवार अंतर्गत प्रशिक्षण आणि मूल्य निर्धारण. पृष्ठभूमि के लिए, शुरु साथ अनुकरण शिक्षण आणि अनुकरण शिक्षण SO-100 वर; एक पहली चलाता के लिए, चलाते आपकी पहली पॉलिसी छोटा रास्ता है.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started