
एक SO-100 आर्मवर एक मानव-गेटेड DAgger राउंडचे चरण-दर-चरण विवरण: धोरण चलवा आणि रेकॉर्ड करा, जेव्हा वर्तन गलत होते तेव्हा ताबा घेणे, धावा सुधारणे म्हणून फाइल करणे, मिश्र डेटासेट तयार करणे, आणि चेकपॉइंटवरून प्रशिक्षण सुरू ठेवणे. लीडर आर्मशिवाय लोकांसाठी कीबोर्ड आणि स्लाइडर ताबा मार्ग समाविष्ट आहे, आणि चार चुका जे एक राउंड अमूल्य बनवतात.
आपली धोरण चलते. हे घन साधनार्थ आणि एक सेंटीमीटर लवकर ग्रिपर बंद करते, आणि असेच चालू राहते जणू कसे होते. काहीही त्रुटी नाही, आणि प्रशिक्षण नुकसान वर कोणत्याही प्रमाणात टक टाकणे त्याचे स्पष्टीकरण नाही. निराकरण समान प्रदर्शनांवर आणखी 20 000 ग्रेडियंट पायऱ्या नाही. हे आपले हाताने आर्मवर परत ठेवणे आहे अचूक जिथे ते चूक होते, आपण कोणी केले हे रेकॉर्ड करणे, आणि पुढील चेकपॉइंट प्राचीन डेटा अधिक त्या सुधारणेवर प्रशिक्षित करणे. हाच एक DAgger राउंड आहे, आणि हे एक SO-100 वर vision-language-action धोरणासह कसे एक चलते ते आहे.
सिद्धांत इतरत्र आहे: डेटासेट एकत्रीकरण कोणी कार्य का करते आणि मानव गेटिंग याबद्दल काय बदलते. हे ऑपरेटिंग मॅनुअल आहे, आणि हे एक प्रशिक्षित चेकपॉइंट, कार्यरत कॅमेरा सेट, आणि हलणारा आर्म गृहीत धरते. खाली सहा पायरी हा लूप आहे जसे या प्लॅटफॉर्मच्या DAgger पृष्ठावर लागू केला आहे, परंतु अनुक्रम आपल्या स्वतःच्या स्क्रिप्टमधून समान आहे.
संक्षेप मध्ये एक राउंड
- •प्रशिक्षित धोरण चलवा आणि रेकॉर्ड करा, कार्य मजकूर सह धावचा सामान्य teleoperation लेबलऐवजी.
- •वर्तन चूक असते तेव्हाच ताबा घेणे: लीडर आर्मसह मिरर हँडओव्हर, कीबोर्ड किंवा स्लाइडरशिवाय तत्काळ आणि व्यक्तिगत.
- •प्रत्येक धावाचा तपास: सुधार म्हणून फाइल करा, मूल्यांकन एपिसोड म्हणून ठेवा, किंवा त्यागा.
- •मिश्र संरचना व्यक्तिमत्तेने - मूळ प्रदर्शन अधिक सुधार, स्रोत प्रति एपिसोड निवडलेले. कधीही केवळ सुधारणेवर प्रशिक्षित करू नका.
- •शेवटच्या चेकपॉइंटवरून प्रशिक्षण सुरू ठेवा, आणि कोणत्या चेकपॉइंटने कोणत्या मिश्रणा तयार केली ते नोट करा.
- •राउंड कोणत्याही किंमती होता हे मोजणारी संख्या हा intervention rate आहे, प्रशिक्षण नुकसान नाही.
दुसरा राउंड फक्त अधिक डेटा नाही का
Behavior cloning राज्य एक मानव पाहिली त्या वर प्रशिक्षित करते. परीक्षण वेळी धोरण राज्य भेट करते हे कारण करते, आणि लहान क्रिया त्रुटी कंपाउंड करते राज्यांमध्ये कोणत्याही प्रदर्शन कव्हर केली. Ross, Gordon आणि Bagnell AISTATS 2011 साठी त्या अपयशचे औपचारिकीकरण केले आणि हे एक पुनरावृत्ती अल्गोरिदम उत्तर दिले जे स्थिर नियंत्रणक प्रशिक्षित करते आणि, त्यांच्या कमी केल्यानुसार, अंतर्गत राज्य वितरण अंतर्गत चांगले कार्य करणे आवश्यक आहे हे प्रेरित करते: वर्तमान धोरण चलवा, तज्ञ ते राज्य लेबल करा हा वास्तव पोहोचला, डेटासेटमध्ये जोडा, पुनर्रचना करा, पुनरावृत्ती करा. Kelly et al. HG-DAgger सह प्रश्नाचे व्यावहारिक केले, जिथे मानव नियंत्रण घेण्याचा निर्णय घेते ऐवजी नियंत्रण धारण केल्याशिवाय राज्य लेबल करा; ते DAgger आणि behavior cloning या दोन्हीवर सुधारलेले कार्यक्षमता नोंद करतात आणि सिम्युलेटेड आणि वास्तविक स्वायत्त ड्राइविंग कार्यावर. मानव गेटिंग हे डेस्क आर्मवर लूप सहनीय बनवते जे - आपण आपले हाता हलवता तेव्हाच काहीतरी चूक होत आहे.
दोन परिणाम व्यवहारात सिद्धांताच्या खोलवर अधिक महत्वाचे आहेत. सुधार साधारण प्रदर्शन नाहीत: ते Mandlekar et al. वर्णन करतात तेथे अडचण क्षेत्रांवर एकाग्र करते, जिथे लहान विचलन धोरण राज्यांमध्ये ड्रॉप करते प्रदर्शन कधीच कव्हर केली. आणि एक डेटासेट केवळ त्या कठीण भागांच्या बनविली एक वाईट आकारची डेटासेट आहे - Belkhale, Cui आणि Sadigh डेटा बाजूवरून बहस करतात की राज्य विविधता नेहमी फायदेशीर नाही, आणि की क्रिया divergence आणि transition diversity एकत्र डेटासेट गुणवत्ता निर्णय करते. मिश्र डेटासेट एक तडजोड नाही, हा मुद्दा आहे.
राउंड एकाने हे फ्रीজ करा
एक DAgger राउंड वेळ ओलांडून धोरण विरुद्ध तुलना करते. डेटासेट नाही पुष्कळ आपण राउंड्स दरम्यान बदलता ते तुलना अर्थहीन बनवते.
- कॅमेरा स्थिति आणि मार्ग, हाताळीचे कॅमेरा समाविष्ट. एक क्लॅम्प सैलला करा आणि आपण निरीक्षण वितरण बदलले, धोरण नाही.
- एक्सपोजर आणि व्हाइट बॅलेंस, जर आपले कॅप्चर स्टॅक आपल्याला तेथे पिन करू दे. ऑटो-एक्सपोजर दरम्यान अलग-अलग राउंड एक संपूर्ण, अदृश्य डोमेन शिफ्ट आहे.
- आर्म कॅलिब्रेशन आणि servo zero स्थिती. जर आपल्याला पुनर्कॅलिब्रेट करावे लागले, तर सर्व कोणत्या आधी रेकॉर्ड केले एक वेगळ डेटासेट म्हणून मानवा.
- कार्य मजकूर. येथे प्रत्येक VLA हे अवस्थित करते; मध्य-लूप rewording हे एक वेगळ कार्य आहे.
- प्रकाश, टेबल पृष्ठभाग, ऑब्जेक्ट सेट. एक नवीन ऑब्जेक्ट एक नवीन प्रयोग आहे, अनुसरण राउंड नाही.
- रेकॉर्डिंग फ्रेम दर. दोन नमुना rastersवर intervention rates तुलना करणे फरक तयार करते जे raster येते.
Hsu et al. हाथ-केंद्रित दृश्य सामान्य तृतीय-व्यक्ति दृष्टिकोण विरुद्ध तुलना केली आणि आँख-इन-हाथ दृष्टिकोण सुसंगत सुधारलेले प्रशिक्षण दक्षता आणि बाहर-of-वितरण सामान्यीकरण, अधिक दृश्य पाहूनही कमी करूल. पाँच-संयुक्ति आर्म वर, gripper समय आपल्या सुधार आमतौर वर फिक्स करत आहेत, आणि gripper समय हे वर हाताळीचे दृश्य वहन करते.
राउंड, शेवट ते शेवट
- 1अनुमान चलवा आणि रेकॉर्ड करा
चेकपॉइंट विरुद्ध धावा शुरू करा आपल्याला सुधारणे आवश्यक आहे, तर अनुमान रूट मध्ये रेकॉर्डिंग शुरू करा. त्या रेकॉर्ड केले त्या रेकॉर्डिंग आपल्या स्वतःचा कार्य मजकूर पारंपारिक teleoperation लेबलऐवजी, जे हे धोरण वर प्रशिक्षित केले होते. रेकॉर्डिंग अपयश पाहू शकता परंतु प्रशिक्षण वर सक्षम नाही.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2तेव्हा तेव्हा ताबा घेणे चूक होते
Take over दबाणे आणि इनपुट मोड निवडा: लीडर आर्म, कीबोर्ड किंवा स्लाइडर. धावक विराम करते, आपल्याला सुधारले, आपल्याला हाताळू परत. फ्रेम रेकॉर्ड केले होते आपल्याला ड्राइविंग while हस्तक्षेप म्हणून स्वयंचलितपणे ध्वजांकित.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3एपिसोड तपास करा
प्रति एपिसोड निर्णय: सुधार म्हणून फाइल, मूल्यांकन म्हणून ठेवा, किंवा त्यागा. एक धावा धोरण अपयश अगर सहाय्य मूल्यांकन डेटा आहे.
- 4सुधार डेटासेट sync करा
सुधार एक स्थानिक डेटासेट प्रति धोरण संग्रह करता आणि स्वयंचलित sync माध्यमे ढोमे स्टोरेज करता. काहीच मिश्रित आहे जे आपल्याने तिथे पाठविले नाही.
- 5मिश्र डेटासेट रचना करा
मूळ डेटासेट सुधार डेटासेटसह एकत्र करा, स्रोत प्रति एपिसोड स्पष्टपणे निवडून. परिणाम त्या बिंदू पासून एक सामान्य डेटासेट आहे.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6चेकपॉइंटवरून प्रशिक्षण सुरू ठेवा
मिश्र मागील चेकपॉइंटवरून प्रशिक्षित करा ऐवजी बेस मॉडेल. कोणत्या चेकपॉइंट आणि कोणते मिश्रण नोट करा; त्या जोडी अगर राउंड पुनरुत्पादनीय नाही.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
विस्तारामध्ये चरण 2: ताबा घेण्याचे दोन मार्ग
एक लीडर आर्मसह
मध्ये लीडर-फॉलोअर मोड takeover हे दोन आर्मांमध्ये हँडओव्हर आहे जे एक पोज मध्ये नाहीत. Take over दबाणे धावक विराम करते आणि लीडर फॉलोअर वर्तमान पोज वर ड्राइव करते, म्हणून काहीच जम्प तेव्हा टॉर्क हस्तांतरण. जर त्या संरेखन ड्राइव वेळा संपली, हाताळू लीडर संरेखित करा आणि फक्त एक बार रिलीज करा दोन पाँच अंश मध्ये आहेत. तेथून आपल्याला सामान्यतः teleoperate आणि क्रिया स्तंभ आपल्याने आदेश केले काय रेकॉर्ड करते.
या मार्ग के बारे में ईमानदार: संरेखन ड्राइव आणि टॉर्क हँडओव्हर लूप प्रकृत हार्डवेअर वर कमीत कमी परीक्षित भाग आहेत. हँडओव्हर एक संपूर्ण, हानिरहित पोज वर परीक्षा करा आपल्याला एक धावा आपल्याला काळजीचे लेखदेव वर. एक लीडर आर्म तीन मोडमध्ये सबसे गुळगुळीत सुधार तयार करते, आणि याला सर्वाधिक आहे जे यांत्रिकरित्या गलत जाऊ शकते.
एक लीडर आर्मशिवाय: कीबोर्ड आणि स्लाइडर
सर्वाधिक लोक वाचण्यास एक आर्म मालकीचे. हे पुरेसे आहे. Take over दबाणे आणि कीबोर्ड निवडा किंवा स्लाइडर इनपुट, आणि takeover तत्काळ आणि व्यक्तिगत - कोणते दुसरे आर्म आहे संरेखन पायरी नाही. फॉलोअर आपली पोज ठेवते आणि इनपुट प्रतीक्षा करते.
| इनपुट मोड | कसे आर्म हलते | सर्व-कॉल मर्यादा सर्वर द्वारा लागू | लॉक केले जेव्हा |
|---|---|---|---|
| लीडर आर्म | मिरर लीडर संयुक्ति कोण फॉलोअर ड्राइव करते | या मोडमध्ये कोणते nudge किंवा सेट कॉल नाही; मिरर फॉलोअर लक्ष्य सतत लिहते | कधीही लॉक नाही, आणि डिफॉल्ट अगर इनपुट मोड दिली नाही - परंतु हे दुसरे आर्मचा आवश्यकता आहे; लीडर आयडी अगर takeover नकार दिली आहे |
| कीबोर्ड | संबंधित nudge प्रति की दबाणे, takeover nudge endpointवर पाठविली | संयुक्ति प्रति 2 अंशांचा कठोर क्लॅम्प, ग्रिपर प्रति 4 अंश | 409 सह नकार अगर takeover लीडर मोडमध्ये शुरू केली |
| स्लाइडर | परिपूर्ण लक्ष्य पोज, takeover सेट endpointवर पाठविली | अधिक एक कॉल प्रति 6 अंश लक्ष्य दिशा प्रवास; interface सुमारे दहा वेळा प्रति दुसरे भेजता राहते | 409 सह नकार अगर takeover लीडर मोडमध्ये शुरू केली |
क्लॅम्प सर्वर-पक्ष लागू केले जाते, interface नाही, कारण typed delta एक बस-सर्वो आर्म एक टकराव आहे. कीबोर्ड सुधार stepwise आणि थोडे कोर्स आहेत; स्लाइडर सुधार गुळगुळीत, कारण सर्वर लक्ष्य दिशा चालता जेव्हा interface राहता streaming. एक जिथे किंवा अन्य क्रिया स्तंभ संपूर्ण आदेशित पोज वेक्टर प्राप्त करते आणि intervention चिह्नन लीडर मार्ग समान आहे, तर कीबोर्ड सुधार डेटासेट मध्ये उतरते format फरक अगर।
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
बटण कधी दबाणे
लवकर बजाय देर. एक सुधार जे सुरू होते gripper कोणत्याही बंद केले नंतर recovery शिकते एक अपयश वरून धोरण अंतर्गत नाही, आणि recovery डेटा avoidance डेटा वर खूप काम मूल्य आहे. Interrupt एक क्षण आपल्याला आत्मविश्वास आहे ते trajectory गलत आहे, सुधारणे कठीण भाग, हाताळू परत एक राज्य धोरण हाताळू आधी हे. ThriftyDAgger त्या निर्णय स्वयंचलित करते gating interventions novelty वर आणि अंदाज जोखीम अनुसार fixed मानव बजट, परंतु एक एकल आर्मवर मानव आधीच घरके, मानव गेट स्वस्त आणि खर्च आपल्याला अर्जन काई की.
खुल्या-स्रोत स्टॅक सह achievable आणि एक काही स्क्रिप्ट. काई खर्च हे bookkeeping आहे, आणि bookkeeping जिथे DAgger राउंड मरते.
- फ्रेम लिहा आपल्या स्वतःच्या अनुमान स्क्रिप्ट LeRobot डेटासेट मध्ये, कार्य स्ट्रिंग सह धोरण वर प्रशिक्षित केली.
- धोरण लूप विराम करा, कमांड स्रोत स्विच करा, आणि प्रति फ्रेम ध्वजांकित आपल्याला ड्राइव करूल intervention . अगर फ्लॅग, सुधार साधारण प्रदर्शन दिसते.
- विचार रचनाशील काई होते मध्य फ्रेम transition धोरण नियंत्रण रिलीज करते आणि आपल्याने प्रथम इनपुट दरम्यान.
- सुधार आपल्या स्वतःच्या डेटासेट प्रति धोरण ठेवा, आणि ट्रॅक एपिसोड indices हाताळू तर मिश्र पुनर्निर्माण केले जाऊ शकते.
- बिंदु मीठा-ट्यूनिंग entry बिंदू मागील चेकपॉइंट, आणि तपास लॉग त्या वजन लोड केली.
समान सहा पायरी बटन म्हणून अस्तित्व. कोणते स्वयंचलित आहे काय सहजे गलत हाताळू द्वारा: प्रति-फ्रेम intervention ध्वजांकन, सुधार आणि मूल्यांकन दरम्यान split, आणि रेकॉर्ड कोणत्या चेकपॉइंट कोणते मिश्रण तयार केली. काहीच एक तयार डेटासेट प्रवेश जे आपल्याने निवडले नाही.
तर निर्णय आपल्याले. कोणते धावा सुधार गणना होते, कोणत्या एपिसोड मिश्रण करता जाते, आणि कधी थांबवले अगर stay निर्णय कॉल. क्षेत्र अंतर्गत प्रलेखित आहेत प्रशिक्षण, इनपुट मोड अंतर्गत teleoperation.
विस्तारामध्ये चरण 3: तपास गुणवत्ता निर्णय करते
धावा नंतर आपल्याला एक रेकॉर्डिंग काही फ्रेम हस्तक्षेप म्हणून चिह्नित आहे. तीन गंतव्य अस्तित्व, आणि गलत एक quietly विषबाधा पुढील राउंड.
- सुधार फाइल जेव्हा हस्तक्षेप एक नक्की फिक्स होते: धोरण कुठेतरी गलत शिरले आणि आपल्याने इनपुट दर्शविले सही काहीतर धोरण स्वतः तयार राज्य.
- मूल्यांकन ठेवा स्वच्छ autonomous धावनेबाजार आणि धावा आपल्याले ताबा बाहर सावधानी. मूल्यांकन एपिसोड पुढील चेकपॉइंट मापन कसे हे आहे, आणि ते प्रशिक्षण कधीही होणार नाही.
- त्यागा धावा ruined काहीतर असंबद्ध - एक dropped कॅमेरा फ्रेम, एक stalled servo, एक ऑब्जेक्ट आपल्याले घन वर knocked. एक messy सुधार कोणते कोणत्याही सुधार नाही चेहरा.
धोरण नियंत्रण रिलीज करते आणि आपल्याने प्रथम इनपुट दरम्यान, आर्म अभी राहते तर रेकॉर्डर लिहते - एक धावा एक समान poses जोडलेले थोडे अलग image. येथे हे handover फ्रेम कच्च्या रेकॉर्डिंग मध्ये राहते आणि सुधार डेटासेट बाहर. जर आपल्याने लूप आपल्या स्वतःचा, तर कट deliberately: एक धोरण तर शिकते pause जे हे काय कार्य.
विस्तारामध्ये चरण 5: मिश्र रचना
संरचना मूळ डेटासेट सुधार डेटासेट सह लेते आणि एक नवीन, सामान्य LeRobot डेटासेट कि प्रशिक्षित जसे कुछ अन्य. महत्वाचे संपत्ति हे एपिसोड निवड आहे स्पष्ट प्रति स्रोत - काहीच स्वयंचलितपणे mixes. कि सांगते कमी होने तक पहिल्यांदा एक धोरण अजीब आचरण आणि आपल्याले पुनर्निर्माण काई येह वर प्रशिक्षित केली.
खुल्या प्रश्न हे अनुपात आहे, आणि कोणी संख्या नाही जो हस्तांतरण. साहित्य काय करते सहमति आहे सुधार चाहिए गणना खर्च अनिवार्य फ्रेम शेयर. Mandlekar et al. retrain पुनरावृत्ती वर डेटा त्यांचे intervention प्रणाली एकत्र करते, तर धोरण learns bottleneck, आणि रिपोर्ट agents trained तर आहे outperform agents non-interventional demonstrators प्रति समतुल्य नमूना संख्या प्रशिक्षित. Sirius आगे जाता आणि फिर-weights प्रशिक्षण नमूना द्वारा अनुमानित मानव विश्वास, रिपोर्टिंग एक 8 प्रतिशत लाभ सिमुलेशन आणि 27 प्रतिशत वास्तविक हार्डवेअर वर धोरण सफलता दर विरुद्ध पद्धति हे तुलना सह, दो गुना convergence गति पर. कोणते प्रशिक्षण entry बिंदु येथे नाही एक नमूना-weighting नॉब उजागर, तर crude विकल्प आहे राखा प्रत्येक सुधार एपिसोड जे subsample मूळ प्रदर्शन - आणि लिहा काई आपल्याले किया.

विस्तारामध्ये चरण 6: जे सुरू ठेवण्यास एक चेकपॉइंट साधारण अर्थ
मिश्र प्रशिक्षित आधार मॉडेल कार्य परंतु फेंक मागील राउंड आणि खर्च एक संपूर्ण धावा. सुरू ठेवा मागील checkpoint तेजस्वी आणि सामान्यतः खरे. हे याची अधिक सीमित आहे वाक्य सुझाव देते.
एक वजन-केवळ checkpoint शामिल प्राचीन आणि काहीच अन्य. लोडिंग हे अगली धावचा बेहतर beginning बिंदु देते बेस मॉडेल दिल, परंतु optimizer क्षण, शिक्षण-दर अनुसूची अवस्थान आणि डेटा अनुक्रम प्रारंभ शून्य से. अपेक्षा एक नुकसान spike शुरुआत सुरू केले हुए धावा, पढ़ नाही एक विफलता, आणि अंतर्गत कॉल करू नाही राउंड एक resume. हे एक वार्म शुरुआत.
| धोरण | आकार | GPU परत | प्रति कार्य चरण अनुमान | डेटासेट प्रारूप | एपिसोड पहले हे मूल्य प्रयास करना |
|---|---|---|---|---|---|
| GR00T N1.7 | लगभग 3 B, मोटे 40 M दौरान प्रशिक्षित फाइन-ट्यूनिंग | A100 80 GB किंवा H100 80 GB | लगभग 152 ms | LeRobot v2.0 किंवा v2.1 | 50 |
| GR00T N1.5 | लगभग 3 B | A100 80 GB किंवा H100 80 GB | लगभग 165 ms | LeRobot v2.0 किंवा v2.1 | 50 |
| Pi0 | लगभग 3 B पर एक PaliGemma backbone | A100 80 GB किंवा H100 80 GB | लगभग 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | लगभग 450 M | RTX 4090 किंवा कोणते 24 GB कार्ड | लगभग 245 ms | LeRobot v3.0 | 30 |
| ACT | लगभग 80 M, प्रारंभ से प्रशिक्षित | RTX 4090 किंवा कोणते 24 GB कार्ड | लगभग 20 ms | LeRobot v3.0 | 50 |
लेटेंसी यौगिक अंदर एक DAgger लूप एक रास्ता यह नाही demo पर: लगभग 485 ms प्रति कार्य चरण आपल्याले ताबा क्योंकि आर्म hesitated, नहीं क्योंकि हे गलत होते, आणि hesitation सुधार नाही उपयोगी प्रशिक्षण डेटा. जर आपल्याले iterate डेटा वर बजाय नहीं चेतन सफलता दर, iterate तेजस्वी मॉडेल. Shukor et al. वर्णन SmolVLA एक एकल GPU पर प्रशिक्षित करने के लिए डिज़ाइन किया गया आणि deploy उपभोक्ता GPU वर किंवा CPU, एक asynchronous अनुमान स्टॅक सह कि decouples कार्य भविष्यवाणी प्रभाव हे सक्षम उच्च नियंत्रण दर - सम्पत्ति कि तर एक takeover लूप जवाबदेही.
डेटासेट प्रारूप नहीं आहेत interchangeable. GR00T सहायता LeRobot v2.0 किंवा v2.1, आणि Isaac-GR00T repository वर्णन इनपुट एक स्वाद LeRobot v2 प्रारूप एक जोड़ा modality विवरण फाइल; की नई प्रशिक्षक येथे आशा v3.0. एक मिश्र तयार गलत संस्करण में विफल लोड समय वर ऐसा उत्पादन खराब धोरण - अच्छे विफलता मोड, अभी एक व्यर्थ कतार स्लॉट. डेटासेट प्रलेखन सूची कि प्रारूप प्रत्येक ट्रेनर सहायता.
लूप, bookkeeping पहले से ही किया
Takeover एक लीडर आर्म सह, कीबोर्ड किंवा स्लाइडर; प्रति-फ्रेम intervention चिह्नन; फाइलिंग धावा सुधार किंवा मूल्यांकन; रचना एक मिश्र डेटासेट एक स्पष्ट एपिसोड निवड प्रति स्रोत; आणि सुरू ठेवा प्रशिक्षण एक चेकपॉइंट ऐसा बेस मॉडेल. काही अगर आपल्याले निर्णय हे कि धावा गणना एक सुधार, काई सेट मिश्र, आणि कधी नुकसान intervention दर बंद.
पाहा कसे DAgger लूप wired हेचार विधि एक राउंड नष्ट करने के लिए
1. सुधार अकेलेपन पर प्रशिक्षण
सबसे सामान्य विफलता आणि सबसे tempting shortcut. एक सुधार-केवल डेटासेट लगभग सपूर्ण कठीण मध्य कार्य, साथ दृष्टिकोण आणि retreat हराइ; धोरण खर्च कठीण भाग आणि भूल पहुँच वहाँ. एकीकरण नहीं एक कार्यान्वयन विस्तार पद्धति, हे संपूर्ण: पुरानी डेटा काई तर व्यवहार जगह राखते जबकि सुधार एक भाग हिलाता है.
2. कॅमेरा राउंड्स दरम्यान चलाना
एक कॅमेरा कि shifts दो सेंटीमीटर राउंड्स दरम्यान धोरण उत्पादन दुर्लभ तुम शुरू, आणि निदान जे खरचे एक दिन. प्रत्येक VLA येथे हे छवि पर शर्त; संयुक्ति अकेली disambiguate नहीं करता जहाँ ऑब्जेक्ट है. फोटो येथे सेट्ट पहले राउंड पहले आणि तपास कि तस्वीर प्रत्येक बाद एक.
3. Handover कलाकृति में छोड़ने प्रशिक्षण
ऊपर का हिस्सा, आणि सूची पर यह अदृश्य आहे. लक्षण एक धोरण कि stalls एक अंश दूसरा अचूक जहाँ पुरानी राउंड ऑपरेटर ताबा लेता. हे दिखता है hesitation; हे imitation.
4. एक वार्म शुरुआत एक resume कॉल
जर आपल्याले विश्वास optimizer राज्य पहुँच बंद, प्रारंभिक नुकसान spike पढ़ता एक बग आणि आपल्याले शिकार संकर्षण डेटा के लिए. जर आपल्याले पता optimizer शुरू जताया, spike उम्मीद आणि आपल्याले पाहा काई येते नंतर यह. समान संख्या, विपरीत निष्कर्ष.
राउंड मापन
मेट्रिक एक मानव-gated लूप हे intervention दर: फ्रेम रेकॉर्ड केले होते जेव्हा आपल्याले नियंत्रण में, विभाजित कुल फ्रेम धावा. यह takeover स्थिति में है, आणि यह एकमेव संख्या कि उत्तर प्रश्न राउंड पूछा. प्रशिक्षण नुकसान पड़ता धोरण सुधारलेले अगर; सफलता दर binary आणि noisy नमूना आकार एक डेस्क आर्म उत्पादन करते. Intervention दर निरंतर, मापा पर राज्य धोरण स्वतः कारण, आणि droplets जेव्हा धोरण आवश्यकता तुम कम.
तुलना यह फक्त राउंड्स रेकॉर्ड केले समान conditions अंतर्गत. पूर्ण तर्क, आणि कसे निर्माण एक मूल्यांकन सेट जे survives दो राउंड्स से अधिक, आहे लेख DAgger लूप मापन वर. राउंड एक realistically एक feasibility परीक्षा: आपल्याले हार्डवेअर आपल्याले takeover काम, सुधार उतरले कि त्यांचे flags, आणि सुरू केले धावा लोड checkpointer आपल्याले नाम. राउंड्स दोन आणि तीन जहाँ दर चाहिए शुरू ले. जर येह चार दरम्यान नहीं चले, समस्या आहे upstream DAgger.
| लिहा प्रति राउंड अनुसूची | काही मायने आगे |
|---|---|
| Checkpoint कि हे ड्राइव किया जाता था | अगर यह आपल्याले कोणते सुधार मिश्र किंवा attribute करू शकु नही |
| इनपुट मोड समझाया takeover के लिए | कीबोर्ड सुधार आहेत coarser लीडर सुधार, आणि हे डेटा हे दिखाता है |
| चलाता संख्या आणि कसे प्रत्येक तपास किया गया | क्या राउंड पर्याप्त सुधार पर नहीं मायने मुद्दा होने के लिए |
| Intervention दर प्रति धावा, आणि अर्थ | लूप प्रगति मेट्रिक |
| एक्सक्ट एपिसोड निवड प्रति स्रोत | एकमेव तरीका पुनरुत्पादन किंवा पूर्ववत राउंड |
| वार्म शुरुआत किंवा ताजा प्रशिक्षण | व्याख्या नुकसान curve आपल्याले एक सप्ताह पर पाहा |
जर आपल्याले एक checkpoint नहीं है
लूप कोणते entry बिंदु अगर नहीं एक. एक पहला डेटासेट रेकॉर्ड, प्रशिक्षित एक पहला धोरण, चलाव - रेकॉर्डिंग, प्रशिक्षण आणि धावना धोरण कवर कि पथ. प्रशिक्षण क्लायंट चालू है डाउनलोड पृष्ठ, GPU परत आणि hourly दर पर pricing पृष्ठ, आणि काई एक usable एपिसोड दिखता है SO-100 डेटा संग्रह गाइड. सही प्रदर्शन पहले सुधार हे: DAgger एक repair तंत्र, आणि हे काम far खर्च लगभग सही कुछ पर.
काई मैं चलाव एक DAgger लूप एक लीडर आर्मशिवाय?▾
हे. निवडा कीबोर्ड किंवा स्लाइडर इनपुट जे आपल्याले प्रेस Take over: takeover तत्काळ आणि व्यक्तिगत, साथ नहीं दुसरे आर्म करने के लिए संरेखित. कीबोर्ड भेजता relative nudges सर्वर क्लॅम्प कठोर 2 अंश प्रति संयुक्ति आणि 4 gripper के लिए; स्लाइडर भेजता absolute लक्ष्य आणि सर्वर आगे बढ़ता सबसे 6 अंश दिशा हर कॉल करने के लिए, जबकि interface राहता streaming. कार्य स्तंभ आणि intervention चिह्नन हैं लीडर मोड में समान, तर कीबोर्ड सुधार डेटासेट मध्ये undistinguishable.
कितना सुधार तक एक राउंड की जरूरत?▾
नहीं एक रक्षणीय सार्वभौमिक संख्या, आणि फ्रेम गणना मायने राहता अधिक एपिसोड गणना. काई नियम आहे सुधार होणार नाही हराइ मिश्र: साथ 200 मूळ एपिसोड आणि तीन सुधार एपिसोड, काहीच ले. लक्ष्य सुधार जे कवर विफल वर्तन कई starting कॉन्फिगरेशन अनुसरण नहीं तीन repetition समान बचाव की.
काई प्रशिक्षण अकेलेपन सुधार इस तरह एक खराब विचार?▾
क्योंकि सुधार लगभग सपूर्ण कठीण मध्य कार्य. दृष्टिकोण, संरेखन आणि retreat हराइ, तर धोरण नुकसान काई हे पहले से ही अच्छा जबकि सुधार भाग. ओल्ड डेटा रखना आणि जोड़ अनुसरण यह तंत्र ही, नहीं एक विकल्प अतिरिक्त.
काई जारी एक चेकपॉइंट resume पूर्व प्रशिक्षण धावा?▾
नहीं. एक वजन-केवल चेकपॉइंट restores प्राचीन आणि काहीच अन्य: optimizer क्षण, शिक्षण-दर अनुसूची स्थान आणि डेटा क्रम शुरुआत ताजा. हे एक वार्म शुरुआत, आणि एक प्रारंभिक नुकसान spike expected अनुसरण नहीं एक लक्षण. लिहा नीचे कि दोनों आपल्याले वास्तव किया, तर आपल्याले पढ़ curve सही एक सप्ताह.
काई जर intervention दर नहीं पड़ता?▾
थांबवा जोड़ राउंड्स. एक flat दर मतलब सुधार नहीं हे सिखाने जे आपल्याले सोच. सामान्य कारण आहेत upstream: एक कॅमेरा चले, सुधार शुरुआत भी देर avoidance डेटा होने के लिए, handover फ्रेम आहेत प्रशिक्षण सेट, किंवा कार्य underdetermined अनुसरण observations धोरण वास्तव प्राप्त.
कोणते यह हे एक हल समस्या आणि कोणते यह एक क्लिक. Interactive imitation शिक्षण एक सक्रिय अनुसंधान क्षेत्र precisely क्योंकि प्रश्न - कधी intervene, कसे वजन काई मानव किया, कितना पुरानी डेटा रखना - नहीं हे fixed उत्तर; सर्वेक्षण Celemin et al. डाली काई अभी खुल्या. काई लूप has मापने convergence जे हे चलाया carefully, हार्डवेअर पर कि खरचा कुछ सौ यूरो. Freeze सेट्ट, intervene जल्दी, तपास ईमानदार, मिश्र deliberately, आणि रेकॉर्ड intervention दर हर समय.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started