एक SO-100 लागत-प्रभावी रोबोट आर्म टेबलावर सेट केलेला, टेलिऑपरेशन आणि धोरण प्रशिक्षणासाठी तयार
DAggerSO-100Imitation LearningVLATeleoperation

SO-100 वर VLA Policy सह DAgger Loop चालवणे

AY-Robots ResearchAugust 27, 202615 मि वाचन

एक SO-100 आर्मवर एक मानव-गेटेड DAgger राउंडचे चरण-दर-चरण विवरण: धोरण चलवा आणि रेकॉर्ड करा, जेव्हा वर्तन गलत होते तेव्हा ताबा घेणे, धावा सुधारणे म्हणून फाइल करणे, मिश्र डेटासेट तयार करणे, आणि चेकपॉइंटवरून प्रशिक्षण सुरू ठेवणे. लीडर आर्मशिवाय लोकांसाठी कीबोर्ड आणि स्लाइडर ताबा मार्ग समाविष्ट आहे, आणि चार चुका जे एक राउंड अमूल्य बनवतात.

आपली धोरण चलते. हे घन साधनार्थ आणि एक सेंटीमीटर लवकर ग्रिपर बंद करते, आणि असेच चालू राहते जणू कसे होते. काहीही त्रुटी नाही, आणि प्रशिक्षण नुकसान वर कोणत्याही प्रमाणात टक टाकणे त्याचे स्पष्टीकरण नाही. निराकरण समान प्रदर्शनांवर आणखी 20 000 ग्रेडियंट पायऱ्या नाही. हे आपले हाताने आर्मवर परत ठेवणे आहे अचूक जिथे ते चूक होते, आपण कोणी केले हे रेकॉर्ड करणे, आणि पुढील चेकपॉइंट प्राचीन डेटा अधिक त्या सुधारणेवर प्रशिक्षित करणे. हाच एक DAgger राउंड आहे, आणि हे एक SO-100 वर vision-language-action धोरणासह कसे एक चलते ते आहे.

सिद्धांत इतरत्र आहे: डेटासेट एकत्रीकरण कोणी कार्य का करते आणि मानव गेटिंग याबद्दल काय बदलते. हे ऑपरेटिंग मॅनुअल आहे, आणि हे एक प्रशिक्षित चेकपॉइंट, कार्यरत कॅमेरा सेट, आणि हलणारा आर्म गृहीत धरते. खाली सहा पायरी हा लूप आहे जसे या प्लॅटफॉर्मच्या DAgger पृष्ठावर लागू केला आहे, परंतु अनुक्रम आपल्या स्वतःच्या स्क्रिप्टमधून समान आहे.

संक्षेप मध्ये एक राउंड

  • प्रशिक्षित धोरण चलवा आणि रेकॉर्ड करा, कार्य मजकूर सह धावचा सामान्य teleoperation लेबलऐवजी.
  • वर्तन चूक असते तेव्हाच ताबा घेणे: लीडर आर्मसह मिरर हँडओव्हर, कीबोर्ड किंवा स्लाइडरशिवाय तत्काळ आणि व्यक्तिगत.
  • प्रत्येक धावाचा तपास: सुधार म्हणून फाइल करा, मूल्यांकन एपिसोड म्हणून ठेवा, किंवा त्यागा.
  • मिश्र संरचना व्यक्तिमत्तेने - मूळ प्रदर्शन अधिक सुधार, स्रोत प्रति एपिसोड निवडलेले. कधीही केवळ सुधारणेवर प्रशिक्षित करू नका.
  • शेवटच्या चेकपॉइंटवरून प्रशिक्षण सुरू ठेवा, आणि कोणत्या चेकपॉइंटने कोणत्या मिश्रणा तयार केली ते नोट करा.
  • राउंड कोणत्याही किंमती होता हे मोजणारी संख्या हा intervention rate आहे, प्रशिक्षण नुकसान नाही.

दुसरा राउंड फक्त अधिक डेटा नाही का

Behavior cloning राज्य एक मानव पाहिली त्या वर प्रशिक्षित करते. परीक्षण वेळी धोरण राज्य भेट करते हे कारण करते, आणि लहान क्रिया त्रुटी कंपाउंड करते राज्यांमध्ये कोणत्याही प्रदर्शन कव्हर केली. Ross, Gordon आणि Bagnell AISTATS 2011 साठी त्या अपयशचे औपचारिकीकरण केले आणि हे एक पुनरावृत्ती अल्गोरिदम उत्तर दिले जे स्थिर नियंत्रणक प्रशिक्षित करते आणि, त्यांच्या कमी केल्यानुसार, अंतर्गत राज्य वितरण अंतर्गत चांगले कार्य करणे आवश्यक आहे हे प्रेरित करते: वर्तमान धोरण चलवा, तज्ञ ते राज्य लेबल करा हा वास्तव पोहोचला, डेटासेटमध्ये जोडा, पुनर्रचना करा, पुनरावृत्ती करा. Kelly et al. HG-DAgger सह प्रश्नाचे व्यावहारिक केले, जिथे मानव नियंत्रण घेण्याचा निर्णय घेते ऐवजी नियंत्रण धारण केल्याशिवाय राज्य लेबल करा; ते DAgger आणि behavior cloning या दोन्हीवर सुधारलेले कार्यक्षमता नोंद करतात आणि सिम्युलेटेड आणि वास्तविक स्वायत्त ड्राइविंग कार्यावर. मानव गेटिंग हे डेस्क आर्मवर लूप सहनीय बनवते जे - आपण आपले हाता हलवता तेव्हाच काहीतरी चूक होत आहे.

दोन परिणाम व्यवहारात सिद्धांताच्या खोलवर अधिक महत्वाचे आहेत. सुधार साधारण प्रदर्शन नाहीत: ते Mandlekar et al. वर्णन करतात तेथे अडचण क्षेत्रांवर एकाग्र करते, जिथे लहान विचलन धोरण राज्यांमध्ये ड्रॉप करते प्रदर्शन कधीच कव्हर केली. आणि एक डेटासेट केवळ त्या कठीण भागांच्या बनविली एक वाईट आकारची डेटासेट आहे - Belkhale, Cui आणि Sadigh डेटा बाजूवरून बहस करतात की राज्य विविधता नेहमी फायदेशीर नाही, आणि की क्रिया divergence आणि transition diversity एकत्र डेटासेट गुणवत्ता निर्णय करते. मिश्र डेटासेट एक तडजोड नाही, हा मुद्दा आहे.

राउंड एकाने हे फ्रीজ करा

एक DAgger राउंड वेळ ओलांडून धोरण विरुद्ध तुलना करते. डेटासेट नाही पुष्कळ आपण राउंड्स दरम्यान बदलता ते तुलना अर्थहीन बनवते.

  • कॅमेरा स्थिति आणि मार्ग, हाताळीचे कॅमेरा समाविष्ट. एक क्लॅम्प सैलला करा आणि आपण निरीक्षण वितरण बदलले, धोरण नाही.
  • एक्सपोजर आणि व्हाइट बॅलेंस, जर आपले कॅप्चर स्टॅक आपल्याला तेथे पिन करू दे. ऑटो-एक्सपोजर दरम्यान अलग-अलग राउंड एक संपूर्ण, अदृश्य डोमेन शिफ्ट आहे.
  • आर्म कॅलिब्रेशन आणि servo zero स्थिती. जर आपल्याला पुनर्कॅलिब्रेट करावे लागले, तर सर्व कोणत्या आधी रेकॉर्ड केले एक वेगळ डेटासेट म्हणून मानवा.
  • कार्य मजकूर. येथे प्रत्येक VLA हे अवस्थित करते; मध्य-लूप rewording हे एक वेगळ कार्य आहे.
  • प्रकाश, टेबल पृष्ठभाग, ऑब्जेक्ट सेट. एक नवीन ऑब्जेक्ट एक नवीन प्रयोग आहे, अनुसरण राउंड नाही.
  • रेकॉर्डिंग फ्रेम दर. दोन नमुना rastersवर intervention rates तुलना करणे फरक तयार करते जे raster येते.
हाताळीचे कॅमेरा पर्याय फर्निचर नाही

Hsu et al. हाथ-केंद्रित दृश्य सामान्य तृतीय-व्यक्ति दृष्टिकोण विरुद्ध तुलना केली आणि आँख-इन-हाथ दृष्टिकोण सुसंगत सुधारलेले प्रशिक्षण दक्षता आणि बाहर-of-वितरण सामान्यीकरण, अधिक दृश्य पाहूनही कमी करूल. पाँच-संयुक्ति आर्म वर, gripper समय आपल्या सुधार आमतौर वर फिक्स करत आहेत, आणि gripper समय हे वर हाताळीचे दृश्य वहन करते.

राउंड, शेवट ते शेवट

  1. 1
    अनुमान चलवा आणि रेकॉर्ड करा

    चेकपॉइंट विरुद्ध धावा शुरू करा आपल्याला सुधारणे आवश्यक आहे, तर अनुमान रूट मध्ये रेकॉर्डिंग शुरू करा. त्या रेकॉर्ड केले त्या रेकॉर्डिंग आपल्या स्वतःचा कार्य मजकूर पारंपारिक teleoperation लेबलऐवजी, जे हे धोरण वर प्रशिक्षित केले होते. रेकॉर्डिंग अपयश पाहू शकता परंतु प्रशिक्षण वर सक्षम नाही.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    तेव्हा तेव्हा ताबा घेणे चूक होते

    Take over दबाणे आणि इनपुट मोड निवडा: लीडर आर्म, कीबोर्ड किंवा स्लाइडर. धावक विराम करते, आपल्याला सुधारले, आपल्याला हाताळू परत. फ्रेम रेकॉर्ड केले होते आपल्याला ड्राइविंग while हस्तक्षेप म्हणून स्वयंचलितपणे ध्वजांकित.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    एपिसोड तपास करा

    प्रति एपिसोड निर्णय: सुधार म्हणून फाइल, मूल्यांकन म्हणून ठेवा, किंवा त्यागा. एक धावा धोरण अपयश अगर सहाय्य मूल्यांकन डेटा आहे.

  4. 4
    सुधार डेटासेट sync करा

    सुधार एक स्थानिक डेटासेट प्रति धोरण संग्रह करता आणि स्वयंचलित sync माध्यमे ढोमे स्टोरेज करता. काहीच मिश्रित आहे जे आपल्याने तिथे पाठविले नाही.

  5. 5
    मिश्र डेटासेट रचना करा

    मूळ डेटासेट सुधार डेटासेटसह एकत्र करा, स्रोत प्रति एपिसोड स्पष्टपणे निवडून. परिणाम त्या बिंदू पासून एक सामान्य डेटासेट आहे.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    चेकपॉइंटवरून प्रशिक्षण सुरू ठेवा

    मिश्र मागील चेकपॉइंटवरून प्रशिक्षित करा ऐवजी बेस मॉडेल. कोणत्या चेकपॉइंट आणि कोणते मिश्रण नोट करा; त्या जोडी अगर राउंड पुनरुत्पादनीय नाही.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

विस्तारामध्ये चरण 2: ताबा घेण्याचे दोन मार्ग

एक लीडर आर्मसह

मध्ये लीडर-फॉलोअर मोड takeover हे दोन आर्मांमध्ये हँडओव्हर आहे जे एक पोज मध्ये नाहीत. Take over दबाणे धावक विराम करते आणि लीडर फॉलोअर वर्तमान पोज वर ड्राइव करते, म्हणून काहीच जम्प तेव्हा टॉर्क हस्तांतरण. जर त्या संरेखन ड्राइव वेळा संपली, हाताळू लीडर संरेखित करा आणि फक्त एक बार रिलीज करा दोन पाँच अंश मध्ये आहेत. तेथून आपल्याला सामान्यतः teleoperate आणि क्रिया स्तंभ आपल्याने आदेश केले काय रेकॉर्ड करते.

या मार्ग के बारे में ईमानदार: संरेखन ड्राइव आणि टॉर्क हँडओव्हर लूप प्रकृत हार्डवेअर वर कमीत कमी परीक्षित भाग आहेत. हँडओव्हर एक संपूर्ण, हानिरहित पोज वर परीक्षा करा आपल्याला एक धावा आपल्याला काळजीचे लेखदेव वर. एक लीडर आर्म तीन मोडमध्ये सबसे गुळगुळीत सुधार तयार करते, आणि याला सर्वाधिक आहे जे यांत्रिकरित्या गलत जाऊ शकते.

एक लीडर आर्मशिवाय: कीबोर्ड आणि स्लाइडर

सर्वाधिक लोक वाचण्यास एक आर्म मालकीचे. हे पुरेसे आहे. Take over दबाणे आणि कीबोर्ड निवडा किंवा स्लाइडर इनपुट, आणि takeover तत्काळ आणि व्यक्तिगत - कोणते दुसरे आर्म आहे संरेखन पायरी नाही. फॉलोअर आपली पोज ठेवते आणि इनपुट प्रतीक्षा करते.

इनपुट मोडकसे आर्म हलतेसर्व-कॉल मर्यादा सर्वर द्वारा लागूलॉक केले जेव्हा
लीडर आर्ममिरर लीडर संयुक्ति कोण फॉलोअर ड्राइव करतेया मोडमध्ये कोणते nudge किंवा सेट कॉल नाही; मिरर फॉलोअर लक्ष्य सतत लिहतेकधीही लॉक नाही, आणि डिफॉल्ट अगर इनपुट मोड दिली नाही - परंतु हे दुसरे आर्मचा आवश्यकता आहे; लीडर आयडी अगर takeover नकार दिली आहे
कीबोर्डसंबंधित nudge प्रति की दबाणे, takeover nudge endpointवर पाठविलीसंयुक्ति प्रति 2 अंशांचा कठोर क्लॅम्प, ग्रिपर प्रति 4 अंश409 सह नकार अगर takeover लीडर मोडमध्ये शुरू केली
स्लाइडरपरिपूर्ण लक्ष्य पोज, takeover सेट endpointवर पाठविलीअधिक एक कॉल प्रति 6 अंश लक्ष्य दिशा प्रवास; interface सुमारे दहा वेळा प्रति दुसरे भेजता राहते409 सह नकार अगर takeover लीडर मोडमध्ये शुरू केली

क्लॅम्प सर्वर-पक्ष लागू केले जाते, interface नाही, कारण typed delta एक बस-सर्वो आर्म एक टकराव आहे. कीबोर्ड सुधार stepwise आणि थोडे कोर्स आहेत; स्लाइडर सुधार गुळगुळीत, कारण सर्वर लक्ष्य दिशा चालता जेव्हा interface राहता streaming. एक जिथे किंवा अन्य क्रिया स्तंभ संपूर्ण आदेशित पोज वेक्टर प्राप्त करते आणि intervention चिह्नन लीडर मार्ग समान आहे, तर कीबोर्ड सुधार डेटासेट मध्ये उतरते format फरक अगर।

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
समान की लेआउट बाकी स्टॅक सर्वत्र, तर रेकॉर्डिंग मांसपेशी स्मृति हस्तांतरण.
एक SO-100 डेटासेट वर एक GR00T फाइन-ट्यूनिंग धावचे आदेशित पायरी दर्शविणारे प्रशिक्षण पथप्रदर्शक
एक राउंड प्रशिक्षण पक्ष समान निर्देशित अनुक्रम एक प्रथम धावचे; फक्त चेकपॉइंट क्षेत्र फरक.

बटण कधी दबाणे

लवकर बजाय देर. एक सुधार जे सुरू होते gripper कोणत्याही बंद केले नंतर recovery शिकते एक अपयश वरून धोरण अंतर्गत नाही, आणि recovery डेटा avoidance डेटा वर खूप काम मूल्य आहे. Interrupt एक क्षण आपल्याला आत्मविश्वास आहे ते trajectory गलत आहे, सुधारणे कठीण भाग, हाताळू परत एक राज्य धोरण हाताळू आधी हे. ThriftyDAgger त्या निर्णय स्वयंचलित करते gating interventions novelty वर आणि अंदाज जोखीम अनुसार fixed मानव बजट, परंतु एक एकल आर्मवर मानव आधीच घरके, मानव गेट स्वस्त आणि खर्च आपल्याला अर्जन काई की.

खुल्या-स्रोत स्टॅक सह achievable आणि एक काही स्क्रिप्ट. काई खर्च हे bookkeeping आहे, आणि bookkeeping जिथे DAgger राउंड मरते.

  1. फ्रेम लिहा आपल्या स्वतःच्या अनुमान स्क्रिप्ट LeRobot डेटासेट मध्ये, कार्य स्ट्रिंग सह धोरण वर प्रशिक्षित केली.
  2. धोरण लूप विराम करा, कमांड स्रोत स्विच करा, आणि प्रति फ्रेम ध्वजांकित आपल्याला ड्राइव करूल intervention . अगर फ्लॅग, सुधार साधारण प्रदर्शन दिसते.
  3. विचार रचनाशील काई होते मध्य फ्रेम transition धोरण नियंत्रण रिलीज करते आणि आपल्याने प्रथम इनपुट दरम्यान.
  4. सुधार आपल्या स्वतःच्या डेटासेट प्रति धोरण ठेवा, आणि ट्रॅक एपिसोड indices हाताळू तर मिश्र पुनर्निर्माण केले जाऊ शकते.
  5. बिंदु मीठा-ट्यूनिंग entry बिंदू मागील चेकपॉइंट, आणि तपास लॉग त्या वजन लोड केली.

विस्तारामध्ये चरण 3: तपास गुणवत्ता निर्णय करते

धावा नंतर आपल्याला एक रेकॉर्डिंग काही फ्रेम हस्तक्षेप म्हणून चिह्नित आहे. तीन गंतव्य अस्तित्व, आणि गलत एक quietly विषबाधा पुढील राउंड.

  • सुधार फाइल जेव्हा हस्तक्षेप एक नक्की फिक्स होते: धोरण कुठेतरी गलत शिरले आणि आपल्याने इनपुट दर्शविले सही काहीतर धोरण स्वतः तयार राज्य.
  • मूल्यांकन ठेवा स्वच्छ autonomous धावनेबाजार आणि धावा आपल्याले ताबा बाहर सावधानी. मूल्यांकन एपिसोड पुढील चेकपॉइंट मापन कसे हे आहे, आणि ते प्रशिक्षण कधीही होणार नाही.
  • त्यागा धावा ruined काहीतर असंबद्ध - एक dropped कॅमेरा फ्रेम, एक stalled servo, एक ऑब्जेक्ट आपल्याले घन वर knocked. एक messy सुधार कोणते कोणत्याही सुधार नाही चेहरा.
Freeze फ्रेम कच्च्या रेकॉर्डिंग मध्ये आहेत, प्रशिक्षण डेटा नाही

धोरण नियंत्रण रिलीज करते आणि आपल्याने प्रथम इनपुट दरम्यान, आर्म अभी राहते तर रेकॉर्डर लिहते - एक धावा एक समान poses जोडलेले थोडे अलग image. येथे हे handover फ्रेम कच्च्या रेकॉर्डिंग मध्ये राहते आणि सुधार डेटासेट बाहर. जर आपल्याने लूप आपल्या स्वतःचा, तर कट deliberately: एक धोरण तर शिकते pause जे हे काय कार्य.

विस्तारामध्ये चरण 5: मिश्र रचना

संरचना मूळ डेटासेट सुधार डेटासेट सह लेते आणि एक नवीन, सामान्य LeRobot डेटासेट कि प्रशिक्षित जसे कुछ अन्य. महत्वाचे संपत्ति हे एपिसोड निवड आहे स्पष्ट प्रति स्रोत - काहीच स्वयंचलितपणे mixes. कि सांगते कमी होने तक पहिल्यांदा एक धोरण अजीब आचरण आणि आपल्याले पुनर्निर्माण काई येह वर प्रशिक्षित केली.

खुल्या प्रश्न हे अनुपात आहे, आणि कोणी संख्या नाही जो हस्तांतरण. साहित्य काय करते सहमति आहे सुधार चाहिए गणना खर्च अनिवार्य फ्रेम शेयर. Mandlekar et al. retrain पुनरावृत्ती वर डेटा त्यांचे intervention प्रणाली एकत्र करते, तर धोरण learns bottleneck, आणि रिपोर्ट agents trained तर आहे outperform agents non-interventional demonstrators प्रति समतुल्य नमूना संख्या प्रशिक्षित. Sirius आगे जाता आणि फिर-weights प्रशिक्षण नमूना द्वारा अनुमानित मानव विश्वास, रिपोर्टिंग एक 8 प्रतिशत लाभ सिमुलेशन आणि 27 प्रतिशत वास्तविक हार्डवेअर वर धोरण सफलता दर विरुद्ध पद्धति हे तुलना सह, दो गुना convergence गति पर. कोणते प्रशिक्षण entry बिंदु येथे नाही एक नमूना-weighting नॉब उजागर, तर crude विकल्प आहे राखा प्रत्येक सुधार एपिसोड जे subsample मूळ प्रदर्शन - आणि लिहा काई आपल्याले किया.

एक SO-100 डेटासेट कि कॅमेरा stream सह एपिसोड दर्शविणारे डेटासेट रेकॉर्डिंग दृश्य
सुधार एपिसोड साधारण एपिसोड एक प्रति-फ्रेम intervention ध्वजांकन, तर मूळ डेटासेट अगर conversion रचना कि.

विस्तारामध्ये चरण 6: जे सुरू ठेवण्यास एक चेकपॉइंट साधारण अर्थ

मिश्र प्रशिक्षित आधार मॉडेल कार्य परंतु फेंक मागील राउंड आणि खर्च एक संपूर्ण धावा. सुरू ठेवा मागील checkpoint तेजस्वी आणि सामान्यतः खरे. हे याची अधिक सीमित आहे वाक्य सुझाव देते.

वजन initialisation एक optimizer resume नाही

एक वजन-केवळ checkpoint शामिल प्राचीन आणि काहीच अन्य. लोडिंग हे अगली धावचा बेहतर beginning बिंदु देते बेस मॉडेल दिल, परंतु optimizer क्षण, शिक्षण-दर अनुसूची अवस्थान आणि डेटा अनुक्रम प्रारंभ शून्य से. अपेक्षा एक नुकसान spike शुरुआत सुरू केले हुए धावा, पढ़ नाही एक विफलता, आणि अंतर्गत कॉल करू नाही राउंड एक resume. हे एक वार्म शुरुआत.

धोरणआकारGPU परतप्रति कार्य चरण अनुमानडेटासेट प्रारूपएपिसोड पहले हे मूल्य प्रयास करना
GR00T N1.7लगभग 3 B, मोटे 40 M दौरान प्रशिक्षित फाइन-ट्यूनिंगA100 80 GB किंवा H100 80 GBलगभग 152 msLeRobot v2.0 किंवा v2.150
GR00T N1.5लगभग 3 BA100 80 GB किंवा H100 80 GBलगभग 165 msLeRobot v2.0 किंवा v2.150
Pi0लगभग 3 B पर एक PaliGemma backboneA100 80 GB किंवा H100 80 GBलगभग 485 msLeRobot v3.050
SmolVLAलगभग 450 MRTX 4090 किंवा कोणते 24 GB कार्डलगभग 245 msLeRobot v3.030
ACTलगभग 80 M, प्रारंभ से प्रशिक्षितRTX 4090 किंवा कोणते 24 GB कार्डलगभग 20 msLeRobot v3.050

लेटेंसी यौगिक अंदर एक DAgger लूप एक रास्ता यह नाही demo पर: लगभग 485 ms प्रति कार्य चरण आपल्याले ताबा क्योंकि आर्म hesitated, नहीं क्योंकि हे गलत होते, आणि hesitation सुधार नाही उपयोगी प्रशिक्षण डेटा. जर आपल्याले iterate डेटा वर बजाय नहीं चेतन सफलता दर, iterate तेजस्वी मॉडेल. Shukor et al. वर्णन SmolVLA एक एकल GPU पर प्रशिक्षित करने के लिए डिज़ाइन किया गया आणि deploy उपभोक्ता GPU वर किंवा CPU, एक asynchronous अनुमान स्टॅक सह कि decouples कार्य भविष्यवाणी प्रभाव हे सक्षम उच्च नियंत्रण दर - सम्पत्ति कि तर एक takeover लूप जवाबदेही.

डेटासेट प्रारूप नहीं आहेत interchangeable. GR00T सहायता LeRobot v2.0 किंवा v2.1, आणि Isaac-GR00T repository वर्णन इनपुट एक स्वाद LeRobot v2 प्रारूप एक जोड़ा modality विवरण फाइल; की नई प्रशिक्षक येथे आशा v3.0. एक मिश्र तयार गलत संस्करण में विफल लोड समय वर ऐसा उत्पादन खराब धोरण - अच्छे विफलता मोड, अभी एक व्यर्थ कतार स्लॉट. डेटासेट प्रलेखन सूची कि प्रारूप प्रत्येक ट्रेनर सहायता.

लूप, bookkeeping पहले से ही किया

Takeover एक लीडर आर्म सह, कीबोर्ड किंवा स्लाइडर; प्रति-फ्रेम intervention चिह्नन; फाइलिंग धावा सुधार किंवा मूल्यांकन; रचना एक मिश्र डेटासेट एक स्पष्ट एपिसोड निवड प्रति स्रोत; आणि सुरू ठेवा प्रशिक्षण एक चेकपॉइंट ऐसा बेस मॉडेल. काही अगर आपल्याले निर्णय हे कि धावा गणना एक सुधार, काई सेट मिश्र, आणि कधी नुकसान intervention दर बंद.

पाहा कसे DAgger लूप wired हे

चार विधि एक राउंड नष्ट करने के लिए

1. सुधार अकेलेपन पर प्रशिक्षण

सबसे सामान्य विफलता आणि सबसे tempting shortcut. एक सुधार-केवल डेटासेट लगभग सपूर्ण कठीण मध्य कार्य, साथ दृष्टिकोण आणि retreat हराइ; धोरण खर्च कठीण भाग आणि भूल पहुँच वहाँ. एकीकरण नहीं एक कार्यान्वयन विस्तार पद्धति, हे संपूर्ण: पुरानी डेटा काई तर व्यवहार जगह राखते जबकि सुधार एक भाग हिलाता है.

2. कॅमेरा राउंड्स दरम्यान चलाना

एक कॅमेरा कि shifts दो सेंटीमीटर राउंड्स दरम्यान धोरण उत्पादन दुर्लभ तुम शुरू, आणि निदान जे खरचे एक दिन. प्रत्येक VLA येथे हे छवि पर शर्त; संयुक्ति अकेली disambiguate नहीं करता जहाँ ऑब्जेक्ट है. फोटो येथे सेट्ट पहले राउंड पहले आणि तपास कि तस्वीर प्रत्येक बाद एक.

3. Handover कलाकृति में छोड़ने प्रशिक्षण

ऊपर का हिस्सा, आणि सूची पर यह अदृश्य आहे. लक्षण एक धोरण कि stalls एक अंश दूसरा अचूक जहाँ पुरानी राउंड ऑपरेटर ताबा लेता. हे दिखता है hesitation; हे imitation.

4. एक वार्म शुरुआत एक resume कॉल

जर आपल्याले विश्वास optimizer राज्य पहुँच बंद, प्रारंभिक नुकसान spike पढ़ता एक बग आणि आपल्याले शिकार संकर्षण डेटा के लिए. जर आपल्याले पता optimizer शुरू जताया, spike उम्मीद आणि आपल्याले पाहा काई येते नंतर यह. समान संख्या, विपरीत निष्कर्ष.

राउंड मापन

मेट्रिक एक मानव-gated लूप हे intervention दर: फ्रेम रेकॉर्ड केले होते जेव्हा आपल्याले नियंत्रण में, विभाजित कुल फ्रेम धावा. यह takeover स्थिति में है, आणि यह एकमेव संख्या कि उत्तर प्रश्न राउंड पूछा. प्रशिक्षण नुकसान पड़ता धोरण सुधारलेले अगर; सफलता दर binary आणि noisy नमूना आकार एक डेस्क आर्म उत्पादन करते. Intervention दर निरंतर, मापा पर राज्य धोरण स्वतः कारण, आणि droplets जेव्हा धोरण आवश्यकता तुम कम.

तुलना यह फक्त राउंड्स रेकॉर्ड केले समान conditions अंतर्गत. पूर्ण तर्क, आणि कसे निर्माण एक मूल्यांकन सेट जे survives दो राउंड्स से अधिक, आहे लेख DAgger लूप मापन वर. राउंड एक realistically एक feasibility परीक्षा: आपल्याले हार्डवेअर आपल्याले takeover काम, सुधार उतरले कि त्यांचे flags, आणि सुरू केले धावा लोड checkpointer आपल्याले नाम. राउंड्स दोन आणि तीन जहाँ दर चाहिए शुरू ले. जर येह चार दरम्यान नहीं चले, समस्या आहे upstream DAgger.

लिहा प्रति राउंड अनुसूचीकाही मायने आगे
Checkpoint कि हे ड्राइव किया जाता थाअगर यह आपल्याले कोणते सुधार मिश्र किंवा attribute करू शकु नही
इनपुट मोड समझाया takeover के लिएकीबोर्ड सुधार आहेत coarser लीडर सुधार, आणि हे डेटा हे दिखाता है
चलाता संख्या आणि कसे प्रत्येक तपास किया गयाक्या राउंड पर्याप्त सुधार पर नहीं मायने मुद्दा होने के लिए
Intervention दर प्रति धावा, आणि अर्थलूप प्रगति मेट्रिक
एक्सक्ट एपिसोड निवड प्रति स्रोतएकमेव तरीका पुनरुत्पादन किंवा पूर्ववत राउंड
वार्म शुरुआत किंवा ताजा प्रशिक्षणव्याख्या नुकसान curve आपल्याले एक सप्ताह पर पाहा

जर आपल्याले एक checkpoint नहीं है

लूप कोणते entry बिंदु अगर नहीं एक. एक पहला डेटासेट रेकॉर्ड, प्रशिक्षित एक पहला धोरण, चलाव - रेकॉर्डिंग, प्रशिक्षण आणि धावना धोरण कवर कि पथ. प्रशिक्षण क्लायंट चालू है डाउनलोड पृष्ठ, GPU परत आणि hourly दर पर pricing पृष्ठ, आणि काई एक usable एपिसोड दिखता है SO-100 डेटा संग्रह गाइड. सही प्रदर्शन पहले सुधार हे: DAgger एक repair तंत्र, आणि हे काम far खर्च लगभग सही कुछ पर.

काई मैं चलाव एक DAgger लूप एक लीडर आर्मशिवाय?

हे. निवडा कीबोर्ड किंवा स्लाइडर इनपुट जे आपल्याले प्रेस Take over: takeover तत्काळ आणि व्यक्तिगत, साथ नहीं दुसरे आर्म करने के लिए संरेखित. कीबोर्ड भेजता relative nudges सर्वर क्लॅम्प कठोर 2 अंश प्रति संयुक्ति आणि 4 gripper के लिए; स्लाइडर भेजता absolute लक्ष्य आणि सर्वर आगे बढ़ता सबसे 6 अंश दिशा हर कॉल करने के लिए, जबकि interface राहता streaming. कार्य स्तंभ आणि intervention चिह्नन हैं लीडर मोड में समान, तर कीबोर्ड सुधार डेटासेट मध्ये undistinguishable.

कितना सुधार तक एक राउंड की जरूरत?

नहीं एक रक्षणीय सार्वभौमिक संख्या, आणि फ्रेम गणना मायने राहता अधिक एपिसोड गणना. काई नियम आहे सुधार होणार नाही हराइ मिश्र: साथ 200 मूळ एपिसोड आणि तीन सुधार एपिसोड, काहीच ले. लक्ष्य सुधार जे कवर विफल वर्तन कई starting कॉन्फिगरेशन अनुसरण नहीं तीन repetition समान बचाव की.

काई प्रशिक्षण अकेलेपन सुधार इस तरह एक खराब विचार?

क्योंकि सुधार लगभग सपूर्ण कठीण मध्य कार्य. दृष्टिकोण, संरेखन आणि retreat हराइ, तर धोरण नुकसान काई हे पहले से ही अच्छा जबकि सुधार भाग. ओल्ड डेटा रखना आणि जोड़ अनुसरण यह तंत्र ही, नहीं एक विकल्प अतिरिक्त.

काई जारी एक चेकपॉइंट resume पूर्व प्रशिक्षण धावा?

नहीं. एक वजन-केवल चेकपॉइंट restores प्राचीन आणि काहीच अन्य: optimizer क्षण, शिक्षण-दर अनुसूची स्थान आणि डेटा क्रम शुरुआत ताजा. हे एक वार्म शुरुआत, आणि एक प्रारंभिक नुकसान spike expected अनुसरण नहीं एक लक्षण. लिहा नीचे कि दोनों आपल्याले वास्तव किया, तर आपल्याले पढ़ curve सही एक सप्ताह.

काई जर intervention दर नहीं पड़ता?

थांबवा जोड़ राउंड्स. एक flat दर मतलब सुधार नहीं हे सिखाने जे आपल्याले सोच. सामान्य कारण आहेत upstream: एक कॅमेरा चले, सुधार शुरुआत भी देर avoidance डेटा होने के लिए, handover फ्रेम आहेत प्रशिक्षण सेट, किंवा कार्य underdetermined अनुसरण observations धोरण वास्तव प्राप्त.

कोणते यह हे एक हल समस्या आणि कोणते यह एक क्लिक. Interactive imitation शिक्षण एक सक्रिय अनुसंधान क्षेत्र precisely क्योंकि प्रश्न - कधी intervene, कसे वजन काई मानव किया, कितना पुरानी डेटा रखना - नहीं हे fixed उत्तर; सर्वेक्षण Celemin et al. डाली काई अभी खुल्या. काई लूप has मापने convergence जे हे चलाया carefully, हार्डवेअर पर कि खरचा कुछ सौ यूरो. Freeze सेट्ट, intervene जल्दी, तपास ईमानदार, मिश्र deliberately, आणि रेकॉर्ड intervention दर हर समय.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started