टेबलटॉप रोबोट वर्कस्पेस जिस प्रकार की दोहराए जाने वाली नीति रन के लिए एक निश्चित मूल्यांकन सेटअप के रूप में उपयोग की जाती है
DAggerमूल्यांकनअनुकरण सीखनारोबोट डेटाSO-100

एक DAgger लूप को मापना: हस्तक्षेप दर, मूल्यांकन प्रोटोकॉल, और बीच के जाल

AY-Robots ResearchAugust 27, 202615 मिनट पढ़ना

हस्तक्षेप दर - हस्तक्षेप फ्रेम को रन के फ्रेम से विभाजित - सबसे सस्ता ईमानदार प्रगति संकेत है जो एक मानव-गेटेड DAgger लूप के पास है। यह लेख इसे परिभाषित करता है ताकि दो लोग समान मान की गणना कर सकें, दिखाता है कि इसे कैसे लॉग करें, और चार तरीकों से काम करता है जो इसे गुमराह करते हैं: ऑपरेटर आदत, बहती हुई मूल्यांकन सेटअप, केवल सुधार पर प्रशिक्षण, और एक मानव जो मंगलवार को सोमवार की तुलना में अलग तरीके से सुधार करता है।

एक DAgger राउंड उत्पादक लगता है जबकि आप इसमें होते हैं। आप नीति चलाते हैं, जब यह पकड़ में हकलाता है तो संभाल लेते हैं, सुधार बचाते हैं, पुनः प्रशिक्षित करते हैं, और अगला रन दिखता है - आप शपथ लेंगे - थोड़ा चिकना। दो राउंड बाद आप नहीं बता सकते कि कुछ बदल गया है, क्योंकि "थोड़ा चिकना" एक मात्रा नहीं है।

लूप को प्रति राउंड एक संख्या की आवश्यकता है, और एक मानव-गेटेड लूप में वह संख्या लगभग मुफ़्त है: उस रन का अंश जिसके दौरान आपके पास नीति के बजाय नियंत्रण था। यह लेख इसे परिभाषित करता है ताकि दो लोग समान मान की गणना कर सकें, इसे लॉग करते हैं, परिणामी वक्र को पढ़ते हैं, और चार तरीकों का नाम देते हैं जो इसे गुमराह करते हैं जब यह अकेले खड़ा हो। सिद्धांत के लिए यह टुकड़ा मानता है, देखें DAgger व्याख्याकार और मानव-गेटेड संस्करण; हाथों पर समकक्ष है एक SO-100 पर DAgger लूप चलाना

संक्षिप्त संस्करण

  • हस्तक्षेप दर = हस्तक्षेप फ्रेम / रन के फ्रेम। फ्रेम, एपिसोड नहीं, और हर मायने में वह फ्रेम शामिल हैं जो आपने सुधार में बिताए।
  • तीन राउंड पर एक सपाट वक्र मतलब राउंड कुछ नहीं खरीदते - मिश्रण, checkpoint या कार्य को चौथे के बजाय बदलें।
  • एक गिरती हस्तक्षेप दर एक बढ़ती सफलता दर नहीं है। आपकी चरण में प्रवेश करने की थ्रेशहोल्ड विश्वास बढ़ने के साथ नीचे की ओर बहती है।
  • एक जमी हुई मूल्यांकन प्रोटोकॉल के बिना - समान प्रारंभ pose, वस्तुएं, कैमरे, परीक्षण संख्या - आप कमरे को माप रहे हैं।
  • केवल सुधार पर प्रशिक्षण राज्य वितरण को विकृत करता है। IWR का उत्तर: हस्तक्षेप और गैर-हस्तक्षेप नमूनों को समान अनुपात में खींचें।

एक राउंड को सभी की संख्या की आवश्यकता क्यों है

DAgger एक वितरण समस्या के कारण मौजूद है, और वितरण समस्याएं आंखों के लिए अदृश्य हैं। रॉस और बग्नेल ने दिखाया कि अनुकरण सीखना एक निश्चित प्रदर्शन सेट पर त्रुटियों को जमा करने और समय क्षितिज में द्विघात रूप से बढ़ती regret बाउंड की ओर जाता है: एक बार जब शिक्षार्थी वह states छोड़ देता है जो प्रदर्शनकारी ने दौरा किया, डेटा में कुछ भी इसे कैसे वापस आना है नहीं बताता। DAgger इसे पुनरावृत्ति द्वारा ठीक करता है - नीति चलाएं, वह states लेबल करें जो यह दौरा करता है, एकत्रित करें, पुनः प्रशिक्षित करें - जिसे रॉस, गॉर्डन और बग्नेल कोई regret ऑनलाइन सीखने के लिए कमी के रूप में फ्रेम करते हैं।

उस फ्रेमिंग का एक परिणाम है जो लोग छोड़ देते हैं। गारंटी पुनरावृत्तियों पर नीतियों के अनुक्रम को चिंतित करती है, किसी एक रन को नहीं। यह कुछ नहीं कहता कि आपका राउंड तीन मदद मिली। एकमात्र तरीका जानने के लिए प्रत्येक पुनरावृत्ति को मापना है। केली और सहयोगियों ने HG-DAgger प्रस्तुत किया क्योंकि क्लासिक DAgger अभी भी नियंत्रण में होने पर विशेषज्ञ से कार्य लेबल के लिए पूछता है, जिस पर पेपर तर्क देता है सुरक्षा को कम कर सकता है और, मानव विशेषज्ञों के साथ, माना जाता कार्यकारी lag के माध्यम से लेबल गुणवत्ता को degrade करने की संभावना है। HG-DAgger भी एक मॉडल अनिश्चितता आधारित जोखिम मेट्रिक के लिए सुरक्षा थ्रेशहोल्ड सीखता है और ड्राइविंग कार्य पर DAgger और behavioral cloning दोनों पर बेहतर प्रदर्शन की रिपोर्ट करता है। यह हस्तक्षेप काउंट प्रकाशित नहीं करता; वे आप स्वयं उत्पादन करते हैं।

दर को परिभाषित करना ताकि दो लोग समान संख्या प्राप्त करें

परिभाषा एक पंक्ति है: हस्तक्षेप फ्रेम को रन के फ्रेम से विभाजित किया जाता है। सब कुछ कठिन क्या गिना जाता है एक फ्रेम के रूप में और क्या एक रन के रूप में गिना जाता है में छिपा हुआ है।

फ्रेम, एपिसोड नहीं

कम से कम एक हस्तक्षेप के साथ एपिसोड गिनना बेकार है: दस एपिसोड एक nudge के साथ प्रत्येक और दस जिसमें आपने अस्सी प्रतिशत दोनों चलाया "10/10" देता है। फ्रेम काउंट उन्हें अलग करता है, और यह granularity है जो रिकॉर्डिंग पहले से है - में LeRobot डेटासेट प्रारूप हर समय step एक row है, तो हस्तक्षेप flag state और action के बगल में एक boolean column है। यहाँ यह प्रति frame लिखा जाता है पल takeover शुरू होता है और साफ किया जाता है जब नियंत्रण वापस होता है।

हर मायने में सुधार शामिल हैं

दो denominators रक्षणीय हैं - रन के कुल फ्रेम, या फ्रेम नीति स्वायत्तता से चलाया - और वे उच्च हस्तक्षेप स्तर पर बुरी तरह से विचलित करते हैं। 1000 फ्रेम के 400 के लिए ले जाएं और पहला 40 प्रतिशत देता है, दूसरा 67 प्रतिशत। एक राउंड की तुलना पहले तरीके से मापा गया अगले के विरुद्ध मापा गया दूसरी सीधी सुधार गायब हो जाता है। कुल फ्रेम लें और कभी series के बीच विकल्प पर फिर से जाएं।

एक बार तय करें कि handover frames के साथ क्या होता है

हमेशा एक seam होता है। जब नियंत्रण पास होता है, कुछ फ्रेम दोनों पक्षों के हैं: arm held है, leader संरेखण कर रहा है, रिकॉर्डिंग frozen है। इस pipeline में उन handover frames raw stream में रहते हैं और कभी curated में नहीं जाते एपिसोड - वे न तो policy behavior हैं और न ही सुधार प्रशिक्षण के लायक हैं। seam को हर राउंड एक ही तरीके से गिनें: 30 Hz पर, छह takeovers एक दो सेकंड seam के साथ प्रत्येक 360 फ्रेम है, एक प्रतिशत बिंदु ले जाने के लिए पर्याप्त।

तीन निर्णय जो तुलना को break करते हैं

फ्रेम या एपिसोड; कुल रन या स्वायत्तता-केवल; handover frames में या बाहर। तीन में से कोई भी चुप्पी से बदल गया राउंड के बीच वक्र meaningless बनाता है। तीनों को लिख दें।

इसे लॉग करना ताकि संख्या सत्र को survive करे

चलाने वाली प्रक्रिया की स्थिति panel में एक metric एक readout है: यह restart पर गायब हो जाता है और plot नहीं किया जा सकता। एक append-only line प्रति रन पूरी series को cover करता है - including कौन सा checkpoint आपने चलाया, क्योंकि जो हर राउंड बदलता है और उन्हें mix करना क्या अनुसरण करता है को invalidate करता है।

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
प्रति रन एक line। संख्या के आगे denominator और handover convention को record करना field names से अधिक मायने रखता है।

दो fields weight carry। train_mix है जो आपने अगली प्रशिक्षण job को fed; बिना इसके कुछ भी attributed नहीं किया जा सकता। eval_protocol fixed test का नाम रखता है जिसे आपने बाद में चलाया, और वह field है जो अक्सर खाली छोड़ दी जाती है। ay-robots cockpit में takeover status चल रहे सत्र के लिए हस्तक्षेप frame count रिपोर्ट करता है, तो logging instrumentation की बजाय transcription है; डेटासेट documentation cover करता है जहां प्रति frame columns land।

Training configuration matrix policies, datasets और checkpoints को side by side दिखाता है
हर राउंड checkpoint और dataset mix बदलता है। एक संख्या जिसका combination record नहीं किया गया attributed नहीं किया जा सकता।

वक्र पढ़ना: तीन राउंड, एक निर्णय

तीन राउंड एक reading के लिए न्यूनतम है, क्योंकि दो points हमेशा एक line हैं। नीचे तालिका एक bookkeeping template है placeholder numbers के साथ, किसी run से measurements नहीं। आप एक monotone decrease के लिए देख रहे हैं matched एक fixed test पर सफलता में increase से।

राउंडCheckpoint चलायाफ्रेमहस्तक्षेप फ्रेमदरसफलताएं (20 में से)
0 (baseline)base नीति5 9001 38023.4 %7
1round 0 mix से5 61098017.5 %10
2round 1 mix से5 41261111.3 %11
3round 2 mix से5 38059811.1 %12

राउंड एक और दो काम कर रहे हैं। राउंड तीन नहीं है: 11.3 against 11.1 प्रतिशत एक physical arm पर मापा किसी भी चीज़ के run-to-run variation के अंदर है, और चौथा राउंड of same corrections एक afternoon को कुछ नहीं खर्च करता है। flat segment कहता है कुछ structural बदलें।

  • बाकी विफलताएं teleoperation से correctable नहीं हैं - object out of reach, gripper geometry, एक joint its limit पर। कोई correction डेटा kinematic wall को fix नहीं करता।
  • सुधार base dataset के विरुद्ध बहुत कम हैं gradient को move करने के लिए, और कुछ भी उन्हें weight नहीं करता।
  • सुधार एक दूसरे को contradict करते हैं, तो नीति दो strategies को average करता है और उन्हें बीच में land करता है।
  • विफलता upstream है: एक कैमरा moved, lighting changed, wrist view अब training से match नहीं करता।
  • कार्य this policy class की ceiling पर है this hardware पर, और अगला step ज्यादा base डेटा है।

आखिरी दोनों लूप की विफलताएं नहीं हैं। Sirius-Fleet में declining need for human designed outcome है: जैसे robot autonomy improves, anomaly predictors adapt अपनी prediction criteria, leading to fewer requests for human intervention और gradually reducing human workload over time। वहां criterion adapts on purpose। एक manual loop में yours अधिकार भी adapts, silently - तो एक rate that flattens क्योंकि कार्य its ceiling पर है looks exactly एक की तरह jो flattened क्योंकि operator stopped noticing। कौन सी अगली समस्या है।

जाल 1: एक गिरती दर एक बढ़ती सफलता दर नहीं है

हस्तक्षेप दर एक चीज़ measure करता है exactly: कितना run का आपने own करने का फैसला किया। वह निर्णय आपका है, real time में किया गया, और यह moves। राउंड zero में आप first bad approach angle पर ले लिए; by राउंड तीन आपने policy को देखा है एक dozen से recover करो और आप इसे try करने देते हैं। आपकी threshold moved; नीति may नहीं किया हो। दर किसी भी तरह falls।

Human trust at least एक modelled quantity है literature में rather than एक assumed constant। Sirius re-weights training samples approximated human trust के साथ और optimises नीति weighted behavioral cloning के साथ, reporting एक 8 प्रतिशत boost in simulation और 27 प्रतिशत on real hardware over state of art में नीति सफलता दर पर, at twice convergence speed। वह treats trust डेटा पर एक weight के रूप में। यह correct नहीं करता threshold आपके head में between राउंड zero and राउंड तीन।

आप drift को remove नहीं कर सकते, तो pair दर कुछ के साथ आपकी threshold नहीं touch कर सकते: trials का एक fixed set जिसमें आप नहीं intervene बिल्कुल, scored एक criterion विरुद्ध लिखा before राउंड। एक rate जो falls जबकि paired success rate put रहता है है habituation का signature - worth catching, क्योंकि from अंदर loop यह feels like प्रगति।

हस्तक्षेप दरFixed protocol पर सफलता दरसबसे likely reading
गिरता हैउगता हैराउंड काम करता है। Continue।
गिरता हैसपाटआपकी threshold drifted, या सुधार effort remove किए बिना failures को remove किए।
गिरता हैगिरता हैसुधार नीति को degrade कर रहे हैं। मिश्रण और उनकी internal consistency check करें।
सपाटसपाटराउंड कुछ नहीं खरीदा। मिश्रण, checkpoint या कार्य को अधिक collect करने से पहले change करें।
उगता हैगिरता हैप्रतिगमन। Training mix, changed कैमरा या checkpoint mix-up पर suspect करें before method को suspecting।

जाल 2: एक fixed protocol के बिना, आप कमरे को measure करते हैं

Real-robot मूल्यांकन महंगा है और repeat करना मुश्किल है। SIMPLER authors simulated मूल्यांकन को motivate करते हैं observation के साथ कि real-world ऐसी नीतियों का मूल्यांकन scalable नहीं है और reproducibility challenges face करता है likely to worsen जैसे policies broaden उनका task spectrum। RoboArena इसे दूसरी side से attacks करता है, साथ 600 से अधिक pairwise real-robot मूल्यांकन एपिसोड across सात generalist policies, run evaluators द्वारा सात academic institutions पर DROID platform पर। इसके evaluators pick उनके अपने tasks और environments but must judge pairs of policies double-blind; पेपर reports कि crowd-sourced ranking tracks generalist-policy performance अधिक accurately than conventional, centralised मूल्यांकन।

आप नहीं चलाएंगे 600 paired एपिसोड one पर SO-100 एक workshop में। क्या आप कर सकते हैं remove variance आप control - एक list बहुत boring जो यह usually gets skipped।

आयामयह freeze करेंक्या drifts अगर आप नहीं करते
शुरू करना poseएक लिखा हुआ home position, driven हर trial से पहलेTrajectory शुरू out of distribution
वस्तुएंटेप किए गए निशान, और same physical objects reserved मूल्यांकन के लिएएक 'बेहतर' नीति है really एक closer object
कैमरे और प्रकाशSame mounts, indices, exposure; blinds closed; photograph setupSwapped कैमरा indices alone can dominate result
Trials और stop ruleFixed n, fixed timeout, criterion लिखा before राउंडPost-hoc criteria turn near-misses जिसमें आप need
Operator व्यवहारमूल्यांकन trials के दौरान कोई interventions नहींमूल्यांकन बन जाता है एक और correction session

फिर arithmetic, unforgiving at trial counts एक workshop afford कर सकता है पर। normal approximation के तहत, 60 प्रतिशत सफलता over 20 trials carries एक standard error near 11 प्रतिशत points - 20 पर 0.6 times 0.4 का square root - और difference दो ऐसे राउंड के बीच carries लगभग 15। 60 से 70 प्रतिशत में एक jump इसलिए consistent है कुछ नहीं होने के साथ। Fifty trials लाते हैं per-round figure लगभग 7 points को, और cost एक afternoon।

यह asymmetry argument है हस्तक्षेप दर के लिए: computed thousands of frames पर rather than twenty binary outcomes, it moves पहले और अधिक smoothly। caveat है कि frames एक episode के भीतर heavily correlated हैं - one bad grasp yields एक hundred consecutive हस्तक्षेप frames - तो effective sample size closer है takeovers की संख्या को। दर को early indicator के रूप में treat करें और success दर को slow ground truth के रूप में।

मूल्यांकन एपिसोड को प्रशिक्षण pool से बाहर रखें

मूल्यांकन एपिसोड को कभी composed प्रशिक्षण डेटासेट में enter नहीं करना चाहिए - अन्यथा round n+1 is scored डेटा पर जिसे यह trained था, और curve memorisation को measure करता है।

जाल 3: केवल सुधार पर प्रशिक्षण नीति को bend करता है

सुधार interesting डेटा हैं, तो instinct है उन पर train करना। न करें। वे come by construction state space के narrow slice से जहां नीति पहले से ही failing थी और say लगभग कुछ नहीं run के बहुमत के बारे में जो काम किया। Fine-tune उस slice पर alone और आप get एक नीति good at recovering एक botched approach से जो भूल गई है कैसे एक clean one बनाना।

Mandlekar और colleagues built अपनी remote intervention system इसके चारों ओर। उनकी framing: manipulation tasks contain bottleneck regions requiring एक sequence of precise actions - inserting एक pod एक coffee machine में उनका example - जहां small deviations lead into states demonstrations कभी cover नहीं किए। उनका algorithm trains iteratively new data पर तो नीति learns traverse उन bottlenecks, और वे report कि agents trained on intervention डेटा beat agents trained on एक equivalent number of samples from non-interventional demonstrators।

सुधार-केवल fine-tuning versus एक composed मिश्रण
सुधार-केवल क्या आपको मिलता है
  • तेज़: एक short run over कुछ dozen एपिसोड cheap enough है repeat करने के लिए
  • लक्षित: gradient dominated है states के द्वारा आप care करते हैं
  • सस्ता testing के लिए कि क्या एक सुधार style learnable है बिल्कुल पर
इसकी क्या कीमत है
  • Fine-tune distribution अब नहीं resembles task distribution
  • Nominal व्यवहार degrade कर सकता है visibly एक single round के भीतर
  • दर fall कर सकती है जबकि success falls it - clean segments traded recoveries के लिए

Mixing ratio एक hyperparameter है और deserves लिखा जाना। Composing next dataset है जहां यह decided - original demonstrations plus सुधार set, एपिसोड selection explicit प्रति source rather than एक rule जो quietly pulls में whatever available। वहां है one compose step cockpit में, और result एक ordinary dataset - देखें प्रशिक्षण documentation। क्या कोई tool नहीं करता है आपके लिए है recording कौन सा अनुपात produced कौन सा curve।

जाल 4: मानव एक consistent expert नहीं है

DAgger का सिद्धांत मान लेता है एक expert। आप नहीं हैं technical sense में: आपके सुधार नहीं हैं samples एक fixed conditional distribution से over actions। ACT authors नाम यह list करते समय obstacles to fine manipulation - errors compound over time, और human demonstrations can be non-stationary। उनकी system still reaches 80 to 90 प्रतिशत success six real tasks पर ten मिनट demonstrations से, तो problem tractable है, absent नहीं।

robomimic अध्ययन करता है point data side से। Across छह offline algorithms पर पाँच simulated और तीन real-world multi-stage tasks, इसके lessons include sensitivity design choices को, dependence demonstration quality पर, और - जो one है जो hurts most यहाँ - variability arising से stopping criteria, क्योंकि training और evaluation objectives differ। checkpoint lowest loss के साथ है reliably नहीं highest success rate वाला।

यह hardware version है इसका: input mode shapes सुधार। एक leader-follower setup produces continuous, human-paced trajectories। Keyboard nudges are clamped hard by server - दो degrees per call arm joints पर, चार gripper पर - तो same intent arrives एक staircase of small steps। Sliders send absolute targets और server moves सर्वाधिक छह degrees toward them per call। तीन modes, तीन action distributions; mixing सब तीन एक सुधार set में और फिर wondering क्यों approach turned twitchy is self-inflicted। teleoperation documentation covers क्या हर mode sends।

Weighting interventions: IWR और क्या आया बाद

अगर सुधार valuable minority हैं, principled fix है weight rather than exclusivity। Intervention Weighted Regression reference implementation है: डेटा is partitioned हस्तक्षेप और non-intervention samples में, और दोनों partitions are sampled equal proportion में during प्रशिक्षण। एक सुधार set जो five प्रतिशत है frames का तो contributes half gradient, without nominal व्यवहार vanishing distribution से।

Equal proportion एक starting point है, not एक law। Sirius generalises it replacing binary partition एक continuous weight से approximated human trust का; Sirius-Fleet moves decision upstream, using एक visual world model और anomaly predictors decide करने के लिए जब एक human asked है बिल्कुल। Common thread: intervention flag एक training signal है, not just एक bookkeeping column।

विधिकौन decide करता है जब मानव actsहस्तक्षेप डेटा कैसे used हैरिपोर्ट किया गया result
DAgger (2011)Fixed schedule; expert labels visited statesOne growing dataset, unweightedFramed एक reduction के रूप में no-regret online learning को
HG-DAgger (2019)मानव, gating control एक real system परAggregated; plus एक learned safety threshold on model uncertaintyबेहतर than DAgger और BC on driving; कोई intervention counts नहीं दिए
IWR (2020)मानव, via remote teleoperationहस्तक्षेप और non-intervention samples drawn equal proportion मेंBeats non-interventional demos at equal sample count
Sirius (2022)मानव, during deploymentWeighted BC, weights from approximated human trust8 % gain in simulation, 27 % on real hardware; 2x faster convergence
ThriftyDAgger (2021)System, gating on novelty and riskInteractive collection under एक supervision budgetUser study (N=10): 58 % higher human और 80 % higher robot performance than next best method
Fleet-DAgger (2022)System, allocating attention across एक fleetFleet learning scored by Return on Human Effortअप to 8.8x higher ROHE than baselines
Sirius-Fleet (2024)Anomaly predictors with self-adapting criteriaMulti-task learning with एक visual world modelकम हस्तक्षेप requests as autonomy improves
Leaderboard view comparing robot policies by measured score
Ranking policies एक दूसरे के विरुद्ध means कुछ only जब हर entry ran same protocol। जो applies आपने अपने तीन राउंड को भी।

दर के आगे logging के लिए चार मेट्रिक्स worth

  • Takeovers प्रति run। बीस short सुधार और one लंबे एक similar दर देते हैं और describe अलग policies - one jittery, one with एक single blind spot।
  • माध्य हस्तक्षेप length। rising length एक falling count के साथ means बाकी failures हैं hard ones, जो है क्या late progress लगता है।
  • समय first intervention के लिए। एक policy जो gets further before needing मदद है improving even जब total rate flat है।
  • जहाँ interventions cluster। Bin flag by normalised episode प्रगति; एक stable peak across राउंड point करता है एक bottleneck।

एक राउंड protocol आप actually run कर सकते हैं

एक measured राउंड है छह steps और produces one row in log। पहले चार हैं loop; आखिरी दोनों बनाते हैं it एक मापन।

  1. 1
    मूल्यांकन protocol को freeze करें राउंड zero से पहले

    शुरू pose, object placement, कैमरे, trial count, timeout और success criterion लिख दें। Table photograph करें। अगर document को change करना पड़े, series restarts।

  2. 2
    Baseline को measure करें

    Protocol run करें कोई interventions बिना और successes को record करें; तो एक instrumented session run करें takeover enabled के साथ और rate को record करें। वह दोनों numbers हैं round zero।

  3. 3
    सुधार को collect करें एक consistent style में

    एक input mode प्रति राउंड, एक operator अगर आप कर सकते हैं। ले जाएं एक criterion पर जिसे आप state कर सकते हैं out loud - 'gripper से अधिक दो centimetres off at approach' - और hold it राउंड के लिए।

  4. 4
    Triage हर एपिसोड same day

    सुधार, मूल्यांकन या discard। Ambiguous एपिसोड get discarded, not saved theory पर कि अधिक डेटा मदद करता है - एक सुधार जिसमें आप yourself fumbled worse है than कोई एपिसोड नहीं।

  5. 5
    Compose mixture को explicitly

    original demonstrations plus सुधार, एपिसोड selection प्रति source। Record base count, सुधार count और कोई weighting - यह field है आप चाहते हैं three weeks में।

  6. 6
    Continue करें checkpoint से, तो re-measure

    trained compose dataset से previous checkpoint instead of base model, run frozen protocol plus एक instrumented session, append row, और compare against previous दो राउंड।

दो limits change कैसे आप read एक weak राउंड। Continuing एक checkpoint से initialises weights उससे - not एक optimiser resume, तो schedule starts fresh और एक short run from एक converged checkpoint can move बहुत कम। और leader-align motion शुरू में एक takeover का है least mileage on real hardware की हर चीज़ का in chain; अगर सुधार सब शुरू करते हैं एक odd transient के साथ, look there before blaming mixture।

measured लूप, already wired ऊपर

ay-robots implement करते हैं ये छह steps एस product features: ले जाएं mid-run से एक leader arm, keyboard या sliders, with हस्तक्षेप frames flagged automatically; triage हर एपिसोड जैसे सुधार, मूल्यांकन या discard; compose अगली dataset original demonstrations plus सुधार से, एपिसोड selection explicit प्रति source; और start अगली प्रशिक्षण run previous checkpoint से base model की बजाय।

देखें कैसे DAgger लूप काम करता है

क्या numbers नहीं बता सकते

यह कुछ नहीं solved, और एक tidy curve आपको otherwise convince नहीं करना चाहिए। हस्तक्षेप दर measure करता है एक joint system - नीति, hardware, operator, room - और attributes कुछ नहीं अपने पर। यह judge नहीं कर सकता क्या सुधार अच्छे थे, और यह fall happily will एक कार्य पर जो got easier क्योंकि object drifted दो centimetres closer over तीन weeks।

क्या यह does है turn एक vague impression एक column में आप argue कर सकते हैं। alternative है not एक बेहतर metric; यह है तीन weeks of collecting सुधार curve बताएगा which आपको, after राउंड तीन, stop collecting। survey literature defines interactive imitation learning जैसे human feedback given intermittently during robot execution, allowing एक online improvement की behavior; family wide है, और कोई arrangement it नहीं काम करता एक number प्रति राउंड के बिना। See भी SO-100 अनुकरण सीखने गाइड base डेटासेट के लिए आप mix विरुद्ध, एक policy चलाना inference side के लिए, और DAgger लूप page implemented pipeline के लिए।

क्या हस्तक्षेप दर just एक minus सफलता दर है?

नहीं। दर measure करता है कितना run का आपने ले लिया; सफलता दर measure करता है क्या कार्य done बिना आप। एक run कर सकता है succeed एक 30 प्रतिशत हस्तक्षेप दर के साथ, और एक run बिल्कुल कोई interventions के बिना can fail बिल्कुल। वह भी differ करते हैं noise में: दर move smoothly over thousands of correlated frames, success दर jumps between एक handful of binary outcomes। दोनों log।

सफलता दर के लिए कितने मूल्यांकन trials मुझे चाहिए mean कुछ?

अधिक than feels reasonable। normal approximation के तहत, 20 trials at एक true 60 प्रतिशत success rate carry एक standard error near 11 प्रतिशत points, तो एक 10-point movement between राउंड है indistinguishable noise से; 50 trials bring that figure लगभग 7। अगर आप afford नहीं कर सकते 50, keep trial count identical across राउंड और treat small movements जैसे inconclusive।

मुझे क्या mixing ratio शुरू करना चाहिए demonstrations to सुधार?

documented starting point है IWR का: partition डेटा हस्तक्षेप और non-intervention samples में और draw them equal proportion में, तो सुधार contribute आधा gradient however छोटा एक fraction frames का वह हैं। अगर आपकी setup नहीं कर सकती weight sampling, approximate it through एपिसोड counts जब compose करते हैं dataset और record ratio। प्रशिक्षण सुधार alone पर है option to rule बाहर।

मेरी हस्तक्षेप दर एक राउंड के बाद ऊपर गई। क्या राउंड wasted है?

आवश्यक नहीं, लेकिन check boring explanations पहले: did checkpoint आपने drove match एक आपने trained, did एक कैमरा index या mount change, did object placement drift, was सुधार style consistent। अगर सभी चार clean हैं और paired success दर भी fell, suspect mixture - बहुत कम base demonstrations विरुद्ध सुधार, या सुधार जो contradict एक दूसरे को। एक genuine regression में belongs log, not bin।

क्या मैं fixed मूल्यांकन protocol skip कर सकता हूँ और बस हस्तक्षेप दर देखें?

केवल अगर आप accept कि आप नहीं बता सकते सुधार habituation से। दर depends आपके अपने real-time threshold पर stepping के लिए, और जो threshold falls जैसे आप get used policy की quirks। frozen protocol है part of measurement आपकी threshold नहीं reach कर सकता - taped marks, एक लिखा हुआ home pose, एक fixed trial count, एक criterion decided before राउंड। यह has to stay unchanged across series।

log को repository में रखें, not एक notebook में: राउंड हैं days अलग, hardware gets rebuilt, और व्यक्ति reading वक्र October में है आप with कोई मेमोरी August की। documentation FAQ covers operational details छोड़ दिए गए यहाँ।

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started