
हस्तक्षेप दर - फेरीचे हस्तक्षेप फ्रेम्स भागिले रनचे फ्रेम्स - हे सर्वात स्वस्त प्रामाणिक प्रगति सिग्नल आहे जी मानवी-गेटेड DAgger लूपला आहे. हा लेख त्याची व्याख्या करतो ताकि दोन व्यक्तींना समान मूल्य मिळेल, त्याची लॉगिंग कशी करायची हे दर्शवतो, आणि चारही मार्गांवरून काम करतो जिथे ते तुम्हाला भरामते: ऑपरेटर सवयीचा प्रभाव, ड्रिफ्टिंग मूल्यांकन सेटअप, केवळ सुधारांवर प्रशिक्षण, आणि एक मानव जो सोमवारच्या तुलनेत मंगळवारी वेगळ्याप्रकारे सुधार करतो.
DAgger फेरी उत्पादक वाटते तर तुम्ही त्यामध्ये आहात. तुम्ही policy चलवता, जेव्हा ते पकड स्खलवते तेव्हा ताबा घेता, सुधार जतन करता, पुनः प्रशिक्षण करता, आणि पुढील रन - तुम्ही शपथ घेऊ शकता - थोडा गुळगुळीत दिसतो. दोन फेरी नंतर तुम्ही सांगू शकत नाही की काहीही बदलले किंवा नाही, कारण "थोडा गुळगुळीत" हे एक प्रमाण नाही.
लूपला प्रति फेरी एक संख्या आवश्यक आहे, आणि मानवी-गेटेड लूपमध्ये ती संख्या जवळजवळ विनामूल्य आहे: तुमच्याकडे policy ऐवजी नियंत्रण असलेल्या रनचा अंश. हा लेख त्याची व्याख्या करतो ताकि दोन व्यक्तींना समान मूल्य मिळेल, त्याची लॉगिंग करतो, परिणामी वक्र वाचतो, आणि चारही मार्गांना नाव देतो जेव्हा ते एकटेच उभे राहतात. सिद्धांतासाठी हा तुकडा गृहीत धरतो, पहा DAgger स्पष्टीकरण आणि मानवी-गेटेड व्यतिकरम; व्यावहारिक समकक्ष आहे SO-100 वर DAgger लूप चलवणे.
संक्षिप्त आवृत्ती
- •हस्तक्षेप दर = हस्तक्षेप फ्रेम्स / रनचे फ्रेम्स. फ्रेम्स, एपिसोड नाही, आणि भाजक तुमच्या सुधारणेचे फ्रेम्स समाविष्ट करते.
- •तीन फेरीतून समतल वक्र म्हणजे फेरी काहीही खरेदी करत नाहीत - मिश्रण, checkpoint किंवा कार्य बदलावे, चौथा गोळा करण्याऐवजी.
- •पडणारा हस्तक्षेप दर म्हणजे वाढणारा यश दर नाही. विश्वासाने वाढत असताना तुमचा हस्तक्षेप करण्याचा थ्रेशोल्ड खाली वाकतो.
- •फ्रोजन मूल्यांकन प्रोटोकॉल - समान सुरुवातीचे poses, वस्तू, कॅमेरे, ट्रायल संख्या - न करता तुम्ही खोलीचे मापन करत आहात.
- •केवळ सुधारांवर प्रशिक्षण स्थिती वितरण विकृत करते. IWR चे उत्तर: हस्तक्षेप आणि गैर-हस्तक्षेप नमुने समान प्रमाणात काढा.
फेरीला संख्या आवश्यक का आहे
DAgger वितरण समस्येमुळे अस्तित्वात आहे, आणि वितरण समस्या डोळ्यांना अदृश्य असतात. Ross आणि Bagnell यांनी दाखवले की नक्कल शिक्षण निश्चित प्रदर्शन संचावर चतुर्भुज वाढणारी खेद बंधन आणि कंपाउंडिंग त्रुटी होतात: एकदा शिक्षार्थी demonstrator ने भेट केलेल्या स्थितीतून निघून गेल्यावर, डेटामधील काहीही त्याला परत कसे येायचे हे सांगत नाही. DAgger हे पुनरावृत्ती करून ठीक करते - policy चलवा, त्याने भेट केलेल्या स्थितींना लेबल द्या, एकत्रित करा, पुनः प्रशिक्षण करा - जी Ross, Gordon आणि Bagnell यांनी कोई-regret ऑनलाइन शिक्षणामध्ये कपात म्हणून तयार केली.
त्या तयार करणेचा परिणाम असा आहे जो लोक वगळतात. गॅरंटी पुनरावृत्ति त्यावरील policies च्या क्रमविषयी आहे, कोनाही एकल रनच्या बाबतीत नाही. हे सांगत नाही की तुमचा फेरी तीन मदत केली. जाणून घेण्याचा एकमेव मार्ग म्हणजे प्रत्येक iteration मापन करणे. Kelly आणि सहकर्मींनी HG-DAgger सुरू केले कारण शास्त्रीय DAgger expert ला कृती लेबल विचारते तर novice अभिनय नियंत्रणात आहे, जे पेपर असा युक्तिवाद करते की सुरक्षा कमी करू शकते आणि, मानवी experts सह, कथित actuator lag मधून लेबल गुणवत्ता खराब करण्याची संभावना आहे. HG-DAgger ही एक model-uncertainty-आधारित risk metric साठी सुरक्षा थ्रेशोल्ड शिखरते आणि DAgger आणि behavioural cloning दोन्हीपेक्षा ड्रायव्हिंग कार्यावर सुधारित कामगिरी नोंदवते. हे हस्तक्षेप संख्या प्रकाशित करत नाही; ती तुम्ही स्वतः तयार करता.
दर व्याख्या केली जेणेकरून दोन व्यक्तींना समान संख्या मिळेल
व्याख्या एक ओळ आहे: हस्तक्षेप फ्रेम्स भागिले रनचे फ्रेम्स. सर्व कठीण काहीतरी लपलेले आहे जे frame मानले जाते आणि रन काय मानले जाते.
फ्रेम्स, एपिसोड नाही
कमीतकमी एक हस्तक्षेप असलेले एपिसोड मोजणे व्यर्थ आहे: प्रत्येकी एक nudge असलेल्या दहा एपिसोड आणि दहा ज्यामध्ये तुम्ही 80 टक्के चालवले दोन्ही "10/10" देतात. फ्रेम संख्या त्यांना अलग करते, आणि ही granularity आहे जी रेकॉर्डिंगला आधीच आहे - मध्ये LeRobot डेटासेट स्वरूप प्रत्येक timestep एक row आहे, तर हस्तक्षेप flag एक boolean column आहे स्थिति आणि action च्या पुढे. येथे ते हस्तक्षेप सुरू होताच per frame लिहिले जातात आणि नियंत्रण परत आल्यावर साफ केले जातात.
भाजक सुधारणे समाविष्ट करते
दोन भाजक संरक्षणीय आहेत - रनचे एकूण फ्रेम्स, किंवा policy स्वतंत्रपणे चालवलेले फ्रेम्स - आणि ते उच्च हस्तक्षेप स्तरांवर वाईटपणे विभक्त होतात. 1000 पैकी 400 फ्रेम्सना ताबा घ्या आणि प्रथम 40 टक्के देतो, दुसरा 67 टक्के देतो. एक फेरीची तुलना पहिल्या मार्गाने मापली गेली एकीचे विरुद्ध मापली गेली दुसऱ्या मार्गाने हे कसे वास्तविक सुधार गायब होते. एकूण फ्रेम्स घ्या आणि मालिकेत निवडीचे पुनरावलोकन करू नका.
हँडओव्हर फ्रेम्सचे काय होते हे एकदा निर्णय घ्या
नेहमीच एक शिवणी असते. जेव्हा नियंत्रण हस्तांतरित होते, काही फ्रेम्स कोणाही बाजूस नसतात: हात धरले जातात, leader संरेखित करत आहे, रेकॉर्डिंग फ्रिज केली जातात. या पाइपलाइनमध्ये हे हँडओव्हर फ्रेम्स कच्च्या स्ट्रीममध्ये राहतात आणि curated मध्ये कधीच प्रवेश करत नाहीत episode - ते न तर policy वर्तन आहेत किंवा प्रशिक्षणार्ह सुधार आहेत. शिवणी सारख्याच मार्गाने प्रत्येक फेरीत मोजा: 30 Hz वर, 2-second शिवणीसह सहा takeovers 360 फ्रेम्स आहेत, एक टक्केबिंदू हलवण्यास पुरेसे.
फ्रेम्स किंवा एपिसोड; एकूण रन किंवा autonomous-फक्त; हँडओव्हर फ्रेम्स आतून किंवा बाहेर. तीनपैकी कोणाचे सायलेंट बदल फेरीच्या दरम्यान वक्र अर्थहीन करते. तीनही लिहून ठेवा.
त्याची लॉगिंग करा ते सेशन हरत नाही
चालणार्या प्रक्रियेच्या status panel मध्ये metric हा वाचन असतो: तो restart वर अदृश्य होतो आणि प्लॉट केला जाऊ शकत नाही. प्रति रन एक append-only line संपूर्ण मालिका कव्हर करतो - ज्यामध्ये कोणताही checkpoint तुम्ही चालवले, कारण ते प्रत्येक फेरी बदलते आणि त्यांच्या मिश्रणला गोंधळात टाकणे जे अनुसरण करते ते अमान्य करते.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}दोन fields वजन घेतात. train_mix हे आहे जे तुम्ही पुढील प्रशिक्षण नोकरीला दिले; त्याशिवाय काहीही आरोपित केले जाऊ शकत नाही. eval_protocol निश्चित चाचणीचे नाव देते तुम्ही त्यानंतर चलवले, आणि हे फील्ड सर्वाधिक वेळा रिकामे सोडले जाते. ay-robots cockpit मध्ये takeover status चालत असलेल्या सेशनसाठी हस्तक्षेप frame count नोंदवतो, तर लॉगिंग instrumentation ऐवजी लिप्यंतरण आहे; the डेटासेट प्रलेखन कव्हर करतो जेथे per-frame columns उतरतात.

वक्र वाचून: तीन फेरी, एक निर्णय
तीन फेरी ही minimum आहे वाचनासाठी, कारण दोन बिंदू नेहमी एक line असतात. खाली दी गेलेली टेबल हा bookkeeping template प्लेसहोल्डर संख्यांसह आहे, कोणत्याही रनमधून मोजमाप नाही. तुम्ही fixed test वर monotone decrease matched by success increase शोधत आहात.
| फेरी | Checkpoint चालवले | फ्रेम्स | हस्तक्षेप फ्रेम्स | दर | यश (20 पैकी) |
|---|---|---|---|---|---|
| 0 (baseline) | base policy | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | फेरी 0 mix पासून | 5 610 | 980 | 17.5 % | 10 |
| 2 | फेरी 1 mix पासून | 5 412 | 611 | 11.3 % | 11 |
| 3 | फेरी 2 mix पासून | 5 380 | 598 | 11.1 % | 12 |
फेरी एक आणि दोन काम करत आहेत. फेरी तीन नाही: 11.3 विरुद्ध 11.1 टक्के physical arm वर मापली गेलेल्या कोणत्याही चीजचे run-to-run भिन्नता आहे, आणि चौथी फेरी समान सुधारणेचा एक दुपारचा खर्च करते. समतल segment म्हणते काहीतरी संरचनात्मक बदलवा.
- उर्वरित अपयश teleoperation द्वारे सुधारण्याचे नाहीत - वस्तू पुरवण्यापासून दूर, gripper geometry, joint त्याच्या मर्यादेवर. कोई correction डेटा kinematic wall ठीक करत नाही.
- सुधार base डेटासेटच्या विरुद्ध खूप कमी आहेत gradient हलवण्यासाठी, आणि काहीही त्यांना वजन देत नाही.
- सुधार एकमेकांचे विरोधाभास करतात, तर policy दोन strategies सरासरी करते आणि त्यांच्यामध्ये उतरते.
- अपयश upstream आहे: एक कॅमेरा हलला, lighting बदलली, wrist view यापुढे प्रशिक्षण जुळत नाही.
- कार्य या policy class च्या छतावर या hardware वर आहे, आणि पुढचा step अधिक base डेटा आहे.
शेवटचे दोन हे loop च्या अपयश नाहीत. Sirius-Fleet मध्ये मानवी ची कमी होणारी गरज हा designed result आहे: जसे robot autonomy सुधारते, त्याचे anomaly predictors आपल्या prediction criteria अनुकूल करतात, मानवी हस्तक्षेपसाठी कमी विनंत्या होतात आणि हळूहळू मानवी workload कमी होतात. तेथे निकष अभिप्रेतपणे अनुकूल होतात. manual loop मध्ये तुमचे अनुकूल होतात, silently - तर दर जो समतल होतो कारण कार्य त्याच्या छतावर आहे असे दिसते तर जो ऑपरेटर लक्षात न घेणे बंद केले तर तसेच. कोणता पुढचा समस्या आहे.
जाळे 1: पडणारा दर म्हणजे वाढणारा यश दर नाही
हस्तक्षेप दर एकच गोष्ट मापतो: रनचा किती हिस्सा तुम्ही मालकी मान्य केले. ती निर्णय तुमची आहे, real time मध्ये केली गेली, आणि ती हलते. फेरी शून्यात तुम्ही पहिल्या वाईट approach angle वर ताबा घेता; फेरी तीनपर्यंत तुम्ही policy ला एक डझनांमधून पुनरुद्धार केले आहे आणि तुम्ही त्याला प्रयत्न करायला दिले आहे. तुमचा threshold हलला; the policy कदाचित नाही. दर कोणत्याही मार्गाने पडतो.
मानवी विश्वास literature मध्ये सर्वकाठी एक modelled quantity आहे assumed constant च्या जागी. Sirius re-weights approximated मानवी विश्वासासह training samples आणि weighted behavioural cloning सह policy optimize करते, simulation मध्ये 8 टक्के boost आणि real hardware वर 27 टक्के state of the art policy success rate वर नोंदवते, convergence speed च्या दुप्पट वर. ती विश्वास data वर weight म्हणून मानते. फेरी शून्य आणि फेरी तीन मध्ये तुमच्या डोक्याच्या threshold सुधारत नाही.
तुम्ही drift दूर करू शकत नाहीत, तर दर काहीतरी घोडदळ करा तुमचा threshold स्पर्श करू शकत नाही: trials चा निश्चित set जेथे तुम्ही अजिबात हस्तक्षेप करत नाही, फेरी आधी लिहिलेल्या criterion विरुद्ध scored. दर जो पडतो तर paired success दर स्थिर राहते हे habituation चे signature आहे - पकडण्यास योग्य, कारण लूप आतून ते प्रगतीसारखे वाटते.
| हस्तक्षेप दर | Fixed protocol वर यश दर | सर्वाधिक संभाव्य वाचन |
|---|---|---|
| पडतो | वाढतो | फेरी काम केली. सुरू ठेवा. |
| पडतो | समतल | तुमचा threshold ड्रिफ्ट केली, किंवा सुधारणे प्रयास काढून नाही परंतु अपयश काढून दिले. |
| पडतो | पडतो | सुधार policy खराब करत आहेत. मिश्रण आणि त्यांची internal consistency तपासा. |
| समतल | समतल | फेरी काहीही खरेदी केली नाही. अधिक गोळा करण्याआधी मिश्रण, checkpoint किंवा कार्य बदलवा. |
| वाढतो | पडतो | Regression. प्रशिक्षण mix, बदलल्या कॅमेरा किंवा checkpoint mix-up method च्या आधी संदेह करा. |
जाळे 2: fixed protocol शिवाय, तुम्ही खोलीचे मापन करत आहात
Real-robot मूल्यांकन महाग आहे आणि पुनरावृत्ती कठीण आहे. SIMPLER लेखकांना simulated मूल्यांकन हे motivate करते observation सह की such policies चे real-world मूल्यांकन scalable नाही आणि reproducibility challenges सामना करते ज्या policies त्यांचे task spectrum विस्तृत करत असल्याने वाईट होण्याची शक्यता आहे. RoboArena त्याला दुसऱ्या बाजूने attack करते, 600 पेक्षा अधिक pairwise real-robot मूल्यांकन episodes सह सात generalist policies वर, DROID platform वर सात शैक्षणिक संस्थांमधील मूल्यांकनकर्त्यांद्वारे चलवले. त्याचे evaluators आपले कार्य आणि वातावरण निवडतात परंतु policies च्या pairs double-blind निर्णय लेऊ शकतात; पेपर नोंदवते की हे crowd-sourced ranking generalist-policy performance centralized मूल्यांकन पेक्षा अधिक अचूक track करते.
तुम्ही एक workshop मध्ये 600 paired episodes SO-100 वर चलवणार नाहीत. तुम्ही काय करू शकता त्या आहे variance तुम्ही control करता काढून - एक list बोरिंग पुरेशी ते सामान्यतः skip होते.
| Dimension | हे Freeze करा | तुम्ही न केल्यास काय ड्रिफ्ट करते |
|---|---|---|
| सुरुवातीचे pose | एक लिखित home position, प्रत्येक trial आधी चलवले | trajectory सुरू होते out of distribution |
| वस्तू | Taped चिन्हे, आणि मूल्यांकनसाठी राखीव समान physical objects | एक 'better' policy खरोखर एक closer वस्तू आहे |
| कॅमेरे आणि प्रकाश | समान mounts, indices, exposure; blinds बंद; setup photograph करा | Swapped कॅमेरा indices एकटे परिणाम प्रभावित करू शकतात |
| ट्रायल आणि stop rule | Fixed n, निश्चित timeout, criterion फेरी आधी लिहिले | Post-hoc निकष near-misses वर तुम्हाला आवश्यक असलेल्या मध्ये वळतात |
| ऑपरेटर वर्तन | मूल्यांकन trials दरम्यान कोई हस्तक्षेप नाही | मूल्यांकन अन्य सुधार session बनते |
अशक्य अंकगणित, trial counts वर जी workshop चलवू शकते. normal approximation अंतर्गत, 60 टक्के यश 20 trials वर std error 11 percentage points जवळ वहन करते - 0.6 वेळा 0.4 20 वर square root - आणि दोन अशा फेरीतून difference 15 कोण्यास असते. 60 पासून 70 टक्के jump म्हणून consistent काहीही घडले नाही. 50 trials प्रति-round figure 7 points जवळ आणे, आणि एक दुपार खर्च करते.
हे asymmetry हे argument आहे हस्तक्षेप दर साठी: thousands फ्रेम्सवर computed twenty binary outcomes ऐवजी, हे हलते पहिले आणि अधिक smoothly. caveat आहे की frames within एक episode heavily correlated - एक वाईट grasp yield करते एक hundred consecutive intervention frames - तर effective sample size closer आहे takeovers संख्येला. दर early indicator म्हणून आणि success rate slow ground truth म्हणून मानवा.
मूल्यांकन episodes कधीच composed training dataset मध्ये प्रवेश करू नये - अन्यथा round n+1 data वर scored होते ते trained होते, आणि वक्र memorisation मापते.
जाळे 3: केवळ सुधारांवर प्रशिक्षण policy वाकते
सुधार interesting डेटा आहे, तर instinct आहे त्यांच्यावर प्रशिक्षण करणे. करू नका. ते construction द्वारा येतात state space च्या narrow slice पासून जेथे policy आधीच अपयश होते आणि majority run जे काम केले त्याबद्दल जवळजवळ काहीही सांगत नाही. त्या slice अकेला वर fine-tune करा आणि तुम्हाला policy मिळते botched approach पुनरुद्धार करण्यात चांगला जे clean एक कसे बनवायचे हे विसरले आहे.
Mandlekar आणि colleagues यांनी त्यांचे remote intervention system या भोवती तयार केले. त्यांचे framing: manipulation tasks bottleneck regions समाविष्ट करतात precise actions च्या sequence आवश्यक - एक coffee machine मध्ये pod insert करणे त्यांचे example आहे - जेथे small deviations demonstrations कधीच कव्हर न केलेल्या states मध्ये lead करतात. त्यांचे algorithm iteratively नवीन डेटा वर प्रशिक्षण करते तर policy त्या bottlenecks traverse करायला शिखरते, आणि ते नोंदवते agents trained intervention डेटा वर non-interventional demonstrators पासून equivalent samples वर trained agents beat करतात.
- Fast: एक short run few dozen episodes वर repeat साठी सस्ता आहे
- Targeted: gradient dominated होता तुम्ही care करत आहात states द्वारा
- Cheap करणे शिक्षणीय आहे की correction style सीखने योग्य आहे अजिबात
- Fine-tune distribution यापुढे task distribution सदृश नाही
- Nominal वर्तन single round मध्ये noticeably degrade करू शकते
- दर पडू शकतो तर success पडते त्यासह - clean segments traded recoveries साठी
मिश्रण दर एक hyperparameter आहे आणि लिखाण योग्य आहे. composing पुढचा dataset आहे जेथे ते decided होता: original demonstrations plus सुधार set, episode selection explicit per source ऐवजी एक rule जो quietly pulls काहीही available. येथे ते एक compose step cockpit मध्ये आहे, आणि result एक ordinary dataset आहे - पहा the प्रशिक्षण प्रलेखन. कोई tool करत नाही तुमच्यासाठी recording कोणते दर कोणते वक्र produced.
जाळे 4: मानव एक consistent expert नाही
DAgger च्या सिद्धांत एक expert assume करते. तुम्ही technical sense मध्ये एक नाही: तुमचे सुधार samples नाहीत fixed conditional distribution over actions. ACT लेखकांनी हे नाव fine manipulation मध्ये obstacles list करताना - errors compound होता वेळ, आणि human demonstrations हो-stationary. त्यांचे system अजून reach करते 80 to 90 टक्के यश सहा real tasks वर ten minutes demonstrations पासून, तर समस्या tractable आहे, absent नाही.
robomimic अध्ययन बनवते बिंदु डेटा side पासून. सहा offline algorithms अधिक पाँच simulated आणि तीन real-world multi-stage tasks, त्याचे lessons design choices मध्ये संवेदनशीलता समाविष्ट करतात, demonstration गुणवत्ता वर dependence, आणि - आहे hurt सर्वाधिक येथे - stopping criteria पासून variability, कारण प्रशिक्षण आणि मूल्यांकन objectives भिन्न. lowest loss checkpoint सह नाही reliably एक highest success rate.
हार्डवेअर संस्करण आहे: input mode सुधार आकार. leader-follower setup उत्पादन करते continuous, human-paced trajectories. कीबोर्ड nudges clamped hard द्वारा सर्वर - arm joints वर दोन degrees प्रत्येक call, gripper वर चार - तर समान intent आते steps चा एक staircase. sliders भेजते absolute targets आणि सर्वर moves अधिकतम सहा degrees उपांत्य प्रत्येक call. तीन modes, तीन action distributions; mixing सर्व तीन एक सुधार set मध्ये आणि मग विचार करण्यात approach वर twitchy आहे self-inflicted. the टेलीऑपरेशन प्रलेखन कव्हर करतो काय प्रत्येक mode भेजते.
वजन interventions: IWR आणि काय त्यानंतर आला
जर सुधार valuable अल्पसंख्य आहे, principled fix आहे weight exclusive नाही. Intervention Weighted Regression reference implementation आहे: डेटा partitioned होता intervention आणि non-intervention samples मध्ये, आणि दोन partitions sampled होता equal proportion प्रशिक्षण दरम्यान. एक सुधार set आहे पाँच टक्के frames चा फक्त contribute करता अर्ध gradient, nominal वर्तन vanishing ऐवजी distribution पासून.
समान proportion एक starting point आहे, law नाही. Sirius generalizes करते binary partition replacing continuous weight द्वारा approximated मानवी विश्वासापासून; Sirius-Fleet moves निर्णय upstream, visual world model आणि anomaly predictors वापरून decide करण्यासाठी जेव्हा मानवी asked होता अजिबात. common thread: intervention flag एक training signal आहे, फक्त bookkeeping column नाही.
| Method | को निर्णय जेव्हा मानवी acts | कसे intervention डेटा used होता | Reported result |
|---|---|---|---|
| DAgger (2011) | Fixed schedule; expert labels visited states | एक growing dataset, unweighted | Framed reduction म्हणून no-regret online learning मध्ये |
| HG-DAgger (2019) | मानवी, gating नियंत्रण real system वर | aggregated; plus एक learned safety threshold model uncertainty वर | Better DAgger आणि BC ड्रायव्हिंग मध्ये; intervention counts दिलेले नाही |
| IWR (2020) | मानवी, via remote टेलीऑपरेशन | Intervention आणि non-intervention samples drawn equal proportion मध्ये | Beats non-interventional demos equal sample count वर |
| Sirius (2022) | मानवी, deployment दरम्यान | Weighted BC, weights approximated मानवी विश्वासापासून | 8 % gain simulation मध्ये, 27 % real hardware वर; 2x faster convergence |
| ThriftyDAgger (2021) | system, gating novelty आणि risk वर | Interactive collection supervision budget अंतर्गत | user study (N=10): 58 % higher मानवी आणि 80 % higher robot performance next best method पेक्षा |
| Fleet-DAgger (2022) | system, allocating attention fleet वर | Fleet learning scored Return on Human Effort द्वारा | up to 8.8x higher ROHE baselines पेक्षा |
| Sirius-Fleet (2024) | anomaly predictors self-adapting criteria सह | Multi-task learning visual world model सह | अधिक कमी हस्तक्षेप request autonomy सुधारते म्हणून |

चार metrics लॉग करण्यास योग्य दर पुढे
- takeovers per run. Twenty short सुधार आणि एक long एक दिते समान दर आणि describe भिन्न policies - एक jittery, एक single blind spot सह.
- mean intervention length. Rising length falling count द्वारा साथ म्हणजे remaining failures hard ones आहेत, कोण आहे काय late progress दिसते.
- time to first intervention. policy जे get further आधी needing मदत आहे improving अगदी तर total दर समतल होता.
- जेथे interventions cluster. bin flag normalized episode progress द्वारा; एक stable peak फेरी वर एक bottleneck point करतात.
एक फेरी protocol तुम्ही खरोखर चलवू शकता
measured फेरी आहे सहा steps आणि produce करतो एक log मध्ये row. पहिले चार आहे लूप; last दोन बनवितो हे measurement.
- 1फ्रोज evaluation protocol फेरी शून्य आधी
लिहा सुरु pose, वस्तू placement, कॅमेरे, trial count, timeout आणि success criterion. table photograph करा. जर दस्तऐवज बदलायला आहे, series restarts.
- 2baseline मापा
protocol चलवा कोई हस्तक्षेप नाही आणि record successes; तर run एक instrumented सेशन takeover सक्षम आणि record दर. दोन numbers आहे फेरी शून्य.
- 3सुधार गोळा करा एक consistent शैली मध्ये
एक input mode per फेरी, एक ऑपरेटर जर तुम्ही चलवू शकता. take over criterion वर तुम्ही state आहे बाहेर मोठा - 'gripper चेहरा दोन centimetres approach वर off' - आणि hold ते फेरीसाठी.
- 4triage प्रत्येक episode समान दिन
सुधार, मूल्यांकन किंवा discard. ambiguous episodes discarded होता, saved theory कि अधिक डेटा मदत - एक सुधार जेथे तुम्ही fumbled नाही episode पेक्षा वाईट.
- 5compose mixture explicit मध्ये
original demonstrations plus सुधार set, episode selection per source. record base count, सुधार count आणि कोई weighting - हे field तुम्ही चाहिल तीन आठवडे.
- 6continue checkpoint पासून, तर re-measure
practice composed डेटासेट previous checkpoint पासून base model ऐवजी, चलवा frozen protocol plus एक instrumented session, append row, आणि compare विरुद्ध previous दोन फेरी.
दोन limit कसे बदलवा तुम्ही read एक weak फेरी. continuing एक checkpoint initialises weights त्यापासून - नाही optimizer resume, तर schedule start fresh आणि एक short run converged checkpoint पासून move very little. आणि leader-align motion सुरु takeover साठी आहे least mileage real hardware चा सर्वकाठी chain; जर सुधार सर्व start odd transient, look तेथे mixture blaming आधी.
measured लूप, पहिले wired up
ay-robots implement करते six steps product features म्हणून: take over mid-run एक leader arm पासून, कीबोर्ड किंवा sliders, intervention frames flagged automatic; triage प्रत्येक episode सुधार, मूल्यांकन किंवा discard; compose पुढचा dataset original demonstrations plus सुधार पासून, episode selection explicit per source; आणि start पुढचा training run previous checkpoint पासून base model ऐवजी.
पहा कसे DAgger लूप काम करतेकाय numbers तुम्हाला सांगू शकत नाहीत
काहीही यात solved नाही, आणि एक tidy वक्र तुम्हाला persuade करू नये अन्यथा. intervention दर joint system मापते - policy, hardware, ऑपरेटर, कमरा - आणि attributes nothing अन्यथा. हे judge करू शकत नाही सुधार चांगले होते, आणि हे fall खुशीने एक कार्य जे सहज बनले कारण वस्तू ड्रिफ्ट तीन weeks मध्ये centimetres closer.
काय हे करते आहे turn एक vague impression एक column आहे तुम्ही argue करू शकत. alternative नाही एक better metric; हे तीन आठवडे collecting सुधार वक्र होता सांगत तुम्हाला, फेरी तीन नंतर, stop collecting. survey literature define करते interactive imitation learning म्हणून human feedback given intermittently robot execution दरम्यान, allowing एक online सुधार behaviour; family चा wide आहे, आणि कोई arrangement काम करत नाही एक number प्रति फेरी शिवाय. पहा देखील SO-100 imitation learning guide base dataset साठी तुम्ही mix विरुद्ध, एक policy चलवणे inference side साठी, आणि DAgger लूप page implemented pipeline साठी.
हे intervention दर फक्त एक minus success दर आहे?▾
नाही. दर मापते किती रनचा तुम्ही took over; success दर मापते शिवाय task मिळाले नाही तुम्ही. एक run succeed करू शकते 30 टक्के intervention दर, आणि एक run कोई हस्तक्षेप शिवाय fail करू शकते पूर्ण. ते पण differ noise: दर move smoothly over thousands correlated frames, success दर jump thousands handful binary outcomes. दोन्ही लॉग करा.
किती मूल्यांकन trial मला चाहिल success दर अर्थपूर्ण साठी?▾
अधिक than feels reasonable. अंतर्गत normal approximation, 20 trial true 60 टक्के success दर वर carry एक std error जवळ 11 percentage points, तर एक 10-point movement फेरी शोर indistinguishable; 50 trial carry figure 7 roughly. तुम्ही 50 afford नाही, trial count identical hold फेरी आणि treat small movement inconclusive म्हणून.
कोई मिश्रण ratio demonstrations सुधार मी start करू शकतो?▾
documented starting point आहे IWR चे: partition डेटा intervention आणि non-intervention sample मध्ये आणि draw equal proportion मध्ये, तर सुधार contribute अर्ध gradient however small fraction frames आहे. तुमचे setup नाही weight sampling, approximate हे episode count वापरून dataset composing तर record दर. training corrections एकटे option आहे rule out.
माझे intervention दर गेला फेरी नंतर up. फेरी होता आधी?▾
जरूरी नाही, परंतु check बोरिंग explanation पहिले: करत checkpoint आहे तुम्ही drove match एक तुम्ही trained, करत कॅमेरा index किंवा mount बदलली, करत वस्तू placement drift, करत सुधार शैली consistent. जर चार clean आणि paired success दर पण पडली, suspect mixture - base demonstrations खूप कमी विरुद्ध सुधार, किंवा सुधार जे विरोधाभास. एक genuine regression belongs log मध्ये, bin नाही.
हे मी skip करू शकतो fixed evaluation protocol आणि फक्त watch intervention दर?▾
केवळ तुम्ही accept करू शकत नाहीत improvement habituation पासून सांगू शकत। दर depends तुमच्या real-time threshold stepping साठी, आणि threshold fall जसे तुम्ही get used policy quirks मध्ये. frozen protocol आहे measurement चा part तुमचा threshold करू शकत नाही पहुंच - taped चिन्हे, एक लिखित home pose, एक fixed trial count, एक criterion decided फेरी आधी. हे stay unchanged series पासून।
ठेवा लॉग repository मध्ये, notebook मध्ये नाही: फेरी days अलग आहेत, hardware gets रीबिल्ट, आणि व्यक्ती reading वक्र October मध्ये आहे तुम्ही कोही memory August साथ। the documentation FAQ कव्हर करतो operational विवरण left येथे बाहेर.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started