टेबलटॉप रोबोट वर्कस्पेस, ज्याचा वापर पुनरावृत्ती policy रनसाठी निश्चित मूल्यांकन सेटअप म्हणून केला जातो
DAggerमूल्यांकननक्कल शिक्षणरोबोट डेटाSO-100

DAgger लूप मापन: हस्तक्षेप दर, मूल्यांकन प्रोटोकॉल, आणि दरम्यानचे जाळे

AY-Robots ResearchAugust 27, 202615 मिनिट वाचन

हस्तक्षेप दर - फेरीचे हस्तक्षेप फ्रेम्स भागिले रनचे फ्रेम्स - हे सर्वात स्वस्त प्रामाणिक प्रगति सिग्नल आहे जी मानवी-गेटेड DAgger लूपला आहे. हा लेख त्याची व्याख्या करतो ताकि दोन व्यक्तींना समान मूल्य मिळेल, त्याची लॉगिंग कशी करायची हे दर्शवतो, आणि चारही मार्गांवरून काम करतो जिथे ते तुम्हाला भरामते: ऑपरेटर सवयीचा प्रभाव, ड्रिफ्टिंग मूल्यांकन सेटअप, केवळ सुधारांवर प्रशिक्षण, आणि एक मानव जो सोमवारच्या तुलनेत मंगळवारी वेगळ्याप्रकारे सुधार करतो.

DAgger फेरी उत्पादक वाटते तर तुम्ही त्यामध्ये आहात. तुम्ही policy चलवता, जेव्हा ते पकड स्खलवते तेव्हा ताबा घेता, सुधार जतन करता, पुनः प्रशिक्षण करता, आणि पुढील रन - तुम्ही शपथ घेऊ शकता - थोडा गुळगुळीत दिसतो. दोन फेरी नंतर तुम्ही सांगू शकत नाही की काहीही बदलले किंवा नाही, कारण "थोडा गुळगुळीत" हे एक प्रमाण नाही.

लूपला प्रति फेरी एक संख्या आवश्यक आहे, आणि मानवी-गेटेड लूपमध्ये ती संख्या जवळजवळ विनामूल्य आहे: तुमच्याकडे policy ऐवजी नियंत्रण असलेल्या रनचा अंश. हा लेख त्याची व्याख्या करतो ताकि दोन व्यक्तींना समान मूल्य मिळेल, त्याची लॉगिंग करतो, परिणामी वक्र वाचतो, आणि चारही मार्गांना नाव देतो जेव्हा ते एकटेच उभे राहतात. सिद्धांतासाठी हा तुकडा गृहीत धरतो, पहा DAgger स्पष्टीकरण आणि मानवी-गेटेड व्यतिकरम; व्यावहारिक समकक्ष आहे SO-100 वर DAgger लूप चलवणे.

संक्षिप्त आवृत्ती

  • हस्तक्षेप दर = हस्तक्षेप फ्रेम्स / रनचे फ्रेम्स. फ्रेम्स, एपिसोड नाही, आणि भाजक तुमच्या सुधारणेचे फ्रेम्स समाविष्ट करते.
  • तीन फेरीतून समतल वक्र म्हणजे फेरी काहीही खरेदी करत नाहीत - मिश्रण, checkpoint किंवा कार्य बदलावे, चौथा गोळा करण्याऐवजी.
  • पडणारा हस्तक्षेप दर म्हणजे वाढणारा यश दर नाही. विश्वासाने वाढत असताना तुमचा हस्तक्षेप करण्याचा थ्रेशोल्ड खाली वाकतो.
  • फ्रोजन मूल्यांकन प्रोटोकॉल - समान सुरुवातीचे poses, वस्तू, कॅमेरे, ट्रायल संख्या - न करता तुम्ही खोलीचे मापन करत आहात.
  • केवळ सुधारांवर प्रशिक्षण स्थिती वितरण विकृत करते. IWR चे उत्तर: हस्तक्षेप आणि गैर-हस्तक्षेप नमुने समान प्रमाणात काढा.

फेरीला संख्या आवश्यक का आहे

DAgger वितरण समस्येमुळे अस्तित्वात आहे, आणि वितरण समस्या डोळ्यांना अदृश्य असतात. Ross आणि Bagnell यांनी दाखवले की नक्कल शिक्षण निश्चित प्रदर्शन संचावर चतुर्भुज वाढणारी खेद बंधन आणि कंपाउंडिंग त्रुटी होतात: एकदा शिक्षार्थी demonstrator ने भेट केलेल्या स्थितीतून निघून गेल्यावर, डेटामधील काहीही त्याला परत कसे येायचे हे सांगत नाही. DAgger हे पुनरावृत्ती करून ठीक करते - policy चलवा, त्याने भेट केलेल्या स्थितींना लेबल द्या, एकत्रित करा, पुनः प्रशिक्षण करा - जी Ross, Gordon आणि Bagnell यांनी कोई-regret ऑनलाइन शिक्षणामध्ये कपात म्हणून तयार केली.

त्या तयार करणेचा परिणाम असा आहे जो लोक वगळतात. गॅरंटी पुनरावृत्ति त्यावरील policies च्या क्रमविषयी आहे, कोनाही एकल रनच्या बाबतीत नाही. हे सांगत नाही की तुमचा फेरी तीन मदत केली. जाणून घेण्याचा एकमेव मार्ग म्हणजे प्रत्येक iteration मापन करणे. Kelly आणि सहकर्मींनी HG-DAgger सुरू केले कारण शास्त्रीय DAgger expert ला कृती लेबल विचारते तर novice अभिनय नियंत्रणात आहे, जे पेपर असा युक्तिवाद करते की सुरक्षा कमी करू शकते आणि, मानवी experts सह, कथित actuator lag मधून लेबल गुणवत्ता खराब करण्याची संभावना आहे. HG-DAgger ही एक model-uncertainty-आधारित risk metric साठी सुरक्षा थ्रेशोल्ड शिखरते आणि DAgger आणि behavioural cloning दोन्हीपेक्षा ड्रायव्हिंग कार्यावर सुधारित कामगिरी नोंदवते. हे हस्तक्षेप संख्या प्रकाशित करत नाही; ती तुम्ही स्वतः तयार करता.

दर व्याख्या केली जेणेकरून दोन व्यक्तींना समान संख्या मिळेल

व्याख्या एक ओळ आहे: हस्तक्षेप फ्रेम्स भागिले रनचे फ्रेम्स. सर्व कठीण काहीतरी लपलेले आहे जे frame मानले जाते आणि रन काय मानले जाते.

फ्रेम्स, एपिसोड नाही

कमीतकमी एक हस्तक्षेप असलेले एपिसोड मोजणे व्यर्थ आहे: प्रत्येकी एक nudge असलेल्या दहा एपिसोड आणि दहा ज्यामध्ये तुम्ही 80 टक्के चालवले दोन्ही "10/10" देतात. फ्रेम संख्या त्यांना अलग करते, आणि ही granularity आहे जी रेकॉर्डिंगला आधीच आहे - मध्ये LeRobot डेटासेट स्वरूप प्रत्येक timestep एक row आहे, तर हस्तक्षेप flag एक boolean column आहे स्थिति आणि action च्या पुढे. येथे ते हस्तक्षेप सुरू होताच per frame लिहिले जातात आणि नियंत्रण परत आल्यावर साफ केले जातात.

भाजक सुधारणे समाविष्ट करते

दोन भाजक संरक्षणीय आहेत - रनचे एकूण फ्रेम्स, किंवा policy स्वतंत्रपणे चालवलेले फ्रेम्स - आणि ते उच्च हस्तक्षेप स्तरांवर वाईटपणे विभक्त होतात. 1000 पैकी 400 फ्रेम्सना ताबा घ्या आणि प्रथम 40 टक्के देतो, दुसरा 67 टक्के देतो. एक फेरीची तुलना पहिल्या मार्गाने मापली गेली एकीचे विरुद्ध मापली गेली दुसऱ्या मार्गाने हे कसे वास्तविक सुधार गायब होते. एकूण फ्रेम्स घ्या आणि मालिकेत निवडीचे पुनरावलोकन करू नका.

हँडओव्हर फ्रेम्सचे काय होते हे एकदा निर्णय घ्या

नेहमीच एक शिवणी असते. जेव्हा नियंत्रण हस्तांतरित होते, काही फ्रेम्स कोणाही बाजूस नसतात: हात धरले जातात, leader संरेखित करत आहे, रेकॉर्डिंग फ्रिज केली जातात. या पाइपलाइनमध्ये हे हँडओव्हर फ्रेम्स कच्च्या स्ट्रीममध्ये राहतात आणि curated मध्ये कधीच प्रवेश करत नाहीत episode - ते न तर policy वर्तन आहेत किंवा प्रशिक्षणार्ह सुधार आहेत. शिवणी सारख्याच मार्गाने प्रत्येक फेरीत मोजा: 30 Hz वर, 2-second शिवणीसह सहा takeovers 360 फ्रेम्स आहेत, एक टक्केबिंदू हलवण्यास पुरेसे.

तीन निर्णय जे तुलनीयता खंडित करतात

फ्रेम्स किंवा एपिसोड; एकूण रन किंवा autonomous-फक्त; हँडओव्हर फ्रेम्स आतून किंवा बाहेर. तीनपैकी कोणाचे सायलेंट बदल फेरीच्या दरम्यान वक्र अर्थहीन करते. तीनही लिहून ठेवा.

त्याची लॉगिंग करा ते सेशन हरत नाही

चालणार्या प्रक्रियेच्या status panel मध्ये metric हा वाचन असतो: तो restart वर अदृश्य होतो आणि प्लॉट केला जाऊ शकत नाही. प्रति रन एक append-only line संपूर्ण मालिका कव्हर करतो - ज्यामध्ये कोणताही checkpoint तुम्ही चालवले, कारण ते प्रत्येक फेरी बदलते आणि त्यांच्या मिश्रणला गोंधळात टाकणे जे अनुसरण करते ते अमान्य करते.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
प्रति रन एक line. भाजक आणि हँडओव्हर convention रेकॉर्डिंग संख्येच्या पुढे फील्ड नावांपेक्षा अधिक महत्वाचे आहे.

दोन fields वजन घेतात. train_mix हे आहे जे तुम्ही पुढील प्रशिक्षण नोकरीला दिले; त्याशिवाय काहीही आरोपित केले जाऊ शकत नाही. eval_protocol निश्चित चाचणीचे नाव देते तुम्ही त्यानंतर चलवले, आणि हे फील्ड सर्वाधिक वेळा रिकामे सोडले जाते. ay-robots cockpit मध्ये takeover status चालत असलेल्या सेशनसाठी हस्तक्षेप frame count नोंदवतो, तर लॉगिंग instrumentation ऐवजी लिप्यंतरण आहे; the डेटासेट प्रलेखन कव्हर करतो जेथे per-frame columns उतरतात.

प्रशिक्षण configuration matrix पॉलिसी, डेटासेट आणि checkpoints एक बाजूला दर्शविते
प्रत्येक फेरी checkpoint आणि डेटासेट mix बदलते. एक संख्या ज्याचे combination रेकॉर्ड केले गेले नाही त्याचे आरोपण केले जाऊ शकत नाही.

वक्र वाचून: तीन फेरी, एक निर्णय

तीन फेरी ही minimum आहे वाचनासाठी, कारण दोन बिंदू नेहमी एक line असतात. खाली दी गेलेली टेबल हा bookkeeping template प्लेसहोल्डर संख्यांसह आहे, कोणत्याही रनमधून मोजमाप नाही. तुम्ही fixed test वर monotone decrease matched by success increase शोधत आहात.

फेरीCheckpoint चालवलेफ्रेम्सहस्तक्षेप फ्रेम्सदरयश (20 पैकी)
0 (baseline)base policy5 9001 38023.4 %7
1फेरी 0 mix पासून5 61098017.5 %10
2फेरी 1 mix पासून5 41261111.3 %11
3फेरी 2 mix पासून5 38059811.1 %12

फेरी एक आणि दोन काम करत आहेत. फेरी तीन नाही: 11.3 विरुद्ध 11.1 टक्के physical arm वर मापली गेलेल्या कोणत्याही चीजचे run-to-run भिन्नता आहे, आणि चौथी फेरी समान सुधारणेचा एक दुपारचा खर्च करते. समतल segment म्हणते काहीतरी संरचनात्मक बदलवा.

  • उर्वरित अपयश teleoperation द्वारे सुधारण्याचे नाहीत - वस्तू पुरवण्यापासून दूर, gripper geometry, joint त्याच्या मर्यादेवर. कोई correction डेटा kinematic wall ठीक करत नाही.
  • सुधार base डेटासेटच्या विरुद्ध खूप कमी आहेत gradient हलवण्यासाठी, आणि काहीही त्यांना वजन देत नाही.
  • सुधार एकमेकांचे विरोधाभास करतात, तर policy दोन strategies सरासरी करते आणि त्यांच्यामध्ये उतरते.
  • अपयश upstream आहे: एक कॅमेरा हलला, lighting बदलली, wrist view यापुढे प्रशिक्षण जुळत नाही.
  • कार्य या policy class च्या छतावर या hardware वर आहे, आणि पुढचा step अधिक base डेटा आहे.

शेवटचे दोन हे loop च्या अपयश नाहीत. Sirius-Fleet मध्ये मानवी ची कमी होणारी गरज हा designed result आहे: जसे robot autonomy सुधारते, त्याचे anomaly predictors आपल्या prediction criteria अनुकूल करतात, मानवी हस्तक्षेपसाठी कमी विनंत्या होतात आणि हळूहळू मानवी workload कमी होतात. तेथे निकष अभिप्रेतपणे अनुकूल होतात. manual loop मध्ये तुमचे अनुकूल होतात, silently - तर दर जो समतल होतो कारण कार्य त्याच्या छतावर आहे असे दिसते तर जो ऑपरेटर लक्षात न घेणे बंद केले तर तसेच. कोणता पुढचा समस्या आहे.

जाळे 1: पडणारा दर म्हणजे वाढणारा यश दर नाही

हस्तक्षेप दर एकच गोष्ट मापतो: रनचा किती हिस्सा तुम्ही मालकी मान्य केले. ती निर्णय तुमची आहे, real time मध्ये केली गेली, आणि ती हलते. फेरी शून्यात तुम्ही पहिल्या वाईट approach angle वर ताबा घेता; फेरी तीनपर्यंत तुम्ही policy ला एक डझनांमधून पुनरुद्धार केले आहे आणि तुम्ही त्याला प्रयत्न करायला दिले आहे. तुमचा threshold हलला; the policy कदाचित नाही. दर कोणत्याही मार्गाने पडतो.

मानवी विश्वास literature मध्ये सर्वकाठी एक modelled quantity आहे assumed constant च्या जागी. Sirius re-weights approximated मानवी विश्वासासह training samples आणि weighted behavioural cloning सह policy optimize करते, simulation मध्ये 8 टक्के boost आणि real hardware वर 27 टक्के state of the art policy success rate वर नोंदवते, convergence speed च्या दुप्पट वर. ती विश्वास data वर weight म्हणून मानते. फेरी शून्य आणि फेरी तीन मध्ये तुमच्या डोक्याच्या threshold सुधारत नाही.

तुम्ही drift दूर करू शकत नाहीत, तर दर काहीतरी घोडदळ करा तुमचा threshold स्पर्श करू शकत नाही: trials चा निश्चित set जेथे तुम्ही अजिबात हस्तक्षेप करत नाही, फेरी आधी लिहिलेल्या criterion विरुद्ध scored. दर जो पडतो तर paired success दर स्थिर राहते हे habituation चे signature आहे - पकडण्यास योग्य, कारण लूप आतून ते प्रगतीसारखे वाटते.

हस्तक्षेप दरFixed protocol वर यश दरसर्वाधिक संभाव्य वाचन
पडतोवाढतोफेरी काम केली. सुरू ठेवा.
पडतोसमतलतुमचा threshold ड्रिफ्ट केली, किंवा सुधारणे प्रयास काढून नाही परंतु अपयश काढून दिले.
पडतोपडतोसुधार policy खराब करत आहेत. मिश्रण आणि त्यांची internal consistency तपासा.
समतलसमतलफेरी काहीही खरेदी केली नाही. अधिक गोळा करण्याआधी मिश्रण, checkpoint किंवा कार्य बदलवा.
वाढतोपडतोRegression. प्रशिक्षण mix, बदलल्या कॅमेरा किंवा checkpoint mix-up method च्या आधी संदेह करा.

जाळे 2: fixed protocol शिवाय, तुम्ही खोलीचे मापन करत आहात

Real-robot मूल्यांकन महाग आहे आणि पुनरावृत्ती कठीण आहे. SIMPLER लेखकांना simulated मूल्यांकन हे motivate करते observation सह की such policies चे real-world मूल्यांकन scalable नाही आणि reproducibility challenges सामना करते ज्या policies त्यांचे task spectrum विस्तृत करत असल्याने वाईट होण्याची शक्यता आहे. RoboArena त्याला दुसऱ्या बाजूने attack करते, 600 पेक्षा अधिक pairwise real-robot मूल्यांकन episodes सह सात generalist policies वर, DROID platform वर सात शैक्षणिक संस्थांमधील मूल्यांकनकर्त्यांद्वारे चलवले. त्याचे evaluators आपले कार्य आणि वातावरण निवडतात परंतु policies च्या pairs double-blind निर्णय लेऊ शकतात; पेपर नोंदवते की हे crowd-sourced ranking generalist-policy performance centralized मूल्यांकन पेक्षा अधिक अचूक track करते.

तुम्ही एक workshop मध्ये 600 paired episodes SO-100 वर चलवणार नाहीत. तुम्ही काय करू शकता त्या आहे variance तुम्ही control करता काढून - एक list बोरिंग पुरेशी ते सामान्यतः skip होते.

Dimensionहे Freeze करातुम्ही न केल्यास काय ड्रिफ्ट करते
सुरुवातीचे poseएक लिखित home position, प्रत्येक trial आधी चलवलेtrajectory सुरू होते out of distribution
वस्तूTaped चिन्हे, आणि मूल्यांकनसाठी राखीव समान physical objectsएक 'better' policy खरोखर एक closer वस्तू आहे
कॅमेरे आणि प्रकाशसमान mounts, indices, exposure; blinds बंद; setup photograph कराSwapped कॅमेरा indices एकटे परिणाम प्रभावित करू शकतात
ट्रायल आणि stop ruleFixed n, निश्चित timeout, criterion फेरी आधी लिहिलेPost-hoc निकष near-misses वर तुम्हाला आवश्यक असलेल्या मध्ये वळतात
ऑपरेटर वर्तनमूल्यांकन trials दरम्यान कोई हस्तक्षेप नाहीमूल्यांकन अन्य सुधार session बनते

अशक्य अंकगणित, trial counts वर जी workshop चलवू शकते. normal approximation अंतर्गत, 60 टक्के यश 20 trials वर std error 11 percentage points जवळ वहन करते - 0.6 वेळा 0.4 20 वर square root - आणि दोन अशा फेरीतून difference 15 कोण्यास असते. 60 पासून 70 टक्के jump म्हणून consistent काहीही घडले नाही. 50 trials प्रति-round figure 7 points जवळ आणे, आणि एक दुपार खर्च करते.

हे asymmetry हे argument आहे हस्तक्षेप दर साठी: thousands फ्रेम्सवर computed twenty binary outcomes ऐवजी, हे हलते पहिले आणि अधिक smoothly. caveat आहे की frames within एक episode heavily correlated - एक वाईट grasp yield करते एक hundred consecutive intervention frames - तर effective sample size closer आहे takeovers संख्येला. दर early indicator म्हणून आणि success rate slow ground truth म्हणून मानवा.

मूल्यांकन episodes training pool मधून ठेवून राखा

मूल्यांकन episodes कधीच composed training dataset मध्ये प्रवेश करू नये - अन्यथा round n+1 data वर scored होते ते trained होते, आणि वक्र memorisation मापते.

जाळे 3: केवळ सुधारांवर प्रशिक्षण policy वाकते

सुधार interesting डेटा आहे, तर instinct आहे त्यांच्यावर प्रशिक्षण करणे. करू नका. ते construction द्वारा येतात state space च्या narrow slice पासून जेथे policy आधीच अपयश होते आणि majority run जे काम केले त्याबद्दल जवळजवळ काहीही सांगत नाही. त्या slice अकेला वर fine-tune करा आणि तुम्हाला policy मिळते botched approach पुनरुद्धार करण्यात चांगला जे clean एक कसे बनवायचे हे विसरले आहे.

Mandlekar आणि colleagues यांनी त्यांचे remote intervention system या भोवती तयार केले. त्यांचे framing: manipulation tasks bottleneck regions समाविष्ट करतात precise actions च्या sequence आवश्यक - एक coffee machine मध्ये pod insert करणे त्यांचे example आहे - जेथे small deviations demonstrations कधीच कव्हर न केलेल्या states मध्ये lead करतात. त्यांचे algorithm iteratively नवीन डेटा वर प्रशिक्षण करते तर policy त्या bottlenecks traverse करायला शिखरते, आणि ते नोंदवते agents trained intervention डेटा वर non-interventional demonstrators पासून equivalent samples वर trained agents beat करतात.

Corrections-only fine-tuning विरुद्ध एक composed mixture
काय corrections-only तुम्हाला मिळवतात
  • Fast: एक short run few dozen episodes वर repeat साठी सस्ता आहे
  • Targeted: gradient dominated होता तुम्ही care करत आहात states द्वारा
  • Cheap करणे शिक्षणीय आहे की correction style सीखने योग्य आहे अजिबात
काय खर्च होतो
  • Fine-tune distribution यापुढे task distribution सदृश नाही
  • Nominal वर्तन single round मध्ये noticeably degrade करू शकते
  • दर पडू शकतो तर success पडते त्यासह - clean segments traded recoveries साठी

मिश्रण दर एक hyperparameter आहे आणि लिखाण योग्य आहे. composing पुढचा dataset आहे जेथे ते decided होता: original demonstrations plus सुधार set, episode selection explicit per source ऐवजी एक rule जो quietly pulls काहीही available. येथे ते एक compose step cockpit मध्ये आहे, आणि result एक ordinary dataset आहे - पहा the प्रशिक्षण प्रलेखन. कोई tool करत नाही तुमच्यासाठी recording कोणते दर कोणते वक्र produced.

जाळे 4: मानव एक consistent expert नाही

DAgger च्या सिद्धांत एक expert assume करते. तुम्ही technical sense मध्ये एक नाही: तुमचे सुधार samples नाहीत fixed conditional distribution over actions. ACT लेखकांनी हे नाव fine manipulation मध्ये obstacles list करताना - errors compound होता वेळ, आणि human demonstrations हो-stationary. त्यांचे system अजून reach करते 80 to 90 टक्के यश सहा real tasks वर ten minutes demonstrations पासून, तर समस्या tractable आहे, absent नाही.

robomimic अध्ययन बनवते बिंदु डेटा side पासून. सहा offline algorithms अधिक पाँच simulated आणि तीन real-world multi-stage tasks, त्याचे lessons design choices मध्ये संवेदनशीलता समाविष्ट करतात, demonstration गुणवत्ता वर dependence, आणि - आहे hurt सर्वाधिक येथे - stopping criteria पासून variability, कारण प्रशिक्षण आणि मूल्यांकन objectives भिन्न. lowest loss checkpoint सह नाही reliably एक highest success rate.

हार्डवेअर संस्करण आहे: input mode सुधार आकार. leader-follower setup उत्पादन करते continuous, human-paced trajectories. कीबोर्ड nudges clamped hard द्वारा सर्वर - arm joints वर दोन degrees प्रत्येक call, gripper वर चार - तर समान intent आते steps चा एक staircase. sliders भेजते absolute targets आणि सर्वर moves अधिकतम सहा degrees उपांत्य प्रत्येक call. तीन modes, तीन action distributions; mixing सर्व तीन एक सुधार set मध्ये आणि मग विचार करण्यात approach वर twitchy आहे self-inflicted. the टेलीऑपरेशन प्रलेखन कव्हर करतो काय प्रत्येक mode भेजते.

वजन interventions: IWR आणि काय त्यानंतर आला

जर सुधार valuable अल्पसंख्य आहे, principled fix आहे weight exclusive नाही. Intervention Weighted Regression reference implementation आहे: डेटा partitioned होता intervention आणि non-intervention samples मध्ये, आणि दोन partitions sampled होता equal proportion प्रशिक्षण दरम्यान. एक सुधार set आहे पाँच टक्के frames चा फक्त contribute करता अर्ध gradient, nominal वर्तन vanishing ऐवजी distribution पासून.

समान proportion एक starting point आहे, law नाही. Sirius generalizes करते binary partition replacing continuous weight द्वारा approximated मानवी विश्वासापासून; Sirius-Fleet moves निर्णय upstream, visual world model आणि anomaly predictors वापरून decide करण्यासाठी जेव्हा मानवी asked होता अजिबात. common thread: intervention flag एक training signal आहे, फक्त bookkeeping column नाही.

Methodको निर्णय जेव्हा मानवी actsकसे intervention डेटा used होताReported result
DAgger (2011)Fixed schedule; expert labels visited statesएक growing dataset, unweightedFramed reduction म्हणून no-regret online learning मध्ये
HG-DAgger (2019)मानवी, gating नियंत्रण real system वरaggregated; plus एक learned safety threshold model uncertainty वरBetter DAgger आणि BC ड्रायव्हिंग मध्ये; intervention counts दिलेले नाही
IWR (2020)मानवी, via remote टेलीऑपरेशनIntervention आणि non-intervention samples drawn equal proportion मध्येBeats non-interventional demos equal sample count वर
Sirius (2022)मानवी, deployment दरम्यानWeighted BC, weights approximated मानवी विश्वासापासून8 % gain simulation मध्ये, 27 % real hardware वर; 2x faster convergence
ThriftyDAgger (2021)system, gating novelty आणि risk वरInteractive collection supervision budget अंतर्गतuser study (N=10): 58 % higher मानवी आणि 80 % higher robot performance next best method पेक्षा
Fleet-DAgger (2022)system, allocating attention fleet वरFleet learning scored Return on Human Effort द्वाराup to 8.8x higher ROHE baselines पेक्षा
Sirius-Fleet (2024)anomaly predictors self-adapting criteria सहMulti-task learning visual world model सहअधिक कमी हस्तक्षेप request autonomy सुधारते म्हणून
Leaderboard view comparing robot policies measured score द्वारे
Ranking policies विरुद्ध एकमेकांच्या अर्थपूर्ण करतात फक्त जेव्हा प्रत्येक entry समान protocol चलवला. ते तुमच्या तीन फेरी साठी देखील applies.

चार metrics लॉग करण्यास योग्य दर पुढे

  • takeovers per run. Twenty short सुधार आणि एक long एक दिते समान दर आणि describe भिन्न policies - एक jittery, एक single blind spot सह.
  • mean intervention length. Rising length falling count द्वारा साथ म्हणजे remaining failures hard ones आहेत, कोण आहे काय late progress दिसते.
  • time to first intervention. policy जे get further आधी needing मदत आहे improving अगदी तर total दर समतल होता.
  • जेथे interventions cluster. bin flag normalized episode progress द्वारा; एक stable peak फेरी वर एक bottleneck point करतात.

एक फेरी protocol तुम्ही खरोखर चलवू शकता

measured फेरी आहे सहा steps आणि produce करतो एक log मध्ये row. पहिले चार आहे लूप; last दोन बनवितो हे measurement.

  1. 1
    फ्रोज evaluation protocol फेरी शून्य आधी

    लिहा सुरु pose, वस्तू placement, कॅमेरे, trial count, timeout आणि success criterion. table photograph करा. जर दस्तऐवज बदलायला आहे, series restarts.

  2. 2
    baseline मापा

    protocol चलवा कोई हस्तक्षेप नाही आणि record successes; तर run एक instrumented सेशन takeover सक्षम आणि record दर. दोन numbers आहे फेरी शून्य.

  3. 3
    सुधार गोळा करा एक consistent शैली मध्ये

    एक input mode per फेरी, एक ऑपरेटर जर तुम्ही चलवू शकता. take over criterion वर तुम्ही state आहे बाहेर मोठा - 'gripper चेहरा दोन centimetres approach वर off' - आणि hold ते फेरीसाठी.

  4. 4
    triage प्रत्येक episode समान दिन

    सुधार, मूल्यांकन किंवा discard. ambiguous episodes discarded होता, saved theory कि अधिक डेटा मदत - एक सुधार जेथे तुम्ही fumbled नाही episode पेक्षा वाईट.

  5. 5
    compose mixture explicit मध्ये

    original demonstrations plus सुधार set, episode selection per source. record base count, सुधार count आणि कोई weighting - हे field तुम्ही चाहिल तीन आठवडे.

  6. 6
    continue checkpoint पासून, तर re-measure

    practice composed डेटासेट previous checkpoint पासून base model ऐवजी, चलवा frozen protocol plus एक instrumented session, append row, आणि compare विरुद्ध previous दोन फेरी.

दोन limit कसे बदलवा तुम्ही read एक weak फेरी. continuing एक checkpoint initialises weights त्यापासून - नाही optimizer resume, तर schedule start fresh आणि एक short run converged checkpoint पासून move very little. आणि leader-align motion सुरु takeover साठी आहे least mileage real hardware चा सर्वकाठी chain; जर सुधार सर्व start odd transient, look तेथे mixture blaming आधी.

measured लूप, पहिले wired up

ay-robots implement करते six steps product features म्हणून: take over mid-run एक leader arm पासून, कीबोर्ड किंवा sliders, intervention frames flagged automatic; triage प्रत्येक episode सुधार, मूल्यांकन किंवा discard; compose पुढचा dataset original demonstrations plus सुधार पासून, episode selection explicit per source; आणि start पुढचा training run previous checkpoint पासून base model ऐवजी.

पहा कसे DAgger लूप काम करते

काय numbers तुम्हाला सांगू शकत नाहीत

काहीही यात solved नाही, आणि एक tidy वक्र तुम्हाला persuade करू नये अन्यथा. intervention दर joint system मापते - policy, hardware, ऑपरेटर, कमरा - आणि attributes nothing अन्यथा. हे judge करू शकत नाही सुधार चांगले होते, आणि हे fall खुशीने एक कार्य जे सहज बनले कारण वस्तू ड्रिफ्ट तीन weeks मध्ये centimetres closer.

काय हे करते आहे turn एक vague impression एक column आहे तुम्ही argue करू शकत. alternative नाही एक better metric; हे तीन आठवडे collecting सुधार वक्र होता सांगत तुम्हाला, फेरी तीन नंतर, stop collecting. survey literature define करते interactive imitation learning म्हणून human feedback given intermittently robot execution दरम्यान, allowing एक online सुधार behaviour; family चा wide आहे, आणि कोई arrangement काम करत नाही एक number प्रति फेरी शिवाय. पहा देखील SO-100 imitation learning guide base dataset साठी तुम्ही mix विरुद्ध, एक policy चलवणे inference side साठी, आणि DAgger लूप page implemented pipeline साठी.

हे intervention दर फक्त एक minus success दर आहे?

नाही. दर मापते किती रनचा तुम्ही took over; success दर मापते शिवाय task मिळाले नाही तुम्ही. एक run succeed करू शकते 30 टक्के intervention दर, आणि एक run कोई हस्तक्षेप शिवाय fail करू शकते पूर्ण. ते पण differ noise: दर move smoothly over thousands correlated frames, success दर jump thousands handful binary outcomes. दोन्ही लॉग करा.

किती मूल्यांकन trial मला चाहिल success दर अर्थपूर्ण साठी?

अधिक than feels reasonable. अंतर्गत normal approximation, 20 trial true 60 टक्के success दर वर carry एक std error जवळ 11 percentage points, तर एक 10-point movement फेरी शोर indistinguishable; 50 trial carry figure 7 roughly. तुम्ही 50 afford नाही, trial count identical hold फेरी आणि treat small movement inconclusive म्हणून.

कोई मिश्रण ratio demonstrations सुधार मी start करू शकतो?

documented starting point आहे IWR चे: partition डेटा intervention आणि non-intervention sample मध्ये आणि draw equal proportion मध्ये, तर सुधार contribute अर्ध gradient however small fraction frames आहे. तुमचे setup नाही weight sampling, approximate हे episode count वापरून dataset composing तर record दर. training corrections एकटे option आहे rule out.

माझे intervention दर गेला फेरी नंतर up. फेरी होता आधी?

जरूरी नाही, परंतु check बोरिंग explanation पहिले: करत checkpoint आहे तुम्ही drove match एक तुम्ही trained, करत कॅमेरा index किंवा mount बदलली, करत वस्तू placement drift, करत सुधार शैली consistent. जर चार clean आणि paired success दर पण पडली, suspect mixture - base demonstrations खूप कमी विरुद्ध सुधार, किंवा सुधार जे विरोधाभास. एक genuine regression belongs log मध्ये, bin नाही.

हे मी skip करू शकतो fixed evaluation protocol आणि फक्त watch intervention दर?

केवळ तुम्ही accept करू शकत नाहीत improvement habituation पासून सांगू शकत। दर depends तुमच्या real-time threshold stepping साठी, आणि threshold fall जसे तुम्ही get used policy quirks मध्ये. frozen protocol आहे measurement चा part तुमचा threshold करू शकत नाही पहुंच - taped चिन्हे, एक लिखित home pose, एक fixed trial count, एक criterion decided फेरी आधी. हे stay unchanged series पासून।

ठेवा लॉग repository मध्ये, notebook मध्ये नाही: फेरी days अलग आहेत, hardware gets रीबिल्ट, आणि व्यक्ती reading वक्र October मध्ये आहे तुम्ही कोही memory August साथ। the documentation FAQ कव्हर करतो operational विवरण left येथे बाहेर.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started