रोबॉट हाताळण्याच्या दृश्याचे सारांश रेंडरिंग, जे अंमलबजावणीदरम्यान शिकलेल्या policy चा state distribution दर्शवते
DAggerImitation LearningBehavior Cloningरोबॉट शिक्षणसिद्धांत

DAgger स्पष्ट केले: Behavior Cloning का विचलित होते आणि Dataset Aggregation वास्तविकपणे काय सिद्ध करते

AY-Robots ResearchAugust 27, 202615 मिनिट वाचन

Behavior cloning expert च्या state distribution वर policy फिट करते आणि नंतर स्वतःवर तैनात केले जाते. त्या दोन वितरणांमधील अंतर हेच कारण आहे की validation मध्ये ठीक दिसणारी policy step 300 वर टेबलवरून पडते. हा आमच्या DAgger मालिकेचा सिद्धांत अध्याय आहे: quadratic error term कुठून येत आहे, dataset aggregation काय बदलते, no-regret proof काय गृहीत धरते, आणि मानवी तज्ञाला अजूनही काय भरावे लागते याचे.

असा एक विशिष्ट अपयश आहे जो manipulation policy प्रशिक्षित करणार्‍या प्रत्येकाला लवकरच किंवा उशिरा मिळतो. policy cube ला हाताळते, दोन सेंटिमीटरच्या आतून येते, संकोचते, बाजूला विचलित होते, नंतर काहीतरी काम शी संबंधित नसलेले करते. Validation loss ठीक होते. Held-out episodes विरुद्ध open-loop replay ठीक होते. आणि तरीही arm असा pose मध्ये संपतो जो प्रशिक्षण डेटामध्ये कुठेही दिसत नाही, आणि तेथून त्याला बोलण्यासारखे काहीही नाही.

त्या अपयशाचे नाव आहे आणि त्याच्या पाठीमागे सिद्ध केलेला सिद्धांत आहे. हा DAgger वर चार लेख पैकी पहिला आहे DAgger, आणि तो तर्क स्वतः कव्हर करतो: demonstrator च्या स्वतःच्या trajectories वर policy फिट करणे अशी त्रुटी का तयार करते जी episode length च्या वर्गाने वाढू शकते, dataset aggregation काय बदलते, आणि no-regret proof काय वचन देत नाही. real hardware वर loop SO-100 वर DAgger loop चालवणे मध्ये कव्हर केले आहे, human-gated variant HG-DAgger आणि human-gated interventions मध्ये, आणि मापन प्रश्न DAgger loop मोजणे.

लघु आवृत्ती

  • Behavior cloning expert च्या state distribution वर प्रशिक्षण घेते आणि policy च्या स्वतःवर मूल्यांकन केले जाते. असमानता episode मध्ये संयुक्त होते.
  • Ross आणि Bagnell ने दर्शविले की अतिरिक्त खर्च T वर्गाने गुणा प्रति-step error ने वाढू शकतो; DAgger paper हा बाउंड पुन्हा सांगते आणि हे नोट करते की हे tight आहे.
  • DAgger labels policy स्वतः व्यक्त करते असे states, आणि केवळ newest नव्हे तर आता पर्यंत गोळा केलेल्या प्रत्येक dataset वर retrains करते.
  • गॅरंटी no-regret online learning मध्ये कपात करणे आहे: aggregating आणि retraining हे Follow-The-Leader आहे.
  • हे policy class मध्ये सर्वोत्तम नुकसान मिळवणार्‍या epsilon_N च्या सापेक्ष ठेवले जाते, शून्य च्या सापेक्ष नव्हे - आणि expert ला अजूनही असे states label करावे लागतात जे तो कधीही तयार केले नसते.

Behavior cloning गप्पा करते असे गृहीतक

एक demonstration dataset हा observation-action जोड्यांचा ढीग आहे. Behavior cloning सामान्य supervised learning सह त्या ढीगला कार्य फिट करते आणि तेथे थांबते. हे field मधील सर्वात जुना कल्पना आहे. Pomerleau ची ALVINN, 1988 मध्ये, तीन-स्तर back-propagation network होती जी camera आणि laser range finder कडून images घेते आणि vehicle ने प्रवास केला पाहिजे असा दिशा तयार करते; हे simulated road images वर प्रशिक्षित होते आणि काही field conditions अंतर्गत real roads अनुसरण करते. Recipe जवळजवळ बदलले नाही; networks बदलले आहेत.

जे bypass केले जाते ते हे check आहे की ते जोड्या कुठून आली आहेत. त्यांच्या प्रत्येकजण demonstrator तयार केलेल्या trajectory वर आहेत. Policy तुम्ही तैनात केली ती स्वतःची तयार करते. तो क्षण ते विचलित होतो, तो states बद्दल queried होतो जे training distribution मध्ये नव्हते, आणि त्याचे उत्तर तो अधिक बाहेर हलवते. Ross, Gordon आणि Bagnell DAgger paper सह तशाच open करतात: sequential prediction i.i.d. assumption अंतर्गत statistical learning उल्लंघन करते, कारण learner च्या स्वतःच्या predictions असे inputs निर्धारित करतात जे तो पुढे पाहतो.

त्या paper मधील सर्वात स्पष्ट illustration robot च्या सर्वात अदूर नाही. Super Mario Bros. साठी near-optimal planner clone करणे असे policy तयार केले जे repeatedly कोणत्याही अडथळ्याच्या विरुद्ध अडकले ऐवजी तो उडी मारला. कारण हा संपूर्ण तर्क एका वाक्यात आहे: expert नेहमी comfortable distance कडून उडी मारला, म्हणून dataset मध्ये Mario अडथळ्याविरुद्ध प्रेस अप असा कोणताही state नव्हता, आणि म्हणून जेव्हा तो अडथळ्याविरुद्ध प्रेस होता तेव्हा काय करायचे याचा label नव्हता.

Mario साठी SO-100 आर्म swap करा आणि structure identical आहे. तुमचे demonstrations clean approach आणि clean grasp दर्शवतात, gripper closing two centimetres short नव्हे - म्हणून policy कडे तेथून काय करायचे याचे कल्पनाही नाही, आणि जे कोणते guess करतो ते त्याला अधिक बाहेर नेते. Covariate shift डेटा संग्रह प्रक्रिया ची property आहे, network architecture ची नव्हे.

Quadratic term कुठून येत आहे

2010 AISTATS paper Ross आणि Bagnell ने, Efficient Reductions for Imitation Learning, compounding precise बनवते. T हा task horizon असो, task cost unit interval मध्ये bounded असो, आणि epsilon हा surrogate loss measured under expert च्या state distribution - validation set ने रिपोर्ट केलेली संख्या. नंतर उस policy साठी T steps साठी चालवण्याचा अतिरिक्त खर्च, expert च्या सापेक्ष, T वर्गाने गुणा epsilon ने bounded आहे. Ross, Gordon आणि Bagnell हे DAgger paper मध्ये Theorem 2.1 म्हणून पुन्हा सांगतात आणि महत्त्वाचे वाक्य जोडतात: bound tight आहे. Problems अस्तित्वात आहेत जेथे policy epsilon loss expert च्या distribution वर वास्तविकपणे T मध्ये quadratically growing अतिरिक्त खर्च incur करतो.

Tight याचा अर्थ typical नव्हे. Quadratic term worst case over problem class आहे, तुमच्या pick-and-place task बद्दल prediction नव्हे. काय establish होत आहे ते हे आहे की अधिक expert demonstration problem दूर केू शकत नाही: हे epsilon estimate sharpen करते केवळ distribution वर जेथे policy test केले जाणार नाही.

Escape route आहे same paper मध्ये, Theorem 2.2 म्हणून restated. जर policy epsilon loss achieve करतो स्वतःच्या state distribution अंतर्गत, आणि एक चुकीचे action maximum u cost-to-go मध्ये expert अंतर्गत costs करते, अतिरिक्त खर्च u वेळा T वेळा epsilon ने bounded आहे - horizon मध्ये linear. Constant u interesting quantity आहे: maximum 1 expert सह 0-1 disagreement साठी, आणि O(1) जेव्हा expert काही steps मध्ये recover करू शकतो. Worst case मध्ये हे O(T) आहे, आणि linear bound तेव्हा quadratic एक पेक्षा चांगला नव्हे.

SettingExpert वर अतिरिक्त खर्च वर Boundकाय यावर rest करते
Behavior cloning (Ross & Bagnell 2010, Thm. 2.1 म्हणून restated Ross et al. 2011 मध्ये)T वर्ग गुणा epsilonepsilon expert च्या state distribution वर measured; cost [0,1] मध्ये; bound tight आहे
कोणतीही policy epsilon loss सह स्वतःच्या distribution अंतर्गत (Thm. 2.2)u वेळा T वेळा epsilonu एक चुकीचे action च्या cost-to-go penalty bounds; maximum 1 0-1 loss साठी, O(T) worst case
Forward training (Ross & Bagnell 2010)u वेळा T वेळा epsilonएक policy प्रत्येक timestep साठी; T policies चाहिज आणि known, finite T
SMILe (Ross & Bagnell 2010)T आणि epsilon वर काहीसे problem classes वर near-linearalpha O(1/T वर्ग) मध्ये, N O(T वर्ग log T) मध्ये; stochastic mixture yield करते
DAgger (Thm. 3.2, Ross et al. 2011)u वेळा T वेळा epsilon_N, plus O(1)N uT च्या order वर; strongly convex bounded loss; no-regret learner; epsilon_N hindsight मध्ये सर्वोत्तम loss आहे
Robot workspace representing states policy visits जे कधीही demonstration set मध्ये appear झाले नाहीत
DAgger round साठी महत्त्वाचे states असे आहेत जे कोणीही demonstrate केले नाहीत: near-miss grasp, half-open gripper, arm object past.

DAgger आधी दोन प्रयत्न

Forward training हे honest पण impractical उत्तर आहे. प्रत्येक timestep साठी वेगळी policy train करा, order मध्ये, प्रत्येक state distribution induced वर पहिल्या steps साठी पहिल्या fixed policies साठी, म्हणून प्रत्येक policy तशाच distribution पाहतो जो तो face करेल. Catch वर्णनात आहे: T policies, sequentially trained, no early stopping. Manipulation episode साठी 30 frames प्रति second वर, T hundreds मध्ये आहे.

SMILe, same paper कडून, आणि SEARN, Daume, Langford आणि Marcu च्या structured prediction वर काम कडून, दुसरा route घेतात: एक stationary policy, पण stochastic. प्रत्येक iteration component train करते आणि mixture मध्ये जोडते, probability mass expert कडून दूर shifting. Result हे mixture आहे जेथे काहीसे components दुसर्‍यांपेक्षा वाईट आहेत - physical arm वर, controller असे bad component mid-motion sample करू शकतो. यहच stated motivation आहे stationary deterministic policy साठी instead चाहणार्‍या.

DAgger: एक idea, एक box

Dataset Aggregation deterministic policy राखते आणि fix data collection मध्ये हलवते. प्रत्येक round: current policy roll out करा, states तो visits record करा, expert ला प्रश्न करा काय सही action असते प्रत्येक मध्ये, ते जोड्या तुम्ही आधी आहे असे dataset मध्ये जोडा, union वर retrain करा. नाव algorithm आहे - तुम्ही aggregate करता, तुम्ही कधीही discard करत नाही.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger meta-algorithm, Algorithm 3.1 Ross, Gordon & Bagnell (2011).

तीन details जास्त weight carry करतात ते दिसते. Labels असे states साठी आहेत visited mixed policy ने, पण actions expert कडून येतात - policy प्रश्न provide करते, expert उत्तर provide करते. Retraining पूर्ण aggregate वर आहे, जे प्रत्येक round Follow-The-Leader step बनवते: round n वर तुम्ही सर्वोत्तम policy pick करता hindsight मध्ये सर्व trajectory वर आता तक. That framing proof पर हँग करते. आणि algorithm end करते returning सर्वोत्तम policy sequence मध्ये chosen validation set वर, कारण theorems guarantee करतात काहीसे policy sequence मध्ये good आहे, अंतिम आहे असे नव्हे.

Beta schedule, आणि हे tuning knob का नव्हे

Mixed policy beta_i वेळा expert plus एक minus beta_i वेळा learner आहे. Point practical आहे: प्रथम काहीसे learned policies प्रशिक्षित होतात अत्यंत कमी डेटा वर, अनेक गुळप करतात, आणि अन्यथा rollout मध्ये states spend करतील जे irrelevant बन जातात एकदा policy improves.

Theory तशाच एक condition impose करते: betas चा running average zero मध्ये जायला हवा. Analysis beta_i bounded सह काम करते (1 - alpha) वर power i-1, constant alpha साठी independent T च्या.

Scheduleकाय करतेPaper काय reports
beta_1 = 1पहिला round शुद्ध expert demonstration आहे; no initial policy चाहिजRecommended starting point प्रत्येक variant मध्ये
beta_i = 1 जर i = 1, अन्यथा 0Expert केवळ round एक मध्ये; no free parameterPaper च्या parameter-free version, जे असे म्हणते करते अनेकदा सर्वोत्तम perform practice मध्ये; 2980 Super Mario Bros. वर 20 iterations नंतर
beta_i = p^(i-1) p = 0.5 सहExpert probability geometrically decays3030 same benchmark वर, slightly ahead parameter-free version च्या
beta_i = p^(i-1) p = 0.9 सहExpert loop मध्ये खूप दूर staysMarkedly slower convergence; 20 iterations end झाल्यावर अजूनही improving

2980 आणि 3030 मधील gap अंदाज 4300 वर चालणार्‍या scale वर छोटा आहे, पण paper च्या याचे explanation सर्वोत्तम practical note section मध्ये आहे. Parameter-free schedule सह, Mario सुरुवातीच same spot मध्ये stuck झाला आणि त्या एक location कडून near-duplicate डेटा mass generate केला; expert drive fraction वेळा दोन्ही unstuck तरी आणि states variety widened. Schedule control ratio मधील mixing पेक्षा कमी महत्त्वाचा आहे ते आहे असे तुमचे डेटा collection keeps producing नव्यान states किंवा same failure.

Schedule physical arm वर transfer का नव्हे so written

Stochastic per-timestep mixture याचा अर्थ control authority switching control rate वर, 30 वेळा per second typical SO-100 setup वर. No teleoperation interface सुरक्षित किंवा meaningful तयार करते. Real hardware वर beta schedule मानवी decision give way when takeover करायचे: वेगळे algorithm वेगळे analysis सह.

Guarantee: no-regret online learning मध्ये कपात

येथे move हे आहे जे paper बनवते काय तो आहे. प्रत्येक DAgger round online learning problem मध्ये एक उदाहरण treat करा, जेथे loss round i वर surrogate loss under state distribution policy round i वर used. Learner policy commit करते loss पाहण्यापूर्वी, आणि sequence non-stationary आहे कारण policies produced depends आता तक.

Algorithm no-regret असे आहे जर average loss N rounds वर सर्वोत्तम एक policy hindsight मध्ये approach करते. Follow-The-Leader strongly convex losses वर असे algorithm आहे, average regret shrinking 1/N order वर - आणि retraining पूर्ण aggregate वर तशाच Follow-The-Leader आहे. कोणतीही अन्य no-regret learner would serve: analysis reduction, एक optimizer property नव्हे.

एक lemma gap bridge करते mixed policy आणि learned policy deploy केला जाणार दरम्यान: Lemma 4.1 L1 distance bound करते state distributions 2 T beta_i ने. यही कारण betas decay आवश्यक आहे - जेव्हा expert अजूनही appreciable control authority hold करतो, states तुम्ही collect करता नाहीत states तुमचे policy produce करेल. Lemma combine करा regret bound सह आणि main result follow: साडेतीस T iterations नंतर, काहीसे policy sequence मध्ये surrogate loss under स्वतःच्या distribution मध्ये O(1/T) epsilon_N च्या. Feed linear bound आणि land Theorem 3.2.

Empirical side modest current standards ने. Super Tux Kart मध्ये supervised baseline improve नव्हे average falls per lap अधिक डेटा आला, DAgger reach करतो policy कधीही fell off track नंतर 15 iterations, आणि SMILe 20 नंतर अजूनही fell अंदाज twice per lap. Handwriting benchmark वर, character accuracy 82 percent run केली structure शिवाय, 83.6 percent supervised, 85.5 percent DAgger सह. हेतुही कोणते manipulation result नाही.

Proof काय वचन नव्हे

Theorem statements conditional आहेत, आणि conditions load-bearing आहेत.

DAgger guarantee, जवळ read केले
काय आपल्या देते
  • T मध्ये linear bound quadratic पेक्षा, stated assumptions अंतर्गत.
  • Stationary deterministic policy stochastic mixture पेक्षा.
  • Genuine reduction: कोणतीही no-regret online learner slots.
  • Concrete iteration count - साडेतीस T rounds regret term stop mattering.
  • Guarantee कम्मीसे एक policy sequence मध्ये, म्हणून closing validation pass.
काय आपल्या नव्हे देते
  • हे epsilon_N च्या सापेक्ष आहे, सर्वोत्तम loss class मध्ये hindsight, शून्य नव्हे. जर तुमचा class expert represent करू शकत नाही, हे practice खाली empty आहे.
  • हे no-regret method किंवा strongly convex surrogate loss चाहिज - classification reductions stronger जेथे builds on, authors note.
  • Constant u O(T) असू शकते worst case मध्ये, आणि linear bound तेव्हा collapses quadratic परत.
  • हे bounds iterations, expert labels नव्हे. Robot वर, labels budget आहेत.
  • हे assume करते expert queried असू शकते visited state प्रत्येक आणि correctly उत्तर देते तेथे. That assumption संपूर्ण cost आहे.

एक further result अनेकदा quoted refutation म्हणून आणि one नव्हे. Rajaraman, Yang, Jiao आणि Ramachandran imitation learning मधील minimax limits study करतात episodic MDPs मध्ये finite state space S आणि horizon H, आणि prove suboptimality lower bound order |S| H वर्ग N वर जे hold करते active expert query करू शकते even visited states वर. That worst-case rate over MDPs class fixed episode budget वर, आणि काय rules out हे idea आहे interaction minimax rate improve करते; DAgger च्या theorem different statement आहे, deployed policy bound करते relati what policy class achieve करू शकते.

Swamy, Choudhury, Bagnell आणि Wu later classified ये algorithms by moments expert च्या behavior match करतात, आणि introduce moment recoverability notion delineates कसे well प्रत्येक family mitigates compounding error. Surveys Osa आणि Celemin से cover algorithmic landscape आणि human-feedback interfaces.

Bill: expert कधीही produce नव्हे असे states labelling

सर्व वर assume करते expert queried असू शकते anywhere. Simulation मध्ये planner सह nearly free - Mario experiments use केली near-optimal planner full access सह game state. Human robot वर ते dominant cost, आणि peculiar one: human produce करायला हवे सही action configuration वर जेथे स्वतःची competence कधीही create नव्हे केले असते.

Kelly, Sidrane, Driggs-Campbell आणि Kochenderfer state objection directly HG-DAgger paper मध्ये. Vanilla DAgger require करते expert supply करायला action labels simultaneously not being fully system मध्ये. यह reduce करते safety, आणि human experts सह degrade likely labels collected quality, attributed perceived actuator lag. Label तुम्ही back मिळता नाही label algorithm assume केली.

Laskey आणि colleagues problem other side कडून attack करतात DART सह, आणि framing direct आहे: on-policy techniques tedious human supervisors साठी, add computational burden, आणि may visit dangerous states training मध्ये. Alternative inject करते calibrated noise supervisor च्या demonstrate demonstrations मध्ये, recovery demonstrate gets without robot untrusted policy कधीही run. MuJoCo Humanoid वर report करतात DART decrease supervisor च्या cumulative reward 5 percent training मध्ये, जेव्हा DAgger execute policies 80 percent less cumulative reward supervisor पेक्षा; grasping clutter मध्ये Toyota HSR सह, average 62 percent increase over behavior cloning.

Zhang आणि Cho साठी SafeDAgger treat queries reference policy scarce resource: separate safety policy predict करते, without querying, primary policy deviation reference पेक्षा threshold ने, आणि केवळ states handed over. तीन react same fact - DAgger analysis charge नव्हे expert labels, आणि reality charge बरीच.

Part कोणीही warn नव्हे आपल्या बद्दल

Off-distribution states labelling mentally harder demonstrate करत कार्य. Normal demonstration मानते execute motor plan तुमच्या पास already. Correcting policy placed gripper somewhere never would means construct recovery spot, under time pressure, robot अजूनही moving. Expect fewer usable minutes per session than plain recording session, आणि watch स्वतःचे correction quality decay course एक.

LeRobot dataset structure showing episodes, frames आणि per-frame columns stored disk वर
Corrections become dataset केवळ एकदा intervention frames mark केले - LeRobot format मध्ये, per-frame column alongside observation आणि action.

काय याचा अर्थ SO-100 वर तुमच्या desk वर

Horizon translate तुमच्या स्वतःच्या units मध्ये. 20-second episode 30 frames per second वर आहे 600 decision steps, आणि T सर्व bounds वर ते number आहे. T = 600 वर, difference term scaling T आणि scaling T वर्ग मध्ये difference policy recover bad approach कडून आणि one does not.

यही part का action chunking helps: जेव्हा policy emit short sequence actions per inference step, decision points number drop, आणि compound chances भी. Zhao, Kumar, Levine आणि Finn name compounding error motivation Action Chunking Transformers साठी, आणि report 80 to 90 percent success six difficult real-world tasks, low-cost bimanual hardware वर, ten minutes demonstrations कडून. Chunking remove करत नाही covariate shift - states still policy स्वतःचे - पण effective horizon shorten. See action chunking आणि SO-100 imitation learning guide.

दुसरा translation progress metric आहे. तुम्ही measure नव्हे करू शकता epsilon policy च्या distribution वर directly - that needs ground-truth expert actions सर्व visited states साठी, thing तुम्ही avoid produce trying करत आहात. काय human-gated loop give करते तुम्ही instead आहे intervention rate: fraction frames run मध्ये जेव्हा human taken over. हे proxy आहे, आणि move करते reasons unrelated policy - patient operator intervene कमी. Used consistently, हे one number आहे says whether round afternoon worth होते.

तीसरा translation data-quality warning analysis cover नव्हे आहे. Mandlekar आणि colleagues six offline learning algorithms study करतात five simulated आणि three real-world multi-stage manipulation tasks वर, आणि report sensitivity algorithmic design choices, dependence demonstration quality वर, आणि variability caused stopping criterion. Belkhale, Cui आणि Sadigh argue dataset quality formalized आवश्यक action divergence आणि transition diversity via, आणि note state diversity always beneficial नव्हे आहे. DAgger round add states कोणीही deliberately chose नाहीत: काहीसे recovery डेटा आहेत तुम्ही चाहिज, काहीसे robot flailing जेव्हा fumble takeover control साठी.

Mechanically round छः steps आहे: inference run recording सह, take over जेव्हा policy misbehave, review run आणि file episode, sync corrections, compose mixed dataset originals आणि corrections episode selection बनवा साथ explicitly per source, आणि continue training former checkpoint instead base model च्या. Ay-robots वर ये steps exist buttons म्हणून, remove करते plumbing पण नव्हे judgment. दोन caveats: continuing checkpoint initialize weights आणि आहे नव्हे optimizer resume, आणि leader-arm alignment move still lightly tested hardware वर. See training आणि datasets.

DAgger loop, already wired up

Takeover live inference run मध्ये, per-frame intervention marking, file episodes corrections किंवा evaluations म्हणून, compose mixed dataset explicit episode selection per source, आणि continue training existing checkpoint कडून सर्व built in आहेत. तुम्ही अजूनही decide जेव्हा take over आणि काय keep - that part automate नव्हे.

See कसे DAgger loop works

Family tree, one table मध्ये

MethodWho choose statesExpert काय supplyMain cost
Behavior cloningExpertClean demonstrationsNo recovery डेटा; error compound quadratically T मध्ये शकते
Forward trainingLearner, per timestepLabels along induced distributionT separate policies; unusable long horizons साठी
SMILe / SEARNStochastic mixture expert आणि learnerLabels along mixture distributionComponents mixture differ quality मध्ये
DAggerMixed policy, beta decay zero साठीसही action सर्व visited states साठीLabelling states expert would never produce, while not control मध्ये
DARTExpert, perturbed injected noise नेDemonstrations अंतर्गत calibrated noiseNoise calibrated होता आवश्यक learner च्या error
HG-DAggerLearner, जब तक human take overCorrections केवळ human-gated segments मध्येDepends human judgment when intervene वर
SafeDAggerLearner, filtered safety gate नेLabels केवळ जेव्हा gate ask करतेGate स्वतः trained आणि trusted आवश्यक

Frequently asked प्रश्न

मी actually observe करेन quadratic error growth my robot वर?

Clean curve नव्हे. Bound worst case: tight in some problem attain करतो, नव्हे yours. काय तुम्ही see consequence आहे - policy score करते held-out frames वर सुंदरपणे, fail real task वर, आणि improve नव्हे जेव्हा record same अधिक. जर अधिक clean डेटा stop helping, असे covariate shift, data-volume problem नव्हे.

मी implement करायला हवे beta mixture DAgger call करायला?

Parameter-free version - expert round एक मध्ये, pure learner afterwards - legitimate special case आहे आणि अनेकदा best perform original experiments मध्ये. काय तुम्ही नव्हे drop शकता हे aggregation आहे: retrain केवळ newest corrections वर break Follow-The-Leader interpretation, जेथे no-regret argument आता आहे. Training corrections केवळ वर much weaker procedure आहे.

का return करा सर्वोत्तम policy validation set वर instead last एक?

कारण theorems guarantee good policy exists somewhere sequence मध्ये, नव्हे final iterate - bound minimum over sequence वर आहे. Ship जे आला last round कडून discard stated condition result, आणि last round reliable नव्हे सर्वोत्तम.

किती rounds plan करावे?

Theory want iterations order T, जे 600-step episode साठी आहे नव्हे नंबर कोणीही runs hardware वर. Original experiments run 20 iterations सर्व benchmark वर. Practice मध्ये तुम्ही run rounds जब तक intervention rate stop falling, far below count analysis assume - real gap theory आणि practice मध्ये.

काय जर my policy class केवळ represent नव्हे शकते expert?

तेव्हा DAgger save नव्हे आपल्या, आणि bound say - हे express epsilon_N सापेक्ष, सर्वोत्तम loss class मध्ये hindsight. जर large आहे कारण wrong architecture, missing observation किंवा camera नव्हे शकते see scene, aggregation give optimal policy class मध्ये नव्हे शकते task. Run open-loop replay against held-out episodes corrections collect करण्यापूर्वी.

जेथे जा येथे

जर तुम्ही अजूनही train policy नव्हे, यह theory premature: record dataset first, starting training आपल्या first policy आणि desktop client. जर तुम्ही weighing अन्य hundred clean demonstrations against starting corrections: clean demonstrations fix नव्हे distribution problem. Mechanics साठी, continue human-gated variant आणि नंतर SO-100 walkthrough.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started