
சாধாரண DAgger ரோபோ இன்னும் ஓடிக்கொண்டிருக்கும் போது ஒரு நபரை நிலைகளைப் பெயரிடச் சொல்கிறது. உண்மையான வன்பொருளில் இது பாதுரக்ஷணமற்றது மற்றும் மோசமான பெயரிடுதலை உருவாக்குகிறது. கேட்ட பதிப்புகள் பின்னணி பெயரிடலை ஒரு கேட்டால் மாற்றுகின்றன, அதை யாரோ பிடிக்க வேண்டும்: HG-DAggerஇல் மனிதன், SafeDAggerஇல் ஒரு பாதுகாப்பு வகைப்படுத்தி, EnsembleDAggerஇல் ஒரு கூட்டத்தின் கருத்து வேறுபாடு, ThriftyDAggerஇல் ஒரு பட்ஜெட் செய்யப்பட்ட புதியது மற்றும் ঝுக்கம் மதிப்பீடு. இந்தக் கட்டுரை யார் கேட்டை சொந்தமாக வைத்திருக்கிறது, என்ன சமிக்ஞை அதை திறக்கிறது, மற்றும் ஒவ்வொன்று செலவு செய்யும் - மற்றும் ஏன் மனிত-கேட்ட வடிவம் உண்மையான கையுடன் தொடர்பு வைத்துக் கொள்ளும் ஒன்று.
একটি ক্লোন নীতি যেখানে তার প্রশিক্ষণ তথ্য দৌড়িয়েছে সেখানে ব্যর্থ হয়। মেরামত প্রদর্শনকারীর পরিবর্তে নীতির নিজের অবস্থা বিতরণের অধীনে তথ্য সংগ্রহ করতে রাখছে, যা DAgger করে এবং কি ডেটাসেট সমন্বয়ের প্রবর্তন প্রথম নীতি থেকে কভার করে। এটি মূল অ্যালগরিদমের বিশ্রাম অংশটি খোলা রেখে যায়: শিক্ষাবিদ চালিত হওয়ার সময়, বিশেষজ্ঞ কি তারা করেছেন বলতে সন্নিবেশিত হয়, প্রতিটি রাজ্যের জন্য, নিয়ন্ত্রণে না থাকলে।
একটি সিমুলেটরে একটি স্ক্রিপ্ট করা বিশেষজ্ঞ সঙ্গে যা বিনামূল্যে। এটা যে একটি টেবিলে একটি বাস্তব হাতকে না বিনামূল্যে বা নিরাপদ। HG-DAgger লেখকরা আপত্তি সুনির্দিষ্টভাবে বিবৃতি: যেমন নমুনা স্কিম "বিশেষজ্ঞদের সিস্টেম সম্পূর্ণ নিয়ন্ত্রণে ছাড়াই অ্যাকশন লেবেল প্রদান করতে প্রয়োজন", যা "নিরাপত্তা হ্রাস করতে পারে এবং, মানুষ হিসাবে বিশেষজ্ঞ ব্যবহার করার সময়, মনে করা অ্যাকচুয়েটর বিলম্বের কারণে সংগৃহীত লেবেলগুলির গুণমান হ্রাস করতে সম্ভবত" (কেলি এট আল।, 2019)। দুটি ব্যর্থতা সেই বাক্যে লুকানো: নীতি চালিত হতে থাকে যেখানে কেউ এটি চায় না, এবং সেই ঝুঁকির সঙ্গে ক্রয় করা লেবেলগুলি একটি মানুষের চেয়ে খারাপ যা নিয়ন্ত্রণ ধরে রেখে উত্পাদিত। নিম্নোক্ত প্রতিটি বৈকল্পিক একই প্রশ্নের উত্তর - নিয়ন্ত্রণে একটি গেট রাখুন এবং যখন এটি খোলে তা সিদ্ধান্ত নেওয়ার অনুমতি দিন। তারা যারা সেই কেউ তা আলাদা করে।
সংক্ষিপ্ত সংস্করণ
- •গেট সংস্করণগুলি পিছনে নীতি নিয়ন্ত্রণ এবং বিশেষজ্ঞ নিয়ন্ত্রণের মধ্যে একটি সুইচ সঙ্গে অন্ধ পরিবর্তন প্রতিস্থাপন। কি তাদের আলাদা করে সে সুইচ মালিক।
- •HG-DAgger মানুষ সুইচ দেয় এবং শুধুমাত্র তথ্য aggregates মানুষ ঐতিহ্যহীন নিয়ন্ত্রণ ছিল যখন রেকর্ড করা হয়েছে।
- •SafeDAgger একটি বাইনারি শ্রেণীকরণকারীকে দেয় যা একটি রেফারেন্স নীতি থেকে বিচলন পূর্বাভাস দেয়; EnsembleDAgger কম সমষ্টি পার্থক্য এবং একই সময়ে বিশেষজ্ঞ অ্যাকশন জন্য ছোট দূরত্ব প্রয়োজন।
- •LazyDAgger নিয়ন্ত্রণ ping-pong না করা hysteresis যোগ করে; ThriftyDAgger ঘটনা বা একটি স্পষ্ট হস্তক্ষেপ বাজেট অধীন অনুমান ঝুঁকি উপর গেট।
- •রোবট-গেট সংকেত কিছু প্রয়োজন যা সূক্ষ্ম-tuned VLA একটি শখ-শ্রেণী বাহুতে সাধারণত অভাব: একটি রেফারেন্স নীতি, একটি সস্তা সমষ্টি, বা যাঁচাই করা বোধগম্য অনিশ্চয়তা।
- •গেট অর্ধেক পদ্ধতি। পরে হস্তক্ষেপ সেগমেন্ট কি - মিশ্রণ, ওজন, একত্রিত - সিদ্ধান্ত দেয় রাউন্ড উন্নত কিছু।
মনুষ্য-গেটড এবং রোবট-গেটড: বিভাজন যে গুরুত্ব পায়
ইন্টারঅ্যাক্টিভ অনুকরণ শেখা তার নিজের জরিপ আছে; Celemin এবং সহকর্মীরা প্রতিক্রিয়া প্রকার, ইন্টারফেস, শেখা মডেল, ব্যবহারকারী অভিজ্ঞতা, আবেদন এবং benchmark সঙ্গে এটি ক্যাটালগ করুন। বিভাজন যা আপনার প্রকৌশল সিদ্ধান্ত সেই axes যেকোনো সহজ এবং সাম্প্রতিক কাজ নাম এটি সরাসরি: একটি পদ্ধতি মনুষ্য-গেটড যখন তত্ত্বাবধানকারী হস্তক্ষেপ সময় সিদ্ধান্ত, এবং রোবট-গেটড যখন এজেন্ট সাহায্যের জন্য জিজ্ঞাসা সময় সিদ্ধান্ত (Cai এবং অন্যরা, 2025)। সবকিছু অন্যথায় যন্ত্র সেই দুটি পছন্দের মধ্যে একটি পরিবেশন করছে। বাণিজ্য শুরু থেকে দৃশ্যমান: একটি মানুষ গেট ক্রমাগত মনোযোগ খরচ, এবং একটি রোবট গেট মনোযোগ ফিরিয়ে দিতে প্রতিশ্রুতি - কিন্তু শুধুমাত্র যদি সঙ্গে গেট সঙ্গে সংকেত বিশ্বাসযোগ্য, এবং যে সঙ্গত তৈরি তার নিজের গবেষণা সমস্যা।
SafeDAgger: একটি শ্রেণীকরণকারী যা তার নিজের বিচলন পূর্বাভাস
Zhang এবং Cho এর SafeDAgger (2016) এই গেট সবচেয়ে আগাম। রেফারেন্স নীতি জিজ্ঞাসা ব্যয়বহুল অংশ, তাই একটি দ্বিতীয়, ছোট নেটওয়ার্ক - নিরাপত্তা নীতি - ভবিষ্যদ্বাণী করে জিজ্ঞাসা করা মূল্যবান কিনা সব একেবারে। এটি "একটি বাইনারি লেবেল রিটার্ন যে প্রাথমিক নীতি সম্ভবত একটি রেফারেন্স নীতি থেকে বিচলন করবে এটি ছাড়া জিজ্ঞাসা করা"। লেবেল দুটি নীতি অ্যাকশন সঙ্গে দুই মধ্যে বর্গক্ষেত্র L2 বিচলন বিরুদ্ধে সংজ্ঞায়িত করা হয় একটি threshold tau, এবং শ্রেণীকরণকারী বাইনারি ক্রস-এন্ট্রপি সঙ্গে ফিট করা হয়। রান সময়ে এটি প্রতিটি রাজ্য সিদ্ধান্ত করে পাওয়া শিক্ষাবিদ চালনা করে বা রেফারেন্স দখল করে। বিমূর্ত রিপোর্ট কম রেফারেন্স কুয়েরি একটি গাড়ি রেসিং সিমুলেটর প্লাস একটি অভিসরণ গতি-আপ লেখক একটি স্বয়ংক্রিয় পাঠ্যক্রম প্রভাব প্রদান করতে হিসাব, কোনো আংশ দেওয়া ছাড়াই।
ধরা ফলাফল না সংজ্ঞা মধ্যে। প্রশিক্ষণ শ্রেণীকরণকারী রেফারেন্স নীতি এর অ্যাকশন প্রতিটি রাজ্য এটি ফিট করতে প্রয়োজন, যা রেফারেন্স অন্য প্রোগ্রাম অনুমান। আপনার রেফারেন্স একজন নেতা হাত একটি ব্যক্তি হয়, যে লেবেল সেট সস্তা না এবং পদ্ধতি হারায় সম্পত্তি এটি জন্য ডিজাইন করা হয়েছিল।
EnsembleDAgger: সন্দেহ এবং বৈষম্য, উভয়
Menda, Driggs-ক্যাম্পবেল এবং Kochenderfer (2019) গেট একটি probabilistic প্রশ্ন হিসাবে বিবেচনা। EnsembleDAgger "একটি Gaussian প্রক্রিয়া ব্যবহার করে স্নায়ু নেটওয়ার্ক একটি সমষ্টি" এবং পড়ে সমষ্টি ভিত্তি একটি আত্মবিশ্বাস প্রক্সি হিসাবে: উচ্চ ভিত্তি মানে একটি অঞ্চল প্রশিক্ষণ তথ্য অনন্য, যা - অনুমান বিশেষজ্ঞ ব্যর্থতা রাজ্য এড়ায় - সম্পর্ক ব্যর্থতা খরচ সাথে। নিয়ম একটি সংমিশ্রণ। শিক্ষাবিদ হতে পারে শুধুমাত্র অর্জন যখন L2 দূরত্ব মানে অ্যাকশন বিশেষজ্ঞ অ্যাকশন থাকে প্রথম থ্রেশহোল্ড নিচে (বৈষম্য) এবং তার পূর্বাভাস অ্যাকশন বিভিন্নতা একটি দ্বিতীয় (সন্দেহ) দোষ নিচে থাকে। হয় ব্যর্থ হয়, বিশেষজ্ঞ নিয়ন্ত্রণ নেয়। লক্ষ্য শিক্ষাবিদ শেয়ার সর্বাধিক করা যখন ব্যর্থতা সম্ভাবনা সীমাবদ্ধতা করা; কাগজ রিপোর্ট উন্নত নিরাপত্তা এবং শেখা বিরুদ্ধে অন্যান্য DAgger বৈকল্পিক একটি inverted pendulum এবং MuJoCo HalfCheetah।
এটি নির্বিঘ্নে হাতমুক্ত তত্ত্বাবধান জন্য সম্পূর্ণ নিয়ম disqualifies। শিক্ষাবিদ অ্যাকশন বিশেষজ্ঞ অ্যাকশন মধ্যে দূরত্ব যে রাজ্য, সেই মুহূর্ত বিশেষজ্ঞ অ্যাকশন প্রয়োজন। একটি স্ক্রিপ্ট করা বিশেষজ্ঞ, ঠিক। একটি মানুষ, মানুষ ক্রমাগত অ্যাকশন উত্পাদিত করা চাই - যথাযথ বোঝা গেট বৈকল্পিক দূর করার জন্য বোঝানো হয়েছিল। সন্দেহ শব্দ একা হাতমুক্ত; সংমিশ্রণ না।
LazyDAgger: সুইচ থেকে থেমে যান chattering
Hoque এবং সহকর্মীরা (2021) পূর্ববর্তী কাগজ পরিমাপ না খরচ আক্রমণ: সুইচ নিজেই। প্রতিটি হস্তক্ষেপ "অন্যান্য কাজ তত্ত্বাবধানকারী করছেন interrupts, প্রতিটি প্রসঙ্গ সুইচ তত্ত্বাবধানকারী এবং স্বায়ত্তশাসিত নিয়ন্ত্রণ মধ্যে অব্যাহতি incurs, এবং কর্মক্ষমতা জন্য সময় প্রয়োজন". একটি গেট যে খোলে এবং বন্ধ করে দশ বার একটি মিনিট এক দশ সেকেন্ডের জন্য খোলা এক খারাপ, একই স্বায়ত্তশাসিত শেয়ার। LazyDAgger SafeDAgger এক্সটেন্ড asymmetric থ্রেশহোল্ড - তত্ত্বাবধানকারী নিয়ন্ত্রণ এন্টার কঠিন এটি থাকার চেয়ে - তাই সিস্টেম সীমানা oscillate না। সিমুলেশন এটি "প্রসঙ্গ সুইচ হ্রাস করতে পারেন গড় SafeDAgger 60% দ্বারা 3 ক্রমাগত নিয়ন্ত্রণ কাজ যখন বজায় রেখে অত্যাধুনিক নীতি কর্মক্ষমতা"; ফ্যাব্রিক ম্যানিপুলেশন একটি ABB YuMi সঙ্গে এটি "প্রসঙ্গ সুইচ হ্রাস করে 60% SafeDAgger উপর সম্পাদন সময় 60% উচ্চতর সাফল্য হার অর্জন অর্জনের যখন"।
ThriftyDAgger: প্রাচুর্য বা ঝুঁকি, একটি বাজেট অধীন
ThriftyDAgger (Hoque এবং অন্যরা, CoRL 2021) তত্ত্বাবধানকারী বাজেট থেকে শুরু করা নীতি পরিবর্তে। এটি "ব্যবহার করে একটি শেখার সুইচিং নীতি প্রতিশ্রুতি শুধুমাত্র রাজ্য তারা যথেষ্ট (1) নতুন, যেখানে রোবোট নীতি কোনো রেফারেন্স আচরণ নকল করতে, বা (2) ঝুঁকিপূর্ণ, যেখানে রোবোট কাজ সম্পাদন কম আত্মবিশ্বাস থাকে", একটি নতুন মেট্রিক সেই ঝুঁকি অনুমান সঙ্গে। বাজেট একটি ইনপুট, ফলাফল না: তুমি বিবৃতি আপনি কত মানুষ সময় ব্যয় করবেন। সম্পাদন সময় প্রয়োগ পদ্ধতি "কৃতিত্ব লাভ করে 100% সাফল্য হার উভয় সিমুলেশন এবং শারীরিক কাজ", এবং দশ অংশগ্রহণকারী নিয়ন্ত্রণ একটি তিন-রোবট বহর সঙ্গে একটি ব্যবহারকারী অধ্যয়ন ঘনত্ব কাজ সাথে রিপোর্ট যে এটি "মানুষ এবং রোবট কর্মক্ষমতা বৃদ্ধি করে 58% এবং 80% যথাক্রমে পরবর্তী সেরা অ্যালগরিদম তুলনায় যখন হ্রাস তত্ত্বাবধানকারী বোঝা". বহর সেটিং এই কাজ জন্য প্রাকৃতিক বাড়ি; বহর-DAgger পরে formalised ইন্টারঅ্যাক্টিভ বহর শেখা একাধিক রোবোট এবং তত্ত্বাবধানকারী, প্রস্তাব রিটার্ন মানুষ প্রচেষ্টা উপর হিসাবে পরিমাণ অপ্টিমাইজ করা।
HG-DAgger: মানুষ গেট ধারণ করে
কেলি এবং অন্যরা (2019) অন্যান্য উপায় যান। কোনো সুইচিং নীতি নেই। শিক্ষাবিদ রোল আউট হয় "যতক্ষণ না বিশেষজ্ঞ লক্ষ্য যে শিক্ষানবিস রাজ্য স্থান একটি অনিরাপদ অঞ্চল প্রবেশ করেছে", যখন বিশেষজ্ঞ নিয়ন্ত্রণ নেয় এবং গাইড সিস্টেম ফিরে। একত্রিত নিয়ম কঠোর অংশ: "বিশেষজ্ঞ অ্যাকশন লেবেল শুধুমাত্র সংগৃহীত এবং ডেটাসেট যোগ করা হয় এই পুনরুদ্ধার trajectories সময়ে, যখন মানুষ বিশেষজ্ঞ বিরামহীন নিয়ন্ত্রণ করেছেন সিস্টেম।" কিছু লেবেল করা হয় যখন মানুষ দর্শক।
এটি সুইচ থেমে যায় না। HG-DAgger এছাড়াও "একটি নিরাপত্তা থ্রেশহোল্ড শিখে একটি মডেল-অনিশ্চয়তা-ভিত্তিক ঝুঁকি মেট্রিক যে পূর্বাভাস ব্যবহার করা যেতে পারে কর্মক্ষমতা সম্পূর্ণ প্রশিক্ষিত শিক্ষাবিদ রাজ্য স্থান বিভিন্ন অঞ্চল": এটি লগ করে শিক্ষাবিদ কেমন নিশ্চিত ছিল মুহূর্ত বিশেষজ্ঞ হস্তক্ষেপ করা এবং সেই রেকর্ড এর শেষ ত্রৈমাসিক গড়, যেখানে শিক্ষাবিদ সবচেয়ে সদৃশ চূড়ান্ত ফর্ম। যে না একটি গেট রোবোট পরিচালনা কিন্তু একটি ডায়াগনস্টিক আপনি বলা সমাপ্ত নীতি প্রত্যাশিত ধারণ। মূল্যায়ন আবরণ একটি simulated এবং একটি বাস্তব-বিশ্ব ড্রাইভিং কাজ এবং রিপোর্ট উন্নত কর্মক্ষমতা উপর উভয় DAgger এবং আচরণ ক্লোনিং।
একটি সম্পর্কিত লাইন লেবেল পরিবর্তন কি গণনা। Spencer এবং সহকর্মী বিশেষজ্ঞ হস্তক্ষেপ শেখা ধারণ "যেকোনো পরিমাণ বিশেষজ্ঞ প্রতিক্রিয়া, হস্তক্ষেপ বা অ-হস্তক্ষেপ কিনা, তথ্য প্রদান করে মানের বর্তমান রাজ্য সম্পর্কে, optimality অ্যাকশন, বা উভয়", formalised একটি সীমাবদ্ধতা হিসাবে শিক্ষাবিদ মূল্য ফাংশন এবং সমাধান কোনো অনুশোচনা অনলাইন শেখার সঙ্গে। যে পড়া অধীন, বিস্তৃত যেখানে মানুষ দেখেছি এবং কিছু না করেননি দুর্বল ইতিবাচক প্রমাণ অনলা শক্তিশালী। EIL সংঘর্ষ সংঘর্ষ এড়ানো শিখে প্রায় এক মিনিট বিশেষজ্ঞ নিয়ন্ত্রণ।

পাশে পাশে বৈকল্পিক
| পদ্ধতি | যারা গেট খোলে | সঙ্গে | প্রয়োজনীয় উপলব্ধ | প্রতিবেদিত |
|---|---|---|---|---|
| DAgger (রস এবং অন্যরা, 2011) | কেউ না - শিক্ষাবিদ সবসময় চালিত | কোনো; বিশেষজ্ঞ প্রতিটি পরিদর্শন অফ-নীতি রাজ্য লেবেল | একটি বিশেষজ্ঞ সক্ষম করা হয় অফ-নীতি রাজ্য লেবেল যখন নিয়ন্ত্রণে না | কোনো-অনুশোচনা হ্রাস গ্যারান্টি সঙ্গে শিক্ষাবিদ স্টেট বিতরণ অধীনে |
| HG-DAgger (কেলি এবং অন্যরা, 2019) | মানুষ তত্ত্বাবধানকারী | তত্ত্বাবধানকারী এর বিচার রাজ্য অনিরাপদ | কেউ পর্যবেক্ষণ, এবং একটি পরিষ্কার নিয়ন্ত্রণ হ্যান্ডওভার | বীট DAgger এবং আচরণ ক্লোনিং একটি simulated এবং একটি বাস্তব ড্রাইভিং কাজ; এছাড়াও শিখে একটি ঝুঁকি থ্রেশহোল্ড |
| SafeDAgger (Zhang & Cho, 2016) | রোবোট | বাইনারি শ্রেণীকরণকারী L2 বিচলন জন্য রেফারেন্স উপরে tau | একটি queryable রেফারেন্স নীতি শ্রেণীকরণকারী লেবেল জন্য | কম রেফারেন্স কুয়েরি একটি রেসিং সিমুলেটর, দ্রুততর অভিসরণ (কোনো আংশ দেওয়া) |
| EnsembleDAgger (Menda এবং অন্যরা, 2019) | রোবোট | সমষ্টি ভিত্তি এবং দূরত্ব বিশেষজ্ঞ অ্যাকশন, উভয় থ্রেশহোল্ড অধীন | একটি সমষ্টি নেটওয়ার্ক প্লাস বিশেষজ্ঞ অ্যাকশন প্রতিটি পদক্ষেপ | উন্নত নিরাপত্তা এবং শেখা pendulum এবং HalfCheetah উপর |
| LazyDAgger (Hoque এবং অন্যরা, 2021) | রোবোট, hysteresis সঙ্গে | SafeDAgger এর সঙ্গে আলাদা এন্ট্রি এবং বর্ষার থ্রেশহোল্ড | কি SafeDAgger প্রয়োজন, প্লাস একটি দ্বিতীয় থ্রেশহোল্ড টিউন করার জন্য | ~60% কম প্রসঙ্গ সুইচ 3 কাজ; 60% উচ্চতর সাফল্য YuMi ফ্যাব্রিক উপর |
| ThriftyDAgger (Hoque এবং অন্যরা, 2021) | রোবোট, একটি বাজেট অধীন | প্রাচুর্য, বা অনুমান ঝুঁকি কাজ সম্পাদন না | একটি শেখা ঝুঁকি নির্ধারক এবং একটি বিবৃত হস্তক্ষেপ বাজেট | 100% সাফল্য সম্পাদন সময় উপর; ব্যবহারকারী অধ্যয়ন (N=10): 58% এবং 80% লাভ পরবর্তী-সেরা |
| EIL (স্পেন্সার এবং অন্যরা, 2020) | মানুষ - অ-হস্তক্ষেপ বিবেচনা করেন খুব | হস্তক্ষেপ এবং এর অনুপস্থিতি মূল্য ফাংশন সীমাবদ্ধতা হিসাবে | অনলাইন কোনো অনুশোচনা শেখা মূল্য সীমাবদ্ধতা উপর | সংঘর্ষ এড়ানো প্রায় এক মিনিট বিশেষজ্ঞ নিয়ন্ত্রণ |
প্রতিটি গেট ক্রয় কি, এবং এটি চার্জ কি
প্রয়োজন" কলাম নিচে পড়ুন এবং একটি প্যাটার্ন পড়ে যায়: প্রতিটি রোবোট-গেট সঙ্গে সেখানে একটি প্রক্সি যা তৈরি করা ছাড়া মিলিত হওয়ার জন্য, এবং প্রতিটি প্রক্সি তার নিজস্ব বিল।
- বৈষম্য সঙ্গে (SafeDAgger, LazyDAgger, অর্ধ EnsembleDAgger এর নিয়ম) একটি রেফারেন্স নীতি প্রয়োজন। হয় আপনার একটি স্ক্রিপ্ট করা বিশেষজ্ঞ, যে ক্ষেত্রে আগ্রহ সমস্যা ইতিমধ্যে সমাধান বা একটি মানুষ দূরে একটি দূরত্ব পরিসংখ্যান করা যায় ক্রমাগত অ্যাকশন উত্পাদিত।
- সন্দেহ সঙ্গে যাঁচাই অবিশ্বাস্য। একটি ছোট নিয়ন্ত্রণ নেটওয়ার্ক একটি সমষ্টি সঠিক সামঞ্জস্য; একটি তিন-বিলিয়ন-প্যারামিটার vision-ভাষা-কর্ম মডেলের একটি সমষ্টি একটি স্মৃতি এবং latency সমস্যা প্রথম।
- প্রাচুর্য এবং ঝুঁকি সঙ্গে একটি শেখা নির্ধারক সফল এবং ব্যর্থ rollouts যথেষ্ট ফিট। একটি কাজ তুমি এখনও পায় কাজ করছে, যে তথ্য রাউন্ড এক মধ্যে বিদ্যমান না।
- মানুষ গেট মনোযোগ প্রয়োজন এবং কিছু অন্যথায় না - একমাত্র সঙ্গে দিন এক উপলব্ধ, কোনো নীতি স্থাপত্য, কোনো অতিরিক্ত মডেল প্রশিক্ষণ।
- কোনো রোবোট গেট মানুষ সরায়। তারা হ্রাস কিভাবে প্রায়ই মানুষ অবশ্যই অধিনিয়ম, না আছে তারা উপস্থিত থাকা চাই।
একটি শান্ত পার্থক্য কি গেট উৎপাদিত। একটি রোবোট গেট মধ্য-trajectory ফায়ার একটি ব্যক্তি একটি গতিশীল বাহু মধ্য-trajectory একটি মনস্বেচ্ছ pose হ্যান্ড। একটি মানুষ গেট লেটস অপারেটর পিক মুহূর্ত - পৌঁছান পরে, grasp আগে, না অর্ধপথ একটি সুইং মাধ্যমে। পুনরুদ্ধার সেগমেন্ট দুটি থেকে না সমানভাবে পরিষ্কার, এবং সেই সেগমেন্ট রাউন্ড এর সম্পূর্ণ পণ্য।
কেন মানুষ-গেটড ফর্ম জয় বাস্তব হার্ডওয়্যার উপর
এটি একটি প্রকৌশল যুক্তি, না একটি বেঞ্চমার্ক ফলাফল না কাগজ চালিত সব পাঁচ গেট একই manipulator একই নীতি শ্রেণী সঙ্গে। এটি বিশ্রাম চারটি পয়েন্ট।
প্রথম, তত্ত্বাবধানকারী সেখানে যখন। কেউ লাভ একটি SO-100 বাহু অপারেটেড পরবর্তী বস্তু এটি knock করতে পারেন নির্বাচন। একবার কেউ পর্যবেক্ষণ হয়, মার্জিনাল দেওয়া প্রদান একটি takeover বোতাম কাছাকাছি শূন্য; নির্মাণ একটি কৃত করা ঝুঁকি নির্ধারক একটি প্রকল্প।
দ্বিতীয়, অনিশ্চয়তা তুমি প্রকৃতপক্ষে একটি আধুনিক নীতিতে পরিমাপ করতে পারেন প্রায়ই ভুল পরিমাণ। একটি diffusion বা প্রবাহ-মিলান মাথা উৎপাদিত ভিত্তি জুড়ে নমুনা করা পদক্ষেপ, এবং যে ভিত্তি প্রতিফলিত multimodality মাথা ছিল প্রশিক্ষিত উপস্থাপন, না অবিজ্ঞতা অনিশ্চয়তা রাজ্য সম্পর্কে। EnsembleDAgger এর সন্দেহ শব্দ ব্যবহার একটি সমষ্টি সুনির্দিষ্টভাবে ধরতে পরবর্তী। দুটি একই সংখ্যা মত দেখায় এবং করি না; অ্যাকশন chunking এবং প্রবাহ মিলান এন্ট্রি কভার কিভাবে সেই মাথা নিঃসরণ করা নীতিবাক্য প্রথম স্থানে।
তৃতীয়, ব্যর্থতা যা বিষয় ম্যানিপুলেশন প্রায়ই semantic পার্থক্য পরিবর্তে সাংখ্যিক উপায় অসাধারণ। একটি নীতি gripper বন্ধ করা দুই সেন্টিমিটার প্রাথমিক, বা পৌঁছানো আত্মবিশ্বাস জন্য ভুল একটি দুই identical cubes, কোনো উচ্চ-ভিত্তি রাজ্য - এটি আত্মবিশ্বাস এবং ভুল। কোনো ভিত্তি থ্রেশহোল্ড ধরা যে; কোনো ব্যক্তি পর্যবেক্ষণ ধরা এটি অবিলম্বে।
চতুর্থ, লেবেল গুণমান - মূল HG-DAgger পয়েন্ট, এবং সবচেয়ে প্রায়ই মুক্তা। লেবেল সংগৃহীত যখন মানুষ বিরামহীন নিয়ন্ত্রণ ছিল মানুষ বীট একটি গতিশীল সিস্টেম উপর narrated। যদি লক্ষ্য corrective ডেটা সার্থক aggregating, বোঝা প্রমাণ থেকে স্বয়ংক্রিয় গেট লাই।
ছবি উল্টে যখন এক তত্ত্বাবধানকারী অনেক রোবোট জন্য দায়বদ্ধ - শাসন ThriftyDAgger এর ব্যবহারকারী অধ্যয়ন এবং বহর-DAgger এর formalization লক্ষ্য। একটি বহর, মানুষ মনোযোগ বিরল সম্পদ এবং একটি অসম্পূর্ণ বরাদ্দ কাটায়। একটি বাহু একটি ডেস্ক আপনি যে শাসন না।
মানুষ-গেটড লুপ, ইতিমধ্যে তার সঙ্গে যুক্ত
একটি চলমান অনুমান সেশন কমান্ড তথ্য, প্রতি-ফ্রেম হস্তক্ষেপ ফ্ল্যাগ সংশোধন সেগমেন্ট উপর, curating প্রতিটি চালান মধ্যে অপারেটর চালিত ফ্রেম মধ্যে সংশোধন বা মূল্যায়ন, রচনা ছিল একটি মিশ্র ডেটাসেট উৎস আপনি পিক থেকে, এবং অব্যাহত প্রশিক্ষণ একটি বিদ্যমান checkpoint থেকে হয় নির্মিত পরিবর্তে স্ক্রিপ্ট করা। Takeover কাজ একটি নেতা বাহু, বা কীবোর্ড এবং স্লাইডার আপনি এক না।
দেখা DAgger লুপ কিভাবে চালিতগেট অর্ধেক পদ্ধতি; তথ্য পরিচালনা অন্য অর্ধেক
একটি গেট সিদ্ধান্ত যা ফ্রেম একটি মানুষ চালিত, না কি তাদের সঙ্গে করতে, এবং যে দ্বিতীয় সিদ্ধান্ত যেখানে রাউন্ড সবচেয়ে প্রায়ই বর্জিত হয়। প্রথম নিয়ম যা D DAgger দাঁড়ায় জন্য: একত্রিত, মুক্তি না। সূক্ষ্ম-tuning একটি checkpoint বিশুদ্ধভাবে কয়েক শত সংশোধন ফ্রেম দেখেছি প্রায় কিছু না এবং ভুলে গেছি নীতি প্রদান করেন সংজ্ঞায়িত trajectory।
দ্বিতীয় নিয়ম যা হস্তক্ষেপ ফ্রেম না সাধারণ ফ্রেম। Mandlekar এবং অন্যরা একটি দূর-teleoperation সিস্টেম নির্মাণ করেছেন 6-DoF ম্যানিপুলেশন জন্য অপারেটর নীতি নিরীক্ষণ করতে এবং ব্যর্থতায় নিয়ন্ত্রণ সাহায্য, তারপর পুনরাবৃত্তি প্রশিক্ষণ একটি অ্যালগরিদম যে "উত্সাহিত করে নীতি শিখতে কিভাবে bottleneck অতিক্রম মাধ্যমে হস্তক্ষেপ"; এজেন্ট প্রশিক্ষিত যে তথ্য outperformed এজেন্ট প্রশিক্ষিত উপর একটি সমান অনেক সাধারণ প্রদর্শন নমুনা। Sirius ধারণা ঠেলে মধ্যে মোতায়েন, "পুনর্-ওজন প্রশিক্ষণ নমুনা অনুমান মানুষ বিশ্বাস এবং অপ্টিমাইজেশন নীতি ওজন আচরণগত ক্লোনিং সঙ্গে". উভয় প্রয়োজন একটি প্রতি-ফ্রেম মার্কার কি মানুষ-চালিত ছিল, যা কেন হস্তক্ষেপ ফ্ল্যাগ বিষয় আরও এটি লাগে।
তৃতীয় নিয়ম যা স্বয়ংক্রিয় মিশ্রণ একটি ফাঁদ। একটি রচিত ডেটাসেট যার উৎস তুমি enumerate ফাঁদ না করতে পারে এটি তুমি debug যখন পরবর্তী রাউন্ড পায় খারাপ। প্ল্যাটফর্মে রচনা পদক্ষেপ স্পষ্ট সেই কারণ - মূল ডেটাসেট প্লাস সংশোধন, পর্ব নির্বাচন প্রতিটি উৎস, এবং ফলাফল একটি সাধারণ LeRobot ডেটাসেট যা syncs এবং প্রশিক্ষণ যে কোনো অন্যান্য মত; ডেটাসেট ডকুমেন্টেশন কভার ফর্ম্যাট পক্ষ।
| ধাপ একটি রাউন্ড | কি এটি উৎপাদিত | সবচেয়ে সাধারণ উপায় এটা সব ভুল যায় |
|---|---|---|
| রেকর্ডিং চালান অনুমান | একটি রান অধীন নীতি স্টেট বিতরণ নিজের | রেকর্ড করা সাধারণ teleoperation, হারানো যে একটি নীতি চালিত ছিল |
| ব্যর্থতা উপর দখল নিন | সংশোধন সেগমেন্ট একটি প্রতি-ফ্রেম হস্তক্ষেপ ফ্ল্যাগ সঙ্গে | সংশোধন সৌন্দর্য wobble, শিক্ষা শৈলী পরিবর্তে পুনরুদ্ধার একটি |
| Curate প্রতিটি পর্ব | সংশোধন, মূল্যায়ন, বা জলাতি | রাখা সবকিছু; একটি botched takeover খরচ আরও পর্ব মূল্যবান। |
| সংশোধন সিঙ্ক করুন | একটি সংস্করণ ডেটাসেট পাশে মূল | সংশোধন যা কখনো স্থানীয় মেশিন ছেড়ে যান |
| মিশ্র ডেটাসেট রচনা করুন | মূল প্লাস সংশোধন, স্পষ্ট নির্বাচন | নীরব স্বয়ংক্রিয়-মিশ্রণ, তাই একটি পরবর্তী regress করতে পারে না একটি উৎস দায়বদ্ধ ট্রেস। |
| একটি checkpoint থেকে অব্যাহত রাখুন | একটি checkpoint প্রাক্ষেপিত থেকে পূর্ববর্তী | একটি অপ্টিমাইজার পুনরায় প্রত্যাশা করছে; ওজন initialise মডেল, তারা পুনরুদ্ধার অপ্টিমাইজার স্টেট না। |
একটি গেট সেট একটি ব্যক্তি প্রকৃত পারে ধারণ করুন
"মানুষ সিদ্ধান্ত" একটি স্পেসিফিকেশন না। দুটি অপারেটর বিভিন্ন থ্রেশহোল্ড অতুলনীয় রাউন্ড উৎপাদিত, এবং একটি ড্রিফটিং থ্রেশহোল্ড একটি ট্রেন্ড তুমি পড়ুন না পড়তে পারে। লিখুন ট্রিগার নিচে প্রথম চালান আগে।
- নাম শর্তাবলী যে গেট খোলে - পদ্ধতি একটি নির্ধারিত মার্জিন ফাঁক, gripper বন্ধ করা কিছু উপর না, একটি যৌথ ড্রিফটিং একটি সীমা, একটি stall দুই সেকেন্ড একাধিক বা - রাখুন তালিকা অপরিবর্তিত রাউন্ড জন্য।
- নাম কি না খোলে এটা। Overshoot নীতি পুনরুদ্ধার করে নিজের প্রশিক্ষণ প্রতিশ্রুতি; নিয়ন্ত্রণ সেখানে মুছে দেয় পুনরুদ্ধার এটি ইতিমধ্যে জানে।
- Takeover যথেষ্ট তাড়াতাড়ি নিষ্কাশন একটি পরিষ্কার হাতে দিয়ে, হ্যান্ড ফিরিয়ে দিন যত তাড়াতাড়ি রাজ্য পুনরুদ্ধারযোগ্য।
- লগ কেন তুমি নিয়ন্ত্রণ নিয়েছেন, প্রতিটি পর্ব। তিন রাউন্ড পরে এটি একমাত্র রেকর্ড আছে ব্যর্থতা একই রিটার্ন।
- রাখুন ক্যামেরা, কাজ পাঠ এবং অপারেটর রাউন্ড জুড়ে ধ্রুবক। পরিবর্তন একটি এবং সংখ্যা থামিয়ে তুলনীয়।
যান্ত্রিকভাবে হাতে নিয়ে দুটি বৈকল্পিক। একটি নেতা বাহু, নেতা উপস্থিতি অনুসরণকারী এর বর্তমান ভঙ্গি আগে torque বিস্তার বা বাহু জম্প; এই সারিবদ্ধকরণ পদ্ধতি যদি না যাচাই অংশ শৃঙ্খলার উপর বাস্তব হার্ডওয়্যার। ছাড়া নেতা বাহু takeover ম্যানুয়াল প্রথম keypress থেকে: অনুসরণকারী অনুষ্ঠিত এবং অপারেটর nudges এটি যৌথ যৌথ কীবোর্ড থেকে বা ড্র্যাগ স্লাইডার, সার্ভার-দিক কল রাখা প্রতিটি ইনপুট ছোট - দম্পতি ডিগ্রি প্রতি keypress, মুঠোয় প্রতি স্লাইডার আপডেট, কারণ একটি বৃহৎ পদক্ষেপ একটি পরিধারিত ভঙ্গি কিভাবে আপনি স্ট্রিপ একটি servo। ধাপ-দ্বারা-ধাপ সংস্করণ কীবাইন্ডিং একটি DAgger রাউন্ড একটি SO-100 এর অনুষ্ঠানী; পটভূমি উভয় teleoperation মোড পরিসীমা teleoperation ডকুমেন্টেশন এবং নেতা-অনুসরণকারী প্রবিষ্টি।

পড়া যদি গেট কিছু
মেট্রিক একটি মানুষ-গেটড রাউন্ড হস্তক্ষেপ হার: হস্তক্ষেপ ফ্রেম দ্বারা বিভক্ত ফ্রেম রান। এটা একটি কাজ - যদি তা ড্রপ না রাউন্ড, রাউন্ড কিনেছে কিছু, এবং পরবর্তী রাউন্ড পরিবর্তন কিছু অন্যথায় ডেটা পরিমাণ।
এটা একটি biased মেট্রিক এবং আপনার কিভাবে জানা উচিত। এটা পরিমাপ অপারেটর এর থ্রেশহোল্ড অনেক যেমন নীতি competence, যা কেন ট্রিগার তালিকা সবুজ সবসময়; অপারেটর যারা শিথিল একটি সেশন একটি ভঙ্গি তৈরি বক্ররেখা পতন এটা পিছনে কিছু ছাড়াই। এটা উপেক্ষা মাত্রা - দশ ফ্রেম থামাতে একটি সংঘর্ষ এবং দশ nudge একটি grasp দেখায় একমাত্র। দম্পতি একটি নির্ধারিত মূল্যায়ন সেট কোনো সংশোধন ডেটা যখন ঠেলে দেওয়া হয়েছিল। মাপার DAgger লুপ নিবন্ধ কাজ মাধ্যমে মূল্যায়ন ডিজাইন, সহ কিভাবে মূল্যায়ন পর্ব রাখতে বিরত প্রশিক্ষণ মিশ্রণ।
- কাজ দিন এক, কোনো নীতি আর্কিটেকচার, কোনো অতিরিক্ত মডেল যাঁচাই করতে
- ধরা আত্মবিশ্বাস-এবং-ভুল ব্যর্থতা কোনো ভিত্তি থ্রেশহোল্ড সনাক্ত করে
- উৎপাদিত সংশোধন রেকর্ড যখন অপারেটর সম্পূর্ণ নিয়ন্ত্রণ ছিল, মুহূর্ত তারা নির্বাচিত
- বৃদ্ধি পায় একটি প্রতি-ফ্রেম মার্কার যে হস্তক্ষেপ-ওজন পদ্ধতি যেমন IWR এবং Sirius গ্রাস করে
- খরচ ক্রমাগত তত্ত্বাবধান; এটা স্কেল না একটি ব্যক্তি এবং অনেক রোবোট
- নির্ভর অপারেটর সামঞ্জস্য - একটি ড্রিফটিং থ্রেশহোল্ড দুর্নীতি হস্তক্ষেপ হার
- উৎপাদিত কোনো ঝুঁকি মডেল নিজেই; HG-DAgger এর শিখা থ্রেশহোল্ড এবং ThriftyDAgger এর নির্ধারক অতিরিক্ত যন্ত্র
- সংখ্যার ফ্রেম, পরিণতি না
- ব্যর্থ ঐতিহ্যবাহী যার ব্যর্থতা নিয়ন্ত্রণ আপস্ট্রিম, যেমন একটি অদলবদল ক্যামেরা বা একটি কাজ mislabelled স্ট্রিং
প্রশ্ন খোলে সার্থক রাখা প্রাসঙ্গিক দৃশ্যমান
বেঞ্চমার্ক দুর্বল। Spencer এবং সহকর্মী পরীক্ষা করা যে পরীক্ষা imitation শেখা পদ্ধতি এবং তারা খুঁজে "wieldable এবং সহজ এবং সুতরাং অপ্রয়োজনীয় ক্যাপচার শক্ত শাসন ত্রুটি compounding বাস্তব-বিশ্ব সিদ্ধান্ত নেওয়া সমস্যা" - এবং, চারপাশে সাহিত্য, খুঁজে প্লেইন আচরণ ক্লোনিং ভাল করা তারা। যে কারণ সন্ধিসন্ধান্ত DAgger বৈকল্পিক র্যাঙ্কিং তারা কাজ, সহ কিছু সংখ্যা টেবিল উপরে।
রোবোট গেট বড় নীতি না সমাধান হয়। AIM কাজ বিস্থাপিত নিশ্চয়তা একটি প্রক্সি Q-ফাংশন মিমিক মানুষ হস্তক্ষেপ নিয়ম এবং রিপোর্ট একটি 40% উন্নতি নিয়ে-উপর খরচ এবং শেখা দক্ষতা থেকে ThriftyDAgger - ক্রমাগত এবং বিচ্ছিন্ন নিয়ন্ত্রণে, না একটি vision-ভাষা-কর্ম মডেল চালিত একটি manipulator। আছে কি এই গেট স্থানান্তর একটি সূক্ষ্ম-tuned VLA খোলা। জরিপ একটি সম্পর্কিত পয়েন্ট করে: ক্ষেত্র এর পরিভাষা এবং গঠন না unified সাহিত্য জুড়ে, যা করে পদ্ধতি তুলনা কঠিন। আপনার নিজের বাহু, আপনার লগ প্রমাণ আপনার করেছি।
HG-DAgger সত্যিই DAgger যদি মানুষ শুধুমাত্র লেবেল হস্তক্ষেপ সময়?▾
এটা রাখে অংশ যে বিষয় - ডেটা সংগৃহীত অধীন রাজ্য বিতরণ শিক্ষাবিদ নিযুক্ত, aggregated যা অগ্রসর - এবং ড্রপ অংশ না বাস্তব হার্ডওয়্যার সঙ্গে সম্পর্ক টিকে। কেলি এবং অন্যরা উপস্থাপন এটি একটি বৈকল্পিক; 2011 কোনো-অনুশোচনা গ্যারান্টি না বহন পরিবর্তিত।
আমি ব্যবহার করতে পারেন একটি রোবোট গেট একটি সূক্ষ্ম-tuned VLA নীতি একটি SO-100 এ?▾
না straightforwardly। SafeDAgger এর শ্রেণীকরণকারী প্রয়োজন একটি queryable রেফারেন্স নীতি তুমি করি না। EnsembleDAgger প্রয়োজন একটি সমষ্টি, যা একটি মাল্টি-বিলিয়ন-প্যারামিটার মডেল মানে একাধিক কপি স্মৃতি প্লাস তাদের অনুমান খরচ। ThriftyDAgger প্রয়োজন একটি ঝুঁকি নির্ধারক ফিট সাফল্য এবং ব্যর্থতা যা বিদ্যমান না আগে রাউন্ড।
কত দীর্ঘ হওয়া উচিত একটি একক takeover?▾
দীর্ঘ যথেষ্ট পৌঁছাতে একটি রাজ্য নীতি পারে অব্যাহত রাখুন থেকে, এবং কোনো দীর্ঘতর: বর্ধিত takeover চালান একটি প্রদর্শন সেশন রূপান্তরিত এবং বন্যা সংশোধন নির্ধারিত আচরণ। LazyDAgger এর উপলব্ধি অন্য উপায় কেটে - অনেক অত্যন্ত কম সুইচ তাদের নিজস্ব খরচ।
আমি প্রশিক্ষণ করা উচিত শুধুমাত্র সংশোধিত সেগমেন্ট?▾
না - যে সবচেয়ে সাধারণ উপায় বর্জিত একটি রাউন্ড। একটি মডেল সূক্ষ্ম-tuned শুধুমাত্র পুনরুদ্ধার সম্পর্কে অনেক দেখেছি পুনরুদ্ধার। মিশ্রণ সংশোধন মূল ডেটাসেট উৎস স্পষ্টভাবে নির্বাচিত হয়; আরও যেতে, লাগেজ হস্তক্ষেপ-ওজন পদ্ধতি যেমন IWR বা Sirius, যে আপ-ওজন মানুষ-চালিত ফ্রেম বরং অনুভব তাদের।
কি যদি হস্তক্ষেপ হার ড্রপ না একটি রাউন্ড পরে?▾
নিন এটা মুখ্য: রাউন্ড করি না সাহায্য। সংশোধন যোগ করার আগে, পরীক্ষা সস্তা ব্যাখ্যা - এটা অপারেটর এর থ্রেশহোল্ড ড্রিফট, সংশোধন সৌন্দর্য ছিল, রচিত ডেটাসেট সত্যিই তাদের রয়েছে, ছিল প্রশিক্ষণ সংশোধনীকৃত checkpoint থেকে আরম্ভ করা। একটি রাউন্ড যে নীরবে ভিত্তি মডেল থেকে শুরু চেহারা যথাযথভাবে একটি রাউন্ড যে ব্যর্থ শিখতে।
করি না-হস্তক্ষেপ বহন করা তথ্য?▾
অধীন বিশেষজ্ঞ হস্তক্ষেপ শেখা, হ্যাঁ: বিস্তৃত যেখানে তত্ত্বাবধানকারী দেখেছি এবং যা করি না অভিনয় দুর্বল প্রমাণ অনুমান তৈরি করা হয় রাজ্য এবং অ্যাকশন গ্রহণযোগ্য ছিল, formalised একটি মূল্য ফাংশন সীমাবদ্ধতা হিসাবে। বেশিরভাগ ব্যবহারিক pipeline, এই অন্তর্ভুক্ত, মার্ক শুধুমাত্র কি মানুষ চালিত।
একটি একক বাহু একটি ডেস্ক পছন্দ করা হয়েছে: গেট ধরুন নিজেই, লিখুন নিচে কি খোলে এটা, এবং ব্যয় প্রচেষ্টা প্রকৃত তথ্য হ্যান্ডলিং এটার চেয়ে স্বয়ংক্রিয় সুইচ। প্ল্যাটফর্ম পক্ষ পরিবর্তে করা হয় DAgger লুপ পৃষ্ঠা, প্রশিক্ষণ বিকল্প প্রতিটি নীতি পরিবার অধীন প্রশিক্ষণ এবং মূল্য নির্ধারণ. পটভূমির জন্য, শুরু করুন অনুকরণ শেখা এবং অনুকরণ শেখা SO-100 উপর; একটি প্রথম চালান, চালান আপনার প্রথম নীতি ছোটোট পথ।
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started