
সাধারণ DAgger একজন মানুষকে অবস্থা লেবেল করতে বলে যখন রোবট এখনও চলছে। প্রকৃত হার্ডওয়্যারে এটি অনিরাপদ এবং খারাপ লেবেল তৈরি করে। গেটেড ভেরিয়েন্টগুলি অন্ধ লেবেলিং কে একটি গেট দিয়ে প্রতিস্থাপন করে যা কেউ ধরে রাখতে হবে: HG-DAgger তে মানুষ, SafeDAgger তে একটি নিরাপত্তা শ্রেণীবদ্ধকারী, EnsembleDAgger এ একটি ensemble এর মতভেদ, ThriftyDAgger এ একটি বাজেটেড অভিনবত্ব এবং ঝুঁকি অনুমান। এই নিবন্ধটি তাদের তুলনা করে যে কে গেটের মালিক, কি সংকেত এটি খোলে এবং প্রতিটি একটি খরচ কত — এবং কেন মানব-গেটেড ফর্মটি একটি প্রকৃত arm এর সাথে যোগাযোগে টিকে থাকে।
একটি ক্লোন করা policy ব্যর্থ হয় যেখানে এর প্রশিক্ষণ ডেটা শেষ হয়। সমাধান হল policy এর নিজস্ব অবস্থা বিতরণের অধীনে ডেটা সংগ্রহ চালিয়ে যাওয়া প্রদর্শনকারীর পরিবর্তে, যা DAgger করে এবং ডেটাসেট aggregation এ প্রবর্তন প্রথম নীতি থেকে কভার করে। এটি মূল অ্যালগরিদমের অশোভন অংশটি খোলা রেখে যায়: যখন শিক্ষার্থী চালায়, বিশেষজ্ঞ সবগুলি অবস্থার জন্য যা তারা করেছে তা বলার কথা বলে, নিয়ন্ত্রণে না থাকার সময়।
একটি সিমুলেটরে একটি স্ক্রিপ্ট করা বিশেষজ্ঞের সাথে যা বিনামূল্যে। একটি টেবিলে এটির উপর একটি প্রকৃত arm এর সাথে এটি বিনামূল্যে বা নিরাপদ। HG-DAgger লেখকরা আপত্তিটি সুনির্দিষ্টভাবে বলেছেন: এই ধরনের স্যাম্পলিং schemes "বিশেষজ্ঞকে সিস্টেম সম্পূর্ণভাবে নিয়ন্ত্রণ না করে action labels প্রদান করতে প্রয়োজন", যা "নিরাপত্তা হ্রাস করতে পারে এবং মানুষকে বিশেষজ্ঞ হিসাবে ব্যবহার করার সময়, সংগৃহীত লেবেলগুলির গুণমান হ্রাস করার সম্ভাবনা রয়েছে। অনুভূত actuator lag এর কারণে" (Kelly et al., 2019)। দুটি ব্যর্থতা সেই বাক্যে লুকানো আছে: policy এমন অবস্থায় চালিয়ে যায় যা কেউ এটি চায় না, এবং সেই ঝুঁকির জন্য কেনা লেবেলগুলি একজন মানুষ নিয়ন্ত্রণে রেখে উত্পাদন করে তার চেয়ে খারাপ। নীচের প্রতিটি ভেরিয়েন্ট একই প্রশ্নের উত্তর দেয় — নিয়ন্ত্রণে একটি গেট রাখুন এবং কেউ সিদ্ধান্ত নিন যখন এটি খোলে। তারা পৃথক হয় কে সেই কেউ তা নিয়ে।
সংক্ষিপ্ত সংস্করণ
- •গেটেড ভেরিয়েন্টগুলি অন্ধ লেবেলিংকে policy নিয়ন্ত্রণ এবং বিশেষজ্ঞ নিয়ন্ত্রণের মধ্যে একটি সুইচ দিয়ে প্রতিস্থাপন করে। তাদের পৃথক করা হল কে স্যুইচটির মালিক।
- •HG-DAgger মানুষকে সুইচটি দেয় এবং শুধুমাত্র মানুষের নিরবচ্ছিন্ন নিয়ন্ত্রণের সময় রেকর্ড করা ডেটা সংগ্রহ করে।
- •SafeDAgger এটি একটি বাইনারি শ্রেণীবদ্ধকারীকে দেয় যা একটি reference policy থেকে বিচ্যুতি পূর্বাভাস দেয়; EnsembleDAgger কম ensemble variance এবং একই সাথে বিশেষজ্ঞ action এর ছোট দূরত্ব প্রয়োজন।
- •LazyDAgger হিসটেরেসিস যোগ করে তাই নিয়ন্ত্রণ ping-পং করে না; ThriftyDAgger একটি স্পষ্ট হস্তক্ষেপ বাজেটের অধীনে অভিনবত্ব বা অনুমান করা ঝুঁকির উপর গেট করে।
- •রোবট-গেটেড সংকেতগুলির প্রয়োজন কিছু একটি সুক্ষ্ম-সুর করা VLA একটি hobby-class arm এ সাধারণত অভাব: একটি reference policy, একটি সস্তা ensemble, বা ক্যালিব্রেট করা epistemic uncertainty।
- •গেট পদ্ধতির অর্ধেক। যা হস্তক্ষেপ সেগমেন্টগুলির পরে ঘটে — মিশ্রণ, ওজন, সংগ্রহ — সিদ্ধান্ত নেয় যে পর্যায়টি কিছু উন্নত করেছে কিনা।
মানব-গেটেড এবং রোবট-গেটেড: পার্থক্য যা গুরুত্বপূর্ণ
ইন্টারঅ্যাক্টিভ অনুকরণ শেখার নিজস্ব survey আছে; Celemin এবং সহকর্মীরা এটি feedback type, interface, learning model, user experience, application এবং benchmark সাথে ক্যাটালগ করে। যা সিদ্ধান্ত নেয় তোমার প্রকৌশল যেকোনো অক্ষের চেয়ে সহজ, এবং সাম্প্রতিক কাজ এটি সরাসরি নাম দেয়: একটি পদ্ধতি মানব-গেটেড যখন তত্ত্বাবধায়ক হস্তক্ষেপ করার সময় সিদ্ধান্ত নেয়, এবং রোবট-গেটেড যখন agent সাহায্যের জন্য চাওয়ার সময় সিদ্ধান্ত নেয় (Cai et al., 2025)। বাকি সবকিছু মেশিনারি যে দুটি পছন্দের একটি পরিবেশন করে। বাণিজ্য শুরু থেকে দৃশ্যমান: একটি মানুষের গেট অবিরাম মনোযোগ খরচ করে, এবং একটি রোবট গেট সেই মনোযোগ ফিরিয়ে দেওয়ার প্রতিশ্রুতি দেয় — কিন্তু শুধুমাত্র যদি সংকেত এটি gates বিশ্বাসযোগ্য হয়, এবং সেই সংকেত তৈরি করা এর নিজস্ব গবেষণা সমস্যা।
SafeDAgger: একটি শ্রেণীবদ্ধকারী যা এর নিজস্ব বিচ্যুতি পূর্বাভাস দেয়
Zhang এবং Cho এর SafeDAgger (2016) এই gates এর প্রাথমিকতম। reference policy querying expensive অংশ, তাই একটি দ্বিতীয়, ছোট নেটওয়ার্ক — the safety policy — পূর্বাভাস দেয় querying যোগ্য কিনা সব। এটি "একটি বাইনারি label ফেরত দেয় নির্দেশনা করে যে primary policy একটি reference policy থেকে query ছাড়া বিচ্যুতি সম্ভব কিনা"। label সংজ্ঞায়িত করা হয় দুটি policies' actions এর মধ্যে একটি squared L2 বিচ্যুতির বিপরীতে একটি threshold tau, এবং শ্রেণীবদ্ধকারী fit করা হয় binary cross-entropy দিয়ে। runtime এ এটি সিদ্ধান্ত নেয় প্রতিটি state এ যা learner চালিয়ে যায় বা reference দখল করে। abstract প্রতিবেদন করে কম reference queries একটি car racing simulator এ প্লাস একটি convergence speed-up লেখকরা attribute করে একটি automated curriculum effect এ, কোনো figure না দিয়ে দুটির জন্য।
catch সংজ্ঞায়িত করা আছে, ফলাফল না। শ্রেণীবদ্ধকারী প্রশিক্ষণ প্রয়োজন reference policy এর action প্রতিটি state এ ব্যবহৃত এটি fit করতে, যা মনে করে reference অন্য একটি প্রোগ্রাম। যদি তোমার reference একজন ব্যক্তি একটি leader arm দিয়ে, সেই label সেট সস্তা না এবং পদ্ধতি হারায় সম্পত্তি এটি ডিজাইন করা হয়েছিল।
EnsembleDAgger: সন্দেহ এবং বিচ্যুতি, উভয়
Menda, Driggs-Campbell এবং Kochenderfer (2019) gate বিবেচনা করে একটি probabilistic প্রশ্ন হিসাবে। EnsembleDAgger "একটি Gaussian Process approximate করে একটি neural networks এর ensemble ব্যবহার করে" এবং ensemble variance পড়ে একটি confidence proxy হিসাবে: উচ্চ variance একটি অঞ্চল মানে প্রশিক্ষণ ডেটার বিপরীত, যা — assuming বিশেষজ্ঞ failure states এড়ায় — correlates করে proximity এর সাথে ব্যর্থতায়। নিয়ম একটি conjunction। learner act করতে পারে শুধুমাত্র যখন L2 distance তার mean action এবং বিশেষজ্ঞ এর action এর মধ্যে থাকে একটি threshold এর নিচে (discrepancy) এবং তার পূর্বাভাস করা action এর variance থাকে একটি দ্বিতীয় এর নিচে (doubt)। যদি either ব্যর্থ হয়, বিশেষজ্ঞ নিয়ন্ত্রণ নেয়। লক্ষ্য learner এর শেয়ার maximize করা যখন constraining ব্যর্থতার probability; paper প্রতিবেদন করে উন্নত নিরাপত্তা এবং শেখা অন্যান্য DAgger variants বিপরীতে একটি inverted pendulum এবং MuJoCo HalfCheetah এ।
এটি quietly disqualifies পূর্ণ rule hands-off তত্ত্বাবধান জন্য। distance learner এর action এবং বিশেষজ্ঞ এর মধ্যে প্রয়োজন বিশেষজ্ঞ এর action সেই state এ, সেই মুহূর্তে। একটি scripted বিশেষজ্ঞ দিয়ে, ভাল। একটি মানুষ দিয়ে, মানুষ must produce actions continuously — exactly burden gated variants অপসারণ করা হয় মানে। doubt term alone হল hands-off; conjunction না।
LazyDAgger: সুইচকে chattering থেকে থামান
Hoque এবং সহকর্মীরা (2021) আক্রমণ করেন একটি খরচ আগের papers পরিমাপ না: সুইচ নিজেই। প্রতিটি হস্তক্ষেপ "interrupts অন্যান্য কাজ মানুষ করছে, incurs latency প্রতিটি context switch এ তত্ত্বাবধায়ক এবং স্বায়ত্তশাসিত নিয়ন্ত্রণ মধ্যে, এবং সময় প্রয়োজন সম্পাদন করতে"। একটি gate যা খোলে এবং বন্ধ হয় দশ বার একটি মিনিটে খারাপ একটি খোলা দশ সেকেন্ড, একই autonomous share এ। LazyDAgger extends SafeDAgger asymmetric thresholds দিয়ে — harder তত্ত্বাবধায়ক নিয়ন্ত্রণ enter করতে এর চেয়ে এটিতে থাকতে — তাই সিস্টেম অসিলেট করে না boundary এ। simulation এ এটি "পারে reduce context switches দ্বারা গড়ে ৬০% SafeDAgger এর উপর ৩ continuous control tasks এ যখন বজায় রাখে state-of-the-art policy performance"; fabric manipulation এ একটি ABB YuMi দিয়ে এটি "reduces context switches দ্বারা ৬০% যখন অর্জন করে ৬০% উচ্চতর সাফল্য rate এর চেয়ে SafeDAgger execution time এ"।
ThriftyDAgger: অভিনবত্ব বা ঝুঁকি, একটি বাজেটের অধীনে
ThriftyDAgger (Hoque et al., CoRL 2021) শুরু করে তত্ত্বাবধায়ক এর বাজেট থেকে রাজনীতি চেয়ে। এটি "ব্যবহার করে একটি learned switching policy solicit হস্তক্ষেপ শুধুমাত্র states এ যা যথেষ্ট (1) novel, রোবট policy কোন reference behavior আছে না অনুকরণ করতে, বা (2) risky, যেখানে রোবট low confidence আছে task completion এ", একটি নতুন metric দিয়ে সেই ঝুঁকি অনুমান করতে। বাজেট একটি input, না outcome: তুমি রাষ্ট্র কত মানব সময় তুমি ব্যয় করবে। execution time এ প্রয়োগ করা হয় পদ্ধতি "অর্জন করে ১০০% সাফল্য rate উভয় simulation এবং physical tasks এ", এবং একটি user study দশ অংশগ্রহণকারী দিয়ে তিন-রোবট fleet নিয়ন্ত্রণ করা একটি concentration task সাথে প্রতিবেদন করে যে এটি "বৃদ্ধি করে মানুষ এবং রোবট performance দ্বারা ৫৮% এবং ৮০% যথাক্রমে পরবর্তী সেরা algorithm এর তুলনায় যখন হ্রাস করে তত্ত্বাবধায়ক burden"। fleet setting প্রাকৃতিক বাড়ি এই কাজের জন্য; Fleet-DAgger পরে formalized interactive fleet learning একাধিক robots এবং supervisors দিয়ে, প্রস্তাব করে Return on Human Effort যেমন পরিমাণ optimize করতে।
HG-DAgger: মানুষ gate ধরে
Kelly et al. (2019) অন্য উপায় যান। কোন switching policy নেই। learner এ rolled out "যতক্ষণ বিশেষজ্ঞ পর্যবেক্ষণ করে যে novice একটি unsafe region এ প্রবেশ করেছে অবস্থা space এর", যে বিন্দু এ বিশেষজ্ঞ নিয়ন্ত্রণ নেয় এবং গাইড সিস্টেম ফিরিয়ে। aggregation rule কঠোর অংশ: "Expert action labels সংগ্রহ এবং যোগ করা হয় শুধুমাত্র dataset এ এই recovery trajectories সময় করা, যখন মানব বিশেষজ্ঞ নিরবচ্ছিন্ন নিয়ন্ত্রণ আছে সিস্টেম।" কিছু না labeled সময় মানুষ spectator।
এটি সুইচ এ থামে না। HG-DAgger also "শিখে একটি নিরাপত্তা threshold একটি model-uncertainty-based risk metric এর জন্য যা ব্যবহার করা পারে predict performance সম্পূর্ণ trained novice এর বিভিন্ন regions এ অবস্থা space এর": এটি logs মানব intervened মুহূর্ত এ learner কত uncertain ছিল এবং গড় করে শেষ quarter এর সেই রেকর্ড, যেখানে learner সবচেয়ে resembles তার চূড়ান্ত ফর্ম। যে না একটি gate রোবট কাজ করে কিন্তু একটি diagnostic বলে তোমাকে যেখানে সম্পূর্ণ policy প্রত্যাশা রাখতে হয়। মূল্যায়ন covers একটি simulated এবং একটি real-world driving task এবং প্রতিবেদন উন্নত performance উভয় DAgger এবং behavior cloning এর উপর।
একটি সম্পর্কিত লাইন পরিবর্তন কি counts হিসাবে একটি label। Spencer এবং সহকর্মীরা' Expert Intervention Learning hold যে "যেকোনো পরিমাণ expert feedback, whether দ্বারা হস্তক্ষেপ বা non-intervention, প্রদান করে তথ্য current state এর গুণমান সম্পর্কে, action এর optimality, বা উভয়", formalized একটি constraint হিসাবে learner এর value function এবং solved করে no-regret online learning দিয়ে। সেই পড়া অনুযায়ী, stretches যেখানে মানুষ দেখেছে এবং কিছু না করেছে দুর্বল ইতিবাচক প্রমাণ খালি চেয়ে। EIL শেখে collision avoidance লগ থেকে একটি মিনিট expert নিয়ন্ত্রণ।

ভেরিয়েন্ট পাশে পাশে
| পদ্ধতি | কে gate খোলে | সংকেত | প্রয়োজন উপলব্ধ | রিপোর্ট করা |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | কেউ না — learner সবসময় চালায় | কোন না; বিশেষজ্ঞ প্রতিটি visited state label করে | একটি বিশেষজ্ঞ সক্ষম label off-policy states সময় না নিয়ন্ত্রণে | No-regret reduction গ্যারান্টি দিয়ে learner এর অধীনে অবস্থা বিতরণ |
| HG-DAgger (Kelly et al., 2019) | মানব তত্ত্বাবধায়ক | তত্ত্বাবধায়ক এর রায় যে state unsafe | কেউ দেখছে, এবং একটি পরিষ্কার handover নিয়ন্ত্রণ এর | Beat DAgger এবং behavior cloning একটি simulated এবং একটি real driving task এ; also শেখে একটি ঝুঁকি threshold |
| SafeDAgger (Zhang & Cho, 2016) | রোবট | বাইনারি শ্রেণীবদ্ধকারী L2 বিচ্যুতির জন্য reference থেকে tau এর উপরে | একটি queryable reference policy শ্রেণীবদ্ধকারী এর labels এর জন্য | কম reference queries racing simulator এ, দ্রুত convergence (কোন figure দেওয়া) |
| EnsembleDAgger (Menda et al., 2019) | রোবট | Ensemble variance এবং distance বিশেষজ্ঞ action এর, উভয় threshold এর অধীনে | একটি ensemble networks এর প্লাস বিশেষজ্ঞ এর action প্রতিটি পদক্ষেপে | উন্নত নিরাপত্তা এবং শেখা pendulum এবং HalfCheetah এ |
| LazyDAgger (Hoque et al., 2021) | রোবট, hysteresis সাথে | SafeDAgger এর signal আলাদা entry এবং exit thresholds সাথে | যা SafeDAgger প্রয়োজন, প্লাস একটি দ্বিতীয় threshold tune করতে | ~৬০% কম context switches ৩ tasks এ; ৬০% উচ্চতর সাফল্য YuMi fabric এ |
| ThriftyDAgger (Hoque et al., 2021) | রোবট, একটি বাজেটের অধীনে | অভিনবত্ব, বা estimated ঝুঁকি না task সম্পূর্ণ করার | একটি learned ঝুঁকি estimator এবং একটি stated হস্তক্ষেপ বাজেট | ১০০% সাফল্য execution time এ; user study (N=10): ৫৮% এবং ৮০% লাভ next-best এর উপর |
| EIL (Spencer et al., 2020) | মানুষ — non-intervention counts too | হস্তক্ষেপ এবং তার অনুপস্থিতি constraints হিসাবে value function এর | অনলাইন no-regret শেখা একটি value constraint এর উপর | Collision avoidance একটি মিনিট প্রায় expert নিয়ন্ত্রণ থেকে |
প্রতিটি gate কি কেনে, এবং কি এটি চার্জ করে
"Needs" কলাম নিচে পড়ুন এবং একটি pattern পড়ে: প্রতিটি robot-gated signal সেখানে একটি proxy যা manufactured হতে হবে, এবং প্রতিটি proxy তার নিজস্ব বিল আছে।
- Discrepancy signals (SafeDAgger, LazyDAgger, অর্ধেক EnsembleDAgger এর rule) প্রয়োজন একটি reference policy। আপনার হয় একটি scripted বিশেষজ্ঞ, যে কেস এ interesting সমস্যা ইতিমধ্যে সমাধান করা হয়, বা একটি মানুষ keeps producing actions background এ তাই একটি distance পারে computed হতে পারে।
- Doubt signals প্রয়োজন calibrated epistemic uncertainty। একটি ensemble ছোট control networks এর approximate এটি; একটি ensemble একটি তিন-বিলিয়ন-parameter vision-language-action মডেল একটি মেমোরি এবং latency সমস্যা প্রথম।
- Novelty এবং ঝুঁকি signals প্রয়োজন একটি learned task completion এর estimator, fitted যথেষ্ট সফল এবং ব্যর্থ rollouts এ। একটি task এ তুমি এখনও getting কাজ করতে, যে ডেটা না exist পর্যায় এক এ।
- মানুষ gate প্রয়োজন মনোযোগ এবং কিছু আর না — একমাত্র signal উপলব্ধ দিন এক এ, যেকোনো policy architecture, অতিরিক্ত model প্রশিক্ষণ ছাড়া।
- কোন রোবট gate সরিয়ে দেয় মানুষ room থেকে। তারা হ্রাস করে কিভাবে প্রায়ই মানুষ must act, না যদি তারা উপস্থিত হতে হবে।
একটি quieter পার্থক্য আছে যা gate উত্পাদন করে। একটি robot gate firing mid-trajectory হাতে একটি ব্যক্তি একটি চলমান arm একটি arbitrary pose এ। একটি মানুষ gate অপারেটর pick করতে দেয় মুহূর্ত — পৌঁছানোর পরে, grasp আগে, না মধ্য দিয়ে swing। recovery segments দুটি থেকে না সমানভাবে পরিষ্কার, এবং এই segments সম্পূর্ণ পণ্য round এর।
কেন মানব-gated ফর্ম জয় প্রকৃত হার্ডওয়্যার এ
এটি একটি প্রকৌশল argument, না একটি benchmark ফলাফল — কোন paper আমরা পাওয়া চালায় সব পাঁচ gates একটি একই manipulator এ একটি একই policy class দিয়ে। এটি রেস্ট করে চার পয়েন্ট এ।
প্রথম, তত্ত্বাবধায়ক সেখানে যেকোনভাবে। কেউ না leaves একটি SO-100 arm চলছে একটি objects সাথে পাশে যা নক করতে পারে। একবার কেউ দেখছে, মার্জিনাল খরচ তাদের একটি takeover button দেওয়া nearly শূন্য; একটি calibrated ঝুঁকি estimator নির্মাণ একটি প্রকল্প।
দ্বিতীয়, uncertainty তুমি পারো সত্যিই পরিমাপ একটি আধুনিক policy এ প্রায়ই wrong quantity। একটি diffusion বা flow-matching হেড উত্পাদন করে variance জুড়ে sampled action chunks, এবং যে variance প্রতিফলিত করে multimodality হেড প্রশিক্ষিত represent করা, না epistemic অজ্ঞতা অবস্থা সম্পর্কে। EnsembleDAgger এর doubt term ব্যবহার করে ensemble সঠিকভাবে উভয় ক্যাপচার করতে। দুটি একটি একই সংখ্যা দেখেন এবং না; the action chunking এবং flow matching entries cover কিভাবে সেই heads emit actions প্রথম জায়গা।
তৃতীয়, ব্যর্থতা যা গুরুত্বপূর্ণ manipulation এ প্রায়ই semantic বনাম statistically unusual। একটি policy closing gripper দুই centimetres প্রাথমিক, বা reaching আত্মবিশ্বাসের সাথে wrong এক দুটি identical cubes এর, না একটি high-variance state — এটি আত্মবিশ্বাসী এবং ভুল। কোন variance threshold ধরে যে; ব্যক্তি দেখছে ধরে যে অবিলম্বে।
চতুর্থ, label গুণমান — মূল HG-DAgger পয়েন্ট, এবং এক সবচেয়ে প্রায়ই skipped। Labels সংগ্রহ মানুষ নিরবচ্ছিন্ন নিয়ন্ত্রণ আছে যখন beat labels narrated একটি চলমান সিস্টেম উপর। যদি লক্ষ্য corrective ডেটা সমষ্টিকরণ মূল্য, burden প্রমাণ lies স্বয়ংক্রিয় gate দিয়ে।
ছবি ফ্লিপ যখন একটি তত্ত্বাবধায়ক responsible অনেক robots — regime ThriftyDAgger এর user study এবং Fleet-DAgger এর formalisation লক্ষ্য। একটি fleet দিয়ে, মানুষ মনোযোগ scarce resource এবং একটি imperfect বরাদ্দ beats কোন। একটি arm এক ডেস্ক এ তুমি না সেই regime এ।
মানব-gated loop, ইতিমধ্যে wired আপ
Takeover চলমান একটি inference সেশন সময়, per-frame হস্তক্ষেপ flags corrected segments এ, curating প্রতিটি চালান corrections বা মূল্যায়ন মধ্যে, composing একটি মিশ্র dataset sources থেকে তুমি pick, এবং চালিয়ে যাওয়া প্রশিক্ষণ একটি বিদ্যমান checkpoint থেকে built হয় বরং scripted হয়। Takeover কাজ করে একটি leader arm দিয়ে, বা keyboard এবং sliders দিয়ে যদি তুমি না একটি পাও।
দেখুন কিভাবে DAgger loop চালায়Gate অর্ধেক পদ্ধতি; ডেটা হ্যান্ডলিং অন্য অর্ধেক
একটি gate সিদ্ধান্ত যা frames একটি মানুষ চালিত, না কি তাদের সাথে করতে, এবং সেই দ্বিতীয় সিদ্ধান্ত যেখানে rounds সবচেয়ে প্রায়ই litter হয়। প্রথম rule যা D DAgger এ দাঁড়িয়ে আছে: aggregate, না replace। Fine-tuning একটি checkpoint সম্পূর্ণভাবে কয়েক শত correction frames এ দেয় তোমাকে একটি মডেল যা দেখেছে প্রায় কিছু না কিন্তু recoveries এবং forgot nominal trajectory।
দ্বিতীয় rule যে হস্তক্ষেপ frames না সাধারণ frames। Mandlekar et al. নির্মিত একটি remote-teleoperation সিস্টেম ৬-DoF manipulation জন্য অপারেটর letting নীতি নিরীক্ষণ এবং take ব্যর্থতা পর করে, তারপর প্রশিক্ষিত iteratively একটি algorithm দিয়ে যা "উৎসাহিত করে policy শিখতে কিভাবে traverse bottlenecks through intervations"; agents প্রশিক্ষিত সেই ডেটা উপর outperformed agents প্রশিক্ষিত একটি সমান সংখ্যা সাধারণ demonstration নমুনা। Sirius ঠেলে দেয় ধারণা deployment মধ্যে, "re-weighing প্রশিক্ষণ নমুনা approximated মানুষ বিশ্বাস দিয়ে এবং optimizing policies weighted behavioral cloning দিয়ে". উভয় প্রয়োজন একটি per-frame marker কী ছিল human-driven, যা কেন the intervention flag বিষয় যা দেখায় তার চেয়ে বেশি।
তৃতীয় rule যে স্বয়ংক্রিয় মিশ্রণ একটি trap। একটি রচিত dataset যার sources তুমি করতে পারো না enumerate একটি তুমি করতে পারো না debug যখন পরবর্তী round খারাপ পায়। এই প্ল্যাটফর্মে compose পদক্ষেপ স্পষ্ট যে কারণে — মূল dataset প্লাস corrections, episode নির্বাচন প্রতি উৎস, এবং ফলাফল একটি সাধারণ LeRobot dataset যা syncs এবং trains যেমন অন্য কোনো; the dataset ডকুমেন্টেশন covers ফর্ম্যাট দিক।
| পদক্ষেপ একটি round এ | কি এটি উত্পাদন করে | সবচেয়ে সাধারণ উপায় এটি যায় ভুল |
|---|---|---|
| চালান inference রেকর্ডিং দিয়ে | একটি চালান policy এর নিজস্ব অবস্থা বিতরণ অধীনে | রেকর্ড করা প্লেইন teleoperation হিসাবে, হারায় যে একটি policy ছিল চালিয়ে |
| নিয়ন্ত্রণ নিন ব্যর্থতা এ | সংশোধন segments একটি per-frame হস্তক্ষেপ flag দিয়ে | সংশোধন cosmetic wobble, শিক্ষা শৈলী বনাম একটি পুনরুদ্ধার |
| Curate প্রতিটি episode | সংশোধন, মূল্যায়ন, বা discards | রাখা সবকিছু; একটি botched takeover খরচ আরও episode মূল্যবান ছিল |
| Sync সংশোধন | একটি versioned dataset পাশে মূল | সংশোধন যে never ছেড়ে স্থানীয় মেশিন |
| Compose মিশ্র dataset | মূল প্লাস সংশোধন, স্পষ্ট নির্বাচন | silent auto-mixing, তাই একটি পরে regression করতে পারো না traced একটি উৎস করতে |
| চালিয়ে যান একটি checkpoint থেকে | একটি checkpoint initialised পূর্ববর্তী এক থেকে | আশা করা optimizer resume; weights initialise মডেল, তারা না restore optimizer state |
একটি গেট একটি ব্যক্তি আসলেই ধরতে পারেন সেটিং করা
"মানুষ সিদ্ধান্ত নেয়" না একটি স্পেসিফিকেশন। দুটি অপারেটর বিভিন্ন থ্রেশহোল্ড সহ উত্পাদন incomparable rounds, এবং একটি দ্রুত threshold উত্পাদন একটি trend তুমি করতে পারো না পড়ুন। লিখুন triggers নিচে পূর্ব প্রথম চালান।
- নাম শর্ত যে gate খোলে — পদ্ধতি বন্ধ বেশি একটি fixed মার্জিন, gripper বন্ধ কিছু না, একটি joint ড্রিফট করা একটি limit তরফ, একটি stall বেশি একটি সেকেন্ড বা দুই — এবং রাখুন তালিকা unchanged round জন্য।
- নাম কি করে না খোলে। Overshoot policy পুনরুদ্ধার করে এর নিজস্ব প্রশিক্ষণ signal; নেওয়া তাই উপর ডিলেট একটি পুনরুদ্ধার এটি ইতিমধ্যে জানে।
- নিয়ন্ত্রণ নিন প্রাথমিক যথেষ্ট একটি পরিষ্কার handover জন্য, হাতে ফিরিয়ে দেওয়া যত তাড়াতাড়ি অবস্থা recoverable।
- লগ কেন তুমি নিয়ন্ত্রণ নিয়েছ, প্রতি episode। তিন rounds পরে এটি একমাত্র রেকর্ড যদি একই ব্যর্থতা ফেরত।
- রাখুন ক্যামেরা, task text এবং অপারেটর constant জুড়ে rounds। পরিবর্তন একটি এবং সংখ্যা বন্ধ থাকে comparable।
Mechanically handover আছে দুটি ভেরিয়েন্ট। একটি leader arm দিয়ে, leader পৌঁছেতে হবে follower এর বর্তমান pose আগে torque transfer, বা arm ঝাঁপ; এই সারিবদ্ধকরণ পদক্ষেপ যা least-tested অংশ চেইন এর উপর প্রকৃত হার্ডওয়্যার। একটি leader arm ছাড়া takeover হল manual প্রথম keypress থেকে: follower held হয় এবং অপারেটর nudges এটি joint দ্বারা joint keyboard থেকে বা ড্র্যাগ sliders, server-side clamps রাখে প্রতিটি ইনপুট ছোট — একটি দম্পতি degree প্রতি keypress, একটি মুষ্টি প্রতি slider আপডেট, কারণ একটি বড় পদক্ষেপ একটি held pose মধ্যে কীভাবে তুমি strip একটি servo। step-by-step সংস্করণ key বাইন্ডিং সাথে আছে in একটি DAgger round এর walkthrough একটি SO-100 উপর; background উভয় teleoperation mode এ আছে in teleoperation docs এবং the leader-follower entry.

পড়া যদি gate কিছু করেছে
metric একটি মানব-gated round এর intervention rate: হস্তক্ষেপ frames বিভক্ত করে frames run এর দ্বারা। এটা আছে একটি কাজ — যদি এটি na fall জুড়ে rounds, round কিনেছে কিছু না, এবং পরবর্তী একটি করা উচিত পরিবর্তন কিছু অন্য ডেটা পরিমাণ চেয়ে।
এটা একটি biased metric এবং তুমি জানা উচিত কিভাবে। এটা পরিমাপ করে অপারেটর এর threshold যতটা policy এর যোগ্যতা, যা কেন trigger তালিকা থাকে fixed; একটি অপারেটর relaxes করে একটি সেশন উপর প্রযোজনীয় একটি falling বক্ররেখা কিছু ছাড়াই। এটা also ignores গুরুত্ব — দশ frames রোধ একটি collision এবং দশ nudge একটি grasp দেখেন একই। যোগী এটা একটি fixed মূল্যায়ন সেট নো correction ডেটা ছিল ever ড্র from। নিবন্ধ পরিমাপ একটি DAgger loop এ কাজ মধ্য দিয়ে মূল্যায়ন ডিজাইন, সহ কিভাবে রাখতে মূল্যায়ন episodes বাইরে প্রশিক্ষণ মিশ্রণ।
- কাজ করে দিন এক, যেকোনো policy architecture, নো extra মডেল calibrate করতে
- ধরে আত্মবিশ্বাসী এবং ভুল ব্যর্থতা নো variance threshold detects
- উত্পাদন সংশোধন রেকর্ড করা হয় অপারেটর পাওয়া পূর্ণ নিয়ন্ত্রণ, একটি মুহূর্তে তারা নির্বাচিত
- Yields একটি per-frame মার্কার যে intervention-weighted পদ্ধতি যেমন IWR এবং Sirius গ্রাহক
- খরচ অবিরাম তত্ত্বাবধান; এটা স্কেল না করে একটি ব্যক্তি এবং অনেক robots
- নির্ভর করে অপারেটর সামঞ্জস্য — একটি ড্রিফট threshold corrupts intervention rate
- উত্পাদন নো ঝুঁকি মডেল তার নিজস্ব; HG-DAgger এর learned threshold এবং ThriftyDAgger এর estimator অতিরিক্ত মেশিনারি
- গণনা frames, না পরিণতি
- করতে পারো না rescue একটি policy যার ব্যর্থতা upstream নিয়ন্ত্রণ, যেমন একটি swapped ক্যামেরা বা একটি mislabelled task string
খোলা প্রশ্ন worthwhile রাখতে দৃশ্য
benchmarks দুর্বল। Spencer এবং সহকর্মীরা পরীক্ষা করেছে সেই imitation learning পদ্ধতি পরীক্ষা করতে ব্যবহৃত এবং পাওয়া তাদের "realizable এবং সরল এবং তাই অপর্যাপ্ত capturing harder regime error compounding দেখা real-world সিদ্ধান্ত গ্রহণের সমস্যা", — এবং, আশেপাশে সাহিত্য বিপরীতে, পাওয়া সাধারণ behavior cloning তাদের ভাল করেছে। সেই কারণ সন্দেহ করা যেকোনো ranking DAgger variants রেস্টিং সেই tasks এ, সহ কিছু সংখ্যা টেবিল এ।
রোবট gates বড় policies এ না সমাধান করা। AIM কাজ প্রতিস্থাপন করে uncertainty একটি proxy Q-function দিয়ে mimicking মানুষ হস্তক্ষেপ rule এবং প্রতিবেদন একটি ৪০% উন্নতি take-over খরচে এবং শেখা দক্ষতা ThriftyDAgger এর উপর — continuous এবং discrete নিয়ন্ত্রণে, না একটি vision-language-action মডেল চালায় একটি manipulator। যদি এই gates স্থানান্তর একটি fine-tuned VLA খোলা। survey করে একটি সম্পর্কিত পয়েন্ট: ফিল্ড terminology এবং কাঠামো না একীভূত জুড়ে সাহিত্য, যা করে পদ্ধতি কঠিন তুলনা। তোমার নিজস্ব arm এ, তোমার logs প্রমাণ তোমার আছে।
করে HG-DAgger সত্যিই DAgger যদি মানুষ শুধু শুধু labels হস্তক্ষেপ সময়?▾
এটা রাখে অংশ যা বিষয় — ডেটা সংগ্রহ learner নিরভুল করা অবস্থা বিতরণ অধীনে, একত্রিত কি এসেছে আগে — এবং ড্রপ অংশ যা না survive যোগাযোগ হার্ডওয়্যার দিয়ে। Kelly et al. উপস্থাপন এটা একটি ভেরিয়েন্ট হিসাবে; ২০११ no-regret গ্যারান্টি carry না করে অপরিবর্তিত।
করতে পারি আমি ব্যবহার একটি রোবট gate একটি fine-tuned VLA policy এ একটি SO-100 এ?▾
না straightforwardly। SafeDAgger এর শ্রেণীবদ্ধকারী প্রয়োজন একটি queryable reference policy তুমি না পাও। EnsembleDAgger প্রয়োজন একটি ensemble, যা একটি মাল্টি-বিলিয়ন-parameter মডেল জন্য মানে বেশ সংখ্যক কপি মেমোরি এ প্লাস তাদের অনুমান খরচ। ThriftyDAgger প্রয়োজন একটি ঝুঁকি estimator fitted সাফল্য এবং ব্যর্থতা যে না exist তোমার প্রথম rounds আগে।
কত দীর্ঘ করা উচিত একটি একক takeover থাকেন?▾
দীর্ঘ যথেষ্ট পৌঁছাতে একটি অবস্থা policy পারে অব্যাহত রাখা থেকে, এবং না বেশি: extended takeovers চালু run মধ্যে একটি প্রদর্শন সেশন এবং বন্যা সংশোধন সেট nominal আচরণ দিয়ে। LazyDAgger এর অনুসন্ধান কাট অন্য উপায় খুব — অনেক খুব ছোট সুইচ তাদের নিজস্ব খরচ।
করা উচিত আমি প্রশিক্ষণ শুধু সংশোধন segments এ?▾
না — যে সবচেয়ে সাধারণ উপায় বর্জ্য একটি round। একটি মডেল fine-tuned শুধু recoveries এ দেখেছে প্রায় কিছু না কিন্তু recoveries। মিশ্রণ সংশোধন মূল dataset মধ্যে sources দিয়ে স্পষ্টভাবে নির্বাচিত; যাও আরও দূর, দেখুন intervention-weighted পদ্ধতি যেমন IWR বা Sirius, যা আপ-ওজন human-driven frames বনাম বিচ্ছিন্ন তাদের।
কি যদি হস্তক্ষেপ rate না পড়ে একটি round পরে?▾
নিন এটা মুখ মূল্য: round সাহায্য করেনা। ঠিক আগে যোগ সংশোধন, চেক সস্তা ব্যাখ্যা — অপারেটর এর threshold drift, সংশোধন ছিল cosmetic, রচিত dataset আসলেই তাদের রয়েছে, প্রশিক্ষণ initialised থেকে intended checkpoint। একটি round যে silently শুরু করেছিল base মডেল থেকে দেখায় ঠিক যেমন একটি round যা ব্যর্থ হয়েছে শিখতে।
করে non-intervention বহন তথ্য?▾
অনুযায়ী Expert Intervention Learning, হ্যাঁ: stretches যেখানে তত্ত্বাবধায়ক দেখেছে এবং act না রেড হয় দুর্বল প্রমাণ অবস্থা এবং action স্বীকার্য, formalized একটি constraint হিসাবে value function। বেশি ব্যবহারিক pipeline, এই একটি সহ, মার্ক শুধুমাত্র কী মানুষ চালিত।
একটি একক arm একটি ডেস্ক এ পছন্দ করা হয়: gate নিজেকে ধরুন, লিখুন নিচে কি খোলে, এবং ব্যয় প্রচেষ্টা ডেটা হ্যান্ডলিং বনাম automating সুইচ। প্ল্যাটফর্ম পাশ বর্ণিত আছে on DAgger loop page, প্রশিক্ষণ বিকল্প প্রতি policy পরিবার অনুযায়ী প্রশিক্ষণ এবং মূল্য নির্ধারণ। পটভূমি জন্য, শুরু করুন অনুকরণ শেখা এবং অনুকরণ শেখা SO-100 এ; প্রথম run জন্য, চালান তোমার প্রথম policy짧er পথ।
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started