
DAgger ساده از انسانی میخواهد که حالات را برچسبگذاری کند در حالیکه ربات هنوز در حال رانندگی است. در سختافزار واقعی این امر ناایمن است و برچسبهای ضعیفی تولید میکند. تغییرات دروازهای، برچسبگذاری کور را با دروازهای جایگزین میکنند که کسی باید آن را نگهدارد: انسان در HG-DAgger، کلاسیفایر ایمنی در SafeDAgger، اختلاف انسامبل در EnsembleDAgger، برآورد بودجهای نوآوری و ریسک در ThriftyDAgger. این مقاله آنها را بر اساس مقایسه میکند که چه کسی مالک دروازه است، چه سیگنالی آن را باز میکند، و هر کدام چه هزینهای دارد — و چرا شکل کنترلشدهتوسطانسان همان است که از تماس با بازوی واقعی درنمیآید.
سیاست کلونشده جایی شکست میخورد که دادههای آموزشی تمام شود. راهحل ادامه جمعآوری داده تحت توزیع حالت سیاست خود به جای نمایشگر است، که DAgger این کار را انجام میدهد و the introduction to dataset aggregation از اصول بنیادی پوشش میدهد. این قسمت محرج الگوریتم اصلی را باز میگذارد: در حالیکه یادگیرنده رانندگی میکند، متخصص باید برای هر حالت بگوید که چه کاری انجام میداد، بدون اینکه کنترل داشته باشد.
در شبیهساز با متخصص دستنویسشده این رایگان است. بر روی میز با بازوی واقعی، نه رایگان است و نه ایمن. نویسندگان HG-DAgger اعتراض را دقیقاً بیان میکنند: چنین طرحهای نمونهگیری «نیاز دارند متخصص برچسبهای عملی بدون کنترل کامل سیستم فراهم کند»، که «میتواند ایمنی را کاهش دهد و هنگام استفاده از انسانها به عنوان متخصصان، احتمال کاهش کیفیت برچسبهای جمعآوریشده به دلیل تاخیر عملگر درکشده وجود دارد» (Kelly و همکاران، ۲۰۱۹). دو شکست در آن جمله پنهان است: سیاست همیشه در حالات رانندگی میکند که هیچکس نمیخواهد، و برچسبهایی که با آن ریسک خریدهاند بدتر از آنچه انسان انجام میدهد در حالیکه کنترلها را نگهدارد است. هر تغییر زیر به همان سؤال پاسخ میدهد — دروازهای بر کنترل قرار دهید و به کسی اجازه دهید تصمیم بگیرد که چه زمانی باز شود. آنها از نظر اینکه این شخص کی است متفاوت است.
نسخه کوتاه
- •تغییرات دروازهای برچسبگذاری کور را با تبدیل بین کنترل سیاست و کنترل متخصص جایگزین میکنند. آنچه آنها را جدا میکند این است که چه کسی مالک تبدیل است.
- •HG-DAgger تبدیل را به انسان میدهد و فقط دادههای ضبطشده در حین کنترل بدون وقفه انسان را جمعآوری میکند.
- •SafeDAgger آن را به کلاسیفایر دودویی پیشبینیکننده انحراف از سیاست مرجع میدهد؛ EnsembleDAgger به واریانس کم انسامبل و فاصله کوچک تا عملی متخصص بهطور همزمان نیاز دارد.
- •LazyDAgger هیسترزیس اضافه میکند تا کنترل پینگپنگ نشود؛ ThriftyDAgger بر نوآوری یا ریسک تخمینی تحت بودجه مداخله صریح دروازه میگذارد.
- •سیگنالهای دروازهای ربات نیاز به چیزی دارد که VLA تنظیمشده دقیق بر روی بازوی کلاس سرگرمی معمولاً فاقد آن است: سیاست مرجع، انسامبل ارزان یا عدماطمینان شناختی کالیبرهشده.
- •دروازه نیمی از روش است. آنچه بعداً به بخشهای مداخله میشود — ترکیب، وزن، جمعآوری — تصمیم میگیرد که آیا دور بهبودی آورد.
کنترلشدهتوسطانسان و کنترلشدهتوسطربات: جدایی که اهمیت دارد
یادگیری تقلیدکنندگی تعاملی بررسی خود را دارد؛ Celemin و همکاران آن را در کنار نوع بازخورد، رابط، مدل یادگیری، تجربه کاربر، کاربرد و معیار فهرست میکنند. تمایزی که تصمیم میگیرد مهندسی شما سادهتر از هر یک از آن محورها است، و کار اخیر آن را مستقیماً نامگذاری میکند: یک روش human-gated زمانی که ناظر تصمیم میگیرد چه زمانی مداخله کند، و robot-gated زمانی که عامل تصمیم میگیرد چه زمانی کمک بخواهد (Cai و همکاران، ۲۰۲۵). بقیه ماشینآلات خدمت یکی از آن دو انتخاب است. تبدیل از ابتدا قابل رویت است: دروازه انسان توجه مستمر هزینه دارد، و دروازه ربات وعده میدهد تا آن توجه را برگرداند — اما فقط اگر سیگنالی که دروازه میگذارد قابل اطمینان باشد، و ساخت آن سیگنال مسئله تحقیق خود است.
SafeDAgger: کلاسیفایری که انحراف خود را پیشبینی میکند
SafeDAgger Zhang و Cho (۲۰۱۶) اولین این دروازهها است. پرسوجو کردن سیاست مرجع بخش گران است، بنابراین شبکه دوم کوچک — سیاست ایمنی — پیشبینی میکند که آیا پرسوجو اصلاً ارزشمند است. این «برچسب دودویی را برمیگرداند که نشان میدهد آیا سیاست اولیه احتمالاً بدون پرسوجو از سیاست مرجع منحرف میشود». برچسب از نظر انحراف مربع L2 بین اقدامات دو سیاست با حد tau تعریف میشود، و کلاسیفایر با آنتروپی متقابل دودویی مناسب است. در زمان اجرا برای هر حالت تصمیم میگیرد که آیا یادگیرنده رانندگی را ادامه میدهد یا مرجع تصاحب میکند. چکیده گزارش کمتر پرسوجوهای مرجع در شبیهساز مسابقه رانندگی به علاوه سرعت بخشیدن همگرایی را بیان میکند که نویسندگان آن را به اثر برنامهدرسی خودکار نسبت میدهند، بدون اینکه رقمی برای هر یک بدهند.
نکته تعریف است، نه نتایج. آموزش کلاسیفایر نیاز به اقدام سیاست مرجع در هر حالت مورد استفاده برای متناسب کردن آن دارد، که فرض میکند مرجع برنامهای دیگر است. اگر مرجع شما شخصی با بازوی رهبری است، آن مجموعه برچسب ارزان نیست و روش خصوصیتی را که برای آن طراحی شدهای را از دست میدهد.
EnsembleDAgger: شک و اختلاف، هردو
Menda، Driggs-Campbell و Kochenderfer (۲۰۱۹) دروازه را به عنوان سؤال احتمالی تلقی میکنند. EnsembleDAgger «فرآیند گاوسی را با استفاده از انسامبل شبکههای عصبی تقریب میزند» و واریانس انسامبل را به عنوان پروکسی اعتماد میخواند: واریانس بالا منطقهای بر خلاف دادههای آموزشی است که — با فرض اینکه متخصص از حالات شکست اجتناب کند — با نزدیکی به شکست همبستگی دارد. قانون ترکیب است. یادگیرنده فقط میتواند عمل کند زمانی که فاصله L2 بین اقدام میانگین خود و اقدام متخصص زیر یک حد باشد (اختلاف) و واریانس اقدام پیشبینیشده خود زیر دوم (شک) باقی میماند. اگر هر کدام شکست بخورد، متخصص کنترل را برعهده میگیرد. هدف حداکثر کردن سهم اقدام یادگیرنده با محدود کردن احتمال شکست است؛ مقاله بهبود ایمنی و یادگیری در مقابل سایر تغییرات DAgger بر روی پاندول معکوس و MuJoCo HalfCheetah گزارش میدهد.
این به آرامی قانون کامل را برای نظارت بدون دست کنار میگذارد. فاصله بین اقدام یادگیرنده و متخصص، اقدام متخصص را در آن حالت، در آن لحظه نیاز دارد. با متخصص دستنویسشده، خوب. با انسان، انسان باید به طور مستمر اقدامات انجام دهد — دقیقاً بار تحمل تغییرات دروازهای برای حذف آن بود. ترم شک به تنهایی بدون دست است؛ ترکیب نیست.
LazyDAgger: متوقف کردن تبدیل از صحبت
Hoque و همکاران (۲۰۲۱) هزینهای را که مقالات قبلی اندازهگیری نکردند مورد حمله قرار دادند: خود تبدیل. هر مداخله «کار دیگری را که انسان انجام میدهد قطع میکند، تاخیری را با هر تبدیل زمینه بین کنترل ناظر و خودمختار ایجاد میکند، و زمان انجام را نیاز دارد». دروازهای که ده بار در دقیقه باز و بسته شود بدتر از یکی است که یک بار برای ده ثانیه باز شود، در سهم خودمختار یکسان. LazyDAgger SafeDAgger را با حد آستانه نامتقارن گسترش میدهد — سختتر برای ورود به کنترل ناظر نسبت به ماندن در آن — بنابراین سیستم در مرز نوسان نمیکند. در شبیهسازی میتواند «تبدیلهای زمینه را به طور متوسط ۶۰ درصد در مقابل SafeDAgger در ۳ کار کنترل مستمر کاهش دهد و در حالیکه عملکرد سیاست پیشرفته را حفظ میکند»؛ در دستکاری پارچه با ABB YuMi «تبدیلهای زمینه را ۶۰ درصد کاهش میدهد و رسیدن به ۶۰ درصد نرخ موفقیت بیشتر از SafeDAgger در زمان اجرا».
ThriftyDAgger: نوآوری یا ریسک، تحت بودجه
ThriftyDAgger (Hoque و همکاران، CoRL ۲۰۲۱) از بودجه ناظر شروع میشود نه سیاست. این «از سیاست تبدیل یادگرفته استفاده میکند تا مداخلات فقط در حالات کافی (۱) نو را درخواست کند، جایی که سیاست ربات هیچ رفتار مرجعی برای تقلید ندارد، یا (۲) پرخطر، جایی که ربات اعتماد کم به تکمیل کار دارد»، با معیار جدید برای برآورد آن ریسک. بودجه ورودی است، نه خروجی: شما بیان میکنید چقدر وقت انسانی خرج میکنید. در زمان اجرا اعمالشده روش «۱۰۰ درصد نرخ موفقیت در هر دو کار شبیهسازی و فیزیکی را میرسد»، و مطالعه کاربر با ده شرکتکننده کنترل کنندگی ناوگان سه ربات در کنار کار غلظت گزارش میدهد که این «عملکرد انسان و ربات را به ترتیب ۵۸ درصد و ۸۰ درصد در مقابل الگوریتم بعدی بهتری افزایش میدهد و بار ناظر را کاهش میدهد». تنظیم ناوگان خانه طبیعی برای این کار است؛ Fleet-DAgger بعداً یادگیری ناوگان تعاملی را با رباطهای متعدد و نظارتکنندگان رسمی کرد، Return on Human Effort را به عنوان کمیتی برای بهینهسازی پیشنهاد میدهد.
HG-DAgger: انسان دروازه را نگهدارد
Kelly و همکاران (۲۰۱۹) به سمت دیگر میروند. سیاست تبدیل وجود ندارد. یادگیرنده «تا زمانیکه متخصص مشاهده کند که تازهکار در منطقه ناامن فضای حالت وارد شدهاست» به بیرونریزی میشود، در نقطهای که متخصص کنترل را به عهده میگیرد و سیستم را راهنمایی میکند. قانون تجمیع قسمت سخت است: «برچسبهای اقدام متخصص فقط در طی این مسیرهای بازیابی جمعآوری و به مجموعه داده اضافه میشوند، در طی آن متخصص انسانی کنترل بدون وقفه سیستم دارد.» هیچچیز برچسبگذاری نمیشود در حالیکه انسان تماشاگر است.
این در تبدیل متوقف نمیشود. HG-DAgger همچنین «آستانه ایمنی را برای معیار ریسک مبتنی بر عدماطمینان مدل یادگیری میکند که میتواند برای پیشبینی عملکرد تازهکار کاملاً آموزششده در منطقههای مختلف فضای حالت استفاده شود»: این چگونگی عدماطمینان یادگیرنده در لحظات مداخله انسان را ثبت میکند و میانگین ربع آخر آن رکوردها را میگیرد، جایی که یادگیرنده بیشتر به شکل نهایی خود شبیه است. این دروازهای نیست که ربات کار میکند بلکه تشخیص است که به شما میگوید کجا سیاست نهایی انتظار میرود نگهدارد. ارزیابی کار رانندگی شبیهسازیشده و واقعی را پوشش میدهد و گزارش عملکرد بهبودیافته را بر هر دو DAgger و رفتار کلونی ارائه میدهد.
یک خط مرتبط آنچه به عنوان برچسب شمار میرود را تغییر میدهد. Expert Intervention Learning Spencer و همکاران بر این دارد که «هر مقدار بازخورد متخصص، چه توسط مداخله یا عدممداخله، اطلاعات در مورد کیفیت حالت فعلی، بهینگی اقدام، یا هردو فراهم میکند»، رسمیشده به عنوان محدودیت در تابع ارزش یادگیرنده و حلشده با یادگیری آنلاین بدونپشیمانی. تحت آن خواندن، دورهای جایی که انسان تماشا کرد و کاری نکرد شواهد ضعیف مثبت است نه خالی. EIL از حدود یک دقیقه کنترل متخصص اجتناب از تصادم را یادگیری میکند.

تغییرات در کنار هم
| روش | چه کسی دروازه را باز میکند | سیگنال | نیازهای دسترسی | گزارششده |
|---|---|---|---|---|
| DAgger (Ross و همکاران، ۲۰۱۱) | هیچکس — یادگیرنده همیشه رانندگی میکند | هیچچیز؛ متخصص هر حالت بازدیدشده را برچسبگذاری میکند | متخصصی که قادر است حالات خارجسیاست را بدون کنترل برچسبگذاری کند | کاهش بدونپشیمانی با ضمانتهای تحت توزیع حالت یادگیرنده |
| HG-DAgger (Kelly و همکاران، ۲۰۱۹) | ناظر انسانی | قضاوت ناظر که حالت ناامن است | کسی که نظارت میکند، و انتقال کنترل پاک | DAgger و رفتار کلونی را در کار رانندگی شبیهسازیشده و واقعی شکست میدهد؛ همچنین آستانه ریسک را یادگیری میکند |
| SafeDAgger (Zhang و Cho، ۲۰۱۶) | ربات | کلاسیفایر دودویی برای انحراف L2 از مرجع بالاتر از تائو | سیاست مرجع قابلپرسوجویی برای برچسبهای کلاسیفایر | پرسوجوهای مرجع کمتر در شبیهساز مسابقه رانندگی، همگرایی سریعتر (رقم داده نشده) |
| EnsembleDAgger (Menda و همکاران، ۲۰۱۹) | واریانس انسامبل و فاصله تا اقدام متخصص، هردو تحت حد | انسامبل شبکهها به علاوه اقدام متخصص در هر مرحله | ایمنی و یادگیری بهبودیافته بر روی پاندول و HalfCheetah | LazyDAgger (Hoque و همکاران، ۲۰۲۱) |
| ربات، با هیسترزیس | سیگنال SafeDAgger با حد ورودی و خروجی جداگانه | آنچه SafeDAgger نیاز دارد، به علاوه حد دوم برای تنظیم | حدود ۶۰ درصد تبدیلهای زمینه کمتر در ۳ کار؛ ۶۰ درصد موفقیت بیشتر در پارچه YuMi | ThriftyDAgger (Hoque و همکاران، ۲۰۲۱) |
| ربات، تحت بودجه | نوآوری یا ریسک تخمینی عدم تکمیل کار | برآوردگر ریسک یادگرفته و بودجه مداخله اعلامشده | ۱۰۰ درصد موفقیت در زمان اجرا؛ مطالعه کاربر (N=۱۰): ۵۸ درصد و ۸۰ درصد بهرههای بیشتر از بعدیبهتری | EIL (Spencer و همکاران، ۲۰۲۰) |
| انسان — عدممداخله نیز شمارش میشود | مداخله و نبود آن به عنوان محدودیتهای تابع ارزش | یادگیری آنلاین بدونپشیمانی بر روی محدودیت ارزش | اجتناب از تصادم از حدود یک دقیقه کنترل متخصص | آنچه که هر دروازه میخرد، و آنچه که شارژ میکند |
پایین ستون «نیازها» بخوانید و الگویی بیرون میآید: هر سیگنال دروازهای ربات پروکسی است که باید ساخته شود، و هر پروکسی صورت حساب خود را دارد.
سیگنالهای اختلاف (SafeDAgger، LazyDAgger، نیمی از قانون EnsembleDAgger) سیاست مرجع نیاز دارند. یا شما متخصص دستنویسشده دارید، در نتیجهای مسئله جالب قبلاً حل شدهاست، یا انسان در پسزمینه اقدامات انجام میدهد تا فاصله محاسبه شود.
- سیگنالهای شک به عدماطمینان شناختی کالیبرهشده نیاز دارند. انسامبل شبکههای کنترل کوچک تقریب آن است؛ انسامبل مدل vision-language-action سه میلیارد پارامتری مسئله حافظه و تاخیر است ابتدا.
- سیگنالهای نوآوری و ریسک برآوردگر یادگرفته تکمیل کار نیاز دارند، تناسبشده بر روی بهبیرونریزیهای موفق و شکستخورده کافی. در کاری که هنوز به آن رسیدگی میکنید، آن داده در دور یک وجود ندارد.
- دروازه انسان توجه نیاز دارد و هیچچیز دیگر نه — تنها سیگنال دسترسی در روز یک، بر روی هر معماری سیاست، بدون مدل اضافی برای آموزش.
- هیچ دروازه رباتی انسان را از اتاق حذف نمیکند. آنها چگالی عملی انسان را کاهش میدهند، نه آنکه آیا باید حاضر باشند.
- تفاوت آرامتری در آنچه دروازه تولید میکند وجود دارد. دروازه ربات که در وسط مسیر شلیک میشود به فردی بازوی متحرک در وضعیت دلخواه میدهد. دروازه انسان اپراتور را اجازه میدهد لحظه را انتخاب کند — پس از رسیدن، قبل از گرفتن، نه نیمهای از تأرجح. بخشهای بازیابی از دو تا یکیطور تمیز نیستند، و آن بخشها تمام محصول دور است.
چرا شکل کنترلشدهتوسطانسان بر روی سختافزار واقعی برنده است
این استدلال مهندسی است، نه نتیجه معیار — هیچ مقالهای که یافتیم هر پنج دروازه را بر روی لاعمل کننده یکسان با کلاس سیاست یکسان اجرا نمیکند. بر چهار نکته استوار است.
اولاً، ناظر به هر حال آنجاست. هیچکس نمیگذارد
بازوی SO-100 بدون نظارت کنار اشیایی که میتواند واژگون کند، اجرا شود. هنگامیکه کسی نظارت میکند، هزینه حاشیهای دادن به آنها دکمه تصاحب کنترل نزدیک صفر است؛ ساخت برآوردگر ریسک کالیبرهشده پروژهای است.دوماً، عدماطمینانی که میتوانید در سیاست مدرن اندازهگیری کنید غالباً کمیت اشتباه است. سر انتشار یا تطابقجریان واریانس را بر روی قطعات اقدام نمونهگیریشده تولید میکند، و آن واریانس چندحالتگیای را منعکس میکند که سر برای نمایندگی آموزش دید، نه ناآگاهی شناختی درباره حالت. ترم شک EnsembleDAgger انسامبل را دقیقاً برای گرفتن دومی استفاده میکند. این دو به نظر مثل شماره یکسان میرسند و نیستند؛
action chunking و flow matching ورودیها پوشش میدهند که چگونه آن سرها اقدامات را اول و مقام تولید میکنند.سوماً، شکستهایی که در دستکاری اهمیت دارند معمولاً معناییاند نه آماری غیرعادی. سیاست بستن گریپر دو سانتیمتر زودتر، یا اعتمادبخش رسیدن برای یکی از غلط دو مکعب یکسان، نه در حالت واریانس بالا است — اعتمادبخش و اشتباه است. هیچ حد واریانس این را نمیگیرد؛ شخصی که نظارت میکند فوری آن را میگیرد.
چهارماً، کیفیت برچسب — نکته اصلی HG-DAgger، و آنچه اغلب رد میشود. برچسبهای جمعآوریشده در حالیکه انسان کنترل بدون وقفه دارد برچسبهای تغیر برای سیستم متحرک را برنده میشوند. اگر هدف داده تصحیحی ارزشمند برای تجمیع است، بار اثبات با دروازه خودکار است.
جاییکه دروازههای ربات بازگشت میشوند
حلقه کنترلشدهتوسطانسان، قبلاً سیمکشیشده
تصاحب کنترل در طی جلسه استنتاج اجراشده، علمهای مداخله درهرقاب بر روی بخشهای تصحیحشده، نگهداری هر اجرا را به تصحیح یا ارزیابی، ترکیب مجموعه داده درهمآمیخته از منابع شما انتخابکنید، و ادامه آموزش از نقطهی تداوم موجود سازیشدهاست نه دستنویس شدهاست. Takeover با بازوی رهبری کار میکند، یا با صفحهکلید و لغزنده اگر یک ندارید.
ببینید حلقه DAgger چگونه اجرا میشود
دروازه نیمی از روش است؛ اداره داده نیمی دیگر استدروازه تصمیم میگیرد که کدام قاب انسان رانندگی کرد، نه چهچیز برای انجام با آنها، و آن تصمیم دوم جایی است که دورها غالباً هدر میروند. قانون اول یکی است که D در DAgger برای آن نایستاده: تجمیع، جایگزین نکنید. تنظیق دقیق
checkpoint خالص بر روی چند صد قاب تصحیح مدلی میدهد که تقریباً هیچچیز ندیده اما بازیابیها و مسیر اسمی را فراموش کردهاست.قانون دوم این است که قابهای مداخله قابهای معمولی نیستند. Mandlekar و همکاران سیستم تلهعملیاتی راهدور برای دستکاری 6-DoF ساختند که اپراتورها سیاستها را نظارت کردند و بر شکست تصاحب کنند، سپس تکراری با الگوریتمی آموزش دادند که «سیاست را تشویق میکند که چگونه طی مداخلات تنگناها را طی کند»؛ عوامل آموزششده بر آن داده عملکردی بهتر از عوامل آموزششده بر روی شماره برابری از نمونههای نمایش عادی بود. Sirius ایده را به استقرار فشار میدهد، «بار واگذاری نمونههای آموزش با اعتماد تقریبی انسان و بهینهسازی سیاستهای با رفتار وزنی کلونی». هردو نیاز به علامت درهرقاب آنچه انسان رانندگی کرد است، که چرا
intervention علم اهمیت بیشتری دارد نسبت به چهرهی آن.قانون سوم این است که ترکیب خودکار تلهای است. مجموعه دادهای ترکیبشده که منابع را نمیتوانید شمار کنید یکی است که زمانی اشکالیابی نمیتوانید کنید که دور بعدی بدتر شود. بر روی این سکو مرحله ترکیب برای آن دلیل صریح است — مجموعه داده اصلی به علاوه تصحیحات، انتخاب قسمت درهرمنبع، و نتیجه مجموعه داده معمولی است
LeRobot dataset که همگامسازی و تمرین میکند مثل دیگر؛ dataset documentation جانب فرمت را پوشش میدهد.مرحله در یک دور
| آنچه تولید میکند | متداولترین راهی که اشتباه میشود | اجرای استنتاج با ضبط روشن |
|---|---|---|
| اجرا تحت توزیع حالت سیاست خود | ضبطشده به عنوان تلهعملیات ساده، از دست دادن آن که سیاست رانندگی بود | تصاحب کنترل بر شکست |
| بخشهای تصحیح با علم مداخله درهرقاب | تصحیح تلملی آرایشی، تدریس سبک نه بازیابی | نگهداری هر قسمت |
| تصحیحات، ارزیابی یا دوراندازی | نگه داشتن همهچیز؛ تصاحب ناموفق بیشتری هزینه دارد نسبت به ارزش قسمت | همگامسازی تصحیحات |
| مجموعه داده نسخهای کنار اصل | تصحیحات که هرگز از ماشین محلی ترک نمیکنند | ترکیب مجموعه داده درهمآمیخته |
| اصل به علاوه تصحیحات، انتخاب صریح | ترکیب خودکار خاموش، تا بازگشت بعدی نمیتواند به منبع ردیابی شود | ادامه از نقطهی تداوم |
| نقطهی تداوم آغازشده از قبلی | انتظار بازگشایی بهینهساز؛ وزنها مدل را آغاز میکنند، حالت بهینهساز را بازیابی نمیکنند | تنظیم دروازهای که فردی میتواند واقعاً نگهدارد |
«انسان تصمیم میگیرد» تشخیص نیست. دو اپراتور با حدهای مختلف دورهای غیرقابلمقایسه تولید میکنند، و حد افتان گرایشی تولید میکند که نمیتوانید بخوانید. تریگرها را قبل از اجرای اول بنویسید.
نامگذاری شرایطی که دروازه را باز میکنند — رویکرد خارج از حاشیه ثابت بیشتر، گریپر بستن بر هیچچیز، مفصلی افتان به سمت حد، توقفی بیشتر از ثانیه یا دو — و فهرست را برای دور تغییرنیافته نگه دارید.
- نامگذاری آنچه باز نمیکند. Overshoot سیاست بازیابی از خود سیگنال آموزش است؛ تصاحب آنجا بازیابی که قبلاً میداند را حذف میکند.
- تصاحب به خود زود برای انتقال پاک، دست برگرداندن بهزودی که حالت بازیافتنی است.
- ثبت چرا تصاحب کردید، درهرقسمت. سه دور بعداً این تنها رکورد است اگر شکست یکسان برگردد.
- دوربینها، متن کار و اپراتور را در بین دورها ثابت نگه دارید. یکی تغییر دهید و اعداد غیرقابلمقایسه متوقف میشوند.
- مکانیکی انتقال دو تغییر دارد. با بازوی رهبری، رهبری باید موضع فعلی دنبالکننده را قبل از انتقال گشتاور رسید یا بازو جهش میکند؛ این حرکت ترازکردن بخش کمتر آزمایششده زنجیر بر روی سختافزار واقعی است. بدون بازوی رهبری تصاحب دستی از اولین فشار کلید است: دنبالکننده نگهشده و اپراتور آن را از صفحهکلید یا سقوط لغزندهها مفصلبهمفصل تحریک میکند، با گیاههای سمت سرور هر ورودی را کوچک نگه میدارند — چند درجه درهرفشار کلید، مشتی درهربهروزرسانی لغزنده، زیرا قدم بزرگ به موضع نگهشده چگونه سرو را نوار میکنید. نسخه قدمبهقدم با کلیدهای متصل در
the walkthrough of a DAgger round on an SO-100؛ پسزمینه بر روی هر دو حالت تلهعملیات در the teleoperation docs و leader-follower entry.مقایسه معماریهای سیاست پشتیبانیشده با ویژگیهای آموزش و استنتاج

معیار دور کنترلشدهتوسطانسان نرخ مداخله است: قابهای مداخله تقسیمشده بر قابهای اجرا. یک کار دارد — اگر در بین دورها نیفتد، دور چیزی نخریدهاست، و دور بعدی چیزی دیگر نسبت به مقدار داده تغییر دهد.
معیار متعصبانه است و باید بدانید چگونه. این حد اپراتور را بهقدری شایستگی سیاست اندازهگیری میکند، که چرا فهرست تریگر ثابت میماند؛ اپراتور که در طی جلسه آرام میشود منحنی کاهندهای تولید میکند بدون هیچچیز در پشت. همچنین سختی را نادیده میگیرد — ده قاب برای توقف تصادم و ده برای تحریک گرفتن یکسان به نظر میرسند. آن را با مجموعه ارزیابی ثابتی که هرگز تصحیح داده آن بهبیرونریزی نشد جفت کنید.
The article on measuring a DAgger loop از طریق طراحی ارزیابی، از جمله چگونه ارزیابی قسمتها از مخلوط آموزش دور نگه دارند.دروازه انسان، صادقانه
- شکست اعتمادبخشوغلط را میگیرد هیچ حد واریانس تشخیص نمیدهد
- تصحیحات ضبطشده را تولید میکند در حالیکه اپراتور کنترل کامل داشت، در لحظهای که انتخاب کردند
- علامت درهرقاب را تسلیم میکند که روشهای مداخلهوزنی مانند IWR و Sirius مصرف میکنند
- نظارت مستمر هزینه میکند؛ برای یک نفر و بسیاری از رباطها مقیاس نمیشود
- بستگی به سازگاری اپراتور — حد افتان نرخ مداخله را خراب میکند
- مدل ریسک خود را تولید نمیکند؛ حد یادگرفته HG-DAgger و برآوردگر ThriftyDAgger ماشینآلات اضافی هستند
- قابها را شمارش میکند، نه پیآمدها
- سیاستی را نمیتواند نجات دهد که شکست آن در هولکس کنترل است، مثل دوربین تبدیلشده یا رشتهی کار برچسبغلط
- سؤالات باز ارزشمند برای نگه داشتن در نمایش
معیارها ضعیف هستند. Spencer و همکاران آنچه برای تست روشهای یادگیری تقلید استفاده شد را بررسی کردند و آنها را «قابلواقعپذیری و ساده و بنابراین ناکافی برای گرفتن رژیمهای سختتر خطای مرکب در مسائل تصمیمگیری جهان واقعی» یافتند — و، در برابر ادبیات مطیع، رفتار کلونی ساده خوب بر روی آنها انجام داد. آن دلیل است برای شکانگیز بودن هر رتبهبندی تغییرات DAgger استوار بر آن کارها، از جمله تعدادی از اعداد در جدول بالا.
دروازههای ربات بر روی سیاستهای بزرگ نهچنان حل نشدهاست. کار AIM عدماطمینان را با Q-تابع پروکسی تقلیدکننده قانون مداخله انسانی جایگزین میکند و ۴۰ درصد بهبود در هزینه تصاحب و کارآیی یادگیری بر ThriftyDAgger گزارش میدهد — در کنترل مستمر و گسسته، نه بر روی مدل vision-language-action که لاعمل کننده را رانندگی میکند. اینکه هر یک از این دروازهها به VLA تنظیمدقیق منتقل میشود باز است. بررسی نکته مرتبط را میکند: اصطلاحات و ساختار زمینه در ادبیات یکپارچه نشدهاست، که روشهای مقایسه سخت میکند. بر روی بازوی خود، ثبتهای شما شواهدی هستند که دارید.
آیا HG-DAgger واقعاً DAgger است اگر انسان فقط در مداخلات برچسبگذاری کند؟
آن قسمتی که اهمیت دارد را نگه میدارد — داده جمعآوریشده تحت توزیع حالتی که یادگیرنده القا میکند، تجمیعشده با آنچه قبل آمده — و قسمتی را که تماس با سختافزار را زنده نمیکند حذف میکند. Kelly و همکاران آن را به عنوان تغییر ارائه میدهند؛ ضمانت بدونپشیمانی ۲۰۱۱ تغییرنیافته نمیشود.▾
میتواند یک دروازه ربات بر سیاست VLA تنظیمدقیق بر SO-100 استفاده کنم؟
نه براهراست. کلاسیفایر SafeDAgger سیاست مرجع قابلپرسوجویی نیاز دارد که ندارید. EnsembleDAgger انسامبل نیاز دارد، که برای مدل چندمیلیاردپارامتری معنیآن چندین نسخه در حافظه به علاوه هزینه استنتاج آنها است. ThriftyDAgger برآوردگر ریسک تنظیمشده بر روی موفقیتها و شکستهایی نیاز دارد که قبل از دورهای اول شما وجود ندارند.▾
یک تصاحب تنها باید چقدر طول کشد؟
طولانه برای رسیدن به حالت سیاست میتواند ادامهای از آن، و نه بیشتر: تصاحبهای طولانه اجرا را به جلسه نمایش تبدیل میکنند و مجموعه تصحیح را با رفتار اسمی سیل میکنند. یافتن LazyDAgger به راه دیگری میخورد — بسیاری تبدیلهای خیلی کوتاه خود هزینهای هستند.▾
فقط بر روی بخشهای تصحیحشده باید آموزش دهم؟
نه — آن متداولترین راه برای هدر دادن دور است. مدل تنظیقدقیقشده فقط بر روی بازیابیها تقریباً هیچچیز ندیدهاست اما بازیابیها. تصحیحات را در مجموعه داده اصلی با منابع انتخابشده صریح کنید؛ برای رفتن بیشتر، روشهای مداخلهوزنی مانند IWR یا Sirius را بنگرید، که قابهای انسانرانندگی را بالاتر از جداسازی آنها وزن میکنند.▾
چه اگر نرخ مداخله بعد از دور نیفتد؟
آن را به ارزش اسمی بگیرید: دور کمک نکرد. قبل از اضافه کردن تصحیحات، توضیحات ارزانتر را بررسی کنید — حد اپراتور انجام داد، تصحیحات آرایشی بودند، مجموعه داده ترکیبشده واقعاً آنها را داشت، آموزش از نقطهی تداوم مقصود آغاز شد. دور که خاموش از مدل پایه شروع شد دقیقاً شامل دور که یادگیری انجام نداد به نظر میرسد.▾
آیا عدممداخله اطلاعات را حمل میکند؟
تحت Expert Intervention Learning، بله: دورهای جایی که ناظر تماشا کرد و عمل نکرد به عنوان شواهد ضعیف خوانده میشود که حالت و اقدام قابلقبول بودند، رسمیشده به عنوان محدودیت تابع ارزش. اکثر لولههای عملی، از جمله این یکی، تنها آنچه انسان رانندگی کرد را علم میگذارند.▾
برای یک بازوی تنها بر روی میز انتخاب است: دروازه را خود نگه دارید، نویسید آنچه باز میکند، و تلاش را بر روی اداره داده در پشت آن نسبت به اتوماسیون تبدیل خرج کنید. سمت سکو در توصیف شده است
the DAgger loop page، گزینههای آموزش در هر خانواده سیاست تحت training and pricing. برای پسزمینه، شروع با imitation learning و imitation learning on the SO-100؛ برای اجرا اول، run your first policy راه کوتاهتر است. is the shorter path.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started