
نرخ مداخله - فریمهای مداخله تقسیم بر فریمهای اجرا - ارزانترین سیگنال پیشرفت درسترو است که یک حلقه DAgger با دروازه انسانی دارد. این مقاله آن را طوری تعریف میکند که دو نفر مقدار یکسان محاسبه کنند، نحوه ثبت آن را نشان میدهد، و چهار راهی که شما را گمراه میکند را بررسی میکند: عادتپذیری عملگر، تنظیم ارزیابی دریفتکننده، آموزش تنها بر روی تصحیحات، و انسانی که در سهشنبه متفاوتتر از دوشنبه تصحیح میکند.
یک دور DAgger در حین انجام آن بهرهور احساس میشود. شما سیاست را هدایت میکنید، وقتی گرفتن را خراب میکند تحت کنترل میگیرید، تصحیحات را ذخیره میکنید، دوباره آموزش میدهید، و اجرای بعدی - به قسم میخورید - کمی هموارتر است. دو دور بعد نمیتوانید بگویید که چیزی تغییر کرده است، زیرا «کمی هموارتر» کمیت نیست.
حلقه یک عدد در هر دور نیاز دارد، و در یک حلقه با دروازه انسانی آن عدد تقریباً رایگان است: کسری از اجرا که در آن شما بجای سیاست کنترل داشتید. این مقاله آن را طوری تعریف میکند که دو نفر مقدار یکسان محاسبه کنند، آن را ثبت میکند، منحنی حاصل را میخواند، و چهار راهی را که شما را گمراه میکند نامگذاری میکند. برای نظریه این قطعه، نگاه کنید به توضیح DAgger و نسخه انسانمحور؛ همتای عملی اجرای یک حلقه DAgger بر روی SO-100.
نسخه کوتاه
- •نرخ مداخله = فریمهای مداخله / فریمهای اجرا. فریمها، نه اپیزودها، و مخرج شامل فریمهایی است که شما صرف تصحیح کردید.
- •منحنی صاف در سه دور به معنی این است که دورها چیزی نمیخریند - بجای جمعآوری چهارمی ترکیب، checkpoint یا وظیفه را تغییر دهید.
- •نرخ مداخله کاهشی معادل نرخ موفقیت افزایشی نیست. آستانه شما برای مداخله با رشد اعتماد بهطور پایینتری دریفت میکند.
- •بدون یک پروتکل ارزیابی منجمد - همان حالات شروع، اجسام، دوربینها، تعداد تجربه - شما اتاق را اندازهگیری میکنید.
- •آموزش تنها بر روی تصحیحات توزیع حالت را کج میکند. پاسخ IWR: نمونههای مداخله و غیر مداخله را به نسبت برابر رسم کنید.
چرا یک دور یک عدد نیاز دارد
DAgger به خاطر مسئله توزیع وجود دارد، و مسائل توزیع برای چشم نامرئی هستند. Ross و Bagnell نشان دادند که یادگیری تقلیدی بر روی یک مجموعه نمایش ثابت به خطاهای ترکیبی و یک کران پشیمانگی بهطور درجهدو در افق زمانی رشد میکند: هنگامی که یادگیرنده از حالاتهایی که نمایشدهنده بازدید کرده است خارج شود، هیچ چیز در داده به آن نمیگوید چگونه برگردد. DAgger این را با تکرار - اجرا سیاست، برچسب زدن حالاتهایی که بازدید میکند، تجمیع، دوباره آموزش - فیکس میکند که Ross، Gordon و Bagnell بهعنوان کاهش به یادگیری آنلاین بدون پشیمانی قالببندی میکنند.
آن قالببندی نتیجهای دارد که مردم از آن صرف نظر میکنند. تضمین دنباله سیاستها در تکرارها را مربوط میکند، نه هیچ یک از اجراها. هیچ چیزی درباره این نمیگوید که شما دور سوم کمک کرد. تنها راه برای دانستن این است که هر تکرار را اندازهگیری کنید. Kelly و همکاران HG-DAgger را معرفی کردند زیرا DAgger کلاسیک از متخصص برچسبهای عملی میخواهد در حالی که تازهکار هنوز در کنترل است، که مقاله استدلال میکند میتواند ایمنی را کاهش دهد و با متخصصین انسانی، احتمالاً کیفیت برچسب را از طریق تاخیر تلهاپراتور تخریب کند. HG-DAgger همچنین یک آستانه ایمنی برای معیار ریسک بر اساس عدمقطعیت مدل یادگیری میدهد و عملکرد بهتری نسبت به هم DAgger و تکثیر رفتاری را بر روی وظیفه رانندگی گزارش میدهد. هیچ تعداد مداخله را منتشر نمیکند؛ آنها را خود تولید میکنید.
تعریف نرخ تا دو نفر عدد یکسان بگیرند
تعریف یک خط است: فریمهای مداخله تقسیم بر فریمهای اجرا. تمام چیزهای دشوار در آنچه بهعنوان فریم و آنچه بهعنوان اجرا در نظر گرفته میشود پنهان هستند.
فریمها، نه اپیزودها
شمارش اپیزودهایی که حداقل یک مداخله دارند بیفایده است: ده اپیزود با یک نیوک هر کدام و ده اپیزودی که شما ۸۰ درصد آنها را هدایت کردید هر دو «۱۰/۱۰» میدهند. تعداد فریم آنها را جدا میکند، و این دانهبندی است که ضبط از قبل دارد - در فرمت مجموعه داده LeRobot هر نقطه زمانی یک سطر است، بنابراین پرچم مداخله یک ستون boolean کنار حالت و عملکرد است. اینجا آن هنگام شروع تحت کنترل نوشته شده است و هنگام بازگشت کنترل پاک شده است.
مخرج شامل تصحیحات است
دو مخرج قابل دفاع هستند - کل فریمهای اجرا، یا فریمهایی که سیاست بهطور خودمختار هدایت کرد - و آنها در سطح مداخله بالا به شدت واگرا میشوند. ۴۰۰ از ۱۰۰۰ فریم را تحت کنترل بگیرید و اولی ۴۰ درصد میدهد، دومی ۶۷ درصد. مقایسه یک دور اندازهگیری شده در نخستین راه با بعدی اندازهگیری شده در دومی چگونه یک بهبودی واقعی ناپدید میشود. کل فریمها را بگیرید و هرگز انتخاب را در سری دوباره بازدید نکنید.
یک بار تصمیم بگیرید که چه اتفاقی برای فریمهای انتقال میافتد
همیشه یک درز وجود دارد. وقتی کنترل منتقل میشود، برخی فریمها به هیچ یک تعلق ندارند: بازو گرفتار است، رهبر همتراز میشود، ضبط منجمد است. در این لوله آن فریمهای انتقال در جریان خام باقی میمانند و هرگز به سفارش شده وارد نمیشوند اپیزود - آنها نه رفتار سیاستاند و نه تصحیحاند که شایسته آموزش باشند. درز را هر دور یکسان بشمارید: در ۳۰ هرتز، شش تحت کنترل با درز دو ثانیهای هر کدام ۳۶۰ فریم است، کافی برای حرکت یک نقطه درصد.
فریمها یا اپیزودها؛ کل اجرا یا تنها خودمختار؛ فریمهای انتقال در یا بیرون. هر کدام از سه تصمیم در سکوت میان دورها تغییر مییابند منحنی بیمعنی میکند. هر سه را یادداشت کنید.
ثبت کنید تا عدد در جلسه باقی بماند
یک معیار در پنل وضعیت یک فرآیند در حال اجرا یک خواندن است: در ریست کردن ناپدید میشود و نمیتواند رسم شود. یک خط فقطالحاقشونده در هر اجرا تمام سری را پوشش میدهد - از جمله کدام checkpoint را هدایت کردید، زیرا این هر دور تغییر میکند و اشتباه انجام آن کار باقی را بیاعتبار میکند.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}دو زمینه وزن را حمل میکنند. train_mix آنچه است که شما کار آموزش بعدی را تغذیه کردید؛ بدون آن هیچ چیز نمیتواند منسوب شود. eval_protocol آزمایش ثابت را نامگذاری میکند که شما بعد از آن اجرا کردید، و زمینهای است که اغلب خالی رها میشود. در cockpit ay-robots وضعیت تحت کنترل تعداد فریم مداخله را برای جلسه در حال اجرا گزارش میدهد، بنابراین ثبتکنی تا ابتکار است تا ابتکار؛ مستندات مجموعه داده پوشش میدهد که ستونهای بهازایهرفریم کجا قرار میگیرند.

خواندن منحنی: سه دور، یک حکم
سه دور حداقل برای خواندن است، زیرا دو نقطه همیشه خط هستند. جدول زیر یک الگوی حسابدار با اعداد جایگزین است، نه اندازهگیریهای از هیچ اجرا. شما به دنبال کاهش یکنواخت منطبق بر افزایش موفقیت در یک آزمایش ثابت هستید.
| دور | Checkpoint هدایت شده | فریمها | فریمهای مداخله | نرخ | موفقیتها (از ۲۰) |
|---|---|---|---|---|---|
| ۰ (پایه) | سیاست پایه | ۵ ۹۰۰ | ۱ ۳۸۰ | ۲۳٫۴ ٪ | ۷ |
| ۱ | از ترکیب دور ۰ | ۵ ۶۱۰ | ۹۸۰ | ۱۷٫۵ ٪ | ۱۰ |
| ۲ | از ترکیب دور ۱ | ۵ ۴۱۲ | ۶۱۱ | ۱۱٫۳ ٪ | ۱۱ |
| ۳ | از ترکیب دور ۲ | ۵ ۳۸۰ | ۵۹۸ | ۱۱٫۱ ٪ | ۱۲ |
دورهای یک و دو کار میکنند. دور سوم نه: ۱۱٫۳ در برابر ۱۱٫۱ درصد درون تنوع دوربهدور هر چیزی است که برای یک بازو فیزیکی اندازهگیری شود، و دور چهارم از همان تصحیحات یک بعدازظهر صرف میکند برای هیچ چیز. بخش صاف میگوید چیزی ساختاری تغییر دهید.
- شکستهای باقیمانده تالاپراسیون قابل تصحیح نیستند - شی از دسترس، هندسه gripper، یک مفصل در حد خود. هیچ داده تصحیح دیوار kinematics را فیکس نمیکند.
- تصحیحات بسیار کم در برابر مجموعه داده پایه برای حرکت gradient است، و هیچ چیز آنها را وزن نمیکند.
- تصحیحات یکدیگر را تناقض دارند، بنابراین سیاست دو استراتژی را میانگین میگیرد و بین آنها فرود میآید.
- خرابی موارد: دوربین حرکت کرد، روشنایی تغییر کرد، نمای مچ دیگر با آموزش منطبق نیست.
- وظیفه در سقف این کلاس سیاست در این سختافزار است، و گام بعدی داده پایه بیشتر است.
دو آخری شکستهای حلقه نیستند. در Sirius-Fleet نیاز کاهشی برای انسان نتیجه طراحیشده است: با بهبود خودمختاری ربات، پیشبینیکنندگان ناهنجاری آن معیار پیشبینی خود را تطبیق میدهند، منجر به درخواستهای کمتر برای مداخله انسانی و تدریجی کاهش بار کاری انسانی در طول زمان. آنجا معیار تطبیق برای هدف است. در حلقه دستی شما نیز در سکوت تطبیق مییابد - بنابراین نرخی که بخش ثابت میشود زیرا وظیفه در سقف خود است کاملاً مثل یکی است که بخش ثابت میشود زیرا عملگر متوقف نوتیسنگی است. کدام گام بعدی مسئله است.
تلهاپ ۱: نرخ کاهشی نرخ موفقیت افزایشی نیست
نرخ مداخله دقیقاً یک چیز اندازهگیری میکند: چه مقدار از اجرا شما تصمیم گرفتید که مالک آن باشید. آن تصمیم شماست، در زمان واقعی انجام شده، و حرکت میکند. در دور صفر شما در اولین زاویه نزدیککردن بد تحت کنترل میگیرید؛ دور سوم تا به حال دوازده بازیافت سیاست را دیدهاید و اجازه میدهید که آن را امتحان کند. آستانه شما حرکت کرد؛ سیاست نمیتواند. نرخ هر دو راه پایین میرود.
اعتماد انسانی حداقل کمیت مدلسازی شده در ادبیات است تا ثابت فرض شود. Sirius نمونههای آموزشی را با تقریب اعتماد انسانی وزن میکند و سیاست را با رفتاری cloning وزندار بهینهسازی میکند، که ۸ درصد افزایش در شبیهسازی و ۲۷ درصد بر روی سختافزار واقعی در برابر هنر فعلی در نرخ موفقیت سیاست گزارش میکند، در دو برابر سرعت همگرایی. این اعتماد را بهعنوان وزن برای داده معامله میکند. آستانه سر شما بین دور صفر و دور سوم را تصحیح نمیکند.
شما نمیتوانید drift را حذف کنید، بنابراین نرخ را با چیزی جفت کنید که آستانه شما نمیتواند لمس کند: مجموعه ثابت تجربه که در آن اصلاً مداخله نمیکنید، امتیاز دادهشده علیه معیار نوشتهشده قبل از دور. نرخی که در حالی که نرخ موفقیت جفت صاف میماند پایین میرود امضای عادتپذیری است - شایسته گرفتن، زیرا از درون حلقه به نظر میرسد پیشرفت است.
| نرخ مداخله | نرخ موفقیت در پروتکل ثابت | خواندن بسیار احتمالی |
|---|---|---|
| افتادن | افزایش | دور کار کرد. ادامه دهید. |
| افتادن | صاف | آستانه شما دریفت شد، یا تصحیحات تلاش را بدون حذف شکستها حذف کردند. |
| افتادن | افتادن | تصحیحات سیاست را تخریب میکنند. ترکیب و سازگاری درونی آنها را بررسی کنید. |
| صاف | صاف | دور چیزی نخریده. قبل از جمعآوری بیشتر ترکیب، checkpoint یا وظیفه را تغییر دهید. |
| افزایش | افتادن | رگرسیون. پیش از مظنون کردن روش ترکیب آموزش، یک دوربین تغییر یافته یا یک mixاپ checkpoint را مظنون کنید. |
دام ۲: بدون پروتکل ثابت، شما اتاق را اندازهگیری میکنید
ارزیابی ربات واقعی گرانبها و تکرار کردن سخت است. نویسندگان SIMPLER ارزیابی شبیهسازی را با مشاهده انگیزه میدهند که ارزیابی واقعی جهان چنین سیاستهایی مقیاسپذیر نیست و چالشهای تولیدی که احتمالاً بدتر میشود زیرا سیاستها طیف وظایف خود را گسترش میدهند. RoboArena از طرف دیگر با بیش از ۶۰۰ اپیزود ارزیابی واقعی جفتی در هفت سیاست عمومیکننده، اجرا شده توسط ارزیابان در هفت موسسه تحقیقاتی بر روی پلتفرم DROID حمله میکند. ارزیابان آن وظایف و محیطهای خود را انتخاب میکنند اما باید سیاستهای جفت را کور دوگانه قضاوت کنند؛ مقاله گزارش میدهد که این رتبهبندی جمعی عملکرد سیاست عمومیکننده را دقیقتر از ارزیابی متمرکز تقلیدی ردیابی میکند.
شما ۶۰۰ اپیزود جفتی را روی یک SO-100 در یک کارگاه اجرا نخواهید کرد. آنچه که میتوانید کنید این است که تنوع را حذف کنید که کنترل میکنید - یک فهرست خستهکننده به آن حد که معمولاً رد میشود.
| بعد | این را منجمد کنید | اگر نکنید چه دریفت میکند |
|---|---|---|
| حالت شروع | یک حالت خانه نوشتهشده، هدایت شده قبل از هر آزمایش | مسیر از توزیع خارج شروع میشود |
| اجسام | نشانههای چسبدار شده، و همان اجسام فیزیکی برای ارزیابی ذخیرهشده | سیاست «بهتر» واقعاً شی نزدیکتر است |
| دوربینها و نور | همان نصبها، شاخصها، نوردهی؛ پردهها بسته شده؛ تنظیم عکسبرداری | تنها شاخصهای دوربین تعویض شده میتواند نتیجه را غالب کند |
| آزمایشها و قانون توقف | n ثابت، timeout ثابت، معیار نوشتهشده قبل از دور | معیارهای پس از تاریخ نزدیکاندیشی را به هر چیزی که نیاز دارید تبدیل میکنند |
| رفتار عملگر | بدون مداخلات در طول آزمایشهای ارزیابی | ارزیابی جلسه تصحیح دیگری میشود |
سپس حسابی، بیرحمانه در تعداد تجربهای که کارگاه میتواند هزینه کند. تحت تقریب عادی، ۶۰ درصد موفقیت بیش از ۲۰ تجربه استاندارد خطایی را کنار نزدیک ۱۱ نقطه درصد حمل میکند - جذر ۰٫۶ برابر ۰٫۴ بر روی ۲۰ - و تفاوت میان دو دور چنین حدود ۱۵ حمل میکند. پرش از ۶۰ به ۷۰ درصد بنابراین با هیچ چیزی که اتفاق افتاده است منطبق است. پنجاه تجربه نقشهای هر دور را به تقریباً ۷ نقطه رساند، و بعد از ظهر هزینه.
این عدمتقارن استدلال برای نرخ مداخله است: محاسبه شده در هزاران فریم تا بجای بیست نتیجه باینری، زودتر و هموارتر حرکت میکند. خنثیکنندگی این است که فریمهای درون یک اپیزود به شدت همبستگی دارند - یک grasp بد صد فریم مداخله متوالی را میکشد - بنابراین اندازه نمونه موثر نزدیکتر به تعداد takeover است. نرخ را بهعنوان نشانگر ابتدایی و نرخ موفقیت را بهعنوان ground truth کند درست در نظر بگیرید.
اپیزودهای ارزیابی هرگز نباید مجموعه داده آموزشی ترکیب شده وارد شوند - وگرنه دور n+1 روی دادهای که برای آن آموزش داده شده امتیاز دادهشده است، و منحنی memorization اندازهگیری میکند.
تلهاپ ۳: تنها آموزش بر روی تصحیحات سیاست را خم میکند
تصحیحات داده جالباند، بنابراین غریزه آموزش بر روی آنها است. نکنید. آنها ساخت شدهاند از برش خیلی محدود از فضای حالت جایی که سیاست از قبل شکست میخورد و تقریباً هیچ چیز درباره بیشتر اجرا که کار کرد نمیگویند. تیونر دقیق بر روی آن برش تنها و شما سیاست خوب برای بازیافت از نزدیککردن خراب میکنید که فراموش کرده است چگونه نزدیککردن تمیز کنید.
Mandlekar و همکاران سیستم مداخله دور خود را حول این ساخت کردند. قالببندی آنها: وظایف دستکاری منطقه گلوتالق شامل دنبالهای از اقدامات دقیق - درج یک پاد به دستگاه قهوهای آنها مثال است - جایی که انحرافات کوچک به حالتهایی که نمایشات هرگز پوشش دادند منجر میشوند. الگوریتم آنها بهصورت تکراری بر روی دادههای جدید آموزش میدهند تا سیاست یادگیری کند تا از آن گلوتالقها عبور کند، و آنها گزارش میدهند که عوامل آموزششده بر روی دادههای مداخله عوامل آموزششده بر روی معادل تعداد نمونههای non-interventional demonstrators را شکست دهند.
- سریع: اجرای کوتاه بیش از چند اپیزود برای تکرار ارزان است
- مستقلهدفشده: gradient توسط حالتهایی که شما برای انجام میدهید غالبشده است
- ارزان برای آزمایش اینکه آیا سبک تصحیح قابل یادگیری است
- توزیع تیون دقیق دیگر شبیه توزیع وظیفه نیست
- رفتار نامی میتواند به طور مرئی درون یک دور واحد تخریب شود
- نرخ میتواند در حالی که موفقیت آن با هم پایین میرود پایین بیفتد - بخشهای تمیز برای بازیافت تبدیل شدهاند
نسبت ترکیب یک ابرپارامتر است و شایسته یادداشت شدن است. ترکیب مجموعه داده بعدی آنجاست که تصمیمگیری میشود: نمایشات اصلی به علاوه مجموعه تصحیح، انتخاب اپیزود صریح به هر منبع تا بجای قانون که بیسازی هر چیزی را میکشد که در دسترس است. آنجا یک مرحله ترکیب در cockpit است، و نتیجه مجموعه داده عادی است - نگاه کنید به مستندات آموزش. چه ابزاری برای شما ثبت کدام نسبت منحنی کدام را تولید کند نیست.
دام ۴: انسان متخصص ثابت نیست
نظریه DAgger متخصص را فرض میکند. شما در معنی فنی نیستید: تصحیحات شما نمونههای از توزیع شرطی ثابت بر روی اقدام نیستند. نویسندگان ACT این را هنگام فهرستکردن موانع برای دستکاری دقیق نامگذاری میکنند - خطاها در طول زمان ترکیب میشوند، و نمایشهای انسانی میتواند non-stationary باشند. سیستم آنها هنوز ۸۰ تا ۹۰ درصد موفقیت را بر روی شش وظایف واقعی از ده دقیقه نمایشها میرساند، بنابراین مسئله tractable است، نه ناپدید.
مطالعه robomimic نقطه را از طرف داده میکند. در سراسر شش الگوریتم آفلاین بر روی پنج کار چندمرحلهای شبیهسازی شده و سه واقعیجهانی، دروس آن شامل حساسیت برای انتخابهای طراحی، وابستگی برای کیفیت نمایش، و - یکی که در اینجا بدترین است - تنوع از معیارهای توقف، زیرا اهداف آموزش و ارزیابی متفاوت هستند. checkpoint با کمترین loss نیست قابلاً بالاترین نرخ موفقیت.
نسخه سختافزار این است: حالت ورودی تصحیح را شکل میدهد. یک رهبر-پیرویکننده تنظیم مسیرهای مستمر در سرعت انسان را تولید میکند. فشارهای صفحه کلید توسط سرور سختگیر میشوند - دو درجه در هر فراخوانی بر روی مفاصل بازو، چهار بر روی gripper - بنابراین نیت یکسان بهعنوان یک پلهای از مراحل کوچک فرود میآید. Sliders اهداف مطلق ارسال میکنند و سرور حداکثر شش درجه به سمت آنها در هر فراخوانی حرکت میکند. سه حالت، سه توزیع عملکرد؛ اختلاط کردن هر سه و سپس تعجب از اینکه چرا نزدیککردن تند شد خودآزردی است. مستندات تلهاپراسیون پوشش میدهد که هر حالت چه ارسال میکند.
وزن مداخلات: IWR و آنچه بعد از آن آمد
اگر تصحیحات اقلیت ارزشمند هستند، اصلاحی اصولمحور وزن تا انحصاری است. Intervention Weighted Regression پیادهسازی مرجع است: دادهها به نمونههای مداخله و غیر مداخله تقسیم میشوند، و دو بخش در نسبت برابر نمونهگیری میشوند در طول آموزش. مجموعه تصحیح که پنج درصد فریمها است سپس نیمی از gradient را میدهد، بدون رفتار نامی از توزیع ناپدید شود.
نسبت برابر یک نقطه شروع است، نه قانون. Sirius آن را عمومی میکند با جایگزینی بخش باینری با وزن مستمر از تقریب اعتماد انسانی؛ Sirius-Fleet تصمیمگیری دستگاه را بالا حرکت میدهد، استفاده از یک مدل جهانی بینایی و پیشبینیکنندگان ناهنجاری تصمیم گرفتن زمانی که انسان تقاضا میشود. رشته مشترک: پرچم مداخله سیگنال آموزشی است، نه فقط ستون حسابداری.
| روش | چه کسی تصمیم میگیرد کی انسان عمل میکند | چگونه دادههای مداخله استفاده میشوند | نتیجه گزارش شده |
|---|---|---|---|
| DAgger (۲۰۱۱) | برنامه ثابت؛ برچسبهای حالت بازدید شده متخصص | یک مجموعه داده رشدکننده، بدون وزن | قالببندی شده بهعنوان کاهش به یادگیری آنلاین بدون پشیمانی |
| HG-DAgger (۲۰۱۹) | انسان، دروازه کنترل بر روی سیستم واقعی | تجمیعشده؛ به علاوه آستانه ایمنی یادگیری شده بر روی عدمقطعیت مدل | بهتر از DAgger و BC در رانندگی؛ هیچ تعداد مداخله داده نشد |
| IWR (۲۰۲۰) | انسان، از طریق تلهاپراسیون دور | نمونههای مداخله و غیر مداخله در نسبت برابر رسم شدهاند | شکست non-interventional demos در شمارش نمونه برابر |
| Sirius (۲۰۲۲) | انسان، در طول استقرار | وزندار BC، وزنها از تقریب اعتماد انسانی | ۸ ٪ افزایش در شبیهسازی، ۲۷ ٪ بر روی سختافزار واقعی؛ ۲ برابر سرعت همگرایی سریعتر |
| ThriftyDAgger (۲۰۲۱) | سیستم، دروازه بر روی نوبت و ریسک | جمعآوری تعاملی تحت بودجه نظارت | مطالعه کاربر (N=۱۰): ۵۸ ٪ انسان بالاتر و ۸۰ ٪ عملکرد ربات بالاتر از روش بعدی بهترین |
| Fleet-DAgger (۲۰۲۲) | سیستم، تخصیص توجه در کل fleet | یادگیری fleet امتیازشده توسط Return on Human Effort | تا ۸٫۸ برابر بالاتر ROHE از خطوط پایگی |
| Sirius-Fleet (۲۰۲۴) | پیشبینیکنندگان ناهنجاری با معیارهای خودتطبیق | یادگیری چندوظیفهای با یک مدل جهانی بینایی | درخواستهای مداخله کمتر زیرا خودمختاری بهتر میشود |

چهار معیار شایستهی ثبت کنار نرخ
- Takeovers در هر اجرا. بیست تصحیح کوتاه و یک طول دهند نرخهای مشابهی میدهند و سیاستهای متفاوت را توصیف میکنند - یک lurch، یکی با یک blind spot تنهایی.
- میانگین طول مداخله. طول افزایشیافته با حساب کاهششده به معنی شکستهای باقیمانده سخت هستند، کدام پیشرفت دیرهنگام است.
- زمان تا اولین مداخله. سیاستی که قبل از نیاز به کمک دورتر میرود حتی وقتی نرخ کل صاف است بهتر است.
- جایی که مداخلات خوشهبندی میشوند. Bin پرچم توسط پیشرفت اپیزود عادی شده؛ قله پایدار در سراسر دورها یک گلوتالق را اشاره میکند.
پروتکل دور شما میتواند واقعاً اجرا شود
دور اندازهگیری شده شش مرحله دارد و یک سطر در log تولید میکند. چهار اولی حلقه است؛ دو آخری این را اندازهگیری میکند.
- 1پروتکل ارزیابی قبل از دور صفر منجمد کنید
حالت شروع، placement شی، دوربینها، تعداد تجربه، timeout و معیار موفقیت را یادداشت کنید. جدول را عکسبرداری کنید. اگر مستند تغییر کند، سری دوباره شروع میشود.
- 2بخش بسنجید
پروتکل را با بدون مداخلات اجرا کنید و موفقیتها را ثبت کنید؛ سپس یک جلسه آموزششده با takeover فعالشده اجرا کنید و نرخ را ثبت کنید. آن دو عدد دور صفر هستند.
- 3تصحیحات را در یک سبک منسجم جمعآوری کنید
یک حالت ورودی در هر دور، یک عملگر اگر میتوانید مدیریت کنید. تحت کنترل بگیرید بر روی معیار شما میتوانید بیان کنید - «gripper بیش از دو سانتیمتر از نزدیککردن در نزدیککردن» - و آن را برای دور نگاه دارید.
- 4هر اپیزود را همان روز تقسیم کنید
تصحیح، ارزیابی یا دور انداز. اپیزودهای مبهم دور انداختهشدهاند، نه ذخیره شدهاند بر نظریه که داده بیشتر کمک میکند - تصحیح که خودتان خراب کردید بدتر از هیچ اپیزود است.
- 5ترکیب را صریحاً ترکیب کنید
نمایشات اصلی به علاوه مجموعه تصحیح، انتخاب اپیزود به هر منبع. شمارش پایگی، شمارش تصحیح و هر وزندهی ثبت کنید - این زمینهای است که شما خواهید خواهد در سه هفته.
- 6بر روی checkpoint ادامه دهید، سپس دوبارهسنجی کنید
مجموعه داده ترکیب شده را از checkpoint قبلی آموزش دهید تا مدل پایگی، پروتکل منجمد به علاوه یک جلسه آموزششده اجرا کنید، سطر را اضافه کنید، و علیه دو دور قبلی مقایسه کنید.
دو حد چگونه را تغییر میدهند خواندن یک دور ضعیف. ادامه دادن از checkpoint ابتدا وزنها را از آن - نه ازتای بهینهساز، بنابراین برنامه تازه شروع میشود و اجرای کوتاه از checkpoint همگراشده خیلی کم حرکت میکند. و حرکت همتراز رهبر در شروع takeover کمترین مسافت بر روی سختافزار واقعی از هر چیز در زنجیر دارد؛ اگر تصحیحات همه با یک موج عارضی شروع کنند، آنجا قبل از بلامگذاری نسبت نگاه کنید.
حلقه اندازهگیری، از قبل سیمبندی
ay-robots این شش مرحله را بهعنوان ویژگیهای محصول پیادهسازی میکند: تحت کنترل mid-run از یک بازو رهبر، صفحه کلید یا sliders، با فریمهای مداخله پرچمشده خودکار؛ هر اپیزود را بهعنوان تصحیح، ارزیابی یا دور انداز تقسیم کنید؛ مجموعه داده بعدی را از نمایشات اصلی به علاوه تصحیحات ترکیب کنید، انتخاب اپیزود صریح به هر منبع؛ و اجرای آموزش بعدی را از checkpoint قبلی تا بجای مدل پایگی شروع کنید.
ببینید چگونه حلقه DAgger کار میکندآنچه اعداد نمیتوانند بگویند
هیچکدام این حل نشدهاست، و منحنی مرتب نباید شما را متقاعد کند در غیر اینصورت. نرخ مداخله یک سیستم مشترک - سیاست، سختافزار، عملگر، اتاق - اندازهگیری میکند و چیزی را خود برای نسبت دادهشده نمیکند. نمیتواند قضاوت کند که آیا تصحیحات خوب بودند، و بخوشی خواهد بر روی وظیفهای که آسانتر شده پوشاندن هندسه gripper صاف آن در سه هفته نزدیکتر را حرکت داد.
آنچه آن انجام میدهد این است تحویل تاثر مبهم به ستون شما میتوانید بحث کنید. جایگزین نه معیار بهتر است؛ این سه هفته جمعآوری تصحیحات است که منحنی این است بعد از دور سه، شما به جمعآوری متوقف کنید. ادبیات survey یادگیری تقلیدی تعاملی بهعنوان بازخورد انسانی که بهصورت intermittent در طول اجرای ربات دادهشده، بهبود آنلاین رفتار را تعریف میکند؛ خانواده پهن است، و بدون عدد در هر دور بدون چیزی کار نمیکند. نگاه کنید به راهنمای یادگیری تقلیدی SO-100 برای مجموعه داده پایگی شما ترکیب علیه، اجرای سیاست برای طرف استنتاج، و صفحه حلقه DAgger برای لوله پیادهسازیشده.
آیا نرخ مداخله فقط یک منهای نرخ موفقیت است؟▾
نه. نرخ اندازهگیری میکند چه مقدار از اجرا شما تحت کنترل گرفتید؛ نرخ موفقیت اندازهگیری میکند آیا وظیفه بدون شما انجام شد. اجرا میتواند با نرخ مداخله ۳۰ درصد موفق شود، و اجرا بدون مداخلات میتواند کاملاً شکست بخورد. آنها نیز در نویز متفاوت هستند: نرخ بر روی هزاران فریم همبستگی هموار حرکت میکند، نرخ موفقیت میان مشتی نتیجه باینری پرش میکند. Log هر دو.
چند آزمایش ارزیابی برای نرخ موفقیت برای معنی کردن چیزی نیاز دارم؟▾
بیش از احساس معقول. تحت تقریب عادی، ۲۰ آزمایش در درست ۶۰ درصد نرخ موفقیت خطای استاندارد نزدیک ۱۱ نقطه درصد حمل میکنند، بنابراین حرکت ۱۰ نقطهای میان دورها از نویز قابلتشخیص نیست؛ ۵۰ آزمایش آن نقشه را تقریباً ۷ رساند. اگر نمیتوانید ۵۰ هزینه کنید، تعداد آزمایش را میان دورها یکسان نگاه دارید و حرکت کوچک را بهعنوان نتیجهگیری ناشناس رفتار کنید.
چه نسبت ترکیب نمایشات برای تصحیحات باید شروع کنم؟▾
نقطه شروع شدهی توثیق شده IWR است: دادهها را به نمونههای مداخله و غیر مداخله تقسیم کنید و نسبت برابر از آن رسم کنید، بنابراین تصحیحات نیمی از gradient میدهند تا هر چقدر چند فریم آنها هستند. اگر تنظیم شما نمیتواند نمونهگیری وزن کند، نسبت آن را از طریق شمارش اپیزود هنگام ترکیب تقریب زنید و نسبت را ثبت کنید. آموزش تنها بر روی تصحیحات گزینه به دور انداختن است.
نرخ مداخله من بعد از یک دور بالا رفت. دور از بین رفت؟▾
نه لزوماً، اما توضیحات خستهکننده را ابتدا بررسی کنید: آیا checkpoint شما هدایتکردید checkpoint شما آموزشداده شدهای را مطابقت کردید، آیا شاخص دوربین یا mount تغییر کرد، آیا placement شی driftدولت نزدیککردن، آیا سبک تصحیح منسجم بود. اگر هر چهار تمیز هستند و نرخ موفقیت جفت نیز پایین رفت، ترکیب را مظنون کنید - خیلی کم نمایشات پایگی علیه تصحیحات، یا تصحیحات که یکدیگر را تناقض دارند. رگرسیون درست کردن در log سود میرود، نه bin.
آیا میتوانم پروتکل ارزیابی ثابت را رد کنم و فقط نرخ مداخله را تماشا کنم؟▾
تنها اگر پذیرفتید که نمیتوانید بهبودی از عادتپذیری تشخیص دهید. نرخ به آستانه شما خود برای مداخله در زمان واقعی بستگی دارد، و آن آستانه پایین میرود زیرا به عادات سیاست عادتکنید. پروتکل منجمد بخشی از اندازهگیری است آستانه شما نمیتواند رسیدن - نشانههای چسبدار شده، حالت خانه نوشتهشده، تعداد آزمایش ثابت، معیار تصمیمگیری قبل از دور. تغییرناپذیر باید در سری باقی بماند.
Log را در مخزن نگاه دارید، نه دفترچه: دورها روزهای دورتر هستند، سختافزار دوبارهِ ساخت شده، و شخصی منحنی را در اکتبر میخوانند شما در اگست بدون حافظه هستید. مستندات FAQ جزئیات عملیاتی جا مانده در اینجا را پوشش میدهد.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started