فضای کاری ربات روی میز از نوعی که به‌عنوان تنظیم ارزیابی ثابت برای اجرای سیاست‌های مکرر استفاده می‌شود
DAggerارزیابییادگیری تقلیدیداده‌های رباتSO-100

اندازه‌گیری یک حلقه DAgger: نرخ مداخله، پروتکل ارزیابی، و دام‌هایی در میان

AY-Robots ResearchAugust 27, 2026خواندن ۱۵ دقیقه

نرخ مداخله - فریم‌های مداخله تقسیم بر فریم‌های اجرا - ارزان‌ترین سیگنال پیشرفت درست‌رو است که یک حلقه DAgger با دروازه انسانی دارد. این مقاله آن را طوری تعریف می‌کند که دو نفر مقدار یکسان محاسبه کنند، نحوه ثبت آن را نشان می‌دهد، و چهار راهی که شما را گمراه می‌کند را بررسی می‌کند: عادت‌پذیری عملگر، تنظیم ارزیابی دریفت‌کننده، آموزش تنها بر روی تصحیحات، و انسانی که در سه‌شنبه متفاوت‌تر از دوشنبه تصحیح می‌کند.

یک دور DAgger در حین انجام آن بهره‌ور احساس می‌شود. شما سیاست را هدایت می‌کنید، وقتی گرفتن را خراب می‌کند تحت کنترل می‌گیرید، تصحیحات را ذخیره می‌کنید، دوباره آموزش می‌دهید، و اجرای بعدی - به قسم می‌خورید - کمی هموارتر است. دو دور بعد نمی‌توانید بگویید که چیزی تغییر کرده است، زیرا «کمی هموارتر» کمیت نیست.

حلقه یک عدد در هر دور نیاز دارد، و در یک حلقه با دروازه انسانی آن عدد تقریباً رایگان است: کسری از اجرا که در آن شما بجای سیاست کنترل داشتید. این مقاله آن را طوری تعریف می‌کند که دو نفر مقدار یکسان محاسبه کنند، آن را ثبت می‌کند، منحنی حاصل را می‌خواند، و چهار راهی را که شما را گمراه می‌کند نام‌گذاری می‌کند. برای نظریه این قطعه، نگاه کنید به توضیح DAgger و نسخه انسان‌محور؛ همتای عملی اجرای یک حلقه DAgger بر روی SO-100.

نسخه کوتاه

  • نرخ مداخله = فریم‌های مداخله / فریم‌های اجرا. فریم‌ها، نه اپیزودها، و مخرج شامل فریم‌هایی است که شما صرف تصحیح کردید.
  • منحنی صاف در سه دور به معنی این است که دورها چیزی نمی‌خریند - بجای جمع‌آوری چهارمی ترکیب، checkpoint یا وظیفه را تغییر دهید.
  • نرخ مداخله کاهشی معادل نرخ موفقیت افزایشی نیست. آستانه شما برای مداخله با رشد اعتماد به‌طور پایین‌تری دریفت می‌کند.
  • بدون یک پروتکل ارزیابی منجمد - همان حالات شروع، اجسام، دوربین‌ها، تعداد تجربه - شما اتاق را اندازه‌گیری می‌کنید.
  • آموزش تنها بر روی تصحیحات توزیع حالت را کج می‌کند. پاسخ IWR: نمونه‌های مداخله و غیر مداخله را به نسبت برابر رسم کنید.

چرا یک دور یک عدد نیاز دارد

DAgger به خاطر مسئله توزیع وجود دارد، و مسائل توزیع برای چشم نامرئی هستند. Ross و Bagnell نشان دادند که یادگیری تقلیدی بر روی یک مجموعه نمایش ثابت به خطاهای ترکیبی و یک کران پشیمان‌گی به‌طور درجه‌دو در افق زمانی رشد می‌کند: هنگامی که یادگیرنده از حالات‌هایی که نمایش‌دهنده بازدید کرده است خارج شود، هیچ چیز در داده به آن نمی‌گوید چگونه برگردد. DAgger این را با تکرار - اجرا سیاست، برچسب زدن حالات‌هایی که بازدید می‌کند، تجمیع، دوباره آموزش - فیکس می‌کند که Ross، Gordon و Bagnell به‌عنوان کاهش به یادگیری آنلاین بدون پشیمانی قالب‌بندی می‌کنند.

آن قالب‌بندی نتیجه‌ای دارد که مردم از آن صرف نظر می‌کنند. تضمین دنباله سیاست‌ها در تکرارها را مربوط می‌کند، نه هیچ یک از اجراها. هیچ چیزی درباره این نمی‌گوید که شما دور سوم کمک کرد. تنها راه برای دانستن این است که هر تکرار را اندازه‌گیری کنید. Kelly و همکاران HG-DAgger را معرفی کردند زیرا DAgger کلاسیک از متخصص برچسب‌های عملی می‌خواهد در حالی که تازه‌کار هنوز در کنترل است، که مقاله استدلال می‌کند می‌تواند ایمنی را کاهش دهد و با متخصصین انسانی، احتمالاً کیفیت برچسب را از طریق تاخیر تله‌اپراتور تخریب کند. HG-DAgger همچنین یک آستانه ایمنی برای معیار ریسک بر اساس عدم‌قطعیت مدل یادگیری می‌دهد و عملکرد بهتری نسبت به هم DAgger و تکثیر رفتاری را بر روی وظیفه رانندگی گزارش می‌دهد. هیچ تعداد مداخله را منتشر نمی‌کند؛ آن‌ها را خود تولید می‌کنید.

تعریف نرخ تا دو نفر عدد یکسان بگیرند

تعریف یک خط است: فریم‌های مداخله تقسیم بر فریم‌های اجرا. تمام چیزهای دشوار در آنچه به‌عنوان فریم و آنچه به‌عنوان اجرا در نظر گرفته می‌شود پنهان هستند.

فریم‌ها، نه اپیزودها

شمارش اپیزودهایی که حداقل یک مداخله دارند بیفایده است: ده اپیزود با یک نیوک هر کدام و ده اپیزودی که شما ۸۰ درصد آنها را هدایت کردید هر دو «۱۰/۱۰» می‌دهند. تعداد فریم آنها را جدا می‌کند، و این دانه‌بندی است که ضبط از قبل دارد - در فرمت مجموعه داده LeRobot هر نقطه زمانی یک سطر است، بنابراین پرچم مداخله یک ستون boolean کنار حالت و عملکرد است. اینجا آن هنگام شروع تحت کنترل نوشته شده است و هنگام بازگشت کنترل پاک شده است.

مخرج شامل تصحیحات است

دو مخرج قابل دفاع هستند - کل فریم‌های اجرا، یا فریم‌هایی که سیاست به‌طور خودمختار هدایت کرد - و آنها در سطح مداخله بالا به شدت واگرا می‌شوند. ۴۰۰ از ۱۰۰۰ فریم را تحت کنترل بگیرید و اولی ۴۰ درصد می‌دهد، دومی ۶۷ درصد. مقایسه یک دور اندازه‌گیری شده در نخستین راه با بعدی اندازه‌گیری شده در دومی چگونه یک بهبودی واقعی ناپدید می‌شود. کل فریم‌ها را بگیرید و هرگز انتخاب را در سری دوباره بازدید نکنید.

یک بار تصمیم بگیرید که چه اتفاقی برای فریم‌های انتقال می‌افتد

همیشه یک درز وجود دارد. وقتی کنترل منتقل می‌شود، برخی فریم‌ها به هیچ یک تعلق ندارند: بازو گرفتار است، رهبر هم‌تراز می‌شود، ضبط منجمد است. در این لوله آن فریم‌های انتقال در جریان خام باقی می‌مانند و هرگز به سفارش شده وارد نمی‌شوند اپیزود - آنها نه رفتار سیاست‌اند و نه تصحیح‌اند که شایسته آموزش باشند. درز را هر دور یکسان بشمارید: در ۳۰ هرتز، شش تحت کنترل با درز دو ثانیه‌ای هر کدام ۳۶۰ فریم است، کافی برای حرکت یک نقطه درصد.

سه تصمیمی که قابل‌مقایسه‌گی را می‌شکند

فریم‌ها یا اپیزودها؛ کل اجرا یا تنها خودمختار؛ فریم‌های انتقال در یا بیرون. هر کدام از سه تصمیم در سکوت میان دورها تغییر می‌یابند منحنی بی‌معنی می‌کند. هر سه را یادداشت کنید.

ثبت کنید تا عدد در جلسه باقی بماند

یک معیار در پنل وضعیت یک فرآیند در حال اجرا یک خواندن است: در ریست کردن ناپدید می‌شود و نمی‌تواند رسم شود. یک خط فقط‌الحاق‌شونده در هر اجرا تمام سری را پوشش می‌دهد - از جمله کدام checkpoint را هدایت کردید، زیرا این هر دور تغییر می‌کند و اشتباه انجام آن کار باقی را بی‌اعتبار می‌کند.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
یک خط در هر اجرا. ثبت کردن مخرج و قرارداد انتقال کنار عدد بیشتر از نام‌های زمینه مهم است.

دو زمینه وزن را حمل می‌کنند. train_mix آنچه است که شما کار آموزش بعدی را تغذیه کردید؛ بدون آن هیچ چیز نمی‌تواند منسوب شود. eval_protocol آزمایش ثابت را نام‌گذاری می‌کند که شما بعد از آن اجرا کردید، و زمینه‌ای است که اغلب خالی رها می‌شود. در cockpit ay-robots وضعیت تحت کنترل تعداد فریم مداخله را برای جلسه در حال اجرا گزارش می‌دهد، بنابراین ثبت‌کنی تا ابتکار است تا ابتکار؛ مستندات مجموعه داده پوشش می‌دهد که ستون‌های به‌ازای‌هر‌فریم کجا قرار می‌گیرند.

ماتریس پیکربندی آموزش که سیاست‌ها، مجموعه داده‌ها و checkpoint‌ها را در کنار هم نشان می‌دهد
هر دور checkpoint و ترکیب مجموعه داده را تغییر می‌دهد. عددی که ترکیب آن ثبت نشد نمی‌تواند منسوب شود.

خواندن منحنی: سه دور، یک حکم

سه دور حداقل برای خواندن است، زیرا دو نقطه همیشه خط هستند. جدول زیر یک الگوی حسابدار با اعداد جایگزین است، نه اندازه‌گیری‌های از هیچ اجرا. شما به دنبال کاهش یکنواخت منطبق بر افزایش موفقیت در یک آزمایش ثابت هستید.

دورCheckpoint هدایت شدهفریم‌هافریم‌های مداخلهنرخموفقیت‌ها (از ۲۰)
۰ (پایه)سیاست پایه۵ ۹۰۰۱ ۳۸۰۲۳٫۴ ٪۷
۱از ترکیب دور ۰۵ ۶۱۰۹۸۰۱۷٫۵ ٪۱۰
۲از ترکیب دور ۱۵ ۴۱۲۶۱۱۱۱٫۳ ٪۱۱
۳از ترکیب دور ۲۵ ۳۸۰۵۹۸۱۱٫۱ ٪۱۲

دورهای یک و دو کار می‌کنند. دور سوم نه: ۱۱٫۳ در برابر ۱۱٫۱ درصد درون تنوع دور‌به‌دور هر چیزی است که برای یک بازو فیزیکی اندازه‌گیری شود، و دور چهارم از همان تصحیحات یک بعدازظهر صرف می‌کند برای هیچ چیز. بخش صاف می‌گوید چیزی ساختاری تغییر دهید.

  • شکست‌های باقی‌مانده تال‌اپراسیون قابل تصحیح نیستند - شی از دسترس، هندسه gripper، یک مفصل در حد خود. هیچ داده تصحیح دیوار kinematics را فیکس نمی‌کند.
  • تصحیحات بسیار کم در برابر مجموعه داده پایه برای حرکت gradient است، و هیچ چیز آنها را وزن نمی‌کند.
  • تصحیحات یکدیگر را تناقض دارند، بنابراین سیاست دو استراتژی را میانگین می‌گیرد و بین آنها فرود می‌آید.
  • خرابی موارد: دوربین حرکت کرد، روشن‌ایی تغییر کرد، نمای مچ دیگر با آموزش منطبق نیست.
  • وظیفه در سقف این کلاس سیاست در این سخت‌افزار است، و گام بعدی داده پایه بیشتر است.

دو آخری شکست‌های حلقه نیستند. در Sirius-Fleet نیاز کاهشی برای انسان نتیجه طراحی‌شده است: با بهبود خودمختاری ربات، پیش‌بینی‌کنندگان ناهنجاری آن معیار پیش‌بینی خود را تطبیق می‌دهند، منجر به درخواست‌های کمتر برای مداخله انسانی و تدریجی کاهش بار کاری انسانی در طول زمان. آنجا معیار تطبیق برای هدف است. در حلقه دستی شما نیز در سکوت تطبیق می‌یابد - بنابراین نرخی که بخش ثابت می‌شود زیرا وظیفه در سقف خود است کاملاً مثل یکی است که بخش ثابت می‌شود زیرا عملگر متوقف نوتیسنگی است. کدام گام بعدی مسئله است.

تله‌اپ ۱: نرخ کاهشی نرخ موفقیت افزایشی نیست

نرخ مداخله دقیقاً یک چیز اندازه‌گیری می‌کند: چه مقدار از اجرا شما تصمیم گرفتید که مالک آن باشید. آن تصمیم شماست، در زمان واقعی انجام شده، و حرکت می‌کند. در دور صفر شما در اولین زاویه نزدیک‌کردن بد تحت کنترل می‌گیرید؛ دور سوم تا به حال دوازده بازیافت سیاست را دیده‌اید و اجازه می‌دهید که آن را امتحان کند. آستانه شما حرکت کرد؛ سیاست نمی‌تواند. نرخ هر دو راه پایین می‌رود.

اعتماد انسانی حداقل کمیت مدل‌سازی شده در ادبیات است تا ثابت فرض شود. Sirius نمونه‌های آموزشی را با تقریب اعتماد انسانی وزن می‌کند و سیاست را با رفتاری cloning وزن‌دار بهینه‌سازی می‌کند، که ۸ درصد افزایش در شبیه‌سازی و ۲۷ درصد بر روی سخت‌افزار واقعی در برابر هنر فعلی در نرخ موفقیت سیاست گزارش می‌کند، در دو برابر سرعت همگرایی. این اعتماد را به‌عنوان وزن برای داده معامله می‌کند. آستانه سر شما بین دور صفر و دور سوم را تصحیح نمی‌کند.

شما نمی‌توانید drift را حذف کنید، بنابراین نرخ را با چیزی جفت کنید که آستانه شما نمی‌تواند لمس کند: مجموعه ثابت تجربه که در آن اصلاً مداخله نمی‌کنید، امتیاز داده‌شده علیه معیار نوشته‌شده قبل از دور. نرخی که در حالی که نرخ موفقیت جفت صاف می‌ماند پایین می‌رود امضای عادت‌پذیری است - شایسته گرفتن، زیرا از درون حلقه به نظر می‌رسد پیشرفت است.

نرخ مداخلهنرخ موفقیت در پروتکل ثابتخواندن بسیار احتمالی
افتادنافزایشدور کار کرد. ادامه دهید.
افتادنصافآستانه شما دریفت شد، یا تصحیحات تلاش را بدون حذف شکست‌ها حذف کردند.
افتادنافتادنتصحیحات سیاست را تخریب می‌کنند. ترکیب و سازگاری درونی آنها را بررسی کنید.
صافصافدور چیزی نخریده. قبل از جمع‌آوری بیشتر ترکیب، checkpoint یا وظیفه را تغییر دهید.
افزایشافتادنرگرسیون. پیش از مظنون کردن روش ترکیب آموزش، یک دوربین تغییر یافته یا یک mix‌اپ checkpoint را مظنون کنید.

دام ۲: بدون پروتکل ثابت، شما اتاق را اندازه‌گیری می‌کنید

ارزیابی ربات واقعی گرانبها و تکرار کردن سخت است. نویسندگان SIMPLER ارزیابی شبیه‌سازی را با مشاهده انگیزه می‌دهند که ارزیابی واقعی جهان چنین سیاست‌هایی مقیاس‌پذیر نیست و چالش‌های تولیدی که احتمالاً بدتر می‌شود زیرا سیاست‌ها طیف وظایف خود را گسترش می‌دهند. RoboArena از طرف دیگر با بیش از ۶۰۰ اپیزود ارزیابی واقعی جفتی در هفت سیاست عمومی‌کننده، اجرا شده توسط ارزیابان در هفت موسسه تحقیقاتی بر روی پلتفرم DROID حمله می‌کند. ارزیابان آن وظایف و محیط‌های خود را انتخاب می‌کنند اما باید سیاست‌های جفت را کور دوگانه قضاوت کنند؛ مقاله گزارش می‌دهد که این رتبه‌بندی جمعی عملکرد سیاست عمومی‌کننده را دقیق‌تر از ارزیابی متمرکز تقلیدی ردیابی می‌کند.

شما ۶۰۰ اپیزود جفتی را روی یک SO-100 در یک کارگاه اجرا نخواهید کرد. آنچه که می‌توانید کنید این است که تنوع را حذف کنید که کنترل می‌کنید - یک فهرست خسته‌کننده به آن حد که معمولاً رد می‌شود.

بعداین را منجمد کنیداگر نکنید چه دریفت می‌کند
حالت شروعیک حالت خانه نوشته‌شده، هدایت شده قبل از هر آزمایشمسیر از توزیع خارج شروع می‌شود
اجسامنشانه‌های چسب‌دار شده، و همان اجسام فیزیکی برای ارزیابی ذخیره‌شدهسیاست «بهتر» واقعاً شی نزدیک‌تر است
دوربین‌ها و نورهمان نصب‌ها، شاخص‌ها، نوردهی؛ پرده‌ها بسته شده؛ تنظیم عکس‌برداریتنها شاخص‌های دوربین تعویض شده می‌تواند نتیجه را غالب کند
آزمایش‌ها و قانون توقفn ثابت، timeout ثابت، معیار نوشته‌شده قبل از دورمعیارهای پس از تاریخ نزدیک‌اندیشی را به هر چیزی که نیاز دارید تبدیل می‌کنند
رفتار عملگربدون مداخلات در طول آزمایش‌های ارزیابیارزیابی جلسه تصحیح دیگری می‌شود

سپس حسابی، بی‌رحمانه در تعداد تجربه‌ای که کارگاه می‌تواند هزینه کند. تحت تقریب عادی، ۶۰ درصد موفقیت بیش از ۲۰ تجربه استاندارد خطایی را کنار نزدیک ۱۱ نقطه درصد حمل می‌کند - جذر ۰٫۶ برابر ۰٫۴ بر روی ۲۰ - و تفاوت میان دو دور چنین حدود ۱۵ حمل می‌کند. پرش از ۶۰ به ۷۰ درصد بنابراین با هیچ چیزی که اتفاق افتاده است منطبق است. پنجاه تجربه نقش‌های هر دور را به تقریباً ۷ نقطه رساند، و بعد از ظهر هزینه.

این عدم‌تقارن استدلال برای نرخ مداخله است: محاسبه شده در هزاران فریم تا بجای بیست نتیجه باینری، زودتر و هموارتر حرکت می‌کند. خنثی‌کنندگی این است که فریم‌های درون یک اپیزود به شدت هم‌بستگی دارند - یک grasp بد صد فریم مداخله متوالی را می‌کشد - بنابراین اندازه نمونه موثر نزدیک‌تر به تعداد takeover است. نرخ را به‌عنوان نشانگر ابتدایی و نرخ موفقیت را به‌عنوان ground truth کند درست در نظر بگیرید.

اپیزودهای ارزیابی را از مجموعه آموزشی ترکیب شده دور کنید

اپیزودهای ارزیابی هرگز نباید مجموعه داده آموزشی ترکیب شده وارد شوند - وگرنه دور n+1 روی داده‌ای که برای آن آموزش داده شده امتیاز داده‌شده است، و منحنی memorization اندازه‌گیری می‌کند.

تله‌اپ ۳: تنها آموزش بر روی تصحیحات سیاست را خم می‌کند

تصحیحات داده جالب‌اند، بنابراین غریزه آموزش بر روی آنها است. نکنید. آنها ساخت شده‌اند از برش خیلی محدود از فضای حالت جایی که سیاست از قبل شکست می‌خورد و تقریباً هیچ چیز درباره بیشتر اجرا که کار کرد نمی‌گویند. تیونر دقیق بر روی آن برش تنها و شما سیاست خوب برای بازیافت از نزدیک‌کردن خراب می‌کنید که فراموش کرده است چگونه نزدیک‌کردن تمیز کنید.

Mandlekar و همکاران سیستم مداخله دور خود را حول این ساخت کردند. قالب‌بندی آنها: وظایف دستکاری منطقه گلوتالق شامل دنباله‌ای از اقدامات دقیق - درج یک پاد به دستگاه قهوه‌ای آنها مثال است - جایی که انحرافات کوچک به حالت‌هایی که نمایشات هرگز پوشش دادند منجر می‌شوند. الگوریتم آنها به‌صورت تکراری بر روی داده‌های جدید آموزش می‌دهند تا سیاست یادگیری کند تا از آن گلوتالق‌ها عبور کند، و آنها گزارش می‌دهند که عوامل آموزش‌شده بر روی داده‌های مداخله عوامل آموزش‌شده بر روی معادل تعداد نمونه‌های non-interventional demonstrators را شکست دهند.

فقط‌تصحیح آموزش دقیق علیه ترکیب ترکیب شده
چه تصحیحات‌فقط به‌شما می‌دهند
  • سریع: اجرای کوتاه بیش از چند اپیزود برای تکرار ارزان است
  • مستقل‌هدف‌شده: gradient توسط حالت‌هایی که شما برای انجام می‌دهید غالب‌شده است
  • ارزان برای آزمایش اینکه آیا سبک تصحیح قابل یادگیری است
چه قیمتی دارد
  • توزیع تیون دقیق دیگر شبیه توزیع وظیفه نیست
  • رفتار نامی می‌تواند به طور مرئی درون یک دور واحد تخریب شود
  • نرخ می‌تواند در حالی که موفقیت آن با هم پایین می‌رود پایین بیفتد - بخش‌های تمیز برای بازیافت تبدیل شده‌اند

نسبت ترکیب یک ابر‌پارامتر است و شایسته یادداشت شدن است. ترکیب مجموعه داده بعدی آنجاست که تصمیم‌گیری می‌شود: نمایشات اصلی به علاوه مجموعه تصحیح، انتخاب اپیزود صریح به هر منبع تا بجای قانون که بی‌سازی هر چیزی را می‌کشد که در دسترس است. آنجا یک مرحله ترکیب در cockpit است، و نتیجه مجموعه داده عادی است - نگاه کنید به مستندات آموزش. چه ابزاری برای شما ثبت کدام نسبت منحنی کدام را تولید کند نیست.

دام ۴: انسان متخصص ثابت نیست

نظریه DAgger متخصص را فرض می‌کند. شما در معنی فنی نیستید: تصحیحات شما نمونه‌های از توزیع شرطی ثابت بر روی اقدام نیستند. نویسندگان ACT این را هنگام فهرست‌کردن موانع برای دستکاری دقیق نام‌گذاری می‌کنند - خطاها در طول زمان ترکیب می‌شوند، و نمایش‌های انسانی می‌تواند non-stationary باشند. سیستم آنها هنوز ۸۰ تا ۹۰ درصد موفقیت را بر روی شش وظایف واقعی از ده دقیقه نمایش‌ها می‌رساند، بنابراین مسئله tractable است، نه ناپدید.

مطالعه robomimic نقطه را از طرف داده می‌کند. در سراسر شش الگوریتم آفلاین بر روی پنج کار چند‌مرحله‌ای شبیه‌سازی شده و سه واقعی‌جهانی، دروس آن شامل حساسیت برای انتخاب‌های طراحی، وابستگی برای کیفیت نمایش، و - یکی که در اینجا بدترین است - تنوع از معیارهای توقف، زیرا اهداف آموزش و ارزیابی متفاوت هستند. checkpoint با کمترین loss نیست قابلاً بالاترین نرخ موفقیت.

نسخه سخت‌افزار این است: حالت ورودی تصحیح را شکل می‌دهد. یک رهبر-پیروی‌کننده تنظیم مسیرهای مستمر در سرعت انسان را تولید می‌کند. فشارهای صفحه کلید توسط سرور سخت‌گیر می‌شوند - دو درجه در هر فراخوانی بر روی مفاصل بازو، چهار بر روی gripper - بنابراین نیت یکسان به‌عنوان یک پله‌ای از مراحل کوچک فرود می‌آید. Sliders اهداف مطلق ارسال می‌کنند و سرور حداکثر شش درجه به سمت آنها در هر فراخوانی حرکت می‌کند. سه حالت، سه توزیع عملکرد؛ اختلاط کردن هر سه و سپس تعجب از اینکه چرا نزدیک‌کردن تند شد خودآزردی است. مستندات تله‌اپراسیون پوشش می‌دهد که هر حالت چه ارسال می‌کند.

وزن مداخلات: IWR و آنچه بعد از آن آمد

اگر تصحیحات اقلیت ارزشمند هستند، اصلاحی اصول‌محور وزن تا انحصاری است. Intervention Weighted Regression پیاده‌سازی مرجع است: داده‌ها به نمونه‌های مداخله و غیر مداخله تقسیم می‌شوند، و دو بخش در نسبت برابر نمونه‌گیری می‌شوند در طول آموزش. مجموعه تصحیح که پنج درصد فریم‌ها است سپس نیمی از gradient را می‌دهد، بدون رفتار نامی از توزیع ناپدید شود.

نسبت برابر یک نقطه شروع است، نه قانون. Sirius آن را عمومی می‌کند با جایگزینی بخش باینری با وزن مستمر از تقریب اعتماد انسانی؛ Sirius-Fleet تصمیم‌گیری دستگاه را بالا حرکت می‌دهد، استفاده از یک مدل جهانی بینایی و پیش‌بینی‌کنندگان ناهنجاری تصمیم گرفتن زمانی که انسان تقاضا می‌شود. رشته مشترک: پرچم مداخله سیگنال آموزشی است، نه فقط ستون حسابداری.

روشچه کسی تصمیم می‌گیرد کی انسان عمل می‌کندچگونه داده‌های مداخله استفاده می‌شوندنتیجه گزارش شده
DAgger (۲۰۱۱)برنامه ثابت؛ برچسب‌های حالت بازدید شده متخصصیک مجموعه داده رشد‌کننده، بدون وزنقالب‌بندی شده به‌عنوان کاهش به یادگیری آنلاین بدون پشیمانی
HG-DAgger (۲۰۱۹)انسان، دروازه کنترل بر روی سیستم واقعیتجمیع‌شده؛ به علاوه آستانه ایمنی یادگیری شده بر روی عدم‌قطعیت مدلبهتر از DAgger و BC در رانندگی؛ هیچ تعداد مداخله داده نشد
IWR (۲۰۲۰)انسان، از طریق تله‌اپراسیون دورنمونه‌های مداخله و غیر مداخله در نسبت برابر رسم شده‌اندشکست non-interventional demos در شمارش نمونه برابر
Sirius (۲۰۲۲)انسان، در طول استقراروزن‌دار BC، وزن‌ها از تقریب اعتماد انسانی۸ ٪ افزایش در شبیه‌سازی، ۲۷ ٪ بر روی سخت‌افزار واقعی؛ ۲ برابر سرعت همگرایی سریع‌تر
ThriftyDAgger (۲۰۲۱)سیستم، دروازه بر روی نوبت و ریسکجمع‌آوری تعاملی تحت بودجه نظارتمطالعه کاربر (N=۱۰): ۵۸ ٪ انسان بالاتر و ۸۰ ٪ عملکرد ربات بالاتر از روش بعدی بهترین
Fleet-DAgger (۲۰۲۲)سیستم، تخصیص توجه در کل fleetیادگیری fleet امتیاز‌شده توسط Return on Human Effortتا ۸٫۸ برابر بالاتر ROHE از خطوط پایگی
Sirius-Fleet (۲۰۲۴)پیش‌بینی‌کنندگان ناهنجاری با معیارهای خودتطبیقیادگیری چند‌وظیفه‌ای با یک مدل جهانی بیناییدرخواست‌های مداخله کمتر زیرا خودمختاری بهتر می‌شود
نمای leaderboard مقایسه سیاست‌های ربات بر اساس امتیاز اندازه‌گیری‌شده
رتبه‌بندی سیاست‌ها علیه یکدیگر معنی دارد تنها وقتی هر ورودی پروتکل یکسانی را اجرا کرد. که برای سه دور خود نیز صدق می‌کند.

چهار معیار شایسته‌ی ثبت کنار نرخ

  • Takeovers در هر اجرا. بیست تصحیح کوتاه و یک طول دهند نرخ‌های مشابهی می‌دهند و سیاست‌های متفاوت را توصیف می‌کنند - یک lurch، یکی با یک blind spot تنهایی.
  • میانگین طول مداخله. طول افزایش‌یافته با حساب کاهش‌شده به معنی شکست‌های باقی‌مانده سخت هستند، کدام پیشرفت دیرهنگام است.
  • زمان تا اولین مداخله. سیاستی که قبل از نیاز به کمک دورتر می‌رود حتی وقتی نرخ کل صاف است بهتر است.
  • جایی که مداخلات خوشه‌بندی می‌شوند. Bin پرچم توسط پیشرفت اپیزود عادی شده؛ قله پایدار در سراسر دورها یک گلوتالق را اشاره می‌کند.

پروتکل دور شما می‌تواند واقعاً اجرا شود

دور اندازه‌گیری شده شش مرحله دارد و یک سطر در log تولید می‌کند. چهار اولی حلقه است؛ دو آخری این را اندازه‌گیری می‌کند.

  1. 1
    پروتکل ارزیابی قبل از دور صفر منجمد کنید

    حالت شروع، placement شی، دوربین‌ها، تعداد تجربه، timeout و معیار موفقیت را یادداشت کنید. جدول را عکس‌برداری کنید. اگر مستند تغییر کند، سری دوباره شروع می‌شود.

  2. 2
    بخش بسنجید

    پروتکل را با بدون مداخلات اجرا کنید و موفقیت‌ها را ثبت کنید؛ سپس یک جلسه آموزش‌شده با takeover فعال‌شده اجرا کنید و نرخ را ثبت کنید. آن دو عدد دور صفر هستند.

  3. 3
    تصحیحات را در یک سبک منسجم جمع‌آوری کنید

    یک حالت ورودی در هر دور، یک عملگر اگر می‌توانید مدیریت کنید. تحت کنترل بگیرید بر روی معیار شما می‌توانید بیان کنید - «gripper بیش از دو سانتی‌متر از نزدیک‌کردن در نزدیک‌کردن» - و آن را برای دور نگاه دارید.

  4. 4
    هر اپیزود را همان روز تقسیم کنید

    تصحیح، ارزیابی یا دور انداز. اپیزودهای مبهم دور انداخته‌شده‌اند، نه ذخیره شده‌اند بر نظریه که داده بیشتر کمک می‌کند - تصحیح که خودتان خراب کردید بدتر از هیچ اپیزود است.

  5. 5
    ترکیب را صریحاً ترکیب کنید

    نمایشات اصلی به علاوه مجموعه تصحیح، انتخاب اپیزود به هر منبع. شمارش پایگی، شمارش تصحیح و هر وزن‌دهی ثبت کنید - این زمینه‌ای است که شما خواهید خواهد در سه هفته.

  6. 6
    بر روی checkpoint ادامه دهید، سپس دوباره‌سنجی کنید

    مجموعه داده ترکیب شده را از checkpoint قبلی آموزش دهید تا مدل پایگی، پروتکل منجمد به علاوه یک جلسه آموزش‌شده اجرا کنید، سطر را اضافه کنید، و علیه دو دور قبلی مقایسه کنید.

دو حد چگونه را تغییر می‌دهند خواندن یک دور ضعیف. ادامه دادن از checkpoint ابتدا وزن‌ها را از آن - نه ازتای بهینه‌ساز، بنابراین برنامه تازه شروع می‌شود و اجرای کوتاه از checkpoint همگرا‌شده خیلی کم حرکت می‌کند. و حرکت هم‌تراز رهبر در شروع takeover کمترین مسافت بر روی سخت‌افزار واقعی از هر چیز در زنجیر دارد؛ اگر تصحیحات همه با یک موج عارضی شروع کنند، آنجا قبل از بلام‌گذاری نسبت نگاه کنید.

حلقه اندازه‌گیری، از قبل سیم‌بندی

ay-robots این شش مرحله را به‌عنوان ویژگی‌های محصول پیاده‌سازی می‌کند: تحت کنترل mid-run از یک بازو رهبر، صفحه کلید یا sliders، با فریم‌های مداخله پرچم‌شده خودکار؛ هر اپیزود را به‌عنوان تصحیح، ارزیابی یا دور انداز تقسیم کنید؛ مجموعه داده بعدی را از نمایشات اصلی به علاوه تصحیحات ترکیب کنید، انتخاب اپیزود صریح به هر منبع؛ و اجرای آموزش بعدی را از checkpoint قبلی تا بجای مدل پایگی شروع کنید.

ببینید چگونه حلقه DAgger کار می‌کند

آنچه اعداد نمی‌توانند بگویند

هیچ‌کدام این حل نشده‌است، و منحنی مرتب نباید شما را متقاعد کند در غیر اینصورت. نرخ مداخله یک سیستم مشترک - سیاست، سخت‌افزار، عملگر، اتاق - اندازه‌گیری می‌کند و چیزی را خود برای نسبت داده‌شده نمی‌کند. نمی‌تواند قضاوت کند که آیا تصحیحات خوب بودند، و بخوشی خواهد بر روی وظیفه‌ای که آسان‌تر شده پوشاندن هندسه gripper صاف آن در سه هفته نزدیک‌تر را حرکت داد.

آنچه آن انجام می‌دهد این است تحویل تاثر مبهم به ستون شما می‌توانید بحث کنید. جایگزین نه معیار بهتر است؛ این سه هفته جمع‌آوری تصحیحات است که منحنی این است بعد از دور سه، شما به جمع‌آوری متوقف کنید. ادبیات survey یادگیری تقلیدی تعاملی به‌عنوان بازخورد انسانی که به‌صورت intermittent در طول اجرای ربات داده‌شده، بهبود آنلاین رفتار را تعریف می‌کند؛ خانواده پهن است، و بدون عدد در هر دور بدون چیزی کار نمی‌کند. نگاه کنید به راهنمای یادگیری تقلیدی SO-100 برای مجموعه داده پایگی شما ترکیب علیه، اجرای سیاست برای طرف استنتاج، و صفحه حلقه DAgger برای لوله پیاده‌سازی‌شده.

آیا نرخ مداخله فقط یک منهای نرخ موفقیت است؟

نه. نرخ اندازه‌گیری می‌کند چه مقدار از اجرا شما تحت کنترل گرفتید؛ نرخ موفقیت اندازه‌گیری می‌کند آیا وظیفه بدون شما انجام شد. اجرا می‌تواند با نرخ مداخله ۳۰ درصد موفق شود، و اجرا بدون مداخلات می‌تواند کاملاً شکست بخورد. آنها نیز در نویز متفاوت هستند: نرخ بر روی هزاران فریم هم‌بستگی هموار حرکت می‌کند، نرخ موفقیت میان مشتی نتیجه باینری پرش می‌کند. Log هر دو.

چند آزمایش ارزیابی برای نرخ موفقیت برای معنی کردن چیزی نیاز دارم؟

بیش از احساس معقول. تحت تقریب عادی، ۲۰ آزمایش در درست ۶۰ درصد نرخ موفقیت خطای استاندارد نزدیک ۱۱ نقطه درصد حمل می‌کنند، بنابراین حرکت ۱۰ نقطه‌ای میان دورها از نویز قابل‌تشخیص نیست؛ ۵۰ آزمایش آن نقشه را تقریباً ۷ رساند. اگر نمی‌توانید ۵۰ هزینه کنید، تعداد آزمایش را میان دورها یکسان نگاه دارید و حرکت کوچک را به‌عنوان نتیجه‌گیری ناشناس رفتار کنید.

چه نسبت ترکیب نمایشات برای تصحیحات باید شروع کنم؟

نقطه شروع شده‌ی توثیق شده IWR است: داده‌ها را به نمونه‌های مداخله و غیر مداخله تقسیم کنید و نسبت برابر از آن رسم کنید، بنابراین تصحیحات نیمی از gradient می‌دهند تا هر چقدر چند فریم آنها هستند. اگر تنظیم شما نمی‌تواند نمونه‌گیری وزن کند، نسبت آن را از طریق شمارش اپیزود هنگام ترکیب تقریب زنید و نسبت را ثبت کنید. آموزش تنها بر روی تصحیحات گزینه به دور انداختن است.

نرخ مداخله من بعد از یک دور بالا رفت. دور از بین رفت؟

نه لزوماً، اما توضیحات خسته‌کننده را ابتدا بررسی کنید: آیا checkpoint شما هدایت‌کردید checkpoint شما آموزش‌داده شده‌ای را مطابقت کردید، آیا شاخص دوربین یا mount تغییر کرد، آیا placement شی driftدولت نزدیک‌کردن، آیا سبک تصحیح منسجم بود. اگر هر چهار تمیز هستند و نرخ موفقیت جفت نیز پایین رفت، ترکیب را مظنون کنید - خیلی کم نمایشات پایگی علیه تصحیحات، یا تصحیحات که یکدیگر را تناقض دارند. رگرسیون درست کردن در log سود می‌رود، نه bin.

آیا می‌توانم پروتکل ارزیابی ثابت را رد کنم و فقط نرخ مداخله را تماشا کنم؟

تنها اگر پذیرفتید که نمی‌توانید بهبودی از عادت‌پذیری تشخیص دهید. نرخ به آستانه شما خود برای مداخله در زمان واقعی بستگی دارد، و آن آستانه پایین می‌رود زیرا به عادات سیاست عادت‌کنید. پروتکل منجمد بخشی از اندازه‌گیری است آستانه شما نمی‌تواند رسیدن - نشانه‌های چسب‌دار شده، حالت خانه نوشته‌شده، تعداد آزمایش ثابت، معیار تصمیم‌گیری قبل از دور. تغییر‌ناپذیر باید در سری باقی بماند.

Log را در مخزن نگاه دارید، نه دفترچه: دورها روزهای دورتر هستند، سخت‌افزار دوبارهِ ساخت شده، و شخصی منحنی را در اکتبر می‌خوانند شما در اگست بدون حافظه هستید. مستندات FAQ جزئیات عملیاتی جا مانده در اینجا را پوشش می‌دهد.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started