نمایش انتزاعی یک صحنۀ دستکاری ربات، نشان دهندۀ توزیع state‌ای که یک policy یاد‌گرفته شده در حین اجرا بازدید می‌کند
DAggerImitation LearningBehavior CloningRobot LearningTheory

DAgger توضیح داده شد: چرا Behavior Cloning منحرف می‌شود و Dataset Aggregation واقعاً چه چیز را ثابت می‌کند

AY-Robots ResearchAugust 27, 202615 دقیقه خواندن

Behavior Cloning یک policy را بر روی توزیع state متخصص تناسب می‌دهد و سپس به‌طور مستقل استقرار می‌یابد. فاصله بین این دو توزیع دلیل این است که policy‌ای که در validation خوب به نظر می‌رسد، در مرحله 300 از میز می‌افتد. این فصل تئوری سری DAgger ما است: جایی که جملۀ خطای درجه دوم منشأ می‌گیرد، Dataset Aggregation چه چیز را تغییر می‌دهد، اثبات بدون‌پشیمانی چه فرض می‌کند، و کدام بخش از صورتحساب متخصص انسانی باید بپردازد.

شکستی خاص وجود دارد که هر کسی که یک manipulation policy را آموزش می‌دهد، دیر یا زود با آن روبرو می‌شود. policy به سمت مکعب دراز می‌شود، تا دو سانتی‌متر نزدیک می‌شود، تردید می‌کند، به‌ طرف کناری منحرف می‌شود، و سپس کاری بی‌ربط با کار انجام می‌دهد. validation loss خوب بود. بازپخش حلقه‌باز بر علیه episodes نگهداشتۀ شده خوب بود. و با این‌حال bazu در موضعی قرار می‌گیرد که هیچ‌جا در داده‌های آموزشی ظاهر نمی‌شود، و از آن‌جا چیزی منطقی برای گفتن ندارد.

این شکست یک نام و یک نظریۀ ثابت شدۀ پشت آن دارد. این اولین مقالۀ چهار مقالۀ DAgger است، و argument خود را پوشش می‌دهد: چرا تناسب یک policy بر روی مسیرهای معرّف خود خطای تولید می‌کند که می‌تواند با مربع طول episode رشد کند، Dataset Aggregation چه چیز را تغییر می‌دهد، و اثبات بدون‌پشیمانی چه تعهد نمی‌کند. حلقه بر روی سخت‌افزار واقعی در اجرای یک حلقۀ DAgger بر روی SO-100 پوشش داده می‌شود، variant گیت‌شدۀ انسانی در HG-DAgger و مداخلات گیت‌شدۀ انسانی، و سؤال اندازه‌گیری در اندازه‌گیری یک حلقۀ DAgger.

نسخۀ کوتاه

  • Behavior Cloning بر روی توزیع state معرّف آموزش می‌یابد و بر روی state policy خود ارزیابی می‌شود. عدم تطابق در طول episode تشدید می‌شود.
  • Ross و Bagnell نشان دادند که هزینۀ اضافی می‌تواند به‌عنوان T مربع برابر خطای هر مرحله رشد کند؛ مقالۀ DAgger این حد را بیان‌مثال می‌کند و توجه می‌دهد که محکم است.
  • DAgger state‌هایی را برچسب می‌زند که policy خود بازدید می‌کند، و بر روی هر مجموعۀ داده‌ای که تاکنون جمع‌آوری شده، نه تنها جدیدترین، دوباره‌آموزش می‌یابد.
  • تضمین یک تقلیل به آنلاین learning بدون‌پشیمانی است: تجمیع و دوباره‌آموزش Follow-The-Leader است.
  • این نسبت به بهترین loss قابل‌دستیابی در policy class است، نه نسبت به صفر - و متخصص همچنان باید state‌هایی را برچسب‌زند که هرگز تولید نکرده‌است.

فرض‌ای که Behavior Cloning بی‌سر و صدا می‌کند

یک مجموعۀ داده‌ای نمایش جفت‌های observation-action است. Behavior Cloning یک تابع را به آن مجموعه با supervised learning معمولی تناسب می‌دهد و متوقف می‌شود. این قدیمی‌ترین ایده در زمینه است. ALVINN Pomerleau، در سال 1988، یک شبکۀ back-propagation سه‌لایه‌ای بود که تصاویر را از دوربین و یک laser range finder می‌گرفت و جهتی را که وسیله نقلیه باید سفر کند تولید می‌کرد؛ بر روی تصاویر راه شبیه‌سازی‌شدۀ آموزش یافته و تحت برخی شرایط صحرایی راه‌های واقعی را دنبال کرد. دستور‌العمل بسیار تغییر نکرده‌است؛ شبکه‌ها تغییر کرده‌اند.

آنچه نادیده گرفته می‌شود یک بررسی در مورد جایی است که این جفت‌ها از کجا آمده‌اند. هر یک از آن‌ها بر روی یک مسیری که معرّف تولید کرد قرار دارند. policy‌ای که استقرار می‌یابند policy خود را تولید می‌کند. همان لحظه که منحرف می‌شود، درخواست برای state‌هایی است که در توزیع آموزشی نبودند، و پاسخ آن آن را بیشتر بیرون می‌برد. Ross، Gordon و Bagnell مقالۀ DAgger را دقیقاً با این شروع می‌کنند: پیش‌بینی ترتیبی assumption i.i.d. را تحت supervised learning زیر سؤال می‌برد، زیرا پیش‌بینی‌های یادگیری شدۀ خود inputs‌ای را که بعد می‌بیند تعیین می‌کند.

واضح‌ترین تصویر در آن مقاله اصلاً یک ربات نیست. تقلید یک planner تقریباً بهینه برای Super Mario Bros تولید یک policy کرد که مکرراً بر علیه یک مانع گیر کرد به جای اینکه از آن بپرد. دلیل کل argument در یک جملۀ است: متخصص همیشه از یک فاصلۀ راحت پرید، بنابراین مجموعۀ داده شامل هیچ state‌ای نبود که Mario به یک مانع فشرده‌شده بود، و بنابراین هیچ برچسب برای آنچه باید انجام شود وقتی او بود وجود نداشت.

Mario را با یک SO-100 arm عوض کنید و ساختار یکسان است. نمایش‌های شما یک approach و grasp تمیز را نشان می‌دهد، نه gripper بسته‌شدۀ دو سانتی‌متر کوتاه - بنابراین policy هیچ ایده‌ای ندارد که از آن‌جا چه کند، و هر چیزی که حدس می‌زند آن را بیشتر بیرون می‌برد. Covariate Shift یک ویژگی از data collection procedure است، نه از network architecture.

جایی که جملۀ درجه دوم منشأ می‌گیرد

مقالۀ AISTATS 2010 توسط Ross و Bagnell، Efficient Reductions for Imitation Learning، تشدید را دقیق می‌کند. بگذارید T تعریف‌کننده task horizon باشد، بگذارید task cost در unit interval محدود شود، و epsilon را loss surrogate اندازه‌گیری‌شده تحت توزیع state expert's - عددی که validation set شما گزارش می‌کند. سپس هزینۀ اضافی اجرای آن policy برای مراحل T، نسبت به متخصص، توسط T مربع برابر epsilon محدود می‌شود. Ross، Gordon و Bagnell این را به‌عنوان Theorem 2.1 در مقالۀ DAgger دوباره بیان می‌کند و جملۀ مهم را اضافه می‌کند: حد محکم است. مسائل وجود دارند که policy با epsilon loss بر روی توزیع expert واقعاً هزینۀ اضافی رشد به‌طور درجه دوم در T را متحمل می‌شود.

محکم به معنای معمولی نیست. جملۀ درجه دوم یک worst case بر روی یک کلاس مسائل است، نه پیش‌بینی درخصوص pick-and-place task شما. آنچه برقرار می‌کند این است که بیشتر expert demonstration نمی‌تواند مسئله را حذف کند: این فقط estimate epsilon را بر روی توزیعی که policy آزمایش نخواهد شد بهتر می‌کند.

راه فرار در همان مقاله است، به‌عنوان Theorem 2.2 دوباره بیان‌شده. اگر یک policy به loss epsilon دست می‌یابد تحت its own توزیع state، و یک اقدام غلط به حداکثر u cost-to-go تحت متخصص هزینه می‌کند، هزینۀ اضافی توسط u برابر T برابر epsilon محدود می‌شود - خطی در horizon. ثابت u کمیت جالبی است: حداکثر 1 برای disagreement 0-1 با متخصص، و O(1) وقتی‌که متخصص می‌تواند در چند مرحله بازیابی کند. در worst case O(T) است، و حد خطی آن‌گاه بهتر از حد درجه دوم نیست.

تنظیمحد بر روی هزینۀ اضافی بر علیه متخصصآنچه بر آن متکی است
Behavior Cloning (Ross & Bagnell 2010, دوباره بیان‌شده به‌عنوان Thm. 2.1 در Ross et al. 2011)T مربع برابر epsilonepsilon اندازه‌گیری‌شده بر روی توزیع state متخصص؛ cost در [0,1]؛ حد محکم است
هر policy با epsilon loss تحت توزیع خود (Thm. 2.2)u برابر T برابر epsilonu bounded هزینۀ cost-to-go یک اقدام غلط؛ حداکثر 1 برای 0-1 loss، O(T) worst case
Forward Training (Ross & Bagnell 2010)u برابر T برابر epsilonیک policy هر timestep؛ T policies و یک T شناخته‌شده، متناهی نیاز دارد
SMILe (Ross & Bagnell 2010)نزدیک به خطی در T و epsilon بر روی برخی کلاس‌های مسائلalpha در O(1/T مربع)، N در O(T مربع log T)؛ یک mixture stochastic را تولید می‌کند
DAgger (Thm. 3.2, Ross et al. 2011)u برابر T برابر epsilon_N، به‌علاوه O(1)N در ترتیب uT؛ strongly convex bounded loss؛ آنلاین no-regret learner؛ epsilon_N بهترین loss hindsight است
Robot Workspace نمایندگی state‌هایی که policy بازدید می‌کند و هرگز در مجموعۀ نمایش ظاهر نشد
state‌های مهم برای یک دور DAgger آن‌هایی هستند که هیچ‌کس نمایش نداد: grasp near-miss، gripper نیمه‌باز، arm گذاشتۀ object.

دو تلاش قبل از DAgger

Forward Training جواب صادقانه اما غیرعملی است. یک policy جداگانه برای هر timestep آموزش دهید، به‌ترتیب، هر یک بر روی توزیع state ناشی از policy‌هایی که قبلاً برای مراحل قبل تعریف‌شده‌اند، بنابراین هر policy دقیقاً توزیعی را می‌بیند که با آن روبرو خواهد شد. گیر در توصیف است: T policy، آموزش ترتیبی، بدون early stopping. برای یک manipulation episode در 30 frame در ثانیه، T در صدها است.

SMILe، از همان مقاله، و SEARN، از کار Daume، Langford و Marcu بر روی structured prediction، مسیر دیگر را می‌رود: یک policy stationary، اما stochastic. هر iteration یک component آموزش می‌دهد و آن را به یک mixture اضافه می‌کند، احتمال را از متخصص دور می‌کند. نتیجه یک mixture‌ای است که بعضی component بدتر هستند - بر روی یک arm فیزیکی، کنترل‌کننده‌ای که می‌تواند یک component بد را mid-motion نمونه‌برداری کند. این انگیزۀ بیان‌شده برای خواستن یک policy stationary deterministic به‌جای آن است.

DAgger: یک ایده، یک جعبه

Dataset Aggregation policy deterministic را نگاه می‌دارد و fix را به data collection حرکت می‌دهد. هر دور: rollout policy فعلی، record state‌هایی که بازدید می‌کند، از متخصص بپرسید که اقدام صحیح در هر یک چه بود، آن جفت‌ها را به مجموعۀ داده‌ای اضافه کنید که قبلاً داشتید، دوباره‌آموزش روی اتحاد. نام algorithm است - شما تجمیع می‌کنید، هرگز دور نمی‌اندازید.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Meta-algorithm DAgger، Algorithm 3.1 از Ross، Gordon & Bagnell (2011).

سه جزئیات وزن بیشتری نسبت به آنچه که به نظر می‌رسند حمل می‌کند. برچسب‌ها برای state‌های بازدید‌شدۀ mixed policy هستند، اما اقدام‌ها از متخصص می‌آیند - policy سؤال‌ها، متخصص جواب‌ها را فراهم می‌کند. دوباره‌آموزش بر روی کل aggregate است، که هر دور را یک Follow-The-Leader step می‌کند: در دور n بهترین policy را در hindsight بر روی هر مسیری که تاکنون وجود داشته انتخاب می‌کنید. این framing آن‌چیزی است که اثبات بر آن آویزان است. و algorithm به‌وسیلۀ بازگرداندن بهترین policy در sequence انجام می‌شود که بر روی validation set انتخاب‌شده، زیرا قضایا تضمین می‌کنند که برخی policy در sequence خوب است، نه اینکه آخری یکی است.

Beta Schedule، و چرا یک tuning knob نیست

Mixed policy beta_i برابر متخصص به‌علاوه یک منهای beta_i برابر یادگیری است. نقطه عملی است: اولین policy‌های یاد‌گرفتۀ چند داده آموزش می‌یابند، بسیاری اشتباه می‌کنند، و در غیر این‌صورت rollout را در state‌هایی می‌گذرانند که یک‌بار policy بهتر می‌شود بی‌ارتباط می‌شوند.

تئوری دقیقاً یک شرط تحمیل می‌کند: میانگین درحال‌اجرای betas به صفر باید برود. تحلیل با beta_i محدود به (1 - alpha) توان i-1 کار می‌کند، برای یک ثابت alpha مستقل از T.

جدولآنچه انجام می‌دهدآنچه که مقاله گزارش می‌کند
beta_1 = 1اولین دور pure expert demonstration؛ هیچ initial policy نیاز نیستنقطۀ شروع توصیه‌شدۀ هر variant
beta_i = 1 اگر i = 1، به غیر 0متخصص فقط در دور یک؛ بدون free parameterنسخۀ parameter-free مقاله، که می‌گوید اغلب بهترین عملکرد در عمل را دارد؛ 2980 بر روی Super Mario Bros بعد از 20 iteration
beta_i = p^(i-1) با p = 0.5احتمال متخصص هندسی از بین می‌رود3030 بر روی همان benchmark، کمی از نسخۀ parameter-free پیشی
beta_i = p^(i-1) با p = 0.9متخصص بسیار بیشتر در حلقه ماندconvergence به‌طور نمایانی کندتر؛ همچنان بهتر می‌شود وقتی که 20 iteration ختم شدند

فاصله بین 2980 و 3030 بر روی scale اجرا به تقریباً 4300 کوچک است، اما توضیح مقاله این است که مفیدترین یادداشت عملی در قسمت است. با parameter-free schedule، Mario در همان نقطۀ شروع در یک نقطۀ شروع گیر کرد و mass نزدیک‌به‌duplicate data از آن یک location تولید کرد؛ اجازت دادن متخصص درایت یک fraction از زمان هم او را آزاد کرد و انواع state را گسترش داد. Schedule کمتر درخصوص mixing ratio است تا اینکه آیا data collection شما همچنان state‌های جدید تولید می‌کند یا همان شکست.

چرا schedule به یک physical arm همان‌طور که نوشته‌شده منتقل نمی‌شود

یک stochastic per-timestep mixture کنترل authority را در control rate، 30 بار یک ثانیه بر روی یک SO-100 setup معمولی می‌کند. هیچ teleoperation interface این را ایمن یا معنادار نمی‌کند. بر روی سخت‌افزار واقعی beta schedule به یک تصمیم انسانی درخصوص وقتی‌که تصاحب کنید می‌رود: یک algorithm متفاوت با یک تحلیل متفاوت.

تضمین: یک تقلیل به آنلاین learning بدون‌پشیمانی

اینجا حرکتی است که مقاله را آن‌چه می‌کند. هر دور DAgger را به‌عنوان یک نمونۀ وارد یک online learning problem در آن loss در دور i surrogate loss تحت توزیع state policy استفاده‌شدۀ در دور i است درمان کنید. یادگیری قبل از دیدن آن loss به یک policy تعهد می‌کند، و sequence غیر stationary است زیرا بر روی policy تولید‌شدۀ تاکنون بستگی دارد.

یک algorithm no-regret است اگر average loss آن بر روی N round به بهترین single policy در hindsight نزدیک شود. Follow-The-Leader بر روی strongly convex loss چنین algorithm‌ای است، با average regret shrinking در ترتیب 1/N - و دوباره‌آموزش بر روی aggregate کامل دقیقاً Follow-The-Leader است. هر other no-regret learner می‌تواند خدمت کند: تحلیل یک تقلیل است، نه ویژگی یک optimizer.

یک lemma فاصله بین mixed policy که داده را جمع‌آوری کرد و learned policy که استقرار می‌یابد را پل می‌کند: Lemma 4.1 فاصلۀ L1 بین توزیع state آن‌ها را توسط 2 T beta_i محدود می‌کند. این دلیل این است که betas باید decay کنند - در حالی‌که متخصص هنوز control authority قابل‌توجه دارد، state‌های جمع‌آوری‌شدۀ شما state‌های policy نیستند تولید خواهند کرد. Lemma را با regret bound ترکیب کنید و نتیجۀ اصلی دنبال می‌شود: بعد از تقریباً T iteration، برخی policy در sequence دارای surrogate loss تحت توزیع خود در O(1/T) از epsilon_N است. آن را به حد خطی وارد کنید و شما در Theorem 3.2 فرود می‌آیند.

سمت تجربی توسط استاندارهای فعلی متواضع است. در Super Tux Kart supervised baseline average falls per lap را بهتر نکرد همان‌طور که بیشتر داده آمد، DAgger به یک policy دست یافت که هرگز از track پس از پانزده iteration نیفتاد، و SMILe بعد از بیست هنوز تقریباً دو بار per lap افتاد. بر روی handwriting benchmark، character accuracy 82 درصد بدون ساختار، 83.6 درصد supervised، 85.5 درصد با DAgger بود. هیچ یک از این‌ها یک manipulation result نیست.

آنچه که اثبات تعهد نمی‌کند

جملات قضیه شرطی هستند، و شرایط load-bearing هستند.

تضمین DAgger، خواندن نزدیک
آنچه به شما می‌دهد
  • یک حد خطی تا درجه دوم در T، تحت فرض‌های بیان‌شده.
  • یک policy stationary deterministic تا یک mixture stochastic.
  • یک تقلیل واقعی: هر no-regret آنلاین learner slot.
  • یک شماره iteration ملموس - تقریباً T دور قبل از اینکه regret term فرق نگذارد.
  • یک تضمین برای حداقل یک policy در sequence، از این‌رو passing validation بسته‌شده.
آنچه به شما نمی‌دهد
  • این نسبت به epsilon_N، بهترین loss در کلاس در hindsight، نه نسبت به صفر است. اگر کلاس شما نمی‌تواند متخصص نمایندگی کند، آن خالی در عمل است.
  • این یک no-regret method یا یک strongly convex surrogate loss نیاز دارد - قوی‌تر از کاهش classification که ساخت می‌کند، همان‌طور که نویسندگان توجه می‌دهند.
  • ثابت u می‌تواند O(T) در worst case باشد، و حد خطی آن‌گاه به درجه دوم folds.
  • این iterate، نه expert labels محدود می‌کند. بر روی یک ربات، labels بودجه هستند.
  • این فرض می‌کند متخصص می‌تواند در هر state بازدید‌شده پرسیده شود و آن‌جا صحیح جواب دهد. آن فرض کل هزینه است.

نتیجۀ دیگری اغلب به‌عنوان تکذیب نقل می‌شود و نیست. Rajaraman، Yang، Jiao و Ramachandran مطالعه minimax limits imitation learning در episodic MDPs با finite state space S و horizon H، و یک suboptimality lower bound در ترتیب |S| H مربع بیش از N ثابت می‌کنند که حتی وقتی‌که یادگیری ممکن است فعالانه متخصص را در visited state پرسش کند. این یک worst-case rate بر روی یک کلاس MDP در یک fixed episode budget، و آنچه که rule out می‌کند ایده‌ای است که interaction minimax rate را بهتر می‌کند؛ theorem DAgger یک جملۀ متفاوت است، deployed policy را نسبت به آنچه که policy class خود می‌تواند دستیاب شود محدود می‌کند.

Swamy، Choudhury، Bagnell و Wu بعداً این algorithm‌ها را بر روی کدام moments behavior متخصص آن‌ها تطابق دادند، و یک notion moment recoverability معرفی‌کردند که چگونه خوب هر خانواده compounding error را کاهش می‌دهد delineate می‌کند. survey‌های Osa و Celemin algorithmic landscape و human-feedback interface را پوشش می‌دهند.

صورتحساب: برچسب‌زنی state‌های متخصص هرگز تولید نکرد

هر چیز بالا فرض متخصصی که می‌تواند هر‌جا پرسیده شود دارد. در simulation با یک planner که تقریباً رایگان است - آزمایش‌های Mario یک planner تقریباً بهینه با دسترسی کامل به game state استفاده می‌کردند. با یک انسان بر روی یک ربات این dominant cost است، و یک عجیب: انسان باید یک اقدام صحیح در یک پیکربندی که خود competence آن هرگز ایجاد نکرده‌است تولید کند.

Kelly، Sidrane، Driggs-Campbell و Kochenderfer اعتراض را مستقیماً در مقالۀ HG-DAgger بیان می‌کنند. Vanilla DAgger متخصص را نیاز دارد action label فراهم کند در حالی‌که کاملاً کنترل سیستم را نداشت. این safety را کاهش می‌دهد، و با expert انسانی آن احتمالاً quality برچسب‌های جمع‌آوری‌شده را degradation می‌دهد، که آن‌ها را به perceived actuator lag نسبت می‌دهند. برچسب که شما بازمی‌گیرید برچسب algorithm assume نکرده است.

Laskey و همکاران مسئله را از طرف دیگر DART مهاجمه می‌کنند، و framing آن‌ها frank است: on-policy technique‌ها برای human supervisor خسته‌کننده، computational burden اضافی، و ممکن است dangerous state در آموزش بازدید کند. جایگزینی آن‌ها calibrated noise را به demonstration‌های supervisor خود تزریق می‌کند، بنابراین recovery بدون robot درحال‌حاضر اجرای untrusted policy‌ای نمایش داده می‌شود. بر روی MuJoCo Humanoid آن‌ها گزارش می‌کنند DART supervisor cumulative reward را 5 درصد کاهش می‌دهد در آموزش، در حالی‌که DAgger policy‌ها با 80 درصد کمتر cumulative reward supervisor اجرا می‌کند؛ بر روی grasping در clutter با Toyota HSR، میانگین 62 درصد افزایش بر روی behavior cloning.

SafeDAgger Zhang و Cho query‌های reference policy را به‌عنوان scarce resource درمان می‌کند: یک جداگانه safety policy پیش‌بینی می‌کند، بدون query، آیا primary policy درخواست detour از reference beyond threshold، و فقط آن state‌ها تحویل داده می‌شوند. هر سه به همان واقعیت واکنش نشان می‌دهند - تحلیل DAgger هیچ‌چیزی برای expert label تحمیل نمی‌کند، و واقعیت بسیار تحمیل می‌کند.

بخشی که هیچ‌کس هشدار نمی‌دهد

برچسب‌زنی off-distribution state‌ها به‌طور ذهنی سخت‌تر از task نمایش است. یک normal demonstration اجرای motor plan معنی دارد که قبلاً دارید. اصلاح یک policy که gripper را جایی قرار داده‌ای هرگز نبود به معنای یک recovery ساخت spot، تحت time pressure، با ربات همچنان حرکت کند. انتظار چند usable minute کمتر per session تا یک plain recording session، و تماشا quality correction خود decay طول یک.

LeRobot Dataset Structure نمایندگی episode، frame و per-frame column به‌عنوان stored on disk
Correction یک dataset تنها وقتی‌که intervention frame marked - در LeRobot format، یک per-frame column alongside observation و action.

آنچه این برای SO-100 بر روی میز شما به معنا است

Horizon را به واحد خود ترجمه کنید. یک بیست‌ثانیۀ episode در 30 frame بر ثانیه 600 decision step، و T در هر حد بالا آن عدد است. در T = 600، فاصله بین یک term scaling با T و یک scaling با T مربع فاصلۀ بین policy که از یک bad approach بازیابی می‌کند و یک است که نمی‌کند.

این بخشی از چرا action chunking کمک می‌کند: وقتی‌که یک policy short sequence اقدام‌ها per inference step تولید می‌کند، تعداد decision point کاهش می‌یابد، و بنابراین فرصت compound. Zhao، Kumar، Levine و Finn compounding error را به‌عنوان motivation برای Action Chunking با Transformers نام می‌برند، و 80 به 90 درصد موفقیت بر روی شش difficult real-world task، بر روی low-cost bimanual hardware، از ده minute worth demonstration گزارش می‌کنند. Chunking covariate shift را حذف نمی‌کند - state‌ها همچنان policy خود هستند - اما effective horizon را کوتاه می‌کند. ببینید action chunking و SO-100 imitation learning guide.

ترجمۀ دوم progress metric است. شما نمی‌توانید epsilon تحت توزیع policy خود اندازه‌گیری کنید مستقیماً - این نیاز expert action ground-truth برای هر visited state دارد، چیزی که سعی می‌کنید تولید کردن آن را تجنب می‌کنید. آنچه یک human-gated loop شما می‌دهد بجای intervention rate است: کسری از frame در یک run که در آن انسان over شد. یک proxy است، و برای دلایل unrelated به policy حرکت می‌کند - یک patient operator کمتر intervene می‌کند. وقتی مسلسل استفاده شود، یک عدد است که می‌گوید آیا یک دور سزای afternoon بود.

ترجمۀ سوم یک data-quality هشدار analysis پوشش نمی‌کند. Mandlekar و همکاران شش offline learning algorithm بر روی پنج simulated و سه real-world multi-stage manipulation task مطالعه کردند، و algorithmic design choice sensitivity، quality demonstration dependence، و stopping criterion variability گزارش می‌کنند. Belkhale، Cui و Sadigh argue کنند action divergence و transition diversity طریق dataset quality formalized شود، و state diversity همیشه beneficial نیست. یک دور DAgger state اضافی می‌کند هیچ‌کس deliberately انتخاب نکرد: برخی recovery data شما نیاز دارید، برخی ربات flailing در حالی‌که fumble برای takeover control.

Mechanically یک دور شش step: inference چالش‌ی با recording، over وقتی‌که policy misbehave، review run و file هر episode، sync correction، compose یک mixed dataset از original به‌علاوه correction با episode selection made explicitly per source، و continue training از قبلی checkpoint تا base model. بر روی ay-robots آن step وجود دارند به‌عنوان button، که plumbing حذف کند نه judgment. دو caveat: continue از checkpoint initialise weight و نیست یک optimizer resume، و leader-arm alignment move هنوز lightly tested بر روی hardware. ببینید training و datasets.

حلقۀ DAgger، قبلاً wired

Takeover در آن live inference run، per-frame intervention marking، filing episode به‌عنوان correction یا evaluation، composing یک mixed dataset با explicit episode selection per source، و continuing training از یک existing checkpoint همه built. شما هنوز decide وقتی‌که over و آنچه keep - که بخش automate نمی‌کند.

ببینید چگونه حلقۀ DAgger کار می‌کند

خانوادۀ tree، در یک جدول

روشچه state انتخاب کنیدآنچه متخصص فراهم می‌کندهزینۀ اصلی
Behavior Cloningمتخصصنمایش تمیزبدون recovery data؛ error می‌تواند compound درجه دوم در T
Forward Trainingیادگیری، per timestepبرچسب‌ها در طول induced distributionT جداگانه policy؛ unusable برای long horizon
SMILe / SEARNیک stochastic mixture از expert و learnerبرچسب‌ها در طول mixture distributionComponent mixture در quality متفاوت
DAggerMixed policy، beta decaying صفریک اقدام صحیح برای هر visited stateبرچسب‌زنی state متخصص هرگز تولید، در حالی‌که کنترل نیست
DARTمتخصص، perturbed توسط injected noiseنمایش تحت calibrated noiseNoise باید calibrated یادگیری error
HG-DAggerیادگیری، تا انسان overCorrection فقط در human-gated segmentDepend بر روی انسان judgment درخصوص وقتی‌که intervene
SafeDAggerیادگیری، filtered توسط safety gateLabel فقط وقتی‌که gate تقاضاGate خود باید trained و trusted

سؤالات متناوب پرسیده

آیا من واقعاً quadratic error growth بر روی ربات من مشاهدۀ خواهم کرد؟

نه به‌عنوان یک clean curve. حد یک worst case: محکم در آن برخی مسئله آن دستیاب، نه اینکه شما. آنچه شما می‌بینید نتیجۀ - یک policy که score خوب بر روی held-out frame، fail بر روی real task، و بهتر نشود وقتی‌که record بیشتر همان. اگر بیشتر clean data توقف کمک، که covariate shift، نه data-volume مسئله.

آیا من beta mixture implement کنم call آن DAgger کنم؟

Parameter-free version - expert در دور یک، pure learner بعد از - یک legitimate special case و اغلب بهترین performed در original experiment. آنچه شما نمی‌توانید drop aggregation: retraining فقط بر روی newest correction Follow-The-Leader interpretation break، که جایی است که no-regret argument از. تنها بر روی correction آموزش بسیار weaker procedure.

چرا return بهترین policy بر روی validation set تا آخری یکی؟

زیرا قضایا یک خوب policy وجود‌دارند جایی‌جا در sequence، نه اینکه این final iterate - bound بر روی minimum بر روی sequence. shipping هر چیز لعاب آخر دور حالت شرط جدید، و آخری دور reliably نیست بهترین.

چند دور برای plan کنم؟

تئوری iteration ترتیب T می‌خواهد، که برای یک 600-step episode نیست عدد کسی بر روی hardware اجرا می‌کند. اصلی experiment بیست iteration هر benchmark اجرا می‌کرد. در عمل شما round تا intervention rate اجرا می‌کنید stop کمتر falling، عدد بسیار کمتر analysis assume - یک gap واقعی بین تئوری و عمل.

اگر policy کلاس من سادگی نمی‌تواند متخصص نمایندگی کند؟

سپس DAgger شما save نمی‌کند، و حد می‌گوید - آن epsilon_N نسبت است، بهترین loss کلاس در hindsight. اگر بزرگ است زیرا architecture غلط، یک missing observation یا camera که scene نمی‌تواند دید، aggregation شما یک policy می‌دهد بهینه است در کلاس که نمی‌تواند task. open-loop replay چالش‌ی held-out episode قبل از جمع‌آوری correction.

جایی برای رفتن از اینجا

اگر شما نداشتید آموزش یک policy ابھی، این تئوری premature: record یک مجموعۀ داده اول، از training بر روی اولین policy و desktop client. اگر شما وزن کردید دیگر صد clean demonstration در برابر شروع correction: clean demonstration توزیع مسئله fix نمی‌کند. برای mechanic، continue با variant human-gated و سپس SO-100 walkthrough.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started