تصيير مجرد لمشهد معالجة روبوتية، يوضح توزيع الحالات الذي تزوره سياسة مكتسبة أثناء التنفيذ
DAggerImitation LearningBehavior CloningRobot Learningالنظرية

شرح DAgger: لماذا ينجرف Behavior Cloning وما يثبته Dataset Aggregation فعلاً

AY-Robots ResearchAugust 27, 202615 دقيقة قراءة

يُدرّب Behavior Cloning سياسة على توزيع الحالات لدى الخبير ثم يُنشرها على توزيعها الخاص. الفجوة بين هذين التوزيعين هي السبب في أن سياسة تبدو جيدة في التحقق تنهار على الخطوة 300. هذا هو فصل النظرية في سلسلة DAgger لدينا: من أين يأتي حد الخطأ التربيعي، ماذا يغيّر Dataset Aggregation، ما الذي تفترضه إثبات عدم الخسارة، وأي جزء من الحساب يتعين على الخبير البشري أن يدفعه.

هناك فشل معين يقابله كل من يدرب سياسة معالجة عاجلاً أم آجلاً. تصل السياسة للمكعب، تقترب بنحو سنتيمترين، تتردد، تنجرف جانباً، ثم تفعل شيئاً غير مرتبط بالمهمة. كان فقدان التحقق جيداً. كان التشغيل بدون حلقة مقابل حلقات محتفظ بها جيداً. ومع ذلك ينتهي الذراع في وضعية لا تظهر في بيانات التدريب، ولا يملك من هناك ما يقول به منطقي.

هذا الفشل له اسم ونظرية معروفة خلفه. هذا هو الأول من أربع مقالات حول DAgger، ويغطي الحجة نفسها: لماذا ينتج عن مناسبة سياسة على مسارات المُظهِر الخاصة به خطأ يمكن أن ينمو بمربع طول الحلقة، ماذا يغيّر تجميع البيانات، وما الذي لا يعده إثبات عدم الخسارة. الحلقة على الأجهزة الحقيقية مغطاة في تشغيل حلقة DAgger على SO-100، والمتغير المأذون به بشرياً في HG-DAgger والتدخلات المأذونة بشرياً، وسؤال القياس في قياس حلقة DAgger.

النسخة المختصرة

  • يدرّب Behavior Cloning على توزيع حالات الخبير ويُقيّم على توزيع السياسة الخاصة به. عدم المطابقة يتفاقم على مدار الحلقة.
  • أظهر Ross و Bagnell أن التكلفة الإضافية يمكن أن تنمو بـ T مربع مضروباً في الخطأ لكل خطوة؛ تعيد ورقة DAgger تلك الحد وتلاحظ أنها ضيقة.
  • يسمي DAgger الحالات التي تزورها السياسة نفسها، ويعيد التدريب على كل مجموعة بيانات تم جمعها حتى الآن، وليس فقط الأحدث.
  • الضمان هو اختزال إلى التعلم على الإنترنت بدون خسارة: التجميع وإعادة التدريب هو Follow-The-Leader.
  • يحمل نسبة إلى أفضل خسارة قابلة للتحقق في فئة السياسة، وليس نسبة إلى الصفر - والخبير لا يزال يتعين عليه تسمية الحالات التي لم يكن ليُنتجها أبداً.

الافتراض الذي يقيم به Behavior Cloning بصمت

مجموعة البيانات الموضحة هي كومة من أزواج الملاحظة والفعل. يناسب Behavior Cloning دالة إلى تلك الكومة بالتعلم الخاضع للإشراف العادي ويتوقف هناك. إنها أقدم فكرة في المجال. ALVINN لـ Pomerleau، في عام 1988، كانت شبكة backpropagation ثلاثية الطبقات أخذت الصور من الكاميرا وماسح المدى بالليزر وأنتجت الاتجاه الذي يجب أن تسلكه المركبة؛ تم تدريبها على صور الطريق المحاكاة واتبعت الطرق الحقيقية في بعض ظروف المجال. لم تتغير الوصفة كثيراً؛ الشبكات نعم.

ما يتم تخطيه هو فحص من أين جاءت تلك الأزواج. كل واحد منها يقع على مسار أنتجه المُظهِر. السياسة التي تنشرها تنتج الخاصة بها. اللحظة التي تنحرف فيها، يتم الاستفسار منها عن حالات لم تكن في توزيع التدريب، وإجابتها تبعدها أكثر. يفتح Ross و Gordon و Bagnell ورقة DAgger بالضبط مع هذا: التنبؤ المتسلسل ينتهك افتراض i.i.d. تحت التعلم الإحصائي، لأن تنبؤات المتعلم الخاصة به تحدد المدخلات التي يراها بعد ذلك.

أوضح توضيح في تلك الورقة ليس روبوتاً على الإطلاق. استنساخ مخطط قريب من الأمثل لـ Super Mario Bros. أنتج سياسة علقت بشكل متكرر ضد عقبة بدلاً من القفز عليها. السبب هو الحجة كلها في جملة واحدة: الخبير دائماً ما يقفز من مسافة مريحة، لذلك لم تحتوي مجموعة البيانات على حالة يكون فيها Mario ملتصقاً بعقبة، وبالتالي لا توجد علامة لما يجب فعله بمجرد أن يكون.

استبدل Mario بـ SO-100 arm والبنية متطابقة. تُظهِر عروضك توجهاً نظيفاً وإمساكاً نظيفاً، وليس المشبك يغلق سنتيمترين قصيراً - لذا لا تملك السياسة فكرة ما يجب فعله من هناك، وأي شيء تخمنه يأخذها أبعد من ذلك. Covariate shift هي خاصية إجراء جمع البيانات، وليس معمارية الشبكة.

من أين يأتي الحد التربيعي

ورقة AISTATS 2010 لـ Ross و Bagnell، Efficient Reductions for Imitation Learning، تجعل التراكم دقيقاً. دع T تكون أفق المهمة، دع تكلفة المهمة تكون محدودة في الفترة الزمنية للوحدة، ودع epsilon تكون الخسارة البديلة المقاسة تحت توزيع الحالات الخاصة بالخبير - الرقم الذي تبلغه مجموعة التحقق الخاصة بك. ثم التكلفة الإضافية لتشغيل تلك السياسة لخطوات T، نسبة إلى الخبير، مقيدة بـ T مربع مضروباً في epsilon. يعيد Ross و Gordon و Bagnell تسمية هذا كنظرية 2.1 في ورقة DAgger ويضيفان الجملة التي تعني: الحد ضيق. المشاكل موجودة حيث تتكبد سياسة بخسارة epsilon على توزيع الخبير فعلاً تكلفة إضافية تنمو بشكل تربيعي في T.

ضيق لا يعني نموذجي. الحد التربيعي هو أسوأ حالة على فئة من المشاكل، وليس تنبؤاً حول مهمة الالتقاط والتجميع الخاصة بك. ما يثبته هو أن عرض الخبير لا يمكن أن يزيل المشكلة: فقط يشحذ التقدير لـ epsilon على توزيع لن تُختبَر السياسة عليه.

طريق الهروب موجود في نفس الورقة، تُعاد صياغتها كنظرية 2.2. إذا حققت سياسة خسارة epsilon تحت توزيع الحالات الخاصة بها، وخطأ واحد فقط يكلف u على الأكثر في الخسارة المستقبلية تحت الخبير، تكون التكلفة الإضافية مقيدة بـ u مضروباً في T مضروباً في epsilon - خطي في الأفق. الثابت u هو الكمية المثيرة للاهتمام: الحد الأقصى 1 لعدم الاتفاق 0-1 مع الخبير، و O(1) كلما تمكن الخبير من التعافي خلال بضع خطوات. في أسوأ الحالات هو O(T)، والحد الخطي لا يكون أفضل من الحد التربيعي.

الإعدادربط التكلفة الإضافية على الخبيرما يستند عليه
Behavior cloning (Ross & Bagnell 2010, تم إعادة صياغتها كـ Thm. 2.1 في Ross et al. 2011)T مربع مضروب في epsilonepsilon مقاس على توزيع الحالات الخاصة بالخبير؛ التكلفة في [0,1]؛ الحد ضيق
أي سياسة بخسارة epsilon تحت توزيعها الخاص (Thm. 2.2)u مضروب في T مضروب في epsilonu يحد من عقوبة الخسارة المستقبلية لفعل خاطئ واحد؛ الحد الأقصى 1 لخسارة 0-1، O(T) في أسوأ الحالات
التدريب الأمامي (Ross & Bagnell 2010)u مضروب في T مضروب في epsilonسياسة واحدة لكل خطوة زمنية؛ يحتاج إلى سياسات T و T محدود معروف
SMILe (Ross & Bagnell 2010)شبه خطي في T و epsilon على بعض فئات المشاكلalpha في O(1/T مربع)، N في O(T مربع log T)؛ ينتج مزيجاً عشوائياً
DAgger (Thm. 3.2, Ross et al. 2011)u مضروب في T مضروب في epsilon_N، زائد O(1)N بترتيب uT؛ خسارة محدبة قوية محدودة؛ متعلم بدون خسارة؛ epsilon_N هي أفضل خسارة بالمقابل
فضاء العمل الروبوتي يمثل الحالات التي تزورها السياسة وليس ظهرت في مجموعة الحالات
الحالات التي تعني حلقة DAgger هي تلك التي لم يوضحها أحد: الإمساك القريب من الفشل، المشبك شبه المفتوح، الذراع بعد الجسم.

محاولتا التي جاءت قبل DAgger

التدريب الأمامي هو الإجابة الصادقة لكن غير العملية. تدريب سياسة منفصلة لكل خطوة زمنية، بالترتيب، كل واحدة على توزيع الحالات الناجم عن السياسات المثبتة بالفعل للخطوات السابقة، بحيث ترى كل سياسة بالضبط التوزيع الذي ستواجهه. يكمن الفخ في الوصف: سياسات T، مدرّبة بشكل متسلسل، لا يوجد توقف مبكر. لـ episode معالجة بـ 30 إطار في الثانية، T بالمئات.

SMILe، من نفس الورقة، و SEARN، من عمل Daume و Langford و Marcu حول التنبؤ المنظم، تأخذ الطريق الآخر: سياسة ثابتة واحدة، لكن عشوائية. تدرب كل تكرار مكون وتضيفه إلى مزيج، وتحول كتلة احتمالية بعيداً عن الخبير. النتيجة هي مزيج تختلف بعض مكوناته عن الآخرين - على ذراع فعلية، يمكن لمتحكم أن يعاين مكون سيء أثناء الحركة. هذا هو الدافع المُعلن عنه للرغبة في سياسة ثابتة حتمية بدلاً من ذلك.

DAgger: فكرة واحدة، صندوق واحد

تجميع البيانات يحافظ على السياسة الحتمية وينقل الإصلاح إلى جمع البيانات. كل جولة: قم بتشغيل السياسة الحالية، سجل الحالات التي تزورها، اطلب من الخبير ما الإجراء الصحيح الذي كان يجب أن يكون في كل واحد، أضف تلك الأزواج إلى مجموعة البيانات التي لديك بالفعل، أعد التدريب على الاتحاد. الاسم هو الخوارزمية - تجمع، لا تتجاهل أبداً.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
meta-خوارزمية DAgger، الخوارزمية 3.1 من Ross و Gordon و Bagnell (2011).

ثلاثة تفاصيل تحمل وزناً أكثر مما تبدو عليه. الوسوم موجودة لحالات يزورها السياسة المختلطة، لكن الإجراءات تأتي من الخبير - تزود السياسة الأسئلة، والخبير الإجابات. إعادة التدريب على التجميع بأكمله، مما يجعل كل جولة خطوة Follow-The-Leader: في الجولة n تختار السياسة الأفضل في المقابل عبر كل مسار حتى الآن. هذا الإطار هو ما يعتمد عليه الإثبات. وتنهي الخوارزمية بإرجاع السياسة الأفضل في التسلسل كما هو محدد في مجموعة التحقق، لأن النظريات تضمن أن بعض السياسات في التسلسل جيدة، وليس أن الأخيرة كانت.

جدول Beta، ولماذا هو ليس مقبض ضبط

السياسة المختلطة هي beta_i مضروب في الخبير زائد واحد ناقص beta_i مضروب في المتعلم. الفكرة هي عملية: السياسات المكتسبة الأولى القليلة مدرّبة على بيانات قليلة جداً، ترتكب أخطاء عديدة، وسوف تقضي وقت التشغيل في حالات تصبح غير ذات صلة بمجرد أن تتحسن السياسة.

النظرية تفرض بالضبط شرط واحد: يجب أن يذهب المتوسط المتحرك للـ betas إلى الصفر. يعمل التحليل مع beta_i مقيد بـ (1 - alpha) لقوة i-1، بثابت alpha مستقل عن T.

الجدولما يفعلهما تبلغه الورقة
beta_1 = 1الجولة الأولى هي مظاهرة خبير نقية؛ لا توجد حاجة لسياسة أوليةنقطة البداية الموصى بها في كل متغير
beta_i = 1 إذا i = 1، وإلا 0خبير فقط في الجولة الأولى؛ لا يوجد معامل حرنسخة خالية من المعاملات من الورقة، التي تقول إنها غالباً ما تقدم الأفضل عملياً؛ 2980 على Super Mario Bros. بعد 20 تكرار
beta_i = p^(i-1) مع p = 0.5احتمال الخبير يتحلل بشكل هندسي3030 على نفس المعيار، متقدماً قليلاً على الإصدار الخالي من المعاملات
beta_i = p^(i-1) مع p = 0.9يبقى الخبير في الحلقة لفترة أطول بكثيرتقارب أبطأ بوضوح؛ لا يزال يتحسن عندما انتهت التكرارات العشرين

الفجوة بين 2980 و 3030 على مقياس يصل إلى تقريباً 4300 صغيرة، لكن شرح الورقة لها هو أكثر ملاحظة عملية مفيدة في القسم. مع جدول خالي من المعاملات، علقت Mario في نفس المكان مبكراً وأنشأ كتلة من البيانات شبه المكررة من ذلك الموقع الواحد؛ السماح للخبير بقيادة كسر من الوقت أطلقها من الإمساك وأوسع مجموعة متنوعة من الحالات. الجدول أقل عن نسبة المزج أكثر عن ما إذا كان جمع البيانات الخاص بك يستمر في إنتاج حالات جديدة أو نفس الفشل.

لماذا الجدول لا يُنقل إلى ذراع فعلية كما هو مكتوب

يعني مزيج عشوائي لكل خطوة زمنية تبديل سلطة التحكم بمعدل التحكم، 30 مرة في الثانية على إعداد SO-100 نموذجي. لا توجد واجهة teleoperation تجعل هذا آمناً أو ذا معنى. على الأجهزة الحقيقية، يفسح جدول beta المجال لقرار بشري حول متى للاستيلاء: خوارزمية مختلفة بتحليل مختلف.

الضمان: اختزال إلى التعلم على الإنترنت بدون خسارة

ها هي الخطوة التي تجعل الورقة ما هي عليه. عامل كل جولة DAgger كمثال واحد في مشكلة التعلم على الإنترنت، حيث تكون الخسارة عند الجولة i هي الخسارة البديلة تحت توزيع الحالات للسياسة المستخدمة عند الجولة i. يلتزم المتعلم بسياسة قبل رؤية تلك الخسارة، والتسلسل غير ثابت لأنه يعتمد على السياسات المُنتجة حتى الآن.

تكون خوارزمية بدون خسارة إذا اقترب متوسط خسارتها على جولات N من أفضل سياسة واحدة وحيدة بالمقابل. Follow-The-Leader على الخسائر المحدبة بقوة هي خوارزمية كهذه، مع ندم متوسط ينكمش بترتيب 1/N - وإعادة التدريب على التجميع الكامل هي بالضبط Follow-The-Leader. أي متعلم بدون خسارة آخر سيكون مفيداً: التحليل هو اختزال، وليس خاصية محسّن واحد.

يربط ملف واحد الفجوة بين السياسة المختلطة التي جمعت البيانات والسياسة المكتسبة التي ستُنشر: يحد الملف 4.1 المسافة L1 بين توزيعات حالاتهما بـ 2 T beta_i. هذا هو السبب في وجوب تحلل الـ betas - بينما يحمل الخبير لا يزال سلطة تحكم كبيرة، فإن الحالات التي تجمعها ليست الحالات التي ستُنتجها سياستك. اجمع الملف مع حد الندم والنتيجة الرئيسية تتبع: بعد تقريباً تكرارات T، تمتلك بعض السياسات في التسلسل خسارة بديلة تحت توزيعها الخاص ضمن O(1/T) من epsilon_N. أدخل ذلك إلى الحد الخطي وستصل إلى النظرية 3.2.

الجانب التجريبي متواضع حسب المعايير الحالية. في Super Tux Kart لم يُحسّن خط الأساس المراقب متوسط سقوطاته لكل لفة مع وصول بيانات أكثر، وصلت DAgger إلى سياسة لم تسقط عن المسار بعد خمس عشرة تكرار، وحققت SMILe بعد عشرين لا تزال تسقط تقريباً مرتين لكل لفة. على معيار الكتابة اليدوية، تحقق دقة الأحرف 82 بالمائة بدون بنية، 83.6 بالمائة تحت الإشراف، 85.5 بالمائة مع DAgger. لا شيء منها هو نتيجة معالجة.

ما الذي لا يعده الإثبات

بيانات النظرية شرطية، والشروط تحمل وزناً.

ضمان DAgger، مقروء بعناية
ما يعطيك إياه
  • حد خطي بدلاً من تربيعي في T، تحت الافتراضات المُعلنة.
  • سياسة محددة حتمية ثابتة بدلاً من مزيج عشوائي.
  • اختزال حقيقي: أي متعلم بدون خسارة ينضم.
  • حد عدد التكرار المحدد - تقريباً جولات T قبل توقف حد الندم عن المهمة.
  • ضمان لسياسة واحدة على الأقل في التسلسل، ومن هنا التمرير النهائي للتحقق.
ما الذي لا يعطيك إياه
  • هو نسبة إلى epsilon_N، أفضل خسارة في الفئة بالمقابل، وليس نسبة إلى الصفر. إذا لم تستطع فئتك تمثيل الخبير، فهي فارغة عملياً.
  • تحتاج إلى طريقة بدون خسارة أو خسارة بديلة محدبة بقوة - أقوى من اختزالات التصنيف التي تُبني عليها، كما لاحظ المؤلفون.
  • الثابت u يمكن أن يكون O(T) في أسوأ الحالات، والحد الخطي ينهار بعد ذلك إلى تربيعي.
  • يحد التكرارات، وليس وسوم الخبير. على روبوت، الوسوم هي الميزانية.
  • يفترض أن الخبير يمكن الاستعلام عنه عند كل حالة يزورها والإجابة بشكل صحيح هناك. هذا الافتراض هو كل التكلفة.

نتيجة أخرى غالباً ما يُستشهد بها كنفي وليست كذلك. يدرس Rajaraman و Yang و Jiao و Ramachandran حدود minimax للتعلم من المحاكاة في MDPs حلقية بمساحة حالة محدودة S وأفق H، ويثبتون حد تحت-أمثلية بترتيب |S| H مربع على N حتى عندما قد يكون للمتعلم الحق في الاستعلام النشط من الخبير عند حالات مزارة. هذا معدل أسوأ حالة على فئة من MDPs بميزانية حلقة محددة، وما يستبعده هو الفكرة أن التفاعل يحسن معدل minimax؛ نظرية DAgger بيان مختلف، حد السياسة المنشورة نسبة إلى ما يمكن لفئة السياسة الخاصة بها أن تحققه.

صنفت Swamy و Choudhury و Bagnell و Wu لاحقاً هذه الخوارزميات بلحظات السلوك الخبيري التي تطابقها، وأدخلوا مفهوماً للقابلية للاسترجاع الذي يفصل كيفية تخفيف كل عائلة خطأ مركب. تغطي الاستقصاءات من Osa وبواسطة Celemin الكيان الخوارزمي والواجهات ذات التعليقات البشرية.

الفاتورة: وسم الحالات التي لم ينتجها الخبير أبداً

كل ما سبق يفترض خبيراً يمكن الاستعلام عنه في أي مكان. في المحاكاة مع مخطط يكون رخيص تقريباً - استخدمت تجارب Mario مخطط قريب من الأمثل مع إمكانية وصول كاملة إلى حالة اللعبة. مع شخص بشري على روبوت فهي التكلفة المهيمنة، وواحدة غريبة: يتعين على الشخص البشري إنتاج إجراء صحيح في تكوين لن تكون كفاءتهم الخاصة قد أنتجته أبداً.

يصرح Kelly و Sidrane و Driggs-Campbell و Kochenderfer بالاعتراض مباشرة في ورقة HG-DAgger. يتطلب vanilla DAgger من الخبير توفير وسوم إجراء بينما لا يكون متحكماً بالكامل في النظام. هذا يقلل الأمان، ومع الخبراء البشريين من المرجح أن يتدهور جودة الوسوم المجمعة، مما ينسبونه إلى تأخر المحرك المُنسوب. الوسم الذي تعيده ليس الوسم الذي افترضته الخوارزمية.

يهاجم Laskey والزملاء المشكلة من الجانب الآخر مع DART، وتأطيرهم مباشر: تقنيات على السياسة مملة للمشرفين البشريين، وإضافة عبء حسابي، وقد تزور الحالات الخطرة أثناء التدريب. بديلهم يحقن ضوضاء معايرة في عروض المشرف الخاصة به، بحيث يُظهَر التعافي دون تشغيل الروبوت أبداً سياسة غير موثوقة. على MuJoCo Humanoid يبلغون أن DART تقلل المكافأة التراكمية للمشرف بنسبة 5 بالمائة أثناء التدريب، بينما تنفذ DAgger سياسات بـ 80 بالمائة أقل مكافأة تراكمية من المشرف؛ على القبض في الفوضى مع Toyota HSR، متوسط زيادة بنسبة 62 بالمائة على استنساخ السلوك.

تعالج SafeDAgger لـ Zhang و Cho الاستعلامات إلى سياسة المرجع كمورد نادر: سياسة أمان منفصلة تتنبأ، دون الاستعلام، ما إذا كانت السياسة الأساسية على وشك الانحراف عن المرجع بعد حد، وفقط تلك الحالات يتم تسليمها. تتفاعل جميع الثلاثة مع نفس الحقيقة - تحليل DAgger لا يفرض شيئاً على وسوم الخبير، والواقع يفرض قدراً كبيراً.

الجزء الذي لا يحذرك منه أحد

وسم الحالات خارج التوزيع أصعب عقلياً من مظاهرة المهمة. المظاهرة العادية تعني تنفيذ خطة حركية لديك بالفعل. تصحيح سياسة وضعت المشبك في مكان لم تذهب إليه أبداً يعني بناء تعافي فوري، تحت ضغط الوقت، مع استمرار الروبوت بالحركة. توقع دقائق صالحة أقل لكل جلسة من جلسة تسجيل عادي، وراقب جودة التصحيح الخاصة بك تتدهور على مدار واحد.

عرض هيكل مجموعة LeRobot يوضح الحلقات والإطارات والأعمدة لكل إطار كما يتم تخزينها على القرص
التصحيحات تصبح مجموعة بيانات فقط بمجرد وسم إطارات التدخل - في صيغة LeRobot، عمود لكل إطار جنباً إلى جنب مع الملاحظة والإجراء.

ما يعنيه هذا لـ SO-100 على مكتبك

ترجم الأفق إلى وحداتك الخاصة. حلقة مدتها عشرون ثانية بـ 30 إطار في الثانية تساوي 600 خطوة قرار، و T في كل الحدود أعلاه تلك الرقم. عند T = 600، الفرق بين حد يتناسب مع T وواحد يتناسب مع T مربع هو الفرق بين سياسة تتعافى من توجه سيء وواحدة لا تفعل.

هذا جزء من السبب الذي يجعل chunking الإجراء يساعد: عندما تُصدر سياسة سلسلة قصيرة من الإجراءات لكل خطوة استدلال، ينخفض عدد نقاط القرار، وكذلك عدد الفرص للتراكم. يذكر Zhao و Kumar و Levine و Finn خطأ مركب كدافع لـ Action Chunking with Transformers، ويبلغون عن نجاح 80 إلى 90 بالمائة على ست مهام صعبة من العالم الحقيقي، على أجهزة bimanual منخفضة التكلفة، من عشر دقائق من المظاهرات. Chunking لا يزيل covariate shift - الحالات لا تزال تابعة للسياسة - لكنه يختصر الأفق الفعال. انظر action chunking و SO-100 imitation learning guide.

الترجمة الثانية هي مقياس التقدم. لا يمكنك قياس epsilon تحت توزيع السياسة الخاصة بك مباشرة - هذا يحتاج إلى إجراءات خبير حقيقية لكل حالة مزارة، الشيء الذي تحاول تجنب إنتاجه. ما تعطيك حلقة مأذونة بشرياً بدلاً من ذلك هو معدل التدخل: جزء الإطارات في التشغيل الذي تولى الشخص البشري السيطرة عليه. إنه بديل، ويتحرك لأسباب غير مرتبطة بالسياسة - مشرف صبور يتدخل أقل. عند استخدامه بشكل متسق، فهو الرقم الواحد الذي يقول ما إذا كانت الجولة تستحق بعد الظهر.

ترجمة ثالثة هي تحذير جودة البيانات الذي لا يغطيه التحليل. درست Mandlekar والزملاء ستة خوارزميات تعلم بدون اتصال على خمس مهام معالجة متعددة المراحل محاكاة وثلاث من العالم الحقيقي، ويبلغون عن حساسية لخيارات التصميم الخوارزمي، وتعتمد على جودة المظاهرات، وتباين ناجم عن معيار التوقف. تحتج Belkhale و Cui و Sadigh بأن جودة مجموعة البيانات يجب أن تُرسمية من خلال تباين الإجراء وتنوع الانتقال، وتلاحظ أن تنوع الحالة ليس مفيداً دائماً. تضيف جولة DAgger حالات لم يختر أحد بتعمد: البعض هو بيانات التعافي التي تحتاجها، والبعض هو الروبوت ينقلب بينما تتعثر للحصول على التحكم في الاستيلاء.

ميكانيكياً جولة ستة خطوات: شغل الاستدلال مع التسجيل قيد التشغيل، استولِ عندما تسوء السياسة، راجع التشغيل وأرشف كل حلقة، زامن التصحيحات، ألّف مجموعة بيانات مختلطة من أصليات زائد تصحيحات مع اختيار حلقة مُجرى بوضوح لكل مصدر، وتابع التدريب من checkpoint السابق بدلاً من نموذج القاعدة. على ay-robots تلك الخطوات موجودة كأزرار، مما يزيل السباكة لكن ليس الحكم. تحذيراتان: الاستمرار من checkpoint يهيئ الأوزان وليس استئناف محسّن، ويظل محاذاة ذراع الزعيم مختبرة بخفة على الأجهزة. انظر training و datasets.

حلقة DAgger، بالفعل توصيلها

الاستيلاء أثناء تشغيل استدلال حي، وسم تدخل لكل إطار، تسجيل الحلقات كتصحيحات أو تقييمات، تأليف مجموعة بيانات مختلطة مع اختيار حلقة صريح لكل مصدر، والمتابعة من checkpoint موجود كلها بنية مدمجة. تقرر أنت ما يجب الاستيلاء عليه وما يجب الاحتفاظ به - لا يتم أتمتة هذا الجزء.

انظر كيف تعمل حلقة DAgger

شجرة العائلة، في جدول واحد

الطريقةمن يختار الحالاتما يوفره الخبيرالتكلفة الرئيسية
Behavior cloningالخبيرمظاهرات نظيفةلا يوجد بيانات تعافي؛ الخطأ يمكن أن يتراكم بشكل تربيعي في T
التدريب الأماميالمتعلم، لكل خطوة زمنيةوسوم على طول التوزيع المُحثّسياسات T منفصلة؛ غير قابلة للاستخدام للآفاق الطويلة
SMILe / SEARNمزيج عشوائي من الخبير والمتعلموسوم على طول توزيع المزيجمكونات المزيج تختلف في الجودة
DAggerالسياسة المختلطة، beta تتحلل إلى الصفرإجراء صحيح لكل حالة مزارةوسم الحالات التي لم يُنتجها الخبير أبداً، بينما لا يكون تحت السيطرة
DARTالخبير، مضطرب بضوضاء مُحقنةمظاهرات تحت ضوضاء معايرةيجب معايرة الضوضاء إلى خطأ المتعلم
HG-DAggerالمتعلم، حتى يستولي الشخص البشريتصحيحات فقط في الأجزاء المأذونة بشرياًيعتمد على حكم الشخص البشري حول متى يتدخل
SafeDAggerالمتعلم، تصفيته بوابة أمانوسوم فقط عندما تطلب البوابةيجب تدريب البوابة ذاتها والثقة فيها

أسئلة متكررة

هل سألاحظ فعلاً نمو خطأ تربيعي على روبوتي؟

ليس كمنحنى نظيف. الحد هو أسوأ حالة: ضيق بأن بعض المشاكل تحققها، وليس أن مشكلتك ستفعل. ما تراه هو النتيجة - سياسة تسجل بشكل جيد على إطارات محتفظ بها، تفشل في المهمة الحقيقية، ولا تتحسن عندما تسجل أكثر من نفس الشيء. إذا توقفت البيانات النظيفة عن المساعدة، هذا هو covariate shift، وليس مشكلة حجم البيانات.

هل يجب أن أنفذ خليط beta لأسميه DAgger؟

الإصدار الخالي من المعاملات - خبير في الجولة الأولى، متعلم نقي بعد ذلك - حالة خاصة شرعية وغالباً ما كان أداؤه أفضل في التجارب الأصلية. ما لا يمكنك إسقاطه هو التجميع: إعادة التدريب فقط على أحدث التصحيحات تقطع تفسير Follow-The-Leader، وهو حيث يأتي حجة عدم الخسارة. التدريب على التصحيحات وحدها إجراء أضعف بكثير.

لماذا إرجاع السياسة الأفضل على مجموعة التحقق بدلاً من الأخيرة؟

لأن النظريات تضمن وجود سياسة جيدة في مكان ما في التسلسل، وليس أن تكون التكرار الأخير - الحد هو على الحد الأدنى على التسلسل. شحن أي جاء من الجولة الأخيرة يتجاهل شرط معروف من النتيجة، والجولة الأخيرة ليست بشكل موثوق الأفضل.

كم عدد الجولات يجب أن أخطط؟

تريد النظرية تكرارات بترتيب T، الذي بالنسبة لحلقة 600 خطوة ليس رقماً يشغله أحد على الأجهزة. تشغيل التجارب الأصلية عشرين تكرار على كل معيار. عملياً تشغيل جولات حتى يتوقف معدل التدخل عن السقوط، أقل بكثير من عدد يفترضه التحليل - فجوة حقيقية بين النظرية والممارسة.

ماذا إذا لم تستطع فئة السياسة الخاصة بي ببساطة تمثيل الخبير؟

بعد ذلك DAgger لا تنقذك، والحد يقول ذلك - يُعبّر عنه نسبة إلى epsilon_N، أفضل خسارة في الفئة بالمقابل. إذا كان كبيراً لأنه معمارية خاطئة، ملاحظة غائبة أو كاميرا لا يمكن أن ترى المشهد، يعطيك التجميع سياسة أمثل ضمن فئة لا يمكن أن تقوم بالمهمة. شغّل استدلال بدون حلقة ضد حلقات محتفظ بها قبل جمع التصحيحات.

إلى أين تذهب من هنا

إذا لم تدرب سياسة بعد، تلك النظرية مبكرة جداً: اعتمد مجموعة بيانات أولاً، بدءاً من تدريب السياسة الأولى الخاصة بك و عميل سطح المكتب. إذا كنت تزن مئة مظاهرة نظيفة إضافية ضد بدء التصحيحات: المظاهرات النظيفة لا تحل مشكلة التوزيع. للميكانيكا، تابع مع المتغير المأذون بشرياً ثم شرح SO-100 التفصيلي.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started