مساحة عمل الروبوت على الطاولة من النوع المستخدم كنظام تقييم ثابت لتشغيل السياسة المتكرر
DAggerالتقييمتعلم المحاكاةبيانات الروبوتSO-100

قياس حلقة DAgger: معدل التدخل، بروتوكول التقييم، والمزالق فيما بينهما

AY-Robots ResearchAugust 27, 202615 دقيقة قراءة

معدل التدخل - إطارات التدخل مقسومة على إطارات المحاولة - هو أرخص إشارة تقدم صادقة يمتلكها حلقة DAgger الموجهة بالبشر. توضح هذه المقالة تعريفه بحيث يحسبه شخصان بنفس القيمة، وتوضح كيفية تسجيله، وتعمل عبر الطرق الأربع التي تضللك: تكيف المشغل، واستقرار نظام التقييم، والتدريب على التصحيحات فقط، وشخص يصحح بشكل مختلف يوم الثلاثاء عن الاثنين.

تشعر حلقة DAgger بأنها منتجة بينما تكون فيها. تقود السياسة، تتحكم عندما تخطئ الإمساك، حفظ التصحيحات، إعادة التدريب، والمحاولة التالية تبدو - ستقسم على ذلك - أسلس قليلاً. بعد جولتين لا يمكنك القول ما إذا حدث شيء، لأن "أسلس قليلاً" ليست كمية.

تحتاج الحلقة إلى رقم واحد لكل جولة، وفي الحلقة الموجهة بالبشر هذا الرقم شبه مجاني: الكسر الزمني من المحاولة التي كان لديك فيه التحكم بدلاً من السياسة. توضح هذه المقالة تعريفه بحيث يحسبه شخصان بنفس القيمة، وتسجله، وتقرأ المنحنى الناتج، وتسمي الطرق الأربع التي تضللك عندما تكون وحدها. بخصوص النظرية التي تفترضها هذه القطعة، انظر شرح DAgger و البديل الموجه بالبشر؛ نظيره العملي هو تشغيل حلقة DAgger على SO-100.

النسخة المختصرة

  • معدل التدخل = إطارات التدخل / إطارات المحاولة. الإطارات، وليس الحلقات، والمقام يتضمن الإطارات التي قضيتها في التصحيح.
  • منحنى مسطح على مدار ثلاث جولات يعني أن الجولات لا تحقق شيئاً - غيّر الخليط أو نقطة التفتيش أو المهمة بدلاً من جمع الرابعة.
  • معدل تدخل متناقص ليس معدل نجاح متزايد. عتبتك للتدخل تنجرف نحو الأسفل مع نمو الثقة.
  • بدون بروتوكول تقييم مجمد - نفس وضعيات البداية، الأشياء، الكاميرات، عدد المحاولات - فأنت تقيس الغرفة.
  • التدريب على التصحيحات فقط ينحرف بتوزيع الحالة. إجابة IWR: استخلاص عينات التدخل والعدم تدخل بنسبة متساوية.

لماذا تحتاج جولة واحدة إلى رقم على الإطلاق

يوجد DAgger بسبب مشكلة توزيع، ومشاكل التوزيع غير مرئية للعين المجردة. أظهر روس وبانيل أن تعلم المحاكاة على مجموعة عرض توضيحي ثابتة يؤدي إلى تفاقم الأخطاء والحد الأقصى للندم ينمو بشكل تربيعي في الأفق الزمني: بمجرد أن يترك المتعلم الحالات التي زارها المعرض التوضيحي، لا شيء في البيانات يخبره كيفية العودة. يصلح DAgger هذا من خلال التكرار - تشغيل السياسة، وضع علامة على الحالات التي تزورها، والتجميع، وإعادة التدريب - والتي يطرحها روس وجوردون وبانيل كاختزال إلى التعلم عبر الإنترنت الخالي من الندم.

لهذا الإطار عاقبة يتخطاها الناس. الضمان يتعلق بسلسلة السياسات عبر التكرارات، وليس أي جولة واحدة. لا يقول شيئاً عما إذا كانت جولتك الثالثة ساعدت. الطريقة الوحيدة للمعرفة هي قياس كل تكرار. قدم كيلي وزملاؤه HG-DAgger لأن DAgger الكلاسيكي يطلب من الخبير تصنيفات الإجراءات بينما المبتدئ لا يزال في السيطرة، والذي تجادل الورقة بأنه يمكن أن يقلل من الأمان و، مع الخبراء البشريين، من المرجح أن يتدهور جودة التصنيف من خلال تأخر المشغل المدرك. يتعلم HG-DAgger أيضاً عتبة أمان لمقياس مخاطر قائم على عدم اليقين في النموذج ويُبلِّغ عن أداء محسّنة على كل من DAgger والاستنساخ السلوكي على مهمة القيادة. لا ينشر عدد التدخلات؛ تلك التي تنتجها بنفسك.

تعريف المعدل بحيث يحصل شخصان على نفس الرقم

التعريف هو سطر واحد: إطارات التدخل مقسومة على إطارات المحاولة. كل شيء صعب يختبئ في ما يحسب كإطار وما يحسب كمحاولة.

الإطارات، وليس الحلقات

عد الحلقات التي بها تدخل واحد على الأقل عديم الفائدة: عشر حلقات بها لمسة واحدة وعشر قادتها ثمانين في المائة تعطي "10/10". يفصل عدد الإطارات بينهما، وهو الحبيبية التي يملكها التسجيل بالفعل - في صيغة مجموعة بيانات LeRobot كل طابع زمني هو صف، لذا علم التدخل هو عمود منطقي واحد بجانب الحالة والإجراء. هنا يتم كتابته لكل إطار في اللحظة التي تبدأ فيها السيطرة ويتم مسحه عند عودة التحكم.

المقام يتضمن التصحيحات

مقسمان دفاعيان - إجمالي إطارات المحاولة، أو الإطارات التي قادتها السياسة بشكل مستقل - وهما ينحرفان بشكل سيء عند مستويات التدخل العالية. السيطرة على 400 من 1000 إطار والأول يعطي 40 في المائة، والثاني 67 في المائة. مقارنة جولة واحدة تقاس بالطريقة الأولى مقابل الجولة التالية المقاسة بالطريقة الثانية هي كيفية اختفاء تحسين حقيقي. خذ إجمالي الإطارات ولا تعيد النظر في الخيار في منتصف السلسلة.

قرر مرة واحدة ما يحدث لإطارات المناولة

هناك دائماً درز. عندما ينتقل التحكم، تنتمي بعض الإطارات إلى أي من الجانبين: تم إمساك الذراع، يتم مواءمة القائد، يتم تجميد التسجيل. في هذا الخط الأنابيب تلك الإطارات المناولة تبقى في التيار الخام ولا تدخل أبداً المعالج حلقة - فهي ليست سلوك السياسة ولا تصحيح يستحق التدريب عليه. عد الدرز بنفس الطريقة كل جولة: عند 30 هرتز، ستة استحواذات بمدة درز قدرها ثانيتين لكل منها هو 360 إطار، كافٍ لتحريك نقطة مئوية.

القرارات الثلاثة التي تكسر القابلية للمقارنة

الإطارات أو الحلقات؛ المحاولة الكاملة أو المستقلة فقط؛ إطارات المناولة في أو خارج. أي من الثلاثة التي تتغير بصمت بين الجولات تجعل المنحنى عديم المعنى. اكتب كل ثلاثة.

تسجيل ذلك بحيث يبقى الرقم بعد الجلسة

مقياس في لوحة الحالة لعملية قيد التشغيل هو قراءة: تختفي عند إعادة التشغيل ولا يمكن رسمها. سطر واحد فقط لكل مرة يغطي السلسلة بأكملها - بما في ذلك أي نقطة تفتيش قادتها، حيث أن هذا يتغير كل جولة وخلطها يبطل ما يتبع.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
سطر واحد لكل مرة. تسجيل المقام واتفاقية المناولة بجانب الرقم يهم أكثر من أسماء الحقول.

حقلان يحملان الوزن. train_mix هو ما أطعمته وظيفة التدريب التالية؛ بدونها لا يمكن نسب أي شيء. eval_protocol يسمي الاختبار الثابت الذي أجريته بعد ذلك، وهو الحقل الذي تم تركه فارغاً في الأغلب. في قمرة القيادة ay-robots تقرير حالة السيطرة بعدد إطارات التدخل للجلسة قيد التشغيل، لذا التسجيل نسخ بدلاً من أداة؛ التوثيق وثائق مجموعة البيانات يغطي حيث تهبط الأعمدة لكل إطار.

مصفوفة تكوين التدريب توضح السياسات ومجموعات البيانات والنقاط الفاصلة جنباً إلى جنب
كل جولة تغير خليط نقطة التفتيش ومجموعة البيانات. لا يمكن نسب رقم لم يتم تسجيل مزيجه.

قراءة المنحنى: ثلاث جولات، حكم واحد

ثلاث جولات هي الحد الأدنى للقراءة، لأن نقطتين دائماً خط. الجدول أدناه هو قالب الحفظ مع أرقام العناصر النائبة، وليس القياسات من أي مرة. تبحث عن انخفاض رتيب مطابق بزيادة في النجاح على اختبار ثابت.

جولةنقطة تفتيش تم قيادتهاإطاراتإطارات التدخلالمعدلالنجاحات (من 20)
0 (الأساس)سياسة أساسية5 9001 38023.4 %7
1من خليط الجولة 05 61098017.5 %10
2من خليط الجولة 15 41261111.3 %11
3من خليط الجولة 25 38059811.1 %12

الجولات الأولى والثانية تقومان بالعمل. الجولة الثالثة لم تكن: 11.3 مقابل 11.1 في المائة داخل التباين من جولة إلى أخرى لأي شيء يُقاس على ذراع فعلية، والجولة الرابعة من نفس التصحيحات تنفق بعد الظهر لا شيء. القطاع المسطح يقول غير شيء هيكلي.

  • الإخفاقات المتبقية لا تصحح بالتشغيل عن بعد - الشيء خارج النطاق، هندسة الماسك، مفصل عند حده. لا بيانات تصحيح تصلح جداراً حركياً.
  • التصحيحات قليلة جداً مقابل مجموعة البيانات الأساسية لتحريك التدرج، ولا شيء يزنها.
  • التصحيحات تتناقض، لذا السياسة متوسط استراتيجيتين وتهبط بينهما.
  • الإخفاق في المنطقة العليا: تحركت الكاميرا، تغير الإضاءة، لا تطابق عرض المعصم التدريب.
  • المهمة عند سقف فئة السياسة هذه على هذه الأجهزة، والخطوة التالية هي المزيد من البيانات الأساسية.

آخر اثنين ليست إخفاقات في الحلقة. في Sirius-Fleet انخفاض الحاجة إلى الإنسان هو النتيجة المصممة: مع تحسن استقلالية الروبوت، تتكيف مؤشرات الشذوذ معايير التنبؤ، مما يؤدي إلى طلبات أقل للتدخل البشري وتقليل عبء العمل البشري تدريجياً بمرور الوقت. هناك المعيار يتكيف بقصد. في حلقة يدوية يتكيف الخاص بك أيضاً، بصمت - لذا معدل يتسطح لأن المهمة عند سقفها تبدو بالضبط مثل واحد يتسطح لأن المشغل توقف عن الملاحظة. وهي المشكلة التالية.

المزلق 1: معدل متناقص ليس معدل نجاح متزايد

معدل التدخل يقيس بالضبط شيء واحد: مقدار المحاولة التي قررت أن تملكها. هذا القرار ملكك، يتخذ في الوقت الفعلي، ويتحرك. في الجولة الصفر تستحوذ على أول زاوية نهج سيئة؛ بحلول الجولة الثالثة شاهدت السياسة تتعافى من دستور منها وتتركها تحاول. تحركت عتبتك؛ السياسة قد لا تكون. ينخفض المعدل أي طريقة.

ثقة الإنسان هي على الأقل كمية مصرح بها في الأدب بدلاً من ثابت مفترض. تزن Sirius عينات التدريب بثقة إنسان تقريبية وتحسن السياسة مع استنساخ سلوكي موزون، تقرير 8 في المائة تعزيز في محاكاة و 27 في المائة على أجهزة حقيقية فوق الفن في معدل نجاح السياسة، بمعدل تقارب ضعف. يتعامل مع الثقة كوزن على البيانات. لا يصحح العتبة في رأسك بين الجولة صفر والجولة ثلاثة.

لا يمكنك إزالة الانجراف، لذا اقرن المعدل مع شيء عتبتك لا يمكن أن تمس: مجموعة ثابتة من المحاولات التي لا تتدخل فيها على الإطلاق، تُحسب مقابل معيار مكتوب قبل الجولة. معدل ينخفض بينما معدل النجاح المقترن يبقى هو توقيع التكيف - يستحق الالتقاط، لأنه من داخل الحلقة يشعر مثل التقدم.

معدل التدخلمعدل النجاح على بروتوكول ثابتالقراءة الأكثر احتمالاً
ينخفضيرتفعالجولة عملت. متابعة.
ينخفضمسطحانجرفت عتبتك، أو أزالت التصحيحات جهد دون إزالة الإخفاقات.
ينخفضينخفضالتصحيحات تتدهور السياسة. تحقق من الخليط والتناسق الداخلي لهم.
مسطحمسطحالجولة لم تشتري شيء. غير الخليط أو نقطة التفتيش أو المهمة قبل جمع المزيد.
يرتفعينخفضانحدار. اشك في تدريب الخليط أو كاميرا متغيرة أو خلط نقطة تفتيش قبل الاشتباه بالطريقة.

المزلق 2: بدون بروتوكول ثابت، تقيس الغرفة

التقييم على الروبوت الحقيقي مكلف وصعب التكرار. يحفز مؤلفو SIMPLER التقييم المحاكى بملاحظة أن التقييم الحقيقي لسياسات من هذا القبيل غير قابل للتوسع ويواجه تحديات قابلية إعادة الإنتاج من المرجح أن تسوء مع توسع نطاق المهام للسياسات. RoboArena تهاجمها من الجانب الآخر، بأكثر من 600 حلقة تقييم حقيقية للروبوت في أزواج عبر سبع سياسات عامة، تشغيلها من قبل المقيمين في سبع مؤسسات أكاديمية على منصة DROID. يختار المقيمون لديهم مهامهم وبيئاتهم الخاصة ولكن يجب أن يحكموا على أزواج السياسات بشكل عمياني مزدوج؛ تقرير الورقة التي هذا الترتيب الجماعي يتبع أداء السياسة العامة بدقة أكثر من التقييم المركزي التقليدي.

لن تشغل 600 حلقة بينية مقترنة على SO-100 في ورشة عمل. ما يمكنك فعله هو إزالة التباين الذي تتحكم فيه - قائمة مملة بما يكفي عادة ما يتم تخطيها.

بُعدتجميد هذاما ينحرف إذا لم تقم
وضعية البدايةموضع منزل مكتوب، مدفوع قبل كل محاولةالمسار يبدأ خارج التوزيع
أشياءعلامات مشدودة، والأشياء الفعلية نفسها محفوظة للتقييمسياسة "أفضل" هي فعلاً شيء أقرب
الكاميرات والضوءنفس التركيبات والمؤشرات والتعريض؛ السعائب مغلقة؛ صورة المعداتيمكن أن تهيمن فهارس الكاميرات المتبادلة وحدها على النتيجة
المحاولات وقاعدة الإيقافن ثابت، مهلة ثابتة، معيار مكتوب قبل الجولةمعايير ما بعد الحقيقة تحول المكاسب الضيقة إلى ما تحتاج
سلوك المشغللا تدخلات أثناء محاولات التقييميصبح التقييم جلسة تصحيح أخرى

ثم الحسابات، بلا رحمة عند عدد المحاولات التي يمكن لورشة عمل تحملها. تحت التقريب الطبيعي، 60 في المائة النجاح على مدى 20 محاولة يحمل خطأ معياري قرب 11 نقطة مئوية - الجذر التربيعي لـ 0.6 مرات 0.4 على 20 - والفرق بين جولتين من هذا القبيل يحمل حوالي 15. القفز من 60 إلى 70 في المائة يتسق بالتالي مع عدم حدوث شيء. خمسون محاولة تجلب الرقم لكل جولة إلى حوالي 7 نقاط، وتكلف بعد الظهر.

هذا عدم التناسب هو الحجة لمعدل التدخل: يُحسب على الآلاف من الإطارات بدلاً من عشرين نتيجة ثنائية، ينتقل في وقت مبكر وأكثر سلاسة. التحذير هو أن الإطارات داخل حلقة مرتبطة بشدة - يؤدي جرف سيء إلى مئة إطار تدخل متتالي - لذا حجم العينة الفعال أقرب إلى عدد الاستحواذات. تعامل مع المعدل كمؤشر مبكر ومعدل النجاح كحقيقة أرض بطيئة.

احفظ حلقات التقييم خارج مجموعة التدريب المؤلفة

يجب أن تدخل حلقات التقييم أبداً مجموعة بيانات التدريب المؤلفة - وإلا فإن الجولة n+1 تُحسب على بيانات تم تدريبها عليها، والمنحنى يقيس التذكر.

المزلق 3: التدريب على التصحيحات فقط يثني السياسة

التصحيحات هي البيانات المثيرة للاهتمام، لذا الغريزة هي التدريب عليها. لا. تأتي بالبناء من الشريحة الضيقة من فضاء الدول حيث كانت السياسة تفشل بالفعل وتقول شيئاً تقريباً لا شيء عن الغالبية من المحاولة التي عملت. ضبط دقيق على هذا الشريحة وحدها وتحصل على سياسة جيدة في التعافي من نهج فاسد التي نسيت كيفية صنع نهج نظيف.

بنى Mandlekar وزملاؤهم نظام التدخل عن بعد حول هذا. إطارهم: مهام التلاعب تحتوي على مناطق اختناق تتطلب سلسلة من الإجراءات الدقيقة - إدراج كبسولة في آلة القهوة مثالهم - حيث الانحرافات الصغيرة تؤدي إلى حالات الإيضاحات لم تغطيه. الخوارزمية الخاصة بهم تدرب بشكل متكرر على البيانات الجديدة بحيث تتعلم السياسة عبور تلك الاختناقات، ويبلغون أن الوكلاء المدربين على بيانات التدخل يضربون الوكلاء المدربين على عدد معادل من العينات من المظاهرين غير المتدخلين.

ضبط دقيق بالتصحيحات فقط مقابل خليط مؤلف
ما يحصل عليه التصحيح فقط
  • سريع: جريان قصير على عدد قليل من الحلقات رخيص بما يكفي للتكرار
  • موجه: التدرج يسيطر عليه الحالات التي تهتم بها
  • رخيص للاختبار ما إذا كان نمط التصحيح قابلاً للتعلم على الإطلاق
ما يكلفه
  • توزيع الضبط الدقيق لم يعد يشبه توزيع المهام
  • السلوك الاسمي يمكن أن يتدهور بشكل ملحوظ داخل جولة واحدة
  • المعدل يمكن أن ينخفض بينما يسقط النجاح معه - مقاطع نظيفة مقابل الشفاء

نسبة الخلط هي مزامة زائدة وتستحق أن تُكتب. يؤلف مجموعة البيانات التالية هو حيث يتم قررها: عروض توضيحية أصلية بالإضافة إلى مجموعة التصحيح، اختيار الحلقة صراحة لكل مصدر بدلاً من قاعدة تسحب بهدوء في ما هو متاح. هنا هذا خطوة بريد واحدة في قمرة القيادة، والنتيجة هي مجموعة بيانات عادية - انظر توثيق التدريب. ما لا توفره أداة لك هو تسجيل نسبة التي أنتجت منحنى أي.

المزلق 4: الإنسان ليس خبيراً متسقاً

نظرية DAgger تفترض خبير. لست واحد بالمعنى التقني: تصحيحاتك ليست عينات من توزيع مشروط ثابت عبر الإجراءات. يسميها مؤلفو ACT عندما يدرجون العوائق إلى المتاجر دقيق - تؤدي الأخطاء إلى تراكم بمرور الوقت، والمظاهرات البشرية يمكن أن تكون غير ثابتة. النظام الخاص بهم لا يزال يصل 80 إلى 90 في المائة النجاح على ستة مهام حقيقية من عشر دقائق من الإيضاحات، لذا المشكلة قابلة للحل، ليست غائبة.

دراسة robomimic تجعل النقطة من جانب البيانات. عبر ستة خوارزميات دون الاتصال على خمس محاكيات وثلاث مهام حقيقية من مراحل متعددة، الدروس تشمل الحساسية تجاه الخيارات، والاعتماد على جودة المظاهرة، و - واحد الذي يؤلم الأكثر هنا - التباين الناشئ من معايير الإيقاف، لأن أهداف التدريب والتقييم تختلف. نقطة التفتيش مع أقل خسارة ليست بموثوقية واحد مع أعلى معدل النجاح.

هناك نسخة أجهزة من هذا: وضع الإدخال يشكل التصحيح. قائد-متابع إعداد ينتج مسارات مستمرة، وتيرة بشرية. لمسات لوحة المفاتيح مشددة بقوة بواسطة الخادم - درجتان لكل استدعاء على مفاصل الذراع، أربعة على الماسك - بحيث نية نفسها تصل كسلم خطوات صغيرة. المنزلقات ترسل الأهداف المطلقة والخادم يتحرك على الأكثر ستة درجات نحوهم لكل استدعاء. ثلاثة أوضاع، ثلاثة توزيعات إجراء؛ خلط كل ثلاثة في مجموعة تصحيح واحدة ثم التساؤل لماذا تحول النهج الكهربائي هو إيذاء النفس. توثيق التشغيل عن بعد يغطي ما يرسله كل وضع.

وزن التدخلات: IWR وما جاء بعد

إذا كانت التصحيحات الأقلية القيمة، الإصلاح الأصول هو الوزن بدلاً من الحصرية. الانحدار المرجح بالتدخل هو التنفيذ المرجعي: يتم تقسيم البيانات إلى عينات التدخل وعدم التدخل، وتُأخذ القسمان بنسبة متساوية أثناء التدريب. مجموعة تصحيح هي خمسة في المائة من الإطارات ثم تساهم نصف التدرج، بدون السلوك الاسمي يختفي من التوزيع.

النسبة المتساوية هي نقطة انطلاق، ليست قانون. Sirius generalizes it by replacing the binary partition with a continuous weight from approximated human trust; Sirius-Fleet moves the decision upstream, using a visual world model and anomaly predictors to decide when a human is asked at all. الخيط المشترك: علم التدخل هو إشارة تدريب، وليس فقط عمود حفظ.

الطريقةمن يقرر عندما يتصرف الإنسانكيف يتم استخدام بيانات التدخلالنتيجة المبلغ عنها
DAgger (2011)جدول ثابت؛ تصنيفات الخبير الحالات التي تمت زيارتهامجموعة بيانات متنامية واحدة، غير مرجحةقائم بصفته اختزال إلى التعلم عبر الإنترنت الخالي من الندم
HG-DAgger (2019)الإنسان، التحكم في البوابة على نظام حقيقيمجمع؛ بالإضافة إلى عتبة أمان مكتسبة على عدم اليقين في النموذجأفضل من DAgger و BC على القيادة؛ لا عدد التدخلات المقدمة
IWR (2020)الإنسان، عبر التشغيل عن بعدعينات التدخل والعدم تدخل مرسومة بنسبة متساويةيضرب المظاهرات غير المتدخلة عند عدد العينات المتساوية
Sirius (2022)الإنسان، أثناء النشرBC المرجح، الأوزان من ثقة الإنسان التقريبية8 % اكتسب في المحاكاة، 27 % على الأجهزة الحقيقية؛ 2x convergence أسرع
ThriftyDAgger (2021)النظام، البوابة على الجدة والمخاطرمجموعة تفاعلية تحت ميزانية إشرافدراسة المستخدم (N=10): 58 % أعلى إنسان و 80 % أعلى أداء الروبوت من الطريقة التالية الأفضل
Fleet-DAgger (2022)النظام، تخصيص الاهتمام عبر الأسطولتعلم الأسطول مسجل بالعودة على جهد الإنسانيصل إلى 8.8x أعلى ROHE من خطوط الأساس
Sirius-Fleet (2024)مؤشرات الشذوذ مع معايير التكيف الذاتيتعلم متعدد المهام مع نموذج عالمي مرئيطلبات تدخل أقل مع تحسن الاستقلالية
عرض اللوحة مقارنة سياسات الروبوت حسب الدرجة المقاسة
ترتيب السياسات ضد بعضها يعني شيء فقط عندما كل إدخال شغل نفس البروتوكول. ينطبق هذا على الجولات الثلاث لديك أيضاً.

أربعة مقاييس تستحق التسجيل بجانب المعدل

  • الاستحواذات لكل مرة. عشرون تصحيح قصير وواحد طويل يعطي معدلات متشابهة ويصفان سياسات مختلفة - واحد متشنج، واحد مع نقطة عمياء واحدة.
  • متوسط طول التدخل. الرفع الطول مع انخفاض الحساب يعني الإخفاقات المتبقية هي الصعبة، وهو ما يبدو عليه التقدم المتأخر.
  • الوقت إلى أول تدخل. سياسة تحصل على مزيد من المساعدة قبل الحاجة للمساعدة تتحسن حتى عندما يكون المعدل الكلي مسطح.
  • حيث تدخلات العنقود. بن العلم بتقدم حلقة معايرة؛ ذروة مستقرة عبر الجولات تشير إلى اختناق واحد.

بروتوكول جولة يمكنك تشغيله فعلاً

جولة مقاسة لها ستة خطوات وتنتج صف واحد في السجل. أول أربعة هي الحلقة؛ آخر اثنين تجعله قياس.

  1. 1
    تجميد بروتوكول التقييم قبل الجولة صفر

    اكتب وضعية البداية، وضع الكائن، والكاميرات، وعدد المحاولات، والمهلة الزمنية ومعيار النجاح. صورة الجدول. إذا اضطر المستند للتغيير، تعيد السلسلة البداية.

  2. 2
    قياس الأساس

    قم بتشغيل البروتوكول بدون تدخلات وسجل النجاحات؛ ثم قم بتشغيل جلسة واحدة مجهزة مع السيطرة الموجه تفعيل وسجل المعدل. هذان الرقمان جولة صفر.

  3. 3
    جمع التصحيحات في نمط متسق واحد

    وضع إدخال واحد لكل جولة، مشغل واحد إذا كنت تستطيع إدارته. السيطرة على معايير يمكنك القول بصوت عالٍ - 'الماسك أكثر من سنتيمترين في النهج' - واحتفظ بها للجولة.

  4. 4
    فرز كل حلقة في اليوم نفسه

    تصحيح، تقييم أو تجاهل. حلقات غامضة يتم تجاهلها، وليس حفظها على نظرية المزيد من البيانات تساعد - التصحيح الذي أنت نفسك tussled هو أسوأ من لا حلقة.

  5. 5
    ركز الخليط صراحة

    الحمالات الأصلية بالإضافة إلى التصحيحات، اختيار الحلقة لكل مصدر. سجل عدد الأساس وعدد التصحيح وأي وزن - هذا هو الحقل الذي ستريده في ثلاثة أسابيع.

  6. 6
    متابعة من نقطة التفتيش، ثم أعد القياس

    قطار مجموعة البيانات المؤلفة من نقطة التفتيش السابقة بدلاً من نموذج الأساس، قم بتشغيل البروتوكول المجمد بالإضافة إلى جلسة واحدة مجهزة، أضف الصف، وقارن مع آخر جولتين.

حدان يغيران كيفية قراءة جولة ضعيفة. المتابعة من نقطة تفتيش تهيئات الأوزان من ذلك - ليس استئناف مزامنة، لذا الجدول يبدأ طازج وجري قصير من نقطة تفتيش متقاربة يمكن نقل جداً قليلاً. والحركة محاذاة قائد في بداية السيطرة الموجه لديه أقل أميال على الأجهزة الحقيقية من أي شيء في السلسلة؛ إذا بدأت التصحيحات جميعاً مع عابر غريب، ابحث هناك قبل إلقاء اللوم على الخليط.

حلقة مقاسة، سلكيها بالفعل

ay-robots ينفذ هذه الخطوات الستة كميزات منتج: السيطرة الموجه من منتصف جريان من ذراع القائد أو لوحة مفاتيح أو منزلقات، مع إطارات التدخل المرسومة تلقائياً؛ فرز كل حلقة كتصحيح أو تقييم أو تجاهل؛ ركز البيانات التالية من الحمالات الأصلية بالإضافة إلى التصحيحات، اختيار الحلقة صريح لكل مصدر؛ وابدأ التشغيل التدريبي التالي من نقطة التفتيش السابقة بدلاً من نموذج الأساس.

انظر كيف تعمل حلقة DAgger

ما لا تستطيع الأرقام أن تخبرك

لا شيء من هذا تم حله، والمنحنى مرتب يجب أن لا يقنعك خلاف ذلك. معدل التدخل يقيس نظام مفصل - السياسة والأجهزة والمشغل والغرفة - ولا يعزي شيء بمفرده. لا يمكن الحكم على ما إذا كانت التصحيحات جيدة، وسوف ينخفض بسعادة على مهمة حصلت على أسهل لأن الكائن انجرف سنتيمتر اثنين أقرب على مدى ثلاثة أسابيع.

ما يفعله هو تحويل انطباع غامض إلى عمود يمكنك الجدل معه. البديل ليس مقياس أفضل؛ إنه ثلاثة أسابيع من جمع التصحيحات المنحنى قد يكون أخبرك، بعد الجولة الثالثة، للتوقف عن الجمع. تحديد أدبيات المسح تعلم المحاكاة التفاعلية كتغذية راجعة بشرية في الوقت المناسب المعطى أثناء تنفيذ الروبوت، مما يسمح بتحسن على الإنترنت في السلوك؛ الأسرة واسعة، ولا ترتيب من ذلك يعمل بدون رقم لكل جولة. انظر أيضاً SO-100 دليل تعلم المحاكاة لمجموعة البيانات الأساسية التي تمزجها ضد، تشغيل سياسة للجانب الاستدلال، و صفحة حلقة DAgger للخط الأنابيب المُعاد.

هل معدل التدخل فقط واحد ناقص معدل النجاح؟

لا. معدل يقيس كم من المحاولة التي السيطرة على؛ معدل النجاح يقيس ما إذا كانت المهمة أنجزت بدونك. يمكن أن تنجح محاولة بمعدل تدخل 30 في المائة، وقد تفشل محاولة بدون تدخلات بشكل صريح. يختلفون أيضاً في الضوضاء: معدل ينتقل بسلاسة على آلاف الإطارات المرتبطة، معدل النجاح ينقفز بين حفنة من النتائج الثنائية. سجل كليهما.

كم عدد محاولات التقييم التي أحتاجها لمعدل النجاح لتعني شيء؟

أكثر من الشعور معقول. تحت التقريب الطبيعي، 20 محاولة عند معدل نجاح حقيقي 60 في المائة تحمل خطأ معياري قريب 11 نقطة مئوية، لذا حركة 10 نقاط بين الجولات لا يمكن تمييزها عن الضوضاء؛ 50 محاولة تجلب هذا الرقم إلى حوالي 7. إذا كنت لا تستطيع تحمل 50، احتفظ بعدد المحاولة المتطابق عبر الجولات وتعامل مع الحركات الصغيرة كغير حاسمة.

ما نسبة الخلط من الحمالات إلى التصحيحات التي يجب أن أبدأ بها؟

نقطة الانطلاق المموثقة هي IWR: تقسيم البيانات إلى عينات التدخل وعدم التدخل وسحبها بنسبة متساوية، حتى التصحيحات تساهم نصف التدرج مهما كانت الكسر الصغير من الإطارات. إذا لم تستطع الإعداد وزن العينة، تقريب من خلال عدد الحلقات عند تأليف مجموعة البيانات والسجل النسبة. التدريب على التصحيحات وحدها هي الخيار لاستبعاده.

ذهب معدل التدخل الخاص بي بعد جولة. هل تم إهدار الجولة؟

ليس بالضرورة، ولكن تحقق من التفسيرات الممله أولاً: هل نقطة التفتيش التي قيادتها تطابق الذي تدريبه، هل تغير فهرس الكاميرا أو الجبل، هل انجرف وضع الكائن، هل كان نمط التصحيح متسق. إذا كانت كل أربعة نظيفة ومعدل النجاح المقترن سقط أيضاً، اشك في الخليط - عدد قليل جداً من الحمالات الأساسية ضد التصحيحات، أو التصحيحات التي تتناقض. انحدار حقيقي ينتمي في السجل، وليس في سلة المهملات.

هل يمكنني تخطي بروتوكول التقييم الثابت ومشاهدة معدل التدخل فقط؟

فقط إذا قبلت أنك لا تستطيع تمييز التحسن من التكيف. معدل يعتمد على عتبة الوقت الفعلي الخاصة بك للتدخل، وهذه العتبة تسقط مع اعتيادك على غرائب السياسة. البروتوكول المجمد هو جزء القياس عتبتك لا يمكن أن تصل - علامات مشدودة، وضعية منزل مكتوبة، عدد محاولة ثابتة، معيار قررت قبل الجولة. يجب أن يبقى دون تغيير عبر السلسلة.

احتفظ السجل في المستودع، وليس في دفتر الملاحظات: الجولات أيام متباعدة، تم إعادة بناء الأجهزة، والشخص الذي يقرأ المنحنى في أكتوبر أنت بدون ذاكرة أغسطس. التوثيق FAQ يغطي التفاصيل التشغيلية التي تركت هنا.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started