ذراع روبوت SO-100 منخفضة التكلفة على مكتب، مجهزة للتشغيل عن بعد والتدريب على السياسة
DAggerSO-100التعلم بالتقليدVLAالتشغيل عن بعد

تشغيل حلقة DAgger على SO-100 باستخدام سياسة VLA

AY-Robots ResearchAugust 27, 202615 دقيقة قراءة

سرد خطوة بخطوة لجولة DAgger واحدة مع تحكم بشري على ذراع SO-100: تشغيل السياسة وتسجيلها، والتحكم بها عند الخطأ، وحفظ الجولة كتصحيح، وتركيب مجموعة بيانات مختلطة، والمتابعة من نقطة فحص. يتضمن مسار التحكم بلوحة المفاتيح والمنزلقات للأشخاص بدون ذراع قيادة، والأربع أخطاء التي تجعل الجولة بلا قيمة.

تعمل السياسة الخاصة بك. تصل إلى المكعب وتغلق الممسك بمسافة سنتيمتر واحد مبكراً جداً، وتستمر كأنها امتلكته. لا توجد أخطاء، وأي كمية من النظر إلى فقدان التدريب لا تشرحها. الحل ليس 20000 خطوة تدرج إضافية على نفس الأمثلة. بل هو وضع يدك مرة أخرى على الذراع بالضبط حيث تحدث الخطأ، وتسجيل ما فعلته بدلاً من ذلك، وتدريب نقطة الفحص التالية على البيانات القديمة بالإضافة إلى هذا التصحيح. هذه جولة DAgger، وهذا هو كيفية تشغيلها على SO-100 باستخدام سياسة vision-language-action.

النظرية موجودة في مكان آخر: لماذا يعمل تجميع المجموعات البيانية على الإطلاق و ما الذي يغيره التحكم البشري بشأنه. هذا هو دليل التشغيل، وهو يفترض وجود نقطة فحص مدربة، ومجموعة كاميرا عاملة، وذراع تتحرك. الخطوات الست أدناه هي الحلقة كما تم تنفيذها على صفحة DAgger من هذه المنصة، لكن التسلسل هو نفسه من السكريبتات الخاصة بك.

جولة واحدة بإيجاز

  • قم بتشغيل السياسة المدربة وتسجيلها، مع نص المهمة للجولة بدلاً من تسمية التشغيل عن بعد العامة.
  • خذ السيطرة في اللحظة التي تحدث فيها السلوك خطأ: تسليم مرآة مع ذراع قيادة، فوري وتجييم على لوحة المفاتيح أو المنزلقات بدون واحدة.
  • فرز كل جولة: احفظها كتصحيح، احتفظ بها كحلقة تقييم، أو تجاهلها.
  • قم بتركيب المزيج يدويًا - الأمثلة الأصلية بالإضافة إلى التصحيحات، والحلقات المختارة لكل مصدر. لا تدرب أبداً على التصحيحات وحدها.
  • متابعة التدريب من آخر نقطة فحص، وملاحظة نقطة الفحص التي أنتجت أي مزيج.
  • الرقم الذي يقول ما إذا كانت الجولة تستحق أي شيء هو معدل التدخل، وليس فقدان التدريب.

لماذا الجولة الثانية ليست مجرد بيانات أخرى

يدرب السلوك القائم على النسخ على الحالات التي زارها الإنسان. في وقت الاختبار، تزور السياسة الحالات التي تسببها، وأخطاء الإجراء الصغيرة تتراكم في حالات لم تغطها أي مظاهرة. شكل Ross و Gordon و Bagnell هذا الفشل لـ AISTATS 2011 وأجابوا عليه بخوارزمية تكرارية تدرب سياسة حتمية ثابتة وتحت الحد الأدنى، يجب أن تعمل بشكل جيد تحت توزيع الحالة الذي تحدثه: قم بتشغيل السياسة الحالية، واطلب من الخبير تسمية الحالات التي وصلت إليها فعلاً، أضف تلك إلى المجموعة البيانية، أعد التدريب، كرر. جعل Kelly وآخرون الاستعلام عملياً مع HG-DAgger، حيث يقرر الإنسان متى يتولى السيطرة بدلاً من تسمية الحالات بدون السيطرة؛ يقارنون الأداء المحسنة على كل من DAgger والنسخ السلوكي في مهمة القيادة المستقلة المحاكاة والحقيقية. التحكم البشري هو ما يجعل الحلقة محتملة على ذراع الطاولة - تتحرك يداك فقط عند حدوث خطأ ما.

يهم النتيجتان أكثر في الممارسة العملية من النظرية. التصحيحات ليست مظاهرات عادية: إنها تركز على مناطق الاختناق التي يصفها Mandlekar وآخرون، حيث يؤدي الانحراف الصغير إلى إسقاط السياسة في حالات لم تغطها المظاهرات مطلقاً. وأي مجموعة بيانات تتكون فقط من تلك الأجزاء الصعبة هي مجموعة بيانات سيئة التشكيل - يحتج Belkhale و Cui و Sadigh من جانب البيانات بأن تنوع الحالة ليس مفيداً دائماً، وأن تباعد الإجراء وتنوع الانتقال معاً يقرران جودة المجموعة البيانية. المجموعة البيانية المختلطة ليست حلاً وسطاً، بل هي الهدف.

تجميد هذه قبل الجولة الأولى

تقارن جولة DAgger السياسة ضد نفسها عبر الزمن. أي شيء تغيره بين الجولات ليس المجموعة البيانية يجعل هذه المقارنة بلا معنى.

  • مواضع الكاميرا والتركيبات، بما في ذلك كاميرا الرسغ. فك المشبك الواحد وأنت قد غيرت توزيع الملاحظة، وليس السياسة.
  • التعريض والتوازن الأبيض، إذا سمحت لك مكدس الالتقاط بتثبيتهما. عدم تطابق التعريض التلقائي بين الجولات هو تحول المجال البطيء والمرئي.
  • معايرة الذراع وأصفار الخادم. إذا كان يجب عليك إعادة المعايرة، فعامل كل شيء مسجل قبله كمجموعة بيانات منفصلة.
  • نص المهمة. كل VLA هنا يشترط عليه؛ إعادة صياغة مسافة وسط الحلقة هي مهمة مختلفة.
  • الإضاءة، سطح الطاولة، مجموعة الأشياء. كائن جديد هو تجربة جديدة، وليس الجولة التالية.
  • معدل التسجيل. مقارنة معدلات التدخل عبر شبكتي أخذ عينات تنتج فروقات تأتي من الشبكة.
كاميرا الرسغ ليست أثاثاً اختياريًا

قارن Hsu وآخرون منظور مركز اليد مقابل العرض من الطرف الثالث المعتاد ووجدوا أن وجهة النظر في العين تحسنت باستمرار كفاءة التدريب والتعميم خارج التوزيع، على الرغم من رؤية أقل للمشهد. على ذراع خماسية المفاصل، توقيت المشبك هو عادة ما تصلحه التصحيحات، وتوقيت المشبك هو ما يحمله العرض في الرسغ.

الجولة من البداية إلى النهاية

  1. 1
    تشغيل الاستدلال وتسجيله

    ابدأ الجولة مقابل نقطة الفحص التي تريد تحسينها، ثم ابدأ التسجيل في جذر الاستدلال. تسجيل بهذه الطريقة يرث نص المهمة الخاص به، وهو ما تم تدريب السياسة عليه، بدلاً من تسمية التشغيل عن بعد الافتراضية. بدون التسجيل يمكنك مشاهدة الفشل ولكن لا تدرب عليه.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    خذ السيطرة عند الخطأ

    اضغط على خانة التحكم واختر وضع الإدخال: ذراع القيادة أو لوحة المفاتيح أو المنزلقات. يتوقف المنفذ، تصحح، تسلم. الإطارات المسجلة أثناء القيادة يتم وضع علامة عليها كتدخلات تلقائياً.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    فرز الحلقات

    تقرر لكل حلقة: احفظها كتصحيح، احتفظ بها كتقييم، أو تجاهلها. جولة أكملتها السياسة بدون مساعدة هي بيانات تقييم.

  4. 4
    مزامنة مجموعة بيانات التصحيح

    تجميع التصحيحات في مجموعة بيانات محلية لكل سياسة والذهاب إلى التخزين السحابي من خلال المزامنة التلقائية. لا يوجد شيء مختلط فيما لم تضعه هناك.

  5. 5
    تركيب المجموعة البيانية المختلطة

    اجمع المجموعة البيانية الأصلية مع مجموعة بيانات التصحيحات، اختيار الحلقات بشكل صريح لكل مصدر. النتيجة هي مجموعة بيانات عادية من تلك النقطة فصاعداً.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    متابعة التدريب من نقطة الفحص

    تدريب المزيج من نقطة الفحص السابقة بدلاً من نموذج القاعدة. لاحظ نقطة الفحص والمزيج؛ بدون هذا الزوج الجولة غير قابلة للتكرار.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

الخطوة 2 بالتفصيل: طريقتان للتحكم

مع ذراع القيادة

في وضع قيادة وتابع يكون التحكم عملية تسليم بين ذراعين ليستا في نفس الموضع. الضغط على خانة التحكم يوقف المنفذ ويقود الذراع القيادة على الموضع الحالي للذراع التابعة، حتى لا تقفز عند نقل عزم الدوران. إذا استغرقت محاولة المحاذاة وقتاً طويلاً، فقم بمحاذاة الذراع القيادة يدويًا وأفرج عنها فقط عندما يكون الاثنان في حدود خمس درجات. من هناك تقوم بالتشغيل عن بعد بشكل طبيعي وتسجل عمود الإجراء ما أمرت به.

كن صريحاً بشأن هذا المسار: محاولة المحاذاة ونقل عزم الدوران هما الجزء الأقل اختباراً من الحلقة على الأجهزة الحقيقية. اختبر التسليم على وضع بطيء وآمن قبل أن تعتمد عليه في جولة تهتم بها. تنتج ذراع القيادة أسلس التصحيحات من بين الأوضاع الثلاثة، وكذلك لديها الأكثر الذي يمكن أن يحدث خطأ ميكانيكياً.

بدون ذراع قيادة: لوحة المفاتيح والمنزلقات

معظم الناس الذين يقرؤون هذا يملكون ذراعاً واحدة. هذا يكفي. اختر إدخال لوحة المفاتيح أو المنزلقات في اللحظة التي تضغط فيها على خانة التحكم، والتحكم فوري وتجييم - لا توجد ذراع ثانية لمحاذاتها، بالتالي لا توجد خطوة محاذاة. تحتفظ الذراع التابعة بموضعها وتنتظر الإدخال.

وضع الإدخالكيف تتحرك الذراعحد لكل مكالمة يفرضه الخادممقفلة عند
ذراع القيادةتقود المرآة الذراع التابعة من زوايا مفاصل الذراع القيادةلا توجد دفعات أو مكالمات محددة في هذا الوضع؛ تكتب المرآة أهداف التابع بشكل مستمرلم تكن مقفلة أبداً، والافتراضي إذا لم يتم إعطاء وضع إدخال - لكنها تحتاج إلى ذراع ثانية؛ بدون معرف رئيسي يتم رفض التحكم
لوحة المفاتيحدفعة نسبية لكل ضغطة مفتاح، مرسلة إلى نقطة نهاية دفع التحكممشبك صعب بـ 2 درجة لكل مفصل، 4 درجات للممسكتم الرفض مع 409 إذا تم بدء التحكم في وضع القيادة
المنزلقاتموضع هدف مطلق، مرسل إلى نقطة نهاية تعيين التحكمعلى الأكثر 6 درجات من السفر نحو الهدف لكل مكالمة؛ تحتفظ الواجهة بالإرسال حوالي عشر مرات في الثانيةتم الرفض مع 409 إذا تم بدء التحكم في وضع القيادة

يتم فرض المشابك من جانب الخادم، وليس في الواجهة، لأن دلتا خاطئة في ذراع bus-servo هي تصادم. تخرج التصحيحات على لوحة المفاتيح بخطوات وخشنة قليلاً؛ تصحيحات المنزلقات أسلس، لأن الخادم يسير نحو الهدف بينما تستمر الواجهة في البث. بأي حال يتلقى عمود الإجراء متجه الموضع المطلوب الكامل والتصحيح من التدخل متطابق مع مسار القيادة، حتى تصحيحات لوحة المفاتيح تهبط في نفس المجموعة البيانية بدون فرق تنسيق.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
نفس تخطيط المفاتيح مثل في كل مكان آخر في المكدس، حتى تذاكر العضلات من التسجيل تحمل.
دليل التدريب يوضح الخطوات المرتبة لجولة ضبط دقيق لـ GR00T على مجموعة بيانات SO-100
جانب التدريب من الجولة هو نفس التسلسل الموجه كما في الجولة الأولى؛ فقط حقل نقطة الفحص يختلف.

متى تضغط على الزر

مبكراً بدلاً من متأخراً. التصحيح الذي يبدأ بعد إغلاق الممسك على لا شيء يعلم التعافي من فشل لم يكن يجب على السياسة أن تدخله، وبيانات التعافي تستحق بكثير أقل من بيانات تجنب الأشياء. قاطع في اللحظة الأولى التي تكون متأكداً من أن المسار خاطئ، اصحح خلال الجزء الصعب، يد الظهر بمجرد أن تكون الحالة واحدة التي تعاملت معها السياسة من قبل. يؤتمت ThriftyDAgger هذا القرار بالتحكم في التدخلات على الجدة والمخاطر المقدرة تحت ميزانية بشرية ثابتة، لكن على ذراع واحدة مع انسان يراقب بالفعل، البوابة البشرية أرخص وأفضل معايرة من أي شيء ستضبطه.

ممكن مع المكدس مفتوح المصدر وبعض السكريبتات. ما يتكلفه هو الحفظ، والحفظ هو حيث تموت جولات DAgger.

  1. اكتب الإطارات من السكريبت الخاص بك في مجموعة بيانات LeRobot، مع سلسلة المهمة التي تم تدريب السياسة عليها.
  2. وقفة حلقة السياسة، بدّل مصدر الأمر، وعلم كل إطار تقوده كتدخل. بدون العلم، تبدو التصحيحات وكأنها مظاهرات عادية.
  3. تقرر بعناية ما يحدث لإطارات الانتقال بين إفراج السياسة عن السيطرة والإدخال الأول.
  4. احتفظ بالتصحيحات في مجموعة بيانات خاصة بهما لكل سياسة، وتتبع مؤشرات الحلقات يدويًا حتى يمكن إعادة بناء المزيج.
  5. اشر نقطة دخول الضبط الدقيق على نقطة الفحص السابقة، وتحقق من السجل من أنه حمل تلك الأوزان.

الخطوة 3 بالتفصيل: الفرز يقرر الجودة

بعد الجولة لديك تسجيل مع بعض الإطارات المحددة كتدخلات. ثلاثة وجهات محددة موجودة، والخطأ الخاطئ يسمم بهدوء الجولة التالية.

  • احفظ كتصحيح عندما يكون التدخل حقاً إصلاحاً: كانت السياسة توجه نحو مكان خاطئ والإدخال الخاص بك أظهر الشيء الصحيح من حالة أنتجتها السياسة نفسها.
  • احتفظ كتقييم لجولات مستقلة نظيفة ولجولات تحكمت فيها بحذر. حلقات التقييم هي كيفية قياس نقطة الفحص التالية، ويجب أن لا تُدرب عليها أبداً.
  • تجاهل جولات أفسدتها شيء غير ذي صلة - إطار كاميرا مسقوط، خادم معطل، كائن اصطدمت به. التصحيح الفوضوي أسوأ من عدم وجود تصحيح.
الإطارات المتجمدة تنتمي إلى التسجيل الخام، وليس بيانات التدريب

بين إفراج السياسة عن السيطرة والإدخال الأول، تحتفظ الذراع بثبات بينما يستمر المسجل في الكتابة - سلسلة من الوضعيات المتطابقة مقترنة بصور مختلفة قليلاً. هناك إطارات التسليم البقاء في التسجيل الخام والخروج من مجموعة بيانات التصحيح. إذا قمت ببناء الحلقة بنفسك، قطعها بعناية: سياسة مدربة عليها تتعلم الإيقاف حيث يجب أن تعمل.

الخطوة 5 بالتفصيل: تركيب المزيج

يأخذ الترتيب المجموعة البيانية الأصلية بالإضافة إلى مجموعة بيانات التصحيح وينتج مجموعة بيانات LeRobot عادية تدرب مثل أي أخرى. الخاصية المهمة هي أن اختيار الحلقة صريح لكل مصدر - لا يتم مزج أي شيء تلقائياً. هذا يبدو ثانوياً حتى المرة الأولى التي تتصرف فيها السياسة بشكل غريب وتضطر إلى إعادة بناء ما تم تدريبها عليه.

السؤال المفتوح هو النسبة، ولا أحد لديه رقم ينتقل. ما توافق عليه الأدب هو أن التصحيحات يجب أن تعتبر أكثر من حصة الإطار. يعيد تدريب Mandlekar وآخرون بشكل تكراري على البيانات التي تجميعها نظامهم، بحيث تتعلم السياسة اجتياز الاختناقات، ويقارنون أن الوكلاء المدربون بهذه الطريقة يفوقون الوكلاء المدربين على عدد مماثل من العينات من المظاهرات غير التدخلية. يذهب Sirius أبعد وإعادة وزن عينات التدريب حسب الثقة البشرية المقدرة، ويقارنون كسب 8 في المائة في المحاكاة و 27 في المائة على الأجهزة الحقيقية في معدل نجاح السياسة مقابل الطرق التي تقارن معها، بسرعة تقارب الضعف. لا أحد من نقاط دخول التدريب هنا يفضح مقبض إعادة وزن العينة، بحيث يكون البديل الخام هو الاحتفاظ بكل حلقة تصحيح أثناء أخذ عينات فرعية من المظاهرات الأصلية - وكتابة ما فعلته.

عرض تسجيل المجموعة البيانية يوضح حلقات من مجموعة بيانات SO-100 مع تدفقات الكاميرا
حلقات التصحيح هي حلقات عادية مع علم تدخل لكل إطار، بحيث يركبون مع المجموعة البيانية الأصلية بدون تحويل.

الخطوة 6 بالتفصيل: ما يعنيه الاستمرار من نقطة فحص حقاً

تدريب المزيج من نموذج القاعدة يعمل لكن يرمي الجولة السابقة وتكاليف جولة كاملة. الاستمرار من نقطة الفحص السابقة أسرع وعادة أفضل. هو أيضا أكثر محدود من العبارة تقترح.

تهيئة الوزن ليست استئناف المحسّن

تحتوي نقطة فحص الأوزان فقط على المعاملات وأي شيء آخر. يعطي تحميله الجولة التالية نقطة بداية أفضل من النموذج الأساسي، لكن لحظات المحسّن، موضع جدول معدل التعلم وترتيب البيانات جميعاً تبدأ من الصفر. توقع ارتفاع خسارة في بداية الجولة المستمرة، لا تقرأها كفشل، ولا تسمي الجولة استئناف. إنه بداية دافئة.

السياسةالحجممستوى GPUالاستدلال لكل خطوة إجراءتنسيق البياناتحلقات قبل أن تستحق المحاولة
GR00T N1.7حوالي 3 B، تقريباً 40 M مدربة أثناء الضبط الدقيقA100 80 GB أو H100 80 GBحوالي 152 msLeRobot v2.0 أو v2.150
GR00T N1.5حوالي 3 BA100 80 GB أو H100 80 GBحوالي 165 msLeRobot v2.0 أو v2.150
Pi0.5حوالي 3 B على عمود PaliGemmaA100 80 GB أو H100 80 GBحوالي 485 msLeRobot v3.050
SmolVLAحوالي 450 MRTX 4090 أو أي بطاقة 24 GBحوالي 245 msLeRobot v3.030
ACTحوالي 80 M، مدربة من الصفرRTX 4090 أو أي بطاقة 24 GBحوالي 20 msLeRobot v3.050

تترجح الكمون داخل حلقة DAgger بطريقة لا تفعلها أثناء عرض توضيحي: بحوالي 485 ms لكل خطوة إجراء تتحكم بها لأن الذراع ترددت، وليس لأنها خاطئة، وبيانات تصحيح التردد ليست بيانات تدريب مفيدة. إذا كنت تتكرر على البيانات بدلاً من ملاحقة معدل نجاح نهائي، كرر على نموذج سريع. يصف Shukor وآخرون SmolVLA كمصممة للتدريب على GPU واحد والنشر على وحدات معالجة الرسومات أو وحدات المعالجة المركزية للمستهلك، مع مكدس استدلال غير متزامن يفصل تنبؤ الإجراء عن التنفيذ للسماح بمعدلات تحكم أعلى - الخاصية التي تحافظ على استجابة حلقة التحكم.

تنسيقات البيانات ليست قابلة للتبديل. يأخذ GR00T LeRobot v2.0 أو v2.1، وتصف مستودع Isaac-GR00T إدخاله كنكهة من تنسيق LeRobot v2 مع ملف وصف مشروط مضافة؛ تتوقع المدربون الأحدث هنا v3.0. يفشل المزيج المركب في الإصدار الخاطئ عند وقت التحميل بدلاً من إنتاج سياسة سيئة - وضع الفشل الأفضل، لا تزال فتحة قائمة الانتظار المهدرة. توثيق المجموعة البيانية يسرد التنسيق الذي يأخذه كل مدرب.

الحلقة، مع الحفظ الفعلي بالفعل

التحكم مع ذراع قيادة أو لوحة مفاتيح أو منزلقات؛ علم التدخل لكل إطار؛ جولات الحفظ كتصحيحات أو تقييمات؛ تركيب مجموعة بيانات مختلطة مع اختيار حلقة صريح لكل مصدر؛ والمتابعة من نقطة فحص بدلاً من نموذج القاعدة. ما يبقى قرار لك هو الجولة التي تعتبر تصحيحاً، والحلقات التي تدخل المزيج، ومتى توقفت معدلات التدخل عن السقوط.

انظر كيف تم توصيل حلقة DAgger

أربع طرق لإهدار جولة

1. التدريب على التصحيحات وحدها

أكثر الفشل الشائع والقطع الأكثر إغراءً. مجموعة بيانات تصحيح فقط هي في الأساس الجزء الأوسط الصعب من المهمة، مع نهج والتراجع المفقودة؛ السياسة تحصل على أفضل في الجزء الصعب وتنسى كيفية الوصول هناك. التجميع ليس تفصيل التنفيذ للطريقة، إنه الآلية: البيانات القديمة هي ما يحافظ على بقية السلوك في مكانه بينما التصحيحات تنقل جزء واحد منه.

2. نقل كاميرا بين الجولات

كاميرا تتحول سنتيمترين بين الجولات تنتج سياسة أسوأ من واحدة كنت بدأت معها، وتشخيص يكلف يوماً. كل VLA هنا يشترط على الصور؛ حالة المفصل وحدها لا توضح أين الكائن. التقط صورة الإعداد قبل الجولة الأولى وتحقق من تلك الصورة قبل كل جولة لاحقة.

3. السماح بقطع التسليم بالدخول إلى بيانات التدريب

مغطى أعلاه، وعلى القائمة لأنه غير مرئي. الأعراض هي سياسة تتوقف لجزء من الثانية بالضبط حيث مشغل الجولة السابقة تحكم. يبدو وكأنه تردد؛ هو التقليد.

4. استدعاء بداية دافئة استئناف

إذا كنت تعتقد أن حالة المحسّن نقلت، فإن ارتفاع الخسارة الأولية قراءة كعطل وتذهب الصيد لبيانات تالفة. إذا كنت تعرف المحسّن بدأ من جديد، فإن الارتفاع متوقع وتنظر إلى ما يأتي بعده. نفس الأرقام، نتائج معاكسة.

قياس الجولة

المقياس للحلقة مع تحكم بشري هو معدل التدخل: الإطارات المسجلة أثناء السيطرة، مقسومة على إجمالي الإطارات من الجولة. إنه في حالة التحكم، وهو الرقم الوحيد الذي يجيب على السؤال الذي طرحته الجولة. خسارة التدريب تنخفض ما إذا كانت السياسة محسنة أم لا؛ معدل النجاح ثنائي وضوضائي في أحجام العينة التي تنتجها ذراع الطاولة. معدل التدخل مستمر، يقاس على الحالات التي تسببتها السياسة نفسها، وينخفض ​​عندما تحتاج السياسة إليك أقل.

قارن فقط عبر جولات مسجلة في ظروف متطابقة. الحجة الكاملة، وكيفية بناء مجموعة تقييم التي تبقى أكثر من جولتين، موجودة في المقالة عن قياس حلقة DAgger. الجولة الأولى واقعية اختبار الجدوى: أنت تتحقق من التحكم يعمل على الأجهزة الخاصة بك، التصحيحات الهبوط مع أعلامهم، والجولة المستمرة تحميل نقطة الفحص التي سميت. الجولات اثنتان وثلاث هي حيث يجب أن يبدأ معدل في التحرك. إذا لم يتحرك بحلول الجولة الرابعة، فالمشكلة هي في اتجاه الجري من DAgger.

اكتب لكل جولةلماذا يهم لاحقاً
نقطة الفحص التي تم توجيههابدونها لا يمكنك نسب تحسين إلى مزيج
وضع الإدخال المستخدم للتحكمتصحيحات لوحة المفاتيح أغلظ من تصحيحات القيادة، وتظهر في البيانات
عدد الجولات وكيف تم فرز كل واحدةما إذا كانت الجولة حصلت على تصحيحات كافية للأهمية
معدل التدخل لكل جولة، والمتوسطمقياس تقدم الحلقة
اختيار الحلقة الدقيق لكل مصدرالطريقة الوحيدة لتكرار أو التراجع عن جولة
بداية دافئة أو تدريب جديديشرح منحنى الخسارة الذي ستنظر إليه في أسبوع

إذا لم تكن لديك نقطة فحص بعد

الحلقة لا تحتوي على نقطة دخول بدونها. تسجيل مجموعة بيانات أولى، تدريب سياسة أولى، تشغيلها - التسجيل، التدريب و تشغيل السياسة تغطي هذا المسار. عميل التسجيل على صفحة التحميل، مستويات GPU والأسعار بالساعة على صفحة التسعير، وما حلقة قابلة للاستخدام تبدو وكأنها في دليل جمع البيانات SO-100. احصل على المظاهرات بشكل صحيح قبل التصحيحات: DAgger هو آلية الإصلاح، وتعمل بكثير أفضل على شيء كان يقترب بالفعل من الصحيح.

هل يمكنني تشغيل حلقة DAgger بدون ذراع قيادة؟

نعم. اختر إدخال لوحة المفاتيح أو المنزلقات عندما تضغط على خانة التحكم: التحكم فوري وتجييم، بدون ذراع ثانية للمحاذاة. لوحة المفاتيح ترسل دفعات نسبية أن الخادم يشبك بقوة في 2 درجة لكل مفصل و 4 للممسك؛ المنزلقات ترسل هدفاً مطلقاً والخادم يتحرك على الأكثر 6 درجات نحوه لكل مكالمة، بينما تستمر الواجهة في البث. عمود الإجراء وتصحيح التدخل هي نفسها كما في وضع القيادة، لذلك التصحيحات غير مختلفة في المجموعة البيانية.

كم عدد التصحيحات التي تحتاجها جولة واحدة؟

لا يوجد رقم عالمي مدافع عنه، وحساب الإطار أهم من حساب الحلقة. القاعدة العملية هي أن التصحيحات يجب ألا تفقد في المزيج: مع 200 حلقة أصلية وثلاث حلقات تصحيح، لن يحدث شيء. الهدف تصحيحات تغطي السلوك الفاشل من عدة تكوينات بدء بدلاً من ثلاث كرات من نفس الإنقاذ.

لماذا التدريب على التصحيحات فقط فكرة سيئة جداً؟

لأن التصحيحات هي في الأساس الجزء الأوسط الصعب من المهمة. النهج والمحاذاة والتراجع مفقودة، لذلك تفقد السياسة ما فعلته بالفعل بشكل جيد أثناء التحسن في الجزء الذي صححته. الاحتفاظ بالبيانات القديمة والإضافة إليها هي الآلية نفسها، وليس شيئاً إضافياً اختيارياً.

هل يعاود تشغيل التدريب السابق استئناف من نقطة فحص؟

رقم. تستعيد نقطة فحص الأوزان فقط المعاملات وشيء آخر: لحظات المحسّن، موضع جدول معدل التعلم وترتيب البيانات تبدأ من جديد. إنها بداية دافئة، وارتفاع خسارة أولية متوقع بدلاً من عرض. اكتب أي من الاثنين فعلت بالفعل، بحيث تقرأ المنحنى بشكل صحيح في أسبوع.

ماذا لو لم ينخفض ​​معدل التدخل؟

توقف عن إضافة جولات. معدل مسطح يعني التصحيحات لا تعلم ما تعتقد. الأسباب المعتادة هي في اتجاه الجري: كاميرا انتقلت، التصحيحات تبدأ متأخرة جداً ليكون بيانات تجنب الأشياء، إطارات التسليم في مجموعة التدريب، أو المهمة غير محددة من الملاحظات التي تحصل عليها السياسة بالفعل.

لا أي من هذا مشكلة حلها ولا أي من هذا واحد انقر. التعلم بالتقليد التفاعلي هو منطقة البحث النشط بالضبط لأن أسئلتها - متى تتدخل، كيفية وزن ما فعله الإنسان، كم البيانات القديمة للاحتفاظ - لم تصل إلى إجابات محددة؛ المسح بواسطة Celemin وآخرون يخرط ما هو لا يزال مفتوحاً. ما الحلقة يفعله هو تقارب قابل للقياس عندما تكون تشغيلها بحذر، على الأجهزة التي تكلف بضع مئات من اليورو. تجميد الإعداد، التدخل في وقت مبكر، فرز بصراحة، مزيج متعمد، وتسجيل معدل التدخل في كل مرة.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started