تدريب النماذج

تدرّب AY-Robots نماذج policy لـ manipulation على وحدات معالجة رسومية (GPU) مُدارة، بحيث تنتقل من episodes مُسجَّلة إلى policy تعمل على ذراعك دون امتلاك أجهزة تدريب. تغطي هذه الصفحة أنواع policy المدعومة، وصفحة تشغيل التدريب، وcheckpoints، والنتائج التي يمكن توقعها واقعياً من عدد episodes لديك.

آخر تحديث 2026-08-09

التدريب دون امتلاك GPU خاص

تدريب policy لـ manipulation هو حِمل عمل يعتمد على GPU، وتحتاج نماذج vision-language-action الحديثة إلى ذاكرة VRAM أكثر مما تملكه محطة عمل عادية. على AY-Robots يجري التدريب على وحدات GPU سحابية تديرها المنصة: تختار مجموعة بيانات ونوع policy، تبدأ التشغيل، وتراقب تقدمه من المتصفح. لا إعداد CUDA، ولا مطابقة drivers، ولا بيئة يجب صيانتها.

المُدخَل دائماً مجموعة بيانات سحابية من Dashboard > Datasets. أي شيء سجّلته عبر جلسات تشغيل عن بُعد أو رفعته بصيغة LeRobot مؤهَّل، بما في ذلك مجموعات البيانات المدمجة. نقّح قبل التدريب: episodes المصنَّفة Failure ينبغي عادةً استبعادها من مجموعة التدريب، وعشر دقائق من المراجعة في متصفح episodes توفّر ساعات من وقت GPU المُنفَق في التعلّم من عروض توضيحية سيئة.

النماذج المدعومة

أربع عائلات policy مدعومة. تختلف في الحجم وتكلفة التدريب وقدر ما يمكنها استيعابه من بياناتك، لذا يعتمد الاختيار الصحيح على مهمتك ومجموعة بياناتك أكثر من أي ترتيب عام.

policyالنوعالخصائص
ACTTransformer، action chunkingتتنبأ بأجزاء قصيرة من الأفعال المستقبلية بدلاً من خطوات مفردة. مدمجة، تُدرَّب بسرعة نسبياً، وخيار أول ثابت لمهمة واحدة معرّفة جيداً.
Diffusion PolicyDiffusion على سلاسل الأفعالتنمذج التوزيع الكامل للأفعال المُظهَرة، ما يساعد عندما تحل عروضك التوضيحية المهمة بأكثر من طريقة صالحة واحدة. أثقل في التدريب وأبطأ في الاستدلال من ACT.
SmolVLAنموذج vision-language-action صغيرمشروط باللغة: تصبح سلسلة المهمة من episodes الخاصة بك جزءاً من المُدخَل. حل وسط جيد عندما تريد اشتراطاً لغوياً دون نموذج أساسي كبير.
GR00T fine-tuneضبط دقيق لنموذج أساسيتضبط بدقة نموذجاً أساسياً كبيراً مُدرَّباً مسبقاً للروبوتات على episodes الخاصة بك. أعلى سقف بين الأربعة، بأعلى تكلفة تدريب، ومتطلب صارم لصيغة مجموعة البيانات.
يتطلب GR00T مجموعات بيانات LeRobot v2.1

لا يقبل الضبط الدقيق لـ GR00T إلا مجموعات بيانات بصيغة LeRobot الإصدار 2.1. ستفشل مجموعة بيانات v3.0 أثناء تحميل البيانات، لا عند الإرسال، لذا تحقق من إصدار الصيغة قبل بدء التشغيل. يمكن استخدام مجموعات البيانات المُسجَّلة على المنصة كما هي؛ للرفعات الخارجية، تحقق أولاً من الإصدار في meta/info.json.

بدء تشغيل

  1. 1
    اختر مجموعة البيانات

    افتح Dashboard > Training واختر مجموعة البيانات للتدريب عليها. يظهر عدد episodes وrobot type حتى تتأكد من اختيار الصحيح.

  2. 2
    اختر policy

    اختر أحد أنواع policy المدعومة. إن لم تكن متأكداً، ابدأ بـ ACT: إنه أرخص طريقة لمعرفة ما إذا كانت مجموعة بياناتك جيدة بما يكفي لتدريب أي شيء إطلاقاً.

  3. 3
    أطلق

    ابدأ التشغيل. يحصل على job id وصفحة تشغيل خاصة به، ويمكنك إغلاق المتصفح: يستمر التدريب على جانب الخادم وتعرض الصفحة الحالة المباشرة كلما عدت.

صفحة تشغيل التدريب

لكل تشغيل صفحة مخصصة تجيب عن السؤالين اللذين يهمانك فعلياً أثناء التدريب: هل يتعلّم، وهل الجهاز سليم. يظهر تقدم التعلّم كمخططات لـ loss، وجدول learning rate، وgradient norm. يخبرك loss يتسطح فوراً أو gradient norm ينفجر مبكراً بأن التشغيل لا يستحق الانتظار.

تظهر صحة الجهاز إلى جانب ذلك: استخدام GPU وذاكرته، إضافة إلى مقاييس host لجهاز التدريب. يظهر جدول زمني للمراحل أين يقع التشغيل حالياً، من إعداد البيئة عبر تحميل البيانات، وحلقة التدريب نفسها، ورفع checkpoint. عندما يبدو شيء خاطئاً، يمنحك عارض السجلات المدمج سجلات التدريب الخام دون أي وصول SSH، وهو ما يكفي عادةً لمعرفة ما إذا كان الخلل في مجموعة بياناتك أو في التشغيل نفسه.

Checkpoints والاستئناف

تُخزَّن checkpoints لكل تشغيل على حدة، لا في مجمع مشترك، لذا تنتمي checkpoints المُدرَجة في صفحة تشغيل دائماً إلى ذلك التشغيل تحديداً وإعداداته. هذا أهم مما يبدو: مزج checkpoints بين تشغيلات بإعدادات مختلفة مصدر كلاسيكي لنماذج تفسد بصمت.

إن انقطع تشغيل، يمكنك الاستئناف من آخر checkpoint له بدلاً من البدء من جديد. checkpoints الوسيطة مفيدة أيضاً بذاتها: عندما يبدأ تشغيل طويل بـ overfitting قرب النهاية، غالباً ما يعمل checkpoint أبكر بشكل أفضل على الذراع الحقيقية من الأخير.

تشغيل النموذج المدرَّب على ذراعك

يمكن نشر policy مكتملة مباشرة على روبوتك مجدداً. في cockpit، اختر policy المدرَّبة لذراعك المتصلة وابدأ الاستدلال: تنتج تلك policy الآن أوامر joint التي كنت تنتجها سابقاً بالتشغيل عن بُعد. يجب أن تكون الذراع من robot type نفسه الذي سُجّلت عليه مجموعة البيانات، وينبغي أن يشبه المشهد مشاهد التدريب، بما في ذلك موضع الكاميرا.

تعامل مع أول تشغيلات الاستدلال كتجارب، لا كعروض. أبقِ زر التوقف الطارئ في المتناول، ابدأ من حالة بداية قريبة مما أظهرته، وتوقع أن تكون policy حساسة لأشياء قد لا تلاحظها: كاميرة تحركت، إضاءة مختلفة، أو جسم لم تحتوِه مجموعة البيانات أبداً.

كم episode تحتاج

أكثر خطأ تدريب شائع على المنصة ليس معامَلاً فائقاً خاطئاً، بل التدريب على بيانات قليلة جداً واستنتاج أن نوع policy لا يعمل. كقاعدة عامة لمهمة tabletop واحدة: نحو 50 episode تمنحك policy بتعميم ضيق تنجح من حالات بداية قريبة مما أظهرته. نحو 100 إلى 200 episode تمنح متانة قابلة للاستخدام عبر مساحة العمل لتلك المهمة الواحدة، شريطة أن تكون قد نوّعت وضع الأجسام بين episodes.

أنواع policy الأكثر قدرة لا تلغي هذا. سيظل GR00T fine-tune على 20 episode يعمّم بشكل رديء؛ ما تشتريه النماذج الأكبر هو سقف أفضل بمجرد توفر البيانات. إن كانت ميزانيتك محدودة، أنفقها على episodes أكثر تنوعاً قبل إنفاقها على نموذج أكبر.

الأسئلة الشائعة

كم يستغرق تشغيل التدريب؟

يعتمد على نوع policy وحجم مجموعة البيانات، لذا لا يوجد رقم صادق واحد. ACT عادةً الأسرع بين الأربعة، وGR00T fine-tune الأبطأ. يُظهر الجدول الزمني للمراحل ومخططات loss في صفحة التشغيل مبكراً ما إذا كان التشغيل يتقدم.

هل يمكنني التدريب على مجموعة بيانات مدمجة؟

نعم. مجموعات البيانات المدمجة هي مجموعات بيانات عادية؛ ضمن التحقق من صحة الدمج بالفعل تطابق fps والخصائص وrobot type. دمج تسجيلات المهمة نفسها من أكثر الطرق فعالية للوصول إلى نطاق 100 إلى 200 episode.

يفشل تشغيل GR00T لدي أثناء تحميل البيانات. ما الذي يجب أن أتحقق منه أولاً؟

إصدار صيغة مجموعة البيانات. يتطلب الضبط الدقيق لـ GR00T إصدار LeRobot v2.1، وتفشل مجموعة بيانات v3.0 هناك بالضبط. تحقق من الإصدار في meta/info.json الخاص بمجموعة بياناتك.

هل يجب أن أحذف episodes الفاشلة قبل التدريب؟

عادةً نعم. تعلّم episodes المصنَّفة Failure النموذج السلوك الفاشل نفسه. episodes Recovery مختلفة: تُظهر كيفية تصحيح خطأ وغالباً ما تستحق الاحتفاظ بها.

هل أحتاج إبقاء المتصفح مفتوحاً أثناء التدريب؟

لا. تنفَّذ التشغيلات على جانب الخادم. تعرض صفحة التشغيل الحالة الراهنة والمخططات والسجلات كلما عدت، وتُحفَظ checkpoints بغض النظر عمن يراقب.