Blog
Insights on robotics, AI, and data collection

تشغيل حلقة DAgger على SO-100 باستخدام سياسة VLA
سرد خطوة بخطوة لجولة DAgger واحدة مع تحكم بشري على ذراع SO-100: تشغيل السياسة وتسجيلها، والتحكم بها عند الخطأ، وحفظ الجولة كتصحيح، وتركيب مجموعة بيانات مختلطة، والمتابعة من نقطة فحص. يتضمن مسار التحكم بلوحة المفاتيح والمنزلقات للأشخاص بدون ذراع قيادة، والأربع أخطاء التي تجعل الجولة بلا قيمة.

قياس حلقة DAgger: معدل التدخل، بروتوكول التقييم، والمزالق فيما بينهما
معدل التدخل - إطارات التدخل مقسومة على إطارات المحاولة - هو أرخص إشارة تقدم صادقة يمتلكها حلقة DAgger الموجهة بالبشر. توضح هذه المقالة تعريفه بحيث يحسبه شخصان بنفس القيمة، وتوضح كيفية تسجيله، وتعمل عبر الطرق الأربع التي تضللك: تكيف المشغل، واستقرار نظام التقييم، والتدريب على التصحيحات فقط، وشخص يصحح بشكل مختلف يوم الثلاثاء عن الاثنين.

HG-DAgger والمتغيرات المتحكم فيها: من يقرر متى يتولى التحكم بسياسة الروبوت
يطلب DAgger العادي من الإنسان تسمية الحالات بينما الروبوت لا يزال يقود. على الأجهزة الحقيقية هذا غير آمن وينتج عنه تصنيفات ضعيفة. تستبدل المتغيرات المتحكم فيها التسمية العمياء بوابة يجب على شخص ما الإمساك بها: الإنسان في HG-DAgger وصنف الأمان في SafeDAgger واختلاف المجموعة في EnsembleDAgger وتقدير مرصود للجدة والخطر في ThriftyDAgger. تقارن هذه المقالة بينهم من حيث من يمتلك الوابة وما الإشارة التي تفتحها وما تكلف كل واحدة منها - ولماذا الشكل المتحكم فيه من الإنسان هو الشكل الذي يصمد عند التلامس مع ذراع حقيقية.

شرح DAgger: لماذا ينجرف Behavior Cloning وما يثبته Dataset Aggregation فعلاً
يُدرّب Behavior Cloning سياسة على توزيع الحالات لدى الخبير ثم يُنشرها على توزيعها الخاص. الفجوة بين هذين التوزيعين هي السبب في أن سياسة تبدو جيدة في التحقق تنهار على الخطوة 300. هذا هو فصل النظرية في سلسلة DAgger لدينا: من أين يأتي حد الخطأ التربيعي، ماذا يغيّر Dataset Aggregation، ما الذي تفترضه إثبات عدم الخسارة، وأي جزء من الحساب يتعين على الخبير البشري أن يدفعه.

استخدام DROID و BridgeData V2 و Open X على SO-100
تتحول DROID و BridgeData V2 و Open X-Embodiment إلى إجراءات طرفية 7D على أذرع ذات 6 و 7 درجات حرية. يأخذ SO-100 ستة أوضاع للمفاصل. ما الذي ينتقل، وما الذي لا ينتقل، وماذا نفعل بدلاً من ذلك.

البيانات الاصطناعية لسياسات الروبوت: أين تساعد المحاكاة
يمكن للمحاكاة أن تضاعف عددًا قليلاً من العروض التوضيحية إلى الآلاف. إليك ما تقوله الأرقام المنشورة حقًا، وأين تكمن مشكلة الفجوة بين المحاكاة والواقع، وما الذي لا يزال يتعين تسجيله.

نماذج VLA الصغيرة: TinyVLA، SmolVLA وحالة أقل من مليار معلمة
يقدم TinyVLA و SmolVLA نظام VLA عمليًا بأقل من مليار معلمة. أرقام حقيقية من كلتا الورقتين، الإعدادات الافتراضية لـ lerobot، زمن الاستجابة المقاس، وتكلفة التشغيل على بطاقة 24 جيجابايت.

تشغيل استدلال GR00T بدون وحدة معالجة رسوميات محلية
جهاز الروبوت الخاص بك لا يحتوي على وحدة معالجة رسوميات. ضع خادم سياسة GR00T على وحدة معالجة رسوميات سحابية مستأجرة، وبث أجزاء الإجراءات إلى الذراع، وتعرف بالضبط على تكلفة الشبكة عليك.

كيفية تدريب ACT على SO-100 من الصفر
تدريب محول تقسيم الإجراءات (Action Chunking Transformer) من الصفر على SO-100 باستخدام lerobot: إعدادات act، وchunk_size، وn_action_steps، وجدول 100000 خطوة، واستدلال 20 مللي ثانية.

أي سياسة VLA يجب عليك تدريبها في عام 2026؟
GR00T N1.7، Pi0.5، SmolVLA، ACT أو GR00T N1.5؟ جدول قرارات يتناسب مع المواقف الحقيقية، مع أرقام المعايير المنشورة، زمن الاستجابة، التكلفة لكل تشغيل والتراخيص وراء كل خيار.

تكلفة تدريب VLA: التكلفة الحقيقية لتشغيل الضبط الدقيق
أسعار وحدات معالجة الرسوميات (GPU) الحقيقية في السوق الفورية، ومدة تشغيل كل سياسة من السياسات الخمس، وتكلفة الذراع والعروض التوضيحية، والأماكن الأربعة التي تختفي فيها الأموال بهدوء.

سجل أول مجموعة بيانات LeRobot خاصة بك باستخدام SO-100
سجل مجموعة بيانات LeRobot قابلة للاستخدام باستخدام SO-100: المعايرة، التشغيل عن بعد بنمط القائد والتابع، علامات lerobot-record الافتراضية والحقيقية، إعداد الكاميرا، عدد الحلقات، والعيوب التي تفسد التشغيل.

كيفية تدريب SmolVLA على وحدة معالجة رسوميات (GPU) بسعة 24 جيجابايت (lerobot 0.6.1)
SmolVLA هو نموذج VLA بـ 450 مليون معلمة يمكن ضبطه بدقة على بطاقة واحدة بسعة 24 جيجابايت. أوامر lerobot 0.6.1 الحقيقية، الإعدادات الافتراضية الفعلية، المزالق التي قد تكلف يومًا كاملاً، وما هي تكلفة التشغيل.

كيفية تدريب Pi0.5 على بيانات الروبوت الخاصة بك
اضبط بدقة Pi0.5، نموذج VLA لمطابقة التدفق من Physical Intelligence، على بيانات الروبوت الخاصة بك. أوامر حقيقية لـ openpi و lerobot pi05، مخاطر تنسيق مجموعة البيانات، وحدود VRAM وزمن الوصول.

كيفية تدريب GR00T N1.7 على مجموعة بيانات SO-100 الخاصة بك
دليل مجرّب للضبط الدقيق لـ NVIDIA GR00T N1.7 على مجموعة بيانات LeRobot من SO-100: الأعلام الحقيقية، modality.json، متطلبات الإصدار 2.1، تكلفة التشغيل، والمزالق.
RoboTurk: تعلم الروبوتات عن طريق التعهيد الجماعي من خلال التشغيل عن بعد
اكتشف كيف تُحدث RoboTurk ثورة في تعلم الروبوتات من خلال التعهيد الجماعي للبيانات عالية الجودة من خلال التشغيل عن بعد، مما يتيح مجموعات بيانات قابلة للتطوير لنماذج الذكاء الاصطناعي في مجال الروبوتات. استكشف تأثيرها على تعلم التقليد ونماذج VLA وعائد الاستثمار لشركات الروبوتات.
سياسات الروبوت المطابقة للتدفق Pi-Zero: إحداث ثورة في التحكم البارع باستخدام تهيئة VLM
اكتشف كيف تعمل تقنية مطابقة التدفق في Pi-Zero، جنبًا إلى جنب مع تهيئة VLM، على تحويل سياسات الروبوت العامة للتحكم البارع. تعرف على مزاياها مقارنة بالطرق التقليدية، وكفاءتها في بيانات تدريب الذكاء الاصطناعي للروبوتات، وتأثيراتها على نشر الروبوتات القابل للتطوير في الصناعات.
RT-2: لماذا تتفوق بيانات تدريب الروبوتات عالية الجودة على الخوارزميات - رؤى Google DeepMind التي تغير قواعد اللعبة
اكتشف كيف يُحدث نموذج RT-2 من Google DeepMind ثورة في مجال الروبوتات التي تعمل بالذكاء الاصطناعي من خلال التأكيد على الدور الحاسم لبيانات التدريب عالية الجودة على الخوارزميات المتقدمة. تحلل هذه المقالة التجارب التي توضح سبب أهمية جمع البيانات الفعال لأداء الروبوتات في العالم الحقيقي. تعرف على كيف يمكن لمنصات مثل AY-Robots المساعدة في سد الفجوة في بيانات التدريب للابتكارات المستقبلية.
RT-2 من Google DeepMind: كيف يُحدث نموذج الرؤية واللغة والحركة هذا ثورة في تعلم الروبوتات
اكتشف كيف يعيد نموذج الرؤية واللغة والحركة (VLA) RT-2 من Google تشكيل تعلم الروبوتات من خلال دمج البيانات المرئية واللغة الطبيعية والإجراءات في الوقت الفعلي. تعمل هذه التقنية المبتكرة للذكاء الاصطناعي على تحسين جمع البيانات لمشغلي التحكم عن بعد وتعزيز الكفاءة في تطبيقات الروبوتات. استكشف تأثيرها المحتمل على مستقبل الروبوتات التي تعمل بالذكاء الاصطناعي في AY-Robots.