جدول مقارنة سياسات AY-Robots يوضح GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA و ACT جنبًا إلى جنب مع عدد المعلمات، فئة وحدة معالجة الرسوميات (GPU)، زمن استجابة الاستدلال والحد الأدنى لعدد الحلقات
نماذج VLAتدريب السياساتاختيار النموذجlerobotso-100

أي سياسة VLA يجب عليك تدريبها في عام 2026؟

AY-Robots ResearchAugust 23, 202618 دقيقة قراءة

GR00T N1.7، Pi0.5، SmolVLA، ACT أو GR00T N1.5؟ جدول قرارات يتناسب مع المواقف الحقيقية، مع أرقام المعايير المنشورة، زمن الاستجابة، التكلفة لكل تشغيل والتراخيص وراء كل خيار.

خمس سياسات قابلة للتدريب على ذراع من فئة SO-100 اليوم. تختلف بعامل 24 في الاستدلال الكمون، و37 في عدد المعلمات، و12 في تكلفة التشغيل، وفيما إذا كان يمكنك شحن النتيجة. خمس بطاقات نموذجية لن تحسم الأمر: لا توجد إجابة على سؤالك، أي منها أقوم بتشغيله أولاً؟

كل رقم أدناه تم استخراجه من الأوراق والمستودعات والبطاقات في أغسطس 2026. أرقام المنصة تأتي من كتالوج سياسات AY-Robots؛ حيثما يختلف الاثنان، يتم عرض كلاهما.

النسخة المختصرة

  • درب ACT أولاً إذا كنت تشك في مجموعة بياناتك: 1 إلى 3 دولار أمريكي لكل تشغيل، لا يوجد شيء مدرب مسبقًا لتغطية البيانات السيئة.
  • GR00T N1.7 و Pi0.5 يقعان ضمن نصف نقطة على LIBERO، 97.0 مقابل 96.85 إلى 97.5. هذا ليس سببًا لاختيار أي منهما.
  • Pi0.5 هو خيار التعميم، وليس خيار الدقة، وهو الأبطأ عند 485 ms.
  • SmolVLA، بـ 450 مليون معلمة، هو VLA الوحيد هنا الذي يتم ضبطه بدقة على بطاقة واحدة بسعة 24 GB.
  • ACT عند 20 ms هو الخيار الوحيد للحركة التفاعلية السريعة. التراخيص تحدد الباقي.

جدول القرارات

وضعكدرب هذالماذا
جودة مجموعة البيانات غير مثبتةACTلا شيء مدرب مسبقًا يخفي مجموعة بيانات معيبة، والفشل يكلف 1 إلى 3 دولار أمريكي.
غني بالاتصال، متعدد الخطوات، مشروط باللغةGR00T N1.797.0% عبر أربع مجموعات LIBERO، بالإضافة إلى مساحة عمل نسبية للمؤثر النهائي.
حركة تفاعلية سريعة، استدلال عند المحركات المؤازرةACT20 مللي ثانية. الأسرع التالي أبطأ 7.6 مرات.
كائنات جديدة، مشهد جديد، عالم مفتوحPi0.5مصمم للسلوك خارج التوزيع، عبر ما يصل إلى 104 مواقع.
بطاقة واحدة بسعة 24 جيجابايت، وما زلت تريد اللغةSmolVLA450 مليون معلمة، حد أدنى 30 حلقة، يعمل محليًا.
إعادة إنتاج تشغيل مسجل في عام 2025GR00T N1.5فقط إذا كان يجب عليك: LeRobot يرفضه الآن، الأوزان غير تجارية.
سيتم شحن هذا كمنتجN1.7, SmolVLA or ACTN1.5 غير تجاري، Pi0.5 يحمل شروط Gemma، بطاقة SmolVLA لا تذكر شيئًا.

المرشحون الخمسة

الخمسة جميعهم سياسات: إطارات الكاميرا، ومواضع المفاصل، ولأربعة منهم، تعليمات لغوية، يتم ربطها بمجموعة من أهداف المفاصل المستقبلية. ما يميزهم هو مقدار ما تم تعلمه قبل وصولك.

السياسةالمعلماتالكمونفئة وحدة معالجة الرسومياتمحلي؟الحد الأدنى للحلقاتالتنسيقالتكلفة
ACT~80 M20 ms24 GB cardنعم50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardنعم30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBلا50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBلا50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBلا50v3.04 to 12 USD

GR00T N1.7

نموذج NVIDIA الحالي نموذج الرؤية واللغة والحركة، حوالي 3 مليارات معلمة، تم تدريب ما يقرب من 40 مليونًا منها خلال الضبط الدقيق. يسرد المستودع الفروقات عن N1.6: العمود الفقري من نموذج Eagle المورد إلى Cosmos-Reason2-2B على Qwen3-VL، طبقات الانتشار من 32 إلى 16، أبعاد الحالة والحركة من 29 إلى 132، أفق الحركة من 16 إلى 40.

ما يهم في الذراع الصغيرة هو مساحة حركة المؤثر النهائي النسبية: يتنبأ N1.7 بالفروقات عن الوضعية الحالية، وهذا ما يسمح بنقل 20 ألف ساعة من فيديو EgoScale البشري إلى سياسة روبوت. المواصفات في صفحة N1.7، والإجراء في دليل N1.7 على SO-100.

التوفر العام (GA) في المستودع، التوفر المبكر (EA) على بطاقة النموذج

يعلن ملف README الخاص بـ Isaac-GR00T أن N1.7 هو إصدار متوفر بشكل عام، مع معايير ودعم كاملين. لم يتم تحديث بطاقته على Hugging Face: لا يزال حقل Model Version يقرأ GR00T N1.7 EA. المستودع هو الوثيقة الأحدث.

GR00T N1.5

نفس مقياس 3 B، وبنية Eagle 2 الأساسية، وSigLip2 و T5، ورأس DiT لمطابقة التدفق. يوجد لتوسيع لديك بالفعل. شيئان يجعلان منه خيارًا افتراضيًا سيئًا: الأوزان تحمل ترخيص NVIDIA أحادي الاتجاه غير التجاري، وإصدارات LeRobot الحالية أزالت دعم N1.5. انظر .

Pi0.5

من Physical Intelligence VLA، نوع السياسة pi05. تقدم الورقة نموذج VLM بحجم 2 مليار معلمة، مهيأ من PaliGemma بالإضافة إلى خبير عمل بحجم 300 مليون معلمة، يقود الروبوت بسرعة 50 هرتز؛ تكوين pi05 الخاص بـ LeRobot يضبط افتراضيًا على جزء من 50 خطوة، أي ثانية واحدة بهذا المعدل. نقطة البيع هي الأماكن غير المرئية: حوالي 400 ساعة من المناولة المتنقلة في المنازل الحقيقية، ودراسة توسع على 3، 12، 22، 53، 82 و 104 مواقع، حيث تطابق النموذج ذو الـ 104 مواقع مع تحكم تم تدريبه على المنازل التجريبية نفسها.

أحد القيود، المذكور على lerobot/pi05_base بطاقة: المنفذ يحمل فقط رأس الإجراء المطابق للتدفق. لم يتم إصدار تنبؤ المهام الفرعية، وتجزئة الإجراءات، والتعلم المعزز (RL) في المصدر، ويقول openpi نفس الشيء عن مستودعه الخاص. صفحة Pi0.5 و دليل Pi0.5 على SO-100 يحتويان على البقية.

الفخ الذي يلتهم فترة ما بعد الظهر: المستودعات المقيدة

يحتاج Pi0.5 إلى مُجزئ الرموز المقيد google/paligemma-3b-pt-224 (gated: manual، على الرغم من أن Google تقول إن الطلبات تُعالج فورًا). بدون قبوله وتشغيل hf auth login في بيئة التدريب، تبدأ المهمة، وتُنزّل لبعض الوقت، ثم تتوقف بسبب خطأ في التفويض يبدو وكأنه عطل في الشبكة. nvidia/GR00T-N1.7-3B غير مقيد، لكن أساسه nvidia/Cosmos-Reason2-2B مقيد (gated: auto). امسح كلاهما قبل الإضافة إلى قائمة الانتظار؛ إذا بقيت عملية تشغيل خاملة، فإن صفحة قائمة الانتظار العالقة تسرد ما يجب التحقق منه.

SmolVLA

450 مليون معلمة، حوالي 100 مليون منها في خبير الإجراءات، على SmolVLM-2 مع تجميد VLM واستخدام أول 16 طبقة فقط من نموذج اللغة. كان التدريب المسبق بيانات مجتمعية: 481 مجموعة بيانات، 10.6 مليون إطار، من نفس الأذرع الرخيصة التي تستخدمها. VLA الوحيد هنا الذي يناسب بطاقة 24 جيجابايت واحدة، والوحيد الذي يصل إلى 30 حلقة كحد أدنى. انظر صفحة SmolVLA.

ACT

ليس نموذجًا أساسيًا. محول تقسيم الإجراءات (Action Chunking Transformer) من ALOHA يحتوي على حوالي 80 مليون معلمة تم تدريبها من الصفر لكل مهمة، بناءً على 50 عرضًا توضيحيًا بتردد 50 هرتز. يذكر البحث ست مهام ثنائية اليد حقيقية من حوالي عشر دقائق من العروض التوضيحية لكل منها، بنسبة 80 إلى 90 بالمائة على الأمثلة التي يسلط الضوء عليها. فكرته، تقسيم الإجراءات، موجودة في كل نموذج في هذه الصفحة، ولا يزال تحليل الإزالة الخاص به يقيس التأثير بشكل أفضل: عبر مهمتين محاكاتين مع إيقاف التجميع الزمني، يرتفع النجاح من 1 بالمائة عند k=1 إلى 44 بالمائة عند k=100. صفحة ACT تحتوي على البقية.

ما تقوله المعايير بالفعل

LIBERO هو المعيار الوحيد الذي أبلغت عنه ثلاثة من هذه الخمسة: مهام مشروطة باللغة على محاكاة Franka Panda، مقسمة إلى المجموعات الأربع أدناه بعشر مهام لكل منها. أجرت NVIDIA 200 تجربة لكل مجموعة.

النموذجمكانيكائنهدف10 (طويل)المتوسط
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
هذه الصفوف ليست قابلة للمقارنة بدقة

كل رقم يأتي من مجموعة اختبار وميزانية مختلفة. GR00T عمل 20 ألف خطوة بحجم دفعة عالمي 640؛ رقم openpi هو نقطة تفتيش 30 ألف؛ إصدار LeRobot أضاف 6 آلاف خطوة إلى نموذج LIBERO الأساسي. SmolVLA هو عدم تطابق آخر: ورقته تدرب هذا الصف على LIBERO من الصفر، بدون تدريب مسبق لـ VLA، بينما الثلاثة التي فوقها تقوم بضبط دقيق لنقاط التفتيش المدربة مسبقًا. تعامل مع 96.85 إلى 97.5 كمجموعة واحدة، والفجوة إلى 87.3% كحقيقية ولكن تم الحصول عليها بـ 6.7 ضعف المعلمات.

SimplerEnv يظهر الانتشار، وهو ما لا يفعله LIBERO. NVIDIA تقارن N1.7 بـ N1.6، وهو أقرب شيء عام إلى "فرق الأجيال".

مجموعة SimplerEnvمتوسط N1.6متوسط N1.7أفضل تأرجحأسوأ تأرجح
Bridge (WidowX)، 7 مهام56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot)، 6 مهام52.0%72.5%open_drawer 0.0 to 65.0لا شيء، كل مهمة تحسنت

صف Bridge هو المفيد: 5.7 نقاط مكتسبة في المتوسط بينما put_eggplant_in_basket خسر 36 و put_eggplant_in_sink انخفض من 33 إلى 2. جيل جديد يحرك التوزيع بدلاً من رفعه، لذا إذا كانت مهمتك تقع حيث تراجع N1.7، فإن المتوسط لا يقول شيئًا.

لوحة صدارة ساحة AY-Robots، جدول قابل للفرز يضم 85 نموذج رؤية-لغة-فعل مع 332 نتيجة معيارية، كل قيمة مرتبطة بالورقة البحثية أو بطاقة النموذج التي جاءت منها
تضم الساحة 85 نموذج VLA و 332 نتيجة معيارية، كل منها مرتبط بورقته البحثية أو بطاقة النموذج الخاصة به. مفيد للتحقق مما إذا كان الرقم المذكور في منشور مدونة حقيقيًا.

من بين الخمسة، الورقة البحثية لـ SmolVLA فقط هي التي تتحدث عن ذراع من فئة SO-100: 78.3 بالمائة لـ SmolVLA و 61.7 لـ Pi0 عبر ثلاث مهام، كلاهما متعدد المهام، مقابل 48.3 لـ ACT المدرب على مهمة واحدة، وهو ليس مقارنة متكافئة. المقارنة النظيفة هي كلاهما بمهمة واحدة على SO-101 pick-and-place: 90 مقابل 70 في التوزيع، 50 مقابل 40 خارج التوزيع. قارن على ACT مقابل SmolVLA و Pi0.5 مقابل SmolVLA، أو تصفح الساحة.

الكمون والتكلفة يحددان النشر

زمن استجابة الاستدلال هو القيد الذي يكتشفه الناس أخيرًا ويندمون عليه أولاً. سياسة أفضل بخمس نقاط على معيار أداء ولكن بنصف ثانية لكل خطوة عمل تبدو أسوأ على مكتبك: ديناميكيات التلامس لا تنتظر.

ملاحظة واحدة: الرقم الخاص بـ GR00T لا يتفق مع بطاقة NVIDIA، التي تسجل 4 خطوات لإزالة الضوضاء وكاميرا واحدة عند 85.8 مللي ثانية على H100 في الوضع الفوري، 48.6 مللي ثانية مع torch.compile، 27.9 مللي ثانية عبر TensorRT الكامل. الـ 152 مللي ثانية هنا هي رقم مكدس كامل مع تكاليف خدمة علوية وأكثر من كاميرا واحدة، وليست تمريرة أمامية.

الاستدلال عن بعد له سقف صعب

الحلقة من 20 إلى 485 مللي ثانية هي للموديل، وتضاف إليها رحلات الذهاب والإياب عبر الإنترنت العام. الاستدلال عن بعد ممكن لمهام الالتقاط والوضع البطيئة، وليس للحركة التفاعلية السريعة. إذا كانت مهمتك تتطلب السرعة، فإن الاستدلال يكون بجوار المحركات المؤازرة: ACT أو SmolVLA، محليًا. ذات صلة: توقف السياسة في منتصف الحركة.

إحدى الطرق لكسب الوقت دون تغيير النموذج: تقيس ورقة SmolVLA التنفيذ المتزامن، حيث تنهي السياسة جزءًا قبل التنبؤ بالجزء التالي، مقابل التنفيذ غير المتزامن، حيث يتداخل التنبؤ مع التنفيذ. النجاح متشابه، 78.3 مقابل 73.3، لكن نفس مهمة الالتقاط والوضع تستغرق 9.7 ثوانٍ بدلاً من 13.75، وفي نافذة زمنية ثابتة يدير الروبوت 19 دورة بدلاً من 9.

التراخيص، تم التحقق منها لأن لا أحد يتحقق منها

النموذجترخيص الأوزانترخيص الكودالاستخدام التجاري
GR00T N1.7ترخيص نموذج NVIDIA المفتوح؛ البطاقة تسمح بالاستخدام التجاريApache 2.0نعم
GR00T N1.5ترخيص NVIDIA أحادي الاتجاه غير التجاريApache 2.0لا
Pi0.5بيانات تعريف بطاقة pi05_base تقرأ الترخيص: gemmaApache 2.0 (openpi, LeRobot docs)اقرأ كلاهما، فهما غير متفقين
SmolVLAلا يوجد حقل ترخيص على بطاقة smolvla_baseApache 2.0 (LeRobot)الكود نعم، الأوزان غير مذكورة
ACTلا توجد أوزان أساسيةApache 2.0 (LeRobot)نعم

صف Pi0.5 يحتاج إلى عناية. وثائق LeRobot pi05 تنص على Apache 2.0 متوافقة مع openpi، بينما بطاقة Hub لـ lerobot/pi05_base تحمل license: gemma. كلاهما نشط. GR00T N1.7 لديه نسخة أخف: ملف README الخاص بـ Isaac-GR00T يذكر عرضًا أن N1.7 مرخص تجاريًا بالكامل بموجب Apache 2.0، بينما قسم الترخيص الخاص به وبطاقة النموذج يضعان الكود فقط تحت Apache 2.0 والأوزان تحت NVIDIA ترخيص النموذج المفتوح.

الإعدادات الافتراضية التي ستشغلها فعليًا

يأتي كل نموذج تدريب بإعداد افتراضي، وهي ليست عشوائية. إعدادات ACT هي خاصة بـ LeRobot: حجم الدفعة 8، lr 1e-5, 100000 خطوات التدريب، حجم الكتلة 100، مطابقة لـ ACTConfig الأصلية وk=100 من ورقة ACT البحثية. أحد الأعمدة أدناه هو فخ.

السياسةالدفعةLRالحد الأقصى للخطواتتراكم التدرجينطبق؟إعدادات إضافية
GR00T N1.7321e-4200001نعمsaveSteps
GR00T N1.511e-5200016نعمsaveSteps
Pi0.515e-53000016لا (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008لاseed, logFreq
ACT81e-51000001لاchunkSize, nActionSteps, seed, logFreq
قابلية الاستنساخ، بتاريخ أغسطس 2026

نقطة دخول الضبط الدقيق لـ GR00T (launch_finetune.py، واجهة سطر أوامر tyro) لا تحتوي على حقل بذرة (seed) في فئة بيانات التكوين الخاصة بها، لذا فإن عمليات التشغيل ليست قابلة للاستنساخ بتفاصيلها الدقيقة. يحذر المستودع أيضًا من تفاوت بنسبة 5 إلى 6 بالمائة بين عمليات التشغيل بسبب عمليات تكبير الصور غير الحتمية، وهو أكبر من معظم الفروقات المعيارية التي يتم النقاش حولها عبر الإنترنت. البذرة الافتراضية لـ LeRobot هي 1000. يصف عمود تراكم التدرج lerobot 0.5.1؛ الإصدار الأصلي 0.6.2 يعرضه كـ --accelerator.gradient_accumulation.steps.

الإعداد الذي يهم أكثر من اختيار النموذج

إنها كتلة الإجراء. تمنح الكتل الأطول حركة أكثر سلاسة وأخطاء تراكمية أقل، ولكن يتم الالتزام بالسياسة أثناء تنفيذ الكتلة، لذا تتفاعل متأخرًا مع أي شيء يتحرك: واثقة على مكعب ثابت، ويائسة على مكعب متحرك. إذا تجاوزت الحد، فإن تقصير الجزء المنفذ أفضل من إعادة التدريب وهو مجاني. المفصل الذي يتوقف مبكرًا يمثل مشكلة مختلفة؛ انظر .

  • ACT: ACTConfig defaults to chunk_size 100 and n_action_steps 100. Temporal ensembling is off and requires n_action_steps 1.
  • GR00T N1.7: internal horizon went 16 to 40, yet LeRobot's SO-101 example still runs --policy.chunk_size=16 --policy.n_action_steps=16. The rollout flag was renamed to --execution-horizon.
  • Pi0.5: a 50-step chunk, of which LeRobot's LIBERO recipe executes 10 via --policy.n_action_steps=10; with --policy.pretrained_path it falls back to 50 if you omit the flag.
  • SmolVLA: 50-action chunks, both knobs exposed.

كيفية فحص الخمسة جميعًا في فترة ما بعد الظهر

الإجابة الأقل تكلفة ليست المزيد من القراءة. أنفق حوالي 15 USD ودع الذراع تخبرك: سجل مرة واحدة، درب النموذج الرخيص أولاً، ثم صعد بمجرد أن يثبت أن البيانات سليمة. الهيكل يتفوق على الحجم، وهذا هو الهدف من و .

  1. 1
    سجل 50 حلقة مرة واحدة

    خمسون حلقة تمهد الطريق لـ GR00T و Pi0.5 و ACT، و 30 حلقة لـ SmolVLA. كرر كل اختلاف بدلاً من التشتت: 50 حلقة تدريب عبر 5 مواضع مكعبات حيث لم يتم تدريب 25 حلقة. انظر تسجيل مجموعة بياناتك الأولى.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    درب ACT أولاً، لأنه لا يمكن أن يكذب عليك

    لا توجد أوزان مدربة مسبقًا، لذا إذا قام بالمهمة على الإطلاق، فإن مجموعة بياناتك تحتوي على المهمة. إذا توقف ACT عن العمل، قم بإصلاح البيانات. 1 إلى 3 USD، 2 إلى 5 ساعات على بطاقة 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    شغل SmolVLA على نفس مجموعة البيانات، دون تغيير

    نفس البيانات، نفس الذراع، 450 مليون معلمة بدلاً من 80 مليون، بالإضافة إلى التكييف اللغوي. يضع LeRobot تشغيل 20 ألف خطوة في حوالي 4 ساعات على A100 واحد. هذا ما يخبرك ما إذا كان التدريب المسبق يجلب أي فائدة.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    قم بالتحويل إلى v2.1 قبل استخدام GR00T

    يقرأ GR00T نسخة من تنسيق LeRobot v2 بالإضافة إلى ملف meta/modality.json إضافي يوضح كيفية تقسيم مصفوفات الحالة والإجراءات المدمجة إلى حقول مسماة. تتسبب مجموعة بيانات v3.0 في تعطل هذا المحمل، لأن v3.0 يجمع العديد من الحلقات في ملفات مشتركة حيث كتب v2 حلقة واحدة لكل حلقة. يشحن Isaac-GR00T مساعد التخفيض كـ scripts/lerobot_conversion/convert_v3_to_v2.py؛ صفحة رفض v3 هي المسار السريع.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    صعّد إلى GR00T N1.7 فقط إذا لم تحقق الخطوتان الأوليان النتائج المرجوة

    من خلال واجهة سطر الأوامر الخاصة بـ NVIDIA، المعروضة هنا، أو نوع سياسة groot الخاص بـ LeRobot. توصي NVIDIA بـ 40 GB أو أكثر من VRAM للضبط الدقيق، و 16 GB للاستدلال. عند حدوث OOM، انظر صفحة OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

طريقتان لتشغيل هذه الفحص الأولي

ثلاث بيئات، لأن سلاسل الأدوات لا تتعايش. LeRobot على الرئيسي هو 0.6.2 ويحتاج إلى Python 3.12 أو أحدث؛ Isaac-GR00T و openpi هما مستودعات منفصلة تدار بواسطة uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • يثبت GR00T torchcodec 0.8.0 كواجهة خلفية وحيدة للفيديو، ويحتاج إلى FFmpeg 4 إلى 7. FFmpeg 8 غير مدعوم، و AV1 غير مضمون.
  • حدود ذاكرة openpi: الاستدلال فوق 8 GB، LoRA فوق 22.5 GB، الضبط الدقيق الكامل فوق 70 GB. هذا الأخير هو السبب في أن Pi0.5 يتطلب A100.
  • استأجر وحدة معالجة الرسوميات بنفسك، ودمرها بعد ذلك، وقم بتسوية ثلاث مجموعات من مسارات نقاط الفحص يدويًا.

نموذج أساسي أو من الصفر

المفترق الحقيقي ليس في اختيار نموذج 3B. بل هو في ما إذا كان يجب استخدام VLA مدرب مسبقًا على الإطلاق، بالنظر إلى أن ACT تعلم ست مهام ثنائية اليد حقيقية من حوالي عشر دقائق من العروض التوضيحية لكل منها، بـ 80 مليون معلمة و لا شيء مدرب مسبقًا.

ضبط دقيق لـ VLA مدرب مسبقًا بدلاً من تدريب ACT من الصفر
ما تكسبه
  • تكييف اللغة. ACT لا يمتلك ذلك؛ نقطة تحقق واحدة لـ ACT تقوم بمهمة واحدة.
  • أفضل على الكائنات الغائبة عن عروضك التوضيحية: على SO-101، 50% مقابل 40% لـ ACT خارج التوزيع.
  • متعدد المهام على الإطلاق: SmolVLA يصل إلى 78.3% عبر ثلاث مهام SO-100 بنقطة تحقق واحدة؛ تم تشغيل ACT كمهام فردية فقط.
ما يكلفك
  • تأخير يتراوح من 7.6x إلى 24x: من 152 إلى 485 مللي ثانية لكل خطوة عمل مقابل 20 مللي ثانية لـ ACT.
  • من 4 إلى 12 دولارًا أمريكيًا لكل تشغيل بدلاً من 1 إلى 3، ومستوى A100 بدلاً من أي بطاقة 24 جيجابايت.
  • التعرض للترخيص، بالإضافة إلى وضع فشل المستودع المقيد الذي لا يوجد من الصفر.
  • يمكن للأوزان المدربة مسبقًا أن تخفي مجموعة بيانات سيئة. الضبط الدقيق الذي يعمل جزئيًا على بيانات معطلة يكلف أسبوعًا قبل أن تنظر إلى البيانات.

حالة إعادة إنتاج تشغيل قديم

مطاردة نقطة تحقق لعام 2025 تجعل اختيار النموذج لك وتحول المشكلة إلى تثبيت الإصدار: يرفض LeRobot الحالي N1.5، لذا تقوم بتثبيت lerobot==0.5.1. مع عدم وجود حقل بذرة وتفاوت بنسبة 5 إلى 6 بالمائة بين عمليات التشغيل، يكون الاستنساخ تقريبيًا بطبيعته. و تحتوي على جانب المنصة.

صفحة المقارنة المباشرة لـ AY-Robots بين GR00T N1.7 و Pi0.5، تعرض عدد المعلمات، متطلبات وحدة معالجة الرسوميات، زمن استجابة الاستدلال، تنسيق مجموعة البيانات، والحد الأدنى لعدد الحلقات جنبًا إلى جنب.
مقارنة مباشرة على /compare/groot-n1-7-vs-pi0-5. يبدو النموذجان 3B قابلين للتبديل في ورقة المواصفات ولكنهما ليسا كذلك: أحدهما يتطلب LeRobot v2.1، والآخر يتطلب v3.0.

هل تقلصت الخيارات إلى اثنين؟ ACT ضد GR00T N1.7 وGR00T N1.7 ضد SmolVLA. توجد الصفوف الأولية في إدخالات الساحة: GR00T N1.7، Pi0.5، SmolVLA وACT.

المواضع التي لا تساعدك فيها هذه المنصة

  • لا يمكنها تسريع الاستدلال عن بعد. الحلقة الزمنية من 20 إلى 485 مللي ثانية تخص النموذج؛ وتضاف إليها أوقات الذهاب والإياب عبر الإنترنت.
  • لا يمكنها ضبط GR00T أو Pi0.5 بدقة على أجهزتك الخاصة. كلاهما متاحان عبر السحابة فقط هنا؛ فقط SmolVLA و ACT يعملان محليًا.
  • لا يمكنها إصلاح مجموعة بيانات. انخفاض الخسارة ولكن السياسة لا تفعل شيئًا هي مشكلة بيانات، وسياسة تعمل في إعداد واحد فقط هي مشكلة تغطية.
  • لا يمكنها جعل تشغيل GR00T قابلاً للتكرار: التكوين الأصلي لا يحتوي على حقل للبذرة (seed).

85 نموذجًا، 332 نتيجة معيارية، كل رقم مرتبط بمصدره

النسخة القابلة للفرز من الجداول في هذه الصفحة: 85 نموذج رؤية-لغة-فعل، 332 نتيجة معيارية، كل منها مرتبط بورقته البحثية أو بطاقة النموذج الخاصة به.

افتح الساحة

اختيار واحد والمضي قدمًا

إعداد افتراضي واحد: سجل 50 حلقة، درب ACT مقابل 1 إلى 3 دولارات أمريكية لإثبات صلاحية مجموعة البيانات، ثم SmolVLA على نفس البيانات. بتكلفة أقل من 6 دولارات أمريكية معًا، يجيبان على السؤال المهم: هل يساعد التدريب المسبق هنا، أم هل تكمن المشكلة في البيانات. انتقل إلى GR00T N1.7 للمهام متعددة الخطوات الغنية بالاتصال، وإلى Pi0.5 عندما يتغير المشهد.

جولة في المنصة: تدريب سياستك الأولى، ثم تشغيل سياستك الأولى. تغطي وثائق التدريب و وثائق مجموعات البيانات الشكل والتنسيق؛ وتغطي صفحة SO-100 و الدليل الشامل لـ SO-100 التجميع والمعايرة. خلفية: نظرة عامة على VLA و مقالة Pi0 حول مطابقة التدفق. العنصر الذي سيرفع معدل نجاحك هو دليل جودة البيانات.

ما هي سياسة VLA التي يجب أن أدربها أولاً على SO-100؟

ACT، ثم SmolVLA. يدرب ACT من الصفر، لذلك لا يمكنه إخفاء مجموعة بيانات سيئة، وتكلفة التشغيل تتراوح من 1 إلى 3 USD على بطاقة 24 GB. إذا قام ACT بالمهمة على الإطلاق، فإن 4 إلى 12 USD لتشغيل GR00T N1.7 أو Pi0.5 لن تذهب سدى.

هل GR00T N1.7 أفضل حقًا من Pi0.5؟

على LIBERO، تقع ضمن نطاق الضوضاء: 97.0% عبر أربع مجموعات لـ GR00T N1.7، و 96.85% لـ Pi0.5 عند 30k خطوة في openpi، و 97.5% لمنفذ LeRobot، وكلها من أنظمة مختلفة. الفروقات الحقيقية هي 152 ms لكل خطوة عمل مقابل 485 ms، ومجموعات بيانات v2.1 مقابل v3.0، ودقة المعيار مقابل التعميم في العالم المفتوح.

هل يمكنني ضبط أي من هذه النماذج بدقة على بطاقة RTX 4090 واحدة؟

SmolVLA و ACT، نعم؛ كلاهما مدرج لبطاقة RTX 4090 أو أي بطاقة 24 GB ويعملان محليًا. يحتاج GR00T N1.7 و N1.5 و Pi0.5 إلى A100 أو H100 80 GB وهي سحابية فقط هنا. توصي NVIDIA بـ 40 GB أو أكثر للضبط الدقيق لـ GR00T؛ الحد الأدنى لـ openpi هو أكثر من 70 GB للضبط الدقيق الكامل لـ Pi0.5، و 22.5 GB لـ LoRA.

أي من هذه الخمسة يمكنني استخدامه تجاريًا؟

أوزان GR00T N1.7 تخضع لاتفاقية ترخيص نموذج NVIDIA المفتوح، والتي تنص البطاقة على أنها تغطي الاستخدام التجاري. أوزان N1.5 غير تجارية. كود SmolVLA هو Apache 2.0 في LeRobot، لكن بطاقة lerobot/smolvla_base لا تحتوي على حقل ترخيص، لذا فإن الأوزان غير مذكورة. ACT ليس لديه أوزان أساسية لترخيصها. Pi0.5 غامض: وثائق LeRobot تقول Apache 2.0، وبيانات تعريف بطاقته تقرأ license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started