
GR00T N1.7، Pi0.5، SmolVLA، ACT أو GR00T N1.5؟ جدول قرارات يتناسب مع المواقف الحقيقية، مع أرقام المعايير المنشورة، زمن الاستجابة، التكلفة لكل تشغيل والتراخيص وراء كل خيار.
خمس سياسات قابلة للتدريب على ذراع من فئة SO-100 اليوم. تختلف بعامل 24 في الاستدلال الكمون، و37 في عدد المعلمات، و12 في تكلفة التشغيل، وفيما إذا كان يمكنك شحن النتيجة. خمس بطاقات نموذجية لن تحسم الأمر: لا توجد إجابة على سؤالك، أي منها أقوم بتشغيله أولاً؟
كل رقم أدناه تم استخراجه من الأوراق والمستودعات والبطاقات في أغسطس 2026. أرقام المنصة تأتي من كتالوج سياسات AY-Robots؛ حيثما يختلف الاثنان، يتم عرض كلاهما.
النسخة المختصرة
- •درب ACT أولاً إذا كنت تشك في مجموعة بياناتك: 1 إلى 3 دولار أمريكي لكل تشغيل، لا يوجد شيء مدرب مسبقًا لتغطية البيانات السيئة.
- •GR00T N1.7 و Pi0.5 يقعان ضمن نصف نقطة على LIBERO، 97.0 مقابل 96.85 إلى 97.5. هذا ليس سببًا لاختيار أي منهما.
- •Pi0.5 هو خيار التعميم، وليس خيار الدقة، وهو الأبطأ عند 485 ms.
- •SmolVLA، بـ 450 مليون معلمة، هو VLA الوحيد هنا الذي يتم ضبطه بدقة على بطاقة واحدة بسعة 24 GB.
- •ACT عند 20 ms هو الخيار الوحيد للحركة التفاعلية السريعة. التراخيص تحدد الباقي.
جدول القرارات
| وضعك | درب هذا | لماذا |
|---|---|---|
| جودة مجموعة البيانات غير مثبتة | ACT | لا شيء مدرب مسبقًا يخفي مجموعة بيانات معيبة، والفشل يكلف 1 إلى 3 دولار أمريكي. |
| غني بالاتصال، متعدد الخطوات، مشروط باللغة | GR00T N1.7 | 97.0% عبر أربع مجموعات LIBERO، بالإضافة إلى مساحة عمل نسبية للمؤثر النهائي. |
| حركة تفاعلية سريعة، استدلال عند المحركات المؤازرة | ACT | 20 مللي ثانية. الأسرع التالي أبطأ 7.6 مرات. |
| كائنات جديدة، مشهد جديد، عالم مفتوح | Pi0.5 | مصمم للسلوك خارج التوزيع، عبر ما يصل إلى 104 مواقع. |
| بطاقة واحدة بسعة 24 جيجابايت، وما زلت تريد اللغة | SmolVLA | 450 مليون معلمة، حد أدنى 30 حلقة، يعمل محليًا. |
| إعادة إنتاج تشغيل مسجل في عام 2025 | GR00T N1.5 | فقط إذا كان يجب عليك: LeRobot يرفضه الآن، الأوزان غير تجارية. |
| سيتم شحن هذا كمنتج | N1.7, SmolVLA or ACT | N1.5 غير تجاري، Pi0.5 يحمل شروط Gemma، بطاقة SmolVLA لا تذكر شيئًا. |
المرشحون الخمسة
الخمسة جميعهم سياسات: إطارات الكاميرا، ومواضع المفاصل، ولأربعة منهم، تعليمات لغوية، يتم ربطها بمجموعة من أهداف المفاصل المستقبلية. ما يميزهم هو مقدار ما تم تعلمه قبل وصولك.
| السياسة | المعلمات | الكمون | فئة وحدة معالجة الرسوميات | محلي؟ | الحد الأدنى للحلقات | التنسيق | التكلفة |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | نعم | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | نعم | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | لا | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | لا | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | لا | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
نموذج NVIDIA الحالي نموذج الرؤية واللغة والحركة، حوالي 3 مليارات معلمة، تم تدريب ما يقرب من 40 مليونًا منها خلال الضبط الدقيق. يسرد المستودع الفروقات عن N1.6: العمود الفقري من نموذج Eagle المورد إلى Cosmos-Reason2-2B على Qwen3-VL، طبقات الانتشار من 32 إلى 16، أبعاد الحالة والحركة من 29 إلى 132، أفق الحركة من 16 إلى 40.
ما يهم في الذراع الصغيرة هو مساحة حركة المؤثر النهائي النسبية: يتنبأ N1.7 بالفروقات عن الوضعية الحالية، وهذا ما يسمح بنقل 20 ألف ساعة من فيديو EgoScale البشري إلى سياسة روبوت. المواصفات في صفحة N1.7، والإجراء في دليل N1.7 على SO-100.
يعلن ملف README الخاص بـ Isaac-GR00T أن N1.7 هو إصدار متوفر بشكل عام، مع معايير ودعم كاملين. لم يتم تحديث بطاقته على Hugging Face: لا يزال حقل Model Version يقرأ GR00T N1.7 EA. المستودع هو الوثيقة الأحدث.
GR00T N1.5
نفس مقياس 3 B، وبنية Eagle 2 الأساسية، وSigLip2 و T5، ورأس DiT لمطابقة التدفق. يوجد لتوسيع لديك بالفعل. شيئان يجعلان منه خيارًا افتراضيًا سيئًا: الأوزان تحمل ترخيص NVIDIA أحادي الاتجاه غير التجاري، وإصدارات LeRobot الحالية أزالت دعم N1.5. انظر .
Pi0.5
من Physical Intelligence VLA، نوع السياسة pi05. تقدم الورقة نموذج VLM بحجم 2 مليار معلمة، مهيأ من PaliGemma بالإضافة إلى خبير عمل بحجم 300 مليون معلمة، يقود الروبوت بسرعة 50 هرتز؛ تكوين pi05 الخاص بـ LeRobot يضبط افتراضيًا على جزء من 50 خطوة، أي ثانية واحدة بهذا المعدل. نقطة البيع هي الأماكن غير المرئية: حوالي 400 ساعة من المناولة المتنقلة في المنازل الحقيقية، ودراسة توسع على 3، 12، 22، 53، 82 و 104 مواقع، حيث تطابق النموذج ذو الـ 104 مواقع مع تحكم تم تدريبه على المنازل التجريبية نفسها.
أحد القيود، المذكور على lerobot/pi05_base بطاقة: المنفذ يحمل فقط رأس الإجراء المطابق للتدفق. لم يتم إصدار تنبؤ المهام الفرعية، وتجزئة الإجراءات، والتعلم المعزز (RL) في المصدر، ويقول openpi نفس الشيء عن مستودعه الخاص. صفحة Pi0.5 و دليل Pi0.5 على SO-100 يحتويان على البقية.
يحتاج Pi0.5 إلى مُجزئ الرموز المقيد google/paligemma-3b-pt-224 (gated: manual، على الرغم من أن Google تقول إن الطلبات تُعالج فورًا). بدون قبوله وتشغيل hf auth login في بيئة التدريب، تبدأ المهمة، وتُنزّل لبعض الوقت، ثم تتوقف بسبب خطأ في التفويض يبدو وكأنه عطل في الشبكة. nvidia/GR00T-N1.7-3B غير مقيد، لكن أساسه nvidia/Cosmos-Reason2-2B مقيد (gated: auto). امسح كلاهما قبل الإضافة إلى قائمة الانتظار؛ إذا بقيت عملية تشغيل خاملة، فإن صفحة قائمة الانتظار العالقة تسرد ما يجب التحقق منه.
SmolVLA
450 مليون معلمة، حوالي 100 مليون منها في خبير الإجراءات، على SmolVLM-2 مع تجميد VLM واستخدام أول 16 طبقة فقط من نموذج اللغة. كان التدريب المسبق بيانات مجتمعية: 481 مجموعة بيانات، 10.6 مليون إطار، من نفس الأذرع الرخيصة التي تستخدمها. VLA الوحيد هنا الذي يناسب بطاقة 24 جيجابايت واحدة، والوحيد الذي يصل إلى 30 حلقة كحد أدنى. انظر صفحة SmolVLA.
ACT
ليس نموذجًا أساسيًا. محول تقسيم الإجراءات (Action Chunking Transformer) من ALOHA يحتوي على حوالي 80 مليون معلمة تم تدريبها من الصفر لكل مهمة، بناءً على 50 عرضًا توضيحيًا بتردد 50 هرتز. يذكر البحث ست مهام ثنائية اليد حقيقية من حوالي عشر دقائق من العروض التوضيحية لكل منها، بنسبة 80 إلى 90 بالمائة على الأمثلة التي يسلط الضوء عليها. فكرته، تقسيم الإجراءات، موجودة في كل نموذج في هذه الصفحة، ولا يزال تحليل الإزالة الخاص به يقيس التأثير بشكل أفضل: عبر مهمتين محاكاتين مع إيقاف التجميع الزمني، يرتفع النجاح من 1 بالمائة عند k=1 إلى 44 بالمائة عند k=100. صفحة ACT تحتوي على البقية.
ما تقوله المعايير بالفعل
LIBERO هو المعيار الوحيد الذي أبلغت عنه ثلاثة من هذه الخمسة: مهام مشروطة باللغة على محاكاة Franka Panda، مقسمة إلى المجموعات الأربع أدناه بعشر مهام لكل منها. أجرت NVIDIA 200 تجربة لكل مجموعة.
| النموذج | مكاني | كائن | هدف | 10 (طويل) | المتوسط |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
كل رقم يأتي من مجموعة اختبار وميزانية مختلفة. GR00T عمل 20 ألف خطوة بحجم دفعة عالمي 640؛ رقم openpi هو نقطة تفتيش 30 ألف؛ إصدار LeRobot أضاف 6 آلاف خطوة إلى نموذج LIBERO الأساسي. SmolVLA هو عدم تطابق آخر: ورقته تدرب هذا الصف على LIBERO من الصفر، بدون تدريب مسبق لـ VLA، بينما الثلاثة التي فوقها تقوم بضبط دقيق لنقاط التفتيش المدربة مسبقًا. تعامل مع 96.85 إلى 97.5 كمجموعة واحدة، والفجوة إلى 87.3% كحقيقية ولكن تم الحصول عليها بـ 6.7 ضعف المعلمات.
SimplerEnv يظهر الانتشار، وهو ما لا يفعله LIBERO. NVIDIA تقارن N1.7 بـ N1.6، وهو أقرب شيء عام إلى "فرق الأجيال".
| مجموعة SimplerEnv | متوسط N1.6 | متوسط N1.7 | أفضل تأرجح | أسوأ تأرجح |
|---|---|---|---|---|
| Bridge (WidowX)، 7 مهام | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot)، 6 مهام | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | لا شيء، كل مهمة تحسنت |
صف Bridge هو المفيد: 5.7 نقاط مكتسبة في المتوسط بينما put_eggplant_in_basket خسر 36 و put_eggplant_in_sink انخفض من 33 إلى 2. جيل جديد يحرك التوزيع بدلاً من رفعه، لذا إذا كانت مهمتك تقع حيث تراجع N1.7، فإن المتوسط لا يقول شيئًا.

من بين الخمسة، الورقة البحثية لـ SmolVLA فقط هي التي تتحدث عن ذراع من فئة SO-100: 78.3 بالمائة لـ SmolVLA و 61.7 لـ Pi0 عبر ثلاث مهام، كلاهما متعدد المهام، مقابل 48.3 لـ ACT المدرب على مهمة واحدة، وهو ليس مقارنة متكافئة. المقارنة النظيفة هي كلاهما بمهمة واحدة على SO-101 pick-and-place: 90 مقابل 70 في التوزيع، 50 مقابل 40 خارج التوزيع. قارن على ACT مقابل SmolVLA و Pi0.5 مقابل SmolVLA، أو تصفح الساحة.
الكمون والتكلفة يحددان النشر
زمن استجابة الاستدلال هو القيد الذي يكتشفه الناس أخيرًا ويندمون عليه أولاً. سياسة أفضل بخمس نقاط على معيار أداء ولكن بنصف ثانية لكل خطوة عمل تبدو أسوأ على مكتبك: ديناميكيات التلامس لا تنتظر.
ملاحظة واحدة: الرقم الخاص بـ GR00T لا يتفق مع بطاقة NVIDIA، التي تسجل 4 خطوات لإزالة الضوضاء وكاميرا واحدة عند 85.8 مللي ثانية على H100 في الوضع الفوري، 48.6 مللي ثانية مع torch.compile، 27.9 مللي ثانية عبر TensorRT الكامل. الـ 152 مللي ثانية هنا هي رقم مكدس كامل مع تكاليف خدمة علوية وأكثر من كاميرا واحدة، وليست تمريرة أمامية.
الحلقة من 20 إلى 485 مللي ثانية هي للموديل، وتضاف إليها رحلات الذهاب والإياب عبر الإنترنت العام. الاستدلال عن بعد ممكن لمهام الالتقاط والوضع البطيئة، وليس للحركة التفاعلية السريعة. إذا كانت مهمتك تتطلب السرعة، فإن الاستدلال يكون بجوار المحركات المؤازرة: ACT أو SmolVLA، محليًا. ذات صلة: توقف السياسة في منتصف الحركة.
إحدى الطرق لكسب الوقت دون تغيير النموذج: تقيس ورقة SmolVLA التنفيذ المتزامن، حيث تنهي السياسة جزءًا قبل التنبؤ بالجزء التالي، مقابل التنفيذ غير المتزامن، حيث يتداخل التنبؤ مع التنفيذ. النجاح متشابه، 78.3 مقابل 73.3، لكن نفس مهمة الالتقاط والوضع تستغرق 9.7 ثوانٍ بدلاً من 13.75، وفي نافذة زمنية ثابتة يدير الروبوت 19 دورة بدلاً من 9.
التراخيص، تم التحقق منها لأن لا أحد يتحقق منها
| النموذج | ترخيص الأوزان | ترخيص الكود | الاستخدام التجاري |
|---|---|---|---|
| GR00T N1.7 | ترخيص نموذج NVIDIA المفتوح؛ البطاقة تسمح بالاستخدام التجاري | Apache 2.0 | نعم |
| GR00T N1.5 | ترخيص NVIDIA أحادي الاتجاه غير التجاري | Apache 2.0 | لا |
| Pi0.5 | بيانات تعريف بطاقة pi05_base تقرأ الترخيص: gemma | Apache 2.0 (openpi, LeRobot docs) | اقرأ كلاهما، فهما غير متفقين |
| SmolVLA | لا يوجد حقل ترخيص على بطاقة smolvla_base | Apache 2.0 (LeRobot) | الكود نعم، الأوزان غير مذكورة |
| ACT | لا توجد أوزان أساسية | Apache 2.0 (LeRobot) | نعم |
صف Pi0.5 يحتاج إلى عناية. وثائق LeRobot pi05 تنص على Apache 2.0 متوافقة مع openpi، بينما بطاقة Hub لـ lerobot/pi05_base تحمل license: gemma. كلاهما نشط. GR00T N1.7 لديه نسخة أخف: ملف README الخاص بـ Isaac-GR00T يذكر عرضًا أن N1.7 مرخص تجاريًا بالكامل بموجب Apache 2.0، بينما قسم الترخيص الخاص به وبطاقة النموذج يضعان الكود فقط تحت Apache 2.0 والأوزان تحت NVIDIA ترخيص النموذج المفتوح.
الإعدادات الافتراضية التي ستشغلها فعليًا
يأتي كل نموذج تدريب بإعداد افتراضي، وهي ليست عشوائية. إعدادات ACT هي خاصة بـ LeRobot: حجم الدفعة 8، lr 1e-5, 100000 خطوات التدريب، حجم الكتلة 100، مطابقة لـ ACTConfig الأصلية وk=100 من ورقة ACT البحثية. أحد الأعمدة أدناه هو فخ.
| السياسة | الدفعة | LR | الحد الأقصى للخطوات | تراكم التدرج | ينطبق؟ | إعدادات إضافية |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | نعم | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | نعم | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | لا (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | لا | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | لا | chunkSize, nActionSteps, seed, logFreq |
نقطة دخول الضبط الدقيق لـ GR00T (launch_finetune.py، واجهة سطر أوامر tyro) لا تحتوي على حقل بذرة (seed) في فئة بيانات التكوين الخاصة بها، لذا فإن عمليات التشغيل ليست قابلة للاستنساخ بتفاصيلها الدقيقة. يحذر المستودع أيضًا من تفاوت بنسبة 5 إلى 6 بالمائة بين عمليات التشغيل بسبب عمليات تكبير الصور غير الحتمية، وهو أكبر من معظم الفروقات المعيارية التي يتم النقاش حولها عبر الإنترنت. البذرة الافتراضية لـ LeRobot هي 1000. يصف عمود تراكم التدرج lerobot 0.5.1؛ الإصدار الأصلي 0.6.2 يعرضه كـ --accelerator.gradient_accumulation.steps.
الإعداد الذي يهم أكثر من اختيار النموذج
إنها كتلة الإجراء. تمنح الكتل الأطول حركة أكثر سلاسة وأخطاء تراكمية أقل، ولكن يتم الالتزام بالسياسة أثناء تنفيذ الكتلة، لذا تتفاعل متأخرًا مع أي شيء يتحرك: واثقة على مكعب ثابت، ويائسة على مكعب متحرك. إذا تجاوزت الحد، فإن تقصير الجزء المنفذ أفضل من إعادة التدريب وهو مجاني. المفصل الذي يتوقف مبكرًا يمثل مشكلة مختلفة؛ انظر .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. Temporal ensembling is off and requiresn_action_steps 1. - GR00T N1.7: internal horizon went 16 to 40, yet LeRobot's SO-101 example still runs
--policy.chunk_size=16 --policy.n_action_steps=16. The rollout flag was renamed to--execution-horizon. - Pi0.5: a 50-step chunk, of which LeRobot's LIBERO recipe executes 10 via
--policy.n_action_steps=10; with--policy.pretrained_pathit falls back to 50 if you omit the flag. - SmolVLA: 50-action chunks, both knobs exposed.
كيفية فحص الخمسة جميعًا في فترة ما بعد الظهر
الإجابة الأقل تكلفة ليست المزيد من القراءة. أنفق حوالي 15 USD ودع الذراع تخبرك: سجل مرة واحدة، درب النموذج الرخيص أولاً، ثم صعد بمجرد أن يثبت أن البيانات سليمة. الهيكل يتفوق على الحجم، وهذا هو الهدف من و .
- 1سجل 50 حلقة مرة واحدة
خمسون حلقة تمهد الطريق لـ GR00T و Pi0.5 و ACT، و 30 حلقة لـ SmolVLA. كرر كل اختلاف بدلاً من التشتت: 50 حلقة تدريب عبر 5 مواضع مكعبات حيث لم يتم تدريب 25 حلقة. انظر تسجيل مجموعة بياناتك الأولى.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2درب ACT أولاً، لأنه لا يمكن أن يكذب عليك
لا توجد أوزان مدربة مسبقًا، لذا إذا قام بالمهمة على الإطلاق، فإن مجموعة بياناتك تحتوي على المهمة. إذا توقف ACT عن العمل، قم بإصلاح البيانات. 1 إلى 3 USD، 2 إلى 5 ساعات على بطاقة 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3شغل SmolVLA على نفس مجموعة البيانات، دون تغيير
نفس البيانات، نفس الذراع، 450 مليون معلمة بدلاً من 80 مليون، بالإضافة إلى التكييف اللغوي. يضع LeRobot تشغيل 20 ألف خطوة في حوالي 4 ساعات على A100 واحد. هذا ما يخبرك ما إذا كان التدريب المسبق يجلب أي فائدة.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4قم بالتحويل إلى v2.1 قبل استخدام GR00T
يقرأ GR00T نسخة من تنسيق LeRobot v2 بالإضافة إلى ملف
meta/modality.jsonإضافي يوضح كيفية تقسيم مصفوفات الحالة والإجراءات المدمجة إلى حقول مسماة. تتسبب مجموعة بيانات v3.0 في تعطل هذا المحمل، لأن v3.0 يجمع العديد من الحلقات في ملفات مشتركة حيث كتب v2 حلقة واحدة لكل حلقة. يشحن Isaac-GR00T مساعد التخفيض كـscripts/lerobot_conversion/convert_v3_to_v2.py؛ صفحة رفض v3 هي المسار السريع.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5صعّد إلى GR00T N1.7 فقط إذا لم تحقق الخطوتان الأوليان النتائج المرجوة
من خلال واجهة سطر الأوامر الخاصة بـ NVIDIA، المعروضة هنا، أو نوع سياسة
grootالخاص بـ LeRobot. توصي NVIDIA بـ 40 GB أو أكثر من VRAM للضبط الدقيق، و 16 GB للاستدلال. عند حدوث OOM، انظر صفحة OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
طريقتان لتشغيل هذه الفحص الأولي
ثلاث بيئات، لأن سلاسل الأدوات لا تتعايش. LeRobot على الرئيسي هو 0.6.2 ويحتاج إلى Python 3.12 أو أحدث؛ Isaac-GR00T و openpi هما مستودعات منفصلة تدار بواسطة uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- يثبت GR00T
torchcodec0.8.0 كواجهة خلفية وحيدة للفيديو، ويحتاج إلى FFmpeg 4 إلى 7. FFmpeg 8 غير مدعوم، و AV1 غير مضمون. - حدود ذاكرة openpi: الاستدلال فوق 8 GB، LoRA فوق 22.5 GB، الضبط الدقيق الكامل فوق 70 GB. هذا الأخير هو السبب في أن Pi0.5 يتطلب A100.
- استأجر وحدة معالجة الرسوميات بنفسك، ودمرها بعد ذلك، وقم بتسوية ثلاث مجموعات من مسارات نقاط الفحص يدويًا.
نفس النماذج الخمسة، نموذج واحد. اختر النموذج ومجموعة البيانات والمعلمات الفائقة؛ تستأجر الواجهة الخلفية وحدة معالجة رسوميات بحجم VRAM المطلوب، وتشغل المدرب وتكتب إلى تخزين الكائنات.
- تتكون مصفوفة التدريب من خمسة نماذج بأربع أذرع، وكل خلية دليل: SmolVLA على SO-100، ACT على SO-101.
- يتم توفير وحدات الاستدلال تلقائيًا بواسطة
/api/inference/podمع مراقب خمول، لذلك لا يتم فوترة وحدة مهملة بصمت. - نقاط الفحص الأساسية هي خاصة بالبائعين:
nvidia/GR00T-N1.7-3B،nvidia/GR00T-N1.5-3B،lerobot/pi05_base. لا يوجد لدى ACT أي منها. - نفس العمليات من واجهة سطر الأوامر ومن وكلاء الذكاء الاصطناعي عبر خادم MCP.
- لا يوجد جهاز؟ الذراع المباشر يبث SO-100 ماديًا بدون تسجيل؛ صفحة التجربة تعرض طرق الدخول.
نموذج أساسي أو من الصفر
المفترق الحقيقي ليس في اختيار نموذج 3B. بل هو في ما إذا كان يجب استخدام VLA مدرب مسبقًا على الإطلاق، بالنظر إلى أن ACT تعلم ست مهام ثنائية اليد حقيقية من حوالي عشر دقائق من العروض التوضيحية لكل منها، بـ 80 مليون معلمة و لا شيء مدرب مسبقًا.
- تكييف اللغة. ACT لا يمتلك ذلك؛ نقطة تحقق واحدة لـ ACT تقوم بمهمة واحدة.
- أفضل على الكائنات الغائبة عن عروضك التوضيحية: على SO-101، 50% مقابل 40% لـ ACT خارج التوزيع.
- متعدد المهام على الإطلاق: SmolVLA يصل إلى 78.3% عبر ثلاث مهام SO-100 بنقطة تحقق واحدة؛ تم تشغيل ACT كمهام فردية فقط.
- تأخير يتراوح من 7.6x إلى 24x: من 152 إلى 485 مللي ثانية لكل خطوة عمل مقابل 20 مللي ثانية لـ ACT.
- من 4 إلى 12 دولارًا أمريكيًا لكل تشغيل بدلاً من 1 إلى 3، ومستوى A100 بدلاً من أي بطاقة 24 جيجابايت.
- التعرض للترخيص، بالإضافة إلى وضع فشل المستودع المقيد الذي لا يوجد من الصفر.
- يمكن للأوزان المدربة مسبقًا أن تخفي مجموعة بيانات سيئة. الضبط الدقيق الذي يعمل جزئيًا على بيانات معطلة يكلف أسبوعًا قبل أن تنظر إلى البيانات.
حالة إعادة إنتاج تشغيل قديم
مطاردة نقطة تحقق لعام 2025 تجعل اختيار النموذج لك وتحول المشكلة إلى تثبيت الإصدار: يرفض LeRobot الحالي N1.5، لذا تقوم بتثبيت lerobot==0.5.1. مع عدم وجود حقل بذرة وتفاوت بنسبة 5 إلى 6 بالمائة بين عمليات التشغيل، يكون الاستنساخ تقريبيًا بطبيعته. و تحتوي على جانب المنصة.

هل تقلصت الخيارات إلى اثنين؟ ACT ضد GR00T N1.7 وGR00T N1.7 ضد SmolVLA. توجد الصفوف الأولية في إدخالات الساحة: GR00T N1.7، Pi0.5، SmolVLA وACT.
المواضع التي لا تساعدك فيها هذه المنصة
- لا يمكنها تسريع الاستدلال عن بعد. الحلقة الزمنية من 20 إلى 485 مللي ثانية تخص النموذج؛ وتضاف إليها أوقات الذهاب والإياب عبر الإنترنت.
- لا يمكنها ضبط GR00T أو Pi0.5 بدقة على أجهزتك الخاصة. كلاهما متاحان عبر السحابة فقط هنا؛ فقط SmolVLA و ACT يعملان محليًا.
- لا يمكنها إصلاح مجموعة بيانات. انخفاض الخسارة ولكن السياسة لا تفعل شيئًا هي مشكلة بيانات، وسياسة تعمل في إعداد واحد فقط هي مشكلة تغطية.
- لا يمكنها جعل تشغيل GR00T قابلاً للتكرار: التكوين الأصلي لا يحتوي على حقل للبذرة (seed).
85 نموذجًا، 332 نتيجة معيارية، كل رقم مرتبط بمصدره
النسخة القابلة للفرز من الجداول في هذه الصفحة: 85 نموذج رؤية-لغة-فعل، 332 نتيجة معيارية، كل منها مرتبط بورقته البحثية أو بطاقة النموذج الخاصة به.
افتح الساحةاختيار واحد والمضي قدمًا
إعداد افتراضي واحد: سجل 50 حلقة، درب ACT مقابل 1 إلى 3 دولارات أمريكية لإثبات صلاحية مجموعة البيانات، ثم SmolVLA على نفس البيانات. بتكلفة أقل من 6 دولارات أمريكية معًا، يجيبان على السؤال المهم: هل يساعد التدريب المسبق هنا، أم هل تكمن المشكلة في البيانات. انتقل إلى GR00T N1.7 للمهام متعددة الخطوات الغنية بالاتصال، وإلى Pi0.5 عندما يتغير المشهد.
جولة في المنصة: تدريب سياستك الأولى، ثم تشغيل سياستك الأولى. تغطي وثائق التدريب و وثائق مجموعات البيانات الشكل والتنسيق؛ وتغطي صفحة SO-100 و الدليل الشامل لـ SO-100 التجميع والمعايرة. خلفية: نظرة عامة على VLA و مقالة Pi0 حول مطابقة التدفق. العنصر الذي سيرفع معدل نجاحك هو دليل جودة البيانات.
ما هي سياسة VLA التي يجب أن أدربها أولاً على SO-100؟▾
ACT، ثم SmolVLA. يدرب ACT من الصفر، لذلك لا يمكنه إخفاء مجموعة بيانات سيئة، وتكلفة التشغيل تتراوح من 1 إلى 3 USD على بطاقة 24 GB. إذا قام ACT بالمهمة على الإطلاق، فإن 4 إلى 12 USD لتشغيل GR00T N1.7 أو Pi0.5 لن تذهب سدى.
هل GR00T N1.7 أفضل حقًا من Pi0.5؟▾
على LIBERO، تقع ضمن نطاق الضوضاء: 97.0% عبر أربع مجموعات لـ GR00T N1.7، و 96.85% لـ Pi0.5 عند 30k خطوة في openpi، و 97.5% لمنفذ LeRobot، وكلها من أنظمة مختلفة. الفروقات الحقيقية هي 152 ms لكل خطوة عمل مقابل 485 ms، ومجموعات بيانات v2.1 مقابل v3.0، ودقة المعيار مقابل التعميم في العالم المفتوح.
هل يمكنني ضبط أي من هذه النماذج بدقة على بطاقة RTX 4090 واحدة؟▾
SmolVLA و ACT، نعم؛ كلاهما مدرج لبطاقة RTX 4090 أو أي بطاقة 24 GB ويعملان محليًا. يحتاج GR00T N1.7 و N1.5 و Pi0.5 إلى A100 أو H100 80 GB وهي سحابية فقط هنا. توصي NVIDIA بـ 40 GB أو أكثر للضبط الدقيق لـ GR00T؛ الحد الأدنى لـ openpi هو أكثر من 70 GB للضبط الدقيق الكامل لـ Pi0.5، و 22.5 GB لـ LoRA.
أي من هذه الخمسة يمكنني استخدامه تجاريًا؟▾
أوزان GR00T N1.7 تخضع لاتفاقية ترخيص نموذج NVIDIA المفتوح، والتي تنص البطاقة على أنها تغطي الاستخدام التجاري. أوزان N1.5 غير تجارية. كود SmolVLA هو Apache 2.0 في LeRobot، لكن بطاقة lerobot/smolvla_base لا تحتوي على حقل ترخيص، لذا فإن الأوزان غير مذكورة. ACT ليس لديه أوزان أساسية لترخيصها. Pi0.5 غامض: وثائق LeRobot تقول Apache 2.0، وبيانات تعريف بطاقته تقرأ license: gemma.
Sources
- مستودع NVIDIA Isaac-GR00T: حالة التوفر العام، التغييرات من N1.6 إلى N1.7، متطلبات الأجهزة، قيود torchcodec و FFmpeg، launch_finetune.py، تباين التشغيل بين المرات
- بطاقة نموذج nvidia/GR00T-N1.7-3B: بنية Cosmos-Reason2-2B الأساسية، 3 B معلمات، جدول توقيت الاستدلال، ترخيص نموذج NVIDIA المفتوح، حقل إصدار النموذج
- بطاقة نموذج nvidia/GR00T-N1.5-3B: مرجع Eagle 2، SigLip2 و T5، مطابقة التدفق DiT، ترخيص غير تجاري أحادي الاتجاه
- مثال Isaac-GR00T LIBERO: معدلات النجاح لكل مجموعة عند 20K خطوة وحجم دفعة 640، 200 تجربة لكل مجموعة
- مثال Isaac-GR00T SimplerEnv: معدلات نجاح Bridge و Fractal لكل مهمة، GR00T N1.6 مقابل N1.7
- pi0.5: نموذج رؤية-لغة-عمل مع تعميم عالمي مفتوح (2 B VLM بالإضافة إلى 300 M خبير عمل، تحكم 50 Hz، حوالي 400 ساعة من التلاعب المتنقل، دراسة توسيع النطاق على 3 إلى 104 مواقع)
- مستودع openpi: حدود ذاكرة GPU، نطاق رأس مطابقة التدفق فقط، ونتائج Pi0.5 LIBERO في examples/libero
- بطاقة نموذج lerobot/pi05_base: نطاق منفذ LeRobot، بيانات تعريف license: gemma، استخدام lerobot-train
- وثائق LeRobot pi0.5: مُرمز PaliGemma المُحكم، جدول استنساخ LIBERO، مصيدة n_action_steps الاحتياطية، بيان Apache 2.0
- SmolVLA: نموذج رؤية-لغة-عمل للروبوتات بأسعار معقولة وفعالة (450 M معلمات، جداول LIBERO و Meta-World، نتائج SO-100 و SO-101، استدلال غير متزامن)
- وثائق LeRobot SmolVLA: 50 حلقة عبر 5 مواضع مقابل 25، 20k خطوة في حوالي 4 ساعات على A100
- تعلم التلاعب الثنائي الدقيق باستخدام أجهزة منخفضة التكلفة (ACT و ALOHA): 6 مهام بنسبة 80-90 بالمائة، استئصال حجم الكتلة من k=1 إلى k=100
- LeRobot 0.6.2: الإعدادات الافتراضية لـ ACTConfig و SmolVLAConfig، البذرة الافتراضية 1000، --accelerator.gradient_accumulation.steps، متطلب Python 3.12، Apache 2.0
- وثائق LeRobot GR00T: نوع السياسة groot، إزالة دعم N1.5، تثبيت lerobot==0.5.1، مثال حجم الكتلة SO-101
- بطاقة نموذج lerobot/smolvla_base: نقطة التحقق الأساسية لـ SmolVLA المستخدمة بواسطة --policy.path، وبيانات تعريف بطاقتها، والتي لا تحتوي على حقل ترخيص
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started