טבלת השוואת המדיניות של AY-Robots המציגה את GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ו-ACT זה לצד זה עם ספירת פרמטרים, רמת GPU, זמן השהיה של הסקה ומספר פרקים מינימלי
מודלי-vlaאימון-מדיניותבחירת-מודלlerobotso-100

באיזו מדיניות VLA כדאי להתאמן ב-2026?

AY-Robots ResearchAugust 23, 202618 דקות קריאה

GR00T N1.7, Pi0.5, SmolVLA, ACT או GR00T N1.5? טבלת החלטות מותאמת למצבים אמיתיים, עם מספרי הביצועים המפורסמים, זמן השהיה, עלות לריצה ורישיונות מאחורי כל בחירה.

חמש מדיניות ניתנות לאימון על זרוע מסוג SO-100 כיום. הן נבדלות בפקטור של 24 ב-זמן אחזור (latency) של הסקה, 37 במספר הפרמטרים ו-12 בעלות הרצה, ובשאלת האם מותר לשלוח את התוצאה. חמישה כרטיסי מודל לא יפתרו את זה: אף אחד מהם לא עונה על השאלה שיש לכם, באיזה מהם כדאי להשתמש קודם?

כל מספר להלן נקרא מתוך המאמרים, המאגרים והכרטיסים באוגוסט 2026. מספרי הפלטפורמה מגיעים מ-קטלוג המדיניות של AY-Robots; היכן שהשניים חלוקים, שניהם מוצגים.

הגרסה הקצרה

  • אמן את ACT תחילה אם אתה מטיל ספק במערך הנתונים שלך: 1 עד 3 דולר להרצה, אין שום דבר שאומן מראש כדי לכסות על נתונים גרועים.
  • GR00T N1.7 ו-Pi0.5 נמצאים בטווח של חצי נקודה ב-LIBERO, 97.0 לעומת 96.85 עד 97.5. זו אינה סיבה לבחור באף אחד מהם.
  • Pi0.5 הוא הבחירה להכללה, לא לדיוק, והאיטי ביותר ב-485 ms.
  • SmolVLA, עם 450 מיליון פרמטרים, הוא ה-VLA היחיד כאן שניתן לכוונן על כרטיס אחד של 24 GB.
  • ACT ב-20 ms היא האפשרות היחידה לתנועה תגובתית מהירה. הרישיונות קובעים את השאר.

טבלת ההחלטות

המצב שלךאמן את זהלמה
איכות הנתונים לא הוכחהACTשום דבר שאומן מראש לא מסתיר מערך נתונים שבור, וכשל עולה 1 עד 3 דולר.
עשיר במגע, רב-שלבי, מותנה שפהGR00T N1.797.0% על פני ארבע חבילות LIBERO, בתוספת מרחב פעולה יחסי של קצה-מבצע.
תנועה תגובתית מהירה, הסקה בסרוואיםACT20 אלפיות השנייה. הבא בתור המהיר ביותר איטי פי 7.6.
אובייקטים חדשים, סצנה חדשה, עולם פתוחPi0.5נבנה עבור התנהגות מחוץ להפצה, על פני עד 104 מיקומים.
כרטיס אחד של 24 ג'יגה-בייט, עדיין רוצה שפהSmolVLA450 מיליון פרמטרים, רצפת 30 פרקים, פועל מקומית.
שחזור הרצה שתועדה ב-2025GR00T N1.5רק אם אתה חייב: LeRobot דוחה זאת כעת, משקלים לא מסחריים.
זה יישלח כמוצרN1.7, SmolVLA or ACTN1.5 אינו מסחרי, Pi0.5 נושא תנאי Gemma, הכרטיס של SmolVLA אינו מציין דבר.

חמשת המועמדים

כל החמישה הם מדיניות: פריימים של מצלמה, מיקומי מפרקים ו, עבור ארבעה מהם, הוראת שפה, הממופה לגוש של יעדי מפרקים עתידיים. מה שמפריד ביניהם הוא כמה נלמד לפני שהגעת.

מדיניותפרמטריםהשהיהרמת GPUמקומי?מינימום פרקיםפורמטעלות
ACT~80 M20 msכרטיס 24 ג'יגה-בייטכן50v3.01 to 3 USD
SmolVLA~450 M245 msכרטיס 24 ג'יגה-בייטכן30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 ג'יגה-בייטלא50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 ג'יגה-בייטלא50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 ג'יגה-בייטלא50v3.04 to 12 USD

GR00T N1.7

מודל ה-ראייה-שפה-פעולה של NVIDIA הנוכחי, כ-3 מיליארד פרמטרים, כ-40 מיליון אומנו במהלך כוונון עדין. המאגר מפרט את ההבדלים מ-N1.6: עמוד שדרה מדגם Eagle מסופק ל-Cosmos-Reason2-2B על Qwen3-VL, שכבות דיפוזיה 32 ל-16, מימדי מצב ופעולה 29 ל-132, אופק פעולה 16 ל-40.

מה שחשוב בזרוע קטנה הוא מרחב הפעולה היחסי של קצה המפעיל: N1.7 מנבא דלתות מה-תנוחה הנוכחית, וזה מה שמאפשר ל-20 אלף שעות של וידאו אנושי מ-EgoScale לעבור למדיניות רובוט. מפרט ב-דף N1.7, הליך ב-מדריך N1.7 על SO-100.

זמינות כללית במאגר, זמינות מוקדמת בכרטיס המודל

קובץ ה-README של Isaac-GR00T מצהיר על N1.7 כגרסת זמינות כללית, עם מדדי ביצוע ותמיכה מלאים. כרטיס ה-Hugging Face שלו עדיין לא התעדכן: שדה ה-Model Version עדיין מציג GR00T N1.7 EA. המאגר הוא המסמך העדכני יותר.

GR00T N1.5

אותו קנה מידה של 3B, עמוד שדרה Eagle 2, SigLip2 ו-T5, ראש DiT להתאמת זרימה. הוא קיים כדי להרחיב שכבר יש לכם. שני דברים הופכים אותו לברירת מחדל גרועה: המשקלים נושאים NVIDIA's one-way non-commercial licence, וגרסאות LeRobot הנוכחיות הסירו תמיכה ב-N1.5. ראו .

Pi0.5

VLA של Physical Intelligence, VLA, סוג מדיניות pi05. המאמר מציג VLM בגודל 2B שאותחל מ-PaliGemma בתוספת מומחה פעולה של 300M, המניע את הרובוט ב-50 הרץ; תצורת pi05 של LeRobot מוגדרת כברירת מחדל לגוש של 50 צעדים, שנייה אחת בקצב זה. נקודת המכירה היא מקומות בלתי נראים: כ-400 שעות של מניפולציה ניידת בבתים אמיתיים, ומחקר קנה מידה על פני 3, 12, 22, 53, 82 ו-104 מיקומים, כאשר המודל של 104 המיקומים תאם לבקרה שאומנה על הבתים הנבדקים עצמם.

מגבלה אחת, המצוינת בכרטיס ה-lerobot/pi05_base :הפורט נושא רק את ה-ראש פעולה תואם זרימה. חיזוי תת-משימות, טוקניזציית פעולות ו-RL לא שוחררו במעלה הזרם, ו-openpi אומרת את אותו הדבר לגבי המאגר שלה. עמוד ה-Pi0.5 ו-מדריך ה-Pi0.5 על SO-100 מכילים את השאר.

המלכודת שאוכלת אחר צהריים: מאגרים מוגנים

Pi0.5 דורש את הטוקנייזר המוגן `google/paligemma-3b-pt-224` (`gated: manual`, אם כי גוגל אומרת שבקשות מעובדות מיד). ללא קבלתו והרצת `hf auth login` בסביבת האימון, המשימה מתחילה, מורידה לזמן מה, ואז קורסת עקב שגיאת הרשאה שנראית כמו תקלת רשת. `nvidia/GR00T-N1.7-3B` אינו מוגן, אך עמוד השדרה שלו `nvidia/Cosmos-Reason2-2B` מוגן (`gated: auto`). נקה את שניהם לפני התור; אם הרצה יושבת ללא פעולה, עמוד התור התקוע מפרט מה לבדוק.

SmolVLA

450 מיליון פרמטרים, כ-100 מיליון במומחה הפעולה, על SmolVLM-2 כשה-VLM קפוא ורק 16 שכבות מודל השפה הראשונות שלו בשימוש. האימון המוקדם היה נתוני קהילה: 481 מערכי נתונים, 10.6 מיליון פריימים, מאותן זרועות זולות שבהן אתה משתמש. ה-VLA היחיד כאן שמתאים לכרטיס 24 GB אחד, והיחיד עם רצפת אפיזודה של 30. ראה עמוד ה-SmolVLA.

ACT

לא מודל יסוד. ה-Action Chunking Transformer מבית ALOHA הוא בעל כ-80 מיליון פרמטרים שאומן מאפס לכל משימה, על 50 הדגמות ב-50 הרץ. המאמר מדווח על שש משימות דו-ידניות אמיתיות מכעשר דקות של הדגמות כל אחת, ב-80 עד 90 אחוז על הדוגמאות שהוא מדגיש. הרעיון שלו, קיבוץ פעולות, נמצא בכל מודל בדף זה, והאבלציה שלו עדיין מודדת את האפקט בצורה הטובה ביותר: על פני שתי משימות מדומה עם temporal ensembling כבוי, ההצלחה עולה מ-1 אחוז ב-k=1 ל-44 אחוז ב-k=100. דף ה-ACT מכיל את השאר.

מה מדדי הביצועים באמת אומרים

LIBERO הוא מדד הביצועים היחיד ששלושה מתוך חמשת אלה מדווחים עליו: משימות מותנות שפה על Franka Panda מדומה, מחולקות לארבע הסוויטות שלהלן, עשר משימות בכל אחת. NVIDIA ביצעה 200 ניסויים לכל סוויטה.

מודלמרחביאובייקטמטרה10 (ארוך)ממוצע
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
שורות אלו אינן ניתנות להשוואה מדויקת

כל מספר מגיע ממערכת בדיקה ותקציב שונים. GR00T רץ 20K צעדים עם גודל אצווה גלובלי של 640; הנתון של openpi הוא נקודת בדיקה של 30K; פורט LeRobot הוסיף 6K צעדים למודל בסיס LIBERO. SmolVLA הוא אי-התאמה נוספת: המאמר שלו מאמן את השורה הזו על LIBERO מאפס, ללא אימון מוקדם של VLA, בעוד ששלושת המודלים שמעליו מכווננים עדין נקודות בדיקה מאומנות מראש. התייחסו ל-96.85 עד 97.5 כאשכול אחד, ולפער ל-87.3% כאמיתי אך מושג עם פי 6.7 פרמטרים.

SimplerEnv מציג את הפיזור, מה ש-LIBERO אינו עושה. NVIDIA משווה את N1.7 מול N1.6, הדבר הציבורי הקרוב ביותר ל"פער דורי".

חבילת SimplerEnvממוצע N1.6ממוצע N1.7השינוי הטוב ביותרהשינוי הגרוע ביותר
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

שורת Bridge היא השימושית: 5.7 נקודות בממוצע נצברו בעוד put_eggplant_in_basket הפסיד 36 ו-put_eggplant_in_sink ירד מ-33 ל-2. דור חדש מזיז את ההתפלגות במקום להרים אותה, כך שאם המשימה שלך נמצאת היכן ש-N1.7 נסוג, הממוצע לא אומר כלום.

לוח המובילים של AY-Robots בזירה, טבלה ניתנת למיון של 85 מודלי ראייה-שפה-פעולה עם 332 תוצאות בנצ'מרק, כל ערך מקושר למאמר או לכרטיס המודל שממנו הגיע
הזירה מכילה 85 מודלי VLA ו-332 תוצאות בנצ'מרק, כל אחת מקושרת בחזרה למאמר או לכרטיס המודל שלה. שימושי לבדיקה האם מספר המצוטט בפוסט בבלוג אמיתי.

מבין החמישה, רק המאמר של SmolVLA מדווח על זרוע מסוג SO-100: 78.3 אחוזים עבור SmolVLA ו-61.7 עבור Pi0 על פני שלוש משימות, שתיהן מרובות משימות, לעומת 48.3 עבור ACT שאומן למשימה יחידה, וזה לא השוואה הוגנת. ההתאמה הנקייה היא שניהם למשימה יחידה ב-SO-101 pick-and-place: 90 מול 70 בהתפלגות, 50 מול 40 מחוצה לה. השווה ב-ACT מול SmolVLA ו-Pi0.5 מול SmolVLA, או עיין ב-הזירה.

זמן השהיה ועלות קובעים את הפריסה

זמן השהיה של הסקה היא האילוץ שאנשים מגלים אחרון ומתחרטים עליו ראשון. מדיניות טובה בחמש נקודות במדד ביצועים אך חצי שנייה לכל שלב פעולה נראית גרוע יותר על שולחנך: דינמיקת מגע אינה ממתינה.

הערה אחת: הנתון של GR00T אינו תואם את כרטיס NVIDIA, אשר מודד 4 שלבי הסרת רעש ומצלמה אחת ב-85.8 אלפיות השנייה על H100 במצב eager, 48.6 אלפיות השנייה עם torch.compile, 27.9 אלפיות השנייה דרך TensorRT מלא. ה-152 אלפיות השנייה כאן הוא נתון של ערימה שלמה עם תקורה של שירות ויותר ממצלמה אחת, לא מעבר קדימה.

להסקה מרחוק יש תקרה קשיחה

הלולאה של 20 עד 485 אלפיות השנייה שייכת למודל, ונסיעות הלוך ושוב באינטרנט הציבורי מוסיפות לכך. הסקה מרחוק אפשרית עבור פעולות איסוף והנחה איטיות, לא עבור תנועה תגובתית מהירה. אם המשימה שלך דורשת מהירות, ההסקה יושבת ליד הסרווים: ACT או SmolVLA, באופן מקומי. קשור: המדיניות קופאת באמצע תנועה.

דרך אחת לקנות זמן מבלי לשנות מודל: מאמר SmolVLA מודד ביצוע סינכרוני, כאשר המדיניות מסיימת מקטע לפני חיזוי הבא, לעומת אסינכרוני, כאשר החיזוי חופף לביצוע. ההצלחה דומה, 78.3 לעומת 73.3, אך אותה פעולת איסוף והנחה אורכת 9.7 שניות במקום 13.75, ובחלון קבוע הרובוט מבצע 19 מחזורים במקום 9.

רישיונות, נבדקו כי אף אחד לא בודק אותם

מודלרישיון משקליםרישיון קודשימוש מסחרי
GR00T N1.7NVIDIA Open Model License; הכרטיס מאפשר שימוש מסחריApache 2.0כן
GR00T N1.5רישיון חד-כיווני לא מסחרי של NVIDIAApache 2.0לא
Pi0.5pi05_base מטא-דאטה של כרטיס קורא רישיון: gemmaApache 2.0 (openpi, LeRobot docs)קרא את שניהם, הם חלוקים
SmolVLAאין שדה רישיון בכרטיס ה-smolvla_baseApache 2.0 (LeRobot)קוד כן, משקלים לא מצוינים
ACTאין משקלי בסיס קיימיםApache 2.0 (LeRobot)כן

השורה של Pi0.5 דורשת תשומת לב. התיעוד של LeRobot pi05 מציין Apache 2.0 באופן עקבי עם openpi, בעוד שכרטיס ה-Hub עבור lerobot/pi05_base נושא license: gemma. שניהם פעילים. ל-GR00T N1.7 יש גרסה מתונה יותר: קובץ ה-README של Isaac-GR00T מציין דרך אגב ש-N1.7 ניתן לרישוי מסחרי מלא תחת Apache 2.0, בעוד שסעיף הרישיון שלו וכרטיס המודל מציבים את הקוד בלבד תחת Apache 2.0 ואת המשקלים תחת ה-NVIDIA Open Model License.

ברירות המחדל שתריץ בפועל

כל טופס אימון מגיע עם ברירת מחדל, והן אינן שרירותיות. אלו של ACT הן של LeRobot עצמה: אצווה 8, lr 1e-5, 100000 שלבי אימון, גודל חתיכה 100, תואם ל-ACTConfig במעלה הזרם ו-k=100 ממאמר ACT. עמודה אחת למטה היא מלכודת.

מדיניותאצווהLRמקסימום צעדיםצבירת גרדיאנטחל?כפתורים נוספים
GR00T N1.7321e-4200001כןsaveSteps
GR00T N1.511e-5200016כןsaveSteps
Pi0.515e-53000016לא (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008לאseed, logFreq
ACT81e-51000001לאchunkSize, nActionSteps, seed, logFreq
שחזוריות, נכון לאוגוסט 2026

נקודת הכניסה לכוונון עדין של GR00T (launch_finetune.py, CLI של tyro) אינה כוללת שדה seed במחלקת הנתונים של התצורה שלה, ולכן הרצות אינן ניתנות לשחזור מדויק. המאגר גם מזהיר מפני שונות של 5 עד 6 אחוזים בין הרצות עקב הגדלות תמונה לא דטרמיניסטיות, שונות גדולה יותר מרוב פערי הביצועים הנידונים ברשת. ה-seed ברירת המחדל של LeRobot הוא 1000. עמודת צבירת הגרדיאנט מתארת את lerobot 0.5.1; גרסת 0.6.2 במעלה הזרם חושפת אותה כ---accelerator.gradient_accumulation.steps.

הכפתור שחשוב יותר מבחירת המודל

זהו מקטע הפעולה. מקטעים ארוכים יותר מספקים תנועה חלקה יותר ופחות שגיאות מצטברות, אך המדיניות מחויבת בזמן שהבלוק מבוצע, ולכן היא מגיבה באיחור לכל דבר שזז: בטוחה על קובייה סטטית, חסרת סיכוי על קובייה מתגלגלת. אם היא חורגת, קיצור החלק המבוצע עדיף על אימון מחדש והוא בחינם. מפרק שעוצר מוקדם הוא בעיה אחרת; ראה .

  • ACT: ACTConfig ברירת המחדל היא chunk_size 100 ו-n_action_steps 100. איגום זמני כבוי ודורש n_action_steps 1.
  • GR00T N1.7: האופק הפנימי עבר מ-16 ל-40, אך הדוגמה SO-101 של LeRobot עדיין מריצה --policy.chunk_size=16 --policy.n_action_steps=16. הדגל rollout שונה שמו ל---execution-horizon.
  • Pi0.5: מקטע של 50 צעדים, מתוכו מתכון LIBERO של LeRobot מבצע 10 באמצעות --policy.n_action_steps=10; עם --policy.pretrained_path הוא חוזר ל-50 אם תשמיט את הדגל.
  • SmolVLA: מקטעי פעולה של 50, שני הכפתורים חשופים.

איך לסנן את כל החמישה אחר הצהריים אחד

התשובה הזולה ביותר אינה קריאה נוספת. הוציאו כ-15 דולר ותנו לזרוע לומר לכם: הקליטו פעם אחת, אמן את המודל הזול תחילה, הסלם ברגע שהנתונים הוכחו תקינים. מבנה עדיף על נפח, זוהי הנקודה של ו-.

  1. 1
    הקלט 50 פרקים פעם אחת

    חמישים מכין את הקרקע עבור GR00T, Pi0.5 ו-ACT, ועבור 30 של SmolVLA. חזור על כל וריאציה במקום להתפזר: 50 פרקים על פני 5 מיקומי קוביות שאומנו, כאשר 25 לא אומנו. ראה הקלט את מערך הנתונים הראשון שלך.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    אמן את ACT קודם, כי הוא לא יכול לשקר לך

    אין משקולות מאומנות מראש, כך שאם הוא מבצע את המשימה בכלל, מערך הנתונים שלך מכיל את המשימה. אם ACT משתטח, תקן את הנתונים. 1 עד 3 דולר, 2 עד 5 שעות על כרטיס 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    הרץ את SmolVLA על אותו מערך נתונים, ללא שינוי

    אותם נתונים, אותה זרוע, 450 מיליון פרמטרים במקום 80 מיליון, בתוספת התניה לשונית. LeRobot מריץ 20K צעדים בכ-4 שעות על A100 אחד. זה מה שאומר לך אם אימון מוקדם משיג משהו.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    המר לגרסה v2.1 לפני שאתה נוגע ב-GR00T

    GR00T קורא גרסה של פורמט LeRobot v2 בתוספת קובץ meta/modality.json נוסף הממפה כיצד מערכי מצב ופעולה משורשרים מתפצלים לשדות בעלי שמות. מערך נתונים בגרסה v3.0 קורס את הטוען הזה, מכיוון ש-v3.0 אורז פרקים רבים לקבצים משותפים בעוד ש-v2 כתב אחד לכל פרק. Isaac-GR00T מספק את כלי העזר לשדרוג לאחור כ-scripts/lerobot_conversion/convert_v3_to_v2.py; דף דחיית v3 הוא הנתיב המהיר.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    הסלם ל-GR00T N1.7 רק אם השניים הראשונים השאירו משהו על השולחן

    באמצעות ה-CLI של NVIDIA, המוצג כאן, או סוג המדיניות groot של LeRobot. NVIDIA ממליצה על 40 GB או יותר של VRAM לכוונון עדין, 16 GB להסקה. במקרה של OOM, ראה דף ה-OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

שתי דרכים להריץ את מעבר הסינון הזה

שלוש סביבות, מכיוון ששרשרות הכלים אינן מתקיימות יחד. LeRobot בגרסה הראשית הוא 0.6.2 ודורש Python 3.12 או חדש יותר; Isaac-GR00T ו-openpi הם מאגרי uv-managed נפרדים.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T מקבע את torchcodec 0.8.0 כקצה האחורי היחיד שלו לווידאו, ודורש FFmpeg 4 עד 7. FFmpeg 8 אינו נתמך, AV1 אינו מובטח.
  • סף זיכרון של openpi: הסקה מעל 8 GB, LoRA מעל 22.5 GB, כוונון עדין מלא מעל 70 GB. האחרון הוא הסיבה ש-Pi0.5 היא משימת A100.
  • שכור את ה-GPU בעצמך, השמד אותו לאחר מכן, ויישב שלושה סטים של נתיבי נקודות ביקורת ידנית.

מודל יסוד או מאפס

ההתלבטות האמיתית אינה איזה מודל 3B לבחור. היא האם להשתמש ב-VLA מאומן מראש בכלל, בהתחשב בכך ש-ACT למד שש משימות דו-ידניות אמיתיות מכעשר דקות של הדגמות לכל אחת, עם 80 מיליון פרמטרים ו-שום דבר לא אומן מראש.

כוונון עדין של VLA מאומן מראש במקום אימון ACT מאפס
מה אתה מרוויח
  • התניה שפתית. ל-ACT אין; נקודת בקרה אחת של ACT מבצעת משימה אחת.
  • טוב יותר על אובייקטים שנעדרים מההדגמות שלך: ב-SO-101, 50% לעומת 40% של ACT מחוץ להפצה.
  • ריבוי משימות בכלל: SmolVLA מגיע ל-78.3% על פני שלוש משימות SO-100 עם נקודת בקרה אחת; ACT הופעל רק במשימה בודדת.
מה זה עולה לך
  • פי 7.6 עד 24 יותר חביון: 152 עד 485 אלפיות השנייה לכל שלב פעולה לעומת 20 אלפיות השנייה של ACT.
  • 4 עד 12 דולר ארה"ב לריצה במקום 1 עד 3, ורמת A100 במקום כל כרטיס 24 GB.
  • חשיפה לרישיונות, בתוספת מצב כשל של מאגר סגור שאינו קיים מאפס.
  • משקלים מאומנים מראש יכולים להסתיר מערך נתונים גרוע. כוונון עדין שעובד חצי דרך על נתונים שבורים עולה שבוע לפני שאתה מסתכל על הנתונים.

המקרה של שחזור ריצה ישנה

רדיפה אחר נקודת בקרה של 2025 קובעת עבורך את בחירת המודל והופכת את הבעיה לקיבוע גרסאות: LeRobot הנוכחי דוחה את N1.5, אז אתה מקבע את lerobot==0.5.1. ללא שדה seed ועם שונות של 5 עד 6 אחוזים בין ריצות, השחזור הוא מקורב מעצם טבעו. ו- מכילים את צד הפלטפורמה.

עמוד ההשוואה ראש בראש של AY-Robots עבור GR00T N1.7 מול Pi0.5, המציג זה לצד זה ספירת פרמטרים, דרישות GPU, זמן אחזור הסקה, פורמט מערך נתונים ומספר פרקים מינימלי.
ראש בראש ב-/compare/groot-n1-7-vs-pi0-5. שני מודלי ה-3B נראים ניתנים להחלפה בגיליון מפרט, אך אינם כאלה: אחד דורש LeRobot v2.1, השני דורש v3.0.

הצטמצם לשניים? ACT מול GR00T N1.7 ו-GR00T N1.7 מול SmolVLA. שורות גולמיות נמצאות בערכי הזירה: GR00T N1.7, Pi0.5, SmolVLA ו-ACT.

היכן פלטפורמה זו אינה עוזרת לך

  • היא אינה יכולה להפוך הסקה מרוחקת למהירה. לולאת ה-20 עד 485 אלפיות השנייה שייכת למודל; נסיעות הלוך ושוב באינטרנט מוסיפות לכך.
  • היא אינה יכולה לכוונן עדין את GR00T או Pi0.5 על החומרה שלך. שניהם זמינים רק בענן כאן; רק SmolVLA ו-ACT רצים מקומית.
  • היא אינה יכולה לתקן מערך נתונים. ההפסד יורד אך המדיניות אינה עושה דבר היא בעיית נתונים, מדיניות שעובדת רק בהגדרה אחת היא בעיית כיסוי.
  • היא אינה יכולה להפוך הרצות של GR00T לשחזוריות: לקונפיגורציה במעלה הזרם אין שדה seed.

85 מודלים, 332 תוצאות בנצ'מרק, כל מספר מקושר למקורו

הגרסה הניתנת למיון של הטבלאות בדף זה: 85 מודלים של ראייה-שפה-פעולה, 332 תוצאות בנצ'מרק, כל אחת מקושרת בחזרה למאמר או לכרטיס המודל שלה.

פתח את הזירה

בוחרים אחד וממשיכים הלאה

ברירת מחדל אחת: הקלט 50 אפיזודות, אמן את ACT עבור 1 עד 3 דולר כדי להוכיח את הדאטה-סט, ואז את SmolVLA על האותם נתונים. יחד, בפחות מ-6 דולר, והם עונים על השאלה החשובה: האם אימון מקדים עוזר כאן, או האם צוואר הבקבוק הוא הנתונים. הסלם ל-GR00T N1.7 למשימות מרובות שלבים עשירות במגע, ל-Pi0.5 כאשר הסצנה משתנה.

סקירת פלטפורמה: אמן את המדיניות הראשונה שלך, ואז הרץ את המדיניות הראשונה שלך. התיעוד האימון ותיעוד הדאטה-סטים מכסים צורה ופורמט; דף ה-SO-100 והמדריך המלא ל-SO-100 מכסים בנייה וכיול. רקע: סקירת ה-VLA ומאמר התאמת הזרימה של Pi0. זה שישפר את שיעור ההצלחה שלך הוא מדריך איכות הנתונים.

באיזו מדיניות VLA כדאי לי לאמן קודם על SO-100?

ACT, ואז SmolVLA. ACT מתאמן מאפס, כך שהוא לא יכול למסך מערך נתונים גרוע, והרצה עולה 1 עד 3 USD על כרטיס 24 GB. אם ACT מבצע את המשימה בכלל, ה-4 עד 12 USD עבור הרצת GR00T N1.7 או Pi0.5 אינם מבוזבזים.

האם GR00T N1.7 באמת טוב יותר מ-Pi0.5?

ב-LIBERO הם בטווח הרעש: 97.0% על פני ארבע סוויטות עבור GR00T N1.7, 96.85% עבור Pi0.5 ב-30k צעדים ב-openpi, 97.5% עבור פורט LeRobot, כולם ממערכות שונות. ההבדלים האמיתיים הם 152 ms לכל צעד פעולה לעומת 485 ms, מערכי נתונים v2.1 לעומת v3.0, ודיוק בבנצ'מרק לעומת הכללה בעולם פתוח.

האם אני יכול לכוונן עדין (fine-tune) כל אחד מאלה על RTX 4090 יחיד?

SmolVLA ו-ACT, כן; שניהם מפורטים עבור RTX 4090 או כל כרטיס 24 GB ורצים מקומית. GR00T N1.7, N1.5 ו-Pi0.5 דורשים A100 או H100 80 GB וזמינים רק בענן כאן. NVIDIA ממליצה על 40 GB או יותר עבור כוונון עדין של GR00T; הרף התחתון של openpi הוא מעל 70 GB עבור כוונון עדין מלא של Pi0.5, ו-22.5 GB עבור LoRA.

באיזה מחמשת אלה אני יכול להשתמש מסחרית?

משקלי GR00T N1.7 נמצאים תחת הסכם הרישיון של מודל פתוח של NVIDIA, אשר הכרטיס מציין שהוא מכסה שימוש מסחרי. משקלי N1.5 אינם מסחריים. הקוד של SmolVLA הוא Apache 2.0 ב-LeRobot, אך כרטיס lerobot/smolvla_base אינו מכיל שדה רישיון, ולכן המשקלים אינם מצוינים. ל-ACT אין משקלי בסיס לרישוי. Pi0.5 מעורפל: התיעוד של LeRobot אומר Apache 2.0, מטא הנתונים של הכרטיס שלו מציינים license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started