
GR00T N1.7, Pi0.5, SmolVLA, ACT או GR00T N1.5? טבלת החלטות מותאמת למצבים אמיתיים, עם מספרי הביצועים המפורסמים, זמן השהיה, עלות לריצה ורישיונות מאחורי כל בחירה.
חמש מדיניות ניתנות לאימון על זרוע מסוג SO-100 כיום. הן נבדלות בפקטור של 24 ב-זמן אחזור (latency) של הסקה, 37 במספר הפרמטרים ו-12 בעלות הרצה, ובשאלת האם מותר לשלוח את התוצאה. חמישה כרטיסי מודל לא יפתרו את זה: אף אחד מהם לא עונה על השאלה שיש לכם, באיזה מהם כדאי להשתמש קודם?
כל מספר להלן נקרא מתוך המאמרים, המאגרים והכרטיסים באוגוסט 2026. מספרי הפלטפורמה מגיעים מ-קטלוג המדיניות של AY-Robots; היכן שהשניים חלוקים, שניהם מוצגים.
הגרסה הקצרה
- •אמן את ACT תחילה אם אתה מטיל ספק במערך הנתונים שלך: 1 עד 3 דולר להרצה, אין שום דבר שאומן מראש כדי לכסות על נתונים גרועים.
- •GR00T N1.7 ו-Pi0.5 נמצאים בטווח של חצי נקודה ב-LIBERO, 97.0 לעומת 96.85 עד 97.5. זו אינה סיבה לבחור באף אחד מהם.
- •Pi0.5 הוא הבחירה להכללה, לא לדיוק, והאיטי ביותר ב-485 ms.
- •SmolVLA, עם 450 מיליון פרמטרים, הוא ה-VLA היחיד כאן שניתן לכוונן על כרטיס אחד של 24 GB.
- •ACT ב-20 ms היא האפשרות היחידה לתנועה תגובתית מהירה. הרישיונות קובעים את השאר.
טבלת ההחלטות
| המצב שלך | אמן את זה | למה |
|---|---|---|
| איכות הנתונים לא הוכחה | ACT | שום דבר שאומן מראש לא מסתיר מערך נתונים שבור, וכשל עולה 1 עד 3 דולר. |
| עשיר במגע, רב-שלבי, מותנה שפה | GR00T N1.7 | 97.0% על פני ארבע חבילות LIBERO, בתוספת מרחב פעולה יחסי של קצה-מבצע. |
| תנועה תגובתית מהירה, הסקה בסרוואים | ACT | 20 אלפיות השנייה. הבא בתור המהיר ביותר איטי פי 7.6. |
| אובייקטים חדשים, סצנה חדשה, עולם פתוח | Pi0.5 | נבנה עבור התנהגות מחוץ להפצה, על פני עד 104 מיקומים. |
| כרטיס אחד של 24 ג'יגה-בייט, עדיין רוצה שפה | SmolVLA | 450 מיליון פרמטרים, רצפת 30 פרקים, פועל מקומית. |
| שחזור הרצה שתועדה ב-2025 | GR00T N1.5 | רק אם אתה חייב: LeRobot דוחה זאת כעת, משקלים לא מסחריים. |
| זה יישלח כמוצר | N1.7, SmolVLA or ACT | N1.5 אינו מסחרי, Pi0.5 נושא תנאי Gemma, הכרטיס של SmolVLA אינו מציין דבר. |
חמשת המועמדים
כל החמישה הם מדיניות: פריימים של מצלמה, מיקומי מפרקים ו, עבור ארבעה מהם, הוראת שפה, הממופה לגוש של יעדי מפרקים עתידיים. מה שמפריד ביניהם הוא כמה נלמד לפני שהגעת.
| מדיניות | פרמטרים | השהיה | רמת GPU | מקומי? | מינימום פרקים | פורמט | עלות |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | כרטיס 24 ג'יגה-בייט | כן | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | כרטיס 24 ג'יגה-בייט | כן | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 ג'יגה-בייט | לא | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 ג'יגה-בייט | לא | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 ג'יגה-בייט | לא | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
מודל ה-ראייה-שפה-פעולה של NVIDIA הנוכחי, כ-3 מיליארד פרמטרים, כ-40 מיליון אומנו במהלך כוונון עדין. המאגר מפרט את ההבדלים מ-N1.6: עמוד שדרה מדגם Eagle מסופק ל-Cosmos-Reason2-2B על Qwen3-VL, שכבות דיפוזיה 32 ל-16, מימדי מצב ופעולה 29 ל-132, אופק פעולה 16 ל-40.
מה שחשוב בזרוע קטנה הוא מרחב הפעולה היחסי של קצה המפעיל: N1.7 מנבא דלתות מה-תנוחה הנוכחית, וזה מה שמאפשר ל-20 אלף שעות של וידאו אנושי מ-EgoScale לעבור למדיניות רובוט. מפרט ב-דף N1.7, הליך ב-מדריך N1.7 על SO-100.
קובץ ה-README של Isaac-GR00T מצהיר על N1.7 כגרסת זמינות כללית, עם מדדי ביצוע ותמיכה מלאים. כרטיס ה-Hugging Face שלו עדיין לא התעדכן: שדה ה-Model Version עדיין מציג GR00T N1.7 EA. המאגר הוא המסמך העדכני יותר.
GR00T N1.5
אותו קנה מידה של 3B, עמוד שדרה Eagle 2, SigLip2 ו-T5, ראש DiT להתאמת זרימה. הוא קיים כדי להרחיב שכבר יש לכם. שני דברים הופכים אותו לברירת מחדל גרועה: המשקלים נושאים NVIDIA's one-way non-commercial licence, וגרסאות LeRobot הנוכחיות הסירו תמיכה ב-N1.5. ראו .
Pi0.5
VLA של Physical Intelligence, VLA, סוג מדיניות pi05. המאמר מציג VLM בגודל 2B שאותחל מ-PaliGemma בתוספת מומחה פעולה של 300M, המניע את הרובוט ב-50 הרץ; תצורת pi05 של LeRobot מוגדרת כברירת מחדל לגוש של 50 צעדים, שנייה אחת בקצב זה. נקודת המכירה היא מקומות בלתי נראים: כ-400 שעות של מניפולציה ניידת בבתים אמיתיים, ומחקר קנה מידה על פני 3, 12, 22, 53, 82 ו-104 מיקומים, כאשר המודל של 104 המיקומים תאם לבקרה שאומנה על הבתים הנבדקים עצמם.
מגבלה אחת, המצוינת בכרטיס ה-lerobot/pi05_base :הפורט נושא רק את ה-ראש פעולה תואם זרימה. חיזוי תת-משימות, טוקניזציית פעולות ו-RL לא שוחררו במעלה הזרם, ו-openpi אומרת את אותו הדבר לגבי המאגר שלה. עמוד ה-Pi0.5 ו-מדריך ה-Pi0.5 על SO-100 מכילים את השאר.
Pi0.5 דורש את הטוקנייזר המוגן `google/paligemma-3b-pt-224` (`gated: manual`, אם כי גוגל אומרת שבקשות מעובדות מיד). ללא קבלתו והרצת `hf auth login` בסביבת האימון, המשימה מתחילה, מורידה לזמן מה, ואז קורסת עקב שגיאת הרשאה שנראית כמו תקלת רשת. `nvidia/GR00T-N1.7-3B` אינו מוגן, אך עמוד השדרה שלו `nvidia/Cosmos-Reason2-2B` מוגן (`gated: auto`). נקה את שניהם לפני התור; אם הרצה יושבת ללא פעולה, עמוד התור התקוע מפרט מה לבדוק.
SmolVLA
450 מיליון פרמטרים, כ-100 מיליון במומחה הפעולה, על SmolVLM-2 כשה-VLM קפוא ורק 16 שכבות מודל השפה הראשונות שלו בשימוש. האימון המוקדם היה נתוני קהילה: 481 מערכי נתונים, 10.6 מיליון פריימים, מאותן זרועות זולות שבהן אתה משתמש. ה-VLA היחיד כאן שמתאים לכרטיס 24 GB אחד, והיחיד עם רצפת אפיזודה של 30. ראה עמוד ה-SmolVLA.
ACT
לא מודל יסוד. ה-Action Chunking Transformer מבית ALOHA הוא בעל כ-80 מיליון פרמטרים שאומן מאפס לכל משימה, על 50 הדגמות ב-50 הרץ. המאמר מדווח על שש משימות דו-ידניות אמיתיות מכעשר דקות של הדגמות כל אחת, ב-80 עד 90 אחוז על הדוגמאות שהוא מדגיש. הרעיון שלו, קיבוץ פעולות, נמצא בכל מודל בדף זה, והאבלציה שלו עדיין מודדת את האפקט בצורה הטובה ביותר: על פני שתי משימות מדומה עם temporal ensembling כבוי, ההצלחה עולה מ-1 אחוז ב-k=1 ל-44 אחוז ב-k=100. דף ה-ACT מכיל את השאר.
מה מדדי הביצועים באמת אומרים
LIBERO הוא מדד הביצועים היחיד ששלושה מתוך חמשת אלה מדווחים עליו: משימות מותנות שפה על Franka Panda מדומה, מחולקות לארבע הסוויטות שלהלן, עשר משימות בכל אחת. NVIDIA ביצעה 200 ניסויים לכל סוויטה.
| מודל | מרחבי | אובייקט | מטרה | 10 (ארוך) | ממוצע |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
כל מספר מגיע ממערכת בדיקה ותקציב שונים. GR00T רץ 20K צעדים עם גודל אצווה גלובלי של 640; הנתון של openpi הוא נקודת בדיקה של 30K; פורט LeRobot הוסיף 6K צעדים למודל בסיס LIBERO. SmolVLA הוא אי-התאמה נוספת: המאמר שלו מאמן את השורה הזו על LIBERO מאפס, ללא אימון מוקדם של VLA, בעוד ששלושת המודלים שמעליו מכווננים עדין נקודות בדיקה מאומנות מראש. התייחסו ל-96.85 עד 97.5 כאשכול אחד, ולפער ל-87.3% כאמיתי אך מושג עם פי 6.7 פרמטרים.
SimplerEnv מציג את הפיזור, מה ש-LIBERO אינו עושה. NVIDIA משווה את N1.7 מול N1.6, הדבר הציבורי הקרוב ביותר ל"פער דורי".
| חבילת SimplerEnv | ממוצע N1.6 | ממוצע N1.7 | השינוי הטוב ביותר | השינוי הגרוע ביותר |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
שורת Bridge היא השימושית: 5.7 נקודות בממוצע נצברו בעוד put_eggplant_in_basket הפסיד 36 ו-put_eggplant_in_sink ירד מ-33 ל-2. דור חדש מזיז את ההתפלגות במקום להרים אותה, כך שאם המשימה שלך נמצאת היכן ש-N1.7 נסוג, הממוצע לא אומר כלום.

מבין החמישה, רק המאמר של SmolVLA מדווח על זרוע מסוג SO-100: 78.3 אחוזים עבור SmolVLA ו-61.7 עבור Pi0 על פני שלוש משימות, שתיהן מרובות משימות, לעומת 48.3 עבור ACT שאומן למשימה יחידה, וזה לא השוואה הוגנת. ההתאמה הנקייה היא שניהם למשימה יחידה ב-SO-101 pick-and-place: 90 מול 70 בהתפלגות, 50 מול 40 מחוצה לה. השווה ב-ACT מול SmolVLA ו-Pi0.5 מול SmolVLA, או עיין ב-הזירה.
זמן השהיה ועלות קובעים את הפריסה
זמן השהיה של הסקה היא האילוץ שאנשים מגלים אחרון ומתחרטים עליו ראשון. מדיניות טובה בחמש נקודות במדד ביצועים אך חצי שנייה לכל שלב פעולה נראית גרוע יותר על שולחנך: דינמיקת מגע אינה ממתינה.
הערה אחת: הנתון של GR00T אינו תואם את כרטיס NVIDIA, אשר מודד 4 שלבי הסרת רעש ומצלמה אחת ב-85.8 אלפיות השנייה על H100 במצב eager, 48.6 אלפיות השנייה עם torch.compile, 27.9 אלפיות השנייה דרך TensorRT מלא. ה-152 אלפיות השנייה כאן הוא נתון של ערימה שלמה עם תקורה של שירות ויותר ממצלמה אחת, לא מעבר קדימה.
הלולאה של 20 עד 485 אלפיות השנייה שייכת למודל, ונסיעות הלוך ושוב באינטרנט הציבורי מוסיפות לכך. הסקה מרחוק אפשרית עבור פעולות איסוף והנחה איטיות, לא עבור תנועה תגובתית מהירה. אם המשימה שלך דורשת מהירות, ההסקה יושבת ליד הסרווים: ACT או SmolVLA, באופן מקומי. קשור: המדיניות קופאת באמצע תנועה.
דרך אחת לקנות זמן מבלי לשנות מודל: מאמר SmolVLA מודד ביצוע סינכרוני, כאשר המדיניות מסיימת מקטע לפני חיזוי הבא, לעומת אסינכרוני, כאשר החיזוי חופף לביצוע. ההצלחה דומה, 78.3 לעומת 73.3, אך אותה פעולת איסוף והנחה אורכת 9.7 שניות במקום 13.75, ובחלון קבוע הרובוט מבצע 19 מחזורים במקום 9.
רישיונות, נבדקו כי אף אחד לא בודק אותם
| מודל | רישיון משקלים | רישיון קוד | שימוש מסחרי |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; הכרטיס מאפשר שימוש מסחרי | Apache 2.0 | כן |
| GR00T N1.5 | רישיון חד-כיווני לא מסחרי של NVIDIA | Apache 2.0 | לא |
| Pi0.5 | pi05_base מטא-דאטה של כרטיס קורא רישיון: gemma | Apache 2.0 (openpi, LeRobot docs) | קרא את שניהם, הם חלוקים |
| SmolVLA | אין שדה רישיון בכרטיס ה-smolvla_base | Apache 2.0 (LeRobot) | קוד כן, משקלים לא מצוינים |
| ACT | אין משקלי בסיס קיימים | Apache 2.0 (LeRobot) | כן |
השורה של Pi0.5 דורשת תשומת לב. התיעוד של LeRobot pi05 מציין Apache 2.0 באופן עקבי עם openpi, בעוד שכרטיס ה-Hub עבור lerobot/pi05_base נושא license: gemma. שניהם פעילים. ל-GR00T N1.7 יש גרסה מתונה יותר: קובץ ה-README של Isaac-GR00T מציין דרך אגב ש-N1.7 ניתן לרישוי מסחרי מלא תחת Apache 2.0, בעוד שסעיף הרישיון שלו וכרטיס המודל מציבים את הקוד בלבד תחת Apache 2.0 ואת המשקלים תחת ה-NVIDIA Open Model License.
ברירות המחדל שתריץ בפועל
כל טופס אימון מגיע עם ברירת מחדל, והן אינן שרירותיות. אלו של ACT הן של LeRobot עצמה: אצווה 8, lr 1e-5, 100000 שלבי אימון, גודל חתיכה 100, תואם ל-ACTConfig במעלה הזרם ו-k=100 ממאמר ACT. עמודה אחת למטה היא מלכודת.
| מדיניות | אצווה | LR | מקסימום צעדים | צבירת גרדיאנט | חל? | כפתורים נוספים |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | כן | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | כן | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | לא (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | לא | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | לא | chunkSize, nActionSteps, seed, logFreq |
נקודת הכניסה לכוונון עדין של GR00T (launch_finetune.py, CLI של tyro) אינה כוללת שדה seed במחלקת הנתונים של התצורה שלה, ולכן הרצות אינן ניתנות לשחזור מדויק. המאגר גם מזהיר מפני שונות של 5 עד 6 אחוזים בין הרצות עקב הגדלות תמונה לא דטרמיניסטיות, שונות גדולה יותר מרוב פערי הביצועים הנידונים ברשת. ה-seed ברירת המחדל של LeRobot הוא 1000. עמודת צבירת הגרדיאנט מתארת את lerobot 0.5.1; גרסת 0.6.2 במעלה הזרם חושפת אותה כ---accelerator.gradient_accumulation.steps.
הכפתור שחשוב יותר מבחירת המודל
זהו מקטע הפעולה. מקטעים ארוכים יותר מספקים תנועה חלקה יותר ופחות שגיאות מצטברות, אך המדיניות מחויבת בזמן שהבלוק מבוצע, ולכן היא מגיבה באיחור לכל דבר שזז: בטוחה על קובייה סטטית, חסרת סיכוי על קובייה מתגלגלת. אם היא חורגת, קיצור החלק המבוצע עדיף על אימון מחדש והוא בחינם. מפרק שעוצר מוקדם הוא בעיה אחרת; ראה .
- ACT: ACTConfig ברירת המחדל היא
chunk_size 100ו-n_action_steps 100. איגום זמני כבוי ודורשn_action_steps 1. - GR00T N1.7: האופק הפנימי עבר מ-16 ל-40, אך הדוגמה SO-101 של LeRobot עדיין מריצה
--policy.chunk_size=16 --policy.n_action_steps=16. הדגל rollout שונה שמו ל---execution-horizon. - Pi0.5: מקטע של 50 צעדים, מתוכו מתכון LIBERO של LeRobot מבצע 10 באמצעות
--policy.n_action_steps=10; עם--policy.pretrained_pathהוא חוזר ל-50 אם תשמיט את הדגל. - SmolVLA: מקטעי פעולה של 50, שני הכפתורים חשופים.
איך לסנן את כל החמישה אחר הצהריים אחד
התשובה הזולה ביותר אינה קריאה נוספת. הוציאו כ-15 דולר ותנו לזרוע לומר לכם: הקליטו פעם אחת, אמן את המודל הזול תחילה, הסלם ברגע שהנתונים הוכחו תקינים. מבנה עדיף על נפח, זוהי הנקודה של ו-.
- 1הקלט 50 פרקים פעם אחת
חמישים מכין את הקרקע עבור GR00T, Pi0.5 ו-ACT, ועבור 30 של SmolVLA. חזור על כל וריאציה במקום להתפזר: 50 פרקים על פני 5 מיקומי קוביות שאומנו, כאשר 25 לא אומנו. ראה הקלט את מערך הנתונים הראשון שלך.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2אמן את ACT קודם, כי הוא לא יכול לשקר לך
אין משקולות מאומנות מראש, כך שאם הוא מבצע את המשימה בכלל, מערך הנתונים שלך מכיל את המשימה. אם ACT משתטח, תקן את הנתונים. 1 עד 3 דולר, 2 עד 5 שעות על כרטיס 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3הרץ את SmolVLA על אותו מערך נתונים, ללא שינוי
אותם נתונים, אותה זרוע, 450 מיליון פרמטרים במקום 80 מיליון, בתוספת התניה לשונית. LeRobot מריץ 20K צעדים בכ-4 שעות על A100 אחד. זה מה שאומר לך אם אימון מוקדם משיג משהו.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4המר לגרסה v2.1 לפני שאתה נוגע ב-GR00T
GR00T קורא גרסה של פורמט LeRobot v2 בתוספת קובץ
meta/modality.jsonנוסף הממפה כיצד מערכי מצב ופעולה משורשרים מתפצלים לשדות בעלי שמות. מערך נתונים בגרסה v3.0 קורס את הטוען הזה, מכיוון ש-v3.0 אורז פרקים רבים לקבצים משותפים בעוד ש-v2 כתב אחד לכל פרק. Isaac-GR00T מספק את כלי העזר לשדרוג לאחור כ-scripts/lerobot_conversion/convert_v3_to_v2.py; דף דחיית v3 הוא הנתיב המהיר.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5הסלם ל-GR00T N1.7 רק אם השניים הראשונים השאירו משהו על השולחן
באמצעות ה-CLI של NVIDIA, המוצג כאן, או סוג המדיניות
grootשל LeRobot. NVIDIA ממליצה על 40 GB או יותר של VRAM לכוונון עדין, 16 GB להסקה. במקרה של OOM, ראה דף ה-OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
שתי דרכים להריץ את מעבר הסינון הזה
שלוש סביבות, מכיוון ששרשרות הכלים אינן מתקיימות יחד. LeRobot בגרסה הראשית הוא 0.6.2 ודורש Python 3.12 או חדש יותר; Isaac-GR00T ו-openpi הם מאגרי uv-managed נפרדים.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T מקבע את
torchcodec0.8.0 כקצה האחורי היחיד שלו לווידאו, ודורש FFmpeg 4 עד 7. FFmpeg 8 אינו נתמך, AV1 אינו מובטח. - סף זיכרון של openpi: הסקה מעל 8 GB, LoRA מעל 22.5 GB, כוונון עדין מלא מעל 70 GB. האחרון הוא הסיבה ש-Pi0.5 היא משימת A100.
- שכור את ה-GPU בעצמך, השמד אותו לאחר מכן, ויישב שלושה סטים של נתיבי נקודות ביקורת ידנית.
אותם חמישה מודלים, טופס אחד. בחר מודל, מערך נתונים והיפרפרמטרים; הקצה האחורי שוכר GPU בגודל ה-VRAM הנדרש, מריץ את המאמן וכותב נקודות ביקורת לאחסון אובייקטים.
- מטריצת האימון היא חמישה מודלים על פני ארבע זרועות, כל תא הוא מדריך: SmolVLA על SO-100, ACT על SO-101.
- פודים להסקה מסופקים אוטומטית על ידי
/api/inference/podעם כלב שמירה סרק, כך שפוד שנשכח לא יחויב בשקט. - נקודות ביקורת בסיסיות הן של הספקים עצמם:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ל-ACT אין. - אותן פעולות מ-ה-CLI ומסוכני AI באמצעות שרת ה-MCP.
- אין חומרה? הזרוע החיה משדרת SO-100 פיזי ללא הרשמה; דף הניסיון מציג את דרכי הכניסה.
מודל יסוד או מאפס
ההתלבטות האמיתית אינה איזה מודל 3B לבחור. היא האם להשתמש ב-VLA מאומן מראש בכלל, בהתחשב בכך ש-ACT למד שש משימות דו-ידניות אמיתיות מכעשר דקות של הדגמות לכל אחת, עם 80 מיליון פרמטרים ו-שום דבר לא אומן מראש.
- התניה שפתית. ל-ACT אין; נקודת בקרה אחת של ACT מבצעת משימה אחת.
- טוב יותר על אובייקטים שנעדרים מההדגמות שלך: ב-SO-101, 50% לעומת 40% של ACT מחוץ להפצה.
- ריבוי משימות בכלל: SmolVLA מגיע ל-78.3% על פני שלוש משימות SO-100 עם נקודת בקרה אחת; ACT הופעל רק במשימה בודדת.
- פי 7.6 עד 24 יותר חביון: 152 עד 485 אלפיות השנייה לכל שלב פעולה לעומת 20 אלפיות השנייה של ACT.
- 4 עד 12 דולר ארה"ב לריצה במקום 1 עד 3, ורמת A100 במקום כל כרטיס 24 GB.
- חשיפה לרישיונות, בתוספת מצב כשל של מאגר סגור שאינו קיים מאפס.
- משקלים מאומנים מראש יכולים להסתיר מערך נתונים גרוע. כוונון עדין שעובד חצי דרך על נתונים שבורים עולה שבוע לפני שאתה מסתכל על הנתונים.
המקרה של שחזור ריצה ישנה
רדיפה אחר נקודת בקרה של 2025 קובעת עבורך את בחירת המודל והופכת את הבעיה לקיבוע גרסאות: LeRobot הנוכחי דוחה את N1.5, אז אתה מקבע את lerobot==0.5.1. ללא שדה seed ועם שונות של 5 עד 6 אחוזים בין ריצות, השחזור הוא מקורב מעצם טבעו. ו- מכילים את צד הפלטפורמה.

הצטמצם לשניים? ACT מול GR00T N1.7 ו-GR00T N1.7 מול SmolVLA. שורות גולמיות נמצאות בערכי הזירה: GR00T N1.7, Pi0.5, SmolVLA ו-ACT.
היכן פלטפורמה זו אינה עוזרת לך
- היא אינה יכולה להפוך הסקה מרוחקת למהירה. לולאת ה-20 עד 485 אלפיות השנייה שייכת למודל; נסיעות הלוך ושוב באינטרנט מוסיפות לכך.
- היא אינה יכולה לכוונן עדין את GR00T או Pi0.5 על החומרה שלך. שניהם זמינים רק בענן כאן; רק SmolVLA ו-ACT רצים מקומית.
- היא אינה יכולה לתקן מערך נתונים. ההפסד יורד אך המדיניות אינה עושה דבר היא בעיית נתונים, מדיניות שעובדת רק בהגדרה אחת היא בעיית כיסוי.
- היא אינה יכולה להפוך הרצות של GR00T לשחזוריות: לקונפיגורציה במעלה הזרם אין שדה seed.
85 מודלים, 332 תוצאות בנצ'מרק, כל מספר מקושר למקורו
הגרסה הניתנת למיון של הטבלאות בדף זה: 85 מודלים של ראייה-שפה-פעולה, 332 תוצאות בנצ'מרק, כל אחת מקושרת בחזרה למאמר או לכרטיס המודל שלה.
פתח את הזירהבוחרים אחד וממשיכים הלאה
ברירת מחדל אחת: הקלט 50 אפיזודות, אמן את ACT עבור 1 עד 3 דולר כדי להוכיח את הדאטה-סט, ואז את SmolVLA על האותם נתונים. יחד, בפחות מ-6 דולר, והם עונים על השאלה החשובה: האם אימון מקדים עוזר כאן, או האם צוואר הבקבוק הוא הנתונים. הסלם ל-GR00T N1.7 למשימות מרובות שלבים עשירות במגע, ל-Pi0.5 כאשר הסצנה משתנה.
סקירת פלטפורמה: אמן את המדיניות הראשונה שלך, ואז הרץ את המדיניות הראשונה שלך. התיעוד האימון ותיעוד הדאטה-סטים מכסים צורה ופורמט; דף ה-SO-100 והמדריך המלא ל-SO-100 מכסים בנייה וכיול. רקע: סקירת ה-VLA ומאמר התאמת הזרימה של Pi0. זה שישפר את שיעור ההצלחה שלך הוא מדריך איכות הנתונים.
באיזו מדיניות VLA כדאי לי לאמן קודם על SO-100?▾
ACT, ואז SmolVLA. ACT מתאמן מאפס, כך שהוא לא יכול למסך מערך נתונים גרוע, והרצה עולה 1 עד 3 USD על כרטיס 24 GB. אם ACT מבצע את המשימה בכלל, ה-4 עד 12 USD עבור הרצת GR00T N1.7 או Pi0.5 אינם מבוזבזים.
האם GR00T N1.7 באמת טוב יותר מ-Pi0.5?▾
ב-LIBERO הם בטווח הרעש: 97.0% על פני ארבע סוויטות עבור GR00T N1.7, 96.85% עבור Pi0.5 ב-30k צעדים ב-openpi, 97.5% עבור פורט LeRobot, כולם ממערכות שונות. ההבדלים האמיתיים הם 152 ms לכל צעד פעולה לעומת 485 ms, מערכי נתונים v2.1 לעומת v3.0, ודיוק בבנצ'מרק לעומת הכללה בעולם פתוח.
האם אני יכול לכוונן עדין (fine-tune) כל אחד מאלה על RTX 4090 יחיד?▾
SmolVLA ו-ACT, כן; שניהם מפורטים עבור RTX 4090 או כל כרטיס 24 GB ורצים מקומית. GR00T N1.7, N1.5 ו-Pi0.5 דורשים A100 או H100 80 GB וזמינים רק בענן כאן. NVIDIA ממליצה על 40 GB או יותר עבור כוונון עדין של GR00T; הרף התחתון של openpi הוא מעל 70 GB עבור כוונון עדין מלא של Pi0.5, ו-22.5 GB עבור LoRA.
באיזה מחמשת אלה אני יכול להשתמש מסחרית?▾
משקלי GR00T N1.7 נמצאים תחת הסכם הרישיון של מודל פתוח של NVIDIA, אשר הכרטיס מציין שהוא מכסה שימוש מסחרי. משקלי N1.5 אינם מסחריים. הקוד של SmolVLA הוא Apache 2.0 ב-LeRobot, אך כרטיס lerobot/smolvla_base אינו מכיל שדה רישיון, ולכן המשקלים אינם מצוינים. ל-ACT אין משקלי בסיס לרישוי. Pi0.5 מעורפל: התיעוד של LeRobot אומר Apache 2.0, מטא הנתונים של הכרטיס שלו מציינים license: gemma.
Sources
- מאגר NVIDIA Isaac-GR00T: סטטוס GA, שינויים מ-N1.6 ל-N1.7, דרישות חומרה, אילוצי torchcodec ו-FFmpeg, launch_finetune.py, שונות בין הרצות
- כרטיס מודל nvidia/GR00T-N1.7-3B: עמוד שדרה Cosmos-Reason2-2B, 3 B פרמטרים, טבלת זמני הסקה, רישיון מודל פתוח של NVIDIA, שדה Model Version
- כרטיס מודל nvidia/GR00T-N1.5-3B: הפניית Eagle 2, SigLip2 ו-T5, flow matching DiT, רישיון חד-כיווני לא מסחרי
- דוגמת Isaac-GR00T LIBERO: שיעורי הצלחה לכל סוויטה ב-20K צעדים וגודל אצווה 640, 200 ניסיונות לכל סוויטה
- דוגמת Isaac-GR00T SimplerEnv: שיעורי הצלחה למשימות Bridge ו-Fractal, GR00T N1.6 לעומת N1.7
- pi0.5: מודל ראייה-שפה-פעולה עם הכללה בעולם פתוח (2 B VLM בתוספת 300 M מומחה פעולה, בקרת 50 Hz, כ-400 שעות של מניפולציה ניידת, מחקר קנה מידה על פני 3 עד 104 מיקומים)
- מאגר openpi: רצפות זיכרון GPU, היקף flow-matching-head-only, ותוצאות Pi0.5 LIBERO ב-examples/libero
- כרטיס מודל lerobot/pi05_base: היקף פורט LeRobot, מטא נתונים license: gemma, שימוש ב-lerobot-train
- תיעוד LeRobot pi0.5: טוקנייזר PaliGemma מגודר, טבלת שחזור LIBERO, מלכודת חזרה n_action_steps, הצהרת Apache 2.0
- SmolVLA: מודל ראייה-שפה-פעולה לרובוטיקה במחיר סביר ויעילה (450 M פרמטרים, טבלאות LIBERO ו-Meta-World, תוצאות SO-100 ו-SO-101, הסקה אסינכרונית)
- תיעוד LeRobot SmolVLA: 50 אפיזודות על פני 5 עמדות לעומת 25, 20k צעדים בכ-4 שעות על A100
- למידת מניפולציה דו-ידנית עדינה עם חומרה בעלות נמוכה (ACT ו-ALOHA): 6 משימות ב-80-90 אחוז, אבלאציה של גודל חתיכה מ-k=1 ל-k=100
- LeRobot 0.6.2: ברירות מחדל של ACTConfig ו-SmolVLAConfig, seed ברירת מחדל 1000, --accelerator.gradient_accumulation.steps, דרישת Python 3.12, Apache 2.0
- תיעוד LeRobot GR00T: סוג מדיניות groot, תמיכה ב-N1.5 הוסרה, pin lerobot==0.5.1, דוגמת גודל חתיכה SO-101
- כרטיס מודל lerobot/smolvla_base: נקודת הבסיס של SmolVLA המשמשת את --policy.path, ומטא הנתונים של הכרטיס שלה, שאינו מכיל שדה רישיון
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started