אימון policy
AY-Robots מאמנת policy למניפולציה על GPU מנוהלים, כך שתוכלו לעבור מ-episodes מוקלטים ל-policy שרץ על הזרוע שלכם בלי להחזיק חומרת אימון משלכם. עמוד זה מכסה את סוגי ה-policy הנתמכים, עמוד ריצת האימון, checkpoints, ולאילו תוצאות כדאי לצפות בפועל בהתאם למספר ה-episodes שלכם.
עדכון אחרון 2026-08-09
אימון בלי GPU משלכם
אימון policy למניפולציה הוא עומס עבודה של GPU, ומודלי vision-language-action מודרניים זקוקים ליותר VRAM ממה שיש בתחנת עבודה טיפוסית. ב-AY-Robots האימון רץ על GPU בענן שמנוהלים על ידי הפלטפורמה: אתם בוחרים מערך נתונים וסוג policy, מתחילים את הריצה, וצופים בהתקדמות שלה מהדפדפן. אין הגדרת CUDA, אין התאמת דרייברים, ואין סביבה לתחזק.
הקלט הוא תמיד מערך נתונים בענן מ-Dashboard > Datasets. כל מה שהקלטתם דרך הפעלות תפעול מרחוק או העליתם בפורמט LeRobot כשיר, כולל מערכי נתונים ממוזגים. תחזקו לפני שאתם מאמנים: episodes מתויגים כ-Failure בדרך כלל שייכים מחוץ למערך האימון, ועשר דקות של סקירה בדפדפן ה-episodes חוסכות שעות של זמן GPU שמושקעות בלמידה מהדגמות גרועות.
policy נתמכים
ארבע משפחות policy נתמכות. הן נבדלות בגודל, בעלות אימון, ובכמה שהן יכולות לספוג מהנתונים שלכם, כך שהבחירה הנכונה תלויה במשימה ובמערך הנתונים שלכם יותר מאשר בכל דירוג כללי.
| policy | סוג | מאפיינים |
|---|---|---|
| ACT | Transformer, action chunking | חוזה נתחים קצרים של פעולות עתידיות במקום צעדים בודדים. קומפקטי, מתאמן במהירות יחסית, ובחירה ראשונה מוצקה למשימה אחת מוגדרת היטב. |
| Diffusion Policy | Diffusion על רצפי פעולות | מדגם את ההתפלגות המלאה של הפעולות המודגמות, מה שעוזר כשההדגמות שלכם פותרות את המשימה ביותר מדרך תקפה אחת. כבד יותר לאימון ואיטי יותר ב-inference מ-ACT. |
| SmolVLA | מודל vision-language-action קטן | מותנה-שפה: מחרוזת המשימה מה-episodes שלכם הופכת לחלק מהקלט. איזון טוב כשאתם רוצים התניית שפה בלי מודל foundation גדול. |
| fine-tune ל-GR00T | fine-tune של מודל foundation | עושה fine-tune למודל foundation גדול ומאומן מראש לרובוטיקה על ה-episodes שלכם. התקרה הגבוהה ביותר מבין הארבעה, בעלות האימון הגבוהה ביותר, ועם דרישת פורמט מערך נתונים מחמירה. |
ה-fine-tuning ל-GR00T מקבל רק מערכי נתונים בפורמט LeRobot גרסה 2.1. מערך נתונים v3.0 ייכשל במהלך טעינת הנתונים, לא בשליחה, אז בדקו את גרסת הפורמט לפני שאתם מתחילים את הריצה. מערכי נתונים שהוקלטו בפלטפורמה אפשר להשתמש בהם כמות שהם; עבור העלאות חיצוניות, ודאו את הגרסה תחילה ב-meta/info.json.
התחלת ריצה
- 1בחרו את מערך הנתונים
פתחו את Dashboard > Training ובחרו את מערך הנתונים לאימון עליו. ספירת ה-episodes וסוג הרובוט מוצגים כדי שתוכלו לאשר שבחרתם בנכון.
- 2בחרו את ה-policy
בחרו אחד מסוגי ה-policy הנתמכים. אם אתם לא בטוחים, התחילו עם ACT: זו הדרך הזולה ביותר לגלות אם מערך הנתונים שלכם טוב מספיק כדי לאמן עליו משהו בכלל.
- 3הפעילו
התחילו את הריצה. היא מקבלת job id ועמוד ריצה משלה, ואתם יכולים לסגור את הדפדפן: האימון ממשיך בצד השרת והעמוד מציג את המצב החי בכל פעם שתחזרו.
עמוד ריצת האימון
לכל ריצה יש עמוד ייעודי שעונה על שתי השאלות שבאמת יש לכם במהלך האימון: האם היא לומדת, והאם המכונה בריאה. התקדמות הלמידה מוצגת כגרפים של ה-loss, לוח הזמנים של קצב הלמידה, ונורמת הגרדיאנט. loss שמגיע ל-plateau מיד או נורמת גרדיאנט שמתפוצצת אומרים לכם מוקדם שהריצה לא שווה המתנה.
בריאות המכונה מוצגת לצד זה: ניצול זיכרון ה-GPU, בתוספת מדדי המארח של מכונת האימון. ציר זמן שלבים מציג איפה הריצה נמצאת כרגע, מהכנת הסביבה דרך טעינת הנתונים, לולאת האימון עצמה, והעלאת checkpoint. כשמשהו נראה לא בסדר, מציג היומן המובנה נותן לכם את יומני האימון הגולמיים בלי גישת SSH, מה שבדרך כלל מספיק כדי לראות אם כשל הוא של מערך הנתונים שלכם או של הריצה עצמה.
checkpoints וחידוש
checkpoints נשמרים לפי ריצה, לא במאגר משותף, כך שה-checkpoints המפורטים בעמוד ריצה תמיד שייכים בדיוק לאותה ריצה ולתצורה שלה. זה חשוב יותר ממה שזה נשמע: ערבוב checkpoints בין ריצות עם הגדרות שונות הוא מקור קלאסי ל-policy שנשברים בשקט.
אם ריצה נקטעת, תוכלו לחדש מה-checkpoint האחרון שלה במקום להתחיל מחדש. checkpoints ביניים שימושיים גם בפני עצמם: כשריצה ארוכה מתחילה overfitting לקראת הסוף, checkpoint מוקדם יותר לעיתים קרובות רץ טוב יותר על הזרוע האמיתית מהאחרון.
הרצת ה-policy המאומן על הזרוע שלכם
policy שהושלם אפשר לפרוס ישירות בחזרה על הרובוט שלכם. ב-cockpit, בחרו את ה-policy המאומן עבור הזרוע המחוברת שלכם והתחילו inference: ה-policy מייצר עכשיו את פקודות המפרקים שקודם לכן ייצרתם באמצעות תפעול מרחוק. הזרוע חייבת להיות מאותו סוג רובוט שעליו הוקלט מערך הנתונים, והסצנה צריכה להידמות לסצנות האימון, כולל מיקום המצלמה.
התייחסו לריצות ה-inference הראשונות כניסויים, לא כהדגמות. השאירו את עצירת החירום בהישג יד, התחילו ממצב התחלה קרוב למה שהדגמתם, וצפו שה-policy יהיה רגיש לדברים שלא הייתם שמים לב אליהם: מצלמה שהוזזה, תאורה שונה, או אובייקט שמערך הנתונים מעולם לא הכיל.
כמה episodes אתם צריכים
הטעות הנפוצה ביותר באימון בפלטפורמה היא לא היפר-פרמטר שגוי, אלא אימון על מעט מדי נתונים והמסקנה שסוג ה-policy לא עובד. ככלל אצבע למשימת שולחן בודדת: בערך 50 episodes נותנים לכם policy עם הכללה צרה שמצליח ממצבי התחלה קרובים לאלה שהדגמתם. בערך 100 עד 200 episodes נותנים חוסן שמיש על פני מרחב העבודה עבור אותה משימה בודדת, בתנאי שגיוונתם את מיקום האובייקטים בין episodes.
סוגי policy מתקדמים יותר לא מבטלים את זה. fine-tune ל-GR00T על 20 episodes עדיין יכליל בצורה גרועה; מה שהמודלים הגדולים יותר קונים לכם זה תקרה טובה יותר ברגע שהנתונים קיימים. אם התקציב שלכם מוגבל, הוציאו אותו על episodes מגוונים יותר לפני שאתם מוציאים אותו על מודל גדול יותר.
שאלות נפוצות
כמה זמן לוקחת ריצת אימון?▾
זה תלוי בסוג ה-policy ובגודל מערך הנתונים, אז אין מספר יחיד כן. ACT בדרך כלל המהיר מבין הארבעה, fine-tunes של GR00T הכי איטיים. ציר הזמן של השלבים וגרפי ה-loss בעמוד הריצה מראים מוקדם אם ריצה מתקדמת.
האם אני יכול לאמן על מערך נתונים ממוזג?▾
כן. מערכי נתונים ממוזגים הם מערכי נתונים רגילים; אימות המיזוג כבר הבטיח fps, תכונות, וסוג רובוט עקביים. מיזוג הקלטות של אותה משימה הוא אחת הדרכים היעילות ביותר להגיע לטווח של 100 עד 200 episodes.
ריצת ה-GR00T שלי נכשלת בטעינת הנתונים. מה כדאי לבדוק קודם?▾
את גרסת פורמט מערך הנתונים. ה-fine-tuning ל-GR00T דורש LeRobot v2.1, ומערך נתונים v3.0 נכשל בדיוק שם. בדקו את הגרסה ב-meta/info.json של מערך הנתונים שלכם.
האם עלי להסיר episodes שנכשלו לפני האימון?▾
לרוב כן. episodes מתויגים כ-Failure מלמדים את ה-policy את ההתנהגות הכושלת. episodes של Recovery שונים: הם מראים איך לתקן טעות ולעיתים קרובות שווה לשמור אותם.
האם עלי לשמור את הדפדפן פתוח במהלך האימון?▾
לא. ריצות מתבצעות בצד השרת. עמוד הריצה מציג את המצב הנוכחי, גרפים, ויומנים בכל פעם שתחזרו, ו-checkpoints נשמרים בלי קשר לכך שמישהו צופה.