
DAgger רגיל מבקש מאדם לתווג מצבים בזמן שהרובוט עדיין נוסע. בחומרה אמיתית זה לא בטוח וזה מייצר תוויות גרועות. הגרסאות הסגורות מחליפות תיוג עיוור בשער שמישהו צריך להחזיק: האדם בـ HG-DAgger, מסווג בטיחות בـ SafeDAgger, חילוקי דעות של ensemble בـ EnsembleDAgger, הערכה של חדשות וסיכון תקציבי בـ ThriftyDAgger. מאמר זה משווה אותם לפי מי הבעלים של השער, איזה אות פותח אותו, וכמה כל אחד עולה - ולמה הצורה בשער אנושי היא זו ששורדת קשר עם זרוע אמיתית.
מדיניות משוכפלת נכשלת כאשר נתוני ההדרכה שלה אזלו. הפיתרון הוא להמשיך לאסוף נתונים תחת התפלגות המצב של המדיניות עצמה במקום של המדגם, וזה מה ש DAgger עושה וההקדמה לצבירת מערכים מכסה מעקרונות ראשיים. זה משאיר פתוח את החלק המביך של האלגוריתם המקורי: בזמן שהלומד נוסע, המומחה אמור לומר מה הם היו עושים, לכל מצב, בלי להיות בשליטה.
בסימולטור עם מומחה כתוב זה בחינם. על שולחן עם זרוע אמיתית זה לא בחינם וגם לא בטוח. מחברי HG-DAgger מציינים את ההתנגדות בדיוק: תוכניות דגימה כאלו "דורשות מהמומחה לספק תוויות פעולה בלי שיהיה בשליטה מלאה של המערכת", אשר "יכולה להפחית בטיחות ו, כשמשתמשים באנושים כמומחים, כנראה תידרדר את איכות התוויות שנאספו בגלל latency מורגש" (Kelly et al., 2019). שני כישלונות מתחבאים במשפט הזה: המדיניות ממשיכה לנסוע למצבים שאף אחד לא רוצה בהם, והתוויות שנקנו בסיכון הזה גרועות יותר מאלו שאדם מייצר בזמן שהוא מחזיק בפקדים. כל גרסה למטה עונה על אותה שאלה - שימו שער על הבקרה ותנו למישהו להחליט מתי הוא נפתח. הם שונים בזה מי הוא המישהו.
הגרסה הקצרה
- •הגרסאות הסגורות מחליפות תיוג עיוור בעם בין בקרת מדיניות לבקרת מומחה. מה שמפריד ביניהם הוא מי הבעלים של העם.
- •HG-DAgger נותן את העם לאדם ומצבור רק נתונים שהוקלדו בזמן שהאדם היה בשליטה ללא הפרעה.
- •SafeDAgger נותן אותה למסווג בינארי המנבא סטיה מ policy ייחוס; EnsembleDAgger דורש variance נמוך של ensemble ומרחק קטן לפעולת המומחה בו זמנית.
- •LazyDAgger מוסיף hysteresis כך שהבקרה לא משתנה עם תנודות; ThriftyDAgger שוער על חדשות או סיכון משוער תחת תקציב התערבות מפורש.
- •אות סגור רובוט צריך משהו שמודל VLA עדין על זרוע בדרגה חובי בדרך כלל חסר: policy ייחוס, ensemble זול, או uncertainty epistemuc כיול.
- •השער הוא מחצית מהשיטה. מה שקורה לקטעי ההתערבות אח"כ - ערבוב, עיצוב משקל, צבירה - קובע האם הסיבוב שיפר משהו.
אנושי-סגור וסגור-רובוט: ההבדל שחשוב
Interactive imitation learning יש סקירה משלו; Celemin וקולגות קטלוג זה לצד סוג משוב, ממשק, מודל למידה, חוויית משתמש, יישום וקבוצה השוואה. ההבחנה שקובעת את ההנדסה שלך היא פשוט יותר מאי אחד מהצירים האלה, והעבודה האחרונה מכנה את זה ישירות: שיטה היא אנושי-סגור כאשר המפקח מחליט מתי להתערב, ו רובוט-סגור כאשר הסוכן מחליט מתי לבקש עזרה (Cai et al., 2025). כל שאר זה מכונות המשרתות בחירה אחת מהשתיים. הסחר נראה מהתחילה: שער אנושי עולה תשומת לב מתמשכת, ו gate רובוט מבטיח להחזיר את התשומת לב הזו - אך רק אם האות שהוא שוער בו אמין, וכנסה את האות הזה היא בעיית מחקר משלה.
SafeDAgger: מסווג המנבא סטיה משלו
SafeDAgger של Zhang ו Cho (2016) היא השער הקדום ביותר של האלה. שאילת השאלה של policy ייחוס היא החלק היקר, כך רשת שנייה, קטנה - ה safety policy - חוזה אם שאילת הפניות הן כדאיות בכלל. זה "מחזיר תווית בינארית המציינת האם ה primary policy כנראה תסטה מ policy ייחוס בלי שאילת הפניות". התווית מוגדרת כנגד סטיית L2 בריבוע בין פעולות שתי המדיניות עם threshold tau, והמסווג מתורגל עם binary cross-entropy. בזמן run הוא מחליט לכל מצב אם הלומד ממשיך לנסוע או ה reference לוקח על עצמו. ה abstract דיווחים שאילות ייחוס פחות בדולי מכונית מרוצים בתוספת acceleration מהירות התכנסות המחברים מייחסים לאפקט Curriculum אוטומטי, בלי לתת דמות לא אחד.
ה catch הוא בהגדרה, לא בתוצאות. הדרכת המסווג דורשת הפעולה של policy ייחוס בכל מצב משמש להתאמה, אשר מניח ש ייחוס הוא תוכנית אחרת. אם ה reference שלך היא אדם עם זרוע מנהיגה, קבוצה התווית הזו לא זול והשיטה מאבדת את הנכס שהוא עוצב עבור.
EnsembleDAgger: ספק וחילוקי דעות, שניהם
Menda, Driggs-Campbell ו Kochenderfer (2019) מתייחסים לשער כשאלה probabilistic. EnsembleDAgger "משוער Gaussian Process באמצעות ensemble של neural networks" וקורא ensemble variance כתוקף בטחון proxy: variance גבוה פירושו אזור בניגוד לנתוני הדרכה, אשר - בהנחה שהמומחה נמנע מן מצבי כישלון - קשור עם קרבה לכשל. הכלל הוא conjunction. ה learner עשוי לפעול רק כאשר מרחק L2 בין הפעולה הממוצעת שלו לפעולת המומחה נשאר מתחת לסף אחד (discrepancy) ו ה variance של הפעולה צפויה שלו נשאר מתחת לשני (doubt). אם כל שניים נכשל, המומחה לוקח בקרה. המטרה היא למקסם את חלק ה learner של פעולות בעת הגבלת ההסתברות של כשל; ה paper דיווחים בטיחות משופרת ו learning כנגד DAgger variants אחרים בתנד הפוך ו MuJoCo HalfCheetah.
זה בשקט מחייב את הכלל המלא ל hands-off supervision. המרחק בין הפעולה של ה learner לפעולת ה expert דורש הפעולה של ה expert בתוך המצב, ברגע. עם expert מסופי, בסדר. עם אדם, האדם חייב לייצר פעולות ברציפות - בדיוק ה burden שה gated variants היו הוא הועצ להסיר. ה doubt term לבדו הוא hands-off; ה conjunction הוא לא.
LazyDAgger: עצור את העם מתנודדות
Hoque ו colleagues (2021) התקפו עלות שה papers מוקדם לא מדדו: ה switch עצמו. כל intervention "מפריע לעבודה אחרת האדם עושה, incurs latency עם כל context switch בין supervisor ו autonomous control, ודורש זמן לביצוע". שער שנפתח ונסגר עשר פעמים בדקה הוא גרוע יותר מאחד הנפתח פעם עשר שניות, בחלק autonomous זהה. LazyDAgger מרחיב SafeDAgger עם asymmetric thresholds - קשה יותר להיכנס supervisor בקרה מאשר להישאר בה - כך המערכת לא מתנודדת בגבול. בסימולציה הוא "יכול להפחית context switches בממוצע של 60% מעל SafeDAgger על 3 משימות continuous control בזמן שיצורי state-of-the-art policy performance"; בערמות fabric עם ABB YuMi הוא "מפחית context switches על ידי 60% בזמן שהשגת 60% גבוה יותר success rate מאשר SafeDAgger בזמן ביצוע".
ThriftyDAgger: חדשות או סיכון, תחת תקציב
ThriftyDAgger (Hoque et al., CoRL 2021) מתחיל מה budget של ה supervisor ולא ה policy. זה "משתמשים בולקה הנלמדה להבקשת התערבויות רק בתוך מצבים שהם סביר להיות (1) חדשני, כאשר ה robot policy יש לא reference התנהגות להעתקה, או (2) risky, כאשר ה robot יש confidence נמוך בשלמות משימה", עם metric חדש ל estimating סיכון זה. ה budget הוא input, לא outcome: הוא מדינה כמה זמן אנושי הוא תבחר להשקיע. יישום ב execution time ה method "משיגה 100% success rate על שניהם simulation ו physical משימות", וכן user study עם עשרה משתתפים שליטה בשלוש-רובוט fleet לצד concentration משימה דיווחים שהוא "מגביר אנושי ו robot performance על ידי 58% ו 80% בהתאמה בהשוואה ל next best algorithm בזמן שמפחית supervisor burden". ה fleet setting היא הבית הטבעי עבור עבודה זו; Fleet-DAgger מאוחר יותר formalised interactive fleet learning עם מספר רובוט ו supervisors, proposing Return on Human Effort כמו כמותי ל optimize.
HG-DAgger: האדם מחזיק את השער
Kelly et al. (2019) לך את הדרך השנייה. יש לא switching policy. ה learner הוא rolled out "עד ה expert צופה בתוך ה novice זה נכנס unsafe region של ה state space", כך ה expert לוקח בקרה ו guides ה system בחזרה. ה aggregation כלל הוא ה strict חלק: "Expert פעולה תוויות הם רק אספו ו הוסף ל ה dataset בזמן אלה recovery trajectories, במהלך אשר ה human expert יש uninterrupted בקרה של ה system." כלום הוא תווית בזמן ה human הוא spectator.
זה עושה לא עצור בתוך ה switch. HG-DAgger גם "learns safety threshold עבור model-uncertainty-based סיכון metric שיכול להיות משמש ל predict ה ביצוע של ה fully qualified novice בתוך region שונות של ה state space": זה רשומות איך uncertain ה learner היה בתוך ה רגעים ה human התערב ו averages ה last רבע של אלה records, כאשר ה learner הוא הדומה ביותר ל ה final צורה. זה לא שער ה robot מפעיל אלא diagnostic אמירה אתה כאשר ה סיים policy הוא צפוי ל hold. ה הערכה מכסה simulated ו real-world נהיגה משימה ו דיווחים משופר ביצוע מעל שניהם DAgger ו behavior cloning.
קו קשור אחד שינויים מה ספירה כמו תווית. Spencer ו colleagues' Expert Intervention Learning מחזיקות בתוך "any כמות של expert משוב, בין ע"י intervention או non-intervention, מספק מידע אודות איכות של ה current state, ה optimality של ה פעולה, או שניהם", formalised כ constraint בתוך ה learner של value function ו handled עם no-regret online learning. תחת כי קריאה, ה stretches כאשר ה human שומר ו עשה כלום הם weak חיובי ראיות ולא ריק. EIL learns collision avoidance מ בערך דקה אחת של expert בקרה.

ה variants זה לצד זה
| שיטה | מי פותח את השער | אות | צרכים זמינים | Reported |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | אף אחד — ה learner תמיד נוסע | כלום; ה expert תוויות כל בקרו state | expert אפשר ל תווית off-policy מצבים בזמן לא בתוך בקרה | כלום-regret הפחתה עם guarantees תחת ה learner של state הפצה |
| HG-DAgger (Kelly et al., 2019) | ה human supervisor | ה supervisor של judgement בתוך ה state הוא unsafe | מישהו צופה, ו clean handover של בקרה | Beats DAgger ו behavior cloning בתוך simulated ו real נהיגה משימה; גם learns סיכון threshold |
| SafeDAgger (Zhang & Cho, 2016) | ה robot | Binary classifier ל L2 סטיה מ ה reference מעל tau | queryable reference policy עבור ה classifier של תוויות | פחות reference שאילות בתוך racing סימולטור, faster התכנסות (כלום דמות נתון) |
| EnsembleDAgger (Menda et al., 2019) | ה robot | Ensemble variance ו מרחק ל ה expert פעולה, שניהם תחת threshold | ensemble של networks בתוספת ה expert של הפעולה בתוך כל צעד | משופר בטיחות ו learning ב pendulum ו HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | ה robot, עם hysteresis | SafeDAgger של אות עם נפרד כניסה ו יציאה thresholds | מה SafeDAgger צרכים, בתוספת שני threshold ל tune | ~60% פחות context switches בתוך 3 משימות; 60% גבוה יותר הצלחה ב YuMi fabric |
| ThriftyDAgger (Hoque et al., 2021) | ה robot, תחת תקציב | Novelty, או משוער סיכון של לא משלים ה משימה | Learned סיכון estimator ו מדינה התערבות תקציב | 100% הצלחה ב execution זמן; user study (N=10): 58% ו 80% gains מעל next-best |
| EIL (Spencer et al., 2020) | ה human - non-intervention הספירה גם | Intervention ו של הגיוני כ constraints בתוך ה value function | Online כלום-regret learning מעל value constraint | Collision avoidance מ בערך דקה אחת של expert בקרה |
מה כל gate קניות, ו מה זה charges
קרא מטה ה "צרכים" column ו pattern נופל החוצה: כל robot-gated אות יש proxy בו חייב להיות manufactured, ו כל proxy יש שלו דמות.
- Discrepancy אות (SafeDAgger, LazyDAgger, חצי של EnsembleDAgger של כלל) צרכים reference policy. כן או יש שלך scripted expert, בתוך אשר ה מעניין בעיה הוא כבר פתר, או human שמור ייצור פעולות בתוך ה רקע כך מרחק יכול להיות מחושב.
- Doubt אות צרכים כיול epistemuc uncertainty. ensemble של קטן בקרה networks approximates זה; ensemble של שלוש-billion-parameter vision-language-action דגם הוא זיכרון ו latency בעיה ראשון.
- Novelty ו סיכון אות צרכים learned estimator של משימה השלמה, התאמו בתוך מספיק הצלחה ו נכשל rollouts. בתוך משימה אתה הוא עדיין קבלה ל עבודה, כי נתונים לא קיים בתוך סיבוב אחד.
- ה human gate צרכים תשומת לב ו כלום אחרות — ה בלבד אות זמין בתוך יום אחד, בתוך כל policy ארכיטקטורה, עם כלום extra דגם ל train.
- כלום robot gate מסיר ה human מ ה חדר. הם מצמצם כמה זמן אנשי ה human חייב לפעול, לא בתוך הם חייב להיות נוכח.
יש quieter ההבדל בתוך מה ה gate מייצר. robot gate יורי mid-trajectory ידות אדם moving זרוע בתוך arbitrary pose. human gate קופצים ה operator pick ה רגע — אחרי ה הגעה, לפני ה grasp, לא halfway דרך swing. ה recovery segments מ ה שניים אינם equally נקי, ו אלה segments היא ה כלל תוצר של ה סיבוב.
למה ה human-gated צורה wins בתוך real חומרה
זה engineering טענה, לא benchmark תוצאה — כלום נייר אנחן מצא runs כל חמש gates בתוך אותו manipulator עם אותו policy class. זה נשענות בתוך ארבע נקודות.
ראשון, ה supervisor הוא שם בכל זאת. אחד לא עזיבה SO-100 זרוע רץ unattended לצד של אובייקטים זה יכול ל knock מעל. אחת מישהו הוא צופה, ה marginal עלות של תן להם takeover כפתור הוא קרוב אפס; בנייה calibrated סיכון estimator היא פרויקט.
שני, ה uncertainty אתה יכול באמת למדוד בתוך modern policy זה בדרך כלל ה wrong כמות. diffusion או flow-matching ראש מייצר variance בתוך sampled פעולה chunks, ו זה variance משקף ה multimodality ה ראש היה qualified ל ייצג, לא epistemuc ignorance בערך ה state. EnsembleDAgger של doubt לבעיה uses ensemble בדיוק ל לכוד ה latter. ה שניים לפי כמו אותו מספר ו הם לא; ה פעולה chunking ו flow matching entries כסות איך אלה ראשים emit פעולות בתוך ה ראשון מקום.
שלישי, ה כישלונות זה חשוב בתוך manipulation הם בדרך כלל semantic ולא statistically דוסקטואלי. policy סגירה ה gripper שני centimetres מוקדם, או הגעה confidently עבור ה wrong אחד של שניים זהה cubes, הוא לא בתוך high-variance state — זה הוא confident ו wrong. כלום variance threshold תופס זה; אדם צופה תופס זה תיכף.
רביעי, תווית איכות — ה מקורי HG-DAgger נקודה, ו ה אחד הכי ברדע skipped. תוויות אספו בזמן ה human יש uninterrupted בקרה להכות תוויות narrated מעל moving מערכת. אם ה מטרה היא corrective נתונים שווה aggregating, ה burden של ראיה שוכן עם ה automated gate.
ה תמונה flips כאשר אחד supervisor הוא אחראי עבור רבים רובוט — ה regime ThriftyDAgger של user study ו Fleet-DAgger של formalisation target. עם fleet, human תשומת לב הוא ה scarce משאב ו imperfect הקצאה חובים כלום. עם אחד זרוע בתוך אחד שולחן אתה הוא לא בתוך כי regime.
ה human-סגור לולאה, כבר wired עד
Takeover במהלך running inference הפעלה, per-frame intervention flags בתוך ה corrected segments, curating כל רץ לתוך corrections או הערכה, composing mixed מערכים מ sources אתה בחר, ו הנמשך הדרכה מ קיים checkpoint הוא בנוי בתוך ולא scripted ב יד. Takeover עבודות עם leader זרוע, או עם keyboard ו sliders אם אתה לא יש אחד.
ראה איך ה DAgger לולאה runsה gate הוא מחצית ה שיטה; נתונים טיפול הוא ה אחר מחצית
gate מחליט אשר frames human נוסע, לא מה ל לעשות עם הם, ו כי שני החלטה הוא כאשר rounds הם הכי כול זבל. ה ראשון כלל הוא ה אחד ה D בתוך DAgger עמדות עבור: צבירה, לעשות לא החלפה. Fine-tuning checkpoint בנקצוביית על כמה מאות correction frames נותן לך דגם זה יש רואה כמעט כלום אבל recoveries ו יש שכח ה nominal trajectory.
ה שני כלל הוא בתוך intervention frames הם לא רגיל frames. Mandlekar et al. בנוי remote-teleoperation מערכת עבור 6-DoF manipulation עזור operators מופקח חוקים ו קח מעל ב כישלון, לאחר מכן qualified iteratively עם אלגוריתם כי "encourages ה policy ל learn איך ל traverse병목-necks דרך ה interventions"; סוכנים qualified בתוך כי נתונים outperformed סוכנים qualified בתוך שווה כמות של רגיל הדגמה דוגמות. Sirius דחפים ה ייעוד לתוך פריסה, "re-weighing הדרכה דוגמות עם approximated human אמון ו optimizing ה חוקים עם weighted behavioral cloning". שניהם צרכים per-frame סימן של מה היה human-נוסע, אשר הוא למה ה התערבות flag חשוב יותר מ זה לפי.
ה שלישי כלל הוא אשר אוטומטי ערבוב הוא טלה. composed מערכים אשר sources אתה לא יכול ל enumerate הוא אחד אתה לא יכול ל debug כאשר ה הבא סיבוב נוסע גרוע. בתוך זה פלטפורמה ה compose צעד הוא explicit עבור זה סיבה — מקורי מערכים בתוספת corrections, קוד בחירה לכל קוד, ו ה תוצאה הוא רגיל LeRobot מערכים כי syncs ו trains כמו כל אחר; ה מערכים תיעוד covers ה format צד.
| צעד בתוך סיבוב | מה זה מייצר | הכי שכיח דרך זה לך wrong |
|---|---|---|
| Run inference עם הקלטה בתוך | רץ תחת ה policy של מצב הפצה | Recorded כמו כלום teleoperation, מפסיד כי policy היה נוסע |
| קח מעל ב כישלון | Correction segments עם per-frame intervention flag | Correcting קוסמטי wobble, הדרכה סגנון ולא recovery |
| Curate כל epizod | Corrections, הערכה, או discards | שמירה הכל; botched takeover עלויות יותר מ ה epizod היה שווה |
| Sync ה corrections | versioned מערכים לצד ה מקורי | Corrections בתוך אף פעם עזיבה ה מקומי מכונה |
| Compose ה mixed מערכים | מקורי בתוספת corrections, explicit בחירה | Silent אוטומטי-ערבוב, כך מאוחר regression לא יכול ל traced ל קוד |
| המשך מ checkpoint | checkpoint initialised מ ה קודם אחד | Expecting אופטימייזר resume; ה משקלות initialize ה דגם, הם לא restore אופטימייזר state |
הגדרה gate אדם יכול בעצם ל hold
"ה human מחליט" הוא לא specification. שניים operators עם שונות thresholds מייצר non-comparable rounds, ו drifting threshold מייצר trend אתה לא יכול ל read. כתוב ה triggers מטה לפני ה ראשון רץ.
- שם ה conditions כי open ה gate — הקרבה מ ע"י יותר מ fixed שוליים, gripper סגירה בתוך כלום, joint drifting לעבור limit, stall של יותר מ שני או שניים — ו keep ה רשימה unchanged עבור ה סיבוב.
- שם מה לא open זה. Overshoot ה policy recovers מ בתוך מצד עצמו הוא הדרכה אות; קח מעל שם deletes recovery זה כבר knows.
- קח מעל מוקדם מספיק עבור clean handover, יד בחזרה כמו כן ה state הוא recoverable.
- Log למה אתה קח מעל, לכל epizod. שלוש rounds מאוחר יותר זה הוא ה בלבד תיעוד של בתוך אם ה אותו כישלון חוזרים.
- keep cameras, משימה טקסט ו operator ללא שינוי בתוך rounds. שינוי אחד ו ה מספרים עצור היות comparable.
Mechanically ה handover יש שניים גרסאות. עם leader זרוע, ה leader יש ל reach ה follower של זמן ייחוס לפני torque transfers, או ה זרוע קפצות; זה ישור תנועה הוא ה least-tested חלק של ה שרשרת בתוך real חומרה. בלי leader זרוע ה takeover הוא ידו מ ה ראשון keypress: ה follower הוא נערך ו ה operator nudges זה joint ע"י joint מ ה keyboard או drags sliders, עם server-side clamps שמירה כל input קטן — כמו זוג מעלות לכל keypress, handful לכל slider update, בגלל large צעד לתוך held pose הוא איך אתה מסד servo. ה צעד-ע"י-צעד גרסה עם ה בעיה bindings הוא בתוך ה walkthrough של DAgger סיבוב בתוך SO-100; רקע בתוך שניים teleoperation מצבים הוא בתוך ה teleoperation תיעוד ו ה leader-follower ערך.

קריאה בתוך אם ה gate עשה שום דבר
ה מטרי של human-סגור סיבוב הוא ה intervention שיעור: intervention frames חלקי frames של ה רץ. זה יש אחד עבודה — אם זה לא פתוח בתוך rounds, ה סיבוב קנה כלום, ו ה הבא אחד צריך לעשות שינוי משהו אחרות מ ה כמות של נתונים.
זה הוא biased מטרי ו אתה צריך ל know איך. זה אמצעים ה operator של threshold כמו כמו ה policy של competence, אשר הוא למה ה trigger רשימה שאר fixed; operator מי relaxes מעל הפעלה מייצר falling עקומה עם כלום מאחוריו. זה גם ignores severity — עשר frames ל עצור collision ו עשר ל nudge grasp לפי זהה. זוג זה עם fixed הערכה קבוצה כלום correction נתונים היה אף פעם drawn מ. ה מאמר בתוך מדידה DAgger לולאה עבודות דרך ה הערכה עיצוב, כולל איך ל keep הערכה episodes מחוץ ה הדרכה ערבוב.
- עבודות בתוך יום אחד, בתוך כל policy ארכיטקטורה, עם כלום extra דגם ל כיול
- Catches confident-ו-wrong כישלונות כלום variance threshold detects
- Produces corrections Recorded בזמן ה operator היה מלאה בקרה, בתוך רגע הם בחרו
- Yields per-frame סימן בתוך intervention-weighted שיטות כמו IWR ו Sirius consume
- עלויות continuous פיקוח; זה לא scales ל אחד אדם ו רבים רובוט
- Depends בתוך operator consistency — drifting threshold corrupts ה intervention שיעור
- Produces כלום סיכון דגם בתוך מצד עצמו; HG-DAgger של learned threshold ו ThriftyDAgger של estimator הם extra מכונות
- מספרים frames, לא consequences
- לא יכול ל rescue policy אשר כישלון הוא upstream של בקרה, כמו swapped מצלמה או mislabelled משימה חוט
פתוח שאלות שווה שמירה בתוך צפייה
ה benchmarks הם חלש. Spencer ו colleagues בחן אלה משמש ל בדיקה imitation learning approaches ו מצא אותם "realizable ו פשוט ו לפיכך מספיק עבור capturing ה קשה regimes של שגיאה compounding ראה בתוך real-world החלטה עשיית בעיות" — ו, כנגד ה surrounding ספרות, מצא כלום behavior cloning עשה טוב בתוך אותם. כי הוא סיבה ל היות sceptical של כל דירוג של DAgger variants שוכן בתוך אלה משימות, כולל כמה מספרים בתוך ה טבלה מעל.
Robot gates בתוך גדול חוקים הם לא מכירים או אחרות. ה AIM עבודה מחליפה uncertainty עם proxy Q-function mimicking ה human intervention כלל ו דיווחים 40% שיפור בתוך take-over עלות ו learning יעילות מעל ThriftyDAgger — בתוך continuous ו discrete בקרה, לא בתוך vision-language-action דגם נוסע manipulator. בתוך אם כל אלה gates transfers ל fine-tuned VLA הוא פתוח. ה סקירה עושה קשור נקודה: ה שדה של terminology ו מבנה הם לא united בתוך ה ספרות, אשר עושה שיטות קשה ל השוואה. בתוך שלך אחד זרוע, שלך logs הוא ה ראיה אתה יש.
הוא HG-DAgger בעצם DAgger אם ה human בלבד תוויות במהלך interventions?▾
זה keeps ה חלק כי חשוב — נתונים אספו תחת ה state הפצה ה learner induces, aggregated עם מה שבא לפני — ו drops ה חלק כי לא יוצא קשר עם חומרה. Kelly et al. להציג זה כ גרסה; ה 2011 כלום-regret guarantee לא נשא מעל unchanged.
יכול אני ל השתמש robot gate בתוך fine-tuned VLA policy בתוך SO-100?▾
לא straightforwardly. SafeDAgger של מסווג צרכים queryable reference policy אתה לא יש. EnsembleDAgger צרכים ensemble, אשר עבור multi-billion-parameter דגם פירושו כמה עותקים בתוך זיכרון בתוספת שלהם inference עלות. ThriftyDAgger צרכים סיכון estimator התאמו בתוך הצלחה ו כישלונות כי לא קיים לפני שלך ראשון rounds.
כמה זמן צריך אחד takeover להיות?▾
ארוך מספיק ל reach state ה policy יכול ל להמשיך מ, ו כלום יותר ארוך: extended takeovers הפוך ה רץ לתוך הדגמה הפעלה ו flood ה correction קבוצה עם nominal התנהגות. LazyDAgger של finding cuts ה אחר דרך גם — רבים מאוד קצר switches הם שלהם סיכון.
צריך אני ל רכבת בלבד בתוך ה corrected segments?▾
כלום — זה הוא ה הכי שכיח דרך ל זבל סיבוב. דגם fine-tuned בלבד בתוך recoveries יש רואה כמעט כלום אבל recoveries. ערבוב corrections לתוך ה מקורי מערכים עם sources בחר explicitly; ל לך יותר רחוק, לפי בתוך intervention-weighted approaches כמו IWR או Sirius, אשר up-weight human-נוסע frames ולא isolating אותם.
מה אם ה intervention שיעור לא drop אחרי סיבוב?▾
קח זה בתוך face ערך: ה סיבוב עשה לא עזור. לפני הוספת corrections, בדוק ה זול הסברים — היה ה operator של threshold drift, היו ה corrections קוסמטי, היה ה composed מערכים בעצם להכיל אותם, היה הדרכה initialised מ ה בעיה checkpoint. סיבוב כי בשקט התחיל מ ה בסיס דגם לפי בדיוק כמו סיבוב כי נכשל ל learn.
לעשות non-intervention נמנוע מידע?▾
תחת Expert Intervention Learning, כן: stretches כאשר ה supervisor צפה ו עשה לא פעולה הם קרא כמו weak ראיות בתוך state ו פעולה היו ישים, formalised כ constraint בתוך ה value פונקציה. הרבה מעשי pipelines, כולל זה אחד, סימן בלבד מה ה human נוסע.
עבור אחד זרוע בתוך שולחן ה בחירה הוא עשה: hold ה gate עצמך, כתוב מטה מה פותח זה, ו להוציא ה עמל בתוך ה נתונים טיפול מאחוריו ולא בתוך automating ה switch. ה פלטפורמה צד הוא תואר בתוך ה DAgger לולאה עמוד, הדרכה אפשרויות לכל policy משפחה תחת הדרכה ו pricing. עבור רקע, התחלה עם imitation learning ו imitation learning בתוך SO-100; עבור ראשון רץ, run שלך ראשון policy הוא ה קצר דרך.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started