
Behavior cloning አንድ policy ን በ expert ው state distribution ላይ ያስተካክላል፣ ከዚያም ብቻውን ይሰማራል። በእነዚህ ሁለት ስርጭቶች (distributions) መካከል ያለው ልዩነት ነው በ validation ወቅት ደህና የሚመስል policy በደረጃ 300 ላይ ከጠረጴዛው የሚያፈነግጥበት ምክንያት። ይህ የ DAgger ተከታታያችን የንድፈ-ሐሳብ ምዕራፍ ነው፦ የካሬ (quadratic) error ቃል ከየት እንደሚመጣ፣ dataset aggregation ምን እንደሚቀይር፣ no-regret proof ው ምን እንደሚገምት፣ እና ከሂሳቡ የትኛው ክፍል አሁንም በ human expert መከፈል እንዳለበት።
manipulation policy የሚያሰለጥን ሁሉ ቶሎም ይሁን ዘግይቶ የሚያጋጥመው የተለየ ውድቀት አለ። policy ኩቢውን ለመያዝ ይደርሳል፣ ከሁለት ሴንቲሜትር ርቀት ውስጥ ይገባል፣ ያመነታል፣ ወደ ጎን ይንሸራተታል፣ ከዚያም ከተግባሩ ጋር ግንኙነት የሌለው ነገር ያደርጋል። Validation loss ደህና ነበር። ከተያዙት episodes (held-out) ጋር የተደረገው open-loop replay ደህና ነበር። ያም ሆኖ ግን ክንዱ በ training data ውስጥ በጭራሽ በማይታይ አቋም ውስጥ ያበቃል፣ ከዚያ ነጥብ ደግሞ ምንም ትርጉም ያለው ነገር የለውም።
ይህ ውድቀት ስም እና የተረጋገጠ የንድፈ-ሐሳብ መሠረት አለው። ይህ ስለ DAgger ከሚወጡ አራት ጽሑፎች የመጀመሪያው ነው፣ እና ራሱን ክርክሩን ይሸፍናል፦ አንድ policy በ demonstrator ራሱ trajectories ላይ ማስተካከል ለምን ከ episode ርዝመት ካሬ ጋር ሊያድግ የሚችል error እንደሚያመነጭ፣ dataset aggregation ምን እንደሚቀይር፣ እና no-regret proof ው ምን እንደማይተነብይ። በእውነተኛ hardware ላይ ያለው loop የተሸፈነው በSO-100 ላይ DAgger loop ማሄድ ውስጥ ነው፣ human-gated ስሪቱ ደግሞ በHG-DAgger እና human-gated interventions ውስጥ ነው፣ የመለኪያ ጥያቄው ደግሞ በDAgger loop መለካት።
አጭሩ ስሪት
- •Behavior cloning በ expert ው state distribution ላይ ይሰለጥናል፣ ነገር ግን የሚገመገመው በ policy ራሱ ስርጭት ላይ ነው። አለመመጣጠኑ (mismatch) በ episode ውስጥ እየተባባሰ ይሄዳል።
- •Ross እና Bagnell ተጨማሪው ወጪ እንደ T ካሬ በ per-step error ተባዝቶ ሊያድግ እንደሚችል አሳይተዋል፤ የ DAgger ወረቀት ይህንን bound እንደገና ይገልጻል እና tight (ጠባብ) መሆኑን ይጠቅሳል።
- •DAgger policy ራሱ የሚጎበኛቸውን states ይሰይማል (labels)፣ እና እስካሁን የተሰበሰቡትን dataset ሁሉ ይጠቀማል፣ አዲሱን ብቻ ሳይሆን።
- •ዋስትናው ወደ no-regret online learning መቀነስ (reduction) ነው፦ ማጠቃለል (aggregating) እና ደግሞ ማሰልጠን (retraining) Follow-The-Leader ነው።
- •ይህ ተግባራዊ የሚሆነው በ policy class ውስጥ ሊደረስበት በሚችለው ምርጥ loss አንጻር ነው፣ ከዜሮ አንጻር አይደለም - እናም expert ው ራሱ በጭራሽ ባያመነጫቸው states ላይ አሁንም መሰየም (label) አለበት።
Behavior cloning በጸጥታ የሚያደርገው ግምት
የ demonstration dataset የ observation-action ጥንዶች ክምር ነው። Behavior cloning በዚያ ክምር ላይ በተራ supervised learning አንድ function ያስተካክላል እና እዚያው ያቆማል። በዘርፉ ውስጥ እጅግ ጥንታዊው ሐሳብ ነው። የ Pomerleau ALVINN፣ በ1988፣ ከካሜራ እና ከሌዘር range finder ምስሎችን የሚወስድ እና ተሽከርካሪው መጓዝ ያለበትን አቅጣጫ የሚያመነጭ ባለ ሦስት ንብርብር back-propagation network ነበር፤ በ simulated የመንገድ ምስሎች ላይ ሰለጠነ እና በአንዳንድ የመስክ ሁኔታዎች ውስጥ እውነተኛ መንገዶችን ተከተለ። የምግብ አዘገጃጀቱ (recipe) ብዙ አልተለወጠም፤ ኔትወርኮቹ ግን ተለውጠዋል።
የሚዘለለው እነዚያ ጥንዶች ከየት እንደመጡ ማረጋገጥ ነው። እያንዳንዳቸው demonstrator ባመነጨው trajectory ላይ ይተኛሉ። የምታሰማራው policy ግን የራሱን ያመነጫል። ከመንገዱ በሚያፈነግጥበት ቅጽበት፣ በ training distribution ውስጥ ስላልነበሩ states ጥያቄ ይቀርብለታል፣ መልሱም ወደ ውጭ የበለጠ ይገፋዋል። Ross፣ Gordon እና Bagnell የ DAgger ወረቀትን የከፈቱት በዚህ ልክ ነው፦ sequential prediction ከ statistical learning ስር ያለውን i.i.d. ግምት ይጥሳል፣ ምክንያቱም የ learner ራሱ ትንበያዎች ቀጥሎ የሚያየውን input ስለሚወስኑ።
በዚያ ወረቀት ውስጥ በጣም ግልጹ ምሳሌ በጭራሽ ሮቦት አይደለም። ለ Super Mario Bros. near-optimal planner ን ማባዛት (cloning) እንቅፋትን ከመዝለል ይልቅ ደጋግሞ በእንቅፋት ላይ የሚጣበቅ policy አስገኘ። ምክንያቱ ሙሉውን ክርክር በአንድ ዓረፍተ ነገር ይይዛል፦ expert ው ሁልጊዜ ከምቹ ርቀት ይዘልል ነበር፣ ስለዚህ dataset ው ማርዮ በእንቅፋት ላይ ተጭኖ የነበረበት state አልያዘም፣ በዚህም ምክንያት አንዴ እዚያ ከደረሰ ምን ማድረግ እንዳለበት label አልነበረም።
ማርዮን በSO-100 ክንድ ብትቀይረው መዋቅሩ ተመሳሳይ ነው። የአንተ demonstrations ንጹህ approach እና ንጹህ grasp ያሳያሉ፣ gripper ከሁለት ሴንቲሜትር ጎድሎ ሲዘጋ አይደለም - ስለዚህ policy ው ከዚያ ነጥብ ምን ማድረግ እንዳለበት ምንም ሐሳብ የለውም፣ የሚገምተውም ማንኛውም ነገር ወደ ውጭ የበለጠ ይወስደዋል። Covariate shift የdata collection procedure ባህሪ ነው፣ የ network architecture ባህሪ አይደለም።
የካሬው (quadratic) ቃል ከየት እንደሚመጣ
በ Ross እና Bagnell የተጻፈው የ2010 AISTATS ወረቀት፣ Efficient Reductions for Imitation Learning፣ ማባባሱን (compounding) ትክክለኛ ያደርገዋል። T የተግባሩ horizon ይሁን፣ የተግባሩ cost በ unit interval የተገደበ ይሁን፣ እና epsilon በexpert ው state distribution ስር የሚለካ surrogate loss ይሁን - ይህም validation set ህ የሚዘግበው ቁጥር ነው። ከዚያ ያንን policy ለ T steps ማሄድ ተጨማሪ ወጪ፣ ከ expert ው አንጻር፣ በ T ካሬ ተባዝቶ በ epsilon የተገደበ ነው። Ross፣ Gordon እና Bagnell ይህንን በ DAgger ወረቀት ውስጥ እንደ Theorem 2.1 እንደገና ይገልጹታል እና ወሳኙን ዓረፍተ ነገር ይጨምራሉ፦ bound ው tight ነው። በ expert ው distribution ላይ epsilon loss ያለው policy በ T ላይ በካሬ የሚያድግ ተጨማሪ ወጪ በእውነት የሚያስከትልባቸው ችግሮች አሉ።
Tight ማለት የተለመደ ማለት አይደለም። የካሬው ቃል በ ችግሮች class ላይ worst case ነው እንጂ፣ ስለ pick-and-place ተግባርህ ትንበያ አይደለም። የሚያሳየው፣ ተጨማሪ expert demonstration ችግሩን ማስወገድ እንደማይችል ነው፦ policy ው በማይፈተንበት distribution ላይ ያለውን የ epsilon ግምት ብቻ ይበልጥ ያጠራል።
የመውጫ መንገዱ በዚያው ወረቀት ውስጥ ነው፣ እንደ Theorem 2.2 እንደገና ተገልጿል። አንድ policy በራሱ state distribution ስር epsilon loss ካገኘ፣ እና አንድ የተሳሳተ action ከ expert ው አንጻር በ cost-to-go ውስጥ ቢበዛ u የሚያስከፍል ከሆነ፣ ተጨማሪው ወጪ በ u ተባዝቶ በ T ተባዝቶ በ epsilon የተገደበ ነው - በ horizon ውስጥ ቀጥተኛ (linear)። አስደሳቹ መጠን u ራሱ ነው፦ ከ expert ው ጋር ላለ 0-1 disagreement ቢበዛ 1፣ expert ው በጥቂት steps ውስጥ መልሶ መመለስ ሲችል ደግሞ O(1)። በ worst case ውስጥ O(T) ነው፣ በዚህ ጊዜ linear bound ው ከ quadratic ው የተሻለ አይሆንም።
| Setting | ከ expert ው በላይ በተጨማሪ ወጪ ላይ ያለ Bound | የተመሰረተበት ነገር |
|---|---|---|
| Behavior cloning (Ross እና Bagnell 2010፣ በ Ross et al. 2011 ውስጥ እንደ Thm. 2.1 እንደገና ተገልጿል) | T ካሬ በ epsilon ተባዝቶ | epsilon በ expert ው state distribution ላይ ተለክቷል፤ cost በ [0,1] ውስጥ ነው፤ bound ው tight ነው |
| በራሱ distribution ስር epsilon loss ያለው ማንኛውም policy (Thm. 2.2) | u በ T ተባዝቶ በ epsilon ተባዝቶ | u የአንድ የተሳሳተ action ን cost-to-go ቅጣት ይገድባል፤ ለ 0-1 loss ቢበዛ 1፣ በ worst case O(T) |
| Forward training (Ross እና Bagnell 2010) | u በ T ተባዝቶ በ epsilon ተባዝቶ | በእያንዳንዱ timestep አንድ policy፤ T policies እና የታወቀ፣ ውሱን T ይፈልጋል |
| SMILe (Ross እና Bagnell 2010) | በአንዳንድ የችግር classes ላይ በ T እና epsilon ውስጥ ወደ-ቀጥተኛ (near-linear) | alpha በ O(1/T ካሬ)፣ N በ O(T ካሬ log T)፤ stochastic mixture ያስገኛል |
| DAgger (Thm. 3.2, Ross et al. 2011) | u በ T ተባዝቶ በ epsilon_N ተባዝቶ፣ ሲደመር O(1) | N በ uT ልክ ደረጃ ላይ፤ strongly convex የተገደበ loss፤ no-regret learner፤ epsilon_N ወደኋላ ተመልክቶ ምርጡ loss ነው |

ከ DAgger በፊት የነበሩ ሁለት ሙከራዎች
Forward training ታማኝ ግን ተግባራዊ ያልሆነ መልስ ነው። ለእያንዳንዱ timestep፣ በቅደም ተከተል፣ ለቀድሞ steps አስቀድሞ በተወሰኑ policies በተፈጠረው state distribution ላይ የተለየ policy አሰልጥን፣ በዚህም እያንዳንዱ policy የሚያጋጥመውን distribution በትክክል ያያል። ችግሩ በመግለጫው ውስጥ ነው፦ T policies፣ በቅደም ተከተል የሰለጠኑ፣ early stopping የለም። ለ manipulation episode በሰከንድ 30 frames፣ T በመቶዎች ውስጥ ነው።
ከዚያው ወረቀት የመጣው SMILe እና ከ Daume፣ Langford እና Marcu structured prediction ስራ የመጣው SEARN ሌላውን መንገድ ይይዛሉ፦ አንድ stationary policy፣ ግን stochastic። እያንዳንዱ iteration አንድ component ያሰለጥናል እና ወደ mixture ይጨምረዋል፣ probability mass ን ከ expert ው እያራቀ። ውጤቱ አንዳንድ components ከሌሎቹ የከፉበት mixture ነው - በአካላዊ ክንድ ላይ፣ ይህ በ motion መካከል መጥፎ component መምረጥ (sample) የሚችል controller ማለት ነው። ይህ stationary deterministic policy እንዲኖር የመፈለጉ የተገለጸ ምክንያት ነው።
DAgger፦ አንድ ሐሳብ፣ አንድ ሳጥን
Dataset Aggregation deterministic policy ውን ይይዛል እና መፍትሄውን ወደ data collection ያዞራል። በእያንዳንዱ round፦ አሁን ያለውን policy roll out አድርግ፣ የሚጎበኛቸውን states መዝግብ፣ በእያንዳንዱ ውስጥ ትክክለኛው action ምን ይሆን እንደነበር expert ውን ጠይቅ፣ እነዚያን ጥንዶች ቀደም ሲል ካለህ dataset ጋር ጨምር፣ በ union ው ላይ እንደገና አሰልጥን። ስሙ ራሱ algorithm ው ነው - ትደምራለህ (aggregate)፣ በጭራሽ አትጥልም (discard)።
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setከሚመስሉት በላይ ክብደት ያላቸው ሦስት ዝርዝሮች አሉ። labels የሚደረጉት በ mixed policy የተጎበኙ states ላይ ነው፣ actions ግን የሚመጡት ከ expert ው ነው - policy ው ጥያቄዎቹን ያቀርባል፣ expert ው መልሶቹን። እንደገና ማሰልጠን (retraining) የሚደረገው በጠቅላላው aggregate ላይ ነው፣ ይህም እያንዳንዱን round Follow-The-Leader step ያደርገዋል፦ በ round n ላይ እስካሁን ባለው እያንዳንዱ trajectory ላይ ወደኋላ ተመልክተህ ምርጡን policy ትመርጣለህ። ማረጋገጫው (proof) የተመሰረተው በዚህ framing ላይ ነው። እናም algorithm ው በ sequence ውስጥ ያለውን ምርጥ policy በ validation set ላይ ተመርጦ በመመለስ ያበቃል፣ ምክንያቱም theorems ቹ የሚያረጋግጡት የተወሰነ policy በ sequence ውስጥ ጥሩ መሆኑን ነው፣ የመጨረሻው መሆኑን አይደለም።
Beta schedule፣ እና ለምን tuning knob (ማስተካከያ ቁልፍ) እንዳልሆነ
Mixed policy ው beta_i በ expert ው ተባዝቶ ሲደመር (1 - beta_i) በ learner ው ተባዝቶ ነው። ነጥቡ ተግባራዊ ነው፦ የመጀመሪያዎቹ ጥቂት የተማሩ policies በጣም ትንሽ data ላይ ሰልጥነዋል፣ ብዙ ስህተቶችን ያደርጋሉ፣ ካልሆነም policy ው ከተሻሻለ በኋላ ተገቢ-ያልሆኑ በሚሆኑ states ውስጥ rollout ውን ያሳልፉ ነበር።
ንድፈ ሐሳቡ በትክክል አንድ ሁኔታ ብቻ ይጭናል፦ የ betas ተንቀሳቃሽ አማካይ (running average) ወደ ዜሮ መድረስ አለበት። ትንተናው የሚሰራው beta_i በ (1 - alpha) ወደ ኃይል i-1 የተገደበ ሲሆን፣ ለ T ገለልተኛ የሆነ ቋሚ alpha ጋር ነው።
| Schedule | የሚያደርገው ነገር | ወረቀቱ የሚዘግበው ነገር |
|---|---|---|
| beta_1 = 1 | የመጀመሪያው round ንጹህ expert demonstration ነው፤ የመነሻ policy አያስፈልግም | በሁሉም variant ውስጥ የሚመከረው መነሻ ነጥብ |
| beta_i = 1 ከሆነ i = 1፣ ካልሆነ 0 | expert ው ብቻ በ round አንድ ውስጥ፤ free parameter የለም | ብዙ ጊዜ በተግባር ላይ ምርጡን አፈጻጸም እንደሚያሳይ ወረቀቱ የሚናገረው parameter-free ስሪት፤ በ Super Mario Bros. ላይ ከ20 iterations በኋላ 2980 |
| beta_i = p^(i-1) ከ p = 0.5 ጋር | የ expert probability በ ጂኦሜትሪክ ሁኔታ ይቀንሳል | በተመሳሳዩ benchmark ላይ 3030፣ ከ parameter-free ስሪቱ ትንሽ ቀድሞ |
| beta_i = p^(i-1) ከ p = 0.9 ጋር | expert ው ለረጅም ጊዜ በ loop ውስጥ ይቆያል | በጣም ቀርፋፋ convergence፤ 20ዎቹ iterations ሲያልቁ አሁንም እየተሻሻለ ነበር |
በ2980 እና 3030 መካከል ያለው ልዩነት፣ ወደ 4300 ገደማ በሚደርስ scale ላይ ሲታይ ትንሽ ነው፣ ነገር ግን የወረቀቱ ማብራሪያ በዚህ ክፍል ውስጥ በጣም ጠቃሚው ተግባራዊ ማስታወሻ ነው። parameter-free schedule ሲጠቀም፣ ማርዮ ገና በለጋ ደረጃ በተመሳሳይ ቦታ ተጣብቆ ከዚያ አንድ ቦታ ብዙ ተቀራራቢ-ተመሳሳይ (near-duplicate) data አመነጨ፤ expert ው ለተወሰነ ጊዜ እንዲነዳ መፍቀድ ሁለቱንም እሱን ከመጣበቅ ነጻ አወጣው እና የ states ልዩነትንም አሰፋ። Schedule ው ስለ mixing ratio ይልቅ የ data collection ህ አዳዲስ states ማመንጨቱን መቀጠሉን ወይም ተመሳሳይ ውድቀት ማምረቱን ነው የሚመለከተው።
Stochastic per-timestep mixture ማለት control authority ን በ control rate፣ በተለመደ SO-100 setup ላይ በሰከንድ 30 ጊዜ መቀያየር ማለት ነው። ምንም teleoperation interface ይህንን ደህንነቱ የተጠበቀ ወይም ትርጉም ያለው አያደርገውም። በእውነተኛ hardware ላይ beta schedule ው ቦታውን ለሰው ውሳኔ ይለቃል፣ መቼ መረከብ እንዳለበት፦ ይህ የተለየ analysis ያለው የተለየ algorithm ነው።
ዋስትናው፦ ወደ no-regret online learning መቀነስ (reduction)
ወረቀቱን ይህ ነው የሚያደርገው move። እያንዳንዱን DAgger round በ online learning ችግር ውስጥ እንደ አንድ ምሳሌ ውሰድ፣ በ round i ላይ ያለው loss በ round i ላይ ጥቅም ላይ የዋለው policy state distribution ስር ያለው surrogate loss ነው። Learner ው ያንን loss ከማየቱ በፊት ወደ policy ይገባል (commits)፣ sequence ውም non-stationary ነው ምክንያቱም እስካሁን በተመረቱ policies ላይ የተመሰረተ ስለሆነ።
አንድ algorithm no-regret የሚባለው በ N rounds ላይ ያለው average loss ወደኋላ ተመልክቶ ካለው ምርጥ ነጠላ policy ጋር የሚቀራረብ ከሆነ ነው። Strongly convex losses ላይ ያለው Follow-The-Leader እንደዚህ ዓይነት algorithm ነው፣ average regret ው በ 1/N ልክ ደረጃ የሚቀንስ - እና በጠቅላላው aggregate ላይ እንደገና ማሰልጠን በትክክል Follow-The-Leader ነው። ማንኛውም ሌላ no-regret learner እኩል ያገለግላል፦ analysis ው reduction ነው እንጂ የአንድ optimiser ባህሪ አይደለም።
አንድ lemma data ውን በሰበሰበው mixed policy እና ወደፊት በሚሰማራው የተማረ policy መካከል ያለውን ልዩነት ያገናኛል፦ Lemma 4.1 በ state distributions ቻቸው መካከል ያለውን L1 distance በ 2 T beta_i ይገድባል። Betas ቹ መቀነስ (decay) ያለባቸው ለዚህ ነው - expert ው አሁንም በቂ control authority እስካለው ድረስ፣ የምትሰበስባቸው states ፖሊሲህ የሚያመነጫቸው states አይደሉም። Lemma ውን ከ regret bound ጋር አዋህድ፣ ዋናው ውጤትም ይከተላል፦ ከ T ገደማ iterations በኋላ፣ በ sequence ውስጥ ያለ የተወሰነ policy በራሱ distribution ስር ካለው epsilon_N በ O(1/T) ውስጥ የሆነ surrogate loss አለው። ያንን ወደ linear bound ውስጥ አስገባ እና ወደ Theorem 3.2 ትደርሳለህ።
የ empirical ጎኑ በአሁኑ ደረጃዎች ልክ መጠነኛ ነው። በ Super Tux Kart ውስጥ supervised baseline ተጨማሪ data ሲመጣ በ lap አማካይ ውድቀቶቹን አላሻሻለም፣ DAgger ግን ከአስራ አምስት iterations በኋላ ከትራኩ በጭራሽ የማይወድቅ policy ደረሰ፣ SMILe ደግሞ ከሃያ በኋላ አሁንም በ lap ገደማ ሁለት ጊዜ ወደቀ። በ handwriting benchmark ላይ፣ character accuracy ያለ structure 82 በመቶ፣ supervised 83.6 በመቶ፣ በ DAgger 85.5 በመቶ ነበር። ከእነዚህ ውስጥ አንዳቸውም የ manipulation ውጤት አይደሉም።
Proof ው የማይተነብየው ነገር
የ theorem መግለጫዎቹ ሁኔታዊ (conditional) ናቸው፣ ሁኔታዎቹም ጫና-ተሸካሚ (load-bearing) ናቸው።
- በተጠቀሱት ግምቶች ስር፣ በ T ውስጥ quadratic ሳይሆን linear የሆነ bound።
- Stochastic mixture ሳይሆን stationary deterministic policy።
- እውነተኛ reduction፦ ማንኛውም no-regret online learner ይገባል።
- ተጨባጭ የ iteration ብዛት - regret ቃሉ ትርጉም ከማጣቱ በፊት ገደማ T rounds።
- በ sequence ውስጥ ቢያንስ ለአንድ policy ዋስትና፣ ስለዚህም የመዝጊያ validation pass ው።
- ከ ዜሮ አንጻር ሳይሆን ወደኋላ ተመልክቶ በ class ውስጥ ካለው ምርጥ loss ማለትም epsilon_N አንጻር ነው። Class ህ expert ውን መወከል ካልቻለ፣ በተግባር ባዶ ነው።
- ደራሲዎቹ እንደሚጠቅሱት፣ no-regret method ወይም strongly convex surrogate loss ይፈልጋል - ከሚገነባባቸው classification reductions የበለጠ ጠንካራ።
- ቋሚው u በ worst case ውስጥ O(T) ሊሆን ይችላል፣ በዚያን ጊዜ linear bound ው ተመልሶ ወደ quadratic ይወድቃል።
- የሚገድበው iterations ን ነው፣ expert labels ን አይደለም። በሮቦት ላይ፣ budget ው labels ናቸው።
- expert ው በተጎበኘ በእያንዳንዱ state ላይ ጥያቄ ሊቀርብለት እና በትክክል ሊመልስ እንደሚችል ይገምታል። ያ ግምት ራሱ ጠቅላላው ወጪ ነው።
ብዙ ጊዜ እንደ ማስተባበያ (refutation) ተጠቅሶ የሚገለጽ ግን ያልሆነ ተጨማሪ ውጤት አለ። Rajaraman፣ Yang፣ Jiao እና Ramachandran ውሱን state space S እና horizon H ባላቸው episodic MDPs ውስጥ የ imitation learning ን minimax ገደቦች ያጠናሉ፣ እና learner ው በተጎበኙ states ላይ በንቃት expert ውን ሊጠይቅ ሲችል እንኳ የሚጸና በ|S| H ካሬ በ N ልክ ደረጃ ላይ ያለ suboptimality lower bound ያረጋግጣሉ። ይህ በ fixed episode budget ላይ በ MDPs class ላይ ያለ worst-case rate ነው፣ የሚያገለው interaction minimax rate ን ያሻሽላል የሚለውን ሐሳብ ነው፤ የ DAgger theorem ግን የተለየ መግለጫ ነው፣ የተሰማራውን policy ራሱ policy class ሊደርስበት ከሚችለው አንጻር ይገድባል።
Swamy፣ Choudhury፣ Bagnell እና Wu በኋላ እነዚህን algorithms የ expert ውን ባህሪ የትኞቹን moments እንደሚያመሳስሉ መሠረት አድርገው ከፋፍለዋል፣ እና እያንዳንዱ family compounding error ን ምን ያህል በጥሩ ሁኔታ እንደሚያቃልል የሚለይ moment recoverability የሚባል ፅንሰ-ሐሳብ አስተዋውቀዋል። በ Osa እና በ Celemin የተደረጉት surveys የ algorithm ውን landscape እና የ human-feedback interfaces ን ይሸፍናሉ።
ሂሳቡ፦ expert ው በጭራሽ ያላመነጫቸውን states መሰየም (labelling)
ከላይ ያለው ሁሉ የትም ጥያቄ ሊቀርብለት የሚችል expert ይገምታል። ከሞላ ጎደል ነጻ በሆነ planner በ simulation ውስጥ - የ Mario ሙከራዎች ወደ game state ሙሉ access ያለው near-optimal planner ተጠቅመዋል። በሮቦት ላይ ሰው ሲኖር ግን ይህ ዋነኛው ወጪ ነው፣ እና እንግዳ ወጪ ነው፦ ሰው ራሱ ብቃቱ በጭራሽ ባይፈጥረው በነበረ configuration ውስጥ ትክክለኛ action ማምረት አለበት።
Kelly፣ Sidrane፣ Driggs-Campbell እና Kochenderfer በ HG-DAgger ወረቀት ውስጥ ተቃውሞውን በቀጥታ ይገልጻሉ። Vanilla DAgger expert ው ሙሉ በሙሉ ሲስተሙን ሳይቆጣጠር action labels እንዲያቀርብ ይጠይቃል። ይህ ደህንነትን ይቀንሳል፣ ከ human experts ጋርም የተሰበሰቡትን labels ጥራት የሚያሳንስ ሲሆን፣ ይህንንም ለ perceived actuator lag ይሰጡታል። የምታገኘው label algorithm ው የገመተው label አይደለም።
Laskey እና ባልደረቦቹ ችግሩን በ DART በኩል ከሌላ አቅጣጫ ያጠቃሉ፣ framing ቸውም ግልጽ ነው፦ on-policy techniques ለ human supervisors አድካሚ ናቸው፣ computational burden ይጨምራሉ፣ በ training ወቅትም አደገኛ states ሊጎበኙ ይችላሉ። አማራጫቸው calibrated noise ን ወደ supervisor ው ራሱ demonstrations ውስጥ ያስገባል፣ ስለዚህ recovery የሚታየው ሮቦቱ በጭራሽ untrusted policy ሳያሄድ ነው። በ MuJoCo Humanoid ላይ DART በ training ወቅት የ supervisor ውን cumulative reward በ5 በመቶ እንደሚቀንስ ይዘግባሉ፣ DAgger ግን ከ supervisor ው በ80 በመቶ ያነሰ cumulative reward ያላቸውን policies ያሄዳል፤ በ Toyota HSR clutter ውስጥ grasping ላይ፣ ከ behavior cloning በአማካይ 62 በመቶ ጭማሪ።
የ Zhang እና Cho SafeDAgger ወደ reference policy የሚደረጉ queries ን እንደ ጠፍ ሀብት (scarce resource) ይይዛል፦ የተለየ safety policy፣ ሳይጠይቅ፣ primary policy ው ከ reference ው threshold አልፎ ሊያፈነግጥ መሆኑን ይተነብያል፣ እነዚያ states ብቻ ናቸው የሚተላለፉት። ሦስቱም የሚምላሱት ለተመሳሳይ እውነታ ነው - የ DAgger analysis ለ expert labels ምንም አያስከፍልም፣ እውነታው ግን በጣም ብዙ ያስከፍላል።
Off-distribution states ን መሰየም ተግባሩን ከማሳየት ይልቅ በአዕምሮ ደረጃ ይከብዳል። መደበኛ demonstration ማለት አስቀድሞ ያለህን motor plan ማስፈጸም ማለት ነው። Gripper ውን በጭራሽ ወዳልነበርክበት ቦታ ያደረሰውን policy ማረም ማለት ግን፣ ሮቦቱ አሁንም እየተንቀሳቀሰ፣ በጊዜ ጫና ስር፣ በቦታው recovery መገንባት ማለት ነው። ከ ተራ recording session ይልቅ በ session ውስጥ ያነሰ ጠቃሚ ደቂቃዎችን ጠብቅ፣ የራስህም የማረም ጥራት በ session አንድ ውስጥ እየቀነሰ እንደሚሄድ ተከታተል።

ይህ በጠረጴዛህ ላለ SO-100 ማለት ምን ማለት ነው
Horizon ን ወደ ራስህ ክፍሎች (units) ተርጉም። በ 30 frames በሰከንድ ላለ ሃያ-ሰከንድ episode 600 decision steps ነው፣ ከላይ ባለው በእያንዳንዱ bound ውስጥ ያለው T ደግሞ ያ ቁጥር ነው። በ T = 600 ላይ፣ ከ T ጋር በተመጣጣኝ በሚያድግ ቃል እና ከ T ካሬ ጋር በሚያድግ ቃል መካከል ያለው ልዩነት፣ ከመጥፎ approach መልሶ በሚያገግም policy እና በማያገግም policy መካከል ያለው ልዩነት ነው።
Action chunking የሚረዳው ለዚህ ነው በከፊል፦ አንድ policy በ inference step አጭር የ actions sequence ሲያመነጭ፣ የ decision points ብዛት ይቀንሳል፣ እንዲሁም ማባባስ (compound) የሚያደርጉ እድሎች ብዛት ይቀንሳል። Zhao፣ Kumar፣ Levine እና Finn compounding error ን ለ Action Chunking with Transformers ምክንያት አድርገው ይጠቅሳሉ፣ በ ስድስት አስቸጋሪ የእውነተኛ-ዓለም ተግባራት ላይ፣ በ ርካሽ bimanual hardware ላይ፣ ከዐስር ደቂቃ demonstrations 80 እስከ 90 በመቶ success ይዘግባሉ። Chunking covariate shift ን አያስወግድም - states ቹ አሁንም የ policy ው ራሱ ናቸው - ግን effective horizon ውን ያሳጥራል። ይመልከቱ action chunking እና የ SO-100 imitation learning መመሪያ።
ሁለተኛው ትርጉም የ progress metric ነው። epsilon ን በ policy ው ራሱ distribution ስር በቀጥታ መለካት አትችልም - ያ ለተጎበኘ እያንዳንዱ state ground-truth expert actions ይፈልጋል፣ ይህም ልታመርተው የምትቆጠቆጥ ነገር ነው። ከዚያ ይልቅ human-gated loop የሚሰጥህ intervention rate ነው፦ በ run አንድ ውስጥ ሰው የተረከበባቸው frames ክፍልፋይ። Proxy ነው፣ ከ policy ው ጋር ግንኙነት በሌላቸው ምክንያቶችም ይንቀሳቀሳል - ትዕግስተኛ operator ያነሰ ጣልቃ ይገባል። በተከታታይ ጥቅም ላይ ሲውል፣ አንድ round ከሰዓቱ ዋጋ ያለው መሆኑን የሚናገር ብቸኛው ቁጥር ነው።
ሦስተኛው ትርጉም analysis ው የማይሸፍነው የ data-quality ማስጠንቀቂያ ነው። Mandlekar እና ባልደረቦቹ ስድስት offline learning algorithms ን በ አምስት simulated እና ሦስት እውነተኛ-ዓለም multi-stage manipulation ተግባራት ላይ አጥንተዋል፣ ለ algorithmic design ምርጫዎች ስሜታዊነት (sensitivity)፣ በ demonstrations ጥራት ላይ ጥገኝነት፣ እና በ stopping criterion የተከሰተ variability ይዘግባሉ። Belkhale፣ Cui እና Sadigh dataset quality በ action divergence እና transition diversity በኩል መደበኛ (formalise) መደረግ እንዳለበት ይከራከራሉ፣ state diversity ሁልጊዜ ጠቃሚ እንዳልሆነም ይጠቅሳሉ። አንድ DAgger round ማንም ሆን ብሎ ያልመረጣቸውን states ይጨምራል፦ አንዳንዶቹ የምትፈልገው recovery data ናቸው፣ አንዳንዶቹ ደግሞ ለ takeover control እየተጣደፍክ ሳለ ሮቦቱ የሚንፈራገጥበት ናቸው።
በ mechanism ደረጃ አንድ round ስድስት steps አሉት፦ recording ን አብርተህ inference አሂድ፣ policy ው ሲበላሽ ተረከብ፣ run ውን ገምግም እያንዳንዱን episode ፋይል አድርግ፣ corrections ውን sync አድርግ፣ ከ originals ጋር corrections ን በማዋሃድ per source በግልጽ episode selection የተደረገበት mixed dataset compose አድርግ፣ እና ከ base model ይልቅ ከቀድሞው checkpoint ስልጠናውን ቀጥል። በ ay-robots ላይ እነዚያ steps እንደ buttons አሉ፣ ይህም plumbing ውን ያስወግዳል እንጂ ውሳኔውን (judgement) አያስወግድም። ሁለት ማሳሰቢያዎች፦ ከ checkpoint መቀጠል weights ን initialise ያደርጋል እንጂ optimizer resume አይደለም፣ የ leader-arm alignment move ም አሁንም በ hardware ላይ በቀላሉ ብቻ ተፈትኗል። ይመልከቱ training እና datasets።
DAgger loop፣ ቀድሞውኑ የተገጠመ
በ live inference run ወቅት መረከብ፣ per-frame intervention marking፣ episodes ን እንደ corrections ወይም evaluations ማድረግ (filing)፣ per source በግልጽ episode selection ያለው mixed dataset ማዋሃድ፣ እና ካለ checkpoint ስልጠናውን መቀጠል ሁሉም built-in ናቸው። መቼ መረከብ እንዳለብህ እና ምን መያዝ እንዳለብህ አሁንም አንተ ትወስናለህ - ያ ክፍል አይራስ-ሰራም (automate)።
DAgger loop እንዴት እንደሚሰራ ይመልከቱየ family tree፣ በአንድ table ውስጥ
| Method | States ቹን የሚመርጠው ማን ነው | Expert ው የሚያቀርበው ነገር | ዋናው ወጪ |
|---|---|---|---|
| Behavior cloning | Expert ው | ንጹህ demonstrations | recovery data የለም፤ error በ T ውስጥ በካሬ ሊባባስ ይችላል |
| Forward training | Learner ው፣ በእያንዳንዱ timestep | በተፈጠረው (induced) distribution ላይ Labels | T የተለያዩ policies፤ ለረጅም horizons የማይጠቅም |
| SMILe / SEARN | የ expert እና learner stochastic mixture | በ mixture ው distribution ላይ Labels | የ mixture ው components በጥራት ይለያያሉ |
| DAgger | Mixed policy፣ beta ወደ ዜሮ እየቀነሰ | ለተጎበኘ እያንዳንዱ state ትክክለኛ action | Expert ው በጭራሽ የማያመነጫቸውን states መሰየም፣ ሲስተሙን ሳይቆጣጠር |
| DART | Expert ው፣ በተጨመረ noise የተረበሸ | በ calibrated noise ስር Demonstrations | Noise ው ከ learner ው error ጋር calibrated መሆን አለበት |
| HG-DAgger | Learner ው፣ ሰው እስከሚረከብ ድረስ | Corrections በ human-gated segments ውስጥ ብቻ | መቼ ጣልቃ መግባት እንዳለበት በ ሰው ውሳኔ (judgement) ላይ የተመሰረተ |
| SafeDAgger | Learner ው፣ በ safety gate የተጣራ | gate ው ሲጠይቅ ብቻ Labels | gate ው ራሱ መሰልጠን እና መታመን አለበት |
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
በሮቦቴ ላይ በእውነት quadratic error growth ን አያለሁ?▾
እንደ ንጹህ curve አይደለም። bound ው worst case ነው፦ tight የሚባለው የተወሰነ ችግር ስለሚደርስበት ነው፣ የአንተውም ይደርስበታል ማለት አይደለም። የምታየው ውጤቱን ነው - በ held-out frames ላይ ጥሩ ውጤት የሚያገኝ፣ በእውነተኛው ተግባር ላይ ግን የሚወድቅ፣ ተመሳሳይ ነገር ብዙ ስትመዘግብም የማይሻሻል policy። ተጨማሪ ንጹህ data መርዳት ካቆመ፣ ያ covariate shift ነው፣ የ data-volume ችግር አይደለም።
DAgger ብዬ ለመጥራት beta mixture ውን መተግበር (implement) አለብኝ?▾
Parameter-free ስሪቱ - expert ው በ round አንድ፣ ከዚያ በኋላ ንጹህ learner - ትክክለኛ ልዩ ጉዳይ (special case) ነው፣ በዋናዎቹ ሙከራዎችም ብዙ ጊዜ ምርጡን አፈጻጸም አሳይቷል። ልትተወው የማትችለው aggregation ውን ነው፦ በአዲሱ corrections ላይ ብቻ እንደገና ማሰልጠን Follow-The-Leader interpretation ውን ይሰብራል፣ no-regret ክርክሩ የሚመጣው ከዚያ ነው። Corrections ብቻ ላይ ማሰልጠን በጣም ደካማ procedure ነው።
ለምን ከመጨረሻው ይልቅ በ validation set ላይ ምርጡን policy ትመልሳለህ?▾
ምክንያቱም theorems ቹ የሚያረጋግጡት በ sequence ውስጥ የሆነ ቦታ ጥሩ policy መኖሩን ነው፣ የመጨረሻው iterate መሆኑን አይደለም - bound ው በ sequence ው ላይ ባለው minimum ላይ ነው። ከመጨረሻው round የወጣውን ማንኛውንም ነገር መላክ (shipping) የተገለጸውን የውጤቱን ሁኔታ ይጥላል፣ የመጨረሻው round ም በአስተማማኝነት ምርጡ አይደለም።
ለምን ያህል rounds ማቀድ አለብኝ?▾
ንድፈ ሐሳቡ በ T ልክ ደረጃ ላይ ያሉ iterations ይፈልጋል፣ ይህም ለ 600-step episode ማንም በ hardware ላይ የማያሄደው ቁጥር ነው። ዋናዎቹ ሙከራዎች በእያንዳንዱ benchmark ላይ ሃያ iterations አሂደዋል። በተግባር ግን rounds ን የምታሄደው intervention rate መውደቅ እስኪያቆም ድረስ ነው፣ analysis ው ከሚገምተው ቁጥር በጣም ያነሰ - በ ንድፈ ሐሳብ እና በ ተግባር መካከል እውነተኛ ክፍተት።
policy class ህ expert ውን መወከል ፈጽሞ ካልቻለስ?▾
ያኔ DAgger አያድንህም፣ bound ውም ይህንኑ ይናገራል - የተገለጸው ወደኋላ ተመልክቶ በ class ውስጥ ካለው ምርጥ loss ማለትም epsilon_N አንጻር ነው። ያ ትልቅ የሆነው በተሳሳተ architecture፣ በጎደለ observation ወይም ትዕይንቱን ማየት በማይችል camera ምክንያት ከሆነ፣ aggregation ተግባሩን ማከናወን በማይችል class ውስጥ optimal የሆነ policy ይሰጥሃል። Corrections ከመሰብሰብህ በፊት ከ held-out episodes ጋር open-loop replay አሂድ።
ከዚህ ወዴት መሄድ
እስካሁን policy ካላሰለጠንክ፣ ይህ ንድፈ ሐሳብ ያለጊዜው ነው፦ በመጀመሪያ dataset መዝግብ፣ ጀምር ከየመጀመሪያ policy ህን ማሰልጠን እና ከdesktop client። ሌላ መቶ ንጹህ demonstrations ከ corrections መጀመር ጋር እያመዛዘንክ ከሆነ፦ ንጹህ demonstrations የ distribution ችግርን አያስተካክሉም። ለ mechanics ው፣ በhuman-gated ስሪቱ እና ከዚያም በSO-100 walkthrough።
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started