ኦፕሬተር በርቀት-ቁጥጥር በይነገጽ በኩል የሮቦት ክንድን የሚቆጣጠርበት፣ እጆቹ በመቆጣጠሪያዎቹ ላይ አርፈው ለመረከብ ዝግጁ ሆኖ
DAggerመስተጋብራዊ አስመስሎ መማርHG-DAggerየሮቦት ፖሊሲዎችSO-100

HG-DAgger እና የበር ስሪቶች፦ የሮቦት ፖሊሲን መቼ መረከብ እንዳለበት የሚወስነው ማን ነው

AY-Robots ResearchAugust 27, 2026የ15 ደቂቃ ንባብ

ተራው DAgger ሮቦቱ አሁንም እየነዳ ባለበት ወቅት ኤክስፐርት ሁኔታዎችን እንዲሰይም ይጠይቃል። በእውነተኛ ሃርድዌር ላይ ይህ ደህንነቱ የተጠበቀ አይደለም፣ ደግሞም ደካማ መለያዎችን ያስገኛል። የበር ስሪቶች ዕውር መለያ ስራን አንድ ሰው መያዝ ባለበት በር ይተካሉ፦ በHG-DAgger ውስጥ ሰው፣ በSafeDAgger ውስጥ የደህንነት ክላሲፋየር፣ በEnsembleDAgger ውስጥ የአንሳምብል አለመስማማት፣ በThriftyDAgger ውስጥ በበጀት የተገደበ የአዲስነት-እና-ስጋት ግምት። ይህ ጽሁፍ እነዚህን በር ማን እንደያዘ፣ የትኛው ምልክት እንደሚከፍተው፣ እና እያንዳንዱ ስንት እንደሚያስከፍል በማነጻጸር ይመረምራል — እንዲሁም ለምን ሰው-ተቆጣጣሪው ስሪት ከእውነተኛ ክንድ ጋር ንክኪ ተርፎ የሚቀጥለው እንደሆነ ያሳያል።

ክሎን የተደረገ ፖሊሲ የስልጠና ውሂቡ ባለቀበት ቦታ ይወድቃል። መፍትሄው ከአሳያሪው የሁኔታ ስርጭት ይልቅ የፖሊሲው ራሱ የሁኔታ ስርጭት ስር ሆኖ ውሂብ መሰብሰቡን መቀጠል ነው፤ ይህንኑ ነው DAgger የሚያደርገው፣ እና ዳታሴት ማጠራቀም መግቢያ ከመሰረታዊ መርሆች ጀምሮ የሚሸፍነው። የዋናውን አልጎሪዝም አስቸጋሪ ክፍል ግን ክፍት ትቶታል፦ ተማሪው እየነዳ ባለበት ወቅት፣ ኤክስፐርቱ ቁጥጥር ሳይኖረው ለእያንዳንዱ ሁኔታ ምን እንደሚያደርግ ነበር መናገር ይጠበቅበታል።

በስክሪፕት በተዘጋጀ ኤክስፐርት በሚሰራ አስመሳይ (simulator) ውስጥ ይህ ወጪ የለውም። እውነተኛ ክንድ ባለበት ጠረጴዛ ላይ ግን ወጪም ደህንነትም የላቸውም። የHG-DAgger ደራሲዎች ተቃውሞውን በትክክል ይገልጻሉ፦ እንደዚህ ያሉ የናሙና አወሳሰድ ዘዴዎች "ኤክስፐርቱ ስርዓቱን ሙሉ በሙሉ ሳይቆጣጠር የአክሽን መለያዎችን እንዲያቀርብ ይጠይቃሉ"፣ ይህም "ደህንነትን ሊቀንስ ይችላል፣ ሰዎችን እንደ ኤክስፐርት ስንጠቀም ደግሞ በሚታወቅ አክቲዌተር መዘግየት (actuator lag) ምክንያት የተሰበሰቡት መለያዎች ጥራት እንዲወርድ ያደርጋል" (Kelly et al., 2019)። በዚህ ዓረፍተ ነገር ውስጥ ሁለት ውድቀቶች ተደብቀዋል፦ ፖሊሲው ማንም በማይፈልገው ሁኔታ ውስጥ መንዳቱን ይቀጥላል፣ እናም በዚያ ስጋት የተገዙት መለያዎች ኤክስፐርቱ መቆጣጠሪያውን ይዞ ከሚያመነጫቸው የከፉ ናቸው። ከዚህ በታች ያለው እያንዳንዱ ስሪት ተመሳሳይ ጥያቄ ይመልሳል — በቁጥጥር ላይ በር አድርግ እና መቼ እንደሚከፈት አንድ ሰው/ነገር እንዲወስን አድርግ። የሚለያዩት ያ ወሳኝ ማን እንደሆነ ነው።

አጭሩ ስሪት

  • የበር ስሪቶች ዕውር መለያ ስራን በፖሊሲ ቁጥጥር እና በኤክስፐርት ቁጥጥር መካከል በሚደረግ መቀያየሪያ ይተካሉ። የሚለያቸው መቀያየሪያውን ማን እንደያዘ ነው።
  • HG-DAgger መቀያየሪያውን ለሰው ይሰጣል፣ እናም ሰው ያለምንም መቆራረጥ ቁጥጥር ባደረገበት ጊዜ የተመዘገበውን ውሂብ ብቻ ይደምራል።
  • SafeDAgger ከማጣቀሻ ፖሊሲ መዛነፍን ለሚተነብይ ሁለትዮሽ ክላሲፋየር ይሰጠዋል፤ EnsembleDAgger ደግሞ ዝቅተኛ የአንሳምብል ቫሪያንስ እና ከኤክስፐርቱ አክሽን ጋር ትንሽ ርቀት በአንድ ጊዜ እንዲኖር ይጠይቃል።
  • LazyDAgger ቁጥጥር እንዳይወዛወዝ ሂስቴሪሲስ ይጨምራል፤ ThriftyDAgger ደግሞ በግልጽ በተቀመጠ የጣልቃ ገብነት በጀት ስር በአዲስነት ወይም በተገመተ ስጋት ላይ ተመስርቶ በሩን ይቆጣጠራል።
  • ሮቦት-ተቆጣጣሪ ምልክቶች የትርፍ ጊዜ-ደረጃ ክንድ ላይ ያለ ፋይን-ትዩን የተደረገ VLA ብዙውን ጊዜ የማይኖረውን ነገር ይፈልጋሉ፦ የማጣቀሻ ፖሊሲ፣ ርካሽ አንሳምብል፣ ወይም የተስተካከለ ኤፒስቲሚክ እርግጠኛ አለመሆን።
  • በሩ የዘዴው ግማሽ ብቻ ነው። ከዚያ በኋላ ለጣልቃ ገብነት ክፍሎች ምን እንደሚደረግ — መቀላቀል፣ ክብደት መስጠት፣ መደመር — ዙሩ ማንኛውንም ነገር እንዳሻሻለ ወይም እንዳላሻሻለ ይወስናል።

ሰው-ተቆጣጣሪ እና ሮቦት-ተቆጣጣሪ፦ አስፈላጊው ክፍፍል

መስተጋብራዊ አስመስሎ መማር የራሱ ጥናት-ዳሰሳ (survey) አለው፤ Celemin እና ባልደረቦቻቸው በግብረመልስ አይነት፣ በይነገጽ፣ የመማሪያ ሞዴል፣ የተጠቃሚ ልምድ፣ አጠቃቀም እና መመዘኛ (benchmark) መሰረት ይመድቡታል። ምህንድስናዎን የሚወስነው ልዩነት ግን ከእነዚያ ዘንጎች ሁሉ ቀላል ነው፣ የቅርብ ጊዜ ስራም በቀጥታ ይሰይመዋል፦ አንድ ዘዴ ሰው-ተቆጣጣሪ ተቆጣጣሪው መቼ ጣልቃ መግባት እንዳለበት ሲወስን፣ እና ሮቦት-ተቆጣጣሪ ኤጀንቱ መቼ እርዳታ መጠየቅ እንዳለበት ሲወስን ነው (Cai et al., 2025)። ሌላው ሁሉ ከእነዚያ ሁለት ምርጫዎች አንዱን የሚያገለግል መሳሪያ ነው። ልውውጡ ከመጀመሪያውኑ ይታያል፦ የሰው በር ተከታታይ ትኩረት ያስከፍላል፣ የሮቦት በር ደግሞ ያንን ትኩረት መልሶ ለመስጠት ቃል ይገባል — ነገር ግን የሚቆጣጠርበት ምልክት አስተማማኝ ከሆነ ብቻ ነው፣ ያንን ምልክት መገንባትም የራሱ የምርምር ችግር ነው።

SafeDAgger፦ የራሱን መዛነፍ የሚተነብይ ክላሲፋየር

የZhang እና Cho SafeDAgger (2016) ከእነዚህ በሮች ውስጥ የመጀመሪያው ነው። የማጣቀሻ ፖሊሲውን መጠየቅ ውድ ክፍል ስለሆነ፣ ሁለተኛ ትንሽ ኔትወርክ — የደህንነት ፖሊሲው — መጠየቅ ጨርሶ ዋጋ ያለው መሆኑን ይተነብያል። "ዋናው ፖሊሲ ሳይጠየቅ ከማጣቀሻ ፖሊሲ ሊዛነፍ የመቻሉን እድል የሚያሳይ ሁለትዮሽ መለያ ይመልሳል"። መለያው የሚገለጸው በሁለቱ ፖሊሲዎች አክሽኖች መካከል ካለ ስኩዌር የተደረገ L2 መዛነፍ ከtau ገደብ ጋር ሲነጻጸር ነው፣ ክላሲፋየሩም በሁለትዮሽ ክሮስ-ኢንትሮፒ ይሰለጥናል። በሩጫ ጊዜ ለእያንዳንዱ ሁኔታ ተማሪው መንዳቱን መቀጠል እንዳለበት ወይም ማጣቀሻው መረከብ እንዳለበት ይወስናል። አጭር ማጠቃለያው በመኪና ውድድር አስመሳይ ውስጥ ያነሱ የማጣቀሻ ጥያቄዎችን እንዲሁም ደራሲዎቹ ለራስ-ሰር ስርዓተ-ትምህርት ውጤት የሚያደርጉትን የኮንቨርጀንስ ፍጥነት መጨመር ይዘግባል፣ ለሁለቱም ግን ቁጥር ሳይሰጥ።

ችግሩ ያለው በውጤቶቹ ሳይሆን በትርጓሜው ውስጥ ነው። ክላሲፋየሩን ማሰልጠን ለማስተካከል በሚያገለግል እያንዳንዱ ሁኔታ ላይ የማጣቀሻ ፖሊሲውን አክሽን ይፈልጋል፣ ይህም ማጣቀሻው ሌላ ፕሮግራም መሆኑን ያስቀምጣል። ማጣቀሻዎ በመሪ ክንድ የሚሰራ ሰው ከሆነ፣ ያ የመለያ ስብስብ ርካሽ አይደለም፣ ዘዴውም ለእሱ ተብሎ የተነደፈለትን ባህሪ ያጣል።

EnsembleDAgger፦ ጥርጣሬም ልዩነትም፣ ሁለቱም

Menda, Driggs-Campbell እና Kochenderfer (2019) በሩን እንደ እድል (probabilistic) ጥያቄ ይመለከቱታል። EnsembleDAgger "የነርቭ ኔትወርኮች አንሳምብልን በመጠቀም የጋውሺያን ሂደትን (Gaussian Process) ይገምታል"፣ የአንሳምብሉን ቫሪያንስ እንደ መተማመኛ ተለዋጭ (confidence proxy) ያነብበዋል፦ ከፍተኛ ቫሪያንስ ከስልጠና ውሂቡ የተለየ አካባቢን ያመለክታል፣ ይህም — ኤክስፐርቱ የውድቀት ሁኔታዎችን እንደሚያስወግድ ከተገመተ — ከውድቀት ቅርበት ጋር ይዛመዳል። ደንቡ ውሁድ (conjunction) ነው። ተማሪው መስራት የሚችለው የአማካይ አክሽኑ ከኤክስፐርቱ አክሽን ያለው L2 ርቀት ከአንድ ገደብ (ልዩነት) በታች ሲቆይ ብቻ ነው እና የተተነበየው አክሽኑ ቫሪያንስ ደግሞ ከሁለተኛ ገደብ (ጥርጣሬ) በታች ሲቆይ ነው። ከሁለቱ አንዱ ካልተሳካ፣ ኤክስፐርቱ ቁጥጥሩን ይረከባል። ግቡ የውድቀትን እድል እየገደቡ የተማሪውን የአክሽኖች ድርሻ ማብዛት ነው፤ ጽሁፉ በተገለበጠ ፔንዱለም (inverted pendulum) እና MuJoCo HalfCheetah ላይ ከሌሎች የDAgger ስሪቶች ጋር ሲነጻጸር የተሻለ ደህንነት እና ትምህርት እንደተገኘ ይዘግባል።

የልዩነት (discrepancy) ቃሉ የኤክስፐርቱን አክሽን ይፈልጋል

ይህ ሙሉውን ደንብ ለእጅ-አልባ ቁጥጥር (hands-off supervision) በጸጥታ ብቁ ያደርገዋል። በተማሪው አክሽን እና በኤክስፐርቱ አክሽን መካከል ያለው ርቀት በዚያ ሁኔታ፣ በዚያ ቅጽበት የኤክስፐርቱን አክሽን ይፈልጋል። በስክሪፕት ከተዘጋጀ ኤክስፐርት ጋር ይህ ችግር የለውም። ከሰው ጋር ግን ሰው ተከታታይ አክሽኖችን ማመንጨት አለበት — በትክክል የበር ስሪቶች ሊያስወግዱት የፈለጉት ሸክም። የጥርጣሬ ቃሉ ብቻውን እጅ-አልባ ነው፤ ውሁዱ ግን አይደለም።

LazyDAgger፦ መቀያየሪያው እንዳይንቀጠቀጥ ማቆም

Hoque እና ባልደረቦቻቸው (2021) ቀደምት ጽሁፎች ያልለኩትን ወጪ ጠቁመዋል፦ ራሱን መቀያየሪያውን። እያንዳንዱ ጣልቃ ገብነት "ሰው እየሰራው ያለውን ሌላ ስራ ያቋርጣል፣ በተቆጣጣሪ እና ራስ-ገዝ ቁጥጥር (autonomous control) መካከል በሚደረግ እያንዳንዱ የአውድ መቀያየር (context switch) መዘግየት ያስከትላል፣ ለማከናወንም ጊዜ ይጠይቃል"። በደቂቃ አስር ጊዜ የሚከፈት እና የሚዘጋ በር ተመሳሳይ ራስ-ገዝ ድርሻ እያለ ለአስር ሰከንድ አንድ ጊዜ ብቻ ከሚከፈት በር የከፋ ነው። LazyDAgger SafeDAgger ን ያልተመጣጠኑ ገደቦችን (asymmetric thresholds) በመጨመር ያሰፋዋል — ወደ ተቆጣጣሪ ቁጥጥር ለመግባት ከመቆየት ይልቅ ይበልጥ ከባድ እንዲሆን — ስርዓቱም በድንበሩ ላይ እንዳይወዛወዝ ለማድረግ። በአስመሳይ ውስጥ "በ3 ተከታታይ ቁጥጥር ስራዎች ላይ ከSafeDAgger ጋር ሲነጻጸር በአማካይ 60% የአውድ መቀያየሮችን ሊቀንስ ይችላል፣ ዘመናዊውን የፖሊሲ አፈጻጸም እያስጠበቀ"፤ ከABB YuMi ጋር በጨርቅ አያያዝ (fabric manipulation) ደግሞ "በአፈጻጸም ጊዜ ከSafeDAgger 60% ከፍ ያለ ስኬት መጠን እያስመዘገበ የአውድ መቀያየሮችን በ60% ይቀንሳል"።

ThriftyDAgger፦ አዲስነት ወይም ስጋት፣ በበጀት ስር

ThriftyDAgger (Hoque et al., CoRL 2021) ከፖሊሲው ይልቅ ከተቆጣጣሪው በጀት ይነሳል። "ጣልቃ ገብነቶችን የሚጠይቀው በበቂ ሁኔታ (1) አዲስ በሆኑ፣ ሮቦት ፖሊሲው ሊኮርጅ የሚችለው የማጣቀሻ ባህሪ በሌለበት፣ ወይም (2) አደገኛ በሆኑ፣ ሮቦቱ ተግባሩን ስለማጠናቀቁ ዝቅተኛ መተማመን ባለበት ሁኔታዎች ላይ ብቻ ነው፣ የተማረ መቀያየሪያ ፖሊሲ በመጠቀም"፣ ያንን ስጋት ለመገመት አዲስ መለኪያም ይዞ። በጀቱ ግቤት ነው፣ ውጤት አይደለም፦ ምን ያህል የሰው ጊዜ እንደሚያጠፉ እርስዎ ይገልጻሉ። በአፈጻጸም ጊዜ ሲተገበር ዘዴው "በአስመሳይ እና በአካላዊ ስራዎች ላይ 100% የስኬት መጠን ያስመዘግባል"፣ ከሶስት-ሮቦት መርከቦች (fleet) ጋር በትኩረት ስራ ጎን ለጎን አስር ተሳታፊዎችን ያካተተ የተጠቃሚ ጥናትም "ከሚቀጥለው ምርጥ አልጎሪዝም ጋር ሲነጻጸር የተቆጣጣሪውን ሸክም እየቀነሰ የሰውንና የሮቦትን አፈጻጸም በቅደም ተከተል በ58% እና በ80% ይጨምራል" ይላል። የመርከቦች ሁኔታ ለዚህ ስራ ተፈጥሯዊ ቤት ነው፤ Fleet-DAgger በኋላ ከበርካታ ሮቦቶች እና ተቆጣጣሪዎች ጋር የሚደረግ መስተጋብራዊ የመርከቦች መማርን መደበኛ አድርጎታል፣ የሰው ጥረት ውጤት መመለሻ (Return on Human Effort) የተባለውን መጠን እንደ ማመቻቻ ግብ በማቅረብ።

HG-DAgger፦ ሰው በሩን ይይዛል

Kelly et al. (2019) በተቃራኒው አቅጣጫ ይሄዳሉ። ምንም መቀያየሪያ ፖሊሲ የለም። ተማሪው "ኤክስፐርቱ ጀማሪው ደህንነቱ ወደማይጠበቅ የሁኔታ ቦታ (state space) ክልል መግባቱን እስከሚያስተውል ድረስ" ይሰራል፣ በዚያ ቅጽበትም ኤክስፐርቱ ቁጥጥሩን ይረከባል ስርዓቱንም መልሶ ይመራል። የመደመሪያ ደንቡ ጥብቁ ክፍል ነው፦ "የኤክስፐርት አክሽን መለያዎች የሚሰበሰቡት እና ወደ ዳታሴቱ የሚጨመሩት በእነዚህ የማገገሚያ ጉዞዎች ወቅት ብቻ ነው፣ በእነዚህም ወቅት የሰው ኤክስፐርት ስርዓቱን ያለምንም መቆራረጥ ይቆጣጠራል።" ሰው ተመልካች ብቻ ሆኖ ባለበት ጊዜ ምንም ነገር አይሰየምም።

በመቀያየሪያው ላይ ብቻ አያቆምም። HG-DAgger በተጨማሪ "ሙሉ በሙሉ የሰለጠነው ጀማሪ በተለያዩ የሁኔታ ቦታ ክልሎች ውስጥ ያለውን አፈጻጸም ለመተንበይ ሊያገለግል የሚችል በሞዴል-እርግጠኛ-አለመሆን ላይ የተመሰረተ የስጋት መለኪያ ደህንነት ገደብ ይማራል"፦ ሰው ጣልቃ በገባባቸው ቅጽበቶች ተማሪው ምን ያህል እርግጠኛ እንዳልነበረ ይመዘግባል፣ ከእነዚያ መዝገቦችም ተማሪው ለመጨረሻ ቅርጹ በጣም ከሚመስልበት የመጨረሻውን ሩብ ያማክላል። ይህ ሮቦቱ የሚያንቀሳቅሰው በር ሳይሆን የተጠናቀቀው ፖሊሲ የት እንደሚቆይ የሚጠበቅበትን የሚነግር መመርመሪያ ነው። ግምገማው በአስመሳይ እና በእውነተኛ-ዓለም የመንዳት ስራ ላይ የተካሄደ ሲሆን ከDAgger እና ከቢሄቪየር ክሎኒንግ ሁለቱም የተሻለ አፈጻጸም እንደተገኘ ይዘግባል።

አንድ ተዛማጅ የስራ መስመር እንደ መለያ የሚቆጠረውን ይለውጣል። የSpencer እና ባልደረቦቻቸው የኤክስፐርት ጣልቃ-ገብነት መማር (Expert Intervention Learning) "ማንኛውም መጠን ያለው የኤክስፐርት ግብረመልስ፣ በጣልቃ ገብነት ይሁን ባለመግባት፣ ስለ አሁኑ ሁኔታ ጥራት፣ ስለ አክሽኑ ምርጥነት፣ ወይም ስለ ሁለቱም መረጃ ይሰጣል" ይላል፣ ይህም በተማሪው የዋጋ ፈንክሽን (value function) ላይ እንደ ገደብ ተመስርቶ ተቀርጾ ከno-regret ኦንላይን መማር ጋር ተፈትቷል። በዚህ አረዳድ መሰረት፣ ሰው ተመልክቶ ምንም ያላደረገባቸው ጊዜያት ባዶ ሳይሆኑ ደካማ አዎንታዊ ማስረጃ ናቸው። EIL ግጭትን ማስወገድ ከአንድ ደቂቃ ገደማ የኤክስፐርት ቁጥጥር ይማራል።

በተቆጣጣሪ ስር በሚደረግ የፖሊሲ ሩጫ ወቅት ውሂብ ለመሰብሰብ ካሜራዎች የተቀመጡበት የሮቦት ክንድ የስራ ቦታ
ሰው-ተቆጣጣሪ ዙር መዝጋቢ (recorder) ተያይዞለት ያለ ተራ የኢንፈረንስ ሩጫ ነው። ኦፕሬተሩ የነዳቸው ፍሬሞች ምልክት ይደረግባቸዋል፤ የተቀሩት እንዳሉ ይቆያሉ።

ስሪቶቹ ጎን ለጎን

ዘዴበሩን የሚከፍተው ማን ነውምልክትየሚያስፈልጉ ነገሮችየተዘገበው
DAgger (Ross et al., 2011)ማንም አይደለም — ተማሪው ሁልጊዜ ይነዳልየለም፤ ኤክስፐርቱ የተጎበኘውን እያንዳንዱን ሁኔታ ይሰይማልቁጥጥር ሳይኖረው off-policy ሁኔታዎችን መሰየም የሚችል ኤክስፐርትበተማሪው የሁኔታ ስርጭት ስር ዋስትና ያለው no-regret ቅነሳ
HG-DAgger (Kelly et al., 2019)የሰው ተቆጣጣሪተቆጣጣሪው ሁኔታው ደህንነቱ የተጠበቀ አይደለም የሚል ፍርድየሚመለከት ሰው፣ እና ንጹህ የቁጥጥር ርክክብበአስመሳይ እና በእውነተኛ የመንዳት ስራ ላይ DAgger ን እና ቢሄቪየር ክሎኒንግን ይበልጣል፤ የስጋት ገደብንም ይማራል
SafeDAgger (Zhang & Cho, 2016)ሮቦቱከtau በላይ ካለው ማጣቀሻ የL2 መዛነፍ ሁለትዮሽ ክላሲፋየርለክላሲፋየሩ መለያዎች ሊጠየቅ የሚችል የማጣቀሻ ፖሊሲበውድድር አስመሳይ ውስጥ ያነሱ የማጣቀሻ ጥያቄዎች፣ ፈጣን ኮንቨርጀንስ (ቁጥር አልተሰጠም)
EnsembleDAgger (Menda et al., 2019)ሮቦቱየአንሳምብል ቫሪያንስ እና ወደ ኤክስፐርቱ አክሽን ያለው ርቀት፣ ሁለቱም ከገደብ በታችየኔትወርኮች አንሳምብል እና በእያንዳንዱ እርምጃ የኤክስፐርቱ አክሽንበፔንዱለም እና HalfCheetah ላይ የተሻለ ደህንነት እና ትምህርት
LazyDAgger (Hoque et al., 2021)ሮቦቱ፣ ከሂስቴሪሲስ ጋርየSafeDAgger ምልክት ከተለያዩ የመግቢያ እና የመውጫ ገደቦች ጋርSafeDAgger የሚፈልገው ነገር፣ እና ለማስተካከል ሁለተኛ ገደብበ3 ስራዎች ላይ ~60% ያነሰ የአውድ መቀያየር፤ በYuMi ጨርቅ ላይ 60% ከፍ ያለ ስኬት
ThriftyDAgger (Hoque et al., 2021)ሮቦቱ፣ በበጀት ስርአዲስነት፣ ወይም ተግባሩን አለማጠናቀቅ የተገመተ ስጋትየተማረ የስጋት ገማች እና የተገለጸ የጣልቃ ገብነት በጀትበአፈጻጸም ጊዜ 100% ስኬት፤ የተጠቃሚ ጥናት (N=10)፦ ከቀጣዩ ምርጥ ጋር ሲነጻጸር 58% እና 80% ጭማሪ
EIL (Spencer et al., 2020)ሰው — ጣልቃ አለመግባትም ይቆጠራልጣልቃ ገብነት እና አለመግባቱ በዋጋ ፈንክሽን ላይ እንደ ገደብበዋጋ ገደብ ላይ የሚደረግ ኦንላይን no-regret መማርግጭትን ማስወገድ ከአንድ ደቂቃ ገደማ የኤክስፐርት ቁጥጥር

እያንዳንዱ በር የሚገዛው እና የሚያስከፍለው

የ"የሚያስፈልጉ ነገሮች" አምድን ወደታች ካነበቡ አንድ ንድፍ ይወጣል፦ እያንዳንዱ ሮቦት-ተቆጣጣሪ ምልክት መመረት ያለበት ተለዋጭ (proxy) ነው፣ እያንዳንዱ ተለዋጭም የራሱ ሂሳብ አለው።

  • የልዩነት (discrepancy) ምልክቶች (SafeDAgger, LazyDAgger, ግማሽ የEnsembleDAgger ደንብ) የማጣቀሻ ፖሊሲ ይፈልጋሉ። ወይ በስክሪፕት የተዘጋጀ ኤክስፐርት አለዎት፣ በዚህ ሁኔታ አስደሳቹ ችግር አስቀድሞ ተፈትቷል፣ ወይም ርቀት ሊሰላ እንዲችል ሰው በስተጀርባ አክሽኖችን ማመንጨቱን ይቀጥላል።
  • የጥርጣሬ (doubt) ምልክቶች የተስተካከለ ኤፒስቲሚክ እርግጠኛ አለመሆን ይፈልጋሉ። የትናንሽ ቁጥጥር ኔትወርኮች አንሳምብል ይህንን ይገምታል፤ የሶስት-ቢሊዮን-ፓራሜትር vision-language-action ሞዴል አንሳምብል ግን መጀመሪያ የማህደረ ትውስታ እና የመዘግየት ችግር ነው።
  • የአዲስነት እና የስጋት ምልክቶች በበቂ ስኬታማ እና ያልተሳኩ ሩጫዎች ላይ የተስተካከለ የተማረ የተግባር-ማጠናቀቅ ገማች ይፈልጋሉ። ገና እያሰራችሁት ባለ ስራ ላይ፣ ያ ውሂብ በመጀመሪያው ዙር ላይ የለም።
  • የሰው በር ትኩረት እንጂ ሌላ ምንም አይፈልግም — በመጀመሪያው ቀን፣ በማንኛውም የፖሊሲ አርክቴክቸር ላይ፣ ምንም ተጨማሪ ሞዴል ሳያሰለጥኑ የሚገኘው ብቸኛው ምልክት ነው።
  • ምንም ሮቦት-በር ሰውን ከክፍሉ አያስወግድም። የሚቀንሱት ሰው ምን ያህል ጊዜ መስራት እንዳለበት እንጂ መገኘት እንዳለበት ወይም እንደሌለበት አይደለም።

በሩ በሚያመነጨው ነገር ላይ የበለጠ ጸጥ ያለ ልዩነት አለ። ሮቦት-በር በጉዞ ማካከል ሲነሳ ለአንድ ሰው በዘፈቀደ አቀማመጥ ላይ ያለ የሚንቀሳቀስ ክንድ ያስረክባል። የሰው በር ግን ኦፕሬተሩ ቅጽበቱን እንዲመርጥ ያደርገዋል — ከመድረሱ በኋላ፣ ከመያዙ በፊት፣ በእንቅስቃሴ አጋማሽ ላይ ሳይሆን። ከሁለቱ የሚገኙት የማገገሚያ ክፍሎች እኩል ንጹህ አይደሉም፣ እነዚያ ክፍሎችም የዙሩ ጠቅላላ ውጤት ናቸው።

ለምን ሰው-ተቆጣጣሪው ስሪት በእውነተኛ ሃርድዌር ላይ ያሸንፋል

ይህ የምህንድስና ክርክር ነው፣ የመመዘኛ (benchmark) ውጤት አይደለም — ያገኘነው ምንም ጽሁፍ ሁሉንም አምስት በሮች በተመሳሳይ ማኒፑሌተር በተመሳሳይ የፖሊሲ ክፍል ላይ አላሄደም። በአራት ነጥቦች ላይ ይመሰረታል።

አንደኛ፣ ተቆጣጣሪው በምንም ሁኔታ እዚያ ይኖራል። ማንም SO-100 ክንድን ሊጥላቸው ከሚችላቸው ነገሮች አጠገብ ተመልካች ሳይኖረው አይተውም። አንድ ሰው ከተመለከተ በኋላ፣ የመረከቢያ ቁልፍ መስጠት ተጨማሪ ወጪው ወደ ዜሮ ይጠጋል፤ የተስተካከለ የስጋት ገማች መገንባት ግን ራሱ ፕሮጀክት ነው።

ሁለተኛ፣ በዘመናዊ ፖሊሲ ላይ በትክክል ሊለኩ የሚችሉት እርግጠኛ-አለመሆን ብዙውን ጊዜ የተሳሳተ መጠን ነው። Diffusion ወይም flow-matching ራስ (head) በተናሙ የአክሽን ቁርጥራጮች (action chunks) ላይ ቫሪያንስን ያመነጫል፣ ያ ቫሪያንስም ራሱ እንዲወክል የሰለጠነውን ብዙ-ዘዬነት (multimodality) እንጂ ስለ ሁኔታው ኤፒስቲሚክ አለማወቅን አያንጸባርቅም። የEnsembleDAgger የጥርጣሬ ቃል አንሳምብልን የሚጠቀመው በትክክል ሁለተኛውን ለመያዝ ነው። ሁለቱ ተመሳሳይ ቁጥር ይመስላሉ፣ ግን አይደሉም፤ የaction chunking እና flow matching ግቤቶች እነዚያ ራሶች (heads) በመጀመሪያ ደረጃ አክሽኖችን እንዴት እንደሚያመነጩ ይሸፍናሉ።

ሶስተኛ፣ በማኒፑሌሽን ውስጥ ጠቃሚ የሆኑ ውድቀቶች ብዙውን ጊዜ ስታትስቲካዊ ያልተለመዱ ሳይሆኑ የትርጉም (semantic) ችግሮች ናቸው። ግሪፐርን ሁለት ሴንቲሜትር ቀደም ብሎ የሚዘጋ ፖሊሲ፣ ወይም ከሁለት ተመሳሳይ ኩቦች መካከል ወደ ተሳሳተው በልበ-ሙሉነት የሚደርስ ፖሊሲ፣ በከፍተኛ-ቫሪያንስ ሁኔታ ውስጥ አይደለም — በልበ-ሙሉነት የተሳሳተ ነው። ምንም የቫሪያንስ ገደብ ይህንን አይይዘውም፤ የሚመለከት ሰው ግን ወዲያውኑ ይይዘዋል።

አራተኛ፣ የመለያ ጥራት — ዋናው የHG-DAgger ነጥብ፣ እናም በጣም ብዙ ጊዜ የሚዘለለው። ሰው ያለምንም መቆራረጥ ቁጥጥር ባደረገበት ጊዜ የተሰበሰቡ መለያዎች በሚንቀሳቀስ ስርዓት ላይ ከሚተረኩ መለያዎች ይበልጣሉ። ግቡ ለመደመር የሚገባ የእርማት ውሂብ ከሆነ፣ የማስረጃ ሸክሙ በራስ-ሰር በር ላይ ነው።

ሮቦት-በሮች የሚከፍሉበት ቦታ

አንድ ተቆጣጣሪ ለብዙ ሮቦቶች ኃላፊነት ሲወስድ ስዕሉ ይገለበጣል — ይህ የThriftyDAgger የተጠቃሚ ጥናት እና የFleet-DAgger መደበኛነት ኢላማ የሚያደርጉት ስርዓት ነው። በመርከቦች ሁኔታ የሰው ትኩረት ጥቂት ሀብት ነው፣ ያልተሟላ ድልድልም ካለመድልደል ይሻላል። በአንድ ጠረጴዛ ላይ ባለ አንድ ክንድ ግን በዚያ ስርዓት ውስጥ አይደሉም።

ሰው-ተቆጣጣሪው ዙር፣ አስቀድሞ ተዘጋጅቷል

በሚሰራ ኢንፈረንስ ክፍለ-ጊዜ (session) ወቅት መረከብ፣ በእርማት ክፍሎች ላይ በፍሬም-ደረጃ የጣልቃ ገብነት ምልክቶች፣ እያንዳንዱን ሩጫ ወደ እርማት ወይም ግምገማ መርምሮ መደርደር፣ እርስዎ ከመረጧቸው ምንጮች የተቀላቀለ ዳታሴት መገንባት፣ ከነባር ቼክፖይንት ስልጠናን መቀጠል — እነዚህ በእጅ ተጽፈው ሳይሆን አስቀድመው የተገነቡ ናቸው። መረከብ በመሪ ክንድ ይሰራል፣ ወይም እሱ ከሌልዎት በኪቦርድ እና ስላይደር ይሰራል።

የDAgger ዙር እንዴት እንደሚሰራ ይመልከቱ

በሩ የዘዴው ግማሽ ነው፤ ውሂብ አያያዝ ደግሞ ሌላኛው ግማሽ ነው

በር የትኞቹ ፍሬሞች በሰው እንደተነዱ ይወስናል፣ በእነሱ ላይ ምን መደረግ እንዳለበት አይደለም፣ ያ ሁለተኛ ውሳኔ ደግሞ ዙሮች በብዛት የሚባክኑበት ነው። የመጀመሪያው ደንብ በDAgger ውስጥ ያለው "D" የሚወክለው ነው፦ ደምር፣ አትተካ። አንድ ቼክፖይንት ን ጥቂት መቶ የእርማት ፍሬሞች ላይ ብቻ ፋይን-ትዩን ማድረግ ከማገገሚያዎች በስተቀር ሌላ ምንም ያላየ እና መደበኛውን ጉዞ የረሳ ሞዴል ይሰጥዎታል።

ሁለተኛው ደንብ የጣልቃ ገብነት ፍሬሞች ተራ ፍሬሞች አለመሆናቸው ነው። Mandlekar et al. ኦፕሬተሮች ፖሊሲዎችን እንዲከታተሉ እና ውድቀት ሲፈጠር እንዲረከቡ የሚያስችል ለ6-DoF ማኒፑሌሽን የርቀት-ቴሌኦፐሬሽን ስርዓት ገንብተዋል፣ ከዚያም "ፖሊሲው በጣልቃ ገብነቶች በኩል ማነቆዎችን እንዴት ማለፍ እንደሚችል እንዲማር የሚያበረታታ" አልጎሪዝም በመጠቀም በተደጋጋሚ አሰልጥነዋል፤ በዚያ ውሂብ ላይ የሰለጠኑ ኤጀንቶች ተመሳሳይ ቁጥር ባላቸው ተራ ማሳያ ናሙናዎች ከሰለጠኑ ኤጀንቶች የተሻለ አፈጻጸም አሳይተዋል። Sirius ሀሳቡን ወደ ማሰማራት (deployment) ይገፋዋል፣ "የስልጠና ናሙናዎችን በተገመተ የሰው እምነት እንደገና በመመዘን እና ፖሊሲዎችን በክብደት ቢሄቪየር ክሎኒንግ በማመቻቻ"። ሁለቱም ምን በሰው እንደተነዳ የሚያሳይ በፍሬም-ደረጃ ምልክት ይፈልጋሉ፣ ለዚህም ነው ጣልቃ ገብነት ምልክቱ ከሚመስለው በላይ አስፈላጊ የሆነው።

ሶስተኛው ደንብ ራስ-ሰር ቅልቅል ወጥመድ መሆኑ ነው። ምንጮቹን መዘርዘር የማይቻልበት የተገነባ ዳታሴት ቀጣዩ ዙር ሲባባስ ማረም (debug) የማይቻልበት ነው። በዚህ መድረክ ላይ ለዚህ ምክንያት የመገንባት (compose) ደረጃው ግልጽ ነው — ዋናው ዳታሴት ከእርማቶች ጋር፣ በእያንዳንዱ ምንጭ የኤፒሶድ ምርጫ፣ ውጤቱም ተራ LeRobot ዳታሴት ሲሆን እንደ ማንኛውም ሌላ ይመሳሰላል እና ይሰለጥናል፤ የዳታሴት ሰነድ የቅርጸት ጎኑን ይሸፍናል።

በዙር ውስጥ ያለ እርምጃየሚያመነጨውበጣም የተለመደው የስህተት መንገድ
recording አብርተው ኢንፈረንስ ማስኬድበፖሊሲው ራሱ የሁኔታ ስርጭት ስር ያለ ሩጫፖሊሲ እየነዳ እንደነበር ሳይታወቅ እንደ ተራ ቴሌኦፐሬሽን ተመዝግቦ
ውድቀት ሲፈጠር መረከብበፍሬም-ደረጃ የጣልቃ ገብነት ምልክት ያላቸው የእርማት ክፍሎችውበታዊ መወዛወዝን (cosmetic wobble) ማስተካከል፣ ማገገሚያ ሳይሆን ስልት ማስተማር
እያንዳንዱን ኤፒሶድ መርምሮ መደርደርእርማት፣ ግምገማ፣ ወይም መጣልሁሉንም ማቆየት፤ የተበላሸ መረከብ ኤፒሶዱ ካለው ዋጋ በላይ ያስከፍላል
እርማቶቹን ማመሳሰል (sync)ከዋናው ጎን ያለ ስሪት ያለው ዳታሴትከአካባቢያዊ (local) ማሽኑ ፈጽሞ የማይወጡ እርማቶች
የተቀላቀለውን ዳታሴት መገንባትዋናው ከእርማቶች ጋር፣ ግልጽ ምርጫጸጥ ያለ ራስ-ሰር ቅልቅል፣ በኋላ የሚከሰት ማሽቆልቆል ወደ ምንጭ ሊታወቅ እንዳይችል
ከቼክፖይንት መቀጠልከቀዳሚው የተጀመረ ቼክፖይንትየኦፕቲማይዘር ማስቀጠል (resume) መጠበቅ፤ ክብደቶቹ ሞዴሉን ያስጀምራሉ እንጂ የኦፕቲማይዘር ሁኔታን አይመልሱም

አንድ ሰው በትክክል ሊይዘው የሚችል በር ማዘጋጀት

"ሰው ይወስናል" የሚለው ዝርዝር መግለጫ (specification) አይደለም። የተለያዩ ገደቦች ያሏቸው ሁለት ኦፕሬተሮች የማይነጻጸሩ ዙሮችን ያመነጫሉ፣ የሚንሸራተት ገደብም ማንበብ የማይችሉት አዝማሚያ ያመነጫል። ከመጀመሪያው ሩጫ በፊት መነሻዎቹን (triggers) ይጻፉ።

  1. በሩን የሚከፍቱትን ሁኔታዎች ይሰይሙ — አቀራረብ ከተወሰነ ልዩነት (margin) በላይ መዛነፍ፣ ግሪፐር ምንም ነገር ሳይይዝ መዘጋት፣ አንድ መገጣጠሚያ ወደ ገደብ መንሸራተት፣ ከአንድ ወይም ሁለት ሰከንድ በላይ መቆም (stall) — ዝርዝሩንም ለዙሩ ሳይለውጡ ያቆዩ።
  2. የማይከፍተውንም ይሰይሙ። ፖሊሲው ራሱ ችሎ የሚያገግምበት ከመጠን-ማለፍ (overshoot) የስልጠና ምልክት ነው፤ እዚያ መረከብ ቀድሞውኑ የሚያውቀውን ማገገሚያ ያጠፋል።
  3. ንጹህ ርክክብ እንዲኖር በበቂ ሁኔታ ቀድመው ይረከቡ፣ ሁኔታው ማገገም እንደሚችል ወዲያውኑ ይመልሱ።
  4. ለምን እንደተረከቡ በእያንዳንዱ ኤፒሶድ ይመዝግቡ። ከሶስት ዙር በኋላ ተመሳሳዩ ውድቀት ይመለስ እንደሆነ የሚያሳየው ብቸኛው መዝገብ ይህ ነው።
  5. ካሜራዎችን፣ የተግባር ጽሁፍን እና ኦፕሬተርን በዙሮች ውስጥ ሳይቀያየሩ ያቆዩ። አንዱን ከቀየሩ ቁጥሮቹ ሊነጻጸሩ አይችሉም።

በሜካኒካል መልኩ ርክክብ ሁለት ስሪቶች አሉት። በመሪ ክንድ በሚደረግበት ጊዜ፣ ቶርክ ከመተላለፉ በፊት መሪው የተከታዩን አሁናዊ አቀማመጥ መድረስ አለበት፣ አለበለዚያ ክንዱ ይዘላል፤ ይህ የማስተካከያ (alignment) እንቅስቃሴ በእውነተኛ ሃርድዌር ላይ ካለው ሰንሰለት ውስጥ በትንሹ የተፈተነው ክፍል ነው። መሪ ክንድ ከሌለ መረከቡ ከመጀመሪያው የቁልፍ ጠቅታ ጀምሮ በእጅ ነው፦ ተከታዩ ተይዞ ኦፕሬተሩ ከኪቦርድ በመገጣጠሚያ በመገጣጠሚያ ይገፋዋል ወይም ስላይደር ይጎትታል፣ በሰርቨር-ጎን ክላምፖች (clamps) እያንዳንዱ ግቤት ትንሽ እንዲሆን ተደርጎ — በእያንዳንዱ የቁልፍ ጠቅታ ጥቂት ዲግሪዎች፣ በእያንዳንዱ ስላይደር ማዘመኛ ጥቂቶች፣ ምክንያቱም ወደ ተያዘ አቀማመጥ ትልቅ እርምጃ ሰርቮ የሚያፈርስበት መንገድ ስለሆነ። ከቁልፍ ማያያዣዎች ጋር ያለው ደረጃ-በደረጃ ስሪት SO-100 ላይ ስለ DAgger ዙር የሚያሳይ የደረጃ-በደረጃ መመሪያ ውስጥ ይገኛል፤ ስለ ሁለቱም የቴሌኦፐሬሽን ሁነታዎች ዳራ ደግሞ የቴሌኦፐሬሽን ሰነዶች እና የመሪ-ተከታይ ግቤት ውስጥ ይገኛል።

የሚደገፉ የፖሊሲ አርክቴክቸሮች ከስልጠና እና ኢንፈረንስ ባህሪያቸው ጋር ንጽጽር
በሩ ከአርክቴክቸር ነጻ ነው (architecture-agnostic)። የትኛውን ፖሊሲ እንደሚያስተካክሉ የዙሩን የስልጠና ወጪ ይለውጣል እንጂ መረከብ እንዴት እንደሚሰራ አይለውጥም።

በሩ ምንም እንዳደረገ ማንበብ

የሰው-ተቆጣጣሪ ዙር መለኪያ የጣልቃ ገብነት መጠን ነው፦ የጣልቃ ገብነት ፍሬሞች በሩጫው ፍሬሞች ተካፍለው። አንድ ስራ ብቻ አለው — በዙሮች ውስጥ ካልቀነሰ፣ ዙሩ ምንም አላገኘም ማለት ነው፣ ቀጣዩም ከውሂብ መጠን ውጪ ሌላ ነገር መቀየር አለበት።

ያደላ (biased) መለኪያ ነው፣ እንዴት እንደሆነም ማወቅ አለብዎት። የፖሊሲውን ብቃት ልክ እንደሚለካው ሁሉ የኦፕሬተሩንም ገደብ ይለካል፣ ለዚህም ነው የመነሻ ዝርዝሩ (trigger list) ቋሚ ሆኖ የሚቆየው፤ በክፍለ-ጊዜ ውስጥ የሚላላ ኦፕሬተር ከበስተጀርባው ምንም ነገር የሌለው ወራጅ ኩርባ ያመነጫል። ክብደትንም (severity) ችላ ይላል — ግጭትን ለማስቆም አስር ፍሬሞች እና መያዝን ለመግፋት አስር ፍሬሞች ተመሳሳይ ይመስላሉ። የእርማት ውሂብ ፈጽሞ ካልተወሰደበት ቋሚ የግምገማ ስብስብ ጋር ያጣምሩት። ስለDAgger ዙር መለካት የሚያትተው ጽሁፍ የግምገማ ንድፉን ይሸፍናል፣ የግምገማ ኤፒሶዶችን ከስልጠና ቅልቅል ውጪ እንዴት ማድረግ እንደሚቻልም ጨምሮ።

የሰው በር፣ በእውነት
የሚሰጥዎት ነገር
  • በመጀመሪያው ቀን፣ በማንኛውም የፖሊሲ አርክቴክቸር ላይ፣ ምንም ተጨማሪ ሞዴል ሳያስተካክሉ ይሰራል
  • ምንም የቫሪያንስ ገደብ የማያገኛቸውን በልበ-ሙሉነት-የተሳሳቱ ውድቀቶች ይይዛል
  • ኦፕሬተሩ ሙሉ ቁጥጥር ባደረገበት ጊዜ፣ በራሱ በመረጠው ቅጽበት የተመዘገቡ እርማቶችን ያመነጫል
  • እንደ IWR እና Sirius ያሉ intervention-weighted ዘዴዎች የሚጠቀሙበትን በፍሬም-ደረጃ ምልክት ያመነጫል
የማይሰጥዎት ነገር
  • ተከታታይ ቁጥጥር ያስከፍላል፤ ወደ አንድ ሰው እና ብዙ ሮቦቶች ጥምርታ አይደረግም
  • በኦፕሬተር ወጥነት ላይ የተመሰረተ ነው — የሚንሸራተት ገደብ የጣልቃ ገብነት መጠንን ያበላሻል
  • በራሱ ምንም የስጋት ሞዴል አያመነጭም፤ የHG-DAgger የተማረ ገደብ እና የThriftyDAgger ገማች ተጨማሪ መሳሪያዎች ናቸው
  • ፍሬሞችን ይቆጥራል እንጂ ውጤቶችን አይደለም
  • እንደ የተቀያየረ ካሜራ ወይም በስህተት የተሰየመ የተግባር ጽሁፍ ካሉ ከቁጥጥር በላይ ካለ ምንጭ የሚመጣን የፖሊሲ ውድቀት ማዳን አይችልም

በዕይታ ውስጥ ማቆየት የሚገባቸው ክፍት ጥያቄዎች

መመዘኛዎቹ (benchmarks) ደካማ ናቸው። Spencer እና ባልደረቦቻቸው አስመስሎ መማር አካሄዶችን ለመፈተሽ የሚያገለግሉትን መርምረው "እውን ሊሆኑ የሚችሉ እና ቀላል ስለሆኑ በእውነተኛ-ዓለም ውሳኔ አሰጣጥ ችግሮች ውስጥ የሚታየውን ከባዱን የስህተት ድምር ስርዓት ለመያዝ በቂ አይደሉም" ብለው አግኝተዋቸዋል — በዙሪያው ካለው ጽሁፍ አንጻርም ተራ ቢሄቪየር ክሎኒንግ በእነሱ ላይ ጥሩ አፈጻጸም እንዳሳየ አግኝተዋል። ይህ በእነዚያ ስራዎች ላይ የተመሰረተ ማንኛውንም የDAgger ስሪቶች ደረጃ አሰጣጥ (ranking) ጨምሮ ከላይ ባለው ሰንጠረዥ ውስጥ ያሉ አንዳንድ ቁጥሮችን በጥርጣሬ ለማየት ምክንያት ነው።

በትላልቅ ፖሊሲዎች ላይ ያሉ ሮቦት-በሮችም አልተፈቱም። የAIM ስራ የሰውን ጣልቃ ገብነት ደንብ የሚመስል proxy Q-function በመጠቀም እርግጠኛ-አለመሆንን ይተካል፣ ከThriftyDAgger ጋር ሲነጻጸርም በመረከቢያ ወጪ እና በመማር ብቃት 40% መሻሻል ይዘግባል — ይህ ግን በተከታታይ እና ልዩነት (discrete) ቁጥጥር ውስጥ ነው፣ ማኒፑሌተርን በሚያንቀሳቅስ vision-language-action ሞዴል ላይ አይደለም። ከእነዚህ በሮች መካከል የትኛውም ወደ ፋይን-ትዩን የተደረገ VLA ይተላለፍ እንደሆነ ክፍት ነው። ጥናቱ (survey) ተዛማጅ ነጥብ ያነሳል፦ የመስኩ ቃላት እና አወቃቀር በጽሁፎች ውስጥ አንድ ወጥ አይደሉም፣ ይህም ዘዴዎችን ለማነጻጸር አስቸጋሪ ያደርገዋል። በራስዎ ክንድ ላይ፣ ማስረጃዎ ያለዎት ምዝግቦችዎ (logs) ናቸው።

ሰው የሚሰይመው በጣልቃ ገብነት ወቅት ብቻ ከሆነ HG-DAgger በእውነት DAgger ነው?

አስፈላጊውን ክፍል ይይዛል — ተማሪው በሚያመነጨው የሁኔታ ስርጭት ስር የተሰበሰበ፣ ከበፊቱ ጋር የተደመረ ውሂብ — ከሃርድዌር ጋር ንክኪ ተርፎ የማይኖረውንም ክፍል ይተዋል። Kelly et al. እንደ ስሪት ያቀርቡታል፤ የ2011 no-regret ዋስትና ሳይለወጥ አይተላለፍም።

በSO-100 ላይ ባለ ፋይን-ትዩን የተደረገ VLA ፖሊሲ ላይ ሮቦት-በር መጠቀም እችላለሁን?

በቀላሉ አይደለም። የSafeDAgger ክላሲፋየር የሌልዎት ሊጠየቅ የሚችል የማጣቀሻ ፖሊሲ ይፈልጋል። EnsembleDAgger አንሳምብል ይፈልጋል፣ ይህም ለብዙ-ቢሊዮን-ፓራሜትር ሞዴል በማህደረ ትውስታ ውስጥ በርካታ ቅጂዎችን እና የኢንፈረንስ ወጪያቸውን ማለት ነው። ThriftyDAgger ከመጀመሪያ ዙሮችዎ በፊት በሌሉ ስኬቶች እና ውድቀቶች ላይ የተስተካከለ የስጋት ገማች ይፈልጋል።

አንድ መረከብ ምን ያህል ጊዜ ሊወስድ ይገባል?

ፖሊሲው ከመቀጠል ወደሚችልበት ሁኔታ ለመድረስ የሚበቃ ብቻ፣ ከዚያ በላይ አይደለም፦ የተራዘሙ መረከቦች ሩጫውን ወደ ማሳያ ክፍለ-ጊዜ ይለውጡታል፣ የእርማት ስብስቡንም በመደበኛ ባህሪ ያጥለቀልቁታል። የLazyDAgger ግኝት በሌላ አቅጣጫም ይቆርጣል — በጣም ብዙ አጫጭር መቀያየሮችም የራሳቸው ወጪ አላቸው።

በተስተካከሉ ክፍሎች ላይ ብቻ ማሰልጠን አለብኝን?

አይ — ዙርን ለማባከን በጣም የተለመደው መንገድ ይህ ነው። በማገገሚያዎች ላይ ብቻ ፋይን-ትዩን የተደረገ ሞዴል ከማገገሚያዎች በስተቀር ሌላ ምንም አላየም። እርማቶችን ምንጮች በግልጽ ተመርጠው ወደ ዋናው ዳታሴት ይቀላቅሉ፤ ከዚያም አልፎ፣ በሰው-የተነዱ ፍሬሞችን ከመነጠል ይልቅ ክብደት (up-weight) የሚሰጡ እንደ IWR ወይም Sirius ያሉ intervention-weighted አካሄዶችን ይመልከቱ።

ከዙር በኋላ የጣልቃ ገብነት መጠን ካልቀነሰ ምን ይሆናል?

እንዳለ ይውሰዱት፦ ዙሩ አልረዳም ማለት ነው። እርማቶችን ከመጨመርዎ በፊት ርካሽ የሆኑ ማብራሪያዎችን ያረጋግጡ — የኦፕሬተሩ ገደብ ተንሸራቷል? እርማቶቹ ውበታዊ (cosmetic) ብቻ ነበሩ? የተገነባው ዳታሴት በእውነት ይዟቸዋል? ስልጠናው ከታሰበው ቼክፖይንት ተጀምሯል? በጸጥታ ከመሰረታዊ ሞዴል የተጀመረ ዙር ልክ እንደ መማር እንዳልቻለ ዙር ይመስላል።

ጣልቃ አለመግባት መረጃ ይይዛልን?

በኤክስፐርት ጣልቃ-ገብነት መማር (Expert Intervention Learning) መሰረት፣ አዎ፦ ተቆጣጣሪው ተመልክቶ ያልተንቀሳቀሰባቸው ጊዜያት ሁኔታው እና አክሽኑ ተቀባይነት እንደነበራቸው እንደ ደካማ ማስረጃ ይነበባሉ፣ በዋጋ ፈንክሽን ላይ እንደ ገደብ ተቀርጾ። ይህንን ጨምሮ አብዛኞቹ ተግባራዊ pipeline ዎች ሰው የነዳውን ብቻ ምልክት ያደርጋሉ።

ለአንድ ጠረጴዛ ላይ ላለ ነጠላ ክንድ ምርጫው ተደርጓል፦ በሩን እራስዎ ይያዙ፣ የሚከፍተውን ይጻፉ፣ ጥረቱንም መቀያየሪያውን ራስ-ሰር ከማድረግ ይልቅ ከበስተጀርባው ባለው ውሂብ አያያዝ ላይ ያውሉ። የመድረኩ ጎን የተገለጸው በየDAgger ዙር ገጽ ላይ ነው፣ በእያንዳንዱ የፖሊሲ ቤተሰብ ያሉ የስልጠና አማራጮች ደግሞ በስልጠና እና ዋጋ ስር ይገኛሉ። ለዳራ፣ በአስመስሎ መማር እና SO-100 ላይ አስመስሎ መማር ይጀምሩ፤ ለመጀመሪያ ሩጫ ደግሞ የመጀመሪያ ፖሊሲዎን ያሂዱ አጭሩ መንገድ ነው።

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started