
የጣልቃ ገብነት መጠን - የጣልቃ ገብነት ፍሬሞች በሩጫው ፍሬሞች ተካፍለው - ሰው-በሚቆጣጠረው DAgger ዙር ውስጥ ካሉት እውነተኛ የግስጋሴ ምልክቶች ሁሉ በጣም ርካሹ ነው። ይህ ጽሁፍ ሁለት ሰዎች ተመሳሳይ ውጤት እንዲያሰሉ አድርጎ ይተረጉመዋል፣ እንዴት እንደሚመዘገብ ያሳያል፣ እና እሱ በአራት መንገዶች እንዴት ሊያሳስትዎት እንደሚችል ይዳስሳል፦ የኦፕሬተር ልማድ መያዝ፣ የሚንሸራተት የግምገማ ውቅር፣ በእርማቶች ላይ ብቻ ማሰልጠን፣ እና ማክሰኞ ከሰኞ በተለየ መንገድ የሚያርም ሰው።
አንድ የDAgger ዙር በውስጡ እያሉ ውጤታማ ሆኖ ይሰማል። ፖሊሲውን ያንቀሳቅሳሉ፣ መያዣውን ሲያዘናጋ ቁጥጥር ይወስዳሉ፣ እርማቶቹን ያስቀምጣሉ፣ እንደገና ያሰለጥናሉ፣ እና ቀጣዩ ሩጫ - በእርግጠኝነት ይላሉ - ትንሽ ለስላሳ ይመስላል። ከሁለት ዙሮች በኋላ ምንም እንደተለወጠ መናገር አይችሉም፣ ምክንያቱም "ትንሽ ለስላሳ" መጠን ስላልሆነ።
ዙሩ በእያንዳንዱ ዙር አንድ ቁጥር ያስፈልገዋል፣ እና በሰው-በሚቆጣጠረው ዙር ውስጥ ያ ቁጥር ማለት ይቻላል ነጻ ነው፦ ፖሊሲው ፈንታ እርስዎ ቁጥጥር የነበራችሁበት የሩጫው ክፍልፋይ። ይህ ጽሁፍ ሁለት ሰዎች ተመሳሳይ ውጤት እንዲያሰሉ ያደርገዋል፣ ይመዘግበዋል፣ የተገኘውን ከርቭ ያነባል፣ እና ብቻውን ሲቆም እንዴት በአራት መንገዶች እንደሚያሳስት ይሰይማል። ይህ ጽሁፍ ለሚገምተው ንድፈ ሃሳብ፣ ይመልከቱ የDAgger ማብራሪያ እና ሰው-በሚቆጣጠረው ስሪት፤ ተግባራዊ አቻው ደግሞ በSO-100 ላይ የDAgger ዙር ማስኬድ።
አጭሩ ስሪት
- •የጣልቃ ገብነት መጠን = የጣልቃ ገብነት ፍሬሞች / የሩጫው ፍሬሞች። ፍሬሞች እንጂ ክፍሎች (episodes) አይደሉም፣ እና አካፋዩ እርማት ላይ ያሳለፏቸውን ፍሬሞች ያካትታል።
- •በሶስት ዙሮች ላይ ጠፍጣፋ ከርቭ ማለት ዙሮቹ ምንም አላተረፉም ማለት ነው - አራተኛ ከመሰብሰብ ይልቅ ድብልቁን፣ ቼክፖይንቱን ወይም ስራውን ይቀይሩ።
- •እየቀነሰ የሚሄድ የጣልቃ ገብነት መጠን እየጨመረ የሚሄድ የስኬት መጠን ማለት አይደለም። እምነት እያደገ ሲሄድ ጣልቃ ለመግባት ያለዎት ገደብ ወደ ታች ይንሸራተታል።
- •የቀዘቀዘ የግምገማ ፕሮቶኮል ከሌለ - ተመሳሳይ የመነሻ አቀማመጦች፣ ዕቃዎች፣ ካሜራዎች፣ የሙከራ ብዛት - እየለኩ ያሉት ክፍሉን ነው።
- •በእርማቶች ላይ ብቻ ማሰልጠን የሁኔታ ስርጭትን ያዛባል። የIWR መልስ፦ የጣልቃ ገብነት እና ጣልቃ-ያልገባ ናሙናዎችን በእኩል መጠን መምረጥ ነው።
ለምን አንድ ዙር ቁጥር ያስፈልገዋል
DAgger ያለው በስርጭት ችግር ምክንያት ነው፣ እና የስርጭት ችግሮች በአይን አይታዩም። Ross እና Bagnell እንዳሳዩት አስመስሎ መማር በቋሚ የማሳያ ስብስብ ላይ ወደ ተደራራቢ ስህተቶች እና በጊዜ አድማስ ውስጥ በካሬ የሚያድግ የጸጸት ወሰን ይመራል፦ ተማሪው አሳያሪው የጎበኘውን ሁኔታዎች ከለቀቀ በኋላ፣ በውሂቡ ውስጥ እንዴት መመለስ እንዳለበት የሚነግረው ነገር የለም። DAgger ይህንን በመድገም ያስተካክለዋል - ፖሊሲውን ያስኬዱ፣ የሚጎበኟቸውን ሁኔታዎች ይሰይሙ፣ ያሰባስቡ፣ እንደገና ያሰለጥኑ - ይህንንም Ross, Gordon እና Bagnell ወደ ጸጸት-አልባ የመስመር ላይ መማር መቀነስ አድርገው ይገልጹታል።
ያ አቀራረብ ሰዎች የሚያልፉት አንድ ውጤት አለው። ዋስትናው የሚመለከተው በድግግሞሾች ላይ ያለውን የፖሊሲዎች ቅደም ተከተል ነው፣ ማንኛውንም ነጠላ ሩጫ አይደለም። ስለ የእርስዎ ሶስተኛ ዙር እንደረዳ ስለመሆኑ ምንም አይናገርም። ማወቅ የሚቻለው ብቸኛው መንገድ እያንዳንዱን ድግግሞሽ መለካት ነው። Kelly እና ባልደረቦቻቸው HG-DAgger ያስተዋወቁት ክላሲክ DAgger ጀማሪው አሁንም ቁጥጥር ላይ እያለ ባለሙያውን የተግባር ስያሜዎችን እንዲሰጥ ስለሚጠይቅ ነው፣ ይህም ወረቀቱ እንደሚከራከረው ደህንነትን ሊቀንስ ይችላል፣ እና ከሰው ባለሙያዎች ጋር፣ በአስተዋይ አክቲዌተር መዘግየት ምክንያት የስያሜ ጥራትን ሊያሳንስ ይችላል። HG-DAgger እንዲሁም በሞዴል-እርግጠኛ-አለመሆን ላይ ለተመሰረተ የአደጋ መለኪያ የደህንነት ገደብ ይማራል እንዲሁም በመንዳት ስራ ላይ ከDAgger እና ከባህርይ ክሎኒንግ በላይ የተሻለ አፈጻጸም ያሳያል። ምንም የጣልቃ ገብነት ቆጠራዎችን አያትምም፤ እነዚያን እርስዎ ራስዎ ያመርታሉ።
ሁለት ሰዎች ተመሳሳይ ቁጥር እንዲያገኙ መጠኑን መተርጎም
ትርጉሙ አንድ መስመር ብቻ ነው፦ የጣልቃ ገብነት ፍሬሞች በሩጫው ፍሬሞች ተካፍለው። አስቸጋሪው ነገር ሁሉ እንደ ፍሬም የሚቆጠረው ምንድን ነው እና እንደ ሩጫ የሚቆጠረው ምንድን ነው በሚለው ውስጥ ተደብቋል።
ፍሬሞች እንጂ ክፍሎች (episodes) አይደሉም
ቢያንስ አንድ ጣልቃ ገብነት ያላቸውን ክፍሎች መቁጠር ዋጋ ቢስ ነው፦ እያንዳንዳቸው አንድ ትንሽ ገፋፊ ያላቸው አስር ክፍሎች እና ሰማንያ በመቶ ያንቀሳቀሱባቸው አስር ክፍሎች ሁለቱም "10/10" ይሰጣሉ። የፍሬም ቆጠራ ለያቸዋል፣ እና ይህ ቅጂው ቀድሞውኑ ያለው ጥራት ደረጃ ነው - በLeRobot dataset format ውስጥ እያንዳንዱ የጊዜ ደረጃ አንድ ረድፍ ነው፣ ስለዚህ የጣልቃ ገብነት ባንዲራ ከሁኔታ እና ተግባር አጠገብ ያለ አንድ ቡሊያን አምድ ነው። እዚህ ላይ ቁጥጥር መውሰድ በጀመረበት ቅጽበት በእያንዳንዱ ፍሬም ይጻፋል እና ቁጥጥር ሲመለስ ይጠፋል።
አካፋዩ እርማቶቹን ያካትታል
ሁለት አካፋዮች ሊከራከሩ ይችላሉ - የሩጫው ጠቅላላ ፍሬሞች፣ ወይም ፖሊሲው በራስ ገዝነት ያንቀሳቀሳቸው ፍሬሞች - እና በከፍተኛ የጣልቃ ገብነት ደረጃዎች ላይ በጣም ይለያያሉ። ከ1000 ፍሬሞች 400ውን ቁጥጥር ቢወስዱ የመጀመሪያው 40 በመቶ ይሰጣል፣ ሁለተኛው ደግሞ 67 በመቶ። በመጀመሪያው መንገድ የተለካን አንድ ዙር በሁለተኛው መንገድ ከተለካ ቀጣይ ጋር ማነጻጸር እውነተኛ መሻሻል የሚጠፋበት መንገድ ነው። ጠቅላላ ፍሬሞችን ይውሰዱ እና ምርጫውን በተከታታይ አጋማሽ ላይ በፍጹም እንደገና አይመልከቱ።
ለርክክብ ፍሬሞች ምን እንደሚሆን አንዴ ይወስኑ
ሁልጊዜ ስፌት አለ። ቁጥጥር ሲተላለፍ፣ አንዳንድ ፍሬሞች ለየትኛውም ወገን አይገዙም፦ ክንዱ ተይዟል፣ መሪው (leader) እያስተካከለ ነው፣ ቅጂው ቀዝቅዟል። በዚህ ፓይፕላይን ውስጥ እነዚያ የርክክብ ፍሬሞች በጥሬው ዥረት ውስጥ ይቆያሉ እና ወደ ተመረጠው episode ውስጥ በፍጹም አይገቡም - እነሱ የፖሊሲ ባህርይም ሆነ ለስልጠና ተገቢ እርማት አይደሉም። ስፌቱን በእያንዳንዱ ዙር በተመሳሳይ መንገድ ይቁጠሩ፦ በ30 Hz፣ ስድስት ርክክቦች እያንዳንዳቸው የሁለት ሰከንድ ስፌት ያላቸው 360 ፍሬሞች ናቸው፣ ይህም አንድ የመቶኛ ነጥብ ለማንቀሳቀስ በቂ ነው።
ፍሬሞች ወይም ክፍሎች፤ ጠቅላላ ሩጫ ወይም ራስ-ገዝ-ብቻ፤ የርክክብ ፍሬሞች ውስጥ ወይም ውጪ። ከሶስቱ ውስጥ ማንኛውም በዙሮች መካከል በጸጥታ ቢቀየር ከርቭውን ትርጉም-አልባ ያደርገዋል። ሶስቱንም ይጻፉ።
ቁጥሩ ክፍለ-ጊዜውን እንዲተርፍ ማስመዝገብ
በሚያሄድ ሂደት የሁኔታ ፓነል ውስጥ ያለ መለኪያ ንባብ ብቻ ነው፦ ዳግም ሲጀመር ይጠፋል እና መቀነጫጨት (plot) አይቻልም። በእያንዳንዱ ሩጫ አንድ ተጨማሪ-ብቻ መስመር መላውን ተከታታይ ይሸፍናል - የትኛውን checkpoint እንዳንቀሳቀሱ ጨምሮ፣ ምክንያቱም ያ በእያንዳንዱ ዙር ስለሚቀየር እና መቀላቀላቸው ቀጥሎ የሚመጣውን ውጤት ልክ ያልሆነ ያደርገዋል።
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}ሁለት መስኮች ክብደቱን ይሸከማሉ። train_mix ለቀጣዩ የስልጠና ስራ የመገቡት ነው፤ ያለ እሱ ምንም ነገር ሊገለጽ አይችልም። eval_protocol ከዚያ በኋላ ያስኬዱትን ቋሚ ሙከራ ይሰይማል፣ እና ብዙ ጊዜ ባዶ ሆኖ የሚቀር መስክ ነው። በay-robots ኮክፒት ውስጥ የቁጥጥር-ውሰድ ሁኔታ ለሚያሄደው ክፍለ-ጊዜ የጣልቃ ገብነት ፍሬም ብዛትን ያሳውቃል፣ ስለዚህ መመዝገብ ከመሳሪያ ተከላ ይልቅ ግልባጭ ነው፤ የውሂብ ስብስብ ሰነድ በእያንዳንዱ-ፍሬም አምዶች የት እንደሚያርፉ ይሸፍናል።

ከርቭውን ማንበብ፦ ሶስት ዙሮች፣ አንድ ውሳኔ
ሶስት ዙሮች ለንባብ ዝቅተኛው ናቸው፣ ምክንያቱም ሁለት ነጥቦች ሁልጊዜ መስመር ስለሆኑ። ከታች ያለው ሠንጠረዥ ከየትኛውም ሩጫ የተገኙ መለኪያዎች ሳይሆኑ ቦታ-ያዥ ቁጥሮች ያሉት የመዝገብ አያያዝ ናሙና ነው። የሚፈልጉት በቋሚ ሙከራ ላይ በስኬት መጨመር የሚመሳሰል ነጠላ-አቅጣጫ ቅናሽ ነው።
| ዙር | የተነዳ ቼክፖይንት | ፍሬሞች | የጣልቃ ገብነት ፍሬሞች | መጠን | ስኬቶች (ከ20) |
|---|---|---|---|---|---|
| 0 (መነሻ) | base policy | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | ከዙር 0 ድብልቅ | 5 610 | 980 | 17.5 % | 10 |
| 2 | ከዙር 1 ድብልቅ | 5 412 | 611 | 11.3 % | 11 |
| 3 | ከዙር 2 ድብልቅ | 5 380 | 598 | 11.1 % | 12 |
ዙር አንድ እና ሁለት ስራ እየሰሩ ናቸው። ዙር ሶስት ግን አይደለም፦ 11.3 በአንጻር 11.1 በመቶ በአካላዊ ክንድ ላይ በሚለካ በማንኛውም ነገር ውስጥ ካለው ከሩጫ-ወደ-ሩጫ ልዩነት ውስጥ ነው፣ እና ተመሳሳይ እርማቶች ያለው አራተኛ ዙር አንድ ከሰዓት በኋላ ለምንም ነገር ያባክናል። ጠፍጣፋው ክፍል የሆነ መዋቅራዊ ነገር እንዲቀየር ይናገራል።
- የቀሩት ውድቀቶች በቴሌኦፐሬሽን ሊታረሙ የማይችሉ ናቸው - ከመድረሻ ውጪ ያለ ዕቃ፣ የመያዣ ጂኦሜትሪ፣ በገደቡ ላይ ያለ መገጣጠሚያ። ምንም የእርማት ውሂብ የኪነማቲክ ግድግዳን አያስተካክልም።
- እርማቶቹ ግሬዲየንቱን ለማንቀሳቀስ ከመሰረቱ የውሂብ ስብስብ አንጻር በጣም ጥቂት ናቸው፣ እና ምንም ነገር አይመዝናቸውም።
- እርማቶቹ እርስ በርስ ይቃረናሉ፣ ስለዚህ ፖሊሲው ሁለት ስልቶችን ያማካክላል እና በመካከላቸው ያርፋል።
- ውድቀቱ ከላይ ነው፦ ካሜራ ተንቀሳቅሷል፣ ብርሃኑ ተለውጧል፣ የእጅ አንጓ እይታ ከስልጠናው ጋር አይመሳሰልም።
- ስራው በዚህ ሃርድዌር ላይ ባለው በዚህ የፖሊሲ ክፍል ጣሪያ ላይ ነው፣ እና ቀጣዩ እርምጃ ተጨማሪ መሰረታዊ ውሂብ ነው።
የመጨረሻዎቹ ሁለቱ የዙሩ ውድቀቶች አይደሉም። በSirius-Fleet ውስጥ ለሰው ያለው ፍላጎት እየቀነሰ መሄድ የተነደፈ ውጤት ነው፦ የሮቦት ራስ-ገዝነት እየተሻሻለ ሲሄድ፣ የመዛባት ትንበያ ሰሪዎቹ የትንበያ መስፈርቶቻቸውን ያስተካክላሉ፣ ይህም ለሰው ጣልቃ ገብነት የሚቀርቡ ጥያቄዎችን ይቀንሳል እና ከጊዜ ወደ ጊዜ የሰውን የስራ ጫና ቀስ በቀስ ይቀንሳል። እዚያ መስፈርቱ ሆን ተብሎ ይስተካከላል። በእጅ በሚደረግ ዙር ውስጥ የእርስዎም ይስተካከላል፣ በጸጥታ - ስለዚህ ስራው ጣሪያው ላይ በመድረሱ ምክንያት ጠፍጣፋ የሆነ መጠን ኦፕሬተሩ ማስተዋል ስላቆመ ጠፍጣፋ ከሆነው ጋር በትክክል ይመሳሰላል። ይህም ቀጣዩ ችግር ነው።
ወጥመድ 1፦ የሚቀንስ መጠን የሚጨምር የስኬት መጠን ማለት አይደለም
የጣልቃ ገብነት መጠን የሚለካው በትክክል አንድ ነገር ብቻ ነው፦ ከሩጫው ምን ያህሉን የመቆጣጠር ውሳኔ እንዳደረጉ። ያ ውሳኔ የእርስዎ ነው፣ በእውነተኛ ጊዜ የሚወሰን፣ እናም ይንቀሳቀሳል። በዙር ዜሮ ላይ በመጀመሪያው መጥፎ አቀራረብ አንግል ላይ ቁጥጥር ይወስዳሉ፤ በዙር ሶስት ላይ ግን ፖሊሲው ከደርዘን የመሳሰሉት እንዳገገመ አይተው እንዲሞክር ይፈቅዳሉ። የእርስዎ ገደብ ተንቀሳቅሷል፤ ፖሊሲ ግን ላይንቀሳቀስ ይችላል። መጠኑ በሁለቱም ሁኔታ ይቀንሳል።
የሰው እምነት በሥነ ጽሑፍ ውስጥ ቢያንስ የተቀናበረ ግምት እንጂ የተገመተ ቋሚ አይደለም። Sirius የስልጠና ናሙናዎችን በተገመተ የሰው እምነት እንደገና ይመዝናል እና ፖሊሲውን በተመዘነ የባህርይ ክሎኒንግ ያሻሽላል፣ በፖሊሲ ስኬት መጠን ውስጥ ከዘመናዊው ደረጃ አንጻር በሲሙሌሽን 8 በመቶ እና በእውነተኛ ሃርድዌር 27 በመቶ መሻሻል ያሳውቃል፣ በእጥፍ የመገጣጠም ፍጥነት። ይህ እምነትን በውሂቡ ላይ እንደ ክብደት ይይዘዋል። በዙር ዜሮ እና በዙር ሶስት መካከል በአእምሮዎ ውስጥ ያለውን ገደብ አያስተካክልም።
ንሸራተቱን ማስወገድ አይችሉም፣ ስለዚህ መጠኑን ገደብዎ ሊነካው ከማይችለው ነገር ጋር ያጣምሩ፦ ጨርሶ ጣልቃ በማይገቡበት ቋሚ የሙከራ ስብስብ፣ ከዙሩ በፊት በተጻፈ መስፈርት አንጻር የሚመዘን። የተጣመረው የስኬት መጠን ቋሚ ሆኖ ሳለ የሚቀንስ መጠን የልማድ መያዝ ምልክት ነው - ለመያዝ ተገቢ ነው፣ ምክንያቱም ከዙሩ ውስጥ ሆኖ እንደ እድገት ስለሚሰማ።
| የጣልቃ ገብነት መጠን | በቋሚ ፕሮቶኮል ላይ የስኬት መጠን | በጣም አይነተኛ ንባብ |
|---|---|---|
| ይቀንሳል | ይጨምራል | ዙሩ ሰርቷል። ይቀጥሉ። |
| ይቀንሳል | ጠፍጣፋ | ገደብዎ ተንሸራቷል፣ ወይም እርማቶቹ ውድቀቶችን ሳያስወግዱ ጥረትን አስወግደዋል። |
| ይቀንሳል | ይቀንሳል | እርማቶቹ ፖሊሲውን እያሳነሱ ነው። ድብልቁን እና የውስጣቸውን ወጥነት ይመልከቱ። |
| ጠፍጣፋ | ጠፍጣፋ | ዙሩ ምንም አላተረፈም። ተጨማሪ ከመሰብሰብዎ በፊት ድብልቁን፣ ቼክፖይንቱን ወይም ስራውን ይቀይሩ። |
| ይጨምራል | ይቀንሳል | ማነስ (Regression)። ዘዴውን ከመጠርጠርዎ በፊት የስልጠና ድብልቁን፣ የተለወጠ ካሜራን ወይም የቼክፖይንት መደበላለቅን ይጠራጠሩ። |
ወጥመድ 2፦ ያለ ቋሚ ፕሮቶኮል፣ የሚለኩት ክፍሉን ነው
እውነተኛ-ሮቦት ግምገማ ውድ እና ለመድገም አስቸጋሪ ነው። የSIMPLER ደራሲዎች የስሙሌሽን ግምገማን የሚያነሳሱት እንደዚህ ያሉ ፖሊሲዎችን በእውነተኛ-ዓለም መገምገም ሊሰፋ የማይችል መሆኑን እና ፖሊሲዎች የስራ ዘርፋቸውን እያሰፉ ሲሄዱ ሊባባሱ የሚችሉ የመድገም-ችግሮች እንደሚያጋጥሙ በመመልከት ነው። RoboArena ከሌላ ወገን ያጠቃዋል፣ በDROID መድረክ ላይ በሰባት የትምህርት ተቋማት ገምጋሚዎች የተካሄዱ በሰባት አጠቃላይ ፖሊሲዎች ላይ ከ600 በላይ ጥምር-እውነተኛ-ሮቦት ግምገማ ክፍሎች ጋር። ገምጋሚዎቹ የራሳቸውን ስራዎች እና አካባቢዎች ይመርጣሉ ነገር ግን የፖሊሲ ጥንዶችን በድርብ-ዕውርነት (double-blind) መፍረድ አለባቸው፤ ወረቀቱ እንደሚዘግበው ይህ በህዝብ-የተሰበሰበ ደረጃ አሰጣጥ ከተለመደው፣ ማዕከላዊ ግምገማ ይልቅ የአጠቃላይ-ፖሊሲ አፈጻጸምን በትክክል ይከታተላል።
አንድ SO-100 ላይ በአውደ ጥናት ውስጥ 600 የተጣመሩ ክፍሎችን አያስኬዱም። ማድረግ የሚችሉት እርስዎ የሚቆጣጠሩትን ልዩነት ማስወገድ ነው - ብዙውን ጊዜ የሚዘለል በቂ አሰልቺ ዝርዝር።
| ልኬት | ይህንን ያቀዝቅዙ | ካላደረጉ የሚንሸራተተው ምንድን ነው |
|---|---|---|
| የመነሻ አቀማመጥ | የተጻፈ የቤት አቀማመጥ፣ ከእያንዳንዱ ሙከራ በፊት የሚነዳ | አካሄዱ ከስርጭት ውጪ ይጀምራል |
| ዕቃዎች | በቴፕ የተደረጉ ምልክቶች፣ እና ለግምገማ ተብለው የተያዙ ተመሳሳይ አካላዊ ዕቃዎች | 'የተሻለ' ፖሊሲ በእውነቱ ቅርብ የሆነ ዕቃ ነው |
| ካሜራዎች እና ብርሃን | ተመሳሳይ መትከያዎች፣ ኢንዴክሶች፣ ተጋላጭነት፤ መጋረጃዎች ተዘግተው፤ ውቅሩን ፎቶ ያንሱ | የተቀያየሩ የካሜራ ኢንዴክሶች ብቻቸውን ውጤቱን ሊቆጣጠሩ ይችላሉ |
| ሙከራዎች እና የማቆሚያ ደንብ | ቋሚ n፣ ቋሚ ጊዜ-ገደብ፣ ከዙሩ በፊት የተጻፈ መስፈርት | ድህረ-እውነታ መስፈርቶች የቀረቡ ውድቀቶችን የፈለጉትን ማንኛውንም ነገር ያደርጓቸዋል |
| የኦፕሬተር ባህርይ | በግምገማ ሙከራዎች ወቅት ምንም ጣልቃ ገብነት የለም | ግምገማ ሌላ የእርማት ክፍለ-ጊዜ ይሆናል |
ከዚያ ስሌቱ አለ፣ አንድ አውደ ጥናት መግዛት በሚችለው የሙከራ ብዛት ላይ ይቅር የማይል። በመደበኛ ግምት መሰረት፣ ከ20 ሙከራዎች 60 በመቶ ስኬት ወደ 11 የመቶኛ ነጥቦች የሚጠጋ መደበኛ ስህተት ይይዛል - የ0.6 ጊዜ 0.4 በ20 ካሬ ስር - እና በሁለት እንደዚህ ያሉ ዙሮች መካከል ያለው ልዩነት ወደ 15 ይይዛል። ስለዚህ ከ60 ወደ 70 በመቶ የሚደረግ ዝላይ ምንም እንዳልተከሰተ ጋር ይስማማል። ሃምሳ ሙከራዎች በእያንዳንዱ-ዙር ቁጥርን ወደ 7 ነጥቦች ገደማ ያደርሱታል፣ እና አንድ ከሰዓት በኋላ ያስከፍላል።
ይህ አለመመጣጠን ለጣልቃ ገብነት መጠን ክርክር ነው፦ ከሃያ ሁለትዮሽ ውጤቶች ይልቅ በሺዎች በሚቆጠሩ ፍሬሞች ላይ ተሰልቶ፣ ቀድሞ እና ለስላሳ ይንቀሳቀሳል። ማስጠንቀቂያው በአንድ ክፍል ውስጥ ያሉ ፍሬሞች በጣም የተዛመዱ መሆናቸው ነው - አንድ መጥፎ መያዝ መቶ ተከታታይ የጣልቃ ገብነት ፍሬሞችን ያስገኛል - ስለዚህ ውጤታማው የናሙና መጠን ለቁጥጥር-ውሰዶች ብዛት ይቀርባል። መጠኑን እንደ ቀደምት አመላካች እና የስኬት መጠንን እንደ ቀርፋፋ የመሬት እውነታ ይያዙ።
የግምገማ ክፍሎች ወደ ተዋቀረው የስልጠና ውሂብ ስብስብ በፍጹም መግባት የለባቸውም - አለበለዚያ ዙር n+1 በሰለጠነበት ውሂብ ላይ ይመዘናል፣ እና ከርቭው የሚለካው ማስታወስን ነው።
ወጥመድ 3፦ በእርማቶች ላይ ብቻ ማሰልጠን ፖሊሲውን ያጣምማል
እርማቶቹ አስደሳች ውሂብ ናቸው፣ ስለዚህ የተፈጥሮ ውስጣዊ ስሜት በእነሱ ላይ ማሰልጠን ነው። አያድርጉ። እነሱ በግንባታ ፖሊሲው ቀድሞውኑ ከሚያልበት ጠባብ የሁኔታ ቦታ ክፍል የመጡ ናቸው እና ስለሰራው የሩጫው አብዛኛው ክፍል ምንም ማለት ይቻላል አይናገሩም። በዚያ ክፍል ላይ ብቻ ፈይን-ትዩን ካደረጉ ንጹህ አቀራረብ ማድረግን የረሳ ግን ከተበላሸ አቀራረብ ማገገም ጥሩ የሆነ ፖሊሲ ያገኛሉ።
Mandlekar እና ባልደረቦቻቸው የርቀት ጣልቃ ገብነት ስርዓታቸውን በዚህ ዙሪያ ገነቡ። አቀራረባቸው፦ የመጠቀሚያ ስራዎች ተከታታይ ትክክለኛ ተግባራትን የሚፈልጉ የማነቆ ክልሎችን ይይዛሉ - ፖድን ወደ ቡና ማሽን ውስጥ ማስገባት ምሳሌያቸው ነው - ትናንሽ ልዩነቶች ማሳያዎቹ ፈጽሞ ወደማይሸፍኗቸው ሁኔታዎች ወደሚመሩበት። አልጎሪዝማቸው ፖሊሲው እነዚያን ማነቆዎች እንዲያልፍ እንዲማር በአዲሱ ውሂብ ላይ በተደጋጋሚ ያሰለጥናል፣ እና በጣልቃ ገብነት ውሂብ ላይ የሰለጠኑ ወኪሎች ጣልቃ-ካልገቡ አሳያሪዎች ተመጣጣኝ ብዛት ባላቸው ናሙናዎች ከሰለጠኑ ወኪሎች እንደሚበልጡ ያሳውቃሉ።
- ፈጣን፦ በጥቂት ደርዘን ክፍሎች ላይ የሚደረግ አጭር ሩጫ ለመድገም በቂ ርካሽ ነው
- ያነጣጠረ፦ ግሬዲየንቱ በሚያሳስቧችሁ ሁኔታዎች ይቆጣጠራል
- የእርማት ስልት በጭራሽ ሊማር የሚችል መሆኑን ለመፈተሽ ርካሽ ነው
- የፈይን-ትዩን ስርጭት ከስራው ስርጭት ጋር መመሳሰሉን ያቆማል
- መደበኛ ባህርይ በአንድ ዙር ውስጥ በሚታይ ሁኔታ ሊባባስ ይችላል
- መጠኑ ከስኬቱ ጋር አብሮ እየቀነሰ ሊወርድ ይችላል - ንጹህ ክፍሎች ለማገገሚያዎች ተለውጠዋል
የመቀላቀያ ጥምርታ ሃይፐርፓራሜትር ነው እና ተመዝግቦ መቀመጥ ይገባዋል። ቀጣዩ የውሂብ ስብስብ የሚዋቀርበት ቦታ ላይ ነው የሚወሰነው፦ የመጀመሪያ ማሳያዎች ከእርማት ስብስቡ ጋር፣ በጸጥታ የሚገኘውን የሚስብ ደንብ ፈንታ በምንጭ ግልጽ የክፍል ምርጫ። እዚህ ላይ ያ በኮክፒት ውስጥ አንድ የአጻጻፍ ደረጃ ነው፣ እና ውጤቱ ተራ የውሂብ ስብስብ ነው - ይመልከቱ የስልጠና ሰነድ። ምንም መሳሪያ ለእርስዎ የማያደርገው የትኛው ጥምርታ የትኛውን ከርቭ እንዳመጣ መመዝገብ ነው።
ወጥመድ 4፦ ሰው ወጥ ባለሙያ አይደለም
የDAgger ንድፈ ሃሳብ ባለሙያ ይገምታል። እርስዎ በቴክኒካዊ መልኩ አንዱ አይደሉም፦ እርማቶችዎ በተግባራት ላይ ካለ ቋሚ ሁኔታዊ ስርጭት የተገኙ ናሙናዎች አይደሉም። የACT ደራሲዎች ለስውጠ መጠቀሚያ ያሉትን እንቅፋቶች ሲዘረዝሩ ይህንን ይሰይማሉ - ስህተቶች በጊዜ ሂደት ይደራረባሉ፣ እና የሰው ማሳያዎች ቋሚ-ያልሆኑ ሊሆኑ ይችላሉ። ስርዓታቸው አሁንም ከአስር ደቂቃ ማሳያዎች በስድስት እውነተኛ ስራዎች ላይ ከ80 እስከ 90 በመቶ ስኬት ይደርሳል፣ ስለዚህ ችግሩ የሚፈታ እንጂ የሌለ አይደለም።
የrobomimic ጥናት ነጥቡን ከውሂብ ጎን ያደርገዋል። በአምስት የተመሰሉ እና በሶስት እውነተኛ-ዓለም ባለብዙ-ደረጃ ስራዎች ላይ በስድስት ኦፍላይን አልጎሪዝሞች ውስጥ፣ ትምህርቶቹ ለንድፍ ምርጫዎች ያለ ስሜታዊነት፣ በማሳያ ጥራት ላይ ጥገኝነት፣ እና - እዚህ ላይ በጣም የሚጎዳው - የስልጠና እና የግምገማ ግቦች ስለሚለያዩ ከማቆሚያ መስፈርቶች የሚመጣ ተለዋዋጭነትን ያካትታሉ። ዝቅተኛ ኪሳራ ያለው ቼክፖይንት በአስተማማኝ ሁኔታ ከፍተኛ የስኬት መጠን ያለው አይደለም።
የዚህ የሃርድዌር ስሪት አለ፦ የግቤት ሁነታ እርማቱን ይቀርጻል። አንድ leader-follower ውቅር ተከታታይ፣ በሰው-ፍጥነት የሚደረጉ አካሄዶችን ያመነጫል። የኪቦርድ ግፊቶች በአገልጋዩ በጥብቅ ይገደባሉ - በክንድ መገጣጠሚያዎች ላይ በጥሪ ሁለት ዲግሪ፣ በመያዣው ላይ አራት - ስለዚህ ተመሳሳይ ሃሳብ እንደ ትንንሽ እርምጃዎች ደረጃ ይደርሳል። ስላይደሮች ፍጹማዊ ኢላማዎችን ይልካሉ እና አገልጋዩ በጥሪ ወደ እነሱ ቢበዛ ስድስት ዲግሪ ይንቀሳቀሳል። ሶስት ሁነታዎች፣ ሶስት የተግባር ስርጭቶች፤ ሶስቱንም ወደ አንድ የእርማት ስብስብ መቀላቀል እና ከዚያ አቀራረቡ ለምን የተነጫነጨ እንደሆነ ማሰብ ራስ-ጥፋት ነው። የቴሌኦፐሬሽን ሰነድ እያንዳንዱ ሁነታ የሚልከውን ይሸፍናል።
ጣልቃ ገብነቶችን መመዘን፦ IWR እና ከዚያ በኋላ የመጣው
እርማቶቹ ውድ አናሳ ከሆኑ፣ መርህ-ተኮር መፍትሄው ብቸኝነት ሳይሆን ክብደት ነው። Intervention Weighted Regression ማጣቀሻ ትግበራ ነው፦ ውሂቡ ወደ ጣልቃ ገብነት እና ጣልቃ-ያልገባ ናሙናዎች ይከፈላል፣ እና ሁለቱ ክፍሎች በስልጠና ወቅት በእኩል መጠን ይመረጣሉ። ከፍሬሞቹ አምስት በመቶ የሆነ የእርማት ስብስብ ከዚያ የግማሹን ግሬዲየንት ያበረክታል፣ መደበኛው ባህርይ ከስርጭቱ ሳይጠፋ።
እኩል መጠን መነሻ ነጥብ እንጂ ህግ አይደለም። Sirius ሁለትዮሽ ክፍፍሉን በተገመተ የሰው እምነት ተከታታይ ክብደት በመተካት ያጠቃልለዋል፤ Sirius-Fleet ውሳኔውን ወደ ላይ ያንቀሳቅሰዋል፣ ሰው መቼ እንደሚጠየቅ ለመወሰን የእይታ ዓለም ሞዴል እና የመዛባት ትንበያ ሰሪዎችን በመጠቀም። የጋራ ክር፦ የጣልቃ ገብነት ባንዲራ የስልጠና ምልክት ነው፣ ልክ የመዝገብ አምድ ብቻ አይደለም።
| ዘዴ | ሰው መቼ እንደሚሰራ የሚወስነው ማን ነው | የጣልቃ ገብነት ውሂብ እንዴት ጥቅም ላይ ይውላል | የተዘገበ ውጤት |
|---|---|---|---|
| DAgger (2011) | ቋሚ መርሃ ግብር፤ ባለሙያው የተጎበኙ ሁኔታዎችን ይሰይማል | አንድ እያደገ የሚሄድ ውሂብ ስብስብ፣ ያልተመዘነ | ወደ ጸጸት-አልባ የመስመር ላይ መማር መቀነስ ተደርጎ ቀርቧል |
| HG-DAgger (2019) | ሰው፣ በእውነተኛ ስርዓት ላይ ቁጥጥርን የሚቆጣጠር | የተሰባሰበ፤ በሞዴል እርግጠኛ-አለመሆን ላይ የተማረ የደህንነት ገደብ ጨምሮ | በመንዳት ላይ ከDAgger እና ከBC የተሻለ፤ ምንም የጣልቃ ገብነት ቆጠራ አልተሰጠም |
| IWR (2020) | ሰው፣ በርቀት ቴሌኦፐሬሽን | የጣልቃ ገብነት እና ጣልቃ-ያልገባ ናሙናዎች በእኩል መጠን ተመርጠዋል | በእኩል ናሙና ብዛት ጣልቃ-ያልገቡ ማሳያዎችን ይበልጣል |
| Sirius (2022) | ሰው፣ በማሰማራት ወቅት | የተመዘነ BC፣ ክብደቶች ከተገመተ የሰው እምነት | 8% ትርፍ በሲሙሌሽን፣ 27% በእውነተኛ ሃርድዌር፤ በ2 እጥፍ ፈጣን መገጣጠም |
| ThriftyDAgger (2021) | ስርዓቱ፣ በአዲስነት እና በአደጋ ላይ ተመስርቶ የሚቆጣጠር | በክትትል በጀት ስር የሚደረግ መስተጋብራዊ ስብስብ | የተጠቃሚ ጥናት (N=10)፦ ከሚቀጥለው ምርጥ ዘዴ 58% ከፍ ያለ የሰው እና 80% ከፍ ያለ የሮቦት አፈጻጸም |
| Fleet-DAgger (2022) | ስርዓቱ፣ ትኩረትን በመርከቦች ስብስብ ላይ የሚያከፋፍል | በሰው ጥረት ምላሽ (ROHE) የተመዘነ የመርከቦች ስብስብ መማር | ከመሰረታዊ ደረጃዎች እስከ 8.8 እጥፍ ከፍ ያለ ROHE |
| Sirius-Fleet (2024) | ራስ-አስተካካይ መስፈርቶች ያላቸው የመዛባት ትንበያ ሰሪዎች | በእይታ ዓለም ሞዴል ላይ የተመሰረተ ባለብዙ-ስራ መማር | ራስ-ገዝነት እየተሻሻለ ሲሄድ ያነሱ የጣልቃ ገብነት ጥያቄዎች |

ከመጠኑ አጠገብ ለመመዝገብ የሚያስፈልጉ አራት መለኪያዎች
- በእያንዳንዱ ሩጫ ቁጥጥር-ውሰዶች። ሃያ አጭር እርማቶች እና አንድ ረጅም ተመሳሳይ መጠኖችን ይሰጣሉ ግን የተለያዩ ፖሊሲዎችን ይገልጻሉ - አንዱ የሚንቀጠቀጥ፣ ሌላው አንድ ነጠላ ዕውር ቦታ ያለው።
- አማካይ የጣልቃ ገብነት ርዝመት። እየጨመረ ያለ ርዝመት ከሚቀንስ ብዛት ጋር ማለት የቀሩት ውድቀቶች ከባዶቹ ናቸው ማለት ነው፣ ይህም ዘግይቶ የሚመጣ እድገት የሚመስለው ነው።
- እስከ መጀመሪያው ጣልቃ ገብነት ያለው ጊዜ። እርዳታ ከመፈለጉ በፊት የበለጠ የሚደርስ ፖሊሲ ጠቅላላ መጠኑ ጠፍጣፋ ቢሆንም እየተሻሻለ ነው።
- ጣልቃ ገብነቶች የሚከማቹበት ቦታ። ባንዲራውን በተስተካከለ የክፍል እድገት ይከፋፍሉ፤ በዙሮች ውስጥ የተረጋጋ ጫፍ ወደ አንድ ማነቆ ያመለክታል።
በተግባር ሊያስኬዱት የሚችሉት የዙር ፕሮቶኮል
የተለካ ዙር ስድስት ደረጃዎች አሉት እና በመዝገቡ ውስጥ አንድ ረድፍ ያመርታል። የመጀመሪያዎቹ አራት ዙሩ ናቸው፤ የመጨረሻዎቹ ሁለት መለኪያ ያደርጉታል።
- 1ከዙር ዜሮ በፊት የግምገማ ፕሮቶኮሉን ያቀዝቅዙ
የመነሻ አቀማመጥ፣ የዕቃ አቀማመጥ፣ ካሜራዎች፣ የሙከራ ብዛት፣ የጊዜ-ገደብ እና የስኬት መስፈርት ይጻፉ። ጠረጴዛውን ፎቶ ያንሱ። ሰነዱ መቀየር ካለበት፣ ተከታታዩ እንደገና ይጀምራል።
- 2መሰረቱን ይለኩ
ፕሮቶኮሉን ያለ ምንም ጣልቃ ገብነት ያስኬዱ እና ስኬቶቹን ይመዝግቡ፤ ከዚያ ቁጥጥር-ውሰድ ነቅቶ ያለበት አንድ የመሳሪያ ክፍለ-ጊዜ ያስኬዱ እና መጠኑን ይመዝግቡ። እነዚያ ሁለት ቁጥሮች ዙር ዜሮ ናቸው።
- 3እርማቶችን በአንድ ወጥ ስልት ይሰብስቡ
በእያንዳንዱ ዙር አንድ የግቤት ሁነታ፣ ማድረግ ከቻሉ አንድ ኦፕሬተር። ጮክ ብለው ሊገልጹት በሚችሉት መስፈርት ላይ ቁጥጥር ይውሰዱ - 'መያዣው በአቀራረብ ላይ ከሁለት ሴንቲሜትር በላይ የራቀ' - እና ለዙሩ ይያዙት።
- 4እያንዳንዱን ክፍል በተመሳሳይ ቀን ይመድቡ
እርማት፣ ግምገማ ወይም መጣል። ግልጽ ያልሆኑ ክፍሎች ይጣላሉ፣ ተጨማሪ ውሂብ ይረዳል በሚል ንድፈ ሃሳብ አይቀመጡም - እርስዎ ራስዎ የተዘናጉበት እርማት ከምንም ክፍል የበለጠ መጥፎ ነው።
- 5ድብልቁን በግልጽ ያዋቅሩ
የመጀመሪያ ማሳያዎች ከእርማቶች ጋር፣ የክፍል ምርጫ በምንጭ። መሰረታዊ ብዛት፣ የእርማት ብዛት እና ማንኛውንም ክብደት ይመዝግቡ - ይህ ከሶስት ሳምንታት በኋላ የሚፈልጉት መስክ ነው።
- 6ከቼክፖይንቱ ይቀጥሉ፣ ከዚያ እንደገና ይለኩ
ከቀደመው ቼክፖይንት እንጂ ከመሰረት ሞዴሉ ሳይሆን የተዋቀረውን የውሂብ ስብስብ ያሰለጥኑ፣ የቀዘቀዘውን ፕሮቶኮል ከአንድ የመሳሪያ ክፍለ-ጊዜ ጋር ያስኬዱ፣ ረድፉን ይጨምሩ፣ እና ከቀደሙት ሁለት ዙሮች ጋር ያነጻጽሩ።
ደካማ ዙርን እንዴት እንደሚያነቡ የሚቀይሩ ሁለት ገደቦች አሉ። ከቼክፖይንት መቀጠል ክብደቶቹን ከዚያ ያስጀምራል - የኦፕቲማይዘር ቀጣይነት አይደለም፣ ስለዚህ መርሃ ግብሩ ከአዲስ ይጀምራል እና ከተገጣጠመ ቼክፖይንት የሚደረግ አጭር ሩጫ በጣም ትንሽ ሊንቀሳቀስ ይችላል። እና በቁጥጥር-ውሰድ መጀመሪያ ላይ ያለው የመሪ-ማስተካከያ እንቅስቃሴ በሰንሰለቱ ውስጥ ካሉት ነገሮች ሁሉ በእውነተኛ ሃርድዌር ላይ ትንሹ ርቀት አለው፤ እርማቶቹ ሁሉም በአንድ እንግዳ ጊዜያዊ ክስተት ከጀመሩ፣ ድብልቁን ከመወንጀልዎ በፊት እዚያ ይመልከቱ።
የተለካው ዙር፣ አስቀድሞ የተገጣጠመ
ay-robots እነዚህን ስድስት ደረጃዎች እንደ ምርት ባህሪያት ይተገብራል፦ ከመሪ ክንድ፣ ኪቦርድ ወይም ስላይደሮች በሩጫ አጋማሽ ላይ ቁጥጥር መውሰድ፣ የጣልቃ ገብነት ፍሬሞች በራስ-ሰር ባንዲራ ተደርገው፤ እያንዳንዱን ክፍል እንደ እርማት፣ ግምገማ ወይም መጣል መመደብ፤ ቀጣዩን የውሂብ ስብስብ ከመጀመሪያ ማሳያዎች እና ከእርማቶች ጋር ማዋቀር፣ የክፍል ምርጫ በምንጭ ግልጽ ሆኖ፤ እና ቀጣዩን የስልጠና ሩጫ ከመሰረት ሞዴል ይልቅ ከቀደመው ቼክፖይንት መጀመር።
የDAgger ዙር እንዴት እንደሚሰራ ይመልከቱቁጥሮቹ ሊነግሩዎት የማይችሉት ነገር
ከዚህ ውስጥ ምንም አልተፈታም፣ እና ንጹህ ከርቭ ሌላ ነገር እንዲያምኑ ማድረግ የለበትም። የጣልቃ ገብነት መጠን የሚለካው የተጣመረ ስርዓትን ነው - ፖሊሲ፣ ሃርድዌር፣ ኦፕሬተር፣ ክፍል - እና በራሱ ምንም ነገር አይገልጽም። እርማቶቹ ጥሩ እንደነበሩ መፍረድ አይችልም፣ እና ዕቃው በሶስት ሳምንታት ውስጥ ሁለት ሴንቲሜትር ስለቀረበ ቀላል በሆነ ስራ ላይ በደስታ ይቀንሳል።
የሚያደርገው ግልጽ ያልሆነ ስሜትን መከራከር ወደሚችሉት አምድ መቀየር ነው። አማራጩ የተሻለ መለኪያ አይደለም፤ ከርቭው ከዙር ሶስት በኋላ መሰብሰብ እንዲያቆሙ ይነግርዎ የነበረውን የሶስት ሳምንታት እርማቶችን መሰብሰብ ነው። የዳሰሳ ጥናት ስነ-ጽሁፍ መስተጋብራዊ አስመስሎ መማርን የሚገልጸው በሮቦት አፈጻጸም ወቅት በየተወሰነ ጊዜ የሚሰጥ የሰው ግብረመልስ ሲሆን፣ የባህርይ በመስመር ላይ መሻሻል የሚያስችል ነው፤ ቤተሰቡ ሰፊ ነው፣ እና ያለ በእያንዳንዱ ዙር ቁጥር ምንም አደረጃጀት አይሰራም። እንዲሁም ይመልከቱ የSO-100 አስመስሎ መማር መመሪያ ከዚያ ጋር ለሚቀላቅሉት መሰረታዊ የውሂብ ስብስብ፣ ፖሊሲ ማስኬድ ለግምት (inference) ጎን፣ እና የDAgger ዙር ገጽ ለተተገበረው ፓይፕላይን።
የጣልቃ ገብነት መጠን ልክ አንድ ቅነሳ የስኬት መጠን ብቻ ነው?▾
አይደለም። መጠኑ የሚለካው ከሩጫው ምን ያህሉን እንደተቆጣጠሩ ነው፤ የስኬት መጠን የሚለካው ስራው ያለ እርስዎ እንደተጠናቀቀ ነው። አንድ ሩጫ በ30 በመቶ የጣልቃ ገብነት መጠን ሊሳካ ይችላል፣ እና ምንም ጣልቃ ገብነት የሌለው ሩጫ ፈጽሞ ሊከሽፍ ይችላል። በጫጫታም ይለያያሉ፦ መጠኑ በሺዎች በሚቆጠሩ የተዛመዱ ፍሬሞች ላይ ለስላሳ ይንቀሳቀሳል፣ የስኬት መጠን ግን በጥቂት ሁለትዮሽ ውጤቶች መካከል ይዘላል። ሁለቱንም ይመዝግቡ።
የስኬት መጠን ትርጉም እንዲኖረው ስንት የግምገማ ሙከራዎች ያስፈልጉኛል?▾
ተገቢ ከሚመስለው በላይ። በመደበኛ ግምት መሰረት፣ በእውነተኛ 60 በመቶ የስኬት መጠን ላይ 20 ሙከራዎች ወደ 11 የመቶኛ ነጥቦች የሚጠጋ መደበኛ ስህተት ይይዛሉ፣ ስለዚህ በዙሮች መካከል ያለ የ10-ነጥብ እንቅስቃሴ ከጫጫታ የማይለይ ነው፤ 50 ሙከራዎች ያንን ቁጥር ወደ 7 ገደማ ያደርሱታል። 50 መግዛት ካልቻሉ፣ የሙከራ ብዛቱን በዙሮች ውስጥ ተመሳሳይ ያድርጉት እና ትናንሽ እንቅስቃሴዎችን እንደ ወሳኝ-ያልሆነ ይያዙ።
በምን የመቀላቀያ ጥምርታ ማሳያዎችን ከእርማቶች ጋር መጀመር አለብኝ?▾
የተመዘገበው መነሻ ነጥብ የIWR ነው፦ ውሂቡን ወደ ጣልቃ ገብነት እና ጣልቃ-ያልገባ ናሙናዎች ይከፋፍሉ እና በእኩል መጠን ይምረጡ፣ ስለዚህ እርማቶቹ ከፍሬሞቹ ምንም ያህል ትንሽ ክፍልፋይ ቢሆኑም የግማሹን ግሬዲየንት ያበረክታሉ። ውቅርዎ ናሙና መመዘን ካልቻለ፣ የውሂብ ስብስቡን ሲያዋቅሩ በክፍል ብዛት ግምት ይውሰዱ እና ጥምርታውን ይመዝግቡ። በእርማቶች ላይ ብቻ ማሰልጠን ውድቅ የሚደረግ አማራጭ ነው።
የጣልቃ ገብነት መጠኔ ከአንድ ዙር በኋላ ጨምሯል። ዙሩ ጠፍቷል ማለት ነው?▾
ግድ አይደለም፣ ግን አሰልቺዎቹን ማብራሪያዎች መጀመሪያ ይመልከቱ፦ ያንቀሳቀሱት ቼክፖይንት ካሰለጠኑት ጋር ይመሳሰላል? የካሜራ ኢንዴክስ ወይም መትከያ ተለውጧል? የዕቃ አቀማመጥ ተንሸራቷል? የእርማት ስልት ወጥ ነበር? ሁሉም አራቱ ንጹህ ከሆኑ እና የተጣመረው የስኬት መጠንም ከቀነሰ፣ ድብልቁን ይጠራጠሩ - ከእርማቶቹ አንጻር በጣም ጥቂት መሰረታዊ ማሳያዎች፣ ወይም እርስ በርስ የሚቃረኑ እርማቶች። እውነተኛ ማነስ (regression) በመዝገቡ ውስጥ መሆን አለበት እንጂ በቆሻሻ ማጠራቀሚያ ውስጥ አይደለም።
ቋሚውን የግምገማ ፕሮቶኮል ትቼ የጣልቃ ገብነት መጠኑን ብቻ መከታተል እችላለሁ?▾
እድገትን ከልማድ መያዝ መለየት እንደማይችሉ ከተቀበሉ ብቻ። መጠኑ በእውነተኛ ጊዜ ጣልቃ ለመግባት ባለዎት ገደብ ላይ የተመሰረተ ነው፣ እና ያ ገደብ የፖሊሲውን ልዩ ባህርያት እየለመዱ ሲሄዱ ይቀንሳል። የቀዘቀዘው ፕሮቶኮል ገደብዎ ሊደርስበት የማይችለው የመለኪያው ክፍል ነው - በቴፕ የተደረጉ ምልክቶች፣ የተጻፈ የቤት አቀማመጥ፣ ቋሚ የሙከራ ብዛት፣ ከዙሩ በፊት የተወሰነ መስፈርት። በተከታታዩ ውስጥ ሳይለወጥ መቆየት አለበት።
መዝገቡን በማከማቻ (repository) ውስጥ ያስቀምጡ እንጂ በማስታወሻ ደብተር ውስጥ አይደለም፦ ዙሮች በቀናት ይለያያሉ፣ ሃርድዌር እንደገና ይገነባል፣ እና በጥቅምት ወር ከርቭውን የሚያነበው ሰው ስለ ነሐሴ ምንም ትዝታ የሌለው እርስዎ ነው። የሰነድ ተደጋጋሚ ጥያቄዎች (FAQ) እዚህ ያልተካተቱ የስራ ዝርዝሮችን ይሸፍናል።
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started