
በ SO-100 ክንድ ላይ ስለተካሄደ አንድ በሰው ቁጥጥር ስር ያለ (human-gated) የDAgger ዙር ደረጃ በደረጃ የቀረበ ማብራሪያ፦ ፖሊሲውን ማስኬድና መቅዳት፣ ስህተት ሲፈጠር ቁጥጥር መውሰድ፣ ሩኑን እንደ እርማት (correction) መመዝገብ፣ የተቀላቀለ ዳታሴት መገንባት፣ እና ስልጠናን ከቼክፖይንት መቀጠል። ያለ መሪ ክንድ ለሚሰሩ ሰዎች የኪቦርድና የስላይደር መቆጣጠሪያ መንገድን፣ እንዲሁም ዙርን ከንቱ የሚያደርጉ አራት ስህተቶችን ያካትታል።
ፖሊሲህ ይሰራል። ወደ ኪዩቡ ይደርሳል፣ ግሪፐሩን ከትክክለኛው ቅጽበት አንድ ሴንቲሜትር ቀደም ብሎ ይዘጋል፣ እና እንደያዘው ሆኖ መንቀሳቀሱን ይቀጥላል። ምንም ስህተት አይታይም፣ የስልጠናውን ኪሳራ (loss) ምንም ያህል ብታስተውል ምክንያቱን አይነግርህም። መፍትሄው በተመሳሳዩ ማሳያዎች ላይ ተጨማሪ 20 000 ግራዲየንት እርምጃዎችን ማድረግ አይደለም። ይልቁንም ስህተቱ በትክክል በሚፈጠርበት ቦታ እጅህን ወደ ክንዱ መመለስ፣ ከዚያ ይልቅ ያደረግከውን መቅዳት፣ እና ቀጣዩን ቼክፖይንት በአሮጌው ዳታ ላይ ያንን እርማት ጨምረህ ማሰልጠን ነው። ይህ የDAgger ዙር ነው፤ አንድ ዙር በSO-100 ላይ በቪዥን-ላንጉዌጅ-አክሽን ፖሊሲ እንዴት እንደሚካሄድ የሚያሳይ ነው።
ንድፈ ሃሳቡ በሌላ ቦታ ይገኛል፦ ዳታሴት ማጠራቀም ለምን ጨርሶ እንደሚሰራ እና የሰው ቁጥጥር (human gating) ስለ እሱ ምን እንደሚቀይር። ይህ የአሰራር መመሪያ ነው፤ የሰለጠነ ቼክፖይንት፣ የሚሰራ የካሜራ ስብስብ እና የሚንቀሳቀስ ክንድ እንዳለ ይገምታል። ከዚህ በታች ያሉት ስድስት ደረጃዎች ዙሩ እንደተተገበረው ናቸው፣ በበዚህ መድረክ የDAgger ገጽ ላይ፤ ነገር ግን ቅደም ተከተሉ ከራስህ ስክሪፕቶች ጋርም ተመሳሳይ ነው።
አንድ ዙር በአጭሩ
- •የሰለጠነውን ፖሊሲ አስኪደህ ቅዳው፣ ከጠቅላላ የቴሌኦፐሬሽን መለያ ይልቅ የሩኑን የተግባር ጽሁፍ (task text) ተጠቅመህ።
- •ባህሪው ስህተት በሚፈጥርበት ቅጽበት ቁጥጥር ውሰድ፦ ከመሪ ክንድ ጋር በሚደረግ ሚረር (mirror) ርክክብ፣ ወይም መሪ ክንድ ከሌለ በኪቦርድ ወይም በስላይደር ወዲያውኑና በእጅ።
- •እያንዳንዱን ሩን መርምረህ ደርድር፦ እንደ እርማት መዝግበው፣ እንደ ግምገማ ኤፒሶድ አቆየው፣ ወይም ጣለው።
- •ቅልቅሉን በእጅ ገንባ - ዋናዎቹ ማሳያዎች ከእርማቶች ጋር፣ ኤፒሶዶቹ በምንጭ እየተመረጡ። በእርማቶች ብቻ በፍጹም አታሰልጥን።
- •ስልጠናን ከመጨረሻው ቼክፖይንት ቀጥል፣ የትኛው ቼክፖይንት የትኛውን ቅልቅል እንዳመረተ መዝግብ።
- •ዙሩ ዋጋ ያለው መሆኑን የሚነግርህ ቁጥር የጣልቃ ገብነት መጠን ነው፣ የስልጠና ኪሳራ (loss) አይደለም።
ሁለተኛው ዙር ተጨማሪ ዳታ ብቻ ያልሆነው ለምንድን ነው
ቢሄቪየር ክሎኒንግ (Behavior Cloning) የሚያሰለጥነው ሰው በጎበኛቸው ሁኔታዎች (states) ላይ ብቻ ነው። በሙከራ ጊዜ ግን ፖሊሲው ራሱ በሚያስከትላቸው ሁኔታዎች ውስጥ ይንቀሳቀሳል፣ ትንንሽ የአክሽን ስህተቶችም ምንም ማሳያ ወዳልሸፈናቸው ሁኔታዎች እየተጠራቀሙ ይወስዱታል። Ross, Gordon እና Bagnell ይህን ውድቀት ለ AISTATS 2011 በይፋ አስቀምጠው፣ ቋሚ የማያሻማ (deterministic) ፖሊሲ የሚያሰለጥን እና በቅነሳቸው መሰረት ራሱ በሚፈጥረው የሁኔታ ስርጭት ስር በጥሩ ሁኔታ መስራት ያለበት ተደጋጋሚ (iterative) አልጎሪዝም በመስጠት መልስ ሰጡት፦ የአሁኑን ፖሊሲ አስኪድ፣ ኤክስፐርቱ በትክክል የደረሰባቸውን ሁኔታዎች እንዲሰይም አድርግ፣ እነዚያን ወደ ዳታሴቱ ጨምር፣ እንደገና አሰልጥን፣ ድገም። Kelly እና ሌሎች በ HG-DAgger ይህን ጥያቄ ተግባራዊ አደረጉት፤ በዚህ ውስጥ ሰውየው ቁጥጥሩን ሳይይዝ ሁኔታዎችን ከመሰየም ይልቅ መቼ ቁጥጥር መውሰድ እንዳለበት ራሱ ይወስናል፤ በተመሳሳይ እና በእውነተኛ ራስ-ገዝ የመንዳት ስራ ላይ ከDAgger እና ከቢሄቪየር ክሎኒንግ የተሻለ አፈጻጸም እንዳገኙ ዘግበዋል። ዙሩን በጠረጴዛ ክንድ ላይ ተቀባይነት ያለው የሚያደርገው የሰው ቁጥጥር (human gating) ነው - እጅህን የምታንቀሳቅሰው ነገር ስህተት ሲፈጥር ብቻ ነው።
በተግባር ላይ ከንድፈ ሃሳቡ የበለጠ ጠቀሜታ ያላቸው ሁለት ውጤቶች አሉ። እርማቶች እንደ ተራ ማሳያዎች አይደሉም፦ Mandlekar እና ሌሎች እንደገለጹት፣ ትንሽ መዛነፍ እንኳ ፖሊሲውን ማሳያዎቹ ፈጽሞ ወዳልሸፈኗቸው ሁኔታዎች በሚያንደረድሩባቸው ማነቆ (bottleneck) አካባቢዎች ላይ ያተኩራሉ። እነዚያን አስቸጋሪ ክፍሎች ብቻ የያዘ ዳታሴትም በደንብ ያልተቀረጸ ዳታሴት ነው - Belkhale, Cui እና Sadigh ከዳታ አንፃር የሁኔታ ብዝሃነት (state diversity) ሁልጊዜ ጠቃሚ እንዳልሆነ፣ ይልቁንም የአክሽን ልዩነትና የሽግግር ብዝሃነት (transition diversity) ተዳምረው የዳታሴቱን ጥራት እንደሚወስኑ ይከራከራሉ። የተቀላቀለው ዳታሴት ማስተካከያ (compromise) ሳይሆን ራሱ ዋናው ነጥብ ነው።
ከመጀመሪያው ዙር በፊት እነዚህን አስተካክለህ ቀዝቅዝ
አንድ የDAgger ዙር ፖሊሲውን ከራሱ ጋር በጊዜ ውስጥ ያነጻጽራል። ከዳታሴት ውጭ በዙሮች መካከል የምትቀይረው ማንኛውም ነገር ያንን ንጽጽር ትርጉም አልባ ያደርገዋል።
- የካሜራ አቀማመጦችና ማንጠልጠያዎች፣ የእጅ አንጓ ካሜራን ጨምሮ። አንድ ክላምፕ ብታላላ የቀየርከው የፖሊሲውን ሳይሆን የምልከታ (observation) ስርጭትን ነው።
- ኤክስፖዠርና ነጭ ማመጣጠኛ (white balance)፣ የካሜራ ስርአትህ እነዚህን እንድትቆልፍ የሚፈቅድ ከሆነ። በዙሮች መካከል የሚንሸራተት ራስ-ሰር ኤክስፖዠር (auto-exposure) ቀስ በቀስ የማይታይ የዶሜይን ለውጥ ነው።
- የክንድ ካሊብሬሽንና የሰርቮዎች ዜሮ አቀማመጥ። እንደገና ካሊብሬት ማድረግ ካስፈለገህ፣ ከዚያ በፊት የተቀዳውን ሁሉ እንደ የተለየ ዳታሴት ቁጠረው።
- የተግባር ጽሁፉ (task text)። እዚህ ያለ እያንዳንዱ VLA በእሱ ላይ የተመሰረተ ነው፤ በዙር መሃል ቃላቱን መቀየር የተለየ ተግባር ማድረግ ነው።
- ብርሃን፣ የጠረጴዛው ወለል፣ የነገሮች ስብስብ። አዲስ ነገር አዲስ ሙከራ ነው፣ ቀጣይ ዙር አይደለም።
- የቀረጻው ፍሬም ፍጥነት (frame rate)። በሁለት የተለያዩ ናሙና ራስተሮች (sampling rasters) መካከል የጣልቃ ገብነት መጠኖችን ማነጻጸር ከራስተሩ ራሱ የሚመነጭ ልዩነት ያመጣል።
Hsu እና ሌሎች በእጅ ላይ ያተኮረ እይታን ከተለመደው የሶስተኛ ሰው እይታ ጋር አነጻጽረው፣ የእጅ-ውስጥ (eye-in-hand) እይታ ከትዕይንቱ ያነሰ ቢያይም የስልጠና ብቃትንና ከመረጃ ስርጭት ውጭ ላሉ ሁኔታዎች መስተካከልን (out-of-distribution generalization) በተከታታይ እንደሚያሻሽል አግኝተዋል። ባለአምስት-መገጣጠሚያ ክንድ ላይ፣ እርማቶችህ በተለምዶ የሚያስተካክሉት የግሪፐሩን ጊዜ አወሳሰድ ነው፣ ይህንንም የግሪፐር ጊዜ አወሳሰድ የሚሸከመው የእጅ አንጓ ካሜራ እይታ ነው።
ዙሩ፣ ከመጀመሪያ እስከ መጨረሻ
- 1ኢንፈረንስ አስኪደህ ቅዳው
ማሻሻል በምትፈልገው ቼክፖይንት ላይ ሩኑን ጀምር፣ ከዚያም ቀረጻውን ወደ ኢንፈረንስ ስር (inference root) ጀምር። በዚህ መልኩ ሲቀዳ፣ ከነባሪው የቴሌኦፐሬሽን መለያ ይልቅ ፖሊሲው የሰለጠነበትን የሩኑን ራሱን የተግባር ጽሁፍ ይወርሳል። ያለ ቀረጻ ውድቀቱን ማየት ትችላለህ፣ ግን በእሱ ላይ ማሰልጠን አትችልም።
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2ስህተት ሲፈጠር ቁጥጥር ውሰድ
«Take over»ን ተጫንና የግቤት ሁነታ (input mode) ምረጥ፦ መሪ ክንድ፣ ኪቦርድ ወይም ስላይደር። ሯጩ (runner) ያቆማል፣ አንተ ታስተካክላለህ፣ ከዚያ ትመልሳለህ። አንተ በምትነዳበት ጊዜ የተቀዱ ፍሬሞች ራስ-ሰር በሆነ መልኩ እንደ ጣልቃ ገብነት ይሰየማሉ።
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3ኤፒሶዶቹን መርምረህ ደርድር
በእያንዳንዱ ኤፒሶድ ወስን፦ እንደ እርማት መዝግብ፣ እንደ ግምገማ አቆይ፣ ወይም ጣል። ያለ እርዳታ ፖሊሲው ራሱ ያጠናቀቀው ሩን የግምገማ ዳታ ነው።
- 4የእርማት ዳታሴቱን አመሳስል (sync)
እርማቶች በእያንዳንዱ ፖሊሲ ውስጥ በአካባቢያዊ ዳታሴት ውስጥ ይሰበሰባሉ፣ ራስ-ሰር በሆነው sync አማካኝነትም ወደ ደመና ማከማቻ ይሄዳሉ። አንተ ያላስገባኸው ምንም ነገር አይቀላቀልም።
- 5የተቀላቀለውን ዳታሴት ገንባ
ዋናውን ዳታሴት ከእርማቶች ጋር አጣምር፣ ኤፒሶዶቹንም እያንዳንዱን ምንጭ በግልጽ እየመረጥህ። ውጤቱ ከዚያ ወዲያ ተራ ዳታሴት ነው።
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6ስልጠናን ከቼክፖይንቱ ቀጥል
ቅልቅሉን ከመሰረታዊው ሞዴል ይልቅ ካለፈው ቼክፖይንት አሰልጥን። የትኛው ቼክፖይንትና የትኛው ቅልቅል እንደሆነ መዝግብ፤ ያ ጥንድ ከሌለ ዙሩ ተደግሞ ሊሰራ አይችልም (not reproducible)።
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
ደረጃ 2 በዝርዝር፦ ቁጥጥር ለመውሰድ ሁለት መንገዶች
በመሪ ክንድ
በleader-follower ሁነታ ውስጥ፣ ቁጥጥር መውሰድ በአንድ ላይ ባልሆኑ አቀማመጦች መካከል ባሉ ሁለት ክንዶች መካከል የሚደረግ ርክክብ ነው። «Take over»ን መጫን ሯጩን ያቆምና መሪውን ወደ ተከታዩ የአሁኑ አቀማመጥ ያንቀሳቅሰዋል፣ ስለዚህ ቶርኩ ሲተላለፍ ምንም ነገር አይዘልም። ያ የማስተካከያ እንቅስቃሴ (alignment drive) ጊዜው ካለቀበት፣ መሪውን በእጅህ አስተካክለህ ሁለቱ በአምስት ዲግሪ ውስጥ ሲሆኑ ብቻ ልቀቅ። ከዚያ በኋላ በተለመደው መንገድ ቴሌኦፐሬት ታደርጋለህ፣ የአክሽን አምዱም ያዘዝከውን ይመዘግባል።
ስለዚህ መንገድ ታማኝ ሁን፦ የማስተካከያ እንቅስቃሴውና የቶርክ ርክክቡ በእውነተኛ ሃርድዌር ላይ ከሁሉም ያነሰ የተፈተነው የዙሩ ክፍል ናቸው። በምትጨነቅበት ሩን ላይ ከመተማመንህ በፊት ርክክቡን በዝግተኛና ምንም ጉዳት በሌለው አቀማመጥ ላይ ሞክረው። ከሶስቱ ሁነታዎች መካከል መሪ ክንድ በጣም ለስላሳ እርማቶችን ያመርታል፣ በተመሳሳይም በሜካኒካል በኩል በጣም ብዙ ችግር ሊፈጠርበት የሚችል ነው።
ያለ መሪ ክንድ፦ ኪቦርድና ስላይደሮች
ይህን የሚያነቡ አብዛኞቹ ሰዎች አንድ ክንድ ብቻ አላቸው። ያ ይበቃል። «Take over»ን በምትጫንበት ቅጽበት የኪቦርድ ወይም የስላይደር ግቤት ምረጥ፣ ቁጥጥር መውሰዱም ወዲያውኑና በእጅ ይሆናል - የሚስተካከል ሁለተኛ ክንድ ስለሌለ የማስተካከያ ደረጃም የለም። ተከታዩ አቀማመጡን ይዞ ግቤት ይጠብቃል።
| የግቤት ሁነታ | ክንዱ እንዴት እንደሚንቀሳቀስ | በሰርቨሩ የሚጫን በእያንዳንዱ ጥሪ ወሰን | የሚቆለፍበት ጊዜ |
|---|---|---|---|
| መሪ ክንድ | ሚረሩ (mirror) ተከታዩን ከመሪው የመገጣጠሚያ አንግሎች ይነዳዋል | በዚህ ሁነታ ውስጥ ምንም nudge ወይም set ጥሪዎች የሉም፤ ሚረሩ የተከታዩን ግቦች በተከታታይ ይጽፋል | ፈጽሞ አይቆለፍም፣ የግቤት ሁነታ ካልተሰጠም ነባሪው ይህ ነው - ነገር ግን ሁለተኛ ክንድ ይፈልጋል፤ የመሪ መለያ (leader id) ከሌለ ቁጥጥር መውሰዱ ይከለከላል |
| ኪቦርድ | በእያንዳንዱ ቁልፍ ግፊት አንጻራዊ ግፊት (nudge) ወደ takeover nudge ኢንድፖይንት ይላካል | ጥብቅ ገደብ በእያንዳንዱ መገጣጠሚያ 2 ዲግሪ፣ ለግሪፐሩ 4 ዲግሪ | ቁጥጥር መውሰዱ በመሪ ሁነታ ከተጀመረ በ409 ውድቅ ይደረጋል |
| ስላይደሮች | ፍጹም ኢላማ አቀማመጥ (absolute target pose)፣ ወደ takeover set ኢንድፖይንት ይላካል | በእያንዳንዱ ጥሪ ወደ ኢላማው በአብዛኛው 6 ዲግሪ ጉዞ፤ በይነገጹም በሰከንድ አስር ጊዜ ያህል መላክ ይቀጥላል | ቁጥጥር መውሰዱ በመሪ ሁነታ ከተጀመረ በ409 ውድቅ ይደረጋል |
ገደቦቹ የሚጫኑት በሰርቨር በኩል እንጂ በበይነገጹ ላይ አይደለም፣ ምክንያቱም በ bus-servo ክንድ ላይ በስህተት የተተየበ ዴልታ ግጭት ስለሚያስከትል ነው። የኪቦርድ እርማቶች እርከናዊ (stepwise) እና ትንሽ ያልጠራ ሆነው ይወጣሉ፤ የስላይደር እርማቶች ግን ለስላሳ ናቸው፣ ምክንያቱም ሰርቨሩ ወደ ኢላማው በእግር እየሄደ (walks) ሲሆን በይነገጹ ደግሞ መላኩን ይቀጥላል። በሁለቱም መንገድ የአክሽን አምዱ ሙሉውን የታዘዘ የአቀማመጥ ቬክተር ይቀበላል፣ የጣልቃ ገብነት ምልክቱም ከመሪው መንገድ ጋር ተመሳሳይ ነው፣ ስለዚህ የኪቦርድ እርማቶች ያለ ምንም የፎርማት ልዩነት በተመሳሳዩ ዳታሴት ውስጥ ያርፋሉ።
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
ቁልፉን መቼ መጫን እንዳለብህ
ዘግይተህ ሳይሆን ቀድመህ። ግሪፐሩ በምንም ላይ ሳይኖር ከተዘጋ በኋላ የሚጀምር እርማት፣ ፖሊሲው መግባት ከሌለበት ውድቀት እንዴት እንደሚያገግም ያስተምረዋል፤ የማገገሚያ ዳታ (recovery data) ግን ከመራቅ ዳታ (avoidance data) በጣም ያነሰ ዋጋ አለው። አካሄዱ ስህተት እንደሆነ እርግጠኛ በምትሆንበት የመጀመሪያ ቅጽበት አቋርጥ፣ በአስቸጋሪው ክፍል ውስጥ አስተካክል፣ ፖሊሲው ከዚህ በፊት የያዘው አይነት ሁኔታ ላይ እንደደረሰ ወዲያውኑ መልስ። ThriftyDAgger ጣልቃ ገብነቶችን በአዲስነት (novelty) እና በተገመተ ስጋት ላይ በተወሰነ የሰው በጀት (human budget) ስር በማገደብ ይህን ውሳኔ ራስ-ሰር ያደርገዋል፤ ነገር ግን ቀድሞውኑ ሰው በሚመለከትበት አንድ ክንድ ላይ፣ የሰው ገደብ (human gate) ካንተ ማንኛውም ማስተካከያ የበለጠ ርካሽና በተሻለ የተስተካከለ ነው።
ክፍት-ምንጭ (open-source) ስታኩና ጥቂት ስክሪፕቶች ይህን ማድረግ ይችላሉ። የሚያስከፍለው ነገር ግን የመዝገብ አያያዝ (bookkeeping) ነው፣ የDAgger ዙሮችም የሚሞቱት እዚያ ላይ ነው።
- ከራስህ ኢንፈረንስ ስክሪፕት ፍሬሞችን ፖሊሲው ወደ ሰለጠነበት የተግባር ጽሁፍ (task string) ጋር ወደ LeRobot ዳታሴት ጻፍ።
- የፖሊሲውን ዙር አቁም፣ የትዕዛዝ ምንጩን ቀይር፣ አንተ የምትነዳውን እያንዳንዱን ፍሬም እንደ ጣልቃ ገብነት ምልክት አድርግበት። ያለ ምልክቱ፣ እርማቶች እንደ ተራ ማሳያዎች ይታያሉ።
- ፖሊሲው ቁጥጥሩን ከለቀቀበት እስከ አንተ የመጀመሪያ ግቤት ባለው የሽግግር ፍሬሞች ላይ ምን እንደሚደረግ ሆን ብለህ ወስን።
- እርማቶችን በእያንዳንዱ ፖሊሲ ራሱ ዳታሴት ውስጥ አቆይ፣ ቅልቅሉም ተመልሶ ሊገነባ እንዲችል የኤፒሶድ ኢንዴክሶችን በእጅ ተከታተል።
- የፋይን-ትዩኒንግ መግቢያ ነጥቡን ወደ ቀድሞው ቼክፖይንት አመልክት፣ በሎጉ ውስጥም እነዚያ ክብደቶች (weights) መጫናቸውን አረጋግጥ።
ተመሳሳዩ ስድስት ደረጃዎች እንደ ቁልፎች አሉ። ራስ-ሰር የተደረገው በእጅ በቀላሉ ሊሳሳት የሚችለው ነው፦ የእያንዳንዱ ፍሬም የጣልቃ ገብነት ምልክት፣ በእርማቶችና በግምገማዎች መካከል ያለው ክፍፍል፣ እና የትኛው ቼክፖይንት የትኛውን ቅልቅል እንዳመረተ የሚያሳይ መዝገብ። አንተ ያልመረጥከው ምንም ነገር ወደ ተገነባ ዳታሴት ውስጥ አይገባም።
ለአንተ ውሳኔ አይሰጥም። የትኛው ሩን እንደ እርማት እንደሚቆጠር፣ የትኞቹ ኤፒሶዶች ወደ ቅልቅሉ እንደሚገቡ፣ እና መቼ ማቆም እንዳለብህ የግምገማ ውሳኔዎች ናቸው። መስኮቹ በስልጠና፣ የግቤት ሁነታዎቹ ደግሞ በቴሌኦፐሬሽን።
ደረጃ 3 በዝርዝር፦ ትሪያጅ (triage) ጥራትን ይወስናል
ከሩኑ በኋላ አንዳንድ ፍሬሞች እንደ ጣልቃ ገብነት ምልክት የተደረገባቸው ቀረጻ ይኖርሃል። ሶስት መድረሻዎች አሉ፣ ትክክል ያልሆነውን መምረጥም ቀጣዩን ዙር በጸጥታ ይመርዘዋል።
- ጣልቃ ገብነቱ እውነተኛ ማስተካከያ ሲሆን እንደ እርማት መዝግብ፦ ፖሊሲው ወደ ስህተት አቅጣጫ እየሄደ ነበር፣ ግቤትህም ፖሊሲው ራሱ ካመነጨው ሁኔታ ትክክለኛውን ነገር አሳይቷል።
- ንፁህ ራስ-ገዝ ሩኖችና ከጥንቃቄ የተነሳ ቁጥጥር ላደረግክባቸው ሩኖች እንደ ግምገማ አቆይ። የግምገማ ኤፒሶዶች ቀጣዩን ቼክፖይንት የምትለካበት መንገድ ናቸው፣ በምንም መልኩ በእነሱ ላይ መሰልጠን የለበትም።
- ከጉዳዩ ጋር ግንኙነት በሌለው ነገር የተበላሹ ሩኖችን ጣል - የወደቀ የካሜራ ፍሬም፣ የቆመ ሰርቮ፣ አንተ ደፍቀህ የጣልከው ነገር። ግራ የተጋባ እርማት ከምንም እርማት አለመኖር የከፋ ነው።
ፖሊሲው ቁጥጥሩን ከለቀቀበት እስከ አንተ የመጀመሪያ ግቤት ባለው ጊዜ ውስጥ፣ መቅጃው መጻፉን እየቀጠለ ክንዱ ግን ቆሞ ይቆያል - ተመሳሳይ አቀማመጦች ትንሽ ከተለያዩ ምስሎች ጋር የተጣመሩበት ተከታታይ ነው። እዚህ እነዚያ የርክክብ ፍሬሞች በጥሬ ቀረጻ ውስጥ ይቆያሉ፣ ከእርማት ዳታሴቱ ግን ውጭ ናቸው። ዙሩን ራስህ የምትገነባ ከሆነ፣ ሆን ብለህ ቁረጣቸው፦ በእነሱ ላይ የሰለጠነ ፖሊሲ መስራት በሚገባው ቦታ ላይ ማቆምን ይማራል።
ደረጃ 5 በዝርዝር፦ ቅልቅሉን መገንባት
ቅልቅል መገንባት (composition) ዋናውን ዳታሴት ከእርማት ዳታሴቱ ጋር ወስዶ አዲስ፣ ተራ LeRobot ዳታሴት ልክ እንደ ማንኛውም ሌላ ዳታሴት የሚያሰለጥን ያመርታል። ወሳኙ ባህሪ የኤፒሶድ ምርጫው በእያንዳንዱ ምንጭ ላይ በግልጽ የሚደረግ መሆኑ ነው - ምንም ነገር ራስ-ሰር አይቀላቀልም። ይህ ፖሊሲ እንግዳ ባህሪ እስኪያሳይና በምን ላይ እንደሰለጠነ መልሰህ እስክትገነባ ድረስ ትንሽ ነገር ይመስላል።
ክፍት ጥያቄው ጥምርታው (ratio) ነው፣ ከቦታ ወደ ቦታ የሚሸጋገር ቁጥርም ማንም የለውም። ስነ-ጽሁፉ የሚስማማበት ግን እርማቶች ከፍሬም ድርሻቸው በላይ መቆጠር እንዳለባቸው ነው። Mandlekar እና ሌሎች የጣልቃ ገብነት ስርአታቸው በሚሰበስበው ዳታ ላይ በተደጋጋሚ (iteratively) ስለሚያሰለጥኑ ፖሊሲው ማነቆዎቹን (bottlenecks) ማለፍ ይማራል፣ በዚያ መንገድ የሰለጠኑ ወኪሎችም ጣልቃ ካልገባ አሳያሽ ከተመሳሳይ ብዛት ናሙናዎች ከሰለጠኑ ወኪሎች የተሻለ አፈጻጸም እንዳላቸው ዘግበዋል። Sirius ደግሞ ከዚህ አልፎ የስልጠና ናሙናዎችን በተገመተ የሰው እምነት (approximated human trust) መልሶ ይመዝናል፣ ከሚያነጻጽራቸው ዘዴዎች አንጻር በሲሙሌሽን 8 በመቶ፣ በእውነተኛ ሃርድዌር ደግሞ 27 በመቶ የፖሊሲ ስኬት መጠን መጨመር፣ በእጥፍ ፍጥነት ኮንቨርጀንስ (convergence) ጋር ዘግቧል። እዚህ ካሉት የስልጠና መግቢያ ነጥቦች መካከል አንዳቸውም የናሙና-ክብደት መቆጣጠሪያ (sample-weighting knob) አያሳዩም፣ ስለዚህ ጥሬው አማራጭ ዋናዎቹን ማሳያዎች ንዑስ-ናሙና (subsampling) እያደረግህ እያንዳንዱን የእርማት ኤፒሶድ ማቆየት ነው - እና ያደረግከውን መዝግብ።

ደረጃ 6 በዝርዝር፦ ከቼክፖይንት መቀጠል በእውነት ምን ማለት እንደሆነ
ቅልቅሉን ከመሰረታዊው ሞዴል ማሰልጠን ይሰራል፣ ነገር ግን ያለፈውን ዙር ጥሎ ሙሉ ሩን ያስከፍላል። ካለፈው ቼክፖይንት ጀምሮ መቀጠል ፈጣንና በአብዛኛው የተሻለ ነው። ቃሉ ከሚጠቁመው በላይም የተገደበ ነው።
ክብደት-ብቻ (weights-only) ቼክፖይንት ፓራሜትሮችን ብቻ ይይዛል፣ ሌላ ምንም። መጫኑ ለቀጣዩ ሩን ከመሰረታዊው ሞዴል የተሻለ መነሻ ቦታ ይሰጣል፣ ነገር ግን የኦፕቲማይዘር ሞመንቶች፣ የመማር-መጠን ጊዜ ሰሌዳ (learning-rate schedule) አቀማመጥ እና የዳታ ቅደም ተከተል ሁሉም ከዜሮ ይጀምራሉ። በቀጠለው ሩን መጀመሪያ ላይ የኪሳራ (loss) መጨመር ጠብቅ፣ እንደ ውድቀት አታንብበው፣ ዙሩንም resume ብለህ አትጥራው። ይህ warm start (ሙቅ ጅምር) ነው።
| ፖሊሲ | መጠን | የGPU ደረጃ | በእያንዳንዱ አክሽን እርምጃ ኢንፈረንስ | የዳታሴት ፎርማት | ከመሞከሩ በፊት የሚያስፈልጉ ኤፒሶዶች |
|---|---|---|---|---|---|
| GR00T N1.7 | ወደ 3 ቢሊዮን፣ በፋይን-ትዩኒንግ ጊዜ የሰለጠነው ወደ 40 ሚሊዮን | A100 80 GB ወይም H100 80 GB | ወደ 152 ms | LeRobot v2.0 ወይም v2.1 | 50 |
| GR00T N1.5 | ወደ 3 ቢሊዮን | A100 80 GB ወይም H100 80 GB | ወደ 165 ms | LeRobot v2.0 ወይም v2.1 | 50 |
| Pi0.5 | ወደ 3 ቢሊዮን በPaliGemma መሰረት (backbone) ላይ | A100 80 GB ወይም H100 80 GB | ወደ 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | ወደ 450 ሚሊዮን | RTX 4090 ወይም ማንኛውም 24 GB ካርድ | ወደ 245 ms | LeRobot v3.0 | 30 |
| ACT | ወደ 80 ሚሊዮን፣ ከዜሮ የሰለጠነ | RTX 4090 ወይም ማንኛውም 24 GB ካርድ | ወደ 20 ms | LeRobot v3.0 | 50 |
ሌተንሲ (latency) በማሳያ ጊዜ በማይታይ መንገድ በDAgger ዙር ውስጥ ይደራረባል፦ በእያንዳንዱ አክሽን እርምጃ ወደ 485 ms ላይ ቁጥጥር የምትወስደው ክንዱ ስላመነታ እንጂ ስህተት ስለሆነ አይደለም፣ የማመንታት እርማቶችም ጠቃሚ የስልጠና ዳታ አይደሉም። የመጨረሻውን የስኬት መጠን ከማሳደድ ይልቅ በዳታ ላይ በተደጋጋሚ (iterating) እየሰራህ ከሆነ፣ በፈጣን ሞዴል ላይ ድገመው። Shukor እና ሌሎች SmolVLA ን በአንድ GPU ላይ ለማሰልጠንና በተጠቃሚ GPU ወይም CPU ላይ ለማሰማራት (deploy) የተነደፈ አድርገው ይገልጹታል፣ ከፍ ያለ የቁጥጥር መጠን (control rate) እንዲፈቀድ የአክሽን ትንበያን ከአፈጻጸም የሚነጣጥል አሲንክሮነስ (asynchronous) የኢንፈረንስ ስታክ ጋር - ይህ ባህሪ ቁጥጥር-መውሰድ ዙርን ምላሽ ሰጪ (responsive) አድርጎ የሚያቆየው ነው።
የዳታሴት ፎርማቶችም እርስ በርስ የሚለዋወጡ አይደሉም። GR00T LeRobot v2.0 ወይም v2.1 ይወስዳል፣ የIsaac-GR00T ማከማቻ (repository) ደግሞ ግቤቱን የተጨመረ modality description ፋይል ያለው የLeRobot v2 ፎርማት አይነት (flavour) አድርጎ ይገልጻል፤ እዚህ ያሉት አዳዲስ አሰልጣኞች (trainers) v3.0 ይጠብቃሉ። በተሳሳተ ቨርዥን የተገነባ ቅልቅል መጥፎ ፖሊሲ ከማምረት ይልቅ በመጫኛ ጊዜ ይወድቃል - የተሻለ የውድቀት ሁነታ ነው፣ ቢሆንም ግን የተባከነ የተራ (queue) ቦታ ነው። የዳታሴት ሰነድ እያንዳንዱ አሰልጣኝ የትኛውን ፎርማት እንደሚወስድ ይዘረዝራል።
ዙሩ፣ የመዝገብ አያያዙ አስቀድሞ ተሰርቶ
በመሪ ክንድ፣ ኪቦርድ ወይም ስላይደር ቁጥጥር መውሰድ፤ የእያንዳንዱ ፍሬም ጣልቃ ገብነት ምልክት ማድረግ፤ ሩኖችን እንደ እርማት ወይም ግምገማ መዝግቦ ማስቀመጥ፤ የኤፒሶድ ምርጫ በእያንዳንዱ ምንጭ ላይ በግልጽ ተደርጎ የተቀላቀለ ዳታሴት መገንባት፤ እና ከመሰረታዊው ሞዴል ይልቅ ከቼክፖይንት ስልጠናን መቀጠል። አንተ ላይ የሚቀረው ውሳኔ የትኛው ሩን እንደ እርማት እንደሚቆጠር፣ ምን ወደ ቅልቅሉ እንደሚገባ፣ እና የጣልቃ ገብነት መጠኑ መቀነሱን መቼ እንዳቆመ ነው።
የDAgger ዙር እንዴት እንደተገጣጠመ ተመልከትዙርን ለማባከን አራት መንገዶች
1. በእርማቶች ብቻ ማሰልጠን
በጣም የተለመደው ውድቀትና በጣም አታላይ አቋራጭ (shortcut) ነው። እርማት-ብቻ ያለው ዳታሴት በሙሉ ማለት ይቻላል የስራው አስቸጋሪ መሃል ክፍል ነው፣ አቀራረብና ማፈግፈግ ጠፍተውበታል፤ ፖሊሲው በአስቸጋሪው ክፍል ላይ ይሻሻላል፣ ወደዚያ እንዴት እንደሚደርስ ግን ይረሳል። ማጠራቀም (aggregation) የዘዴው የትግበራ ዝርዝር ጉዳይ ሳይሆን ራሱ ዘዴው (mechanism) ነው፦ የቀሪውን ባህሪ በቦታው የሚያቆየው አሮጌው ዳታ ሲሆን፣ እርማቶቹ ደግሞ አንድ ክፍሉን ብቻ ያንቀሳቅሳሉ።
2. በዙሮች መካከል ካሜራ ማንቀሳቀስ
በዙሮች መካከል በሁለት ሴንቲሜትር የምትንቀሳቀስ ካሜራ ከጀመርክበት የከፋ ፖሊሲ ታመርታለች፣ አንድ ቀንም የሚያስከፍል ምርመራ (diagnosis)። እዚህ ያለ እያንዳንዱ VLA በምስሎች ላይ የተመሰረተ ነው፤ የመገጣጠሚያ ሁኔታ (joint state) ብቻውን ነገሩ የት እንዳለ በግልጽ አያሳይም። ከመጀመሪያው ዙር በፊት አደራደሩን (setup) ፎቶ አንሳ፣ ከዚያ በኋላ ባለው እያንዳንዱ ዙር በፊትም ያንን ፎቶ አረጋግጥ።
3. የርክክብ ቅሪቶች (artefacts) ወደ ስልጠና እንዲገቡ መፍቀድ
ከላይ ተነስቷል፣ በዝርዝሩ ውስጥ ያለውም የማይታይ ስለሆነ ነው። ምልክቱ ያለፈው ዙር ኦፕሬተር ቁጥጥር በወሰደበት ቦታ ላይ በትክክል ለአንድ ሰከንድ ክፍልፋይ የሚቆም ፖሊሲ ነው። እንደ ማመንታት ይመስላል፤ እውነታው ግን አስመስሎ መማር (imitation) ነው።
4. warm start ን resume ብሎ መጥራት
የኦፕቲማይዘር ሁኔታ (state) ተሸጋግሮ እንደነበር ካመንክ፣ የመጀመሪያው የኪሳራ መጨመር (loss spike) እንደ ባግ ይነበብና የተበላሸ ዳታ ፍለጋ ትገባለህ። ኦፕቲማይዘሩ ከዜሮ እንደጀመረ ካወቅህ ግን፣ መጨመሩ የሚጠበቅ ነው፣ ከዚያ በኋላ ወደሚመጣው ትመለከታለህ። ተመሳሳይ ቁጥሮች፣ ተቃራኒ መደምደሚያዎች።
ዙሩን መለካት
የሰው-ቁጥጥር ስር ላለ ዙር (human-gated loop) መለኪያው የጣልቃ ገብነት መጠን ነው፦ አንተ ቁጥጥር ላይ በነበርክበት ጊዜ የተቀዱ ፍሬሞች፣ በሩኑ ጠቅላላ ፍሬሞች ተካፍለው። ይህ በ takeover ሁኔታ (status) ውስጥ ይገኛል፣ ዙሩ የጠየቀውን ጥያቄ የሚመልስ ብቸኛው ቁጥርም ነው። ፖሊሲው ተሻሽሎም ባይሻሻልም የስልጠና ኪሳራ ይቀንሳል፤ የስኬት መጠን ደግሞ ባይነሪ ነው፣ የጠረጴዛ ክንድ በሚያመርተው የናሙና መጠን ላይም ጫጫታ (noisy) ያለው ነው። የጣልቃ ገብነት መጠን ተከታታይ (continuous) ነው፣ የሚለካውም ፖሊሲው ራሱ በሚያመጣቸው ሁኔታዎች ላይ ነው፣ ፖሊሲው ባንተ ላይ ያለው ጥገኝነት ሲቀንስም ይቀንሳል።
በተመሳሳይ ሁኔታዎች ስር በተቀዱ ሩኖች መካከል ብቻ አነጻጽረው። ሙሉው መከራከሪያ፣ ከሁለት ዙር በላይ የሚዘልቅ የግምገማ ስብስብ (evaluation set) እንዴት እንደሚገነባም፣ በየDAgger ዙርን ስለመለካት በሚያትተው ጽሁፍ ውስጥ። ዙር አንድ በእውነታ የአዋጭነት ሙከራ (feasibility test) ነው፦ ቁጥጥር መውሰዱ በሃርድዌርህ ላይ እንደሚሰራ፣ እርማቶች ከምልክቶቻቸው ጋር እንደሚያርፉ፣ እና የቀጠለው ሩን የሰየምከውን ቼክፖይንት እንደጫነ እያረጋገጥክ ነው። መጠኑ መንቀሳቀስ የሚጀምረው በዙር ሁለትና ሶስት ነው። እስከ ዙር አራት ካልተንቀሳቀሰ፣ ችግሩ ከDAgger በላይ ያለ (upstream) ነው።
| በእያንዳንዱ ዙር መዝግብ | በኋላ ለምን እንደሚያገለግል |
|---|---|
| የተነዳበት ቼክፖይንት | ያለ እሱ መሻሻልን ለተወሰነ ቅልቅል ልታስከትል (attribute) አትችልም |
| ለቁጥጥር መውሰድ የተጠቀምከው የግቤት ሁነታ | የኪቦርድ እርማቶች ከመሪ እርማቶች ይልቅ ያልጠሩ ናቸው፣ ይህም በዳታው ላይ ይታያል |
| የሩኖች ብዛትና እያንዳንዱ እንዴት እንደተመረመረ (triaged) | ዙሩ ትርጉም ያለው ያህል በቂ እርማቶች ነበሩት ወይ |
| በእያንዳንዱ ሩን የጣልቃ ገብነት መጠንና አማካኙ | የዙሩ የግስጋሴ መለኪያ |
| በእያንዳንዱ ምንጭ ላይ ትክክለኛ የኤፒሶድ ምርጫ | ዙርን ደግሞ ለመስራት ወይም ለመሻር ብቸኛው መንገድ |
| Warm start ወይስ ከዜሮ ስልጠና | ከሳምንት በኋላ የምትመለከተውን የኪሳራ ከርቭ (loss curve) ያብራራል |
እስካሁን ቼክፖይንት ከሌለህ
ያለ እሱ ዙሩ መግቢያ ነጥብ የለውም። የመጀመሪያውን ዳታሴት ቅዳ፣ የመጀመሪያውን ፖሊሲ አሰልጥን፣ አስኪደው - ቀረጻ፣ ስልጠና እና ፖሊሲውን ማስኬድ ያንን መንገድ ይሸፍናሉ። የቀረጻ ክላይንቱ በየማውረጃ ገጹ ላይ ይገኛል፣ የGPU ደረጃዎችና የሰዓት ዋጋዎች ደግሞ በየዋጋ ገጹ ላይ፣ ጥቅም ላይ ሊውል የሚችል ኤፒሶድ ምን እንደሚመስል ደግሞ በSO-100 የዳታ አሰባሰብ መመሪያ ውስጥ ይገኛል። ወደ እርማቶቹ ከመሄድህ በፊት ማሳያዎቹን በትክክል አድርግ፦ DAgger የጥገና ዘዴ (repair mechanism) ነው፣ ገና ከወዲሁ ትክክል በሆነ ነገር ላይ ደግሞ በጣም በተሻለ ይሰራል።
ያለ መሪ ክንድ የDAgger ዙር ማካሄድ እችላለሁ?▾
አዎ። «Take over»ን ስትጫን የኪቦርድ ወይም የስላይደር ግቤት ምረጥ፦ ቁጥጥር መውሰዱ ወዲያውኑና በእጅ ነው፣ የሚስተካከል ሁለተኛ ክንድም አያስፈልግም። ኪቦርድ ሰርቨሩ በእያንዳንዱ መገጣጠሚያ በ2 ዲግሪ፣ ለግሪፐሩ በ4 ዲግሪ ጥብቅ ገደብ የሚያደርግባቸውን አንጻራዊ ግፊቶች (relative nudges) ይልካል፤ ስላይደሮች ፍጹም ኢላማ ይልካሉ፣ ሰርቨሩም በእያንዳንዱ ጥሪ ወደዚያ በአብዛኛው 6 ዲግሪ ይንቀሳቀሳል፣ በይነገጹ ደግሞ መላኩን ይቀጥላል። የአክሽን አምዱና የጣልቃ ገብነት ምልክቱ ልክ እንደ መሪ ሁነታ ተመሳሳይ ናቸው፣ ስለዚህ እርማቶቹ በዳታሴቱ ውስጥ ተለይተው አይታወቁም።
አንድ ዙር ስንት እርማቶች ያስፈልጉታል?▾
የሚከላከል ሁለንተናዊ ቁጥር የለም፣ የፍሬም ብዛትም ከኤፒሶድ ብዛት በላይ ጠቀሜታ አለው። የስራ ደንቡ እርማቶቹ በቅልቅሉ ውስጥ መጥፋት የለባቸውም የሚል ነው፦ 200 ዋና ኤፒሶዶችና ሶስት የእርማት ኤፒሶዶች ካሉ፣ ምንም ነገር አይንቀሳቀስም። ተመሳሳይ ማዳን (rescue) ሶስት ጊዜ ከመድገም ይልቅ ውድቀት ያለበትን ባህሪ ከብዙ የመነሻ ውቅሮች (configurations) የሚሸፍኑ እርማቶችን አልም።
በእርማቶች ብቻ ማሰልጠን ለምን መጥፎ ሃሳብ ነው?▾
እርማቶች በሙሉ ማለት ይቻላል የስራው አስቸጋሪ መሃል ክፍል ስለሆኑ ነው። አቀራረብ፣ ማስተካከያ እና ማፈግፈግ ጠፍተውበታል፣ ስለዚህ ፖሊሲው ባስተካከልከው ክፍል ላይ ሲሻሻል ቀድሞ በደንብ ያደርገው የነበረውን ያጣል። አሮጌውን ዳታ አቆይቶ ወደ እሱ መጨመር ራሱ ዘዴው (mechanism) ነው እንጂ አማራጭ ተጨማሪ አይደለም።
ከቼክፖይንት መቀጠል ያለፈውን የስልጠና ሩን resume ያደርገዋል?▾
አይደለም። ክብደት-ብቻ ቼክፖይንት ፓራሜትሮችን ብቻ ይመልሳል፣ ሌላ ምንም፦ የኦፕቲማይዘር ሞመንቶች፣ የመማር-መጠን ጊዜ ሰሌዳ አቀማመጥ እና የዳታ ቅደም ተከተል ከዜሮ ይጀምራሉ። ይህ warm start ነው፣ የመጀመሪያውም የኪሳራ መጨመር እንደ ምልክት (symptom) ሳይሆን የሚጠበቅ ነገር ነው። ከሁለቱ የትኛውን በትክክል እንዳደረግህ መዝግብ፣ ከሳምንት በኋላም ከርቩን በትክክል እንድታነብ።
የጣልቃ ገብነት መጠኑ ካልቀነሰ ምን ይሆናል?▾
ዙሮችን መጨመር አቁም። ጠፍጣፋ መጠን ማለት እርማቶቹ እንዳሰብከው እያስተማሩ አይደሉም ማለት ነው። የተለመዱት ምክንያቶች ከDAgger በላይ ያሉ (upstream) ናቸው፦ ካሜራ ተንቀሳቅሷል፣ እርማቶቹ የመራቅ ዳታ (avoidance data) ለመሆን በጣም ዘግይተው ይጀምራሉ፣ የርክክብ ፍሬሞች በስልጠና ስብስቡ ውስጥ አሉ፣ ወይም ፖሊሲው ከሚያገኛቸው ምልከታዎች አንጻር ስራው በበቂ ሁኔታ አልተወሰነም (underdetermined)።
ከዚህ ውስጥ አንዳቸውም የተፈታ ችግር አይደሉም፣ አንዳቸውም በአንድ ጠቅታ የሚደረጉ አይደሉም። ኢንተራክቲቭ አስመስሎ መማር (interactive imitation learning) ንቁ የምርምር ዘርፍ የሆነው በትክክል ጥያቄዎቹ - መቼ ጣልቃ መግባት እንዳለበት፣ ሰውየው ያደረገውን እንዴት መመዘን እንዳለበት፣ ምን ያህል አሮጌ ዳታ ማቆየት እንዳለበት - ግልጽ መልስ ስለሌላቸው ነው፤ በCelemin እና ሌሎች የተደረገው ጥናት (survey) አሁንም ክፍት የሆነውን ያሳያል። ዙሩ ያለው ነገር ግን በጥንቃቄ ሲካሄድ፣ ጥቂት መቶ ዩሮ በሚያስከፍል ሃርድዌር ላይ፣ ሊለካ የሚችል ኮንቨርጀንስ (convergence) ነው። አደራደሩን አስተካክለህ ቀዝቅዝ፣ ቀድመህ ጣልቃ ግባ፣ በታማኝነት መርምረህ ደርድር፣ ሆን ብለህ ቀላቅል፣ እና በየጊዜው የጣልቃ ገብነት መጠኑን መዝግብ።
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started