ጠረጴዛ ላይ የተቀመጠ ርካሽ SO-100 ሮቦት ክንድ፣ ለቴሌኦፐሬሽንና ለፖሊሲ ስልጠና የተዘጋጀ
DAggerSO-100አስመስሎ መማርVLAቴሌኦፐሬሽን

በ SO-100 ላይ በ VLA ፖሊሲ የDAgger ዙር ማካሄድ

AY-Robots ResearchAugust 27, 2026የ15 ደቂቃ ንባብ

በ SO-100 ክንድ ላይ ስለተካሄደ አንድ በሰው ቁጥጥር ስር ያለ (human-gated) የDAgger ዙር ደረጃ በደረጃ የቀረበ ማብራሪያ፦ ፖሊሲውን ማስኬድና መቅዳት፣ ስህተት ሲፈጠር ቁጥጥር መውሰድ፣ ሩኑን እንደ እርማት (correction) መመዝገብ፣ የተቀላቀለ ዳታሴት መገንባት፣ እና ስልጠናን ከቼክፖይንት መቀጠል። ያለ መሪ ክንድ ለሚሰሩ ሰዎች የኪቦርድና የስላይደር መቆጣጠሪያ መንገድን፣ እንዲሁም ዙርን ከንቱ የሚያደርጉ አራት ስህተቶችን ያካትታል።

ፖሊሲህ ይሰራል። ወደ ኪዩቡ ይደርሳል፣ ግሪፐሩን ከትክክለኛው ቅጽበት አንድ ሴንቲሜትር ቀደም ብሎ ይዘጋል፣ እና እንደያዘው ሆኖ መንቀሳቀሱን ይቀጥላል። ምንም ስህተት አይታይም፣ የስልጠናውን ኪሳራ (loss) ምንም ያህል ብታስተውል ምክንያቱን አይነግርህም። መፍትሄው በተመሳሳዩ ማሳያዎች ላይ ተጨማሪ 20 000 ግራዲየንት እርምጃዎችን ማድረግ አይደለም። ይልቁንም ስህተቱ በትክክል በሚፈጠርበት ቦታ እጅህን ወደ ክንዱ መመለስ፣ ከዚያ ይልቅ ያደረግከውን መቅዳት፣ እና ቀጣዩን ቼክፖይንት በአሮጌው ዳታ ላይ ያንን እርማት ጨምረህ ማሰልጠን ነው። ይህ የDAgger ዙር ነው፤ አንድ ዙር በSO-100 ላይ በቪዥን-ላንጉዌጅ-አክሽን ፖሊሲ እንዴት እንደሚካሄድ የሚያሳይ ነው።

ንድፈ ሃሳቡ በሌላ ቦታ ይገኛል፦ ዳታሴት ማጠራቀም ለምን ጨርሶ እንደሚሰራ እና የሰው ቁጥጥር (human gating) ስለ እሱ ምን እንደሚቀይር። ይህ የአሰራር መመሪያ ነው፤ የሰለጠነ ቼክፖይንት፣ የሚሰራ የካሜራ ስብስብ እና የሚንቀሳቀስ ክንድ እንዳለ ይገምታል። ከዚህ በታች ያሉት ስድስት ደረጃዎች ዙሩ እንደተተገበረው ናቸው፣ በበዚህ መድረክ የDAgger ገጽ ላይ፤ ነገር ግን ቅደም ተከተሉ ከራስህ ስክሪፕቶች ጋርም ተመሳሳይ ነው።

አንድ ዙር በአጭሩ

  • የሰለጠነውን ፖሊሲ አስኪደህ ቅዳው፣ ከጠቅላላ የቴሌኦፐሬሽን መለያ ይልቅ የሩኑን የተግባር ጽሁፍ (task text) ተጠቅመህ።
  • ባህሪው ስህተት በሚፈጥርበት ቅጽበት ቁጥጥር ውሰድ፦ ከመሪ ክንድ ጋር በሚደረግ ሚረር (mirror) ርክክብ፣ ወይም መሪ ክንድ ከሌለ በኪቦርድ ወይም በስላይደር ወዲያውኑና በእጅ።
  • እያንዳንዱን ሩን መርምረህ ደርድር፦ እንደ እርማት መዝግበው፣ እንደ ግምገማ ኤፒሶድ አቆየው፣ ወይም ጣለው።
  • ቅልቅሉን በእጅ ገንባ - ዋናዎቹ ማሳያዎች ከእርማቶች ጋር፣ ኤፒሶዶቹ በምንጭ እየተመረጡ። በእርማቶች ብቻ በፍጹም አታሰልጥን።
  • ስልጠናን ከመጨረሻው ቼክፖይንት ቀጥል፣ የትኛው ቼክፖይንት የትኛውን ቅልቅል እንዳመረተ መዝግብ።
  • ዙሩ ዋጋ ያለው መሆኑን የሚነግርህ ቁጥር የጣልቃ ገብነት መጠን ነው፣ የስልጠና ኪሳራ (loss) አይደለም።

ሁለተኛው ዙር ተጨማሪ ዳታ ብቻ ያልሆነው ለምንድን ነው

ቢሄቪየር ክሎኒንግ (Behavior Cloning) የሚያሰለጥነው ሰው በጎበኛቸው ሁኔታዎች (states) ላይ ብቻ ነው። በሙከራ ጊዜ ግን ፖሊሲው ራሱ በሚያስከትላቸው ሁኔታዎች ውስጥ ይንቀሳቀሳል፣ ትንንሽ የአክሽን ስህተቶችም ምንም ማሳያ ወዳልሸፈናቸው ሁኔታዎች እየተጠራቀሙ ይወስዱታል። Ross, Gordon እና Bagnell ይህን ውድቀት ለ AISTATS 2011 በይፋ አስቀምጠው፣ ቋሚ የማያሻማ (deterministic) ፖሊሲ የሚያሰለጥን እና በቅነሳቸው መሰረት ራሱ በሚፈጥረው የሁኔታ ስርጭት ስር በጥሩ ሁኔታ መስራት ያለበት ተደጋጋሚ (iterative) አልጎሪዝም በመስጠት መልስ ሰጡት፦ የአሁኑን ፖሊሲ አስኪድ፣ ኤክስፐርቱ በትክክል የደረሰባቸውን ሁኔታዎች እንዲሰይም አድርግ፣ እነዚያን ወደ ዳታሴቱ ጨምር፣ እንደገና አሰልጥን፣ ድገም። Kelly እና ሌሎች በ HG-DAgger ይህን ጥያቄ ተግባራዊ አደረጉት፤ በዚህ ውስጥ ሰውየው ቁጥጥሩን ሳይይዝ ሁኔታዎችን ከመሰየም ይልቅ መቼ ቁጥጥር መውሰድ እንዳለበት ራሱ ይወስናል፤ በተመሳሳይ እና በእውነተኛ ራስ-ገዝ የመንዳት ስራ ላይ ከDAgger እና ከቢሄቪየር ክሎኒንግ የተሻለ አፈጻጸም እንዳገኙ ዘግበዋል። ዙሩን በጠረጴዛ ክንድ ላይ ተቀባይነት ያለው የሚያደርገው የሰው ቁጥጥር (human gating) ነው - እጅህን የምታንቀሳቅሰው ነገር ስህተት ሲፈጥር ብቻ ነው።

በተግባር ላይ ከንድፈ ሃሳቡ የበለጠ ጠቀሜታ ያላቸው ሁለት ውጤቶች አሉ። እርማቶች እንደ ተራ ማሳያዎች አይደሉም፦ Mandlekar እና ሌሎች እንደገለጹት፣ ትንሽ መዛነፍ እንኳ ፖሊሲውን ማሳያዎቹ ፈጽሞ ወዳልሸፈኗቸው ሁኔታዎች በሚያንደረድሩባቸው ማነቆ (bottleneck) አካባቢዎች ላይ ያተኩራሉ። እነዚያን አስቸጋሪ ክፍሎች ብቻ የያዘ ዳታሴትም በደንብ ያልተቀረጸ ዳታሴት ነው - Belkhale, Cui እና Sadigh ከዳታ አንፃር የሁኔታ ብዝሃነት (state diversity) ሁልጊዜ ጠቃሚ እንዳልሆነ፣ ይልቁንም የአክሽን ልዩነትና የሽግግር ብዝሃነት (transition diversity) ተዳምረው የዳታሴቱን ጥራት እንደሚወስኑ ይከራከራሉ። የተቀላቀለው ዳታሴት ማስተካከያ (compromise) ሳይሆን ራሱ ዋናው ነጥብ ነው።

ከመጀመሪያው ዙር በፊት እነዚህን አስተካክለህ ቀዝቅዝ

አንድ የDAgger ዙር ፖሊሲውን ከራሱ ጋር በጊዜ ውስጥ ያነጻጽራል። ከዳታሴት ውጭ በዙሮች መካከል የምትቀይረው ማንኛውም ነገር ያንን ንጽጽር ትርጉም አልባ ያደርገዋል።

  • የካሜራ አቀማመጦችና ማንጠልጠያዎች፣ የእጅ አንጓ ካሜራን ጨምሮ። አንድ ክላምፕ ብታላላ የቀየርከው የፖሊሲውን ሳይሆን የምልከታ (observation) ስርጭትን ነው።
  • ኤክስፖዠርና ነጭ ማመጣጠኛ (white balance)፣ የካሜራ ስርአትህ እነዚህን እንድትቆልፍ የሚፈቅድ ከሆነ። በዙሮች መካከል የሚንሸራተት ራስ-ሰር ኤክስፖዠር (auto-exposure) ቀስ በቀስ የማይታይ የዶሜይን ለውጥ ነው።
  • የክንድ ካሊብሬሽንና የሰርቮዎች ዜሮ አቀማመጥ። እንደገና ካሊብሬት ማድረግ ካስፈለገህ፣ ከዚያ በፊት የተቀዳውን ሁሉ እንደ የተለየ ዳታሴት ቁጠረው።
  • የተግባር ጽሁፉ (task text)። እዚህ ያለ እያንዳንዱ VLA በእሱ ላይ የተመሰረተ ነው፤ በዙር መሃል ቃላቱን መቀየር የተለየ ተግባር ማድረግ ነው።
  • ብርሃን፣ የጠረጴዛው ወለል፣ የነገሮች ስብስብ። አዲስ ነገር አዲስ ሙከራ ነው፣ ቀጣይ ዙር አይደለም።
  • የቀረጻው ፍሬም ፍጥነት (frame rate)። በሁለት የተለያዩ ናሙና ራስተሮች (sampling rasters) መካከል የጣልቃ ገብነት መጠኖችን ማነጻጸር ከራስተሩ ራሱ የሚመነጭ ልዩነት ያመጣል።
የእጅ አንጓ ካሜራ አማራጭ ጌጣጌጥ አይደለም

Hsu እና ሌሎች በእጅ ላይ ያተኮረ እይታን ከተለመደው የሶስተኛ ሰው እይታ ጋር አነጻጽረው፣ የእጅ-ውስጥ (eye-in-hand) እይታ ከትዕይንቱ ያነሰ ቢያይም የስልጠና ብቃትንና ከመረጃ ስርጭት ውጭ ላሉ ሁኔታዎች መስተካከልን (out-of-distribution generalization) በተከታታይ እንደሚያሻሽል አግኝተዋል። ባለአምስት-መገጣጠሚያ ክንድ ላይ፣ እርማቶችህ በተለምዶ የሚያስተካክሉት የግሪፐሩን ጊዜ አወሳሰድ ነው፣ ይህንንም የግሪፐር ጊዜ አወሳሰድ የሚሸከመው የእጅ አንጓ ካሜራ እይታ ነው።

ዙሩ፣ ከመጀመሪያ እስከ መጨረሻ

  1. 1
    ኢንፈረንስ አስኪደህ ቅዳው

    ማሻሻል በምትፈልገው ቼክፖይንት ላይ ሩኑን ጀምር፣ ከዚያም ቀረጻውን ወደ ኢንፈረንስ ስር (inference root) ጀምር። በዚህ መልኩ ሲቀዳ፣ ከነባሪው የቴሌኦፐሬሽን መለያ ይልቅ ፖሊሲው የሰለጠነበትን የሩኑን ራሱን የተግባር ጽሁፍ ይወርሳል። ያለ ቀረጻ ውድቀቱን ማየት ትችላለህ፣ ግን በእሱ ላይ ማሰልጠን አትችልም።

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    ስህተት ሲፈጠር ቁጥጥር ውሰድ

    «Take over»ን ተጫንና የግቤት ሁነታ (input mode) ምረጥ፦ መሪ ክንድ፣ ኪቦርድ ወይም ስላይደር። ሯጩ (runner) ያቆማል፣ አንተ ታስተካክላለህ፣ ከዚያ ትመልሳለህ። አንተ በምትነዳበት ጊዜ የተቀዱ ፍሬሞች ራስ-ሰር በሆነ መልኩ እንደ ጣልቃ ገብነት ይሰየማሉ።

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    ኤፒሶዶቹን መርምረህ ደርድር

    በእያንዳንዱ ኤፒሶድ ወስን፦ እንደ እርማት መዝግብ፣ እንደ ግምገማ አቆይ፣ ወይም ጣል። ያለ እርዳታ ፖሊሲው ራሱ ያጠናቀቀው ሩን የግምገማ ዳታ ነው።

  4. 4
    የእርማት ዳታሴቱን አመሳስል (sync)

    እርማቶች በእያንዳንዱ ፖሊሲ ውስጥ በአካባቢያዊ ዳታሴት ውስጥ ይሰበሰባሉ፣ ራስ-ሰር በሆነው sync አማካኝነትም ወደ ደመና ማከማቻ ይሄዳሉ። አንተ ያላስገባኸው ምንም ነገር አይቀላቀልም።

  5. 5
    የተቀላቀለውን ዳታሴት ገንባ

    ዋናውን ዳታሴት ከእርማቶች ጋር አጣምር፣ ኤፒሶዶቹንም እያንዳንዱን ምንጭ በግልጽ እየመረጥህ። ውጤቱ ከዚያ ወዲያ ተራ ዳታሴት ነው።

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    ስልጠናን ከቼክፖይንቱ ቀጥል

    ቅልቅሉን ከመሰረታዊው ሞዴል ይልቅ ካለፈው ቼክፖይንት አሰልጥን። የትኛው ቼክፖይንትና የትኛው ቅልቅል እንደሆነ መዝግብ፤ ያ ጥንድ ከሌለ ዙሩ ተደግሞ ሊሰራ አይችልም (not reproducible)።

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

ደረጃ 2 በዝርዝር፦ ቁጥጥር ለመውሰድ ሁለት መንገዶች

በመሪ ክንድ

leader-follower ሁነታ ውስጥ፣ ቁጥጥር መውሰድ በአንድ ላይ ባልሆኑ አቀማመጦች መካከል ባሉ ሁለት ክንዶች መካከል የሚደረግ ርክክብ ነው። «Take over»ን መጫን ሯጩን ያቆምና መሪውን ወደ ተከታዩ የአሁኑ አቀማመጥ ያንቀሳቅሰዋል፣ ስለዚህ ቶርኩ ሲተላለፍ ምንም ነገር አይዘልም። ያ የማስተካከያ እንቅስቃሴ (alignment drive) ጊዜው ካለቀበት፣ መሪውን በእጅህ አስተካክለህ ሁለቱ በአምስት ዲግሪ ውስጥ ሲሆኑ ብቻ ልቀቅ። ከዚያ በኋላ በተለመደው መንገድ ቴሌኦፐሬት ታደርጋለህ፣ የአክሽን አምዱም ያዘዝከውን ይመዘግባል።

ስለዚህ መንገድ ታማኝ ሁን፦ የማስተካከያ እንቅስቃሴውና የቶርክ ርክክቡ በእውነተኛ ሃርድዌር ላይ ከሁሉም ያነሰ የተፈተነው የዙሩ ክፍል ናቸው። በምትጨነቅበት ሩን ላይ ከመተማመንህ በፊት ርክክቡን በዝግተኛና ምንም ጉዳት በሌለው አቀማመጥ ላይ ሞክረው። ከሶስቱ ሁነታዎች መካከል መሪ ክንድ በጣም ለስላሳ እርማቶችን ያመርታል፣ በተመሳሳይም በሜካኒካል በኩል በጣም ብዙ ችግር ሊፈጠርበት የሚችል ነው።

ያለ መሪ ክንድ፦ ኪቦርድና ስላይደሮች

ይህን የሚያነቡ አብዛኞቹ ሰዎች አንድ ክንድ ብቻ አላቸው። ያ ይበቃል። «Take over»ን በምትጫንበት ቅጽበት የኪቦርድ ወይም የስላይደር ግቤት ምረጥ፣ ቁጥጥር መውሰዱም ወዲያውኑና በእጅ ይሆናል - የሚስተካከል ሁለተኛ ክንድ ስለሌለ የማስተካከያ ደረጃም የለም። ተከታዩ አቀማመጡን ይዞ ግቤት ይጠብቃል።

የግቤት ሁነታክንዱ እንዴት እንደሚንቀሳቀስበሰርቨሩ የሚጫን በእያንዳንዱ ጥሪ ወሰንየሚቆለፍበት ጊዜ
መሪ ክንድሚረሩ (mirror) ተከታዩን ከመሪው የመገጣጠሚያ አንግሎች ይነዳዋልበዚህ ሁነታ ውስጥ ምንም nudge ወይም set ጥሪዎች የሉም፤ ሚረሩ የተከታዩን ግቦች በተከታታይ ይጽፋልፈጽሞ አይቆለፍም፣ የግቤት ሁነታ ካልተሰጠም ነባሪው ይህ ነው - ነገር ግን ሁለተኛ ክንድ ይፈልጋል፤ የመሪ መለያ (leader id) ከሌለ ቁጥጥር መውሰዱ ይከለከላል
ኪቦርድበእያንዳንዱ ቁልፍ ግፊት አንጻራዊ ግፊት (nudge) ወደ takeover nudge ኢንድፖይንት ይላካልጥብቅ ገደብ በእያንዳንዱ መገጣጠሚያ 2 ዲግሪ፣ ለግሪፐሩ 4 ዲግሪቁጥጥር መውሰዱ በመሪ ሁነታ ከተጀመረ በ409 ውድቅ ይደረጋል
ስላይደሮችፍጹም ኢላማ አቀማመጥ (absolute target pose)፣ ወደ takeover set ኢንድፖይንት ይላካልበእያንዳንዱ ጥሪ ወደ ኢላማው በአብዛኛው 6 ዲግሪ ጉዞ፤ በይነገጹም በሰከንድ አስር ጊዜ ያህል መላክ ይቀጥላልቁጥጥር መውሰዱ በመሪ ሁነታ ከተጀመረ በ409 ውድቅ ይደረጋል

ገደቦቹ የሚጫኑት በሰርቨር በኩል እንጂ በበይነገጹ ላይ አይደለም፣ ምክንያቱም በ bus-servo ክንድ ላይ በስህተት የተተየበ ዴልታ ግጭት ስለሚያስከትል ነው። የኪቦርድ እርማቶች እርከናዊ (stepwise) እና ትንሽ ያልጠራ ሆነው ይወጣሉ፤ የስላይደር እርማቶች ግን ለስላሳ ናቸው፣ ምክንያቱም ሰርቨሩ ወደ ኢላማው በእግር እየሄደ (walks) ሲሆን በይነገጹ ደግሞ መላኩን ይቀጥላል። በሁለቱም መንገድ የአክሽን አምዱ ሙሉውን የታዘዘ የአቀማመጥ ቬክተር ይቀበላል፣ የጣልቃ ገብነት ምልክቱም ከመሪው መንገድ ጋር ተመሳሳይ ነው፣ ስለዚህ የኪቦርድ እርማቶች ያለ ምንም የፎርማት ልዩነት በተመሳሳዩ ዳታሴት ውስጥ ያርፋሉ።

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
በስታኩ ውስጥ ካሉት ሌሎች ቦታዎች ጋር ተመሳሳይ የቁልፍ አቀማመጥ (key layout) ስለሆነ፣ ከቀረጻ ጊዜ የተገኘው የጡንቻ ትዝታ (muscle memory) ይሸጋገራል።
በ SO-100 ዳታሴት ላይ የGR00T ፋይን-ትዩኒንግ ሩን የተደረደሩ ደረጃዎችን የሚያሳይ የስልጠና መመሪያ
የአንድ ዙር የስልጠና ክፍል ከመጀመሪያው ሩን ጋር ተመሳሳይ የተመራ ቅደም ተከተል ነው፤ የሚለያየው የቼክፖይንት መስኩ ብቻ ነው።

ቁልፉን መቼ መጫን እንዳለብህ

ዘግይተህ ሳይሆን ቀድመህ። ግሪፐሩ በምንም ላይ ሳይኖር ከተዘጋ በኋላ የሚጀምር እርማት፣ ፖሊሲው መግባት ከሌለበት ውድቀት እንዴት እንደሚያገግም ያስተምረዋል፤ የማገገሚያ ዳታ (recovery data) ግን ከመራቅ ዳታ (avoidance data) በጣም ያነሰ ዋጋ አለው። አካሄዱ ስህተት እንደሆነ እርግጠኛ በምትሆንበት የመጀመሪያ ቅጽበት አቋርጥ፣ በአስቸጋሪው ክፍል ውስጥ አስተካክል፣ ፖሊሲው ከዚህ በፊት የያዘው አይነት ሁኔታ ላይ እንደደረሰ ወዲያውኑ መልስ። ThriftyDAgger ጣልቃ ገብነቶችን በአዲስነት (novelty) እና በተገመተ ስጋት ላይ በተወሰነ የሰው በጀት (human budget) ስር በማገደብ ይህን ውሳኔ ራስ-ሰር ያደርገዋል፤ ነገር ግን ቀድሞውኑ ሰው በሚመለከትበት አንድ ክንድ ላይ፣ የሰው ገደብ (human gate) ካንተ ማንኛውም ማስተካከያ የበለጠ ርካሽና በተሻለ የተስተካከለ ነው።

ክፍት-ምንጭ (open-source) ስታኩና ጥቂት ስክሪፕቶች ይህን ማድረግ ይችላሉ። የሚያስከፍለው ነገር ግን የመዝገብ አያያዝ (bookkeeping) ነው፣ የDAgger ዙሮችም የሚሞቱት እዚያ ላይ ነው።

  1. ከራስህ ኢንፈረንስ ስክሪፕት ፍሬሞችን ፖሊሲው ወደ ሰለጠነበት የተግባር ጽሁፍ (task string) ጋር ወደ LeRobot ዳታሴት ጻፍ።
  2. የፖሊሲውን ዙር አቁም፣ የትዕዛዝ ምንጩን ቀይር፣ አንተ የምትነዳውን እያንዳንዱን ፍሬም እንደ ጣልቃ ገብነት ምልክት አድርግበት። ያለ ምልክቱ፣ እርማቶች እንደ ተራ ማሳያዎች ይታያሉ።
  3. ፖሊሲው ቁጥጥሩን ከለቀቀበት እስከ አንተ የመጀመሪያ ግቤት ባለው የሽግግር ፍሬሞች ላይ ምን እንደሚደረግ ሆን ብለህ ወስን።
  4. እርማቶችን በእያንዳንዱ ፖሊሲ ራሱ ዳታሴት ውስጥ አቆይ፣ ቅልቅሉም ተመልሶ ሊገነባ እንዲችል የኤፒሶድ ኢንዴክሶችን በእጅ ተከታተል።
  5. የፋይን-ትዩኒንግ መግቢያ ነጥቡን ወደ ቀድሞው ቼክፖይንት አመልክት፣ በሎጉ ውስጥም እነዚያ ክብደቶች (weights) መጫናቸውን አረጋግጥ።

ደረጃ 3 በዝርዝር፦ ትሪያጅ (triage) ጥራትን ይወስናል

ከሩኑ በኋላ አንዳንድ ፍሬሞች እንደ ጣልቃ ገብነት ምልክት የተደረገባቸው ቀረጻ ይኖርሃል። ሶስት መድረሻዎች አሉ፣ ትክክል ያልሆነውን መምረጥም ቀጣዩን ዙር በጸጥታ ይመርዘዋል።

  • ጣልቃ ገብነቱ እውነተኛ ማስተካከያ ሲሆን እንደ እርማት መዝግብ፦ ፖሊሲው ወደ ስህተት አቅጣጫ እየሄደ ነበር፣ ግቤትህም ፖሊሲው ራሱ ካመነጨው ሁኔታ ትክክለኛውን ነገር አሳይቷል።
  • ንፁህ ራስ-ገዝ ሩኖችና ከጥንቃቄ የተነሳ ቁጥጥር ላደረግክባቸው ሩኖች እንደ ግምገማ አቆይ። የግምገማ ኤፒሶዶች ቀጣዩን ቼክፖይንት የምትለካበት መንገድ ናቸው፣ በምንም መልኩ በእነሱ ላይ መሰልጠን የለበትም።
  • ከጉዳዩ ጋር ግንኙነት በሌለው ነገር የተበላሹ ሩኖችን ጣል - የወደቀ የካሜራ ፍሬም፣ የቆመ ሰርቮ፣ አንተ ደፍቀህ የጣልከው ነገር። ግራ የተጋባ እርማት ከምንም እርማት አለመኖር የከፋ ነው።
የቀዘቀዙ ፍሬሞች የሚገባቸው ጥሬ ቀረጻ ውስጥ እንጂ የስልጠና ዳታ ውስጥ አይደለም

ፖሊሲው ቁጥጥሩን ከለቀቀበት እስከ አንተ የመጀመሪያ ግቤት ባለው ጊዜ ውስጥ፣ መቅጃው መጻፉን እየቀጠለ ክንዱ ግን ቆሞ ይቆያል - ተመሳሳይ አቀማመጦች ትንሽ ከተለያዩ ምስሎች ጋር የተጣመሩበት ተከታታይ ነው። እዚህ እነዚያ የርክክብ ፍሬሞች በጥሬ ቀረጻ ውስጥ ይቆያሉ፣ ከእርማት ዳታሴቱ ግን ውጭ ናቸው። ዙሩን ራስህ የምትገነባ ከሆነ፣ ሆን ብለህ ቁረጣቸው፦ በእነሱ ላይ የሰለጠነ ፖሊሲ መስራት በሚገባው ቦታ ላይ ማቆምን ይማራል።

ደረጃ 5 በዝርዝር፦ ቅልቅሉን መገንባት

ቅልቅል መገንባት (composition) ዋናውን ዳታሴት ከእርማት ዳታሴቱ ጋር ወስዶ አዲስ፣ ተራ LeRobot ዳታሴት ልክ እንደ ማንኛውም ሌላ ዳታሴት የሚያሰለጥን ያመርታል። ወሳኙ ባህሪ የኤፒሶድ ምርጫው በእያንዳንዱ ምንጭ ላይ በግልጽ የሚደረግ መሆኑ ነው - ምንም ነገር ራስ-ሰር አይቀላቀልም። ይህ ፖሊሲ እንግዳ ባህሪ እስኪያሳይና በምን ላይ እንደሰለጠነ መልሰህ እስክትገነባ ድረስ ትንሽ ነገር ይመስላል።

ክፍት ጥያቄው ጥምርታው (ratio) ነው፣ ከቦታ ወደ ቦታ የሚሸጋገር ቁጥርም ማንም የለውም። ስነ-ጽሁፉ የሚስማማበት ግን እርማቶች ከፍሬም ድርሻቸው በላይ መቆጠር እንዳለባቸው ነው። Mandlekar እና ሌሎች የጣልቃ ገብነት ስርአታቸው በሚሰበስበው ዳታ ላይ በተደጋጋሚ (iteratively) ስለሚያሰለጥኑ ፖሊሲው ማነቆዎቹን (bottlenecks) ማለፍ ይማራል፣ በዚያ መንገድ የሰለጠኑ ወኪሎችም ጣልቃ ካልገባ አሳያሽ ከተመሳሳይ ብዛት ናሙናዎች ከሰለጠኑ ወኪሎች የተሻለ አፈጻጸም እንዳላቸው ዘግበዋል። Sirius ደግሞ ከዚህ አልፎ የስልጠና ናሙናዎችን በተገመተ የሰው እምነት (approximated human trust) መልሶ ይመዝናል፣ ከሚያነጻጽራቸው ዘዴዎች አንጻር በሲሙሌሽን 8 በመቶ፣ በእውነተኛ ሃርድዌር ደግሞ 27 በመቶ የፖሊሲ ስኬት መጠን መጨመር፣ በእጥፍ ፍጥነት ኮንቨርጀንስ (convergence) ጋር ዘግቧል። እዚህ ካሉት የስልጠና መግቢያ ነጥቦች መካከል አንዳቸውም የናሙና-ክብደት መቆጣጠሪያ (sample-weighting knob) አያሳዩም፣ ስለዚህ ጥሬው አማራጭ ዋናዎቹን ማሳያዎች ንዑስ-ናሙና (subsampling) እያደረግህ እያንዳንዱን የእርማት ኤፒሶድ ማቆየት ነው - እና ያደረግከውን መዝግብ።

የካሜራ ዥረቶች ያሉት የ SO-100 ዳታሴት ኤፒሶዶችን የሚያሳይ የዳታሴት ቀረጻ እይታ
የእርማት ኤፒሶዶች የእያንዳንዱ ፍሬም ጣልቃ ገብነት ምልክት ያላቸው ተራ ኤፒሶዶች ናቸው፣ ስለዚህ ያለ ምንም ልወጣ (conversion) ከዋናው ዳታሴት ጋር ይገነባሉ።

ደረጃ 6 በዝርዝር፦ ከቼክፖይንት መቀጠል በእውነት ምን ማለት እንደሆነ

ቅልቅሉን ከመሰረታዊው ሞዴል ማሰልጠን ይሰራል፣ ነገር ግን ያለፈውን ዙር ጥሎ ሙሉ ሩን ያስከፍላል። ካለፈው ቼክፖይንት ጀምሮ መቀጠል ፈጣንና በአብዛኛው የተሻለ ነው። ቃሉ ከሚጠቁመው በላይም የተገደበ ነው።

ክብደት ማስጀመር (weight initialisation) የኦፕቲማይዘር ማስቀጠል (resume) አይደለም

ክብደት-ብቻ (weights-only) ቼክፖይንት ፓራሜትሮችን ብቻ ይይዛል፣ ሌላ ምንም። መጫኑ ለቀጣዩ ሩን ከመሰረታዊው ሞዴል የተሻለ መነሻ ቦታ ይሰጣል፣ ነገር ግን የኦፕቲማይዘር ሞመንቶች፣ የመማር-መጠን ጊዜ ሰሌዳ (learning-rate schedule) አቀማመጥ እና የዳታ ቅደም ተከተል ሁሉም ከዜሮ ይጀምራሉ። በቀጠለው ሩን መጀመሪያ ላይ የኪሳራ (loss) መጨመር ጠብቅ፣ እንደ ውድቀት አታንብበው፣ ዙሩንም resume ብለህ አትጥራው። ይህ warm start (ሙቅ ጅምር) ነው።

ፖሊሲመጠንየGPU ደረጃበእያንዳንዱ አክሽን እርምጃ ኢንፈረንስየዳታሴት ፎርማትከመሞከሩ በፊት የሚያስፈልጉ ኤፒሶዶች
GR00T N1.7ወደ 3 ቢሊዮን፣ በፋይን-ትዩኒንግ ጊዜ የሰለጠነው ወደ 40 ሚሊዮንA100 80 GB ወይም H100 80 GBወደ 152 msLeRobot v2.0 ወይም v2.150
GR00T N1.5ወደ 3 ቢሊዮንA100 80 GB ወይም H100 80 GBወደ 165 msLeRobot v2.0 ወይም v2.150
Pi0.5ወደ 3 ቢሊዮን በPaliGemma መሰረት (backbone) ላይA100 80 GB ወይም H100 80 GBወደ 485 msLeRobot v3.050
SmolVLAወደ 450 ሚሊዮንRTX 4090 ወይም ማንኛውም 24 GB ካርድወደ 245 msLeRobot v3.030
ACTወደ 80 ሚሊዮን፣ ከዜሮ የሰለጠነRTX 4090 ወይም ማንኛውም 24 GB ካርድወደ 20 msLeRobot v3.050

ሌተንሲ (latency) በማሳያ ጊዜ በማይታይ መንገድ በDAgger ዙር ውስጥ ይደራረባል፦ በእያንዳንዱ አክሽን እርምጃ ወደ 485 ms ላይ ቁጥጥር የምትወስደው ክንዱ ስላመነታ እንጂ ስህተት ስለሆነ አይደለም፣ የማመንታት እርማቶችም ጠቃሚ የስልጠና ዳታ አይደሉም። የመጨረሻውን የስኬት መጠን ከማሳደድ ይልቅ በዳታ ላይ በተደጋጋሚ (iterating) እየሰራህ ከሆነ፣ በፈጣን ሞዴል ላይ ድገመው። Shukor እና ሌሎች SmolVLA ን በአንድ GPU ላይ ለማሰልጠንና በተጠቃሚ GPU ወይም CPU ላይ ለማሰማራት (deploy) የተነደፈ አድርገው ይገልጹታል፣ ከፍ ያለ የቁጥጥር መጠን (control rate) እንዲፈቀድ የአክሽን ትንበያን ከአፈጻጸም የሚነጣጥል አሲንክሮነስ (asynchronous) የኢንፈረንስ ስታክ ጋር - ይህ ባህሪ ቁጥጥር-መውሰድ ዙርን ምላሽ ሰጪ (responsive) አድርጎ የሚያቆየው ነው።

የዳታሴት ፎርማቶችም እርስ በርስ የሚለዋወጡ አይደሉም። GR00T LeRobot v2.0 ወይም v2.1 ይወስዳል፣ የIsaac-GR00T ማከማቻ (repository) ደግሞ ግቤቱን የተጨመረ modality description ፋይል ያለው የLeRobot v2 ፎርማት አይነት (flavour) አድርጎ ይገልጻል፤ እዚህ ያሉት አዳዲስ አሰልጣኞች (trainers) v3.0 ይጠብቃሉ። በተሳሳተ ቨርዥን የተገነባ ቅልቅል መጥፎ ፖሊሲ ከማምረት ይልቅ በመጫኛ ጊዜ ይወድቃል - የተሻለ የውድቀት ሁነታ ነው፣ ቢሆንም ግን የተባከነ የተራ (queue) ቦታ ነው። የዳታሴት ሰነድ እያንዳንዱ አሰልጣኝ የትኛውን ፎርማት እንደሚወስድ ይዘረዝራል።

ዙሩ፣ የመዝገብ አያያዙ አስቀድሞ ተሰርቶ

በመሪ ክንድ፣ ኪቦርድ ወይም ስላይደር ቁጥጥር መውሰድ፤ የእያንዳንዱ ፍሬም ጣልቃ ገብነት ምልክት ማድረግ፤ ሩኖችን እንደ እርማት ወይም ግምገማ መዝግቦ ማስቀመጥ፤ የኤፒሶድ ምርጫ በእያንዳንዱ ምንጭ ላይ በግልጽ ተደርጎ የተቀላቀለ ዳታሴት መገንባት፤ እና ከመሰረታዊው ሞዴል ይልቅ ከቼክፖይንት ስልጠናን መቀጠል። አንተ ላይ የሚቀረው ውሳኔ የትኛው ሩን እንደ እርማት እንደሚቆጠር፣ ምን ወደ ቅልቅሉ እንደሚገባ፣ እና የጣልቃ ገብነት መጠኑ መቀነሱን መቼ እንዳቆመ ነው።

የDAgger ዙር እንዴት እንደተገጣጠመ ተመልከት

ዙርን ለማባከን አራት መንገዶች

1. በእርማቶች ብቻ ማሰልጠን

በጣም የተለመደው ውድቀትና በጣም አታላይ አቋራጭ (shortcut) ነው። እርማት-ብቻ ያለው ዳታሴት በሙሉ ማለት ይቻላል የስራው አስቸጋሪ መሃል ክፍል ነው፣ አቀራረብና ማፈግፈግ ጠፍተውበታል፤ ፖሊሲው በአስቸጋሪው ክፍል ላይ ይሻሻላል፣ ወደዚያ እንዴት እንደሚደርስ ግን ይረሳል። ማጠራቀም (aggregation) የዘዴው የትግበራ ዝርዝር ጉዳይ ሳይሆን ራሱ ዘዴው (mechanism) ነው፦ የቀሪውን ባህሪ በቦታው የሚያቆየው አሮጌው ዳታ ሲሆን፣ እርማቶቹ ደግሞ አንድ ክፍሉን ብቻ ያንቀሳቅሳሉ።

2. በዙሮች መካከል ካሜራ ማንቀሳቀስ

በዙሮች መካከል በሁለት ሴንቲሜትር የምትንቀሳቀስ ካሜራ ከጀመርክበት የከፋ ፖሊሲ ታመርታለች፣ አንድ ቀንም የሚያስከፍል ምርመራ (diagnosis)። እዚህ ያለ እያንዳንዱ VLA በምስሎች ላይ የተመሰረተ ነው፤ የመገጣጠሚያ ሁኔታ (joint state) ብቻውን ነገሩ የት እንዳለ በግልጽ አያሳይም። ከመጀመሪያው ዙር በፊት አደራደሩን (setup) ፎቶ አንሳ፣ ከዚያ በኋላ ባለው እያንዳንዱ ዙር በፊትም ያንን ፎቶ አረጋግጥ።

3. የርክክብ ቅሪቶች (artefacts) ወደ ስልጠና እንዲገቡ መፍቀድ

ከላይ ተነስቷል፣ በዝርዝሩ ውስጥ ያለውም የማይታይ ስለሆነ ነው። ምልክቱ ያለፈው ዙር ኦፕሬተር ቁጥጥር በወሰደበት ቦታ ላይ በትክክል ለአንድ ሰከንድ ክፍልፋይ የሚቆም ፖሊሲ ነው። እንደ ማመንታት ይመስላል፤ እውነታው ግን አስመስሎ መማር (imitation) ነው።

4. warm start ን resume ብሎ መጥራት

የኦፕቲማይዘር ሁኔታ (state) ተሸጋግሮ እንደነበር ካመንክ፣ የመጀመሪያው የኪሳራ መጨመር (loss spike) እንደ ባግ ይነበብና የተበላሸ ዳታ ፍለጋ ትገባለህ። ኦፕቲማይዘሩ ከዜሮ እንደጀመረ ካወቅህ ግን፣ መጨመሩ የሚጠበቅ ነው፣ ከዚያ በኋላ ወደሚመጣው ትመለከታለህ። ተመሳሳይ ቁጥሮች፣ ተቃራኒ መደምደሚያዎች።

ዙሩን መለካት

የሰው-ቁጥጥር ስር ላለ ዙር (human-gated loop) መለኪያው የጣልቃ ገብነት መጠን ነው፦ አንተ ቁጥጥር ላይ በነበርክበት ጊዜ የተቀዱ ፍሬሞች፣ በሩኑ ጠቅላላ ፍሬሞች ተካፍለው። ይህ በ takeover ሁኔታ (status) ውስጥ ይገኛል፣ ዙሩ የጠየቀውን ጥያቄ የሚመልስ ብቸኛው ቁጥርም ነው። ፖሊሲው ተሻሽሎም ባይሻሻልም የስልጠና ኪሳራ ይቀንሳል፤ የስኬት መጠን ደግሞ ባይነሪ ነው፣ የጠረጴዛ ክንድ በሚያመርተው የናሙና መጠን ላይም ጫጫታ (noisy) ያለው ነው። የጣልቃ ገብነት መጠን ተከታታይ (continuous) ነው፣ የሚለካውም ፖሊሲው ራሱ በሚያመጣቸው ሁኔታዎች ላይ ነው፣ ፖሊሲው ባንተ ላይ ያለው ጥገኝነት ሲቀንስም ይቀንሳል።

በተመሳሳይ ሁኔታዎች ስር በተቀዱ ሩኖች መካከል ብቻ አነጻጽረው። ሙሉው መከራከሪያ፣ ከሁለት ዙር በላይ የሚዘልቅ የግምገማ ስብስብ (evaluation set) እንዴት እንደሚገነባም፣ በየDAgger ዙርን ስለመለካት በሚያትተው ጽሁፍ ውስጥ። ዙር አንድ በእውነታ የአዋጭነት ሙከራ (feasibility test) ነው፦ ቁጥጥር መውሰዱ በሃርድዌርህ ላይ እንደሚሰራ፣ እርማቶች ከምልክቶቻቸው ጋር እንደሚያርፉ፣ እና የቀጠለው ሩን የሰየምከውን ቼክፖይንት እንደጫነ እያረጋገጥክ ነው። መጠኑ መንቀሳቀስ የሚጀምረው በዙር ሁለትና ሶስት ነው። እስከ ዙር አራት ካልተንቀሳቀሰ፣ ችግሩ ከDAgger በላይ ያለ (upstream) ነው።

በእያንዳንዱ ዙር መዝግብበኋላ ለምን እንደሚያገለግል
የተነዳበት ቼክፖይንትያለ እሱ መሻሻልን ለተወሰነ ቅልቅል ልታስከትል (attribute) አትችልም
ለቁጥጥር መውሰድ የተጠቀምከው የግቤት ሁነታየኪቦርድ እርማቶች ከመሪ እርማቶች ይልቅ ያልጠሩ ናቸው፣ ይህም በዳታው ላይ ይታያል
የሩኖች ብዛትና እያንዳንዱ እንዴት እንደተመረመረ (triaged)ዙሩ ትርጉም ያለው ያህል በቂ እርማቶች ነበሩት ወይ
በእያንዳንዱ ሩን የጣልቃ ገብነት መጠንና አማካኙየዙሩ የግስጋሴ መለኪያ
በእያንዳንዱ ምንጭ ላይ ትክክለኛ የኤፒሶድ ምርጫዙርን ደግሞ ለመስራት ወይም ለመሻር ብቸኛው መንገድ
Warm start ወይስ ከዜሮ ስልጠናከሳምንት በኋላ የምትመለከተውን የኪሳራ ከርቭ (loss curve) ያብራራል

እስካሁን ቼክፖይንት ከሌለህ

ያለ እሱ ዙሩ መግቢያ ነጥብ የለውም። የመጀመሪያውን ዳታሴት ቅዳ፣ የመጀመሪያውን ፖሊሲ አሰልጥን፣ አስኪደው - ቀረጻስልጠና እና ፖሊሲውን ማስኬድ ያንን መንገድ ይሸፍናሉ። የቀረጻ ክላይንቱ በየማውረጃ ገጹ ላይ ይገኛል፣ የGPU ደረጃዎችና የሰዓት ዋጋዎች ደግሞ በየዋጋ ገጹ ላይ፣ ጥቅም ላይ ሊውል የሚችል ኤፒሶድ ምን እንደሚመስል ደግሞ በSO-100 የዳታ አሰባሰብ መመሪያ ውስጥ ይገኛል። ወደ እርማቶቹ ከመሄድህ በፊት ማሳያዎቹን በትክክል አድርግ፦ DAgger የጥገና ዘዴ (repair mechanism) ነው፣ ገና ከወዲሁ ትክክል በሆነ ነገር ላይ ደግሞ በጣም በተሻለ ይሰራል።

ያለ መሪ ክንድ የDAgger ዙር ማካሄድ እችላለሁ?

አዎ። «Take over»ን ስትጫን የኪቦርድ ወይም የስላይደር ግቤት ምረጥ፦ ቁጥጥር መውሰዱ ወዲያውኑና በእጅ ነው፣ የሚስተካከል ሁለተኛ ክንድም አያስፈልግም። ኪቦርድ ሰርቨሩ በእያንዳንዱ መገጣጠሚያ በ2 ዲግሪ፣ ለግሪፐሩ በ4 ዲግሪ ጥብቅ ገደብ የሚያደርግባቸውን አንጻራዊ ግፊቶች (relative nudges) ይልካል፤ ስላይደሮች ፍጹም ኢላማ ይልካሉ፣ ሰርቨሩም በእያንዳንዱ ጥሪ ወደዚያ በአብዛኛው 6 ዲግሪ ይንቀሳቀሳል፣ በይነገጹ ደግሞ መላኩን ይቀጥላል። የአክሽን አምዱና የጣልቃ ገብነት ምልክቱ ልክ እንደ መሪ ሁነታ ተመሳሳይ ናቸው፣ ስለዚህ እርማቶቹ በዳታሴቱ ውስጥ ተለይተው አይታወቁም።

አንድ ዙር ስንት እርማቶች ያስፈልጉታል?

የሚከላከል ሁለንተናዊ ቁጥር የለም፣ የፍሬም ብዛትም ከኤፒሶድ ብዛት በላይ ጠቀሜታ አለው። የስራ ደንቡ እርማቶቹ በቅልቅሉ ውስጥ መጥፋት የለባቸውም የሚል ነው፦ 200 ዋና ኤፒሶዶችና ሶስት የእርማት ኤፒሶዶች ካሉ፣ ምንም ነገር አይንቀሳቀስም። ተመሳሳይ ማዳን (rescue) ሶስት ጊዜ ከመድገም ይልቅ ውድቀት ያለበትን ባህሪ ከብዙ የመነሻ ውቅሮች (configurations) የሚሸፍኑ እርማቶችን አልም።

በእርማቶች ብቻ ማሰልጠን ለምን መጥፎ ሃሳብ ነው?

እርማቶች በሙሉ ማለት ይቻላል የስራው አስቸጋሪ መሃል ክፍል ስለሆኑ ነው። አቀራረብ፣ ማስተካከያ እና ማፈግፈግ ጠፍተውበታል፣ ስለዚህ ፖሊሲው ባስተካከልከው ክፍል ላይ ሲሻሻል ቀድሞ በደንብ ያደርገው የነበረውን ያጣል። አሮጌውን ዳታ አቆይቶ ወደ እሱ መጨመር ራሱ ዘዴው (mechanism) ነው እንጂ አማራጭ ተጨማሪ አይደለም።

ከቼክፖይንት መቀጠል ያለፈውን የስልጠና ሩን resume ያደርገዋል?

አይደለም። ክብደት-ብቻ ቼክፖይንት ፓራሜትሮችን ብቻ ይመልሳል፣ ሌላ ምንም፦ የኦፕቲማይዘር ሞመንቶች፣ የመማር-መጠን ጊዜ ሰሌዳ አቀማመጥ እና የዳታ ቅደም ተከተል ከዜሮ ይጀምራሉ። ይህ warm start ነው፣ የመጀመሪያውም የኪሳራ መጨመር እንደ ምልክት (symptom) ሳይሆን የሚጠበቅ ነገር ነው። ከሁለቱ የትኛውን በትክክል እንዳደረግህ መዝግብ፣ ከሳምንት በኋላም ከርቩን በትክክል እንድታነብ።

የጣልቃ ገብነት መጠኑ ካልቀነሰ ምን ይሆናል?

ዙሮችን መጨመር አቁም። ጠፍጣፋ መጠን ማለት እርማቶቹ እንዳሰብከው እያስተማሩ አይደሉም ማለት ነው። የተለመዱት ምክንያቶች ከDAgger በላይ ያሉ (upstream) ናቸው፦ ካሜራ ተንቀሳቅሷል፣ እርማቶቹ የመራቅ ዳታ (avoidance data) ለመሆን በጣም ዘግይተው ይጀምራሉ፣ የርክክብ ፍሬሞች በስልጠና ስብስቡ ውስጥ አሉ፣ ወይም ፖሊሲው ከሚያገኛቸው ምልከታዎች አንጻር ስራው በበቂ ሁኔታ አልተወሰነም (underdetermined)።

ከዚህ ውስጥ አንዳቸውም የተፈታ ችግር አይደሉም፣ አንዳቸውም በአንድ ጠቅታ የሚደረጉ አይደሉም። ኢንተራክቲቭ አስመስሎ መማር (interactive imitation learning) ንቁ የምርምር ዘርፍ የሆነው በትክክል ጥያቄዎቹ - መቼ ጣልቃ መግባት እንዳለበት፣ ሰውየው ያደረገውን እንዴት መመዘን እንዳለበት፣ ምን ያህል አሮጌ ዳታ ማቆየት እንዳለበት - ግልጽ መልስ ስለሌላቸው ነው፤ በCelemin እና ሌሎች የተደረገው ጥናት (survey) አሁንም ክፍት የሆነውን ያሳያል። ዙሩ ያለው ነገር ግን በጥንቃቄ ሲካሄድ፣ ጥቂት መቶ ዩሮ በሚያስከፍል ሃርድዌር ላይ፣ ሊለካ የሚችል ኮንቨርጀንስ (convergence) ነው። አደራደሩን አስተካክለህ ቀዝቅዝ፣ ቀድመህ ጣልቃ ግባ፣ በታማኝነት መርምረህ ደርድር፣ ሆን ብለህ ቀላቅል፣ እና በየጊዜው የጣልቃ ገብነት መጠኑን መዝግብ።

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started