
DAgger ya kawaida humwomba binadamu aweke lebo kwenye hali huku roboti ikiwa bado inaendesha. Kwenye vifaa halisi hilo si salama na huzalisha lebo duni. Aina za gated zinabadilisha uwekaji lebo kipofu na lango (gate) ambalo mtu au kitu fulani lazima akishikilie: binadamu katika HG-DAgger, kiainishi cha usalama katika SafeDAgger, kutokubaliana kwa ensemble katika EnsembleDAgger, makadirio ya ubunifu-na-hatari yenye bajeti katika ThriftyDAgger. Makala hii inazilinganisha kwa kuangalia nani anamiliki lango hilo, ni ishara gani inayolifungua, na gharama ya kila moja — na kwa nini aina ya human-gated ndiyo inayodumu inapokutana na mkono halisi wa roboti.
Sera iliyoigwa (cloned) hushindwa mahali ambapo data yake ya mafunzo iliishia. Suluhisho ni kuendelea kukusanya data chini ya usambazaji wa hali wa sera yenyewe badala ya ule wa mwonyeshaji, ambalo ndilo DAgger inalofanya na ambalo utangulizi wa uwekaji-pamoja wa dataset inavyoieleza kutoka kanuni za msingi. Inaacha wazi sehemu ngumu ya algoriti asilia: wakati mjifunzaji (learner) akiendesha, mtaalamu anatarajiwa kusema angefanya nini, kwa kila hali, bila kuwa katika udhibiti.
Katika kiigaji (simulator) chenye mtaalamu wa script, hilo ni la bure. Kwenye meza yenye mkono halisi wa roboti, si la bure wala si salama. Waandishi wa HG-DAgger wanaeleza pingamizi hilo kwa usahihi: mifumo kama hiyo ya sampuli “inahitaji mtaalamu kutoa lebo za vitendo bila kuwa na udhibiti kamili wa mfumo”, jambo ambalo “linaweza kupunguza usalama na, wakati binadamu wanapotumika kama wataalamu, kuna uwezekano wa kudhoofisha ubora wa lebo zilizokusanywa kutokana na uchelewaji unaohisiwa wa actuator” (Kelly et al., 2019). Kushindwa mbili kunajificha katika sentensi hiyo: sera inaendelea kuingia katika hali ambazo hakuna anayetaka iwe ndani yake, na lebo zilizonunuliwa kwa hatari hiyo ni duni kuliko zile anazozalisha binadamu akiwa ameshika vidhibiti. Kila aina iliyoorodheshwa hapa chini inajibu swali lile lile — weka lango (gate) kwenye udhibiti na mwache mtu fulani aamue wakati wa kulifungua. Zinatofautiana kwa nani huyo mtu ni.
Muhtasari mfupi
- •Aina za gated zinabadilisha uwekaji lebo kipofu na swichi kati ya udhibiti wa sera na udhibiti wa mtaalamu. Kinachozitofautisha ni nani anamiliki swichi hiyo.
- •HG-DAgger inampa binadamu swichi hiyo na huweka pamoja (aggregate) data iliyorekodiwa tu wakati binadamu alikuwa na udhibiti usiokatizwa.
- •SafeDAgger inaipa kiainishi cha jozi (binary classifier) kinachotabiri mkengeuko kutoka kwa sera ya rejea; EnsembleDAgger inahitaji tofauti ndogo ya ensemble (ensemble variance) na umbali mdogo kutoka kwa kitendo cha mtaalamu kwa wakati mmoja.
- •LazyDAgger inaongeza hysteresis ili udhibiti usirushwe huku na huko (ping-pong); ThriftyDAgger inaweka lango kulingana na ubunifu (novelty) au hatari iliyokadiriwa chini ya bajeti dhahiri ya uingiliaji.
- •Ishara za robot-gated zinahitaji kitu ambacho VLA iliyofanyiwa fine-tuning kwenye mkono wa daraja la hobby kwa kawaida hukikosa: sera ya rejea, ensemble nafuu, au kutokuwa na uhakika wa kielimu (epistemic uncertainty) kilichosawazishwa (calibrated).
- •Lango ni nusu ya mbinu. Kinachotokea kwa vipande vya uingiliaji baadaye — kuchanganya, kupima uzito, kuweka pamoja — ndicho huamua kama duru hiyo imeboresha chochote.
Human-gated na Robot-gated: Mgawanyo Unaohusika
Kujifunza kwa kuiga kwa mwingiliano kina uchunguzi (survey) wake wenyewe; Celemin na wenzake wanakiorodhesha kulingana na aina ya maoni (feedback), kiolesura, muundo wa kujifunza, uzoefu wa mtumiaji, matumizi na kigezo cha kulinganisha (benchmark). Tofauti inayoamua uhandisi wako ni rahisi kuliko mhimili wowote kati ya hiyo, na kazi za hivi karibuni zinaiita moja kwa moja: mbinu ni inayodhibitiwa na binadamu wakati msimamizi ndiye anayeamua lini kuingilia kati, na inayodhibitiwa na roboti wakati wakala (agent) ndiye anayeamua lini kuomba msaada (Cai et al., 2025). Kila kitu kingine ni mitambo inayohudumia mojawapo ya chaguo hizo mbili. Mzunguko wa faida na hasara unaonekana tangu mwanzo: lango la human-gated linagharimu umakini endelevu, na lango la robot-gated linaahidi kurudisha umakini huo — lakini tu ikiwa ishara inayolitegemea inaaminika, na kuunda ishara hiyo ni tatizo lake la utafiti peke yake.
SafeDAgger: Kiainishi Kinachotabiri Mkengeuko Wake Wenyewe
SafeDAgger ya Zhang na Cho (2016) ndiyo lango la kwanza kabisa kati ya haya. Kuuliza (query) sera ya rejea ndiyo sehemu ya gharama kubwa, kwa hivyo mtandao wa pili, mdogo — sera ya usalama — hutabiri kama kuuliza kunafaa kabisa. Inarejesha “lebo ya jozi (binary) inayoonyesha kama sera kuu ina uwezekano wa kukengeuka kutoka kwa sera ya rejea bila kuiuliza”. Lebo hiyo inafafanuliwa dhidi ya mkengeuko wa L2 uliopandishwa mraba (squared) kati ya vitendo vya sera mbili hizo ukiwa na kizingiti tau, na kiainishi hicho kinafanyiwa ulinganifu (fit) kwa kutumia binary cross-entropy. Wakati wa uendeshaji, kinaamua kwa kila hali kama mjifunzaji anaendelea kuendesha au sera ya rejea inachukua udhibiti. Muhtasari (abstract) unaripoti maulizo machache zaidi ya sera ya rejea katika kiigaji cha mbio za magari pamoja na kuongezeka kwa kasi ya muunganiko (convergence) ambako waandishi wanahusisha na athari ya mtaala wa kiotomatiki (automated curriculum), bila kutoa takwimu kwa lolote kati ya hayo mawili.
Mtego uko kwenye ufafanuzi, si kwenye matokeo. Kufundisha kiainishi hicho kunahitaji kitendo cha sera ya rejea kwa kila hali inayotumika kukifundisha, jambo linalodhania kuwa rejea hiyo ni programu nyingine. Kama rejea yako ni mtu mwenye mkono wa kiongozi (leader arm), seti hiyo ya lebo si ya bei nafuu na mbinu hiyo inapoteza sifa iliyobuniwa kwa ajili yake.
EnsembleDAgger: Shaka na Tofauti, Vyote Viwili
Menda, Driggs-Campbell na Kochenderfer (2019) wanachukulia lango hilo kama swali la kihasibu-uwezekano (probabilistic). EnsembleDAgger “inakadiria Mchakato wa Gaussian (Gaussian Process) kwa kutumia ensemble ya mitandao ya neva (neural networks)” na kusoma tofauti ya ensemble (ensemble variance) kama kipimo mbadala cha uhakika (confidence proxy): tofauti kubwa inamaanisha eneo lisilofanana na data ya mafunzo, jambo ambalo — kwa kudhania kuwa mtaalamu anaepuka hali za kushindwa — linahusiana na ukaribu wa kushindwa. Kanuni hiyo ni muunganiko (conjunction). Mjifunzaji anaweza kutenda tu wakati umbali wa L2 kati ya kitendo chake cha wastani na kitendo cha mtaalamu unabaki chini ya kizingiti kimoja (tofauti/discrepancy) na tofauti ya kitendo alichokitabiri inabaki chini ya kizingiti cha pili (shaka/doubt). Ikiwa mojawapo halitimizwi, mtaalamu anachukua udhibiti. Lengo ni kuongeza kwa kiwango cha juu zaidi mgao wa vitendo vya mjifunzaji huku ukizuia uwezekano wa kushindwa; karatasi hiyo inaripoti uboreshaji wa usalama na kujifunza ikilinganishwa na aina nyingine za DAgger kwenye pendulum iliyopinduliwa (inverted pendulum) na MuJoCo HalfCheetah.
Hili kimya kimya linaifanya kanuni nzima kutostahili kwa usimamizi usiohitaji mikono (hands-off). Umbali kati ya kitendo cha mjifunzaji na cha mtaalamu unahitaji kitendo cha mtaalamu katika hali hiyo, wakati huo huo. Kwa mtaalamu wa script, hakuna tatizo. Kwa binadamu, binadamu huyo lazima azalishe vitendo kwa kuendelea — hasa mzigo ambao aina za gated zilikusudiwa kuuondoa. Kipengele cha shaka pekee ni hands-off; muunganiko wenyewe sivyo.
LazyDAgger: Kuzuia Swichi Isitetemeke (Chatter)
Hoque na wenzake (2021) walishughulikia gharama ambayo karatasi za awali hazikuipima: swichi yenyewe. Kila uingiliaji “unakatiza kazi nyingine anayoifanya binadamu, unasababisha uchelewaji (latency) kwa kila mabadiliko ya muktadha kati ya msimamizi na udhibiti wa kiotomatiki, na unahitaji muda kutekelezwa”. Lango linalofunguka na kufungwa mara kumi kwa dakika ni baya zaidi kuliko lile linalofunguka mara moja kwa sekunde kumi, likiwa na mgao sawa wa uendeshaji wa kiotomatiki. LazyDAgger inaipanua SafeDAgger kwa kutumia vizingiti visivyolingana (asymmetric thresholds) — ni vigumu zaidi kuingia katika udhibiti wa msimamizi kuliko kubaki ndani yake — ili mfumo usiyumbeyumbe kwenye mpaka huo. Katika uigaji (simulation) “inaweza kupunguza mabadiliko ya muktadha kwa wastani wa 60% ikilinganishwa na SafeDAgger katika kazi 3 za udhibiti endelevu huku ikidumisha utendaji wa sera wa hali ya juu zaidi (state-of-the-art)”; katika udanganyifu wa kitambaa (fabric manipulation) kwa kutumia ABB YuMi “inapunguza mabadiliko ya muktadha kwa 60% huku ikifikia kiwango cha mafanikio kilicho juu zaidi kwa 60% kuliko SafeDAgger wakati wa utekelezaji”.
ThriftyDAgger: Ubunifu au Hatari, Chini ya Bajeti
ThriftyDAgger (Hoque et al., CoRL 2021) inaanzia kwenye bajeti ya msimamizi badala ya sera yenyewe. Inatumia “sera ya kubadili iliyojifunzwa (learned switching policy) kuomba uingiliaji tu katika hali ambazo (1) ni mpya (novel) vya kutosha, ambapo sera ya roboti haina tabia ya rejea ya kuiga, au (2) ni za hatari, ambapo roboti ina uhakika mdogo wa kukamilisha kazi”, ikiwa na kigezo kipya cha kukadiria hatari hiyo. Bajeti ni kigezo cha ingizo (input), si matokeo: unaeleza ni muda kiasi gani wa binadamu utakaotumia. Ikitumiwa wakati wa utekelezaji, mbinu hiyo “inafikia kiwango cha mafanikio cha 100% katika kazi zote za uigaji na za kimwili”, na uchunguzi wa watumiaji wenye washiriki kumi wakidhibiti kundi la roboti tatu (fleet) sambamba na kazi ya umakinifu unaripoti kuwa inaongeza “utendaji wa binadamu na roboti kwa 58% na 80% mtawalia ikilinganishwa na algoriti bora inayofuata huku ikipunguza mzigo wa msimamizi”. Mazingira ya kundi la roboti (fleet) ndiyo makazi ya asili ya kazi hii; Fleet-DAgger baadaye ilirasimisha kujifunza kwa kundi la roboti kwa mwingiliano ukihusisha roboti na wasimamizi wengi, ikipendekeza Return on Human Effort kama kipimo cha kuboreshwa.
HG-DAgger: Binadamu Ndiye Anayeshikilia Lango
Kelly et al. (2019) wanaenda njia tofauti. Hakuna sera ya kubadili. Mjifunzaji anaachwa aendeshe “mpaka mtaalamu aone kuwa mwanzilishi (novice) ameingia katika eneo lisilo salama la nafasi ya hali”, na hapo ndipo mtaalamu anachukua udhibiti na kuongoza mfumo kurudi. Kanuni ya kuweka-pamoja (aggregation) ndiyo sehemu kali: “Lebo za vitendo vya mtaalamu zinakusanywa na kuongezwa kwenye dataset tu wakati wa njia hizo za kurejesha (recovery trajectories), ambapo mtaalamu binadamu ana udhibiti usiokatizwa wa mfumo.” Hakuna kinachowekwa lebo wakati binadamu ni mtazamaji tu.
Haisimami kwenye swichi tu. HG-DAgger pia “inajifunza kizingiti cha usalama kwa kigezo cha hatari kinachotegemea kutokuwa na uhakika wa modeli (model uncertainty) kinachoweza kutumika kutabiri utendaji wa mwanzilishi aliyefunzwa kikamilifu katika maeneo tofauti ya nafasi ya hali”: inarekodi jinsi mjifunzaji alivyokuwa hana uhakika wakati wa nyakati ambazo binadamu aliingilia kati na kuchukua wastani wa robo ya mwisho ya rekodi hizo, mahali ambapo mjifunzaji anafanana zaidi na umbo lake la mwisho. Hilo si lango linaloendeshwa na roboti bali ni uchunguzi (diagnostic) unaokuambia mahali ambapo sera iliyokamilika inatarajiwa kushikilia. Tathmini hiyo inahusisha kazi ya uendeshaji iliyoigwa na ya ulimwengu halisi na inaripoti utendaji ulioboreshwa ukilinganishwa na DAgger na behavior cloning.
Mstari mmoja unaohusiana unabadilisha kile kinachohesabiwa kama lebo. Expert Intervention Learning ya Spencer na wenzake inasisitiza kuwa “kiwango chochote cha maoni ya mtaalamu, iwe kwa uingiliaji au kwa kutoingilia, kinatoa taarifa kuhusu ubora wa hali ya sasa, ubora bora (optimality) wa kitendo, au vyote viwili”, ikirasimishwa kama kizuizi kwenye kazi ya thamani (value function) ya mjifunzaji na kutatuliwa kwa kujifunza mtandaoni bila majuto (no-regret online learning). Kwa mtazamo huo, vipindi ambapo binadamu alitazama na hakufanya lolote ni ushahidi hafifu wa chanya badala ya kutokuwa na maana. EIL inajifunza kuepuka migongano (collision avoidance) kutoka dakika moja hivi ya udhibiti wa mtaalamu.

Aina Hizo Bega kwa Bega
| Mbinu | Nani Anafungua Lango | Ishara | Mahitaji Yanayohitajika | Iliyoripotiwa |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Hakuna mtu — mjifunzaji huendesha daima | Hakuna; mtaalamu huweka lebo kwa kila hali iliyotembelewa | Mtaalamu anayeweza kuweka lebo kwa hali za off-policy bila kuwa katika udhibiti | Upunguzaji wa no-regret wenye dhamana chini ya usambazaji wa hali wa mjifunzaji |
| HG-DAgger (Kelly et al., 2019) | Msimamizi Binadamu | Uamuzi wa msimamizi kuwa hali hiyo si salama | Mtu anayetazama, na makabidhiano safi ya udhibiti | Inashinda DAgger na behavior cloning katika kazi ya uendeshaji iliyoigwa na halisi; pia inajifunza kizingiti cha hatari |
| SafeDAgger (Zhang & Cho, 2016) | Roboti | Kiainishi cha jozi (binary) kwa mkengeuko wa L2 kutoka kwa rejea zaidi ya tau | Sera ya rejea inayoweza kuulizwa kwa ajili ya lebo za kiainishi | Maulizo machache zaidi ya rejea katika kiigaji cha mbio, muunganiko wa haraka zaidi (hakuna takwimu iliyotolewa) |
| EnsembleDAgger (Menda et al., 2019) | Roboti | Tofauti ya ensemble na umbali kutoka kwa kitendo cha mtaalamu, vyote chini ya kizingiti | Ensemble ya mitandao pamoja na kitendo cha mtaalamu katika kila hatua | Usalama na ujifunzaji ulioboreshwa kwenye pendulum na HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Roboti, yenye hysteresis | Ishara ya SafeDAgger yenye vizingiti tofauti vya kuingia na kutoka | Kile SafeDAgger inachohitaji, pamoja na kizingiti cha pili cha kusawazisha (tune) | ~60% mabadiliko machache zaidi ya muktadha katika kazi 3; mafanikio ya juu zaidi kwa 60% kwenye kitambaa cha YuMi |
| ThriftyDAgger (Hoque et al., 2021) | Roboti, chini ya bajeti | Ubunifu (novelty), au hatari iliyokadiriwa ya kutokamilisha kazi | Kikadiriaji cha hatari kilichojifunzwa na bajeti ya uingiliaji iliyoelezwa | Mafanikio ya 100% wakati wa utekelezaji; uchunguzi wa watumiaji (N=10): faida za 58% na 80% ukilinganisha na bora-inayofuata |
| EIL (Spencer et al., 2020) | Binadamu — kutoingilia kati pia kunahesabiwa | Uingiliaji na kutokuwepo kwake kama vizuizi kwenye kazi ya thamani | Kujifunza mtandaoni bila majuto (no-regret) juu ya kizuizi cha thamani | Kuepuka migongano kutoka dakika moja hivi ya udhibiti wa mtaalamu |
Kile Kila Lango Kinachonunua, na Kile Kinachotoza
Soma chini ya safu wima ya “mahitaji” na muundo unajitokeza: kila ishara ya robot-gated hapo ni kigezo mbadala (proxy) kinachopaswa kutengenezwa, na kila proxy ina bili yake.
- Ishara za tofauti (discrepancy) (SafeDAgger, LazyDAgger, nusu ya kanuni ya EnsembleDAgger) zinahitaji sera ya rejea. Ama una mtaalamu wa script, ambapo tatizo la kuvutia tayari limetatuliwa, au binadamu anaendelea kuzalisha vitendo nyuma ya pazia ili umbali uweze kuhesabiwa.
- Ishara za shaka (doubt) zinahitaji kutokuwa na uhakika wa kielimu (epistemic uncertainty) kilichosawazishwa (calibrated). Ensemble ya mitandao midogo ya udhibiti inakikadiria; ensemble ya modeli ya vision-language-action yenye vigezo bilioni tatu ni tatizo la kumbukumbu (memory) na uchelewaji (latency) kwanza kabisa.
- Ishara za ubunifu (novelty) na hatari zinahitaji kikadiriaji kilichojifunzwa cha ukamilishaji wa kazi, kilichofundishwa kwa idadi ya kutosha ya rollout zilizofanikiwa na zilizoshindwa. Kwenye kazi ambayo bado unaijaribu ifanye kazi, data hiyo haipo katika duru ya kwanza.
- Lango la binadamu linahitaji umakini na hakuna kingine — ndiyo ishara pekee inayopatikana siku ya kwanza, kwenye muundo wowote wa sera (policy architecture), bila modeli ya ziada ya kufundisha.
- Hakuna lango la robot-gated linalomwondoa binadamu chumbani. Yanapunguza mara ngapi binadamu lazima atende, si kama lazima awepo.
Kuna tofauti ya kimya zaidi katika kile lango linachozalisha. Lango la robot-gated linapowaka katikati ya njia (trajectory) linampa mtu mkono wa roboti unaosogea katika mkao (pose) wa bahati nasibu. Lango la binadamu linamruhusu opereta kuchagua wakati — baada ya kufikia (reach), kabla ya kushika (grasp), si katikati ya mwendo wa kutupa (swing). Vipande vya kurejesha (recovery segments) kutoka kwa hizo mbili si safi kwa usawa, na vipande hivyo ndivyo bidhaa nzima ya duru hiyo.
Kwa Nini Aina ya Human-Gated Inashinda kwenye Vifaa Halisi
Hii ni hoja ya kihandisi, si matokeo ya kigezo cha kulinganisha (benchmark) — hakuna karatasi tuliyoipata inayoendesha malango yote matano kwenye mdanganyifu (manipulator) uleule ukiwa na aina ileile ya sera. Inategemea vipengele vinne.
Kwanza, msimamizi yupo hata hivyo. Hakuna anayeacha mkono wa SO-100 ukiendeshwa bila usimamizi karibu na vitu unavyoweza kuvipindua. Mara tu mtu akiwa anatazama, gharama ya ziada (marginal cost) ya kumpa kitufe cha kuchukua udhibiti iko karibu na sifuri; kujenga kikadiriaji cha hatari kilichosawazishwa ni mradi wa peke yake.
Pili, kutokuwa na uhakika ambako unaweza kupima kwa uhalisia kwenye sera ya kisasa mara nyingi ni kipimo kisicho sahihi. Kichwa (head) cha diffusion au flow-matching hutoa tofauti (variance) katika vipande vya vitendo (action chunks) vilivyochukuliwa sampuli, na tofauti hiyo inaakisi multimodality ambayo kichwa hicho kilifundishwa kuiwakilisha, si ujinga wa kielimu (epistemic ignorance) kuhusu hali hiyo. Kipengele cha shaka cha EnsembleDAgger kinatumia ensemble hasa kunasa hilo la pili. Hizo mbili zinaonekana kama namba ileile lakini sivyo; maandiko ya action chunking na flow matching yanaeleza jinsi vichwa hivyo vinavyotoa vitendo hapo kwanza.
Tatu, kushindwa kunakohusika katika udanganyifu (manipulation) mara nyingi ni kwa kimaana (semantic) badala ya kuwa nje ya kawaida kitakwimu. Sera inayofunga gripper sentimita mbili mapema, au inayofikia kwa kujiamini kwenye mchemraba mbaya kati ya vitu viwili vinavyofanana, haipo katika hali ya tofauti kubwa (high-variance) — imejiamini na imekosea. Hakuna kizingiti cha tofauti kinachonasa hilo; mtu anayetazama anakinasa mara moja.
Nne, ubora wa lebo — hoja ya asili ya HG-DAgger, na ile inayorukwa mara nyingi zaidi. Lebo zilizokusanywa wakati binadamu ana udhibiti usiokatizwa zinashinda lebo zinazoelezwa (narrated) juu ya mfumo unaosonga. Ikiwa lengo ni data ya kurekebisha inayostahili kuwekwa pamoja, jukumu la kuthibitisha liko kwa lango la kiotomatiki.
Picha inabadilika pale msimamizi mmoja anapowajibika kwa roboti nyingi — mfumo unaolengwa na uchunguzi wa watumiaji wa ThriftyDAgger na urasimishaji wa Fleet-DAgger. Katika kundi la roboti (fleet), umakini wa binadamu ndiyo rasilimali adimu na mgao usio kamili unashinda kutokuwa na mgao kabisa. Ukiwa na mkono mmoja kwenye meza moja, hauko katika mfumo huo.
Mzunguko wa Human-Gated, Uliokwishaunganishwa
Kuchukua udhibiti wakati wa kikao cha inference kinachoendelea, alama za uingiliaji kwa kila fremu (per-frame intervention flags) kwenye vipande vilivyorekebishwa, kupanga kila uendeshaji kuwa marekebisho au tathmini, kutunga dataset iliyochanganywa kutoka kwa vyanzo unavyochagua, na kuendelea na mafunzo kutoka kwa checkpoint iliyopo — vyote hivi vimejengwa ndani badala ya kuandikwa kwa mkono. Kuchukua udhibiti kunafanya kazi na mkono wa kiongozi (leader arm), au kwa kibodi na slaidi (sliders) kama huna mmoja.
Ona Jinsi Mzunguko wa DAgger UnavyoendeshaLango Ni Nusu ya Mbinu; Ushughulikiaji wa Data Ni Nusu Nyingine
Lango linaamua ni fremu zipi alizoziendesha binadamu, si nini cha kuzifanyia, na uamuzi huo wa pili ndio mahali ambapo duru mara nyingi zaidi hupotea bure. Kanuni ya kwanza ni ile ambayo herufi D katika DAgger inaisimamia: weka pamoja (aggregate), usibadilishe (replace). Kufanya fine-tuning kwenye checkpoint kwa kutumia mamia machache tu ya fremu za marekebisho kunakupa modeli ambayo haijaona chochote isipokuwa marejesho (recoveries) na imesahau njia ya kawaida (nominal trajectory).
Kanuni ya pili ni kwamba fremu za uingiliaji si fremu za kawaida. Mandlekar et al. walijenga mfumo wa teleoperesheni ya mbali kwa udanganyifu wa 6-DoF unaowaruhusu waendeshaji kufuatilia sera na kuchukua udhibiti pale kushindwa kunapotokea, kisha wakafundisha kwa marudio (iteratively) kwa kutumia algoriti “inayohamasisha sera kujifunza jinsi ya kupita vizuizi vidogo (bottlenecks) kupitia uingiliaji huo”; mawakala (agents) waliofundishwa kwa data hiyo walifanya vizuri zaidi kuliko mawakala waliofundishwa kwa idadi sawa ya sampuli za maonyesho ya kawaida. Sirius inasukuma wazo hilo hadi kwenye matumizi halisi, “kupima upya uzito wa sampuli za mafunzo kwa kutumia uaminifu wa binadamu uliokadiriwa na kuboresha sera kwa kutumia behavioral cloning yenye uzito (weighted)”. Zote mbili zinahitaji alama ya kila fremu inayoonyesha kilichoendeshwa na binadamu, ndiyo maana alama ya intervention (uingiliaji) ina umuhimu zaidi kuliko inavyoonekana.
Kanuni ya tatu ni kwamba uchanganyaji wa kiotomatiki ni mtego. Dataset iliyotungwa ambayo huwezi kuorodhesha vyanzo vyake ni dataset ambayo huwezi kuirekebisha (debug) wakati duru inayofuata inapozidi kuwa mbaya. Kwenye jukwaa hili, hatua ya kutunga (compose) ni dhahiri kwa sababu hiyo — dataset asilia pamoja na marekebisho, uchaguzi wa episodi kwa kila chanzo, na matokeo ni LeRobot dataset ya kawaida inayosawazishwa (sync) na kufunzwa kama nyingine yoyote; hati za dataset inashughulikia upande wa muundo (format).
| Hatua Katika Duru | Inachozalisha | Njia ya Kawaida Zaidi Inavyoharibika |
|---|---|---|
| Endesha inference ukiwa na kurekodi kumewashwa | Uendeshaji chini ya usambazaji wa hali wa sera yenyewe | Kurekodiwa kama teleoperesheni ya kawaida, ukipoteza taarifa kuwa sera ndiyo iliyokuwa ikiendesha |
| Chukua Udhibiti Wakati wa Kushindwa | Vipande vya marekebisho vyenye alama ya uingiliaji kwa kila fremu | Kurekebisha kutetemeka kwa juu-juu tu (cosmetic wobble), kufundisha mtindo badala ya marejesho (recovery) |
| Panga Kila Episodi | Marekebisho, tathmini, au kutupwa | Kuhifadhi kila kitu; kuchukua udhibiti kulikoharibika kunagharimu zaidi kuliko thamani ya episodi hiyo |
| Sawazisha (Sync) Marekebisho | Dataset yenye toleo (version) kando ya ile asilia | Marekebisho yasiyowahi kutoka kwenye kompyuta ya ndani |
| Tunga Dataset Iliyochanganywa | Asilia pamoja na marekebisho, uchaguzi dhahiri | Uchanganyaji wa kiotomatiki wa kimya, hivyo urudi nyuma (regression) wa baadaye hauwezi kufuatiliwa hadi kwenye chanzo |
| Endelea Kutoka kwa Checkpoint | Checkpoint iliyoanzishwa kutoka kwa ile iliyotangulia | Kutarajia optimizer iendelee pale ilipoishia; vigezo (weights) vinaanzisha modeli, havirejeshi hali ya optimizer |
Kuweka Lango Ambalo Mtu Anaweza Kulishikilia Kwa Uhalisia
“Binadamu anaamua” si maelezo bayana (specification). Waendeshaji wawili wenye vizingiti tofauti huzalisha duru zisizoweza kulinganishwa, na kizingiti kinachotelezea (drifting) huzalisha mwelekeo (trend) usioweza kusomeka. Andika vichocheo (triggers) kabla ya uendeshaji wa kwanza.
- Taja masharti yanayofungua lango — kufikia (approach) kukiwa mbali kwa zaidi ya kiwango kilichowekwa, gripper inayofunga bila kushika chochote, kiungo (joint) kinachotelezea kuelekea kikomo, kusimama (stall) kwa zaidi ya sekunde moja au mbili — na weka orodha hiyo bila kubadilika kwa duru nzima.
- Taja kisichofungua lango. Kupita kiasi (overshoot) ambako sera hujirekebisha yenyewe ni ishara ya mafunzo; kuchukua udhibiti hapo kunafuta marejesho ambayo tayari inayajua.
- Chukua udhibiti mapema vya kutosha kwa makabidhiano safi, rudisha udhibiti mara tu hali inapoweza kurejeshwa.
- Rekodi kwa nini ulichukua udhibiti, kwa kila episodi. Duru tatu baadaye, hilo ndilo rekodi pekee ya kama kushindwa kuleile kunarudi.
- Weka kamera, maandishi ya kazi na opereta bila kubadilika katika duru zote. Badilisha kimoja na namba hazitakuwa zinaweza kulinganishwa tena.
Kimitambo, makabidhiano yana aina mbili. Ukiwa na mkono wa kiongozi (leader arm), kiongozi lazima afikie mkao wa sasa wa follower kabla ya torque kuhamishwa, la sivyo mkono unaruka; hatua hii ya kulinganisha (alignment) ndiyo sehemu iliyojaribiwa kidogo zaidi ya mnyororo huo kwenye vifaa halisi. Bila mkono wa kiongozi, kuchukua udhibiti ni kwa mkono tangu mbofyo wa kwanza wa kitufe: follower inashikiliwa na opereta anaisukumasukuma kiungo kwa kiungo kutoka kwenye kibodi au kuvuta slaidi (sliders), huku vibano vya upande wa server (server-side clamps) vikiweka kila ingizo dogo — digrii chache kwa kila mbofyo wa kitufe, kiasi kidogo kwa kila sasisho la slaidi, kwa sababu hatua kubwa katika mkao ulioshikiliwa ndiyo njia ya kuharibu (strip) servo. Toleo la hatua kwa hatua lenye mafungamano ya vitufe (key bindings) liko katika mwongozo wa hatua kwa hatua wa duru ya DAgger kwenye SO-100; maelezo ya usuli kuhusu hali zote mbili za teleoperesheni yako katika hati za teleoperesheni na maandiko ya leader-follower.

Kusoma Kama Lango Limefanya Chochote
Kigezo cha duru ya human-gated ni kiwango cha uingiliaji (intervention rate): fremu za uingiliaji zikigawanywa na fremu za uendeshaji huo. Kina kazi moja tu — kama hakishuki katika duru zinazofuatana, duru hiyo haikununua chochote, na inayofuata inapaswa kubadilisha kitu kingine badala ya kiasi cha data.
Ni kigezo chenye upendeleo (biased) na unapaswa kujua jinsi gani. Kinapima kizingiti cha opereta kwa kiwango sawa na uwezo wa sera, ndiyo maana orodha ya vichocheo inabaki bila kubadilika; opereta anayelegeza kiwango wakati wa kikao huzalisha mkondo (curve) unaoshuka bila kitu chochote nyuma yake. Pia kinapuuza uzito wa tatizo (severity) — fremu kumi za kuzuia mgongano na kumi za kusukuma kidogo (nudge) mshiko zinaonekana sawa. Kioanishe na seti ya tathmini iliyowekwa imara ambayo haijawahi kuchukuliwa data yoyote ya marekebisho kutoka kwake. Makala kuhusu kupima mzunguko wa DAgger inapitia muundo wa tathmini, ikiwa ni pamoja na jinsi ya kuweka episodi za tathmini nje ya mchanganyiko wa mafunzo.
- Linafanya kazi siku ya kwanza, kwenye muundo wowote wa sera, bila modeli ya ziada ya kusawazisha
- Linanasa kushindwa kwa aina ya 'kujiamini-na-kukosea' ambako hakuna kizingiti cha tofauti kinachogundua
- Linazalisha marekebisho yaliyorekodiwa wakati opereta alikuwa na udhibiti kamili, katika wakati aliouchagua
- Linazalisha alama ya kila fremu ambayo mbinu zenye uzito wa uingiliaji (intervention-weighted) kama IWR na Sirius zinatumia
- Linagharimu usimamizi endelevu; halikui vizuri kwa mtu mmoja na roboti nyingi
- Linategemea uthabiti wa opereta — kizingiti kinachotelezea huharibu kiwango cha uingiliaji
- Halizalishi modeli ya hatari peke yake; kizingiti kilichojifunzwa cha HG-DAgger na kikadiriaji cha ThriftyDAgger ni mitambo ya ziada
- Linahesabu fremu, si matokeo yake
- Haliwezi kuokoa sera ambayo kushindwa kwake kunatokea kabla ya udhibiti, kama vile kamera iliyobadilishwa mahali au mfuatano wa maandishi wa kazi (task string) uliowekwa lebo isiyo sahihi
Maswali Wazi Yanayostahili Kuzingatiwa
Vigezo vya kulinganisha (benchmarks) ni dhaifu. Spencer na wenzake walichunguza vile vinavyotumika kupima mbinu za kujifunza kwa kuiga na wakavikuta “vinawezekana kufikiwa na ni rahisi na hivyo havitoshi kunasa mifumo migumu zaidi ya mrundikano wa makosa (error compounding) inayoonekana katika matatizo ya kufanya maamuzi ya ulimwengu halisi” — na, kinyume na fasihi inayowazunguka, wakakuta behavior cloning ya kawaida ilifanya vizuri kwenye hivyo. Hilo ni sababu ya kuwa na shaka kuhusu upangaji wowote wa aina za DAgger unaotegemea kazi hizo, ikiwemo baadhi ya namba katika jedwali lililo hapo juu.
Malango ya robot-gated kwenye sera kubwa pia hayajatatuliwa. Kazi ya AIM inabadilisha kutokuwa na uhakika kwa kazi mbadala ya Q (proxy Q-function) inayoiga kanuni ya uingiliaji wa binadamu na inaripoti uboreshaji wa 40% katika gharama ya kuchukua udhibiti na ufanisi wa kujifunza ikilinganishwa na ThriftyDAgger — katika udhibiti endelevu na wa mgawanyiko (discrete), si kwenye modeli ya vision-language-action inayoendesha mdanganyifu (manipulator). Kama lolote kati ya malango haya linahamishika kwenda kwenye VLA iliyofanyiwa fine-tuning bado ni swali wazi. Uchunguzi (survey) huo unatoa hoja inayohusiana: istilahi na muundo wa uwanja huu (field) haujaunganishwa katika fasihi yote, jambo linalofanya mbinu ziwe ngumu kulinganisha. Kwenye mkono wako mwenyewe, kumbukumbu zako (logs) ndizo ushahidi ulionao.
Je, HG-DAgger Kwa Kweli Ni DAgger Ikiwa Binadamu Anaweka Lebo Tu Wakati wa Uingiliaji?▾
Inahifadhi sehemu inayohusika — data iliyokusanywa chini ya usambazaji wa hali unaosababishwa na mjifunzaji, ikiwekwa pamoja na iliyotangulia — na kuacha sehemu isiyodumu inapokutana na vifaa halisi. Kelly et al. wanaiwasilisha kama aina (variant); dhamana ya no-regret ya 2011 haihamishwi bila kubadilika.
Je, Ninaweza Kutumia Lango la Robot-Gated kwenye Sera ya VLA Iliyofanyiwa Fine-Tuning kwenye SO-100?▾
Si kwa urahisi wa moja kwa moja. Kiainishi cha SafeDAgger kinahitaji sera ya rejea inayoweza kuulizwa ambayo huna. EnsembleDAgger inahitaji ensemble, jambo ambalo kwa modeli yenye vigezo vya mabilioni kadhaa linamaanisha nakala kadhaa kwenye kumbukumbu pamoja na gharama yao ya inference. ThriftyDAgger inahitaji kikadiriaji cha hatari kilichofundishwa kwa mafanikio na kushindwa ambako hakupo kabla ya duru zako za kwanza.
Kuchukua Udhibiti Mmoja Kunapaswa Kudumu Muda Gani?▾
Muda wa kutosha kufikia hali ambayo sera inaweza kuendelea kutoka humo, na si zaidi: kuchukua udhibiti kwa muda mrefu kunageuza uendeshaji kuwa kikao cha maonyesho na kufurika seti ya marekebisho kwa tabia ya kawaida (nominal behavior). Ugunduzi wa LazyDAgger unakata upande mwingine pia — mabadiliko mengi mafupi sana yana gharama yao wenyewe.
Je, Nifundishe Kwa Kutumia Vipande Vilivyorekebishwa Tu?▾
Hapana — hiyo ndiyo njia ya kawaida zaidi ya kupoteza duru bure. Modeli iliyofanyiwa fine-tuning kwa marejesho (recoveries) pekee haijaona chochote isipokuwa marejesho. Changanya marekebisho ndani ya dataset asilia ukiwa na vyanzo vilivyochaguliwa dhahiri; kwenda mbali zaidi, angalia mbinu za intervention-weighted kama IWR au Sirius, ambazo huongeza uzito wa fremu zilizoendeshwa na binadamu badala ya kuzitenga.
Je, Ikiwa Kiwango cha Uingiliaji Hakishuki Baada ya Duru?▾
Ichukue kama ilivyo: duru hiyo haikusaidia. Kabla ya kuongeza marekebisho, angalia maelezo nafuu zaidi — je, kizingiti cha opereta kilitelezea, je, marekebisho yalikuwa ya juu-juu tu (cosmetic), je, dataset iliyotungwa iliyakuwa nayo kwa hakika, je, mafunzo yalianzishwa kutoka kwa checkpoint iliyokusudiwa. Duru iliyoanza kimya kimya kutoka kwa modeli ya msingi (base model) inaonekana sawasawa na duru iliyoshindwa kujifunza.
Je, Kutoingilia Kati Kunabeba Taarifa?▾
Chini ya Expert Intervention Learning, ndiyo: vipindi ambapo msimamizi alitazama na hakutenda vinasomwa kama ushahidi hafifu kuwa hali na kitendo vilikubalika, vikirasimishwa kama kizuizi kwenye kazi ya thamani. Mifumo mingi ya vitendo (pipelines), ikiwemo hii, huweka alama tu kwa kile alichoendesha binadamu.
Kwa mkono mmoja kwenye meza, uamuzi tayari umefanywa: shikilia lango wewe mwenyewe, andika kinachofungua, na tumia juhudi kwenye ushughulikiaji wa data nyuma yake badala ya kufanya swichi hiyo kuwa ya kiotomatiki. Upande wa jukwaa (platform) umeelezwa kwenye ukurasa wa mzunguko wa DAgger, chaguzi za mafunzo kwa kila familia ya sera chini ya mafunzo na bei. Kwa maelezo ya usuli, anza na kujifunza kwa kuiga na kujifunza kwa kuiga kwenye SO-100; kwa uendeshaji wa kwanza, endesha sera yako ya kwanza ndiyo njia fupi zaidi.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started