
DAgger i thjeshtë kërkon nga një njeri të etiketojë gjendjet ndërsa roboti po vozit ende. Në harduerin real, kjo është e pasigurt dhe prodhon etiketa të dobëta. Variantet e portës zëvendësojnë etiketimin verbë me një portë që dikush duhet të mbajë: njeriu në HG-DAgger, një klasifikator sigurie në SafeDAgger, mospajtimet e një ansambli në EnsembleDAgger, një vlerësim të buxhetuar të novezes dhe riskut në ThriftyDAgger. Ky artikull i krahason ato sipas kujt i përket porta, çfarë sinjali e hap atë dhe sa kushton secila — dhe pse forma e kontrolluar nga njeriu është ajo që mbijetoi kontaktin me një krah real.
Një politikë e klonuar dështon atje ku të dhënat e saj të trajnimit mbaruan. Rregulla është të vazhdo të mbledhësh të dhëna nën shpërndarjen e gjendjeve të politikës në vend të asaj të demonstratorit, që është ajo që bën DAgger dhe ajo që hyrja në agregimin e bashkësive të të dhënave mbulon nga parimet e para. Lë të qartë pjesën e nganë të algoritmit origjinal: ndërsa nxënësi vozit, eksperi supozohet të thotë çfarë do të ketë bërë, për çdo gjendje, pa qenë në kontroll.
Në një simulues me një ekspert të shkruar në skript që është falas. Në një tavolë me një krah real mbi të, kjo nuk është as falas as e sigurt. Autorët e HG-DAgger shprehin kundërshtimin saktësisht: skema të tilla të marrjes në mostër "kërkojnë ekspertin të japë etiketa aksioni pa qenë plotësisht në kontroll të sistemit", e cila "mund të zvogëlojë sigurinë dhe, kur përdoren njerëzit si ekspertë, ka të ngjarë të degradojë cilësinë e etiketave të mbledhura për shkak të voneses së ndijuar në veprim" (Kelly et al., 2019). Dy dështime fshihen në atë fjali: politika vazhdon të vozit në gjendje që askush nuk i dëshiron, dhe etiketat e blera me atë rrezik janë më të dobëta se ato që një njeri prodhon ndërsa mban kontrollet. Çdo variant më poshtë përgjigjet i pyetjes së njëjtë — vë një portë në kontroll dhe lejo dikë të vendosë kur hapet. Ato ndryshojnë sipas kujt i përket poja.
Versioni i shkurtër
- •Variantet e portës zëvendësojnë etiketimin verbë me një ndërprerës midis kontrollit të politikës dhe atij të ekspertit. Ato që i ndajnë është kush e zotëron ndërprerësin.
- •HG-DAgger i jep ndërprerësin njeriut dhe agregon vetëm të dhëna të regjistruara ndërsa njeriu kishte kontroll të ndërprerë.
- •SafeDAgger i jep atë një klasifikatori binar që parashikon devijimin nga një politike referimi; EnsembleDAgger kërkon variancë të ulët të ansamblit dhe distancë të vogël ndaj aksionit të ekspertit në të njëjtën kohë.
- •LazyDAgger shton histerez në mënyrë që kontrolli të mos ketë fishti; ThriftyDAgger vë portë në novezeë ose rrezik të vlerësuar nën një buxhet të qartë intervenimesh.
- •Sinjalet e kontrolluar nga roboti kanë nevojë për diçka që një VLA i fino-tunuar në një krah klase hobi zakonisht i mungon: një politikë referimi, një ansambel të lirë, ose pasiguri epistemike të kalibruar.
- •Porta është gjysma e metodës. Ajo që ndodh me segmentet e ndërhyrjes më pas — përzierja, peshimi, agregimi — vendos nëse raundi përmirësoi ndonjë gjë.
Kontrolli i njerëzimit dhe i robotit: ndarja që ka rëndësi
Nxënia imituese interaktive ka anketën e vet; Celemin dhe kolegët e katalogojnë atë sipas llojit të përshtypjes, ndërfaqes, modelit të të mësuarit, përvojës së përdoruesit, aplikimit dhe pikës referuese. Dallimi që vendos inxhinierinë tuaj është më i thjeshtë se cilado nga ato boshte, dhe puna e fundit e emërton atë drejtpërdrejt: një metodë është kontrolluesi i njerëzimit kur mbikëqyrësi vendos kur të ndërhyret, dhe kontrolli i robotit kur agenti vendos kur të kërkojë ndihmë (Cai et al., 2025). Gjithçka tjetër është mekanika që shërben njërës nga këto dy zgjedhje. Tregtia është e dukshme nga fillimi: një portë e kontrolluar nga njeriu kushton vëmendje të vazhdueshme, dhe një portë e kontrolluar nga roboti premton t'i kthejë atë vëmendje — por vetëm nëse sinjali që vë portë është i besueshëm, dhe ndërtimi i atij sinjali është problemi i vet i kërkimit.
SafeDAgger: një klasifikator që parashikon devijimin e vet
SafeDAgger e Zhang dhe Cho (2016) është porta më e hershme e këtyre. Kërkimi i politikës referuese është pjesa e shtrenjt, kështu që një rrjet tjetër i vogël — politika sigurie — parashikon nëse kërkimi është i vlefshëm para se të gjithash. Ai "kthen një etiketë binare që tregon nëse politika parësore ka të ngjarë të devijojë nga një politikë referimi pa e kërkuar atë". Etiketa përcaktohet kundrejt devijimit L2 në katror midis aksioneveë të dy politikave me një prag tau, dhe klasifikatori përshtatet me humbjen e entropisë binare. Në kohën e ekzekutimit, ai vendos për çdo gjendje nëse nxënësi vazhdon të vozit ose referimi merr kontrollin. Abstrakti raporton më pak kërkesa referimi në një simulator curse makinash plus përshpejtim të shpejtësisë së konvergjences që autorët i atribuojnë një efekti të kurikulum të automatizuar, pa dhënë një shifër për asnjërën.
Kurba është në përkufizim, jo në rezultate. Trajnimi i klasifikatorit kërkon aksionin e politikës referuese në çdo gjendye të përdorur për ta përshtatur, e cila supozoi se referimi është një program tjetër. Nëse referimi juaj është një njeri me një krah udhëheqës, kjo bashkësi etiketash nuk është e lirë dhe metoda humbet vetinë që u dizajnua.
EnsembleDAgger: dyshim dhe mospajtime, të dy
Menda, Driggs-Campbell dhe Kochenderfer (2019) i trajtojnë portën si një pyetje probabiliste. EnsembleDAgger "përafron një Proces Gaussian duke përdorur një ansambel rrjetash neurale" dhe lexon variancën e ansamblit si një përfaqësues të besimit: varianca e lartë do të thotë një rajon i ndryshëm nga të dhënat e trajnimit, e cila — duke supozuar se eksperti shmang gjendjet e dështimit — korelohet me afërsinë e dështimit. Rregulli është një lidhje. Nxënësi mund të veprojë vetëm kur distanca L2 midis aksionit të tij mesatar dhe aksionit të ekspertit qëndron nën një prag (mospajtime) dhe varianca e aksionit të tij të parashikuar qëndron nën të dytë (dyshim). Nëse njëra dështon, eksperti merr kontrollin. Qëllimi është të maksimizosh pjesën e nxënësit të aksioneveë ndërsa kufizon probabilitetin e dështimit; gazeta raporton sigurinë dhe të mësuarit e përmirësuar kundrejt varianteve të tjera të DAgger në një lavjerrës të përmbysur dhe MuJoCo HalfCheetah.
Kjo në heshtje diskualifikon rregullin e plotë për mbikëqyrjen pa duar. Distanca midis aksionit të nxënësit dhe atij të ekspertit kërkon aksionin e ekspertit në atë gjendye, në atë moment. Me një ekspert të shkruar në skript, mirë. Me një njeri, njeriu duhet të prodhojë aksione vazhdimisht — saktësisht barrë që variantet e portës duheshin ta hiqnin. Termi i dyshimit vetëm është pa duar; lidhja nuk është.
LazyDAgger: ndaloni ndërprerësin të mblidhet
Hoque dhe kolegët (2021) sulmuan një kosto që gazetat më të hershme nuk matën: ndërprerësi vetë. Çdo ndërhyrje "ndërpret punën tjetër që njeriu po bën, shkakton latencë me çdo ndryshim konteksti midis mbikëqyrjes dhe kontrollit autonom, dhe kërkon kohë për të kryer". Një portë që hapet dhe mbyllet dhjetë herë në minutë është më e keqe se një që hapet një herë për dhjetë sekonda, me pjesën e barabartë autonome. LazyDAgger zgjeron SafeDAgger me pragun asimetrik — më i vështirë për hyrjen në kontrollin e mbikëqyrjes se të mbetesh në të — kështu që sistemi nuk oscillon në kufi. Në simulim "mund të zvogëlojë ndërprerjet e kontekstit me një mesatare 60% mbi SafeDAgger në 3 detyra kontrolli të vazhdueshëm ndërsa mbajnë performancën e politikës në krye të artit"; në manipulimin e tekstile me një ABB YuMi, ai "zvogëlon ndërprerjet e kontekstit me 60% ndërsa arrin një normë suksesi 60% më të lartë se SafeDAgger në kohën e ekzekutimit".
ThriftyDAgger: novezeë ose risk, nën një buxhet
ThriftyDAgger (Hoque et al., CoRL 2021) fillon nga buxheti i mbikëqyrësit në vend të politikës. Ai "përdor një politikë ndërprerësi të mësuar për të kërkuar ndërhyrje vetëm në gjendje që janë mjaft (1) novele, ku politika e robotit nuk ka sjellje referimi për të imituar, ose (2) rrezikore, ku roboti ka besim të ulët në përfundimin e detyrës", me një metrikë të re për vlerësimin e atij rreziku. Buxheti është një hyrje, jo një rezultat: ju deklaroni sa kohë njerëzore do të shpenzoni. E aplikuar në kohën e ekzekutimit, metoda "arrin një normë suksesi 100% në të dy detyrat e simulimit dhe fizike", dhe një studim përdoruesi me dhjetë pjesëmarrës që kontrollojnë një floçe tre-roboti prind të një detyre përqendrimi raporton se ai "rrit performancën e njeriut dhe robotit me 58% dhe 80% përkatësisht krahasuar me algoritmin më të mirë tjetër ndërsa zvogëlojnë bremën e mbikëqyrësit". Vendodhja e flotës është shtëpia natyrore për këtë punë; Fleet-DAgger më vonë formalizoi të mësuarit interaktiv të flotës me robotë të shumtë dhe mbikëqyrës, duke propozuar Kthimin në Përpjekjen e Njeriut si sasia për të optimizuar.
HG-DAgger: njeriu mban portën
Kelly et al. (2019) shkojnë në rrugën tjetër. Nuk ka asnjë politikë ndërprerësi. Nxënësi rrotullohet "derisa eksperti vëren se fillestar ka hyrë në një rajon të padëshiruar të hapësirës shtetit", në të cilën pika eksperti merr kontrollin dhe guidon sistemin përpara. Rregulli i agregimit është pjesa e rreptë: "Etiketat e aksionit të ekspertit mblidhen dhe shtohen në bashkësinë e të dhënave vetëm gjatë këtyre trajektoreve të rimëkëmbjes, gjatë të cilave eksperi njeri ka kontroll të ndërprerë të sistemit." Asgjë nuk etiketohet ndërsa njeriu është një spektator.
Nuk ndalon te ndërprerësi. HG-DAgger gjithashtu "mëson një prag sigurie për një metrikë rreziku të bazuar në pasigurinë e modelit që mund të përdoret për të parashikuar performancën e fillestarit të plotë të trajnuar në rajone të ndryshme të hapësirës shtetit": ai regjistron sa i pasigurt qe nxënësi në momentet kur njeriu ndërhyri dhe mesatarizojnë çerekun e fundit të atyre regjistrimeve, ku nxënësi më shumë i ngjason formës përfundimtare. Ajo nuk është një portë që roboti funksionon por një diagnostik që ju thotë ku pritet të mbajë politika e përfunduar. Vlerësimi mbulon një detyrë vozitjeje të simuluar dhe të botës reale dhe raporton performancën e përmirësuar ndaj të dy DAgger dhe klonimit të sjelljes.
Një linjë e lidhur ndryshon atë që llogaritet si etiketë. Expert Intervention Learning e Spencer dhe kolegëve mban se "çdo shumë e përshtypjes së ekspertit, qoftë përmes ndërhyrjes ose jo-ndërhyrjes, ofron informacion në lidhje me cilësinë e gjendjes aktuale, optimalitetin e aksionit, ose të dyja", formalizuar si një kufizim në funksionin e vlerës së nxënësit dhe zgjidhur me të mësuarim pa shpresim në linjë. Nën atë lexim, shticat ku njeriu vëzhgoi dhe nuk bëri asgjë janë prova pozitive të dobëta në vend të boshes. EIL mëson shmangien e përplasjeve nga rreth një minutë e kontrollit të ekspertit.

Variantet krah për krah
| Metoda | Kush e hap portën | Sinjali | Nevojat e disponueshme | Raportuar |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Asnjë — nxënësi vozit gjithnjë | Asgjë; eksperti etiketoj çdo gjendye të vizituar | Një ekspert i aftë të etiketojë gjendje off-policy ndërsa nuk është në kontroll | Zvogëlim pa shpresim me garantime nën shpërndarjen e gjendjeve të nxënësit |
| HG-DAgger (Kelly et al., 2019) | Mbikëqyrësi njeri | Gjykimi i mbikëqyrësit që gjendja është e pasigurt | Dikush që vëzhgon, dhe një dorëzim i pastër i kontrollit | Premton DAgger dhe klonimin e sjelljes në një detyrë vozitjeje të simuluar dhe reale; mëson gjithashtu një prag rreziku |
| SafeDAgger (Zhang & Cho, 2016) | Roboti | Klasifikator binar për devijimin L2 nga referimi mbi tau | Një politikë referimi pyetese për etiketat e klasifikatorit | Më pak kërkesa referimi në një simulator kurse, konvergjencë më e shpejt (nuk jepet shifër) |
| EnsembleDAgger (Menda et al., 2019) | Roboti | Varianca e ansamblit dhe distanca ndaj aksionit të ekspertit, të dy nën pragut | Një ansambel i rrjetave plus aksioni i ekspertit në çdo hap | Siguri dhe të mësuarit e përmirësuar në lavjerrës dhe HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Roboti, me histerez | Sinjali i SafeDAgger me pragjet e hyrjes dhe daljes të ndryshme | Ajo që SafeDAgger ka nevojë, plus një prag të dytë për të tunuar | ~60% më pak ndërprerje konteksti në 3 detyra; 60% norma më e lartë e suksesit në YuMi tekstile |
| ThriftyDAgger (Hoque et al., 2021) | Roboti, nën një buxhet | Novezeë, ose rrezik i vlerësuar të mos përfunduar detyrën | Një vlerësues rreziku i mësuar dhe një buxhet ndërhyrjeje të deklaruar | Sukses 100% në kohën e ekzekutimit; studim përdoruesi (N=10): fitim 58% dhe 80% mbi atë më të mirë tjetër |
| EIL (Spencer et al., 2020) | Njeriu — jo-ndërhyrja llogaritet gjithashtu | Ndërhyrja dhe mungesa e saj si kufizime në funksionin e vlerës | Të mësuarit në linjë pa shpresim mbi një kufizim vlere | Shmangje përplasjeje nga rreth një minutë e kontrollit të ekspertit |
Ajo që secila portë blen, dhe ajo që ngarkon
Lexo poshtë kolonës "nevojat" dhe një model bien jashtë: çdo sinjal i kontrolluar nga roboti atje është një përfaqësues që duhet të prodhohet, dhe secila përfaqësuese e tij ka faturën e vet.
- Sinjalet e mospajtimet (SafeDAgger, LazyDAgger, gjysma e rregullit të EnsembleDAgger) kanë nevojë për një politikë referimi. Ose keni një ekspert të shkruar në skript, në të cilin rast problemi interesant zgjidhet tashmë, ose një njeri përsëri prodhon aksione në sfond në mënyrë që një distancë mund të llogaritet.
- Sinjalet e dyshimit kanë nevojë për pasiguri epistemike të kalibruar. Një ansambel i rrjetave të kontrollit të vogël e përafron atë; një ansambel i një modeli përvojë-gjuhë-aksion tre-miliard-parametrash është një problem memorie dhe latence para.
- Sinjalet e novezes dhe rrezikut kanë nevojë për një vlerësues të mësuar të përfundimit të detyrës, të përshtatni në rrolavje mjaft të suksesshme dhe të dështuar. Në një detyrë që ende po përpiqesh ta bësh të funksionojë, këto të dhëna nuk ekzistojnë në raund të parë.
- Porta e kontrollit të njerëzimit ka nevojë për vëmendje dhe asgjë tjetër — i vetmi sinjal i disponueshëm në ditën e parë, në çdo arkitekturë politike, pa model shtesë për të trajnuar.
- Asnjë portë roboti nuk e heq njeriun nga dhoma. Ato zvogëlojnë sa shpesh njeriu duhet të veprojë, jo nëse duhet të jetë i pranishëm.
Ka një ndryshim më të qetë në atë që porta prodhon. Një porta roboti që zjarr në mes të trajektores ia jep një personi një krah lëvizjes në një qëndrimzgjidhe arbitrare. Një porta e kontrolluar nga njeriu i lejon operatorit të zgjedhë momentin — pas arritjes, përpara përqafrimit, jo në mes të një lëkundjeje. Segmentet e rimëkëmbjes nga të dy nuk janë njësoj të pastra, dhe këto segmente janë e gjithë produkti e raund.
Pse forma e kontrolluar nga njeriu fiton në harduerin real
Ky është një argument inxhinierik, jo një rezultat pikë referuese — asnjë gazetë që gjetëm e ekzekuton të pesë portat në të njëjtën manipulator me të njëjtën klasë politike. Mbështetet në katër pika.
Së pari, mbikëqyrësi është aty në çdo rast. Asnjë nuk e lë një krah SO-100 duke xhiruar pa mbikëqyrje pranë objekteve që mund të rrëzojë. Pasi dikush vëzhgon, kostoja margjinale e dhënies atyre një butoni që të marrin kontrollin është afër zeros; ndërtimi i një vlerësuesi rreziku të kalibruar është një projekt.
Së dyti, pasiguria që mund të matni në të vërtetë në një politikë moderne është shpesh sasia e gabuar. Një kokë difuzioni ose përputhje të fluksit prodhon variancë në të gjitha kuadro të aksionit të mostrar, dhe ajo variancë reflekton multimoda që koksha u trajnua për të përfaqësuar, jo injorancë epistemike rreth gjendjes. Termi i dyshimit të EnsembleDAgger përdor një ansambel saktësisht për të kapur këtë. Të dyja duken si numri i njëjtë dhe nuk janë; chunking aksioni dhe përputhje fluksit hyrjet mbulohen se si ato koka lëshojnë aksione në vendin e parë.
Së treti, dështimet që kanë rëndësi në manipulim janë shpesh semantike sesa statistikisht të pazakonta. Një politikë që mbyll grepën dy centimetra më herët, ose arrin besimtarisht për atë të gabuar të dy kubeve identike, nuk është në një gjendye të variancës së lartë — ajo është besnikur dhe e gabuar. Asnjë prag variancë nuk e kaplon këtë; një njeri që vëzhgon e kapon atë menjëherë.
Së katërti, cilësia e etiketës — pika origjinale e HG-DAgger, dhe ajo më shpesh e kaluar. Etiketat e mbledhura ndërsa njeriu kishte kontroll të ndërprerë superojnë etiketat që u treguan mbi një sistem lëvizës. Nëse qëllimi është të dhëna korektivuese të vlefshme për t'u agreguar, barrja e provës qëndron me portën e automatizuar.
Fotografia përmbys kur një mbikëqyrës është përgjegjës për shumë robotë — regjimi ThriftyDAgger të studimit të përdoruesit dhe Fleet-DAgger të formalizimit objektiv. Me një floçe, vëmendja e njeriut është burimi i rrallë dhe alokim i paperfekt batte asgjë. Me një krah në një zyrë nuk jeni në atë regjim.
Linja e kontrolluar nga njeriu, tashmë e lidhur
Ndërhyrje gjatë një seance konkluzimi në ekzekutim, flamuja të ndërhyrjes për-kuadër në segmentet e korrigjuara, kurimin e çdo ekzekutimi në korigjime ose vlerësim, përzjedhjen e një bashkësie të përzier nga burimet që zgjedhni, dhe vazhdon trajnimin nga një pikë kontrolli ekzistuese janë të ndërtuar në vend të skriptuar me dorë. Ndërhyrja funksionon me një krah udhëheqës, ose me tastierë dhe rrëshqitës nëse nuk keni njërin.
Shihni se si linja e DAgger funksiononPorta është gjysma e metodës; trajtimi i të dhënave është gjysma tjetër
Një portë vendos cilat kuadro voziti njeriu, jo çfarë të bëjë me ato, dhe ky vendim i dytë është ku raunde shpenzohen më shpesh. Rregulli i parë është ai D në DAgger përfaqëson: agregoj, nuk zëvendësoj. Fino-tunimin i një pike kontrolli thjesht në disa qind kuadro korrigjuese ju jep një model që ka parë gati asgjë përveç rimëkëmbjes dhe ka harruar trajektoren nominale.
Rregulli i dytë është se kuadrot e ndërhyrjes nuk janë kuadrot e zakonshme. Mandlekar et al. ndërtuan një sistem teleoperacioni të largët për manipulim 6-DoF që i lejon operatorët të mbikëqyrin politikat dhe të marrin kontrollin në dështim, pastaj të trajnojnë në mënyrë përsëritëse me një algoritëm që "nxit politikën të mësojë se si të përshkojnë përshkallëzime përmes ndërhyrjeve"; agjentët e trajnuar në këto të dhëna tejkaluan agjentët e trajnuar në një numër të barabartë mostrave të zakonshme demonstrimi. Sirius e shtyp idenë në vendosje, "ri-peshojnë mostrat e trajnimit me besim të përafrueshëm të njeriut dhe optimizojnë politikat me sjelljen e peshuar klonuese". Të dyja kanë nevojë për një shënues per-kuadër i asaj që voziti njeriu, që është përse flamuji i ndërhyrjes ka rëndësi më shumë se duket.
Rregulli i tretë është se përzierja automatike është një kurth. Një bashkësi e përpiluar burimet e cila nuk mund të numëro është njëra ku nuk mund të debug kur raundi tjetër bëhet më keq. Në këtë platformë hapi i përbërjes është i qartë për atë arsye — bashkësia origjinale plus korigjime, zgjedhja e epizodës për burim, dhe rezultati është një bashkësi e zakonshme LeRobot që sinkron dhe trajnon si ndonjë tjetër; dokumentacioni i bashkësisë mbulon anën e formatit.
| Hapi në raund | Ajo që prodhon | Mënyra më e zakonshme që përshëmbetje gabim |
|---|---|---|
| Ekzekuto konkluzim me regjistrimin të | Një ekzekutim nën shpërndarjen e gjendjeve të politikës | Regjistruar si teleoperacioni i thjeshtë, duke humbur se një politikë ishte vozitje |
| Merr kontrollin në dështim | Segmentet e korrigjimit me një flamuj ndërhyrjeje për-kuadër | Duke korrigjuar lëkundjen kosmetike, duke mësuar stil në vend të rimëkëmbjes |
| Kuro çdo epizodë | Korigjime, vlerësim, ose përshkrije | Duke mbajtur gjithçka; një ndërhyrje të këputur kushton më shumë se episodi vlente |
| Sinkrono korigjime | Një bashkësi të versione pranë origjinalit | Korigjime që kurrë nuk lënë makinën lokale |
| Komponimi bashkësin e përzier | Origjinal plus korigjime, zgjedhje të qarta | Përzierja në heshtje e auto, kështu një regresion më vonë nuk mund të kushtoj në një burim |
| Vazhdo nga një pikë kontrolli | Një pikë kontrolli inicializuar nga njëra e mëparshme | Duke pritur një optimizer rimë; peshat inicializojnë modelin, ato nuk restaurojnë gjendjen e optimizerit |
Vendosje e një porte që një njeri mund të mbajë në të vërtetë
"Njeriu vendos" nuk është një specifikim. Dy operatorë me pragje të ndryshme prodhojnë raunde të pazbullueshme, dhe një prag që zhvendoset prodhon një trend që nuk mund të lexo. Shkruaj triggemet përpara ekzekutimit të parë.
- Emëro kushtet që hapen porta — arritje jashtë më shumë se një marzhë e fiksuar, grepje duke mbyllur asgjë, një lidhje që zhvendoset drejt një kufiri, një ndalesë më shumë se një sekonda ose dy — dhe mbajnë listën të pa ndryshuar për raund.
- Emëro atë që nuk e hap atë. Kalim portën politika rimëkëmbet nga vetë është sinjal trajnuesi; marrja e kontrollit atje i fshij një rimëkëmbje tashmë dinë.
- Merr kontrollin mjaft herët për një dorëzim të pastër, dorëzoj mbrapa sa më shpejt të jetë gjendja e rimëkuperieshme.
- Regjistro pse merr kontrollin, për epizodë. Tre raunde më vonë është i vetmi rekord i nëse i njëjti dështim kthehet.
- Mbajnë kamerat, tekstin e detyrës dhe operatorin konstant në të gjithë raunde. Ndryshim njërin dhe numrat ndalojnë të jenë të krahasueshëm.
Mekanikisht dorëzimi ka dy variantet. Me një krah udhëheqës, udhëheqësi duhet të arrijë qëndrimin aktual të pasuesit përpara transferimit të çift rrotullues, ose kahu kërcen; ky lëvizje shtrirjeje është pjesa më pak testuar e zinxhirit në harduerin real. Pa një krah udhëheqës ndërhyrja është manuale nga shtypja e parë: pasuesin mbahet dhe operatori e shmang atë lidhje për lidhje nga tastiera ose tërheq rrëshqitës, me klampat anësore e server-side mbajnë secilin hyrje të vogël — disa gradë për shtyp, një puri për përditësim rrëshqitës, sepse një hap të madh në një qëndrimzgjidhe mbajtur është si rrahje një servo. Versioni me hap pas hapi me lidhjet e çelasit janë në ecja përqysh e një raundi DAgger në një SO-100; prapavijë në të dyja mënyrat e teleoperacionit është në dokumentet e teleoperacionit dhe hyrje udhëheqës-ndjekës.

Leximi nëse porta bëri diçka
Metrika e raund i kontrolluar nga njeriu është norma e ndërhyrjes: kuadro ndërhyrjeje ndarë sipas kuadrot e ekzekutimit. Kjo ka një punë — nëse nuk bie në raunde, raundi nuk blenë asgjë, dhe tjetra duhet të ndryshojë diçka tjetër sesa sasia e të dhënave.
Kjo është një metrikë e njëanshme dhe duhet të dini se si. Ajo mat praggu i operatorit aq shumë sa kompetencën e politikës, që është pse lista trigger qëndrat e fiksuar; një operatore të cilë relaksim mbi një seancë prodhon një kurbe që bie me asgjë pas saj. Kjo gjithashtu injoron rrezikun — dhjetë kuadro për të ndaluar një përplasjeje dhe dhjetë për të nudur një përqafrimi duken identike. Çifti kjo me një bashkësi vlerësimi të fiksuar asnjë të dhënë korigjimi ishte ndonjëherë tërhequr nga. Artikulli mbi matjen e një linja DAgger shkon përmes dizajnit të vlerësimit, përfshirë si të mbajnë episodet e vlerësimit jashtë përzierjes së trajnimit.
- Funksionon ditën e parë, në çdo arkitekturë politike, pa model shtesë për të kalibruar
- Kapon dështime besnikur-dhe-e-gabuar asnjë prag variancë zbulon
- Prodhon korigjime të regjistruara ndërsa operatori kishte kontroll të plotë, në një moment zgjuan
- Çifte një shënues per-kuadër që metodat e peshuara-ndërhyrjeje siç janë IWR dhe Sirius konsumohen
- Kushton mbikëqyrje të vazhdueshme; nuk shkallëzohet në një njeri dhe shumë robotë
- Varet nga konsistenca e operatorit — një prag që zhvendoset korrupton normën e ndërhyrjes
- Prodhon asnjë model rreziku në të tij; pragu i mësuar i HG-DAgger dhe vlerësuesi i ThriftyDAgger janë makinerinë shtesë
- Numrat kuadro, jo pasoja
- Nuk mund të shpëtoj një politikë dështimi i cila është ndjekja e kontrollit, siç është një kamerë e ndërruar ose një varg detyre të etiketuar keq
Pyetjet e hapura të vlefshme të mbajtura në pamje
Pikëmatje janë të dobëta. Spencer dhe kolegët ekzaminuan ato të përdorura për të testuar qasjet e nxënies imituese dhe gjetën ato "realizueshme dhe të thjeshta dhe kështu të pamjaftueshme për kapjen e regjimeve më të vështira të kompensimit të gabimit të parë në probleme të vendimmarrjes në botën reale" — dhe, kundrejt literaturës rrethues, gjetën sjelljen e thjeshtë klonuese bëri mirë mbi to. Kjo është arsye të jetë skeptik të çdo renditjeje të varianteve DAgger mbështetja në ato detyra, përfshirë disa numra në tabelën më sipër.
Portat e robotit në politikat e mëdha nuk zgjidhen as. Puna e AIM zëvendëson pasigurinë me një funksion Q përfaqësues që mimikon rregullin e ndërhyrjes njerëzore dhe raporton një përmirësim 40% në koston e marrjes-mbi dhe efikasiteti të të mësuarit mbi ThriftyDAgger — në kontroll të vazhdueshëm dhe diskret, jo në një modeli përvojë-gjuhë-aksion që vozit një manipulator. Nëse ndonjë i këtyre portave transferohet në një politikë VLA të fino-tunuar është i hapur. Anketa bën një pikë të lidhur: terminologjia e fushës dhe struktura nuk janë të unifikuara në të gjithë literaturën, të cilat e bënë metodat të vështira të krahasueshme. Në krahu tuaj, regjistrat tuaj janë provat që keni.
Eshte HG-DAgger vërtet DAgger nëse njeriu etiketoj vetëm gjatë ndërhyrjeve?▾
Ajo mban pjesën që kanë rëndësi — të dhëna të mbledhura nën shpërndarjen e gjendjeve nxënësi indukton, agreguar me atë që erdhi përpara — dhe përjashton pjesën që nuk mbijetoj kontakti me harduerin. Kelly et al. prezantoj atë si një variant; garancia 2011 pa shpresim nuk mbante të pandryshuar.
Mund të përdor një portë roboti në një politikë VLA të fino-tunuar në një SO-100?▾
Jo në mënyrë të drejtpërdrejtë. Klasifikatori e SafeDAgger ka nevojë një politikë referimi pyetese nuk keni. EnsembleDAgger ka nevojë një ansambel, të cilat për një modeli multi-miliard-parametrash do të thotë disa kopje në kujtesë plus kostoja e tyre konkluzion. ThriftyDAgger ka nevojë një vlerësues rreziku përshtate në suksese dhe dështime të cilat nuk ekzistojnë përpara raunde tuaj e parë.
Sa e gjatë duhet të jetë një ndërhyrje të vetme?▾
Mjaft i gjatë për të arritur një gjendye politika mund të vazhdoj nga, dhe jo më gjatë: ndërhyrje të zgjatura kthej ekzekutim në një seancë demonstrim dhe përmbytje bashkësin korigjimit me sjellje nominale. Gjetje e LazyDAgger të presë ndryshe — shumë ndërprerje shumë të shkurtra janë kostja e tyre.
Duhet të trajnoj vetëm në segmentet e korrigjuara?▾
Jo — kjo është mënyra më e zakonshme për të shpenzuar një raund. Një model fino-tunuar vetëm në rimëkëmbje ka parë gati asgjë përveç rimëkëmbjes. Përzierje korigjime në bashkësinë origjinale me burimet zgjatur në qartë; të shkoj më larg, shiko në përafrimet e peshuar-ndërhyrjeve siç janë IWR ose Sirius, të cilat pesht-lartë kuadro të vozitja me dorë në vend të izolim ato.
Po nëse norma e ndërhyrjes nuk bie pas një raundi?▾
Merrni atë në fytyrën e saj: raundi nuk ndihmoj. Para se të shto korigjime, kontroll shpjegimet më të lira — operatorit prag zhvendos, ishin korigjime kosmetike, bëri bashkësinë e përpiluar në të vërtetë përmbajnë ata, ishte trajnuesi inicializuar nga pikë kontrolli paraprake. Një raund se në heshtje filloi nga modeli bazë duket saktësisht si raund i dështuar të mësojë.
Eshte jo-ndërhyrje mbartin informacion?▾
Sipas Expert Intervention Learning, po: shticat ku mbikëqyrësi vëzhgoi dhe nuk veprojnë lexohen si prova të dobëta se gjendja dhe aksioni ishin të pranueshëm, formalizuar si kufizim në funksionin e vlerës. Më praktik pipelines, përfshirë këtë njësi, shënoj vetëm atë voziti njeriu.
Për një krah të vetme në një zyrë zgjedhja bëhet: mbajnë porta vetë, shkruaj poshtë atë hapen, dhe kaloj përpjekja në trajtimin e të dhënave pas saj në vend të në automatizim i ndërprerësi. Anë platformë përshkruhet në faqja e linjës DAgger, opsionet e trajnimit për familje politike nën trajnimin dhe çmimet. Për prapavijë, fillim me nxënia imituese dhe nxënia imituese në SO-100; për një ekzekutim të parë, ekzekuto politikën tuaj të parë është rruga më e shkurtër.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started