
Parasts DAgger lūdz cilvēku marķēt stāvokļus, kamēr robots joprojām brauc. Uz īsta aparāta tas nav draudzīgi un rada zems kvalitātes marķes. Vārti varianti aizstāj aklās etiķetēšanas ar vārtiem, kurus kāds ir spiests turēt: cilvēks HG-DAgger, drošības klasifikators SafeDAgger, ansambļa neatbilstība EnsembleDAgger, budžetēta novitāte un riska novērtējums ThriftyDAgger. Šis raksts tos salīdzina pēc tā, kas ir vārti īpašnieks, kāds signāls tos atver un cik maksā katrs — un kāpēc cilvēka vārti veids ir tas, kurš izdzīvo kontaktu ar īstu roku.
Klonēta politika neveiksmējas, kur to apmācības dati izsīkuši. Risinājums ir turpināt datu savākšanu zem politikas pašas stāvokļa sadalījuma, nevis demonstratora, ko dara DAgger un ko ievads datu agregēšanā sedzas no pirmajiem principiem. Tas pamet atvērts neērto algoritma daļu: kamēr mācītājs brauc, ekspertam ir jāsaka, ko viņi būtu darījuši, katram stāvoklim, neņemot vadību.
Simulatorā ar skriptu ekspertu tas ir bezmaksas. Uz galda ar īstu roku uz tā tas nav ne bezmaksas, ne draudzīgi. HG-DAgger autori precīzi formulē iebildumu: šādi paraugu ņemšanas shēmas "prasa ekspertam sniegt darbības marķes bez pilnīgas sistēmas vadības", kas "var samazināt drošību un, izmantojot cilvēkus kā ekspertus, iespējams, pasliktinās savākto marķu kvalitāti, jo tiek uztverti darbības kavēšanās" (Kelly et al., 2019). Divi kļūmes slēpjas šajā teikumā: politika turpina braukt stāvokļos, kuros neviens to nevēlas, un marķes, kas nopirktas ar šo risku, ir sliktākas nekā tās, ko cilvēks rada, turot vadību. Katrs zemāk minētais variants atbild uz tādu pašu jautājumu — likties uz vadību un ļaut kādam lemt, kad tas tiek atvērts. Viņi atšķiras ar to, kurš šis kāds ir.
Īsā versija
- •Vārti varianti aizstāj aklās etiķetēšanas ar slēdzi starp politikas vadību un eksperta vadību. Tas, kas tos atšķir, ir tas, kurš ir slēdži īpašnieks.
- •HG-DAgger dod slēdzi cilvēkam un apkopo tikai datus, kas ierakstīti, kamēr cilvēks bija nepārtraukta vadība.
- •SafeDAgger dod to binārajam klasifikatoram, kas parāda novirzi no atsauces politikas; EnsembleDAgger prasa zemu ansambļa dispersiju un nelielu attālumu līdz eksperta darbībai vienlaikus.
- •LazyDAgger pievieno histerēzi, lai vadība nepīkstoņa; ThriftyDAgger vārti uz novitāti vai aprēķinātiem riskiem, ja ir skaidrs intervencijas budžets.
- •Robota vārti signāli var nepieciešamies kaut kas, kas smalkaj kalibrētai VLA uz hobija klases rokas parasti pietrūkst: atsauces politika, lēta ansambļa, vai kalibrēts epistēmisks nenoteiktums.
- •Vārti ir puse no metodes. Kas notiek intervencijas segmentiem pēc tam — sajaukt, svērt, apkopot — izlemj, vai kārta uzlaboja kaut ko.
Cilvēka vārti un robota vārti: dalījums, kas ir svarīgs
Interaktīvai imitācijas mācīšanai ir sava apsekojums; Celemin un kolēģi katalogē to pēc atsauksmes veida, saskarnes, mācību modeļa, lietotāja pieredzes, lietojuma un salīdzinājuma. Dalījums, kas izlemj jūsu inženieriju, ir vienkāršāks nekā jebkuri no tiem asīm, un neseņš darbs to nosauc tieši: metode ir cilvēka vārti kad pārraugs izlemj, kad iejaukties, un robota vārti kad aģents izlemj, kad prasīt palīdzību (Cai et al., 2025). Viss pārējais ir mehānika, kas kalpo vienam no tiem diviem izvēlēm. Tirdzniecības ir redzama no sākuma: cilvēka vārti maksā nepārtrauktus uzmanību, un robota vārti solās atdot šo uzmanību atpakaļ — bet tikai, ja signāls, uz ko tas vārti ir uzticams, un veidojot šo signālu ir sava pētniecības problēma.
SafeDAgger: klasifikators, kas parāda savu novirzi
Zhang un Cho SafeDAgger (2016) ir agrīnākais no šiem vārtiem. Atsauces politikas vaicāšana ir dārga daļa, tāpēc otrais, mazs tīkls — drošības politika — parāda, vai vaicāšana vispār ir tā vērta. Tā "atgriež bināro marķi, norādot, vai primārā politika var novirties no atsauces politikas bez tās vaicāšanas". Marķe tiek definēta pret kvadrātveida L2 novirzi starp divu politiku darbībām ar sliekšņa tau, un klasifikators tiek pielāgots ar bināro krustentropiju. Palaides laikā tas izlemj katram stāvoklim, vai mācītājs turpina braukt vai atsauce pārņem. Rezumē ziņo par mazākiem atsauces vaicājumiem automašīnu sacensību simulatorā, kā arī konverģences ātruma palielināšanu, ko autori attiecina uz automātisku mācību efektu, nesniedz skaitli ne vienam ne otram.
Šķelts ir definīcijā, nevis rezultātos. Klasifikatora apmācīšana prasa atsauces politikas darbību uz katra stāvokļa, kas tiek izmantots tā pielāgošanai, kas pieņem, ka atsauce ir vēl viens programma. Ja jūsu atsauce ir persona ar vadošo roku, šis marķu kopums nav lēts un metode zaudē īpašību, uz kuru tā bija paredzēta.
EnsembleDAgger: šaubas un neatbilstība, abi
Menda, Driggs-Campbell un Kochenderfer (2019) uzskatīt vārtus par varbūtisku jautājumu. EnsembleDAgger "tuvina Gausa procesu, izmantojot neironu tīkla ansambli" un lasa ansambļa dispersiju kā pārliecības starpniku: augsta dispersija nozīmē apgabalu, kas atšķiras no apmācības datiem, kas — pieņemot, ka eksperts izvairās no kļūmi stāvokļiem — korelē ar tuvumu kļūmi. Noteikums ir saskaitīšana. Mācītājs drīkst rīkoties tikai tad, ja L2 attālums starp tā vidējo darbību un eksperta darbību paliek zem viena sliekšņa (neatbilstība) un tā paredzētās darbības dispersija paliek zem otrā (šaubas). Ja kāds no tiem neizdodas, eksperts pārņem vadību. Mērķis ir maksimizēt mācītāja darbību daļu, vienlaikus ierobežojot kļūmi varbūtību; dokumentā tiek ziņots par uzlabotu drošību un mācīšanu pret citiem DAgger variantiem uz invertēta svārsta un MuJoCo HalfCheetah.
Tas klusēdams diskvalificē pilno noteikumu par bezmaksas uzraudzību. Attālums starp mācītāja darbību un eksperta darbību prasa eksperta darbību tajā stāvoklī, tajā brīdī. Ar skriptu ekspertu, labi. Ar cilvēku, cilvēks ir jāsagatavo darbības nepārtraukti — tieši tas slogs, kurā vārti varianti bija paredzēti, lai noņemtu. Šaubas termins viens ir bezmaksas; saskaitīšana nav.
LazyDAgger: apturēt slēdzi no čikstoņa
Hoque un kolēģi (2021) uzbruka izmaksām, kuras agrākās dokumenti nemērīja: pats slēdzis. Katra intervencija "traucē citu darbu, ko cilvēks dara, ietekmē latenci ar katru konteksta slēdzi starp pārraugs un autonomu vadību, un prasa laiku, lai to veiktu". Vārti, kas atvēras un aizveras desmit reizes minūtē, ir sliktāki nekā tie, kas atver vienu desmit sekundēm, identiskas autonomas daļas gadījumā. LazyDAgger paplašina SafeDAgger ar asimetriskiem slieksņiem — grūtāk ienākt pārrauga vadībā nekā palikt tajā — tāpēc sistēma nesvārstās robežā. Simulācijā tā "var samazināt konteksta slēdžus par vidēji 60% pār SafeDAgger uz 3 nepārtrauktām vadības uzdevumiem, saglabājot mūsdienīgo politikas sniegumu"; audekla manipulācijā ar ABB YuMi tā "samazina konteksta slēdžus par 60%, vienlaikus sasniedzot par 60% augstāku veiksmes koeficientu nekā SafeDAgger izpildes laikā".
ThriftyDAgger: novitāte vai risks, zem budžeta
ThriftyDAgger (Hoque et al., CoRL 2021) sākas no pārraugs budžeta, nevis politikas. Tā "izmanto iemācītu slēdža politiku, lai lūgtu intervencijas tikai stāvokļos, kas ir pietiekami (1) jauni, kur robota politikai nav atsauces uzvedības, ko imitēt, vai (2) riski, kur robotam ir zems uzticēšanās uzdevuma pabeigšanai", ar jaunu riska novērtēšanas metriku. Budžets ir ieguldījums, nevis iznākums: jūs norādāt, cik daudz cilvēka laika jūs tērēsit. Izpildlaikus lietota metode "sasniedz 100% veiksmes koeficientu gan simulācijas, gan fiziskajos uzdevumos", un lietotāja pētījums ar desmit dalībniekiem, kontrolējot trīs robotu flotilu līdzās koncentrācijas uzdevumam, ziņo, ka tas "palielina cilvēka un robota sniegumu attiecīgi par 58% un 80%, salīdzinot ar nākamo labāko algoritmu, vienlaikus samazinot pārraugs slodzi". Flotiles iestatījums ir šī darba dabiskā māja; Fleet-DAgger vēlāk formalizēja interaktīvo floti mācīšanu ar vairākiem robotiem un uzraugiem, piedāvājot Cilvēka pūļu atgriešanos kā vienlīdzību, ko optimizēt.
HG-DAgger: cilvēks turēs vārtus
Kelly et al. (2019) iet otrā puse. Nav slēdža politikas. Mācītājs tiek izkļauts "līdz ekspertam novēro, ka iesācējs ir ienācis stāvokļa telpu nav draudzīgā apgabalā", kad eksperts pārņem vadību un vada sistēmu atpakaļ. Agregācijas noteikums ir stingra daļa: "Eksperta darbības marķes tiek savāktas un pievienotas datu kopai tikai šo atkopšanas trajektoriju laikā, kurās cilvēka ekspertam bija nepārtraukta sistēmas vadība." Nekas netiek marķēts, kamēr cilvēks ir skatītājs.
Tas neko neapstājas slēdzis. HG-DAgger arī "mācās drošības sliekšņa drošības riska rādītāja modeļa nenoteiktībai, kas var tikt izmantots, lai paredzētu pilnībā apmācītā iesācēja sniegumu dažādos stāvokļa telpe apgabalos": tas reģistrē, cik nenoteikts mācītājs bija brīžos, kad cilvēks iejaucās un vidējie lielumi pēdējās ceturtdaļas no tiem ierakstiem, kur mācītājs visvairāk atgādina savu galīgo formu. Tas nav vārti, ko robots darbina, bet diagnostika, kas saka jums, kur pabeigto politiku novēro. Novērtējums aptver imitētu un reālās vadības uzdevumu un ziņo par uzlabotu sniegumu pār DAgger un uzvedības klonēšanu.
Viena saistīta līnija maina to, kas tiek skaitīts kā marķe. Spencer un kolēģi Expert Intervention Learning turpina, ka "jebkura eksperta atsauksme, neatkarīgi no intervencijas vai tās neesamības, sniedz informāciju par pašreizējā stāvokļa kvalitāti, darbības optimalitāti, vai abiem", formalizēta kā ierobežojums uz mācītāja vērtības funkciju un atrisināta bez apmierinājuma tiešsaistes mācīšanas. Zem šīs lasīšanas nosegumi, kur cilvēks skatījās un neko nedara, ir vāju pozitīvu pierādījumu, nevis tukšu. EIL mācās sadursmes mazināšanu no apmēram vienas minūtes eksperta vadības.

Varianti blakus
| Metode | Kurš atver vārtus | Signāls | Nepieciešams pieejams | Ziņots |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Neviens — mācītājs vienmēr brauc | Neviens; eksperts marķē katru apmeklēto stāvokli | Eksperts, kas spēj marķēt ārpus politikas stāvokļus, kamēr nav vadības | Nekāds apmierinājums samazinājums ar garantijām zem mācītāja stāvokļa sadalījuma |
| HG-DAgger (Kelly et al., 2019) | Cilvēka pārraugs | Pārraugs spriedums, ka stāvoklis nav draudzīgs | Kāds skaties, un tīra vadības pārraugs | Pārspēj DAgger un uzvedības klonēšanu uz imitētas un reālās vadības uzdevuma; arī māca riska sliekšņi |
| SafeDAgger (Zhang & Cho, 2016) | Robots | Binārais klasifikators L2 novirzei no atsauces virs tau | Vaicājama atsauces politika klasifikatora marķes | Mazāk atsauces vaicājumi sacensību simulatorā, ātrāka konverģence (nav skaitļa) |
| EnsembleDAgger (Menda et al., 2019) | Robots | Ansambļa dispersija un attālums līdz eksperta darbībai, abi zem sliekšņa | Neironu tīkla ansambļa plus eksperta darbības katrs solis | Uzlabota drošība un mācīšana uz svārsta un HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robots, ar histerēzi | SafeDAgger signāls ar atsevišķiem ierakstīšanās un iziešanas slieksņiem | Ko SafeDAgger nepieciešams, plus otrais sliekšnis, lai mainītu | ~60% mazāk konteksta slēdži uz 3 uzdevumiem; 60% augstāka veiksme uz YuMi audekla |
| ThriftyDAgger (Hoque et al., 2021) | Robots, zem budžeta | Novitāte vai aprēķinātais risks, nepabeigtas uzdevums | Iemācīts riska novērtētājs un norādīts intervencijas budžets | 100% veiksme izpildlaiku; lietotāja pētījums (N=10): 58% un 80% ieguvumi pār nākamo labāko |
| EIL (Spencer et al., 2020) | Cilvēks — neesamība arī skaita | Intervencija un tās neesamība kā ierobežojumi uz vērtības funkciju | Tiešsaistes nekāds apmierinājums samazinājums vērtības ierobežojums | Sadursmes mazināšana no apmēram vienas minūtes eksperta vadības |
Ko katrs vārti nopērk, un cik tas maksā
Lasot leju "nepieciešamas" kolonna un motīvs izkrīt: katrs robota vārti signāls tur ir starpniku, kas ir jāveido, un katrs starpniks ir sava rēķins.
- Neatbilstības signāli (SafeDAgger, LazyDAgger, puse no EnsembleDAgger noteikuma) nepieciešama atsauces politika. Vai jums ir skriptu eksperts, šajā gadījumā interesanta problēma jau ir atrisināta, vai cilvēks turpina ražot darbības fonā, lai var apkopot attālums.
- Šaubas signāli nepieciešama kalibrēts epistēmisks nenoteiktums. Neironu tīkla ansambļa mazā vadības tuvina to; ansambļa trim miljardu parametru redzeslīmeņa valodas darbības modelis ir atmiņas un latences problēma pirmā.
- Novitāte un riska signāli nepieciešama iemācīts novērtētājs par uzdevuma pabeigšanu, pielāgots par pietiekama un neveiksmīga izkļaušanu. Uz uzdevuma jūs vēl tiek darīt darbs, ka dati nav pastāv pirmo kārtu.
- Cilvēka vārti nepieciešama uzmanības un nekas cits — vienīgais signāls, kas pieejams pirmajā dienā, uz jebkura politikas arhitektūra, ar nav papildu modeļa, lai apmācītu.
- Nav robota vārti noņem cilvēku no istabas. Viņi samazina cik bieži cilvēks ir jādarbojas, nevis vai viņi jābūt klāt.
Ir klusāks atšķirības ko vārti rada. Robota vārti šaušana vidus trajektorijas handes persona pārvietojamais roku uz patvaļīga salocīt. Cilvēka vārti ļauj operatoram izvēlēties brīdi — pēc iestāšanās, pirms grasps, ne vidū švītra. Atkopšana segmentiem no diviem nav vienlīdz tīri, un tiem segmentiem ir visa kārtas produkts.
Kāpēc cilvēka vārti veids uzvar uz īsta aparāta
Šī ir inženieri arguments, nevis salīdzinājums rezultāts — bez dokumenta mēs atradām palaisto visu piecus vārtus uz tādu pati manipulatoru ar tādu pašu politikas klasu. Tas balstās uz četriem punktiem.
Pirmkārt, pārraugs ir klāt tāpat jau. Neviens neatstāj SO-100 roku palaista neuzraudzīta blakus objektiem, ko tas var nokaut. Tiklīdz kāds uzrauga, uzmanu jāļauj operatoram dot tiem pārvērtības pogu ir tuvu nullei; veidošanai kalibrēts riska novērtētājs ir projekts.
Otrkārt, nenoteiktums jūs var faktiski mēra uz mūsdienīgās politikas bieži ir nepareiza lielums. Difūzijas vai plūsmas atbilstības galva dod dispersiju pāri paraugu darbības gabali, un šī dispersija atspoguļo multimoda galvu bija apmācīta pārstāvēt, nevis epistēmisks neziņa par stāvokli. EnsembleDAgger šaubas termins izmanto ansambļa tieši, lai uztvertu pēdējo. Divi izskatās tāds pats skaitlis un nav; darbības apkopošana un plūsma atbilstība ieraksti sedzas kā tiem galvām izlaist darbības pirmā vieta.
Treškārt, kļūmes, kas mācīšanu manipulāciju bieži ir semantisks nevis statistiski neparasts. Politika aizvēršanas gribas divi centimetri agri, vai pasniegšana ticīgi par nepareizo divas identiskas kubi, nav augsta-dispersija stāvoklī — tas ir ticīgs un nepareizi. Nav dispersija sliekšnis notvert to; persona skatiens notver to nekavējoties.
Ceturtais, marķe kvalitāte — oriģināla HG-DAgger punkts, un viens, kas bieži tiek izlaists. Marķes savākts kamēr cilvēks ir nepārtraukta vadības pārspēj marķes izrunātas pāri pārvietojamā sistēma. Ja mērķis ir koriģētā dati vērts apkopošana, slogu pierādījuma ir ar automātisku vārti.
Attēls pagrieziens kad viens pārraugs ir atbildīgs par daudziem robotiem — režīmu ThriftyDAgger lietotāja pētījums un Fleet-DAgger formalizācija mērķis. Ar flotili, cilvēka uzmanības ir retā resurss un neperfekta sadalījums pārspēj neviens. Ar vienu roku uz vienas galda, jūs neesat tajā režīmā.
Cilvēka vārti cilpa, jau par stieņiem
Pārvērtības laikā palaidi sekciju, par-frame intervencijas karogu uz koriģētas segmentiem, kurējot katra palaisi uz koriģētās vai novērtējuma, komponējot jaukta datu kopā no avotiem jūs izvēlaties, un turpinājuma apmācības no eksistējošas kontrolpunkta ir uzbūvēti, nevis skriptēti ar roku. Pārvērtības darbi ar vadošo roku, vai ar tastatūru un slīdņiem ja jums nav viena.
Skatīt, kā DAgger cilpa tiek palaistaVārti ir puse no metodes; datu pastrādes ir otrā puse
Vārti izlemj kuri kadri cilvēks brauca, ne ko darīt ar tiem, un to otru lēmumu ir kur kārtas ir bieži tiek miskasts. Pirmā noteikums ir viens D DAgger nozīmē: apkopot, nevis aizstāt. Fīns-tuning a kontrolpunkts tīrā desmit gadiem koriģējums kadri sniedz jums modelis, kas ir redzējuši gandrīz nekas bet atkopšanas un ir aizmirsuši nomināls trajektorija.
Otrā noteikums ir tas, ka intervencija kadri nav parastie kadri. Mandlekar et al. veidots tāla-teleopērācijas sistēma par 6-DoF manipulāciju pieļaujot operatoriem uz uzraugs politikas un paņemt vairāk par kļūmi, tad apmācīti atkārtoti ar algoritmu, kas "mudina politiku uz mācās kā šķērsot sašaurināti caur intervencijas"; aģenti apmācīti uz tiem dati pārspēja aģentiem apmācīti uz vienādu skaitu parastie demonstrācijas paraugi. Sirius grūdis ideja ievietošanu, "pārsvarošana apmācības paraugi ar tuvinātu cilvēka pārliecības un optimizējot politikas ar svērtiem uzvedības klonēšanu". Abi nepieciešama par-frame marķis ko bija cilvēks-brauca, kā kāpēc intervencija karogs skaita vairāk nekā tas izskatās.
Trešā noteikums ir ka automātiski jaukšanu ir slazds. Komponēta datu kopā, kuru avotus jūs nevarat uzskaitīt ir viena jūs nevarat atkļūdot kad nākamo kārtu iegūst sliktāks. Uz šīs platformas sakompilēts solis ir skaidrs tāpēc — oriģināls datu kopā plus koriģējumi, episodu atlase par avotu, un rezultāts ir parastā LeRobot datu kopā ka sinhronizācija un trenē, tāpat kā jebkurš cits; datu kopas dokumentācija sedzas formāts pusē.
| Solis kārtā | Kas tas rada | Visvairāk izplatīts ceļš tas notiek nepareizi |
|---|---|---|
| Palaidiet secinājumu ar ierakstīšanu uz | Palaidi zem politikas pašas stāvokļa sadalījuma | Ierakstīts kā parasts teleopērācijas, pazaudējot to politika bija brauca |
| Paņemt vairāk par kļūmi | Koriģējums segmentiem ar par-frame intervencijas karogs | Koriģējums kosmētisku vibriņš, pasniegšana stils nevis atkopšanu |
| Kurējums katra episodu | Koriģējumi, novērtējums, vai atmet | Saglabājot visu; iškrāpts pārvērtības maksas vairāk nekā episodu bija vērts |
| Sinhronizācija koriģējumi | Versijēts datu kopā, kur oriģināls | Koriģējumi, ka nekad atstāj vietējā mašīna |
| Komponējums jauktā datu kopā | Oriģināls un koriģējumi, skaidri atlase | Kluss auto-jaukšanu, tā vēlāka regresija nevar vieta uz avotiem |
| Turpinājums no kontrolpunkts | Kontrolpunkts sākt no iepriekšējā | Gaidot optimizators atsākt; svari sākt modelis, viņi neatgriež optimizators valsts |
Iestatīt vārti persona var faktiskā turēt
"Cilvēks izlemj" nav specifikācija. Divi operatori ar atšķirīgu slieksņiem radīt nesakritīgas kārtas, un drifta sliekšņa rada trend jūs nevarat lasīt. Rakstīt izpalaidumos zem pirmā kārtā.
- Nosauciet nosacījumi, kas atver vārtus — iestāšanās ārpus vairāk nekā fiksēts mala, grib aizvēršanu uz neko, savienojuma drifts pret ierobežojums, rūklis vairāk, nekā otrais vai divi — un saglabāt saraksts nemainīts kārtai.
- Nosauciet ko neatver viņu. Overshooting politika atkopjas no pati par sevi ir apmācības signāls; paņemot vairāk par vietu izdzēš atkopšanu tas jau ir uz prāts.
- Paņemt vairāk agri pietiek par tīra pārvērtības, roka atpakaļ tiklīdz valsts ir atkopjams.
- Žurnāls, kāpēc paņemat vairāk, par episodu. Trīs kārtās vēlāk tas ir vienīgais ieraksts no vai tas pats kļūmi atgriež.
- Turēt kameras, uzdevums tekstu un operators nemainīgs pāri kārtās. Mainīt vienu un skaitļi pārstāj būt salīdzināma.
Mehāniski pārvērtības ir divi varianti. Ar vadošo roku, vadošo ir jāsasniedz sekotāju pašreizējā sastiprināt pirms griezes nozare, vai roku lēcieni; šis izlīdzinājums solis ir mazākais-testēti daļa no ķēdi uz īsta aparāta. Bez vadošo roku pārvērtības ir manuāl no pirmā klavatūras: sekotājs tiek turēts un operators nudgies to savienojums pa savienojums no tastatūra vai vilkši slīdņiem, ar servera-puse spīles katra ievade mazs — pāris grādi katrs klavatūra, pāri rokas uz slīdnis, jo liels solis uz turēts sastiprināt ir kā jūs slīpēt servo. Solis-pa-soļa versija ar klavatūra saistības ir iet caur DAgger kārtai uz SO-100; fons uz abi teleopērācijas režīmi ir teleopērācijas dokumenti un vadošo-sekotāja ieraksts.

Lasot vai vārti guva iespēja
Metrika no cilvēka vārti kārtai ir intervencija likme: intervencija kadri sadalīti par kadri kārtai. Tā ir vienu darbu — ja tas nenokrīt pāri kārtās, kārtai nopirka neko, un nākamo vienu jāmaina kaut kas cits nekā datu summu.
Tā ir neobjektīvā metrika un jūs jāzina kā. Tā mēra operatora sliekšņa tik daudz kā politikas kompetences, tas ir, kāpēc izpalaidumi saraksts paliek fiksēti; operators, kas relaksē pāri sesiju rada padussarakas līkne ar neko aiz tā. Tas arī novēro smagumu — desmit kadri apstājas sadursme un desmit, lai nudge grasp izskatīties identisks. Pāri tā ar fiksētu novērtējums kopā nav koriģējums dati bija vienmēr izdarīts no. Raksts uz mērīšanu DAgger cilpa darbi cauri novērtējums koncepcija, tostarp, kā turēt novērtējums episodas ārpus apmācības jaukt.
- Darbi uz dienu viens, uz jebkura politikas arhitektūra, ar nav papildu modelis, lai kalibrēt
- Notver ticīgs-un-nepareizs kļūmes nav dispersija sliekšnis noteikt
- Rada koriģējumi ierakstīts, kamēr operators bija pilna kontrole, uz brīdi viņi izvēlējies
- Ražo par-frame marķis ka intervencija-svērtiem metodes, tāpat kā IWR un Sirius patēriņu
- Maksās nepārtrauktas uzraudzību; tas nav skala, viens cilvēks un daudz robotiem
- Ir atkarīgs no operators konsekvencē — drifta sliekšņa corruptas intervencija likme
- Rada nav riska modelis sevi; HG-DAgger iemācīts sliekšņa un ThriftyDAgger novērtētājs ir papildu mehānika
- Skaita kadri, ne sekas
- Nevar glābt politika, kuru kļūmi ir augšupejošo kontrole, tāpat kā samainīts kamera, vai salduks marķēts uzdevums virkne
Jautājumi par atvertu vērts, lai paturētu skats
Salīdzinājumi ir vāji. Spencer un kolēģi pārbaudīta tie uz testa imitācija mācīšanu pieejas un atraduši viņi "realizējams un vienkāršs un tādējādi nepietiekams, lai notvert grūtāks režīmi, no kļūdi compounding redzēt īstā-pasaulē lēmuma veikšanu problēmas" — un pret apkārtējais literatūra, atradu parasts uzvedības klonēšanu tevi labi uz tiem. Tas ir iemesls, lai būt skeptisks par jebkura izlīdzinājuma DAgger varianti atpūtā uz tiem uzdevumiem, tostarp daži skaitļi iepriekš tabulā.
Robots vārti uz lielas politikas nav atrisināti arī. AIM darbs aizstāj nenoteiktums ar starpniku Q-funkcija mīmvīdējat cilvēka intervencija noteikums un ziņo 40% uzlabošanu brīvo-vairākus izmaksas un apmācības efektivitāte pār ThriftyDAgger — nepārtraukts un diskrēts kontrole, ne uz redzeslīmeņa valodas darbības modelis brauca manipulatoru. Vai jebkura no šiem vārtiem pārsūtīt uz fīns-kalibrēts VLA ir atvertu. Apsekojums padara saistīts punkts: lauka terminoloģija un struktūra nav vienoja pāri literatūra, kas padara metodes grūti salīdzināt. Uz sava roku, jūsu žurnāli ir pierādījums jums ir.
Ir HG-DAgger patiešām DAgger ja cilvēks tikai marķes laikā intervencijas?▾
Tas turpina daļu, ka svarīgs — dati savākti zem stāvokļa sadalījuma mācītājs izsauc, apkopota ar ko nāca pirms — un nometj daļu, ka neizdodas kontaktu ar aparātu. Kelly et al. prezentāt to kā variantu; 2011 nekāds apmierinājums garantija nepārnese pāri nemainītu.
Var es izmantot robota vārti uz fīns-kalibrēts VLA politika uz SO-100?▾
Nav vienkārši. SafeDAgger klasifikators nepieciešama vaicājama atsauces politika jums nav. EnsembleDAgger nepieciešama ansambļa, kura daudzmiljardu-parametru modelis nozīmē vairākas kopijas atmiņā plus viņu secinājums izmaksas. ThriftyDAgger nepieciešama riska novērtētājs pielāgots uz sekmīgs un neveiksmes, ka nepastāv pirms jūsu pirmā kārtās.
Cik ilgi viena pārvērtības jābūt?▾
Pietiekami garš, lai sasniegtu stāvokli politika var turpināt no, un ne ilgāk: paplašināts pārvērtības pagrieziet kārtai uz demonstrācijas sesija un plūdi koriģējums kopā ar nomināls uzvedība. LazyDAgger konstatējums, ka kailās cits ceļš pāri — daudzas ļoti īss slēdži ir viņu pašu izmaksas.
Jāapmāca tikai uz koriģētas segmentiem?▾
Nē — tas ir visvairāk izplatīts ceļš miskasts kārtai. Modelis fīns-kalibrēts tikai uz atkopšanas ir redzējuši gandrīz nekas bet atkopšanas. Jaukt koriģējumi uz oriģināls datu kopā ar avotiem izvēlēts skaidri; iet tālāk, izskatīties intervencija-svērtiem pieejas, tāpat kā IWR vai Sirius, kuri uz-svars cilvēks-brauca kadri nevis izolējot tiem.
Ko, ja intervencija likme nenokrīt pēc kārtai?▾
Paņemt to uz sejas vērtību: kārtai nemācīja. Pirms pievienošana koriģējumi, pārbaudīt lētāku skaidrojumi — guva operators sliekšņa drifts, vai koriģējumi kosmētisku, guva komponēts datu kopā faktiski satur viņi, guva apmācības sāk no paredzētais kontrolpunkts. Kārtai, ka klusēdams sāka no pamatne modelis izskatās tieši kā kārtai, ka neizdevās mācīties.
Ko nē-intervencija tūkstoškaņņu?▾
Zem Expert Intervention Learning, jā: nosegumi kur pārraugs skatījās un nenoteic, ka ir lasīt, kā vāju pierādījums, ka valsts un darbības bija pieņemama, formalizēta kā ierobežojums uz vērtības funkciju. Vairākumā praktiski cauruļvadi, tostarp šī, marķis tikai, ko cilvēks brauca.
Par vienu roku, uz galda izvēli tiek veikta: turēt vārti pats, rakstīt, ko atvērs viņu, un tērēt spēks uz datu pastrādes, lai tas nevis uz automātisks slēdzis. Platformas pusē ir aprakstīts uz DAgger cilpa lapa, apmācības iespējas katrs politikas ģimene zem apmācības un cenu. Fons, sākt ar imitācija mācīšanās un imitācija mācīšanās uz SO-100; par pirmā palaidi, palaist sava pirmā politika ir īsāks ceļš.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started