Operators piesraida robota roku ar teleopārācijas saskarni, rokas uz vadības un gatavs pārņemt
DAggerInteraktīvā imitācijas mācīšanāsHG-DAggerRobota politikasSO-100

HG-DAgger un vārti varianti: Kas lems, kad pārņemt robota politiku

AY-Robots ResearchAugust 27, 202615 min lasīšana

Parasts DAgger lūdz cilvēku marķēt stāvokļus, kamēr robots joprojām brauc. Uz īsta aparāta tas nav draudzīgi un rada zems kvalitātes marķes. Vārti varianti aizstāj aklās etiķetēšanas ar vārtiem, kurus kāds ir spiests turēt: cilvēks HG-DAgger, drošības klasifikators SafeDAgger, ansambļa neatbilstība EnsembleDAgger, budžetēta novitāte un riska novērtējums ThriftyDAgger. Šis raksts tos salīdzina pēc tā, kas ir vārti īpašnieks, kāds signāls tos atver un cik maksā katrs — un kāpēc cilvēka vārti veids ir tas, kurš izdzīvo kontaktu ar īstu roku.

Klonēta politika neveiksmējas, kur to apmācības dati izsīkuši. Risinājums ir turpināt datu savākšanu zem politikas pašas stāvokļa sadalījuma, nevis demonstratora, ko dara DAgger un ko ievads datu agregēšanā sedzas no pirmajiem principiem. Tas pamet atvērts neērto algoritma daļu: kamēr mācītājs brauc, ekspertam ir jāsaka, ko viņi būtu darījuši, katram stāvoklim, neņemot vadību.

Simulatorā ar skriptu ekspertu tas ir bezmaksas. Uz galda ar īstu roku uz tā tas nav ne bezmaksas, ne draudzīgi. HG-DAgger autori precīzi formulē iebildumu: šādi paraugu ņemšanas shēmas "prasa ekspertam sniegt darbības marķes bez pilnīgas sistēmas vadības", kas "var samazināt drošību un, izmantojot cilvēkus kā ekspertus, iespējams, pasliktinās savākto marķu kvalitāti, jo tiek uztverti darbības kavēšanās" (Kelly et al., 2019). Divi kļūmes slēpjas šajā teikumā: politika turpina braukt stāvokļos, kuros neviens to nevēlas, un marķes, kas nopirktas ar šo risku, ir sliktākas nekā tās, ko cilvēks rada, turot vadību. Katrs zemāk minētais variants atbild uz tādu pašu jautājumu — likties uz vadību un ļaut kādam lemt, kad tas tiek atvērts. Viņi atšķiras ar to, kurš šis kāds ir.

Īsā versija

  • Vārti varianti aizstāj aklās etiķetēšanas ar slēdzi starp politikas vadību un eksperta vadību. Tas, kas tos atšķir, ir tas, kurš ir slēdži īpašnieks.
  • HG-DAgger dod slēdzi cilvēkam un apkopo tikai datus, kas ierakstīti, kamēr cilvēks bija nepārtraukta vadība.
  • SafeDAgger dod to binārajam klasifikatoram, kas parāda novirzi no atsauces politikas; EnsembleDAgger prasa zemu ansambļa dispersiju un nelielu attālumu līdz eksperta darbībai vienlaikus.
  • LazyDAgger pievieno histerēzi, lai vadība nepīkstoņa; ThriftyDAgger vārti uz novitāti vai aprēķinātiem riskiem, ja ir skaidrs intervencijas budžets.
  • Robota vārti signāli var nepieciešamies kaut kas, kas smalkaj kalibrētai VLA uz hobija klases rokas parasti pietrūkst: atsauces politika, lēta ansambļa, vai kalibrēts epistēmisks nenoteiktums.
  • Vārti ir puse no metodes. Kas notiek intervencijas segmentiem pēc tam — sajaukt, svērt, apkopot — izlemj, vai kārta uzlaboja kaut ko.

Cilvēka vārti un robota vārti: dalījums, kas ir svarīgs

Interaktīvai imitācijas mācīšanai ir sava apsekojums; Celemin un kolēģi katalogē to pēc atsauksmes veida, saskarnes, mācību modeļa, lietotāja pieredzes, lietojuma un salīdzinājuma. Dalījums, kas izlemj jūsu inženieriju, ir vienkāršāks nekā jebkuri no tiem asīm, un neseņš darbs to nosauc tieši: metode ir cilvēka vārti kad pārraugs izlemj, kad iejaukties, un robota vārti kad aģents izlemj, kad prasīt palīdzību (Cai et al., 2025). Viss pārējais ir mehānika, kas kalpo vienam no tiem diviem izvēlēm. Tirdzniecības ir redzama no sākuma: cilvēka vārti maksā nepārtrauktus uzmanību, un robota vārti solās atdot šo uzmanību atpakaļ — bet tikai, ja signāls, uz ko tas vārti ir uzticams, un veidojot šo signālu ir sava pētniecības problēma.

SafeDAgger: klasifikators, kas parāda savu novirzi

Zhang un Cho SafeDAgger (2016) ir agrīnākais no šiem vārtiem. Atsauces politikas vaicāšana ir dārga daļa, tāpēc otrais, mazs tīkls — drošības politika — parāda, vai vaicāšana vispār ir tā vērta. Tā "atgriež bināro marķi, norādot, vai primārā politika var novirties no atsauces politikas bez tās vaicāšanas". Marķe tiek definēta pret kvadrātveida L2 novirzi starp divu politiku darbībām ar sliekšņa tau, un klasifikators tiek pielāgots ar bināro krustentropiju. Palaides laikā tas izlemj katram stāvoklim, vai mācītājs turpina braukt vai atsauce pārņem. Rezumē ziņo par mazākiem atsauces vaicājumiem automašīnu sacensību simulatorā, kā arī konverģences ātruma palielināšanu, ko autori attiecina uz automātisku mācību efektu, nesniedz skaitli ne vienam ne otram.

Šķelts ir definīcijā, nevis rezultātos. Klasifikatora apmācīšana prasa atsauces politikas darbību uz katra stāvokļa, kas tiek izmantots tā pielāgošanai, kas pieņem, ka atsauce ir vēl viens programma. Ja jūsu atsauce ir persona ar vadošo roku, šis marķu kopums nav lēts un metode zaudē īpašību, uz kuru tā bija paredzēta.

EnsembleDAgger: šaubas un neatbilstība, abi

Menda, Driggs-Campbell un Kochenderfer (2019) uzskatīt vārtus par varbūtisku jautājumu. EnsembleDAgger "tuvina Gausa procesu, izmantojot neironu tīkla ansambli" un lasa ansambļa dispersiju kā pārliecības starpniku: augsta dispersija nozīmē apgabalu, kas atšķiras no apmācības datiem, kas — pieņemot, ka eksperts izvairās no kļūmi stāvokļiem — korelē ar tuvumu kļūmi. Noteikums ir saskaitīšana. Mācītājs drīkst rīkoties tikai tad, ja L2 attālums starp tā vidējo darbību un eksperta darbību paliek zem viena sliekšņa (neatbilstība) un tā paredzētās darbības dispersija paliek zem otrā (šaubas). Ja kāds no tiem neizdodas, eksperts pārņem vadību. Mērķis ir maksimizēt mācītāja darbību daļu, vienlaikus ierobežojot kļūmi varbūtību; dokumentā tiek ziņots par uzlabotu drošību un mācīšanu pret citiem DAgger variantiem uz invertēta svārsta un MuJoCo HalfCheetah.

Neatbilstības termins prasa eksperta darbību

Tas klusēdams diskvalificē pilno noteikumu par bezmaksas uzraudzību. Attālums starp mācītāja darbību un eksperta darbību prasa eksperta darbību tajā stāvoklī, tajā brīdī. Ar skriptu ekspertu, labi. Ar cilvēku, cilvēks ir jāsagatavo darbības nepārtraukti — tieši tas slogs, kurā vārti varianti bija paredzēti, lai noņemtu. Šaubas termins viens ir bezmaksas; saskaitīšana nav.

LazyDAgger: apturēt slēdzi no čikstoņa

Hoque un kolēģi (2021) uzbruka izmaksām, kuras agrākās dokumenti nemērīja: pats slēdzis. Katra intervencija "traucē citu darbu, ko cilvēks dara, ietekmē latenci ar katru konteksta slēdzi starp pārraugs un autonomu vadību, un prasa laiku, lai to veiktu". Vārti, kas atvēras un aizveras desmit reizes minūtē, ir sliktāki nekā tie, kas atver vienu desmit sekundēm, identiskas autonomas daļas gadījumā. LazyDAgger paplašina SafeDAgger ar asimetriskiem slieksņiem — grūtāk ienākt pārrauga vadībā nekā palikt tajā — tāpēc sistēma nesvārstās robežā. Simulācijā tā "var samazināt konteksta slēdžus par vidēji 60% pār SafeDAgger uz 3 nepārtrauktām vadības uzdevumiem, saglabājot mūsdienīgo politikas sniegumu"; audekla manipulācijā ar ABB YuMi tā "samazina konteksta slēdžus par 60%, vienlaikus sasniedzot par 60% augstāku veiksmes koeficientu nekā SafeDAgger izpildes laikā".

ThriftyDAgger: novitāte vai risks, zem budžeta

ThriftyDAgger (Hoque et al., CoRL 2021) sākas no pārraugs budžeta, nevis politikas. Tā "izmanto iemācītu slēdža politiku, lai lūgtu intervencijas tikai stāvokļos, kas ir pietiekami (1) jauni, kur robota politikai nav atsauces uzvedības, ko imitēt, vai (2) riski, kur robotam ir zems uzticēšanās uzdevuma pabeigšanai", ar jaunu riska novērtēšanas metriku. Budžets ir ieguldījums, nevis iznākums: jūs norādāt, cik daudz cilvēka laika jūs tērēsit. Izpildlaikus lietota metode "sasniedz 100% veiksmes koeficientu gan simulācijas, gan fiziskajos uzdevumos", un lietotāja pētījums ar desmit dalībniekiem, kontrolējot trīs robotu flotilu līdzās koncentrācijas uzdevumam, ziņo, ka tas "palielina cilvēka un robota sniegumu attiecīgi par 58% un 80%, salīdzinot ar nākamo labāko algoritmu, vienlaikus samazinot pārraugs slodzi". Flotiles iestatījums ir šī darba dabiskā māja; Fleet-DAgger vēlāk formalizēja interaktīvo floti mācīšanu ar vairākiem robotiem un uzraugiem, piedāvājot Cilvēka pūļu atgriešanos kā vienlīdzību, ko optimizēt.

HG-DAgger: cilvēks turēs vārtus

Kelly et al. (2019) iet otrā puse. Nav slēdža politikas. Mācītājs tiek izkļauts "līdz ekspertam novēro, ka iesācējs ir ienācis stāvokļa telpu nav draudzīgā apgabalā", kad eksperts pārņem vadību un vada sistēmu atpakaļ. Agregācijas noteikums ir stingra daļa: "Eksperta darbības marķes tiek savāktas un pievienotas datu kopai tikai šo atkopšanas trajektoriju laikā, kurās cilvēka ekspertam bija nepārtraukta sistēmas vadība." Nekas netiek marķēts, kamēr cilvēks ir skatītājs.

Tas neko neapstājas slēdzis. HG-DAgger arī "mācās drošības sliekšņa drošības riska rādītāja modeļa nenoteiktībai, kas var tikt izmantots, lai paredzētu pilnībā apmācītā iesācēja sniegumu dažādos stāvokļa telpe apgabalos": tas reģistrē, cik nenoteikts mācītājs bija brīžos, kad cilvēks iejaucās un vidējie lielumi pēdējās ceturtdaļas no tiem ierakstiem, kur mācītājs visvairāk atgādina savu galīgo formu. Tas nav vārti, ko robots darbina, bet diagnostika, kas saka jums, kur pabeigto politiku novēro. Novērtējums aptver imitētu un reālās vadības uzdevumu un ziņo par uzlabotu sniegumu pār DAgger un uzvedības klonēšanu.

Viena saistīta līnija maina to, kas tiek skaitīts kā marķe. Spencer un kolēģi Expert Intervention Learning turpina, ka "jebkura eksperta atsauksme, neatkarīgi no intervencijas vai tās neesamības, sniedz informāciju par pašreizējā stāvokļa kvalitāti, darbības optimalitāti, vai abiem", formalizēta kā ierobežojums uz mācītāja vērtības funkciju un atrisināta bez apmierinājuma tiešsaistes mācīšanas. Zem šīs lasīšanas nosegumi, kur cilvēks skatījās un neko nedara, ir vāju pozitīvu pierādījumu, nevis tukšu. EIL mācās sadursmes mazināšanu no apmēram vienas minūtes eksperta vadības.

Robota roku darba telpa ar kamerām, kas novietotas datu savākšanai pārraudzītas politikas palaides laikā
Cilvēka vārti kārta ir parastā secinājuma palaiste ar ierakstītāju pievienotu. Kadri, ko operators brauca, tiek marķēti; pārējais paliek, kā tas bija.

Varianti blakus

MetodeKurš atver vārtusSignālsNepieciešams pieejamsZiņots
DAgger (Ross et al., 2011)Neviens — mācītājs vienmēr braucNeviens; eksperts marķē katru apmeklēto stāvokliEksperts, kas spēj marķēt ārpus politikas stāvokļus, kamēr nav vadībasNekāds apmierinājums samazinājums ar garantijām zem mācītāja stāvokļa sadalījuma
HG-DAgger (Kelly et al., 2019)Cilvēka pārraugsPārraugs spriedums, ka stāvoklis nav draudzīgsKāds skaties, un tīra vadības pārraugsPārspēj DAgger un uzvedības klonēšanu uz imitētas un reālās vadības uzdevuma; arī māca riska sliekšņi
SafeDAgger (Zhang & Cho, 2016)RobotsBinārais klasifikators L2 novirzei no atsauces virs tauVaicājama atsauces politika klasifikatora marķesMazāk atsauces vaicājumi sacensību simulatorā, ātrāka konverģence (nav skaitļa)
EnsembleDAgger (Menda et al., 2019)RobotsAnsambļa dispersija un attālums līdz eksperta darbībai, abi zem sliekšņaNeironu tīkla ansambļa plus eksperta darbības katrs solisUzlabota drošība un mācīšana uz svārsta un HalfCheetah
LazyDAgger (Hoque et al., 2021)Robots, ar histerēziSafeDAgger signāls ar atsevišķiem ierakstīšanās un iziešanas slieksņiemKo SafeDAgger nepieciešams, plus otrais sliekšnis, lai mainītu~60% mazāk konteksta slēdži uz 3 uzdevumiem; 60% augstāka veiksme uz YuMi audekla
ThriftyDAgger (Hoque et al., 2021)Robots, zem budžetaNovitāte vai aprēķinātais risks, nepabeigtas uzdevumsIemācīts riska novērtētājs un norādīts intervencijas budžets100% veiksme izpildlaiku; lietotāja pētījums (N=10): 58% un 80% ieguvumi pār nākamo labāko
EIL (Spencer et al., 2020)Cilvēks — neesamība arī skaitaIntervencija un tās neesamība kā ierobežojumi uz vērtības funkcijuTiešsaistes nekāds apmierinājums samazinājums vērtības ierobežojumsSadursmes mazināšana no apmēram vienas minūtes eksperta vadības

Ko katrs vārti nopērk, un cik tas maksā

Lasot leju "nepieciešamas" kolonna un motīvs izkrīt: katrs robota vārti signāls tur ir starpniku, kas ir jāveido, un katrs starpniks ir sava rēķins.

  • Neatbilstības signāli (SafeDAgger, LazyDAgger, puse no EnsembleDAgger noteikuma) nepieciešama atsauces politika. Vai jums ir skriptu eksperts, šajā gadījumā interesanta problēma jau ir atrisināta, vai cilvēks turpina ražot darbības fonā, lai var apkopot attālums.
  • Šaubas signāli nepieciešama kalibrēts epistēmisks nenoteiktums. Neironu tīkla ansambļa mazā vadības tuvina to; ansambļa trim miljardu parametru redzeslīmeņa valodas darbības modelis ir atmiņas un latences problēma pirmā.
  • Novitāte un riska signāli nepieciešama iemācīts novērtētājs par uzdevuma pabeigšanu, pielāgots par pietiekama un neveiksmīga izkļaušanu. Uz uzdevuma jūs vēl tiek darīt darbs, ka dati nav pastāv pirmo kārtu.
  • Cilvēka vārti nepieciešama uzmanības un nekas cits — vienīgais signāls, kas pieejams pirmajā dienā, uz jebkura politikas arhitektūra, ar nav papildu modeļa, lai apmācītu.
  • Nav robota vārti noņem cilvēku no istabas. Viņi samazina cik bieži cilvēks ir jādarbojas, nevis vai viņi jābūt klāt.

Ir klusāks atšķirības ko vārti rada. Robota vārti šaušana vidus trajektorijas handes persona pārvietojamais roku uz patvaļīga salocīt. Cilvēka vārti ļauj operatoram izvēlēties brīdi — pēc iestāšanās, pirms grasps, ne vidū švītra. Atkopšana segmentiem no diviem nav vienlīdz tīri, un tiem segmentiem ir visa kārtas produkts.

Kāpēc cilvēka vārti veids uzvar uz īsta aparāta

Šī ir inženieri arguments, nevis salīdzinājums rezultāts — bez dokumenta mēs atradām palaisto visu piecus vārtus uz tādu pati manipulatoru ar tādu pašu politikas klasu. Tas balstās uz četriem punktiem.

Pirmkārt, pārraugs ir klāt tāpat jau. Neviens neatstāj SO-100 roku palaista neuzraudzīta blakus objektiem, ko tas var nokaut. Tiklīdz kāds uzrauga, uzmanu jāļauj operatoram dot tiem pārvērtības pogu ir tuvu nullei; veidošanai kalibrēts riska novērtētājs ir projekts.

Otrkārt, nenoteiktums jūs var faktiski mēra uz mūsdienīgās politikas bieži ir nepareiza lielums. Difūzijas vai plūsmas atbilstības galva dod dispersiju pāri paraugu darbības gabali, un šī dispersija atspoguļo multimoda galvu bija apmācīta pārstāvēt, nevis epistēmisks neziņa par stāvokli. EnsembleDAgger šaubas termins izmanto ansambļa tieši, lai uztvertu pēdējo. Divi izskatās tāds pats skaitlis un nav; darbības apkopošana un plūsma atbilstība ieraksti sedzas kā tiem galvām izlaist darbības pirmā vieta.

Treškārt, kļūmes, kas mācīšanu manipulāciju bieži ir semantisks nevis statistiski neparasts. Politika aizvēršanas gribas divi centimetri agri, vai pasniegšana ticīgi par nepareizo divas identiskas kubi, nav augsta-dispersija stāvoklī — tas ir ticīgs un nepareizi. Nav dispersija sliekšnis notvert to; persona skatiens notver to nekavējoties.

Ceturtais, marķe kvalitāte — oriģināla HG-DAgger punkts, un viens, kas bieži tiek izlaists. Marķes savākts kamēr cilvēks ir nepārtraukta vadības pārspēj marķes izrunātas pāri pārvietojamā sistēma. Ja mērķis ir koriģētā dati vērts apkopošana, slogu pierādījuma ir ar automātisku vārti.

Kur robota vārti maksā kritumā

Attēls pagrieziens kad viens pārraugs ir atbildīgs par daudziem robotiem — režīmu ThriftyDAgger lietotāja pētījums un Fleet-DAgger formalizācija mērķis. Ar flotili, cilvēka uzmanības ir retā resurss un neperfekta sadalījums pārspēj neviens. Ar vienu roku uz vienas galda, jūs neesat tajā režīmā.

Cilvēka vārti cilpa, jau par stieņiem

Pārvērtības laikā palaidi sekciju, par-frame intervencijas karogu uz koriģētas segmentiem, kurējot katra palaisi uz koriģētās vai novērtējuma, komponējot jaukta datu kopā no avotiem jūs izvēlaties, un turpinājuma apmācības no eksistējošas kontrolpunkta ir uzbūvēti, nevis skriptēti ar roku. Pārvērtības darbi ar vadošo roku, vai ar tastatūru un slīdņiem ja jums nav viena.

Skatīt, kā DAgger cilpa tiek palaista

Vārti ir puse no metodes; datu pastrādes ir otrā puse

Vārti izlemj kuri kadri cilvēks brauca, ne ko darīt ar tiem, un to otru lēmumu ir kur kārtas ir bieži tiek miskasts. Pirmā noteikums ir viens D DAgger nozīmē: apkopot, nevis aizstāt. Fīns-tuning a kontrolpunkts tīrā desmit gadiem koriģējums kadri sniedz jums modelis, kas ir redzējuši gandrīz nekas bet atkopšanas un ir aizmirsuši nomināls trajektorija.

Otrā noteikums ir tas, ka intervencija kadri nav parastie kadri. Mandlekar et al. veidots tāla-teleopērācijas sistēma par 6-DoF manipulāciju pieļaujot operatoriem uz uzraugs politikas un paņemt vairāk par kļūmi, tad apmācīti atkārtoti ar algoritmu, kas "mudina politiku uz mācās kā šķērsot sašaurināti caur intervencijas"; aģenti apmācīti uz tiem dati pārspēja aģentiem apmācīti uz vienādu skaitu parastie demonstrācijas paraugi. Sirius grūdis ideja ievietošanu, "pārsvarošana apmācības paraugi ar tuvinātu cilvēka pārliecības un optimizējot politikas ar svērtiem uzvedības klonēšanu". Abi nepieciešama par-frame marķis ko bija cilvēks-brauca, kā kāpēc intervencija karogs skaita vairāk nekā tas izskatās.

Trešā noteikums ir ka automātiski jaukšanu ir slazds. Komponēta datu kopā, kuru avotus jūs nevarat uzskaitīt ir viena jūs nevarat atkļūdot kad nākamo kārtu iegūst sliktāks. Uz šīs platformas sakompilēts solis ir skaidrs tāpēc — oriģināls datu kopā plus koriģējumi, episodu atlase par avotu, un rezultāts ir parastā LeRobot datu kopā ka sinhronizācija un trenē, tāpat kā jebkurš cits; datu kopas dokumentācija sedzas formāts pusē.

Solis kārtāKas tas radaVisvairāk izplatīts ceļš tas notiek nepareizi
Palaidiet secinājumu ar ierakstīšanu uzPalaidi zem politikas pašas stāvokļa sadalījumaIerakstīts kā parasts teleopērācijas, pazaudējot to politika bija brauca
Paņemt vairāk par kļūmiKoriģējums segmentiem ar par-frame intervencijas karogsKoriģējums kosmētisku vibriņš, pasniegšana stils nevis atkopšanu
Kurējums katra episoduKoriģējumi, novērtējums, vai atmetSaglabājot visu; iškrāpts pārvērtības maksas vairāk nekā episodu bija vērts
Sinhronizācija koriģējumiVersijēts datu kopā, kur oriģinālsKoriģējumi, ka nekad atstāj vietējā mašīna
Komponējums jauktā datu kopāOriģināls un koriģējumi, skaidri atlaseKluss auto-jaukšanu, tā vēlāka regresija nevar vieta uz avotiem
Turpinājums no kontrolpunktsKontrolpunkts sākt no iepriekšējāGaidot optimizators atsākt; svari sākt modelis, viņi neatgriež optimizators valsts

Iestatīt vārti persona var faktiskā turēt

"Cilvēks izlemj" nav specifikācija. Divi operatori ar atšķirīgu slieksņiem radīt nesakritīgas kārtas, un drifta sliekšņa rada trend jūs nevarat lasīt. Rakstīt izpalaidumos zem pirmā kārtā.

  1. Nosauciet nosacījumi, kas atver vārtus — iestāšanās ārpus vairāk nekā fiksēts mala, grib aizvēršanu uz neko, savienojuma drifts pret ierobežojums, rūklis vairāk, nekā otrais vai divi — un saglabāt saraksts nemainīts kārtai.
  2. Nosauciet ko neatver viņu. Overshooting politika atkopjas no pati par sevi ir apmācības signāls; paņemot vairāk par vietu izdzēš atkopšanu tas jau ir uz prāts.
  3. Paņemt vairāk agri pietiek par tīra pārvērtības, roka atpakaļ tiklīdz valsts ir atkopjams.
  4. Žurnāls, kāpēc paņemat vairāk, par episodu. Trīs kārtās vēlāk tas ir vienīgais ieraksts no vai tas pats kļūmi atgriež.
  5. Turēt kameras, uzdevums tekstu un operators nemainīgs pāri kārtās. Mainīt vienu un skaitļi pārstāj būt salīdzināma.

Mehāniski pārvērtības ir divi varianti. Ar vadošo roku, vadošo ir jāsasniedz sekotāju pašreizējā sastiprināt pirms griezes nozare, vai roku lēcieni; šis izlīdzinājums solis ir mazākais-testēti daļa no ķēdi uz īsta aparāta. Bez vadošo roku pārvērtības ir manuāl no pirmā klavatūras: sekotājs tiek turēts un operators nudgies to savienojums pa savienojums no tastatūra vai vilkši slīdņiem, ar servera-puse spīles katra ievade mazs — pāris grādi katrs klavatūra, pāri rokas uz slīdnis, jo liels solis uz turēts sastiprināt ir kā jūs slīpēt servo. Solis-pa-soļa versija ar klavatūra saistības ir iet caur DAgger kārtai uz SO-100; fons uz abi teleopērācijas režīmi ir teleopērācijas dokumenti un vadošo-sekotāja ieraksts.

Salīdzinājums no atbalstītu politikas arhitektūras ar viņu apmācības un secinājuma īpašības
Vārti ir arhitektūra-agnostic. Kura politika jūs koriģē izmaiņas apmācības izmaksas kārtai, nevis kā pārvērtības darbi.

Lasot vai vārti guva iespēja

Metrika no cilvēka vārti kārtai ir intervencija likme: intervencija kadri sadalīti par kadri kārtai. Tā ir vienu darbu — ja tas nenokrīt pāri kārtās, kārtai nopirka neko, un nākamo vienu jāmaina kaut kas cits nekā datu summu.

Tā ir neobjektīvā metrika un jūs jāzina kā. Tā mēra operatora sliekšņa tik daudz kā politikas kompetences, tas ir, kāpēc izpalaidumi saraksts paliek fiksēti; operators, kas relaksē pāri sesiju rada padussarakas līkne ar neko aiz tā. Tas arī novēro smagumu — desmit kadri apstājas sadursme un desmit, lai nudge grasp izskatīties identisks. Pāri tā ar fiksētu novērtējums kopā nav koriģējums dati bija vienmēr izdarīts no. Raksts uz mērīšanu DAgger cilpa darbi cauri novērtējums koncepcija, tostarp, kā turēt novērtējums episodas ārpus apmācības jaukt.

Cilvēka vārti, godīgi
Ko tas sniedz jūs
  • Darbi uz dienu viens, uz jebkura politikas arhitektūra, ar nav papildu modelis, lai kalibrēt
  • Notver ticīgs-un-nepareizs kļūmes nav dispersija sliekšnis noteikt
  • Rada koriģējumi ierakstīts, kamēr operators bija pilna kontrole, uz brīdi viņi izvēlējies
  • Ražo par-frame marķis ka intervencija-svērtiem metodes, tāpat kā IWR un Sirius patēriņu
Ko tas neviņu
  • Maksās nepārtrauktas uzraudzību; tas nav skala, viens cilvēks un daudz robotiem
  • Ir atkarīgs no operators konsekvencē — drifta sliekšņa corruptas intervencija likme
  • Rada nav riska modelis sevi; HG-DAgger iemācīts sliekšņa un ThriftyDAgger novērtētājs ir papildu mehānika
  • Skaita kadri, ne sekas
  • Nevar glābt politika, kuru kļūmi ir augšupejošo kontrole, tāpat kā samainīts kamera, vai salduks marķēts uzdevums virkne

Jautājumi par atvertu vērts, lai paturētu skats

Salīdzinājumi ir vāji. Spencer un kolēģi pārbaudīta tie uz testa imitācija mācīšanu pieejas un atraduši viņi "realizējams un vienkāršs un tādējādi nepietiekams, lai notvert grūtāks režīmi, no kļūdi compounding redzēt īstā-pasaulē lēmuma veikšanu problēmas" — un pret apkārtējais literatūra, atradu parasts uzvedības klonēšanu tevi labi uz tiem. Tas ir iemesls, lai būt skeptisks par jebkura izlīdzinājuma DAgger varianti atpūtā uz tiem uzdevumiem, tostarp daži skaitļi iepriekš tabulā.

Robots vārti uz lielas politikas nav atrisināti arī. AIM darbs aizstāj nenoteiktums ar starpniku Q-funkcija mīmvīdējat cilvēka intervencija noteikums un ziņo 40% uzlabošanu brīvo-vairākus izmaksas un apmācības efektivitāte pār ThriftyDAgger — nepārtraukts un diskrēts kontrole, ne uz redzeslīmeņa valodas darbības modelis brauca manipulatoru. Vai jebkura no šiem vārtiem pārsūtīt uz fīns-kalibrēts VLA ir atvertu. Apsekojums padara saistīts punkts: lauka terminoloģija un struktūra nav vienoja pāri literatūra, kas padara metodes grūti salīdzināt. Uz sava roku, jūsu žurnāli ir pierādījums jums ir.

Ir HG-DAgger patiešām DAgger ja cilvēks tikai marķes laikā intervencijas?

Tas turpina daļu, ka svarīgs — dati savākti zem stāvokļa sadalījuma mācītājs izsauc, apkopota ar ko nāca pirms — un nometj daļu, ka neizdodas kontaktu ar aparātu. Kelly et al. prezentāt to kā variantu; 2011 nekāds apmierinājums garantija nepārnese pāri nemainītu.

Var es izmantot robota vārti uz fīns-kalibrēts VLA politika uz SO-100?

Nav vienkārši. SafeDAgger klasifikators nepieciešama vaicājama atsauces politika jums nav. EnsembleDAgger nepieciešama ansambļa, kura daudzmiljardu-parametru modelis nozīmē vairākas kopijas atmiņā plus viņu secinājums izmaksas. ThriftyDAgger nepieciešama riska novērtētājs pielāgots uz sekmīgs un neveiksmes, ka nepastāv pirms jūsu pirmā kārtās.

Cik ilgi viena pārvērtības jābūt?

Pietiekami garš, lai sasniegtu stāvokli politika var turpināt no, un ne ilgāk: paplašināts pārvērtības pagrieziet kārtai uz demonstrācijas sesija un plūdi koriģējums kopā ar nomināls uzvedība. LazyDAgger konstatējums, ka kailās cits ceļš pāri — daudzas ļoti īss slēdži ir viņu pašu izmaksas.

Jāapmāca tikai uz koriģētas segmentiem?

Nē — tas ir visvairāk izplatīts ceļš miskasts kārtai. Modelis fīns-kalibrēts tikai uz atkopšanas ir redzējuši gandrīz nekas bet atkopšanas. Jaukt koriģējumi uz oriģināls datu kopā ar avotiem izvēlēts skaidri; iet tālāk, izskatīties intervencija-svērtiem pieejas, tāpat kā IWR vai Sirius, kuri uz-svars cilvēks-brauca kadri nevis izolējot tiem.

Ko, ja intervencija likme nenokrīt pēc kārtai?

Paņemt to uz sejas vērtību: kārtai nemācīja. Pirms pievienošana koriģējumi, pārbaudīt lētāku skaidrojumi — guva operators sliekšņa drifts, vai koriģējumi kosmētisku, guva komponēts datu kopā faktiski satur viņi, guva apmācības sāk no paredzētais kontrolpunkts. Kārtai, ka klusēdams sāka no pamatne modelis izskatās tieši kā kārtai, ka neizdevās mācīties.

Ko nē-intervencija tūkstoškaņņu?

Zem Expert Intervention Learning, jā: nosegumi kur pārraugs skatījās un nenoteic, ka ir lasīt, kā vāju pierādījums, ka valsts un darbības bija pieņemama, formalizēta kā ierobežojums uz vērtības funkciju. Vairākumā praktiski cauruļvadi, tostarp šī, marķis tikai, ko cilvēks brauca.

Par vienu roku, uz galda izvēli tiek veikta: turēt vārti pats, rakstīt, ko atvērs viņu, un tērēt spēks uz datu pastrādes, lai tas nevis uz automātisks slēdzis. Platformas pusē ir aprakstīts uz DAgger cilpa lapa, apmācības iespējas katrs politikas ģimene zem apmācības un cenu. Fons, sākt ar imitācija mācīšanās un imitācija mācīšanās uz SO-100; par pirmā palaidi, palaist sava pirmā politika ir īsāks ceļš.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started