Stalinės roboto darbo vieta, naudojama kaip fiksuota vertinimo sąranka kartotiniams politikos paleidimams
DAggerVertinimasImitacinis mokymasRoboto duomenysSO-100

DAgger kontūro matavimas: intervencijos dažnis, vertinimo protokolas ir spąstai tarp jų

AY-Robots ResearchAugust 27, 202615 min skaitymas

Intervencijos dažnis - intervencijos kadrų skaičius, padalytas iš bėgimo kadrų - yra pigiausias sąžiningas progreso signalas, kurį turi žmogaus valdomas DAgger ciklas. Šiame straipsnyje jis apibrėžiamas taip, kad dvi žmonės apskaičiuotų tą pačią reikšmę, parodytas jo registravimas ir išanalizuoti keturi būdai, kaip jis jus klaidina: operatoriaus įpratimas, pasislinkęs vertinimo nustatymas, mokymas tik pataisymams ir žmogus, kuris antradienį pataisytas kitaip nei pirmadienį.

DAgger raundas jaučiasi produktyvus, kai jūs jame esate. Jūs valdote politiką, perimiate, kai ji nesugaupia, išsaugote pataisymus, perkvalifikuojate, ir kitas bėgimas atrodo – jūs priesaiką duotumėte – šiek tiek sklandesnis. Du raundai vėliau negalite pasakyti, ar kažkas pasikeitė, nes "šiek tiek sklandesnis" nėra kiekis.

Ciklui reikia vieno skaičiaus per raundą, o žmogaus valdytame cikle tas skaičius yra beveik nemokamas: bėgimo dalis, kurią kontroliavote jūs, o ne politika. Šiame straipsnyje jis apibrėžiamas taip, kad du žmonės apskaičiuotų tą pačią reikšmę, jo registravimas, rezultato kreivės skaitymas ir keturių būdų, kaip jis jus klaidina, pavadinimas, kai jis stovi vienas. Teorijai, kurią šis straipsnis daro prielaidą, žr. DAgger paaiškina ir žmogaus valdomas variantas; praktinis atitikmuo yra DAgger ciklo paleidimas SO-100.

Trumpa versija

  • Intervencijos dažnis = intervencijos kadrų skaičius / bėgimo kadrų skaičius. Kadrų, o ne epizodų, o vardiklis apima kadrų, kuriuos išleido pataisyti.
  • Plokščia kreivė per tris raundus reiškia, kad raundai nieko nepirko - pakeiskite sudėtį, kontrolinį tašką ar užduotį vietoj ketvirtojo rinkimo.
  • Krintantis intervencijos dažnis nėra auganti sėkmės koeficiento. Jūsų slenkstynas, kada perimti, nusileidžia žemyn, kai pasitikėjimas auga.
  • Be fiksuoto vertinimo protokolo - tie patys pradžios žingsniai, objektai, kameros, bandomųjų skaičius - matuojate kambarį.
  • Mokymas tik taisymams iškraipo būsenos pasiskirstymą. IWR atsakymas: intervencijos ir ne-intervencijos pavyzdžius rinkite vienodai.

Kodėl raundui reikia skaičiaus iš viso

DAgger egzistuoja dėl pasiskirstymo problemos, ir pasiskirstymo problemos yra neaiškios akiai. Ross ir Bagnell parodė, kad imitacinis mokymas pagal fiksuotą demonstracinį rinkinį veda į sukauptus klaidų ir atgailos ribą, augančią kvadratiškai pagal laiko horizontą: kai tik besimokantis palieka valstybę, kurioje demonstratorius lankėsi, nieko duomenyse jis nepasakys, kaip grįžti. DAgger tai ištaiso kartodamas - paleisti politiką, žymėti jos lankomas valstybę, susumuoti, perkvalifikuoti - kuriuos Ross, Gordon ir Bagnell suformuluoja kaip redukciją į be-atgailos internete mokymąsi.

Ta formulavimas turi pasekmes, kurias žmonės praleisti. Garantija liečia politikos seką per kartojimus, ne jokią vieną bėgimą. Jis nieko nesako apie tai, ar jūsų trečias raundas padėjo. Vienintelis būdas žinoti yra išmatuoti kiekvieną iteraciją. Kelly ir kolegės pristatė HG-DAgger, nes klasikinis DAgger prašo eksperto veiksmo žymų, kai pradedantysis vis dar valdžioje, kurio autorinės teisės argumentuoja gali sumažinti saugumą ir, kai kurie žmonės yra ekspertai, labai išjungti žymos kokybę per suvokiamą aktuatoriaus delsa. HG-DAgger taip pat mokosi saugumo slenksčio modelio-neapibrėžtumo rizikos metrikai ir praneša apie pagerėjusį veikimą prieš tiek DAgger, tiek elgsenos klonavimą vairavimo užduočiai. Jis nepublikuoja intervencijos skaičiaus; tuos jūs sudarote patys.

Tarifą apibrėžti taip, kad du žmonės gautos tą patį skaičių

Apibrėžimas yra viena linija: intervencijos kadrų skaičius padalytas iš bėgimo kadrų skaičiaus. Visa sunkumas slepiasi į tai, kas skaičiuojasi kaip kadras ir kas skaičiuojasi kaip bėgimas.

Kadrų, o ne epizodų

Epizodų skaičiavimas su bent viena intervencija yra nenutikęs: dešimt epizodų su vienu paspaudimu kiekviename ir dešimt, kuriuose jūs valdėte aštuoniasdešimt procentų abu duoti "10/10". Kadro skaičius juos atskiria, ir tai yra granuliarumas, kurį įrašymas jau turi - LeRobot duomenų rinkinio formatas kiekvienas laiko žingsnis yra eilutė, todėl intervencijos žymė yra viena loginė stulpelio šalia būsenos ir veiksmų. Čia jis rašomas per kadrą iš kurio takeover prasideda ir išvalytas, kai kontrolė grįš.

Vardiklis apima pataisymus

Du vardikliai yra gynybiniai - bendri bėgimo kadrų skaičius arba kadrų, kuriuos politika valdė autonomiškai - ir jie labai skiriasi dideliam intervencijos lygyje. Perimti 400 iš 1000 kadrų ir pirmasis suteikia 40 procentų, antrasis 67 procentų. Palyginant vieną raundą, išmatuotą pirmuoju būdu prieš kitą, išmatuotą antruoju, yra tai, kaip tikras patobulinimas išnyksta. Imkite visą kadrų skaičių ir niekada neperžiūrėkite pasirinkimo per seriją.

Nuspręskite kartą, kas nutinka perdavimo kadrams

Visada yra siūlė. Kai kontrolė perduodama, kai kurie kadrų priklauso nė iš vienos pusės: ranka yra sulaikyta, lyderis lygiuojasi, įrašymas yra įšaldytas. Šiame konvelyje tie perdavimo kadrų lieka neapdorotoje srityje ir niekad nepatenka į kuratūrą epizodą - jie nei politikos elgsena, nei pataisymas, vertini mokyti. Skaičiuokite siūlę tą patį būdą kiekvienas raundas: esant 30 Hz, šeši takeover su dviem sekundžių siūlę kiekvienas yra 360 kadrų, pakanka tam, kad persigrubinti procentinį tašką.

Trys sprendimai, kurie nulaužia palyginamumą

Kadrų ar epizodų; bendras bėgimas ar autonominis; perdavimo kadrų ar ne. Bet kuris iš trijų tylomis pakeistas tarp raundų daro kreivę beprasmę. Rašykite visus tris.

Tai registruojant skaičius gyva per sesijas

Metrika bėgimo proceso būsenos skydelyje yra skaitymas: jis išnyksta iš naujo ir negali būti nubraižytas. Viena pridėj tik eilutė per bėgimą apima visą seriją - įskaitant kurį kontrolinį tašką jūs valdėte, nes tai keičiasi kiekviename raunde ir maišyti jų sunevalidiškina tai, ką seka.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Viena eilutė per bėgimą. Skaitymo vardiklio ir perdavimo konvencijos šalia skaičiaus yra svarbiau nei lauko pavadinimai.

Du laukai neša svorį. train_mix yra tai, ką jūs pratinkite kitam mokymo darbui; be jo nieks negali būti priduotas. eval_protocol vardina fiksuotą testą, kurį jūs paleisti po to, ir yra laukas dažniausiai paliktas tuščias. Ay-robots kokpite takeover būsena praneša intervencijos kadro skaičių bėgančiai sesijai, todėl registravimas yra transkribcija, o ne instrumentavimas; duomenų rinkinio dokumentacija apima, kur per kadro stulpeliai nukreipia.

Mokymų konfigūracijos matrica, rodanti politikas, duomenų rinkinius ir kontrolinius taškus šalia vienas kito
Kiekvienas raundas keičia kontrolinį tašką ir duomenų rinkinio sudėtį. Skaičius, kurio kombinacija nebuvo įrašyta, negali būti priduota.

Kreivės skaitymas: trys raundai, viena nuomonė

Trys raundai yra minimalus skaitymas, nes du taškai visada yra linija. Lentelė žemiau yra apskaitos šablonas su sustiprintais skaičiais, o ne matavimai iš jokio bėgimo. Jūs ieškote monotoninės sumažėjimo, sutriuškintos augančiu sėkme ant fiksuoto testo.

RaundasKontrolinis taškas valdytasKadrųIntervencijos kadrųDažnisSėkmes (iš 20)
0 (bazė)bazinė politika5 9001 38023,4 %7
1iš raundo 0 mišinio5 61098017,5 %10
2iš raundo 1 mišinio5 41261111,3 %11
3iš raundo 2 mišinio5 38059811,1 %12

Raundai vienas ir du daro darbą. Trečias raundas nėra: 11,3 prieš 11,1 procentą yra bėgimo į bėgimą kitimo ribose, kai kas matuojama fiziniu manipuliatoriumi, ir ketvirtas to paties taisymo raundo išleidžia popietę už nieką. Plokščias segmentas sako keisti ką nors struktūrą.

  • Likę gedimai nėra ištaisomi per teleoperavimą - objektas nepasiekiamas, griebtuvo geometrija, sąnaris jo riboje. Nėra taisymo duomenų, kurie nubrėžtų kinematinę sieną.
  • Pataisymai yra per mažai prieš bazinį duomenų rinkinį, kad persigrubinti gradientą, ir nieks jų nesveria.
  • Pataisymai prieštarauja vienas kitam, todėl politika vidina dvi strategijas ir nusileidžia tarp jų.
  • Gedimas atsiranda iš priekio: kamera pajudėjo, apšvietimas pasikeitė, riešo vaizas nebeatitinka mokymo.
  • Užduotis yra šio politikos klasės lubose šioje aparatūroje, o tolimesnė žingsnis yra daugiau bazinių duomenų.

Paskutiniai du nėra ciklo gedimai. Sirius-Fleet mažėjęs žmogaus poreikis yra nustatytas rezultatas: kai roboto autonomija gerėja, jo anomalijos prognozuotojai pritaiko savo prognozes kriterijus, vedant į mažiau užklausų žmogaus intervencijai ir palaipsniui sumažinant žmogaus darbą per laiką. Čia kriterijus pritaiko tyčia. Rankinio ciklo jūsų pritaiko per tylą - todėl dažnis, kuris plokštas, nes užduotis pasiekė lubas, atrodo lygiai taip pat kaip viena, kuri išplokštėjo, nes operatorius nustojo pastebėti. Kuri yra toliau problema.

Spąstai 1: krintantis dažnis nėra auganti sėkmės koeficiento

Intervencijos dažnis matuoja lygiai vienas dalykas: kiek bėgimo jūs nusprendėte turėti. Tas sprendimas yra jūsų, priimtas tiesiogiai, ir jis juda. Nuliniame raunde jūs perimti pirmame blogame artėjimo kampe; trečiame raunde jūs žiūrėjote politiką atsigauti iš tuzino jų ir jūs jai leisti. Jūsų slenkstynas pajudėjo; politika gali ir ne. Dažnis krinta bet kuriuo atveju.

Žmogaus pasitikėjimas yra bent jau modeliuotas kiekis literatūroje, nei nei prielaida konstanta. Sirius persvarsto mokymo pavyzdžius su apytiksliu žmogaus pasitikėjimu ir optimizuoja politiką su sveriomis elgsenos klonavasimu, praneša apie 8 procentų padidėjimą simuliacijoje ir 27 procentus ant tikrų aparatūros prieš šio amžiaus politikos sėkmės koeficientą, dvigubos konvergencijos greičio. Tai traktuoja pasitikėjimą kaip svorį duomenyse. Jis nepatikaipa slenksčio jūsų galvoje tarp nulinės ir trečios raundo.

Negali nuimti šriftą, todėl sujungti dažnį su kažkuo, ko jūsų slenkstynas negali liesti: fiksuotas bandymų rinkinys, kuriame jūs visai nesikišate, įvertinti pagal kriterijų, rašytą prieš raundą. Dažnis, kuris krinta, o suparinti sėkmės koeficientas lieka pat yra charakteristika įpratimo - verta sugauti, nes iš vidinio ciklo jis jaučiasi kaip progreso.

Intervencijos dažnisSėkmės koeficientas fiksuotos protokoloDažniausiai skaityti
krintakylaRaundas veikė. Tęskite.
krintaplokščiaJūsų slenkstynas nužemėjo arba pataisymai nuėmė pastangą be pašalinimo gedimų.
krintakrintaPataisymai blogina politiką. Patikrinkite sudėtį ir jų vidinį nuoseklumą.
plokščiaplokščiaRaundas nepirko nieko. Keiskite sudėtį, kontrolinį tašką ar užduotį prieš rinkę daugiau.
kylakrintaRegresija. Įtaruokite mokymo sudėtį, pakeitusią kamerą arba kontrolinio taško sumaišymą prieš įtariant metodą.

Spąstai 2: be fiksuoto protokolo, jūs matuojate kambarį

Tikra roboto vertinimas yra brangus ir sunkus kartoti. SIMPLER autoriai pagrindžia simuliuotą vertinimą stebėjimu, kad tikrojo roboto vertinimas tokių politikų nėra mastelis ir susiduria su reprodukciabilumo iššūkiais, kurie tikriausiai pablogės, kai politikos praplečia savo užduoties spektrą. RoboArena atakuoja iš kito pusės, turint daugiau nei 600 porinių tikruose robotų vertinimo epizodus per septynias generalistikas politikas, paleistas vertintojų septynėse akademinėse institucijose DROID platformoje. Jos vertintojai rinkosi savo užduotis ir aplinkas, bet turi vertinti politikų poras dvigubai aklas; dokumentas praneša, kad ši minios kategorija šaligatvių seka generalistikas politikas veikimą tiksliau, nei konvencinė, sąraše vertinimas.

Jūs nesuliepsime 600 porines epizodus ant vieno SO-100 dirbtuvėje. Ką jūs galite daryti yra nuimti skirtumą, kurį jūs kontroliuojate - sąrašas nuobodus gerai, kad jis paprastai bus praleistas.

AspektasŠaldyti taiKas nuslysti, jei jūs to nedarote
Pradžios žingsnisParašytas namo pozicija, einanti prieš kiekvieną bandymąTrajektorija prasideda iš pasiskirstymo
ObjektaiĮklijuoti ženkla, ir tie patys fiziniai objektai, saugoti vertinimui"Geriau" politika tikrai arčiau objekto
Kameros ir šviesaTie patys laipsniai, indeksai, ekspozicija; žaliuzės užrašos; nuotrauka sąrankaSukeista kamera indeksai vieni gali dominuoti rezultatą
Bandymai ir sustabdymo taisyklaFiksuotas n, fiksuotas timeout, kriterijus parašytas prieš raundąRyškios kriterijus nuo arti praleista į bet kokias reikalingas
Operatoriaus elgsenaNėra intervencijos vertinimo bandymų metuVertinimas yra dar vienas taisymo seansa

Tada skaičiavimas, negailestingas bandymų skaičiaus dirbtuvėse leisdami. Pagal normalę apytikslę, 60 procentų sėkmė per 20 bandymų nešioja standartinę klaidą šalia 11 procentų taškų - kvadratinė šaknis 0,6 kartų 0,4 per 20 - ir skirtumai tarp dviejų tokių raundų nešioja apie 15. Šuolis iš 60 į 70 procentą yra todėl nuosekl su jokiu paveikslą. Penkiasdešimt bandymų nešioja kiekvieno raundo figūrą apie 7 taškai, ir kainuojanti popietę.

Šis asimetrijukas yra argumentas dėl intervencijos dažnio: apskaičiuoto per tūkstančius kadrų, o ne dvidešimt dvejetainių rezultatų, jis juda ankščiau ir sklandžiau. Pasitarimas yra, kad kadrų epizode yra sunkiai koreliuojami - viena bloga grasp išduoda šimtą iš eilės intervencijos kadrų - todėl veiksmingų pavyzdžio dydis yra artimesnis takeover skaičiui. Traktuokite dažnį kaip ankstyvą indikatorių ir sėkmės koeficientą kaip lėtą tiesą žemę.

Atlikite vertinimo epizodus iš mokymo tūrio

Vertinimo epizodai niekada turi nepatekti į sudarytą mokymo duomenų rinkinį - kitaip raundas n+1 yra įvertintas duomenyse, kurie jie buvo mokyti, ir kreivė matuoja memorization.

Spąstai 3: mokymas tik taisymams lenkia politiką

Pataisymai yra įdominiausi duomenys, todėl instinktas yra to daryti. Nedaryk. Jie ateina konstruktyviai iš siauros valstybės erdvės pjūvio, kur politika jau buvusi nesubyra ir sako beveik nieko apie didžiąją bėgimo dalį, kuri veikė. Susmulkintas tuose tik ir jūs gaunate politiką gerai atsigauti iš sulaidyto artėjimo, kuri pamiršo, kaip daryti gryną.

Mandlekar ir kolegės pastatė savo nuotolinės intervencijos sistemą aplink tai. Jų formulavimas: manipuliavimo užduotys yra turinčios uždarytas regions reikalingas tikslaus veiksmų sekos - įdiegti pod į kavos mašiną yra jų pavyzdys - kur nedideli nukrypimai veda į valstybę, kurias demonstracijos niekada neaptarė. Jų algoritmas mokosi iteratyviai naujuose duomenyse, todėl politika mokosi kirsti tos užraizjos, ir jie praneša, kad agentai, mokyti intervencijos duomenyse, nugali agentus, mokytas lygiavernais pavyzdžiais iš neintervencinių demonstrantų.

Pataisymai tik smulkinimas prieš sudarytą sudėtį
Ko pataisymai tik gauna
  • Greita: trumpas bėgimas per keletą epizodų yra pigus gerai kartoti
  • Orientuota: gradientas yra dominuojamas valstybės, kurios jūs rūpinasi
  • Pigus bandymui, ar taisymo stiliaus yra mokomoji visai
Ko jūs maksate
  • Smulkinimo pasiskirstymas nebeatitinka užduoties pasiskirstymo
  • Vardinė elgsena gali sugesti aiškiai viename raunde
  • Dažnis gali kristi, o sėkmė krinta su juo - grynos segmentai iš atsigavimo

Maišymo koeficientas yra hiperparametras ir nusipelno parašymo. Komposymas sekantis duomenų rinkinys yra kur jis yra nusprendžiamas: originali demonstracijos plius pataisymo rinkinys, epizodo pasirinkimas aiškus per šaltinį, o ne taisyklė, kuri tyliai traukia, kas yra prieinama. Čia tai yra vienas komposymo žingsnis kokpite, ir rezultatas yra įprastas duomenų rinkinys - žr. mokymo dokumentacija. Ką nėra instrumentas, kuris būtų jums, yra raš kuris santykis sukūrė kurį kreivę.

Spąstai 4: žmogus nėra nuolatinis ekspertas

DAgger teorija mano ekspertą. Jūs nėra techninis pojūtis: jūsų pataisymai nėra mėginiai iš fiksuoto sąlyginio pasiskirstymo virš veiksmų. ACT autoriai pavadinimas tai, kai išvardijami kliūtys pagal smulkias manipuliacijas - klaidos sumaišytos per laiką, ir žmogaus demonstracijos gali būti ne stacionarios. Jų sistema vis dar pasiekia 80 iki 90 procentų sėkmes šešias tikrąsias užduotis iš dešimt minučių demonstracijų, todėl problema yra traživama, ne nebuvusi.

Robomimic tyrimų daro tašką iš duomenų pusės. Daugiau nei šeši neprisijungę algoritmai penkose imituotose ir trys tikrojo pasaulio daugiapakopėse užduotyse, jo pamokos apima jautrumą projektavimo pasirinkimams, priklausymą demonstracijos kokybei, ir - vienas, kuris skauda yra čia - kintamumą iš sustabdymo kriterijų, nes mokymo ir vertinimo tikslai skiriasi. Kontrolinis taškas su mažiausiu nuostoliu nėra patikimai su aukščiausiu sėkmės koeficientu.

Yra aparatūros versija: įvesties režimas šeipenus pataisymą. A lyderio-sekėjo sąranka sukuria nuolatinės, žmogaus tempusios trajektorijas. Klaviatūros stumtelėjimai yra sušaldyti sunkiai serveryje - du laipsniai per skambutis ant rankų sąnarių, keturi griebiklyje - todėl tą patį ketinimą atvyksta kaip laipsnių mažų žingsnių. Slideriai siunčia absoliučius tikslus ir serveris juda daugiausiai šešis laipsniai jų per skambutis. Trys režimai, trys veiksmų pasiskirstymai; maišyti visus tris į vieną taisymo rinkinį, tada nuostabu, kodėl artėjimas paliko spragą, yra savisvarbos. teleoperavimo dokumentacija apima, ką kiekvienas režimas siunčia.

Svėrimams intervencijos: IWR ir kas atėjo po

Jei pataisymai yra vertinga mažuma, principinis pataisymas yra svoris, o ne išimtinumas. Intervencijos svertinis regresas yra etaloninė diegimas: duomenys yra padalinti į intervencijas ir ne-intervencijas pavyzdžius, ir abu skaidymai yra iš lygios proporcijos mokymo metu. Pataisymo rinkinys, kuris yra penki procentai kadrų, tada prisideda pusė gradiento, be vardinės elgsenos nuo to pasiskirstymo.

Vienoda proporcija yra pradžios taškas, taisyklė. Sirius apibendrina jį pakeisdama dvejetainę skaidymą su nuolatu svoriu iš apytikslaus žmogaus pasitikėjimo; Sirius-Fleet užtikrina sprendimą uplinku, naudojant vizualinę pasaulio modelį ir anomalijos prognozus, sprendžiant, kada žmogus yra paklaustas visai. Bendrasis siūlas: intervencijos vėliava yra mokymo signalas, tik apskaita stulpelis.

MetodasKas nusprendžia, kai žmogus veikiaKaip intervencijos duomenys yra naudojamiPraneštasis rezultatas
DAgger (2011)Fiksuotas grafikas; eksperto žymos apsilankymo valstybėsVienas augantis duomenų rinkinys, nesviestasSuformuluoti kaip sumažinimas į be-regret veiklos mokymąsi
HG-DAgger (2019)Žmogus, valdant kontrolę tikrajame sistemeSusumuotas; plius mokytas saugumo slenksčio modelio neapibrėžtumoGeriau nei DAgger ir BC vairavimui; nėra intervencijos skaičių
IWR (2020)Žmogus, per nuotolinę teleoperavimąIntervencijos ir ne-intervencijos mėginiai lieti iš lygios proporcijosNugali ne-intervencijas demos lygiomis imties skaičiumi
Sirius (2022)Žmogus, diegiantSvartas BC, svoriai iš apytikslaus žmogaus pasitikėjimo8 % pelnas simuliacijoje, 27 % realia aparatūroje; 2x greitesnė konvergencija
ThriftyDAgger (2021)Sistema, valdant naujoviškumą ir rizikąInteraktyvi rinkimas priežiūros biudžetoVartotojo tyrimų (N=10): 58 % didesnis žmogus ir 80 % didesnis roboto veikimas nei kitas vienas geriausias metodas
Fleet-DAgger (2022)Sistema, paskiriant dėmesį per laivynąLaivyno mokymasis surinktas iš grąžos į žmogaus pastangąIki 8,8 kartų aukštesnis ROHE nei pamatai
Sirius-Fleet (2024)Anomalijos prognozuotojai su savęs iš valymosi kriterijaisDaugiapedalinis mokymasis su vizualine pasaulio modeliuMažiau intervencijos užklausų, kai autonomija gerėja
Lyderių poklis palyginant roboto politikas pagal išmatuotą rezultatą
Politikų reitingavimas prieš vienas kitą reiškia kažką tik tada, kai kiekvieną įrašą palaidojo tą patį protokolą. Tai taikoma ir jūsų tiems trims raundams.

Keturi rodikliai, kurie vertėtų pritvirtinti šalia dažnio

  • Takeovers per bėgimą. Dvidešimt trumpų pataisymų ir vienas ilgas duoti panašius dažnio ir apibūdinkite skirtingas politikas - vienas drebantis, vienas su vienu aklas.
  • Vidutinė intervencijos trukmė. Kilimas ilgio su kritimu skaičiaus reiškia likusios gedimai yra kieti, kurie yra kaip vėlyvas progreso.
  • Laikas nuo pirmosios intervencijos. Politika, kuri gauna toliau prieš poreikio pagalba yra gerėjant, net kai bendras dažnis yra plokščias.
  • Kur intervencijos klasteriuos. Bin vėliava iš normalizuoto epizodo progreso; stabili viršūnė per raundus nukreipia į vieną duobę.

Raundo protokolas, kurį jūs galite tikrai paleisti

Išmastys raundas turi šeši žingsniai ir sukuria vieną eilutę žurnale. Pirmi keturi yra ciklas; paskutiniai du tai pamatuojant.

  1. 1
    Šaldykite vertinimo protokolą prieš nulinio raundo

    Parašykite pradžios poziciją, objekto padėtį, kameras, bandymų skaičių, timeout ir sėkmės kriterijų. Nuotrauka lentelę. Jei dokumentai turi keisti, serija yra keitimas.

  2. 2
    Pamatuoti baziniu

    Paleisti protokolą su jokios intervencijos ir įrašykite sėkmes; tada paleisti vienas instrumentuotas seansa su perimti įgalinta ir įrašykite dažnio. Tie du skaičiai yra nulinės raundo.

  3. 3
    Rinkti pataisymų viename nuoseklų stiliumi

    Viena įvesties režimas per raundą, vienas operatorius, jei jūs gali valdyti. Perimti ant kriterijaus jūs galite valstybę iš garsaus - "griebtuvas daugiau nei du centimetrus nuo na artėjime" - ir turėti jį per raundą.

  4. 4
    Triage kiekvienas epizodas tą dieną

    Pataisymas, vertinimas arba atmet. Neaiški epizodai yra atmesti, ne išsaugoti ant teorijos, kad daugiau duomenų padeda - pataisymas, kuriame jūs patys buvo multas yra blogiau nei jokia epizoda.

  5. 5
    Komponuoti mišinį aiškiai

    Originalios demonstracijos plius pataisymų, epizodo pasirinkimas per šaltinį. Įrašas bazės skaičius, pataisymo skaičius ir bet kurio svarimą - tai yra laukas jūs norėsite tri savaites.

  6. 6
    Tęskite nuo kontrolinio taško, tada matuoti

    Treni sudarytą duomenų rinkinį iš ankstesnio kontrolinio taško, o ne bazinio modelio, paleisti fiksuotą protokolą plius viena instrumentuotas seansa, pridėti eilutę, ir palyginti prieš ankstesnius du raundus.

Du ribos keičia, kaip jūs skaityti susilpnėjusį raundą. Tęstas iš kontrolinio taško initializes svoriai iš jų - ne optimizavimo paleidimas, todėl tvarkaraštis prasideda šviežus ir trumpas paleisti iš suartėjusio kontrolinio taško gali judėti labai mažai. Ir lyderio lygiavimas judesys pradžioje perimtas yra mažiausiai gaidas tikrajoje aparatūroje iš nieko grandinėje; jei pataisymai prasideda nesvarbiu tranzientiu, pažvelkite ten prieš kaltė mišinį.

Išmatuotas ciklas, jau sutvarkyta

ay-robots įdiegti šiuos šeši žingsniai kaip produkto funkcijos: perimti viduryje nuo lyderio rankos, klaviatūros arba sliderių, su intervencijos kadrai žymimo automatinio; triage kiekvienas epizodas kaip pataisymas, vertinimas arba atmet; komponuoti sekantį duomenų rinkinį iš originalo demonstracijos plius pataisymo, epizodo pasirinkimas aiškus per šaltinį; ir pradėti sekantį mokymo pareigybę iš ankstesnio kontrolinio taško, o ne bazinio modelio.

Pamatyti, kaip DAgger ciklas veikia

Ką skaičiai negali jums pasakyti

Nieko iš to nėra išsprendžiama, ir jaukus kreivė nesiūlymas jus kitaip. Intervencijos dažnis matuoja bendru sistemos - politiką, aparatūrą, operatorių, kambarį - ir priskiria nieką savaime. Jis negali spręsti, ar pataisymai buvo geri, ir jis krinta laimingai ant užduoties, kuri buvo lengvesnė, nes objektas nualinti du centimetru artimesnis per tris savaites.

Ką jis daro yra apsusti neaiškų kaip stulpelį jūs galite ginčytis. Alternatyva nėra geriausias rodiklis; tai yra trys savaitės rinktis pataisymo kreivė pasakytų jums, po trijų raundų, su rinkimu. Žiūrų literatūra apibrėžia interaktyvinį imitacinį mokymąsi kaip žmogaus grįžtamąsias nuomonės nurodant kartais per roboto vykdymą, leidžiant interneto tobulinimo elgsenos; šeima yra plati, ir nėra nustatyti jo veikia be skaičius per raundą. Žr. taip pat SO-100 imitacinio mokymo vadovas bazinio duomenų rinkinys jūs mišinyje prieš, paleiskite politiką dėl išvados pusę, ir DAgger ciklo puslapis nustatyto konvelyje.

Yra intervencijos dažnis tik vienas minus sėkmės koeficientas?

Ne. Dažnis matuoja, kiek bėgimo jūs perimti; sėkmės koeficientas matuoja, ar užduotis buvo baigta be jūsų. Paleidimu gali sėkmės su 30 procentų intervencijos dažniu, ir paleidimu su jokios intervencijos gali baigis visai. Jie taip pat skiriasi triukšme: dažnis juda sklandžiai per tūkstančius koreliuojami kadrų, sėkmės koeficientas šokti tarp kelios dvejetainės rezultatai. Žurnalas abu.

Kiek vertinimo bandymai reikia sėkmės koeficientui reikšti?

Daugiau nei jaučiasi pagrįstas. Pagal normalę apytikslę, 20 bandymų esant tikrajam 60 procentų sėkmei nešioja standartę klaidą šalia 11 procentų taškų, todėl dešimt taškai judesys tarp raundų yra nepagrįstas iš triukšmo; 50 bandymų nešioja tą figūrą apie 7. Jei jūs negalite leisti 50, pasilaikykite bandymų skaičiaus tos pačios per raundus ir traktuoti mažus judesynus kaip neišreikštas.

Kas mišinio santykis demonstracijų į pataisymus turėčiau pradėti su?

Dokumentuotas pradžios taškas yra IWR: padalinti duomenis į intervencijas ir ne-intervencijas pavyzdžius ir traukti juos į lygią proporciją, todėl pataisymai prisideda pusė gradiento, kuipats mažas frakciją kadrų jie yra. Jei jūsų sąranka negali svertą pavyzdžius, apytikslė jį per epizodo skaičius komposymo metu ir įrašo santykis. Mokymas tik taisymams yra pasirinktas, kuris bus taisyklės.

Mano intervencijos dažnis pakilo po raundo. Ar raundas suvalotas?

Nebūtinai, bet patikrinti nuobodžia paaiškinimai pirma: ar kontrolinis taškas jūs valdėte sutapo su vienas jūs mokyti, ar kamera indeksas arba laipsnis keitis, ar objekto padėtis nualinti, ar taisymo stilius buvo nuoseklis. Jei visi keturi yra švarūs ir susiję sėkmės koeficientas taip pat krito, įtaruokite sudėtį - per nedaug bazės demonstracijos prieš pataisymus, arba pataisymų, kurie prieštarauja vienas kitam. Tikra regresija priklauso žurnale, taškinys į šiukšlę.

Ar galiu peršokti fiksuotą vertinimo protokolą ir tiesiog žiūrėti intervencijos dažnio?

Tik jei jūs priimate, kad jūs negalite pasakyti patobulinimo iš įpratimo. Dažnis priklauso nuo jūsų pačių tiesioginio slenksčio perimti, ir tas slenkstynas krinta, kai jūs gewöhnen į politikos specificus. Fiksuotas protokolas yra dalis matavimu jūsų slenkstynas negali pasiekti - liptas ženkla, parašytas namo poza, fiksuotas bandymų skaičius, kriterijus nusprendžiamas prieš raundą. Jis turi likti nepakeittas per seriją.

Laikykite žurnalą saugykla, o ne sąsiuvinyje: raundai yra dienos skyryje, aparatūra gauna perkurtas, ir asmenį, kuris skaito kreivę spalio yra jūs su jokią atmintį rugpjūtis. dokumentacija DUK apima operacinių detales, paliktos iš čia.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started