Galdi robota darba vieta, kas lidzīga fiksētai novērtēšanas sistēmai atkārtotiem politikas palaišanas testiem
DAggerNovērtēšanaImitācijas mācīšanāsRobota datiSO-100

DAgger cilpas mērīšana: iejaukšanās pakāpe, novērtēšanas protokols un slazdi

AY-Robots ResearchAugust 27, 202615 min lasīšanai

Iejaukšanās pakāpe — iejaukšanās kadri dalīti ar palaišanas kadri — ir lētākais godīgais progresa signāls, ko cilvēku kontrolēta DAgger cilpa var dot. Šis raksts to definē tā, lai divas personas aprēķinātu to pašu vērtību, parāda, kā to reģistrēt, un izstrādā četrus veidus, kā tā jūs maldina: operatora ieradumi, dreifējošu novērtēšanas sistēmu, apmācību tikai korekcijas paradumos un cilvēku, kas otrdienas korekcijas veic atšķirīgi nekā pirmdienas.

DAgger runda jūtas produktīvi. Jūs vada politiku, preizņemāt kontroli, kad tā pieķeršanās kļūdās, saglabājat korekcijas, pārapmāca, un nākamā palaišana izskatās — jūs varētu zvērēt — nedaudz vienmērīgāka. Divas rindas vēlāk jūs nevarat teikt, vai kaut kas mainījās, jo "nedaudz vienmērīgāka" nav lielums.

Cilpai ir nepieciešams viens skaitlis par rindu, un cilvēku kontrolētā cilpā šis skaitlis ir gandrīz bezmaksas: tās palaišanas daļa, kurā jūs kontrolējāt nevis politika. Šis raksts to definē tā, lai divas personas aprēķinātu to pašu vērtību, to reģistrē, lasa iegūto līkni un nosauc četrus veidus, kā tā jūs maldina, kad tas stāv viens pats. Teorijas nolūkam šis raksts pieņem, sk. DAgger paskaidrojums un cilvēku vadītais variants; praktiskais kolēģis ir DAgger cilpas palaišana SO-100.

Īsā versija

  • Iejaukšanās pakāpe = iejaukšanās kadri / palaišanas kadri. Kadri, nevis epizodes, un saucējs ietver kadrus, ko jūs pavadījāt koriģējot.
  • Plakana līkne pār trim rundām nozīmē, ka rindas neko neieguva — mainiet maisījumu, pāreju vai uzdevumu, nevis savāciet ceturto.
  • Krītošā iejaukšanās pakāpe nav augšupejoša panākumu likme. Jūsu slieksnis iejaukšanai dreifē uz leju, pieaugot uzticībai.
  • Bez iezemēta novērtēšanas protokola — vienas sākuma pozas, objekti, kameras, mēģinājumu skaits — jūs mēra istabu.
  • Apmācība tikai par korekcijām slīpina stāvokļa sadalījumu. IWR atbilde: ņemiet iejaukšanās un iejaukšanās paradumus vienādā proporcijā.

Kāpēc rundai vispār ir nepieciešams skaitlis

DAgger pastāv sadalījuma problēmas dēļ, un sadalījuma problēmas ir neredzamas acs. Ross un Bagnell parādīja, ka imitācijas mācīšanās fiksētā demonstrācijas komplektā noved pie pakāpeniski pieaugošiem kļūdiem un žēlastības robežas, kas pieaug kvadrātiski laika horizonta: tiklīdz stūmējs atstāj valstis, ko demonstrants apmeklēja, nekādi dati neizsaka, kā atgriezties. DAgger to labo ar atkārtošanos — palaidiet politiku, marķējiet valstis, ko tā apmeklē, uzkopojiet, pārapmāca — ko Ross, Gordons un Bagnell ieraida kā mazināšanu bez nožēlas tiešsaistes mācībām.

Šai ieramei ir sekas, ko cilvēki izlaiž. Garantija attiecas uz politikas secību pāri atkārtojumiem, nevis uz jebkuru vienu palaišanu. Tas neko nepasaka par to, vai jūsu trešā runda palīdzēja. Vienīgais veids, kā to zināt, ir mērīt katru atkārtojumu. Kellijs un kolēģi ieviesa HG-DAgger, jo klasisks DAgger lūdz eksperta darbības etiķetes, kamēr iesācējs vēl kontrolē, ko darbs apgalvo, var samazināt drošību un ar cilvēku ekspertiem, acīmredzami pazemina etiķetes kvalitāti caur izjusto aktuatora atpalicību. HG-DAgger arī mēra drošības slieksni modeļa nenoteiktības metrikā un norāda uzlabotus rezultātus pār DAgger un uzvedības klonēšanu automašīnu uzdevumā. Tas nepublicē iejaukšanās skaitus; tos jūs nodrošinājāt pats.

Likmes noteikšana, lai divas personas iegūtu to pašu numuru

Definīcija ir viena rinda: iejaukšanās kadri dalīti ar palaišanas kadri. Viss grūtais slēpjas tajā, kas tiek uzskatīts par kadru un kas uzskatīts par palaišanu.

Kadri, nevis epizodes

Epizožu skaitīšana ar vismaz vienu iejaukšanos ir bezjēdzīga: desmit epizodes ar vienu pasiūtījumu katra un desmit, kurās jūs braucāt astoņdesmit procenti, abas dod "10/10". Kadru skaits tos atdala, un tas ir granularitāte, ko ierakstīšana jau ir — LeRobot datu kopas formāts katra laika solī ir rinda, tāpēc iejaukšanās karogs ir viens Būla kolonna blakus stāvokļa un darbībai. Šeit tas tiek rakstīts par kadru, brīdi, kad pārņemšana sākas un iztīrīts, kad vadība atgriežas.

Saucējs ietver korekcijas

Divi saucēji ir aizstāvami — kopējie palaišanas kadri vai kadri, kuriem politika brāvoja autonomi — un tie ļoti atšķiras augstās iejaukšanās līmenī. Pārņemiet 400 no 1000 kadriem un pirmais dod 40 procentus, otrais 67 procentus. Salīdzināt vienu rindu, mērītu pirmajā veidā, pret nākamo, mērītu otrā veidā, ir kā reāls uzlabojums pazūd. Paņemiet kopējos kadrus un nekad nepārraugojiet izvēli sērijā.

Vienreiz nolemjiet, kas notiek pārejas kadriem

Vienmēr ir šuve. Kad vadība pāriet, daži kadri pieder nevienai pusei: roka ir turēta, vadītājs izlīdzina, ierakstīšana ir sasalusi. Šajā cauruļvadā tie pārejas kadri paliek neapstrādātā straumē un nekad neizkļūst kuratētajā epizodē — tie nav ne politikas uzvedība, ne korekcija, kas ir vērts apmācības. Šuve skaitīt tāpat katrai rundai: 30 Hz, sešas pārejas ar divu sekunžu šuvi katra, tā ir 360 kadri, pietiekami, lai izspaļu procentu punktu.

Trīs lēmumi, kas salauzēs salīdzināmību

Kadri vai epizodes; kopējā palaišana vai tikai autonoma; pārejas kadri iekšā vai ārā. Jebkura no trim mainītas klusumā starp rundām padara līkni bezjēdzīgu. Pierakstiet visas trīs.

Reģistrējot to, lai skaitlis izdzīvo sesiju

Metrika darbības procesa statusa panelī ir nolasīšana: tā pazūd pēc palaišanas no jauna un to nevar attēlot. Viens tikai pievienojams rinde uz palaišanu aptver visu sēriju — ieskaitant kura pāreja jūs brauca, jo tas mainās katru rindu un jauktie tos noraidīti, kas seko.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Viena rinda uz palaišanu. Saucēja reģistrēšana un pārejas konvencija blakus skaitlim ir svarīgāka nekā lauku nosaukumi.

Divi lauki nēsā svaru. train_mix ir tas, ko jūs devāt nākamajam apmācības darbam; bez tā neko nevar attiecināt. eval_protocol nosaka fiksēto testu, ko jūs palaida pēcāk, un ir lauks, kas visbiežāk paliek tukšs. Ay-robots kokpitā pārejas statusa ziņojums ziņo iejaukšanās kadru skaitu palaišanas sesijai, tāpēc reģistrēšana ir pārrakstīšana, nevis instrumentācija; datu kopas dokumentācija nosedz, kur per-frame kolonnas nolaiž.

Apmācības konfigurācijas matrica, kurā parādītas politikas, datu kopas un pārejas blakus
Katra runda mainās pāreja un datu kopas maisījums. Skaitlis, kura kombinācija netika reģistrēta, nevar būt atribūcija.

Līknes lasīšana: trīs rindas, viens tiesneša nolēmums

Trīs rindas ir minimums lasīšanai, jo divi punkti vienmēr ir līnija. Tabula zemāk ir grāmatvedības šablons ar aizstājplīca skaitļiem, nevis mērījumi no jebkura palaišanas. Jūs meklējat monotonijas samazinājums, kuru saskaņo pieaugums panākumos fiksētā testā.

RundaPāreja brāvojaKadriIejaukšanās kadriLikmePanākumi (no 20)
0 (bāze)bāze politika5 9001 38023.4 %7
1no 0. rindas maisījuma5 61098017.5 %10
2no 1. rindas maisījuma5 41261111.3 %11
3no 2. rindas maisījuma5 38059811.1 %12

Pirmā un otrā rinda ir padarīšana darbs. Trešā rinda nav: 11.3 pret 11.1 procentiem ir palaišanas līdz palaišanas variācijas robežā no jebkā, ko mēra uz fiziskas rokas, un ceturtā rinda ar vienas korekcijas iztērē pēcpusdienu par neko. Plakanas segments saka mainīt kaut ko strukturālas.

  • Atlikušie neveiksmes nav labojamas ar tālvadības — objekts nav pieejams, gripers ģeometrija, stienis pie tās robežas. Nav korekcijas datu, kas labo kinemātiskā siena.
  • Korekcijas ir pārāk maz salīdzinājumā ar bāzes datu kopu, lai pārvietotu gradientu, un neko ne nosver.
  • Korekcijas viena otru atgriež, tāpēc politika vidējā divas stratēģijas un nokļūst starp tām.
  • Neveiksme ir augšup: kamera pārvietojusies, apgaismojums mainīts, statīva skats vairs neatbilst apmācībai.
  • Uzdevums ir pie šīs politikas klases griestiem uz šī aparāta, un nākamais solis ir vairāk bāzes datu.

Pēdējās divas nav cilpas neveiksmes. Sirius-Fleet kritiskā nepieciešamības samazinājums cilvēkam ir paredzētais rezultāts: tāpat kā robota autonomija uzlabojās, tā anomālijas prognozētāji adaptē viņu prognozes kritērijus, kā rezultātā ir mazāk pieprasījumu cilvēka intervencei un pakāpeniski samazinās cilvēka darba slogs laika gaitā. Tur kritēriju adaptē nolūkā. Manuālas cilpas jūsu adaptē arī, klusumā — tāpēc likme, kas paslīd, jo uzdevums ir pie griestiem, izskatās tieši tāpat kā viens, kur operatora paslīd, jo sāka nemanīt. Kas ir nākamā problēma.

Slazds 1: krītošā likme nav augšupejoša panākumu likme

Iejaukšanās likme mēra tieši vienu lietu: cik daudz no palaišanas jūs lēmāt būt savi. Šis lēmums ir jūsu, pieņemts reālā laikā, un tas pārvietojas. Nulles rundā jūs pārņemot vadību pie pirmā sliktā pieņemšanas leņķa; trešajā rundā jūs esat skatījies politiku atgūties no duciema tiem un ļāvāt to mēģināt. Jūsu slieksnis pārvietojies; politika var nebūt. Likme krīt tāpat vai citādi.

Cilvēka uzticība ir vismaz modelēts lielums literatūrā, nevis pieņemts konstante. Sirius pārsver apmācības paraugus ar tuvinājumiem cilvēka uzticības un optimizē politiku ar svērtām uzvedības klonēšanu, ziņojot par 8 procentu palielinājumu simulācijā un 27 procentus uz reālā aparāta pār mūsdienu mākslu politikas panākumu likmē, divas reizes ātrāks konverģences ātrumu. Tas uzskata uzticību kā svaru uz datiem. Tas nemaina slieksni jūsu galvā starp nulles rindu un trešo rindu.

Jūs nevarat noņemt dreifēšanu, tāpēc pāra likme ar kaut ko jūsu slieksnis nevar pieskarties: fiksēts mēģinājumu komplekts, kurā jūs nemājāt intervēt, vērtēts pēc kritērija, kas rakstīts pirms rindas. Likme, kas krīt, kamēr sapārotā panākumu likme paliek, ir habituācijas paraksts — vērts notvert, jo no cilpas iekšpuses tas izjūtas kā progresa.

Iejaukšanās likmePanākumu likme uz fiksēta protokolaVisticamākā lasīšana
krītceļasRunda strādāja. Turpinājiet.
krītplakansJūsu slieksnis dreifēja, vai korekcijas noņēma pūli bez neveiksmes noņemšanas.
krītkrītKorekcijas pasliktina politiku. Pārbaudiet maisījumu un to iekšējo konsekvenci.
plakansplakansRunda neieguva neko. Mainiet maisījumu, pāreju vai uzdevumu pirms vēl datu savākšanas.
ceļaskrītRegresija. Aizsargā apmācības maisījumu, mainītu kameru vai pārejas jaukšanu pirms metodes aizsardzības.

Slazds 2: bez fiksēta protokola, jūs mēra istabu

Reālas rokas novērtēšana ir dārga un grūti atkārtojama. SIMPLER autori motivē simulētu novērtēšanu ar novērojumu, ka reālās pasaules šādu politikas novērtēšana nav mērogojama un saskaras ar reproducējamības izaicinājumiem, kas pasliktinās, kad politikas paplašina viņu uzdevumu spektru. RoboArena pieiet to no otrās puses, ar vairāk nekā 600 pāru reālas rokas novērtēšanas epizodēm pār septiņām ģenerālistiem politikām, palaisdamas novērtējuši uz DROID platformas septiņas akadēmiskas iestādes. Viņa novērtējuši izvēlās savus uzdevumus un vides, bet jāsproso politiku pāri dvīņu-blind; raksts norāda, ka šī pūļa rangs piekrauj ģenerālistot-politikas darbību precīzāk nekā pārējais, centralizēts novērtēšana.

Jūs nepalaidīsiet 600 pāru epizodes uz vienu SO-100 darbnīcā. Ko jūs varat darīt, ir noņemt dispersiju, ko jūs kontrolējat — saraksts nozīmīgs pietiekami, ka tas parasti tiek izlaists.

DimensijaSasaldējiet šoKas dreifē, ja jūs neesat
Sākuma pozīcijaRakstīts mājas pozīcija, brāvots pirms katra mēģinājumaTrajektorija sākas ārpus sadalījuma
ObjektiLenti zīmes un tas pats fiziskais objekti rezervēti novērtēšanaiLabāka politika ir tiešām biezāks objekts
Kameras un gaismaVienādas uzstādes, indeksi, ekspozīcija; slaida aizslēgta; fotogrāfija iestatījumuSamainīti kamera indeksi sami var pārņemt rezultāts
Mēģinājumi un stop likumsFiksēts n, fiksēts timeout, kritērija rakstīts pirms rindasPost-hoc kritērija pagriezt gandrīz-padara par ko jums nepieciešams
Operatora uzvedībaNav intervenču novērtēšanas mēģinājumi laikāNovērtēšana kļūst par vēl korekcijas sesiju

Tad aritmētika, neatlaidīgs pie mēģinājumu skaita darbnīca spēj. Saskaņā ar normālo tuvinājumu, 60 procentu panākumi pār 20 mēģinājumiem nēsā standarta kļūdu tuvējā 11 procentu punktiem — kvadrātsakne no 0,6 reizes 0,4 pār 20 — un atšķirība starp diviem šādiem rundām nēsā apmēram 15. Lēciens no 60 uz 70 procentiem ir tāpēc konsekventā ar neko, kas notika. Piecdesmit mēģinājumi dod par-rindu skaitli drīzāk uz aptuveni 7 punktiem un maksāt pēcpusdienu.

Šī asimetrija ir arguments par iejaukšanās likmi: aprēķināta tūkstošiem kadri, nevis divdesmit bināri iznākumi, tā pārvietojas agrāk un vienmērīgāk. Aizliegums ir tas, ka kadri epizodē ir stipri korelē — viens slikt grasp nozīmē simts pēc kārtas iejaukšanās kadri — tāpēc efektīvs paraugs lielums ir tuvāk pāreju skaitam. Izvērtēt likmi kā agrīnais indikators un panākumu likme kā lēns zemes patiesība.

Turiet novērtēšanas epizodes ārpus apmācības kopas

Novērtēšanas epizodes nekad jāiekļauj komponēto apmācības datu kopā — citādi runda n+1 tiek vērtēta pēc datiem, uz kā tā bija apmācīta, un līkne mēra iegaumēšanu.

Slazds 3: apmācība tikai par korekcijām locīda politiku

Korekcijas ir interesanti dati, tāpēc instinkts ir apmācyties viņus. Neizvēlēties. Viņi nāk pēc konstrukcijas no šauram valsts vietas daļas, kur politika jau neveiksimā un stāsta gandrīz neko par jebkuru no palaišanas, kas strādāja. Fine-tune uz šo daļu vien un jūs iegūstat politiku labu atgūšanai no kļūmes pieņemšanas, kas aizmirsis, kā iztaisīt tīru.

Mandlekar un kolēģi iebūvēja savu attālo intervences sistēmu ap šo. Viņu ieramēšana: manipulācijas uzdevumi satur šaurtuves apgabalus, kas paredz secīgus precīzus darbības — iespēja kausa ievietošana kafijas mašīnā ir viņu piemērs — kur mazas novirzes noveda valstīs, ko demonstrācijas nekad nepārklāja. Viņu algoritms apmāca iteratīvi ar jauniem datiem, tāpēc politika mēģina šaurtuves, un viņi ziņo, ka aģenti apmācīti par intervences datiem apiet aģenti apmācīti uz ekvivalentu paraugu skaita no bez-intervences demonstrātāju.

Tikai korekcijas fine-tuning pret komponēto maisījumu
Ko tikai korekcijas dod jums
  • Ātri: īss palaišana pāri dažiem epizodes ir lēts pietiekami atkārtot
  • Mērķēts: gradients tiek dominēts pēc valstīm, uz kurām jūs rūpējaties
  • Lēts testēšanai, vai korekcijas stils ir mācīts vispār
Ko tas maksā
  • Fine-tune sadalījums vairs neatbilst uzdevuma sadalījumam
  • Nominālā uzvedība var degradēties redzams vienas rindas laikā
  • Likme var krīt, kamēr panākumi krīt ar to — tīri segmenti kā atgūvumi tirdniecības

Maisījuma attiecība ir hiperparametrs un pelnās būt rakstīta uz leju. Komponējot nākamo datu kopu ir vieta, kur tā ir nolemts: pūrš demonstrācijas plus korekcijas komplekts, epizodes atlase uz avots, nevis likums, kas klusumā velk iekšā ko ir pieejams. Šeit, ka ir viena komponēt solis kokpitā, un rezultāts ir parasts datu kopa — sk. apmācības dokumentācija. Ko nē rīks ir reģistrēšanas, kura attiecību radīja kura līkne.

Slazds 4: cilvēks nav konsekvents eksperts

DAgger teorija pieņem eksperts. Jūs nav viņu tehniskai nozīmē: jūsu korekcijas nav paraugi no fiksēta nosacīta sadalījuma pār darbības. ACT autori nosaukt šo, uzskaitot šķēršļus smalkās manipulācijas — kļūdas komponējot laika gaitā un cilvēku demonstrācijas var būt ne-stacionāras. Viņu sistēma vēl saskaņo 80 līdz 90 procentu panākumi uz sešiem reāla uzdevumi no desmit minūšu demonstrācijas, tāpēc problēma ir ar kura, nevis atvaļu.

Robomimic pētījums veic punktu no dati pusē. Pāri sešiem offline algoritmi uz pieciem simulēti un trīs reāla-pasaules multi-posms uzdevumi, viņa nodarbības ietver jutību uz dizains izvēles, atkarību par demonstrācijas kvalitāte, un — viens, kas sāp visbiezāk šeit — variabilitāte no apstāšanas kritērija, jo apmācība un novērtēšana mērķi atšķirties. Pāreja ar zemāko zudumu nav uzticami viņš ar augstāko panākumu likmi.

Ir aparāta versija šo: ievades režīms formas korekcija. A vadītājs-sekotājs uzstādīšana rada nepārtrauktu, cilvēka-paced trajektorijas. Tastatūras paņēmieni ir spaļi griezti ar serveri — divi grādi par zvanījumu uz rokas locīkliem, četri uz gripers — tāpēc tāda pati nolūks tiek kā kāpnes mazās soļu. Slīdņi sūta absolūtos mērķos un serveris pārvietojas vairāk virzienā uz tiem per call. Trīs režīmi, trīs darbības sadalījumi; jaukšana visi trīs uz viens korekcijas komplekts un tad brīnumainies kāpēc pieņemšana pagriezāt spazmodisks ir pašu-noliektā. tālvadības dokumentācija nosedz ko katrs režīms sūtā.

Svērtais intervenču: IWR un kas nāca pēc tam

Ja korekcijas ir vērtīgs mazākums, principāls labojums ir svars, nevis eksklusivitāte. Intervences Svērtā Regresija ir atsauces ieviešana: dati tiek sadalīti intervences un intervences paraugi un divi partīcijas tiek paraugu vienādā proporcijā apmācības laikā. Korekcijas komplekts, kas ir pieci procenti kadri tad veicina pusi gradients, bez nominālā uzvedības pazūd no sadalījuma.

Vienāds proporcija ir sākuma punkts, nav likums. Sirius ģeneralizē to, aizstājot bināro sadalījumu ar nepārtrauktu svaru no tuvinājumiem cilvēka uzticības; Sirius-Floti pārvietā lēmumu augšup, izmantojot vizuāls pasaule modelis un anomālijas prognozētāji, lai nolemtu, kad cilvēks tiek prasīts vispār. Kopīgs pavēds: intervences karogu ir apmācības signāls, ne tikai grāmatvedības kolonna.

MetodeKas nolemj, kad cilvēks darbojasKā intervences dati tiek izmantotiZiņots rezultāts
DAgger (2011)Fiksēts grafiks; eksperts marķējumi apmeklēti valstisViena augošā datu kopa, ne-svērtāIeramēta kā samazināšana uz nožēlas tiešsaistes mācībām
HG-DAgger (2019)Cilvēks, vadības vadības uz reāla sistēmaAgregēta; plus saprotama drošības slieksnis uz modeļa nenoteiktībasLabāk nekā DAgger un BC uz vadīšanas; nē intervences skaita dots
IWR (2020)Cilvēks, caur attālu tālvadībasIntervences un intervences paraugi izlozēti vienādā proporcijāApspriž bez-intervences dēms apmēram vienlīdzīgs paraugs skaits
Sirius (2022)Cilvēks, novietojuma laikāSvērtā BC, svari no tuvinājumiem cilvēka uzticības8 % pieaugums simulācijā, 27 % reāla aparāta; divas reizes ātrāks konverģence
ThriftyDAgger (2021)Sistēma, vadības uz jaunumu un riskuInteraktīvs savākšana saskaņā ar pārraudzības budžetsLietotāju pētījums (N=10): 58 % augstāks cilvēka un 80 % augstāks robota darbība nekā nākamais labākais metode
Floti-DAgger (2022)Sistēma, piešķirot uzmanību pāri floteiFlotei mācīšanās vērtēta pēc Atgriešana uz Cilvēka PūliLīdz 8.8x augstāks ROHE nekā bāzes
Sirius-Floti (2024)Anomālijas prognozētāji ar pašu-pielagošas kritērijaMulti-uzdevuma mācīšanās ar vizuāls pasaule modelisMazāk intervences pieprasījumi kā autonomija uzlabojās
Vadību skats salīdzinājumam robota politikas pa izmērīts rezultāts
Rangs politikas pret katru citu nozīme kaut kas tikai tad, kad katra ierakste palaidis tas pats protokola. Tas attiecas uz jūsu paši trīs rindas pārāk.

Četri metrika vertīgs reģistrēšanai blakus likmi

  • Pārejas per palaišanu. Divdesmit īsa korekcijas un viens garš dod līdzīgs likmes un aprakstīt dažādas politikas — viena spazmodiska, viena ar vienu blind plankums.
  • Vidējais intervences garums. Pieaugošais garums ar krītošu skaitu nozīmē atlikušais neveiksmes ir grūtie, kas ir ko vēls progresa izlūko.
  • Laiks uz pirmo intervenci. Politika, kas saņem tālāk pirms nepieciešama palīdzības uzlabojās pat tad, kad kopējā likme ir plakans.
  • Kur intervenču klašķi. Bin karogs ar normalizēti epizodes progresa; stabils augšgals pāri rundām norāda uz vienu šaurtuvi.

Runda protokola jūs faktiskā var palaist

Izmērīts runda ir sešas soļi un ražo viena rinda žurnālā. Pirmā četri ir cilpā; pēdējā divi to iztaisīt mērījums.

  1. 1
    Sasaldējiet novērtēšanas protokola pirms nulles rinda

    Rakstīts sākuma pozīcija, objekta pozicionējums, kameras, mēģinājumu skaits, timeout un panākumu kritērija. Fotogrāfija tabula. Ja dokumentu jāmainīt, sērija sākas no jauna.

  2. 2
    Mērīt bāze

    Palaidiet protokola ar nē intervences un ierakstu panākumi; tad palaidiet viena instrumentēts sesiju ar pārejas iespējota un ierakstu likmi. Tas divi skaitļi ir nulles rinda.

  3. 3
    Savāciet korekcijas vienā konsekvents stils

    Viena ievades režīms per runda, viena operators, ja jūs spēt pārvaldīt. Paņem virsū uz kritērija jūs spēt norādīt augsti — 'gripers vairāk nekā divi centimetri off pieņemšana' — un turīt, ka rinda.

  4. 4
    Triage katra epizode dienas laikā

    Korekcija, novērtēšana vai atmest. Neskaidrs epizodes iegūt atmestā, ne saglabāta uz teorija, ka vairāk dati palīdz — korekcija, kurā jūs pats fumbled ir sliktāk nekā nē epizode.

  5. 5
    Komponējiet maisījumu skaidri

    Pūrš demonstrācijas plus korekcijas, epizodes atlase uz avots. Ieraksts bāze skaitlis, korekcijas skaitlis un kāds svars — tas ir lauks jūs vēlsities trīs nedēļas.

  6. 6
    Turpinājiet no pārejas, tad re-mērīt

    Apmāc komponēto datu kopu no iepriekšējā pārejas, nevis bāzes modelis, palaidiet sasaldēti protokola plus viena instrumentēts sesiju, pievieno-katrs rinda, un salīdziniet virsū iepriekšējā divi rindas.

Divi ierobežojumi mainīt, kā jūs lasīt vāj runda. Turpinājiet no pārejas inicializē svari no to — ne optimizators resume, tāpēc grafiks sākas svaigi un īss palaišana no konverģēts pārejas var pārvietot ļoti maz. Un vadītājs-pielīdzināt kustības sākumā pārejas ir mazāka izbraukums reāls aparāts no jebkā cilpā; ja korekcijas visi sāk ar dīvains pārejas, skatīties viņu pirms vainojot maisījumu.

Izmērīts cilpā, jau bez stieples uz

ay-robots ievieso šīs sešas soļi kā produkts pazīmes: paņemt virsū mid-palaišanu no vadītājs rokas, tastatūra vai slīdņi, ar intervences kadri karogs automātiski; triage katra epizode kā korekcija, novērtēšana vai atmest; komponēt nākamo datu kopu no pūrš demonstrācijas plus korekcijas, epizodes atlase skaidri uz avots; un sākt nākamo apmācības palaist no iepriekšējā pārejas, nevis bāzes modelis.

Redzēt, kā DAgger cilpā darbi

Ko skaitļi nevar pastāstīt jums

Nē no šī ir atrisināta, un caureja līkne nevajadzētu pārliecināt jums pretējais. Intervences likme mēra kopīgs sistēma — politika, aparāts, operators, istaba — un atribūts niks uz savā. Tas nevar spriest vai korekcijas bija labas, un tas kritīs happily uz uzdevuma, kas kļuva vieglāk, jo objekts dreifēja divi centimetri tuvāk pār trīs nedēļas.

Ko tas liek ir pagriezt neskaidrs iespaidā kolonna jūs spēt argumentu ar. Alternatīva nav labāks metrika; tā ir trīs nedēļas savākšanā korekcijas līkne varētu paziņojuši jums, pēc runda trīs, apturēt savākšanai. Uzmeklēt literatūra nosaka interaktīvs imitācijas mācīšanās kā cilvēka atgriezeniskā saite dota pārkritumi robota izpildes, ļaujot tiešsaistes uzlabošanas uzvedības; ģimene ir plats, un nē izkārtojums viņu darbi bez skaitlis per runda. Redzēt arī SO-100 imitācijas mācīšanās ceļvedis par bāzi datu kopu jūs maisījums virsū, politikas brāvošana par secinājums pusē, un DAgger cilpā lapa par ieviesto cauruļvadu.

Ir intervences likme tikai viens mīnus panākumu likme?

Nē. Likme mēra cik daudz palaišanu jūs paņēma virsū; panākumu likme mēra vai uzdevums tika izdarīts bez jums. Palaišanu spēj panākt ar 30 procentu intervences likmi, un palaišanu ar nē intervences spēj neveiksmi pilnīgi. Viņi arī atšķirties troksni: likme pārvietojas vienmērīgi tūkstošiem korelēti kadri, panākumu likme lēcieni starp handout binārs rezultāti. Žurnāls abi.

Cik daudz novērtēšanas mēģinājumi es daru nepieciešams par panākumu likmi nozīme nē kaut ko?

Vairāk nekā jūt pamatota. Saskaņā ar normālo tuvinājumu, 20 mēģinājumi uz taisnīgi 60 procentu panākumu likme nēsā standarta kļūdu tuvējā 11 procentu punktiem, tāpēc 10-punktu kustības rindas ir neatšķirams no troksnis; 50 mēģinājumi dod, ka skaitli uz drīzāk uz septīņu. Ja jūs nespēj payer 50, turītu mēģinājumu skaits identisks pāri rindas un rakstīt mazi kustības kā neskaidrs.

Kāds maisījums attiecība demonstrācijas korekcijas es sāks ar?

Dokumentēti sākuma punkts ir IWR uz: sadalīt dati intervences un intervences paraugi un izlozēt viņiem vienādā proporcijā, tāpēc korekcijas veicina pusi gradienti, lai kāds mazās daļas kadri viņi ir. Ja jūsu uzstādīšana nespēt svars paraugošana, aptuvens to caur epizodes skaita, kad komponējot datu kopu un ieraksts attiecību. Apmācība par korekcijām vien ir opcija uz izslēgt.

Manu intervences likme pieauga pēc rinda. Ir runda iztukšots?

Ne vienmēr, bet pārbaudiet garlaiku izskaidrojumi pirmais: taisnībi pāreja jūs brāvoja atbilst viņu jūs apmācīta, taisnībi kamera indekss vai uzstādes mainīts, taisnībi objekta pozicionējums dreifē, taisnībi korekcijas stils bija konsekvents. Ja visi četri ir tīrs un sapārotā panākumu likme arī krīt, aizsargā maisījumu — pārāk daudz bāzes demonstrācijas pret korekcijas, vai korekcijas, ka pretrunā katru citu. Autentisks regresija piederī žurnālā, nav bin.

Spēju izlaist sasaldēti novērtēšanas protokola un vienkārši skatīt intervences likmi?

Tikai, ja jūs pieņem, ka jūs nespēt stāvēt uzlabošana no ieraduma. Likme ir atkarīga uz jūsu paši reālā laika slieksnis par soļošana iekšā, un šo slieksnis krīt, kā jūs kļūt pieraduši politikas žagars. Sasaldēti protokola ir daļa mērījums jūsu slieksnis nespēt sasniegt — lenti zīmes, rakstīts mājas pozīcija, fiksēts mēģinājumu skaits, kritērija nolemts pirms rinda. To jāpaliek mainīta pāri sēriju.

Turītu žurnālu repositorijā, ne piezīmjukā: rindas ir dienas atšķirti, aparāts saņem pārbūvēts, un personu lasīt līkni oktobri ir jūs ar nē atmiņa augusta. Sk. dokumentācija BUJ var operācijas detaļi atstāts ārā šeit.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started