SO-100 lēts robota rokas uz galda, iestatīts tālvadības vadībai un politikas apmācībai
DAggerSO-100Imitācijas mācīšanāsVLATālvadības vadība

DAgger cilpa palaišana uz SO-100 ar VLA politiku

AY-Robots ResearchAugust 27, 202615 min lasīšanas

Detalizēts atskaites apraksts par vienu cilvēka kontrolētu DAgger kārtu uz SO-100 rokas: palaidiet politiku un ierakstiet to, pārņemiet, kad tas kļūst nepareizs, iesniedziet palaišanu kā labojumu, salikiet jauktu datu kopu un turpiniet apmācību no kontrolpunkta. Ietver klaviatūras un slīdņa pārņemšanas ceļu cilvēkiem bez vadības rokas, un četras kļūdas, kas padara kārtu bezjēdzīgu.

Jūsu politika darbojas. Tā stiepjas pēc kuba, aizvēr griferiu par centimetru par agru un turpina tā, it kā viņai to būtu. Neko neklaudzina, un neviena apmācības zaudējuma stīgāšana to nepaskaidro. Risinājums nav vēl 20 000 gradienta soļu uz tiem pašiem paraugiem. Tas ir atgriezi rokas tieši uz rokas vietā, kur tas kļūst nepareizs, ieraksti, ko tu darīji tā vietā, un apmāci nākamo kontrolpunktu uz vecajiem datiem plus šo labojumu. Tas ir DAgger kārta, un šis ir tas, kā viens palaist uz SO-100 ar redzamības valodas darbības politiku.

Teorija ir citur: kāpēc datu kopas agregācija vispār darbojas un ko cilvēka kontrole maina par to. Šis ir lietošanas rokasgrāmata, un tā pieņem apmācītu kontrolpunktu, darbojoša kameras komplektu un rokas, kas kustas. Seši soļi zemāk ir cilpa, kā tas tiek īstenots uz šīs platformas DAgger lappusi, bet secība ir vienāda no jūsu pašu skriptiem.

Viena kārta īsumā

  • Palaidiet apmācīto politiku un ierakstiet to ar palaišanas uzdevuma tekstu, nevis vispārīgās tālvadības etiķeti.
  • Pārņemiet brīdī, kad uzvedība kļūst nepareiza: spoguļa ieguļošana ar vadības roku, tūlītēja un manuāla pa klaviatūru vai slīdņiem bez tās.
  • Kategorizējiet katru palaišanu: iesniedziet to kā labojumu, paturējiet to kā vērtēšanas episodi vai izmetiet to.
  • Salikiet jaukt rokas ceļā - oriģinālie demonstrējumi plus labojumi, episodes izvēlētas pa avotiem. Nekad neapmāc tikai labojumos.
  • Turpiniet apmācību no pēdējā kontrolpunkta un norādiet, kurš kontrolpunkts radīja kuru jaukumu.
  • Numurs, kas saka, vai kārta bija nozīmīga, ir intervences likme, nevis apmācības zaudējums.

Kāpēc otrā kārta nav tikai vairāk datu

Uzvedības klonēšana apmāca valstis, kuras cilvēks apmeklēja. Pārbaudīšanas laikā politika apmeklē valstis, ko tā izraisa, un nelieli darbības kļūdas saplūst valstīs, ko neviens demonstrējums nesegtā. Ross, Gordon un Bagnell formalizēja šo kļūmi AISTATS 2011 un atbildēja ar iteratīvu algoritmu, kas apmāca stacionāru deterministisku politiku un, saskaņā ar to samazināšanu, ir jāveic labi valsts sadalījumā, ko tā izraisa: palaist pašreizējo politiku, ekspertam ir jāmarķē valstis, ko tā faktiski sasniedza, pievienojiet tos datu kopai, pālaist, atkārtojiet. Kelly et al. padarīja vaicājumu praktisku ar HG-DAgger, kur cilvēks nolemj, kad pārņemt vadību, nevis marķēt valstis bez vadības turēšanas; viņi ziņo par uzlabotu veiktspēju salīdzinājumā ar DAgger un uzvedības klonēšanu simulētā un reālā automātiski vadītas braukšanas uzdevumā. Cilvēka kontrole ir tas, kas padara cilpu pieņemamu uz galda rokas - jūs pārvietojat rokas tikai tad, kad kaut kas kļūst nepareizs.

Divas sekas svarīgākas praksē nekā teorija. Labojumi nav parastie demonstrējumi: viņi koncentrējas pie šaurajām vietām, ko Mandlekar et al. apraksta, kur neliela novirze nometā politiku valstīs, ko demonstrējumi nekad nesegja. Un datu kopa, kas izgatavota tikai no šīm grūtajām daļām, ir nepareizi formēta datu kopa - Belkhale, Cui un Sadigh apgalvo no datu sāniem, ka valsts daudzveidība ne vienmēr ir noderīga, un ka darbības novirze un pārejas daudzveidība kopā nolemj datu kopas kvalitāti. Jauktā datu kopa nav kompromiss, tā ir punkts.

Iesaldējiet tos pirms pirmās kārtas

DAgger kārta salīdzina politiku ar sevi laika gaitā. Jebkas, ko tu mainīsi starp kārtām, kas nav datu kopa, padara šo salīdzinājumu jēgpilnu.

  • Kameras pozīcijas un montāžas, ieskaitant nīstas kameru. Atbrīvojiet vienu stieņu un jūs mainījāt novērošanas sadalījumu, nevis politiku.
  • Ekspozīcija un balanss, ja jūsu fiksācijas kaudze to ļauj piefiksēt. Automātiskās ekspozīcijas novirzīšanās starp kārtām ir lēna, neredzama domēna novirze.
  • Rokas kalibrēšana un servomotora nulles pozīcijas. Ja jums ir jāveic kalibrēšana, apskatiet visu, kas tika ierakstīts pirms tā, kā atsevišķu datu kopu.
  • Uzdevuma teksts. Katrs VLA šeit atkarīgs no tā; tā pārfrāzēšana vidus cilpā ir atšķirīgs uzdevums.
  • Apgaismojums, galda virsma, objektu kopa. Jauns objekts ir jauns eksperiments, nevis nākamā kārta.
  • Ierakstīšanas kadru ātrums. Intervences likmju salīdzināšana divos paraugu režģos rada atšķirības, kas nāk no režģa.
Nīstas kamera nav neobligāta mēbele

Hsu et al. salīdzināja rokas-centrālo skatu ar parastā trešās personas skatu un atrada aci-rokas perspektīvu konsekventi uzlaboja apmācības efektivitāti un ārpus-sadalījuma vispārinājumu, neskatoties uz mazāku skaņu. Piecas savienojuma rokā, grifera laiks parasti ir tas, ko tu savos labojumos labojumi, un grifera laiks ir tas, ko nīstas skats nosa.

Kārta no gala uz galu

  1. 1
    Palaidiet secinājumus un ierakstiet to

    Sāciet palaišanu pret kontrolpunktu, kuru vēlaties uzlabot, tad sāciet ierakstīšanu secinājumu saknē. Ierakstīts šādā veidā tas pārmanto palaišanas sava uzdevuma tekstu, kas ir tas, uz ko politika tika apmācīta, nevis noklusējuma tālvadības etiķeti. Bez ierakstīšanas jūs varat redzēt kļūmi, bet to nevar apmācīties.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Pārņemiet, kad tas kļūst nepareizs

    Nospiediet Pārņemšana un izvēlieties ievades režīmu: vadības roka, klaviatūra vai slīdņi. Skrējējs pauzē, tu laboji, tu nododi atpakaļ. Kadri, kas tika ierakstīti, kamēr tu brauc, ir automātiski atzīmēti kā intervences.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Kategorizējiet episodes

    Nolemt par katra episodi: iesniegt kā labojums, paturēt kā vērtēšanu, vai atmest. Palaišana, ko politika pabeidza bez palīdzības, ir vērtēšanas dati.

  4. 4
    Sinhronizējiet labojuma datu kopu

    Labojumi tiek savākti vietējā datu kopā uz politiku un nonāk mākoņa krātuves caur automātisko sinhronizāciju. Neko nav jaukts, ko tu neesi ievietojis.

  5. 5
    Salikiet jaukto datu kopu

    Apvienojiet oriģinālo datu kopu ar labojuma datu kopu, nepārprotami izvēloties episodes uz avota. Rezultāts ir parasta datu kopa no tā punkta uz turpmāk.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Turpiniet apmācību no kontrolpunkta

    Apmāci jaukumu no iepriekšējā kontrolpunkta, nevis no bāzes modeļa. Norādiet, kurš kontrolpunkts un kurš jaukums; bez šī pāra kārta nav reproducējama.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

2. solis detalizēti: divi pārņemšanas veidi

Ar vadības roku

Iekšā vadības sekotājs režīmā pārņemšana ir ieguļošana starp divām rokām, kas nav vienāda pozā. Nospiediet Pārņemšana pauzē skrējēju un vadā vadības vadību uz sekotāja pašreizējās pozas, tāpēc neko nemēdz, kad griezes moment tiek pārnests. Ja šī izlīdzināšanas braukšana iztūkst, tu izlīdzini vadības vadību ar roku un atbrīvo tikai tad, kad abi ir piecu grādu robežās. No tā brīža uz turpmāk jūs tālvadības vadības normāli un darbības kolonna ieraksta, ko jūs komandējāt.

Būt godīgs par šo ceļu: izlīdzināšanas braukšana un griezes momenta ieguļošana ir vismazāk pārbaudītā cilpas daļa uz reālas aparatūras. Testējiet ieguļošanu lēnā, nekaitīgā pozā, pirms paļaujaties uz to palaišanā, par kuru jūs rūpējaties. Vadības roka rada gludākos labojumus no trim režīmiem un arī visvairāk, kas var kļūt nepareizi mehāniski.

Bez vadības rokas: klaviatūra un slīdņi

Lielākā daļa cilvēku, kas to lasa, pieder vienai rokai. Pietiek. Izvēlieties klaviatūras vai slīdņa ievadi brīdī, kad nospiediet Pārņemšana, un pārņemšana ir tūlītēja un manuāla - nav otrās rokas, kuru izlīdzināt, tāpēc nav izlīdzināšanas soļa. Sekotājs turpina savu pozīciju un gaida ievadi.

Ievades režīmsKā roka kustasPer-call ierobežojums, ko izmanto serverisBloķēts, kad
Vadības rokaSpogulis vadības sekotāju no vadības savienojuma leņķiemBez pīķa vai iestata zvanu šajā režīmā; spogulis raksta sekotāja mērķus nepārtrauktiNekad nav bloķēts, un tas ir noklusējums, ja nav dota ievades režīma - bet tas ir jāpieciešama otrā roka; bez vadības identifikatora pārņemšana tiek atteikta
KlaviatūraRelatīvs brīdinājums katram pogas nospiešanai, sūtīts uz pārņemšanas brīdinājuma galapunktuCietā spiegošana 2 grādu leņķī uz savienojumu, 4 grādu griferimAtteikts ar 409, ja pārņemšana tika sākta vadības režīmā
SlīdņiAbsolūts mērķa stāvoklis, sūtīts uz pārņemšanas iestata galapunktuVisvairāk 6 grādu ceļojums uz mērķi uz zvanu; saskarne turpina sūtīt apmēram desmit reizes sekundēAtteikts ar 409, ja pārņemšana tika sākta vadības režīmā

Spiegošana tiek pieprasīta serverī, nevis saskarnē, jo nepareiza delta uz kopnes servomotora rokas ir sadursme. Klaviatūras labojumi nāk pakāpeniski un nedaudz rupji; slīdņu labojumi ir gludāki, jo serveris pastaigājas pret mērķi, kamēr skaņa turpina straumi. Jebkurā gadījumā darbības kolonna saņem pilnu komandēto pozīciju vektoru un intervences atzīmēšana ir identiska vadības ceļam, tāpēc klaviatūras labojumi nonāk tajā pašā datu kopā bez formāta atšķirības.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Tāds pats pogu izkārtojums kā citur kopā, tāpēc muskuļa atmiņa no ierakstīšanas pārneses.
Apmācības vadītājs, kas parāda GR00T pielāgošanas palaišanas pasūtītos soļus uz SO-100 datu kopas
Apmācības cilpas apmācības puse ir tāda pati vadītā secība kā pirmais palaišana; tikai kontrolpunkta lauks atšķiras.

Kad nospiest pogu

Agri, nevis vēlu. Labojums, kas sākas pēc tam, kad grifērs ir aizvērts uz neko, māca atveseļošanu no kļūmes, ko politika nebūtu jāiespiež, un atveseļošanas dati ir vērts daudz mazāk nekā izvairīšanās dati. Pārraugi brīdī, kad esi pārliecināts, ka trajektorija ir nepareiza, laboji caur grūto daļu, nodod atpakaļ, tiklīdz stāvoklis ir viens, ko politika jau apstrādāja. ThriftyDAgger automatizē šo lēmumu, vārtējot iejaukšanās par novelty un aprēķināto risku ar fiksētu cilvēka budžetu, bet uz vienas rokas ar cilvēku jau skatošo, cilvēka vārti ir lētāks un labāk kalibrēts nekā jebkas, ko tu nolamāsi.

Iespējams ar atvērtā koda kaudzi un dažiem skriptiem. Tas, ko tas maksā, ir grāmatvedība, un grāmatvedība ir vieta, kur DAgger kārtas mirst.

  1. Rakstiet kadrus no jūsu paša secinājumu skriptu LeRobot datu kopā, ar uzdevuma virkni, uz ko politika tika apmācīta.
  2. Pauzējiet politikas cilpu, pārslēdziet komandas avotu un atzīmējiet katru kadru, ko brauc kā intervenci. Bez karoga, labojumi izskatās kā parastie demonstrējumi.
  3. Apzinīgi nolemt, kas notiek ar pārejas kadriem starp politikas vadības izlaišanu un jūsu pirmo ievadi.
  4. Glabājiet labojumus savā datu kopā uz politiku un izsekojiet episodu indeksus ar roku, tāpēc jaukums var tikt rekonstruēts.
  5. Norādiet pielāgošanas ievades punktu uz iepriekšējo kontrolpunktu un pārbaudiet žurnālā, ka tas ielādēja šos svarus.

3. solis detalizēti: triage lemj par kvalitāti

Pēc palaišanas jums ir ieraksts ar dažiem kadriem, kas atzīmēti kā intervences. Pastāv trīs galamērķi, un nepareizais klusi saindē nākamo kārtu.

  • Iesniedziet kā labojums, kad intervence bija īsts labojums: politika bija virzās kaut kur nepareizs un jūsu ievade parādīja pareizo lietu no stāvokļa, ko paša politika izraisīja.
  • Paturējiet kā vērtēšanu tīriem autonomiem palaišanām un palaišanām, kuras paņēmāt pāri piesardzībai. Vērtēšanas episodes ir tas, kā jūs mēra nākamo kontrolpunktu, un viņi nekad nedrīkst tikt apmācīti.
  • Izmetiet palaišanas, ko saslimis ar kaut ko nesaistītu - noraidītu kameras kadru, stāvējušu servomotoru, objektu, kuru jūs iespēlējāt. Nekārtīgs labojums ir sliktāks nekā bez labojuma.
Iesaldēto kadri pieder pie neapstrādāta ieraksta, nevis apmācības datos

Starp politikas vadības izlaišanu un jūsu pirmo ievadi, roka turpina stāvēt, bet ierakstītājs turpina rakstīt - identiskas pozas sērija, kas pārī ar nedaudz atšķirīgiem attēliem. Šeit šie ieguļošanas kadri paliek neapstrādātā ierakstā un ārpus labojuma datu kopas. Ja jūs būvējat cilpu sevi, izgrieziet tos apzināti: politika, kas apmācīta uz tiem, māca pauzēt, kur tā būtu jādarbojas.

5. solis detalizēti: jaukuma komponēšana

Komponēšana ņem oriģinālo datu kopu plus labojuma datu kopu un rada jaunu, parasto LeRobot datu kopu kas apmāca, kā jebkura cita. Svarīgā īpašība ir tā, ka episodu atlase ir nepārprotama uz avota - neko nav automātiski jaukts. Tas izklausās mazāk nozīmīgi, līdz pirmajam reizējam politika izskatās dīvaini un jums ir jārekonstruē, uz ko tā tika apmācīta.

Atvērtais jautājums ir attiecība, un nevienam nav numura, kas pārnests. Tas, ko literatūra piekrīt, ir tas, ka labojumi jāskaita par vairāk nekā to kadru daļa. Mandlekar et al. pālaist iteratīvi uz datiem, kurus to iejaukšanas sistēma savāc, tāpēc politika māca šķērsot šauros grīdas, un ziņo, ka aģenti, kas apmācīti šādā veidā, pārspēj aģentus, kas apmācīti uz līdzvērtīgu paraugu skaita no ne-intervences demonstratoru. Sirius iet tālāk un pārsverot apmācības paraugus ar aprēķinātu cilvēka uzticību, ziņojot par 8 procentu pieaugumu simulācijā un 27 procentu reālā aparatūrā politikas panākumu likmi pret metodēm, ar ko tā salīdzina, divas reizes ātrāku konverģenci. Neviena no apmācības ievades punktiem, kas šeit ir iekļauti, neatklāj parauga-svēršanas pogu, tāpēc kruda aizstāvēšana ir paturēt katru labojuma episodi, kamēr subsample oriģinālajiem demonstrācijiem - un rakstīt uz to, ko jūs darījāt.

Datu kopas ierakstīšanas skats, kas parāda SO-100 datu kopas episodes ar kameras straumēm
Labojuma episodes ir parastās episodes ar per-frame intervences karogu, tāpēc viņi komponē ar oriģinālo datu kopu bez konversijas.

6. solis detalizēti: ko turpināšana no kontrolpunkta patiesi nozīmē

Apmācības jaukums no bāzes modeļa darbojas, bet izmeta iepriekšējo kārtu un maksā pilnu palaišanu. Turpinājums no iepriekšējā kontrolpunkta ir ātrāks un parasti labāks. Tas ir arī ierobežotāks nekā frāze iesaka.

Svara inicializācija nav optimizatora atsākšana

Tikai svaru kontrolpunkts satur parametrus un neko citu. Tās ielāde nākamajam palaišanai dod labāku sākuma punktu nekā bāzes modelis, bet optimizatora momenti, mācības ātruma grafika pozīcija un datu kārtība visi sākas no nulles. Parasti pagaidā zaudējuma šūpuļus palaišanas sākumā, neleciājiet to kā neveiksme, un nelieciet cilpu atsākšanu. Tas ir silts sākums.

PolitikaLielumsGPU līmenisSecinājumi uz darbības soliDatu kopas formātsEpisodes pirms tam, kamēr tas ir vērts mēģināt
GR00T N1.7apmēram 3 B, aptuveni 40 M apmācīta pielāgošanas laikāA100 80 GB vai H100 80 GBapmēram 152 msLeRobot v2.0 vai v2.150
GR00T N1.5apmēram 3 BA100 80 GB vai H100 80 GBapmēram 165 msLeRobot v2.0 vai v2.150
Pi0.5apmēram 3 B uz PaliGemma mugurkauliemA100 80 GB vai H100 80 GBapmēram 485 msLeRobot v3.050
SmolVLAapmēram 450 MRTX 4090 vai jebkura 24 GB kartiapmēram 245 msLeRobot v3.030
ACTapmēram 80 M, apmācīts no nullesRTX 4090 vai jebkura 24 GB kartiapmēram 20 msLeRobot v3.050

Latence saplūst DAgger cilpā tā, kā tā nedarbojas demonstrācijas laikā: aptuveni 485 ms uz darbības soļa jūs pārņemat, jo roka vilcinājās, nevis jo tā bija nepareiza, un vilcinājumu labojumi nav noderīgs apmācības dati. Ja jūs atkārtojat datus, nevis ejat uz gala panākumu likmi, atkārtojiet uz ātra modeļa. Shukor et al. apraksta SmolVLA kā noformēts, lai apmācītos uz vienas GPU un uzstādītu uz patērētāju GPU vai CPU, ar asinhron secinājumu kaudzi, kas atdala darbības prognozi no izpildes, lai ļautu augstākas kontroles likmes - īpašums, kas turpina ieguļošanas cilpu atsaucīgu.

Datu kopas formāti nav aizstājami. GR00T ņem LeRobot v2.0 vai v2.1, un Isaac-GR00T repozitorijs apraksta tā ievadi kā LeRobot v2 formāta gaumi ar pievienotu modalitātes apraksta datni; jaunākie treneri šeit sagaida v3.0. Jaukums, kas salikts nepareizā versijā, neizdodas pie ielādes laika, nevis radot nepareizu politiku - labākā neveiksmes režīma, joprojām izsmiestā rindā spailes. Šis datu kopas dokumentācija norāda, kurš formāts katrs trenēšanas vērtnieks ņem.

Cilpa, ar grāmatvedību jau veiktu

Ieguļošana ar vadības roku, klaviatūru vai slīdņiem; per-frame intervences marķēšana; failu palaišana kā labojumi vai vērtēšanas; jauktas datu kopas komponēšana ar skaidru episodu atlasi uz avota; un turpinājums apmācību no kontrolpunkta, nevis bāzes modeļa. Tas, kas paliek jūsu lēmumiem, ir kura palaišana skaita kā labojums, kas iet jaukumā, un kad intervences likme ir pārstājusi krīt.

Skatieties, kā DAgger cilpa ir pievienota

Četri veidi, kā izkāraut kārtu

1. Apmācība tikai labojumos

Visbiežākā neveiksme un pielāgošanas sadusmojums. Tikai labojuma datu kopa ir gandrīz pilnībā uzdevuma grūtā vidus daļa, ar tuvinājumu un atsaiti pazudusi; politika kļūst labāka grūtā daļa un aizmirst, kā tur nonākt. Agregācija nav metodes detaļa, tā ir mehānisms: vecais dati ir tas, kas turpina atpūtu uzvedību vietā, kamēr labojumi pārvietojas viena daļa.

2. Kameras pārvietošana starp kārtām

Kamera, kas novirzās divi centimetri starp kārtām, rada politiku sliktāku nekā tā, ar ko tu sāki, un diagnozi, kas maksā dienu. Katrs VLA šeit atkarīgs no attēliem; savienojuma stāvoklis vienatnē neatšķir, kur objekts atrodas. Fotografējiet iestatījumu pirms pirmās kārtas un pārbaudiet šo fotogrāfiju pirms katra vēlākā.

3. Ļaušanas ieguļošanas artefaktiem apmācības datiem

Iepriekš apskatīts un uz saraksta, jo tas ir neredzams. Simptoms ir politika, kas apstājas daļas sekundē tieši tur, kur iepriekšējās kārtas operators pārņēma. Tas izskatās kā vilcinājums; tas ir imitācija.

4. Silta sākuma izsaukšana kā atsākšana

Ja ticēsiet, ka optimizatora stāvoklis pārnests, sākotnējais zaudējuma kritiens lasa kā kļūme un jūs dodaties meklējumā pēc bojātas datas. Ja jūs zināt, ka optimizators sāka svaigi, kritiens ir paredzēts un jūs skatāties, kas nāk pēc tā. Tādi paši skaitļi, pretēji secinājumi.

Kārtas mērīšana

Metrika cilvēka kontrolētai cilpai ir intervences likme: kadri, kas tika ierakstīti, kamēr tu biji vadībā, dalīti ar kopējiem palaišanas kadriem. Tas ir ieguļošanas stāvoklī, un tas ir vienīgais numurs, kas atbild uz jautājumu, ko kārta jautāja. Apmācības zaudējums krīt, neatkarīgi no tā, vai politika uzlabojās; panākumu likme ir binārā un troksnaina vidējā rīkojuma lielumā, ko galda roka ražo. Intervences likme ir nepārtraukta, mērīta uz stāvokļiem, ko paša politika izraisīja, un tas krīt, jo politika jums mazāk vajag.

Salīdziniet to tikai palaišanās, kas ierakstītas identiskos apstākļos. Pilnā argumentācija un kā uzbūvēt vērtēšanas kopu, kas pārdzīvo vairāk nekā divas kārtas, ir rakstā par DAgger cilpas mērīšanu. Pirmā kārta ir reālistiski iespējamības pārbaude: jūs pārbaudāt, ka ieguļošana darbojas uz jūsu aparatūras, ka labojumi nonāk ar to karogiem un ka turpinātā palaišana ielādēja kontrolpunktu, ko nosaucāt. Otrā un trešā kārta ir vieta, kur likme sāk pārvietoties. Ja tā nav pārvietojas pēc ceturtās kārtas, problēma ir DAgger augstāko.

Rakstiet uz kārtasKāpēc tas svarīgi vēlāk
Kontrolpunkts, kas tika brautsBez tā jūs nevarat attiecināt uzlabojuma uz jaukumu
Ievades režīms, ko izmanto ieguļošanaiKlaviatūras labojumi ir rupjāki nekā vadības labojumi, un tas ir redzams datos
Palaišanu skaits un kā katrs tika triageVai kārtai bija pietiekami labojumu, lai tas svarīgi
Intervences likme uz palaišanu un vidējāCilpas progresa metrika
Precīza episodu atlase uz avotaVienīgais veids, kā reproducēt vai atsaukt kārtu
Silts sākums vai jauna apmācībaPaskaidro zaudējuma līkni, ko tu redzēsi nedēļas pēc tam

Ja jums vēl nav kontrolpunkta

Cilpa nav ievades punkta bez tā. Ierakstiet pirmo datu kopu, apmāciet pirmo politiku, palaistiet to - ierakstīšana, apmācība un politikas palaišana segt šo ceļu. Ierakstīšanas klients ir uz lejupielādes lapas, GPU līmeņi un stundas likmes uz cenu lapas, un kā izmantojama episodi izskatās SO-100 datu vākšanas vadītājs. Iegūstiet demonstrācijas pareizas pirms labojumiem: DAgger ir remonta mehānisms, un tas darbojas daudz labāk uz kaut ko, kas jau bija gandrīz pareizs.

Vai es varu palaist DAgger cilpu bez vadības rokas?

Jā. Izvēlieties klaviatūras vai slīdņa ievadi, kad nospiediet Pārņemšana: pārņemšana ir tūlītēja un manuāla, bez otrās rokas, kuru izlīdzināt. Klaviatūra sūta relatīvus brīdinājumus, ko serveris stingri spiež 2 grādu leņķī uz savienojumu un 4 griferim; slīdņi sūta absolūto mērķi un serveris pārvietojas visvairāk 6 grādu uz mērķi uz zvanu, kamēr skaņa turpina straumi. Darbības kolonna un intervences marķēšana ir tādi paši kā vadības režīmā, tāpēc labojumi ir neatšķirami datu kopā.

Cik labojumi vienai kārtai ir nepieciešami?

Nav aizstāvamas universālas numura, un kadru skaitlis ir svarīgāks nekā episodu skaitlis. Darba noteikums ir tas, ka labojumi nedrīkst pazust jaukumā: ar 200 oriģinālajām episodēm un trim labojuma episodēm neieks neieks. Mērķis labojumiem, kas segs nepareizo uzvedību no dažādām sākuma konfigurācijām, nevis trīs vienas un tās pašas glābšanas atkārtojumi.

Kāpēc apmācība tikai labojumos ir tik slikta ideja?

Jo labojumi ir gandrīz pilnībā uzdevuma grūtā vidus daļa. Tuvinājums, izlīdzināšana un atsaite ir pazudusi, tāpēc politika zaudē, ko tā jau ieguva labi, uzlabojot daļu, kuru tu nolaboji. Veca datu paturēšana un pievienošana ir mehānisms pats, nevis neobligāts papildinājums.

Vai turpināšana no kontrolpunkta atsāk iepriekšējo apmācības palaišanu?

Nē. Tikai svaru kontrolpunkts atjaunina parametrus un neko citu: optimizatora momenti, mācības ātruma grafika pozīcija un datu kārtība sākas svaigi. Tas ir silts sākums, un sākotnējais zaudējuma kritiens ir paredzēts, nevis simptoms. Rakstiet uz to, kurš no abiem jūs faktiski darījāt, tāpēc jūs lasāt līkni pareizi nedēļas pēc tam.

Kas notiek, ja intervences likme neparādās?

Pārstājiet pievienot kārtas. Plakana likme nozīmē, ka labojumi nemāca, ko tu domā. Parastie cēloņi ir augstāko: kamera pārvietojās, labojumi sākas par vēlu, lai būtu izvairīšanās dati, ieguļošanas kadri ir apmācības kopā, vai uzdevums ir nepārdefinēts no novērojumiem, ko politika faktiski iegūst.

Neviens no šiem nav atrisināta problēma un neviens no tiem nav viens klikskis. Interaktīvā imitācijas mācīšanās ir aktīva pētniecības joma tieši tāpēc, ka tās jautājumi - kad iejaukties, kā nosvērt, ko cilvēks darīja, cik daudz veca datu paturēt - nav nolemtas atbildes; apsekojums Celemin et al. kartē, kas joprojām ir atvērts. Tas, kas cilpai ir, ir mērāma konverģence, ja tā tiek palaista uzmanīgi, uz aparatūras, kas maksā dažus simtus eiro. Iesaldējiet iestatījumu, iejaucitēs agri, triage godīgi, jaukiet apzināti un ierakstiet intervences likmi katru reizi.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started