SO-100 odav robotkäsi kirjatöölaual, mis on seatud teleoperatsioonile ja poliitika koolitusele
DAggerSO-100JäljendusõpeVLATeleoperatsioon

DAgger-silmuse käitamine SO-100-l VLA-poliitikaga

AY-Robots ResearchAugust 27, 202615 min lugemine

Üksikasjalik kirjeldus ühest inimese valitud DAgger-ringist SO-100 käel: käivitage poliitika ja salvestage see, võtke üle, kui midagi läheb valesti, salvestage käik korrektsiooni failina, koostage segatud andmestik ja jätkake koolitust kontrollpunktist. Sisaldab klaviatuuri- ja liuguriteed ülevõtmiseks inimestele ilma juhi käeta ning neli viga, mis teeb ringist kasutuseta.

Teie poliitika käivitatakse. See ulatub kuubiku järele, sulgeb pihveri sentimeetri võrra liiga vara ja jätkab nagu oleks see käes võetud. Midagi ei läheb valesti ja isegi kadumise treenimisvigadele vaatamine ei selgita seda. Parandus ei ole veel 20 000 gradiendi sammu samadel näidistel. See on tagasi panna käsi käele täpselt siis, kui midagi läheb valesti, salvestada, mida sa tegid, ja treenida järgmist kontrollpunkti vana andmete pluss selle parandusega. See on DAgger-ring ja siin näidatakse kuidas üks käivitatakse SO-100 abil nägemuskeele-tegevuse poliitikaga.

Teooria on mujal: miks andmestiku kogumine üldse toimib ja mida inimese valimine selle juures muudab. See on käitusjuhend ja see eeldab koolitatud kontrollpunkti, toimivat kaamerate komplekti ja kätt, mis liigub. Kuus sammu allpool on silmused nii nagu need on rakendatud selle platvormi DAgger-lehel, aga järjestus on sama teie omaenda skriptides.

Üks ring lühidalt

  • Käivitage koolitatud poliitika ja salvestage see käigu tekstiga, mitte üldise teleoperatsiooni etiketiga.
  • Võtke üle hetkel, kui käitumine läheb valesti: peeglite käigus juhi käega, kohene ja käsitsi klaviatuuri või liugurite kaudu ilma juhi käeta.
  • Sorteerige iga käik: salvestage see parandusena, hoidke seda hindamise episoodina, või visake ära.
  • Koostage segatus käsitsi – algandmed pluss parandused, episoodid valitud allikate kaupa. Kunagi ärge treenige paranduste pealt ainult.
  • Jätkake treenimist viimase kontrollpunkti järel ja märkige üles, milline kontrollpunkt tootis millise segamise.
  • Arv, mis ütleb, kas ring oli miski väärt, on sekkumise määr, mitte treenimisviga.

Miks teine ring ei ole lihtsalt rohkem andmeid

Käitumise kloonimine treenib seisundeid, mida inimene külastas. Testimisajal käi poliitika seisundes, mida see põhjustab, ja väikesed tegevuse vead summeeruvad seisundites, millele ükski näide ei kattonut. Ross, Gordon ja Bagnell formaliseerisid selle nurjumise AISTATS 2011 jaoks ja vastasid sellele iteratiivse algoritmiga, mis treenib statsionaarse determineeritud poliitika ja nende taandamise all peab toimima hästi seisundijaotuses, mida see tekitab: käivitage praegune poliitika, lase inimesel märgistada seisundid, mida ta tegelikult jõudis, lisage need andmestikule, treenige uuesti, korrake. Kelly jt tegid päringu praktiliseks HG-DAgger abil, kus inimene otsustab, millal kontrolli üle võtta, selle asemel, et märgistada seisundeid ilma kontrollita; nad teatavad paremast sooritusest nii DAgger-i kui jäljendusõppe üle simuleeritud ja tõelisele autonoomse sõidu ülesandele. Inimese valimine on see, mis muudab silmuse tolereeritavaks kirjatööla käel – liigutate käsi ainult siis, kui midagi läheb valesti.

Kaks tagajärge on praktikas tähtsam kui teooria ise. Parandused ei ole tavalised näidised: nad koonduvad Mandlekari jt kirjeldatud pudelikaela piirkondadele, kus väike kõrvalekalle laskab poliitika seisundes, millele kunagi näidiseid ei andnud. Ja andmestik, mis on valmistatud ainult nendest raskest osast, on halvasti kujundatud andmestik – Belkhale, Cui ja Sadigh väidavad andmete poolelt, et seisundi mitmekesisus ei ole alati kasulik, ja et tegevuse lahknevus ja ülemineku mitmekesisus otsustavad andmestiku kvaliteedi. Segatud andmestik ei ole kompromiss, see on punkt.

Külmutage need enne esimest ringi

DAgger-ring võrdleb poliitika iseenesega aja jooksul. Kõik muu, mida muudate ringide vahel, mis ei ole andmestik, teeb selle võrdlemise mõttetus.

  • Kaamerate asendid ja paigaldus, koos käe otsas oleva kaameral. Lahti ühe pinceri ja te muutsite vaatluse jaotust, mitte poliitikana.
  • Eksponeerimine ja valge tasakaal, kui teie püüdmisstakk lubab neid kinnitada. Automaatne eksponeerimine muutumine ringide vahel on aeglane, nähtamatu valdkonna nihe.
  • Käe kalibreerimine ja servo-nullipositsioonid. Kui peate uuesti kalibreerima, käsitlege kõiki salvestusi enne seda eraldi andmestikuna.
  • Ülesande tekst. Iga VLA siin tingib sellele; selle sõnastamine silmuse keskel on erinev ülesanne.
  • Valgus, laua pind, objektide komplekt. Uus objekt on uus eksperiment, mitte järgmine ring.
  • Salvestamise kaadri kiirus. Sekkumise määra võrdlemine kahe valimise rasvaga tekitab erinevused, mis tulevad rastrist.
Käe otsas olev kaamera ei ole valikuline sisustusvariis

Hsu jt võrreldasid käe-keskselt vaadet tavalisel kolmanda isiku vaatega ja leidsid, et silma-käe perspektiiv parandas järjepidevalt treenimistehokkust ja väljast jaotamise üldistamist, vaatamata vähemale stseeni nägemisele. Viisil käel pinceri ajastus on tavaliselt see, mida teie parandused parandavad, ja pinceri ajastus on see, mida käe otsas olev vaade kannab.

Ring, lõpuni

  1. 1
    Käivitage järeldus ja salvestage see

    Alustage käiku kontrollpunkti vastu, mida soovite parandada, seejärel alustage salvestamist järelduse juure. Nii salvestatud see pärib käigu enda ülesande teksti, mis on see, millele poliitika oli koolitatud, mitte vaikimisi teleoperatsiooni etikett. Ilma salvestamiseta saate vaadata ebaõnnestumist, kuid mitte sellega treenida.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Võtke üle, kui midagi läheb valesti

    Vajutage Võta üle ja valige sisendirežiim: juhi käsi, klaviatuur või liugur. Runner pausib, te korrigeerite, te annate tagasi. Kaadrid, mis salvestatakse ajal, kui te sõitsite, on märgitud sekkumistena automaatselt.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Sorteeri episoodid

    Otsustage episoodi kaupa: salvestage parandusena, hoidke hindamisena, või visake ära. Käik, mille poliitika lõpetas ilma abita, on hindamise andmed.

  4. 4
    Sünkrooni paranduste andmestik

    Parandused kogunevad kohaliku andmestikuna poliitika kaupa ja lähevad pilvesalvestusse automaatse sünkrooniga. Midagi segatakse, mida te sinna ei pannud.

  5. 5
    Koostage segatud andmestik

    Kombineerige algandmestik paranduste andmestikuga, valides episoodid selgelt allikate kaupa. Tulemus on sellest edasi tavapärane andmestik.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Jätkake koolitust kontrollpunktist

    Treenige segamist eelmisest kontrollpunktist mitte baasmudelid. Märkige üles, milline kontrollpunkt ja milline segamine; ilma selle paarita ring ei ole korratav.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Samm 2 detailides: kaks ülevõtmise viisi

Juhi käega

Sees juhi-järelija režiimis on ülevõtmine käigus kahe käe vahel, mis ei ole samas asendis. Võta üle-nupu vajutamine pausib runneri ja viib juhi järelija praeguse asendisse, nii et midagi ei hüppe, kui pöördemoment üle kanda. Kui see joondamiskäik aegub, joondage juht käsitsi ja vabastate ainult siis, kui need on viie kraadi sees. Sealt edasi teete teleoperatsiooni tavaliselt ja tegevuse veerg kirjutab üles, mida te käskisite.

Ole siis aufrichtigkeit selle tee kohta: joondamiskäik ja pöördemoment käigus on kõige vähem testitud osa ringist reaalsel riistvarel. Testige käigus aeglasel, kahjutu asendil enne kui loote sellele käigule käigus, mida te hoolite. Juhi käsi tekitab kolmest režiimist silmatorkavamad parandused ja ka kõige, mis võib mehaaniliselt valesti minna.

Ilma juhi käeta: klaviatuur ja liugur

Enamik inimesi, kes seda loevad, omavad üht kätt. See on piisav. Valige klaviatuur või liugurite sisend hetkel, kui vajutate Võta üle, ja ülevõtmine on kohene ja käsitsi – teise käe joondamiseks pole, seega pole joondamise sammu. Järelija hoiab oma asendis ja ootab sisendeid.

SisendirežiimKuidas käsi liigubKõne kohta piirang serveriga jõustatudLukustatud, kui
Juhi käsiPeeglid viivad järelija juhi liigeste nurkadestPole nõelata või seadistada kõnesid selles režiimis; peeglid kirjutavad järelija sihid pidevaltKunagi lukustatud pole ja vaikeaine, kui sisendirežiimi ei anta – aga see vajab teist kätt; ilma juhi tunnuseta ülevõtmine keeldutakse
KlaviatuurSuhteline lükk klahvi kohta, saadetud ülevõtmise nõelata otspunktiKõva klamp 2 kraadi liigeste kohta, 4 kraadi pinceri jaoksTagasi lükatud 409-ga, kui ülevõtmine alustati juhi režiimis
LiugurAbsoluutne sihiasend, saadetud ülevõtmise seadistamise otspunktiMaksimaalselt 6 kraadi sihipunktis; liides saadab umbes kümme korda sekundisTagasi lükatud 409-ga, kui ülevõtmine alustati juhi režiimis

Klambid on serverarvul jõustatud, mitte liideses, sest valesti tipitud delta bussi-servo käes on kokkupõrge. Klaviatuuri parandused tulevad astmeliselt ja pisut jämedalt; liugurite parandused on sujuvamad, sest server liigub sihipunktis, kuigi liides jätkab voolamisega. Mõlemal juhul saab tegevuse veerg täisköitatud asendvektori ja sekkumise märgistamine on sama nagu juhi tee, nii et klaviatuuri parandused maanduvad samasse andmestikku ilma vorminguerinevuseta.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Sama klahvikoor kui kõik mujal virnas, nii et lihase mälu salvestamisest kannatab edasi.
Treeningujuhend näitab GR00T peenahäälestuse käigu järjestatud samme SO-100 andmestikul
Treenimisel käik on sama juhitud järjestus kui esimene käik; ainult kontrollpunkti väli erineb.

Millal nupp vajutada

Varakult, mitte hilja. Parandus, mis algab pärast pinceri sulgumist tühjale, õpetab otsastamist nurjumisest, mida poliitika ei olnud pidanud sisse minema, ja otsastamise andmed on palju vähem väärt kui vältimine andmeid. Peatage hetkel, mil te olete kindel, et trajektoor on vale, parandage rasket osa, andke käest üle niipea, kui seisund on üks, mida poliitika käsitles enne. ThriftyDAgger automatiseerib selle otsuse uudsuse ja hinnangulise riski värava kaudu fikseeritud inimese eelarve, aga ühe käe peal inimesega vaatava, inimese värav on odavam ja paremini kalibreeritud kui midagi, mida te häälestab.

Teostav avatud allikate virnas ja mõnede skriptidega. Mis see maksab on raamatupidamine, ja raamatupidamine on koht, kus DAgger-ringid surevad.

  1. Kirjutage kaadrid oma järelduse skriptist LeRobot andmestikku, ülesande stringiga, millele poliitika oli koolitatud.
  2. Peatage poliitika silmused, vahetage käskude allikat ja märkige iga kaader, mille te sõitsite sekkumisena. Ilma lipu, parandused näevad välja tavaliste näidisena.
  3. Otsustage tahtlikult, mis juhtub ülemineku kaadritega poliitika vabastamise ja teie esimese sisendi vahel.
  4. Jätke parandused nende enda andmestikku poliitika kaupa ja jälgige episoodi indeksite kaupa käsitsi nii et segamine on taasehitatav.
  5. Osutage peenahäälestamise sisendpunkti eelmisele kontrollpunktile ja kontrollige logi, et see laadis need kaalud.

Samm 3 detailides: sorteerimine otsustab kvaliteedi

Pärast käiku on teil salvestis mõnede kaadrite järgi märgistatud sekkumistena. Kolm sihikohta on olemas ja vale pealegi vaikselt mürgitab järgmist ringi.

  • Salvestage parandusena, kui sekkumise oli tõeline parandus: poliitika oli minetama minemise ja teie sisend näitas õiges asjas seisundi, mille poliitika ise tootis.
  • Hoidke hindamise jaoks puhtaid autonoomseid käike ja käike, mille te kontrolli võtsite ettevaatusest. Hindamise episoodid on kuidas te mõõdate järgmist kontrollpunkti ja neid ei tohi kunagi treenida.
  • Visake ära käigud, mille midagi seotamatu hävitas – langev kaadri, seisev servo, objekt, mille te ümber lõid. Segane parandus on halvem kui parandus.
Külmutatud kaadrid kuuluvad toorele salvestisele, mitte treenimisel andmeid

Poliitika vabastamise ja teie esimese sisendi vahel hoiab käsi paigal, samas kui salvestaja jätkab kirjutamisega – joostus identse asendiga, kuid pisut erineva pildiga. Siin need käigus kaadrid jäävad toorele salvestisele ja välja paranduste andmestikust. Kui koostad silmuse ise, lõika nad tahtlikult: poliitika, mis neid õpib, õpib pausama kus ta peaks toimima.

Samm 5 detailides: segamise koostamine

Koostamine võtab algandmestiku pluss paranduste andmestiku ja toodab uue, tavalise LeRobot andmestiku mis treenib nagu igakski teine. Oluline omadus on et episoodi valimine on selge allikate kaupa – miski ei segu automaatselt. See kõlab väike, kuni esimest korda poliitika käitub kummaliselt ja sa pead taasehitama, millele see oli koolitatud.

Avatud küsimus on suhe ja keegi pole arvut, mis kandub. Mida kirjandus nõustub on et parandused tuleks arvestada rohkem kui nende kaadri osakaal. Mandlekar jt treenivad uuesti iteratiivselt andmetel, mida nende sekkumise süsteem kogub, seega õpib poliitika ületama pudelikaelad ja teatavad et agendid, mida nii koolitatud, ületavad agendid, mida koolitatud samahulgal näidete mitteintervensionaalsilt demonstraatoritelt. Sirius läheb kaugemale ja kaalub treenimisnäidiseid ligikaudse inimese usaldusega, teatavad 8 protsendilise kasvu simulatsioonis ja 27 protsenti reaalsel riistvarel poliitika edukuse määras võrreldes meetoditega, mille see võrdleb, kaks korda kiiremal koondumistel. Ükski treenimisel sisendpunkt siin ei avalda näidistekaalu nuppu, seega on toore asendus hoida iga paranduse episoodi samal ajal alamproovida algandmeid – ja kirjutada üles, mida te tegite.

Andmestiku salvestusvaade näitab SO-100 andmestiku episoode koos kaamera voogedega
Paranduse episoodid on tavalisest episoodidest per-kaadri sekkumise lipu abil, seega segavad algandmestikuga ilma muunduseta.

Samm 6 detailides: mis jätkumine kontrollpunktist tegelikult tähendab

Segamise treenimine baasmudelid töötavad aga visavad ära eelmise ringi ja maksab täisringi. Jätkumine eelmises kontrollpunktis on kiirem ja tavaliselt parem. See on ka piiratum kui fraas viitab.

Kaalu lähtestamine ei ole optimeerijate otsus

Ainult kaaludega kontrollpunkt sisaldab parameetreid ja midagi muud. Selle laadimine annab järgmisele käigule paremale väljastus baasmudelint kui, aga optimeerijate momendid, õppimisel määra ajakavalise asukoha ja andmestiku järjekord kõik algavad nullist. Oodata kaotuse tõus käigu alguses, ärge lugege seda ebaõnnestumisena ja ärge kutsuge ringi otsuse. See on soe algus.

PoliitikaSuurusGPU taseJäreldus tegevuse sammu kohtaAndmestiku vormingEpisoodid enne kui see on väärt proovida
GR00T N1.7umbes 3 B, umbes 40 M koolitatud peenahäälestuse ajalA100 80 GB või H100 80 GBumbes 152 msLeRobot v2.0 või v2.150
GR00T N1.5umbes 3 BA100 80 GB või H100 80 GBumbes 165 msLeRobot v2.0 või v2.150
Pi0.5umbes 3 B PaliGemma selgroolA100 80 GB või H100 80 GBumbes 485 msLeRobot v3.050
SmolVLAumbes 450 MRTX 4090 või ükskik 24 GB kaartumbes 245 msLeRobot v3.030
ACTumbes 80 M, koolitatud nullistRTX 4090 või ükskik 24 GB kaartumbes 20 msLeRobot v3.050

Latentsus kombineerib DAgger silmuses viisil, kuidas see ei demo käigus: umbes 485 ms tegevuse sammu kohta te võtate üle sest käsi kõhkles, mitte sest see oli vale, ja kõhklemise parandused ei ole kasulik treenimisel andmed. Kui te itererete andmetel mitte jahildus lõplikul edukuse määral, itereeruta kiire mudeli peale. Shukor jt kirjeldavad SmolVLA kui disainitud ühe GPU-l treenimiseks ja juurutamise tarbijale GPUadele või CPU-dele, asynkroonne järeldus virnas, mis eraldab tegevuse ennustamise teostamisest, et lubada kõrgemale kontrolli määrad – omadus, mis hoiab ülevõtmise silmuse vastamise.

Andmestiku vormingud ei ole vahetav. GR00T võtab LeRobot v2.0 või v2.1 ja Isaac-GR00T tarkvaraleht kirjeldab selle sisendust LeRobot v2 vormingu maitsena lisatud modallisusel kirjeldamise failiga; uuemad treenijad siin ootavad v3.0. Segamise koostamine valel versioonil nurjub laadimisajal mitte poliitika tootmine – parem nurjumise režiim, siiski raiskatud järjekorrakoht. andmestiku dokumentatsioon loetleb millised vormingud iga treenija võtab.

Silmused raamatupidamiseta

Ülevõtmine juhi käega, klaviatuuriga või liugritega; per-kaadri sekkumise märgistamine; käikude salvestamine paranduste või hindamistena; segatud andmestiku koostamine selge episoodi valikuga allikate kaupa; ja jätkamine treenimsit kontrollpunktist mitte baasmudelid. Mis jääb teie otsuseks on milline käik loetakse paranduseks, mis kuulub segamisesse ja millal sekkumise määr on peatanud kukkumise.

Näe kuidas DAgger silmused on juhtmestatud

Neli viisi ringi raisata

1. Treenimine paranduste pealt ainult

Kõige tavalisem ebaõnnestus ja kõige ahvatlev otsetee. Paranduse-ainult andmestik on peaaegu terve rasked keskel ülesandest, lähenemisega ja taandumisega puuduvad; poliitika saab paremaks raskes osades ja unustab kuidas sinna jõuda. Kogumine ei ole meetodi rakendamise detail, see on mehhanism: vana andmed on see, mis hoiab ülejäänud käitumist paigal ajal parandused liiguvad ühe osa.

2. Kaamera liigutamine ringide vahel

Kaamera, mis nihkub kaks sentimeetrit ringide vahel toodab poliitika halvemad kui millega sa alustad ja diagnoos, mis maksab päeva. Iga VLA siin tingib piltidest; liigeste seisund ei erista üksi kus objekt on. Fotograafi seadistus enne esimest ringi ja kontrolli see foto enne iga hilisemat.

3. Käigus artefaktide laebrimisse treenimisel

Kaetud ülal ja loetlul sest see on nähtamatu. Sümptom on poliitika, mis seisab murdosa sekundi täpselt kus eelmise ringi operaator võttis üle. See näeb välja nagu kõhklus; see on jäljendus.

4. Sooja alusta kutsudes otsuse

Kui uskuda et optimeerijate seisund kandis üle, algne kaotuse tõus loeb viga ja te lähete jahtima korruptiitud andmeid. Kui teate et optimeerija algas värske, tõus on oodatud ja te vaatate, mis tulen pärast. Samad numbrid, vastupidised järeldused.

Ringi mõõtmine

Metriks inimese-värava silmuse jaoks on sekkumise määr: kaadrid salvestatud ajal kui sa olid kontrollid, jagatud kogukaadreid käigu. See on ülevõtmise seisundis ja see on ainus arv, mis vastab küsimusele ringist küsiti. Treenimisel kaotus langeb kas poliitika parandus või mitte; edukuse määr on binaar ja müra väikestes näidistest, mille kirjatööla käsi tekitab. Sekkumise määr on pidev, mõõdetud seisundeis, mille poliitika ise tootis ja see langeb nagu poliitika vajab sind vähem.

Võrdle selle ainult ringides, mille salvestati identsetel tingimustel. Täielik väide ja kuidas ehitada hindamise komplekt, mis jääb rohkem kui kaks ringi, on artiklis DAgger-silmuse mõõtmisest. Ring üks on realistlikult teostavus test: kontrolli et ülevõtmine töötab sinu riistvarel, et parandused maanduvad nende lippe ja et jätkatud käik laadis kontrollpunkti, mida sa nimetasid. Ringid kaks ja kolm on kus määr peaks alustama liikumist. Kui see pole liigutanud neljast ringist, probleem on DAgger ülestuulest.

Kirjutage üles ringi kohtaMiks see aitab hiljem
Kontrollpunkt, mida sõidetiIlma selleta ei saa te omistada paranduse segamisele
Sisendirežiim, mida ülevõtmiseks kasutatiKlaviatuuri parandused on jämedamad juhi parandustest ja see on näha andmetes
Käikude arv ja kuidas igaüks sorteeritiKas ringil oli piisavalt parandusi, et oluline oleks
Sekkumise määr käigu kohta ja keskmineSilmuse edusammu metriks
Täpne episoodi valik allikate kaupaAinus viis ringi taasehitada või tagasi voita
Soe algus või värsked treenimineSelgitab kaotuse kõverat, millele vaatad nädala pärast

Kui teil ei ole veel kontrollpunkti

Silmusel pole sisendpunkti ilma. Salvestage esimene andmestik, treenige esimene poliitika, käivitage see – salvestamine, treenimine ja poliitika käitamine katvad selle tee. Salvestamise klient on allalaadimislehel, GPU tasemed ja tunnitariifid hindamislehel ja mis naudib episoodi näeb SO-100 andmekogumise juhendis. Saa näidiseid paremusel enne parandusi: DAgger on parandamise mehhanism ja see töötab palju paremini millegi peale, mis oli peaaegu juba õige.

Kas ma saan DAgger-silmuse käitada ilma juhi käeta?

Jah. Valige klaviatuur või liugurite sisend kui te vajutate Võta üle: ülevõtmine on kohene ja käsitsi, teise käeta joondamise. Klaviatuur saadab suhtelist nõelata, mida server kleipib jämedalt 2 kraadi liigeste kohta ja 4 pinceri jaoks; liugur saadab absoluutne sihtiasend ja server liigub maksimaalselt 6 kraadi sihti poole hetkekõne kohta, kuigi liides jätkab voolu. Tegevuse veerg ja sekkumise märgistamine on samad nagu juhi režiim, seega on parandused eristamatult andmestikus.

Mitu parandust üks ring vajab?

Pole kaitsmulatavat universaalset arvut ja kaadrite arv aitab rohkem kui episoodi arvu. Tööreegel on et parandused peaksid kaotsi minema segamises: 200 algandmetega ja kolme paranduste episoodiga, miski ei liigu. Sihi parandused, mis katavad ebaõnnestuja käitumise mitmetest algsetes konfiguratsioonides mitte kolme kordamise sama päästmine.

Miks on treenimine paranduste peale ainult selline halb idee?

Sest parandused on peaaegu täiesti ülesande rasked keskel. Lähenemise, joondamise ja taandumise puuduvad, seega kaotab poliitika, mida ta juba hästi tegi, parandades osa, mida parandasid. Vana andmete hoidmine ja sellele lisamine on mehhanism ise, mitte valikuline ekstra.

Kas jätkamine kontrollpunktist taastab eelmise treenimisel käigu?

Ei. Ainult kaaludega kontrollpunkt taastab parameetrid ja midagi muud: optimeerijate momendid, õppimisel määra ajakavalise asendi ja andmestiku järjekord alusta värske. See on soe algus ja algne kaotuse tõus on oodatud mitte sümptom. Kirjutage üles milline kaks teie tegelikult tegite, seega loete kõverat õigesti nädala pärast.

Mida kui sekkumise määr ei lange?

Seisake ringide lisamine. Tasane määr tähendab parandused ei õpe mida sa arvad. Tavalisest põhjustest on ülestuule: kaamera liigutus, parandused alustuvad liiga hilja olema vältimise andmed, käigus kaadrid on treenimisel komplektis või ülesanne on alamääratud vaatlemistest, mida poliitika tegelikult saab.

Miski sellest ei ole lahendatud probleem ja ükski sellest ei ole üks klõps. Interaktiivne jäljendusõpe on aktiivne uurimise valdkond täpselt sest selle küsimused – millal sekkuda, kuidas kaaluda, mida inimene tegi, kui palju vanu andmeid hoida – pole lahendatud vastuseid; Celemin jt küsitlus kaardid mis on veel avatud. Mida silmusel on on mõõdetav koondus kui see käivitatakse hoolikalt, riistvarel, mis maksab mõndsada eurot. Külmutage seadistus, sekkuge vara, sorteerige ausalt, segage tahtlikult ja salvestage sekkumise määr iga kord.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started