Një krah roboti SO-100 me nxitur të ulët në një tavolinë, i vendosur për teleoperim dhe trajnim politike
DAggerSO-100Të Mësuarit përmes ImitimitVLATeleoperimi

Drejtimi i një DAgger Loop në një SO-100 me një VLA Policy

AY-Robots ResearchAugust 27, 202615 min lexim

Një përshkrim hap pas hapi i një raundi DAgger me kontroll njerëzor në një krah SO-100: drejtoje politikën dhe regjistroje atë, merre kontrollin kur shkon gabim, regjistroje si korrigjim, kombinoj një grup të dhënash të përzier, dhe vazhdo trajnimin nga një kontrol. Përfshin shtegën e marrjes së kontrollit me tastierë dhe rrëshqitëse për njerëzit pa një krah udhëheqës, dhe katër gabimet që bëjnë një raund të padobishëm.

Politika juaj funksionon. Arrin në kubik, mbyll gripin një centimetër shumë herët, dhe vazhdon sikur ta kishte të. Asgjë nuk krijon gabim, dhe asnjë sasi e shikimit të humbjeve të trajnimit nuk e shpjegon. Zgjidhja nuk është 20 000 hapa të tjerë të rënies gradiente në të njëjtat demonstrime. Është të vendosësh dorën përsëri në krah pikërisht ku shkon gabim, të regjistrosh se çfarë bëre në vend, dhe të trajnosh kontrolin e ardhshëm në të dhënat e vjetra plus atë korrigjim. Ky është një raund DAgger, dhe kështu funksionon në një SO-100 me një politikë të shikimit-gjuhës-veprimit.

Teoria është diku tjetër: pse grumbullimi i grupit të të dhënave funksionon fare dhe çfarë ndryshon kontrolli njerëzor në lidhje me të. Ky është manuali i operimit, dhe supozon një kontroll të trajnuar, një grup kamerash të punueshëm, dhe një krah që lëviz. Gjashtë hapat më poshtë janë laku siç është zbatuar në faqja DAgger e kësaj platforme, por sekuenca është e njëjtë nga skriptet tuaja.

Një raund në shkurtim

  • Drejtoje politikën e trajnuar dhe regjistroje atë, me tekstin e detyrës të ekzekutimit në vend të një etikete të përgjithshme teleoperimi.
  • Merre kontrollin në momentin kur sjellja shkon gabim: një kalim në pasqyrë me një krah udhëheqës, i menjëhershëm dhe manual përmes tastiere ose rrëshqitëse pa një.
  • Bëj triage secilit drejtim: regjistroje si korrigjim, mbaje si një episode vlerësimi, ose hidhe atë.
  • Kombinoj përzierjen me dorë - demonstrime origjinale plus korrigjime, episode të zgjedhura për burimin. Mos trajno kurrë vetëm në korrigjime.
  • Vazhdo trajnimin nga kontroli i fundit, dhe shëno cili kontrol prodhoi cilën përzierje.
  • Numri që thotë nëse raundi ishte i vlejshëm është shkala e ndërhyrjes, jo humbja e trajnimit.

Pse raundi i dytë nuk është thjesht më shumë të dhëna

Klonimi i sjelljes trajnon në gjendet që ka vizituar njeriu. Në kohën e testimit, politika viziton gjendet që ajo shkakton, dhe gabimet e veprimit të vogël përbëhen në gjendet që asnjë demonstrim nuk mbulon. Ross, Gordon dhe Bagnell formalizuan atë dështim për AISTATS 2011 dhe e përgjigjen me një algoritëm përsëritës që trajnon një politikë përcaktuese të palëvizur dhe, sipas zvogëlimit të tyre, duhet të funksionojë mirë nën shpërndarjen e gjendes që ajo shkakton: drejtoje politikën e tanishme, bëje ekspertin ta etiketojë gjendet që ajo në të vërtetë arriti, shto ato në grupin e të dhënave, ri-trajno, përsërit. Kelly etj. e bënë përgjigjen praktike me HG-DAgger, ku njeriu vendos kur të marrë kontrollin në vend që të etiketojë gjendet pa mbajtur kontrolet; ata raportojnë performancë të përmirësuar ndaj të dy DAgger dhe klonimit të sjelljes në një detyrë autonome drejtimi të simuluar dhe të vërtetë. Kontrollimi njerëzor është ajo që e bën lakun tolerueshëm në një krah tavolinë - ti lëviz duart vetëm kur diçka shkon gabim.

Dy pasoja kanë rëndësi më shumë në praktikë se sa teoria. Korrigjime nuk janë demonstrime të zakonshme: ato përqendrohen në rajonet e ngushtesave Mandlekar etj. përshkruajnë, ku një devijim i vogël e hedh politikën në gjendet që demonstrimet kurrë nuk mbuluan. Dhe një grup të dhënash i përbërë vetëm nga ato pjesë të vështira është një grup të dhënash i keq formuar - Belkhale, Cui dhe Sadigh argumentojnë nga ana e të dhënave që diversiteti i gjendes nuk është gjithmonë i dobishëm, dhe që divergjenca e veprimit dhe diversiteti i kalimit së bashku vendosin cilësinë e grupit të të dhënave. Grupi i të dhënave i përzier nuk është kompromis, është pika.

Ngrije këto para raundi një

Një raund DAgger krahason një politikë kundër vetes në kohë. Çdo gjë që ndryshon midis raundeve që nuk është grupi i të dhënave e bën atë krahasim të pavlerë.

  • Pozicione dhe montahe kamerash, përfshirë kamera dorëzash. Liroje një klamë dhe ke ndryshuar shpërndarjen e vëzhgimit, jo politikën.
  • Ekspozim dhe balancim i bardhë, nëse pirgja jote e kapjes të lejon të pin ato. Zhvendosja e auto-ekspozimit midis raundeve është një ndryshim domeni i ngadalshëm, i padukshëm.
  • Kalibrimi i krahuart dhe pozicionet zero servo. Nëse duhet të ri-kalibrosh, trajtoje gjithçka e regjistruar para sa një grup të dhënash i veçantë.
  • Teksti i detyrës. Çdo VLA këtu kushtet në të; ri-fjalimin e tij mid-loop është një detyrë tjetër.
  • Ndriçim, sipërfaqe tavoline, grup objektesh. Një objekt i ri është një eksperiment i ri, jo raundi i ardhshëm.
  • Shpejtësia e kuadrit të regjistrimit. Krahasimi i shkallës së ndërhyrjes në dy rrjeta të kampionimit prodhon dallime që vijnë nga rrjeta.
Kamera e dores nuk është mobilje opsionale

Hsu etj. krahasuan një pamje të përqendruar në dorë kundrejt pamjes së zakonshme të tretë personit dhe gjetën perspektivën sy-në-dorë rregullisht e përmirësoi efikasitetin e trajnimit dhe përgjithësimin jashtë shpërndarjes, pavarësisht se panë më pak të skenës. Në një krah pesë artikulesh, koha e gripit zakonisht është ajo që korrigjime tuaja po rregullojnë, dhe koha e gripit është ajo që paraja e dores mbart.

Raundi, nga fundi në fund

  1. 1
    Drejtoje përfundimin dhe regjistroje atë

    Fillo drejtimin kundrejt kontrolit që dëshiron të përmirësosh, pastaj fillo regjistrimin në rrënjën e përfundimit. Regjistruar në atë mënyrë ajo trashëgohet teksti i detyrës të ekzekutimit, i cili është ajo çfarë politika u trajnua, në vend të etiketës së parazgjedhur teleoperimi. Pa regjistrimin mund të shikosh dështimin por jo të trajnosh në të.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Merre kontrollin kur shkon gabim

    Shtyp Merre kontrollin dhe zgjidh modalitetin e hyrjes: krah udhëheqës, tastierë ose rrëshqitëse. Drejtuesit pauzoj, ti korrigjo, ti dorëzo përsëri. Kuadrot e regjistruar ndërsa ti drejtoje janë shënuar si ndërhyrje automatikisht.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Bëj triage episodet

    Vendos për episode: regjistroje si korrigjim, mbaje si vlerësim, ose hidhe. Një drejtim që politika e përfundoi pa ndihmë është të dhëna vlerësimi.

  4. 4
    Sinkronizo grupin e të dhënave të korrigjimit

    Korrigjime grumbullohen në një grup të dhënash lokal për politikën dhe shkon në ruajtjen në re përmes sinkronizimit automatik. Asgjë nuk përzihet që ti nuk e vendose atje.

  5. 5
    Kombinoj grupin e të dhënave të përzier

    Kombinoj grupin origjinal të të dhënave me korrigjime, duke zgjedhur episodet në mënyrë të qartë për burimin. Rezultati është një grup të dhënash i zakonshëm nga atë pikë e në.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Vazhdo trajnimin nga kontroli

    Trajno përzierjen nga kontroli i mëparshëm në vend të modelit bazë. Shëno cili kontrol dhe cilën përzierje; pa atë çift raundi nuk është i riprodhueshëm.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Hapi 2 në detaj: dy mënyrat për të marrë kontrollin

Me një krah udhëheqës

udhëheqës-ndjekës modu marrja e kontrollit është një kalim midis dy krahëve që nuk janë në të njëjtën pozë. Shtyp Merre kontrollin pauzoj drejtuesin dhe ngat udhëheqësin në pozën aktuale të ndjekësit, kështu që asgjë nuk kërcen kur transferta e çift-moments. Nëse drejtimi i rreshtimit kohon deri, ti rreshton udhëheqësin me dorë dhe lëshoj vetëm kur të dy janë brenda pesë shkallë. Nga atëherë e tutje ti teleoperoj normalisht dhe kolona e veprimit rekordon atë që ti urdhërove.

Qihu i sinqertë për këtë shteg: drejtimi i rreshtimit dhe kalimi i çift-momentit janë pjesa më pak e testuar e lakut në hardware real. Provo kalimin në një pozë të ngadalshme, të padëmshme përpara se të mbështetesh në të në një drejtim që e dëshiron. Një krah udhëheqës prodhon korrigjime më të lëmuar të tri modeve, dhe gjithashtu ka më shumë që mund të shkoj gabim mekanikisht.

Pa një krah udhëheqës: tastierë dhe rrëshqitëse

Shumica e njerëzve lexojnë këtë zotërojnë një krah. Ky është i mjaftueshëm. Zgjidh hyrje tastiere ose rrëshqitëse në momentin që shtyp Merre kontrollin, dhe marrja e kontrollit është e menjëhershme dhe manuale - nuk ka krah të dytë për t'u rreshtuar, kështu që nuk ka hap rreshte. Ndjekësit mbante pozën dhe pret për hyrje.

Modu i hyrjesSi lëviz krahuKufir për-thirrje i zbatuar nga serveriBllokuar kur
Krah udhëheqësPasqyra ngat ndjekësin nga këndet e ndarjeve të udhëheqësitAsnjë nxitje ose thirrje vendosmeje në këtë modu; pasqyra shkruan qëllime ndjekës vazhdimishtAsnjëherë nuk është bllokuar, dhe parazgjedhja nëse nuk është dhënë modaliteti i hyrjes - por ajo ka nevojë për një krah të dytë; pa një id udhëheqës marrja e kontrollit refuzohet
TastierëNxitje relative për shtypje çelësi, e dërguar në pikën përfundimtare të nxitjes të marrjes së kontrollitKlamë e vështirë në 2 shkallë për ndarje, 4 shkallë për gripinRefuzuar me 409 nëse marrja e kontrollit u fillua në modalitetin udhëheqës
RrëshqitësePozë e synuar absolute, e dërguar në pikën përfundimtare të vendossmejës të marrjes së kontrollitMë shumë 6 shkallë të udhetimit në drejtim të synimit për thirrje; ndërfaqja mbante dërgon rreth dhjetë herë për sekondëRefuzuar me 409 nëse marrja e kontrollit u fillua në modalitetin udhëheqës

Klamët janë zbatuar në anën e serverit, jo në ndërfaqe, sepse një delta i gabuar në një krah servo-bus është një përplasje. Korrigjime tastiere dalin në mënyrë shkallimi dhe pak të ashpra; korrigjime rrëshqitëse janë më të lëmuara, sepse serveri kaminon në drejtim të synimit ndërsa ndërfaqja mbate dërgon. Në çdo rast kolona e veprimit merr vektorin e plotë të pozës të urdhëruar dhe shënimi i ndërhyrjes është identik me shtegën e udhëheqësit, kështu që korrigjime tastiere zbritin në të njëjtin grup të të dhënave pa një ndryshim formati.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Të njëjtën shkronjë si kudo tjetër në pirgjën, kështu që memoria muskulore nga regjistrimi kalon.
Udhëzues trajnimi që tregon hapat e renditur të një run përpunimi të mirë GR00T në një grupi të dhënash SO-100
Ana e trajnimit të një raundi është e njëjta sekuencë me udhëzim si një drejtim i parë; vetëm fusha e kontrolit ndryshon.

Kur të shtypësh butonin

Më shumë herët se vone. Një korrigjim që fillon pasi gripi ka mbyllur mbi asgjë u mëson rikuperimin nga një dështim që politika nuk duhej të ishte futur, dhe të dhëna rikuperimi vlen shumë më pak se të dhëna shmangje. Ndërpre në momentin e parë kur je i sigurt se trajektoria është e gabuar, korrigjo përmes pjesës së vështirë, dorëzo përsëri sa më shpejt gjendje është e cila politika e trajtoi më parë. ThriftyDAgger automatizoj atë vendim nga portalizimi i ndërhyrjeve në novelete dhe riskun e vlerësuar nën një buxhet njerëzor të fiksuar, por në një krah të vetëm me një njeri tashmë shikues, porta njerëzore është më e lirë dhe më mirë të kalibruar se çdo gjë ti do të akordosh.

I bëjshëm me pirgjën e burim-hapës dhe disa skripte. Ajo që kushton është kontabiliteti, dhe kontabiliteti është ku raundi DAgger vdesin.

  1. Shkruaj kuadrot nga skripti juaj i vetë i përfundimit në një grupi të dhënash LeRobot, me vargun e detyrës të cilit politika ishte trajnuar.
  2. Pauzo lakun politike, ndryshoje burimin e komandes, dhe shënoje çdo kuadër që ti drejtoje si ndërhyrje. Pa shënimin, korrigjime duken si demonstrime të zakonshme.
  3. Vendos me qëllim se çfarë ndodh për kuadrot e kalimit midis politikës të lëshimit kontroll dhe hyrjeve tuaja të parë.
  4. Mbaje korrigjime në grupin e tyre të të dhënave për politikën, dhe shkolle indekset episode me dorë kështu që përzierja mund të ri-ndërtohet.
  5. Theso pika përfundim të përpunimit të mirë në kontrolin e mëparshëm, dhe kontrol në regjistrin që ai ngarkoi ato pesha.

Hapi 3 në detaj: triage vendos cilësinë

Pas ekzekutimit ti ke një regjistrim me disa kuadra të shënuara si ndërhyrje. Tre përzgjedhje ekzistojnë, dhe e vëllezër peshon në heshtje raundun e ardhshëm.

  • Regjistroje si korrigjim kur ndërhyrja ishte një korrigjim i vërtetë: politika ishte duke shkuar diku gabim dhe hyrje juaja tregoi gjëin e duhur nga gjendje e politika vetë e prodhoi.
  • Mbaje si vlerësim për ekzekutimet autonome të pastër dhe për ekzekutimet të cilat ti merre kontrollin nga parandalim. Episodet vlerësimi janë si ti mas kontrollin e ardhshëm, dhe ato nuk duhet kurrë të trajnohen.
  • Hidhe ekzekutimet e shkatërruar nga diçka e lidhur - një kuadër kamerash të rënë, një servo i ngulur, një objekt të cilin ti shkundte poshtë. Një korrigjim i rrëmujshëm është më keq se asnjë korrigjim.
Kuadrot e ngrirë i përkasin regjistrit të papërpunuar, jo në të dhënat e trajnimit

Midis politikës të lëshimit kontroll dhe hyrjeve tuaja të parë, krahu mban qetësi ndërsa regjistri vazhdon të shkruaj - një ekzekutim të nëna identike të çiftuar me imazhe të ndryshme pakëz. Këtu ato kuadra kalimet qëndrojnë në regjistrin e papërpunuar dhe jashtë grupit të të dhënave të korrigjimit. Nëse ti ndërto lakun vetë, preje ato në qëllim: një politikë e trajnuar në ato mëson të pauzo ku duhet të veprojë.

Hapi 5 në detaj: kombinimi i përzierjes

Kombinimi merr grupin origjinal të të dhënave plus grupin e të dhënave të korrigjimit dhe prodhon një të ri, të zakonshme grupi i të dhënave LeRobot që trajnon si çdo tjetër. Karakteristika e rëndësishme është se përzgjedhja e episodes është e qartë për burimin - asgjë nuk përzihet në mënyrë automatike. Kjo duket e vogël deri herën e parë një politikë sillet çuditerisht dhe ti duhet të ri-ndërtosh atë çfarë ishte trajnuar.

Pyetja e hapur është raporti, dhe askush nuk ka një numër që transferi. Ajo që literatura bëhet dakord është se korrigjime duhet të llogariten për më shumë se pjesa e tyre kuadër. Mandlekar etj. ri-trajno nëpërmjet përsëritje në të dhëna sistemi i tyre i ndërhyrjes grumbullon, kështu që politika mëson të përshko ngushtesave, dhe raporti se agjentë trajnuar në këtë mënyrë tejkalojnë agjentë trajnuar në një numër ekuivalent të mostrave nga demonstruese jointervencioniste. Sirius shkon më tej dhe ri-peshoj mostrat e trajnimit nga besimi njerëzor i përafërt, raportimi se 8 përqind fitim në simulim dhe 27 përqind në hardware të vërtetë në shkalla e suksesit politike ndaj metodave të cilat krahason, në shpejtësi konvergjence dyfish. Asnjë nga pikat e fillimit të trajnimit këtu ekspozoj një çelës të peshimit të mostres, kështu që zëvendësuesi i ashpër është të mbajë çdo episode korrigjimi ndërsa në-kampionim demonstrime origjinale - dhe të shkruaj atë çfarë ti bëre.

Pamje regjistrim grupi të dhënash që tregon episodet e grupit të të dhënash SO-100 me rrjedha kamera
Episodet korrigjim janë episodet e zakonshme me një shënimin e ndërhyrjes për-kuadër, kështu që ato kombinojnë me grupin origjinal të të dhënave pa konvertim.

Hapi 6 në detaj: çfarë do të thotë vazhdimi nga një kontrol do të thotë

Trajnimi i përzierjes nga modeli bazë funksionon por hedh raundun e mëparshëm dhe kushton një ekzekutim të plotë. Vazhdimi nga kontroli është më i shpejtë dhe zakonisht më i mirë. Ajo është gjithashtu më e kufizuar se sa fraza sugjeron.

Inicializimi i peshës nuk është një optimizer rikthim

Një kontrol vetëm-peshe përmban parametrat dhe asgjë tjetër. Ngarkimi i tij e jep ekzekutimit të ardhshëm një pikë filljese më të mirë se modeli bazë, por momente optimizer, pozicioni i kronogramit të shpejtësisë të mësimit dhe renditje të dhënave të gjithë fillojnë nga zero. Prevo një spike humbje në fillim të ekzekutimit të vazhduar, mos e lexo si dështim, dhe mos e thirr raundun një rikthim. Ajo është një fillim i ngrohtë.

PolitikaMadhësiaShtresa GPUPërfundim për hap veprimiFormati i grupit të të dhënaveEpisodet përpara se të vlejë të provojnë
GR00T N1.7rreth 3 B, zëvendësisht 40 M trajnuar gjatë përpunimit të mirëA100 80 GB ose H100 80 GBrreth 152 msLeRobot v2.0 ose v2.150
GR00T N1.5rreth 3 BA100 80 GB ose H100 80 GBrreth 165 msLeRobot v2.0 ose v2.150
Pi0.5rreth 3 B në një kôm PaliGemmaA100 80 GB ose H100 80 GBrreth 485 msLeRobot v3.050
SmolVLArreth 450 MRTX 4090 ose çdo kartë 24 GBrreth 245 msLeRobot v3.030
ACTrreth 80 M, trajnuar nga e paraRTX 4090 ose çdo kartë 24 GBrreth 20 msLeRobot v3.050

Vonesa përzihet brenda një DAgger loop në një mënyrë ajo nuk funksionon gjatë një demonstrim: në zëvendësisht 485 ms për hap veprimi ti merre kontrollin sepse krahu nguroi, jo sepse ishte e gabuar, dhe korrigjime ngurimi nuk janë të dhëna të dobishme trajnime. Nëse ti je përsëritje në të dhëna në vend të ndjekje një shkalla përfundimtare suksesi, përsërit në një model të shpejtë. Shukor etj. përshkruajnë SmolVLA si dizajnuar për të trajnuar në një GPU të vetëm dhe për të zbatuar në GPUs të konsumatorit ose CPUs, me një pirgjë përfundimi asinkron që zhkuplon parashikimin e veprimit nga ekzekutim për të lejuar norma kontrolli më të larta - karakteristika që mban lakun e marrjes së kontrollit përgjegjës.

Formate grupi të dhënave nuk janë të ndërrueshmëm gjithashtu. GR00T merr LeRobot v2.0 ose v2.1, dhe repository Isaac-GR00T përshkruan hyrje si një shtirje e formati LeRobot v2 me një skedari përshkrimi të shtuar modaliteti; ata më të ri trajnues këtu presim v3.0. Një përzierje e kombinuar në version të gabuar dështon në kohën e ngarkimit në vend të prodhimit të një politike të keqe - moda më e mirë dështim, akoma një slot radhe të shënjuar. dokumentacioni i grupit të të dhënave liston cili formati çdo trajnues merr.

Laku, me kontabilitetin tashmë të bërë

Merre kontrollin me krah udhëheqës, tastierë ose rrëshqitëse; shënim ndërhyrje për-kuadër; regjistrimi i ekzekutimeve si korrigjime ose vlerësime; kombinimi i grupit të dhënash i përzier me një përzgjedhje episode të qartë për burimin; dhe vazhdimi i trajnimit nga një kontrol në vend të modelit bazë. Ajo që qëndron vendimi juaj është se cili drejtim llogaritet si korrigjim, se çfarë shkon në përzierje, dhe kur shkalla e ndërhyrjes ka ndalluar rënien.

Shiko se si laku DAgger është kabëluar

Katër mënyra për të shpenzuar një raund

1. Trajnim vetëm në korrigjime

Dështimi më i zakonshëm dhe shtegu i shkurtër më tundues. Një grupi të dhënash vetëm-korrigjim është pothuajse tërësisht e mesme e vështirë e detyrës, me qasje dhe tërheqje të mungon; politika merr më të mirë në pjesën e vështirë dhe harron se si të arrijmë atje. Grumbullimi nuk është detaj zbatimi i metodës, ajo është mekanizmi: të dhënat e vjetra janë ato që mban pjesën tjetër të sjelljes në vend ndërsa korrigjime lëviz një pjesë të tij.

2. Lëvizja e kamera midis raundeve

Një kamera që ndryshon dy centimetra midis raundeve prodhon një politikë më keq se ajo të cilën ti filloi, dhe një diagnozë të cilat kushton një ditë. Çdo VLA këtu kushto në imazhe; gjendje ndarje vetëm nuk disambiguon ku është objekti. Fotoje vendosje para raundi i parë dhe kontrol atë fotografi para çdo raund më vonë.

3. Duke lejuar artefakte kalimet në trajnim

I mbuluar më lart, dhe në listë sepse ajo është e padukshme. Simptoma është një politikë të cilat ngul për një fraksion të sekondës pikërisht ku operatori i raundi i mëparshëm merre kontrollin. Duket si ngurimi; ajo është imitimi.

4. Thirrja e fillimit të ngrohtë si rikthim

Nëse ti beson gjendje optimizer i mbaruar, spike humbje filljese lexon si një gabim dhe ti shko duke kërkuar të dhëna të korruptuara. Nëse ti di optimizer i filluar të freskët, spike është përfunduar dhe ti shiko çfarë vjen pas tij. Të njëjtat numra, përfundime të kundërta.

Matja e raundi

Metrika për një lak me kontrolli njerëzor është shkala e ndërhyrjes: kuadrot e regjistruar ndërsa ti ishte në kontroll, ndarë me kuadra të plotë të ekzekutimit. Ajo është në statusin e marrjes se kontrollit, dhe ajo është numri i vetëm që përgjigjet pyetjet raundi pyeti. Humbja trajnimit bie nëse ose jo politika përmirësoi; norma suksesi është binare dhe me zhurmë në madhësitë e mostrat një krah tavolina prodhon. Norma ndërhyrje është e vazhdueshme, matur në gjendet politika vetë shkaku, dhe ajo bie si politika ti ka nevojë për ty më pak.

E krahasoje vetëm përmes ekzekutimeve të regjistruar në kushte identike. Argumenti i plotë, dhe si të ndërto një përzgjedhje vlerësimi të cilat tejkalon më shumë se dy raunde, është në artikull në matjen e një laku DAgger. Raundi një është në mënyrën e realizueshme një test vijueshmërie: ti është duke kontrolluar që marrja e kontrollit funksionon në hardware tuaj, që korrigjime zbritin me shënime të tyre, dhe që ekzekutim të vazhduar ngarkoi kontroli ti emërueshjen. Raunde dy dhe tre janë ku norma duhet të fillojë të lëvizë. Nëse ajo nuk lëvizt nga raund katër, problemi është lart rrjedhkës DAgger.

Shkruaj përfundim raundPse nesh është rëndësi më vonë
Kontrol të cilat ishte drejtuarPa të ti nuk mund të përshkruaj një përmirësim në një përzierje
Modu i hyrjes përdorur për marrja e kontrollitKorrigjime tastiere janë më të ashpra se korrigjime udhëheqës, dhe ajo tregon në të dhëna
Numri i ekzekutimeve dhe si çdo ishte triazhNëse raundi kishin mjaft korrigjime të materie
Norma ndërhyrje për ekzekutim, dhe mesatareMetrika përparimi e lakut
Përzgjedhja exact episode për buriminMënyra e vetme për ri-prodhoj ose zhbëj një raund
Fillim i ngrohtë ose trajnim i freskëtShpjegon lakun e humbjeve ti do të shikosh në një javë

Nëse ti nuk kesh një kontrol ende

Laku nuk ka pikë hyrje pa një. Regjistroj një grupi të dhënash të parë, trajno një politikë të parë, drejtoje atë - regjistrimi, trajnim dhe drejtimin e politikës mbule atë shteg. Klienti regjistrimit është në faqja shkarkimit, shtresa GPU dhe norma orare në faqja çmimit, dhe se çfarë duket një episode e përdorshme në udhëzues të mbledhjes të dhënash SO-100. Merr demonstrime të duhur përpara korrigjimeve: DAgger është një mekanizëm riparimi, dhe ajo funksionon shumë më mirë në diçka të cilat ishte pothuajse e duhur tashmë.

A mund të drejtoj një DAgger loop pa një krah udhëheqës?

Po. Zgjidh hyrje tastiere ose rrëshqitëse kur ti shtyp Merre kontrollin: marrja e kontrollit është e menjëhershme dhe manuale, me asnjë krah të dytë për t'u rreshtuar. Tastiera dërgon nxitje relative që serveri klam i vështirë në 2 shkallë për ndarje dhe 4 për gripin; rrëshqitëse dërgon një synumin absolute dhe serveri lëviz më shumë 6 shkallë në drejtim të atij për thirrje, ndërsa ndërfaqja vazhdon të dërgoj. Kolona e veprimit dhe shënim ndërhyrje janë të njëjtë si në modalitetin udhëheqës, kështu që korrigjime janë të dallueshme në grupin të dhënash.

Sa korrigjime bën një raund të bëj?

Nuk ekziston një numër universal i mbrojtshëm, dhe numri kuadër ka rëndësi më shumë se numri episode. Rregulli i punës është se korrigjime nuk duhet të humbet në përzierje: me 200 episodet origjinale dhe tre episode korrigjim, asgjë nuk do të lëviz. Synojnë korrigjime të cilat mbule sjellji dështim nga disa konfigurimi filljese në vend të tre përsëritje të të njëjtit shpëtim.

Pse trajnim vetëm në korrigjime është ide kaq e keqe?

Sepse korrigjime janë pothuajse tërësisht mesme i vështirë e detyrës. Qasje, rreshtim dhe tërheqje janë të mungon, kështu që politika humb atë çfarë ajo tashmë bëri mirë ndërsa përmirësohet në pjesën ti ndreqe. Mbajta të dhënat e vjetra dhe shtoj në të është mekanizmi vetë, jo shtesë opsionale.

A mbaron vashdimi nga një kontrol atë ekzekutim trajnimit të mëparshëm?

Jo. Një kontrol vetëm-peshe rivendos parametrat dhe asgjë tjetër: momente optimizer, pozicioni i kronogramit të shpejtësisë të mësimit dhe renditje të dhënash filloj të freskët. Ajo është një fillim i ngrohtë, dhe një spike humbje filljese është përfunduar në vend të një simptom. Shkruaj se cilat e dy ti në të vërtetë bëre, kështu që ti lexoj lakun saktë një javë më vonë.

Çfarë po nëse norma ndërhyrje nuk bie?

Ndalo shtimin e raundeve. Një norma e barabartë do të thotë korrigjime nuk janë duke mësuar atë çfarë ti mendon. Shkaqet e zakonshme janë lart rrjedhkës: një kamera lëvizt, korrigjime filloj shumë vonë për të qenë të dhëna shmangje, kuadrat kalimet janë në grup trajnim, ose detyrë është underdetermined nga vëzhgime politika në të vërtetë merr.

Asnjë e kësaj nuk është një problem zgjdhur dhe asgjë e kësaj nuk është një klik. Të mësuarit imitim interaktive është një fushë e aktive kërkimit pikërisht sepse pyetje - kur të ndërhyj, si të peshoj atë çfarë njeriu bëre, sa shumë të dhëna të vjetra për të mbajtur - nuk kanë përgjigje të vendosur; anketa nga Celemin etj. hartat çfarë është ende i hapur. Ajo çfarë laku ka është konvergjenca i matshëm kur ajo është drejtuar me kujdes, në hardware të cilat kushton disa qind euros. Ngrije vendosje, ndërhyj herët, triazh me sinqeritet, përzier me qëllim, dhe regjistro norma ndërhyrje çdo herë.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started