Hapësira e punës së robotit në tabela e llojit të përdorur si një rregullim vlerësimi fiks për drejtimin e përsëritur të politikës
DAggerVlerësimMësim përmes ImitimitTë Dhënat e RobotitSO-100

Matja e një Sylfate DAgger: Shpejtësia e Intervenimit, Protokolli i Vlerësimit dhe Kurthot në Mes

AY-Robots ResearchAugust 27, 202615 min lexim

Shpejtësia e intervenimit - kornizat e intervenimit të ndarë me kornizat e drejtimit - është sinjali më i lirë i përparimit të sinqertë që ka një sylfate DAgger e kontrolluar nga njerëz. Ky artikull e përcakton atë në mënyrë që dy njerëz të llogarisin të njëjtën vlerë, tregon se si ta regjistrojnë atë dhe kalon përmes katër mënyrave sesi e mashtron jua: habituimi i operatorit, një rregullim vlerësimi në lëvizje, trajnimi vetëm në korrigjime dhe një njeri që korrigjon ndryshe të martën se sa të hënën.

Një rund DAgger ndjehet produktiv ndërsa jeni në të. Ju drejtoni politikën, merrni kontroll kur ajo përçekohë graspën, ruaj korrigjimet, rimarrëni dhe rundi tjetër duket - do të bëjat - pak më i qetë. Dy raunde më vonë nuk mund të thonit nëse ndonjë gje ndryshoi, sepse "pak më i qetë" nuk është një sasi.

Syfata ka nevojë për një numër për rund dhe në një sylfate të kontrolluar nga njerëz ky numër është pothuajse falas: përqindja e drejtimit gjatë të cilit kishte kontroll në vend të politikës. Ky artikull e përcakton atë në mënyrë që dy njerëz të llogarisin të njëjtën vlerë, të regjistrojnë atë, të lexojnë kurbën që rezulton dhe të emërojnë katër mënyrat e saj e mashtron kur qëndron vetëm. Për teorinë që e supozon ky artikull, shih shpjeguesin e DAgger dhe varianta e kontrolluar nga njerëz; bashkëpunarësi praktik është drejtimi i një syfate DAgger në një SO-100.

Versioni i shkurtër

  • Shpejtësia e intervenimit = kornizat e intervenimit / kornizat e drejtimit. Korniza, jo episodi dhe emëruesi përfshin kornizat që keni shpenzuar në korrigjime.
  • Një kurbë e sheshtë mbi tre raunde do të thotë që raundet blejnë asgjë - ndryshoni përzierjen, pikën kontrollimi ose detyrën në vend që të mbledhni një të katërtën.
  • Një shpejtësi intervenimi në rënie nuk është një shpejtësi suksesi në rritje. Pragu juaj për të hyrë në lëvizje rrëzet poshtë ndërsa besimi rritet.
  • Pa një protokoll vlerësimi të ngrirë - të njëjtën fillim pozoj, objektet, kamerasit, numri i provave - jeni duke matur dhomën.
  • Trajnimi vetëm në korrigjime shtrembëron shpërndarjen e gjendjeve. Përgjigja e IWR: vizato kampionet e intervenimit dhe jo-intervenimit në përqindje të barabartë.

Pse një rund ka nevojë për një numër në të gjithë

DAgger ekziston për shkak të një problemi shpërndarjeje dhe problemet e shpërndarjes janë të padukshme për syrin. Ross dhe Bagnell treguan se mësimi përmes imitimit në një bashkësi demonstrimi fiks çon në gabime të përbëra dhe një kufi ketuese që rritet në mënyrë kuadratike në horizont kohor: pasi të mësuesi të largohet nga gjendet që demonstruesi vizitoi, asgjë në të dhëna nuk i thotë se si të kthehet. DAgger e rregullon këtë duke përsëritur - drejton politikën, etiketuese gjendet që ajo viziton, grumbullon, rimarrënon - që Ross, Gordon dhe Bagnell e kuadrojnë si një reduktim në mësimin në internet pa ketuese.

Kjo kuadrim ka një pasojë që njerëzit kalojnë. Garantia ka të bëjë me sekuencën e politikave mbi përshkakje, jo ndonjë runde e vetme. Ajo nuk thotë asgjë për nëse juaj rundi tre ndihmoi. Mënyra e vetme për të ditur është të matesh çdo përsëritje. Kelly dhe kolegët e tij prezantuan HG-DAgger sepse DAgger klasik kërkon ekspertin për etiketat e veprimit ndërsa novacaku është ende në kontroll, të cilin të dokumentit pohon se mund të zvogëlojë sigurinë dhe, me ekspertë njerëzor, ka të ngjarë të keqëson cilësinë e etiketimit përmes vonesës përceptuese të aktuatorit. HG-DAgger gjithashtu mëson një prag sigurimi për një metrikë rreziku të bazuar në pasigurinë e modelit dhe raporton performancë të përmirësuar mbi të dy DAgger dhe sjelljen klonuese në një detyrë drejtimi. Ajo nuk publikon numra intervenimesh; ato i produkcion vetë.

Përcaktimi i shpejtësisë në mënyrë që dy njerëz të marrin të njëjtin numër

Përcaktimi është një linjë: korniza e intervenimit të ndarë me korniza e drejtimit. Gjithçka e vështirë fshihet në atë që numërohet si kornizë dhe atë që numërohet si drejtim.

Korniza, jo episodi

Numërimi i episodeve me të paktën një intervenime është i padobishëm: dhjetë episode me një shtyp secila dhe dhjetë në të cilat drejtuat tetëdhjetë përqindje të dyja japin "10/10". Numri i kornizës i ndan ato dhe është granulusja që regjistri tashmë ka - në formatin e dataset-i LeRobot çdo hap kohor është një rresht në mënyrë që flamuri i intervenimit është një kolonë boolean pranë gjendjeje dhe veprimit. Këtu ajo është shkruar për kornizë në momentin që mbyllja fillon dhe hiqet kur kontrolli kthehet.

Emëruesi përfshin korrigjimet

Dy emërues janë të arsyeshëm - gjithsej korniza e drejtimit ose korniza që politika drejtoi në mënyrë autonome - dhe ato ndryshojnë keq në nivele të larta intervenimesh. Merrni kontroll për 400 nga 1000 korniza dhe e para jep 40 përqind, e dyta 67 përqind. Krahasimi i një rund të matur në mënyrën e parë kundrejt atij tjetër të matur në të dytin është si një përmirësim real zhduket. Merrni gjithsej korniza dhe mos i rikthehuni zgjedhjes në mes të serisë.

Vendosni një herë se çfarë ndodh me kornizat e dorëzimit

Gjithmonë ka një costur. Kur kontrolli kalon, disa korniza i përkasin asnjë palës: koka ruhet, udhëheqësi radhitet, regjistri ngrij. Në këtë rrjedhë ato korniza dorëzimi qëndrojnë në rrjedhjen e papërpunuar dhe kurrë nuk hyjnë në kuratuar episodi - ato janë as sjellje politike as një korrigjim vërt për trajnimin. Numëro costura në të njëjtën mënyrë çdo rund: në 30 Hz, gjashtë dorëzime me një costur prej dy sekondash secila janë 360 korniza, mjaft për të lëvizur një pikë përqindje.

Tre vendime që e thejnë krahasueshmërinë

Korniza ose episodi; gjithsej drejtim ose vetëm autonome; kornizat e dorëzimit brenda ose jashtë. Nëse ndonjë nga të tretat ndryshon në heshtje ndërmjet rundeve, kurba nuk do të thotë asgjë. Shkruaj të tretat poshtë.

Regjistri i saj në mënyrë që numri i mbijetojë sesioni

Një metrikë në panelin e statusit të një procesi në ekzekutim është një lexim: ajo zhduket kur rinisja dhe nuk mund të vizatohet. Një linjë append-vetëm për rund mbulon tërë serinë - përfshirë se cila pikë kontrollimi drejtuat, pasi ajo ndryshon çdo rund dhe përzieja e tyre invalidi atë që vijon.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Një linjë për rund. Regjistrimi i emëruesit dhe konvencionit të dorëzimit pranë numrit ka më shumë peshë se emrat e fushave.

Dy fusha mbajnë peshën. train_mix është ajo që ushqevet punen e trajnimit tjetër; pa të asgjë nuk mund të atribuohet. eval_protocol emëron testin e ngrirë që drejtuat më pas dhe është fusha më shpesh e lënë boshe. Në kokpitin ay-robots statusi i dorëzimit raporton numrin e kornizave të intervenimit për sesionin në ekzekutim, kështu që regjistrimi është përshkrim në vend të instrumentimit; dokumentacioni i dataset-i mbulon ku përfundojnë kolonat për-kornizë.

Matrica e konfigurimit të trajnimit që tregon politikat, dataset-et dhe pikën kontrollimi pranë njëri-tjetrit
Çdo rund ndryshon pikën kontrollimi dhe përzierjen e dataset-i. Një numër kombinimi i të cilit nuk u regjistrua nuk mund të atribuohet.

Leximi i kurbës: tre raunde, një vendim

Tre raunde është minimumi për një lexim, sepse dy pika janë gjithmonë një linjë. Tabela më poshtë është një shabllon libri me numra të pavendosur, jo matje nga ndonjë drejtim. Ju po kërkoni një zvogëlim të monoton të përputhur me një rritje në sukses në një test fiks.

RundPika kontrollimi e drejtuarKornizaKornizat e intervenimitShpejtësiaSuksese (nga 20)
0 (bazë)politika bazë5 9001 38023,4 %7
1nga përzierja e rund 05 61098017,5 %10
2nga përzierja e rund 15 41261111,3 %11
3nga përzierja e rund 25 38059811,1 %12

Raunde njësh dhe dysh bëjnë punën. Rund tre nuk bën: 11,3 kundrejt 11,1 përqind është brenda variacionit të drejtimit nga drejtimi në drejtim i çdo gjëje të matur në një krah fizik dhe një rund i katërt i të njëjtave korrigje shpenzon një pasdite për asgjë. Segmenti i sheshtë thotë ndryshoni diçka strukturore.

  • Dështimet e mbetura nuk janë të ndreqshme nga teleoperimi - objekti jashtë përqasjes, gjeometria e gripper, një bashkënd në kufirin e tij. Asnjë të dhënë korrijimi nuk rregullon një mur kinematik.
  • Korrigjimet janë shumë pak kundrejt dataset-i bazë për të lëvizur gradentin dhe asgjë nuk i peshon.
  • Korrigjimet kundërshtojnë njëri-tjetrin, kështu që politika mesatarizon dy strategji dhe zbret në mes.
  • Dështimi është në rrjedhën: një kamera lëvizi, ndriçimi ndryshoi, pamja e zgjimit nuk përkon më me trajnimin.
  • Detyra është në tavanin e kësaj klase politike në këtë pajisje dhe hapi tjetër është më shumë të dhëna bazë.

Dy të fundit nuk janë dështimet e syfatës. Në Sirius-Fleet një nevojë në rënie për njeriun është rezultati i projektuar: ndërsa autonomia e robotit përmirësohet, parashikuesit e tij i anomalisë përshtaten kriteret e parashikimit, duke çuar në më pak kërkesa për intervenimin njerëzor dhe gradualisht duke zvogëluar ngarkesën njerëzore me kalimin e kohës. Atje kriteri përshtatet me qëllim. Në një sylfate manuale tuaja përshtatet gjithashtu, në heshtje - kështu një shpejtësi që ngryshet sepse detyra është në tavanin e tij duket saktësisht si një që ngryshet sepse operatori ndaloi të vinte në mend. Cila është problemi tjetër.

Kurth 1: një shpejtësi në rënie nuk është një shpejtësi suksesi në rritje

Shpejtësia e intervenimit mat saktësisht një gje: sa shumë të drejtimit vendosët të posedoni. Kjo vendim është juaji bërë në kohë reale dhe ajo lëviz. Në rund zero merrni kontroll me këndsin e parë të keq të qasjes; nga rund tre keni parë politikën të rikuperojë nga një duzinë të tyre dhe e lini atë të përpiqet. Pragu juaj lëviz; politika mund të mos ketë. Shpejtësia bie në të dy mënyrat.

Besimi njerëzor është të paktën një sasi modeluar në letërsi në vend të një konstante të supozuar. Sirius ri-peshon mostrat e trajnimit me besim njerëzor të përafruar dhe optimizon politikën me klonimin sjelljeje të peshuar, raportuar një përfitim 8 përqind në simulim dhe 27 përqind në pajisjen reale mbi nivelin e artit në shpejtësinë e suksesit të politikës, në dy herë shpejtësinë e konvergjencës. Kjo trajton besimin si një peshë në të dhënat. Ajo nuk korrigjon pragrin në kokën tuaj ndërmjet rund zero dhe rund tre.

Ju nuk mund të hiqni zhvendosjen, kështu që çiftoni shpejtësinë me diçka që pragu juaj nuk mund të prekë: një bashkësi e fiksuar e provave në të cilat ju nuk ndërhyrni fare, dhënë kundrejt një kriteri të shkruar përpara rundit. Një shpejtësi që bie ndërsa shpejtësia e suksesit të çiftuar qëndron në vend është nënshkrimi i habituimit - vlen të kapet, sepse nga brenda syfatës ndjehet si përparim.

Shpejtësia e intervenimitShpejtësia e suksesit në protokoll të fiksuarLeximi më i mundshëm
bierritetRundi punoi. Vazhdoni.
biesheshtëPragu juaj zhvendosi ose korrigjimet hoqën përpjekjen pa hequr dështimet.
biebieKorrigjimet degradojnë politikën. Kontrolloni përzierjen dhe përputhjen e tyre të brendshme.
sheshtësheshtëRundi nuk blenë asgjë. Ndryshoni përzierjen, pikën kontrollimi ose detyrën para se të mbledhni më shumë.
rritetbieRegresion. Dyshoni në përzierjen e trajnimit, në një kamera të ndryshuar ose në një përzieje të pikës kontrollimi përpara se të dyshoni në metodën.

Kurth 2: pa një protokoll të fiksuar, ju matni dhomën

Vlerësimi i robotit në botë reale është i shtrenjtë dhe i vështirë të përsëritet. Autorët e SIMPLER-it motivojnë vlerësimin e simuluar me vëzhgimin se vlerësimi në botë reale i politikave të tilla nuk është i shkallëzueshëm dhe përballet me sfidat e riproduksimit ka të ngjarë të përkeqësohen ndërsa politikat zgjerohen spektrin e detyrave të tyre. RoboArena e sulmon nga ana tjetër, me më shumë se 600 episode të vlerësimit të robotit në çifte në shtatë politika përgjithësim, të ekzekutuar nga vlerësuesit në shtatë institucione akademike në platformën DROID. Vlerësuesit e tij zgjedhin detyrat dhe mjedisit e tyre, por duhet të gjykojnë palë të politikave në mënyrë të dyfishtë të verbër; të dokumentit raporton se ky renditja e mbledhur mirë ndjek performancën e politikës generalisht më saktë se vlerësimi konvencional, i centralizuar.

Ju nuk do të drejtoni 600 episode të çiftuar në një SO-100 në një punëtori. Ajo që mund të bëni është hiqet varianca që kontrolloni - një listë aq e mërzitshme sa ajo zakonisht merret e kaluar.

DimensioniNgrij këtëAjo që zhvendosi nëse ju nuk
Fillim pozojNjë pozë shtëpie e shkruar, e drejtuar para çdo proveTrajektoria fillon jashtë shpërndarjeje
ObjektetShenjat me shirit dhe objektet e njëjta fizike të rezervuar për vlerësimNjë politikë më e mirë është në të vërtetë një objekt më afër
Kamerasit dhe dritaKëllëqa të njëjta, indeksa, ekspozim; nuk janë të mbyllur; fotografo konfiguriminIndeksat e kamares të ndërruar vetëm mund të dominojnë rezultatin
Provat dhe rregulla ndaliN e fiksuar, timeout e fiksuar, kriteri i shkruar përpara runditKriteret pas faktit shndërrojnë thuajse-rrëzohet në çerë që keni nevojë
Sjellje operatoriNuk ka ndërhyrje gjatë provave të vlerësimitVlerësimi bëhet një seancë tjetër korrigjimi

Pastaj aritmetika, pa mëshirë në numrin e provave që një punëtori mund të aftësojë. Nën përqasjen normale, 60 përqind sukses mbi 20 prova mban një gabim standard afër 11 pikës përqind - rrënja katrore e 0,6 herë 0,4 mbi 20 - dhe ndryshimi midis dy rundeve të tilla mban afër 15. Një kërcim nga 60 në 70 përqind është prandaj përputhur me asgjë e cila ndodhi. Pesëdhjetë prova sjellin figurën për rund afër 7 pikave dhe kostojnë një pasdite.

Ky asimetri është argumenti për shpejtësinë e intervenimit: llogaritur mbi milet e kornizave në vend të njëzet rezultateve binar, ajo lëviz më herët dhe më lëmuar. Kuragjja është se kornizat brenda një episodi janë shumë të korreluar - një grasp i keq jep një qind korniza të intervenimit të vazhduar - kështu madhësia efektive e mostrës është më afër numrit të dorëzimeve. Trajtoni shpejtësinë si treguesin e hershëm dhe shpejtësinë e suksesit si të vërtetën e ngadalshme në tokë.

Mbajeni episodet e vlerësimit jashtë pishinës trajnuese

Episodet e vlerësimit nuk duhet të hyjnë kurrë në dataset-in e komponuar të trajnimit - përndryshe rund n+1 shëndetetet në të dhënat që ajo u trajnua dhe kurba mat memorizimin.

Kurth 3: trajnimi vetëm në korrigjimet përkulet politikën

Korrigjimet janë të dhënat interesante, prandaj instinkti është të trajnosh në ta. Mos bej. Ata vijnë në ndërtim nga fetë e ngushtë të hapësirës së gjendjeve ku politika dështoi tashmë dhe thonë pothuajse asgjë për shumicën e drejtimit që punoi. Fine-tune në këtë fetë vetëm dhe ju merrni një politikë të mirë në të rikuperojne nga një qasje që ka marrë përsëri se si të bëjë një të pastër.

Mandlekar dhe kolegët e tij ndërtuan sistemin e tyre të ndërhyrjeje të largët rreth kësaj. Të tyre kadrimi: detyrat e manipulimit përmbajnë rajonet e grykës që kërkojnë një sekuencë të aksioneve të sakta - vendosja e një kapsulle në një makinë kafeje është shembulli e tyre - ku devijime të vogla çojnë në gjendet demonstruesi kurrë nuk mbuloi. Algoritmi i tyre trajnon përsëritimisht në të dhënat e reja në mënyrë që politika mëson të kalojnë ato gryka dhe ata raportojnë se agjente të trajnuar në të dhënat e intervenimit përrendojnë agjente të trajnuar në një numër të barabartë të mostrave nga demonstruesit jo-intervenimi.

Trajnimi vetëm në korrigjimet versus një përzierje e komponuar
Ajo që trajnimi vetëm në korrigjimet ju merrni
  • E shpejtë: një drejtim i shkurtër mbi disa episode të duzinë është mjaft e lirë të përsëritet
  • Synuar: gradienti dominohet nga gjendet ju kujdesemi për
  • I lirë për testimin nëse një stil korrigjimi është mësueshëm fare
Ajo që kushton
  • Shpërndarja e fine-tune nuk më ngjan shpërndarjeje detyra
  • Sjellja emëruese mund të degradohet në mënyrë të dukshme brenda një rund të vetëm
  • Shpejtësia mund të biet ndërsa suksesi bie me të - segmente të pastra për rikuperime të ndryshuara

Raporti i përzierjeje është një hiperparametër dhe meriton të shkruhet poshtë. Komponimi i dataset-i tjetër është ku vendoset: demonstrime origjinale plus bashkësia korrigimi, zgjedhje episodi për burim në vend të një rregulle që në heshtje tërhiq në atë që është në dispozicion. Atje kjo është një hap komponimi në kokpit dhe rezultati është një dataset i zakonshëm - shih dokumentacioni i trajnimit. Ajo që asnjë mjet bën për ju është regjistrimi i cili raport prodhoi kurba cilat.

Kurth 4: njerëu nuk është një ekspert i qëndrueshëm

Teoria e DAgger supozon një ekspert. Ju nuk jeni një në kuptimin teknik: korrigjimet juaja nuk janë mostra nga një shpërndarje me kushta e fiksuar mbi veprimet. Autorët e ACT-it emërojnë këtë kur rendosin pengesat për manipulimin e kapacitetit - gabimet grumbullohen me kalimin e kohës dhe demonstruimet njerëzore mund të jenë jo-stacionare. Sistemi e tyre ende arrin 80 deri në 90 përqind sukses në gjashtë detyra reale nga dhjetë minuta demonstruime në mënyrë kështu problemi është i rregullueshëm, jo i vdiq.

Studimi robomimic e bën pikën nga ana e të dhënave. Në gjashtë algoritme jashtë-linije në pesë detyra të simuluara dhe tre të botës reale multi-fazë, mësimet e tij përfshijnë ndjeshmërinë ndaj zgjedhjeve të modelimit, varësinë nga cilësia e demonstrimit dhe - ajo që dhuron më shumë këtu - variabilitetin i ardhshëm nga kriteret ndali, sepse trajnimi dhe objektivat e vlerësimit ndryshojnë. Pika kontrollimi me humbjen më të ulët nuk është në mënyrë të besueshme ai me shpejtësinë më të lartë të suksesit.

Ka një verzion harduer i kësaj: mënyra e hyrjes formon korrigjimin. Një udhëheqës-ndjekës rregullim prodhon trajektore të vazhdueshme të ritmuara nga njerëz. Shtypa të tastierës janë kufizuar shumë nga serveri - dy gradë për ndarjet e krahut, katër në gripper - kështu e njëjta qëllim vjen si një shkallë e hapave të vogla. Rrëshqitësit dërgojnë qëllime absolute dhe serveri lëviz më shumë gjashtë gradë drejt tyre për thërritje. Tre mënyra, tre shpërndarje veprimi; përzierja e të treve në një bashkësi korrigjimi dhe pastaj pyetja pse qasja u bë dridhur është vetë-shtrëngatë. Përqasja dokumentacioni i teleoperimit mbulon atë që çdo mënyrë dërgon.

Peshimi i ndërhyrjeve: IWR dhe ajo që erdhi më pas

Nëse korrigjimet janë pakica e vlefshme, rregullimi i parimeve është peshë në vend të ekskluzivitetit. Regresion i Peshuar në Intervenime është implementimi i referencës: të dhënat ndahen në intervenime dhe mostra jo-intervenimesh dhe dy ndarjet shëtiten në proporcion të barabartë gjatë trajnimit. Një bashkësi korrigjimi që është pesë përqind të kornizave më pas kontribuon gjysma të gradientit pa sjelljen emëruese zhduken nga shpërndarja.

Përqindja e barabartë është një pikënisje jo një ligj. Sirius përgjithëson atë me zëvendësimin ndarjes binare me një peshë të vazhdueshme nga besim njerëzor i përafruar; Sirius-Fleet lëviz vendimin lart, duke përdorur një model bote vizuale dhe parashikuesit e anomalisë për të vendosur kur pyet një njeri fare. Fija e përbashkët: flamuri i intervenimit është sinjal trajnuese jo vetëm një kolonë libri.

MetodaKush vendos kur vepron njerëuSi përdoren të dhënat e intervenimitRezultat i raportuar
DAgger (2011)Orari fiks; etiketat ekspert gjendet e vizituarNjë dataset që rritet, i pa-peshuarI kadruar si një reduktim në mësimin në internet pa ketuese
HG-DAgger (2019)Njerëu i kontrollimit të gating në një sistem realI grumbulluar; plis një prag sigurimi i mësuar mbi pasigurinë e modelitMë mirë se DAgger dhe BC në drejtim; asnjë numra intervenimesh dhënë
IWR (2020)Njerëu përmes teleoperimit të largëtMostra intervenimesh dhe jo-intervenimesh të përpunuara në proporcion të barabartëPërrendoj demonstruimet jo-intervenimi në numër të barabartë të mostrave
Sirius (2022)Njerëu gjatë deploymentBC i peshuar, peshon nga besim njerëzor i përafruarfitim 8 % në simulim, 27 % në pajisjen reale; konvergjencë 2x më e shpejtë
ThriftyDAgger (2021)Sistemi duke gated mbi novitet dhe rrezikKoleksion interaktiv nën një buxhet mbikëqyrjejeStudim përdoruesi (N=10): 57 % më i lartë njerëzor dhe 80 % performancë e robotit më i lartë se metoda tjetër më e mirë
Fleet-DAgger (2022)Sistemi duke ndarë atensionin në të gjithë një flotëMësimi në flotë shëndeteton nga Kthimi në Përpjekjen NjerëzoreDeri në 8.8x më i lartë ROHE se bazat
Sirius-Fleet (2024)Parashikuesit e anomalisë me kritere vetë-përshtateMësimi multi-detyrë me një model bote vizualeMë pak kërkesa intervenimesh ndërsa autonomia përmirësohet
Pamje tabela e krahasimit të politikave të robotit sipas pikës të matur
Renditja e politikave kundrejt njëri-tjetrit do të thotë diçka vetëm kur çdo zënë drejtoi protokoll të njëjtë. Ajo zbatohet për tre raunde tuaja gjithashtu.

Katër metrika vlen të regjestrohet pranë shpejtësisë

  • Dorëzime për drejtim. Njëzet korrigje të shkurtra dhe një e gjatë japin shpejtësi të ngjashme dhe përshkruajnë politika të ndryshme - njëra dridhje njëra me një pikë të verbër të vetme.
  • Gjatësia mesatare e intervenimit. Gjatësia në rritje me numrin në rënie do të thotë dështimet e mbetura janë të vështirat të cilat ajo duket përparim i vonshëm.
  • Koha ndaj intervenimit të parë. Një politikë që shkon më larg përpara se të ketë nevojë për ndihmë përmirësohet edhe kur shpejtësia totale është e sheshtë.
  • Ku përpunime përpunime grumbull. Bin flamuri me përsëri të normalizuar të episodit përparimet; një kulm i qëndrueshëm ndërmjet rundeve tregon në një grykë të vetme.

Një protokoll rund që ju mund të drejtoj në të vërtetë

Një rund i matur ka gjashtë hapa dhe prodhon një rresht në log. Katër të parat janë syfata; dy të fundit e bëjnë atë një matje.

  1. 1
    Ngrij protokollin e vlerësimit përpara rund zero

    Shkruaj poshtë fillim pozoj, vendosje objekti, kamerasit, numri i provave, timeout dhe kriterin e suksesit. Fotografo tabelën. Nëse dokumenti duhet të ndryshojë seria ristart.

  2. 2
    Matni bazën

    Drejtoj protokollin me asnjë ndërhyrje dhe regjistro sukseset; më pas drejtoj një seancë të instrumentuar me dorëzimin e mundshëm dhe regjistro shpejtësinë. Ato dy numra janë rund zero.

  3. 3
    Mblej korrigjimet në një stil të qëndrueshëm

    Një mënyrë hyrje për rund, një operatori nëse mund të menaxhoni atë. Merrni kontroll në një kriteri ju mund të deklaroni me zë - 'gripper më shumë se dy centimetër jashtë në qasje' - dhe mbajeni për rundin.

  4. 4
    Triazh çdo episod e njëjta ditë

    Korrigjim, vlerësim ose likuidacion. Episodet e paqarta merren likuidim jo ruajtur në teorinë se më shumë të dhëna ndihmojnë - një korrigjim në të cilin ju vetë gafuar është më keq se asnjë episod.

  5. 5
    Kompononi përzierjen në mënyrë të qartë

    Demonstruime origjinale plus korrigjimet episod zgjedhje për burim. Regjistro numri bazë numri korrigjimi dhe ndonjë peshim - kjo është fusha ju do të doni në tre javë.

  6. 6
    Vazhdoni nga pika kontrollimi më pas ri-matje

    Trajnoi dataset-in e komponuar nga pika kontrolli e mëparshme në vend të modelit bazë drejtoj protokollin e ngrirë plis një seancë të instrumentuar append rresht dhe krahasoj kundrejt dy rundeve të mëparshme.

Dy kufijtë ndryshojnë se si lexoni një rund të dobët. Vazhdimi nga një pika kontrolli inicializon peshat nga ajo - jo një riprodhim optimizatori në mënyrë orari fillon frash dhe një drejtim të shkurtër nga një pika kontrolli e konvergjuar mund të lëvizë shumë pak. Dhe lëvizja e udhëheqës-radhitje në fillimin e një dorëzimi ka mileazhin më të shëndetshëm në pajisjet reale të ndonjë gjëje në zinxhir; nëse korrigjimet të gjitha fillojnë me një transitori të cuditshëm shqyrto atje përpara se të biesh në përzierjen.

Syfata e matur tashmë e telit

ay-robots zbaton këta gjashtë hapa si veçori produkti: merrni kontroll mesi-drejtim nga një krahë udhëheqës tastierë ose rrëshqitëse me kornizat e intervenimit të shenjuara automatikisht; triazh çdo episod si korrigjim vlerësim ose likuidim; kompononi dataset-in tjetër nga demonstruime origjinale plis korrigjimet zgjedhje episodi e qartë për burim; dhe fillim lënda trajnim tjetër nga pika kontrolli e mëparshme në vend të modelit bazë.

Shih se si syfata DAgger punon

Ajo që numrat nuk mund t'ju thonë

Asgjë e kësaj nuk zgjidhet dhe një kurbë e këndshme nuk duhet t'ju bindë përndryshe. Shpejtësia e intervenimit mat një sistem të përmbashkët - politika pajisje operatori dhomë - dhe atribuon asgjë në vetë. Ajo nuk mund të gjykoj nëse korrigjimet ishin të mirë dhe do të biet me gëzim në një detyrë e cila u tha më lehtë sepse objekti zhvendosur dy centimetër më afër mbi tre javë.

Ajo që bëhet ajo kalon një mblesje në një kolonë ju mund të luftoni me. Alternativa nuk është një metrikë më mirë; ajo është tre javë të mbledhjes korrigjimet kurbë do të ju thonin pas rund tre të ndaluar mbledhje. Letërsia shqyrtim përcakton mësimin interaktiv përmes imitimit si përgjigje njerëzore dhënë në periudha gjatë ekzekutimit të robotit duke lejuar një përmirësim në internet të sjelljese; familje është gjerë dhe asnjë rregullim e saj punon pa një numër për rund. Shih gjithashtu udhëzim mësimi përmes imitimit SO-100 për dataset-in bazë ju përzierje kundrejt drejtim një politikë për anën e përfundimit dhe faqja syfata DAgger për pipeline-in e zbatuar.

A shpejtësia e intervenimit vetëm një minus shpejtësia e suksesit?

Jo. Shpejtësia mat sa shumë të një drejtim ju merrni kontroll; shpejtësia e suksesit mat nëse detyra u bë pa ju. Një drejtim mund të rezultohet me një 30 përqind shpejtësi intervenimesh dhe një drejtim me asnjë ndërhyrje mund të dështojë si duhet. Ata gjithashtu ndryshojnë në zhurmë: shpejtësia lëviz në mënyrë të butë mbi milet e kornizave të korreluar shpejtësia e suksesit kërcen midis dorë të rezultateve binar. Regjistro të dyja.

Sa prova të vlerësimit kam nevojë për shpejtësinë e suksesit të do të thotë ndonjë gje?

Më shumë se ndjehet e arsyeshme. Nën përqasjen normale 20 prova në një vërtetë të vërtetë 60 përqind shpejtësia suksesi mban një gabim standard afër 11 pikës përqind prandaj një lëvizje 10-pikë ndërmjet rundeve nuk dallohet nga zhurmë; 50 prova sjellin figurën afër 7. Nëse ju nuk mund të aftësojë 50 mbajë numri i provave identik në tërë raunde dhe trajtoj lëvizje të vogla si jo konkluzioni.

Cila përzierje raport demonstrime korrigjimet duhet të filloj me?

Pika e dokumentuar fillimin është IWR të: ndarje të dhënat në intervenime dhe mostra jo-intervenimesh dhe vizato atë në proporcion të barabartë në mënyrë korrigjimet kontribuon gjysma të gradientit se sa një fraksion i vogël të kornizave ato janë. Nëse rregullimi juaj nuk mund të peshon mostrimin përafro atë përmes numrave episodi kur komponon dataset-in dhe regjistro raportit. Trajnimi vetëm në korrigjimet është opsioni për të mbyllur.

Shpejtësia intervenimeve të mia shkoi lart pas një rund. A është rund-i marr?

Jo domosdoshmërisht por kontrolloj shpjegime e mëmendshme fillim: a pika kontrolli ju drejtuat përputhjen ai ju trajnuat a indeksi kamera ose këllëqu ndryshuar a vendosje objekti zhvendosur a stil korrigjimi përdor. Nëse të katër janë të pastra dhe shpejtësia e suksesit të çiftuar gjithashtu bie dyshoni përzierjen - shumë pak demonstruimet bazë kundrejt korrigjimet ose korrigjimet që kundërshtojnë njëri-tjetrin. Një regresion i vërtetë i përket log nuk bin.

Mund të kaloj protokollin e vlerësimit të fiksuar dhe vetëm shikoni shpejtësinë e intervenimit?

Vetëm nëse pranoni se ju nuk mund të thuaj përmirësim nga habituim. Shpejtësia varet nga pragu juaj në kohë reale për të hyrë në lëvizje dhe atë prag bie kur ju merrni mësuar ekstremizimet e politikës. Protokolli i ngrirë është pjesa e matjes pragu juaj nuk mund të prekë - shenjat me shirit një pozë shtëpie e shkruar një numri provë fiks një kriteri vendosur përpara rund. Ajo duhet të qëndrojë i pandryshuar nëpër serinë.

Mbajeni log-in në depo nuk në një libër: raunde janë ditë përveç pajisje merret ndërtuar dhe personi lexim kurbë në tetor është ju me asnjë memorie tetor. Përgjigja dokumentacioni FAQ mbulon detajet në ekzekutim të lënë këtu.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started