
Një përshkrim hap pas hapi i një raundi DAgger me kontroll njerëzor në një krah SO-100: drejtoje politikën dhe regjistroje atë, merre kontrollin kur shkon gabim, regjistroje si korrigjim, kombinoj një grup të dhënash të përzier, dhe vazhdo trajnimin nga një kontrol. Përfshin shtegën e marrjes së kontrollit me tastierë dhe rrëshqitëse për njerëzit pa një krah udhëheqës, dhe katër gabimet që bëjnë një raund të padobishëm.
Politika juaj funksionon. Arrin në kubik, mbyll gripin një centimetër shumë herët, dhe vazhdon sikur ta kishte të. Asgjë nuk krijon gabim, dhe asnjë sasi e shikimit të humbjeve të trajnimit nuk e shpjegon. Zgjidhja nuk është 20 000 hapa të tjerë të rënies gradiente në të njëjtat demonstrime. Është të vendosësh dorën përsëri në krah pikërisht ku shkon gabim, të regjistrosh se çfarë bëre në vend, dhe të trajnosh kontrolin e ardhshëm në të dhënat e vjetra plus atë korrigjim. Ky është një raund DAgger, dhe kështu funksionon në një SO-100 me një politikë të shikimit-gjuhës-veprimit.
Teoria është diku tjetër: pse grumbullimi i grupit të të dhënave funksionon fare dhe çfarë ndryshon kontrolli njerëzor në lidhje me të. Ky është manuali i operimit, dhe supozon një kontroll të trajnuar, një grup kamerash të punueshëm, dhe një krah që lëviz. Gjashtë hapat më poshtë janë laku siç është zbatuar në faqja DAgger e kësaj platforme, por sekuenca është e njëjtë nga skriptet tuaja.
Një raund në shkurtim
- •Drejtoje politikën e trajnuar dhe regjistroje atë, me tekstin e detyrës të ekzekutimit në vend të një etikete të përgjithshme teleoperimi.
- •Merre kontrollin në momentin kur sjellja shkon gabim: një kalim në pasqyrë me një krah udhëheqës, i menjëhershëm dhe manual përmes tastiere ose rrëshqitëse pa një.
- •Bëj triage secilit drejtim: regjistroje si korrigjim, mbaje si një episode vlerësimi, ose hidhe atë.
- •Kombinoj përzierjen me dorë - demonstrime origjinale plus korrigjime, episode të zgjedhura për burimin. Mos trajno kurrë vetëm në korrigjime.
- •Vazhdo trajnimin nga kontroli i fundit, dhe shëno cili kontrol prodhoi cilën përzierje.
- •Numri që thotë nëse raundi ishte i vlejshëm është shkala e ndërhyrjes, jo humbja e trajnimit.
Pse raundi i dytë nuk është thjesht më shumë të dhëna
Klonimi i sjelljes trajnon në gjendet që ka vizituar njeriu. Në kohën e testimit, politika viziton gjendet që ajo shkakton, dhe gabimet e veprimit të vogël përbëhen në gjendet që asnjë demonstrim nuk mbulon. Ross, Gordon dhe Bagnell formalizuan atë dështim për AISTATS 2011 dhe e përgjigjen me një algoritëm përsëritës që trajnon një politikë përcaktuese të palëvizur dhe, sipas zvogëlimit të tyre, duhet të funksionojë mirë nën shpërndarjen e gjendes që ajo shkakton: drejtoje politikën e tanishme, bëje ekspertin ta etiketojë gjendet që ajo në të vërtetë arriti, shto ato në grupin e të dhënave, ri-trajno, përsërit. Kelly etj. e bënë përgjigjen praktike me HG-DAgger, ku njeriu vendos kur të marrë kontrollin në vend që të etiketojë gjendet pa mbajtur kontrolet; ata raportojnë performancë të përmirësuar ndaj të dy DAgger dhe klonimit të sjelljes në një detyrë autonome drejtimi të simuluar dhe të vërtetë. Kontrollimi njerëzor është ajo që e bën lakun tolerueshëm në një krah tavolinë - ti lëviz duart vetëm kur diçka shkon gabim.
Dy pasoja kanë rëndësi më shumë në praktikë se sa teoria. Korrigjime nuk janë demonstrime të zakonshme: ato përqendrohen në rajonet e ngushtesave Mandlekar etj. përshkruajnë, ku një devijim i vogël e hedh politikën në gjendet që demonstrimet kurrë nuk mbuluan. Dhe një grup të dhënash i përbërë vetëm nga ato pjesë të vështira është një grup të dhënash i keq formuar - Belkhale, Cui dhe Sadigh argumentojnë nga ana e të dhënave që diversiteti i gjendes nuk është gjithmonë i dobishëm, dhe që divergjenca e veprimit dhe diversiteti i kalimit së bashku vendosin cilësinë e grupit të të dhënave. Grupi i të dhënave i përzier nuk është kompromis, është pika.
Ngrije këto para raundi një
Një raund DAgger krahason një politikë kundër vetes në kohë. Çdo gjë që ndryshon midis raundeve që nuk është grupi i të dhënave e bën atë krahasim të pavlerë.
- Pozicione dhe montahe kamerash, përfshirë kamera dorëzash. Liroje një klamë dhe ke ndryshuar shpërndarjen e vëzhgimit, jo politikën.
- Ekspozim dhe balancim i bardhë, nëse pirgja jote e kapjes të lejon të pin ato. Zhvendosja e auto-ekspozimit midis raundeve është një ndryshim domeni i ngadalshëm, i padukshëm.
- Kalibrimi i krahuart dhe pozicionet zero servo. Nëse duhet të ri-kalibrosh, trajtoje gjithçka e regjistruar para sa një grup të dhënash i veçantë.
- Teksti i detyrës. Çdo VLA këtu kushtet në të; ri-fjalimin e tij mid-loop është një detyrë tjetër.
- Ndriçim, sipërfaqe tavoline, grup objektesh. Një objekt i ri është një eksperiment i ri, jo raundi i ardhshëm.
- Shpejtësia e kuadrit të regjistrimit. Krahasimi i shkallës së ndërhyrjes në dy rrjeta të kampionimit prodhon dallime që vijnë nga rrjeta.
Hsu etj. krahasuan një pamje të përqendruar në dorë kundrejt pamjes së zakonshme të tretë personit dhe gjetën perspektivën sy-në-dorë rregullisht e përmirësoi efikasitetin e trajnimit dhe përgjithësimin jashtë shpërndarjes, pavarësisht se panë më pak të skenës. Në një krah pesë artikulesh, koha e gripit zakonisht është ajo që korrigjime tuaja po rregullojnë, dhe koha e gripit është ajo që paraja e dores mbart.
Raundi, nga fundi në fund
- 1Drejtoje përfundimin dhe regjistroje atë
Fillo drejtimin kundrejt kontrolit që dëshiron të përmirësosh, pastaj fillo regjistrimin në rrënjën e përfundimit. Regjistruar në atë mënyrë ajo trashëgohet teksti i detyrës të ekzekutimit, i cili është ajo çfarë politika u trajnua, në vend të etiketës së parazgjedhur teleoperimi. Pa regjistrimin mund të shikosh dështimin por jo të trajnosh në të.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Merre kontrollin kur shkon gabim
Shtyp Merre kontrollin dhe zgjidh modalitetin e hyrjes: krah udhëheqës, tastierë ose rrëshqitëse. Drejtuesit pauzoj, ti korrigjo, ti dorëzo përsëri. Kuadrot e regjistruar ndërsa ti drejtoje janë shënuar si ndërhyrje automatikisht.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Bëj triage episodet
Vendos për episode: regjistroje si korrigjim, mbaje si vlerësim, ose hidhe. Një drejtim që politika e përfundoi pa ndihmë është të dhëna vlerësimi.
- 4Sinkronizo grupin e të dhënave të korrigjimit
Korrigjime grumbullohen në një grup të dhënash lokal për politikën dhe shkon në ruajtjen në re përmes sinkronizimit automatik. Asgjë nuk përzihet që ti nuk e vendose atje.
- 5Kombinoj grupin e të dhënave të përzier
Kombinoj grupin origjinal të të dhënave me korrigjime, duke zgjedhur episodet në mënyrë të qartë për burimin. Rezultati është një grup të dhënash i zakonshëm nga atë pikë e në.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Vazhdo trajnimin nga kontroli
Trajno përzierjen nga kontroli i mëparshëm në vend të modelit bazë. Shëno cili kontrol dhe cilën përzierje; pa atë çift raundi nuk është i riprodhueshëm.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Hapi 2 në detaj: dy mënyrat për të marrë kontrollin
Me një krah udhëheqës
Në udhëheqës-ndjekës modu marrja e kontrollit është një kalim midis dy krahëve që nuk janë në të njëjtën pozë. Shtyp Merre kontrollin pauzoj drejtuesin dhe ngat udhëheqësin në pozën aktuale të ndjekësit, kështu që asgjë nuk kërcen kur transferta e çift-moments. Nëse drejtimi i rreshtimit kohon deri, ti rreshton udhëheqësin me dorë dhe lëshoj vetëm kur të dy janë brenda pesë shkallë. Nga atëherë e tutje ti teleoperoj normalisht dhe kolona e veprimit rekordon atë që ti urdhërove.
Qihu i sinqertë për këtë shteg: drejtimi i rreshtimit dhe kalimi i çift-momentit janë pjesa më pak e testuar e lakut në hardware real. Provo kalimin në një pozë të ngadalshme, të padëmshme përpara se të mbështetesh në të në një drejtim që e dëshiron. Një krah udhëheqës prodhon korrigjime më të lëmuar të tri modeve, dhe gjithashtu ka më shumë që mund të shkoj gabim mekanikisht.
Pa një krah udhëheqës: tastierë dhe rrëshqitëse
Shumica e njerëzve lexojnë këtë zotërojnë një krah. Ky është i mjaftueshëm. Zgjidh hyrje tastiere ose rrëshqitëse në momentin që shtyp Merre kontrollin, dhe marrja e kontrollit është e menjëhershme dhe manuale - nuk ka krah të dytë për t'u rreshtuar, kështu që nuk ka hap rreshte. Ndjekësit mbante pozën dhe pret për hyrje.
| Modu i hyrjes | Si lëviz krahu | Kufir për-thirrje i zbatuar nga serveri | Bllokuar kur |
|---|---|---|---|
| Krah udhëheqës | Pasqyra ngat ndjekësin nga këndet e ndarjeve të udhëheqësit | Asnjë nxitje ose thirrje vendosmeje në këtë modu; pasqyra shkruan qëllime ndjekës vazhdimisht | Asnjëherë nuk është bllokuar, dhe parazgjedhja nëse nuk është dhënë modaliteti i hyrjes - por ajo ka nevojë për një krah të dytë; pa një id udhëheqës marrja e kontrollit refuzohet |
| Tastierë | Nxitje relative për shtypje çelësi, e dërguar në pikën përfundimtare të nxitjes të marrjes së kontrollit | Klamë e vështirë në 2 shkallë për ndarje, 4 shkallë për gripin | Refuzuar me 409 nëse marrja e kontrollit u fillua në modalitetin udhëheqës |
| Rrëshqitëse | Pozë e synuar absolute, e dërguar në pikën përfundimtare të vendossmejës të marrjes së kontrollit | Më shumë 6 shkallë të udhetimit në drejtim të synimit për thirrje; ndërfaqja mbante dërgon rreth dhjetë herë për sekondë | Refuzuar me 409 nëse marrja e kontrollit u fillua në modalitetin udhëheqës |
Klamët janë zbatuar në anën e serverit, jo në ndërfaqe, sepse një delta i gabuar në një krah servo-bus është një përplasje. Korrigjime tastiere dalin në mënyrë shkallimi dhe pak të ashpra; korrigjime rrëshqitëse janë më të lëmuara, sepse serveri kaminon në drejtim të synimit ndërsa ndërfaqja mbate dërgon. Në çdo rast kolona e veprimit merr vektorin e plotë të pozës të urdhëruar dhe shënimi i ndërhyrjes është identik me shtegën e udhëheqësit, kështu që korrigjime tastiere zbritin në të njëjtin grup të të dhënave pa një ndryshim formati.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kur të shtypësh butonin
Më shumë herët se vone. Një korrigjim që fillon pasi gripi ka mbyllur mbi asgjë u mëson rikuperimin nga një dështim që politika nuk duhej të ishte futur, dhe të dhëna rikuperimi vlen shumë më pak se të dhëna shmangje. Ndërpre në momentin e parë kur je i sigurt se trajektoria është e gabuar, korrigjo përmes pjesës së vështirë, dorëzo përsëri sa më shpejt gjendje është e cila politika e trajtoi më parë. ThriftyDAgger automatizoj atë vendim nga portalizimi i ndërhyrjeve në novelete dhe riskun e vlerësuar nën një buxhet njerëzor të fiksuar, por në një krah të vetëm me një njeri tashmë shikues, porta njerëzore është më e lirë dhe më mirë të kalibruar se çdo gjë ti do të akordosh.
I bëjshëm me pirgjën e burim-hapës dhe disa skripte. Ajo që kushton është kontabiliteti, dhe kontabiliteti është ku raundi DAgger vdesin.
- Shkruaj kuadrot nga skripti juaj i vetë i përfundimit në një grupi të dhënash LeRobot, me vargun e detyrës të cilit politika ishte trajnuar.
- Pauzo lakun politike, ndryshoje burimin e komandes, dhe shënoje çdo kuadër që ti drejtoje si ndërhyrje. Pa shënimin, korrigjime duken si demonstrime të zakonshme.
- Vendos me qëllim se çfarë ndodh për kuadrot e kalimit midis politikës të lëshimit kontroll dhe hyrjeve tuaja të parë.
- Mbaje korrigjime në grupin e tyre të të dhënave për politikën, dhe shkolle indekset episode me dorë kështu që përzierja mund të ri-ndërtohet.
- Theso pika përfundim të përpunimit të mirë në kontrolin e mëparshëm, dhe kontrol në regjistrin që ai ngarkoi ato pesha.
Të njëjtat gjashtë hapa ekzistojnë si butona. Ajo që automatizimit është ajo që është e lehtë të bësh gabim me dorë: shënimi i ndërhyrjes për-kuadër, ndarja midis korrigjimesh dhe vlerësimesh, dhe regjistri se cili kontrol prodhoi cilën përzierje. Asgjë nuk hyn në një grupi të dhënash të kombinuar që ti nuk zgjodhe.
Ajo nuk vendos për ty. Cili drejtim llogaritet si korrigjim, cilat episode shkon në përzierje, dhe kur të ndalet mbeten thirrje gjykimi. Fushat janë dokumentuar nën trajnim, modalitetet e hyrjes nën teleoperim.
Hapi 3 në detaj: triage vendos cilësinë
Pas ekzekutimit ti ke një regjistrim me disa kuadra të shënuara si ndërhyrje. Tre përzgjedhje ekzistojnë, dhe e vëllezër peshon në heshtje raundun e ardhshëm.
- Regjistroje si korrigjim kur ndërhyrja ishte një korrigjim i vërtetë: politika ishte duke shkuar diku gabim dhe hyrje juaja tregoi gjëin e duhur nga gjendje e politika vetë e prodhoi.
- Mbaje si vlerësim për ekzekutimet autonome të pastër dhe për ekzekutimet të cilat ti merre kontrollin nga parandalim. Episodet vlerësimi janë si ti mas kontrollin e ardhshëm, dhe ato nuk duhet kurrë të trajnohen.
- Hidhe ekzekutimet e shkatërruar nga diçka e lidhur - një kuadër kamerash të rënë, një servo i ngulur, një objekt të cilin ti shkundte poshtë. Një korrigjim i rrëmujshëm është më keq se asnjë korrigjim.
Midis politikës të lëshimit kontroll dhe hyrjeve tuaja të parë, krahu mban qetësi ndërsa regjistri vazhdon të shkruaj - një ekzekutim të nëna identike të çiftuar me imazhe të ndryshme pakëz. Këtu ato kuadra kalimet qëndrojnë në regjistrin e papërpunuar dhe jashtë grupit të të dhënave të korrigjimit. Nëse ti ndërto lakun vetë, preje ato në qëllim: një politikë e trajnuar në ato mëson të pauzo ku duhet të veprojë.
Hapi 5 në detaj: kombinimi i përzierjes
Kombinimi merr grupin origjinal të të dhënave plus grupin e të dhënave të korrigjimit dhe prodhon një të ri, të zakonshme grupi i të dhënave LeRobot që trajnon si çdo tjetër. Karakteristika e rëndësishme është se përzgjedhja e episodes është e qartë për burimin - asgjë nuk përzihet në mënyrë automatike. Kjo duket e vogël deri herën e parë një politikë sillet çuditerisht dhe ti duhet të ri-ndërtosh atë çfarë ishte trajnuar.
Pyetja e hapur është raporti, dhe askush nuk ka një numër që transferi. Ajo që literatura bëhet dakord është se korrigjime duhet të llogariten për më shumë se pjesa e tyre kuadër. Mandlekar etj. ri-trajno nëpërmjet përsëritje në të dhëna sistemi i tyre i ndërhyrjes grumbullon, kështu që politika mëson të përshko ngushtesave, dhe raporti se agjentë trajnuar në këtë mënyrë tejkalojnë agjentë trajnuar në një numër ekuivalent të mostrave nga demonstruese jointervencioniste. Sirius shkon më tej dhe ri-peshoj mostrat e trajnimit nga besimi njerëzor i përafërt, raportimi se 8 përqind fitim në simulim dhe 27 përqind në hardware të vërtetë në shkalla e suksesit politike ndaj metodave të cilat krahason, në shpejtësi konvergjence dyfish. Asnjë nga pikat e fillimit të trajnimit këtu ekspozoj një çelës të peshimit të mostres, kështu që zëvendësuesi i ashpër është të mbajë çdo episode korrigjimi ndërsa në-kampionim demonstrime origjinale - dhe të shkruaj atë çfarë ti bëre.

Hapi 6 në detaj: çfarë do të thotë vazhdimi nga një kontrol do të thotë
Trajnimi i përzierjes nga modeli bazë funksionon por hedh raundun e mëparshëm dhe kushton një ekzekutim të plotë. Vazhdimi nga kontroli është më i shpejtë dhe zakonisht më i mirë. Ajo është gjithashtu më e kufizuar se sa fraza sugjeron.
Një kontrol vetëm-peshe përmban parametrat dhe asgjë tjetër. Ngarkimi i tij e jep ekzekutimit të ardhshëm një pikë filljese më të mirë se modeli bazë, por momente optimizer, pozicioni i kronogramit të shpejtësisë të mësimit dhe renditje të dhënave të gjithë fillojnë nga zero. Prevo një spike humbje në fillim të ekzekutimit të vazhduar, mos e lexo si dështim, dhe mos e thirr raundun një rikthim. Ajo është një fillim i ngrohtë.
| Politika | Madhësia | Shtresa GPU | Përfundim për hap veprimi | Formati i grupit të të dhënave | Episodet përpara se të vlejë të provojnë |
|---|---|---|---|---|---|
| GR00T N1.7 | rreth 3 B, zëvendësisht 40 M trajnuar gjatë përpunimit të mirë | A100 80 GB ose H100 80 GB | rreth 152 ms | LeRobot v2.0 ose v2.1 | 50 |
| GR00T N1.5 | rreth 3 B | A100 80 GB ose H100 80 GB | rreth 165 ms | LeRobot v2.0 ose v2.1 | 50 |
| Pi0.5 | rreth 3 B në një kôm PaliGemma | A100 80 GB ose H100 80 GB | rreth 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | rreth 450 M | RTX 4090 ose çdo kartë 24 GB | rreth 245 ms | LeRobot v3.0 | 30 |
| ACT | rreth 80 M, trajnuar nga e para | RTX 4090 ose çdo kartë 24 GB | rreth 20 ms | LeRobot v3.0 | 50 |
Vonesa përzihet brenda një DAgger loop në një mënyrë ajo nuk funksionon gjatë një demonstrim: në zëvendësisht 485 ms për hap veprimi ti merre kontrollin sepse krahu nguroi, jo sepse ishte e gabuar, dhe korrigjime ngurimi nuk janë të dhëna të dobishme trajnime. Nëse ti je përsëritje në të dhëna në vend të ndjekje një shkalla përfundimtare suksesi, përsërit në një model të shpejtë. Shukor etj. përshkruajnë SmolVLA si dizajnuar për të trajnuar në një GPU të vetëm dhe për të zbatuar në GPUs të konsumatorit ose CPUs, me një pirgjë përfundimi asinkron që zhkuplon parashikimin e veprimit nga ekzekutim për të lejuar norma kontrolli më të larta - karakteristika që mban lakun e marrjes së kontrollit përgjegjës.
Formate grupi të dhënave nuk janë të ndërrueshmëm gjithashtu. GR00T merr LeRobot v2.0 ose v2.1, dhe repository Isaac-GR00T përshkruan hyrje si një shtirje e formati LeRobot v2 me një skedari përshkrimi të shtuar modaliteti; ata më të ri trajnues këtu presim v3.0. Një përzierje e kombinuar në version të gabuar dështon në kohën e ngarkimit në vend të prodhimit të një politike të keqe - moda më e mirë dështim, akoma një slot radhe të shënjuar. dokumentacioni i grupit të të dhënave liston cili formati çdo trajnues merr.
Laku, me kontabilitetin tashmë të bërë
Merre kontrollin me krah udhëheqës, tastierë ose rrëshqitëse; shënim ndërhyrje për-kuadër; regjistrimi i ekzekutimeve si korrigjime ose vlerësime; kombinimi i grupit të dhënash i përzier me një përzgjedhje episode të qartë për burimin; dhe vazhdimi i trajnimit nga një kontrol në vend të modelit bazë. Ajo që qëndron vendimi juaj është se cili drejtim llogaritet si korrigjim, se çfarë shkon në përzierje, dhe kur shkalla e ndërhyrjes ka ndalluar rënien.
Shiko se si laku DAgger është kabëluarKatër mënyra për të shpenzuar një raund
1. Trajnim vetëm në korrigjime
Dështimi më i zakonshëm dhe shtegu i shkurtër më tundues. Një grupi të dhënash vetëm-korrigjim është pothuajse tërësisht e mesme e vështirë e detyrës, me qasje dhe tërheqje të mungon; politika merr më të mirë në pjesën e vështirë dhe harron se si të arrijmë atje. Grumbullimi nuk është detaj zbatimi i metodës, ajo është mekanizmi: të dhënat e vjetra janë ato që mban pjesën tjetër të sjelljes në vend ndërsa korrigjime lëviz një pjesë të tij.
2. Lëvizja e kamera midis raundeve
Një kamera që ndryshon dy centimetra midis raundeve prodhon një politikë më keq se ajo të cilën ti filloi, dhe një diagnozë të cilat kushton një ditë. Çdo VLA këtu kushto në imazhe; gjendje ndarje vetëm nuk disambiguon ku është objekti. Fotoje vendosje para raundi i parë dhe kontrol atë fotografi para çdo raund më vonë.
3. Duke lejuar artefakte kalimet në trajnim
I mbuluar më lart, dhe në listë sepse ajo është e padukshme. Simptoma është një politikë të cilat ngul për një fraksion të sekondës pikërisht ku operatori i raundi i mëparshëm merre kontrollin. Duket si ngurimi; ajo është imitimi.
4. Thirrja e fillimit të ngrohtë si rikthim
Nëse ti beson gjendje optimizer i mbaruar, spike humbje filljese lexon si një gabim dhe ti shko duke kërkuar të dhëna të korruptuara. Nëse ti di optimizer i filluar të freskët, spike është përfunduar dhe ti shiko çfarë vjen pas tij. Të njëjtat numra, përfundime të kundërta.
Matja e raundi
Metrika për një lak me kontrolli njerëzor është shkala e ndërhyrjes: kuadrot e regjistruar ndërsa ti ishte në kontroll, ndarë me kuadra të plotë të ekzekutimit. Ajo është në statusin e marrjes se kontrollit, dhe ajo është numri i vetëm që përgjigjet pyetjet raundi pyeti. Humbja trajnimit bie nëse ose jo politika përmirësoi; norma suksesi është binare dhe me zhurmë në madhësitë e mostrat një krah tavolina prodhon. Norma ndërhyrje është e vazhdueshme, matur në gjendet politika vetë shkaku, dhe ajo bie si politika ti ka nevojë për ty më pak.
E krahasoje vetëm përmes ekzekutimeve të regjistruar në kushte identike. Argumenti i plotë, dhe si të ndërto një përzgjedhje vlerësimi të cilat tejkalon më shumë se dy raunde, është në artikull në matjen e një laku DAgger. Raundi një është në mënyrën e realizueshme një test vijueshmërie: ti është duke kontrolluar që marrja e kontrollit funksionon në hardware tuaj, që korrigjime zbritin me shënime të tyre, dhe që ekzekutim të vazhduar ngarkoi kontroli ti emërueshjen. Raunde dy dhe tre janë ku norma duhet të fillojë të lëvizë. Nëse ajo nuk lëvizt nga raund katër, problemi është lart rrjedhkës DAgger.
| Shkruaj përfundim raund | Pse nesh është rëndësi më vonë |
|---|---|
| Kontrol të cilat ishte drejtuar | Pa të ti nuk mund të përshkruaj një përmirësim në një përzierje |
| Modu i hyrjes përdorur për marrja e kontrollit | Korrigjime tastiere janë më të ashpra se korrigjime udhëheqës, dhe ajo tregon në të dhëna |
| Numri i ekzekutimeve dhe si çdo ishte triazh | Nëse raundi kishin mjaft korrigjime të materie |
| Norma ndërhyrje për ekzekutim, dhe mesatare | Metrika përparimi e lakut |
| Përzgjedhja exact episode për burimin | Mënyra e vetme për ri-prodhoj ose zhbëj një raund |
| Fillim i ngrohtë ose trajnim i freskët | Shpjegon lakun e humbjeve ti do të shikosh në një javë |
Nëse ti nuk kesh një kontrol ende
Laku nuk ka pikë hyrje pa një. Regjistroj një grupi të dhënash të parë, trajno një politikë të parë, drejtoje atë - regjistrimi, trajnim dhe drejtimin e politikës mbule atë shteg. Klienti regjistrimit është në faqja shkarkimit, shtresa GPU dhe norma orare në faqja çmimit, dhe se çfarë duket një episode e përdorshme në udhëzues të mbledhjes të dhënash SO-100. Merr demonstrime të duhur përpara korrigjimeve: DAgger është një mekanizëm riparimi, dhe ajo funksionon shumë më mirë në diçka të cilat ishte pothuajse e duhur tashmë.
A mund të drejtoj një DAgger loop pa një krah udhëheqës?▾
Po. Zgjidh hyrje tastiere ose rrëshqitëse kur ti shtyp Merre kontrollin: marrja e kontrollit është e menjëhershme dhe manuale, me asnjë krah të dytë për t'u rreshtuar. Tastiera dërgon nxitje relative që serveri klam i vështirë në 2 shkallë për ndarje dhe 4 për gripin; rrëshqitëse dërgon një synumin absolute dhe serveri lëviz më shumë 6 shkallë në drejtim të atij për thirrje, ndërsa ndërfaqja vazhdon të dërgoj. Kolona e veprimit dhe shënim ndërhyrje janë të njëjtë si në modalitetin udhëheqës, kështu që korrigjime janë të dallueshme në grupin të dhënash.
Sa korrigjime bën një raund të bëj?▾
Nuk ekziston një numër universal i mbrojtshëm, dhe numri kuadër ka rëndësi më shumë se numri episode. Rregulli i punës është se korrigjime nuk duhet të humbet në përzierje: me 200 episodet origjinale dhe tre episode korrigjim, asgjë nuk do të lëviz. Synojnë korrigjime të cilat mbule sjellji dështim nga disa konfigurimi filljese në vend të tre përsëritje të të njëjtit shpëtim.
Pse trajnim vetëm në korrigjime është ide kaq e keqe?▾
Sepse korrigjime janë pothuajse tërësisht mesme i vështirë e detyrës. Qasje, rreshtim dhe tërheqje janë të mungon, kështu që politika humb atë çfarë ajo tashmë bëri mirë ndërsa përmirësohet në pjesën ti ndreqe. Mbajta të dhënat e vjetra dhe shtoj në të është mekanizmi vetë, jo shtesë opsionale.
A mbaron vashdimi nga një kontrol atë ekzekutim trajnimit të mëparshëm?▾
Jo. Një kontrol vetëm-peshe rivendos parametrat dhe asgjë tjetër: momente optimizer, pozicioni i kronogramit të shpejtësisë të mësimit dhe renditje të dhënash filloj të freskët. Ajo është një fillim i ngrohtë, dhe një spike humbje filljese është përfunduar në vend të një simptom. Shkruaj se cilat e dy ti në të vërtetë bëre, kështu që ti lexoj lakun saktë një javë më vonë.
Çfarë po nëse norma ndërhyrje nuk bie?▾
Ndalo shtimin e raundeve. Një norma e barabartë do të thotë korrigjime nuk janë duke mësuar atë çfarë ti mendon. Shkaqet e zakonshme janë lart rrjedhkës: një kamera lëvizt, korrigjime filloj shumë vonë për të qenë të dhëna shmangje, kuadrat kalimet janë në grup trajnim, ose detyrë është underdetermined nga vëzhgime politika në të vërtetë merr.
Asnjë e kësaj nuk është një problem zgjdhur dhe asgjë e kësaj nuk është një klik. Të mësuarit imitim interaktive është një fushë e aktive kërkimit pikërisht sepse pyetje - kur të ndërhyj, si të peshoj atë çfarë njeriu bëre, sa shumë të dhëna të vjetra për të mbajtur - nuk kanë përgjigje të vendosur; anketa nga Celemin etj. hartat çfarë është ende i hapur. Ajo çfarë laku ka është konvergjenca i matshëm kur ajo është drejtuar me kujdes, në hardware të cilat kushton disa qind euros. Ngrije vendosje, ndërhyj herët, triazh me sinqeritet, përzier me qëllim, dhe regjistro norma ndërhyrje çdo herë.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started