
Skref-fyrir-skref lýsing á einni mannkjörnum DAgger-lotu á SO-100 armi: keyra stefnuna og skrá hana, taka yfir þegar hún fer úrskeiðis, skrá keyrsluna sem leiðréttingu, semja blandaðan gagnasafn og halda áfram þjálfun frá tímapunkti. Nær yfir lyklaborðs- og sleðaaðfangsleiðina fyrir fólk án stýriarma, og fjóra mistök sem gera lotugerðina gagnslaust.
Stefnan þín keyrir. Hún nær til teningurinn, lokar gripanum snemma um sentímetra, og heldur áfram eins og væru hún með hann. Ekkert misbrestur og engi magn af staring á þjálfunartapinu útskýrir það. Leiðrétingin er ekki 20 000 aðrar stigaflæðisraðir á sömu sýningunum. Henni er að setja höndina aftur á arminn nákvæmlega þar sem hún fer úrskeiðis, skrá hvað þú gerðir í stað þess og þjálfun næsta tímapunkti á gömlum gögnum auk þeirrar leiðréttingar. Það er DAgger lota, og þetta er hvernig maður rekur það á SO-100 með framtíðar-tungumála-aðgerða stefnu.
Kenningin er annars staðar: hvers vegna gagnasafns samsetning virkar alls og hvað mannkjör gating breytir um það. Þetta er rekstrarleiðbein, og það gerir ráð fyrir þjálfuðum tímapunkti, vinnandi myndavélasafni og armi sem hreyfast. Sex skrefin hér að neðan eru lotan eins og hún er útfærð á DAgger síðu þessarar vettvangur, en röðin er sú sama frá þínum eigin skrifum.
Ein lota í stuttu máli
- •Keyra þjálfaða stefnuna og skrá hana, með verkefnatexta keyrslunnar frekar en almennri fjarstyringarmerkingu.
- •Taktu yfir þegar hegðunin fer úrskeiðis: speglahönd með leiðtoga armi, tafarlaus og handvirk yfir lyklaborði eða sleðum án einn.
- •Flokka hverja keyrslu: skrá hana sem leiðréttingu, halda henni sem matsepísóðu eða fleygja henni.
- •Semja blöndunina með höndum - upprunalegar sýningar plús leiðréttingar, epísóður valdar á hverri uppruna. Aldrei þjálfun á aðeins leiðréttingum.
- •Haldu áfram þjálfun frá síðasta tímapunkti, og taktu eft hverjum tímapunkti framleiddi hvaða blöndun.
- •Talan sem segir hvort lotan var þess virði eitthvað er inngripastigið, ekki þjálfunartapið.
Hvers vegna seinni lotan er ekki bara fleiri gögn
Hermingu þjálfun þjálfar um ríki manneskjan heimsótti. Við prófunartíma stefnan heimsótti ríki það veldur, og litlar aðgerðir mistök samsetning inn í ríki engin sýning dekkaðist. Ross, Gordon og Bagnell formleituðu þann bilun fyrir AISTATS 2011 og svarað það með endalaust reiknirit sem þjálfar kyrrstæðan ákveðinn stefnu og, undir þeirra lækkun, hefur að framkvæma vel undir ríki dreifingu það inducesó keyra núverandi stefnu, hafa sérfræðingur merkja ríki það raunverulega náðu, bæta þau í gagnasafnið, endurþjálfun, endurtaka. Kelly o.fl. gerðu fyrirspurnina hagnýta með HG-DAgger, þar sem manneskjan ákveður hvenær á að taka stjórn frekar en merkja ríki án þess að halda stjórnunum; þeir tilkynna batnaðri frammistöðu yfir bæði DAgger og hermingu þjálfun á eftirlíkuðu og raunverulegri sjálfstjórnun verkefnum. Mannkjör gating er það sem gerir lotan þolandi á skrifborðsarmi - þú færir aðeins hendirnar þegar eitthvað er að fara úrskeiðis.
Tvær afleiðingar skipta meira sköpum í framkvæmdinni en kenningin gerir. Leiðréttingar eru ekki venjulegar sýningar: þeir einblína við bottleneck svæði Mandlekar o.fl. lýsa, þar sem lítil frávik fellur stefnan inn í ríki sýningarnar aldrei dekkaðist. Og gagnasafn gjörð aðeins af þessum erfiðu hlutum er illa löguð gagnasafn - Belkhale, Cui og Sadigh rök frá gögnum hliðina að ríki fjölbreytileiki er ekki alltaf gagnlegur, og að aðgerða frávik og umbreytingu fjölbreytileiki saman ákveða gagnasafns gæði. Blandaðan gagnasafnið er ekki málamiðlun, það er stigið.
Frost þetta fyrir undir lotueinni
A DAgger lota ber saman stefnu gegn sjálfu sér yfir tíma. Allt sem þú breytir á milli lota sem er ekki gagnasafnið gerir þá samanburð skilyrðislaust.
- Myndavéla stöðu og tengingar, hnappaleggi myndavéla meðal. Losna ein klemma og þú breyttu athugunar dreifingu, ekki stefnuna.
- Glýing og hvítir jöfnuður, ef þinn mynda stöðu leyfir þér að festa þau. Sjálfvirkur glýing rekstri á milli lota er hægur, ósýnilegur lén breytun.
- Armi kalibreering og þjóðanna núll stöðu. Ef þú verður að endurjafna, meðhöndla allt þatað skrá fyrir það sem aðskilið gagnasafn.
- Verkefnatextinn. Sérhver VLA hér skilyrði á því; endurfjarðir það mitt-lota er annað verkefni.
- Birta, tafla yfirborð, tilvik sett. Nýtt hlut er nýr tilraun, ekki næsta lota.
- Skrá rammaflutningur. Samanburð á inngripastigum yfir tveir sýnatakir raster framleiðir munur sem koma frá rasteri.
Hsu o.fl. bera saman hönd-miðju skoðun gegn venjulegri þriðju-persónu skoðun og fundið augunum-í-hönd sjónarhorn stöðugt batnaðar þjálfun skilvirkni og út-frá-dreifingu alhæfing, þrátt fyrir að sjá minna af atburðarás. Á fimm-samband armi, greip tíðabil er venjulega hvað þín leiðréttingu eru lagfæra, og greip tíðabil er hvað hnappaleggi skoðun ber.
Lotan, enda til enda
- 1Keyra ályktar og skrá hana
Byrja keyrsluna gegn tímapunkti þú vilt bæta, þá byrja skráningu inn ályktar rót. Skrá þannig erfir það eigin keyrslunnar verkefni texti, sem er hvað stefnan var þjálfuð á, frekar en sjálfgefið fjarstyring merki. Án skráningu þú getur horft á bilun en ekki þjálfun á henni.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Taktu yfir þegar það fer úrskeiðis
Ýttu Taktu yfir og veldu aðfang ham: leiðtogi armi, lyklaborð eða sleða. Runninn stöðvar, þú leiðrétta, þú hendu aftur. Rammar skrá á meðan þú varst keyrandi eru merktir sem inngrip sjálfvirkt.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Flokka epísóðurnar
Ákveða fyrir hverja epísóðu: skrá sem leiðréttingu, halda sem mat, eða fleygja. A keyrsla stefnan lokið án aðstoðar er mat gögn.
- 4Samstilla leiðréttingar gagnasafnið
Leiðréttingu safna í staðbundnu gagnasafni á hverja stefnu og fara til ský geymsla í gegnum sjálfvirk samstilling. Ekkert er blandað í að þú settir ekki þar.
- 5Semja blandaðan gagnasafnið
Sameina upprunalegu gagnasafnið með leiðréttingu gagnasafnið, velja epísóður beint á hverja uppruna. Niðurstaðan er venjulegur gagnasafn frá þeim stað og áfram.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Haldu áfram þjálfun frá tímapunkti
Þjálfun blöndun frá fyrri tímapunkti frekar en grunnlíkanið. Taktu eft hverjum tímapunkti og hverjum blöndun; án þess að par lotan er ekki aftan.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Skref 2 í smbandi: tvær leiðir til að taka yfir
Með leiðtoga armi
Í leiðtogi-fylgja ham handfarið er handöfun á milli tveir armanna sem eru ekki í sömu stöðu. Stinga Taktu yfir stöðvar runninn og drifur leiðtogi á fylgja núverandi stöðu, svo ekkert hoppi þegar kraftur yfirfærslur. Ef þessi jöfnun dríf timeout, þú jafna leiðtoga með höndum og losa aðeins þegar tvær eru innan fimm gráðu. Frá þeim og á þú teleoperate venjulega og aðgerðir dálkur skrár hvað þú skipað.
Vera heiðarlegur um þessa leið: jöfnun dríf og kraftur handöfun eru the least prófuðu hluti lotan á raunverulegur vélræn. Prufa handöfun á hægum, skaðlaust stöðu áður en þú treyst það í keyrslu þú umhugsa um. Leiðtogi armi framleiðir smoothest leiðréttingu af þeim þremur hamum, og einnig hefur the most sem getur farið rangt vélræn.
Án leiðtoga armi: lyklaborð og sleða
Flestir manna lestur þetta eiga einn armi. Það er nóg. Veldu lyklaborð eða sleða aðfang á augnabliki þú ýta Taktu yfir, og handfarið er tafarlaus og handvirk - þar er engin annar armi til jafna, svo þar er engin jöfnun skref. Fylgja heldur stöðu hennar og bíða aðfang.
| Aðfang ham | Hvernig arminn hreyfast | Per-kall takmörkun löggilt af þjónninn | Læst þegar |
|---|---|---|---|
| Leiðtogi armi | Spegli drifur fylgja frá leiðtoga samband horn | Engin nudge eða set símtöl í þessa ham; spegli skrifar fylgja markmið samfellu | Aldrei læst, og the sjálfgefið ef engin aðfang ham er gefið - en það þarfnast annar armi; án leiðtogi id handfarið er hafnað |
| Lyklaborð | Hlutfallsmikil nudge per lykill ýta, senda til handfarið nudge endapunkti | Erfitt þota á 2 gráðu per samband, 4 gráðu fyrir greipinn | Hafnað með 409 ef handfarið var byrjað í leiðtogi ham |
| Sleða | Algert markmið stöðu, senda til handfarið sett endapunkti | At most 6 gráðu ferðir í átt markmiðið per kall; viðmót heldur sending um tíu sinnum á sekúndu | Hafnað með 409 ef handfarið var byrjað í leiðtogi ham |
Þotarnir eru löggilt þjónninn-hlið, ekki í viðmóti, vegna a rangtýpt delta á bús-servo armi er árekstur. Lyklaborð leiðréttingu koma út stepwise og aðeins grófur; sleða leiðréttingu eru smoother, vegna þjónninn fer í átt markmiðið meðan viðmót heldur streymi. Annað hvort vegur aðgerðir dálkur móta full skipað stöðu vektor og inngripas merking er eins og leiðtogi leið, svo lyklaborð leiðréttingu land í sama gagnasafni án snið munur.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Hvenær á að ýta hnappinn
Snemma frekar en seint. Leiðrétting sem byrjar eftir greip hefur lokað á engu kenni endurheimt frá bilun stefnan ætti ekki að hafa farið inn, og endurheimt gögn er þess virði langt minni en forðun gögn. Trufla á fyrri augnabliki þú ert fullviss um að plott er rangt, leiðréttu með erfiðu hlutanum, hendu aftur um leið og ríki er one the policy höndlað áður. ThriftyDAgger automates that decision by gating interventions on novelty and estimated risk under a fixed human budget, but on a single arm with a human already watching, the human gate is cheaper and better calibrated than anything you will tune.
Gerlegt með opinn-heimild stakk og a few scripts. What it costs is bookkeeping, and bookkeeping is where DAgger rounds die.
- Skrifðu rammir frá þín eigin ályktar script inn LeRobot gagnasafn, með verkefna strengur stefnan var þjálfuð á.
- Stöðva stefnu lykkja, skipta skipanir heimild, og merki sérhver rammi þú drifur sem inngripas. Án the flag, leiðréttingu líta út eins og venjulegur sýningar.
- Ákveða vísvitandi hvað gerist með umbreytingu rammir á milli the policy sleppur stjórn og þín first input.
- Geyma leiðréttingu í þeirra eigin gagnasafn per stefnu, og rekja epísóða indices með höndum svo the mix geta verið endurgert.
- Bentu the fínstilling inngangur punktur á the fyrri tímapunkti, og athuga á the log at it loaded those weights.
The sama sex steps exist sem buttons. Hvað er automates er hvað er easy at get rangt með höndum: the per-frame inngripas flag, the split á milli leiðréttingu og evaluations, og the record of which tímapunkti framleitt sem mix. Ekkert enters a composed gagnasafn that þú didu ekki select.
Það does not decide fyrir þig. Sem keyrsla counts as a leiðrétting, sem epísóður fara inn the mix, og hvenær the inngripas rate hefur stopað falling remain judgment calls. The svæðin eru documented undir þjálfun, the input modes undir fjarstýring.
Skref 3 í smbandi: triage decides the quality
Eftir the keyrsla þú hefur a skráningu með sum rammir marked as interventions. Þrír áfangastaðir exist, og the rangt einn quietly poisons the næsta lota.
- Skrá sem leiðrétting þegar the inngripas var a genuine fix: the stefnan var heading somewhere rangt og þín input showed the rétt eitthvað frá a ríki the stefnan itself framleidd.
- Geyma sem mat fyrir clean autonomous runs og fyrir runs þú took yfir út of caution. Mat epísóður eru hvernig þú mæla the næsta tímapunkti, og þeir verða never vera þjálfaðir á.
- Fleygja runs ruined af eitthvað unrelated - a dropped myndavéla rammi, a stöðvuðu servo, an hlut þú knocked yfir. A messy leiðrétting er worse than no leiðrétting.
Á milli the stefnan sleppur stjórn og þín first input, the arminn heldur still meðan the recorder heldur writing - a keyrsla of identical poses paired með slightly different myndir. Hér those handöfun rammir stay í the raw skráningu og út of the leiðréttingu gagnasafn. Ef þú build the lykkja sjálf, cut þeir vísvitandi: a stefnu þjálfuðu á þeim learns að pause where it ætti að act.
Skref 5 í smbandi: composing the mix
Samsetning tekur the upprunalegu gagnasafn plús the leiðréttingu gagnasafn og framleiðir a nýr, ordinary LeRobot gagnasafn that þjálfar eins og any other. The mikilvægt eign er at the epísóða selection er explicit per uppruna - ekkert er blandað inn sjálfvirkt. That sounds minor til the first tími a stefnu behaves strangely og þú hefur að endurgera hvað það var þjálfuðu á.
The opinn spurning er the ratio, og nobody hefur a tala at transfers. Hvað the bóklega does agree á er at leiðréttingu ætti að count fyrir more than their rammi share. Mandlekar o.fl. retrain iteratively á the gögn their inngripas kerfi collects, svo the stefnu learns að traverse the bottlenecks, og report at agents þjálfuðu that vegur outperform agents þjálfuðu á an ekvivalent fjöldi samples frá non-interventional demonstrators. Sirius goes further og re-weights þjálfun samples af approximated human trust, reporting an 8 percent gain í simulation og 27 percent á raunverulegur vélmændis í stefna success rate gegn the methods það compares með, á twice the convergence speed. None of the þjálfun entry points hér expose a sample-weighting knob, svo the gróf substitute er at keep every leiðrétting epísóðu while subsampling the upprunalegu demonstrations - og at write niður what þú did.

Skref 6 í smbandi: hvað continuing frá a tímapunkti truly means
Þjálfun the mix frá the grunnlíkanið works en throws away the fyrri lota og costs a full keyrslu. Continuing frá the fyrri tímapunkti er faster og usually better. Það er einnig more limited en the orðasamband suggests.
A weights-only tímapunkti contains the parameters og nothing annað. Loading það gefur the næsta keyrslu a better starting point en the grunnlíkanið, en optimizer moments, learning-rate schedule position og gögn order allir byrja frá zero. Búast við a loss spike á the byrjun of the continued keyrslu, do not les it som a failure, og do not call the lota a resume. Það er a warm start.
| Stefna | Stærð | GPU tier | Ályktar per aðgerðir skref | Gagnasafns snið | Epísóður áður en það er worth trying |
|---|---|---|---|---|---|
| GR00T N1.7 | um 3 B, roughly 40 M þjálfuðu við fínstilling | A100 80 GB eða H100 80 GB | um 152 ms | LeRobot v2.0 eða v2.1 | 50 |
| GR00T N1.5 | um 3 B | A100 80 GB eða H100 80 GB | um 165 ms | LeRobot v2.0 eða v2.1 | 50 |
| Pi0.5 | um 3 B á a PaliGemma backbone | A100 80 GB eða H100 80 GB | um 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | um 450 M | RTX 4090 eða any 24 GB card | um 245 ms | LeRobot v3.0 | 30 |
| ACT | um 80 M, þjálfað frá scratchi | RTX 4090 eða any 24 GB card | um 20 ms | LeRobot v3.0 | 50 |
Latency compounds innan a DAgger lykkja í a vegur það does ekki við a demo: at roughly 485 ms per aðgerðir skref þú take yfir vegna the arminn hesitated, ekki vegna það var rangt, og hesitation leiðréttingu eru ekki gagnlegur þjálfun gögn. Ef þú ert iterating á gögn frekar en chasing a final success rate, iterate á a fast líkan. Shukor o.fl. describe SmolVLA sem hannaðir at þjálfun á a single GPU og deploy á consumer GPUs eða CPUs, með a asynchronous ályktar stakk at decouples aðgerðir spá frá execution at allow higher control rates - the eign at keeps a takeover lykkja responsive.
Gagnasafns snið eru ekki interchangeable annað. GR00T tekur LeRobot v2.0 eða v2.1, og the Isaac-GR00T repository describes its aðfang sem a flavor of the LeRobot v2 snið með a added modality description file; the nýrri trainers hér expect v3.0. A mix composed í the rangt version fails við load tími frekar en framleiðslu a bad stefnu - the better failure ham, still a wasted queue slot. Hinn gagnasafns documentation lists sem snið each trainer tekur.
Lotan, með the bookkeeping already done
Takover með a leiðtogi armi, lyklaborð eða sleða; per-frame inngripas merking; filing runs sem leiðréttingu eða evaluations; composing a blandaðan gagnasafn með a explicit epísóða selection per uppruna; og continuing þjálfun frá a tímapunkti í stað the grunnlíkanið. Hvað stays þín decision er sem keyrsla counts sem a leiðrétting, hvað fer inn the mix, og hvenær the inngripas rate hefur stopað falling.
Sjá hvernig the DAgger lykkja er virkjaðFjórir leiðir at waste a lota
1. Þjálfun á the leiðréttingu einn
The most common failure og the most tempting shortcut. A leiðrétting-only gagnasafn er almost entirely the erfiðu middle of the verkefni, með approach og retreat missing; the stefnu gets better við the hard hluti og forgets hvernig at arrive þar. Samsetning er ekki an implementation detail of the method, það er the mechanism: the gömul gögn er hvað holds the rest of the hegðun í place meðan the leiðréttingu move one hluti of it.
2. Flutningur a myndavéla á milli lota
A myndavéla sem shifts tveir sentímetrar á milli lota framleiðir a stefnu worse en the einn þú byrjuðu með, og a diagnosis sem costs a dagur. Sérhver VLA hér skilyrði á myndir; samband ríki einn does ekki disambiguate where the hlut er. Photograph the setup fyrir the first lota og check sem photograph fyrir each seinna einn.
3. Þáttu handöfun artefacts inn þjálfun
Covered above, og á the list vegna það er ósýnilegur. The symptom er a stefnu sem stalls fyrir a brot of a sekúndu exactly where the fyrri lota's operator took yfir. Það lítur út eins og hesitation; það er imitation.
4. Kalla a warm start a resume
Ef þú believe optimizer ríki carried yfir, the initial loss spike lestur sem a bug og þú fer hunting fyrir corrupted gögn. Ef þú know the optimizer byrjuðu fresh, the spike er expected og þú look við hvað comes eftir it. Sama numbers, opposite conclusions.
Mæling lotan
The metric fyrir a mannkjör-gated lykkja er the inngripas rate: rammir skrá meðan þú varst í stjórn, divided eftir total rammir of the keyrslu. Það er í the takeover status, og það er the aðeins tala sem svarar the spurning the lota spurðu. Þjálfun loss falls hvort eða ekki the stefnu batnaðist; success rate er binary og noisy við the sample sizes a desk armi framleiðir. Inngripas rate er continuous, mæld á the ríki the stefnu itself caused, og það drops sem the stefnu needs þú less.
Bera það saman aðeins yfir runs skrá undir identical conditions. Hinn full rök, og hvernig at build an mat sett sem survives more en tveir lota, er í the article on mæling a DAgger lykkja. Lota one er realistically a feasibility test: þú ert checking sem the takeover works á þinn vélmændis, sem leiðréttingu land með their flags, og sem the continued keyrslu loaded the tímapunkti þú named. Lota tveir og þrír eru where the rate ætti að start moving. Ef það hefur ekki moved eftir lota fjórir, the vandamál er upstream of DAgger.
| Skrifðu niður per lota | Hvers vegna það matters seinna |
|---|---|
| Tímapunkti sem var driven | Án it þú getur ekki attribute an improvement at a mix |
| Aðfang ham used fyrir the takeover | Lyklaborð leiðréttingu eru coarser en leiðtogi leiðréttingu, og það shows í the gögn |
| Fjöldi of runs og hvernig each var triaged | Hvort the lota hafði enough leiðréttingu at matter |
| Inngripas rate per keyrslu, og the mean | The progress metric of the lykkja |
| Exact epísóða selection per uppruna | The aðeins vegur at reproduce eða undo a lota |
| Warm start eða fresh þjálfun | Explains the loss curve þú munt look við í a vika |
Ef þú do ekki have a tímapunkti yet
Lotan hefur engin entry punktur án one. Skrá a first gagnasafn, þjálfun a first stefnu, keyra það - skráningu, þjálfun og keyra the stefnu cover sem path. Hinn skráningu client er á the download page, GPU tiers og hourly rates á the pricing page, og hvað a usable epísóðu looks eins og í the SO-100 gagnasafns collection guide. Fá the sýningar rétt fyrir the leiðréttingu: DAgger er a repair mechanism, og það works langt better á eitthvað sem var nearly rétt already.
Get I keyra a DAgger lykkja án a leiðtogi armi?▾
já. Veldu lyklaborð eða sleða aðfang þegar þú ýta Taktu yfir: the takeover er tafarlaus og handvirk, með no annar armi at jafna. Lyklaborð sends hlutfallsmikil nudges sem the þjónninn clamps hard við 2 gráðu per samband og 4 fyrir the greipinn; sleða send an algert markmið og the þjónninn moves at most 6 gráðu í átt it per kall, meðan the viðmót heldur streaming. Aðgerðir dálkur og inngripas merking eru the sama sem í leiðtogi ham, svo the leiðréttingu eru indistinguishable í the gagnasafn.
Hvernig margar leiðréttingu does one lota need?▾
Þar er no defensible universal tala, og rammi count matters more en epísóðu count. Hinn working rule er sem the leiðréttingu verða ekki lost í the mix: með 200 upprunalegu epísóður og þrír leiðréttingu epísóður, ekkert mun move. Aim fyrir leiðréttingu sem dekka the failing hegðun frá several starting configurations frekar en þrír repetitions of the sama rescue.
Hvers vegna er þjálfun á aðeins leiðréttingu such a bad hugmynd?▾
Vegna leiðréttingu eru almost entirely the hard middle of the verkefni. Approach, jöfnun og retreat eru missing, svo the stefnu loses hvað það already gerðu well meðan batna við the hluti þú fixed. Geyma the gömul gögn og bæta at it er the mechanism itself, ekki a valkvæð extra.
Does continuing frá a tímapunkti resume the fyrri þjálfun keyrslu?▾
no. A weights-only tímapunkti restores parameters og nothing annað: optimizer moments, learning-rate schedule position og gögn order byrja fresh. Það er a warm start, og an initial loss spike er expected frekar en a symptom. Skrifðu niður sem of the tveir þú actually did, svo þú les the curve correctly a vika seinna.
Hvað ef the inngripas rate does ekki fall?▾
Stopp adding lota. A flat rate means the leiðréttingu eru ekki kenni hvað þú think. Hinn usual causes eru upstream: a myndavéla moved, the leiðréttingu byrja too seint at vera avoidance gögn, handöfun rammir eru í the þjálfun sett, eða the verkefni er underdetermined frá the observations the stefnu actually gets.
None of þetta er a solved problem og none of it er one click. Interactive hermingu nám er an active research svæði precisely vegna its spurningar - hvenær at intervene, hvernig at weight hvað the human did, hvernig mikið gömul gögn at keep - have no settled answers; the survey eftir Celemin o.fl. maps hvað er still open. Hvað the lykkja does have er measurable convergence þegar það er run carefully, á vélmændis sem costs a few handrad euros. Frost the setup, intervene early, triage honestly, mix deliberately, og record the inngripas rate every tími.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started