
Vaiheittainen kuvaus yhdestä ihmisen hallitsemasta DAgger-kierroksesta SO-100-kädessä: aja politiikka ja tallenna se, ota hallintoon kun jokin menee väärin, tallenna ajo korjaukseksi, koostu sekoitettu aineisto ja jatka koulutusta tarkistuspisteestä. Sisältää näppäimistö- ja liukunappien hallinnan ihmisille ilman johtaja-kättä sekä neljä virhettä, jotka tekevät kierroksesta hyödyttömän.
Politiikkasi toimii. Se tavoittelee kuutiota, sulkee pihdin senttimetrin liian aikaisin ja jatkaa ikään kuin sillä olisi se. Mitään ei virheelle, ja koulutushäviö ei selitä sitä. Korjaus ei ole vielä 20 000 gradienttivaihe samoilla demonstraatioilla. Se on laittaa kätesi takaisin käteen juuri silloin kun se menee väärin, tallentaa mitä teit sen sijaan ja kouluttaa seuraava tarkistuspiste vanhalla datalla sekä korjauksella. Se on DAgger-kierros, ja näin yksi ajaa SO-100:lla SO-100 vision-language-action -politiikalla.
Teoria on muualla: miksi aineiston yhdistäminen toimii ollenkaan ja mitä ihmisen hallinta muuttaa siinä. Tämä on käyttöohje, ja se olettaa koulutetun tarkistuspisteen, toimivan kamerajärjestelmän ja käden, joka liikkuu. Kuusi vaihetta alla ovat silmukka sellaisena kuin se on toteutettu tämän alustan DAgger-sivulla, mutta järjestys on sama omista skripteistäsi.
Yksi kierros lyhyesti
- •Aja koulutettu politiikka ja tallenna se, ajo teksti tehtävästä pikemmin kuin yleinen teleoperaation nimike.
- •Ota hallintoon hetkeä kun käyttäytyminen menee väärin: peilattava siirto johtaja-käden kanssa, välitön ja manuaalinen näppäimistön tai liukunappien kautta ilman sitä.
- •Luokittele jokainen ajo: tallenna se korjaukseksi, pidä se arviointi-jaksona, tai hylkää se.
- •Koostu sekoitus käsin - alkuperäiset demonstraatiot sekä korjaukset, jaksot valitut lähteittäin. Älä koskaan kouluta pelkillä korjauksilla.
- •Jatka koulutusta viimeisestä tarkistuspisteestä, ja merkitse mikä tarkistuspiste tuotti minkä sekoituksen.
- •Numero, joka kertoo oliko kierros hyödyllinen, on intervention rate, ei koulutushäviö.
Miksi toinen kierros ei ole vain enemmän dataa
Käyttäytymisen kloonaus kouluttaa tiloissa, joissa ihminen kävi. Testausaikaan politiikka vierailee tiloissa, joita se aiheuttaa, ja pienet toimintavirheet kasautuvat tiloihin, joita demonstraatio ei kattanut. Ross, Gordon ja Bagnell muodostivat vikauttamisen AISTATS 2011:lle ja vastasivat siihen iteratiivisella algoritmilla, joka kouluttaa kiinteää determinististä politiikkaa ja heidän reduktiossaan on toimittava hyvin tilan jakaumalla, jonka se aiheuttaa: aja nykyinen politiikka, laita asiantuntija merkitsemään tilat, joihin se todella saapui, lisää ne aineistoon, kouluuta uudelleen, toista. Kelly et al. tekivät kyselyn käytännölliseksi HG-DAgger:lla, jossa ihminen päättää milloin ottaa hallintoon sen sijaan, että merkitsisi tilat ilman hallintoa; he raportoivat parantuneesta suorituksesta sekä DAgger:iin että käyttäytymisen klonaukseen simuloidulla ja oikealla autonomisen ajon tehtävällä. Ihmisen hallinta on mitä tekee silmukan siedettäväksi pöydän kädessä - sinulla on kädessä vain kun jotain menee väärin.
Kaksi seurausta välit käytännössä kuin teoria. Korjaukset eivät ole tavallisia demonstraatioita: ne keskittyvät pullonkaula-alueille, joita Mandlekar et al. kuvaavat, joissa pieni poikkeama pudottaa politiikan tiloihin, joita demonstraatiot eivät koskaan kattoneet. Ja aineisto tehty pelkistä näistä vaikeista osista on huonosti muotoiltu aineisto - Belkhale, Cui ja Sadigh väittävät data-puolelta, että tilan monimuotoisuus ei ole aina hyödyllistä, ja että toiminnan eroavuus ja siirtymän monimuotoisuus yhdessä päättävät aineiston laadusta. Sekoitettu aineisto ei ole kompromissi, se on kohta.
Jäädytä nämä ennen kierrosta yksi
DAgger-kierros vertaa politiikkaa itseensä ajan mittaan. Mitä tahansa muutat kierrosten välillä, mikä ei ole aineisto, tekee vertailusta merkityksettömän.
- Kameran sijainnit ja kiinnitykset, rannekkeen kamera mukaan lukien. Löysää yksi kiinnike ja olet muuttanut havaintojen jakaumaa, ei politiikkaa.
- Paljastus ja valkoisen tasapainon, jos sieppauspinonsa avulla voit kiinnittää ne. Auto-paljastus muuttuva kierrosten välillä on hidas, näkymätön verkkotunnus muutos.
- Käden kalibrointi ja servo nolla-sijainnit. Jos sinun täytyy kalibroida uudelleen, käsittele kaikki tallennettu ennen sitä erillisenä aineistona.
- Tehtävä teksti. Jokainen VLA täällä ehdollistuu siihen; se sanoittaminen uudelleen silmukan keskellä on eri tehtävä.
- Valaistus, pöytä pinta, objekti joukko. Uusi objekti on uusi kokeilu, ei seuraava kierros.
- Tallennuskehys nopeus. Intervention rate:n vertaaminen kahden näytteenotto-ruudukot tuottaa eroja, jotka tulevat ruudukosta.
Hsu et al. vertasivat kädessä-keskeistä näkymää tavanomaiseen kolmannen henkilön näkymään ja löysivät silmäkkeen perspektiivin johdonmukaisesti parantavan koulutuksen tehokkuutta ja jakelun ulkopuolelle yleistymistä, huolimatta siitä, että näkee vähemmän kohtauksesta. Viidennessä nivelkädessä, pihdin ajoitus on yleensä mitä korjaukset korjaavat, ja pihdin ajoitus on mitä rannekkeen näkymä kuljettaa.
Kierros, päästä päähän
- 1Suorita päätelyt ja tallenna se
Aloita ajo tarkistuspisteestä, jonka haluat parantaa, sitten aloita tallentaminen päätelmen juureen. Tallennettu näin se perii oman tehtävä tekstin, mikä on mitä politiikka koulutettiin, pikemminkin kuin oletusarvoinen teleoperaatio merkki. Ilman tallentamista voit katsoa vikautta mutta et kouluttaa sitä.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Ota hallintoon kun se menee väärin
Paina Ota hallintoon ja valitse syöttö tapa: johtaja käsi, näppäimistö tai liukutaulut. Juoksija keskeyttää, sinä korjaat, luovutat takaisin. Kehykset tallennetut ajon aikana kun ajoit merkitään väliintuloksi automaattisesti.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Luokittele jaksot
Päätä jaksoittain: tallenna korjaukseksi, pidä arviointi, tai hylkää. Ajo, joka politiikka suoritti ilman apua, on arviointidata.
- 4Synkronoi korjausaineisto
Korjaukset keräävät paikalliseen aineistoon politiikan kohti ja menevät pilvi varastoon automaattisen synkronoinnin kautta. Mitään sekoitetaan, jota sinä et laittanut siihen.
- 5Koostu sekoitettu aineisto
Yhdistä alkuperäinen aineisto korjausaineiston kanssa, valiten jaksot selvästi lähteittäin. Tulos on tavallinen aineisto siitä eteenpäin.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Jatka koulutusta tarkistuspisteestä
Kouluta sekoitus edellisestä tarkistuspisteestä pikemminkin kuin perusmallista. Merkitse mikä tarkistuspiste ja mikä sekoitus; ilman sitä paria kierros ei ole toistettavissa.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Vaihe 2 yksityiskohtaisesti: kaksi tapaa ottaa hallintoon
Johtaja käden kanssa
In johtaja-seuraaja tila siirto on käsittely kahden käden välillä, jotka eivät ole samassa asennossa. Painamalla Ota hallintoon keskeyttää juoksijan ja ajaa johtajan seuraajan nykyiseen asentoon, joten mitään ei hyppää kun vääntömomentti siirtyy. Jos kyseinen tasaus ajaminen aikakatkaistuu, tasaat johtajan käsin ja vapauta vain kun kaksi ovat viidessä asteessa. Siitä eteenpäin teleoperoit normaalisti ja toiminto sarake tallentaa mitä ohjasit.
Ole rehellinen tästä polusta: tasaus ajaminen ja vääntömomentti siirto ovat vähiten testatut osa silmukasta oikealla laitteistolla. Testaa siirto hitaalla, vaarattomalla asennolla ennen kuin luotat siihen ajossa, joka sinulle on tärkeä. Johtaja käsi tuottaa sileiden korjausten kolmesta tilasta, ja myös eniten, joka voi mennä väärin mekaanisesti.
Ilman johtaja kättä: näppäimistö ja liukutaulut
Useimmat ihmiset lukevat tätä omistava yhden käden. Se on tarpeeksi. Valitse näppäimistö tai liukunappien syöttö hetkeä kun painat Ota hallintoon, ja siirto on välitön ja manuaalinen - ei ole toista kättä tasattavaksi, joten ei ole tasaus vaihetta. Seuraaja pitää asennon ja odottaa syöttöä.
| Syöttö tila | Miten käsi liikkuu | Kutsu kohden raja sovellettu palvelimella | Lukittu kun |
|---|---|---|---|
| Johtaja käsi | Peilailu ajaa seuraajan johtajan nivel kulmista | Ei liu'uta tai aseta soittoja tässä tilassa; peilailu kirjoittaa seuraajan tavoitteet jatkuvasti | Ei koskaan lukittu, ja oletus jos ei syöttö tila annettu - mutta se tarvitsee toisen käden; ilman johtaja tunnusta siirto kielletään |
| Näppäimistö | Suhteellinen liu'utus, kosketus lähetetään siirto liu'utu päätepiste | Kova kiinnike, 2 astetta kohti nivelistä, 4 astetta pihtille | Hylätty 409:llä jos siirto aloitettiin johtaja tilassa |
| Liukutaulut | Absoluuttinen kohde asento, lähetetty siirto asetus päätepiste | Enintään 6 astetta matkaa kohti tavoitetta kutsu kohti; käyttöliittymä lähettää noin kymmenen kertaa sekunnissa | Hylätty 409:llä jos siirto aloitettiin johtaja tilassa |
Kiinnikkeet sovelletaan palvelinpuolella, ei käyttöliittymässä, koska kirjoitusvirhe delta väylä servo käsi on törmäys. Näppäimistön korjaukset tulevat asteittain ja hieman karkeasti; liukunappien korjaukset ovat sileitä, koska palvelin kävelee tavoitetta kohti kun käyttöliittymä pitää virtausta. Joka tapauksessa toiminto sarake vastaanottaa täyden ohjatun asento vektorin ja väliintulo merkitseminen on sama johtaja polulla, joten näppäimistön korjaukset laskeutuvat samaan aineistoon ilman muoto eroa.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Milloin painaa nappia
Aikaisin pikemminkin kuin myöhään. Korjaus, joka alkaa jälkeen pihdin on sulkeutunut mitään, opettaa toipuminen viasta politiikka ei ollut pitäisi päästä, ja toipuminen tieto on arvoinen paljon vähemmän kuin välttäminen tieto. Keskeytä hetkellä kun olet varma liikerata on väärä, korjaa vaikean osan läpi, luovuta takaisin kun tila on sellainen politiikka käsitteli ennen. ThriftyDAgger automatisoi kyseisen päätöksen porttaamalla väliintulot uutuuteen ja arvioidun riskin kiinteällä ihmisen budjetilla, mutta yhdellä kädessä jo katselevalla ihmisellä, ihmisen portti on halvempi ja paremmin kalibroitu kuin mitään tunat.
Mahdollista avoimen lähteen pinonssa ja muutama komentosarja. Mitä se maksaa on kirjanpito, ja kirjanpito on missä DAgger kierrokset kuolevat.
- Kirjoita kehykset omasta päätelty skriptistä LeRobot aineistoon, tehtävä merkkijono politiikka koulutettiin.
- Keskeytä politiikka silmukka, vaihda käsky lähde, ja merkitse jokainen kehys ajaa väliintuloksi. Ilman merkintää, korjaukset näyttävät tavallista demonstraatioilta.
- Päätä tarkoituksella mitä tapahtuu siirtymä kehykset välillä politiikka vapautuu hallintoon ja ensimmäinen syöttösi.
- Pidä korjaukset omassa aineistossa politiikan kohti, ja seuraa jakso indeksit käsin niin sekoitus voidaan rekonstruoida.
- Osoita fine-tuning sisääntulon edellisen tarkistuspisteen, ja tarkista lokista se latasi nuo painot.
Sama kuusi vaihetta olemassa nappeina. Mitä on automatisoitu on mitä on helppo saada väärin käsin: per-kehys väliintulo merkki, jakso välillä korjaukset ja arvioinnit, ja tietue mikä tarkistuspiste tuotti mikä sekoitus. Mitään ei mene kootuun aineistoon, että et valinnut.
Se ei päätä sinulle. Mikä ajo lasketaan korjaukseksi, mitkä jaksot menevät sekoitukseen, ja milloin pysäyttää jäävät päätös kutsuille. Kentät ovat dokumentoitu alle koulutus, syöttö tilat alle teleoperaatio.
Vaihe 3 yksityiskohtaisesti: luokitus päättää laadusta
Ajon jälkeen sinulla on tallentaminen joista kehykset merkitään väliintuloksi. Kolme määränpäätä olemassa, ja väärä yksi hiljaa myrkyttää seuraava kierros.
- Tallenna korjaukseksi kun väliintulo oli aito korjaus: politiikka oli menossa väärään paikkaan ja syöttösi näytti oikean asian tilasta politiikka itse tuotti.
- Pidä arviointi puhdasta autonomista ajoja varten ja ajoille sinä ottanut hallintoon varovaisuuden vuoksi. Arviointi jaksot ovat miten mitataan seuraava tarkistuspiste, ja he täytyy ei koskaan kouluttaa.
- Hylkää ajon pilalla jotain liittymätöntä - pudotettu kamera kehys, jumittunut servo, objekti sinä vasaroit. Sotkuinen korjaus on huonompi kuin ei korjausta.
Välillä politiikka vapautuu hallintoon ja ensimmäinen syöttösi, käsi pidä silti kun tallentaja pitää kirjoitus - ajo identtinen asennon pareilla hieman erilaisia kuvia. Täällä nuo siirto kehykset pysyä raakaahan tallentamiseen ja pois korjaus aineistosta. Jos rakennat silmukan itse, leikkaa ne tarkoituksella: politiikka koulutettu niihin oppii keskeyttää missä se pitäisi toimia.
Vaihe 5 yksityiskohtaisesti: sekoituksen koostamainen
Koostamainen ottaa alkuperäinen aineisto ja korjaus aineisto ja tuottaa uuden, tavallisen LeRobot aineisto joka kouluttaa niin muut. Tärkeä ominaisuus on, että jakso valinta on selvästi lähteittäin - mitään ei sekoitettu automaattisesti. Se kuulostaa pieneltä kunnes ensimmäinen kerta politiikka käyttäytyy omituaisesti ja täytyy rekonstruoida mikä se koulutettiin.
Avoin kysymys on suhde, ja kukaan ei ole numero, joka siirtää. Mitä kirjallisuus on yksimielinen on, että korjaukset pitäisi laskea enemmän kuin niiden kehys jakaa. Mandlekar et al. kouluttaa uudelleen iteratiivisesti dataa niiden väliintulo järjestelmä kerää, joten politiikka oppii kulkea pullonkaulan, ja raportti, että agentit koulutettu näin ylittyä agentit koulutettu vastaava määrä näytteitä ei-väliintulo demonstraattoreilta. Sirius menee edelleen ja painaa uudelleen koulutus näytteitä arvioidulla ihmisen luottamus, raportointi 8 prosentti saada simulaatioissa ja 27 prosentti oikeassa laitteistossa politiikka menestys nopeus vertaan menetelmät se vertaa kanssa, klo kaksinkertainen konvergenssi nopeus. Ei yhtään koulutus sisääntulon täällä altis näyte-painoitus säätö, niin karkea korvike on pidä jokainen korjaus jakso kun aliotos alkuperäinen osoitukset - ja kirjoittaa alas mitä sinä tekemään.

Vaihe 6 yksityiskohtaisesti: mikä jatkaa tarkistuspisteestä todella tarkoittaa
Koulutus sekoitus perusmallista toimii mutta heittää pois edellinen kierros ja maksaa täyden ajon. Jatka edellisestä tarkistuspiste on nopeampi ja yleensä parempi. Se on myös enemmän rajoitettu kuin ilmaus ehdottaa.
Painon-vain tarkistuspiste sisältää parametrit ja mitään muuta. Lataamalla se antaa seuraava ajo parempi aloitus piste kuin perusmalli, mutta optimoija hetket, oppimis-nopeus jaddi asema ja tieto järjestys kaikki alkaa nollasta. Odota tappio spike alussa jatka ajo, älä lue se kuin vikautta, ja älä kutsua kierros resume. Se on lämmin alkuun.
| Politiikka | Koko | GPU taso | Päätelyt per toiminta askel | Aineisto muoto | Jaksot ennen se on arvoinen yrittää |
|---|---|---|---|---|---|
| GR00T N1.7 | noin 3 B, noin 40 M koulutettu aikana fine-tuning | A100 80 GB tai H100 80 GB | noin 152 ms | LeRobot v2.0 tai v2.1 | 50 |
| GR00T N1.5 | noin 3 B | A100 80 GB tai H100 80 GB | noin 165 ms | LeRobot v2.0 tai v2.1 | 50 |
| Pi0.5 | noin 3 B PaliGemma selkärankana | A100 80 GB tai H100 80 GB | noin 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | noin 450 M | RTX 4090 tai mikä tahansa 24 GB kortti | noin 245 ms | LeRobot v3.0 | 30 |
| ACT | noin 80 M, koulutettu alusta | RTX 4090 tai mikä tahansa 24 GB kortti | noin 20 ms | LeRobot v3.0 | 50 |
Latenssi kasautuu DAgger silmukan sisällä tavalla, että se ei ajon aikana: noin 485 ms per toiminta askel sinä otat hallintoon koska käsi epäröi, ei koska se oli väärä, ja epäröinti korjaukset eivät ole hyödyllisiä koulutus tieto. Jos olet toistamalla tieto pikemminkin jäljittävät lopullinen menestys nopeus, toista nopealla mallilla. Shukor et al. kuvaava SmolVLA niin suunniteltu kouluttaa yhden GPU ja levitä kuluttaja GPUit tai CPUit, asynkroninen päätelyt pino, joka irrottaa toiminta ennuste suoritus sallia korkeampi hallinta nopeudet - ominaisuus joka pitää siirto silmukan vastuullinen.
Aineisto muodot eivät ole vaihdettavissa joko. GR00T ottaa LeRobot v2.0 tai v2.1, ja Isaac-GR00T arkisto kuvailla sen syöttö niin makua LeRobot v2 muoto joissa lisätty modaalisuus kuvaus tiedosto; uudempi harjoittajat tässä odottaa v3.0. Sekoitus koottu väärä versio epäonnistuu kuormitaa aika pikemminkin kuin tuottaa huono politiikka - parempi vikautta tila, silti hukkaan jonon paikka. aineisto dokumentaatio luetteloi mikä muoto jokainen harjoittaja ottaa.
Silmukka, kirjanpito jo tehty
Siirto johtaja käsi, näppäimistö tai liukutaulut; per-kehys väliintulo merkitseminen; tallentaminen ajon korjauksiksi tai arvioinnit; koostamainen sekoitettu aineisto selvästi jakso valinta lähde kohti; ja jatkaa koulutusta tarkistuspisteestä pikemminkin kuin perusmalli. Mitä pysyy kanta päätös on mikä ajo laskee korjaukseksi, mitä menee sekoitukseen, ja kun intervention rate on pysähtynyt pudota.
Katso miten DAgger silmukka on johdettuNeljä tapaa tuhlata kierros
1. Koulutus korjauksilla ainoastaan
Yleisin vikautta ja yleisin houkutteleva pika-ovi. Korjaus-vain aineisto on lähes kokonaan vaikea keskellä tehtävää, joissa lähestyminen ja vetäytyminen puuttuu; politiikka saa parempi vaikea osa ja unohtaa miten saapua siellä. Yhdistäminen ei ole toteutus yksityiskohta menetelmä, se on mekanismi: vanha tieto on mitä pitää loput käyttäytyminen paikalla kun korjaukset siirtää yksi osa se.
2. Kameran siirtäminen kierrosten välillä
Kamera, joka siirtää kaksi senttimetriä kierrosten välillä tuottaa politiikka huonompi kuin se, jotka sinä aloitit, ja diagnoosi, joka maksaa päivä. Jokainen VLA täällä ehdollistuu kuviin; nivel tieto yksin ei selvennä missä objekti on. Valokuvaa asetus ennen ensimmäinen kierros ja tarkistaa kyseisen valokuvan ennen jokainen myöhemmin.
3. Siirto artefaktit pääseminen koulutukseen
Kattaa edellä, ja listalla koska se on näkymätön. Oire on politiikka, joka pysähtyy hetken tarkasti missä edellinen kierros operaattori ottanut hallintoon. Se näyttää epäröinti; se on jäljittelyä.
4. Kutsua lämmin alkuun resume
Jos luot optimoija tieto kantaa yli, alku tappio spike lukee ohjelma ja sinä mene metsästys vioittunut tieto. Jos tiedät optimoija aloitit tuore, spike on odotettavissa ja sinä näyttävät mitä tulee jälkeen se. Sama numerot, vastakkain johtopäätökset.
Mittaaminen kierros
Metriikka ihmisen hallittu silmukka on intervention rate: kehykset tallennettu kun olit hallintoon, jaettuna kokonaisuudessaan kehykset ajon. Se on siirto asema, ja se on vain numero, joka vastaa kysymys kierros kysyi. Koulutus tappio putoaa riippumatta siitä politiikka parantunut; menestys nopeus on binäärinen ja meluisa klo näyte koot pöydän käsi tuottaa. Intervention rate on jatkuva, mitattu välillä politiikka itse aiheutetut, ja se putoaa kun politiikka tarvitsee sinua vähemmän.
Vertaa se vain ajon tallennettu alle tunnistettavissa olosuhteet. Täysi argumentti, ja miten rakentaa arviointi aseta, joka selviää enemmän kuin kaksi kierros, on in artikkeli mittaamisen DAgger silmukka. Kierros yksi on realistinen totettavaksi testi: sinä tarkistat siirto toimii laitteistollasi, että korjaukset laskeutua niiden liput, ja jatka ajo ladattu tarkistuspiste sinä nimetty. Kierros kaksi ja kolme on missä nopeus pitäisi alkaa liikkua. Jos se ei ole liikkunut kierros neljään, ongelma on ylävirta DAgger.
| Kirjoita alas kierros kohti | Miksi se on tärkeä myöhemmin |
|---|---|
| Tarkistuspiste joka oli ajettu | Ilman se sinä ei voi osoittaa parannus sekoitukseen |
| Syöttö tila käytetty siirto | Näppäimistö korjaukset ovat karkeampi kuin johtaja korjaukset, ja se näyttää tieto |
| Määrä ajon ja miten jokainen oli luokiteltu | Onko kierros oli tarpeeksi korjaukset varmistettu |
| Intervention rate per ajo, ja tarkoittaa | Edistymisen metriikka silmukka |
| Tarkka jakso valinta lähde kohti | Ainoastaan tapa toistaa tai kumota kierros |
| Lämmin alkuun tai tuore koulutus | Selittää tappio käyrä sinä olet katselemassa viikko |
Jos sinä ei ole tarkistuspiste vielä
Silmukan on ei sisääntulon ilman yksi. Tallenna ensimmäinen aineisto, kouluta ensimmäinen politiikka, suorita se - tallentaminen, koulutus ja suorita politiikka kattaa polku. Tallentaminen asiakas on lataus sivulla, GPU tasot ja tunti nopeudet hinnoittelu sivulla, ja mitä käyttökelpoinen jakso näyttää SO-100 tieto kokoelu opas. Hanki osoitukset oikea ennen korjaukset: DAgger on korjaus mekanismi, ja se toimii paljon paremmin jotain, joka oli melkein oikea jo.
Voinko suorita DAgger silmukka ilman johtaja käsi?▾
Kyllä. Valitse näppäimistö tai liukunappien syöttö kun sinä painat Ota hallintoon: siirto on välitön ja manuaalinen, ilman toista kättä tasata. Näppäimistö lähettää suhteellinen nudged, että palvelin kiinnike kova, 2 astetta jokainen nivel ja 4 pihdin; liukutaulot lähettää absoluuttinen tavoite ja palvelin liikkuu enintään 6 astetta tavoite kohti kutsu kohti, kun käyttöliittymä pitää virtausta. Toiminta sarake ja väliintulo merkitseminen ovat sama johtaja tila, niin korjaukset ovat erottamaton aineistossa.
Kuinka monta korjausta yksi kierros tarvitsee?▾
Ei ole puolustettava universaali numero, ja kehys laskea varmistettu enemmän kuin jakso laskea. Työ sääntö on, että korjaukset täytyy ei ole menetetty sekoituksessa: kanssa 200 alkuperäinen jakso ja kolme korjaus jakso, mitään ei siirtää. Tavoite korjauksiksi, joka kattaa epäonnistuu käyttäytyminen mistä usea aloitus konfiguraatiot pikemminkin kuin kolme toisto sama pelastus.
Miksi koulutus korjauksilla ainoastaan sellainen huono idea?▾
Koska korjaukset ovat melkein kokonaan vaikea keskellä tehtävää. Lähestyminen, tasaus ja vetäytyminen puuttuu, niin politiikka menettää mitä se jo tekemään hyvin kun parannus osa sinä kiinnitä. Pitäminen vanhaa tieto ja lisääminen se on mekanismi itse, ei valinnainen ylimääräinen.
Tekee jatkaa tarkistuspisteestä resume edellinen koulutus ajo?▾
Ei. Painon-vain tarkistuspiste palauttaa parametrit ja mitään muuta: optimoija hetket, oppimis-nopeus jaddi asema ja tieto järjestys aloittaa tuore. Se on lämmin alkuun, ja alku tappio spike on odotettavissa pikemminkin kuin oire. Kirjoita alas mikä kaksi sinä todella tekemään, niin sinä lukea käyrä oikein viikko myöhemmin.
Mitä jos intervention rate ei putoaa?▾
Lopeta lisääminen kierros. Tasainen nopeus tarkoittaa korjaukset ei ole opettaa mitä sinä ajattele. Tavallinen syyt ovat ylävirta: kamera liikkuneet, korjaukset alkaa liian myöhään olla välttäminen tieto, siirto kehykset ovat koulutus aseta, tai tehtävä on alitäytetty mistä havainnot politiikka todella saa.
Ei mitään tämä on ratkennut ongelma ja ei mitään se on yksi klikkaus. Interaktiivinen jäljittelyoppiminen on aktiivinen tutkimus alue juuri koska sen kysymykset - kun väliintua, miten painaa mitä ihminen tekemään, kuinka paljon vanha tieto pidä - ei ole ratkeneet vastaukset; tutkimukseen Celemin et al. kartat mitä on silti avoin. Mitä silmukka tekee on arvoinen konvergenssi kun se on suorita huolellisesti, laitteistolla, että maksaa muutama sata euroa. Jäädytä asetukset, väliintua aikaisin, luokita rehellisesti, sekoita tarkoituksella, ja tallenna intervention rate jokainen aika.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started