Jeftin robotski arm SO-100 na stolu, postavljen za teleoperaciju i obuku politike
DAggerSO-100Učenje imitacijomVLATeleoperacija

Pokretanje DAgger petlje na SO-100 sa VLA politikom

AY-Robots ResearchAugust 27, 2026Čitanje od 15 minuta

Detaljno pregled jedne DAgger runde sa ljudskim vremenima na SO-100 armu: pokrenite politiku i zabeležite je, preuzite je kada krene po zlu, zabeležite izvršavanje kao korekciju, sastavite mešoviti skup podataka i nastavite obuku od kontrolne tačke. Uključuje putanju preuzimanja preko tastature i klizača za ljude bez lidera, i četiri greške koje čine rundu beskorisnom.

Vaša politika se pokreće. Stiže do kocke, zatvara hvatač centimetar pre nego što treba i nastavlja kao da jeste. Ništa se ne greši, i bez obzira koliko gledate u gubitak obuke, to se ne objašnjava. Rešenje nije još 20 000 koraka gradijenta na istim demonstracijama. To je da stavite ruku nazad na arm tačno tamo gde krene po zlu, zabeležite šta ste umesto toga uradili i obučite sledeću kontrolnu tačku na starim podacima plus tu korekciju. To je DAgger runda, i evo kako se pokretanju jednu sa SO-100 sa politikom viđenja-jezika-akcije.

Teorija je negde drugde: zašto agregacija skupa podataka uopšte radi i šta ljudsko vremenovanje menja kod toga. Ovo je priručnik za rad, i pretpostavlja treniranu kontrolnu tačku, radni skup kamera i arm koji se pokreće. Šest koraka ispod su petlja kako je implementirana na DAgger stranica ove platforme, ali niz je isti od vaših sopstvenih skripti.

Jedna runda kratko

  • Pokrenite treniranu politiku i zabeležite je, sa tekstom zadatka izvršavanja umesto generičke etikete teleoperacije.
  • Preuzite u trenutku kada se ponašanje krene po zlu: zrcalna prerada sa vodstvom-pratenjem armom, bezposredna i ručna preko tastature ili klizača bez njega.
  • Triaža svaki izvršavanja: zabeležite kao korekciju, zadržite kao епизоду evaluacije ili je odbacite.
  • Sastavite mešavinu ručno - originalne demonstracije plus korekcije, епизоде odabrane po izvoru. Nikada ne obučavajte samo korekcije.
  • Nastavite obuku od poslednje kontrolne tačke i zabeležite koja kontrolna tačka je proizvela koju mešavinu.
  • Broj koji kaže da li je runda bila od vrednosti je stopa intervencije, ne gubitak obuke.

Zašto druga runda nije samo više podataka

Kloniranje ponašanja se obučava na stanjima koja je čovek posetio. U vremenu testiranja politika poseća stanja koja uzrokuje, i male greške u akciji se akumuliraju u stanja koja ni jedna demonstracija nije pokrivala. Ross, Gordon i Bagnell su formalizovali taj propust za AISTATS 2011 i odgovorili ga sa iterativnim algoritmom koji trenira stacionarnu determinističku politiku i, pod njihovom redukcijom, mora da radi dobro pod distribucijom stanja koju induktuje: pokrenite trenutnu politiku, neka stručnjak označi stanja koja je zaista dostigla, dodajte je skupu podataka, prepodučite, ponovite. Kelly i dr. su učinili upit praktičnim sa HG-DAgger-om, gde čovek odluči kada preuzme kontrolu umesto da označava stanja bez držanja kontrola; izveštavaju o poboljšanim performansama nasuprot i DAgger-u i ponašanju kloniranja na simuliranom i stvarnom zadatku autonomne vožnje. Ljudsko vremenovanje je ono što čini petlju podnošljivom na armu na stolu - premještate ruke samo kada nešto krene po zlu.

Dve posledice su važnije u praksi nego što je teorija. Korekcije nisu obične demonstracije: koncentrišu se na uska mesta koja Mandlekar i dr. opisuju, gde mala devijacija baca politiku u stanja koja demonstracije nikada nisu pokrivale. I skup podataka napravljen samo od tih teških delova je loše oblikovan skup podataka - Belkhale, Cui i Sadigh argumentuju sa strane podataka da raznovrsnost stanja nije uvek korisna, i da divergencija akcije i raznovrsnost prelaza zajedno odlučuju kvalitet skupa podataka. Mešoviti skup podataka nije kompromis, to je cilj.

Zamrznite ovo pre nego što je runda jedan

DAgger runda upoređuje politiku sa sobom tokom vremena. Bilo šta što promenite između rundi što nije skup podataka čini tu poređenja besmislenim.

  • Pozicije kamera i montaže, uključujući kameru na zglobu. Otvorite jednu stezaljku i promenili ste distribuciju posmatranja, ne politiku.
  • Ekspozicija i ravnoteža belina, ako vaš stek za snimanje vam dozvoli da ih fiksno postavite. Auto-ekspozicija koja se kreće između rundi je spora, nevidljiva promena domene.
  • Kalibracija arma i nulte pozicije servosa. Ako morate da rekalibrujete, tretirajte sve što je snimljeno pre toga kao odvojen skup podataka.
  • Tekst zadatka. Svaki VLA ovde je uslovna na njega; prepravljanje ga mid-petljom je drugi zadatak.
  • Osvetljenje, površina stola, skup objekata. Novi objekat je novi eksperiment, ne sledeća runda.
  • Stopa kadrova za snimanje. Poređenje stopa intervencije preko dva rastera uzorkovanja proizvodi razlike koje dolaze iz rastera.
Kamera na zglobu nije opcionalna namena

Hsu i dr. su poredili pogled usredsređen na ruku naspram uobičajenog prikaza treće osobe i otkrili da je perspektiva oko-u-ruci konzistentno poboljšala efikasnost obuke i generalizaciju van distribucije, uprkos tome što vide manje scene. Na armu sa pet zglobova, vreme hvatanja je obično ono što vaše korekcije popravlja, i vreme hvatanja je ono što vid zglobu nosi.

Runda, kraj do kraja

  1. 1
    Pokrenite zaključivanje i zabeležite ga

    Pokrenite izvršavanja naspram kontrolne tačke koju želite da poboljšate, zatim počnite snimanje u korijen zaključivanja. Snimljeno na taj način nasleđuje tekst zadatka sopstvenog izvršavanja, što je ono na šta je politika bila obučavana, umesto zadane etikete teleoperacije. Bez snimanja možete gledati kvar ali ne možete ga obučavati.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Preuzite kada krene po zlu

    Pritisnite Preuzmi i odaberite modus unosa: arm sa vodstvom, tastatura ili klizači. Izvršavanje se pauzira, vi ispravite, vi se vratite. Okviri snimljeni dok ste vozili se automatski označavaju kao intervencije.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Triaža епизоде

    Odlučite po епизоди: zabeležite kao korekciju, zadržite kao evaluaciju, ili je odbacite. Izvršavanje koju je politika završila bez pomoći su podaci evaluacije.

  4. 4
    Sinhronizuj skup podataka korekcija

    Korekcije se sakupljaju u lokalnom skupu podataka po politici i idu u skladištem oblaka kroz automatsku sinhronizaciju. Ništa se ne meša što niste stavili.

  5. 5
    Sastavite mešoviti skup podataka

    Kombinujte originalni skup podataka sa skupom podataka korekcija, eksplicitno birajući епизоде po izvoru. Rezultat je obični skup podataka od te tačke dalje.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Nastavite obuku od kontrolne tačke

    Obučavajte mešavinu od prethodne kontrolne tačke umesto osnovnog modela. Zabeležite koja kontrolna tačka i koja mešavina; bez tog para runda nije reproducibilna.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Korak 2 detaljno: dva načina za preuzimanje

Sa armom sa vodstvom

U modu sa vodstvom-praćenjem preuzimanje je prerada između dva arma koja nisu u istoj poziciji. Pritiskom na Preuzmi pauzira se izvršavanje i vodi vodia na poziciju pratilaca, pa se ništa ne skače kada se moment transfera. Ako ovo usklađivanje vožnje istekne, usklađite vodia rukom i otpustite samo kada su dva unutar pet stepeni. Od tada vožite teleoperaciju normalno i kolona akcije beleži ono što ste naređivali.

Budite iskreni o ovoj putanji: vožnja usklađivanja i prerada momenta su najmanje testiran deo petlje na stvarnom hardveru. Testirajte predaju na sporom, neškodnom stanju pre nego što se oslonite na njega u izvršavanju do kojeg vam je stalo. Arm sa vodstvom proizvodi najglatke korekcije od tri moda, i ima i najveće što može da krene po zlu mehanički.

Bez arma sa vodstvom: tastatura i klizači

Većina ljudi koji ovo čitaju poseduje jedan arm. To je dovoljno. Odaberite unos preko tastature ili klizača u trenutku kada pritisnete Preuzmi, i preuzimanje je bezposredno i ručno - nema drugog arma za usklađivanje, pa nema koraka usklađivanja. Pratilac drži poziciju i čeka unos.

Modus unosaKako se arm pokrećeOgraničenje po pozivu koje nameće serverZaključano kada
Arm sa vodstvomOgledalo vozi pratilac sa uglova zglobova vođeNema gurnanja ili postavljanja poziva u ovom modu; ogledalo piše ciljeve pratioca neprekidnoNikada zaključano, i zadano ako ni jedan modus unosa nije dat - ali zahteva drugi arm; bez liderskog identifikatora preuzimanje je odbijeno
TastaturaRelativni gurnaj po pritisku na taster, poslat krajnjoj tački gurnanja preuzimanjaTvrda stezaljka na 2 stepena po zglobu, 4 stepena za hvatačOdbijena sa 409 ako je preuzimanje započeto u modu sa vodstvom
KlizačiApsolutna ciljna pozicija, poslata krajnjoj tački postavljanja preuzimanjaNajviše 6 stepeni putovanja prema cilju po pozivu; interfejs nastavlja slanje oko deset puta u sekundiOdbijena sa 409 ako je preuzimanje započeto u modu sa vodstvom

Stezaljke se nameću server-stranu, ne u interfejsu, jer pogrešno kucan delta na armu sa magistralnim servom je sudara. Korekcije preko tastature dolaze postepeno i blago grubo; korekcije klizača su glatke jer server kreće prema cilju dok interfejs nastavlja strujanje. Bilo kako kolona akcije prima kompletnu naredbenu vektor pozicije i označavanje intervencije je identično putanju lidera, pa korekcije preko tastature pristaju u isti skup podataka bez razlike formata.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Isti raspored tastera kao svuda drugde u stacku, pa mišična memorija snimanja prenosi.
Vodiča za obuku koja prikazuje uređene korake GR00T fino podešavanja izvršavanja na SO-100 skupu podataka
Strana obuke runde je isti vođeni niz kao prvo izvršavanje; samo polje kontrolne tačke se razlikuje.

Kada pritisnuti dugme

Ranije nego kasnije. Korekcija koja počinje nakon što je hvatač zatvoren na ništa uči oporavak od greške koju politika nije trebala da uđe, i podaci oporavka vrede daleko manje od podataka izbegavanja. Prekini u prvom trenutku kada si siguran da je putanja pogrešna, ispravi kroz teški deo, vrati se čim je stanje ono što je politika obradila pre. ThriftyDAgger automatizuje tu odluku stotinama intervencije na novosti i procenjenom riziku pod fiksnim ljudskim budžetom, ali na jednarm sa čovekom već gledam, ljudska kapija je jeftinija i bolje kalibrirana od svega što ćeš podešavati.

Izvodljiv sa open-source stackom i nekoliko skripti. Što to košta je vođenje evidencije, i evidencija je gde DAgger runde gube.

  1. Napišite okvire iz vlastitog skripte zaključivanja u LeRobot skup podataka, sa stringom zadatka na kojem je politika obučavana.
  2. Pauziraite petlju politike, prebacite izvor naredbe i označite svaki okvir koji vozite kao intervenciju. Bez zastave, korekcije izgledaju kao obične demonstracije.
  3. Odlučite namerno šta se dešava sa prelaznim okvirima između politike koja otpušta kontrolu i vaš prvi unos.
  4. Zadržite korekcije u svom skupu podataka po politici i pratite indekse епизоди ručno da bi se mešavina mogla rekonstruisati.
  5. Usmerite ulaznu tačku fino podešavanja na prethodnu kontrolnu tačku i proverite u dnevniku da je učitala te težine.

Korak 3 detaljno: trijaža odlučuje kvalitet

Nakon izvršavanja imate snimak sa nekim okvirima označenim kao intervencije. Tri odredišta postoje i pogrešno tiho otrovava sledeću rundu.

  • Zabeležite kao korekciju kada je intervencija bila prava ispravka: politika je išla negde pogrešno i vaš unos je pokazao pravu stvar iz stanja koju je sama politika proizvela.
  • Zadržite kao evaluaciju za čista autonomna izvršavanja i za izvršavanja koja ste preuzeli iz opreznosti. Епизоде evaluacije su kako merite sledeću kontrolnu tačku, i oni nikada ne smeju biti obučeni.
  • Odbacite izvršavanja pokvarena nečim nepovezanim - ispušteni okvir kamere, zaglavljeni servo, objekat koji ste srušili. Neuredna korekcija je gore nego nikakva korekcija.
Zamrzne okvire pripadaju sirovom snimanju, ne u podacima obuke

Između politike koja otpušta kontrolu i vaš prvi unos, arm stoji mirno dok snimač nastavlja pisanje - niz identičnih pozicija uparenih sa blago različitim slikama. Ovde ti okviri prenosti ostaju u sirovom snimanju i van skupa podataka korekcija. Ako gradite petlju sami, secite ih namerno: politika obučavana na njima uči da pauziraj gde bi trebalo da deluje.

Korak 5 detaljno: sastavljanje mešavine

Kompozicija uzima originalni skup podataka plus skup podataka korekcija i proizvodi novi, obični LeRobot skup podataka koji obučava kao bilo koji drugi. Važno svojstvo je da je izbor епизоди eksplicitan po izvoru - ništa se ne meša automatski. To zvuči mali dok prvi put politika se ponaša čudno i moraš rekonstruisati šta je obučavana.

Otvoreno pitanje je odnos i nikome nema broja koji se prenosi. Ono sa čime se literatura slaže je da korekcije trebaju računati više od njihovog dela okvira. Mandlekar i dr. prepodučavaju iterativno na podacima koje njihov sistem intervencije skupi, tako da politika uči da prođe kroz uska mesta, i izveštavaju da agenti obučeni na taj način nadmašuju agente obučene na ekvivalentnom broju uzoraka od demonstratora bez intervencija. Sirius ide dalje i ponovno teži uzorke obuke aproksimiranom ljudskom poverenjem, izveštavajući o 8 procentnom dobitku u simulaciji i 27 procenata na stvarnom hardveru u stopi uspeha politike naspram metoda sa kojima se poređa, sa dvostrukom brzinom konvergencije. Nijedna od ulaznih tačaka obuke ovde ne izlaže gumbu za ponovno težnjenje uzorka, pa je grub zamena da se svaka епизода korekcije zadrži dok se originalne demonstracije poduzorkuju - i da napišete šta ste radili.

Prikaz snimanja skupa podataka koji prikazuje епизоде SO-100 skupa podataka sa tokovima kamera
Епизоде korekcije su obične епизоде sa zastavom intervencije po okviru, tako da se komponuju sa originalnim skupom podataka bez konverzije.

Korak 6 detaljno: šta nastavak od kontrolne tačke stvarno znači

Obuka mešavine od osnovnog modela radi ali baca prethodnu rundu i košta kompletan izvršavanje. Nastavak od prethodne kontrolna tačka je brže i obično bolje. Takođe je ograničenije nego što fraza sugeriše.

Inicijalizacija težine nije nastavak optimizatora

Kontrolna tačka samo sa težinama sadrži parametre i ništa drugo. Učitavanje ga daje sledećem izvršavanju boljoj početnoj tački nego osnovnom modelu, ali momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka sve počinju od nule. Očekujte gubitak vrh na početku nastavljenog izvršavanja, nemojte ga čitati kao neuspeh, i nemojte se pozivati na rundu kao preuzimanje. To je topla početak.

PolitikaVeličinaGPU nivoZaključivanje po koraku akcijeFormat skupa podatakaЕпизоде pre nego što je vredna pokušaja
GR00T N1.7oko 3 B, grubo 40 M obučavana tokom fino podešavanjaA100 80 GB ili H100 80 GBoko 152 msLeRobot v2.0 ili v2.150
GR00T N1.5oko 3 BA100 80 GB ili H100 80 GBoko 165 msLeRobot v2.0 ili v2.150
Pi0.5oko 3 B na PaliGemma hrbetuA100 80 GB ili H100 80 GBoko 485 msLeRobot v3.050
SmolVLAoko 450 MRTX 4090 ili bilo koja 24 GB karticaoko 245 msLeRobot v3.030
ACToko 80 M, obučavana od početkaRTX 4090 ili bilo koja 24 GB karticaoko 20 msLeRobot v3.050

Kašnjenje se sabira unutar DAgger petlje na način na koji se ne dešava tokom demonstracije: sa grubo 485 ms po koraku akcije preuzimaš jer je arm kolebao, ne jer je pogrešan, i podaci oporavka od kolebanja nisu korisni podaci obuke. Ako ponavljaš na podacima umesto da juriš finalnu stopu uspeha, ponovi na brzom modelu. Shukor i dr. opisuju SmolVLA kao dizajniran da se obučava na jednom GPU i da se primeni na konzumentskim GPU-ima ili CPU-ima, sa asinkronim stackom zaključivanja koji odvaja predviđanje akcije od izvršavanja da dozvoli veće stope kontrole - svojstvo koje čini petlju preuzimanja reagovnom.

Formate skupa podataka nisu međuzamenljivi. GR00T uzima LeRobot v2.0 ili v2.1, i Isaac-GR00T skladište opisuje njegov unos kao ukus LeRobot v2 formata sa dodatnim fajlom opis modaliteta; noviji obučavači ovde očekuju v3.0. Mešavina sastavljena u pogrešnoj verziji ne uspe pri učitavanju umesto da ne proizvede lošu politiku - bolji modus neuspeha, još uvek uništen mesta u redu. dokumentaciju skupa podataka lista koji format svaki obučavač uzima.

Petlja, sa evidencijom već urađenom

Preuzimanje sa armom sa vodstvom, tastatura ili klizači; označavanje intervencije po okviru; prijava izvršavanja kao korekcije ili evaluacije; sastavljanje mešovitog skupa podataka sa eksplicitnim izborom епизoди po izvoru; i nastavak obuke od kontrolne tačke umesto osnovnog modela. Šta ostaje vaša odluka je koja izvršavanja se računa kao korekcija, šta ide u mešavinu i kada stopa intervencije prestane padati.

Vidi kako je DAgger petlja okablirana

Četiri načina da budiš rundu

1. Obuka samo na korekcijama

Najčešće stvar neuspešnosti i najtentativnija prečica. Skup podataka samo korekcija je skoro u potpunosti teško srednje zadatka, sa pristupom i povlačenjem nedostaće; politika postaje bolja na teško delu i zaboravlja kako da stigne tamo. Agregacija nije detalj implementacije metode, to je mehanizam: stari podaci su ono što drži ostatak ponašanja na mestu dok korekcije premešćaju jedan deo toga.

2. Premešćanje kamere između rundi

Kamera koja pomeranja dva centimetra između rundi proizvodi politiku goru od one sa kojom ste počeli, i dijagnozu koja košta dan. Svaki VLA ovde je uslovna na slike; stanje zgloba samo ne razjašnjava gde je objekat. Fotografirajte postavku pre prve runde i proverite tu fotografiju pre svake kasnije.

3. Dozvoljavanju artefakta preuzimanja u obuku

Pokriveno gore i na listi jer je nevidljivo. Simptom je politika koja se zaustavlja za delić sekunde tačno tamo gde je operater prethodne runde preuzeo. Izgleda kao kolebanje; to je imitacija.

4. Pozivanju tople početka preuzimanjem

Ako verujete da se stanje optimizatora prenosilo, početni gubitak vrh čita kao bug i ideš loviti za pokvarene podatke. Ako znate da je optimizator počeo svežanj, vrh je očekivan i gledate šta dolazi posle njega. Isti brojevi, suprotne zaključke.

Merenje runde

Metrika za human-gated petlju je stopa intervencije: okviri snimljeni dok ste bili u kontroli, podeljeni sa ukupnim okvirima izvršavanja. To je u statusu preuzimanja i to je jedini broj koji odgovara pitanju koje je runda postavila. Gubitak obuke pada bez obzira da li se politika poboljšala; stopa uspeha je binarna i šumna pri veličinama uzorka koje arm na stolu proizvodi. Stopa intervencije je kontinualna, merena na stanjima koja je politika sama proizvela i pada kako politika manje trebaj vas.

Uporedi je samo preko izvršavanja snimljena pod identičnim uslovima. Pun argument i kako napraviti skup evaluacije koji preživi više od dve runde nalazi se u članku o merenju DAgger petlje. Runda jedan je realno test izvodljivosti: proveravate da preuzimanje radi na vašem hardveru, da korekcije pristanu sa svojim zastavama i da je nastavljeno izvršavanje učitalo kontrolnu tačku koju ste imenovali. Runde dva i tri su gde bi stopa trebala početi da se pomera. Ako se do runde četiri nije pomerila, problem je uzvodno od DAgger-a.

Napišite po rundiZašto je to bitno kasnije
Kontrolna tačka koja je vozenaBez nje ne možete atribuirati poboljšanja mešavini
Modus unosa korišćen za preuzimanjeKorekcije preko tastature su gruboće nego korekcije vodia i vidi se u podacima
Broj izvršavanja i kako je svaka trijažaDa li je runda imala dovoljno korekcija da bude od važnosti
Stopa intervencije po izvršavanju, i prosledekMetrika progresa petlje
Tačan izbor епизоди po izvoruJedini način da reproduciraš ili poništiš rundu
Topla početak ili svežanj obukaObjašnjava krivulju gubitka koju ćete gledati za nedelju dana

Ako još nemaš kontrolnu tačku

Petlja nema ulazne tačke bez nje. Zabeležite prvi skup podataka obučavajte prvo politiku pokrenite je - snimanje, obuka i pokretanje politike pokrivaju tu putanju. Klijent snimanja je na stranici za preuzimanje, GPU nivoi i satne stope na stranici cena i šta je usable епизода izgleda u SO-100 vodiču za prikupljanje podataka. Dobijte demonstracije ispravne pre korekcije: DAgger je mehanizam popravke i radi daleko bolje na nečem što je bilo skoro da je u redu već.

Mogu li da pokrenete DAgger petlju bez arma sa vodstvom?

Da. Odaberite unos preko tastature ili klizača kada pritisnete Preuzmi: preuzimanje je bezposredno i ručno, bez drugog arma koji se usklađuje. Tastatura šalje relativne gurnaje koje server stezće tvrdo na 2 stepena po zglobu i 4 za hvatač; klizači prate apsolutni cilj i server se kreće najviše 6 stepeni prema njemu po pozivu, dok interfejs nastavlja strujanje. Kolona akcije i označavanje intervencije su isti kao u modu sa vodstvom, tako da korekcije su nerazlučive u skupu podataka.

Koliko korekcija jedna runda trebati?

Nema odbranivog univerzalnog broja i broj okvira je važniji od broja епизоди. Radna pravilo je da korekcije ne smeju biti izgubljene u mešavini: sa 200 originalnih епизоди i tri епизоде korekcija, ništa se ne pomera. Ciљ je na korekcije koje pokrivaju neuspešno ponašanje iz nekoliko početnih konfiguracija nego tri ponavljanja iste spasavanja.

Zašto je obuka samo na korekcijama takva loša ideja?

Jer su korekcije skoro u potpunosti teško srednje zadatka. Pristup, usklađivanje i povlačenje nedostaju, tako da politika gubi ono što je već radila dobro dok se poboljšava na delu koji si ispravil. Čuvanje starih podataka i dodavanje je sam mehanizam, ne opcionalno dodatno.

Da li nastavak od kontrolne tačke nastavlja prethodno izvršavanje obuke?

Ne. Kontrolna tačka samo sa težinama vraća parametre i ništa drugo: momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka počinju svežanj. To je topla početak i početni gubitak vrh je očekivan umesto simptoma. Napišite koji od dva si zaista uradio, tako da čitate krivulju ispravno nedelju dana kasnije.

Šta ako stopa intervencije ne padne?

Zaustavite dodavanje rundi. Ravna stopa znači da korekcije ne uče šta mislite. Uobičajene uzroke su uzvodno: kamera je promerena, korekcije počinju preukusno da budu podaci izbegavanja, okviri preuzimanja su u skupu podataka obuke, ili zadatak je nedoloučen iz posmatranja koja politika zaista dobija.

Ništa od ovoga nije rešen problem i ništa od toga nije jedan klik. Interaktivno učenje imitacijom je aktivna oblast istraživanja upravo zato što su njegova pitanja - kada intervenirati, kako ponderirati šta je čovek uradio, koliko starih podataka čuvati - nema uspostavljenih odgovora; anketa od Celemin i dr. mapira šta je još otvoreno. Ono šta petlja ima je merljiva konvergencija kada se pokreće pažljivo, na hardveru koji košta nekoliko stotina evra. Zamrznite postavku, intervenujte rano, trijaža iskreno, komponujte namerno i beležite stopu intervencije svaki put.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started