SO-100 robotska ruka niske cene na stolu, podešena za teleoperaciju i obuku politike
DAggerSO-100Učenje imitacijomVLATeleoperacija

Pokretanje DAgger petlje na SO-100 sa VLA politikom

AY-Robots ResearchAugust 27, 202615 min čitanja

Detaljno izveštavanje o jednoj DAgger rundi sa ljudskom kontrolom na SO-100 ruki: pokrenite politiku i snimite je, preuzimite je kada nešto krene naopako, obeležite trčanje kao ispravljanje, sastavite mešoviti skup podataka i nastavite obuku od kontrolne tačke. Uključuje putanju sa tastaturom i klizačima za ljude bez voditeljske ruke, kao i četiri greške koje čine rundu beskorisnom.

Vaša politika radi. Doseže kocku, zatvara zahvat centimetar preurano i nastavlja kao da je ima. Ništa se ne javlja kao greška, i nijedan obim gledanja na gubitak obuke ne objašnjava. Popravka nije još 20 000 koraka gradijenta na istim demonstracijama. To je vraćanje vaše ruke na ruku tačno gde ide naopako, snemanje šta ste umesto toga uradili, i obuka sledeće kontrolne tačke na starim podacima plus toj ispravci. To je DAgger runda, i evo kako se pokušava na SO-100 sa politikom vizije-jezika-akcije.

Teorija je drugdje: zašto agregacija skupa podataka uopće radi i šta ljudska kontrola menja kod toga. Ovo je priručnik za rad, i pretpostavlja obučenu kontrolnu tačku, radio kamere i ruku koja se kreće. Šest koraka ispod su petlja kao što je implementirana na DAgger stranica ove platforme, ali sekvenca je ista iz vaših sopstvenih skripti.

Jedna runda u kratko

  • Pokrenite obučenu politiku i snimite je, sa tekstom zadatka trčanja umesto opšte etikete teleoperacije.
  • Preuzimite čim ponašanje krene naopako: zrcalna predaja sa voditeljskom rukom, odmah i ručno preko tastature ili klizača bez nje.
  • Trijaž svako trčanje: klasifikujte ga kao ispravljanje, čuvajte ga kao epizodu evaluacije ili ga odbacite.
  • Sastavite mešavinu ručno - originalne demonstracije plus ispravke, epizode odabrane po izvoru. Nikada ne obučavajte samo na ispravkama.
  • Nastavite obuku od poslednje kontrolne tačke, i zabeležite koju kontrolnu tačku je stvorila koja mešavina.
  • Broj koji govori da li je runda bila vredna nečega je stopa intervencije, ne gubitak obuke.

Zašto druga runda nije samo više podataka

Kloniranje ponašanja obučava se na stanjima koja je čovjek posjetio. U vrijeme testiranja politika posjećuje stanja koja uzrokuje, a male greške u akciji se skupljaju u stanja koja ni jedna demonstracija nije pokrivala. Ross, Gordon i Bagnell su formalizirali tu grešku za AISTATS 2011 i odgovorili sa iterativnim algoritmom koji obučava determinističku politiku i, prema njihovoj redukciji, mora dobro funkcionisati pod distribucijom stanja koju inducirava: pokrenite trenutnu politiku, imajte eksperta da označava stanja koja je zaista dostigla, dodajte ih skupu podataka, ponovo obučite, ponovite. Kelly et al. su učinili upit praktičnim sa HG-DAggerom, gde čovek odlučuje kada preuzeti kontrolu umesto da označava stanja bez držanja kontrola; oni izveštavaju o poboljšanoj performansi i DAggerom i kloniranjem ponašanja na simuliranom i stvarnom autonomnom vožnjom. Ljudska kontrola je ono što čini petlju podnošljivom na stolu ruke - ruke vam se pomeraju samo kad nešto krene naopako.

Dvije posledice su važnije u praksi nego u teoriji. Ispravke nisu obične demonstracije: one se koncentruju u regijama uskih grla koje Mandlekar et al. opisuju, gde malo odstupanje spušta politiku u stanja koja demonstracije nikada nisu pokrivale. A skup podataka napravljen samo od tih teških delova je loše oblikovan skup podataka - Belkhale, Cui i Sadigh tvrde sa strane podataka da raznolikost stanja nije uvek korisna, i da divergencija akcije i raznolikost prelaza zajedno odlučuju kvalitet skupa podataka. Mešoviti skup podataka nije kompromis, on je suština.

Zamrznite ove pre prve runde

DAgger runda upoređuje politiku sa sobom kroz vreme. Sve što promenite između rundi koje nije skup podataka čini to poređenje besmislenim.

  • Položaje i montaže kamera, uključujući kameru na zapešću. Otpustite jednu stezaljku i promenili ste distribuciju opažanja, ne politiku.
  • Ekspozicija i balans belina, ako vam stek hvatanja dozvoljava da ih pričvrstite. Drift auto-ekspozicije između rundi je spora, nevidljiva promena domena.
  • Kalibracijski arm i pozicije servo nule. Ako morate da rekalibrujete, tretiraite sve snimljeno pre toga kao odvojen skup podataka.
  • Tekst zadatka. Svaka VLA ovdje uslovljava na njega; preformulacija tokom petlje je drugačiji zadatak.
  • Osvetljenje, površina stola, skup objekata. Novi objekat je novi eksperiment, ne sledeća runda.
  • Brzina kadriranja snimanja. Poređenje stopa intervencije kroz dva rastora uzorkovanja proizvodi razlike koje dolaze od rastera.
Kamera na zapešću nije opciono nameštanje

Hsu et al. su uporedili pogled fokusiran na ruku nasuprot običnom tercijskom pogledu i otkrili da perspektiva oka u ruci konzistentno poboljšava efikasnost obuke i uopštavanje van distribucije, uprkos tome što vidi manje scene. Na ruki od pet zglobova, vremenovanje zahvata je obično ono što vaše ispravke ispravka, i vremenovanje zahvata je ono što vidi zahvatač zapešća.

Runda, od kraja do kraja

  1. 1
    Pokrenite zaključivanje i snimite ga

    Pokrenite trčanje nasuprot kontrolnoj tački koju želite da poboljšate, zatim pokrenite snimanje u koren zaključivanja. Snimljeno na taj način nasljeđuje tekst zadatka samog trčanja, što je ono na čemu je politika obučavana, umesto zadane etikete teleoperacije. Bez snimanja možete gledati grešku ali je ne možete obučavati.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Preuzimite kada krene naopako

    Pritisnite Preuzimanje i odaberite režim unosa: voditeljska ruka, tastatura ili klizači. Trkač se pauzira, vi ispravljate, vraćate. Kadri snimljeni dok ste vozili označavaju se kao intervencije automatski.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Trijaž epizode

    Odlučite po epizodi: klasifikujte kao ispravljanje, čuvajte kao evaluaciju, ili odbacite. Trčanje koje je politika završila bez pomoći je evaluacijski podatak.

  4. 4
    Sinhronizujte skup podataka za ispravljanje

    Ispravke se skupljaju u lokalni skup podataka po politici i odlaze u skladište u oblaku kroz automatsku sinhronizaciju. Ništa se ne meša što niste tamo stavili.

  5. 5
    Sastavite mešoviti skup podataka

    Kombinujte originalni skup podataka sa skupom podataka za ispravke, eksplicitno biraju epizode po izvoru. Rezultat je obični skup podataka od tada napred.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Nastavite obuku od kontrolne tačke

    Obučite mešavinu od prethodne kontrolne tačke umesto osnovnog modela. Zabeležite koju kontrolnu tačku i koju mešavinu; bez tog para runda nije ponovljiva.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Korak 2 detaljno: dva načina preuzimanja

Sa voditeljskom rukom

U voditeljskom-sledbeniku režimu preuzimanje je predaja između dve ruke koje nisu u istoj pozi. Pritiskanjem Preuzimanja trkač se pauzira i vodi vođenja na trenutnu pozu sledbenika, tako da se ništa ne skoči kada se moment prenese. Ako ta vožnja poravnanja vremenski istekne, ručno poravnate vođenje i oslobađate samo kad su dva u pet stepeni. Od tada teleoperujete normalno i kolona akcije beleži šta ste naručili.

Budite pošten o ovoj putanji: vožnja poravnanja i rukovanje momentom su najmanje testirani deo petlje na stvarnom hardveru. Testirajte predaju na sporoj, neškodljivoj pozi pre nego što se na nju oslanjate u trčanju kojem vas briga. Voditeljska ruka proizvodi najgladnije ispravke od tri režima, i takođe ima najviše što može poći naopako mehanički.

Bez voditeljske ruke: tastatura i klizači

Većina ljudi koji čitaju ovo poseduje jednu ruku. To je dovoljno. Odaberite unos tastaturom ili klizačima u trenutku kad pritisnete Preuzimanje, i preuzimanje je odmah i ručno - nema druge ruke da se poravna, zato nema koraka poravnanja. Sledbenski drži svu pozu i čeka unos.

Režim unosaKako se ruka krećeOgraničenje po pozivu nametnuto od strane serveraZaključano kada
Voditeljska rukaOgledalo vozi sledbenika sa uglova zglobova vođeNema gurnisa ili postavki poziva u ovom režimu; ogledalo piše ciljeve sledbenika kontinuiranoNikada zaključano, i podrazumevan ako nema datog režima unosa - ali treba drugu ruku; bez voditeljskog ID-a preuzimanje je odbijeno
TastaturaRelativno guranje po pritisku na taster, poslano zaključiteljskom gurlanjuTvrda stezanja na 2 stepena po zglobu, 4 stepena za zahvatOdbijeno sa 409 ako je preuzimanje pokrenuto u režimu vođe
KlizačiApsolutna ciljana poza, poslana zaključiteljskoj postavciNajviše 6 stepeni putovanja prema cilju po pozivu; interfejs nastavlja slanje oko deset puta u sekundiOdbijeno sa 409 ako je preuzimanje pokrenuto u režimu vođe

Stezanja se nameću sa strane servera, ne u interfejsu, jer je pogrešan delta na magistrali sa servo rukom sudara. Korekcije tastature dolaze stepwise i blago grube; korekcije klizača su glatke, jer server hoda prema cilju dok interfejs nastavlja strujanje. Na bilo koji način kolona akcije prima pune komande poza i intervencije oznaku je identična voditeljskoj putanji, tako da se korekcije tastature smeštaju u isti skup podataka bez razlike u formatu.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Ista rasporeda tastera kao bilo gde drugdje u steku, tako da mišična memorija od snimanja preli.
Voditeljski priručnik koji pokazuje uređene korake GR00T fine-tuning trčanja na SO-100 skupu podataka
Obučavanja strana runde je ista vođena sekvenca kao prvo trčanje; samo polje kontrolne tačke se razlikuje.

Kada pritisnuti dugme

Ranije nego kasnije. Ispravka koja počinje nakon što se zahvat zatvori na ništa uči oporavak od greške koju politika nije trebala da uđe, i podaci oporavka vrede daleko manje od podataka izbegavanja. Prekinite u prvom trenutku kada ste sigurni da je putanja pogrešna, ispravite kroz teški deo, vratite čim je stanje ono što je politika vredala pre. ThriftyDAgger automatizira tu odluku kapljanjem intervencija o novosti i procenjenom riziku pod fiksnim ljudskim budžetom, ali na jednoj ruki sa čovekom koji već gleda, ljudska kaplja je jeftinija i bolje kalibrirana od bilo šta što ćete tunovati.

Izvedivo sa otvorenim stekom i nekoliko skripti. Šta to košta je čitara, i čitara je gde DAgger runde umiru.

  1. Napišite kadre iz vaše sopstvene skripte zaključivanja u LeRobot skup podataka, sa stringom zadatka na koji je politika obučavana.
  2. Pauzira politiku petlje, prebacite izvor komande, i označite svaki kadr koji vozite kao intervenciju. Bez zastavice, ispravke izgledaju kao obične demonstracije.
  3. Odlučite svesno šta se dešava na kadrama prelaza između politike da oslobodi kontrolu i vašeg prvog unosa.
  4. Čuvajte ispravke u njihovom vlastitom skupu podataka po politici, i pratite indekse epizoda ručno kako bi se mešavina mogla rekonstruisati.
  5. Pokažite unos fine-tuning na prethodnu kontrolnu tačku, i proverite u dnevniku da je učitao te težine.

Korak 3 detaljno: trijaž odlučuje kvalitet

Posle trčanja imate snimak sa nekim kadrima označenim kao intervencije. Tri odredišta postoje, i pogrešna tiho truje sledeću rundu.

  • Klasifikujte kao ispravljanje kad je intervencija bila pravi popravak: politika je išla na neki pogrešan lugar i vaš unos je pokazao desnu stvar iz stanja koju je politika sama proizvela.
  • Čuvajte kao evaluaciju za čista autonomna trčanja i za trčanja gde ste preuzeli od opreza. Epizode evaluacije su kako mererate sledeću kontrolnu tačku, i oni se nikada ne smeju obučavati.
  • Odbacite trčanja pokvarejena od nečega nepovezanog - ispušteni kadr kamere, zaustavljen servo, objekat koji ste oborili. Prljava ispravka je gora od bez ispravke.
Kadri zamrzavanja pripadaju raw snimanju, ne obučavanju

Između politike da oslobodi kontrolu i vašeg prvog unosa, ruka drži mirno dok snimač nastavlja pisanje - trčanje identičnih poza parunjenih sa malo različitim slikama. Tu su kadri predaje ostaju u raw snimanju i van skupa podataka za ispravljanje. Ako sami gradite petlju, režite ih svesno: politika obučavana na njima uči da se pauzira gde treba da deluje.

Korak 5 detaljno: komponovanje mešavine

Skladba uzima originalni skup podataka plus skup podataka za ispravke i proizvodi novi, obični LeRobot skup podataka koji obučava kao bilo koji drugi. Važna svojstva je da je selekcija epizode eksplicitna po izvoru - ništa se ne meša automatski. To zvuči manje dok prvi put politika deluje čudno i morate rekonstruisati šta je na njemu obučavana.

Otvoreno pitanje je odnos, i niko nema broj koji se prenosi. Ono što se slaže literature je da ispravke trebaju broj više od njihovog dela frejm. Mandlekar et al. retrain iterativno na podacima koju njihov sistem intervencije skuplja, tako da politika uči da prođe kroz uska grla, i izveštavaju da agenti obučeni na taj način nadmašu agente obučene na ekvivalentnom broju uzoraka od ne-intervencijskih instruktora. Sirius ide dalje i ponovo teži trening uzoraka sa približenom ljudskom poverenjem, izveštavajući 8 procentnu dobit u simulaciji i 27 procenata na stvarnom hardveru u stopi uspeha politike naspram metoda sa kojima upoređuje, na dvostruko brzoj konvergenciji. Nijedan od unosa obuke ovde ne izlože gumb prepondiranja uzorka, pa je gruba zamena da čuvate svaku epizodu ispravke dok subsamolirate originalne demonstracije - i da napišete šta ste uradili.

Prikaz snimanja skupa podataka koji pokazuje epizode SO-100 skupa podataka sa tokovima kamera
Epizode ispravke su obične epizode sa zastavikom intervencije po kadru, tako da se komponuju sa originalnim skupom podataka bez konverzije.

Korak 6 detaljno: šta zaista znači nastavak od kontrolne tačke

Obuka mešavine od osnovnog modela radi ali baca prethodnu rundu i košta puno trčanja. Nastavak od prethodne kontrolne tačke je brži i obično bolji. To je takođe ograničenije nego što fraza sugeriše.

Inicijalizacija težine nije rezime optimizatora

Kontrolna tačka samo težina sadrži parametre i ništa drugo. Učitavanje je daje sledećem trčanju bolji početak nego osnovni model, ali momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka svi počinju od nule. Očekujte gubitak u početku nastavka trčanja, ne čitajte ga kao neuspeh, i ne pozivajte rundu rezime. To je topao početak.

PolitikaVeličinaGPU tieraZaključivanje po stepenu akcijeFormat skupa podatakaEpizode pre nego što je vredna pokušavanja
GR00T N1.7oko 3 B, otprilike 40 M obučeno tokom fine-tuningA100 80 GB ili H100 80 GBoko 152 msLeRobot v2.0 ili v2.150
GR00T N1.5oko 3 BA100 80 GB ili H100 80 GBoko 165 msLeRobot v2.0 ili v2.150
Pi0.5oko 3 B na PaliGemma kičmiA100 80 GB ili H100 80 GBoko 485 msLeRobot v3.050
SmolVLAoko 450 MRTX 4090 ili bilo koja 24 GB karticaoko 245 msLeRobot v3.030
ACToko 80 M, obučeno od nuleRTX 4090 ili bilo koja 24 GB karticaoko 20 msLeRobot v3.050

Kašnjenje se sabira unutar DAgger petlje na način na koji se ne javlja tokom demon: na otprilike 485 ms po koraku akcije preuzimate jer je ruka oklevala, ne zato što je pogrešna, i oklevanja ispravke nisu korisni podaci obuke. Ako iterujete na podacima umesto da jurite konačnom stope uspеha, iterujte na brzom modelu. Shukor et al. opisuju SmolVLA kao dizajnirano da se obučava na jednom GPU-u i rasporedbuje na potrošačkim GPU-u ili CPU-ovima, sa asinhronim stekom zaključivanja koja odvaja predviđanje akcije od izvršavanja kako bi dozvolilo veće stope kontrole - svojstvo koje drži petlju preuzimanja odgovrajućom.

Formati skupa podataka nisu zamenjivi. GR00T uzima LeRobot v2.0 ili v2.1, i Isaac-GR00T repozitorijum opisuje svoj unos kao ukus LeRobot v2 formata sa datotekom dodane modaliteta opisa; novije trenere ovde očekuju v3.0. Mešavina sastavljena u pogrešnoj verziji pada tokom učitavanja umesto da proizvede lošu politiku - bolji način pada, i dalje propušten rezon u redu čekanja. dokumentacija skupa podataka navodi koji format svaki trener uzima.

Petlja, sa beleškama već završenim

Preuzimanje sa voditeljskom rukom, tastaturom ili klizačima; označavanje intervencije po kadru; klasifikovanje trčanja kao ispravki ili evaluacija; komponovanje mešovitog skupa podataka sa eksplicitnom selekcijom epizode po izvoru; i nastavak obuke od kontrolne tačke umesto osnovnog modela. Ono što ostaje vaša odluka je koje trčanje računa kao ispravljanje, šta ide u mešavinu, i kad je stopa intervencije prestala padati.

Pogledajte kako je DAgger petlja žičana

Četiri načina za rasipanje runde

1. Obuka samo na ispravkama

Najčešća greška i najokušavajuća prečica. Skup podataka samo ispravka je gotovo potpuno teški srednji deo zadatka, sa pristupom i povlačenjem nedostatak; politika postaje bolja u težom delu i zaboravlja kako tamo stići. Agregacija nije detalj implentacije metode, to je mehanizam: stari podaci su ono što drži ostatak ponašanja na mestu dok ispravke kreću jedan deo toga.

2. Premeštanje kamere između rundi

Kamera koja se pomera dva centimetra između rundi proizvodi politiku goru nego ona sa kojom ste počeli, a dijagnoza koja košta dan. Svaka VLA ovde se uslovi na slike; stanje zglobova samo ne razjašnjava gde je objekat. Fotografirajte postavku pre prve runde i proverite tu fotografiju pre svake kasnije.

3. Dozvoljavanje artefakata predaje u obuku

Pokriveno gore, i na listi jer je nevidljivo. Simptom je politika koja staje frakciju sekunde tačno gde je operator prethodne runde preuzeo. Izgleda kao oklevanje; to je imitacija.

4. Zivanje toplog početka rezimea

Ako verujete da je stanje optimizatora preneto, početni gubitak čini se kao greška i idete loviti poljoprivredno prikivanu podatke. Ako znate da je optimizator počeo ispočetka, skok je očekivan i gledate šta dolazi posle njega. Isti brojevi, suprotni zaključci.

Meravanje runde

Metrika za ljudsku kontrolu petlje je stopa intervencije: kadri snimljeni dok ste bili u kontroli, deljeni sa ukupnim okvirima trčanja. Nalazi se u statusu preuzimanja, i to je jedini broj koji odgovara na pitanje koje je runda postavila. Gubitak obuke pada da li je ili ne politika poboljšana; stopa uspeha je binarna i bučna sa veličinama uzorka koje ruka na stolu proizvodi. Stopa intervencije je kontinuirana, merena na stanjima koja politika sama uzrokuje, i pada kako politika vas manje treba.

Uporedite je samo kroz trčanja snimljena pod identičnim uslovima. Puno argument, i kako da napravite skup evaluacije koja drži više od dve runde, je u članku o meranju DAgger petlje. Runda jedan je realno test izvedljivosti: proveravate da preuzimanje deluje na vašem hardveru, da ispravke smeštaju sa zastavicama, i da je nastavljena obuka učitala kontrolnu tačku koju ste imenovali. Runde dva i tri su gde bi stopa trebala početi da se kreće. Ako se nije pomerila do runde četiri, problem je uzvodno od DAgger.

Napišite po rundiZašto je kasnije važno
Kontrolna tačka koja je vozanaBez toga ne možete pripisati poboljšanje mešavini
Režim unosa korišćen za preuzimanjeIspravke tastature su grube nego ispravke vođe, i viđa se u podacima
Broj trčanja i kako je svako trijažDa li je runda imala dovoljno ispravki da bude važne
Stopa intervencije po trčanju, i srednja vrednostMetrički napredak petlje
Tačna selekcija epizode po izvoruJedini način da se reprodukuje ili otkaže runda
Topao početak ili nova obukaObjašnjava krivulju gubitka koju ćete pogledati za nedelju dana

Ako još nemaš kontrolnu tačku

Petlja nema ulazne tačke bez one. Snimite prvi skup podataka, obučite prvu politiku, pokrenite je - snimanje, obuka i pokretanje politike pokrivaju tu putanju. Klijent snimanja je na stranici za preuzimanje, GPU tierovi i satne cene na stranici cena, i šta dobra epizoda izgleda u SO-100 vodiču za prikupljanje podataka. Prvo ispravite demonstracije pre ispravki: DAgger je mehanizam popravke, i radi daleko bolje na nečem što je bilo skoro u redu.

Mogu li pokrenuti DAgger petlju bez voditeljske ruke?

Da. Odaberite unos tastaturom ili klizačima kad pritisnete Preuzimanje: preuzimanje je odmah i ručno, bez druge ruke da se poravna. Tastatura šalje relativne šibice koju server teško stiska na 2 stepena po zglobu i 4 za zahvat; klizači šalju apsolutni cilj i server se kreće najviše 6 stepeni prema njemu po pozvu, dok interfejs nastavlja strujanje. Kolona akcije i intervencije oznaka su iste kao u voditeljskom režimu, tako da su ispravke tastature nerazlučive u skupu podataka.

Koliko ispravki treba jednoj rundi?

Nema branivih univerzalnih brojeva, i broj kadriranja važniji je od broja epizode. Radna pravila je da ispravke ne smeju biti izgubljene u mešavini: sa 200 originalnih epizoda i tri epizode ispravke, ništa se neće pomeriti. Cilj je ispravke koje pokrivaju propadajuće ponašanje iz nekoliko početnnih konfiguracija umesto tri ponavljanja iste spasavanja.

Zašto je obuka samo na ispravkama tolika loša ideja?

Jer su ispravke gotovo potpuno teški deo sredine zadatka. Pristup, poravnanje i povlačenje nedostaju, tako da politika gubi šta je već dobro uradila dok poboljšava deo koji ste ispravili. Čuvanje starog podataka i dodavanje je sam mehanizam, ne opciono ekstra.

Da li nastavak od kontrolne tačke nastavlja prethodno trčanje obuke?

Ne. Kontrolna tačka samo težine vraća parametre i ništa drugo: momenti optimizatora, pozicija rasporeda stope učenja i redosled podataka počinju ispočetka. To je topao početak, i početni gubitak je očekivan umesto simptoma. Napišite koji od dva ste zaista uradili, tako da čitate krivu ispravno za nedelju dana.

Šta ako stopa intervencije ne pada?

Prestanite da dodajete runde. Ravna stopa znači da ispravke ne poučavaju šta mislite. Uobičajeni uzroci su uzvodno: kamera se pomerila, ispravke počinju prekasno da budu podaci izbegavanja, kadri predaje su u skupu obuke, ili je zadatak neodređen iz opažanja koja politika zaista dobija.

Ništa od toga nije rešeni problem i ništa od toga nije jedan klik. Interaktivno učenje imitacijom je aktivna oblast istraživanja upravo zato što su joj pitanja - kad intervenisati, kako ponderisati šta je čovek uradio, koliko starog podataka čuvati - nemaju utvrđene odgovore; anketa Celemin et al. mapira šta je još otvoreno. Ono što petlja ima je merljiva konvergencija kad se vodim pažljivo, na hardveru koji košta nekoliko stotina evra. Zamrznite postavku, intervenisati rano, trijaž pošteno, mešavaju namerno, i zabeležite stopu intervencije svaki put.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started