SO-100 jeftini robotski krak na stolu, postavljen za teleoperciju i treniranje politike
DAggerSO-100Učenje imitacijomVLATeleopercija

Pokretanje DAgger petlje na SO-100 s VLA politikom

AY-Robots ResearchAugust 27, 202615 min čitanja

Korak po korak opis jedne ljudski vođene DAgger runde na SO-100 kraku: pokrenite politiku i snimite je, preuzimite kada nešto pođe po zlu, zabilježite kao korekciju, sastavite mješoviti skup podataka i nastavite treniranje od kontrolne točke. Uključuje putanju preuzimanja putem tipkovnice i klizača za ljude bez voditeljskog kraka, te četiri greške koje čine rundu beskorisnom.

Vaša politika se pokreće. Doseže kocku, zatvara hvatač centimetar prerano i nastavlja kao da je ima. Ništa se ne javlja kao greška, i bez obzira koliko gledali u gubitak treniranja, ne objašnjava se. Rješenje nije dodatnih 20 000 koraka gradijenta na istim demonstracijama. Trebate vratiti ruku na krak točno gdje nešto pođe po zlu, snimiti što ste umjesto toga učinili, i trenirati sljedeću kontrolnu točku na starim podacima plus toj korekciji. To je DAgger runda, i evo kako se pokreće na SO-100 s politikom vizije-jezika-akcije.

Teorija je drugdje: zašto agregacija skupa podataka uopće funkcionira i što ljudsko vođenje mijenja u vezi toga. Ovo je priručnik za rad i pretpostavlja trenirani kontrolnu točku, funkcionalan skup kamera, i krak koji se pokreće. Šest koraka u nastavku je petlja kako je implementirana na DAgger stranici ove platforme, ali redoslijed je isti iz vlastitih skripti.

Jedna runda ukratko

  • Pokrenite trenirane politike i snimite je, s tekstom zadatka rundy umjesto generičke etikete teleopercije.
  • Preuzimite u trenutku kada ponašanje pođe po zlu: zrcalna preuzimanja s voditeljem, odmah i ručno kroz tipkovnicu ili klizače bez njega.
  • Sortira svaku rundu: zabilježite kao korekciju, čuvajte kao evaluacijski epizod, ili odbacite.
  • Sastavite mix ručno - originalne demonstracije plus korekcije, epizode odabrane po izvoru. Nikad ne trenirajte samo na korekcijama.
  • Nastavite treniranje od zadnje kontrolne točke i zabilježite koja kontrolna točka je proizvela koji mix.
  • Broj koji govori je li runda nešto vrijedna je stopa intervencije, ne gubitak treniranja.

Zašto druga runda nije samo više podataka

Kloniranje ponašanja trenira se na stanjima koja je čovjek posjetio. U vrijeme testiranja politika posjeća stanja koja uzrokuje, i male greške akcije se nagomilavaju u stanja koja niti jedna demonstracija nije pokrivala. Ross, Gordon i Bagnell su formalizirali taj neuspjeh za AISTATS 2011 i odgovorili s iterativnim algoritmom koji trenira stacionarnu determinističku politiku i, u okviru njihove redukcije, mora biti dobra pod distribucijom stanja koju uzrokuje: pokrenite trenutnu politiku, neka ekspert označi stanja do kojih je zaista stigla, dodajte u skup podataka, retjenirajte, ponavljajte. Kelly i drugi su učinili upiti praktičnim s HG-DAgger, gdje čovjek odlučuje kada preuzeti kontrolu umjesto označavanja stanja bez držanja kontrola; izvješćuju poboljšanu izvedbu nad DAgger i kloniranjem ponašanja na simuliranom i stvarnom zadatku autonomne vožnje. Ljudsko vođenje je ono što čini petlju podnošljivom na kraku na stolu - trebate rukovati samo kada nešto ide po zlu.

Dvije posljedice su važnije u praksi nego što je teorija. Korekcije nisu obične demonstracije: koncentriraju se u regijama grlog boca koje Mandlekar i drugi opisuju, gdje mala devijacija baci politiku u stanja koja demonstracije nikad nisu pokrivala. I skup podataka napravljeni samo od tih težih dijelova je loše oblikovan skup - Belkhale, Cui i Sadigh argumentiraju sa strane podataka da raznolikost stanja nije uvijek korisna, i da divergencija akcije i raznolikost prijelaza zajedno odlučuju kvalitetu skupa podataka. Mješoviti skup podataka nije kompromis, to je poanta.

Zamrzni ove stvari prije runde jedan

DAgger runda uspoređuje politiku protiv sebe kroz vrijeme. Bilo što što trebate promijeniti između rundi što nije skup podataka čini tu usporedbu besmislenom.

  • Položaje i montaže kamera, uključujući kameru na zapešću. Otpustite jednu kopču i trebate promijeniti distribuciju opažanja, ne politiku.
  • Ekspozicija i balans bijele, ako vam slog slike omogućava da ih fiksnirate. Automatska ekspozicija koja pluta između rundi je spora, nevidljiva domena promjena.
  • Kalibracija kraka i pozicije nule servo motora. Ako trebate ponovno kalibrirati, sve snimljeno prije toga tretirajte kao zaseban skup podataka.
  • Tekst zadatka. Svaka VLA ovdje je uvjetovana na njega; preformuliranje usred petlje je drugačiji zadatak.
  • Osvjetljenje, površina stola, skup objekata. Novi objekt je novi pokus, ne sljedeća runda.
  • Brzina snimanja okvira. Uspoređivanje stopa intervencije između dva rastra uzorkovanja proizvodi razlike koje dolaze iz rastera.
Kamera na zapešću nije opcijska dekoracija

Hsu i drugi su usporedili vidik usmjeren na ruku protiv uobičajenog vidika treće osobe i otkrili da je perspektiva oka-u-ruci dosljedno poboljšala učinkovitost treniranja i generalizaciju izvan distribucije, unatoč viđenju manje scene. Na kraku s pet zglobova, timing grifera je obično ono što trebate ispraviti, a timing grifera je ono što nosi vidik zapešća.

Runda, od kraja do kraja

  1. 1
    Pokrenite zaključivanje i snimite ga

    Pokrenite rundu na kontrolnoj točki koju trebate poboljšati, zatim pokrenite snimanje u korijen zaključivanja. Snimljena na taj način, naslijedi tekst zadatka vlastite rundy, što je politika bila trenirana, umjesto zadane etikete teleopercije. Bez snimanja možete gledati neuspjeh ali ga ne možete trenirati.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Preuzimite kada nešto pođe po zlu

    Pritisnite Preuzmi i odaberite način unosa: voditeljski krak, tipkovnica ili klizači. Pokretač se pauzira, trebate ispraviti, trebate vratiti. Okviri snimljeni dok ste vozili su automatski označeni kao intervencije.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Sortirajte epizode

    Odlučite po epizodi: zabilježite kao korekciju, čuvajte kao evaluaciju, ili odbacite. Runda koju je politika završila bez pomoći je evaluacijski podatak.

  4. 4
    Sinkronizirajte skup podataka korekcije

    Korekcije se skupljaju u lokalni skup podataka po politici i odlaze u oblačno spremište kroz automatsku sinkronizaciju. Ništa se ne miješa što niste tamo stavili.

  5. 5
    Sastavite mješoviti skup podataka

    Kombinirajte originalni skup podataka s korekcijama, odabirući epizode eksplicitno po izvoru. Rezultat je obični skup podataka od tada naviše.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Nastavite treniranje od kontrolne točke

    Trenirajte mix od prethodne kontrolne točke umjesto početnog modela. Zabilježite koja kontrolna točka i koji mix; bez te veze runda nije ponovljiva.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Korak 2 detaljno: dva načina preuzimanja

S voditeljem

U voditeljski-pratitelj modu je preuzimanje rukovanje između dva kraka koja nisu u istoj poziciji. Pritisak na Preuzmi pauzira pokretač i pokreće voditelja na poziciju pratitelja, tako da se ništa ne skače kada se moment prenosi. Ako se vožnja poravnanja istekne, trebate ručno poravnati voditelja i osloboditi samo kad su dva unutar pet stupnjeva. Od tada rade normalno teleoperciju i stupac akcije bilježi što ste trebali.

Budite iskreni o ovoj putanji: vožnja poravnanja i moment rukovanja su najmanje testirani dio petlje na stvarnom hardveru. Testirajte rukovanje na sporom, neškodnom položaju prije nego što se oslonite na njega u rundi koju trebate. Voditeljski krak proizvodi najgladnije korekcije od tri moda, i ima i najviše što može pići mehanički.

Bez voditeljskog kraka: tipkovnica i klizači

Većina ljudi koji ovo čitaju posjeduje jedan krak. To je dovoljno. Odaberite unos putem tipkovnice ili klizača u trenutku pritiska na Preuzmi, i preuzimanje je odmah i ručno - nema drugog kraka za poravnanje, tako da nema koraka poravnanja. Pratitelj drži svoju poziciju i čeka unos.

Način unosaKako se krak pokrećeOgraničenje po pozivu nametnuto od strane poslužiteljaZaključano kada
Voditeljski krakZrcalo pokreće pratitelja iz kutnih brzina voditeljskog krakaNema dodirivanja ili postavljanja poziva u ovom modu; zrcalo neprekidno piše ciljeve pratiteljaNikad zaključano, i zadano ako nema danog moda unosa - ali trebate drugi krak; bez ID voditeljskog kraka preuzimanje je odbijeno
TipkovnicaRelativno dodirivanje po pritisku na tipku, poslano na krajnju točku dodirivanja preuzimanjaTeško stisnuto na 2 stupnja po zglobu, 4 stupnja za hvatačOdbijeno s 409 ako je preuzimanje počelo u modu voditeljskog kraka
KlizačiApsolutna ciljna pozicija, poslana na krajnju točku postavljanja preuzimanjaNajviše 6 stupnjeva kretanja prema cilju po pozivu; sučelje šalje oko deset puta u sekundiOdbijeno s 409 ako je preuzimanje počelo u modu voditeljskog kraka

Stezanje se provodi na strani poslužitelja, a ne u sučelju, jer pogrešno tipkan delta na kraku s magistralnim servo motorima je sudar. Korekcije putem tipkovnice dolaze stepenasto i malo grubo; korekcije sa klizačima su glatke jer poslužitelj ide prema cilju dok sučelje neprekidno šalje. Ionako stupac akcije prima kompletan vektor trebane pozicije i označavanje intervencije je identično putanji voditeljskog kraka, tako da korekcije putem tipkovnice stanu u isti skup podataka bez razlike u obliku.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Isti raspored tipki kao i svugdje drugdje u stogu, tako da se mišićna memorija iz snimanja prenosi.
Priručnik za treniranje koji pokazuje naređene korake GR00T finog podešavanja rundy na SO-100 skupu podataka
Strana treniranja runde je isti vođeni redoslijed kao i prva runda; samo se polje kontrolne točke razlikuje.

Kada pritisnuti gumb

Ranije nego li kasnije. Korekcija koja počinje nakon što je hvatač zatvoren na ništa učava oporavak od neuspjeha kojeg politika ne bi trebala ući, i podaci o oporavku vrijede daleko manje nego li podaci o izbjegavanju. Prekidite u prvom trenutku kada ste sigurni da je putanja pogrešna, trebate ispraviti kroz težak dio, trebate vratiti čim je stanje ono što je politika trebala prije. ThriftyDAgger automatizira tu odluku održavanjem intervencija na novosti i procijenjenom riziku pod fiksnom ljudskom budžetom, ali na jednom kraku s čovjekom koji već gleda, ljudska vrata su jeftinija i bolje kalibrirana od bilo čega što ćete trebati preporučiti.

Moguće s otvorenim kodom i nekoliko skripti. Što to košta je knjiženje, i knjiženje je gdje DAgger runde umiru.

  1. Napišite okvire iz vlastite skripte zaključivanja u LeRobot skup podataka, s tekstom zadatka na kojem je politika bila trenirana.
  2. Pauzirati petlju politike, prebaciti izvor naredbi, i označiti svaki okvir koji trebate voziti kao intervenciju. Bez oznake korekcije izgledaju kao obične demonstracije.
  3. Odlučite namjerno što se događa s okvirima prijelaza između puštanja kontrole politike i vašeg prvog unosa.
  4. Čuvajte korekcije u njihovom vlastitom skupu podataka po politici, i pratite indekse epizoda ručno tako da mix može biti ponovno konstruiran.
  5. Pokažite na unos finog podešavanja na prethodnu kontrolnu točku, i provjerite u dnevniku da je naložio te težine.

Korak 3 detaljno: sortiranje odlučuje o kvaliteti

Nakon rundy imate snimanje s nekim okvirima označenim kao intervencije. Tri odredišta postoje, a pogrešan zahtijeva tiho Crno zagađuju sljedeću rundu.

  • Zabilježite kao korekciju kada je intervencija bila pravi popravak: politika je išla negdje pogrešno i vaš unos je pokazao pravu stvar iz stanja koje je politika sama proizvela.
  • Čuvajte kao evaluaciju za čiste autonomne runde i runde u koje ste preuzeli oprezno. Epizodi za evaluaciju su kako mjerite sljedeću kontrolnu točku, i oni nikad ne smiju biti trenirani.
  • Odbacite runde uništene nečim nepovezanim - ispušteni okvir kamere, zapaljeni servo motor, objekt koji ste srušili. Neuređena korekcija je gora nego li nema korekcije.
Okviri zamrzavanja pripadaju sirovom snimanju, ne u podatke za treniranje

Između puštanja kontrole politike i vašeg prvog unosa, krak stoji dok bilježnik nastavlja pisati - niz identičnih pozicija uparenih s malo drugačijima slikama. Ovdje ti okviri rukovanja ostaju u sirovom snimanju i izvan skupa podataka korekcije. Ako trebate sami graditi petlju, trebate ih namjerno rezati: politika trenirana na njima učit će se pauzirati gdje trebate djelovati.

Korak 5 detaljno: sastavljanje mixa

Sastav uzima originalni skup podataka plus skup podataka korekcije i proizvodi novi, obični LeRobot skup podataka koji trenira kao bilo koji drugi. Važna svojstva je da je odabir epizode eksplicitan po izvoru - ništa se ne miješa automatski. To zvuči nedovoljno dok se prvi put politika ponaša čudno i trebate ponovno konstruirati na čemu je bila trenirana.

Otvoreno pitanje je omjer, i nitko nema broj koji se prenosi. Ono što literatura slažu je da korekcije trebaju vrijediti više od njihove akcije okvira. Mandlekar i drugi ponovno treniraju iterativno na podacima koje njihov sustav intervencije skuplja, tako da politika uči prelaziti grla, i izvješćuju da agenti trenirani na taj način nadilaze agente trenirane na ekvivalentnom broju primjeraka od ne-intervencionalne demonstrujuće osobe. Sirius ide dalje i ponovno težina uzorke treniranja procijenjenim ljudskim povjerenjem, izvješćujući 8 postotni dobitak u simulaciji i 27 posto na stvarnom hardveru u stopi uspjeha politike protiv metoda koje uspoređuje, na dvostruko bržoj brzini konvergencije. Niti jedan unos za treniranje ovdje izlaže nož za ponovno vaganje uzorka, tako da je grubi zamjena da čuvate svaki epizodu korekcije uz uzorkovanje originalnih demonstracija - i trebate zapisati što ste radili.

Prikaz snimanja skupa podataka koji pokazuje epizode SO-100 skupa podataka s tokovima kamera
Epizodi korekcije su obični epizodi s oznakom intervencije po okviru, tako da se sastavljaju s originalnim skupom podataka bez konverzije.

Korak 6 detaljno: što nastavak od kontrolne točke zaista znači

Treniranje mixa od početnog modela radi ali baca prethodnu rundu i košta cijelu rundu. Nastavak od prethodne kontrolne točke je brži i obično bolje. Također je ograničenije nego što fraza sugeriše.

Inicijalizacija težina nije povratak optimizatora

Kontrolna točka samo-težine sadrži parametre i ništa više. Učitavanje ga daje sljedeću rundu bolji početak nego li početni model, ali momenti optimizatora, pozicija rasporeda brzine učenja i redoslijed podataka svi počinju od nule. Očekujete skok gubitka na početku nastavka rundy, ne čitajte kao neuspjeh, i ne pozivajte rundu kao povratak. To je topla početka.

PolitikaVeličinaGPU razredZaključivanje po koraku akcijeOblik skupa podatakaEpizodi prije nego što je vrijedno pokušavanja
GR00T N1.7oko 3 B, otprilike 40 M trenirano tijekom finog podešavanjaA100 80 GB ili H100 80 GBoko 152 msLeRobot v2.0 ili v2.150
GR00T N1.5oko 3 BA100 80 GB ili H100 80 GBoko 165 msLeRobot v2.0 ili v2.150
Pi0.5oko 3 B na PaliGemma hrbtuA100 80 GB ili H100 80 GBoko 485 msLeRobot v3.050
SmolVLAoko 450 MRTX 4090 ili bilo koja 24 GB karticaoko 245 msLeRobot v3.030
ACToko 80 M, trenirano od nuleRTX 4090 ili bilo koja 24 GB karticaoko 20 msLeRobot v3.050

Latencija se sabira unutar DAgger petlje na način na koji se ne javlja tijekom demoa: s otprilike 485 ms po koraku akcije trebate preuzeti jer je krak oklijevao, ne jer je bio pogrešan, i oklijevanje korekcije nije korisni podatak za treniranje. Ako trebate iterirati na podacima umjesto janjanja konačne stope uspjeha, trebate iterirati na brzom modelu. Shukor i drugi su opisali SmolVLA kao dizajniran za treniranje na jednom GPU-u i razvoj na GPU-ama ili procesorima za potrošače, s asinkrono zaključivanjem stoga koji odvaja predviđanje akcije od izvršavanja kako bi se dopustile veće brzine kontrole - svojstvo koje čuva petlju preuzimanja reaktivnom.

Oblici skupa podataka se međusobno zamjenjivati. GR00T uzima LeRobot v2.0 ili v2.1, i spremište Isaac-GR00T opisuje svoj unos kao okus LeRobot v2 oblika s dodanom datotekom opisa modalnosti; noviji treneri ovdje očekuju v3.0. Mix sastavljen u pogrešnoj verziji ne uspijeva pri učitavanju umjesto proizvodnje loše politike - bolji način neuspjeha, ponovno uništena besplatan red. dokumentacija skupa podataka popisuje koji oblik svaki trener uzima.

Petlja, s odjeljenim knjiženju

Preuzimanje s voditeljem, tipkovnicom ili klizačima; označavanje intervencije po okviru; prikupljanje kao korekcije ili evaluacije; sastavljanje mješovitog skupa podataka s eksplicitnim odabirom epizode po izvoru; i nastavak treniranja od kontrolne točke umjesto početnog modela. Ono što ostaje vaša odluka je koja runda računa kao korekcija, što ulazi u mix, i kada stopa intervencije prestane padati.

Vidjeti kako je DAgger petlja vezana

Četiri načina uništiti rundu

1. Treniranje samo na korekcijama

Najveća greška i najtamnija prečica. Skup podataka samo korekcije je gotovo u cijelosti težak srednji dio zadatka, s prilaskom i povlačenjem koji nedostaje; politika postaje bolja na težom dijelu i zaboravlja kako doći tamo. Agregacija nije detalj implementacije metode, to je mehanizam: stari podaci su ono što čini ostatak ponašanja na mjestu dok korekcije pomičnu jedan dio toga.

2. Premještanje kamere između rundi

Kamera koja se pomakne dva centimetra između rundi stvara politiku lošijom od one s kojom ste počeli, i dijagnostiku koja traje dan. Svaka VLA ovdje je uvjetovana na slike; samo stanje zglobova ne razlikuje gdje je objekt. Fotografirajte postavku prije prve rundy i provjerite tu fotografiju prije svake kasnije.

3. Neuspješno rukovanju artefakte u treniranje

Pokriveno gore, i na popisu jer je nevidljivo. Simptom je politika koja stoji frakciju sekunde točno gdje je operator prethodne rundy preuzeo kontrolu. Izgleda kao oklijevanje; to je imitacija.

4. Pozivanje tople početke kao povratka

Ako vjerujete da je stanje optimizatora prešlo, skok gubitka na početku čita kao greška i trebate tražiti oštećene podatke. Ako znate da je optimizator počeo iznova, skok je očekivan i trebate pogledati što dolazi nakon njega. Isti brojevi, suprotni zaključci.

Mjerenje rundy

Metrika za ljudski-vođenu petlju je stopa intervencije: okviri snimljeni dok ste bili pod kontrolom, podijeljeni s ukupnim okvirima rundy. Nalazi se u stanju preuzimanja, i to je jedini broj koji odgovara na pitanje koje je runda postavila. Gubitak treniranja pada je li li politika poboljšana ili ne; stopa uspjeha je binarna i bučna na veličinama primjeraka koje krak na stolu proizvodi. Stopa intervencije je kontinuirana, mjerena na stanjima koja politika sama uzrokuje, i pada kako manje trebate vas.

Usporedite je samo kroz runde snimljene pod identičnim uvjetima. Cijeli argument, i kako trebate graditi niz evaluacija koji preživi više od dvije rundy, je u članku o mjerenju DAgger petlje. Runda jedan je realno test izvedivosti: trebate provjeriti da preuzimanje radi na vašem hardveru, da korekcije stanu sa svojim zastavama, i da nastavak rundy je naložio kontrolnu točku koju ste trebali. Runde dvije i tri su gdje bi stopa trebala početi pokretati. Ako se nije pokrenula do četvrte rundy, problem je gore u DAgger.

Napišite po rundiZašto je to važno kasnije
Kontrolna točka koja je bila vozanaBez toga ne možete pripisati poboljšanje mixa
Način unosa korišten za preuzimanjeKorekcije putem tipkovnice su grublje od korekcija voditeljskog kraka, i vidi se u podacima
Broj rundi i kako je svaka bila sortiraneIma li runda dovoljno korekcija da stvara razliku
Stopa intervencije po rundi, i prosjekMetrika napretka petlje
Točan odabir epizode po izvoruJedini način da trebate ponovno proizvedite ili poništite rundu
Topla početka ili свежо treniranjeObjašnjava krivulju gubitka koju ćete pogledati u tjednu

Ako trebate nemate kontrolnu točku još

Petlja nema točku unosa bez nje. Snimite prvi skup podataka, trenirajte prvu politiku, pokrenite je - snimanja, treniranja i pokretanja politike pokrivaju tu putanju. Klijent za snimanje je na stranici preuzimanja, GPU razrede i satne stope na stranici cijena, i što izgleda kao iskoristiv epizoda u vodiču za prikupljanje podataka SO-100. Trebate biti pravi demografi prije korekcija: DAgger je mehanizam popravke, i radi daleko bolje na nečem što je bilo gotovo pravo već.

Mogu li trebam pokrenuti DAgger petlju bez voditeljskog kraka?

Da. Odaberite unos putem tipkovnice ili klizača kada trebate pritisnuti Preuzmi: preuzimanje je odmah i ručno, bez drugog kraka za poravnanje. Tipkovnica šalje relativne doditke koji poslužitelj kuća teško na 2 stupnja po zglobu i 4 za hvatač; klizači šalju apsolutni cilj i poslužitelj se kreće najviše 6 stupnjeva prema njemu po pozivu, dok sučelje neprekidno šalje. Stupac akcije i označavanje intervencije su isti kao u modu voditeljskog kraka, tako da su korekcije nerazlučive u skupu podataka.

Koliko korekcija trebam za jednu rundu?

Nema obranog univerzalnog broja, i broj okvira važnije je nego broj epizoda. Radno pravilo je da korekcije ne smiju biti izgubljene u mixa: s 200 originalnih epizoda i tri epizode korekcije, ništa se neće trebati. Trebajte za korekcije koje pokrivaju ponašanje s neuspjehom od nekoliko počinih konfiguracija umjesto tri ponavljanja istog spašavanja.

Zašto je treniranje samo na korekcijama tako loša ideja?

Jer su korekcije gotovo u cijelosti teški srednji dio zadatka. Pristupa, poravnanja i povučenje nedostaju, tako da politika gubi ono što je već dobro radila dok se poboljšava dio koji ste trebali. Čuvanje starih podataka i dodavanje njima je mehanizam sebe, ne opcijski dodatak.

Čini li nastavak od kontrolne točke nove pokretanje prethodnog treniranja?

Ne. Kontrolna točka samo-težine vraća parametre i ništa više: momenti optimizatora, pozicija rasporeda brzine učenja i redoslijed podataka počinju iznova. To je topla početka, i skok gubitka na početku je očekivan umjesto simptoma. Napišite koja od dva ste zaista radili, tako da čitate krivulju ispravno tjedan kasnije.

Što ako stopa intervencije ne pada?

Prestanite trebati rundi. Ravna stopa znači da korekcije nisu učile ono što trebate. Uobičajeni uzroci su gore: kamera se premjestila, korekcije počinju prekasno da budu podaci izbjegavanja, okviri rukovanja su u skupu podataka treniranja, ili zadatak je određen nedovoljan od opažanja koja politika zaista dobija.

Ništa od toga nije riješeni problem i ništa od toga nije jedan klik. Interaktivno učenje imitacijom je aktivno istraživanje jer su njegova pitanja - kada trebate intervenirati, kako trebate vagati što je čovjek radio, koliko starih podataka trebate čuvati - bez settled odgovora; pregled od Celemina i drugih mapira što je još otvoreno. Ono što petlja ima je mjerljiva konvergencija kada je pokrenuta pažljivo, na hardveru koji koštaju nekoliko stotina eura. Trebate zamrznuti postavku, trebate intervenirati rano, trebate sortirajte iskreno, trebate miksate namjerno, i trebate zabilježite stopu intervencije svaki put.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started