
Detalizēts atskaites apraksts par vienu cilvēka kontrolētu DAgger kārtu uz SO-100 rokas: palaidiet politiku un ierakstiet to, pārņemiet, kad tas kļūst nepareizs, iesniedziet palaišanu kā labojumu, salikiet jauktu datu kopu un turpiniet apmācību no kontrolpunkta. Ietver klaviatūras un slīdņa pārņemšanas ceļu cilvēkiem bez vadības rokas, un četras kļūdas, kas padara kārtu bezjēdzīgu.
Jūsu politika darbojas. Tā stiepjas pēc kuba, aizvēr griferiu par centimetru par agru un turpina tā, it kā viņai to būtu. Neko neklaudzina, un neviena apmācības zaudējuma stīgāšana to nepaskaidro. Risinājums nav vēl 20 000 gradienta soļu uz tiem pašiem paraugiem. Tas ir atgriezi rokas tieši uz rokas vietā, kur tas kļūst nepareizs, ieraksti, ko tu darīji tā vietā, un apmāci nākamo kontrolpunktu uz vecajiem datiem plus šo labojumu. Tas ir DAgger kārta, un šis ir tas, kā viens palaist uz SO-100 ar redzamības valodas darbības politiku.
Teorija ir citur: kāpēc datu kopas agregācija vispār darbojas un ko cilvēka kontrole maina par to. Šis ir lietošanas rokasgrāmata, un tā pieņem apmācītu kontrolpunktu, darbojoša kameras komplektu un rokas, kas kustas. Seši soļi zemāk ir cilpa, kā tas tiek īstenots uz šīs platformas DAgger lappusi, bet secība ir vienāda no jūsu pašu skriptiem.
Viena kārta īsumā
- •Palaidiet apmācīto politiku un ierakstiet to ar palaišanas uzdevuma tekstu, nevis vispārīgās tālvadības etiķeti.
- •Pārņemiet brīdī, kad uzvedība kļūst nepareiza: spoguļa ieguļošana ar vadības roku, tūlītēja un manuāla pa klaviatūru vai slīdņiem bez tās.
- •Kategorizējiet katru palaišanu: iesniedziet to kā labojumu, paturējiet to kā vērtēšanas episodi vai izmetiet to.
- •Salikiet jaukt rokas ceļā - oriģinālie demonstrējumi plus labojumi, episodes izvēlētas pa avotiem. Nekad neapmāc tikai labojumos.
- •Turpiniet apmācību no pēdējā kontrolpunkta un norādiet, kurš kontrolpunkts radīja kuru jaukumu.
- •Numurs, kas saka, vai kārta bija nozīmīga, ir intervences likme, nevis apmācības zaudējums.
Kāpēc otrā kārta nav tikai vairāk datu
Uzvedības klonēšana apmāca valstis, kuras cilvēks apmeklēja. Pārbaudīšanas laikā politika apmeklē valstis, ko tā izraisa, un nelieli darbības kļūdas saplūst valstīs, ko neviens demonstrējums nesegtā. Ross, Gordon un Bagnell formalizēja šo kļūmi AISTATS 2011 un atbildēja ar iteratīvu algoritmu, kas apmāca stacionāru deterministisku politiku un, saskaņā ar to samazināšanu, ir jāveic labi valsts sadalījumā, ko tā izraisa: palaist pašreizējo politiku, ekspertam ir jāmarķē valstis, ko tā faktiski sasniedza, pievienojiet tos datu kopai, pālaist, atkārtojiet. Kelly et al. padarīja vaicājumu praktisku ar HG-DAgger, kur cilvēks nolemj, kad pārņemt vadību, nevis marķēt valstis bez vadības turēšanas; viņi ziņo par uzlabotu veiktspēju salīdzinājumā ar DAgger un uzvedības klonēšanu simulētā un reālā automātiski vadītas braukšanas uzdevumā. Cilvēka kontrole ir tas, kas padara cilpu pieņemamu uz galda rokas - jūs pārvietojat rokas tikai tad, kad kaut kas kļūst nepareizs.
Divas sekas svarīgākas praksē nekā teorija. Labojumi nav parastie demonstrējumi: viņi koncentrējas pie šaurajām vietām, ko Mandlekar et al. apraksta, kur neliela novirze nometā politiku valstīs, ko demonstrējumi nekad nesegja. Un datu kopa, kas izgatavota tikai no šīm grūtajām daļām, ir nepareizi formēta datu kopa - Belkhale, Cui un Sadigh apgalvo no datu sāniem, ka valsts daudzveidība ne vienmēr ir noderīga, un ka darbības novirze un pārejas daudzveidība kopā nolemj datu kopas kvalitāti. Jauktā datu kopa nav kompromiss, tā ir punkts.
Iesaldējiet tos pirms pirmās kārtas
DAgger kārta salīdzina politiku ar sevi laika gaitā. Jebkas, ko tu mainīsi starp kārtām, kas nav datu kopa, padara šo salīdzinājumu jēgpilnu.
- Kameras pozīcijas un montāžas, ieskaitant nīstas kameru. Atbrīvojiet vienu stieņu un jūs mainījāt novērošanas sadalījumu, nevis politiku.
- Ekspozīcija un balanss, ja jūsu fiksācijas kaudze to ļauj piefiksēt. Automātiskās ekspozīcijas novirzīšanās starp kārtām ir lēna, neredzama domēna novirze.
- Rokas kalibrēšana un servomotora nulles pozīcijas. Ja jums ir jāveic kalibrēšana, apskatiet visu, kas tika ierakstīts pirms tā, kā atsevišķu datu kopu.
- Uzdevuma teksts. Katrs VLA šeit atkarīgs no tā; tā pārfrāzēšana vidus cilpā ir atšķirīgs uzdevums.
- Apgaismojums, galda virsma, objektu kopa. Jauns objekts ir jauns eksperiments, nevis nākamā kārta.
- Ierakstīšanas kadru ātrums. Intervences likmju salīdzināšana divos paraugu režģos rada atšķirības, kas nāk no režģa.
Hsu et al. salīdzināja rokas-centrālo skatu ar parastā trešās personas skatu un atrada aci-rokas perspektīvu konsekventi uzlaboja apmācības efektivitāti un ārpus-sadalījuma vispārinājumu, neskatoties uz mazāku skaņu. Piecas savienojuma rokā, grifera laiks parasti ir tas, ko tu savos labojumos labojumi, un grifera laiks ir tas, ko nīstas skats nosa.
Kārta no gala uz galu
- 1Palaidiet secinājumus un ierakstiet to
Sāciet palaišanu pret kontrolpunktu, kuru vēlaties uzlabot, tad sāciet ierakstīšanu secinājumu saknē. Ierakstīts šādā veidā tas pārmanto palaišanas sava uzdevuma tekstu, kas ir tas, uz ko politika tika apmācīta, nevis noklusējuma tālvadības etiķeti. Bez ierakstīšanas jūs varat redzēt kļūmi, bet to nevar apmācīties.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Pārņemiet, kad tas kļūst nepareizs
Nospiediet Pārņemšana un izvēlieties ievades režīmu: vadības roka, klaviatūra vai slīdņi. Skrējējs pauzē, tu laboji, tu nododi atpakaļ. Kadri, kas tika ierakstīti, kamēr tu brauc, ir automātiski atzīmēti kā intervences.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Kategorizējiet episodes
Nolemt par katra episodi: iesniegt kā labojums, paturēt kā vērtēšanu, vai atmest. Palaišana, ko politika pabeidza bez palīdzības, ir vērtēšanas dati.
- 4Sinhronizējiet labojuma datu kopu
Labojumi tiek savākti vietējā datu kopā uz politiku un nonāk mākoņa krātuves caur automātisko sinhronizāciju. Neko nav jaukts, ko tu neesi ievietojis.
- 5Salikiet jaukto datu kopu
Apvienojiet oriģinālo datu kopu ar labojuma datu kopu, nepārprotami izvēloties episodes uz avota. Rezultāts ir parasta datu kopa no tā punkta uz turpmāk.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Turpiniet apmācību no kontrolpunkta
Apmāci jaukumu no iepriekšējā kontrolpunkta, nevis no bāzes modeļa. Norādiet, kurš kontrolpunkts un kurš jaukums; bez šī pāra kārta nav reproducējama.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
2. solis detalizēti: divi pārņemšanas veidi
Ar vadības roku
Iekšā vadības sekotājs režīmā pārņemšana ir ieguļošana starp divām rokām, kas nav vienāda pozā. Nospiediet Pārņemšana pauzē skrējēju un vadā vadības vadību uz sekotāja pašreizējās pozas, tāpēc neko nemēdz, kad griezes moment tiek pārnests. Ja šī izlīdzināšanas braukšana iztūkst, tu izlīdzini vadības vadību ar roku un atbrīvo tikai tad, kad abi ir piecu grādu robežās. No tā brīža uz turpmāk jūs tālvadības vadības normāli un darbības kolonna ieraksta, ko jūs komandējāt.
Būt godīgs par šo ceļu: izlīdzināšanas braukšana un griezes momenta ieguļošana ir vismazāk pārbaudītā cilpas daļa uz reālas aparatūras. Testējiet ieguļošanu lēnā, nekaitīgā pozā, pirms paļaujaties uz to palaišanā, par kuru jūs rūpējaties. Vadības roka rada gludākos labojumus no trim režīmiem un arī visvairāk, kas var kļūt nepareizi mehāniski.
Bez vadības rokas: klaviatūra un slīdņi
Lielākā daļa cilvēku, kas to lasa, pieder vienai rokai. Pietiek. Izvēlieties klaviatūras vai slīdņa ievadi brīdī, kad nospiediet Pārņemšana, un pārņemšana ir tūlītēja un manuāla - nav otrās rokas, kuru izlīdzināt, tāpēc nav izlīdzināšanas soļa. Sekotājs turpina savu pozīciju un gaida ievadi.
| Ievades režīms | Kā roka kustas | Per-call ierobežojums, ko izmanto serveris | Bloķēts, kad |
|---|---|---|---|
| Vadības roka | Spogulis vadības sekotāju no vadības savienojuma leņķiem | Bez pīķa vai iestata zvanu šajā režīmā; spogulis raksta sekotāja mērķus nepārtraukti | Nekad nav bloķēts, un tas ir noklusējums, ja nav dota ievades režīma - bet tas ir jāpieciešama otrā roka; bez vadības identifikatora pārņemšana tiek atteikta |
| Klaviatūra | Relatīvs brīdinājums katram pogas nospiešanai, sūtīts uz pārņemšanas brīdinājuma galapunktu | Cietā spiegošana 2 grādu leņķī uz savienojumu, 4 grādu griferim | Atteikts ar 409, ja pārņemšana tika sākta vadības režīmā |
| Slīdņi | Absolūts mērķa stāvoklis, sūtīts uz pārņemšanas iestata galapunktu | Visvairāk 6 grādu ceļojums uz mērķi uz zvanu; saskarne turpina sūtīt apmēram desmit reizes sekundē | Atteikts ar 409, ja pārņemšana tika sākta vadības režīmā |
Spiegošana tiek pieprasīta serverī, nevis saskarnē, jo nepareiza delta uz kopnes servomotora rokas ir sadursme. Klaviatūras labojumi nāk pakāpeniski un nedaudz rupji; slīdņu labojumi ir gludāki, jo serveris pastaigājas pret mērķi, kamēr skaņa turpina straumi. Jebkurā gadījumā darbības kolonna saņem pilnu komandēto pozīciju vektoru un intervences atzīmēšana ir identiska vadības ceļam, tāpēc klaviatūras labojumi nonāk tajā pašā datu kopā bez formāta atšķirības.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Kad nospiest pogu
Agri, nevis vēlu. Labojums, kas sākas pēc tam, kad grifērs ir aizvērts uz neko, māca atveseļošanu no kļūmes, ko politika nebūtu jāiespiež, un atveseļošanas dati ir vērts daudz mazāk nekā izvairīšanās dati. Pārraugi brīdī, kad esi pārliecināts, ka trajektorija ir nepareiza, laboji caur grūto daļu, nodod atpakaļ, tiklīdz stāvoklis ir viens, ko politika jau apstrādāja. ThriftyDAgger automatizē šo lēmumu, vārtējot iejaukšanās par novelty un aprēķināto risku ar fiksētu cilvēka budžetu, bet uz vienas rokas ar cilvēku jau skatošo, cilvēka vārti ir lētāks un labāk kalibrēts nekā jebkas, ko tu nolamāsi.
Iespējams ar atvērtā koda kaudzi un dažiem skriptiem. Tas, ko tas maksā, ir grāmatvedība, un grāmatvedība ir vieta, kur DAgger kārtas mirst.
- Rakstiet kadrus no jūsu paša secinājumu skriptu LeRobot datu kopā, ar uzdevuma virkni, uz ko politika tika apmācīta.
- Pauzējiet politikas cilpu, pārslēdziet komandas avotu un atzīmējiet katru kadru, ko brauc kā intervenci. Bez karoga, labojumi izskatās kā parastie demonstrējumi.
- Apzinīgi nolemt, kas notiek ar pārejas kadriem starp politikas vadības izlaišanu un jūsu pirmo ievadi.
- Glabājiet labojumus savā datu kopā uz politiku un izsekojiet episodu indeksus ar roku, tāpēc jaukums var tikt rekonstruēts.
- Norādiet pielāgošanas ievades punktu uz iepriekšējo kontrolpunktu un pārbaudiet žurnālā, ka tas ielādēja šos svarus.
Tie paši seši soļi pastāv kā pogas. Tas, kas tiek automatizēts, ir tas, kas ir viegli kļūdīties ar roku: per-frame intervences karogs, sadalījums starp labojumiem un vērtēšanām, un kontrolpunkta un jaukuma skaņa. Nekas nejāc salikts datu kopā, kuru tu neesi izvēlējies.
Tā nelemj par tevi. Kura palaišana uzskaita kā labojums, kuras episodes iet jaukumā, un kad intervences likme ir pārstājusi krīt, paliek sprieduma zvani. Lauki ir dokumentēti zem apmācības, ievades režīmi zem tālvadības.
3. solis detalizēti: triage lemj par kvalitāti
Pēc palaišanas jums ir ieraksts ar dažiem kadriem, kas atzīmēti kā intervences. Pastāv trīs galamērķi, un nepareizais klusi saindē nākamo kārtu.
- Iesniedziet kā labojums, kad intervence bija īsts labojums: politika bija virzās kaut kur nepareizs un jūsu ievade parādīja pareizo lietu no stāvokļa, ko paša politika izraisīja.
- Paturējiet kā vērtēšanu tīriem autonomiem palaišanām un palaišanām, kuras paņēmāt pāri piesardzībai. Vērtēšanas episodes ir tas, kā jūs mēra nākamo kontrolpunktu, un viņi nekad nedrīkst tikt apmācīti.
- Izmetiet palaišanas, ko saslimis ar kaut ko nesaistītu - noraidītu kameras kadru, stāvējušu servomotoru, objektu, kuru jūs iespēlējāt. Nekārtīgs labojums ir sliktāks nekā bez labojuma.
Starp politikas vadības izlaišanu un jūsu pirmo ievadi, roka turpina stāvēt, bet ierakstītājs turpina rakstīt - identiskas pozas sērija, kas pārī ar nedaudz atšķirīgiem attēliem. Šeit šie ieguļošanas kadri paliek neapstrādātā ierakstā un ārpus labojuma datu kopas. Ja jūs būvējat cilpu sevi, izgrieziet tos apzināti: politika, kas apmācīta uz tiem, māca pauzēt, kur tā būtu jādarbojas.
5. solis detalizēti: jaukuma komponēšana
Komponēšana ņem oriģinālo datu kopu plus labojuma datu kopu un rada jaunu, parasto LeRobot datu kopu kas apmāca, kā jebkura cita. Svarīgā īpašība ir tā, ka episodu atlase ir nepārprotama uz avota - neko nav automātiski jaukts. Tas izklausās mazāk nozīmīgi, līdz pirmajam reizējam politika izskatās dīvaini un jums ir jārekonstruē, uz ko tā tika apmācīta.
Atvērtais jautājums ir attiecība, un nevienam nav numura, kas pārnests. Tas, ko literatūra piekrīt, ir tas, ka labojumi jāskaita par vairāk nekā to kadru daļa. Mandlekar et al. pālaist iteratīvi uz datiem, kurus to iejaukšanas sistēma savāc, tāpēc politika māca šķērsot šauros grīdas, un ziņo, ka aģenti, kas apmācīti šādā veidā, pārspēj aģentus, kas apmācīti uz līdzvērtīgu paraugu skaita no ne-intervences demonstratoru. Sirius iet tālāk un pārsverot apmācības paraugus ar aprēķinātu cilvēka uzticību, ziņojot par 8 procentu pieaugumu simulācijā un 27 procentu reālā aparatūrā politikas panākumu likmi pret metodēm, ar ko tā salīdzina, divas reizes ātrāku konverģenci. Neviena no apmācības ievades punktiem, kas šeit ir iekļauti, neatklāj parauga-svēršanas pogu, tāpēc kruda aizstāvēšana ir paturēt katru labojuma episodi, kamēr subsample oriģinālajiem demonstrācijiem - un rakstīt uz to, ko jūs darījāt.

6. solis detalizēti: ko turpināšana no kontrolpunkta patiesi nozīmē
Apmācības jaukums no bāzes modeļa darbojas, bet izmeta iepriekšējo kārtu un maksā pilnu palaišanu. Turpinājums no iepriekšējā kontrolpunkta ir ātrāks un parasti labāks. Tas ir arī ierobežotāks nekā frāze iesaka.
Tikai svaru kontrolpunkts satur parametrus un neko citu. Tās ielāde nākamajam palaišanai dod labāku sākuma punktu nekā bāzes modelis, bet optimizatora momenti, mācības ātruma grafika pozīcija un datu kārtība visi sākas no nulles. Parasti pagaidā zaudējuma šūpuļus palaišanas sākumā, neleciājiet to kā neveiksme, un nelieciet cilpu atsākšanu. Tas ir silts sākums.
| Politika | Lielums | GPU līmenis | Secinājumi uz darbības soli | Datu kopas formāts | Episodes pirms tam, kamēr tas ir vērts mēģināt |
|---|---|---|---|---|---|
| GR00T N1.7 | apmēram 3 B, aptuveni 40 M apmācīta pielāgošanas laikā | A100 80 GB vai H100 80 GB | apmēram 152 ms | LeRobot v2.0 vai v2.1 | 50 |
| GR00T N1.5 | apmēram 3 B | A100 80 GB vai H100 80 GB | apmēram 165 ms | LeRobot v2.0 vai v2.1 | 50 |
| Pi0.5 | apmēram 3 B uz PaliGemma mugurkauliem | A100 80 GB vai H100 80 GB | apmēram 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | apmēram 450 M | RTX 4090 vai jebkura 24 GB karti | apmēram 245 ms | LeRobot v3.0 | 30 |
| ACT | apmēram 80 M, apmācīts no nulles | RTX 4090 vai jebkura 24 GB karti | apmēram 20 ms | LeRobot v3.0 | 50 |
Latence saplūst DAgger cilpā tā, kā tā nedarbojas demonstrācijas laikā: aptuveni 485 ms uz darbības soļa jūs pārņemat, jo roka vilcinājās, nevis jo tā bija nepareiza, un vilcinājumu labojumi nav noderīgs apmācības dati. Ja jūs atkārtojat datus, nevis ejat uz gala panākumu likmi, atkārtojiet uz ātra modeļa. Shukor et al. apraksta SmolVLA kā noformēts, lai apmācītos uz vienas GPU un uzstādītu uz patērētāju GPU vai CPU, ar asinhron secinājumu kaudzi, kas atdala darbības prognozi no izpildes, lai ļautu augstākas kontroles likmes - īpašums, kas turpina ieguļošanas cilpu atsaucīgu.
Datu kopas formāti nav aizstājami. GR00T ņem LeRobot v2.0 vai v2.1, un Isaac-GR00T repozitorijs apraksta tā ievadi kā LeRobot v2 formāta gaumi ar pievienotu modalitātes apraksta datni; jaunākie treneri šeit sagaida v3.0. Jaukums, kas salikts nepareizā versijā, neizdodas pie ielādes laika, nevis radot nepareizu politiku - labākā neveiksmes režīma, joprojām izsmiestā rindā spailes. Šis datu kopas dokumentācija norāda, kurš formāts katrs trenēšanas vērtnieks ņem.
Cilpa, ar grāmatvedību jau veiktu
Ieguļošana ar vadības roku, klaviatūru vai slīdņiem; per-frame intervences marķēšana; failu palaišana kā labojumi vai vērtēšanas; jauktas datu kopas komponēšana ar skaidru episodu atlasi uz avota; un turpinājums apmācību no kontrolpunkta, nevis bāzes modeļa. Tas, kas paliek jūsu lēmumiem, ir kura palaišana skaita kā labojums, kas iet jaukumā, un kad intervences likme ir pārstājusi krīt.
Skatieties, kā DAgger cilpa ir pievienotaČetri veidi, kā izkāraut kārtu
1. Apmācība tikai labojumos
Visbiežākā neveiksme un pielāgošanas sadusmojums. Tikai labojuma datu kopa ir gandrīz pilnībā uzdevuma grūtā vidus daļa, ar tuvinājumu un atsaiti pazudusi; politika kļūst labāka grūtā daļa un aizmirst, kā tur nonākt. Agregācija nav metodes detaļa, tā ir mehānisms: vecais dati ir tas, kas turpina atpūtu uzvedību vietā, kamēr labojumi pārvietojas viena daļa.
2. Kameras pārvietošana starp kārtām
Kamera, kas novirzās divi centimetri starp kārtām, rada politiku sliktāku nekā tā, ar ko tu sāki, un diagnozi, kas maksā dienu. Katrs VLA šeit atkarīgs no attēliem; savienojuma stāvoklis vienatnē neatšķir, kur objekts atrodas. Fotografējiet iestatījumu pirms pirmās kārtas un pārbaudiet šo fotogrāfiju pirms katra vēlākā.
3. Ļaušanas ieguļošanas artefaktiem apmācības datiem
Iepriekš apskatīts un uz saraksta, jo tas ir neredzams. Simptoms ir politika, kas apstājas daļas sekundē tieši tur, kur iepriekšējās kārtas operators pārņēma. Tas izskatās kā vilcinājums; tas ir imitācija.
4. Silta sākuma izsaukšana kā atsākšana
Ja ticēsiet, ka optimizatora stāvoklis pārnests, sākotnējais zaudējuma kritiens lasa kā kļūme un jūs dodaties meklējumā pēc bojātas datas. Ja jūs zināt, ka optimizators sāka svaigi, kritiens ir paredzēts un jūs skatāties, kas nāk pēc tā. Tādi paši skaitļi, pretēji secinājumi.
Kārtas mērīšana
Metrika cilvēka kontrolētai cilpai ir intervences likme: kadri, kas tika ierakstīti, kamēr tu biji vadībā, dalīti ar kopējiem palaišanas kadriem. Tas ir ieguļošanas stāvoklī, un tas ir vienīgais numurs, kas atbild uz jautājumu, ko kārta jautāja. Apmācības zaudējums krīt, neatkarīgi no tā, vai politika uzlabojās; panākumu likme ir binārā un troksnaina vidējā rīkojuma lielumā, ko galda roka ražo. Intervences likme ir nepārtraukta, mērīta uz stāvokļiem, ko paša politika izraisīja, un tas krīt, jo politika jums mazāk vajag.
Salīdziniet to tikai palaišanās, kas ierakstītas identiskos apstākļos. Pilnā argumentācija un kā uzbūvēt vērtēšanas kopu, kas pārdzīvo vairāk nekā divas kārtas, ir rakstā par DAgger cilpas mērīšanu. Pirmā kārta ir reālistiski iespējamības pārbaude: jūs pārbaudāt, ka ieguļošana darbojas uz jūsu aparatūras, ka labojumi nonāk ar to karogiem un ka turpinātā palaišana ielādēja kontrolpunktu, ko nosaucāt. Otrā un trešā kārta ir vieta, kur likme sāk pārvietoties. Ja tā nav pārvietojas pēc ceturtās kārtas, problēma ir DAgger augstāko.
| Rakstiet uz kārtas | Kāpēc tas svarīgi vēlāk |
|---|---|
| Kontrolpunkts, kas tika brauts | Bez tā jūs nevarat attiecināt uzlabojuma uz jaukumu |
| Ievades režīms, ko izmanto ieguļošanai | Klaviatūras labojumi ir rupjāki nekā vadības labojumi, un tas ir redzams datos |
| Palaišanu skaits un kā katrs tika triage | Vai kārtai bija pietiekami labojumu, lai tas svarīgi |
| Intervences likme uz palaišanu un vidējā | Cilpas progresa metrika |
| Precīza episodu atlase uz avota | Vienīgais veids, kā reproducēt vai atsaukt kārtu |
| Silts sākums vai jauna apmācība | Paskaidro zaudējuma līkni, ko tu redzēsi nedēļas pēc tam |
Ja jums vēl nav kontrolpunkta
Cilpa nav ievades punkta bez tā. Ierakstiet pirmo datu kopu, apmāciet pirmo politiku, palaistiet to - ierakstīšana, apmācība un politikas palaišana segt šo ceļu. Ierakstīšanas klients ir uz lejupielādes lapas, GPU līmeņi un stundas likmes uz cenu lapas, un kā izmantojama episodi izskatās SO-100 datu vākšanas vadītājs. Iegūstiet demonstrācijas pareizas pirms labojumiem: DAgger ir remonta mehānisms, un tas darbojas daudz labāk uz kaut ko, kas jau bija gandrīz pareizs.
Vai es varu palaist DAgger cilpu bez vadības rokas?▾
Jā. Izvēlieties klaviatūras vai slīdņa ievadi, kad nospiediet Pārņemšana: pārņemšana ir tūlītēja un manuāla, bez otrās rokas, kuru izlīdzināt. Klaviatūra sūta relatīvus brīdinājumus, ko serveris stingri spiež 2 grādu leņķī uz savienojumu un 4 griferim; slīdņi sūta absolūto mērķi un serveris pārvietojas visvairāk 6 grādu uz mērķi uz zvanu, kamēr skaņa turpina straumi. Darbības kolonna un intervences marķēšana ir tādi paši kā vadības režīmā, tāpēc labojumi ir neatšķirami datu kopā.
Cik labojumi vienai kārtai ir nepieciešami?▾
Nav aizstāvamas universālas numura, un kadru skaitlis ir svarīgāks nekā episodu skaitlis. Darba noteikums ir tas, ka labojumi nedrīkst pazust jaukumā: ar 200 oriģinālajām episodēm un trim labojuma episodēm neieks neieks. Mērķis labojumiem, kas segs nepareizo uzvedību no dažādām sākuma konfigurācijām, nevis trīs vienas un tās pašas glābšanas atkārtojumi.
Kāpēc apmācība tikai labojumos ir tik slikta ideja?▾
Jo labojumi ir gandrīz pilnībā uzdevuma grūtā vidus daļa. Tuvinājums, izlīdzināšana un atsaite ir pazudusi, tāpēc politika zaudē, ko tā jau ieguva labi, uzlabojot daļu, kuru tu nolaboji. Veca datu paturēšana un pievienošana ir mehānisms pats, nevis neobligāts papildinājums.
Vai turpināšana no kontrolpunkta atsāk iepriekšējo apmācības palaišanu?▾
Nē. Tikai svaru kontrolpunkts atjaunina parametrus un neko citu: optimizatora momenti, mācības ātruma grafika pozīcija un datu kārtība sākas svaigi. Tas ir silts sākums, un sākotnējais zaudējuma kritiens ir paredzēts, nevis simptoms. Rakstiet uz to, kurš no abiem jūs faktiski darījāt, tāpēc jūs lasāt līkni pareizi nedēļas pēc tam.
Kas notiek, ja intervences likme neparādās?▾
Pārstājiet pievienot kārtas. Plakana likme nozīmē, ka labojumi nemāca, ko tu domā. Parastie cēloņi ir augstāko: kamera pārvietojās, labojumi sākas par vēlu, lai būtu izvairīšanās dati, ieguļošanas kadri ir apmācības kopā, vai uzdevums ir nepārdefinēts no novērojumiem, ko politika faktiski iegūst.
Neviens no šiem nav atrisināta problēma un neviens no tiem nav viens klikskis. Interaktīvā imitācijas mācīšanās ir aktīva pētniecības joma tieši tāpēc, ka tās jautājumi - kad iejaukties, kā nosvērt, ko cilvēks darīja, cik daudz veca datu paturēt - nav nolemtas atbildes; apsekojums Celemin et al. kartē, kas joprojām ir atvērts. Tas, kas cilpai ir, ir mērāma konverģence, ja tā tiek palaista uzmanīgi, uz aparatūras, kas maksā dažus simtus eiro. Iesaldējiet iestatījumu, iejaucitēs agri, triage godīgi, jaukiet apzināti un ierakstiet intervences likmi katru reizi.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started