Nízkonákladové robotické rameno SO-100 na stole, nastavené pro teleoperaci a trénování strategií
DAggerSO-100Imitation LearningVLATeleoperation

Spuštění DAgger cyklu na SO-100 s VLA strategií

AY-Robots ResearchAugust 27, 202615 min čtení

Podrobný popis jednoho kola human-gated DAgger na rameni SO-100: spusťte strategii a zaznamenávejte ji, převezměte ji, když selže, archivujte běh jako opravu, skládejte smíšenou datovou sadu a pokračujte v trénování z checkpointu. Zahrnuje cestu převzetí přes klávesnici a posuvníky pro lidi bez vedoucího ramene a čtyři chyby, které činí kolo zbytečným.

Vaše strategie běží. Dosáhne krychle, zavře úchop centimetr příliš brzy a pokračuje, jako by ji měla. Nic se nejedna, a žádné studium trénovací ztráty to nevysvětluje. Řešení není dalších 20 000 gradient kroků na stejných demonstracích. Je to vrátit si ruku zpět na rameno přesně tam, kde selže, zaznamenat, co jste udělali místo toho, a trénovat další checkpoint na starých datech plus na té opravě. To je DAgger kolo, a tímto je způsob, jak jej spustit na SO-100 se strategií vision-language-action.

Teorie je jinde: proč vůbec funguje agregace datových sad a co human gating změní na tom. Toto je operační manuál a předpokládá trénovaný checkpoint, fungující sadu kamer a rameno, které se pohybuje. Šest kroků níže je cyklus, jak je implementován na DAgger stránku této platformy, ale posloupnost je stejná z vašich vlastních skriptů.

Jedno kolo ve zkratce

  • Spusťte trénovanou strategii a zaznamenávejte ji s textovým popisem úkolu spuštění, nikoli s generickým popisem teleoperace.
  • Převezměte v okamžiku, kdy se chování špatně mění: zrcadlový handover s vedoucím ramenem, okamžitý a ruční přes klávesnici nebo posuvníky bez něj.
  • Třídění každého běhu: archivujte jej jako opravu, ponechte jej jako evaluační epizodu, nebo jej zahoďte.
  • Skládejte mix ručně - původní demonstrace plus opravy, epizody zvolené podle zdroje. Nikdy netrénujte pouze na opravách.
  • Pokračujte v trénování z posledního checkpointu a poznamenejte si, který checkpoint vyprodukoval který mix.
  • Číslo, které říká, zda mělo kolo jakou cenu, je intervention rate, ne trénovací ztráta.

Proč druhé kolo není jen více dat

Behavior cloning trénuje na stavech, které lidé navštívili. V testovací době strategie navštěvuje stavy, které způsobuje, a malé chyby akcí se skládají do stavů, které žádná demonstrace nepokryla. Ross, Gordon a Bagnell formalizovali toto selhání pro AISTATS 2011 a odpověděli iterativním algoritmem, který trénuje stacionární deterministickou strategii a, pod jejich redukcí, musí dosahovat dobré výkonnosti pod distribucí stavů, kterou vyvolává: spusťte aktuální strategii, nechte experta označit stavy, které skutečně dosáhla, přidejte je do datové sady, přetrénujte, opakujte. Kelly et al. učinili dotaz praktickým s HG-DAgger, kde se lidé rozhodují, kdy převzít kontrolu místo označování stavů bez držení ovladačů; hlásí zlepšenou výkonnost oproti DAgger i behavior cloning na simulované i reálné úloze autonomního řízení. Human gating je to, co činí cyklus na stolním rameni snesitelným - posunete ruce jen když se něco špatně mění.

Dvě důsledky mají v praxi větší důležitost než teorie. Opravy nejsou běžné demonstrace: soustředují se na kritické oblasti, které Mandlekar et al. popisují, kde malá odchylka strčí strategii do stavů, které demonstrace nikdy nepokryly. A datová sada vytvořená pouze z těchto těžkých částí je špatně tvarovaná datová sada - Belkhale, Cui a Sadigh argumentují ze strany dat, že rozmanitost stavů není vždy přínosná, a že divergence akcí a diverzita přechodů dohromady rozhodují kvalitu datové sady. Smíšená datová sada není kompromis, je to smysl.

Zamrazte to před prvním kolem

DAgger kolo porovnává strategii sama se sebou v čase. Cokoli, co změníte mezi koly, co není datová sada, činí to srovnání nesmyslným.

  • Pozice kamer a montáže, včetně kamery na zápěstí. Uvolněte jeden spoj a změnili jste distribuci pozorování, ne strategii.
  • Expozice a balanci bílé, pokud vám to vaše capture stack umožňuje. Drift auto-expozice mezi koly je pomalá, neviditelná změna domény.
  • Kalibrace ramene a pozice servo-nuly. Pokud musíte znovu kalibrovat, považujte vše zaznamenané před tím za oddělený datový soubor.
  • Text úkolu. Každá VLA zde se podmiňuje na něm; přeformulování uprostřed cyklu je jiný úkol.
  • Osvětlení, povrch stolu, sada objektů. Nový objekt je nový experiment, ne další kolo.
  • Frekvence snímání nahrávání. Porovnávání intervention rates across dvě vzorkovací rastry vytváří rozdíly, které pocházejí z rastru.
Kamera na zápěstí není volitelný nábytek

Hsu et al. porovnali pohled zaměřený na ruku s obvyklým třetí-osobovým pohledem a zjistili, že perspektiva eye-in-hand konzistentně zlepšila efektivitu trénování a zevšeobecnění mimo distribuci, navzdory vidění menší části scény. Na pěti-kloubovém rameni je načasování griprru obvykle to, co opravujete ve svých opravách, a načasování griprru je to, co nese pohled z zápěstí.

Kolo, od konce ke konci

  1. 1
    Spusťte inferenci a zaznamenávejte ji

    Spusťte běh proti checkpointu, který chcete zlepšit, pak spusťte nahrávání do kořene inference. Zaznamenáno tímto způsobem dědí vlastní textový popis úkolu běhu, což je to, na čem byla strategie trénována, místo výchozího popisku teleoperace. Bez nahrávky si můžete prohlédnout selhání, ale nemůžete na něm trénovat.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Převezměte, když se to špatně mění

    Stiskněte Převzetí a vyberte režim vstupu: vedoucí rameno, klávesnice nebo posuvníky. Runner se pozastaví, vy opravíte, vrátíte. Snímky zaznamenané během vaší jízdy jsou automaticky označeny jako intervence.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Třídění epizod

    Rozhodněte per epizodu: archivujte jako opravu, ponechte jako evaluaci, nebo zahoďte. Běh, který strategie dokončila bez pomoci, jsou evaluační data.

  4. 4
    Synchronizace opravy datové sady

    Opravy se shromažďují v místní datové sadě per strategii a jdou do cloud storage prostřednictvím automatické synchronizace. Nic se do toho nemíchá, co jste si tam nedali.

  5. 5
    Skládejte smíšenou datovou sadu

    Kombinujte původní datový soubor s opravou datové sady, výběrem epizod explicitně per zdroj. Výsledek je běžný datový soubor od té chvíle.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Pokračujte v trénování z checkpointu

    Trénujte mix z předchozího checkpointu místo základního modelu. Poznamenejte si, který checkpoint a který mix; bez tohoto páru není kolo reprodukovatelné.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Krok 2 podrobně: dva způsoby, jak převzít

S vedoucím ramenem

V leader-follower režimu je handover mezi dvěma rameny, která nejsou ve stejné poloze. Stisknutí Převzetí pozastaví runner a vede vedoucího do aktuální polohy followers, takže nic neskočí, když se moment přenáší. Pokud tato zarovnávací jednotka vypršet, srovnáte vedoucího ručně a uvolníte pouze, když jsou oba v pěti stupních. Od té chvíle se teleoperujete normálně a sloupec akcí zaznamenává to, co jste příkazoval.

Buďte čestní o této cestě: zarovnávací jednotka a transfer momenty jsou nejméně testovanou částí cyklu na reálném hardwaru. Otestujte handover na pomalé, neškodné poloze, než se na něm spolehnete v běhu, kterému záleží. Vedoucí rameno vytváří nejhladší opravy ze tří režimů a má také nejvíce, co se může pokazit mechanicky.

Bez vedoucího ramene: klávesnice a posuvníky

Většina lidí čtoucích to vlastní jedno rameno. To stačí. Vyberte si vstup klávesnice nebo posuvníku v okamžiku, kdy stisknete Převzetí, a handover je okamžitý a ruční - neexistuje druhé rameno k srovnání, takže není krok zarovnání. Follower drží svou polohu a čeká na vstup.

Režim vstupuJak se rameno pohybujeOmezení na volání vynucené serveremUzavřeno když
Vedoucí ramenoZrcadlo řídí followers z úhlů kloubů vedoucíhoBez nudge nebo set volání v tomto režimu; zrcadlo piše cíle followers kontinuálněNikdy uzavřeno, a výchozí, pokud není uveden žádný režim vstupu - ale potřebuje druhé rameno; bez id vedoucího je handover odmítnut
KlávesniceRelativní nudge per stisk klávesy, poslán na endpoin nudge teleoperaceTvrdé omezení na 2 stupně per kloub, 4 stupně pro gripperOdmítnut s 409, pokud byl handover zahájen v režimu vedoucího
PosuvníkyAbsolutní cílová poloha, poslán na endpoint set teleoperaceNejvíce 6 stupňů cestování k cíli per volání; rozhraní posílá asi desetkrát za sekunduOdmítnut s 409, pokud byl handover zahájen v režimu vedoucího

Omezení jsou vynucena na straně serveru, ne v rozhraní, protože chybně napsaná delta na rameni bus-servo je kolize. Opravy klávesnice vypadají po krocích a mírně hrubě; opravy posuvníky jsou hladší, protože server kráčí k cíli, zatímco rozhraní stále vysílá. Tak či onak sloupec akcí přijímá úplný příkazovaný vektor polohy a označení intervence je totožné s cestou vedoucího, takže opravy klávesnice přistávají ve stejné datové sadě bez rozdílu formátu.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Stejné rozložení kláves jako všude jinde v stacku, takže svalová paměť ze záznamu se přenáší.
Průvodce trénováním zobrazující seřazené kroky běhu GR00T fine-tuning na datové sadě SO-100
Část trénování kola je stejná vedená posloupnost jako první běh; pouze se liší pole checkpointu.

Kdy stisknout tlačítko

Dříve spíše než později. Oprava, která začíná poté, co gripper zavře nic, učí obnovu z selhání, do kterého by strategie neměla vstoupit, a data obnovy stojí daleko méně než data vyhýbání. Přerušte v prvním okamžiku, kdy jste si jisti, že je trajektorie špatná, opravte skrze obtížnou část, vrátíte se hned, když je stav ten, který strategie zvládla. ThriftyDAgger automatizuje toto rozhodnutí bráním intervencí na novotě a odhadovaném riziku pod pevným rozpočtem lidí, ale na jednom rameni s člověkem již hlídajícím je lidská brána levnější a lépe kalibrovaná než cokoli, co budete ladit.

Možné s open-source stackem a několika skripty. Co to stojí, je vedení zápisů, a vedení zápisů je tam, kde DAgger kola umírají.

  1. Napište snímky z vlastního skriptu inference do datové sady LeRobot, s textovým řetězcem úkolu, na kterém byla strategie trénována.
  2. Pozastavte smyčku strategie, přepněte zdroj příkazu a označte každý snímek, který řídíte, jako intervenci. Bez příznaku vypadají opravy jako běžné demonstrace.
  3. Rozhodněte záměrně, co se stane s přechodovými snímky mezi uvolněním strategie a vaším prvním vstupem.
  4. Uchovávejte opravy ve své vlastní datové sadě per strategii a sledujte indexy epizod ručně tak, aby mohl být mix rekonstruován.
  5. Najeďte na vstupní bod fine-tuning na předchozí checkpoint a zkontrolujte v protokolu, že načetl ty váhy.

Krok 3 podrobně: třídění rozhoduje o kvalitě

Po běhu máte nahrávku s některými snímky označenými jako intervence. Tři destinace existují, a špatná potichu otravuje další kolo.

  • Archivujte jako opravu, když byla intervence skutečná oprava: strategie byla na špatné cestě a váš vstup ukázal správnou věc ze stavu, který samotná strategie vyprodukovala.
  • Ponechte jako evaluaci pro čisté autonomní běhy a pro běhy, které jste převzali z opatrnosti. Evaluační epizody jsou to, jak měříte další checkpoint, a nikdy se na nich nesmí trénovat.
  • Zahoďte běhy zkazené něčím nesouvisejícím - vynechaný snímek kamery, zaseknutý servo, objekt, který jste srazili. Nepořádná oprava je horší než žádná oprava.
Freeze frames patří do surového nahrávání, ne do trénovacích dat

Mezi uvolněním strategie a vaším prvním vstupem drží rameno stůj, zatímco recorder stále piše - běh stejných poloh spárovaných se mírně různými obrázky. Zde ty snímky handoveru zůstávají v surovém nahrávání a mimo datovou sadu opravy. Pokud si sami budujete smyčku, střihněte je záměrně: strategie trénovaná na nich se učí pozastavit se tam, kde by měla jednat.

Krok 5 podrobně: skládání mixu

Skládání vezme původní datový soubor plus datový soubor opravy a vytvoří nový, běžný LeRobot dataset který trénuje jako každý jiný. Důležitou vlastností je, že výběr epizod je explicitní per zdroj - nic se automaticky nemíchá. To zní bez důsledku, dokud poprvé strategie chová podivně a musíte rekonstruovat, na čem byla trénována.

Otevřená otázka je poměr a nikdo nemá číslo, které by se přeneslo. To, na čem literatura souhlasí, je, že opravy by měly počítat více než jejich podíl snímku. Mandlekar et al. opakovaně trénují na datech, která jejich intervenční systém shromažďuje, takže se strategie učí procházet kritickými místy, a hlásí, že agenti trénovaní tímto způsobem překonávají agenty trénované na ekvivalentním počtu vzorků od neintervenčních demonstrantů. Sirius jde dále a znovu váží trénovací vzorky podle aproximovaného lidského důvěry, hlásí 8procentní zisk v simulaci a 27 procent na reálném hardwaru v míře úspěchu strategie oproti metodám, které srovnává, při dvojnásobné rychlosti konvergence. Žádný z vstupních bodů trénování zde neukazuje sampler-weighting knob, takže hrubou náhradou je udržet každou epizodu opravy, zatímco podvzorkovat původní demonstrace - a napsat si, co jste udělali.

Pohled nahrávání datové sady zobrazující epizody datové sady SO-100 s proudy kamer
Epizody opravy jsou běžné epizody s příznakem per-frame intervence, takže se složí s původní datovou sadou bez konverze.

Krok 6 podrobně: co opravdu znamená pokračování z checkpointu

Trénování mixu ze základního modelu funguje, ale zahodí předchozí kolo a stojí plný běh. Pokračování z předchozího checkpoint je rychlejší a obvykle lepší. Je to také omezenější, než fráze navrhuje.

Inicializace váh není obnovení optimizátoru

Checkpoint pouze s váhami obsahuje parametry a nic víc. Načtení mu dá dalšímu běhu lepší výchozí bod než základní model, ale momenty optimizátoru, pozice rozpracovaného plánu učení a pořadí dat všechno začínají od nuly. Očekávejte ztrátu skok na začátku pokračovaného běhu, nečtěte jej jako selhání a nenazývejte kolo obnovením. Je to teplý start.

StrategieVelikostÚroveň GPUInference per action stepFormát datové sadyEpizody, než to stojí za pokus
GR00T N1.7přibližně 3 B, přibližně 40 M trénováno během fine-tuningA100 80 GB nebo H100 80 GBpřibližně 152 msLeRobot v2.0 nebo v2.150
GR00T N1.5přibližně 3 BA100 80 GB nebo H100 80 GBpřibližně 165 msLeRobot v2.0 nebo v2.150
Pi0.5přibližně 3 B na páteři PaliGemmaA100 80 GB nebo H100 80 GBpřibližně 485 msLeRobot v3.050
SmolVLApřibližně 450 MRTX 4090 nebo nějaká 24 GB kartapřibližně 245 msLeRobot v3.030
ACTpřibližně 80 M, trénováno od nulyRTX 4090 nebo nějaká 24 GB kartapřibližně 20 msLeRobot v3.050

Latence se skládá uvnitř DAgger smyčky způsobem, kterým se ne během demo: při přibližně 485 ms per action step převezmete, protože se rameno zaváhalo, ne protože bylo špatné, a data obnovy zaváhání nejsou užitečná trénovací data. Pokud iterujete na datech spíše než pronásledujete finální míru úspěchu, iterujte na rychlém modelu. Shukor et al. popisují SmolVLA jako navržené k trénování na jednom GPU a nasazení na GPU spotřebitele nebo CPU, s asynchronním zásobníkem inference, který odděluje předpověď akcí od provedení, aby umožnil vyšší kontrolní frekvence - vlastnost, která udržuje smyčku takeover responzivní.

Formáty datové sady nejsou zaměnitelné. GR00T vezme LeRobot v2.0 nebo v2.1, a Isaac-GR00T úložiště popisuje jeho vstup jako příchuť formátu LeRobot v2 s přidaným souborem popisu modality; novější trenéři zde očekávají v3.0. Mix skládaný v špatné verzi selže při času načítání spíše než vyprodukování špatné strategie - lepší režim selhání, stále ztrácený slot fronty. dataset documentation seznamuje, který formát každý trenér vezme.

Smyčka, s již hotovým vedením

Handover s vedoucím ramenem, klávesnicí nebo posuvníky; per-frame označení intervence; archivace běhů jako oprav nebo evaluací; skládání smíšené datové sady s explicitním výběrem epizod per zdroj; a pokračování v trénování z checkpointu místo základního modelu. Co zůstává vaší rozhodnutím, je který běh počítá jako oprava, co jde do mixu a kdy intervention rate přestala klesat.

Podívejte se, jak je smyčka DAgger zapájena

Čtyři způsoby, jak zmar kolo

1. Trénování pouze na opravách

Nejčastější selhání a nejlákaví zkratkový. Datová sada pouze oprav je téměř zcela obtížným středem úkolu, s chybějícím přístupem a ústupem; strategie se zlepší v těžké části a zapomene, jak se tam dostat. Agregace není podrobností implementace metody, je to mechanismus: stará data jsou to, co drží zbytek chování na místě, zatímco opravy posouvají jednu část.

2. Přesunutí kamery mezi koly

Kamera, která se posune dva centimetry mezi koly, produkuje strategii horší než ta, s kterou jste začínali, a diagnózu, která stojí den. Každá VLA zde se podmiňuje na obrázcích; samotný stav kloubů nerozlišuje, kde je objekt. Vyfotografujte nastavení před prvním kolem a zkontrolujte tu fotografii před každým pozdějším.

3. Nechat artefakty handoveru vstoupit do trénování

Pokryto výše a v seznamu, protože je neviditelné. Symptomem je strategie, která se zasekne na zlomek sekundy přesně tam, kde operátor předchozího kola převzal. Vypadá to jako zaváhání; to je imitace.

4. Nazývání teplého startu obnovením

Pokud věříte, že optimizer state se přenesl, čtení počáteční ztráty skoku jako chyby a jdete lovit korumpovaná data. Pokud víte, že optimizer začal čerstvě, skok je očekáván a podíváte se na to, co přijde po něm. Stejná čísla, opačné závěry.

Měření kola

Metrika pro human-gated smyčku je intervention rate: snímky zaznamenané, zatímco jste byli v kontrole, děleny celkovými snímky běhu. Je v takeover stavu a je to jediné číslo, které odpovídá na otázku, kterou kolo položilo. Trénovací ztráta klesá ať už se strategie zlepšila či ne; míra úspěchu je binární a hlučná v počtech vzorků, které stolní rameno produkuje. Intervention rate je spojitá, měřená na stavech, které strategie sama vyvolala, a klesá, jak strategie potřebuje méně.

Porovnávejte jej pouze across běhy zaznamenané za totožných podmínek. Úplný argument a jak si vytvořit evaluační sadu, která přežije více než dvě kola, je v article on measuring a DAgger loop. Kolo jedna je realisticky test možnosti: kontrolujete, zda handover funguje na vašem hardwaru, že opravy přistávají se svými příznaky a že pokračovaný běh načetl checkpoint, který jste pojmenovali. Kola dva a tři jsou tam, kde by měla začít sazba pohybovat. Pokud se do kola čtyři nepohybuje, problém je upstream z DAgger.

Napište si per koloProč to později záleží
Checkpoint, který byl vyjištěnBez toho nemůžete připsat zlepšení mixu
Režim vstupu použitý pro handoverKlávesnice opravy jsou hrubší než opravy vedoucího a v datech se to vidí
Počet běhů a jak byl každý zatříděnZda mělo kolo dost oprav, aby mělo smysl
Intervention rate per běh a průměrMetrika pokroku smyčky
Přesný výběr epizod per zdrojJediný způsob, jak kolo reprodukovat nebo vrátit
Teplý start nebo čerstvé trénováníVysvětluje křivku ztráty, kterou se budete dívat za týden

Pokud ještě nemáte checkpoint

Smyčka nemá vstupní bod bez něj. Zaznamenejte první datový soubor, trénujte první strategii, spusťte ji - recording, training a running the policy pokrývají tu cestu. Klient nahrávání je na download page, úrovně GPU a hodinové sazby na pricing page a jak vypadá použitelná epizoda v SO-100 data collection guide. Dostaňte demonstrace správně před opravami: DAgger je opravy mechanismus a funguje daleko lépe na něčem, co bylo téměř správně.

Mohu spustit DAgger smyčku bez vedoucího ramene?

Ano. Vyberte si vstup klávesnice nebo posuvníku, když stisknete Převzetí: handover je okamžitý a ruční, bez druhého ramene k srovnání. Klávesnice posílá relativní nudge, který server pevně sevírá na 2 stupně per kloub a 4 pro gripper; posuvníky posílají absolutní cíl a server se pohybuje nejvíce 6 stupnů k němu per volání, zatímco rozhraní stále vysílá. Sloupec akcí a značení intervence jsou stejné jako v režimu vedoucího, takže jsou opravy nerozlišitelné v datové sadě.

Kolik oprav potřebuje jedno kolo?

Neexistuje obhajovatelné univerzální číslo a počet snímků záleží více než počet epizod. Pracovní pravidlo je, že opravy se nesmí ztratit v mixu: se 200 původními epizodami a třemi epizodami oprav, nic se nepohne. Cíl pro opravy pokrývající selhávající chování z několika počátečních konfigurací spíše než tři opakování stejné záchrany.

Proč je trénování pouze na opravách tak špatná myšlenka?

Protože opravy jsou téměř zcela obtížným středem úkolu. Přístup, srovnání a ústup chybějí, takže strategie ztrácí to, co už dělala dobře, zatímco se zlepšuje v části, kterou jste opravili. Udržení starých dat a přidávání k nim je samotný mechanismus, ne volitelné extra.

Obnovuje pokračování z checkpointu předchozí běh trénování?

Ne. Checkpoint pouze s váhami obnoví parametry a nic jiného: momenty optimizátoru, pozice rozpracovaného plánu učení a pořadí dat začínají čerstvě. Je to teplý start a počáteční ztráta skok je očekáván spíše než symptom. Napište si, který ze dvou jste skutečně dělali, abyste správně četli křivku za týden.

Co když intervention rate neklesne?

Zastavte přidávání kol. Plochá sazba znamená, že opravy neučí, co myslíte. Obvyklé příčiny jsou upstream: kamera se pohla, opravy začínají příliš pozdě na to, aby byly data vyhýbání, snímky handoveru jsou v trénovací sadě, nebo úkol je nedostatečně určen z pozorování, která strategie skutečně dostává.

Nic z toho není vyřešený problém a nic z toho není jednoklik. Interactive imitation learning je aktivní oblast výzkumu přesně proto, že její otázky - kdy intervenovat, jak vážit to, co lidé dělali, kolik starých dat uchovávat - nemají ustálené odpovědi; průzkum Celemin et al. mapuje, co je stále otevřeno. Co smyčka má, je měřitelná konvergence, když se běží opatrně, na hardwaru, který stojí pár set eur. Zamrazte nastavení, intervenujte brzy, třídění čestně, mix záměrně a zaznamenejte intervention rate pokaždé.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started