Un braț robot SO-100 cu cost redus pe birou, configurat pentru teleoperare și antrenament de politică
DAggerSO-100Învățare prin imitațieVLATeleoperare

Rulare a unui ciclu DAgger pe SO-100 cu o politică VLA

AY-Robots ResearchAugust 27, 202615 min citire

Un raport pas-cu-pas al unei runde DAgger controlate de om pe un braț SO-100: rulează politica și înregistreaz-o, preia controlul când merge prost, clasifică rularea ca o corectare, compune un dataset mixt și continuă antrenamentul dintr-un punct de control. Include calea de preluare prin tastatură și glisor pentru cei fără un braț lider, și cele patru greșeli care fac o rundă nefolositoare.

Politica ta rulează. Ajunge la cub, închide griferul cu un centimetru prea devreme și continuă de parcă l-ar fi luat. Nimic nu generează eroare și nicio cantitate de analizare a pierderii de antrenament nu o explică. Remediul nu este încă 20 000 pași de gradient pe aceleași demonstrații. Este să-ți pui mâna înapoi pe braț exact unde merge prost, să înregistrezi ce ai făcut în schimb, și să antrenezi punctul de control următor pe datele vechi plus acea corectare. Aceasta este o rundă DAgger, și acesta este cum se rulează pe un SO-100 cu o politică de acțiune bazată pe limbaj vizual.

Teoria este în altă parte: de ce agregarea dataset-urilor funcționează deloc și ce schimbă controlul de om despre asta. Acesta este manualul de operare și presupune un punct de control antrenat, un set de camere care funcționează și un braț care se mișcă. Cei șase pași de mai jos sunt ciclul implementat pe pagina DAgger a acestei platforme, dar secvența este aceeași din propriile tale scripturi.

O rundă pe scurt

  • Rulează politica antrenată și înregistreaz-o, cu textul sarcinii din rulare mai degrabă decât o etichetă generică de teleoperare.
  • Preia controlul în momentul în care comportamentul merge prost: o predare în oglindă cu un braț lider, imediat și manual prin tastatură sau glisor fără unul.
  • Triajeaza fiecare rulare: clasifico ca o corectare, păstrez-o ca un episod de evaluare sau renunță la ea.
  • Compune amestecul manual - demonstrații originale plus corectări, episoade alese per sursă. Nu antrena niciodată numai pe corectări.
  • Continuă antrenamentul din ultimul punct de control și notează care punct de control a produs care amestec.
  • Numărul care spune dacă runda a meritat ceva este rata de intervenție, nu pierderea de antrenament.

De ce runda a doua nu este doar mai mult date

Comportamentul clonării imitativ antreneaza pe stările pe care le-a vizitat un om. La ora testării, politica vizitează stările pe care le cauzează, iar erorii mici de acțiune se compun în stări pe care nicio demonstrație nu le-a acoperit. Ross, Gordon și Bagnell au formalizat această eșec pentru AISTATS 2011 și au răspuns cu un algoritm iterativ care antreneaza o politică deterministă staționară și, sub reducția lor, trebuie să funcționeze bine sub distribuția de stări pe care o induce: rulează politica actuală, fă experții să eticheteze stările pe care le-a ajuns, adaugă-le la dataset, re-antreneaza, repetă. Kelly et al. au făcut interogarea practică cu HG-DAgger, unde omul decide când să preia controlul în loc să eticheteze stări fără a ține comenzile; raportează performanță îmbunătățită atât asupra DAgger cât și asupra comportamentului clonării pe o sarcină de conducere autonomă simulată și reală. Controlul uman este ceea ce face ciclul tolerabil pe un braț birou - mișcă mâinile doar atunci când ceva merge prost.

Două consecințe contează mai mult în practică decât teoria. Corectările nu sunt demonstrații obișnuite: se concentrează în regiunile de gâtuire pe care le descriu Mandlekar et al., unde o mică deviație aruncă politica în stări pe care demonstrațiile nu le-au acoperit. Și un dataset făcut numai din acele părți grele este un dataset prost format - Belkhale, Cui și Sadigh susțin din partea datelor că diversitatea stării nu este întotdeauna benefică, și că divergența acțiunilor și diversitatea de tranziție împreună decid calitatea dataset-ului. Dataset-ul mixt nu este un compromis, este punctul.

Înghață acestea înainte de runda unu

O rundă DAgger compară o politică împotriva ei însăși în timp. Orice schimbări între runde care nu sunt dataset-ul face acea comparație lipsită de sens.

  • Poziții și montări de cameră, inclusiv camera încheieturii. Slăbește o clemă și ai schimbat distribuția de observație, nu politica.
  • Expunere și echilibrul alb, dacă stiva ta de capturare te lasă să le fixezi. Expunerea automată deplasând între runde este o schimbare domeniu lentă, invizibilă.
  • Calibrare braț și poziții zero servo. Dacă trebuie să recalibrezi, tratează tot ce a fost înregistrat înainte ca un dataset separat.
  • Textul sarcinii. Fiecare VLA aici se condiționează pe el; reformularea ei în mijlocul ciclului este o sarcină diferită.
  • Iluminare, suprafață masă, set de obiecte. Un obiect nou este un experiment nou, nu runda următoare.
  • Rata de cadre a înregistrării. Compararea ratelor de intervenție pe două rasteruri de eșantionare produce diferențe care vin din raster.
Camera încheieturii nu este mobilier opțional

Hsu et al. au comparat o vizualizare centrată pe mână împotriva vizualizării obișnuite din terță parte și au găsit perspectiva ochi-în-mână consistent îmbunătățit eficiența antrenamentului și generalizarea afară din distribuție, în ciuda că a vedere mai puțin din scenă. Pe un braț cu cinci articulații, cronometrarea griferului este de obicei ceea ce corectările dvs. corectează, și cronometrarea griferului este ceea ce vizualizarea încheieturii transportă.

Runda, de la capăt la capăt

  1. 1
    Execută inferență și înregistreaz-o

    Începe rularea împotriva punctului de control pe care dorești să-l îmbunătățești, apoi începe înregistrarea în rădăcina inferenței. Înregistrat în felul acesta moștenește textul propriu al sarcinii din rulare, care este ceea ce a fost antrenată politica, mai degrabă decât eticheta generică de teleoperare. Fără înregistrare poți urmări eșecul dar nu poți antrena pe el.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Preia controlul când merge prost

    Apasă Preluare și alege modul de intrare: braț lider, tastatură sau glisor. Runner-ul se pauzează, tu corectezi, tu cedezi. Cadrele înregistrate în timp ce conduceai sunt marcate ca intervenții în mod automat.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Triajeaza episoadele

    Hotărăște per episod: clasifică ca corectare, păstează ca evaluare, sau renunță. O rulare pe care politica a finalizat-o fără ajutor este date de evaluare.

  4. 4
    Sincronizează dataset-ul de corectare

    Corectările se colectează într-un dataset local per politică și merg la stocarea în cloud prin sincronizare automată. Nimic nu este amestecat în ceea ce nu ai pus acolo.

  5. 5
    Compune dataset-ul mixt

    Combină dataset-ul original cu dataset-ul de corectare, alegând episoade în mod explicit per sursă. Rezultatul este un dataset obișnuit din acel punct înainte.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Continuă antrenamentul din punctul de control

    Antreneaza amestecul din punctul de control anterior mai degrabă decât modelul de bază. Notează care punct de control și care amestec; fără această pereche runda nu este reproducibilă.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Pasul 2 în detaliu: cele două moduri de preluare

Cu un braț lider

În modul conducător-urmăritor predarea este o predare între două brațe care nu se află în aceeași poziție. Apăsarea Preluare pauzează runner-ul și conduce liderul pe poziția actuală a urmăritorului, deci nimic nu sare când cuplul se transferă. Dacă unitatea de aliniere se epuizează, aliniezi liderul cu mâna și eliberezi doar când cele două sunt în cinci grade. De acolo înainte teleoperezi normal și coloana de acțiuni înregistrează ceea ce ai comandat.

Fii onest despre această cale: unitatea de aliniere și predarea cu cuplu sunt cea mai puțin testată parte a ciclului pe hardware-ul real. Testează predarea pe o poziție lentă, inofensivă înainte să te bazezi pe ea într-o rulare cu care ții. Un braț lider produce cele mai netede corectări din cele trei moduri, și are și cel mai mult care poate merge prost din punct de vedere mecanic.

Fără un braț lider: tastatură și glisor

Majoritatea oamenilor care citesc aceasta deține un braț. Asta este suficient. Alege intrare prin tastatură sau glisor în momentul în care apesi Preluare, iar preluarea este imediat și manual - nu este al doilea braț pentru a se alinia, deci nu este pas de aliniere. Urmăritorul ține poziția și așteaptă intrare.

Modul de intrareCum se mișcă brațulLimită per-apel impusă de serverBlocat când
Braț liderOglinda conduce urmăritorul din unghiurile articulare ale lideruluiNicio apel împinge sau setează apeluri în acest mod; oglinda scrie obiectivele urmăritorului continuuNiciodată blocat, și implicit dacă nu este dat niciun mod de intrare - dar are nevoie de un al doilea braț; fără o id lider preluarea este refuzată
TastaturăApel relativ per apăsare tasta, trimis la punctul final de nudge de preluareClamă grea la 2 grade per articulație, 4 grade pentru griferulRespinge cu 409 dacă preluarea a fost pornită în modul lider
GlisorPoziție țintă absolută, trimisă la punctul final de setare a preluăriiCel mult 6 grade de deplasare către țintă per apel; interfața continuă să trimită cam de zece ori pe secundăRespinge cu 409 dacă preluarea a fost pornită în modul lider

Clampele sunt impuse pe server, nu în interfață, pentru că o deltă greșit tastată pe un braț servo magistral este o coliziune. Corectări din tastatură ies pas cu pas și puțin brute; corectări din glisor sunt mai netede, pentru că serverul merge către țintă în timp ce interfața continuă să curgă. Oricum, coloana de acțiuni primește vectorul de poziție complet comandat și marcajul de intervenție este identic cu calea liderului, deci corectări din tastatură aterizează în același dataset fără o diferență de format.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Aceeași dată de taste ca oriunde în stivă, deci memoria musculară din înregistrare se duce.
Ghid de antrenament care arată pașii ordonați ai unei rulări de fine-tuning GR00T pe un dataset SO-100
Partea de antrenament a unei runde este aceeași secvență ghidată ca o primă rulare; doar câmpul punctului de control diferă.

Când să apesi butonul

Mai devreme mai degrabă decât târziu. O corectare care începe după ce griferul s-a închis pe nimic învață recuperarea dintr-o eșec pe care politica nu ar fi trebuit să intre, și datele de recuperare merită mult mai puțin decât datele de evitare. Întrerupe în momentul în care ești sigur că traiectoria este greșită, corectează prin partea dificilă, cedează cât mai curând starea este una pe care politica a gestionat-o înainte. ThriftyDAgger automatizează acea decizie prin controlul intervenției pe noutate și risc estimat sub un buget uman fix, dar pe un braț unic cu un om deja observând, poarta omului este mai ieftină și mai bine calibrată decât orice vei acorda.

Posibil cu stiva deschisă și câteva scripturi. Ceea ce costă este contabilitate, și contabilitatea este unde DAgger runde mor.

  1. Scrie cadre din propriul script de inferență într-un dataset LeRobot, cu șirul de sarcini cu care a fost antrenată politica.
  2. Pauzează bucla politicii, schimbă sursa comenzii și marchează fiecare cadru pe care îl conduci ca intervenție. Fără steag, corectări arată ca demonstrații obișnuite.
  3. Hotărăște deliberat ce se întâmplă cu cadrele de tranziție între politica care eliberează controlul și prima ta intrare.
  4. Păstreazeți corectări în propriul lor dataset per politică și urmăriți indicii de episod cu mâna deci amestecul poate fi reconstruite.
  5. Punctează punctul de intrare de fine-tuning la punctul de control anterior și verifică în jurnal că a încărcat acele greutăți.

Pasul 3 în detaliu: triage-ul decide calitatea

După rulare ai o înregistrare cu unele cadre marcate ca intervenții. Trei destinații există și cea greșită otrăvei în tăcere runda următoare.

  • Clasifică ca corectare când intervenția a fost o reparație genuină: politica mergea undeva în greșit și aportul tău a arătat lucrul corect dintr-o stare pe care politica a produs-o.
  • Păstreazeți ca evaluare pentru rulări autonome curate și pentru rulări pe care le-ați preluat din precauție. Episoadele de evaluare sunt cum măsori punctul de control următor, și nu trebuie să fie niciodată antrenate.
  • Renunță rulări ruinate de ceva neconectat - un cadru de cameră căzut, un servo blocat, un obiect pe care l-ai lovit. O corectare dezordine este mai rea decât nicio corectare.
Cadrele înghețate aparțin înregistrării brute, nu în date de antrenament

Între politica care eliberează controlul și prima ta intrare, brațul ține ochi în timp ce recorder-ul continuă scrierea - o rulare de poziții identice împerechiate cu imagini ușor diferite. Aici acele cadre de predare rămân în înregistrarea brută și afară din dataset-ul de corectare. Dacă construiești bucla singur, tăie-le deliberat: o politică antrenată pe ele învață să se pauze unde ar trebui să acționeze.

Pasul 5 în detaliu: compunerea amestecului

Compoziția ia dataset-ul original plus dataset-ul de corectare și produce un nou, obișnuit dataset LeRobot care antrenează ca orice altul. Proprietatea importantă este că selecția episodului este explicită per sursă - nimic nu este amestecat în mod automat. Aceasta sună minor până la prima dată când o politică se comportă ciudat și trebuie să reconstruiești pe ce a fost antrenată.

Întrebarea deschisă este raportul și nimeni nu are un număr care se transferă. Ce literatura se acordă este că corectările ar trebui să conteze pentru mai mult decât scăzământul lor de cadru. Mandlekar et al. reentreneaza iterativ pe datele pe care sistemul lor de intervenție le colectează, deci politica învață să traverseze gâturile de sticla și raportează că agenții antrenați în felul acesta depășesc agenți antrenați pe un număr echivalent de eșantioane din demonstrații non-intervenție. Sirius merge mai departe și reprețuiește eșantioane de antrenament prin încredere umană aproximată, raportând un câștig de 8 la sută în simulare și 27 la sută pe hardware real în rata de succes al politicii împotriva metodelor pe care le compară, la viteză de convergență dublă. Niciun punct de intrare de antrenament aici nu expune o manetă de ponderare eșantion, deci substitutul brut este să ții fiecare episod de corectare în timp ce subseșanționezi demonstrațiile originale - și să notezi ce ai făcut.

Vizualizare înregistrare dataset arătând episoade ale unui dataset SO-100 cu fluxuri de cameră
Episoadele de corectare sunt episoade obișnuite cu un steag de intervenție per cadru, deci se compun cu dataset-ul original fără conversie.

Pasul 6 în detaliu: ce continuarea dintr-un punct de control într-adevăr înseamnă

Antrenamentul amestecului din modelul de bază funcționează dar aruncă runda anterioară și costă o rulare completă. Continuarea din anteriorul punct de control este mai rapid și de obicei mai bun. Este și mai limitat decât expresia sugerează.

Inițializarea greutate nu este un CV a optimizatorului

Un punct de control doar greutăți conține parametri și nimic altceva. Încărcarea oferă rulării următoare un punct de plecare mai bun decât modelul de bază, dar momente ale optimizatorului, poziția programului de rat de învățare și ordinea datelor toate încep de la zero. Așteptați un vârf de pierdere la începutul rulării continuate, nu îl citești ca eșec și nu numești runda ca un CV. Este o plăcintă caldă.

PoliticăMărimeNivel GPUInferență per pas de acțiuneFormat datasetEpisoade înainte de a fi demn de încercare
GR00T N1.7aproximativ 3 B, aproximativ 40 M antrenate în timpul fine-tuning-uluiA100 80 GB sau H100 80 GBaproximativ 152 msLeRobot v2.0 sau v2.150
GR00T N1.5aproximativ 3 BA100 80 GB sau H100 80 GBaproximativ 165 msLeRobot v2.0 sau v2.150
Pi0.5aproximativ 3 B pe o coloană vertebrală PaliGemmaA100 80 GB sau H100 80 GBaproximativ 485 msLeRobot v3.050
SmolVLAaproximativ 450 MRTX 4090 sau orice card 24 GBaproximativ 245 msLeRobot v3.030
ACTaproximativ 80 M, antrenate de la zeroRTX 4090 sau orice card 24 GBaproximativ 20 msLeRobot v3.050

Latență se compune în interiorul unei bucle DAgger în mod ce nu face în timpul unei demonstrații: la aproximativ 485 ms pe pas de acțiune faci preluare pentru că brațul a ezitat, nu pentru că a fost greșit și corectări de ezitare nu sunt date de antrenament utile. Dacă iterezi pe date mai degrabă decât vânezi o rată de succes finală, iterează pe un model rapid. Shukor et al. descriu SmolVLA ca fiind conceput pentru a antrena pe un singur GPU și a implementa pe GPU-uri de consum sau CPU-uri, cu o stivă de inferență asincronă care decuplează predicția acțiuni de execuție pentru a permite rate de control mai mari - proprietatea care ține o bucla de preluare receptivă.

Formatele dataset nu sunt interschimbabile. GR00T ia LeRobot v2.0 sau v2.1 și depozitul Isaac-GR00T descrie intrarea sa ca o aromă a formatului LeRobot v2 cu fișier de descriere modalitate adăugat; antrenatorii mai noi aici așteaptă v3.0. Un amestec compus în versiunea greșită eșuează la ora de încărcare mai degrabă decât produce o politică proastă - modul de eșec mai bun, încă o fesă de coadă risipită. Documentația dataset listează care format fiecare antrenor ia.

Bucla, cu contabilitate deja făcută

Preluare cu un braț lider, tastatură sau glisor; marcare de intervenție per cadru; dosier de rulări ca corectări sau evaluări; compunere unui dataset mixt cu selecție episod explicită per sursă; și continuare antrenament dintr-un punct de control mai degrabă decât din modelul de bază. Ce rămâne decizia ta este care rulare contează ca o corectare, ceea ce merge în amestec și când rata de intervenție a oprit căderea.

Vedea cum ciclul DAgger este legat

Patru moduri de a risipi o rundă

1. Antrenament numai pe corectări

Cea mai comună eșec și scurtătura cel mai tentant. Un dataset numai pentru corectări este aproape în întregime mijlocul greu al sarcinii, cu apropiere și retragere lipsind; politica devine mai bună la partea grea și uită cum să ajungă acolo. Agregarea nu este un detaliu de implementare al metodei, este mecanismul: datele vechi sunt ceea ce ține restul comportamentului pe loc în timp ce corectări muta o parte din el.

2. Mutarea unei camere între runde

O cameră care se schimbă doi centimetri între runde produce o politică mai rea decât cea cu care ai începe și o diagnostic care costă o zi. Fiecare VLA aici se condiționează pe imagini; starea articulării singură nu dezambiguează unde este obiectul. Fotografiaza setul înainte de prima rundă și verifica fotografia înainte de fiecare mai târziu.

3. Lăsând artefacte de predare în antrenament

Acoperit mai sus și pe lista pentru că este invizibil. Simptomul este o politică care se întrerupe pentru o fracțiune de secundă exact unde operatorul rundei anterioare a preluat. Se pare ezitare; este imitație.

4. Numind o plăcintă caldă un CV

Dacă crezi că starea optimizatorului s-a dus peste, vârful pierderii inițiale se citește ca un bug și tu vânezi după date corupte. Dacă știi că optimizatorul a început proaspăt, vârful este așteptat și tu te uiți la ce vine după. Aceleași numere, concluzii opuse.

Măsurarea rundei

Metrica pentru o bucla controlată de om este rata de intervenție: cadre înregistrate în timp ce ați condus, împărțite la cadre totale ale rulării. Este în starea preluării și este singurul număr care răspunde întrebării pe care a pus-o runda. Pierderea antrenamentului cade indiferent dacă politica s-a îmbunătățit; rata de succes este binară și zgomotoasă la dimensiunile de eșantion pe care un braț birou le produce. Rata de intervenție este continuă, măsurată pe stările pe care le-a cauzat politica și cade pe măsură ce politica te necesită mai puțin.

Comparați doar pe rulări înregistrate în condiții identice. Argumentul complet și cum să construiți un set de evaluare care supraviețuiește mai mult de două runde este în articolul despre măsurarea unei bucle DAgger. Runda unu este realist un test de fezabilitate: verifici că preluarea funcționează pe hardware-ul tău, că corectări aterizează cu steagurile lor și că rularea continuată a încărcat punctul de control pe care l-ai numit. Rundele doi și trei sunt unde rata ar trebui să înceapă să se miște. Dacă nu s-a mișcat până la runda patru, problema este în amontiglul DAgger.

Notează-ți per rundăDe ce contează mai târziu
Punctul de control care a fost condusFără el nu poți atribui o îmbunătățire unui amestec
Modul de intrare folosit pentru preluareCorectări din tastatură sunt mai brute decât corectări lider și se vede în date
Numărul de rulări și cum a fost fiecare triajatăDacă runda a avut suficiente corectări pentru a conta
Rata de intervenție per rulare și mediaMetrica de progres a buclei
Selecție exactă de episod per sursăSingurul mod de a reproduce sau anula o rundă
Plăcintă caldă sau antrenament proaspătExplică curba pierderii pe care o vei privi într-o săptămână

Dacă nu ai încă un punct de control

Bucla nu are punct de intrare fără unu. Înregistrează un dataset de început, antreneaza o politică de început, rulează-o - înregistrare, antrenament și rularea politicii acoper acea cale. Clientul de înregistrare se află pe pagina de descărcare, niveluri GPU și rate pe oră pe pagina de prețuri și cum arată un episod utilizabil în ghidul de colecție de date SO-100. Ajunge demonstrațiile înainte de corectări: DAgger este un mecanism de reparație și funcționează mult mai bine pe ceva care a fost aproape corect deja.

Pot rula o bucla DAgger fără un braț lider?

Da. Alege intrare prin tastatură sau glisor când apesi Preluare: preluarea este imediată și manuală fără al doilea braț pentru a se alinia. Tastatura trimite corecții relative pe care serverul le fă strânse la 2 grade per articulație și 4 pentru griferul; glisoarele trimit o țintă absolută și serverul se mișcă cel mult 6 grade către ea per apel în timp ce interfața continuă să curgă. Coloana de acțiuni și marcajul de intervenție sunt aceleași ca în modul lider deci corectări sunt de nedeosebite din dataset.

Câte corectări are nevoie o rundă?

Nu există niciun număr universal defensabil și numărul de cadre contează mai mult decât numărul de episod. Regula de lucru este că corectările nu trebuie să se piardă în amestec: cu 200 de episoade originale și trei episoade de corectare nimic nu se va muta. Urmăresc corectări care acoperă comportamentul de eșec din mai multe configurări de plecare mai degrabă decât trei repetări ale aceleiași salvări.

De ce este antrenamentul numai pe corectări o idee atât de proastă?

Pentru că corectări sunt aproape în întregime mijlocul greu al sarcinii. Apropiere, aliniere și retragere lipsesc deci politica pierde ceea ce a făcut deja bine în timp ce se îmbunătățește la partea pe care ai corectat-o. Păstrarea datelor vechi și adăugarea la ele este mecanismul în sine nu un extra opțional.

Continuarea dintr-un punct de control relansează rularea de antrenament anterior?

Nu. Un punct de control doar greutăți restaurează parametri și nimic altceva: momente ale optimizatorului, poziție program de rat de învățare și ordinea datelor încep proaspete. Este o plăcintă caldă și un vârf de pierdere inițial este așteptat mai degrabă decât un simptom. Notează-ți care din cele două ai făcut de fapt deci citești curba corect o săptămână mai târziu.

Ce dacă rata de intervenție nu cade?

Opri adăugarea de runde. O rată plană înseamnă corectări nu învață ceea ce crezi. Cauzele obișnuite sunt în amontiglul: o cameră s-a mutat, corectări încep prea târziu pentru a fi date de evitare, cadre de predare sunt în setul de antrenament sau sarcina este nedeterminată din observații pe care politica le primește de fapt.

Nimic din asta nu este o problemă rezolvată și nimic din ea nu este o singură clic. Învățarea imitației interactive este o zonă de cercetare activă exact pentru că întrebările sale - când interveni, cum cântărești ceea ce a făcut omul, cât de mult date vechi să ții - nu au răspunsuri stabilite; sondajul de Celemin et al. hărțuiește ceea ce este încă deschis. Ceea ce bucla are este convergență măsurabilă când este rulată cu grijă pe hardware care costă câteva sute de euro. Înghață setul, interveni devreme, triajeaza onest, amestecă deliberat și notează rata de intervenție de fiecare dată.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started