AY-Robots žodyno įrašas apie LeRobot duomenų rinkinio formatą, formatą, kurį vartoja kiekvienas platformos mokytojas, nepriklausomai nuo to, ar epizodai buvo įrašyti, ar sugeneruoti.
sintetiniai duomenyssimuliacija-realybėIsaac Labimitacinis mokymasisMimicGenSO-101

Sintetiniai duomenys robotų politikoms: kur padeda simuliacija

AY-Robots ResearchAugust 23, 202631 min skaitymo

Simuliacija gali padauginti saujelę demonstracijų į tūkstančius. Štai ką iš tikrųjų sako paskelbti skaičiai, kur kanda simuliacijos-realybės atotrūkis ir ką dar reikia įrašyti.

Kas kelis mėnesius kas nors supranta, kad įrašyti penkiasdešimt epizodų rankiniu būdu yra lėta, ir klausia, ar simuliatorius galėtų juos sukurti. Tai pagrįstas klausimas. Sąžiningas atsakymas susideda iš trijų dalių: sugeneruoti duomenys padeda, jie nepakeičia realių įrašų, o santykis tarp šių dviejų faktų visiškai priklauso nuo to, kokius sintetinius duomenis turite omenyje.

Šiame puslapyje apžvelgiama, ką iš tikrųjų išmatavo paskelbti darbai, ką šiandien galite paleisti ant nebrangios rankos, tokios kaip SO-100, ir kur simuliacijos-realybės atotrūkis suvalgo privalumus. Trumpa versija, prieš detales: sistemos, kurios praneša apie didžiausius daugiklius, padaugina nedidelį rinkinį realių žmogaus demonstracijų. Jos nepanaikina poreikio joms.

Ką reikia žinoti

  • Keturi nesusiję metodai manipuliacijoje vadinami sintetiniais duomenimis: trajektorijos dauginimas, fizikos modeliavimas, vaizdo pasaulio modeliai ir vaizdo erdvės papildymas. Jie skirtingai veikia ir yra skirtingos vertės.
  • MimicGen pavertė mažiau nei 200 žmogaus demonstracijų į daugiau nei 50 000 sugeneruotų demonstracijų per 18 užduočių. Atliekant „Square D0“ užduotį, 200 demonstracijų, sugeneruotų iš 10 žmogaus demonstracijų, davė 79 procentų sėkmę, palyginti su 84 procentais 200 realių žmogaus demonstracijų.
  • RoboCasa yra priešingas pavyzdys: 72 000 sugeneruotų demonstracijų pasiekė 47,6 procento, palyginti su 28,8 procento 1 250 žmogaus demonstracijų. Tai yra 58 kartų didesnis tūrio pranašumas, o ne lygiavertė pergalė.
  • Simuliacijos ir realaus pasaulio bendrojo mokymo tyrimas praneša apie vidutinį 38 procentų pagerėjimą realaus pasaulio užduočių atlikime. Receptas yra bendras mokymas naudojant mišinį, o ne tik simuliacijos perkėlimas.
  • GR00T N1 remiasi 780 000 simuliacijos trajektorijų (atitinka 6 500 valandų, sugeneruotų per 11 valandų) ir 827 valandomis neuroninių trajektorijų, išaugintų iš 88 realių valandų. Tos 88 realios valandos vis dar yra piramidės viršūnė.
  • SO-101 šiandien yra veikianti atvira sistema: LeIsaac programoje Isaac Lab, valdykite nuotoliniu būdu fizine pagrindine ranka, dauginkite su Isaac Lab Mimic, eksportuokite į LeRobot formatą, tiksliai sureguliuokite GR00T.
  • AY-Robots negeneruoja sintetinių duomenų. Jis mokosi iš LeRobot duomenų rinkinio, kurį jam pateikiate, nepriklausomai nuo to, kaip tas duomenų rinkinys buvo sukurtas, o mokytojams reikia mažiausiai 30–50 epizodų, priklausomai nuo modelio.

Keturi skirtingi dalykai vadinami sintetiniais duomenimis

Prieš lyginant skaičius, verta atskirti šeimas, nes straipsnis, pranešantis apie 100x daugiklį, ir straipsnis, pranešantis apie 5 punktų sėkmės padidėjimą, dažnai aprašo tą patį procesą iš skirtingų pusių. Bendras bruožas yra tas, kad kažkas LeRobot duomenų rinkinyje buvo pagaminta mašinos, o ne įrašyta nuo fizinės rankos. Skiriasi tik tai, kuri dalis.

ŠeimaKas lieka realuKas generuojamaPraneštas daugiklisPagrindinis gedimo režimas
Trajektorijos dauginimas (MimicGen, DexMimicGen, Isaac Lab Mimic)Keli žmogaus demonstraciniai pavyzdžiai, objekto tinkleliai, fizikos variklisNaujos trajektorijos, pritaikytos naujoms objekto pozoms ir scenos išdėstymams10 human demos to 1,000 per reset distribution; 60 to 21,000; under 200 to over 50,000Generavimo bandymai nepavyksta. Isaac Lab nurodo, kad kandidato sėkmės rodiklis paprastais atvejais siekia iki 70 procentų, o sudėtingais – mažiau nei 1 procentą.
Fizikos modeliavimas užduočių simuliatoriuje (Isaac Lab, robosuite, RoboCasa)Fizikos variklis ir resursų bibliotekaVisos serijos, valdomos scenarijų valdiklių, planuotojų ar RLRibojama tik GPU valandomisSimuliuota ranka nėra jūsų ranka. Kontakto ir servo dinamika yra apytikslė.
Vaizdo pasaulio modeliai (DreamGen, Cosmos Transfer)Keletas realių teleoperacijos epizodų, naudojamų kaip sąlygosFotorealistinis naujų elgsenų vaizdo įrašas, plius vėliau atkurti pseudo-veiksmai88 hours to 827 hours in GR00T N1, about 10xVeiksmai yra numanomi, o ne matuojami. Tikėtinas vaizdo įrašas gali turėti neįtikėtiną veiksmą.
Vaizdo erdvės papildymas (atsitiktinis apkarpymas, spalvų virpėjimas)Viskas, išskyrus pikseliusIškraipyti jau turimų epizodų vaizdai1x, tai nesukuria naujos trajektorijosGeometrinis papildymas nutraukia ryšį tarp vaizdo ir veiksmo žymės.

Tik pirmieji trys yra sintetiniai duomenys, kaip tai suprantama šiame straipsnyje. Ketvirtąjį verta paminėti, nes jis įtraukiamas į tą patį pokalbį ir yra pigiausias sąraše. Jei dar neįjungėte papildymų, su kuriais pateikiamas jūsų treniruoklis, padarykite tai prieš diegdami simuliatorių.

Galite peržiūrėti realius sintetinius duomenis prieš juos generuodami

NVIDIA paskelbė simuliuotas trajektorijas, naudotas GR00T N1 po treniruočių, kaip nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim platformoje Hugging Face, apie 1.87 TB pagal cc-by-4.0 licenciją. Jos suskirstytos į 9 000 kryžminių dvirankių Panda ir GR1 trajektorijų, 240 000 humanoidinių stalo trajektorijų, 72 000 vienos Panda virtuvės trajektorijų ir 102 Unitree G1 lokomocijos-manipuliacijos trajektorijas. Atsisiuntus vieną pogrupį su huggingface-cli download --include "gr1_arms_only.CanSort/**" ir peržiūrėjus kelis epizodus, tai yra greičiausias būdas kalibruoti, kaip atrodo sugeneruotos trajektorijos, ir tai nekainuoja nieko, išskyrus pralaidumą.

Ką iš tikrųjų sako paskelbti skaičiai

Štai įrodymų bazė su skaičiais, kaip juos nurodo šaltiniai, o ne kaip juos apibendrina pranešimai spaudai. Kiekviena toliau pateikta eilutė yra iš straipsnio ar projekto puslapio, perskaityto 2026 m. rugpjūčio 23 d.

SistemaĮvestisSugeneruotaPraneštas rezultatas
MimicGen, CoRL 2023Mažiau nei 200 žmogaus demonstracijų; 10 žmogaus demonstracijų tiesioginiame palyginimeDaugiau nei 50 000 demonstracijų, 18 užduočių, keturios rankos (Panda, Sawyer, IIWA, UR5e)Square D0: 79 procentai iš 200 demonstracijų, sugeneruotų iš 10 žmogaus demonstracijų, palyginti su 84 procentais iš 200 žmogaus demonstracijų
DexMimicGen, 202460 pirminių žmogaus demonstracijų21 000 demonstracijų dvirankiams vikriems robotamsDvirankės vikrios užduotys simuliacijoje, plius realaus-į-simuliacinio-į-realaus humanoido skardinių rūšiavimo diegimas
RoboCasa, 20241 250 žmogaus demonstracijų (50 užduočiai per 25 atomines užduotis), 100 vertinimo užduočių, daugiau nei 150 objektų kategorijų100 000 MimicGen trajektorijų; 72 000 demonstracijų poaibis lemia pagrindinį palyginimą28,8 procento bendrai žmogaus rinkinyje, palyginti su 47,6 procento visiškai sugeneruotame rinkinyje, vertinta tik pagal nematytus objektų egzempliorius
Simuliacinis ir realus bendras mokymas, 2025Realios demonstracijos plius simuliacijos duomenų rinkiniai, dvi sritys (roboto ranka ir humaniodas)Mišinys, o ne pakaitalasSimuliacijos duomenys pagerino realaus pasaulio užduočių atlikimą vidutiniškai 38 procentais
DreamGen, 2025Teleoperacijos duomenys iš vienos paėmimo ir padėjimo užduoties vienoje aplinkojeSintetinis vaizdo įrašas plius pseudo-veiksmai iš latentinio veiksmo modelio arba atvirkštinės dinamikos modelio22 nauji elgesiai su humaniodu, matytose ir nematytose aplinkose
GR00T N1 data pyramid, 202588 valandos vidinės GR-1 teleoperacijos827 valandos neuroninių trajektorijų (apie 10x); 780 000 simuliacinių trajektorijų, atitinkančių 6 500 valandų, pagamintų per 11 valandųNeuroninės trajektorijos pridėjo 4,2, 8,8 ir 6,8 taško RoboCasa sistemoje esant 30, 100 ir 300 demonstracijų užduočiai režimams, ir vidutiniškai 5,8 taško per 8 realias GR-1 užduotis
Skaitykite daugiklius kaip trajektorijų skaičių, o ne galimybes

Daugiklis yra eilučių skaičius. Pačios MimicGen tiesioginiame palyginime sugeneruoti duomenys yra šiek tiek mažesni nei toks pat žmogaus duomenų skaičius (79 prieš 84 procentus), o GR00T N1 abliacija prideda vienženklius procentinius punktus prie modelio, kuris jau turėjo realias valandas. RoboCasa pranoksta žmogaus duomenis, 47,6 prieš 28,8 procento, tačiau su 72 000 sugeneruotų demonstracijų, palyginti su 1 250 žmogaus demonstracijų. Apimtis perka aprėptį. Ji neperka informacijos, kurios jūsų demonstracijos niekada neturėjo.

Kiekvienos sąžiningos abliacijos modelis yra tas pats. Sintetiniai duomenys pigiai išplečia aprėptį. Jie nesukuria informacijos apie jūsų griebtuvą, servo nusileidimą, apšvietimą ar stalo aukštį, kurios nebūtų buvę realiuose demonstraciniuose pavyzdžiuose. Jei jūsų politika, nepavyksta, nes galinis efektorius užsidaro puse sekundės per vėlai, joks simuliuotos variacijos kiekis to nepataisys. Tai yra griebtuvo laiko problema realiuose įrašuose.

Vieną MimicGen išvadą verta pritaikyti savo įrašymo sesijose, nes ji prieštarauja įprastiems patarimams. Projektas sugeneravo du duomenų rinkinius „Square D2“: vieną su 10 demonstracinių pavyzdžių iš geresnės kokybės žmogaus operatoriaus ir vieną su 10 demonstracinių pavyzdžių iš prastesnės kokybės operatoriaus, abu paimti iš „robomimic multi-human Square“ duomenų rinkinio. Kiekviename apmokytos politikos pasiekė panašius rezultatus, ką autoriai interpretavo kaip ženklą, kad didelio masto duomenų režime duomenų kokybė gali būti ne tokia svarbi. Atidžiai perskaitykite: tai yra teiginys apie dešimt pradinių demonstracinių pavyzdžių, o ne apie jūsų penkiasdešimt realių epizodų. Tai reiškia, kad šiek tiek netvarkingas pradinis rinkinys nėra tai, kas stovi tarp jūsų ir naudingo sugeneruoto duomenų rinkinio. Tai nereiškia, kad realūs epizodai, kuriuos naudojate bendram apmokymui, gali būti netvarkingi, nes būtent jie perduoda informaciją, kurios simuliatorius neturi.

AY-Robots viešasis duomenų rinkinių katalogas, kuriame pateikiami įrašyti LeRobot duomenų rinkiniai su jų epizodų skaičiumi.
Viešasis duomenų rinkinių katalogas adresu /directory. Kiekvienas įrašas čia yra realūs įrašyti epizodai. Sintetiniai duomenys yra daugiklis, papildantis kažką panašaus, o ne jo pakaitalas.

Simuliacijos ir realybės atotrūkis, konkrečiai

Atotrūkis dažniausiai aptariamas kaip vienas dydis, o tai nėra naudinga. Tai yra bent penki atskiri neatitikimai, ir jie yra skirtingo dydžio 110–150 EUR kainuojančioje mėgėjiškoje roboto rankoje, palyginti su Franka.

  • Kontaktas ir trintis. Isaac Lab aiškiai teigia, kad naudojant tą pačią aparatinę įrangą ir tą pačią Isaac Sim bei PhysX versiją, simuliacija yra atkartojama, tačiau rezultatai skiriasi priklausomai nuo skirtingų aparatinės įrangos konfigūracijų dėl slankiojo kablelio tikslumo ir apvalinimo klaidų, ir kad PhysX negarantuoja determinizmo jokiai scenai su nelanksčiais kūnais, tokiais kaip audinys ar minkšti kūnai.
  • Valdymas. Feetech STS3215 magistralinis servovariklis, veikiantis 7.4 V įtampa, linksta esant apkrovai, turi laisvumą ir keičia elgesį kaistant. SO-101 MJCF modelis paima savo variklio parametrus iš nesusijusio projekto, o ne nustato juos jūsų roboto rankoje.
  • Atvaizdavimas. Kameros triukšmas, riedantis užraktas, automatinė ekspozicija ir tikslus jūsų stalo atspalvis nėra atvaizduojami. Tai yra pusė atotrūkio, kurį Cosmos-Transfer1 buvo sukurtas užpildyti: jo robotikos papildymo darbo eiga vieną robotikos sintetinį pavyzdį susieja su keliais realistiškais pavyzdžiais iš segmentavimo, gylio ar kraštų sąlygojimo.
  • Laikas. Simuliatorius žengia fiksuotu greičiu. Reali valdymo kilpa to nedaro, o pats modelis kainuoja nuo 20 iki 485 ms vienam veiksmo žingsniui, priklausomai nuo to, kurį pasirinkote. Žr. išvadų vėlavimas.
  • Objektų statistika. Imituojamos scenos yra paimamos iš kažkieno užrašyto pasiskirstymo. Jūsų virtuvės stalas nėra.

Ką simuliuojamas SO-100 iš tikrųjų žino apie jūsų roboto ranką

Tai yra dalis, kuri nusprendžia, ar kas nors iš aukščiau paminėtų dalykų yra vertas jūsų savaitgalio, ir pirmasis netikėtumas yra tas, kad SO-100 ir SO-101 nėra vienodai aptarnaujami. TheRobotStudio SO-ARM100 saugykla savo simuliacijos turtą laiko po Simulation/. SO100 aplankas turi vieną URDF failą ir nieko daugiau. SO101 aplankas turi tiek URDF, tiek MuJoCo failus: scene.xml, so101_new_calib.xml, so101_old_calib.xml, atitinkamus URDF ir joints_properties.xml. Jei norite fizikos modelio, o ne kinematinės grandinės, jums reikia SO-101 failų.

Jie buvo sugeneruoti naudojant onshape-to-robot papildinį iš CAD modelio, sukurto Onshape, o tai reiškia, kad kinematika ir vizualiniai tinkleliai yra tokie pat geri kaip ir CAD. Dinamika yra kita istorija, o paties saugyklos README atvirai kalba apie tris dalykus. Pagrindiniai susidūrimo tinkleliai buvo pašalinti dėl problemiško susidūrimo elgesio modeliavimo ir planavimo metu. STS3215 variklio savybės yra pritaikytos iš Open Duck Mini projekto, o ne išmatuotos ant SO-101. Ir LeRobot griebtuvo konvencija, kurioje 0 reiškia visiškai uždarytą, o 100 – visiškai atidarytą, dar nėra aiškiai atspindėta URDF ir MuJoCo failuose. Kiekviena iš šių vietų yra ta, kur politika, apmokyta tik tame modelyje, elgsis kitaip ant jūsų stalo.

Kalibravimo konvencija, kuri suvalgo dieną

Pristatytuose MuJoCo failuose yra dvi nulio konvencijos, o scene.xml pasirenka tarp jų pagal tai, kurį roboto failą jis įtraukia. Faile so101_new_calib.xml, kuris yra numatytasis, kiekvieno jungties virtualus nulis yra viduryje jos jungties diapazono. Faile so101_old_calib.xml nulis yra konfigūracija, kurioje robotas yra visiškai ištiestas horizontaliai. Jei jūsų imituoti epizodai naudoja vieną konvenciją, o jūsų įrašyti realūs epizodai – kitą, kiekvienas jungties kampas mišriame duomenų rinkinyje yra paslinktas dešimtimis laipsnių, nuostolis vis tiek mažėja, o politika daro kažką užtikrintai neteisingo. Prieš bendrai apmokydami, patikrinkite konvenciją abiejose pusėse ir pirmiausia perskaitykite kalibravimą bei nuostolis mažėja, politika nieko nedaro.

Domeno atsitiktinumas ir ko jis neištaiso

Standartinis atsakymas į šį atotrūkį yra nustoti bandyti atitikti realybę ir vietoj to apmokyti modelį per pakankamai platų pasiskirstymą, kad realybė patektų į jį. Tobinas ir kolegos 2017 m. parodė stiprią šios idėjos versiją: objekto detektorius, apmokytas tik ant imituotų vaizdų su nerealistiškomis atsitiktinėmis tekstūromis, be jokio išankstinio apmokymo ant realių vaizdų, lokalizavo realius objektus 1.5 cm tikslumu ir išliko atsparus blaškantiems veiksniams bei daliniams uždengimams.

Isaac Lab atskleidžia tą pačią idėją kaip ir įvykių terminai, kuriuos priskiriate aplinkos konfigūracijai. Tai yra valdikliai, pagal jų tikruosius funkcijų pavadinimus isaaclab.envs.mdp, kad galėtumėte juos perskaityti, o ne spėlioti.

Įvykio funkcijaKą ji trikdo
randomize_rigid_body_materialKontaktinė trintis ir atstatymas
randomize_rigid_body_mass, randomize_rigid_body_comObjekto ir jungties masė, masės centro poslinkiai
randomize_actuator_gainsJungties valdiklio standumas ir slopinimas
randomize_joint_parameters, randomize_fixed_tendon_parametersJungties trintis, armatūra ir ribos
randomize_visual_texture_material, randomize_visual_colorIšvaizda, fotometrinė tarpo pusė
randomize_physics_scene_gravityGravitacijos vektorius
apply_external_force_torque, push_by_setting_velocityVykdymo metu atsirandantys trikdžiai
reset_root_state_uniform, reset_joints_by_offsetPradinės būsenos pasiskirstymas kiekvieno epizodo atstatymo metu

Štai riba, ir tai yra ta, dėl kurios žmonės suklumpa. Atsitiktinumas praplečia pasiskirstymą, kurį politika matė jūsų sukurtame modelyje. Jis negali įvesti fizinio efekto, kurio simuliatorius neatspindi. Jei PhysX nemodeliuoja jūsų STS3215 servovariklių laisvumo ir terminio nusileidimo, jų standumo atsitiktinumas nieko neišmoko politikos apie laisvumą. Štai kodėl ranka, kuri pagal simuliatoriuje apmokytą politiką nėra atsitiktinumo biudžeto problema. Tai yra modeliavimo problema.

Rankinis kelias: duomenų generavimas Isaac Lab

Isaac Gym yra sena programinė įranga. Pačiame NVIDIA puslapyje rašoma „Isaac Gym – dabar nebenaudojama“ ir teigiama, kad kūrėjai gali ją atsisiųsti ir toliau naudoti, tačiau ji nebepalaikoma, o vietoj jos nurodoma Isaac Lab. Jei norite sužinoti istoriją, aprašėme abi: ir . Naujiems darbams 2026 m. pradėkite nuo Isaac Lab.

  1. 1
    Įdiekite Isaac Sim ir Isaac Lab

    Pip diegimo puslapyje nurodoma, kad instrukcijos skirtos Isaac Sim 5.X, kuriai reikalingas Python 3.11. Šaltinio klonavimas suteikia jums scenarijus, reikalingus kitiems žingsniams.

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    Įrašykite apie dešimt žmogaus demonstracijų

    Isaac Lab dokumentacija yra konkreti: norint sėkmingai atlikti tolesnius veiksmus, reikia apie 10 sėkmingų demonstracijų. Jos patarimai yra vienodai konkretūs. Demonstracijos turi būti trumpos, eiti tiesiu keliu, o ne judėti savavališkomis ašimis, ir nedaryti pauzių, nes politikai nėra akivaizdu, kodėl ir kada daryti pauzę.

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    Anuotuokite potaskio ribas

    Mimic padalija įvesties demonstracijas į potaskius, kad galėtų iš naujo nustatyti segmentų laiką ir tikslą. Vėliavėlė --auto tai atlieka be žmogaus įsikišimo užduotims, kurios apibrėžia automatinį anotavimą; be jos pauzę darote su B, tęsiate su N ir žymite ribą su S. Atkreipkite dėmesį, kad užduoties ID gauna -Mimic priesagą.

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    Sugeneruokite padaugintą duomenų rinkinį

    Tai yra žingsnis, kuris 10 paverčia 1000. Mimic taiko bulio sėkmės kriterijų kiekvienam kandidatui ir pasilieka tik tuos, kurie atliko užduotį, todėl išvesties skaičius yra mažesnis nei bandymų skaičius. Dokumentuose nurodoma, kad kandidato sėkmės rodiklis paprastais atvejais siekia net 70 procentų, o sudėtingoms užduotims ir robotams – mažiau nei 1 procentą: apie 50 procentų Franka kubo krovimui ir 65–80 procentų GR1T2 paėmimo ir padėjimo užduočiai, kur 1000 demonstracijų užtrunka nuo 18 iki 40 minučių (19 minučių su RTX ADA 6000, veikiančiu 80 procentų).

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    Konvertuokite HDF5 į LeRobot duomenų rinkinį

    Viskas, kas išdėstyta aukščiau, sukuria robomimic formato HDF5, o Isaac Lab branduolys neturi savo LeRobot konverterio: jo dokumentuose tik nurodoma, kad sugeneruotą duomenų rinkinį galite konvertuoti į LeRobot formatą. Du projektai pateikia tikrąjį konverterį. IsaacLab-Arena pateikia GR00T skirtą konverterį, visiškai valdomą YAML konfigūracijos, o LeIsaac pateikia savo porą SO-101 maršrutui (žr. žemiau).

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
Prisekite savo versijas ir nepasitikėkite main

2026 m. rugpjūčio 23 d. Isaac Lab dokumentacija, skirta main, turi Isaac Sim 6.0.1 ženklelį ir versijų perjungiklyje siūlo release/3.0.0 ir v3.0.0-beta2 kartu su v2.3.2, o pip diegimo puslapis tame pačiame medyje vis dar nurodo isaacsim[all,extscache]==5.1.0 ir apibūdina instrukcijas kaip skirtas Isaac Sim 5.X. NVIDIA synthetic-manipulation-motion-generation brėžinio konteineris yra dar senesnis: Isaac Lab 2.0.2 ant Isaac Sim 4.5.0. LeIsaac suderinamumo lentelėje Isaac Sim 5.1 suporuotas su Isaac Lab v2.3.0. Šie medžiai juda greičiau, nei dokumentai susiderina. Pasirinkite vieną leidimą, užsirašykite jį ir tikėkitės, kad scenarijų keliai ir vėliavėlių pavadinimai pasikeis, jei vadovausitės prieš tris mėnesius parašyta pamoka.

Kodėl generavimo bandymai nepavyksta ir ką keisti

Kandidato sėkmės rodiklis, svyruojantis tarp 70 procentų ir mažiau nei 1 procento, nėra paslaptis, o Isaac Lab dokumentuoja dažniausiai pasitaikančias klaidas, užuot palikęs jus spėlioti. Kiekviena iš jų yra kažkas, ką kontroliuojate įrašymo metu, todėl verta perskaityti šį sąrašą prieš įrašant dešimt pradinių demonstracijų, o ne po pirmojo nuviliančio generavimo paleidimo.

  • Demonstracijos per ilgos. Ilgesnį laiko horizontą politikai sunkiau išmokti. Pradėkite arti pirmojo objekto ir sumažinkite judesį.
  • Demonstracijos nėra sklandžios. Nereguliarų judesį politikai sunku iššifruoti, o geresnė teleoperacijos aparatinė įranga suteikia geresnius duomenis: dokumentuose aiškiai teigiama, kad SpaceMouse yra pranašesnis už klaviatūrą.
  • Pauzės. Pauzes sunku išmokti, nes politikai nėra akivaizdu, kodėl ir kada daryti pauzę. Išlaikykite sklandų judesį.
  • Per daug užduočių. Daugiau užduočių reiškia daugiau sujungimų tarp trajektorijos segmentų, o tai lemia mažiau sklandų judesį ir mažesnį generavimo sėkmės rodiklį. Pažymėkite ribas, kur ranka vargu ar susidurs su kuo nors.
  • Nėra veiksmų triukšmo. Veiksmų triukšmas daro gautas politikas atsparesnes.
  • Įrašas per daug apkarpytas. Jei įrašymas sustoja tiksliai tame kadre, kuriame suveikia sėkmės sąlyga, jis gali nebesuveikti pakartotinio paleidimo metu. Palikite buferį pabaigoje.
  • Nedeterministinis pakartotinis paleidimas. Fizika Isaac Lab nėra deterministiškai atkartojama per env.reset, todėl kai kurios žmogaus demonstracijos nepavyksta pakartotinio paleidimo metu. Surinkite daugiau, nei jums reikia, ir pasilikite tas, kurios išgyvena anotaciją. Viskas, kas patenka į Mimic sugeneruotą HDF5 failą, yra sėkminga demonstracija ir gali būti naudojama mokymui, net jei pakartotinis paleidimas vėliau nepavyksta.

Interpoliacijos žingsnis tarp sujungtų užduočių segmentų turi savo reguliavimo rankenėlę, o reikalingas interpoliacijos žingsnių skaičius priklauso nuo to, kaip greitai juda robotas ir koks platus yra objekto atstatymo pasiskirstymas. Sudėtinga užduotis su dideliu atstatymo pasiskirstymu palieka didesnius tarpus tarp segmentų, kuriems reikia daugiau interpoliacijos žingsnių, kad judesys būtų tolygus. Jei jūsų sugeneruoti vaizdo įrašai rodo, kad ranka trūkčioja tarp fazių, tai yra parametras, į kurį reikia atkreipti dėmesį prieš kaltinant pradinius demonstracinius pavyzdžius.

Tas pats konvejeris SO-101, su tikra lyderio ranka

Tai įdomus variantas kiekvienam, skaitančiam šį puslapį, nes tai vienintelis atviras konvejeris, kuris įdeda į Isaac Lab ir leidžia jį valdyti fizine lyderio ranka, kurią jau turite. LeIsaac, rašymo metu 0.4.0 versija, yra oficiali imitacinio mokymosi simuliacijos aikštelė, integruota į LeRobot EnvHub. Jos suderinamumo lentelėje nurodytos trys veikiančios kombinacijos; naujausia suporuoja Isaac Sim 5.1 su Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 ir Python 3.11, o dokumentacija rekomenduoja Isaac Sim 5.0 ar naujesnę versiją 50-serijos kortelėms.

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac iš šaltinio. Numpy versijos fiksavimas yra oficialiose instrukcijose, o ne apeinamasis sprendimas.

Tai įdiegus, lyderio ranka, prijungta prie /dev/ttyACM0, valdo simuliuojamą sekėją ir įrašo tiesiai į HDF5. ciklas yra tas pats, kurį jau žinote iš realaus įrašymo, tik sekėjas yra standus kūnas PhysX aplinkoje.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
Aplinkos IDUžduoties aprašymasRobotas
LeIsaac-SO101-PickOrange-v0Paimkite tris apelsinus ir padėkite juos į lėkštę, tada grąžinkite ranką į pradinę padėtį.Vienos rankos SO101 sekėjas
LeIsaac-SO101-LiftCube-v0Pakelkite raudoną kubą.Vienos rankos SO101 sekėjas
LeIsaac-SO101-CleanToyTable-v0Paimkite du „e“ raidės objektus į dėžę, tada grąžinkite ranką į pradinę padėtį.Vienos rankos SO101 sekėjas
LeIsaac-SO101-CleanToyTable-BiArm-v0Ta pati užduotis su dviem rankomis.Dviejų rankų SO101 sekėjas
LeIsaac-SO101-FoldCloth-BiArm-v0Sulankstykite audinį, tada grąžinkite ranką į pradinę padėtį. Tik „DirectEnv“ variantas palaiko „check_success“.Dviejų rankų SO101 sekėjas
LeIsaac-LeKiwi-CleanupTrash-v0Paimkite popieriaus šiukšles nuo grindų ir išmeskite jas į šiukšliadėžę.LeKiwi

Dauguma šių ID taip pat egzistuoja kaip -Direct-v0 variantas, o python scripts/environments/list_envs.py atspausdina dabartinį sąrašą. Taip pat galite visiškai praleisti HDF5 aplinkkelį ir rašyti „LeRobot“ formatu teleoperacijos metu, pridėdami tris žymeklius. Du įspėjimai pateikiami iš pačios dokumentacijos: įrašymo įrenginys automatiškai praleidžia pirmuosius 5 kiekvieno epizodo kadrus, kad išvengtų nestabilumo dėl pradinių būsenų, ir tai gali sukelti nedidelius vėlavimus teleoperacijos metu, o tai yra būtent tas dalykas, kuris tyliai keičia jūsų demonstracijų pobūdį. Jis taip pat išsaugo tik tuos epizodus, kuriuos užduotis pažymėjo kaip sėkmingus.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

Dauginimo žingsnis tada vykdomas su šiais įrašais. „LeIsaac“ apgaubia „Isaac Lab Mimic“ keturiomis komandomis, nes „Mimic“ apibendrina trajektorijas iš galinio efektoriaus ir objekto pozų: konvertuoja jungčių erdvės veiksmus į IK pagrįstus veiksmus, anotuojama, generuojama, tada konvertuojama atgal į jungčių erdvę.

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

Tada konvertuokite į LeRobot. Tai yra žingsnis, kuriame platformos formato taisyklė įsigalioja, o LeIsaac atsitiktinai pateikia būtent du jums reikalingus konverterius: isaaclab2lerobot.py rašo LeRobot v2, kurį naudoja GR00T įkėlikliai, ir isaaclab2lerobotv3.py rašo v3, skirtą Pi0.5, SmolVLA ir ACT. Du scenarijai priima identiškus argumentus, tačiau naudoja skirtingas lerobot versijas, ir konvertuojami tik sėkmingi epizodai.

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
LeRobot v2 išvestis GR00T. Pakeiskite į isaaclab2lerobotv3.py, su lerobot 0.4.2, skirtą v3 treniruokliams.
Yra išsigelbėjimo būdas be GPU

LeIsaac dokumentuoja viso paketo paleidimą NVIDIA Brev: diekite, spustelėkite 80 prievado nuorodą, kad atidarytumėte naršyklės pagrindu veikiantį VS Code serverį, ir valdykite keturis iš anksto įdiegtus scenarijus su --kit_args="--no-window --enable omni.kit.livestream.webrtc", peržiūrėdami atvaizdą tuo pačiu adresu su pridėtu /viewer. Jei neturite darbo stoties kortelės po stalu, tai yra pigesnis būdas sužinoti, ar jūsų užduoties imituota versija yra bent jau artima, prieš skirdami jai aparatinę įrangą.

Du keliai į apmokytą politiką

Jūs patys kuriate sceną, generuojate duomenis, nuomojatės GPU ir nustatote aptarnavimą. Tai yra teisingas pasirinkimas, jei užduočiai reikia aplinkos variacijų, kurių negalite fiziškai sukurti, arba jei norite pakartojamo vertinimo.

  1. Įdiekite Isaac Sim 5.1 ir Isaac Lab, arba LeIsaac paketą, jei jūsų robotas yra SO-101.
  2. Modeliuokite arba importuokite sceną. Tai yra žingsnis, kuriam niekas neskiria biudžeto ir kuris dažniausiai užtrunka ilgiausiai.
  3. Įrašykite maždaug 10 švarių demonstracijų per imituojamą sekėją.
  4. Anuotuokite užduotis, paleiskite generate_dataset.py ir sutikite, kad nesėkmės bus atmestos.
  5. Konvertuokite HDF5 į LeRobot formatą, pasirinkdami v2 GR00T ir v3 kitiems.
  6. Vis tiek įrašykite realius epizodus su fizine ranka, tada bendrai apmokykite ant mišinio.
  7. Išsinuomokite GPU, paleiskite tikslųjį derinimą, aptarnaukite kontrolinį tašką šalia rankos.
ResursasKą nurodo šaltiniai
Vietinis simuliacijos GPUNVIDIA sintetinės manipuliacijos planas reikalauja Ubuntu 22.04 ir NVIDIA RTX A6000 su 48 GB VRAM
Pasaulio modelio mazgasTas pats planas reikalauja H100 ar aukštesnio su 80 GB, mazge atskirtame nuo Isaac Lab simuliacijos
Konteinerių versijosIsaac Lab 2.0.2 ant Isaac Sim 4.5.0 tame plano atvaizde
Generavimo pralaidumasIsaac Lab praneša apie 1000 GR1T2 paėmimo ir padėjimo demonstracijų per 18–40 minučių, 19 minučių su RTX ADA 6000 esant 80 procentų sėkmei
Neuralinės trajektorijos kainaGR00T N1 praneša apie 105 000 L40 GPU valandų, maždaug 1,5 dienos su 3 600 L40, už savo 827 valandas svajonių
Tikroji kaina yra kalendorinis laikas, o ne GPU laikas

1000 trajektorijų generavimas užtrunka popietę. Scenos, kameros ekstrinsikų, objekto tinklelių ir servo modelio paruošimas taip, kad tos trajektorijos persikeltų, užtrunka savaites. Biudžetą skirkite modeliavimui, o ne mėginių ėmimui.

Vaizdo pasaulio modeliai: naujausias sluoksnis ir mažiausiai išmatuotas

Idėja, slypinti už DreamGen, yra ta, kad vaizdo generatyvinis modelis, pritaikytas tiksliniam roboto įkūnijimui, gali įsivaizduoti tikėtinus epizodus scenose, kurių niekada nelankėte. Duomenų apdorojimo grandinė turi keturis etapus: tiksliai suderinti vaizdo pasaulio modelį, generuoti fotorealistinius sintetinius robotų vaizdo įrašus, atkurti pseudo-veiksmų sekas su latentinio veiksmo modeliu arba atvirkštinės dinamikos modeliu, tada apmokyti roboto politiką pagal rezultatą. NVIDIA GR00T-dreams saugykla įgyvendina būtent tai.

Pagrindinis rezultatas yra realus ir vertas rimto dėmesio: teleoperacijos duomenys iš vienos paėmimo ir padėjimo užduoties vienoje aplinkoje sukūrė 22 naujus elgesius humanoidui, tiek matytose, tiek nematytose aplinkose. Įspėjimas yra lygiai toks pat realus ir slypi trečiame etape.

Vaizdo pasaulio modeliai kaip duomenų šaltinis
Privalumai
  • Jie masteliuojasi pagal ašį, kuri yra tikrai brangi realiame pasaulyje: naujos scenos, nauji objektų išdėstymai, naujos instrukcijų formuluotės.
  • GR00T-dreams nurodo keturis palaikomus įkūnijimus savo veiksmų ištraukimo ir tikslinimo scenarijams: franka, gr1, robocasa ir so100. Tai nėra tik humanoidams skirta technika.
  • Cosmos-Transfer1 tiesiogiai atakuoja fotometrinę spragos pusę, susiedamas vieną robotikos sintetinį pavyzdį su keliais realistiškais iš segmentavimo, gylio ar kraštų sąlygų. Pats Isaac Lab pateikia įrankius tam po scripts/tools/cosmos.
  • DreamGen darbas pateikia DreamGen Bench, vaizdo generavimo etaloną, kuris rodo stiprią koreliaciją tarp etalono našumo ir tolesnės politikos sėkmės, todėl galite patikrinti generacijas prieš jas apmokydami.
Kompromisai
  • Veiksmai atkuriami modelio, o ne matuojami koduotuvu. Vaizdo įrašas, kuris atrodo teisingai, gali turėti jungties trajektoriją, kurios jūsų ranka negali atlikti.
  • Generavimas yra brangus. GR00T N1 praneša, kad vienos sekundės vaizdo įrašo generavimas L40 užtrunka dvi minutes, maždaug 105 000 L40 GPU valandų, apie 1,5 dienos naudojant 3 600 L40 GPU, 827 valandoms neuroninių trajektorijų.
  • Išmatuotas prieaugis yra vienženklis: 4,2, 8,8 ir 6,8 taško RoboCasa per tris duomenų režimus ir 5,8 taško vidutiniškai per 8 realias GR-1 užduotis, be modelio, kuris jau turėjo realius duomenis.
  • Nėra paskelbto recepto, kuris tai patvirtintų 7,4 V hobio-servo rankai nuo pradžios iki pabaigos. Jūs perkeltumėte, o ne sektumėte.
Niekada netiekite 12 V į STS3215

Nesusiję su simuliacija, bet tai iškyla, kai kas nors pereina nuo simuliuotos rankos prie realios ir improvizuoja maitinimo šaltinį. SO-100, SO-101 ir LeKiwi rankos visos naudoja Feetech STS3215 servovariklius 7,4 V įtampa. Maitinant juos 12 V, jie sugenda, o LeKiwi yra ypač pavojingas, nes jo pagrindo bėgelis yra 12 V. Prieš ką nors jungdami, žr. SO-100 techninės įrangos puslapį.

Bendras mokymas yra receptas, kuris iš tikrųjų rodo naudą

Jei iš literatūros pasiimsite vieną operacinę pamoką, tebūnie tai ši. Simuliacijos ir realaus pasaulio bendrojo mokymo tyrimas (Maddukuri ir kolegos, 2025) siekė rasti paprastą receptą, kaip naudoti simuliacijos duomenis regėjimu pagrįstoms robotų manipuliavimo užduotims spręsti dviejose srityse – roboto rankos ir humanoido – ir jo išvada yra, kad reikia mokyti naudojant mišinį. Simuliacijos duomenys pagerino realaus pasaulio užduočių atlikimą vidutiniškai 38 procentais, ir straipsnyje aiškiai nurodoma, kad tai galiojo net esant pastebimiems skirtumams tarp simuliacijos ir realaus pasaulio duomenų.

Tas paskutinis sakinys yra svarbesnis nei 38 procentai. Tai reiškia, kad simuliacija neturi būti tobulas skaitmeninis dvynys, kad būtų naudinga, su sąlyga, kad realūs duomenys yra mišinyje, kad ją įtvirtintų. Perkėlimas tik iš simuliacijos yra brangus kelias: tame pačiame straipsnyje teigiama, kad politikos mokymas vien tik simuliacijoje ir jos perkėlimas į realų pasaulį dažnai reikalauja didelių žmogaus pastangų, kad būtų įveiktas realybės atotrūkis. Bendrasis mokymas praleidžia didžiąją dalį šių pastangų, niekada neprašydamas politikos pačios užpildyti atotrūkio.

AY-Robots politikos palyginimo lentelė, rodanti parametrus, GPU lygį, išvadų vėlavimą ir minimalius epizodus GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ir ACT.
Penkios apmokomos politikos adresu /policies. Minimalaus epizodų stulpelis yra skaičius, kuris nusprendžia, ar sintetiniai duomenys yra pageidaujami, ar tai vienintelis būdas pasiekti apmokomą duomenų rinkinį.

Praktiškai, šioje platformoje, bendrasis mokymas reiškia viena: įdėkite abu epizodų rinkinius į tą patį LeRobot duomenų rinkinį su nuosekliais kameros raktais, nuoseklia jungčių tvarka ir nuosekliais vienetais, tada paleiskite įprastą tikslųjį derinimą. Mokymo formoje nėra mišinio svorio reguliavimo rankenėlės. Jei norite 3:1 simuliacijos ir realaus pasaulio santykio, tai išreiškiate tuo, kiek kiekvieno tipo epizodų įdėjote į duomenų rinkinį.

Pigiausias laimėjimas iš simuliacijos nėra mokymo duomenys

Tai yra vertinimas. Vykdyti dešimtis realių bandymų kiekvienai užduočiai, siekiant palyginti du užima visą dieną roboto rankos darbo, o ranka dreifuoja tarp bandymų. SIMPLER (Li ir kolegos, 2024) sukūrė simuliuotas aplinkas, kurių tikslas yra vertinti realias politikas, o ne jas apmokyti, ir tada išmatavo, kaip gerai simuliacijos reitingas prognozuoja realųjį. Viena SIMPLER aplinka atvaizduojama 3 500 simuliacijos žingsnių per sekundę ant vartotojams skirtos RTX 4090 plokštės 640 x 512 raiška, o tai, esant 500 Hz simuliacijos dažniui, yra 7 kartų pagreitis, palyginti su realiu vertinimu.

Vertinimo protokolasMMRV (mažiau yra geriau)Pirsono r (daugiau yra geriau)
Validavimo MSE0.3750.308
SIMPLER, variantų agregavimas0.1430.778
SIMPLER, vizualinis atitikimas0.0560.924

Tai yra trijų Google Robot užduočių grupių vidurkiai šešiems įprastiems atvirojo kodo kontroliniams taškams: trims RT-1 kontroliniams taškams skirtinguose mokymo etapuose, RT-1-X, RT-2-X ir Octo-Base. Reali pusė neturi vienodo bandymų skaičiaus, ką verta žinoti prieš cituojant: 75 bandymai skardinės paėmimui, 60 – priartėjimui, 54 – stalčiaus atidarymo ir uždarymo užduotims ir 27 – ilgesnei stalčiaus ir obuolio užduočiai. Palyginimas su validavimo MSE yra naudinga dalis. Modelio pasirinkimas pagal validavimo nuostolius blogai reitinguoja šiuos kontrolinius taškus, o Pirsono r 0,924 esant vizualiniam atitikimui reiškia, kad jei kontrolinis taškas geriau įvertinamas SIMPLER, jis labai tikėtinai geriau įvertinamas ir bandymų stende. Tai yra pakartojamas naktinis rezultatų suvestinės metodas, ir jis nereikalauja tikėti niekuo apie simuliacijos ir realaus pasaulio mokymo perkėlimą.

AY-Robots Arena lyderių lentelė, rūšiuojama 85 vizijos-kalbos-veiksmų modelių lentelė su 332 etaloniniais rezultatais, kiekviena reikšmė susieta su jos šaltinio straipsniu arba modelio kortele.
Arena adresu /arena surenka 332 etaloninius rezultatus iš 85 modelių. Beveik visi jie yra simuliuoti etalonai, o tai yra tikslus SIMPLER argumento esmė: simuliacija yra gera rezultatų lentelė dar gerokai prieš tai, kai ji tampa geru duomenų šaltiniu.

Jei norite platesnio konteksto apie tai, ką šie etaloniniai skaičiai jums sako ir ko nesako apie , mes tai atskirai aprašėme .

Kuo ši platforma jums nepadeda

Aiškumas dėl ribų taupo visų laiką. AY-Robots yra įrašymo, mokymo ir aptarnavimo platforma. Ji neturi savyje simuliatoriaus.

  • Jokio Isaac Lab, jokio MimicGen, jokio pasaulio modelio, jokio scenos kūrimo. Jei norite generuotų duomenų, juos generuojate kitur ir atsinešate rezultatą.
  • Treniruokliai naudoja LeRobot duomenų rinkinius ir nieko daugiau. Simuliatoriaus eksportas turi būti konvertuotas prieš tampant įvestimi, ir jis turi būti tinkamos versijos: v2.0 arba v2.1, skirtas GR00T N1.5 ir N1.7, v3.0, skirtas Pi0.5, SmolVLA ir ACT.
  • GR00T smulkaus derinimo įvesties taškas yra tyro CLI, kuris neatskleidžia jokios sėklos, todėl GR00T paleidimai nėra bitas po bito atkuriami. Jei vykdote kruopštų simuliacijos ir realybės abliaciją, tai yra tikras apribojimas. lerobot numatytoji sėkla yra 1000, o ACT, SmolVLA ir Pi0.5 formos atskleidžia sėklos lauką.
  • Gradiento kaupimas iš tikrųjų taikomas tik dviem GR00T treniruokliams. Pi0.5 ir SmolVLA atveju laukas egzistuoja formoje, tačiau lerobot 0.5.1 neturi tokios vėliavėlės, todėl jis nieko nedaro.
  • Išvados turi būti šalia servovariklių greitoms užduotims. Valdymo ciklas yra nuo 20 iki 485 ms vienam veiksmo žingsniui, priklausomai nuo modelio, o pridėjus viešojo interneto keliones pirmyn ir atgal, veikianti politika virsta dvejojančia. Nuotolinės išvados yra tinkamos lėtam paėmimui ir padėjimui, bet ne greitam reaktyviam judesiui.
Ką čia galite padaryti, kas kitur yra tikrai sunku

Įrašykite realią bendrojo mokymo mišinio pusę, neturėdami roboto rankos. /live transliuoja fizinį SO-100 be registracijos, eilės principu, o operatoriaus programa egzistuoja, nes kažkas turi juos valdyti. Jei jūsų kliūtis yra tai, kad turite simuliatorių ir jokių realių epizodų, tai yra spraga, kurią ši platforma užpildo.

Biudžetas, kurį galite apginti

Padėkite du kelius vienas šalia kito su skaičiais, kuriuos kiekvienas iš tikrųjų skelbia, ir sprendimas paprastai priimamas savaime vienos užduoties projektui su nebrangia roboto ranka.

Eilutės elementasPirmiausia – simuliacijaPirmiausia – įrašymas
Išankstinis modeliavimasScena, tinkleliai, kameros išdėstymas, servo modelis. Dienos iki savaičiųNėra
Duomenų rinkimasApie 10 demonstracijų simuliatoriuje, tada generavimas30–50 realių epizodų, kelios valandos teleoperacijos
Turima techninė įranga48 GB kortelė, skirta Isaac Lab brėžiniui, 80 GB, skirta Cosmos scenaiRobotinė ranka ir nešiojamasis kompiuteris
Mokymo kainaTas pats, kas dešiniajame stulpelyje, mokytojui nesvarbu, iš kur gauti duomenys1–3 USD 4090 lygmenyje, 4–12 USD A100 arba H100 lygmenyje
Geriausi naudos įrodymai38 procentų vidutinis realaus pasaulio prieaugis, kai mokoma kartu, 4–9 taškai iš neuroninių trajektorijųPradinė reikšmė, pagal kurią matuojama visa, kas išdėstyta aukščiau
Sugenda, kaiJūsų užduotis priklauso nuo kontakto, deformuojamų objektų ar servo lankstumoJums reikia aplinkos variacijos, kurios negalite fiziškai sukurti

Pirminei SO-100 politikai – įrašykite. ir nuves jus prie aptarnaujamo kontrolinio taško už kavos kainą, ir jūs turėsite realią bet kokio būsimo bendro mokymo mišinio pusę. Naudokite simuliatorių, kai turite veikiančią pradinę reikšmę ir konkretų apibendrinimo gedimą, kurį galite įvardyti, pavyzdžiui, politiką, kuri .

Dar neturite robotinės rankos ant stalo?

Valdykite tikrą SO-100 naršyklėje, eilės principu, be registracijos, ir pamatykite, kaip atrodo tikras epizodas, prieš praleisdami savaitgalį modeliuodami jį simuliatoriuje.

Valdykite tikrą robotinę ranką

Receptas, atsižvelgiantis į įrodymus

  1. 1
    Pirmiausia įrašykite tikrąją bazinę liniją

    30 episodes for SmolVLA, 50 for ACT, GR00T N1.7 and Pi0.5. Treniruokite vieną kartą. Viskas, kas nepavyksta tai politikai, yra jūsų sintetinės duomenų specifikacija.

  2. 2
    Įvardykite apibendrinimo nesėkmę

    Objekto poza? Apšvietimas? Stalo aukštis? Blaškantys veiksniai? Kitoks instrukcijos formulavimas? Sintetiniai duomenys yra geri tik viename iš šių dalykų vienu metu ir nenaudingi, jei negalite pasakyti, kuriame.

  3. 3
    Pasirinkite pigiausią šeimą, kuri tai apima

    Pozos ir išdėstymo variacija: trajektorijos dauginimas. Apšvietimas ir tekstūra: pirmiausia vaizdo papildymas, antra – pasaulio modelis. Visiškai naujos scenos: fizikos modeliavimas ir modeliavimo išlaidų priėmimas.

  4. 4
    Generuokite, tada agresyviai išmeskite

    Generavimo bandymai nepavyksta, o Isaac Lab kandidatų sėkmės rodiklis svyruoja nuo 70 procentų iki mažiau nei 1 procento, priklausomai nuo užduoties. Išsaugokite tik sėkmingas, užduotį užbaigiančias trajektorijas ir peržiūrėkite pavyzdį kaip vaizdo įrašą, prieš pasitikėdami partija.

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    Treniruokite kartu, nepakeiskite

    Sujunkite sugeneruotus epizodus su tikraisiais į vieną LeRobot duomenų rinkinį su identiškais kameros raktais ir jungčių tvarka. 38 procentų skaičius yra bendrojo mokymo rodiklis.

  6. 6
    Vertinkite ant tikrosios rankos ir tik ten

    Modeliavimo vertinimas yra geras reitingavimo signalas (Pearson r 0.924 SIMPLER vizualinio atitikimo nustatyme), tačiau tai nėra priėmimo testas. Paleiskite kontrolinį tašką ant stendo, prieš juo patikėdami.

Jei norėtumėte pradėti nuo tikrųjų įrašų kontrolinio sąrašo, duomenų rinkimo vadovas apima kameros išdėstymą, veiksmų grupavimą pasekmes ir gedimo režimus, dėl kurių imitacinio mokymosi duomenų rinkinys tampa nenaudojamas. Išsami informacija apie patį formatą pateikiama duomenų rinkinio dokumentacijoje, o hiperparametrų pusė – mokymo dokumentacijoje.

Ar galiu apmokyti roboto politiką tik sintetiniais duomenimis?

Manipuliavimo užduočiai su tikra ranka – nepatikimai. Kiekvienas paskelbtas rezultatas su stipriu skaičiumi yra bendrojo mokymo rezultatas arba papildymo ant tikrų duomenų rezultatas. MimicGen palyginimas rodo, kad 200 sugeneruotų demonstracijų pasiekia 79 procentus, palyginti su 84 procentais 200 žmogaus demonstracijų toje pačioje užduotyje, o 2025 m. simuliacijos ir realaus bendrojo mokymo darbas teigia, kad mokymas tik simuliacijoje ir perkėlimas dažnai reikalauja didelių žmogaus pastangų, kad būtų įveiktas realybės atotrūkis. RoboCasa rodo, kad sugeneruoti duomenys pranoksta žmogaus duomenis 47,6 prieš 28,8 procento, tačiau tik su 72 000 sugeneruotų demonstracijų, palyginti su 1 250 žmogaus demonstracijų, simuliatoriuje, kuris sukūrė abu.

Kiek realių epizodų man vis dar reikia, jei generuoju sintetinius?

AY-Robots platformoje treniruokliams reikia mažiausiai 30 epizodų SmolVLA ir 50 ACT, GR00T N1.5, GR00T N1.7 ir Pi0.5, nepriklausomai nuo to, iš kur epizodai atsirado. Isaac Lab Mimic dokumentacijoje teigiama, kad generavimui reikalingos maždaug 10 sėkmingų žmogaus demonstracijų kaip pradinė sėkla. Tai yra skirtingi skaičiai, atsakantys į skirtingus klausimus: 10 yra tai, ko reikia generatoriui, 30–50 yra tai, ko reikia treniruokliui.

Ar simuliuoti duomenys turi būti LeRobot formatu?

Norint treniruotis šioje platformoje, taip. Isaac Lab ir LeIsaac abu gamina robomimic-skonio HDF5. Isaac Lab branduolys neturi LeRobot konverterio, tačiau LeIsaac turi isaaclab2lerobot.py, skirtą LeRobot v2, ir isaaclab2lerobotv3.py, skirtą v3, o IsaacLab-Arena turi GR00T skirtą convert_hdf5_to_lerobot.py, valdomą YAML konfigūracijos. Stebėkite versiją: GR00T N1.5 ir N1.7 naudoja LeRobot v2.0 arba v2.1, o Pi0.5, SmolVLA ir ACT naudoja v3.0. V3.0 duomenų rinkinys sugadina GR00T įkroviklį ir turi būti konvertuotas į v2.1.

Ar Isaac Gym vis dar yra tinkamas dalykas mokytis 2026 m.?

Ne. NVIDIA produkto puslapyje yra antraštė „Isaac Gym – dabar nebenaudojama“ ir teigiama, kad tai yra sena programinė įranga, kurią kūrėjai gali atsisiųsti ir toliau naudoti, tačiau ji nebepalaikoma, ir nurodoma Isaac Lab kaip pakaitalas. Isaac Lab pateikia migracijos vadovus iš IsaacGymEnvs, iš OmniIsaacGymEnvs ir iš Orbit, todėl esama aplinka yra perkeliama, o ne prarandama.

Ar galiu įdėti SO-100 arba SO-101 į Isaac Lab?

SO-101, taip, tinkamai. TheRobotStudio saugykla pateikia tiek URDF, tiek MJCF failus SO-101, sugeneruotus su onshape-to-robot iš Onshape CAD modelio, o LeIsaac teikia paruoštas Isaac Lab užduotis, tokias kaip LeIsaac-SO101-PickOrange-v0 su teleoperacija iš fizinės SO101 pagrindinės rankos. SO-100 ta pati saugykla pateikia tik vieną URDF ir jokio MuJoCo modelio. Būkite informuoti apie apribojimus, kuriuos SO-101 README nurodo abiem atvejais: bazinės susidūrimo tinkleliai buvo pašalinti dėl problemiško susidūrimo elgesio, STS3215 variklio savybės buvo pritaikytos iš Open Duck Mini projekto, o ne identifikuotos ant SO-101, o 0-uždaros iki 100-atviros griebtuvo konvencija dar nėra atspindėta modelio failuose.

Ar platforma vykdo simuliaciją už mane?

Ne. AY-Robots įrašo LeRobot duomenų rinkinius iš realios teleoperacijos, tikslina penkias palaikomas politikas nuomojamuose GPU ir grąžina gautą kontrolinį tašką rankai. Jame nėra simuliatoriaus, sintetinio duomenų generavimo ir scenos kūrimo. Jei generuojate duomenis kitur ir konvertuojate juos į galiojantį LeRobot duomenų rinkinį, treniruokliai priims juos lygiai taip pat, kaip ir realius įrašus.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started