Entri glosari AY-Robots untuk format set data LeRobot, format yang digunakan oleh setiap pelatih di platform sama ada episod itu direkodkan atau dihasilkan.
data sintetiksim-ke-nyataIsaac Labpembelajaran tiruanMimicGenSO-101

Data Sintetik untuk Polisi Robot: Di Mana Simulasi Membantu

AY-Robots ResearchAugust 23, 202631 min bacaan

Simulasi boleh menggandakan beberapa demonstrasi menjadi ribuan. Berikut adalah apa yang sebenarnya dikatakan oleh angka-angka yang diterbitkan, di mana jurang sim-ke-nyata memberi kesan, dan apa yang masih perlu direkodkan.

Setiap beberapa bulan seseorang menyedari bahawa merakam lima puluh episod secara manual adalah perlahan, dan bertanya sama ada simulator boleh menghasilkannya. Itu soalan yang wajar. Jawapan jujur ada tiga bahagian: data yang dihasilkan memang membantu, ia tidak menggantikan rakaman sebenar, dan nisbah antara kedua-dua fakta ini bergantung sepenuhnya pada jenis data sintetik yang anda maksudkan.

Halaman ini menerangkan apa yang sebenarnya diukur oleh kerja yang diterbitkan, apa yang boleh anda jalankan hari ini pada lengan kos rendah seperti SO-100, dan di mana jurang sim-ke-nyata menghilangkan keuntungan. Versi ringkas, sebelum perincian: sistem yang melaporkan pengganda terbesar menggandakan set kecil demonstrasi manusia sebenar. Ia tidak menghilangkan keperluan untuk demonstrasi tersebut.

Apa yang perlu anda tahu

  • Empat teknik yang tidak berkaitan dipanggil data sintetik dalam manipulasi: penggandaan trajektori, pengguliran fizik, model dunia video, dan augmentasi ruang imej. Ia gagal dalam cara yang berbeza dan bernilai jumlah yang berbeza.
  • MimicGen menukar kurang daripada 200 demonstrasi manusia kepada lebih 50,000 demonstrasi yang dihasilkan merentasi 18 tugas. Pada tugas Square D0-nya, 200 demo yang dihasilkan daripada 10 demo manusia memberikan kejayaan 79 peratus berbanding 84 peratus untuk 200 demo manusia sebenar.
  • RoboCasa adalah contoh balas: 72,000 demo yang dihasilkan mencatat 47.6 peratus berbanding 28.8 peratus untuk 1,250 demo manusia. Itu adalah kelebihan volum 58x, bukan kemenangan setanding.
  • Kajian latihan bersama sim-dan-nyata melaporkan purata peningkatan 38 peratus dalam prestasi tugas dunia sebenar. Resipinya adalah latihan bersama pada campuran, bukan pemindahan sim-sahaja.
  • GR00T N1 menggunakan 780,000 trajektori simulasi (setara 6,500 jam, dihasilkan dalam 11 jam) dan 827 jam trajektori neural yang berkembang daripada 88 jam sebenar. 88 jam sebenar itu masih merupakan puncak piramid.
  • Untuk SO-101 terdapat saluran paip terbuka yang berfungsi hari ini: LeIsaac di dalam Isaac Lab, teleoperasi dengan lengan pemimpin fizikal, gandakan dengan Isaac Lab Mimic, eksport ke format LeRobot, penalaan halus GR00T.
  • AY-Robots tidak menjana data sintetik. Ia melatih pada set data LeRobot yang anda berikan, walau apa pun cara set data itu dihasilkan, dan pelatih memerlukan minimum 30 hingga 50 episod bergantung pada model.

Empat perkara berbeza dipanggil data sintetik

Sebelum membandingkan nombor, adalah wajar untuk memisahkan keluarga, kerana kertas kerja yang melaporkan pengganda 100x dan kertas kerja yang melaporkan peningkatan kejayaan 5 mata sering menggambarkan saluran paip yang sama dari hujung yang berbeza. Benang merahnya ialah sesuatu dalam LeRobot dataset dihasilkan oleh mesin dan bukannya direkodkan daripada lengan fizikal. Apa yang berbeza ialah bahagian mana.

KeluargaApa yang kekal nyataApa yang dihasilkanPengganda yang dilaporkanMod kegagalan utama
Pendaraban Trajektori (MimicGen, DexMimicGen, Isaac Lab Mimic)Beberapa demo manusia, jaring objek, enjin fizikTrajektori baharu yang disesuaikan dengan pose objek baharu dan susun atur pemandangan10 demo manusia kepada 1,000 setiap agihan set semula; 60 kepada 21,000; di bawah 200 kepada lebih 50,000Percubaan penjanaan gagal. Isaac Lab meletakkan kadar kejayaan calon setinggi 70 peratus dalam kes mudah dan di bawah 1 peratus dalam kes sukar
Pelancaran fizik dalam simulator tugas (Isaac Lab, robosuite, RoboCasa)Enjin fizik dan perpustakaan asetEpisod penuh, didorong oleh pengawal berskrip, perancang atau RLTerhad hanya oleh jam GPULengan simulasi bukan lengan anda. Dinamik sentuhan dan servo adalah anggaran
Model dunia video (DreamGen, Cosmos Transfer)Beberapa episod teleoperasi sebenar digunakan sebagai pengkondisianVideo fotorealistik tingkah laku baharu, ditambah pseudo-tindakan yang dipulihkan selepas itu88 jam kepada 827 jam dalam GR00T N1, kira-kira 10xTindakan disimpulkan, bukan diukur. Video yang munasabah boleh membawa tindakan yang tidak munasabah
Augmentasi ruang imej (random crop, colour jitter)Segala-galanya kecuali pikselPandangan terganggu episod yang anda sudah ada1x, ia tidak mencipta trajektori baharuAugmentasi geometri memutuskan ikatan antara imej dan label tindakan

Hanya tiga yang pertama adalah data sintetik dalam erti kata artikel ini. Yang keempat patut disebut kerana ia digabungkan dalam perbualan yang sama dan setakat ini merupakan perkara paling murah dalam senarai. Jika anda belum menghidupkan augmentasi yang disertakan dengan pelatih anda, lakukan itu sebelum anda memasang simulator.

Anda boleh melihat data sintetik sebenar sebelum anda menjana apa-apa

NVIDIA menerbitkan trajektori simulasi yang digunakan untuk pasca-latihan GR00T N1 sebagai nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim di Hugging Face, kira-kira 1.87 TB di bawah cc-by-4.0. Ia terbahagi kepada 9,000 trajektori Panda dan GR1 bimanual silang-embodied, 240,000 trajektori humanoid atas meja, 72,000 trajektori dapur Panda tunggal dan 102 trajektori lokomosi-manipulasi Unitree G1. Memuat turun satu subset dengan huggingface-cli download --include "gr1_arms_only.CanSort/**" dan menonton beberapa episod adalah cara terpantas untuk menentukur rupa trajektori yang dihasilkan, dan ia tidak memerlukan apa-apa selain lebar jalur.

Apa yang sebenarnya dikatakan oleh nombor yang diterbitkan

Berikut adalah asas bukti, dengan nombor seperti yang dinyatakan oleh sumber dan bukannya seperti yang diringkaskan oleh siaran akhbar. Setiap baris di bawah berasal dari kertas kerja atau halaman projek yang dibaca pada 23 Ogos 2026.

SistemInputDijanaHasil yang Dilaporkan
MimicGen, CoRL 2023Kurang daripada 200 demo manusia; 10 demo manusia dalam perbandingan langsungLebih 50,000 demo, 18 tugas, empat lengan (Panda, Sawyer, IIWA, UR5e)Square D0: 79 peratus daripada 200 demo yang dijana daripada 10 demo manusia, berbanding 84 peratus daripada 200 demo manusia
DexMimicGen, 202460 demo manusia sumber21,000 demo untuk robot cekap bimanualTugas cekap bimanual dalam simulasi, ditambah dengan penempatan penyisihan tin humanoid dari dunia nyata ke simulasi ke dunia nyata
RoboCasa, 20241,250 demo manusia (50 setiap tugas merentasi 25 tugas atomik), 100 tugas penilaian, lebih 150 kategori objek100,000 MimicGen trajectories; subset 72,000 demo mendorong perbandingan utama28.8 peratus keseluruhan pada set manusia berbanding 47.6 peratus pada set yang dijana sepenuhnya, dinilai hanya pada contoh objek yang tidak pernah dilihat
Latihan bersama simulasi dan dunia nyata, 2025Demo dunia nyata ditambah set data simulasi, dua domain (lengan robot dan humanoid)Campuran, bukan penggantiData simulasi meningkatkan prestasi tugas dunia nyata secara purata sebanyak 38 peratus
DreamGen, 2025Data teleoperasi daripada satu tugas pilih-dan-letak dalam satu persekitaranVideo sintetik ditambah tindakan pseudo daripada model tindakan laten atau model dinamik songsang22 tingkah laku baharu pada humanoid, dalam persekitaran yang pernah dilihat dan tidak pernah dilihat
GR00T N1 data pyramid, 202588 jam teleoperasi GR-1 dalaman827 jam trajektori neural (kira-kira 10x); 780,000 trajektori simulasi, bersamaan 6,500 jam, dihasilkan dalam 11 jamTrajektori neural menambah 4.2, 8.8 dan 6.8 mata pada RoboCasa pada rejim 30, 100 dan 300 demo setiap tugas, dan purata 5.8 mata merentasi 8 tugas GR-1 dunia nyata
Baca pengganda sebagai kiraan trajektori, bukan keupayaan

Pengganda adalah kiraan baris. Perbandingan langsung MimicGen sendiri meletakkan data yang dijana sedikit di bawah kiraan data manusia yang sama (79 berbanding 84 peratus), dan ablasi GR00T N1 menambah mata peratusan satu digit di atas model yang sudah mempunyai jam sebenar. RoboCasa memang mengalahkan data manusia, 47.6 berbanding 28.8 peratus, tetapi dengan 72,000 demo yang dijana berbanding 1,250 demo manusia. Jumlah membeli liputan. Ia tidak membeli maklumat yang tidak pernah terkandung dalam demonstrasi anda.

Corak merentasi setiap ablasi yang jujur adalah sama. Data sintetik meluaskan liputan dengan murah. Ia tidak mencipta maklumat tentang gripper anda, servo sag anda, pencahayaan anda atau ketinggian meja anda yang tidak ada dalam demonstrasi sebenar di suatu tempat. Jika dasar anda gagal kerana efektor akhir tertutup setengah saat terlalu lewat, tiada jumlah variasi simulasi yang dapat memperbaikinya. Itu adalah masalah masa gripper dalam rakaman sebenar.

Satu penemuan MimicGen patut dibawa ke sesi rakaman anda sendiri, kerana ia bertentangan dengan nasihat biasa. Projek ini menjana dua set data di Square D2, satu disemai dengan 10 demo daripada pengendali manusia berkualiti lebih baik dan satu lagi dengan 10 demo daripada pengendali berkualiti lebih rendah, kedua-duanya diambil daripada set data robomimic multi-human Square. Dasar yang dilatih pada setiap satu mencapai hasil yang setanding, yang dibaca oleh penulis sebagai tanda bahawa dalam rejim data berskala besar, kualiti data mungkin tidak begitu penting. Baca dengan teliti, itu adalah kenyataan tentang sepuluh demonstrasi benih, bukan tentang lima puluh episod sebenar anda. Ini bermakna set benih yang sedikit tidak kemas bukanlah penghalang antara anda dan set data yang boleh digunakan. Ini tidak bermakna episod sebenar yang anda latih bersama boleh menjadi tidak kemas, kerana itulah yang membawa maklumat yang tidak dimiliki oleh simulator.

Penyenaraian direktori set data awam AY-Robots yang merekodkan set data LeRobot dengan kiraan episodnya.
Direktori set data awam di /directory. Setiap entri di sini adalah episod rakaman sebenar. Data sintetik adalah pengganda di atas sesuatu seperti ini, bukan pengganti.

Jurang sim-ke-nyata, secara konkrit

Jurang ini biasanya dibincangkan sebagai kuantiti tunggal, yang tidak membantu. Ia sekurang-kurangnya lima ketidakpadanan yang berasingan, dan ia mempunyai saiz yang berbeza pada lengan hobi 110 hingga 150 EUR berbanding pada Franka.

  • Sentuhan dan geseran. Isaac Lab menyatakan dengan jelas bahawa dengan perkakasan yang sama dan versi Isaac Sim dan PhysX yang sama, simulasi boleh dihasilkan semula, tetapi hasilnya berbeza-beza merentasi konfigurasi perkakasan yang berbeza disebabkan oleh ketepatan titik terapung dan ralat pembundaran, dan bahawa PhysX tidak menjamin determinisme untuk mana-mana adegan dengan badan bukan tegar seperti kain atau badan lembut.
  • Penggerakan. Servo bas Feetech STS3215 yang beroperasi pada 7.4 V melendut di bawah beban, mempunyai tindak balas, dan mengubah tingkah laku apabila ia panas. Model MJCF untuk SO-101 meminjam parameter motornya daripada projek yang tidak berkaitan dan bukannya mengenal pastinya pada lengan anda.
  • Pemerian. Bunyi kamera, pengatup bergulir, pendedahan automatik, dan warna tepat meja anda tiada dalam pemerian. Ini adalah separuh daripada jurang yang Cosmos-Transfer1 dibina untuk ditutup: aliran kerja augmentasi robotiknya memetakan satu contoh sintetik robotik kepada pelbagai contoh realistik daripada segmentasi, kedalaman atau pengkondisian tepi.
  • Pemasaan. Simulator melangkah pada kadar tetap. Gelung kawalan sebenar tidak, dan model itu sendiri berharga 20 hingga 485 ms setiap langkah tindakan bergantung pada yang mana anda pilih. Lihat kependaman inferens.
  • Statistik objek. Adegan simulasi diambil sampel daripada taburan yang ditulis oleh seseorang. Meja dapur anda tidak.

Apa yang sebenarnya diketahui oleh SO-100 simulasi tentang lengan anda

Ini adalah bahagian yang menentukan sama ada mana-mana di atas berbaloi untuk hujung minggu anda, dan kejutan pertama ialah SO-100 dan SO-101 tidak dilayan sama rata. Repositori SO-ARM100 TheRobotStudio menyimpan aset simulasinya di bawah Simulation/. Folder SO100 mengandungi satu fail URDF dan tiada yang lain. Folder SO101 mengandungi kedua-dua fail URDF dan MuJoCo: scene.xml, so101_new_calib.xml, so101_old_calib.xml, URDF yang sepadan dan joints_properties.xml. Jika anda mahukan model fizik dan bukannya rantai kinematik, anda mahukan fail SO-101.

Ia dijana dengan pemalam onshape-to-robot daripada model CAD yang direka dalam Onshape, yang bermaksud kinematik dan jaringan visual adalah sebaik CAD. Dinamik adalah cerita yang berbeza, dan README repositori itu sendiri berterus terang tentang tiga perkara. Jaringan perlanggaran asas telah dialih keluar kerana tingkah laku perlanggaran yang bermasalah semasa simulasi dan perancangan. Ciri-ciri motor STS3215 diadaptasi daripada projek Open Duck Mini dan bukannya diukur pada SO-101. Dan konvensyen pengepit LeRobot, di mana 0 adalah tertutup sepenuhnya dan 100 adalah terbuka sepenuhnya, secara eksplisit belum lagi dicerminkan dalam fail URDF dan MuJoCo. Setiap satu daripadanya adalah tempat di mana polisi yang dilatih semata-mata dalam model itu akan berkelakuan berbeza di meja anda.

Konvensyen penentukuran yang memakan masa sehari

Terdapat dua konvensyen sifar dalam fail MuJoCo yang dihantar, dan scene.xml memilih antara keduanya mengikut fail robot yang disertakan. Dalam so101_new_calib.xml, secara lalai, sifar maya setiap sendi terletak di tengah julat sendinya. Dalam so101_old_calib.xml sifar adalah konfigurasi di mana robot dipanjangkan sepenuhnya secara mendatar. Jika episod simulasi anda menggunakan satu konvensyen dan episod sebenar yang direkodkan anda menggunakan yang lain, setiap sudut sendi dalam set data campuran diimbangi oleh puluhan darjah, kerugian masih menurun, dan polisi melakukan sesuatu yang salah dengan yakin. Semak konvensyen di kedua-dua belah pihak sebelum anda melatih bersama, dan baca penentukuran dan kerugian menurun, polisi tidak melakukan apa-apa terlebih dahulu.

Rawak domain, dan apa yang tidak diperbaikinya

Jawapan standard kepada jurang ini adalah untuk berhenti cuba memadankan realiti dan sebaliknya melatih merentasi taburan yang cukup luas sehingga realiti jatuh di dalamnya. Tobin dan rakan-rakan menunjukkan versi kuat ini pada tahun 2017: pengesan objek yang dilatih hanya pada imej simulasi dengan tekstur rawak yang tidak realistik, tanpa pra-latihan pada imej sebenar sama sekali, mengesan objek sebenar dengan ketepatan 1.5 cm dan kekal teguh terhadap gangguan dan oklusi separa.

Isaac Lab mendedahkan idea yang sama seperti istilah acara yang anda lampirkan pada konfigurasi persekitaran. Ini adalah tombol-tombol, mengikut nama fungsi sebenar mereka dalam isaaclab.envs.mdp, jadi anda boleh pergi dan membacanya daripada meneka.

Fungsi acaraApa yang diganggu
randomize_rigid_body_materialGeseran sentuhan dan pemulihan
randomize_rigid_body_mass, randomize_rigid_body_comJisim objek dan pautan, ofset pusat jisim
randomize_actuator_gainsKekakuan dan redaman pengawal sendi
randomize_joint_parameters, randomize_fixed_tendon_parametersGeseran sendi, angker dan had
randomize_visual_texture_material, randomize_visual_colorPenampilan, separuh fotometrik jurang
randomize_physics_scene_gravityVektor graviti
apply_external_force_torque, push_by_setting_velocityGangguan masa jalanan
reset_root_state_uniform, reset_joints_by_offsetPenyebaran keadaan awal pada setiap penetapan semula episod

Ini adalah hadnya, dan inilah yang sering orang terlepas pandang. Rawakan meluaskan taburan yang telah dilihat oleh polisi dalam model yang anda bina. Ia tidak boleh memperkenalkan kesan fizikal yang tidak diwakili oleh simulator. Jika PhysX tidak memodelkan tindak balas dan penurunan terma servo STS3215 anda, merawakan kekakuan mereka tidak mengajar polisi apa-apa tentang tindak balas. Itulah sebabnya lengan yang di bawah polisi yang dilatih sim bukanlah masalah bajet rawakan. Ia adalah masalah pemodelan.

Laluan manual: menjana data dalam Isaac Lab

Isaac Gym adalah perisian legasi. Halaman NVIDIA sendiri bertajuk "Isaac Gym - Kini Tidak Digunakan Lagi" dan menyatakan pembangun boleh memuat turun dan terus menggunakannya tetapi ia tidak lagi disokong, sebaliknya menunjuk kepada Isaac Lab. Jika anda ingin tahu sejarahnya, kami telah merangkumi kedua-duanya: dan . Untuk kerja baharu pada tahun 2026, mulakan dengan Isaac Lab.

  1. 1
    Pasang Isaac Sim dan Isaac Lab

    Halaman pemasangan pip menyatakan bahawa arahan adalah untuk Isaac Sim 5.X, yang memerlukan Python 3.11. Klon sumber memberikan anda skrip yang diperlukan untuk langkah-langkah seterusnya.

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    Rakam kira-kira sepuluh demonstrasi manusia

    Dokumentasi Isaac Lab adalah spesifik: kira-kira 10 demonstrasi yang berjaya diperlukan untuk langkah-langkah berikut berjaya. Petua-petuanya juga spesifik. Pastikan demonstrasi pendek, ambil laluan terus dan bukannya bergerak mengikut paksi arbitrari, dan jangan berhenti seketika, kerana tidak jelas kepada polisi mengapa dan bila untuk berhenti.

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    Anotasi sempadan subtugas

    Mimic membahagikan demonstrasi input kepada subtugas supaya ia boleh menjadualkan semula dan menyasarkan semula segmen. Bendera --auto melakukan ini tanpa campur tangan manusia untuk tugas yang mentakrifkan anotasi automatik; tanpanya anda berhenti dengan B, meneruskan dengan N dan menandakan sempadan dengan S. Perhatikan ID tugas mendapat akhiran -Mimic.

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    Jana set data yang digandakan

    Ini adalah langkah yang mengubah 10 menjadi 1000. Mimic menggunakan kriteria kejayaan boolean kepada setiap calon dan hanya menyimpan yang telah menyelesaikan tugas, jadi kiraan output adalah lebih rendah daripada kiraan percubaan. Dokumen meletakkan kadar kejayaan calon setinggi 70 peratus dalam kes mudah dan di bawah 1 peratus untuk tugas sukar dan robot kompleks: kira-kira 50 peratus untuk susunan kiub Franka, dan 65 hingga 80 peratus untuk GR1T2 pick and place, di mana 1000 demo mengambil masa 18 hingga 40 minit (19 minit pada RTX ADA 6000 pada 80 peratus).

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    Tukar HDF5 kepada set data LeRobot

    Semua di atas menghasilkan HDF5 berperisa robomimic, dan teras Isaac Lab tidak menghantar penukar LeRobot sendiri: dokumennya hanya menyatakan anda boleh menukar set data yang dijana ke format LeRobot. Dua projek membekalkan penukar sebenar. IsaacLab-Arena menghantar satu yang disasarkan GR00T yang didorong sepenuhnya oleh konfigurasi YAML, dan LeIsaac menghantar pasangannya sendiri untuk laluan SO-101 (lihat di bawah).

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
Semat versi anda, dan jangan percaya main

Pada 23 Ogos 2026, dokumentasi Isaac Lab untuk main membawa lencana Isaac Sim 6.0.1 dan menawarkan release/3.0.0 dan v3.0.0-beta2 dalam penukar versinya bersama v2.3.2, manakala halaman pemasangan pip pada pokok yang sama masih menetapkan isaacsim[all,extscache]==5.1.0 dan menerangkan arahan sebagai untuk Isaac Sim 5.X. Kontena blueprint NVIDIA synthetic-manipulation-motion-generation adalah lebih lama lagi: Isaac Lab 2.0.2 pada Isaac Sim 4.5.0. Jadual keserasian LeIsaac sendiri menggandingkan Isaac Sim 5.1 dengan Isaac Lab v2.3.0. Pokok-pokok ini bergerak lebih pantas daripada yang didokumentasikan. Pilih satu keluaran, catatkannya, dan jangkakan laluan skrip dan nama bendera telah berubah jika anda mengikuti tutorial yang ditulis tiga bulan lalu.

Mengapa percubaan penjanaan gagal, dan apa yang perlu diubah

Kadar kejayaan calon yang berayun antara 70 peratus dan di bawah 1 peratus bukanlah misteri, dan Isaac Lab mendokumentasikan perangkap biasa daripada membiarkan anda meneka. Setiap satu daripadanya adalah sesuatu yang anda kawal semasa masa rakaman, itulah sebabnya penting untuk membaca senarai ini sebelum anda merakam sepuluh demonstrasi benih dan bukannya selepas larian penjanaan pertama yang mengecewakan.

  • Demonstrasi terlalu panjang. Horizon masa yang lebih panjang lebih sukar untuk dipelajari oleh polisi. Mulakan dekat dengan objek pertama dan minimumkan pergerakan.
  • Demonstrasi tidak lancar. Pergerakan tidak teratur sukar untuk ditafsirkan oleh polisi, dan perkakasan teleoperasi yang lebih baik memberikan data yang lebih baik: dokumen menyatakan dengan jelas bahawa SpaceMouse lebih baik daripada papan kekunci.
  • Jeda. Jeda sukar dipelajari, kerana tidak jelas kepada polisi mengapa dan bila untuk berhenti seketika. Pastikan pergerakan lancar.
  • Terlalu banyak subtugas. Lebih banyak subtugas bermakna lebih banyak penyambungan antara segmen trajektori, yang menghasilkan pergerakan kurang lancar dan kadar kejayaan penjanaan yang lebih rendah. Anotasi sempadan di mana lengan tidak mungkin bertembung dengan apa-apa.
  • Tiada hingar tindakan. Hingar tindakan menjadikan polisi yang terhasil lebih teguh.
  • Rakaman dipotong terlalu ketat. Jika rakaman berhenti pada bingkai tepat di mana istilah kejayaan dicetuskan, ia mungkin tidak dicetuskan semula semasa main semula. Tinggalkan penimbal di hujung.
  • Main semula tidak deterministik. Fizik dalam Isaac Lab tidak boleh dihasilkan semula secara deterministik merentasi env.reset, jadi beberapa demo manusia gagal semasa main semula. Kumpul lebih daripada yang anda perlukan dan simpan yang terselamat daripada anotasi. Segala-galanya yang mendarat dalam fail HDF5 yang dijana Mimic adalah demo yang berjaya dan boleh digunakan untuk latihan walaupun main semula kemudian gagal.

Langkah interpolasi antara segmen subtugas yang disambung mempunyai tombol penalaannya sendiri, dan bilangan langkah interpolasi yang anda perlukan berskala dengan kelajuan pergerakan robot dan keluasan taburan penetapan semula objek. Tugas yang kompleks dengan taburan penetapan semula yang besar meninggalkan jurang yang lebih besar antara segmen, yang memerlukan lebih banyak langkah interpolasi untuk menghasilkan pergerakan berterusan. Jika video yang anda hasilkan menunjukkan lengan tersentak-sentak antara fasa, itulah parameter yang perlu dilihat sebelum anda menyalahkan demo benih.

Saluran paip yang sama pada SO-101, dengan lengan pemimpin sebenar

Ini adalah yang menarik bagi sesiapa sahaja yang membaca halaman ini, kerana ia adalah satu-satunya saluran paip terbuka yang meletakkan SO-101 di dalam Isaac Lab dan membolehkan anda memacunya dengan lengan pemimpin fizikal yang anda sudah miliki. LeIsaac, versi 0.4.0 pada masa penulisan, adalah taman permainan simulasi pembelajaran tiruan rasmi yang diintegrasikan ke dalam EnvHub LeRobot. Jadual keserasiannya menyenaraikan tiga kombinasi yang berfungsi; yang terbaru menggabungkan Isaac Sim 5.1 dengan Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 dan Python 3.11, dan dokumen mengesyorkan Isaac Sim 5.0 atau yang lebih baru untuk kad siri 50.

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac dari sumber. Pin numpy ada dalam arahan rasmi, bukan penyelesaian sementara.

Dengan itu, lengan pemimpin pada /dev/ttyACM0 memacu pengikut simulasi dan merekod terus ke HDF5. Gelung pemimpin-pengikut adalah sama seperti yang anda sudah tahu dari rakaman sebenar, hanya pengikut adalah badan tegar dalam PhysX.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
Environment IDPenerangan tugasRobot
LeIsaac-SO101-PickOrange-v0Pilih tiga oren dan letakkannya ke dalam pinggan, kemudian tetapkan semula lengan ke keadaan rehatSingle-arm SO101 follower
LeIsaac-SO101-LiftCube-v0Angkat kiub merah ke atasSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0Pilih dua objek huruf e ke dalam kotak, kemudian tetapkan semula lengan ke keadaan rehatSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0Tugas yang sama dengan dua lenganBi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0Lipat kain, kemudian tetapkan semula lengan ke keadaan rehat. Hanya varian DirectEnv menyokong check_successBi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0Ambil sampah tisu dari lantai dan buangkannya ke dalam tong sampahLeKiwi

Kebanyakan ID tersebut juga wujud sebagai -Direct-v0 varian, dan python scripts/environments/list_envs.py mencetak senarai semasa. Anda juga boleh melangkau lencongan HDF5 sepenuhnya dan menulis format LeRobot semasa teleoperasi dengan menambah tiga bendera. Dua peringatan datang dari dokumentasi itu sendiri: perakam secara automatik melangkau 5 bingkai pertama setiap episod untuk mengelakkan ketidakstabilan dari keadaan awal, dan ia mungkin menyebabkan sedikit kelewatan dalam teleoperasi, yang merupakan jenis perkara yang secara senyap mengubah ciri demonstrasi anda. Ia juga hanya membuang episod yang ditandakan sebagai berjaya oleh tugas.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

Langkah pendaraban kemudian dijalankan pada rakaman tersebut. LeIsaac membalut Isaac Lab Mimic dalam empat arahan, kerana Mimic menggeneralisasikan trajektori daripada pose hujung-efektor dan objek: menukar tindakan ruang sendi kepada tindakan berasaskan IK, menganotasi, menjana, kemudian menukar kembali ke ruang sendi.

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

Kemudian tukar kepada LeRobot. Ini adalah langkah di mana peraturan format platform menjadi penting, dan LeIsaac kebetulan menyediakan tepat dua penukar yang anda perlukan: isaaclab2lerobot.py menulis LeRobot v2, iaitu apa yang digunakan oleh pemuat GR00T, dan isaaclab2lerobotv3.py menulis v3 untuk Pi0.5, SmolVLA dan ACT. Kedua-dua skrip mengambil argumen yang sama tetapi menetapkan versi lerobot yang berbeza, dan hanya episod yang berjaya ditukar.

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
Output LeRobot v2 untuk GR00T. Tukar kepada isaaclab2lerobotv3.py, dengan lerobot 0.4.2, untuk pelatih v3.
Terdapat jalan keluar tanpa GPU

LeIsaac mendokumentasikan menjalankan keseluruhan timbunan pada NVIDIA Brev: gunakan, klik pautan port 80 untuk membuka Pelayan VS Code berasaskan pelayar, dan jalankan empat senario pra-pasang dengan --kit_args="--no-window --enable omni.kit.livestream.webrtc", melihat paparan pada alamat yang sama dengan /viewer ditambahkan. Jika anda tidak mempunyai kad stesen kerja di bawah meja anda, itu adalah cara yang lebih murah untuk mengetahui sama ada versi simulasi tugas anda hampir tepat sebelum anda komit perkakasan kepadanya.

Dua laluan ke polisi terlatih

Anda membina adegan, menjana data, menyewa GPU dan menyediakan perkhidmatan sendiri. Ini adalah pilihan yang tepat jika tugas memerlukan variasi persekitaran yang tidak dapat anda sediakan secara fizikal, atau jika anda mahukan penilaian yang boleh diulang.

  1. Pasang Isaac Sim 5.1 dan Isaac Lab, atau susunan LeIsaac jika robot anda adalah SO-101.
  2. Modelkan atau import adegan. Ini adalah langkah yang tiada siapa bajet dan biasanya yang paling lama.
  3. Rakam kira-kira 10 demonstrasi bersih melalui pengikut simulasi.
  4. Anotasi subtugas, jalankan generate_dataset.py, dan terima bahawa kegagalan dibuang.
  5. Tukar HDF5 ke format LeRobot, memilih v2 untuk GR00T dan v3 untuk yang lain.
  6. Rakam episod sebenar pada lengan fizikal, kemudian latih bersama pada campuran.
  7. Sewa GPU, jalankan penalaan halus, sediakan checkpoint di sebelah lengan.
SumberApa yang dinyatakan oleh sumber
GPU simulasi tempatanPelan tindakan manipulasi sintetik NVIDIA memerlukan Ubuntu 22.04 dan NVIDIA RTX A6000 dengan 48 GB VRAM
Nod model duniaPelan tindakan yang sama memerlukan H100 atau lebih tinggi dengan 80 GB, pada nod yang berasingan daripada simulasi Isaac Lab
Versi kontenaIsaac Lab 2.0.2 pada Isaac Sim 4.5.0 di dalam imej pelan tindakan itu
Daya pemprosesan penjanaanIsaac Lab melaporkan 1000 demo pilih-dan-letak GR1T2 dalam 18 hingga 40 minit, 19 minit pada RTX ADA 6000 pada 80 peratus kejayaan
Kos trajektori neuralGR00T N1 melaporkan kira-kira 105,000 jam GPU L40, kira-kira 1.5 hari pada 3,600 L40, untuk 827 jam impiannya
Kos sebenar adalah masa kalendar, bukan masa GPU

Menjana 1000 trajektori adalah kerja petang. Mendapatkan adegan anda, ekstrinsik kamera anda, jaring objek anda dan model servo anda cukup dekat sehingga trajektori tersebut berpindah adalah di mana minggu-minggu berlalu. Bajet untuk pemodelan, bukan pensampelan.

Model dunia video: lapisan terbaru, dan yang paling kurang diukur

Idea di sebalik DreamGen ialah model generatif video, yang disesuaikan dengan perwujudan robot sasaran, boleh membayangkan episod yang munasabah dalam adegan yang tidak pernah anda lawati. Saluran paip ini mempunyai empat peringkat: penalaan halus model dunia video, menjana video robot sintetik fotorealistik, memulihkan urutan pseudo-tindakan dengan model tindakan laten atau model dinamik songsang, kemudian melatih polisi robot berdasarkan hasilnya. Repositori GR00T-dreams NVIDIA melaksanakan perkara itu.

Hasil utama adalah nyata dan patut diambil serius: data teleoperasi daripada hanya satu tugas pilih-dan-letak dalam satu persekitaran menghasilkan 22 tingkah laku baharu pada humanoid, dalam persekitaran yang pernah dilihat dan belum pernah dilihat. Peringatan itu juga nyata dan terletak pada peringkat ketiga.

Model dunia video sebagai sumber data
Kelebihan
  • Ia berskala sepanjang paksi yang sememangnya mahal di dunia nyata: adegan baharu, susunan objek baharu, frasa arahan baharu.
  • GR00T-dreams menyenaraikan empat perwujudan yang disokong untuk skrip pengekstrakan tindakan dan penalaan halus: franka, gr1, robocasa dan so100. Ini bukan teknik khusus humanoid.
  • Cosmos-Transfer1 menyerang separuh fotometrik jurang secara langsung, memetakan satu contoh sintetik robotik kepada beberapa contoh realistik daripada segmentasi, kedalaman atau pengkondisian tepi. Isaac Lab sendiri menghantar alat gesaan untuknya di bawah scripts/tools/cosmos.
  • Kerja DreamGen menghantar DreamGen Bench, penanda aras penjanaan video yang menunjukkan korelasi kuat antara prestasi penanda aras dan kejayaan polisi hiliran, jadi anda boleh menyaring generasi sebelum melatihnya.
Pertukaran
  • Tindakan diperoleh semula oleh model, bukan diukur oleh pengekod. Video yang kelihatan betul boleh membawa trajektori sendi yang tidak dapat dilaksanakan oleh lengan anda.
  • Penjanaan adalah mahal. GR00T N1 melaporkan dua minit untuk menjana satu saat video pada L40, kira-kira 105,000 jam GPU L40, kira-kira 1.5 hari pada 3,600 GPU L40, untuk 827 jam trajektori neuralnya.
  • Keuntungan yang diukur berada dalam satu digit: 4.2, 8.8 dan 6.8 mata pada RoboCasa merentasi tiga rejim data, dan 5.8 mata purata lebih 8 tugas GR-1 sebenar, di atas model yang sudah mempunyai data sebenar.
  • Tiada resipi yang diterbitkan mengesahkan ini untuk lengan servo hobi 7.4 V secara menyeluruh. Anda akan melakukan porting, bukan mengikutinya.
Jangan sekali-kali membekalkan 12 V kepada STS3215

Tidak berkaitan dengan simulasi, tetapi ia timbul setiap kali seseorang beralih daripada lengan simulasi kepada lengan sebenar dan mengimprovisasi bekalan kuasa. Lengan SO-100, SO-101 dan LeKiwi semuanya menggunakan servo Feetech STS3215 pada 7.4 V. Membekalkan 12 V kepada mereka akan memusnahkannya, dan LeKiwi adalah perangkap tertentu kerana rel dasarnya adalah 12 V. Lihat halaman perkakasan SO-100 sebelum anda membuat sebarang pendawaian.

Latihan bersama adalah resipi yang sebenarnya menunjukkan keuntungan

Jika anda mengambil satu pengajaran operasi daripada literatur, ambillah yang ini. Kajian latihan bersama sim-dan-nyata (Maddukuri dan rakan-rakan, 2025) bertujuan untuk mencari resipi mudah untuk menggunakan data simulasi bagi menyelesaikan tugas manipulasi robotik berasaskan penglihatan, merentasi dua domain, lengan robot dan humanoid, dan kesimpulannya ialah anda melatih pada campuran. Data simulasi meningkatkan prestasi tugas dunia nyata secara purata sebanyak 38 peratus, dan kertas kerja itu menyatakan dengan jelas bahawa ini berlaku walaupun terdapat perbezaan ketara antara data simulasi dan data dunia nyata.

Klausa terakhir itu lebih penting daripada 38 peratus. Ini bermakna simulasi tidak perlu menjadi kembar digital yang sempurna untuk berguna, asalkan data sebenar ada dalam campuran untuk menjadi sauhnya. Pemindahan hanya-simulasi adalah laluan yang mahal: kertas kerja yang sama menyatakan bahawa melatih polisi semata-mata dalam simulasi dan memindahkannya ke dunia nyata sering menuntut usaha manusia yang besar untuk merapatkan jurang realiti. Latihan bersama melangkau kebanyakan usaha itu dengan tidak pernah meminta polisi untuk menutup jurang itu sendiri.

Jadual perbandingan polisi AY-Robots yang menunjukkan parameter, tahap GPU, kependaman inferens dan episod minimum untuk GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT.
Lima polisi yang boleh dilatih di /policies. Lajur episod minimum adalah nombor yang menentukan sama ada data sintetik adalah sesuatu yang bagus untuk dimiliki atau satu-satunya cara anda mencapai set data yang boleh dilatih.

Secara praktikal, di platform ini, latihan bersama bermaksud satu perkara: letakkan kedua-dua set episod dalam set data LeRobot yang sama dengan kunci kamera yang konsisten, susunan sendi yang konsisten dan unit yang konsisten, kemudian jalankan penalaan halus biasa. Tiada tombol berat campuran dalam borang latihan. Jika anda mahukan nisbah sim-ke-nyata 3:1, anda menyatakan itu dengan berapa banyak episod setiap satu yang anda masukkan ke dalam set data.

Kemenangan termurah dari simulasi bukanlah data latihan

Ia adalah penilaian. Menjalankan berdozen percubaan sebenar bagi setiap tugas untuk membandingkan dua adalah satu hari masa lengan, dan lengan itu bergerak antara percubaan. SIMPLER (Li dan rakan-rakan, 2024) membina persekitaran simulasi yang tujuannya adalah untuk menilai polisi sebenar dan bukannya melatihnya, dan kemudian mengukur sejauh mana kedudukan sim meramalkan kedudukan sebenar. Satu persekitaran SIMPLER tunggal memaparkan pada 3,500 langkah simulasi sesaat pada RTX 4090 pengguna pada resolusi 640 kali 512, yang di bawah frekuensi simulasi 500 Hz adalah peningkatan kelajuan 7x berbanding penilaian sebenar.

Protokol penilaianMMRV (lebih rendah lebih baik)Pearson r (lebih tinggi lebih baik)
MSE Pengesahan0.3750.308
SIMPLER, agregasi varian0.1430.778
SIMPLER, padanan visual0.0560.924

Itu adalah purata bagi tiga kumpulan tugas Google Robot untuk enam titik semak sumber terbuka yang biasa: tiga titik semak RT-1 pada peringkat latihan yang berbeza, RT-1-X, RT-2-X dan Octo-Base. Bahagian sebenar bukanlah kiraan percubaan yang seragam, yang patut diketahui sebelum anda memetiknya: 75 percubaan untuk mengambil tin kok, 60 untuk bergerak dekat, 54 untuk tugas membuka dan menutup laci dan 27 untuk tugas laci-dan-epal yang lebih panjang. Perbandingan dengan MSE pengesahan adalah bahagian yang berguna. Pemilihan model melalui kerugian pengesahan meletakkan titik semak ini dengan teruk, dan Pearson r sebanyak 0.924 di bawah padanan visual bermakna jika titik semak mendapat skor lebih baik dalam SIMPLER, ia kemungkinan besar mendapat skor lebih baik di bangku ujian. Itu adalah papan skor semalaman yang boleh diulang, dan ia tidak memerlukan anda untuk mempercayai apa-apa tentang pemindahan latihan sim-ke-nyata.

Papan pendahulu AY-Robots Arena, jadual boleh isih bagi 85 model visi-bahasa-tindakan dengan 332 hasil penanda aras, setiap nilai dipautkan ke kertas sumber atau kad modelnya.
Arena di /arena mengumpul 332 hasil penanda aras merentasi 85 model. Hampir kesemuanya adalah penanda aras simulasi, yang merupakan inti pati hujah SIMPLER: simulasi adalah papan skor yang baik jauh sebelum ia menjadi sumber data yang baik.

Jika anda ingin konteks yang lebih luas tentang apa yang diberitahu dan tidak diberitahu oleh nombor penanda aras ini mengenai model visi-bahasa-tindakan, kami telah menulisnya secara berasingan dalam gambaran keseluruhan VLA.

Di mana platform ini tidak membantu anda

Menjelaskan sempadan menjimatkan masa semua orang. AY-Robots adalah platform rakaman, latihan dan penyediaan. Ia tidak mempunyai simulator di dalamnya.

  • Tiada Isaac Lab, tiada MimicGen, tiada model dunia, tiada pengarangan adegan. Jika anda mahukan data yang dijana, anda menjananya di tempat lain dan membawa hasilnya.
  • Pelatih menggunakan set data LeRobot dan tiada yang lain. Eksport simulator perlu ditukar sebelum menjadi input, dan ia mestilah versi yang betul: v2.0 atau v2.1 untuk GR00T N1.5 dan N1.7, v3.0 untuk Pi0.5, SmolVLA dan ACT.
  • Titik masuk penalaan halus GR00T ialah CLI tyro yang tidak mendedahkan sebarang seed, jadi larian GR00T tidak boleh dihasilkan semula bit-demi-bit. Jika anda menjalankan ablasi sim-berbanding-nyata yang teliti, itu adalah batasan sebenar. Seed lalai lerobot sendiri ialah 1000, dan borang ACT, SmolVLA serta Pi0.5 mendedahkan medan seed.
  • Pengumpulan gradien hanya sebenarnya digunakan untuk dua pelatih GR00T. Untuk Pi0.5 dan SmolVLA medan itu wujud dalam borang tetapi lerobot 0.5.1 tidak mempunyai bendera sedemikian, jadi ia tidak melakukan apa-apa.
  • Inferens perlu berada di sebelah servo untuk tugas pantas. Gelung kawalan adalah 20 hingga 485 ms setiap langkah tindakan bergantung pada model, dan menambah perjalanan pergi balik internet awam mengubah polisi yang berfungsi menjadi ragu-ragu. Inferens jauh boleh dilaksanakan untuk pick-and-place yang perlahan, bukan untuk gerakan reaktif yang pantas.
Apa yang anda boleh lakukan di sini yang benar-benar sukar di tempat lain

Rakam separuh sebenar campuran latihan bersama tanpa memiliki lengan. /live menstrim SO-100 fizikal tanpa pendaftaran, berasaskan giliran, dan program pengendali wujud kerana seseorang perlu memandunya. Jika kesesakan anda ialah anda mempunyai simulator dan tiada episod sebenar, itulah jurang yang ditutup oleh platform ini.

Bajet yang boleh anda pertahankan

Letakkan kedua-dua laluan bersebelahan dengan nombor yang diterbitkan oleh setiap satu, dan keputusan biasanya akan terbentuk dengan sendirinya untuk projek satu tugas pada lengan kos rendah.

Item BarisSimulasi-dahuluRekod-dahulu
Pemodelan AwalAdegan, jaring, penempatan kamera, model servo. Hari hingga mingguNone
Pengumpulan DataKira-kira 10 demo dalam simulasi, kemudian penjanaan30 to 50 real episodes, a few hours of teleoperation
Perkakasan untuk DimilikiKad 48 GB untuk pelan induk Isaac Lab, 80 GB untuk peringkat CosmosLengan dan komputer riba
Kos LatihanSama seperti lajur kanan, pelatih tidak peduli dari mana data datang1 to 3 USD on the 4090 tier, 4 to 12 USD on the A100 or H100 tier
Bukti Terbaik PulanganPurata keuntungan dunia sebenar 38 peratus apabila dilatih bersama, 4 hingga 9 mata daripada trajektori neuralGaris dasar yang menjadi ukuran segala di atas
Gagal apabilaTugas anda bergantung pada sentuhan, bahan boleh ubah bentuk atau pematuhan servoAnda memerlukan variasi persekitaran yang tidak dapat anda sediakan secara fizikal

Untuk polisi pertama pada SO-100, rekod. dan membawa anda ke pusat pemeriksaan yang disediakan dengan harga secawan kopi, dan anda akan mempunyai separuh sebenar daripada sebarang campuran latihan bersama di masa hadapan. Gunakan simulator apabila anda mempunyai garis dasar yang berfungsi dan kegagalan generalisasi khusus yang boleh anda namakan, seperti polisi yang .

Belum ada lengan di meja anda?

Pandu SO-100 sebenar dalam pelayar, berasaskan giliran, tanpa pendaftaran, dan lihat bagaimana rupa episod sebenar sebelum anda menghabiskan hujung minggu memodelkannya dalam simulator.

Pandu lengan sebenar

Resipi yang menghormati bukti

  1. 1
    Rekod garis dasar sebenar dahulu

    30 episod untuk SmolVLA, 50 untuk ACT, GR00T N1.7 dan Pi0.5. Latih sekali. Apa sahaja yang gagal pada polisi itu adalah spesifikasi anda untuk data sintetik.

  2. 2
    Namakan kegagalan generalisasi

    Kedudukan objek? Pencahayaan? Ketinggian meja? Pengganggu? Frasa arahan yang berbeza? Data sintetik hanya bagus untuk satu daripada ini pada satu masa, dan tidak berguna jika anda tidak dapat menyatakan yang mana.

  3. 3
    Pilih keluarga termurah yang meliputinya

    Variasi kedudukan dan susun atur: pendaraban trajektori. Pencahayaan dan tekstur: augmentasi imej dahulu, model dunia kedua. Adegan baharu sepenuhnya: pelancaran fizik, dan terima kos pemodelan.

  4. 4
    Jana, kemudian buang secara agresif

    Percubaan penjanaan gagal, dan kadar kejayaan calon Isaac Lab sendiri berkisar antara 70 peratus hingga di bawah 1 peratus bergantung pada tugas. Simpan hanya trajektori yang berjaya dan melengkapkan tugas, dan periksa sampel sebagai video sebelum anda mempercayai kelompok itu.

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    Latih bersama, jangan ganti

    Gabungkan episod yang dijana dengan yang sebenar ke dalam satu set data LeRobot dengan kunci kamera dan susunan sendi yang sama. Angka 38 peratus adalah angka latihan bersama.

  6. 6
    Nilai pada lengan sebenar, dan hanya di sana

    Penilaian simulasi adalah isyarat kedudukan yang baik (Pearson r 0.924 dalam persediaan padanan visual SIMPLER) tetapi ia bukan ujian penerimaan. Jalankan titik semak pada bangku sebelum anda mempercayainya.

Jika anda lebih suka bermula dari senarai semak untuk rakaman sebenar itu sendiri, , meliputi penempatan kamera, implikasi dan mod kegagalan yang menjadikan set data tidak boleh digunakan. Butiran mengenai format itu sendiri terdapat dalam , dan bahagian hiperparameter dalam .

Bolehkah saya melatih polisi robot sepenuhnya menggunakan data sintetik?

Untuk tugas manipulasi pada lengan sebenar, tidak boleh dipercayai. Setiap hasil yang diterbitkan dengan angka yang kukuh adalah hasil latihan bersama atau hasil augmentasi di atas data sebenar. Perbandingan MimicGen sendiri meletakkan 200 demo yang dijana pada 79 peratus berbanding 84 peratus untuk 200 demo manusia pada tugas yang sama, dan kertas latihan bersama sim-dan-sebenar 2025 menyatakan bahawa latihan semata-mata dalam simulasi dan pemindahan sering menuntut usaha manusia yang besar untuk merapatkan jurang realiti. RoboCasa menunjukkan data yang dijana mengalahkan data manusia pada 47.6 berbanding 28.8 peratus, tetapi hanya dengan 72,000 demo yang dijana berbanding 1,250 demo manusia, di dalam simulator yang menghasilkan kedua-duanya.

Berapa banyak episod sebenar yang masih saya perlukan jika saya menjana yang sintetik?

Pada AY-Robots, pelatih memerlukan minimum 30 episod untuk SmolVLA dan 50 untuk ACT, GR00T N1.5, GR00T N1.7 dan Pi0.5, tanpa mengira dari mana episod itu datang. Dokumentasi Mimic Isaac Lab menyatakan kira-kira 10 demonstrasi manusia yang berjaya diperlukan sebagai benih untuk penjanaan. Itu adalah nombor yang berbeza yang menjawab soalan yang berbeza: 10 adalah apa yang diperlukan oleh penjana, 30 hingga 50 adalah apa yang diperlukan oleh pelatih.

Adakah data simulasi perlu dalam format LeRobot?

Untuk melatih pada platform ini, ya. Isaac Lab dan LeIsaac kedua-duanya menghasilkan HDF5 berjenama robomimic. Teras Isaac Lab tidak menyertakan penukar LeRobot, tetapi LeIsaac menyertakan isaaclab2lerobot.py untuk LeRobot v2 dan isaaclab2lerobotv3.py untuk v3, dan IsaacLab-Arena menyertakan convert_hdf5_to_lerobot.py yang disasarkan GR00T yang didorong oleh konfigurasi YAML. Perhatikan versi: GR00T N1.5 dan N1.7 mengambil LeRobot v2.0 atau v2.1, manakala Pi0.5, SmolVLA dan ACT mengambil v3.0. Set data v3.0 akan menyebabkan pemuat GR00T ranap dan perlu ditukar kepada v2.1.

Adakah Isaac Gym masih perkara yang betul untuk dipelajari pada tahun 2026?

Tidak. Halaman produk NVIDIA sendiri bertajuk "Isaac Gym - Kini Tidak Digunakan Lagi" dan menyatakan bahawa ini adalah perisian legasi, bahawa pembangun boleh memuat turun dan terus menggunakannya tetapi ia tidak lagi disokong, dan menunjuk kepada Isaac Lab sebagai pengganti. Isaac Lab menyertakan panduan migrasi dari IsaacGymEnvs, dari OmniIsaacGymEnvs dan dari Orbit, jadi persekitaran sedia ada boleh dialihkan dan bukannya hilang.

Bolehkah saya meletakkan SO-100 atau SO-101 dalam Isaac Lab?

SO-101, ya, dengan betul. Repositori TheRobotStudio menyertakan kedua-dua fail URDF dan MJCF untuk SO-101, yang dijana dengan onshape-to-robot dari model CAD Onshape, dan LeIsaac menyediakan tugas Isaac Lab yang sedia ada seperti LeIsaac-SO101-PickOrange-v0 dengan teleoperasi dari lengan pemimpin fizikal SO101. Untuk SO-100, repositori yang sama hanya menyertakan satu URDF dan tiada model MuJoCo. Berhati-hati dengan had yang dinyatakan dalam README SO-101: mesh perlanggaran asas telah dialih keluar kerana tingkah laku perlanggaran yang bermasalah, sifat motor STS3215 disesuaikan dari projek Open Duck Mini dan bukannya dikenal pasti pada SO-101, dan konvensyen gripper 0-tertutup hingga 100-terbuka belum lagi dicerminkan dalam fail model.

Adakah platform ini menjalankan simulasi untuk saya?

Tidak. AY-Robots merekodkan set data LeRobot dari teleoperasi sebenar, menyelaraskan lima polisi yang disokong pada GPU sewa, dan menghantar titik semak yang terhasil kembali ke lengan. Tiada simulator, tiada penjanaan data sintetik dan tiada pengarang adegan di dalamnya. Jika anda menjana data di tempat lain dan menukarnya kepada set data LeRobot yang sah, pelatih akan menerimanya sama seperti rakaman sebenar.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started