Latihan policy
AY-Robots melatih policy manipulasi pada GPU terurus, jadi anda boleh beralih daripada episod yang dirakam kepada policy yang berjalan pada lengan anda tanpa memiliki perkakasan latihan sendiri. Halaman ini merangkumi jenis policy yang disokong, halaman larian latihan, checkpoint, dan hasil realistik yang boleh dijangka daripada bilangan episod anda.
Terakhir dikemas kini 2026-08-09
Latihan tanpa GPU sendiri
Melatih policy manipulasi ialah beban kerja GPU, dan model vision-language-action moden memerlukan lebih banyak VRAM daripada stesen kerja biasa. Di AY-Robots latihan berjalan pada GPU awan yang diuruskan oleh platform: anda pilih set data dan jenis policy, mulakan larian itu, dan tonton kemajuannya daripada pelayar. Tiada persediaan CUDA, tiada padanan driver, dan tiada persekitaran untuk diselenggara.
Input sentiasa set data awan daripada Dashboard > Datasets. Apa jua yang anda rakam melalui sesi teleoperasi atau muat naik dalam format LeRobot layak digunakan, termasuk set data gabungan. Uruskan sebelum melatih: episod berlabel Failure biasanya perlu dikeluarkan daripada set latihan, dan sepuluh minit semakan dalam pelayar episod menjimatkan berjam-jam masa GPU yang dibelanjakan untuk belajar daripada demonstrasi yang buruk.
Policy yang disokong
Empat keluarga policy disokong. Ia berbeza dari segi saiz, kos latihan, dan sejauh mana ia boleh menyerap daripada data anda, jadi pilihan yang tepat lebih bergantung pada tugas dan set data anda daripada mana-mana kedudukan umum.
| Policy | Jenis | Ciri |
|---|---|---|
| ACT | Transformer, action chunking | Meramal ketulan pendek tindakan masa depan dan bukannya langkah tunggal. Padat, dilatih dengan agak pantas, dan pilihan pertama yang kukuh untuk satu tugas tunggal yang jelas ditakrifkan. |
| Diffusion Policy | Diffusion ke atas urutan tindakan | Memodelkan taburan penuh tindakan yang didemonstrasikan, yang membantu apabila demonstrasi anda menyelesaikan tugas dengan lebih daripada satu cara yang sah. Lebih berat untuk dilatih dan lebih perlahan pada inference berbanding ACT. |
| SmolVLA | Model vision-language-action kecil | Bersyarat bahasa: rentetan tugas daripada episod anda menjadi sebahagian daripada input. Titik tengah yang baik apabila anda mahu pensyaratan bahasa tanpa model foundation yang besar. |
| fine-tune GR00T | fine-tune model foundation | Melakukan fine-tune model foundation robotik yang besar dan telah dilatih terlebih dahulu pada episod anda. Siling tertinggi daripada keempat-empat itu, pada kos latihan tertinggi, dan dengan keperluan format set data yang ketat. |
Fine-tuning untuk GR00T hanya menerima set data dalam format LeRobot versi 2.1. Set data v3.0 akan gagal semasa pemuatan data, bukan semasa penyerahan, jadi semak versi format sebelum memulakan larian. Set data yang dirakam pada platform boleh digunakan sebagaimana adanya; untuk muat naik luaran, sahkan versinya dahulu dalam meta/info.json.
Memulakan larian
- 1Pilih set data
Buka Dashboard > Training dan pilih set data untuk dilatih. Bilangan episod dan jenis robot dipaparkan supaya anda dapat mengesahkan pilihan yang betul.
- 2Pilih policy
Pilih salah satu jenis policy yang disokong. Jika tidak pasti, mulakan dengan ACT: cara paling murah untuk mengetahui sama ada set data anda cukup baik untuk melatih apa-apa pun.
- 3Lancarkan
Mulakan larian itu. Ia mendapat job id dan halaman larian sendiri, dan anda boleh menutup pelayar: latihan diteruskan di sisi pelayan dan halaman itu menunjukkan keadaan langsung apabila anda kembali.
Halaman larian latihan
Setiap larian mempunyai halaman khusus yang menjawab dua soalan yang benar-benar anda ada semasa latihan: adakah ia sedang belajar, dan adakah mesin itu sihat. Kemajuan pembelajaran ditunjukkan sebagai carta loss, jadual kadar pembelajaran, dan norma gradien. Loss yang segera mencapai plateau atau norma gradien yang meletup memberitahu anda lebih awal bahawa larian itu tidak berbaloi ditunggu.
Kesihatan mesin dipaparkan bersebelahan: penggunaan dan memori GPU, ditambah metrik hos mesin latihan. Garis masa fasa menunjukkan di mana larian itu berada sekarang, daripada penyediaan persekitaran hingga pemuatan data, gelung latihan itu sendiri, dan muat naik checkpoint. Apabila sesuatu kelihatan tidak kena, pemapar log terbina dalam memberi anda log latihan mentah tanpa sebarang akses SSH, yang biasanya cukup untuk melihat sama ada kegagalan itu daripada set data anda atau larian itu sendiri.
Checkpoint dan menyambung semula
Checkpoint disimpan mengikut larian, bukan dalam kumpulan bersama, jadi checkpoint yang disenaraikan pada halaman larian sentiasa tergolong dalam larian dan konfigurasinya yang tepat itu. Ini lebih penting daripada yang kedengaran: mencampurkan checkpoint merentasi larian dengan tetapan berbeza ialah punca klasik policy yang rosak secara senyap.
Jika larian terganggu, anda boleh menyambung semula daripada checkpoint terkininya dan bukannya bermula dari awal. Checkpoint pertengahan juga berguna dengan sendirinya: apabila larian panjang mula overfitting menghampiri penghujung, checkpoint yang lebih awal selalunya berjalan lebih baik pada lengan sebenar berbanding yang terakhir.
Menjalankan policy terlatih pada lengan anda
Policy yang siap boleh digunakan terus semula pada robot anda. Dalam cockpit, pilih policy terlatih untuk lengan anda yang tersambung dan mulakan inference: policy itu kini menghasilkan arahan sendi yang sebelum ini anda hasilkan melalui teleoperasi. Lengan itu mesti jenis robot yang sama seperti tempat set data itu dirakam, dan adegan itu perlu menyerupai adegan latihan, termasuk kedudukan kamera.
Layankan larian inference pertama seperti eksperimen, bukan demonstrasi. Pastikan henti kecemasan berada dalam jangkauan, mulakan daripada keadaan permulaan yang hampir dengan apa yang anda demonstrasikan, dan jangkakan policy itu sensitif kepada perkara yang anda mungkin tidak perasan: kamera yang dipindahkan, pencahayaan berbeza, atau objek yang tidak pernah ada dalam set data.
Berapa banyak episod yang anda perlukan
Kesilapan latihan paling biasa pada platform bukan hiperparameter yang salah, tetapi melatih dengan data yang terlalu sedikit dan membuat kesimpulan bahawa jenis policy itu tidak berfungsi. Sebagai panduan kasar untuk satu tugas meja tunggal: kira-kira 50 episod memberi anda policy dengan generalisasi sempit yang berjaya daripada keadaan permulaan yang hampir dengan apa yang anda demonstrasikan. Kira-kira 100 hingga 200 episod memberikan keteguhan yang boleh digunakan merentasi ruang kerja untuk satu tugas itu, dengan syarat anda mempelbagaikan penempatan objek antara episod.
Jenis policy yang lebih berkeupayaan tidak membatalkan ini. fine-tune GR00T pada 20 episod masih akan menggeneralisasi dengan lemah; apa yang dibeli oleh model yang lebih besar ialah siling yang lebih baik sebaik sahaja data itu ada. Jika bajet anda terhad, belanjakannya pada episod yang lebih pelbagai sebelum membelanjakannya pada model yang lebih besar.
Soalan lazim
Berapa lama satu larian latihan mengambil masa?▾
Bergantung pada jenis policy dan saiz set data, jadi tiada satu angka jujur yang tunggal. ACT biasanya yang paling pantas daripada keempat-empat itu, fine-tune GR00T yang paling perlahan. Garis masa fasa dan carta loss pada halaman larian menunjukkan lebih awal sama ada larian itu maju.
Bolehkah saya melatih pada set data gabungan?▾
Ya. Set data gabungan ialah set data biasa; pengesahan penggabungan sudah menjamin fps, ciri, dan jenis robot yang konsisten. Menggabungkan rakaman tugas yang sama ialah salah satu cara paling berkesan untuk mencapai lingkungan 100 hingga 200 episod.
Larian GR00T saya gagal semasa pemuatan data. Apa yang perlu saya semak dahulu?▾
Versi format set data. Fine-tuning untuk GR00T memerlukan LeRobot v2.1, dan set data v3.0 gagal tepat di situ. Semak versi dalam meta/info.json set data anda.
Patutkah saya membuang episod yang gagal sebelum latihan?▾
Biasanya ya. Episod berlabel Failure mengajar policy itu tingkah laku yang gagal. Episod Recovery berbeza: ia menunjukkan cara membetulkan kesilapan dan selalunya berbaloi untuk disimpan.
Perlukah saya membiarkan pelayar terbuka semasa latihan?▾
Tidak. Larian dijalankan di sisi pelayan. Halaman larian menunjukkan keadaan semasa, carta, dan log apabila anda kembali, dan checkpoint disimpan tanpa mengira sama ada sesiapa sedang menonton.
Cara AY-Robots menyimpan rakaman teleoperasi dalam format LeRobot: struktur episod, pelayar episod papan pemuka, penggabungan muat naik, dan pasaran set data.
Setiap lengan robot yang disokong pada AY-Robots berserta spesifikasinya: SO-100, Koch v1.1, Franka FR3, FP3 dan Panda, WidowX-250, serta ALOHA ViperX-300.