Blog
Insights on robotics, AI, and data collection

Menjalankan Loop DAgger pada SO-100 dengan Kebijakan VLA
Penjelasan langkah demi langkah tentang satu ronde DAgger yang dikendalikan manusia pada lengan SO-100: jalankan kebijakan dan rekam, ambil alih saat mulai salah, catat run tersebut sebagai koreksi, susun dataset campuran, dan lanjutkan pelatihan dari sebuah checkpoint. Mencakup jalur pengambilalihan lewat keyboard dan slider bagi yang tidak memiliki leader arm, serta empat kesalahan yang membuat sebuah ronde jadi sia-sia.

Mengukur Loop DAgger: Tingkat Intervensi, Protokol Evaluasi, dan Jebakan di Antaranya
Tingkat intervensi - frame intervensi dibagi frame dari keseluruhan run - adalah sinyal kemajuan jujur paling murah yang dimiliki loop DAgger dengan gerbang manusia (human-gated). Artikel ini mendefinisikannya sehingga dua orang menghitung nilai yang sama, menunjukkan cara mencatatnya, dan membahas empat cara ia bisa menyesatkan Anda: habituasi operator, setup evaluasi yang bergeser, pelatihan hanya pada koreksi, dan manusia yang mengoreksi secara berbeda pada hari Selasa dibanding hari Senin.

HG-DAgger dan Varian-Varian Bergerbang: Siapa yang Menentukan Kapan Mengambil Alih Policy Robot
DAgger biasa meminta manusia melabeli state selagi robot masih menjalankan policy-nya sendiri. Di hardware nyata hal ini tidak aman dan menghasilkan label yang buruk. Varian-varian bergerbang mengganti pelabelan buta itu dengan sebuah gate yang harus dipegang seseorang: manusia pada HG-DAgger, classifier keamanan pada SafeDAgger, ketidaksepakatan ensemble pada EnsembleDAgger, estimasi novelty-dan-risiko dengan budget pada ThriftyDAgger. Artikel ini membandingkan semuanya berdasarkan siapa yang memegang gate, sinyal apa yang membukanya, dan berapa biaya masing-masing — serta mengapa bentuk human-gated adalah yang bertahan saat bersentuhan dengan lengan robot sungguhan.

DAgger Dijelaskan: Mengapa Behavior Cloning Melenceng dan Apa yang Sebenarnya Dibuktikan oleh Dataset Aggregation
Behavior cloning melatih sebuah policy pada distribusi state milik expert, lalu policy tersebut dijalankan sendiri saat deployment. Kesenjangan antara kedua distribusi inilah yang membuat policy yang terlihat baik saat validasi justru keluar dari meja pada langkah ke-300. Ini adalah bab teori dari seri DAgger kami: dari mana asal suku error kuadratik, apa yang diubah oleh dataset aggregation, apa yang diasumsikan oleh bukti no-regret, dan bagian mana dari biayanya yang tetap harus dibayar oleh expert manusia.

Menggunakan DROID, BridgeData V2, dan Open X pada SO-100
DROID, BridgeData V2, dan Open X-Embodiment dikonversi menjadi aksi end-effector 7-D pada lengan 6 dan 7-DoF. SO-100 mengambil 6 posisi sendi. Apa yang dapat ditransfer, apa yang tidak, dan apa yang harus dilakukan sebagai gantinya.

Data Sintetis untuk Kebijakan Robot: Di Mana Simulasi Membantu
Simulasi dapat melipatgandakan segelintir demonstrasi menjadi ribuan. Berikut adalah apa yang sebenarnya dikatakan oleh angka-angka yang dipublikasikan, di mana celah sim-to-real menjadi masalah, dan apa yang masih harus direkam.

Model VLA Kecil: TinyVLA, SmolVLA, dan Kasus di Bawah 1 Miliar Parameter
TinyVLA dan SmolVLA menghadirkan VLA yang berfungsi di bawah 1 miliar parameter. Angka-angka sebenarnya dari kedua makalah, pengaturan default LeRobot, latensi terukur, dan biaya satu kali jalankan pada kartu 24 GB.

Jalankan Inferensi GR00T Tanpa GPU Lokal
Mesin robot Anda tidak memiliki GPU. Tempatkan server kebijakan GR00T pada GPU cloud sewaan, alirkan potongan aksi ke lengan, dan pelajari dengan tepat berapa biaya jaringan untuk Anda.

Cara Melatih ACT pada SO-100 dari Awal
Latih Action Chunking Transformer dari awal pada SO-100 dengan lerobot: konfigurasi act, chunk_size dan n_action_steps, jadwal 100000 langkah, inferensi 20 ms.

Kebijakan VLA Mana yang Seharusnya Anda Latih pada Tahun 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT atau GR00T N1.5? Sebuah tabel keputusan yang disesuaikan dengan situasi nyata, lengkap dengan angka benchmark yang dipublikasikan, latensi, biaya per eksekusi, dan lisensi di balik setiap pilihan.

Biaya Pelatihan VLA: Berapa Biaya Sebenarnya dari Satu Kali Fine-Tuning
Harga GPU pasar spot yang sebenarnya, berapa lama setiap dari lima kebijakan berjalan, berapa biaya lengan robot dan demonstrasi, dan empat tempat di mana uang diam-diam menghilang.

Rekam Dataset LeRobot Pertama Anda Dengan SO-100
Rekam dataset LeRobot yang dapat digunakan dengan SO-100: kalibrasi, teleoperasi leader-follower, flag dan default lerobot-record yang sebenarnya, pengaturan kamera, jumlah episode, dan cacat yang merusak sebuah percobaan.

Cara Melatih SmolVLA pada GPU 24 GB (lerobot 0.6.1)
SmolVLA adalah VLA 450 J parameter yang dapat di-fine-tune pada satu kartu 24 GB. Perintah lerobot 0.6.1 yang sebenarnya, nilai default yang sebenarnya, jebakan yang memakan waktu sehari, dan berapa biaya satu kali jalankan.

Cara Melatih Pi0.5 dengan Data Robot Anda Sendiri
Lakukan fine-tuning Pi0.5, VLA pencocokan aliran dari Physical Intelligence, dengan data robot Anda sendiri. Perintah nyata untuk openpi dan lerobot pi05, jebakan format dataset, batas VRAM dan latensi.
Isaac Lab: Simulasi GPU Generasi Berikutnya untuk Pembelajaran Robot Multi-Modal
Temukan bagaimana Isaac Lab NVIDIA merevolusi pembelajaran robot multi-modal melalui simulasi yang dipercepat GPU, memungkinkan pelatihan AI yang lebih cepat, penerapan yang terukur, dan ROI yang dioptimalkan untuk peneliti dan perusahaan robotika.
Isaac Gym: Simulasi Fisika Asli GPU untuk Pembelajaran Robot - Menskalakan Ribuan Lingkungan Paralel
Temukan bagaimana Isaac Gym merevolusi pembelajaran robot dengan simulasi fisika asli GPU, memungkinkan ribuan lingkungan paralel untuk pembelajaran penguatan yang cepat, pelatihan model VLA, dan teleoperasi robot AI yang efisien. Jelajahi tolok ukur, integrasi dengan PyTorch, dan aplikasi dunia nyata yang menjembatani kesenjangan sim-ke-nyata.
BC-Z: Generalisasi Tugas Zero-Shot dengan Pembelajaran Imitasi Robot - Apa Arti Skala Sebenarnya
Jelajahi bagaimana BC-Z merevolusi pembelajaran imitasi robot dengan memungkinkan generalisasi tugas zero-shot melalui data demonstrasi yang diskalakan. Temukan hukum penskalaan, model VLA, praktik terbaik teleoperasi, dan manfaat ROI untuk perusahaan robotika dan insinyur AI.
DROID Dataset: Merevolusi Manipulasi Robot Skala Besar untuk Pelatihan AI
Temukan bagaimana Dataset DROID, dataset manipulasi robot skala besar, mengubah pelatihan AI untuk robot dengan lebih dari 76.000 demonstrasi dari lingkungan dunia nyata. Pelajari tentang dampaknya pada model VLA, tolok ukur, dan metode pengumpulan data yang dapat diskalakan untuk perusahaan robotika.
BridgeData V2: Data Robot Murah dalam Skala Besar - Metode Pembelajaran Imitasi dan RL Offline Mana yang Benar-Benar Bermanfaat
Jelajahi bagaimana BridgeData V2 menyediakan data robot murah dalam skala besar, meningkatkan metode pembelajaran imitasi dan pembelajaran penguatan offline. Temukan tolok ukur utama, model VLA dalam robotika, dan alur kerja teleoperasi robot yang efisien untuk pengumpulan data pelatihan AI.
Open X-Embodiment: Merevolusi Pembelajaran Robot Skala Besar di Lebih dari 20 Embodiment
Temukan bagaimana Open X-Embodiment, dataset kolaboratif yang mencakup lebih dari 20 embodiment robot, mengubah pembelajaran robot. Pelajari tentang model RT-X, generalisasi lintas embodiment, dan strategi praktis bagi perusahaan robotika untuk meningkatkan ROI melalui pengumpulan data dan teleoperasi yang efisien.
Pi-Zero Flow-Matching Robot Policies: Revolutionizing Dexterous Control with VLM Initialization
Discover how Pi-Zero's flow-matching technique, combined with VLM initialization, is transforming generalist robot policies for dexterous control. Learn about its advantages over traditional methods, efficiency in AI training data for robotics, and implications for scalable robot deployment in industries.
RT-2: Bagaimana Model Visi-Bahasa-Aksi Mentransfer Pengetahuan Web ke Kontrol Robot
Temukan bagaimana Model Visi-Bahasa-Aksi RT-2 Google merevolusi kontrol robot dengan mentransfer pengetahuan web ke tindakan fisik. Pelajari tentang arsitekturnya, metode pelatihan, kemampuan yang muncul, dan implikasinya bagi perusahaan dan operator robotika, termasuk integrasi dengan teleoperasi untuk pelatihan AI yang efisien.
Vision-Language-Action Models: The Future of Robot Learning
Explore how Vision-Language-Action (VLA) models are revolutionizing robot learning by integrating vision, language, and action for smarter, more efficient robotics. Discover architectures, training methods, benchmarks, and ROI for deployment in this comprehensive guide.
RT-2: Mengapa Data Pelatihan Robot Berkualitas Tinggi Lebih Unggul dari Algoritma – Wawasan Mengubah Permainan dari Google DeepMind
Temukan bagaimana model RT-2 Google DeepMind merevolusi robotika AI dengan menekankan peran penting data pelatihan berkualitas tinggi daripada algoritma canggih. Artikel ini menguraikan eksperimen yang menunjukkan mengapa pengumpulan data yang efektif sangat penting untuk kinerja robot di dunia nyata. Pelajari bagaimana platform seperti AY-Robots dapat membantu menjembatani kesenjangan dalam data pelatihan untuk inovasi masa depan.
RT-2 oleh Google DeepMind: Bagaimana Model Visi-Bahasa-Aksi Ini Mengubah Pembelajaran Robot
Temukan bagaimana model Visi-Bahasa-Aksi (VLA) RT-2 dari Google membentuk kembali pembelajaran robot dengan mengintegrasikan data visual, bahasa alami, dan tindakan waktu nyata. Teknologi AI inovatif ini meningkatkan pengumpulan data untuk teleoperator dan meningkatkan efisiensi dalam aplikasi robotika. Jelajahi potensi dampaknya pada masa depan robot yang digerakkan oleh AI di AY-Robots.