Blog
Insights on robotics, AI, and data collection

اجرای حلقه DAgger روی SO-100 با یک policy VLA
شرح مرحله به مرحله یک دور DAgger با گیتگذاری انسانی روی بازوی SO-100: policy را اجرا کنید و ضبط کنید، وقتی مشکل پیش آمد تصرف کنید، اجرا را به عنوان اصلاح فایل کنید، یک dataset ترکیبی بسازید و آموزش را از یک checkpoint ادامه دهید. شامل مسیر تصرف صفحهکلید و لغزنده برای کسانی که بازوی رهبر ندارند و چهار اشتباهی که یک دور را بیارزش میکند.

اندازهگیری یک حلقه DAgger: نرخ مداخله، پروتکل ارزیابی، و دامهایی در میان
نرخ مداخله - فریمهای مداخله تقسیم بر فریمهای اجرا - ارزانترین سیگنال پیشرفت درسترو است که یک حلقه DAgger با دروازه انسانی دارد. این مقاله آن را طوری تعریف میکند که دو نفر مقدار یکسان محاسبه کنند، نحوه ثبت آن را نشان میدهد، و چهار راهی که شما را گمراه میکند را بررسی میکند: عادتپذیری عملگر، تنظیم ارزیابی دریفتکننده، آموزش تنها بر روی تصحیحات، و انسانی که در سهشنبه متفاوتتر از دوشنبه تصحیح میکند.

HG-DAgger و تغییرات دروازهای: چه کسی تصمیم میگیرد چه زمانی کنترل سیاست رباتی را به عهده بگیرد
DAgger ساده از انسانی میخواهد که حالات را برچسبگذاری کند در حالیکه ربات هنوز در حال رانندگی است. در سختافزار واقعی این امر ناایمن است و برچسبهای ضعیفی تولید میکند. تغییرات دروازهای، برچسبگذاری کور را با دروازهای جایگزین میکنند که کسی باید آن را نگهدارد: انسان در HG-DAgger، کلاسیفایر ایمنی در SafeDAgger، اختلاف انسامبل در EnsembleDAgger، برآورد بودجهای نوآوری و ریسک در ThriftyDAgger. این مقاله آنها را بر اساس مقایسه میکند که چه کسی مالک دروازه است، چه سیگنالی آن را باز میکند، و هر کدام چه هزینهای دارد — و چرا شکل کنترلشدهتوسطانسان همان است که از تماس با بازوی واقعی درنمیآید.

DAgger توضیح داده شد: چرا Behavior Cloning منحرف میشود و Dataset Aggregation واقعاً چه چیز را ثابت میکند
Behavior Cloning یک policy را بر روی توزیع state متخصص تناسب میدهد و سپس بهطور مستقل استقرار مییابد. فاصله بین این دو توزیع دلیل این است که policyای که در validation خوب به نظر میرسد، در مرحله 300 از میز میافتد. این فصل تئوری سری DAgger ما است: جایی که جملۀ خطای درجه دوم منشأ میگیرد، Dataset Aggregation چه چیز را تغییر میدهد، اثبات بدونپشیمانی چه فرض میکند، و کدام بخش از صورتحساب متخصص انسانی باید بپردازد.

استفاده از DROID، BridgeData V2 و Open X روی SO-100
DROID، BridgeData V2 و Open X-Embodiment به عملیاتهای 7-بعدی اند-افکتور روی بازوهای 6 و 7 درجه آزادی تبدیل میشوند. یک SO-100 شش موقعیت مفصلی را میپذیرد. چه چیزی منتقل میشود، چه چیزی نمیشود، و به جای آن چه باید کرد.

دادههای مصنوعی برای سیاستهای ربات: جایی که شبیهسازی کمک میکند
شبیهسازی میتواند تعداد کمی از نمایشها را به هزاران مورد تکثیر کند. در اینجا چیزی است که اعداد منتشر شده واقعاً میگویند، جایی که شکاف شبیهسازی به واقعیت مشکلساز میشود، و چه چیزی هنوز باید ضبط شود.

مدلهای کوچک VLA: TinyVLA, SmolVLA و مورد زیر ۱ میلیارد پارامتر
TinyVLA و SmolVLA یک VLA عملیاتی را زیر ۱ میلیارد پارامتر قرار میدهند. اعداد واقعی از هر دو مقاله، پیشفرضهای LeRobot، تأخیر اندازهگیری شده، و هزینه یک اجرا روی کارت ۲۴ گیگابایتی.

اجرای استنتاج GR00T بدون GPU محلی
ماشین ربات شما GPU ندارد. سرور سیاست GR00T را روی یک GPU ابری اجارهای قرار دهید، تکههای عملیات را به بازو استریم کنید، و دقیقاً متوجه شوید که شبکه چقدر برای شما هزینه دارد.

چگونه ACT را روی SO-100 از ابتدا آموزش دهیم
یک Action Chunking Transformer را از ابتدا روی SO-100 با lerobot آموزش دهید: پیکربندی act، chunk_size و n_action_steps، برنامه 100000 مرحلهای، استنتاج 20 میلیثانیه.

کدام سیاست VLA را باید در سال 2026 آموزش دهید؟
GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ یک جدول تصمیمگیری منطبق با موقعیتهای واقعی، همراه با اعداد بنچمارک منتشر شده، تأخیر، هزینه هر اجرا و مجوزهای پشت هر انتخاب.

هزینه آموزش VLA: یک اجرای تنظیم دقیق واقعاً چقدر هزینه دارد
قیمتهای واقعی GPU در بازار لحظهای، مدت زمان اجرای هر یک از پنج سیاست، هزینه بازو و نمایشها، و چهار جایی که پول بیصدا ناپدید میشود.

اولین مجموعه داده LeRobot خود را با یک SO-100 ضبط کنید
یک مجموعه داده LeRobot قابل استفاده را با SO-100 ضبط کنید: کالیبراسیون، تلهاپریشن رهبر-پیرو، پرچمها و پیشفرضهای واقعی lerobot-record، تنظیمات دوربین، تعداد اپیزودها، و نقصهایی که یک اجرا را خراب میکنند.

چگونه SmolVLA را روی یک GPU 24 گیگابایتی آموزش دهیم (lerobot 0.6.1)
SmolVLA یک VLA با 450 میلیون پارامتر است که روی یک کارت 24 گیگابایتی تنظیم دقیق میشود. دستورات واقعی lerobot 0.6.1، پیشفرضهای واقعی، دامهایی که یک روز زمان میبرند و هزینه یک اجرا چقدر است.

چگونه Pi0.5 را با دادههای ربات خودتان آموزش دهیم
Pi0.5، مدل VLA تطبیق جریان از Physical Intelligence، را با دادههای ربات خودتان تنظیم دقیق کنید. دستورات واقعی برای openpi و lerobot pi05، مشکلات فرمت مجموعه داده، و محدودیتهای VRAM و تأخیر.

چگونه GR00T N1.7 را روی مجموعه داده SO-100 خودتان آموزش دهیم
یک راهنمای عملی و آزمایششده برای تنظیم دقیق NVIDIA GR00T N1.7 روی یک مجموعه داده LeRobot SO-100: پرچمهای واقعی، modality.json، نیاز به v2.1، هزینه یک اجرا، و چالشها.
RoboTurk: یادگیری ربات با استفاده از برونسپاری جمعی از طریق دورکاری
کشف کنید که چگونه RoboTurk با برونسپاری جمعی دادههای با کیفیت بالا از طریق دورکاری، یادگیری ربات را متحول میکند و مجموعهدادههای مقیاسپذیر را برای مدلهای هوش مصنوعی در رباتیک امکانپذیر میسازد. تأثیر آن را بر یادگیری تقلیدی، مدلهای VLA و ROI برای شرکتهای رباتیک بررسی کنید.
سیاستهای ربات تطبیق جریان Pi-Zero: تحولی در کنترل ماهرانه با مقداردهی اولیه VLM
کشف کنید که چگونه تکنیک تطبیق جریان Pi-Zero، همراه با مقداردهی اولیه VLM، سیاستهای ربات جنرالیست را برای کنترل ماهرانه متحول میکند. در مورد مزایای آن نسبت به روشهای سنتی، کارایی در دادههای آموزش هوش مصنوعی برای رباتیک و پیامدهای آن برای استقرار مقیاسپذیر ربات در صنایع بیاموزید.
Isaac Lab: نسل بعدی شبیهسازی GPU برای یادگیری ربات چندوجهی
کشف کنید که چگونه آزمایشگاه آیزاک NVIDIA از طریق شبیهسازیهای شتابیافته GPU، یادگیری ربات چندوجهی را متحول میکند و آموزش سریعتر هوش مصنوعی، استقرار مقیاسپذیر و ROI بهینه را برای محققان و شرکتهای رباتیک امکانپذیر میکند.
Isaac Gym: شبیه سازی فیزیک بومی GPU برای یادگیری ربات - مقیاس بندی هزاران محیط موازی
کشف کنید که چگونه Isaac Gym با شبیه سازی فیزیک بومی GPU، یادگیری ربات را متحول می کند و هزاران محیط موازی را برای یادگیری تقویتی سریع، آموزش مدل های VLA و تله اپراتوری ربات هوش مصنوعی کارآمد امکان پذیر می کند. معیارها، ادغام با PyTorch و برنامه های کاربردی دنیای واقعی را که شکاف sim-to-real را پر می کنند، کاوش کنید.
BridgeData V2: داده های ربات کم هزینه در مقیاس بزرگ - کدام روش های یادگیری تقلیدی و RL آفلاین واقعاً سود می برند
بررسی کنید که چگونه BridgeData V2 داده های ربات کم هزینه را در مقیاس بزرگ ارائه می دهد و روش های یادگیری تقلیدی و یادگیری تقویتی آفلاین را بهبود می بخشد. معیارها، مدل های VLA در رباتیک و گردش کار کارآمد تله اپراتوری ربات را برای جمع آوری داده های آموزش هوش مصنوعی کشف کنید.
RT-2: چرا دادههای آموزشی ربات با کیفیت بالا از الگوریتمها پیشی میگیرند – بینشهای متحولکننده Google DeepMind
کشف کنید که چگونه مدل RT-2 گوگل دیپمایند با تأکید بر نقش حیاتی دادههای آموزشی با کیفیت بالا نسبت به الگوریتمهای پیشرفته، رباتیک هوش مصنوعی را متحول میکند. این مقاله آزمایشهایی را تشریح میکند که نشان میدهند چرا جمعآوری مؤثر دادهها برای عملکرد ربات در دنیای واقعی ضروری است. بیاموزید که چگونه پلتفرمهایی مانند AY-Robots میتوانند به پر کردن شکاف در دادههای آموزشی برای نوآوریهای آینده کمک کنند.
RT-2 از Google DeepMind: چگونه این مدل دیداری-زبانی-عملی، یادگیری ربات را متحول میکند
کشف کنید که چگونه مدل دیداری-زبانی-عملی (VLA) گوگل با ادغام دادههای بصری، زبان طبیعی و اقدامات بیدرنگ، یادگیری ربات را تغییر میدهد. این فناوری نوآورانه هوش مصنوعی، جمعآوری دادهها را برای اپراتورهای از راه دور افزایش داده و کارایی را در کاربردهای رباتیک تقویت میکند. پتانسیل تاثیر آن بر آینده رباتهای مبتنی بر هوش مصنوعی را در AY-Robots بررسی کنید.