آموزش policy
AY-Robots policy های manipulation را روی GPU های مدیریت شده آموزش می دهد، پس می توانید بدون داشتن سخت افزار آموزش خودتان از اپیزودهای ضبط شده به یک policy که روی بازوی شما اجرا می شود برسید. این صفحه انواع policy پشتیبانی شده، صفحه اجرای آموزش، checkpoint ها، و اینکه واقع بینانه از تعداد اپیزودتان چه نتایجی انتظار داشته باشید را پوشش می دهد.
آخرین به روزرسانی 2026-08-09
آموزش بدون GPU خودتان
آموزش یک policy manipulation یک بار کاری GPU است، و مدل های vision-language-action مدرن به VRAM بیشتری از یک ایستگاه کاری معمولی نیاز دارند. در AY-Robots آموزش روی GPU های ابری مدیریت شده توسط پلتفرم اجرا می شود: یک مجموعه داده و یک نوع policy انتخاب می کنید، اجرا را شروع می کنید، و پیشرفت آن را از مرورگر تماشا می کنید. هیچ راه اندازی CUDA، هیچ تطبیق driver، و هیچ محیطی برای نگهداری نیست.
ورودی همیشه یک مجموعه داده ابری از Dashboard > Datasets است. هر چیزی که از طریق نشست های کنترل از راه دور ضبط کرده اید یا با فرمت LeRobot آپلود کرده اید واجد شرایط است، از جمله مجموعه داده های ادغام شده. قبل از آموزش مدیریت کنید: اپیزودهایی که Failure برچسب خورده اند معمولا باید بیرون از مجموعه آموزشی بمانند، و ده دقیقه بررسی در مرورگر اپیزود ساعت ها زمان GPU که صرف یادگیری از نمایش های بد می شود را ذخیره می کند.
policy های پشتیبانی شده
چهار خانواده policy پشتیبانی می شوند. آن ها در اندازه، هزینه آموزش، و اینکه چقدر می توانند از داده شما جذب کنند تفاوت دارند، پس انتخاب درست بیشتر به وظیفه و مجموعه داده شما بستگی دارد تا به هر رتبه بندی کلی.
| policy | نوع | ویژگی ها |
|---|---|---|
| ACT | Transformer، action chunking | قطعات کوتاهی از اقدام های آینده را پیش بینی می کند به جای گام های تکی. فشرده، نسبتا سریع آموزش می بیند، و یک انتخاب اول محکم برای یک وظیفه واحد و به خوبی تعریف شده است. |
| Diffusion Policy | Diffusion روی توالی های اقدام | توزیع کامل اقدام های نمایش داده شده را مدل می کند، که وقتی نمایش های شما وظیفه را به بیش از یک روش معتبر حل می کنند کمک می کند. آموزش سنگین تر و در inference کندتر از ACT است. |
| SmolVLA | مدل کوچک vision-language-action | شرطی شده به زبان: رشته وظیفه از اپیزودهای شما بخشی از ورودی می شود. یک تعادل خوب وقتی می خواهید شرطی سازی زبان را بدون یک مدل foundation بزرگ داشته باشید. |
| fine-tune GR00T | fine-tune مدل foundation | یک مدل foundation بزرگ و از پیش آموزش دیده رباتیک را روی اپیزودهای شما fine-tune می کند. بالاترین سقف از این چهار، با بالاترین هزینه آموزش، و با یک الزام فرمت مجموعه داده سخت گیرانه. |
fine-tuning برای GR00T فقط مجموعه داده هایی با فرمت LeRobot نسخه 2.1 را می پذیرد. یک مجموعه داده v3.0 در طول بارگذاری داده شکست می خورد، نه در ارسال، پس قبل از شروع اجرا نسخه فرمت را بررسی کنید. مجموعه داده های ضبط شده روی پلتفرم را می توان همان طور که هستند استفاده کرد؛ برای آپلودهای خارجی، ابتدا نسخه را در meta/info.json تایید کنید.
شروع یک اجرا
- 1مجموعه داده را انتخاب کنید
Dashboard > Training را باز کنید و مجموعه داده ای که می خواهید روی آن آموزش دهید انتخاب کنید. تعداد اپیزود و نوع ربات نشان داده می شوند تا مطمئن شوید درست را انتخاب کرده اید.
- 2policy را انتخاب کنید
یکی از انواع policy پشتیبانی شده را انتخاب کنید. اگر مطمئن نیستید، با ACT شروع کنید: ارزان ترین راه برای فهمیدن این است که آیا مجموعه داده شما اصلا به اندازه کافی خوب است که چیزی روی آن آموزش داد.
- 3راه اندازی کنید
اجرا را شروع کنید. یک job id و صفحه اجرای مخصوص خودش می گیرد، و می توانید مرورگر را ببندید: آموزش سمت سرور ادامه می یابد و صفحه هر بار که برمی گردید وضعیت زنده را نشان می دهد.
صفحه اجرای آموزش
هر اجرا یک صفحه اختصاصی دارد که به دو سوالی که واقعا در طول آموزش دارید پاسخ می دهد: آیا در حال یادگیری است، و آیا ماشین سالم است. پیشرفت یادگیری به شکل نمودارهای loss، برنامه نرخ یادگیری، و نرم گرادیان نشان داده می شود. یک loss که فورا به یک plateau می رسد یا یک نرم گرادیان که منفجر می شود زود به شما می گوید که این اجرا ارزش صبر کردن ندارد.
سلامت ماشین در کنار آن نشان داده می شود: استفاده و حافظه GPU، به علاوه معیارهای میزبان ماشین آموزشی. یک جدول زمانی مرحله نشان می دهد اجرا در حال حاضر کجاست، از آماده سازی محیط تا بارگذاری داده، خود حلقه آموزش، و آپلود checkpoint. وقتی چیزی درست به نظر نمی رسد، نمایشگر لاگ داخلی لاگ های خام آموزش را بدون هیچ دسترسی SSH به شما می دهد، که معمولا کافی است تا ببینید یک شکست مربوط به مجموعه داده شماست یا خود اجرا.
checkpoint ها و از سرگیری
checkpoint ها بر اساس اجرا ذخیره می شوند، نه در یک استخر مشترک، پس checkpoint هایی که در یک صفحه اجرا فهرست شده اند همیشه دقیقا به همان اجرا و پیکربندی آن تعلق دارند. این بیشتر از آن چیزی که به نظر می رسد اهمیت دارد: ترکیب checkpoint ها بین اجراهایی با تنظیمات مختلف یک منبع کلاسیک برای policy هایی است که به طور خاموش خراب می شوند.
اگر یک اجرا قطع شود، می توانید از آخرین checkpoint آن به جای شروع دوباره از سر بگیرید. checkpoint های میانی هم به تنهایی مفید هستند: وقتی یک اجرای طولانی نزدیک انتها overfitting را شروع می کند، یک checkpoint زودتر اغلب روی بازوی واقعی بهتر از آخرین اجرا می شود.
اجرای policy آموزش دیده روی بازوی خودتان
یک policy تمام شده را می توان مستقیم روی ربات شما deploy کرد. در cockpit، policy آموزش دیده را برای بازوی متصل خود انتخاب کنید و inference را شروع کنید: policy اکنون همان دستورهای مفصلی را تولید می کند که قبلا با کنترل از راه دور تولید می کردید. بازو باید همان نوع رباتی باشد که مجموعه داده روی آن ضبط شده، و صحنه باید شبیه صحنه های آموزشی باشد، از جمله موقعیت دوربین.
با اجراهای اولیه inference مثل آزمایش رفتار کنید، نه نمایش. توقف اضطراری را در دسترس نگه دارید، از یک وضعیت شروع نزدیک به چیزی که نمایش دادید شروع کنید، و انتظار داشته باشید که policy به چیزهایی حساس باشد که شما متوجه نمی شدید: یک دوربین جابجا شده، نور متفاوت، یا شیئی که مجموعه داده هرگز نداشته.
چند اپیزود نیاز دارید
رایج ترین اشتباه آموزشی روی پلتفرم یک هایپرپارامتر اشتباه نیست، بلکه آموزش روی داده خیلی کم و نتیجه گیری این است که نوع policy کار نمی کند. به عنوان یک قانون کلی برای یک وظیفه رومیزی واحد: حدود 50 اپیزود یک policy با تعمیم باریک به شما می دهد که از وضعیت های شروع نزدیک به آنچه نمایش دادید موفق می شود. حدود 100 تا 200 اپیزود استحکام قابل استفاده در سراسر فضای کاری برای همان وظیفه واحد می دهد، به شرطی که موقعیت اشیا را بین اپیزودها متنوع کرده باشید.
انواع policy توانمندتر این را لغو نمی کنند. یک fine-tune GR00T روی 20 اپیزود هنوز ضعیف تعمیم می یابد؛ آنچه مدل های بزرگ تر به شما می دهند سقف بهتری است به محض اینکه داده وجود دارد. اگر بودجه شما محدود است، آن را روی اپیزودهای متنوع تر خرج کنید قبل از اینکه روی یک مدل بزرگ تر خرج کنید.
سوالات متداول
یک اجرای آموزش چقدر طول می کشد؟▾
به نوع policy و اندازه مجموعه داده بستگی دارد، پس هیچ عدد واحد صادقانه ای وجود ندارد. ACT معمولا سریع ترین از این چهار است، fine-tune های GR00T کندترین. جدول زمانی مرحله و نمودارهای loss در صفحه اجرا زود نشان می دهند که آیا یک اجرا پیشرفت می کند.
آیا می توانم روی یک مجموعه داده ادغام شده آموزش دهم؟▾
بله. مجموعه داده های ادغام شده مجموعه داده های عادی هستند؛ اعتبارسنجی ادغام از قبل fps، ویژگی ها، و نوع ربات سازگار را تضمین کرده. ادغام ضبط های همان وظیفه یکی از موثرترین راه ها برای رسیدن به محدوده 100 تا 200 اپیزود است.
اجرای GR00T من در بارگذاری داده شکست می خورد. اول چه چیزی را بررسی کنم؟▾
نسخه فرمت مجموعه داده. fine-tuning برای GR00T به LeRobot v2.1 نیاز دارد، و یک مجموعه داده v3.0 دقیقا همان جا شکست می خورد. نسخه را در meta/info.json مجموعه داده خود بررسی کنید.
آیا باید اپیزودهای شکست خورده را قبل از آموزش حذف کنم؟▾
معمولا بله. اپیزودهای برچسب خورده به Failure رفتار شکست خورده را به policy یاد می دهند. اپیزودهای Recovery متفاوت هستند: آن ها نشان می دهند چگونه یک اشتباه را اصلاح کرد و اغلب ارزش نگه داشتن دارند.
آیا باید مرورگر را در طول آموزش باز نگه دارم؟▾
نه. اجراها سمت سرور اجرا می شوند. صفحه اجرا هر بار که برمی گردید وضعیت فعلی، نمودارها، و لاگ ها را نشان می دهد، و checkpoint ها بدون توجه به اینکه کسی تماشا می کند ذخیره می شوند.
AY-Robots ضبط های کنترل از راه دور را با فرمت LeRobot چگونه ذخیره می کند: ساختار اپیزود، مرورگر اپیزود در داشبورد، ادغام آپلودها، و بازار مجموعه داده.
هر بازوی رباتی که در AY-Robots پشتیبانی می شود با مشخصات آن: SO-100، Koch v1.1، Franka FR3، FP3 و Panda، WidowX-250، و ALOHA ViperX-300.