جدول هزینه AY-Robots که نشان می‌دهد هر یک از پنج سیاست به کدام GPU نیاز دارد، زمان اجرای معمول و قیمت هر اجرا، و تعداد اپیزودهای مورد نیاز قبل از مفید شدن سیاست
آموزش VLAهزینه‌های GPUSO-100تنظیم دقیقیادگیری رباتبودجه‌بندی

هزینه آموزش VLA: یک اجرای تنظیم دقیق واقعاً چقدر هزینه دارد

AY-Robots ResearchAugust 23, 202623 دقیقه مطالعه

قیمت‌های واقعی GPU در بازار لحظه‌ای، مدت زمان اجرای هر یک از پنج سیاست، هزینه بازو و نمایش‌ها، و چهار جایی که پول بی‌صدا ناپدید می‌شود.

نسخه کوتاه

  • یک اجرا در رده A100 80 GB یا H100 بین 3 تا 6 ساعت طول می‌کشد و حدود 4 تا 12 دلار هزینه دارد. در رده RTX 4090، این زمان 2 تا 5 ساعت و هزینه حدود 1 تا 3 دلار است.
  • اندازه‌گیری شده در vast.ai در ساعت 13:44 UTC در 23 آگوست 2026: یک RTX 4090 کامل در صورت تقاضا با 0.13 تا 0.38 دلار در ساعت، یک A100 80 GB با 0.44 تا 0.67 دلار، یک H100 80 GB با 1.34 تا 2.34 دلار. کارت‌های 80 GB کامل کمیاب هستند، به ترتیب دو و پنج پیشنهاد تک کارتی.
  • GPU ارزان‌ترین بخش است. لیست مواد SO-ARM100 یک جفت رهبر به همراه دنبال‌کننده را 229.88 دلار برآورد می‌کند که معادل 77 تا 230 اجرا در رده 24 GB است.
  • دو ساعت ضبط 50 اپیزود توسط یک شخص، بیشتر از هزینه اجرای آموزشی است که این اپیزودها به آن تغذیه می‌کنند.
  • پول در چهار جا از بین می‌رود: اجراها با داده‌های خراب، مدل‌های 3B برای وظایفی که یک خط‌مشی 80M انجام می‌دهد، GPUهایی که کسی از بین نبرده، و اجرای مجدد نتایجی که نتوانسته‌اید حفظ کنید.
  • AY-Robots اندازه کارت را بر اساس VRAM مورد نیاز مدل تعیین می‌کند و آن را در همان بازار لحظه‌ای اجاره می‌دهد، بنابراین هزینه اجرا همان هزینه بازار است.

صورت‌حساب چهار بخش دارد و GPU کوچک‌ترین آنهاست

وقتی مردم می‌پرسند هزینه تنظیم دقیق یک مدل بینایی-زبان-عمل برای یک SO-100 چقدر است، تقریباً همیشه منظورشان اجاره GPU است. این عددی است که به عنوان هزینه روی کارت ظاهر می‌شود، بنابراین همان چیزی است که واقعی به نظر می‌رسد. همچنین، با اختلاف زیاد، کوچک‌ترین از چهار عددی است که تعیین می‌کند یک خط‌مشی کارآمد واقعاً چقدر برای شما هزینه دارد.

بخشچیستاندازه معمول برای یک خط‌مشی کارآمد
زمان GPUاجاره کارت برای اجرا1 تا 12 دلار به ازای هر اجرا، و شما 3 تا 5 اجرا انجام خواهید داد
رباتسرووها، فریم چاپی، دوربین‌ها، کابل‌ها، برقیک بار، 110 تا 500 یورو به ازای هر بازو
ساعات انسانیشخصی که بازو را برای ضبط دموها هدایت می‌کند1 تا 4 ساعت به ازای هر مجموعه داده، تکرار شده به ازای هر وظیفه
ضایعاتداده‌های بد، مدل‌های بیش از حد بزرگ، پادهای فراموش شدهنامحدود، و تنها بخشی که شما کنترل می‌کنید

زمان‌های آموزش در ادامه از مقالات و مخازن خود پنج مدل، هزینه سخت‌افزار از لیست مواد منتشر شده، و اعداد پلتفرم از AY-Robots کاتالوگ سیاست‌ها و صفحه قیمت‌گذاری. در مواردی که پلتفرم کمکی نمی‌کند، این مقاله به آن اشاره می‌کند.

هزینه واقعی یک ساعت GPU در بازار لحظه‌ای

هیچ قیمت واحدی برای یک ساعت A100 وجود ندارد. در بازاری مانند vast.ai هر میزبان نرخ خود را تعیین می‌کند، و اجرای آموزشی که شما راه‌اندازی می‌کنید، روی هر ماشینی که در آن لحظه ارزان و آزاد باشد، قرار می‌گیرد. پاسخ صادقانه یک توزیع است. در اینجا، اندازه‌گیری شده در 23 آگوست 2026 در ساعت 13:44 UTC: کارت‌های کامل تکی، بر اساس تقاضا، فیلتر شده بر اساس VRAM واقعی.

کارتvast.ai بر اساس تقاضا USD/h (کم / میانه / زیاد)پیشنهادات کارت کاملکف قیمت vast.aiRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74ارائه نشده
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99ارائه نشده
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19ارائه نشده
این تصویر لحظه‌ای چگونه گرفته شد و چه چیزی نیست

پیشنهادات درخواستی برای یک GPU کامل (gpu_frac == 1.0) از API عمومی vast.ai که نیازی به حساب کاربری ندارد، بر اساس gpu_ram فیلتر شده‌اند تا فقط کارت‌های 80 گیگابایتی واقعی در ردیف‌های 80 گیگابایتی قرار گیرند. این فیلتر مهم است: در این بررسی، هر سه پیشنهاد تک کارتی A100 SXM4 قطعات 40 گیگابایتی بودند، همانطور که دو مورد از چهار پیشنهاد A100 PCIE نیز چنین بودند، بنابراین جمع‌آوری آن‌ها در یک ردیف "A100" قیمت گزارش شده در اینجا را نصف می‌کرد. ستون Hugging Face دو محصول را ترکیب می‌کند: 2.50 USD/h سخت‌افزار Nvidia A100 - large Spaces است و 4.50 USD/h یک H100 80 GB تحت Inference Endpoints است که Spaces آن را ارائه نمی‌دهد. میانگین‌ها را به عنوان شاخص در نظر بگیرید: ردیف A100 80 GB بر اساس دو پیشنهاد و ردیف H100 بر اساس پنج پیشنهاد است، و همان کوئری 36 ثانیه بعد تعداد 4090 متفاوتی و قیمت بالای متفاوتی را در سه ردیف از پنج ردیف بازگرداند. قیمت‌های لیست RunPod عدد پایدارتری برای برنامه‌ریزی هستند.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
کوئری دقیق پشت جدول بالا، که هنگام نوشتن این بخش دو بار اجرا شده است. قبل از اعتماد به هر مقاله قیمت‌گذاری GPU، از جمله این مقاله، آن را اجرا کنید.
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
جدول هزینه در /try: کارت، زمان اجرا، قیمت هر اجرا و حداقل اپیزودها برای هر سیاست.

چرا مدل‌های 3B نمی‌توانند از کارت ارزان استفاده کنند

یک ساعت 4090 و یک ساعت H100 80 GB در میانگین‌های بالا تقریباً شش برابر با هم تفاوت دارند. آنچه شما را به سمت کارت گران‌قیمت سوق می‌دهد، سرعت نیست، بلکه حافظه است. openpi حداقل حافظه مورد نیاز برای یک Pi0.5 کامل را فاین‌تیون 70 GB تعیین می‌کند و NVIDIA برای GR00T، 40 GB یا بیشتر را توصیه می‌کند. توجه داشته باشید که عدد GR00T به چه معنا نیست. پیکربندی فاین‌تیون آن به طور پیش‌فرض مدل زبان و رمزگذار بصری را فریز می‌کند (tune_llm و tune_visual False هستند، در حالی که پروژکتور و هد انتشار True هستند)، به همین دلیل کاتالوگ تقریباً 40 میلیون پارامتر آموزش‌دیده از 3 میلیارد را فهرست می‌کند. 40 GB مربوط به وضعیت بهینه‌ساز برای وزن‌های 3 میلیارد نیست، بلکه مربوط به ستون فقرات فریز شده به علاوه فعال‌سازی‌ها است. نسخه‌های با دامنه کاهش‌یافته، کمتر نیاز دارند: مسیر LoRA در openpi به 22.5 GB نیاز دارد و 4090 را نام می‌برد، و گردش کار Isaac Lab Arena شرکت NVIDIA یک گزینه تک-GPU با 24 GB را برای پس‌آموزش GR00T فهرست می‌کند. پلتفرم بر اساس حداقل حافظه مورد نیاز که هر فروشنده برای پیکربندی واقعی خود منتشر می‌کند، طبقه‌بندی می‌شود. مقاله pi0 flow-matching توضیح می‌دهد که آن flow-matching ردپا از کجا می‌آید.

کارحافظه مورد نیاز پروژه بالادستیمنبع
استنتاج pi0 / pi0.5more than 8 GB, example RTX 4090openpi
فاین‌تیون LoRA برای pi0 / pi0.5more than 22.5 GB, example RTX 4090openpi
فاین‌تیون کامل pi0 / pi0.5more than 70 GB, example A100 80 GB or H100openpi
استنتاج GR00T N1.71 GPU with 16 GB or moreIsaac-GR00T
فاین‌تیون GR00T N1.740 GB or more recommended, H100 or L40 nodesIsaac-GR00T
فاین‌تیون GR00T، آنچه آموزش می‌دهدprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
پس‌آموزش GR00T، کاهش‌یافته1 GPU with 24 GB, language model frozenIsaac Lab Arena
فاین‌تیون SmolVLAsingle A100 for the reference 20,000-step runlerobot docs
آموزش ACTa single 11 GB RTX 2080 TiACT paper

این جدول دلیل تقسیم پنج مدل توسط پلتفرم به دو رده است. GR00T N1.7، GR00T N1.5 و Pi0.5 روی A100 80 GB یا H100 اجرا می‌شوند زیرا این چیزی است که فروشندگان درخواست می‌کنند. SmolVLA و ACT روی RTX 4090 یا هر کارت 24 GB دیگری اجرا می‌شوند زیرا این مقدار واقعاً کافی است.

تله‌ای که یک روز را هدر می‌دهد: اجاره کارت ارزان برای مدل بزرگ

اجرای GR00T یا Pi0.5 روی کارت 24 GB در ثانیه صفر با شکست مواجه نمی‌شود. این مدل، چک‌پوینت پایه را دانلود می‌کند، فهرست مجموعه داده را می‌سازد، اولین مرحله پیش‌رو را آغاز می‌کند و پس از چند صد گام با خطای CUDA out-of-memory از کار می‌افتد. شما هزینه دانلود و راه‌اندازی را پرداخت کرده‌اید و چیزی به دست نیاورده‌اید. راه‌حل‌ها: کمبود حافظه در حین آموزش.

مدت زمان اجرای واقعی هر یک از پنج مدل

زمان اجرا نیمه دیگر هزینه است: 2.00 USD در ساعت بی‌اهمیت است اگر کار 40 دقیقه طول بکشد و ویرانگر است اگر 40 ساعت باشد. اینها تنظیمات پیش‌فرض AY-Robots هستند که واقعاً به مربی ارسال می‌کند، همراه با پنجره اجرا و هزینه برای هر سطح.

سیاستسطح GPUحداکثر گام‌های پیش‌فرضبچ پیش‌فرض (تجمع گرادیان)پنجره اجراهزینه هر اجرا
GR00T N1.7, ~3BA100 80 GB or H10020,00032، تجمع 1، اعمال می‌شود3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001، تجمع 16، اعمال می‌شود3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001، تجمع 16، بدون تأثیر3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002، تجمع 8، بدون تأثیر2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008، تجمع 12 to 5 h1 to 3 USD
جدول مقایسه پنج سیاست قابل آموزش در AY-Robots که تعداد پارامترها، GPU مورد نیاز، تأخیر استنتاج و حداقل تعداد اپیزودها را نشان می‌دهد.
پنج سیاست در کنار هم: پارامترها، سطح GPU، تأخیر در هر گام عملیاتی، حداقل اپیزودها.

پنجره‌های اجرای بالادستی از کجا می‌آیند

  • SmolVLA: مستندات lerobot بیان می‌کند که ۲۰,۰۰۰ گام تقریباً ۴ ساعت روی یک A100 طول می‌کشد. پلتفرم همین ۲۰,۰۰۰ گام را روی رده ۲۴ گیگابایتی ارزان‌تر اجرا می‌کند، از این رو یک پنجره زمانی به جای ۴ ساعت ثابت.
  • ACT: مقاله اصلی ALOHA حدود ۵ ساعت را روی یک RTX 2080 Ti با ۱۱ گیگابایت برای یک مدل ۸۰ میلیون پارامتری گزارش می‌دهد. یک ۴۰۹۰ چندین نسل جدیدتر است اما پلتفرم ۱۰۰,۰۰۰ گام را بودجه‌بندی می‌کند، بنابراین پنجره زمانی در همان مکان قرار می‌گیرد.
  • GR00T: گردش کار مرجع NVIDIA برای نسل N1.6 تقریباً ۴ تا ۸ ساعت را برای ۲۰,۰۰۰ گام با بچ ۲۴ روی هشت کارت L40S، و ۲ تا ۳ ساعت را برای ۳۰,۰۰۰ گام با بچ ۱۶ روی یک Ada 6000 ذکر می‌کند. تنظیم دقیق (fine-tuning) یک VLA 3B با یک کارت در چند ساعت عادی است، نه خوش‌بینانه.
  • Pi0.5: openpi هیچ رقم زمان واقعی (wall-clock) منتشر نمی‌کند، اما حداقل ۷۰ گیگابایت را برای یک تنظیم دقیق کامل منتشر می‌کند که کارت و در نتیجه نرخ را مشخص می‌کند.

ارزش دارد که روی عددی که پرداخت نمی‌کنید مکث کنید. مقاله GR00T N1 تقریباً ۵۰,۰۰۰ ساعت GPU H100 را برای پیش‌آموزش مدل 2.2B، روی خوشه‌ای تا ۱۰۲۴ GPU، با اندازه بچ پیش‌آموزش ۱۶,۳۸۴ برای ۲۰۰,۰۰۰ گام گرادیان گزارش می‌دهد. با نرخ ۱.۳۴ تا ۲.۳۴ دلار در ساعت که در بالا اندازه‌گیری شد، این مقدار در حدود ۶۷,۰۰۰ تا ۱۱۷,۰۰۰ دلار محاسبات اجاره‌ای است. مقاله SmolVLA پروژه خود را تقریباً ۳۰,۰۰۰ ساعت GPU در ۴۸۱ مجموعه داده جامعه، ۲۲.۹ هزار اپیزود و ۱۰.۶ میلیون فریم قرار می‌دهد. شما همه اینها را با قیمت یک دانلود به ارث می‌برید؛ ۸ دلار شما ۲۰,۰۰۰ گام آخر را می‌خرد. چرا VLAها اینگونه ساخته می‌شوند آن تقسیم‌بندی را پوشش می‌دهد.

بازو: یک هزینه یک‌باره که صورت‌حساب GPU را ناچیز می‌کند

یک دور آموزش کمتر از ناهار هزینه دارد. ربات اینطور نیست. به همین دلیل SO-100 اهمیت دارد: این ارزان‌ترین بازویی است که کل یادگیری تقلیدی زنجیره ابزار واقعاً پشتیبانی می‌کند.

بازوسرووهاولتاژهزینه قطعاتپشتیبانی در AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURکامل، بازوی مرجع
SO-101Feetech STS32157.4 V130 to 170 EURکامل
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURسازگار
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURسازگار

فهرست مواد اولیه در مخزن SO-ARM100 دقیق‌تر است و ارزش بررسی در منطقه شما را دارد: لیست قطعات برای دو بازو آن مجموعاً 229.88 دلار آمریکا یا 226.30 یورو برای یک راه‌اندازی رهبر به همراه پیرو است، و لیست قطعات برای یک بازوی پیرو آن مجموعاً 121.94 دلار آمریکا یا 124.30 یورو است. شش سروو STS3215 با قیمت 13.89 دلار آمریکا برای هر کدام، 83.34 دلار از آن 121.94 دلار را تشکیل می‌دهند، بنابراین سرووها همان بازو هستند. با 1 تا 3 دلار آمریکا برای هر اجرای SmolVLA یا ACT، یک جفت بازو بین 77 تا 230 دور آموزش ارزش دارد. اگر هنوز در حال انتخاب هستید، SO-100 در مقابل SO-101 مقایسه‌ای است که اهمیت دارد، زیرا این دو به اندازه‌ای به هم نزدیک هستند که تصمیم‌گیری بیشتر به در دسترس بودن مربوط می‌شود تا قابلیت.

7.4 V، نه 12 V

STS3215 در دو نوع 7.4 ولت و 12 ولت عرضه می‌شود؛ مخزن اشاره می‌کند که قطعه 12 ولت نیز به جای منبع تغذیه 5 ولت، به یک منبع تغذیه 12 ولت 5 آمپر نیاز دارد، بنابراین این دو قابل تعویض نیستند. تغذیه 12 ولت به سرووهای 7.4 ولت آنها را از بین می‌برد، و شش سروو دو سوم هزینه قطعات یک بازوی پیرو را تشکیل می‌دهند. برچسب روی هر سروو را قبل از اولین روشن کردن بررسی کنید. اگر سرووها قبلاً به طور عجیبی رفتار می‌کنند: سروو پاسخ نمی‌دهد، بازو می‌لرزد سپس افت می‌کند.

ساعات انسانی: ردیفی که هیچ‌کس در صفحه گسترده نمی‌گذارد

این عددی است که بحث هزینه را کاملاً دگرگون می‌کند. ضبط دموها به این صورت است که یک نفر بازوی ربات را در زمان واقعی، یک اپیزود در هر زمان، حرکت می‌دهد. هیچ دسته‌بندی و اجاره‌ای بر اساس ثانیه وجود ندارد. LeRobot dataset ضبط‌کننده با تنظیمات پیش‌فرض عرضه می‌شود که محاسبات را آسان می‌کند، هر سه در DatasetRecordConfig: ۶۰ ثانیه برای هر اپیزود، ۶۰ ثانیه برای بازنشانی صحنه، ۵۰ اپیزود. ستون هزینه در پایین ۱۵ دلار آمریکا را برای یک ساعت کار یک نفر در نظر می‌گیرد، که این یک فرض است تا یک عدد پلتفرم. نرخ خود را جایگزین کنید؛ نسبت مهم است.

  1. 1
    مجموعه داده را با پیش‌فرض‌هایی که واقعاً برای آن‌ها صورت‌حساب دریافت خواهید کرد، ضبط کنید

    این lerobot 0.6.1 است، نسخه‌ای که در تاریخ ۳ اوت ۲۰۲۶ در PyPI موجود است. به شکل CLI توجه کنید: ضبط از طریق نقطه ورودی کنسول lerobot-record (lerobot.scripts.lerobot_record) اجرا می‌شود، نه مسیر ماژول قدیمی python -m lerobot.scripts.record. AY-Robots نسخه 0.5.1 را هدف قرار می‌دهد، و چرخ 0.5.1 همان نقاط ورودی lerobot-record و lerobot-train را اعلام می‌کند، بنابراین شکل زیر در هر دو پایدار است. سه پرچم زمان‌بندی پیش‌فرض‌های بالادستی هستند، بنابراین این همان دستوری است که محاسبات در جدول بعدی بر اساس آن انجام می‌شود.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    قبل از اجاره حتی یک دقیقه GPU، آنچه را که ضبط کرده‌اید بررسی کنید

    بازرسی یک مجموعه داده صفر دلار آمریکا در ساعت هزینه دارد. کشف همین مشکل از یک منحنی زیان ۲.۰۰ دلار آمریکا در ساعت در رده H100 هزینه دارد و چهار ساعت دیرتر به شما اطلاع می‌دهد. مجموعه داده را ارسال کنید و آن را در نمایشگر LeRobot بررسی کنید، یا دایرکتوری مجموعه داده AY-Robots را مرور کنید.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    آموزش دهید و مطمئن شوید که نقطه بازرسی از عمر پاد بیشتر است

    یک ماشین اجاره‌ای ذاتاً موقتی است، بنابراین نقاط بازرسی را در طول اجرا در مکانی پایدار بنویسید. دو پرچم تعیین می‌کنند که آیا آنچه را که برای آن پرداخت کرده‌اید، نگه می‌دارید یا خیر. --save_freq به طور پیش‌فرض ۲۰,۰۰۰ گام است، بنابراین یک اجرای پیش‌فرض ۲۰,۰۰۰ گامی SmolVLA اولین نقطه بازرسی خود را زمانی می‌نویسد که اجرا از قبل به پایان رسیده است؛ قبل از اجاره هر چیز قابل قطع، آن را کاهش دهید. --save_checkpoint_to_hub به --policy.repo_id نیاز دارد و در lerobot 0.5.1 وجود ندارد، بنابراین در آن نسخه باید خودتان دایرکتوری خروجی را از روی ماشین کپی کنید. اندازه دسته در پایین نمونه‌ای از مستندات بالادستی است؛ فرم AY-Robots برای SmolVLA عدد ۲ را ارسال می‌کند و با ظاهر شدن نقاط بازرسی، آن‌ها را در فضای ذخیره‌سازی اشیاء می‌نویسد.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
اپیزودهاضبط در ۶۰ ثانیهبازنشانی در ۶۰ ثانیهزمان واقعیبه علاوه ۲۰ درصد ضبط مجددبا ۱۵ دلار آمریکا در هر ساعت انسانی
۳۰، حداقل SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
۵۰، چهار حداقل دیگر50 min50 min1 h 40 min2 h 00 minabout 30 USD
۱۰۰، یک مجموعه داده راحت100 min100 min3 h 20 min4 h 00 minabout 60 USD

ستون سمت راست را با هزینه اجرای 1 تا 12 دلاری مقایسه کنید. با این نرخ فرضی، یک مجموعه داده 50 قسمتی، دو تا هفت برابر بیشتر از هزینه آموزش، برای ضبط هزینه دارد، قبل از کالیبراسیون، تنظیم دوربین و قسمت‌هایی که دور می‌ریزید. به همین دلیل است که ارزش دلاری مستقیمی دارد. راهنمای LeRobot حداقل 50 قسمت با 10 قسمت برای هر مکان شی را پیشنهاد می‌کند؛ مستندات SmolVLA گزارش می‌دهند که یک نسخه 25 قسمتی از همان کار کافی نبوده است.

جایی که پول واقعاً از دست می‌رود

1. اجرا بر روی داده‌هایی که هرگز کار نمی‌کردند

یک اجرای 20,000 مرحله‌ای GR00T بر روی یک مجموعه داده با دو جریان دوربین جابجا شده، همان هزینه را دارد که بر روی یک مجموعه داده تمیز دارد، همان زمان را می‌برد و یک منحنی افت (loss curve) تولید می‌کند که خوب به نظر می‌رسد. شکست ساعت‌ها بعد، روی بازو ظاهر می‌شود. به صورت ساعتی محاسبه می‌شوند و تشخیص به صورت روزانه محاسبه می‌شود. دو نشانه که ارزش به خاطر سپردن دارند: معمولاً به این معنی است که مشاهدات آنچه را که وظیفه نیاز دارد، حمل نمی‌کنند، و به این معنی است که مجموعه داده تنوع کمتری نسبت به آنچه فکر می‌کردید، داشته است.

2. پرداخت هزینه‌های مدل پایه برای یک وظیفه با دوربین ثابت

ACT تقریباً 80 میلیون پارامتر دارد و برای آموزش از ابتدا بر روی 50 نمایش یک وظیفه طراحی شده است. GR00T N1.7 تقریباً 3 میلیارد پارامتر با یک ستون فقرات از پیش آموزش‌دیده دارد. برای یک دوربین ثابت، یک میز ثابت و یک شیء، مدل 80 میلیونی اغلب به هدف می‌رسد، با سرعت حدود 20 میلی‌ثانیه در هر گام عملیاتی به جای 152 میلی‌ثانیه اجرا می‌شود و 1 تا 3 دلار به ازای هر اجرا هزینه دارد به جای 4 تا 12 دلار. 3 دلار هزینه کنید تا بفهمید آیا مدل ارزان‌تر کار می‌کند یا خیر، قبل از اینکه 12 دلار برای مدل گران‌تر خرج کنید. ACT در برابر SmolVLA و GR00T N1.7 در برابر Pi0.5 نشان می‌دهند که هر کدام در کجا دیگر پاسخ صحیح نیستند؛ عرصه مدل دارای 85 مدل و 332 نتیجه بنچمارک است.

3. پردازنده گرافیکی که فراموش کردید

ارزان‌ترین اشتباه برای جلوگیری و رایج‌ترین اشتباه برای انجام دادن. یک نمونه که در روز جمعه برای اشکال‌زدایی چیزی شروع شده است، در طول آخر هفته با همان نرخ یک اجرای واقعی صورتحساب می‌شود.

کارتنرخ میانه در لحظهبیکار به مدت ۲۴ ساعتبیکار به مدت ۷ روزارزش آن
RTX 40900.32 USD/h7.68 USD53.76 USDحدود ۲۷ اجرای SmolVLA یا ACT با ۲ دلار
A100 80 GB0.56 USD/h13.44 USD94.08 USDحدود ۱۲ اجرای GR00T با ۸ دلار
H100 80 GB1.80 USD/h43.20 USD302.40 USDحدود ۳۸ اجرای GR00T با ۸ دلار

در AY-Robots، این خطا برای استنتاج طراحی شده است: پادهایی که توسط API استنتاج تأمین می‌شوند، یک ناظر بیکاری (idle watchdog) را حمل می‌کنند و پس از یک دوره بیکاری خود را از بین می‌برند. اگر کارت را خودتان اجاره کنید، آن ناظر بیکاری یادآور تقویم شماست.

۴. پرداخت دو برابر برای یک پاسخ

نقطه ورود تنظیم دقیق GR00T یک CLI از نوع tyro است که هیچ seedی را نمایش نمی‌دهد. این یک محدودیت پلتفرم نیست، بلکه ابزار بالادستی است: هیچ فیلد seedی در gr00t/configs/finetune_config.py، و نکات آموزشی خود مخزن هشدار می‌دهند که اجراها به دلیل غیرقطعی بودن افزایش‌های تصویر، ۵ تا ۶ درصد متفاوت هستند. lerobot در هر دو نسخه 0.5.1 و 0.6.1 به طور پیش‌فرض از seed 1000 استفاده می‌کند، بنابراین اجراهای ACT، SmolVLA و Pi0.5 حداقل می‌توانند از همان مقداردهی اولیه و ترتیب داده‌ها دوباره اجرا شوند. این تضمین وزن‌های بیت-یکسان روی GPU نیست، اما تفاوت بین یک اجرای مجدد و یک آزمایش جدید است. اگر یک اجرای GR00T سیاستی را تولید کند که کار می‌کند و شما چک‌پوینت، را نگه نداشته‌اید، هزینه کامل را برای نتیجه‌ای پرداخت می‌کنید که ممکن است بیش از تفاوتی باشد که به دنبال آن بودید. راه دومی برای از دست دادن چک‌پوینتی که برای آن هزینه کرده‌اید وجود دارد: CLI به طور پیش‌فرض از --save-total-limit 5 استفاده می‌کند، که به عنوان حداکثر تعداد چک‌پوینت‌های نگهداری شده قبل از حذف موارد قدیمی‌تر مستند شده است. ذخیره‌سازی چند سنت است؛ یک اجرای مجدد ۴ تا ۱۲ دلار و شش ساعت هزینه دارد.

ظرفیت قابل وقفه نصف قیمت است و اجرای شما را متوقف می‌کند

حداقل قیمت‌های پیشنهادی بالا کسری از نرخ درخواستی هستند و vast.ai می‌گوید سیستم مناقصه می‌تواند هزینه‌های مشتری را پنجاه درصد یا بیشتر کاهش دهد. نکته مهم، به گفته خودشان: یک نمونه قابل وقفه می‌تواند در هر زمان متوقف شود اگر کاربر دیگری پیشنهاد بالاتری بدهد یا یک اجاره درخواستی برای همان منابع ایجاد شود، و این توقف «تمام فرآیندهای در حال اجرا را متوقف می‌کند». تقاضا همیشه اولویت دارد. این برای یک اجرا که هر چند صد مرحله یک نقطه بازیابی می‌نویسد خوب است، اما برای اجرایی که در انتها می‌نویسد یک ضرر کامل است، که دقیقاً همان چیزی است که تنظیمات پیش‌فرض به شما می‌دهند: Isaac-GR00T CLI هر --save-steps (پیش‌فرض 1000) می‌نویسد، اما --save_freq lerobot به طور پیش‌فرض 20,000 مرحله است، بنابراین یک اجرای پیش‌فرض SmolVLA فقط یک بار در خط پایان نقطه بازیابی می‌کند. آن را کاهش دهید، یا پیشنهاد ندهید. فرم آموزش AY-Robots تنظیم GR00T را به عنوان saveSteps نمایش می‌دهد.

اجاره کارت گرافیک توسط خودتان
مزایا
  • پایین‌ترین نرخ ساعتی موجود.
  • کنترل کامل بر ایمیج، نسخه CUDA، بازبینی lerobot یا Isaac-GR00T و هر پرچم.
  • پیشنهاد قابل وقفه نرخ را نصف می‌کند اگر اجرای شما به اندازه کافی مکرر نقطه بازیابی کند تا از توقف جان سالم به در ببرد.
  • هیچ چیز انتزاعی نیست، بنابراین وقتی یک اجرا به طور غیرعادی رفتار می‌کند، می‌توانید دلیل آن را ببینید.
معایب
  • هزینه‌های راه‌اندازی با نرخ GPU محاسبه می‌شود: درایورها، وابستگی‌ها، نقطه بازیابی پایه چند گیگابایتی و دانلود مجموعه داده، همگی به ازای هر ساعت به اندازه آموزش هزینه دارند.
  • یک نمونه قابل وقفه که پیشنهاد بالاتری برای آن داده شده، متوقف می‌شود و فرآیندهای آن از بین می‌روند. یک اجرای ذخیره نشده به معنای هدر رفتن پول است، و پیش‌فرض lerobot اولین نقطه بازیابی خود را در مرحله 20,000 می‌نویسد.
  • هیچ چیز پاد را برای شما از بین نمی‌برد. جدول بیکاری بالا صورت‌حساب فراموشی است.
  • عرضه کارت‌های کامل 80 GB تک‌گانه کم است: در این بررسی دو پیشنهاد A100 80 GB و پنج پیشنهاد H100 80 GB کارت کامل وجود دارد. لیست‌ها نیز دائماً تغییر می‌کنند، بنابراین ارزان‌ترین قیمت لیست شده و قیمتی که واقعاً می‌توانید اجاره کنید یکسان نیستند.
  • هر ساعت صرف شده روی زیرساخت، ساعتی است که برای ضبط اپیزودهایی که تعیین می‌کنند آیا سیاست کار می‌کند یا خیر، صرف نشده است.

انجام آن توسط خودتان در مقابل اجازه دادن به پلتفرم برای اجاره کارت

شما ماشین را انتخاب می‌کنید، محیط را می‌سازید و پاد را از بین می‌برید. نرخ ساعتی همان نرخ بازار بالاست؛ هر چیز دیگری زمان شماست.

  1. کارتی را پیدا کنید که با VRAM مورد نیاز مدل مطابقت داشته باشد: 24 GB برای ACT و SmolVLA، 80 GB برای GR00T و Pi0.5.
  2. اگر اجرا نمی‌تواند از توقف جان سالم به در ببرد، درخواستی اجاره کنید؛ اگر مکرراً نقطه بازیابی می‌کند، قابل وقفه اجاره کنید.
  3. ابزارها را نصب کنید: lerobot برای ACT، SmolVLA و Pi0.5، مخزن Isaac-GR00T با لانچر tyro مخصوص خود برای GR00T.
  4. در صورت نیاز، مجموعه داده را تبدیل کنید. یک مجموعه داده LeRobot v3.0 لودر GR00T را از کار می‌اندازد و باید به v2.1 تبدیل شود.
  5. اجرا کنید، افت را مشاهده کنید، نقاط بازیابی را به محض نوشته شدن در جایی پایدار ذخیره کنید.
  6. نمونه را از بین ببرید، سپس بررسی کنید که آن را از بین برده‌اید.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
نقطه ورودی فعلی fine-tune Isaac-GR00T، مطابق با دستور در README مخزن. این CLI پرچم seed ندارد، بنابراین اجراهای GR00T به صورت بیت به بیت قابل بازتولید نیستند.

هزینه واقعی برای یک اجرای GR00T: 3 تا 6 ساعت روی یک H100 80 GB با نرخ 1.34 تا 2.34 USD در ساعت، 4 تا 14 USD است، به علاوه 20 تا 40 دقیقه راه‌اندازی که آن هم هزینه دارد، به علاوه زمان خودتان.

پلتفرم چه هزینه‌ای دریافت می‌کند و چگونه کارت را انتخاب می‌کند

منطق عمداً ساده است. هر مدل در کاتالوگ، یک رده GPU را اعلام می‌کند؛ بک‌اند VRAM مورد نیاز را گرفته و یک کارت منطبق را در همان بازار لحظه‌ای که در بالا اندازه‌گیری شد، اجاره می‌کند. به همین دلیل هزینه اعلام شده یک محدوده است، نه یک قیمت ثابت. GR00T و Pi0.5 در اینجا فقط ابری هستند به دلیل حداقل‌های 40 GB و 70 GB. SmolVLA و ACT همچنین به صورت محلی روی کارت 24 GB خود شما اجرا می‌شوند، جایی که هزینه ابری صفر است و برق مشکل شماست.

صفحه قیمت‌گذاری AY-Robots که هزینه یک اجرای آموزش و دسترسی به پلتفرم را نشان می‌دهد
صفحه قیمت‌گذاری. ارقام هر اجرا بازار لحظه‌ای را دنبال می‌کنند نه یک قیمت ثابت.

یک تنظیم نیاز به هشدار دارد. انباشت گرادیان واقعاً برای هر دو نوع GR00T اعمال می‌شود، بنابراین افزایش آن یک بچ مؤثر بزرگتر را روی همان کارت فراهم می‌کند. برای Pi0.5 و SmolVLA اصلاً اعمال نمی‌شود: lerobot 0.5.1 هیچ گزینه انباشت گرادیانی در تنظیمات آموزش خود ندارد، بنابراین تنظیم این فیلد روی 16 هیچ هزینه‌ای ندارد و چیزی هم به دست نمی‌آورد. اگر یک کار در صف هرگز شروع نشد، صفحه مربوط به کار گیر کرده در صف آنچه را که باید بررسی کنید پوشش می‌دهد؛ اگر مجموعه داده قبل از شروع اجرا رد شود، تقریباً همیشه مشکل فرمت v3.0 است.

محدودیتی که این پلتفرم حل نمی‌کند: تأخیر

یک GPU اجاره‌ای که سیاست شما را از طریق اینترنت عمومی ارائه می‌دهد، رفت و برگشت‌هایی را به یک حلقه کنترل اضافه می‌کند که خود از قبل 20 تا 485 میلی‌ثانیه در هر مرحله عمل است. برای عملیات کند برداشتن و گذاشتن مناسب است، اما برای حرکت واکنشی سریع خیر. استنتاج ابری یک نقطه بازرسی را به خوبی ارزیابی می‌کند و دستکاری تولیدی را بد اجرا می‌کند: اگر کار به سرعت نیاز دارد، محاسبات باید در کنار سرووها قرار گیرد، و این هزینه‌ای است که این مقاله نمی‌تواند آن را از بین ببرد. به تأخیر استنتاج مراجعه کنید.

بودجه‌ای عملی برای اولین سیاست کاری

هر چهار خط با هم، از صفر شروع می‌شوند. مجموع GPU فرض می‌کند 3 تا 5 اجرا: اولین اجرا ثابت می‌کند که پایپ‌لاین کار می‌کند، دومی یک مشکل داده را آشکار می‌کند، سومی یا چهارمی همان است که شما نگه می‌دارید.

ردیفمسیر کم‌هزینهمسیر راحت
بازوفقط SO-100 follower، 121.94 دلار در BOMleader به علاوه follower، 229.88 دلار در BOM
مدلSmolVLA یا ACT، رده 24 گیگابایتGR00T N1.7، A100 80 گیگابایت یا H100 رده
اپیزودهای ضبط شده30، حداقل SmolVLA50 تا 100
زمان انسانی برای ضبطحدود 1 ساعت و 12 دقیقه2 تا 4 ساعت
هزینه یک اجرا1 تا 3 دلار4 تا 12 دلار
اجراها قبل از کار کردن3 تا 53 تا 5
کل هزینه GPU3 تا 15 دلار12 تا 60 دلار
بزرگترین ردیف در صورتحساببازو، سپس زمان شمابازو، سپس زمان شما

این الگو در این اندازه از ربات نیز صادق است: محاسبات یک خطای گرد کردن است، سخت‌افزار یک هزینه واقعی یک‌بار مصرف است، و ساعات کاری انسان هزینه تکراری است. برای آزمایش بخش آموزش قبل از خرید هر چیزی، نقاط ورودی بدون سخت‌افزار به شما امکان می‌دهد مدل‌ها را مقایسه کنید و یک GPU را بدون نیاز به بازوی ربات اجاره کنید، و بازوی زنده یک SO-100 فیزیکی است که می‌توانید آن را در مرورگر بدون نیاز به ثبت‌نام کنترل کنید. برای کل خط لوله از ابتدا تا انتها، راهنمای کامل SO-100 راه‌اندازی، تله‌اپریشن و آموزش را پوشش می‌دهد، و اولین سیاست خود را آموزش دهید نسخه کوتاه آن است.

ماتریس آموزش AY-Robots با پنج سیاست به عنوان ردیف و چهار بازوی ربات به عنوان ستون، که هر سلول به یک راهنمای آموزشی خاص لینک می‌دهد.
ماتریس /train: ردیف برای بودجه شما، ستون برای بازوی ربات شما، و سلول برای راهنمای پیش‌فرض‌ها و هزینه آن ترکیب.
هزینه یک اجرای کامل تنظیم دقیق VLA چقدر است؟

حدود 4 تا 12 دلار آمریکا برای GR00T N1.7، GR00T N1.5 یا Pi0.5 در رده A100 80 GB یا H100 (3 تا 6 ساعت با نرخ 1.20 تا 2.00 دلار آمریکا در ساعت)، و حدود 1 تا 3 دلار آمریکا برای SmolVLA یا ACT در رده RTX 4090 (2 تا 5 ساعت با نرخ 0.30 تا 0.60 دلار آمریکا در ساعت). اجاره کارت توسط خودتان نیز پس از احتساب زمان راه‌اندازی، در همین محدوده قرار می‌گیرد، زیرا با نرخ آموزش محاسبه می‌شود.

آیا پرداخت هزینه بیشتر برای H100 نسبت به A100 80 GB ارزش دارد؟

برای یک سیاست SO-100، معمولاً خیر. هر دو حداقل حافظه مورد نیاز GR00T و Pi0.5 را تامین می‌کنند، و در تاریخ 23 آگوست 2026، یک A100 80 GB کامل با 0.44 دلار آمریکا در ساعت در مقابل 1.34 دلار برای یک H100 80 GB شروع شد. H100 زودتر به پایان می‌رسد، بنابراین بخشی از نرخ به صورت ساعات کمتر بازمی‌گردد، اما هزینه کل برای یک اجرای به این کوچکی همچنان بالاتر است. دلیل اصلی برای H100، در دسترس بودن است: پنج پیشنهاد H100 80 GB تکی در آن بازار در مقابل دو A100 80 GB، و کارتی که نمی‌توانید اجاره کنید، قیمتی ندارد.

چند اجرا طول می‌کشد تا یک سیاست واقعاً کار کند؟

برای سه تا پنج اجرا برنامه‌ریزی کنید. اولین اجرا ثابت می‌کند که خط لوله به درستی سیم‌کشی شده است. دومی معمولاً یک مشکل در مجموعه داده را آشکار می‌کند، مانند قطع شدن جریان دوربین در میانه راه. سومی یا چهارمی همان است که نگه می‌دارید.

آیا می‌توانم SmolVLA یا ACT را روی GPU خودم آموزش دهم به جای اجاره کردن؟

بله. هر دو به صورت محلی در AY-Robots پشتیبانی می‌شوند و هر دو به راحتی در 24 GB جا می‌شوند؛ مقاله اصلی ACT مدل 80M خود را در حدود 5 ساعت روی یک RTX 2080 Ti با 11 GB آموزش داد. GR00T و Pi0.5 در اینجا فقط ابری هستند زیرا حداقل حافظه مستند شده توسط فروشندگان برای تنظیم دقیق 40 GB و 70 GB است، و بزرگترین کارت مصرف‌کننده در بازار RTX 5090 با 32 GB است.

چرا تعداد گام‌های یکسان در مدل‌های مختلف هزینه‌های متفاوتی دارد؟

تعداد گام‌ها در سیاست‌های مختلف قابل مقایسه نیستند. ACT به طور پیش‌فرض 100,000 گام با بچ 8 روی یک کارت 24 GB دارد؛ GR00T N1.5 به طور پیش‌فرض 2,000 گام با بچ 1 و انباشت گرادیان 16 روی یک کارت 80 GB دارد. صورت‌حساب بر اساس ساعات ضربدر نرخ کارتی است که میزان حافظه مورد نیاز شما را مجبور به استفاده از آن می‌کند، نه شمارنده گام‌ها.

قبل از شروع، ببینید اجرای شما چقدر هزینه خواهد داشت

هر یک از پنج سیاست، رده GPU، زمان اجرا و قیمت هر اجرا را لیست می‌کند، و بک‌اند آموزش، کارت را در همان بازار لحظه‌ای که این اعداد در آن اندازه‌گیری شده‌اند، اجاره می‌کند.

قیمت‌گذاری را بررسی کنید

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started