
قیمتهای واقعی GPU در بازار لحظهای، مدت زمان اجرای هر یک از پنج سیاست، هزینه بازو و نمایشها، و چهار جایی که پول بیصدا ناپدید میشود.
نسخه کوتاه
- •یک اجرا در رده A100 80 GB یا H100 بین 3 تا 6 ساعت طول میکشد و حدود 4 تا 12 دلار هزینه دارد. در رده RTX 4090، این زمان 2 تا 5 ساعت و هزینه حدود 1 تا 3 دلار است.
- •اندازهگیری شده در vast.ai در ساعت 13:44 UTC در 23 آگوست 2026: یک RTX 4090 کامل در صورت تقاضا با 0.13 تا 0.38 دلار در ساعت، یک A100 80 GB با 0.44 تا 0.67 دلار، یک H100 80 GB با 1.34 تا 2.34 دلار. کارتهای 80 GB کامل کمیاب هستند، به ترتیب دو و پنج پیشنهاد تک کارتی.
- •GPU ارزانترین بخش است. لیست مواد SO-ARM100 یک جفت رهبر به همراه دنبالکننده را 229.88 دلار برآورد میکند که معادل 77 تا 230 اجرا در رده 24 GB است.
- •دو ساعت ضبط 50 اپیزود توسط یک شخص، بیشتر از هزینه اجرای آموزشی است که این اپیزودها به آن تغذیه میکنند.
- •پول در چهار جا از بین میرود: اجراها با دادههای خراب، مدلهای 3B برای وظایفی که یک خطمشی 80M انجام میدهد، GPUهایی که کسی از بین نبرده، و اجرای مجدد نتایجی که نتوانستهاید حفظ کنید.
- •AY-Robots اندازه کارت را بر اساس VRAM مورد نیاز مدل تعیین میکند و آن را در همان بازار لحظهای اجاره میدهد، بنابراین هزینه اجرا همان هزینه بازار است.
صورتحساب چهار بخش دارد و GPU کوچکترین آنهاست
وقتی مردم میپرسند هزینه تنظیم دقیق یک مدل بینایی-زبان-عمل برای یک SO-100 چقدر است، تقریباً همیشه منظورشان اجاره GPU است. این عددی است که به عنوان هزینه روی کارت ظاهر میشود، بنابراین همان چیزی است که واقعی به نظر میرسد. همچنین، با اختلاف زیاد، کوچکترین از چهار عددی است که تعیین میکند یک خطمشی کارآمد واقعاً چقدر برای شما هزینه دارد.
| بخش | چیست | اندازه معمول برای یک خطمشی کارآمد |
|---|---|---|
| زمان GPU | اجاره کارت برای اجرا | 1 تا 12 دلار به ازای هر اجرا، و شما 3 تا 5 اجرا انجام خواهید داد |
| ربات | سرووها، فریم چاپی، دوربینها، کابلها، برق | یک بار، 110 تا 500 یورو به ازای هر بازو |
| ساعات انسانی | شخصی که بازو را برای ضبط دموها هدایت میکند | 1 تا 4 ساعت به ازای هر مجموعه داده، تکرار شده به ازای هر وظیفه |
| ضایعات | دادههای بد، مدلهای بیش از حد بزرگ، پادهای فراموش شده | نامحدود، و تنها بخشی که شما کنترل میکنید |
زمانهای آموزش در ادامه از مقالات و مخازن خود پنج مدل، هزینه سختافزار از لیست مواد منتشر شده، و اعداد پلتفرم از AY-Robots کاتالوگ سیاستها و صفحه قیمتگذاری. در مواردی که پلتفرم کمکی نمیکند، این مقاله به آن اشاره میکند.
هزینه واقعی یک ساعت GPU در بازار لحظهای
هیچ قیمت واحدی برای یک ساعت A100 وجود ندارد. در بازاری مانند vast.ai هر میزبان نرخ خود را تعیین میکند، و اجرای آموزشی که شما راهاندازی میکنید، روی هر ماشینی که در آن لحظه ارزان و آزاد باشد، قرار میگیرد. پاسخ صادقانه یک توزیع است. در اینجا، اندازهگیری شده در 23 آگوست 2026 در ساعت 13:44 UTC: کارتهای کامل تکی، بر اساس تقاضا، فیلتر شده بر اساس VRAM واقعی.
| کارت | vast.ai بر اساس تقاضا USD/h (کم / میانه / زیاد) | پیشنهادات کارت کامل | کف قیمت vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | ارائه نشده |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | ارائه نشده |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | ارائه نشده |
پیشنهادات درخواستی برای یک GPU کامل (gpu_frac == 1.0) از API عمومی vast.ai که نیازی به حساب کاربری ندارد، بر اساس gpu_ram فیلتر شدهاند تا فقط کارتهای 80 گیگابایتی واقعی در ردیفهای 80 گیگابایتی قرار گیرند. این فیلتر مهم است: در این بررسی، هر سه پیشنهاد تک کارتی A100 SXM4 قطعات 40 گیگابایتی بودند، همانطور که دو مورد از چهار پیشنهاد A100 PCIE نیز چنین بودند، بنابراین جمعآوری آنها در یک ردیف "A100" قیمت گزارش شده در اینجا را نصف میکرد. ستون Hugging Face دو محصول را ترکیب میکند: 2.50 USD/h سختافزار Nvidia A100 - large Spaces است و 4.50 USD/h یک H100 80 GB تحت Inference Endpoints است که Spaces آن را ارائه نمیدهد. میانگینها را به عنوان شاخص در نظر بگیرید: ردیف A100 80 GB بر اساس دو پیشنهاد و ردیف H100 بر اساس پنج پیشنهاد است، و همان کوئری 36 ثانیه بعد تعداد 4090 متفاوتی و قیمت بالای متفاوتی را در سه ردیف از پنج ردیف بازگرداند. قیمتهای لیست RunPod عدد پایدارتری برای برنامهریزی هستند.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
چرا مدلهای 3B نمیتوانند از کارت ارزان استفاده کنند
یک ساعت 4090 و یک ساعت H100 80 GB در میانگینهای بالا تقریباً شش برابر با هم تفاوت دارند. آنچه شما را به سمت کارت گرانقیمت سوق میدهد، سرعت نیست، بلکه حافظه است. openpi حداقل حافظه مورد نیاز برای یک Pi0.5 کامل را فاینتیون 70 GB تعیین میکند و NVIDIA برای GR00T، 40 GB یا بیشتر را توصیه میکند. توجه داشته باشید که عدد GR00T به چه معنا نیست. پیکربندی فاینتیون آن به طور پیشفرض مدل زبان و رمزگذار بصری را فریز میکند (tune_llm و tune_visual False هستند، در حالی که پروژکتور و هد انتشار True هستند)، به همین دلیل کاتالوگ تقریباً 40 میلیون پارامتر آموزشدیده از 3 میلیارد را فهرست میکند. 40 GB مربوط به وضعیت بهینهساز برای وزنهای 3 میلیارد نیست، بلکه مربوط به ستون فقرات فریز شده به علاوه فعالسازیها است. نسخههای با دامنه کاهشیافته، کمتر نیاز دارند: مسیر LoRA در openpi به 22.5 GB نیاز دارد و 4090 را نام میبرد، و گردش کار Isaac Lab Arena شرکت NVIDIA یک گزینه تک-GPU با 24 GB را برای پسآموزش GR00T فهرست میکند. پلتفرم بر اساس حداقل حافظه مورد نیاز که هر فروشنده برای پیکربندی واقعی خود منتشر میکند، طبقهبندی میشود. مقاله pi0 flow-matching توضیح میدهد که آن flow-matching ردپا از کجا میآید.
| کار | حافظه مورد نیاز پروژه بالادستی | منبع |
|---|---|---|
| استنتاج pi0 / pi0.5 | more than 8 GB, example RTX 4090 | openpi |
| فاینتیون LoRA برای pi0 / pi0.5 | more than 22.5 GB, example RTX 4090 | openpi |
| فاینتیون کامل pi0 / pi0.5 | more than 70 GB, example A100 80 GB or H100 | openpi |
| استنتاج GR00T N1.7 | 1 GPU with 16 GB or more | Isaac-GR00T |
| فاینتیون GR00T N1.7 | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| فاینتیون GR00T، آنچه آموزش میدهد | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| پسآموزش GR00T، کاهشیافته | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| فاینتیون SmolVLA | single A100 for the reference 20,000-step run | lerobot docs |
| آموزش ACT | a single 11 GB RTX 2080 Ti | ACT paper |
این جدول دلیل تقسیم پنج مدل توسط پلتفرم به دو رده است. GR00T N1.7، GR00T N1.5 و Pi0.5 روی A100 80 GB یا H100 اجرا میشوند زیرا این چیزی است که فروشندگان درخواست میکنند. SmolVLA و ACT روی RTX 4090 یا هر کارت 24 GB دیگری اجرا میشوند زیرا این مقدار واقعاً کافی است.
اجرای GR00T یا Pi0.5 روی کارت 24 GB در ثانیه صفر با شکست مواجه نمیشود. این مدل، چکپوینت پایه را دانلود میکند، فهرست مجموعه داده را میسازد، اولین مرحله پیشرو را آغاز میکند و پس از چند صد گام با خطای CUDA out-of-memory از کار میافتد. شما هزینه دانلود و راهاندازی را پرداخت کردهاید و چیزی به دست نیاوردهاید. راهحلها: کمبود حافظه در حین آموزش.
مدت زمان اجرای واقعی هر یک از پنج مدل
زمان اجرا نیمه دیگر هزینه است: 2.00 USD در ساعت بیاهمیت است اگر کار 40 دقیقه طول بکشد و ویرانگر است اگر 40 ساعت باشد. اینها تنظیمات پیشفرض AY-Robots هستند که واقعاً به مربی ارسال میکند، همراه با پنجره اجرا و هزینه برای هر سطح.
| سیاست | سطح GPU | حداکثر گامهای پیشفرض | بچ پیشفرض (تجمع گرادیان) | پنجره اجرا | هزینه هر اجرا |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32، تجمع 1، اعمال میشود | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1، تجمع 16، اعمال میشود | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1، تجمع 16، بدون تأثیر | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2، تجمع 8، بدون تأثیر | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8، تجمع 1 | 2 to 5 h | 1 to 3 USD |

پنجرههای اجرای بالادستی از کجا میآیند
- SmolVLA: مستندات lerobot بیان میکند که ۲۰,۰۰۰ گام تقریباً ۴ ساعت روی یک A100 طول میکشد. پلتفرم همین ۲۰,۰۰۰ گام را روی رده ۲۴ گیگابایتی ارزانتر اجرا میکند، از این رو یک پنجره زمانی به جای ۴ ساعت ثابت.
- ACT: مقاله اصلی ALOHA حدود ۵ ساعت را روی یک RTX 2080 Ti با ۱۱ گیگابایت برای یک مدل ۸۰ میلیون پارامتری گزارش میدهد. یک ۴۰۹۰ چندین نسل جدیدتر است اما پلتفرم ۱۰۰,۰۰۰ گام را بودجهبندی میکند، بنابراین پنجره زمانی در همان مکان قرار میگیرد.
- GR00T: گردش کار مرجع NVIDIA برای نسل N1.6 تقریباً ۴ تا ۸ ساعت را برای ۲۰,۰۰۰ گام با بچ ۲۴ روی هشت کارت L40S، و ۲ تا ۳ ساعت را برای ۳۰,۰۰۰ گام با بچ ۱۶ روی یک Ada 6000 ذکر میکند. تنظیم دقیق (fine-tuning) یک VLA 3B با یک کارت در چند ساعت عادی است، نه خوشبینانه.
- Pi0.5: openpi هیچ رقم زمان واقعی (wall-clock) منتشر نمیکند، اما حداقل ۷۰ گیگابایت را برای یک تنظیم دقیق کامل منتشر میکند که کارت و در نتیجه نرخ را مشخص میکند.
ارزش دارد که روی عددی که پرداخت نمیکنید مکث کنید. مقاله GR00T N1 تقریباً ۵۰,۰۰۰ ساعت GPU H100 را برای پیشآموزش مدل 2.2B، روی خوشهای تا ۱۰۲۴ GPU، با اندازه بچ پیشآموزش ۱۶,۳۸۴ برای ۲۰۰,۰۰۰ گام گرادیان گزارش میدهد. با نرخ ۱.۳۴ تا ۲.۳۴ دلار در ساعت که در بالا اندازهگیری شد، این مقدار در حدود ۶۷,۰۰۰ تا ۱۱۷,۰۰۰ دلار محاسبات اجارهای است. مقاله SmolVLA پروژه خود را تقریباً ۳۰,۰۰۰ ساعت GPU در ۴۸۱ مجموعه داده جامعه، ۲۲.۹ هزار اپیزود و ۱۰.۶ میلیون فریم قرار میدهد. شما همه اینها را با قیمت یک دانلود به ارث میبرید؛ ۸ دلار شما ۲۰,۰۰۰ گام آخر را میخرد. چرا VLAها اینگونه ساخته میشوند آن تقسیمبندی را پوشش میدهد.
بازو: یک هزینه یکباره که صورتحساب GPU را ناچیز میکند
یک دور آموزش کمتر از ناهار هزینه دارد. ربات اینطور نیست. به همین دلیل SO-100 اهمیت دارد: این ارزانترین بازویی است که کل یادگیری تقلیدی زنجیره ابزار واقعاً پشتیبانی میکند.
| بازو | سرووها | ولتاژ | هزینه قطعات | پشتیبانی در AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | کامل، بازوی مرجع |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | کامل |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | سازگار |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | سازگار |
فهرست مواد اولیه در مخزن SO-ARM100 دقیقتر است و ارزش بررسی در منطقه شما را دارد: لیست قطعات برای دو بازو آن مجموعاً 229.88 دلار آمریکا یا 226.30 یورو برای یک راهاندازی رهبر به همراه پیرو است، و لیست قطعات برای یک بازوی پیرو آن مجموعاً 121.94 دلار آمریکا یا 124.30 یورو است. شش سروو STS3215 با قیمت 13.89 دلار آمریکا برای هر کدام، 83.34 دلار از آن 121.94 دلار را تشکیل میدهند، بنابراین سرووها همان بازو هستند. با 1 تا 3 دلار آمریکا برای هر اجرای SmolVLA یا ACT، یک جفت بازو بین 77 تا 230 دور آموزش ارزش دارد. اگر هنوز در حال انتخاب هستید، SO-100 در مقابل SO-101 مقایسهای است که اهمیت دارد، زیرا این دو به اندازهای به هم نزدیک هستند که تصمیمگیری بیشتر به در دسترس بودن مربوط میشود تا قابلیت.
STS3215 در دو نوع 7.4 ولت و 12 ولت عرضه میشود؛ مخزن اشاره میکند که قطعه 12 ولت نیز به جای منبع تغذیه 5 ولت، به یک منبع تغذیه 12 ولت 5 آمپر نیاز دارد، بنابراین این دو قابل تعویض نیستند. تغذیه 12 ولت به سرووهای 7.4 ولت آنها را از بین میبرد، و شش سروو دو سوم هزینه قطعات یک بازوی پیرو را تشکیل میدهند. برچسب روی هر سروو را قبل از اولین روشن کردن بررسی کنید. اگر سرووها قبلاً به طور عجیبی رفتار میکنند: سروو پاسخ نمیدهد، بازو میلرزد سپس افت میکند.
ساعات انسانی: ردیفی که هیچکس در صفحه گسترده نمیگذارد
این عددی است که بحث هزینه را کاملاً دگرگون میکند. ضبط دموها به این صورت است که یک نفر بازوی ربات را در زمان واقعی، یک اپیزود در هر زمان، حرکت میدهد. هیچ دستهبندی و اجارهای بر اساس ثانیه وجود ندارد. LeRobot dataset ضبطکننده با تنظیمات پیشفرض عرضه میشود که محاسبات را آسان میکند، هر سه در DatasetRecordConfig: ۶۰ ثانیه برای هر اپیزود، ۶۰ ثانیه برای بازنشانی صحنه، ۵۰ اپیزود. ستون هزینه در پایین ۱۵ دلار آمریکا را برای یک ساعت کار یک نفر در نظر میگیرد، که این یک فرض است تا یک عدد پلتفرم. نرخ خود را جایگزین کنید؛ نسبت مهم است.
- 1مجموعه داده را با پیشفرضهایی که واقعاً برای آنها صورتحساب دریافت خواهید کرد، ضبط کنید
این lerobot 0.6.1 است، نسخهای که در تاریخ ۳ اوت ۲۰۲۶ در PyPI موجود است. به شکل CLI توجه کنید: ضبط از طریق نقطه ورودی کنسول
lerobot-record(lerobot.scripts.lerobot_record) اجرا میشود، نه مسیر ماژول قدیمیpython -m lerobot.scripts.record. AY-Robots نسخه 0.5.1 را هدف قرار میدهد، و چرخ 0.5.1 همان نقاط ورودیlerobot-recordوlerobot-trainرا اعلام میکند، بنابراین شکل زیر در هر دو پایدار است. سه پرچم زمانبندی پیشفرضهای بالادستی هستند، بنابراین این همان دستوری است که محاسبات در جدول بعدی بر اساس آن انجام میشود.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2قبل از اجاره حتی یک دقیقه GPU، آنچه را که ضبط کردهاید بررسی کنید
بازرسی یک مجموعه داده صفر دلار آمریکا در ساعت هزینه دارد. کشف همین مشکل از یک منحنی زیان ۲.۰۰ دلار آمریکا در ساعت در رده H100 هزینه دارد و چهار ساعت دیرتر به شما اطلاع میدهد. مجموعه داده را ارسال کنید و آن را در نمایشگر LeRobot بررسی کنید، یا دایرکتوری مجموعه داده AY-Robots را مرور کنید.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3آموزش دهید و مطمئن شوید که نقطه بازرسی از عمر پاد بیشتر است
یک ماشین اجارهای ذاتاً موقتی است، بنابراین نقاط بازرسی را در طول اجرا در مکانی پایدار بنویسید. دو پرچم تعیین میکنند که آیا آنچه را که برای آن پرداخت کردهاید، نگه میدارید یا خیر.
--save_freqبه طور پیشفرض ۲۰,۰۰۰ گام است، بنابراین یک اجرای پیشفرض ۲۰,۰۰۰ گامی SmolVLA اولین نقطه بازرسی خود را زمانی مینویسد که اجرا از قبل به پایان رسیده است؛ قبل از اجاره هر چیز قابل قطع، آن را کاهش دهید.--save_checkpoint_to_hubبه--policy.repo_idنیاز دارد و در lerobot 0.5.1 وجود ندارد، بنابراین در آن نسخه باید خودتان دایرکتوری خروجی را از روی ماشین کپی کنید. اندازه دسته در پایین نمونهای از مستندات بالادستی است؛ فرم AY-Robots برای SmolVLA عدد ۲ را ارسال میکند و با ظاهر شدن نقاط بازرسی، آنها را در فضای ذخیرهسازی اشیاء مینویسد.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| اپیزودها | ضبط در ۶۰ ثانیه | بازنشانی در ۶۰ ثانیه | زمان واقعی | به علاوه ۲۰ درصد ضبط مجدد | با ۱۵ دلار آمریکا در هر ساعت انسانی |
|---|---|---|---|---|---|
| ۳۰، حداقل SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| ۵۰، چهار حداقل دیگر | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| ۱۰۰، یک مجموعه داده راحت | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
ستون سمت راست را با هزینه اجرای 1 تا 12 دلاری مقایسه کنید. با این نرخ فرضی، یک مجموعه داده 50 قسمتی، دو تا هفت برابر بیشتر از هزینه آموزش، برای ضبط هزینه دارد، قبل از کالیبراسیون، تنظیم دوربین و قسمتهایی که دور میریزید. به همین دلیل است که ارزش دلاری مستقیمی دارد. راهنمای LeRobot حداقل 50 قسمت با 10 قسمت برای هر مکان شی را پیشنهاد میکند؛ مستندات SmolVLA گزارش میدهند که یک نسخه 25 قسمتی از همان کار کافی نبوده است.
جایی که پول واقعاً از دست میرود
1. اجرا بر روی دادههایی که هرگز کار نمیکردند
یک اجرای 20,000 مرحلهای GR00T بر روی یک مجموعه داده با دو جریان دوربین جابجا شده، همان هزینه را دارد که بر روی یک مجموعه داده تمیز دارد، همان زمان را میبرد و یک منحنی افت (loss curve) تولید میکند که خوب به نظر میرسد. شکست ساعتها بعد، روی بازو ظاهر میشود. به صورت ساعتی محاسبه میشوند و تشخیص به صورت روزانه محاسبه میشود. دو نشانه که ارزش به خاطر سپردن دارند: معمولاً به این معنی است که مشاهدات آنچه را که وظیفه نیاز دارد، حمل نمیکنند، و به این معنی است که مجموعه داده تنوع کمتری نسبت به آنچه فکر میکردید، داشته است.
2. پرداخت هزینههای مدل پایه برای یک وظیفه با دوربین ثابت
ACT تقریباً 80 میلیون پارامتر دارد و برای آموزش از ابتدا بر روی 50 نمایش یک وظیفه طراحی شده است. GR00T N1.7 تقریباً 3 میلیارد پارامتر با یک ستون فقرات از پیش آموزشدیده دارد. برای یک دوربین ثابت، یک میز ثابت و یک شیء، مدل 80 میلیونی اغلب به هدف میرسد، با سرعت حدود 20 میلیثانیه در هر گام عملیاتی به جای 152 میلیثانیه اجرا میشود و 1 تا 3 دلار به ازای هر اجرا هزینه دارد به جای 4 تا 12 دلار. 3 دلار هزینه کنید تا بفهمید آیا مدل ارزانتر کار میکند یا خیر، قبل از اینکه 12 دلار برای مدل گرانتر خرج کنید. ACT در برابر SmolVLA و GR00T N1.7 در برابر Pi0.5 نشان میدهند که هر کدام در کجا دیگر پاسخ صحیح نیستند؛ عرصه مدل دارای 85 مدل و 332 نتیجه بنچمارک است.
3. پردازنده گرافیکی که فراموش کردید
ارزانترین اشتباه برای جلوگیری و رایجترین اشتباه برای انجام دادن. یک نمونه که در روز جمعه برای اشکالزدایی چیزی شروع شده است، در طول آخر هفته با همان نرخ یک اجرای واقعی صورتحساب میشود.
| کارت | نرخ میانه در لحظه | بیکار به مدت ۲۴ ساعت | بیکار به مدت ۷ روز | ارزش آن |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | حدود ۲۷ اجرای SmolVLA یا ACT با ۲ دلار |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | حدود ۱۲ اجرای GR00T با ۸ دلار |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | حدود ۳۸ اجرای GR00T با ۸ دلار |
در AY-Robots، این خطا برای استنتاج طراحی شده است: پادهایی که توسط API استنتاج تأمین میشوند، یک ناظر بیکاری (idle watchdog) را حمل میکنند و پس از یک دوره بیکاری خود را از بین میبرند. اگر کارت را خودتان اجاره کنید، آن ناظر بیکاری یادآور تقویم شماست.
۴. پرداخت دو برابر برای یک پاسخ
نقطه ورود تنظیم دقیق GR00T یک CLI از نوع tyro است که هیچ seedی را نمایش نمیدهد. این یک محدودیت پلتفرم نیست، بلکه ابزار بالادستی است: هیچ فیلد seedی در gr00t/configs/finetune_config.py، و نکات آموزشی خود مخزن هشدار میدهند که اجراها به دلیل غیرقطعی بودن افزایشهای تصویر، ۵ تا ۶ درصد متفاوت هستند. lerobot در هر دو نسخه 0.5.1 و 0.6.1 به طور پیشفرض از seed 1000 استفاده میکند، بنابراین اجراهای ACT، SmolVLA و Pi0.5 حداقل میتوانند از همان مقداردهی اولیه و ترتیب دادهها دوباره اجرا شوند. این تضمین وزنهای بیت-یکسان روی GPU نیست، اما تفاوت بین یک اجرای مجدد و یک آزمایش جدید است. اگر یک اجرای GR00T سیاستی را تولید کند که کار میکند و شما چکپوینت، را نگه نداشتهاید، هزینه کامل را برای نتیجهای پرداخت میکنید که ممکن است بیش از تفاوتی باشد که به دنبال آن بودید. راه دومی برای از دست دادن چکپوینتی که برای آن هزینه کردهاید وجود دارد: CLI به طور پیشفرض از --save-total-limit 5 استفاده میکند، که به عنوان حداکثر تعداد چکپوینتهای نگهداری شده قبل از حذف موارد قدیمیتر مستند شده است. ذخیرهسازی چند سنت است؛ یک اجرای مجدد ۴ تا ۱۲ دلار و شش ساعت هزینه دارد.
حداقل قیمتهای پیشنهادی بالا کسری از نرخ درخواستی هستند و vast.ai میگوید سیستم مناقصه میتواند هزینههای مشتری را پنجاه درصد یا بیشتر کاهش دهد. نکته مهم، به گفته خودشان: یک نمونه قابل وقفه میتواند در هر زمان متوقف شود اگر کاربر دیگری پیشنهاد بالاتری بدهد یا یک اجاره درخواستی برای همان منابع ایجاد شود، و این توقف «تمام فرآیندهای در حال اجرا را متوقف میکند». تقاضا همیشه اولویت دارد. این برای یک اجرا که هر چند صد مرحله یک نقطه بازیابی مینویسد خوب است، اما برای اجرایی که در انتها مینویسد یک ضرر کامل است، که دقیقاً همان چیزی است که تنظیمات پیشفرض به شما میدهند: Isaac-GR00T CLI هر --save-steps (پیشفرض 1000) مینویسد، اما --save_freq lerobot به طور پیشفرض 20,000 مرحله است، بنابراین یک اجرای پیشفرض SmolVLA فقط یک بار در خط پایان نقطه بازیابی میکند. آن را کاهش دهید، یا پیشنهاد ندهید. فرم آموزش AY-Robots تنظیم GR00T را به عنوان saveSteps نمایش میدهد.
- پایینترین نرخ ساعتی موجود.
- کنترل کامل بر ایمیج، نسخه CUDA، بازبینی lerobot یا Isaac-GR00T و هر پرچم.
- پیشنهاد قابل وقفه نرخ را نصف میکند اگر اجرای شما به اندازه کافی مکرر نقطه بازیابی کند تا از توقف جان سالم به در ببرد.
- هیچ چیز انتزاعی نیست، بنابراین وقتی یک اجرا به طور غیرعادی رفتار میکند، میتوانید دلیل آن را ببینید.
- هزینههای راهاندازی با نرخ GPU محاسبه میشود: درایورها، وابستگیها، نقطه بازیابی پایه چند گیگابایتی و دانلود مجموعه داده، همگی به ازای هر ساعت به اندازه آموزش هزینه دارند.
- یک نمونه قابل وقفه که پیشنهاد بالاتری برای آن داده شده، متوقف میشود و فرآیندهای آن از بین میروند. یک اجرای ذخیره نشده به معنای هدر رفتن پول است، و پیشفرض lerobot اولین نقطه بازیابی خود را در مرحله 20,000 مینویسد.
- هیچ چیز پاد را برای شما از بین نمیبرد. جدول بیکاری بالا صورتحساب فراموشی است.
- عرضه کارتهای کامل 80 GB تکگانه کم است: در این بررسی دو پیشنهاد A100 80 GB و پنج پیشنهاد H100 80 GB کارت کامل وجود دارد. لیستها نیز دائماً تغییر میکنند، بنابراین ارزانترین قیمت لیست شده و قیمتی که واقعاً میتوانید اجاره کنید یکسان نیستند.
- هر ساعت صرف شده روی زیرساخت، ساعتی است که برای ضبط اپیزودهایی که تعیین میکنند آیا سیاست کار میکند یا خیر، صرف نشده است.
انجام آن توسط خودتان در مقابل اجازه دادن به پلتفرم برای اجاره کارت
شما ماشین را انتخاب میکنید، محیط را میسازید و پاد را از بین میبرید. نرخ ساعتی همان نرخ بازار بالاست؛ هر چیز دیگری زمان شماست.
- کارتی را پیدا کنید که با VRAM مورد نیاز مدل مطابقت داشته باشد: 24 GB برای ACT و SmolVLA، 80 GB برای GR00T و Pi0.5.
- اگر اجرا نمیتواند از توقف جان سالم به در ببرد، درخواستی اجاره کنید؛ اگر مکرراً نقطه بازیابی میکند، قابل وقفه اجاره کنید.
- ابزارها را نصب کنید: lerobot برای ACT، SmolVLA و Pi0.5، مخزن Isaac-GR00T با لانچر tyro مخصوص خود برای GR00T.
- در صورت نیاز، مجموعه داده را تبدیل کنید. یک مجموعه داده LeRobot v3.0 لودر GR00T را از کار میاندازد و باید به v2.1 تبدیل شود.
- اجرا کنید، افت را مشاهده کنید، نقاط بازیابی را به محض نوشته شدن در جایی پایدار ذخیره کنید.
- نمونه را از بین ببرید، سپس بررسی کنید که آن را از بین بردهاید.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>هزینه واقعی برای یک اجرای GR00T: 3 تا 6 ساعت روی یک H100 80 GB با نرخ 1.34 تا 2.34 USD در ساعت، 4 تا 14 USD است، به علاوه 20 تا 40 دقیقه راهاندازی که آن هم هزینه دارد، به علاوه زمان خودتان.
شما مدل، مجموعه داده و هایپرپارامترها را در یک فرم انتخاب میکنید. بکاند یک GPU نقطهای با اندازه VRAM مورد نیاز مدل اجاره میکند، ترینر را اجرا میکند و نقاط بازیابی را در فضای ذخیرهسازی ابری مینویسد.
- ترکیب خود را در ماتریس آموزش انتخاب کنید: پنج مدل، چهار بازو، یک راهنما در هر سلول.
- آن را به یک مجموعه داده اشاره دهید: یکی که با کلاینت دسکتاپ ضبط شده، یک Hugging Face repo id، یا یکی از ماشین خودتان.
- پیشفرضها را بپذیرید یا آنها را تنظیم کنید. جدول بالا چیزی است که واقعاً به ترینر ارسال میشود.
- بکاند کارت را بر اساس VRAM مورد نیاز انتخاب میکند، بنابراین شما هرگز به دنبال GPU نمیگردید.
- نقاط بازیابی به محض نوشته شدن در فضای ذخیرهسازی ابری قرار میگیرند، بنابراین یک اجرای متوقف شده، یک اجرای از دست رفته نیست.
| سطح | مدلها | زمان اجرا | هزینه هر اجرا |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 تا 6 ساعت | حدود 4 تا 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 تا 5 ساعت | حدود 1 تا 3 USD |
کاری که انجام نمیدهد: یک مجموعه داده بد را خوب کند، به GR00T یک seed بدهد که هرگز نداشته، یا محدودیت تأخیر توضیح داده شده در زیر را حذف کند. این کار خرید GPU، ساخت محیط و پادی که فراموش کردهاید از بین ببرید را حذف میکند. مکانیکها در مستندات آموزش هستند.
پلتفرم چه هزینهای دریافت میکند و چگونه کارت را انتخاب میکند
منطق عمداً ساده است. هر مدل در کاتالوگ، یک رده GPU را اعلام میکند؛ بکاند VRAM مورد نیاز را گرفته و یک کارت منطبق را در همان بازار لحظهای که در بالا اندازهگیری شد، اجاره میکند. به همین دلیل هزینه اعلام شده یک محدوده است، نه یک قیمت ثابت. GR00T و Pi0.5 در اینجا فقط ابری هستند به دلیل حداقلهای 40 GB و 70 GB. SmolVLA و ACT همچنین به صورت محلی روی کارت 24 GB خود شما اجرا میشوند، جایی که هزینه ابری صفر است و برق مشکل شماست.

یک تنظیم نیاز به هشدار دارد. انباشت گرادیان واقعاً برای هر دو نوع GR00T اعمال میشود، بنابراین افزایش آن یک بچ مؤثر بزرگتر را روی همان کارت فراهم میکند. برای Pi0.5 و SmolVLA اصلاً اعمال نمیشود: lerobot 0.5.1 هیچ گزینه انباشت گرادیانی در تنظیمات آموزش خود ندارد، بنابراین تنظیم این فیلد روی 16 هیچ هزینهای ندارد و چیزی هم به دست نمیآورد. اگر یک کار در صف هرگز شروع نشد، صفحه مربوط به کار گیر کرده در صف آنچه را که باید بررسی کنید پوشش میدهد؛ اگر مجموعه داده قبل از شروع اجرا رد شود، تقریباً همیشه مشکل فرمت v3.0 است.
یک GPU اجارهای که سیاست شما را از طریق اینترنت عمومی ارائه میدهد، رفت و برگشتهایی را به یک حلقه کنترل اضافه میکند که خود از قبل 20 تا 485 میلیثانیه در هر مرحله عمل است. برای عملیات کند برداشتن و گذاشتن مناسب است، اما برای حرکت واکنشی سریع خیر. استنتاج ابری یک نقطه بازرسی را به خوبی ارزیابی میکند و دستکاری تولیدی را بد اجرا میکند: اگر کار به سرعت نیاز دارد، محاسبات باید در کنار سرووها قرار گیرد، و این هزینهای است که این مقاله نمیتواند آن را از بین ببرد. به تأخیر استنتاج مراجعه کنید.
بودجهای عملی برای اولین سیاست کاری
هر چهار خط با هم، از صفر شروع میشوند. مجموع GPU فرض میکند 3 تا 5 اجرا: اولین اجرا ثابت میکند که پایپلاین کار میکند، دومی یک مشکل داده را آشکار میکند، سومی یا چهارمی همان است که شما نگه میدارید.
| ردیف | مسیر کمهزینه | مسیر راحت |
|---|---|---|
| بازو | فقط SO-100 follower، 121.94 دلار در BOM | leader به علاوه follower، 229.88 دلار در BOM |
| مدل | SmolVLA یا ACT، رده 24 گیگابایت | GR00T N1.7، A100 80 گیگابایت یا H100 رده |
| اپیزودهای ضبط شده | 30، حداقل SmolVLA | 50 تا 100 |
| زمان انسانی برای ضبط | حدود 1 ساعت و 12 دقیقه | 2 تا 4 ساعت |
| هزینه یک اجرا | 1 تا 3 دلار | 4 تا 12 دلار |
| اجراها قبل از کار کردن | 3 تا 5 | 3 تا 5 |
| کل هزینه GPU | 3 تا 15 دلار | 12 تا 60 دلار |
| بزرگترین ردیف در صورتحساب | بازو، سپس زمان شما | بازو، سپس زمان شما |
این الگو در این اندازه از ربات نیز صادق است: محاسبات یک خطای گرد کردن است، سختافزار یک هزینه واقعی یکبار مصرف است، و ساعات کاری انسان هزینه تکراری است. برای آزمایش بخش آموزش قبل از خرید هر چیزی، نقاط ورودی بدون سختافزار به شما امکان میدهد مدلها را مقایسه کنید و یک GPU را بدون نیاز به بازوی ربات اجاره کنید، و بازوی زنده یک SO-100 فیزیکی است که میتوانید آن را در مرورگر بدون نیاز به ثبتنام کنترل کنید. برای کل خط لوله از ابتدا تا انتها، راهنمای کامل SO-100 راهاندازی، تلهاپریشن و آموزش را پوشش میدهد، و اولین سیاست خود را آموزش دهید نسخه کوتاه آن است.

هزینه یک اجرای کامل تنظیم دقیق VLA چقدر است؟▾
حدود 4 تا 12 دلار آمریکا برای GR00T N1.7، GR00T N1.5 یا Pi0.5 در رده A100 80 GB یا H100 (3 تا 6 ساعت با نرخ 1.20 تا 2.00 دلار آمریکا در ساعت)، و حدود 1 تا 3 دلار آمریکا برای SmolVLA یا ACT در رده RTX 4090 (2 تا 5 ساعت با نرخ 0.30 تا 0.60 دلار آمریکا در ساعت). اجاره کارت توسط خودتان نیز پس از احتساب زمان راهاندازی، در همین محدوده قرار میگیرد، زیرا با نرخ آموزش محاسبه میشود.
آیا پرداخت هزینه بیشتر برای H100 نسبت به A100 80 GB ارزش دارد؟▾
برای یک سیاست SO-100، معمولاً خیر. هر دو حداقل حافظه مورد نیاز GR00T و Pi0.5 را تامین میکنند، و در تاریخ 23 آگوست 2026، یک A100 80 GB کامل با 0.44 دلار آمریکا در ساعت در مقابل 1.34 دلار برای یک H100 80 GB شروع شد. H100 زودتر به پایان میرسد، بنابراین بخشی از نرخ به صورت ساعات کمتر بازمیگردد، اما هزینه کل برای یک اجرای به این کوچکی همچنان بالاتر است. دلیل اصلی برای H100، در دسترس بودن است: پنج پیشنهاد H100 80 GB تکی در آن بازار در مقابل دو A100 80 GB، و کارتی که نمیتوانید اجاره کنید، قیمتی ندارد.
چند اجرا طول میکشد تا یک سیاست واقعاً کار کند؟▾
برای سه تا پنج اجرا برنامهریزی کنید. اولین اجرا ثابت میکند که خط لوله به درستی سیمکشی شده است. دومی معمولاً یک مشکل در مجموعه داده را آشکار میکند، مانند قطع شدن جریان دوربین در میانه راه. سومی یا چهارمی همان است که نگه میدارید.
آیا میتوانم SmolVLA یا ACT را روی GPU خودم آموزش دهم به جای اجاره کردن؟▾
بله. هر دو به صورت محلی در AY-Robots پشتیبانی میشوند و هر دو به راحتی در 24 GB جا میشوند؛ مقاله اصلی ACT مدل 80M خود را در حدود 5 ساعت روی یک RTX 2080 Ti با 11 GB آموزش داد. GR00T و Pi0.5 در اینجا فقط ابری هستند زیرا حداقل حافظه مستند شده توسط فروشندگان برای تنظیم دقیق 40 GB و 70 GB است، و بزرگترین کارت مصرفکننده در بازار RTX 5090 با 32 GB است.
چرا تعداد گامهای یکسان در مدلهای مختلف هزینههای متفاوتی دارد؟▾
تعداد گامها در سیاستهای مختلف قابل مقایسه نیستند. ACT به طور پیشفرض 100,000 گام با بچ 8 روی یک کارت 24 GB دارد؛ GR00T N1.5 به طور پیشفرض 2,000 گام با بچ 1 و انباشت گرادیان 16 روی یک کارت 80 GB دارد. صورتحساب بر اساس ساعات ضربدر نرخ کارتی است که میزان حافظه مورد نیاز شما را مجبور به استفاده از آن میکند، نه شمارنده گامها.
قبل از شروع، ببینید اجرای شما چقدر هزینه خواهد داشت
هر یک از پنج سیاست، رده GPU، زمان اجرا و قیمت هر اجرا را لیست میکند، و بکاند آموزش، کارت را در همان بازار لحظهای که این اعداد در آن اندازهگیری شدهاند، اجاره میکند.
قیمتگذاری را بررسی کنیدSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started