
أسعار وحدات معالجة الرسوميات (GPU) الحقيقية في السوق الفورية، ومدة تشغيل كل سياسة من السياسات الخمس، وتكلفة الذراع والعروض التوضيحية، والأماكن الأربعة التي تختفي فيها الأموال بهدوء.
النسخة المختصرة
- •تستغرق التشغيلة على فئة A100 80 GB أو H100 من 3 إلى 6 ساعات وتكلف حوالي 4 إلى 12 دولارًا أمريكيًا. على فئة RTX 4090، تستغرق من 2 إلى 5 ساعات وتكلف حوالي 1 إلى 3 دولارات أمريكية.
- •تم القياس على vast.ai في الساعة 13:44 بالتوقيت العالمي المنسق في 23 أغسطس 2026: بطاقة RTX 4090 كاملة عند الطلب بسعر 0.13 إلى 0.38 دولار أمريكي/ساعة، وبطاقة A100 80 GB بسعر 0.44 إلى 0.67، وبطاقة H100 80 GB بسعر 1.34 إلى 2.34. بطاقات 80 GB الكاملة نادرة، مع عرضين وخمسة عروض لبطاقة واحدة على التوالي.
- •وحدة معالجة الرسوميات (GPU) هي البند الأقل تكلفة. تضع فاتورة مواد SO-ARM100 زوجًا من القائد والتابع بسعر 229.88 دولارًا أمريكيًا، وهو ما يعادل من 77 إلى 230 تشغيلة على فئة 24 GB.
- •ساعتان من تسجيل شخص لـ 50 حلقة تكلف أكثر من تشغيلة التدريب التي تغذيها تلك الحلقات.
- •تختفي الأموال في أربعة أماكن: التشغيل على بيانات معطوبة، نماذج 3B على مهام تتعامل معها سياسة 80M، وحدات معالجة رسوميات لم يدمرها أحد، وإعادة تشغيل نتيجة فشلت في الاحتفاظ بها.
- •تقوم AY-Robots بتحديد حجم البطاقة بناءً على ذاكرة الفيديو (VRAM) التي يحتاجها النموذج وتستأجرها في نفس السوق الفوري، لذا فإن تكلفة التشغيل هي تكلفة السوق.
الفاتورة تتكون من أربعة بنود، ووحدة معالجة الرسوميات هي الأصغر
عندما يسأل الناس عن تكلفة الضبط الدقيق لـ نموذج الرؤية واللغة والحركة لـ SO-100، فإنهم يقصدون دائمًا تقريبًا استئجار وحدة معالجة الرسوميات (GPU). هذا هو الرقم الذي يظهر كرسوم على البطاقة، لذا فهو الذي يبدو حقيقيًا. وهو أيضًا، بفارق كبير، الأصغر من بين الأرقام الأربعة التي تحدد التكلفة الفعلية لـ سياسة عاملة.
| البند | ما هو | الحجم النموذجي لسياسة عاملة واحدة |
|---|---|---|
| GPU time | استئجار بطاقة للتشغيل | من 1 إلى 12 دولارًا أمريكيًا لكل تشغيلة، وستقوم بـ 3 إلى 5 تشغيلات |
| الروبوت | المحركات المؤازرة، الإطار المطبوع، الكاميرات، الكابلات، الطاقة | مرة واحدة، من 110 إلى 500 يورو لكل ذراع |
| ساعات العمل البشري | شخص يقود الذراع لتسجيل العروض التوضيحية | من 1 إلى 4 ساعات لكل مجموعة بيانات، تتكرر لكل مهمة |
| الهدر | بيانات سيئة، نماذج كبيرة الحجم، حاويات منسية | غير محدود، وهو البند الوحيد الذي تتحكم فيه |
أوقات التدريب أدناه مستمدة من أوراق ومستودعات النماذج الخمسة نفسها، وتكلفة الأجهزة من قائمة المواد المنشورة، وأرقام المنصات من AY-Robots كتالوج السياسات وصفحة الأسعار. وحيث لا تساعد المنصة، تشير هذه المقالة إلى ذلك.
ما هي التكلفة الفعلية لساعة وحدة معالجة الرسوميات (GPU) في السوق الفوري
لا يوجد سعر واحد لساعة A100. في سوق مثل vast.ai، يحدد كل مضيف سعره الخاص، وتشغيل التدريب الذي تطلقه يهبط على أي جهاز رخيص ومتاح في تلك اللحظة. الإجابة الصادقة هي توزيع. إليك القياس، في 23 أغسطس 2026 الساعة 13:44 بالتوقيت العالمي المنسق: بطاقات كاملة فردية، عند الطلب، مصفاة حسب ذاكرة الفيديو الفعلية (VRAM).
| البطاقة | vast.ai عند الطلب دولار أمريكي/ساعة (منخفض / متوسط / مرتفع) | عروض البطاقات الكاملة | الحد الأدنى للمزايدة في vast.ai | RunPod مجتمع / آمن | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
عروض حسب الطلب لوحدة معالجة رسوميات كاملة واحدة (gpu_frac == 1.0) من واجهة برمجة تطبيقات الحزم العامة vast.ai، والتي لا تتطلب حسابًا، وتمت تصفيتها بناءً على gpu_ram بحيث تظهر فقط بطاقات 80 جيجابايت الأصلية في صفوف 80 جيجابايت. هذا الفلتر مهم: في هذه القراءة، كانت جميع عروض A100 SXM4 الثلاثة ذات البطاقة الواحدة أجزاءً بسعة 40 جيجابايت، وكذلك اثنان من عروض A100 PCIE الأربعة، لذا فإن تجميعها في صف واحد باسم "A100" كان سيخفض السعر المبلغ عنه هنا إلى النصف. يمزج عمود Hugging Face بين منتجين: 2.50 USD/h هو جهاز Nvidia A100 - large Spaces و 4.50 USD/h هو H100 80 GB واحد ضمن Inference Endpoints، والذي لا تقدمه Spaces. تعامل مع القيم الوسيطة كمؤشرات: يعتمد صف A100 80 GB على عرضين وصف H100 على خمسة، وأعادت نفس الاستعلام بعد 36 ثانية عددًا مختلفًا لـ 4090 وسعرًا أعلى مختلفًا على ثلاثة من الصفوف الخمسة. أسعار قائمة RunPod هي الرقم الأكثر استقرارًا للتخطيط بناءً عليه.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
لماذا لا تستطيع نماذج 3B استخدام البطاقة الرخيصة
تختلف ساعة 4090 وساعة H100 80 جيجابايت بحوالي ستة أضعاف عند القيم الوسيطة المذكورة أعلاه. ما يدفعك لاستخدام البطاقة باهظة الثمن ليس السرعة، بل الذاكرة. يحدد openpi الحد الأدنى لـ Pi0.5 كامل الضبط الدقيق عند 70 جيجابايت، وتوصي NVIDIA بـ 40 جيجابايت أو أكثر لـ GR00T. لاحظ ما لا يمثله رقم GR00T. يقوم إعداد الضبط الدقيق الخاص به بتجميد نموذج اللغة والمشفر البصري افتراضيًا (tune_llm و tune_visual هي False، بينما يكون جهاز العرض ورأس الانتشار True)، وهذا هو السبب في أن الكتالوج يسرد حوالي 40 مليون معلمة مدربة من أصل 3 مليار. الـ 40 جيجابايت ليست حالة مُحسِّن لأوزان 3 مليار، بل هي العمود الفقري المجمد بالإضافة إلى التنشيطات. تنخفض المتغيرات ذات النطاق المحدود إلى مستويات أقل: يتطلب مسار LoRA الخاص بـ openpi 22.5 جيجابايت ويذكر 4090، ويسرد سير عمل Isaac Lab Arena من NVIDIA خيار GPU واحد بسعة 24 جيجابايت لـ GR00T بعد التدريب. تعتمد مستويات المنصة على الحد الأدنى الذي ينشره كل بائع للتكوين الذي يقوم بتشغيله فعليًا. المقال التفصيلي حول مطابقة التدفق لـ pi0 يشرح من أين تأتي بصمة مطابقة التدفق هذه.
| المهمة | الذاكرة التي يطلبها المشروع الأصلي | المصدر |
|---|---|---|
| استدلال pi0 / pi0.5 | أكثر من 8 جيجابايت، مثال RTX 4090 | openpi |
| ضبط دقيق LoRA لـ pi0 / pi0.5 | أكثر من 22.5 جيجابايت، مثال RTX 4090 | openpi |
| ضبط دقيق كامل لـ pi0 / pi0.5 | أكثر من 70 جيجابايت، مثال A100 80 جيجابايت أو H100 | openpi |
| استدلال GR00T N1.7 | 1 GPU بسعة 16 جيجابايت أو أكثر | Isaac-GR00T |
| ضبط دقيق GR00T N1.7 | يوصى بـ 40 جيجابايت أو أكثر، عقد H100 أو L40 | Isaac-GR00T |
| ضبط دقيق GR00T، ما يدربه | جهاز العرض ورأس الانتشار؛ LLM والمشفر البصري مجمدان افتراضيًا | finetune_config.py |
| GR00T بعد التدريب، مخفض | 1 GPU بسعة 24 جيجابايت، نموذج اللغة مجمد | Isaac Lab Arena |
| ضبط دقيق SmolVLA | A100 واحد لتشغيل 20,000 خطوة المرجعي | lerobot docs |
| تدريب ACT | بطاقة RTX 2080 Ti واحدة بسعة 11 جيجابايت | ACT paper |
هذا الجدول هو السبب في أن المنصة تقسم النماذج الخمسة إلى مستويين. GR00T N1.7، GR00T N1.5 و Pi0.5 تعمل على A100 80 جيجابايت أو H100 لأن هذا ما يطلبه البائعون. SmolVLA و ACT تعمل على RTX 4090 أو أي بطاقة بسعة 24 جيجابايت لأن ذلك كافٍ بالفعل.
تشغيل GR00T أو Pi0.5 على بطاقة بسعة 24 جيجابايت لا يفشل في الثانية صفر. يقوم بتنزيل نقطة التحقق الأساسية، ويبني فهرس مجموعة البيانات، ويبدأ التمريرة الأمامية الأولى، ثم يتوقف بعد بضع مئات من الخطوات بسبب خطأ نفاد ذاكرة CUDA. لقد دفعت مقابل التنزيل والإعداد ولم تحصل على شيء. الحلول: نفاد الذاكرة أثناء التدريب.
المدة الفعلية لتشغيل كل نموذج من النماذج الخمسة
وقت التشغيل هو النصف الآخر من التكلفة: 2.00 دولار أمريكي في الساعة لا يهم إذا كانت المهمة تستغرق 40 دقيقة، ويكون مدمراً إذا استغرقت 40 ساعة. هذه هي الإعدادات الافتراضية التي ترسلها AY-Robots بالفعل إلى المدرب، مع نافذة التشغيل والتكلفة لكل مستوى.
| السياسة | فئة وحدة معالجة الرسوميات (GPU) | الحد الأقصى الافتراضي للخطوات | الدفعة الافتراضية (تراكم التدرج) | نافذة التشغيل | التكلفة لكل تشغيل |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32، تراكم 1، ينطبق | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1، تراكم 16، ينطبق | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1، تراكم 16، لا يوجد تأثير | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2، تراكم 8، لا يوجد تأثير | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8، تراكم 1 | 2 to 5 h | 1 to 3 USD |

من أين تأتي فترات التشغيل هذه من المصدر الأعلى
- SmolVLA: تذكر وثائق lerobot أن 20,000 خطوة تستغرق حوالي 4 ساعات على بطاقة A100 واحدة. تقوم المنصة بتشغيل نفس الـ 20,000 خطوة على الفئة الأقل تكلفة بسعة 24 GB، وبالتالي تكون هناك فترة زمنية متغيرة بدلاً من 4 ساعات ثابتة.
- ACT: تفيد ورقة ALOHA الأصلية بحوالي 5 ساعات على بطاقة 11 GB RTX 2080 Ti واحدة لنموذج بـ 80M-parameter. بطاقة 4090 أحدث بعدة أجيال، لكن المنصة تخصص ميزانية لـ 100,000 خطوة، لذا تقع الفترة الزمنية المتغيرة في نفس النطاق.
- GR00T: يُشير سير عمل NVIDIA المرجعي لجيل N1.6 إلى حوالي 4 إلى 8 ساعات لـ 20,000 خطوة بحجم دفعة 24 على ثماني بطاقات L40S، ومن 2 إلى 3 ساعات لـ 30,000 خطوة بحجم دفعة 16 على بطاقة Ada 6000 واحدة. الضبط الدقيق لنموذج 3B VLA على بطاقة واحدة في غضون ساعات قليلة أمر طبيعي، وليس تفاؤليًا.
- Pi0.5: لا تنشر openpi أي رقم زمني فعلي، لكنها تنشر الحد الأدنى 70 GB للضبط الدقيق الكامل، مما يحدد البطاقة وبالتالي المعدل.
يجدر التوقف عند الرقم الذي لا تدفعه. تفيد ورقة GR00T N1 بحوالي 50,000 H100 GPU hours لتدريب نموذج 2.2B مسبقًا، على مجموعة تصل إلى 1024 GPUs، بحجم دفعة تدريب مسبق يبلغ 16,384 لـ 200,000 gradient steps. بالسعر المقاس أعلاه من 1.34 إلى 2.34 USD per hour، يكون ذلك في حدود 67,000 إلى 117,000 USD من الحوسبة المستأجرة. تضع ورقة SmolVLA مشروعها عند حوالي 30,000 GPU hours عبر 481 community datasets، و 22.9K episodes و 10.6M frames. أنت ترث كل ذلك بسعر التنزيل؛ 8 USD تشتري لك آخر 20,000 steps. لماذا تُبنى نماذج VLA بهذه الطريقة يغطي هذا التقسيم.
الذراع: تكلفة لمرة واحدة تتضاءل أمام فاتورة وحدة معالجة الرسوميات
تكلفة تشغيل التدريب أقل من وجبة الغداء. الروبوت ليس كذلك. لهذا السبب فإن SO-100 مهم: إنه أرخص ذراع تدعمه سلسلة أدوات التعلم بالمحاكاة بأكملها بالفعل.
| الذراع | المحركات المؤازرة | الجهد | تكلفة الأجزاء | الدعم على AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | ذراع مرجعي كامل |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | كامل |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | متوافق |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | متوافق |
قائمة المواد الأولية في مستودع SO-ARM100 أكثر تفصيلاً وتستحق المراجعة حسب منطقتك: قائمة أجزاء لذراعين يبلغ إجماليها 229.88 دولارًا أمريكيًا أو 226.30 يورو لإعداد قائد وتابع، وقائمة أجزاء لذراع تابع واحد يبلغ إجماليها 121.94 دولارًا أمريكيًا أو 124.30 يورو. ستة محركات STS3215 مؤازرة بسعر 13.89 دولارًا أمريكيًا لكل منها تشكل 83.34 من هذا المبلغ البالغ 121.94، لذا فإن المحركات المؤازرة هي الذراع. بتكلفة تتراوح من 1 إلى 3 دولارات أمريكية لكل تشغيل SmolVLA أو ACT، فإن زوجًا واحدًا من الأذرع يساوي ما بين 77 و 230 تشغيل تدريب. إذا كنت لا تزال تختار، فإن SO-100 مقابل SO-101 هي المقارنة المهمة، لأن الاثنين متشابهان بما يكفي ليكون القرار متعلقًا بالتوافر وليس بالقدرة.
يُشحن STS3215 في نسختين 7.4 فولت و 12 فولت؛ ويشير المستودع إلى أن الجزء 12 فولت يحتاج أيضًا إلى مصدر طاقة 12 فولت 5 أمبير بدلاً من مصدر 5 فولت، لذا فهما غير قابلين للتبديل. يؤدي تغذية 12 فولت إلى محركات مؤازرة 7.4 فولت إلى تدميرها، وتشكل ستة محركات مؤازرة ثلثي تكلفة أجزاء الذراع التابع. تحقق من الملصق الموجود على كل محرك مؤازر قبل التشغيل الأول. إذا كانت المحركات المؤازرة تتصرف بشكل غريب بالفعل: المحرك المؤازر لا يستجيب، الذراع يرتعش ثم يترهل.
ساعات العمل البشري: البند الذي لا يضعه أحد في جدول البيانات
هذا هو الرقم الذي يقلب نقاش التكلفة رأسًا على عقب. تسجيل العروض التوضيحية يعني أن شخصًا ما يحرك ذراع روبوت، حلقة واحدة في كل مرة، في الوقت الفعلي. لا يمكن معالجتها دفعة واحدة ولا تأجيرها بالثانية. مسجل مجموعة بيانات LeRobot يأتي بإعدادات افتراضية تجعل الحسابات سهلة، وقد تم تأكيد الثلاثة جميعًا في DatasetRecordConfig: 60 ثانية لكل حلقة، 60 ثانية لإعادة ضبط المشهد، 50 حلقة. يفترض عمود المال أدناه 15 دولارًا أمريكيًا لساعة عمل شخص ما، وهو افتراض وليس رقم منصة. استبدل سعرك الخاص؛ النسبة هي الأهم.
- 1سجل مجموعة البيانات بالإعدادات الافتراضية التي ستُحاسب عليها فعليًا
هذا هو lerobot 0.6.1، الإصدار الموجود على PyPI اعتبارًا من 3 أغسطس 2026. لاحظ شكل واجهة سطر الأوامر (CLI): يتم تشغيل التسجيل عبر نقطة إدخال وحدة التحكم
lerobot-record(lerobot.scripts.lerobot_record)، وليس مسار الوحدة النمطية القديمpython -m lerobot.scripts.record. تستهدف AY-Robots الإصدار 0.5.1، ويعلن إصدار 0.5.1 عن نفس نقاط الإدخالlerobot-recordوlerobot-train، لذا فإن الشكل أدناه مستقر عبر كليهما. علامات التوقيت الثلاث هي الإعدادات الافتراضية الأصلية، لذا فهذا هو أيضًا الأمر الذي تفترضه الحسابات في الجدول التالي.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2انظر إلى ما سجلته قبل أن تستأجر دقيقة واحدة من وحدة معالجة الرسوميات
فحص مجموعة البيانات لا يكلف صفر دولار أمريكي في الساعة. اكتشاف نفس المشكلة من منحنى الخسارة يكلف 2.00 دولار أمريكي في الساعة على مستوى H100 ويخبرك بعد أربع ساعات. ادفع مجموعة البيانات وراجعها في عارض LeRobot، أو تصفح دليل مجموعات البيانات الخاص بـ AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3تدرب، وتأكد من أن نقطة الحفظ تبقى بعد انتهاء الحاوية
الآلة المستأجرة مؤقتة بحكم تعريفها، لذا اكتب نقاط الحفظ في مكان دائم أثناء التشغيل. تحدد علامتان ما إذا كنت ستحتفظ بما دفعته.
--save_freqالافتراضي هو 20,000 خطوة، لذا فإن تشغيل SmolVLA الافتراضي المكون من 20,000 خطوة يكتب نقطة الحفظ الأولى عندما يكون التشغيل قد انتهى بالفعل؛ قم بتخفيضها قبل استئجار أي شيء قابل للمقاطعة. تتطلب--save_checkpoint_to_hubالمعلمة--policy.repo_idولا توجد في lerobot 0.5.1، لذا في هذا الإصدار، تقوم بنسخ دليل الإخراج من الجهاز بنفسك. حجم الدفعة أدناه هو مثال الوثائق الأصلية؛ يرسل نموذج AY-Robots 2 لـ SmolVLA ويكتب إلى تخزين الكائنات عند ظهور نقاط الحفظ.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| الحلقات | التسجيل بـ 60 ثانية | إعادة الضبط بـ 60 ثانية | الوقت الفعلي | بالإضافة إلى 20 بالمائة إعادة تسجيل | بسعر 15 دولارًا أمريكيًا لكل ساعة عمل بشري |
|---|---|---|---|---|---|
| 30، الحد الأدنى لـ SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50، الحدود الدنيا الأربعة الأخرى | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100، مجموعة بيانات مريحة | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
قارن العمود الأيمن بتكلفة التشغيل التي تتراوح من 1 إلى 12 دولارًا أمريكيًا. بهذا المعدل المفترض، تكلف مجموعة بيانات مكونة من 50 حلقة ضعف إلى سبعة أضعاف تكلفة تسجيلها مقارنة بتكلفة التدريب عليها، وذلك قبل المعايرة وإعداد الكاميرا والحلقات التي تتخلص منها. لهذا السبب له قيمة مالية مباشرة. يقترح دليل lerobot ما لا يقل عن 50 حلقة بواقع 10 لكل موقع كائن؛ وتفيد وثائق SmolVLA بأن نسخة من نفس المهمة مكونة من 25 حلقة لم تكن كافية.
أين تضيع الأموال بالفعل
1. تشغيل على بيانات لم تكن لتنجح أبدًا
يكلف تشغيل GR00T بخطوات 20,000 على مجموعة بيانات تحتوي على تدفقين للكاميرا متبادلين نفس تكلفة التشغيل على مجموعة بيانات نظيفة، ويستغرق نفس الوقت، وينتج منحنى خسارة يبدو جيدًا. يظهر الفشل على الذراع بعد ساعات. تُحاسب بالساعة ويُحاسب التشخيص بالأيام. هناك عرضان يستحقان الحفظ: عادةً ما يعني أن الملاحظات لا تحمل ما تحتاجه المهمة، و يعني أن مجموعة البيانات كانت تحتوي على تباين أقل مما كنت تعتقد.
2. دفع أسعار النماذج الأساسية لمهمة كاميرا ثابتة
يحتوي ACT على حوالي 80 مليون معلمة وتم تصميمه للتدريب من الصفر على 50 عرضًا توضيحيًا لمهمة واحدة. يحتوي GR00T N1.7 على حوالي 3 مليار معلمة مع بنية أساسية مدربة مسبقًا. بالنسبة لكاميرا مثبتة، وطاولة ثابتة، وكائن واحد، غالبًا ما يحقق النموذج ذو الـ 80 مليون معلمة الهدف، ويعمل بسرعة حوالي 20 مللي ثانية لكل خطوة إجراء بدلاً من 152 مللي ثانية، ويكلف من 1 إلى 3 دولارات أمريكية لكل تشغيل بدلاً من 4 إلى 12 دولارًا. أنفق 3 دولارات أمريكية لمعرفة ما إذا كان النموذج الرخيص يعمل قبل إنفاق 12 دولارًا أمريكيًا على النموذج باهظ الثمن. ACT مقابل SmolVLA و GR00T N1.7 مقابل Pi0.5 توضح متى يتوقف كل منهما عن كونه الإجابة الصحيحة؛ ساحة النماذج تحتوي على 85 نموذجًا و 332 نتيجة معيارية.
3. وحدة معالجة الرسوميات التي نسيتها
أرخص خطأ يمكن تجنبه والأكثر شيوعًا. يتم احتساب تكلفة مثيل بدأ يوم الجمعة لتصحيح خطأ ما طوال عطلة نهاية الأسبوع بنفس سعر التشغيل الفعلي.
| البطاقة | المعدل الوسيط في اللقطة | خاملة لمدة 24 ساعة | خاملة لمدة 7 أيام | هذا يعادل |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | حوالي 27 تشغيل SmolVLA أو ACT بتكلفة 2 دولار أمريكي |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | حوالي 12 تشغيل GR00T بتكلفة 8 دولارات أمريكية |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | حوالي 38 تشغيل GR00T بتكلفة 8 دولارات أمريكية |
في AY-Robots، تم تصميم هذا الفشل بحيث لا يحدث للاستدلال: تحمل الحاويات التي توفرها واجهة برمجة تطبيقات الاستدلال (API) مراقبًا للخمول وتدمر نفسها بعد فترة خمول. إذا استأجرت البطاقة بنفسك، فإن هذا المراقب هو تذكيرك في التقويم.
4. الدفع مرتين مقابل نفس الإجابة
نقطة الدخول للضبط الدقيق في GR00T هي واجهة سطر أوامر (CLI) من نوع tyro لا تكشف عن أي بذرة (seed). هذا ليس قيدًا على المنصة، بل هو أداة المصدر الأصلية: لا يوجد حقل بذرة في gr00t/configs/finetune_config.py، وتحذر نصائح التدريب الخاصة بالمستودع من أن التشغيلات تختلف بنسبة 5 إلى 6 بالمائة لأن تحسينات الصور غير حتمية. يستخدم lerobot البذرة الافتراضية 1000 في كل من الإصدارين 0.5.1 و 0.6.1، لذا يمكن على الأقل إعادة تشغيل ACT و SmolVLA و Pi0.5 من نفس التهيئة وترتيب البيانات. هذا ليس وعدًا بأوزان متطابقة تمامًا على وحدة معالجة الرسوميات (GPU)، ولكنه الفرق بين إعادة التشغيل وتجربة جديدة. إذا أنتج تشغيل GR00T سياسة تعمل ولم تحتفظ بـ نقطة التحقق، فإنك تدفع الثمن كاملاً مقابل نتيجة قد تختلف بأكثر من الفرق الذي كنت تسعى إليه. هناك طريقة ثانية لفقدان نقطة تحقق دفعت ثمنها: واجهة سطر الأوامر (CLI) تستخدم افتراضيًا --save-total-limit 5، والموثق على أنه الحد الأقصى لعدد نقاط التحقق المحفوظة قبل حذف الأقدم منها. التخزين يكلف سنتات؛ وإعادة التشغيل تكلف من 4 إلى 12 دولارًا أمريكيًا وست ساعات.
الحدود الدنيا للمزايدة أعلاه هي جزء من سعر الطلب، وتقول vast.ai إن نظام المزايدة يمكن أن يخفض تكاليف العميل بنسبة خمسين بالمائة أو أكثر. المشكلة، على حد تعبيرها: يمكن إيقاف مثيل قابل للمقاطعة مؤقتًا في أي وقت إذا قدم مستخدم آخر عرضًا أعلى أو تم إنشاء تأجير عند الطلب لنفس الموارد، وهذا الإيقاف المؤقت "يوقف جميع العمليات الجارية". الأولوية دائمًا للطلب. هذا جيد لتشغيل يكتب نقطة حفظ كل بضع مئات من الخطوات، وخسارة كاملة لتشغيل يكتب في النهاية، وهذا بالضبط ما توفره لك الإعدادات الافتراضية: يكتب Isaac-GR00T CLI كل --save-steps (الافتراضي 1000)، ولكن --save_freq الخاص بـ lerobot يضبط افتراضيًا على 20,000 خطوة، لذا فإن تشغيل SmolVLA الافتراضي يحفظ نقطة واحدة فقط، عند خط النهاية. قم بتخفيضها، أو لا تقدم عرضًا. تعرض استمارة تدريب AY-Robots إعداد GR00T كـ saveSteps.
- أقل سعر بالساعة متاح.
- تحكم كامل في الصورة، إصدار CUDA، مراجعة lerobot أو Isaac-GR00T وكل علامة.
- المزايدة القابلة للمقاطعة تخفض السعر إلى النصف إذا كانت عملية التشغيل الخاصة بك تحفظ نقاطًا بشكل متكرر بما يكفي للبقاء على قيد الحياة بعد الإيقاف المؤقت.
- لا يوجد شيء مجرد، لذا عندما يتصرف التشغيل بشكل غريب يمكنك معرفة السبب.
- تكاليف الإعداد تحسب بأسعار وحدات معالجة الرسوميات (GPU): برامج التشغيل، التبعيات، نقطة الحفظ الأساسية متعددة الجيجابايت، وتنزيل مجموعة البيانات، كلها تكلف نفس السعر بالساعة مثل التدريب.
- يتم إيقاف المثيل القابل للمقاطعة الذي تم المزايدة عليه وقتل عملياته. التشغيل غير المحفوظ هو أموال محترقة، ويكتب lerobot الافتراضي أول نقطة حفظ له عند الخطوة 20,000.
- لا شيء يدمر الـ pod نيابة عنك. الجدول الخامل أعلاه هو فاتورة النسيان.
- العرض لبطاقات 80 جيجابايت الكاملة الواحدة قليل: عرضان لبطاقات A100 80 GB وخمسة عروض لبطاقات H100 80 GB كاملة في هذه القراءة. تتغير القائمة أيضًا باستمرار، لذا فإن أرخص سعر مدرج والسعر الذي يمكنك استئجاره فعليًا ليسا نفس الرقم.
- كل ساعة على البنية التحتية هي ساعة لم تُقضَ في تسجيل الحلقات التي تحدد ما إذا كانت السياسة تعمل أم لا.
القيام بذلك بنفسك مقابل السماح للمنصة باستئجار البطاقة
تختار الجهاز، وتبني البيئة، وتدمر الـ pod. السعر بالساعة هو سعر السوق أعلاه؛ كل شيء آخر هو وقتك.
- ابحث عن بطاقة تتناسب مع ذاكرة الفيديو (VRAM) التي يحتاجها النموذج: 24 GB لـ ACT و SmolVLA، و 80 GB لـ GR00T و Pi0.5.
- استأجر عند الطلب إذا لم يتمكن التشغيل من البقاء على قيد الحياة بعد الإيقاف المؤقت، أو قابل للمقاطعة إذا كان يحفظ نقاطًا بشكل متكرر.
- ثبّت سلسلة الأدوات: lerobot لـ ACT و SmolVLA و Pi0.5، ومستودع Isaac-GR00T مع مشغل tyro الخاص به لـ GR00T.
- حوّل مجموعة البيانات إذا لزم الأمر. مجموعة بيانات LeRobot v3.0 تتسبب في تعطل محمل GR00T ويجب تحويلها إلى v2.1.
- شغّل، راقب الخسارة، ادفع نقاط الحفظ إلى مكان دائم فور كتابتها.
- دمر المثيل، ثم تحقق من أنك دمرته.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>التكلفة الواقعية لتشغيل GR00T واحد: 3 إلى 6 ساعات على H100 80 GB بسعر 1.34 إلى 2.34 دولار أمريكي في الساعة هي 4 إلى 14 دولار أمريكي، بالإضافة إلى 20 إلى 40 دقيقة من الإعداد التي تُحسب أيضًا، بالإضافة إلى وقتك الخاص.
تختار النموذج ومجموعة البيانات والمعاملات الفائقة في نموذج. يقوم الواجهة الخلفية باستئجار وحدة معالجة رسوميات (GPU) فورية بحجم ذاكرة الفيديو (VRAM) التي يحتاجها النموذج، ويشغل المدرب ويكتب نقاط الحفظ إلى تخزين الكائنات.
- اختر مجموعتك على مصفوفة التدريب: خمسة نماذج، أربعة أذرع، دليل واحد لكل خلية.
- وجهه إلى مجموعة بيانات: واحدة مسجلة باستخدام عميل سطح المكتب، أو معرف مستودع Hugging Face، أو واحدة من جهازك الخاص.
- اقبل الإعدادات الافتراضية أو عدّلها. الجدول أعلاه هو ما يتم إرساله فعليًا إلى المدرب.
- تختار الواجهة الخلفية البطاقة بناءً على ذاكرة الفيديو (VRAM) المطلوبة، لذا لن تضطر أبدًا للبحث عن وحدات معالجة الرسوميات (GPUs).
- تهبط نقاط الحفظ في تخزين الكائنات فور كتابتها، لذا فإن التشغيل المتقطع ليس تشغيلًا ضائعًا.
| الفئة | النماذج | وقت التشغيل | التكلفة لكل تشغيل |
|---|---|---|---|
| A100 80 GB أو H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 إلى 6 ساعات | حوالي 4 إلى 12 دولار أمريكي |
| RTX 4090 أو أي بطاقة 24 GB | SmolVLA, ACT | 2 إلى 5 ساعات | حوالي 1 إلى 3 دولار أمريكي |
ما لا يفعله: تحسين مجموعة بيانات سيئة، أو إعطاء GR00T بذرة لم تكن لديه أبدًا، أو إزالة حد الكمون الموضح أدناه. إنه يزيل عناء البحث عن وحدات معالجة الرسوميات (GPU)، وبناء البيئة، والـ pod الذي نسيت تدميره. التفاصيل موجودة في وثائق التدريب.
ما تفرضه المنصة وكيف تختار البطاقة
المنطق ممل عن قصد. كل نموذج في الكتالوج يعلن عن فئة وحدة معالجة رسوميات (GPU)؛ يأخذ الواجهة الخلفية (backend) ذاكرة الفيديو العشوائية (VRAM) المطلوبة ويستأجر بطاقة مطابقة في نفس السوق الفوري المقاس أعلاه. لهذا السبب، التكلفة المقتبسة هي نطاق وليست سعرًا. GR00T و Pi0.5 متاحان هنا فقط على السحابة بسبب الحدود الدنيا البالغة 40 GB و 70 GB. يعمل SmolVLA و ACT أيضًا محليًا على بطاقتك الخاصة بسعة 24 GB، حيث تكون تكلفة السحابة صفرًا والكهرباء هي مشكلتك.

توجد نقطة واحدة تستحق التحذير. تراكم التدرج (Gradient accumulation) ينطبق بالفعل على كلا نوعي GR00T، لذا فإن زيادته تتيح دفعة فعالة أكبر على نفس البطاقة. بالنسبة لـ Pi0.5 و SmolVLA، لا ينطبق على الإطلاق: lerobot 0.5.1 لا يحتوي على خيار تراكم التدرج في إعدادات التدريب الخاصة به، لذا فإن تعيين الحقل إلى 16 لا يكلف شيئًا ولا يشتري شيئًا. إذا لم يبدأ تشغيل مهمة في قائمة الانتظار أبدًا، صفحة المهام العالقة في قائمة الانتظار تغطي ما يجب التحقق منه؛ إذا تم رفض مجموعة البيانات قبل بدء التشغيل، فغالبًا ما يكون السبب مشكلة تنسيق v3.0.
تضيف وحدة معالجة رسوميات مستأجرة تخدم سياستك عبر الإنترنت العام رحلات ذهابًا وإيابًا إلى حلقة تحكم تتراوح بالفعل بين 20 و 485 مللي ثانية لكل خطوة إجراء. مناسب لمهام الالتقاط والوضع البطيئة، وليس للحركة التفاعلية السريعة. تقييم الاستدلال السحابي لنقطة تحقق جيد، ولكنه يشغل عمليات التلاعب الإنتاجية بشكل سيء: إذا كانت المهمة تتطلب سرعة، فيجب أن تكون الحوسبة بجوار المحركات المؤازرة، وهذه تكلفة لا يمكن لهذه المقالة إخفاءها. انظر زمن استجابة الاستدلال.
ميزانية مفصلة لسياسة عمل أولية
جميع الخطوط الأربعة معًا، بدءًا من لا شيء. يفترض إجمالي استخدام وحدة معالجة الرسوميات (GPU) من 3 إلى 5 تشغيلات: الأول يثبت أن المسار يعمل، والثاني يكشف عن مشكلة في البيانات، والثالث أو الرابع هو الذي تحتفظ به.
| البند | المسار الاقتصادي | المسار المريح |
|---|---|---|
| الذراع | SO-100 تابع فقط، 121.94 دولار أمريكي في قائمة المواد | قائد بالإضافة إلى تابع، 229.88 دولار أمريكي في قائمة المواد |
| النموذج | SmolVLA أو ACT، فئة 24 جيجابايت | GR00T N1.7، A100 80 جيجابايت أو فئة H100 |
| الحلقات المسجلة | 30، الحد الأدنى لـ SmolVLA | 50 إلى 100 |
| الوقت البشري للتسجيل | حوالي 1 ساعة و 12 دقيقة | 2 إلى 4 ساعات |
| تكلفة التشغيل الواحد | 1 إلى 3 دولار أمريكي | 4 إلى 12 دولار أمريكي |
| عدد التشغيلات قبل أن يعمل | 3 إلى 5 | 3 إلى 5 |
| إجمالي إنفاق وحدة معالجة الرسوميات | 3 إلى 15 دولار أمريكي | 12 إلى 60 دولار أمريكي |
| أكبر بند في الفاتورة | الذراع، ثم وقتك | الذراع، ثم وقتك |
ينطبق هذا النمط على هذا الحجم من الروبوتات: الحوسبة هي خطأ تقريبي، والأجهزة هي تكلفة حقيقية لمرة واحدة، وساعات العمل البشري هي المصاريف المتكررة. لاختبار جزء التدريب قبل شراء أي شيء، تتيح لك مقارنة النماذج واستئجار وحدة معالجة رسوميات (GPU) دون الحاجة إلى ذراع، و هو ذراع SO-100 مادي يمكنك التحكم به في المتصفح دون تسجيل. بالنسبة للخطوات الكاملة من البداية إلى النهاية، فإن يغطي الإعداد، و والتدريب، و هو النسخة المختصرة.

كم تكلفة تشغيل واحد لضبط VLA من البداية إلى النهاية؟▾
حوالي 4 إلى 12 دولارًا أمريكيًا لـ GR00T N1.7 أو GR00T N1.5 أو Pi0.5 على فئة A100 80 GB أو H100 (من 3 إلى 6 ساعات بسعر 1.20 إلى 2.00 دولار أمريكي في الساعة)، وحوالي 1 إلى 3 دولارات أمريكية لـ SmolVLA أو ACT على فئة RTX 4090 (من 2 إلى 5 ساعات بسعر 0.30 إلى 0.60 دولار أمريكي في الساعة). استئجار البطاقة بنفسك يقع ضمن نفس النطاق بمجرد احتساب وقت الإعداد، حيث يتم احتسابه بسعر التدريب.
هل يستحق دفع ثمن H100 بدلاً من A100 80 GB؟▾
بالنسبة لسياسة SO-100 واحدة، عادة لا. كلاهما يفي بمتطلبات الذاكرة الدنيا التي يحتاجها GR00T و Pi0.5، وفي قراءة بتاريخ 23 أغسطس 2026، بدأت A100 80 GB كاملة بسعر 0.44 دولار أمريكي في الساعة مقابل 1.34 دولار أمريكي لـ H100 80 GB. تنتهي H100 بشكل أسرع، لذا يعود جزء من السعر في شكل ساعات أقل، لكن الإجمالي لا يزال أعلى لتشغيل بهذا الحجم الصغير. الحجة الحقيقية لـ H100 هي التوفر: خمسة عروض H100 80 GB فردية في ذلك السوق مقابل عرضين لـ A100 80 GB، والبطاقة التي لا يمكنك استئجارها ليس لها سعر.
كم عدد مرات التشغيل التي تستغرقها السياسة قبل أن تعمل فعليًا؟▾
خطط لثلاثة إلى خمسة. الأول يثبت أن المسار متصل بشكل صحيح. الثاني عادة ما يكشف عن مشكلة في مجموعة البيانات مثل تدفق الكاميرا الذي توقف في منتصف الطريق. الثالث أو الرابع هو الذي تحتفظ به.
هل يمكنني تدريب SmolVLA أو ACT على وحدة معالجة الرسوميات الخاصة بي بدلاً من الاستئجار؟▾
نعم. كلاهما مدعوم محليًا على AY-Robots وكلاهما يتناسب بشكل مريح مع 24 جيجابايت؛ قامت ورقة ACT الأصلية بتدريب نموذجها البالغ 80 مليونًا في حوالي 5 ساعات على بطاقة RTX 2080 Ti بسعة 11 جيجابايت. GR00T و Pi0.5 متاحان فقط عبر السحابة هنا لأن الحدود الدنيا لضبط البائعين الموثقة هي 40 جيجابايت و 70 جيجابايت، وأكبر بطاقة استهلاكية في السوق هي RTX 5090 بسعة 32 جيجابايت.
لماذا يكلف نفس عدد الخطوات مبالغ مختلفة عبر النماذج؟▾
الخطوات ليست قابلة للمقارنة عبر السياسات. ACT يستخدم افتراضيًا 100,000 خطوة بحجم دفعة 8 على بطاقة 24 جيجابايت؛ GR00T N1.5 يستخدم افتراضيًا 2,000 خطوة بحجم دفعة 1 مع تجميع التدرج 16 على بطاقة 80 جيجابايت. الفاتورة هي الساعات مضروبة في سعر البطاقة التي تفرضها عليك بصمة الذاكرة، وليس عداد الخطوات.
اطلع على تكلفة تشغيلك قبل أن تبدأه
تدرج كل سياسة من السياسات الخمس فئة وحدة معالجة الرسوميات (GPU) الخاصة بها، ووقت التشغيل، وسعر كل تشغيل، ويقوم نظام التدريب الخلفي باستئجار البطاقة من نفس السوق الفوري الذي تم قياس هذه الأرقام عليه.
تحقق من الأسعارSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started