جدول تكلفة AY-Robots يوضح وحدة معالجة الرسوميات التي تحتاجها كل سياسة من السياسات الخمس، ووقت التشغيل النموذجي والسعر لكل تشغيل، وعدد الحلقات المطلوبة قبل أن تصبح السياسة مفيدة
تدريب VLAتكاليف وحدات معالجة الرسومياتSO-100الضبط الدقيقتعلم الروبوتاتالميزانية

تكلفة تدريب VLA: التكلفة الحقيقية لتشغيل الضبط الدقيق

AY-Robots ResearchAugust 23, 202623 دقيقة قراءة

أسعار وحدات معالجة الرسوميات (GPU) الحقيقية في السوق الفورية، ومدة تشغيل كل سياسة من السياسات الخمس، وتكلفة الذراع والعروض التوضيحية، والأماكن الأربعة التي تختفي فيها الأموال بهدوء.

النسخة المختصرة

  • تستغرق التشغيلة على فئة A100 80 GB أو H100 من 3 إلى 6 ساعات وتكلف حوالي 4 إلى 12 دولارًا أمريكيًا. على فئة RTX 4090، تستغرق من 2 إلى 5 ساعات وتكلف حوالي 1 إلى 3 دولارات أمريكية.
  • تم القياس على vast.ai في الساعة 13:44 بالتوقيت العالمي المنسق في 23 أغسطس 2026: بطاقة RTX 4090 كاملة عند الطلب بسعر 0.13 إلى 0.38 دولار أمريكي/ساعة، وبطاقة A100 80 GB بسعر 0.44 إلى 0.67، وبطاقة H100 80 GB بسعر 1.34 إلى 2.34. بطاقات 80 GB الكاملة نادرة، مع عرضين وخمسة عروض لبطاقة واحدة على التوالي.
  • وحدة معالجة الرسوميات (GPU) هي البند الأقل تكلفة. تضع فاتورة مواد SO-ARM100 زوجًا من القائد والتابع بسعر 229.88 دولارًا أمريكيًا، وهو ما يعادل من 77 إلى 230 تشغيلة على فئة 24 GB.
  • ساعتان من تسجيل شخص لـ 50 حلقة تكلف أكثر من تشغيلة التدريب التي تغذيها تلك الحلقات.
  • تختفي الأموال في أربعة أماكن: التشغيل على بيانات معطوبة، نماذج 3B على مهام تتعامل معها سياسة 80M، وحدات معالجة رسوميات لم يدمرها أحد، وإعادة تشغيل نتيجة فشلت في الاحتفاظ بها.
  • تقوم AY-Robots بتحديد حجم البطاقة بناءً على ذاكرة الفيديو (VRAM) التي يحتاجها النموذج وتستأجرها في نفس السوق الفوري، لذا فإن تكلفة التشغيل هي تكلفة السوق.

الفاتورة تتكون من أربعة بنود، ووحدة معالجة الرسوميات هي الأصغر

عندما يسأل الناس عن تكلفة الضبط الدقيق لـ نموذج الرؤية واللغة والحركة لـ SO-100، فإنهم يقصدون دائمًا تقريبًا استئجار وحدة معالجة الرسوميات (GPU). هذا هو الرقم الذي يظهر كرسوم على البطاقة، لذا فهو الذي يبدو حقيقيًا. وهو أيضًا، بفارق كبير، الأصغر من بين الأرقام الأربعة التي تحدد التكلفة الفعلية لـ سياسة عاملة.

البندما هوالحجم النموذجي لسياسة عاملة واحدة
GPU timeاستئجار بطاقة للتشغيلمن 1 إلى 12 دولارًا أمريكيًا لكل تشغيلة، وستقوم بـ 3 إلى 5 تشغيلات
الروبوتالمحركات المؤازرة، الإطار المطبوع، الكاميرات، الكابلات، الطاقةمرة واحدة، من 110 إلى 500 يورو لكل ذراع
ساعات العمل البشريشخص يقود الذراع لتسجيل العروض التوضيحيةمن 1 إلى 4 ساعات لكل مجموعة بيانات، تتكرر لكل مهمة
الهدربيانات سيئة، نماذج كبيرة الحجم، حاويات منسيةغير محدود، وهو البند الوحيد الذي تتحكم فيه

أوقات التدريب أدناه مستمدة من أوراق ومستودعات النماذج الخمسة نفسها، وتكلفة الأجهزة من قائمة المواد المنشورة، وأرقام المنصات من AY-Robots كتالوج السياسات وصفحة الأسعار. وحيث لا تساعد المنصة، تشير هذه المقالة إلى ذلك.

ما هي التكلفة الفعلية لساعة وحدة معالجة الرسوميات (GPU) في السوق الفوري

لا يوجد سعر واحد لساعة A100. في سوق مثل vast.ai، يحدد كل مضيف سعره الخاص، وتشغيل التدريب الذي تطلقه يهبط على أي جهاز رخيص ومتاح في تلك اللحظة. الإجابة الصادقة هي توزيع. إليك القياس، في 23 أغسطس 2026 الساعة 13:44 بالتوقيت العالمي المنسق: بطاقات كاملة فردية، عند الطلب، مصفاة حسب ذاكرة الفيديو الفعلية (VRAM).

البطاقةvast.ai عند الطلب دولار أمريكي/ساعة (منخفض / متوسط / مرتفع)عروض البطاقات الكاملةالحد الأدنى للمزايدة في vast.aiRunPod مجتمع / آمنHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74not offered
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99not offered
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19not offered
كيف تم التقاط هذه اللقطة، وماذا لا تمثل

عروض حسب الطلب لوحدة معالجة رسوميات كاملة واحدة (gpu_frac == 1.0) من واجهة برمجة تطبيقات الحزم العامة vast.ai، والتي لا تتطلب حسابًا، وتمت تصفيتها بناءً على gpu_ram بحيث تظهر فقط بطاقات 80 جيجابايت الأصلية في صفوف 80 جيجابايت. هذا الفلتر مهم: في هذه القراءة، كانت جميع عروض A100 SXM4 الثلاثة ذات البطاقة الواحدة أجزاءً بسعة 40 جيجابايت، وكذلك اثنان من عروض A100 PCIE الأربعة، لذا فإن تجميعها في صف واحد باسم "A100" كان سيخفض السعر المبلغ عنه هنا إلى النصف. يمزج عمود Hugging Face بين منتجين: 2.50 USD/h هو جهاز Nvidia A100 - large Spaces و 4.50 USD/h هو H100 80 GB واحد ضمن Inference Endpoints، والذي لا تقدمه Spaces. تعامل مع القيم الوسيطة كمؤشرات: يعتمد صف A100 80 GB على عرضين وصف H100 على خمسة، وأعادت نفس الاستعلام بعد 36 ثانية عددًا مختلفًا لـ 4090 وسعرًا أعلى مختلفًا على ثلاثة من الصفوف الخمسة. أسعار قائمة RunPod هي الرقم الأكثر استقرارًا للتخطيط بناءً عليه.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
الاستعلام الدقيق وراء الجدول أعلاه، تم تشغيله مرتين أثناء كتابة هذا القسم. قم بتشغيله قبل الوثوق بأي مقال تسعير لوحدات معالجة الرسوميات، بما في ذلك هذا المقال.
جدول تكلفة AY-Robots يوضح وحدة معالجة الرسوميات التي تحتاجها كل سياسة، ووقت التشغيل النموذجي، والسعر لكل تشغيل، وعدد الحلقات المطلوبة قبل أن تصبح السياسة مفيدة.
جدول التكلفة على /try: البطاقة، وقت التشغيل، السعر لكل تشغيل، والحد الأدنى للحلقات لكل سياسة.

لماذا لا تستطيع نماذج 3B استخدام البطاقة الرخيصة

تختلف ساعة 4090 وساعة H100 80 جيجابايت بحوالي ستة أضعاف عند القيم الوسيطة المذكورة أعلاه. ما يدفعك لاستخدام البطاقة باهظة الثمن ليس السرعة، بل الذاكرة. يحدد openpi الحد الأدنى لـ Pi0.5 كامل الضبط الدقيق عند 70 جيجابايت، وتوصي NVIDIA بـ 40 جيجابايت أو أكثر لـ GR00T. لاحظ ما لا يمثله رقم GR00T. يقوم إعداد الضبط الدقيق الخاص به بتجميد نموذج اللغة والمشفر البصري افتراضيًا (tune_llm و tune_visual هي False، بينما يكون جهاز العرض ورأس الانتشار True)، وهذا هو السبب في أن الكتالوج يسرد حوالي 40 مليون معلمة مدربة من أصل 3 مليار. الـ 40 جيجابايت ليست حالة مُحسِّن لأوزان 3 مليار، بل هي العمود الفقري المجمد بالإضافة إلى التنشيطات. تنخفض المتغيرات ذات النطاق المحدود إلى مستويات أقل: يتطلب مسار LoRA الخاص بـ openpi 22.5 جيجابايت ويذكر 4090، ويسرد سير عمل Isaac Lab Arena من NVIDIA خيار GPU واحد بسعة 24 جيجابايت لـ GR00T بعد التدريب. تعتمد مستويات المنصة على الحد الأدنى الذي ينشره كل بائع للتكوين الذي يقوم بتشغيله فعليًا. المقال التفصيلي حول مطابقة التدفق لـ pi0 يشرح من أين تأتي بصمة مطابقة التدفق هذه.

المهمةالذاكرة التي يطلبها المشروع الأصليالمصدر
استدلال pi0 / pi0.5أكثر من 8 جيجابايت، مثال RTX 4090openpi
ضبط دقيق LoRA لـ pi0 / pi0.5أكثر من 22.5 جيجابايت، مثال RTX 4090openpi
ضبط دقيق كامل لـ pi0 / pi0.5أكثر من 70 جيجابايت، مثال A100 80 جيجابايت أو H100openpi
استدلال GR00T N1.71 GPU بسعة 16 جيجابايت أو أكثرIsaac-GR00T
ضبط دقيق GR00T N1.7يوصى بـ 40 جيجابايت أو أكثر، عقد H100 أو L40Isaac-GR00T
ضبط دقيق GR00T، ما يدربهجهاز العرض ورأس الانتشار؛ LLM والمشفر البصري مجمدان افتراضيًاfinetune_config.py
GR00T بعد التدريب، مخفض1 GPU بسعة 24 جيجابايت، نموذج اللغة مجمدIsaac Lab Arena
ضبط دقيق SmolVLAA100 واحد لتشغيل 20,000 خطوة المرجعيlerobot docs
تدريب ACTبطاقة RTX 2080 Ti واحدة بسعة 11 جيجابايتACT paper

هذا الجدول هو السبب في أن المنصة تقسم النماذج الخمسة إلى مستويين. GR00T N1.7، GR00T N1.5 و Pi0.5 تعمل على A100 80 جيجابايت أو H100 لأن هذا ما يطلبه البائعون. SmolVLA و ACT تعمل على RTX 4090 أو أي بطاقة بسعة 24 جيجابايت لأن ذلك كافٍ بالفعل.

الفخ الذي يستهلك يومًا: استئجار البطاقة الرخيصة للنموذج الكبير

تشغيل GR00T أو Pi0.5 على بطاقة بسعة 24 جيجابايت لا يفشل في الثانية صفر. يقوم بتنزيل نقطة التحقق الأساسية، ويبني فهرس مجموعة البيانات، ويبدأ التمريرة الأمامية الأولى، ثم يتوقف بعد بضع مئات من الخطوات بسبب خطأ نفاد ذاكرة CUDA. لقد دفعت مقابل التنزيل والإعداد ولم تحصل على شيء. الحلول: نفاد الذاكرة أثناء التدريب.

المدة الفعلية لتشغيل كل نموذج من النماذج الخمسة

وقت التشغيل هو النصف الآخر من التكلفة: 2.00 دولار أمريكي في الساعة لا يهم إذا كانت المهمة تستغرق 40 دقيقة، ويكون مدمراً إذا استغرقت 40 ساعة. هذه هي الإعدادات الافتراضية التي ترسلها AY-Robots بالفعل إلى المدرب، مع نافذة التشغيل والتكلفة لكل مستوى.

السياسةفئة وحدة معالجة الرسوميات (GPU)الحد الأقصى الافتراضي للخطواتالدفعة الافتراضية (تراكم التدرج)نافذة التشغيلالتكلفة لكل تشغيل
GR00T N1.7, ~3BA100 80 GB or H10020,00032، تراكم 1، ينطبق3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001، تراكم 16، ينطبق3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001، تراكم 16، لا يوجد تأثير3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002، تراكم 8، لا يوجد تأثير2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008، تراكم 12 to 5 h1 to 3 USD
جدول مقارنة للسياسات الخمس القابلة للتدريب على AY-Robots يوضح عدد المعلمات، وحدة معالجة الرسوميات المطلوبة، زمن استجابة الاستدلال، والحد الأدنى لعدد الحلقات
السياسات الخمس جنباً إلى جنب: المعلمات، فئة وحدة معالجة الرسوميات (GPU)، زمن الاستجابة لكل خطوة إجراء، الحد الأدنى للحلقات.

من أين تأتي فترات التشغيل هذه من المصدر الأعلى

  • SmolVLA: تذكر وثائق lerobot أن 20,000 خطوة تستغرق حوالي 4 ساعات على بطاقة A100 واحدة. تقوم المنصة بتشغيل نفس الـ 20,000 خطوة على الفئة الأقل تكلفة بسعة 24 GB، وبالتالي تكون هناك فترة زمنية متغيرة بدلاً من 4 ساعات ثابتة.
  • ACT: تفيد ورقة ALOHA الأصلية بحوالي 5 ساعات على بطاقة 11 GB RTX 2080 Ti واحدة لنموذج بـ 80M-parameter. بطاقة 4090 أحدث بعدة أجيال، لكن المنصة تخصص ميزانية لـ 100,000 خطوة، لذا تقع الفترة الزمنية المتغيرة في نفس النطاق.
  • GR00T: يُشير سير عمل NVIDIA المرجعي لجيل N1.6 إلى حوالي 4 إلى 8 ساعات لـ 20,000 خطوة بحجم دفعة 24 على ثماني بطاقات L40S، ومن 2 إلى 3 ساعات لـ 30,000 خطوة بحجم دفعة 16 على بطاقة Ada 6000 واحدة. الضبط الدقيق لنموذج 3B VLA على بطاقة واحدة في غضون ساعات قليلة أمر طبيعي، وليس تفاؤليًا.
  • Pi0.5: لا تنشر openpi أي رقم زمني فعلي، لكنها تنشر الحد الأدنى 70 GB للضبط الدقيق الكامل، مما يحدد البطاقة وبالتالي المعدل.

يجدر التوقف عند الرقم الذي لا تدفعه. تفيد ورقة GR00T N1 بحوالي 50,000 H100 GPU hours لتدريب نموذج 2.2B مسبقًا، على مجموعة تصل إلى 1024 GPUs، بحجم دفعة تدريب مسبق يبلغ 16,384 لـ 200,000 gradient steps. بالسعر المقاس أعلاه من 1.34 إلى 2.34 USD per hour، يكون ذلك في حدود 67,000 إلى 117,000 USD من الحوسبة المستأجرة. تضع ورقة SmolVLA مشروعها عند حوالي 30,000 GPU hours عبر 481 community datasets، و 22.9K episodes و 10.6M frames. أنت ترث كل ذلك بسعر التنزيل؛ 8 USD تشتري لك آخر 20,000 steps. لماذا تُبنى نماذج VLA بهذه الطريقة يغطي هذا التقسيم.

الذراع: تكلفة لمرة واحدة تتضاءل أمام فاتورة وحدة معالجة الرسوميات

تكلفة تشغيل التدريب أقل من وجبة الغداء. الروبوت ليس كذلك. لهذا السبب فإن SO-100 مهم: إنه أرخص ذراع تدعمه سلسلة أدوات التعلم بالمحاكاة بأكملها بالفعل.

الذراعالمحركات المؤازرةالجهدتكلفة الأجزاءالدعم على AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURذراع مرجعي كامل
SO-101Feetech STS32157.4 V130 to 170 EURكامل
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURمتوافق
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURمتوافق

قائمة المواد الأولية في مستودع SO-ARM100 أكثر تفصيلاً وتستحق المراجعة حسب منطقتك: قائمة أجزاء لذراعين يبلغ إجماليها 229.88 دولارًا أمريكيًا أو 226.30 يورو لإعداد قائد وتابع، وقائمة أجزاء لذراع تابع واحد يبلغ إجماليها 121.94 دولارًا أمريكيًا أو 124.30 يورو. ستة محركات STS3215 مؤازرة بسعر 13.89 دولارًا أمريكيًا لكل منها تشكل 83.34 من هذا المبلغ البالغ 121.94، لذا فإن المحركات المؤازرة هي الذراع. بتكلفة تتراوح من 1 إلى 3 دولارات أمريكية لكل تشغيل SmolVLA أو ACT، فإن زوجًا واحدًا من الأذرع يساوي ما بين 77 و 230 تشغيل تدريب. إذا كنت لا تزال تختار، فإن SO-100 مقابل SO-101 هي المقارنة المهمة، لأن الاثنين متشابهان بما يكفي ليكون القرار متعلقًا بالتوافر وليس بالقدرة.

7.4 فولت، وليس 12 فولت

يُشحن STS3215 في نسختين 7.4 فولت و 12 فولت؛ ويشير المستودع إلى أن الجزء 12 فولت يحتاج أيضًا إلى مصدر طاقة 12 فولت 5 أمبير بدلاً من مصدر 5 فولت، لذا فهما غير قابلين للتبديل. يؤدي تغذية 12 فولت إلى محركات مؤازرة 7.4 فولت إلى تدميرها، وتشكل ستة محركات مؤازرة ثلثي تكلفة أجزاء الذراع التابع. تحقق من الملصق الموجود على كل محرك مؤازر قبل التشغيل الأول. إذا كانت المحركات المؤازرة تتصرف بشكل غريب بالفعل: المحرك المؤازر لا يستجيب، الذراع يرتعش ثم يترهل.

ساعات العمل البشري: البند الذي لا يضعه أحد في جدول البيانات

هذا هو الرقم الذي يقلب نقاش التكلفة رأسًا على عقب. تسجيل العروض التوضيحية يعني أن شخصًا ما يحرك ذراع روبوت، حلقة واحدة في كل مرة، في الوقت الفعلي. لا يمكن معالجتها دفعة واحدة ولا تأجيرها بالثانية. مسجل مجموعة بيانات LeRobot يأتي بإعدادات افتراضية تجعل الحسابات سهلة، وقد تم تأكيد الثلاثة جميعًا في DatasetRecordConfig: 60 ثانية لكل حلقة، 60 ثانية لإعادة ضبط المشهد، 50 حلقة. يفترض عمود المال أدناه 15 دولارًا أمريكيًا لساعة عمل شخص ما، وهو افتراض وليس رقم منصة. استبدل سعرك الخاص؛ النسبة هي الأهم.

  1. 1
    سجل مجموعة البيانات بالإعدادات الافتراضية التي ستُحاسب عليها فعليًا

    هذا هو lerobot 0.6.1، الإصدار الموجود على PyPI اعتبارًا من 3 أغسطس 2026. لاحظ شكل واجهة سطر الأوامر (CLI): يتم تشغيل التسجيل عبر نقطة إدخال وحدة التحكم lerobot-record (lerobot.scripts.lerobot_record)، وليس مسار الوحدة النمطية القديم python -m lerobot.scripts.record. تستهدف AY-Robots الإصدار 0.5.1، ويعلن إصدار 0.5.1 عن نفس نقاط الإدخال lerobot-record و lerobot-train، لذا فإن الشكل أدناه مستقر عبر كليهما. علامات التوقيت الثلاث هي الإعدادات الافتراضية الأصلية، لذا فهذا هو أيضًا الأمر الذي تفترضه الحسابات في الجدول التالي.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    انظر إلى ما سجلته قبل أن تستأجر دقيقة واحدة من وحدة معالجة الرسوميات

    فحص مجموعة البيانات لا يكلف صفر دولار أمريكي في الساعة. اكتشاف نفس المشكلة من منحنى الخسارة يكلف 2.00 دولار أمريكي في الساعة على مستوى H100 ويخبرك بعد أربع ساعات. ادفع مجموعة البيانات وراجعها في عارض LeRobot، أو تصفح دليل مجموعات البيانات الخاص بـ AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    تدرب، وتأكد من أن نقطة الحفظ تبقى بعد انتهاء الحاوية

    الآلة المستأجرة مؤقتة بحكم تعريفها، لذا اكتب نقاط الحفظ في مكان دائم أثناء التشغيل. تحدد علامتان ما إذا كنت ستحتفظ بما دفعته. --save_freq الافتراضي هو 20,000 خطوة، لذا فإن تشغيل SmolVLA الافتراضي المكون من 20,000 خطوة يكتب نقطة الحفظ الأولى عندما يكون التشغيل قد انتهى بالفعل؛ قم بتخفيضها قبل استئجار أي شيء قابل للمقاطعة. تتطلب --save_checkpoint_to_hub المعلمة --policy.repo_id ولا توجد في lerobot 0.5.1، لذا في هذا الإصدار، تقوم بنسخ دليل الإخراج من الجهاز بنفسك. حجم الدفعة أدناه هو مثال الوثائق الأصلية؛ يرسل نموذج AY-Robots 2 لـ SmolVLA ويكتب إلى تخزين الكائنات عند ظهور نقاط الحفظ.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
الحلقاتالتسجيل بـ 60 ثانيةإعادة الضبط بـ 60 ثانيةالوقت الفعليبالإضافة إلى 20 بالمائة إعادة تسجيلبسعر 15 دولارًا أمريكيًا لكل ساعة عمل بشري
30، الحد الأدنى لـ SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50، الحدود الدنيا الأربعة الأخرى50 min50 min1 h 40 min2 h 00 minabout 30 USD
100، مجموعة بيانات مريحة100 min100 min3 h 20 min4 h 00 minabout 60 USD

قارن العمود الأيمن بتكلفة التشغيل التي تتراوح من 1 إلى 12 دولارًا أمريكيًا. بهذا المعدل المفترض، تكلف مجموعة بيانات مكونة من 50 حلقة ضعف إلى سبعة أضعاف تكلفة تسجيلها مقارنة بتكلفة التدريب عليها، وذلك قبل المعايرة وإعداد الكاميرا والحلقات التي تتخلص منها. لهذا السبب له قيمة مالية مباشرة. يقترح دليل lerobot ما لا يقل عن 50 حلقة بواقع 10 لكل موقع كائن؛ وتفيد وثائق SmolVLA بأن نسخة من نفس المهمة مكونة من 25 حلقة لم تكن كافية.

أين تضيع الأموال بالفعل

1. تشغيل على بيانات لم تكن لتنجح أبدًا

يكلف تشغيل GR00T بخطوات 20,000 على مجموعة بيانات تحتوي على تدفقين للكاميرا متبادلين نفس تكلفة التشغيل على مجموعة بيانات نظيفة، ويستغرق نفس الوقت، وينتج منحنى خسارة يبدو جيدًا. يظهر الفشل على الذراع بعد ساعات. تُحاسب بالساعة ويُحاسب التشخيص بالأيام. هناك عرضان يستحقان الحفظ: عادةً ما يعني أن الملاحظات لا تحمل ما تحتاجه المهمة، و يعني أن مجموعة البيانات كانت تحتوي على تباين أقل مما كنت تعتقد.

2. دفع أسعار النماذج الأساسية لمهمة كاميرا ثابتة

يحتوي ACT على حوالي 80 مليون معلمة وتم تصميمه للتدريب من الصفر على 50 عرضًا توضيحيًا لمهمة واحدة. يحتوي GR00T N1.7 على حوالي 3 مليار معلمة مع بنية أساسية مدربة مسبقًا. بالنسبة لكاميرا مثبتة، وطاولة ثابتة، وكائن واحد، غالبًا ما يحقق النموذج ذو الـ 80 مليون معلمة الهدف، ويعمل بسرعة حوالي 20 مللي ثانية لكل خطوة إجراء بدلاً من 152 مللي ثانية، ويكلف من 1 إلى 3 دولارات أمريكية لكل تشغيل بدلاً من 4 إلى 12 دولارًا. أنفق 3 دولارات أمريكية لمعرفة ما إذا كان النموذج الرخيص يعمل قبل إنفاق 12 دولارًا أمريكيًا على النموذج باهظ الثمن. ACT مقابل SmolVLA و GR00T N1.7 مقابل Pi0.5 توضح متى يتوقف كل منهما عن كونه الإجابة الصحيحة؛ ساحة النماذج تحتوي على 85 نموذجًا و 332 نتيجة معيارية.

3. وحدة معالجة الرسوميات التي نسيتها

أرخص خطأ يمكن تجنبه والأكثر شيوعًا. يتم احتساب تكلفة مثيل بدأ يوم الجمعة لتصحيح خطأ ما طوال عطلة نهاية الأسبوع بنفس سعر التشغيل الفعلي.

البطاقةالمعدل الوسيط في اللقطةخاملة لمدة 24 ساعةخاملة لمدة 7 أيامهذا يعادل
RTX 40900.32 USD/h7.68 USD53.76 USDحوالي 27 تشغيل SmolVLA أو ACT بتكلفة 2 دولار أمريكي
A100 80 GB0.56 USD/h13.44 USD94.08 USDحوالي 12 تشغيل GR00T بتكلفة 8 دولارات أمريكية
H100 80 GB1.80 USD/h43.20 USD302.40 USDحوالي 38 تشغيل GR00T بتكلفة 8 دولارات أمريكية

في AY-Robots، تم تصميم هذا الفشل بحيث لا يحدث للاستدلال: تحمل الحاويات التي توفرها واجهة برمجة تطبيقات الاستدلال (API) مراقبًا للخمول وتدمر نفسها بعد فترة خمول. إذا استأجرت البطاقة بنفسك، فإن هذا المراقب هو تذكيرك في التقويم.

4. الدفع مرتين مقابل نفس الإجابة

نقطة الدخول للضبط الدقيق في GR00T هي واجهة سطر أوامر (CLI) من نوع tyro لا تكشف عن أي بذرة (seed). هذا ليس قيدًا على المنصة، بل هو أداة المصدر الأصلية: لا يوجد حقل بذرة في gr00t/configs/finetune_config.py، وتحذر نصائح التدريب الخاصة بالمستودع من أن التشغيلات تختلف بنسبة 5 إلى 6 بالمائة لأن تحسينات الصور غير حتمية. يستخدم lerobot البذرة الافتراضية 1000 في كل من الإصدارين 0.5.1 و 0.6.1، لذا يمكن على الأقل إعادة تشغيل ACT و SmolVLA و Pi0.5 من نفس التهيئة وترتيب البيانات. هذا ليس وعدًا بأوزان متطابقة تمامًا على وحدة معالجة الرسوميات (GPU)، ولكنه الفرق بين إعادة التشغيل وتجربة جديدة. إذا أنتج تشغيل GR00T سياسة تعمل ولم تحتفظ بـ نقطة التحقق، فإنك تدفع الثمن كاملاً مقابل نتيجة قد تختلف بأكثر من الفرق الذي كنت تسعى إليه. هناك طريقة ثانية لفقدان نقطة تحقق دفعت ثمنها: واجهة سطر الأوامر (CLI) تستخدم افتراضيًا --save-total-limit 5، والموثق على أنه الحد الأقصى لعدد نقاط التحقق المحفوظة قبل حذف الأقدم منها. التخزين يكلف سنتات؛ وإعادة التشغيل تكلف من 4 إلى 12 دولارًا أمريكيًا وست ساعات.

السعة القابلة للمقاطعة بنصف السعر وستنهي تشغيلك

الحدود الدنيا للمزايدة أعلاه هي جزء من سعر الطلب، وتقول vast.ai إن نظام المزايدة يمكن أن يخفض تكاليف العميل بنسبة خمسين بالمائة أو أكثر. المشكلة، على حد تعبيرها: يمكن إيقاف مثيل قابل للمقاطعة مؤقتًا في أي وقت إذا قدم مستخدم آخر عرضًا أعلى أو تم إنشاء تأجير عند الطلب لنفس الموارد، وهذا الإيقاف المؤقت "يوقف جميع العمليات الجارية". الأولوية دائمًا للطلب. هذا جيد لتشغيل يكتب نقطة حفظ كل بضع مئات من الخطوات، وخسارة كاملة لتشغيل يكتب في النهاية، وهذا بالضبط ما توفره لك الإعدادات الافتراضية: يكتب Isaac-GR00T CLI كل --save-steps (الافتراضي 1000)، ولكن --save_freq الخاص بـ lerobot يضبط افتراضيًا على 20,000 خطوة، لذا فإن تشغيل SmolVLA الافتراضي يحفظ نقطة واحدة فقط، عند خط النهاية. قم بتخفيضها، أو لا تقدم عرضًا. تعرض استمارة تدريب AY-Robots إعداد GR00T كـ saveSteps.

استئجار البطاقة بنفسك
المزايا
  • أقل سعر بالساعة متاح.
  • تحكم كامل في الصورة، إصدار CUDA، مراجعة lerobot أو Isaac-GR00T وكل علامة.
  • المزايدة القابلة للمقاطعة تخفض السعر إلى النصف إذا كانت عملية التشغيل الخاصة بك تحفظ نقاطًا بشكل متكرر بما يكفي للبقاء على قيد الحياة بعد الإيقاف المؤقت.
  • لا يوجد شيء مجرد، لذا عندما يتصرف التشغيل بشكل غريب يمكنك معرفة السبب.
المقايضات
  • تكاليف الإعداد تحسب بأسعار وحدات معالجة الرسوميات (GPU): برامج التشغيل، التبعيات، نقطة الحفظ الأساسية متعددة الجيجابايت، وتنزيل مجموعة البيانات، كلها تكلف نفس السعر بالساعة مثل التدريب.
  • يتم إيقاف المثيل القابل للمقاطعة الذي تم المزايدة عليه وقتل عملياته. التشغيل غير المحفوظ هو أموال محترقة، ويكتب lerobot الافتراضي أول نقطة حفظ له عند الخطوة 20,000.
  • لا شيء يدمر الـ pod نيابة عنك. الجدول الخامل أعلاه هو فاتورة النسيان.
  • العرض لبطاقات 80 جيجابايت الكاملة الواحدة قليل: عرضان لبطاقات A100 80 GB وخمسة عروض لبطاقات H100 80 GB كاملة في هذه القراءة. تتغير القائمة أيضًا باستمرار، لذا فإن أرخص سعر مدرج والسعر الذي يمكنك استئجاره فعليًا ليسا نفس الرقم.
  • كل ساعة على البنية التحتية هي ساعة لم تُقضَ في تسجيل الحلقات التي تحدد ما إذا كانت السياسة تعمل أم لا.

القيام بذلك بنفسك مقابل السماح للمنصة باستئجار البطاقة

تختار الجهاز، وتبني البيئة، وتدمر الـ pod. السعر بالساعة هو سعر السوق أعلاه؛ كل شيء آخر هو وقتك.

  1. ابحث عن بطاقة تتناسب مع ذاكرة الفيديو (VRAM) التي يحتاجها النموذج: 24 GB لـ ACT و SmolVLA، و 80 GB لـ GR00T و Pi0.5.
  2. استأجر عند الطلب إذا لم يتمكن التشغيل من البقاء على قيد الحياة بعد الإيقاف المؤقت، أو قابل للمقاطعة إذا كان يحفظ نقاطًا بشكل متكرر.
  3. ثبّت سلسلة الأدوات: lerobot لـ ACT و SmolVLA و Pi0.5، ومستودع Isaac-GR00T مع مشغل tyro الخاص به لـ GR00T.
  4. حوّل مجموعة البيانات إذا لزم الأمر. مجموعة بيانات LeRobot v3.0 تتسبب في تعطل محمل GR00T ويجب تحويلها إلى v2.1.
  5. شغّل، راقب الخسارة، ادفع نقاط الحفظ إلى مكان دائم فور كتابتها.
  6. دمر المثيل، ثم تحقق من أنك دمرته.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
نقطة الدخول الحالية لضبط Isaac-GR00T، مطابقة للأمر في ملف README للمستودع. لا يحتوي هذا الـ CLI على علامة بذرة (seed flag)، لذا فإن عمليات تشغيل GR00T ليست قابلة للتكرار بتطابق تام.

التكلفة الواقعية لتشغيل GR00T واحد: 3 إلى 6 ساعات على H100 80 GB بسعر 1.34 إلى 2.34 دولار أمريكي في الساعة هي 4 إلى 14 دولار أمريكي، بالإضافة إلى 20 إلى 40 دقيقة من الإعداد التي تُحسب أيضًا، بالإضافة إلى وقتك الخاص.

ما تفرضه المنصة وكيف تختار البطاقة

المنطق ممل عن قصد. كل نموذج في الكتالوج يعلن عن فئة وحدة معالجة رسوميات (GPU)؛ يأخذ الواجهة الخلفية (backend) ذاكرة الفيديو العشوائية (VRAM) المطلوبة ويستأجر بطاقة مطابقة في نفس السوق الفوري المقاس أعلاه. لهذا السبب، التكلفة المقتبسة هي نطاق وليست سعرًا. GR00T و Pi0.5 متاحان هنا فقط على السحابة بسبب الحدود الدنيا البالغة 40 GB و 70 GB. يعمل SmolVLA و ACT أيضًا محليًا على بطاقتك الخاصة بسعة 24 GB، حيث تكون تكلفة السحابة صفرًا والكهرباء هي مشكلتك.

صفحة تسعير AY-Robots التي توضح تكلفة تشغيل التدريب والوصول إلى المنصة
صفحة التسعير. تتبع الأرقام لكل تشغيل السوق الفوري بدلاً من سعر قائمة ثابت.

توجد نقطة واحدة تستحق التحذير. تراكم التدرج (Gradient accumulation) ينطبق بالفعل على كلا نوعي GR00T، لذا فإن زيادته تتيح دفعة فعالة أكبر على نفس البطاقة. بالنسبة لـ Pi0.5 و SmolVLA، لا ينطبق على الإطلاق: lerobot 0.5.1 لا يحتوي على خيار تراكم التدرج في إعدادات التدريب الخاصة به، لذا فإن تعيين الحقل إلى 16 لا يكلف شيئًا ولا يشتري شيئًا. إذا لم يبدأ تشغيل مهمة في قائمة الانتظار أبدًا، صفحة المهام العالقة في قائمة الانتظار تغطي ما يجب التحقق منه؛ إذا تم رفض مجموعة البيانات قبل بدء التشغيل، فغالبًا ما يكون السبب مشكلة تنسيق v3.0.

الحد الذي لا تحله هذه المنصة: زمن الاستجابة

تضيف وحدة معالجة رسوميات مستأجرة تخدم سياستك عبر الإنترنت العام رحلات ذهابًا وإيابًا إلى حلقة تحكم تتراوح بالفعل بين 20 و 485 مللي ثانية لكل خطوة إجراء. مناسب لمهام الالتقاط والوضع البطيئة، وليس للحركة التفاعلية السريعة. تقييم الاستدلال السحابي لنقطة تحقق جيد، ولكنه يشغل عمليات التلاعب الإنتاجية بشكل سيء: إذا كانت المهمة تتطلب سرعة، فيجب أن تكون الحوسبة بجوار المحركات المؤازرة، وهذه تكلفة لا يمكن لهذه المقالة إخفاءها. انظر زمن استجابة الاستدلال.

ميزانية مفصلة لسياسة عمل أولية

جميع الخطوط الأربعة معًا، بدءًا من لا شيء. يفترض إجمالي استخدام وحدة معالجة الرسوميات (GPU) من 3 إلى 5 تشغيلات: الأول يثبت أن المسار يعمل، والثاني يكشف عن مشكلة في البيانات، والثالث أو الرابع هو الذي تحتفظ به.

البندالمسار الاقتصاديالمسار المريح
الذراعSO-100 تابع فقط، 121.94 دولار أمريكي في قائمة الموادقائد بالإضافة إلى تابع، 229.88 دولار أمريكي في قائمة المواد
النموذجSmolVLA أو ACT، فئة 24 جيجابايتGR00T N1.7، A100 80 جيجابايت أو فئة H100
الحلقات المسجلة30، الحد الأدنى لـ SmolVLA50 إلى 100
الوقت البشري للتسجيلحوالي 1 ساعة و 12 دقيقة2 إلى 4 ساعات
تكلفة التشغيل الواحد1 إلى 3 دولار أمريكي4 إلى 12 دولار أمريكي
عدد التشغيلات قبل أن يعمل3 إلى 53 إلى 5
إجمالي إنفاق وحدة معالجة الرسوميات3 إلى 15 دولار أمريكي12 إلى 60 دولار أمريكي
أكبر بند في الفاتورةالذراع، ثم وقتكالذراع، ثم وقتك

ينطبق هذا النمط على هذا الحجم من الروبوتات: الحوسبة هي خطأ تقريبي، والأجهزة هي تكلفة حقيقية لمرة واحدة، وساعات العمل البشري هي المصاريف المتكررة. لاختبار جزء التدريب قبل شراء أي شيء، تتيح لك مقارنة النماذج واستئجار وحدة معالجة رسوميات (GPU) دون الحاجة إلى ذراع، و هو ذراع SO-100 مادي يمكنك التحكم به في المتصفح دون تسجيل. بالنسبة للخطوات الكاملة من البداية إلى النهاية، فإن يغطي الإعداد، و والتدريب، و هو النسخة المختصرة.

مصفوفة تدريب AY-Robots بخمس سياسات كصفوف وأربعة أذرع روبوتية كأعمدة، وكل خلية تربط بدليل تدريب محدد
مصفوفة /train: صف لميزانيتك، عمود لذراعك، وخلية للدليل الذي يحتوي على الإعدادات الافتراضية والتكلفة لذلك الاقتران.
كم تكلفة تشغيل واحد لضبط VLA من البداية إلى النهاية؟

حوالي 4 إلى 12 دولارًا أمريكيًا لـ GR00T N1.7 أو GR00T N1.5 أو Pi0.5 على فئة A100 80 GB أو H100 (من 3 إلى 6 ساعات بسعر 1.20 إلى 2.00 دولار أمريكي في الساعة)، وحوالي 1 إلى 3 دولارات أمريكية لـ SmolVLA أو ACT على فئة RTX 4090 (من 2 إلى 5 ساعات بسعر 0.30 إلى 0.60 دولار أمريكي في الساعة). استئجار البطاقة بنفسك يقع ضمن نفس النطاق بمجرد احتساب وقت الإعداد، حيث يتم احتسابه بسعر التدريب.

هل يستحق دفع ثمن H100 بدلاً من A100 80 GB؟

بالنسبة لسياسة SO-100 واحدة، عادة لا. كلاهما يفي بمتطلبات الذاكرة الدنيا التي يحتاجها GR00T و Pi0.5، وفي قراءة بتاريخ 23 أغسطس 2026، بدأت A100 80 GB كاملة بسعر 0.44 دولار أمريكي في الساعة مقابل 1.34 دولار أمريكي لـ H100 80 GB. تنتهي H100 بشكل أسرع، لذا يعود جزء من السعر في شكل ساعات أقل، لكن الإجمالي لا يزال أعلى لتشغيل بهذا الحجم الصغير. الحجة الحقيقية لـ H100 هي التوفر: خمسة عروض H100 80 GB فردية في ذلك السوق مقابل عرضين لـ A100 80 GB، والبطاقة التي لا يمكنك استئجارها ليس لها سعر.

كم عدد مرات التشغيل التي تستغرقها السياسة قبل أن تعمل فعليًا؟

خطط لثلاثة إلى خمسة. الأول يثبت أن المسار متصل بشكل صحيح. الثاني عادة ما يكشف عن مشكلة في مجموعة البيانات مثل تدفق الكاميرا الذي توقف في منتصف الطريق. الثالث أو الرابع هو الذي تحتفظ به.

هل يمكنني تدريب SmolVLA أو ACT على وحدة معالجة الرسوميات الخاصة بي بدلاً من الاستئجار؟

نعم. كلاهما مدعوم محليًا على AY-Robots وكلاهما يتناسب بشكل مريح مع 24 جيجابايت؛ قامت ورقة ACT الأصلية بتدريب نموذجها البالغ 80 مليونًا في حوالي 5 ساعات على بطاقة RTX 2080 Ti بسعة 11 جيجابايت. GR00T و Pi0.5 متاحان فقط عبر السحابة هنا لأن الحدود الدنيا لضبط البائعين الموثقة هي 40 جيجابايت و 70 جيجابايت، وأكبر بطاقة استهلاكية في السوق هي RTX 5090 بسعة 32 جيجابايت.

لماذا يكلف نفس عدد الخطوات مبالغ مختلفة عبر النماذج؟

الخطوات ليست قابلة للمقارنة عبر السياسات. ACT يستخدم افتراضيًا 100,000 خطوة بحجم دفعة 8 على بطاقة 24 جيجابايت؛ GR00T N1.5 يستخدم افتراضيًا 2,000 خطوة بحجم دفعة 1 مع تجميع التدرج 16 على بطاقة 80 جيجابايت. الفاتورة هي الساعات مضروبة في سعر البطاقة التي تفرضها عليك بصمة الذاكرة، وليس عداد الخطوات.

اطلع على تكلفة تشغيلك قبل أن تبدأه

تدرج كل سياسة من السياسات الخمس فئة وحدة معالجة الرسوميات (GPU) الخاصة بها، ووقت التشغيل، وسعر كل تشغيل، ويقوم نظام التدريب الخلفي باستئجار البطاقة من نفس السوق الفوري الذي تم قياس هذه الأرقام عليه.

تحقق من الأسعار

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started