AY-Robots لاگت کی جدول جو یہ دکھاتی ہے کہ پانچوں پالیسیوں میں سے ہر ایک کو کون سا GPU درکار ہے، عام رن ٹائم اور فی رن قیمت، اور پالیسی کے کارآمد ہونے سے پہلے کتنے ایپی سوڈز کی ضرورت ہے۔
VLA ٹریننگGPU لاگتSO-100فائن ٹیوننگروبوٹ لرننگبجٹ بنانا

VLA ٹریننگ لاگت: ایک فائن ٹیوننگ رن کی اصل لاگت کیا ہے

AY-Robots ResearchAugust 23, 202623 منٹ کا مطالعہ

حقیقی سپاٹ مارکیٹ GPU کی قیمتیں، پانچوں پالیسیوں میں سے ہر ایک کتنی دیر چلتی ہے، بازو اور مظاہروں کی لاگت کیا ہے، اور وہ چار جگہیں جہاں پیسہ خاموشی سے غائب ہو جاتا ہے۔

مختصر ورژن

  • A100 80 GB یا H100 ٹیر پر ایک رن میں 3 سے 6 گھنٹے لگتے ہیں اور اس پر تقریباً 4 سے 12 امریکی ڈالر لاگت آتی ہے۔ RTX 4090 ٹیر پر یہ 2 سے 5 گھنٹے اور تقریباً 1 سے 3 امریکی ڈالر ہے۔
  • vast.ai پر 23 اگست 2026 کو 13:44 UTC پر پیمائش کی گئی: ایک مکمل RTX 4090 آن ڈیمانڈ 0.13 سے 0.38 امریکی ڈالر فی گھنٹہ، ایک A100 80 GB 0.44 سے 0.67، ایک H100 80 GB 1.34 سے 2.34۔ مکمل 80 GB کارڈز نایاب ہیں، بالترتیب دو اور پانچ سنگل کارڈ آفرز۔
  • GPU سب سے سستی لائن ہے۔ SO-ARM100 بل آف میٹریلز ایک لیڈر پلس فالوور جوڑے کو 229.88 امریکی ڈالر پر رکھتا ہے، جو 24 GB ٹیر پر 77 سے 230 رن کے برابر ہے۔
  • ایک شخص کے 50 ایپی سوڈز ریکارڈ کرنے کے دو گھنٹے ان ایپی سوڈز کو فیڈ کرنے والے ٹریننگ رن سے زیادہ مہنگے ہیں۔
  • پیسہ چار جگہوں پر غائب ہوتا ہے: خراب ڈیٹا پر رن، 3B ماڈلز ان کاموں پر جنہیں 80M پالیسی سنبھالتی ہے، GPUs جنہیں کسی نے تباہ نہیں کیا، اور ایسے نتائج کے دوبارہ رن جنہیں آپ محفوظ رکھنے میں ناکام رہے۔
  • AY-Robots کارڈ کا سائز ماڈل کی VRAM کی ضرورت کے مطابق کرتا ہے اور اسے اسی اسپاٹ مارکیٹ پر کرائے پر دیتا ہے، لہذا رن کی لاگت مارکیٹ کی لاگت ہے۔

بل میں چار لائنیں ہیں، اور GPU سب سے چھوٹی ہے۔

جب لوگ پوچھتے ہیں کہ ایک ویژن-لینگویج-ایکشن ماڈل کو SO-100 کے لیے فائن ٹیون کرنے میں کیا لاگت آتی ہے، تو ان کا تقریباً ہمیشہ مطلب GPU کا کرایہ ہوتا ہے۔ یہ وہ نمبر ہے جو کارڈ پر چارج کے طور پر ظاہر ہوتا ہے، لہذا یہ وہی ہے جو حقیقی محسوس ہوتا ہے۔ یہ بھی، ایک بڑے فرق سے، ان چار نمبروں میں سب سے چھوٹا ہے جو یہ فیصلہ کرتے ہیں کہ ایک فعال پالیسی دراصل آپ کو کیا لاگت آتی ہے۔

لائنیہ کیا ہےایک فعال پالیسی کے لیے عام سائز
GPU وقترن کے لیے کارڈ کرائے پر لینافی رن 1 سے 12 امریکی ڈالر، اور آپ 3 سے 5 رن کریں گے
روبوٹسرووز، پرنٹ شدہ فریم، کیمرے، کیبلز، پاورایک بار، فی بازو 110 سے 500 یورو
انسانی گھنٹےڈیمو ریکارڈ کرنے کے لیے بازو چلانے والا شخصفی ڈیٹا سیٹ 1 سے 4 گھنٹے، فی ٹاسک دہرایا جائے گا
ضیاعخراب ڈیٹا، بڑے ماڈلز، بھولی ہوئی پوڈزلامحدود، اور واحد لائن جسے آپ کنٹرول کرتے ہیں

ذیل میں تربیت کے اوقات پانچ ماڈلز کے اپنے پیپرز اور ریپوزٹریز سے لیے گئے ہیں، ہارڈ ویئر کی لاگت شائع شدہ بل آف میٹریلز سے، پلیٹ فارم کے اعداد و شمار AY-Robots پالیسی کیٹلاگ اور قیمتوں کا صفحہ۔ جہاں پلیٹ فارم مدد نہیں کرتا، یہ مضمون اس کا ذکر کرتا ہے۔

اسپاٹ مارکیٹ میں ایک GPU گھنٹے کی اصل لاگت کیا ہے

A100 گھنٹے کی کوئی ایک قیمت نہیں ہے۔ vast.ai جیسے مارکیٹ پلیس پر ہر میزبان اپنی شرح مقرر کرتا ہے، اور تربیتی رن جو آپ لانچ کرتے ہیں وہ اس وقت جو بھی مشین سستی اور خالی ہو اس پر اترتا ہے۔ ایماندارانہ جواب ایک تقسیم ہے۔ یہ رہا، 23 اگست 2026 کو 13:44 UTC پر ماپا گیا: سنگل فل کارڈز، آن ڈیمانڈ، حقیقی VRAM کے ذریعے فلٹر شدہ۔

کارڈvast.ai آن ڈیمانڈ USD/h (کم / اوسط / زیادہ)فل کارڈ آفرزvast.ai بِڈ فلورRunPod کمیونٹی / سیکیورHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74not offered
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99not offered
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19not offered
یہ سنیپ شاٹ کیسے لیا گیا، اور یہ کیا نہیں ہے

vast.ai پبلک بنڈل API سے ایک مکمل GPU (gpu_frac == 1.0) کے لیے آن ڈیمانڈ پیشکشیں، جس کے لیے کسی اکاؤنٹ کی ضرورت نہیں، gpu_ram پر فلٹر کی گئی ہیں تاکہ صرف حقیقی 80 GB کارڈز 80 GB کی قطاروں میں آئیں۔ یہ فلٹر اہم ہے: اس مطالعے میں تمام تین سنگل کارڈ A100 SXM4 پیشکشیں 40 GB کے حصے تھے، جیسا کہ چار A100 PCIE پیشکشوں میں سے دو تھے، لہذا انہیں ایک "A100" قطار میں جمع کرنے سے یہاں رپورٹ کی گئی قیمت آدھی ہو جاتی۔ Hugging Face کالم دو مصنوعات کو ملاتا ہے: 2.50 USD/h Nvidia A100 - large Spaces ہارڈویئر ہے اور 4.50 USD/h Inference Endpoints کے تحت ایک واحد H100 80 GB ہے، جو Spaces پیش نہیں کرتا۔ میڈین کو اشارے کے طور پر لیں: A100 80 GB کی قطار دو پیشکشوں پر مبنی ہے اور H100 کی قطار پانچ پر، اور 36 سیکنڈ بعد کی گئی ایک جیسی استفسار نے 4090 کی مختلف تعداد اور پانچ میں سے تین قطاروں پر مختلف سب سے زیادہ قیمت واپس کی۔ RunPod کی فہرست کی قیمتیں منصوبہ بندی کے لیے زیادہ مستحکم اعداد ہیں۔

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
اوپر دی گئی جدول کے پیچھے کی درست استفسار، اس حصے کو لکھتے وقت دو بار چلائی گئی۔ کسی بھی GPU قیمتوں کے مضمون پر بھروسہ کرنے سے پہلے اسے چلائیں، بشمول یہ والا۔
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
The cost table on /try: card, run time, price per run and minimum episodes per policy.

3B ماڈلز سستے کارڈ کو کیوں استعمال نہیں کر سکتے

ایک 4090 گھنٹہ اور ایک H100 80 GB گھنٹہ اوپر دیے گئے میڈینز پر تقریباً چھ گنا مختلف ہیں۔ جو چیز آپ کو مہنگے کارڈ پر مجبور کرتی ہے وہ رفتار نہیں، بلکہ میموری ہے۔ openpi ایک مکمل Pi0.5 کے لیے کم از کم ضرورت مقرر کرتا ہے فائن ٹیون 70 GB پر، اور NVIDIA GR00T کے لیے 40 GB یا اس سے زیادہ کی سفارش کرتا ہے۔ نوٹ کریں کہ GR00T نمبر کیا نہیں ہے۔ اس کی فائن ٹیون کنفیگریشن زبان کے ماڈل اور بصری انکوڈر کو بطور ڈیفالٹ منجمد کر دیتی ہے (tune_llm اور tune_visual False ہیں، جبکہ پروجیکٹر اور ڈفیوژن ہیڈ True ہیں)، یہی وجہ ہے کہ کیٹلاگ میں 3 B میں سے تقریباً 40 M تربیت یافتہ پیرامیٹرز درج ہیں۔ 40 GB 3 B وزن کے لیے آپٹیمائزر کی حالت نہیں ہے، یہ منجمد بیک بون اور ایکٹیویشنز ہیں۔ کم دائرہ کار والی اقسام کم ہوتی ہیں: openpi کا LoRA پاتھ 22.5 GB چاہتا ہے اور 4090 کا نام لیتا ہے، اور NVIDIA کا Isaac Lab Arena ورک فلو GR00T پوسٹ ٹریننگ کے لیے 24 GB سنگل-GPU آپشن درج کرتا ہے۔ پلیٹ فارم ہر وینڈر کی طرف سے شائع کردہ کنفیگریشن کے لیے کم از کم ضروریات پر مبنی ہے۔ pi0 فلو-میچنگ کی تحریر وضاحت کرتی ہے کہ وہ فلو-میچنگ فوٹ پرنٹ کہاں سے آتا ہے۔

کاماپ اسٹریم پروجیکٹ کے لیے درکار میموریماخذ
pi0 / pi0.5 انفرنسmore than 8 GB, example RTX 4090openpi
pi0 / pi0.5 LoRA فائن ٹیونmore than 22.5 GB, example RTX 4090openpi
pi0 / pi0.5 مکمل فائن ٹیونmore than 70 GB, example A100 80 GB or H100openpi
GR00T N1.7 انفرنس1 GPU with 16 GB or moreIsaac-GR00T
GR00T N1.7 فائن ٹیون40 GB or more recommended, H100 or L40 nodesIsaac-GR00T
GR00T فائن ٹیون، جو یہ تربیت دیتا ہےprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
GR00T پوسٹ ٹریننگ، کم شدہ1 GPU with 24 GB, language model frozenIsaac Lab Arena
SmolVLA فائن ٹیونsingle A100 for the reference 20,000-step runlerobot docs
ACT ٹریننگa single 11 GB RTX 2080 TiACT paper

یہ جدول اس بات کی وضاحت کرتا ہے کہ پلیٹ فارم پانچ ماڈلز کو دو درجوں میں کیوں تقسیم کرتا ہے۔ GR00T N1.7، GR00T N1.5 اور Pi0.5 A100 80 GB یا H100 پر چلتے ہیں کیونکہ وینڈرز یہی مطالبہ کرتے ہیں۔ SmolVLA اور ACT RTX 4090 یا کسی بھی 24 GB کارڈ پر چلتے ہیں کیونکہ یہ واقعی کافی ہے۔

ایک دن ضائع کرنے والا جال: بڑے ماڈل کے لیے سستا کارڈ کرائے پر لینا

ایک GR00T یا Pi0.5 کا 24 GB کارڈ پر چلنا پہلے سیکنڈ میں ناکام نہیں ہوتا۔ یہ بیس چیک پوائنٹ ڈاؤن لوڈ کرتا ہے، ڈیٹا سیٹ انڈیکس بناتا ہے، پہلا فارورڈ پاس شروع کرتا ہے اور چند سو مراحل کے بعد CUDA آؤٹ آف میموری ایرر کے ساتھ بند ہو جاتا ہے۔ آپ نے ڈاؤن لوڈ اور سیٹ اپ کے لیے ادائیگی کی اور کچھ حاصل نہیں کیا۔ حل: ٹریننگ کے دوران میموری کی کمی۔

پانچ ماڈلز میں سے ہر ایک دراصل کتنی دیر تک چلتا ہے

رن ٹائم لاگت کا دوسرا نصف ہے: اگر کام 40 منٹ کا ہو تو 2.00 امریکی ڈالر فی گھنٹہ غیر متعلقہ ہے اور اگر 40 گھنٹے کا ہو تو تباہ کن ہے۔ یہ وہ ڈیفالٹس ہیں جو AY-Robots دراصل ٹرینر کو بھیجتا ہے، ہر ٹیر کے لیے رن ونڈو اور لاگت کے ساتھ۔

پالیسیGPU ٹیرڈیفالٹ زیادہ سے زیادہ مراحلڈیفالٹ بیچ (گریڈ ایکوم)رن ونڈوفی رن لاگت
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
AY-Robots پر پانچ تربیت پذیر پالیسیوں کا موازنہ جدول جو پیرامیٹر کی گنتی، مطلوبہ GPU، انفرنس لیٹنسی اور کم از کم ایپی سوڈ کی گنتی دکھا رہا ہے
پانچ پالیسیاں ساتھ ساتھ: پیرامیٹرز، GPU ٹیر، فی ایکشن سٹیپ لیٹنسی، کم از کم ایپی سوڈز۔

یہ رن ونڈوز اپ اسٹریم سے کہاں سے آتی ہیں؟

  • SmolVLA: lerobot کی دستاویزات میں بتایا گیا ہے کہ 20,000 steps ایک A100 پر تقریباً 4 hours لیتے ہیں۔ پلیٹ فارم وہی 20,000 steps سستے 24 GB tier پر چلاتا ہے، اس لیے 4 hours کی ایک فلیٹ مدت کے بجائے ایک ونڈو ہے۔
  • ACT: اصل ALOHA پیپر میں ایک 80M-parameter ماڈل کے لیے ایک 11 GB RTX 2080 Ti پر تقریباً 5 hours کا وقت بتایا گیا ہے۔ ایک 4090 کئی نسلوں بعد کا ہے لیکن پلیٹ فارم 100,000 steps کا بجٹ رکھتا ہے، لہذا ونڈو اسی جگہ پر آتی ہے۔
  • GR00T: NVIDIA کا N1.6 جنریشن کے لیے حوالہ ورک فلو آٹھ L40S کارڈز پر batch 24 پر 20,000 steps کے لیے تقریباً 4 to 8 hours، اور ایک Ada 6000 پر batch 16 پر 30,000 steps کے لیے 2 to 3 hours کا وقت بتاتا ہے۔ چند گھنٹوں میں ایک 3B VLA کی سنگل کارڈ فائن ٹیوننگ معمول کی بات ہے، نہ کہ پرامید۔
  • Pi0.5: openpi کوئی وال کلاک فگر شائع نہیں کرتا، لیکن یہ مکمل فائن ٹیون کے لیے 70 GB کی حد شائع کرتا ہے، جو کارڈ اور اس طرح شرح کو متعین کرتا ہے۔

اس تعداد پر غور کرنا ضروری ہے جس کی آپ ادائیگی نہیں کر رہے۔ GR00T N1 پیپر کے مطابق، 2.2B ماڈل کو پری ٹرین کرنے کے لیے تقریباً 50,000 H100 GPU hours درکار ہوتے ہیں، جو 1024 GPUs تک کے کلسٹر پر، 16,384 کے پری ٹریننگ بیچ سائز پر 200,000 gradient steps کے لیے استعمال ہوتے ہیں۔ اوپر ماپی گئی 1.34 to 2.34 USD فی گھنٹہ کی شرح سے، یہ 67,000 to 117,000 USD کی کرائے کی کمپیوٹ کے برابر ہے۔ SmolVLA پیپر اپنے پروجیکٹ کو 481 کمیونٹی ڈیٹا سیٹس، 22.9K episodes اور 10.6M frames پر تقریباً 30,000 GPU hours پر رکھتا ہے۔ آپ یہ سب کچھ ایک ڈاؤن لوڈ کی قیمت پر حاصل کرتے ہیں؛ آپ کے 8 USD آخری 20,000 steps خریدتے ہیں۔ VLAs اس طرح کیوں بنائے جاتے ہیں اس تقسیم کا احاطہ کرتا ہے۔

بازو: ایک بار کا خرچ جو GPU بل کو بونا بنا دیتا ہے

ایک تربیتی رن کی لاگت دوپہر کے کھانے سے کم ہے۔ روبوٹ کی نہیں۔ یہی وجہ ہے کہ SO-100 اہم ہے: یہ سب سے سستا بازو ہے جسے پوری نقلی سیکھنے ٹول چین درحقیقت سپورٹ کرتا ہے۔

بازوسرووزوولٹیجپرزوں کی لاگتAY-Robots پر سپورٹ
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURمکمل، حوالہ بازو
SO-101Feetech STS32157.4 V130 to 170 EURمکمل
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURہم آہنگ
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURہم آہنگ

SO-ARM100 ریپوزٹری میں اپ اسٹریم بل آف میٹریلز زیادہ تفصیلی ہے اور آپ کے علاقے کے لحاظ سے جانچنے کے قابل ہے: اس کی دو بازوؤں کے لیے پرزے فہرست ایک لیڈر پلس فالوور سیٹ اپ کے لیے 229.88 USD یا 226.30 EUR بنتی ہے، اور اس کی ایک فالوور بازو کے لیے پرزے فہرست 121.94 USD یا 124.30 EUR بنتی ہے۔ چھ STS3215 سرووز، ہر ایک 13.89 USD پر، اس 121.94 میں سے 83.34 کے ہیں، لہذا سرووز ہی بازو ہیں۔ 1 سے 3 USD فی SmolVLA یا ACT رن پر، بازوؤں کا ایک جوڑا 77 سے 230 تربیتی رن کے برابر ہے۔ اگر آپ اب بھی انتخاب کر رہے ہیں، تو SO-100 بمقابلہ SO-101 وہ موازنہ ہے جو اہمیت رکھتا ہے، کیونکہ دونوں اتنے قریب ہیں کہ فیصلہ صلاحیت کے بجائے دستیابی کے بارے میں ہے۔

7.4 V، 12 V نہیں

STS3215 7.4 V اور 12 V ویرینٹ میں دستیاب ہے۔ ریپوزٹری نوٹ کرتی ہے کہ 12 V والے حصے کو 5 V کی بجائے 12 V 5 A سپلائی کی بھی ضرورت ہوتی ہے، لہذا دونوں قابل تبادلہ نہیں ہیں۔ 7.4 V سرووز میں 12 V فیڈ کرنے سے وہ تباہ ہو جاتے ہیں، اور چھ سرووز ایک فالوور بازو کے پرزوں کی لاگت کا دو تہائی ہیں۔ پہلی بار پاور آن کرنے سے پہلے ہر سروو پر لیبل چیک کریں۔ اگر سرووز پہلے ہی عجیب و غریب برتاؤ کر رہے ہیں: سروو جواب نہیں دے رہا، بازو جھٹکے لیتا ہے پھر ڈھیلا پڑ جاتا ہے۔

انسانی گھنٹے: وہ لائن جو کوئی اسپریڈشیٹ میں نہیں ڈالتا

یہ وہ تعداد ہے جو لاگت کی بحث کو الٹ دیتی ہے۔ مظاہروں کو ریکارڈ کرنا ایک شخص کا روبوٹ بازو کو حقیقی وقت میں، ایک وقت میں ایک ایپی سوڈ حرکت دینا ہے۔ اس میں کوئی بیچنگ نہیں ہے اور نہ ہی اسے فی سیکنڈ کرائے پر لیا جا سکتا ہے۔ The LeRobot dataset ریکارڈر ڈیفالٹس کے ساتھ آتا ہے جو حساب کتاب کو آسان بناتے ہیں، یہ تینوں کی تصدیق DatasetRecordConfig: 60 سیکنڈ فی ایپی سوڈ، منظر کو ری سیٹ کرنے کے لیے 60 سیکنڈ، 50 ایپی سوڈز۔ نیچے دی گئی رقم کا کالم کسی کے ایک گھنٹے کے وقت کے لیے 15 USD فرض کرتا ہے، جو کہ ایک مفروضہ ہے نہ کہ پلیٹ فارم نمبر۔ اپنی شرح تبدیل کریں؛ تناسب ہی اصل بات ہے۔

  1. 1
    ڈیٹا سیٹ کو ان ڈیفالٹس کے ساتھ ریکارڈ کریں جن کے لیے آپ کو اصل میں بل کیا جائے گا

    یہ lerobot 0.6.1 ہے، جو 3 اگست 2026 تک PyPI پر دستیاب ورژن ہے۔ CLI کی شکل نوٹ کریں: ریکارڈنگ پرانے python -m lerobot.scripts.record ماڈیول پاتھ کے بجائے lerobot-record کنسول انٹری پوائنٹ (lerobot.scripts.lerobot_record) کے ذریعے چلتی ہے۔ AY-Robots 0.5.1 کو ہدف بناتا ہے، اور 0.5.1 وہیل وہی lerobot-record اور lerobot-train انٹری پوائنٹس کا اعلان کرتا ہے، لہذا نیچے دی گئی شکل دونوں میں مستحکم ہے۔ تین ٹائمنگ فلیگز اپ اسٹریم ڈیفالٹس ہیں، لہذا یہ وہی کمانڈ بھی ہے جسے اگلی جدول میں حسابات فرض کرتے ہیں۔

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    ایک بھی GPU منٹ کرائے پر لینے سے پہلے جو کچھ آپ نے ریکارڈ کیا ہے اسے دیکھیں

    ڈیٹا سیٹ کا معائنہ کرنے پر فی گھنٹہ صفر USD لاگت آتی ہے۔ لاس کرو سے وہی مسئلہ دریافت کرنے پر H100 ٹیر پر فی گھنٹہ 2.00 USD لاگت آتی ہے اور آپ کو چار گھنٹے بعد پتہ چلتا ہے۔ ڈیٹا سیٹ کو پش کریں اور اسے LeRobot ویور میں اسکرَب کریں، یا AY-Robots ڈیٹا سیٹ ڈائریکٹری کو براؤز کریں۔

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    تربیت دیں، اور یقینی بنائیں کہ چیک پوائنٹ پوڈ سے زیادہ دیر تک رہے

    کرائے پر لی گئی مشین تعریف کے لحاظ سے عارضی ہوتی ہے، لہذا رن کے دوران چیک پوائنٹس کو کسی پائیدار جگہ پر لکھیں۔ دو فلیگز یہ فیصلہ کرتے ہیں کہ آپ نے جو ادائیگی کی ہے اسے برقرار رکھتے ہیں یا نہیں۔ --save_freq 20,000 سٹیپس پر ڈیفالٹ ہوتا ہے، لہذا ایک ڈیفالٹ 20,000 سٹیپ SmolVLA رن اپنا پہلا چیک پوائنٹ اس وقت لکھتا ہے جب رن پہلے ہی ختم ہو چکا ہوتا ہے؛ اسے کسی بھی رکاوٹ والی چیز کو کرائے پر لینے سے پہلے کم کریں۔ --save_checkpoint_to_hub کو --policy.repo_id کی ضرورت ہوتی ہے اور lerobot 0.5.1 میں موجود نہیں ہے، لہذا اس ورژن پر آپ آؤٹ پٹ ڈائریکٹری کو مشین سے خود کاپی کرتے ہیں۔ نیچے دی گئی بیچ سائز اپ اسٹریم ڈاک کی مثال ہے؛ AY-Robots فارم SmolVLA کے لیے 2 بھیجتا ہے اور چیک پوائنٹس ظاہر ہونے پر آبجیکٹ سٹوریج میں لکھتا ہے۔

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
ایپی سوڈز60 سیکنڈ پر ریکارڈنگ60 سیکنڈ پر ری سیٹ کرناوال کلاکپلس 20 فیصد دوبارہ ریکارڈز15 USD فی انسانی گھنٹہ پر
30، SmolVLA کا کم از کم30 منٹ30 منٹ1 گھنٹہ 00 منٹ1 گھنٹہ 12 منٹتقریباً 18 USD
50، دیگر چار کم از کم50 منٹ50 منٹ1 گھنٹہ 40 منٹ2 گھنٹے 00 منٹتقریباً 30 USD
100، ایک آرام دہ ڈیٹا سیٹ100 منٹ100 منٹ3 گھنٹے 20 منٹ4 گھنٹے 00 منٹتقریباً 60 USD

دائیں ہاتھ کے کالم کا موازنہ 1 سے 12 USD کے رن کے اخراجات سے کریں۔ اس مفروضہ شرح پر، 50 اقساط کے ڈیٹا سیٹ کو ریکارڈ کرنے میں تربیت دینے سے دو سے سات گنا زیادہ لاگت آتی ہے، کیلیبریشن، کیمرہ سیٹ اپ اور ان اقساط کو ہٹانے سے پہلے جنہیں آپ ضائع کر دیتے ہیں۔ یہی وجہ ہے کہ کی براہ راست مالی اہمیت ہے۔ LeRobot گائیڈ کم از کم 50 اقساط تجویز کرتا ہے جس میں ہر آبجیکٹ لوکیشن کے لیے 10 اقساط ہوں؛ SmolVLA دستاویزات بتاتی ہیں کہ اسی کام کا 25 اقساط کا ورژن کافی نہیں تھا۔

پیسہ دراصل کہاں غائب ہوتا ہے

1. ایسے ڈیٹا پر چلنے والے رن جو کبھی کام نہیں کرنے والے تھے

دو تبدیل شدہ کیمرہ سٹریمز والے ڈیٹا سیٹ پر 20,000 قدم کا GR00T رن اتنا ہی خرچ کرتا ہے جتنا ایک صاف ڈیٹا سیٹ پر، اتنا ہی وقت لیتا ہے، اور ایک ایسا لاس کرو پیدا کرتا ہے جو ٹھیک لگتا ہے۔ ناکامی بازو پر گھنٹوں بعد ظاہر ہوتی ہے۔ کی بلنگ فی گھنٹہ ہوتی ہے اور تشخیص کی بلنگ دنوں میں ہوتی ہے۔ دو علامات جو یاد رکھنے کے قابل ہیں: کا عام طور پر مطلب یہ ہے کہ مشاہدات وہ معلومات نہیں رکھتے جو کام کے لیے درکار ہیں، اور کا مطلب ہے کہ ڈیٹا سیٹ میں آپ کی سوچ سے کم تغیر تھا۔

2. فکسڈ کیمرہ ٹاسک کے لیے فاؤنڈیشن ماڈل کی قیمتیں ادا کرنا

ACT تقریباً 80M پیرامیٹرز پر مشتمل ہے اور اسے ایک ٹاسک کے 50 مظاہروں پر شروع سے تربیت دینے کے لیے ڈیزائن کیا گیا تھا۔ GR00T N1.7 تقریباً 3B ہے جس میں ایک پری ٹرینڈ بیک بون ہے۔ ایک بولٹڈ کیمرہ، ایک فکسڈ ٹیبل اور ایک آبجیکٹ کے لیے، 80M ماڈل اکثر کام کرتا ہے، 152 ms کے بجائے تقریباً 20 ms فی ایکشن سٹیپ پر چلتا ہے، اور 4 سے 12 USD کے بجائے 1 سے 3 USD فی رن لاگت آتی ہے۔ مہنگے ماڈل پر 12 USD خرچ کرنے سے پہلے یہ معلوم کرنے کے لیے 3 USD خرچ کریں کہ کیا سستا ماڈل کام کرتا ہے۔ ACT بمقابلہ SmolVLA اور GR00T N1.7 بمقابلہ Pi0.5 دکھاتے ہیں کہ ہر ایک کہاں صحیح جواب ہونا بند کر دیتا ہے؛ ماڈل ایرینا میں 85 ماڈلز اور 332 بینچ مارک نتائج ہیں۔

3. وہ GPU جسے آپ بھول گئے

روکنے کے لیے سب سے سستی غلطی اور کرنے کے لیے سب سے عام غلطی۔ جمعہ کو کسی چیز کو ڈیبگ کرنے کے لیے شروع کی گئی ایک انسٹنس ہفتے کے آخر میں ایک حقیقی رن کی طرح ہی بل ہوتی ہے۔

کارڈسنیپ شاٹ میں اوسط شرح24 گھنٹے بیکار7 دن بیکاراس کی قیمت
RTX 40900.32 USD/h7.68 USD53.76 USDتقریباً 27 SmolVLA یا ACT رنز 2 USD میں
A100 80 GB0.56 USD/h13.44 USD94.08 USDتقریباً 12 GR00T رنز 8 USD میں
H100 80 GB1.80 USD/h43.20 USD302.40 USDتقریباً 38 GR00T رنز 8 USD میں

AY-Robots پر، یہ ناکامی انفرنس کے لیے ڈیزائن کی گئی ہے: انفرنس API کے ذریعے فراہم کردہ پوڈز ایک بیکار واچ ڈاگ رکھتے ہیں اور ایک بیکار مدت کے بعد خود کو تباہ کر دیتے ہیں۔ اگر آپ خود کارڈ کرایہ پر لیتے ہیں، تو وہ واچ ڈاگ آپ کا کیلنڈر یاد دہانی ہے۔

4. ایک ہی جواب کے لیے دو بار ادائیگی

GR00T کا فائن ٹیوننگ انٹری پوائنٹ ایک ٹائرو CLI ہے جو کوئی سیڈ ظاہر نہیں کرتا۔ یہ پلیٹ فارم کی کوئی حد نہیں ہے، یہ اپ اسٹریم ٹول ہے: gr00t/configs/finetune_config.py میں کوئی سیڈ فیلڈ نہیں ہے، اور ریپوزٹری کی اپنی تربیتی تجاویز خبردار کرتی ہیں کہ رنز 5 سے 6 فیصد تک مختلف ہوتے ہیں کیونکہ امیج آگمینٹیشنز غیر حتمی ہیں۔ lerobot 0.5.1 اور 0.6.1 دونوں میں سیڈ 1000 پر ڈیفالٹ کرتا ہے، لہذا ACT، SmolVLA اور Pi0.5 رنز کو کم از کم اسی انیشیلائزیشن اور ڈیٹا آرڈر سے دوبارہ چلایا جا سکتا ہے۔ یہ GPU پر بٹ-آئیڈنٹیکل ویٹس کا وعدہ نہیں ہے، لیکن یہ دوبارہ چلانے اور ایک نئے تجربے کے درمیان فرق ہے۔ اگر GR00T رن ایک ایسی پالیسی تیار کرتا ہے جو کام کرتی ہے اور آپ نے چیک پوائنٹ نہیں رکھا، تو آپ ایک ایسے نتیجے کے لیے پوری قیمت ادا کرتے ہیں جو اس فرق سے زیادہ مختلف ہو سکتا ہے جس کا آپ پیچھا کر رہے تھے۔ ایک چیک پوائنٹ کھونے کا دوسرا طریقہ یہ ہے جس کے لیے آپ نے ادائیگی کی تھی: CLI --save-total-limit 5 پر ڈیفالٹ کرتا ہے، جسے پرانے چیک پوائنٹس کو حذف کرنے سے پہلے رکھے جانے والے چیک پوائنٹس کی زیادہ سے زیادہ تعداد کے طور پر دستاویزی کیا گیا ہے۔ سٹوریج سینٹ میں ہے؛ ایک دوبارہ رن 4 سے 12 USD اور چھ گھنٹے کا ہے۔

رکاوٹ پذیر صلاحیت آدھی قیمت پر ہے اور آپ کے رن کو ختم کر دے گی

اوپر کی بولی کی حدیں آن ڈیمانڈ ریٹ کا ایک حصہ ہیں، اور vast.ai کا کہنا ہے کہ بولی کا نظام کلائنٹ کے اخراجات کو پچاس فیصد یا اس سے زیادہ کم کر سکتا ہے۔ اس کا کیچ، اس کے اپنے الفاظ میں: ایک رکاوٹ پذیر انسٹنس کو کسی بھی وقت روکا جا سکتا ہے اگر کوئی دوسرا صارف زیادہ بولی لگائے یا انہی وسائل کے لیے آن ڈیمانڈ کرایہ داری بنائی جائے، اور وہ توقف "چلنے والے تمام عمل کو روک دیتا ہے"۔ آن ڈیمانڈ کو ہمیشہ ترجیح حاصل ہوتی ہے۔ یہ اس رن کے لیے ٹھیک ہے جو ہر چند سو قدموں پر ایک چیک پوائنٹ لکھتا ہے، لیکن اس کے لیے مکمل نقصان ہے جو آخر میں لکھتا ہے، جو بالکل وہی ہے جو ڈیفالٹس آپ کو دیتے ہیں: Isaac-GR00T CLI ہر --save-steps (ڈیفالٹ 1000) پر لکھتا ہے، لیکن lerobot کا --save_freq ڈیفالٹ 20,000 قدموں پر ہے، لہذا ایک ڈیفالٹ SmolVLA رن صرف ایک بار، اختتامی لائن پر چیک پوائنٹ کرتا ہے۔ اسے کم کریں، یا بولی نہ لگائیں۔ AY-Robots ٹریننگ فارم GR00T نوب کو saveSteps کے طور پر ظاہر کرتا ہے۔

کارڈ خود کرایہ پر لینا
فوائد
  • سب سے کم فی گھنٹہ کی شرح جو دستیاب ہے۔
  • امیج، CUDA ورژن، lerobot یا Isaac-GR00T ریویژن اور ہر فلیگ پر مکمل کنٹرول۔
  • رکاوٹ پذیر بولی شرح کو آدھا کر دیتی ہے اگر آپ کا رن اتنی بار چیک پوائنٹ کرتا ہے کہ توقف سے بچ سکے۔
  • کوئی چیز تجریدی نہیں ہے، لہذا جب کوئی رن عجیب رویہ اختیار کرتا ہے تو آپ دیکھ سکتے ہیں کہ ایسا کیوں ہے۔
نقصانات
  • سیٹ اپ GPU ریٹس پر بل ہوتا ہے: ڈرائیورز، ڈیپینڈنسیز، ملٹی گیگا بائٹ بیس چیک پوائنٹ اور ڈیٹا سیٹ ڈاؤن لوڈ سب کی فی گھنٹہ لاگت ٹریننگ کے برابر ہے۔
  • ایک اوور بِڈ رکاوٹ پذیر انسٹنس کو روکا جاتا ہے اور اس کے عمل کو ختم کر دیا جاتا ہے۔ ایک غیر محفوظ شدہ رن جلا ہوا پیسہ ہے، اور lerobot ڈیفالٹ اپنا پہلا چیک پوائنٹ 20,000 قدم پر لکھتا ہے۔
  • کوئی چیز آپ کے لیے پوڈ کو تباہ نہیں کرتی۔ اوپر دی گئی بیکار ٹیبل بھولنے کا بل ہے۔
  • سنگل مکمل 80 GB کارڈز کی سپلائی کم ہے: اس پڑھائی میں دو A100 80 GB اور پانچ H100 80 GB مکمل کارڈ کی پیشکشیں ہیں۔ فہرست بھی بدلتی رہتی ہے، لہذا سب سے سستی درج شدہ قیمت اور وہ قیمت جس پر آپ واقعی کرایہ پر لے سکتے ہیں، ایک ہی نمبر نہیں ہیں۔
  • انفراسٹرکچر پر گزارا گیا ہر گھنٹہ وہ گھنٹہ ہے جو ان اقساط کو ریکارڈ کرنے میں نہیں گزارا گیا جو یہ فیصلہ کرتی ہیں کہ پالیسی کام کرتی ہے یا نہیں۔

خود کرنا بمقابلہ پلیٹ فارم کو کارڈ کرایہ پر لینے دینا

آپ مشین کا انتخاب کرتے ہیں، ماحول بناتے ہیں اور پوڈ کو ختم کرتے ہیں۔ فی گھنٹہ کی شرح اوپر دی گئی مارکیٹ ریٹ ہے؛ باقی سب آپ کا وقت ہے۔

  1. ماڈل کی VRAM کی ضرورت کے مطابق ایک کارڈ تلاش کریں: ACT اور SmolVLA کے لیے 24 GB، GR00T اور Pi0.5 کے لیے 80 GB۔
  2. اگر رن وقفے کو برداشت نہیں کر سکتا تو ڈیمانڈ پر کرایہ پر لیں، اگر یہ اکثر چیک پوائنٹس بناتا ہے تو قابلِ مداخلت۔
  3. ٹول چین انسٹال کریں: ACT، SmolVLA اور Pi0.5 کے لیے lerobot، GR00T کے لیے Isaac-GR00T ریپوزٹری اپنے tyro لانچر کے ساتھ۔
  4. اگر ضرورت ہو تو ڈیٹا سیٹ کو تبدیل کریں۔ ایک LeRobot v3.0 ڈیٹا سیٹ GR00T لوڈر کو کریش کر دیتا ہے اور اسے v2.1 میں تبدیل کرنا ضروری ہے۔
  5. لانچ کریں، نقصان کو دیکھیں، چیک پوائنٹس کو کسی پائیدار جگہ پر دھکیلیں جیسے ہی وہ لکھے جائیں۔
  6. انسٹنس کو ختم کریں، پھر چیک کریں کہ آپ نے اسے ختم کر دیا ہے۔
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
موجودہ Isaac-GR00T فائن ٹیون انٹری پوائنٹ، جو ریپوزٹری README میں کمانڈ سے مطابقت رکھتا ہے۔ اس CLI میں کوئی سیڈ فلیگ نہیں ہے، لہذا GR00T رنز بٹ-فار-بٹ قابلِ تولید نہیں ہیں۔

ایک GR00T رن کے لیے حقیقت پسندانہ لاگت: H100 80 GB پر 3 سے 6 گھنٹے 1.34 سے 2.34 USD فی گھنٹہ کے حساب سے 4 سے 14 USD ہے، علاوہ 20 سے 40 منٹ کا سیٹ اپ جس کا بھی بل آتا ہے، علاوہ آپ کا اپنا وقت۔

پلیٹ فارم کیا چارج کرتا ہے اور یہ کارڈ کا انتخاب کیسے کرتا ہے

منطق جان بوجھ کر سادہ ہے۔ ہر ماڈل کیٹلاگ میں ایک GPU ٹیر کا اعلان کرتا ہے؛ بیک اینڈ مطلوبہ VRAM لیتا ہے اور اوپر بیان کردہ اسی اسپاٹ مارکیٹ پر ایک مماثل کارڈ کرائے پر لیتا ہے۔ یہی وجہ ہے کہ بتائی گئی لاگت ایک رینج ہے، قیمت نہیں۔ GR00T اور Pi0.5 یہاں صرف کلاؤڈ پر چلتے ہیں کیونکہ ان کی 40 GB اور 70 GB کی کم از کم ضرورت ہے۔ SmolVLA اور ACT آپ کے اپنے 24 GB کارڈ پر مقامی طور پر بھی چلتے ہیں، جہاں کلاؤڈ کی لاگت صفر ہے اور بجلی آپ کا مسئلہ ہے۔

AY-Robots کا قیمتوں کا صفحہ جو ایک ٹریننگ رن اور پلیٹ فارم تک رسائی کی لاگت کو دکھا رہا ہے
قیمتوں کا صفحہ۔ فی رن کے اعداد و شمار مقررہ فہرست قیمت کے بجائے اسپاٹ مارکیٹ کو ٹریک کرتے ہیں۔

ایک سیٹنگ پر توجہ کی ضرورت ہے۔ گریڈینٹ ایکومولیشن GR00T کے دونوں ویرینٹس پر حقیقی معنوں میں لاگو ہوتی ہے، لہذا اسے بڑھانے سے اسی کارڈ پر ایک بڑا مؤثر بیچ حاصل ہوتا ہے۔ Pi0.5 اور SmolVLA کے لیے یہ بالکل لاگو نہیں ہوتی: lerobot 0.5.1 کی ٹریننگ کنفگ میں گریڈینٹ ایکومولیشن کا کوئی آپشن نہیں ہے، لہذا فیلڈ کو 16 پر سیٹ کرنے سے نہ کچھ خرچ ہوتا ہے اور نہ کچھ حاصل ہوتا ہے۔ اگر کوئی قطار میں لگی ہوئی جاب کبھی شروع نہیں ہوتی، قطار میں پھنسی ہوئی جاب کا صفحہ یہ بتاتا ہے کہ کیا چیک کرنا ہے؛ اگر رن شروع ہونے سے پہلے ڈیٹا سیٹ مسترد ہو جاتا ہے، تو یہ تقریباً ہمیشہ v3.0 فارمیٹ کا مسئلہ ہوتا ہے۔

وہ حد جسے یہ پلیٹ فارم حل نہیں کرتا: لیٹنسی

ایک کرائے کا GPU جو عوامی انٹرنیٹ پر آپ کی پالیسی کو سروس فراہم کرتا ہے، کنٹرول لوپ میں اضافی راؤنڈ ٹرپس کا اضافہ کرتا ہے جو پہلے ہی فی ایکشن سٹیپ 20 سے 485 ملی سیکنڈ ہے۔ سست پک اینڈ پلیس کے لیے ٹھیک ہے، لیکن تیز رد عمل والی حرکت کے لیے نہیں۔ کلاؤڈ انفرنس ایک چیک پوائنٹ کا اچھی طرح جائزہ لیتا ہے اور پروڈکشن مینیپولیشن کو بری طرح چلاتا ہے: اگر کام کو رفتار کی ضرورت ہو تو کمپیوٹ کو سرووز کے ساتھ بیٹھنا پڑتا ہے، اور یہ ایک ایسی لاگت ہے جسے یہ مضمون ختم نہیں کر سکتا۔ دیکھیں انفرنس لیٹنسی۔

پہلی کارآمد پالیسی کے لیے ایک تیار شدہ بجٹ

تمام چار لائنیں ایک ساتھ، بالکل شروع سے۔ GPU کا کل تخمینہ 3 سے 5 رن پر مبنی ہے: پہلا پائپ لائن کے کام کرنے کو ثابت کرتا ہے، دوسرا ڈیٹا کے مسئلے کو ظاہر کرتا ہے، تیسرا یا چوتھا وہ ہے جسے آپ برقرار رکھتے ہیں۔

آئٹمکم خرچ راستہآرام دہ راستہ
Armصرف SO-100 فالوور، BOM میں 121.94 USDلیڈر پلس فالوور، BOM میں 229.88 USD
ModelSmolVLA یا ACT، 24 GB ٹیرGR00T N1.7، A100 80 GB یا H100 ٹیر
Episodes recorded30، SmolVLA کا کم از کم50 to 100
Human time to recordتقریباً 1 گھنٹہ 12 منٹ2 سے 4 گھنٹے
Cost of one run1 to 3 USD4 to 12 USD
Runs before it works3 to 53 to 5
Total GPU spend3 to 15 USD12 to 60 USD
Largest line on the billآرم، پھر آپ کا وقتآرم، پھر آپ کا وقت

اس روبوٹ کے سائز پر بھی یہی پیٹرن برقرار ہے: کمپیوٹ ایک معمولی غلطی ہے، ہارڈویئر ایک حقیقی یک وقتی لاگت ہے، انسانی گھنٹے بار بار ہونے والا خرچ ہیں۔ کچھ بھی خریدنے سے پہلے تربیتی حصے کو جانچنے کے لیے، آپ کو ماڈلز کا موازنہ کرنے اور بغیر کسی بازو کے GPU کرائے پر لینے کی اجازت دیتے ہیں، اور ایک فزیکل SO-100 ہے جسے آپ بغیر سائن اپ کے براؤزر میں چلا سکتے ہیں۔ پوری پائپ لائن کو شروع سے آخر تک دیکھنے کے لیے، سیٹ اپ کا احاطہ کرتی ہے، اور تربیت، اور مختصر ورژن ہے۔

The AY-Robots training matrix with five policies as rows and four robot arms as columns, every cell linking to a specific training guide
The /train matrix: row for your budget, column for your arm, cell for the guide with that pairing's defaults and cost.
ایک VLA فائن ٹیوننگ رن کی مکمل لاگت کیا ہے؟

A100 80 GB یا H100 ٹیر پر GR00T N1.7، GR00T N1.5 یا Pi0.5 کے لیے تقریباً 4 سے 12 USD (1.20 سے 2.00 USD فی گھنٹہ کے حساب سے 3 سے 6 گھنٹے)، اور RTX 4090 ٹیر پر SmolVLA یا ACT کے لیے تقریباً 1 سے 3 USD (0.30 سے 0.60 USD فی گھنٹہ کے حساب سے 2 سے 5 گھنٹے)۔ کارڈ خود کرایہ پر لینے کی صورت میں سیٹ اپ کا وقت شامل کرنے کے بعد لاگت اسی حد میں رہتی ہے، کیونکہ اس پر ٹریننگ کی شرح سے بل آتا ہے۔

کیا A100 80 GB کے مقابلے میں H100 کے لیے ادائیگی کرنا فائدہ مند ہے؟

ایک SO-100 پالیسی کے لیے، عام طور پر نہیں۔ دونوں GR00T اور Pi0.5 کو درکار میموری فلور کو صاف کرتے ہیں، اور 23 اگست 2026 کی ریڈنگ کے مطابق ایک مکمل A100 80 GB کی قیمت 0.44 USD فی گھنٹہ تھی جبکہ H100 80 GB کی 1.34 USD تھی۔ H100 جلد ختم ہو جاتا ہے، لہذا شرح کا کچھ حصہ کم گھنٹوں کی صورت میں واپس آ جاتا ہے، لیکن اس چھوٹے رن کے لیے کل لاگت اب بھی زیادہ ہے۔ H100 کے لیے اصل دلیل دستیابی ہے: اس مارکیٹ میں پانچ سنگل H100 80 GB آفرز بمقابلہ دو A100 80 GB، اور جس کارڈ کو آپ کرایہ پر نہیں لے سکتے اس کی کوئی قیمت نہیں۔

ایک پالیسی کے اصل میں کام کرنے سے پہلے کتنے رن درکار ہوتے ہیں؟

تین سے پانچ کا منصوبہ بنائیں۔ پہلا یہ ثابت کرتا ہے کہ پائپ لائن صحیح طریقے سے جڑی ہوئی ہے۔ دوسرا عام طور پر ڈیٹا سیٹ کے مسئلے کو ظاہر کرتا ہے جیسے کہ کیمرہ سٹریم جو درمیان میں بند ہو گئی ہو۔ تیسرا یا چوتھا وہ ہوتا ہے جسے آپ رکھتے ہیں۔

کیا میں کرایہ پر لینے کے بجائے اپنے GPU پر SmolVLA یا ACT کو تربیت دے سکتا ہوں؟

جی ہاں۔ دونوں AY-Robots پر مقامی طور پر سپورٹ کیے جاتے ہیں اور دونوں 24 GB میں آسانی سے فٹ ہو جاتے ہیں؛ اصل ACT پیپر نے اپنے 80M ماڈل کو تقریباً 5 گھنٹے میں 11 GB RTX 2080 Ti پر تربیت دی تھی۔ GR00T اور Pi0.5 یہاں صرف کلاؤڈ پر ہیں کیونکہ وینڈرز کے دستاویزی فائن ٹیوننگ فلورز 40 GB اور 70 GB ہیں، اور مارکیٹ میں سب سے بڑا کنزیومر کارڈ 32 GB RTX 5090 ہے۔

ماڈلز کے درمیان مراحل کی ایک ہی تعداد کی لاگت مختلف کیوں ہوتی ہے؟

مراحل پالیسیوں کے درمیان موازنہ کے قابل نہیں ہیں۔ ACT 24 GB کارڈ پر بیچ 8 پر 100,000 مراحل پر ڈیفالٹ کرتا ہے؛ GR00T N1.5 80 GB کارڈ پر گریڈینٹ ایکومولیشن 16 کے ساتھ بیچ 1 پر 2,000 مراحل پر ڈیفالٹ کرتا ہے۔ بل گھنٹوں کو اس کارڈ کی شرح سے ضرب دے کر آتا ہے جس پر میموری فٹ پرنٹ آپ کو مجبور کرتا ہے، نہ کہ مراحل کی گنتی سے۔

شروع کرنے سے پہلے دیکھیں کہ آپ کے رن پر کتنی لاگت آئے گی

پانچوں پالیسیوں میں سے ہر ایک اپنے GPU ٹیر، رن ٹائم اور فی رن قیمت کی فہرست دیتا ہے، اور ٹریننگ بیک اینڈ اسی سپاٹ مارکیٹ پر کارڈ کرایہ پر لیتا ہے جہاں یہ اعداد و شمار ماپے گئے تھے۔

قیمت چیک کریں

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started