
حقیقی سپاٹ مارکیٹ GPU کی قیمتیں، پانچوں پالیسیوں میں سے ہر ایک کتنی دیر چلتی ہے، بازو اور مظاہروں کی لاگت کیا ہے، اور وہ چار جگہیں جہاں پیسہ خاموشی سے غائب ہو جاتا ہے۔
مختصر ورژن
- •A100 80 GB یا H100 ٹیر پر ایک رن میں 3 سے 6 گھنٹے لگتے ہیں اور اس پر تقریباً 4 سے 12 امریکی ڈالر لاگت آتی ہے۔ RTX 4090 ٹیر پر یہ 2 سے 5 گھنٹے اور تقریباً 1 سے 3 امریکی ڈالر ہے۔
- •vast.ai پر 23 اگست 2026 کو 13:44 UTC پر پیمائش کی گئی: ایک مکمل RTX 4090 آن ڈیمانڈ 0.13 سے 0.38 امریکی ڈالر فی گھنٹہ، ایک A100 80 GB 0.44 سے 0.67، ایک H100 80 GB 1.34 سے 2.34۔ مکمل 80 GB کارڈز نایاب ہیں، بالترتیب دو اور پانچ سنگل کارڈ آفرز۔
- •GPU سب سے سستی لائن ہے۔ SO-ARM100 بل آف میٹریلز ایک لیڈر پلس فالوور جوڑے کو 229.88 امریکی ڈالر پر رکھتا ہے، جو 24 GB ٹیر پر 77 سے 230 رن کے برابر ہے۔
- •ایک شخص کے 50 ایپی سوڈز ریکارڈ کرنے کے دو گھنٹے ان ایپی سوڈز کو فیڈ کرنے والے ٹریننگ رن سے زیادہ مہنگے ہیں۔
- •پیسہ چار جگہوں پر غائب ہوتا ہے: خراب ڈیٹا پر رن، 3B ماڈلز ان کاموں پر جنہیں 80M پالیسی سنبھالتی ہے، GPUs جنہیں کسی نے تباہ نہیں کیا، اور ایسے نتائج کے دوبارہ رن جنہیں آپ محفوظ رکھنے میں ناکام رہے۔
- •AY-Robots کارڈ کا سائز ماڈل کی VRAM کی ضرورت کے مطابق کرتا ہے اور اسے اسی اسپاٹ مارکیٹ پر کرائے پر دیتا ہے، لہذا رن کی لاگت مارکیٹ کی لاگت ہے۔
بل میں چار لائنیں ہیں، اور GPU سب سے چھوٹی ہے۔
جب لوگ پوچھتے ہیں کہ ایک ویژن-لینگویج-ایکشن ماڈل کو SO-100 کے لیے فائن ٹیون کرنے میں کیا لاگت آتی ہے، تو ان کا تقریباً ہمیشہ مطلب GPU کا کرایہ ہوتا ہے۔ یہ وہ نمبر ہے جو کارڈ پر چارج کے طور پر ظاہر ہوتا ہے، لہذا یہ وہی ہے جو حقیقی محسوس ہوتا ہے۔ یہ بھی، ایک بڑے فرق سے، ان چار نمبروں میں سب سے چھوٹا ہے جو یہ فیصلہ کرتے ہیں کہ ایک فعال پالیسی دراصل آپ کو کیا لاگت آتی ہے۔
| لائن | یہ کیا ہے | ایک فعال پالیسی کے لیے عام سائز |
|---|---|---|
| GPU وقت | رن کے لیے کارڈ کرائے پر لینا | فی رن 1 سے 12 امریکی ڈالر، اور آپ 3 سے 5 رن کریں گے |
| روبوٹ | سرووز، پرنٹ شدہ فریم، کیمرے، کیبلز، پاور | ایک بار، فی بازو 110 سے 500 یورو |
| انسانی گھنٹے | ڈیمو ریکارڈ کرنے کے لیے بازو چلانے والا شخص | فی ڈیٹا سیٹ 1 سے 4 گھنٹے، فی ٹاسک دہرایا جائے گا |
| ضیاع | خراب ڈیٹا، بڑے ماڈلز، بھولی ہوئی پوڈز | لامحدود، اور واحد لائن جسے آپ کنٹرول کرتے ہیں |
ذیل میں تربیت کے اوقات پانچ ماڈلز کے اپنے پیپرز اور ریپوزٹریز سے لیے گئے ہیں، ہارڈ ویئر کی لاگت شائع شدہ بل آف میٹریلز سے، پلیٹ فارم کے اعداد و شمار AY-Robots پالیسی کیٹلاگ اور قیمتوں کا صفحہ۔ جہاں پلیٹ فارم مدد نہیں کرتا، یہ مضمون اس کا ذکر کرتا ہے۔
اسپاٹ مارکیٹ میں ایک GPU گھنٹے کی اصل لاگت کیا ہے
A100 گھنٹے کی کوئی ایک قیمت نہیں ہے۔ vast.ai جیسے مارکیٹ پلیس پر ہر میزبان اپنی شرح مقرر کرتا ہے، اور تربیتی رن جو آپ لانچ کرتے ہیں وہ اس وقت جو بھی مشین سستی اور خالی ہو اس پر اترتا ہے۔ ایماندارانہ جواب ایک تقسیم ہے۔ یہ رہا، 23 اگست 2026 کو 13:44 UTC پر ماپا گیا: سنگل فل کارڈز، آن ڈیمانڈ، حقیقی VRAM کے ذریعے فلٹر شدہ۔
| کارڈ | vast.ai آن ڈیمانڈ USD/h (کم / اوسط / زیادہ) | فل کارڈ آفرز | vast.ai بِڈ فلور | RunPod کمیونٹی / سیکیور | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
vast.ai پبلک بنڈل API سے ایک مکمل GPU (gpu_frac == 1.0) کے لیے آن ڈیمانڈ پیشکشیں، جس کے لیے کسی اکاؤنٹ کی ضرورت نہیں، gpu_ram پر فلٹر کی گئی ہیں تاکہ صرف حقیقی 80 GB کارڈز 80 GB کی قطاروں میں آئیں۔ یہ فلٹر اہم ہے: اس مطالعے میں تمام تین سنگل کارڈ A100 SXM4 پیشکشیں 40 GB کے حصے تھے، جیسا کہ چار A100 PCIE پیشکشوں میں سے دو تھے، لہذا انہیں ایک "A100" قطار میں جمع کرنے سے یہاں رپورٹ کی گئی قیمت آدھی ہو جاتی۔ Hugging Face کالم دو مصنوعات کو ملاتا ہے: 2.50 USD/h Nvidia A100 - large Spaces ہارڈویئر ہے اور 4.50 USD/h Inference Endpoints کے تحت ایک واحد H100 80 GB ہے، جو Spaces پیش نہیں کرتا۔ میڈین کو اشارے کے طور پر لیں: A100 80 GB کی قطار دو پیشکشوں پر مبنی ہے اور H100 کی قطار پانچ پر، اور 36 سیکنڈ بعد کی گئی ایک جیسی استفسار نے 4090 کی مختلف تعداد اور پانچ میں سے تین قطاروں پر مختلف سب سے زیادہ قیمت واپس کی۔ RunPod کی فہرست کی قیمتیں منصوبہ بندی کے لیے زیادہ مستحکم اعداد ہیں۔
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
3B ماڈلز سستے کارڈ کو کیوں استعمال نہیں کر سکتے
ایک 4090 گھنٹہ اور ایک H100 80 GB گھنٹہ اوپر دیے گئے میڈینز پر تقریباً چھ گنا مختلف ہیں۔ جو چیز آپ کو مہنگے کارڈ پر مجبور کرتی ہے وہ رفتار نہیں، بلکہ میموری ہے۔ openpi ایک مکمل Pi0.5 کے لیے کم از کم ضرورت مقرر کرتا ہے فائن ٹیون 70 GB پر، اور NVIDIA GR00T کے لیے 40 GB یا اس سے زیادہ کی سفارش کرتا ہے۔ نوٹ کریں کہ GR00T نمبر کیا نہیں ہے۔ اس کی فائن ٹیون کنفیگریشن زبان کے ماڈل اور بصری انکوڈر کو بطور ڈیفالٹ منجمد کر دیتی ہے (tune_llm اور tune_visual False ہیں، جبکہ پروجیکٹر اور ڈفیوژن ہیڈ True ہیں)، یہی وجہ ہے کہ کیٹلاگ میں 3 B میں سے تقریباً 40 M تربیت یافتہ پیرامیٹرز درج ہیں۔ 40 GB 3 B وزن کے لیے آپٹیمائزر کی حالت نہیں ہے، یہ منجمد بیک بون اور ایکٹیویشنز ہیں۔ کم دائرہ کار والی اقسام کم ہوتی ہیں: openpi کا LoRA پاتھ 22.5 GB چاہتا ہے اور 4090 کا نام لیتا ہے، اور NVIDIA کا Isaac Lab Arena ورک فلو GR00T پوسٹ ٹریننگ کے لیے 24 GB سنگل-GPU آپشن درج کرتا ہے۔ پلیٹ فارم ہر وینڈر کی طرف سے شائع کردہ کنفیگریشن کے لیے کم از کم ضروریات پر مبنی ہے۔ pi0 فلو-میچنگ کی تحریر وضاحت کرتی ہے کہ وہ فلو-میچنگ فوٹ پرنٹ کہاں سے آتا ہے۔
| کام | اپ اسٹریم پروجیکٹ کے لیے درکار میموری | ماخذ |
|---|---|---|
| pi0 / pi0.5 انفرنس | more than 8 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 LoRA فائن ٹیون | more than 22.5 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 مکمل فائن ٹیون | more than 70 GB, example A100 80 GB or H100 | openpi |
| GR00T N1.7 انفرنس | 1 GPU with 16 GB or more | Isaac-GR00T |
| GR00T N1.7 فائن ٹیون | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| GR00T فائن ٹیون، جو یہ تربیت دیتا ہے | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| GR00T پوسٹ ٹریننگ، کم شدہ | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| SmolVLA فائن ٹیون | single A100 for the reference 20,000-step run | lerobot docs |
| ACT ٹریننگ | a single 11 GB RTX 2080 Ti | ACT paper |
یہ جدول اس بات کی وضاحت کرتا ہے کہ پلیٹ فارم پانچ ماڈلز کو دو درجوں میں کیوں تقسیم کرتا ہے۔ GR00T N1.7، GR00T N1.5 اور Pi0.5 A100 80 GB یا H100 پر چلتے ہیں کیونکہ وینڈرز یہی مطالبہ کرتے ہیں۔ SmolVLA اور ACT RTX 4090 یا کسی بھی 24 GB کارڈ پر چلتے ہیں کیونکہ یہ واقعی کافی ہے۔
ایک GR00T یا Pi0.5 کا 24 GB کارڈ پر چلنا پہلے سیکنڈ میں ناکام نہیں ہوتا۔ یہ بیس چیک پوائنٹ ڈاؤن لوڈ کرتا ہے، ڈیٹا سیٹ انڈیکس بناتا ہے، پہلا فارورڈ پاس شروع کرتا ہے اور چند سو مراحل کے بعد CUDA آؤٹ آف میموری ایرر کے ساتھ بند ہو جاتا ہے۔ آپ نے ڈاؤن لوڈ اور سیٹ اپ کے لیے ادائیگی کی اور کچھ حاصل نہیں کیا۔ حل: ٹریننگ کے دوران میموری کی کمی۔
پانچ ماڈلز میں سے ہر ایک دراصل کتنی دیر تک چلتا ہے
رن ٹائم لاگت کا دوسرا نصف ہے: اگر کام 40 منٹ کا ہو تو 2.00 امریکی ڈالر فی گھنٹہ غیر متعلقہ ہے اور اگر 40 گھنٹے کا ہو تو تباہ کن ہے۔ یہ وہ ڈیفالٹس ہیں جو AY-Robots دراصل ٹرینر کو بھیجتا ہے، ہر ٹیر کے لیے رن ونڈو اور لاگت کے ساتھ۔
| پالیسی | GPU ٹیر | ڈیفالٹ زیادہ سے زیادہ مراحل | ڈیفالٹ بیچ (گریڈ ایکوم) | رن ونڈو | فی رن لاگت |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

یہ رن ونڈوز اپ اسٹریم سے کہاں سے آتی ہیں؟
- SmolVLA: lerobot کی دستاویزات میں بتایا گیا ہے کہ 20,000 steps ایک A100 پر تقریباً 4 hours لیتے ہیں۔ پلیٹ فارم وہی 20,000 steps سستے 24 GB tier پر چلاتا ہے، اس لیے 4 hours کی ایک فلیٹ مدت کے بجائے ایک ونڈو ہے۔
- ACT: اصل ALOHA پیپر میں ایک 80M-parameter ماڈل کے لیے ایک 11 GB RTX 2080 Ti پر تقریباً 5 hours کا وقت بتایا گیا ہے۔ ایک 4090 کئی نسلوں بعد کا ہے لیکن پلیٹ فارم 100,000 steps کا بجٹ رکھتا ہے، لہذا ونڈو اسی جگہ پر آتی ہے۔
- GR00T: NVIDIA کا N1.6 جنریشن کے لیے حوالہ ورک فلو آٹھ L40S کارڈز پر batch 24 پر 20,000 steps کے لیے تقریباً 4 to 8 hours، اور ایک Ada 6000 پر batch 16 پر 30,000 steps کے لیے 2 to 3 hours کا وقت بتاتا ہے۔ چند گھنٹوں میں ایک 3B VLA کی سنگل کارڈ فائن ٹیوننگ معمول کی بات ہے، نہ کہ پرامید۔
- Pi0.5: openpi کوئی وال کلاک فگر شائع نہیں کرتا، لیکن یہ مکمل فائن ٹیون کے لیے 70 GB کی حد شائع کرتا ہے، جو کارڈ اور اس طرح شرح کو متعین کرتا ہے۔
اس تعداد پر غور کرنا ضروری ہے جس کی آپ ادائیگی نہیں کر رہے۔ GR00T N1 پیپر کے مطابق، 2.2B ماڈل کو پری ٹرین کرنے کے لیے تقریباً 50,000 H100 GPU hours درکار ہوتے ہیں، جو 1024 GPUs تک کے کلسٹر پر، 16,384 کے پری ٹریننگ بیچ سائز پر 200,000 gradient steps کے لیے استعمال ہوتے ہیں۔ اوپر ماپی گئی 1.34 to 2.34 USD فی گھنٹہ کی شرح سے، یہ 67,000 to 117,000 USD کی کرائے کی کمپیوٹ کے برابر ہے۔ SmolVLA پیپر اپنے پروجیکٹ کو 481 کمیونٹی ڈیٹا سیٹس، 22.9K episodes اور 10.6M frames پر تقریباً 30,000 GPU hours پر رکھتا ہے۔ آپ یہ سب کچھ ایک ڈاؤن لوڈ کی قیمت پر حاصل کرتے ہیں؛ آپ کے 8 USD آخری 20,000 steps خریدتے ہیں۔ VLAs اس طرح کیوں بنائے جاتے ہیں اس تقسیم کا احاطہ کرتا ہے۔
بازو: ایک بار کا خرچ جو GPU بل کو بونا بنا دیتا ہے
ایک تربیتی رن کی لاگت دوپہر کے کھانے سے کم ہے۔ روبوٹ کی نہیں۔ یہی وجہ ہے کہ SO-100 اہم ہے: یہ سب سے سستا بازو ہے جسے پوری نقلی سیکھنے ٹول چین درحقیقت سپورٹ کرتا ہے۔
| بازو | سرووز | وولٹیج | پرزوں کی لاگت | AY-Robots پر سپورٹ |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | مکمل، حوالہ بازو |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | مکمل |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | ہم آہنگ |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | ہم آہنگ |
SO-ARM100 ریپوزٹری میں اپ اسٹریم بل آف میٹریلز زیادہ تفصیلی ہے اور آپ کے علاقے کے لحاظ سے جانچنے کے قابل ہے: اس کی دو بازوؤں کے لیے پرزے فہرست ایک لیڈر پلس فالوور سیٹ اپ کے لیے 229.88 USD یا 226.30 EUR بنتی ہے، اور اس کی ایک فالوور بازو کے لیے پرزے فہرست 121.94 USD یا 124.30 EUR بنتی ہے۔ چھ STS3215 سرووز، ہر ایک 13.89 USD پر، اس 121.94 میں سے 83.34 کے ہیں، لہذا سرووز ہی بازو ہیں۔ 1 سے 3 USD فی SmolVLA یا ACT رن پر، بازوؤں کا ایک جوڑا 77 سے 230 تربیتی رن کے برابر ہے۔ اگر آپ اب بھی انتخاب کر رہے ہیں، تو SO-100 بمقابلہ SO-101 وہ موازنہ ہے جو اہمیت رکھتا ہے، کیونکہ دونوں اتنے قریب ہیں کہ فیصلہ صلاحیت کے بجائے دستیابی کے بارے میں ہے۔
STS3215 7.4 V اور 12 V ویرینٹ میں دستیاب ہے۔ ریپوزٹری نوٹ کرتی ہے کہ 12 V والے حصے کو 5 V کی بجائے 12 V 5 A سپلائی کی بھی ضرورت ہوتی ہے، لہذا دونوں قابل تبادلہ نہیں ہیں۔ 7.4 V سرووز میں 12 V فیڈ کرنے سے وہ تباہ ہو جاتے ہیں، اور چھ سرووز ایک فالوور بازو کے پرزوں کی لاگت کا دو تہائی ہیں۔ پہلی بار پاور آن کرنے سے پہلے ہر سروو پر لیبل چیک کریں۔ اگر سرووز پہلے ہی عجیب و غریب برتاؤ کر رہے ہیں: سروو جواب نہیں دے رہا، بازو جھٹکے لیتا ہے پھر ڈھیلا پڑ جاتا ہے۔
انسانی گھنٹے: وہ لائن جو کوئی اسپریڈشیٹ میں نہیں ڈالتا
یہ وہ تعداد ہے جو لاگت کی بحث کو الٹ دیتی ہے۔ مظاہروں کو ریکارڈ کرنا ایک شخص کا روبوٹ بازو کو حقیقی وقت میں، ایک وقت میں ایک ایپی سوڈ حرکت دینا ہے۔ اس میں کوئی بیچنگ نہیں ہے اور نہ ہی اسے فی سیکنڈ کرائے پر لیا جا سکتا ہے۔ The LeRobot dataset ریکارڈر ڈیفالٹس کے ساتھ آتا ہے جو حساب کتاب کو آسان بناتے ہیں، یہ تینوں کی تصدیق DatasetRecordConfig: 60 سیکنڈ فی ایپی سوڈ، منظر کو ری سیٹ کرنے کے لیے 60 سیکنڈ، 50 ایپی سوڈز۔ نیچے دی گئی رقم کا کالم کسی کے ایک گھنٹے کے وقت کے لیے 15 USD فرض کرتا ہے، جو کہ ایک مفروضہ ہے نہ کہ پلیٹ فارم نمبر۔ اپنی شرح تبدیل کریں؛ تناسب ہی اصل بات ہے۔
- 1ڈیٹا سیٹ کو ان ڈیفالٹس کے ساتھ ریکارڈ کریں جن کے لیے آپ کو اصل میں بل کیا جائے گا
یہ lerobot 0.6.1 ہے، جو 3 اگست 2026 تک PyPI پر دستیاب ورژن ہے۔ CLI کی شکل نوٹ کریں: ریکارڈنگ پرانے
python -m lerobot.scripts.recordماڈیول پاتھ کے بجائےlerobot-recordکنسول انٹری پوائنٹ (lerobot.scripts.lerobot_record) کے ذریعے چلتی ہے۔ AY-Robots 0.5.1 کو ہدف بناتا ہے، اور 0.5.1 وہیل وہیlerobot-recordاورlerobot-trainانٹری پوائنٹس کا اعلان کرتا ہے، لہذا نیچے دی گئی شکل دونوں میں مستحکم ہے۔ تین ٹائمنگ فلیگز اپ اسٹریم ڈیفالٹس ہیں، لہذا یہ وہی کمانڈ بھی ہے جسے اگلی جدول میں حسابات فرض کرتے ہیں۔bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2ایک بھی GPU منٹ کرائے پر لینے سے پہلے جو کچھ آپ نے ریکارڈ کیا ہے اسے دیکھیں
ڈیٹا سیٹ کا معائنہ کرنے پر فی گھنٹہ صفر USD لاگت آتی ہے۔ لاس کرو سے وہی مسئلہ دریافت کرنے پر H100 ٹیر پر فی گھنٹہ 2.00 USD لاگت آتی ہے اور آپ کو چار گھنٹے بعد پتہ چلتا ہے۔ ڈیٹا سیٹ کو پش کریں اور اسے LeRobot ویور میں اسکرَب کریں، یا AY-Robots ڈیٹا سیٹ ڈائریکٹری کو براؤز کریں۔
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3تربیت دیں، اور یقینی بنائیں کہ چیک پوائنٹ پوڈ سے زیادہ دیر تک رہے
کرائے پر لی گئی مشین تعریف کے لحاظ سے عارضی ہوتی ہے، لہذا رن کے دوران چیک پوائنٹس کو کسی پائیدار جگہ پر لکھیں۔ دو فلیگز یہ فیصلہ کرتے ہیں کہ آپ نے جو ادائیگی کی ہے اسے برقرار رکھتے ہیں یا نہیں۔
--save_freq20,000 سٹیپس پر ڈیفالٹ ہوتا ہے، لہذا ایک ڈیفالٹ 20,000 سٹیپ SmolVLA رن اپنا پہلا چیک پوائنٹ اس وقت لکھتا ہے جب رن پہلے ہی ختم ہو چکا ہوتا ہے؛ اسے کسی بھی رکاوٹ والی چیز کو کرائے پر لینے سے پہلے کم کریں۔--save_checkpoint_to_hubکو--policy.repo_idکی ضرورت ہوتی ہے اور lerobot 0.5.1 میں موجود نہیں ہے، لہذا اس ورژن پر آپ آؤٹ پٹ ڈائریکٹری کو مشین سے خود کاپی کرتے ہیں۔ نیچے دی گئی بیچ سائز اپ اسٹریم ڈاک کی مثال ہے؛ AY-Robots فارم SmolVLA کے لیے 2 بھیجتا ہے اور چیک پوائنٹس ظاہر ہونے پر آبجیکٹ سٹوریج میں لکھتا ہے۔bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| ایپی سوڈز | 60 سیکنڈ پر ریکارڈنگ | 60 سیکنڈ پر ری سیٹ کرنا | وال کلاک | پلس 20 فیصد دوبارہ ریکارڈز | 15 USD فی انسانی گھنٹہ پر |
|---|---|---|---|---|---|
| 30، SmolVLA کا کم از کم | 30 منٹ | 30 منٹ | 1 گھنٹہ 00 منٹ | 1 گھنٹہ 12 منٹ | تقریباً 18 USD |
| 50، دیگر چار کم از کم | 50 منٹ | 50 منٹ | 1 گھنٹہ 40 منٹ | 2 گھنٹے 00 منٹ | تقریباً 30 USD |
| 100، ایک آرام دہ ڈیٹا سیٹ | 100 منٹ | 100 منٹ | 3 گھنٹے 20 منٹ | 4 گھنٹے 00 منٹ | تقریباً 60 USD |
دائیں ہاتھ کے کالم کا موازنہ 1 سے 12 USD کے رن کے اخراجات سے کریں۔ اس مفروضہ شرح پر، 50 اقساط کے ڈیٹا سیٹ کو ریکارڈ کرنے میں تربیت دینے سے دو سے سات گنا زیادہ لاگت آتی ہے، کیلیبریشن، کیمرہ سیٹ اپ اور ان اقساط کو ہٹانے سے پہلے جنہیں آپ ضائع کر دیتے ہیں۔ یہی وجہ ہے کہ کی براہ راست مالی اہمیت ہے۔ LeRobot گائیڈ کم از کم 50 اقساط تجویز کرتا ہے جس میں ہر آبجیکٹ لوکیشن کے لیے 10 اقساط ہوں؛ SmolVLA دستاویزات بتاتی ہیں کہ اسی کام کا 25 اقساط کا ورژن کافی نہیں تھا۔
پیسہ دراصل کہاں غائب ہوتا ہے
1. ایسے ڈیٹا پر چلنے والے رن جو کبھی کام نہیں کرنے والے تھے
دو تبدیل شدہ کیمرہ سٹریمز والے ڈیٹا سیٹ پر 20,000 قدم کا GR00T رن اتنا ہی خرچ کرتا ہے جتنا ایک صاف ڈیٹا سیٹ پر، اتنا ہی وقت لیتا ہے، اور ایک ایسا لاس کرو پیدا کرتا ہے جو ٹھیک لگتا ہے۔ ناکامی بازو پر گھنٹوں بعد ظاہر ہوتی ہے۔ کی بلنگ فی گھنٹہ ہوتی ہے اور تشخیص کی بلنگ دنوں میں ہوتی ہے۔ دو علامات جو یاد رکھنے کے قابل ہیں: کا عام طور پر مطلب یہ ہے کہ مشاہدات وہ معلومات نہیں رکھتے جو کام کے لیے درکار ہیں، اور کا مطلب ہے کہ ڈیٹا سیٹ میں آپ کی سوچ سے کم تغیر تھا۔
2. فکسڈ کیمرہ ٹاسک کے لیے فاؤنڈیشن ماڈل کی قیمتیں ادا کرنا
ACT تقریباً 80M پیرامیٹرز پر مشتمل ہے اور اسے ایک ٹاسک کے 50 مظاہروں پر شروع سے تربیت دینے کے لیے ڈیزائن کیا گیا تھا۔ GR00T N1.7 تقریباً 3B ہے جس میں ایک پری ٹرینڈ بیک بون ہے۔ ایک بولٹڈ کیمرہ، ایک فکسڈ ٹیبل اور ایک آبجیکٹ کے لیے، 80M ماڈل اکثر کام کرتا ہے، 152 ms کے بجائے تقریباً 20 ms فی ایکشن سٹیپ پر چلتا ہے، اور 4 سے 12 USD کے بجائے 1 سے 3 USD فی رن لاگت آتی ہے۔ مہنگے ماڈل پر 12 USD خرچ کرنے سے پہلے یہ معلوم کرنے کے لیے 3 USD خرچ کریں کہ کیا سستا ماڈل کام کرتا ہے۔ ACT بمقابلہ SmolVLA اور GR00T N1.7 بمقابلہ Pi0.5 دکھاتے ہیں کہ ہر ایک کہاں صحیح جواب ہونا بند کر دیتا ہے؛ ماڈل ایرینا میں 85 ماڈلز اور 332 بینچ مارک نتائج ہیں۔
3. وہ GPU جسے آپ بھول گئے
روکنے کے لیے سب سے سستی غلطی اور کرنے کے لیے سب سے عام غلطی۔ جمعہ کو کسی چیز کو ڈیبگ کرنے کے لیے شروع کی گئی ایک انسٹنس ہفتے کے آخر میں ایک حقیقی رن کی طرح ہی بل ہوتی ہے۔
| کارڈ | سنیپ شاٹ میں اوسط شرح | 24 گھنٹے بیکار | 7 دن بیکار | اس کی قیمت |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | تقریباً 27 SmolVLA یا ACT رنز 2 USD میں |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | تقریباً 12 GR00T رنز 8 USD میں |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | تقریباً 38 GR00T رنز 8 USD میں |
AY-Robots پر، یہ ناکامی انفرنس کے لیے ڈیزائن کی گئی ہے: انفرنس API کے ذریعے فراہم کردہ پوڈز ایک بیکار واچ ڈاگ رکھتے ہیں اور ایک بیکار مدت کے بعد خود کو تباہ کر دیتے ہیں۔ اگر آپ خود کارڈ کرایہ پر لیتے ہیں، تو وہ واچ ڈاگ آپ کا کیلنڈر یاد دہانی ہے۔
4. ایک ہی جواب کے لیے دو بار ادائیگی
GR00T کا فائن ٹیوننگ انٹری پوائنٹ ایک ٹائرو CLI ہے جو کوئی سیڈ ظاہر نہیں کرتا۔ یہ پلیٹ فارم کی کوئی حد نہیں ہے، یہ اپ اسٹریم ٹول ہے: gr00t/configs/finetune_config.py میں کوئی سیڈ فیلڈ نہیں ہے، اور ریپوزٹری کی اپنی تربیتی تجاویز خبردار کرتی ہیں کہ رنز 5 سے 6 فیصد تک مختلف ہوتے ہیں کیونکہ امیج آگمینٹیشنز غیر حتمی ہیں۔ lerobot 0.5.1 اور 0.6.1 دونوں میں سیڈ 1000 پر ڈیفالٹ کرتا ہے، لہذا ACT، SmolVLA اور Pi0.5 رنز کو کم از کم اسی انیشیلائزیشن اور ڈیٹا آرڈر سے دوبارہ چلایا جا سکتا ہے۔ یہ GPU پر بٹ-آئیڈنٹیکل ویٹس کا وعدہ نہیں ہے، لیکن یہ دوبارہ چلانے اور ایک نئے تجربے کے درمیان فرق ہے۔ اگر GR00T رن ایک ایسی پالیسی تیار کرتا ہے جو کام کرتی ہے اور آپ نے چیک پوائنٹ نہیں رکھا، تو آپ ایک ایسے نتیجے کے لیے پوری قیمت ادا کرتے ہیں جو اس فرق سے زیادہ مختلف ہو سکتا ہے جس کا آپ پیچھا کر رہے تھے۔ ایک چیک پوائنٹ کھونے کا دوسرا طریقہ یہ ہے جس کے لیے آپ نے ادائیگی کی تھی: CLI --save-total-limit 5 پر ڈیفالٹ کرتا ہے، جسے پرانے چیک پوائنٹس کو حذف کرنے سے پہلے رکھے جانے والے چیک پوائنٹس کی زیادہ سے زیادہ تعداد کے طور پر دستاویزی کیا گیا ہے۔ سٹوریج سینٹ میں ہے؛ ایک دوبارہ رن 4 سے 12 USD اور چھ گھنٹے کا ہے۔
اوپر کی بولی کی حدیں آن ڈیمانڈ ریٹ کا ایک حصہ ہیں، اور vast.ai کا کہنا ہے کہ بولی کا نظام کلائنٹ کے اخراجات کو پچاس فیصد یا اس سے زیادہ کم کر سکتا ہے۔ اس کا کیچ، اس کے اپنے الفاظ میں: ایک رکاوٹ پذیر انسٹنس کو کسی بھی وقت روکا جا سکتا ہے اگر کوئی دوسرا صارف زیادہ بولی لگائے یا انہی وسائل کے لیے آن ڈیمانڈ کرایہ داری بنائی جائے، اور وہ توقف "چلنے والے تمام عمل کو روک دیتا ہے"۔ آن ڈیمانڈ کو ہمیشہ ترجیح حاصل ہوتی ہے۔ یہ اس رن کے لیے ٹھیک ہے جو ہر چند سو قدموں پر ایک چیک پوائنٹ لکھتا ہے، لیکن اس کے لیے مکمل نقصان ہے جو آخر میں لکھتا ہے، جو بالکل وہی ہے جو ڈیفالٹس آپ کو دیتے ہیں: Isaac-GR00T CLI ہر --save-steps (ڈیفالٹ 1000) پر لکھتا ہے، لیکن lerobot کا --save_freq ڈیفالٹ 20,000 قدموں پر ہے، لہذا ایک ڈیفالٹ SmolVLA رن صرف ایک بار، اختتامی لائن پر چیک پوائنٹ کرتا ہے۔ اسے کم کریں، یا بولی نہ لگائیں۔ AY-Robots ٹریننگ فارم GR00T نوب کو saveSteps کے طور پر ظاہر کرتا ہے۔
- سب سے کم فی گھنٹہ کی شرح جو دستیاب ہے۔
- امیج، CUDA ورژن، lerobot یا Isaac-GR00T ریویژن اور ہر فلیگ پر مکمل کنٹرول۔
- رکاوٹ پذیر بولی شرح کو آدھا کر دیتی ہے اگر آپ کا رن اتنی بار چیک پوائنٹ کرتا ہے کہ توقف سے بچ سکے۔
- کوئی چیز تجریدی نہیں ہے، لہذا جب کوئی رن عجیب رویہ اختیار کرتا ہے تو آپ دیکھ سکتے ہیں کہ ایسا کیوں ہے۔
- سیٹ اپ GPU ریٹس پر بل ہوتا ہے: ڈرائیورز، ڈیپینڈنسیز، ملٹی گیگا بائٹ بیس چیک پوائنٹ اور ڈیٹا سیٹ ڈاؤن لوڈ سب کی فی گھنٹہ لاگت ٹریننگ کے برابر ہے۔
- ایک اوور بِڈ رکاوٹ پذیر انسٹنس کو روکا جاتا ہے اور اس کے عمل کو ختم کر دیا جاتا ہے۔ ایک غیر محفوظ شدہ رن جلا ہوا پیسہ ہے، اور lerobot ڈیفالٹ اپنا پہلا چیک پوائنٹ 20,000 قدم پر لکھتا ہے۔
- کوئی چیز آپ کے لیے پوڈ کو تباہ نہیں کرتی۔ اوپر دی گئی بیکار ٹیبل بھولنے کا بل ہے۔
- سنگل مکمل 80 GB کارڈز کی سپلائی کم ہے: اس پڑھائی میں دو A100 80 GB اور پانچ H100 80 GB مکمل کارڈ کی پیشکشیں ہیں۔ فہرست بھی بدلتی رہتی ہے، لہذا سب سے سستی درج شدہ قیمت اور وہ قیمت جس پر آپ واقعی کرایہ پر لے سکتے ہیں، ایک ہی نمبر نہیں ہیں۔
- انفراسٹرکچر پر گزارا گیا ہر گھنٹہ وہ گھنٹہ ہے جو ان اقساط کو ریکارڈ کرنے میں نہیں گزارا گیا جو یہ فیصلہ کرتی ہیں کہ پالیسی کام کرتی ہے یا نہیں۔
خود کرنا بمقابلہ پلیٹ فارم کو کارڈ کرایہ پر لینے دینا
آپ مشین کا انتخاب کرتے ہیں، ماحول بناتے ہیں اور پوڈ کو ختم کرتے ہیں۔ فی گھنٹہ کی شرح اوپر دی گئی مارکیٹ ریٹ ہے؛ باقی سب آپ کا وقت ہے۔
- ماڈل کی VRAM کی ضرورت کے مطابق ایک کارڈ تلاش کریں: ACT اور SmolVLA کے لیے 24 GB، GR00T اور Pi0.5 کے لیے 80 GB۔
- اگر رن وقفے کو برداشت نہیں کر سکتا تو ڈیمانڈ پر کرایہ پر لیں، اگر یہ اکثر چیک پوائنٹس بناتا ہے تو قابلِ مداخلت۔
- ٹول چین انسٹال کریں: ACT، SmolVLA اور Pi0.5 کے لیے lerobot، GR00T کے لیے Isaac-GR00T ریپوزٹری اپنے tyro لانچر کے ساتھ۔
- اگر ضرورت ہو تو ڈیٹا سیٹ کو تبدیل کریں۔ ایک LeRobot v3.0 ڈیٹا سیٹ GR00T لوڈر کو کریش کر دیتا ہے اور اسے v2.1 میں تبدیل کرنا ضروری ہے۔
- لانچ کریں، نقصان کو دیکھیں، چیک پوائنٹس کو کسی پائیدار جگہ پر دھکیلیں جیسے ہی وہ لکھے جائیں۔
- انسٹنس کو ختم کریں، پھر چیک کریں کہ آپ نے اسے ختم کر دیا ہے۔
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>ایک GR00T رن کے لیے حقیقت پسندانہ لاگت: H100 80 GB پر 3 سے 6 گھنٹے 1.34 سے 2.34 USD فی گھنٹہ کے حساب سے 4 سے 14 USD ہے، علاوہ 20 سے 40 منٹ کا سیٹ اپ جس کا بھی بل آتا ہے، علاوہ آپ کا اپنا وقت۔
آپ ایک فارم میں ماڈل، ڈیٹا سیٹ اور ہائپر پیرامیٹرز کا انتخاب کرتے ہیں۔ بیک اینڈ ماڈل کی VRAM کی ضرورت کے مطابق ایک اسپاٹ GPU کرایہ پر لیتا ہے، ٹرینر چلاتا ہے اور چیک پوائنٹس کو آبجیکٹ اسٹوریج میں لکھتا ہے۔
- اپنی ترکیب ٹریننگ میٹرکس پر منتخب کریں: پانچ ماڈل، چار بازو، ہر سیل کے لیے ایک گائیڈ۔
- اسے ایک ڈیٹا سیٹ کی طرف اشارہ کریں: ایک جو ڈیسک ٹاپ کلائنٹ کے ساتھ ریکارڈ کیا گیا ہو، ایک Hugging Face repo id، یا آپ کی اپنی مشین سے ایک۔
- ڈیفالٹس کو قبول کریں یا انہیں ایڈجسٹ کریں۔ اوپر دی گئی جدول وہ ہے جو دراصل ٹرینر کو بھیجی جاتی ہے۔
- بیک اینڈ مطلوبہ VRAM کے مطابق کارڈ کا انتخاب کرتا ہے، لہذا آپ کو کبھی GPUs کی خریداری نہیں کرنی پڑتی۔
- چیک پوائنٹس لکھے جانے کے ساتھ ہی آبجیکٹ اسٹوریج میں محفوظ ہو جاتے ہیں، لہذا ایک منقطع رن ضائع شدہ رن نہیں ہوتا۔
| ٹیر | ماڈلز | رن ٹائم | فی رن لاگت |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
یہ کیا نہیں کرتا: ایک خراب ڈیٹا سیٹ کو اچھا بنانا، GR00T کو وہ سیڈ دینا جو اس کے پاس کبھی نہیں تھا، یا نیچے بیان کردہ لیٹنسی کی حد کو ہٹانا۔ یہ GPU کی خریداری، ماحول کی تعمیر اور اس پوڈ کو ہٹاتا ہے جسے آپ ختم کرنا بھول گئے تھے۔ میکانکس ٹریننگ دستاویزات میں ہیں۔
پلیٹ فارم کیا چارج کرتا ہے اور یہ کارڈ کا انتخاب کیسے کرتا ہے
منطق جان بوجھ کر سادہ ہے۔ ہر ماڈل کیٹلاگ میں ایک GPU ٹیر کا اعلان کرتا ہے؛ بیک اینڈ مطلوبہ VRAM لیتا ہے اور اوپر بیان کردہ اسی اسپاٹ مارکیٹ پر ایک مماثل کارڈ کرائے پر لیتا ہے۔ یہی وجہ ہے کہ بتائی گئی لاگت ایک رینج ہے، قیمت نہیں۔ GR00T اور Pi0.5 یہاں صرف کلاؤڈ پر چلتے ہیں کیونکہ ان کی 40 GB اور 70 GB کی کم از کم ضرورت ہے۔ SmolVLA اور ACT آپ کے اپنے 24 GB کارڈ پر مقامی طور پر بھی چلتے ہیں، جہاں کلاؤڈ کی لاگت صفر ہے اور بجلی آپ کا مسئلہ ہے۔

ایک سیٹنگ پر توجہ کی ضرورت ہے۔ گریڈینٹ ایکومولیشن GR00T کے دونوں ویرینٹس پر حقیقی معنوں میں لاگو ہوتی ہے، لہذا اسے بڑھانے سے اسی کارڈ پر ایک بڑا مؤثر بیچ حاصل ہوتا ہے۔ Pi0.5 اور SmolVLA کے لیے یہ بالکل لاگو نہیں ہوتی: lerobot 0.5.1 کی ٹریننگ کنفگ میں گریڈینٹ ایکومولیشن کا کوئی آپشن نہیں ہے، لہذا فیلڈ کو 16 پر سیٹ کرنے سے نہ کچھ خرچ ہوتا ہے اور نہ کچھ حاصل ہوتا ہے۔ اگر کوئی قطار میں لگی ہوئی جاب کبھی شروع نہیں ہوتی، قطار میں پھنسی ہوئی جاب کا صفحہ یہ بتاتا ہے کہ کیا چیک کرنا ہے؛ اگر رن شروع ہونے سے پہلے ڈیٹا سیٹ مسترد ہو جاتا ہے، تو یہ تقریباً ہمیشہ v3.0 فارمیٹ کا مسئلہ ہوتا ہے۔
ایک کرائے کا GPU جو عوامی انٹرنیٹ پر آپ کی پالیسی کو سروس فراہم کرتا ہے، کنٹرول لوپ میں اضافی راؤنڈ ٹرپس کا اضافہ کرتا ہے جو پہلے ہی فی ایکشن سٹیپ 20 سے 485 ملی سیکنڈ ہے۔ سست پک اینڈ پلیس کے لیے ٹھیک ہے، لیکن تیز رد عمل والی حرکت کے لیے نہیں۔ کلاؤڈ انفرنس ایک چیک پوائنٹ کا اچھی طرح جائزہ لیتا ہے اور پروڈکشن مینیپولیشن کو بری طرح چلاتا ہے: اگر کام کو رفتار کی ضرورت ہو تو کمپیوٹ کو سرووز کے ساتھ بیٹھنا پڑتا ہے، اور یہ ایک ایسی لاگت ہے جسے یہ مضمون ختم نہیں کر سکتا۔ دیکھیں انفرنس لیٹنسی۔
پہلی کارآمد پالیسی کے لیے ایک تیار شدہ بجٹ
تمام چار لائنیں ایک ساتھ، بالکل شروع سے۔ GPU کا کل تخمینہ 3 سے 5 رن پر مبنی ہے: پہلا پائپ لائن کے کام کرنے کو ثابت کرتا ہے، دوسرا ڈیٹا کے مسئلے کو ظاہر کرتا ہے، تیسرا یا چوتھا وہ ہے جسے آپ برقرار رکھتے ہیں۔
| آئٹم | کم خرچ راستہ | آرام دہ راستہ |
|---|---|---|
| Arm | صرف SO-100 فالوور، BOM میں 121.94 USD | لیڈر پلس فالوور، BOM میں 229.88 USD |
| Model | SmolVLA یا ACT، 24 GB ٹیر | GR00T N1.7، A100 80 GB یا H100 ٹیر |
| Episodes recorded | 30، SmolVLA کا کم از کم | 50 to 100 |
| Human time to record | تقریباً 1 گھنٹہ 12 منٹ | 2 سے 4 گھنٹے |
| Cost of one run | 1 to 3 USD | 4 to 12 USD |
| Runs before it works | 3 to 5 | 3 to 5 |
| Total GPU spend | 3 to 15 USD | 12 to 60 USD |
| Largest line on the bill | آرم، پھر آپ کا وقت | آرم، پھر آپ کا وقت |
اس روبوٹ کے سائز پر بھی یہی پیٹرن برقرار ہے: کمپیوٹ ایک معمولی غلطی ہے، ہارڈویئر ایک حقیقی یک وقتی لاگت ہے، انسانی گھنٹے بار بار ہونے والا خرچ ہیں۔ کچھ بھی خریدنے سے پہلے تربیتی حصے کو جانچنے کے لیے، آپ کو ماڈلز کا موازنہ کرنے اور بغیر کسی بازو کے GPU کرائے پر لینے کی اجازت دیتے ہیں، اور ایک فزیکل SO-100 ہے جسے آپ بغیر سائن اپ کے براؤزر میں چلا سکتے ہیں۔ پوری پائپ لائن کو شروع سے آخر تک دیکھنے کے لیے، سیٹ اپ کا احاطہ کرتی ہے، اور تربیت، اور مختصر ورژن ہے۔

ایک VLA فائن ٹیوننگ رن کی مکمل لاگت کیا ہے؟▾
A100 80 GB یا H100 ٹیر پر GR00T N1.7، GR00T N1.5 یا Pi0.5 کے لیے تقریباً 4 سے 12 USD (1.20 سے 2.00 USD فی گھنٹہ کے حساب سے 3 سے 6 گھنٹے)، اور RTX 4090 ٹیر پر SmolVLA یا ACT کے لیے تقریباً 1 سے 3 USD (0.30 سے 0.60 USD فی گھنٹہ کے حساب سے 2 سے 5 گھنٹے)۔ کارڈ خود کرایہ پر لینے کی صورت میں سیٹ اپ کا وقت شامل کرنے کے بعد لاگت اسی حد میں رہتی ہے، کیونکہ اس پر ٹریننگ کی شرح سے بل آتا ہے۔
کیا A100 80 GB کے مقابلے میں H100 کے لیے ادائیگی کرنا فائدہ مند ہے؟▾
ایک SO-100 پالیسی کے لیے، عام طور پر نہیں۔ دونوں GR00T اور Pi0.5 کو درکار میموری فلور کو صاف کرتے ہیں، اور 23 اگست 2026 کی ریڈنگ کے مطابق ایک مکمل A100 80 GB کی قیمت 0.44 USD فی گھنٹہ تھی جبکہ H100 80 GB کی 1.34 USD تھی۔ H100 جلد ختم ہو جاتا ہے، لہذا شرح کا کچھ حصہ کم گھنٹوں کی صورت میں واپس آ جاتا ہے، لیکن اس چھوٹے رن کے لیے کل لاگت اب بھی زیادہ ہے۔ H100 کے لیے اصل دلیل دستیابی ہے: اس مارکیٹ میں پانچ سنگل H100 80 GB آفرز بمقابلہ دو A100 80 GB، اور جس کارڈ کو آپ کرایہ پر نہیں لے سکتے اس کی کوئی قیمت نہیں۔
ایک پالیسی کے اصل میں کام کرنے سے پہلے کتنے رن درکار ہوتے ہیں؟▾
تین سے پانچ کا منصوبہ بنائیں۔ پہلا یہ ثابت کرتا ہے کہ پائپ لائن صحیح طریقے سے جڑی ہوئی ہے۔ دوسرا عام طور پر ڈیٹا سیٹ کے مسئلے کو ظاہر کرتا ہے جیسے کہ کیمرہ سٹریم جو درمیان میں بند ہو گئی ہو۔ تیسرا یا چوتھا وہ ہوتا ہے جسے آپ رکھتے ہیں۔
کیا میں کرایہ پر لینے کے بجائے اپنے GPU پر SmolVLA یا ACT کو تربیت دے سکتا ہوں؟▾
جی ہاں۔ دونوں AY-Robots پر مقامی طور پر سپورٹ کیے جاتے ہیں اور دونوں 24 GB میں آسانی سے فٹ ہو جاتے ہیں؛ اصل ACT پیپر نے اپنے 80M ماڈل کو تقریباً 5 گھنٹے میں 11 GB RTX 2080 Ti پر تربیت دی تھی۔ GR00T اور Pi0.5 یہاں صرف کلاؤڈ پر ہیں کیونکہ وینڈرز کے دستاویزی فائن ٹیوننگ فلورز 40 GB اور 70 GB ہیں، اور مارکیٹ میں سب سے بڑا کنزیومر کارڈ 32 GB RTX 5090 ہے۔
ماڈلز کے درمیان مراحل کی ایک ہی تعداد کی لاگت مختلف کیوں ہوتی ہے؟▾
مراحل پالیسیوں کے درمیان موازنہ کے قابل نہیں ہیں۔ ACT 24 GB کارڈ پر بیچ 8 پر 100,000 مراحل پر ڈیفالٹ کرتا ہے؛ GR00T N1.5 80 GB کارڈ پر گریڈینٹ ایکومولیشن 16 کے ساتھ بیچ 1 پر 2,000 مراحل پر ڈیفالٹ کرتا ہے۔ بل گھنٹوں کو اس کارڈ کی شرح سے ضرب دے کر آتا ہے جس پر میموری فٹ پرنٹ آپ کو مجبور کرتا ہے، نہ کہ مراحل کی گنتی سے۔
شروع کرنے سے پہلے دیکھیں کہ آپ کے رن پر کتنی لاگت آئے گی
پانچوں پالیسیوں میں سے ہر ایک اپنے GPU ٹیر، رن ٹائم اور فی رن قیمت کی فہرست دیتا ہے، اور ٹریننگ بیک اینڈ اسی سپاٹ مارکیٹ پر کارڈ کرایہ پر لیتا ہے جہاں یہ اعداد و شمار ماپے گئے تھے۔
قیمت چیک کریںSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started