
वास्तविक स्पॉट-मार्केट GPU किमती, प्रत्येक पाच पॉलिसी किती वेळ चालतात, आर्म आणि प्रदर्शनांचा खर्च काय आहे आणि पैसे शांतपणे गायब होणारी चार ठिकाणे.
थोडक्यात
- •A100 80 GB किंवा H100 टियरवर एक रन पूर्ण होण्यासाठी 3 ते 6 तास लागतात आणि त्याचा खर्च सुमारे 4 ते 12 USD येतो. RTX 4090 टियरवर तो 2 ते 5 तास लागतो आणि सुमारे 1 ते 3 USD खर्च येतो.
- •vast.ai वर 23 ऑगस्ट 2026 रोजी 13:44 UTC वाजता मोजले गेले: मागणीनुसार पूर्ण RTX 4090 साठी 0.13 ते 0.38 USD/तास, A100 80 GB साठी 0.44 ते 0.67, H100 80 GB साठी 1.34 ते 2.34. पूर्ण 80 GB कार्ड्स दुर्मिळ आहेत, अनुक्रमे दोन आणि पाच सिंगल-कार्ड ऑफर उपलब्ध आहेत.
- •GPU ही सर्वात स्वस्त बाब आहे. SO-ARM100 च्या सामग्रीच्या बिलामध्ये एक लीडर आणि फॉलोअर जोडी 229.88 USD ला येते, जी 24 GB टियरवर 77 ते 230 रन इतकी आहे.
- •एका व्यक्तीने 50 एपिसोड्स रेकॉर्ड करण्यासाठी लागणारे दोन तास, त्या एपिसोड्सना फीड करणाऱ्या ट्रेनिंग रनपेक्षा जास्त खर्चिक असतात.
- •पैसा चार ठिकाणी वाया जातो: खराब डेटावरील रन, 80M पॉलिसी हाताळू शकणाऱ्या कामांसाठी 3B मॉडेल्स वापरणे, कोणीही नष्ट न केलेले GPUs, आणि तुम्ही जतन करण्यात अयशस्वी झालेल्या परिणामांचे री-रन.
- •AY-Robots मॉडेलला आवश्यक असलेल्या VRAM नुसार कार्डचा आकार ठरवते आणि ते त्याच स्पॉट मार्केटमध्ये भाड्याने देते, त्यामुळे रनचा खर्च हा बाजारातील खर्च असतो.
बिलामध्ये चार ओळी आहेत आणि GPU ही सर्वात लहान आहे
जेव्हा लोक विचारतात की व्हिजन-लँग्वेज-ॲक्शन मॉडेल SO-100 साठी फाइन-ट्यून करण्यासाठी किती खर्च येतो, तेव्हा त्यांचा अर्थ जवळजवळ नेहमीच GPU भाड्याने घेणे हा असतो. ही ती संख्या आहे जी कार्डवर शुल्क म्हणून दिसते, त्यामुळे ती खरी वाटते. तसेच, मोठ्या फरकाने, कार्यरत पॉलिसी प्रत्यक्षात तुम्हाला किती खर्च येते हे ठरवणाऱ्या चार संख्यांपैकी ही सर्वात लहान आहे.
| बाब | ते काय आहे | एका कार्यरत पॉलिसीसाठी सामान्य आकार |
|---|---|---|
| GPU वेळ | रनसाठी कार्ड भाड्याने घेणे | प्रत्येक रनसाठी 1 ते 12 USD, आणि तुम्ही 3 ते 5 रन कराल |
| रोबोट | सर्व्हो, प्रिंटेड फ्रेम, कॅमेरा, केबल्स, पॉवर | एकदाच, प्रति आर्म 110 ते 500 EUR |
| मानवी तास | डेमो रेकॉर्ड करण्यासाठी आर्म चालवणारी व्यक्ती | प्रत्येक डेटासेटसाठी 1 ते 4 तास, प्रत्येक कार्यासाठी पुनरावृत्ती |
| वाया गेलेला खर्च | खराब डेटा, जास्त मोठे मॉडेल्स, विसरलेले पॉड्स | अमर्याद, आणि तुम्ही नियंत्रित करू शकणारी एकमेव बाब |
खालील प्रशिक्षण वेळा पाच मॉडेल्सच्या स्वतःच्या पेपर्स आणि रिपॉझिटरीजमधून घेतल्या आहेत, हार्डवेअरची किंमत प्रकाशित बिल ऑफ मटेरियल्समधून, प्लॅटफॉर्म क्रमांक AY-Robots च्या धोरण कॅटलॉग आणि किंमत पृष्ठ. जिथे प्लॅटफॉर्म मदत करत नाही, तिथे हा लेख तसे सांगतो.
स्पॉट मार्केटमध्ये GPU तासाची खरी किंमत किती असते
A100 तासासाठी एकच किंमत नाही. vast.ai सारख्या मार्केटप्लेसवर प्रत्येक होस्ट स्वतःचा दर ठरवतो आणि तुम्ही लॉन्च केलेला प्रशिक्षण रन त्या क्षणी स्वस्त आणि मोफत असलेल्या कोणत्याही मशीनवर उतरते. खरे उत्तर म्हणजे एक वितरण. हे येथे आहे, 23 ऑगस्ट 2026 रोजी 13:44 UTC वाजता मोजले गेले: सिंगल फुल कार्ड्स, ऑन डिमांड, वास्तविक VRAM नुसार फिल्टर केलेले.
| कार्ड | vast.ai ऑन डिमांड USD/तास (कमी / मध्यम / उच्च) | फुल-कार्ड ऑफर्स | vast.ai बिड फ्लोर | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
vast.ai सार्वजनिक बंडल API वरून एका पूर्ण GPU (gpu_frac == 1.0) साठी ऑन-डिमांड ऑफर, ज्यासाठी कोणत्याही खात्याची आवश्यकता नाही, gpu_ram वर फिल्टर केलेले जेणेकरून केवळ अस्सल 80 GB कार्ड्स 80 GB च्या पंक्तींमध्ये येतात. तो फिल्टर महत्त्वाचा आहे: या वाचनात, सर्व तीन सिंगल-कार्ड A100 SXM4 ऑफर 40 GB चे भाग होते, तसेच चार A100 PCIE ऑफरपैकी दोनही, त्यामुळे त्यांना एका "A100" पंक्तीमध्ये एकत्र केल्याने येथे नमूद केलेली किंमत निम्मी झाली असती. Hugging Face स्तंभ दोन उत्पादने मिसळतो: 2.50 USD/h हे Nvidia A100 - large Spaces हार्डवेअर आहे आणि 4.50 USD/h हे Inference Endpoints अंतर्गत एकच H100 80 GB आहे, जे Spaces ऑफर करत नाही. मध्यकांना सूचक माना: A100 80 GB पंक्ती दोन ऑफरवर आधारित आहे आणि H100 पंक्ती पाचवर, आणि 36 सेकंदांनंतर त्याच क्वेरीने 4090 ची वेगळी संख्या आणि पाचपैकी तीन पंक्तींवर वेगळी सर्वोच्च किंमत परत केली. RunPod सूचीतील किमती नियोजन करण्यासाठी अधिक स्थिर संख्या आहेत.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
3B मॉडेल्स स्वस्त कार्ड का वापरू शकत नाहीत
वरील मध्यकांनुसार, 4090 तास आणि H100 80 GB तास यांच्यात अंदाजे सहा पटींचा फरक आहे. तुम्हाला महागड्या कार्डवर जाण्यास गती नाही, तर मेमरी भाग पाडते. openpi पूर्ण Pi0.5 साठी किमान मर्यादा ठेवते फाइन-ट्यून 70 GB वर, आणि NVIDIA GR00T साठी 40 GB किंवा अधिकची शिफारस करते. GR00T संख्या काय नाही हे लक्षात घ्या. त्याचे फाइन-ट्यून कॉन्फिग डीफॉल्टनुसार भाषा मॉडेल आणि व्हिज्युअल एन्कोडर गोठवते (tune_llm आणि tune_visual False आहेत, प्रोजेक्टर आणि डिफ्यूजन हेड True आहेत), म्हणूनच कॅटलॉगमध्ये 3 B पैकी अंदाजे 40 M प्रशिक्षित पॅरामीटर्स सूचीबद्ध आहेत. 40 GB हे 3 B वजनांसाठी ऑप्टिमायझरची स्थिती नाही, तर ते गोठलेले बॅकबोन आणि ॲक्टिव्हेशन्स आहेत. कमी-व्याप्ती असलेले प्रकार खाली येतात: openpi च्या LoRA पाथला 22.5 GB लागतात आणि 4090 चे नाव देते, आणि NVIDIA च्या Isaac Lab Arena वर्कफ्लोमध्ये GR00T पोस्ट-ट्रेनिंगसाठी 24 GB सिंगल-GPU पर्याय सूचीबद्ध आहे. प्रत्येक विक्रेता ज्या कॉन्फिगरेशनसाठी चालवतो, त्या किमान मर्यादेवर प्लॅटफॉर्मची श्रेणी ठरते. pi0 फ्लो-मॅचिंग लेख स्पष्ट करतो की तो फ्लो-मॅचिंग फूटप्रिंट कुठून येतो.
| कार्य | अपस्ट्रीम प्रकल्पाला आवश्यक मेमरी | स्रोत |
|---|---|---|
| pi0 / pi0.5 inference | 8 GB पेक्षा जास्त, उदाहरणार्थ RTX 4090 | openpi |
| pi0 / pi0.5 LoRA fine-tune | 22.5 GB पेक्षा जास्त, उदाहरणार्थ RTX 4090 | openpi |
| pi0 / pi0.5 full fine-tune | 70 GB पेक्षा जास्त, उदाहरणार्थ A100 80 GB किंवा H100 | openpi |
| GR00T N1.7 inference | 16 GB किंवा अधिकसह 1 GPU | Isaac-GR00T |
| GR00T N1.7 fine-tune | 40 GB किंवा अधिक शिफारस केलेले, H100 किंवा L40 नोड्स | Isaac-GR00T |
| GR00T fine-tune, what it trains | प्रोजेक्टर आणि डिफ्यूजन हेड; LLM आणि व्हिज्युअल एन्कोडर डीफॉल्टनुसार गोठलेले | finetune_config.py |
| GR00T post-training, reduced | 24 GB सह 1 GPU, भाषा मॉडेल गोठलेले | Isaac Lab Arena |
| SmolVLA fine-tune | संदर्भ 20,000-स्टेप रनसाठी सिंगल A100 | lerobot docs |
| ACT training | एक सिंगल 11 GB RTX 2080 Ti | ACT paper |
त्या सारणीमुळे प्लॅटफॉर्म पाच मॉडेल्सना दोन स्तरांमध्ये विभाजित करतो. GR00T N1.7, GR00T N1.5 आणि Pi0.5 A100 80 GB किंवा H100 वर जातात कारण विक्रेत्यांना तेच आवश्यक आहे. SmolVLA आणि ACT RTX 4090 किंवा कोणत्याही 24 GB कार्डवर जातात कारण ते खरोखरच पुरेसे आहे.
24 GB कार्डवर GR00T किंवा Pi0.5 रन शून्य सेकंदाला अयशस्वी होत नाही. ते बेस चेकपॉईंट डाउनलोड करते, डेटासेट इंडेक्स तयार करते, पहिला फॉरवर्ड पास सुरू करते आणि काही शेकडो स्टेप्समध्ये CUDA आउट-ऑफ-मेमरी एररने थांबते. तुम्ही डाउनलोड आणि सेटअपसाठी पैसे दिले आणि काहीही मिळाले नाही. उपाय: प्रशिक्षणादरम्यान मेमरी संपणे.
प्रत्येक पाच मॉडेल प्रत्यक्षात किती वेळ चालतात
कार्यकाळ हा खर्चाचा दुसरा भाग आहे: जर काम 40 मिनिटांचे असेल तर 2.00 USD प्रति तास दर निरर्थक आहे आणि जर ते 40 तासांचे असेल तर तो विनाशकारी आहे. AY-Robots प्रशिक्षकाला खरोखर पाठवते ती ही डीफॉल्ट सेटिंग्ज आहेत, प्रत्येक स्तरासाठी रन विंडो आणि खर्चासह.
| धोरण | GPU स्तर | डीफॉल्ट कमाल पायऱ्या | डीफॉल्ट बॅच (ग्रेड संचय) | रन विंडो | प्रत्येक रनचा खर्च |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

या रन विंडोजचा स्रोत अपस्ट्रीममध्ये कुठे आहे
- SmolVLA: lerobot च्या डॉक्युमेंटेशननुसार, 20,000 स्टेप्स पूर्ण करण्यासाठी एका A100 वर अंदाजे 4 तास लागतात. प्लॅटफॉर्म तेच 20,000 स्टेप्स स्वस्त 24 GB टियरवर चालवतो, त्यामुळे 4 तासांचा निश्चित कालावधी न ठेवता एक 'विंडो' (कालावधी) दिला जातो.
- ACT: मूळ ALOHA पेपरनुसार, 80M-पॅरामीटर मॉडेलसाठी एका 11 GB RTX 2080 Ti वर सुमारे 5 तास लागतात. 4090 हे अनेक पिढ्या नवीन असले तरी, प्लॅटफॉर्म 100,000 स्टेप्ससाठी बजेट करतो, त्यामुळे 'विंडो' (कालावधी) तोच राहतो.
- GR00T: NVIDIA च्या N1.6 जनरेशनसाठीच्या संदर्भ वर्कफ्लोनुसार, आठ L40S कार्ड्सवर बॅच 24 मध्ये 20,000 स्टेप्ससाठी अंदाजे 4 ते 8 तास लागतात, आणि एका Ada 6000 वर बॅच 16 मध्ये 30,000 स्टेप्ससाठी 2 ते 3 तास लागतात. काही तासांत 3B VLA चे सिंगल-कार्ड फाइन-ट्यूनिंग सामान्य आहे, आशावादी नाही.
- Pi0.5: openpi ने वॉल-क्लॉक आकडेवारी प्रकाशित केलेली नाही, परंतु ते पूर्ण फाइन-ट्यूनसाठी 70 GB ची किमान मर्यादा प्रकाशित करते, ज्यामुळे कार्ड आणि त्यामुळे दर निश्चित होतो.
तुम्ही ज्या संख्येसाठी पैसे देत नाही आहात, त्यावर थोडा विचार करणे महत्त्वाचे आहे. GR00T N1 पेपरनुसार, 2.2B मॉडेलला प्रीट्रेन करण्यासाठी अंदाजे 50,000 H100 GPU तास लागतात, जे 1024 GPUs पर्यंतच्या क्लस्टरवर, 16,384 च्या प्रीट्रेनिंग बॅच साइजमध्ये 200,000 ग्रॅडियंट स्टेप्ससाठी वापरले जातात. वर नमूद केलेल्या 1.34 ते 2.34 USD प्रति तास दराने, हे भाड्याने घेतलेल्या कंप्यूटचे अंदाजे 67,000 ते 117,000 USD इतके होते. SmolVLA पेपरनुसार, त्यांचा प्रकल्प 481 कम्युनिटी डेटासेट्स, 22.9K एपिसोड्स आणि 10.6M फ्रेम्सवर अंदाजे 30,000 GPU तास वापरतो. तुम्ही हे सर्व एका डाउनलोडच्या किमतीत मिळवता; तुमचे 8 USD शेवटच्या 20,000 स्टेप्ससाठी आहेत. VLAs अशा प्रकारे का बनवले जातात हे विभाजन स्पष्ट करते.
आर्म: एक-वेळचा खर्च जो GPU बिलापेक्षा खूप मोठा आहे
एक प्रशिक्षण रन दुपारच्या जेवणापेक्षा कमी खर्चिक असतो. रोबोट नाही. म्हणूनच SO-100 महत्त्वाचे आहे: हा सर्वात स्वस्त आर्म आहे ज्याला संपूर्ण अनुकरण शिक्षण टूलचेन प्रत्यक्षात समर्थन करते.
| आर्म | सर्व्हो | व्होल्टेज | भागांची किंमत | AY-Robots वर समर्थन |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | पूर्ण, संदर्भ आर्म |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | पूर्ण |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | सुसंगत |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | सुसंगत |
SO-ARM100 रिपॉझिटरीमधील अपस्ट्रीम बिल ऑफ मटेरियल्स अधिक तपशीलवार आहे आणि तुमच्या प्रदेशानुसार तपासण्यासारखे आहे: त्याची दोन आर्म्ससाठी भाग यादीमध्ये लीडर आणि फॉलोअर सेटअपसाठी एकूण 229.88 USD किंवा 226.30 EUR खर्च येतो, आणि त्याची एका फॉलोअर आर्मसाठी भाग यादीमध्ये एकूण 121.94 USD किंवा 124.30 EUR खर्च येतो. प्रत्येक 13.89 USD दराने सहा STS3215 सर्व्हो त्या 121.94 पैकी 83.34 आहेत, त्यामुळे सर्व्हो हेच आर्म आहेत. प्रति SmolVLA किंवा ACT रन 1 ते 3 USD दराने, एक आर्म्सची जोडी 77 ते 230 प्रशिक्षण रनच्या बरोबरीची आहे. जर तुम्ही अजूनही निवड करत असाल, तर SO-100 विरुद्ध SO-101 ही तुलना महत्त्वाची आहे, कारण दोन्ही इतके जवळचे आहेत की निर्णय क्षमतेऐवजी उपलब्धतेवर आधारित आहे.
STS3215 7.4 V आणि 12 V प्रकारात उपलब्ध आहे; रिपॉझिटरीमध्ये नमूद केले आहे की 12 V भागाला 5 V ऐवजी 12 V 5 A पुरवठा देखील लागतो, त्यामुळे ते अदलाबदल करण्यायोग्य नाहीत. 7.4 V सर्व्होमध्ये 12 V पुरवठा केल्यास ते खराब होतात, आणि सहा सर्व्हो हे फॉलोअर आर्मच्या भागांच्या खर्चाच्या दोन तृतीयांश आहेत. पहिल्यांदा पॉवर-अप करण्यापूर्वी प्रत्येक सर्व्होवरील लेबल तपासा. जर सर्व्हो आधीच विचित्रपणे वागत असतील तर: सर्व्हो प्रतिसाद देत नाही, आर्म थरथरतो आणि नंतर खाली पडतो.
मानवी तास: अशी ओळ जी कोणीही स्प्रेडशीटमध्ये टाकत नाही
ही अशी संख्या आहे जी खर्चाच्या चर्चेला पूर्णपणे बदलून टाकते. प्रात्यक्षिके रेकॉर्ड करणे म्हणजे एक व्यक्ती रोबोटिक आर्मला एका वेळी एक एपिसोड, वास्तविक वेळेत हलवणे. यात बॅचिंग नाही आणि सेकंदाने भाड्याने देण्याची सोय नाही. द LeRobot डेटासेट रेकॉर्डर डीफॉल्ट सेटिंग्जसह येतो ज्यामुळे अंकगणित सोपे होते, हे तिन्ही DatasetRecordConfig: प्रति 60 सेकंद एपिसोड, दृश्य रीसेट करण्यासाठी 60 सेकंद, 50 एपिसोड्स. खालील पैशाच्या स्तंभात एका व्यक्तीच्या एका तासासाठी 15 USD गृहीत धरले आहेत, जी एक गृहितक आहे, प्लॅटफॉर्मची संख्या नाही. तुमचा स्वतःचा दर वापरा; गुणोत्तर महत्त्वाचे आहे.
- 1तुम्हाला प्रत्यक्षात बिल केले जाईल अशा डीफॉल्टसह डेटासेट रेकॉर्ड करा
हे lerobot 0.6.1 आहे, 3 ऑगस्ट 2026 पर्यंत PyPI वर उपलब्ध असलेली आवृत्ती. CLI च्या स्वरूपाकडे लक्ष द्या: रेकॉर्डिंग
lerobot-recordकन्सोल एंट्री पॉइंट (lerobot.scripts.lerobot_record) द्वारे चालते, जुन्याpython -m lerobot.scripts.recordमॉड्यूल पाथद्वारे नाही. AY-Robots 0.5.1 ला लक्ष्य करते, आणि 0.5.1 व्हीलमध्ये तेचlerobot-recordआणिlerobot-trainएंट्री पॉइंट्स घोषित केले आहेत, त्यामुळे खालील स्वरूप दोन्हीमध्ये स्थिर आहे. तीन टाइमिंग फ्लॅग अपस्ट्रीम डीफॉल्ट आहेत, त्यामुळे पुढील टेबलमधील अंकगणित याच कमांडवर आधारित आहे.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2एकही GPU मिनिट भाड्याने घेण्यापूर्वी तुम्ही काय रेकॉर्ड केले ते पहा
डेटासेट तपासण्यासाठी प्रति तास शून्य USD खर्च येतो. लॉस कर्व्हमधून तीच समस्या शोधण्यासाठी H100 टियरवर प्रति तास 2.00 USD खर्च येतो आणि तुम्हाला चार तास उशिरा कळते. डेटासेट पुश करा आणि LeRobot व्ह्यूअरमध्ये तपासा, किंवा AY-Robots डेटासेट डिरेक्टरी ब्राउझ करा.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3प्रशिक्षण द्या, आणि चेकपॉइंट पॉडपेक्षा जास्त काळ टिकेल याची खात्री करा
भाड्याने घेतलेली मशीन मुळात तात्पुरती असते, त्यामुळे रन दरम्यान चेकपॉइंट्स कुठेतरी टिकाऊ ठिकाणी लिहा. तुम्ही जे पैसे दिले ते ठेवता की नाही हे दोन फ्लॅग ठरवतात.
--save_freqडीफॉल्टनुसार 20,000 स्टेप्सवर सेट असतो, त्यामुळे डीफॉल्ट 20,000-स्टेप SmolVLA रन त्याची पहिली चेकपॉइंट रन संपल्यावरच लिहितो; काहीही इंटरप्टिबल भाड्याने घेण्यापूर्वी ते कमी करा.--save_checkpoint_to_hubला--policy.repo_idआवश्यक आहे आणि lerobot 0.5.1 मध्ये ते अस्तित्वात नाही, त्यामुळे त्या आवृत्तीवर तुम्हाला आउटपुट डिरेक्टरी मशीनमधून स्वतः कॉपी करावी लागेल. खालील बॅच आकार अपस्ट्रीम डॉकचे उदाहरण आहे; AY-Robots फॉर्म SmolVLA साठी 2 पाठवतो आणि चेकपॉइंट्स दिसताच ऑब्जेक्ट स्टोरेजमध्ये लिहितो.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| एपिसोड्स | 60 सेकंदांवर रेकॉर्डिंग | 60 सेकंदांवर रीसेट करणे | वास्तविक वेळ | अधिक 20 टक्के पुन्हा रेकॉर्ड करणे | प्रति मानवी तास 15 USD दराने |
|---|---|---|---|---|---|
| 30, SmolVLA किमान | 30 मिनिटे | 30 मिनिटे | 1 तास 00 मिनिटे | 1 तास 12 मिनिटे | सुमारे 18 USD |
| 50, इतर चार किमान | 50 मिनिटे | 50 मिनिटे | 1 तास 40 मिनिटे | 2 तास 00 मिनिटे | सुमारे 30 USD |
| 100, एक आरामदायक डेटासेट | 100 मिनिटे | 100 मिनिटे | 3 तास 20 मिनिटे | 4 तास 00 मिनिटे | सुमारे 60 USD |
उजव्या स्तंभाची तुलना 1 ते 12 USD च्या रन खर्चाशी करा. या गृहीत दराने, कॅलिब्रेशन, कॅमेरा सेटअप आणि तुम्ही टाकून दिलेल्या एपिसोड्स वगळता, 50-एपिसोडचा डेटासेट रेकॉर्ड करण्यासाठी प्रशिक्षण देण्यापेक्षा दोन ते सात पट जास्त खर्च येतो. म्हणूनच याला थेट आर्थिक मूल्य आहे. LeRobot मार्गदर्शक प्रत्येक ऑब्जेक्ट स्थानासाठी 10 एपिसोड्ससह किमान 50 एपिसोड्सची शिफारस करते; SmolVLA डॉक्स अहवाल देतात की त्याच कार्याची 25-एपिसोडची आवृत्ती पुरेशी नव्हती.
पैसा नेमका कुठे वाया जातो
1. कधीही काम न करणाऱ्या डेटावर चालणारे रन
दोन अदलाबदल केलेल्या कॅमेरा स्ट्रीम्स असलेल्या डेटासेटवर 20,000-स्टेप GR00T रनचा खर्च स्वच्छ डेटासेटवरील रनइतकाच असतो, तेवढाच वेळ लागतो आणि एक चांगला दिसणारा लॉस कर्व्ह तयार होतो. ही त्रुटी काही तासांनंतर आर्मवर दिसून येते. यांचे बिल तासांनुसार आकारले जाते आणि निदान दिवसांनुसार आकारले जाते. लक्षात ठेवण्यासारखी दोन लक्षणे: याचा अर्थ सहसा असा होतो की निरीक्षणांमध्ये कार्यासाठी आवश्यक असलेली माहिती नसते, आणि याचा अर्थ डेटासेटमध्ये तुमच्या अपेक्षेपेक्षा कमी विविधता होती.
2. निश्चित-कॅमेरा कार्यासाठी फाउंडेशन-मॉडेलची किंमत मोजणे
ACT मध्ये अंदाजे 80M पॅरामीटर्स आहेत आणि ते एका कार्यासाठी 50 प्रात्यक्षिकांवरून नव्याने प्रशिक्षण देण्यासाठी डिझाइन केले गेले होते. GR00T N1.7 मध्ये अंदाजे 3B पॅरामीटर्स आहेत आणि ते पूर्व-प्रशिक्षित बॅकबोनसह येते. बोल्ट केलेल्या कॅमेऱ्यासाठी, निश्चित टेबल आणि एका वस्तूसाठी, 80M मॉडेल अनेकदा कार्य पूर्ण करते, 152 ms ऐवजी प्रति क्रिया पायरी सुमारे 20 ms वेगाने चालते आणि 4 ते 12 USD ऐवजी प्रति रन 1 ते 3 USD खर्च येतो. महागड्या मॉडेलवर 12 USD खर्च करण्यापूर्वी स्वस्त मॉडेल काम करते की नाही हे शोधण्यासाठी 3 USD खर्च करा. ACT विरुद्ध SmolVLA आणि GR00T N1.7 विरुद्ध Pi0.5 दाखवतात की प्रत्येक मॉडेल योग्य उत्तर देणे कधी थांबवते; मॉडेल अरेना मध्ये 85 मॉडेल्स आणि 332 बेंचमार्क परिणाम आहेत.
3. तुम्ही विसरलेला GPU
टाळण्यासाठी सर्वात स्वस्त आणि करण्याची सर्वात सामान्य चूक. शुक्रवारी डीबग करण्यासाठी सुरू केलेले इन्स्टन्स आठवड्याच्या शेवटी वास्तविक रनच्या समान दराने बिल होते.
| कार्ड | स्नॅपशॉटमधील सरासरी दर | 24 तास निष्क्रिय | 7 दिवस निष्क्रिय | त्याची किंमत |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | सुमारे 27 SmolVLA किंवा ACT रन (प्रत्येकी 2 USD) |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | सुमारे 12 GR00T रन (प्रत्येकी 8 USD) |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | सुमारे 38 GR00T रन (प्रत्येकी 8 USD) |
AY-Robots वर, ही त्रुटी इन्फरन्ससाठी टाळण्यासाठी डिझाइन केली आहे: इन्फरन्स API द्वारे प्रदान केलेले पॉड्स निष्क्रिय वॉचडॉग घेऊन येतात आणि निष्क्रिय कालावधीनंतर स्वतःच नष्ट होतात. जर तुम्ही कार्ड स्वतः भाड्याने घेतले, तर तो वॉचडॉग तुमचे कॅलेंडर रिमाइंडर आहे.
4. एकाच उत्तरासाठी दोनदा पैसे देणे
GR00T चा फाइन-ट्यूनिंग एंट्री पॉइंट एक टायरो CLI आहे जो कोणताही सीड उघड करत नाही. ही प्लॅटफॉर्मची मर्यादा नाही, तर हे अपस्ट्रीम टूल आहे: gr00t/configs/finetune_config.py मध्ये कोणतेही सीड फील्ड नाही, आणि रेपॉजिटरीच्या स्वतःच्या प्रशिक्षण टिप्समध्ये चेतावणी दिली आहे की इमेज ऑगमेंटेशन्स नॉन-डिटरमिनिस्टिक असल्यामुळे रन 5 ते 6 टक्क्यांनी बदलतात. lerobot 0.5.1 आणि 0.6.1 या दोन्हीमध्ये सीड 1000 ला डीफॉल्ट करतो, त्यामुळे ACT, SmolVLA आणि Pi0.5 रन किमान त्याच इनिशियलायझेशन आणि डेटा ऑर्डरमधून पुन्हा चालवता येतात. ही GPU वर बिट-आयडेंटिकल वजनांची हमी नाही, परंतु हे री-रन आणि नवीन प्रयोगामधील फरक आहे. जर GR00T रनने काम करणारी पॉलिसी तयार केली आणि तुम्ही चेकपॉइंट ठेवला नाही, तर तुम्ही अशा परिणामासाठी पूर्ण किंमत द्याल जो तुम्ही शोधत असलेल्या फरकापेक्षा जास्त भिन्न असू शकतो. तुम्ही पैसे दिलेल्या चेकपॉइंट गमावण्याचा दुसरा मार्ग आहे: CLI डीफॉल्टनुसार --save-total-limit 5 वापरतो, जे जुने चेकपॉइंट्स हटवण्यापूर्वी ठेवल्या जाणाऱ्या चेकपॉइंट्सची कमाल संख्या म्हणून दस्तऐवजीकरण केले आहे. स्टोरेजची किंमत काही सेंट्स आहे; एक री-रन 4 ते 12 USD आणि सहा तास लागतो.
वरील बिड फ्लोअर्स ऑन-डिमांड दराच्या काही अंशात आहेत आणि vast.ai म्हणते की बिडिंग प्रणाली क्लायंटचा खर्च पन्नास टक्के किंवा त्याहून अधिक कमी करू शकते. त्यांच्या स्वतःच्या शब्दात सांगायचे तर, अडचण अशी आहे: जर दुसरा वापरकर्ता जास्त बोली लावेल किंवा त्याच संसाधनांसाठी ऑन-डिमांड भाडे तयार केले जाईल, तर व्यत्यय येण्याची शक्यता असलेली इन्स्टन्स कधीही थांबवली जाऊ शकते आणि ती थांबवल्याने "चालू असलेले सर्व प्रक्रिया थांबतात". ऑन-डिमांडला नेहमी प्राधान्य दिले जाते. प्रत्येक काहीशे स्टेप्सनंतर चेकपॉईंट लिहिणाऱ्या रनसाठी हे ठीक आहे, परंतु शेवटी लिहिणाऱ्या रनसाठी हे पूर्णपणे नुकसानकारक आहे, आणि डीफॉल्ट सेटिंग्ज तुम्हाला तेच देतात: Isaac-GR00T CLI प्रत्येक --save-steps (डीफॉल्ट 1000) नंतर लिहिते, परंतु lerobot चे --save_freq डीफॉल्ट 20,000 स्टेप्स आहे, त्यामुळे डीफॉल्ट SmolVLA रन एकदाच, अंतिम टप्प्यावर चेकपॉईंट करते. ते कमी करा, किंवा बोली लावू नका. AY-Robots प्रशिक्षण फॉर्म GR00T नॉबला saveSteps म्हणून दर्शवतो.
- सर्वात कमी प्रति तास दर उपलब्ध आहे.
- इमेज, CUDA आवृत्ती, lerobot किंवा Isaac-GR00T रिव्हिजन आणि प्रत्येक फ्लॅगवर पूर्ण नियंत्रण.
- जर तुमचा रन थांबवल्यानंतरही टिकून राहण्यासाठी पुरेसे चेकपॉईंट्स वारंवार लिहित असेल, तर व्यत्यय येण्याची शक्यता असलेली बोली दर अर्धा करते.
- काहीही अमूर्त केलेले नाही, त्यामुळे जेव्हा एखादा रन विचित्रपणे वागतो तेव्हा तुम्हाला त्याचे कारण कळू शकते.
- सेटअपसाठी GPU दराने बिल लागते: ड्रायव्हर्स, डिपेंडन्सीज, मल्टी-गिगाबाइट बेस चेकपॉईंट आणि डेटासेट डाउनलोड या सर्वांचा प्रति तास खर्च प्रशिक्षणाएवढाच असतो.
- जास्त बोली लागलेली व्यत्यय येण्याची शक्यता असलेली इन्स्टन्स थांबवली जाते आणि तिचे प्रक्रिया बंद केल्या जातात. न जतन केलेला रन म्हणजे पैसे वाया घालवणे, आणि lerobot डीफॉल्टनुसार 20,000 व्या स्टेपवर पहिला चेकपॉईंट लिहितो.
- तुमच्यासाठी पॉड कोणीही नष्ट करत नाही. वरील निष्क्रिय टेबल हे विसरल्याबद्दलचे बिल आहे.
- सिंगल पूर्ण 80 GB कार्ड्सचा पुरवठा कमी आहे: या वाचनात दोन A100 80 GB आणि पाच H100 80 GB पूर्ण-कार्ड ऑफर आहेत. सूची देखील बदलत राहते, त्यामुळे सर्वात स्वस्त सूचीबद्ध किंमत आणि तुम्ही प्रत्यक्षात भाड्याने घेऊ शकणारी किंमत समान नसते.
- इन्फ्रास्ट्रक्चरवर घालवलेला प्रत्येक तास म्हणजे पॉलिसी काम करते की नाही हे ठरवणारे एपिसोड रेकॉर्ड न केलेला तास.
स्वतः करणे विरुद्ध प्लॅटफॉर्मला कार्ड भाड्याने देऊ देणे
तुम्ही मशीन निवडता, वातावरण तयार करता आणि पॉड नष्ट करता. प्रति तास दर वरील बाजार दरानुसार असतो; बाकी सर्व तुमचा वेळ असतो.
- मॉडेलला आवश्यक असलेल्या VRAM शी जुळणारे कार्ड शोधा: ACT आणि SmolVLA साठी 24 GB, GR00T आणि Pi0.5 साठी 80 GB.
- जर रन थांबवल्यानंतर टिकू शकत नसेल तर ऑन-डिमांड भाड्याने घ्या, जर ते वारंवार चेकपॉईंट करत असेल तर व्यत्यय येण्याची शक्यता असलेले भाड्याने घ्या.
- टूलचेन स्थापित करा: ACT, SmolVLA आणि Pi0.5 साठी lerobot, GR00T साठी स्वतःच्या टायरो लाँचरसह Isaac-GR00T रिपॉझिटरी.
- आवश्यक असल्यास डेटासेट रूपांतरित करा. LeRobot v3.0 डेटासेट GR00T लोडर क्रॅश करतो आणि तो v2.1 मध्ये रूपांतरित करणे आवश्यक आहे.
- लाँच करा, लॉस पहा, चेकपॉईंट्स लिहिताना ते टिकाऊ ठिकाणी पुश करा.
- इन्स्टन्स नष्ट करा, नंतर तुम्ही ते नष्ट केले आहे याची खात्री करा.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>एका GR00T रनसाठी वास्तविक खर्च: H100 80 GB वर 3 ते 6 तास, प्रति तास 1.34 ते 2.34 USD दराने 4 ते 14 USD, अधिक 20 ते 40 मिनिटांचा सेटअप ज्याचे बिल देखील लागते, अधिक तुमचा स्वतःचा वेळ.
तुम्ही फॉर्ममध्ये मॉडेल, डेटासेट आणि हायपरपॅरामीटर्स निवडता. बॅकएंड मॉडेलला आवश्यक असलेल्या VRAM नुसार स्पॉट GPU भाड्याने घेते, ट्रेनर चालवते आणि चेकपॉईंट्स ऑब्जेक्ट स्टोरेजमध्ये लिहिते.
- प्रशिक्षण मॅट्रिक्सवर तुमचे संयोजन निवडा: पाच मॉडेल्स, चार आर्म्स, प्रति सेल एक मार्गदर्शक.
- ते एका डेटासेटवर निर्देशित करा: डेस्कटॉप क्लायंटने रेकॉर्ड केलेला, Hugging Face रेपो आयडी, किंवा तुमच्या स्वतःच्या मशीनमधील एक.
- डीफॉल्ट स्वीकारा किंवा ते समायोजित करा. वरील टेबलमध्ये ट्रेनरला प्रत्यक्षात काय पाठवले जाते ते दर्शविले आहे.
- बॅकएंड आवश्यक VRAM नुसार कार्ड निवडते, त्यामुळे तुम्हाला कधीही GPUs खरेदी करण्याची गरज नाही.
- चेकपॉईंट्स लिहिताना ऑब्जेक्ट स्टोरेजमध्ये जातात, त्यामुळे व्यत्यय आलेला रन हरवलेला रन नसतो.
| श्रेणी | मॉडेल्स | रन वेळ | प्रति रन खर्च |
|---|---|---|---|
| A100 80 GB किंवा H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 ते 6 तास | सुमारे 4 ते 12 USD |
| RTX 4090 किंवा कोणतेही 24 GB कार्ड | SmolVLA, ACT | 2 ते 5 तास | सुमारे 1 ते 3 USD |
ते काय करत नाही: खराब डेटासेट चांगला बनवणे, GR00T ला कधीही नसलेले सीड देणे, किंवा खाली वर्णन केलेली लेटन्सी मर्यादा काढून टाकणे. ते GPU खरेदी, वातावरण तयार करणे आणि तुम्ही नष्ट करायला विसरलेला पॉड काढून टाकते. यांत्रिकी प्रशिक्षण दस्तऐवजांमध्ये आहेत.
प्लॅटफॉर्म काय शुल्क आकारते आणि ते कार्ड कसे निवडते
हे तर्क हेतुपुरस्सर सोपे आहे. प्रत्येक मॉडेल कॅटलॉग मध्ये एक GPU टियर घोषित करते; बॅकएंड आवश्यक VRAM घेते आणि वर नमूद केलेल्या स्पॉट मार्केटमध्ये जुळणारे कार्ड भाड्याने देते. म्हणूनच उद्धृत केलेली किंमत एक श्रेणी आहे, निश्चित किंमत नाही. GR00T आणि Pi0.5 येथे केवळ क्लाउड-आधारित आहेत कारण त्यांना अनुक्रमे 40 GB आणि 70 GB किमान VRAM आवश्यक आहे. SmolVLA आणि ACT तुमच्या स्वतःच्या 24 GB कार्डवर स्थानिक पातळीवर देखील चालतात, जिथे क्लाउड खर्च शून्य असतो आणि वीज ही तुमची समस्या असते.

एका सेटिंगबद्दल चेतावणी देणे आवश्यक आहे. ग्रेडियंट ॲक्युमुलेशन GR00T च्या दोन्ही प्रकारांना खऱ्या अर्थाने लागू होते, त्यामुळे ते वाढवल्यास त्याच कार्डवर मोठा प्रभावी बॅच मिळतो. Pi0.5 आणि SmolVLA साठी ते अजिबात लागू होत नाही: lerobot 0.5.1 च्या प्रशिक्षण कॉन्फिगमध्ये ग्रेडियंट-ॲक्युमुलेशनचा पर्याय नाही, त्यामुळे हे फील्ड 16 वर सेट केल्यास काहीही खर्च होत नाही आणि काहीही मिळत नाही. जर एखादे रांगेतील काम कधीच सुरू झाले नाही, तर रांगेत अडकलेल्या कामाचे पृष्ठ काय तपासावे हे सांगते; जर रन सुरू होण्यापूर्वी डेटासेट नाकारला गेला, तर ते जवळजवळ नेहमीच v3.0 फॉरमॅटची समस्या.
सार्वजनिक इंटरनेटवर तुमची पॉलिसी सेवा देणारा भाड्याचा GPU कंट्रोल लूपमध्ये राउंड ट्रिप वाढवतो, जो आधीच प्रत्येक कृतीसाठी 20 ते 485 ms असतो. हळू पिक-अँड-प्लेससाठी ठीक आहे, पण जलद प्रतिक्रियाशील गतीसाठी नाही. क्लाउड इन्फरन्स चेकपॉईंटचे चांगले मूल्यांकन करतो आणि उत्पादन हाताळणी खराब करतो: जर कार्याला गतीची आवश्यकता असेल तर संगणक सर्व्होच्या शेजारी असावा लागतो, आणि ही एक किंमत आहे जी हा लेख अदृश्य करू शकत नाही. पहा इन्फरन्स लेटन्सी.
पहिल्या कार्यरत पॉलिसीसाठी तयार केलेले बजेट
सर्व चार ओळी एकत्र, काहीही नसताना सुरुवात करून. GPU एकूण 3 ते 5 रन गृहीत धरतो: पहिला पाइपलाइन कार्य करते हे सिद्ध करतो, दुसरा डेटा समस्या उघड करतो, तिसरा किंवा चौथा तुम्ही ठेवता तो असतो.
| ओळ | लीन मार्ग | आरामदायक मार्ग |
|---|---|---|
| आर्म | SO-100 फक्त फॉलोअर, BOM मध्ये 121.94 USD | लीडर अधिक फॉलोअर, BOM मध्ये 229.88 USD |
| मॉडेल | SmolVLA or ACT, 24 GB tier | GR00T N1.7, A100 80 GB or H100 tier |
| रेकॉर्ड केलेले एपिसोड | 30, the SmolVLA minimum | 50 ते 100 |
| रेकॉर्ड करण्यासाठी मानवी वेळ | सुमारे 1 तास 12 मिनिटे | 2 ते 4 तास |
| एका रनची किंमत | 1 ते 3 USD | 4 ते 12 USD |
| कार्य करण्यापूर्वीचे रन | 3 ते 5 | 3 ते 5 |
| एकूण GPU खर्च | 3 ते 15 USD | 12 ते 60 USD |
| बिलावरील सर्वात मोठी ओळ | आर्म, नंतर तुमचा वेळ | आर्म, नंतर तुमचा वेळ |
या रोबोटच्या आकारातही हेच स्वरूप कायम आहे: संगणकीय खर्च नगण्य आहे, हार्डवेअर ही एक वास्तविक एक-वेळची किंमत आहे, मानवी तास हा आवर्ती खर्च आहे. काहीही खरेदी करण्यापूर्वी प्रशिक्षण भागाची चाचणी घेण्यासाठी, तुम्हाला मॉडेल्सची तुलना करण्यास आणि हाताशिवाय GPU भाड्याने घेण्यास मदत करतात, आणि हा एक भौतिक SO-100 आहे जो तुम्ही ब्राउझरमध्ये कोणत्याही नोंदणीशिवाय चालवू शकता. संपूर्ण पाइपलाइनसाठी, सेटअप, आणि प्रशिक्षण समाविष्ट करते, आणि ही त्याची संक्षिप्त आवृत्ती आहे.

एका VLA फाइन-ट्यूनिंग रनचा एकूण खर्च किती येतो?▾
A100 80 GB किंवा H100 टियरवर GR00T N1.7, GR00T N1.5 किंवा Pi0.5 साठी सुमारे 4 ते 12 USD (प्रति तास 1.20 ते 2.00 USD दराने 3 ते 6 तास), आणि RTX 4090 टियरवर SmolVLA किंवा ACT साठी सुमारे 1 ते 3 USD (प्रति तास 0.30 ते 0.60 USD दराने 2 ते 5 तास). सेटअप वेळ विचारात घेतल्यास, स्वतः कार्ड भाड्याने घेतल्यास खर्च याच श्रेणीत येतो, कारण ते प्रशिक्षण दराने बिल केले जाते.
A100 80 GB च्या तुलनेत H100 साठी पैसे देणे फायदेशीर आहे का?▾
एका SO-100 पॉलिसीसाठी, सहसा नाही. GR00T आणि Pi0.5 ला आवश्यक असलेली मेमरी दोन्ही पूर्ण करतात, आणि 23 ऑगस्ट 2026 च्या आकडेवारीनुसार, पूर्ण A100 80 GB प्रति तास 0.44 USD पासून सुरू होते, तर H100 80 GB साठी 1.34 USD. H100 लवकर काम पूर्ण करते, त्यामुळे दर काही प्रमाणात कमी तासांच्या स्वरूपात परत मिळतो, परंतु इतक्या लहान रनसाठी एकूण खर्च अजूनही जास्त असतो. H100 साठी खरा युक्तिवाद उपलब्धता आहे: त्या बाजारात दोन A100 80 GB च्या तुलनेत पाच सिंगल H100 80 GB ऑफर उपलब्ध आहेत, आणि जे कार्ड तुम्ही भाड्याने घेऊ शकत नाही त्याची किंमत नसते.
एखादी पॉलिसी प्रत्यक्षात काम करण्यापूर्वी किती रन लागतात?▾
तीन ते पाच रनची योजना करा. पहिला रन पाइपलाइन योग्यरित्या जोडलेली आहे हे सिद्ध करतो. दुसरा रन सामान्यतः डेटासेटमधील समस्या उघड करतो, जसे की कॅमेरा स्ट्रीम अर्धवट बंद पडणे. तिसरा किंवा चौथा रन तो असतो जो तुम्ही ठेवता.
मी SmolVLA किंवा ACT भाड्याने घेण्याऐवजी माझ्या स्वतःच्या GPU वर प्रशिक्षित करू शकतो का?▾
होय. दोन्ही AY-Robots वर स्थानिक पातळीवर समर्थित आहेत आणि दोन्ही 24 GB मध्ये सहज बसतात; मूळ ACT पेपरने त्याचे 80M मॉडेल 11 GB RTX 2080 Ti वर सुमारे 5 तासांत प्रशिक्षित केले. GR00T आणि Pi0.5 येथे केवळ क्लाउड-आधारित आहेत कारण विक्रेत्यांच्या दस्तऐवजीकरणानुसार फाइन-ट्यूनिंगसाठी किमान 40 GB आणि 70 GB मेमरी आवश्यक आहे, आणि बाजारात उपलब्ध असलेले सर्वात मोठे ग्राहक कार्ड 32 GB RTX 5090 आहे.
मॉडेल्समध्ये समान संख्येच्या स्टेप्ससाठी वेगवेगळा खर्च का येतो?▾
स्टेप्सची तुलना पॉलिसींमध्ये करता येत नाही. ACT 24 GB कार्डवर बॅच 8 सह 100,000 स्टेप्सवर डीफॉल्ट करते; GR00T N1.5 80 GB कार्डवर ग्रेडियंट ॲक्युमुलेशन 16 सह बॅच 1 वर 2,000 स्टेप्सवर डीफॉल्ट करते. बिल हे मेमरीच्या गरजेनुसार तुम्हाला वापरण्यास भाग पाडलेल्या कार्डच्या दराने गुणाकार केलेल्या तासांवर आधारित असते, स्टेप काउंटरवर नाही.
तुमचा रन सुरू करण्यापूर्वी त्याचा खर्च किती येईल ते पहा
प्रत्येक पाच पॉलिसीमध्ये त्याचा GPU टियर, रन वेळ आणि प्रति रन किंमत सूचीबद्ध आहे, आणि प्रशिक्षण बॅकएंड याच स्पॉट मार्केटमधून कार्ड भाड्याने घेते जिथे हे आकडे मोजले गेले होते.
किंमत तपासाSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started