
वास्तविक स्पॉट-मार्केट GPU कीमतें, पाँचों नीतियों में से प्रत्येक को चलाने में कितना समय लगता है, आर्म और प्रदर्शनों की लागत क्या है, और वे चार स्थान जहाँ पैसा चुपचाप गायब हो जाता है।
संक्षिप्त संस्करण
- •A100 80 GB या H100 टियर पर एक रन में 3 से 6 घंटे लगते हैं और इसकी लागत लगभग 4 से 12 USD आती है। RTX 4090 टियर पर यह 2 से 5 घंटे और लगभग 1 से 3 USD है।
- •vast.ai पर 23 अगस्त 2026 को 13:44 UTC पर मापा गया: मांग पर एक पूर्ण RTX 4090 के लिए 0.13 से 0.38 USD/घंटा, एक A100 80 GB के लिए 0.44 से 0.67, एक H100 80 GB के लिए 1.34 से 2.34। पूर्ण 80 GB कार्ड दुर्लभ हैं, क्रमशः दो और पांच सिंगल-कार्ड ऑफ़र उपलब्ध हैं।
- •GPU सबसे सस्ती लाइन है। SO-ARM100 सामग्री बिल में एक लीडर प्लस फॉलोअर जोड़ी की कीमत 229.88 USD है, जो 24 GB टियर पर 77 से 230 रन के बराबर है।
- •एक व्यक्ति द्वारा 50 एपिसोड रिकॉर्ड करने में लगने वाले दो घंटे की लागत उन एपिसोड को फीड करने वाले प्रशिक्षण रन से अधिक होती है।
- •पैसा चार जगहों पर गायब होता है: खराब डेटा पर रन, 80M पॉलिसी द्वारा संभाले जाने वाले कार्यों पर 3B मॉडल, ऐसे GPU जिन्हें किसी ने नष्ट नहीं किया, और उन परिणामों के रीरन जिन्हें आप सहेजने में विफल रहे।
- •AY-Robots मॉडल को आवश्यक VRAM के अनुसार कार्ड का आकार निर्धारित करता है और इसे उसी स्पॉट मार्केट पर किराए पर लेता है, इसलिए रन की लागत बाजार लागत होती है।
बिल में चार लाइनें हैं, और GPU सबसे छोटी है
जब लोग पूछते हैं कि एक विजन-लैंग्वेज-एक्शन मॉडल SO-100 के लिए फाइन-ट्यून करने में कितना खर्च आता है, तो उनका मतलब लगभग हमेशा GPU का किराया होता है। यह वह संख्या है जो कार्ड पर शुल्क के रूप में दिखाई देती है, इसलिए यह वही है जो वास्तविक लगता है। यह भी, एक बड़े अंतर से, उन चार संख्याओं में सबसे छोटी है जो यह तय करती हैं कि एक कार्यशील पॉलिसी की आपको वास्तव में कितनी लागत आती है।
| लाइन | यह क्या है | एक कार्यशील पॉलिसी के लिए विशिष्ट आकार |
|---|---|---|
| GPU समय | रन के लिए एक कार्ड किराए पर लेना | प्रति रन 1 से 12 USD, और आप 3 से 5 रन करेंगे |
| रोबोट | सर्वो, मुद्रित फ्रेम, कैमरे, केबल, बिजली | एक बार, प्रति आर्म 110 से 500 EUR |
| मानव घंटे | डेमो रिकॉर्ड करने के लिए आर्म चलाने वाला व्यक्ति | प्रति डेटासेट 1 से 4 घंटे, प्रति कार्य दोहराया गया |
| अपशिष्ट | खराब डेटा, बड़े मॉडल, भूले हुए पॉड | असीमित, और एकमात्र लाइन जिसे आप नियंत्रित करते हैं |
नीचे दिए गए प्रशिक्षण समय पाँच मॉडलों के अपने पेपर और रिपॉजिटरी से लिए गए हैं, हार्डवेयर लागत प्रकाशित बिल ऑफ मटेरियल्स से है, प्लेटफॉर्म नंबर AY-Robots नीति कैटलॉग और मूल्य निर्धारण पृष्ठ से हैं। जहाँ प्लेटफॉर्म मदद नहीं करता, यह लेख ऐसा कहता है।
स्पॉट मार्केट में एक GPU घंटे की वास्तविक लागत क्या है
A100 घंटे के लिए कोई एक कीमत नहीं है। vast.ai जैसे मार्केटप्लेस पर हर होस्ट अपनी दर निर्धारित करता है, और प्रशिक्षण रन जिसे आप लॉन्च करते हैं, वह उस समय जो भी मशीन सस्ती और खाली होती है, उस पर उतरता है। ईमानदार जवाब एक वितरण है। यह यहाँ है, 23 अगस्त 2026 को 13:44 UTC पर मापा गया: एकल पूर्ण कार्ड, ऑन डिमांड, वास्तविक VRAM द्वारा फ़िल्टर किए गए।
| कार्ड | vast.ai ऑन डिमांड USD/घंटा (कम / औसत / उच्च) | पूर्ण-कार्ड ऑफ़र | vast.ai बिड फ्लोर | RunPod कम्युनिटी / सिक्योर | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
vast.ai पब्लिक बंडल API से एक सिंगल फुल GPU (gpu_frac == 1.0) के लिए ऑन-डिमांड ऑफ़र, जिसके लिए किसी खाते की आवश्यकता नहीं है, gpu_ram पर फ़िल्टर किया गया ताकि केवल वास्तविक 80 GB कार्ड ही 80 GB पंक्तियों में आएं। यह फ़िल्टर महत्वपूर्ण है: इस रीडिंग में सभी तीन सिंगल-कार्ड A100 SXM4 ऑफ़र 40 GB के थे, जैसे कि चार A100 PCIE ऑफ़र में से दो थे, इसलिए उन्हें एक "A100" पंक्ति में पूल करने से यहां रिपोर्ट की गई कीमत आधी हो जाती। Hugging Face कॉलम दो उत्पादों को मिलाता है: 2.50 USD/h Nvidia A100 - large Spaces हार्डवेयर है और 4.50 USD/h Inference Endpoints के तहत एक सिंगल H100 80 GB है, जो Spaces प्रदान नहीं करता है। माध्यिकाओं को सांकेतिक मानें: A100 80 GB पंक्ति दो ऑफ़र पर आधारित है और H100 पंक्ति पाँच पर, और 36 सेकंड बाद समान क्वेरी ने पाँच पंक्तियों में से तीन पर एक अलग 4090 गणना और एक अलग शीर्ष मूल्य लौटाया। RunPod की सूची कीमतें योजना बनाने के लिए अधिक स्थिर संख्या हैं।
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
3B मॉडल सस्ते कार्ड का उपयोग क्यों नहीं कर सकते
ऊपर दिए गए माध्यकों पर एक 4090 घंटे और एक H100 80 GB घंटे में लगभग छह गुना का अंतर होता है। जो चीज़ आपको महंगे कार्ड पर मजबूर करती है, वह गति नहीं, बल्कि मेमोरी है। openpi एक पूर्ण Pi0.5 के लिए न्यूनतम आवश्यकता निर्धारित करता है फाइन-ट्यून 70 GB पर, और NVIDIA GR00T के लिए 40 GB या उससे अधिक की सिफारिश करता है। ध्यान दें कि GR00T संख्या क्या नहीं है। इसका फाइन-ट्यून कॉन्फ़िग डिफ़ॉल्ट रूप से भाषा मॉडल और विज़ुअल एनकोडर को फ्रीज़ कर देता है (tune_llm और tune_visual False हैं, प्रोजेक्टर और डिफ्यूजन हेड True हैं), यही कारण है कि कैटलॉग में 3 B में से लगभग 40 M प्रशिक्षित पैरामीटर सूचीबद्ध हैं। 40 GB 3 B वज़न के लिए ऑप्टिमाइज़र स्टेट नहीं है, यह फ्रोजन बैकबोन और एक्टिवेशन है। कम-स्कोप वाले वेरिएंट कम होते हैं: openpi का LoRA पाथ 22.5 GB चाहता है और 4090 का नाम लेता है, और NVIDIA का Isaac Lab Arena वर्कफ़्लो GR00T पोस्ट-ट्रेनिंग के लिए 24 GB सिंगल-GPU विकल्प सूचीबद्ध करता है। प्लेटफ़ॉर्म उन न्यूनतम आवश्यकताओं पर आधारित है जो प्रत्येक विक्रेता उस कॉन्फ़िगरेशन के लिए प्रकाशित करता है जिसे वह वास्तव में चलाता है। pi0 फ्लो-मैचिंग राइट-अप बताता है कि वह फ्लो-मैचिंग फ़ुटप्रिंट कहाँ से आता है।
| कार्य | अपस्ट्रीम प्रोजेक्ट द्वारा आवश्यक मेमोरी | स्रोत |
|---|---|---|
| pi0 / pi0.5 अनुमान | 8 GB से अधिक, उदाहरण RTX 4090 | openpi |
| pi0 / pi0.5 LoRA फाइन-ट्यून | 22.5 GB से अधिक, उदाहरण RTX 4090 | openpi |
| pi0 / pi0.5 पूर्ण फाइन-ट्यून | 70 GB से अधिक, उदाहरण A100 80 GB या H100 | openpi |
| GR00T N1.7 अनुमान | 16 GB या अधिक के साथ 1 GPU | Isaac-GR00T |
| GR00T N1.7 फाइन-ट्यून | 40 GB या अधिक अनुशंसित, H100 या L40 नोड्स | Isaac-GR00T |
| GR00T फाइन-ट्यून, यह क्या प्रशिक्षित करता है | प्रोजेक्टर और डिफ्यूजन हेड; LLM और विज़ुअल एनकोडर डिफ़ॉल्ट रूप से फ्रीज़ होते हैं | finetune_config.py |
| GR00T पोस्ट-ट्रेनिंग, कम किया गया | 24 GB के साथ 1 GPU, भाषा मॉडल फ्रीज़ | Isaac Lab Arena |
| SmolVLA फाइन-ट्यून | संदर्भ 20,000-स्टेप रन के लिए सिंगल A100 | lerobot docs |
| ACT प्रशिक्षण | एक सिंगल 11 GB RTX 2080 Ti | ACT paper |
वह तालिका ही कारण है कि प्लेटफ़ॉर्म पाँच मॉडलों को दो स्तरों में विभाजित करता है। GR00T N1.7, GR00T N1.5 और Pi0.5 A100 80 GB या H100 पर चलते हैं क्योंकि विक्रेता यही मांगते हैं। SmolVLA और ACT RTX 4090 या किसी भी 24 GB कार्ड पर चलते हैं क्योंकि वह वास्तव में पर्याप्त है।
24 GB कार्ड पर GR00T या Pi0.5 रन तुरंत विफल नहीं होता है। यह बेस चेकपॉइंट डाउनलोड करता है, डेटासेट इंडेक्स बनाता है, पहला फॉरवर्ड पास शुरू करता है और कुछ सौ चरणों के बाद CUDA आउट-ऑफ-मेमोरी त्रुटि के साथ बंद हो जाता है। आपने डाउनलोड और सेटअप के लिए भुगतान किया और कुछ भी नहीं मिला। समाधान: प्रशिक्षण के दौरान मेमोरी से बाहर।
पांच मॉडल में से प्रत्येक वास्तव में कितनी देर तक चलता है
रन टाइम लागत का दूसरा पहलू है: यदि काम 40 मिनट का है तो 2.00 USD प्रति घंटा अप्रासंगिक है, और यदि यह 40 घंटे का है तो विनाशकारी है। ये वे डिफ़ॉल्ट सेटिंग्स हैं जो AY-Robots वास्तव में ट्रेनर को भेजता है, जिसमें प्रत्येक टियर के लिए रन विंडो और लागत शामिल है।
| पॉलिसी | GPU टियर | डिफ़ॉल्ट अधिकतम स्टेप्स | डिफ़ॉल्ट बैच (ग्रेडिएंट एक्यूमुलेशन) | रन विंडो | प्रति रन लागत |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, एक्यूमुलेशन 1, लागू होता है | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, एक्यूमुलेशन 16, लागू होता है | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, एक्यूमुलेशन 16, कोई प्रभाव नहीं | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, एक्यूमुलेशन 8, कोई प्रभाव नहीं | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, एक्यूमुलेशन 1 | 2 to 5 h | 1 to 3 USD |

वे रन विंडो अपस्ट्रीम से कहाँ से आती हैं
- SmolVLA: lerobot दस्तावेज़ में कहा गया है कि 20,000 स्टेप्स एक सिंगल A100 पर लगभग 4 घंटे लेते हैं। प्लेटफ़ॉर्म वही 20,000 स्टेप्स सस्ते 24 GB टियर पर चलाता है, इसलिए 4 घंटे के बजाय एक विंडो मिलती है।
- ACT: मूल ALOHA पेपर एक 80M-पैरामीटर मॉडल के लिए सिंगल 11 GB RTX 2080 Ti पर लगभग 5 घंटे की रिपोर्ट करता है। एक 4090 कई पीढ़ियों नया है, लेकिन प्लेटफ़ॉर्म 100,000 स्टेप्स का बजट रखता है, इसलिए विंडो उसी जगह पर आती है।
- GR00T: N1.6 जनरेशन के लिए NVIDIA का संदर्भ वर्कफ़्लो आठ L40S कार्ड पर बैच 24 पर 20,000 स्टेप्स के लिए लगभग 4 से 8 घंटे, और सिंगल Ada 6000 पर बैच 16 पर 30,000 स्टेप्स के लिए 2 से 3 घंटे बताता है। कुछ घंटों में 3B VLA का सिंगल-कार्ड फाइन-ट्यूनिंग सामान्य है, आशावादी नहीं।
- Pi0.5: openpi कोई वॉल-क्लॉक आंकड़ा प्रकाशित नहीं करता है, लेकिन यह पूर्ण फाइन-ट्यून के लिए 70 GB की न्यूनतम आवश्यकता प्रकाशित करता है, जो कार्ड और इसलिए दर को निर्धारित करता है।
उस संख्या पर रुकना उचित है जिसके लिए आप भुगतान नहीं कर रहे हैं। GR00T N1 पेपर 2.2B मॉडल को प्रीट्रेन करने के लिए लगभग 50,000 H100 GPU घंटे की रिपोर्ट करता है, जो 1024 GPUs तक के क्लस्टर पर, 16,384 के प्रीट्रेनिंग बैच आकार पर 200,000 ग्रेडिएंट स्टेप्स के लिए है। ऊपर मापी गई 1.34 से 2.34 USD प्रति घंटे की दर से यह 67,000 से 117,000 USD के किराए के कंप्यूट के बराबर है। SmolVLA पेपर अपने प्रोजेक्ट को 481 सामुदायिक डेटासेट, 22.9K एपिसोड और 10.6M फ़्रेम पर लगभग 30,000 GPU घंटे पर रखता है। आप इसे डाउनलोड की कीमत पर प्राप्त करते हैं; आपके 8 USD अंतिम 20,000 स्टेप्स खरीदते हैं। VLAs इस तरह क्यों बनाए जाते हैं उस विभाजन को कवर करता है।
आर्म: एक बार की लागत जो GPU बिल को बौना कर देती है
एक प्रशिक्षण रन का खर्च दोपहर के भोजन से कम होता है। रोबोट का नहीं। इसीलिए SO-100 महत्वपूर्ण है: यह सबसे सस्ता आर्म है जिसे पूरी इमिटेशन लर्निंग टूलचेन वास्तव में समर्थन करती है।
| आर्म | सर्वो | वोल्टेज | पुर्जों की लागत | AY-Robots पर समर्थन |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | पूर्ण, संदर्भ आर्म |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | पूर्ण |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | संगत |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | संगत |
SO-ARM100 रिपॉजिटरी में अपस्ट्रीम बिल ऑफ मटेरियल्स अधिक विस्तृत है और आपके क्षेत्र के अनुसार जांचने लायक है: इसकी दो आर्म्स के लिए पुर्जे सूची में एक लीडर प्लस फॉलोअर सेटअप के लिए कुल 229.88 USD या 226.30 EUR हैं, और इसकी एक फॉलोअर आर्म के लिए पुर्जे सूची में कुल 121.94 USD या 124.30 EUR हैं। 13.89 USD प्रत्येक के हिसाब से छह STS3215 सर्वो उस 121.94 में से 83.34 के हैं, इसलिए सर्वो ही आर्म हैं। प्रति SmolVLA या ACT रन 1 से 3 USD पर, आर्म्स की एक जोड़ी 77 से 230 प्रशिक्षण रनों के बराबर है। यदि आप अभी भी चुन रहे हैं, तो SO-100 बनाम SO-101 वह तुलना है जो मायने रखती है, क्योंकि दोनों इतने करीब हैं कि निर्णय क्षमता के बजाय उपलब्धता के बारे में है।
STS3215 7.4 V और 12 V वेरिएंट में आता है; रिपॉजिटरी नोट करती है कि 12 V वाले हिस्से को 5 V वाले के बजाय 12 V 5 A सप्लाई की भी आवश्यकता होती है, इसलिए दोनों विनिमेय नहीं हैं। 7.4 V सर्वो में 12 V फीड करने से वे नष्ट हो जाते हैं, और छह सर्वो एक फॉलोअर आर्म के पुर्जों की लागत का दो-तिहाई होते हैं। पहली बार पावर-अप करने से पहले हर सर्वो पर लेबल की जांच करें। यदि सर्वो पहले से ही अजीब व्यवहार करते हैं: सर्वो प्रतिक्रिया नहीं दे रहा है, आर्म झटके मारता है फिर ढीला पड़ जाता है।
मानव घंटे: वह पंक्ति जिसे कोई स्प्रेडशीट में नहीं डालता
यह वह संख्या है जो लागत चर्चा को पूरी तरह बदल देती है। प्रदर्शनों को रिकॉर्ड करना एक व्यक्ति द्वारा रोबोट आर्म को एक-एक एपिसोड करके, वास्तविक समय में हिलाना है। इसमें कोई बैचिंग नहीं है और न ही इसे प्रति सेकंड किराए पर लिया जा सकता है। LeRobot dataset रिकॉर्डर डिफ़ॉल्ट सेटिंग्स के साथ आता है जो गणना को आसान बनाती हैं, ये तीनों DatasetRecordConfig: प्रति एपिसोड 60 सेकंड, दृश्य को रीसेट करने के लिए 60 सेकंड, 50 एपिसोड। नीचे दी गई पैसे की कॉलम किसी व्यक्ति के एक घंटे के समय के लिए 15 USD मानती है, जो एक धारणा है न कि प्लेटफ़ॉर्म संख्या। अपनी दर बदलें; अनुपात ही मुख्य बात है।
- 1डिफ़ॉल्ट सेटिंग्स के साथ डेटासेट रिकॉर्ड करें जिनके लिए आपको वास्तव में बिल किया जाएगा
यह lerobot 0.6.1 है, जो 3 अगस्त 2026 तक PyPI पर उपलब्ध संस्करण है। CLI आकार पर ध्यान दें: रिकॉर्डिंग पुराने
python -m lerobot.scripts.recordमॉड्यूल पथ के बजायlerobot-recordकंसोल एंट्री पॉइंट (lerobot.scripts.lerobot_record) के माध्यम से चलती है। AY-Robots 0.5.1 को लक्षित करता है, और 0.5.1 व्हील समानlerobot-recordऔरlerobot-trainएंट्री पॉइंट घोषित करता है, इसलिए नीचे दिया गया आकार दोनों में स्थिर है। तीन टाइमिंग फ्लैग अपस्ट्रीम डिफ़ॉल्ट हैं, इसलिए यह वह कमांड भी है जिसे अगली तालिका में गणना मानती है।bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2एक भी GPU मिनट किराए पर लेने से पहले देखें कि आपने क्या रिकॉर्ड किया है
एक डेटासेट का निरीक्षण करने में प्रति घंटे शून्य USD लागत आती है। लॉस कर्व से उसी समस्या का पता लगाने में H100 टियर पर प्रति घंटे 2.00 USD लागत आती है और आपको चार घंटे देर से पता चलता है। डेटासेट को पुश करें और इसे LeRobot व्यूअर में स्क्रैब करें, या AY-Robots डेटासेट डायरेक्टरी ब्राउज़ करें।
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3ट्रेन करें, और सुनिश्चित करें कि चेकपॉइंट पॉड से अधिक समय तक जीवित रहे
एक किराए की मशीन परिभाषा के अनुसार अस्थायी होती है, इसलिए रन के दौरान चेकपॉइंट्स को कहीं टिकाऊ जगह पर लिखें। दो फ्लैग तय करते हैं कि आप अपने भुगतान की गई चीज़ को रखते हैं या नहीं।
--save_freqडिफ़ॉल्ट रूप से 20,000 स्टेप्स पर सेट होता है, इसलिए एक डिफ़ॉल्ट 20,000-स्टेप SmolVLA रन अपना पहला चेकपॉइंट तब लिखता है जब रन पहले ही खत्म हो चुका होता है; इसे किराए पर लेने से पहले कम करें।--save_checkpoint_to_hubको--policy.repo_idकी आवश्यकता होती है और lerobot 0.5.1 में मौजूद नहीं है, इसलिए उस संस्करण पर आप आउटपुट डायरेक्टरी को मशीन से खुद कॉपी करते हैं। नीचे दिया गया बैच आकार अपस्ट्रीम डॉक का उदाहरण है; AY-Robots फॉर्म SmolVLA के लिए 2 भेजता है और चेकपॉइंट्स के प्रकट होने पर ऑब्जेक्ट स्टोरेज में लिखता है।bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| एपिसोड | 60 सेकंड पर रिकॉर्डिंग | 60 सेकंड पर रीसेट करना | वास्तविक समय | प्लस 20 प्रतिशत री-रिकॉर्ड | प्रति मानव घंटे 15 USD पर |
|---|---|---|---|---|---|
| 30, SmolVLA न्यूनतम | 30 मिनट | 30 मिनट | 1 घंटा 00 मिनट | 1 घंटा 12 मिनट | लगभग 18 USD |
| 50, अन्य चार न्यूनतम | 50 मिनट | 50 मिनट | 1 घंटा 40 मिनट | 2 घंटा 00 मिनट | लगभग 30 USD |
| 100, एक आरामदायक डेटासेट | 100 मिनट | 100 मिनट | 3 घंटा 20 मिनट | 4 घंटा 00 मिनट | लगभग 60 USD |
दाहिने कॉलम की तुलना 1 से 12 USD के रन लागत से करें। उस अनुमानित दर पर, 50-एपिसोड वाले डेटासेट को रिकॉर्ड करने में प्रशिक्षण लागत से दो से सात गुना अधिक खर्च आता है, जिसमें कैलिब्रेशन, कैमरा सेटअप और हटाए गए एपिसोड शामिल नहीं हैं। यही कारण है कि का सीधा मौद्रिक मूल्य है। lerobot गाइड प्रति वस्तु स्थान पर 10 के साथ कम से कम 50 एपिसोड का सुझाव देती है; SmolVLA डॉक्स रिपोर्ट करते हैं कि उसी कार्य का 25-एपिसोड वाला संस्करण पर्याप्त नहीं था।
पैसा वास्तव में कहाँ गायब होता है
1. ऐसे डेटा पर रन जो कभी काम नहीं करने वाला था
दो स्वैप्ड कैमरा स्ट्रीम वाले डेटासेट पर 20,000-स्टेप का GR00T रन एक क्लीन डेटासेट पर चलने वाले रन के समान लागत लेता है, उतना ही समय लेता है, और एक लॉस कर्व उत्पन्न करता है जो ठीक दिखता है। विफलता घंटों बाद आर्म पर दिखाई देती है। का बिल प्रति घंटे के हिसाब से होता है और निदान का बिल दिनों में होता है। याद रखने योग्य दो लक्षण: का आमतौर पर मतलब है कि अवलोकन में वह जानकारी नहीं है जिसकी कार्य को आवश्यकता है, और का मतलब है कि डेटासेट में आपकी सोच से कम भिन्नता थी।
2. एक निश्चित-कैमरा कार्य के लिए फाउंडेशन-मॉडल की कीमतें चुकाना
ACT में लगभग 80M पैरामीटर हैं और इसे एक कार्य के 50 प्रदर्शनों पर स्क्रैच से प्रशिक्षित करने के लिए डिज़ाइन किया गया था। GR00T N1.7 में एक प्रीट्रेन्ड बैकबोन के साथ लगभग 3B पैरामीटर हैं। एक बोल्ट-डाउन कैमरे, एक निश्चित मेज और एक वस्तु के लिए, 80M मॉडल अक्सर काम करता है, 152 ms के बजाय प्रति एक्शन स्टेप लगभग 20 ms पर चलता है, और 4 से 12 USD के बजाय प्रति रन 1 से 3 USD का खर्च आता है। महंगे मॉडल पर 12 USD खर्च करने से पहले यह पता लगाने के लिए 3 USD खर्च करें कि क्या सस्ता मॉडल काम करता है। ACT बनाम SmolVLA और GR00T N1.7 बनाम Pi0.5 दिखाते हैं कि प्रत्येक कहाँ सही उत्तर होना बंद कर देता है; मॉडल एरेना में 85 मॉडल और 332 बेंचमार्क परिणाम हैं।
3. वह GPU जिसे आप भूल गए थे
रोकने के लिए सबसे सस्ती गलती और करने के लिए सबसे आम गलती। शुक्रवार को कुछ डीबग करने के लिए शुरू किया गया एक इंस्टेंस सप्ताहांत में वास्तविक रन के समान दर पर बिल होता है।
| कार्ड | स्नैपशॉट में औसत दर | 24 घंटे निष्क्रिय | 7 दिन निष्क्रिय | उसकी कीमत है |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | लगभग 27 SmolVLA या ACT रन 2 USD पर |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | लगभग 12 GR00T रन 8 USD पर |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | लगभग 38 GR00T रन 8 USD पर |
AY-Robots पर, यह विफलता अनुमान के लिए डिज़ाइन की गई है: अनुमान API द्वारा प्रावधानित पॉड्स एक निष्क्रिय वॉचडॉग ले जाते हैं और एक निष्क्रिय अवधि के बाद खुद को नष्ट कर देते हैं। यदि आप कार्ड खुद किराए पर लेते हैं, तो वह वॉचडॉग आपका कैलेंडर रिमाइंडर है।
4. एक ही उत्तर के लिए दो बार भुगतान करना
GR00T का फाइन-ट्यूनिंग एंट्री पॉइंट एक टायरो CLI है जो कोई सीड उजागर नहीं करता है। यह कोई प्लेटफॉर्म सीमा नहीं है, यह अपस्ट्रीम टूल है: gr00t/configs/finetune_config.py में कोई सीड फ़ील्ड नहीं है, और रिपॉजिटरी के अपने प्रशिक्षण सुझाव चेतावनी देते हैं कि रन 5 से 6 प्रतिशत तक भिन्न होते हैं क्योंकि इमेज ऑग्मेंटेशन गैर-नियतात्मक होते हैं। lerobot 0.5.1 और 0.6.1 दोनों में सीड 1000 पर डिफ़ॉल्ट होता है, इसलिए ACT, SmolVLA और Pi0.5 रन को कम से कम उसी इनिशियलाइज़ेशन और डेटा ऑर्डर से फिर से चलाया जा सकता है। यह GPU पर बिट-आइडेंटिकल वेट्स का वादा नहीं है, लेकिन यह एक रीरन और एक नए प्रयोग के बीच का अंतर है। यदि एक GR00T रन एक ऐसी पॉलिसी बनाता है जो काम करती है और आपने चेकपॉइंट नहीं रखा, तो आप एक ऐसे परिणाम के लिए पूरी कीमत चुकाते हैं जो उस अंतर से अधिक भिन्न हो सकता है जिसका आप पीछा कर रहे थे। आपके द्वारा भुगतान किए गए चेकपॉइंट को खोने का एक दूसरा तरीका है: CLI डिफ़ॉल्ट रूप से --save-total-limit 5 पर सेट होता है, जिसे पुराने चेकपॉइंट्स को हटाए जाने से पहले रखे जाने वाले चेकपॉइंट्स की अधिकतम संख्या के रूप में प्रलेखित किया गया है। स्टोरेज कुछ सेंट का है; एक रीरन 4 से 12 USD और छह घंटे का होता है।
ऊपर दिए गए बिड फ़्लोर ऑन-डिमांड दर का एक अंश हैं, और vast.ai का कहना है कि बिडिंग सिस्टम क्लाइंट की लागत को पचास प्रतिशत या उससे अधिक कम कर सकता है। इसकी अपनी शब्दों में कमी यह है: एक बाधित करने योग्य इंस्टेंस को किसी भी समय रोका जा सकता है यदि कोई अन्य उपयोगकर्ता अधिक बोली लगाता है या उन्हीं संसाधनों के लिए ऑन-डिमांड रेंटल बनाया जाता है, और वह विराम "चल रही सभी प्रक्रियाओं को रोक देता है"। ऑन-डिमांड को हमेशा प्राथमिकता मिलती है। यह उन रन के लिए ठीक है जो हर कुछ सौ चरणों में एक चेकपॉइंट लिखते हैं, लेकिन उन रन के लिए पूरी तरह से नुकसानदायक है जो अंत में लिखते हैं, और डिफ़ॉल्ट रूप से आपको यही मिलता है: Isaac-GR00T CLI हर --save-steps (डिफ़ॉल्ट 1000) पर लिखता है, लेकिन lerobot का --save_freq डिफ़ॉल्ट रूप से 20,000 चरणों पर सेट है, इसलिए एक डिफ़ॉल्ट SmolVLA रन फिनिश लाइन पर एक बार चेकपॉइंट करता है। इसे कम करें, या बोली न लगाएं। AY-Robots प्रशिक्षण फ़ॉर्म GR00T नॉब को saveSteps के रूप में दिखाता है।
- सबसे कम प्रति घंटा दर।
- इमेज, CUDA संस्करण, lerobot या Isaac-GR00T संशोधन और हर फ़्लैग पर पूर्ण नियंत्रण।
- यदि आपका रन इतनी बार चेकपॉइंट करता है कि वह रुकने के बाद भी जीवित रह सके, तो बाधित करने योग्य बोली दर को आधा कर देती है।
- कुछ भी अमूर्त नहीं है, इसलिए जब कोई रन अजीब व्यवहार करता है तो आप देख सकते हैं कि ऐसा क्यों है।
- सेटअप का बिल GPU दरों पर आता है: ड्राइवर, डिपेंडेंसी, मल्टी-गीगाबाइट बेस चेकपॉइंट और डेटासेट डाउनलोड सभी की प्रति घंटा लागत प्रशिक्षण के समान होती है।
- एक अधिक बोली वाला बाधित करने योग्य इंस्टेंस रोक दिया जाता है और उसकी प्रक्रियाएं समाप्त कर दी जाती हैं। एक बिना सहेजा गया रन पैसे की बर्बादी है, और lerobot डिफ़ॉल्ट रूप से अपना पहला चेकपॉइंट 20,000वें चरण पर लिखता है।
- आपके लिए पॉड को कोई नष्ट नहीं करता। ऊपर दी गई निष्क्रिय तालिका भूलने का बिल है।
- सिंगल फुल 80 GB कार्ड की आपूर्ति कम है: इस रीड में दो A100 80 GB और पांच H100 80 GB फुल-कार्ड ऑफ़र हैं। लिस्टिंग भी बदलती रहती है, इसलिए सबसे सस्ती सूचीबद्ध कीमत और वह कीमत जिस पर आप वास्तव में किराए पर ले सकते हैं, समान नहीं हैं।
- इंफ्रास्ट्रक्चर पर बिताया गया हर घंटा उन एपिसोड को रिकॉर्ड करने में खर्च नहीं किया गया घंटा है जो यह तय करते हैं कि नीति काम करती है या नहीं।
खुद करना बनाम प्लेटफ़ॉर्म को कार्ड किराए पर लेने देना
आप मशीन चुनते हैं, वातावरण बनाते हैं और पॉड को नष्ट करते हैं। प्रति घंटा दर ऊपर दी गई बाजार दर है; बाकी सब आपका समय है।
- मॉडल को आवश्यक VRAM से मेल खाने वाला कार्ड ढूंढें: ACT और SmolVLA के लिए 24 GB, GR00T और Pi0.5 के लिए 80 GB।
- यदि रन रुकने के बाद जीवित नहीं रह सकता है तो ऑन-डिमांड किराए पर लें, यदि यह अक्सर चेकपॉइंट करता है तो बाधित करने योग्य किराए पर लें।
- टूलचेन स्थापित करें: ACT, SmolVLA और Pi0.5 के लिए lerobot, GR00T के लिए अपने स्वयं के टायरो लॉन्चर के साथ Isaac-GR00T रिपॉजिटरी।
- यदि आवश्यक हो तो डेटासेट को परिवर्तित करें। एक LeRobot v3.0 डेटासेट GR00T लोडर को क्रैश कर देता है और इसे v2.1 में परिवर्तित किया जाना चाहिए।
- लॉन्च करें, लॉस देखें, चेकपॉइंट्स को कहीं टिकाऊ जगह पर धकेलें जैसे ही वे लिखे जाते हैं।
- इंस्टेंस को नष्ट करें, फिर जांचें कि आपने इसे नष्ट कर दिया है।
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>एक GR00T रन की वास्तविक लागत: H100 80 GB पर 1.34 से 2.34 USD प्रति घंटे की दर से 3 से 6 घंटे 4 से 14 USD है, साथ ही 20 से 40 मिनट का सेटअप भी बिल होता है, साथ ही आपका अपना समय भी।
आप एक फ़ॉर्म में मॉडल, डेटासेट और हाइपरपैरामीटर चुनते हैं। बैकएंड मॉडल को आवश्यक VRAM के आकार का एक स्पॉट GPU किराए पर लेता है, ट्रेनर चलाता है और चेकपॉइंट्स को ऑब्जेक्ट स्टोरेज में लिखता है।
- प्रशिक्षण मैट्रिक्स पर अपना संयोजन चुनें: पांच मॉडल, चार आर्म्स, प्रति सेल एक गाइड।
- इसे एक डेटासेट पर इंगित करें: डेस्कटॉप क्लाइंट के साथ रिकॉर्ड किया गया एक, एक Hugging Face रेपो आईडी, या आपकी अपनी मशीन से एक।
- डिफ़ॉल्ट स्वीकार करें या उन्हें समायोजित करें। ऊपर दी गई तालिका वह है जो वास्तव में ट्रेनर को भेजी जाती है।
- बैकएंड आवश्यक VRAM द्वारा कार्ड चुनता है, इसलिए आपको कभी भी GPUs के लिए खरीदारी नहीं करनी पड़ती।
- चेकपॉइंट्स लिखे जाने पर ऑब्जेक्ट स्टोरेज में आते हैं, इसलिए एक बाधित रन खोया हुआ रन नहीं होता है।
| टियर | मॉडल | रन समय | प्रति रन लागत |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
यह क्या नहीं करता है: एक खराब डेटासेट को अच्छा बनाना, GR00T को एक सीड देना जो उसके पास कभी नहीं था, या नीचे वर्णित विलंबता सीमा को हटाना। यह GPU खरीदारी, वातावरण निर्माण और उस पॉड को हटा देता है जिसे आप नष्ट करना भूल गए थे। इसकी कार्यप्रणाली प्रशिक्षण दस्तावेज़ों में है।
प्लेटफ़ॉर्म क्या शुल्क लेता है और वह कार्ड कैसे चुनता है
तर्क जानबूझकर सीधा है। हर मॉडल कैटलॉग में एक GPU टियर घोषित करता है; बैकएंड आवश्यक VRAM लेता है और ऊपर मापे गए उसी स्पॉट मार्केट पर एक मेल खाने वाला कार्ड किराए पर लेता है। यही कारण है कि उद्धृत लागत एक सीमा है, कीमत नहीं। GR00T और Pi0.5 यहाँ केवल क्लाउड-आधारित हैं क्योंकि इनमें 40 GB और 70 GB की न्यूनतम आवश्यकता है। SmolVLA और ACT आपके अपने 24 GB कार्ड पर स्थानीय रूप से भी चलते हैं, जहाँ क्लाउड लागत शून्य होती है और बिजली आपकी समस्या होती है।

एक सेटिंग पर ध्यान देना ज़रूरी है। ग्रेडिएंट एक्यूमुलेशन वास्तव में GR00T के दोनों वेरिएंट पर लागू होता है, इसलिए इसे बढ़ाने से उसी कार्ड पर एक बड़ा प्रभावी बैच मिलता है। Pi0.5 और SmolVLA के लिए यह बिल्कुल लागू नहीं होता है: lerobot 0.5.1 में इसकी प्रशिक्षण कॉन्फ़िग में कोई ग्रेडिएंट-एक्यूमुलेशन विकल्प नहीं है, इसलिए फ़ील्ड को 16 पर सेट करने से कुछ भी खर्च नहीं होता और कुछ भी नहीं मिलता। यदि कोई कतारबद्ध कार्य कभी शुरू नहीं होता है, कतार में फंसे कार्य का पृष्ठ बताता है कि क्या जांचना है; यदि रन शुरू होने से पहले डेटासेट अस्वीकृत हो जाता है, तो यह लगभग हमेशा v3.0 प्रारूप की समस्या।
सार्वजनिक इंटरनेट पर आपकी नीति को सेवा प्रदान करने वाला एक किराए का GPU एक नियंत्रण लूप में राउंड ट्रिप जोड़ता है जो पहले से ही प्रति एक्शन स्टेप 20 से 485 ms है। धीमी पिक-एंड-प्लेस के लिए ठीक है, लेकिन तेज़ प्रतिक्रियाशील गति के लिए नहीं। क्लाउड इन्फरेंस एक चेकपॉइंट का अच्छी तरह से मूल्यांकन करता है और उत्पादन हेरफेर को खराब तरीके से चलाता है: यदि कार्य को गति की आवश्यकता है तो कंप्यूट को सर्वो के बगल में बैठना होगा, और यह एक लागत है जिसे यह लेख गायब नहीं कर सकता। देखें इन्फरेंस लेटेंसी।
पहली कार्यशील नीति के लिए एक विस्तृत बजट
सभी चार लाइनें एक साथ, शून्य से शुरू होकर। GPU कुल 3 से 5 रन मानता है: पहला पाइपलाइन के काम करने को साबित करता है, दूसरा डेटा समस्या को उजागर करता है, तीसरा या चौथा वह है जिसे आप रखते हैं।
| मद | लीन पाथ | आरामदायक पाथ |
|---|---|---|
| आर्म | SO-100 केवल फॉलोअर, BOM में 121.94 USD | लीडर प्लस फॉलोअर, BOM में 229.88 USD |
| मॉडल | SmolVLA or ACT, 24 GB tier | GR00T N1.7, A100 80 GB or H100 tier |
| रिकॉर्ड किए गए एपिसोड | 30, the SmolVLA minimum | 50 to 100 |
| रिकॉर्ड करने में मानवीय समय | लगभग 1 घंटा 12 मिनट | 2 से 4 घंटे |
| एक रन की लागत | 1 to 3 USD | 4 to 12 USD |
| काम करने से पहले के रन | 3 to 5 | 3 to 5 |
| कुल GPU खर्च | 3 to 15 USD | 12 to 60 USD |
| बिल पर सबसे बड़ी मद | आर्म, फिर आपका समय | आर्म, फिर आपका समय |
इस आकार के रोबोट पर भी यही पैटर्न लागू होता है: कंप्यूट एक मामूली त्रुटि है, हार्डवेयर एक वास्तविक एकमुश्त लागत है, मानवीय घंटे आवर्ती खर्च हैं। कुछ भी खरीदने से पहले प्रशिक्षण वाले हिस्से का परीक्षण करने के लिए, आपको मॉडल की तुलना करने और बिना किसी आर्म के GPU किराए पर लेने की सुविधा देते हैं, और एक भौतिक SO-100 है जिसे आप बिना साइनअप के ब्राउज़र में चला सकते हैं। पूरी एंड-टू-एंड पाइपलाइन के लिए, सेटअप, और प्रशिक्षण को कवर करती है, और इसका संक्षिप्त संस्करण है।

एक VLA फाइन-ट्यूनिंग रन की कुल लागत कितनी आती है?▾
A100 80 GB या H100 टियर पर GR00T N1.7, GR00T N1.5 या Pi0.5 के लिए लगभग 4 से 12 USD (1.20 से 2.00 USD प्रति घंटे की दर से 3 से 6 घंटे), और RTX 4090 टियर पर SmolVLA या ACT के लिए लगभग 1 से 3 USD (0.30 से 0.60 USD प्रति घंटे की दर से 2 से 5 घंटे)। कार्ड को स्वयं किराए पर लेने पर सेटअप समय गिनने के बाद लागत इसी सीमा में आती है, क्योंकि इसका बिल प्रशिक्षण दर पर होता है।
क्या A100 80 GB के मुकाबले H100 के लिए भुगतान करना उचित है?▾
एकल SO-100 पॉलिसी के लिए, आमतौर पर नहीं। दोनों GR00T और Pi0.5 को आवश्यक मेमोरी फ्लोर प्रदान करते हैं, और 23 अगस्त 2026 के आंकड़ों के अनुसार एक पूर्ण A100 80 GB की लागत 0.44 USD प्रति घंटा थी, जबकि H100 80 GB की 1.34 USD थी। H100 जल्दी काम पूरा करता है, इसलिए दर का कुछ हिस्सा कम घंटों के रूप में वापस मिल जाता है, लेकिन इतने छोटे रन के लिए कुल लागत अभी भी अधिक होती है। H100 के लिए असली तर्क उपलब्धता है: उस बाजार में दो A100 80 GB के मुकाबले पांच एकल H100 80 GB ऑफ़र उपलब्ध हैं, और जिस कार्ड को आप किराए पर नहीं ले सकते उसकी कोई कीमत नहीं होती।
एक पॉलिसी के वास्तव में काम करने से पहले कितने रन लगते हैं?▾
तीन से पांच की योजना बनाएं। पहला यह साबित करता है कि पाइपलाइन सही ढंग से जुड़ी हुई है। दूसरा आमतौर पर एक डेटासेट समस्या को उजागर करता है, जैसे कि एक कैमरा स्ट्रीम जो बीच में ही बंद हो गई। तीसरा या चौथा वह है जिसे आप रखते हैं।
क्या मैं किराए पर लेने के बजाय अपने स्वयं के GPU पर SmolVLA या ACT को प्रशिक्षित कर सकता हूँ?▾
हाँ। दोनों AY-Robots पर स्थानीय रूप से समर्थित हैं और दोनों 24 GB में आराम से फिट होते हैं; मूल ACT पेपर ने अपने 80M मॉडल को 11 GB RTX 2080 Ti पर लगभग 5 घंटे में प्रशिक्षित किया था। GR00T और Pi0.5 यहाँ केवल क्लाउड-आधारित हैं क्योंकि विक्रेताओं के दस्तावेज़ों में फाइन-ट्यूनिंग के लिए न्यूनतम आवश्यकताएँ 40 GB और 70 GB हैं, और बाजार में सबसे बड़ा उपभोक्ता कार्ड 32 GB RTX 5090 है।
एक ही संख्या में स्टेप्स के लिए विभिन्न मॉडलों में अलग-अलग लागत क्यों आती है?▾
पॉलिसी के अनुसार स्टेप्स तुलनीय नहीं होते। ACT 24 GB कार्ड पर बैच 8 पर 100,000 स्टेप्स पर डिफ़ॉल्ट होता है; GR00T N1.5 80 GB कार्ड पर ग्रेडिएंट एक्यूमुलेशन 16 के साथ बैच 1 पर 2,000 स्टेप्स पर डिफ़ॉल्ट होता है। बिल घंटों को उस कार्ड की दर से गुणा करके आता है जिस पर मेमोरी फुटप्रिंट आपको मजबूर करता है, न कि स्टेप काउंटर से।
शुरू करने से पहले देखें कि आपके रन की लागत कितनी होगी
प्रत्येक पाँच नीतियों में उसका GPU टियर, रन टाइम और प्रति रन मूल्य सूचीबद्ध है, और प्रशिक्षण बैकएंड उसी स्पॉट मार्केट पर कार्ड किराए पर लेता है जिस पर ये संख्याएँ मापी गई थीं।
मूल्य निर्धारण देखेंSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started