
বাস্তব স্পট-মার্কেট GPU মূল্য, পাঁচটি পলিসির প্রতিটির রান করার সময়, আর্ম এবং প্রদর্শনীগুলির খরচ কত, এবং চারটি জায়গা যেখানে টাকা নীরবে অদৃশ্য হয়ে যায়।
সংক্ষিপ্ত সংস্করণ
- •A100 80 GB বা H100 স্তরে একটি রান করতে 3 থেকে 6 ঘন্টা সময় লাগে এবং এর খরচ প্রায় 4 থেকে 12 USD। RTX 4090 স্তরে এটি 2 থেকে 5 ঘন্টা এবং প্রায় 1 থেকে 3 USD।
- •vast.ai-তে 23 আগস্ট 2026 তারিখে 13:44 UTC-তে পরিমাপ করা হয়েছে: একটি সম্পূর্ণ RTX 4090 অন-ডিমান্ডের জন্য 0.13 থেকে 0.38 USD/h, একটি A100 80 GB-এর জন্য 0.44 থেকে 0.67, একটি H100 80 GB-এর জন্য 1.34 থেকে 2.34। সম্পূর্ণ 80 GB কার্ড দুষ্প্রাপ্য, যথাক্রমে দুটি এবং পাঁচটি একক-কার্ড অফার রয়েছে।
- •GPU হল সবচেয়ে সস্তা লাইন। SO-ARM100 বিল অফ ম্যাটেরিয়ালস অনুযায়ী একটি লিডার প্লাস ফলোয়ার পেয়ারের দাম 229.88 USD, যা 24 GB স্তরে 77 থেকে 230 রানের সমান।
- •একজন ব্যক্তির 50টি পর্ব রেকর্ড করার জন্য দুই ঘন্টা সময় ব্যয় করা সেই পর্বগুলি যে ট্রেনিং রানকে ফিড করে তার চেয়ে বেশি ব্যয়বহুল।
- •চারটি জায়গায় অর্থ নষ্ট হয়: ত্রুটিপূর্ণ ডেটার উপর রান, 80M পলিসি দ্বারা পরিচালিত কাজগুলিতে 3B মডেল ব্যবহার, কেউ নষ্ট করেনি এমন GPU, এবং যে ফলাফল আপনি সংরক্ষণ করতে পারেননি তার পুনরায় রান।
- •AY-Robots মডেলের প্রয়োজনীয় VRAM অনুযায়ী কার্ডের আকার নির্ধারণ করে এবং একই স্পট মার্কেটে এটি ভাড়া নেয়, তাই রানের খরচ বাজার মূল্য।
বিলের চারটি লাইন আছে, এবং GPU হল সবচেয়ে ছোটটি
যখন লোকেরা জিজ্ঞাসা করে যে একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল SO-100 এর জন্য ফাইন-টিউন করতে কত খরচ হয়, তারা প্রায় সবসময় GPU ভাড়া বোঝায়। এটি সেই সংখ্যা যা একটি কার্ডে চার্জ হিসাবে প্রদর্শিত হয়, তাই এটিই বাস্তব মনে হয়। এটি চারটি সংখ্যার মধ্যে সবচেয়ে ছোট, যা একটি কার্যকরী পলিসি আসলে আপনার কত খরচ হয় তা নির্ধারণ করে।
| লাইন | এটি কী | একটি কার্যকরী পলিসির জন্য সাধারণ আকার |
|---|---|---|
| GPU সময় | রানের জন্য একটি কার্ড ভাড়া করা | প্রতি রানে 1 থেকে 12 USD, এবং আপনি 3 থেকে 5টি করবেন |
| রোবট | সার্ভো, প্রিন্টেড ফ্রেম, ক্যামেরা, কেবল, পাওয়ার | একবার, প্রতি আর্মের জন্য 110 থেকে 500 EUR |
| মানব ঘন্টা | ডেমো রেকর্ড করার জন্য একজন ব্যক্তি আর্ম চালানো | প্রতি ডেটাসেটের জন্য 1 থেকে 4 ঘন্টা, প্রতি কাজের জন্য পুনরাবৃত্তি |
| অপচয় | খারাপ ডেটা, অতিরিক্ত আকারের মডেল, ভুলে যাওয়া পড | অসীম, এবং একমাত্র লাইন যা আপনি নিয়ন্ত্রণ করেন |
নিচের প্রশিক্ষণের সময়গুলি পাঁচটি মডেলের নিজস্ব কাগজপত্র এবং সংগ্রহস্থল থেকে নেওয়া হয়েছে, হার্ডওয়্যারের খরচ প্রকাশিত বিল অফ মেটেরিয়ালস থেকে, প্ল্যাটফর্মের সংখ্যা AY-Robots এর নীতি ক্যাটালগ এবং মূল্য নির্ধারণের পৃষ্ঠা। যেখানে প্ল্যাটফর্ম সাহায্য করে না, এই নিবন্ধটি তা উল্লেখ করে।
স্পট মার্কেটে একটি GPU ঘন্টার প্রকৃত খরচ কত
একটি A100 ঘন্টার জন্য কোনো একক মূল্য নেই। vast.ai-এর মতো একটি মার্কেটপ্লেসে প্রতিটি হোস্ট তার নিজস্ব হার নির্ধারণ করে, এবং যে প্রশিক্ষণ রান আপনি চালু করেন তা সেই মুহূর্তে সস্তা এবং বিনামূল্যে থাকা যেকোনো মেশিনে চলে যায়। সৎ উত্তর হল একটি বিতরণ। এখানে এটি, 2026 সালের 23শে আগস্ট 13:44 UTC-এ পরিমাপ করা হয়েছে: একক পূর্ণ কার্ড, চাহিদা অনুযায়ী, প্রকৃত VRAM দ্বারা ফিল্টার করা হয়েছে।
| কার্ড | vast.ai চাহিদা অনুযায়ী USD/ঘন্টা (কম / মধ্যম / উচ্চ) | পূর্ণ-কার্ড অফার | vast.ai বিড ফ্লোর | RunPod কমিউনিটি / সুরক্ষিত | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
একটি একক সম্পূর্ণ GPU-এর জন্য অন-ডিমান্ড অফার (gpu_frac == 1.0) vast.ai পাবলিক বান্ডেল API থেকে, যার জন্য কোনো অ্যাকাউন্টের প্রয়োজন নেই, gpu_ram-এর উপর ফিল্টার করা হয়েছে যাতে শুধুমাত্র আসল 80 GB কার্ডগুলি 80 GB সারিতে আসে। এই ফিল্টারটি গুরুত্বপূর্ণ: এই পাঠে, তিনটি একক-কার্ড A100 SXM4 অফারই ছিল 40 GB অংশ, যেমন ছিল চারটি A100 PCIE অফারের মধ্যে দুটি, তাই সেগুলিকে একটি "A100" সারিতে একত্রিত করলে এখানে রিপোর্ট করা মূল্য অর্ধেক হয়ে যেত। Hugging Face কলাম দুটি পণ্যকে মিশ্রিত করে: 2.50 USD/h হল Nvidia A100 - large Spaces হার্ডওয়্যার এবং 4.50 USD/h হল ইনফিরেন্স এন্ডপয়েন্টের অধীনে একটি একক H100 80 GB, যা Spaces অফার করে না। মধ্যম মানগুলিকে নির্দেশক হিসাবে বিবেচনা করুন: A100 80 GB সারি দুটি অফারের উপর ভিত্তি করে এবং H100 সারি পাঁচটি অফারের উপর ভিত্তি করে, এবং 36 সেকেন্ড পরে একই ক্যোয়ারী একটি ভিন্ন 4090 গণনা এবং পাঁচটি সারির তিনটিতে একটি ভিন্ন সর্বোচ্চ মূল্য ফিরিয়ে দিয়েছে। RunPod তালিকা মূল্যগুলি পরিকল্পনার জন্য আরও স্থিতিশীল সংখ্যা।
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
কেন 3B মডেলগুলি সস্তা কার্ড ব্যবহার করতে পারে না
উপরের মধ্যমাগুলিতে একটি 4090 ঘন্টা এবং একটি H100 80 GB ঘন্টার মধ্যে প্রায় ছয় গুণ পার্থক্য রয়েছে। যা আপনাকে ব্যয়বহুল কার্ডে যেতে বাধ্য করে তা গতি নয়, এটি মেমরি। openpi একটি সম্পূর্ণ Pi0.5 এর জন্য সর্বনিম্ন সীমা নির্ধারণ করে ফাইন-টিউন 70 GB এ, এবং NVIDIA GR00T এর জন্য 40 GB বা তার বেশি সুপারিশ করে। লক্ষ্য করুন GR00T সংখ্যাটি কী নয়। এর ফাইন-টিউন কনফিগারেশন ডিফল্টরূপে ভাষা মডেল এবং ভিজ্যুয়াল এনকোডারকে ফ্রিজ করে (tune_llm এবং tune_visual False, প্রোজেক্টর এবং ডিফিউশন হেড True), এই কারণেই ক্যাটালগে 3 B এর মধ্যে প্রায় 40 M প্রশিক্ষিত প্যারামিটার তালিকাভুক্ত করা হয়েছে। 40 GB হল 3 B ওজনের জন্য অপ্টিমাইজার স্টেট নয়, এটি হল ফ্রিজ করা ব্যাকবোন এবং অ্যাক্টিভেশন। হ্রাসকৃত-স্কোপ ভেরিয়েন্টগুলি আরও কম হয়: openpi এর LoRA পাথ 22.5 GB চায় এবং 4090 এর নাম উল্লেখ করে, এবং NVIDIA এর Isaac Lab Arena ওয়ার্কফ্লো GR00T পোস্ট-ট্রেনিং এর জন্য একটি 24 GB সিঙ্গেল-GPU বিকল্প তালিকাভুক্ত করে। প্ল্যাটফর্মটি প্রতিটি বিক্রেতা যে কনফিগারেশনের জন্য প্রকাশ করে তার উপর ভিত্তি করে স্তরবিন্যাস করে। pi0 ফ্লো-ম্যাচিং রাইট-আপ ব্যাখ্যা করে যে ফ্লো-ম্যাচিং ফুটপ্রিন্ট কোথা থেকে আসে।
| কাজ | আপস্ট্রিম প্রকল্প যে মেমরি চায় | উৎস |
|---|---|---|
| pi0 / pi0.5 ইনফারেন্স | 8 GB এর বেশি, উদাহরণ RTX 4090 | openpi |
| pi0 / pi0.5 LoRA ফাইন-টিউন | 22.5 GB এর বেশি, উদাহরণ RTX 4090 | openpi |
| pi0 / pi0.5 সম্পূর্ণ ফাইন-টিউন | 70 GB এর বেশি, উদাহরণ A100 80 GB বা H100 | openpi |
| GR00T N1.7 ইনফারেন্স | 16 GB বা তার বেশি সহ 1 GPU | Isaac-GR00T |
| GR00T N1.7 ফাইন-টিউন | 40 GB বা তার বেশি প্রস্তাবিত, H100 বা L40 নোড | Isaac-GR00T |
| GR00T ফাইন-টিউন, এটি কী প্রশিক্ষণ দেয় | প্রোজেক্টর এবং ডিফিউশন হেড; LLM এবং ভিজ্যুয়াল এনকোডার ডিফল্টরূপে ফ্রিজ করা থাকে | finetune_config.py |
| GR00T পোস্ট-ট্রেনিং, হ্রাসকৃত | 24 GB সহ 1 GPU, ভাষা মডেল ফ্রিজ করা | Isaac Lab Arena |
| SmolVLA ফাইন-টিউন | রেফারেন্স 20,000-স্টেপ রানের জন্য একক A100 | lerobot docs |
| ACT প্রশিক্ষণ | একটি একক 11 GB RTX 2080 Ti | ACT paper |
এই সারণীটি হল কেন প্ল্যাটফর্মটি পাঁচটি মডেলকে দুটি স্তরে বিভক্ত করে। GR00T N1.7, GR00T N1.5 এবং Pi0.5 A100 80 GB বা H100 এ চলে কারণ বিক্রেতারা এটিই চায়। SmolVLA এবং ACT একটি RTX 4090 বা যেকোনো 24 GB কার্ডে চলে কারণ এটি সত্যিই যথেষ্ট।
একটি 24 GB কার্ডে GR00T বা Pi0.5 রান শূন্য সেকেন্ডে ব্যর্থ হয় না। এটি বেস চেকপয়েন্ট ডাউনলোড করে, ডেটাসেট ইনডেক্স তৈরি করে, প্রথম ফরোয়ার্ড পাস শুরু করে এবং কয়েকশ ধাপের মধ্যে একটি CUDA আউট-অফ-মেমরি ত্রুটির সাথে বন্ধ হয়ে যায়। আপনি ডাউনলোড এবং সেটআপের জন্য অর্থ প্রদান করেছেন এবং কিছুই পাননি। সমাধান: প্রশিক্ষণের সময় মেমরি শেষ হয়ে যাওয়া।
পাঁচটি মডেলের প্রতিটি আসলে কতক্ষণ চলে
চালানোর সময় খরচের অন্য অর্ধেক: প্রতি ঘন্টায় 2.00 USD অপ্রাসঙ্গিক যদি কাজটি 40 মিনিটের হয় এবং ধ্বংসাত্মক যদি এটি 40 ঘন্টার হয়। AY-Robots প্রশিক্ষকের কাছে এই ডিফল্টগুলিই পাঠায়, প্রতিটি স্তরের জন্য রান উইন্ডো এবং খরচ সহ।
| নীতি | GPU স্তর | ডিফল্ট সর্বোচ্চ ধাপ | ডিফল্ট ব্যাচ (গ্রেড অ্যাকুম) | চালানোর সময়সীমা | প্রতিবার চালানোর খরচ |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, প্রযোজ্য | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, প্রযোজ্য | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, কোনো প্রভাব নেই | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, কোনো প্রভাব নেই | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

এই রান উইন্ডোগুলি আপস্ট্রিম থেকে কোথায় আসে
- SmolVLA: lerobot ডকুমেন্টেশন অনুযায়ী, একটি A100-এ 20,000 ধাপ সম্পূর্ণ করতে প্রায় 4 ঘন্টা সময় লাগে। প্ল্যাটফর্মটি একই 20,000 ধাপ সস্তা 24 GB টায়ারে চালায়, তাই একটি নির্দিষ্ট 4 ঘন্টার পরিবর্তে একটি উইন্ডো থাকে।
- ACT: মূল ALOHA পেপার অনুযায়ী, একটি 80M-প্যারামিটার মডেলের জন্য একটি 11 GB RTX 2080 Ti-তে প্রায় 5 ঘন্টা সময় লাগে। একটি 4090 বেশ কয়েক প্রজন্ম নতুন হলেও প্ল্যাটফর্মটি 100,000 ধাপের জন্য বাজেট করে, তাই উইন্ডোটি একই জায়গায় থাকে।
- GR00T: N1.6 প্রজন্মের জন্য NVIDIA-এর রেফারেন্স ওয়ার্কফ্লো অনুযায়ী, আটটি L40S কার্ডে ব্যাচ 24-এ 20,000 ধাপের জন্য প্রায় 4 থেকে 8 ঘন্টা এবং একটি Ada 6000-এ ব্যাচ 16-এ 30,000 ধাপের জন্য 2 থেকে 3 ঘন্টা সময় লাগে। কয়েক ঘন্টার মধ্যে একটি 3B VLA-এর সিঙ্গেল-কার্ড ফাইন-টিউনিং স্বাভাবিক, আশাবাদী নয়।
- Pi0.5: openpi কোনো ওয়াল-ক্লক চিত্র প্রকাশ করে না, তবে এটি একটি সম্পূর্ণ ফাইন-টিউনের জন্য 70 GB ফ্লোর প্রকাশ করে, যা কার্ড এবং সেই অনুযায়ী হার নির্ধারণ করে।
আপনি যে সংখ্যার জন্য অর্থ প্রদান করছেন না, সেদিকে একটু বিরতি দিন। GR00T N1 পেপার অনুযায়ী, 2.2B মডেলকে প্রিটেইন করতে প্রায় 50,000 H100 GPU ঘন্টা লাগে, যা 1024টি GPU-এর একটি ক্লাস্টারে, 16,384 এর প্রিটেইনিং ব্যাচ সাইজে 200,000 গ্রেডিয়েন্ট ধাপের জন্য। উপরে পরিমাপ করা প্রতি ঘন্টায় 1.34 থেকে 2.34 USD হারে, এটি 67,000 থেকে 117,000 USD এর ভাড়া করা কম্পিউটের সমতুল্য। SmolVLA পেপার অনুযায়ী, এর প্রকল্পটি 481টি কমিউনিটি ডেটাসেট, 22.9K এপিসোড এবং 10.6M ফ্রেম জুড়ে প্রায় 30,000 GPU ঘন্টা ব্যবহার করে। আপনি ডাউনলোডের মূল্যে এর সবকিছুর উত্তরাধিকারী হন; আপনার 8 USD শেষ 20,000 ধাপ কিনে নেয়। কেন VLA গুলি এভাবে তৈরি করা হয় সেই বিভাজনটি কভার করে।
আর্ম: একটি এককালীন খরচ যা GPU বিলকে ম্লান করে দেয়
একটি প্রশিক্ষণ রান দুপুরের খাবারের চেয়ে কম ব্যয়বহুল। রোবটটি তা নয়। এই কারণেই SO-100 গুরুত্বপূর্ণ: এটিই সবচেয়ে সস্তা বাহু যা সম্পূর্ণ ইমিটেশন লার্নিং টুলচেইন আসলে সমর্থন করে।
| বাহু | সার্ভো | ভোল্টেজ | যন্ত্রাংশের খরচ | AY-Robots-এ সমর্থন |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | full, reference arm |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | full |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatible |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatible |
SO-ARM100 রিপোজিটরিতে আপস্ট্রিম বিল অফ মেটেরিয়ালস আরও বিস্তারিত এবং আপনার অঞ্চলের সাথে মিলিয়ে দেখা উচিত: এর দুটি বাহুর জন্য যন্ত্রাংশ তালিকাটি একটি লিডার প্লাস ফলোয়ার সেটআপের জন্য মোট 229.88 USD বা 226.30 EUR, এবং এর একটি ফলোয়ার বাহুর জন্য যন্ত্রাংশ তালিকাটি মোট 121.94 USD বা 124.30 EUR। প্রতিটি 13.89 USD মূল্যের ছয়টি STS3215 সার্ভো সেই 121.94 এর মধ্যে 83.34, তাই সার্ভোগুলিই হল বাহু। প্রতি SmolVLA বা ACT রানে 1 থেকে 3 USD খরচ হলে, একজোড়া বাহু 77 থেকে 230টি প্রশিক্ষণ রানের সমান। আপনি যদি এখনও নির্বাচন করেন, SO-100 বনাম SO-101 হল সেই তুলনা যা গুরুত্বপূর্ণ, কারণ দুটি এত কাছাকাছি যে সিদ্ধান্তটি সক্ষমতার চেয়ে প্রাপ্যতার উপর নির্ভর করে।
STS3215 7.4 V এবং 12 V ভ্যারিয়েন্টে আসে; রিপোজিটরি উল্লেখ করে যে 12 V অংশের জন্য 5 V এর পরিবর্তে একটি 12 V 5 A সাপ্লাইও প্রয়োজন, তাই দুটি বিনিময়যোগ্য নয়। 7.4 V সার্ভোতে 12 V সরবরাহ করলে সেগুলি নষ্ট হয়ে যায়, এবং ছয়টি সার্ভো একটি ফলোয়ার বাহুর যন্ত্রাংশের খরচের দুই-তৃতীয়াংশ। প্রথম পাওয়ার-আপের আগে প্রতিটি সার্ভোর লেবেল পরীক্ষা করুন। যদি সার্ভোগুলি ইতিমধ্যেই অস্বাভাবিক আচরণ করে: সার্ভো সাড়া দিচ্ছে না, বাহু কাঁপে তারপর ঝুলে যায়।
মানুষের কাজের সময়: যে লাইনটি কেউ স্প্রেডশীটে রাখে না
এই সংখ্যাটি খরচের আলোচনাকে সম্পূর্ণ পাল্টে দেয়। ডেমোনস্ট্রেশন রেকর্ড করা মানে একজন ব্যক্তি একটি রোবট আর্মকে রিয়েল টাইমে, একবারে একটি করে এপিসোড ধরে সরানো। এটিকে ব্যাচ করা যায় না এবং সেকেন্ডের হিসাবে ভাড়া নেওয়া যায় না। দ্য LeRobot ডেটাসেট রেকর্ডার ডিফল্ট সেটিংস সহ আসে যা হিসাব সহজ করে তোলে, তিনটিই নিশ্চিত করা হয়েছে DatasetRecordConfig: প্রতি 60 সেকেন্ড এপিসোড, দৃশ্য রিসেট করতে 60 সেকেন্ড, 50টি এপিসোড। নীচের টাকার কলামে একজন ব্যক্তির এক ঘন্টার কাজের জন্য 15 USD ধরা হয়েছে, যা একটি অনুমান মাত্র, কোনো প্ল্যাটফর্মের সংখ্যা নয়। আপনার নিজের হার প্রতিস্থাপন করুন; অনুপাতটিই মূল বিষয়।
- 1আপনি যে ডিফল্টগুলির জন্য বিল পাবেন, সেগুলির সাথে ডেটাসেট রেকর্ড করুন
এটি lerobot 0.6.1, 3 আগস্ট 2026 তারিখের PyPI-এর সংস্করণ। CLI আকারটি লক্ষ্য করুন: রেকর্ডিং
lerobot-recordকনসোল এন্ট্রি পয়েন্টের (lerobot.scripts.lerobot_record) মাধ্যমে চলে, পুরনোpython -m lerobot.scripts.recordমডিউল পাথের মাধ্যমে নয়। AY-Robots 0.5.1 সংস্করণকে লক্ষ্য করে, এবং 0.5.1 হুইল একইlerobot-recordএবংlerobot-trainএন্ট্রি পয়েন্ট ঘোষণা করে, তাই নীচের আকার উভয় ক্ষেত্রেই স্থিতিশীল। তিনটি টাইমিং ফ্ল্যাগ আপস্ট্রিম ডিফল্ট, তাই এটি সেই কমান্ডও যা পরবর্তী টেবিলের হিসাব ধরে নেয়।bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2একটিও GPU মিনিট ভাড়া নেওয়ার আগে আপনি যা রেকর্ড করেছেন তা দেখুন
একটি ডেটাসেট পরিদর্শন করতে প্রতি ঘন্টায় শূন্য USD খরচ হয়। একটি লস কার্ভ থেকে একই সমস্যা আবিষ্কার করতে H100 টায়ারে প্রতি ঘন্টায় 2.00 USD খরচ হয় এবং চার ঘন্টা দেরিতে আপনাকে জানায়। ডেটাসেটটি পুশ করুন এবং LeRobot ভিউয়ারে এটি স্ক্রাব করুন, অথবা AY-Robots ডেটাসেট ডিরেক্টরি ব্রাউজ করুন।
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3প্রশিক্ষণ দিন, এবং নিশ্চিত করুন যে চেকপয়েন্টটি পডের চেয়ে বেশি সময় ধরে টিকে থাকে
একটি ভাড়া করা মেশিন সংজ্ঞানুসারে অস্থায়ী, তাই রান চলাকালীন চেকপয়েন্টগুলি কোথাও স্থায়ীভাবে লিখুন। দুটি ফ্ল্যাগ সিদ্ধান্ত নেয় যে আপনি যা দিয়েছেন তা রাখবেন কিনা।
--save_freqডিফল্টরূপে 20,000 স্টেপস, তাই একটি ডিফল্ট 20,000-স্টেপ SmolVLA রান তার প্রথম চেকপয়েন্টটি লেখে যখন রানটি ইতিমধ্যেই শেষ হয়ে যায়; কোনো কিছু ভাড়া নেওয়ার আগে এটি কমিয়ে দিন যা বাধাগ্রস্ত হতে পারে।--save_checkpoint_to_hubএর জন্য--policy.repo_idপ্রয়োজন এবং lerobot 0.5.1-এ এটি বিদ্যমান নেই, তাই সেই সংস্করণে আপনাকে নিজেই মেশিন থেকে আউটপুট ডিরেক্টরি কপি করতে হবে। নীচের ব্যাচ সাইজটি আপস্ট্রিম ডকের উদাহরণ; AY-Robots ফর্ম SmolVLA-এর জন্য 2 পাঠায় এবং চেকপয়েন্টগুলি উপস্থিত হওয়ার সাথে সাথে অবজেক্ট স্টোরেজে লেখে।bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| এপিসোড | 60 সেকেন্ডে রেকর্ডিং | 60 সেকেন্ডে রিসেট করা | ওয়াল ক্লক | প্লাস 20 শতাংশ রি-রেকর্ড | প্রতি মানব ঘন্টায় 15 USD |
|---|---|---|---|---|---|
| 30, the SmolVLA minimum | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, the other four minimums | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, a comfortable dataset | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
ডানদিকের কলামটি 1 থেকে 12 USD রান খরচের সাথে তুলনা করুন। এই অনুমিত হারে, একটি 50-এপিসোডের ডেটাসেট রেকর্ড করতে প্রশিক্ষণ খরচের চেয়ে দুই থেকে সাত গুণ বেশি খরচ হয়, ক্রমাঙ্কন, ক্যামেরা সেটআপ এবং বাদ দেওয়া এপিসোডগুলি বাদ দিয়ে। এই কারণেই এর একটি সরাসরি আর্থিক মূল্য আছে। LeRobot গাইড প্রতি অবজেক্ট অবস্থানে 10টি করে কমপক্ষে 50টি এপিসোডের পরামর্শ দেয়; SmolVLA ডকুমেন্টেশন রিপোর্ট করে যে একই কাজের 25-এপিসোডের সংস্করণ যথেষ্ট ছিল না।
কোথায় আসলে টাকা নষ্ট হয়
1. এমন ডেটার উপর রান যা কখনোই কাজ করবে না
দুটি অদলবদল করা ক্যামেরা স্ট্রিম সহ একটি ডেটাসেটে 20,000-স্টেপের GR00T রান একটি পরিষ্কার ডেটাসেটের মতো একই খরচ হয়, একই সময় নেয় এবং একটি লস কার্ভ তৈরি করে যা দেখতে ঠিক আছে। ব্যর্থতা কয়েক ঘন্টা পরে রোবটের বাহুতে দেখা যায়। ঘণ্টার হিসাবে বিল করা হয় এবং রোগ নির্ণয় দিনের হিসাবে বিল করা হয়। দুটি লক্ষণ মনে রাখা দরকার: সাধারণত এর অর্থ হল পর্যবেক্ষণগুলি কাজের জন্য প্রয়োজনীয় তথ্য বহন করে না, এবং এর অর্থ হল ডেটাসেটে আপনার ধারণার চেয়ে কম বৈচিত্র্য ছিল।
2. একটি স্থির-ক্যামেরা কাজের জন্য ফাউন্ডেশন-মডেলের মূল্যে অর্থ প্রদান
ACT প্রায় 80M প্যারামিটার এবং এটি একটি কাজের 50টি প্রদর্শনী থেকে স্ক্র্যাচ থেকে প্রশিক্ষণের জন্য ডিজাইন করা হয়েছিল। GR00T N1.7 একটি প্রাক-প্রশিক্ষিত ব্যাকবোন সহ প্রায় 3B। একটি বোল্ট-ডাউন ক্যামেরা, একটি স্থির টেবিল এবং একটি বস্তুর জন্য, 80M মডেলটি প্রায়শই কাজ করে, 152 ms এর পরিবর্তে প্রতি অ্যাকশন ধাপে প্রায় 20 ms এ চলে এবং 4 থেকে 12 এর পরিবর্তে প্রতি রানে 1 থেকে 3 USD খরচ হয়। দামি মডেলটিতে 12 USD খরচ করার আগে সস্তা মডেলটি কাজ করে কিনা তা জানতে 3 USD খরচ করুন। ACT বনাম SmolVLA এবং GR00T N1.7 বনাম Pi0.5 দেখায় যে কোনটি সঠিক উত্তর হওয়া বন্ধ করে; মডেল এরিনাএ 85টি মডেল এবং 332টি বেঞ্চমার্ক ফলাফল রয়েছে।
3. যে GPUটির কথা আপনি ভুলে গেছেন
প্রতিরোধ করার জন্য সবচেয়ে সস্তা ভুল এবং করার জন্য সবচেয়ে সাধারণ ভুল। শুক্রবার ডিবাগ করার জন্য শুরু করা একটি ইনস্ট্যান্স সপ্তাহান্তে একটি বাস্তব রানের মতোই বিল হয়।
| কার্ড | স্ন্যাপশটে গড় হার | 24 ঘণ্টা নিষ্ক্রিয় | 7 দিন নিষ্ক্রিয় | এর মূল্য |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | প্রায় 27টি SmolVLA বা ACT রান 2 USD-তে |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | প্রায় 12টি GR00T রান 8 USD-তে |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | প্রায় 38টি GR00T রান 8 USD-তে |
AY-Robots-এ এই ব্যর্থতা ইনফারেন্সের জন্য ডিজাইন করা হয়েছে: ইনফারেন্স API দ্বারা সরবরাহকৃত পডগুলি একটি নিষ্ক্রিয় ওয়াচডগ বহন করে এবং একটি নিষ্ক্রিয় সময়ের পরে নিজেদের ধ্বংস করে। আপনি যদি কার্ডটি নিজে ভাড়া করেন, তবে সেই ওয়াচডগটি আপনার ক্যালেন্ডার রিমাইন্ডার।
4. একই উত্তরের জন্য দুবার অর্থ প্রদান
GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট হল একটি টাইরো CLI যা কোনো সিড প্রকাশ করে না। এটি কোনো প্ল্যাটফর্মের সীমাবদ্ধতা নয়, এটি আপস্ট্রিম টুল: gr00t/configs/finetune_config.py-এ কোনো সিড ফিল্ড নেই, এবং রিপোজিটরির নিজস্ব প্রশিক্ষণ টিপস সতর্ক করে যে রানগুলি 5 থেকে 6 শতাংশ পরিবর্তিত হয় কারণ ইমেজ অগমেন্টেশনগুলি নন-ডিটারমিনিস্টিক। lerobot 0.5.1 এবং 0.6.1 উভয় ক্ষেত্রেই সিড 1000 ডিফল্ট করে, তাই ACT, SmolVLA এবং Pi0.5 রানগুলি অন্তত একই ইনিশিয়ালাইজেশন এবং ডেটা অর্ডার থেকে পুনরায় চালানো যেতে পারে। এটি একটি GPU-তে বিট-আইডেন্টিক্যাল ওয়েটের প্রতিশ্রুতি নয়, তবে এটি একটি পুনরায় চালানো এবং একটি নতুন পরীক্ষার মধ্যে পার্থক্য। যদি একটি GR00T রান একটি কার্যকরী নীতি তৈরি করে এবং আপনি চেকপয়েন্ট ধরে না রাখেন, তবে আপনি এমন একটি ফলাফলের জন্য পুরো মূল্য পরিশোধ করবেন যা আপনি যে পার্থক্যটি খুঁজছিলেন তার চেয়ে বেশি ভিন্ন হতে পারে। আপনি যে চেকপয়েন্টের জন্য অর্থ প্রদান করেছেন তা হারানোর দ্বিতীয় উপায় হল: CLI ডিফল্টরূপে --save-total-limit 5 ব্যবহার করে, যা পুরানো চেকপয়েন্টগুলি মুছে ফেলার আগে রাখা চেকপয়েন্টের সর্বোচ্চ সংখ্যা হিসাবে নথিভুক্ত। স্টোরেজ কয়েক সেন্টের ব্যাপার; একটি পুনরায় চালানো 4 থেকে 12 USD এবং ছয় ঘণ্টা।
উপরের বিড ফ্লোরগুলি অন-ডিমান্ড রেটের একটি অংশ, এবং vast.ai বলে যে বিডিং সিস্টেম ক্লায়েন্টের খরচ পঞ্চাশ শতাংশ বা তার বেশি কমাতে পারে। এর নিজস্ব কথায় এর অসুবিধা: একটি ইন্টারাপ্টিবল ইনস্ট্যান্স যেকোনো সময় বিরতি দেওয়া যেতে পারে যদি অন্য কোনো ব্যবহারকারী বেশি বিড করে বা একই রিসোর্সের জন্য একটি অন-ডিমান্ড ভাড়া তৈরি করা হয়, এবং সেই বিরতি "চলমান সমস্ত প্রক্রিয়া বন্ধ করে দেয়"। অন-ডিমান্ড সর্বদা অগ্রাধিকার পায়। যে রান প্রতি কয়েকশ ধাপে একটি চেকপয়েন্ট লেখে তার জন্য ঠিক আছে, কিন্তু যে রান শেষে লেখে তার জন্য এটি সম্পূর্ণ ক্ষতি, যা ডিফল্টগুলি আপনাকে দেয়: Isaac-GR00T CLI প্রতি --save-steps (ডিফল্ট 1000) লেখে, কিন্তু lerobot-এর --save_freq ডিফল্ট 20,000 ধাপে সেট করা থাকে, তাই একটি ডিফল্ট SmolVLA রান একবার চেকপয়েন্ট করে, শেষ লাইনে। এটি কমান, অথবা বিড করবেন না। AY-Robots প্রশিক্ষণ ফর্ম GR00T নবকে saveSteps হিসাবে প্রকাশ করে।
- সর্বনিম্ন প্রতি ঘন্টার রেট।
- ইমেজ, CUDA সংস্করণ, lerobot বা Isaac-GR00T রিভিশন এবং প্রতিটি ফ্ল্যাগের সম্পূর্ণ নিয়ন্ত্রণ।
- আপনার রান যদি বিরতি থেকে বাঁচতে যথেষ্ট ঘন ঘন চেকপয়েন্ট করে, তাহলে ইন্টারাপ্টিবল বিডিং রেট অর্ধেক করে দেয়।
- কিছুই অ্যাবস্ট্রাক্ট করা হয় না, তাই যখন একটি রান অদ্ভুত আচরণ করে তখন আপনি কারণ দেখতে পারেন।
- সেটআপের বিল GPU রেটে হয়: ড্রাইভার, ডিপেন্ডেন্সি, মাল্টি-গিগাবাইট বেস চেকপয়েন্ট এবং ডেটাসেট ডাউনলোড সবকিছুর খরচ প্রশিক্ষণের মতোই প্রতি ঘন্টায়।
- একটি আউটবিড ইন্টারাপ্টিবল ইনস্ট্যান্স বিরতি দেওয়া হয় এবং এর প্রক্রিয়াগুলি বন্ধ করে দেওয়া হয়। একটি সেভ না করা রান মানে অর্থ নষ্ট, এবং lerobot ডিফল্ট তার প্রথম চেকপয়েন্ট 20,000 ধাপে লেখে।
- আপনার জন্য পড ধ্বংস করার কিছু নেই। উপরের নিষ্ক্রিয় টেবিলটি ভুলে যাওয়ার বিল।
- একক পূর্ণ 80 GB কার্ডের সরবরাহ কম: এই রিডে দুটি A100 80 GB এবং পাঁচটি H100 80 GB পূর্ণ-কার্ড অফার রয়েছে। তালিকাটিও পরিবর্তনশীল, তাই সবচেয়ে সস্তা তালিকাভুক্ত মূল্য এবং আপনি আসলে যে দামে ভাড়া নিতে পারবেন তা একই সংখ্যা নয়।
- অবকাঠামোতে ব্যয় করা প্রতিটি ঘন্টা এমন একটি ঘন্টা যা নীতি কাজ করে কিনা তা নির্ধারণকারী পর্বগুলি রেকর্ড করতে ব্যয় করা হয়নি।
নিজে করা বনাম প্ল্যাটফর্মকে কার্ড ভাড়া দিতে দেওয়া
আপনি মেশিন নির্বাচন করেন, পরিবেশ তৈরি করেন এবং পড ধ্বংস করেন। প্রতি ঘন্টার রেট উপরের বাজার রেট; বাকি সব আপনার সময়।
- মডেলের প্রয়োজনীয় VRAM এর সাথে মিলে যাওয়া একটি কার্ড খুঁজুন: ACT এবং SmolVLA এর জন্য 24 GB, GR00T এবং Pi0.5 এর জন্য 80 GB।
- যদি রান বিরতি থেকে বাঁচতে না পারে তবে অন-ডিমান্ড ভাড়া করুন, যদি ঘন ঘন চেকপয়েন্ট করে তবে ইন্টারাপ্টিবল ভাড়া করুন।
- টুলচেইন ইনস্টল করুন: ACT, SmolVLA এবং Pi0.5 এর জন্য lerobot, GR00T এর জন্য নিজস্ব টাইরো লঞ্চার সহ Isaac-GR00T রিপোজিটরি।
- প্রয়োজনে ডেটাসেট রূপান্তর করুন। একটি LeRobot v3.0 ডেটাসেট GR00T লোডারকে ক্র্যাশ করে এবং v2.1 এ রূপান্তর করতে হবে।
- লঞ্চ করুন, লস দেখুন, চেকপয়েন্টগুলি লেখার সাথে সাথে কোথাও টেকসই স্থানে পুশ করুন।
- ইনস্ট্যান্সটি ধ্বংস করুন, তারপর নিশ্চিত করুন যে আপনি এটি ধ্বংস করেছেন।
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>একটি GR00T রানের বাস্তবসম্মত খরচ: একটি H100 80 GB তে 1.34 থেকে 2.34 USD প্রতি ঘন্টায় 3 থেকে 6 ঘন্টা হল 4 থেকে 14 USD, সাথে 20 থেকে 40 মিনিটের সেটআপ যা বিল হয়, এবং আপনার নিজের সময়।
আপনি একটি ফর্মে মডেল, ডেটাসেট এবং হাইপারপ্যারামিটার নির্বাচন করেন। ব্যাকএন্ড মডেলের প্রয়োজনীয় VRAM অনুযায়ী একটি স্পট GPU ভাড়া করে, প্রশিক্ষক চালায় এবং অবজেক্ট স্টোরেজে চেকপয়েন্ট লেখে।
- প্রশিক্ষণ ম্যাট্রিক্সে আপনার কম্বিনেশন নির্বাচন করুন: পাঁচটি মডেল, চারটি আর্ম, প্রতি সেলে একটি গাইড।
- এটিকে একটি ডেটাসেটের দিকে নির্দেশ করুন: ডেস্কটপ ক্লায়েন্ট দিয়ে রেকর্ড করা একটি, একটি Hugging Face রেপো আইডি, অথবা আপনার নিজের মেশিন থেকে একটি।
- ডিফল্টগুলি গ্রহণ করুন বা সেগুলিকে সামঞ্জস্য করুন। উপরের টেবিলটি আসলে প্রশিক্ষকের কাছে যা পাঠানো হয়।
- ব্যাকএন্ড প্রয়োজনীয় VRAM দ্বারা কার্ড নির্বাচন করে, তাই আপনাকে কখনও GPU খুঁজতে হয় না।
- চেকপয়েন্টগুলি লেখার সাথে সাথে অবজেক্ট স্টোরেজে জমা হয়, তাই একটি বাধাগ্রস্ত রান একটি হারানো রান নয়।
| স্তর | মডেল | রান সময় | প্রতি রানের খরচ |
|---|---|---|---|
| A100 80 GB বা H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 থেকে 6 ঘন্টা | প্রায় 4 থেকে 12 USD |
| RTX 4090 বা যেকোনো 24 GB কার্ড | SmolVLA, ACT | 2 থেকে 5 ঘন্টা | প্রায় 1 থেকে 3 USD |
এটি যা করে না: একটি খারাপ ডেটাসেটকে ভালো করা, GR00T কে এমন একটি সিড দেওয়া যা তার আগে ছিল না, অথবা নিচে বর্ণিত ল্যাটেন্সি সীমা অপসারণ করা। এটি GPU কেনাকাটা, পরিবেশ তৈরি এবং আপনি যে পডটি ধ্বংস করতে ভুলে গেছেন তা সরিয়ে দেয়। এর কার্যপ্রণালী প্রশিক্ষণ ডকুমেন্টেশনে রয়েছে।
প্ল্যাটফর্ম কী চার্জ করে এবং কীভাবে এটি কার্ড নির্বাচন করে
লজিকটি ইচ্ছাকৃতভাবে সরল। প্রতিটি মডেল ক্যাটালগ-এ একটি GPU স্তর ঘোষণা করে; ব্যাকএন্ড প্রয়োজনীয় VRAM নেয় এবং উপরে উল্লিখিত একই স্পট মার্কেটে একটি উপযুক্ত কার্ড ভাড়া করে। এই কারণেই উদ্ধৃত খরচ একটি পরিসীমা, একটি নির্দিষ্ট মূল্য নয়। GR00T এবং Pi0.5 এখানে শুধুমাত্র ক্লাউড-ভিত্তিক কারণ তাদের 40 GB এবং 70 GB ফ্লোর রয়েছে। SmolVLA এবং ACT আপনার নিজস্ব 24 GB কার্ডেও স্থানীয়ভাবে চলে, যেখানে ক্লাউড খরচ শূন্য এবং বিদ্যুৎ আপনার সমস্যা।

একটি বিষয় সতর্কতার দাবি রাখে। গ্রেডিয়েন্ট অ্যাকুমুলেশন GR00T-এর উভয় ভেরিয়েন্টের জন্য প্রযোজ্য, তাই এটি বাড়ালে একই কার্ডে একটি বড় কার্যকর ব্যাচ পাওয়া যায়। Pi0.5 এবং SmolVLA-এর জন্য এটি একেবারেই প্রযোজ্য নয়: lerobot 0.5.1-এর প্রশিক্ষণ কনফিগে কোনো গ্রেডিয়েন্ট-অ্যাকুমুলেশন বিকল্প নেই, তাই ক্ষেত্রটিকে 16-এ সেট করলে কোনো খরচ হয় না এবং কোনো লাভও হয় না। যদি একটি সারিবদ্ধ কাজ কখনও শুরু না হয়, সারিতে আটকে থাকা কাজের পৃষ্ঠা কী পরীক্ষা করতে হবে তা কভার করে; যদি রান শুরু হওয়ার আগে ডেটাসেট প্রত্যাখ্যান করা হয়, তবে এটি প্রায় সবসময়ই v3.0 ফরম্যাটের সমস্যা।
পাবলিক ইন্টারনেটের মাধ্যমে আপনার পলিসি পরিবেশনকারী একটি ভাড়া করা GPU একটি কন্ট্রোল লুপে রাউন্ড ট্রিপ যোগ করে যা প্রতি অ্যাকশন স্টেপে ইতিমধ্যেই 20 থেকে 485 ms। ধীর পিক-অ্যান্ড-প্লেসের জন্য ঠিক আছে, কিন্তু দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়। ক্লাউড ইনফারেন্স একটি চেকপয়েন্ট ভালোভাবে মূল্যায়ন করে এবং প্রোডাকশন ম্যানিপুলেশন খারাপভাবে চালায়: যদি কাজের জন্য গতির প্রয়োজন হয় তবে কম্পিউটকে সার্ভোগুলির পাশে থাকতে হবে, এবং এটি এমন একটি খরচ যা এই নিবন্ধটি অদৃশ্য করতে পারে না। দেখুন ইনফারেন্স ল্যাটেন্সি।
প্রথম কার্যকরী পলিসির জন্য একটি বিস্তারিত বাজেট
সব চারটি লাইন একসাথে, শূন্য থেকে শুরু করে। GPU মোট 3 থেকে 5টি রান ধরে নেয়: প্রথমটি প্রমাণ করে যে পাইপলাইন কাজ করে, দ্বিতীয়টি একটি ডেটা সমস্যা প্রকাশ করে, তৃতীয় বা চতুর্থটি হল যেটি আপনি রাখেন।
| লাইন | মিতব্যয়ী পথ | আরামদায়ক পথ |
|---|---|---|
| আর্ম | শুধুমাত্র SO-100 ফলোয়ার, BOM-এ 121.94 USD | লিডার এবং ফলোয়ার, BOM-এ 229.88 USD |
| মডেল | SmolVLA বা ACT, 24 GB টিয়ার | GR00T N1.7, A100 80 GB বা H100 টিয়ার |
| রেকর্ড করা এপিসোড | 30, SmolVLA-এর ন্যূনতম | 50 থেকে 100 |
| রেকর্ড করার জন্য মানুষের সময় | প্রায় 1 ঘণ্টা 12 মিনিট | 2 থেকে 4 ঘণ্টা |
| একটি রানের খরচ | 1 থেকে 3 USD | 4 থেকে 12 USD |
| কাজ করার আগে রান | 3 থেকে 5 | 3 থেকে 5 |
| মোট GPU খরচ | 3 থেকে 15 USD | 12 থেকে 60 USD |
| বিলের সবচেয়ে বড় লাইন | আর্ম, তারপর আপনার সময় | আর্ম, তারপর আপনার সময় |
এই আকারের রোবটের ক্ষেত্রেও এই প্যাটার্নটি প্রযোজ্য: কম্পিউট একটি রাউন্ডিং এরর, হার্ডওয়্যার একটি বাস্তব এককালীন খরচ, এবং মানুষের শ্রম হল পুনরাবৃত্তিমূলক ব্যয়। কিছু কেনার আগে প্রশিক্ষণের অংশটি পরীক্ষা করতে, আপনাকে মডেল তুলনা করতে এবং একটি আর্ম ছাড়াই একটি GPU ভাড়া নিতে দেয়, এবং হল একটি ফিজিক্যাল SO-100 যা আপনি ব্রাউজারে কোনো সাইনআপ ছাড়াই চালাতে পারবেন। সম্পূর্ণ পাইপলাইন এন্ড-টু-এন্ডের জন্য, সেটআপ, এবং প্রশিক্ষণ কভার করে, এবং হল সংক্ষিপ্ত সংস্করণ।

একটি VLA ফাইন-টিউনিং রানের শেষ থেকে শেষ পর্যন্ত খরচ কত?▾
A100 80 GB বা H100 টিয়ারে GR00T N1.7, GR00T N1.5 বা Pi0.5 এর জন্য প্রায় 4 থেকে 12 USD (প্রতি ঘন্টায় 1.20 থেকে 2.00 USD হারে 3 থেকে 6 ঘন্টা), এবং RTX 4090 টিয়ারে SmolVLA বা ACT এর জন্য প্রায় 1 থেকে 3 USD (প্রতি ঘন্টায় 0.30 থেকে 0.60 USD হারে 2 থেকে 5 ঘন্টা)। সেটআপ সময় গণনা করার পর কার্ড নিজে ভাড়া নিলে একই পরিসরে খরচ পড়ে, কারণ এটি প্রশিক্ষণের হারেই বিল করে।
A100 80 GB এর চেয়ে H100 এর জন্য অর্থ প্রদান করা কি মূল্যবান?▾
একটি একক SO-100 পলিসির জন্য, সাধারণত না। উভয়ই GR00T এবং Pi0.5 এর প্রয়োজনীয় মেমরি ফ্লোর পূরণ করে, এবং 23 আগস্ট 2026 এর তথ্য অনুযায়ী একটি সম্পূর্ণ A100 80 GB প্রতি ঘন্টায় 0.44 USD থেকে শুরু হয়েছিল, যেখানে একটি H100 80 GB এর জন্য 1.34 USD। H100 দ্রুত শেষ হয়, তাই হারের একটি অংশ কম ঘন্টা হিসাবে ফিরে আসে, কিন্তু এত ছোট একটি রানের জন্য মোট খরচ এখনও বেশি। H100 এর আসল যুক্তি হল প্রাপ্যতা: সেই বাজারে দুটি A100 80 GB এর বিপরীতে পাঁচটি একক H100 80 GB অফার রয়েছে, এবং যে কার্ড ভাড়া করা যায় না তার কোন মূল্য নেই।
একটি পলিসি কার্যকর হওয়ার আগে কতগুলি রান লাগে?▾
তিন থেকে পাঁচটি রানের পরিকল্পনা করুন। প্রথমটি প্রমাণ করে যে পাইপলাইনটি সঠিকভাবে সংযুক্ত আছে। দ্বিতীয়টি সাধারণত একটি ডেটাসেট সমস্যা প্রকাশ করে, যেমন একটি ক্যামেরা স্ট্রিম যা মাঝপথে বন্ধ হয়ে গেছে। তৃতীয় বা চতুর্থটি হল যেটি আপনি রাখবেন।
আমি কি ভাড়া নেওয়ার পরিবর্তে আমার নিজের GPU তে SmolVLA বা ACT প্রশিক্ষণ দিতে পারি?▾
হ্যাঁ। উভয়ই AY-Robots এ স্থানীয়ভাবে সমর্থিত এবং উভয়ই 24 GB তে স্বাচ্ছন্দ্যে ফিট করে; আসল ACT পেপারটি তার 80M মডেলকে একটি 11 GB RTX 2080 Ti তে প্রায় 5 ঘন্টায় প্রশিক্ষণ দিয়েছিল। GR00T এবং Pi0.5 এখানে শুধুমাত্র ক্লাউড-ভিত্তিক কারণ বিক্রেতাদের নথিভুক্ত ফাইন-টিউনিং ফ্লোরগুলি হল 40 GB এবং 70 GB, এবং বাজারে সবচেয়ে বড় কনজিউমার কার্ড হল 32 GB RTX 5090।
একই সংখ্যক স্টেপের জন্য মডেল জুড়ে ভিন্ন ভিন্ন খরচ হয় কেন?▾
পলিসি জুড়ে স্টেপগুলি তুলনীয় নয়। ACT একটি 24 GB কার্ডে ব্যাচ 8 এ 100,000 স্টেপ ডিফল্ট করে; GR00T N1.5 একটি 80 GB কার্ডে গ্র্যাডিয়েন্ট অ্যাকুমুলেশন 16 সহ ব্যাচ 1 এ 2,000 স্টেপ ডিফল্ট করে। বিলটি হল মেমরি ফুটপ্রিন্ট আপনাকে যে কার্ডে বাধ্য করে তার হারের সাথে ঘন্টা গুণ করে, স্টেপ কাউন্টার নয়।
শুরু করার আগে আপনার রানের খরচ কত হবে তা দেখুন
পাঁচটি পলিসির প্রতিটি তার GPU টিয়ার, রান টাইম এবং প্রতি রানের মূল্য তালিকাভুক্ত করে, এবং প্রশিক্ষণ ব্যাকএন্ড সেই একই স্পট মার্কেট থেকে কার্ড ভাড়া করে যেখানে এই সংখ্যাগুলি পরিমাপ করা হয়েছিল।
মূল্য পরীক্ষা করুনSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started