AY-Robots খরচ সারণী যেখানে দেখানো হয়েছে পাঁচটি পলিসির প্রতিটির জন্য কোন GPU প্রয়োজন, সাধারণ রান টাইম এবং প্রতি রান-এর মূল্য, এবং পলিসিটি কার্যকর হওয়ার আগে কতগুলি এপিসোড প্রয়োজন।
VLA প্রশিক্ষণGPU খরচSO-100ফাইন-টিউনিংরোবট লার্নিংবাজেটিং

VLA প্রশিক্ষণের খরচ: একটি ফাইন-টিউনিং রান-এর আসল খরচ কত

AY-Robots ResearchAugust 23, 202623 মিনিট পড়া

বাস্তব স্পট-মার্কেট GPU মূল্য, পাঁচটি পলিসির প্রতিটির রান করার সময়, আর্ম এবং প্রদর্শনীগুলির খরচ কত, এবং চারটি জায়গা যেখানে টাকা নীরবে অদৃশ্য হয়ে যায়।

সংক্ষিপ্ত সংস্করণ

  • A100 80 GB বা H100 স্তরে একটি রান করতে 3 থেকে 6 ঘন্টা সময় লাগে এবং এর খরচ প্রায় 4 থেকে 12 USD। RTX 4090 স্তরে এটি 2 থেকে 5 ঘন্টা এবং প্রায় 1 থেকে 3 USD।
  • vast.ai-তে 23 আগস্ট 2026 তারিখে 13:44 UTC-তে পরিমাপ করা হয়েছে: একটি সম্পূর্ণ RTX 4090 অন-ডিমান্ডের জন্য 0.13 থেকে 0.38 USD/h, একটি A100 80 GB-এর জন্য 0.44 থেকে 0.67, একটি H100 80 GB-এর জন্য 1.34 থেকে 2.34। সম্পূর্ণ 80 GB কার্ড দুষ্প্রাপ্য, যথাক্রমে দুটি এবং পাঁচটি একক-কার্ড অফার রয়েছে।
  • GPU হল সবচেয়ে সস্তা লাইন। SO-ARM100 বিল অফ ম্যাটেরিয়ালস অনুযায়ী একটি লিডার প্লাস ফলোয়ার পেয়ারের দাম 229.88 USD, যা 24 GB স্তরে 77 থেকে 230 রানের সমান।
  • একজন ব্যক্তির 50টি পর্ব রেকর্ড করার জন্য দুই ঘন্টা সময় ব্যয় করা সেই পর্বগুলি যে ট্রেনিং রানকে ফিড করে তার চেয়ে বেশি ব্যয়বহুল।
  • চারটি জায়গায় অর্থ নষ্ট হয়: ত্রুটিপূর্ণ ডেটার উপর রান, 80M পলিসি দ্বারা পরিচালিত কাজগুলিতে 3B মডেল ব্যবহার, কেউ নষ্ট করেনি এমন GPU, এবং যে ফলাফল আপনি সংরক্ষণ করতে পারেননি তার পুনরায় রান।
  • AY-Robots মডেলের প্রয়োজনীয় VRAM অনুযায়ী কার্ডের আকার নির্ধারণ করে এবং একই স্পট মার্কেটে এটি ভাড়া নেয়, তাই রানের খরচ বাজার মূল্য।

বিলের চারটি লাইন আছে, এবং GPU হল সবচেয়ে ছোটটি

যখন লোকেরা জিজ্ঞাসা করে যে একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল SO-100 এর জন্য ফাইন-টিউন করতে কত খরচ হয়, তারা প্রায় সবসময় GPU ভাড়া বোঝায়। এটি সেই সংখ্যা যা একটি কার্ডে চার্জ হিসাবে প্রদর্শিত হয়, তাই এটিই বাস্তব মনে হয়। এটি চারটি সংখ্যার মধ্যে সবচেয়ে ছোট, যা একটি কার্যকরী পলিসি আসলে আপনার কত খরচ হয় তা নির্ধারণ করে।

লাইনএটি কীএকটি কার্যকরী পলিসির জন্য সাধারণ আকার
GPU সময়রানের জন্য একটি কার্ড ভাড়া করাপ্রতি রানে 1 থেকে 12 USD, এবং আপনি 3 থেকে 5টি করবেন
রোবটসার্ভো, প্রিন্টেড ফ্রেম, ক্যামেরা, কেবল, পাওয়ারএকবার, প্রতি আর্মের জন্য 110 থেকে 500 EUR
মানব ঘন্টাডেমো রেকর্ড করার জন্য একজন ব্যক্তি আর্ম চালানোপ্রতি ডেটাসেটের জন্য 1 থেকে 4 ঘন্টা, প্রতি কাজের জন্য পুনরাবৃত্তি
অপচয়খারাপ ডেটা, অতিরিক্ত আকারের মডেল, ভুলে যাওয়া পডঅসীম, এবং একমাত্র লাইন যা আপনি নিয়ন্ত্রণ করেন

নিচের প্রশিক্ষণের সময়গুলি পাঁচটি মডেলের নিজস্ব কাগজপত্র এবং সংগ্রহস্থল থেকে নেওয়া হয়েছে, হার্ডওয়্যারের খরচ প্রকাশিত বিল অফ মেটেরিয়ালস থেকে, প্ল্যাটফর্মের সংখ্যা AY-Robots এর নীতি ক্যাটালগ এবং মূল্য নির্ধারণের পৃষ্ঠা। যেখানে প্ল্যাটফর্ম সাহায্য করে না, এই নিবন্ধটি তা উল্লেখ করে।

স্পট মার্কেটে একটি GPU ঘন্টার প্রকৃত খরচ কত

একটি A100 ঘন্টার জন্য কোনো একক মূল্য নেই। vast.ai-এর মতো একটি মার্কেটপ্লেসে প্রতিটি হোস্ট তার নিজস্ব হার নির্ধারণ করে, এবং যে প্রশিক্ষণ রান আপনি চালু করেন তা সেই মুহূর্তে সস্তা এবং বিনামূল্যে থাকা যেকোনো মেশিনে চলে যায়। সৎ উত্তর হল একটি বিতরণ। এখানে এটি, 2026 সালের 23শে আগস্ট 13:44 UTC-এ পরিমাপ করা হয়েছে: একক পূর্ণ কার্ড, চাহিদা অনুযায়ী, প্রকৃত VRAM দ্বারা ফিল্টার করা হয়েছে।

কার্ডvast.ai চাহিদা অনুযায়ী USD/ঘন্টা (কম / মধ্যম / উচ্চ)পূর্ণ-কার্ড অফারvast.ai বিড ফ্লোরRunPod কমিউনিটি / সুরক্ষিতHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74not offered
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99not offered
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19not offered
এই স্ন্যাপশটটি কীভাবে নেওয়া হয়েছিল এবং এটি কী নয়

একটি একক সম্পূর্ণ GPU-এর জন্য অন-ডিমান্ড অফার (gpu_frac == 1.0) vast.ai পাবলিক বান্ডেল API থেকে, যার জন্য কোনো অ্যাকাউন্টের প্রয়োজন নেই, gpu_ram-এর উপর ফিল্টার করা হয়েছে যাতে শুধুমাত্র আসল 80 GB কার্ডগুলি 80 GB সারিতে আসে। এই ফিল্টারটি গুরুত্বপূর্ণ: এই পাঠে, তিনটি একক-কার্ড A100 SXM4 অফারই ছিল 40 GB অংশ, যেমন ছিল চারটি A100 PCIE অফারের মধ্যে দুটি, তাই সেগুলিকে একটি "A100" সারিতে একত্রিত করলে এখানে রিপোর্ট করা মূল্য অর্ধেক হয়ে যেত। Hugging Face কলাম দুটি পণ্যকে মিশ্রিত করে: 2.50 USD/h হল Nvidia A100 - large Spaces হার্ডওয়্যার এবং 4.50 USD/h হল ইনফিরেন্স এন্ডপয়েন্টের অধীনে একটি একক H100 80 GB, যা Spaces অফার করে না। মধ্যম মানগুলিকে নির্দেশক হিসাবে বিবেচনা করুন: A100 80 GB সারি দুটি অফারের উপর ভিত্তি করে এবং H100 সারি পাঁচটি অফারের উপর ভিত্তি করে, এবং 36 সেকেন্ড পরে একই ক্যোয়ারী একটি ভিন্ন 4090 গণনা এবং পাঁচটি সারির তিনটিতে একটি ভিন্ন সর্বোচ্চ মূল্য ফিরিয়ে দিয়েছে। RunPod তালিকা মূল্যগুলি পরিকল্পনার জন্য আরও স্থিতিশীল সংখ্যা।

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
উপরের টেবিলের পেছনের সঠিক ক্যোয়ারী, এই অংশটি লেখার সময় দুবার চালানো হয়েছে। এইটি সহ যেকোনো GPU মূল্যের নিবন্ধ বিশ্বাস করার আগে এটি চালান।
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
The cost table on /try: card, run time, price per run and minimum episodes per policy.

কেন 3B মডেলগুলি সস্তা কার্ড ব্যবহার করতে পারে না

উপরের মধ্যমাগুলিতে একটি 4090 ঘন্টা এবং একটি H100 80 GB ঘন্টার মধ্যে প্রায় ছয় গুণ পার্থক্য রয়েছে। যা আপনাকে ব্যয়বহুল কার্ডে যেতে বাধ্য করে তা গতি নয়, এটি মেমরি। openpi একটি সম্পূর্ণ Pi0.5 এর জন্য সর্বনিম্ন সীমা নির্ধারণ করে ফাইন-টিউন 70 GB এ, এবং NVIDIA GR00T এর জন্য 40 GB বা তার বেশি সুপারিশ করে। লক্ষ্য করুন GR00T সংখ্যাটি কী নয়। এর ফাইন-টিউন কনফিগারেশন ডিফল্টরূপে ভাষা মডেল এবং ভিজ্যুয়াল এনকোডারকে ফ্রিজ করে (tune_llm এবং tune_visual False, প্রোজেক্টর এবং ডিফিউশন হেড True), এই কারণেই ক্যাটালগে 3 B এর মধ্যে প্রায় 40 M প্রশিক্ষিত প্যারামিটার তালিকাভুক্ত করা হয়েছে। 40 GB হল 3 B ওজনের জন্য অপ্টিমাইজার স্টেট নয়, এটি হল ফ্রিজ করা ব্যাকবোন এবং অ্যাক্টিভেশন। হ্রাসকৃত-স্কোপ ভেরিয়েন্টগুলি আরও কম হয়: openpi এর LoRA পাথ 22.5 GB চায় এবং 4090 এর নাম উল্লেখ করে, এবং NVIDIA এর Isaac Lab Arena ওয়ার্কফ্লো GR00T পোস্ট-ট্রেনিং এর জন্য একটি 24 GB সিঙ্গেল-GPU বিকল্প তালিকাভুক্ত করে। প্ল্যাটফর্মটি প্রতিটি বিক্রেতা যে কনফিগারেশনের জন্য প্রকাশ করে তার উপর ভিত্তি করে স্তরবিন্যাস করে। pi0 ফ্লো-ম্যাচিং রাইট-আপ ব্যাখ্যা করে যে ফ্লো-ম্যাচিং ফুটপ্রিন্ট কোথা থেকে আসে।

কাজআপস্ট্রিম প্রকল্প যে মেমরি চায়উৎস
pi0 / pi0.5 ইনফারেন্স8 GB এর বেশি, উদাহরণ RTX 4090openpi
pi0 / pi0.5 LoRA ফাইন-টিউন22.5 GB এর বেশি, উদাহরণ RTX 4090openpi
pi0 / pi0.5 সম্পূর্ণ ফাইন-টিউন70 GB এর বেশি, উদাহরণ A100 80 GB বা H100openpi
GR00T N1.7 ইনফারেন্স16 GB বা তার বেশি সহ 1 GPUIsaac-GR00T
GR00T N1.7 ফাইন-টিউন40 GB বা তার বেশি প্রস্তাবিত, H100 বা L40 নোডIsaac-GR00T
GR00T ফাইন-টিউন, এটি কী প্রশিক্ষণ দেয়প্রোজেক্টর এবং ডিফিউশন হেড; LLM এবং ভিজ্যুয়াল এনকোডার ডিফল্টরূপে ফ্রিজ করা থাকেfinetune_config.py
GR00T পোস্ট-ট্রেনিং, হ্রাসকৃত24 GB সহ 1 GPU, ভাষা মডেল ফ্রিজ করাIsaac Lab Arena
SmolVLA ফাইন-টিউনরেফারেন্স 20,000-স্টেপ রানের জন্য একক A100lerobot docs
ACT প্রশিক্ষণএকটি একক 11 GB RTX 2080 TiACT paper

এই সারণীটি হল কেন প্ল্যাটফর্মটি পাঁচটি মডেলকে দুটি স্তরে বিভক্ত করে। GR00T N1.7, GR00T N1.5 এবং Pi0.5 A100 80 GB বা H100 এ চলে কারণ বিক্রেতারা এটিই চায়। SmolVLA এবং ACT একটি RTX 4090 বা যেকোনো 24 GB কার্ডে চলে কারণ এটি সত্যিই যথেষ্ট।

যে ফাঁদটি একটি দিন খেয়ে ফেলে: বড় মডেলের জন্য সস্তা কার্ড ভাড়া করা

একটি 24 GB কার্ডে GR00T বা Pi0.5 রান শূন্য সেকেন্ডে ব্যর্থ হয় না। এটি বেস চেকপয়েন্ট ডাউনলোড করে, ডেটাসেট ইনডেক্স তৈরি করে, প্রথম ফরোয়ার্ড পাস শুরু করে এবং কয়েকশ ধাপের মধ্যে একটি CUDA আউট-অফ-মেমরি ত্রুটির সাথে বন্ধ হয়ে যায়। আপনি ডাউনলোড এবং সেটআপের জন্য অর্থ প্রদান করেছেন এবং কিছুই পাননি। সমাধান: প্রশিক্ষণের সময় মেমরি শেষ হয়ে যাওয়া

পাঁচটি মডেলের প্রতিটি আসলে কতক্ষণ চলে

চালানোর সময় খরচের অন্য অর্ধেক: প্রতি ঘন্টায় 2.00 USD অপ্রাসঙ্গিক যদি কাজটি 40 মিনিটের হয় এবং ধ্বংসাত্মক যদি এটি 40 ঘন্টার হয়। AY-Robots প্রশিক্ষকের কাছে এই ডিফল্টগুলিই পাঠায়, প্রতিটি স্তরের জন্য রান উইন্ডো এবং খরচ সহ।

নীতিGPU স্তরডিফল্ট সর্বোচ্চ ধাপডিফল্ট ব্যাচ (গ্রেড অ্যাকুম)চালানোর সময়সীমাপ্রতিবার চালানোর খরচ
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, প্রযোজ্য3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, প্রযোজ্য3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, কোনো প্রভাব নেই3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, কোনো প্রভাব নেই2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
AY-Robots-এ পাঁচটি প্রশিক্ষণযোগ্য নীতির তুলনামূলক সারণী যেখানে প্যারামিটার সংখ্যা, প্রয়োজনীয় GPU, ইনফারেন্স লেটেন্সি এবং ন্যূনতম পর্বের সংখ্যা দেখানো হয়েছে
পাঁচটি নীতি পাশাপাশি: প্যারামিটার, GPU স্তর, প্রতি অ্যাকশন ধাপে লেটেন্সি, ন্যূনতম পর্ব।

এই রান উইন্ডোগুলি আপস্ট্রিম থেকে কোথায় আসে

  • SmolVLA: lerobot ডকুমেন্টেশন অনুযায়ী, একটি A100-এ 20,000 ধাপ সম্পূর্ণ করতে প্রায় 4 ঘন্টা সময় লাগে। প্ল্যাটফর্মটি একই 20,000 ধাপ সস্তা 24 GB টায়ারে চালায়, তাই একটি নির্দিষ্ট 4 ঘন্টার পরিবর্তে একটি উইন্ডো থাকে।
  • ACT: মূল ALOHA পেপার অনুযায়ী, একটি 80M-প্যারামিটার মডেলের জন্য একটি 11 GB RTX 2080 Ti-তে প্রায় 5 ঘন্টা সময় লাগে। একটি 4090 বেশ কয়েক প্রজন্ম নতুন হলেও প্ল্যাটফর্মটি 100,000 ধাপের জন্য বাজেট করে, তাই উইন্ডোটি একই জায়গায় থাকে।
  • GR00T: N1.6 প্রজন্মের জন্য NVIDIA-এর রেফারেন্স ওয়ার্কফ্লো অনুযায়ী, আটটি L40S কার্ডে ব্যাচ 24-এ 20,000 ধাপের জন্য প্রায় 4 থেকে 8 ঘন্টা এবং একটি Ada 6000-এ ব্যাচ 16-এ 30,000 ধাপের জন্য 2 থেকে 3 ঘন্টা সময় লাগে। কয়েক ঘন্টার মধ্যে একটি 3B VLA-এর সিঙ্গেল-কার্ড ফাইন-টিউনিং স্বাভাবিক, আশাবাদী নয়।
  • Pi0.5: openpi কোনো ওয়াল-ক্লক চিত্র প্রকাশ করে না, তবে এটি একটি সম্পূর্ণ ফাইন-টিউনের জন্য 70 GB ফ্লোর প্রকাশ করে, যা কার্ড এবং সেই অনুযায়ী হার নির্ধারণ করে।

আপনি যে সংখ্যার জন্য অর্থ প্রদান করছেন না, সেদিকে একটু বিরতি দিন। GR00T N1 পেপার অনুযায়ী, 2.2B মডেলকে প্রিটেইন করতে প্রায় 50,000 H100 GPU ঘন্টা লাগে, যা 1024টি GPU-এর একটি ক্লাস্টারে, 16,384 এর প্রিটেইনিং ব্যাচ সাইজে 200,000 গ্রেডিয়েন্ট ধাপের জন্য। উপরে পরিমাপ করা প্রতি ঘন্টায় 1.34 থেকে 2.34 USD হারে, এটি 67,000 থেকে 117,000 USD এর ভাড়া করা কম্পিউটের সমতুল্য। SmolVLA পেপার অনুযায়ী, এর প্রকল্পটি 481টি কমিউনিটি ডেটাসেট, 22.9K এপিসোড এবং 10.6M ফ্রেম জুড়ে প্রায় 30,000 GPU ঘন্টা ব্যবহার করে। আপনি ডাউনলোডের মূল্যে এর সবকিছুর উত্তরাধিকারী হন; আপনার 8 USD শেষ 20,000 ধাপ কিনে নেয়। কেন VLA গুলি এভাবে তৈরি করা হয় সেই বিভাজনটি কভার করে।

আর্ম: একটি এককালীন খরচ যা GPU বিলকে ম্লান করে দেয়

একটি প্রশিক্ষণ রান দুপুরের খাবারের চেয়ে কম ব্যয়বহুল। রোবটটি তা নয়। এই কারণেই SO-100 গুরুত্বপূর্ণ: এটিই সবচেয়ে সস্তা বাহু যা সম্পূর্ণ ইমিটেশন লার্নিং টুলচেইন আসলে সমর্থন করে।

বাহুসার্ভোভোল্টেজযন্ত্রাংশের খরচAY-Robots-এ সমর্থন
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURfull, reference arm
SO-101Feetech STS32157.4 V130 to 170 EURfull
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURcompatible
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURcompatible

SO-ARM100 রিপোজিটরিতে আপস্ট্রিম বিল অফ মেটেরিয়ালস আরও বিস্তারিত এবং আপনার অঞ্চলের সাথে মিলিয়ে দেখা উচিত: এর দুটি বাহুর জন্য যন্ত্রাংশ তালিকাটি একটি লিডার প্লাস ফলোয়ার সেটআপের জন্য মোট 229.88 USD বা 226.30 EUR, এবং এর একটি ফলোয়ার বাহুর জন্য যন্ত্রাংশ তালিকাটি মোট 121.94 USD বা 124.30 EUR। প্রতিটি 13.89 USD মূল্যের ছয়টি STS3215 সার্ভো সেই 121.94 এর মধ্যে 83.34, তাই সার্ভোগুলিই হল বাহু। প্রতি SmolVLA বা ACT রানে 1 থেকে 3 USD খরচ হলে, একজোড়া বাহু 77 থেকে 230টি প্রশিক্ষণ রানের সমান। আপনি যদি এখনও নির্বাচন করেন, SO-100 বনাম SO-101 হল সেই তুলনা যা গুরুত্বপূর্ণ, কারণ দুটি এত কাছাকাছি যে সিদ্ধান্তটি সক্ষমতার চেয়ে প্রাপ্যতার উপর নির্ভর করে।

7.4 V, 12 V নয়

STS3215 7.4 V এবং 12 V ভ্যারিয়েন্টে আসে; রিপোজিটরি উল্লেখ করে যে 12 V অংশের জন্য 5 V এর পরিবর্তে একটি 12 V 5 A সাপ্লাইও প্রয়োজন, তাই দুটি বিনিময়যোগ্য নয়। 7.4 V সার্ভোতে 12 V সরবরাহ করলে সেগুলি নষ্ট হয়ে যায়, এবং ছয়টি সার্ভো একটি ফলোয়ার বাহুর যন্ত্রাংশের খরচের দুই-তৃতীয়াংশ। প্রথম পাওয়ার-আপের আগে প্রতিটি সার্ভোর লেবেল পরীক্ষা করুন। যদি সার্ভোগুলি ইতিমধ্যেই অস্বাভাবিক আচরণ করে: সার্ভো সাড়া দিচ্ছে না, বাহু কাঁপে তারপর ঝুলে যায়

মানুষের কাজের সময়: যে লাইনটি কেউ স্প্রেডশীটে রাখে না

এই সংখ্যাটি খরচের আলোচনাকে সম্পূর্ণ পাল্টে দেয়। ডেমোনস্ট্রেশন রেকর্ড করা মানে একজন ব্যক্তি একটি রোবট আর্মকে রিয়েল টাইমে, একবারে একটি করে এপিসোড ধরে সরানো। এটিকে ব্যাচ করা যায় না এবং সেকেন্ডের হিসাবে ভাড়া নেওয়া যায় না। দ্য LeRobot ডেটাসেট রেকর্ডার ডিফল্ট সেটিংস সহ আসে যা হিসাব সহজ করে তোলে, তিনটিই নিশ্চিত করা হয়েছে DatasetRecordConfig: প্রতি 60 সেকেন্ড এপিসোড, দৃশ্য রিসেট করতে 60 সেকেন্ড, 50টি এপিসোড। নীচের টাকার কলামে একজন ব্যক্তির এক ঘন্টার কাজের জন্য 15 USD ধরা হয়েছে, যা একটি অনুমান মাত্র, কোনো প্ল্যাটফর্মের সংখ্যা নয়। আপনার নিজের হার প্রতিস্থাপন করুন; অনুপাতটিই মূল বিষয়।

  1. 1
    আপনি যে ডিফল্টগুলির জন্য বিল পাবেন, সেগুলির সাথে ডেটাসেট রেকর্ড করুন

    এটি lerobot 0.6.1, 3 আগস্ট 2026 তারিখের PyPI-এর সংস্করণ। CLI আকারটি লক্ষ্য করুন: রেকর্ডিং lerobot-record কনসোল এন্ট্রি পয়েন্টের (lerobot.scripts.lerobot_record) মাধ্যমে চলে, পুরনো python -m lerobot.scripts.record মডিউল পাথের মাধ্যমে নয়। AY-Robots 0.5.1 সংস্করণকে লক্ষ্য করে, এবং 0.5.1 হুইল একই lerobot-record এবং lerobot-train এন্ট্রি পয়েন্ট ঘোষণা করে, তাই নীচের আকার উভয় ক্ষেত্রেই স্থিতিশীল। তিনটি টাইমিং ফ্ল্যাগ আপস্ট্রিম ডিফল্ট, তাই এটি সেই কমান্ডও যা পরবর্তী টেবিলের হিসাব ধরে নেয়।

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    একটিও GPU মিনিট ভাড়া নেওয়ার আগে আপনি যা রেকর্ড করেছেন তা দেখুন

    একটি ডেটাসেট পরিদর্শন করতে প্রতি ঘন্টায় শূন্য USD খরচ হয়। একটি লস কার্ভ থেকে একই সমস্যা আবিষ্কার করতে H100 টায়ারে প্রতি ঘন্টায় 2.00 USD খরচ হয় এবং চার ঘন্টা দেরিতে আপনাকে জানায়। ডেটাসেটটি পুশ করুন এবং LeRobot ভিউয়ারে এটি স্ক্রাব করুন, অথবা AY-Robots ডেটাসেট ডিরেক্টরি ব্রাউজ করুন।

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    প্রশিক্ষণ দিন, এবং নিশ্চিত করুন যে চেকপয়েন্টটি পডের চেয়ে বেশি সময় ধরে টিকে থাকে

    একটি ভাড়া করা মেশিন সংজ্ঞানুসারে অস্থায়ী, তাই রান চলাকালীন চেকপয়েন্টগুলি কোথাও স্থায়ীভাবে লিখুন। দুটি ফ্ল্যাগ সিদ্ধান্ত নেয় যে আপনি যা দিয়েছেন তা রাখবেন কিনা। --save_freq ডিফল্টরূপে 20,000 স্টেপস, তাই একটি ডিফল্ট 20,000-স্টেপ SmolVLA রান তার প্রথম চেকপয়েন্টটি লেখে যখন রানটি ইতিমধ্যেই শেষ হয়ে যায়; কোনো কিছু ভাড়া নেওয়ার আগে এটি কমিয়ে দিন যা বাধাগ্রস্ত হতে পারে। --save_checkpoint_to_hub এর জন্য --policy.repo_id প্রয়োজন এবং lerobot 0.5.1-এ এটি বিদ্যমান নেই, তাই সেই সংস্করণে আপনাকে নিজেই মেশিন থেকে আউটপুট ডিরেক্টরি কপি করতে হবে। নীচের ব্যাচ সাইজটি আপস্ট্রিম ডকের উদাহরণ; AY-Robots ফর্ম SmolVLA-এর জন্য 2 পাঠায় এবং চেকপয়েন্টগুলি উপস্থিত হওয়ার সাথে সাথে অবজেক্ট স্টোরেজে লেখে।

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
এপিসোড60 সেকেন্ডে রেকর্ডিং60 সেকেন্ডে রিসেট করাওয়াল ক্লকপ্লাস 20 শতাংশ রি-রেকর্ডপ্রতি মানব ঘন্টায় 15 USD
30, the SmolVLA minimum30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, the other four minimums50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, a comfortable dataset100 min100 min3 h 20 min4 h 00 minabout 60 USD

ডানদিকের কলামটি 1 থেকে 12 USD রান খরচের সাথে তুলনা করুন। এই অনুমিত হারে, একটি 50-এপিসোডের ডেটাসেট রেকর্ড করতে প্রশিক্ষণ খরচের চেয়ে দুই থেকে সাত গুণ বেশি খরচ হয়, ক্রমাঙ্কন, ক্যামেরা সেটআপ এবং বাদ দেওয়া এপিসোডগুলি বাদ দিয়ে। এই কারণেই এর একটি সরাসরি আর্থিক মূল্য আছে। LeRobot গাইড প্রতি অবজেক্ট অবস্থানে 10টি করে কমপক্ষে 50টি এপিসোডের পরামর্শ দেয়; SmolVLA ডকুমেন্টেশন রিপোর্ট করে যে একই কাজের 25-এপিসোডের সংস্করণ যথেষ্ট ছিল না।

কোথায় আসলে টাকা নষ্ট হয়

1. এমন ডেটার উপর রান যা কখনোই কাজ করবে না

দুটি অদলবদল করা ক্যামেরা স্ট্রিম সহ একটি ডেটাসেটে 20,000-স্টেপের GR00T রান একটি পরিষ্কার ডেটাসেটের মতো একই খরচ হয়, একই সময় নেয় এবং একটি লস কার্ভ তৈরি করে যা দেখতে ঠিক আছে। ব্যর্থতা কয়েক ঘন্টা পরে রোবটের বাহুতে দেখা যায়। ঘণ্টার হিসাবে বিল করা হয় এবং রোগ নির্ণয় দিনের হিসাবে বিল করা হয়। দুটি লক্ষণ মনে রাখা দরকার: সাধারণত এর অর্থ হল পর্যবেক্ষণগুলি কাজের জন্য প্রয়োজনীয় তথ্য বহন করে না, এবং এর অর্থ হল ডেটাসেটে আপনার ধারণার চেয়ে কম বৈচিত্র্য ছিল।

2. একটি স্থির-ক্যামেরা কাজের জন্য ফাউন্ডেশন-মডেলের মূল্যে অর্থ প্রদান

ACT প্রায় 80M প্যারামিটার এবং এটি একটি কাজের 50টি প্রদর্শনী থেকে স্ক্র্যাচ থেকে প্রশিক্ষণের জন্য ডিজাইন করা হয়েছিল। GR00T N1.7 একটি প্রাক-প্রশিক্ষিত ব্যাকবোন সহ প্রায় 3B। একটি বোল্ট-ডাউন ক্যামেরা, একটি স্থির টেবিল এবং একটি বস্তুর জন্য, 80M মডেলটি প্রায়শই কাজ করে, 152 ms এর পরিবর্তে প্রতি অ্যাকশন ধাপে প্রায় 20 ms এ চলে এবং 4 থেকে 12 এর পরিবর্তে প্রতি রানে 1 থেকে 3 USD খরচ হয়। দামি মডেলটিতে 12 USD খরচ করার আগে সস্তা মডেলটি কাজ করে কিনা তা জানতে 3 USD খরচ করুন। ACT বনাম SmolVLA এবং GR00T N1.7 বনাম Pi0.5 দেখায় যে কোনটি সঠিক উত্তর হওয়া বন্ধ করে; মডেল এরিনাএ 85টি মডেল এবং 332টি বেঞ্চমার্ক ফলাফল রয়েছে।

3. যে GPUটির কথা আপনি ভুলে গেছেন

প্রতিরোধ করার জন্য সবচেয়ে সস্তা ভুল এবং করার জন্য সবচেয়ে সাধারণ ভুল। শুক্রবার ডিবাগ করার জন্য শুরু করা একটি ইনস্ট্যান্স সপ্তাহান্তে একটি বাস্তব রানের মতোই বিল হয়।

কার্ডস্ন্যাপশটে গড় হার24 ঘণ্টা নিষ্ক্রিয়7 দিন নিষ্ক্রিয়এর মূল্য
RTX 40900.32 USD/h7.68 USD53.76 USDপ্রায় 27টি SmolVLA বা ACT রান 2 USD-তে
A100 80 GB0.56 USD/h13.44 USD94.08 USDপ্রায় 12টি GR00T রান 8 USD-তে
H100 80 GB1.80 USD/h43.20 USD302.40 USDপ্রায় 38টি GR00T রান 8 USD-তে

AY-Robots-এ এই ব্যর্থতা ইনফারেন্সের জন্য ডিজাইন করা হয়েছে: ইনফারেন্স API দ্বারা সরবরাহকৃত পডগুলি একটি নিষ্ক্রিয় ওয়াচডগ বহন করে এবং একটি নিষ্ক্রিয় সময়ের পরে নিজেদের ধ্বংস করে। আপনি যদি কার্ডটি নিজে ভাড়া করেন, তবে সেই ওয়াচডগটি আপনার ক্যালেন্ডার রিমাইন্ডার।

4. একই উত্তরের জন্য দুবার অর্থ প্রদান

GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট হল একটি টাইরো CLI যা কোনো সিড প্রকাশ করে না। এটি কোনো প্ল্যাটফর্মের সীমাবদ্ধতা নয়, এটি আপস্ট্রিম টুল: gr00t/configs/finetune_config.py-এ কোনো সিড ফিল্ড নেই, এবং রিপোজিটরির নিজস্ব প্রশিক্ষণ টিপস সতর্ক করে যে রানগুলি 5 থেকে 6 শতাংশ পরিবর্তিত হয় কারণ ইমেজ অগমেন্টেশনগুলি নন-ডিটারমিনিস্টিক। lerobot 0.5.1 এবং 0.6.1 উভয় ক্ষেত্রেই সিড 1000 ডিফল্ট করে, তাই ACT, SmolVLA এবং Pi0.5 রানগুলি অন্তত একই ইনিশিয়ালাইজেশন এবং ডেটা অর্ডার থেকে পুনরায় চালানো যেতে পারে। এটি একটি GPU-তে বিট-আইডেন্টিক্যাল ওয়েটের প্রতিশ্রুতি নয়, তবে এটি একটি পুনরায় চালানো এবং একটি নতুন পরীক্ষার মধ্যে পার্থক্য। যদি একটি GR00T রান একটি কার্যকরী নীতি তৈরি করে এবং আপনি চেকপয়েন্ট ধরে না রাখেন, তবে আপনি এমন একটি ফলাফলের জন্য পুরো মূল্য পরিশোধ করবেন যা আপনি যে পার্থক্যটি খুঁজছিলেন তার চেয়ে বেশি ভিন্ন হতে পারে। আপনি যে চেকপয়েন্টের জন্য অর্থ প্রদান করেছেন তা হারানোর দ্বিতীয় উপায় হল: CLI ডিফল্টরূপে --save-total-limit 5 ব্যবহার করে, যা পুরানো চেকপয়েন্টগুলি মুছে ফেলার আগে রাখা চেকপয়েন্টের সর্বোচ্চ সংখ্যা হিসাবে নথিভুক্ত। স্টোরেজ কয়েক সেন্টের ব্যাপার; একটি পুনরায় চালানো 4 থেকে 12 USD এবং ছয় ঘণ্টা।

ইন্টারাপ্টিবল ক্ষমতা অর্ধেক দামে পাওয়া যায় এবং আপনার রান বন্ধ করে দেবে

উপরের বিড ফ্লোরগুলি অন-ডিমান্ড রেটের একটি অংশ, এবং vast.ai বলে যে বিডিং সিস্টেম ক্লায়েন্টের খরচ পঞ্চাশ শতাংশ বা তার বেশি কমাতে পারে। এর নিজস্ব কথায় এর অসুবিধা: একটি ইন্টারাপ্টিবল ইনস্ট্যান্স যেকোনো সময় বিরতি দেওয়া যেতে পারে যদি অন্য কোনো ব্যবহারকারী বেশি বিড করে বা একই রিসোর্সের জন্য একটি অন-ডিমান্ড ভাড়া তৈরি করা হয়, এবং সেই বিরতি "চলমান সমস্ত প্রক্রিয়া বন্ধ করে দেয়"। অন-ডিমান্ড সর্বদা অগ্রাধিকার পায়। যে রান প্রতি কয়েকশ ধাপে একটি চেকপয়েন্ট লেখে তার জন্য ঠিক আছে, কিন্তু যে রান শেষে লেখে তার জন্য এটি সম্পূর্ণ ক্ষতি, যা ডিফল্টগুলি আপনাকে দেয়: Isaac-GR00T CLI প্রতি --save-steps (ডিফল্ট 1000) লেখে, কিন্তু lerobot-এর --save_freq ডিফল্ট 20,000 ধাপে সেট করা থাকে, তাই একটি ডিফল্ট SmolVLA রান একবার চেকপয়েন্ট করে, শেষ লাইনে। এটি কমান, অথবা বিড করবেন না। AY-Robots প্রশিক্ষণ ফর্ম GR00T নবকে saveSteps হিসাবে প্রকাশ করে।

কার্ড নিজে ভাড়া করা
সুবিধা
  • সর্বনিম্ন প্রতি ঘন্টার রেট।
  • ইমেজ, CUDA সংস্করণ, lerobot বা Isaac-GR00T রিভিশন এবং প্রতিটি ফ্ল্যাগের সম্পূর্ণ নিয়ন্ত্রণ।
  • আপনার রান যদি বিরতি থেকে বাঁচতে যথেষ্ট ঘন ঘন চেকপয়েন্ট করে, তাহলে ইন্টারাপ্টিবল বিডিং রেট অর্ধেক করে দেয়।
  • কিছুই অ্যাবস্ট্রাক্ট করা হয় না, তাই যখন একটি রান অদ্ভুত আচরণ করে তখন আপনি কারণ দেখতে পারেন।
অসুবিধা
  • সেটআপের বিল GPU রেটে হয়: ড্রাইভার, ডিপেন্ডেন্সি, মাল্টি-গিগাবাইট বেস চেকপয়েন্ট এবং ডেটাসেট ডাউনলোড সবকিছুর খরচ প্রশিক্ষণের মতোই প্রতি ঘন্টায়।
  • একটি আউটবিড ইন্টারাপ্টিবল ইনস্ট্যান্স বিরতি দেওয়া হয় এবং এর প্রক্রিয়াগুলি বন্ধ করে দেওয়া হয়। একটি সেভ না করা রান মানে অর্থ নষ্ট, এবং lerobot ডিফল্ট তার প্রথম চেকপয়েন্ট 20,000 ধাপে লেখে।
  • আপনার জন্য পড ধ্বংস করার কিছু নেই। উপরের নিষ্ক্রিয় টেবিলটি ভুলে যাওয়ার বিল।
  • একক পূর্ণ 80 GB কার্ডের সরবরাহ কম: এই রিডে দুটি A100 80 GB এবং পাঁচটি H100 80 GB পূর্ণ-কার্ড অফার রয়েছে। তালিকাটিও পরিবর্তনশীল, তাই সবচেয়ে সস্তা তালিকাভুক্ত মূল্য এবং আপনি আসলে যে দামে ভাড়া নিতে পারবেন তা একই সংখ্যা নয়।
  • অবকাঠামোতে ব্যয় করা প্রতিটি ঘন্টা এমন একটি ঘন্টা যা নীতি কাজ করে কিনা তা নির্ধারণকারী পর্বগুলি রেকর্ড করতে ব্যয় করা হয়নি।

নিজে করা বনাম প্ল্যাটফর্মকে কার্ড ভাড়া দিতে দেওয়া

আপনি মেশিন নির্বাচন করেন, পরিবেশ তৈরি করেন এবং পড ধ্বংস করেন। প্রতি ঘন্টার রেট উপরের বাজার রেট; বাকি সব আপনার সময়।

  1. মডেলের প্রয়োজনীয় VRAM এর সাথে মিলে যাওয়া একটি কার্ড খুঁজুন: ACT এবং SmolVLA এর জন্য 24 GB, GR00T এবং Pi0.5 এর জন্য 80 GB।
  2. যদি রান বিরতি থেকে বাঁচতে না পারে তবে অন-ডিমান্ড ভাড়া করুন, যদি ঘন ঘন চেকপয়েন্ট করে তবে ইন্টারাপ্টিবল ভাড়া করুন।
  3. টুলচেইন ইনস্টল করুন: ACT, SmolVLA এবং Pi0.5 এর জন্য lerobot, GR00T এর জন্য নিজস্ব টাইরো লঞ্চার সহ Isaac-GR00T রিপোজিটরি।
  4. প্রয়োজনে ডেটাসেট রূপান্তর করুন। একটি LeRobot v3.0 ডেটাসেট GR00T লোডারকে ক্র্যাশ করে এবং v2.1 এ রূপান্তর করতে হবে।
  5. লঞ্চ করুন, লস দেখুন, চেকপয়েন্টগুলি লেখার সাথে সাথে কোথাও টেকসই স্থানে পুশ করুন।
  6. ইনস্ট্যান্সটি ধ্বংস করুন, তারপর নিশ্চিত করুন যে আপনি এটি ধ্বংস করেছেন।
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
বর্তমান Isaac-GR00T ফাইন-টিউন এন্ট্রি পয়েন্ট, যা রিপোজিটরি README-এর কমান্ডের সাথে মিলে যায়। এই CLI-তে কোনো সিড ফ্ল্যাগ নেই, তাই GR00T রানগুলি বিট-ফর-বিট পুনরুত্পাদনযোগ্য নয়।

একটি GR00T রানের বাস্তবসম্মত খরচ: একটি H100 80 GB তে 1.34 থেকে 2.34 USD প্রতি ঘন্টায় 3 থেকে 6 ঘন্টা হল 4 থেকে 14 USD, সাথে 20 থেকে 40 মিনিটের সেটআপ যা বিল হয়, এবং আপনার নিজের সময়।

প্ল্যাটফর্ম কী চার্জ করে এবং কীভাবে এটি কার্ড নির্বাচন করে

লজিকটি ইচ্ছাকৃতভাবে সরল। প্রতিটি মডেল ক্যাটালগ-এ একটি GPU স্তর ঘোষণা করে; ব্যাকএন্ড প্রয়োজনীয় VRAM নেয় এবং উপরে উল্লিখিত একই স্পট মার্কেটে একটি উপযুক্ত কার্ড ভাড়া করে। এই কারণেই উদ্ধৃত খরচ একটি পরিসীমা, একটি নির্দিষ্ট মূল্য নয়। GR00T এবং Pi0.5 এখানে শুধুমাত্র ক্লাউড-ভিত্তিক কারণ তাদের 40 GB এবং 70 GB ফ্লোর রয়েছে। SmolVLA এবং ACT আপনার নিজস্ব 24 GB কার্ডেও স্থানীয়ভাবে চলে, যেখানে ক্লাউড খরচ শূন্য এবং বিদ্যুৎ আপনার সমস্যা।

AY-Robots-এর মূল্য নির্ধারণের পৃষ্ঠা যেখানে একটি প্রশিক্ষণ রান এবং প্ল্যাটফর্ম অ্যাক্সেসের খরচ দেখানো হয়েছে
মূল্য নির্ধারণের পৃষ্ঠা। প্রতি-রান পরিসংখ্যান একটি নির্দিষ্ট তালিকা মূল্যের পরিবর্তে স্পট বাজারকে অনুসরণ করে।

একটি বিষয় সতর্কতার দাবি রাখে। গ্রেডিয়েন্ট অ্যাকুমুলেশন GR00T-এর উভয় ভেরিয়েন্টের জন্য প্রযোজ্য, তাই এটি বাড়ালে একই কার্ডে একটি বড় কার্যকর ব্যাচ পাওয়া যায়। Pi0.5 এবং SmolVLA-এর জন্য এটি একেবারেই প্রযোজ্য নয়: lerobot 0.5.1-এর প্রশিক্ষণ কনফিগে কোনো গ্রেডিয়েন্ট-অ্যাকুমুলেশন বিকল্প নেই, তাই ক্ষেত্রটিকে 16-এ সেট করলে কোনো খরচ হয় না এবং কোনো লাভও হয় না। যদি একটি সারিবদ্ধ কাজ কখনও শুরু না হয়, সারিতে আটকে থাকা কাজের পৃষ্ঠা কী পরীক্ষা করতে হবে তা কভার করে; যদি রান শুরু হওয়ার আগে ডেটাসেট প্রত্যাখ্যান করা হয়, তবে এটি প্রায় সবসময়ই v3.0 ফরম্যাটের সমস্যা

এই প্ল্যাটফর্ম যে সীমাবদ্ধতা সমাধান করে না: ল্যাটেন্সি

পাবলিক ইন্টারনেটের মাধ্যমে আপনার পলিসি পরিবেশনকারী একটি ভাড়া করা GPU একটি কন্ট্রোল লুপে রাউন্ড ট্রিপ যোগ করে যা প্রতি অ্যাকশন স্টেপে ইতিমধ্যেই 20 থেকে 485 ms। ধীর পিক-অ্যান্ড-প্লেসের জন্য ঠিক আছে, কিন্তু দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়। ক্লাউড ইনফারেন্স একটি চেকপয়েন্ট ভালোভাবে মূল্যায়ন করে এবং প্রোডাকশন ম্যানিপুলেশন খারাপভাবে চালায়: যদি কাজের জন্য গতির প্রয়োজন হয় তবে কম্পিউটকে সার্ভোগুলির পাশে থাকতে হবে, এবং এটি এমন একটি খরচ যা এই নিবন্ধটি অদৃশ্য করতে পারে না। দেখুন ইনফারেন্স ল্যাটেন্সি

প্রথম কার্যকরী পলিসির জন্য একটি বিস্তারিত বাজেট

সব চারটি লাইন একসাথে, শূন্য থেকে শুরু করে। GPU মোট 3 থেকে 5টি রান ধরে নেয়: প্রথমটি প্রমাণ করে যে পাইপলাইন কাজ করে, দ্বিতীয়টি একটি ডেটা সমস্যা প্রকাশ করে, তৃতীয় বা চতুর্থটি হল যেটি আপনি রাখেন।

লাইনমিতব্যয়ী পথআরামদায়ক পথ
আর্মশুধুমাত্র SO-100 ফলোয়ার, BOM-এ 121.94 USDলিডার এবং ফলোয়ার, BOM-এ 229.88 USD
মডেলSmolVLA বা ACT, 24 GB টিয়ারGR00T N1.7, A100 80 GB বা H100 টিয়ার
রেকর্ড করা এপিসোড30, SmolVLA-এর ন্যূনতম50 থেকে 100
রেকর্ড করার জন্য মানুষের সময়প্রায় 1 ঘণ্টা 12 মিনিট2 থেকে 4 ঘণ্টা
একটি রানের খরচ1 থেকে 3 USD4 থেকে 12 USD
কাজ করার আগে রান3 থেকে 53 থেকে 5
মোট GPU খরচ3 থেকে 15 USD12 থেকে 60 USD
বিলের সবচেয়ে বড় লাইনআর্ম, তারপর আপনার সময়আর্ম, তারপর আপনার সময়

এই আকারের রোবটের ক্ষেত্রেও এই প্যাটার্নটি প্রযোজ্য: কম্পিউট একটি রাউন্ডিং এরর, হার্ডওয়্যার একটি বাস্তব এককালীন খরচ, এবং মানুষের শ্রম হল পুনরাবৃত্তিমূলক ব্যয়। কিছু কেনার আগে প্রশিক্ষণের অংশটি পরীক্ষা করতে, আপনাকে মডেল তুলনা করতে এবং একটি আর্ম ছাড়াই একটি GPU ভাড়া নিতে দেয়, এবং হল একটি ফিজিক্যাল SO-100 যা আপনি ব্রাউজারে কোনো সাইনআপ ছাড়াই চালাতে পারবেন। সম্পূর্ণ পাইপলাইন এন্ড-টু-এন্ডের জন্য, সেটআপ, এবং প্রশিক্ষণ কভার করে, এবং হল সংক্ষিপ্ত সংস্করণ।

The AY-Robots training matrix with five policies as rows and four robot arms as columns, every cell linking to a specific training guide
The /train matrix: row for your budget, column for your arm, cell for the guide with that pairing's defaults and cost.
একটি VLA ফাইন-টিউনিং রানের শেষ থেকে শেষ পর্যন্ত খরচ কত?

A100 80 GB বা H100 টিয়ারে GR00T N1.7, GR00T N1.5 বা Pi0.5 এর জন্য প্রায় 4 থেকে 12 USD (প্রতি ঘন্টায় 1.20 থেকে 2.00 USD হারে 3 থেকে 6 ঘন্টা), এবং RTX 4090 টিয়ারে SmolVLA বা ACT এর জন্য প্রায় 1 থেকে 3 USD (প্রতি ঘন্টায় 0.30 থেকে 0.60 USD হারে 2 থেকে 5 ঘন্টা)। সেটআপ সময় গণনা করার পর কার্ড নিজে ভাড়া নিলে একই পরিসরে খরচ পড়ে, কারণ এটি প্রশিক্ষণের হারেই বিল করে।

A100 80 GB এর চেয়ে H100 এর জন্য অর্থ প্রদান করা কি মূল্যবান?

একটি একক SO-100 পলিসির জন্য, সাধারণত না। উভয়ই GR00T এবং Pi0.5 এর প্রয়োজনীয় মেমরি ফ্লোর পূরণ করে, এবং 23 আগস্ট 2026 এর তথ্য অনুযায়ী একটি সম্পূর্ণ A100 80 GB প্রতি ঘন্টায় 0.44 USD থেকে শুরু হয়েছিল, যেখানে একটি H100 80 GB এর জন্য 1.34 USD। H100 দ্রুত শেষ হয়, তাই হারের একটি অংশ কম ঘন্টা হিসাবে ফিরে আসে, কিন্তু এত ছোট একটি রানের জন্য মোট খরচ এখনও বেশি। H100 এর আসল যুক্তি হল প্রাপ্যতা: সেই বাজারে দুটি A100 80 GB এর বিপরীতে পাঁচটি একক H100 80 GB অফার রয়েছে, এবং যে কার্ড ভাড়া করা যায় না তার কোন মূল্য নেই।

একটি পলিসি কার্যকর হওয়ার আগে কতগুলি রান লাগে?

তিন থেকে পাঁচটি রানের পরিকল্পনা করুন। প্রথমটি প্রমাণ করে যে পাইপলাইনটি সঠিকভাবে সংযুক্ত আছে। দ্বিতীয়টি সাধারণত একটি ডেটাসেট সমস্যা প্রকাশ করে, যেমন একটি ক্যামেরা স্ট্রিম যা মাঝপথে বন্ধ হয়ে গেছে। তৃতীয় বা চতুর্থটি হল যেটি আপনি রাখবেন।

আমি কি ভাড়া নেওয়ার পরিবর্তে আমার নিজের GPU তে SmolVLA বা ACT প্রশিক্ষণ দিতে পারি?

হ্যাঁ। উভয়ই AY-Robots এ স্থানীয়ভাবে সমর্থিত এবং উভয়ই 24 GB তে স্বাচ্ছন্দ্যে ফিট করে; আসল ACT পেপারটি তার 80M মডেলকে একটি 11 GB RTX 2080 Ti তে প্রায় 5 ঘন্টায় প্রশিক্ষণ দিয়েছিল। GR00T এবং Pi0.5 এখানে শুধুমাত্র ক্লাউড-ভিত্তিক কারণ বিক্রেতাদের নথিভুক্ত ফাইন-টিউনিং ফ্লোরগুলি হল 40 GB এবং 70 GB, এবং বাজারে সবচেয়ে বড় কনজিউমার কার্ড হল 32 GB RTX 5090।

একই সংখ্যক স্টেপের জন্য মডেল জুড়ে ভিন্ন ভিন্ন খরচ হয় কেন?

পলিসি জুড়ে স্টেপগুলি তুলনীয় নয়। ACT একটি 24 GB কার্ডে ব্যাচ 8 এ 100,000 স্টেপ ডিফল্ট করে; GR00T N1.5 একটি 80 GB কার্ডে গ্র্যাডিয়েন্ট অ্যাকুমুলেশন 16 সহ ব্যাচ 1 এ 2,000 স্টেপ ডিফল্ট করে। বিলটি হল মেমরি ফুটপ্রিন্ট আপনাকে যে কার্ডে বাধ্য করে তার হারের সাথে ঘন্টা গুণ করে, স্টেপ কাউন্টার নয়।

শুরু করার আগে আপনার রানের খরচ কত হবে তা দেখুন

পাঁচটি পলিসির প্রতিটি তার GPU টিয়ার, রান টাইম এবং প্রতি রানের মূল্য তালিকাভুক্ত করে, এবং প্রশিক্ষণ ব্যাকএন্ড সেই একই স্পট মার্কেট থেকে কার্ড ভাড়া করে যেখানে এই সংখ্যাগুলি পরিমাপ করা হয়েছিল।

মূল্য পরীক্ষা করুন

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started