AY-Robots নীতিগুলির তুলনা সারণী যেখানে GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT পাশাপাশি দেখানো হয়েছে প্যারামিটার গণনা, GPU স্তর, ইনফারেন্স ল্যাটেন্সি এবং ন্যূনতম পর্বের সংখ্যা সহ।
vla-মডেলনীতি-প্রশিক্ষণমডেল-নির্বাচনlerobotso-100

2026 সালে আপনার কোন VLA নীতি প্রশিক্ষণ করা উচিত?

AY-Robots ResearchAugust 23, 202618 মিনিট পড়া

GR00T N1.7, Pi0.5, SmolVLA, ACT নাকি GR00T N1.5? বাস্তব পরিস্থিতির সাথে মিলে যাওয়া একটি সিদ্ধান্ত সারণী, প্রকাশিত বেঞ্চমার্ক সংখ্যা, ল্যাটেন্সি, প্রতি রান খরচ এবং প্রতিটি পছন্দের পিছনের লাইসেন্স সহ।

আজ একটি SO-100 শ্রেণীর বাহুতে পাঁচটি নীতি প্রশিক্ষণযোগ্য। এগুলি ইনফারেন্সের ক্ষেত্রে ২৪ গুণ ভিন্ন,ল্যাটেন্সি, প্যারামিটার গণনায় ৩৭ গুণ এবং একটি রানের খরচে ১২ গুণ ভিন্ন, এবং আপনি ফলাফল শিপ করতে পারবেন কিনা তার উপরও নির্ভর করে। পাঁচটি মডেল কার্ডএটি সমাধান করবে না: আপনার যে প্রশ্নটি আছে, কোনটি আমি প্রথমে চালাব, তার উত্তর কোনটিই দেয় না?

নীচের প্রতিটি সংখ্যা ২০২৬ সালের আগস্ট মাসে কাগজপত্র, রেপো এবং কার্ড থেকে নেওয়া হয়েছে। প্ল্যাটফর্মের সংখ্যাগুলি এসেছেথেকে AY-Robots নীতি ক্যাটালগ; যেখানে দুটি ভিন্ন, উভয়ই দেখানো হয়েছে।

সংক্ষিপ্ত সংস্করণ

  • আপনার ডেটাসেট নিয়ে সন্দেহ থাকলে প্রথমে ACT প্রশিক্ষণ দিন: প্রতি রানে ১ থেকে ৩ USD, খারাপ ডেটা ঢাকতে কোনো প্রাক-প্রশিক্ষিত মডেল নেই।
  • GR00T N1.7 এবং Pi0.5 LIBERO-তে অর্ধেক পয়েন্টের মধ্যে থাকে, ৯৭.০ বনাম ৯৬.৮৫ থেকে ৯৭.৫। এটি কোনোটি বেছে নেওয়ার কারণ নয়।
  • Pi0.5 হল সাধারণীকরণের জন্য, নির্ভুলতার জন্য নয়, এবং ৪৮৫ ms-এ সবচেয়ে ধীর।
  • SmolVLA, ৪৫০ M প্যারামিটার সহ, এখানে একমাত্র VLA যা একটি ২৪ GB কার্ডে ফাইন-টিউন করে।
  • ২০ ms-এ ACT দ্রুত প্রতিক্রিয়াশীল গতির জন্য একমাত্র বিকল্প। লাইসেন্স বাকিটা নির্ধারণ করে।

সিদ্ধান্ত সারণী

আপনার পরিস্থিতিএটি প্রশিক্ষণ দিনকেন
ডেটা সেটের গুণমান অপ্রমাণিতACTকোনো প্রাক-প্রশিক্ষিত মডেলই ত্রুটিপূর্ণ ডেটা সেট লুকাতে পারে না, এবং ব্যর্থতার খরচ 1 থেকে 3 USD।
যোগাযোগ-সমৃদ্ধ, বহু-ধাপের, ভাষা-নির্ভরGR00T N1.7চারটি LIBERO স্যুটে 97.0%, সাথে একটি আপেক্ষিক এন্ড-ইফেক্টর অ্যাকশন স্পেস।
দ্রুত প্রতিক্রিয়াশীল গতি, সার্ভোতে ইনফারেন্সACT20 ms। পরবর্তী দ্রুততমটি 7.6 গুণ ধীর।
নতুন বস্তু, নতুন দৃশ্য, উন্মুক্ত বিশ্বPi0.5104টি পর্যন্ত অবস্থানে, ডিস্ট্রিবিউশনের বাইরের আচরণের জন্য তৈরি।
একটি 24 GB কার্ড, তবুও ভাষা চাইSmolVLA450 M প্যারামিটার, 30 এপিসোডের ফ্লোর, স্থানীয়ভাবে চলে।
2025 সালে রেকর্ড করা একটি রান পুনরুৎপাদন করাGR00T N1.5শুধুমাত্র যদি আপনার প্রয়োজন হয়: LeRobot এখন এটি প্রত্যাখ্যান করে, ওজন অ-বাণিজ্যিক।
এটি একটি পণ্য হিসাবে পাঠানো হবেN1.7, SmolVLA or ACTN1.5 অ-বাণিজ্যিক, Pi0.5 Gemma শর্তাবলী বহন করে, SmolVLA-এর কার্ডে কোনোটি উল্লেখ নেই।

পাঁচটি প্রার্থী

পাঁচটিই হল নীতি: ক্যামেরা ফ্রেম, জয়েন্ট পজিশন এবং, তাদের মধ্যে চারটির জন্য, একটি ভাষা নির্দেশ, ভবিষ্যতের জয়েন্ট টার্গেটের একটি অংশে ম্যাপ করা হয়েছে। তাদের মধ্যে পার্থক্য হল কতটা আপনি আসার আগে শেখা হয়েছিল।

নীতিপ্যারামিটারল্যাটেন্সিGPU স্তরস্থানীয়?সর্বনিম্ন এপিসোডফরম্যাটখরচ
ACT~80 M20 ms24 GB cardহ্যাঁ50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardহ্যাঁ30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBনা50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBনা50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBনা50v3.04 to 12 USD

GR00T N1.7

NVIDIA-এর বর্তমান ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল, প্রায় 3 বিলিয়ন প্যারামিটার, প্রায় 40 মিলিয়ন প্রশিক্ষিত হয়েছে ফাইন-টিউনিং। রেপোতে N1.6 থেকে ডেল্টাগুলি তালিকাভুক্ত করা হয়েছে: ব্যাকবোন একটি ভেন্ডরড ঈগল মডেল থেকে Qwen3-VL-এর Cosmos-Reason2-2B-তে, ডিফিউশন লেয়ার 32 থেকে 16, স্টেট এবং অ্যাকশন ডাইমেনশন 29 থেকে 132, অ্যাকশন হরাইজন 16 থেকে 40।

একটি ছোট আর্মের ক্ষেত্রে যা গুরুত্বপূর্ণ তা হল আপেক্ষিক এন্ড-ইফেক্টর অ্যাকশন স্পেস: N1.7 বর্তমান পোজ থেকে ডেল্টাগুলি অনুমান করে, যা 20K ঘন্টার ইগোস্কেল মানব ভিডিওকে একটি রোবট পলিসিতে স্থানান্তরিত করতে দেয়। স্পেক দেখুন N1.7 পৃষ্ঠায়, পদ্ধতি দেখুন SO-100 গাইডে N1.7

রেপোতে GA, মডেল কার্ডে EA

Isaac-GR00T README N1.7-কে একটি সাধারণ উপলব্ধতা রিলিজ হিসাবে ঘোষণা করেছে, সম্পূর্ণ বেঞ্চমার্ক এবং সমর্থন সহ। এর Hugging Face কার্ড এখনও আপডেট হয়নি: Model Version ফিল্ডে এখনও লেখা আছে GR00T N1.7 EA। রেপোটি নতুন ডকুমেন্ট।

GR00T N1.5

একই 3 B স্কেল, Eagle 2 ব্যাকবোন, SigLip2 এবং T5, ফ্লো-ম্যাচিং DiT হেড। এটি আপনার বিদ্যমান একটি প্রসারিত করার জন্য বিদ্যমান। দুটি কারণে এটি একটি দুর্বল ডিফল্ট: ওজন বহন করে NVIDIA's one-way non-commercial licence, এবং বর্তমান LeRobot রিলিজ N1.5 সমর্থন সরিয়ে দিয়েছে। দেখুন .

Pi0.5

ফিজিক্যাল ইন্টেলিজেন্সের VLA, পলিসি টাইপ pi05। গবেষণাপত্রটি PaliGemma থেকে ইনিশিয়ালাইজ করা একটি 2 B VLM এবং একটি 300 M অ্যাকশন এক্সপার্ট দেয়, যা রোবটকে 50 Hz গতিতে চালিত করে; LeRobot-এর pi05 কনফিগ ডিফল্টভাবে একটি 50-স্টেপ চাঙ্ক, সেই হারে এক সেকেন্ড। এর মূল আকর্ষণ হল অচেনা স্থান: বাস্তব বাড়িতে প্রায় 400 hours মোবাইল ম্যানিপুলেশন, এবং 3, 12, 22, 53, 82 এবং 104টি অবস্থানের উপর একটি স্কেলিং স্টাডি, যেখানে 104-অবস্থানের মডেলটি পরীক্ষামূলক বাড়িগুলিতে প্রশিক্ষিত একটি নিয়ন্ত্রণের সাথে মিলে গিয়েছিল।

একটি সীমাবদ্ধতা, যা উল্লেখ করা হয়েছে lerobot/pi05_base কার্ডে: পোর্টটি শুধুমাত্র ফ্লো-ম্যাচিং অ্যাকশন হেড বহন করে। সাবটাস্ক প্রেডিকশন, অ্যাকশন টোকেনাইজেশন এবং RL আপস্ট্রিম থেকে প্রকাশিত হয়নি, এবং openpi তার নিজের রিপোজিটরি সম্পর্কেও একই কথা বলে। Pi0.5 পৃষ্ঠা এবং SO-100-এ Pi0.5 গাইড বাকিটা আছে।

যে ফাঁদটি একটি দুপুর খেয়ে ফেলে: গেটেড রিপো

Pi0.5-এর জন্য গেটেড google/paligemma-3b-pt-224 টোকেনাইজার প্রয়োজন (gated: manual, যদিও গুগল বলে যে অনুরোধগুলি অবিলম্বে প্রক্রিয়া করা হয়)। এটি গ্রহণ না করে এবং ট্রেনিং এনভায়রনমেন্টে hf auth login না চালালে, কাজটি শুরু হয়, কিছুক্ষণ ডাউনলোড হয়, তারপর একটি অথরাইজেশন ত্রুটিতে বন্ধ হয়ে যায় যা একটি নেটওয়ার্ক ত্রুটির মতো মনে হয়। nvidia/GR00T-N1.7-3B গেটেড নয়, তবে এর nvidia/Cosmos-Reason2-2B ব্যাকবোন গেটেড (gated: auto)। কিউ করার আগে উভয়ই পরিষ্কার করুন; যদি একটি রান নিষ্ক্রিয় থাকে, স্টাক-কিউ পৃষ্ঠাটি কী পরীক্ষা করতে হবে তা তালিকাভুক্ত করে।

SmolVLA

450 M প্যারামিটার, অ্যাকশন এক্সপার্টে প্রায় 100 M, SmolVLM-2-এ VLM ফ্রিজ করা এবং শুধুমাত্র এর প্রথম 16টি ল্যাঙ্গুয়েজ-মডেল লেয়ার ব্যবহার করা হয়েছে। প্রিট্রেনিং ছিল কমিউনিটি ডেটা: 481টি ডেটাসেট, 10.6 M ফ্রেম, একই সস্তা আর্মস যা আপনি ব্যবহার করেন। এখানে একমাত্র VLA যা একটি 24 GB কার্ডে ফিট করে, এবং একমাত্র 30 পর্ব ফ্লোর। দেখুন SmolVLA পৃষ্ঠা.

ACT

এটি একটি ফাউন্ডেশন মডেল নয়। ALOHA থেকে অ্যাকশন চাঙ্কিং ট্রান্সফরমার প্রায় 80M প্যারামিটার নিয়ে গঠিত এবং প্রশিক্ষিত হয়েছে প্রতিটি কাজের জন্য স্ক্র্যাচ থেকে, 50 Hz এ 50টি প্রদর্শনের উপর। কাগজটি প্রায় দশ মিনিটের প্রদর্শনী থেকে ছয়টি বাস্তব দ্বিপাক্ষিক কাজ রিপোর্ট করে, যেখানে এটি হাইলাইট করা উদাহরণগুলিতে 80 থেকে 90 শতাংশ সাফল্য পাওয়া যায়। এর ধারণা, অ্যাকশন চাঙ্কিং, এই পৃষ্ঠার প্রতিটি মডেলে বিদ্যমান, এবং এর অ্যাবলেশন এখনও পরিমাপ করে সর্বোত্তম প্রভাব: টেম্পোরাল এনসেম্বলিং বন্ধ রেখে দুটি সিমুলেটেড কাজের উপর, k=1 এ 1 শতাংশ থেকে k=100 এ 44 শতাংশে সাফল্য বৃদ্ধি পায়। ACT পৃষ্ঠা বাকি তথ্য ধারণ করে।

বেঞ্চমার্কগুলি আসলে কী বলে

LIBERO হল এমন একটি বেঞ্চমার্ক যা এই পাঁচটি মডেলের মধ্যে তিনটি রিপোর্ট করে: একটি সিমুলেটেড ফ্রাঙ্কা পান্ডা, যা নিচে চারটি স্যুটে বিভক্ত, প্রতিটি স্যুটে দশটি করে কাজ রয়েছে। NVIDIA প্রতিটি স্যুটে 200টি পরীক্ষা চালিয়েছে।

মডেলস্থানিকবস্তুলক্ষ্য10 (দীর্ঘ)গড়
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
এই সারিগুলি কঠোরভাবে তুলনীয় নয়

প্রতিটি সংখ্যা একটি ভিন্ন হারনেস এবং বাজেট থেকে এসেছে। GR00T গ্লোবাল ব্যাচ 640-এ 20K ধাপ চালিয়েছে; openpi চিত্রটি একটি 30K চেকপয়েন্ট; LeRobot পোর্ট একটি LIBERO বেস মডেলে 6K ধাপ যোগ করেছে। SmolVLA আরও একটি অমিল: এর গবেষণাপত্র LIBERO-তে প্রথম থেকে সেই সারিটিকে প্রশিক্ষণ দেয়, কোনো VLA প্রিটেনিং ছাড়াই, যখন এর উপরের তিনটি প্রিটেইনড চেকপয়েন্টগুলিকে ফাইন-টিউন করে। 96.85 থেকে 97.5 কে একটি ক্লাস্টার হিসাবে বিবেচনা করুন, এবং 87.3% এর ব্যবধানকে বাস্তব হিসাবে, তবে 6.7 গুণ বেশি প্যারামিটার দিয়ে কেনা হয়েছে।

SimplerEnv বিস্তার দেখায়, যা LIBERO দেখায় না। NVIDIA N1.7 কে N1.6 এর সাথে তুলনা করে, যা একটি প্রজন্মগত ডেল্টা।

SimplerEnv স্যুটN1.6 গড়N1.7 গড়সেরা সুইংসবচেয়ে খারাপ সুইং
Bridge (WidowX), 7টি কাজ56.6%62.3%stack_cube 5.0 থেকে 48.0put_eggplant_in_basket 89.0 থেকে 53.0
Fractal (Google Robot), 6টি কাজ52.0%72.5%open_drawer 0.0 থেকে 65.0কিছুই না, প্রতিটি কাজ উন্নত হয়েছে

ব্রিজ সারিটিই কার্যকর: গড়ে 5.7 পয়েন্ট অর্জিত হয়েছে যখন put_eggplant_in_basket 36 হারিয়েছে এবং put_eggplant_in_sink 33 থেকে 2-এ নেমে এসেছে। একটি নতুন প্রজন্ম বিতরণকে উপরে তোলার পরিবর্তে সরিয়ে দেয়, তাই যদি আপনার কাজটি N1.7 যেখানে পিছিয়েছিল সেখানে থাকে, তবে গড় কিছুই বলে না।

AY-Robots অ্যারেনা লিডারবোর্ড, 85টি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেলের একটি সর্টেবল টেবিল যেখানে 332টি বেঞ্চমার্ক ফলাফল রয়েছে, প্রতিটি মান যে গবেষণাপত্র বা মডেল কার্ড থেকে এসেছে তার সাথে সংযুক্ত।
অ্যারেনায় 85টি VLA মডেল এবং 332টি বেঞ্চমার্ক ফলাফল রয়েছে, প্রতিটি তার গবেষণাপত্র বা মডেল কার্ডের সাথে সংযুক্ত। একটি ব্লগ পোস্টে উদ্ধৃত সংখ্যাটি বাস্তব কিনা তা পরীক্ষা করার জন্য এটি কার্যকর।

পাঁচটির মধ্যে, শুধুমাত্র SmolVLA গবেষণাপত্রটি একটি SO-100 শ্রেণীর আর্মের উপর রিপোর্ট করে: SmolVLA-এর জন্য 78.3 শতাংশ এবং তিনটি টাস্কে Pi0-এর জন্য 61.7, উভয়ই মাল্টি-টাস্ক, ACT দ্বারা প্রশিক্ষিত সিঙ্গেল-টাস্কের 48.3-এর বিপরীতে, যা একই রকম নয়। পরিষ্কার জোড়াটি SO-101 পিক-এন্ড-প্লেসে উভয়ই সিঙ্গেল-টাস্ক: বিতরণে 90 বনাম 70, 50 বনাম 40 এর বাইরে। তুলনা করুন ACT বনাম SmolVLA এবং Pi0.5 বনাম SmolVLA, অথবা ব্রাউজ করুন অ্যারেনা.

ল্যাটেন্সি এবং খরচ স্থাপনার সিদ্ধান্ত নেয়

ইনফারেন্স ল্যাটেন্সি এমন একটি সীমাবদ্ধতা যা মানুষ সবার শেষে আবিষ্কার করে এবং প্রথমে অনুশোচনা করে। একটি নীতি যা বেঞ্চমার্কে পাঁচ পয়েন্ট ভালো, কিন্তু প্রতি অ্যাকশন স্টেপে আধা সেকেন্ড বেশি সময় নেয়, আপনার ডেস্কে খারাপ দেখাবে: যোগাযোগের গতিবিদ্যা অপেক্ষা করে না।

একটি সতর্কতা: GR00T-এর চিত্রটি NVIDIA-এর কার্ডের সাথে একমত নয়, যা 4টি ডিনোইজিং স্টেপ এবং একটি ক্যামেরা H100-এ ইগার মোডে 85.8 ms, torch.compile-এর সাথে 48.6 ms, সম্পূর্ণ TensorRT-এর মাধ্যমে 27.9 ms সময় নেয়। এখানে 152 ms হল সার্ভিং ওভারহেড এবং একাধিক ক্যামেরা সহ একটি সম্পূর্ণ-স্ট্যাকের চিত্র, এটি কেবল একটি ফরোয়ার্ড পাস নয়।

রিমোট ইনফারেন্সের একটি কঠিন সীমা আছে

20 থেকে 485 ms লুপটি মডেলের, এবং পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ এতে যোগ হয়। ধীর পিক-অ্যান্ড-প্লেসের জন্য রিমোট ইনফারেন্স কার্যকর, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়। যদি আপনার কাজের গতির প্রয়োজন হয়, তাহলে ইনফারেন্স সার্ভোগুলির পাশেই থাকে: ACT বা SmolVLA, স্থানীয়ভাবে। সম্পর্কিত: নীতি মাঝপথে থেমে যায়

মডেল পরিবর্তন না করে সময় কেনার একটি উপায়: SmolVLA পেপার সিঙ্ক্রোনাস এক্সিকিউশন পরিমাপ করে, যেখানে নীতি পরবর্তী অংশ অনুমান করার আগে একটি অংশ শেষ করে, বনাম অ্যাসিঙ্ক্রোনাস, যেখানে অনুমান এক্সিকিউশনের সাথে ওভারল্যাপ করে। সাফল্য একই রকম, 78.3 বনাম 73.3, কিন্তু একই পিক-অ্যান্ড-প্লেস 13.75 এর পরিবর্তে 9.7 সেকেন্ড সময় নেয়, এবং একটি নির্দিষ্ট উইন্ডোতে রোবট 9টির পরিবর্তে 19টি চক্র পরিচালনা করে।

লাইসেন্স, যা পরীক্ষা করা হয়েছে কারণ কেউ পরীক্ষা করে না

মডেলওয়েটসের লাইসেন্সকোডের লাইসেন্সবাণিজ্যিক ব্যবহার
GR00T N1.7NVIDIA Open Model License; কার্ড বাণিজ্যিক ব্যবহারের অনুমতি দেয়Apache 2.0হ্যাঁ
GR00T N1.5NVIDIA একমুখী অবাণিজ্যিক লাইসেন্সApache 2.0না
Pi0.5pi05_base কার্ডের মেটাডেটা অনুযায়ী লাইসেন্স: gemmaApache 2.0 (openpi, LeRobot docs)উভয়ই পড়ুন, তাদের মধ্যে অমিল আছে
SmolVLAsmolvla_base কার্ডে কোনো লাইসেন্স ক্ষেত্র নেইApache 2.0 (LeRobot)কোড হ্যাঁ, ওয়েটস উল্লেখ করা হয়নি
ACTকোনো বেস ওয়েটস বিদ্যমান নেইApache 2.0 (LeRobot)হ্যাঁ

Pi0.5 সারির প্রতি মনোযোগ প্রয়োজন। LeRobot pi05 ডকুমেন্টেশন openpi-এর সাথে সামঞ্জস্যপূর্ণভাবে Apache 2.0 উল্লেখ করে, যখন হাব কার্ড lerobot/pi05_base বহন করে license: gemma। উভয়ই সক্রিয়। GR00T N1.7-এর একটি নরম সংস্করণ রয়েছে: Isaac-GR00T README-তে উল্লেখ করা হয়েছে যে N1.7 Apache 2.0-এর অধীনে সম্পূর্ণ বাণিজ্যিকভাবে লাইসেন্সযোগ্য, যখন এর নিজস্ব লাইসেন্স বিভাগ এবং মডেল কার্ড শুধুমাত্র কোডকে Apache 2.0-এর অধীনে এবং ওয়েটসকে NVIDIA Open Model License-এর অধীনে রাখে।

যে ডিফল্টগুলো আপনি আসলে চালাবেন

প্রতিটি প্রশিক্ষক ফর্ম একটি ডিফল্ট সহ আসে, এবং সেগুলি নির্বিচার নয়। ACT-এর নিজস্ব LeRobot: ব্যাচ 8, lr 1e-5, 100000 প্রশিক্ষণ ধাপ, চাঙ্ক সাইজ 100, ACTConfig আপস্ট্রিম এবং k=100 from the ACT paper এর সাথে মিলে যায়। নিচের একটি কলাম একটি ফাঁদ।

পলিসিব্যাচLRসর্বোচ্চ ধাপগ্র্যাড অ্যাকুমপ্রযোজ্য?অতিরিক্ত নব
GR00T N1.7321e-4200001হ্যাঁsaveSteps
GR00T N1.511e-5200016হ্যাঁsaveSteps
Pi0.515e-53000016না (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008নাseed, logFreq
ACT81e-51000001নাchunkSize, nActionSteps, seed, logFreq
পুনরুৎপাদনযোগ্যতা, তারিখ আগস্ট 2026

GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট (launch_finetune.py, একটি টাইরো CLI)-এ কোনো সিড ফিল্ড নেই তার কনফিগ ডেটাক্লাসে, তাই রানগুলি বিট-ফর-বিট পুনরুৎপাদনযোগ্য নয়। রেপোটি আরও সতর্ক করে যে রানগুলির মধ্যে 5 থেকে 6 শতাংশ ভিন্নতা অ-নির্ধারিত চিত্র অগমেন্টেশন থেকে, যা অনলাইনে বিতর্কিত বেশিরভাগ বেঞ্চমার্ক পার্থক্যের চেয়ে বড়। LeRobot-এর ডিফল্ট সিড 1000। গ্র্যাড-অ্যাকুম কলামটি বর্ণনা করে lerobot 0.5.1; আপস্ট্রিম 0.6.2 এটিকে --accelerator.gradient_accumulation.steps হিসাবে প্রকাশ করে।

মডেল পছন্দের চেয়ে গুরুত্বপূর্ণ নব

এটি অ্যাকশন চাঙ্ক। দীর্ঘতর চাঙ্ক মসৃণ গতি এবং কম যৌগিক ত্রুটি দেয়, কিন্তু ব্লকটি কার্যকর হওয়ার সময় নীতিটি প্রতিশ্রুতিবদ্ধ থাকে, তাই এটি চলমান যেকোনো কিছুর প্রতি দেরিতে প্রতিক্রিয়া জানায়: একটি স্থির কিউবের উপর আত্মবিশ্বাসী, একটি ঘূর্ণায়মান কিউবের উপর হতাশ। যদি এটি অতিরিক্ত চলে যায়, তবে কার্যকর করা অংশটি ছোট করা পুনরায় প্রশিক্ষণের চেয়ে ভালো এবং বিনামূল্যে। একটি জয়েন্ট যা অকালে থেমে যায় তা একটি ভিন্ন সমস্যা; দেখুন .

  • ACT: ACTConfig ডিফল্টরূপে chunk_size 100 এবং n_action_steps 100। টেম্পোরাল এনসেম্বলিং বন্ধ থাকে এবং এর জন্য প্রয়োজন n_action_steps 1
  • GR00T N1.7: অভ্যন্তরীণ দিগন্ত 16 থেকে 40-এ গিয়েছিল, তবুও LeRobot-এর SO-101 উদাহরণ এখনও চালায় --policy.chunk_size=16 --policy.n_action_steps=16। রোলআউট ফ্ল্যাগটির নাম পরিবর্তন করে রাখা হয়েছে --execution-horizon
  • Pi0.5: একটি 50-স্টেপ চাঙ্ক, যার মধ্যে LeRobot-এর LIBERO রেসিপি 10টি কার্যকর করে --policy.n_action_steps=10; --policy.pretrained_path সহ, আপনি যদি ফ্ল্যাগটি বাদ দেন তবে এটি 50-এ ফিরে আসে।
  • SmolVLA: 50-অ্যাকশন চাঙ্ক, উভয় নব উন্মুক্ত।

এক বিকেলে পাঁচটি কীভাবে স্ক্রিন করবেন

সবচেয়ে সস্তা উত্তরটি আরও বেশি পড়া নয়। প্রায় 15 USD খরচ করুন এবং বাহুটিকে আপনাকে বলতে দিন: একবার রেকর্ড করুন, প্রথমে সস্তা মডেলটি প্রশিক্ষণ দিন, ডেটা সঠিক প্রমাণিত হলে বাড়ান। কাঠামো আয়তনের চেয়ে ভালো, এর মূল বিষয় এবং .

  1. 1
    একবারে 50টি পর্ব রেকর্ড করুন

    GR00T, Pi0.5 এবং ACT-এর জন্য পঞ্চাশটি ফ্লোর পরিষ্কার করে, এবং SmolVLA-এর 30টি। প্রতিটি ভিন্নতা পাতলাভাবে ছড়িয়ে না দিয়ে পুনরাবৃত্তি করুন: 5টি কিউব অবস্থানে 50টি পর্ব প্রশিক্ষণ করা হয়েছে যেখানে 25টি হয়নি। দেখুন আপনার প্রথম ডেটাসেট রেকর্ড করুন

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    প্রথমে ACT প্রশিক্ষণ দিন, কারণ এটি আপনাকে মিথ্যা বলতে পারে না

    কোনো প্রাক-প্রশিক্ষিত ওজন নেই, তাই যদি এটি কাজটি আদৌ করে, তাহলে আপনার ডেটাসেটে কাজটি রয়েছে। যদি ACT ফ্ল্যাটলাইন হয়, ডেটা ঠিক করুন। 24 GB কার্ডে 1 থেকে 3 USD, 2 থেকে 5 ঘন্টা।

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    একই ডেটাসেটে SmolVLA চালান, অপরিবর্তিত

    একই ডেটা, একই আর্ম, 80 M এর পরিবর্তে 450 M প্যারামিটার, সাথে ভাষা কন্ডিশনিং। LeRobot একটি A100-এ প্রায় 4 ঘন্টায় 20K ধাপের রান সম্পন্ন করে। এটি আপনাকে বলে যে প্রাক-প্রশিক্ষণ কোনো সুবিধা দেয় কিনা।

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T ব্যবহার করার আগে v2.1-এ রূপান্তর করুন

    GR00T LeRobot v2 ফরম্যাটের একটি ফ্লেভার পড়ে, সাথে একটি অতিরিক্ত meta/modality.json যা সংযুক্ত স্টেট এবং অ্যাকশন অ্যারেগুলি কীভাবে নামযুক্ত ফিল্ডে বিভক্ত হয় তা ম্যাপ করে। একটি v3.0 ডেটাসেট সেই লোডারকে ক্র্যাশ করে, কারণ v3.0 অনেক পর্বকে শেয়ার করা ফাইলগুলিতে প্যাক করে যেখানে v2 প্রতি পর্বে একটি করে লিখত। Isaac-GR00T scripts/lerobot_conversion/convert_v3_to_v2.py হিসাবে ডাউনগ্রেড হেল্পার সরবরাহ করে; v3 প্রত্যাখ্যান পৃষ্ঠাটি দ্রুত পথ।

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    প্রথম দুটি যদি কিছু অসম্পূর্ণ রেখে যায় তবেই GR00T N1.7-এ উন্নীত করুন

    এখানে দেখানো NVIDIA-এর CLI এর মাধ্যমে, অথবা LeRobot-এর groot পলিসি টাইপের মাধ্যমে। NVIDIA ফাইন-টিউনিংয়ের জন্য 40 GB বা তার বেশি VRAM, এবং ইনফারেন্সের জন্য 16 GB VRAM সুপারিশ করে। OOM হলে, OOM পৃষ্ঠাটি দেখুন।

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

সেই স্ক্রিনিং পাস চালানোর দুটি উপায়

তিনটি পরিবেশ, কারণ টুলচেইনগুলি সহাবস্থান করে না। মেইনে LeRobot হল 0.6.2 এবং এর জন্য Python 3.12 বা নতুন সংস্করণ প্রয়োজন; Isaac-GR00T এবং openpi হল আলাদা uv-পরিচালিত রেপো।

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0 কে তার একমাত্র ভিডিও ব্যাকএন্ড হিসাবে পিন করে, যার জন্য FFmpeg 4 থেকে 7 প্রয়োজন। FFmpeg 8 অসমর্থিত, AV1 নিশ্চিত নয়।
  • openpi মেমরি ফ্লোর: ইনফারেন্স 8 GB এর উপরে, LoRA 22.5 GB এর উপরে, সম্পূর্ণ ফাইন-টিউনিং 70 GB এর উপরে। শেষটি এই কারণে যে Pi0.5 একটি A100 কাজ।
  • GPU নিজেই ভাড়া করুন, পরে এটি ধ্বংস করুন, তিনটি চেকপয়েন্ট পাথের সেট হাতে মিলিয়ে নিন।

ফাউন্ডেশন মডেল নাকি স্ক্র্যাচ থেকে

আসল দ্বিধাটি হল কোন 3 B মডেলটি বেছে নেওয়া নয়। এটি হল একটি প্রাক-প্রশিক্ষিত VLA ব্যবহার করা উচিত কিনা, এই বিবেচনায় যে ACT প্রতিটি প্রায় দশ মিনিটের প্রদর্শনী থেকে ছয়টি বাস্তব দ্বিপাক্ষিক কাজ শিখেছে, 80 M প্যারামিটার সহ এবং কোনো প্রাক-প্রশিক্ষণ ছাড়াই।

ACT কে স্ক্র্যাচ থেকে প্রশিক্ষণ না দিয়ে একটি প্রাক-প্রশিক্ষিত VLA ফাইন-টিউন করা
আপনি কী লাভ করবেন
  • ভাষা কন্ডিশনিং। ACT-এর কোনোটি নেই; একটি ACT চেকপয়েন্ট একটি কাজ করে।
  • আপনার প্রদর্শনীতে অনুপস্থিত বস্তুর উপর ভালো: SO-101-এ, ACT-এর 40% আউট অফ ডিস্ট্রিবিউশনের বিপরীতে 50%।
  • সর্বোপরি মাল্টি-টাস্ক: SmolVLA একটি চেকপয়েন্ট সহ তিনটি SO-100 টাস্কে 78.3% অর্জন করে; ACT শুধুমাত্র একক-টাস্ক হিসাবে চালানো হয়েছিল।
এর জন্য আপনাকে কী মূল্য দিতে হবে
  • 7.6x থেকে 24x লেটেন্সি: ACT-এর 20 ms এর বিপরীতে প্রতি অ্যাকশন স্টেপে 152 থেকে 485 ms।
  • 1 থেকে 3 এর পরিবর্তে প্রতি রানে 4 থেকে 12 USD, এবং যেকোনো 24 GB কার্ডের পরিবর্তে একটি A100 টায়ার।
  • লাইসেন্স এক্সপোজার, এছাড়াও একটি গেটেড-রেপো ব্যর্থতা মোড যা স্ক্র্যাচ থেকে বিদ্যমান নয়।
  • প্রাক-প্রশিক্ষিত ওজন একটি খারাপ ডেটাসেটকে আড়াল করতে পারে। ভাঙা ডেটাতে আধা-কার্যকর একটি ফাইন-টিউন ডেটা দেখার আগে এক সপ্তাহ খরচ করে।

একটি পুরানো রান পুনরুৎপাদন করার ক্ষেত্রে

একটি 2025 চেকপয়েন্ট অনুসরণ করা আপনার জন্য মডেল পছন্দ করে এবং সমস্যাটিকে সংস্করণ পিনিংয়ে পরিণত করে: বর্তমান LeRobot N1.5 প্রত্যাখ্যান করে, তাই আপনি পিন করেন lerobot==0.5.1। কোনো সিড ফিল্ড এবং রানগুলির মধ্যে 5 থেকে 6 শতাংশ ভিন্নতা না থাকায়, পুনরুৎপাদন নির্মাণগতভাবে আনুমানিক। এবং প্ল্যাটফর্মের দিকটি রয়েছে।

GR00T N1.7 এবং Pi0.5-এর জন্য AY-Robots-এর মুখোমুখি তুলনা পৃষ্ঠা, যেখানে প্যারামিটার সংখ্যা, GPU প্রয়োজনীয়তা, ইনফারেন্স ল্যাটেন্সি, ডেটাসেট ফরম্যাট এবং ন্যূনতম এপিসোড সংখ্যা পাশাপাশি দেখানো হয়েছে।
Head to head on /compare/groot-n1-7-vs-pi0-5. দুটি 3 B মডেল স্পেক শীটে বিনিময়যোগ্য মনে হলেও তা নয়: একটি LeRobot v2.1 চায়, অন্যটি v3.0 চায়।

দুটিতে নেমে এসেছে? ACT বনাম GR00T N1.7 এবং GR00T N1.7 বনাম SmolVLA. কাঁচা সারিগুলি এরিনা এন্ট্রিগুলিতে রয়েছে: GR00T N1.7, Pi0.5, SmolVLA এবং ACT.

এই প্ল্যাটফর্মটি আপনাকে যেখানে সাহায্য করে না

  • এটি রিমোট ইনফারেন্স দ্রুত করতে পারে না। 20 থেকে 485 ms লুপ মডেলের অন্তর্গত; ইন্টারনেট রাউন্ড ট্রিপ এতে যোগ হয়।
  • এটি আপনার নিজস্ব হার্ডওয়্যারে GR00T বা Pi0.5 ফাইন-টিউন করতে পারে না। এখানে উভয়ই শুধুমাত্র ক্লাউড-ভিত্তিক; শুধুমাত্র SmolVLA এবং ACT স্থানীয়ভাবে চলে।
  • এটি একটি ডেটাসেট ঠিক করতে পারে না। লস কমে কিন্তু পলিসি কিছুই করে না এটি একটি ডেটা সমস্যা, একটি পলিসি যা শুধুমাত্র একটি সেটআপে কাজ করে এটি একটি কভারেজ সমস্যা।
  • এটি GR00T রানগুলিকে পুনরুৎপাদনযোগ্য করতে পারে না: আপস্ট্রিম কনফিগে কোনো সিড ফিল্ড নেই।

৮৫টি মডেল, ৩৩২টি বেঞ্চমার্ক ফলাফল, প্রতিটি সংখ্যা তার উৎসের সাথে সংযুক্ত

এই পৃষ্ঠার সর্ট করা যায় এমন টেবিলগুলি: ৮৫টি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল, ৩৩২টি বেঞ্চমার্ক ফলাফল, প্রতিটি তার পেপার বা মডেল কার্ডের সাথে সংযুক্ত।

অ্যারেনা খুলুন

একটি বেছে নিয়ে এগিয়ে যাওয়া

একটি ডিফল্ট: ৫০টি এপিসোড রেকর্ড করুন, ডেটাসেট প্রমাণ করতে ACT-কে ১ থেকে ৩ USD-এর জন্য প্রশিক্ষণ দিন, তারপর SmolVLA-কে একই ডেটার উপর। একসাথে ৬ USD-এর নিচে, এবং তারা গুরুত্বপূর্ণ প্রশ্নের উত্তর দেয়: এখানে প্রিট্রেনিং সাহায্য করে কিনা, নাকি বাধা ডেটা। যোগাযোগ-সমৃদ্ধ বহু-ধাপের কাজের জন্য GR00T N1.7-এ উন্নীত করুন, যখন দৃশ্য পরিবর্তিত হয় তখন Pi0.5-এ।

প্ল্যাটফর্ম ওয়াকথ্রু: আপনার প্রথম নীতি প্রশিক্ষণ দিন, তারপর আপনার প্রথম নীতি চালানপ্রশিক্ষণ ডকুমেন্টেশন এবং ডেটাসেট ডকুমেন্টেশন ফর্ম এবং বিন্যাস কভার করে; SO-100 পৃষ্ঠা এবং সম্পূর্ণ SO-100 গাইড নির্মাণ এবং ক্রমাঙ্কন কভার করে। পটভূমি: VLA ওভারভিউ এবং Pi0 ফ্লো-ম্যাচিং নিবন্ধ। যা আপনার সাফল্যের হার বাড়াবে তা হল ডেটা গুণমান গাইড

SO-100-এ আমার প্রথমে কোন VLA নীতি প্রশিক্ষণ দেওয়া উচিত?

ACT, তারপর SmolVLA। ACT স্ক্র্যাচ থেকে প্রশিক্ষণ নেয়, তাই এটি একটি খারাপ ডেটাসেটকে মাস্ক করতে পারে না, এবং একটি 24 GB কার্ডে একটি রান করতে 1 থেকে 3 USD খরচ হয়। যদি ACT কাজটি করতে পারে, তাহলে GR00T N1.7 বা Pi0.5 রানের জন্য 4 থেকে 12 USD নষ্ট হয় না।

GR00T N1.7 কি Pi0.5 এর চেয়ে সত্যিই ভালো?

LIBERO-তে তারা নয়েজের মধ্যে থাকে: GR00T N1.7-এর জন্য চারটি স্যুটে 97.0%, openpi-তে 30k ধাপে Pi0.5-এর জন্য 96.85%, LeRobot পোর্টের জন্য 97.5%, সবই বিভিন্ন হারনেস থেকে। আসল পার্থক্যগুলি হল প্রতি অ্যাকশন স্টেপে 152 ms বনাম 485 ms, v2.1 ডেটাসেট বনাম v3.0, এবং বেঞ্চমার্ক নির্ভুলতা বনাম ওপেন-ওয়ার্ল্ড জেনারেলাইজেশন।

আমি কি একটি একক RTX 4090-এ এর মধ্যে যেকোনো একটি ফাইন-টিউন করতে পারি?

SmolVLA এবং ACT, হ্যাঁ; উভয়ই একটি RTX 4090 বা যেকোনো 24 GB কার্ডের জন্য তালিকাভুক্ত এবং স্থানীয়ভাবে চলে। GR00T N1.7, N1.5 এবং Pi0.5-এর জন্য একটি A100 বা H100 80 GB প্রয়োজন এবং এখানে শুধুমাত্র ক্লাউড-ভিত্তিক। NVIDIA GR00T ফাইন-টিউনিংয়ের জন্য 40 GB বা তার বেশি সুপারিশ করে; একটি সম্পূর্ণ Pi0.5 ফাইন-টিউনের জন্য openpi-এর ফ্লোর 70 GB-এর উপরে, LoRA-এর জন্য 22.5 GB।

এই পাঁচটির মধ্যে কোনটি আমি বাণিজ্যিকভাবে ব্যবহার করতে পারি?

GR00T N1.7 ওজন NVIDIA Open Model License Agreement-এর অধীনে রয়েছে, যা কার্ডে বাণিজ্যিক ব্যবহারের জন্য প্রযোজ্য বলে উল্লেখ করা হয়েছে। N1.5 ওজন অ-বাণিজ্যিক। SmolVLA-এর কোড LeRobot-এ Apache 2.0, কিন্তু lerobot/smolvla_base কার্ডে কোনো লাইসেন্স ক্ষেত্র নেই, তাই ওজনগুলি অনির্দিষ্ট। ACT-এর লাইসেন্সের জন্য কোনো বেস ওজন নেই। Pi0.5 অস্পষ্ট: LeRobot-এর ডক্স Apache 2.0 বলে, এর কার্ড মেটাডেটা লাইসেন্স: gemma পড়ে।

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started