
GR00T N1.7, Pi0.5, SmolVLA, ACT নাকি GR00T N1.5? বাস্তব পরিস্থিতির সাথে মিলে যাওয়া একটি সিদ্ধান্ত সারণী, প্রকাশিত বেঞ্চমার্ক সংখ্যা, ল্যাটেন্সি, প্রতি রান খরচ এবং প্রতিটি পছন্দের পিছনের লাইসেন্স সহ।
আজ একটি SO-100 শ্রেণীর বাহুতে পাঁচটি নীতি প্রশিক্ষণযোগ্য। এগুলি ইনফারেন্সের ক্ষেত্রে ২৪ গুণ ভিন্ন,ল্যাটেন্সি, প্যারামিটার গণনায় ৩৭ গুণ এবং একটি রানের খরচে ১২ গুণ ভিন্ন, এবং আপনি ফলাফল শিপ করতে পারবেন কিনা তার উপরও নির্ভর করে। পাঁচটি মডেল কার্ডএটি সমাধান করবে না: আপনার যে প্রশ্নটি আছে, কোনটি আমি প্রথমে চালাব, তার উত্তর কোনটিই দেয় না?
নীচের প্রতিটি সংখ্যা ২০২৬ সালের আগস্ট মাসে কাগজপত্র, রেপো এবং কার্ড থেকে নেওয়া হয়েছে। প্ল্যাটফর্মের সংখ্যাগুলি এসেছেথেকে AY-Robots নীতি ক্যাটালগ; যেখানে দুটি ভিন্ন, উভয়ই দেখানো হয়েছে।
সংক্ষিপ্ত সংস্করণ
- •আপনার ডেটাসেট নিয়ে সন্দেহ থাকলে প্রথমে ACT প্রশিক্ষণ দিন: প্রতি রানে ১ থেকে ৩ USD, খারাপ ডেটা ঢাকতে কোনো প্রাক-প্রশিক্ষিত মডেল নেই।
- •GR00T N1.7 এবং Pi0.5 LIBERO-তে অর্ধেক পয়েন্টের মধ্যে থাকে, ৯৭.০ বনাম ৯৬.৮৫ থেকে ৯৭.৫। এটি কোনোটি বেছে নেওয়ার কারণ নয়।
- •Pi0.5 হল সাধারণীকরণের জন্য, নির্ভুলতার জন্য নয়, এবং ৪৮৫ ms-এ সবচেয়ে ধীর।
- •SmolVLA, ৪৫০ M প্যারামিটার সহ, এখানে একমাত্র VLA যা একটি ২৪ GB কার্ডে ফাইন-টিউন করে।
- •২০ ms-এ ACT দ্রুত প্রতিক্রিয়াশীল গতির জন্য একমাত্র বিকল্প। লাইসেন্স বাকিটা নির্ধারণ করে।
সিদ্ধান্ত সারণী
| আপনার পরিস্থিতি | এটি প্রশিক্ষণ দিন | কেন |
|---|---|---|
| ডেটা সেটের গুণমান অপ্রমাণিত | ACT | কোনো প্রাক-প্রশিক্ষিত মডেলই ত্রুটিপূর্ণ ডেটা সেট লুকাতে পারে না, এবং ব্যর্থতার খরচ 1 থেকে 3 USD। |
| যোগাযোগ-সমৃদ্ধ, বহু-ধাপের, ভাষা-নির্ভর | GR00T N1.7 | চারটি LIBERO স্যুটে 97.0%, সাথে একটি আপেক্ষিক এন্ড-ইফেক্টর অ্যাকশন স্পেস। |
| দ্রুত প্রতিক্রিয়াশীল গতি, সার্ভোতে ইনফারেন্স | ACT | 20 ms। পরবর্তী দ্রুততমটি 7.6 গুণ ধীর। |
| নতুন বস্তু, নতুন দৃশ্য, উন্মুক্ত বিশ্ব | Pi0.5 | 104টি পর্যন্ত অবস্থানে, ডিস্ট্রিবিউশনের বাইরের আচরণের জন্য তৈরি। |
| একটি 24 GB কার্ড, তবুও ভাষা চাই | SmolVLA | 450 M প্যারামিটার, 30 এপিসোডের ফ্লোর, স্থানীয়ভাবে চলে। |
| 2025 সালে রেকর্ড করা একটি রান পুনরুৎপাদন করা | GR00T N1.5 | শুধুমাত্র যদি আপনার প্রয়োজন হয়: LeRobot এখন এটি প্রত্যাখ্যান করে, ওজন অ-বাণিজ্যিক। |
| এটি একটি পণ্য হিসাবে পাঠানো হবে | N1.7, SmolVLA or ACT | N1.5 অ-বাণিজ্যিক, Pi0.5 Gemma শর্তাবলী বহন করে, SmolVLA-এর কার্ডে কোনোটি উল্লেখ নেই। |
পাঁচটি প্রার্থী
পাঁচটিই হল নীতি: ক্যামেরা ফ্রেম, জয়েন্ট পজিশন এবং, তাদের মধ্যে চারটির জন্য, একটি ভাষা নির্দেশ, ভবিষ্যতের জয়েন্ট টার্গেটের একটি অংশে ম্যাপ করা হয়েছে। তাদের মধ্যে পার্থক্য হল কতটা আপনি আসার আগে শেখা হয়েছিল।
| নীতি | প্যারামিটার | ল্যাটেন্সি | GPU স্তর | স্থানীয়? | সর্বনিম্ন এপিসোড | ফরম্যাট | খরচ |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | হ্যাঁ | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | হ্যাঁ | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | না | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | না | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | না | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-এর বর্তমান ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল, প্রায় 3 বিলিয়ন প্যারামিটার, প্রায় 40 মিলিয়ন প্রশিক্ষিত হয়েছে ফাইন-টিউনিং। রেপোতে N1.6 থেকে ডেল্টাগুলি তালিকাভুক্ত করা হয়েছে: ব্যাকবোন একটি ভেন্ডরড ঈগল মডেল থেকে Qwen3-VL-এর Cosmos-Reason2-2B-তে, ডিফিউশন লেয়ার 32 থেকে 16, স্টেট এবং অ্যাকশন ডাইমেনশন 29 থেকে 132, অ্যাকশন হরাইজন 16 থেকে 40।
একটি ছোট আর্মের ক্ষেত্রে যা গুরুত্বপূর্ণ তা হল আপেক্ষিক এন্ড-ইফেক্টর অ্যাকশন স্পেস: N1.7 বর্তমান পোজ থেকে ডেল্টাগুলি অনুমান করে, যা 20K ঘন্টার ইগোস্কেল মানব ভিডিওকে একটি রোবট পলিসিতে স্থানান্তরিত করতে দেয়। স্পেক দেখুন N1.7 পৃষ্ঠায়, পদ্ধতি দেখুন SO-100 গাইডে N1.7।
Isaac-GR00T README N1.7-কে একটি সাধারণ উপলব্ধতা রিলিজ হিসাবে ঘোষণা করেছে, সম্পূর্ণ বেঞ্চমার্ক এবং সমর্থন সহ। এর Hugging Face কার্ড এখনও আপডেট হয়নি: Model Version ফিল্ডে এখনও লেখা আছে GR00T N1.7 EA। রেপোটি নতুন ডকুমেন্ট।
GR00T N1.5
একই 3 B স্কেল, Eagle 2 ব্যাকবোন, SigLip2 এবং T5, ফ্লো-ম্যাচিং DiT হেড। এটি আপনার বিদ্যমান একটি প্রসারিত করার জন্য বিদ্যমান। দুটি কারণে এটি একটি দুর্বল ডিফল্ট: ওজন বহন করে NVIDIA's one-way non-commercial licence, এবং বর্তমান LeRobot রিলিজ N1.5 সমর্থন সরিয়ে দিয়েছে। দেখুন .
Pi0.5
ফিজিক্যাল ইন্টেলিজেন্সের VLA, পলিসি টাইপ pi05। গবেষণাপত্রটি PaliGemma থেকে ইনিশিয়ালাইজ করা একটি 2 B VLM এবং একটি 300 M অ্যাকশন এক্সপার্ট দেয়, যা রোবটকে 50 Hz গতিতে চালিত করে; LeRobot-এর pi05 কনফিগ ডিফল্টভাবে একটি 50-স্টেপ চাঙ্ক, সেই হারে এক সেকেন্ড। এর মূল আকর্ষণ হল অচেনা স্থান: বাস্তব বাড়িতে প্রায় 400 hours মোবাইল ম্যানিপুলেশন, এবং 3, 12, 22, 53, 82 এবং 104টি অবস্থানের উপর একটি স্কেলিং স্টাডি, যেখানে 104-অবস্থানের মডেলটি পরীক্ষামূলক বাড়িগুলিতে প্রশিক্ষিত একটি নিয়ন্ত্রণের সাথে মিলে গিয়েছিল।
একটি সীমাবদ্ধতা, যা উল্লেখ করা হয়েছে lerobot/pi05_base কার্ডে: পোর্টটি শুধুমাত্র ফ্লো-ম্যাচিং অ্যাকশন হেড বহন করে। সাবটাস্ক প্রেডিকশন, অ্যাকশন টোকেনাইজেশন এবং RL আপস্ট্রিম থেকে প্রকাশিত হয়নি, এবং openpi তার নিজের রিপোজিটরি সম্পর্কেও একই কথা বলে। Pi0.5 পৃষ্ঠা এবং SO-100-এ Pi0.5 গাইড বাকিটা আছে।
Pi0.5-এর জন্য গেটেড google/paligemma-3b-pt-224 টোকেনাইজার প্রয়োজন (gated: manual, যদিও গুগল বলে যে অনুরোধগুলি অবিলম্বে প্রক্রিয়া করা হয়)। এটি গ্রহণ না করে এবং ট্রেনিং এনভায়রনমেন্টে hf auth login না চালালে, কাজটি শুরু হয়, কিছুক্ষণ ডাউনলোড হয়, তারপর একটি অথরাইজেশন ত্রুটিতে বন্ধ হয়ে যায় যা একটি নেটওয়ার্ক ত্রুটির মতো মনে হয়। nvidia/GR00T-N1.7-3B গেটেড নয়, তবে এর nvidia/Cosmos-Reason2-2B ব্যাকবোন গেটেড (gated: auto)। কিউ করার আগে উভয়ই পরিষ্কার করুন; যদি একটি রান নিষ্ক্রিয় থাকে, স্টাক-কিউ পৃষ্ঠাটি কী পরীক্ষা করতে হবে তা তালিকাভুক্ত করে।
SmolVLA
450 M প্যারামিটার, অ্যাকশন এক্সপার্টে প্রায় 100 M, SmolVLM-2-এ VLM ফ্রিজ করা এবং শুধুমাত্র এর প্রথম 16টি ল্যাঙ্গুয়েজ-মডেল লেয়ার ব্যবহার করা হয়েছে। প্রিট্রেনিং ছিল কমিউনিটি ডেটা: 481টি ডেটাসেট, 10.6 M ফ্রেম, একই সস্তা আর্মস যা আপনি ব্যবহার করেন। এখানে একমাত্র VLA যা একটি 24 GB কার্ডে ফিট করে, এবং একমাত্র 30 পর্ব ফ্লোর। দেখুন SmolVLA পৃষ্ঠা.
ACT
এটি একটি ফাউন্ডেশন মডেল নয়। ALOHA থেকে অ্যাকশন চাঙ্কিং ট্রান্সফরমার প্রায় 80M প্যারামিটার নিয়ে গঠিত এবং প্রশিক্ষিত হয়েছে প্রতিটি কাজের জন্য স্ক্র্যাচ থেকে, 50 Hz এ 50টি প্রদর্শনের উপর। কাগজটি প্রায় দশ মিনিটের প্রদর্শনী থেকে ছয়টি বাস্তব দ্বিপাক্ষিক কাজ রিপোর্ট করে, যেখানে এটি হাইলাইট করা উদাহরণগুলিতে 80 থেকে 90 শতাংশ সাফল্য পাওয়া যায়। এর ধারণা, অ্যাকশন চাঙ্কিং, এই পৃষ্ঠার প্রতিটি মডেলে বিদ্যমান, এবং এর অ্যাবলেশন এখনও পরিমাপ করে সর্বোত্তম প্রভাব: টেম্পোরাল এনসেম্বলিং বন্ধ রেখে দুটি সিমুলেটেড কাজের উপর, k=1 এ 1 শতাংশ থেকে k=100 এ 44 শতাংশে সাফল্য বৃদ্ধি পায়। ACT পৃষ্ঠা বাকি তথ্য ধারণ করে।
বেঞ্চমার্কগুলি আসলে কী বলে
LIBERO হল এমন একটি বেঞ্চমার্ক যা এই পাঁচটি মডেলের মধ্যে তিনটি রিপোর্ট করে: একটি সিমুলেটেড ফ্রাঙ্কা পান্ডা, যা নিচে চারটি স্যুটে বিভক্ত, প্রতিটি স্যুটে দশটি করে কাজ রয়েছে। NVIDIA প্রতিটি স্যুটে 200টি পরীক্ষা চালিয়েছে।
| মডেল | স্থানিক | বস্তু | লক্ষ্য | 10 (দীর্ঘ) | গড় |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
প্রতিটি সংখ্যা একটি ভিন্ন হারনেস এবং বাজেট থেকে এসেছে। GR00T গ্লোবাল ব্যাচ 640-এ 20K ধাপ চালিয়েছে; openpi চিত্রটি একটি 30K চেকপয়েন্ট; LeRobot পোর্ট একটি LIBERO বেস মডেলে 6K ধাপ যোগ করেছে। SmolVLA আরও একটি অমিল: এর গবেষণাপত্র LIBERO-তে প্রথম থেকে সেই সারিটিকে প্রশিক্ষণ দেয়, কোনো VLA প্রিটেনিং ছাড়াই, যখন এর উপরের তিনটি প্রিটেইনড চেকপয়েন্টগুলিকে ফাইন-টিউন করে। 96.85 থেকে 97.5 কে একটি ক্লাস্টার হিসাবে বিবেচনা করুন, এবং 87.3% এর ব্যবধানকে বাস্তব হিসাবে, তবে 6.7 গুণ বেশি প্যারামিটার দিয়ে কেনা হয়েছে।
SimplerEnv বিস্তার দেখায়, যা LIBERO দেখায় না। NVIDIA N1.7 কে N1.6 এর সাথে তুলনা করে, যা একটি প্রজন্মগত ডেল্টা।
| SimplerEnv স্যুট | N1.6 গড় | N1.7 গড় | সেরা সুইং | সবচেয়ে খারাপ সুইং |
|---|---|---|---|---|
| Bridge (WidowX), 7টি কাজ | 56.6% | 62.3% | stack_cube 5.0 থেকে 48.0 | put_eggplant_in_basket 89.0 থেকে 53.0 |
| Fractal (Google Robot), 6টি কাজ | 52.0% | 72.5% | open_drawer 0.0 থেকে 65.0 | কিছুই না, প্রতিটি কাজ উন্নত হয়েছে |
ব্রিজ সারিটিই কার্যকর: গড়ে 5.7 পয়েন্ট অর্জিত হয়েছে যখন put_eggplant_in_basket 36 হারিয়েছে এবং put_eggplant_in_sink 33 থেকে 2-এ নেমে এসেছে। একটি নতুন প্রজন্ম বিতরণকে উপরে তোলার পরিবর্তে সরিয়ে দেয়, তাই যদি আপনার কাজটি N1.7 যেখানে পিছিয়েছিল সেখানে থাকে, তবে গড় কিছুই বলে না।

পাঁচটির মধ্যে, শুধুমাত্র SmolVLA গবেষণাপত্রটি একটি SO-100 শ্রেণীর আর্মের উপর রিপোর্ট করে: SmolVLA-এর জন্য 78.3 শতাংশ এবং তিনটি টাস্কে Pi0-এর জন্য 61.7, উভয়ই মাল্টি-টাস্ক, ACT দ্বারা প্রশিক্ষিত সিঙ্গেল-টাস্কের 48.3-এর বিপরীতে, যা একই রকম নয়। পরিষ্কার জোড়াটি SO-101 পিক-এন্ড-প্লেসে উভয়ই সিঙ্গেল-টাস্ক: বিতরণে 90 বনাম 70, 50 বনাম 40 এর বাইরে। তুলনা করুন ACT বনাম SmolVLA এবং Pi0.5 বনাম SmolVLA, অথবা ব্রাউজ করুন অ্যারেনা.
ল্যাটেন্সি এবং খরচ স্থাপনার সিদ্ধান্ত নেয়
ইনফারেন্স ল্যাটেন্সি এমন একটি সীমাবদ্ধতা যা মানুষ সবার শেষে আবিষ্কার করে এবং প্রথমে অনুশোচনা করে। একটি নীতি যা বেঞ্চমার্কে পাঁচ পয়েন্ট ভালো, কিন্তু প্রতি অ্যাকশন স্টেপে আধা সেকেন্ড বেশি সময় নেয়, আপনার ডেস্কে খারাপ দেখাবে: যোগাযোগের গতিবিদ্যা অপেক্ষা করে না।
একটি সতর্কতা: GR00T-এর চিত্রটি NVIDIA-এর কার্ডের সাথে একমত নয়, যা 4টি ডিনোইজিং স্টেপ এবং একটি ক্যামেরা H100-এ ইগার মোডে 85.8 ms, torch.compile-এর সাথে 48.6 ms, সম্পূর্ণ TensorRT-এর মাধ্যমে 27.9 ms সময় নেয়। এখানে 152 ms হল সার্ভিং ওভারহেড এবং একাধিক ক্যামেরা সহ একটি সম্পূর্ণ-স্ট্যাকের চিত্র, এটি কেবল একটি ফরোয়ার্ড পাস নয়।
20 থেকে 485 ms লুপটি মডেলের, এবং পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ এতে যোগ হয়। ধীর পিক-অ্যান্ড-প্লেসের জন্য রিমোট ইনফারেন্স কার্যকর, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়। যদি আপনার কাজের গতির প্রয়োজন হয়, তাহলে ইনফারেন্স সার্ভোগুলির পাশেই থাকে: ACT বা SmolVLA, স্থানীয়ভাবে। সম্পর্কিত: নীতি মাঝপথে থেমে যায়।
মডেল পরিবর্তন না করে সময় কেনার একটি উপায়: SmolVLA পেপার সিঙ্ক্রোনাস এক্সিকিউশন পরিমাপ করে, যেখানে নীতি পরবর্তী অংশ অনুমান করার আগে একটি অংশ শেষ করে, বনাম অ্যাসিঙ্ক্রোনাস, যেখানে অনুমান এক্সিকিউশনের সাথে ওভারল্যাপ করে। সাফল্য একই রকম, 78.3 বনাম 73.3, কিন্তু একই পিক-অ্যান্ড-প্লেস 13.75 এর পরিবর্তে 9.7 সেকেন্ড সময় নেয়, এবং একটি নির্দিষ্ট উইন্ডোতে রোবট 9টির পরিবর্তে 19টি চক্র পরিচালনা করে।
লাইসেন্স, যা পরীক্ষা করা হয়েছে কারণ কেউ পরীক্ষা করে না
| মডেল | ওয়েটসের লাইসেন্স | কোডের লাইসেন্স | বাণিজ্যিক ব্যবহার |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; কার্ড বাণিজ্যিক ব্যবহারের অনুমতি দেয় | Apache 2.0 | হ্যাঁ |
| GR00T N1.5 | NVIDIA একমুখী অবাণিজ্যিক লাইসেন্স | Apache 2.0 | না |
| Pi0.5 | pi05_base কার্ডের মেটাডেটা অনুযায়ী লাইসেন্স: gemma | Apache 2.0 (openpi, LeRobot docs) | উভয়ই পড়ুন, তাদের মধ্যে অমিল আছে |
| SmolVLA | smolvla_base কার্ডে কোনো লাইসেন্স ক্ষেত্র নেই | Apache 2.0 (LeRobot) | কোড হ্যাঁ, ওয়েটস উল্লেখ করা হয়নি |
| ACT | কোনো বেস ওয়েটস বিদ্যমান নেই | Apache 2.0 (LeRobot) | হ্যাঁ |
Pi0.5 সারির প্রতি মনোযোগ প্রয়োজন। LeRobot pi05 ডকুমেন্টেশন openpi-এর সাথে সামঞ্জস্যপূর্ণভাবে Apache 2.0 উল্লেখ করে, যখন হাব কার্ড lerobot/pi05_base বহন করে license: gemma। উভয়ই সক্রিয়। GR00T N1.7-এর একটি নরম সংস্করণ রয়েছে: Isaac-GR00T README-তে উল্লেখ করা হয়েছে যে N1.7 Apache 2.0-এর অধীনে সম্পূর্ণ বাণিজ্যিকভাবে লাইসেন্সযোগ্য, যখন এর নিজস্ব লাইসেন্স বিভাগ এবং মডেল কার্ড শুধুমাত্র কোডকে Apache 2.0-এর অধীনে এবং ওয়েটসকে NVIDIA Open Model License-এর অধীনে রাখে।
যে ডিফল্টগুলো আপনি আসলে চালাবেন
প্রতিটি প্রশিক্ষক ফর্ম একটি ডিফল্ট সহ আসে, এবং সেগুলি নির্বিচার নয়। ACT-এর নিজস্ব LeRobot: ব্যাচ 8, lr 1e-5, 100000 প্রশিক্ষণ ধাপ, চাঙ্ক সাইজ 100, ACTConfig আপস্ট্রিম এবং k=100 from the ACT paper এর সাথে মিলে যায়। নিচের একটি কলাম একটি ফাঁদ।
| পলিসি | ব্যাচ | LR | সর্বোচ্চ ধাপ | গ্র্যাড অ্যাকুম | প্রযোজ্য? | অতিরিক্ত নব |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | হ্যাঁ | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | হ্যাঁ | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | না (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | না | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | না | chunkSize, nActionSteps, seed, logFreq |
GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট (launch_finetune.py, একটি টাইরো CLI)-এ কোনো সিড ফিল্ড নেই তার কনফিগ ডেটাক্লাসে, তাই রানগুলি বিট-ফর-বিট পুনরুৎপাদনযোগ্য নয়। রেপোটি আরও সতর্ক করে যে রানগুলির মধ্যে 5 থেকে 6 শতাংশ ভিন্নতা অ-নির্ধারিত চিত্র অগমেন্টেশন থেকে, যা অনলাইনে বিতর্কিত বেশিরভাগ বেঞ্চমার্ক পার্থক্যের চেয়ে বড়। LeRobot-এর ডিফল্ট সিড 1000। গ্র্যাড-অ্যাকুম কলামটি বর্ণনা করে lerobot 0.5.1; আপস্ট্রিম 0.6.2 এটিকে --accelerator.gradient_accumulation.steps হিসাবে প্রকাশ করে।
মডেল পছন্দের চেয়ে গুরুত্বপূর্ণ নব
এটি অ্যাকশন চাঙ্ক। দীর্ঘতর চাঙ্ক মসৃণ গতি এবং কম যৌগিক ত্রুটি দেয়, কিন্তু ব্লকটি কার্যকর হওয়ার সময় নীতিটি প্রতিশ্রুতিবদ্ধ থাকে, তাই এটি চলমান যেকোনো কিছুর প্রতি দেরিতে প্রতিক্রিয়া জানায়: একটি স্থির কিউবের উপর আত্মবিশ্বাসী, একটি ঘূর্ণায়মান কিউবের উপর হতাশ। যদি এটি অতিরিক্ত চলে যায়, তবে কার্যকর করা অংশটি ছোট করা পুনরায় প্রশিক্ষণের চেয়ে ভালো এবং বিনামূল্যে। একটি জয়েন্ট যা অকালে থেমে যায় তা একটি ভিন্ন সমস্যা; দেখুন .
- ACT: ACTConfig ডিফল্টরূপে
chunk_size 100এবংn_action_steps 100। টেম্পোরাল এনসেম্বলিং বন্ধ থাকে এবং এর জন্য প্রয়োজনn_action_steps 1। - GR00T N1.7: অভ্যন্তরীণ দিগন্ত 16 থেকে 40-এ গিয়েছিল, তবুও LeRobot-এর SO-101 উদাহরণ এখনও চালায়
--policy.chunk_size=16 --policy.n_action_steps=16। রোলআউট ফ্ল্যাগটির নাম পরিবর্তন করে রাখা হয়েছে--execution-horizon। - Pi0.5: একটি 50-স্টেপ চাঙ্ক, যার মধ্যে LeRobot-এর LIBERO রেসিপি 10টি কার্যকর করে
--policy.n_action_steps=10;--policy.pretrained_pathসহ, আপনি যদি ফ্ল্যাগটি বাদ দেন তবে এটি 50-এ ফিরে আসে। - SmolVLA: 50-অ্যাকশন চাঙ্ক, উভয় নব উন্মুক্ত।
এক বিকেলে পাঁচটি কীভাবে স্ক্রিন করবেন
সবচেয়ে সস্তা উত্তরটি আরও বেশি পড়া নয়। প্রায় 15 USD খরচ করুন এবং বাহুটিকে আপনাকে বলতে দিন: একবার রেকর্ড করুন, প্রথমে সস্তা মডেলটি প্রশিক্ষণ দিন, ডেটা সঠিক প্রমাণিত হলে বাড়ান। কাঠামো আয়তনের চেয়ে ভালো, এর মূল বিষয় এবং .
- 1একবারে 50টি পর্ব রেকর্ড করুন
GR00T, Pi0.5 এবং ACT-এর জন্য পঞ্চাশটি ফ্লোর পরিষ্কার করে, এবং SmolVLA-এর 30টি। প্রতিটি ভিন্নতা পাতলাভাবে ছড়িয়ে না দিয়ে পুনরাবৃত্তি করুন: 5টি কিউব অবস্থানে 50টি পর্ব প্রশিক্ষণ করা হয়েছে যেখানে 25টি হয়নি। দেখুন আপনার প্রথম ডেটাসেট রেকর্ড করুন।
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2প্রথমে ACT প্রশিক্ষণ দিন, কারণ এটি আপনাকে মিথ্যা বলতে পারে না
কোনো প্রাক-প্রশিক্ষিত ওজন নেই, তাই যদি এটি কাজটি আদৌ করে, তাহলে আপনার ডেটাসেটে কাজটি রয়েছে। যদি ACT ফ্ল্যাটলাইন হয়, ডেটা ঠিক করুন। 24 GB কার্ডে 1 থেকে 3 USD, 2 থেকে 5 ঘন্টা।
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3একই ডেটাসেটে SmolVLA চালান, অপরিবর্তিত
একই ডেটা, একই আর্ম, 80 M এর পরিবর্তে 450 M প্যারামিটার, সাথে ভাষা কন্ডিশনিং। LeRobot একটি A100-এ প্রায় 4 ঘন্টায় 20K ধাপের রান সম্পন্ন করে। এটি আপনাকে বলে যে প্রাক-প্রশিক্ষণ কোনো সুবিধা দেয় কিনা।
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T ব্যবহার করার আগে v2.1-এ রূপান্তর করুন
GR00T LeRobot v2 ফরম্যাটের একটি ফ্লেভার পড়ে, সাথে একটি অতিরিক্ত
meta/modality.jsonযা সংযুক্ত স্টেট এবং অ্যাকশন অ্যারেগুলি কীভাবে নামযুক্ত ফিল্ডে বিভক্ত হয় তা ম্যাপ করে। একটি v3.0 ডেটাসেট সেই লোডারকে ক্র্যাশ করে, কারণ v3.0 অনেক পর্বকে শেয়ার করা ফাইলগুলিতে প্যাক করে যেখানে v2 প্রতি পর্বে একটি করে লিখত। Isaac-GR00Tscripts/lerobot_conversion/convert_v3_to_v2.pyহিসাবে ডাউনগ্রেড হেল্পার সরবরাহ করে; v3 প্রত্যাখ্যান পৃষ্ঠাটি দ্রুত পথ।text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5প্রথম দুটি যদি কিছু অসম্পূর্ণ রেখে যায় তবেই GR00T N1.7-এ উন্নীত করুন
এখানে দেখানো NVIDIA-এর CLI এর মাধ্যমে, অথবা LeRobot-এর
grootপলিসি টাইপের মাধ্যমে। NVIDIA ফাইন-টিউনিংয়ের জন্য 40 GB বা তার বেশি VRAM, এবং ইনফারেন্সের জন্য 16 GB VRAM সুপারিশ করে। OOM হলে, OOM পৃষ্ঠাটি দেখুন।bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
সেই স্ক্রিনিং পাস চালানোর দুটি উপায়
তিনটি পরিবেশ, কারণ টুলচেইনগুলি সহাবস্থান করে না। মেইনে LeRobot হল 0.6.2 এবং এর জন্য Python 3.12 বা নতুন সংস্করণ প্রয়োজন; Isaac-GR00T এবং openpi হল আলাদা uv-পরিচালিত রেপো।
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 কে তার একমাত্র ভিডিও ব্যাকএন্ড হিসাবে পিন করে, যার জন্য FFmpeg 4 থেকে 7 প্রয়োজন। FFmpeg 8 অসমর্থিত, AV1 নিশ্চিত নয়। - openpi মেমরি ফ্লোর: ইনফারেন্স 8 GB এর উপরে, LoRA 22.5 GB এর উপরে, সম্পূর্ণ ফাইন-টিউনিং 70 GB এর উপরে। শেষটি এই কারণে যে Pi0.5 একটি A100 কাজ।
- GPU নিজেই ভাড়া করুন, পরে এটি ধ্বংস করুন, তিনটি চেকপয়েন্ট পাথের সেট হাতে মিলিয়ে নিন।
একই পাঁচটি মডেল, একটি ফর্ম। মডেল, ডেটাসেট এবং হাইপারপ্যারামিটার নির্বাচন করুন; ব্যাকএন্ড প্রয়োজনীয় VRAM অনুযায়ী একটি GPU ভাড়া করে, প্রশিক্ষক চালায় এবং অবজেক্ট স্টোরেজে লেখে।
- The প্রশিক্ষণ ম্যাট্রিক্স হল চারটি আর্ম দ্বারা পাঁচটি মডেল, প্রতিটি সেল একটি নির্দেশিকা: SO-100-এ SmolVLA, SO-101-এ ACT।
- ইনফারেন্স পডগুলি একটি নিষ্ক্রিয় ওয়াচডগ সহ
/api/inference/podদ্বারা স্বয়ংক্রিয়ভাবে সরবরাহ করা হয়, তাই একটি ভুলে যাওয়া পড নীরবে বিল করে না। - বেস চেকপয়েন্টগুলি বিক্রেতাদের নিজস্ব:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base। ACT-এর কোনোটি নেই। - CLI থেকে এবং MCP সার্ভার এর মাধ্যমে AI এজেন্টদের থেকে একই অপারেশন।
- কোনো হার্ডওয়্যার নেই? লাইভ আর্ম কোনো সাইনআপ ছাড়াই একটি ফিজিক্যাল SO-100 স্ট্রিম করে; চেষ্টা করার পৃষ্ঠাটি প্রবেশের উপায়গুলি দেখায়।
ফাউন্ডেশন মডেল নাকি স্ক্র্যাচ থেকে
আসল দ্বিধাটি হল কোন 3 B মডেলটি বেছে নেওয়া নয়। এটি হল একটি প্রাক-প্রশিক্ষিত VLA ব্যবহার করা উচিত কিনা, এই বিবেচনায় যে ACT প্রতিটি প্রায় দশ মিনিটের প্রদর্শনী থেকে ছয়টি বাস্তব দ্বিপাক্ষিক কাজ শিখেছে, 80 M প্যারামিটার সহ এবং কোনো প্রাক-প্রশিক্ষণ ছাড়াই।
- ভাষা কন্ডিশনিং। ACT-এর কোনোটি নেই; একটি ACT চেকপয়েন্ট একটি কাজ করে।
- আপনার প্রদর্শনীতে অনুপস্থিত বস্তুর উপর ভালো: SO-101-এ, ACT-এর 40% আউট অফ ডিস্ট্রিবিউশনের বিপরীতে 50%।
- সর্বোপরি মাল্টি-টাস্ক: SmolVLA একটি চেকপয়েন্ট সহ তিনটি SO-100 টাস্কে 78.3% অর্জন করে; ACT শুধুমাত্র একক-টাস্ক হিসাবে চালানো হয়েছিল।
- 7.6x থেকে 24x লেটেন্সি: ACT-এর 20 ms এর বিপরীতে প্রতি অ্যাকশন স্টেপে 152 থেকে 485 ms।
- 1 থেকে 3 এর পরিবর্তে প্রতি রানে 4 থেকে 12 USD, এবং যেকোনো 24 GB কার্ডের পরিবর্তে একটি A100 টায়ার।
- লাইসেন্স এক্সপোজার, এছাড়াও একটি গেটেড-রেপো ব্যর্থতা মোড যা স্ক্র্যাচ থেকে বিদ্যমান নয়।
- প্রাক-প্রশিক্ষিত ওজন একটি খারাপ ডেটাসেটকে আড়াল করতে পারে। ভাঙা ডেটাতে আধা-কার্যকর একটি ফাইন-টিউন ডেটা দেখার আগে এক সপ্তাহ খরচ করে।
একটি পুরানো রান পুনরুৎপাদন করার ক্ষেত্রে
একটি 2025 চেকপয়েন্ট অনুসরণ করা আপনার জন্য মডেল পছন্দ করে এবং সমস্যাটিকে সংস্করণ পিনিংয়ে পরিণত করে: বর্তমান LeRobot N1.5 প্রত্যাখ্যান করে, তাই আপনি পিন করেন lerobot==0.5.1। কোনো সিড ফিল্ড এবং রানগুলির মধ্যে 5 থেকে 6 শতাংশ ভিন্নতা না থাকায়, পুনরুৎপাদন নির্মাণগতভাবে আনুমানিক। এবং প্ল্যাটফর্মের দিকটি রয়েছে।

দুটিতে নেমে এসেছে? ACT বনাম GR00T N1.7 এবং GR00T N1.7 বনাম SmolVLA. কাঁচা সারিগুলি এরিনা এন্ট্রিগুলিতে রয়েছে: GR00T N1.7, Pi0.5, SmolVLA এবং ACT.
এই প্ল্যাটফর্মটি আপনাকে যেখানে সাহায্য করে না
- এটি রিমোট ইনফারেন্স দ্রুত করতে পারে না। 20 থেকে 485 ms লুপ মডেলের অন্তর্গত; ইন্টারনেট রাউন্ড ট্রিপ এতে যোগ হয়।
- এটি আপনার নিজস্ব হার্ডওয়্যারে GR00T বা Pi0.5 ফাইন-টিউন করতে পারে না। এখানে উভয়ই শুধুমাত্র ক্লাউড-ভিত্তিক; শুধুমাত্র SmolVLA এবং ACT স্থানীয়ভাবে চলে।
- এটি একটি ডেটাসেট ঠিক করতে পারে না। লস কমে কিন্তু পলিসি কিছুই করে না এটি একটি ডেটা সমস্যা, একটি পলিসি যা শুধুমাত্র একটি সেটআপে কাজ করে এটি একটি কভারেজ সমস্যা।
- এটি GR00T রানগুলিকে পুনরুৎপাদনযোগ্য করতে পারে না: আপস্ট্রিম কনফিগে কোনো সিড ফিল্ড নেই।
৮৫টি মডেল, ৩৩২টি বেঞ্চমার্ক ফলাফল, প্রতিটি সংখ্যা তার উৎসের সাথে সংযুক্ত
এই পৃষ্ঠার সর্ট করা যায় এমন টেবিলগুলি: ৮৫টি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল, ৩৩২টি বেঞ্চমার্ক ফলাফল, প্রতিটি তার পেপার বা মডেল কার্ডের সাথে সংযুক্ত।
অ্যারেনা খুলুনএকটি বেছে নিয়ে এগিয়ে যাওয়া
একটি ডিফল্ট: ৫০টি এপিসোড রেকর্ড করুন, ডেটাসেট প্রমাণ করতে ACT-কে ১ থেকে ৩ USD-এর জন্য প্রশিক্ষণ দিন, তারপর SmolVLA-কে একই ডেটার উপর। একসাথে ৬ USD-এর নিচে, এবং তারা গুরুত্বপূর্ণ প্রশ্নের উত্তর দেয়: এখানে প্রিট্রেনিং সাহায্য করে কিনা, নাকি বাধা ডেটা। যোগাযোগ-সমৃদ্ধ বহু-ধাপের কাজের জন্য GR00T N1.7-এ উন্নীত করুন, যখন দৃশ্য পরিবর্তিত হয় তখন Pi0.5-এ।
প্ল্যাটফর্ম ওয়াকথ্রু: আপনার প্রথম নীতি প্রশিক্ষণ দিন, তারপর আপনার প্রথম নীতি চালান। প্রশিক্ষণ ডকুমেন্টেশন এবং ডেটাসেট ডকুমেন্টেশন ফর্ম এবং বিন্যাস কভার করে; SO-100 পৃষ্ঠা এবং সম্পূর্ণ SO-100 গাইড নির্মাণ এবং ক্রমাঙ্কন কভার করে। পটভূমি: VLA ওভারভিউ এবং Pi0 ফ্লো-ম্যাচিং নিবন্ধ। যা আপনার সাফল্যের হার বাড়াবে তা হল ডেটা গুণমান গাইড।
SO-100-এ আমার প্রথমে কোন VLA নীতি প্রশিক্ষণ দেওয়া উচিত?▾
ACT, তারপর SmolVLA। ACT স্ক্র্যাচ থেকে প্রশিক্ষণ নেয়, তাই এটি একটি খারাপ ডেটাসেটকে মাস্ক করতে পারে না, এবং একটি 24 GB কার্ডে একটি রান করতে 1 থেকে 3 USD খরচ হয়। যদি ACT কাজটি করতে পারে, তাহলে GR00T N1.7 বা Pi0.5 রানের জন্য 4 থেকে 12 USD নষ্ট হয় না।
GR00T N1.7 কি Pi0.5 এর চেয়ে সত্যিই ভালো?▾
LIBERO-তে তারা নয়েজের মধ্যে থাকে: GR00T N1.7-এর জন্য চারটি স্যুটে 97.0%, openpi-তে 30k ধাপে Pi0.5-এর জন্য 96.85%, LeRobot পোর্টের জন্য 97.5%, সবই বিভিন্ন হারনেস থেকে। আসল পার্থক্যগুলি হল প্রতি অ্যাকশন স্টেপে 152 ms বনাম 485 ms, v2.1 ডেটাসেট বনাম v3.0, এবং বেঞ্চমার্ক নির্ভুলতা বনাম ওপেন-ওয়ার্ল্ড জেনারেলাইজেশন।
আমি কি একটি একক RTX 4090-এ এর মধ্যে যেকোনো একটি ফাইন-টিউন করতে পারি?▾
SmolVLA এবং ACT, হ্যাঁ; উভয়ই একটি RTX 4090 বা যেকোনো 24 GB কার্ডের জন্য তালিকাভুক্ত এবং স্থানীয়ভাবে চলে। GR00T N1.7, N1.5 এবং Pi0.5-এর জন্য একটি A100 বা H100 80 GB প্রয়োজন এবং এখানে শুধুমাত্র ক্লাউড-ভিত্তিক। NVIDIA GR00T ফাইন-টিউনিংয়ের জন্য 40 GB বা তার বেশি সুপারিশ করে; একটি সম্পূর্ণ Pi0.5 ফাইন-টিউনের জন্য openpi-এর ফ্লোর 70 GB-এর উপরে, LoRA-এর জন্য 22.5 GB।
এই পাঁচটির মধ্যে কোনটি আমি বাণিজ্যিকভাবে ব্যবহার করতে পারি?▾
GR00T N1.7 ওজন NVIDIA Open Model License Agreement-এর অধীনে রয়েছে, যা কার্ডে বাণিজ্যিক ব্যবহারের জন্য প্রযোজ্য বলে উল্লেখ করা হয়েছে। N1.5 ওজন অ-বাণিজ্যিক। SmolVLA-এর কোড LeRobot-এ Apache 2.0, কিন্তু lerobot/smolvla_base কার্ডে কোনো লাইসেন্স ক্ষেত্র নেই, তাই ওজনগুলি অনির্দিষ্ট। ACT-এর লাইসেন্সের জন্য কোনো বেস ওজন নেই। Pi0.5 অস্পষ্ট: LeRobot-এর ডক্স Apache 2.0 বলে, এর কার্ড মেটাডেটা লাইসেন্স: gemma পড়ে।
Sources
- NVIDIA Isaac-GR00T রিপোজিটরি: GA স্ট্যাটাস, N1.6 থেকে N1.7 পরিবর্তন, হার্ডওয়্যার প্রয়োজনীয়তা, torchcodec এবং FFmpeg সীমাবদ্ধতা, launch_finetune.py, রান-টু-রান ভ্যারিয়েন্স
- nvidia/GR00T-N1.7-3B মডেল কার্ড: Cosmos-Reason2-2B ব্যাকবোন, 3 B প্যারামিটার, ইনফারেন্স টাইমিং টেবিল, NVIDIA Open Model License, Model Version ফিল্ড
- nvidia/GR00T-N1.5-3B মডেল কার্ড: Eagle 2 রেফারেন্স, SigLip2 এবং T5, ফ্লো ম্যাচিং DiT, ওয়ান-ওয়ে অ-বাণিজ্যিক লাইসেন্স
- Isaac-GR00T LIBERO উদাহরণ: 20K ধাপে এবং ব্যাচ সাইজ 640-এ প্রতি-স্যুট সাফল্যের হার, প্রতি স্যুটে 200টি ট্রায়াল
- Isaac-GR00T SimplerEnv উদাহরণ: প্রতি-টাস্ক ব্রিজ এবং ফ্র্যাক্টাল সাফল্যের হার, GR00T N1.6 বনাম N1.7
- pi0.5: ওপেন-ওয়ার্ল্ড জেনারেলাইজেশন সহ একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল (2 B VLM প্লাস 300 M অ্যাকশন এক্সপার্ট, 50 Hz কন্ট্রোল, প্রায় 400 ঘন্টা মোবাইল ম্যানিপুলেশন, 3 থেকে 104টি অবস্থানে স্কেলিং স্টাডি)
- openpi রিপোজিটরি: GPU মেমরি ফ্লোর, ফ্লো-ম্যাচিং-হেড-অনলি স্কোপ, এবং examples/libero-তে Pi0.5 LIBERO ফলাফল
- lerobot/pi05_base মডেল কার্ড: LeRobot পোর্টের স্কোপ, লাইসেন্স: gemma মেটাডেটা, lerobot-train ব্যবহার
- LeRobot pi0.5 ডকুমেন্টেশন: গেটেড PaliGemma টোকেনাইজার, LIBERO রিপ্রোডাকশন টেবিল, n_action_steps ফলব্যাক ট্র্যাপ, Apache 2.0 স্টেটমেন্ট
- SmolVLA: সাশ্রয়ী এবং দক্ষ রোবোটিক্সের জন্য একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল (450 M প্যারামিটার, LIBERO এবং Meta-World টেবিল, SO-100 এবং SO-101 ফলাফল, অ্যাসিঙ্ক ইনফারেন্স)
- LeRobot SmolVLA ডকুমেন্টেশন: 25টির বিপরীতে 5টি অবস্থানে 50টি এপিসোড, একটি A100-এ প্রায় 4 ঘন্টায় 20k ধাপ
- কম খরচের হার্ডওয়্যার সহ ফাইন-গ্রেইনড বাইম্যানুয়াল ম্যানিপুলেশন শেখা (ACT এবং ALOHA): 80-90 শতাংশে 6টি টাস্ক, k=1 থেকে k=100 পর্যন্ত চাঙ্ক সাইজ অ্যাবলেশন
- LeRobot 0.6.2: ACTConfig এবং SmolVLAConfig ডিফল্ট, ডিফল্ট সিড 1000, --accelerator.gradient_accumulation.steps, Python 3.12 প্রয়োজনীয়তা, Apache 2.0
- LeRobot GR00T ডকুমেন্টেশন: পলিসি টাইপ groot, N1.5 সমর্থন সরানো হয়েছে, pin lerobot==0.5.1, SO-101 চাঙ্ক সাইজ উদাহরণ
- lerobot/smolvla_base মডেল কার্ড: --policy.path দ্বারা ব্যবহৃত SmolVLA বেস চেকপয়েন্ট, এবং এর কার্ড মেটাডেটা, যাতে কোনো লাইসেন্স ক্ষেত্র নেই
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started