
TinyVLA এবং SmolVLA ১ বিলিয়ন প্যারামিটারের নিচে একটি কার্যকরী VLA স্থাপন করে। উভয় গবেষণাপত্র থেকে বাস্তব সংখ্যা, lerobot ডিফল্ট, পরিমাপকৃত ল্যাটেন্সি, এবং একটি ২৪ জিবি কার্ডে একটি রানের খরচ কত।
প্রায় প্রতিটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল যা নিয়ে লেখা হয়, তা একটি ডেটাসেন্টার কার্ড অনুমান করে। OpenVLA হল 7 বিলিয়ন প্যারামিটার। GR00T N1.7 এবং Pi0.5 প্রায় 3 বিলিয়ন এবং ফাইন-টিউন করার জন্য একটি A100 80 GB চায়। যদি আপনার ডেস্কে থাকা কার্ডটি একটি 4090 হয়, তবে সেই শ্রেণীর মডেল নাগালের বাইরে।
দুটি গবেষণাপত্র যুক্তি দেয় যে আপনার এটির প্রয়োজন নেই। TinyVLA (arXiv 2409.12514, ফেব্রুয়ারী 2025-এ IEEE রোবোটিক্স অ্যান্ড অটোমেশন লেটার্স দ্বারা গৃহীত) একটি 400 মিলিয়ন থেকে 1.3 বিলিয়ন ব্যাকবোন এবং একটি ডিফিউশন অ্যাকশন হেড থেকে একটি VLA তৈরি করে। SmolVLA (arXiv 2506.01844, 2 জুন 2025-এ জমা দেওয়া হয়েছে) 450 মিলিয়ন প্যারামিটার সহ ওপেন ওয়েট, ওপেন ডেটা এবং একটি স্ক্রিপ্ট সরবরাহ করে যা একটি ভোক্তা কার্ডে চলে। এখানে উভয়ই কী পরিমাপ করেছে এবং যেখানে সাব-1 বিলিয়ন যুক্তিটি আর কার্যকর থাকে না।
আপনার যা জানা দরকার
- •TinyVLA তিনটি আকারে আসে: 422 মিলিয়ন মোট যার মধ্যে 101 মিলিয়ন প্রশিক্ষণযোগ্য, 740 মিলিয়ন যার মধ্যে 138 মিলিয়ন, 1.3 বিলিয়ন যার মধ্যে 143 মিলিয়ন। শুধুমাত্র প্রথম দুটি 1 বিলিয়নের নিচে থাকে।
- •এর সারণী IV একটি A6000-এ TinyVLA-1B-এর জন্য প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms পরিমাপ করে, যেখানে OpenVLA-7B-এর জন্য 292 ms এবং একটি ছোট OpenVLA-1B-এর জন্য 140 ms।
- •হেড সেই গতি ধরে রাখে, ব্যাকবোন নয়: TinyVLA-H-এর ডিফিউশন হেডকে একটি ACT হেডের সাথে অদলবদল করলে পাঁচটি বাস্তব-রোবট টাস্ক 94.0 গড় থেকে একক অঙ্কে নেমে আসে। একটি MLP হেড সব জায়গায় 0 স্কোর করে।
- •SmolVLA হল 450 মিলিয়ন, যার মধ্যে প্রায় 100 মিলিয়ন অ্যাকশন এক্সপার্ট, 481টি কমিউনিটি LeRobot ডেটাসেট এবং 10.6 মিলিয়ন ফ্রেমে প্রিটেইন করা হয়েছে। এটি LIBERO-তে 87.3 রিপোর্ট করে যেখানে 3.3 বিলিয়ন-এর একটি রোবোটিক্স-প্রিটেইনড Pi0-এর জন্য 86.0, এবং তিনটি বাস্তব SO-100 টাস্কে 78.3 যেখানে 3.5 বিলিয়ন-এর Pi0-এর জন্য 61.7।
- •সেই প্রিটেইনিং ছাড়া একক-টাস্কে প্রশিক্ষিত হলে, SmolVLA সেই টাস্কগুলিতে 40.0-এ নেমে আসে, যা ACT-এর 48.3-এর নিচে। ছোট মানেই স্বয়ংক্রিয়ভাবে সহজ নয়।
- •TinyVLA-এর কোনো LeRobot ইন্টিগ্রেশন নেই এবং এটি একটি CUDA 11.7 হুইল স্ট্যাক পিন করে। SmolVLA lerobot-এ আছে এবং এখানে 24 GB টায়ারে প্রতি রানে প্রায় 1 থেকে 3 USD খরচ হয়।
আসলে কী একটি ছোট VLA হিসাবে গণ্য হয়
একটি মডেল কার্ডে প্যারামিটার সংখ্যা একটি একক সংখ্যা নয়। এর অর্থ হতে পারে মোট ওজন, ইনফারেন্সের সময় লোড করা ওজন, অথবা যে ওজনগুলি গ্রেডিয়েন্ট পায় । TinyVLA উভয়ই রিপোর্ট করে, এবং পার্থক্যটি বড়: TinyVLA-H এর মোট 1.3 B কিন্তু 143 M প্রশিক্ষণযোগ্য, কারণ ভিশন টাওয়ার এবং বেশিরভাগ ভাষা মডেল স্থির থাকে যখন LoRA অ্যাডাপ্টার এবং অ্যাকশন হেড চলে। গবেষণাপত্রটি প্রশিক্ষণযোগ্য অংশকে প্রায় 5 শতাংশে রাখে।
| মডেল | প্যারামিটার | ব্যাকবোন | অ্যাকশন হেড | উৎস |
|---|---|---|---|---|
| TinyVLA-S | 422 M মোট, 101 M প্রশিক্ষণযোগ্য | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M মোট, 138 M প্রশিক্ষণযোগ্য | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B মোট, 143 M প্রশিক্ষণযোগ্য | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M অ্যাকশন এক্সপার্ট | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S স্কেল, T5-Base টেক্সট এনকোডার | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, কোনো ভাষা মডেল নেই | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 এবং SigLIP এনকোডার | Autoregressive action tokens | arXiv 2406.09246 |
দুটি সারি নিয়ে আলোচনা করা যেতে পারে। প্রায় 80 M এ এখানে অন্য সবকিছুর চেয়ে ছোট কিন্তু এর কোনো ভাষা মডেল নেই, তাই এটি একটি VLA নয়: এটি একটি কাজ শেখে এবং অন্য কোনো কাজ করতে বলা যায় না। 27 M এ একটি T5-Base টেক্সট এনকোডারের মাধ্যমে শর্তযুক্ত, LLM ব্যাকবোন নয়। ভালো বেসলাইন, কোনটিই আপনাকে লেবেল দ্বারা বোঝানো নির্দেশাবলী অনুসরণ করতে দেয় না।
TinyVLA-H, যে ভ্যারিয়েন্টটি প্রধান ফলাফল বহন করে, সেটি 1.3 B এবং লাইনের উপরে অবস্থান করে। আরও ভালো প্রশ্ন হলো, একটি মডেল প্রশিক্ষণের সময় 24 GB তে ফিট করে কিনা এবং ইনফারেন্সের সময় আপনার নিয়ন্ত্রণ হারে পৌঁছায় কিনা। এখানে আপনি যে পাঁচটি নীতি প্রশিক্ষণ দিতে পারেন তা নীতি পৃষ্ঠায় রয়েছে; TinyVLA এর একটি এরিনা এন্ট্রি আছে যদি আপনি এর সংখ্যা অন্যদের পাশে দেখতে চান।
TinyVLA: গতি আসে হেড থেকে, ব্যাকবোন থেকে নয়
সাধারণ ধারণা হলো তারা ল্যাঙ্গুয়েজ মডেলকে ছোট করেছে, তাই এটি দ্রুত হয়েছে। তবে গবেষণাপত্রের অ্যাবলেশন ভিন্ন কথা বলে। OpenVLA-এর 7 B ব্যাকবোনকে প্রায় 1 B ব্যাকবোন দিয়ে প্রতিস্থাপন করলে প্রতি-অ্যাকশন ভবিষ্যদ্বাণী 292 ms থেকে 140 ms-এ নেমে আসে, যা 2x গতি বৃদ্ধি। তুলনীয় প্যারামিটার সংখ্যা সহ TinyVLA-H একই কার্ডে 14 ms-এ চলে। বাকি 10x গতি আসে অ্যাকশন হেড থেকে।
| মডেল | প্রতি-অ্যাকশন ভবিষ্যদ্বাণী | পরিমাপ করা হয়েছে |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA ল্যাঙ্গুয়েজ মডেল হেডের মাধ্যমে ডিসক্রিটাইজড টোকেন হিসাবে অ্যাকশন নির্গত করে, প্রতি অ্যাকশন ডাইমেনশনের জন্য একটি করে, অটোরেগ্রেসিভভাবে। TinyVLA একটি ডিফিউশন ডিকোডার সংযুক্ত করে যা পুরো অংশটি একবারে তৈরি করে। সারণী V-তে TinyVLA-H-এর আর্কিটেকচার রয়েছে এবং একই পাঁচটি বাস্তব-রোবট টাস্কে শুধুমাত্র হেড পরিবর্তন করা হয়েছে। এটি উভয় গবেষণাপত্রে এই যুক্তির জন্য সবচেয়ে পরিষ্কার প্রমাণ যে ফ্লো ম্যাচিং পলিসি তৈরি করে, এবং এর কারণ Pi0 টোকেন ডিকোডিং থেকে সরে এসেছে।
| TinyVLA-H-এ হেড | প্লেস টেনিস | ফ্লিপ মাগ | স্ট্যাক কিউবস | ড্রয়ার বন্ধ করুন | বক্স খুলুন |
|---|---|---|---|---|---|
| ডিফিউশন (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| অ্যাকশন চাঙ্কিং ট্রান্সফরমার | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| মাল্টি-লেয়ার পারসেপ্ট্রন | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms এর সংখ্যাগুলি সারণী IV থেকে নেওয়া হয়েছে, যা একটি A6000-এ প্রাপ্ত। এগুলি প্রতি অ্যাকশন ভবিষ্যদ্বাণীর জন্য এবং ক্যামেরা ক্যাপচার, প্রিপ্রসেসিং এবং সার্ভোগুলিতে সিরিয়াল রাইট বাদ দিয়ে গণনা করা হয়েছে। প্রকাশিত ল্যাটেন্সি একটি নিম্ন সীমা হিসাবে বিবেচনা করুন, কখনই নিয়ন্ত্রণ হার হিসাবে নয়। আমাদের নিজস্ব সংখ্যাগুলিরও একই সীমাবদ্ধতা রয়েছে: দেখুন ইনফারেন্স ল্যাটেন্সি।
TinyVLA কী স্কোর করেছে
| বেঞ্চমার্ক | প্রোটোকল | TinyVLA-H | বেসলাইন |
|---|---|---|---|
| মেটাওয়ার্ল্ড, 50টি টাস্ক, সিম | মাল্টি-টাস্ক, 50টি ডেমো, 3টি সিড | কঠিনতা অনুসারে 77.6 / 21.5 / 11.4 / 15.8, গড় 31.6 | ডিফিউশন পলিসির গড় 10.5 |
| রিয়েল ফ্রাঙ্কা পান্ডা, 5টি টাস্ক | প্রতি টাস্কে 100টি ট্র্যাজেক্টরি, 20টি ট্রায়াল | 94.0 গড় | OpenVLA 68.3, ডিফিউশন পলিসি 35.3 |
| বাইম্যানুয়াল UR5, 3টি টাস্ক | মাল্টি-টাস্ক, প্রতি টাস্কে 10টি ট্রায়াল | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, ডিফিউশন পলিসি 40.3 / 31.3 / 43.0 |
দ্বি-ম্যানুয়াল সারির একটি বিরক্তিকর ব্যাখ্যা রয়েছে যা কাগজটি নিজেই দেয়: OpenVLA Open X-Embodiment-এ প্রাক-প্রশিক্ষিত, যা সম্পূর্ণরূপে একক-আর্ম ডেটা নিয়ে গঠিত, তাই একটি দুই-আর্ম অ্যাকশন স্পেস বিতরণের বাইরে এবং এটি শূন্য স্কোর করে। ডিফিউশন পলিসি বেসলাইন সেই তিনটি কাজের মধ্যে দুটিতে TinyVLA-H কে হারিয়েছে। পটভূমি Open X-Embodiment লেখাটিতে.

TinyVLA রেপো, আগস্ট 2026 অনুযায়ী
কাগজটি ভালো। কোডটি একটি গবেষণা ড্রপ। রিপোজিটরি হল github.com/liyaxuanliyaxuan/TinyVLA; এর README কোড প্রকাশের তারিখ 17 ফেব্রুয়ারি 2025 এবং শেষ কমিট 11 মার্চ 2025। একটি কাগজ পুনরুৎপাদনের জন্য ঠিক আছে, কিন্তু যদি আপনি একটি রক্ষণাবেক্ষণ করা লাইব্রেরি চান তবে এটি একটি সমস্যা।
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt `torch==2.0.1`, `transformers==4.37.1`, `deepspeed==0.9.5`, `peft==0.4.0`, `diffusers==0.11.1`, `numpy==1.24.4`, এবং CUDA স্ট্যাককে 11.x হুইলগুলির সাথে পিন করে: `nvidia-cuda-runtime-cu11==11.7.99`, `nvidia-cudnn-cu11==8.5.0.96`, `triton==2.0.0`। README-তে Python 3.10 চাওয়া হয়েছে; lerobot 0.6.1-এর জন্য 3.12 বা তার নতুন সংস্করণ প্রয়োজন, তাই এই দুটি একটি এনভায়রনমেন্ট শেয়ার করতে পারে না। প্রথমে আপনার GPU জেনারেশনের জন্য একটি torch 2.0.1 বিল্ড বিদ্যমান কিনা তা নিশ্চিত করুন। যদি একটি রান VRAM-এর অভাবে বন্ধ হয়ে যায়, তাহলে আউট-অফ-মেমরি চেকলিস্ট অনুমান করার চেয়ে দ্রুত কাজ করে।
TinyVLA LeRobot ডেটাসেটও পড়ে না। এর ফরম্যাট হল ACT-স্টাইলের HDF5: action, language_raw, এবং multi-view images, joint_positions, qpos ও qvel সহ একটি observations গ্রুপ। রিপোজিটরিটি RLDS ইনপুটের জন্য data_utils/rlds_to_h5py.py সরবরাহ করে, এবং প্রতিটি টাস্ক aloha_scripts/constants.py-তে তার dataset_dir, episode_len এবং camera_names সহ ম্যানুয়ালি রেজিস্টার করা হয়। যদি আপনার এপিসোড lerobot বা ডেস্কটপ ক্লায়েন্ট থেকে আসে, তাহলে রূপান্তরের দায়িত্ব আপনার।
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 একটি আট-কার্ড নোড অনুমান করে। এটিকে 1 এ সেট করুন এবং ব্যাচ সাইজ 32 এর অনেক নিচে নামিয়ে আনুন। কোনো সিঙ্গেল-GPU ভ্যারিয়েন্ট আপস্ট্রিম শিপ করে না, তাই কমান্ডটি 4090-এ হুবহু চালানো যাবে না।
- --deepspeed scripts/zero2.json এমন একটি ফাইলের দিকে নির্দেশ করে যা টপ-লেভেল scripts ডিরেক্টরিতে নেই। DeepSpeed কনফিগগুলি llava-pythia/scripts/zero2.json-এ শিপ করে। আপনার প্রথম রান করার আগে পাথটি ঠিক করুন।
- README-এর জন্য আউটপুট ডিরেক্টরির নামে llava_pythia থাকতে হবে, এবং LoRA সক্ষম থাকলে lora থাকতে হবে।
- ব্যাকবোন একটি আলাদা ডাউনলোড: lesjie/Llava-Pythia-400M, -700M অথবা -1.3B। এমন কোনো একক বেস চেকপয়েন্ট নেই যেখানে আপনি একটি পলিসি নির্দেশ করতে পারেন, যেভাবে আপনি lerobot/smolvla_base-এর দিকে নির্দেশ করেন।
SmolVLA: 1 B-এর নিচের মডেল যা আপনি আজ বিকেলে চালাতে পারবেন
SmolVLA একটি রক্ষণাবেক্ষণ করা লাইব্রেরির মধ্যে একই যুক্তি উপস্থাপন করে। এটি একটি SmolVLM2-500M-Video-Instruct ব্যাকবোনে 450 M প্যারামিটার ব্যবহার করে, এবং এর দক্ষতা আসে configuration_smolvla.py থেকে পড়া সেটিংস থেকে, ছোট হওয়ার দাবি থেকে নয়।
| configuration_smolvla.py-এর সেটিং | ডিফল্ট | এর সুবিধা |
|---|---|---|
| num_vlm_layers | 16 | শুধুমাত্র প্রথম 16টি ল্যাঙ্গুয়েজ মডেল লেয়ার চলে |
| expert_width_multiplier | 0.75 | অ্যাকশন এক্সপার্ট হিডেন সাইজ VLM-এর 75 শতাংশ |
| self_attn_every_n_layers | 2 | সেল্ফ-অ্যাটেনশন ক্রস-অ্যাটেনশনের সাথে ইন্টারলিভড |
| chunk_size / n_action_steps | 50 / 50 | এক পাসে 50টি অ্যাকশন নির্গত হয় এবং সব 50টি কার্যকর করা হয় |
| num_steps | 10 | ফ্লো ম্যাচিং ডিনয়েজিং 10 ধাপে স্থির করা হয়েছে |
| tokenizer_max_length | 48 | নির্দেশনা 48টি টোকেনে ট্রাঙ্কেট করা হয়েছে |
| freeze_vision_encoder / train_expert_only | True / True | ফাইন-টিউনিং এক্সপার্টকে সরিয়ে দেয়, ভিশন টাওয়ারকে নয় |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | কাগজের রেসিপি নয়: এর প্রিট্রেনিং 200000 ধাপের উপর 100-ধাপের ওয়ার্মআপ ব্যবহার করেছে |
প্রিট্রেনিং-এর জন্য 4টি GPU-তে 481টি কমিউনিটি LeRobot ডেটাসেট, 22.9 K এপিসোড এবং 10.6 M ফ্রেম ব্যবহার করা হয়েছিল, 256-এর গ্লোবাল ব্যাচে 200000 স্টেপস চালানো হয়েছিল; গবেষণাপত্রটি পুরো প্রোজেক্টটিকে প্রায় 30 K GPU ঘণ্টা বলে উল্লেখ করেছে। একটি সংখ্যা যা লক্ষ্য করার মতো: Hugging Face-এর লঞ্চ ব্লগ 487টি কিউরেটেড ডেটাসেটের কথা বলেছে যেখানে গবেষণাপত্রের সারণীতে 481টি উল্লেখ করা হয়েছে। আমরা গবেষণাপত্রের সংখ্যাটি ব্যবহার করছি এবং এই অমিলটি চিহ্নিত করছি।

| বেঞ্চমার্ক | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO গড়, মাল্টি-টাস্ক | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| মেটা-ওয়ার্ল্ড গড়, মাল্টি-টাস্ক | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| বাস্তব SO-100, 3টি টাস্ক, মাল্টি-টাস্ক ট্রেনিং | 78.3 | - | 61.7 (3.5 B) | - |
| বাস্তব SO-100, 3টি টাস্ক, সিঙ্গেল-টাস্ক, রোবোটিক্স প্রিট্রেনিং ছাড়া | 40.0 | - | - | 48.3 |
| SO-101 লেগো পিক-প্লেস, সিঙ্গেল-টাস্ক, ইন ডিস্ট্রিবিউশন | 90 | - | - | 70 |
| SO-101 লেগো পিক-প্লেস, সিঙ্গেল-টাস্ক, আউট অফ ডিস্ট্রিবিউশন | 50 | - | - | 40 |
LIBERO হল সিমুলেশন এবং সেখানে এখন সবকিছুই আশির ঘরে স্কোর করে। বাস্তব SO-100 সারিটি, যেখানে একটি 450 M মডেল একটি 3.5 B মডেলকে 16.6 পয়েন্টে হারিয়েছে, সেটিই আকর্ষণীয়; এর নিচের সারিটি হল এর প্রতিভার। কমিউনিটি প্রিট্রেনিং এবং মাল্টি-টাস্ক ট্রেনিং বাদ দিলে একই মডেল ACT-এর নিচে 40.0-এ নেমে আসে। যুক্তিযুক্ত দাবিটি হল যে একটি ছোট মডেল স্বয়ংক্রিয়ভাবে খারাপ নয়, এটি ভালো তাও নয়।
একটি ঘটনা সাহায্য করে: SmolVLA পেপারের মেটা-ওয়ার্ল্ড টেবিলে TinyVLA-এর নিজস্ব প্রকাশিত সংখ্যাগুলি একটি বেসলাইন হিসাবে রয়েছে, তাই প্রথমবারের মতো উভয় মডেল একটি টেবিলে রয়েছে, SmolVLA-0.45B 57.3 এবং TinyVLA-H 31.6। এটি আরও জানায় যে SmolVLA Pi0 এর চেয়ে প্রায় 40 শতাংশ দ্রুত প্রশিক্ষণ নেয় এবং 6 গুণ কম মেমরি ব্যবহার করে। এর সব তথ্য SmolVLA লেখকদের কাছ থেকে এসেছে; অ্যারেনা এন্ট্রি প্রতিটি মানকে তার উৎসের সাথে লিঙ্ক করে।
SmolVLA কোথায় তার সময় ব্যয় করে
AY-Robots SmolVLA-কে প্রতি অ্যাকশন স্টেপে 245 ms এবং ACT-কে 20 ms এ পলিসি ক্যাটালগ-এ তালিকাভুক্ত করে। TinyVLA প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms রিপোর্ট করে। এই সংখ্যাগুলি তুলনীয় নয়, এবং সেগুলিকে তুলনীয় হিসাবে বিবেচনা করা এই বিষয়ে সবচেয়ে সাধারণ ভুল: কেউ একটি ফরোয়ার্ড পাসের সময় পরিমাপ করে, কেউ সেই পাসকে একটি খণ্ডে ভাগ করে যখন অ্যাকশন চাঙ্কিং এটি অ্যামোর্টাইজ করে।
- SmolVLA প্রতি ফরোয়ার্ড পাসে 50টি অ্যাকশন নির্গত করে এবং সব 50টি কার্যকর করে। বাস্তব রোবটে পেপারটি যে 30 fps ব্যবহার করে, তাতে একটি ইনফারেন্স প্রায় 1.7 সেকেন্ডের গতি কভার করে।
- অ্যাসিঙ্ক্রোনাস ইনফারেন্স বর্তমান চাঙ্কটি কার্যকর হওয়ার সময় পরবর্তী চাঙ্কটি গণনা করে: 13.75 s সিঙ্ক্রোনাসের বিপরীতে 9.7 s গড় টাস্ক সম্পন্ন হয়, যা প্রায় 30 শতাংশ দ্রুত, এবং একটি নির্দিষ্ট 60-সেকেন্ডের উইন্ডোতে 9টির বিপরীতে 19টি পিক-এন্ড-প্লেস সাইকেল।
- সাফল্যের হার উন্নত হওয়ার পরিবর্তে তুলনীয় ছিল, 73.3 অ্যাসিঙ্ক্রোনাসের বিপরীতে 78.3 সিঙ্ক্রোনাস। অ্যাসিঙ্ক থ্রুপুট বাড়ায়, নির্ভুলতা নয়।
- চাঙ্কিং কম্পিউট লেটেন্সি লুকায়, নেটওয়ার্ক লেটেন্সি নয়, এবং এটি পলিসিকে কম প্রতিক্রিয়াশীল করে তোলে কারণ এটি 50টি অ্যাকশনের জন্য প্রতিশ্রুতিবদ্ধ।
AY-Robots একটি ক্লাউড GPU পড স্বয়ংক্রিয়ভাবে সরবরাহ করতে পারে যা আপনার নীতি পরিবেশন করে যখন স্থানীয় রোবট ক্লায়েন্ট সেই এন্ডপয়েন্টের সাথে যোগাযোগ করে, এবং পডটিতে একটি নিষ্ক্রিয় ওয়াচডগ থাকে যাতে এটি নীরবে বিল করার পরিবর্তে নিজেকে ধ্বংস করে। এটি যা করে না তা হল পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ দূর করা। এখানে পাঁচটি নীতির জুড়ে নিয়ন্ত্রণ লুপ কোনো নেটওয়ার্ক ছাড়াই প্রতি অ্যাকশন ধাপে 20 থেকে 485 ms, তাই রিমোট ইনফারেন্স ধীর পিক-এন্ড-প্লেসের জন্য কার্যকর, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়।

একটি কনজিউমার কার্ডে SmolVLA ফাইন-টিউনিং
ম্যানুয়াল পথ, lerobot 0.6.1-এ, 23 আগস্ট 2026 তারিখের বর্তমান PyPI রিলিজ। নিচে যা কিছু আছে তা একই দিনে আনা Hugging Face lerobot SmolVLA ডকুমেন্টেশন থেকে এসেছে; নির্দেশিত সংস্করণ আরও সহজ।
- 1স্মলভিএলএ অতিরিক্ত সহ লেরোবট ইনস্টল করুন
স্মলভিএলএ নির্ভরতাগুলি একটি ঐচ্ছিক অতিরিক্ত, বেস ইনস্টলের অংশ নয়। এটি ছাড়া ইনস্টল করা এবং তারপর পলিসির ধরন অজানা কেন তা ভেবে আধা ঘণ্টা নষ্ট করা একটি সাধারণ ঘটনা।
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2পর্যাপ্ত পর্ব সহ একটি ডেটা সেট পান
ডকুমেন্টেশন প্রায় ৫০টি পর্বের সুপারিশ করে এবং বলে যে ২৫টি পর্বের সাথে একই কাজ যথেষ্ট ছিল না। AY-Robots সর্বনিম্ন ৩০টি নির্ধারণ করে। আপনার নিজের রেকর্ড করুন, অথবা ডেটা সেট ডিরেক্টরি থেকে শুরু করুন।
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3ফাইন-টিউন শুরু করুন
লেরোবট গাইড থেকে কমান্ড, অপরিবর্তিত। ডকুমেন্টেশন একটি A100-এ ২০০০০ ধাপকে প্রায় ৪ ঘণ্টা বলে। একটি ২৪ জিবি কার্ডে, আরও বেশি সময় আশা করুন এবং এটি পরিমাপ করুন।
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4ফিট না হওয়া পর্যন্ত ব্যাচ সাইজ কমান
batch_size=64 একটি নথিভুক্ত উদাহরণ, আপনার কার্ড সম্পর্কে কোনো প্রতিশ্রুতি নয়। ডকুমেন্টেশন ছোট থেকে শুরু করে লোডিং সময় কম থাকা অবস্থায় বাড়ানোর পরামর্শ দেয়।
bashlerobot-train --help - 5আর্মের উপর চেকপয়েন্ট রোল আউট করুন
একই লাইব্রেরি, একটি কমান্ড। রিয়েল-টাইম চাঙ্কিং ফ্ল্যাগগুলি ডকুমেন্টেশনে মন্তব্য করা আছে এবং কম-পাওয়ার হার্ডওয়্যারের জন্য এগুলি ব্যবহার করা উচিত।
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
আপনি যে পথই নিন না কেন, আপনি একটি চেকপয়েন্ট এবং এটি তৈরি করা কনফিগারেশন পাবেন। ডেটা সেট রিভিশন, ধাপের সংখ্যা এবং বীজ এর পাশে রাখুন। লেরোবট ডিফল্টভাবে বীজ ১০০০ ব্যবহার করে; GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট কোনো বীজ প্রকাশ করে না, তাই সেই রানগুলি বিট-ফর-বিট পুনরুত্পাদনযোগ্য নয়। প্রশিক্ষণ ডকুমেন্টেশন-এ মেকানিক্স।
একটি ছোট ভিএলএ একটি আর্মের উপর পাওয়ার দুটি উপায়
আপনি মেশিন এবং ব্যর্থতার মোডগুলির মালিক। স্মলভিএলএ-এর জন্য এটি যুক্তিসঙ্গত: একটি পিপ অতিরিক্ত, একটি ট্রেন কমান্ড, একটি রোলআউট কমান্ড। টাইনিভিএলএ-এর জন্য এটি হিমায়িত পিন, একটি ভাঙা ডিপস্পিড পাথ এবং একটি ডেটা রূপান্তর যা আপনি নিজেই লেখেন তার সাথে একটি গবেষণা পুনরুত্পাদন।
- একটি ২৪ জিবি কার্ড নিন, ৩০ থেকে ৫০টি পর্ব রেকর্ড করুন, ক্যামেরা স্ট্রিমগুলি ফ্রেম বাই ফ্রেম যাচাই করুন।
- pip install -e ".[smolvla]", lerobot/smolvla_base এর বিরুদ্ধে lerobot-train চালান, তারপর আর্মটি যে মেশিনে প্লাগ করা আছে সেখানে চেকপয়েন্টটি পরিবেশন করুন।
- টাইনিভিএলএ-এর জন্য: আলাদা কন্ডা এনভ, ডেটা HDF5-এ রূপান্তর করুন, constants.py-এ টাস্ক রেজিস্টার করুন, zero2.json পাথ ঠিক করুন, train.sh আটটি GPU থেকে একটিতে কাটুন।
- কার্ডের দাম পরিশোধ হয়ে গেলে প্রতি ঘণ্টার বিলিং নেই।
- ইনফারেন্স সার্ভোগুলির পাশে থাকে, দ্রুত নিয়ন্ত্রণ লুপ পাওয়ার একমাত্র উপায়।
- আপনি পলিসি কোড প্যাচ করতে পারেন, এবং টাইনিভিএলএ শুধুমাত্র এই উপায়ে উপলব্ধ।
- একটি 4090 প্রায় প্রতিটি ~3 B পলিসিকে বাদ দেয়, তাই GR00T N1.7 বা Pi0.5 এর বিরুদ্ধে কোনো স্থানীয় তুলনা নেই।
- পরিবেশ সেটআপই আসল কাজ। শুধুমাত্র টাইনিভিএলএ-এর পিনগুলিই একদিন খরচ করতে পারে।
- কোনো কিউ, কোনো রিট্রাই, কোনো চেকপয়েন্ট স্টোরেজ নেই। ১৪০০০ ধাপে একটি রিবুট মানে আবার শুরু করা।
স্মলভিএলএ এখানে পাঁচটি পলিসির মধ্যে একটি। আপনি একটি ফর্মে মডেল এবং ডেটা সেট নির্বাচন করেন, ব্যাকএন্ড প্রয়োজনীয় ভিআরএএম অনুযায়ী একটি GPU ভাড়া করে, প্রশিক্ষক চালায় এবং চেকপয়েন্ট অবজেক্ট স্টোরেজে লেখে। ধাপে ধাপে: SO-100-এ স্মলভিএলএ, অথবা সম্পূর্ণ ম্যাট্রিক্স প্রশিক্ষণ পৃষ্ঠায়।
| প্ল্যাটফর্ম স্মলভিএলএ-এর জন্য কী পাঠায় | মান |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
প্রথমত, এখানে ডিফল্ট ব্যাচ সাইজ হল ২, লেরোবট ডকুমেন্টেশন উদাহরণে ৬৪ নয়, এবং গ্রেডিয়েন্ট অ্যাকুমুলেশন সেটিং পাঠানো হয় কিন্তু স্মলভিএলএ-এর জন্য এর কোনো প্রভাব নেই, তাই কার্যকর ব্যাচ আসলে ২। ডিফল্ট আপস্ট্রিমের সাথে মেলে এমনটা ধরে না নিয়ে ইচ্ছাকৃতভাবে এটি বাড়ান। দ্বিতীয়ত, টাইনিভিএলএ এখানে মোটেও প্রশিক্ষণযোগ্য নয়।
২৪ জিবি টিয়ারে একটি রান প্রতি ঘণ্টায় ০.৩০ থেকে ০.৬০ ইউএসডি খরচে ২ থেকে ৫ ঘণ্টা সময় নেয়, যা প্রায় ১ থেকে ৩ ইউএসডি। A100 টিয়ারে একটি ~3 B পলিসি প্রতি ঘণ্টায় ১.২০ থেকে ২.০০ ইউএসডি খরচে ৩ থেকে ৬ ঘণ্টা সময় নেয়, যা প্রায় ৪ থেকে ১২ ইউএসডি। দেখুন মূল্য নির্ধারণ, এবং একই অপারেশনগুলি সিএলআই এবং এমসিপি সার্ভার থেকে।
যখন একটি ছোট মডেল ভুল পছন্দ
উভয় গবেষণাপত্রই সারসংক্ষেপের চেয়ে এখানে বেশি সতর্ক। TinyVLA-এর ব্যর্থতা বিশ্লেষণ সুনির্দিষ্ট: 0.4 B ভ্যারিয়েন্ট নির্দেশাবলী ভুল পড়ার কারণে তিনবার ব্যর্থ হয়েছিল, যা লেখকরা ছোট VLM-এ সীমিত ভাষা বোঝার ক্ষমতার জন্য দায়ী করেছেন, এবং সেই মোডটি 1.3 B-তে অদৃশ্য হয়ে গিয়েছিল। SmolVLA অন্য প্রান্ত থেকে একই বক্ররেখা দেখায়: অভিন্ন আর্কিটেকচারের 2.25 B সংস্করণ LIBERO-তে 88.75 এবং Meta-World-এ 68.24 স্কোর করে, যেখানে 0.45 B মডেলের জন্য এটি 87.3 এবং 57.3।
- একটি 24 GB কার্ডে ফিট করে, যা একটি পরীক্ষার খরচ কয়েক ডলার থেকে কয়েক ডলারে নামিয়ে আনে।
- আর্মের পাশে চালানোর জন্য যথেষ্ট দ্রুত, তাই নিয়ন্ত্রণ লুপে কোনও নেটওয়ার্ক হপ নেই।
- একজন ব্যক্তি রেকর্ড করতে পারে এমন ডেটার উপর ফাইন-টিউন করে, হাজার হাজার নয়, কয়েক ডজন পর্ব।
- SmolVLA-এর ওজন, ডেটা তালিকা এবং কোড সর্বজনীন, তাই একটি খারাপ ফলাফল ডিবাগ করা সম্ভব।
- দুর্বল নির্দেশ অনুসরণ: কম ভাষার প্যারামিটার, অনুরূপ রেফারেন্সিং এক্সপ্রেশন আলাদা করার ক্ষমতা কম।
- আপনি রেকর্ড করেননি এমন সেটআপগুলিতে কম স্থানিক এবং ভিজ্যুয়াল সাধারণীকরণ।
- ডেটা সেট ত্রুটির প্রতি বেশি সংবেদনশীল, ফিরে যাওয়ার জন্য কম প্রাক-প্রশিক্ষণ।
- মাল্টি-টাস্ক এবং দীর্ঘ-পরিসরের কাজ এখনও বড় মডেলগুলিকে সমর্থন করে, যার মধ্যে SmolVLA-এর নিজস্ব 2.25 B ভ্যারিয়েন্টও রয়েছে।
যে তুলনাটি চালানো উচিত তা TinyVLA বনাম SmolVLA নয়। এটি SmolVLA বনাম ACT আপনার নিজের কাজে, এবং SmolVLA পেপারটি এর কারণের যুক্তি। কোনো রোবোটিক্স প্রাক-প্রশিক্ষণ ছাড়াই একক-টাস্কে প্রশিক্ষিত, SmolVLA তিনটি SO-100 টাস্কে গড়ে 40.0 স্কোর করেছে যেখানে একক-টাস্ক ACT 48.3 অর্জন করেছে। এটিকে 78.3-তে উন্নীত করে কমিউনিটি প্রাক-প্রশিক্ষণ এবং মাল্টি-টাস্ক প্রশিক্ষণ, শুধুমাত্র আর্কিটেকচার নয়। SO-101 লেগো টাস্কে, উভয়ই একক-টাস্ক, SmolVLA জেতে: বিতরণে 70 এর বিপরীতে 90। তারপর SmolVLA বনাম Pi0.5 যদি বাজেট অনুমতি দেয়।
খারাপ ডেটা কভার করার জন্য কম প্রিট্রেটিং থাকে, তাই একটি ত্রুটিপূর্ণ ডেটাসেটে একটি পরিষ্কার লস কার্ভ আপনাকে এমন একটি নীতি দেয় যা আত্মবিশ্বাসের সাথে ত্রুটিটি পুনরুত্পাদন করে। lerobot ডকুমেন্টেশন কাঠামো সম্পর্কে স্পষ্ট: 5টি কিউব অবস্থানে 50টি এপিসোড, প্রতি অবস্থানে 10টি, কাজ করেছে; 25টি করেনি। যদি লস ঠিক মনে হয় এবং বাহু কোনো দরকারী কাজ না করে, তাহলে লস কমে যায়, নীতি কোনো কাজ করে না, নীতি শুধুমাত্র একটি সেটআপে কাজ করে অথবা প্রকৃতপক্ষে ব্যবহারযোগ্য VLA প্রশিক্ষণ ডেটা সংগ্রহ করা থেকে শুরু করুন।
পাঁচটি নীতি, একটি তুলনা সারণী
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT বাস্তব প্যারামিটার গণনা সহ, প্রতি অ্যাকশন ধাপে ইনফারেন্স ল্যাটেন্সি, প্রতিটি GPU স্তরের প্রয়োজন এবং কোনো দরকারী কাজ করার আগে ন্যূনতম এপিসোড সংখ্যা।
নীতিগুলি তুলনা করুনএকটি সিদ্ধান্ত সারণী যা আপনি ব্যবহার করতে পারেন
| আপনার পরিস্থিতি | এখান থেকে শুরু করুন | কেন |
|---|---|---|
| একটি কাজ, ভালো প্রদর্শনী, কোনো ভাষা নেই | ACT | ~80 M, 20 ms, 24 GB কার্ড, কোনো বেস মডেল ডাউনলোড করার প্রয়োজন নেই |
| কয়েকটি সম্পর্কিত কাজ, প্রতিটি একটি নির্দেশ সহ | SmolVLA | 450 M, lerobot-এ, ন্যূনতম 30টি এপিসোড, প্রতি রানে 1 থেকে 3 USD |
| বিশেষভাবে TinyVLA ফলাফল পুনরুত্পাদন করা | TinyVLA-B or TinyVLA-H | রেপোই একমাত্র পথ: বিচ্ছিন্ন পরিবেশ, রূপান্তরিত ডেটা |
| মাল্টি-টাস্ক, বিভিন্ন নির্দেশাবলী, A100 বাজেট | GR00T N1.7 or Pi0.5 | ~3 B, প্রতি ধাপে 152 ms এবং 485 ms, প্রতি রানে 4 থেকে 12 USD |
| এখনো কোনো রোবট নেই | একটি বাস্তব বাহু চালান | কিউ-ভিত্তিক লাইভ আর্মের জন্য কোনো সাইনআপ এবং কোনো হার্ডওয়্যারের প্রয়োজন নেই |
শেষ সারির জন্য, লাইভ আর্ম একটি ফিজিক্যাল SO-100 স্ট্রিম করে যা আপনি অ্যাকাউন্ট ছাড়াই ব্রাউজার থেকে চালাতে পারবেন, এবং শুরু করার তিনটি উপায় বাকিটা কভার করে। SO-100 এখানে রেফারেন্স আর্ম, যন্ত্রাংশ সহ আনুমানিক 110 থেকে 150 EUR, সাথে একটি সম্পূর্ণ সেটআপ গাইড।
সাব-1 B মডেলের পরে কী আসে
প্যারামিটার সংখ্যা কমানো VLA-কে সস্তা করার একটি উপায় এবং এটিই যে একমাত্র বিজয়ী উপায় তা স্পষ্ট নয়। OpenVLA-OFT (arXiv 2502.19645) 7 B ব্যাকবোন বজায় রাখে এবং শুধুমাত্র অ্যাকশনগুলি কীভাবে ডিকোড করা হয় তা পরিবর্তন করে, অ্যাকশন জেনারেশন থ্রুপুটে 26x বৃদ্ধি এবং LIBERO 76.5 থেকে 97.1 শতাংশে উন্নীত হওয়ার কথা জানায়। BitVLA (arXiv 2506.07530) একটি 1-বিট BitNet b1.58 2B4T ব্যাকবোনের প্রতিটি ওজন টারনারি করে, 11.0x কম মেমরি এবং 4.4x কম এন্ড-টু-এন্ড ল্যাটেন্সি রিপোর্ট করে যখন ফুল-প্রিসিশন OpenVLA-OFT-এর সাথে মেলে। X-VLA-0.9B (arXiv 2510.10274) ফ্লো ম্যাচিং সহ 1 B লাইনে বসে আছে।
সাধারণ বিষয়: অ্যাকশন ডিকোডার, ল্যাঙ্গুয়েজ মডেল নয়, যেখানে ল্যাটেন্সি থাকে। একটি পলিসি কীভাবে অ্যাকশন নির্গত করে তা জিজ্ঞাসা করুন তার প্যারামিটার সংখ্যা জিজ্ঞাসা করার আগে। অ্যারেনা তে 85টি মডেল এবং 332টি ফলাফল রয়েছে, প্রতিটি তার উৎসের সাথে সংযুক্ত; একটি বিস্তৃত ওভারভিউ রয়েছে আমাদের VLA পরিচিতি।
আমি কি একটি RTX 4090-এ SmolVLA ফাইন-টিউন করতে পারি?▾
হ্যাঁ। SmolVLA হল 450 M প্যারামিটার এবং AY-Robots এটিকে RTX 4090 / 24 GB টায়ারে চালায়। lerobot উদাহরণটি --batch_size=64 ব্যবহার করে, যা আপনার কার্ডের জন্য একটি গ্যারান্টি না হয়ে একটি উদাহরণ মাত্র; ডকুমেন্টেশন ছোট থেকে শুরু করে লোডিং সময় কম থাকা পর্যন্ত বাড়ানোর পরামর্শ দেয়। A100-এ 20000 স্টেপের জন্য ডকুমেন্টেশনে উল্লেখিত প্রায় 4 ঘন্টার চেয়ে বেশি সময় লাগতে পারে।
TinyVLA কি lerobot বা AY-Robots-এ উপলব্ধ?▾
উভয় ক্ষেত্রেই না। TinyVLA শুধুমাত্র এর গবেষণা রিপোজিটরিতে বিদ্যমান, শেষ কমিট 11 March 2025, এবং এর ফরম্যাট LeRobot-এর পরিবর্তে ACT-স্টাইলের HDF5। AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT প্রশিক্ষণ দেয়। আপনি যদি TinyVLA চান তবে আপনাকে এটি নিজে তৈরি করতে হবে, এবং প্রথমে scripts/train.sh-এ DeepSpeed কনফিগ পাথ ঠিক করতে হবে।
একটি 450 M মডেল কি সত্যিই একটি 3 B মডেলের সাথে প্রতিযোগিতামূলক?▾
লেখকদের নিজস্ব বেঞ্চমার্কে, হ্যাঁ: LIBERO-তে 87.3 বনাম 86.0 একটি রোবোটিক্স-প্রিট্রেইনড Pi0 3.3 B-এর বিপরীতে, এবং তিনটি বাস্তব SO-100 টাস্কে 78.3 বনাম 61.7 যেখানে একই পেপার Pi0-কে 3.5 B লেবেল করে। সীমাবদ্ধতা একই পেপারে রয়েছে: রোবোটিক্স প্রিট্রেনিং ছাড়া একক-টাস্কে, SmolVLA 40.0-এ নেমে আসে, যা ACT-এর 48.3-এর নিচে।
একটি ছোট VLA কিছু করার আগে আমার কতগুলি পর্বের প্রয়োজন?▾
AY-Robots SmolVLA-এর জন্য সর্বনিম্ন 30টি পর্ব এবং ACT-এর জন্য সর্বনিম্ন 50টি পর্ব নির্ধারণ করে। lerobot ডকুমেন্টেশন প্রায় 50টি সুপারিশ করে এবং রিপোর্ট করে যে একই কাজের জন্য 25টি যথেষ্ট ছিল না। সংখ্যার মতোই কাঠামোও গুরুত্বপূর্ণ: পেপারের সেটটি প্রতিটি 10টি পর্ব সহ 5টি কিউব পজিশন ব্যবহার করেছে।
প্রকাশিত ল্যাটেন্সি সংখ্যাগুলি এত ভিন্ন কেন?▾
তারা বিভিন্ন জিনিস পরিমাপ করে। TinyVLA একটি A6000-এ প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms রিপোর্ট করে; AY-Robots SmolVLA-কে 245 ms এবং ACT-কে প্রতি অ্যাকশন স্টেপে 20 ms হিসাবে তালিকাভুক্ত করে। কিছু চিত্র একটি ফরোয়ার্ড পাস কভার করে, কিছু একটি 50-অ্যাকশন চাঙ্কের মধ্যে একটি পাস ভাগ করে, এবং প্রায় কোনটিই ক্যামেরা ক্যাপচার বা সার্ভোতে লেখা অন্তর্ভুক্ত করে না।
ক্লাউড ইনফারেন্স কি GPU সমস্যা সমাধান করে?▾
আংশিকভাবে। AY-Robots স্বয়ংক্রিয়ভাবে একটি পড সরবরাহ করে যা নীতিটি পরিবেশন করে যখন স্থানীয় ক্লায়েন্ট সেই এন্ডপয়েন্টের সাথে কথা বলে, একটি নিষ্ক্রিয় ওয়াচডগ সহ যাতে এটি নীরবে বিল না করে নিজেকে ধ্বংস করে। এটি পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ সরাতে পারে না, এবং নিয়ন্ত্রণ লুপটি ইতিমধ্যেই প্রতি অ্যাকশন স্টেপে 20 থেকে 485 ms। ধীর পিক-এন্ড-প্লেসের জন্য ঠিক আছে, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়।
Sources
- TinyVLA: রোবোটিক ম্যানিপুলেশনের জন্য দ্রুত, ডেটা-দক্ষ ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেলের দিকে
- TinyVLA অফিসিয়াল কোড রিপোজিটরি (README, requirements.txt, scripts/train.sh)
- TinyVLA প্রকল্প পৃষ্ঠা
- lesjie/Llava-Pythia-1.3B, TinyVLA-H ব্যাকবোন ওজন
- SmolVLA: সাশ্রয়ী এবং দক্ষ রোবোটিক্সের জন্য একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল
- lerobot ডকুমেন্টেশন: SmolVLA ফাইন-টিউনিং
- lerobot: configuration_smolvla.py, SmolVLA ডিফল্ট
- lerobot/smolvla_base মডেল কার্ড
- SmolVLA: দক্ষ ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল (Hugging Face ব্লগ)
- PyPI-এ lerobot (0.6.1, Python 3.12 বা নতুন প্রয়োজন)
- OpenVLA: একটি ওপেন-সোর্স ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল
- ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল ফাইন-টিউনিং: গতি এবং সাফল্য অপ্টিমাইজ করা (OpenVLA-OFT)
- BitVLA: রোবোটিক্স ম্যানিপুলেশনের জন্য 1-বিট ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল
- X-VLA: স্কেলেবল ক্রস-এমবডিমেন্ট ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল হিসাবে সফট-প্রম্পটেড ট্রান্সফরমার
- rail-berkeley/octo-small-1.5 মডেল কার্ড (27 M প্যারামিটার)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started