AY-Robots পলিসি তুলনা সারণী যেখানে প্যারামিটার সংখ্যা, GPU স্তর এবং অনুমান ল্যাটেন্সি রয়েছে GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT এর জন্য
SmolVLATinyVLAছোট VLAভোক্তা GPULeRobot

ছোট VLA মডেল: TinyVLA, SmolVLA এবং সাব-১বি কেস

AY-Robots ResearchAugust 23, 202619 মিনিট পড়া

TinyVLA এবং SmolVLA ১ বিলিয়ন প্যারামিটারের নিচে একটি কার্যকরী VLA স্থাপন করে। উভয় গবেষণাপত্র থেকে বাস্তব সংখ্যা, lerobot ডিফল্ট, পরিমাপকৃত ল্যাটেন্সি, এবং একটি ২৪ জিবি কার্ডে একটি রানের খরচ কত।

প্রায় প্রতিটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল যা নিয়ে লেখা হয়, তা একটি ডেটাসেন্টার কার্ড অনুমান করে। OpenVLA হল 7 বিলিয়ন প্যারামিটার। GR00T N1.7 এবং Pi0.5 প্রায় 3 বিলিয়ন এবং ফাইন-টিউন করার জন্য একটি A100 80 GB চায়। যদি আপনার ডেস্কে থাকা কার্ডটি একটি 4090 হয়, তবে সেই শ্রেণীর মডেল নাগালের বাইরে।

দুটি গবেষণাপত্র যুক্তি দেয় যে আপনার এটির প্রয়োজন নেই। TinyVLA (arXiv 2409.12514, ফেব্রুয়ারী 2025-এ IEEE রোবোটিক্স অ্যান্ড অটোমেশন লেটার্স দ্বারা গৃহীত) একটি 400 মিলিয়ন থেকে 1.3 বিলিয়ন ব্যাকবোন এবং একটি ডিফিউশন অ্যাকশন হেড থেকে একটি VLA তৈরি করে। SmolVLA (arXiv 2506.01844, 2 জুন 2025-এ জমা দেওয়া হয়েছে) 450 মিলিয়ন প্যারামিটার সহ ওপেন ওয়েট, ওপেন ডেটা এবং একটি স্ক্রিপ্ট সরবরাহ করে যা একটি ভোক্তা কার্ডে চলে। এখানে উভয়ই কী পরিমাপ করেছে এবং যেখানে সাব-1 বিলিয়ন যুক্তিটি আর কার্যকর থাকে না।

আপনার যা জানা দরকার

  • TinyVLA তিনটি আকারে আসে: 422 মিলিয়ন মোট যার মধ্যে 101 মিলিয়ন প্রশিক্ষণযোগ্য, 740 মিলিয়ন যার মধ্যে 138 মিলিয়ন, 1.3 বিলিয়ন যার মধ্যে 143 মিলিয়ন। শুধুমাত্র প্রথম দুটি 1 বিলিয়নের নিচে থাকে।
  • এর সারণী IV একটি A6000-এ TinyVLA-1B-এর জন্য প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms পরিমাপ করে, যেখানে OpenVLA-7B-এর জন্য 292 ms এবং একটি ছোট OpenVLA-1B-এর জন্য 140 ms।
  • হেড সেই গতি ধরে রাখে, ব্যাকবোন নয়: TinyVLA-H-এর ডিফিউশন হেডকে একটি ACT হেডের সাথে অদলবদল করলে পাঁচটি বাস্তব-রোবট টাস্ক 94.0 গড় থেকে একক অঙ্কে নেমে আসে। একটি MLP হেড সব জায়গায় 0 স্কোর করে।
  • SmolVLA হল 450 মিলিয়ন, যার মধ্যে প্রায় 100 মিলিয়ন অ্যাকশন এক্সপার্ট, 481টি কমিউনিটি LeRobot ডেটাসেট এবং 10.6 মিলিয়ন ফ্রেমে প্রিটেইন করা হয়েছে। এটি LIBERO-তে 87.3 রিপোর্ট করে যেখানে 3.3 বিলিয়ন-এর একটি রোবোটিক্স-প্রিটেইনড Pi0-এর জন্য 86.0, এবং তিনটি বাস্তব SO-100 টাস্কে 78.3 যেখানে 3.5 বিলিয়ন-এর Pi0-এর জন্য 61.7।
  • সেই প্রিটেইনিং ছাড়া একক-টাস্কে প্রশিক্ষিত হলে, SmolVLA সেই টাস্কগুলিতে 40.0-এ নেমে আসে, যা ACT-এর 48.3-এর নিচে। ছোট মানেই স্বয়ংক্রিয়ভাবে সহজ নয়।
  • TinyVLA-এর কোনো LeRobot ইন্টিগ্রেশন নেই এবং এটি একটি CUDA 11.7 হুইল স্ট্যাক পিন করে। SmolVLA lerobot-এ আছে এবং এখানে 24 GB টায়ারে প্রতি রানে প্রায় 1 থেকে 3 USD খরচ হয়।

আসলে কী একটি ছোট VLA হিসাবে গণ্য হয়

একটি মডেল কার্ডে প্যারামিটার সংখ্যা একটি একক সংখ্যা নয়। এর অর্থ হতে পারে মোট ওজন, ইনফারেন্সের সময় লোড করা ওজন, অথবা যে ওজনগুলি গ্রেডিয়েন্ট পায় । TinyVLA উভয়ই রিপোর্ট করে, এবং পার্থক্যটি বড়: TinyVLA-H এর মোট 1.3 B কিন্তু 143 M প্রশিক্ষণযোগ্য, কারণ ভিশন টাওয়ার এবং বেশিরভাগ ভাষা মডেল স্থির থাকে যখন LoRA অ্যাডাপ্টার এবং অ্যাকশন হেড চলে। গবেষণাপত্রটি প্রশিক্ষণযোগ্য অংশকে প্রায় 5 শতাংশে রাখে।

মডেলপ্যারামিটারব্যাকবোনঅ্যাকশন হেডউৎস
TinyVLA-S422 M মোট, 101 M প্রশিক্ষণযোগ্যLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M মোট, 138 M প্রশিক্ষণযোগ্যLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B মোট, 143 M প্রশিক্ষণযোগ্যLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M অ্যাকশন এক্সপার্টSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S স্কেল, T5-Base টেক্সট এনকোডারDiffusionocto-small-1.5 card
ACT~80 MResNet, কোনো ভাষা মডেল নেইDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 এবং SigLIP এনকোডারAutoregressive action tokensarXiv 2406.09246

দুটি সারি নিয়ে আলোচনা করা যেতে পারে। প্রায় 80 M এ এখানে অন্য সবকিছুর চেয়ে ছোট কিন্তু এর কোনো ভাষা মডেল নেই, তাই এটি একটি VLA নয়: এটি একটি কাজ শেখে এবং অন্য কোনো কাজ করতে বলা যায় না। 27 M এ একটি T5-Base টেক্সট এনকোডারের মাধ্যমে শর্তযুক্ত, LLM ব্যাকবোন নয়। ভালো বেসলাইন, কোনটিই আপনাকে লেবেল দ্বারা বোঝানো নির্দেশাবলী অনুসরণ করতে দেয় না।

1 B লাইনটি নির্বিচার

TinyVLA-H, যে ভ্যারিয়েন্টটি প্রধান ফলাফল বহন করে, সেটি 1.3 B এবং লাইনের উপরে অবস্থান করে। আরও ভালো প্রশ্ন হলো, একটি মডেল প্রশিক্ষণের সময় 24 GB তে ফিট করে কিনা এবং ইনফারেন্সের সময় আপনার নিয়ন্ত্রণ হারে পৌঁছায় কিনা। এখানে আপনি যে পাঁচটি নীতি প্রশিক্ষণ দিতে পারেন তা নীতি পৃষ্ঠায় রয়েছে; TinyVLA এর একটি এরিনা এন্ট্রি আছে যদি আপনি এর সংখ্যা অন্যদের পাশে দেখতে চান।

TinyVLA: গতি আসে হেড থেকে, ব্যাকবোন থেকে নয়

সাধারণ ধারণা হলো তারা ল্যাঙ্গুয়েজ মডেলকে ছোট করেছে, তাই এটি দ্রুত হয়েছে। তবে গবেষণাপত্রের অ্যাবলেশন ভিন্ন কথা বলে। OpenVLA-এর 7 B ব্যাকবোনকে প্রায় 1 B ব্যাকবোন দিয়ে প্রতিস্থাপন করলে প্রতি-অ্যাকশন ভবিষ্যদ্বাণী 292 ms থেকে 140 ms-এ নেমে আসে, যা 2x গতি বৃদ্ধি। তুলনীয় প্যারামিটার সংখ্যা সহ TinyVLA-H একই কার্ডে 14 ms-এ চলে। বাকি 10x গতি আসে অ্যাকশন হেড থেকে।

মডেলপ্রতি-অ্যাকশন ভবিষ্যদ্বাণীপরিমাপ করা হয়েছে
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA ল্যাঙ্গুয়েজ মডেল হেডের মাধ্যমে ডিসক্রিটাইজড টোকেন হিসাবে অ্যাকশন নির্গত করে, প্রতি অ্যাকশন ডাইমেনশনের জন্য একটি করে, অটোরেগ্রেসিভভাবে। TinyVLA একটি ডিফিউশন ডিকোডার সংযুক্ত করে যা পুরো অংশটি একবারে তৈরি করে। সারণী V-তে TinyVLA-H-এর আর্কিটেকচার রয়েছে এবং একই পাঁচটি বাস্তব-রোবট টাস্কে শুধুমাত্র হেড পরিবর্তন করা হয়েছে। এটি উভয় গবেষণাপত্রে এই যুক্তির জন্য সবচেয়ে পরিষ্কার প্রমাণ যে ফ্লো ম্যাচিং পলিসি তৈরি করে, এবং এর কারণ Pi0 টোকেন ডিকোডিং থেকে সরে এসেছে

TinyVLA-H-এ হেডপ্লেস টেনিসফ্লিপ মাগস্ট্যাক কিউবসড্রয়ার বন্ধ করুনবক্স খুলুন
ডিফিউশন (droid_diffusion)90.098.398.396.786.7
অ্যাকশন চাঙ্কিং ট্রান্সফরমার13.38.38.313.323.3
মাল্টি-লেয়ার পারসেপ্ট্রন00000
TinyVLA সংখ্যাগুলি কী বোঝায়

292 / 140 / 14 ms এর সংখ্যাগুলি সারণী IV থেকে নেওয়া হয়েছে, যা একটি A6000-এ প্রাপ্ত। এগুলি প্রতি অ্যাকশন ভবিষ্যদ্বাণীর জন্য এবং ক্যামেরা ক্যাপচার, প্রিপ্রসেসিং এবং সার্ভোগুলিতে সিরিয়াল রাইট বাদ দিয়ে গণনা করা হয়েছে। প্রকাশিত ল্যাটেন্সি একটি নিম্ন সীমা হিসাবে বিবেচনা করুন, কখনই নিয়ন্ত্রণ হার হিসাবে নয়। আমাদের নিজস্ব সংখ্যাগুলিরও একই সীমাবদ্ধতা রয়েছে: দেখুন ইনফারেন্স ল্যাটেন্সি

TinyVLA কী স্কোর করেছে

বেঞ্চমার্কপ্রোটোকলTinyVLA-Hবেসলাইন
মেটাওয়ার্ল্ড, 50টি টাস্ক, সিমমাল্টি-টাস্ক, 50টি ডেমো, 3টি সিডকঠিনতা অনুসারে 77.6 / 21.5 / 11.4 / 15.8, গড় 31.6ডিফিউশন পলিসির গড় 10.5
রিয়েল ফ্রাঙ্কা পান্ডা, 5টি টাস্কপ্রতি টাস্কে 100টি ট্র্যাজেক্টরি, 20টি ট্রায়াল94.0 গড়OpenVLA 68.3, ডিফিউশন পলিসি 35.3
বাইম্যানুয়াল UR5, 3টি টাস্কমাল্টি-টাস্ক, প্রতি টাস্কে 10টি ট্রায়াল76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, ডিফিউশন পলিসি 40.3 / 31.3 / 43.0

দ্বি-ম্যানুয়াল সারির একটি বিরক্তিকর ব্যাখ্যা রয়েছে যা কাগজটি নিজেই দেয়: OpenVLA Open X-Embodiment-এ প্রাক-প্রশিক্ষিত, যা সম্পূর্ণরূপে একক-আর্ম ডেটা নিয়ে গঠিত, তাই একটি দুই-আর্ম অ্যাকশন স্পেস বিতরণের বাইরে এবং এটি শূন্য স্কোর করে। ডিফিউশন পলিসি বেসলাইন সেই তিনটি কাজের মধ্যে দুটিতে TinyVLA-H কে হারিয়েছে। পটভূমি Open X-Embodiment লেখাটিতে.

AY-Robots এর অ্যারেনা লিডারবোর্ড, 85টি VLA মডেলের একটি সাজানো যায় এমন সারণী যেখানে 332টি বেঞ্চমার্ক ফলাফল রয়েছে, প্রতিটি মান যে কাগজ বা মডেল কার্ড থেকে এসেছে তার সাথে লিঙ্ক করা আছে।
ক্রস-মডেল বেঞ্চমার্ক সংখ্যাগুলি কেবল তখনই তুলনীয় যখন আপনি দেখতে পান প্রতিটি কোথা থেকে এসেছে।

TinyVLA রেপো, আগস্ট 2026 অনুযায়ী

কাগজটি ভালো। কোডটি একটি গবেষণা ড্রপ। রিপোজিটরি হল github.com/liyaxuanliyaxuan/TinyVLA; এর README কোড প্রকাশের তারিখ 17 ফেব্রুয়ারি 2025 এবং শেষ কমিট 11 মার্চ 2025। একটি কাগজ পুনরুৎপাদনের জন্য ঠিক আছে, কিন্তু যদি আপনি একটি রক্ষণাবেক্ষণ করা লাইব্রেরি চান তবে এটি একটি সমস্যা।

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README থেকে ইনস্টল সিকোয়েন্স, 2026-08-23 তারিখে রিপোজিটরিটির সাথে যাচাই করা হয়েছে।
ডিপেন্ডেন্সি পিনগুলি এমন একটি ফাঁদ যা একটি দিন নষ্ট করে

requirements.txt `torch==2.0.1`, `transformers==4.37.1`, `deepspeed==0.9.5`, `peft==0.4.0`, `diffusers==0.11.1`, `numpy==1.24.4`, এবং CUDA স্ট্যাককে 11.x হুইলগুলির সাথে পিন করে: `nvidia-cuda-runtime-cu11==11.7.99`, `nvidia-cudnn-cu11==8.5.0.96`, `triton==2.0.0`। README-তে Python 3.10 চাওয়া হয়েছে; lerobot 0.6.1-এর জন্য 3.12 বা তার নতুন সংস্করণ প্রয়োজন, তাই এই দুটি একটি এনভায়রনমেন্ট শেয়ার করতে পারে না। প্রথমে আপনার GPU জেনারেশনের জন্য একটি torch 2.0.1 বিল্ড বিদ্যমান কিনা তা নিশ্চিত করুন। যদি একটি রান VRAM-এর অভাবে বন্ধ হয়ে যায়, তাহলে আউট-অফ-মেমরি চেকলিস্ট অনুমান করার চেয়ে দ্রুত কাজ করে।

TinyVLA LeRobot ডেটাসেটও পড়ে না। এর ফরম্যাট হল ACT-স্টাইলের HDF5: action, language_raw, এবং multi-view images, joint_positions, qpos ও qvel সহ একটি observations গ্রুপ। রিপোজিটরিটি RLDS ইনপুটের জন্য data_utils/rlds_to_h5py.py সরবরাহ করে, এবং প্রতিটি টাস্ক aloha_scripts/constants.py-তে তার dataset_dir, episode_len এবং camera_names সহ ম্যানুয়ালি রেজিস্টার করা হয়। যদি আপনার এপিসোড lerobot বা ডেস্কটপ ক্লায়েন্ট থেকে আসে, তাহলে রূপান্তরের দায়িত্ব আপনার।

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh থেকে সংক্ষিপ্ত করা হয়েছে। উপরের প্রতিটি ফ্ল্যাগ এবং ভ্যালু সরবরাহকৃত ফাইলে রয়েছে।
  • --num_gpus=8 একটি আট-কার্ড নোড অনুমান করে। এটিকে 1 এ সেট করুন এবং ব্যাচ সাইজ 32 এর অনেক নিচে নামিয়ে আনুন। কোনো সিঙ্গেল-GPU ভ্যারিয়েন্ট আপস্ট্রিম শিপ করে না, তাই কমান্ডটি 4090-এ হুবহু চালানো যাবে না।
  • --deepspeed scripts/zero2.json এমন একটি ফাইলের দিকে নির্দেশ করে যা টপ-লেভেল scripts ডিরেক্টরিতে নেই। DeepSpeed কনফিগগুলি llava-pythia/scripts/zero2.json-এ শিপ করে। আপনার প্রথম রান করার আগে পাথটি ঠিক করুন।
  • README-এর জন্য আউটপুট ডিরেক্টরির নামে llava_pythia থাকতে হবে, এবং LoRA সক্ষম থাকলে lora থাকতে হবে।
  • ব্যাকবোন একটি আলাদা ডাউনলোড: lesjie/Llava-Pythia-400M, -700M অথবা -1.3B। এমন কোনো একক বেস চেকপয়েন্ট নেই যেখানে আপনি একটি পলিসি নির্দেশ করতে পারেন, যেভাবে আপনি lerobot/smolvla_base-এর দিকে নির্দেশ করেন।

SmolVLA: 1 B-এর নিচের মডেল যা আপনি আজ বিকেলে চালাতে পারবেন

SmolVLA একটি রক্ষণাবেক্ষণ করা লাইব্রেরির মধ্যে একই যুক্তি উপস্থাপন করে। এটি একটি SmolVLM2-500M-Video-Instruct ব্যাকবোনে 450 M প্যারামিটার ব্যবহার করে, এবং এর দক্ষতা আসে configuration_smolvla.py থেকে পড়া সেটিংস থেকে, ছোট হওয়ার দাবি থেকে নয়।

configuration_smolvla.py-এর সেটিংডিফল্টএর সুবিধা
num_vlm_layers16শুধুমাত্র প্রথম 16টি ল্যাঙ্গুয়েজ মডেল লেয়ার চলে
expert_width_multiplier0.75অ্যাকশন এক্সপার্ট হিডেন সাইজ VLM-এর 75 শতাংশ
self_attn_every_n_layers2সেল্ফ-অ্যাটেনশন ক্রস-অ্যাটেনশনের সাথে ইন্টারলিভড
chunk_size / n_action_steps50 / 50এক পাসে 50টি অ্যাকশন নির্গত হয় এবং সব 50টি কার্যকর করা হয়
num_steps10ফ্লো ম্যাচিং ডিনয়েজিং 10 ধাপে স্থির করা হয়েছে
tokenizer_max_length48নির্দেশনা 48টি টোকেনে ট্রাঙ্কেট করা হয়েছে
freeze_vision_encoder / train_expert_onlyTrue / Trueফাইন-টিউনিং এক্সপার্টকে সরিয়ে দেয়, ভিশন টাওয়ারকে নয়
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000কাগজের রেসিপি নয়: এর প্রিট্রেনিং 200000 ধাপের উপর 100-ধাপের ওয়ার্মআপ ব্যবহার করেছে

প্রিট্রেনিং-এর জন্য 4টি GPU-তে 481টি কমিউনিটি LeRobot ডেটাসেট, 22.9 K এপিসোড এবং 10.6 M ফ্রেম ব্যবহার করা হয়েছিল, 256-এর গ্লোবাল ব্যাচে 200000 স্টেপস চালানো হয়েছিল; গবেষণাপত্রটি পুরো প্রোজেক্টটিকে প্রায় 30 K GPU ঘণ্টা বলে উল্লেখ করেছে। একটি সংখ্যা যা লক্ষ্য করার মতো: Hugging Face-এর লঞ্চ ব্লগ 487টি কিউরেটেড ডেটাসেটের কথা বলেছে যেখানে গবেষণাপত্রের সারণীতে 481টি উল্লেখ করা হয়েছে। আমরা গবেষণাপত্রের সংখ্যাটি ব্যবহার করছি এবং এই অমিলটি চিহ্নিত করছি।

AY-Robots-এ SmolVLA মডেলের পৃষ্ঠা যেখানে প্যারামিটার সংখ্যা, 24 GB GPU টিয়ার, ইনফারেন্স ল্যাটেন্সি প্রতি অ্যাকশন স্টেপে এবং সর্বনিম্ন এপিসোড সংখ্যা দেখানো হয়েছে।
প্ল্যাটফর্মের SmolVLA পৃষ্ঠা: 450 M প্যারামিটার, প্রতি অ্যাকশন স্টেপে 245 ms, RTX 4090 টিয়ার, সর্বনিম্ন 30টি এপিসোড।
বেঞ্চমার্কSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO গড়, মাল্টি-টাস্ক87.388.7586.0 (3.3 B, robotics-pretrained)-
মেটা-ওয়ার্ল্ড গড়, মাল্টি-টাস্ক57.368.2447.9 (3.5 B, robotics-pretrained)-
বাস্তব SO-100, 3টি টাস্ক, মাল্টি-টাস্ক ট্রেনিং78.3-61.7 (3.5 B)-
বাস্তব SO-100, 3টি টাস্ক, সিঙ্গেল-টাস্ক, রোবোটিক্স প্রিট্রেনিং ছাড়া40.0--48.3
SO-101 লেগো পিক-প্লেস, সিঙ্গেল-টাস্ক, ইন ডিস্ট্রিবিউশন90--70
SO-101 লেগো পিক-প্লেস, সিঙ্গেল-টাস্ক, আউট অফ ডিস্ট্রিবিউশন50--40
পুরো সারণীটি পড়ুন, শুধু শিরোনামের সারি নয়

LIBERO হল সিমুলেশন এবং সেখানে এখন সবকিছুই আশির ঘরে স্কোর করে। বাস্তব SO-100 সারিটি, যেখানে একটি 450 M মডেল একটি 3.5 B মডেলকে 16.6 পয়েন্টে হারিয়েছে, সেটিই আকর্ষণীয়; এর নিচের সারিটি হল এর প্রতিভার। কমিউনিটি প্রিট্রেনিং এবং মাল্টি-টাস্ক ট্রেনিং বাদ দিলে একই মডেল ACT-এর নিচে 40.0-এ নেমে আসে। যুক্তিযুক্ত দাবিটি হল যে একটি ছোট মডেল স্বয়ংক্রিয়ভাবে খারাপ নয়, এটি ভালো তাও নয়।

একটি ঘটনা সাহায্য করে: SmolVLA পেপারের মেটা-ওয়ার্ল্ড টেবিলে TinyVLA-এর নিজস্ব প্রকাশিত সংখ্যাগুলি একটি বেসলাইন হিসাবে রয়েছে, তাই প্রথমবারের মতো উভয় মডেল একটি টেবিলে রয়েছে, SmolVLA-0.45B 57.3 এবং TinyVLA-H 31.6। এটি আরও জানায় যে SmolVLA Pi0 এর চেয়ে প্রায় 40 শতাংশ দ্রুত প্রশিক্ষণ নেয় এবং 6 গুণ কম মেমরি ব্যবহার করে। এর সব তথ্য SmolVLA লেখকদের কাছ থেকে এসেছে; অ্যারেনা এন্ট্রি প্রতিটি মানকে তার উৎসের সাথে লিঙ্ক করে।

SmolVLA কোথায় তার সময় ব্যয় করে

AY-Robots SmolVLA-কে প্রতি অ্যাকশন স্টেপে 245 ms এবং ACT-কে 20 ms এ পলিসি ক্যাটালগ-এ তালিকাভুক্ত করে। TinyVLA প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms রিপোর্ট করে। এই সংখ্যাগুলি তুলনীয় নয়, এবং সেগুলিকে তুলনীয় হিসাবে বিবেচনা করা এই বিষয়ে সবচেয়ে সাধারণ ভুল: কেউ একটি ফরোয়ার্ড পাসের সময় পরিমাপ করে, কেউ সেই পাসকে একটি খণ্ডে ভাগ করে যখন অ্যাকশন চাঙ্কিং এটি অ্যামোর্টাইজ করে।

  • SmolVLA প্রতি ফরোয়ার্ড পাসে 50টি অ্যাকশন নির্গত করে এবং সব 50টি কার্যকর করে। বাস্তব রোবটে পেপারটি যে 30 fps ব্যবহার করে, তাতে একটি ইনফারেন্স প্রায় 1.7 সেকেন্ডের গতি কভার করে।
  • অ্যাসিঙ্ক্রোনাস ইনফারেন্স বর্তমান চাঙ্কটি কার্যকর হওয়ার সময় পরবর্তী চাঙ্কটি গণনা করে: 13.75 s সিঙ্ক্রোনাসের বিপরীতে 9.7 s গড় টাস্ক সম্পন্ন হয়, যা প্রায় 30 শতাংশ দ্রুত, এবং একটি নির্দিষ্ট 60-সেকেন্ডের উইন্ডোতে 9টির বিপরীতে 19টি পিক-এন্ড-প্লেস সাইকেল।
  • সাফল্যের হার উন্নত হওয়ার পরিবর্তে তুলনীয় ছিল, 73.3 অ্যাসিঙ্ক্রোনাসের বিপরীতে 78.3 সিঙ্ক্রোনাস। অ্যাসিঙ্ক থ্রুপুট বাড়ায়, নির্ভুলতা নয়।
  • চাঙ্কিং কম্পিউট লেটেন্সি লুকায়, নেটওয়ার্ক লেটেন্সি নয়, এবং এটি পলিসিকে কম প্রতিক্রিয়াশীল করে তোলে কারণ এটি 50টি অ্যাকশনের জন্য প্রতিশ্রুতিবদ্ধ।
রিমোট ইনফারেন্স বিনামূল্যে নয়, এবং কোনো প্ল্যাটফর্মই পদার্থবিদ্যাকে পরিবর্তন করতে পারে না

AY-Robots একটি ক্লাউড GPU পড স্বয়ংক্রিয়ভাবে সরবরাহ করতে পারে যা আপনার নীতি পরিবেশন করে যখন স্থানীয় রোবট ক্লায়েন্ট সেই এন্ডপয়েন্টের সাথে যোগাযোগ করে, এবং পডটিতে একটি নিষ্ক্রিয় ওয়াচডগ থাকে যাতে এটি নীরবে বিল করার পরিবর্তে নিজেকে ধ্বংস করে। এটি যা করে না তা হল পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ দূর করা। এখানে পাঁচটি নীতির জুড়ে নিয়ন্ত্রণ লুপ কোনো নেটওয়ার্ক ছাড়াই প্রতি অ্যাকশন ধাপে 20 থেকে 485 ms, তাই রিমোট ইনফারেন্স ধীর পিক-এন্ড-প্লেসের জন্য কার্যকর, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়।

AY-Robots নীতিগুলির তুলনা সারণী যেখানে GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT দেখানো হয়েছে প্যারামিটার সংখ্যা, প্রয়োজনীয় GPU স্তর, প্রতি অ্যাকশন ধাপে ইনফারেন্স লেটেন্সি এবং প্রতিটি নীতির জন্য প্রয়োজনীয় পর্বের সর্বনিম্ন সংখ্যা সহ।
SmolVLA প্রায় 450 M এবং ACT প্রায় 80 M হল দুটি যা একটি 24 GB কার্ডে ফিট করে। অন্য তিনটির জন্য একটি A100 বা H100 80 GB প্রয়োজন।

একটি কনজিউমার কার্ডে SmolVLA ফাইন-টিউনিং

ম্যানুয়াল পথ, lerobot 0.6.1-এ, 23 আগস্ট 2026 তারিখের বর্তমান PyPI রিলিজ। নিচে যা কিছু আছে তা একই দিনে আনা Hugging Face lerobot SmolVLA ডকুমেন্টেশন থেকে এসেছে; নির্দেশিত সংস্করণ আরও সহজ।

  1. 1
    স্মলভিএলএ অতিরিক্ত সহ লেরোবট ইনস্টল করুন

    স্মলভিএলএ নির্ভরতাগুলি একটি ঐচ্ছিক অতিরিক্ত, বেস ইনস্টলের অংশ নয়। এটি ছাড়া ইনস্টল করা এবং তারপর পলিসির ধরন অজানা কেন তা ভেবে আধা ঘণ্টা নষ্ট করা একটি সাধারণ ঘটনা।

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    পর্যাপ্ত পর্ব সহ একটি ডেটা সেট পান

    ডকুমেন্টেশন প্রায় ৫০টি পর্বের সুপারিশ করে এবং বলে যে ২৫টি পর্বের সাথে একই কাজ যথেষ্ট ছিল না। AY-Robots সর্বনিম্ন ৩০টি নির্ধারণ করে। আপনার নিজের রেকর্ড করুন, অথবা ডেটা সেট ডিরেক্টরি থেকে শুরু করুন।

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    ফাইন-টিউন শুরু করুন

    লেরোবট গাইড থেকে কমান্ড, অপরিবর্তিত। ডকুমেন্টেশন একটি A100-এ ২০০০০ ধাপকে প্রায় ৪ ঘণ্টা বলে। একটি ২৪ জিবি কার্ডে, আরও বেশি সময় আশা করুন এবং এটি পরিমাপ করুন।

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    ফিট না হওয়া পর্যন্ত ব্যাচ সাইজ কমান

    batch_size=64 একটি নথিভুক্ত উদাহরণ, আপনার কার্ড সম্পর্কে কোনো প্রতিশ্রুতি নয়। ডকুমেন্টেশন ছোট থেকে শুরু করে লোডিং সময় কম থাকা অবস্থায় বাড়ানোর পরামর্শ দেয়।

    bash
    lerobot-train --help
  5. 5
    আর্মের উপর চেকপয়েন্ট রোল আউট করুন

    একই লাইব্রেরি, একটি কমান্ড। রিয়েল-টাইম চাঙ্কিং ফ্ল্যাগগুলি ডকুমেন্টেশনে মন্তব্য করা আছে এবং কম-পাওয়ার হার্ডওয়্যারের জন্য এগুলি ব্যবহার করা উচিত।

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
চেকপয়েন্ট হল ডেলিভারেবল

আপনি যে পথই নিন না কেন, আপনি একটি চেকপয়েন্ট এবং এটি তৈরি করা কনফিগারেশন পাবেন। ডেটা সেট রিভিশন, ধাপের সংখ্যা এবং বীজ এর পাশে রাখুন। লেরোবট ডিফল্টভাবে বীজ ১০০০ ব্যবহার করে; GR00T-এর ফাইন-টিউনিং এন্ট্রি পয়েন্ট কোনো বীজ প্রকাশ করে না, তাই সেই রানগুলি বিট-ফর-বিট পুনরুত্পাদনযোগ্য নয়। প্রশিক্ষণ ডকুমেন্টেশন-এ মেকানিক্স।

একটি ছোট ভিএলএ একটি আর্মের উপর পাওয়ার দুটি উপায়

আপনি মেশিন এবং ব্যর্থতার মোডগুলির মালিক। স্মলভিএলএ-এর জন্য এটি যুক্তিসঙ্গত: একটি পিপ অতিরিক্ত, একটি ট্রেন কমান্ড, একটি রোলআউট কমান্ড। টাইনিভিএলএ-এর জন্য এটি হিমায়িত পিন, একটি ভাঙা ডিপস্পিড পাথ এবং একটি ডেটা রূপান্তর যা আপনি নিজেই লেখেন তার সাথে একটি গবেষণা পুনরুত্পাদন।

  1. একটি ২৪ জিবি কার্ড নিন, ৩০ থেকে ৫০টি পর্ব রেকর্ড করুন, ক্যামেরা স্ট্রিমগুলি ফ্রেম বাই ফ্রেম যাচাই করুন।
  2. pip install -e ".[smolvla]", lerobot/smolvla_base এর বিরুদ্ধে lerobot-train চালান, তারপর আর্মটি যে মেশিনে প্লাগ করা আছে সেখানে চেকপয়েন্টটি পরিবেশন করুন।
  3. টাইনিভিএলএ-এর জন্য: আলাদা কন্ডা এনভ, ডেটা HDF5-এ রূপান্তর করুন, constants.py-এ টাস্ক রেজিস্টার করুন, zero2.json পাথ ঠিক করুন, train.sh আটটি GPU থেকে একটিতে কাটুন।
সুবিধা
  • কার্ডের দাম পরিশোধ হয়ে গেলে প্রতি ঘণ্টার বিলিং নেই।
  • ইনফারেন্স সার্ভোগুলির পাশে থাকে, দ্রুত নিয়ন্ত্রণ লুপ পাওয়ার একমাত্র উপায়।
  • আপনি পলিসি কোড প্যাচ করতে পারেন, এবং টাইনিভিএলএ শুধুমাত্র এই উপায়ে উপলব্ধ।
বিনিময়
  • একটি 4090 প্রায় প্রতিটি ~3 B পলিসিকে বাদ দেয়, তাই GR00T N1.7 বা Pi0.5 এর বিরুদ্ধে কোনো স্থানীয় তুলনা নেই।
  • পরিবেশ সেটআপই আসল কাজ। শুধুমাত্র টাইনিভিএলএ-এর পিনগুলিই একদিন খরচ করতে পারে।
  • কোনো কিউ, কোনো রিট্রাই, কোনো চেকপয়েন্ট স্টোরেজ নেই। ১৪০০০ ধাপে একটি রিবুট মানে আবার শুরু করা।

যখন একটি ছোট মডেল ভুল পছন্দ

উভয় গবেষণাপত্রই সারসংক্ষেপের চেয়ে এখানে বেশি সতর্ক। TinyVLA-এর ব্যর্থতা বিশ্লেষণ সুনির্দিষ্ট: 0.4 B ভ্যারিয়েন্ট নির্দেশাবলী ভুল পড়ার কারণে তিনবার ব্যর্থ হয়েছিল, যা লেখকরা ছোট VLM-এ সীমিত ভাষা বোঝার ক্ষমতার জন্য দায়ী করেছেন, এবং সেই মোডটি 1.3 B-তে অদৃশ্য হয়ে গিয়েছিল। SmolVLA অন্য প্রান্ত থেকে একই বক্ররেখা দেখায়: অভিন্ন আর্কিটেকচারের 2.25 B সংস্করণ LIBERO-তে 88.75 এবং Meta-World-এ 68.24 স্কোর করে, যেখানে 0.45 B মডেলের জন্য এটি 87.3 এবং 57.3।

1 B-এর নিচে একটি VLA নির্বাচন করা
যেখানে এটি জেতে
  • একটি 24 GB কার্ডে ফিট করে, যা একটি পরীক্ষার খরচ কয়েক ডলার থেকে কয়েক ডলারে নামিয়ে আনে।
  • আর্মের পাশে চালানোর জন্য যথেষ্ট দ্রুত, তাই নিয়ন্ত্রণ লুপে কোনও নেটওয়ার্ক হপ নেই।
  • একজন ব্যক্তি রেকর্ড করতে পারে এমন ডেটার উপর ফাইন-টিউন করে, হাজার হাজার নয়, কয়েক ডজন পর্ব।
  • SmolVLA-এর ওজন, ডেটা তালিকা এবং কোড সর্বজনীন, তাই একটি খারাপ ফলাফল ডিবাগ করা সম্ভব।
যেখানে এটি হারায়
  • দুর্বল নির্দেশ অনুসরণ: কম ভাষার প্যারামিটার, অনুরূপ রেফারেন্সিং এক্সপ্রেশন আলাদা করার ক্ষমতা কম।
  • আপনি রেকর্ড করেননি এমন সেটআপগুলিতে কম স্থানিক এবং ভিজ্যুয়াল সাধারণীকরণ।
  • ডেটা সেট ত্রুটির প্রতি বেশি সংবেদনশীল, ফিরে যাওয়ার জন্য কম প্রাক-প্রশিক্ষণ।
  • মাল্টি-টাস্ক এবং দীর্ঘ-পরিসরের কাজ এখনও বড় মডেলগুলিকে সমর্থন করে, যার মধ্যে SmolVLA-এর নিজস্ব 2.25 B ভ্যারিয়েন্টও রয়েছে।

যে তুলনাটি চালানো উচিত তা TinyVLA বনাম SmolVLA নয়। এটি SmolVLA বনাম ACT আপনার নিজের কাজে, এবং SmolVLA পেপারটি এর কারণের যুক্তি। কোনো রোবোটিক্স প্রাক-প্রশিক্ষণ ছাড়াই একক-টাস্কে প্রশিক্ষিত, SmolVLA তিনটি SO-100 টাস্কে গড়ে 40.0 স্কোর করেছে যেখানে একক-টাস্ক ACT 48.3 অর্জন করেছে। এটিকে 78.3-তে উন্নীত করে কমিউনিটি প্রাক-প্রশিক্ষণ এবং মাল্টি-টাস্ক প্রশিক্ষণ, শুধুমাত্র আর্কিটেকচার নয়। SO-101 লেগো টাস্কে, উভয়ই একক-টাস্ক, SmolVLA জেতে: বিতরণে 70 এর বিপরীতে 90। তারপর SmolVLA বনাম Pi0.5 যদি বাজেট অনুমতি দেয়।

এই আকারে, ডেটাসেট ফলাফল নির্ধারণ করে

খারাপ ডেটা কভার করার জন্য কম প্রিট্রেটিং থাকে, তাই একটি ত্রুটিপূর্ণ ডেটাসেটে একটি পরিষ্কার লস কার্ভ আপনাকে এমন একটি নীতি দেয় যা আত্মবিশ্বাসের সাথে ত্রুটিটি পুনরুত্পাদন করে। lerobot ডকুমেন্টেশন কাঠামো সম্পর্কে স্পষ্ট: 5টি কিউব অবস্থানে 50টি এপিসোড, প্রতি অবস্থানে 10টি, কাজ করেছে; 25টি করেনি। যদি লস ঠিক মনে হয় এবং বাহু কোনো দরকারী কাজ না করে, তাহলে লস কমে যায়, নীতি কোনো কাজ করে না, নীতি শুধুমাত্র একটি সেটআপে কাজ করে অথবা প্রকৃতপক্ষে ব্যবহারযোগ্য VLA প্রশিক্ষণ ডেটা সংগ্রহ করা থেকে শুরু করুন।

পাঁচটি নীতি, একটি তুলনা সারণী

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT বাস্তব প্যারামিটার গণনা সহ, প্রতি অ্যাকশন ধাপে ইনফারেন্স ল্যাটেন্সি, প্রতিটি GPU স্তরের প্রয়োজন এবং কোনো দরকারী কাজ করার আগে ন্যূনতম এপিসোড সংখ্যা।

নীতিগুলি তুলনা করুন

একটি সিদ্ধান্ত সারণী যা আপনি ব্যবহার করতে পারেন

আপনার পরিস্থিতিএখান থেকে শুরু করুনকেন
একটি কাজ, ভালো প্রদর্শনী, কোনো ভাষা নেইACT~80 M, 20 ms, 24 GB কার্ড, কোনো বেস মডেল ডাউনলোড করার প্রয়োজন নেই
কয়েকটি সম্পর্কিত কাজ, প্রতিটি একটি নির্দেশ সহSmolVLA450 M, lerobot-এ, ন্যূনতম 30টি এপিসোড, প্রতি রানে 1 থেকে 3 USD
বিশেষভাবে TinyVLA ফলাফল পুনরুত্পাদন করাTinyVLA-B or TinyVLA-Hরেপোই একমাত্র পথ: বিচ্ছিন্ন পরিবেশ, রূপান্তরিত ডেটা
মাল্টি-টাস্ক, বিভিন্ন নির্দেশাবলী, A100 বাজেটGR00T N1.7 or Pi0.5~3 B, প্রতি ধাপে 152 ms এবং 485 ms, প্রতি রানে 4 থেকে 12 USD
এখনো কোনো রোবট নেইএকটি বাস্তব বাহু চালানকিউ-ভিত্তিক লাইভ আর্মের জন্য কোনো সাইনআপ এবং কোনো হার্ডওয়্যারের প্রয়োজন নেই

শেষ সারির জন্য, লাইভ আর্ম একটি ফিজিক্যাল SO-100 স্ট্রিম করে যা আপনি অ্যাকাউন্ট ছাড়াই ব্রাউজার থেকে চালাতে পারবেন, এবং শুরু করার তিনটি উপায় বাকিটা কভার করে। SO-100 এখানে রেফারেন্স আর্ম, যন্ত্রাংশ সহ আনুমানিক 110 থেকে 150 EUR, সাথে একটি সম্পূর্ণ সেটআপ গাইড

সাব-1 B মডেলের পরে কী আসে

প্যারামিটার সংখ্যা কমানো VLA-কে সস্তা করার একটি উপায় এবং এটিই যে একমাত্র বিজয়ী উপায় তা স্পষ্ট নয়। OpenVLA-OFT (arXiv 2502.19645) 7 B ব্যাকবোন বজায় রাখে এবং শুধুমাত্র অ্যাকশনগুলি কীভাবে ডিকোড করা হয় তা পরিবর্তন করে, অ্যাকশন জেনারেশন থ্রুপুটে 26x বৃদ্ধি এবং LIBERO 76.5 থেকে 97.1 শতাংশে উন্নীত হওয়ার কথা জানায়। BitVLA (arXiv 2506.07530) একটি 1-বিট BitNet b1.58 2B4T ব্যাকবোনের প্রতিটি ওজন টারনারি করে, 11.0x কম মেমরি এবং 4.4x কম এন্ড-টু-এন্ড ল্যাটেন্সি রিপোর্ট করে যখন ফুল-প্রিসিশন OpenVLA-OFT-এর সাথে মেলে। X-VLA-0.9B (arXiv 2510.10274) ফ্লো ম্যাচিং সহ 1 B লাইনে বসে আছে।

সাধারণ বিষয়: অ্যাকশন ডিকোডার, ল্যাঙ্গুয়েজ মডেল নয়, যেখানে ল্যাটেন্সি থাকে। একটি পলিসি কীভাবে অ্যাকশন নির্গত করে তা জিজ্ঞাসা করুন তার প্যারামিটার সংখ্যা জিজ্ঞাসা করার আগে। অ্যারেনা তে 85টি মডেল এবং 332টি ফলাফল রয়েছে, প্রতিটি তার উৎসের সাথে সংযুক্ত; একটি বিস্তৃত ওভারভিউ রয়েছে আমাদের VLA পরিচিতি

আমি কি একটি RTX 4090-এ SmolVLA ফাইন-টিউন করতে পারি?

হ্যাঁ। SmolVLA হল 450 M প্যারামিটার এবং AY-Robots এটিকে RTX 4090 / 24 GB টায়ারে চালায়। lerobot উদাহরণটি --batch_size=64 ব্যবহার করে, যা আপনার কার্ডের জন্য একটি গ্যারান্টি না হয়ে একটি উদাহরণ মাত্র; ডকুমেন্টেশন ছোট থেকে শুরু করে লোডিং সময় কম থাকা পর্যন্ত বাড়ানোর পরামর্শ দেয়। A100-এ 20000 স্টেপের জন্য ডকুমেন্টেশনে উল্লেখিত প্রায় 4 ঘন্টার চেয়ে বেশি সময় লাগতে পারে।

TinyVLA কি lerobot বা AY-Robots-এ উপলব্ধ?

উভয় ক্ষেত্রেই না। TinyVLA শুধুমাত্র এর গবেষণা রিপোজিটরিতে বিদ্যমান, শেষ কমিট 11 March 2025, এবং এর ফরম্যাট LeRobot-এর পরিবর্তে ACT-স্টাইলের HDF5। AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA এবং ACT প্রশিক্ষণ দেয়। আপনি যদি TinyVLA চান তবে আপনাকে এটি নিজে তৈরি করতে হবে, এবং প্রথমে scripts/train.sh-এ DeepSpeed কনফিগ পাথ ঠিক করতে হবে।

একটি 450 M মডেল কি সত্যিই একটি 3 B মডেলের সাথে প্রতিযোগিতামূলক?

লেখকদের নিজস্ব বেঞ্চমার্কে, হ্যাঁ: LIBERO-তে 87.3 বনাম 86.0 একটি রোবোটিক্স-প্রিট্রেইনড Pi0 3.3 B-এর বিপরীতে, এবং তিনটি বাস্তব SO-100 টাস্কে 78.3 বনাম 61.7 যেখানে একই পেপার Pi0-কে 3.5 B লেবেল করে। সীমাবদ্ধতা একই পেপারে রয়েছে: রোবোটিক্স প্রিট্রেনিং ছাড়া একক-টাস্কে, SmolVLA 40.0-এ নেমে আসে, যা ACT-এর 48.3-এর নিচে।

একটি ছোট VLA কিছু করার আগে আমার কতগুলি পর্বের প্রয়োজন?

AY-Robots SmolVLA-এর জন্য সর্বনিম্ন 30টি পর্ব এবং ACT-এর জন্য সর্বনিম্ন 50টি পর্ব নির্ধারণ করে। lerobot ডকুমেন্টেশন প্রায় 50টি সুপারিশ করে এবং রিপোর্ট করে যে একই কাজের জন্য 25টি যথেষ্ট ছিল না। সংখ্যার মতোই কাঠামোও গুরুত্বপূর্ণ: পেপারের সেটটি প্রতিটি 10টি পর্ব সহ 5টি কিউব পজিশন ব্যবহার করেছে।

প্রকাশিত ল্যাটেন্সি সংখ্যাগুলি এত ভিন্ন কেন?

তারা বিভিন্ন জিনিস পরিমাপ করে। TinyVLA একটি A6000-এ প্রতি অ্যাকশন ভবিষ্যদ্বাণীতে 14 ms রিপোর্ট করে; AY-Robots SmolVLA-কে 245 ms এবং ACT-কে প্রতি অ্যাকশন স্টেপে 20 ms হিসাবে তালিকাভুক্ত করে। কিছু চিত্র একটি ফরোয়ার্ড পাস কভার করে, কিছু একটি 50-অ্যাকশন চাঙ্কের মধ্যে একটি পাস ভাগ করে, এবং প্রায় কোনটিই ক্যামেরা ক্যাপচার বা সার্ভোতে লেখা অন্তর্ভুক্ত করে না।

ক্লাউড ইনফারেন্স কি GPU সমস্যা সমাধান করে?

আংশিকভাবে। AY-Robots স্বয়ংক্রিয়ভাবে একটি পড সরবরাহ করে যা নীতিটি পরিবেশন করে যখন স্থানীয় ক্লায়েন্ট সেই এন্ডপয়েন্টের সাথে কথা বলে, একটি নিষ্ক্রিয় ওয়াচডগ সহ যাতে এটি নীরবে বিল না করে নিজেকে ধ্বংস করে। এটি পাবলিক-ইন্টারনেট রাউন্ড ট্রিপ সরাতে পারে না, এবং নিয়ন্ত্রণ লুপটি ইতিমধ্যেই প্রতি অ্যাকশন স্টেপে 20 থেকে 485 ms। ধীর পিক-এন্ড-প্লেসের জন্য ঠিক আছে, দ্রুত প্রতিক্রিয়াশীল গতির জন্য নয়।

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started