AY-Robots پالیسی موازنہ جدول جس میں GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA اور ACT کے لیے پیرامیٹر کی گنتی، GPU ٹیرز اور انفرنس لیٹنسی شامل ہیں۔
SmolVLATinyVLAچھوٹے VLAکنزیومر GPULeRobot

چھوٹے VLA ماڈلز: TinyVLA, SmolVLA اور 1B سے کم کا معاملہ

AY-Robots ResearchAugust 23, 202619 منٹ پڑھنے کا وقت

TinyVLA اور SmolVLA نے ایک فعال VLA کو 1 بلین پیرامیٹرز سے کم میں پیش کیا ہے۔ دونوں پیپرز سے حقیقی اعداد و شمار، LeRobot کے ڈیفالٹس، پیمائش شدہ لیٹنسی، اور 24 GB کارڈ پر ایک رن کی لاگت کیا ہے۔

تقریباً ہر ویژن-لینگویج-ایکشن ماڈل جس کے بارے میں لکھا جاتا ہے، ایک ڈیٹا سینٹر کارڈ فرض کرتا ہے۔ OpenVLA 7 ارب پیرامیٹرز پر مشتمل ہے۔ GR00T N1.7 اور Pi0.5 تقریباً 3 ارب ہیں اور انہیں فائن ٹیون کرنے کے لیے A100 80 GB کی ضرورت ہوتی ہے۔ اگر آپ کی میز پر موجود کارڈ 4090 ہے، تو اس قسم کا ماڈل آپ کی پہنچ سے باہر ہے۔

دو مقالے دلیل دیتے ہیں کہ آپ کو اس کی ضرورت نہیں ہے۔ TinyVLA (arXiv 2409.12514، جسے فروری 2025 میں IEEE Robotics and Automation Letters نے قبول کیا) 400 ملین سے 1.3 ارب بیک بون اور ایک ڈفیوژن ایکشن ہیڈ سے ایک VLA بناتا ہے۔ SmolVLA (arXiv 2506.01844، 2 جون 2025 کو جمع کرایا گیا) 450 ملین پیرامیٹرز کے ساتھ اوپن ویٹس، اوپن ڈیٹا اور ایک اسکرپٹ فراہم کرتا ہے جو ایک کنزیومر کارڈ پر چلتا ہے۔ یہاں وہ ہے جو دونوں نے ماپا، اور جہاں 1 ارب سے کم کا استدلال درست نہیں رہتا۔

آپ کو کیا جاننے کی ضرورت ہے

  • TinyVLA تین سائز میں دستیاب ہے: 422 ملین کل جس میں 101 ملین تربیت کے قابل ہیں، 740 ملین جس میں 138 ملین، 1.3 ارب جس میں 143 ملین۔ صرف پہلے دو 1 ارب سے کم ہیں۔
  • اس کی ٹیبل IV ایک A6000 پر TinyVLA-1B کے لیے فی ایکشن پیش گوئی 14 ms ماپتی ہے، جبکہ OpenVLA-7B کے لیے 292 ms اور ایک چھوٹے OpenVLA-1B کے لیے 140 ms ہے۔
  • ہیڈ اس رفتار کو برقرار رکھتا ہے، نہ کہ بیک بون: TinyVLA-H کے ڈفیوژن ہیڈ کو ACT ہیڈ سے تبدیل کریں اور پانچ حقیقی روبوٹ ٹاسکس 94.0 کی اوسط سے سنگل ہندسوں میں گر جاتے ہیں۔ ایک MLP ہیڈ ہر جگہ 0 اسکور کرتا ہے۔
  • SmolVLA 450 ملین ہے، جس میں سے تقریباً 100 ملین ایکشن ایکسپرٹ ہے، جسے 481 کمیونٹی LeRobot ڈیٹا سیٹس اور 10.6 ملین فریمز پر پری ٹرین کیا گیا ہے۔ یہ LIBERO پر 87.3 کی رپورٹ کرتا ہے جبکہ 3.3 ارب پر ایک روبوٹکس-پری ٹرینڈ Pi0 کے لیے 86.0، اور تین حقیقی SO-100 ٹاسکس پر 78.3 جبکہ 3.5 ارب پر Pi0 کے لیے 61.7۔
  • اس پری ٹریننگ کے بغیر سنگل ٹاسک پر تربیت یافتہ، SmolVLA ان ٹاسکس پر 40.0 تک گر جاتا ہے، جو ACT کے 48.3 سے کم ہے۔ چھوٹا خود بخود آسان نہیں ہوتا۔
  • TinyVLA میں کوئی LeRobot انٹیگریشن نہیں ہے اور یہ ایک CUDA 11.7 وہیل اسٹیک کو پن کرتا ہے۔ SmolVLA lerobot میں ہے اور یہاں 24 GB ٹیر پر فی رن تقریباً 1 سے 3 امریکی ڈالر لاگت آتی ہے۔

اصل میں ایک چھوٹا VLA کیا کہلاتا ہے

ماڈل کارڈ پر پیرامیٹر کی گنتی ایک عدد نہیں ہوتی۔ اس کا مطلب کل وزن، انفرنس کے وقت لوڈ ہونے والے وزن، یا وہ وزن ہو سکتا ہے جو دورانِ ۔ TinyVLA دونوں کی اطلاع دیتا ہے، اور فرق بہت زیادہ ہے: TinyVLA-H کا کل وزن 1.3 B ہے لیکن 143 M قابلِ تربیت ہے، کیونکہ وژن ٹاور اور زیادہ تر لینگویج ماڈل منجمد رہتے ہیں جبکہ LoRA اڈاپٹرز اور ایکشن ہیڈ حرکت کرتے ہیں۔ مقالے میں قابلِ تربیت حصہ تقریباً 5 فیصد بتایا گیا ہے۔

ماڈلپیرامیٹرزبیک بونایکشن ہیڈماخذ
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

دو قطاریں بحث کے قابل ہیں۔ تقریباً 80 M پر یہاں موجود ہر چیز سے چھوٹا ہے لیکن اس میں کوئی لینگویج ماڈل نہیں ہے، لہذا یہ VLA نہیں ہے: یہ ایک کام سیکھتا ہے اور اسے دوسرا کام کرنے کے لیے نہیں کہا جا سکتا۔ 27 M پر T5-Base ٹیکسٹ انکوڈر کے ذریعے کنڈیشنڈ ہے، نہ کہ LLM بیک بون کے ذریعے۔ اچھے بیس لائنز ہیں، لیکن دونوں میں سے کوئی بھی وہ ہدایات کی پیروی فراہم نہیں کرتا جو لیبل سے مراد ہے۔

1 B کی حد من مانی ہے

TinyVLA-H، وہ ویرینٹ جو نمایاں نتائج پیش کرتا ہے، 1.3 B ہے اور اس حد سے اوپر ہے۔ بہتر سوال یہ ہے کہ کیا کوئی ماڈل تربیت کے دوران 24 GB میں فٹ ہوتا ہے اور انفرنس کے وقت آپ کی کنٹرول ریٹ کو پورا کرتا ہے۔ پانچ پالیسیاں جنہیں آپ یہاں تربیت دے سکتے ہیں وہ پالیسیوں کے صفحے پر موجود ہیں؛ اگر آپ اس کے اعداد و شمار دوسروں کے ساتھ دیکھنا چاہتے ہیں تو TinyVLA کا ایک ایرینا اندراج ہے۔

TinyVLA: رفتار ہیڈ سے آتی ہے، نہ کہ بیک بون سے

واضح مطلب یہ ہے کہ انہوں نے لینگویج ماڈل کو چھوٹا کیا، اس لیے یہ تیز ہو گیا۔ پیپر کا ایبلیشن اس کے برعکس کہتا ہے۔ OpenVLA کے 7 B بیک بون کو تقریباً 1 B والے سے تبدیل کرنے سے فی ایکشن کی پیش گوئی 292 ms سے کم ہو کر 140 ms رہ گئی، جو کہ 2 گنا اضافہ ہے۔ TinyVLA-H، ایک موازنہ پیرامیٹر کاؤنٹ پر، اسی کارڈ پر 14 ms پر چلتا ہے۔ باقی 10 گنا ایکشن ہیڈ کی وجہ سے ہے۔

ماڈلفی ایکشن کی پیش گوئیپیمائش کی گئی
OpenVLA-7B292 mssingle A6000
OpenVLA-1B، بیک بون کو TinyVLA کے ساتھ تبدیل کیا گیا140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA لینگویج ماڈل ہیڈ کے ذریعے، ہر ایکشن ڈائمینشن کے لیے ایک، خودکار طریقے سے ڈسکریٹائزڈ ٹوکنز کے طور پر ایکشنز خارج کرتا ہے۔ TinyVLA ایک ڈفیوژن ڈیکوڈر منسلک کرتا ہے جو پورے چنک کو ایک ہی بار میں تیار کرتا ہے۔ ٹیبل V TinyVLA-H پر آرکیٹیکچر کو ظاہر کرتا ہے اور اسی پانچ حقیقی روبوٹ ٹاسکس پر صرف ہیڈ کو تبدیل کرتا ہے۔ یہ دونوں پیپرز میں اس دلیل کا سب سے واضح ثبوت ہے جو فلو میچنگ پالیسیاں بناتی ہیں، اور اس کی وجہ Pi0 ٹوکن ڈی کوڈنگ سے ہٹ گیا۔

TinyVLA-H پر ہیڈپلیس ٹینسفلپ مگاسٹیک کیوبزکلوز ڈراوراوپن باکس
ڈفیوژن (droid_diffusion)90.098.398.396.786.7
ایکشن چنکنگ ٹرانسفارمر13.38.38.313.323.3
ملٹی لیئر پرسیپٹرون00000
TinyVLA کے اعداد و شمار کیا ظاہر کرتے ہیں

292 / 140 / 14 ms کے اعداد و شمار ٹیبل IV میں ہیں، سب ایک A6000 پر۔ یہ فی ایکشن پیش گوئی کے ہیں اور کیمرہ کیپچر، پری پروسیسنگ اور سرووز کو سیریل رائٹ کو خارج کرتے ہیں۔ شائع شدہ لیٹنسی کو ہمیشہ ایک نچلی حد سمجھیں، کبھی بھی کنٹرول ریٹ نہیں۔ ہمارے اپنے اعداد و شمار بھی اسی حد کے حامل ہیں: دیکھیں انفرنس لیٹنسی۔

TinyVLA نے کیا اسکور کیا

بینچ مارکپروٹوکولTinyVLA-Hبیس لائنز
میٹا ورلڈ، 50 ٹاسکس، سمملٹی ٹاسک، 50 ڈیموز، 3 سیڈزمشکل کے لحاظ سے 77.6 / 21.5 / 11.4 / 15.8، اوسط 31.6ڈفیوژن پالیسی اوسط 10.5
ریئل فرانکا پانڈا، 5 ٹاسکسفی ٹاسک 100 ٹراجیکٹریز، 20 ٹرائلز94.0 اوسطOpenVLA 68.3، ڈفیوژن پالیسی 35.3
بائی مینول UR5، 3 ٹاسکسملٹی ٹاسک، فی ٹاسک 10 ٹرائلز76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0، ڈفیوژن پالیسی 40.3 / 31.3 / 43.0

بائی مینول قطار کی ایک بورنگ وضاحت ہے جو پیپر خود دیتا ہے: OpenVLA کو Open X-Embodiment پر پری ٹرین کیا گیا ہے، جو مکمل طور پر سنگل آرم ڈیٹا پر مشتمل ہے، لہذا دو آرم ایکشن اسپیس ڈسٹری بیوشن سے باہر ہے اور اس کا سکور صفر ہے۔ ڈفیوژن پالیسی بیس لائن ان تین میں سے دو کاموں پر TinyVLA-H کو ہرا دیتی ہے۔ مزید معلومات کے لیے اوپن ایکس-ایمباڈیمنٹ کی تحریر.

AY-Robots ایرینا لیڈر بورڈ، 85 VLA ماڈلز کی ایک ترتیب پذیر جدول جس میں 332 بینچ مارک نتائج ہیں، ہر قدر اس پیپر یا ماڈل کارڈ سے منسلک ہے جہاں سے یہ آئی ہے۔
کراس ماڈل بینچ مارک نمبرز کا موازنہ صرف تب کیا جا سکتا ہے جب آپ دیکھ سکیں کہ ہر ایک کہاں سے آیا ہے۔

TinyVLA ریپو، اگست 2026 تک

یہ پیپر اچھا ہے۔ کوڈ ایک ریسرچ ڈراپ ہے۔ ریپوزٹری github.com/liyaxuanliyaxuan/TinyVLA ہے؛ اس کی README کوڈ کی ریلیز کی تاریخ 17 فروری 2025 اور آخری کمٹ 11 مارچ 2025 بتاتی ہے۔ یہ ایک پیپر کو دوبارہ تیار کرنے کے لیے ٹھیک ہے، لیکن اگر آپ ایک برقرار رکھی گئی لائبریری چاہتے ہیں تو یہ ایک مسئلہ ہے۔

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README سے انسٹالیشن کی ترتیب، جسے 2026-08-23 کو ریپوزٹری کے خلاف چیک کیا گیا تھا۔
ڈیپینڈنسی پنز وہ جال ہیں جو ایک دن کھا جاتے ہیں

requirements.txt میں torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, اور CUDA اسٹیک کو 11.x وہیلز پر سیٹ کرتا ہے: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0۔ README میں Python 3.10 کا مطالبہ کیا گیا ہے؛ lerobot 0.6.1 کو 3.12 یا اس سے نیا ورژن درکار ہے، لہذا دونوں ایک ہی ماحول کا اشتراک نہیں کر سکتے۔ پہلے تصدیق کریں کہ آپ کی GPU جنریشن کے لیے torch 2.0.1 کا بلڈ موجود ہے۔ اگر اس کے بجائے کوئی رن VRAM پر ختم ہو جائے، تو آؤٹ آف میموری چیک لسٹ اندازہ لگانے سے زیادہ تیز ہے۔

TinyVLA LeRobot ڈیٹا سیٹس بھی نہیں پڑھتا۔ اس کا فارمیٹ ACT-اسٹائل HDF5 ہے: ایکشن، language_raw، اور ایک آبزرویشنز گروپ جس میں ملٹی ویو امیجز، joint_positions، qpos اور qvel شامل ہیں۔ ریپو RLDS ان پٹ کے لیے data_utils/rlds_to_h5py.py فراہم کرتا ہے، اور ہر ٹاسک کو aloha_scripts/constants.py میں اس کے dataset_dir، episode_len اور camera_names کے ساتھ دستی طور پر رجسٹر کیا جاتا ہے۔ اگر آپ کے ایپیسوڈز lerobot یا ڈیسک ٹاپ کلائنٹ سے آئے ہیں، تو آپ کو کنورژن خود کرنا ہوگا۔

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh سے مختصر کیا گیا۔ اوپر موجود ہر فلیگ اور ویلیو فراہم کردہ فائل میں موجود ہے۔
  • --num_gpus=8 ایک آٹھ کارڈ والے نوڈ کو فرض کرتا ہے۔ اسے 1 پر سیٹ کریں اور بیچ سائز کو 32 سے کافی نیچے کر دیں۔ کوئی سنگل-GPU ویرینٹ اپ اسٹریم نہیں بھیجا جاتا، لہذا کمانڈ کو 4090 پر لفظ بہ لفظ نہیں چلایا جا سکتا۔
  • --deepspeed scripts/zero2.json ایک ایسی فائل کی طرف اشارہ کرتا ہے جو ٹاپ-لیول اسکرپٹس ڈائریکٹری میں نہیں ہے۔ DeepSpeed کنفگس llava-pythia/scripts/zero2.json پر بھیجے جاتے ہیں۔ اپنی پہلی رن سے پہلے پاتھ کو درست کریں۔
  • README کا تقاضا ہے کہ آؤٹ پٹ ڈائریکٹری کے نام میں llava_pythia شامل ہو، نیز lora اگر LoRA فعال ہو۔
  • بیک بون ایک علیحدہ ڈاؤن لوڈ ہے: lesjie/Llava-Pythia-400M, -700M یا -1.3B۔ کوئی ایک بیس چیک پوائنٹ نہیں ہے جس کی طرف آپ ایک پالیسی کو اس طرح اشارہ کریں جس طرح آپ lerobot/smolvla_base کی طرف اشارہ کرتے ہیں۔

SmolVLA: وہ سب-1 B ماڈل جسے آپ آج دوپہر چلا سکتے ہیں

SmolVLA ایک برقرار رکھی گئی لائبریری کے اندر وہی دلیل پیش کرتا ہے۔ یہ SmolVLM2-500M-Video-Instruct بیک بون پر 450 M پیرامیٹرز پر مشتمل ہے، اور کارکردگی ان سیٹنگز سے آتی ہے جو آپ configuration_smolvla.py سے پڑھ سکتے ہیں نہ کہ چھوٹے ہونے کے دعوے سے۔

configuration_smolvla.py میں سیٹنگڈیفالٹاس کا فائدہ
num_vlm_layers16صرف پہلے 16 لینگویج ماڈل لیئرز چلتے ہیں
expert_width_multiplier0.75ایکشن ایکسپرٹ کی پوشیدہ سائز VLM کے 75 فیصد ہے
self_attn_every_n_layers2سیلف-اٹینشن کراس-اٹینشن کے ساتھ انٹرلیوڈ ہے
chunk_size / n_action_steps50 / 50ایک پاس 50 ایکشنز خارج کرتا ہے اور تمام 50 پر عمل درآمد ہوتا ہے
num_steps10فلو میچنگ ڈینوائزنگ 10 سٹیپس پر فکسڈ ہے
tokenizer_max_length48ہدایت کو 48 ٹوکنز تک چھوٹا کر دیا جاتا ہے
freeze_vision_encoder / train_expert_onlyTrue / Trueفائن-ٹیوننگ ایکسپرٹ کو حرکت دیتی ہے، نہ کہ ویژن ٹاور کو
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000یہ پیپر کی ترکیب نہیں ہے: اس کی پری ٹریننگ نے 200000 سٹیپس پر 100-سٹیپ وارم اپ استعمال کیا تھا

پری ٹریننگ میں 481 کمیونٹی LeRobot ڈیٹا سیٹس، 22.9 K ایپی سوڈز اور 10.6 M فریمز 4 GPUs پر استعمال کیے گئے، 200000 سٹیپس 256 کے گلوبل بیچ پر؛ پیپر کے مطابق یہ پورا پروجیکٹ تقریباً 30 K GPU گھنٹوں کا ہے۔ ایک قابلِ غور تعداد: Hugging Face کے لانچ بلاگ میں 487 کیوریٹڈ ڈیٹا سیٹس کا ذکر ہے جبکہ پیپر کی ٹیبل میں 481 درج ہے۔ ہم پیپر کی تعداد استعمال کرتے ہیں اور اس اختلاف کو نمایاں کرتے ہیں۔

AY-Robots پر SmolVLA ماڈل کا صفحہ جو پیرامیٹر کاؤنٹ، 24 GB GPU ٹیر، فی ایکشن سٹیپ انفرنس لیٹنسی اور کم از کم ایپی سوڈ کاؤنٹ دکھا رہا ہے۔
پلیٹ فارم کا SmolVLA صفحہ: 450 M پیرامیٹرز، 245 ms فی ایکشن سٹیپ، RTX 4090 ٹیر، کم از کم 30 ایپی سوڈز۔
بینچ مارکSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO اوسط، ملٹی ٹاسک87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World اوسط، ملٹی ٹاسک57.368.2447.9 (3.5 B, robotics-pretrained)-
حقیقی SO-100، 3 ٹاسکس، ملٹی ٹاسک ٹریننگ78.3-61.7 (3.5 B)-
حقیقی SO-100، 3 ٹاسکس، سنگل ٹاسک، روبوٹکس پری ٹریننگ کے بغیر40.0--48.3
SO-101 لیگو پک-پلیس، سنگل ٹاسک، ان ڈسٹری بیوشن90--70
SO-101 لیگو پک-پلیس، سنگل ٹاسک، آؤٹ آف ڈسٹری بیوشن50--40
پوری ٹیبل پڑھیں، نہ کہ صرف ہیڈ لائن رو

LIBERO ایک سمولیشن ہے اور اب وہاں ہر قابل ماڈل اسی کی دہائی میں سکور کرتا ہے۔ حقیقی SO-100 کی رو، جہاں ایک 450 M ماڈل 3.5 B والے کو 16.6 پوائنٹس سے ہرا دیتا ہے، دلچسپ ہے۔ اس کے نیچے والی رو اس کا کاؤنٹر ویٹ ہے۔ کمیونٹی پری ٹریننگ اور ملٹی ٹاسک ٹریننگ کو ہٹا دیں تو وہی ماڈل ACT سے نیچے 40.0 پر آ جاتا ہے۔ قابلِ دفاع دعویٰ یہ ہے کہ ایک چھوٹا ماڈل خود بخود بدتر نہیں ہوتا، نہ کہ یہ بہتر ہوتا ہے۔

ایک اتفاق مددگار ثابت ہوتا ہے: SmolVLA پیپر کی میٹا ورلڈ ٹیبل میں TinyVLA کے اپنے شائع شدہ اعداد و شمار کو ایک بیس لائن کے طور پر شامل کیا گیا ہے، لہٰذا اس بار دونوں ماڈلز ایک ہی ٹیبل میں موجود ہیں، SmolVLA-0.45B 57.3 پر TinyVLA-H کے مقابلے میں 31.6 پر۔ یہ بھی رپورٹ کیا گیا ہے کہ SmolVLA کی تربیت Pi0 کے مقابلے میں تقریباً 40 فیصد تیزی سے اور 6 گنا کم میموری پر ہوتی ہے۔ یہ سب SmolVLA کے مصنفین کی طرف سے ہے؛ ارینا اندراج ہر قدر کو اس کے ماخذ سے جوڑتا ہے۔

SmolVLA اپنا وقت کہاں صرف کرتا ہے

AY-Robots SmolVLA کو 245 ms فی ایکشن سٹیپ اور ACT کو 20 ms پر پالیسی کیٹلاگ میں درج کرتا ہے۔ TinyVLA فی ایکشن پیش گوئی 14 ms رپورٹ کرتا ہے۔ یہ اعداد و شمار موازنہ کے قابل نہیں ہیں، اور انہیں ایسا سمجھنا اس موضوع میں سب سے عام غلطی ہے: کچھ ایک فارورڈ پاس کا وقت لیتے ہیں، کچھ اس پاس کو ایک چنک میں تقسیم کرتے ہیں جب ایکشن چنکنگ اسے امارٹائز کرتا ہے۔

  • SmolVLA فی فارورڈ پاس 50 ایکشنز خارج کرتا ہے اور تمام 50 کو انجام دیتا ہے۔ 30 fps پر جو پیپر حقیقی روبوٹس پر استعمال کرتا ہے، ایک انفرنس تقریباً 1.7 سیکنڈ کی حرکت کا احاطہ کرتا ہے۔
  • غیر ہم وقت ساز انفرنس اگلے چنک کا حساب لگاتا ہے جبکہ موجودہ چنک ابھی بھی عمل میں ہوتا ہے: 9.7 سیکنڈ اوسط ٹاسک تکمیل بمقابلہ 13.75 سیکنڈ ہم وقت ساز، تقریباً 30 فیصد تیز، اور 60 سیکنڈ کی مقررہ ونڈو میں 19 پک اینڈ پلیس سائیکل بمقابلہ 9۔
  • کامیابی کی شرح بہتر ہونے کے بجائے موازنہ کے قابل تھی، 78.3 ہم وقت ساز بمقابلہ 73.3 غیر ہم وقت ساز۔ غیر ہم وقت سازی تھرو پٹ خریدتی ہے، درستگی نہیں۔
  • چنکنگ کمپیوٹ لیٹنسی کو چھپاتی ہے، نیٹ ورک لیٹنسی کو نہیں، اور یہ پالیسی کو کم رد عمل والا بناتی ہے کیونکہ یہ 50 ایکشنز کے لیے پرعزم ہے۔
ریموٹ انفرنس مفت نہیں ہے، اور کوئی پلیٹ فارم فزکس کو ٹھیک نہیں کرتا

AY-Robots ایک کلاؤڈ GPU پوڈ کو خودکار طور پر فراہم کر سکتا ہے جو آپ کی پالیسی کو سروس دیتا ہے جبکہ مقامی روبوٹ کلائنٹ اس اینڈ پوائنٹ سے بات کرتا ہے، اور پوڈ ایک آئیڈل واچ ڈاگ رکھتا ہے تاکہ یہ خاموشی سے بلنگ کرنے کے بجائے خود کو تباہ کر دے۔ جو یہ نہیں کرتا وہ پبلک انٹرنیٹ راؤنڈ ٹرپ کو ہٹانا ہے۔ یہاں موجود پانچ پالیسیوں میں کنٹرول لوپ کسی بھی نیٹ ورک سے پہلے فی ایکشن سٹیپ 20 سے 485 ms ہے، لہذا ریموٹ انفرنس سست پک اینڈ پلیس کے لیے قابل عمل ہے، تیز ری ایکٹو حرکت کے لیے نہیں۔

AY-Robots پالیسیوں کا موازنہ جدول جو GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA اور ACT کو پیرامیٹر کی گنتی، درکار GPU ٹیر، فی ایکشن سٹیپ انفرنس لیٹنسی اور ہر ایک کو درکار اقساط کی کم از کم تعداد کے ساتھ دکھا رہا ہے۔
SmolVLA تقریباً 450 M اور ACT تقریباً 80 M پر وہ دو ہیں جو 24 GB کارڈ میں فٹ ہوتے ہیں۔ باقی تین کو A100 یا H100 80 GB کی ضرورت ہے۔

ایک کنزیومر کارڈ پر SmolVLA کی فائن ٹیوننگ

دستی راستہ، lerobot 0.6.1 پر، جو 23 اگست 2026 تک موجودہ PyPI ریلیز ہے۔ نیچے دی گئی تمام معلومات Hugging Face lerobot SmolVLA دستاویزات سے لی گئی ہیں، جو اسی دن حاصل کی گئی تھیں؛ گائیڈڈ ورژن زیادہ نرم ہے۔

  1. 1
    lerobot کو smolvla ایکسٹرا کے ساتھ انسٹال کریں

    SmolVLA کی ڈیپینڈنسز ایک اختیاری اضافی ہیں، جو بنیادی انسٹالیشن کا حصہ نہیں ہیں۔ اس کے بغیر انسٹال کرنا اور پھر یہ سوچنا کہ پالیسی کی قسم نامعلوم کیوں ہے، آدھا گھنٹہ ضائع کرنے کا ایک عام طریقہ ہے۔

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    کافی ایپی سوڈز کے ساتھ ایک ڈیٹا سیٹ حاصل کریں

    دستاویزات تقریباً 50 ایپی سوڈز کی سفارش کرتی ہیں اور بتاتی ہیں کہ 25 ایپی سوڈز کے ساتھ وہی کام کافی نہیں تھا۔ AY-Robots کم از کم 30 مقرر کرتا ہے۔ اپنے خود کے ریکارڈ کریں، یا ڈیٹا سیٹ ڈائریکٹری سے شروع کریں۔

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    فائن ٹیون شروع کریں

    lerobot گائیڈ سے کمانڈ، بغیر کسی تبدیلی کے۔ دستاویزات کے مطابق 20000 سٹیپس ایک A100 پر تقریباً 4 گھنٹے لگتے ہیں۔ 24 GB کارڈ پر، زیادہ وقت کی توقع کریں اور اسے ماپیں۔

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    بیچ سائز کو اس وقت تک کم کریں جب تک کہ وہ فٹ نہ ہو جائے

    batch_size=64 ایک دستاویزی مثال ہے، آپ کے کارڈ کے بارے میں کوئی وعدہ نہیں۔ دستاویزات چھوٹے سے شروع کرنے اور لوڈنگ کے اوقات کم رہنے تک بڑھانے کا مشورہ دیتی ہیں۔

    bash
    lerobot-train --help
  5. 5
    چیک پوائنٹ کو بازو پر رول آؤٹ کریں

    وہی لائبریری، ایک کمانڈ۔ ریئل ٹائم چنکنگ فلیگز دستاویزات میں کمنٹ آؤٹ کیے گئے ہیں اور کم طاقت والے ہارڈویئر پر ان تک پہنچنے والے ہیں۔

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
چیک پوائنٹ قابلِ ترسیل ہے

آپ جو بھی راستہ اختیار کریں، آپ کو ایک چیک پوائنٹ اور اسے تیار کرنے والی کنفیگریشن ملتی ہے۔ ڈیٹا سیٹ ریویژن، سٹیپ کاؤنٹ اور سیڈ کو اس کے ساتھ رکھیں۔ lerobot کا ڈیفالٹ سیڈ 1000 ہے؛ GR00T کا فائن ٹیوننگ انٹری پوائنٹ کوئی سیڈ ظاہر نہیں کرتا، لہذا وہ رنز بٹ-فار-بٹ دوبارہ تیار نہیں کیے جا سکتے۔ میکینکس ٹریننگ دستاویزات میں ہیں۔

ایک چھوٹے VLA کو بازو پر حاصل کرنے کے دو طریقے

آپ مشین اور ناکامی کے طریقوں کے مالک ہیں۔ SmolVLA کے لیے یہ معقول ہے: ایک پِپ ایکسٹرا، ایک ٹرین کمانڈ، ایک رول آؤٹ کمانڈ۔ TinyVLA کے لیے یہ منجمد پنز، ایک ٹوٹے ہوئے DeepSpeed پاتھ اور ایک ڈیٹا کنورژن کے ساتھ ایک تحقیقی تولید ہے جسے آپ خود لکھتے ہیں۔

  1. ایک 24 GB کارڈ حاصل کریں، 30 سے 50 ایپی سوڈز ریکارڈ کریں، کیمرہ سٹریمز کو فریم بہ فریم تصدیق کریں۔
  2. pip install -e ".[smolvla]"، lerobot/smolvla_base کے خلاف lerobot-train چلائیں، پھر اس مشین پر چیک پوائنٹ کو سرو کریں جس میں بازو لگا ہوا ہے۔
  3. TinyVLA کے لیے: الگ کونڈا ماحول، ڈیٹا کو HDF5 میں تبدیل کریں، constants.py میں ٹاسک رجسٹر کریں، zero2.json پاتھ کو ٹھیک کریں، train.sh کو آٹھ GPUs سے ایک پر کاٹیں۔
فوائد
  • کارڈ کی ادائیگی کے بعد فی گھنٹہ بلنگ نہیں۔
  • انفرنس سرووز کے ساتھ بیٹھتا ہے، تیز کنٹرول لوپ حاصل کرنے کا واحد طریقہ۔
  • آپ پالیسی کوڈ کو پیچ کر سکتے ہیں، اور TinyVLA صرف اسی طرح دستیاب ہے۔
توازن
  • ایک 4090 ہر ~3 B پالیسی کو خارج کر دیتا ہے، لہذا GR00T N1.7 یا Pi0.5 کے خلاف کوئی مقامی موازنہ نہیں۔
  • ماحول کا سیٹ اپ اصل کام ہے۔ TinyVLA کے پنز اکیلے ایک دن کا خرچہ کر سکتے ہیں۔
  • کوئی قطار نہیں، کوئی دوبارہ کوشش نہیں، کوئی چیک پوائنٹ سٹوریج نہیں۔ 14000 سٹیپ پر ریبوٹ کا مطلب دوبارہ شروع کرنا ہے۔

جب ایک چھوٹا ماڈل غلط انتخاب ہو

دونوں مقالے خلاصوں کے مقابلے میں یہاں زیادہ محتاط ہیں۔ TinyVLA کی ناکامی کا تجزیہ مخصوص ہے: 0.4 B ویرینٹ نے ہدایت کو غلط پڑھنے کی وجہ سے تین بار ناکامی کا سامنا کیا، جسے مصنفین نے چھوٹے VLM میں محدود لسانی فہم سے منسوب کیا، اور یہ موڈ 1.3 B پر غائب ہو گیا۔ SmolVLA دوسری طرف سے وہی وکر دکھاتا ہے: یکساں فن تعمیر کا 2.25 B ورژن LIBERO پر 88.75 اور Meta-World پر 68.24 اسکور کرتا ہے، جبکہ 0.45 B ماڈل کے لیے یہ 87.3 اور 57.3 ہے۔

ایک ذیلی-1 B VLA کا انتخاب
جہاں یہ جیتتا ہے
  • ایک 24 GB کارڈ میں فٹ ہو جاتا ہے، جو ایک تجربے کی لاگت کو دسیوں ڈالر سے چند ڈالر تک کم کر دیتا ہے۔
  • بازو کے ساتھ چلنے کے لیے کافی تیز، لہذا کنٹرول لوپ میں کوئی نیٹ ورک ہاپ نہیں۔
  • اس ڈیٹا پر فائن ٹیون ہوتا ہے جسے ایک شخص ریکارڈ کر سکتا ہے، ہزاروں کے بجائے دسیوں ایپی سوڈز۔
  • SmolVLA کے وزن، ڈیٹا لسٹ اور کوڈ عوامی ہیں، لہذا ایک خراب نتیجہ ڈیبگ کیا جا سکتا ہے۔
جہاں یہ ہارتا ہے
  • کمزور ہدایات کی پیروی: کم لسانی پیرامیٹرز، مماثل حوالہ جاتی تاثرات کو الگ کرنے کی کم صلاحیت۔
  • ایسے سیٹ اپس کے لیے کم مکانی اور بصری عمومیت جنہیں آپ نے ریکارڈ نہیں کیا۔
  • ڈیٹا سیٹ کی خامیوں کے لیے زیادہ حساس، جس میں کم پری ٹریننگ ہوتی ہے جس پر انحصار کیا جا سکے۔
  • ملٹی ٹاسک اور طویل المدتی کام اب بھی بڑے ماڈلز کو ترجیح دیتا ہے، بشمول SmolVLA کا اپنا 2.25 B ویرینٹ۔

جس موازنے کو چلانا قابل قدر ہے وہ TinyVLA بمقابلہ SmolVLA نہیں ہے۔ یہ SmolVLA بمقابلہ ACT آپ کے اپنے کام پر ہے، اور SmolVLA کا مقالہ اس کی دلیل ہے۔ روبوٹکس پری ٹریننگ کے بغیر سنگل ٹاسک پر تربیت یافتہ، SmolVLA نے تین SO-100 کاموں میں اوسطاً 40.0 اسکور کیا جہاں سنگل ٹاسک ACT نے 48.3 حاصل کیا۔ جو چیز اسے 78.3 تک لے جاتی ہے وہ کمیونٹی پری ٹریننگ اور ملٹی ٹاسک ٹریننگ ہے، نہ کہ صرف فن تعمیر۔ SO-101 لیگو ٹاسک پر، دونوں سنگل ٹاسک، SmolVLA جیتتا ہے: تقسیم میں 70 کے مقابلے میں 90۔ پھر SmolVLA بمقابلہ Pi0.5 اگر بجٹ اجازت دیتا ہے۔

اس سائز پر، ڈیٹا سیٹ نتیجہ کا فیصلہ کرتا ہے

خراب ڈیٹا کو کور کرنے کے لیے کم پری ٹریننگ ہوتی ہے، لہذا ایک خراب ڈیٹا سیٹ پر ایک صاف لاس کرو آپ کو ایک ایسی پالیسی فراہم کرتا ہے جو نقص کو اعتماد کے ساتھ دوبارہ پیدا کرتی ہے۔ lerobot دستاویزات ساخت کے بارے میں واضح ہیں: 5 کیوب پوزیشنز پر 50 ایپی سوڈز، ہر پوزیشن پر 10، کام کیا؛ 25 نے نہیں کیا۔ اگر لاس ٹھیک لگتا ہے اور بازو کچھ مفید نہیں کرتا، تو لاس گرتا ہے، پالیسی کچھ نہیں کرتی، پالیسی صرف ایک سیٹ اپ میں کام کرتی ہے یا VLA ٹریننگ ڈیٹا جمع کرنا جو دراصل قابل استعمال ہو سے شروع کریں۔

پانچ پالیسیاں، ایک موازنہ جدول

GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA اور ACT حقیقی پیرامیٹر گنتی، فی ایکشن سٹیپ انفرنس لیٹنسی، ہر ایک کو درکار GPU ٹیر اور کم از کم ایپی سوڈ گنتی کے ساتھ اس سے پہلے کہ وہ کچھ مفید کرے۔

پالیسیوں کا موازنہ کریں

ایک فیصلہ کن جدول جس پر آپ عمل کر سکتے ہیں

آپ کی صورتحالاس سے شروع کریںکیوں
ایک کام، اچھی مظاہرے، کوئی زبان نہیںACT~80 M, 20 ms, 24 GB کارڈ، ڈاؤن لوڈ کرنے کے لیے کوئی بیس ماڈل نہیں
چند متعلقہ کام، ہر ایک کے لیے ایک ہدایتSmolVLA450 M، lerobot میں، کم از کم 30 ایپی سوڈ، فی رن 1 سے 3 USD
خاص طور پر TinyVLA کے نتیجے کو دوبارہ پیدا کرناTinyVLA-B or TinyVLA-Hریپو واحد راستہ ہے: الگ تھلگ ماحول، تبدیل شدہ ڈیٹا
ملٹی ٹاسک، مختلف ہدایات، A100 بجٹGR00T N1.7 or Pi0.5~3 B، فی سٹیپ 152 ms اور 485 ms، فی رن 4 سے 12 USD
ابھی تک کوئی روبوٹ نہیںایک حقیقی بازو چلائیںکیو پر مبنی لائیو بازو کو کسی سائن اپ اور ہارڈ ویئر کی ضرورت نہیں

آخری قطار کے لیے، لائیو آرم ایک فزیکل SO-100 کو سٹریم کرتا ہے جسے آپ براؤزر سے بغیر کسی اکاؤنٹ کے چلا سکتے ہیں، اور شروع کرنے کے تین طریقے باقی کا احاطہ کرتے ہیں۔ SO-100 یہاں ریفرنس آرم ہے، جس کے پرزوں کی قیمت تقریباً 110 سے 150 یورو ہے، ساتھ میں ایک مکمل سیٹ اپ گائیڈ.

سب-1 B ماڈلز کے بعد کیا آتا ہے

پیرامیٹر کی گنتی کو کم کرنا VLA کو سستا بنانے کا ایک طریقہ ہے اور یہ واضح طور پر جیتنے والا طریقہ نہیں ہے۔ OpenVLA-OFT (arXiv 2502.19645) 7 B بیک بون کو برقرار رکھتا ہے اور صرف اس بات کو تبدیل کرتا ہے کہ اعمال کو کیسے ڈی کوڈ کیا جاتا ہے، جس میں ایکشن جنریشن تھرو پٹ میں 26 گنا اضافہ اور LIBERO میں 76.5 سے 97.1 فیصد تک اضافہ رپورٹ کیا گیا ہے۔ BitVLA (arXiv 2506.07530) 1-بٹ BitNet b1.58 2B4T بیک بون کے ہر وزن کو ٹرنری بناتا ہے، جس میں 11.0 گنا کم میموری اور 4.4 گنا کم اینڈ ٹو اینڈ لیٹنسی رپورٹ کی گئی ہے جبکہ یہ مکمل درستگی والے OpenVLA-OFT سے مماثل ہے۔ X-VLA-0.9B (arXiv 2510.10274) فلو میچنگ کے ساتھ 1 B لائن پر موجود ہے۔

مشترکہ نکتہ: ایکشن ڈیکوڈر، نہ کہ لینگویج ماڈل، وہ جگہ ہے جہاں لیٹنسی رہتی ہے۔ یہ پوچھنے سے پہلے کہ کسی پالیسی میں کتنے پیرامیٹرز ہیں، یہ پوچھیں کہ وہ اعمال کیسے خارج کرتی ہے۔ ارینا میں 85 ماڈلز اور 332 نتائج ہیں، ہر ایک اپنے ماخذ سے منسلک ہے؛ ایک وسیع تر جائزہ ہماری VLA تعارف میں ہے۔

کیا میں RTX 4090 پر SmolVLA کو فائن ٹیون کر سکتا ہوں؟

جی ہاں۔ SmolVLA 450 M پیرامیٹرز کا ہے اور AY-Robots اسے RTX 4090 / 24 GB ٹیر پر چلاتا ہے۔ lerobot کی مثال --batch_size=64 استعمال کرتی ہے، جو آپ کے کارڈ کے لیے ضمانت کے بجائے ایک مثال ہے؛ دستاویزات چھوٹے سے شروع کرنے اور لوڈنگ کے اوقات مختصر رہنے تک بڑھانے کا مشورہ دیتی ہیں۔ A100 پر 20000 سٹیپس کے لیے دستاویزات میں درج تقریباً 4 گھنٹے سے زیادہ وقت کی توقع رکھیں۔

کیا TinyVLA lerobot یا AY-Robots پر دستیاب ہے؟

دونوں کا جواب نفی میں ہے۔ TinyVLA صرف اپنی ریسرچ ریپوزٹری میں موجود ہے، آخری کمٹ 11 مارچ 2025 کو ہوا تھا، اور اس کا فارمیٹ LeRobot کے بجائے ACT-style HDF5 ہے۔ AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA اور ACT کو تربیت دیتا ہے۔ اگر آپ TinyVLA چاہتے ہیں تو آپ اسے خود بنائیں گے، اور آپ کو پہلے scripts/train.sh میں DeepSpeed کنفگ پاتھ کو ٹھیک کرنا ہوگا۔

کیا 450 M ماڈل واقعی 3 B والے ماڈل سے مقابلہ کر سکتا ہے؟

مصنفین کے اپنے بینچ مارکس کے مطابق، جی ہاں: LIBERO پر 87.3 بمقابلہ 86.0 ایک روبوٹکس-پری ٹرینڈ Pi0 (3.3 B) کے مقابلے میں، اور تین حقیقی SO-100 ٹاسکس پر 78.3 بمقابلہ 61.7 جہاں اسی پیپر میں Pi0 کو 3.5 B پر لیبل کیا گیا ہے۔ حد اسی پیپر میں ہے: روبوٹکس پری ٹریننگ کے بغیر سنگل ٹاسک پر، SmolVLA 40.0 پر گر جاتا ہے، جو ACT کے 48.3 سے کم ہے۔

ایک چھوٹے VLA کے کچھ کرنے سے پہلے مجھے کتنے ایپی سوڈز کی ضرورت ہے؟

AY-Robots SmolVLA کے لیے کم از کم 30 ایپی سوڈز اور ACT کے لیے کم از کم 50 ایپی سوڈز مقرر کرتا ہے۔ lerobot کی دستاویزات تقریباً 50 کی سفارش کرتی ہیں اور رپورٹ کرتی ہیں کہ اسی کام کے لیے 25 کافی نہیں تھے۔ ساخت بھی تعداد جتنی ہی اہم ہے: پیپر کے سیٹ میں 5 کیوب پوزیشنز استعمال کی گئیں جن میں ہر ایک کے 10 ایپی سوڈز تھے۔

شائع شدہ لیٹنسی نمبرز اتنے مختلف کیوں ہوتے ہیں؟

وہ مختلف چیزوں کی پیمائش کرتے ہیں۔ TinyVLA A6000 پر فی ایکشن پیش گوئی 14 ms رپورٹ کرتا ہے؛ AY-Robots SmolVLA کو 245 ms اور ACT کو 20 ms فی ایکشن سٹیپ پر درج کرتا ہے۔ کچھ اعداد و شمار ایک فارورڈ پاس کا احاطہ کرتے ہیں، کچھ 50-ایکشن چنک میں ایک پاس کو تقسیم کرتے ہیں، اور تقریباً کوئی بھی کیمرہ کیپچر یا سرووز کو لکھنے کو شامل نہیں کرتا۔

کیا کلاؤڈ انفرنس GPU کے مسئلے کو حل کرتا ہے؟

جزوی طور پر۔ AY-Robots خود بخود ایک پوڈ فراہم کرتا ہے جو پالیسی کو سروس دیتا ہے جبکہ مقامی کلائنٹ اس اینڈ پوائنٹ سے بات کرتا ہے، ایک آئیڈل واچ ڈاگ کے ساتھ تاکہ یہ خاموشی سے بلنگ کرنے کے بجائے خود کو تباہ کر دے۔ یہ پبلک انٹرنیٹ راؤنڈ ٹرپ کو ختم نہیں کر سکتا، اور کنٹرول لوپ پہلے ہی 20 سے 485 ms فی ایکشن سٹیپ ہے۔ سست پک اینڈ پلیس کے لیے ٹھیک ہے، تیز ری ایکٹو حرکت کے لیے نہیں۔

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started