
TinyVLA اور SmolVLA نے ایک فعال VLA کو 1 بلین پیرامیٹرز سے کم میں پیش کیا ہے۔ دونوں پیپرز سے حقیقی اعداد و شمار، LeRobot کے ڈیفالٹس، پیمائش شدہ لیٹنسی، اور 24 GB کارڈ پر ایک رن کی لاگت کیا ہے۔
تقریباً ہر ویژن-لینگویج-ایکشن ماڈل جس کے بارے میں لکھا جاتا ہے، ایک ڈیٹا سینٹر کارڈ فرض کرتا ہے۔ OpenVLA 7 ارب پیرامیٹرز پر مشتمل ہے۔ GR00T N1.7 اور Pi0.5 تقریباً 3 ارب ہیں اور انہیں فائن ٹیون کرنے کے لیے A100 80 GB کی ضرورت ہوتی ہے۔ اگر آپ کی میز پر موجود کارڈ 4090 ہے، تو اس قسم کا ماڈل آپ کی پہنچ سے باہر ہے۔
دو مقالے دلیل دیتے ہیں کہ آپ کو اس کی ضرورت نہیں ہے۔ TinyVLA (arXiv 2409.12514، جسے فروری 2025 میں IEEE Robotics and Automation Letters نے قبول کیا) 400 ملین سے 1.3 ارب بیک بون اور ایک ڈفیوژن ایکشن ہیڈ سے ایک VLA بناتا ہے۔ SmolVLA (arXiv 2506.01844، 2 جون 2025 کو جمع کرایا گیا) 450 ملین پیرامیٹرز کے ساتھ اوپن ویٹس، اوپن ڈیٹا اور ایک اسکرپٹ فراہم کرتا ہے جو ایک کنزیومر کارڈ پر چلتا ہے۔ یہاں وہ ہے جو دونوں نے ماپا، اور جہاں 1 ارب سے کم کا استدلال درست نہیں رہتا۔
آپ کو کیا جاننے کی ضرورت ہے
- •TinyVLA تین سائز میں دستیاب ہے: 422 ملین کل جس میں 101 ملین تربیت کے قابل ہیں، 740 ملین جس میں 138 ملین، 1.3 ارب جس میں 143 ملین۔ صرف پہلے دو 1 ارب سے کم ہیں۔
- •اس کی ٹیبل IV ایک A6000 پر TinyVLA-1B کے لیے فی ایکشن پیش گوئی 14 ms ماپتی ہے، جبکہ OpenVLA-7B کے لیے 292 ms اور ایک چھوٹے OpenVLA-1B کے لیے 140 ms ہے۔
- •ہیڈ اس رفتار کو برقرار رکھتا ہے، نہ کہ بیک بون: TinyVLA-H کے ڈفیوژن ہیڈ کو ACT ہیڈ سے تبدیل کریں اور پانچ حقیقی روبوٹ ٹاسکس 94.0 کی اوسط سے سنگل ہندسوں میں گر جاتے ہیں۔ ایک MLP ہیڈ ہر جگہ 0 اسکور کرتا ہے۔
- •SmolVLA 450 ملین ہے، جس میں سے تقریباً 100 ملین ایکشن ایکسپرٹ ہے، جسے 481 کمیونٹی LeRobot ڈیٹا سیٹس اور 10.6 ملین فریمز پر پری ٹرین کیا گیا ہے۔ یہ LIBERO پر 87.3 کی رپورٹ کرتا ہے جبکہ 3.3 ارب پر ایک روبوٹکس-پری ٹرینڈ Pi0 کے لیے 86.0، اور تین حقیقی SO-100 ٹاسکس پر 78.3 جبکہ 3.5 ارب پر Pi0 کے لیے 61.7۔
- •اس پری ٹریننگ کے بغیر سنگل ٹاسک پر تربیت یافتہ، SmolVLA ان ٹاسکس پر 40.0 تک گر جاتا ہے، جو ACT کے 48.3 سے کم ہے۔ چھوٹا خود بخود آسان نہیں ہوتا۔
- •TinyVLA میں کوئی LeRobot انٹیگریشن نہیں ہے اور یہ ایک CUDA 11.7 وہیل اسٹیک کو پن کرتا ہے۔ SmolVLA lerobot میں ہے اور یہاں 24 GB ٹیر پر فی رن تقریباً 1 سے 3 امریکی ڈالر لاگت آتی ہے۔
اصل میں ایک چھوٹا VLA کیا کہلاتا ہے
ماڈل کارڈ پر پیرامیٹر کی گنتی ایک عدد نہیں ہوتی۔ اس کا مطلب کل وزن، انفرنس کے وقت لوڈ ہونے والے وزن، یا وہ وزن ہو سکتا ہے جو دورانِ ۔ TinyVLA دونوں کی اطلاع دیتا ہے، اور فرق بہت زیادہ ہے: TinyVLA-H کا کل وزن 1.3 B ہے لیکن 143 M قابلِ تربیت ہے، کیونکہ وژن ٹاور اور زیادہ تر لینگویج ماڈل منجمد رہتے ہیں جبکہ LoRA اڈاپٹرز اور ایکشن ہیڈ حرکت کرتے ہیں۔ مقالے میں قابلِ تربیت حصہ تقریباً 5 فیصد بتایا گیا ہے۔
| ماڈل | پیرامیٹرز | بیک بون | ایکشن ہیڈ | ماخذ |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
دو قطاریں بحث کے قابل ہیں۔ تقریباً 80 M پر یہاں موجود ہر چیز سے چھوٹا ہے لیکن اس میں کوئی لینگویج ماڈل نہیں ہے، لہذا یہ VLA نہیں ہے: یہ ایک کام سیکھتا ہے اور اسے دوسرا کام کرنے کے لیے نہیں کہا جا سکتا۔ 27 M پر T5-Base ٹیکسٹ انکوڈر کے ذریعے کنڈیشنڈ ہے، نہ کہ LLM بیک بون کے ذریعے۔ اچھے بیس لائنز ہیں، لیکن دونوں میں سے کوئی بھی وہ ہدایات کی پیروی فراہم نہیں کرتا جو لیبل سے مراد ہے۔
TinyVLA-H، وہ ویرینٹ جو نمایاں نتائج پیش کرتا ہے، 1.3 B ہے اور اس حد سے اوپر ہے۔ بہتر سوال یہ ہے کہ کیا کوئی ماڈل تربیت کے دوران 24 GB میں فٹ ہوتا ہے اور انفرنس کے وقت آپ کی کنٹرول ریٹ کو پورا کرتا ہے۔ پانچ پالیسیاں جنہیں آپ یہاں تربیت دے سکتے ہیں وہ پالیسیوں کے صفحے پر موجود ہیں؛ اگر آپ اس کے اعداد و شمار دوسروں کے ساتھ دیکھنا چاہتے ہیں تو TinyVLA کا ایک ایرینا اندراج ہے۔
TinyVLA: رفتار ہیڈ سے آتی ہے، نہ کہ بیک بون سے
واضح مطلب یہ ہے کہ انہوں نے لینگویج ماڈل کو چھوٹا کیا، اس لیے یہ تیز ہو گیا۔ پیپر کا ایبلیشن اس کے برعکس کہتا ہے۔ OpenVLA کے 7 B بیک بون کو تقریباً 1 B والے سے تبدیل کرنے سے فی ایکشن کی پیش گوئی 292 ms سے کم ہو کر 140 ms رہ گئی، جو کہ 2 گنا اضافہ ہے۔ TinyVLA-H، ایک موازنہ پیرامیٹر کاؤنٹ پر، اسی کارڈ پر 14 ms پر چلتا ہے۔ باقی 10 گنا ایکشن ہیڈ کی وجہ سے ہے۔
| ماڈل | فی ایکشن کی پیش گوئی | پیمائش کی گئی |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B، بیک بون کو TinyVLA کے ساتھ تبدیل کیا گیا | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA لینگویج ماڈل ہیڈ کے ذریعے، ہر ایکشن ڈائمینشن کے لیے ایک، خودکار طریقے سے ڈسکریٹائزڈ ٹوکنز کے طور پر ایکشنز خارج کرتا ہے۔ TinyVLA ایک ڈفیوژن ڈیکوڈر منسلک کرتا ہے جو پورے چنک کو ایک ہی بار میں تیار کرتا ہے۔ ٹیبل V TinyVLA-H پر آرکیٹیکچر کو ظاہر کرتا ہے اور اسی پانچ حقیقی روبوٹ ٹاسکس پر صرف ہیڈ کو تبدیل کرتا ہے۔ یہ دونوں پیپرز میں اس دلیل کا سب سے واضح ثبوت ہے جو فلو میچنگ پالیسیاں بناتی ہیں، اور اس کی وجہ Pi0 ٹوکن ڈی کوڈنگ سے ہٹ گیا۔
| TinyVLA-H پر ہیڈ | پلیس ٹینس | فلپ مگ | اسٹیک کیوبز | کلوز ڈراور | اوپن باکس |
|---|---|---|---|---|---|
| ڈفیوژن (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| ایکشن چنکنگ ٹرانسفارمر | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| ملٹی لیئر پرسیپٹرون | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms کے اعداد و شمار ٹیبل IV میں ہیں، سب ایک A6000 پر۔ یہ فی ایکشن پیش گوئی کے ہیں اور کیمرہ کیپچر، پری پروسیسنگ اور سرووز کو سیریل رائٹ کو خارج کرتے ہیں۔ شائع شدہ لیٹنسی کو ہمیشہ ایک نچلی حد سمجھیں، کبھی بھی کنٹرول ریٹ نہیں۔ ہمارے اپنے اعداد و شمار بھی اسی حد کے حامل ہیں: دیکھیں انفرنس لیٹنسی۔
TinyVLA نے کیا اسکور کیا
| بینچ مارک | پروٹوکول | TinyVLA-H | بیس لائنز |
|---|---|---|---|
| میٹا ورلڈ، 50 ٹاسکس، سم | ملٹی ٹاسک، 50 ڈیموز، 3 سیڈز | مشکل کے لحاظ سے 77.6 / 21.5 / 11.4 / 15.8، اوسط 31.6 | ڈفیوژن پالیسی اوسط 10.5 |
| ریئل فرانکا پانڈا، 5 ٹاسکس | فی ٹاسک 100 ٹراجیکٹریز، 20 ٹرائلز | 94.0 اوسط | OpenVLA 68.3، ڈفیوژن پالیسی 35.3 |
| بائی مینول UR5، 3 ٹاسکس | ملٹی ٹاسک، فی ٹاسک 10 ٹرائلز | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0، ڈفیوژن پالیسی 40.3 / 31.3 / 43.0 |
بائی مینول قطار کی ایک بورنگ وضاحت ہے جو پیپر خود دیتا ہے: OpenVLA کو Open X-Embodiment پر پری ٹرین کیا گیا ہے، جو مکمل طور پر سنگل آرم ڈیٹا پر مشتمل ہے، لہذا دو آرم ایکشن اسپیس ڈسٹری بیوشن سے باہر ہے اور اس کا سکور صفر ہے۔ ڈفیوژن پالیسی بیس لائن ان تین میں سے دو کاموں پر TinyVLA-H کو ہرا دیتی ہے۔ مزید معلومات کے لیے اوپن ایکس-ایمباڈیمنٹ کی تحریر.

TinyVLA ریپو، اگست 2026 تک
یہ پیپر اچھا ہے۔ کوڈ ایک ریسرچ ڈراپ ہے۔ ریپوزٹری github.com/liyaxuanliyaxuan/TinyVLA ہے؛ اس کی README کوڈ کی ریلیز کی تاریخ 17 فروری 2025 اور آخری کمٹ 11 مارچ 2025 بتاتی ہے۔ یہ ایک پیپر کو دوبارہ تیار کرنے کے لیے ٹھیک ہے، لیکن اگر آپ ایک برقرار رکھی گئی لائبریری چاہتے ہیں تو یہ ایک مسئلہ ہے۔
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt میں torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, اور CUDA اسٹیک کو 11.x وہیلز پر سیٹ کرتا ہے: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0۔ README میں Python 3.10 کا مطالبہ کیا گیا ہے؛ lerobot 0.6.1 کو 3.12 یا اس سے نیا ورژن درکار ہے، لہذا دونوں ایک ہی ماحول کا اشتراک نہیں کر سکتے۔ پہلے تصدیق کریں کہ آپ کی GPU جنریشن کے لیے torch 2.0.1 کا بلڈ موجود ہے۔ اگر اس کے بجائے کوئی رن VRAM پر ختم ہو جائے، تو آؤٹ آف میموری چیک لسٹ اندازہ لگانے سے زیادہ تیز ہے۔
TinyVLA LeRobot ڈیٹا سیٹس بھی نہیں پڑھتا۔ اس کا فارمیٹ ACT-اسٹائل HDF5 ہے: ایکشن، language_raw، اور ایک آبزرویشنز گروپ جس میں ملٹی ویو امیجز، joint_positions، qpos اور qvel شامل ہیں۔ ریپو RLDS ان پٹ کے لیے data_utils/rlds_to_h5py.py فراہم کرتا ہے، اور ہر ٹاسک کو aloha_scripts/constants.py میں اس کے dataset_dir، episode_len اور camera_names کے ساتھ دستی طور پر رجسٹر کیا جاتا ہے۔ اگر آپ کے ایپیسوڈز lerobot یا ڈیسک ٹاپ کلائنٹ سے آئے ہیں، تو آپ کو کنورژن خود کرنا ہوگا۔
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 ایک آٹھ کارڈ والے نوڈ کو فرض کرتا ہے۔ اسے 1 پر سیٹ کریں اور بیچ سائز کو 32 سے کافی نیچے کر دیں۔ کوئی سنگل-GPU ویرینٹ اپ اسٹریم نہیں بھیجا جاتا، لہذا کمانڈ کو 4090 پر لفظ بہ لفظ نہیں چلایا جا سکتا۔
- --deepspeed scripts/zero2.json ایک ایسی فائل کی طرف اشارہ کرتا ہے جو ٹاپ-لیول اسکرپٹس ڈائریکٹری میں نہیں ہے۔ DeepSpeed کنفگس llava-pythia/scripts/zero2.json پر بھیجے جاتے ہیں۔ اپنی پہلی رن سے پہلے پاتھ کو درست کریں۔
- README کا تقاضا ہے کہ آؤٹ پٹ ڈائریکٹری کے نام میں llava_pythia شامل ہو، نیز lora اگر LoRA فعال ہو۔
- بیک بون ایک علیحدہ ڈاؤن لوڈ ہے: lesjie/Llava-Pythia-400M, -700M یا -1.3B۔ کوئی ایک بیس چیک پوائنٹ نہیں ہے جس کی طرف آپ ایک پالیسی کو اس طرح اشارہ کریں جس طرح آپ lerobot/smolvla_base کی طرف اشارہ کرتے ہیں۔
SmolVLA: وہ سب-1 B ماڈل جسے آپ آج دوپہر چلا سکتے ہیں
SmolVLA ایک برقرار رکھی گئی لائبریری کے اندر وہی دلیل پیش کرتا ہے۔ یہ SmolVLM2-500M-Video-Instruct بیک بون پر 450 M پیرامیٹرز پر مشتمل ہے، اور کارکردگی ان سیٹنگز سے آتی ہے جو آپ configuration_smolvla.py سے پڑھ سکتے ہیں نہ کہ چھوٹے ہونے کے دعوے سے۔
| configuration_smolvla.py میں سیٹنگ | ڈیفالٹ | اس کا فائدہ |
|---|---|---|
| num_vlm_layers | 16 | صرف پہلے 16 لینگویج ماڈل لیئرز چلتے ہیں |
| expert_width_multiplier | 0.75 | ایکشن ایکسپرٹ کی پوشیدہ سائز VLM کے 75 فیصد ہے |
| self_attn_every_n_layers | 2 | سیلف-اٹینشن کراس-اٹینشن کے ساتھ انٹرلیوڈ ہے |
| chunk_size / n_action_steps | 50 / 50 | ایک پاس 50 ایکشنز خارج کرتا ہے اور تمام 50 پر عمل درآمد ہوتا ہے |
| num_steps | 10 | فلو میچنگ ڈینوائزنگ 10 سٹیپس پر فکسڈ ہے |
| tokenizer_max_length | 48 | ہدایت کو 48 ٹوکنز تک چھوٹا کر دیا جاتا ہے |
| freeze_vision_encoder / train_expert_only | True / True | فائن-ٹیوننگ ایکسپرٹ کو حرکت دیتی ہے، نہ کہ ویژن ٹاور کو |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | یہ پیپر کی ترکیب نہیں ہے: اس کی پری ٹریننگ نے 200000 سٹیپس پر 100-سٹیپ وارم اپ استعمال کیا تھا |
پری ٹریننگ میں 481 کمیونٹی LeRobot ڈیٹا سیٹس، 22.9 K ایپی سوڈز اور 10.6 M فریمز 4 GPUs پر استعمال کیے گئے، 200000 سٹیپس 256 کے گلوبل بیچ پر؛ پیپر کے مطابق یہ پورا پروجیکٹ تقریباً 30 K GPU گھنٹوں کا ہے۔ ایک قابلِ غور تعداد: Hugging Face کے لانچ بلاگ میں 487 کیوریٹڈ ڈیٹا سیٹس کا ذکر ہے جبکہ پیپر کی ٹیبل میں 481 درج ہے۔ ہم پیپر کی تعداد استعمال کرتے ہیں اور اس اختلاف کو نمایاں کرتے ہیں۔

| بینچ مارک | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO اوسط، ملٹی ٹاسک | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World اوسط، ملٹی ٹاسک | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| حقیقی SO-100، 3 ٹاسکس، ملٹی ٹاسک ٹریننگ | 78.3 | - | 61.7 (3.5 B) | - |
| حقیقی SO-100، 3 ٹاسکس، سنگل ٹاسک، روبوٹکس پری ٹریننگ کے بغیر | 40.0 | - | - | 48.3 |
| SO-101 لیگو پک-پلیس، سنگل ٹاسک، ان ڈسٹری بیوشن | 90 | - | - | 70 |
| SO-101 لیگو پک-پلیس، سنگل ٹاسک، آؤٹ آف ڈسٹری بیوشن | 50 | - | - | 40 |
LIBERO ایک سمولیشن ہے اور اب وہاں ہر قابل ماڈل اسی کی دہائی میں سکور کرتا ہے۔ حقیقی SO-100 کی رو، جہاں ایک 450 M ماڈل 3.5 B والے کو 16.6 پوائنٹس سے ہرا دیتا ہے، دلچسپ ہے۔ اس کے نیچے والی رو اس کا کاؤنٹر ویٹ ہے۔ کمیونٹی پری ٹریننگ اور ملٹی ٹاسک ٹریننگ کو ہٹا دیں تو وہی ماڈل ACT سے نیچے 40.0 پر آ جاتا ہے۔ قابلِ دفاع دعویٰ یہ ہے کہ ایک چھوٹا ماڈل خود بخود بدتر نہیں ہوتا، نہ کہ یہ بہتر ہوتا ہے۔
ایک اتفاق مددگار ثابت ہوتا ہے: SmolVLA پیپر کی میٹا ورلڈ ٹیبل میں TinyVLA کے اپنے شائع شدہ اعداد و شمار کو ایک بیس لائن کے طور پر شامل کیا گیا ہے، لہٰذا اس بار دونوں ماڈلز ایک ہی ٹیبل میں موجود ہیں، SmolVLA-0.45B 57.3 پر TinyVLA-H کے مقابلے میں 31.6 پر۔ یہ بھی رپورٹ کیا گیا ہے کہ SmolVLA کی تربیت Pi0 کے مقابلے میں تقریباً 40 فیصد تیزی سے اور 6 گنا کم میموری پر ہوتی ہے۔ یہ سب SmolVLA کے مصنفین کی طرف سے ہے؛ ارینا اندراج ہر قدر کو اس کے ماخذ سے جوڑتا ہے۔
SmolVLA اپنا وقت کہاں صرف کرتا ہے
AY-Robots SmolVLA کو 245 ms فی ایکشن سٹیپ اور ACT کو 20 ms پر پالیسی کیٹلاگ میں درج کرتا ہے۔ TinyVLA فی ایکشن پیش گوئی 14 ms رپورٹ کرتا ہے۔ یہ اعداد و شمار موازنہ کے قابل نہیں ہیں، اور انہیں ایسا سمجھنا اس موضوع میں سب سے عام غلطی ہے: کچھ ایک فارورڈ پاس کا وقت لیتے ہیں، کچھ اس پاس کو ایک چنک میں تقسیم کرتے ہیں جب ایکشن چنکنگ اسے امارٹائز کرتا ہے۔
- SmolVLA فی فارورڈ پاس 50 ایکشنز خارج کرتا ہے اور تمام 50 کو انجام دیتا ہے۔ 30 fps پر جو پیپر حقیقی روبوٹس پر استعمال کرتا ہے، ایک انفرنس تقریباً 1.7 سیکنڈ کی حرکت کا احاطہ کرتا ہے۔
- غیر ہم وقت ساز انفرنس اگلے چنک کا حساب لگاتا ہے جبکہ موجودہ چنک ابھی بھی عمل میں ہوتا ہے: 9.7 سیکنڈ اوسط ٹاسک تکمیل بمقابلہ 13.75 سیکنڈ ہم وقت ساز، تقریباً 30 فیصد تیز، اور 60 سیکنڈ کی مقررہ ونڈو میں 19 پک اینڈ پلیس سائیکل بمقابلہ 9۔
- کامیابی کی شرح بہتر ہونے کے بجائے موازنہ کے قابل تھی، 78.3 ہم وقت ساز بمقابلہ 73.3 غیر ہم وقت ساز۔ غیر ہم وقت سازی تھرو پٹ خریدتی ہے، درستگی نہیں۔
- چنکنگ کمپیوٹ لیٹنسی کو چھپاتی ہے، نیٹ ورک لیٹنسی کو نہیں، اور یہ پالیسی کو کم رد عمل والا بناتی ہے کیونکہ یہ 50 ایکشنز کے لیے پرعزم ہے۔
AY-Robots ایک کلاؤڈ GPU پوڈ کو خودکار طور پر فراہم کر سکتا ہے جو آپ کی پالیسی کو سروس دیتا ہے جبکہ مقامی روبوٹ کلائنٹ اس اینڈ پوائنٹ سے بات کرتا ہے، اور پوڈ ایک آئیڈل واچ ڈاگ رکھتا ہے تاکہ یہ خاموشی سے بلنگ کرنے کے بجائے خود کو تباہ کر دے۔ جو یہ نہیں کرتا وہ پبلک انٹرنیٹ راؤنڈ ٹرپ کو ہٹانا ہے۔ یہاں موجود پانچ پالیسیوں میں کنٹرول لوپ کسی بھی نیٹ ورک سے پہلے فی ایکشن سٹیپ 20 سے 485 ms ہے، لہذا ریموٹ انفرنس سست پک اینڈ پلیس کے لیے قابل عمل ہے، تیز ری ایکٹو حرکت کے لیے نہیں۔

ایک کنزیومر کارڈ پر SmolVLA کی فائن ٹیوننگ
دستی راستہ، lerobot 0.6.1 پر، جو 23 اگست 2026 تک موجودہ PyPI ریلیز ہے۔ نیچے دی گئی تمام معلومات Hugging Face lerobot SmolVLA دستاویزات سے لی گئی ہیں، جو اسی دن حاصل کی گئی تھیں؛ گائیڈڈ ورژن زیادہ نرم ہے۔
- 1lerobot کو smolvla ایکسٹرا کے ساتھ انسٹال کریں
SmolVLA کی ڈیپینڈنسز ایک اختیاری اضافی ہیں، جو بنیادی انسٹالیشن کا حصہ نہیں ہیں۔ اس کے بغیر انسٹال کرنا اور پھر یہ سوچنا کہ پالیسی کی قسم نامعلوم کیوں ہے، آدھا گھنٹہ ضائع کرنے کا ایک عام طریقہ ہے۔
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2کافی ایپی سوڈز کے ساتھ ایک ڈیٹا سیٹ حاصل کریں
دستاویزات تقریباً 50 ایپی سوڈز کی سفارش کرتی ہیں اور بتاتی ہیں کہ 25 ایپی سوڈز کے ساتھ وہی کام کافی نہیں تھا۔ AY-Robots کم از کم 30 مقرر کرتا ہے۔ اپنے خود کے ریکارڈ کریں، یا ڈیٹا سیٹ ڈائریکٹری سے شروع کریں۔
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3فائن ٹیون شروع کریں
lerobot گائیڈ سے کمانڈ، بغیر کسی تبدیلی کے۔ دستاویزات کے مطابق 20000 سٹیپس ایک A100 پر تقریباً 4 گھنٹے لگتے ہیں۔ 24 GB کارڈ پر، زیادہ وقت کی توقع کریں اور اسے ماپیں۔
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4بیچ سائز کو اس وقت تک کم کریں جب تک کہ وہ فٹ نہ ہو جائے
batch_size=64 ایک دستاویزی مثال ہے، آپ کے کارڈ کے بارے میں کوئی وعدہ نہیں۔ دستاویزات چھوٹے سے شروع کرنے اور لوڈنگ کے اوقات کم رہنے تک بڑھانے کا مشورہ دیتی ہیں۔
bashlerobot-train --help - 5چیک پوائنٹ کو بازو پر رول آؤٹ کریں
وہی لائبریری، ایک کمانڈ۔ ریئل ٹائم چنکنگ فلیگز دستاویزات میں کمنٹ آؤٹ کیے گئے ہیں اور کم طاقت والے ہارڈویئر پر ان تک پہنچنے والے ہیں۔
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
آپ جو بھی راستہ اختیار کریں، آپ کو ایک چیک پوائنٹ اور اسے تیار کرنے والی کنفیگریشن ملتی ہے۔ ڈیٹا سیٹ ریویژن، سٹیپ کاؤنٹ اور سیڈ کو اس کے ساتھ رکھیں۔ lerobot کا ڈیفالٹ سیڈ 1000 ہے؛ GR00T کا فائن ٹیوننگ انٹری پوائنٹ کوئی سیڈ ظاہر نہیں کرتا، لہذا وہ رنز بٹ-فار-بٹ دوبارہ تیار نہیں کیے جا سکتے۔ میکینکس ٹریننگ دستاویزات میں ہیں۔
ایک چھوٹے VLA کو بازو پر حاصل کرنے کے دو طریقے
آپ مشین اور ناکامی کے طریقوں کے مالک ہیں۔ SmolVLA کے لیے یہ معقول ہے: ایک پِپ ایکسٹرا، ایک ٹرین کمانڈ، ایک رول آؤٹ کمانڈ۔ TinyVLA کے لیے یہ منجمد پنز، ایک ٹوٹے ہوئے DeepSpeed پاتھ اور ایک ڈیٹا کنورژن کے ساتھ ایک تحقیقی تولید ہے جسے آپ خود لکھتے ہیں۔
- ایک 24 GB کارڈ حاصل کریں، 30 سے 50 ایپی سوڈز ریکارڈ کریں، کیمرہ سٹریمز کو فریم بہ فریم تصدیق کریں۔
- pip install -e ".[smolvla]"، lerobot/smolvla_base کے خلاف lerobot-train چلائیں، پھر اس مشین پر چیک پوائنٹ کو سرو کریں جس میں بازو لگا ہوا ہے۔
- TinyVLA کے لیے: الگ کونڈا ماحول، ڈیٹا کو HDF5 میں تبدیل کریں، constants.py میں ٹاسک رجسٹر کریں، zero2.json پاتھ کو ٹھیک کریں، train.sh کو آٹھ GPUs سے ایک پر کاٹیں۔
- کارڈ کی ادائیگی کے بعد فی گھنٹہ بلنگ نہیں۔
- انفرنس سرووز کے ساتھ بیٹھتا ہے، تیز کنٹرول لوپ حاصل کرنے کا واحد طریقہ۔
- آپ پالیسی کوڈ کو پیچ کر سکتے ہیں، اور TinyVLA صرف اسی طرح دستیاب ہے۔
- ایک 4090 ہر ~3 B پالیسی کو خارج کر دیتا ہے، لہذا GR00T N1.7 یا Pi0.5 کے خلاف کوئی مقامی موازنہ نہیں۔
- ماحول کا سیٹ اپ اصل کام ہے۔ TinyVLA کے پنز اکیلے ایک دن کا خرچہ کر سکتے ہیں۔
- کوئی قطار نہیں، کوئی دوبارہ کوشش نہیں، کوئی چیک پوائنٹ سٹوریج نہیں۔ 14000 سٹیپ پر ریبوٹ کا مطلب دوبارہ شروع کرنا ہے۔
SmolVLA یہاں کی پانچ پالیسیوں میں سے ایک ہے۔ آپ ایک فارم میں ماڈل اور ڈیٹا سیٹ کا انتخاب کرتے ہیں، بیک اینڈ مطلوبہ VRAM کے مطابق ایک GPU کرائے پر لیتا ہے، ٹرینر چلاتا ہے اور چیک پوائنٹس کو آبجیکٹ سٹوریج میں لکھتا ہے۔ مرحلہ وار: SO-100 پر SmolVLA، یا مکمل میٹرکس ٹریننگ پیج پر۔
| پلیٹ فارم SmolVLA کے لیے کیا بھیجتا ہے | قدر |
|---|---|
| بیچ سائز | 2 |
| لرننگ ریٹ | 1e-4 |
| زیادہ سے زیادہ سٹیپس | 20000 |
| گریڈینٹ ایکومولیشن | 8, and it does not reach the trainer |
| فارم میں اضافی نوبس | seed, logFreq |
| GPU ٹیر | RTX 4090 or any 24 GB card |
| ڈیٹا سیٹ فارمیٹ | LeRobot v3.0 |
| کم از کم ایپی سوڈز | 30 |
پہلی بات، یہاں ڈیفالٹ بیچ سائز 2 ہے، نہ کہ lerobot دستاویزات کی مثال میں 64، اور گریڈینٹ ایکومولیشن سیٹنگ بھیجی جاتی ہے لیکن SmolVLA کے لیے اس کا کوئی اثر نہیں ہوتا، لہذا مؤثر بیچ واقعی 2 ہے۔ اسے جان بوجھ کر بڑھائیں بجائے اس کے کہ یہ فرض کریں کہ ڈیفالٹ اپ سٹریم سے میل کھاتا ہے۔ دوسری بات، TinyVLA یہاں بالکل بھی تربیت کے قابل نہیں ہے۔
24 GB ٹیر پر ایک رن 0.30 سے 0.60 USD فی گھنٹہ کی شرح سے 2 سے 5 گھنٹے لیتا ہے، تقریباً 1 سے 3 USD۔ A100 ٹیر پر ایک ~3 B پالیسی 1.20 سے 2.00 USD فی گھنٹہ کی شرح سے 3 سے 6 گھنٹے لیتی ہے، تقریباً 4 سے 12 USD۔ قیمتوں کو دیکھیں، اور CLI اور MCP سرور سے وہی آپریشنز۔
جب ایک چھوٹا ماڈل غلط انتخاب ہو
دونوں مقالے خلاصوں کے مقابلے میں یہاں زیادہ محتاط ہیں۔ TinyVLA کی ناکامی کا تجزیہ مخصوص ہے: 0.4 B ویرینٹ نے ہدایت کو غلط پڑھنے کی وجہ سے تین بار ناکامی کا سامنا کیا، جسے مصنفین نے چھوٹے VLM میں محدود لسانی فہم سے منسوب کیا، اور یہ موڈ 1.3 B پر غائب ہو گیا۔ SmolVLA دوسری طرف سے وہی وکر دکھاتا ہے: یکساں فن تعمیر کا 2.25 B ورژن LIBERO پر 88.75 اور Meta-World پر 68.24 اسکور کرتا ہے، جبکہ 0.45 B ماڈل کے لیے یہ 87.3 اور 57.3 ہے۔
- ایک 24 GB کارڈ میں فٹ ہو جاتا ہے، جو ایک تجربے کی لاگت کو دسیوں ڈالر سے چند ڈالر تک کم کر دیتا ہے۔
- بازو کے ساتھ چلنے کے لیے کافی تیز، لہذا کنٹرول لوپ میں کوئی نیٹ ورک ہاپ نہیں۔
- اس ڈیٹا پر فائن ٹیون ہوتا ہے جسے ایک شخص ریکارڈ کر سکتا ہے، ہزاروں کے بجائے دسیوں ایپی سوڈز۔
- SmolVLA کے وزن، ڈیٹا لسٹ اور کوڈ عوامی ہیں، لہذا ایک خراب نتیجہ ڈیبگ کیا جا سکتا ہے۔
- کمزور ہدایات کی پیروی: کم لسانی پیرامیٹرز، مماثل حوالہ جاتی تاثرات کو الگ کرنے کی کم صلاحیت۔
- ایسے سیٹ اپس کے لیے کم مکانی اور بصری عمومیت جنہیں آپ نے ریکارڈ نہیں کیا۔
- ڈیٹا سیٹ کی خامیوں کے لیے زیادہ حساس، جس میں کم پری ٹریننگ ہوتی ہے جس پر انحصار کیا جا سکے۔
- ملٹی ٹاسک اور طویل المدتی کام اب بھی بڑے ماڈلز کو ترجیح دیتا ہے، بشمول SmolVLA کا اپنا 2.25 B ویرینٹ۔
جس موازنے کو چلانا قابل قدر ہے وہ TinyVLA بمقابلہ SmolVLA نہیں ہے۔ یہ SmolVLA بمقابلہ ACT آپ کے اپنے کام پر ہے، اور SmolVLA کا مقالہ اس کی دلیل ہے۔ روبوٹکس پری ٹریننگ کے بغیر سنگل ٹاسک پر تربیت یافتہ، SmolVLA نے تین SO-100 کاموں میں اوسطاً 40.0 اسکور کیا جہاں سنگل ٹاسک ACT نے 48.3 حاصل کیا۔ جو چیز اسے 78.3 تک لے جاتی ہے وہ کمیونٹی پری ٹریننگ اور ملٹی ٹاسک ٹریننگ ہے، نہ کہ صرف فن تعمیر۔ SO-101 لیگو ٹاسک پر، دونوں سنگل ٹاسک، SmolVLA جیتتا ہے: تقسیم میں 70 کے مقابلے میں 90۔ پھر SmolVLA بمقابلہ Pi0.5 اگر بجٹ اجازت دیتا ہے۔
خراب ڈیٹا کو کور کرنے کے لیے کم پری ٹریننگ ہوتی ہے، لہذا ایک خراب ڈیٹا سیٹ پر ایک صاف لاس کرو آپ کو ایک ایسی پالیسی فراہم کرتا ہے جو نقص کو اعتماد کے ساتھ دوبارہ پیدا کرتی ہے۔ lerobot دستاویزات ساخت کے بارے میں واضح ہیں: 5 کیوب پوزیشنز پر 50 ایپی سوڈز، ہر پوزیشن پر 10، کام کیا؛ 25 نے نہیں کیا۔ اگر لاس ٹھیک لگتا ہے اور بازو کچھ مفید نہیں کرتا، تو لاس گرتا ہے، پالیسی کچھ نہیں کرتی، پالیسی صرف ایک سیٹ اپ میں کام کرتی ہے یا VLA ٹریننگ ڈیٹا جمع کرنا جو دراصل قابل استعمال ہو سے شروع کریں۔
پانچ پالیسیاں، ایک موازنہ جدول
GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA اور ACT حقیقی پیرامیٹر گنتی، فی ایکشن سٹیپ انفرنس لیٹنسی، ہر ایک کو درکار GPU ٹیر اور کم از کم ایپی سوڈ گنتی کے ساتھ اس سے پہلے کہ وہ کچھ مفید کرے۔
پالیسیوں کا موازنہ کریںایک فیصلہ کن جدول جس پر آپ عمل کر سکتے ہیں
| آپ کی صورتحال | اس سے شروع کریں | کیوں |
|---|---|---|
| ایک کام، اچھی مظاہرے، کوئی زبان نہیں | ACT | ~80 M, 20 ms, 24 GB کارڈ، ڈاؤن لوڈ کرنے کے لیے کوئی بیس ماڈل نہیں |
| چند متعلقہ کام، ہر ایک کے لیے ایک ہدایت | SmolVLA | 450 M، lerobot میں، کم از کم 30 ایپی سوڈ، فی رن 1 سے 3 USD |
| خاص طور پر TinyVLA کے نتیجے کو دوبارہ پیدا کرنا | TinyVLA-B or TinyVLA-H | ریپو واحد راستہ ہے: الگ تھلگ ماحول، تبدیل شدہ ڈیٹا |
| ملٹی ٹاسک، مختلف ہدایات، A100 بجٹ | GR00T N1.7 or Pi0.5 | ~3 B، فی سٹیپ 152 ms اور 485 ms، فی رن 4 سے 12 USD |
| ابھی تک کوئی روبوٹ نہیں | ایک حقیقی بازو چلائیں | کیو پر مبنی لائیو بازو کو کسی سائن اپ اور ہارڈ ویئر کی ضرورت نہیں |
آخری قطار کے لیے، لائیو آرم ایک فزیکل SO-100 کو سٹریم کرتا ہے جسے آپ براؤزر سے بغیر کسی اکاؤنٹ کے چلا سکتے ہیں، اور شروع کرنے کے تین طریقے باقی کا احاطہ کرتے ہیں۔ SO-100 یہاں ریفرنس آرم ہے، جس کے پرزوں کی قیمت تقریباً 110 سے 150 یورو ہے، ساتھ میں ایک مکمل سیٹ اپ گائیڈ.
سب-1 B ماڈلز کے بعد کیا آتا ہے
پیرامیٹر کی گنتی کو کم کرنا VLA کو سستا بنانے کا ایک طریقہ ہے اور یہ واضح طور پر جیتنے والا طریقہ نہیں ہے۔ OpenVLA-OFT (arXiv 2502.19645) 7 B بیک بون کو برقرار رکھتا ہے اور صرف اس بات کو تبدیل کرتا ہے کہ اعمال کو کیسے ڈی کوڈ کیا جاتا ہے، جس میں ایکشن جنریشن تھرو پٹ میں 26 گنا اضافہ اور LIBERO میں 76.5 سے 97.1 فیصد تک اضافہ رپورٹ کیا گیا ہے۔ BitVLA (arXiv 2506.07530) 1-بٹ BitNet b1.58 2B4T بیک بون کے ہر وزن کو ٹرنری بناتا ہے، جس میں 11.0 گنا کم میموری اور 4.4 گنا کم اینڈ ٹو اینڈ لیٹنسی رپورٹ کی گئی ہے جبکہ یہ مکمل درستگی والے OpenVLA-OFT سے مماثل ہے۔ X-VLA-0.9B (arXiv 2510.10274) فلو میچنگ کے ساتھ 1 B لائن پر موجود ہے۔
مشترکہ نکتہ: ایکشن ڈیکوڈر، نہ کہ لینگویج ماڈل، وہ جگہ ہے جہاں لیٹنسی رہتی ہے۔ یہ پوچھنے سے پہلے کہ کسی پالیسی میں کتنے پیرامیٹرز ہیں، یہ پوچھیں کہ وہ اعمال کیسے خارج کرتی ہے۔ ارینا میں 85 ماڈلز اور 332 نتائج ہیں، ہر ایک اپنے ماخذ سے منسلک ہے؛ ایک وسیع تر جائزہ ہماری VLA تعارف میں ہے۔
کیا میں RTX 4090 پر SmolVLA کو فائن ٹیون کر سکتا ہوں؟▾
جی ہاں۔ SmolVLA 450 M پیرامیٹرز کا ہے اور AY-Robots اسے RTX 4090 / 24 GB ٹیر پر چلاتا ہے۔ lerobot کی مثال --batch_size=64 استعمال کرتی ہے، جو آپ کے کارڈ کے لیے ضمانت کے بجائے ایک مثال ہے؛ دستاویزات چھوٹے سے شروع کرنے اور لوڈنگ کے اوقات مختصر رہنے تک بڑھانے کا مشورہ دیتی ہیں۔ A100 پر 20000 سٹیپس کے لیے دستاویزات میں درج تقریباً 4 گھنٹے سے زیادہ وقت کی توقع رکھیں۔
کیا TinyVLA lerobot یا AY-Robots پر دستیاب ہے؟▾
دونوں کا جواب نفی میں ہے۔ TinyVLA صرف اپنی ریسرچ ریپوزٹری میں موجود ہے، آخری کمٹ 11 مارچ 2025 کو ہوا تھا، اور اس کا فارمیٹ LeRobot کے بجائے ACT-style HDF5 ہے۔ AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA اور ACT کو تربیت دیتا ہے۔ اگر آپ TinyVLA چاہتے ہیں تو آپ اسے خود بنائیں گے، اور آپ کو پہلے scripts/train.sh میں DeepSpeed کنفگ پاتھ کو ٹھیک کرنا ہوگا۔
کیا 450 M ماڈل واقعی 3 B والے ماڈل سے مقابلہ کر سکتا ہے؟▾
مصنفین کے اپنے بینچ مارکس کے مطابق، جی ہاں: LIBERO پر 87.3 بمقابلہ 86.0 ایک روبوٹکس-پری ٹرینڈ Pi0 (3.3 B) کے مقابلے میں، اور تین حقیقی SO-100 ٹاسکس پر 78.3 بمقابلہ 61.7 جہاں اسی پیپر میں Pi0 کو 3.5 B پر لیبل کیا گیا ہے۔ حد اسی پیپر میں ہے: روبوٹکس پری ٹریننگ کے بغیر سنگل ٹاسک پر، SmolVLA 40.0 پر گر جاتا ہے، جو ACT کے 48.3 سے کم ہے۔
ایک چھوٹے VLA کے کچھ کرنے سے پہلے مجھے کتنے ایپی سوڈز کی ضرورت ہے؟▾
AY-Robots SmolVLA کے لیے کم از کم 30 ایپی سوڈز اور ACT کے لیے کم از کم 50 ایپی سوڈز مقرر کرتا ہے۔ lerobot کی دستاویزات تقریباً 50 کی سفارش کرتی ہیں اور رپورٹ کرتی ہیں کہ اسی کام کے لیے 25 کافی نہیں تھے۔ ساخت بھی تعداد جتنی ہی اہم ہے: پیپر کے سیٹ میں 5 کیوب پوزیشنز استعمال کی گئیں جن میں ہر ایک کے 10 ایپی سوڈز تھے۔
شائع شدہ لیٹنسی نمبرز اتنے مختلف کیوں ہوتے ہیں؟▾
وہ مختلف چیزوں کی پیمائش کرتے ہیں۔ TinyVLA A6000 پر فی ایکشن پیش گوئی 14 ms رپورٹ کرتا ہے؛ AY-Robots SmolVLA کو 245 ms اور ACT کو 20 ms فی ایکشن سٹیپ پر درج کرتا ہے۔ کچھ اعداد و شمار ایک فارورڈ پاس کا احاطہ کرتے ہیں، کچھ 50-ایکشن چنک میں ایک پاس کو تقسیم کرتے ہیں، اور تقریباً کوئی بھی کیمرہ کیپچر یا سرووز کو لکھنے کو شامل نہیں کرتا۔
کیا کلاؤڈ انفرنس GPU کے مسئلے کو حل کرتا ہے؟▾
جزوی طور پر۔ AY-Robots خود بخود ایک پوڈ فراہم کرتا ہے جو پالیسی کو سروس دیتا ہے جبکہ مقامی کلائنٹ اس اینڈ پوائنٹ سے بات کرتا ہے، ایک آئیڈل واچ ڈاگ کے ساتھ تاکہ یہ خاموشی سے بلنگ کرنے کے بجائے خود کو تباہ کر دے۔ یہ پبلک انٹرنیٹ راؤنڈ ٹرپ کو ختم نہیں کر سکتا، اور کنٹرول لوپ پہلے ہی 20 سے 485 ms فی ایکشن سٹیپ ہے۔ سست پک اینڈ پلیس کے لیے ٹھیک ہے، تیز ری ایکٹو حرکت کے لیے نہیں۔
Sources
- TinyVLA: روبوٹک مینیپولیشن کے لیے تیز، ڈیٹا-موثر ویژن-لینگویج-ایکشن ماڈلز کی طرف
- TinyVLA آفیشل کوڈ ریپوزٹری (README, requirements.txt, scripts/train.sh)
- TinyVLA پروجیکٹ پیج
- lesjie/Llava-Pythia-1.3B، TinyVLA-H بیک بون ویٹس
- SmolVLA: سستی اور موثر روبوٹکس کے لیے ایک ویژن-لینگویج-ایکشن ماڈل
- lerobot دستاویزات: SmolVLA کی فائن ٹیوننگ
- lerobot: configuration_smolvla.py، SmolVLA کی ڈیفالٹس
- lerobot/smolvla_base ماڈل کارڈ
- SmolVLA: موثر ویژن-لینگویج-ایکشن ماڈل (Hugging Face بلاگ)
- PyPI پر lerobot (0.6.1، Python 3.12 یا اس سے نیا درکار ہے)
- OpenVLA: ایک اوپن سورس ویژن-لینگویج-ایکشن ماڈل
- ویژن-لینگویج-ایکشن ماڈلز کی فائن ٹیوننگ: رفتار اور کامیابی کو بہتر بنانا (OpenVLA-OFT)
- BitVLA: روبوٹکس مینیپولیشن کے لیے 1-بٹ ویژن-لینگویج-ایکشن ماڈلز
- X-VLA: اسکیل ایبل کراس-ایمباڈیمنٹ ویژن-لینگویج-ایکشن ماڈل کے طور پر سافٹ-پرامپٹڈ ٹرانسفارمر
- rail-berkeley/octo-small-1.5 ماڈل کارڈ (27 M پیرامیٹرز)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started