
TinyVLA እና SmolVLA የሚሰራ VLA ከ1 ቢሊዮን መለኪያዎች በታች አስቀምጠዋል። ከሁለቱም ወረቀቶች የተገኙ ትክክለኛ ቁጥሮች፣ የ lerobot ነባሪዎች፣ የተለካ መዘግየት እና አንድ ሩጫ በ24 ጊባ ካርድ ላይ ምን ያህል እንደሚያስወጣ።
ሁሉም ማለት ይቻላል የእይታ-ቋንቋ-ድርጊት ሞዴል ስለሚጻፍ የዳታ ማዕከል ካርድን ይገምታል። OpenVLA 7 ቢሊዮን ፓራሜትሮች አሉት። GR00T N1.7 እና Pi0.5 ወደ 3 ቢሊዮን የሚጠጉ ሲሆኑ ለማስተካከል A100 80 ጊባ ይፈልጋሉ። በዴስክዎ ላይ ያለው ካርድ 4090 ከሆነ፣ ያ የሞዴል ክፍል ሊደረስበት አይችልም።
ሁለት ወረቀቶች እንደማያስፈልግ ይከራከራሉ። TinyVLA (arXiv 2409.12514፣ በየካቲት 2025 በ IEEE Robotics and Automation Letters ተቀባይነት ያገኘ) ከ400 ሚሊዮን እስከ 1.3 ቢሊዮን የጀርባ አጥንት እና የዲፍዩዥን ድርጊት ራስ በመጠቀም VLA ይገነባል። SmolVLA (arXiv 2506.01844፣ ሰኔ 2 ቀን 2025 የቀረበ) 450 ሚሊዮን ፓራሜትሮችን በክፍት ክብደቶች፣ ክፍት ዳታ እና በአንድ የሸማች ካርድ ላይ የሚሰራ ስክሪፕት ይዞ ይመጣል። ሁለቱም የለኩት እና ከ1 ቢሊዮን በታች ያለው ክርክር መቆሙ እዚህ አለ።
ማወቅ ያለብዎት ነገር
- •TinyVLA ሶስት መጠኖች አሉት፡ 422 ሚሊዮን ጠቅላላ ከ101 ሚሊዮን ጋር ሊሰለጥን የሚችል፣ 740 ሚሊዮን ከ138 ሚሊዮን ጋር፣ 1.3 ቢሊዮን ከ143 ሚሊዮን ጋር። የመጀመሪያዎቹ ሁለቱ ብቻ ከ1 ቢሊዮን በታች ናቸው።
- •የእሱ ሰንጠረዥ IV ለአንድ A6000 በTinyVLA-1B ላይ ለእያንዳንዱ የድርጊት ትንበያ 14 ሚሊሰከንዶች ይለካል፣ ከOpenVLA-7B 292 ሚሊሰከንዶች እና ለተቀነሰ OpenVLA-1B 140 ሚሊሰከንዶች ጋር ሲነጻጸር።
- •ፍጥነቱን የሚይዘው ራስ እንጂ የጀርባ አጥንት አይደለም፡ የTinyVLA-Hን የዲፍዩዥን ራስ በACT ራስ ይቀይሩት እና አምስቱ እውነተኛ-ሮቦት ተግባራት ከ94.0 አማካይ ወደ ነጠላ አሃዞች ይወርዳሉ። የMLP ራስ በሁሉም ቦታ 0 ያስመዘግባል።
- •SmolVLA 450 ሚሊዮን ነው፣ ከዚህ ውስጥ በግምት 100 ሚሊዮን የድርጊት ኤክስፐርት ሲሆን፣ በ481 የህብረተሰብ LeRobot ዳታ ስብስቦች እና 10.6 ሚሊዮን ፍሬሞች ላይ አስቀድሞ የሰለጠነ ነው። በLIBERO ላይ 87.3 ሪፖርት ያደርጋል፣ ከሮቦቲክስ-አስቀድሞ የሰለጠነ Pi0 በ3.3 ቢሊዮን 86.0 ጋር ሲነጻጸር፣ እና በሶስት እውነተኛ SO-100 ተግባራት ላይ 78.3 ሪፖርት ያደርጋል፣ ከPi0 በ3.5 ቢሊዮን 61.7 ጋር ሲነጻጸር።
- •ያለዚያ ቅድመ-ስልጠና በአንድ ተግባር የሰለጠነ፣ SmolVLA በእነዚያ ተግባራት ላይ ወደ 40.0 ይወርዳል፣ ከACT 48.3 በታች። ትንሽ ማለት በራስ-ሰር ቀላል ማለት አይደለም።
- •TinyVLA የLeRobot ውህደት የለውም እና CUDA 11.7 wheel stackን ይደግፋል። SmolVLA በlerobot ውስጥ ነው እና እዚህ በ24 ጊባ ደረጃ ላይ ለእያንዳንዱ ሩጫ በግምት ከ1 እስከ 3 ዶላር ያስከፍላል።
በእርግጥ እንደ ትንሽ VLA የሚቆጠረው ምንድን ነው
በሞዴል ካርድ ላይ ያለው የፓራሜትር ብዛት አንድ ቁጥር አይደለም። አጠቃላይ ክብደቶችን፣ በግምት ወቅት የተጫኑ ክብደቶችን፣ ወይም በጊዜ ውስጥ ግራዲየንቶችን የሚቀበሉ ክብደቶችን ሊያመለክት ይችላል። ። TinyVLA ሁለቱንም ሪፖርት ያደርጋል፣ እና ልዩነቱ ትልቅ ነው፡ TinyVLA-H በጠቅላላው 1.3 B ነው ነገር ግን 143 M ሊሰለጥን የሚችል ነው፣ ምክንያቱም የቪዥን ታወር እና አብዛኛው የቋንቋ ሞዴል ሳይቀዘቅዙ ሲቀሩ LoRA አስማሚዎች እና የአክሽን ሄድ ይንቀሳቀሳሉ። ወረቀቱ ሊሰለጥን የሚችለውን ድርሻ ወደ 5 በመቶ ገደማ ያስቀምጣል።
| ሞዴል | ፓራሜትሮች | ባክቦን | የድርጊት ራስ | ምንጭ |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | ፍሰት ማዛመጃ ኤክስፐርት | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | ቀጥተኛ የቁራጭ ሪግሬሽን | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | ራስ-ሪግሬሲቭ የድርጊት ቶከኖች | arXiv 2406.09246 |
ሁለት ረድፎች ክርክር የሚያስፈልጋቸው ናቸው። በግምት 80 M ሲሆን ከሌሎቹ ሁሉ ያነሰ ነው ነገር ግን የቋንቋ ሞዴል የለውም፣ ስለዚህ VLA አይደለም፡ አንድ ተግባር ይማራል እና ሌላ እንዲሰራ ሊነገረው አይችልም። በ27 M በT5-Base ጽሑፍ ኢንኮደር በኩል የተስተካከለ ነው፣ እንጂ LLM ባክቦን አይደለም። ጥሩ የመነሻ መስመሮች ናቸው፣ ነገር ግን የሌብሉን ትርጉም የሚከተል መመሪያ አይሰጡም።
TinyVLA-H፣ ዋና ዋና ውጤቶችን የያዘው ልዩነት፣ 1.3 B ሲሆን ከመስመሩ በላይ ነው። የተሻለው ጥያቄ አንድ ሞዴል በስልጠና ወቅት በ24 GB ውስጥ መግባት ይችል እንደሆነ እና በግምት ወቅት የቁጥጥር ፍጥነትዎን ማሳካት ይችል እንደሆነ ነው። እዚህ ማሰልጠን የሚችሏቸው አምስቱ ፖሊሲዎች በፖሊሲዎች ገጽ ላይ ይገኛሉ፤ ቁጥሮቹን ከሌሎች ጋር ማወዳደር ከፈለጉ TinyVLA የአሬና ግቤት አለው።
TinyVLA: ፍጥነቱ የሚመጣው ከጭንቅላቱ ነው እንጂ ከአከርካሪው አይደለም
ግልጽ የሆነው ግንዛቤ የቋንቋ ሞዴሉን በማሳነስ ፈጣን እንዲሆን ማድረጋቸው ነው። የጥናቱ የአብሌሽን ትንተና ግን ሌላ ያሳያል። የOpenVLAን 7 B አከርካሪ በግምት 1 B በሆነው መተካት በአንድ ድርጊት ትንበያ ጊዜውን ከ292 ms ወደ 140 ms ቀንሶታል፣ ይህም የ2x ጭማሪ ነው። TinyVLA-H፣ በተመጣጣኝ የፓራሜትር ብዛት፣ በተመሳሳይ ካርድ ላይ በ14 ms ይሰራል። ሌላው 10x ደግሞ የአክሽን ሄዱ ነው።
| ሞዴል | በአንድ ድርጊት ትንበያ | የተለካበት |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B፣ አከርካሪው በTinyVLA ተተክቶ | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA ድርጊቶችን እንደ ተከፋፈሉ ቶከኖች በቋንቋ ሞዴል ሄድ በኩል፣ በአንድ ድርጊት ልኬት አንድ፣ በራስ-ሰር ያመነጫል። TinyVLA ሙሉውን ክፍል በአንድ ጊዜ የሚያመነጭ የዲፍዩዥን ዲኮደር ያያይዛል። ሠንጠረዥ V የTinyVLA-H አርክቴክቸርን ይዟል እና ሄዱን ብቻ በተመሳሳይ አምስት እውነተኛ-ሮቦት ተግባራት ላይ ይለዋውጣል። ይህ በማንኛውም ጥናት ውስጥ ለሚከተለው ክርክር እጅግ በጣም ግልጽ ማስረጃ ነው ፍሎው ማቺንግ ፖሊሲዎች የሚያደርጉት፣ እና ምክንያቱ ደግሞ Pi0 ከቶከን ዲኮዲንግ የራቀበት።
| በTinyVLA-H ላይ ያለው ራስ | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Diffusion (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Action Chunking Transformer | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Multi-layer perceptron | 0 | 0 | 0 | 0 | 0 |
የ292 / 140 / 14 ሚሴ አሃዞች ሰንጠረዥ IV ላይ ያሉ ሲሆን ሁሉም በአንድ A6000 ላይ የተገኙ ናቸው። እነዚህ በአንድ ድርጊት ትንበያ ላይ የተመሰረቱ ሲሆኑ የካሜራ ቀረጻን፣ ቅድመ-ሂደትን እና ወደ ሰርቮስ የሚደረገውን ተከታታይ ጽሁፍ አያካትቱም። የታተመውን መዘግየት እንደ ዝቅተኛ ገደብ ይቁጠሩት፣ በፍጹም እንደ መቆጣጠሪያ ፍጥነት አይደለም። የእኛ ቁጥሮች ተመሳሳይ ገደብ አላቸው፡ የመረጃ መዘግየትን ይመልከቱ።
TinyVLA ምን ውጤት አስመዘገበ
| ቤንችማርክ | ፕሮቶኮል | TinyVLA-H | መሰረታዊ መስመሮች |
|---|---|---|---|
| MetaWorld, 50 tasks, sim | ባለብዙ ተግባር፣ 50 ማሳያዎች፣ 3 ዘሮች | 77.6 / 21.5 / 11.4 / 15.8 እንደ አስቸጋሪነቱ፣ አማካይ 31.6 | Diffusion Policy average 10.5 |
| Real Franka Panda, 5 tasks | በእያንዳንዱ ተግባር 100 አቅጣጫዎች፣ 20 ሙከራዎች | 94.0 አማካይ | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanual UR5, 3 tasks | ባለብዙ ተግባር፣ በእያንዳንዱ ተግባር 10 ሙከራዎች | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
ባይማኑዋል ረድፉ ወረቀቱ ራሱ የሚሰጠው አሰልቺ ማብራሪያ አለው፡ OpenVLA ሙሉ በሙሉ ነጠላ-እጅ ዳታ ባካተተው Open X-Embodiment ላይ የሰለጠነ ነው፣ ስለዚህ ባለሁለት-እጅ የድርጊት ቦታ ከስርጭት ውጪ ነው እና ዜሮ ያስመዘግባል። የዲፍዩዥን ፖሊሲ ቤዝላይን ከእነዚያ ሶስት ተግባራት ውስጥ በሁለቱ ላይ TinyVLA-Hን ያሸንፋል። ተጨማሪ መረጃ በየ Open X-Embodiment ጽሑፍ.

የ TinyVLA ሪፖ፣ ከኦገስት 2026 ጀምሮ
ወረቀቱ ጥሩ ነው። ኮዱ ለምርምር የተለቀቀ ነው። ሪፖዚቶሪው github.com/liyaxuanliyaxuan/TinyVLA ነው፤ የ README ፋይሉ የኮዱን መለቀቅ የካቲት 17 ቀን 2025 እና የመጨረሻውን ኮሚት መጋቢት 11 ቀን 2025 ያሳያል። አንድን ወረቀት ለማባዛት ጥሩ ነው፣ ነገር ግን የተጠበቀ ላይብረሪ ከፈለጉ ችግር ነው።
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt `torch==2.0.1`፣ `transformers==4.37.1`፣ `deepspeed==0.9.5`፣ `peft==0.4.0`፣ `diffusers==0.11.1`፣ `numpy==1.24.4`፣ እና የCUDA ስታክን ወደ 11.x ዊልስ ያያይዛል፡ `nvidia-cuda-runtime-cu11==11.7.99`፣ `nvidia-cudnn-cu11==8.5.0.96`፣ `triton==2.0.0`። READMEው Python 3.10ን ይጠይቃል፤ lerobot 0.6.1 ደግሞ 3.12 ወይም ከዚያ በላይ ያስፈልገዋል፣ ስለዚህ ሁለቱ አንድ አካባቢ መጋራት አይችሉም። በመጀመሪያ ለጂፒዩ ትውልድዎ የtorch 2.0.1 ግንባታ መኖሩን ያረጋግጡ። ይልቁንም አንድ ሩጫ በVRAM ምክንያት ከቆመ፣ የማስታወሻ እጥረት መፈተሻ ዝርዝር ከመገመት ይልቅ ፈጣን ነው።
TinyVLA ደግሞ አያነብም LeRobot ዳታ ስብስቦችን. ቅርጸቱ ACT-style HDF5 ነው፡ action, language_raw, እና multi-view images, joint_positions, qpos እና qvel የያዘ observations group። ሪፖው ለRLDS ግብዓት data_utils/rlds_to_h5py.pyን ያቀርባል፣ እና እያንዳንዱ ተግባር በaloha_scripts/constants.py ውስጥ በdataset_dir, episode_len እና camera_names በእጅ ይመዘገባል። የእርስዎ ክፍሎች ከlerobot ወይም ከ ዴስክቶፕ ደንበኛ የመጡ ከሆነ፣ ልወጣው የእርስዎ ኃላፊነት ነው።
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 ስምንት ካርድ ያለው ኖድ እንደሆነ ይገምታል። ወደ 1 ያቀናብሩት እና የባች መጠኑን ከ 32 በታች ዝቅ ያድርጉት። ምንም ነጠላ-ጂፒዩ ልዩነት ወደ ላይ አይላክም፣ ስለዚህ ትዕዛዙ በ 4090 ላይ በትክክል ሊሰራ አይችልም።
- --deepspeed scripts/zero2.json ከከፍተኛ ደረጃ ስክሪፕቶች ማውጫ ውጭ ወዳለ ፋይል ይጠቁማል። የDeepSpeed ውቅሮች በ llava-pythia/scripts/zero2.json ላይ ይገኛሉ። ከመጀመሪያው አሂድዎ በፊት መንገዱን ያስተካክሉ።
- README የውጤት ማውጫው ስም llava_pythia እንዲይዝ ይጠይቃል፣ በተጨማሪም LoRA ከነቃ lora።
- የጀርባ አጥንቱ የተለየ ማውረድ ነው: lesjie/Llava-Pythia-400M, -700M ወይም -1.3B. lerobot/smolvla_base ላይ እንደሚያመለክቱት ፖሊሲን የሚያመለክቱበት አንድ ነጠላ የመሠረት ቼክፖይንት የለም።
SmolVLA: ከ 1 ቢ በታች የሆነው ሞዴል ዛሬ ከሰዓት በኋላ ሊያሄዱት የሚችሉት
SmolVLA በተጠበቀ ቤተ-መጽሐፍት ውስጥ ተመሳሳይ ክርክር ያቀርባል። በ SmolVLM2-500M-Video-Instruct የጀርባ አጥንት ላይ 450 M መለኪያዎች አሉት፣ እና ቅልጥፍናው የሚመጣው ከ configuration_smolvla.py ሊያነቧቸው ከሚችሏቸው ቅንብሮች ነው እንጂ ትንሽ ስለመሆኑ ከሚቀርብ የይገባኛል ጥያቄ አይደለም።
| Setting in configuration_smolvla.py | ነባሪ | የሚያስገኘው ጥቅም |
|---|---|---|
| num_vlm_layers | 16 | የመጀመሪያዎቹ 16 የቋንቋ ሞዴል ንብርብሮች ብቻ ይሰራሉ |
| expert_width_multiplier | 0.75 | የድርጊት ኤክስፐርት የተደበቀ መጠን ከVLM 75 በመቶ ነው |
| self_attn_every_n_layers | 2 | ራስን ትኩረት መስጠት ከሌሎች ትኩረት ጋር የተጠላለፈ |
| chunk_size / n_action_steps | 50 / 50 | አንድ ማለፊያ 50 ድርጊቶችን ያመነጫል እና ሁሉም 50 ይፈጸማሉ |
| num_steps | 10 | የፍሰት ማዛመጃ ዲኖይዚንግ በ 10 ደረጃዎች ተስተካክሏል |
| tokenizer_max_length | 48 | መመሪያው ወደ 48 ቶከኖች ተቆርጧል |
| freeze_vision_encoder / train_expert_only | True / True | ጥሩ ማስተካከያ ኤክስፐርቱን ያንቀሳቅሳል እንጂ የራዕይ ማማውን አይደለም |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | የወረቀቱ የምግብ አሰራር አይደለም: ቅድመ-ስልጠናው በ 200000 ደረጃዎች ላይ 100-ደረጃ ማሞቂያ ተጠቅሟል |
ቅድመ-ስልጠናው 481 የማህበረሰብ LeRobot ዳታሴቶችን፣ 22.9 ሺህ ክፍሎችን እና 10.6 ሚሊዮን ፍሬሞችን በ4 ጂፒዩዎች ላይ፣ በ256 ዓለም አቀፍ ባች 200000 እርምጃዎችን ተጠቅሟል፤ ጥናቱ አጠቃላይ ፕሮጀክቱን ወደ 30 ሺህ ጂፒዩ ሰዓታት ገምቷል። ትኩረት ሊሰጠው የሚገባ አንድ ቁጥር: የHugging Face ማስጀመሪያ ብሎግ 487 የተመረጡ ዳታሴቶችን ሲል፣ የጥናቱ ሰንጠረዥ ግን 481 ይላል። እኛ የጥናቱን ቁጥር እንጠቀማለን እና ልዩነቱን እናሳውቃለን።
| ቤንችማርክ | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO አማካይ፣ ባለብዙ-ተግባር | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World አማካይ፣ ባለብዙ-ተግባር | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| እውነተኛ SO-100፣ 3 ተግባራት፣ ባለብዙ-ተግባር ስልጠና | 78.3 | - | 61.7 (3.5 B) | - |
| እውነተኛ SO-100፣ 3 ተግባራት፣ ነጠላ-ተግባር፣ ያለ ሮቦቲክስ ቅድመ-ስልጠና | 40.0 | - | - | 48.3 |
| SO-101 ሌጎ ማንሳት-ማስቀመጥ፣ ነጠላ-ተግባር፣ በስርጭት ውስጥ | 90 | - | - | 70 |
| SO-101 ሌጎ ማንሳት-ማስቀመጥ፣ ነጠላ-ተግባር፣ ከስርጭት ውጪ | 50 | - | - | 40 |
LIBERO ሲሙሌሽን ነው እና አሁን እዚያ ሁሉም ብቃት ያላቸው ውጤቶች በሰማንያዎቹ ውስጥ ናቸው። እውነተኛው የSO-100 ረድፍ፣ የ450 ሚሊዮን ሞዴል የ3.5 ቢሊዮን ሞዴልን በ16.6 ነጥብ የሚያሸንፍበት፣ አስደሳች ነው። ከሱ በታች ያለው ረድፍ ደግሞ ተቃራኒውን ያሳያል። የማህበረሰብ ቅድመ-ስልጠናውን እና ባለብዙ-ተግባር ስልጠናውን ሲያስወግዱ እና ያው ሞዴል ከACT በታች ወደ 40.0 ይወርዳል። ሊከላከል የሚችለው ክርክር ትንሽ ሞዴል በራስ-ሰር የከፋ አይደለም እንጂ የተሻለ ነው ማለት አይደለም።
አንድ አጋጣሚ ይረዳል፡ የSmolVLA ወረቀት ሜታ-ወርልድ ሰንጠረዥ የTinyVLA የራሱን የታተሙ ቁጥሮች እንደ መሰረት ይዟል፣ ስለዚህ ለመጀመሪያ ጊዜ ሁለቱም ሞዴሎች በአንድ ሰንጠረዥ ውስጥ ተቀምጠዋል፣ SmolVLA-0.45B በ57.3 ከTinyVLA-H በ31.6 ጋር። እንዲሁም SmolVLA ከPi0 በ6 እጥፍ ያነሰ ማህደረ ትውስታ ላይ በግምት 40 በመቶ በፍጥነት እንደሚሰለጥን ሪፖርት ያደርጋል። ይህ ሁሉ ከSmolVLA ደራሲዎች የመጣ ነው፤ የአሬና ግቤት እያንዳንዱን እሴት ወደ ምንጩ ያገናኛል።
SmolVLA ጊዜውን የሚያጠፋው የት ነው
AY-Robots SmolVLAን በአንድ የድርጊት እርምጃ 245 ms እና ACT በ20 ms በየፖሊሲ ካታሎግ ውስጥ ይዘረዝራል። TinyVLA በአንድ የድርጊት ትንበያ 14 ms ሪፖርት ያደርጋል። እነዚህ ቁጥሮች ሊነፃፀሩ አይችሉም፣ እና እንደነበሩ አድርጎ መውሰድ በዚህ ርዕስ ውስጥ በጣም የተለመደው ስህተት ነው፡ አንዳንዶች አንድ የፊት ማለፊያ ጊዜ ይወስዳሉ፣ አንዳንዶች ደግሞ ያንን ማለፊያ በአንድ ክፍል ላይ ይከፋፍሉታል አንዴ የድርጊት ክፍፍል ሲከፋፈለው።
- SmolVLA በአንድ የፊት ማለፊያ 50 ድርጊቶችን ያመነጫል እና ሁሉንም 50 ያከናውናል። ወረቀቱ በእውነተኛ ሮቦቶች ላይ በሚጠቀምበት 30 fps፣ አንድ ግምት ወደ 1.7 ሰከንድ የሚሆን እንቅስቃሴን ይሸፍናል።
- አሲንክሮነስ ግምት የአሁኑ እየተፈጸመ እያለ ቀጣዩን ክፍል ያሰላል፡ 9.7 ሰ አማካይ የተግባር ማጠናቀቂያ ከ13.75 ሰ ሲንክሮነስ ጋር ሲነፃፀር፣ በግምት 30 በመቶ ፈጣን ነው፣ እና በቋሚ 60 ሰከንድ መስኮት ውስጥ 19 የመምረጥ እና የማስቀመጥ ዑደቶች ከ9 ጋር ሲነፃፀሩ።
- የስኬት መጠኖች የተሻሉ ከመሆን ይልቅ ተመጣጣኝ ነበሩ፣ 78.3 ሲንክሮነስ ከ73.3 አሲንክሮነስ ጋር። አሲንክሮነስ ፍጥነትን እንጂ ትክክለኛነትን አይገዛም።
- የድርጊት ክፍፍል የሂሳብ መዘግየትን እንጂ የአውታረ መረብ መዘግየትን አይሰውርም፣ እና ፖሊሲው ለ50 ድርጊቶች ቁርጠኛ ስለሆነ ምላሽ የመስጠት አቅሙን ይቀንሳል።
AY-Robots የእርስዎን ፖሊሲ የሚያገለግል የክላውድ ጂፒዩ ፖድ በራስ-ሰር ማቅረብ ይችላል፣ የአካባቢው ሮቦት ደንበኛ ከዚያ የመጨረሻ ነጥብ ጋር ሲነጋገር፣ እና ፖዱ በዝምታ ከማስከፈል ይልቅ ራሱን የሚያጠፋ ስራ ፈት የጥበቃ ሰዓት ይይዛል። የማያደርገው ነገር የህዝብ-ኢንተርኔት ዙር ጉዞን ማስወገድ ነው። እዚህ ያሉት አምስቱ ፖሊሲዎች ላይ ያለው የቁጥጥር ዑደት ምንም አይነት ኔትወርክ ከመኖሩ በፊት በአንድ የድርጊት ደረጃ ከ20 እስከ 485 ms ነው፣ ስለዚህ የርቀት ግምት ለቀርፋፋ ማንሳት እና ማስቀመጥ የሚቻል እንጂ ለፈጣን ምላሽ ሰጪ እንቅስቃሴ አይደለም።

SmolVLAን በአንድ የሸማች ካርድ ላይ ማስተካከል
በ lerobot 0.6.1 ላይ ያለው በእጅ የሚሰራው መንገድ፣ በ23 ኦገስት 2026 ያለው የአሁኑ የPyPI ልቀት። ከዚህ በታች ያለው ሁሉ የመጣው ከHugging Face lerobot SmolVLA ሰነድ ነው፣ በተመሳሳይ ቀን የተገኘ፤ የተመራው ስሪት የበለጠ ቀላል ነው።
- 1ለሮቦትን በsmolvla ተጨማሪ ይጫኑ
የSmolVLA ጥገኞች አማራጭ ተጨማሪ ናቸው፣ የመሰረታዊ ጭነት አካል አይደሉም። ያለሱ መጫን እና ከዚያ የፖሊሲው አይነት የማይታወቅ መሆኑን ማሰብ በተለምዶ የሚባክን ግማሽ ሰዓት ነው።
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2በቂ ክፍሎች ያለው የመረጃ ስብስብ ያግኙ
ሰነዶቹ ወደ 50 የሚጠጉ ክፍሎችን ይመክራሉ እና ተመሳሳይ ስራ በ25 ክፍሎች በቂ እንዳልነበረ ይገልጻሉ። AY-Robots ዝቅተኛውን በ30 ያደርገዋል። የራስዎን ይመዝግቡ፣ ወይም ከመረጃ ስብስብ ማውጫው ይጀምሩ።
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3ጥሩ ማስተካከያውን ይጀምሩ
ከለሮቦት መመሪያ የተወሰደ ትዕዛዝ፣ ያልተቀየረ። ሰነዶቹ 20000 እርምጃዎች በአንድ A100 ላይ በግምት 4 ሰዓታት እንደሚወስዱ ይገልጻሉ። በ24 ጂቢ ካርድ ላይ፣ ረዘም ያለ ጊዜ ይጠብቁ እና ይለኩት።
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4እስኪገጥም ድረስ የባች መጠኑን ይቀንሱ
batch_size=64 በሰነድ የተደገፈ ምሳሌ ነው፣ ስለ ካርድዎ የተሰጠ ቃል አይደለም። ሰነዶቹ የመጫኛ ጊዜዎች አጭር እስከሆኑ ድረስ በትንሹ እንዲጀምሩ እና እንዲጨምሩ ይመክራሉ።
bashlerobot-train --help - 5የፍተሻ ነጥቡን በክንዱ ላይ ያውጡ
ተመሳሳይ ቤተ-መጽሐፍት፣ አንድ ትዕዛዝ። የእውነተኛ ጊዜ ቸንኪንግ ባንዲራዎች በሰነዶቹ ውስጥ አስተያየት ተሰጥቶባቸዋል እና ዝቅተኛ ኃይል ባላቸው ሃርድዌሮች ላይ የሚያስፈልጉት ናቸው።
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
የቱንም መንገድ ቢከተሉ፣ የፍተሻ ነጥብ እና ያንን ያመረተውን ውቅር ያገኛሉ። የመረጃ ስብስብ ክለሳውን፣ የእርምጃ ቆጠራውን እና ዘሩን ከጎኑ ያስቀምጡ። ለሮቦት በነባሪ ወደ ዘር 1000 ያቀናጃል፤ የGR00T ጥሩ ማስተካከያ መግቢያ ነጥብ ምንም ዘር አያሳይም፣ ስለዚህ እነዚያ ሩጫዎች ቢት-ለ-ቢት ሊባዙ አይችሉም። አሰራሩ በስልጠና ሰነዶች ውስጥ።
አንድ ትንሽ VLA ወደ ክንድ ለማስገባት ሁለት መንገዶች
ማሽኑን እና የውድቀት ሁነታዎችን እርስዎ ይቆጣጠራሉ። ለSmolVLA ይህ ምክንያታዊ ነው፡ አንድ የፒፕ ተጨማሪ፣ አንድ የባቡር ትዕዛዝ፣ አንድ የሮልአውት ትዕዛዝ። ለTinyVLA ግን የቀዘቀዙ ፒኖች፣ የተበላሸ የDeepSpeed መንገድ እና እርስዎ እራስዎ የሚጽፉት የመረጃ ልወጣ ያለው የምርምር ማባዛት ነው።
- 24 ጂቢ ካርድ ያግኙ፣ ከ30 እስከ 50 ክፍሎችን ይመዝግቡ፣ የካሜራ ዥረቶችን ፍሬም በፍሬም ያረጋግጡ።
- pip install -e ".[smolvla]"፣ lerobot-train ከ lerobot/smolvla_base ጋር፣ ከዚያም የፍተሻ ነጥቡን ክንዱ በተሰካበት ማሽን ላይ ያቅርቡ።
- ለTinyVLA፡ የተለየ ኮንዳ አካባቢ፣ መረጃን ወደ HDF5 ቀይር፣ ስራውን በconstants.py ውስጥ አስመዝግብ፣ የzero2.json መንገዱን አስተካክል፣ train.shን ከስምንት ጂፒዩዎች ወደ አንድ ቅንስ።
- ካርዱ ከተከፈለ በኋላ በሰዓት ክፍያ የለም።
- መደምደሚያው ከሰርቮዎቹ አጠገብ ነው፣ ፈጣን የቁጥጥር ዑደት ለማግኘት ብቸኛው መንገድ።
- የፖሊሲውን ኮድ ማስተካከል ይችላሉ፣ እና TinyVLA በዚህ መንገድ ብቻ ይገኛል።
- አንድ 4090 እያንዳንዱን ~3 ቢ ፖሊሲ ያስወግዳል፣ ስለዚህ ከGR00T N1.7 ወይም Pi0.5 ጋር የአካባቢ ንጽጽር የለም።
- የአካባቢ ማዋቀር እውነተኛው ስራ ነው። የTinyVLA ፒኖች ብቻ አንድ ቀን ሊያስወጡ ይችላሉ።
- ምንም ወረፋ የለም፣ ምንም ዳግም ሙከራ የለም፣ ምንም የፍተሻ ነጥብ ማከማቻ የለም። በእርምጃ 14000 ላይ ዳግም ማስነሳት እንደገና መጀመር ማለት ነው።
SmolVLA እዚህ ካሉት አምስት ፖሊሲዎች አንዱ ነው። ሞዴል እና የመረጃ ስብስብ በቅጽ ይመርጣሉ፣ የኋላ ስርዓቱ በሚያስፈልገው VRAM መሰረት ጂፒዩ ይከራያል፣ አሰልጣኙን ያካሂዳል እና የፍተሻ ነጥቦችን ወደ ዕቃ ማከማቻ ይጽፋል። ደረጃ በደረጃ፡ SmolVLA በSO-100 ላይ፣ ወይም ሙሉው ማትሪክስ በስልጠና ገጹ ላይ።
| መድረኩ ለSmolVLA የሚልከው | ዋጋ |
|---|---|
| የባች መጠን | 2 |
| የመማሪያ መጠን | 1e-4 |
| ከፍተኛ እርምጃዎች | 20000 |
| የግራዲየንት ክምችት | 8, እና አሰልጣኙ ጋር አይደርስም |
| በቅጹ ውስጥ ያሉ ተጨማሪ መቆጣጠሪያዎች | seed, logFreq |
| የጂፒዩ ደረጃ | RTX 4090 or any 24 GB card |
| የመረጃ ስብስብ ቅርጸት | LeRobot v3.0 |
| ዝቅተኛ ክፍሎች | 30 |
በመጀመሪያ፣ እዚህ ያለው ነባሪ የባች መጠን 2 ነው፣ በለሮቦት ሰነድ ምሳሌ ውስጥ ያለው 64 አይደለም፣ እና የግራዲየንት ክምችት ቅንብር ይላካል ነገር ግን ለSmolVLA ምንም ውጤት የለውም፣ ስለዚህ ውጤታማው ባች በእርግጥ 2 ነው። ነባሪው ከዋናው ጋር ይዛመዳል ብለው ከማሰብ ይልቅ ሆን ብለው ከፍ ያድርጉት። በሁለተኛ ደረጃ፣ TinyVLA እዚህ በጭራሽ ማሰልጠን አይቻልም።
በ24 ጂቢ ደረጃ ላይ ያለ ሩጫ በሰዓት ከ0.30 እስከ 0.60 ዶላር፣ በግምት ከ1 እስከ 3 ዶላር፣ ከ2 እስከ 5 ሰዓታት ይወስዳል። በA100 ደረጃ ላይ ያለ ~3 ቢ ፖሊሲ በሰዓት ከ1.20 እስከ 2.00 ዶላር፣ በግምት ከ4 እስከ 12 ዶላር፣ ከ3 እስከ 6 ሰዓታት ይወስዳል። ዋጋዎችን ይመልከቱ፣ እና ተመሳሳይ ስራዎችን ከCLI እና ከMCP አገልጋይ።
አነስተኛ ሞዴል የተሳሳተ ምርጫ ሲሆን
ሁለቱም ወረቀቶች ከማጠቃለያዎቹ የበለጠ ጥንቃቄ የተሞላባቸው ናቸው። የTinyVLA ውድቀት ትንተና የተለየ ነው፡ የ0.4 ቢ ልዩነት መመሪያውን በተሳሳተ መንገድ በማንበብ ሶስት ጊዜ ወድቋል፣ ይህም ደራሲዎቹ በትናንሽ VLM ውስጥ ባለው ውስን የቋንቋ ግንዛቤ ምክንያት ነው ብለው ያምናሉ፣ እና ያ ሁነታ በ1.3 ቢ ጠፍቷል። SmolVLA ተመሳሳይ ኩርባን ከሌላኛው ጫፍ ያሳያል፡ ተመሳሳይ አርክቴክቸር ያለው የ2.25 ቢ ስሪት በLIBERO ላይ 88.75 እና በMeta-World ላይ 68.24 ያስመዘገበ ሲሆን የ0.45 ቢ ሞዴል ደግሞ 87.3 እና 57.3 አስመዝግቧል።
- 24 ጂቢ ካርድ ላይ ይገጥማል፣ ይህም አንድ ሙከራን ከአስር ዶላር ወደ ጥቂት ዶላር ይቀንሳል።
- ከእጁ አጠገብ ለመስራት በቂ ፍጥነት ያለው፣ ስለዚህ በመቆጣጠሪያ ዑደት ውስጥ ምንም የአውታረ መረብ ዝላይ የለም።
- አንድ ሰው ሊመዘግበው በሚችለው መረጃ ላይ በጥሩ ሁኔታ ይስተካከላል፣ በሺዎች ከሚቆጠሩት ይልቅ በአስር የሚቆጠሩ ክፍሎች።
- የSmolVLA ክብደቶች፣ የውሂብ ዝርዝር እና ኮድ ይፋዊ ናቸው፣ ስለዚህ መጥፎ ውጤት ሊስተካከል ይችላል።
- ደካማ መመሪያ መከተል፡ አነስተኛ የቋንቋ መለኪያዎች፣ ተመሳሳይ የማጣቀሻ አገላለጾችን የመለየት ችሎታ ማነስ።
- ያልመዘገቧቸውን ዝግጅቶች በተመለከተ አነስተኛ የቦታ እና የእይታ አጠቃላይነት።
- ለዳታ ስብስብ ጉድለቶች የበለጠ ስሜታዊ፣ ለመደገፍ የሚያስችል አነስተኛ ቅድመ-ስልጠና።
- ባለብዙ ተግባር እና የረጅም ጊዜ ስራ አሁንም ትላልቅ ሞዴሎችን ይደግፋል፣ የSmolVLA የራሱ የሆነውን 2.25 ቢ ልዩነት ጨምሮ።
ሊደረግ የሚገባው ንጽጽር TinyVLA ከSmolVLA ጋር አይደለም። SmolVLA ከACTበእርስዎ ተግባር ላይ ነው፣ እና የSmolVLA ወረቀት ለምን እንደሆነ የሚያብራራ ነው። ያለ ሮቦቲክስ ቅድመ-ስልጠና በአንድ ተግባር የሰለጠነው SmolVLA በሶስት SO-100 ተግባራት ላይ በአማካይ 40.0 አስመዝግቧል፣ ነጠላ-ተግባር ACT ደግሞ 48.3 አስመዝግቧል። ወደ 78.3 ከፍ የሚያደርገው የማህበረሰብ ቅድመ-ስልጠና እና ባለብዙ ተግባር ስልጠና ነው እንጂ አርክቴክቸሩ ብቻ አይደለም። በSO-101 ሌጎ ተግባር ላይ፣ ሁለቱም ነጠላ-ተግባር ሲሆኑ፣ SmolVLA ያሸንፋል፡ በስርጭት ውስጥ 90 ከ 70። ከዚያ SmolVLA ከPi0.5በጀት የሚፈቅድ ከሆነ።
ለመጥፎ ዳታ የሚሸፍን ቅድመ-ስልጠና አነስተኛ ነው፣ ስለዚህ በተበላሸ የዳታ ስብስብ ላይ ንጹህ የኪሳራ ከርቭ ጉድለቱን በልበ ሙሉነት የሚያባዛ ፖሊሲ ይሰጥዎታል። የlerobot ሰነዶች ስለ አወቃቀሩ ግልጽ ናቸው፡ 50 ክፍሎች በአምስት የኩብ አቀማመጦች፣ ለእያንዳንዱ አቀማመጥ 10፣ ሰርተዋል፤ 25 ግን አልሰሩም። ኪሳራው ጥሩ መስሎ ከታየ እና ክንዱ ምንም ጠቃሚ ነገር ካላደረገ፣ ከ ኪሳራው ይወድቃል፣ ፖሊሲው ምንም አያደርግም፣ ፖሊሲው በአንድ አቀማመጥ ላይ ብቻ ይሰራል ወይም በእርግጥም ጥቅም ላይ ሊውል የሚችል የVLA ስልጠና ዳታ መሰብሰብ ይጀምሩ።
አምስት ፖሊሲዎች፣ አንድ የንጽጽር ሠንጠረዥ
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA እና ACT በእውነተኛ የፓራሜትር ብዛት፣ ለእያንዳንዱ የድርጊት እርምጃ የማመዛዘን መዘግየት፣ እያንዳንዱ የሚያስፈልገው የጂፒዩ ደረጃ እና ጠቃሚ ነገር ከማድረጉ በፊት ያለው ዝቅተኛው የክፍሎች ብዛት።
ፖሊሲዎቹን ያነጻጽሩእርምጃ ሊወስዱበት የሚችሉበት የውሳኔ ሠንጠረዥ
| የእርስዎ ሁኔታ | በዚህ ይጀምሩ | ለምን |
|---|---|---|
| አንድ ተግባር፣ ጥሩ ማሳያዎች፣ ቋንቋ የለም | ACT | ~80 M, 20 ms, 24 GB card, no base model to download |
| ጥቂት ተዛማጅ ተግባራት፣ ለእያንዳንዱ አንድ መመሪያ | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| በተለይ የTinyVLA ውጤትን ማባዛት | TinyVLA-B or TinyVLA-H | ሪፖው ብቸኛው መንገድ ነው፡ የተገለለ አካባቢ፣ የተቀየረ ዳታ |
| ባለብዙ ተግባር፣ የተለያዩ መመሪያዎች፣ A100 በጀት | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| ገና ሮቦት የለም | እውነተኛ ክንድ ያሽከርክሩ | በወረፋ ላይ የተመሰረተው የቀጥታ ክንድ ምዝገባም ሆነ ሃርድዌር አያስፈልገውም |
ለመጨረሻው ረድፍ፣ ቀጥታ ክንድ አካውንት ሳያስፈልግዎት ከብሮውዘር ሊነዱት የሚችሉትን አካላዊ SO-100 ያሰራጫል፣ እና ለመጀመር ሦስቱ መንገዶች ቀሪውን ይሸፍናል። SO-100 እዚህ ያለው የማጣቀሻ ክንድ ነው፣ በግምት ከ110 እስከ 150 ዩሮ የሚገመት ክፍሎች ያሉት፣ ከሙሉ የማዋቀር መመሪያ ጋር።
ከ1 ቢ በታች ከሆኑ ሞዴሎች በኋላ የሚመጣው ምንድን ነው
የፓራሜትር ብዛትን መቀነስ VLAን ርካሽ ለማድረግ አንዱ መንገድ ነው እንጂ በግልጽ አሸናፊው አይደለም። OpenVLA-OFT (arXiv 2502.19645) የ7 ቢ ባክቦን ይዞ የሚቆይ ሲሆን ድርጊቶች እንዴት እንደሚፈቱ ብቻ ይለውጣል፣ በድርጊት ማመንጨት ፍሰት 26x ጭማሪ እና LIBERO ከ76.5 ወደ 97.1 በመቶ ከፍ ማለቱን ሪፖርት ያደርጋል። BitVLA (arXiv 2506.07530) የ1-ቢት BitNet b1.58 2B4T ባክቦን እያንዳንዱን ክብደት ሶስትዮሽ ያደርገዋል፣ 11.0x ያነሰ ማህደረ ትውስታ እና 4.4x ዝቅተኛ ከጫፍ እስከ ጫፍ መዘግየት ሪፖርት ያደርጋል ሙሉ-ትክክለኛነት OpenVLA-OFTን ሲያሟላ። X-VLA-0.9B (arXiv 2510.10274) በፍሰት ማዛመድ ከ1 ቢ መስመር ላይ ይገኛል።
የጋራው ክር፡ መዘግየቱ የሚኖረው በድርጊት ዲኮደር እንጂ በቋንቋ ሞዴል አይደለም። አንድ ፖሊሲ ስንት ፓራሜትሮች እንዳሉት ከመጠየቅዎ በፊት ድርጊቶችን እንዴት እንደሚያወጣ ይጠይቁ። አሬና 85 ሞዴሎች እና 332 ውጤቶች አሉት፣ እያንዳንዱም ከምንጩ ጋር የተገናኘ ነው፤ ሰፋ ያለ አጠቃላይ እይታ በየእኛ የVLA መግቢያ ውስጥ ይገኛል።
SmolVLAን በ RTX 4090 ላይ ማስተካከል እችላለሁን?▾
አዎ። SmolVLA 450 M ፓራሜትሮች ሲሆን AY-Robots በ RTX 4090 / 24 GB ደረጃ ላይ ያካሂደዋል። የ lerobot ምሳሌ --batch_size=64ን ይጠቀማል፣ ይህም ለካርድዎ ዋስትና ሳይሆን ምሳሌ ነው። ሰነዶቹ በትንሹ እንዲጀምሩ እና የመጫኛ ጊዜዎች አጭር እስከሆኑ ድረስ እንዲጨምሩ ይመክራሉ። ለ 20000 ደረጃዎች በ A100 ላይ ሰነዶቹ ከጠቀሱት ግምታዊ 4 ሰዓታት በላይ ረዘም ያለ ጊዜ ይጠብቁ።
TinyVLA በ lerobot ወይም በ AY-Robots ላይ ይገኛል?▾
ለሁለቱም አይሆንም። TinyVLA የሚገኘው በምርምር ማከማቻው ውስጥ ብቻ ነው፣ የመጨረሻው ኮሚት 11 March 2025 ሲሆን ቅርጸቱም LeRobot ሳይሆን ACT-style HDF5 ነው። AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA እና ACTን ያሰለጥናል። TinyVLAን ከፈለጉ እራስዎ መገንባት አለብዎት፣ እና በመጀመሪያ የ DeepSpeed config pathን በ scripts/train.sh ውስጥ ማስተካከል ይኖርብዎታል።
አንድ 450 M ሞዴል በእርግጥ ከ 3 B ሞዴል ጋር ተወዳዳሪ ነው?▾
በጸሐፊዎቹ የራሳቸው መለኪያዎች መሰረት፣ አዎ፡ በ LIBERO ላይ 87.3 ከ 86.0 ጋር ሲነጻጸር ከሮቦቲክስ-ቅድመ-ስልጠና ካለው Pi0 በ 3.3 B፣ እና 78.3 ከ 61.7 ጋር በሶስት እውነተኛ SO-100 ተግባራት ላይ፣ እዚያም ተመሳሳይ ወረቀት Pi0ን በ 3.5 B ይሰይማል። ገደቡ በተመሳሳይ ወረቀት ላይ ነው፡ ያለ ሮቦቲክስ ቅድመ-ስልጠና ነጠላ-ተግባር ሲሆን፣ SmolVLA ወደ 40.0 ይወርዳል፣ ከ ACT 48.3 በታች።
አንድ ትንሽ VLA ማንኛውንም ነገር ከማድረጉ በፊት ስንት ክፍሎች ያስፈልጉኛል?▾
AY-Robots ለ SmolVLA ዝቅተኛውን 30 ክፍሎች እና ለ ACT ዝቅተኛውን 50 ክፍሎች ያዘጋጃል። የ lerobot ሰነዶች ወደ 50 አካባቢ ይመክራሉ እና 25 ለተመሳሳይ ተግባር በቂ እንዳልሆነ ሪፖርት ያደርጋሉ። አወቃቀር እንደ ብዛት ሁሉ አስፈላጊ ነው፡ የወረቀቱ ስብስብ 5 የኩብ አቀማመጦችን በእያንዳንዳቸው 10 ክፍሎች ተጠቅሟል።
የታተሙ የዘገየ ቁጥሮች ለምን በጣም ይለያያሉ?▾
የተለያዩ ነገሮችን ይለካሉ። TinyVLA በአንድ A6000 ላይ ለእያንዳንዱ የድርጊት ትንበያ 14 ms ሪፖርት ያደርጋል፤ AY-Robots SmolVLAን በ 245 ms እና ACTን በ 20 ms ለእያንዳንዱ የድርጊት ደረጃ ይዘረዝራል። አንዳንድ አሃዞች አንድ የፊት ማለፊያን ይሸፍናሉ፣ አንዳንዶቹ ማለፊያን በ 50-ድርጊት ክፍል ይከፋፍላሉ፣ እና አብዛኛዎቹ የካሜራ ቀረጻን ወይም ወደ ሰርቮስ መጻፍን አያካትቱም።
የክላውድ ግምት የ GPU ችግርን ይፈታል?▾
በከፊል። AY-Robots ፖሊሲውን የሚያገለግል ፖድ በራስ-ሰር ያቀርባል፣ የአካባቢው ደንበኛ ደግሞ ከዛ የመጨረሻ ነጥብ ጋር ይገናኛል፣ ስራ ፈት የጥበቃ ሰዓት ስላለው በጸጥታ ክፍያ ከማስከፈል ይልቅ ራሱን ያጠፋል። የህዝብ-ኢንተርኔት የጉዞ ጊዜን ማስወገድ አይችልም፣ እና የቁጥጥር ዑደቱ ለእያንዳንዱ የድርጊት ደረጃ ከ 20 እስከ 485 ms ነው። ለቀስ በቀስ ማንሳት እና ማስቀመጥ ጥሩ ነው፣ ለፈጣን ምላሽ ሰጪ እንቅስቃሴ ግን አይደለም።
Sources
- TinyVLA: ለሮቦቲክ ማኒፑሌሽን ፈጣን፣ ዳታ-ቀልጣፋ ቪዥን-ቋንቋ-ድርጊት ሞዴሎች
- TinyVLA ይፋዊ የኮድ ማከማቻ (README, requirements.txt, scripts/train.sh)
- TinyVLA የፕሮጀክት ገጽ
- lesjie/Llava-Pythia-1.3B, የ TinyVLA-H የጀርባ ክብደቶች
- SmolVLA: ለተመጣጣኝ እና ቀልጣፋ ሮቦቲክስ የቪዥን-ቋንቋ-ድርጊት ሞዴል
- lerobot ሰነድ: SmolVLAን ማስተካከል
- lerobot: configuration_smolvla.py, የ SmolVLA ነባሪዎች
- lerobot/smolvla_base ሞዴል ካርድ
- SmolVLA: ቀልጣፋ ቪዥን-ቋንቋ-ድርጊት ሞዴል (Hugging Face ብሎግ)
- lerobot በ PyPI (0.6.1, Python 3.12 ወይም ከዚያ በላይ ያስፈልገዋል)
- OpenVLA: ክፍት ምንጭ ቪዥን-ቋንቋ-ድርጊት ሞዴል
- ቪዥን-ቋንቋ-ድርጊት ሞዴሎችን ማስተካከል: ፍጥነትን እና ስኬትን ማመቻቸት (OpenVLA-OFT)
- BitVLA: ለሮቦቲክስ ማኒፑሌሽን 1-ቢት ቪዥን-ቋንቋ-ድርጊት ሞዴሎች
- X-VLA: ለተለያዩ አካላት የሚመጥን የቪዥን-ቋንቋ-ድርጊት ሞዴል እንደ Soft-Prompted Transformer
- rail-berkeley/octo-small-1.5 ሞዴል ካርድ (27 M ፓራሜትሮች)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started