የ AY-Robots ፖሊሲ ንጽጽር ሠንጠረዥ ከመለኪያ ብዛት፣ ከጂፒዩ ደረጃዎች እና ከ GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA እና ACT የመገመት መዘግየት ጋር
SmolVLATinyVLAትናንሽ VLAየሸማች ጂፒዩLeRobot

ትናንሽ VLA ሞዴሎች: TinyVLA, SmolVLA እና ከ1 ቢሊዮን በታች ያለው ሁኔታ

AY-Robots ResearchAugust 23, 202619 ደቂቃ ንባብ

TinyVLA እና SmolVLA የሚሰራ VLA ከ1 ቢሊዮን መለኪያዎች በታች አስቀምጠዋል። ከሁለቱም ወረቀቶች የተገኙ ትክክለኛ ቁጥሮች፣ የ lerobot ነባሪዎች፣ የተለካ መዘግየት እና አንድ ሩጫ በ24 ጊባ ካርድ ላይ ምን ያህል እንደሚያስወጣ።

ሁሉም ማለት ይቻላል የእይታ-ቋንቋ-ድርጊት ሞዴል ስለሚጻፍ የዳታ ማዕከል ካርድን ይገምታል። OpenVLA 7 ቢሊዮን ፓራሜትሮች አሉት። GR00T N1.7 እና Pi0.5 ወደ 3 ቢሊዮን የሚጠጉ ሲሆኑ ለማስተካከል A100 80 ጊባ ይፈልጋሉ። በዴስክዎ ላይ ያለው ካርድ 4090 ከሆነ፣ ያ የሞዴል ክፍል ሊደረስበት አይችልም።

ሁለት ወረቀቶች እንደማያስፈልግ ይከራከራሉ። TinyVLA (arXiv 2409.12514፣ በየካቲት 2025 በ IEEE Robotics and Automation Letters ተቀባይነት ያገኘ) ከ400 ሚሊዮን እስከ 1.3 ቢሊዮን የጀርባ አጥንት እና የዲፍዩዥን ድርጊት ራስ በመጠቀም VLA ይገነባል። SmolVLA (arXiv 2506.01844፣ ሰኔ 2 ቀን 2025 የቀረበ) 450 ሚሊዮን ፓራሜትሮችን በክፍት ክብደቶች፣ ክፍት ዳታ እና በአንድ የሸማች ካርድ ላይ የሚሰራ ስክሪፕት ይዞ ይመጣል። ሁለቱም የለኩት እና ከ1 ቢሊዮን በታች ያለው ክርክር መቆሙ እዚህ አለ።

ማወቅ ያለብዎት ነገር

  • TinyVLA ሶስት መጠኖች አሉት፡ 422 ሚሊዮን ጠቅላላ ከ101 ሚሊዮን ጋር ሊሰለጥን የሚችል፣ 740 ሚሊዮን ከ138 ሚሊዮን ጋር፣ 1.3 ቢሊዮን ከ143 ሚሊዮን ጋር። የመጀመሪያዎቹ ሁለቱ ብቻ ከ1 ቢሊዮን በታች ናቸው።
  • የእሱ ሰንጠረዥ IV ለአንድ A6000 በTinyVLA-1B ላይ ለእያንዳንዱ የድርጊት ትንበያ 14 ሚሊሰከንዶች ይለካል፣ ከOpenVLA-7B 292 ሚሊሰከንዶች እና ለተቀነሰ OpenVLA-1B 140 ሚሊሰከንዶች ጋር ሲነጻጸር።
  • ፍጥነቱን የሚይዘው ራስ እንጂ የጀርባ አጥንት አይደለም፡ የTinyVLA-Hን የዲፍዩዥን ራስ በACT ራስ ይቀይሩት እና አምስቱ እውነተኛ-ሮቦት ተግባራት ከ94.0 አማካይ ወደ ነጠላ አሃዞች ይወርዳሉ። የMLP ራስ በሁሉም ቦታ 0 ያስመዘግባል።
  • SmolVLA 450 ሚሊዮን ነው፣ ከዚህ ውስጥ በግምት 100 ሚሊዮን የድርጊት ኤክስፐርት ሲሆን፣ በ481 የህብረተሰብ LeRobot ዳታ ስብስቦች እና 10.6 ሚሊዮን ፍሬሞች ላይ አስቀድሞ የሰለጠነ ነው። በLIBERO ላይ 87.3 ሪፖርት ያደርጋል፣ ከሮቦቲክስ-አስቀድሞ የሰለጠነ Pi0 በ3.3 ቢሊዮን 86.0 ጋር ሲነጻጸር፣ እና በሶስት እውነተኛ SO-100 ተግባራት ላይ 78.3 ሪፖርት ያደርጋል፣ ከPi0 በ3.5 ቢሊዮን 61.7 ጋር ሲነጻጸር።
  • ያለዚያ ቅድመ-ስልጠና በአንድ ተግባር የሰለጠነ፣ SmolVLA በእነዚያ ተግባራት ላይ ወደ 40.0 ይወርዳል፣ ከACT 48.3 በታች። ትንሽ ማለት በራስ-ሰር ቀላል ማለት አይደለም።
  • TinyVLA የLeRobot ውህደት የለውም እና CUDA 11.7 wheel stackን ይደግፋል። SmolVLA በlerobot ውስጥ ነው እና እዚህ በ24 ጊባ ደረጃ ላይ ለእያንዳንዱ ሩጫ በግምት ከ1 እስከ 3 ዶላር ያስከፍላል።

በእርግጥ እንደ ትንሽ VLA የሚቆጠረው ምንድን ነው

በሞዴል ካርድ ላይ ያለው የፓራሜትር ብዛት አንድ ቁጥር አይደለም። አጠቃላይ ክብደቶችን፣ በግምት ወቅት የተጫኑ ክብደቶችን፣ ወይም በጊዜ ውስጥ ግራዲየንቶችን የሚቀበሉ ክብደቶችን ሊያመለክት ይችላል። ። TinyVLA ሁለቱንም ሪፖርት ያደርጋል፣ እና ልዩነቱ ትልቅ ነው፡ TinyVLA-H በጠቅላላው 1.3 B ነው ነገር ግን 143 M ሊሰለጥን የሚችል ነው፣ ምክንያቱም የቪዥን ታወር እና አብዛኛው የቋንቋ ሞዴል ሳይቀዘቅዙ ሲቀሩ LoRA አስማሚዎች እና የአክሽን ሄድ ይንቀሳቀሳሉ። ወረቀቱ ሊሰለጥን የሚችለውን ድርሻ ወደ 5 በመቶ ገደማ ያስቀምጣል።

ሞዴልፓራሜትሮችባክቦንየድርጊት ራስምንጭ
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-Instructፍሰት ማዛመጃ ኤክስፐርትarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelቀጥተኛ የቁራጭ ሪግሬሽንAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersራስ-ሪግሬሲቭ የድርጊት ቶከኖችarXiv 2406.09246

ሁለት ረድፎች ክርክር የሚያስፈልጋቸው ናቸው። በግምት 80 M ሲሆን ከሌሎቹ ሁሉ ያነሰ ነው ነገር ግን የቋንቋ ሞዴል የለውም፣ ስለዚህ VLA አይደለም፡ አንድ ተግባር ይማራል እና ሌላ እንዲሰራ ሊነገረው አይችልም። በ27 M በT5-Base ጽሑፍ ኢንኮደር በኩል የተስተካከለ ነው፣ እንጂ LLM ባክቦን አይደለም። ጥሩ የመነሻ መስመሮች ናቸው፣ ነገር ግን የሌብሉን ትርጉም የሚከተል መመሪያ አይሰጡም።

የ1 B መስመር የዘፈቀደ ነው

TinyVLA-H፣ ዋና ዋና ውጤቶችን የያዘው ልዩነት፣ 1.3 B ሲሆን ከመስመሩ በላይ ነው። የተሻለው ጥያቄ አንድ ሞዴል በስልጠና ወቅት በ24 GB ውስጥ መግባት ይችል እንደሆነ እና በግምት ወቅት የቁጥጥር ፍጥነትዎን ማሳካት ይችል እንደሆነ ነው። እዚህ ማሰልጠን የሚችሏቸው አምስቱ ፖሊሲዎች በፖሊሲዎች ገጽ ላይ ይገኛሉ፤ ቁጥሮቹን ከሌሎች ጋር ማወዳደር ከፈለጉ TinyVLA የአሬና ግቤት አለው

TinyVLA: ፍጥነቱ የሚመጣው ከጭንቅላቱ ነው እንጂ ከአከርካሪው አይደለም

ግልጽ የሆነው ግንዛቤ የቋንቋ ሞዴሉን በማሳነስ ፈጣን እንዲሆን ማድረጋቸው ነው። የጥናቱ የአብሌሽን ትንተና ግን ሌላ ያሳያል። የOpenVLAን 7 B አከርካሪ በግምት 1 B በሆነው መተካት በአንድ ድርጊት ትንበያ ጊዜውን ከ292 ms ወደ 140 ms ቀንሶታል፣ ይህም የ2x ጭማሪ ነው። TinyVLA-H፣ በተመጣጣኝ የፓራሜትር ብዛት፣ በተመሳሳይ ካርድ ላይ በ14 ms ይሰራል። ሌላው 10x ደግሞ የአክሽን ሄዱ ነው።

ሞዴልበአንድ ድርጊት ትንበያየተለካበት
OpenVLA-7B292 mssingle A6000
OpenVLA-1B፣ አከርካሪው በTinyVLA ተተክቶ140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA ድርጊቶችን እንደ ተከፋፈሉ ቶከኖች በቋንቋ ሞዴል ሄድ በኩል፣ በአንድ ድርጊት ልኬት አንድ፣ በራስ-ሰር ያመነጫል። TinyVLA ሙሉውን ክፍል በአንድ ጊዜ የሚያመነጭ የዲፍዩዥን ዲኮደር ያያይዛል። ሠንጠረዥ V የTinyVLA-H አርክቴክቸርን ይዟል እና ሄዱን ብቻ በተመሳሳይ አምስት እውነተኛ-ሮቦት ተግባራት ላይ ይለዋውጣል። ይህ በማንኛውም ጥናት ውስጥ ለሚከተለው ክርክር እጅግ በጣም ግልጽ ማስረጃ ነው ፍሎው ማቺንግ ፖሊሲዎች የሚያደርጉት፣ እና ምክንያቱ ደግሞ Pi0 ከቶከን ዲኮዲንግ የራቀበት

በTinyVLA-H ላይ ያለው ራስPlaceTennisFlipMugStackCubesCloseDrawerOpenBox
Diffusion (droid_diffusion)90.098.398.396.786.7
Action Chunking Transformer13.38.38.313.323.3
Multi-layer perceptron00000
የTinyVLA ቁጥሮች ምን ያካትታሉ

የ292 / 140 / 14 ሚሴ አሃዞች ሰንጠረዥ IV ላይ ያሉ ሲሆን ሁሉም በአንድ A6000 ላይ የተገኙ ናቸው። እነዚህ በአንድ ድርጊት ትንበያ ላይ የተመሰረቱ ሲሆኑ የካሜራ ቀረጻን፣ ቅድመ-ሂደትን እና ወደ ሰርቮስ የሚደረገውን ተከታታይ ጽሁፍ አያካትቱም። የታተመውን መዘግየት እንደ ዝቅተኛ ገደብ ይቁጠሩት፣ በፍጹም እንደ መቆጣጠሪያ ፍጥነት አይደለም። የእኛ ቁጥሮች ተመሳሳይ ገደብ አላቸው፡ የመረጃ መዘግየትን ይመልከቱ።

TinyVLA ምን ውጤት አስመዘገበ

ቤንችማርክፕሮቶኮልTinyVLA-Hመሰረታዊ መስመሮች
MetaWorld, 50 tasks, simባለብዙ ተግባር፣ 50 ማሳያዎች፣ 3 ዘሮች77.6 / 21.5 / 11.4 / 15.8 እንደ አስቸጋሪነቱ፣ አማካይ 31.6Diffusion Policy average 10.5
Real Franka Panda, 5 tasksበእያንዳንዱ ተግባር 100 አቅጣጫዎች፣ 20 ሙከራዎች94.0 አማካይOpenVLA 68.3, Diffusion Policy 35.3
Bimanual UR5, 3 tasksባለብዙ ተግባር፣ በእያንዳንዱ ተግባር 10 ሙከራዎች76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

ባይማኑዋል ረድፉ ወረቀቱ ራሱ የሚሰጠው አሰልቺ ማብራሪያ አለው፡ OpenVLA ሙሉ በሙሉ ነጠላ-እጅ ዳታ ባካተተው Open X-Embodiment ላይ የሰለጠነ ነው፣ ስለዚህ ባለሁለት-እጅ የድርጊት ቦታ ከስርጭት ውጪ ነው እና ዜሮ ያስመዘግባል። የዲፍዩዥን ፖሊሲ ቤዝላይን ከእነዚያ ሶስት ተግባራት ውስጥ በሁለቱ ላይ TinyVLA-Hን ያሸንፋል። ተጨማሪ መረጃ በየ Open X-Embodiment ጽሑፍ.

AY-Robots አሬና ሊደርቦርድ፣ 85 VLA ሞዴሎችን እና 332 የቤንችማርክ ውጤቶችን የያዘ የሚደረደር ሠንጠረዥ ሲሆን፣ እያንዳንዱ እሴት ከመጣበት ወረቀት ወይም ሞዴል ካርድ ጋር የተገናኘ ነው።
የተለያዩ ሞዴሎች የቤንችማርክ ቁጥሮች እያንዳንዱ ከየት እንደመጣ ማየት ሲቻል ብቻ ነው የሚነፃፀሩት።

የ TinyVLA ሪፖ፣ ከኦገስት 2026 ጀምሮ

ወረቀቱ ጥሩ ነው። ኮዱ ለምርምር የተለቀቀ ነው። ሪፖዚቶሪው github.com/liyaxuanliyaxuan/TinyVLA ነው፤ የ README ፋይሉ የኮዱን መለቀቅ የካቲት 17 ቀን 2025 እና የመጨረሻውን ኮሚት መጋቢት 11 ቀን 2025 ያሳያል። አንድን ወረቀት ለማባዛት ጥሩ ነው፣ ነገር ግን የተጠበቀ ላይብረሪ ከፈለጉ ችግር ነው።

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
የTinyVLA README የመጫኛ ቅደም ተከተል፣ በ2026-08-23 ከሪፖዚቶሪው ጋር ተረጋግጧል።
የጥገኝነት ማያያዣዎች አንድ ቀን የሚበላ ወጥመድ ናቸው

requirements.txt `torch==2.0.1`፣ `transformers==4.37.1`፣ `deepspeed==0.9.5`፣ `peft==0.4.0`፣ `diffusers==0.11.1`፣ `numpy==1.24.4`፣ እና የCUDA ስታክን ወደ 11.x ዊልስ ያያይዛል፡ `nvidia-cuda-runtime-cu11==11.7.99`፣ `nvidia-cudnn-cu11==8.5.0.96`፣ `triton==2.0.0`። READMEው Python 3.10ን ይጠይቃል፤ lerobot 0.6.1 ደግሞ 3.12 ወይም ከዚያ በላይ ያስፈልገዋል፣ ስለዚህ ሁለቱ አንድ አካባቢ መጋራት አይችሉም። በመጀመሪያ ለጂፒዩ ትውልድዎ የtorch 2.0.1 ግንባታ መኖሩን ያረጋግጡ። ይልቁንም አንድ ሩጫ በVRAM ምክንያት ከቆመ፣ የማስታወሻ እጥረት መፈተሻ ዝርዝር ከመገመት ይልቅ ፈጣን ነው።

TinyVLA ደግሞ አያነብም LeRobot ዳታ ስብስቦችን. ቅርጸቱ ACT-style HDF5 ነው፡ action, language_raw, እና multi-view images, joint_positions, qpos እና qvel የያዘ observations group። ሪፖው ለRLDS ግብዓት data_utils/rlds_to_h5py.pyን ያቀርባል፣ እና እያንዳንዱ ተግባር በaloha_scripts/constants.py ውስጥ በdataset_dir, episode_len እና camera_names በእጅ ይመዘገባል። የእርስዎ ክፍሎች ከlerobot ወይም ከ ዴስክቶፕ ደንበኛ የመጡ ከሆነ፣ ልወጣው የእርስዎ ኃላፊነት ነው።

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
ከscripts/train.sh የተወሰደ። ከላይ ያለው እያንዳንዱ ባንዲራ እና እሴት በተላከው ፋይል ውስጥ ይገኛል።
  • --num_gpus=8 ስምንት ካርድ ያለው ኖድ እንደሆነ ይገምታል። ወደ 1 ያቀናብሩት እና የባች መጠኑን ከ 32 በታች ዝቅ ያድርጉት። ምንም ነጠላ-ጂፒዩ ልዩነት ወደ ላይ አይላክም፣ ስለዚህ ትዕዛዙ በ 4090 ላይ በትክክል ሊሰራ አይችልም።
  • --deepspeed scripts/zero2.json ከከፍተኛ ደረጃ ስክሪፕቶች ማውጫ ውጭ ወዳለ ፋይል ይጠቁማል። የDeepSpeed ውቅሮች በ llava-pythia/scripts/zero2.json ላይ ይገኛሉ። ከመጀመሪያው አሂድዎ በፊት መንገዱን ያስተካክሉ።
  • README የውጤት ማውጫው ስም llava_pythia እንዲይዝ ይጠይቃል፣ በተጨማሪም LoRA ከነቃ lora።
  • የጀርባ አጥንቱ የተለየ ማውረድ ነው: lesjie/Llava-Pythia-400M, -700M ወይም -1.3B. lerobot/smolvla_base ላይ እንደሚያመለክቱት ፖሊሲን የሚያመለክቱበት አንድ ነጠላ የመሠረት ቼክፖይንት የለም።

SmolVLA: ከ 1 ቢ በታች የሆነው ሞዴል ዛሬ ከሰዓት በኋላ ሊያሄዱት የሚችሉት

SmolVLA በተጠበቀ ቤተ-መጽሐፍት ውስጥ ተመሳሳይ ክርክር ያቀርባል። በ SmolVLM2-500M-Video-Instruct የጀርባ አጥንት ላይ 450 M መለኪያዎች አሉት፣ እና ቅልጥፍናው የሚመጣው ከ configuration_smolvla.py ሊያነቧቸው ከሚችሏቸው ቅንብሮች ነው እንጂ ትንሽ ስለመሆኑ ከሚቀርብ የይገባኛል ጥያቄ አይደለም።

Setting in configuration_smolvla.pyነባሪየሚያስገኘው ጥቅም
num_vlm_layers16የመጀመሪያዎቹ 16 የቋንቋ ሞዴል ንብርብሮች ብቻ ይሰራሉ
expert_width_multiplier0.75የድርጊት ኤክስፐርት የተደበቀ መጠን ከVLM 75 በመቶ ነው
self_attn_every_n_layers2ራስን ትኩረት መስጠት ከሌሎች ትኩረት ጋር የተጠላለፈ
chunk_size / n_action_steps50 / 50አንድ ማለፊያ 50 ድርጊቶችን ያመነጫል እና ሁሉም 50 ይፈጸማሉ
num_steps10የፍሰት ማዛመጃ ዲኖይዚንግ በ 10 ደረጃዎች ተስተካክሏል
tokenizer_max_length48መመሪያው ወደ 48 ቶከኖች ተቆርጧል
freeze_vision_encoder / train_expert_onlyTrue / Trueጥሩ ማስተካከያ ኤክስፐርቱን ያንቀሳቅሳል እንጂ የራዕይ ማማውን አይደለም
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000የወረቀቱ የምግብ አሰራር አይደለም: ቅድመ-ስልጠናው በ 200000 ደረጃዎች ላይ 100-ደረጃ ማሞቂያ ተጠቅሟል

ቅድመ-ስልጠናው 481 የማህበረሰብ LeRobot ዳታሴቶችን፣ 22.9 ሺህ ክፍሎችን እና 10.6 ሚሊዮን ፍሬሞችን በ4 ጂፒዩዎች ላይ፣ በ256 ዓለም አቀፍ ባች 200000 እርምጃዎችን ተጠቅሟል፤ ጥናቱ አጠቃላይ ፕሮጀክቱን ወደ 30 ሺህ ጂፒዩ ሰዓታት ገምቷል። ትኩረት ሊሰጠው የሚገባ አንድ ቁጥር: የHugging Face ማስጀመሪያ ብሎግ 487 የተመረጡ ዳታሴቶችን ሲል፣ የጥናቱ ሰንጠረዥ ግን 481 ይላል። እኛ የጥናቱን ቁጥር እንጠቀማለን እና ልዩነቱን እናሳውቃለን።

ቤንችማርክSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO አማካይ፣ ባለብዙ-ተግባር87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World አማካይ፣ ባለብዙ-ተግባር57.368.2447.9 (3.5 B, robotics-pretrained)-
እውነተኛ SO-100፣ 3 ተግባራት፣ ባለብዙ-ተግባር ስልጠና78.3-61.7 (3.5 B)-
እውነተኛ SO-100፣ 3 ተግባራት፣ ነጠላ-ተግባር፣ ያለ ሮቦቲክስ ቅድመ-ስልጠና40.0--48.3
SO-101 ሌጎ ማንሳት-ማስቀመጥ፣ ነጠላ-ተግባር፣ በስርጭት ውስጥ90--70
SO-101 ሌጎ ማንሳት-ማስቀመጥ፣ ነጠላ-ተግባር፣ ከስርጭት ውጪ50--40
ሙሉውን ሰንጠረዥ ያንብቡ፣ የመጀመሪያውን ረድፍ ብቻ ሳይሆን

LIBERO ሲሙሌሽን ነው እና አሁን እዚያ ሁሉም ብቃት ያላቸው ውጤቶች በሰማንያዎቹ ውስጥ ናቸው። እውነተኛው የSO-100 ረድፍ፣ የ450 ሚሊዮን ሞዴል የ3.5 ቢሊዮን ሞዴልን በ16.6 ነጥብ የሚያሸንፍበት፣ አስደሳች ነው። ከሱ በታች ያለው ረድፍ ደግሞ ተቃራኒውን ያሳያል። የማህበረሰብ ቅድመ-ስልጠናውን እና ባለብዙ-ተግባር ስልጠናውን ሲያስወግዱ እና ያው ሞዴል ከACT በታች ወደ 40.0 ይወርዳል። ሊከላከል የሚችለው ክርክር ትንሽ ሞዴል በራስ-ሰር የከፋ አይደለም እንጂ የተሻለ ነው ማለት አይደለም።

አንድ አጋጣሚ ይረዳል፡ የSmolVLA ወረቀት ሜታ-ወርልድ ሰንጠረዥ የTinyVLA የራሱን የታተሙ ቁጥሮች እንደ መሰረት ይዟል፣ ስለዚህ ለመጀመሪያ ጊዜ ሁለቱም ሞዴሎች በአንድ ሰንጠረዥ ውስጥ ተቀምጠዋል፣ SmolVLA-0.45B በ57.3 ከTinyVLA-H በ31.6 ጋር። እንዲሁም SmolVLA ከPi0 በ6 እጥፍ ያነሰ ማህደረ ትውስታ ላይ በግምት 40 በመቶ በፍጥነት እንደሚሰለጥን ሪፖርት ያደርጋል። ይህ ሁሉ ከSmolVLA ደራሲዎች የመጣ ነው፤ የአሬና ግቤት እያንዳንዱን እሴት ወደ ምንጩ ያገናኛል።

SmolVLA ጊዜውን የሚያጠፋው የት ነው

AY-Robots SmolVLAን በአንድ የድርጊት እርምጃ 245 ms እና ACT በ20 ms በየፖሊሲ ካታሎግ ውስጥ ይዘረዝራል። TinyVLA በአንድ የድርጊት ትንበያ 14 ms ሪፖርት ያደርጋል። እነዚህ ቁጥሮች ሊነፃፀሩ አይችሉም፣ እና እንደነበሩ አድርጎ መውሰድ በዚህ ርዕስ ውስጥ በጣም የተለመደው ስህተት ነው፡ አንዳንዶች አንድ የፊት ማለፊያ ጊዜ ይወስዳሉ፣ አንዳንዶች ደግሞ ያንን ማለፊያ በአንድ ክፍል ላይ ይከፋፍሉታል አንዴ የድርጊት ክፍፍል ሲከፋፈለው።

  • SmolVLA በአንድ የፊት ማለፊያ 50 ድርጊቶችን ያመነጫል እና ሁሉንም 50 ያከናውናል። ወረቀቱ በእውነተኛ ሮቦቶች ላይ በሚጠቀምበት 30 fps፣ አንድ ግምት ወደ 1.7 ሰከንድ የሚሆን እንቅስቃሴን ይሸፍናል።
  • አሲንክሮነስ ግምት የአሁኑ እየተፈጸመ እያለ ቀጣዩን ክፍል ያሰላል፡ 9.7 ሰ አማካይ የተግባር ማጠናቀቂያ ከ13.75 ሰ ሲንክሮነስ ጋር ሲነፃፀር፣ በግምት 30 በመቶ ፈጣን ነው፣ እና በቋሚ 60 ሰከንድ መስኮት ውስጥ 19 የመምረጥ እና የማስቀመጥ ዑደቶች ከ9 ጋር ሲነፃፀሩ።
  • የስኬት መጠኖች የተሻሉ ከመሆን ይልቅ ተመጣጣኝ ነበሩ፣ 78.3 ሲንክሮነስ ከ73.3 አሲንክሮነስ ጋር። አሲንክሮነስ ፍጥነትን እንጂ ትክክለኛነትን አይገዛም።
  • የድርጊት ክፍፍል የሂሳብ መዘግየትን እንጂ የአውታረ መረብ መዘግየትን አይሰውርም፣ እና ፖሊሲው ለ50 ድርጊቶች ቁርጠኛ ስለሆነ ምላሽ የመስጠት አቅሙን ይቀንሳል።
የርቀት ግምት ነፃ አይደለም፣ እና ምንም መድረክ ፊዚክስን አያስተካክልም።

AY-Robots የእርስዎን ፖሊሲ የሚያገለግል የክላውድ ጂፒዩ ፖድ በራስ-ሰር ማቅረብ ይችላል፣ የአካባቢው ሮቦት ደንበኛ ከዚያ የመጨረሻ ነጥብ ጋር ሲነጋገር፣ እና ፖዱ በዝምታ ከማስከፈል ይልቅ ራሱን የሚያጠፋ ስራ ፈት የጥበቃ ሰዓት ይይዛል። የማያደርገው ነገር የህዝብ-ኢንተርኔት ዙር ጉዞን ማስወገድ ነው። እዚህ ያሉት አምስቱ ፖሊሲዎች ላይ ያለው የቁጥጥር ዑደት ምንም አይነት ኔትወርክ ከመኖሩ በፊት በአንድ የድርጊት ደረጃ ከ20 እስከ 485 ms ነው፣ ስለዚህ የርቀት ግምት ለቀርፋፋ ማንሳት እና ማስቀመጥ የሚቻል እንጂ ለፈጣን ምላሽ ሰጪ እንቅስቃሴ አይደለም።

የAY-Robots ፖሊሲዎች ንጽጽር ሰንጠረዥ GR00T N1.7፣ GR00T N1.5፣ Pi0.5፣ SmolVLA እና ACTን ከፓራሜትር ብዛት፣ ከሚያስፈልገው የጂፒዩ ደረጃ፣ በአንድ የድርጊት ደረጃ የግምት መዘግየት እና እያንዳንዳቸው የሚያስፈልጋቸውን ዝቅተኛው የትዕይንቶች ብዛት ያሳያል።
SmolVLA በ~450 M እና ACT በ~80 M ባለ 24 GB ካርድ ላይ የሚገጥሙት ሁለቱ ናቸው። ሌሎቹ ሶስቱ A100 ወይም H100 80 GB ያስፈልጋቸዋል።

SmolVLAን በአንድ የሸማች ካርድ ላይ ማስተካከል

በ lerobot 0.6.1 ላይ ያለው በእጅ የሚሰራው መንገድ፣ በ23 ኦገስት 2026 ያለው የአሁኑ የPyPI ልቀት። ከዚህ በታች ያለው ሁሉ የመጣው ከHugging Face lerobot SmolVLA ሰነድ ነው፣ በተመሳሳይ ቀን የተገኘ፤ የተመራው ስሪት የበለጠ ቀላል ነው።

  1. 1
    ለሮቦትን በsmolvla ተጨማሪ ይጫኑ

    የSmolVLA ጥገኞች አማራጭ ተጨማሪ ናቸው፣ የመሰረታዊ ጭነት አካል አይደሉም። ያለሱ መጫን እና ከዚያ የፖሊሲው አይነት የማይታወቅ መሆኑን ማሰብ በተለምዶ የሚባክን ግማሽ ሰዓት ነው።

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    በቂ ክፍሎች ያለው የመረጃ ስብስብ ያግኙ

    ሰነዶቹ ወደ 50 የሚጠጉ ክፍሎችን ይመክራሉ እና ተመሳሳይ ስራ በ25 ክፍሎች በቂ እንዳልነበረ ይገልጻሉ። AY-Robots ዝቅተኛውን በ30 ያደርገዋል። የራስዎን ይመዝግቡ፣ ወይም ከመረጃ ስብስብ ማውጫው ይጀምሩ

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    ጥሩ ማስተካከያውን ይጀምሩ

    ከለሮቦት መመሪያ የተወሰደ ትዕዛዝ፣ ያልተቀየረ። ሰነዶቹ 20000 እርምጃዎች በአንድ A100 ላይ በግምት 4 ሰዓታት እንደሚወስዱ ይገልጻሉ። በ24 ጂቢ ካርድ ላይ፣ ረዘም ያለ ጊዜ ይጠብቁ እና ይለኩት።

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    እስኪገጥም ድረስ የባች መጠኑን ይቀንሱ

    batch_size=64 በሰነድ የተደገፈ ምሳሌ ነው፣ ስለ ካርድዎ የተሰጠ ቃል አይደለም። ሰነዶቹ የመጫኛ ጊዜዎች አጭር እስከሆኑ ድረስ በትንሹ እንዲጀምሩ እና እንዲጨምሩ ይመክራሉ።

    bash
    lerobot-train --help
  5. 5
    የፍተሻ ነጥቡን በክንዱ ላይ ያውጡ

    ተመሳሳይ ቤተ-መጽሐፍት፣ አንድ ትዕዛዝ። የእውነተኛ ጊዜ ቸንኪንግ ባንዲራዎች በሰነዶቹ ውስጥ አስተያየት ተሰጥቶባቸዋል እና ዝቅተኛ ኃይል ባላቸው ሃርድዌሮች ላይ የሚያስፈልጉት ናቸው።

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
የፍተሻ ነጥቡ የሚቀርበው ውጤት ነው

የቱንም መንገድ ቢከተሉ፣ የፍተሻ ነጥብ እና ያንን ያመረተውን ውቅር ያገኛሉ። የመረጃ ስብስብ ክለሳውን፣ የእርምጃ ቆጠራውን እና ዘሩን ከጎኑ ያስቀምጡ። ለሮቦት በነባሪ ወደ ዘር 1000 ያቀናጃል፤ የGR00T ጥሩ ማስተካከያ መግቢያ ነጥብ ምንም ዘር አያሳይም፣ ስለዚህ እነዚያ ሩጫዎች ቢት-ለ-ቢት ሊባዙ አይችሉም። አሰራሩ በስልጠና ሰነዶች ውስጥ።

አንድ ትንሽ VLA ወደ ክንድ ለማስገባት ሁለት መንገዶች

ማሽኑን እና የውድቀት ሁነታዎችን እርስዎ ይቆጣጠራሉ። ለSmolVLA ይህ ምክንያታዊ ነው፡ አንድ የፒፕ ተጨማሪ፣ አንድ የባቡር ትዕዛዝ፣ አንድ የሮልአውት ትዕዛዝ። ለTinyVLA ግን የቀዘቀዙ ፒኖች፣ የተበላሸ የDeepSpeed መንገድ እና እርስዎ እራስዎ የሚጽፉት የመረጃ ልወጣ ያለው የምርምር ማባዛት ነው።

  1. 24 ጂቢ ካርድ ያግኙ፣ ከ30 እስከ 50 ክፍሎችን ይመዝግቡ፣ የካሜራ ዥረቶችን ፍሬም በፍሬም ያረጋግጡ።
  2. pip install -e ".[smolvla]"፣ lerobot-train ከ lerobot/smolvla_base ጋር፣ ከዚያም የፍተሻ ነጥቡን ክንዱ በተሰካበት ማሽን ላይ ያቅርቡ።
  3. ለTinyVLA፡ የተለየ ኮንዳ አካባቢ፣ መረጃን ወደ HDF5 ቀይር፣ ስራውን በconstants.py ውስጥ አስመዝግብ፣ የzero2.json መንገዱን አስተካክል፣ train.shን ከስምንት ጂፒዩዎች ወደ አንድ ቅንስ።
ጥቅሞች
  • ካርዱ ከተከፈለ በኋላ በሰዓት ክፍያ የለም።
  • መደምደሚያው ከሰርቮዎቹ አጠገብ ነው፣ ፈጣን የቁጥጥር ዑደት ለማግኘት ብቸኛው መንገድ።
  • የፖሊሲውን ኮድ ማስተካከል ይችላሉ፣ እና TinyVLA በዚህ መንገድ ብቻ ይገኛል።
የሚለዋወጡ ነገሮች
  • አንድ 4090 እያንዳንዱን ~3 ቢ ፖሊሲ ያስወግዳል፣ ስለዚህ ከGR00T N1.7 ወይም Pi0.5 ጋር የአካባቢ ንጽጽር የለም።
  • የአካባቢ ማዋቀር እውነተኛው ስራ ነው። የTinyVLA ፒኖች ብቻ አንድ ቀን ሊያስወጡ ይችላሉ።
  • ምንም ወረፋ የለም፣ ምንም ዳግም ሙከራ የለም፣ ምንም የፍተሻ ነጥብ ማከማቻ የለም። በእርምጃ 14000 ላይ ዳግም ማስነሳት እንደገና መጀመር ማለት ነው።

አነስተኛ ሞዴል የተሳሳተ ምርጫ ሲሆን

ሁለቱም ወረቀቶች ከማጠቃለያዎቹ የበለጠ ጥንቃቄ የተሞላባቸው ናቸው። የTinyVLA ውድቀት ትንተና የተለየ ነው፡ የ0.4 ቢ ልዩነት መመሪያውን በተሳሳተ መንገድ በማንበብ ሶስት ጊዜ ወድቋል፣ ይህም ደራሲዎቹ በትናንሽ VLM ውስጥ ባለው ውስን የቋንቋ ግንዛቤ ምክንያት ነው ብለው ያምናሉ፣ እና ያ ሁነታ በ1.3 ቢ ጠፍቷል። SmolVLA ተመሳሳይ ኩርባን ከሌላኛው ጫፍ ያሳያል፡ ተመሳሳይ አርክቴክቸር ያለው የ2.25 ቢ ስሪት በLIBERO ላይ 88.75 እና በMeta-World ላይ 68.24 ያስመዘገበ ሲሆን የ0.45 ቢ ሞዴል ደግሞ 87.3 እና 57.3 አስመዝግቧል።

ከ1 ቢ በታች የሆነ VLA መምረጥ
የሚያሸንፍበት
  • 24 ጂቢ ካርድ ላይ ይገጥማል፣ ይህም አንድ ሙከራን ከአስር ዶላር ወደ ጥቂት ዶላር ይቀንሳል።
  • ከእጁ አጠገብ ለመስራት በቂ ፍጥነት ያለው፣ ስለዚህ በመቆጣጠሪያ ዑደት ውስጥ ምንም የአውታረ መረብ ዝላይ የለም።
  • አንድ ሰው ሊመዘግበው በሚችለው መረጃ ላይ በጥሩ ሁኔታ ይስተካከላል፣ በሺዎች ከሚቆጠሩት ይልቅ በአስር የሚቆጠሩ ክፍሎች።
  • የSmolVLA ክብደቶች፣ የውሂብ ዝርዝር እና ኮድ ይፋዊ ናቸው፣ ስለዚህ መጥፎ ውጤት ሊስተካከል ይችላል።
የሚጎድለው ነገር
  • ደካማ መመሪያ መከተል፡ አነስተኛ የቋንቋ መለኪያዎች፣ ተመሳሳይ የማጣቀሻ አገላለጾችን የመለየት ችሎታ ማነስ።
  • ያልመዘገቧቸውን ዝግጅቶች በተመለከተ አነስተኛ የቦታ እና የእይታ አጠቃላይነት።
  • ለዳታ ስብስብ ጉድለቶች የበለጠ ስሜታዊ፣ ለመደገፍ የሚያስችል አነስተኛ ቅድመ-ስልጠና።
  • ባለብዙ ተግባር እና የረጅም ጊዜ ስራ አሁንም ትላልቅ ሞዴሎችን ይደግፋል፣ የSmolVLA የራሱ የሆነውን 2.25 ቢ ልዩነት ጨምሮ።

ሊደረግ የሚገባው ንጽጽር TinyVLA ከSmolVLA ጋር አይደለም። SmolVLA ከACTበእርስዎ ተግባር ላይ ነው፣ እና የSmolVLA ወረቀት ለምን እንደሆነ የሚያብራራ ነው። ያለ ሮቦቲክስ ቅድመ-ስልጠና በአንድ ተግባር የሰለጠነው SmolVLA በሶስት SO-100 ተግባራት ላይ በአማካይ 40.0 አስመዝግቧል፣ ነጠላ-ተግባር ACT ደግሞ 48.3 አስመዝግቧል። ወደ 78.3 ከፍ የሚያደርገው የማህበረሰብ ቅድመ-ስልጠና እና ባለብዙ ተግባር ስልጠና ነው እንጂ አርክቴክቸሩ ብቻ አይደለም። በSO-101 ሌጎ ተግባር ላይ፣ ሁለቱም ነጠላ-ተግባር ሲሆኑ፣ SmolVLA ያሸንፋል፡ በስርጭት ውስጥ 90 ከ 70። ከዚያ SmolVLA ከPi0.5በጀት የሚፈቅድ ከሆነ።

በዚህ መጠን፣ የዳታ ስብስቡ ውጤቱን ይወስናል

ለመጥፎ ዳታ የሚሸፍን ቅድመ-ስልጠና አነስተኛ ነው፣ ስለዚህ በተበላሸ የዳታ ስብስብ ላይ ንጹህ የኪሳራ ከርቭ ጉድለቱን በልበ ሙሉነት የሚያባዛ ፖሊሲ ይሰጥዎታል። የlerobot ሰነዶች ስለ አወቃቀሩ ግልጽ ናቸው፡ 50 ክፍሎች በአምስት የኩብ አቀማመጦች፣ ለእያንዳንዱ አቀማመጥ 10፣ ሰርተዋል፤ 25 ግን አልሰሩም። ኪሳራው ጥሩ መስሎ ከታየ እና ክንዱ ምንም ጠቃሚ ነገር ካላደረገ፣ ከ ኪሳራው ይወድቃል፣ ፖሊሲው ምንም አያደርግምፖሊሲው በአንድ አቀማመጥ ላይ ብቻ ይሰራል ወይም በእርግጥም ጥቅም ላይ ሊውል የሚችል የVLA ስልጠና ዳታ መሰብሰብ ይጀምሩ።

አምስት ፖሊሲዎች፣ አንድ የንጽጽር ሠንጠረዥ

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA እና ACT በእውነተኛ የፓራሜትር ብዛት፣ ለእያንዳንዱ የድርጊት እርምጃ የማመዛዘን መዘግየት፣ እያንዳንዱ የሚያስፈልገው የጂፒዩ ደረጃ እና ጠቃሚ ነገር ከማድረጉ በፊት ያለው ዝቅተኛው የክፍሎች ብዛት።

ፖሊሲዎቹን ያነጻጽሩ

እርምጃ ሊወስዱበት የሚችሉበት የውሳኔ ሠንጠረዥ

የእርስዎ ሁኔታበዚህ ይጀምሩለምን
አንድ ተግባር፣ ጥሩ ማሳያዎች፣ ቋንቋ የለምACT~80 M, 20 ms, 24 GB card, no base model to download
ጥቂት ተዛማጅ ተግባራት፣ ለእያንዳንዱ አንድ መመሪያSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
በተለይ የTinyVLA ውጤትን ማባዛትTinyVLA-B or TinyVLA-Hሪፖው ብቸኛው መንገድ ነው፡ የተገለለ አካባቢ፣ የተቀየረ ዳታ
ባለብዙ ተግባር፣ የተለያዩ መመሪያዎች፣ A100 በጀትGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
ገና ሮቦት የለምእውነተኛ ክንድ ያሽከርክሩበወረፋ ላይ የተመሰረተው የቀጥታ ክንድ ምዝገባም ሆነ ሃርድዌር አያስፈልገውም

ለመጨረሻው ረድፍ፣ ቀጥታ ክንድ አካውንት ሳያስፈልግዎት ከብሮውዘር ሊነዱት የሚችሉትን አካላዊ SO-100 ያሰራጫል፣ እና ለመጀመር ሦስቱ መንገዶች ቀሪውን ይሸፍናል። SO-100 እዚህ ያለው የማጣቀሻ ክንድ ነው፣ በግምት ከ110 እስከ 150 ዩሮ የሚገመት ክፍሎች ያሉት፣ ከሙሉ የማዋቀር መመሪያ ጋር።

ከ1 ቢ በታች ከሆኑ ሞዴሎች በኋላ የሚመጣው ምንድን ነው

የፓራሜትር ብዛትን መቀነስ VLAን ርካሽ ለማድረግ አንዱ መንገድ ነው እንጂ በግልጽ አሸናፊው አይደለም። OpenVLA-OFT (arXiv 2502.19645) የ7 ቢ ባክቦን ይዞ የሚቆይ ሲሆን ድርጊቶች እንዴት እንደሚፈቱ ብቻ ይለውጣል፣ በድርጊት ማመንጨት ፍሰት 26x ጭማሪ እና LIBERO ከ76.5 ወደ 97.1 በመቶ ከፍ ማለቱን ሪፖርት ያደርጋል። BitVLA (arXiv 2506.07530) የ1-ቢት BitNet b1.58 2B4T ባክቦን እያንዳንዱን ክብደት ሶስትዮሽ ያደርገዋል፣ 11.0x ያነሰ ማህደረ ትውስታ እና 4.4x ዝቅተኛ ከጫፍ እስከ ጫፍ መዘግየት ሪፖርት ያደርጋል ሙሉ-ትክክለኛነት OpenVLA-OFTን ሲያሟላ። X-VLA-0.9B (arXiv 2510.10274) በፍሰት ማዛመድ ከ1 ቢ መስመር ላይ ይገኛል።

የጋራው ክር፡ መዘግየቱ የሚኖረው በድርጊት ዲኮደር እንጂ በቋንቋ ሞዴል አይደለም። አንድ ፖሊሲ ስንት ፓራሜትሮች እንዳሉት ከመጠየቅዎ በፊት ድርጊቶችን እንዴት እንደሚያወጣ ይጠይቁ። አሬና 85 ሞዴሎች እና 332 ውጤቶች አሉት፣ እያንዳንዱም ከምንጩ ጋር የተገናኘ ነው፤ ሰፋ ያለ አጠቃላይ እይታ በየእኛ የVLA መግቢያ ውስጥ ይገኛል።

SmolVLAን በ RTX 4090 ላይ ማስተካከል እችላለሁን?

አዎ። SmolVLA 450 M ፓራሜትሮች ሲሆን AY-Robots በ RTX 4090 / 24 GB ደረጃ ላይ ያካሂደዋል። የ lerobot ምሳሌ --batch_size=64ን ይጠቀማል፣ ይህም ለካርድዎ ዋስትና ሳይሆን ምሳሌ ነው። ሰነዶቹ በትንሹ እንዲጀምሩ እና የመጫኛ ጊዜዎች አጭር እስከሆኑ ድረስ እንዲጨምሩ ይመክራሉ። ለ 20000 ደረጃዎች በ A100 ላይ ሰነዶቹ ከጠቀሱት ግምታዊ 4 ሰዓታት በላይ ረዘም ያለ ጊዜ ይጠብቁ።

TinyVLA በ lerobot ወይም በ AY-Robots ላይ ይገኛል?

ለሁለቱም አይሆንም። TinyVLA የሚገኘው በምርምር ማከማቻው ውስጥ ብቻ ነው፣ የመጨረሻው ኮሚት 11 March 2025 ሲሆን ቅርጸቱም LeRobot ሳይሆን ACT-style HDF5 ነው። AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA እና ACTን ያሰለጥናል። TinyVLAን ከፈለጉ እራስዎ መገንባት አለብዎት፣ እና በመጀመሪያ የ DeepSpeed config pathን በ scripts/train.sh ውስጥ ማስተካከል ይኖርብዎታል።

አንድ 450 M ሞዴል በእርግጥ ከ 3 B ሞዴል ጋር ተወዳዳሪ ነው?

በጸሐፊዎቹ የራሳቸው መለኪያዎች መሰረት፣ አዎ፡ በ LIBERO ላይ 87.3 ከ 86.0 ጋር ሲነጻጸር ከሮቦቲክስ-ቅድመ-ስልጠና ካለው Pi0 በ 3.3 B፣ እና 78.3 ከ 61.7 ጋር በሶስት እውነተኛ SO-100 ተግባራት ላይ፣ እዚያም ተመሳሳይ ወረቀት Pi0ን በ 3.5 B ይሰይማል። ገደቡ በተመሳሳይ ወረቀት ላይ ነው፡ ያለ ሮቦቲክስ ቅድመ-ስልጠና ነጠላ-ተግባር ሲሆን፣ SmolVLA ወደ 40.0 ይወርዳል፣ ከ ACT 48.3 በታች።

አንድ ትንሽ VLA ማንኛውንም ነገር ከማድረጉ በፊት ስንት ክፍሎች ያስፈልጉኛል?

AY-Robots ለ SmolVLA ዝቅተኛውን 30 ክፍሎች እና ለ ACT ዝቅተኛውን 50 ክፍሎች ያዘጋጃል። የ lerobot ሰነዶች ወደ 50 አካባቢ ይመክራሉ እና 25 ለተመሳሳይ ተግባር በቂ እንዳልሆነ ሪፖርት ያደርጋሉ። አወቃቀር እንደ ብዛት ሁሉ አስፈላጊ ነው፡ የወረቀቱ ስብስብ 5 የኩብ አቀማመጦችን በእያንዳንዳቸው 10 ክፍሎች ተጠቅሟል።

የታተሙ የዘገየ ቁጥሮች ለምን በጣም ይለያያሉ?

የተለያዩ ነገሮችን ይለካሉ። TinyVLA በአንድ A6000 ላይ ለእያንዳንዱ የድርጊት ትንበያ 14 ms ሪፖርት ያደርጋል፤ AY-Robots SmolVLAን በ 245 ms እና ACTን በ 20 ms ለእያንዳንዱ የድርጊት ደረጃ ይዘረዝራል። አንዳንድ አሃዞች አንድ የፊት ማለፊያን ይሸፍናሉ፣ አንዳንዶቹ ማለፊያን በ 50-ድርጊት ክፍል ይከፋፍላሉ፣ እና አብዛኛዎቹ የካሜራ ቀረጻን ወይም ወደ ሰርቮስ መጻፍን አያካትቱም።

የክላውድ ግምት የ GPU ችግርን ይፈታል?

በከፊል። AY-Robots ፖሊሲውን የሚያገለግል ፖድ በራስ-ሰር ያቀርባል፣ የአካባቢው ደንበኛ ደግሞ ከዛ የመጨረሻ ነጥብ ጋር ይገናኛል፣ ስራ ፈት የጥበቃ ሰዓት ስላለው በጸጥታ ክፍያ ከማስከፈል ይልቅ ራሱን ያጠፋል። የህዝብ-ኢንተርኔት የጉዞ ጊዜን ማስወገድ አይችልም፣ እና የቁጥጥር ዑደቱ ለእያንዳንዱ የድርጊት ደረጃ ከ 20 እስከ 485 ms ነው። ለቀስ በቀስ ማንሳት እና ማስቀመጥ ጥሩ ነው፣ ለፈጣን ምላሽ ሰጪ እንቅስቃሴ ግን አይደለም።

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started