AY-Robots கொள்கை ஒப்பீட்டு அட்டவணை, GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT ஆகியவற்றிற்கான அளவுரு எண்ணிக்கைகள், GPU அடுக்குகள் மற்றும் அனுமான தாமதத்துடன்.
SmolVLATinyVLAசிறிய VLAநுகர்வோர் GPULeRobot

சிறிய VLA மாதிரிகள்: TinyVLA, SmolVLA மற்றும் 1 பில்லியனுக்கும் குறைவான அளவு

AY-Robots ResearchAugust 23, 202619 நிமிட வாசிப்பு

TinyVLA மற்றும் SmolVLA ஆகியவை 1 பில்லியன் அளவுருக்களுக்குக் குறைவான ஒரு செயல்படும் VLA-வை வழங்குகின்றன. இரு ஆய்வுக் கட்டுரைகளிலிருந்தும் உண்மையான எண்கள், LeRobot இயல்புநிலைகள், அளவிடப்பட்ட தாமதம் மற்றும் 24 GB கார்டில் ஒரு இயக்கம் எவ்வளவு செலவாகும் என்பது பற்றிய தகவல்கள்.

கிட்டத்தட்ட ஒவ்வொரு பார்வை-மொழி-செயல் மாதிரி பற்றி எழுதப்படும் கட்டுரைகள் ஒரு தரவு மைய அட்டையை (datacentre card) அடிப்படையாகக் கொண்டவை. OpenVLA 7 பில்லியன் அளவுருக்களைக் (parameters) கொண்டுள்ளது. GR00T N1.7 மற்றும் Pi0.5 சுமார் 3 பில்லியன் அளவுருக்களைக் கொண்டுள்ளன, மேலும் அவற்றைச் செம்மைப்படுத்த (fine-tune) ஒரு A100 80 GB தேவைப்படுகிறது. உங்கள் மேசையில் உள்ள அட்டை ஒரு 4090 ஆக இருந்தால், அந்த வகை மாதிரிகள் எட்டாத தூரத்தில் உள்ளன.

இரண்டு ஆய்வுக் கட்டுரைகள் இதற்குத் தேவையில்லை என்று வாதிடுகின்றன. TinyVLA (arXiv 2409.12514, பிப்ரவரி 2025 இல் IEEE Robotics and Automation Letters ஆல் ஏற்றுக்கொள்ளப்பட்டது) ஒரு 400 மில்லியன் முதல் 1.3 பில்லியன் வரையிலான பேக்போன் (backbone) மற்றும் ஒரு டிஃப்யூஷன் ஆக்‌ஷன் ஹெட் (diffusion action head) ஆகியவற்றிலிருந்து ஒரு VLA ஐ உருவாக்குகிறது. SmolVLA (arXiv 2506.01844, ஜூன் 2, 2025 அன்று சமர்ப்பிக்கப்பட்டது) 450 மில்லியன் அளவுருக்களைத் திறந்த எடைகள் (open weights), திறந்த தரவு (open data) மற்றும் ஒரு நுகர்வோர் அட்டையில் (consumer card) இயங்கும் ஒரு ஸ்கிரிப்ட் உடன் வழங்குகிறது. இரண்டும் அளவிட்டவை மற்றும் 1 பில்லியனுக்கும் குறைவான அளவுருக்கள் என்ற வாதம் எங்கு நிற்கிறது என்பது இங்கே.

நீங்கள் தெரிந்து கொள்ள வேண்டியவை

  • TinyVLA மூன்று அளவுகளில் வருகிறது: 422 மில்லியன் மொத்த அளவுருக்களுடன் 101 மில்லியன் பயிற்சி செய்யக்கூடியவை, 740 மில்லியன் மொத்த அளவுருக்களுடன் 138 மில்லியன் பயிற்சி செய்யக்கூடியவை, 1.3 பில்லியன் மொத்த அளவுருக்களுடன் 143 மில்லியன் பயிற்சி செய்யக்கூடியவை. முதல் இரண்டு மட்டுமே 1 பில்லியனுக்குக் கீழே உள்ளன.
  • அதன் அட்டவணை IV, ஒரு A6000 இல் TinyVLA-1B க்கு ஒரு செயல் கணிப்புக்கு 14 மில்லி விநாடிகள் என்றும், OpenVLA-7B க்கு 292 மில்லி விநாடிகள் என்றும், சுருக்கப்பட்ட OpenVLA-1B க்கு 140 மில்லி விநாடிகள் என்றும் அளவிடுகிறது.
  • அந்த வேகத்தை ஹெட் (head) தான் தக்கவைக்கிறது, பேக்போன் (backbone) அல்ல: TinyVLA-H இன் டிஃப்யூஷன் ஹெட்டை ஒரு ACT ஹெட்டுடன் மாற்றினால், ஐந்து உண்மையான ரோபோ பணிகள் 94.0 சராசரியில் இருந்து ஒற்றை இலக்கங்களுக்குக் குறைகின்றன. ஒரு MLP ஹெட் எல்லா இடங்களிலும் 0 மதிப்பெண் பெறுகிறது.
  • SmolVLA 450 மில்லியன் அளவுருக்களைக் கொண்டுள்ளது, அதில் சுமார் 100 மில்லியன் செயல் நிபுணர் (action expert), 481 சமூக LeRobot தரவுத்தொகுப்புகள் மற்றும் 10.6 மில்லியன் பிரேம்களில் முன்-பயிற்சி பெற்றது. இது LIBERO இல் 87.3 ஐப் பதிவு செய்கிறது, அதேசமயம் ரோபோடிக்ஸ்-முன்-பயிற்சி பெற்ற Pi0 3.3 பில்லியனில் 86.0 ஐப் பதிவு செய்கிறது, மேலும் மூன்று உண்மையான SO-100 பணிகளில் 78.3 ஐப் பதிவு செய்கிறது, அதேசமயம் Pi0 3.5 பில்லியனில் 61.7 ஐப் பதிவு செய்கிறது.
  • அந்த முன்-பயிற்சி இல்லாமல் ஒற்றைப் பணியில் பயிற்சி பெற்றால், SmolVLA அந்த பணிகளில் 40.0 ஆகக் குறைகிறது, இது ACT இன் 48.3 ஐ விடக் குறைவு. சிறியது தானாகவே எளிதானது அல்ல.
  • TinyVLA க்கு LeRobot ஒருங்கிணைப்பு இல்லை மற்றும் ஒரு CUDA 11.7 வீல் ஸ்டேக்கை (wheel stack) பயன்படுத்துகிறது. SmolVLA lerobot இல் உள்ளது மற்றும் இங்குள்ள 24 GB அடுக்கில் ஒரு ரன்னுக்கு தோராயமாக 1 முதல் 3 USD செலவாகும்.

உண்மையில் ஒரு சிறிய VLA என்று கருதப்படுவது எது

ஒரு மாதிரி அட்டையில் உள்ள அளவுரு எண்ணிக்கை ஒரு எண் அல்ல. இது மொத்த எடைகள், அனுமானத்தின் போது ஏற்றப்பட்ட எடைகள் அல்லது சாய்வுகளைப் பெறும் எடைகள் ஆகியவற்றைக் குறிக்கலாம். . TinyVLA இரண்டையும் தெரிவிக்கிறது, மேலும் இடைவெளி பெரியது: TinyVLA-H மொத்தம் 1.3 பில்லியன் ஆனால் 143 மில்லியன் பயிற்சி செய்யக்கூடியது, ஏனெனில் விஷன் டவர் மற்றும் பெரும்பாலான மொழி மாதிரி உறைந்திருக்கும், அதே நேரத்தில் LoRA அடாப்டர்கள் மற்றும் ஆக்‌ஷன் ஹெட் நகரும். இந்த ஆய்வுக் கட்டுரை பயிற்சி செய்யக்கூடிய பங்கை சுமார் 5 சதவீதமாகக் குறிப்பிடுகிறது.

மாதிரிஅளவுருக்கள்முதுகெலும்புசெயல் தலைப்புஆதாரம்
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

இரண்டு வரிசைகள் விவாதிக்கத்தக்கவை. சுமார் 80 மில்லியனில் உள்ள ACT, இங்குள்ள மற்ற அனைத்தையும் விட சிறியது, ஆனால் அதற்கு மொழி மாதிரி இல்லை, எனவே இது ஒரு VLA அல்ல: இது ஒரு பணியைக் கற்றுக்கொள்கிறது மற்றும் மற்றொரு பணியைச் செய்யும்படி கூற முடியாது. 27 மில்லியனில் உள்ள Octo-Small, LLM முதுகெலும்பு அல்லாமல், T5-Base டெக்ஸ்ட் என்கோடர் மூலம் நிபந்தனைக்குட்படுத்தப்பட்டுள்ளது. நல்ல அடிப்படை மாதிரிகள், ஆனால் லேபிள் குறிப்பிடும் அறிவுறுத்தலைப் பின்பற்றுதலை இவை இரண்டும் வழங்குவதில்லை.

1 பில்லியன் கோடு தன்னிச்சையானது

TinyVLA-H, தலைப்புச் செய்தியின் முடிவுகளைக் கொண்ட மாறுபாடு, 1.3 பில்லியன் மற்றும் கோட்டிற்கு மேலே உள்ளது. ஒரு மாதிரி பயிற்சியின் போது 24 GB இல் பொருந்தி, அனுமானத்தின் போது உங்கள் கட்டுப்பாட்டு விகிதத்தை அடைகிறதா என்பதே சிறந்த கேள்வி. நீங்கள் இங்கு பயிற்சி செய்யக்கூடிய ஐந்து கொள்கைகள் கொள்கைகள் பக்கத்தில் உள்ளன; மற்ற அனைவரின் எண்களுடன் அதன் எண்களையும் நீங்கள் விரும்பினால், TinyVLA ஒரு அரினா உள்ளீட்டைக் கொண்டுள்ளது.

TinyVLA: வேகம் தலையிலிருந்து வருகிறது, முதுகெலும்பிலிருந்து அல்ல

மொழி மாதிரியைச் சிறியதாக்கியதால் அது வேகமாகச் செயல்பட்டது என்பது வெளிப்படையான புரிதல். ஆனால் ஆய்வுக் கட்டுரையின் நீக்குதல் பகுப்பாய்வு வேறுவிதமாகக் கூறுகிறது. OpenVLA-வின் 7 B முதுகெலும்பை தோராயமாக 1 B முதுகெலும்புடன் மாற்றியபோது, ஒரு செயலுக்கான கணிப்பு 292 ms இலிருந்து 140 ms ஆகக் குறைந்தது, இது 2x ஆதாயம். TinyVLA-H, ஒப்பிடக்கூடிய அளவுரு எண்ணிக்கையுடன், அதே கார்டில் 14 ms இல் இயங்குகிறது. மற்ற 10x ஆதாயம் செயல் தலையிலிருந்து வருகிறது.

மாடல்ஒரு செயலுக்கான கணிப்புஅளவிடப்பட்டது
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA, மொழி மாதிரி தலை வழியாக, ஒவ்வொரு செயல் பரிமாணத்திற்கும் ஒரு தனித்த டோக்கனாக, தானாகவே செயல்களை வெளியிடுகிறது. TinyVLA ஒரு டிஃப்யூஷன் டீகோடரை இணைக்கிறது, அது முழு தொகுதியையும் ஒரே நேரத்தில் உருவாக்குகிறது. அட்டவணை V, TinyVLA-H இன் கட்டமைப்பைக் கொண்டுள்ளது மற்றும் அதே ஐந்து உண்மையான ரோபோ பணிகளில் தலையை மட்டுமே மாற்றுகிறது. இது, ஃப்ளோ மேட்சிங் கொள்கைகள் உருவாக்குகின்றன என்பதற்கான மிகத் தெளிவான ஆதாரம், மற்றும் Pi0 டோக்கன் டீகோடிங்கிலிருந்து விலகிச் சென்றதற்கான காரணம்.

TinyVLA-H இல் தலைடென்னிஸ் வைமக் புரட்டுகியூப்களை அடுக்கவும்அறையை மூடுபெட்டியைத் திற
டிஃப்யூஷன் (droid_diffusion)90.098.398.396.786.7
செயல் துண்டுபடுத்தும் டிரான்ஸ்ஃபார்மர்13.38.38.313.323.3
பல அடுக்கு பெர்செப்ட்ரான்00000
TinyVLA எண்கள் எதைக் குறிக்கின்றன

292 / 140 / 14 மில்லி வினாடி புள்ளிவிவரங்கள் அட்டவணை IV இல் உள்ளன, அனைத்தும் ஒரு A6000 இல். இவை ஒரு செயல் கணிப்பிற்கானவை மற்றும் கேமரா பிடிப்பு, முன் செயலாக்கம் மற்றும் சர்வோக்களுக்கு தொடர் எழுதுதல் ஆகியவற்றைத் தவிர்த்து. வெளியிடப்பட்ட தாமதத்தை ஒரு குறைந்தபட்ச வரம்பாகக் கருதுங்கள், ஒருபோதும் கட்டுப்பாட்டு விகிதமாக அல்ல. எங்கள் சொந்த எண்களும் அதே வரம்பைக் கொண்டுள்ளன: இன்ஃபரன்ஸ் லேட்டன்சியைப் பார்க்கவும்.

TinyVLA பெற்ற மதிப்பெண்

பெஞ்ச்மார்க்நெறிமுறைTinyVLA-Hஅடிப்படைத் தரவுகள்
மெட்டாவர்ல்ட், 50 பணிகள், சிம்பல பணி, 50 டெமோக்கள், 3 சீட்கள்சிரமத்தின் அடிப்படையில் 77.6 / 21.5 / 11.4 / 15.8, சராசரி 31.6டிஃப்யூஷன் பாலிசி சராசரி 10.5
உண்மையான ஃபிராங்கா பாண்டா, 5 பணிகள்ஒரு பணிக்கு 100 பாதைகள், 20 சோதனைகள்94.0 சராசரிOpenVLA 68.3, டிஃப்யூஷன் பாலிசி 35.3
இரு கைகள் கொண்ட UR5, 3 பணிகள்பல பணி, ஒரு பணிக்கு 10 சோதனைகள்76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, டிஃப்யூஷன் பாலிசி 40.3 / 31.3 / 43.0

இரு-கை வரிசைக்கு, ஆய்வுக் கட்டுரை ஒரு சலிப்பான விளக்கத்தை அளிக்கிறது: OpenVLA ஆனது Open X-Embodiment இல் முன்-பயிற்சி செய்யப்பட்டுள்ளது, இது முழுவதுமாக ஒற்றை-கை தரவுகளைக் கொண்டுள்ளது, எனவே இரு-கை செயல்வெளி விநியோகத்திற்கு வெளியே உள்ளது மற்றும் அது பூஜ்ஜிய மதிப்பெண் பெறுகிறது. டிஃப்யூஷன் பாலிசி பேஸ்லைன் அந்த மூன்று பணிகளில் இரண்டில் TinyVLA-H ஐ வெல்கிறது. பின்னணி விவரங்கள் Open X-Embodiment விளக்கக் கட்டுரையில்.

AY-Robots அரினா லீடர்போர்டு, 85 VLA மாதிரிகள் மற்றும் 332 அளவுகோல் முடிவுகளைக் கொண்ட ஒரு வரிசைப்படுத்தக்கூடிய அட்டவணை, ஒவ்வொரு மதிப்பும் அது வந்த ஆய்வுக் கட்டுரை அல்லது மாதிரி அட்டையுடன் இணைக்கப்பட்டுள்ளது.
ஒவ்வொரு மாதிரியின் அளவுகோல் எண்கள் எங்கிருந்து வந்தன என்பதை நீங்கள் காணும்போது மட்டுமே குறுக்கு-மாதிரி அளவுகோல் எண்கள் ஒப்பிடத்தக்கவை.

TinyVLA களஞ்சியம், ஆகஸ்ட் 2026 நிலவரப்படி

ஆய்வுக் கட்டுரை நன்றாக உள்ளது. குறியீடு ஒரு ஆராய்ச்சி வெளியீடு. களஞ்சியம் github.com/liyaxuanliyaxuan/TinyVLA; அதன் README குறியீடு வெளியீட்டை 17 பிப்ரவரி 2025 என்றும் கடைசி கமிட் 11 மார்ச் 2025 என்றும் குறிப்பிடுகிறது. ஒரு ஆய்வுக் கட்டுரையை மீண்டும் உருவாக்க இது நன்றாக இருக்கும், ஆனால் பராமரிக்கப்படும் ஒரு நூலகத்தை நீங்கள் விரும்பினால் இது ஒரு சிக்கலாகும்.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README இலிருந்து நிறுவல் வரிசை, 2026-08-23 அன்று களஞ்சியத்துடன் சரிபார்க்கப்பட்டது.
சார்பு முனைகள் ஒரு நாளை விழுங்கும் பொறி

requirements.txt ஆனது torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 மற்றும் CUDA ஸ்டேக்கை 11.x வீல்களுக்குப் பயன்படுத்துகிறது: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README ஆனது Python 3.10 ஐக் கேட்கிறது; lerobot 0.6.1 ஆனது 3.12 அல்லது அதற்குப் புதிய பதிப்பைக் கோருகிறது, எனவே இரண்டும் ஒரு சூழலைப் பகிர முடியாது. உங்கள் GPU தலைமுறைக்கு ஒரு torch 2.0.1 உருவாக்கம் உள்ளதா என்பதை முதலில் உறுதிப்படுத்தவும். ஒருவேளை VRAM இல் ஒரு செயல்பாடு நின்றுவிட்டால், நினைவகப் பற்றாக்குறை சரிபார்ப்புப் பட்டியல் யூகிப்பதை விட வேகமாக இருக்கும்.

TinyVLA ஆனது வாசிப்பதில்லை LeRobot தரவுத்தொகுப்புகள். அதன் வடிவம் ACT-பாணி HDF5: செயல், language_raw, மற்றும் பல-பார்வை படங்கள், joint_positions, qpos மற்றும் qvel கொண்ட ஒரு அவதானிப்புக் குழு. களஞ்சியம் RLDS உள்ளீட்டிற்காக data_utils/rlds_to_h5py.py ஐ வழங்குகிறது, மேலும் ஒவ்வொரு பணியும் aloha_scripts/constants.py இல் அதன் dataset_dir, episode_len மற்றும் camera_names உடன் கையால் பதிவு செய்யப்படுகிறது. உங்கள் எபிசோடுகள் lerobot இலிருந்து அல்லது டெஸ்க்டாப் கிளையன்ட் இலிருந்து வந்திருந்தால், மாற்றத்தை நீங்கள் தான் செய்ய வேண்டும்.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh இலிருந்து சுருக்கப்பட்டது. மேலே உள்ள ஒவ்வொரு கொடியும் மதிப்பும் அனுப்பப்பட்ட கோப்பில் உள்ளது.
  • --num_gpus=8 என்பது எட்டு கார்டு நோடை (node) குறிக்கிறது. இதை 1 ஆக அமைத்து, பேட்ச் அளவை 32க்குக் கீழே குறைக்கவும். ஒற்றை-GPU மாறுபாடு (variant) அப்ஸ்ட்ரீமில் அனுப்பப்படவில்லை, எனவே இந்த கட்டளையை 4090 இல் அப்படியே இயக்க முடியாது.
  • --deepspeed scripts/zero2.json என்பது மேல்-நிலை ஸ்கிரிப்ட்ஸ் கோப்பகத்தில் இல்லாத ஒரு கோப்பைக் குறிக்கிறது. DeepSpeed உள்ளமைவுகள் llava-pythia/scripts/zero2.json இல் அனுப்பப்படுகின்றன. உங்கள் முதல் இயக்கத்திற்கு முன் பாதையைச் சரிசெய்யவும்.
  • README ஆனது வெளியீட்டு கோப்பகத்தின் பெயரில் llava_pythia ஐக் கொண்டிருக்க வேண்டும், மேலும் LoRA இயக்கப்பட்டிருந்தால் lora ஐயும் கொண்டிருக்க வேண்டும்.
  • பேக்போன் ஒரு தனி பதிவிறக்கம்: lesjie/Llava-Pythia-400M, -700M அல்லது -1.3B. lerobot/smolvla_base ஐ நீங்கள் சுட்டிக்காட்டுவது போல, ஒரு கொள்கையை சுட்டிக்காட்ட ஒரு ஒற்றை அடிப்படை செக்பாயிண்ட் (checkpoint) இல்லை.

SmolVLA: இன்று மதியம் நீங்கள் இயக்கக்கூடிய 1 பில்லியனுக்கும் குறைவான மாதிரி

SmolVLA ஒரு பராமரிக்கப்படும் நூலகத்திற்குள் அதே வாதத்தை முன்வைக்கிறது. இது SmolVLM2-500M-Video-Instruct பேக்போனில் 450 M அளவுருக்களைக் கொண்டுள்ளது, மேலும் அதன் செயல்திறன் சிறியதாக இருப்பதற்கான கூற்றிலிருந்து வருவதை விட, configuration_smolvla.py இலிருந்து நீங்கள் படிக்கக்கூடிய அமைப்புகளிலிருந்து வருகிறது.

configuration_smolvla.py இல் உள்ள அமைப்புஇயல்புநிலைஅதன் பயன்
num_vlm_layers16முதல் 16 மொழி மாதிரி அடுக்குகளை மட்டுமே இயக்குகிறது
expert_width_multiplier0.75செயல் நிபுணரின் மறைக்கப்பட்ட அளவு VLM இன் 75 சதவீதம்
self_attn_every_n_layers2சுய-கவனம் குறுக்கு-கவனத்துடன் மாறி மாறி செயல்படுகிறது
chunk_size / n_action_steps50 / 50ஒரு பாஸ் 50 செயல்களை வெளியிடுகிறது, மேலும் அனைத்து 50 செயல்களும் செயல்படுத்தப்படுகின்றன
num_steps10ஃப்ளோ மேட்சிங் டினாய்சிங் 10 படிகளில் சரிசெய்யப்பட்டுள்ளது
tokenizer_max_length48அறிவுறுத்தல் 48 டோக்கன்களாகக் குறைக்கப்படும்
freeze_vision_encoder / train_expert_onlyTrue / Trueஃபைன்-ட்யூனிங் நிபுணரை நகர்த்துகிறது, விஷன் டவரை அல்ல
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000இது ஆய்வுக் கட்டுரையின் செய்முறை அல்ல: அதன் முன்-பயிற்சி 200000 படிகளில் 100-படி வார்ம்அப்பைப் பயன்படுத்தியது

முன்பயிற்சியானது 481 சமூக LeRobot தரவுத்தொகுப்புகள், 22.9 K எபிசோடுகள் மற்றும் 10.6 M பிரேம்களை 4 GPU-களில், 200000 படிகளில் 256 உலகளாவிய தொகுப்பில் பயன்படுத்தியது; இந்த ஆய்வு முழு திட்டத்தையும் சுமார் 30 K GPU மணிநேரம் என மதிப்பிடுகிறது. கவனிக்க வேண்டிய ஒரு எண்: Hugging Face வெளியீட்டு வலைப்பதிவு 487 தொகுக்கப்பட்ட தரவுத்தொகுப்புகளைக் குறிப்பிடுகிறது, அதேசமயம் ஆய்வுக் கட்டுரையின் அட்டவணை 481 என்று கூறுகிறது. நாங்கள் ஆய்வுக் கட்டுரையின் எண்ணிக்கையைப் பயன்படுத்துகிறோம் மற்றும் இந்த முரண்பாட்டைப் பதிவு செய்கிறோம்.

AY-Robots இல் உள்ள SmolVLA மாதிரிப் பக்கம், அளவுருக்களின் எண்ணிக்கை, 24 GB GPU அடுக்கு, ஒரு செயல் படிக்கு ஊகிக்கும் தாமதம் மற்றும் குறைந்தபட்ச எபிசோடுகளின் எண்ணிக்கையைக் காட்டுகிறது.
தளத்தின் SmolVLA பக்கம்: 450 M அளவுருக்கள், ஒரு செயல் படிக்கு 245 ms, RTX 4090 அடுக்கு, குறைந்தபட்சம் 30 எபிசோடுகள்.
அளவுகோல்SmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO சராசரி, பல-பணி87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World சராசரி, பல-பணி57.368.2447.9 (3.5 B, robotics-pretrained)-
உண்மையான SO-100, 3 பணிகள், பல-பணி பயிற்சி78.3-61.7 (3.5 B)-
உண்மையான SO-100, 3 பணிகள், ஒற்றை-பணி, ரோபோடிக்ஸ் முன்பயிற்சி இல்லை40.0--48.3
SO-101 லெகோ எடுத்து வைக்கும் பணி, ஒற்றை-பணி, விநியோகத்தில்90--70
SO-101 லெகோ எடுத்து வைக்கும் பணி, ஒற்றை-பணி, விநியோகத்திற்கு வெளியே50--40
முழு அட்டவணையையும் படிக்கவும், தலைப்பு வரிசையை மட்டும் அல்ல

LIBERO ஒரு உருவகப்படுத்துதல் ஆகும், மேலும் அங்குள்ள அனைத்து திறமையான மதிப்பெண்களும் இப்போது எண்பதுகளில் உள்ளன. உண்மையான SO-100 வரிசை, அங்கு ஒரு 450 M மாதிரி 3.5 B மாதிரியை 16.6 புள்ளிகள் வித்தியாசத்தில் தோற்கடிக்கிறது, இது சுவாரஸ்யமானது; அதற்கு கீழே உள்ள வரிசை எதிர் எடை. சமூக முன்பயிற்சி மற்றும் பல-பணி பயிற்சியை நீக்கினால், அதே மாதிரி ACT-க்கு கீழ் 40.0 ஆக குறைகிறது. ஒரு சிறிய மாதிரி தானாகவே மோசமானது அல்ல, அது சிறந்தது என்பதல்ல என்பதே பாதுகாக்கக்கூடிய கூற்று.

ஒரு தற்செயல் நிகழ்வு உதவுகிறது: SmolVLA கட்டுரையின் Meta-World அட்டவணை TinyVLA இன் வெளியிடப்பட்ட எண்களை ஒரு அடிப்படையாகக் கொண்டுள்ளது, எனவே ஒருமுறை இரு மாடல்களும் ஒரே அட்டவணையில் உள்ளன, SmolVLA-0.45B 57.3 ஆகவும் TinyVLA-H 31.6 ஆகவும் உள்ளன. இது SmolVLA பயிற்சி Pi0 ஐ விட சுமார் 40 சதவீதம் வேகமாக 6 மடங்கு குறைவான நினைவகத்தில் நடப்பதாகவும் தெரிவிக்கிறது. இவை அனைத்தும் SmolVLA ஆசிரியர்களிடமிருந்து வந்தவை; அரங்க நுழைவு ஒவ்வொரு மதிப்பையும் அதன் மூலத்துடன் இணைக்கிறது.

SmolVLA அதன் நேரத்தை எங்கு செலவிடுகிறது

AY-Robots SmolVLA ஐ ஒரு செயல் படிக்கு 245 ms ஆகவும் ACT 20 ms ஆகவும் கொள்கை பட்டியல் இல் பட்டியலிடுகிறது. TinyVLA ஒரு செயல் கணிப்புக்கு 14 ms ஐப் புகாரளிக்கிறது. இந்த எண்கள் ஒப்பிட முடியாதவை, அவற்றை ஒப்பிடக்கூடியவை என்று கருதுவது இந்த தலைப்பில் மிகவும் பொதுவான தவறு: சில ஒரு முன்னோக்கி செல்லும் நேரத்தை, சில அந்த நேரத்தை ஒரு துண்டில் பிரித்து செயல் துண்டாக்கம் அதை ஈடுசெய்கிறது.

  • SmolVLA ஒரு முன்னோக்கி செல்லும் போது 50 செயல்களை வெளியிடுகிறது மற்றும் அனைத்து 50 செயல்களையும் செயல்படுத்துகிறது. உண்மையான ரோபோக்களில் கட்டுரை பயன்படுத்தும் 30 fps இல், ஒரு அனுமானம் சுமார் 1.7 வினாடிகள் இயக்கத்தை உள்ளடக்கியது.
  • ஒத்திசைவற்ற அனுமானம் தற்போதைய துண்டு இன்னும் செயல்படும் போது அடுத்த துண்டைக் கணக்கிடுகிறது: 13.75 வினாடிகள் ஒத்திசைவானதற்கு எதிராக சராசரியாக 9.7 வினாடிகள் பணி நிறைவு, தோராயமாக 30 சதவீதம் வேகமாக, மற்றும் ஒரு நிலையான 60 வினாடி சாளரத்தில் 9 க்கு எதிராக 19 பிக்-அண்ட்-பிளேஸ் சுழற்சிகள்.
  • வெற்றி விகிதங்கள் சிறப்பாக இருப்பதை விட ஒப்பிடக்கூடியதாக இருந்தன, 73.3 ஒத்திசைவற்றதற்கு எதிராக 78.3 ஒத்திசைவானது. ஒத்திசைவற்றது செயல்திறனை வாங்குகிறது, துல்லியத்தை அல்ல.
  • துண்டாக்கம் கணக்கீட்டு தாமதத்தை மறைக்கிறது, நெட்வொர்க் தாமதத்தை அல்ல, மேலும் இது கொள்கையை குறைவான எதிர்வினையாற்றுகிறது, ஏனெனில் இது 50 செயல்களுக்கு உறுதியளிக்கிறது.
ரிமோட் இன்ஃபரன்ஸ் இலவசமல்ல, மேலும் எந்த தளமும் இயற்பியலை சரிசெய்யாது

AY-Robots ஆனது உங்கள் கொள்கைக்கு சேவை செய்யும் ஒரு கிளவுட் GPU பாட்-ஐ தானாகவே வழங்க முடியும், உள்ளூர் ரோபோ கிளையன்ட் அந்த எண்ட்பாயிண்டுடன் பேசும்போது, மேலும் அந்த பாட் ஒரு செயலற்ற வாட்ச்டாக்-ஐக் கொண்டிருப்பதால், அது அமைதியாக பில் செய்வதை விட தன்னைத்தானே அழித்துக் கொள்கிறது. அது செய்யாதது என்னவென்றால், பொது இணைய ரவுண்ட் ட்ரிப்-ஐ நீக்குவதுதான். இங்குள்ள ஐந்து கொள்கைகளுக்கான கட்டுப்பாட்டு சுழற்சி, எந்த நெட்வொர்க்கும் இல்லாமல், ஒரு செயல் படிக்கு 20 முதல் 485 மில்லி விநாடிகள் ஆகும், எனவே, ரிமோட் இன்ஃபரன்ஸ் மெதுவான பிக்-அண்ட்-பிளேஸ்-க்கு சாத்தியமானது, வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல.

AY-Robots கொள்கைகள் ஒப்பீட்டு அட்டவணை GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT-ஐ அவற்றின் அளவுரு எண்ணிக்கை, தேவையான GPU அடுக்கு, ஒரு செயல் படிக்கு இன்ஃபரன்ஸ் லேட்டன்சி மற்றும் ஒவ்வொன்றிற்கும் தேவையான குறைந்தபட்ச எபிசோடுகளின் எண்ணிக்கையுடன் காட்டுகிறது
சுமார் 450 M அளவுள்ள SmolVLA மற்றும் சுமார் 80 M அளவுள்ள ACT ஆகிய இரண்டும் 24 GB கார்டில் பொருந்தும். மற்ற மூன்றுக்கு A100 அல்லது H100 80 GB தேவை.

ஒரு நுகர்வோர் கார்டில் SmolVLA-ஐ ஃபைன்-ட்யூன் செய்தல்

கையேடு வழி, lerobot 0.6.1 இல், 23 ஆகஸ்ட் 2026 நிலவரப்படி தற்போதைய PyPI வெளியீடு. கீழே உள்ள அனைத்தும் அதே நாளில் பெறப்பட்ட Hugging Face lerobot SmolVLA ஆவணத்திலிருந்து வந்தவை; வழிகாட்டப்பட்ட பதிப்பு மிகவும் எளிமையானது.

  1. 1
    smolvla கூடுதல் அம்சத்துடன் lerobot ஐ நிறுவவும்

    SmolVLA சார்புகள் ஒரு விருப்பமான கூடுதல், அடிப்படை நிறுவலில் ஒரு பகுதி அல்ல. அதை நிறுவாமல், கொள்கை வகை ஏன் தெரியவில்லை என்று ஆச்சரியப்படுவது பொதுவாக அரை மணிநேரத்தை வீணடிக்கும்.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    போதுமான எபிசோட்களுடன் ஒரு தரவுத்தொகுப்பைப் பெறுங்கள்

    ஆவணங்கள் சுமார் 50 எபிசோட்களைப் பரிந்துரைக்கின்றன, மேலும் 25 எபிசோட்களுடன் அதே பணி போதுமானதாக இல்லை என்று கூறுகின்றன. AY-Robots குறைந்தபட்சம் 30 ஆக நிர்ணயிக்கிறது. உங்களுடையதை பதிவு செய்யவும், அல்லது தரவுத்தொகுப்பு அடைவிலிருந்து தொடங்கவும்.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    நுண்ணிய சரிசெய்தலைத் தொடங்கவும்

    lerobot வழிகாட்டியிலிருந்து வரும் கட்டளை, மாற்றப்படாதது. ஆவணங்கள் 20000 படிகளை ஒரு A100 இல் தோராயமாக 4 மணிநேரம் என்று குறிப்பிடுகின்றன. ஒரு 24 GB கார்டில், அதிக நேரம் ஆகும் என்று எதிர்பார்க்கலாம் மற்றும் அதை அளவிடவும்.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    பொருந்தும் வரை தொகுதி அளவைக் குறைக்கவும்

    batch_size=64 என்பது ஆவணப்படுத்தப்பட்ட ஒரு எடுத்துக்காட்டு, உங்கள் கார்டைப் பற்றிய வாக்குறுதி அல்ல. ஆவணங்கள் சிறியதாகத் தொடங்கி, ஏற்றுதல் நேரம் குறைவாக இருக்கும் வரை அதிகரிக்க அறிவுறுத்துகின்றன.

    bash
    lerobot-train --help
  5. 5
    சரிபார்ப்புப் புள்ளியை கையில் பயன்படுத்தவும்

    அதே நூலகம், ஒரு கட்டளை. நிகழ்நேர துண்டாக்குதல் கொடிகள் ஆவணங்களில் கருத்துத் தெரிவிக்கப்பட்டுள்ளன, மேலும் அவை குறைந்த சக்தி வன்பொருளில் பயன்படுத்தப்பட வேண்டியவை.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
சரிபார்ப்புப் புள்ளிதான் வழங்கக்கூடியது

நீங்கள் எந்தப் பாதையை எடுத்தாலும், ஒரு சரிபார்ப்புப் புள்ளி மற்றும் அதை உருவாக்கிய உள்ளமைவுடன் முடிவடையும். தரவுத்தொகுப்பு திருத்தம், படி எண்ணிக்கை மற்றும் விதையை அதனுடன் வைத்திருங்கள். lerobot இயல்பாக விதை 1000 ஐப் பயன்படுத்துகிறது; GR00T இன் நுண்ணிய சரிசெய்தல் நுழைவுப் புள்ளி எந்த விதையையும் வெளிப்படுத்தவில்லை, எனவே அந்த இயக்கங்கள் பிட்-க்கு-பிட் மீண்டும் உருவாக்க முடியாதவை. பயிற்சி ஆவணங்களில் உள்ள இயக்கவியல்.

ஒரு சிறிய VLA ஐ ஒரு கையில் பெறுவதற்கான இரண்டு வழிகள்

நீங்கள் இயந்திரத்தையும் தோல்வி முறைகளையும் சொந்தமாக வைத்திருக்கிறீர்கள். SmolVLA க்கு அது நியாயமானது: ஒரு pip கூடுதல், ஒரு பயிற்சி கட்டளை, ஒரு வெளியீட்டு கட்டளை. TinyVLA க்கு இது உறைந்த பின்கள், உடைந்த DeepSpeed பாதை மற்றும் நீங்கள் சொந்தமாக எழுதும் தரவு மாற்றம் கொண்ட ஒரு ஆராய்ச்சி மறுஉருவாக்கம் ஆகும்.

  1. ஒரு 24 GB கார்டைப் பெறுங்கள், 30 முதல் 50 எபிசோட்களைப் பதிவு செய்யுங்கள், கேமரா ஸ்ட்ரீம்களை பிரேம் பை பிரேமாக சரிபார்க்கவும்.
  2. pip install -e ".[smolvla]", lerobot/smolvla_base க்கு எதிராக lerobot-train ஐ இயக்கவும், பின்னர் சரிபார்ப்புப் புள்ளியை கை இணைக்கப்பட்டுள்ள இயந்திரத்தில் வழங்கவும்.
  3. TinyVLA க்கு: தனி conda env, தரவை HDF5 ஆக மாற்றவும், constants.py இல் பணியைப் பதிவு செய்யவும், zero2.json பாதையை சரிசெய்யவும், train.sh ஐ எட்டு GPU களில் இருந்து ஒன்றாகக் குறைக்கவும்.
நன்மைகள்
  • கார்டுக்கு பணம் செலுத்தியவுடன் ஒரு மணிநேர கட்டணம் இல்லை.
  • ஊகித்தல் சர்வோக்களுக்கு அடுத்ததாக அமர்ந்திருக்கிறது, இது ஒரு வேகமான கட்டுப்பாட்டு சுழற்சியைப் பெறுவதற்கான ஒரே வழி.
  • நீங்கள் கொள்கை குறியீட்டை சரிசெய்யலாம், மேலும் TinyVLA இந்த வழியில் மட்டுமே கிடைக்கும்.
சாதக பாதகங்கள்
  • ஒரு 4090 ஒவ்வொரு ~3 B கொள்கையையும் நிராகரிக்கிறது, எனவே GR00T N1.7 அல்லது Pi0.5 க்கு எதிராக உள்ளூர் ஒப்பீடு இல்லை.
  • சூழல் அமைவுதான் உண்மையான வேலை. TinyVLA இன் பின்கள் மட்டுமே ஒரு நாளைக்கு செலவாகும்.
  • வரிசை இல்லை, மீண்டும் முயற்சி இல்லை, சரிபார்ப்புப் புள்ளி சேமிப்பு இல்லை. படி 14000 இல் ஒரு மறுதொடக்கம் மீண்டும் தொடங்குவதைக் குறிக்கிறது.

ஒரு சிறிய மாதிரி தவறான தேர்வாக இருக்கும்போது

இரண்டு ஆய்வுக் கட்டுரைகளும் சுருக்கங்களை விட இங்கு மிகவும் கவனமாக உள்ளன. TinyVLA இன் தோல்வி பகுப்பாய்வு குறிப்பிட்டது: 0.4 B மாறுபாடு அறிவுறுத்தலை தவறாகப் படித்ததால் மூன்று முறை தோல்வியடைந்தது, இதை ஆசிரியர்கள் சிறிய VLM இல் உள்ள வரையறுக்கப்பட்ட மொழி புரிதலுக்குக் காரணம் கூறுகின்றனர், மேலும் அந்த முறை 1.3 B இல் மறைந்துவிட்டது. SmolVLA அதே வளைவை மறுமுனையில் இருந்து காட்டுகிறது: ஒரே மாதிரியான கட்டமைப்பின் 2.25 B பதிப்பு LIBERO இல் 88.75 மற்றும் Meta-World இல் 68.24 மதிப்பெண்களைப் பெறுகிறது, அதேசமயம் 0.45 B மாதிரிக்கு 87.3 மற்றும் 57.3.

1 B க்கும் குறைவான VLA ஐத் தேர்ந்தெடுப்பது
எங்கு அது வெல்லும்
  • 24 GB கார்டில் பொருந்துகிறது, இது ஒரு சோதனையின் செலவை பல டாலர்களில் இருந்து ஒரு சில டாலர்களாகக் குறைக்கிறது.
  • கையின் அருகில் இயங்கும் அளவுக்கு வேகமாக உள்ளது, எனவே கட்டுப்பாட்டு சுழற்சியில் நெட்வொர்க் ஹாப் இல்லை.
  • ஒரு நபரால் பதிவு செய்யக்கூடிய தரவுகளில் நன்றாக சரிசெய்யப்படுகிறது, ஆயிரக்கணக்கான அத்தியாயங்களுக்குப் பதிலாக பத்துப் பன்னிரண்டு அத்தியாயங்கள்.
  • SmolVLA இன் எடைகள், தரவுப் பட்டியல் மற்றும் குறியீடு பொதுவில் உள்ளன, எனவே ஒரு மோசமான முடிவை பிழைத்திருத்த முடியும்.
எங்கு அது இழக்கிறது
  • பலவீனமான அறிவுறுத்தல் பின்பற்றுதல்: குறைவான மொழி அளவுருக்கள், ஒத்த குறிப்பு வெளிப்பாடுகளைப் பிரித்தறியும் திறன் குறைவு.
  • நீங்கள் பதிவு செய்யாத அமைப்புகளுக்கு குறைவான இடஞ்சார்ந்த மற்றும் காட்சி பொதுமைப்படுத்தல்.
  • தரவுத்தொகுப்பு குறைபாடுகளுக்கு அதிக உணர்திறன், நம்புவதற்கு குறைவான முன் பயிற்சி.
  • பல-பணி மற்றும் நீண்ட-கால வேலைகள் இன்னும் பெரிய மாதிரிகளுக்கு ஆதரவாக உள்ளன, இதில் SmolVLA இன் சொந்த 2.25 B மாறுபாடும் அடங்கும்.

இயக்கப்பட வேண்டிய ஒப்பீடு TinyVLA க்கு எதிராக SmolVLA அல்ல. இது SmolVLA க்கு எதிராக ACT உங்கள் சொந்த பணியில், மற்றும் SmolVLA கட்டுரை அதற்கான காரணம். ரோபோடிக்ஸ் முன் பயிற்சி இல்லாமல் ஒற்றை-பணியில் பயிற்சி பெற்ற SmolVLA, மூன்று SO-100 பணிகளில் சராசரியாக 40.0 மதிப்பெண் பெற்றது, அங்கு ஒற்றை-பணி ACT 48.3 ஐ நிர்வகித்தது. அதை 78.3 ஆக உயர்த்துவது சமூக முன் பயிற்சி மற்றும் பல-பணி பயிற்சி, கட்டிடக்கலை மட்டும் அல்ல. SO-101 லெகோ பணியில், இரண்டுமே ஒற்றை-பணி, SmolVLA வெற்றி பெறுகிறது: விநியோகத்தில் 70 க்கு எதிராக 90. பின்னர் SmolVLA க்கு எதிராக Pi0.5 பட்ஜெட் அனுமதித்தால்.

இந்த அளவில், தரவுத்தொகுப்பு முடிவை தீர்மானிக்கிறது

மோசமான தரவுகளை ஈடுசெய்ய குறைவான முன் பயிற்சி உள்ளது, எனவே குறைபாடுள்ள தரவுத்தொகுப்பில் ஒரு தெளிவான இழப்பு வளைவு, குறைபாட்டை நம்பிக்கையுடன் மீண்டும் உருவாக்கும் ஒரு கொள்கையை உங்களுக்கு வழங்குகிறது. lerobot ஆவணங்கள் அமைப்பு பற்றி வெளிப்படையாக உள்ளன: 5 கியூப் நிலைகளில் 50 எபிசோடுகள், ஒரு நிலைக்கு 10, வேலை செய்தது; 25 வேலை செய்யவில்லை. இழப்பு சரியாகத் தெரிந்தால் மற்றும் கை எதுவும் பயனுள்ளதாக செய்யவில்லை என்றால், இழப்பு குறைகிறது, கொள்கை எதுவும் செய்யவில்லை, கொள்கை ஒரு அமைப்பில் மட்டுமே வேலை செய்கிறது அல்லது உண்மையில் பயன்படுத்தக்கூடிய உயர்தர VLA பயிற்சித் தரவைச் சேகரித்தல் என்பதில் இருந்து தொடங்கவும்.

ஐந்து கொள்கைகள், ஒரு ஒப்பீட்டு அட்டவணை

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT ஆகியவை உண்மையான அளவுரு எண்ணிக்கைகள், ஒரு செயல் படிக்கு ஊகிக்கும் தாமதம், ஒவ்வொன்றிற்கும் தேவையான GPU அடுக்கு மற்றும் பயனுள்ள எதையும் செய்வதற்கு முன் குறைந்தபட்ச எபிசோட் எண்ணிக்கை ஆகியவற்றுடன்.

கொள்கைகளை ஒப்பிடுக

நீங்கள் செயல்படக்கூடிய ஒரு முடிவெடுக்கும் அட்டவணை

உங்கள் நிலைமைஇதனுடன் தொடங்கவும்ஏன்
ஒரு பணி, நல்ல விளக்கங்கள், மொழி இல்லைACT~80 M, 20 ms, 24 GB கார்டு, பதிவிறக்க அடிப்படை மாதிரி இல்லை
சில தொடர்புடைய பணிகள், ஒவ்வொன்றிற்கும் ஒரு அறிவுறுத்தல்SmolVLA450 M, lerobot இல், குறைந்தபட்சம் 30 எபிசோடுகள், ஒரு ஓட்டத்திற்கு 1 முதல் 3 USD
குறிப்பாக TinyVLA முடிவை மீண்டும் உருவாக்குதல்TinyVLA-B அல்லது TinyVLA-Hரெப்போ மட்டுமே வழி: தனிமைப்படுத்தப்பட்ட சூழல், மாற்றப்பட்ட தரவு
பல பணிகள், மாறுபட்ட அறிவுறுத்தல்கள், A100 பட்ஜெட்GR00T N1.7 அல்லது Pi0.5~3 B, ஒரு படிக்கு 152 ms மற்றும் 485 ms, ஒரு ஓட்டத்திற்கு 4 முதல் 12 USD
இன்னும் ரோபோ இல்லைஒரு உண்மையான கையை இயக்கவும்வரிசை அடிப்படையிலான நேரடி கைக்கு பதிவு மற்றும் வன்பொருள் தேவையில்லை

கடைசி வரிசைக்கு, நேரடி கை கணக்கு இல்லாமல் உலாவியில் இருந்து இயக்கக்கூடிய ஒரு SO-100 ஐ நேரடியாக ஒளிபரப்புகிறது, மேலும் தொடங்குவதற்கான மூன்று வழிகள் மீதமுள்ளவற்றை உள்ளடக்கியது. SO-100 இங்குள்ள குறிப்பு கை ஆகும், பாகங்களில் தோராயமாக 110 முதல் 150 யூரோக்கள் ஆகும், அதனுடன் ஒரு முழுமையான அமைவு வழிகாட்டி.

1 பில்லியனுக்கும் குறைவான மாடல்களுக்குப் பிறகு வருவது என்ன?

பாராமீட்டர் எண்ணிக்கையைக் குறைப்பது VLA ஐ மலிவாக மாற்றுவதற்கான ஒரு வழி, ஆனால் இது வெளிப்படையாக வெற்றி பெறும் வழி அல்ல. OpenVLA-OFT (arXiv 2502.19645) 7 B பேக்போனை வைத்துக்கொண்டு, செயல்கள் எவ்வாறு டிகோட் செய்யப்படுகின்றன என்பதை மட்டுமே மாற்றுகிறது, இது செயல் உருவாக்கும் செயல்திறனில் 26 மடங்கு அதிகரிப்பையும், LIBERO 76.5 சதவீதத்திலிருந்து 97.1 சதவீதமாக உயர்வதையும் தெரிவிக்கிறது. BitVLA (arXiv 2506.07530) ஒரு 1-பிட் BitNet b1.58 2B4T பேக்போனின் ஒவ்வொரு எடையையும் மும்மடங்காக மாற்றுகிறது, இது 11.0 மடங்கு குறைவான நினைவகத்தையும் 4.4 மடங்கு குறைவான எண்ட்-டு-எண்ட் தாமதத்தையும் தெரிவிக்கிறது, அதே நேரத்தில் முழு-துல்லியமான OpenVLA-OFT உடன் பொருந்துகிறது. X-VLA-0.9B (arXiv 2510.10274) ஃப்ளோ மேட்சிங்குடன் 1 B வரிசையில் அமைகிறது.

பொதுவான அம்சம்: தாமதம் மொழி மாதிரியில் இல்லை, செயல் டிகோடரில் தான் உள்ளது. ஒரு கொள்கை எத்தனை பாராமீட்டர்களைக் கொண்டுள்ளது என்று கேட்பதற்கு முன், அது எவ்வாறு செயல்களை வெளியிடுகிறது என்று கேளுங்கள். The arena 85 மாடல்களையும் 332 முடிவுகளையும் கொண்டுள்ளது, ஒவ்வொன்றும் அதன் மூலத்துடன் இணைக்கப்பட்டுள்ளன; ஒரு பரந்த கண்ணோட்டம் எங்கள் VLA அறிமுகத்தில்.

RTX 4090 இல் SmolVLA ஐ நான் ஃபைன்-ட்யூன் செய்ய முடியுமா?

ஆம். SmolVLA 450 M அளவுருக்களைக் கொண்டது, AY-Robots அதை RTX 4090 / 24 GB அடுக்கில் இயக்குகிறது. lerobot எடுத்துக்காட்டு --batch_size=64 ஐப் பயன்படுத்துகிறது, இது உங்கள் கார்டுக்கு ஒரு உத்தரவாதம் அல்ல, மாறாக ஒரு எடுத்துக்காட்டு; ஆவணங்கள் சிறியதாகத் தொடங்கி, ஏற்றுதல் நேரம் குறைவாக இருக்கும்போது அதிகரிக்க அறிவுறுத்துகின்றன. A100 இல் 20000 படிகளுக்கு ஆவணங்கள் குறிப்பிடும் தோராயமாக 4 மணிநேரத்தை விட அதிக நேரம் எதிர்பார்க்கலாம்.

TinyVLA lerobot இல் அல்லது AY-Robots இல் கிடைக்குமா?

இரண்டுக்கும் இல்லை. TinyVLA அதன் ஆராய்ச்சி களஞ்சியத்தில் மட்டுமே உள்ளது, கடைசி கமிட் 11 மார்ச் 2025, மற்றும் அதன் வடிவம் LeRobot ஐ விட ACT-பாணி HDF5 ஆகும். AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT ஐப் பயிற்றுவிக்கிறது. உங்களுக்கு TinyVLA தேவைப்பட்டால், அதை நீங்களே உருவாக்க வேண்டும், மேலும் scripts/train.sh இல் உள்ள DeepSpeed config பாதையை முதலில் சரிசெய்ய வேண்டும்.

450 M மாதிரி உண்மையில் 3 B மாதிரியுடன் போட்டியிட முடியுமா?

ஆசிரியர்களின் சொந்த அளவுகோல்களின்படி, ஆம்: LIBERO இல் 87.3 க்கு எதிராக 86.0, 3.3 B இல் ரோபோடிக்ஸ்-முன்பயிற்சி பெற்ற Pi0 உடன் ஒப்பிடும்போது, மற்றும் மூன்று உண்மையான SO-100 பணிகளில் 78.3 க்கு எதிராக 61.7, அதே ஆய்வுக் கட்டுரை Pi0 ஐ 3.5 B எனக் குறிப்பிடுகிறது. அதே ஆய்வுக் கட்டுரையில் வரம்பு உள்ளது: ரோபோடிக்ஸ் முன்பயிற்சி இல்லாத ஒற்றைப் பணியில், SmolVLA 40.0 ஆகக் குறைகிறது, இது ACT இன் 48.3 ஐ விடக் குறைவு.

ஒரு சிறிய VLA எதையும் செய்வதற்கு முன் எனக்கு எத்தனை எபிசோடுகள் தேவை?

AY-Robots SmolVLA இன் குறைந்தபட்சத்தை 30 எபிசோடுகளாகவும், ACT இன் குறைந்தபட்சத்தை 50 ஆகவும் நிர்ணயிக்கிறது. lerobot ஆவணங்கள் சுமார் 50 ஐ பரிந்துரைக்கின்றன மற்றும் அதே பணிக்கு 25 போதுமானதாக இல்லை என்று தெரிவிக்கின்றன. எண்ணிக்கை போலவே கட்டமைப்பும் முக்கியமானது: ஆய்வுக் கட்டுரையின் தொகுப்பு 5 கியூப் நிலைகளை ஒவ்வொன்றிற்கும் 10 எபிசோடுகளுடன் பயன்படுத்தியது.

வெளியிடப்பட்ட தாமத எண்கள் ஏன் இவ்வளவு வேறுபடுகின்றன?

அவை வெவ்வேறு விஷயங்களை அளவிடுகின்றன. TinyVLA ஒரு A6000 இல் ஒரு செயல் கணிப்புக்கு 14 ms ஐப் புகாரளிக்கிறது; AY-Robots SmolVLA ஐ ஒரு செயல் படிக்கு 245 ms ஆகவும் ACT ஐ 20 ms ஆகவும் பட்டியலிடுகிறது. சில புள்ளிவிவரங்கள் ஒரு ஃபார்வர்ட் பாஸை உள்ளடக்குகின்றன, சில ஒரு பாஸை 50-செயல் துண்டுகளாகப் பிரிக்கின்றன, மேலும் கிட்டத்தட்ட எதுவும் கேமரா பிடிப்பு அல்லது சர்வோக்களுக்கு எழுதுவதை உள்ளடக்கவில்லை.

கிளவுட் இன்ஃபரன்ஸ் GPU சிக்கலைத் தீர்க்கிறதா?

ஓரளவு. AY-Robots ஒரு பாலிசியை வழங்கும் ஒரு பாட்-ஐ தானாகவே வழங்குகிறது, அதே நேரத்தில் உள்ளூர் கிளையன்ட் அந்த இறுதிப்புள்ளியுடன் பேசுகிறது, ஒரு செயலற்ற வாட்ச்டாக் உடன், அது தானாகவே அழிந்துவிடும், அமைதியாக பில் செய்யாது. இது பொது-இணைய ரவுண்ட் டிரிப்பை அகற்ற முடியாது, மேலும் கட்டுப்பாட்டு சுழற்சி ஏற்கனவே ஒரு செயல் படிக்கு 20 முதல் 485 ms ஆகும். மெதுவான பிக்-அண்ட்-பிளேஸுக்கு நல்லது, ஆனால் வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started