Tabela krahasuese e politikave të AY-Robots që tregon GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT krah për krah me numrin e parametrave, nivelin e GPU-së, latencën e inferencës dhe numrin minimal të episodeve
modele-vlatrajnim-politikashzgjedhje-modelilerobotso-100

Cilën Politikë VLA Duhet të Trajnoni në 2026?

AY-Robots ResearchAugust 23, 202618 min lexuar

GR00T N1.7, Pi0.5, SmolVLA, ACT apo GR00T N1.5? Një tabelë vendimmarrjeje e përshtatur me situata reale, me numrat e publikuar të benchmark-ut, latencën, koston për ekzekutim dhe licencat pas çdo zgjedhjeje.

Pesë politika mund të trajnohen sot në një krah të klasës SO-100. Ato ndryshojnë me një faktor 24 në inferencë vonesë, 37 në numrin e parametrave dhe 12 në koston e një ekzekutimi, dhe nëse mund ta dërgoni rezultatin. Pesë karta modelesh nuk do ta zgjidhin këtë: asnjëra nuk i përgjigjet pyetjes që keni, cilën duhet të ekzekutoj së pari?

Çdo numër më poshtë është lexuar nga punimet, depozitat dhe kartat në gusht 2026. Numrat e platformës vijnë nga katalogu i politikave i AY-Robots; ku të dyja nuk pajtohen, të dyja shfaqen.

Versioni i shkurtër

  • Trajnoni ACT-në së pari nëse dyshoni në grupin tuaj të të dhënave: 1 deri në 3 USD për ekzekutim, asgjë e paratrajnuar për të mbuluar të dhënat e këqija.
  • GR00T N1.7 dhe Pi0.5 janë brenda gjysmë pike në LIBERO, 97.0 kundrejt 96.85 deri në 97.5. Ky nuk është një arsye për të zgjedhur asnjërën.
  • Pi0.5 është loja e përgjithësimit, jo loja e saktësisë, dhe më i ngadalti me 485 ms.
  • SmolVLA, me 450 M parametra, është i vetmi VLA këtu që rregullohet imët në një kartë 24 GB.
  • ACT me 20 ms është opsioni i vetëm për lëvizje të shpejtë reaktive. Licencat vendosin për pjesën tjetër.

Tabela e vendimeve

Situata juajTrajnoni këtëPse
Cilësia e grupit të të dhënave e paprovuarACTAsgjë e paratrajnuar nuk fsheh një grup të dhënash të dëmtuar, dhe dështimi kushton 1 deri në 3 USD.
I pasur me kontakte, me shumë hapa, i kushtëzuar nga gjuhaGR00T N1.797.0% në katër suita LIBERO, plus një hapësirë veprimi relative të fund-efektorit.
Lëvizje e shpejtë reaktive, inferencë te servotACT20 ms. Tjetri më i shpejtë është 7.6 herë më i ngadaltë.
Objekte të reja, skenë e re, botë e hapurPi0.5Ndërtuar për sjellje jashtë shpërndarjes, në deri në 104 vendndodhje.
Një kartë 24 GB, ende dëshironi gjuhëSmolVLA450 M parametra, një minimum prej 30 episodesh, funksionon lokalisht.
Riprodhimi i një ekzekutimi të regjistruar në 2025GR00T N1.5Vetëm nëse duhet: LeRobot tani e refuzon, peshat jo-komerciale.
Ky do të dërgohet si produktN1.7, SmolVLA or ACTN1.5 është jo-komercial, Pi0.5 përmban kushtet e Gemma-s, karta e SmolVLA-s nuk specifikon asnjë.

Pesë kandidatët

Të gjithë të pesë janë politika: korniza kamerash, pozicione nyjesh dhe, për katër prej tyre, një udhëzim gjuhe, i hartuar në një bllok objektivash të ardhshëm të nyjeve. Ajo që i ndan është sa shumë u mësua para se të arrinit ju.

PolitikaParametratVonesaNiveli i GPU-sëLokal?Episodet minFormatiKostoja
ACT~80 M20 ms24 GB cardpo50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardpo30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBjo50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBjo50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBjo50v3.04 to 12 USD

GR00T N1.7

Modeli aktual i NVIDIA-s model vizion-gjuhë-veprim, rreth 3 miliardë parametra, afërsisht 40 milionë të trajnuar gjatë fine-tuning. Depoja liston ndryshimet nga N1.6: shtylla kurrizore nga një model Eagle i shitur te Cosmos-Reason2-2B në Qwen3-VL, shtresat e difuzionit 32 në 16, dimensionet e gjendjes dhe veprimit 29 në 132, horizonti i veprimit 16 në 40.

Ajo që ka rëndësi në një krah të vogël është hapësira relative e veprimit të fund-efektorit: N1.7 parashikon ndryshime nga pozicioni aktual, gjë që lejon transferimin e 20 mijë orëve video njerëzore EgoScale në një politikë roboti. Specifikimet në faqen e N1.7, procedura në udhëzuesin e N1.7 në SO-100.

GA në depo, EA në kartën e modelit

README i Isaac-GR00T e deklaron N1.7 një version General Availability, me standarde dhe mbështetje të plota. Karta e tij në Hugging Face nuk është përditësuar: fusha Model Version ende shkruan GR00T N1.7 EA. Depoja është dokumenti më i ri.

GR00T N1.5

E njëjta shkallë 3 B, shtyllë kurrizore Eagle 2, SigLip2 dhe T5, kokë DiT me përputhje fluksi. Ekziston për të zgjeruar një që tashmë keni. Dy gjëra e bëjnë atë një parazgjedhje të dobët: peshat mbartin NVIDIA's one-way non-commercial licence, dhe versionet aktuale të LeRobot-it hoqën mbështetjen për N1.5. Shih .

Pi0.5

VLA-ja e Physical Intelligence me , tipi i politikës pi05. Punimi jep një VLM 2 B të inicializuar nga PaliGemma plus një ekspert veprimi 300 M, duke drejtuar robotin me 50 Hz; konfigurimi pi05 i LeRobot-it parazgjedh një bllok me 50 hapa, një sekondë me atë shpejtësi. Pika e shitjes janë vendet e paeksploruara: rreth 400 orë manipulim mobil në shtëpi reale, dhe një studim shkallëzimi mbi 3, 12, 22, 53, 82 dhe 104 vendndodhje, ku modeli me 104 vendndodhje përputhej me një kontroll të trajnuar në vetë shtëpitë e testimit.

Një kufizim, i theksuar në kartën lerobot/pi05_base: porti mbart vetëm kokën e veprimit që përputhet me fluksin. Parashikimi i nën-detyrave, tokenizimi i veprimeve dhe RL nuk u lëshuan upstream, dhe openpi thotë të njëjtën gjë për depozitën e vet. Faqja e Pi0.5 dhe udhëzuesi i Pi0.5 në SO-100 kanë pjesën tjetër.

Kurthi që të ha një pasdite: depozitat e mbyllura

Pi0.5 kërkon tokenizuesin e mbyllur google/paligemma-3b-pt-224 (gated: manual, megjithëse Google thotë se kërkesat përpunohen menjëherë). Pa e pranuar atë dhe pa ekzekutuar hf auth login në mjedisin e trajnimit, puna fillon, shkarkon për pak kohë, pastaj ndërpritet me një gabim autorizimi që duket si një defekt rrjeti. nvidia/GR00T-N1.7-3B nuk është i mbyllur, por shtylla kurrizore e tij nvidia/Cosmos-Reason2-2B është (gated: auto). Pastroni të dyja para se të vendosni në radhë; nëse një ekzekutim qëndron në pritje, faqja e radhës së ngecur liston çfarë duhet kontrolluar.

SmolVLA

450 M parametra, rreth 100 M në ekspertin e veprimit, në SmolVLM-2 me VLM të ngrirë dhe duke përdorur vetëm 16 shtresat e para të modelit të gjuhës. Paratrajnimi ishte të dhëna komunitare: 481 grupe të dhënash, 10.6 M korniza, nga të njëjtat krahë të lirë që përdorni. I vetmi VLA këtu që përshtatet në një kartë 24 GB, dhe i vetmi me një dysheme prej 30 epizodesh. Shih faqen e SmolVLA.

ACT

Nuk është një model themelor. Action Chunking Transformer nga ALOHA ka rreth 80 M parametra të trajnuar nga e para për detyrë, në 50 demonstrime me 50 Hz. Punimi raporton gjashtë detyra reale bimanuale nga rreth dhjetë minuta demonstrimesh secila, me 80 deri në 90 për qind në shembujt që thekson. Ideja e tij, copëtimi i veprimeve, është në çdo model në këtë faqe, dhe ablacionimi i tij ende mat efektin më mirë: mbi dy detyra të simuluara me ansamblimin kohor të fikur, suksesi rritet nga 1 për qind në k=1 në 44 për qind në k=100. Faqja e ACT ka pjesën tjetër.

Çfarë thonë në të vërtetë standardet

LIBERO është standardi i vetëm për të cilin raportojnë tre nga këto pesë: detyra të kushtëzuara nga gjuha në një Franka Panda të simuluar, të ndara në katër suita më poshtë me nga dhjetë detyra secila. NVIDIA zhvilloi 200 prova për suitë.

ModelHapësinorObjektQëllim10 (Gjatë)Mesatare
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Këto rreshta nuk janë rreptësisht të krahasueshëm

Çdo numër vjen nga një pajisje dhe buxhet i ndryshëm. GR00T ekzekutoi 20K hapa me grup global 640; shifra openpi është një pikë kontrolli 30K; porti LeRobot shtoi 6K hapa në një model bazë LIBERO. SmolVLA është një mospërputhje e mëtejshme: punimi i tij trajnon atë rresht në LIBERO nga e para, pa paratrajnim VLA, ndërsa tre mbi të rregullojnë pikat e kontrollit të paratrajnuara. Trajtoni 96.85 deri në 97.5 si një grup, dhe hendekun deri në 87.3% si real, por të blerë me 6.7x parametrat.

SimplerEnv tregon shpërndarjen, gjë që LIBERO nuk e bën. NVIDIA krahason N1.7 me N1.6, gjënë më të afërt publike me një delta gjeneracionale.

Suitë SimplerEnvMesatarja N1.6Mesatarja N1.7Lëkundja më e mirëLëkundja më e keqe
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Rreshti Bridge është i dobishmi: 5.7 pikë të fituara mesatarisht ndërsa put_eggplant_in_basket humbi 36 dhe put_eggplant_in_sink ra nga 33 në 2. Një gjeneratë e re lëviz shpërndarjen në vend që ta ngrejë atë, kështu që nëse detyra juaj ndodhet aty ku N1.7 u regresua, mesatarja nuk thotë asgjë.

Tabela e renditjes së arenës AY-Robots, një tabelë e renditshme me 85 modele vizion-gjuhë-veprim me 332 rezultate benchmark, çdo vlerë e lidhur me punimin ose kartën e modelit nga e cila erdhi
Arena përmban 85 modele VLA dhe 332 rezultate benchmark, secila e lidhur me punimin ose kartën e modelit të saj. E dobishme për të kontrolluar nëse një numër i cituar në një postim në blog është real.

Nga të pesë, vetëm punimi SmolVLA raporton për një krah të klasës SO-100: 78.3 për qind për SmolVLA dhe 61.7 për Pi0 në tre detyra, të dyja multi-task, kundrejt 48.3 për ACT të trajnuar single-task, që nuk është si për njësoj. Çiftimi i pastër është të dyja single-task në SO-101 pick-and-place: 90 kundrejt 70 në shpërndarje, 50 kundrejt 40 jashtë saj. Krahasoni në ACT kundrejt SmolVLA dhe Pi0.5 kundrejt SmolVLA, ose shfletoni arenën.

Vonesa dhe kostoja vendosin vendosjen

Vonesa e inferencës është kufizimi që njerëzit zbulojnë të fundit dhe pendohen të parët. Një politikë pesë pikë më e mirë në një standard, por gjysmë sekonde për hap veprimi duket më keq në tavolinën tuaj: dinamika e kontaktit nuk pret.

Një paralajmërim: shifra e GR00T nuk përputhet me kartën e NVIDIA-s, e cila mat 4 hapa denoise dhe një kamerë në 85.8 ms në një H100 në modalitetin eager, 48.6 ms me torch.compile, 27.9 ms përmes TensorRT të plotë. 152 ms këtu është një shifër e plotë e stack-ut me overhead shërbimi dhe më shumë se një kamerë, jo një kalim përpara.

Inferenca në distancë ka një kufi të fortë

Cikli 20 deri në 485 ms është i modelit, dhe udhëtimet vajtje-ardhje në internetin publik i shtohen kësaj. Inferenca në distancë është e realizueshme për pick-and-place të ngadaltë, jo për lëvizje të shpejtë reaktive. Nëse detyra juaj kërkon shpejtësi, inferenca qëndron pranë servove: ACT ose SmolVLA, lokalisht. Të lidhura: politika ngrin në mes të lëvizjes.

Një mënyrë për të fituar kohë pa ndryshuar modelin: punimi SmolVLA mat ekzekutimin sinkron, ku politika përfundon një bllok para se të parashikojë tjetrin, kundrejt asinkronit, ku parashikimi mbivendoset me ekzekutimin. Suksesi është i ngjashëm, 78.3 kundrejt 73.3, por i njëjti pick-and-place merr 9.7 sekonda në vend të 13.75, dhe në një dritare fikse roboti menaxhon 19 cikle në vend të 9.

Licencat, të kontrolluara sepse askush nuk i kontrollon

ModeliLicenca e peshaveLicenca e koditPërdorimi komercial
GR00T N1.7NVIDIA Open Model License; karta lejon përdorim komercialApache 2.0po
GR00T N1.5NVIDIA licencë njëkahëshe jokomercialeApache 2.0jo
Pi0.5metadata e kartës pi05_base lexon licencën: gemmaApache 2.0 (openpi, dokumentet LeRobot)lexoni të dyja, ato nuk pajtohen
SmolVLAnuk ka fushë licence në kartën smolvla_baseApache 2.0 (LeRobot)kodi po, peshat të padeklaruara
ACTnuk ekzistojnë pesha bazëApache 2.0 (LeRobot)po

Rreshti Pi0.5 kërkon kujdes. Dokumentacioni LeRobot pi05 deklaron Apache 2.0 në përputhje me openpi, ndërsa karta e Hub-it për lerobot/pi05_base përmban license: gemma. Të dyja janë aktive. GR00T N1.7 ka një version më të butë: README i Isaac-GR00T thotë kalimthi se N1.7 është plotësisht i licencueshëm komercialisht sipas Apache 2.0, ndërsa seksioni i saj i licencës dhe karta e modelit vendosin vetëm kodin nën Apache 2.0 dhe peshat nën NVIDIA Open Model License.

Parazgjedhjet që do të ekzekutoni në të vërtetë

Çdo formë trajnuesi vjen me një parazgjedhje, dhe ato nuk janë arbitrare. Ato të ACT-së janë të LeRobot-it: batch 8, lr 1e-5, 100000 hapa trajnimi, madhësia e bllokut 100, duke përputhur ACTConfig-un upstream dhe k=100 from the ACT paper. Një kolonë më poshtë është një kurth.

PolitikaBatchLRHapa maksimalëAkumulimi i gradientitAplikohet?Kontrolle shtesë
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Riprodhueshmëria, datë gusht 2026

Pika e hyrjes për fine-tuning të GR00T (launch_finetune.py, një CLI tyro) nuk ka fushë seed në dataclass-in e konfigurimit të saj, kështu që ekzekutimet nuk janë të riprodhueshme bit-për-bit. Repoja gjithashtu paralajmëron për 5 deri në 6 për qind variacion midis ekzekutimeve nga augmentimet jo-deterministike të imazheve, më e madhe se shumica e boshllëqeve të benchmark-ut të diskutuara online. Seed-i parazgjedhur i LeRobot është 1000. Kolona e akumulimit të gradientit përshkruan lerobot 0.5.1; versioni upstream 0.6.2 e ekspozon atë si --accelerator.gradient_accumulation.steps.

Kontrolli që ka më shumë rëndësi sesa zgjedhja e modelit

Është blloku i veprimit. Blloqet më të gjata japin lëvizje më të qetë dhe më pak gabime të përbëra, por politika është e angazhuar ndërsa blloku ekzekutohet, kështu që reagon me vonesë ndaj çdo gjëje që lëviz: e sigurt në një kub statik, e pashpresë në një kub rrotullues. Nëse tejkalon, shkurtimi i pjesës së ekzekutuar është më i mirë se ritrajnimi dhe është falas. Një nyje që ndalon shkurt është një problem tjetër; shih faqen e ndalimit të hershëm të nyjes.

  • ACT: ACTConfig parazgjedhur ka chunk_size 100 dhe n_action_steps 100. Ansambli kohor është i fikur dhe kërkon n_action_steps 1.
  • GR00T N1.7: horizonti i brendshëm shkoi nga 16 në 40, megjithatë shembulli SO-101 i LeRobot ende ekzekuton --policy.chunk_size=16 --policy.n_action_steps=16. Flaga e shpërndarjes u riemërua në --execution-horizon.
  • Pi0.5: një bllok me 50 hapa, nga të cilët receta LIBERO e LeRobot ekzekuton 10 përmes --policy.n_action_steps=10; me --policy.pretrained_path ajo kthehet në 50 nëse e lini pa specifikuar flagën.
  • SmolVLA: blloqe me 50 veprime, të dyja komandat të ekspozuara.

Si t'i shqyrtosh të pesë në një pasdite

Përgjigja më e lirë nuk është më shumë lexim. Shpenzoni rreth 15 USD dhe lëreni krahun t'ju tregojë: regjistroni një herë, trajnoni modelin e lirë së pari, përshkallëzoni pasi të ketë provuar se të dhënat janë të shëndosha. Struktura mund vëllimin, qëllimi i mbledhjes së të dhënave SO-100 dhe formatit të grupit të të dhënave LeRobot.

  1. 1
    Regjistroni 50 episode një herë

    Pesëdhjetë pastron terrenin për GR00T, Pi0.5 dhe ACT, dhe 30 të SmolVLA-s. Përsëritni çdo variacion në vend që të shpërndaheni: 50 episode në 5 pozicione kubi të trajnuara ku 25 nuk u trajnuan. Shih regjistroni grupin tuaj të parë të të dhënave.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Trajnoni ACT-në së pari, sepse nuk mund t'ju gënjejë

    Pa pesha të para-trajnuara, kështu që nëse e kryen detyrën fare, grupi juaj i të dhënave përmban detyrën. Nëse ACT nuk jep rezultate, rregulloni të dhënat. 1 deri në 3 USD, 2 deri në 5 orë në një kartë 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Ekzekutoni SmolVLA në të njëjtin grup të dhënash, të pandryshuar

    Të njëjtat të dhëna, i njëjti krah, 450 M parametra në vend të 80 M, plus kushtëzimi gjuhësor. LeRobot vendos një ekzekutim prej 20K hapash në afërsisht 4 orë në një A100. Kjo është ajo që ju tregon nëse para-trajnimi vlen diçka.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Konvertoni në v2.1 para se të prekni GR00T

    GR00T lexon një variant të formatit LeRobot v2 plus një shtesë meta/modality.json që harton se si gjendja e bashkuar dhe vargjet e veprimeve ndahen në fusha të emërtuara. Një grup të dhënash v3.0 e rrëzon atë ngarkues, sepse v3.0 paketon shumë episode në skedarë të përbashkët ku v2 shkruante një për episod. Isaac-GR00T ofron ndihmësin e uljes së versionit si scripts/lerobot_conversion/convert_v3_to_v2.py; faqja e refuzimit të v3 është rruga e shpejtë.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Përshkallëzoni në GR00T N1.7 vetëm nëse dy të parat lanë diçka pa u zgjidhur

    Nëpërmjet CLI-së së NVIDIA-s, e treguar këtu, ose tipit të politikës groot të LeRobot-it. NVIDIA rekomandon 40 GB ose më shumë VRAM për fine-tuning, 16 GB për inferencë. Në rast OOM, shih faqen OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dy mënyra për të ekzekutuar atë kalim shqyrtimi

Tre mjedise, sepse zinxhirët e veglave nuk bashkëjetojnë. LeRobot në main është 0.6.2 dhe kërkon Python 3.12 ose më të ri; Isaac-GR00T dhe openpi janë depozita të veçanta të menaxhuara nga uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fikson torchcodec 0.8.0 si backend-in e vetëm të videos, duke kërkuar FFmpeg 4 deri në 7. FFmpeg 8 nuk mbështetet, AV1 nuk garantohet.
  • Kufijtë e memories së openpi: inferencë mbi 8 GB, LoRA mbi 22.5 GB, fine-tuning i plotë mbi 70 GB. Kjo e fundit është arsyeja pse Pi0.5 është një punë A100.
  • Merrni me qira GPU-në vetë, shkatërrojeni më pas, pajtoni tre grupe rrugësh pikash kontrolli me dorë.

Model themelor apo nga e para

Dilema e vërtetë nuk është se cilin model 3 B të zgjedhësh. Është nëse duhet përdorur një VLA i paratrajnuar fare, duke pasur parasysh që ACT mësoi gjashtë detyra reale bimanuale nga rreth dhjetë minuta demonstrime secila, me 80 M parametra dhe asgjë të paratrajnuar.

Rregullimi i imët i një VLA-je të paratrajnuar në vend të trajnimit të ACT nga e para
Çfarë fitoni
  • Kushtëzimi gjuhësor. ACT nuk ka asnjë; një pikë kontrolli ACT kryen një detyrë.
  • Më mirë me objekte që mungojnë në demonstrimet tuaja: në SO-101, 50% kundrejt 40% të ACT jashtë shpërndarjes.
  • Shumë-detyrë fare: SmolVLA arrin 78.3% në tre detyra SO-100 me një pikë kontrolli; ACT u ekzekutua vetëm si një-detyrë.
Çfarë ju kushton
  • 7.6x deri në 24x vonesa: 152 deri në 485 ms për hap veprimi kundrejt 20 ms të ACT.
  • 4 deri në 12 USD për ekzekutim në vend të 1 deri në 3, dhe një nivel A100 në vend të çdo karte 24 GB.
  • Ekspozimi ndaj licencave, plus një mënyrë dështimi e depove të mbyllura që nuk ekziston nga e para.
  • Peshat e paratrajnuara mund të maskojnë një grup të dhënash të keq. Një rregullim i imët që funksionon pjesërisht me të dhëna të dëmtuara kushton një javë para se të shikoni të dhënat.

Rasti i riprodhimit të një ekzekutimi të vjetër

Në ndjekje të një pike kontrolli të vitit 2025, zgjedhja e modelit bëhet për ju dhe problemi kthehet në fiksim versioni: LeRobot aktual refuzon N1.5, kështu që ju fiksoni lerobot==0.5.1. Pa fushë farë dhe me 5 deri në 6 për qind variancë ndërmjet ekzekutimeve, riprodhimi është i përafërt nga ndërtimi. dhe kanë anën e platformës.

Faqja e krahasimit të drejtpërdrejtë të AY-Robots për GR00T N1.7 kundrejt Pi0.5, duke treguar numrin e parametrave, kërkesat e GPU-së, vonesën e inferencës, formatin e grupit të të dhënave dhe numrin minimal të episodeve krah për krah.
Krahasim i drejtpërdrejtë në /compare/groot-n1-7-vs-pi0-5. Dy modelet 3 B duken të këmbyeshme në një fletë specifikash dhe nuk janë: njëri kërkon LeRobot v2.1, tjetri kërkon v3.0.

Deri në dy? dhe . Rreshtat e papërpunuar gjenden në hyrjet e arenës: , , dhe .

Ku kjo platformë nuk ju ndihmon

  • Nuk mund ta bëjë inferencën në distancë të shpejtë. Cikli 20 deri në 485 ms i përket modelit; udhëtimet vajtje-ardhje në internet i shtohen atij.
  • Nuk mund të rregullojë GR00T ose Pi0.5 në harduerin tuaj. Të dyja janë vetëm në cloud këtu; vetëm SmolVLA dhe ACT funksionojnë lokalisht.
  • Nuk mund të rregullojë një grup të dhënash. Humbja bie por politika nuk bën asgjë është një problem i të dhënave, një politikë që funksionon vetëm në një konfigurim është një problem mbulimi.
  • Nuk mund t'i bëjë ekzekutimet e GR00T të riprodhueshme: konfigurimi i sipërm nuk ka fushë farë.

85 modele, 332 rezultate benchmark, çdo numër i lidhur me burimin e tij

Versioni i renditshëm i tabelave në këtë faqe: 85 modele vizion-gjuhë-veprim, 332 rezultate benchmark, secila e lidhur me punimin ose kartën e modelit të saj.

Hapni arenën

Zgjedhja e njërit dhe vazhdimi

Një parazgjedhje: regjistroni 50 episode, trajnoni ACT për 1 deri në 3 USD për të provuar grupin e të dhënave, pastaj SmolVLA në të njëjtat të dhëna. Nën 6 USD së bashku, dhe ato i përgjigjen pyetjes që ka rëndësi: nëse paratrajnimi ndihmon këtu, apo nëse pengesa është të dhënat. Përshkallëzoni në GR00T N1.7 për detyra me shumë hapa dhe të pasura me kontakt, në Pi0.5 kur skena ndryshon.

Udhëzuesi i platformës: trajnoni politikën tuaj të parë, pastaj ekzekutoni politikën tuaj të parë. Të dokumentet e trajnimit dhe dokumentet e grupeve të të dhënave mbulojnë formën dhe formatin; faqja SO-100 dhe udhëzuesi i plotë SO-100 mbulojnë ndërtimin dhe kalibrimin. Sfondi: përmbledhja VLA dhe artikulli Pi0 flow-matching. Ai që do të rrisë shkallën tuaj të suksesit është udhëzuesi i cilësisë së të dhënave.

Cilën politikë VLA duhet të trajnoj së pari në një SO-100?

ACT, pastaj SmolVLA. ACT trajnohet nga e para, kështu që nuk mund të maskojë një grup të dhënash të keq, dhe një ekzekutim kushton 1 deri në 3 USD në një kartë 24 GB. Nëse ACT e kryen detyrën fare, 4 deri në 12 USD për një ekzekutim të GR00T N1.7 ose Pi0.5 nuk shkojnë dëm.

A është GR00T N1.7 vërtet më i mirë se Pi0.5?

Në LIBERO ato janë brenda zhurmës: 97.0% në katër suita për GR00T N1.7, 96.85% për Pi0.5 në 30k hapa në openpi, 97.5% për portin LeRobot, të gjitha nga sisteme të ndryshme. Dallimet reale janë 152 ms për hap veprimi kundrejt 485 ms, grupe të dhënash v2.1 kundrejt v3.0, dhe saktësia e standardit kundrejt përgjithësimit në botën e hapur.

A mund të rregulloj (fine-tune) ndonjë prej këtyre në një RTX 4090 të vetme?

SmolVLA dhe ACT, po; të dyja janë të listuara për një RTX 4090 ose çdo kartë 24 GB dhe ekzekutohen lokalisht. GR00T N1.7, N1.5 dhe Pi0.5 kërkojnë një A100 ose H100 80 GB dhe janë vetëm në cloud këtu. NVIDIA rekomandon 40 GB ose më shumë për fine-tuning të GR00T; kufiri i openpi është mbi 70 GB për një fine-tune të plotë të Pi0.5, 22.5 GB për LoRA.

Cilën nga këto pesë mund ta përdor komercialisht?

Peshat e GR00T N1.7 janë nën Marrëveshjen e Licencës së Modelit të Hapur të NVIDIA, e cila sipas kartës mbulon përdorimin komercial. Peshat e N1.5 janë jo-komerciale. Kodi i SmolVLA është Apache 2.0 në LeRobot, por karta lerobot/smolvla_base nuk përmban fushë licence, kështu që peshat janë të padeklaruara. ACT nuk ka pesha bazë për t'u licencuar. Pi0.5 është i paqartë: dokumentet e LeRobot thonë Apache 2.0, metadata e kartës së tij lexon license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started