
GR00T N1.7, Pi0.5, SmolVLA, ACT apo GR00T N1.5? Një tabelë vendimmarrjeje e përshtatur me situata reale, me numrat e publikuar të benchmark-ut, latencën, koston për ekzekutim dhe licencat pas çdo zgjedhjeje.
Pesë politika mund të trajnohen sot në një krah të klasës SO-100. Ato ndryshojnë me një faktor 24 në inferencë vonesë, 37 në numrin e parametrave dhe 12 në koston e një ekzekutimi, dhe nëse mund ta dërgoni rezultatin. Pesë karta modelesh nuk do ta zgjidhin këtë: asnjëra nuk i përgjigjet pyetjes që keni, cilën duhet të ekzekutoj së pari?
Çdo numër më poshtë është lexuar nga punimet, depozitat dhe kartat në gusht 2026. Numrat e platformës vijnë nga katalogu i politikave i AY-Robots; ku të dyja nuk pajtohen, të dyja shfaqen.
Versioni i shkurtër
- •Trajnoni ACT-në së pari nëse dyshoni në grupin tuaj të të dhënave: 1 deri në 3 USD për ekzekutim, asgjë e paratrajnuar për të mbuluar të dhënat e këqija.
- •GR00T N1.7 dhe Pi0.5 janë brenda gjysmë pike në LIBERO, 97.0 kundrejt 96.85 deri në 97.5. Ky nuk është një arsye për të zgjedhur asnjërën.
- •Pi0.5 është loja e përgjithësimit, jo loja e saktësisë, dhe më i ngadalti me 485 ms.
- •SmolVLA, me 450 M parametra, është i vetmi VLA këtu që rregullohet imët në një kartë 24 GB.
- •ACT me 20 ms është opsioni i vetëm për lëvizje të shpejtë reaktive. Licencat vendosin për pjesën tjetër.
Tabela e vendimeve
| Situata juaj | Trajnoni këtë | Pse |
|---|---|---|
| Cilësia e grupit të të dhënave e paprovuar | ACT | Asgjë e paratrajnuar nuk fsheh një grup të dhënash të dëmtuar, dhe dështimi kushton 1 deri në 3 USD. |
| I pasur me kontakte, me shumë hapa, i kushtëzuar nga gjuha | GR00T N1.7 | 97.0% në katër suita LIBERO, plus një hapësirë veprimi relative të fund-efektorit. |
| Lëvizje e shpejtë reaktive, inferencë te servot | ACT | 20 ms. Tjetri më i shpejtë është 7.6 herë më i ngadaltë. |
| Objekte të reja, skenë e re, botë e hapur | Pi0.5 | Ndërtuar për sjellje jashtë shpërndarjes, në deri në 104 vendndodhje. |
| Një kartë 24 GB, ende dëshironi gjuhë | SmolVLA | 450 M parametra, një minimum prej 30 episodesh, funksionon lokalisht. |
| Riprodhimi i një ekzekutimi të regjistruar në 2025 | GR00T N1.5 | Vetëm nëse duhet: LeRobot tani e refuzon, peshat jo-komerciale. |
| Ky do të dërgohet si produkt | N1.7, SmolVLA or ACT | N1.5 është jo-komercial, Pi0.5 përmban kushtet e Gemma-s, karta e SmolVLA-s nuk specifikon asnjë. |
Pesë kandidatët
Të gjithë të pesë janë politika: korniza kamerash, pozicione nyjesh dhe, për katër prej tyre, një udhëzim gjuhe, i hartuar në një bllok objektivash të ardhshëm të nyjeve. Ajo që i ndan është sa shumë u mësua para se të arrinit ju.
| Politika | Parametrat | Vonesa | Niveli i GPU-së | Lokal? | Episodet min | Formati | Kostoja |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | po | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | po | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | jo | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | jo | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | jo | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Modeli aktual i NVIDIA-s model vizion-gjuhë-veprim, rreth 3 miliardë parametra, afërsisht 40 milionë të trajnuar gjatë fine-tuning. Depoja liston ndryshimet nga N1.6: shtylla kurrizore nga një model Eagle i shitur te Cosmos-Reason2-2B në Qwen3-VL, shtresat e difuzionit 32 në 16, dimensionet e gjendjes dhe veprimit 29 në 132, horizonti i veprimit 16 në 40.
Ajo që ka rëndësi në një krah të vogël është hapësira relative e veprimit të fund-efektorit: N1.7 parashikon ndryshime nga pozicioni aktual, gjë që lejon transferimin e 20 mijë orëve video njerëzore EgoScale në një politikë roboti. Specifikimet në faqen e N1.7, procedura në udhëzuesin e N1.7 në SO-100.
README i Isaac-GR00T e deklaron N1.7 një version General Availability, me standarde dhe mbështetje të plota. Karta e tij në Hugging Face nuk është përditësuar: fusha Model Version ende shkruan GR00T N1.7 EA. Depoja është dokumenti më i ri.
GR00T N1.5
E njëjta shkallë 3 B, shtyllë kurrizore Eagle 2, SigLip2 dhe T5, kokë DiT me përputhje fluksi. Ekziston për të zgjeruar një që tashmë keni. Dy gjëra e bëjnë atë një parazgjedhje të dobët: peshat mbartin NVIDIA's one-way non-commercial licence, dhe versionet aktuale të LeRobot-it hoqën mbështetjen për N1.5. Shih .
Pi0.5
VLA-ja e Physical Intelligence me , tipi i politikës pi05. Punimi jep një VLM 2 B të inicializuar nga PaliGemma plus një ekspert veprimi 300 M, duke drejtuar robotin me 50 Hz; konfigurimi pi05 i LeRobot-it parazgjedh një bllok me 50 hapa, një sekondë me atë shpejtësi. Pika e shitjes janë vendet e paeksploruara: rreth 400 orë manipulim mobil në shtëpi reale, dhe një studim shkallëzimi mbi 3, 12, 22, 53, 82 dhe 104 vendndodhje, ku modeli me 104 vendndodhje përputhej me një kontroll të trajnuar në vetë shtëpitë e testimit.
Një kufizim, i theksuar në kartën lerobot/pi05_base: porti mbart vetëm kokën e veprimit që përputhet me fluksin. Parashikimi i nën-detyrave, tokenizimi i veprimeve dhe RL nuk u lëshuan upstream, dhe openpi thotë të njëjtën gjë për depozitën e vet. Faqja e Pi0.5 dhe udhëzuesi i Pi0.5 në SO-100 kanë pjesën tjetër.
Pi0.5 kërkon tokenizuesin e mbyllur google/paligemma-3b-pt-224 (gated: manual, megjithëse Google thotë se kërkesat përpunohen menjëherë). Pa e pranuar atë dhe pa ekzekutuar hf auth login në mjedisin e trajnimit, puna fillon, shkarkon për pak kohë, pastaj ndërpritet me një gabim autorizimi që duket si një defekt rrjeti. nvidia/GR00T-N1.7-3B nuk është i mbyllur, por shtylla kurrizore e tij nvidia/Cosmos-Reason2-2B është (gated: auto). Pastroni të dyja para se të vendosni në radhë; nëse një ekzekutim qëndron në pritje, faqja e radhës së ngecur liston çfarë duhet kontrolluar.
SmolVLA
450 M parametra, rreth 100 M në ekspertin e veprimit, në SmolVLM-2 me VLM të ngrirë dhe duke përdorur vetëm 16 shtresat e para të modelit të gjuhës. Paratrajnimi ishte të dhëna komunitare: 481 grupe të dhënash, 10.6 M korniza, nga të njëjtat krahë të lirë që përdorni. I vetmi VLA këtu që përshtatet në një kartë 24 GB, dhe i vetmi me një dysheme prej 30 epizodesh. Shih faqen e SmolVLA.
ACT
Nuk është një model themelor. Action Chunking Transformer nga ALOHA ka rreth 80 M parametra të trajnuar nga e para për detyrë, në 50 demonstrime me 50 Hz. Punimi raporton gjashtë detyra reale bimanuale nga rreth dhjetë minuta demonstrimesh secila, me 80 deri në 90 për qind në shembujt që thekson. Ideja e tij, copëtimi i veprimeve, është në çdo model në këtë faqe, dhe ablacionimi i tij ende mat efektin më mirë: mbi dy detyra të simuluara me ansamblimin kohor të fikur, suksesi rritet nga 1 për qind në k=1 në 44 për qind në k=100. Faqja e ACT ka pjesën tjetër.
Çfarë thonë në të vërtetë standardet
LIBERO është standardi i vetëm për të cilin raportojnë tre nga këto pesë: detyra të kushtëzuara nga gjuha në një Franka Panda të simuluar, të ndara në katër suita më poshtë me nga dhjetë detyra secila. NVIDIA zhvilloi 200 prova për suitë.
| Model | Hapësinor | Objekt | Qëllim | 10 (Gjatë) | Mesatare |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Çdo numër vjen nga një pajisje dhe buxhet i ndryshëm. GR00T ekzekutoi 20K hapa me grup global 640; shifra openpi është një pikë kontrolli 30K; porti LeRobot shtoi 6K hapa në një model bazë LIBERO. SmolVLA është një mospërputhje e mëtejshme: punimi i tij trajnon atë rresht në LIBERO nga e para, pa paratrajnim VLA, ndërsa tre mbi të rregullojnë pikat e kontrollit të paratrajnuara. Trajtoni 96.85 deri në 97.5 si një grup, dhe hendekun deri në 87.3% si real, por të blerë me 6.7x parametrat.
SimplerEnv tregon shpërndarjen, gjë që LIBERO nuk e bën. NVIDIA krahason N1.7 me N1.6, gjënë më të afërt publike me një delta gjeneracionale.
| Suitë SimplerEnv | Mesatarja N1.6 | Mesatarja N1.7 | Lëkundja më e mirë | Lëkundja më e keqe |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Rreshti Bridge është i dobishmi: 5.7 pikë të fituara mesatarisht ndërsa put_eggplant_in_basket humbi 36 dhe put_eggplant_in_sink ra nga 33 në 2. Një gjeneratë e re lëviz shpërndarjen në vend që ta ngrejë atë, kështu që nëse detyra juaj ndodhet aty ku N1.7 u regresua, mesatarja nuk thotë asgjë.

Nga të pesë, vetëm punimi SmolVLA raporton për një krah të klasës SO-100: 78.3 për qind për SmolVLA dhe 61.7 për Pi0 në tre detyra, të dyja multi-task, kundrejt 48.3 për ACT të trajnuar single-task, që nuk është si për njësoj. Çiftimi i pastër është të dyja single-task në SO-101 pick-and-place: 90 kundrejt 70 në shpërndarje, 50 kundrejt 40 jashtë saj. Krahasoni në ACT kundrejt SmolVLA dhe Pi0.5 kundrejt SmolVLA, ose shfletoni arenën.
Vonesa dhe kostoja vendosin vendosjen
Vonesa e inferencës është kufizimi që njerëzit zbulojnë të fundit dhe pendohen të parët. Një politikë pesë pikë më e mirë në një standard, por gjysmë sekonde për hap veprimi duket më keq në tavolinën tuaj: dinamika e kontaktit nuk pret.
Një paralajmërim: shifra e GR00T nuk përputhet me kartën e NVIDIA-s, e cila mat 4 hapa denoise dhe një kamerë në 85.8 ms në një H100 në modalitetin eager, 48.6 ms me torch.compile, 27.9 ms përmes TensorRT të plotë. 152 ms këtu është një shifër e plotë e stack-ut me overhead shërbimi dhe më shumë se një kamerë, jo një kalim përpara.
Cikli 20 deri në 485 ms është i modelit, dhe udhëtimet vajtje-ardhje në internetin publik i shtohen kësaj. Inferenca në distancë është e realizueshme për pick-and-place të ngadaltë, jo për lëvizje të shpejtë reaktive. Nëse detyra juaj kërkon shpejtësi, inferenca qëndron pranë servove: ACT ose SmolVLA, lokalisht. Të lidhura: politika ngrin në mes të lëvizjes.
Një mënyrë për të fituar kohë pa ndryshuar modelin: punimi SmolVLA mat ekzekutimin sinkron, ku politika përfundon një bllok para se të parashikojë tjetrin, kundrejt asinkronit, ku parashikimi mbivendoset me ekzekutimin. Suksesi është i ngjashëm, 78.3 kundrejt 73.3, por i njëjti pick-and-place merr 9.7 sekonda në vend të 13.75, dhe në një dritare fikse roboti menaxhon 19 cikle në vend të 9.
Licencat, të kontrolluara sepse askush nuk i kontrollon
| Modeli | Licenca e peshave | Licenca e kodit | Përdorimi komercial |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; karta lejon përdorim komercial | Apache 2.0 | po |
| GR00T N1.5 | NVIDIA licencë njëkahëshe jokomerciale | Apache 2.0 | jo |
| Pi0.5 | metadata e kartës pi05_base lexon licencën: gemma | Apache 2.0 (openpi, dokumentet LeRobot) | lexoni të dyja, ato nuk pajtohen |
| SmolVLA | nuk ka fushë licence në kartën smolvla_base | Apache 2.0 (LeRobot) | kodi po, peshat të padeklaruara |
| ACT | nuk ekzistojnë pesha bazë | Apache 2.0 (LeRobot) | po |
Rreshti Pi0.5 kërkon kujdes. Dokumentacioni LeRobot pi05 deklaron Apache 2.0 në përputhje me openpi, ndërsa karta e Hub-it për lerobot/pi05_base përmban license: gemma. Të dyja janë aktive. GR00T N1.7 ka një version më të butë: README i Isaac-GR00T thotë kalimthi se N1.7 është plotësisht i licencueshëm komercialisht sipas Apache 2.0, ndërsa seksioni i saj i licencës dhe karta e modelit vendosin vetëm kodin nën Apache 2.0 dhe peshat nën NVIDIA Open Model License.
Parazgjedhjet që do të ekzekutoni në të vërtetë
Çdo formë trajnuesi vjen me një parazgjedhje, dhe ato nuk janë arbitrare. Ato të ACT-së janë të LeRobot-it: batch 8, lr 1e-5, 100000 hapa trajnimi, madhësia e bllokut 100, duke përputhur ACTConfig-un upstream dhe k=100 from the ACT paper. Një kolonë më poshtë është një kurth.
| Politika | Batch | LR | Hapa maksimalë | Akumulimi i gradientit | Aplikohet? | Kontrolle shtesë |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Pika e hyrjes për fine-tuning të GR00T (launch_finetune.py, një CLI tyro) nuk ka fushë seed në dataclass-in e konfigurimit të saj, kështu që ekzekutimet nuk janë të riprodhueshme bit-për-bit. Repoja gjithashtu paralajmëron për 5 deri në 6 për qind variacion midis ekzekutimeve nga augmentimet jo-deterministike të imazheve, më e madhe se shumica e boshllëqeve të benchmark-ut të diskutuara online. Seed-i parazgjedhur i LeRobot është 1000. Kolona e akumulimit të gradientit përshkruan lerobot 0.5.1; versioni upstream 0.6.2 e ekspozon atë si --accelerator.gradient_accumulation.steps.
Kontrolli që ka më shumë rëndësi sesa zgjedhja e modelit
Është blloku i veprimit. Blloqet më të gjata japin lëvizje më të qetë dhe më pak gabime të përbëra, por politika është e angazhuar ndërsa blloku ekzekutohet, kështu që reagon me vonesë ndaj çdo gjëje që lëviz: e sigurt në një kub statik, e pashpresë në një kub rrotullues. Nëse tejkalon, shkurtimi i pjesës së ekzekutuar është më i mirë se ritrajnimi dhe është falas. Një nyje që ndalon shkurt është një problem tjetër; shih faqen e ndalimit të hershëm të nyjes.
- ACT: ACTConfig parazgjedhur ka
chunk_size 100dhen_action_steps 100. Ansambli kohor është i fikur dhe kërkonn_action_steps 1. - GR00T N1.7: horizonti i brendshëm shkoi nga 16 në 40, megjithatë shembulli SO-101 i LeRobot ende ekzekuton
--policy.chunk_size=16 --policy.n_action_steps=16. Flaga e shpërndarjes u riemërua në--execution-horizon. - Pi0.5: një bllok me 50 hapa, nga të cilët receta LIBERO e LeRobot ekzekuton 10 përmes
--policy.n_action_steps=10; me--policy.pretrained_pathajo kthehet në 50 nëse e lini pa specifikuar flagën. - SmolVLA: blloqe me 50 veprime, të dyja komandat të ekspozuara.
Si t'i shqyrtosh të pesë në një pasdite
Përgjigja më e lirë nuk është më shumë lexim. Shpenzoni rreth 15 USD dhe lëreni krahun t'ju tregojë: regjistroni një herë, trajnoni modelin e lirë së pari, përshkallëzoni pasi të ketë provuar se të dhënat janë të shëndosha. Struktura mund vëllimin, qëllimi i mbledhjes së të dhënave SO-100 dhe formatit të grupit të të dhënave LeRobot.
- 1Regjistroni 50 episode një herë
Pesëdhjetë pastron terrenin për GR00T, Pi0.5 dhe ACT, dhe 30 të SmolVLA-s. Përsëritni çdo variacion në vend që të shpërndaheni: 50 episode në 5 pozicione kubi të trajnuara ku 25 nuk u trajnuan. Shih regjistroni grupin tuaj të parë të të dhënave.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Trajnoni ACT-në së pari, sepse nuk mund t'ju gënjejë
Pa pesha të para-trajnuara, kështu që nëse e kryen detyrën fare, grupi juaj i të dhënave përmban detyrën. Nëse ACT nuk jep rezultate, rregulloni të dhënat. 1 deri në 3 USD, 2 deri në 5 orë në një kartë 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Ekzekutoni SmolVLA në të njëjtin grup të dhënash, të pandryshuar
Të njëjtat të dhëna, i njëjti krah, 450 M parametra në vend të 80 M, plus kushtëzimi gjuhësor. LeRobot vendos një ekzekutim prej 20K hapash në afërsisht 4 orë në një A100. Kjo është ajo që ju tregon nëse para-trajnimi vlen diçka.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konvertoni në v2.1 para se të prekni GR00T
GR00T lexon një variant të formatit LeRobot v2 plus një shtesë
meta/modality.jsonqë harton se si gjendja e bashkuar dhe vargjet e veprimeve ndahen në fusha të emërtuara. Një grup të dhënash v3.0 e rrëzon atë ngarkues, sepse v3.0 paketon shumë episode në skedarë të përbashkët ku v2 shkruante një për episod. Isaac-GR00T ofron ndihmësin e uljes së versionit siscripts/lerobot_conversion/convert_v3_to_v2.py; faqja e refuzimit të v3 është rruga e shpejtë.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Përshkallëzoni në GR00T N1.7 vetëm nëse dy të parat lanë diçka pa u zgjidhur
Nëpërmjet CLI-së së NVIDIA-s, e treguar këtu, ose tipit të politikës
groottë LeRobot-it. NVIDIA rekomandon 40 GB ose më shumë VRAM për fine-tuning, 16 GB për inferencë. Në rast OOM, shih faqen OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dy mënyra për të ekzekutuar atë kalim shqyrtimi
Tre mjedise, sepse zinxhirët e veglave nuk bashkëjetojnë. LeRobot në main është 0.6.2 dhe kërkon Python 3.12 ose më të ri; Isaac-GR00T dhe openpi janë depozita të veçanta të menaxhuara nga uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fikson
torchcodec0.8.0 si backend-in e vetëm të videos, duke kërkuar FFmpeg 4 deri në 7. FFmpeg 8 nuk mbështetet, AV1 nuk garantohet. - Kufijtë e memories së openpi: inferencë mbi 8 GB, LoRA mbi 22.5 GB, fine-tuning i plotë mbi 70 GB. Kjo e fundit është arsyeja pse Pi0.5 është një punë A100.
- Merrni me qira GPU-në vetë, shkatërrojeni më pas, pajtoni tre grupe rrugësh pikash kontrolli me dorë.
Pesë modele të njëjta, një formë. Zgjidhni modelin, grupin e të dhënave dhe hiperparametrat; backend-i merr me qira një GPU të madhësisë së VRAM-it të kërkuar, ekzekuton trajnerin dhe shkruan në ruajtjen e objekteve.
- Matrica e trajnimit është pesë modele me katër krahë, çdo qelizë një udhëzues: SmolVLA në SO-100, ACT në SO-101.
- Pod-et e inferencës auto-furnizohen nga
/api/inference/podme një watchdog të papunë, kështu që një pod i harruar nuk faturohet në heshtje. - Pikat bazë të kontrollit janë të vetë shitësve:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nuk ka asnjë. - Të njëjtat operacione nga CLI dhe nga agjentët e AI nëpërmjet serverit MCP.
- Pa pajisje? Krahu i drejtpërdrejtë transmeton një SO-100 fizik pa regjistrim; faqja e provës tregon mënyrat e hyrjes.
Model themelor apo nga e para
Dilema e vërtetë nuk është se cilin model 3 B të zgjedhësh. Është nëse duhet përdorur një VLA i paratrajnuar fare, duke pasur parasysh që ACT mësoi gjashtë detyra reale bimanuale nga rreth dhjetë minuta demonstrime secila, me 80 M parametra dhe asgjë të paratrajnuar.
- Kushtëzimi gjuhësor. ACT nuk ka asnjë; një pikë kontrolli ACT kryen një detyrë.
- Më mirë me objekte që mungojnë në demonstrimet tuaja: në SO-101, 50% kundrejt 40% të ACT jashtë shpërndarjes.
- Shumë-detyrë fare: SmolVLA arrin 78.3% në tre detyra SO-100 me një pikë kontrolli; ACT u ekzekutua vetëm si një-detyrë.
- 7.6x deri në 24x vonesa: 152 deri në 485 ms për hap veprimi kundrejt 20 ms të ACT.
- 4 deri në 12 USD për ekzekutim në vend të 1 deri në 3, dhe një nivel A100 në vend të çdo karte 24 GB.
- Ekspozimi ndaj licencave, plus një mënyrë dështimi e depove të mbyllura që nuk ekziston nga e para.
- Peshat e paratrajnuara mund të maskojnë një grup të dhënash të keq. Një rregullim i imët që funksionon pjesërisht me të dhëna të dëmtuara kushton një javë para se të shikoni të dhënat.
Rasti i riprodhimit të një ekzekutimi të vjetër
Në ndjekje të një pike kontrolli të vitit 2025, zgjedhja e modelit bëhet për ju dhe problemi kthehet në fiksim versioni: LeRobot aktual refuzon N1.5, kështu që ju fiksoni lerobot==0.5.1. Pa fushë farë dhe me 5 deri në 6 për qind variancë ndërmjet ekzekutimeve, riprodhimi është i përafërt nga ndërtimi. dhe kanë anën e platformës.

Deri në dy? dhe . Rreshtat e papërpunuar gjenden në hyrjet e arenës: , , dhe .
Ku kjo platformë nuk ju ndihmon
- Nuk mund ta bëjë inferencën në distancë të shpejtë. Cikli 20 deri në 485 ms i përket modelit; udhëtimet vajtje-ardhje në internet i shtohen atij.
- Nuk mund të rregullojë GR00T ose Pi0.5 në harduerin tuaj. Të dyja janë vetëm në cloud këtu; vetëm SmolVLA dhe ACT funksionojnë lokalisht.
- Nuk mund të rregullojë një grup të dhënash. Humbja bie por politika nuk bën asgjë është një problem i të dhënave, një politikë që funksionon vetëm në një konfigurim është një problem mbulimi.
- Nuk mund t'i bëjë ekzekutimet e GR00T të riprodhueshme: konfigurimi i sipërm nuk ka fushë farë.
85 modele, 332 rezultate benchmark, çdo numër i lidhur me burimin e tij
Versioni i renditshëm i tabelave në këtë faqe: 85 modele vizion-gjuhë-veprim, 332 rezultate benchmark, secila e lidhur me punimin ose kartën e modelit të saj.
Hapni arenënZgjedhja e njërit dhe vazhdimi
Një parazgjedhje: regjistroni 50 episode, trajnoni ACT për 1 deri në 3 USD për të provuar grupin e të dhënave, pastaj SmolVLA në të njëjtat të dhëna. Nën 6 USD së bashku, dhe ato i përgjigjen pyetjes që ka rëndësi: nëse paratrajnimi ndihmon këtu, apo nëse pengesa është të dhënat. Përshkallëzoni në GR00T N1.7 për detyra me shumë hapa dhe të pasura me kontakt, në Pi0.5 kur skena ndryshon.
Udhëzuesi i platformës: trajnoni politikën tuaj të parë, pastaj ekzekutoni politikën tuaj të parë. Të dokumentet e trajnimit dhe dokumentet e grupeve të të dhënave mbulojnë formën dhe formatin; faqja SO-100 dhe udhëzuesi i plotë SO-100 mbulojnë ndërtimin dhe kalibrimin. Sfondi: përmbledhja VLA dhe artikulli Pi0 flow-matching. Ai që do të rrisë shkallën tuaj të suksesit është udhëzuesi i cilësisë së të dhënave.
Cilën politikë VLA duhet të trajnoj së pari në një SO-100?▾
ACT, pastaj SmolVLA. ACT trajnohet nga e para, kështu që nuk mund të maskojë një grup të dhënash të keq, dhe një ekzekutim kushton 1 deri në 3 USD në një kartë 24 GB. Nëse ACT e kryen detyrën fare, 4 deri në 12 USD për një ekzekutim të GR00T N1.7 ose Pi0.5 nuk shkojnë dëm.
A është GR00T N1.7 vërtet më i mirë se Pi0.5?▾
Në LIBERO ato janë brenda zhurmës: 97.0% në katër suita për GR00T N1.7, 96.85% për Pi0.5 në 30k hapa në openpi, 97.5% për portin LeRobot, të gjitha nga sisteme të ndryshme. Dallimet reale janë 152 ms për hap veprimi kundrejt 485 ms, grupe të dhënash v2.1 kundrejt v3.0, dhe saktësia e standardit kundrejt përgjithësimit në botën e hapur.
A mund të rregulloj (fine-tune) ndonjë prej këtyre në një RTX 4090 të vetme?▾
SmolVLA dhe ACT, po; të dyja janë të listuara për një RTX 4090 ose çdo kartë 24 GB dhe ekzekutohen lokalisht. GR00T N1.7, N1.5 dhe Pi0.5 kërkojnë një A100 ose H100 80 GB dhe janë vetëm në cloud këtu. NVIDIA rekomandon 40 GB ose më shumë për fine-tuning të GR00T; kufiri i openpi është mbi 70 GB për një fine-tune të plotë të Pi0.5, 22.5 GB për LoRA.
Cilën nga këto pesë mund ta përdor komercialisht?▾
Peshat e GR00T N1.7 janë nën Marrëveshjen e Licencës së Modelit të Hapur të NVIDIA, e cila sipas kartës mbulon përdorimin komercial. Peshat e N1.5 janë jo-komerciale. Kodi i SmolVLA është Apache 2.0 në LeRobot, por karta lerobot/smolvla_base nuk përmban fushë licence, kështu që peshat janë të padeklaruara. ACT nuk ka pesha bazë për t'u licencuar. Pi0.5 është i paqartë: dokumentet e LeRobot thonë Apache 2.0, metadata e kartës së tij lexon license: gemma.
Sources
- Depoja NVIDIA Isaac-GR00T: statusi GA, ndryshimet N1.6 në N1.7, kërkesat harduerike, kufizimet e torchcodec dhe FFmpeg, launch_finetune.py, varianca nga ekzekutimi në ekzekutim
- Karta e modelit nvidia/GR00T-N1.7-3B: shtylla kurrizore Cosmos-Reason2-2B, 3 B parametra, tabela e kohës së inferencës, Licenca e Modelit të Hapur të NVIDIA, fusha e Versionit të Modelit
- Karta e modelit nvidia/GR00T-N1.5-3B: referenca Eagle 2, SigLip2 dhe T5, DiT me përputhje fluksi, licencë njëkahëshe jo-komerciale
- Shembull Isaac-GR00T LIBERO: shkallët e suksesit për suitë në 20K hapa dhe madhësi grupi 640, 200 prova për suitë
- Shembull Isaac-GR00T SimplerEnv: shkallët e suksesit për detyrë Bridge dhe Fractal, GR00T N1.6 kundrejt N1.7
- pi0.5: një Model Vizioni-Gjuhe-Veprimi me Përgjithësim në Botën e Hapur (2 B VLM plus 300 M ekspert veprimi, kontroll 50 Hz, rreth 400 orë manipulim mobil, studim shkallëzimi mbi 3 deri në 104 vendndodhje)
- Depoja openpi: kufijtë e memories GPU, fusha vetëm për kokën e përputhjes së fluksit, dhe rezultatet e Pi0.5 LIBERO në examples/libero
- Karta e modelit lerobot/pi05_base: fusha e portit LeRobot, license: metadata gemma, përdorimi i lerobot-train
- Dokumentacioni LeRobot pi0.5: tokenizuesi i mbyllur PaliGemma, tabela e riprodhimit LIBERO, kurthi i kthimit n_action_steps, deklarata Apache 2.0
- SmolVLA: Një Model Vizioni-Gjuhe-Veprimi për Robotikë të Përballueshme dhe Efikase (450 M parametra, tabela LIBERO dhe Meta-World, rezultatet SO-100 dhe SO-101, inferencë asinkrone)
- Dokumentacioni LeRobot SmolVLA: 50 episode në 5 pozicione kundrejt 25, 20k hapa në rreth 4 orë në një A100
- Mësimi i Manipulimit Bimanual të Detajuar me Harduer me Kosto të Ulët (ACT dhe ALOHA): 6 detyra në 80-90 për qind, ablacioni i madhësisë së copës nga k=1 në k=100
- LeRobot 0.6.2: parazgjedhjet e ACTConfig dhe SmolVLAConfig, seed parazgjedhur 1000, --accelerator.gradient_accumulation.steps, kërkesa Python 3.12, Apache 2.0
- Dokumentacioni LeRobot GR00T: lloji i politikës groot, mbështetja N1.5 e hequr, pin lerobot==0.5.1, shembull i madhësisë së copës SO-101
- Karta e modelit lerobot/smolvla_base: pika e kontrollit bazë SmolVLA e përdorur nga --policy.path, dhe metadata e kartës së saj, e cila nuk përmban fushë licence
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started