
Þjálfaðu Action Chunking Transformer frá grunni á SO-100 með lerobot: act config, chunk_size og n_action_steps, 100000 skrefa áætlunin, 20 ms ályktun.
ACT er undantakið meðal SO-100 stefnanna. GR00T N1.7 og N1.5 byrja frá nvidia/GR00T-N1.7-3B og nvidia/GR00T-N1.5-3B, Pi0.5 frá lerobot/pi05_base. ACT byrjar frá grunni: það er enginn grunnur eftirlitsstaður, því það er ekki grunnlíkan. Það er um það bil 80 milljóna færibreytu spennir sem þú þjálfar frá grunni í einu verkefni, á handleggnum þínum, undir lýsingu þinni.
Þess vegna keyrir það stjórnunarskref á 20 ms þar sem 3 milljarða færibreytu VLA þarf 152 til 485 ms, og kostar 1 til 3 USD á keyrslu í stað 4 til 12. Þessi leiðbeining fer handvirka leið með lerobot á SO-100: upptaka, act stillingin, hvað chunk_size og n_action_steps stjórna, 100000 skrefa áætlunin, útfærslan. Síðan sama verkefnið á AY-Robots, þar á meðal þar sem pallurinn hjálpar ekki.
Það sem þú þarft að vita
- •ACT þjálfar frá grunni: ekkert grunnlíkan, engin forþjálfun, engin tungumálinntak. Einn eftirlitsstaður, eitt verkefni.
- •Greinin: um 80 M færibreytur, um 5 klukkustundir á 11 GB RTX 2080 Ti, 0.01 s ályktun.
- •lerobot sjálfgefið: chunk_size 100, n_action_steps 100, batch 8, lr 1e-5, 100000 skref, seed 1000.
- •Á AY-Robots: 20 ms á skref, hraðast af fimm. Lágmark 50 þættir, LeRobot v3.0, 24 GB kort, 1 til 3 USD á keyrslu.
- •Það vinnur í verkefni sem það hefur séð, og tapar um leið og þú vilt tungumálaskilyrðingu.
Athugað 23. ágúst 2026 gegn lerobot 0.6.x: pyproject.toml á main les version = "0.6.2", nýjasta merkið v0.6.1, 3. ágúst 2026. Kennsla sem byrjar með python lerobot/scripts/train.py er eldri en inngangspunktarnir í stjórnborðinu lerobot-train, lerobot-record og lerobot-rollout.
Hvað ACT raunverulega er
Aðgerðaskipting með Transformers kemur úr ALOHA greininni, Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware, eftir Zhao, Kumar, Levine og Finn, arXiv, 23. apríl 2023. Búnaðurinn tekur upp á 50 Hz með fjórum vefmyndavélum sem streyma 480x640 á 30 fps: tvær á gripunum, ein að ofan, ein að framan. Ágrip greinarinnar heldur því fram að sex færni hafi náð 80 til 90 prósenta árangri, þar á meðal að opna hálfgegnsæjan kryddbolla og setja rafhlöðu í, eftir 10 mínútna sýnikennslu.
Aðaltextinn er gagnlegri þegar skipulögð er upptökulota: 50 sýnikennslur á verkefni, nema Thread Velcro á 100, sem er 10 til 20 mínútur af gögnum og 30 til 60 mínútur af rauntíma þegar endurstillingar eru taldar með. Árangur er heldur ekki jafn: Thread Velcro endar á 20 prósentum, Put On Shoe á 92, Cup Open 84, Prep Tape 64.
| Ofurbreyta | ALOHA greinin, Tafla III | lerobot á main |
|---|---|---|
| námsstuðull | 1e-5 | optimizer_lr = 1e-5 |
| lotustærð | 8 | batch_size = 8, in TrainPipelineConfig not ACTConfig |
| kóðara / afkóðara lög | 4 / 7 | n_encoder_layers = 4 / n_decoder_layers = 1 |
| kubbstærð k | 100 | chunk_size = 100 |
| falin vídd z | absent; Fig. 11 shows a 32 to 512 projection | latent_dim = 32 |
| tímaleg samsetning | absent; --temporal_agg in the reference code | temporal_ensemble_coeff = None |
Greinin listar 7 afkóðunarlög, lerobot sendir 1, viljandi. Athugasemdin í configuration_act.py segir að upprunalega útfærslan hafi galla sem þýðir að aðeins fyrsta lagið er notað, og vísar í vandamál 25 í tonyzhaozh/act: aðgerðarhausinn les hs[0], svo öll sjö lögin keyra en aðeins fyrsta úttakið nær spánni. Þetta vandamál hefur verið opið og ósvarað síðan 23. apríl 2024. lerobot passar við hegðunina sem framleiddi birtar niðurstöður, ekki prentaða númerið. Hækkaðu --policy.n_decoder_layers og þú þjálfar líkan sem greinin aldrei mat.
Aðgerðaskipting er kjarninn í hugmyndinni
Venjuleg hegðunarklónun varpar einni athugun í eina aðgerð, og villur safnast upp: frávik setur handlegginn út fyrir dreifingu, framleiðir verri aðgerð, og þrjátíu skrefum síðar er gripurinn hvergi nærri hlutnum. Aðgerðaskipting spáir fyrir um k aðgerðir í einu og framkvæmir þær, sem lækkar virkan sjóndeildarhring um stuðulinn k. Það tekur einnig á óþægindum sem eru sérstök fyrir mannleg gögn: fjarstýringar gera hlé, og eins-skrefs Markovísk stefna getur ekki líkanfært hlé sem fer eftir því sem á undan kom.
Greinin rannsakar k frekar en að fullyrða það. Með tímabundinni samsetningu óvirkri, að meðaltali yfir fjórar stillingar, hækkar árangur úr 1 prósenti við k = 1 í 44 prósent við k = 100, og minnkar síðan við 200 og 400 þegar stefnan nálgast opna lykkjustýringu. Sú ferill er ástæðan fyrir því að sjálfgefið gildi er 100.
- chunk_size: hversu margar framtíðaraðgerðir afkóðarinn spáir fyrir um í hverri framsendingu. Sjálfgefið 100.
- n_action_steps: hversu margar af þeim þú framkvæmir áður en þú spyrð aftur. Sjálfgefið 100, svo lerobot keyrir allan bitann í opnum lykkju.
- lerobot staðfestir
n_action_steps <= chunk_sizeog kastarValueErroref þú snýrð því við.
Það sem skiptir máli í rekstri er chunk_size deilt með rammatíðni. Við 30 fps sem dæmi lerobot's SO-100 nota, skuldbindur biti af 100 um 3.3 sekúndur frá einni athugun. Ef verkefnið þarf leiðréttingu innan þess glugga, lækkaðu n_action_steps, ekki chunk_size: þú heldur langri spá og athugar aftur oftar.
# predict 100 actions, re-query after 25 of them (about 0.8 s at 30 fps)
lerobot-train \
--dataset.repo_id=${HF_USER}/so100_cube \
--policy.type=act \
--policy.chunk_size=100 \
--policy.n_action_steps=25 \
--policy.device=cudaStilltu --policy.temporal_ensemble_coeff og lerobot krefst n_action_steps = 1, og kastar NotImplementedError annars. Samsetning spyr stefnuna í hverju tímastigi og blandar saman skarandi spám fyrir það tímastig með vigtum w_i = exp(-m * i), þar sem sú elsta fær w_0. Greinin setur það í 3.3 prósent fyrir ACT: raunverulegt en hóflegt, og það margfaldar ályktunarfjölda með lengd bitans. Viðráðanlegt við 20 ms á hvert skref, ekki við 485 ms. Sjá töf á ályktun.
Þegar ACT sigrar grunnlíkan
Fimm þjálfanlegar stefnur hlið við hlið, með tölunum sem AY-Robots mælir og notar til að ákvarða stærð GPU sem það leigir.
| Stefna | Fjölskylda | Færibreytur | Á hvert skref | GPU flokkur | Lágmarksþættir | Gagnasafn |
|---|---|---|---|---|---|---|
| ACT | Kjarnaskipta spennir, frá grunni | ~80 M | 20 ms | RTX 4090 / 24 GB | 50 | LeRobot v3.0 |
| SmolVLA | Þétt VLA | ~450 M | 245 ms | RTX 4090 / 24 GB | 30 | LeRobot v3.0 |
| GR00T N1.7 | VLA grunnur, dreifingarhaus | ~3 B (~40 M trained) | 152 ms | A100 / H100 80 GB | 50 | LeRobot v2.0 or v2.1 |
| GR00T N1.5 | VLA grunnur, forveri | ~3 B | 165 ms | A100 / H100 80 GB | 50 | LeRobot v2.0 or v2.1 |
| Pi0.5 | Flæðisjöfnun VLA, sjá flæðisjöfnun | ~3 B, PaliGemma backbone | 485 ms | A100 / H100 80 GB | 50 | LeRobot v3.0 |

- 20 ms á aðgerðarskref, hraðast af fimm, á 24 GB korti en ekki A100.
- 1 til 3 USD á keyrslu á móti 4 til 12 fyrir 3 B flokkinn.
- Nákvæmt í snertiríkri vinnu sem það hefur séð: 88 og 96 prósent á Slide Ziploc og Slot Battery, þar sem fyrri aðferðir komust aldrei yfir fyrsta stig.
- Engin tungumálaskilyrðing: verkefnisstrengurinn er hunsaður, svo einn gátpunktur er eitt verkefni.
- Engar merkingarfræðilegar forsendur: allt sem það veit kom frá 50 þáttum þínum.
- Þröng alhæfing: færðu myndavél og þú ert að endurþjálfa.
- Það bilar hljóðlega: tap minnkar, armurinn gerir ekkert, loggarnir segja ekkert.
- Hraðaforgangurinn hjálpar aðeins ef ályktun er við hliðina á servóunum.
Veldu ACT þegar verkefni og svið eru föst og hreyfing verður að vera hröð og nákvæm. Veldu þegar einn gátpunktur þarf að ná yfir nokkrar leiðbeiningar. Tvær síður vinna ákvörðunina beint: og . Fyrir birt viðmið, tengir hverja tölu við uppruna sinn.
Það sem þú þarft áður en þú byrjar
Einn fylgjararmur, einn leiðararmur fyrir , að minnsta kosti ein myndavél, 24 GB GPU. ACT les aðeins myndir og liðstöður. Tvær myndavélar eru besti kosturinn: föst framsýn fyrir hvar hlutir eru, úlnliðsmyndavél fyrir það sem er að fara að snerta, eins og á ALOHA.
| Armur | Servó | Spenna | Kostnaður hluta | Staða |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 | 7.4 V | ~110 til 150 EUR | Fullur stuðningur, viðmiðunararmur |
| SO-101 | Feetech STS3215 | 7.4 V | ~130 til 170 EUR | Fullur stuðningur |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V og 12 V raðir | ~250 til 350 EUR | Samhæft |
| LeKiwi | Feetech STS3215 (armur) | 7.4 V armur, 12 V grunnur | ~400 til 500 EUR | Samhæft |
SO-100 og SO-101 nota Feetech STS3215 servó á 7.4 V rað. Að gefa þeim 12 V eyðileggur þau, nógu hljóðlega til að fólk kennir hugbúnaðinum fyrst um, og Koch 12 V aflgjafi passar líkamlega á SO-100 borð. Athugaðu merkimiðann. Einkenni: servó svarar ekki, armur kippist og sígur svo. Einnig SO-100 vs SO-101.
Frá berum armi til skráðs gagnasafns
Ferlið hér að neðan er lerobot 0.6.x. Slepptu því ef þú ert með kvarðaðan arm og gagnasafn. Annars fjallar SO-100 byrjunarleiðbeiningar um samsetningu, upptöku leiðbeiningar fjallar um upptöku og gagnasafns skjöl um sniðið.
- 1Setja upp lerobot með réttum aukapakka
Upptaka þarf
core_scripts, þjálfuntraining, Feetech servófeetech. Python 3.12+.bashconda create -y -n lerobot python=3.12 conda activate lerobot conda install ffmpeg -c conda-forge pip install 'lerobot[core_scripts,training,feetech]' lerobot-info - 2Finna USB-tengi hvers arms
Keyrðu það með báðum örmum tengdum, taktu annan úr sambandi þegar beðið er um það. Á Linux gætirðu þurft að opna heimildir fyrir hnútinn.
bashlerobot-find-port # on Linux, if the port exists but is unreadable: sudo chmod 666 /dev/ttyACM0 - 3Stilla auðkenni mótora og baudrate
Á SO-100 gerist þetta fyrir samsetningu: ólíkt SO-101 eru tengin óaðgengileg þegar búið er að setja saman. Skriftan fer yfir rásina einn mótor í einu frá gripnum og skrifar auðkenni í EEPROM.
bashlerobot-setup-motors \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 lerobot-setup-motors \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 - 4Kvarða báða arma
Stilltu hvern lið í miðju sviðs síns, ýttu á Enter, og farðu síðan með hvern og einn í gegnum allt svið sitt. Kvörðun gerir stefnu sem þjálfuð er á einum armi kleift að keyra á öðrum. Endurnýttu sama
id.bashlerobot-calibrate \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower lerobot-calibrate \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader - 5Fjarstýra einu sinni með myndavélarnar á
Þumalputtaregla lerobot: þú ættir að geta framkvæmt verkefnið með því að horfa aðeins á myndirnar frá myndavélunum. Ef þú getur það ekki, getur ACT það heldur ekki. Þetta finnur fleiri slæm gagnasöfn en síðari villuleit.
bashlerobot-teleoperate \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader \ --display_data=true - 6Taka upp 50 þætti
50 er lágmark AY-Robots og það sem ALOHA notaði á hvert verkefni. lerobot ráðleggur 10 á hvern stað hlutar, fastar myndavélar, stöðugt grip.
nlýkur þætti,rtekur upp aftur,qstöðvar og kóðar.bashHF_USER=$(NO_COLOR=1 hf auth whoami | awk -F': *' 'NR==1 {print $2}') lerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader \ --dataset.repo_id=${HF_USER}/so100_cube \ --dataset.num_episodes=50 \ --dataset.single_task="Grab the black cube and put it in the bin" \ --display_data=true

ACT hefur engar forsendur til að falla aftur á, svo sérhver ósamræmi verður varanlegt. Þrjú dýrustu: myndavél sem var hreyfð á milli þáttar 20 og 21, ljós sem breyttist vegna þess að þú tókst upp helminginn af settinu síðdegis, grip sem var gert á tvo vegu. Hvert og eitt gefur fullkomlega útlit tapferil og arm sem fer á rangan stað. Sjá tap fellur, stefna gerir ekkert, stefna virkar aðeins í einni uppsetningu og að safna hágæða þjálfunargögnum.
Fyrir þjálfun, spilaðu að minnsta kosti fimm þætti aftur. LeRobot gagnasafnssniðið geymir myndavélarstrauma, liðstöður og aðgerðir á hvern þátt, og endurspilun ýtir þessum aðgerðum aftur á arminn. Ef endurspilunin framkvæmir ekki verkefnið, innihalda gögnin það ekki og þjálfun mun ekki finna það upp.
lerobot-replay \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.id=my_follower \
--dataset.repo_id=${HF_USER}/so100_cube \
--dataset.episode=0Þjálfun ACT stefnunnar
Þetta er öll skipunin. Allt sem er ACT-sértækt er nú þegar sjálfgefið, þess vegna segir á lerobot ACT síðunni að byrja á þeim.
lerobot-train \
--dataset.repo_id=${HF_USER}/so100_cube \
--policy.type=act \
--output_dir=outputs/train/act_so100_cube \
--job_name=act_so100_cube \
--policy.device=cuda \
--wandb.enable=true \
--policy.repo_id=${HF_USER}/act_so100_cube--policy.type=act hleður ACTConfig, sem aðlagast að því hversu marga mótora og myndavélar gagnasafnið þitt skráði, svo þú þarft aldrei að lýsa athugunarforminu. --wandb.enable=true er valfrjálst og þess virði: tapferillinn er eina ódýra merkið í 100000 skrefa keyrslu. Tímaáætlunin kemur frá lerobot's train config, ekki ACTConfig: 100000 skref, lota 8, fræ 1000, geymslupunktur á 20000 skrefa fresti, skráning á 200 skrefa fresti.
Full keyrsla skilur eftir fimm geymslupunkta möppur, 020000 til 100000, auk síðasta tákntengils. Haltu þeim öllum: besta stefnan er oft ekki sú síðasta.
| Stilling | lerobot sjálfgefið | AY-Robots ACT form | Athugasemd |
|---|---|---|---|
| Stærð lotu | 8 | 8 | Lækkaðu hana fyrst ef þú lendir í VRAM takmörkunum. |
| Námshraði | 1e-5 | 1e-5 | Sama og í ALOHA greininni. |
| Hámarks skref | 100000 | 100000 | Nokkuð nálægt því þar sem 50 þátta sett hættir að batna. |
| Hallauppsöfnun | 1 | 1, does not apply | Breyttu stærð lotu í staðinn. |
| Fræ | 1000 | exposed | Aðgangspunktur GR00T tyro hefur ekkert fræ; ACT keyrslur eru þær endurgeranlegu. |
| chunk_size / n_action_steps | 100 / 100 | 100 / 100, editable | Spá- og framkvæmdarsjóndeildarhringur. Lækkaðu þann seinni, ekki þann fyrri. |
| Tíðni geymslupunkta | 20000 | not exposed | saveSteps er GR00T stilling hér. |
ACT með lotustærð 8 og tveimur 640x480 myndavélum passar vel á 24 GB. Það hættir að passa þegar fólk hækkar lotustærðina fyrir hraða, eða gefur því 1920x1080 ramma sem eitt lerobot upptökudæmi sýnir. Tveir ResNet-18 bakgrunnar í 1080p hafa mjög ólíkt minnisprófíl. Lækkaðu --batch_size í 4 áður en þú leigir stærra kort. Sjá minniþurrð í þjálfun.
Lengd: um 5 klukkustundir á 11 GB RTX 2080 Ti í greininni, nokkrar klukkustundir fyrir 100k skref samkvæmt ACT síðu lerobot, 2 til 5 klukkustundir á AY-Robots 24 GB flokki. Ekki stytta það. README skrá viðmiðunargeymslunnar segir að rykkjótt eða hlébundin stefna þurfi venjulega bara meira þjálfun, því árangur og mýkt halda áfram að batna eftir að tapferillinn nær jafnvægi: fyrir raunveruleg gögn vill það að minnsta kosti 5000 tímabil, eða 3 til 4 sinnum lengdina aftur eftir jafnvægið.
lerobot-train \
--config_path=outputs/train/act_so100_cube/checkpoints/last/pretrained_model/train_config.json \
--resume=trueKeyra þjálfaða stefnu á arminum
Innleiðing notar lerobot-rollout. Myndavélalyklar verða að passa við þá sem voru skráðir: stefna þjálfuð á front og wrist mun ekki samþykkja cam0 og cam1, og rename_map hjálpar ekki, þar sem það þarf forþjálfaðan geymslupunkt. Verkefnisstrengnum má sleppa; dæmi lerobot sjálfs merkir hann sem sleppanlegan fyrir ACT.
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/act_so100_cube \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.id=my_follower \
--robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \
--display_data=true \
--duration=60Mat fór áður fram með lerobot-record --policy.path=.... Í 0.6.x er það lerobot-rollout með --strategy.type vali: base, sentry (upptaka með sjálfvirkri upphleðslu), highlight (hringminni vistað með takkaborðssmelli), dagger (manneskja í lykkjunni) og episodic. Frá og með 23. ágúst 2026 segir ACT skjölunarsíðan enn „using the lerobot-record command“ beint fyrir ofan blokk sem keyrir lerobot-rollout. Fylgdu skipuninni, ekki setningunni.
Til að festa gátpunkt frekar en lokamódelið, bættu við --policy.pretrained_revision. Það krefst þess að keyrslan hafi byrjað með --save_checkpoint_to_hub=true, sjálfgefið óvirkt: án þess ýtir lerobot lokamódelinu og engu öðru. Með því er hver gátpunktur merktur með núllfylltu skrefi sínu, svo --policy.pretrained_revision=060000 endurheimtir 60000 skrefa gátpunktinn. Að bera hann saman við 100000 á raunverulegum armi er ódýrasta tilraunin sem völ er á.
Tvær leiðir að sama gátpunkti
Allt hér að ofan er handvirka leiðin og hún virkar. Vettvangurinn fórnar stjórn fyrir það að þurfa ekki að eiga GPU eða Python umhverfi.
- Settu upp lerobot 0.6.x með
core_scripts,training,feetech, ffmpeg. - Finndu tengi, stilltu mótorauðkenni, kvarðaðu báða armana, taktu upp 50 þætti.
- Spilaðu nokkra þætti aftur til að staðfesta að gögnin innihaldi verkefnið.
- Leigðu eða eignastu 24 GB GPU, passaðu CUDA og PyTorch, keyrðu
lerobot-train --policy.type=act. - Bíddu í nokkrar klukkustundir, keyrðu síðan
lerobot-rolloutá vélinni við arminn.
# the two commands that matter, end to end
lerobot-record --robot.type=so100_follower --robot.port=/dev/ttyACM0 \
--teleop.type=so100_leader --teleop.port=/dev/ttyACM1 \
--dataset.repo_id=${HF_USER}/so100_cube --dataset.num_episodes=50 \
--dataset.single_task="Grab the black cube"
lerobot-train --dataset.repo_id=${HF_USER}/so100_cube --policy.type=act \
--output_dir=outputs/train/act_so100_cube --policy.device=cudaFull stjórn: breyttu configuration_act.py, bættu við myndavél, greindu þjálfarann. Fyrir rannsóknir frekar en að senda verkefni er vettvangur truflun.
- Taktu upp með skjáborðsforritinu, eða komdu með Hugging Face repo auðkenni eða staðbundið gagnasafn.
- Opnaðu leiðbeiningarnar fyrir ACT á SO-100 og veldu líkan og gagnasafn. Sjálfgefnar stillingar eru lerobot stillingarnar; chunkSize, nActionSteps, seed og logFreq eru breytanleg.
- Bakendinn leigir GPU sem er stærðar eftir VRAM og skrifar eftirlitsstöðvar í hlutageymslu.
/api/inference/podþjónar síðan stefnunni til staðbundins vélmennaforrits. Óvirkt vaktkerfi eyðir podinu, svo ekkert er rukkað í laumi.- Sömu aðgerðir eru til í CLI, MCP netþjóninum og þjálfunarskjölunum.
Það lagar ekki gögnin þín: gagnasafn með færðri myndavél þjálfast jafn illa hér, og eyðublaðið getur ekki greint það. Það fjarlægir heldur ekki tafarvandamálið. Stýringarferillinn er 20 til 485 ms á hverju aðgerðarskrefi, með almennum internetferðum ofan á, og ACT verður mest fyrir áhrifum vegna þess að skrefið hennar er styst: 60 ms er 12 prósent hæging á 485 ms Pi0.5 en fjórfalt skrefið á 20 ms ACT. Fjarlæg ályktun hentar hægum "pick and place" aðgerðum, ekki hröðum viðbragðshreyfingum.

Hvað fer í raun úrskeiðis
Næstum enginn sársauki er í þjálfunarskipaninni. Hann er í hlutunum í kringum hana, raðað eftir því hversu oft þeir bíta í fyrsta skipti.
| Einkenni | Algeng orsök | Síða |
|---|---|---|
| lerobot-find-port sýnir ekkert | Rekill, kapall eða heimildir hnútpunktar | armur ekki greindur |
| Myndavél vantar við upptöku | Vísitala breyttist við endurræsingu, eða tvær myndavélar á einum USB stýrikerfi | myndavél ekki greind |
| Þjálfun hafnar gagnasafninu | ACT wants v3.0, GR00T needs v2.1 | gagnasafni hafnað sem v3 |
| CUDA minni uppurið | Hópstærð hækkuð, eða 1080p rammar í stað 480p | minni uppurið í þjálfun |
| Tap lítur vel út, armur gerir ekkert | Gögnin skortir verkefnið, eða myndavél færðist | tap lækkar, stefna gerir ekkert |
| Rykkjótt hreyfing eða hlé í miðjum þætti | Ófullþjálfað, stöðvun við blokkamörk, eða tímalokun á ályktunarkalli | stefna frýs í miðri hreyfingu |
Tvær raðir verðskulda áherslu. ACT þjálfar á LeRobot v3.0 á meðan hleðslutæki GR00T hrynur á því og þarf v2.1, svo gagnasafn sem þjálfar ACT getur valdið því að GR00T keyrsla mistekst. Og síðasta röðin hefur tvær lausnir: höfundar ACT svara rykkjóttri hreyfingu með meiri þjálfun, á meðan með n_action_steps við 100 lendir raunveruleg stöðvun við blokkamörk, sýnilegt hlé á 3.3 sekúndna fresti við 30 fps. Tvö atriði til viðbótar að vita: einn dauður liður er venjulega servó auðkenni sem aldrei var skrifað, og griparmi sem nálgast en lokast aldrei þýðir of lítið gripbil í sýnikennslunni. Heildarvísitala: síðurnar um bilunarham.
Hvað keyrsla kostar
| Flokkur | Líkön | Keyrslutími | Verð á klukkustund | Kostnaður á keyrslu |
|---|---|---|---|---|
| RTX 4090 / 24 GB | ACT, SmolVLA | 2 til 5 klukkustundir | 0.30 to 0.60 USD | um 1 til 3 USD |
| A100 80 GB / H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 til 6 klukkustundir | 1.20 to 2.00 USD | um 4 til 12 USD |
Þetta eru rökin fyrir því að byrja með ACT jafnvel þótt þú viljir VLA síðar. Misheppnuð ACT keyrsla kostar verð á kaffi og segir þér innan nokkurra klukkustunda hvort gagnasafnið þitt inniheldur verkefnið. Misheppnuð GR00T keyrsla kostar fjórfalt það fyrir sama lærdóm. Að færa sig upp í GR00T N1.7 eða SmolVLA eftir á er formbreyting, ekki endurbygging. Bakgrunnur: sjón-tungumál-aðgerðalíkön, fullkomin SO-100 leiðbeining, þjálfaðu fyrstu stefnuna þína og herminám. Enginn armur? Beina útsendingarsíðan streymir raunverulegum SO-100 til að keyra án þess að skrá sig.
Þjálfaðu ACT á SO-100 þínum
Leiðbeiningar fyrir þessa nákvæmu samsetningu: sjálfgefnar stillingar, GPU flokkur og hvað keyrsla kostar. Veldu gagnasafnið, bakendinn leigir kortið og skrifar geymslupunkta.
Opnaðu þjálfunarleiðbeiningarnarEr til forþjálfað ACT líkan sem ég get fínstillt í staðinn?▾
Nei. ACT hefur ekkert grunnlíkan; það verður aðeins til eftir að þú þjálfar það. Þetta er ekki gat í verkfærunum, þetta er það sem ACT er: greinin þjálfar stefnu frá grunni fyrir hvert verkefni. Fyrir söluaðila geymslupunkt, notaðu GR00T N1.7 eða Pi0.5.
Hversu marga þætti þarf ég í raun og veru?▾
50: það sem ALOHA skráði fyrir hvert verkefni (100 fyrir Thread Velcro, það erfiðasta) og lágmark AY-Robots. lerobot ráðleggur um 10 á hvern staðsetningu hlutar, myndavélar fastar, grip samkvæmt. Fimmtíu hreinir þættir eru betri en hundrað þar sem myndavélin hreyfðist.
Ætti ég að breyta chunk_size úr 100?▾
Yfirleitt ekki. Ablation klifrar úr 1 prósenti við k = 1 í 44 prósent við k = 100 og minnkar síðan, svo 100 er nálægt toppnum. Ef armurinn skuldbindur sig of lengi, lækkaðu n_action_steps í staðinn: við 30 fps, 25 endurspurnir á 0.8 sekúndna fresti.
Hversu langan tíma tekur þjálfunarferli, og get ég stöðvað það snemma?▾
Tvær til fimm klukkustundir á 24 GB korti fyrir 100000 skref. Geymslupunktar lenda á 20000 skrefa fresti og --resume=true heldur áfram keyrslu, svo það er óhætt að stöðva snemma. Bara ekki á fyrsta slétta kaflanum: sléttleiki batnar eftir að tapið nær jafnvægi.
Tap minnkaði og armurinn mistekst enn. Hvað nú?▾
Næstum alltaf gagnasafnið. Spilaðu upptaka þætti á arminum: ef uppspilunin framkvæmir ekki verkefnið, inniheldur gögnin það ekki. Athugaðu síðan hvort eitthvað hreyfðist, sérstaklega myndavél. ACT hefur engar forsendur, svo smá ýting í þætti 21 er varanleg.
Sources
- Zhao, Kumar, Levine, Finn: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT), arXiv 2304.13705
- ALOHA / ACT project page
- tonyzhaozh/act, the reference implementation and its training-length advice
- tonyzhaozh/act issue 25: the action head reads only the first decoder layer
- huggingface/lerobot
- lerobot ACTConfig: chunk_size, n_action_steps, n_decoder_layers and the rest of the defaults
- lerobot TrainPipelineConfig: steps, batch_size, seed, save_freq, log_freq, save_checkpoint_to_hub
- lerobot train_utils: zero-padded checkpoint dirs, the last symlink and checkpoint push tagging
- lerobot v0.6.1 release, 3 August 2026
- LeRobot docs: ACT
- LeRobot docs: imitation learning on real robots (record, replay, train, rollout)
- LeRobot docs: SO-100 setup, motor ids and calibration
- LeRobot docs: installation and the optional extras
- Hugging Face blog: LeRobot Community Datasets, the ImageNet of Robotics, When and How?
- TheRobotStudio/SO-ARM100: Standard Open Arm 100
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started