Þjálfunarfylki AY-Robots með fimm stefnulínum og fjórum vélmennaarmasúlum, þar sem hver reitur tengist ákveðinni gerð og þjálfunarleiðbeiningum fyrir arminn
ACTSO-100lerobotherminámstefnuþjálfun

Hvernig á að þjálfa ACT á SO-100 frá grunni

AY-Robots ResearchAugust 23, 202616 mín lestur

Þjálfaðu Action Chunking Transformer frá grunni á SO-100 með lerobot: act config, chunk_size og n_action_steps, 100000 skrefa áætlunin, 20 ms ályktun.

ACT er undantakið meðal SO-100 stefnanna. GR00T N1.7 og N1.5 byrja frá nvidia/GR00T-N1.7-3B og nvidia/GR00T-N1.5-3B, Pi0.5 frá lerobot/pi05_base. ACT byrjar frá grunni: það er enginn grunnur eftirlitsstaður, því það er ekki grunnlíkan. Það er um það bil 80 milljóna færibreytu spennir sem þú þjálfar frá grunni í einu verkefni, á handleggnum þínum, undir lýsingu þinni.

Þess vegna keyrir það stjórnunarskref á 20 ms þar sem 3 milljarða færibreytu VLA þarf 152 til 485 ms, og kostar 1 til 3 USD á keyrslu í stað 4 til 12. Þessi leiðbeining fer handvirka leið með lerobot á SO-100: upptaka, act stillingin, hvað chunk_size og n_action_steps stjórna, 100000 skrefa áætlunin, útfærslan. Síðan sama verkefnið á AY-Robots, þar á meðal þar sem pallurinn hjálpar ekki.

Það sem þú þarft að vita

  • ACT þjálfar frá grunni: ekkert grunnlíkan, engin forþjálfun, engin tungumálinntak. Einn eftirlitsstaður, eitt verkefni.
  • Greinin: um 80 M færibreytur, um 5 klukkustundir á 11 GB RTX 2080 Ti, 0.01 s ályktun.
  • lerobot sjálfgefið: chunk_size 100, n_action_steps 100, batch 8, lr 1e-5, 100000 skref, seed 1000.
  • Á AY-Robots: 20 ms á skref, hraðast af fimm. Lágmark 50 þættir, LeRobot v3.0, 24 GB kort, 1 til 3 USD á keyrslu.
  • Það vinnur í verkefni sem það hefur séð, og tapar um leið og þú vilt tungumálaskilyrðingu.
Hvaða útgáfur þetta lýsir

Athugað 23. ágúst 2026 gegn lerobot 0.6.x: pyproject.toml á main les version = "0.6.2", nýjasta merkið v0.6.1, 3. ágúst 2026. Kennsla sem byrjar með python lerobot/scripts/train.py er eldri en inngangspunktarnir í stjórnborðinu lerobot-train, lerobot-record og lerobot-rollout.

Hvað ACT raunverulega er

Aðgerðaskipting með Transformers kemur úr ALOHA greininni, Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware, eftir Zhao, Kumar, Levine og Finn, arXiv, 23. apríl 2023. Búnaðurinn tekur upp á 50 Hz með fjórum vefmyndavélum sem streyma 480x640 á 30 fps: tvær á gripunum, ein að ofan, ein að framan. Ágrip greinarinnar heldur því fram að sex færni hafi náð 80 til 90 prósenta árangri, þar á meðal að opna hálfgegnsæjan kryddbolla og setja rafhlöðu í, eftir 10 mínútna sýnikennslu.

Aðaltextinn er gagnlegri þegar skipulögð er upptökulota: 50 sýnikennslur á verkefni, nema Thread Velcro á 100, sem er 10 til 20 mínútur af gögnum og 30 til 60 mínútur af rauntíma þegar endurstillingar eru taldar með. Árangur er heldur ekki jafn: Thread Velcro endar á 20 prósentum, Put On Shoe á 92, Cup Open 84, Prep Tape 64.

OfurbreytaALOHA greinin, Tafla IIIlerobot á main
námsstuðull1e-5optimizer_lr = 1e-5
lotustærð8batch_size = 8, in TrainPipelineConfig not ACTConfig
kóðara / afkóðara lög4 / 7n_encoder_layers = 4 / n_decoder_layers = 1
kubbstærð k100chunk_size = 100
falin vídd zabsent; Fig. 11 shows a 32 to 512 projectionlatent_dim = 32
tímaleg samsetningabsent; --temporal_agg in the reference codetemporal_ensemble_coeff = None
Röðin um afkóðunarlagið er ekki innsláttarvilla

Greinin listar 7 afkóðunarlög, lerobot sendir 1, viljandi. Athugasemdin í configuration_act.py segir að upprunalega útfærslan hafi galla sem þýðir að aðeins fyrsta lagið er notað, og vísar í vandamál 25 í tonyzhaozh/act: aðgerðarhausinn les hs[0], svo öll sjö lögin keyra en aðeins fyrsta úttakið nær spánni. Þetta vandamál hefur verið opið og ósvarað síðan 23. apríl 2024. lerobot passar við hegðunina sem framleiddi birtar niðurstöður, ekki prentaða númerið. Hækkaðu --policy.n_decoder_layers og þú þjálfar líkan sem greinin aldrei mat.

Aðgerðaskipting er kjarninn í hugmyndinni

Venjuleg hegðunarklónun varpar einni athugun í eina aðgerð, og villur safnast upp: frávik setur handlegginn út fyrir dreifingu, framleiðir verri aðgerð, og þrjátíu skrefum síðar er gripurinn hvergi nærri hlutnum. Aðgerðaskipting spáir fyrir um k aðgerðir í einu og framkvæmir þær, sem lækkar virkan sjóndeildarhring um stuðulinn k. Það tekur einnig á óþægindum sem eru sérstök fyrir mannleg gögn: fjarstýringar gera hlé, og eins-skrefs Markovísk stefna getur ekki líkanfært hlé sem fer eftir því sem á undan kom.

Greinin rannsakar k frekar en að fullyrða það. Með tímabundinni samsetningu óvirkri, að meðaltali yfir fjórar stillingar, hækkar árangur úr 1 prósenti við k = 1 í 44 prósent við k = 100, og minnkar síðan við 200 og 400 þegar stefnan nálgast opna lykkjustýringu. Sú ferill er ástæðan fyrir því að sjálfgefið gildi er 100.

  • chunk_size: hversu margar framtíðaraðgerðir afkóðarinn spáir fyrir um í hverri framsendingu. Sjálfgefið 100.
  • n_action_steps: hversu margar af þeim þú framkvæmir áður en þú spyrð aftur. Sjálfgefið 100, svo lerobot keyrir allan bitann í opnum lykkju.
  • lerobot staðfestir n_action_steps <= chunk_size og kastar ValueError ef þú snýrð því við.

Það sem skiptir máli í rekstri er chunk_size deilt með rammatíðni. Við 30 fps sem dæmi lerobot's SO-100 nota, skuldbindur biti af 100 um 3.3 sekúndur frá einni athugun. Ef verkefnið þarf leiðréttingu innan þess glugga, lækkaðu n_action_steps, ekki chunk_size: þú heldur langri spá og athugar aftur oftar.

bash
# predict 100 actions, re-query after 25 of them (about 0.8 s at 30 fps)
lerobot-train \
  --dataset.repo_id=${HF_USER}/so100_cube \
  --policy.type=act \
  --policy.chunk_size=100 \
  --policy.n_action_steps=25 \
  --policy.device=cuda
Stytting á framkvæmdum hluta bitans án þess að stytta spána.
Tímabundin samsetningar gildra

Stilltu --policy.temporal_ensemble_coeff og lerobot krefst n_action_steps = 1, og kastar NotImplementedError annars. Samsetning spyr stefnuna í hverju tímastigi og blandar saman skarandi spám fyrir það tímastig með vigtum w_i = exp(-m * i), þar sem sú elsta fær w_0. Greinin setur það í 3.3 prósent fyrir ACT: raunverulegt en hóflegt, og það margfaldar ályktunarfjölda með lengd bitans. Viðráðanlegt við 20 ms á hvert skref, ekki við 485 ms. Sjá töf á ályktun.

Þegar ACT sigrar grunnlíkan

Fimm þjálfanlegar stefnur hlið við hlið, með tölunum sem AY-Robots mælir og notar til að ákvarða stærð GPU sem það leigir.

StefnaFjölskyldaFæribreyturÁ hvert skrefGPU flokkurLágmarksþættirGagnasafn
ACTKjarnaskipta spennir, frá grunni~80 M20 msRTX 4090 / 24 GB50LeRobot v3.0
SmolVLAÞétt VLA~450 M245 msRTX 4090 / 24 GB30LeRobot v3.0
GR00T N1.7VLA grunnur, dreifingarhaus~3 B (~40 M trained)152 msA100 / H100 80 GB50LeRobot v2.0 or v2.1
GR00T N1.5VLA grunnur, forveri~3 B165 msA100 / H100 80 GB50LeRobot v2.0 or v2.1
Pi0.5Flæðisjöfnun VLA, sjá flæðisjöfnun~3 B, PaliGemma backbone485 msA100 / H100 80 GB50LeRobot v3.0
The AY-Robots policies page showing a comparison table of ACT, SmolVLA, GR00T N1.5, GR00T N1.7 and Pi0.5 with parameter counts, GPU requirements, inference latency and minimum episode counts
Taflan /policies: ACT hefur fæsta færibreytur og stystan skrefstíma.
Þjálfun ACT frá grunni
Kostir
  • 20 ms á aðgerðarskref, hraðast af fimm, á 24 GB korti en ekki A100.
  • 1 til 3 USD á keyrslu á móti 4 til 12 fyrir 3 B flokkinn.
  • Nákvæmt í snertiríkri vinnu sem það hefur séð: 88 og 96 prósent á Slide Ziploc og Slot Battery, þar sem fyrri aðferðir komust aldrei yfir fyrsta stig.
Málamiðlanir
  • Engin tungumálaskilyrðing: verkefnisstrengurinn er hunsaður, svo einn gátpunktur er eitt verkefni.
  • Engar merkingarfræðilegar forsendur: allt sem það veit kom frá 50 þáttum þínum.
  • Þröng alhæfing: færðu myndavél og þú ert að endurþjálfa.
  • Það bilar hljóðlega: tap minnkar, armurinn gerir ekkert, loggarnir segja ekkert.
  • Hraðaforgangurinn hjálpar aðeins ef ályktun er við hliðina á servóunum.

Veldu ACT þegar verkefni og svið eru föst og hreyfing verður að vera hröð og nákvæm. Veldu þegar einn gátpunktur þarf að ná yfir nokkrar leiðbeiningar. Tvær síður vinna ákvörðunina beint: og . Fyrir birt viðmið, tengir hverja tölu við uppruna sinn.

Það sem þú þarft áður en þú byrjar

Einn fylgjararmur, einn leiðararmur fyrir , að minnsta kosti ein myndavél, 24 GB GPU. ACT les aðeins myndir og liðstöður. Tvær myndavélar eru besti kosturinn: föst framsýn fyrir hvar hlutir eru, úlnliðsmyndavél fyrir það sem er að fara að snerta, eins og á ALOHA.

ArmurServóSpennaKostnaður hlutaStaða
SO-100Feetech STS32157.4 V~110 til 150 EURFullur stuðningur, viðmiðunararmur
SO-101Feetech STS32157.4 V~130 til 170 EURFullur stuðningur
Koch v1.1Dynamixel XL330 / XL4305 V og 12 V raðir~250 til 350 EURSamhæft
LeKiwiFeetech STS3215 (armur)7.4 V armur, 12 V grunnur~400 til 500 EURSamhæft
7.4 V, ekki 12 V

SO-100 og SO-101 nota Feetech STS3215 servó á 7.4 V rað. Að gefa þeim 12 V eyðileggur þau, nógu hljóðlega til að fólk kennir hugbúnaðinum fyrst um, og Koch 12 V aflgjafi passar líkamlega á SO-100 borð. Athugaðu merkimiðann. Einkenni: servó svarar ekki, armur kippist og sígur svo. Einnig SO-100 vs SO-101.

Frá berum armi til skráðs gagnasafns

Ferlið hér að neðan er lerobot 0.6.x. Slepptu því ef þú ert með kvarðaðan arm og gagnasafn. Annars fjallar SO-100 byrjunarleiðbeiningar um samsetningu, upptöku leiðbeiningar fjallar um upptöku og gagnasafns skjöl um sniðið.

  1. 1
    Setja upp lerobot með réttum aukapakka

    Upptaka þarf core_scripts, þjálfun training, Feetech servó feetech. Python 3.12+.

    bash
    conda create -y -n lerobot python=3.12
    conda activate lerobot
    conda install ffmpeg -c conda-forge
    
    pip install 'lerobot[core_scripts,training,feetech]'
    lerobot-info
  2. 2
    Finna USB-tengi hvers arms

    Keyrðu það með báðum örmum tengdum, taktu annan úr sambandi þegar beðið er um það. Á Linux gætirðu þurft að opna heimildir fyrir hnútinn.

    bash
    lerobot-find-port
    # on Linux, if the port exists but is unreadable:
    sudo chmod 666 /dev/ttyACM0
  3. 3
    Stilla auðkenni mótora og baudrate

    Á SO-100 gerist þetta fyrir samsetningu: ólíkt SO-101 eru tengin óaðgengileg þegar búið er að setja saman. Skriftan fer yfir rásina einn mótor í einu frá gripnum og skrifar auðkenni í EEPROM.

    bash
    lerobot-setup-motors \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0
    
    lerobot-setup-motors \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1
  4. 4
    Kvarða báða arma

    Stilltu hvern lið í miðju sviðs síns, ýttu á Enter, og farðu síðan með hvern og einn í gegnum allt svið sitt. Kvörðun gerir stefnu sem þjálfuð er á einum armi kleift að keyra á öðrum. Endurnýttu sama id.

    bash
    lerobot-calibrate \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower
    
    lerobot-calibrate \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader
  5. 5
    Fjarstýra einu sinni með myndavélarnar á

    Þumalputtaregla lerobot: þú ættir að geta framkvæmt verkefnið með því að horfa aðeins á myndirnar frá myndavélunum. Ef þú getur það ekki, getur ACT það heldur ekki. Þetta finnur fleiri slæm gagnasöfn en síðari villuleit.

    bash
    lerobot-teleoperate \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader \
        --display_data=true
  6. 6
    Taka upp 50 þætti

    50 er lágmark AY-Robots og það sem ALOHA notaði á hvert verkefni. lerobot ráðleggur 10 á hvern stað hlutar, fastar myndavélar, stöðugt grip. n lýkur þætti, r tekur upp aftur, q stöðvar og kóðar.

    bash
    HF_USER=$(NO_COLOR=1 hf auth whoami | awk -F': *' 'NR==1 {print $2}')
    
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader \
        --dataset.repo_id=${HF_USER}/so100_cube \
        --dataset.num_episodes=50 \
        --dataset.single_task="Grab the black cube and put it in the bin" \
        --display_data=true
AY-Robots upptökuhandbókarsíðan sem útskýrir hvernig á að fanga gagnasafn á LeRobot-sniði úr fjarstýringarlotu
Upptökuhandbókin. Skjáborðsforritið skrifar sama skipulag og lerobot-record.
Gildran sem étur dag: ósamræmt gagnasafn

ACT hefur engar forsendur til að falla aftur á, svo sérhver ósamræmi verður varanlegt. Þrjú dýrustu: myndavél sem var hreyfð á milli þáttar 20 og 21, ljós sem breyttist vegna þess að þú tókst upp helminginn af settinu síðdegis, grip sem var gert á tvo vegu. Hvert og eitt gefur fullkomlega útlit tapferil og arm sem fer á rangan stað. Sjá tap fellur, stefna gerir ekkert, stefna virkar aðeins í einni uppsetningu og að safna hágæða þjálfunargögnum.

Fyrir þjálfun, spilaðu að minnsta kosti fimm þætti aftur. LeRobot gagnasafnssniðið geymir myndavélarstrauma, liðstöður og aðgerðir á hvern þátt, og endurspilun ýtir þessum aðgerðum aftur á arminn. Ef endurspilunin framkvæmir ekki verkefnið, innihalda gögnin það ekki og þjálfun mun ekki finna það upp.

bash
lerobot-replay \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM0 \
    --robot.id=my_follower \
    --dataset.repo_id=${HF_USER}/so100_cube \
    --dataset.episode=0
Spila aftur þátt 0. Ef þetta mistekst, stöðvaðu og taktu upp aftur.

Þjálfun ACT stefnunnar

Þetta er öll skipunin. Allt sem er ACT-sértækt er nú þegar sjálfgefið, þess vegna segir á lerobot ACT síðunni að byrja á þeim.

bash
lerobot-train \
  --dataset.repo_id=${HF_USER}/so100_cube \
  --policy.type=act \
  --output_dir=outputs/train/act_so100_cube \
  --job_name=act_so100_cube \
  --policy.device=cuda \
  --wandb.enable=true \
  --policy.repo_id=${HF_USER}/act_so100_cube
Þjálfunarskipunin úr lerobot 0.6.x skjölunum, á SO-100 gagnasafni.

--policy.type=act hleður ACTConfig, sem aðlagast að því hversu marga mótora og myndavélar gagnasafnið þitt skráði, svo þú þarft aldrei að lýsa athugunarforminu. --wandb.enable=true er valfrjálst og þess virði: tapferillinn er eina ódýra merkið í 100000 skrefa keyrslu. Tímaáætlunin kemur frá lerobot's train config, ekki ACTConfig: 100000 skref, lota 8, fræ 1000, geymslupunktur á 20000 skrefa fresti, skráning á 200 skrefa fresti.

Full keyrsla skilur eftir fimm geymslupunkta möppur, 020000 til 100000, auk síðasta tákntengils. Haltu þeim öllum: besta stefnan er oft ekki sú síðasta.

Stillinglerobot sjálfgefiðAY-Robots ACT formAthugasemd
Stærð lotu88Lækkaðu hana fyrst ef þú lendir í VRAM takmörkunum.
Námshraði1e-51e-5Sama og í ALOHA greininni.
Hámarks skref100000100000Nokkuð nálægt því þar sem 50 þátta sett hættir að batna.
Hallauppsöfnun11, does not applyBreyttu stærð lotu í staðinn.
Fræ1000exposedAðgangspunktur GR00T tyro hefur ekkert fræ; ACT keyrslur eru þær endurgeranlegu.
chunk_size / n_action_steps100 / 100100 / 100, editableSpá- og framkvæmdarsjóndeildarhringur. Lækkaðu þann seinni, ekki þann fyrri.
Tíðni geymslupunkta20000not exposedsaveSteps er GR00T stilling hér.
Minniþurrð er vandamál með stærð lotu, ekki kortavandamál

ACT með lotustærð 8 og tveimur 640x480 myndavélum passar vel á 24 GB. Það hættir að passa þegar fólk hækkar lotustærðina fyrir hraða, eða gefur því 1920x1080 ramma sem eitt lerobot upptökudæmi sýnir. Tveir ResNet-18 bakgrunnar í 1080p hafa mjög ólíkt minnisprófíl. Lækkaðu --batch_size í 4 áður en þú leigir stærra kort. Sjá minniþurrð í þjálfun.

Lengd: um 5 klukkustundir á 11 GB RTX 2080 Ti í greininni, nokkrar klukkustundir fyrir 100k skref samkvæmt ACT síðu lerobot, 2 til 5 klukkustundir á AY-Robots 24 GB flokki. Ekki stytta það. README skrá viðmiðunargeymslunnar segir að rykkjótt eða hlébundin stefna þurfi venjulega bara meira þjálfun, því árangur og mýkt halda áfram að batna eftir að tapferillinn nær jafnvægi: fyrir raunveruleg gögn vill það að minnsta kosti 5000 tímabil, eða 3 til 4 sinnum lengdina aftur eftir jafnvægið.

bash
lerobot-train \
  --config_path=outputs/train/act_so100_cube/checkpoints/last/pretrained_model/train_config.json \
  --resume=true
Halda áfram truflaðri keyrslu frá síðasta geymslupunkti.

Keyra þjálfaða stefnu á arminum

Innleiðing notar lerobot-rollout. Myndavélalyklar verða að passa við þá sem voru skráðir: stefna þjálfuð á front og wrist mun ekki samþykkja cam0 og cam1, og rename_map hjálpar ekki, þar sem það þarf forþjálfaðan geymslupunkt. Verkefnisstrengnum má sleppa; dæmi lerobot sjálfs merkir hann sem sleppanlegan fyrir ACT.

bash
lerobot-rollout \
  --strategy.type=base \
  --policy.path=${HF_USER}/act_so100_cube \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.id=my_follower \
  --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30} }" \
  --display_data=true \
  --duration=60
Sjálfvirk útfærsla án upptöku. Notaðu --strategy.type=sentry til að taka upp matsloturnar.
Þessari skipun var nýlega breytt nafni, svo gamlar kennsluleiðbeiningar eru ósammála

Mat fór áður fram með lerobot-record --policy.path=.... Í 0.6.x er það lerobot-rollout með --strategy.type vali: base, sentry (upptaka með sjálfvirkri upphleðslu), highlight (hringminni vistað með takkaborðssmelli), dagger (manneskja í lykkjunni) og episodic. Frá og með 23. ágúst 2026 segir ACT skjölunarsíðan enn „using the lerobot-record command“ beint fyrir ofan blokk sem keyrir lerobot-rollout. Fylgdu skipuninni, ekki setningunni.

Til að festa gátpunkt frekar en lokamódelið, bættu við --policy.pretrained_revision. Það krefst þess að keyrslan hafi byrjað með --save_checkpoint_to_hub=true, sjálfgefið óvirkt: án þess ýtir lerobot lokamódelinu og engu öðru. Með því er hver gátpunktur merktur með núllfylltu skrefi sínu, svo --policy.pretrained_revision=060000 endurheimtir 60000 skrefa gátpunktinn. Að bera hann saman við 100000 á raunverulegum armi er ódýrasta tilraunin sem völ er á.

Tvær leiðir að sama gátpunkti

Allt hér að ofan er handvirka leiðin og hún virkar. Vettvangurinn fórnar stjórn fyrir það að þurfa ekki að eiga GPU eða Python umhverfi.

  1. Settu upp lerobot 0.6.x með core_scripts, training, feetech, ffmpeg.
  2. Finndu tengi, stilltu mótorauðkenni, kvarðaðu báða armana, taktu upp 50 þætti.
  3. Spilaðu nokkra þætti aftur til að staðfesta að gögnin innihaldi verkefnið.
  4. Leigðu eða eignastu 24 GB GPU, passaðu CUDA og PyTorch, keyrðu lerobot-train --policy.type=act.
  5. Bíddu í nokkrar klukkustundir, keyrðu síðan lerobot-rollout á vélinni við arminn.
bash
# the two commands that matter, end to end
lerobot-record --robot.type=so100_follower --robot.port=/dev/ttyACM0 \
  --teleop.type=so100_leader --teleop.port=/dev/ttyACM1 \
  --dataset.repo_id=${HF_USER}/so100_cube --dataset.num_episodes=50 \
  --dataset.single_task="Grab the black cube"

lerobot-train --dataset.repo_id=${HF_USER}/so100_cube --policy.type=act \
  --output_dir=outputs/train/act_so100_cube --policy.device=cuda
Hvað þessi leið gefur þér

Full stjórn: breyttu configuration_act.py, bættu við myndavél, greindu þjálfarann. Fyrir rannsóknir frekar en að senda verkefni er vettvangur truflun.

AY-Robots þjálfunarfylkið með fimm stefnuröðum og fjórum vélmennaarmadálkum, þar sem hver reitur tengist sérstökum þjálfunarleiðbeiningum fyrir þá líkan- og armasamsetningu
Fylkið á /train. ACT röðin á móti SO-100 dálkinum er leiðbeiningar þessarar greinar.

Hvað fer í raun úrskeiðis

Næstum enginn sársauki er í þjálfunarskipaninni. Hann er í hlutunum í kringum hana, raðað eftir því hversu oft þeir bíta í fyrsta skipti.

EinkenniAlgeng orsökSíða
lerobot-find-port sýnir ekkertRekill, kapall eða heimildir hnútpunktararmur ekki greindur
Myndavél vantar við upptökuVísitala breyttist við endurræsingu, eða tvær myndavélar á einum USB stýrikerfimyndavél ekki greind
Þjálfun hafnar gagnasafninuACT wants v3.0, GR00T needs v2.1gagnasafni hafnað sem v3
CUDA minni uppuriðHópstærð hækkuð, eða 1080p rammar í stað 480pminni uppurið í þjálfun
Tap lítur vel út, armur gerir ekkertGögnin skortir verkefnið, eða myndavél færðisttap lækkar, stefna gerir ekkert
Rykkjótt hreyfing eða hlé í miðjum þættiÓfullþjálfað, stöðvun við blokkamörk, eða tímalokun á ályktunarkallistefna frýs í miðri hreyfingu

Tvær raðir verðskulda áherslu. ACT þjálfar á LeRobot v3.0 á meðan hleðslutæki GR00T hrynur á því og þarf v2.1, svo gagnasafn sem þjálfar ACT getur valdið því að GR00T keyrsla mistekst. Og síðasta röðin hefur tvær lausnir: höfundar ACT svara rykkjóttri hreyfingu með meiri þjálfun, á meðan með n_action_steps við 100 lendir raunveruleg stöðvun við blokkamörk, sýnilegt hlé á 3.3 sekúndna fresti við 30 fps. Tvö atriði til viðbótar að vita: einn dauður liður er venjulega servó auðkenni sem aldrei var skrifað, og griparmi sem nálgast en lokast aldrei þýðir of lítið gripbil í sýnikennslunni. Heildarvísitala: síðurnar um bilunarham.

Hvað keyrsla kostar

FlokkurLíkönKeyrslutímiVerð á klukkustundKostnaður á keyrslu
RTX 4090 / 24 GBACT, SmolVLA2 til 5 klukkustundir0.30 to 0.60 USDum 1 til 3 USD
A100 80 GB / H100GR00T N1.7, GR00T N1.5, Pi0.53 til 6 klukkustundir1.20 to 2.00 USDum 4 til 12 USD

Þetta eru rökin fyrir því að byrja með ACT jafnvel þótt þú viljir VLA síðar. Misheppnuð ACT keyrsla kostar verð á kaffi og segir þér innan nokkurra klukkustunda hvort gagnasafnið þitt inniheldur verkefnið. Misheppnuð GR00T keyrsla kostar fjórfalt það fyrir sama lærdóm. Að færa sig upp í GR00T N1.7 eða SmolVLA eftir á er formbreyting, ekki endurbygging. Bakgrunnur: sjón-tungumál-aðgerðalíkön, fullkomin SO-100 leiðbeining, þjálfaðu fyrstu stefnuna þína og herminám. Enginn armur? Beina útsendingarsíðan streymir raunverulegum SO-100 til að keyra án þess að skrá sig.

Þjálfaðu ACT á SO-100 þínum

Leiðbeiningar fyrir þessa nákvæmu samsetningu: sjálfgefnar stillingar, GPU flokkur og hvað keyrsla kostar. Veldu gagnasafnið, bakendinn leigir kortið og skrifar geymslupunkta.

Opnaðu þjálfunarleiðbeiningarnar
Er til forþjálfað ACT líkan sem ég get fínstillt í staðinn?

Nei. ACT hefur ekkert grunnlíkan; það verður aðeins til eftir að þú þjálfar það. Þetta er ekki gat í verkfærunum, þetta er það sem ACT er: greinin þjálfar stefnu frá grunni fyrir hvert verkefni. Fyrir söluaðila geymslupunkt, notaðu GR00T N1.7 eða Pi0.5.

Hversu marga þætti þarf ég í raun og veru?

50: það sem ALOHA skráði fyrir hvert verkefni (100 fyrir Thread Velcro, það erfiðasta) og lágmark AY-Robots. lerobot ráðleggur um 10 á hvern staðsetningu hlutar, myndavélar fastar, grip samkvæmt. Fimmtíu hreinir þættir eru betri en hundrað þar sem myndavélin hreyfðist.

Ætti ég að breyta chunk_size úr 100?

Yfirleitt ekki. Ablation klifrar úr 1 prósenti við k = 1 í 44 prósent við k = 100 og minnkar síðan, svo 100 er nálægt toppnum. Ef armurinn skuldbindur sig of lengi, lækkaðu n_action_steps í staðinn: við 30 fps, 25 endurspurnir á 0.8 sekúndna fresti.

Hversu langan tíma tekur þjálfunarferli, og get ég stöðvað það snemma?

Tvær til fimm klukkustundir á 24 GB korti fyrir 100000 skref. Geymslupunktar lenda á 20000 skrefa fresti og --resume=true heldur áfram keyrslu, svo það er óhætt að stöðva snemma. Bara ekki á fyrsta slétta kaflanum: sléttleiki batnar eftir að tapið nær jafnvægi.

Tap minnkaði og armurinn mistekst enn. Hvað nú?

Næstum alltaf gagnasafnið. Spilaðu upptaka þætti á arminum: ef uppspilunin framkvæmir ekki verkefnið, inniheldur gögnin það ekki. Athugaðu síðan hvort eitthvað hreyfðist, sérstaklega myndavél. ACT hefur engar forsendur, svo smá ýting í þætti 21 er varanleg.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started