AY-Robots prufusíðan: þrjár leiðir til að byrja án þess að eiga vélmenni, þar á meðal að leigja GPU fyrir stefnuályktun
GR00T N1.7Fjarstýrð ályktunSkýja-GPULeRobotSO-100Töf

Keyra GR00T ályktun án staðbundinnar GPU

AY-Robots ResearchAugust 23, 202619 mínútna lestur

Vélmennavélin þín hefur enga GPU. Settu GR00T stefnumiðlarann á leigða skýja-GPU, streymdu aðgerðabitum til armsins, og lærðu nákvæmlega hvað netið kostar þig.

Raspberry Pi er nóg til að knýja yfir raðtengi og sækja ramma af tveimur USB myndavélum. Það er ekki nóg til að keyra þriggja milljarða færibreytu : README skjal NVIDIA segir að GR00T N1.7 ályktun krefjist eins GPU með 16 GB eða meira af VRAM. Til að sjá hvað fínstillt eftirlitsstöð gerir á arminum án þess að kaupa kort, settu stefnuna á leigðan skýja-GPU, haltu vélmennalykkjunni á tölvunni með USB tengjunum og sendu athuganir og aðgerðabita yfir netið.

Það virkar, það er ekki ókeypis og verðið dreifist ekki jafnt á milli verkefna. Hér að neðan: Stefnuþjónn NVIDIA, ósamstilltur staflinn frá lerobot, reikningsaðferðin sem segir fyrirfram hvort upphleðslan þín sé nógu hröð og leiðin um pallinn. Allt þetta athugað gegn Isaac-GR00T aðalgreininni (N1.7 GA) og lerobot 0.6.1 þann 23. ágúst 2026.

Það sem þú þarft að vita

  • GR00T N1.7, GR00T N1.5 og Pi0.5 eru um það bil 3 milljarða færibreytu líkön. Engin þeirra passa á vélmennastýringu án sérstaks GPU.
  • Isaac-GR00T og lerobot senda báðir með skiptingu milli biðlara og þjóns. Þú skrifar ekki flutningslagið.
  • Athuganir ráða kostnaði á netinu, ekki aðgerðir: tveir óþjappaðir 640x480 RGB rammar eru 1.843.200 bæti, um 14,7 Mbit á hvert kall, og hvorugur staflinn þjappar þeim.
  • AY-Robots listar 20 til 485 ms á hvert aðgerðarskref eftir líkani. Netferðir bætast ofan á það.
  • Fjarályktun hentar hægum "pick-and-place" verkefnum, ekki hröðum viðbragðshreyfingum. Lengri framkvæmdarsjóndeildarhringur kaupir tíma og kostar ferskleika athugana.
  • Hvorugur þjónninn er öruggur á opinberri IP-tölu eins og hann er sendur, og lerobot's inniheldur óplástrað RCE. Götunnið hann.

Af hverju stefnan passar ekki á vélmennavélina

Tvær af fimm stefnum sem AY-Robots getur þjálfað keyra á vinnustöðvarkorti, þrjár gera það ekki. Dálkurinn hér að neðan er á hvern aðgerðarskref, og það er sú tala sem keppir við hringferð netkerfisins þíns.

StefnaFæribreyturÁlyktun á hvern aðgerðarskrefGPU flokkur fyrir þjálfunLágmarksþættirGagnasafnsnið
GR00T N1.7~3 B, ~40 M trained during fine-tuning152 msA100 80 GB or H100 80 GB50LeRobot v2.0 or v2.1
GR00T N1.5~3 B165 msA100 80 GB or H100 80 GB50LeRobot v2.0 or v2.1
Pi0.5~3 B, PaliGemma backbone485 msA100 80 GB or H100 80 GB50LeRobot v3.0
SmolVLA~450 M245 msRTX 4090 or any 24 GB card30LeRobot v3.0
ACT~80 M20 msRTX 4090 or any 24 GB card50LeRobot v3.0
The AY-Robots policies page comparing the five trainable policies by parameters, GPU tier, inference latency and minimum episodes
Sömu fimm raðir á /policies. Töfardálkurinn ræður því hvort stefna lifir af netstökk.

Lestu þetta sem ákvörðun, ekki smáatriði. við 20 ms á skref keyrir á vélmennavélinni og þú hugsar aldrei um það aftur. við 485 ms hefur eytt þriðjungi úr sekúndu áður en pakki fer úr byggingunni þinni. Samanburður á og bæta við nákvæmnishliðinni.

ACT hefur ekkert grunnlíkan

GR00T N1.7, GR00T N1.5 og Pi0.5 byrja frá söluaðila eftirlitsstað (nvidia/GR00T-N1.7-3B, nvidia/GR00T-N1.5-3B, lerobot/pi05_base). ACT er ekki til fyrr en þú þjálfar það á eigin verkefni, svo það er ekkert til að þjóna fjarstýrt fyrr en þjálfunarverk hefur verið keyrt. Sjá ACT on SO-100.

Tveir viðskiptavinur-þjónn staflar sem þegar eru til

Isaac-GR00T sendir ZeroMQ beiðni-svar þjón; lerobot sendir gRPC þjón byggðan á ósamstilltri ályktun. Báðir samþykkja GR00T eftirlitsstað. Stuðningsstefnulisti lerobot í async_inference/constants.py er act, smolvla, diffusion, tdmpc, vqbet, pi0, pi05 og groot; vélmennalisti þess er so100_follower, so101_follower, bi_so_follower og omx_follower.

Isaac-GR00T Stefnuþjónnlerobot ósamstillt ályktun
Aðgangsstaðurgr00t/eval/run_gr00t_server.pypython -m lerobot.async_inference.policy_server
FlutningurZeroMQ REQ/REPgRPC, add_insecure_port / insecure_channel
Raðgreiningmsgpack + msgpack_numpy, allow_pickle=False enforcedpickle.dumps / pickle.loads, marked # nosec
Sjálfgefin gátt55558080
Sjálfgefin binding0.0.0.0, öll tengilocalhost
Auðkenningapi_token studd af klasanum, ekki sendur af CLIenginn
Tímamörk viðskiptavinar15000 ms (PolicyClient timeout_ms)2 s biðraðar tímamörk fyrir athugun
Framkvæmdarlíkansamstillt: loka, síðan framkvæma hlutaósamstillt: framkvæma á meðan næsti hluti reiknar

Raðgreiningarröðin skiptir meira máli en hún virðist. GR00T's MsgSerializer neitar object-dtype ndarray gagnamagni í báðar áttir, því msgpack_numpy myndi annars afhenda þau til pickle. lerobot notar pickle í staðinn: policy_server.py kallar á pickle.loads á beiðnigögn, robot_client.py notar pickle á athugunina sem það sendir. Varnarhæft á traustu staðarneti, óvarnarhæft þegar hægt er að ná í gáttina frá internetinu.

Leið A: GR00T stefnuþjónn NVIDIA

Þetta er leiðin sem NVIDIA skjalfestir fyrir SO-100 og SO-101 vélbúnað, og sú sem á að nota ef gátpunkturinn þinn kom úr examples/finetune.sh með --embodiment-tag NEW_EMBODIMENT. Skrefin bæta við því sem README skjalið að ofan skilur eftir: að koma gáttinni til vélmennisins án þess að afhjúpa hana fyrir öllum öðrum.

  1. 1
    Setja upp GR00T á leigðu GPU tölvunni

    Undireiningar eru nauðsynlegar, og git-lfs verður að vera til staðar fyrir klónunina eða parquet skrárnar í demo_data koma sem vísar. flash-attn og TensorRT fylgja sjálfgefnu uppsetningunni. Gildran á nýrri pod-mynd: torchcodec 0.8.0 er eini studdi myndbandsbakendinn og hleður aðeins FFmpeg 4 til 7. Ubuntu 25.10 og 26.04 senda með FFmpeg 8, svo GR00T mistekst með Could not load libtorchcodec. Settu upp FFmpeg undir 8 og settu bókasöfn þess á LD_LIBRARY_PATH.

    bash
    sudo apt install git-lfs && git lfs install
    curl -LsSf https://astral.sh/uv/install.sh | sh
    sudo apt-get update && sudo apt-get install -y ffmpeg
    
    git clone --recurse-submodules https://github.com/NVIDIA/Isaac-GR00T
    cd Isaac-GR00T
    uv sync --python 3.12
    uv run python -c "import gr00t; print('GR00T installed successfully')"
  2. 2
    Auðkenna sig gegn gáttaða burðarásnum

    Hver GR00T N1.7 gátpunktur, þar á meðal þinn eigin fínstilling, hleður gáttaða nvidia/Cosmos-Reason2-2B við fyrstu notkun. Biddu um aðgang á líkanasíðunni og skráðu þig inn á pod-inn, annars mistekst hleðsla með GatedRepoError.

    bash
    uv run huggingface-cli login
    # or:  export HF_TOKEN=<your_token>
  3. 3
    Ræsa stefnuþjóninn

    Beindu --model-path á gátpunktamöppuna þína; á þeirri slóð hunsar þjónninn --modality-config-path, sem er aðeins lesin á endurspilunarslóðinni. Slepptu --model-path og sendu --dataset-path ásamt --execution-horizon í staðinn fyrir ReplayPolicy sem endurspilar skráðar aðgerðir, ódýrasta leiðin til að sanna að tengingin virki.

    bash
    uv run python gr00t/eval/run_gr00t_server.py \
      --model-path /workspace/so100_finetune/checkpoint-10000 \
      --embodiment-tag NEW_EMBODIMENT \
      --device cuda:0 \
      --host 127.0.0.1 --port 5555
  4. 4
    Tengja gátt 5555 við vélmennisvélina með göngum

    Binda við loopback, eins og hér að ofan, og flytja gáttina yfir SSH eða WireGuard-líkt net. Það veitir dulkóðun og auðkenningu sem ZeroMQ tengið gerir ekki, í um það bil eina millisekúndu.

    bash
    # on the robot machine
    ssh -N -L 5555:127.0.0.1:5555 root@<pod-host> -p <pod-ssh-port>
    
    # sanity check that something answers
    nc -vz 127.0.0.1 5555
  5. 5
    Keyra vélmennisbiðlarann við hliðina á servóunum

    Biðlarinn þarf sitt eigið uv umhverfi: hann vill vélmennisrekla lerobot, ekki þjálfunarstaflann. eval_so100.py flytur inn so100_follower, so101_follower og koch_follower, svo sendu --robot.type sem passar við handlegginn þinn (README skjalið að ofan notar so101_follower). Myndavélalyklar verða að passa við þjálfun: millistykkið les nákvæmlega front og wrist, og að skipta þeim sýnir stefnunni ranga sýn.

    bash
    cd gr00t/eval/real_robot/SO100
    uv sync
    uv pip install --no-deps -e ../../../../
    
    uv run --no-sync python eval_so100.py \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=orange_follower \
      --robot.cameras="{ front: {type: opencv, index_or_path: 6, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}" \
      --policy_host=127.0.0.1 \
      --policy_port=5555 \
      --lang_instruction="pick up the red block and put it in the bin"
Tvær sjálfgefnar stillingar sem munu valda vandræðum

run_gr00t_server.py notar sjálfgefið --host 0.0.0.0, sem bindur öll tengi: á pod með opinberri IP-tölu er það opinn ályktunarendapunktur. Og PolicyServer klasinn tekur við api_token og staðfestir það fyrir hverja beiðni, en run_gr00t_server.py sendir aldrei slíkt, svo CLI-þjónninn er óstaðfestur, sama hvað þú stillir. Binddu við 127.0.0.1 og notaðu göng. ZMQError: Address already in use þýðir að port 5555 er upptekið; sendu --port.

Leið B: lerobot ósamstillt ályktun

lerobot leysir annað vandamál. Í stað þess að stöðva vélmennið á meðan líkanið hugsar, heldur biðlarinn áfram að vinna í gegnum biðröðina sem hann hefur nú þegar á meðan þjónninn reiknar út næsta bita. Þetta er aðgerðabitar, tekið lengra, ósamstillta staflinn sem kynntur var með SmolVLA. Það virkar einnig með GR00T gátpunkti.

bash
# GPU machine
pip install -e ".[async]"
python -m lerobot.async_inference.policy_server \
     --host=127.0.0.1 \
     --port=8080

# robot machine, after tunnelling 8080
python -m lerobot.async_inference.robot_client \
    --server_address=127.0.0.1:8080 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM0 \
    --robot.id=follower_so100 \
    --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, wrist: {type: opencv, index_or_path: 1, width: 640, height: 480, fps: 30}}" \
    --task="pick up the red block and put it in the bin" \
    --policy_type=groot \
    --pretrained_name_or_path=<user>/my_groot_finetune \
    --policy_device=cuda \
    --actions_per_chunk=50 \
    --chunk_size_threshold=0.5 \
    --debug_visualize_queue_size=True
Stýringarþjónn á GPU, vélmennamiðlari á tölvunni með USB-tengjunum

Þjónninn byrjar tómur: hann veit ekki hvaða stefnu hann þjónar fyrr en fyrsta handaband viðskiptavinarins segir honum það, sem er þægilegt á leigðum hýsingareiningu. Tveir stillihnappar sem ráða því hvort armurinn hreyfist mjúklega eru actions_per_chunk og chunk_size_threshold (lerobot skjöl kalla þann seinni g, eftir SmolVLA greininni), og skjalfestu gildin og gildin sem fylgja með eru ekki sammála.

FæribreytaGildi í lerobot 0.6.1 kóðaHvað það gerirAthugasemd
actions_per_chunkengin sjálfgefin, krafistAðgerðir skilaðar á hvert kallSkjöl tafla listar 50; dataclass sviðið hefur ekkert sjálfgefið gildi, svo CLI krefst gildis
chunk_size_threshold0.5Hlutfall fyllingar biðraðar sem viðskiptavinur sendir nýja athugun við eða undirSkjöl tafla segir 0.7; kóðinn og dæmi skjalanna sjálfra segja 0.5
fps30Stýrihraði viðskiptavinar, stillir environment_dt = 1/fpsLækkaðu það ef biðröðin heldur áfram að tæmast
inference_latency1/30 s (33.3 ms)Markmið um ályktunartöf á þjóninumMarkmið, ekki mæling
obs_queue_timeout2 sHversu lengi þjónninn bíður eftir athugunarbiðröðinniHæg upphleðsla sést fyrst hér
aggregate_fn_nameweighted_averageHvernig skarast hlutasvæði eru blönduð0.3 gamalt + 0.7 nýtt; latest_only, average og conservative fylgja einnig með. Skrásetningin er AGGREGATE_FUNCTIONS í configs.py, ekki robot_client.py eins og skjöl segja
Stefnuþjónn lerobot hefur óplástrað RCE

CVE-2026-25874 er óauðkennd fjarkóðaútfærsla í ósamstilltri ályktunarpípu lerobot: pickle.loads() á gögnum sem berast yfir óauðkennda gRPC rás án TLS, aðgengileg í gegnum SendPolicyInstructions, SendObservations og GetActions köllin. CWE-502, CVSS 3.1 grunnstig 9.8 frá NVD, 4.0 grunnstig 9.3 frá úthlutandi CNA. Skráin listar LeRobot til og með 0.5.1 sem áhrifavald og nefnir bæði stefnuþjóninn og vélmennaviðskiptavininn, svo vélin við hliðina á arminum þínum er innan gildissviðs. Uppfærsla er ekki lausnin: skráin vísar í upprunavandamál 3047 og plásturinn, PR 3048, sem skiptir pickle út fyrir safetensors plús JSON, og þann 23. ágúst 2026 eru báðir enn opnir. policy_server.py á main kallar enn á pickle.loads á beiðnigögnum á meðan serve() bindur við add_insecure_port. Binddu við lykkju og aldrei áframsenda port 8080.

Reikningsaðgerðin sem ákveður hvort tengingin þín sé nógu hröð

Fólk sleppir þessu og eyðir svo degi í . Þetta tekur tvær mínútur og er næstum alltaf afgerandi.

Athugasemda athugunardict í NVIDIA's eval_so100.py segir hvað fer um línuna: tvö fylki af stærð (480, 640, 3) í uint8, sex liðflotar, tungumálsstrengur. Það eru 921.600 bæti á ramma, 1.843.200 bæti fyrir tvær myndavélar, um 14,7 Mbit, og hvorugur staflinn JPEG-þjappar því. Búturinn sem kemur til baka er nokkrir tugir skrefa af 6 flotum. Upphleðslan þín ræður öllu, ekki niðurhalið þitt.

UpphleðslubandbreiddTími til að senda eina athugun (14.7 Mbit)Niðurstaða fyrir 30 FPS arm
10 Mbit/s, dæmigerð upphleðsla heima~1.47 sÓnotanlegt. Armurinn stoppar á milli hvers búts.
25 Mbit/s~0.59 sAðeins hæg upptaka og staðsetning, með langan framkvæmdarsjóndeildarhring.
50 Mbit/s~0.29 sHægt að vinna með fyrir yfirvegaðar verkefni.
100 Mbit/s~0.15 sÍ lagi fyrir upptöku og staðsetningu, sýnilegt við hraðar hreyfingar.
1 Gbit/s ljósleiðari eða gagnaver~0.015 sLíkanið verður flöskuhálsinn í staðinn.

Fjárhagsáætlunin sem þú þarft að passa inn í

GR00T SO-100 biðlarinn er samstilltur: hann kallar á policy.get_action(obs), framkvæmir fyrstu action_horizon skrefin af bútnum á 30 FPS, og kallar svo aftur. Bútastærð og sjóndeildarhringur eru ólíkar tölur: dreifingarleiðbeiningar NVIDIA mæla með aðgerðabútastærð upp á 16, að minnsta kosti 32 þegar það er sameinað rauntíma bútun, á meðan eval_so100.py sendir frá sér framkvæmdarsjóndeildarhring upp á 8. Átta skref á 30 FPS eru 267 ms af hreyfingu á hvert kall, og allt annað þarf að passa inn í það.

text
observation upload   14.7 Mbit / 100 Mbit/s   = 147 ms
network round trip                            =  30 ms
model inference (AY-Robots figure, N1.7)      = 152 ms
action chunk return + deserialize             =  ~2 ms
                                                -------
total per call                                  331 ms

budget at action_horizon = 8   ->  267 ms   FAIL, arm pauses ~64 ms per chunk
budget at action_horizon = 16  ->  533 ms   fits, with headroom
budget at action_horizon = 32  -> 1067 ms   fits, observations now ~1 s stale
Dæmi: 100 Mbit/s upphleðsla, 30 ms hringferð, GR00T N1.7

Að hækka sjóndeildarhringinn er gróf lausn og ekki ókeypis: armurinn bregst við athugun sem er nú gömul. Meginreglulega lausnin er rauntíma bútun, sem reiknar út næsta bút á meðan sá núverandi keyrir, frystir aðgerðir sem tryggt er að framkvæmist og fyllir inn í restina; RTC skýrslan segir þetta vera öflugt gegn ályktunartöfum án endurþjálfunar. Athugaðu fyrst hvar það stendur. NVIDIA merkir RTC sem tilraunakennt, lággæða líkan frumstætt sem hægt er að ná í gegnum action_head.get_action(..., options={"rtc_overlap_steps": ..., "rtc_frozen_steps": ...}), ekki tengt inn í Gr00tPolicy eða netþjóns-biðlara leiðina, þar sem options er ónotað, án prófana og án dæmis. Yfir stefnuþjóni færðu ósamstillta framkvæmd, ekki RTC.

Hvað líkanið kostar áður en netið gerir það

NVIDIA mælir GR00T N1.7 frá enda til enda í 4 afhávaðaskrefum með einni myndavél. Á H100 80GB HBM3: 85.8 ms (11.7 Hz) í PyTorch eager, 48.6 ms (20.6 Hz) með torch.compile, 27.9 ms (35.9 Hz) með TensorRT fullri pípu. L40 í eager ham tekur 128.3 ms (7.8 Hz). NVIDIA kallar 10 Hz ráðlagðan lágmarkshraða fyrir dæmigerða meðhöndlun, og undir 10 Hz hentar aðeins fyrir hægar, óvirkar aðgerðir. Þetta eru enduráætlunarhraðar: 10 Hz stefna getur samt keyrt 30 FPS arm í gegnum aðgerðabútun. Önnur myndavél færir þig í ranga átt.

Mældu það áður en þú treystir því

Hver tala hér að ofan er spá. Fjórar skipanir breyta henni í mælingu, sem er þess virði að keyra áður en þú skuldbindur pod-klukkustund í verkefni sem aldrei hefði virkað.

  1. 1
    Fáðu hráa hringferðartímann

    Gegn podinu, ekki CDN. Fylgstu jafn vel með frávikinu og meðaltalinu: sveiflur valda því að armur hikstar, ekki meðaltalsleynd.

    bash
    ping -c 50 <pod-host>
    # the mdev column is the number that predicts stutter
  2. 2
    Mældu upphleðsluna sem þú hefur, ekki þá sem þú borgar fyrir

    Upphleðsla í íbúðarhúsnæði er venjulega brot af niðurhali, og það er talan í bandbreiddartöflunni hér að ofan.

    bash
    # on the pod
    iperf3 -s
    
    # on the robot machine, -R omitted so this measures upload
    iperf3 -c <pod-host> -t 30
  3. 3
    Lestu leyndarskráningu biðlarans sjálfs

    LeRobot vélmennamiðlarinn skráir leyndartíma frá miðlara til biðlara og afraðgreiningartíma fyrir hvern bita. Á leið B þarftu engin utanaðkomandi verkfæri.

    text
    Received action chunk for step #240 | Latest action: #232 |
      Incoming actions: 240:289 |
      Network latency (server->client): 187.44ms |
      Deserialization time: 3.10ms
  4. 4
    Fylgstu með því að aðgerðarbiðröðin tæmist

    Sendu --debug_visualize_queue_size=True og biðlarinn teiknar stærð biðraðarinnar á keyrslutíma. Ef hún fer ítrekað í núll ertu kominn yfir fjárhagsáætlun: lækkaðu fps, hækkaðu actions_per_chunk, eða hækkaðu chunk_size_threshold svo athuganir fari oftar út.

    bash
    python -m lerobot.async_inference.robot_client \
        ... \
        --debug_visualize_queue_size=True

Til hvers er fjarlæg ályktun í raun og veru góð

Stýring á leigðu GPU, armur á skrifborðinu þínu
Kostir
  • Þú getur metið 3 B færibreytu stýringu á raunverulegum vélbúnaði án þess að eiga kort sem kostar meira en armurinn.
  • GPU er leigt á klukkustund, svo misheppnaður geymslupunktur kostar nokkra dollara.
  • Vélmennishliðin helst lítil: lerobot drifbúnaður, tvær myndavélar, raðtengi, og þú skiptir um geymslupunkta án þess að snerta hana.
Málamiðlanir
  • Óþjappaðar athuganir ráða ríkjum í gagnaflutningskostnaði, og upphleðsluhraði heimilisneta er takmarkandi þátturinn.
  • Tímaskekkja (jitter) skaðar meira en leynd (latency): tenging sem er að meðaltali 40 ms með toppa upp í 300 ms hikstar þar sem stöðug 120 ms tenging gerir það ekki.
  • Hröð viðbragðsverkefni lifa ekki af hringferðina á neinum tíma.
  • Báðir netþjónar eru sendir óauðkenndir í CLI formi, svo jarðgönguvinnan er þín.
  • Rofin tenging í miðri sendingu skilur handlegginn eftir með úrelta aðgerð. Bættu við eigin varðhund á vélmennishliðinni.
VerkefniVirkar yfir almenningsnetið?Af hverju
Velja kyrrstæðan hlut, setja hann í körfuEkkert hreyfist milli athugunar og aðgerðar.
Stafla kubbum á hægum hraðaJá, við action_horizon 16 eða meiraVillur safnast upp nógu hægt til að laga í næstu sendingu.
Opna skúffu, setja inn hlutVenjulegaSnertiríkt en hægt. Fylgstu með stöðvun og ræsingu við snertingu.
Fylgja hreyfanlegum hlutNeiStýringin byggir á athugun sem er 300 ms til 1 s gömul.
Grípa, halda jafnvægi, eða ná sér eftir að hafa runniðNeiLeiðréttingarglugginn er styttri en ein hringferð.
30 Hz samstillt lokað lykkjaNeiFjárhagsáætlunin er 33 ms frá enda til enda. Jafnvel staðarnet á í erfiðleikum.

Ef fjarlæg keyrsla hikstar á sama punkti í hverjum þætti, er netið líklega ekki orsökin. Stýring sem hikstar á sama liðhorni í hvert skipti er venjulega gagnamál; sjá síður um bilunarham, sérstaklega stýring sem virkar aðeins í einni uppsetningu og tap minnkar en stýringin gerir ekkert.

Að gera það sjálfur á móti því að gera það á AY-Robots

  1. Leigðu GPU á sprotamarkaði og bíddu eftir nægu VRAM á verði sem þér líkar.
  2. Settu upp CUDA, uv, ffmpeg torchcodec sem styður, og GR00T staflann með undireiningum.
  3. Óskaðu eftir aðgangi að lokaða `nvidia/Cosmos-Reason2-2B` burðarásnum og settu auðkenni á podinn.
  4. Sæktu eftirlitsstöðina þína á podinn.
  5. Ræstu netþjóninn á lykkju, byggðu síðan SSH göng frá vélmennavélinni.
  6. Settu upp annað umhverfi á vélmennavélinni fyrir biðlara og rekla.
  7. Samsvaraðu myndavélalyklum, liðnöfnum og tungumálaleiðbeiningum við það sem eftirlitsstöðin sá.
  8. Fylgstu með podinum. Gleymd A100 sem keyrir yfir nótt kostar meira en tilraunin.
Óvirki podinn er raunverulegur kostnaður

GPU reikningurinn hættir ekki þegar vélmennið stoppar. Mest af peningum sem tapast á fjarlægri ályktun fer í netþjón sem var í gangi eftir að allir fóru. Stilltu vekjaraklukku, eða sjálfvirknivæddu niðurrif.

AY-Robots MCP netþjónssíðan sem sýnir vettvangsaðgerðir sem verkfæri fyrir gervigreindarmiðlara
MCP síðan: úthlutunar- og ályktunaraðgerðir sýndar sem verkfæri sem miðlari getur kallað á.

Hvað fjarlæg ályktunarlota kostar

Tvær tölur skipta máli: tímagjald kortsins, og hversu lengi þú lætur það keyra. Sú fyrri er birt; sú síðari kemur fólki á óvart.

KortRunpod samfélagsskýRunpod öruggt skýHentugt fyrir
A100 PCIe 80 GB1.19 USD/h1.39 USD/hGR00T N1.7, GR00T N1.5, Pi0.5
A100 SXM 80 GB1.39 USD/h1.59 USD/hSama, aðeins hraðari
H100 PCIe 80 GB1.99 USD/h2.89 USD/hHraðasta flokkun; 11,7 Hz eager tala NVIDIA er fyrir H100 80GB HBM3
L40S 48 GB0.79 USD/h0.99 USD/hAðeins ályktun, yfir 16 GB lágmarkinu
RTX 4090 24 GB0.34 USD/h0.74 USD/hSmolVLA, ACT

Þessir taxtar voru lesnir af verðsíðu Runpod þann 23. ágúst 2026, og markaðir breytast. AY-Robots gefur upp heildar keyrslu í staðinn: 3 til 6 klukkustundir á 1,20 til 2,00 USD á klukkustund á A100 eða H100 flokknum, um 4 til 12 USD fyrir GR00T eða Pi0.5 keyrslu; 2 til 5 klukkustundir á 0,30 til 0,60 USD á klukkustund á 24 GB flokknum, 1 til 3 USD fyrir SmolVLA eða ACT. Ályktunarlota er ódýrari en þjálfunar keyrsla aðeins ef þú stöðvar hana, sem er það sem aðgerðalaus vaktari er fyrir. Sjáðu reikningsskjöl og verðsíðu.

Kostnaðartafla AY-Robots sem sýnir hvaða GPU hver stefna þarf, dæmigerðan keyrslutíma og verð, og lotur áður en stefna er nothæf
Kostnaðartaflan á /try: hvaða kort hvert líkan þarf og hvað keyrsla kostar venjulega.

Ef þú vilt frekar ekki hafa netið í lykkjunni

Fjarályktun leysir vélbúnaðarvandamál og skapar biðtímavandamál. Stundum er betra svarið stefna sem passar við vélbúnaðinn sem þú hefur.

  • ACT, um það bil 80 M færibreytur og 20 ms á aðgerðarskref, 50 þættir að lágmarki, hvaða 24 GB kort sem er. Í endurtekinni uppsetningu fyrir eitt verkefni slær það oft fjarstýrt 3 B líkan, vegna þess að það bíður aldrei eftir pakka.
  • SmolVLA, um það bil 450 M færibreytur og 245 ms á aðgerðarskref, 30 þættir að lágmarki. Það heldur tungumálaskilyrðingunni sem ACT skortir, og lerobot skjöl setja það í um 2 GB við ályktunartíma á móti um 14 GB fyrir PI0.
  • ACT vs GR00T N1.7 fyrir nákvæmnishlutann af málamiðluninni.

Það er líka millileið: þjálfa í skýinu, meta staðbundið. Fínstilling þarf 80 GB kortið og er sama um biðtíma, svo að þjálfa GR00T N1.7 á SO-100 fjarstýrt er óumdeilt. Aðeins matslúkkan hefur rauntímakröfu; þjálfunarskjölin og líkan- og armamatrísa fjalla um þann hluta.

Enginn armur á borðinu ennþá?

Keyrðu raunverulegan SO-100 í vafranum án skráningar, berðu saman fimm þjálfanlegar stefnur með raunverulegum biðtímatölum þeirra, eða leigðu GPU og þjálfaðu eina. Þrjár leiðir til að byrja, engin þarf vélbúnað sem þú átt ekki.

Prófaðu það án vélbúnaðar

Algengar spurningar

Get ég keyrt GR00T N1.7 á Raspberry Pi ef GPU er fjarstýrt?

Já, það er tilgangurinn með skiptingu í biðlara og þjón. Pi keyrir lerobot drifbúnaðinn, les úr tveimur myndavélum og raðtengi, og sendir athuganir til stefnuþjónsins; hann hleður aldrei inn líkaninu. Takmörkunin færist frá VRAM yfir í upphleðsluhraða: tveir óþjappaðir 640x480 RGB rammar eru 1.843.200 bæti í hverju kalli, og hvorugur staflinn þjappar þeim.

Hversu mikla leynd bætir netið raunverulega við?

Ferðatími fram og til baka auk flutningstíma athugana. Flutningstími er 14,7 Mbit deilt með upphleðsluhraða þínum: um það bil 147 ms á 100 Mbit/s tengingu, 1,47 s á 10 Mbit/s tengingu. Báðir bætast ofan á eigin ályktunartíma líkansins, sem AY-Robots skráir sem 152 ms fyrir GR00T N1.7 og 485 ms fyrir Pi0.5. Mældu með ping og iperf3 gegn hýsingareiningunni, ekki hraðaprófunarþjóni.

Er fjárályktun nógu góð fyrir raunverulegt verkefni?

Fyrir hæga, yfirvegaða val-og-setja aðgerð, já. Fyrir allt sem er viðbragðsgott, nei. Dreifingarleiðbeiningar NVIDIA setja kröfuna um samstillt einstakt skref á um það bil 33 ms frá enda til enda við 30 FPS, og tekur fram að myndataka, net, ályktun og eftirvinnsla fara reglulega fram úr því án þess að internet sé tengt.

Hvaða tengi nota þjónarnir og er óhætt að opna það?

PolicyServer Isaac-GR00T notar sjálfgefið tengi 5555 yfir ZeroMQ og bindur 0.0.0.0 í CLI sínu. lerobot notar sjálfgefið tengi 8080 yfir gRPC og bindur localhost. Hvorugt er öruggt að afhjúpa: GR00T klasinn styður api_token en run_gr00t_server.py sendir aldrei slíkt, og lerobot geymir gögn yfir óörugga gRPC rás, sem er CVE-2026-25874. Binddu við lykkju og notaðu SSH göng.

Lagfærir uppfærsla á lerobot CVE-2026-25874?

Ekki frá og með 23. ágúst 2026. CVE skráin listar LeRobot upp að 0.5.1 sem áhrifavald og PyPI sendir 0.6.1, en beiðnin um að fjarlægja pickle úr ósamstilltu ferlinu er enn opin, og policy_server.py á aðalgreininni kallar enn á pickle.loads á beiðnigögnum. Líttu á neteinangrun sem lausn, ekki útgáfuuppfærslu, og gerðu ráð fyrir að biðlari vélmennisins sé einnig innan gildissviðs.

Get ég notað ósamstilltan biðlara lerobot með GR00T geymslupunkti?

Já. lerobot 0.6.1 listar groot í SUPPORTED_POLICIES ásamt act, smolvla, diffusion, tdmpc, vqbet, pi0 og pi05, og bæði so100_follower og so101_follower eru í SUPPORTED_ROBOTS. Sendu --policy_type=groot og beindu --pretrained_name_or_path á geymslupunktinn þinn. Þú færð ósamstillta framkvæmd, sem GR00T SO-100 dæmið innleiðir ekki, á kostnað pickle flutningsins.

Stutta útgáfan

Fjárályktun fyrir 3 B stefnu er leyst verkfræðilegt vandamál með óleyst eðlisfræðilegt vandamál tengt. Verkfræðin er tvær skipanir og SSH göng. Eðlisfræðin er sú að 1,8 MB athugun þarf að ná til GPU í öðru landi og koma til baka áður en armurinn klárast af aðgerðum. Gerðu útreikningana áður en þú leigir eitthvað, veldu verkefni sem þolir úrelta athugun og hækkaðu framkvæmdarsviðið frekar en að vona að tengingin batni.

Ef þú hefur ekki tekið upp gagnasafn ennþá, taktu upp fyrsta gagnasafnið þitt og uppsetningarleiðbeiningar SO-100 koma fyrst, og LeRobot gagnasafnssniðið færsla útskýrir hvað upptökutækið skrifar. Bakgrunnur er í sjón-tungumál-aðgerðarlíkönum og vinnu með flæðisjöfnunarstefnur; arena færslan tengir hvert viðmiðunarnúmer við uppruna.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started