Jedwali la gharama la AY-Robots likionyesha GPU ambayo kila moja ya sera tano inahitaji, muda wa kawaida wa uendeshaji na bei kwa kila uendeshaji, na ni vipindi vingapi vinahitajika kabla ya sera kuwa muhimu
Mafunzo ya VLAGharama za GPUSO-100urekebishajiujifunzaji wa robotibajeti

Gharama ya Mafunzo ya VLA: Uendeshaji wa Kurekebisha Kweli Unagharimu Kiasi Gani

AY-Robots ResearchAugust 23, 202623 min kusoma

Bei halisi za GPU sokoni, muda ambao kila moja ya sera tano huendeshwa, gharama ya mkono na maonyesho, na sehemu nne ambapo pesa hupotea kimya kimya.

Muhtasari mfupi

  • Kukimbia kwenye kiwango cha A100 80 GB au H100 huchukua saa 3 hadi 6 na gharama yake ni takriban dola 4 hadi 12 za Kimarekani. Kwenye kiwango cha RTX 4090 ni saa 2 hadi 5 na takriban dola 1 hadi 3 za Kimarekani.
  • Imepimwa kwenye vast.ai saa 13:44 UTC mnamo Agosti 23, 2026: RTX 4090 kamili inapohitajika kwa 0.13 hadi 0.38 USD/h, A100 80 GB kwa 0.44 hadi 0.67, H100 80 GB kwa 1.34 hadi 2.34. Kadi kamili za 80 GB ni chache, ofa mbili na tano za kadi moja mtawalia.
  • GPU ndio mstari wa bei nafuu zaidi. Orodha ya vifaa vya SO-ARM100 inaweka jozi ya kiongozi na mfuasi kwa 229.88 USD, ambayo ni mikimbio 77 hadi 230 kwenye kiwango cha 24 GB.
  • Saa mbili za mtu kurekodi vipindi 50 hugharimu zaidi ya mchakato wa mafunzo unaolishwa na vipindi hivyo.
  • Pesa hupotea katika maeneo manne: mikimbio kwenye data iliyoharibika, mifumo ya 3B kwenye kazi zinazoshughulikiwa na sera ya 80M, GPU ambazo hakuna aliyeharibu, na kurudia matokeo uliyoshindwa kuhifadhi.
  • AY-Robots hupima kadi kulingana na VRAM inayohitajika na modeli na huikodisha kwenye soko hilo hilo la papo hapo, hivyo gharama ya uendeshaji ni gharama ya soko.

Bili ina mistari minne, na GPU ndio mdogo zaidi

Watu wanapouliza inagharimu kiasi gani kurekebisha modeli ya lugha-maono-vitendo kwa SO-100, karibu kila mara wanamaanisha kukodisha GPU. Hiyo ndiyo namba inayoonekana kama malipo kwenye kadi, kwa hivyo ndiyo inayohisi halisi. Pia, kwa tofauti kubwa, ndiyo ndogo zaidi kati ya namba nne zinazoamua ni kiasi gani sera inayofanya kazi inakugharimu.

MstariNi niniUkubwa wa kawaida kwa sera moja inayofanya kazi
Muda wa GPUkukodisha kadi kwa ajili ya uendeshajiDola 1 hadi 12 za Kimarekani kwa kila uendeshaji, na utafanya 3 hadi 5
Robotiservos, fremu iliyochapishwa, kamera, nyaya, nguvumara moja, Euro 110 hadi 500 kwa mkono
Saa za binadamumtu anayeendesha mkono kurekodi maonyeshoSaa 1 hadi 4 kwa kila seti ya data, hurudiwa kwa kila kazi
Upotevudata mbaya, mifumo mikubwa kupita kiasi, pods zilizosahaulikahaina kikomo, na ndio mstari pekee unaoudhibiti

Nyakati za mafunzo hapa chini zinatokana na karatasi na hifadhi za miundo mitano yenyewe, gharama ya maunzi kutoka kwenye orodha ya vifaa iliyochapishwa, namba za jukwaa kutoka AY-Robots orodha ya sera na ukurasa wa bei. Pale ambapo jukwaa halisaidii, makala haya yanasema hivyo.

Gharama halisi ya saa ya GPU kwenye soko la papo hapo

Hakuna bei moja ya saa ya A100. Kwenye soko kama vast.ai kila mwenyeji huweka kiwango chake, na mchakato wa mafunzo unaozindua hutua kwenye mashine yoyote iliyo nafuu na huru kwa wakati huo. Jibu la uaminifu ni usambazaji. Hapa ndio, iliyopimwa Agosti 23, 2026 saa 13:44 UTC: kadi kamili moja, kwa mahitaji, iliyochujwa na VRAM halisi.

Kadivast.ai kwa mahitaji USD/h (chini / wastani / juu)Ofa za Kadi KamiliBei ya chini ya zabuni vast.aiRunPod Jumuiya / SalamaHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74not offered
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99not offered
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19not offered
Jinsi picha hii ilivyochukuliwa, na isivyo

Matoleo ya mahitaji maalum kwa GPU moja kamili (gpu_frac == 1.0) kutoka API ya umma ya vast.ai, ambayo haihitaji akaunti, yaliyochujwa kwa gpu_ram ili kadi halisi za 80 GB tu ziingie kwenye safu za 80 GB. Kichujio hicho ni muhimu: katika usomaji huu, matoleo yote matatu ya kadi moja ya A100 SXM4 yalikuwa sehemu za 40 GB, kama vile matoleo mawili kati ya manne ya A100 PCIE, kwa hivyo kuziunganisha kwenye safu moja ya "A100" kungepunguza bei iliyoripotiwa hapa kwa nusu. Safu ya Hugging Face inachanganya bidhaa mbili: 2.50 USD/h ni maunzi ya Nvidia A100 - kubwa ya Spaces na 4.50 USD/h ni H100 80 GB moja chini ya Inference Endpoints, ambayo Spaces haitoi. Chukulia wastani kama viashiria: safu ya A100 80 GB inategemea matoleo mawili na safu ya H100 inategemea matano, na swali lile lile sekunde 36 baadaye lilirejesha hesabu tofauti ya 4090 na bei tofauti ya juu kwenye safu tatu kati ya tano. Bei za orodha za RunPod ndio nambari thabiti zaidi ya kupanga dhidi yake.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Hoja kamili iliyo nyuma ya jedwali hapo juu, iliyoendeshwa mara mbili wakati wa kuandika sehemu hii. Iendeshe kabla ya kuamini makala yoyote ya bei ya GPU, ikiwemo hii.
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
Jedwali la gharama kwenye /try: kadi, muda wa kuendesha, bei kwa kila uendeshaji na idadi ya chini ya vipindi kwa kila sera.

Kwa nini mifumo ya 3B haiwezi kutumia kadi ya bei nafuu

Saa ya 4090 na saa ya H100 80 GB hutofautiana kwa takriban mara sita kwenye wastani ulio hapo juu. Kinachokulazimisha kutumia kadi ghali si kasi, bali ni kumbukumbu. openpi inaweka kiwango cha chini kwa Pi0.5 kamili urekebishaji-laini kwa 70 GB, na NVIDIA inapendekeza 40 GB au zaidi kwa GR00T. Kumbuka nambari ya GR00T si nini. Usanidi wake wa urekebishaji-laini hugandisha modeli ya lugha na kirekebisha-taswira kwa chaguo-msingi (tune_llm na tune_visual ni False, projekta na kichwa cha usambazaji ni True), ndiyo maana katalogi inaorodhesha takriban vigezo 40 M vilivyofunzwa kati ya 3 B. 40 GB si hali ya kiboreshaji kwa uzito wa 3 B, bali ni uti wa mgongo uliogandishwa pamoja na uanzishaji. Toleo zenye wigo uliopunguzwa hushuka chini: njia ya LoRA ya openpi inahitaji 22.5 GB na inataja 4090, na mtiririko wa kazi wa Isaac Lab Arena wa NVIDIA unaorodhesha chaguo la 24 GB la GPU moja kwa mafunzo ya baada ya GR00T. Jukwaa linaweka viwango kulingana na kiwango cha chini ambacho kila muuzaji huchapisha kwa usanidi unaoendeshwa. Maelezo ya pi0 flow-matching inaeleza ni wapi upatanishi wa mtiririko nyayo hiyo inatoka.

KaziKumbukumbu inayohitajika na mradi wa asiliChanzo
pi0 / pi0.5 inferencezaidi ya 8 GB, mfano RTX 4090openpi
pi0 / pi0.5 LoRA urekebishaji-lainizaidi ya 22.5 GB, mfano RTX 4090openpi
pi0 / pi0.5 urekebishaji-laini kamilizaidi ya 70 GB, mfano A100 80 GB au H100openpi
GR00T N1.7 inference1 GPU yenye 16 GB au zaidiIsaac-GR00T
GR00T N1.7 urekebishaji-laini40 GB au zaidi inapendekezwa, nodi za H100 au L40Isaac-GR00T
GR00T urekebishaji-laini, inachofunzaprojekta na kichwa cha usambazaji; LLM na kirekebisha-taswira vimegandishwa kwa chaguo-msingifinetune_config.py
GR00T mafunzo ya baada, yaliyopunguzwa1 GPU yenye 24 GB, modeli ya lugha imegandishwaIsaac Lab Arena
SmolVLA urekebishaji-lainiA100 moja kwa ajili ya marejeleo ya hatua 20,000lerobot docs
ACT mafunzoRTX 2080 Ti moja ya 11 GBACT paper

Jedwali hilo ndilo sababu jukwaa linagawanya modeli tano katika viwango viwili. GR00T N1.7, GR00T N1.5 na Pi0.5 huendeshwa kwenye A100 80 GB au H100 kwa sababu ndicho wanachohitaji wauzaji. SmolVLA na ACT huendeshwa kwenye RTX 4090 au kadi yoyote ya 24 GB kwa sababu hiyo inatosha kabisa.

Mtego unaokula siku: kukodisha kadi ya bei nafuu kwa modeli kubwa

Uendeshaji wa GR00T au Pi0.5 kwenye kadi ya 24 GB haushindwi mara moja. Inapakua kituo cha ukaguzi cha msingi, inajenga faharisi ya seti ya data, inaanza pasi ya kwanza ya mbele na inakufa baada ya hatua chache tu kwa hitilafu ya CUDA out-of-memory. Umelipia upakuaji na usanidi na hukupata chochote. Marekebisho: kumbukumbu kujaa wakati wa mafunzo.

Muda halisi wa uendeshaji wa kila moja ya mifumo mitano

Muda wa uendeshaji ni nusu nyingine ya gharama: 2.00 USD kwa saa hauna maana ikiwa kazi ni dakika 40 na ni mbaya ikiwa ni saa 40. Hizi ndizo mipangilio chaguomsingi AY-Robots hutuma kwa mkufunzi, pamoja na dirisha la uendeshaji na gharama kwa kila ngazi.

SeraNgazi ya GPUHatua Chaguomsingi za JuuKundi Chaguomsingi (mkusanyiko wa grad)Dirisha la UendeshajiGharama kwa Kila Uendeshaji
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Jedwali la kulinganisha la sera tano zinazoweza kufunzwa kwenye AY-Robots likionyesha idadi ya vigezo, GPU inayohitajika, muda wa kusubiri wa inference na idadi ya chini kabisa ya vipindi
Sera tano zikiwa sambamba: vigezo, ngazi ya GPU, muda wa kusubiri kwa kila hatua ya kitendo, vipindi vya chini kabisa.

Vyanzo vya makadirio hayo ya muda wa utekelezaji kutoka juu

  • SmolVLA: nyaraka za lerobot zinasema kuwa hatua 20,000 huchukua takriban saa 4 kwenye A100 moja. Jukwaa huendesha hatua hizo 20,000 kwenye kiwango cha bei nafuu cha 24 GB, hivyo basi kuna dirisha la muda badala ya saa 4 kamili.
  • ACT: karatasi asili ya ALOHA inaripoti takriban saa 5 kwenye RTX 2080 Ti moja ya 11 GB kwa modeli yenye vigezo milioni 80. Kadi ya 4090 ni ya vizazi kadhaa vipya zaidi lakini jukwaa linatenga bajeti ya hatua 100,000, kwa hivyo dirisha la muda linaangukia mahali pale pale.
  • GR00T: Mfumo wa kazi wa marejeleo wa NVIDIA kwa kizazi cha N1.6 unataja takriban saa 4 hadi 8 kwa hatua 20,000 kwa batch 24 kwenye kadi nane za L40S, na saa 2 hadi 3 kwa hatua 30,000 kwa batch 16 kwenye Ada 6000 moja. Kufanya 'fine-tuning' ya VLA ya 3B kwa kutumia kadi moja ndani ya saa chache ni jambo la kawaida, si matumaini makubwa.
  • Pi0.5: openpi haichapishi takwimu za muda halisi, lakini inachapisha kiwango cha chini cha 70 GB kwa 'fine-tune' kamili, jambo linalobainisha kadi na hivyo basi kasi.

Inafaa kusitisha kidogo kwenye namba ambayo hulipi. Karatasi ya GR00T N1 inaripoti takriban saa 50,000 za H100 GPU kwa ajili ya kutoa mafunzo ya awali kwa modeli ya 2.2B, kwenye kundi la hadi GPU 1024, kwa ukubwa wa batch ya mafunzo ya awali ya 16,384 kwa hatua 200,000 za gradient. Kwa USD 1.34 hadi 2.34 kwa saa iliyopimwa hapo juu, hiyo ni takriban USD 67,000 hadi 117,000 za kompyuta iliyokodishwa. Karatasi ya SmolVLA inaweka mradi wake kwa takriban saa 30,000 za GPU kwenye seti data 481 za jamii, vipindi 22.9K na fremu 10.6M. Unarithi yote kwa bei ya kupakua; USD 8 zako zinanunua hatua 20,000 za mwisho. Kwa nini VLAs hujengwa kwa njia hii inafafanua mgawanyiko huo.

Mkono: gharama ya mara moja inayofunika bili ya GPU

Mafunzo hugharimu chini ya chakula cha mchana. Roboti haigharimu hivyo. Ndiyo maana SO-100 ni muhimu: ni mkono wa bei nafuu zaidi ambao mfumo mzima wa zana wa ujifunzaji wa kuiga unasaidia.

MkonoServosVoltiGharama ya sehemuUsaidizi kwenye AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURmkono kamili, wa rejea
SO-101Feetech STS32157.4 V130 to 170 EURkamili
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURinayooana
LeKiwiMkono wa Feetech STS3215, msingi wenye magurudumuMkono wa 7.4 V, msingi wa 12 V400 to 500 EURinayooana

Orodha ya vifaa vya juu katika hazina ya SO-ARM100 ni ya kina zaidi na inafaa kuangaliwa kulingana na eneo lako: orodha yake ya Sehemu za Mikono Miwili inafikia jumla ya 229.88 USD au 226.30 EUR kwa usanidi wa kiongozi na mfuasi, na orodha yake ya Sehemu za Mkono Mmoja wa Mfuasi inafikia jumla ya 121.94 USD au 124.30 EUR. Servos sita za STS3215 kwa 13.89 USD kila moja ni 83.34 ya 121.94 hiyo, kwa hivyo servos ndio mkono. Kwa 1 hadi 3 USD kwa kila SmolVLA au ACT run, jozi moja ya mikono ina thamani ya kati ya mafunzo 77 na 230. Ikiwa bado unachagua, SO-100 dhidi ya SO-101 ndio ulinganisho muhimu, sababu hizo mbili ziko karibu kiasi kwamba uamuzi unahusu upatikanaji badala ya uwezo.

7.4 V, si 12 V

STS3215 inapatikana katika toleo la 7.4 V na 12 V; hazina inabainisha kuwa sehemu ya 12 V pia inahitaji usambazaji wa 12 V 5 A badala ya ule wa 5 V, kwa hivyo hizo mbili haziwezi kubadilishana. Kuweka 12 V kwenye servos za 7.4 V huziharibu, na servos sita ni theluthi mbili ya gharama ya sehemu za mkono wa mfuasi. Angalia lebo kwenye kila servo kabla ya kuwasha kwa mara ya kwanza. Ikiwa servos tayari zinafanya kazi isivyo kawaida: servo haijibu, mkono unatetemeka kisha unalegea.

Saa za binadamu: mstari ambao hakuna anayeweka kwenye lahajedwali

Huu ndio namba inayogeuzia mjadala wa gharama kichwa chini. Kurekodi maonyesho ni mtu kusogeza mkono wa roboti, kipindi kimoja kwa wakati mmoja, kwa wakati halisi. Hakuna kuikusanya kwa wingi wala kuikodisha kwa sekunde. Kinasa cha seti ya data ya LeRobot kinakuja na mipangilio chaguomsingi inayofanya hesabu kuwa rahisi, zote tatu zimethibitishwa katika DatasetRecordConfig: sekunde 60 kwa kila kipindi, sekunde 60 kuweka upya eneo, vipindi 50. Safu wima ya pesa hapa chini inachukulia Dola 15 kwa saa moja ya muda wa mtu, ambayo ni dhana badala ya namba ya jukwaa. Badilisha kiwango chako mwenyewe; uwiano ndio muhimu.

  1. 1
    Rekodi seti ya data kwa mipangilio chaguomsingi utakayotozwa gharama halisi

    Huu ni lerobot 0.6.1, toleo lililopo kwenye PyPI kufikia Agosti 3, 2026. Kumbuka umbo la CLI: kurekodi hupitia sehemu ya kuingilia ya koni ya lerobot-record (lerobot.scripts.lerobot_record), si njia ya moduli ya zamani ya python -m lerobot.scripts.record. AY-Robots inalenga 0.5.1, na gurudumu la 0.5.1 linatangaza sehemu zile zile za kuingilia za lerobot-record na lerobot-train, kwa hivyo umbo hapa chini ni thabiti kwa zote mbili. Bendera tatu za muda ni mipangilio chaguomsingi ya juu, kwa hivyo hii pia ndio amri ambayo hesabu katika jedwali linalofuata inachukulia.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Angalia ulichorekodi kabla ya kukodisha hata dakika moja ya GPU

    Kukagua seti ya data hugharimu Dola sifuri kwa saa. Kugundua tatizo lile lile kutoka kwenye mkondo wa hasara hugharimu Dola 2.00 kwa saa kwenye kiwango cha H100 na kukujulisha saa nne baadaye. Sukuma seti ya data na uichunguze kwenye kitazamaji cha LeRobot, au vinjari saraka ya seti za data ya AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Funza, na hakikisha sehemu ya kukagua inabaki hai baada ya pod

    Mashine iliyokodishwa ni ya muda mfupi kwa ufafanuzi, kwa hivyo andika sehemu za kukagua mahali salama wakati wa uendeshaji. Bendera mbili huamua kama utahifadhi ulicholipia. --save_freq inachaguomsingi hatua 20,000, kwa hivyo uendeshaji chaguomsingi wa SmolVLA wa hatua 20,000 huandika sehemu yake ya kwanza ya kukagua wakati uendeshaji tayari umekwisha; ipunguze kabla ya kukodisha chochote kinachoweza kukatizwa. --save_checkpoint_to_hub inahitaji --policy.repo_id na haipo katika lerobot 0.5.1, kwa hivyo kwenye toleo hilo unanakili saraka ya matokeo kutoka kwenye mashine mwenyewe. Ukubwa wa kundi hapa chini ni mfano wa hati ya juu; fomu ya AY-Robots hutuma 2 kwa SmolVLA na kuandika kwenye hifadhi ya vitu kadri sehemu za kukagua zinavyoonekana.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
VipindiKurekodi kwa 60 sKuweka upya kwa 60 sSaa halisiPamoja na asilimia 20 ya kurekodi upyaKwa Dola 15 kwa saa ya binadamu
30, the SmolVLA minimum30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, the other four minimums50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, a comfortable dataset100 min100 min3 h 20 min4 h 00 minabout 60 USD

Linganisha safu ya kulia na gharama ya uendeshaji ya 1 hadi 12 USD. Kwa kiwango hicho kilichokadiriwa, seti ya data ya vipindi 50 inagharimu mara mbili hadi saba zaidi kurekodi kuliko inavyogharimu kufundisha, kabla ya urekebishaji, usanidi wa kamera na vipindi unavyotupa. Ndiyo maana ina thamani ya moja kwa moja ya dola. Mwongozo wa lerobot unapendekeza angalau vipindi 50 na 10 kwa kila eneo la kitu; nyaraka za SmolVLA zinaripoti kuwa toleo la vipindi 25 la kazi hiyo hiyo halikutosha.

Ambapo pesa hupotea kweli

1. Uendeshaji kwenye data ambayo haingewahi kufanya kazi

Uendeshaji wa GR00T wa hatua 20,000 kwenye seti ya data yenye mitiririko miwili ya kamera iliyobadilishana inagharimu sawa na ule kwenye seti ya data safi, inachukua muda sawa, na inazalisha mkondo wa hasara unaoonekana sawa. Kushindwa huonekana kwenye mkono, masaa kadhaa baadaye. hulipwa kwa saa na utambuzi hulipwa kwa siku. Dalili mbili zinazostahili kukumbukwa: kwa kawaida inamaanisha kuwa uchunguzi haubebi kile ambacho kazi inahitaji, na inamaanisha kuwa seti ya data ilikuwa na tofauti ndogo kuliko ulivyofikiria.

2. Kulipa bei za modeli msingi kwa kazi ya kamera isiyohamishika

ACT ina takriban vigezo milioni 80 na iliundwa kufunzwa kuanzia mwanzo kwa maonyesho 50 ya kazi moja. GR00T N1.7 ina takriban bilioni 3 ikiwa na uti wa mgongo uliofunzwa awali. Kwa kamera iliyofungwa chini, meza isiyohamishika na kitu kimoja, modeli ya milioni 80 mara nyingi hufikia lengo, huendeshwa kwa takriban milisekunde 20 kwa kila hatua ya kitendo badala ya milisekunde 152, na gharama yake ni kati ya dola 1 hadi 3 kwa kila uendeshaji badala ya dola 4 hadi 12. Tumia dola 3 kujua kama modeli ya bei nafuu inafanya kazi kabla ya kutumia dola 12 kwa ile ya gharama kubwa. ACT dhidi ya SmolVLA na GR00T N1.7 dhidi ya Pi0.5 huonyesha wapi kila moja huacha kuwa jibu sahihi; uwanja wa modeli una modeli 85 na matokeo 332 ya vigezo.

3. GPU uliyoisahau

Kosa la bei nafuu zaidi kuzuia na la kawaida zaidi kufanya. Kifaa kilichoanzishwa Ijumaa kwa ajili ya kurekebisha hitilafu huhesabiwa gharama kwa wikiendi nzima kwa kiwango sawa na uendeshaji halisi.

KadiKiwango cha wastani katika pichaHaifanyi kazi kwa saa 24Haifanyi kazi kwa siku 7Hiyo inafaa
RTX 40900.32 USD/h7.68 USD53.76 USDtakriban majaribio 27 ya SmolVLA au ACT kwa 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDtakriban majaribio 12 ya GR00T kwa 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDtakriban majaribio 38 ya GR00T kwa 8 USD

Katika AY-Robots, hitilafu hii imeondolewa kwa ajili ya inference: pods zinazotolewa na inference API hubeba watchdog isiyofanya kazi na hujiharibu zenyewe baada ya kipindi cha kutofanya kazi. Ukikodi kadi mwenyewe, watchdog hiyo ni kikumbusho chako cha kalenda.

4. Kulipa mara mbili kwa jibu lile lile

Sehemu ya kuanzia ya GR00T ya fine-tuning ni tyro CLI ambayo haionyeshi seed yoyote. Hiyo siyo kikwazo cha jukwaa, ni zana ya asili: hakuna sehemu ya seed katika gr00t/configs/finetune_config.py, na vidokezo vya mafunzo vya hazina hiyo vinaonya kuwa majaribio hutofautiana kwa asilimia 5 hadi 6 kwa sababu nyongeza za picha si za uhakika. lerobot huweka seed 1000 kama chaguo-msingi katika 0.5.1 na 0.6.1, hivyo majaribio ya ACT, SmolVLA na Pi0.5 yanaweza angalau kurudiwa kutoka kwa uanzishaji na mpangilio wa data ule ule. Hiyo si ahadi ya uzito unaofanana kabisa kwenye GPU, lakini ni tofauti kati ya kurudia na jaribio jipya. Ikiwa jaribio la GR00T linazalisha sera inayofanya kazi na hukuhifadhi sehemu ya kukagua, unalipa bei kamili kwa matokeo ambayo yanaweza kutofautiana zaidi ya tofauti uliyokuwa ukiifuata. Kuna njia ya pili ya kupoteza sehemu ya kukagua uliyolipia: CLI huweka chaguo-msingi la --save-total-limit 5, iliyoandikwa kama idadi ya juu zaidi ya sehemu za kukagua zinazohifadhiwa kabla ya zile za zamani kufutwa. Hifadhi ni senti; kurudia ni 4 hadi 12 USD na saa sita.

Uwezo unaoweza kukatizwa ni nusu bei na utakatisha mchakato wako

Bei za chini za zabuni hapo juu ni sehemu ndogo ya kiwango cha mahitaji, na vast.ai inasema mfumo wa zabuni unaweza kupunguza gharama za mteja kwa asilimia hamsini au zaidi. Kikwazo, kwa maneno yao wenyewe: mfumo unaoweza kukatizwa unaweza kusitishwa wakati wowote ikiwa mtumiaji mwingine atatoa zabuni ya juu au ukodishaji wa mahitaji utaundwa kwa rasilimali hizo hizo, na usitishaji huo "unasimamisha michakato yote inayoendelea". Mahitaji daima hupewa kipaumbele. Hii ni sawa kwa mchakato unaoandika checkpoint kila hatua mia chache, hasara kamili kwa ule unaoandika mwishoni, ambayo ndiyo hasa mipangilio chaguomsingi inakupa: Isaac-GR00T CLI huandika kila --save-steps (chaguomsingi 1000), lakini --save_freq ya lerobot inachaguomsingi hatua 20,000, kwa hivyo mchakato chaguomsingi wa SmolVLA huandika checkpoint mara moja, mwishoni. Punguza, au usitoe zabuni. Fomu ya mafunzo ya AY-Robots inaonyesha mpangilio wa GR00T kama saveSteps.

Kukodisha kadi mwenyewe
Faida
  • Kiwango cha chini kabisa cha saa kinachopatikana.
  • Udhibiti kamili wa picha, toleo la CUDA, marekebisho ya lerobot au Isaac-GR00T na kila bendera.
  • Zabuni inayoweza kukatizwa hupunguza kiwango kwa nusu ikiwa mchakato wako huandika checkpoint mara kwa mara vya kutosha kuweza kuendelea baada ya kusitishwa.
  • Hakuna kinachofichwa, kwa hivyo mchakato unapofanya kazi isivyo kawaida unaweza kuona sababu.
Mabadilishano
  • Gharama za usanidi huhesabiwa kwa viwango vya GPU: madereva, vitegemezi, checkpoint ya msingi ya gigabyte nyingi na upakuaji wa data zote hugharimu sawa kwa saa kama mafunzo.
  • Mfumo unaoweza kukatizwa ulioshindwa zabuni husitishwa na michakato yake huisha. Mchakato usiohifadhiwa ni pesa iliyopotea, na chaguomsingi ya lerobot huandika checkpoint yake ya kwanza katika hatua ya 20,000.
  • Hakuna kinachoharibu pod kwa ajili yako. Jedwali la muda wa kutotumika hapo juu ni bili ya kusahau.
  • Ugavi wa kadi kamili za 80 GB ni mdogo: ofa mbili za A100 80 GB na tano za H100 80 GB za kadi kamili katika usomaji huu. Orodha pia hubadilika, kwa hivyo bei ya chini kabisa iliyoorodheshwa na bei unayoweza kukodisha si namba sawa.
  • Kila saa kwenye miundombinu ni saa ambayo haikutumika kurekodi vipindi vinavyoamua kama sera inafanya kazi.

Kufanya mwenyewe dhidi ya kuruhusu jukwaa kukodisha kadi

Unachagua mashine, unajenga mazingira na kuharibu pod. Kiwango cha saa ni kiwango cha soko hapo juu; kila kitu kingine ni muda wako.

  1. Tafuta kadi inayolingana na VRAM inayohitajika na modeli: 24 GB kwa ACT na SmolVLA, 80 GB kwa GR00T na Pi0.5.
  2. Kodisha kwa mahitaji ikiwa mchakato hauwezi kuendelea baada ya kusitishwa, unaoweza kukatizwa ikiwa huandika checkpoint mara kwa mara.
  3. Sakinisha zana: lerobot kwa ACT, SmolVLA na Pi0.5, hazina ya Isaac-GR00T na kizindua chake cha tyro kwa GR00T.
  4. Badilisha data ikiwa inahitajika. Data ya LeRobot v3.0 husababisha GR00T loader kukwama na lazima ibadilishwe hadi v2.1.
  5. Zindua, angalia hasara, sukuma checkpoints mahali salama zinapoandikwa.
  6. Haribu mfumo, kisha hakikisha umeuharibu.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Sehemu ya sasa ya Isaac-GR00T ya kurekebisha vizuri, inayolingana na amri katika README ya hazina. CLI hii haina bendera ya mbegu, kwa hivyo michakato ya GR00T haiwezi kuzalishwa tena kidogo-kidogo.

Gharama halisi kwa mchakato mmoja wa GR00T: saa 3 hadi 6 kwenye H100 80 GB kwa 1.34 hadi 2.34 USD kwa saa ni 4 hadi 14 USD, pamoja na dakika 20 hadi 40 za usanidi ambazo pia zinalipishwa, pamoja na muda wako mwenyewe.

Jinsi jukwaa linavyotoza na jinsi linavyochagua kadi

Mantiki imekusudiwa kuwa rahisi. Kila modeli katika orodha inatangaza kiwango cha GPU; mfumo wa nyuma huchukua VRAM inayohitajika na kukodisha kadi inayolingana kwenye soko lile lile la papo hapo lililopimwa hapo juu. Ndiyo maana gharama iliyonukuliwa ni safu, si bei. GR00T na Pi0.5 zinapatikana kwenye wingu pekee hapa kwa sababu ya viwango vya chini vya 40 GB na 70 GB. SmolVLA na ACT pia huendeshwa ndani ya nchi kwenye kadi yako mwenyewe ya 24 GB, ambapo gharama ya wingu ni sifuri na umeme ni tatizo lako.

Ukurasa wa bei wa AY-Robots unaoonyesha gharama ya uendeshaji wa mafunzo na ufikiaji wa jukwaa
Ukurasa wa bei. Takwimu za kila uendeshaji hufuatilia soko la papo hapo badala ya bei maalum ya orodha.

Kipengele kimoja kinahitaji onyo. Mkusanyiko wa gradient unatumika kikweli kwa aina zote mbili za GR00T, kwa hivyo kuongeza huku kunanunua kundi kubwa zaidi la ufanisi kwenye kadi ile ile. Kwa Pi0.5 na SmolVLA haitumiki kabisa: lerobot 0.5.1 haina chaguo la mkusanyiko wa gradient katika usanidi wake wa mafunzo, kwa hivyo kuweka uga kuwa 16 hakugharimu chochote na hakununui chochote. Ikiwa kazi iliyopangwa haianzi kamwe, ukurasa wa kazi iliyokwama kwenye foleni inashughulikia nini cha kuangalia; ikiwa seti ya data inakataliwa kabla ya uendeshaji kuanza, karibu kila mara ni tatizo la umbizo la v3.0.

Kikomo ambacho jukwaa hili halitatui: kuchelewa

GPU ya kukodi inayohudumia sera yako kupitia intaneti ya umma huongeza safari za kwenda na kurudi kwenye kitanzi cha udhibiti ambacho tayari kina 20 hadi 485 ms kwa kila hatua ya kitendo. Inafaa kwa kazi za polepole za kuchukua na kuweka, si kwa mwendo wa haraka wa kuitikia. Utabiri wa wingu hutathmini sehemu ya kukagua vizuri na huendesha udanganyifu wa uzalishaji vibaya: ikiwa kazi inahitaji kasi, kompyuta inapaswa kukaa karibu na servomotor, na hiyo ni gharama ambayo makala haya hayawezi kuifanya kutoweka. Tazama kuchelewa kwa utabiri.

Bajeti iliyofanyiwa kazi kwa sera ya kwanza inayofanya kazi

Mistari yote minne pamoja, kuanzia mwanzo. Jumla ya GPU inachukua mizunguko 3 hadi 5: wa kwanza unathibitisha kuwa bomba linafanya kazi, wa pili unafunua tatizo la data, wa tatu au wa nne ndio unaohifadhi.

MstariNjia nyepesiNjia rahisi
MkonoSO-100 mfuasi pekee, 121.94 USD katika BOMkiongozi pamoja na mfuasi, 229.88 USD katika BOM
MfumoSmolVLA au ACT, kiwango cha 24 GBGR00T N1.7, A100 80 GB au kiwango cha H100
Vipindi vilivyorekodiwa30, kiwango cha chini cha SmolVLA50 hadi 100
Muda wa binadamu wa kurekodikama saa 1 na dakika 12Saa 2 hadi 4
Gharama ya mzunguko mmoja1 hadi 3 USD4 hadi 12 USD
Mizunguko kabla haijafanya kazi3 hadi 53 hadi 5
Jumla ya matumizi ya GPU3 hadi 15 USD12 hadi 60 USD
Mstari mkubwa zaidi kwenye bilimkono, kisha muda wakomkono, kisha muda wako

Mfumo huu unatumika kwa ukubwa huu wa roboti: hesabu ni makosa madogo, maunzi ni gharama halisi ya mara moja, saa za binadamu ndio gharama inayojirudia. Ili kujaribu nusu ya mafunzo kabla ya kununua chochote, hukuruhusu kulinganisha mifumo na kukodisha GPU bila mkono, na ni SO-100 halisi unayoweza kuendesha kwenye kivinjari bila kujisajili. Kwa mchakato mzima kuanzia mwanzo hadi mwisho, inashughulikia usanidi, na mafunzo, na ni toleo fupi.

Matrix ya mafunzo ya AY-Robots yenye sera tano kama safu na mikono minne ya roboti kama safu wima, kila seli ikiunganisha kwenye mwongozo maalum wa mafunzo.
Matrix ya /train: safu kwa bajeti yako, safu wima kwa mkono wako, seli kwa mwongozo wenye mipangilio chaguomsingi na gharama za jozi hiyo.
Gharama ya mara moja ya VLA fine-tuning ni kiasi gani kuanzia mwanzo hadi mwisho?

Kama 4 hadi 12 USD kwa GR00T N1.7, GR00T N1.5 au Pi0.5 kwenye kiwango cha A100 80 GB au H100 (saa 3 hadi 6 kwa 1.20 hadi 2.00 USD kwa saa), na kama 1 hadi 3 USD kwa SmolVLA au ACT kwenye kiwango cha RTX 4090 (saa 2 hadi 5 kwa 0.30 hadi 0.60 USD kwa saa). Kukodisha kadi mwenyewe kunaingia katika kiwango hicho hicho mara tu muda wa usanidi unapohesabiwa, kwani inatozwa kwa kiwango cha mafunzo.

Je, H100 inafaa kulipiwa zaidi ya A100 80 GB?

Kwa sera moja ya SO-100, kwa kawaida hapana. Zote mbili zinakidhi mahitaji ya kumbukumbu ya GR00T na Pi0.5, na katika usomaji wa Agosti 23, 2026, A100 80 GB kamili ilianza kwa 0.44 USD kwa saa dhidi ya 1.34 kwa H100 80 GB. H100 humaliza haraka, kwa hivyo sehemu ya kiwango hurudi kama saa chache, lakini jumla bado ni kubwa zaidi kwa mchakato mdogo kama huu. Hoja halisi ya H100 ni upatikanaji: ofa tano za H100 80 GB moja kwenye soko hilo dhidi ya A100 80 GB mbili, na kadi ambayo huwezi kukodisha haina bei.

Inachukua mara ngapi kabla sera haijaanza kufanya kazi?

Panga kwa tatu hadi tano. Ya kwanza inathibitisha kuwa mchakato umeunganishwa kwa usahihi. Ya pili kwa kawaida hufichua tatizo la data kama vile mtiririko wa kamera uliokufa katikati. Ya tatu au ya nne ndiyo unayohifadhi.

Je, ninaweza kufunza SmolVLA au ACT kwenye GPU yangu mwenyewe badala ya kukodisha?

Ndio. Zote mbili zinaungwa mkono ndani ya nchi kwenye AY-Robots na zote zinafaa vizuri katika 24 GB; karatasi asili ya ACT ilifunza modeli yake ya 80M kwa takriban saa 5 kwenye 11 GB RTX 2080 Ti. GR00T na Pi0.5 zinapatikana kwenye wingu pekee hapa kwa sababu viwango vya chini vya fine-tuning vilivyorekodiwa na wachuuzi ni 40 GB na 70 GB, na kadi kubwa zaidi ya watumiaji sokoni ni 32 GB RTX 5090.

Kwa nini idadi sawa ya hatua inagharimu kiasi tofauti kati ya mifumo?

Hatua haziwezi kulinganishwa kati ya sera. ACT inatumia hatua 100,000 kwa batch 8 kwenye kadi ya 24 GB; GR00T N1.5 inatumia hatua 2,000 kwa batch 1 na gradient accumulation 16 kwenye kadi ya 80 GB. Bili ni saa zilizozidishwa na kiwango cha kadi ambayo mahitaji ya kumbukumbu yanakulazimisha kutumia, sio kaunta ya hatua.

Angalia gharama ya mchakato wako kabla ya kuanza

Kila moja ya sera tano inaorodhesha kiwango chake cha GPU, muda wa kuendesha na bei kwa kila mchakato, na mfumo wa mafunzo hukodisha kadi kwenye soko lile lile ambapo namba hizi zilipimwa.

Angalia bei

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started