
Bei halisi za GPU sokoni, muda ambao kila moja ya sera tano huendeshwa, gharama ya mkono na maonyesho, na sehemu nne ambapo pesa hupotea kimya kimya.
Muhtasari mfupi
- •Kukimbia kwenye kiwango cha A100 80 GB au H100 huchukua saa 3 hadi 6 na gharama yake ni takriban dola 4 hadi 12 za Kimarekani. Kwenye kiwango cha RTX 4090 ni saa 2 hadi 5 na takriban dola 1 hadi 3 za Kimarekani.
- •Imepimwa kwenye vast.ai saa 13:44 UTC mnamo Agosti 23, 2026: RTX 4090 kamili inapohitajika kwa 0.13 hadi 0.38 USD/h, A100 80 GB kwa 0.44 hadi 0.67, H100 80 GB kwa 1.34 hadi 2.34. Kadi kamili za 80 GB ni chache, ofa mbili na tano za kadi moja mtawalia.
- •GPU ndio mstari wa bei nafuu zaidi. Orodha ya vifaa vya SO-ARM100 inaweka jozi ya kiongozi na mfuasi kwa 229.88 USD, ambayo ni mikimbio 77 hadi 230 kwenye kiwango cha 24 GB.
- •Saa mbili za mtu kurekodi vipindi 50 hugharimu zaidi ya mchakato wa mafunzo unaolishwa na vipindi hivyo.
- •Pesa hupotea katika maeneo manne: mikimbio kwenye data iliyoharibika, mifumo ya 3B kwenye kazi zinazoshughulikiwa na sera ya 80M, GPU ambazo hakuna aliyeharibu, na kurudia matokeo uliyoshindwa kuhifadhi.
- •AY-Robots hupima kadi kulingana na VRAM inayohitajika na modeli na huikodisha kwenye soko hilo hilo la papo hapo, hivyo gharama ya uendeshaji ni gharama ya soko.
Bili ina mistari minne, na GPU ndio mdogo zaidi
Watu wanapouliza inagharimu kiasi gani kurekebisha modeli ya lugha-maono-vitendo kwa SO-100, karibu kila mara wanamaanisha kukodisha GPU. Hiyo ndiyo namba inayoonekana kama malipo kwenye kadi, kwa hivyo ndiyo inayohisi halisi. Pia, kwa tofauti kubwa, ndiyo ndogo zaidi kati ya namba nne zinazoamua ni kiasi gani sera inayofanya kazi inakugharimu.
| Mstari | Ni nini | Ukubwa wa kawaida kwa sera moja inayofanya kazi |
|---|---|---|
| Muda wa GPU | kukodisha kadi kwa ajili ya uendeshaji | Dola 1 hadi 12 za Kimarekani kwa kila uendeshaji, na utafanya 3 hadi 5 |
| Roboti | servos, fremu iliyochapishwa, kamera, nyaya, nguvu | mara moja, Euro 110 hadi 500 kwa mkono |
| Saa za binadamu | mtu anayeendesha mkono kurekodi maonyesho | Saa 1 hadi 4 kwa kila seti ya data, hurudiwa kwa kila kazi |
| Upotevu | data mbaya, mifumo mikubwa kupita kiasi, pods zilizosahaulika | haina kikomo, na ndio mstari pekee unaoudhibiti |
Nyakati za mafunzo hapa chini zinatokana na karatasi na hifadhi za miundo mitano yenyewe, gharama ya maunzi kutoka kwenye orodha ya vifaa iliyochapishwa, namba za jukwaa kutoka AY-Robots orodha ya sera na ukurasa wa bei. Pale ambapo jukwaa halisaidii, makala haya yanasema hivyo.
Gharama halisi ya saa ya GPU kwenye soko la papo hapo
Hakuna bei moja ya saa ya A100. Kwenye soko kama vast.ai kila mwenyeji huweka kiwango chake, na mchakato wa mafunzo unaozindua hutua kwenye mashine yoyote iliyo nafuu na huru kwa wakati huo. Jibu la uaminifu ni usambazaji. Hapa ndio, iliyopimwa Agosti 23, 2026 saa 13:44 UTC: kadi kamili moja, kwa mahitaji, iliyochujwa na VRAM halisi.
| Kadi | vast.ai kwa mahitaji USD/h (chini / wastani / juu) | Ofa za Kadi Kamili | Bei ya chini ya zabuni vast.ai | RunPod Jumuiya / Salama | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
Matoleo ya mahitaji maalum kwa GPU moja kamili (gpu_frac == 1.0) kutoka API ya umma ya vast.ai, ambayo haihitaji akaunti, yaliyochujwa kwa gpu_ram ili kadi halisi za 80 GB tu ziingie kwenye safu za 80 GB. Kichujio hicho ni muhimu: katika usomaji huu, matoleo yote matatu ya kadi moja ya A100 SXM4 yalikuwa sehemu za 40 GB, kama vile matoleo mawili kati ya manne ya A100 PCIE, kwa hivyo kuziunganisha kwenye safu moja ya "A100" kungepunguza bei iliyoripotiwa hapa kwa nusu. Safu ya Hugging Face inachanganya bidhaa mbili: 2.50 USD/h ni maunzi ya Nvidia A100 - kubwa ya Spaces na 4.50 USD/h ni H100 80 GB moja chini ya Inference Endpoints, ambayo Spaces haitoi. Chukulia wastani kama viashiria: safu ya A100 80 GB inategemea matoleo mawili na safu ya H100 inategemea matano, na swali lile lile sekunde 36 baadaye lilirejesha hesabu tofauti ya 4090 na bei tofauti ya juu kwenye safu tatu kati ya tano. Bei za orodha za RunPod ndio nambari thabiti zaidi ya kupanga dhidi yake.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Kwa nini mifumo ya 3B haiwezi kutumia kadi ya bei nafuu
Saa ya 4090 na saa ya H100 80 GB hutofautiana kwa takriban mara sita kwenye wastani ulio hapo juu. Kinachokulazimisha kutumia kadi ghali si kasi, bali ni kumbukumbu. openpi inaweka kiwango cha chini kwa Pi0.5 kamili urekebishaji-laini kwa 70 GB, na NVIDIA inapendekeza 40 GB au zaidi kwa GR00T. Kumbuka nambari ya GR00T si nini. Usanidi wake wa urekebishaji-laini hugandisha modeli ya lugha na kirekebisha-taswira kwa chaguo-msingi (tune_llm na tune_visual ni False, projekta na kichwa cha usambazaji ni True), ndiyo maana katalogi inaorodhesha takriban vigezo 40 M vilivyofunzwa kati ya 3 B. 40 GB si hali ya kiboreshaji kwa uzito wa 3 B, bali ni uti wa mgongo uliogandishwa pamoja na uanzishaji. Toleo zenye wigo uliopunguzwa hushuka chini: njia ya LoRA ya openpi inahitaji 22.5 GB na inataja 4090, na mtiririko wa kazi wa Isaac Lab Arena wa NVIDIA unaorodhesha chaguo la 24 GB la GPU moja kwa mafunzo ya baada ya GR00T. Jukwaa linaweka viwango kulingana na kiwango cha chini ambacho kila muuzaji huchapisha kwa usanidi unaoendeshwa. Maelezo ya pi0 flow-matching inaeleza ni wapi upatanishi wa mtiririko nyayo hiyo inatoka.
| Kazi | Kumbukumbu inayohitajika na mradi wa asili | Chanzo |
|---|---|---|
| pi0 / pi0.5 inference | zaidi ya 8 GB, mfano RTX 4090 | openpi |
| pi0 / pi0.5 LoRA urekebishaji-laini | zaidi ya 22.5 GB, mfano RTX 4090 | openpi |
| pi0 / pi0.5 urekebishaji-laini kamili | zaidi ya 70 GB, mfano A100 80 GB au H100 | openpi |
| GR00T N1.7 inference | 1 GPU yenye 16 GB au zaidi | Isaac-GR00T |
| GR00T N1.7 urekebishaji-laini | 40 GB au zaidi inapendekezwa, nodi za H100 au L40 | Isaac-GR00T |
| GR00T urekebishaji-laini, inachofunza | projekta na kichwa cha usambazaji; LLM na kirekebisha-taswira vimegandishwa kwa chaguo-msingi | finetune_config.py |
| GR00T mafunzo ya baada, yaliyopunguzwa | 1 GPU yenye 24 GB, modeli ya lugha imegandishwa | Isaac Lab Arena |
| SmolVLA urekebishaji-laini | A100 moja kwa ajili ya marejeleo ya hatua 20,000 | lerobot docs |
| ACT mafunzo | RTX 2080 Ti moja ya 11 GB | ACT paper |
Jedwali hilo ndilo sababu jukwaa linagawanya modeli tano katika viwango viwili. GR00T N1.7, GR00T N1.5 na Pi0.5 huendeshwa kwenye A100 80 GB au H100 kwa sababu ndicho wanachohitaji wauzaji. SmolVLA na ACT huendeshwa kwenye RTX 4090 au kadi yoyote ya 24 GB kwa sababu hiyo inatosha kabisa.
Uendeshaji wa GR00T au Pi0.5 kwenye kadi ya 24 GB haushindwi mara moja. Inapakua kituo cha ukaguzi cha msingi, inajenga faharisi ya seti ya data, inaanza pasi ya kwanza ya mbele na inakufa baada ya hatua chache tu kwa hitilafu ya CUDA out-of-memory. Umelipia upakuaji na usanidi na hukupata chochote. Marekebisho: kumbukumbu kujaa wakati wa mafunzo.
Muda halisi wa uendeshaji wa kila moja ya mifumo mitano
Muda wa uendeshaji ni nusu nyingine ya gharama: 2.00 USD kwa saa hauna maana ikiwa kazi ni dakika 40 na ni mbaya ikiwa ni saa 40. Hizi ndizo mipangilio chaguomsingi AY-Robots hutuma kwa mkufunzi, pamoja na dirisha la uendeshaji na gharama kwa kila ngazi.
| Sera | Ngazi ya GPU | Hatua Chaguomsingi za Juu | Kundi Chaguomsingi (mkusanyiko wa grad) | Dirisha la Uendeshaji | Gharama kwa Kila Uendeshaji |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Vyanzo vya makadirio hayo ya muda wa utekelezaji kutoka juu
- SmolVLA: nyaraka za lerobot zinasema kuwa hatua 20,000 huchukua takriban saa 4 kwenye A100 moja. Jukwaa huendesha hatua hizo 20,000 kwenye kiwango cha bei nafuu cha 24 GB, hivyo basi kuna dirisha la muda badala ya saa 4 kamili.
- ACT: karatasi asili ya ALOHA inaripoti takriban saa 5 kwenye RTX 2080 Ti moja ya 11 GB kwa modeli yenye vigezo milioni 80. Kadi ya 4090 ni ya vizazi kadhaa vipya zaidi lakini jukwaa linatenga bajeti ya hatua 100,000, kwa hivyo dirisha la muda linaangukia mahali pale pale.
- GR00T: Mfumo wa kazi wa marejeleo wa NVIDIA kwa kizazi cha N1.6 unataja takriban saa 4 hadi 8 kwa hatua 20,000 kwa batch 24 kwenye kadi nane za L40S, na saa 2 hadi 3 kwa hatua 30,000 kwa batch 16 kwenye Ada 6000 moja. Kufanya 'fine-tuning' ya VLA ya 3B kwa kutumia kadi moja ndani ya saa chache ni jambo la kawaida, si matumaini makubwa.
- Pi0.5: openpi haichapishi takwimu za muda halisi, lakini inachapisha kiwango cha chini cha 70 GB kwa 'fine-tune' kamili, jambo linalobainisha kadi na hivyo basi kasi.
Inafaa kusitisha kidogo kwenye namba ambayo hulipi. Karatasi ya GR00T N1 inaripoti takriban saa 50,000 za H100 GPU kwa ajili ya kutoa mafunzo ya awali kwa modeli ya 2.2B, kwenye kundi la hadi GPU 1024, kwa ukubwa wa batch ya mafunzo ya awali ya 16,384 kwa hatua 200,000 za gradient. Kwa USD 1.34 hadi 2.34 kwa saa iliyopimwa hapo juu, hiyo ni takriban USD 67,000 hadi 117,000 za kompyuta iliyokodishwa. Karatasi ya SmolVLA inaweka mradi wake kwa takriban saa 30,000 za GPU kwenye seti data 481 za jamii, vipindi 22.9K na fremu 10.6M. Unarithi yote kwa bei ya kupakua; USD 8 zako zinanunua hatua 20,000 za mwisho. Kwa nini VLAs hujengwa kwa njia hii inafafanua mgawanyiko huo.
Mkono: gharama ya mara moja inayofunika bili ya GPU
Mafunzo hugharimu chini ya chakula cha mchana. Roboti haigharimu hivyo. Ndiyo maana SO-100 ni muhimu: ni mkono wa bei nafuu zaidi ambao mfumo mzima wa zana wa ujifunzaji wa kuiga unasaidia.
| Mkono | Servos | Volti | Gharama ya sehemu | Usaidizi kwenye AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | mkono kamili, wa rejea |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | kamili |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | inayooana |
| LeKiwi | Mkono wa Feetech STS3215, msingi wenye magurudumu | Mkono wa 7.4 V, msingi wa 12 V | 400 to 500 EUR | inayooana |
Orodha ya vifaa vya juu katika hazina ya SO-ARM100 ni ya kina zaidi na inafaa kuangaliwa kulingana na eneo lako: orodha yake ya Sehemu za Mikono Miwili inafikia jumla ya 229.88 USD au 226.30 EUR kwa usanidi wa kiongozi na mfuasi, na orodha yake ya Sehemu za Mkono Mmoja wa Mfuasi inafikia jumla ya 121.94 USD au 124.30 EUR. Servos sita za STS3215 kwa 13.89 USD kila moja ni 83.34 ya 121.94 hiyo, kwa hivyo servos ndio mkono. Kwa 1 hadi 3 USD kwa kila SmolVLA au ACT run, jozi moja ya mikono ina thamani ya kati ya mafunzo 77 na 230. Ikiwa bado unachagua, SO-100 dhidi ya SO-101 ndio ulinganisho muhimu, sababu hizo mbili ziko karibu kiasi kwamba uamuzi unahusu upatikanaji badala ya uwezo.
STS3215 inapatikana katika toleo la 7.4 V na 12 V; hazina inabainisha kuwa sehemu ya 12 V pia inahitaji usambazaji wa 12 V 5 A badala ya ule wa 5 V, kwa hivyo hizo mbili haziwezi kubadilishana. Kuweka 12 V kwenye servos za 7.4 V huziharibu, na servos sita ni theluthi mbili ya gharama ya sehemu za mkono wa mfuasi. Angalia lebo kwenye kila servo kabla ya kuwasha kwa mara ya kwanza. Ikiwa servos tayari zinafanya kazi isivyo kawaida: servo haijibu, mkono unatetemeka kisha unalegea.
Saa za binadamu: mstari ambao hakuna anayeweka kwenye lahajedwali
Huu ndio namba inayogeuzia mjadala wa gharama kichwa chini. Kurekodi maonyesho ni mtu kusogeza mkono wa roboti, kipindi kimoja kwa wakati mmoja, kwa wakati halisi. Hakuna kuikusanya kwa wingi wala kuikodisha kwa sekunde. Kinasa cha seti ya data ya LeRobot kinakuja na mipangilio chaguomsingi inayofanya hesabu kuwa rahisi, zote tatu zimethibitishwa katika DatasetRecordConfig: sekunde 60 kwa kila kipindi, sekunde 60 kuweka upya eneo, vipindi 50. Safu wima ya pesa hapa chini inachukulia Dola 15 kwa saa moja ya muda wa mtu, ambayo ni dhana badala ya namba ya jukwaa. Badilisha kiwango chako mwenyewe; uwiano ndio muhimu.
- 1Rekodi seti ya data kwa mipangilio chaguomsingi utakayotozwa gharama halisi
Huu ni lerobot 0.6.1, toleo lililopo kwenye PyPI kufikia Agosti 3, 2026. Kumbuka umbo la CLI: kurekodi hupitia sehemu ya kuingilia ya koni ya
lerobot-record(lerobot.scripts.lerobot_record), si njia ya moduli ya zamani yapython -m lerobot.scripts.record. AY-Robots inalenga 0.5.1, na gurudumu la 0.5.1 linatangaza sehemu zile zile za kuingilia zalerobot-recordnalerobot-train, kwa hivyo umbo hapa chini ni thabiti kwa zote mbili. Bendera tatu za muda ni mipangilio chaguomsingi ya juu, kwa hivyo hii pia ndio amri ambayo hesabu katika jedwali linalofuata inachukulia.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Angalia ulichorekodi kabla ya kukodisha hata dakika moja ya GPU
Kukagua seti ya data hugharimu Dola sifuri kwa saa. Kugundua tatizo lile lile kutoka kwenye mkondo wa hasara hugharimu Dola 2.00 kwa saa kwenye kiwango cha H100 na kukujulisha saa nne baadaye. Sukuma seti ya data na uichunguze kwenye kitazamaji cha LeRobot, au vinjari saraka ya seti za data ya AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Funza, na hakikisha sehemu ya kukagua inabaki hai baada ya pod
Mashine iliyokodishwa ni ya muda mfupi kwa ufafanuzi, kwa hivyo andika sehemu za kukagua mahali salama wakati wa uendeshaji. Bendera mbili huamua kama utahifadhi ulicholipia.
--save_freqinachaguomsingi hatua 20,000, kwa hivyo uendeshaji chaguomsingi wa SmolVLA wa hatua 20,000 huandika sehemu yake ya kwanza ya kukagua wakati uendeshaji tayari umekwisha; ipunguze kabla ya kukodisha chochote kinachoweza kukatizwa.--save_checkpoint_to_hubinahitaji--policy.repo_idna haipo katika lerobot 0.5.1, kwa hivyo kwenye toleo hilo unanakili saraka ya matokeo kutoka kwenye mashine mwenyewe. Ukubwa wa kundi hapa chini ni mfano wa hati ya juu; fomu ya AY-Robots hutuma 2 kwa SmolVLA na kuandika kwenye hifadhi ya vitu kadri sehemu za kukagua zinavyoonekana.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Vipindi | Kurekodi kwa 60 s | Kuweka upya kwa 60 s | Saa halisi | Pamoja na asilimia 20 ya kurekodi upya | Kwa Dola 15 kwa saa ya binadamu |
|---|---|---|---|---|---|
| 30, the SmolVLA minimum | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, the other four minimums | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, a comfortable dataset | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Linganisha safu ya kulia na gharama ya uendeshaji ya 1 hadi 12 USD. Kwa kiwango hicho kilichokadiriwa, seti ya data ya vipindi 50 inagharimu mara mbili hadi saba zaidi kurekodi kuliko inavyogharimu kufundisha, kabla ya urekebishaji, usanidi wa kamera na vipindi unavyotupa. Ndiyo maana ina thamani ya moja kwa moja ya dola. Mwongozo wa lerobot unapendekeza angalau vipindi 50 na 10 kwa kila eneo la kitu; nyaraka za SmolVLA zinaripoti kuwa toleo la vipindi 25 la kazi hiyo hiyo halikutosha.
Ambapo pesa hupotea kweli
1. Uendeshaji kwenye data ambayo haingewahi kufanya kazi
Uendeshaji wa GR00T wa hatua 20,000 kwenye seti ya data yenye mitiririko miwili ya kamera iliyobadilishana inagharimu sawa na ule kwenye seti ya data safi, inachukua muda sawa, na inazalisha mkondo wa hasara unaoonekana sawa. Kushindwa huonekana kwenye mkono, masaa kadhaa baadaye. hulipwa kwa saa na utambuzi hulipwa kwa siku. Dalili mbili zinazostahili kukumbukwa: kwa kawaida inamaanisha kuwa uchunguzi haubebi kile ambacho kazi inahitaji, na inamaanisha kuwa seti ya data ilikuwa na tofauti ndogo kuliko ulivyofikiria.
2. Kulipa bei za modeli msingi kwa kazi ya kamera isiyohamishika
ACT ina takriban vigezo milioni 80 na iliundwa kufunzwa kuanzia mwanzo kwa maonyesho 50 ya kazi moja. GR00T N1.7 ina takriban bilioni 3 ikiwa na uti wa mgongo uliofunzwa awali. Kwa kamera iliyofungwa chini, meza isiyohamishika na kitu kimoja, modeli ya milioni 80 mara nyingi hufikia lengo, huendeshwa kwa takriban milisekunde 20 kwa kila hatua ya kitendo badala ya milisekunde 152, na gharama yake ni kati ya dola 1 hadi 3 kwa kila uendeshaji badala ya dola 4 hadi 12. Tumia dola 3 kujua kama modeli ya bei nafuu inafanya kazi kabla ya kutumia dola 12 kwa ile ya gharama kubwa. ACT dhidi ya SmolVLA na GR00T N1.7 dhidi ya Pi0.5 huonyesha wapi kila moja huacha kuwa jibu sahihi; uwanja wa modeli una modeli 85 na matokeo 332 ya vigezo.
3. GPU uliyoisahau
Kosa la bei nafuu zaidi kuzuia na la kawaida zaidi kufanya. Kifaa kilichoanzishwa Ijumaa kwa ajili ya kurekebisha hitilafu huhesabiwa gharama kwa wikiendi nzima kwa kiwango sawa na uendeshaji halisi.
| Kadi | Kiwango cha wastani katika picha | Haifanyi kazi kwa saa 24 | Haifanyi kazi kwa siku 7 | Hiyo inafaa |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | takriban majaribio 27 ya SmolVLA au ACT kwa 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | takriban majaribio 12 ya GR00T kwa 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | takriban majaribio 38 ya GR00T kwa 8 USD |
Katika AY-Robots, hitilafu hii imeondolewa kwa ajili ya inference: pods zinazotolewa na inference API hubeba watchdog isiyofanya kazi na hujiharibu zenyewe baada ya kipindi cha kutofanya kazi. Ukikodi kadi mwenyewe, watchdog hiyo ni kikumbusho chako cha kalenda.
4. Kulipa mara mbili kwa jibu lile lile
Sehemu ya kuanzia ya GR00T ya fine-tuning ni tyro CLI ambayo haionyeshi seed yoyote. Hiyo siyo kikwazo cha jukwaa, ni zana ya asili: hakuna sehemu ya seed katika gr00t/configs/finetune_config.py, na vidokezo vya mafunzo vya hazina hiyo vinaonya kuwa majaribio hutofautiana kwa asilimia 5 hadi 6 kwa sababu nyongeza za picha si za uhakika. lerobot huweka seed 1000 kama chaguo-msingi katika 0.5.1 na 0.6.1, hivyo majaribio ya ACT, SmolVLA na Pi0.5 yanaweza angalau kurudiwa kutoka kwa uanzishaji na mpangilio wa data ule ule. Hiyo si ahadi ya uzito unaofanana kabisa kwenye GPU, lakini ni tofauti kati ya kurudia na jaribio jipya. Ikiwa jaribio la GR00T linazalisha sera inayofanya kazi na hukuhifadhi sehemu ya kukagua, unalipa bei kamili kwa matokeo ambayo yanaweza kutofautiana zaidi ya tofauti uliyokuwa ukiifuata. Kuna njia ya pili ya kupoteza sehemu ya kukagua uliyolipia: CLI huweka chaguo-msingi la --save-total-limit 5, iliyoandikwa kama idadi ya juu zaidi ya sehemu za kukagua zinazohifadhiwa kabla ya zile za zamani kufutwa. Hifadhi ni senti; kurudia ni 4 hadi 12 USD na saa sita.
Bei za chini za zabuni hapo juu ni sehemu ndogo ya kiwango cha mahitaji, na vast.ai inasema mfumo wa zabuni unaweza kupunguza gharama za mteja kwa asilimia hamsini au zaidi. Kikwazo, kwa maneno yao wenyewe: mfumo unaoweza kukatizwa unaweza kusitishwa wakati wowote ikiwa mtumiaji mwingine atatoa zabuni ya juu au ukodishaji wa mahitaji utaundwa kwa rasilimali hizo hizo, na usitishaji huo "unasimamisha michakato yote inayoendelea". Mahitaji daima hupewa kipaumbele. Hii ni sawa kwa mchakato unaoandika checkpoint kila hatua mia chache, hasara kamili kwa ule unaoandika mwishoni, ambayo ndiyo hasa mipangilio chaguomsingi inakupa: Isaac-GR00T CLI huandika kila --save-steps (chaguomsingi 1000), lakini --save_freq ya lerobot inachaguomsingi hatua 20,000, kwa hivyo mchakato chaguomsingi wa SmolVLA huandika checkpoint mara moja, mwishoni. Punguza, au usitoe zabuni. Fomu ya mafunzo ya AY-Robots inaonyesha mpangilio wa GR00T kama saveSteps.
- Kiwango cha chini kabisa cha saa kinachopatikana.
- Udhibiti kamili wa picha, toleo la CUDA, marekebisho ya lerobot au Isaac-GR00T na kila bendera.
- Zabuni inayoweza kukatizwa hupunguza kiwango kwa nusu ikiwa mchakato wako huandika checkpoint mara kwa mara vya kutosha kuweza kuendelea baada ya kusitishwa.
- Hakuna kinachofichwa, kwa hivyo mchakato unapofanya kazi isivyo kawaida unaweza kuona sababu.
- Gharama za usanidi huhesabiwa kwa viwango vya GPU: madereva, vitegemezi, checkpoint ya msingi ya gigabyte nyingi na upakuaji wa data zote hugharimu sawa kwa saa kama mafunzo.
- Mfumo unaoweza kukatizwa ulioshindwa zabuni husitishwa na michakato yake huisha. Mchakato usiohifadhiwa ni pesa iliyopotea, na chaguomsingi ya lerobot huandika checkpoint yake ya kwanza katika hatua ya 20,000.
- Hakuna kinachoharibu pod kwa ajili yako. Jedwali la muda wa kutotumika hapo juu ni bili ya kusahau.
- Ugavi wa kadi kamili za 80 GB ni mdogo: ofa mbili za A100 80 GB na tano za H100 80 GB za kadi kamili katika usomaji huu. Orodha pia hubadilika, kwa hivyo bei ya chini kabisa iliyoorodheshwa na bei unayoweza kukodisha si namba sawa.
- Kila saa kwenye miundombinu ni saa ambayo haikutumika kurekodi vipindi vinavyoamua kama sera inafanya kazi.
Kufanya mwenyewe dhidi ya kuruhusu jukwaa kukodisha kadi
Unachagua mashine, unajenga mazingira na kuharibu pod. Kiwango cha saa ni kiwango cha soko hapo juu; kila kitu kingine ni muda wako.
- Tafuta kadi inayolingana na VRAM inayohitajika na modeli: 24 GB kwa ACT na SmolVLA, 80 GB kwa GR00T na Pi0.5.
- Kodisha kwa mahitaji ikiwa mchakato hauwezi kuendelea baada ya kusitishwa, unaoweza kukatizwa ikiwa huandika checkpoint mara kwa mara.
- Sakinisha zana: lerobot kwa ACT, SmolVLA na Pi0.5, hazina ya Isaac-GR00T na kizindua chake cha tyro kwa GR00T.
- Badilisha data ikiwa inahitajika. Data ya LeRobot v3.0 husababisha GR00T loader kukwama na lazima ibadilishwe hadi v2.1.
- Zindua, angalia hasara, sukuma checkpoints mahali salama zinapoandikwa.
- Haribu mfumo, kisha hakikisha umeuharibu.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Gharama halisi kwa mchakato mmoja wa GR00T: saa 3 hadi 6 kwenye H100 80 GB kwa 1.34 hadi 2.34 USD kwa saa ni 4 hadi 14 USD, pamoja na dakika 20 hadi 40 za usanidi ambazo pia zinalipishwa, pamoja na muda wako mwenyewe.
Unachagua modeli, data na vigezo vya juu katika fomu. Sehemu ya nyuma hukodisha GPU ya doa iliyopimwa kwa VRAM inayohitajika na modeli, huendesha mkufunzi na kuandika checkpoints kwenye hifadhi ya vitu.
- Chagua mchanganyiko wako kwenye matrix ya mafunzo: modeli tano, mikono minne, mwongozo mmoja kwa kila seli.
- Elekeza kwenye data: iliyorekodiwa na mteja wa kompyuta, kitambulisho cha hazina ya Hugging Face, au moja kutoka kwenye mashine yako mwenyewe.
- Kubali mipangilio chaguomsingi au irekebishe. Jedwali hapo juu ndicho kinachotumwa kwa mkufunzi.
- Sehemu ya nyuma huchagua kadi kulingana na VRAM inayohitajika, kwa hivyo hutawahi kutafuta GPU.
- Checkpoints huwekwa kwenye hifadhi ya vitu zinapoandikwa, kwa hivyo mchakato uliokatizwa si mchakato uliopotea.
| Kiwango | Modeli | Muda wa kuendesha | Gharama kwa kila mchakato |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | saa 3 hadi 6 | kama 4 hadi 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | saa 2 hadi 5 | kama 1 hadi 3 USD |
Kile ambacho haifanyi: kufanya data mbaya kuwa nzuri, kumpa GR00T mbegu ambayo hajawahi kuwa nayo, au kuondoa kikomo cha kuchelewa kilichoelezwa hapa chini. Inaondoa ununuzi wa GPU, ujenzi wa mazingira na pod uliyosahau kuiharibu. Taratibu ziko kwenye nyaraka za mafunzo.
Jinsi jukwaa linavyotoza na jinsi linavyochagua kadi
Mantiki imekusudiwa kuwa rahisi. Kila modeli katika orodha inatangaza kiwango cha GPU; mfumo wa nyuma huchukua VRAM inayohitajika na kukodisha kadi inayolingana kwenye soko lile lile la papo hapo lililopimwa hapo juu. Ndiyo maana gharama iliyonukuliwa ni safu, si bei. GR00T na Pi0.5 zinapatikana kwenye wingu pekee hapa kwa sababu ya viwango vya chini vya 40 GB na 70 GB. SmolVLA na ACT pia huendeshwa ndani ya nchi kwenye kadi yako mwenyewe ya 24 GB, ambapo gharama ya wingu ni sifuri na umeme ni tatizo lako.

Kipengele kimoja kinahitaji onyo. Mkusanyiko wa gradient unatumika kikweli kwa aina zote mbili za GR00T, kwa hivyo kuongeza huku kunanunua kundi kubwa zaidi la ufanisi kwenye kadi ile ile. Kwa Pi0.5 na SmolVLA haitumiki kabisa: lerobot 0.5.1 haina chaguo la mkusanyiko wa gradient katika usanidi wake wa mafunzo, kwa hivyo kuweka uga kuwa 16 hakugharimu chochote na hakununui chochote. Ikiwa kazi iliyopangwa haianzi kamwe, ukurasa wa kazi iliyokwama kwenye foleni inashughulikia nini cha kuangalia; ikiwa seti ya data inakataliwa kabla ya uendeshaji kuanza, karibu kila mara ni tatizo la umbizo la v3.0.
GPU ya kukodi inayohudumia sera yako kupitia intaneti ya umma huongeza safari za kwenda na kurudi kwenye kitanzi cha udhibiti ambacho tayari kina 20 hadi 485 ms kwa kila hatua ya kitendo. Inafaa kwa kazi za polepole za kuchukua na kuweka, si kwa mwendo wa haraka wa kuitikia. Utabiri wa wingu hutathmini sehemu ya kukagua vizuri na huendesha udanganyifu wa uzalishaji vibaya: ikiwa kazi inahitaji kasi, kompyuta inapaswa kukaa karibu na servomotor, na hiyo ni gharama ambayo makala haya hayawezi kuifanya kutoweka. Tazama kuchelewa kwa utabiri.
Bajeti iliyofanyiwa kazi kwa sera ya kwanza inayofanya kazi
Mistari yote minne pamoja, kuanzia mwanzo. Jumla ya GPU inachukua mizunguko 3 hadi 5: wa kwanza unathibitisha kuwa bomba linafanya kazi, wa pili unafunua tatizo la data, wa tatu au wa nne ndio unaohifadhi.
| Mstari | Njia nyepesi | Njia rahisi |
|---|---|---|
| Mkono | SO-100 mfuasi pekee, 121.94 USD katika BOM | kiongozi pamoja na mfuasi, 229.88 USD katika BOM |
| Mfumo | SmolVLA au ACT, kiwango cha 24 GB | GR00T N1.7, A100 80 GB au kiwango cha H100 |
| Vipindi vilivyorekodiwa | 30, kiwango cha chini cha SmolVLA | 50 hadi 100 |
| Muda wa binadamu wa kurekodi | kama saa 1 na dakika 12 | Saa 2 hadi 4 |
| Gharama ya mzunguko mmoja | 1 hadi 3 USD | 4 hadi 12 USD |
| Mizunguko kabla haijafanya kazi | 3 hadi 5 | 3 hadi 5 |
| Jumla ya matumizi ya GPU | 3 hadi 15 USD | 12 hadi 60 USD |
| Mstari mkubwa zaidi kwenye bili | mkono, kisha muda wako | mkono, kisha muda wako |
Mfumo huu unatumika kwa ukubwa huu wa roboti: hesabu ni makosa madogo, maunzi ni gharama halisi ya mara moja, saa za binadamu ndio gharama inayojirudia. Ili kujaribu nusu ya mafunzo kabla ya kununua chochote, hukuruhusu kulinganisha mifumo na kukodisha GPU bila mkono, na ni SO-100 halisi unayoweza kuendesha kwenye kivinjari bila kujisajili. Kwa mchakato mzima kuanzia mwanzo hadi mwisho, inashughulikia usanidi, na mafunzo, na ni toleo fupi.

Gharama ya mara moja ya VLA fine-tuning ni kiasi gani kuanzia mwanzo hadi mwisho?▾
Kama 4 hadi 12 USD kwa GR00T N1.7, GR00T N1.5 au Pi0.5 kwenye kiwango cha A100 80 GB au H100 (saa 3 hadi 6 kwa 1.20 hadi 2.00 USD kwa saa), na kama 1 hadi 3 USD kwa SmolVLA au ACT kwenye kiwango cha RTX 4090 (saa 2 hadi 5 kwa 0.30 hadi 0.60 USD kwa saa). Kukodisha kadi mwenyewe kunaingia katika kiwango hicho hicho mara tu muda wa usanidi unapohesabiwa, kwani inatozwa kwa kiwango cha mafunzo.
Je, H100 inafaa kulipiwa zaidi ya A100 80 GB?▾
Kwa sera moja ya SO-100, kwa kawaida hapana. Zote mbili zinakidhi mahitaji ya kumbukumbu ya GR00T na Pi0.5, na katika usomaji wa Agosti 23, 2026, A100 80 GB kamili ilianza kwa 0.44 USD kwa saa dhidi ya 1.34 kwa H100 80 GB. H100 humaliza haraka, kwa hivyo sehemu ya kiwango hurudi kama saa chache, lakini jumla bado ni kubwa zaidi kwa mchakato mdogo kama huu. Hoja halisi ya H100 ni upatikanaji: ofa tano za H100 80 GB moja kwenye soko hilo dhidi ya A100 80 GB mbili, na kadi ambayo huwezi kukodisha haina bei.
Inachukua mara ngapi kabla sera haijaanza kufanya kazi?▾
Panga kwa tatu hadi tano. Ya kwanza inathibitisha kuwa mchakato umeunganishwa kwa usahihi. Ya pili kwa kawaida hufichua tatizo la data kama vile mtiririko wa kamera uliokufa katikati. Ya tatu au ya nne ndiyo unayohifadhi.
Je, ninaweza kufunza SmolVLA au ACT kwenye GPU yangu mwenyewe badala ya kukodisha?▾
Ndio. Zote mbili zinaungwa mkono ndani ya nchi kwenye AY-Robots na zote zinafaa vizuri katika 24 GB; karatasi asili ya ACT ilifunza modeli yake ya 80M kwa takriban saa 5 kwenye 11 GB RTX 2080 Ti. GR00T na Pi0.5 zinapatikana kwenye wingu pekee hapa kwa sababu viwango vya chini vya fine-tuning vilivyorekodiwa na wachuuzi ni 40 GB na 70 GB, na kadi kubwa zaidi ya watumiaji sokoni ni 32 GB RTX 5090.
Kwa nini idadi sawa ya hatua inagharimu kiasi tofauti kati ya mifumo?▾
Hatua haziwezi kulinganishwa kati ya sera. ACT inatumia hatua 100,000 kwa batch 8 kwenye kadi ya 24 GB; GR00T N1.5 inatumia hatua 2,000 kwa batch 1 na gradient accumulation 16 kwenye kadi ya 80 GB. Bili ni saa zilizozidishwa na kiwango cha kadi ambayo mahitaji ya kumbukumbu yanakulazimisha kutumia, sio kaunta ya hatua.
Angalia gharama ya mchakato wako kabla ya kuanza
Kila moja ya sera tano inaorodhesha kiwango chake cha GPU, muda wa kuendesha na bei kwa kila mchakato, na mfumo wa mafunzo hukodisha kadi kwenye soko lile lile ambapo namba hizi zilipimwa.
Angalia beiSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started