
Giá GPU thị trường giao ngay thực tế, thời gian chạy của từng trong năm chính sách, chi phí của cánh tay robot và các bản trình diễn, và bốn nơi tiền âm thầm biến mất.
Phiên bản tóm tắt
- •Một lần chạy trên tầng A100 80 GB hoặc H100 mất 3 đến 6 giờ và tốn khoảng 4 đến 12 USD. Trên tầng RTX 4090, mất 2 đến 5 giờ và khoảng 1 đến 3 USD.
- •Đo trên vast.ai lúc 13:44 UTC ngày 23 tháng 8 năm 2026: một RTX 4090 đầy đủ theo yêu cầu với giá 0.13 đến 0.38 USD/giờ, một A100 80 GB với giá 0.44 đến 0.67, một H100 80 GB với giá 1.34 đến 2.34. Các card 80 GB đầy đủ rất khan hiếm, lần lượt có hai và năm ưu đãi card đơn.
- •GPU là hạng mục rẻ nhất. Danh mục vật liệu của SO-ARM100 định giá một cặp leader cộng follower là 229.88 USD, tương đương 77 đến 230 lần chạy trên tầng 24 GB.
- •Hai giờ một người ghi lại 50 tập phim tốn kém hơn chi phí chạy huấn luyện mà các tập phim đó cung cấp.
- •Tiền biến mất ở bốn nơi: chạy trên dữ liệu hỏng, mô hình 3B cho các tác vụ mà chính sách 80M xử lý, GPU không ai phá hủy, và chạy lại một kết quả mà bạn không giữ được.
- •AY-Robots định cỡ card theo VRAM mà mô hình cần và thuê nó trên cùng thị trường giao ngay, vì vậy chi phí chạy là chi phí thị trường.
Hóa đơn có bốn hạng mục, và GPU là hạng mục nhỏ nhất
Khi mọi người hỏi chi phí để tinh chỉnh một mô hình hành động-ngôn ngữ-thị giác cho một SO-100, họ gần như luôn đề cập đến chi phí thuê GPU. Đó là con số xuất hiện dưới dạng phí trên thẻ, vì vậy nó là con số cảm thấy thực tế nhất. Nó cũng là, với một biên độ rộng, con số nhỏ nhất trong bốn con số quyết định chi phí thực sự của một chính sách hoạt động thực sự tốn của bạn bao nhiêu.
| Hạng mục | Nó là gì | Kích thước điển hình cho một chính sách hoạt động |
|---|---|---|
| GPU time | thuê một card cho lần chạy | 1 đến 12 USD mỗi lần chạy, và bạn sẽ thực hiện 3 đến 5 lần |
| The robot | servo, khung in, camera, cáp, nguồn điện | một lần, 110 đến 500 EUR mỗi cánh tay |
| Human hours | một người điều khiển cánh tay để ghi lại các bản demo | 1 đến 4 giờ mỗi tập dữ liệu, lặp lại cho mỗi tác vụ |
| Waste | dữ liệu xấu, mô hình quá khổ, pod bị lãng quên | không giới hạn, và là hạng mục duy nhất bạn kiểm soát |
Thời gian huấn luyện dưới đây lấy từ các bài báo và kho lưu trữ của năm mô hình, chi phí phần cứng từ danh sách vật liệu đã công bố, số liệu nền tảng từ AY-Robots danh mục chính sách và trang giá. Trong trường hợp nền tảng không hỗ trợ, bài viết này sẽ nêu rõ.
Chi phí thực tế của một giờ GPU trên thị trường giao ngay
Không có một mức giá duy nhất cho một giờ A100. Trên một thị trường như vast.ai, mỗi nhà cung cấp đặt ra mức giá riêng, và lần chạy huấn luyện bạn khởi chạy sẽ được thực hiện trên bất kỳ máy nào rẻ và trống vào thời điểm đó. Câu trả lời trung thực là một phân phối. Dưới đây là số liệu, được đo vào ngày 23 tháng 8 năm 2026 lúc 13:44 UTC: các card đầy đủ, theo yêu cầu, được lọc theo VRAM thực tế.
| Card | vast.ai theo yêu cầu USD/h (thấp / trung bình / cao) | Ưu đãi card đầy đủ | Giá sàn vast.ai | RunPod Cộng đồng / Bảo mật | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | not offered |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | not offered |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | not offered |
Các ưu đãi theo yêu cầu cho một GPU đầy đủ duy nhất (gpu_frac == 1.0) từ API gói công khai vast.ai, không cần tài khoản, được lọc theo gpu_ram để chỉ các thẻ 80 GB chính hãng xuất hiện trong các hàng 80 GB. Bộ lọc đó rất quan trọng: trong lần đọc này, tất cả ba ưu đãi A100 SXM4 một thẻ đều là loại 40 GB, cũng như hai trong số bốn ưu đãi A100 PCIE, vì vậy việc gộp chúng vào một hàng "A100" sẽ làm giảm một nửa giá được báo cáo ở đây. Cột Hugging Face kết hợp hai sản phẩm: 2.50 USD/h là phần cứng Spaces Nvidia A100 - large và 4.50 USD/h là một H100 80 GB duy nhất trong Inference Endpoints, mà Spaces không cung cấp. Coi các giá trị trung vị là chỉ số: hàng A100 80 GB dựa trên hai ưu đãi và hàng H100 dựa trên năm ưu đãi, và truy vấn tương tự 36 giây sau đó đã trả về số lượng 4090 khác và giá cao nhất khác trên ba trong số năm hàng. Giá niêm yết của RunPod là con số ổn định hơn để lập kế hoạch.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Tại sao các mô hình 3B không thể sử dụng thẻ giá rẻ
Một giờ 4090 và một giờ H100 80 GB khác nhau khoảng sáu lần ở các giá trị trung vị trên. Điều buộc bạn phải sử dụng thẻ đắt tiền không phải là tốc độ, mà là bộ nhớ. openpi đặt mức tối thiểu cho một Pi0.5 đầy đủ tinh chỉnh ở mức 70 GB, và NVIDIA khuyến nghị 40 GB trở lên cho GR00T. Lưu ý những gì con số GR00T không phải là. Cấu hình tinh chỉnh của nó đóng băng mô hình ngôn ngữ và bộ mã hóa hình ảnh theo mặc định (tune_llm và tune_visual là False, bộ chiếu và đầu khuếch tán là True), đó là lý do tại sao danh mục liệt kê khoảng 40 triệu tham số được huấn luyện trong số 3 tỷ. 40 GB không phải là trạng thái bộ tối ưu hóa cho 3 tỷ trọng số, mà là xương sống đóng băng cộng với các kích hoạt. Các biến thể giảm phạm vi yêu cầu thấp hơn: đường dẫn LoRA của openpi yêu cầu 22.5 GB và đề cập đến 4090, và quy trình làm việc Isaac Lab Arena của NVIDIA liệt kê tùy chọn một GPU 24 GB cho GR00T sau huấn luyện. Nền tảng phân cấp dựa trên mức tối thiểu mà mỗi nhà cung cấp công bố cho cấu hình mà nó thực sự chạy. Bài viết về khớp nối dòng chảy pi0 giải thích nguồn gốc của khớp nối dòng chảy dấu chân đến từ đâu.
| Công việc | Bộ nhớ dự án thượng nguồn yêu cầu | Nguồn |
|---|---|---|
| Suy luận pi0 / pi0.5 | hơn 8 GB, ví dụ RTX 4090 | openpi |
| Tinh chỉnh LoRA pi0 / pi0.5 | hơn 22.5 GB, ví dụ RTX 4090 | openpi |
| Tinh chỉnh đầy đủ pi0 / pi0.5 | hơn 70 GB, ví dụ A100 80 GB hoặc H100 | openpi |
| Suy luận GR00T N1.7 | 1 GPU với 16 GB trở lên | Isaac-GR00T |
| Tinh chỉnh GR00T N1.7 | khuyến nghị 40 GB trở lên, các node H100 hoặc L40 | Isaac-GR00T |
| GR00T tinh chỉnh, những gì nó huấn luyện | bộ chiếu và đầu khuếch tán; LLM và bộ mã hóa hình ảnh bị đóng băng theo mặc định | finetune_config.py |
| GR00T sau huấn luyện, giảm | 1 GPU với 24 GB, mô hình ngôn ngữ bị đóng băng | Isaac Lab Arena |
| Tinh chỉnh SmolVLA | một A100 duy nhất cho lần chạy tham chiếu 20.000 bước | lerobot docs |
| Huấn luyện ACT | một RTX 2080 Ti 11 GB duy nhất | ACT paper |
Bảng đó là lý do tại sao nền tảng chia năm mô hình thành hai cấp. GR00T N1.7, GR00T N1.5 và Pi0.5 chạy trên A100 80 GB hoặc H100 vì đó là những gì các nhà cung cấp yêu cầu. SmolVLA và ACT chạy trên RTX 4090 hoặc bất kỳ thẻ 24 GB nào vì điều đó thực sự là đủ.
Một lần chạy GR00T hoặc Pi0.5 trên thẻ 24 GB không thất bại ngay từ giây đầu tiên. Nó tải xuống điểm kiểm tra cơ sở, xây dựng chỉ mục tập dữ liệu, bắt đầu lần truyền tiến đầu tiên và chết sau vài trăm bước với lỗi CUDA hết bộ nhớ. Bạn đã trả tiền cho việc tải xuống và thiết lập nhưng không nhận được gì. Các bản sửa lỗi: hết bộ nhớ trong quá trình huấn luyện.
Thời gian chạy thực tế của từng trong năm mô hình
Thời gian chạy là một nửa còn lại của chi phí: 2.00 USD mỗi giờ là không đáng kể nếu công việc chỉ 40 phút và sẽ rất tốn kém nếu kéo dài 40 giờ. Đây là các cài đặt mặc định mà AY-Robots thực sự gửi đến trình huấn luyện, cùng với khoảng thời gian chạy và chi phí cho mỗi cấp.
| Chính sách | Cấp GPU | Số bước tối đa mặc định | Kích thước lô mặc định (tích lũy gradient) | Khoảng thời gian chạy | Chi phí mỗi lần chạy |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, tích lũy 1, áp dụng | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, tích lũy 16, áp dụng | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, tích lũy 16, không ảnh hưởng | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, tích lũy 8, không ảnh hưởng | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, tích lũy 1 | 2 to 5 h | 1 to 3 USD |

Nguồn gốc của các khoảng thời gian chạy đó từ phía trước
- SmolVLA: tài liệu của lerobot cho biết 20.000 bước mất khoảng 4 giờ trên một A100 duy nhất. Nền tảng chạy cùng 20.000 bước trên gói 24 GB rẻ hơn, do đó có một khoảng thời gian thay vì cố định 4 giờ.
- ACT: bài báo ALOHA gốc báo cáo khoảng 5 giờ trên một RTX 2080 Ti 11 GB duy nhất cho một mô hình 80M tham số. Một 4090 mới hơn vài thế hệ nhưng nền tảng dự trù 100.000 bước, vì vậy khoảng thời gian vẫn tương tự.
- GR00T: quy trình làm việc tham chiếu của NVIDIA cho thế hệ N1.6 ước tính khoảng 4 đến 8 giờ cho 20.000 bước với batch 24 trên tám card L40S, và 2 đến 3 giờ cho 30.000 bước với batch 16 trên một Ada 6000 duy nhất. Việc tinh chỉnh một VLA 3B bằng một card duy nhất trong vài giờ là bình thường, không phải lạc quan.
- Pi0.5: openpi không công bố số liệu thời gian thực, nhưng họ công bố mức sàn 70 GB cho một lần tinh chỉnh hoàn chỉnh, điều này xác định loại card và do đó là tốc độ.
Đáng để dừng lại ở con số mà bạn không phải trả. Bài báo GR00T N1 báo cáo khoảng 50.000 giờ GPU H100 để huấn luyện trước mô hình 2.2B, trên một cụm lên đến 1024 GPU, với kích thước batch huấn luyện trước là 16.384 cho 200.000 bước gradient. Với mức giá 1.34 đến 2.34 USD mỗi giờ được đo ở trên, chi phí thuê điện toán là khoảng 67.000 đến 117.000 USD. Bài báo SmolVLA ước tính dự án của họ tiêu tốn khoảng 30.000 giờ GPU trên 481 bộ dữ liệu cộng đồng, 22.9K tập và 10.6M khung hình. Bạn thừa hưởng tất cả những điều đó với giá của một lượt tải xuống; 8 USD của bạn mua 20.000 bước cuối cùng. Tại sao VLA được xây dựng theo cách này đề cập đến sự phân chia đó.
Cánh tay robot: chi phí một lần làm lu mờ hóa đơn GPU
Một lần chạy huấn luyện tốn ít hơn một bữa trưa. Robot thì không. Đó là lý do tại sao SO-100 quan trọng: nó là cánh tay rẻ nhất mà toàn bộ học bắt chước chuỗi công cụ thực sự hỗ trợ.
| Cánh tay robot | Động cơ servo | Điện áp | Chi phí linh kiện | Hỗ trợ trên AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | đầy đủ, cánh tay tham chiếu |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | đầy đủ |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | tương thích |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | tương thích |
Danh sách vật tư (BOM) gốc trong kho lưu trữ SO-ARM100 chi tiết hơn và đáng để kiểm tra theo khu vực của bạn: danh sách Linh kiện cho hai cánh tay tổng cộng 229.88 USD hoặc 226.30 EUR cho một thiết lập leader và follower, và danh sách Linh kiện cho một cánh tay follower tổng cộng 121.94 USD hoặc 124.30 EUR. Sáu động cơ servo STS3215 với giá 13.89 USD mỗi chiếc là 83.34 trong số 121.94 đó, vậy động cơ servo chính là cánh tay robot. Với 1 đến 3 USD cho mỗi lần chạy SmolVLA hoặc ACT, một cặp cánh tay có giá trị tương đương từ 77 đến 230 lần chạy huấn luyện. Nếu bạn vẫn đang lựa chọn, SO-100 so với SO-101 là sự so sánh quan trọng, bởi vì hai loại này đủ gần nhau để quyết định dựa trên tính khả dụng hơn là khả năng.
STS3215 có hai biến thể 7.4 V và 12 V; kho lưu trữ lưu ý rằng linh kiện 12 V cũng cần nguồn cấp 12 V 5 A thay vì nguồn 5 V, vì vậy hai loại này không thể thay thế cho nhau. Cấp 12 V vào động cơ servo 7.4 V sẽ làm hỏng chúng, và sáu động cơ servo chiếm hai phần ba chi phí linh kiện của một cánh tay follower. Kiểm tra nhãn trên mỗi động cơ servo trước khi cấp nguồn lần đầu. Nếu động cơ servo đã hoạt động bất thường: servo không phản hồi, cánh tay giật rồi xệ xuống.
Giờ công của con người: dòng không ai đưa vào bảng tính
Đây là con số làm đảo lộn cuộc thảo luận về chi phí. Ghi lại các bản trình diễn là một người di chuyển cánh tay robot, từng tập một, trong thời gian thực. Không có việc xử lý theo lô hay thuê theo giây. Trình ghi của tập dữ liệu LeRobot đi kèm với các giá trị mặc định giúp việc tính toán dễ dàng, cả ba đều được xác nhận trong DatasetRecordConfig: 60 giây mỗi tập, 60 giây để đặt lại cảnh, 50 tập. Cột tiền dưới đây giả định 15 USD cho một giờ làm việc của một người, đây là một giả định chứ không phải con số của nền tảng. Hãy thay thế bằng mức giá của riêng bạn; tỷ lệ mới là điều quan trọng.
- 1Ghi lại tập dữ liệu với các giá trị mặc định mà bạn sẽ thực sự phải trả tiền
Đây là lerobot 0.6.1, phiên bản trên PyPI tính đến ngày 3 tháng 8 năm 2026. Lưu ý hình dạng CLI: việc ghi chạy qua điểm vào console
lerobot-record(lerobot.scripts.lerobot_record), chứ không phải đường dẫn module cũpython -m lerobot.scripts.record. AY-Robots nhắm mục tiêu 0.5.1, và wheel 0.5.1 khai báo cùng các điểm vàolerobot-recordvàlerobot-train, vì vậy hình dạng dưới đây ổn định trên cả hai. Ba cờ thời gian là các giá trị mặc định của upstream, vì vậy đây cũng là lệnh mà phép tính trong bảng tiếp theo giả định.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Xem những gì bạn đã ghi trước khi thuê một phút GPU nào
Kiểm tra một tập dữ liệu không tốn đồng nào mỗi giờ. Phát hiện cùng một vấn đề từ đường cong mất mát tốn 2.00 USD mỗi giờ trên cấp H100 và cho bạn biết muộn bốn giờ. Đẩy tập dữ liệu và xem xét nó trong trình xem LeRobot, hoặc duyệt thư mục tập dữ liệu của AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Huấn luyện, và đảm bảo điểm kiểm tra tồn tại lâu hơn pod
Một máy thuê theo định nghĩa là tạm thời, vì vậy hãy ghi các điểm kiểm tra vào một nơi bền vững trong quá trình chạy. Hai cờ quyết định liệu bạn có giữ được những gì bạn đã trả tiền hay không.
--save_freqmặc định là 20.000 bước, vì vậy một lần chạy SmolVLA mặc định 20.000 bước sẽ ghi điểm kiểm tra đầu tiên khi quá trình chạy đã kết thúc; hãy giảm nó trước khi bạn thuê bất kỳ thứ gì có thể bị gián đoạn.--save_checkpoint_to_hubyêu cầu--policy.repo_idvà không tồn tại trong lerobot 0.5.1, vì vậy trên phiên bản đó, bạn tự sao chép thư mục đầu ra ra khỏi máy. Kích thước lô dưới đây là ví dụ của tài liệu upstream; biểu mẫu AY-Robots gửi 2 cho SmolVLA và ghi vào bộ lưu trữ đối tượng khi các điểm kiểm tra xuất hiện.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Số tập | Ghi hình ở 60 giây | Đặt lại ở 60 giây | Tổng thời gian | Cộng thêm 20 phần trăm ghi lại | Với 15 USD mỗi giờ công |
|---|---|---|---|---|---|
| 30, tối thiểu của SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, bốn mức tối thiểu khác | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, một tập dữ liệu thoải mái | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
So sánh cột bên phải với chi phí chạy từ 1 đến 12 USD. Với mức giá giả định đó, một tập dữ liệu gồm 50 tập có chi phí ghi lại gấp hai đến bảy lần so với chi phí đào tạo, chưa kể hiệu chuẩn, thiết lập camera và các tập bạn bỏ đi. Đó là lý do tại sao có giá trị tiền tệ trực tiếp. Hướng dẫn của lerobot đề xuất ít nhất 50 tập với 10 tập cho mỗi vị trí đối tượng; tài liệu SmolVLA báo cáo rằng phiên bản 25 tập của cùng một nhiệm vụ là không đủ.
Tiền thực sự biến mất ở đâu
1. Chạy trên dữ liệu không bao giờ hoạt động được
Một lần chạy GR00T 20.000 bước trên một tập dữ liệu với hai luồng camera bị hoán đổi có chi phí tương đương với một lần chạy trên tập dữ liệu sạch, mất cùng thời gian và tạo ra một đường cong mất mát trông ổn. Lỗi xuất hiện trên cánh tay robot, vài giờ sau đó. được tính phí theo giờ và chẩn đoán được tính phí theo ngày. Hai triệu chứng đáng ghi nhớ: thường có nghĩa là các quan sát không mang thông tin mà nhiệm vụ cần, và có nghĩa là tập dữ liệu có ít biến thể hơn bạn nghĩ.
2. Trả giá mô hình nền tảng cho một tác vụ camera cố định
ACT có khoảng 80 triệu tham số và được thiết kế để huấn luyện từ đầu với 50 lần trình diễn một tác vụ. GR00T N1.7 có khoảng 3 tỷ tham số với một backbone đã được huấn luyện trước. Đối với một camera cố định, một bàn cố định và một vật thể, mô hình 80 triệu tham số thường đạt được mục tiêu, chạy khoảng 20 ms mỗi bước hành động thay vì 152 ms, và tốn 1 đến 3 USD mỗi lần chạy thay vì 4 đến 12. Hãy chi 3 USD để tìm hiểu xem mô hình rẻ hơn có hoạt động không trước khi chi 12 USD cho mô hình đắt tiền hơn. ACT so với SmolVLA và GR00T N1.7 so với Pi0.5 cho thấy khi nào mỗi mô hình không còn là lựa chọn đúng; đấu trường mô hình có 85 mô hình và 332 kết quả benchmark.
3. GPU bạn đã quên
Lỗi rẻ nhất để ngăn chặn và phổ biến nhất để mắc phải. Một phiên bản được khởi động vào thứ Sáu để gỡ lỗi sẽ bị tính phí suốt cuối tuần với cùng mức giá như một lần chạy thực tế.
| Card | Tỷ lệ trung bình trong ảnh chụp nhanh | Không hoạt động trong 24 giờ | Không hoạt động trong 7 ngày | Giá trị tương đương |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | khoảng 27 lượt chạy SmolVLA hoặc ACT với giá 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | khoảng 12 lượt chạy GR00T với giá 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | khoảng 38 lượt chạy GR00T với giá 8 USD |
Trên AY-Robots, lỗi này đã được loại bỏ trong suy luận: các pod được cung cấp bởi API suy luận mang một bộ giám sát không hoạt động và tự hủy sau một khoảng thời gian không hoạt động. Nếu bạn tự thuê card, bộ giám sát đó chính là lời nhắc trên lịch của bạn.
4. Trả tiền hai lần cho cùng một câu trả lời
Điểm vào để tinh chỉnh của GR00T là một CLI tyro không để lộ seed. Đó không phải là giới hạn của nền tảng, mà là công cụ upstream: không có trường seed trong gr00t/configs/finetune_config.py, và các mẹo huấn luyện của kho lưu trữ cảnh báo rằng các lượt chạy có thể khác nhau từ 5 đến 6 phần trăm vì các phép tăng cường hình ảnh không xác định. lerobot mặc định sử dụng seed 1000 trong cả 0.5.1 và 0.6.1, vì vậy các lượt chạy ACT, SmolVLA và Pi0.5 ít nhất có thể được chạy lại từ cùng một khởi tạo và thứ tự dữ liệu. Đó không phải là lời hứa về các trọng số giống hệt từng bit trên GPU, nhưng đó là sự khác biệt giữa việc chạy lại và một thử nghiệm mới. Nếu một lượt chạy GR00T tạo ra một chính sách hoạt động và bạn không giữ điểm kiểm tra, bạn phải trả toàn bộ chi phí cho một kết quả có thể khác biệt nhiều hơn so với sự khác biệt bạn đang tìm kiếm. Có một cách thứ hai để mất một điểm kiểm tra mà bạn đã trả tiền: CLI mặc định là --save-total-limit 5, được ghi lại là số lượng điểm kiểm tra tối đa được giữ trước khi các điểm cũ hơn bị xóa. Lưu trữ chỉ tốn vài xu; một lượt chạy lại tốn 4 đến 12 USD và sáu giờ.
Mức giá sàn trên chỉ là một phần nhỏ của giá theo yêu cầu, và vast.ai cho biết hệ thống đấu giá có thể giảm chi phí cho khách hàng từ năm mươi phần trăm trở lên. Điểm bất lợi, theo lời của họ: một phiên bản có thể bị gián đoạn có thể bị tạm dừng bất cứ lúc nào nếu người dùng khác trả giá cao hơn hoặc một thuê bao theo yêu cầu được tạo cho cùng tài nguyên, và việc tạm dừng đó "dừng tất cả các tiến trình đang chạy". Theo yêu cầu luôn được ưu tiên. Điều này tốt cho một lần chạy ghi điểm kiểm tra sau mỗi vài trăm bước, nhưng lại là tổn thất hoàn toàn cho một lần chạy chỉ ghi ở cuối, và đó chính xác là những gì cài đặt mặc định cung cấp cho bạn: Isaac-GR00T CLI ghi sau mỗi --save-steps (mặc định 1000), nhưng --save_freq của lerobot mặc định là 20.000 bước, vì vậy một lần chạy SmolVLA mặc định chỉ ghi điểm kiểm tra một lần, ở vạch đích. Hãy giảm nó xuống, hoặc đừng đấu giá. Biểu mẫu đào tạo AY-Robots hiển thị tùy chọn GR00T dưới dạng saveSteps.
- Mức giá theo giờ thấp nhất hiện có.
- Kiểm soát hoàn toàn hình ảnh, phiên bản CUDA, lerobot hoặc Isaac-GR00T và mọi cờ.
- Đấu giá gián đoạn giảm một nửa tỷ lệ nếu quá trình chạy của bạn ghi điểm kiểm tra đủ thường xuyên để sống sót qua một lần tạm dừng.
- Không có gì bị trừu tượng hóa, vì vậy khi một lần chạy hoạt động bất thường, bạn có thể thấy lý do tại sao.
- Thiết lập được tính phí theo giá GPU: trình điều khiển, các phụ thuộc, điểm kiểm tra cơ sở nhiều gigabyte và việc tải xuống tập dữ liệu đều có chi phí mỗi giờ giống như đào tạo.
- Một phiên bản có thể bị gián đoạn bị trả giá cao hơn sẽ bị tạm dừng và các tiến trình của nó bị hủy. Một lần chạy chưa được lưu là tiền bị đốt cháy, và mặc định của lerobot ghi điểm kiểm tra đầu tiên ở bước 20.000.
- Không có gì tự động hủy pod cho bạn. Bảng thời gian nhàn rỗi ở trên là hóa đơn cho việc quên tắt.
- Nguồn cung cho các card 80 GB đầy đủ là khan hiếm: hai A100 80 GB và năm H100 80 GB được cung cấp đầy đủ trong lần đọc này. Danh sách cũng thay đổi liên tục, vì vậy giá niêm yết rẻ nhất và giá bạn thực sự có thể thuê không phải là cùng một con số.
- Mỗi giờ trên cơ sở hạ tầng là một giờ không được dành để ghi lại các tập quyết định xem chính sách có hoạt động hay không.
Tự làm so với để nền tảng thuê card
Bạn chọn máy, xây dựng môi trường và hủy pod. Mức giá theo giờ là giá thị trường như trên; mọi thứ khác là thời gian của bạn.
- Tìm một card phù hợp với VRAM mà mô hình cần: 24 GB cho ACT và SmolVLA, 80 GB cho GR00T và Pi0.5.
- Thuê theo yêu cầu nếu quá trình chạy không thể chịu được việc tạm dừng, có thể bị gián đoạn nếu nó thường xuyên tạo checkpoint.
- Cài đặt bộ công cụ: lerobot cho ACT, SmolVLA và Pi0.5, kho lưu trữ Isaac-GR00T với trình khởi chạy tyro riêng cho GR00T.
- Chuyển đổi tập dữ liệu nếu cần. Một tập dữ liệu LeRobot v3.0 làm sập bộ tải GR00T và phải được chuyển đổi xuống v2.1.
- Khởi chạy, theo dõi độ mất mát (loss), đẩy các checkpoint đến một nơi lưu trữ bền vững khi chúng được ghi.
- Hủy phiên bản, sau đó kiểm tra xem bạn đã hủy nó chưa.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Chi phí thực tế cho một lần chạy GR00T: 3 đến 6 giờ trên H100 80 GB với giá 1.34 đến 2.34 USD mỗi giờ là 4 đến 14 USD, cộng thêm 20 đến 40 phút thiết lập cũng tính phí, cộng với thời gian của riêng bạn.
Bạn chọn mô hình, tập dữ liệu và các siêu tham số trong một biểu mẫu. Backend thuê một GPU spot có kích thước theo VRAM mà mô hình cần, chạy trình huấn luyện và ghi các checkpoint vào bộ lưu trữ đối tượng.
- Chọn sự kết hợp của bạn trên ma trận huấn luyện: năm mô hình, bốn cánh tay, một hướng dẫn cho mỗi ô.
- Chỉ định nó vào một tập dữ liệu: một tập được ghi bằng ứng dụng khách máy tính để bàn, một ID kho lưu trữ Hugging Face, hoặc một tập từ máy của riêng bạn.
- Chấp nhận các giá trị mặc định hoặc điều chỉnh chúng. Bảng trên là những gì thực sự được gửi đến trình huấn luyện.
- Backend chọn card theo VRAM yêu cầu, vì vậy bạn không bao giờ phải tìm kiếm GPU.
- Các checkpoint được lưu vào bộ lưu trữ đối tượng khi chúng được ghi, vì vậy một lần chạy bị gián đoạn không phải là một lần chạy bị mất.
| Cấp | Mô hình | Thời gian chạy | Chi phí mỗi lần chạy |
|---|---|---|---|
| A100 80 GB hoặc H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 đến 6 giờ | khoảng 4 đến 12 USD |
| RTX 4090 hoặc bất kỳ card 24 GB nào | SmolVLA, ACT | 2 đến 5 giờ | khoảng 1 đến 3 USD |
Những gì nó không làm: biến một tập dữ liệu xấu thành tốt, cung cấp cho GR00T một seed mà nó chưa từng có, hoặc loại bỏ giới hạn độ trễ được mô tả bên dưới. Nó loại bỏ việc tìm kiếm GPU, xây dựng môi trường và pod mà bạn quên hủy. Cơ chế hoạt động nằm trong tài liệu huấn luyện.
Nền tảng tính phí như thế nào và cách nó chọn thẻ
Logic được thiết kế đơn giản. Mọi mô hình trong danh mục khai báo một cấp GPU; hệ thống phụ trợ lấy VRAM cần thiết và thuê một thẻ phù hợp trên cùng thị trường giao ngay được đo lường ở trên. Đó là lý do tại sao chi phí được báo giá là một khoảng, không phải một mức giá cố định. GR00T và Pi0.5 chỉ chạy trên đám mây ở đây vì yêu cầu tối thiểu 40 GB và 70 GB. SmolVLA và ACT cũng chạy cục bộ trên thẻ 24 GB của riêng bạn, nơi chi phí đám mây bằng 0 và điện là vấn đề của bạn.

Một tùy chỉnh cần được cảnh báo. Tích lũy gradient thực sự áp dụng cho cả hai biến thể GR00T, vì vậy việc tăng nó sẽ mua một lô hiệu quả lớn hơn trên cùng một thẻ. Đối với Pi0.5 và SmolVLA, nó hoàn toàn không áp dụng: lerobot 0.5.1 không có tùy chọn tích lũy gradient trong cấu hình huấn luyện của nó, vì vậy việc đặt trường này thành 16 không tốn kém gì và không mang lại lợi ích gì. Nếu một công việc đang chờ không bao giờ bắt đầu, trang về công việc bị kẹt trong hàng đợi bao gồm những gì cần kiểm tra; nếu tập dữ liệu bị từ chối trước khi chạy bắt đầu, thì hầu như luôn là vấn đề định dạng v3.0.
Một GPU thuê phục vụ chính sách của bạn qua internet công cộng sẽ thêm các chuyến đi khứ hồi vào một vòng điều khiển vốn đã có độ trễ từ 20 đến 485 ms cho mỗi bước hành động. Tốt cho các tác vụ chọn và đặt chậm, nhưng không phù hợp cho chuyển động phản ứng nhanh. Suy luận trên đám mây đánh giá một điểm kiểm tra tốt nhưng thực hiện thao tác sản xuất kém: nếu tác vụ cần tốc độ, bộ xử lý phải đặt cạnh các servo, và đó là một chi phí mà bài viết này không thể làm biến mất. Xem độ trễ suy luận.
Ngân sách chi tiết cho một chính sách hoạt động đầu tiên
Tất cả bốn dòng cùng nhau, bắt đầu từ con số không. Tổng chi phí GPU giả định 3 đến 5 lần chạy: lần đầu tiên chứng minh quy trình hoạt động, lần thứ hai phát hiện vấn đề dữ liệu, lần thứ ba hoặc thứ tư là lần bạn giữ lại.
| Hạng mục | Lộ trình tinh gọn | Lộ trình thoải mái |
|---|---|---|
| Cánh tay robot | Chỉ bộ phận theo dõi SO-100, 121.94 USD trong BOM | Bộ phận dẫn đầu cộng bộ phận theo dõi, 229.88 USD trong BOM |
| Mô hình | SmolVLA hoặc ACT, cấp 24 GB | GR00T N1.7, A100 80 GB hoặc cấp H100 |
| Số tập đã ghi | 30, tối thiểu của SmolVLA | 50 đến 100 |
| Thời gian người để ghi | khoảng 1 giờ 12 phút | 2 đến 4 giờ |
| Chi phí một lần chạy | 1 đến 3 USD | 4 đến 12 USD |
| Số lần chạy trước khi hoạt động | 3 đến 5 | 3 đến 5 |
| Tổng chi tiêu GPU | 3 đến 15 USD | 12 đến 60 USD |
| Hạng mục lớn nhất trong hóa đơn | cánh tay robot, sau đó là thời gian của bạn | cánh tay robot, sau đó là thời gian của bạn |
Quy luật này vẫn đúng với kích thước robot này: tính toán chỉ là sai số làm tròn, phần cứng là chi phí một lần thực sự, giờ công của con người là chi phí định kỳ. Để kiểm tra phần huấn luyện trước khi mua bất cứ thứ gì, các điểm truy cập không cần phần cứng cho phép bạn so sánh các mô hình và thuê GPU mà không cần cánh tay robot, và cánh tay robot trực tiếp là một SO-100 vật lý mà bạn có thể điều khiển trong trình duyệt mà không cần đăng ký. Đối với toàn bộ quy trình từ đầu đến cuối, hướng dẫn SO-100 đầy đủ bao gồm thiết lập, điều khiển từ xa và huấn luyện, và huấn luyện chính sách đầu tiên của bạn là phiên bản rút gọn.

Một lần tinh chỉnh VLA từ đầu đến cuối tốn bao nhiêu?▾
Khoảng 4 đến 12 USD cho GR00T N1.7, GR00T N1.5 hoặc Pi0.5 trên tầng A100 80 GB hoặc H100 (3 đến 6 giờ với giá 1.20 đến 2.00 USD mỗi giờ), và khoảng 1 đến 3 USD cho SmolVLA hoặc ACT trên tầng RTX 4090 (2 đến 5 giờ với giá 0.30 đến 0.60 USD mỗi giờ). Tự thuê card cũng nằm trong cùng phạm vi khi tính cả thời gian thiết lập, vì nó được tính phí theo tỷ lệ huấn luyện.
Có đáng để trả tiền cho H100 hơn A100 80 GB không?▾
Đối với một chính sách SO-100 duy nhất, thường là không. Cả hai đều đáp ứng ngưỡng bộ nhớ mà GR00T và Pi0.5 cần, và vào ngày 23 tháng 8 năm 2026, một A100 80 GB đầy đủ có giá khởi điểm 0.44 USD mỗi giờ so với 1.34 USD cho một H100 80 GB. H100 hoàn thành sớm hơn, vì vậy một phần chi phí được bù lại bằng ít giờ hơn, nhưng tổng chi phí vẫn cao hơn cho một lần chạy nhỏ như vậy. Lập luận thực sự cho H100 là tính khả dụng: năm ưu đãi H100 80 GB đơn lẻ trên thị trường đó so với hai A100 80 GB, và một card bạn không thể thuê thì không có giá.
Cần bao nhiêu lần chạy để một chính sách thực sự hoạt động?▾
Lên kế hoạch từ ba đến năm lần. Lần đầu tiên chứng minh rằng quy trình được kết nối đúng cách. Lần thứ hai thường phát hiện ra vấn đề về tập dữ liệu, chẳng hạn như luồng camera bị ngắt giữa chừng. Lần thứ ba hoặc thứ tư là lần bạn giữ lại.
Tôi có thể huấn luyện SmolVLA hoặc ACT trên GPU của riêng mình thay vì thuê không?▾
Có. Cả hai đều được hỗ trợ cục bộ trên AY-Robots và cả hai đều vừa vặn thoải mái trong 24 GB; bài báo ACT gốc đã huấn luyện mô hình 80M của nó trong khoảng 5 giờ trên một RTX 2080 Ti 11 GB. GR00T và Pi0.5 chỉ có trên đám mây ở đây vì ngưỡng tinh chỉnh được ghi nhận của các nhà cung cấp là 40 GB và 70 GB, và card tiêu dùng lớn nhất trên thị trường là RTX 5090 32 GB.
Tại sao cùng một số bước lại tốn các khoản tiền khác nhau giữa các mô hình?▾
Các bước không thể so sánh được giữa các chính sách. ACT mặc định 100.000 bước với batch 8 trên card 24 GB; GR00T N1.5 mặc định 2.000 bước với batch 1 và gradient accumulation 16 trên card 80 GB. Hóa đơn được tính bằng số giờ nhân với tỷ lệ của card mà dung lượng bộ nhớ buộc bạn phải sử dụng, chứ không phải số bước.
Xem chi phí chạy của bạn trước khi bắt đầu
Mỗi trong năm chính sách liệt kê tầng GPU, thời gian chạy và giá mỗi lần chạy, và hệ thống huấn luyện thuê card trên cùng thị trường giao ngay nơi các con số này được đo lường.
Kiểm tra giáSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started