Bảng chi phí AY-Robots hiển thị GPU mà mỗi trong năm chính sách cần, thời gian chạy điển hình và giá mỗi lần chạy, và số lượng tập cần thiết trước khi chính sách hữu ích
Huấn luyện VLAChi phí GPUSO-100Tinh chỉnhHọc máy robotLập ngân sách

Chi phí huấn luyện VLA: Một lần tinh chỉnh thực sự tốn bao nhiêu

AY-Robots ResearchAugust 23, 202623 phút đọc

Giá GPU thị trường giao ngay thực tế, thời gian chạy của từng trong năm chính sách, chi phí của cánh tay robot và các bản trình diễn, và bốn nơi tiền âm thầm biến mất.

Phiên bản tóm tắt

  • Một lần chạy trên tầng A100 80 GB hoặc H100 mất 3 đến 6 giờ và tốn khoảng 4 đến 12 USD. Trên tầng RTX 4090, mất 2 đến 5 giờ và khoảng 1 đến 3 USD.
  • Đo trên vast.ai lúc 13:44 UTC ngày 23 tháng 8 năm 2026: một RTX 4090 đầy đủ theo yêu cầu với giá 0.13 đến 0.38 USD/giờ, một A100 80 GB với giá 0.44 đến 0.67, một H100 80 GB với giá 1.34 đến 2.34. Các card 80 GB đầy đủ rất khan hiếm, lần lượt có hai và năm ưu đãi card đơn.
  • GPU là hạng mục rẻ nhất. Danh mục vật liệu của SO-ARM100 định giá một cặp leader cộng follower là 229.88 USD, tương đương 77 đến 230 lần chạy trên tầng 24 GB.
  • Hai giờ một người ghi lại 50 tập phim tốn kém hơn chi phí chạy huấn luyện mà các tập phim đó cung cấp.
  • Tiền biến mất ở bốn nơi: chạy trên dữ liệu hỏng, mô hình 3B cho các tác vụ mà chính sách 80M xử lý, GPU không ai phá hủy, và chạy lại một kết quả mà bạn không giữ được.
  • AY-Robots định cỡ card theo VRAM mà mô hình cần và thuê nó trên cùng thị trường giao ngay, vì vậy chi phí chạy là chi phí thị trường.

Hóa đơn có bốn hạng mục, và GPU là hạng mục nhỏ nhất

Khi mọi người hỏi chi phí để tinh chỉnh một mô hình hành động-ngôn ngữ-thị giác cho một SO-100, họ gần như luôn đề cập đến chi phí thuê GPU. Đó là con số xuất hiện dưới dạng phí trên thẻ, vì vậy nó là con số cảm thấy thực tế nhất. Nó cũng là, với một biên độ rộng, con số nhỏ nhất trong bốn con số quyết định chi phí thực sự của một chính sách hoạt động thực sự tốn của bạn bao nhiêu.

Hạng mụcNó là gìKích thước điển hình cho một chính sách hoạt động
GPU timethuê một card cho lần chạy1 đến 12 USD mỗi lần chạy, và bạn sẽ thực hiện 3 đến 5 lần
The robotservo, khung in, camera, cáp, nguồn điệnmột lần, 110 đến 500 EUR mỗi cánh tay
Human hoursmột người điều khiển cánh tay để ghi lại các bản demo1 đến 4 giờ mỗi tập dữ liệu, lặp lại cho mỗi tác vụ
Wastedữ liệu xấu, mô hình quá khổ, pod bị lãng quênkhông giới hạn, và là hạng mục duy nhất bạn kiểm soát

Thời gian huấn luyện dưới đây lấy từ các bài báo và kho lưu trữ của năm mô hình, chi phí phần cứng từ danh sách vật liệu đã công bố, số liệu nền tảng từ AY-Robots danh mục chính sáchtrang giá. Trong trường hợp nền tảng không hỗ trợ, bài viết này sẽ nêu rõ.

Chi phí thực tế của một giờ GPU trên thị trường giao ngay

Không có một mức giá duy nhất cho một giờ A100. Trên một thị trường như vast.ai, mỗi nhà cung cấp đặt ra mức giá riêng, và lần chạy huấn luyện bạn khởi chạy sẽ được thực hiện trên bất kỳ máy nào rẻ và trống vào thời điểm đó. Câu trả lời trung thực là một phân phối. Dưới đây là số liệu, được đo vào ngày 23 tháng 8 năm 2026 lúc 13:44 UTC: các card đầy đủ, theo yêu cầu, được lọc theo VRAM thực tế.

Cardvast.ai theo yêu cầu USD/h (thấp / trung bình / cao)Ưu đãi card đầy đủGiá sàn vast.aiRunPod Cộng đồng / Bảo mậtHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74not offered
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99not offered
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19not offered
Cách ảnh chụp nhanh này được thực hiện và những gì nó không phải

Các ưu đãi theo yêu cầu cho một GPU đầy đủ duy nhất (gpu_frac == 1.0) từ API gói công khai vast.ai, không cần tài khoản, được lọc theo gpu_ram để chỉ các thẻ 80 GB chính hãng xuất hiện trong các hàng 80 GB. Bộ lọc đó rất quan trọng: trong lần đọc này, tất cả ba ưu đãi A100 SXM4 một thẻ đều là loại 40 GB, cũng như hai trong số bốn ưu đãi A100 PCIE, vì vậy việc gộp chúng vào một hàng "A100" sẽ làm giảm một nửa giá được báo cáo ở đây. Cột Hugging Face kết hợp hai sản phẩm: 2.50 USD/h là phần cứng Spaces Nvidia A100 - large và 4.50 USD/h là một H100 80 GB duy nhất trong Inference Endpoints, mà Spaces không cung cấp. Coi các giá trị trung vị là chỉ số: hàng A100 80 GB dựa trên hai ưu đãi và hàng H100 dựa trên năm ưu đãi, và truy vấn tương tự 36 giây sau đó đã trả về số lượng 4090 khác và giá cao nhất khác trên ba trong số năm hàng. Giá niêm yết của RunPod là con số ổn định hơn để lập kế hoạch.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Truy vấn chính xác đằng sau bảng trên, được chạy hai lần trong khi viết phần này. Hãy chạy nó trước khi tin tưởng bất kỳ bài viết nào về giá GPU, kể cả bài này.
Bảng chi phí AY-Robots hiển thị GPU mà mỗi chính sách cần, thời gian chạy điển hình và giá mỗi lần chạy, cũng như số tập cần thiết trước khi chính sách hữu ích
Bảng chi phí trên /try: thẻ, thời gian chạy, giá mỗi lần chạy và số tập tối thiểu cho mỗi chính sách.

Tại sao các mô hình 3B không thể sử dụng thẻ giá rẻ

Một giờ 4090 và một giờ H100 80 GB khác nhau khoảng sáu lần ở các giá trị trung vị trên. Điều buộc bạn phải sử dụng thẻ đắt tiền không phải là tốc độ, mà là bộ nhớ. openpi đặt mức tối thiểu cho một Pi0.5 đầy đủ tinh chỉnh ở mức 70 GB, và NVIDIA khuyến nghị 40 GB trở lên cho GR00T. Lưu ý những gì con số GR00T không phải là. Cấu hình tinh chỉnh của nó đóng băng mô hình ngôn ngữ và bộ mã hóa hình ảnh theo mặc định (tune_llmtune_visual là False, bộ chiếu và đầu khuếch tán là True), đó là lý do tại sao danh mục liệt kê khoảng 40 triệu tham số được huấn luyện trong số 3 tỷ. 40 GB không phải là trạng thái bộ tối ưu hóa cho 3 tỷ trọng số, mà là xương sống đóng băng cộng với các kích hoạt. Các biến thể giảm phạm vi yêu cầu thấp hơn: đường dẫn LoRA của openpi yêu cầu 22.5 GB và đề cập đến 4090, và quy trình làm việc Isaac Lab Arena của NVIDIA liệt kê tùy chọn một GPU 24 GB cho GR00T sau huấn luyện. Nền tảng phân cấp dựa trên mức tối thiểu mà mỗi nhà cung cấp công bố cho cấu hình mà nó thực sự chạy. Bài viết về khớp nối dòng chảy pi0 giải thích nguồn gốc của khớp nối dòng chảy dấu chân đến từ đâu.

Công việcBộ nhớ dự án thượng nguồn yêu cầuNguồn
Suy luận pi0 / pi0.5hơn 8 GB, ví dụ RTX 4090openpi
Tinh chỉnh LoRA pi0 / pi0.5hơn 22.5 GB, ví dụ RTX 4090openpi
Tinh chỉnh đầy đủ pi0 / pi0.5hơn 70 GB, ví dụ A100 80 GB hoặc H100openpi
Suy luận GR00T N1.71 GPU với 16 GB trở lênIsaac-GR00T
Tinh chỉnh GR00T N1.7khuyến nghị 40 GB trở lên, các node H100 hoặc L40Isaac-GR00T
GR00T tinh chỉnh, những gì nó huấn luyệnbộ chiếu và đầu khuếch tán; LLM và bộ mã hóa hình ảnh bị đóng băng theo mặc địnhfinetune_config.py
GR00T sau huấn luyện, giảm1 GPU với 24 GB, mô hình ngôn ngữ bị đóng băngIsaac Lab Arena
Tinh chỉnh SmolVLAmột A100 duy nhất cho lần chạy tham chiếu 20.000 bướclerobot docs
Huấn luyện ACTmột RTX 2080 Ti 11 GB duy nhấtACT paper

Bảng đó là lý do tại sao nền tảng chia năm mô hình thành hai cấp. GR00T N1.7, GR00T N1.5Pi0.5 chạy trên A100 80 GB hoặc H100 vì đó là những gì các nhà cung cấp yêu cầu. SmolVLAACT chạy trên RTX 4090 hoặc bất kỳ thẻ 24 GB nào vì điều đó thực sự là đủ.

Cái bẫy làm mất cả ngày: thuê thẻ giá rẻ cho mô hình lớn

Một lần chạy GR00T hoặc Pi0.5 trên thẻ 24 GB không thất bại ngay từ giây đầu tiên. Nó tải xuống điểm kiểm tra cơ sở, xây dựng chỉ mục tập dữ liệu, bắt đầu lần truyền tiến đầu tiên và chết sau vài trăm bước với lỗi CUDA hết bộ nhớ. Bạn đã trả tiền cho việc tải xuống và thiết lập nhưng không nhận được gì. Các bản sửa lỗi: hết bộ nhớ trong quá trình huấn luyện.

Thời gian chạy thực tế của từng trong năm mô hình

Thời gian chạy là một nửa còn lại của chi phí: 2.00 USD mỗi giờ là không đáng kể nếu công việc chỉ 40 phút và sẽ rất tốn kém nếu kéo dài 40 giờ. Đây là các cài đặt mặc định mà AY-Robots thực sự gửi đến trình huấn luyện, cùng với khoảng thời gian chạy và chi phí cho mỗi cấp.

Chính sáchCấp GPUSố bước tối đa mặc địnhKích thước lô mặc định (tích lũy gradient)Khoảng thời gian chạyChi phí mỗi lần chạy
GR00T N1.7, ~3BA100 80 GB or H10020,00032, tích lũy 1, áp dụng3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, tích lũy 16, áp dụng3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, tích lũy 16, không ảnh hưởng3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, tích lũy 8, không ảnh hưởng2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, tích lũy 12 to 5 h1 to 3 USD
Bảng so sánh năm chính sách có thể huấn luyện trên AY-Robots hiển thị số lượng tham số, GPU yêu cầu, độ trễ suy luận và số tập tối thiểu
Năm chính sách cạnh nhau: tham số, cấp GPU, độ trễ mỗi bước hành động, số tập tối thiểu.

Nguồn gốc của các khoảng thời gian chạy đó từ phía trước

  • SmolVLA: tài liệu của lerobot cho biết 20.000 bước mất khoảng 4 giờ trên một A100 duy nhất. Nền tảng chạy cùng 20.000 bước trên gói 24 GB rẻ hơn, do đó có một khoảng thời gian thay vì cố định 4 giờ.
  • ACT: bài báo ALOHA gốc báo cáo khoảng 5 giờ trên một RTX 2080 Ti 11 GB duy nhất cho một mô hình 80M tham số. Một 4090 mới hơn vài thế hệ nhưng nền tảng dự trù 100.000 bước, vì vậy khoảng thời gian vẫn tương tự.
  • GR00T: quy trình làm việc tham chiếu của NVIDIA cho thế hệ N1.6 ước tính khoảng 4 đến 8 giờ cho 20.000 bước với batch 24 trên tám card L40S, và 2 đến 3 giờ cho 30.000 bước với batch 16 trên một Ada 6000 duy nhất. Việc tinh chỉnh một VLA 3B bằng một card duy nhất trong vài giờ là bình thường, không phải lạc quan.
  • Pi0.5: openpi không công bố số liệu thời gian thực, nhưng họ công bố mức sàn 70 GB cho một lần tinh chỉnh hoàn chỉnh, điều này xác định loại card và do đó là tốc độ.

Đáng để dừng lại ở con số mà bạn không phải trả. Bài báo GR00T N1 báo cáo khoảng 50.000 giờ GPU H100 để huấn luyện trước mô hình 2.2B, trên một cụm lên đến 1024 GPU, với kích thước batch huấn luyện trước là 16.384 cho 200.000 bước gradient. Với mức giá 1.34 đến 2.34 USD mỗi giờ được đo ở trên, chi phí thuê điện toán là khoảng 67.000 đến 117.000 USD. Bài báo SmolVLA ước tính dự án của họ tiêu tốn khoảng 30.000 giờ GPU trên 481 bộ dữ liệu cộng đồng, 22.9K tập và 10.6M khung hình. Bạn thừa hưởng tất cả những điều đó với giá của một lượt tải xuống; 8 USD của bạn mua 20.000 bước cuối cùng. Tại sao VLA được xây dựng theo cách này đề cập đến sự phân chia đó.

Cánh tay robot: chi phí một lần làm lu mờ hóa đơn GPU

Một lần chạy huấn luyện tốn ít hơn một bữa trưa. Robot thì không. Đó là lý do tại sao SO-100 quan trọng: nó là cánh tay rẻ nhất mà toàn bộ học bắt chước chuỗi công cụ thực sự hỗ trợ.

Cánh tay robotĐộng cơ servoĐiện ápChi phí linh kiệnHỗ trợ trên AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURđầy đủ, cánh tay tham chiếu
SO-101Feetech STS32157.4 V130 to 170 EURđầy đủ
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURtương thích
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURtương thích

Danh sách vật tư (BOM) gốc trong kho lưu trữ SO-ARM100 chi tiết hơn và đáng để kiểm tra theo khu vực của bạn: danh sách Linh kiện cho hai cánh tay tổng cộng 229.88 USD hoặc 226.30 EUR cho một thiết lập leader và follower, và danh sách Linh kiện cho một cánh tay follower tổng cộng 121.94 USD hoặc 124.30 EUR. Sáu động cơ servo STS3215 với giá 13.89 USD mỗi chiếc là 83.34 trong số 121.94 đó, vậy động cơ servo chính là cánh tay robot. Với 1 đến 3 USD cho mỗi lần chạy SmolVLA hoặc ACT, một cặp cánh tay có giá trị tương đương từ 77 đến 230 lần chạy huấn luyện. Nếu bạn vẫn đang lựa chọn, SO-100 so với SO-101 là sự so sánh quan trọng, bởi vì hai loại này đủ gần nhau để quyết định dựa trên tính khả dụng hơn là khả năng.

7.4 V, không phải 12 V

STS3215 có hai biến thể 7.4 V và 12 V; kho lưu trữ lưu ý rằng linh kiện 12 V cũng cần nguồn cấp 12 V 5 A thay vì nguồn 5 V, vì vậy hai loại này không thể thay thế cho nhau. Cấp 12 V vào động cơ servo 7.4 V sẽ làm hỏng chúng, và sáu động cơ servo chiếm hai phần ba chi phí linh kiện của một cánh tay follower. Kiểm tra nhãn trên mỗi động cơ servo trước khi cấp nguồn lần đầu. Nếu động cơ servo đã hoạt động bất thường: servo không phản hồi, cánh tay giật rồi xệ xuống.

Giờ công của con người: dòng không ai đưa vào bảng tính

Đây là con số làm đảo lộn cuộc thảo luận về chi phí. Ghi lại các bản trình diễn là một người di chuyển cánh tay robot, từng tập một, trong thời gian thực. Không có việc xử lý theo lô hay thuê theo giây. Trình ghi của tập dữ liệu LeRobot đi kèm với các giá trị mặc định giúp việc tính toán dễ dàng, cả ba đều được xác nhận trong DatasetRecordConfig: 60 giây mỗi tập, 60 giây để đặt lại cảnh, 50 tập. Cột tiền dưới đây giả định 15 USD cho một giờ làm việc của một người, đây là một giả định chứ không phải con số của nền tảng. Hãy thay thế bằng mức giá của riêng bạn; tỷ lệ mới là điều quan trọng.

  1. 1
    Ghi lại tập dữ liệu với các giá trị mặc định mà bạn sẽ thực sự phải trả tiền

    Đây là lerobot 0.6.1, phiên bản trên PyPI tính đến ngày 3 tháng 8 năm 2026. Lưu ý hình dạng CLI: việc ghi chạy qua điểm vào console lerobot-record (lerobot.scripts.lerobot_record), chứ không phải đường dẫn module cũ python -m lerobot.scripts.record. AY-Robots nhắm mục tiêu 0.5.1, và wheel 0.5.1 khai báo cùng các điểm vào lerobot-recordlerobot-train, vì vậy hình dạng dưới đây ổn định trên cả hai. Ba cờ thời gian là các giá trị mặc định của upstream, vì vậy đây cũng là lệnh mà phép tính trong bảng tiếp theo giả định.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Xem những gì bạn đã ghi trước khi thuê một phút GPU nào

    Kiểm tra một tập dữ liệu không tốn đồng nào mỗi giờ. Phát hiện cùng một vấn đề từ đường cong mất mát tốn 2.00 USD mỗi giờ trên cấp H100 và cho bạn biết muộn bốn giờ. Đẩy tập dữ liệu và xem xét nó trong trình xem LeRobot, hoặc duyệt thư mục tập dữ liệu của AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Huấn luyện, và đảm bảo điểm kiểm tra tồn tại lâu hơn pod

    Một máy thuê theo định nghĩa là tạm thời, vì vậy hãy ghi các điểm kiểm tra vào một nơi bền vững trong quá trình chạy. Hai cờ quyết định liệu bạn có giữ được những gì bạn đã trả tiền hay không. --save_freq mặc định là 20.000 bước, vì vậy một lần chạy SmolVLA mặc định 20.000 bước sẽ ghi điểm kiểm tra đầu tiên khi quá trình chạy đã kết thúc; hãy giảm nó trước khi bạn thuê bất kỳ thứ gì có thể bị gián đoạn. --save_checkpoint_to_hub yêu cầu --policy.repo_id và không tồn tại trong lerobot 0.5.1, vì vậy trên phiên bản đó, bạn tự sao chép thư mục đầu ra ra khỏi máy. Kích thước lô dưới đây là ví dụ của tài liệu upstream; biểu mẫu AY-Robots gửi 2 cho SmolVLA và ghi vào bộ lưu trữ đối tượng khi các điểm kiểm tra xuất hiện.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
Số tậpGhi hình ở 60 giâyĐặt lại ở 60 giâyTổng thời gianCộng thêm 20 phần trăm ghi lạiVới 15 USD mỗi giờ công
30, tối thiểu của SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, bốn mức tối thiểu khác50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, một tập dữ liệu thoải mái100 min100 min3 h 20 min4 h 00 minabout 60 USD

So sánh cột bên phải với chi phí chạy từ 1 đến 12 USD. Với mức giá giả định đó, một tập dữ liệu gồm 50 tập có chi phí ghi lại gấp hai đến bảy lần so với chi phí đào tạo, chưa kể hiệu chuẩn, thiết lập camera và các tập bạn bỏ đi. Đó là lý do tại sao có giá trị tiền tệ trực tiếp. Hướng dẫn của lerobot đề xuất ít nhất 50 tập với 10 tập cho mỗi vị trí đối tượng; tài liệu SmolVLA báo cáo rằng phiên bản 25 tập của cùng một nhiệm vụ là không đủ.

Tiền thực sự biến mất ở đâu

1. Chạy trên dữ liệu không bao giờ hoạt động được

Một lần chạy GR00T 20.000 bước trên một tập dữ liệu với hai luồng camera bị hoán đổi có chi phí tương đương với một lần chạy trên tập dữ liệu sạch, mất cùng thời gian và tạo ra một đường cong mất mát trông ổn. Lỗi xuất hiện trên cánh tay robot, vài giờ sau đó. được tính phí theo giờ và chẩn đoán được tính phí theo ngày. Hai triệu chứng đáng ghi nhớ: thường có nghĩa là các quan sát không mang thông tin mà nhiệm vụ cần, và có nghĩa là tập dữ liệu có ít biến thể hơn bạn nghĩ.

2. Trả giá mô hình nền tảng cho một tác vụ camera cố định

ACT có khoảng 80 triệu tham số và được thiết kế để huấn luyện từ đầu với 50 lần trình diễn một tác vụ. GR00T N1.7 có khoảng 3 tỷ tham số với một backbone đã được huấn luyện trước. Đối với một camera cố định, một bàn cố định và một vật thể, mô hình 80 triệu tham số thường đạt được mục tiêu, chạy khoảng 20 ms mỗi bước hành động thay vì 152 ms, và tốn 1 đến 3 USD mỗi lần chạy thay vì 4 đến 12. Hãy chi 3 USD để tìm hiểu xem mô hình rẻ hơn có hoạt động không trước khi chi 12 USD cho mô hình đắt tiền hơn. ACT so với SmolVLAGR00T N1.7 so với Pi0.5 cho thấy khi nào mỗi mô hình không còn là lựa chọn đúng; đấu trường mô hình có 85 mô hình và 332 kết quả benchmark.

3. GPU bạn đã quên

Lỗi rẻ nhất để ngăn chặn và phổ biến nhất để mắc phải. Một phiên bản được khởi động vào thứ Sáu để gỡ lỗi sẽ bị tính phí suốt cuối tuần với cùng mức giá như một lần chạy thực tế.

CardTỷ lệ trung bình trong ảnh chụp nhanhKhông hoạt động trong 24 giờKhông hoạt động trong 7 ngàyGiá trị tương đương
RTX 40900.32 USD/h7.68 USD53.76 USDkhoảng 27 lượt chạy SmolVLA hoặc ACT với giá 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDkhoảng 12 lượt chạy GR00T với giá 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDkhoảng 38 lượt chạy GR00T với giá 8 USD

Trên AY-Robots, lỗi này đã được loại bỏ trong suy luận: các pod được cung cấp bởi API suy luận mang một bộ giám sát không hoạt động và tự hủy sau một khoảng thời gian không hoạt động. Nếu bạn tự thuê card, bộ giám sát đó chính là lời nhắc trên lịch của bạn.

4. Trả tiền hai lần cho cùng một câu trả lời

Điểm vào để tinh chỉnh của GR00T là một CLI tyro không để lộ seed. Đó không phải là giới hạn của nền tảng, mà là công cụ upstream: không có trường seed trong gr00t/configs/finetune_config.py, và các mẹo huấn luyện của kho lưu trữ cảnh báo rằng các lượt chạy có thể khác nhau từ 5 đến 6 phần trăm vì các phép tăng cường hình ảnh không xác định. lerobot mặc định sử dụng seed 1000 trong cả 0.5.1 và 0.6.1, vì vậy các lượt chạy ACT, SmolVLA và Pi0.5 ít nhất có thể được chạy lại từ cùng một khởi tạo và thứ tự dữ liệu. Đó không phải là lời hứa về các trọng số giống hệt từng bit trên GPU, nhưng đó là sự khác biệt giữa việc chạy lại và một thử nghiệm mới. Nếu một lượt chạy GR00T tạo ra một chính sách hoạt động và bạn không giữ điểm kiểm tra, bạn phải trả toàn bộ chi phí cho một kết quả có thể khác biệt nhiều hơn so với sự khác biệt bạn đang tìm kiếm. Có một cách thứ hai để mất một điểm kiểm tra mà bạn đã trả tiền: CLI mặc định là --save-total-limit 5, được ghi lại là số lượng điểm kiểm tra tối đa được giữ trước khi các điểm cũ hơn bị xóa. Lưu trữ chỉ tốn vài xu; một lượt chạy lại tốn 4 đến 12 USD và sáu giờ.

Dung lượng có thể bị gián đoạn có giá bằng một nửa và sẽ làm hỏng quá trình chạy của bạn

Mức giá sàn trên chỉ là một phần nhỏ của giá theo yêu cầu, và vast.ai cho biết hệ thống đấu giá có thể giảm chi phí cho khách hàng từ năm mươi phần trăm trở lên. Điểm bất lợi, theo lời của họ: một phiên bản có thể bị gián đoạn có thể bị tạm dừng bất cứ lúc nào nếu người dùng khác trả giá cao hơn hoặc một thuê bao theo yêu cầu được tạo cho cùng tài nguyên, và việc tạm dừng đó "dừng tất cả các tiến trình đang chạy". Theo yêu cầu luôn được ưu tiên. Điều này tốt cho một lần chạy ghi điểm kiểm tra sau mỗi vài trăm bước, nhưng lại là tổn thất hoàn toàn cho một lần chạy chỉ ghi ở cuối, và đó chính xác là những gì cài đặt mặc định cung cấp cho bạn: Isaac-GR00T CLI ghi sau mỗi --save-steps (mặc định 1000), nhưng --save_freq của lerobot mặc định là 20.000 bước, vì vậy một lần chạy SmolVLA mặc định chỉ ghi điểm kiểm tra một lần, ở vạch đích. Hãy giảm nó xuống, hoặc đừng đấu giá. Biểu mẫu đào tạo AY-Robots hiển thị tùy chọn GR00T dưới dạng saveSteps.

Tự thuê card
Ưu điểm
  • Mức giá theo giờ thấp nhất hiện có.
  • Kiểm soát hoàn toàn hình ảnh, phiên bản CUDA, lerobot hoặc Isaac-GR00T và mọi cờ.
  • Đấu giá gián đoạn giảm một nửa tỷ lệ nếu quá trình chạy của bạn ghi điểm kiểm tra đủ thường xuyên để sống sót qua một lần tạm dừng.
  • Không có gì bị trừu tượng hóa, vì vậy khi một lần chạy hoạt động bất thường, bạn có thể thấy lý do tại sao.
Đánh đổi
  • Thiết lập được tính phí theo giá GPU: trình điều khiển, các phụ thuộc, điểm kiểm tra cơ sở nhiều gigabyte và việc tải xuống tập dữ liệu đều có chi phí mỗi giờ giống như đào tạo.
  • Một phiên bản có thể bị gián đoạn bị trả giá cao hơn sẽ bị tạm dừng và các tiến trình của nó bị hủy. Một lần chạy chưa được lưu là tiền bị đốt cháy, và mặc định của lerobot ghi điểm kiểm tra đầu tiên ở bước 20.000.
  • Không có gì tự động hủy pod cho bạn. Bảng thời gian nhàn rỗi ở trên là hóa đơn cho việc quên tắt.
  • Nguồn cung cho các card 80 GB đầy đủ là khan hiếm: hai A100 80 GB và năm H100 80 GB được cung cấp đầy đủ trong lần đọc này. Danh sách cũng thay đổi liên tục, vì vậy giá niêm yết rẻ nhất và giá bạn thực sự có thể thuê không phải là cùng một con số.
  • Mỗi giờ trên cơ sở hạ tầng là một giờ không được dành để ghi lại các tập quyết định xem chính sách có hoạt động hay không.

Tự làm so với để nền tảng thuê card

Bạn chọn máy, xây dựng môi trường và hủy pod. Mức giá theo giờ là giá thị trường như trên; mọi thứ khác là thời gian của bạn.

  1. Tìm một card phù hợp với VRAM mà mô hình cần: 24 GB cho ACT và SmolVLA, 80 GB cho GR00T và Pi0.5.
  2. Thuê theo yêu cầu nếu quá trình chạy không thể chịu được việc tạm dừng, có thể bị gián đoạn nếu nó thường xuyên tạo checkpoint.
  3. Cài đặt bộ công cụ: lerobot cho ACT, SmolVLA và Pi0.5, kho lưu trữ Isaac-GR00T với trình khởi chạy tyro riêng cho GR00T.
  4. Chuyển đổi tập dữ liệu nếu cần. Một tập dữ liệu LeRobot v3.0 làm sập bộ tải GR00T và phải được chuyển đổi xuống v2.1.
  5. Khởi chạy, theo dõi độ mất mát (loss), đẩy các checkpoint đến một nơi lưu trữ bền vững khi chúng được ghi.
  6. Hủy phiên bản, sau đó kiểm tra xem bạn đã hủy nó chưa.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Điểm vào fine-tune Isaac-GR00T hiện tại, khớp với lệnh trong README của kho lưu trữ. CLI này không có cờ seed, vì vậy các lần chạy GR00T không thể tái tạo từng bit một.

Chi phí thực tế cho một lần chạy GR00T: 3 đến 6 giờ trên H100 80 GB với giá 1.34 đến 2.34 USD mỗi giờ là 4 đến 14 USD, cộng thêm 20 đến 40 phút thiết lập cũng tính phí, cộng với thời gian của riêng bạn.

Nền tảng tính phí như thế nào và cách nó chọn thẻ

Logic được thiết kế đơn giản. Mọi mô hình trong danh mục khai báo một cấp GPU; hệ thống phụ trợ lấy VRAM cần thiết và thuê một thẻ phù hợp trên cùng thị trường giao ngay được đo lường ở trên. Đó là lý do tại sao chi phí được báo giá là một khoảng, không phải một mức giá cố định. GR00T và Pi0.5 chỉ chạy trên đám mây ở đây vì yêu cầu tối thiểu 40 GB và 70 GB. SmolVLA và ACT cũng chạy cục bộ trên thẻ 24 GB của riêng bạn, nơi chi phí đám mây bằng 0 và điện là vấn đề của bạn.

Trang giá của AY-Robots hiển thị chi phí cho một lần chạy huấn luyện và quyền truy cập nền tảng
Trang giá. Các số liệu theo từng lần chạy theo dõi thị trường giao ngay thay vì một mức giá niêm yết cố định.

Một tùy chỉnh cần được cảnh báo. Tích lũy gradient thực sự áp dụng cho cả hai biến thể GR00T, vì vậy việc tăng nó sẽ mua một lô hiệu quả lớn hơn trên cùng một thẻ. Đối với Pi0.5 và SmolVLA, nó hoàn toàn không áp dụng: lerobot 0.5.1 không có tùy chọn tích lũy gradient trong cấu hình huấn luyện của nó, vì vậy việc đặt trường này thành 16 không tốn kém gì và không mang lại lợi ích gì. Nếu một công việc đang chờ không bao giờ bắt đầu, trang về công việc bị kẹt trong hàng đợi bao gồm những gì cần kiểm tra; nếu tập dữ liệu bị từ chối trước khi chạy bắt đầu, thì hầu như luôn là vấn đề định dạng v3.0.

Giới hạn mà nền tảng này không giải quyết được: độ trễ

Một GPU thuê phục vụ chính sách của bạn qua internet công cộng sẽ thêm các chuyến đi khứ hồi vào một vòng điều khiển vốn đã có độ trễ từ 20 đến 485 ms cho mỗi bước hành động. Tốt cho các tác vụ chọn và đặt chậm, nhưng không phù hợp cho chuyển động phản ứng nhanh. Suy luận trên đám mây đánh giá một điểm kiểm tra tốt nhưng thực hiện thao tác sản xuất kém: nếu tác vụ cần tốc độ, bộ xử lý phải đặt cạnh các servo, và đó là một chi phí mà bài viết này không thể làm biến mất. Xem độ trễ suy luận.

Ngân sách chi tiết cho một chính sách hoạt động đầu tiên

Tất cả bốn dòng cùng nhau, bắt đầu từ con số không. Tổng chi phí GPU giả định 3 đến 5 lần chạy: lần đầu tiên chứng minh quy trình hoạt động, lần thứ hai phát hiện vấn đề dữ liệu, lần thứ ba hoặc thứ tư là lần bạn giữ lại.

Hạng mụcLộ trình tinh gọnLộ trình thoải mái
Cánh tay robotChỉ bộ phận theo dõi SO-100, 121.94 USD trong BOMBộ phận dẫn đầu cộng bộ phận theo dõi, 229.88 USD trong BOM
Mô hìnhSmolVLA hoặc ACT, cấp 24 GBGR00T N1.7, A100 80 GB hoặc cấp H100
Số tập đã ghi30, tối thiểu của SmolVLA50 đến 100
Thời gian người để ghikhoảng 1 giờ 12 phút2 đến 4 giờ
Chi phí một lần chạy1 đến 3 USD4 đến 12 USD
Số lần chạy trước khi hoạt động3 đến 53 đến 5
Tổng chi tiêu GPU3 đến 15 USD12 đến 60 USD
Hạng mục lớn nhất trong hóa đơncánh tay robot, sau đó là thời gian của bạncánh tay robot, sau đó là thời gian của bạn

Quy luật này vẫn đúng với kích thước robot này: tính toán chỉ là sai số làm tròn, phần cứng là chi phí một lần thực sự, giờ công của con người là chi phí định kỳ. Để kiểm tra phần huấn luyện trước khi mua bất cứ thứ gì, các điểm truy cập không cần phần cứng cho phép bạn so sánh các mô hình và thuê GPU mà không cần cánh tay robot, và cánh tay robot trực tiếp là một SO-100 vật lý mà bạn có thể điều khiển trong trình duyệt mà không cần đăng ký. Đối với toàn bộ quy trình từ đầu đến cuối, hướng dẫn SO-100 đầy đủ bao gồm thiết lập, điều khiển từ xa và huấn luyện, và huấn luyện chính sách đầu tiên của bạn là phiên bản rút gọn.

Ma trận huấn luyện AY-Robots với năm chính sách làm hàng và bốn cánh tay robot làm cột, mỗi ô liên kết đến một hướng dẫn huấn luyện cụ thể
Ma trận /train: hàng cho ngân sách của bạn, cột cho cánh tay robot của bạn, ô cho hướng dẫn với các cài đặt mặc định và chi phí của cặp đó.
Một lần tinh chỉnh VLA từ đầu đến cuối tốn bao nhiêu?

Khoảng 4 đến 12 USD cho GR00T N1.7, GR00T N1.5 hoặc Pi0.5 trên tầng A100 80 GB hoặc H100 (3 đến 6 giờ với giá 1.20 đến 2.00 USD mỗi giờ), và khoảng 1 đến 3 USD cho SmolVLA hoặc ACT trên tầng RTX 4090 (2 đến 5 giờ với giá 0.30 đến 0.60 USD mỗi giờ). Tự thuê card cũng nằm trong cùng phạm vi khi tính cả thời gian thiết lập, vì nó được tính phí theo tỷ lệ huấn luyện.

Có đáng để trả tiền cho H100 hơn A100 80 GB không?

Đối với một chính sách SO-100 duy nhất, thường là không. Cả hai đều đáp ứng ngưỡng bộ nhớ mà GR00T và Pi0.5 cần, và vào ngày 23 tháng 8 năm 2026, một A100 80 GB đầy đủ có giá khởi điểm 0.44 USD mỗi giờ so với 1.34 USD cho một H100 80 GB. H100 hoàn thành sớm hơn, vì vậy một phần chi phí được bù lại bằng ít giờ hơn, nhưng tổng chi phí vẫn cao hơn cho một lần chạy nhỏ như vậy. Lập luận thực sự cho H100 là tính khả dụng: năm ưu đãi H100 80 GB đơn lẻ trên thị trường đó so với hai A100 80 GB, và một card bạn không thể thuê thì không có giá.

Cần bao nhiêu lần chạy để một chính sách thực sự hoạt động?

Lên kế hoạch từ ba đến năm lần. Lần đầu tiên chứng minh rằng quy trình được kết nối đúng cách. Lần thứ hai thường phát hiện ra vấn đề về tập dữ liệu, chẳng hạn như luồng camera bị ngắt giữa chừng. Lần thứ ba hoặc thứ tư là lần bạn giữ lại.

Tôi có thể huấn luyện SmolVLA hoặc ACT trên GPU của riêng mình thay vì thuê không?

Có. Cả hai đều được hỗ trợ cục bộ trên AY-Robots và cả hai đều vừa vặn thoải mái trong 24 GB; bài báo ACT gốc đã huấn luyện mô hình 80M của nó trong khoảng 5 giờ trên một RTX 2080 Ti 11 GB. GR00T và Pi0.5 chỉ có trên đám mây ở đây vì ngưỡng tinh chỉnh được ghi nhận của các nhà cung cấp là 40 GB và 70 GB, và card tiêu dùng lớn nhất trên thị trường là RTX 5090 32 GB.

Tại sao cùng một số bước lại tốn các khoản tiền khác nhau giữa các mô hình?

Các bước không thể so sánh được giữa các chính sách. ACT mặc định 100.000 bước với batch 8 trên card 24 GB; GR00T N1.5 mặc định 2.000 bước với batch 1 và gradient accumulation 16 trên card 80 GB. Hóa đơn được tính bằng số giờ nhân với tỷ lệ của card mà dung lượng bộ nhớ buộc bạn phải sử dụng, chứ không phải số bước.

Xem chi phí chạy của bạn trước khi bắt đầu

Mỗi trong năm chính sách liệt kê tầng GPU, thời gian chạy và giá mỗi lần chạy, và hệ thống huấn luyện thuê card trên cùng thị trường giao ngay nơi các con số này được đo lường.

Kiểm tra giá

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started