Bảng so sánh chính sách của AY-Robots hiển thị GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA và ACT cạnh nhau với số lượng tham số, cấp độ GPU, độ trễ suy luận và số lượng tập tối thiểu
mô hình vlahuấn luyện chính sáchlựa chọn mô hìnhlerobotso-100

Bạn Nên Huấn Luyện Chính Sách VLA Nào vào Năm 2026?

AY-Robots ResearchAugust 23, 202618 phút đọc

GR00T N1.7, Pi0.5, SmolVLA, ACT hay GR00T N1.5? Một bảng quyết định phù hợp với các tình huống thực tế, cùng với các số liệu điểm chuẩn đã công bố, độ trễ, chi phí mỗi lần chạy và giấy phép đằng sau mỗi lựa chọn.

Năm chính sách có thể được huấn luyện trên một cánh tay robot lớp SO-100 hiện nay. Chúng khác nhau 24 lần về độ trễ suy luận, 37 lần về số lượng tham số và 12 lần về chi phí cho một lần chạy, cũng như về việc bạn có thể xuất bản kết quả hay không. Năm thẻ mô hình sẽ không giải quyết được vấn đề: không có thẻ nào trả lời câu hỏi của bạn, tôi nên chạy cái nào trước?

Mọi con số dưới đây đều được trích từ các bài báo, kho lưu trữ và thẻ vào tháng 8 năm 2026. Các con số về nền tảng đến từ danh mục chính sách của AY-Robots; nơi hai bên không thống nhất, cả hai đều được hiển thị.

Phiên bản tóm tắt

  • Huấn luyện ACT trước nếu bạn nghi ngờ về tập dữ liệu của mình: 1 đến 3 USD cho mỗi lần chạy, không có gì được huấn luyện trước để che đậy dữ liệu xấu.
  • GR00T N1.7 và Pi0.5 nằm trong khoảng nửa điểm trên LIBERO, 97.0 so với 96.85 đến 97.5. Đó không phải là lý do để chọn cái nào.
  • Pi0.5 là lựa chọn ưu tiên cho khả năng tổng quát hóa, không phải độ chính xác, và là chậm nhất ở 485 ms.
  • SmolVLA, với 450 M tham số, là VLA duy nhất ở đây có thể tinh chỉnh trên một card 24 GB.
  • ACT ở 20 ms là lựa chọn duy nhất cho chuyển động phản ứng nhanh. Giấy phép quyết định phần còn lại.

Bảng quyết định

Tình huống của bạnHuấn luyện cái nàyLý do
Chất lượng tập dữ liệu chưa được chứng minhACTKhông có gì được huấn luyện trước có thể che giấu một tập dữ liệu bị lỗi, và thất bại tốn 1 đến 3 USD.
Giàu tương tác, đa bước, có điều kiện ngôn ngữGR00T N1.7Đạt 97.0% trên bốn bộ LIBERO, cộng với không gian hành động tương đối của đầu cuối.
Chuyển động phản ứng nhanh, suy luận tại các servoACT20 ms. Tốc độ nhanh nhất tiếp theo chậm hơn 7.6 lần.
Vật thể mới, cảnh mới, thế giới mởPi0.5Được xây dựng cho hành vi ngoài phân phối, trên tối đa 104 vị trí.
Một card 24 GB, vẫn muốn ngôn ngữSmolVLA450 triệu tham số, tối thiểu 30 tập, chạy cục bộ.
Tái tạo một lần chạy được ghi lại vào năm 2025GR00T N1.5Chỉ khi bạn bắt buộc: LeRobot hiện từ chối nó, trọng số không dùng cho mục đích thương mại.
Cái này sẽ được phát hành dưới dạng sản phẩmN1.7, SmolVLA or ACTN1.5 không dùng cho mục đích thương mại, Pi0.5 tuân theo các điều khoản của Gemma, card của SmolVLA không ghi gì.

Năm ứng cử viên

Cả năm đều là chính sách: khung hình camera, vị trí khớp và, đối với bốn trong số đó, một hướng dẫn ngôn ngữ, được ánh xạ tới một phần các mục tiêu khớp trong tương lai. Điều phân biệt chúng là mức độ đã được học trước khi bạn đến.

Chính sáchTham sốĐộ trễCấp GPUCục bộ?Số tập tối thiểuĐịnh dạngChi phí
ACT~80 M20 ms24 GB card50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB card30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBkhông50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBkhông50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBkhông50v3.04 to 12 USD

GR00T N1.7

Mô hình hiện tại của NVIDIA mô hình hành động-ngôn ngữ-thị giác, khoảng 3 tỷ tham số, khoảng 40 triệu được huấn luyện trong quá trình tinh chỉnh. Kho lưu trữ liệt kê các thay đổi từ N1.6: xương sống từ mô hình Eagle của nhà cung cấp sang Cosmos-Reason2-2B trên Qwen3-VL, các lớp khuếch tán từ 32 xuống 16, kích thước trạng thái và hành động từ 29 lên 132, tầm hành động từ 16 lên 40.

Điều quan trọng đối với một cánh tay robot nhỏ là không gian hành động tương đối của bộ phận cuối: N1.7 dự đoán các thay đổi từ tư thế hiện tại, đây là điều cho phép 20K giờ video người EgoScale chuyển đổi thành chính sách robot. Thông số kỹ thuật trên trang N1.7, quy trình trong hướng dẫn N1.7 trên SO-100.

GA trong kho lưu trữ, EA trên thẻ mô hình

README của Isaac-GR00T tuyên bố N1.7 là một bản phát hành Sẵn sàng chung, với các điểm chuẩn và hỗ trợ đầy đủ. Thẻ Hugging Face của nó chưa được cập nhật: trường Phiên bản Mô hình vẫn hiển thị GR00T N1.7 EA. Kho lưu trữ là tài liệu mới hơn.

GR00T N1.5

Cùng quy mô 3 B, kiến trúc Eagle 2, SigLip2 và T5, đầu DiT khớp dòng chảy. Nó tồn tại để mở rộng một điểm kiểm tra bạn đã có. Hai điều khiến nó trở thành một lựa chọn mặc định kém: các trọng số mang giấy phép phi thương mại một chiều của NVIDIA, và các bản phát hành LeRobot hiện tại đã loại bỏ hỗ trợ N1.5. Xem N1.7 so với N1.5.

Pi0.5

VLA khớp dòng chảy của Physical Intelligence, loại chính sách khớp dòng chảy. Bài báo trình bày một VLM 2 B được khởi tạo từ PaliGemma cộng với một chuyên gia hành động 300 M, điều khiển robot ở tốc độ 50 Hz; cấu hình pi05 của LeRobot mặc định là một khối 50 bước, một giây ở tốc độ đó. Điểm bán hàng là những nơi chưa từng thấy: khoảng 400 giờ thao tác di động trong các ngôi nhà thực tế, và một nghiên cứu mở rộng quy mô trên 3, 12, 22, 53, 82 và 104 địa điểm, trong đó mô hình 104 địa điểm khớp với một điều khiển được huấn luyện trên chính các ngôi nhà thử nghiệm.

Một giới hạn, được nêu trên lerobot/pi05_base thẻ: cổng chỉ mang đầu hành động khớp với luồng. Dự đoán tác vụ con, mã hóa hành động và RL không được phát hành từ upstream, và openpi cũng nói điều tương tự về kho lưu trữ của riêng nó. Trang Pi0.5hướng dẫn Pi0.5 trên SO-100 có phần còn lại.

Cái bẫy nuốt chửng cả buổi chiều: kho lưu trữ có cổng

Pi0.5 cần bộ mã hóa google/paligemma-3b-pt-224 có cổng (gated: manual, mặc dù Google nói rằng các yêu cầu được xử lý ngay lập tức). Nếu không chấp nhận nó và chạy hf auth login trong môi trường đào tạo, công việc sẽ bắt đầu, tải xuống một lúc, sau đó chết vì lỗi ủy quyền trông giống như lỗi mạng. nvidia/GR00T-N1.7-3B không có cổng, nhưng xương sống nvidia/Cosmos-Reason2-2B của nó thì có (gated: auto). Xóa cả hai trước khi xếp hàng; nếu một lần chạy ở trạng thái chờ, trang hàng đợi bị kẹt liệt kê những gì cần kiểm tra.

SmolVLA

450 triệu tham số, khoảng 100 triệu trong chuyên gia hành động, trên SmolVLM-2 với VLM bị đóng băng và chỉ 16 lớp mô hình ngôn ngữ đầu tiên được sử dụng. Huấn luyện trước là dữ liệu cộng đồng: 481 bộ dữ liệu, 10.6 triệu khung hình, từ cùng cánh tay giá rẻ mà bạn sử dụng. VLA duy nhất ở đây phù hợp với một thẻ 24 GB, và là 30 tập sàn. Xem trang SmolVLA.

ACT

Không phải là một mô hình nền tảng. Action Chunking Transformer từ ALOHA có khoảng 80 triệu tham số được huấn luyện từ đầu cho mỗi tác vụ, trên 50 bản trình diễn ở tần số 50 Hz. Bài báo báo cáo sáu tác vụ hai tay thực tế từ khoảng mười phút trình diễn mỗi tác vụ, đạt 80 đến 90 phần trăm trên các ví dụ mà nó làm nổi bật. Ý tưởng của nó, phân đoạn hành động, có mặt trong mọi mô hình trên trang này, và phân tích loại bỏ của nó vẫn đo lường hiệu quả tốt nhất: trên hai tác vụ mô phỏng với tính năng kết hợp thời gian tắt, tỷ lệ thành công tăng từ 1 phần trăm ở k=1 lên 44 phần trăm ở k=100. Trang ACT có phần còn lại.

Những gì các điểm chuẩn thực sự nói

LIBERO là một điểm chuẩn mà ba trong số năm mô hình này báo cáo: các tác vụ được điều kiện bằng ngôn ngữ trên một mô phỏng Franka Panda, được chia thành bốn bộ dưới đây, mỗi bộ mười tác vụ. NVIDIA đã chạy 200 thử nghiệm cho mỗi bộ.

Mô hìnhKhông gianĐối tượngMục tiêu10 (Dài)Trung bình
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Các hàng này không hoàn toàn có thể so sánh được

Mỗi con số đến từ một bộ kiểm tra và ngân sách khác nhau. GR00T chạy 20K bước với batch toàn cầu 640; số liệu openpi là một checkpoint 30K; phiên bản LeRobot đã thêm 6K bước vào một mô hình cơ sở LIBERO. SmolVLA là một sự không khớp hơn nữa: bài báo của nó huấn luyện hàng đó trên LIBERO từ đầu, không có tiền huấn luyện VLA, trong khi ba mô hình trên nó tinh chỉnh các checkpoint đã được tiền huấn luyện. Hãy coi 96.85 đến 97.5 là một cụm, và khoảng cách đến 87.3% là có thật nhưng đạt được với số lượng tham số gấp 6.7 lần.

SimplerEnv cho thấy sự phân tán, điều mà LIBERO không làm được. NVIDIA so sánh N1.7 với N1.6, điều công khai gần nhất với một delta thế hệ.

Bộ SimplerEnvTrung bình N1.6Trung bình N1.7Biến động tốt nhấtBiến động tệ nhất
Bridge (WidowX), 7 tác vụ56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tác vụ52.0%72.5%open_drawer 0.0 to 65.0không có, mọi tác vụ đều được cải thiện

Hàng Bridge là hàng hữu ích: trung bình tăng 5.7 điểm trong khi put_eggplant_in_basket mất 36 và put_eggplant_in_sink giảm từ 33 xuống 2. Một thế hệ mới di chuyển phân phối thay vì nâng nó lên, vì vậy nếu nhiệm vụ của bạn nằm ở nơi N1.7 bị suy giảm, thì giá trị trung bình không nói lên điều gì.

Bảng xếp hạng đấu trường AY-Robots, một bảng có thể sắp xếp gồm 85 mô hình thị giác-ngôn ngữ-hành động với 332 kết quả benchmark, mỗi giá trị được liên kết với bài báo hoặc thẻ mô hình mà nó xuất phát từ đó
Đấu trường chứa 85 mô hình VLA và 332 kết quả benchmark, mỗi kết quả được liên kết trở lại bài báo hoặc thẻ mô hình của nó. Hữu ích để kiểm tra xem một con số được trích dẫn trong một bài đăng blog có phải là thật hay không.

Trong số năm mô hình, chỉ có bài báo SmolVLA báo cáo về một cánh tay lớp SO-100: 78.3 phần trăm cho SmolVLA và 61.7 cho Pi0 trên ba nhiệm vụ, cả hai đều là đa nhiệm, so với 48.3 cho ACT được huấn luyện đơn nhiệm, điều này không phải là so sánh tương đương. Cặp đôi rõ ràng là cả hai đều đơn nhiệm trên SO-101 pick-and-place: 90 so với 70 trong phân phối, 50 so với 40 ngoài phân phối. So sánh trên ACT so với SmolVLAPi0.5 so với SmolVLA, hoặc duyệt đấu trường.

Độ trễ và chi phí quyết định việc triển khai

Độ trễ suy luận là ràng buộc mà mọi người phát hiện ra sau cùng và hối tiếc đầu tiên. Một chính sách tốt hơn năm điểm trên một tiêu chuẩn nhưng mất nửa giây cho mỗi bước hành động sẽ trông tệ hơn trên bàn làm việc của bạn: động lực học tiếp xúc không chờ đợi.

Một lưu ý: số liệu của GR00T không khớp với thẻ của NVIDIA, vốn tính toán 4 bước khử nhiễu và một camera ở 85.8 ms trên H100 ở chế độ eager, 48.6 ms với torch.compile, 27.9 ms thông qua TensorRT đầy đủ. Con số 152 ms ở đây là số liệu toàn bộ ngăn xếp bao gồm chi phí phục vụ và nhiều hơn một camera, không phải là một forward pass.

Suy luận từ xa có giới hạn cứng

Vòng lặp 20 đến 485 ms là của mô hình, và các chuyến đi khứ hồi qua internet công cộng làm tăng thêm thời gian đó. Suy luận từ xa khả thi cho các tác vụ gắp đặt chậm, không phải cho chuyển động phản ứng nhanh. Nếu tác vụ của bạn cần tốc độ, suy luận phải nằm cạnh các servo: ACT hoặc SmolVLA, cục bộ. Liên quan: chính sách bị đóng băng giữa chừng chuyển động.

Một cách để tiết kiệm thời gian mà không thay đổi mô hình: bài báo SmolVLA đo lường việc thực thi đồng bộ, trong đó chính sách hoàn thành một phần trước khi dự đoán phần tiếp theo, so với bất đồng bộ, nơi dự đoán chồng chéo với việc thực thi. Tỷ lệ thành công tương tự, 78.3 so với 73.3, nhưng cùng một tác vụ gắp đặt mất 9.7 giây thay vì 13.75, và trong một cửa sổ cố định, robot thực hiện được 19 chu kỳ thay vì 9.

Giấy phép, đã kiểm tra vì không ai kiểm tra chúng

Mô hìnhGiấy phép trọng sốGiấy phép mã nguồnSử dụng thương mại
GR00T N1.7NVIDIA Open Model License; thẻ cho phép sử dụng thương mạiApache 2.0
GR00T N1.5Giấy phép phi thương mại một chiều của NVIDIAApache 2.0không
Pi0.5pi05_base card metadata reads license: gemmaApache 2.0 (openpi, LeRobot docs)đọc cả hai, chúng không khớp
SmolVLAkhông có trường giấy phép trên thẻ smolvla_baseApache 2.0 (LeRobot)mã nguồn có, trọng số không được nêu
ACTkhông có trọng số cơ sở nào tồn tạiApache 2.0 (LeRobot)

Dòng Pi0.5 cần được chú ý. Tài liệu LeRobot pi05 nêu rõ Apache 2.0 phù hợp với openpi, trong khi thẻ Hub cho lerobot/pi05_base mang license: gemma. Cả hai đều đang hoạt động. GR00T N1.7 có một phiên bản nhẹ hơn: README của Isaac-GR00T nói thoáng qua rằng N1.7 có thể được cấp phép thương mại đầy đủ theo Apache 2.0, trong khi phần giấy phép riêng của nó và thẻ mô hình chỉ đặt mã nguồn dưới Apache 2.0 và trọng số dưới NVIDIA Open Model License.

Các cài đặt mặc định bạn sẽ thực sự chạy

Mỗi biểu mẫu huấn luyện viên đi kèm với một cài đặt mặc định và chúng không phải là tùy ý. Các cài đặt của ACT là của riêng LeRobot: batch 8, lr 1e-5, 100000 bước huấn luyện, kích thước chunk 100, khớp với ACTConfig upstream và k=100 từ bài báo ACT. Một cột dưới đây là một cái bẫy.

Chính sáchBatchLRSố bước tối đaTích lũy GradÁp dụng?Các tùy chỉnh bổ sung
GR00T N1.7321e-4200001saveSteps
GR00T N1.511e-5200016saveSteps
Pi0.515e-53000016không (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008khôngseed, logFreq
ACT81e-51000001khôngchunkSize, nActionSteps, seed, logFreq
Khả năng tái tạo, cập nhật tháng 8 năm 2026

Điểm vào fine-tuning của GR00T (launch_finetune.py, một CLI tyro) không có trường seed trong dataclass cấu hình của nó, do đó các lần chạy không thể tái tạo bit-for-bit. Kho lưu trữ cũng cảnh báo về sự khác biệt từ 5 đến 6 phần trăm giữa các lần chạy do các phép tăng cường hình ảnh không xác định, lớn hơn hầu hết các khoảng cách điểm chuẩn được tranh luận trực tuyến. Seed mặc định của LeRobot là 1000. Cột tích lũy grad mô tả lerobot 0.5.1; upstream 0.6.2 hiển thị nó dưới dạng --accelerator.gradient_accumulation.steps.

Tùy chỉnh quan trọng hơn lựa chọn mô hình

Đây là khối hành động. Các khối dài hơn mang lại chuyển động mượt mà hơn và ít lỗi tích lũy hơn, nhưng chính sách được cam kết trong khi khối thực thi, vì vậy nó phản ứng chậm với bất kỳ thứ gì di chuyển: tự tin trên một khối lập phương tĩnh, vô vọng trên một khối lăn. Nếu nó vượt quá, việc rút ngắn phần đã thực thi tốt hơn việc đào tạo lại và miễn phí. Một khớp dừng sớm là một vấn đề khác; xem .

  • ACT: ACTConfig mặc định là chunk_size 100n_action_steps 100. Tập hợp thời gian (Temporal ensembling) bị tắt và yêu cầu n_action_steps 1.
  • GR00T N1.7: tầm nhìn nội bộ (internal horizon) đã tăng từ 16 lên 40, nhưng ví dụ SO-101 của LeRobot vẫn chạy --policy.chunk_size=16 --policy.n_action_steps=16. Cờ rollout đã được đổi tên thành --execution-horizon.
  • Pi0.5: một khối 50 bước, trong đó công thức LIBERO của LeRobot thực thi 10 bước thông qua --policy.n_action_steps=10; với --policy.pretrained_path nó sẽ trở lại 50 nếu bạn bỏ qua cờ này.
  • SmolVLA: các khối 50 hành động, cả hai tùy chỉnh đều được hiển thị.

Cách sàng lọc cả năm trong một buổi chiều

Câu trả lời rẻ nhất không phải là đọc thêm. Hãy chi khoảng 15 USD và để cánh tay robot cho bạn biết: ghi lại một lần, đào tạo mô hình rẻ trước, sau đó mở rộng khi dữ liệu đã được chứng minh là đáng tin cậy. Cấu trúc quan trọng hơn số lượng, đó là điểm chính của và .

  1. 1
    Ghi lại 50 tập một lần

    Năm mươi tập dọn đường cho GR00T, Pi0.5 và ACT, cùng với 30 tập của SmolVLA. Lặp lại từng biến thể thay vì dàn trải mỏng: 50 tập trên 5 vị trí khối lập phương được huấn luyện, trong khi 25 tập thì không. Xem ghi lại tập dữ liệu đầu tiên của bạn.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Huấn luyện ACT trước, vì nó không thể nói dối bạn

    Không có trọng số được huấn luyện trước, vì vậy nếu nó thực hiện được nhiệm vụ, tập dữ liệu của bạn chứa nhiệm vụ đó. Nếu ACT không hoạt động, hãy sửa dữ liệu. 1 đến 3 USD, 2 đến 5 giờ trên thẻ 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Chạy SmolVLA trên cùng tập dữ liệu, không thay đổi

    Cùng dữ liệu, cùng cánh tay, 450 triệu tham số thay vì 80 triệu, cộng với điều kiện ngôn ngữ. LeRobot ước tính một lần chạy 20K bước mất khoảng 4 giờ trên một A100. Đây là điều cho bạn biết liệu việc huấn luyện trước có mang lại lợi ích gì không.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Chuyển đổi xuống v2.1 trước khi bạn chạm vào GR00T

    GR00T đọc một biến thể của định dạng LeRobot v2 cộng với một tệp meta/modality.json bổ sung để ánh xạ cách các mảng trạng thái và hành động được nối với nhau phân tách thành các trường có tên. Một tập dữ liệu v3.0 làm hỏng trình tải đó, vì v3.0 đóng gói nhiều tập vào các tệp dùng chung trong khi v2 ghi một tệp cho mỗi tập. Isaac-GR00T cung cấp công cụ hỗ trợ hạ cấp dưới dạng scripts/lerobot_conversion/convert_v3_to_v2.py; trang từ chối v3 là con đường nhanh chóng.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Chỉ nâng cấp lên GR00T N1.7 nếu hai bước đầu tiên còn bỏ sót điều gì đó

    Thông qua CLI của NVIDIA, được hiển thị ở đây, hoặc loại chính sách groot của LeRobot. NVIDIA khuyến nghị 40 GB VRAM trở lên để tinh chỉnh, 16 GB để suy luận. Khi gặp lỗi OOM, hãy xem trang OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Hai cách để chạy bước sàng lọc đó

Ba môi trường, vì các chuỗi công cụ không cùng tồn tại. LeRobot trên nhánh chính là 0.6.2 và cần Python 3.12 trở lên; Isaac-GR00T và openpi là các kho lưu trữ riêng biệt được quản lý bằng uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T ghim torchcodec 0.8.0 làm backend video duy nhất của nó, yêu cầu FFmpeg 4 đến 7. FFmpeg 8 không được hỗ trợ, AV1 không được đảm bảo.
  • Yêu cầu bộ nhớ tối thiểu của openpi: suy luận trên 8 GB, LoRA trên 22.5 GB, tinh chỉnh hoàn chỉnh trên 70 GB. Yêu cầu cuối cùng đó là lý do tại sao Pi0.5 là một tác vụ A100.
  • Tự thuê GPU, hủy bỏ sau đó, tự đối chiếu ba bộ đường dẫn checkpoint.

Mô hình nền tảng hay từ đầu

Vấn đề thực sự không phải là chọn mô hình 3 B nào. Mà là liệu có nên sử dụng VLA được huấn luyện trước hay không, khi mà ACT đã học sáu nhiệm vụ song thủ thực tế từ khoảng mười phút trình diễn mỗi nhiệm vụ, với 80 triệu tham số và không có gì được huấn luyện trước.

Tinh chỉnh VLA được huấn luyện trước thay vì huấn luyện ACT từ đầu
Những gì bạn đạt được
  • Điều kiện hóa ngôn ngữ. ACT không có; một checkpoint của ACT chỉ thực hiện một nhiệm vụ.
  • Tốt hơn với các đối tượng không có trong các bản trình diễn của bạn: trên SO-101, 50% so với 40% của ACT ngoài phân phối.
  • Đa nhiệm hoàn toàn: SmolVLA đạt 78.3% trên ba nhiệm vụ SO-100 với một checkpoint; ACT chỉ được chạy đơn nhiệm.
Những gì bạn phải trả
  • Độ trễ gấp 7.6 đến 24 lần: 152 đến 485 ms cho mỗi bước hành động so với 20 ms của ACT.
  • 4 đến 12 USD mỗi lần chạy thay vì 1 đến 3, và cần GPU A100 thay vì bất kỳ card 24 GB nào.
  • Rủi ro về giấy phép, cộng với chế độ lỗi kho lưu trữ có kiểm soát không tồn tại khi bắt đầu từ đầu.
  • Các trọng số được huấn luyện trước có thể che giấu một tập dữ liệu kém chất lượng. Một lần tinh chỉnh hoạt động một nửa trên dữ liệu bị lỗi sẽ tốn một tuần trước khi bạn xem xét dữ liệu.

Trường hợp tái tạo một lần chạy cũ

Việc theo đuổi một checkpoint năm 2025 sẽ quyết định lựa chọn mô hình cho bạn và biến vấn đề thành việc ghim phiên bản: LeRobot hiện tại từ chối N1.5, vì vậy bạn ghim lerobot==0.5.1. Với trường seed trống và độ lệch 5 đến 6 phần trăm giữa các lần chạy, việc tái tạo chỉ mang tính xấp xỉ theo thiết kế. và có phần nền tảng.

Trang so sánh đối đầu của AY-Robots cho GR00T N1.7 với Pi0.5, hiển thị số lượng tham số, yêu cầu GPU, độ trễ suy luận, định dạng tập dữ liệu và số lượng tập tối thiểu cạnh nhau.
Đối đầu trên /compare/groot-n1-7-vs-pi0-5. Hai mô hình 3 B trông có vẻ có thể thay thế cho nhau trên bảng thông số kỹ thuật nhưng thực tế không phải: một mô hình yêu cầu LeRobot v2.1, một mô hình yêu cầu v3.0.

Chỉ còn hai? ACT với GR00T N1.7GR00T N1.7 với SmolVLA. Các hàng dữ liệu thô nằm trong các mục đấu trường: GR00T N1.7, Pi0.5, SmolVLAACT.

Nơi nền tảng này không giúp ích được cho bạn

  • Nó không thể làm cho suy luận từ xa nhanh chóng. Vòng lặp 20 đến 485 ms thuộc về mô hình; các chuyến đi khứ hồi qua internet sẽ làm tăng thêm thời gian này.
  • Nó không thể tinh chỉnh GR00T hoặc Pi0.5 trên phần cứng của riêng bạn. Cả hai đều chỉ chạy trên đám mây ở đây; chỉ SmolVLA và ACT chạy cục bộ.
  • Nó không thể sửa một tập dữ liệu. Mất mát giảm nhưng chính sách không làm gì là một vấn đề về dữ liệu, một chính sách chỉ hoạt động trong một thiết lập là một vấn đề về độ bao phủ.
  • Nó không thể làm cho các lần chạy GR00T có thể tái tạo: cấu hình upstream không có trường seed.

85 mô hình, 332 kết quả benchmark, mọi con số đều có liên kết đến nguồn của nó

Phiên bản có thể sắp xếp của các bảng trên trang này: 85 mô hình thị giác-ngôn ngữ-hành động, 332 kết quả benchmark, mỗi kết quả được liên kết trở lại bài báo hoặc thẻ mô hình của nó.

Mở đấu trường

Chọn một và tiếp tục

Một mặc định: ghi lại 50 tập, huấn luyện ACT với chi phí 1 đến 3 USD để chứng minh tập dữ liệu, sau đó là SmolVLA trên cùng dữ liệu. Tổng cộng dưới 6 USD, và chúng trả lời câu hỏi quan trọng: liệu việc tiền huấn luyện có giúp ích ở đây không, hay liệu nút thắt cổ chai có phải là dữ liệu không. Nâng cấp lên GR00T N1.7 cho các tác vụ đa bước giàu tiếp xúc, lên Pi0.5 khi cảnh thay đổi.

Hướng dẫn nền tảng: huấn luyện chính sách đầu tiên của bạn, sau đó chạy chính sách đầu tiên của bạn. Các tài liệu huấn luyệntài liệu tập dữ liệu bao gồm hình thức và định dạng; trang SO-100hướng dẫn SO-100 đầy đủ bao gồm việc xây dựng và hiệu chuẩn. Thông tin cơ bản: tổng quan về VLAbài viết về khớp dòng Pi0. Điều sẽ nâng cao tỷ lệ thành công của bạn là hướng dẫn chất lượng dữ liệu.

Tôi nên huấn luyện chính sách VLA nào trước tiên trên SO-100?

ACT, sau đó là SmolVLA. ACT huấn luyện từ đầu, vì vậy nó không thể che giấu một bộ dữ liệu kém chất lượng, và một lần chạy tốn 1 đến 3 USD trên một card 24 GB. Nếu ACT thực hiện được nhiệm vụ, thì 4 đến 12 USD cho một lần chạy GR00T N1.7 hoặc Pi0.5 sẽ không bị lãng phí.

GR00T N1.7 có thực sự tốt hơn Pi0.5 không?

Trên LIBERO, chúng nằm trong phạm vi nhiễu: 97.0% trên bốn bộ thử nghiệm cho GR00T N1.7, 96.85% cho Pi0.5 ở 30k bước trong openpi, 97.5% cho phiên bản LeRobot, tất cả đều từ các hệ thống khác nhau. Sự khác biệt thực sự là 152 ms mỗi bước hành động so với 485 ms, bộ dữ liệu v2.1 so với v3.0, và độ chính xác theo điểm chuẩn so với khả năng tổng quát hóa trong thế giới mở.

Tôi có thể tinh chỉnh bất kỳ mô hình nào trong số này trên một card RTX 4090 duy nhất không?

SmolVLA và ACT, có; cả hai đều được liệt kê cho RTX 4090 hoặc bất kỳ card 24 GB nào và chạy cục bộ. GR00T N1.7, N1.5 và Pi0.5 cần A100 hoặc H100 80 GB và chỉ chạy trên đám mây ở đây. NVIDIA khuyến nghị 40 GB trở lên để tinh chỉnh GR00T; mức tối thiểu của openpi là trên 70 GB cho một lần tinh chỉnh Pi0.5 đầy đủ, 22.5 GB cho LoRA.

Trong số năm mô hình này, tôi có thể sử dụng mô hình nào cho mục đích thương mại?

Trọng số của GR00T N1.7 thuộc Thỏa thuận Giấy phép Mô hình Mở của NVIDIA, mà card ghi rõ là bao gồm sử dụng thương mại. Trọng số của N1.5 là phi thương mại. Mã của SmolVLA là Apache 2.0 trong LeRobot, nhưng card lerobot/smolvla_base không có trường giấy phép, vì vậy trọng số không được nêu rõ. ACT không có trọng số cơ bản để cấp phép. Pi0.5 không rõ ràng: tài liệu của LeRobot nói Apache 2.0, siêu dữ liệu card của nó ghi license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started