
GR00T N1.7, Pi0.5, SmolVLA, ACT hay GR00T N1.5? Một bảng quyết định phù hợp với các tình huống thực tế, cùng với các số liệu điểm chuẩn đã công bố, độ trễ, chi phí mỗi lần chạy và giấy phép đằng sau mỗi lựa chọn.
Năm chính sách có thể được huấn luyện trên một cánh tay robot lớp SO-100 hiện nay. Chúng khác nhau 24 lần về độ trễ suy luận, 37 lần về số lượng tham số và 12 lần về chi phí cho một lần chạy, cũng như về việc bạn có thể xuất bản kết quả hay không. Năm thẻ mô hình sẽ không giải quyết được vấn đề: không có thẻ nào trả lời câu hỏi của bạn, tôi nên chạy cái nào trước?
Mọi con số dưới đây đều được trích từ các bài báo, kho lưu trữ và thẻ vào tháng 8 năm 2026. Các con số về nền tảng đến từ danh mục chính sách của AY-Robots; nơi hai bên không thống nhất, cả hai đều được hiển thị.
Phiên bản tóm tắt
- •Huấn luyện ACT trước nếu bạn nghi ngờ về tập dữ liệu của mình: 1 đến 3 USD cho mỗi lần chạy, không có gì được huấn luyện trước để che đậy dữ liệu xấu.
- •GR00T N1.7 và Pi0.5 nằm trong khoảng nửa điểm trên LIBERO, 97.0 so với 96.85 đến 97.5. Đó không phải là lý do để chọn cái nào.
- •Pi0.5 là lựa chọn ưu tiên cho khả năng tổng quát hóa, không phải độ chính xác, và là chậm nhất ở 485 ms.
- •SmolVLA, với 450 M tham số, là VLA duy nhất ở đây có thể tinh chỉnh trên một card 24 GB.
- •ACT ở 20 ms là lựa chọn duy nhất cho chuyển động phản ứng nhanh. Giấy phép quyết định phần còn lại.
Bảng quyết định
| Tình huống của bạn | Huấn luyện cái này | Lý do |
|---|---|---|
| Chất lượng tập dữ liệu chưa được chứng minh | ACT | Không có gì được huấn luyện trước có thể che giấu một tập dữ liệu bị lỗi, và thất bại tốn 1 đến 3 USD. |
| Giàu tương tác, đa bước, có điều kiện ngôn ngữ | GR00T N1.7 | Đạt 97.0% trên bốn bộ LIBERO, cộng với không gian hành động tương đối của đầu cuối. |
| Chuyển động phản ứng nhanh, suy luận tại các servo | ACT | 20 ms. Tốc độ nhanh nhất tiếp theo chậm hơn 7.6 lần. |
| Vật thể mới, cảnh mới, thế giới mở | Pi0.5 | Được xây dựng cho hành vi ngoài phân phối, trên tối đa 104 vị trí. |
| Một card 24 GB, vẫn muốn ngôn ngữ | SmolVLA | 450 triệu tham số, tối thiểu 30 tập, chạy cục bộ. |
| Tái tạo một lần chạy được ghi lại vào năm 2025 | GR00T N1.5 | Chỉ khi bạn bắt buộc: LeRobot hiện từ chối nó, trọng số không dùng cho mục đích thương mại. |
| Cái này sẽ được phát hành dưới dạng sản phẩm | N1.7, SmolVLA or ACT | N1.5 không dùng cho mục đích thương mại, Pi0.5 tuân theo các điều khoản của Gemma, card của SmolVLA không ghi gì. |
Năm ứng cử viên
Cả năm đều là chính sách: khung hình camera, vị trí khớp và, đối với bốn trong số đó, một hướng dẫn ngôn ngữ, được ánh xạ tới một phần các mục tiêu khớp trong tương lai. Điều phân biệt chúng là mức độ đã được học trước khi bạn đến.
| Chính sách | Tham số | Độ trễ | Cấp GPU | Cục bộ? | Số tập tối thiểu | Định dạng | Chi phí |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | có | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | có | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | không | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | không | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | không | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Mô hình hiện tại của NVIDIA mô hình hành động-ngôn ngữ-thị giác, khoảng 3 tỷ tham số, khoảng 40 triệu được huấn luyện trong quá trình tinh chỉnh. Kho lưu trữ liệt kê các thay đổi từ N1.6: xương sống từ mô hình Eagle của nhà cung cấp sang Cosmos-Reason2-2B trên Qwen3-VL, các lớp khuếch tán từ 32 xuống 16, kích thước trạng thái và hành động từ 29 lên 132, tầm hành động từ 16 lên 40.
Điều quan trọng đối với một cánh tay robot nhỏ là không gian hành động tương đối của bộ phận cuối: N1.7 dự đoán các thay đổi từ tư thế hiện tại, đây là điều cho phép 20K giờ video người EgoScale chuyển đổi thành chính sách robot. Thông số kỹ thuật trên trang N1.7, quy trình trong hướng dẫn N1.7 trên SO-100.
README của Isaac-GR00T tuyên bố N1.7 là một bản phát hành Sẵn sàng chung, với các điểm chuẩn và hỗ trợ đầy đủ. Thẻ Hugging Face của nó chưa được cập nhật: trường Phiên bản Mô hình vẫn hiển thị GR00T N1.7 EA. Kho lưu trữ là tài liệu mới hơn.
GR00T N1.5
Cùng quy mô 3 B, kiến trúc Eagle 2, SigLip2 và T5, đầu DiT khớp dòng chảy. Nó tồn tại để mở rộng một điểm kiểm tra bạn đã có. Hai điều khiến nó trở thành một lựa chọn mặc định kém: các trọng số mang giấy phép phi thương mại một chiều của NVIDIA, và các bản phát hành LeRobot hiện tại đã loại bỏ hỗ trợ N1.5. Xem N1.7 so với N1.5.
Pi0.5
VLA khớp dòng chảy của Physical Intelligence, loại chính sách khớp dòng chảy. Bài báo trình bày một VLM 2 B được khởi tạo từ PaliGemma cộng với một chuyên gia hành động 300 M, điều khiển robot ở tốc độ 50 Hz; cấu hình pi05 của LeRobot mặc định là một khối 50 bước, một giây ở tốc độ đó. Điểm bán hàng là những nơi chưa từng thấy: khoảng 400 giờ thao tác di động trong các ngôi nhà thực tế, và một nghiên cứu mở rộng quy mô trên 3, 12, 22, 53, 82 và 104 địa điểm, trong đó mô hình 104 địa điểm khớp với một điều khiển được huấn luyện trên chính các ngôi nhà thử nghiệm.
Một giới hạn, được nêu trên lerobot/pi05_base thẻ: cổng chỉ mang đầu hành động khớp với luồng. Dự đoán tác vụ con, mã hóa hành động và RL không được phát hành từ upstream, và openpi cũng nói điều tương tự về kho lưu trữ của riêng nó. Trang Pi0.5 và hướng dẫn Pi0.5 trên SO-100 có phần còn lại.
Pi0.5 cần bộ mã hóa google/paligemma-3b-pt-224 có cổng (gated: manual, mặc dù Google nói rằng các yêu cầu được xử lý ngay lập tức). Nếu không chấp nhận nó và chạy hf auth login trong môi trường đào tạo, công việc sẽ bắt đầu, tải xuống một lúc, sau đó chết vì lỗi ủy quyền trông giống như lỗi mạng. nvidia/GR00T-N1.7-3B không có cổng, nhưng xương sống nvidia/Cosmos-Reason2-2B của nó thì có (gated: auto). Xóa cả hai trước khi xếp hàng; nếu một lần chạy ở trạng thái chờ, trang hàng đợi bị kẹt liệt kê những gì cần kiểm tra.
SmolVLA
450 triệu tham số, khoảng 100 triệu trong chuyên gia hành động, trên SmolVLM-2 với VLM bị đóng băng và chỉ 16 lớp mô hình ngôn ngữ đầu tiên được sử dụng. Huấn luyện trước là dữ liệu cộng đồng: 481 bộ dữ liệu, 10.6 triệu khung hình, từ cùng cánh tay giá rẻ mà bạn sử dụng. VLA duy nhất ở đây phù hợp với một thẻ 24 GB, và là 30 tập sàn. Xem trang SmolVLA.
ACT
Không phải là một mô hình nền tảng. Action Chunking Transformer từ ALOHA có khoảng 80 triệu tham số được huấn luyện từ đầu cho mỗi tác vụ, trên 50 bản trình diễn ở tần số 50 Hz. Bài báo báo cáo sáu tác vụ hai tay thực tế từ khoảng mười phút trình diễn mỗi tác vụ, đạt 80 đến 90 phần trăm trên các ví dụ mà nó làm nổi bật. Ý tưởng của nó, phân đoạn hành động, có mặt trong mọi mô hình trên trang này, và phân tích loại bỏ của nó vẫn đo lường hiệu quả tốt nhất: trên hai tác vụ mô phỏng với tính năng kết hợp thời gian tắt, tỷ lệ thành công tăng từ 1 phần trăm ở k=1 lên 44 phần trăm ở k=100. Trang ACT có phần còn lại.
Những gì các điểm chuẩn thực sự nói
LIBERO là một điểm chuẩn mà ba trong số năm mô hình này báo cáo: các tác vụ được điều kiện bằng ngôn ngữ trên một mô phỏng Franka Panda, được chia thành bốn bộ dưới đây, mỗi bộ mười tác vụ. NVIDIA đã chạy 200 thử nghiệm cho mỗi bộ.
| Mô hình | Không gian | Đối tượng | Mục tiêu | 10 (Dài) | Trung bình |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Mỗi con số đến từ một bộ kiểm tra và ngân sách khác nhau. GR00T chạy 20K bước với batch toàn cầu 640; số liệu openpi là một checkpoint 30K; phiên bản LeRobot đã thêm 6K bước vào một mô hình cơ sở LIBERO. SmolVLA là một sự không khớp hơn nữa: bài báo của nó huấn luyện hàng đó trên LIBERO từ đầu, không có tiền huấn luyện VLA, trong khi ba mô hình trên nó tinh chỉnh các checkpoint đã được tiền huấn luyện. Hãy coi 96.85 đến 97.5 là một cụm, và khoảng cách đến 87.3% là có thật nhưng đạt được với số lượng tham số gấp 6.7 lần.
SimplerEnv cho thấy sự phân tán, điều mà LIBERO không làm được. NVIDIA so sánh N1.7 với N1.6, điều công khai gần nhất với một delta thế hệ.
| Bộ SimplerEnv | Trung bình N1.6 | Trung bình N1.7 | Biến động tốt nhất | Biến động tệ nhất |
|---|---|---|---|---|
| Bridge (WidowX), 7 tác vụ | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tác vụ | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | không có, mọi tác vụ đều được cải thiện |
Hàng Bridge là hàng hữu ích: trung bình tăng 5.7 điểm trong khi put_eggplant_in_basket mất 36 và put_eggplant_in_sink giảm từ 33 xuống 2. Một thế hệ mới di chuyển phân phối thay vì nâng nó lên, vì vậy nếu nhiệm vụ của bạn nằm ở nơi N1.7 bị suy giảm, thì giá trị trung bình không nói lên điều gì.

Trong số năm mô hình, chỉ có bài báo SmolVLA báo cáo về một cánh tay lớp SO-100: 78.3 phần trăm cho SmolVLA và 61.7 cho Pi0 trên ba nhiệm vụ, cả hai đều là đa nhiệm, so với 48.3 cho ACT được huấn luyện đơn nhiệm, điều này không phải là so sánh tương đương. Cặp đôi rõ ràng là cả hai đều đơn nhiệm trên SO-101 pick-and-place: 90 so với 70 trong phân phối, 50 so với 40 ngoài phân phối. So sánh trên ACT so với SmolVLA và Pi0.5 so với SmolVLA, hoặc duyệt đấu trường.
Độ trễ và chi phí quyết định việc triển khai
Độ trễ suy luận là ràng buộc mà mọi người phát hiện ra sau cùng và hối tiếc đầu tiên. Một chính sách tốt hơn năm điểm trên một tiêu chuẩn nhưng mất nửa giây cho mỗi bước hành động sẽ trông tệ hơn trên bàn làm việc của bạn: động lực học tiếp xúc không chờ đợi.
Một lưu ý: số liệu của GR00T không khớp với thẻ của NVIDIA, vốn tính toán 4 bước khử nhiễu và một camera ở 85.8 ms trên H100 ở chế độ eager, 48.6 ms với torch.compile, 27.9 ms thông qua TensorRT đầy đủ. Con số 152 ms ở đây là số liệu toàn bộ ngăn xếp bao gồm chi phí phục vụ và nhiều hơn một camera, không phải là một forward pass.
Vòng lặp 20 đến 485 ms là của mô hình, và các chuyến đi khứ hồi qua internet công cộng làm tăng thêm thời gian đó. Suy luận từ xa khả thi cho các tác vụ gắp đặt chậm, không phải cho chuyển động phản ứng nhanh. Nếu tác vụ của bạn cần tốc độ, suy luận phải nằm cạnh các servo: ACT hoặc SmolVLA, cục bộ. Liên quan: chính sách bị đóng băng giữa chừng chuyển động.
Một cách để tiết kiệm thời gian mà không thay đổi mô hình: bài báo SmolVLA đo lường việc thực thi đồng bộ, trong đó chính sách hoàn thành một phần trước khi dự đoán phần tiếp theo, so với bất đồng bộ, nơi dự đoán chồng chéo với việc thực thi. Tỷ lệ thành công tương tự, 78.3 so với 73.3, nhưng cùng một tác vụ gắp đặt mất 9.7 giây thay vì 13.75, và trong một cửa sổ cố định, robot thực hiện được 19 chu kỳ thay vì 9.
Giấy phép, đã kiểm tra vì không ai kiểm tra chúng
| Mô hình | Giấy phép trọng số | Giấy phép mã nguồn | Sử dụng thương mại |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; thẻ cho phép sử dụng thương mại | Apache 2.0 | có |
| GR00T N1.5 | Giấy phép phi thương mại một chiều của NVIDIA | Apache 2.0 | không |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | đọc cả hai, chúng không khớp |
| SmolVLA | không có trường giấy phép trên thẻ smolvla_base | Apache 2.0 (LeRobot) | mã nguồn có, trọng số không được nêu |
| ACT | không có trọng số cơ sở nào tồn tại | Apache 2.0 (LeRobot) | có |
Dòng Pi0.5 cần được chú ý. Tài liệu LeRobot pi05 nêu rõ Apache 2.0 phù hợp với openpi, trong khi thẻ Hub cho lerobot/pi05_base mang license: gemma. Cả hai đều đang hoạt động. GR00T N1.7 có một phiên bản nhẹ hơn: README của Isaac-GR00T nói thoáng qua rằng N1.7 có thể được cấp phép thương mại đầy đủ theo Apache 2.0, trong khi phần giấy phép riêng của nó và thẻ mô hình chỉ đặt mã nguồn dưới Apache 2.0 và trọng số dưới NVIDIA Open Model License.
Các cài đặt mặc định bạn sẽ thực sự chạy
Mỗi biểu mẫu huấn luyện viên đi kèm với một cài đặt mặc định và chúng không phải là tùy ý. Các cài đặt của ACT là của riêng LeRobot: batch 8, lr 1e-5, 100000 bước huấn luyện, kích thước chunk 100, khớp với ACTConfig upstream và k=100 từ bài báo ACT. Một cột dưới đây là một cái bẫy.
| Chính sách | Batch | LR | Số bước tối đa | Tích lũy Grad | Áp dụng? | Các tùy chỉnh bổ sung |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | có | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | có | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | không (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | không | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | không | chunkSize, nActionSteps, seed, logFreq |
Điểm vào fine-tuning của GR00T (launch_finetune.py, một CLI tyro) không có trường seed trong dataclass cấu hình của nó, do đó các lần chạy không thể tái tạo bit-for-bit. Kho lưu trữ cũng cảnh báo về sự khác biệt từ 5 đến 6 phần trăm giữa các lần chạy do các phép tăng cường hình ảnh không xác định, lớn hơn hầu hết các khoảng cách điểm chuẩn được tranh luận trực tuyến. Seed mặc định của LeRobot là 1000. Cột tích lũy grad mô tả lerobot 0.5.1; upstream 0.6.2 hiển thị nó dưới dạng --accelerator.gradient_accumulation.steps.
Tùy chỉnh quan trọng hơn lựa chọn mô hình
Đây là khối hành động. Các khối dài hơn mang lại chuyển động mượt mà hơn và ít lỗi tích lũy hơn, nhưng chính sách được cam kết trong khi khối thực thi, vì vậy nó phản ứng chậm với bất kỳ thứ gì di chuyển: tự tin trên một khối lập phương tĩnh, vô vọng trên một khối lăn. Nếu nó vượt quá, việc rút ngắn phần đã thực thi tốt hơn việc đào tạo lại và miễn phí. Một khớp dừng sớm là một vấn đề khác; xem .
- ACT: ACTConfig mặc định là
chunk_size 100vàn_action_steps 100. Tập hợp thời gian (Temporal ensembling) bị tắt và yêu cầun_action_steps 1. - GR00T N1.7: tầm nhìn nội bộ (internal horizon) đã tăng từ 16 lên 40, nhưng ví dụ SO-101 của LeRobot vẫn chạy
--policy.chunk_size=16 --policy.n_action_steps=16. Cờ rollout đã được đổi tên thành--execution-horizon. - Pi0.5: một khối 50 bước, trong đó công thức LIBERO của LeRobot thực thi 10 bước thông qua
--policy.n_action_steps=10; với--policy.pretrained_pathnó sẽ trở lại 50 nếu bạn bỏ qua cờ này. - SmolVLA: các khối 50 hành động, cả hai tùy chỉnh đều được hiển thị.
Cách sàng lọc cả năm trong một buổi chiều
Câu trả lời rẻ nhất không phải là đọc thêm. Hãy chi khoảng 15 USD và để cánh tay robot cho bạn biết: ghi lại một lần, đào tạo mô hình rẻ trước, sau đó mở rộng khi dữ liệu đã được chứng minh là đáng tin cậy. Cấu trúc quan trọng hơn số lượng, đó là điểm chính của và .
- 1Ghi lại 50 tập một lần
Năm mươi tập dọn đường cho GR00T, Pi0.5 và ACT, cùng với 30 tập của SmolVLA. Lặp lại từng biến thể thay vì dàn trải mỏng: 50 tập trên 5 vị trí khối lập phương được huấn luyện, trong khi 25 tập thì không. Xem ghi lại tập dữ liệu đầu tiên của bạn.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Huấn luyện ACT trước, vì nó không thể nói dối bạn
Không có trọng số được huấn luyện trước, vì vậy nếu nó thực hiện được nhiệm vụ, tập dữ liệu của bạn chứa nhiệm vụ đó. Nếu ACT không hoạt động, hãy sửa dữ liệu. 1 đến 3 USD, 2 đến 5 giờ trên thẻ 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Chạy SmolVLA trên cùng tập dữ liệu, không thay đổi
Cùng dữ liệu, cùng cánh tay, 450 triệu tham số thay vì 80 triệu, cộng với điều kiện ngôn ngữ. LeRobot ước tính một lần chạy 20K bước mất khoảng 4 giờ trên một A100. Đây là điều cho bạn biết liệu việc huấn luyện trước có mang lại lợi ích gì không.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Chuyển đổi xuống v2.1 trước khi bạn chạm vào GR00T
GR00T đọc một biến thể của định dạng LeRobot v2 cộng với một tệp
meta/modality.jsonbổ sung để ánh xạ cách các mảng trạng thái và hành động được nối với nhau phân tách thành các trường có tên. Một tập dữ liệu v3.0 làm hỏng trình tải đó, vì v3.0 đóng gói nhiều tập vào các tệp dùng chung trong khi v2 ghi một tệp cho mỗi tập. Isaac-GR00T cung cấp công cụ hỗ trợ hạ cấp dưới dạngscripts/lerobot_conversion/convert_v3_to_v2.py; trang từ chối v3 là con đường nhanh chóng.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Chỉ nâng cấp lên GR00T N1.7 nếu hai bước đầu tiên còn bỏ sót điều gì đó
Thông qua CLI của NVIDIA, được hiển thị ở đây, hoặc loại chính sách
grootcủa LeRobot. NVIDIA khuyến nghị 40 GB VRAM trở lên để tinh chỉnh, 16 GB để suy luận. Khi gặp lỗi OOM, hãy xem trang OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Hai cách để chạy bước sàng lọc đó
Ba môi trường, vì các chuỗi công cụ không cùng tồn tại. LeRobot trên nhánh chính là 0.6.2 và cần Python 3.12 trở lên; Isaac-GR00T và openpi là các kho lưu trữ riêng biệt được quản lý bằng uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T ghim
torchcodec0.8.0 làm backend video duy nhất của nó, yêu cầu FFmpeg 4 đến 7. FFmpeg 8 không được hỗ trợ, AV1 không được đảm bảo. - Yêu cầu bộ nhớ tối thiểu của openpi: suy luận trên 8 GB, LoRA trên 22.5 GB, tinh chỉnh hoàn chỉnh trên 70 GB. Yêu cầu cuối cùng đó là lý do tại sao Pi0.5 là một tác vụ A100.
- Tự thuê GPU, hủy bỏ sau đó, tự đối chiếu ba bộ đường dẫn checkpoint.
Năm mô hình tương tự, một biểu mẫu. Chọn mô hình, tập dữ liệu và siêu tham số; backend thuê một GPU có kích thước phù hợp với VRAM yêu cầu, chạy trình huấn luyện và ghi các vào bộ lưu trữ đối tượng.
- Ma trận huấn luyện là năm mô hình với bốn cánh tay, mỗi ô là một hướng dẫn: SmolVLA trên SO-100, ACT trên SO-101.
- Các pod suy luận được tự động cấp phát bởi
/api/inference/podvới một bộ giám sát không hoạt động, vì vậy một pod bị quên sẽ không tính phí một cách âm thầm. - Các checkpoint cơ sở là của các nhà cung cấp:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT không có. - Các thao tác tương tự từ CLI và từ các tác nhân AI thông qua máy chủ MCP.
- Không có phần cứng? Cánh tay robot trực tiếp truyền phát SO-100 vật lý mà không cần đăng ký; trang dùng thử hiển thị các cách truy cập.
Mô hình nền tảng hay từ đầu
Vấn đề thực sự không phải là chọn mô hình 3 B nào. Mà là liệu có nên sử dụng VLA được huấn luyện trước hay không, khi mà ACT đã học sáu nhiệm vụ song thủ thực tế từ khoảng mười phút trình diễn mỗi nhiệm vụ, với 80 triệu tham số và không có gì được huấn luyện trước.
- Điều kiện hóa ngôn ngữ. ACT không có; một checkpoint của ACT chỉ thực hiện một nhiệm vụ.
- Tốt hơn với các đối tượng không có trong các bản trình diễn của bạn: trên SO-101, 50% so với 40% của ACT ngoài phân phối.
- Đa nhiệm hoàn toàn: SmolVLA đạt 78.3% trên ba nhiệm vụ SO-100 với một checkpoint; ACT chỉ được chạy đơn nhiệm.
- Độ trễ gấp 7.6 đến 24 lần: 152 đến 485 ms cho mỗi bước hành động so với 20 ms của ACT.
- 4 đến 12 USD mỗi lần chạy thay vì 1 đến 3, và cần GPU A100 thay vì bất kỳ card 24 GB nào.
- Rủi ro về giấy phép, cộng với chế độ lỗi kho lưu trữ có kiểm soát không tồn tại khi bắt đầu từ đầu.
- Các trọng số được huấn luyện trước có thể che giấu một tập dữ liệu kém chất lượng. Một lần tinh chỉnh hoạt động một nửa trên dữ liệu bị lỗi sẽ tốn một tuần trước khi bạn xem xét dữ liệu.
Trường hợp tái tạo một lần chạy cũ
Việc theo đuổi một checkpoint năm 2025 sẽ quyết định lựa chọn mô hình cho bạn và biến vấn đề thành việc ghim phiên bản: LeRobot hiện tại từ chối N1.5, vì vậy bạn ghim lerobot==0.5.1. Với trường seed trống và độ lệch 5 đến 6 phần trăm giữa các lần chạy, việc tái tạo chỉ mang tính xấp xỉ theo thiết kế. và có phần nền tảng.

Chỉ còn hai? ACT với GR00T N1.7 và GR00T N1.7 với SmolVLA. Các hàng dữ liệu thô nằm trong các mục đấu trường: GR00T N1.7, Pi0.5, SmolVLA và ACT.
Nơi nền tảng này không giúp ích được cho bạn
- Nó không thể làm cho suy luận từ xa nhanh chóng. Vòng lặp 20 đến 485 ms thuộc về mô hình; các chuyến đi khứ hồi qua internet sẽ làm tăng thêm thời gian này.
- Nó không thể tinh chỉnh GR00T hoặc Pi0.5 trên phần cứng của riêng bạn. Cả hai đều chỉ chạy trên đám mây ở đây; chỉ SmolVLA và ACT chạy cục bộ.
- Nó không thể sửa một tập dữ liệu. Mất mát giảm nhưng chính sách không làm gì là một vấn đề về dữ liệu, một chính sách chỉ hoạt động trong một thiết lập là một vấn đề về độ bao phủ.
- Nó không thể làm cho các lần chạy GR00T có thể tái tạo: cấu hình upstream không có trường seed.
85 mô hình, 332 kết quả benchmark, mọi con số đều có liên kết đến nguồn của nó
Phiên bản có thể sắp xếp của các bảng trên trang này: 85 mô hình thị giác-ngôn ngữ-hành động, 332 kết quả benchmark, mỗi kết quả được liên kết trở lại bài báo hoặc thẻ mô hình của nó.
Mở đấu trườngChọn một và tiếp tục
Một mặc định: ghi lại 50 tập, huấn luyện ACT với chi phí 1 đến 3 USD để chứng minh tập dữ liệu, sau đó là SmolVLA trên cùng dữ liệu. Tổng cộng dưới 6 USD, và chúng trả lời câu hỏi quan trọng: liệu việc tiền huấn luyện có giúp ích ở đây không, hay liệu nút thắt cổ chai có phải là dữ liệu không. Nâng cấp lên GR00T N1.7 cho các tác vụ đa bước giàu tiếp xúc, lên Pi0.5 khi cảnh thay đổi.
Hướng dẫn nền tảng: huấn luyện chính sách đầu tiên của bạn, sau đó chạy chính sách đầu tiên của bạn. Các tài liệu huấn luyện và tài liệu tập dữ liệu bao gồm hình thức và định dạng; trang SO-100 và hướng dẫn SO-100 đầy đủ bao gồm việc xây dựng và hiệu chuẩn. Thông tin cơ bản: tổng quan về VLA và bài viết về khớp dòng Pi0. Điều sẽ nâng cao tỷ lệ thành công của bạn là hướng dẫn chất lượng dữ liệu.
Tôi nên huấn luyện chính sách VLA nào trước tiên trên SO-100?▾
ACT, sau đó là SmolVLA. ACT huấn luyện từ đầu, vì vậy nó không thể che giấu một bộ dữ liệu kém chất lượng, và một lần chạy tốn 1 đến 3 USD trên một card 24 GB. Nếu ACT thực hiện được nhiệm vụ, thì 4 đến 12 USD cho một lần chạy GR00T N1.7 hoặc Pi0.5 sẽ không bị lãng phí.
GR00T N1.7 có thực sự tốt hơn Pi0.5 không?▾
Trên LIBERO, chúng nằm trong phạm vi nhiễu: 97.0% trên bốn bộ thử nghiệm cho GR00T N1.7, 96.85% cho Pi0.5 ở 30k bước trong openpi, 97.5% cho phiên bản LeRobot, tất cả đều từ các hệ thống khác nhau. Sự khác biệt thực sự là 152 ms mỗi bước hành động so với 485 ms, bộ dữ liệu v2.1 so với v3.0, và độ chính xác theo điểm chuẩn so với khả năng tổng quát hóa trong thế giới mở.
Tôi có thể tinh chỉnh bất kỳ mô hình nào trong số này trên một card RTX 4090 duy nhất không?▾
SmolVLA và ACT, có; cả hai đều được liệt kê cho RTX 4090 hoặc bất kỳ card 24 GB nào và chạy cục bộ. GR00T N1.7, N1.5 và Pi0.5 cần A100 hoặc H100 80 GB và chỉ chạy trên đám mây ở đây. NVIDIA khuyến nghị 40 GB trở lên để tinh chỉnh GR00T; mức tối thiểu của openpi là trên 70 GB cho một lần tinh chỉnh Pi0.5 đầy đủ, 22.5 GB cho LoRA.
Trong số năm mô hình này, tôi có thể sử dụng mô hình nào cho mục đích thương mại?▾
Trọng số của GR00T N1.7 thuộc Thỏa thuận Giấy phép Mô hình Mở của NVIDIA, mà card ghi rõ là bao gồm sử dụng thương mại. Trọng số của N1.5 là phi thương mại. Mã của SmolVLA là Apache 2.0 trong LeRobot, nhưng card lerobot/smolvla_base không có trường giấy phép, vì vậy trọng số không được nêu rõ. ACT không có trọng số cơ bản để cấp phép. Pi0.5 không rõ ràng: tài liệu của LeRobot nói Apache 2.0, siêu dữ liệu card của nó ghi license: gemma.
Sources
- Kho lưu trữ NVIDIA Isaac-GR00T: trạng thái GA, thay đổi từ N1.6 sang N1.7, yêu cầu phần cứng, ràng buộc torchcodec và FFmpeg, launch_finetune.py, phương sai giữa các lần chạy
- Thẻ mô hình nvidia/GR00T-N1.7-3B: kiến trúc Cosmos-Reason2-2B, 3 tỷ tham số, bảng thời gian suy luận, Giấy phép Mô hình Mở của NVIDIA, trường Phiên bản Mô hình
- Thẻ mô hình nvidia/GR00T-N1.5-3B: tham chiếu Eagle 2, SigLip2 và T5, DiT khớp luồng, giấy phép phi thương mại một chiều
- Ví dụ Isaac-GR00T LIBERO: tỷ lệ thành công trên mỗi bộ thử nghiệm ở 20K bước và kích thước lô 640, 200 thử nghiệm mỗi bộ
- Ví dụ Isaac-GR00T SimplerEnv: tỷ lệ thành công Bridge và Fractal trên mỗi nhiệm vụ, GR00T N1.6 so với N1.7
- pi0.5: Mô hình Thị giác-Ngôn ngữ-Hành động với Khả năng Tổng quát hóa Thế giới Mở (VLM 2 tỷ cộng với chuyên gia hành động 300 triệu, điều khiển 50 Hz, khoảng 400 giờ thao tác di động, nghiên cứu mở rộng trên 3 đến 104 vị trí)
- Kho lưu trữ openpi: giới hạn bộ nhớ GPU, phạm vi chỉ đầu khớp luồng, và kết quả Pi0.5 LIBERO trong examples/libero
- Thẻ mô hình lerobot/pi05_base: phạm vi của phiên bản LeRobot, siêu dữ liệu license: gemma, cách sử dụng lerobot-train
- Tài liệu LeRobot pi0.5: bộ mã hóa PaliGemma có cổng, bảng tái tạo LIBERO, bẫy dự phòng n_action_steps, tuyên bố Apache 2.0
- SmolVLA: Mô hình Thị giác-Ngôn ngữ-Hành động cho Robot học Giá cả phải chăng và Hiệu quả (450 triệu tham số, bảng LIBERO và Meta-World, kết quả SO-100 và SO-101, suy luận không đồng bộ)
- Tài liệu LeRobot SmolVLA: 50 tập trên 5 vị trí so với 25, 20k bước trong khoảng 4 giờ trên A100
- Học Thao tác Hai tay Tinh tế với Phần cứng Chi phí Thấp (ACT và ALOHA): 6 nhiệm vụ đạt 80-90 phần trăm, phân tích kích thước khối từ k=1 đến k=100
- LeRobot 0.6.2: mặc định ACTConfig và SmolVLAConfig, seed mặc định 1000, --accelerator.gradient_accumulation.steps, yêu cầu Python 3.12, Apache 2.0
- Tài liệu LeRobot GR00T: loại chính sách groot, hỗ trợ N1.5 đã bị loại bỏ, pin lerobot==0.5.1, ví dụ kích thước khối SO-101
- Thẻ mô hình lerobot/smolvla_base: điểm kiểm tra cơ sở SmolVLA được sử dụng bởi --policy.path, và siêu dữ liệu thẻ của nó, không có trường giấy phép
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started