Mục từ điển AY-Robots cho định dạng tập dữ liệu LeRobot, định dạng mà mọi trình huấn luyện trên nền tảng đều sử dụng, cho dù các tập được ghi lại hay tạo ra.
dữ liệu tổng hợpsim-to-realIsaac Labhọc bắt chướcMimicGenSO-101

Dữ liệu tổng hợp cho các chính sách robot: Nơi mô phỏng hỗ trợ

AY-Robots ResearchAugust 23, 202631 phút đọc

Mô phỏng có thể nhân một vài bản trình diễn thành hàng nghìn. Dưới đây là những gì các con số đã công bố thực sự nói lên, nơi khoảng cách sim-to-real gây khó khăn và những gì vẫn cần được ghi lại.

Cứ vài tháng lại có người nhận ra rằng việc ghi lại năm mươi tập bằng tay thì chậm, và hỏi liệu một trình mô phỏng có thể tạo ra chúng thay thế được không. Đó là một câu hỏi hợp lý. Câu trả lời trung thực có ba phần: dữ liệu được tạo ra có ích, nó không thay thế các bản ghi thực tế, và tỷ lệ giữa hai sự thật đó hoàn toàn phụ thuộc vào loại dữ liệu tổng hợp mà bạn muốn nói.

Trang này sẽ trình bày những gì công trình đã công bố thực sự đo lường, những gì bạn có thể chạy hôm nay trên một cánh tay chi phí thấp như SO-100, và nơi khoảng cách từ mô phỏng đến thực tế làm mất đi những lợi ích. Phiên bản ngắn gọn, trước khi đi vào chi tiết: các hệ thống báo cáo các hệ số nhân lớn nhất thường nhân một tập hợp nhỏ các bản trình diễn thực tế của con người. Chúng không loại bỏ nhu cầu về những bản trình diễn đó.

Những điều bạn cần biết

  • Bốn kỹ thuật không liên quan được gọi là dữ liệu tổng hợp trong thao tác: nhân rộng quỹ đạo, triển khai vật lý, mô hình thế giới video và tăng cường không gian hình ảnh. Chúng thất bại theo những cách khác nhau và có giá trị khác nhau.
  • MimicGen đã biến ít hơn 200 bản trình diễn của con người thành hơn 50.000 bản được tạo ra trên 18 nhiệm vụ. Trên nhiệm vụ Square D0 của nó, 200 bản trình diễn được tạo ra từ 10 bản trình diễn của con người đã đạt 79 phần trăm thành công so với 84 phần trăm cho 200 bản trình diễn thực tế của con người.
  • RoboCasa là ví dụ ngược lại: 72.000 bản trình diễn được tạo ra đạt 47.6 phần trăm so với 28.8 phần trăm cho 1.250 bản trình diễn của con người. Đó là lợi thế về khối lượng gấp 58 lần, không phải là một chiến thắng ngang bằng.
  • Nghiên cứu đồng huấn luyện mô phỏng và thực tế báo cáo mức cải thiện trung bình 38 phần trăm trong hiệu suất nhiệm vụ thế giới thực. Công thức là đồng huấn luyện trên một hỗn hợp, không phải chuyển giao chỉ từ mô phỏng.
  • GR00T N1 dựa trên 780.000 quỹ đạo mô phỏng (tương đương 6.500 giờ, được tạo ra trong 11 giờ) và 827 giờ quỹ đạo thần kinh được phát triển từ 88 giờ thực tế. 88 giờ thực tế đó vẫn là đỉnh của kim tự tháp.
  • Đối với một SO-101, hiện có một quy trình làm việc mở: LeIsaac bên trong Isaac Lab, vận hành từ xa bằng cánh tay dẫn hướng vật lý, nhân rộng với Isaac Lab Mimic, xuất sang định dạng LeRobot, tinh chỉnh GR00T.
  • AY-Robots không tạo dữ liệu tổng hợp. Nó huấn luyện trên tập dữ liệu LeRobot mà bạn cung cấp, bất kể tập dữ liệu đó được tạo ra bằng cách nào, và các huấn luyện viên cần tối thiểu 30 đến 50 tập tùy thuộc vào mô hình.

Bốn điều khác nhau được gọi là dữ liệu tổng hợp

Trước khi so sánh các con số, điều đáng làm là phân loại các nhóm, bởi vì một bài báo báo cáo hệ số nhân 100x và một bài báo báo cáo mức tăng thành công 5 điểm thường mô tả cùng một quy trình từ các góc độ khác nhau. Điểm chung là một phần nào đó trong tập dữ liệu LeRobot được tạo ra bởi máy móc thay vì được ghi lại từ một cánh tay vật lý. Điều khác biệt là phần nào.

NhómNhững gì giữ nguyên thực tếNhững gì được tạo raHệ số nhân được báo cáoChế độ lỗi chính
Nhân quỹ đạo (MimicGen, DexMimicGen, Isaac Lab Mimic)Một vài bản demo của con người, lưới đối tượng, công cụ vật lýCác quỹ đạo mới được điều chỉnh theo tư thế đối tượng và bố cục cảnh mới10 bản demo của con người thành 1.000 mỗi phân phối đặt lại; 60 thành 21.000; dưới 200 thành hơn 50.000Các nỗ lực tạo ra thất bại. Isaac Lab đặt tỷ lệ thành công ứng cử viên cao tới 70 phần trăm trong các trường hợp đơn giản và dưới 1 phần trăm trong các trường hợp khó
Triển khai vật lý trong trình mô phỏng tác vụ (Isaac Lab, robosuite, RoboCasa)Công cụ vật lý và thư viện tài sảnToàn bộ tập, được điều khiển bởi các bộ điều khiển, bộ lập kế hoạch hoặc RL được viết kịch bảnChỉ bị giới hạn bởi số giờ GPUCánh tay mô phỏng không phải là cánh tay của bạn. Động lực học tiếp xúc và servo là các xấp xỉ
Mô hình thế giới video (DreamGen, Cosmos Transfer)Một vài tập điều khiển từ xa thực tế được sử dụng làm điều kiệnVideo chân thực về các hành vi mới, cộng với các hành động giả được phục hồi sau đó88 hours to 827 hours in GR00T N1, about 10xCác hành động được suy luận, không được đo lường. Một video hợp lý có thể chứa một hành động không hợp lý
Tăng cường không gian hình ảnh (cắt ngẫu nhiên, nhiễu màu)Mọi thứ trừ các pixelCác chế độ xem bị nhiễu của các tập bạn đã có1x, nó không tạo ra quỹ đạo mới nàoTăng cường hình học phá vỡ mối liên hệ giữa hình ảnh và nhãn hành động

Chỉ ba loại đầu tiên là dữ liệu tổng hợp theo nghĩa mà bài viết này đề cập. Loại thứ tư đáng được nhắc đến vì nó được gộp vào cùng một cuộc trò chuyện và cho đến nay là thứ rẻ nhất trong danh sách. Nếu bạn chưa bật các tính năng tăng cường mà trình huấn luyện của bạn đi kèm, hãy làm điều đó trước khi bạn cài đặt một trình mô phỏng.

Bạn có thể xem dữ liệu tổng hợp thực tế trước khi tạo bất kỳ dữ liệu nào

NVIDIA đã công bố các quỹ đạo mô phỏng được sử dụng cho GR00T N1 sau huấn luyện dưới dạng nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim trên Hugging Face, khoảng 1.87 TB theo giấy phép cc-by-4.0. Nó được chia thành 9.000 quỹ đạo Panda và GR1 hai tay đa thể, 240.000 quỹ đạo người máy trên mặt bàn, 72.000 quỹ đạo Panda đơn trong bếp và 102 quỹ đạo điều khiển di chuyển Unitree G1. Tải xuống một tập con với huggingface-cli download --include "gr1_arms_only.CanSort/**" và xem một vài tập là cách nhanh nhất để hiệu chỉnh xem các quỹ đạo được tạo trông như thế nào, và nó không tốn gì ngoài băng thông.

Những con số được công bố thực sự nói lên điều gì

Đây là cơ sở bằng chứng, với các con số được nêu ra từ các nguồn chứ không phải từ các bản thông cáo báo chí tóm tắt. Mỗi hàng dưới đây đều đến từ một bài báo hoặc trang dự án được đọc vào ngày 23 tháng 8 năm 2026.

Hệ thốngĐầu vàoĐã tạoKết quả báo cáo
MimicGen, CoRL 2023Ít hơn 200 bản demo của con người; 10 bản demo của con người trong cuộc đối đầu trực tiếpHơn 50.000 bản demo, 18 tác vụ, bốn cánh tay (Panda, Sawyer, IIWA, UR5e)Square D0: 79 phần trăm từ 200 bản demo được tạo ra từ 10 bản demo của con người, so với 84 phần trăm từ 200 bản demo của con người
DexMimicGen, 202460 bản demo nguồn của con người21.000 bản demo cho robot khéo léo hai tayCác tác vụ khéo léo hai tay trong mô phỏng, cộng với triển khai phân loại lon của người máy từ thực tế-sang-mô phỏng-sang-thực tế
RoboCasa, 20241.250 bản demo của con người (50 bản mỗi tác vụ trên 25 tác vụ nguyên tử), 100 tác vụ đánh giá, hơn 150 danh mục đối tượng100.000 quỹ đạo MimicGen; tập con 72.000 bản demo thúc đẩy so sánh tiêu đề28.8 phần trăm tổng thể trên tập dữ liệu của con người so với 47.6 phần trăm trên tập dữ liệu được tạo hoàn toàn, chỉ được đánh giá trên các trường hợp đối tượng chưa từng thấy
Đào tạo đồng thời mô phỏng và thực tế, 2025Các bản demo thực tế cộng với tập dữ liệu mô phỏng, hai miền (cánh tay robot và người máy)Một sự kết hợp, không phải là sự thay thếDữ liệu mô phỏng đã nâng cao hiệu suất tác vụ trong thế giới thực trung bình 38 phần trăm
DreamGen, 2025Dữ liệu điều khiển từ xa từ một tác vụ nhặt và đặt duy nhất trong một môi trườngVideo tổng hợp cộng với các hành động giả từ một mô hình hành động tiềm ẩn hoặc một mô hình động lực học nghịch đảo22 hành vi mới trên người máy, trong các môi trường đã thấy và chưa thấy
GR00T N1 data pyramid, 202588 giờ điều khiển từ xa GR-1 nội bộ827 giờ quỹ đạo thần kinh (khoảng 10 lần); 780.000 quỹ đạo mô phỏng, tương đương 6.500 giờ, được tạo ra trong 11 giờCác quỹ đạo thần kinh đã thêm 4.2, 8.8 và 6.8 điểm trên RoboCasa ở các chế độ 30, 100 và 300 bản demo mỗi tác vụ, và trung bình 5.8 điểm trên 8 tác vụ GR-1 thực tế
Đọc các hệ số nhân là số lượng quỹ đạo, không phải khả năng

Hệ số nhân là số lượng hàng. Cuộc đối đầu trực tiếp của MimicGen đặt dữ liệu được tạo ra hơi thấp hơn cùng số lượng dữ liệu của con người (79 so với 84 phần trăm), và phép loại bỏ GR00T N1 thêm các điểm phần trăm một chữ số vào một mô hình đã có số giờ thực tế. RoboCasa thực sự đánh bại dữ liệu của con người, 47.6 so với 28.8 phần trăm, nhưng với 72.000 bản demo được tạo ra so với 1.250 bản demo của con người. Khối lượng mua được phạm vi bao phủ. Nó không mua thông tin mà các bản demo của bạn chưa bao giờ chứa đựng.

Mô hình trên mọi thử nghiệm cắt bỏ (ablation) trung thực đều giống nhau. Dữ liệu tổng hợp mở rộng phạm vi bao phủ một cách rẻ tiền. Nó không tạo ra thông tin về kẹp gắp, độ võng servo, ánh sáng hoặc chiều cao bàn của bạn mà không có sẵn trong các bản trình diễn thực tế ở đâu đó. Nếu chính sách của bạn thất bại vì bộ phận cuối tay máy đóng trễ nửa giây, thì không có lượng biến thể mô phỏng nào có thể khắc phục được. Đó là một vấn đề thời gian kẹp gắp trong các bản ghi thực tế.

Một phát hiện của MimicGen đáng để áp dụng vào các buổi ghi hình của riêng bạn, vì nó đi ngược lại lời khuyên thông thường. Dự án đã tạo ra hai bộ dữ liệu trên Square D2, một bộ được gieo hạt với 10 bản demo từ một người vận hành chất lượng tốt hơn và một bộ với 10 bản demo từ một người vận hành chất lượng kém hơn, cả hai đều được lấy từ bộ dữ liệu robomimic multi-human Square. Các chính sách được huấn luyện trên mỗi bộ đều đạt được kết quả tương đương, điều mà các tác giả coi là dấu hiệu cho thấy trong chế độ dữ liệu quy mô lớn, chất lượng dữ liệu có thể không quan trọng đến vậy. Đọc kỹ, đó là một tuyên bố về mười bản trình diễn hạt giống, chứ không phải về năm mươi tập thực tế của bạn. Điều đó có nghĩa là một bộ hạt giống hơi lộn xộn không phải là thứ ngăn cách bạn với một bộ dữ liệu được tạo ra có thể sử dụng được. Nó không có nghĩa là các tập thực tế mà bạn đồng huấn luyện có thể lộn xộn, bởi vì đó là những tập mang thông tin mà trình mô phỏng không có.

Danh sách thư mục bộ dữ liệu công khai của AY-Robots liệt kê các bộ dữ liệu LeRobot đã ghi với số lượng tập của chúng.
Thư mục bộ dữ liệu công khai tại /directory. Mỗi mục ở đây là các tập đã ghi thực tế. Dữ liệu tổng hợp là một yếu tố nhân lên trên một cái gì đó như thế này, chứ không phải là một sự thay thế cho nó.

Khoảng cách từ mô phỏng đến thực tế, một cách cụ thể

Khoảng cách này thường được thảo luận như một đại lượng duy nhất, điều này không hữu ích. Nó bao gồm ít nhất năm sự không khớp riêng biệt, và chúng có kích thước khác nhau trên một cánh tay robot nghiệp dư giá 110 đến 150 EUR so với trên một Franka.

  • Tiếp xúc và ma sát. Isaac Lab tuyên bố rõ ràng rằng với cùng phần cứng và cùng phiên bản Isaac Sim và PhysX, mô phỏng có thể tái tạo được, nhưng kết quả thay đổi trên các cấu hình phần cứng khác nhau do độ chính xác dấu phẩy động và lỗi làm tròn, và PhysX không đảm bảo tính xác định cho bất kỳ cảnh nào có các vật thể không cứng nhắc như vải hoặc vật thể mềm.
  • Truyền động. Một servo bus Feetech STS3215 chạy ở 7.4 V bị chùng dưới tải, có độ rơ, và thay đổi hành vi khi nóng lên. Mô hình MJCF cho SO-101 mượn các thông số động cơ từ một dự án không liên quan thay vì xác định chúng trên cánh tay robot của bạn.
  • Kết xuất. Nhiễu camera, màn trập cuốn, tự động phơi sáng và màu sắc chính xác của bàn của bạn không có trong kết xuất. Đây là một nửa khoảng cách mà Cosmos-Transfer1 được xây dựng để thu hẹp: quy trình làm việc tăng cường robot của nó ánh xạ một ví dụ tổng hợp robot thành nhiều ví dụ thực tế từ phân đoạn, độ sâu hoặc điều kiện cạnh.
  • Thời gian. Một bộ mô phỏng bước theo một tốc độ cố định. Một vòng điều khiển thực tế thì không, và bản thân mô hình tiêu tốn 20 đến 485 ms cho mỗi bước hành động tùy thuộc vào mô hình bạn chọn. Xem độ trễ suy luận.
  • Thống kê đối tượng. Các cảnh mô phỏng được lấy mẫu từ một phân phối mà ai đó đã viết ra. Bàn bếp của bạn thì không.

Những gì một SO-100 mô phỏng thực sự biết về cánh tay robot của bạn

Đây là phần quyết định xem bất kỳ điều nào ở trên có đáng để bạn dành cuối tuần hay không, và điều ngạc nhiên đầu tiên là SO-100 và SO-101 không được phục vụ như nhau. Kho lưu trữ SO-ARM100 của TheRobotStudio giữ các tài sản mô phỏng của nó dưới Simulation/. Thư mục SO100 chứa một tệp URDF duy nhất và không có gì khác. Thư mục SO101 chứa cả tệp URDF và MuJoCo: scene.xml, so101_new_calib.xml, so101_old_calib.xml, các tệp URDF tương ứng và một joints_properties.xml. Nếu bạn muốn một mô hình vật lý thay vì một chuỗi động học, bạn sẽ cần các tệp SO-101.

Chúng được tạo ra bằng plugin onshape-to-robot từ một mô hình CAD được thiết kế trong Onshape, điều này có nghĩa là động học và lưới hình ảnh tốt như CAD. Động lực học lại là một câu chuyện khác, và README của kho lưu trữ thẳng thắn đề cập đến ba điều. Lưới va chạm cơ sở đã bị loại bỏ do hành vi va chạm có vấn đề trong quá trình mô phỏng và lập kế hoạch. Các thuộc tính động cơ STS3215 được điều chỉnh từ dự án Open Duck Mini thay vì được đo trên SO-101. Và quy ước kẹp của LeRobot, trong đó 0 là đóng hoàn toàn và 100 là mở hoàn toàn, vẫn chưa được phản ánh rõ ràng trong các tệp URDF và MuJoCo. Mỗi điều đó là một điểm mà một chính sách được huấn luyện thuần túy trong mô hình đó sẽ hoạt động khác trên bàn làm việc của bạn.

Quy ước hiệu chuẩn gây mất thời gian

Có hai quy ước điểm không trong các tệp MuJoCo được cung cấp, và scene.xml chọn giữa chúng bằng cách bao gồm tệp robot nào. Trong so101_new_calib.xml, mặc định, điểm không ảo của mỗi khớp nằm ở giữa phạm vi khớp của nó. Trong so101_old_calib.xml, điểm không là cấu hình mà robot được mở rộng hoàn toàn theo chiều ngang. Nếu các tập mô phỏng của bạn sử dụng một quy ước và các tập thực tế đã ghi của bạn sử dụng quy ước khác, mọi góc khớp trong tập dữ liệu hỗn hợp sẽ bị lệch hàng chục độ, tổn thất vẫn giảm, và chính sách thực hiện điều gì đó sai một cách tự tin. Kiểm tra quy ước ở cả hai phía trước khi bạn đồng huấn luyện, và đọc hiệu chuẩntổn thất giảm, chính sách không làm gì trước.

Ngẫu nhiên hóa miền, và những gì nó không khắc phục

Câu trả lời tiêu chuẩn cho khoảng cách này là ngừng cố gắng khớp với thực tế và thay vào đó huấn luyện trên một phân phối đủ rộng để thực tế nằm trong đó. Tobin và các đồng nghiệp đã trình bày phiên bản mạnh mẽ của điều này vào năm 2017: một bộ phát hiện đối tượng được huấn luyện chỉ trên hình ảnh mô phỏng với các kết cấu ngẫu nhiên không thực tế, không có bất kỳ huấn luyện trước nào trên hình ảnh thực, đã định vị các đối tượng thực với độ chính xác 1.5 cm và duy trì khả năng chống lại các yếu tố gây nhiễu và che khuất một phần.

Isaac Lab thể hiện cùng một ý tưởng như các thuật ngữ sự kiện bạn gắn vào cấu hình môi trường. Đây là các nút điều chỉnh, theo tên chức năng thực tế của chúng trong isaaclab.envs.mdp, để bạn có thể đọc chúng thay vì đoán.

Hàm sự kiệnNhững gì nó làm nhiễu loạn
randomize_rigid_body_materialMa sát tiếp xúc và hệ số phục hồi
randomize_rigid_body_mass, randomize_rigid_body_comKhối lượng vật thể và liên kết, độ lệch tâm khối
randomize_actuator_gainsĐộ cứng và giảm chấn của bộ điều khiển khớp
randomize_joint_parameters, randomize_fixed_tendon_parametersMa sát khớp, phần ứng và giới hạn
randomize_visual_texture_material, randomize_visual_colorHình thức, một nửa quang trắc của khoảng cách
randomize_physics_scene_gravityVector trọng lực
apply_external_force_torque, push_by_setting_velocityNhiễu loạn trong thời gian chạy
reset_root_state_uniform, reset_joints_by_offsetTrạng thái ban đầu phân tán tại mỗi lần đặt lại tập

Đây là giới hạn, và đây là điều mà mọi người thường mắc phải. Ngẫu nhiên hóa mở rộng phân phối mà chính sách đã thấy bên trong mô hình bạn xây dựng. Nó không thể đưa vào một hiệu ứng vật lý mà trình mô phỏng không thể hiện. Nếu PhysX không mô hình hóa độ rơ và sự sụt giảm nhiệt của động cơ servo STS3215 của bạn, việc ngẫu nhiên hóa độ cứng của chúng sẽ không dạy cho chính sách bất cứ điều gì về độ rơ. Đó là lý do tại sao một cánh tay mà giật rồi chùng xuống dưới một chính sách được huấn luyện bằng mô phỏng không phải là vấn đề về ngân sách ngẫu nhiên hóa. Đó là một vấn đề về mô hình hóa.

Đường dẫn thủ công: tạo dữ liệu trong Isaac Lab

Isaac Gym là phần mềm cũ. Trang của NVIDIA có tiêu đề "Isaac Gym - Hiện đã lỗi thời" và cho biết các nhà phát triển có thể tải xuống và tiếp tục sử dụng nhưng nó không còn được hỗ trợ, thay vào đó chỉ đến Isaac Lab. Nếu bạn muốn tìm hiểu lịch sử, chúng tôi đã đề cập cả hai: và . Đối với các dự án mới vào năm 2026, hãy bắt đầu với Isaac Lab.

  1. 1
    Cài đặt Isaac Sim và Isaac Lab

    Trang cài đặt pip nêu rõ rằng các hướng dẫn dành cho Isaac Sim 5.X, yêu cầu Python 3.11. Bản sao mã nguồn cung cấp cho bạn các script mà các bước tiếp theo cần.

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    Ghi lại khoảng mười bản demo của con người

    Tài liệu của Isaac Lab rất cụ thể: cần khoảng 10 bản demo thành công để các bước sau thành công. Các mẹo của nó cũng cụ thể không kém. Giữ các bản demo ngắn gọn, đi theo một đường thẳng thay vì di chuyển dọc theo các trục tùy ý và không tạm dừng, vì không rõ ràng đối với một chính sách tại sao và khi nào nên tạm dừng.

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    Chú thích các ranh giới tác vụ con

    Mimic chia các bản demo đầu vào thành các tác vụ con để có thể điều chỉnh lại thời gian và mục tiêu của các phân đoạn. Cờ --auto thực hiện điều này mà không cần sự can thiệp của con người đối với các tác vụ định nghĩa chú thích tự động; nếu không có nó, bạn tạm dừng bằng B, tiếp tục bằng N và đánh dấu ranh giới bằng S. Lưu ý rằng ID tác vụ có thêm hậu tố -Mimic.

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    Tạo tập dữ liệu đã nhân lên

    Đây là bước biến 10 thành 1000. Mimic áp dụng tiêu chí thành công boolean cho mỗi ứng viên và chỉ giữ lại những ứng viên đã hoàn thành tác vụ, do đó số lượng đầu ra thấp hơn số lượng thử nghiệm. Tài liệu cho biết tỷ lệ thành công của ứng viên có thể cao tới 70 phần trăm trong các trường hợp đơn giản và dưới 1 phần trăm đối với các tác vụ khó và robot phức tạp: khoảng 50 phần trăm đối với việc xếp khối Franka, và 65 đến 80 phần trăm đối với việc nhặt và đặt GR1T2, trong đó 1000 bản demo mất 18 đến 40 phút (19 phút trên RTX ADA 6000 ở 80 phần trăm).

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    Chuyển đổi HDF5 sang tập dữ liệu LeRobot

    Mọi thứ ở trên đều tạo ra HDF5 theo kiểu robomimic, và lõi Isaac Lab không tự cung cấp bộ chuyển đổi LeRobot nào: tài liệu của nó chỉ nói rằng bạn có thể chuyển đổi tập dữ liệu đã tạo sang định dạng LeRobot. Hai dự án cung cấp bộ chuyển đổi thực tế. IsaacLab-Arena cung cấp một bộ chuyển đổi nhắm mục tiêu GR00T được điều khiển hoàn toàn bằng cấu hình YAML, và LeIsaac cung cấp cặp riêng của nó cho tuyến SO-101 (xem bên dưới).

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
Ghim các phiên bản của bạn, và đừng tin tưởng main

Vào ngày 23 tháng 8 năm 2026, tài liệu Isaac Lab cho main mang huy hiệu Isaac Sim 6.0.1 và cung cấp release/3.0.0 và v3.0.0-beta2 trong bộ chuyển đổi phiên bản của nó cùng với v2.3.2, trong khi trang cài đặt pip trên cùng cây đó vẫn ghim isaacsim[all,extscache]==5.1.0 và mô tả các hướng dẫn là dành cho Isaac Sim 5.X. Container blueprint synthetic-manipulation-motion-generation của NVIDIA lại cũ hơn: Isaac Lab 2.0.2 trên Isaac Sim 4.5.0. Bảng tương thích của LeIsaac ghép Isaac Sim 5.1 với Isaac Lab v2.3.0. Các cây này di chuyển nhanh hơn so với việc tài liệu được cập nhật. Hãy chọn một bản phát hành, ghi lại và dự kiến các đường dẫn script và tên cờ sẽ thay đổi nếu bạn làm theo một hướng dẫn được viết ba tháng trước.

Tại sao các nỗ lực tạo ra thất bại, và cần thay đổi gì

Tỷ lệ thành công của ứng viên dao động từ 70 phần trăm xuống dưới 1 phần trăm không phải là một điều bí ẩn, và Isaac Lab ghi lại những cạm bẫy phổ biến thay vì để bạn phải tự đoán. Mỗi cạm bẫy đều là thứ bạn có thể kiểm soát trong quá trình ghi hình, đó là lý do tại sao bạn nên đọc danh sách này trước khi ghi lại mười bản trình diễn hạt giống thay vì sau lần chạy tạo ra kết quả đáng thất vọng đầu tiên.

  • Các bản trình diễn quá dài. Một khoảng thời gian dài hơn sẽ khó hơn để chính sách học hỏi. Bắt đầu gần đối tượng đầu tiên và giảm thiểu chuyển động.
  • Các bản trình diễn không mượt mà. Chuyển động không đều rất khó để chính sách giải mã, và phần cứng điều khiển từ xa tốt hơn sẽ cung cấp dữ liệu tốt hơn: tài liệu nói rõ rằng SpaceMouse tốt hơn bàn phím.
  • Tạm dừng. Việc tạm dừng rất khó học, vì chính sách không rõ tại sao và khi nào nên tạm dừng. Giữ chuyển động trôi chảy.
  • Quá nhiều tác vụ phụ. Nhiều tác vụ phụ hơn có nghĩa là nhiều sự ghép nối hơn giữa các phân đoạn quỹ đạo, dẫn đến chuyển động kém mượt mà hơn và tỷ lệ thành công tạo ra thấp hơn. Đánh dấu các ranh giới nơi cánh tay ít có khả năng va chạm với bất cứ thứ gì.
  • Không có nhiễu hành động. Nhiễu hành động làm cho các chính sách thu được mạnh mẽ hơn.
  • Ghi hình bị cắt quá sát. Nếu ghi hình dừng đúng khung hình mà điều kiện thành công kích hoạt, nó có thể không kích hoạt lại trong quá trình phát lại. Để lại một vùng đệm ở cuối.
  • Phát lại không xác định. Vật lý trong Isaac Lab không thể tái tạo một cách xác định trên các lần env.reset, vì vậy một số bản demo của con người thất bại khi phát lại. Thu thập nhiều hơn mức bạn cần và giữ lại những bản sống sót sau khi chú thích. Mọi thứ nằm trong tệp HDF5 do Mimic tạo ra đều là một bản demo thành công và có thể được sử dụng để đào tạo ngay cả khi phát lại sau đó thất bại.

Bước nội suy giữa các phân đoạn tác vụ phụ được ghép nối có nút điều chỉnh riêng, và số bước nội suy bạn cần tỷ lệ thuận với tốc độ di chuyển của robot và độ rộng của phân phối đặt lại đối tượng. Một tác vụ phức tạp với phân phối đặt lại lớn sẽ để lại khoảng trống lớn hơn giữa các phân đoạn, điều này cần nhiều bước nội suy hơn để tạo ra chuyển động liên tục. Nếu video được tạo của bạn cho thấy cánh tay giật cục giữa các pha, đó là tham số cần xem xét trước khi bạn đổ lỗi cho các bản demo hạt giống.

Cùng một quy trình trên SO-101, với cánh tay dẫn hướng thực

Đây là phần thú vị đối với bất kỳ ai đọc trang này, vì đây là đường ống mở duy nhất đặt một vào bên trong Isaac Lab và cho phép bạn điều khiển nó bằng cánh tay dẫn vật lý mà bạn đã sở hữu. LeIsaac, phiên bản 0.4.0 tại thời điểm viết bài, là sân chơi mô phỏng học tập bắt chước chính thức được tích hợp vào EnvHub của LeRobot. Bảng tương thích của nó liệt kê ba sự kết hợp hoạt động; phiên bản mới nhất ghép nối Isaac Sim 5.1 với Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 và Python 3.11, và tài liệu khuyến nghị Isaac Sim 5.0 hoặc mới hơn cho các card dòng 50.

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac từ mã nguồn. Việc ghim numpy có trong hướng dẫn chính thức, không phải là một giải pháp tạm thời.

Với thiết lập đó, cánh tay dẫn trên /dev/ttyACM0 điều khiển cánh tay theo dõi mô phỏng và ghi trực tiếp vào HDF5. Vòng lặp giống như vòng lặp bạn đã biết từ ghi hình thực tế, chỉ khác là cánh tay theo dõi là một vật thể cứng trong PhysX.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
ID Môi trườngMô tả nhiệm vụRobot
LeIsaac-SO101-PickOrange-v0Nhặt ba quả cam và đặt vào đĩa, sau đó đưa cánh tay về trạng thái nghỉSingle-arm SO101 follower
LeIsaac-SO101-LiftCube-v0Nâng khối lập phương màu đỏ lênSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0Nhặt hai vật thể chữ 'e' vào hộp, sau đó đưa cánh tay về trạng thái nghỉSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0Nhiệm vụ tương tự với hai cánh tayBi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0Gấp vải, sau đó đưa cánh tay về trạng thái nghỉ. Chỉ biến thể DirectEnv hỗ trợ check_successBi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0Nhặt rác khăn giấy từ sàn và vứt vào thùng rácLeKiwi

Hầu hết các ID đó cũng tồn tại dưới dạng -Direct-v0 biến thể, và python scripts/environments/list_envs.py in ra danh sách hiện tại. Bạn cũng có thể bỏ qua hoàn toàn việc chuyển đổi HDF5 và ghi định dạng LeRobot trong quá trình điều khiển từ xa bằng cách thêm ba cờ. Hai lưu ý đến từ chính tài liệu: trình ghi tự động bỏ qua 5 khung hình đầu tiên của mỗi tập để tránh sự bất ổn từ các trạng thái ban đầu, và nó có thể gây ra một chút chậm trễ trong quá trình điều khiển từ xa, đây chính xác là loại điều làm thay đổi một cách âm thầm tính chất của các bản trình diễn của bạn. Nó cũng chỉ ghi các tập mà nhiệm vụ được đánh dấu là thành công.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

Bước nhân sau đó chạy trên các bản ghi đó. LeIsaac gói Isaac Lab Mimic trong bốn lệnh, bởi vì Mimic tổng quát hóa các quỹ đạo từ tư thế của bộ phận cuối và vật thể: chuyển đổi các hành động trong không gian khớp thành các hành động dựa trên IK, chú thích, tạo, sau đó chuyển đổi trở lại không gian khớp.

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

Sau đó chuyển đổi sang LeRobot. Đây là bước mà quy tắc định dạng của nền tảng gây khó khăn, và LeIsaac tình cờ cung cấp chính xác hai bộ chuyển đổi bạn cần: isaaclab2lerobot.py ghi LeRobot v2, đây là định dạng mà các bộ tải của GR00T sử dụng, và isaaclab2lerobotv3.py ghi v3 cho Pi0.5, SmolVLAACT.

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
Đầu ra LeRobot v2 cho GR00T. Thay thế bằng isaaclab2lerobotv3.py, với lerobot 0.4.2, cho các bộ huấn luyện v3.
Có một lối thoát không cần GPU

LeIsaac tài liệu hóa việc chạy toàn bộ hệ thống trên NVIDIA Brev: triển khai, nhấp vào liên kết cổng 80 để mở VS Code Server dựa trên trình duyệt, và điều khiển bốn kịch bản được cài đặt sẵn với --kit_args="--no-window --enable omni.kit.livestream.webrtc", xem kết xuất tại cùng địa chỉ với /viewer được thêm vào. Nếu bạn không có card đồ họa máy trạm dưới bàn làm việc, đó là một cách rẻ hơn để tìm hiểu xem phiên bản mô phỏng của nhiệm vụ của bạn có gần đúng hay không trước khi bạn cam kết phần cứng cho nó.

Hai lộ trình để có một chính sách được huấn luyện

Bạn tự xây dựng cảnh, tạo dữ liệu, thuê GPU và thiết lập dịch vụ. Đây là lựa chọn phù hợp nếu tác vụ yêu cầu sự đa dạng môi trường mà bạn không thể dàn dựng vật lý, hoặc nếu bạn muốn đánh giá lặp lại được.

  1. Cài đặt Isaac Sim 5.1 và Isaac Lab, hoặc bộ công cụ LeIsaac nếu robot của bạn là SO-101.
  2. Mô hình hóa hoặc nhập cảnh. Đây là bước mà không ai dự trù ngân sách và thường là bước tốn thời gian nhất.
  3. Ghi lại khoảng 10 bản trình diễn sạch thông qua bộ theo dõi mô phỏng.
  4. Ghi chú các tác vụ con, chạy generate_dataset.py, và chấp nhận rằng các lỗi sẽ bị loại bỏ.
  5. Chuyển đổi HDF5 sang định dạng LeRobot, chọn v2 cho GR00T và v3 cho các định dạng khác.
  6. Dù sao thì vẫn ghi lại các tập thực tế trên cánh tay robot vật lý, sau đó đồng huấn luyện trên hỗn hợp.
  7. Thuê GPU, chạy tinh chỉnh, phục vụ điểm kiểm tra bên cạnh cánh tay robot.
Tài nguyênNguồn tài liệu nêu gì
Tài nguyên GPU mô phỏng cục bộBản thiết kế thao tác tổng hợp của NVIDIA yêu cầu Ubuntu 22.04 và NVIDIA RTX A6000 với 48 GB VRAM
Nút mô hình thế giớiBản thiết kế tương tự yêu cầu H100 hoặc cao hơn với 80 GB, trên một nút riêng biệt với mô phỏng Isaac Lab
Phiên bản containerIsaac Lab 2.0.2 trên Isaac Sim 4.5.0 bên trong hình ảnh bản thiết kế đó
Thông lượng tạoIsaac Lab báo cáo 1000 bản demo nhặt và đặt GR1T2 trong 18 đến 40 phút, 19 phút trên RTX ADA 6000 với tỷ lệ thành công 80 phần trăm
Chi phí quỹ đạo thần kinhGR00T N1 báo cáo khoảng 105.000 giờ GPU L40, xấp xỉ 1,5 ngày trên 3.600 L40, cho 827 giờ 'giấc mơ' của nó
Chi phí thực tế là thời gian theo lịch, không phải thời gian GPU

Tạo ra 1000 quỹ đạo chỉ mất một buổi chiều. Việc đưa cảnh, thông số ngoại vi camera, lưới đối tượng và mô hình servo của bạn đủ gần để các quỹ đạo đó có thể chuyển giao mới là nơi tiêu tốn hàng tuần. Hãy dự trù ngân sách cho việc mô hình hóa, không phải lấy mẫu.

Mô hình thế giới video: lớp mới nhất và ít được đo lường nhất

Ý tưởng đằng sau DreamGen là một mô hình tạo video, được điều chỉnh cho hình thái robot mục tiêu, có thể tưởng tượng ra các tập hợp lý trong những cảnh bạn chưa từng ghé thăm. Quy trình này có bốn giai đoạn: tinh chỉnh mô hình thế giới video, tạo video robot tổng hợp chân thực, khôi phục chuỗi hành động giả với mô hình hành động tiềm ẩn hoặc mô hình động lực học nghịch đảo, sau đó huấn luyện chính sách robot dựa trên kết quả. Kho lưu trữ GR00T-dreams của NVIDIA triển khai chính xác điều đó.

Kết quả chính là có thật và đáng được xem xét nghiêm túc: dữ liệu điều khiển từ xa từ chỉ một nhiệm vụ nhặt và đặt trong một môi trường đã tạo ra 22 hành vi mới trên một người máy hình người, trong cả môi trường đã thấy và chưa thấy. Lưu ý cũng có thật và nằm ở giai đoạn thứ ba.

Các mô hình thế giới video làm nguồn dữ liệu
Ưu điểm
  • Chúng mở rộng theo trục thực sự tốn kém trong thế giới thực: các cảnh mới, cách sắp xếp đối tượng mới, cách diễn đạt hướng dẫn mới.
  • GR00T-dreams liệt kê bốn hình thái được hỗ trợ cho các tập lệnh trích xuất hành động và tinh chỉnh của nó: franka, gr1, robocasa và so100. Đây không phải là kỹ thuật chỉ dành cho người máy hình người.
  • Cosmos-Transfer1 tấn công trực tiếp nửa quang trắc của khoảng cách, ánh xạ một ví dụ tổng hợp robot học thành nhiều ví dụ thực tế từ phân đoạn, độ sâu hoặc điều kiện cạnh. Isaac Lab tự nó cung cấp công cụ nhắc nhở cho điều này dưới scripts/tools/cosmos.
  • Công trình DreamGen cung cấp DreamGen Bench, một điểm chuẩn tạo video cho thấy mối tương quan mạnh mẽ giữa hiệu suất điểm chuẩn và thành công của chính sách hạ nguồn, vì vậy bạn có thể sàng lọc các thế hệ trước khi huấn luyện chúng.
Đánh đổi
  • Các hành động được khôi phục bởi một mô hình, không phải được đo bằng bộ mã hóa. Một video trông có vẻ đúng có thể chứa một quỹ đạo khớp mà cánh tay của bạn không thể thực hiện.
  • Việc tạo ra rất tốn kém. GR00T N1 báo cáo mất hai phút để tạo ra một giây video trên L40, khoảng 105.000 giờ GPU L40, khoảng 1,5 ngày trên 3.600 GPU L40, cho 827 giờ quỹ đạo thần kinh của nó.
  • Mức tăng đo được nằm ở một chữ số: 4.2, 8.8 và 6.8 điểm trên RoboCasa trên ba chế độ dữ liệu, và 5.8 điểm trung bình trên 8 nhiệm vụ GR-1 thực tế, trên một mô hình đã có dữ liệu thực.
  • Không có công thức nào được công bố xác nhận điều này cho một cánh tay servo sở thích 7.4 V từ đầu đến cuối. Bạn sẽ phải chuyển đổi, chứ không phải làm theo.
Không bao giờ cấp 12 V cho STS3215

Không liên quan đến mô phỏng, nhưng điều này thường xảy ra khi ai đó chuyển từ cánh tay mô phỏng sang cánh tay thật và tự chế nguồn điện. Các cánh tay SO-100, SO-101 và LeKiwi đều chạy servo Feetech STS3215 ở 7.4 V. Cấp 12 V cho chúng sẽ làm hỏng chúng, và LeKiwi là một cái bẫy đặc biệt vì thanh ray cơ sở của nó 12 V. Hãy xem trang phần cứng SO-100 trước khi bạn đấu dây bất cứ thứ gì.

Đồng huấn luyện là công thức thực sự mang lại lợi ích

Nếu bạn rút ra một bài học vận hành từ tài liệu, hãy ghi nhớ điều này. Nghiên cứu đồng huấn luyện mô phỏng và thực tế (Maddukuri và cộng sự, 2025) đã đặt ra mục tiêu tìm kiếm một công thức đơn giản để sử dụng dữ liệu mô phỏng nhằm giải quyết các nhiệm vụ thao tác robot dựa trên thị giác, trên hai lĩnh vực, một cánh tay robot và một người máy hình người, và kết luận của nó là bạn huấn luyện trên một hỗn hợp. Dữ liệu mô phỏng đã nâng cao hiệu suất nhiệm vụ trong thế giới thực trung bình 38 phần trăm, và bài báo nêu rõ rằng điều này vẫn đúng ngay cả khi có sự khác biệt đáng kể giữa dữ liệu mô phỏng và dữ liệu thế giới thực.

Điều khoản cuối cùng đó quan trọng hơn con số 38 phần trăm. Nó có nghĩa là mô phỏng không cần phải là một bản sao kỹ thuật số hoàn hảo để hữu ích, miễn là dữ liệu thực tế có trong hỗn hợp để làm điểm tựa. Chuyển giao chỉ bằng mô phỏng là con đường tốn kém: cùng một bài báo nêu rõ rằng việc huấn luyện một chính sách chỉ trong mô phỏng và chuyển giao nó sang thế giới thực thường đòi hỏi nỗ lực đáng kể của con người để thu hẹp khoảng cách thực tế. Đồng huấn luyện bỏ qua hầu hết nỗ lực đó bằng cách không bao giờ yêu cầu chính sách tự mình thu hẹp khoảng cách.

The AY-Robots policy comparison table showing parameters, GPU tier, inference latency and minimum episodes for GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA and ACT.
Năm chính sách có thể huấn luyện tại /policies. Cột số tập tối thiểu là con số quyết định liệu dữ liệu tổng hợp là một thứ tốt nên có hay là cách duy nhất để bạn đạt được một tập dữ liệu có thể huấn luyện.

Trên thực tế, trên nền tảng này, đồng huấn luyện có nghĩa là một điều: đặt cả hai tập hợp các tập trong cùng một tập dữ liệu LeRobot với các khóa camera nhất quán, thứ tự khớp nhất quán và đơn vị nhất quán, sau đó chạy một tinh chỉnh thông thường. Không có nút điều chỉnh trọng số hỗn hợp trong biểu mẫu huấn luyện. Nếu bạn muốn tỷ lệ mô phỏng-thực tế là 3:1, bạn thể hiện điều đó bằng số lượng tập của mỗi loại mà bạn đưa vào tập dữ liệu.

Lợi ích dễ đạt được nhất từ mô phỏng không phải là dữ liệu huấn luyện

Đó là đánh giá. Chạy hàng chục thử nghiệm thực tế cho mỗi tác vụ để so sánh hai tốn một ngày làm việc của cánh tay robot, và cánh tay có thể bị lệch giữa các lần thử nghiệm. SIMPLER (Li và cộng sự, 2024) đã xây dựng các môi trường mô phỏng với mục đích đánh giá các chính sách thực tế thay vì huấn luyện chúng, sau đó đo lường mức độ dự đoán của xếp hạng mô phỏng so với xếp hạng thực tế. Một môi trường SIMPLER duy nhất có thể hiển thị ở tốc độ 3.500 bước mô phỏng mỗi giây trên card đồ họa tiêu dùng RTX 4090 ở độ phân giải 640 x 512, với tần số mô phỏng 500 Hz, đạt tốc độ nhanh hơn 7 lần so với đánh giá thực tế.

Giao thức đánh giáMMRV (thấp hơn là tốt hơn)Pearson r (cao hơn là tốt hơn)
Validation MSE0.3750.308
SIMPLER, tổng hợp biến thể0.1430.778
SIMPLER, khớp hình ảnh0.0560.924

Đây là các giá trị trung bình trên ba nhóm tác vụ Google Robot cho sáu điểm kiểm tra mã nguồn mở phổ biến: ba điểm kiểm tra RT-1 ở các giai đoạn huấn luyện khác nhau, RT-1-X, RT-2-X và Octo-Base. Phía thực tế không có số lượng thử nghiệm đồng đều, điều này đáng để biết trước khi bạn trích dẫn: 75 thử nghiệm cho tác vụ nhặt lon coca, 60 cho tác vụ di chuyển gần, 54 cho các tác vụ mở và đóng ngăn kéo và 27 cho tác vụ ngăn kéo và táo dài hơn. So sánh với MSE xác thực là phần hữu ích. Việc lựa chọn mô hình bằng cách sử dụng validation loss xếp hạng các điểm kiểm tra này kém, và hệ số Pearson r là 0.924 trong điều kiện khớp hình ảnh có nghĩa là nếu một điểm kiểm tra đạt điểm tốt hơn trong SIMPLER, thì rất có thể nó cũng đạt điểm tốt hơn trên thực tế. Đó là một bảng điểm có thể lặp lại qua đêm, và nó không yêu cầu bạn phải tin bất cứ điều gì về việc chuyển giao huấn luyện từ mô phỏng sang thực tế.

Bảng xếp hạng Đấu trường AY-Robots, một bảng có thể sắp xếp gồm 85 mô hình thị giác-ngôn ngữ-hành động với 332 kết quả benchmark, mỗi giá trị được liên kết đến bài báo gốc hoặc thẻ mô hình của nó.
Đấu trường tại /arena thu thập 332 kết quả benchmark từ 85 mô hình. Hầu hết trong số đó là các benchmark mô phỏng, đây chính xác là điểm mấu chốt của lập luận SIMPLER: mô phỏng là một bảng điểm tốt rất lâu trước khi nó trở thành một nguồn dữ liệu tốt.

Nếu bạn muốn có bối cảnh rộng hơn về những gì các con số benchmark này cho bạn biết và không cho bạn biết về một , chúng tôi đã viết riêng về điều đó trong .

Nơi nền tảng này không giúp ích cho bạn

Việc làm rõ ranh giới giúp mọi người tiết kiệm thời gian. AY-Robots là một nền tảng ghi lại, huấn luyện và phục vụ. Nó không có trình mô phỏng nào.

  • Không có Isaac Lab, không có MimicGen, không có mô hình thế giới, không có công cụ tạo cảnh. Nếu bạn muốn dữ liệu được tạo, bạn tạo nó ở nơi khác và mang kết quả đến.
  • Các bộ huấn luyện chỉ tiêu thụ tập dữ liệu LeRobot và không có gì khác. Một bản xuất từ trình mô phỏng phải được chuyển đổi trước khi trở thành đầu vào, và nó phải là phiên bản đúng: v2.0 hoặc v2.1 cho GR00T N1.5 và N1.7, v3.0 cho Pi0.5, SmolVLA và ACT.
  • Điểm vào tinh chỉnh của GR00T là một CLI tyro không hiển thị seed, vì vậy các lần chạy GR00T không thể tái tạo từng bit. Nếu bạn đang thực hiện một phép loại bỏ cẩn thận giữa mô phỏng và thực tế, đó là một hạn chế thực sự. Seed mặc định của lerobot là 1000, và các dạng ACT, SmolVLA và Pi0.5 có hiển thị trường seed.
  • Tích lũy gradient chỉ thực sự được áp dụng cho hai bộ huấn luyện GR00T. Đối với Pi0.5 và SmolVLA, trường này tồn tại trong biểu mẫu nhưng lerobot 0.5.1 không có cờ như vậy, vì vậy nó không làm gì cả.
  • Suy luận phải nằm cạnh các servo cho các tác vụ nhanh. Vòng lặp điều khiển là 20 đến 485 ms cho mỗi bước hành động tùy thuộc vào mô hình, và việc thêm các chuyến đi khứ hồi qua internet công cộng biến một chính sách hoạt động thành một chính sách do dự. Suy luận từ xa khả thi cho các tác vụ nhặt và đặt chậm, không phải cho chuyển động phản ứng nhanh.
Những gì bạn có thể làm ở đây mà thực sự khó ở nơi khác

Ghi lại phần thực của một hỗn hợp đồng huấn luyện mà không cần sở hữu một cánh tay robot. /live phát trực tiếp một SO-100 vật lý mà không cần đăng ký, dựa trên hàng đợi, và chương trình điều khiển tồn tại vì ai đó phải điều khiển chúng. Nếu nút thắt của bạn là bạn có một trình mô phỏng và không có các tập thực tế, đó là khoảng trống mà nền tảng này lấp đầy.

Một ngân sách bạn có thể bảo vệ

Đặt hai con đường cạnh nhau với các con số mà mỗi con đường thực sự công bố, và quyết định thường tự đưa ra cho một dự án đơn nhiệm vụ trên một cánh tay robot chi phí thấp.

MụcƯu tiên mô phỏngƯu tiên ghi lại
Mô hình hóa ban đầuCảnh, lưới, vị trí camera, mô hình servo. Vài ngày đến vài tuầnKhông có
Thu thập dữ liệuKhoảng 10 bản demo trong mô phỏng, sau đó tạo ra30 đến 50 tập thực tế, vài giờ điều khiển từ xa
Phần cứng cần sở hữuCard 48 GB cho bản thiết kế Isaac Lab, 80 GB cho giai đoạn CosmosMột cánh tay robot và một máy tính xách tay
Chi phí huấn luyệnGiống như cột bên phải, người huấn luyện không quan tâm dữ liệu đến từ đâu1 to 3 USD on the 4090 tier, 4 to 12 USD on the A100 or H100 tier
Bằng chứng tốt nhất về lợi íchMức tăng trung bình 38 phần trăm trong thế giới thực khi được huấn luyện chung, 4 đến 9 điểm từ quỹ đạo thần kinhMức cơ sở mà mọi thứ trên đây được đo lường
Thất bại khiNhiệm vụ của bạn phụ thuộc vào tiếp xúc, vật thể biến dạng hoặc độ tuân thủ của servoBạn cần sự biến đổi môi trường mà bạn không thể dàn dựng vật lý

Đối với chính sách đầu tiên trên SO-100, hãy ghi lại. , và sẽ đưa bạn đến một điểm kiểm tra đã được phục vụ với giá một ly cà phê, và bạn sẽ có một nửa thực tế của bất kỳ hỗn hợp huấn luyện chung nào trong tương lai. Hãy tìm đến trình mô phỏng khi bạn có một đường cơ sở hoạt động và một lỗi tổng quát hóa cụ thể mà bạn có thể gọi tên, chẳng hạn như một chính sách mà .

Chưa có cánh tay robot trên bàn của bạn?

Điều khiển một SO-100 thực tế trong trình duyệt, dựa trên hàng đợi, không cần đăng ký, và xem một tập thực tế trông như thế nào trước khi bạn dành cả cuối tuần để mô hình hóa nó trong trình mô phỏng.

Điều khiển một cánh tay robot thực tế

Một công thức tôn trọng bằng chứng

  1. 1
    Ghi lại đường cơ sở thực tế trước

    30 tập cho SmolVLA, 50 tập cho ACT, GR00T N1.7Pi0.5. Huấn luyện một lần. Bất cứ điều gì mà chính sách đó thất bại sẽ là đặc tả của bạn cho dữ liệu tổng hợp.

  2. 2
    Đặt tên cho lỗi khái quát hóa

    Tư thế vật thể? Ánh sáng? Chiều cao bàn? Các yếu tố gây nhiễu? Một cách diễn đạt khác của hướng dẫn? Dữ liệu tổng hợp chỉ tốt ở một trong số này tại một thời điểm, và vô dụng nếu bạn không thể nói rõ là cái nào.

  3. 3
    Chọn nhóm giải pháp rẻ nhất bao gồm nó

    Biến thể tư thế và bố cục: nhân rộng quỹ đạo. Ánh sáng và kết cấu: tăng cường hình ảnh trước, mô hình thế giới sau. Toàn bộ cảnh mới: mô phỏng vật lý, và chấp nhận chi phí mô hình hóa.

  4. 4
    Tạo ra, sau đó loại bỏ mạnh mẽ

    Các nỗ lực tạo ra thất bại, và tỷ lệ thành công ứng cử viên của Isaac Lab dao động từ 70 percent xuống dưới 1 percent tùy thuộc vào nhiệm vụ. Chỉ giữ lại các quỹ đạo thành công, hoàn thành nhiệm vụ, và xem xét kỹ một mẫu dưới dạng video trước khi bạn tin tưởng vào lô dữ liệu.

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    Đồng huấn luyện, không thay thế

    Hợp nhất các tập đã tạo với các tập thực tế vào một bộ dữ liệu LeRobot duy nhất với các khóa camera và thứ tự khớp giống hệt nhau. Con số 38 percent là một con số đồng huấn luyện.

  6. 6
    Đánh giá trên cánh tay robot thực, và chỉ ở đó

    Đánh giá mô phỏng là một tín hiệu xếp hạng tốt (Pearson r 0.924 trong thiết lập khớp hình ảnh của SIMPLER) nhưng nó không phải là bài kiểm tra chấp nhận. Chạy điểm kiểm tra trên bàn thử trước khi bạn tin tưởng nó.

Nếu bạn muốn bắt đầu từ một danh sách kiểm tra cho các bản ghi thực tế, bao gồm vị trí camera, hàm ý và các chế độ lỗi khiến một bộ dữ liệu không thể sử dụng được. Chi tiết về định dạng nằm trong , và khía cạnh siêu tham số trong .

Tôi có thể huấn luyện một chính sách robot hoàn toàn bằng dữ liệu tổng hợp không?

Đối với một nhiệm vụ thao tác trên cánh tay robot thực, không đáng tin cậy. Mọi kết quả được công bố với con số mạnh mẽ đều là kết quả đồng huấn luyện hoặc kết quả tăng cường trên dữ liệu thực. So sánh của MimicGen cho thấy 200 bản demo được tạo ra đạt 79 percent so với 84 percent cho 200 bản demo của con người trên cùng một nhiệm vụ, và bài báo đồng huấn luyện mô phỏng và thực tế năm 2025 nêu rõ rằng việc huấn luyện hoàn toàn trong mô phỏng và chuyển giao thường đòi hỏi nỗ lực đáng kể của con người để thu hẹp khoảng cách thực tế. RoboCasa cho thấy dữ liệu được tạo ra vượt trội hơn dữ liệu của con người ở mức 47.6 so với 28.8 percent, nhưng chỉ với 72,000 bản demo được tạo ra so với 1,250 bản của con người, bên trong trình mô phỏng đã tạo ra cả hai.

Tôi vẫn cần bao nhiêu tập thực tế nếu tôi tạo ra các tập tổng hợp?

Trên AY-Robots, các huấn luyện viên cần tối thiểu 30 tập cho SmolVLA và 50 tập cho ACT, GR00T N1.5, GR00T N1.7 và Pi0.5, bất kể các tập đó đến từ đâu. Tài liệu Mimic của Isaac Lab nói rằng khoảng 10 bản demo thành công của con người là cần thiết làm hạt giống để tạo ra. Đó là những con số khác nhau trả lời các câu hỏi khác nhau: 10 là cái mà trình tạo cần, 30 đến 50 là cái mà huấn luyện viên cần.

Dữ liệu mô phỏng có cần phải ở định dạng LeRobot không?

Để huấn luyện trên nền tảng này, có. Isaac Lab và LeIsaac đều tạo ra HDF5 theo kiểu robomimic. Isaac Lab core không đi kèm bộ chuyển đổi LeRobot nào, nhưng LeIsaac đi kèm isaaclab2lerobot.py cho LeRobot v2 và isaaclab2lerobotv3.py cho v3, và IsaacLab-Arena đi kèm một convert_hdf5_to_lerobot.py nhắm mục tiêu GR00T được điều khiển bởi cấu hình YAML. Lưu ý phiên bản: GR00T N1.5 và N1.7 sử dụng LeRobot v2.0 hoặc v2.1, trong khi Pi0.5, SmolVLA và ACT sử dụng v3.0. Một bộ dữ liệu v3.0 sẽ làm sập bộ nạp GR00T và phải được chuyển đổi xuống v2.1.

Isaac Gym có còn là thứ phù hợp để học vào năm 2026 không?

Không. Trang sản phẩm của NVIDIA có tiêu đề "Isaac Gym - Hiện đã lỗi thời" và nêu rõ rằng đây là phần mềm cũ, các nhà phát triển có thể tải xuống và tiếp tục sử dụng nhưng nó không còn được hỗ trợ, và chỉ ra Isaac Lab là sự thay thế. Isaac Lab đi kèm các hướng dẫn di chuyển từ IsaacGymEnvs, từ OmniIsaacGymEnvs và từ Orbit, vì vậy một môi trường hiện có có thể di chuyển được chứ không bị mất.

Tôi có thể đưa SO-100 hoặc SO-101 vào Isaac Lab không?

SO-101, có, đúng cách. Kho lưu trữ TheRobotStudio cung cấp cả tệp URDF và MJCF cho SO-101, được tạo bằng onshape-to-robot từ mô hình CAD Onshape, và LeIsaac cung cấp các tác vụ Isaac Lab sẵn có như LeIsaac-SO101-PickOrange-v0 với điều khiển từ xa từ cánh tay dẫn hướng SO101 vật lý. Đối với SO-100, cùng kho lưu trữ đó chỉ cung cấp một tệp URDF duy nhất và không có mô hình MuJoCo. Hãy lưu ý các giới hạn mà README của SO-101 nêu rõ: lưới va chạm cơ sở đã bị loại bỏ do hành vi va chạm có vấn đề, các thuộc tính động cơ STS3215 được điều chỉnh từ dự án Open Duck Mini chứ không phải được xác định trên SO-101, và quy ước kẹp từ 0-closed đến 100-open vẫn chưa được phản ánh trong các tệp mô hình.

Nền tảng này có chạy mô phỏng cho tôi không?

Không. AY-Robots ghi lại các bộ dữ liệu LeRobot từ điều khiển từ xa thực tế, tinh chỉnh năm chính sách được hỗ trợ trên các GPU thuê, và phục vụ điểm kiểm tra kết quả trở lại cánh tay robot. Không có trình mô phỏng, không có tạo dữ liệu tổng hợp và không có tác giả cảnh trong đó. Nếu bạn tạo dữ liệu ở nơi khác và chuyển đổi nó thành một bộ dữ liệu LeRobot hợp lệ, các huấn luyện viên sẽ chấp nhận nó chính xác như các bản ghi thực tế.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started