Huấn luyện policy
AY-Robots huấn luyện các policy thao tác trên GPU được quản lý, vì vậy bạn có thể đi từ các episode đã ghi đến một policy chạy trên cánh tay của bạn mà không cần sở hữu phần cứng huấn luyện. Trang này bao gồm các loại policy được hỗ trợ, trang chạy huấn luyện, checkpoint, và những kết quả thực tế nên mong đợi từ số lượng episode của bạn.
Cập nhật lần cuối 2026-08-09
Huấn luyện mà không cần GPU của riêng bạn
Huấn luyện một policy thao tác là một khối lượng công việc GPU, và các mô hình vision-language-action hiện đại cần nhiều VRAM hơn một trạm làm việc thông thường có. Trên AY-Robots, việc huấn luyện chạy trên các GPU cloud được nền tảng quản lý: bạn chọn một dataset và một loại policy, bắt đầu chạy, và theo dõi tiến trình từ trình duyệt. Không cần thiết lập CUDA, không cần khớp driver, và không cần bảo trì môi trường.
Đầu vào luôn là một dataset cloud từ Dashboard > Datasets. Bất cứ thứ gì bạn đã ghi qua các phiên điều khiển từ xa hoặc đã tải lên theo định dạng LeRobot đều đủ điều kiện, kể cả các dataset đã gộp. Hãy chọn lọc trước khi huấn luyện: các episode được gắn nhãn Failure thường nên loại khỏi tập huấn luyện, và mười phút xem lại trong trình duyệt episode tiết kiệm hàng giờ thời gian GPU dành cho việc học từ những minh họa xấu.
Các policy được hỗ trợ
Bốn họ policy được hỗ trợ. Chúng khác nhau về kích thước, chi phí huấn luyện, và mức độ chúng có thể hấp thụ từ dữ liệu của bạn, vì vậy lựa chọn đúng phụ thuộc vào nhiệm vụ và dataset của bạn nhiều hơn bất kỳ xếp hạng chung nào.
| Policy | Loại | Đặc điểm |
|---|---|---|
| ACT | Transformer, action chunking | Dự đoán các đoạn hành động tương lai ngắn thay vì từng bước đơn lẻ. Gọn nhẹ, huấn luyện tương đối nhanh, và là lựa chọn đầu tiên vững chắc cho một nhiệm vụ duy nhất được xác định rõ ràng. |
| Diffusion Policy | Diffusion trên chuỗi hành động | Mô hình hóa toàn bộ phân phối của các hành động được minh họa, điều này hữu ích khi các minh họa của bạn giải quyết nhiệm vụ theo nhiều cách hợp lệ khác nhau. Nặng hơn khi huấn luyện và chậm hơn khi suy luận so với ACT. |
| SmolVLA | Mô hình vision-language-action nhỏ | Có điều kiện ngôn ngữ: chuỗi nhiệm vụ từ các episode của bạn trở thành một phần của đầu vào. Một lựa chọn cân bằng tốt khi bạn muốn điều kiện ngôn ngữ mà không cần một foundation model lớn. |
| Fine-tune GR00T | Fine-tune foundation model | Fine-tune một foundation model robot học lớn đã được huấn luyện trước trên các episode của bạn. Có trần cao nhất trong bốn loại, với chi phí huấn luyện cao nhất, và yêu cầu định dạng dataset nghiêm ngặt. |
Việc fine-tune GR00T chỉ chấp nhận dataset theo định dạng LeRobot phiên bản 2.1. Một dataset v3.0 sẽ thất bại trong khi tải dữ liệu, không phải khi gửi, vì vậy hãy kiểm tra phiên bản định dạng trước khi bạn bắt đầu chạy. Dataset được ghi trên nền tảng có thể được sử dụng nguyên trạng; đối với các tệp tải lên từ bên ngoài, hãy xác minh phiên bản trong meta/info.json trước.
Bắt đầu một lần chạy
- 1Chọn dataset
Mở Dashboard > Training và chọn dataset để huấn luyện. Số lượng episode và loại robot được hiển thị để bạn có thể xác nhận đã chọn đúng.
- 2Chọn policy
Chọn một trong các loại policy được hỗ trợ. Nếu bạn không chắc chắn, hãy bắt đầu với ACT: đây là cách rẻ nhất để biết liệu dataset của bạn có đủ tốt để huấn luyện bất cứ điều gì hay không.
- 3Khởi chạy
Bắt đầu chạy. Nó nhận một job id và trang chạy riêng, và bạn có thể đóng trình duyệt: việc huấn luyện tiếp tục ở phía server và trang hiển thị trạng thái trực tiếp bất cứ khi nào bạn quay lại.
Trang chạy huấn luyện
Mỗi lần chạy có một trang riêng trả lời hai câu hỏi bạn thực sự có trong khi huấn luyện: nó có đang học không, và máy có khỏe mạnh không. Tiến trình học được hiển thị dưới dạng biểu đồ của loss, lịch trình learning rate, và chuẩn gradient. Một loss ổn định ngay lập tức hoặc một chuẩn gradient bùng nổ sẽ báo cho bạn sớm rằng lần chạy này không đáng chờ đợi.
Sức khỏe của máy được hiển thị bên cạnh: mức sử dụng GPU và bộ nhớ, cùng với các chỉ số host của máy huấn luyện. Một dòng thời gian giai đoạn cho thấy lần chạy hiện đang ở đâu, từ chuẩn bị môi trường qua tải dữ liệu, vòng lặp huấn luyện chính, và tải lên checkpoint. Khi có gì đó trông không ổn, trình xem log tích hợp sẵn cung cấp cho bạn log huấn luyện thô mà không cần bất kỳ quyền truy cập SSH nào, thường đủ để thấy liệu một lỗi là do dataset của bạn hay do chính lần chạy.
Checkpoint và tiếp tục
Checkpoint được lưu trữ theo từng lần chạy, không phải trong một kho chung, vì vậy các checkpoint được liệt kê trên một trang chạy luôn thuộc chính xác về lần chạy đó và cấu hình của nó. Điều này quan trọng hơn vẻ ngoài của nó: việc trộn lẫn checkpoint giữa các lần chạy với cài đặt khác nhau là một nguồn gốc kinh điển của các policy bị hỏng một cách âm thầm.
Nếu một lần chạy bị gián đoạn, bạn có thể tiếp tục từ checkpoint mới nhất của nó thay vì bắt đầu lại từ đầu. Các checkpoint trung gian cũng hữu ích tự thân: khi một lần chạy dài bắt đầu overfitting gần cuối, một checkpoint trước đó thường chạy tốt hơn trên cánh tay thật so với checkpoint cuối cùng.
Chạy policy đã huấn luyện trên cánh tay của bạn
Một policy đã hoàn thành có thể được triển khai thẳng trở lại robot của bạn. Trong cockpit, chọn policy đã huấn luyện cho cánh tay đã kết nối của bạn và bắt đầu inference: policy giờ đây tạo ra các lệnh khớp mà trước đây bạn tạo ra thông qua điều khiển từ xa. Cánh tay phải là cùng loại robot mà dataset đã được ghi trên đó, và cảnh nên giống với các cảnh huấn luyện, kể cả vị trí đặt camera.
Hãy coi những lần chạy inference đầu tiên như các thí nghiệm, không phải bản demo. Giữ emergency stop trong tầm với, bắt đầu từ một trạng thái ban đầu gần với những gì bạn đã minh họa, và mong đợi policy nhạy cảm với những thứ bạn có thể không để ý: một camera bị di chuyển, ánh sáng khác biệt, hoặc một đối tượng mà dataset chưa từng chứa.
Bạn cần bao nhiêu episode
Sai lầm huấn luyện phổ biến nhất trên nền tảng không phải là một siêu tham số sai, mà là huấn luyện trên quá ít dữ liệu và kết luận rằng loại policy đó không hoạt động. Như một nguyên tắc thực tế cho một nhiệm vụ trên mặt bàn duy nhất: khoảng 50 episode cho bạn một policy có khả năng khái quát hẹp thành công từ các trạng thái ban đầu gần với những gì bạn đã minh họa. Khoảng 100 đến 200 episode cho độ vững chắc hữu dụng trên toàn bộ không gian làm việc cho nhiệm vụ đó, miễn là bạn đã thay đổi vị trí đối tượng giữa các episode.
Các loại policy mạnh hơn không thay đổi điều này. Một fine-tune GR00T trên 20 episode vẫn sẽ khái quát kém; những gì các mô hình lớn hơn mang lại là một trần cao hơn khi dữ liệu đã sẵn sàng. Nếu ngân sách của bạn có hạn, hãy chi cho nhiều episode đa dạng hơn trước khi chi cho một mô hình lớn hơn.
Câu hỏi thường gặp
Một lần chạy huấn luyện mất bao lâu?▾
Điều này phụ thuộc vào loại policy và kích thước dataset, vì vậy không có một con số trung thực duy nhất. ACT thường là nhanh nhất trong bốn loại, fine-tune GR00T chậm nhất. Dòng thời gian giai đoạn và biểu đồ loss trên trang chạy cho thấy sớm liệu một lần chạy có đang tiến triển hay không.
Tôi có thể huấn luyện trên một dataset đã gộp không?▾
Có. Dataset đã gộp là dataset thông thường; việc xác thực gộp đã đảm bảo fps, đặc trưng, và loại robot nhất quán rồi. Việc gộp các bản ghi của cùng nhiệm vụ là một trong những cách hiệu quả nhất để đạt đến khoảng 100 đến 200 episode.
Lần chạy GR00T của tôi thất bại trong khi tải dữ liệu. Tôi nên kiểm tra gì trước tiên?▾
Phiên bản định dạng dataset. Việc fine-tune GR00T yêu cầu LeRobot v2.1, và một dataset v3.0 thất bại chính xác ở đó. Kiểm tra phiên bản trong meta/info.json của dataset của bạn.
Tôi có nên loại bỏ các episode thất bại trước khi huấn luyện không?▾
Thường thì có. Các episode được gắn nhãn Failure dạy cho policy hành vi thất bại. Các episode Recovery thì khác: chúng cho thấy cách sửa một lỗi và thường đáng để giữ lại.
Tôi có cần giữ trình duyệt mở trong khi huấn luyện không?▾
Không. Các lần chạy thực thi ở phía server. Trang chạy hiển thị trạng thái hiện tại, biểu đồ, và log bất cứ khi nào bạn quay lại, và checkpoint được lưu bất kể có ai đang theo dõi hay không.
Cách AY-Robots lưu trữ bản ghi điều khiển từ xa theo định dạng LeRobot: cấu trúc episode, trình duyệt episode trên trang tổng quan, gộp file tải lên, và chợ giao dịch.
Mọi cánh tay robot được hỗ trợ trên AY-Robots cùng thông số kỹ thuật: SO-100, Koch v1.1, Franka FR3, FP3 và Panda, WidowX-250, và ALOHA ViperX-300.