Blog
Insights on robotics, AI, and data collection

Chạy vòng lặp DAgger trên SO-100 với chính sách VLA
Mô tả từng bước một vòng DAgger có con người giám sát (human-gated) trên cánh tay SO-100: chạy chính sách và ghi lại, tiếp quản khi nó đi sai hướng, phân loại lượt chạy thành một hiệu chỉnh, kết hợp thành một tập dữ liệu hỗn hợp, và tiếp tục huấn luyện từ một checkpoint. Bao gồm cả cách tiếp quản bằng bàn phím và thanh trượt dành cho những ai không có cánh tay leader, cùng bốn sai lầm khiến cả vòng lặp trở nên vô giá trị.

Đo lường một Vòng lặp DAgger: Tỷ lệ Intervention, Giao thức Evaluation, và những Bẫy ở Giữa
Tỷ lệ intervention — các khung hình intervention chia cho các khung hình của lần chạy — là tín hiệu tiến bộ chân thành rẻ nhất mà một vòng lặp DAgger được kiểm soát bởi con người có. Bài viết này định nghĩa nó sao cho hai người tính toán cùng một giá trị, cho biết cách ghi log nó, và đi qua bốn cách nó dẫn bạn vào sai lầm: thói quen của nhà điều hành, một cấu hình evaluation trôi dạt, chỉ luyện tập trên các sửa chữa, và một người con người sửa chữa khác nhau vào thứ Ba hơn là Thứ Hai.

HG-DAgger và các biến thể được gating: Ai quyết định khi nào để takeover một robot policy
Plain DAgger yêu cầu một người để gán nhãn các state trong khi robot vẫn đang lái. Trên hardware thực, điều này không an toàn và tạo ra các nhãn kém chất lượng. Các biến thể được gating thay thế gán nhãn mù với một cổng mà ai đó phải giữ: con người trong HG-DAgger, một bộ phân loại an toàn trong SafeDAgger, sự không đồng ý của ensemble trong EnsembleDAgger, một ước tính novelty-and-risk có ngân sách trong ThriftyDAgger. Bài viết này so sánh chúng bằng ai sở hữu cổng, tín hiệu nào mở nó, và chi phí của mỗi cái — và tại sao dạng được gating bởi con người là dạng có thể sống sót khi tiếp xúc với một cánh tay thực.

DAgger Giải thích: Tại sao Behavior Cloning Trôi Dạt và Dataset Aggregation Thực sự Chứng minh Điều gì
Behavior cloning điều chỉnh policy trên phân phối trạng thái của chuyên gia và sau đó được triển khai trên chính nó. Khoảng cách giữa hai phân phối này là lý do tại sao một policy trông ổn trong xác thực lại bước ra khỏi bàn ở bước 300. Đây là chương lý thuyết của loạt bài DAgger của chúng tôi: nơi mà thuật ngữ lỗi bình phương xuất phát từ đâu, dataset aggregation thay đổi gì, bằng chứng không hối tiếc giả định điều gì, và phần nào của hóa đơn mà chuyên gia nhân loại vẫn phải trả.

Sử dụng DROID, BridgeData V2 và Open X trên SO-100
DROID, BridgeData V2 và Open X-Embodiment chuyển đổi thành các hành động đầu cuối 7 chiều trên các cánh tay robot 6 và 7 bậc tự do. Một SO-100 sử dụng 6 vị trí khớp. Những gì có thể chuyển giao, những gì không, và nên làm gì thay thế.

Dữ liệu tổng hợp cho các chính sách robot: Nơi mô phỏng hỗ trợ
Mô phỏng có thể nhân một vài bản trình diễn thành hàng nghìn. Dưới đây là những gì các con số đã công bố thực sự nói lên, nơi khoảng cách sim-to-real gây khó khăn và những gì vẫn cần được ghi lại.

Mô hình VLA nhỏ: TinyVLA, SmolVLA và trường hợp dưới 1 tỷ tham số
TinyVLA và SmolVLA đưa một VLA hoạt động xuống dưới 1 tỷ tham số. Các số liệu thực tế từ cả hai bài báo, các cài đặt mặc định của LeRobot, độ trễ đo được và chi phí cho một lần chạy trên card 24 GB.

Chạy suy luận GR00T mà không cần GPU cục bộ
Máy robot của bạn không có GPU. Đặt máy chủ chính sách GR00T trên một GPU đám mây thuê, truyền các khối hành động đến cánh tay, và tìm hiểu chính xác chi phí mạng của bạn.

Cách huấn luyện ACT trên SO-100 từ đầu
Huấn luyện một Action Chunking Transformer từ đầu trên SO-100 với lerobot: cấu hình act, chunk_size và n_action_steps, lịch trình 100000 bước, suy luận 20 ms.

Bạn Nên Huấn Luyện Chính Sách VLA Nào vào Năm 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT hay GR00T N1.5? Một bảng quyết định phù hợp với các tình huống thực tế, cùng với các số liệu điểm chuẩn đã công bố, độ trễ, chi phí mỗi lần chạy và giấy phép đằng sau mỗi lựa chọn.

Chi phí huấn luyện VLA: Một lần tinh chỉnh thực sự tốn bao nhiêu
Giá GPU thị trường giao ngay thực tế, thời gian chạy của từng trong năm chính sách, chi phí của cánh tay robot và các bản trình diễn, và bốn nơi tiền âm thầm biến mất.

Ghi lại tập dữ liệu LeRobot đầu tiên của bạn với SO-100
Ghi lại một tập dữ liệu LeRobot có thể sử dụng được với SO-100: hiệu chuẩn, điều khiển từ xa theo kiểu chủ-tớ, các cờ và giá trị mặc định thực tế của lerobot-record, thiết lập camera, số lượng tập, và các lỗi làm hỏng một lần chạy.

Cách huấn luyện SmolVLA trên GPU 24 GB (lerobot 0.6.1)
SmolVLA là một VLA 450 triệu tham số có thể tinh chỉnh trên một card 24 GB duy nhất. Các lệnh lerobot 0.6.1 thực tế, các cài đặt mặc định thực tế, những cạm bẫy tốn một ngày và chi phí cho một lần chạy.

Cách huấn luyện Pi0.5 trên dữ liệu robot của riêng bạn
Tinh chỉnh Pi0.5, VLA khớp dòng chảy từ Physical Intelligence, trên dữ liệu robot của riêng bạn. Các lệnh thực tế cho openpi và lerobot pi05, những cạm bẫy định dạng tập dữ liệu, giới hạn VRAM và độ trễ.
Chính Sách Robot Khớp Dòng Pi-Zero: Cách Mạng Hóa Điều Khiển Khéo Léo với Khởi Tạo VLM
Khám phá cách kỹ thuật khớp dòng của Pi-Zero, kết hợp với khởi tạo VLM, đang chuyển đổi các chính sách robot tổng quát để điều khiển khéo léo. Tìm hiểu về những ưu điểm của nó so với các phương pháp truyền thống, hiệu quả trong dữ liệu huấn luyện AI cho robot và ý nghĩa đối với việc triển khai robot có khả năng mở rộng trong các ngành công nghiệp.
Isaac Lab: Mô phỏng GPU thế hệ tiếp theo để học robot đa phương thức
Khám phá cách Isaac Lab của NVIDIA cách mạng hóa việc học robot đa phương thức thông qua mô phỏng được tăng tốc bằng GPU, cho phép đào tạo AI nhanh hơn, triển khai có thể mở rộng và tối ưu hóa ROI cho các nhà nghiên cứu và công ty về robot.
Isaac Gym: Mô phỏng Vật lý Gốc GPU cho Học Máy Robot - Mở rộng Quy mô Hàng nghìn Môi trường Song song
Khám phá cách Isaac Gym cách mạng hóa việc học robot với mô phỏng vật lý gốc GPU, cho phép hàng nghìn môi trường song song để học tăng cường nhanh chóng, đào tạo các mô hình VLA và điều khiển từ xa robot AI hiệu quả. Khám phá các điểm chuẩn, tích hợp với PyTorch và các ứng dụng thực tế giúp thu hẹp khoảng cách giữa mô phỏng và thực tế.
BridgeData V2: Low-Cost Robot Data at Scale - Which Imitation Learning and Offline RL Methods Actually Benefit
Explore how BridgeData V2 provides low-cost robot data at scale, enhancing imitation learning methods and offline reinforcement learning. Discover key benchmarks, VLA models in robotics, and efficient robot teleoperation workflows for AI training data collection.
RT-2: Cách Mô Hình Ngôn Ngữ-Hành Động Thị Giác Chuyển Kiến Thức Web Sang Điều Khiển Robot
Khám phá cách Mô hình Ngôn ngữ-Hành động Thị giác RT-2 của Google cách mạng hóa việc điều khiển robot bằng cách chuyển kiến thức web sang các hành động vật lý. Tìm hiểu về kiến trúc, phương pháp đào tạo, khả năng mới nổi và ý nghĩa của nó đối với các công ty và nhà khai thác robot, bao gồm tích hợp với điều khiển từ xa để đào tạo AI hiệu quả.
RT-2: Vì Sao Dữ Liệu Huấn Luyện Robot Chất Lượng Cao Vượt Trội Hơn Thuật Toán – Những Phân Tích Thay Đổi Cuộc Chơi của Google DeepMind
Khám phá cách mô hình RT-2 của Google DeepMind cách mạng hóa lĩnh vực robot AI bằng cách nhấn mạnh vai trò quan trọng của dữ liệu huấn luyện chất lượng cao hơn là các thuật toán tiên tiến. Bài viết này phân tích các thử nghiệm chứng minh tại sao việc thu thập dữ liệu hiệu quả là điều cần thiết cho hiệu suất robot trong thế giới thực. Tìm hiểu cách các nền tảng như AY-Robots có thể giúp thu hẹp khoảng cách về dữ liệu huấn luyện cho những đổi mới trong tương lai.
RT-2 của Google DeepMind: Mô hình Thị giác-Ngôn ngữ-Hành động này đang Thay đổi Cách mạng Học Máy Robot như thế nào
Khám phá cách mô hình Thị giác-Ngôn ngữ-Hành động (VLA) RT-2 của Google đang định hình lại việc học máy robot bằng cách tích hợp dữ liệu trực quan, ngôn ngữ tự nhiên và các hành động theo thời gian thực. Công nghệ AI tiên tiến này tăng cường thu thập dữ liệu cho các nhà điều khiển từ xa và tăng hiệu quả trong các ứng dụng robot. Khám phá tác động tiềm năng của nó đối với tương lai của robot điều khiển bằng AI tại AY-Robots.