Blog
Insights on robotics, AI, and data collection

在 SO-100 上运行 DAgger 循环搭配 VLA 策略
一个人类管控的 DAgger 轮次的逐步说明,在 SO-100 臂上进行:运行策略并记录,出现问题时接管,将运行作为修正归档,组合混合数据集,并从检查点继续训练。包含了不带 leader 臂的人员的键盘和滑块接管路径,以及使一个轮次无用的四个错误。

测量 DAgger 循环:干预率、评估协议及其间的陷阱
干预率——干预帧数除以运行总帧数——是人工门控 DAgger 循环拥有的最廉价诚实进展信号。本文定义了它,使得两个人可以计算出相同的值,展示了如何记录它,并详细讨论了四种误导方式:操作员习惯化、漂移的评估设置、仅在修正上训练,以及一个人在周二和周一的修正方式不同。

HG-DAgger 和门控变体: 谁决定何时接管机器人策略
普通 DAgger 要求人类在机器人仍在行驶时标记状态。在真实硬件上这是不安全的,并且会产生质量差的标签。门控变体用必须由某人按住的门替换盲目标记: HG-DAgger 中的人类、SafeDAgger 中的安全分类器、EnsembleDAgger 中的集合分歧、ThriftyDAgger 中的预算化新颖性和风险估计。本文根据谁拥有门、什么信号打开门以及每个门的代价来比较它们——以及为什么人工门控的形式是与真实机械臂接触后仍然有效的那种。

DAgger讲解:行为克隆为何漂移以及数据集聚合实际证明了什么
行为克隆在专家的状态分布上拟合一个策略,然后在其自身基础上部署。这两个分布之间的差距是为什么在验证中看起来很好的策略在第300步时从桌子上走下去。这是我们DAgger系列的理论章节:二次误差项来自何处、数据集聚合改变了什么、无悔证明假设了什么,以及人类专家还需要支付多少成本。

在 SO-100 上使用 DROID、BridgeData V2 和 Open X
DROID、BridgeData V2 和 Open X-Embodiment 转换为 6 自由度和 7 自由度机械臂上的 7 维末端执行器动作。SO-100 接收 6 个关节位置。哪些可以迁移,哪些不可以,以及替代方案。

机器人策略的合成数据:仿真如何提供帮助
仿真可以将少量演示扩展成数千个。以下是已发布数据真正说明的内容、仿真到现实差距的影响,以及仍需记录的内容。

小型VLA模型:TinyVLA、SmolVLA以及10亿参数以下的情况
TinyVLA和SmolVLA将可用的VLA模型参数量控制在10亿以下。本文提供了来自两篇论文的真实数据、LeRobot的默认设置、测量的延迟,以及在24 GB显卡上运行的成本。

在没有本地GPU的情况下运行GR00T推理
您的机器人设备没有GPU。将GR00T策略服务器部署在租用的云GPU上,将动作块流式传输到机械臂,并精确了解网络成本。

如何从零开始在 SO-100 上训练 ACT
使用 lerobot 在 SO-100 上从零开始训练一个 Action Chunking Transformer:act 配置、chunk_size 和 n_action_steps、100000 步训练计划、20 毫秒推理。

2026年您应该训练哪种VLA策略?
GR00T N1.7, Pi0.5, SmolVLA, ACT 还是 GR00T N1.5?一份与实际情况匹配的决策表,包含每种选择的已发布基准数据、延迟、每次运行成本和许可信息。

VLA 训练成本:微调运行的真实成本
真实的现货市场 GPU 价格,五种策略各自的运行时间,机械臂和演示的成本,以及资金悄然消失的四个地方。

使用 SO-100 录制您的第一个 LeRobot 数据集
使用 SO-100 录制一个可用的 LeRobot 数据集:校准、主从遥操作、实际的 lerobot-record 标志和默认值、摄像头设置、剧集数量,以及导致运行失败的缺陷。

如何在 24 GB GPU 上训练 SmolVLA (lerobot 0.6.1)
SmolVLA 是一个拥有 4.5 亿参数的 VLA 模型,可以在单张 24 GB 显卡上进行微调。本文包含真实的 lerobot 0.6.1 命令、实际的默认设置、耗时一天的陷阱,以及每次运行的成本。

如何在您自己的机器人数据上训练 Pi0.5
在您自己的机器人数据上微调来自 Physical Intelligence 的流匹配 VLA 模型 Pi0.5。包含 openpi 和 lerobot pi05 的实际命令、数据集格式陷阱、VRAM 和延迟限制。
Pi-Zero流动匹配机器人策略:利用VLM初始化革新灵巧控制
了解Pi-Zero的流动匹配技术与VLM初始化相结合,如何改变用于灵巧控制的通用机器人策略。了解其相对于传统方法的优势、机器人AI训练数据的效率以及对行业中可扩展机器人部署的影响。
Isaac Lab:用于多模态机器人学习的下一代 GPU 模拟
了解 NVIDIA 的 Isaac Lab 如何通过 GPU 加速模拟彻底改变多模态机器人学习,从而为机器人研究人员和公司实现更快的 AI 训练、可扩展的部署和优化的 ROI。
Isaac Gym:用于机器人学习的 GPU 原生物理模拟 - 扩展数千个并行环境
了解 Isaac Gym 如何通过 GPU 原生的物理仿真彻底改变机器人学习,从而实现数千个并行环境,以实现快速强化学习、VLA 模型训练和高效的 AI 机器人远程操作。探索基准、与 PyTorch 的集成以及弥合模拟到现实差距的实际应用。
BC-Z:通过机器人模仿学习实现零样本任务泛化 - 规模的真正含义
探索 BC-Z 如何通过缩放演示数据,通过实现零样本任务泛化来彻底改变机器人模仿学习。了解机器人公司和 AI 工程师的缩放定律、VLA 模型、远程操作最佳实践和 ROI 优势。
DROID 数据集:彻底改变用于 AI 训练的大规模机器人操作
了解 DROID 数据集(一种大规模机器人操作数据集)如何通过来自真实环境的超过 76,000 次演示来改变机器人 AI 训练。了解其对 VLA 模型、基准以及机器人公司可扩展数据收集方法的影响。
BridgeData V2:低成本大规模机器人数据 - 哪些模仿学习和离线强化学习方法真正受益
探索 BridgeData V2 如何以低成本提供大规模机器人数据,从而增强模仿学习方法和离线强化学习。了解机器人技术中的关键基准、VLA 模型以及用于 AI 训练数据收集的高效机器人远程操作工作流程。
开放 X-Embodiment:彻底改变跨 20 多种形态的大规模机器人学习
了解开放 X-Embodiment(一个跨越 20 多种机器人形态的协作数据集)如何改变机器人学习。了解 RT-X 模型、跨形态泛化以及机器人公司通过高效数据收集和远程操作提高投资回报率的实用策略。
RT-2:视觉-语言-动作模型如何将网络知识转移到机器人控制
了解谷歌的 RT-2 视觉-语言-动作模型如何通过将网络知识转移到物理动作来彻底改变机器人控制。了解其架构、训练方法、涌现能力以及对机器人公司和运营商的影响,包括与远程操作集成以实现高效的 AI 训练。
视觉-语言-动作模型:机器人学习的未来
探索视觉-语言-动作 (VLA) 模型如何通过整合视觉、语言和动作来彻底改变机器人学习,从而实现更智能、更高效的机器人技术。在本综合指南中,了解架构、训练方法、基准和部署的投资回报率。
Google DeepMind 的 RT-2:这种视觉-语言-动作模型如何改变机器人学习
了解 Google 的 RT-2 视觉-语言-动作 (VLA) 模型如何通过整合视觉数据、自然语言和实时动作来重塑机器人学习。这项创新的 AI 技术增强了远程操作员的数据收集,并提高了机器人应用的效率。在 AY-Robots 探索其对 AI 驱动机器人未来的潜在影响。
RT-2:为什么高质量机器人训练数据胜过算法——谷歌 DeepMind 的变革性洞见
发现谷歌 DeepMind 的 RT-2 模型如何革新 AI 机器人领域,通过强调高质量训练数据的重要性,而不是依赖高级算法。这篇文章剖析了实验,证明了有效数据收集对于真实世界机器人性能至关重要。了解像 AY-Robots 这样的平台如何帮助弥合训练数据差距,推动未来创新。