AY-Robots 策略对比表,并排展示 GR00T N1.7、GR00T N1.5、Pi0.5、SmolVLA 和 ACT,以及它们的参数数量、GPU 层级、推理延迟和最小 эпизод 计数
vla模型策略训练模型选择lerobotso-100

2026年您应该训练哪种VLA策略?

AY-Robots ResearchAugust 23, 202618 分钟阅读

GR00T N1.7, Pi0.5, SmolVLA, ACT 还是 GR00T N1.5?一份与实际情况匹配的决策表,包含每种选择的已发布基准数据、延迟、每次运行成本和许可信息。

目前,SO-100 级机械臂可训练五种策略。它们在推理延迟方面相差 24 倍,在参数数量方面相差 37 倍,在每次运行成本方面相差 12 倍,并且在是否可以交付结果方面也有所不同。五张模型卡片无法解决问题:没有一张能回答您的问题,我应该首先运行哪一个?

以下所有数据均摘自 2026 年 8 月的论文、代码库和卡片。平台数据来自 AY-Robots 策略目录;如果两者不一致,则同时显示。

简要版本

  • 如果对数据集有疑问,请首先训练 ACT:每次运行 1 到 3 美元,没有预训练模型来掩盖不良数据。
  • GR00T N1.7 和 Pi0.5 在 LIBERO 上的得分相差不到半分,分别为 97.0 和 96.85 到 97.5。这并不是选择其中任何一个的理由。
  • Pi0.5 侧重于泛化能力而非准确性,并且是速度最慢的,为 485 毫秒。
  • SmolVLA 拥有 4.5 亿参数,是这里唯一可以在一张 24 GB 显卡上进行微调的 VLA。
  • ACT 以 20 毫秒的速度是快速反应运动的唯一选择。其余由许可证决定。

决策表

您的情境训练此模型原因
数据集质量未经证实ACT任何预训练模型都无法掩盖损坏的数据集,失败成本为 1 到 3 USD。
接触丰富、多步骤、语言条件GR00T N1.7在四个 LIBERO 套件上达到 97.0%,外加一个相对末端执行器动作空间。
快速反应运动,在伺服器上进行推理ACT20 ms。下一个最快的慢 7.6 倍。
新物体、新场景、开放世界Pi0.5专为分布外行为而构建,覆盖多达 104 个位置。
一张 24 GB 显卡,仍需语言能力SmolVLA450 M 参数,最低 30 集,本地运行。
重现 2025 年记录的运行GR00T N1.5仅在必要时:LeRobot 现在拒绝它,权重非商业用途。
这将作为产品发布N1.7, SmolVLA 或 ACTN1.5 为非商业用途,Pi0.5 附带 Gemma 条款,SmolVLA 的显卡说明无限制。

五种候选方案

所有五种都是 策略:相机帧、关节位置,其中四种还包括语言指令,映射到未来的关节目标块。它们之间的区别在于在您到来之前学习了多少。

策略参数延迟GPU 等级本地?最小集数格式成本
ACT~80 M20 ms24 GB card50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB card30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GB50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GB50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GB50v3.04 to 12 USD

GR00T N1.7

NVIDIA 当前的视觉-语言-动作模型,约 3 B 参数,其中约 40 M 在微调期间训练。该仓库列出了 N1.6 的变化:骨干网络从供应商的 Eagle 模型变为 Qwen3-VL 上的 Cosmos-Reason2-2B,扩散层从 32 变为 16,状态和动作维度从 29 变为 132,动作时间范围从 16 变为 40。

小型机械臂的关键在于相对末端执行器动作空间:N1.7 预测的是相对于当前姿态的增量,这使得 20K 小时的 EgoScale 人类视频能够转化为机器人策略。详细规格请参见N1.7 页面,操作步骤请参考SO-100 上的 N1.7 指南

仓库中为 GA,模型卡中为 EA

Isaac-GR00T 的 README 声明 N1.7 为 正式发布 版本,提供完整的基准测试和支持。其 Hugging Face 模型卡尚未更新:Model Version 字段仍显示 GR00T N1.7 EA。仓库中的文档是最新版本。

GR00T N1.5

相同的 3 B 规模,Eagle 2 主干网络,SigLip2 和 T5,流匹配 DiT 头。它的存在是为了扩展一个你已有的。有两点使其成为一个糟糕的默认选择:权重带有NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. See .

Pi0.5

Physical Intelligence 的 VLA,策略类型pi05。该论文提出了一个从 PaliGemma 初始化而来的 2 B VLM,加上一个 300 M 的动作专家,以 50 Hz 的频率驱动机器人;LeRobot's pi05 config defaults to a 50-step chunk, one second at that rate. The selling point is unseen places: 大约 400 小时在真实家庭中的移动操作,以及对 3、12、22、53、82 和 104 个地点的扩展性研究,其中 104 个地点的模型与在测试家庭本身上训练的对照组相匹配。

一个限制,在lerobot/pi05_base卡片上说明:该端口仅承载流匹配的action head。子任务预测、动作标记化和强化学习未在上游发布,openpi 也对其自己的仓库做了同样说明。Pi0.5 页面SO-100 上的 Pi0.5 指南有其余信息。

吞噬下午的陷阱:门控仓库

Pi0.5 需要门控的 `google/paligemma-3b-pt-224` 分词器(`gated: manual`,尽管 Google 表示请求会立即处理)。如果不在训练环境中接受它并运行 `hf auth login`,任务会启动,下载一段时间,然后因授权错误而终止,该错误看起来像是网络故障。`nvidia/GR00T-N1.7-3B` 未门控,但其 `nvidia/Cosmos-Reason2-2B` 主干已门控(`gated: auto`)。在排队之前清除两者;如果运行闲置,卡住的队列页面列出了要检查的内容。

SmolVLA

4.5 亿参数,其中约 1 亿在动作专家中,基于 SmolVLM-2,VLM 被冻结,并且仅使用其前 16 层语言模型层。预训练数据来自社区:481 个数据集,1060 万帧,来自你使用的相同廉价机械臂。这里唯一适合一张 24 GB 显卡的 VLA,也是唯一一个 30 回合的下限。请参阅SmolVLA 页面.

ACT

不是一个基础模型。来自ALOHA的动作分块Transformer大约有80 M个参数,针对每个任务从头开始训练,基于50个演示,以50 Hz的频率。该论文报告了六个真实的双臂任务,每个任务大约有大约十分钟的演示,在它强调的示例上达到了80%到90%的成功率。它的核心思想,动作分块,存在于本页的每个模型中,其消融实验仍然能最好地衡量其效果:在两个关闭时间集成(temporal ensembling)的模拟任务中,成功率从k=1时的1%上升到k=100时的44%。ACT页面有更多详细信息。

基准测试实际说明了什么

LIBERO是这五个模型中三个报告的基准测试:在模拟的Franka Panda上进行的语言条件任务,分为以下四个套件,每个套件包含十个任务。NVIDIA为每个套件运行了200次试验。

模型空间物体目标10 (长)平均
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
这些行不具有严格可比性

每个数字都来自不同的测试平台和预算。GR00T 在全局批次 640 下运行了 20K 步;openpi 的数据是一个 30K 检查点;LeRobot 移植版在 LIBERO 基础模型上增加了 6K 步。SmolVLA 进一步不匹配:其论文在 LIBERO 上从头开始训练该行,没有 VLA 预训练,而其上方的三个模型则微调了预训练检查点。将 96.85 到 97.5 视为一个集群,而与 87.3% 的差距是真实存在的,但这是以 6.7 倍的参数量换来的。

SimplerEnv 显示了分布情况,而 LIBERO 没有。NVIDIA 将 N1.7 与 N1.6 进行比较,这是最接近公开的代际差异。

SimplerEnv 套件N1.6 平均值N1.7 平均值最佳波动最差波动
Bridge (WidowX),7 项任务56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot),6 项任务52.0%72.5%open_drawer 0.0 to 65.0无,每项任务均有改进

Bridge 行是其中有用的一个:平均获得 5.7 分,而 put_eggplant_in_basket 损失了 36 分,put_eggplant_in_sink 从 33 分下降到 2 分。新一代模型是移动分布而不是提升分布,因此如果您的任务位于 N1.7 退步的区域,那么平均值就毫无意义。

AY-Robots 竞技场排行榜,一个可排序的表格,包含 85 个视觉-语言-动作模型及其 332 个基准测试结果,每个值都链接到其来源论文或模型卡
竞技场包含 85 个 VLA 模型和 332 个基准测试结果,每个结果都链接回其论文或模型卡。这对于检查博客文章中引用的数字是否真实很有用。

在这五个中,只有 SmolVLA 论文报告了 SO-100 级别的机械臂:SmolVLA 在三个任务中达到 78.3%,Pi0 达到 61.7%,两者都是多任务,而 ACT 训练的单任务为 48.3%,这不具有可比性。更清晰的对比是两者都在 SO-101 抓取放置任务上进行单任务训练:分布内 90 对 70,分布外 50 对 40。可在 ACT 对比 SmolVLAPi0.5 对比 SmolVLA 上进行比较,或浏览 竞技场

延迟和成本决定部署

推理延迟是人们最后发现但最先后悔的约束。一个在基准测试中好五分但每动作步慢半秒的策略在你的桌面上看起来会更糟:接触动力学不会等待。

一个注意事项:GR00T 的数据与 NVIDIA 的显卡数据不符,NVIDIA 的显卡在 H100 上以 eager 模式处理 4 个去噪步骤和一个摄像头需要 85.8 ms,使用 torch.compile 为 48.6 ms,通过完整的 TensorRT 为 27.9 ms。这里的 152 ms 是一个包含服务开销和多个摄像头的全栈数据,而不是一个前向传播。

远程推理存在硬性上限

20 到 485 ms 的循环是模型的,公共互联网往返时间会增加其开销。远程推理对于慢速的抓取放置任务是可行的,但对于快速反应运动则不然。如果你的任务需要速度,推理就应该靠近伺服系统:ACT 或 SmolVLA,在本地运行。相关内容:策略在运动中冻结

一种无需更改模型即可争取时间的方法是:SmolVLA 论文测量了同步执行(其中策略在预测下一个块之前完成一个块)与异步执行(其中预测与执行重叠)的对比。成功率相似,78.3 对 73.3,但相同的抓取放置任务耗时 9.7 秒而非 13.75 秒,并且在固定时间内,机器人完成了 19 个周期而非 9 个。

许可证,已检查(因为没人检查)

模型权重许可证代码许可证商业用途
GR00T N1.7NVIDIA 开放模型许可证;模型卡允许商业用途Apache 2.0
GR00T N1.5NVIDIA 单向非商业许可证Apache 2.0
Pi0.5pi05_base 模型卡元数据显示许可证:gemmaApache 2.0 (openpi, LeRobot 文档)两者都读,它们不一致
SmolVLAsmolvla_base 模型卡上没有许可证字段Apache 2.0 (LeRobot)代码是,权重未说明
ACT不存在基础权重Apache 2.0 (LeRobot)

Pi0.5 这一行需要注意。LeRobot pi05 文档声明 Apache 2.0 与 openpi 一致,而 Hub 模型卡 lerobot/pi05_base 带有 license: gemma。两者都有效。GR00T N1.7 有一个 更温和的版本:Isaac-GR00T README 顺带提到 N1.7 在 Apache 2.0 下完全可用于商业许可,而其自身的许可证部分和模型卡仅将代码置于 Apache 2.0 下,并将权重置于 NVIDIA 开放模型许可证下。

您将实际运行的默认值

每个训练器表单都附带一个默认值,并且它们并非随意设置。ACT 的是 LeRobot 自带的:批次 8,lr 1e-5, 100000 训练步数,块大小 100,与上游 ACTConfig 匹配,以及k=100 from the ACT paper. 下面有一列是个陷阱。

策略批次学习率最大步数梯度累积适用?额外旋钮
GR00T N1.7321e-4200001saveSteps
GR00T N1.511e-5200016saveSteps
Pi0.515e-53000016否 (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008seed, logFreq
ACT81e-51000001chunkSize, nActionSteps, seed, logFreq
可复现性,2026 年 8 月

GR00T 的微调入口点 (launch_finetune.py,一个 tyro CLI) 在其配置数据类中没有种子字段,因此运行无法实现逐位复现。该仓库还警告称,由于非确定性图像增强,运行之间存在 5% 到 6% 的差异,这比在线争论的大多数基准差距都要大。LeRobot 的默认种子是 1000。梯度累积列描述的是 lerobot 0.5.1;上游 0.6.2 将其公开为 --accelerator.gradient_accumulation.steps

比模型选择更重要的旋钮

这是动作块。更长的动作块能提供更平滑的运动并减少累积误差,但是策略在块执行期间是固定的,因此它对任何移动的物体反应迟钝:在静态立方体上表现自信,在滚动立方体上则无能为力。如果它超出目标,缩短执行部分比重新训练更有效且免费。关节提前停止是另一个问题;请参阅。

  • ACT: ACTConfig 默认设置为 chunk_size 100n_action_steps 100。时间集成功能已关闭,需要 n_action_steps 1
  • GR00T N1.7: 内部预测范围从 16 增加到 40,但 LeRobot 的 SO-101 示例仍然运行 --policy.chunk_size=16 --policy.n_action_steps=16。rollout 标志已重命名为 --execution-horizon
  • Pi0.5: 一个 50 步的动作块,其中 LeRobot 的 LIBERO 配方通过 --policy.n_action_steps=10 执行 10 步;如果省略该标志,则使用 --policy.pretrained_path 时会回退到 50 步。
  • SmolVLA: 50 动作块,两个参数都已公开。

如何在一下午筛选所有五个模型

最经济的答案不是阅读更多资料。花费大约 15 USD,让机械臂告诉你:录制一次,首先训练廉价模型,一旦数据被证明可靠,再逐步升级。结构胜于数量,这是和的重点。

  1. 1
    一次性记录50个episode

    50个数据集为GR00T、Pi0.5和ACT以及SmolVLA的30个数据集腾出空间。重复每个变体而不是分散:在5个立方体位置上训练50个episode,其中25个没有。请参阅记录您的第一个数据集

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    首先训练ACT,因为它不会欺骗您

    没有预训练权重,所以如果它能完成任务,您的数据集就包含了该任务。如果ACT表现平平,请修复数据。在24 GB显卡上,成本为1到3美元,耗时2到5小时。

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    在相同数据集上运行SmolVLA,无需更改

    相同的数据,相同的机械臂,4.5亿参数而不是8000万,加上语言条件。LeRobot在单个A100上运行2万步大约需要4小时。这会告诉您预训练是否有价值。

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    在使用GR00T之前降级到v2.1

    GR00T读取LeRobot v2格式的一种变体,外加一个额外的meta/modality.json文件,用于映射连接的状态和动作数组如何拆分为命名字段。v3.0数据集会导致该加载器崩溃,因为v3.0将许多episode打包到共享文件中,而v2是每个episode写入一个文件。Isaac-GR00T将降级助手作为scripts/lerobot_conversion/convert_v3_to_v2.py提供;v3拒绝页面是快速路径。

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    仅当前两个模型未能达到预期时,才升级到GR00T N1.7

    通过此处所示的NVIDIA CLI,或LeRobot的groot策略类型。NVIDIA建议微调使用40 GB或更多显存,推理使用16 GB。如果出现OOM,请参阅OOM页面

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

运行该筛选过程的两种方式

三个环境,因为工具链不兼容。主分支上的LeRobot版本是0.6.2,需要Python 3.12或更高版本;Isaac-GR00T和openpi是独立的uv管理仓库。

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T将torchcodec 0.8.0作为其唯一的视频后端,需要FFmpeg 4到7。FFmpeg 8不受支持,AV1不保证。
  • openpi内存要求:推理高于8 GB,LoRA高于22.5 GB,完全微调高于70 GB。最后一个是Pi0.5需要A100的原因。
  • 自行租用GPU,使用后销毁,手动协调三组检查点路径。

基础模型还是从零开始

真正的分歧不在于选择哪个3B模型。而在于是否应该使用预训练的VLA,考虑到ACT在每个任务大约十分钟的演示中学习了六个真实的双手任务,使用了80M参数,并且没有进行任何预训练。

微调预训练VLA而非从头训练ACT
收益
  • 语言条件化。ACT没有;一个ACT检查点只能完成一个任务。
  • 对演示中不存在的物体表现更好:在SO-101上,分布外性能为50%,而ACT为40%。
  • 全面多任务:SmolVLA通过一个检查点在三个SO-100任务上达到78.3%;ACT仅以单任务模式运行。
成本
  • 延迟增加7.6到24倍:每个动作步骤152到485毫秒,而ACT为20毫秒。
  • 每次运行成本4到12美元,而非1到3美元,且需要A100级别显卡而非任何24GB显卡。
  • 许可证风险,以及从头开始训练不存在的门控仓库故障模式。
  • 预训练权重可能掩盖不良数据集。一个在损坏数据上仅部分奏效的微调,在你检查数据之前就会花费一周时间。

复现旧运行案例

追逐2025年的检查点会为你决定模型选择,并将问题转化为版本锁定:当前LeRobot拒绝N1.5,因此你需要锁定lerobot==0.5.1。由于没有种子字段和运行之间5%到6%的差异,复现结果在结构上是近似的。和提供了平台侧的信息。

AY-Robots 的 GR00T N1.7 与 Pi0.5 的正面比较页面,并排显示参数数量、GPU 要求、推理延迟、数据集格式和最小回合数
在 /compare/groot-n1-7-vs-pi0-5 上进行正面比较。这两个 3B 模型在规格表上看起来可以互换,但实际上并非如此:一个需要 LeRobot v2.1,另一个需要 v3.0。

只剩下两个?ACT 对比 GR00T N1.7GR00T N1.7 对比 SmolVLA。原始数据行位于竞技场条目中:GR00T N1.7Pi0.5SmolVLAACT

本平台无法为您提供帮助的方面

  • 它无法加快远程推理速度。20 到 485 毫秒的循环属于模型本身;互联网往返会增加额外延迟。
  • 它无法在您自己的硬件上微调 GR00T 或 Pi0.5。两者在此处都仅支持云端;只有 SmolVLA 和 ACT 可以在本地运行。
  • 它无法修复数据集。损失下降但策略无效 是一个数据问题,只在一种设置下有效的策略 是一个覆盖范围问题。
  • 它无法使 GR00T 运行可复现:上游配置中没有种子字段。

85个模型,332个基准测试结果,每个数字都链接到其来源

本页面表格的可排序版本:85个视觉-语言-动作模型,332个基准测试结果,每个结果都链接回其论文或模型卡。

打开竞技场

选择一个并继续

一个默认方案:记录50个片段,用1到3美元训练ACT以验证数据集,然后用SmolVLA处理相同的数据。总共不到6美元,它们就能回答关键问题:预训练在这里是否有帮助,或者瓶颈是否在于数据。对于接触丰富的多步任务,可升级到GR00T N1.7;当场景变化时,可升级到Pi0.5。

平台演练:训练你的第一个策略,然后运行你的第一个策略。 《训练文档》和《数据集文档》涵盖形式和格式;SO-100页面完整的SO-100指南涵盖构建和校准。背景知识:VLA概述Pi0流匹配文章。能提高你成功率的是数据质量指南

在SO-100上我应该首先训练哪个VLA策略?

ACT,然后是SmolVLA。ACT从头开始训练,因此它无法掩盖糟糕的数据集,并且在24 GB显卡上运行一次的成本为1到3美元。如果ACT能够完成任务,那么为GR00T N1.7或Pi0.5运行支付的4到12美元就不会浪费。

GR00T N1.7真的比Pi0.5更好吗?

在LIBERO上,它们的表现都在误差范围内:GR00T N1.7在四个套件中达到97.0%,Pi0.5在openpi中30k步时达到96.85%,LeRobot移植版达到97.5%,所有这些都来自不同的测试平台。真正的区别在于每个动作步骤152毫秒对比485毫秒,v2.1数据集对比v3.0,以及基准精度对比开放世界泛化能力。

我可以在单个RTX 4090上微调这些模型中的任何一个吗?

SmolVLA和ACT可以;两者都列明适用于RTX 4090或任何24 GB显卡,并可在本地运行。GR00T N1.7、N1.5和Pi0.5需要A100或H100 80 GB显卡,并且在此处仅支持云端。NVIDIA建议GR00T微调需要40 GB或更多显存;openpi对完整的Pi0.5微调的最低要求是70 GB以上,LoRA则为22.5 GB。

这五个模型中,我可以在商业上使用哪一个?

GR00T N1.7的权重受NVIDIA开放模型许可协议约束,该协议说明涵盖商业用途。N1.5的权重是非商业用途。SmolVLA的代码在LeRobot中是Apache 2.0,但lerobot/smolvla_base模型卡没有许可字段,因此权重未声明。ACT没有基础权重需要许可。Pi0.5存在歧义:LeRobot的文档称其为Apache 2.0,但其模型卡元数据显示license: gemma。

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started