Blog
Insights on robotics, AI, and data collection

SO-100 上の VLA Policy で DAgger ループを実行する
SO-100 アームの 1 回の人間ゲート付き DAgger ラウンドの段階的な説明: ポリシーを実行して記録し、問題が発生した時点でテイクオーバーし、ラウンドを修正として提出し、混合データセットを構成し、チェックポイントからトレーニングを継続します。リーダーアームなしの人向けのキーボードとスライダーテイクオーバーパス、およびラウンドを無価値にする 4 つの間違いを含みます。

DAggerループの測定:介入率、評価プロトコル、およびその間の落とし穴
介入率(介入フレーム数を実行フレーム数で除したもの)は、ヒューマンゲート型DAggerループが有する最も安価で誠実な進捗シグナルである。本記事では、2人が同じ値を計算するようにそれを定義し、それをログする方法を示し、それが誤解させるための4つの方法を実装する:操作者の習慣化、ドリフトする評価セットアップ、訂正に対してのみのトレーニング、および月曜日とは異なる火曜日に訂正するヒューマンである。

HG-DAgger とゲート制御型バリアント: ロボットポリシーの引き継ぎを誰が決定するのか
プレーンな DAgger はロボットが運転中に人間が状態にラベルを付けるよう求めます。実際のハードウェアではこれは安全でなく、低品質なラベルを生成します。ゲート制御型バリアントは盲目的ラベリングを誰かが保持する必要があるゲートに置き換えます: HG-DAgger では人間、SafeDAgger ではセーフティ分類器、EnsembleDAgger では集合の不一致、ThriftyDAgger では予算化された新規性とリスク推定。この記事はゲートを誰が保持するか、どの信号がそれを開くか、各々のコストによって比較します。そして実際の腕と接触して生き残るのが人間がゲート制御する形式である理由。

DAgger解説:Behavior Cloningがドリフトする理由と、データセット集約が実際に証明すること
Behavior cloningはポリシーをエキスパートの状態分布にフィッティングしてから展開する。その2つの分布間のギャップが、検証では問題ないように見えるポリシーがステップ300でテーブルから落ちる理由である。これはDAggerシリーズの理論章である:二次誤差項がどこから来るのか、データセット集約が何を変えるのか、no-regret証明が何を仮定するのか、そしてコストのどの部分をヒューマンエキスパートがまだ負担する必要があるのかについて。

SO-100でDROID、BridgeData V2、Open Xを使用する
DROID、BridgeData V2、Open X-Embodimentは、6自由度および7自由度アーム上で7次元のエンドエフェクタアクションに変換されます。SO-100は6つの関節位置を取ります。何が転送され、何が転送されず、代わりに何をすべきか。

ロボットポリシーのための合成データ:シミュレーションが役立つ場所
シミュレーションは、少数のデモンストレーションを数千に増やすことができます。公開されている数値が実際に示していること、sim-to-realギャップが問題となる点、そしてまだ記録する必要があることについて説明します。

小規模VLAモデル: TinyVLA、SmolVLA、および10億パラメータ未満のケース
TinyVLAとSmolVLAは、10億パラメータ未満で動作するVLAを実現します。両方の論文からの実際の数値、LeRobotのデフォルト設定、測定されたレイテンシ、および24GBカードでの実行コストについて説明します。

ローカルGPUなしでGR00T推論を実行する
お使いのロボットマシンにはGPUがありません。GR00TポリシーサーバーをレンタルしたクラウドGPUに配置し、アクションチャンクをアームにストリーミングし、ネットワークがどれくらいのコストになるかを正確に把握します。

SO-100でACTをゼロからトレーニングする方法
lerobotを使用してSO-100でAction Chunking Transformerをゼロからトレーニングします。act config、chunk_sizeとn_action_steps、100000ステップのスケジュール、20 msの推論について説明します。

2026年にどのVLAポリシーをトレーニングすべきか?
GR00T N1.7, Pi0.5, SmolVLA, ACT、それともGR00T N1.5? 実際の状況に合わせた意思決定表。公開されているベンチマーク数値、レイテンシ、実行あたりのコスト、および各選択肢のライセンス情報付き。

VLAトレーニングコスト:ファインチューニングの実行にかかる実際の費用
実際のスポット市場GPU価格、5つのポリシーそれぞれの実行時間、アームとデモンストレーションの費用、そして静かに費用が消えていく4つの場所。

SO-100で最初のLeRobotデータセットを記録する
SO-100で利用可能なLeRobotデータセットを記録する:キャリブレーション、リーダー・フォロワー方式のテレイグジスタンス、実際のlerobot-recordフラグとデフォルト、カメラ設定、エピソード数、および実行を台無しにする欠陥。

24 GB GPUでSmolVLAをトレーニングする方法 (lerobot 0.6.1)
SmolVLAは4億5000万パラメータのVLAで、単一の24 GBカードでファインチューニングできます。実際のlerobot 0.6.1コマンド、デフォルト設定、1日を無駄にする落とし穴、そして実行にかかるコストについて解説します。

Pi0.5を自分のロボットデータで学習させる方法
Physical IntelligenceのフローマッチングVLAであるPi0.5を、自分のロボットデータでファインチューニングします。openpiとlerobot pi05の実際のコマンド、データセット形式の落とし穴、VRAMとレイテンシの制限について解説します。
Isaac Lab: 次世代GPUシミュレーションによるマルチモーダルロボット学習
NVIDIAのIsaac Labが、GPUアクセラレーションによるシミュレーションを通じて、マルチモーダルロボット学習をどのように革新し、AIトレーニングの高速化、スケーラブルな展開、ロボット工学の研究者や企業向けのROIの最適化を実現するかをご覧ください。
Isaac Gym: ロボット学習のための GPU ネイティブ物理シミュレーション - 数千の並列環境のスケーリング
Isaac Gym が GPU ネイティブの物理シミュレーションでロボット学習に革命を起こし、迅速な強化学習、VLA モデルのトレーニング、効率的な AI ロボットの遠隔操作のために数千の並列環境を可能にする方法をご覧ください。ベンチマーク、PyTorch との統合、シムツーリアルのギャップを埋める現実世界のアプリケーションを探求してください。
BC-Z: ロボット模倣学習によるゼロショットタスクの一般化 - スケールが本当に意味するもの
BC-Zが、スケーリングされたデモンストレーションデータを通じてゼロショットタスクの一般化を可能にすることで、ロボット模倣学習にどのように革命をもたらすかを探ります。スケーリング則、VLAモデル、テレオペレーションのベストプラクティス、およびロボット企業とAIエンジニアのROIの利点を発見してください。
DROIDデータセット:AIトレーニング向けの大規模ロボット操作に革命を起こす
大規模ロボット操作データセットであるDROIDデータセットが、実際の環境からの76,000件を超えるデモンストレーションにより、ロボットのAIトレーニングをどのように変革しているかをご覧ください。VLAモデル、ベンチマーク、およびロボット工学企業向けの拡張可能なデータ収集方法への影響について学びます。
BridgeData V2: 低コストのロボットデータの大規模化 - 模倣学習およびオフラインRLのどの手法が実際に役立つか
BridgeData V2が低コストで大規模なロボットデータを提供し、模倣学習法とオフライン強化学習をどのように強化するかを探ります。主要なベンチマーク、ロボティクスにおけるVLAモデル、AIトレーニングデータ収集のための効率的なロボット遠隔操作ワークフローを発見してください。
Pi-Zero Flow-Matching Robot Policies: Revolutionizing Dexterous Control with VLM Initialization
Discover how Pi-Zero's flow-matching technique, combined with VLM initialization, is transforming generalist robot policies for dexterous control. Learn about its advantages over traditional methods, efficiency in AI training data for robotics, and implications for scalable robot deployment in industries.
RT-2:ビジョン・言語・行動モデルがウェブの知識をロボット制御にどのように転送するか
GoogleのRT-2ビジョン・言語・行動モデルが、ウェブの知識を物理的な行動に転送することで、ロボット制御に革命を起こす方法をご覧ください。そのアーキテクチャ、トレーニング方法、創発的機能、ロボット企業やオペレーターへの影響(効率的なAIトレーニングのためのテレオペレーションとの統合を含む)について学びます。
ビジョン-言語-アクションモデル:ロボット学習の未来
ビジョン-言語-アクション(VLA)モデルが、ビジョン、言語、アクションを統合して、よりスマートで効率的なロボット工学を実現し、ロボット学習に革命を起こしている様子を探ります。この包括的なガイドで、アーキテクチャ、トレーニング方法、ベンチマーク、および展開のROIを発見してください。
Google DeepMind の RT-2: 視覚-言語-行動モデルがロボット学習をどのように変革しているか
Google の RT-2 視覚-言語-行動 (VLA) モデルが、視覚データ、自然言語、リアルタイム動作を統合してロボット学習を再定義する方法を発見してください。この革新的な AI 技術は、遠隔操作者のデータ収集を強化し、ロボットアプリケーションの効率を向上させます。AY-Robots で、AI 駆動型ロボットの未来への潜在的な影響を探求してください。
RT-2: 高品質なロボット訓練データがアルゴリズムを上回る理由 – Google DeepMindの画期的な洞察
Google DeepMindのRT-2モデルが、AIロボティクスを革新する仕組みを発見してください。このモデルは、高品質な訓練データの重要性を強調し、進んだアルゴリズムよりも優先します。この記事では、効果的なデータ収集が実世界のロボット性能に不可欠であることを示す実験を詳述します。また、AY-Robotsのようなプラットフォームが、将来の革新のための訓練データのギャップを埋める方法を学びましょう。