遠隔操作インターフェイスを通じてロボットアームを監視するオペレーター、コントロールに手を置き、引き継ぎの準備ができている状態
DAggerインタラクティブ模倣学習HG-DAggerロボットポリシーSO-100

HG-DAgger とゲート制御型バリアント: ロボットポリシーの引き継ぎを誰が決定するのか

AY-Robots ResearchAugust 27, 202615 分で読む

プレーンな DAgger はロボットが運転中に人間が状態にラベルを付けるよう求めます。実際のハードウェアではこれは安全でなく、低品質なラベルを生成します。ゲート制御型バリアントは盲目的ラベリングを誰かが保持する必要があるゲートに置き換えます: HG-DAgger では人間、SafeDAgger ではセーフティ分類器、EnsembleDAgger では集合の不一致、ThriftyDAgger では予算化された新規性とリスク推定。この記事はゲートを誰が保持するか、どの信号がそれを開くか、各々のコストによって比較します。そして実際の腕と接触して生き残るのが人間がゲート制御する形式である理由。

クローンされたポリシーはトレーニングデータが尽きたところで失敗します。修正方法は示範者の代わりにポリシー自身の状態分布の下でデータ収集を続けることです。これは DAgger が実行することです。そして データセット集約の導入 は第一原理から説明します。元のアルゴリズムの厄介な部分が残ります: 学習器が運転中、専門家はコントロール下にないまま、あらゆる状態について自分ならどうしたかを言うことになっています。

スクリプト化された専門家を持つシミュレータではそれは自由です。その上に本物のアームがあるテーブルではそれはどちらでもありません。HG-DAgger の著者は異議を正確に述べています: そのようなサンプリング方式は「専門家がシステムを完全にコントロール下に置かずにアクション ラベルを提供する必要があります」とのことで、「安全性を低下させる可能性があり、人間を専門家として使用する場合、認識されるアクチュエータラグによりラベルの品質を低下させる可能性があります」(Kelly et al., 2019)。その文には 2 つの失敗が隠れています: ポリシーは誰も望まない状態に運転し続けます。そのリスクで購入されたラベルはコントロールを保持中に人間が生成したものより悪いです。以下のすべてのバリアントは同じ質問に答えます。コントロールにゲートを置き、誰かに開くタイミングを決定させます。彼らは誰がそれを決定するかで異なります。

短いバージョン

  • ゲート制御型バリアントは盲目的ラベリングをポリシーコントロールと専門家コントロール間のスイッチに置き換えます。彼らを分けるのはスイッチの所有者です。
  • HG-DAgger はスイッチを人間に与え、人間が中断のないコントロールを持っていた間に記録されたデータのみを集約します。
  • SafeDAgger はそれを参照ポリシーからの偏差を予測する二値分類器に与えます。EnsembleDAgger は低いアンサンブル分散と専門家アクションへの小さな距離を同時に必要とします。
  • LazyDAgger はヒステリシスを追加してコントロールがピンポン現象しないようにします。ThriftyDAgger は明示的な干渉予算の下で新規性または推定リスクに基づいてゲートします。
  • ロボット制御信号には、ホビークラスアームで微調整された VLA が通常欠いているもの: 参照ポリシー、安価なアンサンブル、またはキャリブレーションされた認識論的不確実性が必要です。
  • ゲートはメソッドの半分です。その後、干渉セグメントに何が起こるか。ミックス、重み付け、集約。それがラウンドが何かを改善したかどうかを決定します。

人間がゲート制御と ロボットがゲート制御: 重要な分割

インタラクティブ模倣学習には独自の調査があります。Celemin と同僚はそれをフィードバック タイプ、インターフェイス、学習モデル、ユーザー エクスペリエンス、アプリケーション、ベンチマークとともにカタログします。エンジニアリングを決定する区別はこれらのどの軸よりも単純で、最近の研究ではそれを直接命名しています: メソッドは 人間がゲート制御 監督者が干渉するタイミングを決定する場合、そして ロボットがゲート制御 エージェントが支援を求めるタイミングを決定する場合 (Cai et al., 2025)。その他すべては、これら 2 つの選択肢の 1 つに役立つメカニズムです。トレードオフは最初から見えます: 人間のゲートは継続的な注意が必要で、ロボットのゲートはその注意を返すことを約束します。ただし、それがゲートされる信号が信頼できる場合のみです。そしてその信号を構築することはそれ自体の研究課題です。

SafeDAgger: 独自の偏差を予測する分類器

Zhang と Cho の SafeDAgger (2016) はこれらのゲートの最初のものです。参照ポリシーへのクエリは高価な部分なので、2 番目の小さなネットワーク。セーフティ ポリシー。クエリが適切かどうかを予測します。「プライマリ ポリシーがクエリなしで参照ポリシーから偏差する可能性があるかどうかを示すバイナリ ラベルを返します」。ラベルは 2 つのポリシーのアクション間の 2 乗 L2 偏差に対してしきい値 tau で定義され、分類器はバイナリ クロスエントロピーでフィットされます。実行時にはポリシーあたりの状態で学習器がドライブを続けるか参照が引き継ぐかを決定します。概要は自動車レーシング シミュレータでのクエリの削減と著者が自動カリキュラム効果に帰属させる収束の高速化を報告しますが、どちらについても数字は示していません。

問題は結果ではなく定義にあります。分類器のトレーニングには参照ポリシーのアクションがフィットに使用されるすべての状態で必要であり、これは参照が別のプログラムであることを前提としています。参照がリーダーアームを持つ人間の場合、そのラベル セットは安価ではなく、メソッドは設計された特性を失います。

EnsembleDAgger: 疑い と不一致の両方

Menda、Driggs-Campbell および Kochenderfer (2019) はゲートを確率的な質問として扱います。EnsembleDAgger は「ニューラル ネットワークのアンサンブルを使用してガウス過程を近似し」、アンサンブル分散を信頼プロキシとして読み取ります: 高分散はトレーニング データとは異なる領域を意味し、専門家が失敗状態を回避することを前提として、失敗への近接性と相関します。規則は接続詞です。学習器は、その平均アクションと専門家のアクション間の L2 距離が 1 つのしきい値 (不一致) より低い場合にのみ行動できます そして その予測アクションの分散が 2 番目 (疑い) より低い場合。どちらかが失敗した場合、専門家がコントロールを取ります。目標は失敗の確率を制約しながら学習器のアクション シェアを最大化することです。論文は倒立振子と MuJoCo HalfCheetah で他の DAgger バリアントに対する安全性と学習の改善を報告します。

不一致項は専門家のアクションが必要です

これは静かに放任監督のための完全なルールを失格にします。学習器のアクション と専門家のアクション間の距離には、その状態でその瞬間に専門家のアクションが必要です。スクリプト化された専門家との場合、問題ありません。人間との場合、人間は継続的にアクションを生成する必要があります。これはまさにゲート制御型バリアントが削除することを目的とした負担です。疑いの項だけは放任です。接続詞ではありません。

LazyDAgger: スイッチがチャタリングするのを止める

Hoque と同僚 (2021) は以前の論文が測定しなかったコストに対処しました。スイッチそのもの。各干渉は「人間が行っている他の仕事を中断し、監督者と自律制御間のコンテキスト スイッチごとにレイテンシが発生し、実行に時間がかかります」。1 分に 10 回開いたり閉じたりするゲートは、同じ自律シェアで 10 秒間に 1 回開くゲートより悪いです。LazyDAgger は非対称しきい値で SafeDAgger を拡張します。監督者コントロールに入るのは留まるより難しいです。システムが境界で振動しないようにします。シミュレーションでは「3 つの継続的制御タスクで SafeDAgger よりもコンテキスト スイッチを平均 60% 削減でき、最先端のポリシー パフォーマンスを維持します」。ABB YuMi でのファブリック操作では「コンテキスト スイッチを 60% 削減しながら、実行時に SafeDAgger より 60% 高い成功率を達成します」。

ThriftyDAgger: 予算の下での新規性またはリスク

ThriftyDAgger (Hoque et al., CoRL 2021) はポリシーではなく監督者の予算から始まります。「学習されたスイッチング ポリシーを使用して、十分に (1) 新しい状態のみで干渉を求めます。ロボット ポリシーは模倣する参照動作がありません。または (2) リスク。ロボットはタスク完了に対する信頼度が低いです」。そのリスクを推定するための新しいメトリック。予算は入力です。結果ではありません。支出する人間の時間を述べます。実行時に適用されたメソッドは「シミュレーション タスクと物理タスクの両方で 100% の成功率を達成し」、10 人の参加者が 3 ロボット フリートを集中タスクと一緒に制御するユーザー研究では「人間とロボットのパフォーマンスが 58% と 80% 向上しました」と報告しています。次善のアルゴリズムと比較して、監督者の負担が軽減されます。フリート設定はこの作業の自然なホームです。Fleet-DAgger はその後、複数のロボットと監督者による対話的フリート学習を正式化し、Return on Human Effort を最適化する量として提案しました。

HG-DAgger: 人間がゲートを保持する

Kelly et al. (2019) は別の方法で進みます。スイッチング ポリシーはありません。学習器は「専門家が初心者が状態空間の安全でない領域に入ったことを観察するまで」ロールアウトされ、その時点で専門家がコントロールを取り、システムをガイド バックします。集約ルールは厳密な部分です: 「専門家のアクション ラベルは、人間の専門家がシステムの中断のないコントロールを持つこれらの回復軌跡の間のみに収集され、データセットに追加されます。」人間が観客である間、何もラベル付けされません。

スイッチで止まりません。HG-DAgger は「完全にトレーニングされた初心者のパフォーマンスを状態空間のさまざまな領域で予測するために使用できるモデル不確実性ベースのリスク メトリックの安全性しきい値を学習」します。人間が干渉した瞬間に学習器がどの程度不確かであったかをログに記録し、学習器が最終形態に最も似ている最後の 4 分の 1 のレコードを平均化します。これはロボットが動作するゲートではなく、完成したポリシーが保持されると予想される場所を告げる診断です。評価はシミュレーションされた実世界のドライビング タスクを対象とし、DAgger と行動クローニングの両方より優れたパフォーマンスを報告しています。

関連する 1 つの行はラベルとしてカウントされるものを変更します。Spencer と同僚の Expert Intervention Learning は「干渉または非干渉のいずれかによるあらゆる量の専門家フィードバックは、現在の状態の品質、アクションの最適性、またはその両方に関する情報を提供します」と保持しており、学習者の値関数への制約として正式化され、ノー リグレット オンライン学習で解決されました。その読み方では、人間が見守り、何もしなかった区間は空ではなく弱い肯定的な証拠です。EIL は約 1 分の専門家コントロールから衝突回避を学習します。

監督されたポリシー ロールアウト中のデータ収集のためにカメラが配置されているロボット アーム ワークスペース
人間がゲート制御するラウンドは、レコーダーが接続された通常の推論実行です。オペレーターが運転したフレームはフラグが立てられます。残りはそのままです。

バリアント並べて

メソッド誰がゲートを開くか信号利用可能なニーズ報告済み
DAgger (Ross et al., 2011)誰もいません。学習器は常に運転しますなし。専門家はすべての訪問された状態にラベルを付けますコントロール下にないオフ ポリシー状態にラベルを付けることができる専門家学習器の状態分布の下での保証によるノー リグレット削減
HG-DAgger (Kelly et al., 2019)人間の監督者状態が安全でないという監督者の判断誰かが見守り、コントロールの清潔な引き継ぎシミュレーションされた実世界のドライビング タスクで DAgger と行動クローニングを打ち負かします。リスク しきい値も学習します
SafeDAgger (Zhang & Cho, 2016)ロボット参照からの L2 偏差のバイナリ分類器 tau の上に分類器のラベルのためのクエリ可能な参照ポリシーレーシング シミュレータでのクエリの削減、より高速な収束 (数字は示されていません)
EnsembleDAgger (Menda et al., 2019)ロボットアンサンブル分散と専門家アクションへの距離の両方、しきい値の下ネットワークのアンサンブル + 各ステップでの専門家のアクション振子と HalfCheetah での安全性と学習の向上
LazyDAgger (Hoque et al., 2021)ロボット、ヒステリシス付きSafeDAgger の信号、別の入場と出場のしきい値付きSafeDAgger が必要なもの + チューニングする 2 番目のしきい値3 つのタスクでのコンテキスト スイッチが約 60% 削減。YuMi ファブリックでの成功が 60% 向上
ThriftyDAgger (Hoque et al., 2021)ロボット、予算の下で新規性、またはタスクを完了しないと推定されるリスク学習されたリスク推定器と述べられた干渉予算実行時に 100% の成功。ユーザー研究 (N=10): 次善より 58% と 80% の利益
EIL (Spencer et al., 2020)人間。非干渉もカウントされます値関数への制約としての干渉とその不在値制約を超えるオンライン ノー リグレット学習約 1 分の専門家コントロールからの衝突回避

各ゲートが購入するもの、そして請求するもの

「ニーズ」列を下に読み、パターンが出ます: そこにあるすべてのロボット制御信号は製造する必要があるプロキシであり、各プロキシには独自の請求があります。

  • 不一致信号 (SafeDAgger、LazyDAgger、EnsembleDAgger のルールの半分) には参照ポリシーが必要です。スクリプト化された専門家がいるか、その場合は興味深い問題は既に解決されているか、または人間はバックグラウンドでアクションを生成し続けて距離を計算できます。
  • 疑いの信号には、キャリブレーションされた認識論的不確実性が必要です。小さな制御ネットワークのアンサンブルはそれを近似します。30 億パラメータのビジョン言語アクション モデルのアンサンブルは、まずメモリとレイテンシの問題です。
  • 新規性とリスク信号には、十分に成功した失敗したロールアウトでフィットされたタスク完了の学習推定器が必要です。まだ機能していないタスクでは、そのデータは最初のラウンドに存在しません。
  • 人間のゲートには注意が必要で、それ以外は何もありません。初日に利用できる唯一の信号、あらゆるポリシー アーキテクチャで、トレーニングするための追加モデルなしで。
  • ロボット ゲートは人間を部屋から削除しません。彼らは人間が行動する頻度を減らします。存在する必要があるかどうかではなく。

ゲートが生成する内容には、より静かな違いがあります。軌道の途中で起動するロボット ゲートは、任意のポーズで動いてきた腕を人に手渡します。人間のゲートにより、オペレーターはタイミングを選択できます。リーチ後、グラスプの前、スウィング中盤ではなく。2 つからの回復セグメントは同じくらい清潔ではなく、これらのセグメントはラウンド全体の製品です。

人間がゲート制御する形式が実際のハードウェアで勝つ理由

これはエンジニアリング議論であり、ベンチマーク結果ではありません。同じポリシー クラスを持つ同じマニピュレーターで 5 つのゲートすべてを実行する論文は見つかりませんでした。4 つのポイントに基づいています。

まず、監督者はとにかくそこにいます。誰も ご覧になっていませんSO-100 アーム 転倒させることができるオブジェクトの隣で無人で実行中。誰かが見守っていたら、テイクオーバー ボタンを与えることの限界費用はほぼ 0 です。キャリブレーションされたリスク推定器を構築することはプロジェクトです。

次に、最新のポリシーで実際に測定できる不確実性はしばしば間違った量です。拡散またはフロー マッチング ヘッドはサンプリングされたアクション チャンク全体で分散を生成し、その分散はヘッドが表現するように訓練されたマルチモーダリティを反映します。状態に関する認識論的無視ではなく。EnsembleDAgger の疑いの項は、後者を正確にキャプチャするためにアンサンブルを使用します。2 つは同じ番号に見え、そうではありません。アクション チャンキング そして フロー マッチング エントリは、これらのヘッドが最初にアクションをどのように放出するかを説明します。

第 3 に、操作で重要な失敗はしばしば統計的に異常ではなく意味的です。ポリシーがグリッパーを 2 センチ早く閉じたり、同じ 2 つの立方体のうち間違ったものに自信を持ってリーチしたりすることは、高分散状態にありません。自信があり、間違っています。分散のしきい値はそれをキャッチしません。見守っている人はそれをすぐにキャッチします。

第 4 に、ラベル品質。元の HG-DAgger ポイント、そして最もスキップされるポイント。人間が中断のないコントロールを持っている間に収集されたラベルは、移動中のシステムで語られたラベルを打ち負かします。目標が集約する価値のある修正データの場合、証明の負担は自動ゲートにあります。

ロボット ゲートがどこで利益を生むか

1 人の監督者が多くのロボットを担当する場合、画像が反転します。ThriftyDAgger のユーザー研究と Fleet-DAgger の正式化ターゲットのレジーム。フリートでは、人間の注意は希少資源であり、不完全な割り当てはなしに勝ちます。1 つのデスク上の 1 つのアームでは、そのレジームにいません。

人間がゲート制御するループ、既に配線済み

実行中の推論セッション中のテイクオーバー、修正セグメント上のフレームごとの干渉フラグ、各実行を修正または評価にキュレーション、選んだソースから混合データセットを構成、既存のチェックポイントからトレーニングを継続するはビルトインであり、手書きではありません。テイクオーバーはリーダー アームで動作するか、持っていない場合はキーボードとスライダーで動作します。

DAgger ループの実行方法を確認してください

ゲートはメソッドの半分です。データ処理はもう一方の半分です

ゲートは人間が運転したフレームを決定します。それらに何をするかではなく、その 2 番目の決定がラウンドが最も頻繁に浪費される場所です。最初のルールは DAgger の D が表すものです: 集約して、置き換えないでください。微調整する チェックポイント 純粋に数百の修正フレームでは、回復しか見ていないモデルが得られ、公称軌道を忘れています。

2 番目のルールは、干渉フレームが通常のフレームではないということです。Mandlekar et al. オペレーターがポリシーを監視し、失敗時に引き継ぐことができる 6-DoF 操作用のリモート遠隔操作システムを構築しました。その後、アルゴリズムを使用して反復的にトレーニングしました。「ポリシーが干渉を通じてボトルネックをトラバースする方法を学習することを奨励します」。そのデータでトレーニングされたエージェントは、通常の実証サンプルの等しい数でトレーニングされたエージェントを上回りました。Sirius はこのアイデアをデプロイメントに押し込み、「近似した人間の信頼でトレーニング サンプルを再度重み付けし、重み付け行動クローニングでポリシーを最適化する」。両方とも、人間が運転したものを示すフレームごとのマーカーが必要です。これが理由です 干渉 フラグはそれが見えるより重要です。

3 番目のルールは、自動ミキシングがトラップであるということです。ソースを列挙できない構成データセットは、次のラウンドが悪くなった場合にデバッグできないものです。このプラットフォームでは、そのため compose ステップが明示的です。元のデータセット + 修正、ソースごとのエピソード選択、結果は通常です LeRobot データセット それは他と同様に同期およびトレーニングします。データセット ドキュメント はフォーマット側をカバーします。

ラウンドのステップそれが生成するもの最も一般的な失敗方法
録音を記録して推論を実行するポリシー自身の状態分布の下での実行プレーン遠隔操作として記録され、ポリシーが運転していることを失うこと
失敗時に引き継ぐフレームごとの干渉フラグ付き修正セグメント化粧品のふらつきを修正し、回復ではなくスタイルを教えること
各エピソードをキュレーション修正、評価、または廃棄すべてを保持。失敗したテイクオーバーはエピソードの価値より高いコストがかかります
修正を同期する元の横にあるバージョン管理されたデータセットローカル マシンを離れないと修正
混合データセットを構成する元の + 修正、明示的な選択サイレント自動ミキシング、したがって後の回帰をソースにトレースできません
チェックポイントから続行前のものから初期化されたチェックポイントオプティマイザー再開を期待しています。重みはモデルを初期化します。オプティマイザーの状態を復元しません

実際に人が持つことができるゲートを設定する

「人間が決定する」は仕様ではありません。異なるしきい値を持つ 2 つのオペレーターは比較不可能なラウンドを生成し、ドリフトするしきい値はあなたが読むことができない傾向を生成します。最初の実行の前にトリガーを書き留めます。

  1. ゲートを開く条件を名前にします。固定マージン以上でアプローチがオフになり、グリッパーが何も閉じず、ジョイントがリミットに向かってドリフトし、1 秒または 2 秒以上の停止があります。ラウンドのリストを変更しないようにします。
  2. それを開かないものを名付けます。ポリシーが独自に回復するオーバーシュートはトレーニング信号です。そこで引き継ぐと、既に知っている回復が削除されます。
  3. クリーンハンドオーバーに十分に早く引き継ぎ、状態が回復可能になったらすぐにハンドバックします。
  4. エピソードごとに引き継ぎ理由をログに記録します。3 ラウンド後、同じ失敗が戻ったかどうかの唯一の記録です。
  5. ラウンド間でカメラ、タスク テキスト、オペレーターを一定に保つ。1 つを変更すると、数字の比較ができなくなります。

機械的には、ハンドオーバーには 2 つのバリアントがあります。リーダー アームでは、トルク転送前にリーダーがフォロワーの現在のポーズに到達する必要があります。そうしないと腕がジャンプします。この配置移動は実際のハードウェアのチェーンの最も検査されていない部分です。リーダー アームなしの場合、テイクオーバーは最初のキープレスから手動です: フォロワーが保持され、オペレーターはキーボードからジョイント バイ ジョイントで軽くたたくか、スライダーをドラッグします。サーバー側のクランプが各入力を小さく保つため。キープレスあたり数度、スライダー更新あたり一握り。大きなステップを保持したポーズに導入することはサーボをストリップする方法だからです。キーバインディング付きのステップ バイ ステップ バージョンは SO-100 での DAgger ラウンドのウォークスルー; 両方の遠隔操作モードの背景は 遠隔操作ドキュメント そして リーダー フォロワー エントリ.

トレーニングと推論の特性を持つサポートされるポリシー アーキテクチャの比較
ゲートはアーキテクチャに依存しません。修正するポリシーはラウンドのトレーニング コストを変更し、テイクオーバーの機能方法ではありません。

ゲートが何かしたかどうかを読む

人間がゲート制御するラウンドのメトリックは干渉率です: 干渉フレームをラウンドのフレームで割ったもの。1 つのジョブがあります。ラウンド間で落ちない場合、ラウンドは何も買っておらず、次のラウンドはデータ量以外の何かを変更する必要があります。

それはバイアスされたメトリックであり、あなたはそれがどのようにしてくるかを知る必要があります。オペレーターのしきい値をポリシーの能力と同じくらい測定します。これが理由です トリガー リストは固定されたままです。セッション中にリラックスするオペレーターは、背後に何もない下降曲線を生成します。それはまた重大性を無視します。衝突を止めるための 10 フレームと掴まえを軽くたたくための 10 フレームは同じに見えます。修正データが決して描かれていない固定評価セットとペアにしてください。DAgger ループを測定する記事 評価設計を通じて機能し、評価エピソードをトレーニング ミックスから除外する方法を含みます。

人間のゲート、正直に
それが与えるもの
  • Works on day one, on any policy architecture, with no extra model to calibrate
  • 確信に満ちた誤った失敗をキャッチします。分散のしきい値は検出しません
  • オペレーターが完全なコントロールを持っていた間に記録された修正を生成し、選択した瞬間に
  • IWR や Sirius などの干渉重み付けメソッドが消費するフレームごとのマーカーを生成
それがしないこと
  • 継続的な監督がコストです。1 人と多くのロボットにスケールしません
  • オペレーターの一貫性に依存します。ドリフトするしきい値は干渉率を破壊します
  • 独自のリスク モデルを生成しません。HG-DAgger の学習しきい値と ThriftyDAgger の推定器は余分な機械です
  • フレームをカウント、結果ではなく
  • コントロール上流の失敗があるポリシー を救うことはできません。スワップカメラやミスラベルタスク文字列など

目に見える価値のある公開質問

ベンチマークは弱いです。Spencer と同僚は模倣学習アプローチをテストするために使用されたものを検査し、それらを「実現可能で単純であり、実世界の意思決定問題で見られるエラー複合化の困難なレジームをキャプチャするのに不十分」と判定しました。周辺文献に対して、プレーン行動クローニングは彼らに対してよく機能しました。それはこれらのタスクに基づく DAgger バリアントのあらゆるランキングに懐疑的である理由です。上記の表のいくつかの数字を含む。

大規模なポリシーのロボット ゲートも解決されていません。AIM ワークは不確実性を人間の干渉ルールを模倣するプロキシ Q 関数に置き換え、ThriftyDAgger よりも引き継ぎコストと学習効率の 40% 改善を報告します。継続的および離散的制御で、マニピュレーターを駆動するビジョン言語アクション モデルではなく。これらのゲートのいずれかが微調整された VLA に転送されるかどうかは未解決です。調査は関連するポイントを示しています: フィールドの用語と構造は文献全体で統一されていないため、メソッドの比較が困難です。あなた自身の腕では、ログはあなたが持っている証拠です。

人間が干渉中にのみラベルを付ける場合、HG-DAgger は本当に DAgger ですか?

学習器が誘導した状態分布の下で収集されたデータ。以前のものと集約されたデータ。。ハードウェアとの接触で生き残らない部分を落とします。Kelly et al. はそれをバリアントとして提示します。2011 年のノー リグレット保証は変更されないまま実行されません。

SO-100 で微調整された VLA ポリシーでロボット ゲートを使用できますか?

簡単には、SafeDAgger の分類器には、持っていないクエリ可能な参照ポリシーが必要です。EnsembleDAgger はアンサンブルが必要で、多数のパラメーター モデルの場合、メモリ内にいくつかのコピーとそれらの推論コストが必要です。ThriftyDAgger には、最初のラウンドの前に存在しない成功と失敗にフィットされたリスク推定器が必要です。

単一のテイクオーバーはどのくらいの長さにすべきですか?

ポリシーが続行できる状態に到達するのに十分な期間であり、それ以上ではありません: 拡張テイクオーバーは実行をデモンストレーション セッションに変え、公称動作で修正セットを氾濫させます。LazyDAgger の調査結果も別の方法で削減されます。多くの非常に短いスイッチは独自のコストです。

修正されたセグメントのみでトレーニングすべきですか?

いいえ。それがラウンドを無駄にする最も一般的な方法です。回復のみで微調整されたモデルは、ほぼ回復しか見ていません。修正を元のデータセットにミックスし、ソースを明示的に選択します。さらに進むには、IWR や Sirius などの干渉重み付けアプローチを確認してください。人間が運転したフレームを分離するのではなく、上位重み付けするようにします。

ラウンド後の干渉率が低下しない場合はどうなりますか?

そのまま取得します: ラウンドは助けになりませんでした。修正を追加する前に、より安い説明をチェックしてください。オペレーターのしきい値がドリフトしましたか、修正は化粧品でしたか、構成されたデータセットには実際に含まれていましたか、トレーニングは意図されたチェックポイントから初期化されましたか。ベース モデルから静かに開始されたラウンドは、学習に失敗したラウンドとまったく同じに見えます。

非干渉は情報を提供しますか?

Expert Intervention Learning の下で、はい: 監督者が見守り、行動しなかった区間は、状態とアクションが受け入れられたことの弱い証拠として読み取られます。値関数への制約として正式化されました。これを含むほとんどの実用的なパイプラインは、人間が運転したものだけをマークします。

机の上の単一のアームでは、選択が行われます: ゲートを自分で保持し、それを開くものを書き留めます。スイッチの自動化ではなく、その後ろのデータ処理に努力を費やします。プラットフォーム側は DAgger ループ ページ、ポリシー ファミリーごとのトレーニング オプション トレーニングと価格設定。背景については、次のことから始めます 模倣学習 そして SO-100 の模倣学習; 最初の実行では、最初のポリシーを実行する はより短いパスです。

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started