繰り返されたポリシー実行用の固定評価セットアップとして使用される種類の卓上ロボットワークスペース
DAgger評価模倣学習ロボットデータSO-100

DAggerループの測定:介入率、評価プロトコル、およびその間の落とし穴

AY-Robots ResearchAugust 27, 202615 分読了

介入率(介入フレーム数を実行フレーム数で除したもの)は、ヒューマンゲート型DAggerループが有する最も安価で誠実な進捗シグナルである。本記事では、2人が同じ値を計算するようにそれを定義し、それをログする方法を示し、それが誤解させるための4つの方法を実装する:操作者の習慣化、ドリフトする評価セットアップ、訂正に対してのみのトレーニング、および月曜日とは異なる火曜日に訂正するヒューマンである。

DAggerラウンドは実行中は生産的に感じられる。ポリシーを駆動し、掴みが失敗したときに引き継ぎ、訂正を保存し、再トレーニングを行い、次の実行はわずかにスムーズに見える。2ラウンド後、「わずかにスムーズ」は量ではないため、何かが変わったかどうかは言えない。

ループはラウンドごとに1つの数字が必要であり、ヒューマンゲート型ループではその数字はほぼ無料である:ポリシーの代わりにコントロール下にあった実行の割合。本記事では、2人が同じ値を計算するように定義し、ログし、結果の曲線を読み、それが単独で立つときに誤解させる4つの方法に名前を付ける。この記事が想定する理論については、以下を参照してください DAgger解説ヒューマンゲート型バリアント;実践的な対応物は SO-100でのDAggerループの実行

短いバージョン

  • 介入率 = 介入フレーム数 / 実行フレーム数。エピソードではなくフレーム、および分母には訂正に費やしたフレームが含まれる。
  • 3ラウンドにわたる平坦な曲線は、ラウンドが何も購入していないことを意味する - 4番目を収集する代わりに、混合、チェックポイント、またはタスクを変更する。
  • 減少する介入率は増加する成功率ではない。ステップインのしきい値は、信頼が増すにつれて下向きにドリフトする。
  • 凍結された評価プロトコルなしで - 同じ開始ポーズ、オブジェクト、カメラ、トライアル数 - あなたは部屋を測定している。
  • 訂正に対してのみのトレーニングは状態分布を歪める。IWRの回答:介入サンプルと非介入サンプルを等しい割合で描画する。

なぜラウンドには数字が必要なのか

DAggerは分布問題のために存在し、分布問題は目には見えない。RossとBagnellは、模倣学習 固定デモンストレーションセットでは、誤差が複合し、時間地平線内で二次的に増加する後悔限界につながる:学習者が実演者が訪問した状態を離れると、データ内のものは、戻る方法を教えない。DAggerはこれを繰り返すことで修正する - ポリシーを実行し、訪問する状態にラベルを付け、集約し、再トレーニングする - これはRoss、GordonおよびBagnellが後悔のないオンライン学習への削減として構成している。

そのフレーミングは、人々がスキップする結果を持っている。保証は、任意の単一の実行ではなく、反復にわたるポリシーのシーケンスに関するものである。それは、かどうかについて何も言わない あなたの ラウンド3が役に立った。唯一の方法は、各反復を測定することである。Kellyと同僚がHG-DAggerを導入した理由は、古典的なDAggerが初心者がまだコントロール下にある間に、専門家にアクション ラベルを要求するためであり、論文はこれが安全性を低下させることができ、ヒューマン専門家では、知覚されたアクチュエータラグを通じてラベル品質を低下させる可能性が高いと主張している。HG-DAggerはまた、モデル不確実性ベースのリスク メトリックの安全閾値を学習し、運転タスク上でDAggerおよび行動クローニングの両方よりも改善されたパフォーマンスを報告する。介入カウントは公開していない;それらはあなた自身が生成する。

2人が同じ数を得るようにレートを定義する

定義は1行である:介入フレーム数を実行フレーム数で除したもの。すべての困難は、フレームとして何がカウントされ、実行として何がカウントされるかに隠されている。

エピソードではなくフレーム

少なくとも1つの介入を伴うエピソードをカウントすることは無駄である:1つずつナッジを伴う10エピソードと80パーセント運転した10の両方が「10/10」を与える。フレームカウントはそれらを分離し、それは記録がすでに持っている粒度である - LeRobot データセット形式 すべてのタイムステップが行である、したがって介入フラグは状態とアクション の隣の1つのブール列である。ここでは、テイクオーバーが開始する瞬間のフレームごとに記述され、制御が戻るときにクリアされる。

分母には訂正が含まれる

2つの分母が防御可能である - 実行の総フレーム、またはポリシーが自律的に駆動したフレーム - そして、高い介入レベルで大きく分岐する。1000フレームのうち400を引き継ぎ、最初の40パーセント、2番目の67パーセント。最初の方法で測定されたあるラウンドを2番目の方法で測定された次のラウンドと比較することは、実際の改善がどのように消えるかである。総フレームを取得し、シリーズの途中で選択を再検討しない。

ハンドオーバーフレームに何が起こるかを一度決定する

常に継ぎ目がある。制御が渡されるとき、いくつかのフレームはどちらの側にも属さない:腕は保持されている、リーダーは整列している、記録は凍結されている。このパイプラインでは、これらのハンドオーバーフレームは生のストリームに留まり、キュレーションされた エピソード - それらはポリシー行動でも、トレーニングの価値がある訂正でもない。毎ラウンド同じ方法で継ぎ目をカウントする:30 Hzでは、各2秒の継ぎ目を備えた6つのテイクオーバーは360フレームであり、パーセントポイントを移動するのに十分である。

比較可能性を損なう3つの決定

フレームまたはエピソード;総実行または自律のみ;ハンドオーバーフレームイン またはアウト。ラウンド間で静かに変更された3つのいずれかが曲線を無意味にする。3つすべてを記述する。

ログ記録により、数字はセッションを生き残る

実行中のプロセスのステータスパネルのメトリックは読み出しである:再起動時に消え、プロットできない。実行ごとに1つの追記のみの行がシリーズ全体をカバーする - どの チェックポイント あなたが運転したもの、それはラウンドごとに変わり、混ぜると何が続くかを無効にする。

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
実行ごとに1行。分母とハンドオーバー慣例を数字の隣に記録することは、フィールド名より重要である。

2つのフィールドが重要である。 train_mix は、次のトレーニングジョブに供給したものである;それなしでは何も属性付けることができない。 eval_protocol は、その後に実行した固定テストに名前を付け、最も頻繁に空のままであるフィールドである。ay-robots コックピットでは、テイクオーバーステータスは実行中のセッションの介入フレームカウントを報告するため、ログ記録は計測ではなく転写である;データセットドキュメンテーション フレームごとの列がどこに着陸するかを対象としている。

ポリシー、データセット、チェックポイントを並べて表示するトレーニング設定マトリックス
毎ラウンドチェックポイントとデータセット混合が変更される。組み合わせが記録されなかった数は属性付けることはできない。

曲線を読む:3ラウンド、1つの評決

3ラウンドは読みの最小値である。なぜなら、2つのポイントは常に直線だからである。以下の表は、実行からの測定ではなく、プレースホルダー数を使用した簿記テンプレートである。固定テストの成功の増加と一致する単調減少を探している。

ラウンドチェックポイント駆動フレーム数介入フレーム数レート成功 (20 回中)
0 (ベースライン)基本ポリシー5 9001 38023.4 %7
1ラウンド 0 ミックスから5 61098017.5 %10
2ラウンド 1 ミックスから5 41261111.3 %11
3ラウンド 2 ミックスから5 38059811.1 %12

ラウンド1と2は動作している。ラウンド3はそうではない:11.3対11.1パーセントは、物理的な腕で測定されるものの実行から実行への変動内であり、同じ訂正の4番目のラウンドは何もしない午後を費やす。平坦なセグメントは、何か構造的に変更することを示している。

  • 残りの故障はテレオペレーションでは修正できない - オブジェクトが到達範囲外、グリッパージオメトリ、制限の関節。訂正データはキネマティック壁を修正しない。
  • 訂正は、勾配を移動させるためのベースデータセットに対して少なすぎ、何も重みを付けない。
  • 訂正は互いに矛盾しているため、ポリシーは2つの戦略を平均化してその間に着地する。
  • 障害はアップストリームにある:カメラが移動し、照明が変更され、手首ビューがトレーニングと一致しなくなった。
  • タスクはこのハードウェアのこのポリシークラスの上限にあり、次のステップはより多くのベースデータである。

最後の2つはループの障害ではない。Sirius-Fleetでは、ヒューマンの必要性の低下は設計された結果である:ロボット自律性が向上するにつれて、その異常予測因子は予測基準を適応させ、ヒューマン介入の要求が少なくなり、時間とともにヒューマンワークロードが徐々に減少する。そこで基準は意図的に適応する。手動ループでは、あなたのものも静かに適応する - したがって、タスクがその上限にあるために平坦化するレートは、オペレータが注意を停止したために平坦化したものとまったく同じに見える。これが次の問題である。

トラップ1:低下するレートは上昇する成功率ではない

介入率は正確に1つのことを測定する:実行のうちどれだけをあなたが所有することを決定したか。その決定はあなたのものであり、リアルタイムで行われ、移動する。ラウンド0では、最初の悪いアプローチ角度を引き継ぎます;ラウンド3までに、ポリシーがそれら数十から回復するのを見守り、試してみるようにします。あなたのしきい値が移動しました;ポリシー かもしれません。レートはどちらにしても低下する。

人間の信頼は、少なくとも仮定された定数ではなく、文献でモデル化された量である。Siriusは、概算的な人間の信頼を使用してトレーニングサンプルを再重み付けし、加重行動クローニングを使用してポリシーを最適化し、ポリシー成功率の最先端に対してシミュレーション で8パーセントのブースト、実ハードウェアで27パーセントを報告し、2倍の収束速度で報告する。これはデータの重みとして信頼を扱う。それはラウンド0とラウンド3の間のあなたの頭のしきい値を修正しない。

ドリフトを削除することはできないため、レートをしきい値が接触できない何かとペアにする:介入しない固定試験セット、ラウンド前に記述された基準に対してスコアリングされたもの。ペアの成功率が変わらないまま低下するレートは、習慣化の署名である - 価値があるをキャッチ、ループの内側から進歩のように感じるため。

介入率固定プロトコルの成功率最も可能性の高い読み
低下する上昇するラウンドは機能した。続ける。
低下する平坦あなたのしきい値がドリフトしたか、訂正が故障を除去せずに努力を除去した。
低下する低下する訂正はポリシーを低下させている。混合物とその内部一貫性を確認する。
平坦平坦ラウンドは何も購入しなかった。より多くを収集する前に、混合、チェックポイント、またはタスクを変更する。
上昇する低下する回帰。メソッドを疑う前に、トレーニング混合、変更されたカメラ、またはチェックポイント混合を疑う。

トラップ2:固定プロトコルがなければ、部屋を測定する

実ロボット評価は費用がかかり、繰り返すのが難しい。SIMPLER著者は、そのようなポリシーの実世界的評価がスケーラブルではなく、ポリシーがタスクスペクトルを拡大するにつれて悪化する可能性のある再現可能性の課題に直面するという観察によってシミュレーション評価を動機付ける。RoboArenaは反対側からそれを攻撃し、DROIDプラットフォーム上の7つの学術機関の評価者によって実行される7つの一般主義者ポリシーにわたる600以上のペアワイズ実ロボット評価エピソードを使用する。その評価者は自分のタスクと環境を選択するが、ダブルブラインドでポリシーのペアを判断する必要があります;論文は、このクラウドソーシングされたランキングが従来の集中化された評価よりも正確に一般主義者ポリシーのパフォーマンスを追跡することを報告している。

1つで600個のペアエピソードを実行することはない SO-100 ワークショップで。あなたができることは、あなたが制御する分散を削除することである - それは通常スキップされるほど退屈なリストである。

次元これを凍結するやらない場合にドリフトするもの
開始ポーズすべての試行の前に駆動される、書かれたホームポジショントラジェクトリは分布から始まる
オブジェクトテープされたマークと、評価用に予約された同じ物理オブジェクト「より良い」ポリシーは実は近いオブジェクトである
カメラとライト同じマウント、インデックス、露出;ブラインド閉じる;セットアップの写真撮影スワップされたカメラインデックスだけで結果を支配できる
試行と停止ルール固定n、固定タイムアウト、ラウンド前に記述された基準事後基準は、ニアミスをあなたが必要とするものに変える
オペレータ行動評価試行中に介入なし評価は別の訂正セッションになる

その後、算数、ワークショップが余裕を持ってできるトライアルカウントで容赦ない。通常の近似では、20回の試行で60パーセントの成功は、11パーセントポイント近くの標準誤差を持っている - 20回以上の0.6倍0.4の平方根 - 2つのそのようなラウンド間の差は約15を持っている。したがって、60から70パーセントへのジャンプは、何も起こっていないことと一致している。50回の試行は、ラウンドごとの図をおおよそ7ポイントにし、午後のコストである。

この非対称性は、介入率の議論である:20の二進結果ではなく、数千のフレームで計算され、より早く、より滑らかに移動する。注意点は、エピソード内のフレームが強く相関している - 1つの悪い掴みは100個の連続介入フレームを生成する - ため、有効なサンプルサイズはテイクオーバーの数に近い。レートを初期指標として、成功率を遅い地上真実として扱う。

評価エピソードをトレーニングプールから除いておく

評価エピソードは、構成されたトレーニングデータセットに入ることはできません - そうでなければ、ラウンドn+1はそれが訓練されたデータでスコアリングされ、曲線は記憶化を測定します。

トラップ3:訂正に対してのみのトレーニングはポリシーを曲げる

訂正は興味深いデータであるため、本能は彼らにトレーニングすることである。するな。彼らはポリシーがすでに失敗していた状態空間の狭いスライスから建設によって来て、機能した実行の大多数についてほぼ何も言わない。そのスライスだけでファインチューニングすると、ぎこちないアプローチから回復するのは良いが、クリーンなアプローチを作る方法を忘れたポリシーが得られる。

Mandlekarと同僚は、彼らの遠隔介入システムをこれを中心に構築した。彼らのフレーミング:操作タスクには、一連の正確なアクションを必要とするボトルネック領域が含まれている - ポッドをコーヒーマシンに挿入することは、彼らの例である - 小さな逸脱がデモンストレーションが決してカバーしなかった状態につながるところ。彼らのアルゴリズムは新しいデータに対して反復的に訓練し、ポリシーはこれらのボトルネックを通過することを学び、介入データで訓練されたエージェントが非介入的デモンストレータからの同等数のサンプルで訓練されたエージェントを打つことを報告する。

訂正のみのファインチューニング対構成混合物
訂正のみがあなたを得るもの
  • 高速:数十のエピソードにわたる短い実行は、繰り返すのに十分安い
  • ターゲット:勾配は、あなたが気にする状態によって支配される
  • 訂正スタイルがすべて学習可能かどうかをテストするための安い
それが何を費やすか
  • ファインチューン分布はもはやタスク分布に似ていない
  • 名目上の行動は、1つのラウンド内で目に見えて低下する可能性がある
  • レートは成功がそれで低下している間に低下することができます - リカバリーのためにトレードされたクリーンセグメント

混合比は超パラメータであり、書き下ろされるべきである。次のデータセットを構成することは、それが決定される場所である:元のデモンストレーションプラス訂正セット、利用可能なものを静かに引き込むルールではなくソースごとの明示的なエピソード選択。ここではコックピットの1つの構成ステップであり、結果は通常のデータセットである - を参照 トレーニングドキュメンテーション。どのツールもあなたのためにしていないのは、どの比率がどの曲線を生成したかを記録することである。

トラップ4:ヒューマンは一貫した専門家ではない

DAggerの理論は専門家を想定している。技術的な意味では、あなたは1つではない:あなたの訂正はアクション上の固定条件分布からのサンプルではない。ACT著者は、良好な操作への障害をリストアップするときこれに名前を付ける - エラーは時間とともに複合し、人間のデモンストレーションは非定常的である。彼らのシステムは依然として10分のデモンストレーションから6つの実タスクで80から90パーセントの成功に達し、問題は処理可能であり、不在ではない。

robomimic研究はデータサイドからポイントを作成する。5つのシミュレーションおよび3つの現実世界のマルチステージタスクにわたる6つのオフラインアルゴリズムで、その教訓には設計選択の感受性、デモンストレーション品質への依存、および - ここで最も傷つく - 停止基準に起因する変動性が含まれる、トレーニングと評価の目的が異なるため。最も低い損失を持つチェックポイントは、確実に最も高い成功率を持つチェックポイントではない。

これのハードウェアバージョンがある:入力モードは訂正を形作る。リーダーフォロワー セットアップは、連続的で、人間のペースの軌跡を生成する。キーボードのナッジはサーバーによってハードにクランプされ、腕関節で1コールあたり2度、グリッパーで4度 - したがって、同じ意図は小さなステップの階段として到着する。スライダーは絶対ターゲットを送信し、サーバーは1コールあたり最大6度それらに向かって移動する。3つのモード、3つのアクション分布;3つすべてを1つの訂正セットに混ぜてから、アプローチがなぜ痛みを伴ったのかを疑問に思うことは自己不健全である。テレオペレーションドキュメンテーション 各モードが送信するものをカバーしている。

介入の重み付け:IWRとその後

訂正が貴重なマイノリティの場合、原則的な修正は排他性ではなく重みである。Intervention Weighted Regressionは参照実装である:データは介入サンプルと非介入サンプルに分割され、2つの分割はトレーニング中に等しい割合でサンプリングされる。フレームの5パーセントの訂正セットは、名目上の行動が分布から消えることなく、勾配の半分に貢献する。

等しい割合は法律ではなく、出発点である。Siriusは、二進分割を概算的な人間の信頼からの継続的な重みで置き換えることによってそれを一般化する;Sirius-Fleetは、視覚的な世界モデルと異常予測因子を使用してヒューマンが要求されるかどうかを決定する上流の決定を移動する。共通のスレッド:介入フラグは、単なる簿記列ではなく、トレーニング信号である。

メソッドヒューマンが行動するときに誰が決定するか介入データの使用方法報告結果
DAgger (2011)固定スケジュール;専門家ラベルが訪問した状態1つの増加しているデータセット、重みなし後悔のないオンライン学習への削減としてフレーミングされた
HG-DAgger (2019)ヒューマン、実システムのゲート制御集約;プラスモデル不確実性の学習された安全閾値運転時のDAggerおよびBCより優れている;介入カウントは与えられていない
IWR (2020)ヒューマン、遠隔テレオペレーション経由等しい割合で引き出された介入および非介入サンプル等しいサンプルカウントで非介入デモを打つ
Sirius (2022)デプロイ中のヒューマン加重BC、概算的な人間の信頼からの重みシミュレーションで8%のゲイン、実ハードウェアで27%;2倍高速収束
ThriftyDAgger (2021)システム、新規性とリスクのゲート監督予算下での対話型収集ユーザー研究 (N=10):次の最良の方法よりも58%高いヒューマンおよび80%高いロボットパフォーマンス
Fleet-DAgger (2022)システム、艦隊全体に注意を割り当てる人間努力のリターンでスコアリングされたフリートラーニングベースラインより最大8.8倍高いROHE
Sirius-Fleet (2024)自己適応基準を備えた異常予測因子視覚的な世界モデルを備えたマルチタスク学習自律性が向上するにつれて、介入要求が減少
測定スコアでロボットポリシーを比較するリーダーボードビュー
ポリシーを互いにランク付けすることは、すべてのエントリが同じプロトコルを実行したときにのみ意味がある。これはあなた自身の3ラウンドにも適用される。

レートの隣に価値がある4つのメトリック

  • 実行ごとのテイクオーバー。20の短い訂正と1つの長い訂正は、同様のレートを与え、異なるポリシーを説明する - 1つはじきじきした、1つは単一の盲点である。
  • 平均介入長。数の低下を伴う上昇長は、残りの故障が難しいものであり、進行後半がどのように見えるかを意味する。
  • 初回介入までの時間。ヘルプが必要になる前にさらに進む政策は、総率が平坦でも改善されている。
  • 介入がクラスタリングされる場所。正規化されたエピソード進捗により、フラグをビン化する;ラウンド全体の安定したピークは1つのボトルネックを指している。

実際に実行できるラウンドプロトコル

測定されたラウンドには6つのステップがあり、ログに1行を生成する。最初の4つはループである;最後の2つはそれを測定にする。

  1. 1
    ラウンド0前に評価プロトコルを凍結する

    開始ポーズ、オブジェクト配置、カメラ、トライアルカウント、タイムアウト、および成功基準を記述する。テーブルの写真撮影。ドキュメントを変更する必要があれば、シリーズが再起動される。

  2. 2
    ベースラインを測定する

    介入なしでプロトコルを実行し、成功を記録します;次に、テイクオーバーを有効にして1つの計測セッションを実行し、レートを記録します。これら2つの数字はラウンド0である。

  3. 3
    1つの一貫したスタイルで訂正を収集する

    ラウンドあたり1つの入力モード、可能な場合は1つのオペレータ。あなたが声に出して状態できる基準に対して引き継ぐ - '近づきで2センチメートル以上グリッパーをオフにする' - そしてラウンドのためにそれを保持する。

  4. 4
    同じ日にすべてのエピソードをトリアージする

    訂正、評価、または破棄。曖昧なエピソードは破棄され、より多くのデータが役立つという理論で保存されていない - あなた自身が失敗した訂正は、エピソードがないより悪い。

  5. 5
    混合物を明示的に構成する

    元のデモンストレーションプラス訂正、ソースごとのエピソード選択。ベースカウント、訂正カウント、および重みを記録 - これは3週間で必要になるフィールドである。

  6. 6
    チェックポイントから続行し、再測定する

    基本モデルではなく前のチェックポイントから構成されたデータセットを訓練し、凍結されたプロトコルプラス1つの計測セッションを実行し、行を追記し、前の2ラウンドと比較する。

2つの制限は、弱いラウンドをどのように読むかを変更する。チェックポイントから続行するとそれから重みを初期化する - オプティマイザーのレジュームではなく、スケジュールは新しく開始され、収束したチェックポイントからの短い実行はほとんど移動できない。そして、テイクオーバーの開始時のリーダーアラインモーションは、チェーン内のもの中で最も実ハードウェア上の走行距離が少ない;訂正がすべて奇妙な一時的なもので始まる場合、混合物のせいにする前にそこを見てください。

測定されたループ、既に配線済み

ay-robotsはこれら6つのステップをプロダクト機能として実装する:リーダーアーム、キーボード、またはスライダーから実行中に引き継ぎ、介入フレームは自動的にフラグが設定される;各エピソードを訂正、評価、または破棄としてトリアージ;元のデモンストレーションプラス訂正から次のデータセットを構成し、ソースごとの明示的なエピソード選択;そして基本モデルの代わりに前のチェックポイントから次のトレーニング実行を開始する。

DAggerループがどのように機能するかを確認する

数字があなたに言うことができない

これのどれも解決されていない、そして整然とした曲線はあなたにそうでなければ説得すべきではない。介入率は、ジョイントシステム(ポリシー、ハードウェア、オペレータ、ルーム)を測定し、それ自体に何も属性付けしない。訂正が良かったかどうかを判断することはできず、オブジェクトが3週間以上で2センチメートル近くドリフトしたため、タスクが簡単になったタスクに幸せに低下する。

それが行うことは、漠然とした印象をあなたが議論できる列に変える。代替案はより良いメトリックではなく、それは、ラウンド3の後、収集を停止するように曲線があなたに言ったであろう訂正を収集する3週間である。調査文献は、インタラクティブ模倣学習を、ロボット実行中に断続的に与えられたヒューマンフィードバックとして定義し、行動のオンライン改善を可能にする;家族は広く、ラウンドごとに数字なしで機能する配置はない。も参照してください SO-100模倣学習ガイド 対混合するベースデータセットについては、ポリシーの実行 推論側については、DAggerループページ 実装されたパイプラインについては。

介入率は単に1から成功率を引いたものですか?

いいえ。レートは実行のうちどれだけを引き継いだかを測定する;成功率は、タスクがあなたなしで完了したかどうかを測定する。実行は30パーセントの介入率で成功することができ、介入のない実行は完全に失敗することができます。彼らはまたノイズが異なります:レートは数千の相関フレームにわたってスムーズに移動し、成功率はいくつかのバイナリ結果の間で跳ね回ります。両方をログします。

成功率が何かを意味するために必要な評価試行数はいくつですか?

合理的に感じるより多い。通常の近似では、真の60パーセント成功率での20回の試行は、11パーセントポイント近くの標準誤差を持つため、ラウンド間の10ポイント移動はノイズと区別できない;50回の試行はその数字を大体7に持ってくる。50を余裕を持ってできない場合は、ラウンド全体でトライアルカウントを同じに保つと、小さな移動を決定的でないものとして扱う。

デモンストレーションから訂正までの混合比から始めるべきですか?

記録された開始点はIWRの:データを介入サンプルと非介入サンプルに分割し、等しい割合で引き出す、したがって訂正は、フレームの何分の小さな分数でも勾配の半分に貢献する。セットアップがサンプリングを重み付けできない場合は、データセットを構成するときにエピソードカウントを通じてそれを概算し、比率を記録する。訂正に対してのみのトレーニングはルール外とするオプションである。

ラウンド後に介入率が上昇しました。ラウンドは無駄ですか?

必ずしもそうではなく、最初に退屈な説明を確認する:あなたが運転したチェックポイントはあなたが訓練したものと一致しましたか、カメラインデックスまたはマウントが変更されましたか、オブジェクト配置がドリフトしましたか、訂正スタイルは一貫していましたか。すべての4つがクリーンで、ペアの成功率も低下した場合、混合物を疑う - 訂正に対する基本デモンストレーションが少なすぎるか、互いに矛盾する訂正。真の回帰はビンではなくログに属する。

固定評価プロトコルをスキップし、介入率を見ることはできますか?

習慣化から改善を伝えることはできないことを受け入れた場合のみ。レートは、ステップインのための独自のリアルタイム閾値に依存し、ポリシーの癖に慣れると、その閾値が低下する。凍結されたプロトコルは、測定のうち、しきい値が到達できない部分である - テープされたマーク、書かれたホームポーズ、固定トライアルカウント、ラウンド前に決定された基準。シリーズ全体で変更されていない状態を保つ必要があります。

ログをノートではなくリポジトリに保持する:ラウンドは数日離れており、ハードウェアが再構築され、10月の曲線を読む人は、8月の記憶がないあなたである。ドキュメンテーション FAQ ここで省略された運用上の詳細をカバーしている。

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started