ロボット操作シーンの抽象描画、学習されたポリシーが実行中に訪れる状態分布を示す
DAggerImitation LearningBehavior CloningRobot LearningTheory

DAgger解説:Behavior Cloningがドリフトする理由と、データセット集約が実際に証明すること

AY-Robots ResearchAugust 27, 202615分で読了

Behavior cloningはポリシーをエキスパートの状態分布にフィッティングしてから展開する。その2つの分布間のギャップが、検証では問題ないように見えるポリシーがステップ300でテーブルから落ちる理由である。これはDAggerシリーズの理論章である:二次誤差項がどこから来るのか、データセット集約が何を変えるのか、no-regret証明が何を仮定するのか、そしてコストのどの部分をヒューマンエキスパートがまだ負担する必要があるのかについて。

操作ポリシーを訓練するすべての人がいずれかの時点で出会う特定の失敗がある。ポリシーはキューブに手を伸ばし、2センチメートルの距離に到達してからためらい、横にドリフトして、タスクに関係のない何かをする。検証ロスは問題なかった。ホールドアウトエピソードに対するオープンループリプレイも問題なかった。しかし、アームは訓練データのどこにも現れない姿勢に終わり、そこからそれは言うべき賢明なことを何も持たない。

その失敗には名前と確立された理論がある。これはDAggerに関する4つの記事の最初である DAgger、そしてそれは議論そのものをカバーしている:エキスパートの自身の軌跡にポリシーをフィッティングすることがエピソード長の二乗で成長できるエラーを生成する理由、データセット集約が何を変えるのか、そしてno-regret証明が何を約束しないのか。実ハードウェアでのループについてはSO-100でDAggerループを実行する、ヒューマンゲートバリアントHG-DAggerと人間ゲート介入、計測問題DAggerループを計測するを参照。

要約版

  • Behavior cloningはエキスパートの状態分布で訓練され、ポリシー独自の分布で評価される。ミスマッチはエピソード全体で複合される。
  • RossとBagnellは追加コストはT二乗倍のステップごとのエラーまで成長できることを示した。DAggerペーパーはその境界を言い直し、それが厳密であることを指摘する。
  • DAggerは、ポリシー自体が訪れる状態にラベルを付け、最新のものだけではなく、これまでに集められたすべてのデータセットで再訓練する。
  • 保証はno-regret online learningへの削減である:集約と再訓練はFollow-The-Leaderである。
  • これは、ゼロに対してではなく、ポリシークラスで達成可能な最良の損失に対して相対的である。そしてエキスパートはそれが生成することがない状態にラベルを付ける必要がある。

Behavior cloningが静かに行う仮定

デモンストレーションデータセットは観測-アクションペアのパイルである。Behavior cloningは通常の教師あり学習でそのパイルに関数をフィットさせてそこで止まる。それは分野で最も古いアイデアである。1988年のPomerleauのALVINNは、カメラとレーザーレンジファインダーからの画像を受け取り、車が移動すべき方向を生成した3層のバックプロパゲーションネットワークだった。シミュレートされた道路画像で訓練され、いくつかの現地条件下で実際の道路に従った。レシピは多く変わっていない。ネットワークはそうだった。

スキップされるのは、これらのペアがどこから来たかのチェックである。それぞれが、エキスパートが生成した軌跡の上にある。展開するポリシーは独自のポリシーを生成する。それが逸脱した瞬間、訓練分布にない状態について照会されており、その答えはそれをさらに外に動かす。Ross、GordonとBagnellはDAggerペーパーをまさにこれで開く:逐次的な予測は、統計学習の下の独立同一分布仮定に違反する。なぜなら学習器の独自の予測はそれが次に見る入力を決定するからである。

そのペーパーの最も明確な図解はロボットではない。Super Mario Bros.の準最適プランナーのクローニングにより、障害物に対して繰り返し立ち往生する代わりにジャンプするポリシーが生成された。理由はその文の全議論である:エキスパートは常に快適な距離からジャンプしたため、データセットはマリオが障害物に押し付けられた状態を含まず、そのため、一度そこにいたら何をするかのラベルも含まなかった。

マリオをSO-100アームに置き換えると、構造は同じである。デモンストレーションは、クリーンなアプローチとクリーンなグラスプを示し、グリッパーが2センチメートル短く閉じてから示さない。そのため、ポリシーはそこから何をすべきか知らず、それが推測するものが何であれ、それをさらに外に動かす。Covariate shiftは、ネットワークアーキテクチャではなく、データ収集手順のプロパティである。

二次項がどこから来るか

2010年のAISTATSペーパーはRossとBagnellのEfficient Reductions for Imitation Learningは複合を正確にする。Tをタスク地平線とし、タスクコストを単位区間に限定し、epsilonをエキスパートの状態分布の下で測定した代理損失とする。検証セットが報告する数。その後、Tステップのためにそのポリシーを実行する余分なコストは、Tの二乗倍epsilonによって制限される。Ross、GordonとBagnellはこれをDAggerペーパーの定理2.1として言い直し、重要な文を追加する:結合は厳密である。問題は存在する。ここで、エキスパートの分布で小数損失を持つポリシーは、実際にはTで二次的に成長する追加コストを発生させる。

厳密は典型的を意味しない。二次項は問題のクラスに対する最悪の場合である。あなたのピックアンドプレイスタスクについての予測ではない。それが確立することは、より多くのエキスパートデモンストレーションが問題を削除できないことである:それはエキスパートをテストしない分布で小数をシャープにするだけである。

逃げ出すルートは同じペーパーにあり、定理2.2として言い直される。ポリシーがの下で小数の損失を達成する場合 独自 状態分布、そして単一の間違ったアクションはエキスパートの下でコスト-to-go最大uを費やし、余分なコストはu倍T倍epsilonで制限される。地平線に対して線形。定数uは興味深い量である。エキスパートとの0-1不一致の最大1、数ステップ内で復旧できる場合いつでもO(1)。最悪のケースではO(T)であり、線形結合は二次結合より優れていない。

設定エキスパートを超える余分なコストの限界それが休息する
Behavior cloning(Ross&Bagnell 2010、RossおよびBagnell 2011のThm。2.1として言い直された)T二乗倍のエプシロンエキスパートの状態分布で測定された小数。[0,1]のコスト。結合は厳密
独自の分布下で小数損失を持つ任意のポリシー(Thm。2.2)u倍T倍のエプシロンuは間違ったアクションのコスト-to-ゴーペナルティを制限する。0-1損失の場合は最大1、最悪のケースO(T)
前方訓練(Ross&Bagnell 2010)u倍T倍のエプシロンタイムステップごとに1つのポリシー。Tポリシーと既知の有限Tが必要
SMILe(Ross&Bagnell 2010)T とエプシロンで準線形なそれいくつかの問題クラスアルファはO(1/T二乗)内、Nは O(T二乗ログT)内。確率混合を生成
DAgger(Thm。3.2、RossおよびBagnell 2011)u倍T倍のエプシロンN、プラスO(1)NはuTの順序で。強く凸形制限損失。no-regret学習者。epsilon_Nは後付けの最良損失
ロボットワークスペース、ポリシーがアクセスする状態を表す。デモンストレーションセットに現れたことのない状態
DAggerラウンドに重要な状態は、誰もデモンストレーションしなかった状態である。ニアミスグラスプ、半開グリッパー、オブジェクト過去のアーム。

DAggerの前にあった2つの試み

前方訓練は正直だが実用的ではない答えである。各タイムステップに対して個別のポリシーを順序よく訓練し、各ポリシーはより早いステップについてすでに固定されたポリシーによって誘発された状態分布で、すべてのポリシーが正確にそれが直面する分布を見る。説明の捕捉:Tポリシー、順序よく訓練された、早期停止なし。操作についてエピソード 1秒あたり30フレームで、Tは数百である。

SMILe、同じペーパーから、およびSEARN、Daum、LangfordおよびMarcuの構造化予測の仕事から、別の経路を取る。1つのステーショナリーポリシーだが確率的。各反復は成分を訓練し、それを混合に追加し、確率質量をエキスパートから遠ざける。結果は、いくつかの成分が他よりも悪い混合である。物理的なアーム上で、動き中に悪い成分をサンプリングできるコントローラー。それはステーショナリー代わりに望む求める述べられた動機である決定的 ポリシー。

DAgger:1つのアイデア、1つのボックス

Dataset Aggregationは決定的なポリシーを保ち、修正をデータ収集に移す。各ラウンド:現在のポリシーをロールアウト、それが訪れる状態を記録、それぞれでエキスパートが正しいアクションだったことを求める、これらのペアをあなたが既に持つデータセットに追加、ユニオンで再訓練。名前はアルゴリズムである。あなたは集約し、決して破棄しない。

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAggerメタアルゴリズム、Ross、GordonおよびBagnellの2011年のアルゴリズム3.1。

3つの詳細はそれらがそう見えるよりも多くの重さを運ぶ。ラベルは混合ポリシーによって訪れた状態のためのものであるが、アクションはエキスパートからのものである。ポリシーが質問を提供し、エキスパートが答えを提供する。再訓練はユニオン全体にあり、各ラウンドをFollow-The-Leaderステップにする。ラウンドnで、あなたはこれまでのあらゆる軌跡で後付けで最高のポリシーを選ぶ。そのフレーミングが証明が掛かることである。そしてアルゴリズムは検証セットで選ばれるシーケンスで最良のポリシーを返すことで終わる。なぜなら定理が何か シーケンスのポリシーは良いものであるが、最後の1つではないことを保証する。

ベータスケジュール、そしてなぜそれは調整ノブではないのか

混合ポリシーはベータi倍のエキスパートプラス1マイナスベータi倍の学習者である。ポイントは実用的である:最初のいくつかの学習されたポリシーは非常に少量のデータで訓練され、多くの間違いを犯し、ポリシーが改善されたら無関係になる状態でロールアウトを過ごすだろう。

理論はまさに1つの条件を課す:ベータの実行平均はゼロに行く必要がある。分析はベータiは定数アルファの定数に対して(1-alpha)の累乗i-1に制限される。

スケジュールそれがすることペーパーが報告すること
ベータ1 = 1最初のラウンドはピュアエキスパートデモンストレーション。初期ポリシーが必要ないすべてのバリアントで推奨される出発点
ベータi = 1(i = 1の場合)、それ以外の場合0ラウンド1の後はエキスパートのみ。フリーパラメータなしペーパーのパラメーターフリー版で、実際には最良のパフォーマンスをすることが多いと言う。スーパーマリオブロス後20回のイテレーション後2980
ベータi = p ^(i-1)、p = 0.5の場合エキスパート確率は幾何学的に減衰同じベンチマークで3030で、パラメーターフリー版より少し先
ベータi = p ^(i-1)、p = 0.9の場合エキスパートはループにはるかに長く留まる明らかに遅い収束。20イテレーションが終わったときにまだ改善中

2980と3030のギャップはおおよそ4300で実行する規模で小さいが、ペーパーの説明はセクションで最も有用な実用的な注記である。パラメーターフリースケジュールでは、マリオは早期に同じ場所で立ち往生し、その1つの場所から大量の近い複製データを生成した。エキスパートに確率の一部を運転させることも彼を立ち往生させるだけでなく、さまざまな状態を広げた。スケジュールは混合比についてではなく、データ収集が新しい状態を生産し続けるかどうか、または同じ失敗についてである。

スケジュールが書かれたとおり物理的なアームに転送しない理由

確率ごとのタイムステップ混合は、制御レートで制御権を切り替えることを意味し、典型的なSO-100セットアップで1秒あたり30回。テレオペレーションインターフェイスが安全または意味のあるものにします。実ハードウェアではベータスケジュールは人間がいつ引き継ぐかについての決定に譲歩する:別のアルゴリズム別の分析を伴う。

保証:no-regret online learningへの削減

ここは論文をそれがある理由にする動きである。各DAggerラウンドをオンライン学習問題の1つの例として扱う。ここで、ラウンドiの損失は、ラウンドiで使用されたポリシーの状態分布の下の代理損失である。学習者はその損失を見る前にポリシーを約束し、シーケンスはそれがこれまでに生成されたポリシーに依存するため非定常である。

アルゴリズムはno-regretである場合、Nラウンドでの平均損失は後付けで最高の単一ポリシーに近づく。強く凸損失でのFollow-The-Leaderはそのようなアルゴリズムであり、平均後悔は1/Nの順序で縮小する。ユニオン集約で再訓練するのはまさにFollow-The-Leaderである。任意の他のno-regret学習者は同じくらい良く機能するだろう。分析は削減であり、1つの最適化者のプロパティではない。

1つの補題は混合ポリシーが収集したデータとデプロイされる学習ポリシーの間のギャップをブリッジする:補題4.1は、それらの状態分布間のL1距離を2Tベータiで制限する。これは、ベータがなぜ減衰する必要があるかの理由である。エキスパートが依然としてかなりの制御権を保有している間、集約する状態は、ポリシーが生成する状態ではない。補題を後悔の結合と組み合わせ、主な結果がたどる。約Tイテレーション後、シーケンスのいくつかのポリシーは、独自の分布の下で代理損失を持つ、エプシロンNのO(1/T)内。線形結合に戻し、定理3.2に到達する。

経験的側面は現在の規格では控えめである。スーパータックスカートでは、監督基準は、より多くのデータが到着するにつれて平均倒れなかった、DAggerは15イテレーション後は追跡されなくなり、SMILeは20後後も約1周あたり2回落ちた。手書きベンチマークでは、文字精度は構造なしで82パーセント、83.6パーセント監督、DAggerで85.5パーセントを走らせた。これらのいずれもが操作結果ではない。

証明が約束しないもの

定理ステートメントは条件付きであり、条件は搭載されている。

DAgger保証、密接に読む
それがあなたを与えるもの
  • 述べられた仮定の下で、T内で二次的ではなく線形の結合。
  • 確率混合ではなくステーショナリー決定的ポリシー。
  • 本物の削減:任意のno-regret online学習者がスロットイン。
  • 具体的なイテレーション数。後悔項が関係を止める前にはほぼTラウンド。
  • シーケンスの少なくとも1つのポリシーの保証。したがって、閉じる検証パス。
それがあなたを与えないもの
  • それはエプシロンN、クラスの後付けで最高の損失に対して相対的であり、ゼロに対しては相対的ではない。クラスがエキスパートを表現できない場合、実際には空である。
  • no-regret法または強く凸形代理損失が必要である。それが構築する分類削減より強い。著者が指摘するとおり。
  • 定数uは最悪のケースでO(T)できる、線形結合その後二次に戻す。
  • それがイテレーションをバウンドし、エキスパートラベルではない。ロボットに、ラベルは予算である。
  • エキスパートはすべての訪れた状態で照会でき、そこで正しく答えることができると仮定する。仮定はコスト全体である。

さらに1つの結果は、反論として引用されることが多く、1つではない。Rajaraman、Yang、JiaoおよびRamachandranは、有限状態空間Sと地平線Hを有する多数のMDPでのImitation Learningのミニマックス限界を研究し、学習者がアクティブにエキスパートで状態を照会することができる場合でも維持する下位最適性下限を証明する。これはMDPのクラスでの最悪のケースレート、固定エピソード予算で、そしてそれが統治するのは、相互作用がミニマックスレートを改善するというアイデアである。DAggerの定理は別のステートメントであり、デプロイされたポリシーを独自のポリシークラスが達成できるものに対して相対的にバウンドする。

Swamy、Choudhury、BagnellおよびWuはこれらのアルゴリズムを後付けでエキスパートの動作のどの瞬間が一致するか分類し、各ファミリーが複合エラーをどの程度軽減するかを区切る瞬間回復性の概念を導入した。OsaとCeleminによるサーベイはアルゴリズムの風景と人間のフィードバックインターフェイスをカバーする。

請求:エキスパートが生成しなかった状態にラベル付けする

上記のすべてはどこでもクエリできるエキスパートを仮定する。ほぼ無料の計画士とシミュレーションでゲーム状態への完全なアクセス。マリオ実験は準最適計画者を完全なアクセスで使用した。人間とロボットでは、それは支配的なコストです。そして特異なもの:人間はその独自の能力が決して作らないであろう構成で正しいアクションを生成する必要があります。

Kelly、Sidrane、Driggs-CampbellおよびKochenderferはHG-DAggerペーパーで異議を直接述べる。バニラDAggerはエキスパートがシステムの完全な制御下にない状態でアクションラベルを供給することを必要とする。これは安全を減らし、人間のエキスパートでそれはラベルの品質を低下させる可能性が高い。彼らはそれを知覚された作用ラグに帰す。返される標籤はアルゴリズムが仮定したものではない。

Laskeyと同僚はDARTで反対側から問題を攻撃し、そのフレーミングは率直である:オンポリシー技術は人間の監督者にとって退屈で、計算上の負荷を追加し、訓練中に危険な状態を訪れることがある。彼らの代替案は監督者独自のデモンストレーションに較正されたノイズを注入するため、ロボットが信頼できないポリシーを実行することなく回復が実証される。MuJoCoヒューマノイドでは、DAggerが監督者の累積報酬を訓練中に80パーセント少ないポリシーを実行する5パーセント減少することを報告する。掴み乱雑さのトヨタHSRでつかみ、平均62パーセント増加以上の行動クローニング。

ZhangおよびChoのSafeDAggerは、リファレンスポリシーへのクエリを希少なリソースとして扱う。別のセーフティーポリシーは、クエリすることなく、主要なポリシーがリファレンスからこれまで逸脱しようとしているかどうかを予測し、それらの状態のみが配達される。3つはすべて同じ事実に反応する。DAgger分析はエキスパートラベルにお金を取らず、現実はかなりのお金を取る。

誰も警告しない部分

分布外の状態にラベル付けするのは、タスクをデモンストレーションするより精神的に難しい。標準デモンストレーションは、あなたが既に持っているモータープランを実行することを意味する。グリッパーをあなたが決してそこに置かないポリシーが置いた場所を修正することは、時間の圧力の下で、ロボットがまだ動いている間、その場で回復を作成することを意味する。プレーンレコーディングセッションより1セッションあたりの有用な分数は少ないこと、および1つの過程の中であなた自身の修正品質の減衰を見ることを期待する。

LeRobot データセット構造は、エピソード、フレーム、ディスク上に保存されるフレームごとの列を示す
修正は、介入フレームが標記されると初めてデータセットになる。LeRobot形式では、観測とアクションの横にあるフレームごとの列。

あなたのデスクの上のSO-100ではこれが意味するもの

地平線をあなた独自のユニットに変換する。秒30フレーム1秒あたり30フレームで600のシーケンスステップであり、上記のすべての結合のT、その数。T = 600で、Tでスケーリングする項とT二乗でスケーリングする項の間の違いはポリシーが悪いアプローチから回復する違いであり、1つではない。

これはアクションチャンキングが助ける理由の一部である。ポリシーが推論ステップあたり短いアクションシーケンスを放出する場合、決定ポイント数が減り、複合する可能性がある。Zhao、Kumar、LevineおよびFinは複合エラーをアクションチャンキングトランスフォーマーの動機として指名し、低コスト二足ハードウェアで、10分間のデモンストレーションから6つの難しいリアルワールドタスクで80から90パーセントの成功を報告する。チャンキングはcovariate shiftを削除しない。状態はまだポリシー独自のものである。しかし、有効な地平線を短縮する。参照アクションチャンキング そしてSO-100 imitation learning guide

2番目の変換は進捗指標である。ポリシー独自の分布の下でエプシロンを直接測定することはできない。それがすべての訪れた状態の地面真実エキスパートアクションが必要であり、あなたがそれを避けようとしている。人間ゲートループがあなたを与えるの代わりに介入率である。ラウンドの間、人間が引き継いだフレームの分数。これはプロキシであり、それはポリシーに関係のない理由で動く。患者オペレータはより少ないで介入する。一貫性を持つように使用され、それは1つの数であり、ラウンドが午後の価値があったかどうかを言う。

3番目の変換は、分析がカバーしないデータ品質警告である。Mandlekarと同僚は5つのシミュレートおよび3つの現実世界のマルチステージ操作タスクの6つのオフライン学習アルゴリズムを研究し、アルゴリズム設計選択、デモンストレーションの品質への依存、停止基準による可変性に敏感であることを報告する。Belkhale、CuiおよびSadighは、データセット品質がアクション発散と転移の多様性を通じて形式化されるべきであることを主張し、状態の多様性が必ずしも有利でないことを指摘する。DAggerラウンドは誰も意図的に選んだ状態を追加しない。いくつかはあなたが必要な回復データであり、いくつかはロボットが引き継かれた制御のために暴動している間暴動である。

機械的にラウンドは6ステップ:レコーディングオンで推論を実行し、ポリシーが悪い行動をとるときに引き継ぎ、ラウンドをレビューし、各エピソードをファイルし、修正を同期し、ソースごとに明示的に選択されたエピソード選択のオリジナルプラス修正から混合データセットを作成、前のより続行するチェックポイント ベースモデルではなく。ay-robotsで、これらのステップはボタンとして存在し、配管を削除しますが、判断は削除しません。2つの注意事項:チェックポイントからの継続は重みを初期化し、オプティマイザーの再開ではなく、リーダーアームアライメント移動はまだハードウェアでテストされている。参照トレーニング そしてデータセット

DAggerループ、既に配線された

ライブ推論実行中のテイクオーバー、フレームごとの介入標記、修正またはエバルエーションのためのエピソードを提出、ソースごとの明示的なエピソード選択による混合データセットの作成、既存のチェックポイントから訓練の継続はすべて組み込まれている。いつ引き継ぎ、何を保つかを決定する。その部分はオートメーションではない。

DAggerループがどのように機能するかを参照

ファミリーツリー、1つのテーブルで

方法誰が状態を選択するエキスパートが供給するもの主なコスト
Behavior cloningエキスパートクリーンなデモンストレーション回復データなし。エラーはT内で二次的に複合する可能性
前方訓練学習者、タイムステップごと誘発分布に沿ったラベルT個の個別ポリシー。長いイテレーションに使用できない
SMILe / SEARNエキスパートと学習者の確率混合混合の分布に沿ったラベル混合の成分は品質が異なる
DAgger混合ポリシー、ベータゼロに減衰訪れた所有者の状態ごとの正しいアクションエキスパートが生成しない状態にラベル付けし、制御下にない状態
DARTエキスパート、注入されたノイズによって摂動較正ノイズの下でのデモンストレーションノイズは学習者のエラーに較正される必要がある
HG-DAgger人間が引き継ぐまで学習者人間ゲートセグメント内のみの修正人間がいつ介入するかについての判断に依存する
SafeDAggerセーフティーゲートでフィルター処理された学習者ゲートが尋ねるときのみラベルゲート自体は訓練と信頼されなければならない

よくある質問

ロボットで実際に二次誤差成長を観察しますか?

クリーンな曲線として。結合は最悪のケースである。タイトに、いくつかの問題が達成する、あなたのものはしない。見るのはその結果である。高く評価されるポリシーは、実際のタスクで失敗し、より多くのクリーンなデータを記録しても改善されない。より多くのデータがヘルプを停止する場合、それはcovariate shiftであり、データボリューム問題ではない。

DAggerと呼ぶために、ベータ混合を実装する必要がありますか?

パラメーターフリー版では、ラウンド1のエキスパート、その後、ピュア学習者は合法的な特別な場合です。多くの場合、元の実験で最良のパフォーマンスをしました。何が出るのは集約である。最新の修正のみで再訓練することは、Follow-The-Leaderの解釈を壊す。これは、ノーリグレット議論の出所である。修正のみで訓練することは、ははるかに弱い手順。

検証セットで最高のポリシーの代わりに最後の1つを返す理由?

なぜなら定理シーケンスのどこかに良いポリシーが存在することを保証し、最後の反復ではなく。結合はシーケンスの最小値である。最後のラウンドから何が出てきたかを出荷することは、結果の述べられた条件を破棄し、最後のラウンドは確実に最良ではない。

何ラウンド計画する必要がありますか?

理論はT順序のイテレーションが必要です。600ステップエピソード以下、誰もハードウェアで実行される数ではない。元の実験は20回のイテレーションをすべてのベンチマークで実行しました。実際には、介入率が下落を停止するまでラウンドを実行し、分析が仮定するかなり低い。理論と実践の間の実ギャップ。

ポリシークラスがエキスパートを表現できない場合?

その後、DAggerはあなたを節約しない、結合は言う。それはエプシロンNに対して相対的に表現される。クラスのエキスパートのクラスで最高の損失。それが大きい場合は間違ったアーキテクチャのため、不足している観測、またはシーンを見ることができないカメラで、集約はあなたにポリシーを与える。最適なクラスをできないクラス内。ホールドアウトエピソードに対するオープンループリプレイを実行してから、修正を収集。

ここに行く場所

ポリシーを訓練していない場合、この理論は時期尚早である:最初にデータセットを記録する。から始まる最初のポリシーを訓練 そしてデスクトップクライアント。別の100のクリーンなデモンストレーションを開始修正に対して計量する場合:クリーンデモンストレーションは分布問題を修正しない。機械については、ヒューマンゲートバリアント 続いてSO-100ウォークスルーを続ける。

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started