機器人學習
機器人放置的四項測試
位置可以達到目標並在之後倒下。四種歷史上的 Samsara 協議測試了何時成功才是最重要的。
機器人可以在球門處放置物體,然後在下一步 移動時將其擊落。如果評估人員在第一次成功時停下來,則穩定的安置 和短暫的接觸都算作透過。
我們之前的 Samsara 實驗使用了四條停止規則。環境報告目標狀態後,第一個 計算成功率。 第二種要求在政策繼續發揮作用的同時堅持下去。 然後第三個停止了控制,等了二十步。第四款在部署期間增加了執行器 干擾,同時保留了持續和 不干涉的要求。
第一次接觸CHECKPOINT V9 · 400 集
96.50 百分之持續控制CHECKPOINT V10 · 400 集
93.75 百分之再加上 20 個步驟CHECKPOINT V12 · 400 集
92.25 百分之有執行器干擾CHECKPOINT V12 · 400 集
90.25 百分之每項結果包含每個套件 100 個回合,共 400 個,使用隨機種子 1701 和初始狀態 10–19。首次成功標準下的 96.50% 使用 v9;持續控制下的 93.75% 使用 v10。停止干預和施加擾動的結果為 92.25% 和 90.25%,使用 v12。檢查點發生了變化,因此不能把得分差異完全歸因於評分規則。
當前的基準測試使用不同的規則
當前的Samsara評估 使用了217M引數的架構和2,000個回組合。它的固定評估 部署在首次成功終止環境時停止。 94.85% 的總分和 99.6% 的物件分數使用了該規則。
對之前的四條規則進行控制比較將使策略保持不 變,並重播相同的條件。在此之前,歷史結果 和當前的基準測試回答了有關操縱的不同問題。