強化学習 on 行李の底に収めたり[YuWd]

強化学習 on 行李の底に収めたり[YuWd] https://yuiga.dev/blog/en/tags/%E5%BC%B7%E5%8C%96%E5%AD%A6%E7%BF%92/ Recent content in 強化学習 on 行李の底に収めたり[YuWd] Hugo -- gohugo.io en ©2024, All Rights Reserved Thu, 07 Jul 2022 01:14:08 +0900 方策エントロピー https://yuiga.dev/blog/en/ja/posts/%E6%96%B9%E7%AD%96%E3%82%A8%E3%83%B3%E3%83%88%E3%83%AD%E3%83%94%E3%83%BC/ Thu, 07 Jul 2022 01:14:08 +0900 Thu, 07 Jul 2022 01:14:08 +0900 https://yuiga.dev/blog/en/ja/posts/%E6%96%B9%E7%AD%96%E3%82%A8%E3%83%B3%E3%83%88%E3%83%AD%E3%83%94%E3%83%BC/ 探索空間において探索されたことで更新される情報量情報エントロピー, もしくは方策の対数尤度の期待値と考えればOK $$\displaystyle{H(\pi( \cdot | s_t)) = \sum_{a} {-\pi(a | s)\log\pi(a | s)} = E_{a\sim\pi} \left[ {-\log\pi(a | s)} \right \rbrack}$$ 引用: https://horomary.hatenablog.com/entry/2020/12/20/115439 YuWd (Yuiga Wada) featured image 強化学習 post SAC(Soft-Actor-Critic) https://yuiga.dev/blog/en/ja/posts/sacsoft-actor-critic/ Thu, 07 Jul 2022 00:57:58 +0900 Thu, 07 Jul 2022 00:57:58 +0900 https://yuiga.dev/blog/en/ja/posts/sacsoft-actor-critic/ Actor-Critic型のSoft-Q学習 Soft-Q学習とは簡単に言うと, 報酬 + 方策エントロピーを目的関数に据える学習手法 SAC(Soft-Actor-Critic)の理論的背景はSoft-Q学習からきており、従来の目的関数に方策エントロピー項を加え、より多様な探索を可能にした手法です。エントロピー項は正則化の役割 YuWd (Yuiga Wada) 強化学習 post REINFORCE https://yuiga.dev/blog/en/ja/posts/reinforce/ Mon, 27 Jun 2022 17:47:00 +0900 Mon, 27 Jun 2022 17:47:00 +0900 https://yuiga.dev/blog/en/ja/posts/reinforce/ 単純な方策勾配方法では $$\nabla J(\theta) = \mathrm{E}_{\tau_\theta} \lbrack \sum_t G(\tau) \nabla log \pi_\theta (A_t|S_t) \rbrack$$ が使われていたが, 全ての時刻 $t$において収益 $G(\tau)$が一律に使用されているのが気がかりである重要なのは, 時刻 $t$の行動の後の評価であるから, $\lbrack0,t)$の収益はノイズとなり得るそこで, REINFORCEでは以下のように勾配を変更する $$\nabla J(\theta) = \mathrm{E}_{\tau_\theta} \lbrack \sum_t G_t YuWd (Yuiga Wada) 強化学習 post TD法 https://yuiga.dev/blog/en/ja/posts/td%E6%B3%95/ Sun, 26 Jun 2022 23:32:14 +0900 Sun, 26 Jun 2022 23:32:14 +0900 https://yuiga.dev/blog/en/ja/posts/td%E6%B3%95/ DP法とMC法の中間 MCの場合, 終端までわかってないと使えなかったなので, 1ステップの状態に対してサンプリングを行い, 評価→行動引用: ゼロから作るDeep Learning ❹ ―強化学習編 YuWd (Yuiga Wada) featured image 強化学習 post DQN https://yuiga.dev/blog/en/ja/posts/dqn/ Sun, 26 Jun 2022 23:32:02 +0900 Sun, 26 Jun 2022 23:32:02 +0900 https://yuiga.dev/blog/en/ja/posts/dqn/ Q学習は推定値 $E_t$ を使って推定値 $E_{t+1}$を更新する (これをブートストラップと呼ぶ) ゆえにQ学習は不安定なのだが, NNを加えると更に不安定になりやすい DQNでは, 推定値 $E_t$ と推定値 $E_{t+1}$の相関が強くなりすぎないように「経験再生」と「ターゲットネットワーク」と呼ばれるものを導入する経験再生過去の状態や行動 YuWd (Yuiga Wada) 強化学習 post MC法 https://yuiga.dev/blog/en/ja/posts/mc%E6%B3%95/ Sun, 26 Jun 2022 23:01:29 +0900 Sun, 26 Jun 2022 23:01:29 +0900 https://yuiga.dev/blog/en/ja/posts/mc%E6%B3%95/ モンテカルロ法二次グリッド上の経路探索問題なら, 状態 $s$ は $(i,j)$の各マス方策 $\pi$に準じて $N$回行動 $a$をサンプリング移動先の状態 $s_k$と収益 $G_t(s_k)$を記録終端まで収益 $G_t(s_k)$を計算最後に各状態 $s$の収益 $G_t(s_k)$の平均を取る [* 行動 $a$をサンプリングしている点に注 YuWd (Yuiga Wada) featured image 強化学習 post DAgger algorithm https://yuiga.dev/blog/en/ja/posts/dagger_algorithm/ Sun, 26 Jun 2022 17:15:40 +0900 Sun, 26 Jun 2022 17:15:40 +0900 https://yuiga.dev/blog/en/ja/posts/dagger_algorithm/ 状態: $s \in S$ 行動: $a \in A$ 方策: $\pi$ $\pi : S \rightarrow A$ と定義累積的にデータセットを増やしながら方策を学習していく感じ誤差が少ないらしい YuWd (Yuiga Wada) featured image 模倣学習強化学習 post