rl algorithm

学習手法

MLGO:強化学習を使ってコンパイラの最適化処理を最適化(2/2)

1.MLGO:強化学習を使ってコンパイラの最適化処理を最適化(2/2)まとめ ・MLGOを使用してレジスタ割当問題も大規模データセンターのQPSで0.3%~1.5%改善できた ・QPSは導入後数ヶ月間持続しており時間経過に伴って性能が劣化し...
学習手法

JSRL:事前ポリシーを効率的に使用して強化学習をジャンプスタート(1/2)

1.JSRL:事前ポリシーを効率的に使用して強化学習をジャンプスタート(1/2)まとめ ・強化学習は試行錯誤でタスクを実行するがゼロからポリシーを学習する事は難しい ・例えば複雑でゴールにどれだけ近づいているかを測定できないようなタスクの解...
学習手法

オフライン強化学習における未解決の課題への取り組み(3/3)

1.オフライン強化学習における未解決の課題への取り組み(3/3)まとめ ・オフラインRLを改善するためには履歴データにない行動を学習する必要がある ・既存手法は履歴データにない行動を過度に過大評価してしまう問題があった ・基本的に悲観的な予...
学習手法

オフライン強化学習に関する楽観的な見解(1/2)

1.オフライン強化学習に関する楽観的な見解(1/2)まとめ ・ほとんどの強化学習は、エージェントが直接オンライン環境と対話するオンライン強化学習が前提 ・オフライン強化学習はエージェントが収集済みデータにないアクションを実行した際の評価が困...