90C40」カテゴリーアーカイブ

A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces

要約 我々は、ポーランドの状態および行動空間を用いた無限地平線エントロピー正則化 … 続きを読む

カテゴリー: 60B05, 90C26, 90C40, 90C53, 93E20, cs.LG, math.OC, math.PR | A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces はコメントを受け付けていません

Strongly-polynomial time and validation analysis of policy gradient methods

要約 この論文では、有限状態およびアクションのマルコフ決定プロセス (MDP) … 続きを読む

カテゴリー: 49K45, 49M05, 90C05, 90C26, 90C40, 90C46, cs.AI, cs.DS, cs.LG, math.OC | Strongly-polynomial time and validation analysis of policy gradient methods はコメントを受け付けていません

Achieving Exponential Asymptotic Optimality in Average-Reward Restless Bandits without Global Attractor Assumption

要約 無限の地平線の平均報酬の落ち着きのない盗賊問題を考えます。 我々は、アーム … 続きを読む

カテゴリー: 90C40, cs.LG, G.3, math.OC, math.PR | Achieving Exponential Asymptotic Optimality in Average-Reward Restless Bandits without Global Attractor Assumption はコメントを受け付けていません

Unichain and Aperiodicity are Sufficient for Asymptotic Optimality of Average-Reward Restless Bandits

要約 我々は、離散時間における無限地平の平均報酬型レストレス・バンディット問題を … 続きを読む

カテゴリー: 90C40, cs.LG, G.3, math.OC, math.PR | Unichain and Aperiodicity are Sufficient for Asymptotic Optimality of Average-Reward Restless Bandits はコメントを受け付けていません

Active Inference Tree Search in Large POMDPs

要約 事前に効率的に計画を立てる能力は、生物と人工システムの両方にとって重要です … 続きを読む

カテゴリー: 68Q07, 68T20, 68W27, 90C40, cs.AI, G.3, math.PR, q-bio.NC | Active Inference Tree Search in Large POMDPs はコメントを受け付けていません

Non-maximizing policies that fulfill multi-criterion aspirations in expectation

要約 動的計画法と強化学習では、確率的環境におけるエージェントの逐次的な意思決定 … 続きを読む

カテゴリー: 68T20, 90C40, 91B06, cs.AI, econ.TH, F.2.2, math.OC | Non-maximizing policies that fulfill multi-criterion aspirations in expectation はコメントを受け付けていません

Unichain and Aperiodicity are Sufficient for Asymptotic Optimality of Average-Reward Restless Bandits

要約 無限の地平線、平均報酬の落ち着きのない盗賊問題を離散時間で考察します。 私 … 続きを読む

カテゴリー: 90C40, cs.LG, G.3, math.OC, math.PR | Unichain and Aperiodicity are Sufficient for Asymptotic Optimality of Average-Reward Restless Bandits はコメントを受け付けていません

Restless Bandits with Average Reward: Breaking the Uniform Global Attractor Assumption

要約 離散時間設定と連続時間設定の両方で、平均報酬基準を使用して無限地平線の落ち … 続きを読む

カテゴリー: 90C40, cs.LG, G.3, math.OC, math.PR, stat.ML | Restless Bandits with Average Reward: Breaking the Uniform Global Attractor Assumption はコメントを受け付けていません

A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces

要約 我々は、ポーランドの状態と行動空間を用いた無限地平線エントロピー正則化マル … 続きを読む

カテゴリー: 60B05, 90C26, 90C40, 90C53, 93E20, cs.LG, math.OC, math.PR | A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces はコメントを受け付けていません

Active Inference Tree Search in Large POMDPs

要約 前もって効率的に計画を立てる能力は、生物と人工システムの両方にとって重要で … 続きを読む

カテゴリー: 68Q07, 68T20, 68W27, 90C40, cs.AI, G.3, math.PR, q-bio.NC | Active Inference Tree Search in Large POMDPs はコメントを受け付けていません