On Corrigibility and Alignment in Multi Agent Games

要約

自律エージェントの修正性は、システム設計の中で十分に検討されていない部分であり、これまでの研究では単一エージェント システムに焦点を当てていました。
人間の好みに関する不確実性が、たとえ人間の不合理に直面したとしても、エージェントを無慈悲に保つように作用することが示唆されている。
我々は、エージェントが人間に監督を求めることができる動きを常に持つ 2 プレイヤー ゲームとして、マルチエージェント設定での適合性をモデル化するための一般的なフレームワークを提示します。
これは、人間の信念に不確実性をもたらすことを目的としたベイジアン ゲームとして定式化されています。
さらに 2 つの具体的なケースを分析します。
まず、2 プレイヤーの相関性ゲームです。このゲームでは、一般的なペイオフ (単調) ゲームと調和ゲームの両方について両方のエージェントに相関性を表示する必要があります。
次に、一方のエージェントが「防御側」エージェント、もう一方が「敵対者」であると見なされる敵対者の設定を調査します。
正当性を誘発するために、防御側エージェントがゲームと人間の合理性についてどのような信念を持っている必要があるかについての一般的な結果が提供されます。

要約(オリジナル)

Corrigibility of autonomous agents is an under explored part of system design, with previous work focusing on single agent systems. It has been suggested that uncertainty over the human preferences acts to keep the agents corrigible, even in the face of human irrationality. We present a general framework for modelling corrigibility in a multi-agent setting as a 2 player game in which the agents always have a move in which they can ask the human for supervision. This is formulated as a Bayesian game for the purpose of introducing uncertainty over the human beliefs. We further analyse two specific cases. First, a two player corrigibility game, in which we want corrigibility displayed in both agents for both common payoff (monotone) games and harmonic games. Then we investigate an adversary setting, in which one agent is considered to be a `defending’ agent and the other an `adversary’. A general result is provided for what belief over the games and human rationality the defending agent is required to have to induce corrigibility.

arxiv情報

著者 Edmund Dable-Heath,Boyko Vodenicharski,James Bishop
発行日 2025-01-09 16:44:38+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.AI, cs.GT パーマリンク