タグ
1件 · 1週間分
複雑な環境で優れた性能を発揮するディープ強化学習(DRL)エージェントの意思決定プロセスは解釈が困難である。SPOT (Sampling Policy Observation Tree) は、ポリシーと環境シミュレーターを活用し、エージェントの行動選好とその後の状態変化を有限地平ツリーで表現することで、DRLポリシーの解釈可能性を大幅に向上させる。