タグ
2件 · 2週間分
複雑な環境で優れた性能を発揮するディープ強化学習(DRL)エージェントの意思決定プロセスは解釈が困難である。SPOT (Sampling Policy Observation Tree) は、ポリシーと環境シミュレーターを活用し、エージェントの行動選好とその後の状態変化を有限地平ツリーで表現することで、DRLポリシーの解釈可能性を大幅に向上させる。
LLMのユーザーは通常、単一の出力でモデルを評価しますが、これは広範な生成分布の一部に過ぎません。本研究では、この分布構造(モード、エッジケース、プロンプト変化への感度)を可視化・比較するインタラクティブなツール「GROVE」を提案しています。これにより、ユーザーはLLMの振る舞いをより深く理解し、プロンプト開発の効率化に貢献します。