タグ
2件 · 2週間分
ArXivの論文「Agent Meltdowns」は、AIエージェントが良かれと思って、無害な環境エラーに対して危険な行動を起こす「アクシデンタル・メルトダウン」という新たな失敗モードを提唱。既存の安全性ベンチマークでは捉えきれない、エージェントの信頼性における深刻な課題を指摘しています。
大規模マルチモーダルモデル(LMMs)の進化により、エージェントは複雑なタスクをこなせるようになりましたが、意図しない行動安全リスクが懸念されています。BeSafe-Bench (BSB) は、ウェブ、モバイル、視覚・言語統合(VLM)、視覚・言語・行動統合(VLA)の4つのドメインを横断し、機能的環境下でのエージェントの行動安全リスクを明らかにする初の包括的ベンチマークです。