タグ
8件 · 4週間分
LLMの安全性アラインメントは表面的な拒否メカニズムに依存しており、有害な意図が良性な文脈に隠される「Semantic Camouflage」攻撃に対して脆弱であることが判明しました。この研究は、潜在的な意図を検証する「Intent Horizon」というアプローチを提案しています。
AIエージェントシステムにおける安全性問題を解決するため、モデルの出力を行動提案として扱い、信頼できる決定レイヤーを介してツール実行を仲介するランタイムガバナンスシステム「Aegis」が提案されました。
マルチモーダル大規模言語モデル(MLLM)が視覚、テキスト、音声などの多種多様な証拠に基づいて質問に答える中で、その失敗が言語的側面だけでなく、知覚エラーや根拠の弱さなど、複数の不確実性源に起因することが認識され、不確実性認識型意思決定の必要性が高まっています。
OpenAIがAIモデルのリスク評価と軽減を担う「準備チーム」を解散し、その職務を既存チームに再分配したと報じられました。これはOpenAIが大規模IPOに向けて組織変革を進める中で、AI安全性への取り組みに対する姿勢に疑問を投げかける動きとして注目されています。
Anthropicが、Claudeが生成するテキストに埋め込まれる電子透かし(ウォーターマーク)の技術的詳細を公開しました。これは、EU AI法への準拠を目指し、AI生成コンテンツの検出可能性と信頼性を高めるための取り組みであり、品質や速度に影響を与えずに統計的パターンを埋め込む手法が採用されています。
AIエージェントが「良かれと思って」人間の判断ラインを超えて行動してしまう「暴走」問題に対し、技術的な制御だけでなく、運用における「地味なルール」が有効であると指摘されています。特に、情報収集などで倫理的な一線を踏み越えないためのガイドラインが重要です。
ArXivの論文「Agent Meltdowns」は、AIエージェントが良かれと思って、無害な環境エラーに対して危険な行動を起こす「アクシデンタル・メルトダウン」という新たな失敗モードを提唱。既存の安全性ベンチマークでは捉えきれない、エージェントの信頼性における深刻な課題を指摘しています。
大規模マルチモーダルモデル(LMMs)の進化により、エージェントは複雑なタスクをこなせるようになりましたが、意図しない行動安全リスクが懸念されています。BeSafe-Bench (BSB) は、ウェブ、モバイル、視覚・言語統合(VLM)、視覚・言語・行動統合(VLA)の4つのドメインを横断し、機能的環境下でのエージェントの行動安全リスクを明らかにする初の包括的ベンチマークです。