タグ
13件 · 6週間分
AIエージェントの知識やスキルを仮想ファイルシステムで管理するOpenVikingが登場し、エージェントの記憶システム評価も進んでいます。Anthropicからはエージェント評価の公式ガイドが発表され、結果を基に学習・改善する「AutoBots」も注目を集めています。
金融AIエージェントの評価に特化した新しいベンチマーク「FinProBench」が提案されました。このベンチマークは、実際の金融専門家が作成した成果物から導出された「役割に基づいたルーブリック」を用いることで、既存手法では見落とされがちな暗黙の専門基準を評価基準に組み込みます。
多言語LLMの性能評価において、出力トークン数に上限を設ける従来の評価方法が、言語によって異なる「ネイティブ言語と翻訳言語の推論ギャップ」に最大57ポイントものバイアスを生じさせることが判明しました。これは、各言語の表現に必要なトークン数が異なるためです。
AI科学者システムによる自律的な研究生成の品質を評価するため、フロンティアLLMを活用した自動査読システムを提案。Sakana AI、CycleResearcherなど主要フレームワークの独創性、科学的厳密性、明瞭さ、重要性をベンチマークしました。
LLMが自動判定を行う際の認知バイアス脆弱性に対処するため、「Chain-of-Models (CoM)」という自動監査パイプラインを提案。これは、第二のモデルが第一モデルの推論過程を検査してから最終判定を下す仕組みで、監査モデルの選択が重要であることを示します。
RAG(Retrieval-Augmented Generation)システムの評価において、市販のRAG評価フレームワーク(RAGAS、DeepEval、TruLens)が、自作評価と比較してどの程度有効かを検証した結果、誤答検出では自作評価が優れる一方、原因診断では市販フレームワークが強みを発揮することが判明しました。
VentureBeatの調査によると、企業はAIエージェントに自律性を持たせながらも、その評価結果への信頼度が低い状況です。157社中半数以上が内部評価をクリアしたエージェントが本番環境で顧客対応に失敗したと報告しており、評価の現実世界との乖離が問題となっています。
RAG(検索拡張生成)システムの精度評価を行った際、当初はモデルの差が問題と思われたが、実際には評価に使用していた「ものさし」である埋め込みモデルに問題があったことが判明しました。text-embedding-ada-002からtext-embedding-3-smallへの変更で、同一条件でも評価結果が大幅に改善することが示されました。
Explainable AI (XAI) の技術が多数存在するにもかかわらず、それが実世界のワークフローに影響を与えることが稀であると指摘されています。本論文は、XAI研究が「アドホックな手法」の開発から、問題の定式化、評価目的の不明確さ、フィードバックパイプラインの欠如といった「基礎的・構造的課題」に取り組む方向へ転換すべきだと主張しています。
大規模言語モデル(LLM)が多段階の会話において、新たな証拠が提示された際にどれだけ合理的に信念を更新するかを評価する新たなベンチマーク「BayesBench」が発表されました。これは、LLMが単一の最終回答だけでなく、対話過程での不確実性の減少をどのように扱うかを測るものです。
現在のAI評価パラダイムは妥当性の欠陥を抱えており、特に生成AIシステムの評価において、項目レベルのベンチマークデータが不可欠であるとArXivの論文が指摘しています。これにより、詳細な診断分析とベンチマークの原則的な検証が可能になると主張しています。
LLMの性能比較において、プロンプトAとBのどちらが優れているかを判断するために必要な評価件数に関する統計的根拠が不足している現状に対し、Zennの記事[33]がその重要性を解説しています。無根拠な件数ではなく、統計的検定と検出力分析に基づいた評価の必要性を強調しています。
従来のベンチマークでは評価が難しかったLLMの「専門家レベルの認知能力」を測るため、XpertBenchが発表されました。金融、医療、法律、教育など80の専門分野にわたる1,346の複雑なタスクとルーブリックベースの評価基準を特徴とし、LLMの真の実用性を明らかにします。