タグ
8件 · 4週間分
RAG(Retrieval-Augmented Generation)システムの評価において、市販のRAG評価フレームワーク(RAGAS、DeepEval、TruLens)が、自作評価と比較してどの程度有効かを検証した結果、誤答検出では自作評価が優れる一方、原因診断では市販フレームワークが強みを発揮することが判明しました。
VentureBeatの調査によると、企業はAIエージェントに自律性を持たせながらも、その評価結果への信頼度が低い状況です。157社中半数以上が内部評価をクリアしたエージェントが本番環境で顧客対応に失敗したと報告しており、評価の現実世界との乖離が問題となっています。
RAG(検索拡張生成)システムの精度評価を行った際、当初はモデルの差が問題と思われたが、実際には評価に使用していた「ものさし」である埋め込みモデルに問題があったことが判明しました。text-embedding-ada-002からtext-embedding-3-smallへの変更で、同一条件でも評価結果が大幅に改善することが示されました。
Explainable AI (XAI) の技術が多数存在するにもかかわらず、それが実世界のワークフローに影響を与えることが稀であると指摘されています。本論文は、XAI研究が「アドホックな手法」の開発から、問題の定式化、評価目的の不明確さ、フィードバックパイプラインの欠如といった「基礎的・構造的課題」に取り組む方向へ転換すべきだと主張しています。
大規模言語モデル(LLM)が多段階の会話において、新たな証拠が提示された際にどれだけ合理的に信念を更新するかを評価する新たなベンチマーク「BayesBench」が発表されました。これは、LLMが単一の最終回答だけでなく、対話過程での不確実性の減少をどのように扱うかを測るものです。
現在のAI評価パラダイムは妥当性の欠陥を抱えており、特に生成AIシステムの評価において、項目レベルのベンチマークデータが不可欠であるとArXivの論文が指摘しています。これにより、詳細な診断分析とベンチマークの原則的な検証が可能になると主張しています。
LLMの性能比較において、プロンプトAとBのどちらが優れているかを判断するために必要な評価件数に関する統計的根拠が不足している現状に対し、Zennの記事[33]がその重要性を解説しています。無根拠な件数ではなく、統計的検定と検出力分析に基づいた評価の必要性を強調しています。
従来のベンチマークでは評価が難しかったLLMの「専門家レベルの認知能力」を測るため、XpertBenchが発表されました。金融、医療、法律、教育など80の専門分野にわたる1,346の複雑なタスクとルーブリックベースの評価基準を特徴とし、LLMの真の実用性を明らかにします。