2026年9月16日(水)

12件
Google DeepMind Blog TOP 93

Google Gemini 3.8 Liveと3.8 Live Extended Thinkingの発表

Google DeepMindは、リアルタイム音声対話に特化したGemini 3.8 Liveと、思考プロセスを並行して実行する3.8 Live Extended Thinkingを発表しました。これにより、音声AIエージェントの会話の滑らかさとタスク処理能力が飛躍的に向上します。

LLMGoogleエージェント
9/15
Hugging Face Blog TOP 92

AIエージェントの安定性と自己改善:一貫性評価と新しいフレームワーク

AIエージェントがタスクを一貫して成功させるための評価手法「ALTK Evolve Consistency」が提案されました。また、Hugging FaceとIBM Researchは、エージェントの振る舞いの一貫性評価の重要性を強調し、さらに「Generalized Agent Iteration (GAI)」という自己改善のための統一フレームワークが発表され、従来のポリシー改善と再帰的自己改善を統合します。

エージェント研究LLM
9/16
The Verge TOP 90

Microsoft WindowsとSurfaceの新イベント:ローカルAIがPCの未来をどう形作るか

Microsoftは10月7日にWindowsとSurfaceに関するイベントを開催し、特にローカルAIがPCの次章をどう形作るかについて議論する予定です。NVIDIAのJensen Huang CEOも登壇することから、AIを強化した次世代PC、特にRTX Spark PCに焦点が当たると予想されます。

AINowツール開発効率化
10/7
The Verge TOP 88

米国におけるAIとデータセンターに対する国民の強い反感、両党に影響

ニューヨーク・タイムズとシエナ大学の世論調査によると、米国の有権者の61%がAIを動かすデータセンターの建設に反対しており、強い反感が示されています。この問題は、両党の支持層に均等に分断を生んでおり、政治家が対応を迫られる状況です。

AINow社会インフラ
9/17
Zenn AI TOP 85

タスクの優先順位付けにおけるLLMの推測能力と限界

LLMは情報不足のタスク優先順位付けでも、確認質問をせず推測で情報を補完し、自信満々に回答する特性が明らかになりました。情報量が増えても全体的な順位付けは大きく変わらず、推測の根拠は不明瞭なままです。

LLMエージェントプロンプト
9/15
Zenn AI HOT 83

思考モード:ChatGPT、Claude、GeminiのReasoning Effort実装比較とAIの自己認識の限界

ChatGPT、Claude、Geminiといった主要LLMプロバイダーは、AIが回答前にどれだけ「思考」するかを制御する多様なreasoning effort設定を提供していますが、その実装は異なり、AI自身に設定内容を尋ねても正確な情報は得られないことが判明しました。

LLMプロンプト研究
9/15
Zenn AI HOT 80

AIエージェントの「忘却」問題とローカル記憶レイヤー「myc」

Claude CodeなどのAIエージェントが過去の決定事項を忘れてしまう「忘却」問題に対し、OSSのローカル記憶レイヤー「myc」が提案されました。これはプロジェクト隣接のSQLiteファイルでタスクキューや記憶を管理し、一貫したエージェントの振る舞いを可能にします。

エージェントオープンソース開発効率化
9/15
ArXiv AI HOT 78

特許ドラフトAIエージェントの評価におけるLLM判事の有効性

特許ドラフト生成の評価において、LLM判事が反復的なフィードバックを提供することで、AIエージェントのドラフト品質が向上することが示されました。LLM判事によるガイド付き改訂は、高コストな高推論エージェントの性能に低推論エージェントを近づける効果があることをVibe Patenting研究が報告しています。

LLMエージェント研究
9/16
ArXiv ML HOT 75

ローカルLLMエージェントにおけるメモリ戦略評価プロトコル「BudgetBench」

ローカルLLMエージェントのメモリ戦略評価のため、各呼び出しごとの入力トークン予算を独立変数とする「BudgetBench」プロトコルが発表されました。これにより、メモリ容量、遅延、キャッシュ増加といった制約下での品質、予算利用率、予算違反率を体系的に比較できます。

LLMエージェント研究
9/16
ArXiv AI HOT 70

AIエージェントが長期間の物理タスクを自己適応的に管理できるか

LLMエージェントが人間の介入なしに長期間の物理タスクを自己適応的に管理できるかを探る研究がArXivで発表されました。計画、ツール呼び出し、観察、検証を統合したマルチエージェントフレームワークにより、ゼロショットで環境変化に対応する物理AIの実現可能性を評価しています。

LLMエージェントロボティクス
9/16
ArXiv NLP

LLM時代のプロンプト圧縮:トレーニング不要な辞書ベース手法の有効性

大規模化するLLMプロンプトのコストとレイテンシを削減するため、トレーニング不要で決定的な辞書ベースのプロンプト圧縮パイプラインが提案されました。この手法は、出力品質を大きく損なうことなく高い圧縮率を実現する可能性を示しています。

LLMプロンプト研究
9/16