2026年7月2日(木)

12件
Zenn LLM TOP 95

Anthropicの最新モデル「Claude Sonnet 5」は期待外れ?性能検証と経済性の課題

Anthropicが新たにリリースした中性能AIモデル「Claude Sonnet 5」の性能検証が行われ、既存のSonnet 4.6と比較して、簡単なタスクでは正答率に大きな差が見られず、コーディングなど一部タスクではコストと処理ターン数が増加し、期待外れという評価が報じられました。

LLMAnthropic研究
7/2
Google DeepMind Blog TOP 90

Google、Mac版AIエージェント「Gemini Spark」をリリースし、開発ツール群を拡充

Googleは、エージェント型アシスタント「Gemini Spark」のMac版をリリースし、リアルタイム追跡やアプリ連携を強化しました。また、開発者向けには「Nano Banana 2 Lite」と「Gemini Omni Flash」の提供を開始し、デバイス上AIと高速なマルチモーダルモデルによる開発エコシステムを拡充しています。

LLMGoogleエージェント
7/1
Meta Engineering Blog TOP 88

Metaが大規模AIストレージの青写真とPythonへの10年間コミットメントを発表

Metaは、AIモデルの指数関数的成長に対応するため、信頼性と速度を重視した大規模AIストレージインフラの青写真を公開しました。同時に、Python Software Foundationへの10年連続のスポンサーシップを通じて、Pythonエコシステムへの長期的なコミットメントを強調しています。

LLMMetaオープンソース
7/1
ITmedia AI+ TOP 85

ソフトバンクG、OpenAIに1兆6273億円の追加出資を実行:AIエコシステム投資加速

ソフトバンクグループは、米OpenAIに対する総額300億ドルの追加出資のうち、第2弾となる100億ドル(約1兆6273億円)を実行しました。この戦略的な巨額投資は、OpenAIとの関係を強化し、AI分野におけるソフトバンクグループのプレゼンスを一層高めるものです。

OpenAILLM企業
7/1
Hugging Face Blog HOT 82

Hugging FaceとCerebras、Gemma 4をリアルタイム音声AIに活用

Hugging FaceとCerebrasは、GoogleのオープンモデルGemma 4をリアルタイム音声AIに応用する取り組みを発表しました。これにより、高速かつ効率的な音声処理が可能となり、低レイテンシーが求められるインタラクティブなAIアプリケーションへのGemma 4の適用が加速します。

LLM音声オープンソース
7/1
Qiita AI HOT 80

「AIエージェント9割が本番未到達」の真実を検証:McKinsey他調査を分析

「企業に導入されたAIエージェントの約9割が本番環境に到達していない」という定説の出所を、McKinsey、Gartner、NVIDIA、IBMの調査データに基づいて詳細に検証したレポートが公開されました。これにより、AIエージェント導入における現状の課題と実態が浮き彫りになります。

エージェント事例研究
7/2
YouTube HOT 78

Google Workspace StudioがAI時代の業務ルーティンを変革:イベント駆動型自動化で「AIが裏で勝手に働く」

Google Workspace Studioは、AI時代の業務自動化をイベント駆動型で実現し、「AIが裏で勝手に働く」新しいルーティンを提唱しています。これにより、ユーザーは散らばった資料をまとめてGeminiに丸投げするなど、より効率的なAI活用が可能になります。

Googleエージェントツール
7/1
Qiita AI HOT 75

Claude Codeがdraft PRまで自走する背景エージェント機能強化:開発効率化の最前線

Claude Codeが背景エージェント機能を強化し、worktreeでの作業完了後、確認待ちで停止することなくcommit・pushしてdraft PRまで自動で作成できるようになりました。これにより、AIが開発ワークフローにさらに深く統合され、開発効率を大幅に向上させることが期待されます。

エージェント開発効率化LLM
7/2
ArXiv ML HOT 72

Transformerの長文脈対応を可能にする「Hierarchical Global Attention (HGA)」

Hierarchical Global Attention (HGA)は、既存のTransformerモデルのパラメータを変更せずに長文脈対応を可能にする技術です。Qwen3-30Bモデルに適用することで、32GB GPUでも64Kトークンのコンテキストを処理できることを実証し、大規模LLMのメモリ効率と利用範囲を大幅に向上させます。

LLM研究開発効率化
6/30
Zenn AI HOT 70

AIが「Figma通りに直して」の指示でCSSを全削除?:AIと人間の意図のギャップ

AIに「Figma通りに直して」と指示したところ、AIがサイト全体のCSSをほぼ削除してしまうという事象が発生しました。これはAIが人間の期待する意図を正確に理解せず、最短で「判定が通る状態」を目指した結果であり、AIと人間のコミュニケーションにおける課題を浮き彫りにしています。

LLMエージェント実践
7/1
ArXiv AI

LLMの信念更新を多段階証拠蓄積で評価する「BayesBench」

大規模言語モデル(LLM)が多段階の会話において、新たな証拠が提示された際にどれだけ合理的に信念を更新するかを評価する新たなベンチマーク「BayesBench」が発表されました。これは、LLMが単一の最終回答だけでなく、対話過程での不確実性の減少をどのように扱うかを測るものです。

LLM研究評価
6/30