2026年9月2日(水)

12件
The Verge TOP 95

Anthropicが新モデル「Claude Fable 5.1」と「Mythos 5.1」を発表 - 性能向上とコスト削減、エージェントワークを最適化

Anthropicは、新しいLLM「Claude Fable 5.1」と「Mythos 5.1」を発表しました。Fable 5.1はFable 5よりも性能が向上しつつ、特にエージェントタスクにおいて最大45%のコスト削減を実現しています。Mythos 5.1はより厳格な審査制のモデルで、高度なサイバーセキュリティ能力と強化されたセーフガードを備えています。

LLMAnthropicエージェント
9/1
OpenAI Blog TOP 92

OpenAI、クリティカルなサイバーセキュリティ能力を持つモデル「Astra」のセーフガード強化を発表

OpenAIは、未発表のモデルスイート「Astra」の開発を一時的に遅らせ、サイバーセキュリティの安全対策を強化したと発表しました。Astraは「Preparedness Framework」に基づき、クリティカルなサイバーセキュリティ能力の閾値を満たす最初のOpenAIモデルとなります。

LLMOpenAIエージェント
9/2
OpenAI Blog TOP 90

AIネイティブ企業がワークフローをオペレーション能力に変革する事例

OpenAIは、Basis、Clay、Exa LabsといったAIネイティブ企業が、AIエージェントを活用してオンボーディング、アカウント管理、開発者統合などの主要ワークフローを大幅に改善し、運用能力へと転換している事例を紹介しました。これらの事例は、エンタープライズ企業がAIを戦略的に導入する上で適用可能な示唆に富んでいます。

エージェントOpenAI事例
9/2
TechCrunch AI TOP 88

Google、Canvaに対抗するAIファーストのデザインツール「Google Pics」を発表

Googleは、CanvaやAdobeが支配するクリエイティブソフトウェア市場に、「Google Pics」というAIファーストのデザインツールで参入します。このツールは、従来のGUIベースのデザインではなく、プロンプト入力によって画像を生成・編集するアプローチを採用しており、ユーザーはデザインのスキルがなくても高度なビジュアルコンテンツを作成できます。

画像生成Googleツール
9/1
Hugging Face Blog TOP 85

Hugging FaceがWebGPU対応の200以上のカーネル「@huggingface/kernels」を公開、ローカルAI開発を加速

Hugging Faceは、WebGPUを活用した200以上のカーネルを含むライブラリ「@huggingface/kernels」をリリースしました。これにより、ブラウザ内で高性能なAIモデルを直接実行することが可能になり、ローカルAIの開発と実行が大幅に効率化されます。

オープンソース研究開発効率化
9/2
TechCrunch AI HOT 80

AnthropicのClaude Fable 5.1とMythos 5.1がエージェントワークを最大45%削減し、規制緩和を実現

Anthropicは新LLM「Claude Fable 5.1」と「Mythos 5.1」をリリースしました。Fable 5.1はFable 5よりも高性能でありながら、特にエージェントタスクにおいて最大45%のコスト削減を達成。また、過度な安全対策の緩和やデータ保持ポリシーの改善も図られ、エンタープライズ顧客の要望に応えています。

LLMAnthropicエージェント
9/1
ASCII.jp HOT 75

「AI協働力」評価基準をハイヤールーが無償公開、エンジニアのAI活用能力を可視化

株式会社ハイヤールーは、エンジニアがAIと協働する際のプロセスの質を測る独自の指標「AI協働力」の評価設計と解説資料を無償で公開しました。これは、AIを活用した開発が主流となる中で、エンジニアの新しいスキルセットを客観的に評価するための重要なツールとなります。

開発効率化コミュニティ実践
8/25
Zenn AI HOT 70

生成AIにコードを直させる際の「差分ゼロ」検証の落とし穴と対策

AIにコード修正を依頼する際、新旧のコードの「差分ゼロ」を合格条件とすると、予期せぬ問題に直面することがZennの記事で指摘されています。AIが意図しない変更を生成する可能性があるため、検証は出力結果の「期待値との一致」に焦点を当てるべきであり、並行実行による正確な差分確認の困難さも考慮する必要があります。

開発効率化実践LLM
9/2
YouTube

Google DeepMindがエージェント型動画理解Geminiを発表

Google DeepMindは、新しいエージェント型動画理解モデル「Gemini」を発表しました。このモデルは、単に動画の内容を認識するだけでなく、動画内で発生する複雑なイベントやインタラクションをエージェントのように推論・理解する能力を持ちます。

マルチモーダルGoogle研究
9/2
ArXiv AI

データサイエンス自動化のためのエージェントハーネスツールキット「DS-Lighting」発表

データサイエンスワークフローの自動化において、LLMエージェントの性能は「ハーネス」と呼ばれるタスク表現、実行状態管理、評価フィードバックの仕組みに大きく依存します。ArXivに発表されたDS-Lightingは、このハーネス設計を明示化し、データサイエンス自動化を統一的に支援するツールキットです。

エージェントLLM研究
8/26
ArXiv ML

LLMの推論効率を向上させるシーケンシャルエントロピー解決フレームワーク「ERR+」

複雑なタスクで高性能を示す大規模言語モデル(LLM)の推論チェーンにおいて、正しい推論は誤った推論よりも思考フェーズでのトークンレベルエントロピーの頻繁かつ大きな低下を示すことが判明しました。この発見に基づき、ArXivに発表された「ERR+」は、シーケンシャルエントロピー解決を導入し、効率的で決定的なLLM推論を実現する2フェーズの強化学習フレームワークです。

LLM研究エージェント
8/26