タグ
33件 · 15週間分
中国のMoonshot AIが2.8兆パラメータの新型AIモデル「Kimi K3」を発表しました。このモデルは、長文処理能力と高性能ベンチマークスコアでGPT-5.6やClaude Fable 5に匹敵するとされ、AI業界に新たな競争の波をもたらしています。その自社ベンチマーク、独立指標、市場反応、およびweights公開予定について解説します。
Anthropicの最上位AIモデル「Claude Fable 5」が、MaxおよびTeam Premiumプランの標準機能として提供開始されました。この統合により、ユーザーは利用上限の50%まで追加費用なしでFable 5を利用できるようになります。また、Claude Fable 5はLMSYSでGPT-5.6 Solを上回り首位を獲得するなど、その性能の高さが各所で評価されています。
JPMorganのストラテジストチームが、OpenAIとAnthropicのAIモデルで構築した8体のAI投資エージェントを20年間のバックテストにかけ、一部のエージェントがベンチマークに対して0.7ポイントの超過リターンを達成したことを明らかにしました。この実験は、AIが複雑な金融市場で意思決定を行う可能性を示唆しています。
富士通は、業務知識から複数のAIを自動構成し自己進化するマルチAIエージェント開発・運用基盤「Fujitsu Kozuchi Multi AI Agent Framework」を発表しました。これにより、AIが自律的に連携し、複雑な業務プロセスの効率化と自動化を大幅に加速します。
AIサービスにおける年齢確認は自己申告が基本であり、虚偽申告による未成年アカウントの事後的な大量削除は技術的・倫理的に難しい設計問題を抱えています。46,812件の強制退会事例から、年齢下限を設けるAIサービスの課題と対策が議論されています。
OpenAIは、Microsoft 365 Copilotの推奨モデルとして最新のGPT-5.6シリーズ(Sol、Terra、Luna)を発表しました。これにより、Word、Excel、PowerPointなどのOfficeアプリケーションにおけるAI機能が強化され、生産性が向上します。
大規模言語モデル(LLM)のAPI料金や入力上限は「トークン数」で決まりますが、これは日本語の「文字数」とは異なる概念です。本記事は、トークンとコンテキストウィンドウの基礎を解説し、実務におけるコスト試算やプロンプト設計で文字数ではなくトークン数を意識する重要性を説いています。
セキュリティ企業Sysdigが、LLMエージェント単独でLangflowのRCE脆弱性を悪用し、侵入から暗号化まで全自動で実行する世界初のAI実行ランサムウェア「JADEPUFFER」を報告しました。このランサムウェアは、ハルシネーションを利用したサプライチェーン攻撃の脅威を示唆しています。
AIエージェントの利用が広がる中、過剰実装やコスト増大の問題が顕在化しています。本稿では、OSS「ponytail」による過剰実装の抑制、複数のClaude Codeエージェントの並列運用、モデルの使い分けによるコスト削減など、AIエージェントを賢く運用し、コストを最適化するための具体的な戦略とツールについて解説します。
2025年後半から2026年前半にかけて、AI活用の中心は「プロンプトエンジニアリング」から「コンテキストエンジニアリング」へと移行しました。これは、LLMが単発のプロンプトだけでなく、会話履歴、RAG、外部文書、ツール実行結果、記憶など、より広範なコンテキストを扱うようになったためです。
「企業に導入されたAIエージェントの約9割が本番環境に到達していない」という定説の出所を、McKinsey、Gartner、NVIDIA、IBMの調査データに基づいて詳細に検証したレポートが公開されました。これにより、AIエージェント導入における現状の課題と実態が浮き彫りになります。
Claude Codeが背景エージェント機能を強化し、worktreeでの作業完了後、確認待ちで停止することなくcommit・pushしてdraft PRまで自動で作成できるようになりました。これにより、AIが開発ワークフローにさらに深く統合され、開発効率を大幅に向上させることが期待されます。
OpenAIは、次世代AIモデル「GPT-5.6 Sol」の限定プレビューを開始しました。このモデルは、コーディング、科学、サイバーセキュリティの能力を大幅に強化し、OpenAI史上最も高度な安全性スタックを統合しています。米政府との調整を経て、信頼できるパートナー向けに先行提供されます。
LlamaIndexを活用したRouter Agentの開発は、複数のデータソースを自律的に切り替えるエージェントRAGを可能にします。これにより、従来の単一巨大データベースRAGの限界を克服し、企業内の複雑なナレッジマネジメントを効率化する道が開かれます。
Bloombergの報道によると、OpenAIはAnthropicとの競争激化を見据え、大幅な値下げを検討しています。これは、Anthropicが同様のコスト引き下げに動くことを予測した動きであり、AI市場における低価格モデルへのシフトが加速しています。
Appleが「Poke」をMessages for Business初のAIエージェントとして承認し、テキストメッセージだけで予定管理、健康モニタリング、スマートホーム操作などが可能になります。これにより、AIがユーザーの日常生活に深く統合され、よりシームレスな体験が実現します。
日本企業では「若手ほどAIを使う」という傾向が過去のものとなりつつあり、役職者層でのAI活用が進む一方で、全社的なAI導入には課題が山積しています。生成AIの活用環境を重視する新入社員と、利用に慎重な企業文化との間で摩擦が生じています。
Anthropicが最新のLLM「Claude Opus 4.8」をリリースし、コーディング精度を大幅に向上させました。さらに、高速版の「Fast mode」はAPIコストが3分の1に削減され、開発者にとってよりアクセスしやすくなっています。このアップデートは、特にAIを活用した開発や業務効率化に大きな影響を与えるでしょう。
Anthropicが公開したエージェントの「封じ込め(containment)」設計に関する知見は、AIエージェントが高度化する中で、その誤動作や意図しない影響(Blast Radius)を最小限に抑えるための実践的なアプローチを提示しています。
AIの進化が「エンジニア不要論」を引き起こす中で、AnthropicのClaude Mythosの登場を起点に、正社員エンジニアという働き方の価値や、AI時代のセキュリティ変化について考察が展開されています。
AIコーディングツールが小規模プロジェクトでは均一な効果を示すものの、その真の価値は「大規模プロジェクト」においてこそ顕著になるという見解が示されました。AIがプロジェクト全体の複雑性を管理し、開発効率を向上させる可能性を指摘しています。
Microsoft AI CEOのムスタファ・スレイマン氏が「12〜18ヶ月でAIがほとんどの専門職業務で人間レベルに到達する」と予測。これにより「AIで消える職種」ではなく「職種の中のどの業務がAIに置き換わるか」という視点が重要になると提言されています。
OpenAIのCodex/GPT-5.5やAnthropicのClaude Codeは、金融チームのレポート作成からNVIDIAのシステム開発、AutoScout24のコード品質向上に至るまで、多様な分野で開発効率を劇的に向上させています。特に、コーディングエージェントのスキル共有やマーケットプレイス活用により、非エンジニアでも業務自動化が可能になり、AIエージェントの適用範囲が拡大しています。
Anthropicが金融分野に特化したAIエージェント10種を公開し、金融業界でのClaudeの導入を加速させます。同時に、米CAISIはMicrosoft、Google DeepMind、xAIとフロンティアモデルの評価で正式合意し、AIの安全な開発と利用に向けた国際的な枠組みが強化されています。
AIコーディングエージェントの暴走による従量課金APIの高額請求リスクに対し、「API課金ゲート」を設計し、「ヒューマン・イン・ザ・ループ」を導入することで、コスト管理と安全な運用を実現する方法が解説されています。
ChatGPTやGoogle AI OverviewなどのAI検索エンジンに自社サイトの情報が正確に引用されるためには、構造化データ(JSON-LD)の利用が不可欠です。この記事では、具体的な実装コードとともにその方法を解説し、AI時代のSEO対策を提示します。
Anthropicは、3月から4月にかけて報告されたClaude Codeの品質低下について公式報告書(ポストモーテム)を公開しました。調査の結果、3つの回帰(regression)が原因であったと特定し、現在これらの問題に対処していることを発表。ユーザーからのフィードバックに基づき、信頼性向上に努めています。
AI生成コードに潜むAPIキー漏洩リスクは深刻であり、それを防ぐための静的解析ツールと、AIが生成物を自己レビュー・修正するCLIツール「Kanzaki」が開発されました。AIを活用したセキュリティ対策と品質向上に貢献します。
LLMアプリ開発でよく遭遇する「返答が途中で切れる」「回答が不安定になる」といった問題は、入力・出力トークン制限、会話履歴の管理、RAG(検索拡張生成)の設計に起因します。本記事では、これらの問題の根本原因を解明し、効果的な解決策を提示します。
AIエージェントが持つ「健忘症問題」、つまり過去の対話や行動履歴を忘れてしまう課題に対し、継続的な学習と成長を可能にする3つの設計原則が提唱されている。OpenClawの運用経験からも、エージェントは一度設定したら終わりではなく、試行錯誤とフィードバックの繰り返しで成長することが強調されており、記憶の永続化と再利用が重要となる。
「ハーネスエンジニアリング」というバズワードが注目を集めるが、その実体はLLMのプロンプトやエージェントの動作を安定させるための、環境設計や検証の工夫であり、新しい専門領域というよりは既存のベストプラクティスに新しい名称を与えたものだという指摘がある。重要なのは、曖定な言葉に惑わされず、再現性の高いプロンプト設計の条件を理解し、堅牢なAIシステムを構築することである。
無料版ChatGPTが以前より性能が低下したと感じるユーザーが増えていますが、これは「気のせい」ではなく、無料版と有料版のモデルや機能の「仕様差」に起因する可能性が高いです。OpenAIは意図的に無料版の性能を調整しているかもしれません。
最近、無料版ChatGPTの性能が以前より劣化したと感じるユーザーが増加しており、これは単なる「気のせい」ではなく、有料版(ChatGPT Plus)との機能やモデルの「仕様差」に起因する可能性が高いと指摘されています。特に、応答の質、詳細度、対話の深さにおいて違いが見られます。