Google DeepMind、拡散モデルベースの高速テキスト生成AI「DiffusionGemma」を発表
なぜ重要か
テキスト生成の速度と効率性を画期的に高め、リアルタイム性の高いAIアプリケーションの新たな道を拓きます。
要約
Google DeepMindは、テキスト生成を従来の4倍高速化する実験的AIモデル「DiffusionGemma」を発表しました。画像生成の拡散モデルをテキスト生成に応用し、256トークンを一括で並列生成することで、ローカルGPUで毎秒1000トークン以上の速度を実現します。これにより、インライン編集やコード補完などのインタラクティブな用途での新たな可能性が拓かれます。
要点
- 拡散モデルでテキスト生成
- 毎秒1000トークン超
- 並列生成で4倍高速化
- ローカルGPUで動作
- インライン編集に最適
詳細解説
Google DeepMindは、テキスト生成技術に新たなパラダイムをもたらす「DiffusionGemma」を発表しました。このモデルは、従来の自己回帰型モデルが抱える逐次生成のボトルネックを解消するため、画像生成で成功を収めている拡散モデルのアプローチをテキスト生成に応用しています。具体的には、256トークンを同時にノイズ除去する形で並列生成することで、テキスト生成速度を劇的に向上させます。H100 GPUでは毎秒1000トークン以上、消費者向けRTX 5090でも700トークン以上の速度を達成し、わずか18GBのVRAMで動作するという、驚異的な効率性を示しています。この技術的意義は大きく、従来のLLMの限界とされていた生成速度を一変させる可能性があります。Apache 2.0ライセンスで提供され、研究制限がないため、開発者はこの革新的なアーキテクチャを自由に活用できます。品質面ではまだ標準モデルに及ばない点もありますが、ローカル環境での高速なインライン編集、コード補完、リアルタイム対話型アプリケーションなど、低遅延が求められるユースケースにおいて大きな強みを発揮します。今後の展望として、この並列生成アプローチがテキスト生成モデルの主流となり、ユーザーエクスペリエンスを根本的に向上させる可能性を秘めています。
元記事を読む
Google DeepMind Blog で読む →