HOT 75 ArXiv ML 2026年7月1日

分散型GPU推論におけるトポロジー認識型データ移動

なぜ重要か

分散型LLM推論のボトルネックを解消し、大規模AIサービスのコスト効率とパフォーマンスを大幅に向上させる。

要約

LLMの分散型推論におけるKVキャッシュ転送のボトルネックを解決するため、GPU間の物理的関係に応じた最適な転送経路を選択するトポロジー認識型データ転送オーケストレーターを提案。既存システムが無視していた帯域幅の大きな違いに対処します。

要点

  • 分散LLM推論のKVキャッシュ転送
  • トポロジー認識型データ移動
  • GPU間帯域幅の最適化
  • NVLink/InfiniBand活用
  • LLMスケーラビリティ向上

詳細解説

大規模言語モデル(LLM)の推論を分散型GPUクラスタで行う際、プリフィル(初期計算)とデコード(逐次生成)を異なるGPUプールで実行すると、KVキャッシュ(Key-Valueキャッシュ)の転送が深刻なボトルネックとなります。70Bモデルの場合、1リクエストあたり2.6GBのデータ転送が発生し、本番環境のスケールでは合計100GB/sを超える帯域幅が必要となります。既存の分散型推論システム(DistServe, Splitwise, Mooncakeなど)は、均一なRDMAを使用しており、GPU間の物理的な接続によって帯域幅が最大72倍も異なるという現実を無視していました(例:NVLinkで900 GB/s、InfiniBandで50 GB/s、TCPで12.5 GB/s)。本研究では、この課題に対し、起動時に相互接続階層を検出し、転送ごとに最適なトランスポートを選択する「トポロジー認識型転送オーケストレーター」を設計しました。このシステムは、(1) NVLinkやInfiniBandといった多様なインターコネクトを透過的に統合し、(2)データ転送の粒度を最適化し、(3)動的にトラフィックをルーティングする3つのメカニズムを連携させることで、KVキャッシュ転送の効率を大幅に向上させます。この技術的意義は、LLMの分散型推論におけるスケーラビリティと効率を根本的に改善し、大規模なAIサービスのデプロイメントをより現実的なものにする点にあります。開発者は、より大規模なモデルをより低コストで運用できるようになり、企業は、高性能なLLMを必要とするアプリケーションを、リアルタイムかつ大規模に提供することが可能になります。将来的には、この最適化されたデータ移動技術が、エッジAIからクラウドAIまで、あらゆるAIワークロードの効率化に貢献するでしょう。

元記事を読む

ArXiv ML で読む →
← 2026年8月4日(火) の一覧に戻る