LLMチームは「What? Where? When?」ゲームをプレイできるか:チームベースのインタラクションでLLMの推論能力を向上
なぜ重要か
複数のLLMを連携させ、組織的な推論を模倣することで、AIが複雑な問題解決において人間のような協調能力を発揮する道を開きます。
要約
LLMが間接推論、文化的知識、協調的仮説検証を必要とするクイズゲーム「What? Where? When? (ChGK)」に挑戦しました。チームベースの戦略(投票、サイレントチーム、おしゃべりチーム)を導入することで、単一モデルのベースラインを最大20ポイント上回り、LLMの推論能力が大幅に向上することが示されました。
要点
- LLMがChGKクイズに挑戦
- チームベースの戦略を導入
- 単一モデルを最大20%上回る
- 間接推論・文化的知識を強化
- AIエージェントの協調的推論
詳細解説
大規模言語モデル(LLM)は近年目覚ましい進歩を遂げていますが、間接的な推論、深い文化的知識、複数のエージェント間の協調的な仮説検証が必要な複雑なタスクにおいては、依然として限界があります。本研究では、ロシアの人気のクイズゲーム「What? Where? When? (ChGK)」をテストベッドとして、チームベースのインタラクションがLLMの性能に与える影響を調査しました。ChGKは、集団的な推論能力を強く要求されるゲームです。研究者らは、投票、サイレントチーム(キャプテンが最終回答のみを観察)、そしておしゃべりチーム(キャプテンが回答と根拠の両方を観察)という3つの異なるチーム戦略を導入し、データリークを最小限に抑えるため、2025年にリリースされた572問のChGK質問で評価を行いました。結果として、6つのオープンソース大規模モデルを用いたチームベースの戦略は、単一モデルのベースラインと比較して、最大20パーセントポイントの精度向上を達成しました。この技術的意義は、LLMが単体で解決できない複雑な問題に対し、複数のLLMを連携させ、人間のような組織的推論を模倣することで、その能力を大幅に引き出せることを実証した点にあります。社会・産業への影響としては、将来のAIエージェントシステムや、企業におけるAIを活用した意思決定支援システムにおいて、より高度な協調性と信頼性を持ったソリューションが実現される可能性を示唆しています。今後は、チーム戦略のさらなる最適化や、実世界での複雑な問題解決への応用が期待されます。
元記事を読む
ArXiv NLP で読む →