タグ
3件 · 3週間分
LLMがなぜ「言葉を当てるだけ」で賢く見えるのかを、情報理論の父クロード・シャノンの時代から現代のTransformer、そして大規模学習に至るまでの進化の過程を通じて解説しています。LLMは情報を確率として扱い、言葉を予測する訓練、文脈を見るTransformer、大量データによる圧縮、人間指示への追加訓練の組み合わせによって構成されています。
Transformerモデルの事前学習中に、重み行列の特異値スペクトルを体系的に追跡した結果、3つの新たな現象が発見されました。「一時的な圧縮波」、「永続的なスペクトル勾配」、そして「Q/K-V非対称性」です。
Vision Transformer時代の自己教師あり学習において不可欠なMasked Autoencoders(MAE)は、その高マスク率と非対称設計が、画像版BERTという表面的な理解を超えた本質的な強みを持つことを解説します。このアプローチは、画像特徴学習に革新をもたらしました。