大規模言語モデル(LLM)の進化は目覚ましいものがありますが、その性能を支えるAttention機構、特にTransformer(変換器)で用いられるソフトマックスアテンションには、入力シーケンス長に比例して計算コストが二次関数的に増大するという課題があります。この課題に対処するため、より計算効率の高い「線形アテンション(Linear Attention)」が注目を集めています。
線形アテンションは、ソフトマックスアテンションが持つ無制限のキャッシュ(記憶)を、固定サイズのリカレント状態(recurrent state)に置き換えることで、シーケンスミキシングの計算を線形時間へ、デコード時のメモリ使用量を定数へと削減します。これにより、より長いコンテキスト(文脈)を効率的に扱えるようになると期待されています。
しかし、この効率化には新たな課題が伴いました。それは、圧縮された固定サイズのメモリにおいて、「何を忘れるか」だけでなく、「どのようにメモリを編集すれば、既存の関連性を壊さずに新しい情報を書き込めるか」という点です。これまでの多くの線形アテンションモデル、例えばDelta-ruleモデルは、新しい値を書き込む前に現在の読み出し内容を減算するという仕組みを採用しています。また、Kimi Delta Attention (KDA)は、チャネルごとの減衰(channel-wise decay)を導入することで、忘却プロセスをより精密に制御しようと試みてきました。
これらの既存手法の共通の限界は、メモリの「消去」と「書き込み」という異なる二つのプロセスが、単一のスカラーゲート(scalar gate)によって同時に制御されてきた点にあります。つまり、キー(key)側で古いコンテンツをどれだけ消去するか、バリュー(value)側で新しいコンテンツをどれだけコミットするかという二つのアクションが、密接に連動してしまっていたのです。本稿で解説する「Gated DeltaNet-2」は、この長年の課題に根本からアプローチし、線形アテンションにおける記憶の柔軟性と精度を飛躍的に向上させる可能性を秘めています。
この研究の新規性
Gated DeltaNet-2の最も重要な新規性は、線形アテンションのメモリ編集において、記憶の「消去」と「書き込み」のメカニズムを、チャネルごとに独立したゲートで制御できるように分離した点にあります。
これまでのGated DeltaNetやKimi Delta Attention (KDA)では、メモリから古い情報を消去する量と、新しい情報を書き込む量を、実質的に一つのゲートで決定していました。これは、メモリが「忘れる」ことと「覚える」ことのバランスを一つのレバーで調整するようなもので、時には最適な制御が難しい状況を生み出していました。
Gated DeltaNet-2は、この制約を打ち破ります。具体的には、「チャネルごとの消去ゲート b_t」と「チャネルごとの書き込みゲート w_t」という二つの独立したゲートを導入しました。これにより、モデルは各情報チャネルに対して、古い情報を積極的に消去しつつ、新しい情報を控えめに書き込む、あるいはその逆といった、よりきめ細やかなメモリ操作が可能になります。
このアプローチは、Gated DeltaNetとKDAの両方を一般化するものです。論文では、もし両方のゲートが同じスカラー値に集約される場合、Gated DeltaNet-2はKDAに還元されること、さらにチャネルごとの減衰が失われる場合にはGated DeltaNetに還元されることを示しています。これは、Gated DeltaNet-2が既存の成功した線形アテンションモデルを包含しつつ、その表現能力をさらに拡張したことを意味します。この分離された制御メカニズムこそが、既存の関連性を壊さずに効率的なメモリ編集を可能にするブレークスルーだと言えるでしょう。
技術的な核心
Gated DeltaNet-2の技術的な核心は、線形アテンションが持つリカレント状態の更新プロセスに、チャネルごとの独立したゲートを導入した点にあります。
線形アテンションモデルでは、各タイムステップ t において、現在の入力クエリ(query) q_t とキー(key) k_t を用いて、これまでのシーケンス情報を凝縮したリカレント状態 h_{t-1} を更新し、新しい状態 h_t を生成します。この h_t が、実質的にモデルの「記憶」の役割を果たします。
従来のDelta-ruleモデルでは、新しい情報を記憶する際に、まず現在のリカレント状態から古い情報を「減算」し、その後に新しい情報を「加算」するという更新ルールが用いられます。数式的には h_t = (1 - ext{gate}) * h_{t-1} + ext{gate} * ext{new_info} のような形です。ここで gate は通常スカラー値であり、古い情報の忘却と新しい情報のコミットを同時に制御していました。Kimi Delta Attention (KDA)は、この (1 - ext{gate}) の部分に「チャネルごとの減衰」を導入し、忘却の粒度を高めましたが、やはりゲート自体は単一スカラーに基づいていました。
Gated DeltaNet-2では、この「減算と加算」のプロセスをより精密に制御します。具体的には、古い情報を消去するための「チャネルごとの消去ゲート b_t (erase gate)」と、新しい情報を書き込むための「チャネルごとの書き込みゲート w_t (write gate)」を導入します。これらのゲートは、入力に基づき動的に生成され、各チャネル(特徴量次元)ごとに異なる値を持ちます。
これにより、リカレント状態 h_t の更新は、例えば h_t = (b_t ext{ element-wise product } h_{t-1}) + (w_t ext{ element-wise product } ext{new_info}) のような形になります。ここで element-wise product は要素ごとの積を意味します。b_t が小さいチャネルでは古い情報が強く忘れられ、w_t が大きいチャネルでは新しい情報が強く書き込まれます。これら二つのゲートが独立しているため、例えば「ある種の古い情報は強く残しつつ、この新しい情報は弱く書き込む」といった、柔軟な記憶の編集が可能になるのです。
さらに、論文では実装面での工夫も紹介されています。高速な重み更新ビュー(fast-weight update view)を導出し、チャネルごとの減衰が非対称な消去要因に吸収される「チャンクワイズWYアルゴリズム」を採用しています。これにより、長いシーケンスを効率的に処理できます。また、効率的な並列トレーニングを維持するための「ゲート対応のバックワードパス(gate-aware backward pass)」も設計されており、これは大規模モデルの学習において非常に重要です。
実験結果と評価
Gated DeltaNet-2は、その革新的なアーキテクチャ設計が実際の性能向上に結びつくことを、大規模な実験によって示しています。
具体的には、1.3億(1.3B)のパラメータを持つモデルを構築し、1000億(100B)ものFineWeb-Eduトークンという膨大なデータセットで学習を行いました。この学習済みモデルを、言語モデリング、コモンセンス推論、そして情報検索といった、様々なタスクで評価しています。
比較対象として、Mamba-2、既存のGated DeltaNet、Kimi Delta Attention (KDA)、そしてMamba-3の派生モデルが選ばれています。これらのモデルとの比較において、Gated DeltaNet-2は、これら既存の強力なモデル群の中で「最も強力な全体結果を達成」しました。これは、Gated DeltaNet-2が、様々なタスクにおいて一貫して優れた性能を発揮する汎用性の高いモデルであることを示唆しています。
特に、その優位性が顕著に表れたのが、長文コンテキストの処理能力を評価する「RULER needle-in-a-haystackベンチマーク」です。このベンチマークは、非常に長い文章の中に埋め込まれた特定の情報(針)を正確に探し出す能力を測るもので、モデルの長期的な依存関係を捉える能力が試されます。Gated DeltaNet-2は、このベンチマークにおいて最も優位性を示し、特に評価された「マルチキー検索設定」において性能を改善しました。これは、線形アテンションのメモリ編集能力が、長文における情報の関連付けと検索において非常に有効であることを実証しています。
さらに、モデルはリカレント設定とハイブリッド設定の両方で高い性能を維持しています。リカレント設定はシーケンシャルなデータ処理に適し、ハイブリッド設定は並列処理とシーケンシャル処理を組み合わせることで効率と性能のバランスを取るものですが、いずれのシナリオでもGated DeltaNet-2がその堅牢性を示したことは、幅広い応用可能性を裏付けるものと言えるでしょう。
実用への示唆
Gated DeltaNet-2の登場は、特に長文コンテキストを扱うAIアプリケーション開発に大きな示唆を与えます。記憶の「消去」と「書き込み」をチャネルごとに独立して制御できるようになったことで、以下のような具体的な応用が考えられます。
まず、大規模言語モデルの長文理解能力のさらなる向上が期待されます。長い文書の要約、契約書のレビュー、医学論文の解析など、これまでTransformerベースのモデルではコンテキスト長の制約から難しかったタスクにおいて、より正確かつ深い理解が可能になるでしょう。チャットボットがユーザーとの長い対話履歴をより効率的かつ正確に記憶し、文脈を維持した応答を生成することも期待されます。
次に、検索拡張生成(RAG)システムにおける効率性と精度の向上です。RAGシステムでは、外部の知識ベースから関連情報を検索し、それを元にテキストを生成します。Gated DeltaNet-2のような長文コンテキスト処理に優れたモデルは、検索された膨大な情報をより効率的に処理し、必要な「針」を「干し草の山」から見つけ出す能力を高めることで、生成されるテキストの品質と関連性を向上させることができます。
また、メモリ効率の改善は、より大規模なモデルや、より長いシーケンス長を扱う際の計算リソースの節約にも貢献します。これは、限られた計算予算の中で高性能なAIモデルを開発・運用しようとする企業や研究機関にとって、非常に重要なメリットとなります。
さらに、独立したゲートによる記憶制御は、特定ドメインの知識や専門用語の学習と維持にも応用できるかもしれません。例えば、特定の分野の情報をより強く記憶し、関係のない情報は積極的に忘却するといった、ドメイン特化型の記憶戦略をモデルに持たせることが可能になる可能性があります。
このように、Gated DeltaNet-2は、単にベンチマークスコアを向上させるだけでなく、現代のAIシステムの根本的な課題解決に貢献し、多様な産業応用への道を拓く技術と言えるでしょう。
まとめ
本記事では、線形アテンションの記憶メカニズムに革新をもたらす「Gated DeltaNet-2」について解説しました。
従来の線形アテンションモデルが抱えていた、記憶の「消去」と「書き込み」が単一のスカラーゲートで連動してしまうという課題に対し、Gated DeltaNet-2はチャネルごとの独立した消去ゲート b_t と書き込みゲート w_t を導入することで、この問題を根本的に解決しました。
この新しいアーキテクチャは、既存のGated DeltaNetやKimi Delta Attention (KDA)を一般化しつつ、線形アテンションが持つメモリの編集能力を飛躍的に向上させています。実験結果では、言語モデリング、コモンセンス推論、情報検索といった多岐にわたるタスクにおいて、Mamba系列を含む他の強力なモデルと比較して最も優れた全体結果を達成しました。特に長文コンテキストのRULER needle-in-a-haystackベンチマークでの顕著な優位性は、その長期的な情報保持と検索能力の高さを示しています。
Gated DeltaNet-2は、大規模言語モデルの長文理解能力を大幅に高め、検索拡張生成(RAG)システムのような応用において、より効率的で高精度な情報処理を実現する可能性を秘めています。この研究は、線形アテンションが次世代のAIモデルの基盤としてさらに発展していく上での重要な一歩となるでしょう。
元論文
- タイトル: Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
- 著者: (不明)
- arXiv ID: 2605.22791
※ 本記事には Amazon アソシエイト・楽天アフィリエイト・A8.net 等のアフィリエイト広告が含まれる場合があります。リンクから商品・サービスが購入された場合、紹介料を受け取ることがあります。