戻るAIはオープンソースです
DeepSeek Engram 解釈:O(1) を使って条件付きメモリを検索し、大型モデルに「新しいスパース軸」を追加してください

DeepSeek Engram 解釈:O(1) を使って条件付きメモリを検索し、大型モデルに「新しいスパース軸」を追加してください

AIはオープンソースです Admin 132 回閲覧

1. 要旨

EngramはDeepSeekのオープンソース「条件付きメモリ」モジュールであり、その核心はTransformerに拡張可能なフォームルックアップメモリプリミティブを追加することです。より静的なパターンや知識の一部がNグラムメモリテーブルの形で保存され、推論時におおよそO(1)の方法で取得され、現在の隠れ状態と融合されます。 公式リポジトリの結論によれば、パラメータと計算能力が等しい制約の下で、Engram-27Bは知識、推論、コード、数学などのタスクにおいてMoEベースラインと比較して安定した成果を有しています。 また、メカニズム解析により、初期層の静的モデルの「再構築」の負担を軽減し、より複雑な推論計算に有効深度を残すことが示されています。

2. コア機能

1. O(1) フォーム 条件メモリ

静的Nグラムメモリの決定論的なアドレッシングと取得により、「知識探索」は高密度のニューラルコンピューティングから部分的に分離され、計算経路の占有が減ります。

2. MoEを補完する「スパース新軸」

MoEは条件付き計算によって容量を拡張し、Engramは条件付きメモリによって容量を拡張します。一方は「計算」され、もう一方は「チェック」され、組み合わせた後に同じFLOPの下でモデル能力をより効果的に割り当てることができます。

3. 容量割り当てにはU字縮尺法則が用いられます

「計算能力(MoE)」と静的記憶容量(Engram)の公式なトレードオフが示されており、工学的なトレードオフを導くU字型のスケーリング法則が存在することを指摘しています。

4. メカニズムの説明は工学的直感により近い

リポジトリでは、Engramが初期層で静的パターンを繰り返し再構築する必要をなくし、層数や表現能力を後のより重要な推論プロセスに委ねることを明示しています。これは「推論のためのより効果的な深化」と理解できます。

5. システムの効率性と着陸可能性

決定的アドレッシングは、ハイパースケールの組み込みテーブルをホストメモリにオフロードするために用いられ、推論オーバーヘッドの増加は可能な限り制御可能です。

3. 設置

1. 環境の準備

Python 3.8+、隔離環境(venv/conda)が推奨されます。

2. インストール依存関係

リポジトリごとのクイックスタート:torch、numpy、transformers、sympyなどの依存関係をインストールします。

3. デモンストレーションを実施する

リポジトリはEngramのコアデータフローを示すためのengram_demo_v1.pyを提供します。 このバージョンでは、いくつかの標準的なコンポーネント(例:Attention/MoEなど)をモックし、Engramモジュールの動作方法を強調します。

4. 典型的なユースケース

1. 知識集約型の質疑応答と事実の想起

タスクが「安定した知識/固定表現モード」により依存する場合、ルックアップメモリはモデルの最初の数層でのパターン再構築の繰り返しを減らすことができます。

2. 長期文脈における安定した断片再利用

固定されたフレーズ、コードテンプレート、一般的なフォーマットなど、繰り返し現れる短い断片に対して静的メモリヒットを適用し、長い文脈での無効計算を減らすこと。

3. コードのテンプレート構造と数学的シナリオ

より「一般的な導出ルーチン/コード骨組」を持つタスクでは、メモリチャネルがより静的な構造を扱うために使われ、計算チャネルは組み合わせと推論に重点を置きます。

4. MoEと組み合わせたコスト効率の高い拡張

総パラメータと総FLOP数が制限される前提のもと、「容量の一部は静的メモリテーブルに置かれ、その代わりに実効容量密度が高まります」とされています。

5. 生態系と競合製品

1. 生態学的状況

現在、公式リポジトリは主に論文+構造図+実験図+デモで構成されており、新しい「条件付き記憶」コンポーネントの迅速な理解や既存のMoEスタックとの組み合わせ空間の評価に適しています。

2. 競合する商品および隣接する方向

隣接するアイデアには、通常、RAG(外部検索強化)、kNN-LM/近隣検索、伝統的なNグラム/キャッシュ、そしてさまざまなスパースアテンション/スパースルーティングアーキテクチャが含まれます。 Engramの違いは、モデルの内部プリミティブとして「訓練可能な静的メモリテーブル」を使用し、作業分担とMoEによるスケーリングを強調している点です。 実際の効果は、特定のデータ分布、トレーニングレシピ、デプロイの制約と組み合わせて検証する必要があります。

6. 制限事項と注意事項

1. 用紙の詳細および複製口径

リポジトリは主要な結論とデモを提供しますが、大規模なトレーニング、対処実装、完全なアブレーションの詳細は依然として論文に基づいています。

2. メモリと展開のトレードオフ

巨大なメモリテーブルをホストメモリにオフロードすることでメモリ負荷は軽減されますが、帯域幅、レイテンシ、エンジニアリングの複雑さに新たな制約が生じます。

3. 適用性は課題の形態によって異なります

タスクの主なボトルネックが「動的推論/組合せ的一般化」であり、「静的モード/知識再利用」よりも、知識集約型のタスクほど利点が明確でないかもしれません。

4. 既存のトレーニングシステムとの統合コスト

新しいモジュールを既存のMoE/注意実装や並行戦略に結びつけるには、トレーニングの安定性、スループット、ヒット率やテーブル容量利用率などのモニタリング指標を評価する必要があります。

7. プロジェクトアドレス

https://github.com/deepseek-ai/Engram

8. よくある質問

Q: Engramのコアキーワードは何ですか?また、どのような問題を解決していますか?

A: キーワードは条件付きメモリ、スケーラブル・ルックアップ、O(1) ルックアップメモリ、Nグラムメモリです。 トランスフォーマーに「ネイティブ知識ルックアップ」機能を与え、静的なパターンや知識を集中的な計算から分離しようとしています。

Q: EngramとMoEの関係は何ですか?

A: MoEは条件付き計算で容量を拡張し、Engramは条件付きメモリによって容量を拡張します。 この二つは互いに補完し合い、「計算(計算)+チェック(記憶)」という分担を形成できます。

Q: 公式のメカニズム分析で「より効果的で深い」とはどういう意味ですか?

A: リポジトリビューでは、Engramが初期層での静的パターンの再構築負担を軽減し、ネットワークの深さをより複雑な推論に集中させるというものです。これは「重要な部分に深さを残す」ようなものです。

Q: Engramの動作を素早く確認するにはどうすればいいですか?

A: ウェアハウスが提供するengram_demo_v1.pyを直接実行するには、まずデータフローと融合の位置を理解してください。 デモではEngramを強調するために共通のコンポーネントをモックします。

Q: EngramはRAGの代替として適していますか?

A: 補助的な方向性としてより適しています。RAGは外部文書の検索と更新、Engramは内部静的メモリの原始言語および計算/メモリの分業です。 この代替は、タスクが外部で更新可能な知識や制御可能な検索リンクを必要とするかどうかに依存します。

DeepSeekオープンソースのEngram条件付きメモリモジュールの公開 O(1) なぜテーブルを確認することが重要なのか? エングラム-27Bと計算能力がMoE基準を超えた理由 エングラムはNグラム静的メモリテーブル拡張トランスを使用して論争を呼び起こしました Engram-27Bは、知識推論コードの数学的安定獲得に実装されています DeepSeek Engramは、FLOPの集中的な計算ストリップから知識検索を除去します エングラムとMoEは互いの新しい軸を補完し合っています。一方は数え、もう一方は労働の分担方法を確認します エングラムはU字スケール法則を提案しました MoE計算能力と静的メモリのどちらを選ぶか エングラム機構の説明:初期層はもはや静的パターン推論をより深く、より効果的に再構築していません ディープシーク Engramは非常に大きなテーブルに対してホストメモリのオフロードをサポートしていますが、レイテンシコストは幾何級数学的です Engram_demo_v1オンライン 条件付きメモリのデータフローとフュージョン位置をできるだけ早く理解する方法 Engramは知識集約型のQ&Aに適しています なぜ静的モード多重化が純粋な計算よりも優れているのか Engramは固定断片を長い文脈で再利用します 無効な計算経路を減らすことはできますか? Engramはコードと数学テンプレート構造を強化 チャネルフォーカスを計算し、コンバインの推論がより強くなります Engram+MoEによるコスト効率の高い拡張 なぜFLOPの密度が高いのでしょうか? エングラムとRAGのどちらが強いか モデル内静的メモリが外部検索に代わるかどうか EngramとkNN-LMの違い:静的メモリプリミティブは注意を引くように訓練できます DeepSeek Engramの生態学的状況:実験的な図のデモは何を示しているのか? Engramのコアキーワード「条件付き記憶」の解釈: どんな課題を解決するのでしょうか? EngramはO(1)の検索を決定的アドレス指定で実装しています プロジェクトの着陸の利点はどこにあるのでしょうか? エングラムは前階の再建の負担を軽減します なぜ深みは複雑な推論に委ねられるのでしょうか? エングラムの静的メモリ容量が大きいほど良いです U字型の法則が答えを与えます Engramはホストメモリをオフロードしてビデオメモリを節約します 帯域幅やスループットは新たなボトルネックになるのでしょうか? エングラム統合のMoEと注意はコストがかかります トレーニングの安定性の評価方法 Engramはどのような指標を監視する必要があるのでしょうか? ヒット率とテーブル容量の利用率が鍵となります エングラム複製口径の注意: 倉庫の結論と論文の詳細の違いは何ですか? エングラムの境界はどこにあるのでしょうか? 動的推論課題の利点は明確でないかもしれません Engramはモデルに「ルックアップ」を組み込んでいます なぜNグラムをキャッシュするよりも新しいプリミティブのようなものなのか エングラムは固定式よりも安定した知識に優しいです なぜ二重計算を減らすのか DeepSeek Engram-27BとMoE基準の比較 なぜ計算能力は今でも利益を生むのでしょうか? エングラムの新しい軸はまばらな注意とは異なる テーブルを確認して容量を拡大する方が直接的ですか? エングラムエンジニアリングの直感:表現能力を後回しにすることの意味 Engramインストールクイックスタートポイント:トーチトランスフォーマーのSympy依存関係の設定方法 なぜEngramデモはモックなのか? 注意/MoE どのコアパスが強調されているか エングラムは長文脈安定化フラグメント多重に使用されます コードテンプレートでどれだけの計算能力を節約できるか エングラムは数学的導出ルーチンで静的構造に当てます なぜ改善しやすいのか エングラムとMoEの組み合わせは拡張ルートを変えるのでしょうか? 計算+調査の相乗効果がトレンドとなっています Engramのスケーラブル 検索の意味 スケーラブルなルックアップは推論を遅くしません Engramの決定的アドレッシングは展開に有利です しかし、柔軟性は犠牲になるのでしょうか? エングラムの大規模訓練の詳細は完全には公開されていません 着陸リスクや落とし穴は何でしょうか Engramのメモリと展開のトレードオフ:ビデオメモリの節約と遅延の追加は割に合わない エングラム 隣接競合比較:RAG kNN-LM キャッシュ Nグラム どちらがより適しているか DeepSeek Engramのプロジェクトアドレスは公開されています 条件付きメモリはトランスフォーマーの標準になるのでしょうか? エングラムの重要な論争: 長期的にメモリを計算能力に変換することがコスト効率が良いかどうか Engramが「ネイティブ化」する知識検索 なぜモデルの能力割り当てロジックを変更する必要があるのでしょうか? エングラムの「より効果的で深い」という言葉 メカニズムの証拠が工学的説明と整合しているかどうか 同じFLOPでエングラムが強い理由 静的メモリと計算経路の分離が鍵となります 既存の並列戦略とEngramを統合する際の困難さ 分散トレーニングとルーティングがどのように連携して機能するか エングラムは事実の記憶やトリビアに使われます なぜ純粋なMoEよりも安定しているのでしょうか? エングラムはMoEの欠点を補えるのか? 条件付きメモリはモデルが計算を減らし、より多くチェックできるようにします

関連記事

キルラインとは何か:ゲームのメカニクスから現実のメタファーへ

キルラインとは何か:ゲームのメカニクスから現実のメタファーへ

1. 殺戮線の本来の意味 「キルライン」という言葉は、ゲームの文脈で初めて使われました。これは、キャラクターの体力やその他の重要な指標が一定の臨界点まで低くなると、特定のスキルや一連のコンボによって安...

Anthropicリリース Cowork:Claude Desktopが非技術的なタスク用のフォルダプロキシを追加

Anthropicリリース Cowork:Claude Desktopが非技術的なタスク用のフォルダプロキシを追加

AnthropicはClaude Desktopで「Cowork」研究のプレビューを開始し、「より日常的な作業シナリオにおけるClaude Codeの拡張」として位置づけました。 ユーザーは、Clau...

Mem0はエージェントと統合する価値がありますか? 長期記憶は役立ちますが、境界線を管理する必要があります

Mem0はエージェントと統合する価値がありますか? 長期記憶は役立ちますが、境界線を管理する必要があります

Mem0は、AIアプリケーションやエージェント向けのオープンソースメモリ層プロジェクトで、アプリのユーザーの好み、歴史的事実、長期的な文脈を記憶するのを支援することを目的としています。 パーソナライズ...

ヘイスタックはどのようなチームに適しているのでしょうか? むしろコンポジタブルなRAGエンジニアリングフレームワークのようなものです

ヘイスタックはどのようなチームに適しているのでしょうか? むしろコンポジタブルなRAGエンジニアリングフレームワークのようなものです

HaystackはDeepSetが保守するオープンソースのAIアプリケーションフレームワークで、RAG構築、ドキュメントQ&A、検索パイプライン、LLMワークフローの構築に一般的に使用されています。 ...

おすすめツール

もっと見る