Engram:条件记忆

Engram 是 DeepSeek 提出的条件记忆(conditional memory)模块:把语言建模中的 "静态知识检索"从神经网络计算中剥离出来,交给经典的 N-gram 嵌入表以 O(1) 哈希查找完成。 它与 MoE 的条件计算构成一对互补的稀疏轴——MoE 用稀疏激活处理动态逻辑, Engram 用稀疏查找存取固定知识。

原始论文:Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models(arXiv:2601.07372,DeepSeek-AI + 北京大学,2026), 代码开源于 GitHub

核心思想

  • 语言建模包含两类性质不同的子任务:组合推理(需要深层动态计算)与 知识检索(命名实体、套语等局部、静态、高度模式化的内容)。
  • 标准 Transformer 没有原生的知识查找原语,只能用计算模拟检索: 解析一个多 token 实体往往要消耗早期多层的 Attention 与 FFN, 相当于在运行时重建一张昂贵的静态查找表。
  • Engram 把这类局部依赖交给确定性哈希查找,把宝贵的网络深度与注意力容量 还给全局上下文与复杂推理。

收录条目

原始论文的架构(四大组件)、稀疏分配 U 型缩放律、27B 规模实验、机理分析与系统设计 V4.1-Flash 对原始设计的工程化裁剪


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""