自 Qwen 3.8 Flash Next 发布以来,有一个流传的看法:N-gram 表将让人在单台服务器上跑起 1T 以上参数的模型,其中约 980B 参数可以卸载到 SSD。这里要泼一盆冷水:它做不到。但它真正能为本地模型带来的东西,比“跑更大模型”更值得期待。
一、Engram 到底是什么
Engram 本质上是一张带长键的嵌入表。与平常按单个 token ID 索引静态向量不同,它用最后 2-3 个 token 作为键——也就是一个 N-gram。比如“New York”会拥有自己独立的记忆向量,“the United”也会有自己的向量。使用时先对 N-gram 做哈希,取出向量,再送入网络。整个过程 O(1) 常数时间,没有额外 FLOPs。
为什么要这样做?因为在 transformer 早期的层中,有很大一部分计算是在从头重建静态事实:实体名称怎么拼写、套话、常见搭配,例如“New”加“York”会想到华尔街、熟食店、老鼠和地铁。然而每次模型需要回忆一个多 token 实体时,都会消耗好几层 attention 和 FFN 去重新组装——这本质上就是一次数据库查询。Engram 把这个任务真正变成查表,让神经层把深度留给实际推理。
所以 Qwen 3.8 Flash Next 能携带约 51B 参数的 N-gram 嵌入,而每个 token 只激活约 6B 参数。查表很便宜,因此可以把表做得非常大,并且放在 RAM 或 SSD 中。
二、为什么不能靠 Engram 跑 1T 模型
关键在于:查表是“笨”的。键只是最后 2-3 个 token,你拥有的 200k 上下文对取回什么没有任何影响。更宽的上下文可以接受或拒绝取回的向量,但无法改变取回的内容。Engram 用来存储“含义”,类似嵌入,它不替代推理或计算。当模型看到 import std,不会因为 Engram 向量而突然获得多年 C++ 编程经验。表负责记忆,transformer 负责推理。
有人可能想,把 N 调大不就能记住更复杂的模式吗?也不行。N 越大,该特定 N-gram 在训练数据中出现得越少,每条目得到的训练信号越弱。论文的消融实验发现,把容量分配给 4-gram 会“稀释掉更常见 2/3-gram 模式的容量”。因此,把 Engram 嵌入扩大到 500B 而不让它浪费空间,几乎不可能。
三、真正有价值的改变:让小模型把推理和记忆分开
Engram 是一个了不起的架构创新。它让模型将多 token“含义”推导从活跃参数中剥离出去,这意味着较小的模型会变得聪明得多。过去 27B 模型不得不把参数预算同时花在两件事上:实际推理,以及记忆本来可以由查表保存的静态模式。这就是为什么 4B 或 7B 小模型即使面对明显超出其推理能力的任务,也常常显得笨。Engram 把这两件事拆开:知识放入几乎零成本查询的表中,每个活跃参数都被释放用于推理。这个创新最值得兴奋的一点是:更小的模型可能达到今天 Opus 或 Sol 的智能水平,而不是要堆更大的模型。
四、社区中的观察与期待
有网友立刻注意到,这类模型有两个可见变化:它能以极少的推理数出单词中的字母;对否定词如“not”的处理变好了,因为“do not”很可能已经成为一个单独的 N-gram。这样一来,告诉模型“不要做某事”反而增加它发生概率的老问题,有望得到缓解。
另一位使用者提到,per-layer embeddings(PLE),比如 Gemma E2B/E4B 中实现的,某种程度上也是简化版的 N-gram 查表(1-gram)。尽管论文里提到,在给定参数预算时存在一个最优的 Engram 参数与 MoE expert 参数比例,但处于 VRAM 受限的消费级系统,Engram 多一点可能更实用。他期待看到的概念验证是:一个约 20~30B 的模型装入 VRAM,再多加 100B 甚至更多的 Engram 参数,卸载到 RAM 或 NVMe 存储。
也有人提出,如果真能以卸载 Engram 的方式把 1T 模型跑起来,那客观上肯定比跑小模型更有吸引力;但这个问题的立场是,Engram 并不能让 1T 模型以可用速度运行,而是让你已经在跑的更低参数模型达到更高的智能水平。此外,也有人质疑,这项技术最早不是 DeepSeek 大规模引入的吗?为什么除了 Qwen 还没有别人真正采用?对此,有网友回复说,其实已经有对应的 pull request,也有人演示过它能工作。
处理建议
如果你还在期望“1T 模型在本地跑起来”,可以先放下这个念头。更值得关注的是:在相同参数量下,Engram 能解放多少推理能力。对本地部署者来说,可以留意 llama.cpp 这类推理后端是否会增加类似 --ssd-ngram 的选项;同时,等真正出现 20~30B 模型搭配 100B+ Engram 的概念验证,再评估实际效果也不迟。