Liquid AI 的 100B 模型到底会不会来?先别急着高兴

文章导读
Liquid AI 近期在社交平台上发起了一个关于新模型规模的投票,社区里不少人期待 100B 级别的 LFM 3 出现。但冷静分析后会发现:投票并不代表官方计划,训练 100B MoE 的计算资源、显存需求和实际调度难度都是硬约束。文章梳理了社区对 100B 模型硬件兼容性的期待、对 MoE 训练成本的争论,以及为什么 30B 可能是更现实的下一站。给开发者的建议是:别被营销节奏带偏,按自己手头硬件和任务需求预留评估预算。
📋 目录
  1. 100B 对普通玩家意味着什么
  2. 投票≠承诺,社区历来如此
  3. MoE 训练成本:有效参数不是全部
  4. 30B 或许才是真正的“下一站”
  5. 给你的建议
A A

Liquid AI 在社交平台挂出一个投票,问大家希望下一款模型做到多大,评论区立刻兴奋起来——尤其是 100B 这个档位。但票数高不代表真的会做。真要拆开看,训练一个 100B MoE 需要的算力、显存、集群调度能力,都和“社区呼声”没有直接关系。本文整理了几个关键讨论点,帮你在期待之前先有个谱。

100B 对普通玩家意味着什么

很多人期待 100B 的原因,是它恰好卡在“个人顶级硬件”和“小规模服务器”之间的甜蜜点。评论区有用户直接点名:DGX Spark、Strix Halo 这类机器,或者 Mac Studio、RTX Pro 6000,甚至 4× RTX 3090 的常见配置,跑 100B MoE 都算比较舒服。相比之下,120B 可能就会出现显存需求暴涨的问题——有人明确说:如果真要出 100B 而不是 120B,那绝对欢迎;如果是 120B,那不如老老实实等 30B,因为自己的 64GB 内存/显存根本塞不下传说中的 78GB 需求。

投票≠承诺,社区历来如此

不少有经验的用户给这波热情泼了冷水。一个高赞观点是:投票只是看大家想要什么,并不代表 Liquid AI 已经立项了。训练 2B–5B 和训练 100B MoE 的算力需求差出几个数量级,如果公司手头没有足够的训练资源,这个投票做出来大概率也是白兴奋。也有人拿 Qwen 的例子类比:阿里曾经搞过类似投票,结果每个档位票数都差不多,最后只出了 1–2 个变体——哪怕有阿里这种级别的算力,投票结果也很难预测实际发布时间表。

MoE 训练成本:有效参数不是全部

针对“为什么 100B A5B MoE 的性价比也许没那么高”这个问题,评论区有两派。一派强调理论上训练 MoE 的计算量和激活参数(active parameters)成正比,所以训练 100B A5B 跟训练 5B 稠密模型的花费差不多,还能拿到更好的长尾记忆能力。另一派则指出:训练 token 的需求量是和全局参数量(global parameter count)挂钩的,不是只跟有效参数走。而且还有 all-to-all 通信开销、batch size 下降、调度复杂度等现实损耗。说得直白一点,训练软件的难度可能比算力更让人头疼。

30B 或许才是真正的“下一站”

评论区里有一个很务实的观察:Liquid AI 已经提到“还在做 24B-A2B MoE 模型”,那 30B 档位基本等于确认了。有人甚至公开呼吁大家别把票投给小尺寸模型——因为小的反正会持续更新,不如把票投给 30B 或 100B,逼一下官方。但更接近真相的,可能是另一条评论:销售和市场团队天天画饼,“承诺整个宇宙”是他们的日常工作,最后真正交付的东西,通常比承诺小一圈。

给你的建议

如果你已经被 100B 吊起了胃口,我的建议是:先别升级硬件。在官方正式出 release note 之前,按现有硬件评估你手头任务的 baseline 是更实际的做法——比如,LFM 2.6B 在一些小任务上已经能给到非常惊喜的反馈,30B 级别的模型也足够覆盖多数日常场景。真等 100B 落地,再决定是租卡还是买机器也不迟。投票那种东西,看着热闹就得了。