预算 250 美元预训练 1B 模型,K3 架构小规模验证值不值?

文章导读
一项小规模预训练实验以 250 美元复现 Kimi K3 架构,1.02B 参数、5B tokens 训练取得 33.4% HellaSwag,超越 GPT-2 124M。文章梳理了实验方法、硬件租赁与训练细节、社区对数据配比与模型规模的讨论,以及后续扩展建议。真实经验比理论更接地气,适合想低成本做预训练研究的人参考。
📋 目录
  1. A 实验核心:复现的不是参数,而是架构
  2. B 训练成本:250 美元到底花在哪
  3. C 结果与对比:33.4% HellaSwag 怎么解读
  4. D 一个被尖锐指出的问题:训练数据不够
  5. E 社区反应与下一步:从 1B 到 35B 的现实路径
  6. F 实操建议:如果你也想自己搞
A A

在大模型预训练动辄数百万美元的时代,用 250 美元能做出什么?有人真的做了:以 Kimi K3 为架构模板,训练了一个 1.02B 参数的小模型,只见过 50 亿个 token,HellaSwag 得分 33.4%,直接超过了 GPT-2 124M 的 28%。这个结果本身不惊人,但它证明了架构的价值——小模型也能验证大模型的设计思路。

实验核心:复现的不是参数,而是架构

这个 1.02B 模型并不是简单缩小版的 K3,它保留了许多关键设计:

  • 使用 Kimi Delta Attention、Gated MLA、Attention Residuals
  • LatentMoE 配合无 aux-loss 的 balancer
  • 沿用 K3 的激活函数和两个常数
  • 直接使用 K3 的 163,840 token tokenizer(未做修改)

模型总量 1.02B 参数,每个 token 激活 145M 参数,大约是 K3 总规模的 1/2000。训练数据是 5,000,003,584 个去污 token,没有做 instruction tuning,只做 next token prediction。

训练成本:250 美元到底花在哪

很多人在评论区问:这 250 美元是租云 GPU 还是本地算力?作者没有明确回答,但提到自己后续拿到了 5000 美元 funding,准备继续扩大规模。从上下文看,250 美元大概率是云服务上租卡跑的——训练 5B tokens 级别的小模型,用消费级显卡几天也能跑完,但更可能的是按小时租云。

结果与对比:33.4% HellaSwag 怎么解读

模型在 HellaSwag 上达到 33.4%,高于 GPT-2 124M 的 28%,但远低于当前主流模型。HellaSwag 是一个常识推理基准,33.4% 说明模型学到了一些模式,但距离“实用”还很远。评论区也有人指出:如果模型没有做指令微调,那么它只会做 next token prediction,聊天时可能表现得像“神经多样化的猩猩”(原文用了一个比较幽默的比喻)。

一个被尖锐指出的问题:训练数据不够

有一条评论非常技术性:按照 Chinchilla 缩放法则,1 个参数应该看到约 20 个 token。这个模型 1.02B 参数只看到 5B tokens,相当于每个参数只看到 5 个 token,比建议值少了 4 倍。评论者自己有 220M 参数模型,用了 4.5B tokens,HellaSwag 31.4%(n=400),虽然数据偏代码,但验证了数据配比的重要性。

所以这里有个矛盾:模型虽然用了 K3 的架构,但训练量远远不足。如果能把模型缩小 60% 并把数据集扩大 3-4 倍,可能得到更实际的模型。这个观点很有价值,提醒我们:架构只是维度之一,算力和数据才是瓶颈。

社区反应与下一步:从 1B 到 35B 的现实路径

评论区有几种典型反馈:

  • 有人建议“现在做一个 35B A3B 版本,打败 Qwen3.8 27B,然后就可以退休了”
  • 作者回应已获 5000 美元资金,打算继续推进,欢迎有兴趣的人联系
  • 有人好奇 5000 美元的资助从哪来
  • 作者还提到自己在 Modal 上用 8 张 B300 托管了整个 2.8T 参数的 K3 模型,并且把这个过程也分享了出来

另外也有人建议基于 K3 做 autonomous RL,利用大模型作为 teacher,听起来是个有趣的方向。

实操建议:如果你也想自己搞

结合这次实验和评论区讨论,可以整理出几条实在的建议:

  1. 先想清楚是验证架构还是做实用模型。验证架构的话,1B 参数、10B tokens 以下就足够;做实用模型则要准备更多数据。
  2. 数据配比必须认真设计。最好参照 Chinchilla 法则,并考虑自己的数据构成,代码占比太高会影响对话能力。
  3. 没有预算的话,可以先从 60-200M 参数的小模型开始,几百 GPU 小时就能跑完,HellaSwag 往往也能到 30% 左右。
  4. 别指望低成本模型能直接聊天。预训练只是第一步,指令微调和 RL 才能让模型“可用”。
  5. 把训练日志和脚本公开,如果你有这个勇气的话。这次实验的作者分享了完整教程,也是社区除结果外最大的收获。

250 美元买不到 K3,但能买到一个对 K3 架构的直观理解。实验本身不完美,但至少它把“复现大模型架构”这件事从神坛上拉了下来。