在大模型预训练动辄数百万美元的时代,用 250 美元能做出什么?有人真的做了:以 Kimi K3 为架构模板,训练了一个 1.02B 参数的小模型,只见过 50 亿个 token,HellaSwag 得分 33.4%,直接超过了 GPT-2 124M 的 28%。这个结果本身不惊人,但它证明了架构的价值——小模型也能验证大模型的设计思路。
实验核心:复现的不是参数,而是架构
这个 1.02B 模型并不是简单缩小版的 K3,它保留了许多关键设计:
- 使用 Kimi Delta Attention、Gated MLA、Attention Residuals
- LatentMoE 配合无 aux-loss 的 balancer
- 沿用 K3 的激活函数和两个常数
- 直接使用 K3 的 163,840 token tokenizer(未做修改)
模型总量 1.02B 参数,每个 token 激活 145M 参数,大约是 K3 总规模的 1/2000。训练数据是 5,000,003,584 个去污 token,没有做 instruction tuning,只做 next token prediction。
训练成本:250 美元到底花在哪
很多人在评论区问:这 250 美元是租云 GPU 还是本地算力?作者没有明确回答,但提到自己后续拿到了 5000 美元 funding,准备继续扩大规模。从上下文看,250 美元大概率是云服务上租卡跑的——训练 5B tokens 级别的小模型,用消费级显卡几天也能跑完,但更可能的是按小时租云。
结果与对比:33.4% HellaSwag 怎么解读
模型在 HellaSwag 上达到 33.4%,高于 GPT-2 124M 的 28%,但远低于当前主流模型。HellaSwag 是一个常识推理基准,33.4% 说明模型学到了一些模式,但距离“实用”还很远。评论区也有人指出:如果模型没有做指令微调,那么它只会做 next token prediction,聊天时可能表现得像“神经多样化的猩猩”(原文用了一个比较幽默的比喻)。
一个被尖锐指出的问题:训练数据不够
有一条评论非常技术性:按照 Chinchilla 缩放法则,1 个参数应该看到约 20 个 token。这个模型 1.02B 参数只看到 5B tokens,相当于每个参数只看到 5 个 token,比建议值少了 4 倍。评论者自己有 220M 参数模型,用了 4.5B tokens,HellaSwag 31.4%(n=400),虽然数据偏代码,但验证了数据配比的重要性。
所以这里有个矛盾:模型虽然用了 K3 的架构,但训练量远远不足。如果能把模型缩小 60% 并把数据集扩大 3-4 倍,可能得到更实际的模型。这个观点很有价值,提醒我们:架构只是维度之一,算力和数据才是瓶颈。
社区反应与下一步:从 1B 到 35B 的现实路径
评论区有几种典型反馈:
- 有人建议“现在做一个 35B A3B 版本,打败 Qwen3.8 27B,然后就可以退休了”
- 作者回应已获 5000 美元资金,打算继续推进,欢迎有兴趣的人联系
- 有人好奇 5000 美元的资助从哪来
- 作者还提到自己在 Modal 上用 8 张 B300 托管了整个 2.8T 参数的 K3 模型,并且把这个过程也分享了出来
另外也有人建议基于 K3 做 autonomous RL,利用大模型作为 teacher,听起来是个有趣的方向。
实操建议:如果你也想自己搞
结合这次实验和评论区讨论,可以整理出几条实在的建议:
- 先想清楚是验证架构还是做实用模型。验证架构的话,1B 参数、10B tokens 以下就足够;做实用模型则要准备更多数据。
- 数据配比必须认真设计。最好参照 Chinchilla 法则,并考虑自己的数据构成,代码占比太高会影响对话能力。
- 没有预算的话,可以先从 60-200M 参数的小模型开始,几百 GPU 小时就能跑完,HellaSwag 往往也能到 30% 左右。
- 别指望低成本模型能直接聊天。预训练只是第一步,指令微调和 RL 才能让模型“可用”。
- 把训练日志和脚本公开,如果你有这个勇气的话。这次实验的作者分享了完整教程,也是社区除结果外最大的收获。
250 美元买不到 K3,但能买到一个对 K3 架构的直观理解。实验本身不完美,但至少它把“复现大模型架构”这件事从神坛上拉了下来。