Qwen3.8-27B Q6 做 agentic coding 到底行不行?实测 20 小时 60+ tokens/s

文章导读
一位本地 LLM 玩家使用 RTX 3090 + RTX 3060 双卡,在 agentic coding 场景下连续运行 Qwen3.8-27B Q6 量化模型近 20 小时,生成速度稳定在 60-63 tokens/s,并称其为“野兽”。社区反应热烈,有人追问 harness 与代码审查等工程细节,也有人分享 uncensored GGUF。本文基于该实测经历和评论讨论,整理出值得关注的速度表现、社区疑问以及复现时需要留意的检查项,供打算用本地模型做编码代理的人参考。
📋 目录
  1. A 实测:双卡跑 Qwen3.8-27B Q6
  2. B 社区在追问什么?
  3. C 想复现类似效果?先检查这几项
  4. D 社区里的其他资源
A A

Qwen3.8-27B 的 Q6 量化版本在 agentic coding 中到底行不行?最近有人在双 GPU 环境下做了近 20 小时的连续测试,给出了一个相当积极的答案,同时也引发了不少关于工程细节的追问。下面结合分享者提供的信息和社区讨论,整理成这篇文章。

实测:双卡跑 Qwen3.8-27B Q6

测试配置是 RTX 3090 搭配 RTX 3060,模型为 Qwen3.8-27B 的 Q6 量化版。分享者表示,在持续进行 agentic coding 时,生成速度稳定在 60-63 tokens/s,连续运行将近 20 小时没有出现明显掉速或崩溃。他把这个组合称作“beast”,显然对性能和稳定性都很满意。

这个速度对于本地编码智能体来说相当可观。要知道 agentic coding 通常需要短时间生成大量代码和工具调用,如果模型跑得太慢,体感就会很拖沓。分享者提到后续会专门出一个视频,详细讲解用 llama.cpp 搭配两块 GPU 的优化方法,值得关注。

社区在追问什么?

对于这类测试,大家最关心的其实不是速度本身,而是工程细节。评论区有人直接抛出了几个很具体的问题:Harness 是怎么搭的?/goal 命令是否负责处理 compaction?有没有 reviewer 或者 code quality gate 这类质量检查环节?可惜原分享者当时没有逐条回应,评论区也没有更多补充。

这些问题暴露了一个常见误区:很多人以为 agentic coding 就是跑一个 chat 模型让它写代码,但真正能自动完成任务的系统往往还需要一大堆外围组件,比如任务规划、上下文压缩、代码审查和反馈循环。速度再快,如果这些环节缺失,实际体验可能并不好。

想复现类似效果?先检查这几项

  • 量化格式:他选的是 Q6,不是 Q4 或者 Q8。如果你显存比较紧张,可以先用 Q4 跑通流程再升级到 Q6。
  • 双卡并行:RTX 3090 和 RTX 3060 显存不一样,性能也有差距,能做到 60+ tokens/s 说明 llama.cpp 的张量拆分设置得不错。建议尝试调整 --tensor-split 参数,观察不同比例下的吞吐变化。
  • 长时间稳定性:20 小时不断生成非常考验显存管理和上下文处理。如果你要跑长期任务,一定要提前测试模型在长上下文下是否会出现性能衰减或 OOM。

社区里的其他资源

评论区也不全是严肃的技术讨论。有人贴了图,也有人玩梗,甚至出现了经典的“Qwen is love”长篇调侃。另外还有用户分享了一个 Qwen3.8-27B 的 Uncensored GGUF 版本,链接暂未作展示。如果你对这种去安全对齐的变体感兴趣,可以在社区里自行查找,注意合规使用就好。

整体来看,Qwen3.8-27B Q6 在 agentic coding 上的表现值得肯定,但真正的难点还在工程化。如果你打算复现,建议先确认自己的显卡能否容纳 Q6 量化,再逐步验证上述几个环节。想要更稳的体验,可以参考分享者的计划,到时候看看完整的优化视频。