Framework 推出 192GB 主板:内存够大,但带宽撑得起本地大模型吗?
Framework 官网悄然出现 192GB 内存选项,或为 Strix Halo 平台的更新款。内存容量翻倍,但带宽仍然约为 224GB/s,仅与六年前 RTX 3050 相当。有用户认为适合跑中等规模 MoE 模型,也有人直接泼冷水:预…
Framework 官网悄然出现 192GB 内存选项,或为 Strix Halo 平台的更新款。内存容量翻倍,但带宽仍然约为 224GB/s,仅与六年前 RTX 3050 相当。有用户认为适合跑中等规模 MoE 模型,也有人直接泼冷水:预…
16GB 显存跑 Qwen 3.8 27B 并保持 100K 上下文的可行方案,重点不在堆层数,而在于定制混合量化、beellama.cpp 的 kvarn KV Cache 类型,以及能压 thinking token 的 Jinja 模…
Terminal Bench 4.0 发布后,GLM-5.3 在误差范围内接近 Fable 5。围绕这份结果,有人强调“统计上不能说谁更好”,有人指出每任务成本仅 Fable 37%,但总 token 消耗更大。文章整理了关于模型一致性、评…
AI 生成内容正在淹没网络,许多读者发现越来越难分辨一段文字是真人写的还是模型生成的。一位网友回顾了自己从喜爱阅读到如今对大多数落地页和文案感到麻木的过程,并希望找到“值得读”的确定信号。讨论中有人建议回归经典、识别模型固定句式,也有人谈到…
GLM-5.3 与 GLM-5.2 共用基座,官方称编码能力提升 50%,并在 Terminal Bench 3.0、CyberGym 等评测中刷新开源权重模型 SOTA。社区讨论焦点落在许可证对大厂的高营收门槛、本地部署的硬盘与显存需求,…
在 Hugging Face 被收购、开源 AI 前景不确定的背景下,本地 AI 玩家开始重新审视真正坚持开源的团队。Unsloth 因持续为低端 GPU 提供高质量量化、超快速 GGUF,以及谦逊及时的开源维护而备受推崇。社区在感谢之余,…
一位系统管理员用“弓箭手面对步枪”来形容 AI 对技术职业的冲击,认为这行失去了挑战与成就感。同行反馈两极:被 AI 幻觉带偏、浪费时间;或靠 AI 快速定位日志问题、补全知识。还有“第一英里”比喻和认知卸载的担忧。整理真实经验,核心提醒是…
Nvidia 以约 129 亿美元收购 HuggingFace,而此前已被 HuggingFace 收编的 llama.cpp 团队,连带可能让 Nvidia 获得项目版权和核心开发者。社区担忧重点不是立即闭源,而是后续许可证变更或 ROC…
Qwen 3.8 Flash Next 的 Engram 常被误认为能把 1T 参数模型卸载到 SSD 本地运行,实际上它做不到。Engram 本质是 N-gram 嵌入表,用最近 2-3 个 token 做键查静态记忆,从而把多 toke…
有自托管用户发现,AI 辅助开发的应用正快速涌入,UI 却高度雷同,绿药丸按钮、emoji 文档、同质化设置页几乎成了模板。更让人担心的是,新项目不断带走原本维护成熟开源项目的开发者,最终老项目凋敝,新应用却缺乏长期维护。讨论中不少开发者也…
有报道称 Nvidia 正以超过 130 亿美元洽谈收购 Hugging Face,随后消息称交易已以 129 亿美元完成。围绕这笔收购,开发者们讨论了 HF 的真实价值、盈利模式以及被 Nvidia 掌控后是否可能“变质”。文章梳理了各方…
一份被删除的社交动态让社区确认:此前在 OpenCode 和 OpenRouter 上匿名测试的 ox-alpha 就是 GLM-5.3-Flash。它拥有 320B 总参数、18B 激活参数,支持多模态视觉和 1M Token 上下文,官…
模型每次发布,社区总会涌现大量讨论。最近有用户质疑强制把新模型讨论集中到单一总帖的做法,认为这扼杀了真正的交流。管理员则解释,总帖是为了应对刷屏、营销水军和版面失控。围绕 Qwen 3.8 发布时的具体案例,社区就总帖的时机、内容和可检索性…
围绕即将发布的 Qwen3.8-Flash-Next 架构,社区讨论了它的本地友好性。模型约 125B 参数、激活约 6B,包含 51B n-gram 表,理想 4-bit 量化约 82GB。由于 n-gram 表稀疏访问,可放到系统内存,…
小米发布 AI Cube 原型,采用三芯片方案:玄戒 O3、O100 与 D100。D100 面向电动车,支持 160GB 内存,而 O100 提供 1.22TB/s 内存带宽,引发关于该数字是否指 SRAM 的猜测。网友认为这是 AI 硬…
一位开发者用 Qwen3.8 27B 在本地 vLLM 上尝试将 3.9 万行 C 代码一次提示移植为单文件 HTML/three.js,结果 4 小时输出仍是废品,而云端 Opus 5 只用 21 分钟。本地模型在复杂代码移植任务上仍明显…
Liquid AI 近期在社交平台上发起了一个关于新模型规模的投票,社区里不少人期待 100B 级别的 LFM 3 出现。但冷静分析后会发现:投票并不代表官方计划,训练 100B MoE 的计算资源、显存需求和实际调度难度都是硬约束。文章梳…
Qwen 3.8 27B 在本地运行时的长耗时让很多人头疼。本文整理了相关讨论:有用户对比旧版 35B-A3B 约 120 t/s 的速度,而 27B 仅约 20 t/s,即使 35B 需要二次重试也快三倍;也有人在等待 40B/A5B 等…
开发者团队将 Qwen 3.8 27B 接入编码和 OCR 流水线后发现,其编码能力接近常用商业模型,OCR 质量甚至优于 Gemini 3.5 Flash Lite,且在复杂文档结构化提取上比传统 OCR 更高效。结合社区反馈,小型专用模…
这篇文章从一位真实玩家的经历出发,记录了从16台到36台DGX Spark的本地AI集群升级之路。作者不仅列出了完整的网络和计算配置,还解释了为什么放弃 B200/B300,转向性价比更高的 Spark 与 6000 Pro 组合。文章同时…
共 26 篇问答