过程:
- 操作系统: UBUNTU24.04
- intel 为 vllm 出了docker,这就简单多了,起码不用太多折腾了,代码:
docker pull intel/llm-scaler-vllm:0.21.0-b3.1
- DOCKER 有15个G,为了更快和更稳.... 可以尝试用win下边的 docker desktop 加上科学上网然后拽下来之后再倒到ubuntu下边吧,因为WIN下边的科学上网貌似会稳定点? 还是我个人的感觉问题? win下边的 docker desktop 下载完之后,打个包到文件里,命令行:
docker save -o D:\llm-scaler-vllm-b3.1.tar intel/llm-scaler-vllm:0.21.0-b3.1
-
下载大模型文件到相应地址,这个不多谈。
-
部署配置
ZE_AFFINITY_MASK="**1,2**" vllm serve \
--port 8989 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.9 \
--max-num-batched-tokens 8192 \
--max-model-len **65536** \
--block-size 64 \
--dtype float16 \
--model models/LLM/Qwen3.8-27B-Uncensored-FP8 \
--served-model-name Qwen3.8-27B-FP8 \
--tensor-parallel-size 2 \
--quantization fp8 \
--enforce-eager \
--trust-remote-code \
--enable-prefix-caching \
--enable-auto-tool-choice \
**--tool-call-parser qwen3_coder \
--reasoning-parser qwen3**
之后就直接起来了。
这里的标粗部分的解释:
1,2 这是说用哪张卡,是从0号开始,所以显示我用的第2、3张。
max-model-len 这个数值,如果弄的比较小,比如40K,那可能敏捷些,但用hermess 这些agent 的话,可能会‘拒绝服务’ 。综合试着,先这个64K吧,后续如果把图片反推/视频反推等功能用起来之后再加大到128K。
- 下午一直在忙,同时进行着几个业务,既然只剩下电费钱了,索性放开吧:3台局域网内的电脑 每一台都开着 codex/opencode,其中两台还开着 hermess 和 workbuddy ,全部都在跑着任务。我把这些全部都配置上局域网内的这个QWEN3.8-27B的API了,同时,我还用hermes 调用着 remotion 在调整视频。 下边是我从微信上让hermes 来返回的数据截图

调用着 remotion 的截图

我的机器的截图

另外!! 机器太吵了,为了降低噪音,我像老特一样,限制了频率只有80%。以上是8成的频率跑出来的数据。
说说使用感受: 比ds4flash 速度慢。 智商不够,但反应速度和智商我个人觉得完全满足了我本地调用的这些需求了。 如果要‘创造型’或者更深推理型的需求,那还是别难为自己, DSV4哪怕是PRO 也没几个钱的。 大家也看到了我部署的是什么模型,其实我只是想搞一个可以完全离线的本地可以肆无忌惮的模型测试一下而已。纯粹学术研究~~
另外就是.... 最近听说有个可以离线运行的桌面陪伴女友.... 代码我好像有来着。不知道本地运行咋样....
文自@sirwang:lcz/m.e/topic/1293/%E4%B8%A4%E5%BC%A0intel-b70-%E5%85%B164g%E6%98%BE%E5%AD%98-vllm-%E9%83%A8%E7%BD%B2-qwen3.8-27b-fp8-%E7%9A%84%E8%BF%87%E7%A8%8B%E5%8F%8A%E6%95%B0%E6%8D%AE/2 【128KB上下文】 大牛给了我新的代码, 直接FP8下边128K的上下文。3条线也可以满128K的上下文了....技术好,果然可以为所欲为.....
export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=1
vllm serve \
--port 8000 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.90 \
--max-num-batched-tokens 8192 \
--max-model-len 131072 \
--block-size 64 \
--dtype float16 \
--api-key "ww@lw" \
--model models/LLM/Qwen3.8-27B-Uncensored-FP8/ \
--served-model-name Qwen3.8-27B-FP8 \
--tensor-parallel-size 2 \
--quantization fp8 \
--enforce-eager \
--trust-remote-code \
--enable-prefix-caching \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--limit-mm-per-prompt image=4,video=1 \
> vllm-qwen3.8-27b.log 2>&1 &