用模型自动配Cisco路由器的十多万字长任务做对照实验,证明vLLM推理栈里注意力后端(生成时做上下文计算的模块)、KV缓存(显存里存上下文的临时记忆)、权重量化(把模型参数压到低精度以省显存)三个环节都能让模型在没人注意的地方选错下一个字。
同一份Qwen3.6-27B权重、同一张RTX PRO 6000 Blackwell、同一段Cisco路由器配置prompt。把vLLM推理引擎的注意力后端从Triton切到FlashAttention 2,模型就输出了一个根本不存在的接口名:期望配置GigabitEthernet0/0/1.201,模型写下GigabitEthernet0/1/4,紧接着发出两条错误的show命令,整段自动化任务被带偏。这是Level1Techs论坛用户thr3e的一篇长帖里记录的具体现场,由量子位(QbitAI)整理为中文版。
thr3e的实验设置是:100k+ token的真实Agent工作流,每一步的全词表logit抓取,再以BF16作为基线,用FP64 KL散度和Top-1一致率(模型预测的最可能token是否与基线一致)做对照。同一份权重、同一台机器、同一段prompt,只在推理栈里动一个旋钮,结论是同一个模型在同一个硬件上能输出截然不同的下一token。英文社区摘录(techplanet.today)补充了背景:vLLM已经成为本地长上下文Agent的事实标准推理引擎,社区量化和NVFP4等新方案正处于大规模落地的窗口期,但"模型变笨"的抱怨普遍被归咎于prompt或微调。
vLLM在Qwen3.6-27B上暴露了三种注意力后端:FlashAttention 2、Flash Inference、Triton Attention。thr3e的对照显示,同一后端内的两次运行hidden state在比特级别完全一致,不同后端之间发散。差异不来自随机性,来自CUDA kernel里矩阵乘法和累加路径的不同实现。
具体表现是Top-1 token直接翻面:模型本来要选的那个字被另一个字顶掉,这种翻转不会被任何一次"看着差不多"的输出暴露。Cisco接口那一段是典型样本:换一个后端,模型"决定"配一个不存在的接口。这种错误对长任务下游的污染是连锁的。
thr3e把权重锁在BF16、注意力后端锁在Triton,只让KV缓存(模型在生成长文本时用来"记上下文"的显存)的精度变化。结果分三层:
这是给长上下文Agent工作流最直接的一条工程警告:在vLLM上跑Qwen类模型做长任务时,把KV缓存压到INT4是在赌任务能在短上下文内完成。
权重锁在BF16 KV缓存,thr3e跑了五套方案的横评:
| 方案 | 来源 | 精度 | 备注 |
|---|---|---|---|
| Qwen官方BF16 | Qwen | BF16 | 基线 |
| Qwen官方FP8 | Qwen | W8A8 | 官方 |
| TheHouseOfTheDude INT8 | 社区 | W8A16,channel-wise对称,无校准 | 反超 |
| NVIDIA NVFP4 | NVIDIA | NVFP4 | 长上下文翻转率近半 |
| cyankiwi AWQ INT4 | 社区 | W4A16,STEM + Agentic校准 | 压缩最狠 |
在Top-1一致率上,结果并不按"官方更稳"的直觉排序。TheHouseOfTheDude的INT8(W8A16,权重压到8bit、激活保留16bit)跑赢了Qwen官方FP8和NVIDIA官方NVFP4。
NVFP4的"垫底"成绩要回到具体路径上看:vLLM的nightly版本当时还不支持原生FP4,NVFP4在vLLM里实际跑的是Marlin内核的"仅权重W4解压缩"。这是框架和方案不匹配的故事,不是"NVIDIA方案本身失败"的故事。在88k token上下文附近,NVFP4的Top-1翻转率逼近50%,模型产出了一条错误的show run命令,正确动作是show arp。
在tensor parallel(把一个模型拆到多张显卡上同时跑)切分上,同一份BF16权重、同一台机器,TP1能完成这个Agent工具调用任务,TP2失败,TP4又成功。
thr3e没有给出机理解释,读者也最好不要替他想一个。可能的线索包括all-reduce顺序、矩阵分块累加路径差异,但这些在原帖里都只是猜测。结论是:同一份模型在同一台硬件上能完成还是搞砸同一项任务,纯看推理服务器怎么切片权重。这件事在长上下文Agent场景里需要被纳入风险评估。
这次实测是单一作者(thr3e)、单一模型(Qwen3.6-27B)、单一GPU类(RTX PRO 6000 Blackwell)下的可复现实验,没有第三方专家背书,也没有跨厂商复现。它是一扇可复现的归因窗口,不是一份行业判决书。
离开这篇时,读者可以带着这张风险表:
thr3e在Level1Techs的原帖里公开了完整的实验方法。下一步的关键节点是等独立复现,尤其是NVFP4在vLLM正式支持原生FP4之后是否还会停留在W4解压缩路径。