本周精选
发布
vLLM v0.30.0 发布
新增 Fast Start 权重缓存与 DeepSeek V4.1-Flash 支持。
- 为什么重要:
- 引擎重启可经 CUDA IPC 直接映射量化后权重(--load-format ipc_cache),免磁盘重载,大规模部署的冷启动与弹性伸缩成本显著下降;762 个 commit 还带来 HiSparse 主机内存稀疏 MLA 分层解码与 Elastic EP。
- 与端侧/边缘部署的关联:
- 新增 DeepSeek V4 CPU 后端(AVX512/AMX 稀疏 MLA),无 GPU 的 x86 服务器推理多一个选项。
来源:GitHub vLLM Releases
发布
Claude Opus 5.5 发布
性能对标上代旗舰,官方称典型负载成本降 40%。
- 为什么重要:
- 官方称典型负载成本较上代降 40%,定价随之调整:$4/$20 每百万 token,cache read 较上代降 60% 至 $0.20,生成速度快 30% 以上。闭源前沿首次把“单位智能推理成本”当核心卖点,同日 OpenAI 以两款更便宜的 GPT-6 跟进——前沿推理价格战成型。
- 与端侧/边缘部署的关联:
- 与端侧部署无直接关系。
来源:Anthropic 官方博客
发布
DeepSeek V4.1-Flash 解析
552B 总参数,prefill 仅激活 8B,KV cache 降 75%。
- 为什么重要:
- 新 Causal Encoder-Decoder 架构证明“激活参数而非总参数决定推理成本”:prefill 激活 8B,对比 Qwen3.8-Max 的 95B;缓存命中价 $0.003/百万 token,对 Agent 负载是数量级变化。发布 4 天即强制切换 V4-Pro 全部流量,也暴露了 API 依赖方的新型供应商风险。(官方公告发于 9 月 9-10 日,本周进入实测与迁移讨论期。)
- 与端侧/边缘部署的关联:
- KV cache 约为上代 1/4,拉低了自托管的显存门槛。
来源:Tech Insider 深度对比
观点
开放模型推理量一年 80 倍
OpenRouter 开放模型周推理量约 80T token,中国模型超八成。
- 为什么重要:
- Nathan Lambert 判断开源权重已过商业可行性拐点:开放与闭源前沿能力差距仅 2-5 个月,推理平台(Together、Fireworks、OpenRouter 等)是开放模型经济的第一批赢家。
- 与端侧/边缘部署的关联:
- 自托管与第三方推理的需求结构被数据证实为长期趋势,与本地部署生态密切相关。
来源:Interconnects / Nathan Lambert
论文
WavePP:流水线前缀复用
前缀复用场景 prefill 吞吐最高提升 2.91 倍。
- 为什么重要:
- 基于 TensorRT-LLM 的 prefill 运行时:跨 pipeline stage 异步匹配可复用前缀、动态规划 chunk 大小。GLM 5.2 / MiniMax M2.7 上 40 组配置 37 组提升;Kimi K3 并发 ≥8 的 18 组配置全部优于 TRT-LLM / SGLang / vLLM 基线。
- 与端侧/边缘部署的关联:
- 端侧影响:无。
来源:arXiv 2609.35263
论文
DPS:双精度弹性推理
KV 紧张时降权重量级换缓存,吞吐升 2.1-3.3 倍。
- 为什么重要:
- 把权重显存变成弹性资源:正常负载跑全精度,KV 压力大时切换嵌套低精度变体,腾出的显存转给 KV cache;保持 FP16 级精度同时 effective pass@1 最高 +41pp。基于 vLLM 实现,覆盖 dense 与 MoE 模型。
- 与端侧/边缘部署的关联:
- 对显存受限环境(单卡、小集群)值得借鉴。
来源:arXiv 2609.34380
工具
transformers 原生加载 GGUF
AutoModelForCausalLM 直接加载 llama.cpp 量化模型。
- 为什么重要:
- GGUF 从 llama.cpp 专属格式变成 Hugging Face 生态一等公民,研究与部署工具链进一步合流,量化模型的评测与二次开发门槛明显降低。
- 与端侧/边缘部署的关联:
- 端侧量化模型进入主流训练/评测流程的摩擦直接减少。
来源:r/LocalLLaMA 讨论(多聚合源交叉验证)
论文
多智能体 KV 卸载修复
并发 Agent 的 KV offload 建模,重算 token 减少 93%。
- 为什么重要:
- EfficientAgent 解释了多智能体并发下 KV offload“时灵时不灵”的原因:用 stack-distance 模型估算 agent 池的复用工作集来定 host 层容量;SWE-bench Verified 编码智能体上端到端时间降 39%,代码开源。
- 与端侧/边缘部署的关联:
- 非端侧话题,面向主机内存分层。
来源:arXiv 2609.33762
工具
prompt lookup 草拟提速 42 倍
llama.cpp n-gram 投机解码草拟延迟 165µs 降至 3.98µs。
- 为什么重要:
- Hayder Tirmazi 的 fork 把 prompt lookup 草拟路径提速 42 倍、内存省 62%;但增益集中在重复 prompt(如共享 system prompt)场景,代码因流程问题暂未合并上游。
- 与端侧/边缘部署的关联:
- 端侧 llama.cpp 用户可关注,合并上游前不建议生产依赖。
来源:r/LocalLLaMA 讨论(多聚合源交叉验证)
工具
LFM2.5-VL 边缘投机解码
280M drafter 给 3B VLM 解码提速最高 3.13 倍。
- 为什么重要:
- Liquid AI 给视觉语言模型配仅 +8.9% 参数的投机解码 drafter,Apple Silicon 解码最高 3.13×、输出分布无损,已进 llama.cpp / MLX-VLM / SGLang。但端到端只有 1.56-2.62×——瓶颈在 vision encoder 与 prefill,教科书级 Amdahl 定律案例。
- 与端侧/边缘部署的关联:
- 为端侧 VLM 部署量身打造,实测数字可用于选型。
来源:Liquid AI 官方博客