← 大模型实施周报
English首页

第 1 期:单位智能的成本战

2026-09-22 ~ 2026-09-29 · 发布于 2026-09-29

本周主线是“单位智能的成本”:Anthropic 按 serving 成本给 Claude Opus 5.5 定价,DeepSeek V4.1-Flash 用激活参数效率打价格战,Interconnects 用周 80T token 的推理量论证开放模型拐点已过。系统侧,arXiv cs.DC 围绕 KV cache 的复用与分层集中产出五篇以上论文;端侧则有骁龙 8 Elite Gen 6 发布与 Liquid AI 的边缘投机解码方案落地三大推理框架。

本周精选

发布

vLLM v0.30.0 发布

新增 Fast Start 权重缓存与 DeepSeek V4.1-Flash 支持。

为什么重要:
引擎重启可经 CUDA IPC 直接映射量化后权重(--load-format ipc_cache),免磁盘重载,大规模部署的冷启动与弹性伸缩成本显著下降;762 个 commit 还带来 HiSparse 主机内存稀疏 MLA 分层解码与 Elastic EP。
与端侧/边缘部署的关联:
新增 DeepSeek V4 CPU 后端(AVX512/AMX 稀疏 MLA),无 GPU 的 x86 服务器推理多一个选项。

来源:GitHub vLLM Releases

发布

Claude Opus 5.5 发布

性能对标上代旗舰,官方称典型负载成本降 40%。

为什么重要:
官方称典型负载成本较上代降 40%,定价随之调整:$4/$20 每百万 token,cache read 较上代降 60% 至 $0.20,生成速度快 30% 以上。闭源前沿首次把“单位智能推理成本”当核心卖点,同日 OpenAI 以两款更便宜的 GPT-6 跟进——前沿推理价格战成型。
与端侧/边缘部署的关联:
与端侧部署无直接关系。

来源:Anthropic 官方博客

发布

DeepSeek V4.1-Flash 解析

552B 总参数,prefill 仅激活 8B,KV cache 降 75%。

为什么重要:
新 Causal Encoder-Decoder 架构证明“激活参数而非总参数决定推理成本”:prefill 激活 8B,对比 Qwen3.8-Max 的 95B;缓存命中价 $0.003/百万 token,对 Agent 负载是数量级变化。发布 4 天即强制切换 V4-Pro 全部流量,也暴露了 API 依赖方的新型供应商风险。(官方公告发于 9 月 9-10 日,本周进入实测与迁移讨论期。)
与端侧/边缘部署的关联:
KV cache 约为上代 1/4,拉低了自托管的显存门槛。

来源:Tech Insider 深度对比

观点

开放模型推理量一年 80 倍

OpenRouter 开放模型周推理量约 80T token,中国模型超八成。

为什么重要:
Nathan Lambert 判断开源权重已过商业可行性拐点:开放与闭源前沿能力差距仅 2-5 个月,推理平台(Together、Fireworks、OpenRouter 等)是开放模型经济的第一批赢家。
与端侧/边缘部署的关联:
自托管与第三方推理的需求结构被数据证实为长期趋势,与本地部署生态密切相关。

来源:Interconnects / Nathan Lambert

论文

WavePP:流水线前缀复用

前缀复用场景 prefill 吞吐最高提升 2.91 倍。

为什么重要:
基于 TensorRT-LLM 的 prefill 运行时:跨 pipeline stage 异步匹配可复用前缀、动态规划 chunk 大小。GLM 5.2 / MiniMax M2.7 上 40 组配置 37 组提升;Kimi K3 并发 ≥8 的 18 组配置全部优于 TRT-LLM / SGLang / vLLM 基线。
与端侧/边缘部署的关联:
端侧影响:无。

来源:arXiv 2609.35263

论文

DPS:双精度弹性推理

KV 紧张时降权重量级换缓存,吞吐升 2.1-3.3 倍。

为什么重要:
把权重显存变成弹性资源:正常负载跑全精度,KV 压力大时切换嵌套低精度变体,腾出的显存转给 KV cache;保持 FP16 级精度同时 effective pass@1 最高 +41pp。基于 vLLM 实现,覆盖 dense 与 MoE 模型。
与端侧/边缘部署的关联:
对显存受限环境(单卡、小集群)值得借鉴。

来源:arXiv 2609.34380

工具

transformers 原生加载 GGUF

AutoModelForCausalLM 直接加载 llama.cpp 量化模型。

为什么重要:
GGUF 从 llama.cpp 专属格式变成 Hugging Face 生态一等公民,研究与部署工具链进一步合流,量化模型的评测与二次开发门槛明显降低。
与端侧/边缘部署的关联:
端侧量化模型进入主流训练/评测流程的摩擦直接减少。

来源:r/LocalLLaMA 讨论(多聚合源交叉验证)

论文

多智能体 KV 卸载修复

并发 Agent 的 KV offload 建模,重算 token 减少 93%。

为什么重要:
EfficientAgent 解释了多智能体并发下 KV offload“时灵时不灵”的原因:用 stack-distance 模型估算 agent 池的复用工作集来定 host 层容量;SWE-bench Verified 编码智能体上端到端时间降 39%,代码开源。
与端侧/边缘部署的关联:
非端侧话题,面向主机内存分层。

来源:arXiv 2609.33762

工具

prompt lookup 草拟提速 42 倍

llama.cpp n-gram 投机解码草拟延迟 165µs 降至 3.98µs。

为什么重要:
Hayder Tirmazi 的 fork 把 prompt lookup 草拟路径提速 42 倍、内存省 62%;但增益集中在重复 prompt(如共享 system prompt)场景,代码因流程问题暂未合并上游。
与端侧/边缘部署的关联:
端侧 llama.cpp 用户可关注,合并上游前不建议生产依赖。

来源:r/LocalLLaMA 讨论(多聚合源交叉验证)

工具

LFM2.5-VL 边缘投机解码

280M drafter 给 3B VLM 解码提速最高 3.13 倍。

为什么重要:
Liquid AI 给视觉语言模型配仅 +8.9% 参数的投机解码 drafter,Apple Silicon 解码最高 3.13×、输出分布无损,已进 llama.cpp / MLX-VLM / SGLang。但端到端只有 1.56-2.62×——瓶颈在 vision encoder 与 prefill,教科书级 Amdahl 定律案例。
与端侧/边缘部署的关联:
为端侧 VLM 部署量身打造,实测数字可用于选型。

来源:Liquid AI 官方博客

一句话速览

本周真信号 vs 噪音

信号 “单位智能成本”成为主战场

Anthropic 按 serving 成本给 Opus 5.5 定价、DeepSeek 用激活参数效率把缓存命中价打到 $0.003、Cognition 用“贵模型指挥便宜模型”省 36% 成本——三条独立线索指向同一方向。定价与架构都在围绕推理成本重构,这会持续。

信号 KV cache 从省显存技术变成分层资产调度

本周 cs.DC 集中产出 WavePP、TempoKV、EfficientAgent、PReCache、DPS 五篇系统论文,全部围绕 KV 的复用、分层与弹性调度;驱动力是 Agent 工作负载的长前缀复用,需求刚性,不是学术热点轮动。

噪音 “N 倍加速”标题

42× 的 prompt lookup 优化只适用重复 prompt 场景且未合并上游;边缘 VLM 3.13× 解码加速端到端仅 1.56-2.62×。这类数字本身不假,但适用面远小于标题暗示——先看场景再看倍数。

值得 star / 精读

下周盯梢清单

本期内容由编辑根据公开信息源整理,所有链接均指向原始出处;如有个别信息在发布后更新,以来源页面为准。