AIDEEPAI 深度拆解
← 全部拆解
· DeepSeek(深度求索)联合北京大学decode

DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架

原文:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark

DeepSeekDSpark推测解码推理加速北京大学开源V4效率优先推理成本
DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架 配图 1

6 月 27 日 DeepSeek 放出 DSpark 时,社交媒体第一波转发把它当成了“V4 的新版本”。这是个理解错误,而且错得很说明问题。DeepSeek 自己在 Hugging Face 的模型卡片上写得很直白:“DeepSeek-V4-Pro-DSpark 不是一个新模型,它是同一个权重外挂了一个推测解码模块。”

也就是说,模型的脑子一个参数没动。变的只有一件事:同样一句回答,吐字速度快了 60% 到 85%。一个公司发了个东西,让旗舰模型快了将近一倍,却特意强调“这不是新模型、智商没变”——这件事本身比那个 85% 更值得拆。

它优化的是账单,不是智商

要看懂 DSpark,先要看懂大模型回答时到底慢在哪。

今天的语言模型是一个字一个字往外蹦的(行话叫自回归生成 autoregressive)。它写第十个字之前,必须先把前九个字都生成完、再读一遍,才能算出第十个字该是什么。这个“必须一个接一个”的顺序,是天生的瓶颈:哪怕你的显卡算力还有大把富余,它也只能干等着上一个字出来。

推测解码(speculative decoding)就是冲着这个瓶颈去的,原理一句话就能讲清:找个又小又快的“草稿模型”先一口气猜出后面五个字,再让又大又准的“正式模型”一次性批量检查这五个字——对的直接收下,错的从第一个错的地方掐掉重来。关键在于,检查五个字和生成一个字,对大模型来说花的力气差不多(都是一次前向计算),但如果草稿猜对了四个,你就用一次的成本换来了四个字。MarkTechPost 把这套验证机制说得更准:大模型“接受最长的合法前缀,再附送一个 token”,而且数学上可以证明,最终吐出来的字和不用这套机制时一模一样。

这就是为什么 DeepSeek 反复强调“质量无损”。推测解码省的是算力,不是精度——草稿模型猜错了就丢掉,绝不会把错的字塞给你。所以 DSpark 不是把 V4 变聪明了,而是让它在不变聪明的前提下,把那些“反正要被丢掉的字”上浪费的显卡时间省了出来。

它优化的是你的账单,不是模型的智商。这个区分不是文字游戏,它决定了你该怎么看待那串性能数字。

DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架 配图 2

两个真正的新东西

推测解码不是 DeepSeek 发明的,Google 和学界几年前就有了。DSpark 真正自己加的东西有两个,都在解决“草稿模型猜得不够准”这个老毛病。

第一个叫半自回归(semi-autoregressive)。过去的草稿模型分两派:一派老老实实一个字一个字猜,准但慢,等于没解决瓶颈;另一派一口气并行猜五个字,快但越往后越不准——因为它猜第五个字时根本没看到前四个字,纯靠蒙。DSpark 的做法是把两派缝在一起:用一个并行的主干网络(在自家此前的 DFlash 上改的)一次性把五个字的初稿都打出来,再挂一个很轻的“串行小模块”,逐个字地把“前面已经定下来的字”这条信息补回去。东方财富援引论文的说法是,并行主干“一次性产出全部候选位置的隐藏状态和基础 logits,随后由一个轻量级顺序模块逐 token 注入前缀依赖信息”。效果是草稿靠后位置的命中率不再断崖式下跌。论文给的数字:被采纳的草稿长度比学界的 Eagle3 方案高 26% 到 31%,比自家旧的 DFlash 高 16% 到 18%。

第二个叫置信度调度(confidence scheduling),这个更工程、也更聪明。模型里加了一个“置信度头”,专门给草稿里每个字打分,估计它有多大概率被正式模型收下。然后一个“硬件感知调度器”看着显卡的忙闲来动态决定一次猜几个字:显卡闲着,就多猜几个字赌一把(反正算力不花白不花);显卡满载、用户排队,就少猜、稳住延迟。DeepSeek 还给这个打分做了校准,把预测的“置信度”和实际命中率之间的误差从 3%-8% 压到了大约 1%——打分准了,赌才赌得对。

这两个东西合起来,才是 DSpark 区别于一个普通推测解码实现的地方:它不只是猜得更准,还知道在什么硬件状态下该赌多大。生产环境里跑的是叫 DSpark-5 的配置——一次猜五个字、配 Markov 头。

DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架 配图 3

那串吓人的数字,要分场合读

DeepSeek 报的提速数字横跨一个很大的区间:单用户生成速度提升 60% 到 85%(V4-Flash)、57% 到 78%(V4-Pro),到了吞吐量这一栏甚至冒出来 406%、661%。后面两个数字被不少标题党直接拎出来当主标题,但它们有严格的前提。

吞吐量提升随服务承诺(SLA)收紧而放大,这是关键。新浪援引的数据:V4-Flash 在“保证每个用户至少 80 字/秒”的标准下,总吞吐量比旧基线高 51%;可一旦把标准提到“保证 120 字/秒”,提升就窜到 661%。V4-Pro 同理,35 字/秒标准下是 52%,50 字/秒标准下是 406%。

这不矛盾,但需要翻译成人话:在正常负载下,DSpark 大概给你 50% 上下的吞吐红利;那些三四百、六百多的数字,只出现在你对速度要求极其苛刻、苛刻到旧方案根本扛不住、几乎要趴下的临界点上——这时候不是 DSpark 突然神了,是旧基线先崩了,对比的分母塌了。kingy.ai 的解读说得克制:那些头部数字“只出现在严苛 SLA 区间,老基线撞到运营边界的地方,不是普适的提速承诺”。

读懂这一点,比记住 85% 这个数更有用。任何推理优化报告里出现成倍数字,第一反应都该是去问:对比的基线是什么?在什么负载下测的?DSpark 这里两个答案都不漂亮——对比基线 MTP-1 是 DeepSeek 自家此前的生产方案,测试也是自家做的。

DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架 配图 4

把护城河挖了又填平

最值得琢磨的不是技术,是 DeepSeek 选择把它开源。

推理加速这种东西,本可以是纯私有的竞争优势。同样的模型、同样的显卡,谁能多服务一倍用户,谁就能把 API 价格压得更低、利润率做得更高。这是实打实的成本护城河,捂着不放才符合直觉。DeepSeek 反着来:连同 DSpark,把 DFlash、Eagle3 三种草稿模型的训练代码、评估脚本、模型权重,一起塞进一个叫 DeepSpec 的仓库,MIT 协议放出来——别人可以照着给自己的模型训一套同样的加速器。

这和 DeepSeek 从 V3、R1 一路下来的打法是一条线。它的核心叙事从来不是“我的模型最聪明”,而是“我用更省的工程把同样的智能做得更便宜”。DSpark 是这个叙事在推理层的又一次落地,而开源是这个叙事的放大器:当性价比是你的主张,把降本的方法公开,等于把整个行业的成本基线往下拽,而你站在自己挖的那条沟的最前面。kingy.ai 那句话点到了要害——“AI 竞赛已经不只是比谁训出最大或最聪明的模型,也是在比谁能在生产规模上把智能服务得更快、更稳、更便宜。”

参数竞赛还在打,但 DeepSeek 用 DSpark 提醒了一件事:模型炼出来只是上半场,怎么把它便宜地端到几百万人面前,是同样硬核、而且更快能变成钱的下半场。

DeepSeek 的 DSpark:一个让 V4 快 85% 却一字未改其智商的框架 配图 5

盲区:我们不知道的

北大的具体角色没核清。多家中文财经媒体一致写“联合北京大学”,但 Hugging Face 卡片和英文报道里都没提北大,论文署名也没逐一核到,所以这次合作里北大出了什么、占多大分量,目前是空的。

那串性能数字缺独立复现。所有提速数据都是 DeepSeek 自家测、对比自家旧基线 MTP-1。推测解码本身数学无损这点可信,但具体的提速倍数在别人的硬件、别人的负载上能不能重现,要等第三方跑过才算数。

还有一个边界值得说清:推测解码的红利不是均匀的。它对那种“下一个字很好猜”的内容(套话、代码模板、格式化输出)特别有效,草稿命中率高;对真正高熵、需要模型现场推理的硬内容,草稿猜不准、被丢得多,提速会缩水。论文里离线对话接受率能调到 95.7%,数学推理只有 92.5%,已经露出这个梯度。你的实际任务越“意外”,拿到的加速越接近区间下沿,而不是那个 85%。

对 AI 从业者意味着什么

如果你在用 DeepSeek API 或自己部署 V4:这是成本侧的直接利好,不需要改任何提示词或业务逻辑。同样的预算、同样的卡,要么服务更多并发,要么让现有用户体感更快,回答质量一字不变。它不会让你的产品更聪明,但会让它更便宜或更跟手——在 to C 的实时交互场景(聊天、补全、语音),吐字快一倍是能被用户直接感知的差异。

如果你在做推理优化:DeepSpec 值得抄作业。它给的不仅是结论,还有三种草稿模型可复现的训练代码。就算你不用 DeepSeek 的模型,半自回归加置信度调度这套思路也能迁移。先想清楚你的业务里哪类输出“好猜”——那部分是推测解码红利最大的地方。

如果你在看赛道:别再只盯着谁家模型刷新了榜单。推理效率正在变成一条独立、能直接换成毛利和定价权的战线。一家公司愿意把这条战线上的方法开源,要么是它有更深的护城河不在乎,要么是它判断“把行业成本拉低”对自己利大于弊。DeepSeek 大概两者都是。

本期关键词

  • 推测解码(speculative decoding) —— 给大模型提速的一种通用手法。核心是分工:用一个又小又快的“草稿模型”先一口气猜出接下来好几个字,再让又大又准的“正式模型”一次性批量检查这几个字,对的收下、错的丢掉重来。大模型“检查一批”和“生成一个”花的力气差不多,只要草稿经常猜对,就能用一份成本换回好几个字。关键是它数学上无损——最终吐出来的内容和不用这招时完全一样,省的是算力不是精度。

  • 自回归生成(autoregressive) —— 今天主流语言模型的工作方式:一个字一个字往外吐,每写下一个字之前必须先看完前面所有字。这个“必须按顺序”的特性是天然的速度瓶颈,也正是推测解码要绕开的东西。

  • 半自回归(semi-autoregressive) —— DSpark 给草稿模型用的折中招。纯并行猜字快但越往后越不准(后面的字没看到前面的字),纯顺序猜字准但慢。半自回归是先并行把一批字的初稿都打出来,再用一个很轻的串行模块逐个把“前面定下的字”这条信息补回去,兼顾快和准。

  • 吞吐量与延迟(throughput / latency) —— 看推理系统的两个不同尺子。延迟是单个用户等回答等多久(对应“每秒吐几个字”);吞吐量是整个系统同一时间能服务多少人。DSpark 的本事是在守住延迟承诺的前提下把吞吐量做大——读它的性能数字时,必须先问“是在什么延迟标准下测的”,否则那串成倍数字会骗人。

  • SLA(服务等级承诺) —— 服务方对性能给出的硬指标,比如“保证每个用户至少 80 字/秒”。SLA 卡得越严,旧方案越吃力,DSpark 的相对优势就被放大得越夸张——那些 406%、661% 的数字就是这么来的,不是普遍提速,是在临界点上和一个快撑不住的基线比。

  • MoE(混合专家) —— DeepSeek V4 的底层架构。模型总参数很大(V4-Pro 标称 1.6 万亿),但每次回答只激活其中一小部分(约 490 亿)专家网络,相当于养了一支大军、每次只派最对口的几个人上场,用较低的实际算力撑起很大的模型容量。

引用

  1. DeepSeek-V4-Pro-DSpark · Hugging Face —— 官方模型卡片,“不是新模型”原话出处。
  2. DeepSpec · GitHub —— 官方开源仓库(DSpark / DFlash / Eagle3 训练与评估代码,MIT)。
  3. DeepSeek Releases DSpark... — MarkTechPost(2026-06-27) —— 详尽技术解读,含半自回归、置信度调度、接受率与提速数字。英文摘录“accepts the longest valid prefix and appends one bonus token, preserving output quality losslessly”译为“接受最长合法前缀并附送一个 token,无损保留输出质量”。
  4. 北大与 DeepSeek 联合开源 DSpark — 东方财富(2026-06-27) —— 北大合作与并行主干/顺序模块的中文论文转述。
  5. DeepSeek 发布 DSpark — 新浪 —— 80/120 字/秒 SLA 下的吞吐量数字出处。
  6. DeepSeek DSpark Explained — kingy.ai —— 战略角度。英文摘录“The AI race is no longer only about who can train the biggest or cleverest model. It is also about who can serve intelligence quickly, reliably, and cheaply at production scale”译文见正文。