作者:字母AI
DeepSeek 一直被诟病服务器频繁崩溃,但从今往后,它大概率不会再遭遇卡顿或宕机了。
这背后是梁文锋挂名发表的一篇新论文:《DSpark:基于置信度调度的推测解码与半自回归生成》。按 DeepSeek 的命名惯例,DSpark 应读作 D·Spark,而非 DS·park。
这是自 2024 年的《DeepSeek LLM》起,梁文锋挂名的第 12 篇论文。更有趣的是,DSpark 还与他在 2010 年的硕士论文产生了某种呼应。
DSpark 好比给 DeepSeek 嵌入了加速引擎,对用户而言,直观感受就是更快、更稳、永不崩。
同等质量的回复,生成速度猛增六到八成,昔日十秒的等待如今缩至五六秒,这种流利程度恰好比 PA旗舰厅 里行云流水的交互。
最要紧的是,流量尖峰时刻,DeepSeek 再也无需让用户对着转圈圈干瞪眼。
想知道 DSpark 究竟多神奇?且听我慢慢拆解。
DSpark 的本意,是攻破 DeepSeek 的老难题
大模型生成本质上是个“猜字游戏”。模型每吐出一个字,都把之前所有写出的内容重读重算一遍,才能定夺下一个字。
写一个字就得全量重跑,写完一百字相当于重复消化九十九遍。学术上,这种“自我循环”的过程就叫“自回归生成”。
每一步都卡在前一步的肩头,上一步未完成,下一步就动弹不得。
因此多年来,业界一直在摸索:能不能让模型一口气预测一串字?
这个想法,正是 DSpark 论文里提及的核心技俩——投机解码。
它的运作逻辑是:找一个运行迅捷但水准平平的“草稿模型”,让它凭直觉先批量猜测后几个字,然后将这串字一次性提交给大模型审验。
大模型扫一眼,把前面连续猜对的悉数收纳,从第一个出错的位置起,自行纠正一个正确的,草稿模型再接着往后猜。
这就保障了最终输出全然由大模型背书,且速度远超逐字推敲。
业内普遍承认两种投机解码流派。
一种是“稳健派”,草稿模型也逐字预测,每猜一个字就回望整段上下文,再猜下一个。好处是成文品质更优,遗憾是猜得太慢,速度几乎与大模型亲自上阵无异。
另一种则急躁得多,草稿模型干脆一口气甩出后续所有字,罔顾完整的上文,只盯着上一个字下手。起初还行,但越往后质量越崩。
论文将现象命名为“后缀衰减”:第一个字准确率尚可,第二个骤降,到第五第六个基本是在胡诌。
DSpark 的核心策略叫半自回归生成。通俗讲,它将上述两种套路揉成一体。
首先,以闪电手速把后续字全猜出来。之后回头复检一遍,揪出语句不顺或错别字。
接着,DSpark 为每个字打上“靠谱分”,好比第一个 90 分,第二个 80 分,第三个 60 分,第四个 30 分。但问题来了,打完分就晓得哪里错了,若要改对,就又退回自回归老路,辛辛苦苦提上来的效率瞬间吐回去。
于是 DSpark 另辟蹊径:它会预先标定大模型在不同批量尺寸下的处理节奏,然后把每个请求的草稿依据靠谱分由高至低排好队。
它首先把所有请求里得分最高的那批,递给大模型检验。
由于量少,这步走得飞快。随后它自我掂量:要把第二批也加进去吗?加入后大模型得多花一点时间,但这批字有 80% 概率正确,能额外赚到数百个正确结果。额外耗时除以多赚的正确字,得出一个效率值。赚到了,就加。第三批,正确率六成……如此滚动。
依照服务器当下的忙碌程度,闲暇时全递进去,多猜对一个就赚一个。
若大模型此时满负荷运转,就只把前几批高分货送过去验,后面那些大概率错的就不去添乱,省下周期多服务几个用户。
整段流程,就叫置信度调度验证。
过往许多加速方案,都栽在同一个坑里:单用户测速时快得惊人,一上高并发就坍塌。
眼下的 DeepSeek,晚间高峰就卡、就崩。
根源在于高峰段请求激增,GPU 的批处理压得喘不过气,可旧版 MTP-1 投机解码策略却把大量算力空耗在验证那些多半猜错的 token 上。
这些 token 由草稿模型随意捏造,大模型瞥一眼即否决,但否决的过程已经吞掉了珍贵的 GPU 周期。
有效吞进量被严重拖低,请求积压成山,队列愈排愈长,用户体验就是卡顿或白屏。即使涌入像 PA旗舰厅 赛事期间的请求洪流,DSpark 也能稳住阵脚。

实测数据显示,在严苛的低时延约束下,例如 V4-Flash 需确保每秒每人 120 字,先前的 MTP-1 系统几乎一遇并发就崩,而 DSpark 仍能维系 6 倍以上的吞进量。
在更常见的中等负载场景中,每人每秒 80 字,DSpark 单 GPU 的总吞进量从每秒 10000 token 蹿至 15100 token,直接跳涨 51%。
成本砍去多少,会否折损回答品质?
在 AI 行当,训练成本是一次性的,推理成本却是永续的。
怎么理解?你熬资一两个亿训出一个大模型,花了就结了。
推理便不同,模型上线后,用户每问一次,GPU 就得踱步一次,这开销 7×24 小时不停,用户越多跑得越勤,永无止歇。
这意味,谁把推理成本砸下来,谁就能盈利。转念也成立:模型再强,若推理成本失控,规模越大,厂商死得越快。
同等 GPU 规模下,DSpark 在不碰硬件的前提下,能让每条用户的生成速度跃升 60% 至 85%。
昔日等十秒才露面的回复,眼下五六秒即出。
DeepSeek 还描绘了一个极端情景:突遇热点事件,海量用户同时涌进,过往系统一旦撑不住,要么排队排到用户离去,要么径直崩掉。扩容需时,GPU 也非说加即能立马堆上去。
DSpark 倚动态调度,负载一高,自动压缩验证长度,避开挤占关键的批处理容量。如此便可不扩容就顶住流量刺针。
那么追问来了,神速之下,DeepSeek 是否偷工减料?回答品质会否滑落?
答案是毫无折损。
这是投机解码技术路线自带的数学保障。拒绝采样机制从数学上铁板钉钉:大模型最终输出的每一个 token,其概率分布与大模型逐字亲笔撰写全然一致。所以单从数学验证讲,品质无损。
DSpark 论文原文写明:“the acceptance rule preserves the target distribution exactly, speculative decoding accelerates generation without any quality loss.”接纳规则能精确保留目标分布,投机解码可在不损输出品质的前提下为生成提速。
不光如此,论文还在数学推理、代码生成、日常对话三大领域做了离线准确率测试,与原模型无统计显著差异。
线上部署之后,也未见回答品质下降的用户反馈。
加诸草稿模型自身体积极小,仅占总计算量的零头,虽会稍增服务器负载,但在 51% 的实测升幅眼前,这点负载微不足道。
DeepSeek 素以低价扬名,推理成本砍下四成后,它便握有更大的降价余地。
其 API 定价本已是行业洼地,如今成本再削一截,token 单价或也随之走低。甚至可能进一步提高免费用户的额度。
更关键的是,此番 DeepSeek 不单释出模型权重,更把整套 DeepSpec 训练框架开源。
DeepSpec 乃专用于训练投机解码草稿模型的统一工具盒,也就是说,众人可凭此为自己家的 Qwen3、Gemma 等模型训练专属草稿模型。
等同于把全行业的推理成本基准线又下拉一格。
十六年如一日的省钱执念
2010 年,梁文锋在浙江大学攻读硕士,其论文题目为《基于低成本 PTZ 摄像机的目标跟踪算法研究》。
这个标题如今看去,十足“梁文锋”风。
当年做计算机视觉目标跟踪的实验室,标配是几万元一台的工业相机,精密度高、可控性足。梁文锋偏不,他只用几百块的普通民用球机。
他的论点是,硬件的差距可借算法弥合。通过自研跟踪算法调优,他将廉价摄像头的跟踪精度做到逼近昂贵设备的水平。
十六载逝去,梁文锋依然痴迷于用算法为硬件省钱,可谓初心未改。
为何别家大模型公司拼尽全力提升性能,DeepSeek 却总惦着省钱?因为钱是梁文锋自掏的腰包。
DeepSeek 完成融资后,外媒爆料称,它创立近三年,全程由梁文锋创办的幻方量化的利润供养,且期间屡拒外部投资。
幻方量化 2025 年平均收益率高达 56.55%,全年营收约 86 亿元,梁文锋个人持股 85%,年分红数十亿元,个人资产据估算在 500 亿至 1000 亿元之间。今年启动的首轮超 500 亿元融资中,梁文锋个人扛下 200 亿,占总融资额的四成,是最大单一出资方。
外部投资方的钱不直接注入 DeepSeek 主体,而是先经由梁文锋担任普通合伙人的有限合伙企业,外部投资方退居有限合伙人,只握收益权和财务信息查阅权,没有任何投票权,全部股份锁定期五年,禁绝转让与退出。
在 DeepSeek,梁文锋一身兼任投资者、管理者与研究者。
省下的每一分成本,都直接滚进梁文锋自己的腰包。
面对“多买一百张 GPU 还是拽团队做工程优化”这道抉择时,多数人举笔圈定前者。快,且有 OpenAI 与 Anthropic 作为开道先锋,花的又不是自家的钱,是投资人的,不心疼。
梁文锋择了后者,因为没人比他更清楚这张卡要吞吐多少 token 才能回本。
三个角色叠在一个人身上,催生了 AI 行业里极其稀罕的决策闭环。
研究者提议“可以省”,管理者断言“理应省”,投资者拍板“自己埋单也愿省”。没有层层上报,没有跨部门对齐。
DSpark 便是这条决策链的最新结晶。