Files
llm_wiki/wiki/DSpark.md
T
hehaiguang1123 a6f05ab2d5 Phase 0-2: Schema cleanup, typed relations, event-driven automation
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd)
- Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py)
- Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks
- Fix .gitignore to track tools/ and .githooks/
- Fix git remote URL (remove plaintext token)
- New wiki pages: 504 pages, 34 raw sources
2026-07-01 08:05:43 +08:00

4.7 KiB
Raw Blame History

categories, tags, created, source, type, aliases
categories tags created source type aliases
LLM Wiki
wiki
tool
inference-optimization
speculative-decoding
deepseek
2026-06-30 raw/向DeepSeek学习破局 tool
DSpark
置信度调度的半自回归投机解码

DSpark

一句话描述:DeepSeek 提出的大模型推理加速系统,通过将速度和连贯性拆分到独立子系统,实现 60%-85% 的推理速度提升。

基本信息

属性
机构 DeepSeek(深度求索)
论文标题 DSpark:基于置信度调度的半自回归投机解码
年份 2026

核心创新

DSpark 的核心创新不是在"快"和"准"之间找折中点,而是将两个目标拆到独立的子系统中,各用各的最优机制[raw:向DeepSeek学习破局:43]。

传统困境

大语言模型每生成一个词,都要重新计算前面所有已写内容。回答越长,越慢[raw:向DeepSeek学习破局:37]。

为了加速,研究者发明了"投机解码":让一个快速小模型先写草稿,主模型再批量检查[raw:向DeepSeek学习破局:37]。

但草稿模型的设计有一个死结:

  • 自回归方式:逐字写、每字基于前文——连贯但慢,因为逐字生成本身就是瓶颈
  • 并行方式:所有候选词同时算——快但后面几个词容易前言不搭后语,因为每个位置独立预测,不知道旁边写了什么[raw:向DeepSeek学习破局:39]

看起来这是一个零和困境:要速度就得牺牲连贯,要连贯就得牺牲速度。[raw:向DeepSeek学习破局:41]

DSpark 的拆解方案

DSpark 问了一个完全不同的问题:这两个目标各自对应的下层结构是什么?[raw:向DeepSeek学习破局:43]

拆解结果

目标 下层结构 子系统 最优机制
速度 并行计算架构 并行主干 一次性地理解上下文,计算量大,必须并行
连贯 序列间依赖 轻量串行头 前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]

接口设计

  • 串行头和并行主干只传递一个词的嵌入向量
  • 不共享状态、不重新分布参数[raw:向DeepSeek学习破局:65]
  • 串行头极轻:延迟开销仅占整轮的 0.2% 到 1.3%[raw:向DeepSeek学习破局:45]

性能表现

接受长度提升

  • 数学:30%
  • 代码:26%
  • 对话:22%[raw:向DeepSeek学习破局:45]

部署到 DeepSeek-V4 线上服务后

  • V4-Flash:每用户生成速度提高 60% 到 85%
  • V4-Pro:每用户生成速度提高 57% 到 78%[raw:向DeepSeek学习破局:51]

0.2% 到 1.3% 的代价,换来 16% 到 30% 的提升:这个不等式是对的。[raw:向DeepSeek学习破局:67]

技术架构

并行主干

  • 职责:负责速度目标
  • 特征:一次性理解上下文,计算量大,必须并行
  • 处理:全局语义理解,大矩阵计算[raw:向DeepSeek学习破局:45]

轻量串行头

  • 职责:负责连贯性目标
  • 特征:极轻量,处理局部过渡
  • 处理:前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]

最小接口

  • 数据传递:只传递一个词的嵌入向量
  • 耦合度:极低(不共享状态、不重新分布参数)[raw:向DeepSeek学习破局:65]
  • 成本:仅占整轮延迟的 0.2%-1.3%

在 LLM Wiki 中的角色

DSpark 是"拆与合"思维模式的技术原型案例,展示了如何通过拆解框架制造的假互斥冲突,实现零和困境的突破。

这是一个"框架制造的冲突被拆开"的故事,而非"折中"的故事。[raw:向DeepSeek学习破局:53]

核心启发

  1. 不是折中:DSpark 没有在速度和连贯性之间找折中点,而是拆开了框架
  2. 异构机制:并行主干用 Transformer 做全局编码,串行头用低秩矩阵做局部过渡——它们解决的不是"同一件事的缩小版"[raw:向DeepSeek学习破局:77]
  3. 最小接口:接口越小,耦合越弱,拆分的收益越大[raw:向DeepSeek学习破局:65]
  4. 接受成本:拆不是免费的,关键不是零成本,而是让接口成本小到被合流后的总体增益覆盖[raw:向DeepSeek学习破局:67]

相关工具

来源

所有数字/百分比/具体结论均标注 [raw:向DeepSeek学习破局:{行号}] 格式。