Files
llm_wiki/wiki/DSpark.md
T

124 lines
4.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
categories:
- '[[LLM Wiki]]'
tags:
- wiki
- tool
- inference-optimization
- speculative-decoding
- deepseek
created: 2026-06-30
source: '[[raw/向DeepSeek学习破局]]'
type: tool
aliases:
- DSpark
- 置信度调度的半自回归投机解码
---
# DSpark
> **一句话描述**:DeepSeek 提出的大模型推理加速系统,通过将速度和连贯性拆分到独立子系统,实现 60%-85% 的推理速度提升。
## 基本信息
| 属性 | 值 |
|
------|
-----|
| 机构 | DeepSeek(深度求索) |
| 论文标题 | DSpark:基于置信度调度的半自回归投机解码 |
| 年份 | 2026 |
## 核心创新
DSpark 的核心创新不是在"快"和"准"之间找折中点,而是**将两个目标拆到独立的子系统中**,各用各的最优机制[raw:向DeepSeek学习破局:43]。
### 传统困境
大语言模型每生成一个词,都要重新计算前面所有已写内容。回答越长,越慢[raw:向DeepSeek学习破局:37]。
为了加速,研究者发明了"投机解码":让一个快速小模型先写草稿,主模型再批量检查[raw:向DeepSeek学习破局:37]。
但草稿模型的设计有一个死结:
- **自回归方式**:逐字写、每字基于前文——连贯但慢,因为逐字生成本身就是瓶颈
- **并行方式**:所有候选词同时算——快但后面几个词容易前言不搭后语,因为每个位置独立预测,不知道旁边写了什么[raw:向DeepSeek学习破局:39]
> 看起来这是一个零和困境:要速度就得牺牲连贯,要连贯就得牺牲速度。[raw:向DeepSeek学习破局:41]
### DSpark 的拆解方案
DSpark 问了一个完全不同的问题:这两个目标各自对应的下层结构是什么?[raw:向DeepSeek学习破局:43]
**拆解结果**
| 目标 | 下层结构 | 子系统 | 最优机制 |
|------|---------|--------|---------|
| **速度** | 并行计算架构 | 并行主干 | 一次性地理解上下文,计算量大,必须并行 |
| **连贯** | 序列间依赖 | 轻量串行头 | 前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45] |
**接口设计**
- 串行头和并行主干只传递一个词的嵌入向量
- 不共享状态、不重新分布参数[raw:向DeepSeek学习破局:65]
- 串行头极轻:延迟开销仅占整轮的 **0.2% 到 1.3%**[raw:向DeepSeek学习破局:45]
## 性能表现
### 接受长度提升
- 数学:**30%**
- 代码:**26%**
- 对话:**22%**[raw:向DeepSeek学习破局:45]
### 部署到 DeepSeek-V4 线上服务后
- **V4-Flash**:每用户生成速度提高 **60% 到 85%**
- **V4-Pro**:每用户生成速度提高 **57% 到 78%**[raw:向DeepSeek学习破局:51]
> 0.2% 到 1.3% 的代价,换来 16% 到 30% 的提升:这个不等式是对的。[raw:向DeepSeek学习破局:67]
## 技术架构
### 并行主干
- 职责:负责速度目标
- 特征:一次性理解上下文,计算量大,必须并行
- 处理:全局语义理解,大矩阵计算[raw:向DeepSeek学习破局:45]
### 轻量串行头
- 职责:负责连贯性目标
- 特征:极轻量,处理局部过渡
- 处理:前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]
### 最小接口
- 数据传递:只传递一个词的嵌入向量
- 耦合度:极低(不共享状态、不重新分布参数)[raw:向DeepSeek学习破局:65]
- 成本:仅占整轮延迟的 0.2%-1.3%
## 在 LLM Wiki 中的角色
DSpark 是"拆与合"思维模式的**技术原型案例**,展示了如何通过拆解框架制造的假互斥冲突,实现零和困境的突破。
> 这是一个"框架制造的冲突被拆开"的故事,而非"折中"的故事。[raw:向DeepSeek学习破局:53]
## 核心启发
1. **不是折中**:DSpark 没有在速度和连贯性之间找折中点,而是拆开了框架
2. **异构机制**:并行主干用 Transformer 做全局编码,串行头用低秩矩阵做局部过渡——它们解决的不是"同一件事的缩小版"[raw:向DeepSeek学习破局:77]
3. **最小接口**:接口越小,耦合越弱,拆分的收益越大[raw:向DeepSeek学习破局:65]
4. **接受成本**:拆不是免费的,关键不是零成本,而是让接口成本小到被合流后的总体增益覆盖[raw:向DeepSeek学习破局:67]
## 相关工具
- [[DeepSeek-V4]] — DSpark 部署的 DeepSeek 大模型版本
- [[投机解码]] — DSpark 基于的传统加速技术
- [[拆与合]] — DSpark 实例化的思维模式
## 来源
> 所有数字/百分比/具体结论均标注 `[raw:向DeepSeek学习破局:{行号}]` 格式。
- [[向DeepSeek学习破局]] — 得一录,微信公众号,2026-06-29[raw:向DeepSeek学习破局:3]