a6f05ab2d5
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd) - Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py) - Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks - Fix .gitignore to track tools/ and .githooks/ - Fix git remote URL (remove plaintext token) - New wiki pages: 504 pages, 34 raw sources
122 lines
4.7 KiB
Markdown
122 lines
4.7 KiB
Markdown
---
|
||
categories:
|
||
- "[[LLM Wiki]]"
|
||
tags:
|
||
- wiki
|
||
- tool
|
||
- inference-optimization
|
||
- speculative-decoding
|
||
- deepseek
|
||
created: 2026-06-30
|
||
source: "[[raw/向DeepSeek学习破局]]"
|
||
type: tool
|
||
aliases:
|
||
- DSpark
|
||
- 置信度调度的半自回归投机解码
|
||
---
|
||
|
||
# DSpark
|
||
|
||
> **一句话描述**:DeepSeek 提出的大模型推理加速系统,通过将速度和连贯性拆分到独立子系统,实现 60%-85% 的推理速度提升。
|
||
|
||
## 基本信息
|
||
|
||
| 属性 | 值 |
|
||
|------|-----|
|
||
| 机构 | DeepSeek(深度求索) |
|
||
| 论文标题 | DSpark:基于置信度调度的半自回归投机解码 |
|
||
| 年份 | 2026 |
|
||
|
||
## 核心创新
|
||
|
||
DSpark 的核心创新不是在"快"和"准"之间找折中点,而是**将两个目标拆到独立的子系统中**,各用各的最优机制[raw:向DeepSeek学习破局:43]。
|
||
|
||
### 传统困境
|
||
|
||
大语言模型每生成一个词,都要重新计算前面所有已写内容。回答越长,越慢[raw:向DeepSeek学习破局:37]。
|
||
|
||
为了加速,研究者发明了"投机解码":让一个快速小模型先写草稿,主模型再批量检查[raw:向DeepSeek学习破局:37]。
|
||
|
||
但草稿模型的设计有一个死结:
|
||
|
||
- **自回归方式**:逐字写、每字基于前文——连贯但慢,因为逐字生成本身就是瓶颈
|
||
- **并行方式**:所有候选词同时算——快但后面几个词容易前言不搭后语,因为每个位置独立预测,不知道旁边写了什么[raw:向DeepSeek学习破局:39]
|
||
|
||
> 看起来这是一个零和困境:要速度就得牺牲连贯,要连贯就得牺牲速度。[raw:向DeepSeek学习破局:41]
|
||
|
||
### DSpark 的拆解方案
|
||
|
||
DSpark 问了一个完全不同的问题:这两个目标各自对应的下层结构是什么?[raw:向DeepSeek学习破局:43]
|
||
|
||
**拆解结果**:
|
||
|
||
| 目标 | 下层结构 | 子系统 | 最优机制 |
|
||
|------|---------|--------|---------|
|
||
| **速度** | 并行计算架构 | 并行主干 | 一次性地理解上下文,计算量大,必须并行 |
|
||
| **连贯** | 序列间依赖 | 轻量串行头 | 前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45] |
|
||
|
||
**接口设计**:
|
||
- 串行头和并行主干只传递一个词的嵌入向量
|
||
- 不共享状态、不重新分布参数[raw:向DeepSeek学习破局:65]
|
||
- 串行头极轻:延迟开销仅占整轮的 **0.2% 到 1.3%**[raw:向DeepSeek学习破局:45]
|
||
|
||
## 性能表现
|
||
|
||
### 接受长度提升
|
||
|
||
- 数学:**30%**
|
||
- 代码:**26%**
|
||
- 对话:**22%**[raw:向DeepSeek学习破局:45]
|
||
|
||
### 部署到 DeepSeek-V4 线上服务后
|
||
|
||
- **V4-Flash**:每用户生成速度提高 **60% 到 85%**
|
||
- **V4-Pro**:每用户生成速度提高 **57% 到 78%**[raw:向DeepSeek学习破局:51]
|
||
|
||
> 0.2% 到 1.3% 的代价,换来 16% 到 30% 的提升:这个不等式是对的。[raw:向DeepSeek学习破局:67]
|
||
|
||
## 技术架构
|
||
|
||
### 并行主干
|
||
|
||
- 职责:负责速度目标
|
||
- 特征:一次性理解上下文,计算量大,必须并行
|
||
- 处理:全局语义理解,大矩阵计算[raw:向DeepSeek学习破局:45]
|
||
|
||
### 轻量串行头
|
||
|
||
- 职责:负责连贯性目标
|
||
- 特征:极轻量,处理局部过渡
|
||
- 处理:前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]
|
||
|
||
### 最小接口
|
||
|
||
- 数据传递:只传递一个词的嵌入向量
|
||
- 耦合度:极低(不共享状态、不重新分布参数)[raw:向DeepSeek学习破局:65]
|
||
- 成本:仅占整轮延迟的 0.2%-1.3%
|
||
|
||
## 在 LLM Wiki 中的角色
|
||
|
||
DSpark 是"拆与合"思维模式的**技术原型案例**,展示了如何通过拆解框架制造的假互斥冲突,实现零和困境的突破。
|
||
|
||
> 这是一个"框架制造的冲突被拆开"的故事,而非"折中"的故事。[raw:向DeepSeek学习破局:53]
|
||
|
||
## 核心启发
|
||
|
||
1. **不是折中**:DSpark 没有在速度和连贯性之间找折中点,而是拆开了框架
|
||
2. **异构机制**:并行主干用 Transformer 做全局编码,串行头用低秩矩阵做局部过渡——它们解决的不是"同一件事的缩小版"[raw:向DeepSeek学习破局:77]
|
||
3. **最小接口**:接口越小,耦合越弱,拆分的收益越大[raw:向DeepSeek学习破局:65]
|
||
4. **接受成本**:拆不是免费的,关键不是零成本,而是让接口成本小到被合流后的总体增益覆盖[raw:向DeepSeek学习破局:67]
|
||
|
||
## 相关工具
|
||
|
||
- [[DeepSeek-V4]] — DSpark 部署的 DeepSeek 大模型版本
|
||
- [[投机解码]] — DSpark 基于的传统加速技术
|
||
- [[拆与合]] — DSpark 实例化的思维模式
|
||
|
||
## 来源
|
||
|
||
> 所有数字/百分比/具体结论均标注 `[raw:向DeepSeek学习破局:{行号}]` 格式。
|
||
|
||
- [[向DeepSeek学习破局]] — 得一录,微信公众号,2026-06-29[raw:向DeepSeek学习破局:3]
|