Phase 0-2: Schema cleanup, typed relations, event-driven automation

- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd)
- Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py)
- Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks
- Fix .gitignore to track tools/ and .githooks/
- Fix git remote URL (remove plaintext token)
- New wiki pages: 504 pages, 34 raw sources
This commit is contained in:
hehaiguang1123
2026-07-01 08:05:43 +08:00
parent e544d6e04a
commit a6f05ab2d5
1067 changed files with 522992 additions and 819 deletions
+121
View File
@@ -0,0 +1,121 @@
---
categories:
- "[[LLM Wiki]]"
tags:
- wiki
- tool
- inference-optimization
- speculative-decoding
- deepseek
created: 2026-06-30
source: "[[raw/向DeepSeek学习破局]]"
type: tool
aliases:
- DSpark
- 置信度调度的半自回归投机解码
---
# DSpark
> **一句话描述**:DeepSeek 提出的大模型推理加速系统,通过将速度和连贯性拆分到独立子系统,实现 60%-85% 的推理速度提升。
## 基本信息
| 属性 | 值 |
|------|-----|
| 机构 | DeepSeek(深度求索) |
| 论文标题 | DSpark:基于置信度调度的半自回归投机解码 |
| 年份 | 2026 |
## 核心创新
DSpark 的核心创新不是在"快"和"准"之间找折中点,而是**将两个目标拆到独立的子系统中**,各用各的最优机制[raw:向DeepSeek学习破局:43]。
### 传统困境
大语言模型每生成一个词,都要重新计算前面所有已写内容。回答越长,越慢[raw:向DeepSeek学习破局:37]。
为了加速,研究者发明了"投机解码":让一个快速小模型先写草稿,主模型再批量检查[raw:向DeepSeek学习破局:37]。
但草稿模型的设计有一个死结:
- **自回归方式**:逐字写、每字基于前文——连贯但慢,因为逐字生成本身就是瓶颈
- **并行方式**:所有候选词同时算——快但后面几个词容易前言不搭后语,因为每个位置独立预测,不知道旁边写了什么[raw:向DeepSeek学习破局:39]
> 看起来这是一个零和困境:要速度就得牺牲连贯,要连贯就得牺牲速度。[raw:向DeepSeek学习破局:41]
### DSpark 的拆解方案
DSpark 问了一个完全不同的问题:这两个目标各自对应的下层结构是什么?[raw:向DeepSeek学习破局:43]
**拆解结果**
| 目标 | 下层结构 | 子系统 | 最优机制 |
|------|---------|--------|---------|
| **速度** | 并行计算架构 | 并行主干 | 一次性地理解上下文,计算量大,必须并行 |
| **连贯** | 序列间依赖 | 轻量串行头 | 前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45] |
**接口设计**
- 串行头和并行主干只传递一个词的嵌入向量
- 不共享状态、不重新分布参数[raw:向DeepSeek学习破局:65]
- 串行头极轻:延迟开销仅占整轮的 **0.2% 到 1.3%**[raw:向DeepSeek学习破局:45]
## 性能表现
### 接受长度提升
- 数学:**30%**
- 代码:**26%**
- 对话:**22%**[raw:向DeepSeek学习破局:45]
### 部署到 DeepSeek-V4 线上服务后
- **V4-Flash**:每用户生成速度提高 **60% 到 85%**
- **V4-Pro**:每用户生成速度提高 **57% 到 78%**[raw:向DeepSeek学习破局:51]
> 0.2% 到 1.3% 的代价,换来 16% 到 30% 的提升:这个不等式是对的。[raw:向DeepSeek学习破局:67]
## 技术架构
### 并行主干
- 职责:负责速度目标
- 特征:一次性理解上下文,计算量大,必须并行
- 处理:全局语义理解,大矩阵计算[raw:向DeepSeek学习破局:45]
### 轻量串行头
- 职责:负责连贯性目标
- 特征:极轻量,处理局部过渡
- 处理:前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]
### 最小接口
- 数据传递:只传递一个词的嵌入向量
- 耦合度:极低(不共享状态、不重新分布参数)[raw:向DeepSeek学习破局:65]
- 成本:仅占整轮延迟的 0.2%-1.3%
## 在 LLM Wiki 中的角色
DSpark 是"拆与合"思维模式的**技术原型案例**,展示了如何通过拆解框架制造的假互斥冲突,实现零和困境的突破。
> 这是一个"框架制造的冲突被拆开"的故事,而非"折中"的故事。[raw:向DeepSeek学习破局:53]
## 核心启发
1. **不是折中**:DSpark 没有在速度和连贯性之间找折中点,而是拆开了框架
2. **异构机制**:并行主干用 Transformer 做全局编码,串行头用低秩矩阵做局部过渡——它们解决的不是"同一件事的缩小版"[raw:向DeepSeek学习破局:77]
3. **最小接口**:接口越小,耦合越弱,拆分的收益越大[raw:向DeepSeek学习破局:65]
4. **接受成本**:拆不是免费的,关键不是零成本,而是让接口成本小到被合流后的总体增益覆盖[raw:向DeepSeek学习破局:67]
## 相关工具
- [[DeepSeek-V4]] — DSpark 部署的 DeepSeek 大模型版本
- [[投机解码]] — DSpark 基于的传统加速技术
- [[拆与合]] — DSpark 实例化的思维模式
## 来源
> 所有数字/百分比/具体结论均标注 `[raw:向DeepSeek学习破局:{行号}]` 格式。
- [[向DeepSeek学习破局]] — 得一录,微信公众号,2026-06-29[raw:向DeepSeek学习破局:3]