a6f05ab2d5
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd) - Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py) - Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks - Fix .gitignore to track tools/ and .githooks/ - Fix git remote URL (remove plaintext token) - New wiki pages: 504 pages, 34 raw sources
4.7 KiB
4.7 KiB
categories, tags, created, source, type, aliases
| categories | tags | created | source | type | aliases | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
|
2026-06-30 | raw/向DeepSeek学习破局 | tool |
|
DSpark
一句话描述:DeepSeek 提出的大模型推理加速系统,通过将速度和连贯性拆分到独立子系统,实现 60%-85% 的推理速度提升。
基本信息
| 属性 | 值 |
|---|---|
| 机构 | DeepSeek(深度求索) |
| 论文标题 | DSpark:基于置信度调度的半自回归投机解码 |
| 年份 | 2026 |
核心创新
DSpark 的核心创新不是在"快"和"准"之间找折中点,而是将两个目标拆到独立的子系统中,各用各的最优机制[raw:向DeepSeek学习破局:43]。
传统困境
大语言模型每生成一个词,都要重新计算前面所有已写内容。回答越长,越慢[raw:向DeepSeek学习破局:37]。
为了加速,研究者发明了"投机解码":让一个快速小模型先写草稿,主模型再批量检查[raw:向DeepSeek学习破局:37]。
但草稿模型的设计有一个死结:
- 自回归方式:逐字写、每字基于前文——连贯但慢,因为逐字生成本身就是瓶颈
- 并行方式:所有候选词同时算——快但后面几个词容易前言不搭后语,因为每个位置独立预测,不知道旁边写了什么[raw:向DeepSeek学习破局:39]
看起来这是一个零和困境:要速度就得牺牲连贯,要连贯就得牺牲速度。[raw:向DeepSeek学习破局:41]
DSpark 的拆解方案
DSpark 问了一个完全不同的问题:这两个目标各自对应的下层结构是什么?[raw:向DeepSeek学习破局:43]
拆解结果:
| 目标 | 下层结构 | 子系统 | 最优机制 |
|---|---|---|---|
| 速度 | 并行计算架构 | 并行主干 | 一次性地理解上下文,计算量大,必须并行 |
| 连贯 | 序列间依赖 | 轻量串行头 | 前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45] |
接口设计:
- 串行头和并行主干只传递一个词的嵌入向量
- 不共享状态、不重新分布参数[raw:向DeepSeek学习破局:65]
- 串行头极轻:延迟开销仅占整轮的 0.2% 到 1.3%[raw:向DeepSeek学习破局:45]
性能表现
接受长度提升
- 数学:30%
- 代码:26%
- 对话:22%[raw:向DeepSeek学习破局:45]
部署到 DeepSeek-V4 线上服务后
- V4-Flash:每用户生成速度提高 60% 到 85%
- V4-Pro:每用户生成速度提高 57% 到 78%[raw:向DeepSeek学习破局:51]
0.2% 到 1.3% 的代价,换来 16% 到 30% 的提升:这个不等式是对的。[raw:向DeepSeek学习破局:67]
技术架构
并行主干
- 职责:负责速度目标
- 特征:一次性理解上下文,计算量大,必须并行
- 处理:全局语义理解,大矩阵计算[raw:向DeepSeek学习破局:45]
轻量串行头
- 职责:负责连贯性目标
- 特征:极轻量,处理局部过渡
- 处理:前一个词抽出后,给下一个词的概率分布加一点过渡偏置[raw:向DeepSeek学习破局:45]
最小接口
- 数据传递:只传递一个词的嵌入向量
- 耦合度:极低(不共享状态、不重新分布参数)[raw:向DeepSeek学习破局:65]
- 成本:仅占整轮延迟的 0.2%-1.3%
在 LLM Wiki 中的角色
DSpark 是"拆与合"思维模式的技术原型案例,展示了如何通过拆解框架制造的假互斥冲突,实现零和困境的突破。
这是一个"框架制造的冲突被拆开"的故事,而非"折中"的故事。[raw:向DeepSeek学习破局:53]
核心启发
- 不是折中:DSpark 没有在速度和连贯性之间找折中点,而是拆开了框架
- 异构机制:并行主干用 Transformer 做全局编码,串行头用低秩矩阵做局部过渡——它们解决的不是"同一件事的缩小版"[raw:向DeepSeek学习破局:77]
- 最小接口:接口越小,耦合越弱,拆分的收益越大[raw:向DeepSeek学习破局:65]
- 接受成本:拆不是免费的,关键不是零成本,而是让接口成本小到被合流后的总体增益覆盖[raw:向DeepSeek学习破局:67]
相关工具
- DeepSeek-V4 — DSpark 部署的 DeepSeek 大模型版本
- 投机解码 — DSpark 基于的传统加速技术
- 拆与合 — DSpark 实例化的思维模式
来源
所有数字/百分比/具体结论均标注
[raw:向DeepSeek学习破局:{行号}]格式。
- 向DeepSeek学习破局 — 得一录,微信公众号,2026-06-29[raw:向DeepSeek学习破局:3]