2025 年 DeepSeek R1 和 OpenAI o1/o3 的出现,标志着 LLM 从"直接回答"进入"先思考再回答"时代。这对 FDE 的部署策略、资源规划和延迟优化产生了根本性影响。
前置知识
什么是 Thinking / Reasoning 模型
传统 LLM 是 System 1 思维 (直觉式,直接生成回答)。Thinking 模型引入了 System 2 思维 (慢思考,先生成推理链,再给出最终答案)。
代表模型时间线
核心概念:Thinking 模型是怎么训练出来的
训练范式:从 SFT 到强化学习
关键训练技术
一行话: Thinking 模型不是通过更多数据训练的,而是通过"让模型自己试错 + 强化学习"训练出推理能力。
Thinking 模型对 FDE 部署的影响
影响 1:输出长度暴增
Thinking 模型: 思考过程: ~2000-8000 tokens(内部推理链) 最终答案: ~100-500 tokens 总输出: ~2100-8500 tokens
输出长度比: 20-85 倍
这对部署意味着:
影响 2:KV Cache 管理策略需要调整
各策略对比:
影响 3:流式输出需要区分 thinking 和 answer
<thinking> 嗯,这个问题涉及到...首先我需要考虑... 假设我们有一个函数 f(x),那么... 让我验证一下这个推导... 看起来是对的。 </thinking>
<answer> 答案是 42。 </answer>
API 需要支持:
// 返回的 chunks 格式: // { "choices": [{ "delta": {"role": "assistant"}, "finish_reason": null, "usage": null }] } // { "choices": [{ "delta": {"thinking": "嗯,这个问题..."}, "finish_reason": null }] } // ... (thinking 部分) // { "choices": [{ "delta": {"answer": "答案是 42。"}, "finish_reason": null }] } // { "choices": [{ "delta": {}, "finish_reason": "stop", "usage": {"prompt_tokens": 10, "completion_tokens": 2100, "thinking_tokens": 2000}}] }
影响 4:GPU 资源规划需要重新计算
传统模型(输出 200 tokens): 单 GPU 并发: ~30 请求 QPS: ~10 每请求 GPU 时间: ~3 秒 月成本(1M 请求): ~$3,000
Thinking 模型(输出 3000 tokens): 单 GPU 并发: ~5 请求(KV Cache 和计算时间都增加) QPS: ~1.5 每请求 GPU 时间: ~40 秒 月成本(1M 请求): ~$40,000
成本增加: 13 倍
Thinking 模型的部署优化策略
策略 1:异步处理 + 结果缓存
适用于:重复问题多的场景(FAQ、常见问题)
策略 2:分层推理
路由策略: - 用小型分类模型判断问题复杂度 - 或用规则:数学题/编程题 → 完整 thinking 日常对话 → 快速路径
策略 3:Thinking Token 限制 + 强制截断
策略 4:Prefill-Decode 分离(针对 Thinking 模型优化)
因此 Prefill-Decode 分离特别适合: - Prefill 节点:小 GPU 实例,处理短 prompt - Decode 节点:大 GPU 集群,处理长 decode - 两个节点独立扩缩容,Decode 节点按需增加
面试视角
常考问题
"Thinking 模型和普通模型有什么区别?"
回答框架: