从图灵测试到 Claude Opus 4.7,了解 AI 是如何一步步走到今天的。理解历史,才能判断未来。
为什么 FDE 需要了解 AI 历史
面试中不会直接考历史,但:
第一次浪潮:符号主义 AI(1950s-1970s)
起源
1950 年,图灵发表论文《Computing Machinery and Intelligence》,提出 图灵测试 :如果一台机器能够与人类进行对话,而人类无法区分它是机器还是人,那么这台机器就具有"智能"。
1956 年,达特茅斯会议首次提出 Artificial Intelligence 这一术语,标志着 AI 作为一门独立学科的诞生。
核心思想
代表性成果
第一次寒冬(1974-1980)
原因:
第二次浪潮:专家系统与连接主义萌芽(1980s-1990s)
专家系统
代表系统:
连接主义的复兴
1986 年,Rumelhart、Hinton、Williams 发表 Backpropagation 论文,提出用反向传播训练多层神经网络。
第二次寒冬(1987-1993)
第三次浪潮:深度学习(2006-2017)
关键突破
AlexNet 为什么重要
AlexNet 是第一个 真正用 GPU 训练 的深度学习模型:
GPU 的并行计算能力恰好匹配神经网络的海量矩阵运算 → 从此 GPU 成为 AI 训练和推理的标准硬件
这与 FDE 的关系:从 AlexNet 开始,AI 系统的性能优化就与 GPU 硬件深度绑定了。
RNN 的统治与局限
在 Transformer 出现之前,RNN(及其变体 LSTM、GRU)是 NLP 的主流架构:
RNN 的核心问题 :无法并行训练。序列数据必须从左到右一步步处理,这在 GPU 上是巨大的浪费。
Transformer 时代(2017-2020)
转折点:Attention Is All You Need(2017)
Google 提出 Transformer 架构,完全抛弃 RNN,只用 Self-Attention。
BERT(2018)
Google 用 Transformer Encoder 做预训练,在 11 个 NLP 任务上达到 SOTA。
GPT 系列
GPT-3 的 In-context Learning 是范式转变 :不需要微调,只需在 prompt 里给几个例子,模型就能完成任务。
大语言模型时代(2020-2023)
Scaling Law(2020)
OpenAI 发表论文,发现一个规律:
其中 a ≈ b ≈ c ≈ 0.05
结论:只要增加计算、数据、参数,性能就会稳定提升
这个发现直接推动了后续的"军备竞赛":
ChatGPT 与对齐(2022)
关键步骤: 1. 预训练(Pre-training):海量文本上学习语言模型 2. 监督微调(SFT):用人工标注的指令数据微调 3. RLHF:用人类反馈强化学习对齐输出 a. 训练 Reward Model(人类标注偏好) b. PPO 优化策略(最大化 reward)
RLHF 是 ChatGPT 成功的关键 。GPT-3 本身能力很强但"不听话",RLHF 让它能遵循指令、拒绝有害请求。
开源崛起(2023)
多模态、Reasoning 与 Agent 时代(2023-2026)
多模态大模型
Reasoning 模型革命
2025 年开始,模型从"直接回答"转向"先思考再回答":
FDE 视角 :Reasoning 模型的思考过程产生大量隐藏 token(可达最终回答的 5-10x),TTFT 和 KV Cache 成为全新优化战场。
Agent 系统
2023 年开始,研究从"模型本身"转向"如何使用模型":
FDE 视角:从历史看未来
对岗位的影响
每次技术变革带来的新优化点
单模态 → 多模态: 新优化点:图像/视频 encoder 的推理加速
单模型 → Agent: 新优化点:多轮调用的延迟优化、工具调用的缓存
这些变化意味着 FDE 的技能栈需要持续更新。
面试视角
Q: "说说 AI 发展历程中几个关键转折点?"
回答框架:
Q: "为什么 GPU 成为 AI 的标准硬件?"