深度学习发展简史:从感知机到 AlphaGo 的六十年
写在前面:《AI 发展简史》里提到,深度学习的爆发是"算力 + 数据 + 算法"三重奏凑齐的结果。但这三重奏不是 2012 年某天突然齐活的——它背后是神经网络整整三十年的冷板凳。这篇就把这条冷板凳到王座的路,一段段走一遍。
一、前传:感知机与第一次连接主义寒冬(1950s-1970s)
1958 年,Frank Rosenblatt 造了一台叫"感知机"的东西。它模仿神经元:输入加权求和,过个阈值就输出 1 或 0。Rosenblatt 还专门做了台硬件 Mark I Perceptron,能识别简单的印刷字母,媒体一度兴奋地宣称它"能走能看能说能写"。
这是"连接主义"的第一次露脸——别写规则,让机器自己调权重学。
但好景不长。1969 年,Minsky 和 Papert 合写了一本《Perceptrons》,用严密的数学证明了一件事:单层感知机连最简单的"异或"(XOR)都学不会。异或长这样——(0,0)→0、(1,1)→0、(1,0)→1、(0,1)→1,你拿一条直线怎么也分不开。
一本书把感知机判了死刑。经费撤了,人散了,连接主义进了第一次寒冬。整个 1970 年代,舞台让给了符号主义(也就是《AI 发展简史》第一段那些写规则的系统)。
其实多层感知机能解异或,但当时没人知道怎么训练一个多层网络——梯度怎么往回传,是个悬而未决的问题。
二、反向传播:连接主义的悄悄复活(1980s-1990s)
1986 年,Rumelhart、Hinton、Williams 发了一篇论文,把一个其实 1970 年代就有人提过的算法重新讲清楚——反向传播(Backpropagation)。
思路一句话能说清:网络输出错了,把误差从输出层往回算,一层层算出每个权重该往哪个方向调、调多少。这样多层网络就能训练了,异或问题自然解开。
连接主义复活,出了一批成果:
- LeNet-5(1998,LeCun):五层卷积网络识别手写数字,美国银行真拿它读支票,每天处理上百万张——这是神经网络第一次进生产线;
- LSTM(1997,Hochreiter & Schmidhuber):解决 RNN 记不住长序列的毛病,为后来的语音、翻译埋下种子。
但这一波没撑起"深度"。原因很现实:
| 卡点 | 现实 |
|---|---|
| 算力 | CPU 跑多层网络慢得让人怀疑人生 |
| 数据 | 没有大规模标注集,网络一深就过拟合 |
| 梯度 | 网络一深,梯度传到前面就消失成 0,学不动 |
于是 1990 年代,支持向量机(SVM)这种在小样本上又快又稳的方法压着神经网络打。第二次 AI 寒冬里,神经网络几乎只剩 Hinton、LeCun、Bengio 三个圈子在硬扛。
这三个人后来拿了 2018 年的图灵奖。评语大意是:在所有人都跑了的年代,他们没走。
三、破冰三重奏:算力 + 数据 + 算法(2006-2012)
转机是三股力量分头攒、最后凑到一起的。
1. 算力——黄仁勋押注 GPU
2007 年 NVIDIA 推出 CUDA,让 GPU 能干通用计算。GPU 本来是画游戏画面的,但它有个绝活:几千个核心并行做矩阵乘法。而神经网络的前向、反向传播,本质上就是一连串矩阵乘法。别人拿 GPU 玩游戏,Hinton 的学生拿 GPU 训网络——速度比 CPU 快几十倍。
2. 数据——李飞飞攒 ImageNet
2009 年,李飞飞团队花三年众包标注出 ImageNet:1000 类、120 万张图。当时大家都觉得"谁要这么多图",但事后看,这正是深度网络能喂饱的关键——网络深了参数多,没大数据就过拟合给你看。ImageNet 每年办挑战赛,成了深度学习的角斗场。
3. 算法——几把钥匙开几把锁
- ReLU 激活(2010):把 sigmoid 换成 max(0,x),梯度不再消失,网络终于能往深了堆;
- Dropout(2012,Hinton):训练时随机丢掉一半神经元,强迫网络别死记,过拟合被摁住;
- 逐层预训练(2006,Hinton):先用无监督方法一层层初始化,再微调——这是"深度信念网络","deep learning"这个词就是这时开始流行。
三股力量在 2012 年汇成一战。
四、AlexNet 一战成名(2012)
2012 年的 ImageNet 比赛,第二名用传统视觉方法,错误率 26.1%。Hinton 的两个学生 Krizhevsky 和 Sutskever 拿 GPU 堆了个八层卷积网络 AlexNet,错误率直接砍到 15.3%。
这是个分水岭。不是因为模型多聪明,而是因为它证明了一件事:
只要算力够、数据够、网络够深,传统视觉那套手工设计特征的做法就可以整个扔掉。
从这一年起,计算机视觉的研究范式整个换掉——没人再手工设计 SIFT、HOG 特征了,全改成堆网络。深度学习从"边缘流派"变成"主航道"。
五、视觉与序列的统治(2012-2016)
AlexNet 之后是一段狂飙期,两个方向各领风骚。
视觉:CNN 一路加深
| 年份 | 模型 | 关键创新 |
|---|---|---|
| 2012 | AlexNet | 8 层,ReLU + Dropout + GPU |
| 2014 | VGG | 16-19 层,小卷积核堆叠 |
| 2014 | GoogLeNet | 22 层,Inception 模块并行多尺度 |
| 2015 | ResNet | 152 层,残差连接,错误率 3.57%——低于人类 5.1% |
ResNet 的残差连接是个妙招:让每一层学"和输入的差"而不是"输入本身",梯度能一路畅通地传回去,网络从十几层堆到一百多层都不崩。到 2015 年,ImageNet 上机器分类已经比人眼还准。
序列:RNN/LSTM 与注意力萌芽
另一边,RNN 和 LSTM 统治了序列任务——语音识别、机器翻译、语言模型。2014 年 Sutskever 提出 Seq2Seq:一个编码器把输入序列压成一个向量,一个解码器再展开成输出序列,端到端翻译。
但 Seq2Seq 有个硬伤:不管句子多长,都压成一个固定长度的向量,信息必然丢。于是 2014 年 Bahdanau 提出注意力机制——解码时每一步都去输入序列里"挑相关的看",不用全压成一个向量。这个想法后来长成了 Transformer。
六、生成与博弈:GAN 与 AlphaGo(2014-2016)
判别任务(分类、检测)做到头之后,深度学习开始往两个新方向伸手。
GAN:让网络学会"造"
2014 年,Goodfellow 提出 生成对抗网络(GAN)。思路很巧:训两个网络,一个生成器负责造假,一个判别器负责打假,俩人对抗博弈,生成器越造越真。这是深度学习从"判别"跨向"生成"的第一步——后来那些以假乱真的换脸、AI 画图,根都在这。
AlphaGo:让公众第一次"震撼"
2016 年 3 月,DeepMind 的 AlphaGo 4:1 击败李世石。它背后是三样东西叠在一起:
- 深度神经网络评估棋局、走子;
- 强化学习:自己跟自己下几千万盘,从输赢里学;
- 蒙特卡洛树搜索:往下看几步,挑胜率高的走。
围棋长期被视为"机器下不了"的游戏——状态空间比宇宙原子还多,穷举不可能。AlphaGo 不是靠算力硬怼,是靠深度网络学到了人类说不清的"棋感"。这一战让普通公众第一次真切感到 AI"震撼",深度学习从此出圈。
七、走向 Transformer:统一架构的曙光(2017-)
2017 年,Google 那篇《Attention Is All You Need》提出 Transformer。它干了一件大事:把 RNN 那套"一个一个顺序处理"扔掉,全靠自注意力让所有位置直接互相看,于是能并行处理整条序列,训练效率起飞。
这件事的深远意义在于:在此之前,视觉用 CNN、序列用 RNN、生成用 GAN,各玩各的;Transformer 出来后,一个架构通吃——视觉有 ViT,语音有 Whisper,多模态有 CLIP,语言有 GPT。深度学习从"专精一域"走向"统一架构"。
再往后就是《AI 发展简史》第四段的故事了:GPT-3、ChatGPT、多模态、智能体。深度学习这六十年,最终汇进了大模型这条大河。
八、几点冷思考
回头看,深度学习的崛起近乎传奇,但传奇底下也有几道阴影:
- 算力依赖与能耗:从 AlexNet 到 GPT-4,模型越大、卡越多、电越费,这条路能不能持续,是个问号;
- 黑盒与可解释性:网络学会了,但说不清"为什么这么判",医疗、司法等关键场景仍难放心;
- 数据饥渴:监督学习要大量标注,标注贵、长尾领域没数据,自监督和合成数据是补丁不是解药;
- 鲁棒性:一张人眼看不出区别的对抗样本,能让分类器把熊猫认成长臂猿——深度学习的"会"很脆;
- 理论滞后:实践跑得飞快,理论却说不清为什么深网络能泛化、为什么过参数化反而不过拟合,很多事是"先跑通再解释"。
结语
感知机被判死刑那年,没人想到神经网络会回来;反向传播复活那年,没人想到它会熬三十年冷板凳;AlexNet 一战成名那年,也没人想到六年后会有 ChatGPT。
深度学习的故事其实就讲了一件事:
很多"一夜爆红"的技术,背后是几十年的冷板凳,和几个在所有人都走了的年代还没走的人。
理解了这一点,再看今天大模型、智能体的热潮,也许能多一分清醒:哪些是真趋势,哪些是泡沫,往往要看它底下有没有一条熬过来的来路。
本文写于 2026 年 10 月,承接《AI 发展简史》第二、三段。欢迎在评论区聊聊你第一次接触神经网络是什么时候。
- 点赞
- 收藏
- 关注作者
评论(0)