这本书讲什么?
三位深度学习奠基者合写的教科书,把神经网络从线性代数、概率论与数值计算讲起,一直推到卷积网络、循环网络、正则化与生成模型。它不追求覆盖面,而是坚持一条原则:先理解数学结构,再理解为什么某些结构在实践中有效。
为什么值得读?
当“深度学习”被简化成调参和堆算力时,这本书提醒你这门技术建立在什么之上:可微分的表示、梯度的传播与统计估计的边界。它的价值在于让你知道模型的假设在哪里,因而知道它会在哪里失败。
核心思想
- 深度学习的核心是把输入逐层变换为更抽象、更可分的表示,而不是手工设计特征。
- 反向传播只是链式法则的高效实现,真正困难的是如何设计出易于优化的深度结构。
- 正则化、数据规模与模型容量之间的张力,决定了泛化能力,而非训练误差。
- 许多实践技巧可以用少数几个数学原理(表示、优化、概率)统一解释。
这本书试图回答什么?
- 为什么深层网络能够学习到有用的表示,而浅层模型不能?
- 在什么条件下,一个在训练集上表现优异的模型会在新数据上失败?
适合谁?
适合已具备线性代数、微积分与概率基础,并希望理解而非仅调用深度学习工具的人。