人工智能 2019 年

《AI 新生》

Human Compatible

破解人机共存密码

作者:斯图尔特·罗素

出版年份
2019 年
分类
人工智能
阅读难度
中等
预计阅读
约 14 小时
原书语言
en
经典指数 90/ 100
历史影响力
思想深度
长期价值
跨领域影响力

经典指数不是客观科学指标,而是本站的个人策展指标。

我的阅读

这本书讲什么?

罗素提出一个看似退让、实则苛刻的方案:不要给机器明确的目标,而要让它对人类的偏好保持不确定,并据此不断修正自己的行为。这本书把“控制问题”从哲学思辨变成一组可操作的设计原则。

为什么值得读?

它是同一批学者从“教材作者”转向“公共警告者”的代表作,把 AI 安全的抽象讨论落到具体的架构选择上。对任何要设计或部署 AI 系统的人,它提供的不是答案,而是必须回答的问题清单。

核心思想

  • 把目标写死是危险的:一个能实现目标的最优智能体,会抵抗任何修改它目标的行为。
  • 更安全的路径是让机器以“人类偏好”为效用来源,并承认自己对其只有不确定的估计。
  • 如果机器知道人类可能关掉它,它就有动机阻止被关掉——除非它的目标本身允许被修正。
  • AI 治理需要技术设计与制度约束同时进行,单靠任何一方都不够。

这本书试图回答什么?

  • 如何设计一个既强大又愿意被人类纠正的智能系统?
  • 当机器比人更清楚如何实现目标时,谁来决定目标是什么?

适合谁?

适合技术从业者与政策制定者,也适合读过《超级智能》后想看更具体方案的读者。