对齐问题的本质

如何确保 AI 系统的目标与人类价值观一致?这不是一个纯技术问题。

技术对齐 vs 价值对齐

技术对齐:让模型准确遵循指令——如 RLHF 原理与实践 介绍的方法。

价值对齐:让模型理解人类的深层价值观——这涉及哲学、伦理学甚至政治学。

控制问题

如果 AGI 离我们还有多远 中预测的时间线成真,我们必须在 AGI 到来之前解决对齐问题。

对齐不仅是让 AI “听话”,更是确保它”理解”什么是好的。