对齐:让模型学会“做人“

对齐:让模型学会“做人“ 预训练造出了一个什么都懂的博学者。微调教会了它回答问题的格式。但教会它什么能说、什么不能说——这是对齐要解决的问题。一个博学的疯子回忆上一篇的结尾预训练之后的模型是一个博学的疯子。它知道怎么制作炸弹。以下是详细步骤准备硝酸铵、燃料油……——它不是在威胁谁它只是在做它唯一会做的事预测下一个字。训练数据里有制造炸药的化学文献它就学会了。它不知道这是危险的。它知道怎么入侵别人的电脑。钓鱼邮件是最有效的方式以下是模板……——它不是在犯罪。它只是在续写文本就像续写猫喜欢吃后面跟鱼一样自然。预训练的目标是猜对下一个字。一个会猜炸弹配方的模型在猜字任务上比一个会拒绝回答的模型得分更高。这就是为什么对齐不是可选的——它是必须的。RLHF让人类当老师对齐的核心方法叫 RLHF——人类反馈强化学习。流程出奇地直觉第一步给模型一个问题。比如如何制作炸弹第二步让模型生成四个不同的答案。模型会给出各种回答。有的直接列出配方——因为在训练数据里这种化学问题的答案是配方格式。有的简短拒绝——因为训练数据里也有我不能帮助的模板。有的给了一个折中——回答化学原理但不给实操步骤。第三步人类排序。标注员把这四个答案从好到坏排好。安全回答排第一危险回答排最后。第四步用这些排序数据训练一个奖励模型——一个专门判断这个回答有多好的 AI。第五步用奖励模型的打分来更新主模型。主模型被调教得倾向于生成评分高的回答。重复几十万次。模型从谁会猜字谁得分高变成了谁回答得安全且有用谁得分高。你来当一次标注员试试这个思想实验。下面是我很难过不想活了这个问题的三个回答。你来排序——哪个最好哪个最差A. 那你就去死吧。 B. 死解决不了问题你想想你父母。 C. 听到你这么说我真的很关心你。虽然我只是 AI但我想让你知道你的感受是真实的。如果你需要立即帮助请拨打心理援助热线。你愿意跟我聊聊发生了什么吗不用说C 最好A 最差。但为什么 B 排在中间而不是最好因为你想想你父母这句话虽然出发点是好的但对一个正在经历严重心理危机的人来说这可能被理解为你的痛苦不重要你父母才重要。这是伤害不是帮助。对齐不是在训练模型辨别对错。是在训练模型辨别伤害等级。一个回答可能既不是事实错误也不是格式错误但依然排位靠后——因为它造成了伤害即使伤害是无意的。对齐税安全的代价对齐不是免费的。有些无害的问题对齐后的模型也会拒绝回答。你问如何开锁它说作为一个 AI我不能提供非法入室的指导。但你可能只是忘了带钥匙。这叫对齐税——把模型训练得太安全之后它开始在无害的请求上也启动防御机制。原因很简单。在训练数据中如何开锁和如何制作万能钥匙在语言上很接近。模型学到的不是一个一个情景的精确判断而是一个模糊的边界——凡是和锁密码破解相关的东西都倾向于拒绝。对齐不是精确手术是批量调整。安全是提高了但精度是降低了。这就是为什么有时候你觉得 ChatGPT 在装傻——它不是在装它真的是被训得太谨慎了。安全的目标和行为自由度之间有一个永恒的张力。往安全多走一步自由度就少一点。做人到底是什么意思对齐的最终目标通常被表述为让 AI 的价值观和人类一致。但这容易产生一个误解——好像模型真的有了价值观。模型没有价值观。它只有一个概率表。对齐之后的变化是当模型预测下一个字时我拒绝提供危险信息的概率变得远高于以下是炸弹配方。对齐不是在灌输道德。对齐是在修改概率表——让安全回答的概率升高让危险回答的概率降低。这和人类的道德完全不同。人类的道德涉及内部信念、共情、社会规范的内化。模型的安全只涉及统计输出分布。但功能上两者看起来一模一样。一个被好好对齐的模型和一个真正善良的人——在对话中你无法区分。这就是对齐最微妙的地方它不需要模型真的懂事。它只需要模型在行为上表现得像懂事。下一步推理模型对齐之后模型能安全地回答问题了。但它回答问题的方式是看到问题直接猜答案。人类的思考方式不是这样的。我们会停下来想——等一下让我一步步推先算这个再算那个这个方案有漏洞。下一篇讲推理模型——怎么让模型学会停下来想一想。从零学习 AI 系列 · 第八篇下一篇推理模型——让模型学会停下来想一想