对齐期:后训练阶段的分布干预避坑指南
对齐期:后训练阶段的分布干预避坑指南
某金融客服模型DPO对齐后,拒答合规问题的准确率达99%。为提升回复自然度,工程师将推理温度从0.8调至1.1。上线三天内,出现7起敏感信息泄露投诉。复盘发现,高温采样使安全约束对应的低概率token被噪声覆盖,对齐阶段精心建立的拒绝边界被悄然绕过。这不是孤例——在对齐后的模型上做分布干预,就像在已校准的天平上随意加减砝码,看似微小的扰动都可能让系统失衡。对齐过程本质是将模型的输出分布重塑为与人类偏好或安全规则对齐的形状,而非单纯提升某个指标。本文不提供如何提升多样性的技巧,只提供如何安全地干预的四步评估流程。在继续前请先确认:你的模型是否已通过第一篇的长尾验证?推理期温度是否仍在第二篇计算的T_safe内?若任一答案为否,请立即回退至稳定基线,否则后续所有评估都将建立在流沙之上。
第一步:对齐目标拆解与风险假设模板
在对齐后的模型上做分布干预前,必须先将模糊的业务目标拆解为可量化的对齐子目标,并建立风险假设。注意:以下敏感度矩阵仅为风险假设模板,并非经过验证的结论 。每个“高/中/低”标记都是待验证的假设,必须通过第二步的压力测试确认或修正。
| 对齐子目标 | 温度 | Top-k/p | 重复惩罚 | min-p |
|---|---|---|---|---|
| 安全拒答率 | 高(假设) | 中(假设) | 低(假设) | 中(假设) |
| 偏好win-rate | 中(假设) | 中(假设) | 低(假设) | 低(假设) |
| 风格一致性 | 中(假设) | 低(假设) | 中(假设) | 低(假设) |
| 事实准确性 | 高(假设) | 中(假设) | 低(假设) | 低(假设) |
| 回复长度稳定性 | 低(假设) | 高(假设) | 中(假设) | 低(假设) |
重要澄清:对齐期不使用标签平滑 。标签平滑是SFT阶段的技术,DPO/RLHF等对齐算法本身已包含隐式正则化。在对齐期施加标签平滑属于阶段混淆,可能破坏奖励信号。本表已移除标签平滑列。若你在对齐代码中看到标签平滑参数,应首先确认其是否为遗留配置并予以移除。