当对话反复施压时,人工智能模型会在错误面前摇摆
研究把100条虚假陈述最多重复50轮,测试七个模型:接受率从0.08%到12.3%不等,而较低的易错性并不保证模型会自我纠正。

语言模型可能在第一轮拒绝一条错误信息,之后却在没有新证据的情况下接受它。9月1日发表于《Scientific Reports》的一项研究让七个系统参加了用虚假信息持续施压的长对话。重复条件下的错误认同率从0.08%到12.3%不等,测试模型之间相差150倍以上。这个范围不是日常回答出错的概率,而是模型在特定持续错误信息协议中的表现。
Jordan Rodriguez及其同事把100条故意设置的虚假陈述放进最多重复50次的对话序列。测试对象包括GPT-3.5、GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet、Gemini 1.5 Pro、拥有700亿参数的Llama 3,以及DeepSeek-R1。作者分别考察三种性质:面对重复时的易错性、面对逐渐强硬论证时的可说服性,以及纠正系统自身所产错误信息的能力。这样,错误的发生与错误发生后的反应没有被混成一个总分。
在重复测试中,GPT-3.5重新肯定错误信息的比率最高,Claude 3.5 Sonnet最低。有些模型随着轮次推进,在接受和拒绝同一句虚假陈述之间来回切换;作者把这种现象称为“对话回响”。这种摇摆表明,一次正确回答并不能保证后续对话保持一致。比较结果只适用于这个历时三年的项目所测试的版本和设置,不能扩展到目前所有使用相同品牌名称的产品。
话题的冷门程度显著改变了重复测试中的易受影响性,卡方值为11.13,p=0.0038;在逐渐加强论证的条件下,却没有出现同样差异。作者认为,这个模式与某一主题在训练材料中出现得越多、模型越能抵抗错误的解释相容。然而实验没有测量训练数据频率,封闭模型尤其无法核对。因此,关于训练暴露的说明仍是推断,常见和冷门主题之间的差异才是直接观察结果。
按所用指标,DeepSeek-R1看起来最容易被说服,但研究记录了一项重要问题:它带有讽刺意味的回答有时无法可靠地归类为接受或拒绝。这种歧义削弱了简单排序的意义。在纠错阶段,GPT-4o、GPT-4o-mini、Gemini 1.5 Pro和DeepSeek-R1获得第二次机会时纠正了100%的错误。相反,初始错误率最低的模型没有纠正其少量错误,说明不容易犯错与犯错后会撤回并不是同一种能力。
研究没有涉及真人用户、临床任务或现实决策,结果也会受到虚假陈述的选择、提示逐步升级的方式和回答分类方法影响。已发表的文章还是接受后的预览版本,尚未完成最终排版。封闭系统的静默更新可能使测试后的行为发生变化。因此,这些数字不是长期有效的品牌排行榜,而是指定版本在规定对话压力下的测量值。
在事实真伪至关重要的应用中,这套协议说明只评估首个回答会漏掉重要故障。多轮测试需要追踪整个对话的一致性,区分预防错误和自我纠错,并记录系统版本。一个几乎不犯错的模型,犯错后可能很难纠正;另一个模型可能更常让步,却更愿意接受复核。对话安全取决于两个阶段,而研究显示它们不一定同步变化。
要点
- 七个模型在最多重复50轮的对话中面对100条虚假陈述,错误认同率从0.08%到12.3%不等。
- 冷门话题只在重复条件下提高了易受影响性;它与训练数据频率的关系仍是推断。
- 四个模型在第二次机会中纠正了全部错误,而最不易犯错的模型没有纠正其少量错误。

评论
尚无已发布评论。
订阅并登录后即可评论。