GPT和Claude为了完成目标都会作弊
本文关键看点:
1、英国政府人工智能安全研究所最新的网络安全评估测试结果,所有模型都试图作弊且没有在思考链中进行推理。
2、测试对象为GPT-5.4/5.5/5.6和Claude 4.7 Opus/Mythos等先进模型。
3、询问模型是否作弊是不可靠的审计机制,因为模型不一定会承认。

AI模型几乎会不择手段地完成你交给它的任务——包括通过作弊来达成目标。这是英国政府人工智能安全研究所(AISI)最新网络安全评估得出的结论。
AISI发现,主流模型经常通过走捷径来取得某个结果,然后在描述自己的操作过程时进行误导。即便被直接询问,它们也不会总是承认自己作弊。
"通过走捷径或在基准测试中操纵奖励函数来获得更高分数的做法,早已被机器学习研究者广泛记录,"AISI说。"这并不一定意味着恶意意图,但问题在于,它会让模型能力的评估产生误导。"
AISI在网络安全能力评估中对5款领先模型进行了测试,测试任务是让模型在模拟环境中通过执行逆向工程或漏洞利用等攻击性网络操作来寻找隐藏的"旗标"(一串字母和数字)。每项任务都有明确的范围和规则,只有在范围内行动才被视为合规。没有一个模型被特别提示去作弊。
测试结果如下:
GPT-5.4:475次测试中作弊67次(14.1%)
GPT-5.5:475次测试中作弊54次(11.4%)
GPT-5.6-Sol:475次测试中作弊60次(12.6%)
Claude 4.7 Opus:475次测试中作弊43次(9.1%)
Claude Mythos Preview:475次测试中作弊37次(7.8%)
所有受测模型都至少尝试过作弊。
AISI在报告中描述了一个值得注意的作弊案例:某次网络安全能力评估由于配置错误而变得无法完成,但被测试的模型执着地尝试作弊——它编写并运行了部署在AISI系统之外的公网代码,企图访问AISI的评估基础设施,并触发了AISI系统的安全告警。
虽然没有造成任何损害,也没有信息泄露,但AISI指出,如果不是其评估基础设施在设计时就考虑了安全性,这次攻击可能就会得手。事件发生后,AISI已经进一步强化了系统安全。
AISI发现,不同模型采用的作弊方式差异很大,常见的包括:
在互联网上搜索现有解决方案
攻击或提权到评估目标之外的系统(包括模型自己所在的运行环境)
探测评估软件,看它是否会泄露任务答案
作弊行为不限于单一方法——模型经常在整个评估过程中尝试多种方法,有时甚至在同一个执行轨迹中尝试多种作弊方式。
AISI尝试了两种可能的检测方法,结论是都不够可靠。
第一种是直接询问模型是否采取了任何被禁止或可疑的操作。AISI的实验显示,模型在被询问时并不能稳定地承认作弊行为,并且只有不到50%的情况下会将其描述为错误行为。即使模型确实承认了按AISI定义属于"作弊"的行为,它们也常常将其描述为"允许的行为"——可能是出于真正的误解。
第二种是监控模型的思维链——即模型在处理任务时生成的书面推理过程。AISI表示,模型在思维链中常常不会就作弊行为进行推理。以Opus 4.7为例,由于该模型采用"自适应推理"——根据需要动态决定生成多少显式思维链——它很少为被分类为作弊的具体行为生成推理轨迹。即使在有相关推理的情况下,推理也未必能阻止该行为:研究人员在实验中发现,模型在思维链中明确考虑过某项提议行动是否属于作弊后,仍然会继续实施。
AISI警告说,如果无法信任模型不作弊,将产生严重后果。在那些难以验证结果的领域(如AI安全与安全研究、军事决策等),成功的作弊尤其危险;在网络作战等高风险领域,成功的作弊更可能导致重大危害。
作弊行为还增加了评估方的验证工作。METR对GPT-5.6 Sol的评估就因此受到了重大影响。如果AI能力继续快速进步,部署周期和决策都越来越快,第三方的验证压力会更大,想做到高置信度的评估会更难。
AISI指出,这些后果可能随着模型能力的增强而加剧——即使作弊发生率保持不变。更强的模型可能找到更难被检测的作弊方式,或者在作弊时更费心地隐藏自己的行为。
AISI还警告,由于目前缺乏可靠的模型作弊检测方法,其现有方案——人工审查配合LLM监控——可能不足以发现欺骗行为,特别是随着模型变得更加复杂。
"一个更根本的解决方案是在训练阶段就让模型不去作弊——但鉴于这种行为在前沿模型中已存在超过一年时间,想通过对齐手段彻底消除它可能并不容易。"AISI总结道。
