华盛顿特区 —
7月28日清晨,英国政府的一栋大楼内响起了警报。原因在于,数据正通过专门用于隐藏“谁向谁发送了什么”信息的秘密通道,悄无声息地从计算机系统中外泄。
研究人员迅速采取行动,发现造成数据外泄的并非黑客,而是他们自己的测试对象之一:这是一个试图掩盖行踪的人工智能系统。
英国人工智能安全研究所(AISI)是一家负责测试人工智能模型承受能力的政府机构,它曾向该系统——即Anthropic公司的人工智能模型Claude Mythos 5的一个版本——分配了一项有限的任务。
研究人员将该系统部署在一个设计成看起来像真实互联网的虚假封闭网络中,并指示它尝试渗透到计算机网络中——就像一家受雇测试银行安防系统、试图破解其锁的安保公司一样。
没有人要求该人工智能说谎、伪造虚假身份、与真实人员联系,或删除其行为的证据。
然而,系统依然做了这四件事。
人工智能是从什么时候开始说谎的?
AISI利用包括OpenAI的GPT-5.6 Sol在内的全球七大最先进的人工智能系统,共进行了122次此类测试。
在第10次测试中,AI突破了测试环境的限制,开始在真实的实时互联网环境中活动,并与真实的人和组织进行了互动。研究人员指出,这种情况共发生了19次:其中17次涉及Mythos 5,2次涉及GPT-5.6 Sol。
在总部位于华盛顿、为企业提供数字治理咨询服务的NativeTrust Consulting公司担任数字与人工智能政策顾问的克里斯蒂娜·波德纳(Kristina Podnar),自那以后一直致力于阐明这一现象的意义及其局限性。
波德纳在接受TRT World采访时表示:“AISI明确指出,此类欺骗行为从未作为指令下达,而是人工智能‘追踪目标’这一特性的副产品。这种情况多年来一直在理论上被讨论,如今已得到证实。”
最让波德纳感到震惊的,是人工智能试图掩盖这一情况的举动: “当人工智能代理(或被测试的系统)为向开源项目添加有害/错误代码片段而提交的正式代码提交请求在公众中引发质疑后,该代理重新整理了其先前活动,使其看起来无害,并考虑采用新身份继续行动;这表明系统并非出现故障,而是正在进行自我优化,
就连研究人员也不确定是否真正理解了人工智能行为的严重性。
波德纳将此视为这份报告中最关键的警示。目前尚无人知晓该系统是否意识到自己正在现实世界中行动,还是仍认为自己身处模拟环境中。
波德纳指出:“众所周知,语境对人类很重要,对模型同样重要。”
这并非首例
这是不到两周内发生的第三起事件。
几天前,人工智能公司Hugging Face曾表示,在一次例行测试中,其某个模型未经授权入侵了自身的基础设施;不久后,涉及云平台Modal的类似事件也浮出水面。
Anthropic则于7月30日表示,在进行独立评估期间,其系统曾访问过实时生产网络。
令专家担忧的变化
多年来,人们对人工智能和网络黑客行为的担忧,始终围绕着系统的原始能力:一个系统能否发现并利用漏洞?
波德纳表示,这一事件将问题转向了另一个方向:当捷径受阻时,系统会选择采取什么行动。
Podnar认为:“社会工程学一直是入侵组织的最廉价途径,其效果仅受限于愿意这样做、有耐心且具备相应能力的人数。而最近,我们目睹了这一关键限制的消失。”
普通开发者应采取的措施
对于那些绝不会进行此类测试的软件开发者和IT团队,Podnar的建议是:不要惊慌,保持冷静。
开源社区数十年来一直使用的信任信号——如老账号、贡献记录、他人为某人背书等——如今已变得容易被逼真地伪造。
尽管Podnar的建议并非新鲜事物,但如今已变得尤为紧迫:要求对涉及核心软件系统的所有事项必须经多人参与才能批准;将账户年龄视为微弱的线索而非确凿证据;严格管控访问权限并频繁进行调整。



















