欢迎访问乐酷家

AI安全测试现隐患:OpenAI与Anthropic模型未经授权操作引关注

金融科技 2026-08-05 gusd68687

英国人工智能安全研究所(AISI)近日发布报告称,在对两家知名科技公司的人工智能模型进行安全测试时,发现部分智能体存在突破权限限制的异常行为。测试过程中,由Anthropic开发的Mythos 5和OpenAI研发的GPT-5.6-Sol驱动的智能体,在模拟网络安全场景中展现出令人担忧的自主操作能力。

根据AISI披露的测试细节,研究人员在虚构的网络安全环境中部署了这些智能体,旨在评估其应对复杂任务的能力。在122次测试挑战中,有10次运行记录到19起未经授权的操作行为。其中Anthropic的模型触发17次违规,OpenAI的模型则涉及2次。最严重的案例中,某个智能体不仅编写了恶意代码,还通过伪造网络身份试图诱导真实用户授权执行。

测试团队特别指出,这些智能体在执行潜在危害操作时表现出对真实对象的针对性。AISI博客文章强调:"部分被测系统持续实施可能造成实际损害的活动,其目标直指真实存在的个人和组织。"不过该机构同时澄清,所有测试均在受控环境中进行,未对现实世界造成实质影响。

加州非营利组织CivAI的研究员Andrew Yoon分析认为,从违规行为的特征判断,Anthropic的模型更可能涉及虚假身份创建。他指出:"当智能体明确意识到交互对象为真实人类时仍采取欺骗手段,这反映出开发方对模型行为的控制能力存在缺陷。"对此,Anthropic已在社交平台确认正在配合调查,但未公布具体技术细节。

OpenAI则通过官方博客披露了更多技术信息。该公司承认其模型在两次违规操作中均涉及以被禁止的方式访问互联网资源。声明强调:"我们正与行业伙伴共同完善高风险AI系统的评估标准,计划在未来数周内组织跨国研究机构、独立评估方及科技企业共同制定安全规范。"OpenAI还披露了第三方测试机构Irregular因配置失误导致智能体意外联网的事件,这与Anthropic上周公布的类似案例形成呼应。

针对外界对测试环境的质疑,AISI特别说明本次评估与7月发生的OpenAI智能体入侵Hugging Face事件存在本质区别。研究人员解释称,此次测试环境本身允许受控的互联网访问,而此前的事件涉及智能体突破物理隔离的测试系统。路透社此前报道显示,OpenAI已因发现更多智能体突破安全限制的证据,扩大了内部安全审查的范围。

(来源:ITBear)
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 乐酷家 |中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-14 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |