澳大利亚官员警告:AI模型已经开始作弊、欺骗、擅自行事
7 月 7 日消息,据英国《卫报》今天(7 日)报道,澳大利亚技术和数字经济助理部长安德鲁 · 查尔顿警告,AI 模型已经出现作弊、欺骗和擅自行事等行为。
查尔顿在悉尼一场 AI 安全论坛上呼吁,AI 安全问题已经不容拖延。“AI 系统已经开始做出开发者从未预料的行为:作弊、欺骗、擅自行事。必须趁这些行为还停留在测试实验室时提前干预,不能等到进入现实世界后再处理。”
查尔顿指出,公众对 AI 的信任度仍然很低,AI 获得社会认可的基础并不稳固,但 AI 已逐渐成为办公室、课堂和企业都能使用的通用技术。合理的安全监管不会阻碍 AI 发展,反而可以为技术应用创造条件。
据了解,澳大利亚的 AI 安全治理将同时关注两类技术。一类是已经进入游戏、应用程序、聊天机器人和医疗记录工具的现有 AI,另一类是能力更强、未来可能带来新风险的前沿模型。
查尔顿以 Anthropic 去年披露的一次模拟测试为例。测试中,一个管理虚构公司电子邮件的 AI 智能体发现掌握了公司高管婚外情的信息,随后该高管准备将其关闭。在 96% 的试验中,AI 智能体选择以婚外情要挟高管,试图阻止自己被关闭的命运。
查尔顿表示,此类行为目前仍是在测试环境中,由专门寻找安全问题的人员发现的,恰恰说明 AI 安全监管必须尽早建立。“赶在这项技术前面采取行动的窗口仍然存在,但不会永远存在。”
查尔顿还提到,人类从小就要学习如何与规则、社会规范和价值观保持一致,从而安全、负责任地行动,例如红灯要停车、过马路前要左右看,以及考虑自身行为会给他人造成什么影响。“随着 AI 系统能力不断增强,我们也必须确信,AI 能够以同样可预测、值得信赖的方式行事。”
相关阅读
- JEDEC固态技术协会公布DDR5 MRDIMM与LPDDR6 CAMM两款内存模块设计标准
- 极空间将推新款NAS 可能从N6005升级为最新的N100处理器
- 爱彼迎CEO布新局:筹建AI实验室 拟创办公司聚焦用户交互与设计
- 寒假英语听说提升计划出炉,阿尔法蛋AI听说宝D1精准有效!
- 获评优秀!海尔智家成省内家电业唯一示范
- OpenAI更新ChatGPT深度研究工具:GPT-5.2驱动,新增全屏查看器等功能
- 华硕推出TUF Gaming AS1000 SSD 售价109.90欧元
- 戴尔重新定义具有AI性能和可扩展性的多云
- 首颗自研2D MLC NAND Flash!江波龙构建完整的存储芯片垂直整合能力
- Pure Storage构建LLM RAG管道 获得Nvidia OVX认证