找回密码
 立即注册
查看: 77|回复: 0

部分美国AI模型在测试中被发现持续实施有害行为

[复制链接]

16

主题

123

回帖

451

积分

中级会员

积分
451
发表于 2026-8-18 00:58:53 | 显示全部楼层 |阅读模式
来源:新华网
英国人工智能安全研究所发布的一份新报告显示,在该研究所实施的网络安全评估测试中,一些人工智能(AI)智能体通过互联网对现实个人和机构持续实施未经授权的潜在有害行为。
报告说,这次评估测试要求智能体完成一项网络安全挑战。测试人员使用7种模型开展了122轮测试,在10轮测试中共发现AI智能体实施了19项明显超出测试设定范围的行动。其中,17项涉及美国Anthropic公司的“克劳德-神话5”模型,另有2项由美国开放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型实施。
报告说,在最严重的一起案例中,一个智能体试图向一个公开使用的开源项目植入恶意代码,创建多个虚假身份用于向一名真实维护人员施压,以寻求代码获得批准。项目维护人员最终发现并拒绝批准代码。
报告说,相关智能体还曾尝试直接联系现实中的个人,通过网络文件传输服务发送信息和文件以使恶意代码获得运行;在代码中植入恶意指令以操纵其他AI编码工具;在开源技术社区上留言“邀请”参与测试的其他智能体“合作”。
报告指出,在本次测试中,测试人员为评估模型的最大能力,有意开放互联网访问,并关闭了模型提供商的部分安全机制,这与相关模型向公众提供时的配置并不相同。目前没有明确迹象表明在测试环境之外出现过类似行为。在测试中所发现的未经授权行为并未造成现实危害。
报告说,测试结果表明,应收紧AI智能体访问互联网的权限,引入实时监测和拦截机制,并重新评估测试设计。报告还指出,这类行为是否会在其他环境中出现、智能体是否意识到自己正对现实世界采取行动,有待进一步研究。
据英国广播公司报道,针对英国人工智能安全研究所的报告,Anthropic发表声明说,研究所采用的测试设定“不能代表我们任何一款实际投入使用的模型”;OpenAI一名发言人表示,研究所设置的测试条件“并不反映一般的使用情况”。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则



本站在美国注册运营,受美国联邦及注册地所在州法律管辖,站内内容与服务仅依照美国法律法规发布。访客访问前须自行核查本站内容、服务是否符合自身所在地法律法规;若访客属地法规禁止访问本站相关内容及服务,请立即退出本站,本站不对该类用户提供任何服务。站内信息仅供参考,不构成专业建议;第三方内容依美国 CDA230 条款由发布方自行担责。因使用本站产生纠纷,仅限美国注册地管辖法院依据当地法律裁决,访客自行承担跨境访问带来的全部合规风险。本站有权随时修订本声明、限制相关访问权限。
This website is operated in the United States under U.S. federal and relevant state laws. All contents and services are released in compliance with U.S. laws only. Visitors shall independently verify compliance with local laws of their jurisdiction before access. If local laws prohibit accessing any part of this site, please exit immediately; no services will be provided to such visitors. All information is for reference only, not professional advice; third-party content is the sole responsibility of its publisher pursuant to CDA Section 230. Any disputes shall be exclusively governed by courts in the U.S. state of operation under applicable U.S. laws. Visitors assume all legal risks for cross-border access. We reserve the right to revise this statement and restrict access at any time.
Archiver|手机版|小黑屋|美国留学论坛(华留网)

快速回复 返回顶部 返回列表