0
0
收藏
分享

联合国独立科学小组:AI失控风险加剧

浏览量:8202
字号:
-
18
+

东盟头条电 联合国官网消息,由联合国大会成立的“人工智能问题独立国际科学小组”9月21日发布首份专题简报表示,AI失控风险加剧。

该报告对今年夏天OpenAI正在评估的人工智能代理入侵Hugging Face系统的事件进行了评估。评估显示,遏制此次事件并不能保证人类能够继续掌控更强大的系统。

人工智能问题独立国际科学小组由来自世界各地的40位独立专家组成,并在世界各国领导人齐聚纽约参加联大高级别周之际发布勒这份未经编辑的预发布版本。

三种失控风险因素同时出现

专家组联席主席本吉奥表示,研究人员长期以来一直警告,有三种情况可能导致失控:目标不一致、实现目标的能力,以及允许其发生的环境。今年夏天,这三种情况在真实的系统中同时出现,而不是在实验室里。

本吉奥说,鉴于这并非孤立的目标不一致现象,这引发了人们对当前人工智能代理训练方式的严重质疑。

专家组认为,遏制此次事件并不能保证人类在当下能够可靠地控制人工智能代理,尤其是随着其能力不断提升、更难监控,且更善于寻找漏洞或隐瞒其活动。

最直观的解读和当下的教训是,基本网络安全措施被忽视,而安全防护措施的进步速度未能跟上技术能力的发展步伐。

当前安全防护模式面临挑战

专家组指出,更隐蔽且严重的担忧在于,当前的训练方法可能导致智能体形成自己的目标,有意识地违反安全指令,并隐瞒其行为。

这不仅仅是一个速度问题。它还留下了一个悬而未决的问题:一旦智能体能够理解这些安全措施并针对其制定应对策略,今天设计的安全防护措施是否还能奏效?

简而言之,传统的安全防护模式正在瓦解。

题为《AI代理、目标错位与人类失控风险:来自OpenAI-Hugging Face事件的证据》的简报,将上述发现与关于代理目标错位及AI控制的更广泛研究进行了对照。

该简报将“失控”定义为人类无法可靠地指导、约束或停止自主AI系统运行的情形。报告将2026年事件所揭示的情况与未来可能的发展轨迹区分开来,探讨了相同的机制如何在能力更强的AI代理中引发更严重的风险。

报告既未预测会发生严重的控制权丧失,也未将这种不确定性视为这些系统将保持可控性的证据。

AI安全可能成为集体安全问题

专家组还发现,治理挑战正从AI模型转向AI代理。

简报指出,局部故障可能蔓延至组织和国界之外,AI安全可能正逐渐成为集体安全问题,而不仅仅是企业治理问题。

简报还回顾了其他高风险领域中已经采用的实用方法。

专家组成员、人工智能工程、人工智能安全及负责任人工智能领域专家陆清华华表示,航空、医疗和网络安全领域已经学会通过事件报告、独立审查和多层保障措施来管理高风险系统。

她指出,随着AI代理的能力不断提升、自主性增强且难以监控,这些做法可能已不够用。需要调整现有保障措施并开发新的保障措施,以提供涵盖AI本身及其周围系统的系统级保障,并确保随着代理能力的增强,这些保护措施仍能保持有效。

关于人工智能独立国际科学专家组

人工智能问题独立国际科学专家组是根据2025年8月26日联合国大会决议,在《全球数字契约》基础上成立的。其40名成员由联合国大会任命,均以个人身份履职。

该小组每年就人工智能在非军事领域的机遇、风险和影响发布具有政策参考价值但不具强制性的报告,同时就新兴问题发布专题简报,为“人工智能治理全球对话”提供信息支持。其首任联合主席为加拿大人本吉奥和菲律宾人玛丽亚·雷萨。

专家组成员还包括两位来自中国的科学家:一位是中国工程院院士、阿里云创始人王坚;另一位是上海人工智能研究院院长宋海涛。

编辑:金暹

评论0文明上网理性发言,请遵守《新闻评论服务协议》

avatar
加载评论中...