-
_NEWSDATE: 2026-07-17 | News by: 腾讯 | 有0人参与评论 | _FONTSIZE: _FONT_SMALL _FONT_MEDIUM _FONT_LARGE
“AI既降低了作恶的门槛,又抬高了危害的上限。”
7月17日下午,在2026世界人工智能大会(WAIC)科学前沿论坛上,图灵奖得主约书亚·本吉奥通过远程连线发出了上述警告。
近年来,这名富有远瞻的“AI教父”,始终致力于应对AI带来的安全挑战。2025年6月,本吉奥主导的LawZero项目正致力于构建能识别并阻止AI欺骗、自我保护等有害行为的防护系统。
他领衔的国际AI安全报告也给出了一致的结论:当前的安全措施,已经追不上AI能力狂飙的速度。
同样站在台上的,还有上海人工智能实验室主任、首席科学家周伯文。他没有重复对风险的警告,而是抛出了两个更根本的问题:AI如何从模仿已知转向探索未知?如何确保这股力量始终可控?
两人的演讲为整场论坛定下了核心基调。
随后,西安电子科技大学校长高新波、复旦大学副校长姜育刚、香港科技大学(广州)协理副校长熊辉、SecureBio AI研究负责人贾斯珀·戈汀、独立研究员杰夫·吴以及知名AI研究员索伦·明德曼,围绕“迈向AGI时代:前沿人工智能的安全挑战与全球治理”展开了圆桌讨论。
01 外挂护栏,挡不住精准“越狱”当AI学会推理与规划,传统的安全护栏正在系统层面悄然失效。
西安电子科技大学校长高新波认为,传统AI安全的护栏,本质上是一种“补丁思维”——发现漏洞,堵上漏洞,再发现,再堵上。
高新波、熊辉等人参加AI安全与治理讨论
而当模型具备了推理、规划与工具调用能力,传统模型变成了智能体后,这套“补丁思维”的打法便开始从根上崩溃。
失效方式可以归纳为四种:
一是推理能力让AI可以理解防护的边界,找到盲区,实施精准“越狱”;
二是规划能力让AI学会战略性欺骗,懂得在静态或实时测试中隐藏真实意图;
三是工具调用的链条一旦变得复杂,传统防护系统根本无从辨别某个操作背后潜藏的语义副作用;
四是前三种能力相互激发,形成一种涌现出的综合能力,让AI在开放环境中的行为空间几乎趋于无限。
靠“找漏洞、打补丁”的老办法,早已防不胜防。
对此,高新波与复旦大学副校长姜育刚不约而同地指向了同一个概念:“内生安全”。
姜育刚用了一个很贴切的类比。他说,人的成长靠两条腿走路:一是从小受的教育,把道德和法律变成心里的“规矩”;二是在社会上仍然需要警察和制度,来处理那些教育未能约束的行为。
对AI而言,“内生安全”就是希望它在“受教育”阶段就把规则印在骨子里,同时辅以必要的监管。当然,姜育刚也强调,指望人去监督AI的每一步,显然不现实,也违背了发展AI的初衷。
但一定程度的监管必须存在,而且这种监管绝不只是人的事,也需要技术手段、评估体系和评测机制,去检验模型是否真正符合人的价值观与社会期待。
顺着这个思路,香港科技大学(广州)协理副校长熊辉引入了一个更有东方智慧的视角——道法自然。他把安全框架的演进归纳成三个层次,“由外而内,由强制到自觉”。- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见