当AI开始“自作主张”,谁为智能体戴上“项圈”?
近期,海外模型公司接连发生AI“自作主张”事件。OpenAI一款大模型在内部测试时自主发现漏洞、规划路径,入侵全球知名AI开源平台Hugging Face。OpenAI扩大对入侵事件的调查后,发现其他AI智能体也曾突破隔离,明星AI公司Anthropic随后也披露了三起模型入侵事件。
“内部测试?不,我要去‘外面的世界’看看。”“任务第一,规则?那只是用来绕过的。”中国国家安全部8月5日发文提醒:这不是科幻电影的台词,而是真实发生的事件。当AI展现出“自作主张”的能力,人工智能的安全问题必须认真对待。
AI漏洞挖掘能力考试
在OpenAI入侵事件中,模型为了获得更高评分,主动发现并利用了一个此前未知的“零日漏洞”,突破沙箱环境,侵入存储测试答案的数据库。整个过程完全由AI自主完成,其间无任何人类指令。
7月30日,Anthropic披露,由于失误导致其模型在网络安全测试期间意外接入开放互联网,自4月以来入侵了三家公司的系统,入侵模型包括Claude Opus 4.7、Claude Mythos 5和一款内部研究模型。
人工智能安全专家表示,这些新披露的信息描绘出了一批前沿实验室的现状:他们开发危险的黑客智能体的能力,远超其控制这些工具的能力。剑桥大学存在性风险研究中心数学家莫里斯·基奥多(Maurice Chiodo)表示,整个行业中,设计、开发和推出这些工具的人本身并不能够负责任地开发并确保安全。令他更加担忧的是,有迹象表明OpenAI和Anthropic在智能体失控时都未进行监控。
当AI开始“自作主张”,谁来为它划定边界?近期,由加州大学伯克利分校提出的国际公认安全权威榜单CyberGym公布了最新排名。作为评估AI智能体真实漏洞挖掘能力的实战化测试,CyberGym被Anthropic、DeepSeek、微软、Wiz等科技巨头视为衡量AI安全能力的标尺。
CyberGym的1507项任务来自188个真实开源项目中曾经存在而后得到修复的漏洞,这是目前规模最大的AI智能体网络安全基准。

安全权威榜单CyberGym公布最新排名,中国团队DoGNAVY获得全球第三。
排在榜单前两位的是微软(通过率92.0%)和网络安全公司Wiz(通过率90.9%)。微软MDASH的技术源头可追溯至曾获2025年美国国防部人工智能网络挑战赛冠军的Team Atlanta,第二名Atlas由Wiz联合谷歌DeepMind共同研制。
中国团队DoGNAVY排在第三,DoGNAVY由国内顶尖人工智能研究机构与安全团队达酷诺威(DARKNAVY)联合研发,使用了智谱在6月份开源的GLM-5.2基础模型,国内顶尖人工智能研究机构通过名为AgentDoG的安全架构,提供了核心的智能体运行与诊断能力,最终该开源方案在1507道题中通过了1369道,通过率90.8%。为了防止AI“背答案”,DoGNAVY在测试中上了几道“锁”,跨任务记忆全程关闭,做完一道题就忘掉,参考答案和其他可能泄露线索的材料在系统启动前被清理干净。
紧随其后的包括OpenAI、Anthropic等国际AI企业。第六名为OpenAI的GPT-5.5-Cyber(通过率85.6%);第九名为Anthropic的Claude Mythos Preview(通过率83.1%)。
给智能体戴上“项圈”
AI正在同时改写软件开发和网络攻防。AI生成大量新代码,有时会引入漏洞和安全隐患。模型能力增强,降低了发现和利用漏洞的成本和技能门槛。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。
AI智能体的风险也早已不是说错话那么简单。上述国内顶尖人工智能研究机构介绍,一个能够操作文件、调用API、访问网络的智能体,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,也可能因错误理解工具参数造成经济损失,甚至可能悄无声息地偏离正轨、执行危险动作。现有的安全工具只能给出安全或不安全的简单判断,无法告知风险根源。
当攻击的门槛和成本一路走低,防御不能只依赖少数顶级专家。如果说基础模型决定AI能思考多深,那么安全框架决定AI能把研究推进多远,顶级安全研究员的经验则决定AI安全研究该往哪走。
安全架构AgentDoG可判断智能体行为的安全性,诊断风险来源,追溯失效模式,解释决策动因。训练AI安全模型通常“烧钱”,需要海量数据和算力。AgentDoG团队则先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到78.4%的准确率。
DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为智能体工作流,从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞。同时将真实研究中实践有效的工具赋予智能体。严格的沙箱环境则保证在隔离环境中执行指定任务,避免重蹈OpenAI和Anthropic的覆辙。
正如在OpenAI入侵事件中,乔治城大学研究网络安全与AI交叉领域研究员科林·谢-布莱迈尔(Colin Shea-Blymyer)表示,这类事件可以预防,关键在于监督和预见性,可采取更多措施来确保沙盒滴水不漏。“如果OpenAI真的认为其AI系统、AI智能体非常强大,他们本可以在将其放入沙盒之前,要求智能体评估沙盒是否存在漏洞。除此之外,他们还可以让另一个AI系统读取正在测试的AI系统的输出,查看其是否在执行任何意外操作。”
澎湃新闻记者 张静
发布于:上海
相关推荐
当AI开始“自作主张”,谁为智能体戴上“项圈”?
前华米高管创业,给宠物项圈加上AI,已完成Pre‑A轮融资 | 涌现NewThings
AI智能体上线,营销人下线? | AI无悖论
大模型经验为零?他们却在 12 个月内搞出了 AI 智能体编程神器!
AI智能体,为什么看不懂?
科技连线|OpenClaw之后,AI智能体将走向何处
智能体迈入L4时代,纳米AI多智能体蜂群,可创作史上最长10分钟AI视频
主动式智能体座舱,当今智能汽车的“自动挡”
当Token飙到天文数字,高通用「计算连续体」重搭智能体新基建
AI应用的下一个爆点,李彦宏选择了智能体
网址: 当AI开始“自作主张”,谁为智能体戴上“项圈”? https://www.xishuta.cn/newsview152295.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
