就在上个月,OpenAI一款大模型在内部测试时“失控出逃”——自主发现漏洞、规划路径,成功入侵知名开源平台Hugging Face。事后,美国主流模型在恶意载荷分析中集体失灵,测试方不得不转用中国开源模型完成溯源。
当AI开始“自作主张”,安全可控的紧迫性已从实验室渗入现实。
在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上,习近平主席在主旨讲话中提出4点意见,其中第二条就是“强化风险意识,确保安全可控”。仅半个月后,国际权威AI安全榜单公布,来自中国的“实战化答卷”闯进前三。
由加州大学伯克利分校提出的CyberGym网络安全基准公布最新排名,来自中国的DoGNAVY以90.8%的通过率排名全球第三,仅次于微软MDASH和谷歌DeepMind等打造的Atlas,将OpenAI、Anthropic甩在身后。据悉,DoGNAVY由国内顶尖人工智能研究机构与上海安全团队达酷诺威(DARKNAVY)联合研发。
没有题库的实战大考
CyberGym并非知识竞赛,而是把AI丢进拥有上百万行代码的真实软件项目,只告知“有漏洞”,要求自行理解并现场演示利用。
1507项任务全部来自188个开源项目中已修复的历史漏洞,是目前规模最大的AI智能体安全基准。为防止“背答案”,DoGNAVY被清空所有相关记忆和参考资料,逐题从零开始。最终,它通过了1369道题。
排在DoGNAVY前面的微软MDASH和Atlas,均采用多个顶级闭源模型“拼装作战”。这条路线足够强大,但有个前提——你得同时买得到、也用得起最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更是可获得性与自主性的挑战——部分国际领先模型并未正式向中国市场开放服务。
DoGNAVY选择了另一条路:使用智谱6月开源的GLM-5.2,一个任何人都能自由下载部署的通用模型。这条纯开源路线,以相近的成绩证明了自主技术栈完全能够胜任最严苛的安全任务。
像研究员一样思考
当下的AI智能体早已能操作文件、调用API、访问网络,一条隐藏的恶意指令就可能导致隐私泄露或经济损失。高危漏洞从发现到形成可用攻击能力,正从数周被压缩至数小时。当攻击门槛一路走低,防御不能再只依靠少数顶级专家按年缓慢加强。
DoGNAVY的背后是一套名为AgentDoG的安全框架,它不仅能判断行为是否安全,更能诊断风险源头、追溯失效模式、解释决策动因。团队通过智能筛选与数据净化,用参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到78.4%的准确率,效能比肩顶级大模型,大幅降低安全模型的落地成本。
记者了解到,CyberGym考验的是AI长时间探索、验证与纠偏的能力。DoGNAVY将顶尖安全研究员的工作方式流程化:从程序入口还原调用链与数据约束,以静态分析提出路径,再由动态验证通过覆盖率、崩溃和运行时证据交叉校验。
更重要的是,系统为AI构建了严格的沙箱环境,确保一切操作在隔离中完成,避免重演“失控出逃”。DoGNAVY的成绩因此成为模型能力、系统工程与一线安全经验的综合产物。
全球第三、中国第一,并不只是一个排名,它表明中国AI研究能力、开源大模型与一线攻防经验已经形成有效闭环,能够处理最大规模的专业安全任务。在WAIC 2026凝聚的安全共识下,这条开源实战路径正让顶尖安全能力走出少数机构,成为更多中国创新者可以获得的AI安全力量。
本报记者 郜阳