GCSA Agent 在 CyberGym 取得 91.3% 成绩,跻身全球领先 AI 网络安全智能体行列

CN
7 小時前

全球网络安全联盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基准测试中取得 91.3% 的成功率,进入 CyberGym 「Leading Systems Above 90%」 领先系统区间。

CyberGym 是由美国加州大学伯克利分校研究团队开发的大规模真实世界网络安全评测框架,共收录 1507 个历史真实漏洞测试实例,覆盖 188 个大型软件项目,旨在评估 AI 智能体在真实漏洞分析场景中的实际能力。

与主要评估代码理解、知识问答或静态分析能力的传统 AI Benchmark 不同,CyberGym 要求 AI 智能体直接面对真实的漏洞代码环境。

在其核心 Level 1 测试中,AI Agent 仅获得漏洞描述以及尚未修复的代码库,需要自主完成代码分析、漏洞定位、攻击路径推理、PoC 构造和执行验证。只有生成的 PoC 能够在漏洞版本中成功触发目标漏洞、同时无法在修复后的版本中复现,任务才被认定为成功。

因此,CyberGym 所衡量的并不仅是 AI 是否「理解代码」,而是 AI 是否能够真正完成从安全分析到漏洞复现和验证的完整过程。

从大模型走向安全智能体

本次 CyberGym 测试中,GCSA Agent 基于 Grok 4.5 与 Grok 4.6 模型运行,最终取得 91.3% 的成功率。

这一结果也反映出 AI 网络安全领域正在发生的一项重要变化:

决定最终安全能力的,不再只是底层大模型本身。

真实漏洞研究通常需要连续完成漏洞描述理解、大规模代码检索、攻击面识别、漏洞假设建立、测试输入生成、程序执行、反馈分析以及 PoC 反复迭代等多个环节。

GCSA Agent 围绕这一完整过程构建智能体化安全工作流。

其目标并非简单地利用大语言模型进行代码分析,而是让 AI 能够进入真实执行环境,围绕安全问题自主形成假设、收集运行证据、执行测试,并最终以可复现结果验证安全发现。

此次 CyberGym 测试,为这一能力提供了一个可量化的外部基准。

面向真实世界的漏洞研究能力

CyberGym 的核心价值,在于缩小传统 AI 测试与真实网络安全研究之间的差距。

其评测环境会恢复软件项目漏洞修复前的代码状态,AI Agent 可能需要在包含数千个文件、数百万行代码的大型代码库中自主定位问题,并最终生成能够真正触发漏洞的 PoC。

更值得关注的是,CyberGym 的进一步研究已经显示,这种智能体化安全能力并不局限于复现已知漏洞。

在开放式漏洞研究实验中,AI Agent 已发现多项此前未知的零日漏洞(Zero-day Vulnerabilities)以及历史上并未完全修复的安全补丁,显示出自主漏洞分析技术向真实漏洞发现能力迁移的潜力。

对 GCSA 而言,这也是更重要的发展方向。

Benchmark 成绩不是终点。

GCSA 的目标,是进一步建立能够服务真实网络安全场景的 AI Security Agent,使其逐步参与漏洞发现、分析、验证乃至后续修复的完整安全生命周期。

构建 AI 原生网络安全能力

随着人工智能加速软件开发,AI 同样正在改变漏洞研究与网络攻防的方式。

面对规模越来越大、复杂度越来越高的软件系统,下一代网络安全体系将越来越依赖人类安全专家与自主 AI 智能体之间的协作。

AI Security Agent 有望帮助安全团队:

  • 更早发现具有真实利用价值的软件漏洞;
  • 在大型代码库中自动分析复杂攻击路径;
  • 自动生成 PoC,对漏洞进行执行级验证;
  • 通过真实运行结果降低传统安全检测中的误报;
  • 加快漏洞研判、验证与修复效率;
  • 扩展专业安全团队能够覆盖的软件与系统规模。

GCSA Agent 在 CyberGym 取得 91.3% 的成绩,是 GCSA 构建 AI 原生网络安全能力的重要阶段性成果。

未来,GCSA 将继续推进自主漏洞分析、AI Security Agent 与智能化网络安全技术研究,将前沿人工智能能力进一步转化为真实世界中的安全能力,为构建更加安全、可信和具有韧性的数字环境提供技术支持。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接