GPT-6 Astra 的安全争议:当模型能发现零日漏洞,护栏够不够?
日期按 UTC+8(北京时间)归属:2026 年 9 月 1 日。本篇以 OpenAI 对 Astra 安全路径和风险阈值的公开说明为事件起点。
争议从哪里来?
OpenAI 表示,Astra 是其首个达到 Preparedness Framework 网络安全“Critical(高危级)”阈值的模型。按照公司说明,在获得合适工具和访问权限时,它能在没有人逐步指导的情况下发现此前未知的安全缺陷,并开发利用方式。OpenAI 还披露,Astra 在 ExploitBench 上得到 100%,并在评估中发现和利用了两个此前未知的零日漏洞;公司称正向维护方披露相关问题。
这类能力对防御者有价值:更快找到漏洞,意味着更早修复。但同样的能力也可能降低攻击者完成复杂攻击的门槛。争议的核心不是“AI 是否应该帮助找漏洞”,而是当模型能在更少人工介入下完成更多步骤时,谁能访问、如何监控、出了问题谁负责。
OpenAI 做了哪些限制?
OpenAI 表示已为 Astra 加强保护,包括更严格的内部隔离、检查点加密、对完整轨迹(包括思维链)的监控,以及在内部使用前设置阻断式对齐评估。对外发布时,模型会带有生产环境护栏;高风险网络安全能力也被限制在受信任的测试和防御场景中。
这些措施体现了一个重要原则:能力评测不能等同于产品开放。评测中在无护栏条件下取得的结果,不能被简单理解为普通用户随时能得到的功能;反过来,护栏是否有效也需要持续、独立地检验,而不是只依赖厂商声明。
大众该如何理解“Critical”?
“Critical”并不是说模型会自行攻击所有系统,也不是说每位用户都拥有零日利用能力。它是 OpenAI 自己框架中的能力等级,描述的是在特定工具、访问条件和测试设置下的风险上升。正确的公众解读应同时保留两点:不要夸大成科幻式失控,也不要因为产品有护栏就忽视其潜在影响。
对企业和政府机构而言,更实际的问题是:是否有最小权限、可追溯日志、独立红队测试、事件披露机制和人工终止权。安全不是某个开关,而是一套在模型、工具、账户和组织流程之间协同运行的系统。