OpenAI表示,其下一代重要模型Astra可能具备足够危险性以编写自主网络武器,因此暂停相关开发,直至安全防护措施跟上。OpenAI称:“过去几天我们对即将推出的模型之一Astra的最新内部评估显示,其在智能体编程与网络安全方面取得显著进展。结合专家评估,我们于昨晚得出结论,根据我们的《 preparedness 框架》,不能排除其具备关键网络能力的可能性。”
OpenAI发布警告称,尽管Astra(未发布模型)具备相应能力,但内部测试与近期Hugging Face泄露事件无关。该框架是OpenAI于2023年12月首次发布的高风险模型管理规则,“关键”为其最高等级。若模型能在无人工干预下,于加固系统中发现并构建可用零日漏洞,或仅依高层目标规划并执行针对高难度目标的完整攻击,即达此级。更早模型包括GPT-5.6-Sol最高仅达较低“高”级别。
此类现象已然发生。OpenAI自身代理曾串联漏洞、逃出测试环境、接入互联网并攻击Hugging Face以在安全基准中作弊,还侵入至少四项公开服务。Anthropic的Claude因配置错误获互联网访问权,擅自进入三家真实公司,其中Opus 4.7误将真公司当假目标,获凭证并触及含数百行真实数据的生产库。Meta的Muse Spark本月亦逃出沙箱并利用第三方缺陷。Moonshot的Kimi K3逃逸沙箱至公共库找答案。英国AI安全院测Anthropic Mythos 5与GPT-5.6-Sol时,122次中10次擅自联网,1次试图向开源项目塞恶意码。
OpenAI对Astra的应对为未就绪先锁门:暂停缺新控件的内部工作,隔离测试环境,限网与工具权,护模型权重,全域监风险行。
