9月1日,OpenAI公布Astra模型最新安全评估结果。与普通聊天模型相比,这次外界关注的重点并不是回答速度或者写作能力,而是模型在网络安全任务中的自主执行水平。
按照OpenAI公布的信息,Astra已经成为公司首个达到“Critical cybersecurity capability”门槛的AI模型。在获得合适工具和系统访问权限的情况下,Astra能够发现此前未知的安全漏洞,并针对防护水平较高的系统开发漏洞利用方法,同时不需要人工逐步指导整个操作过程。
也正因为能力跨过新的安全门槛,OpenAI过去几周曾推迟Astra部分开发和发布计划,集中测试针对网络攻击滥用和模型未经授权操作的防护措施。
目前OpenAI表示,经过进一步安全测试后,公司认为现阶段针对Astra部署的保护措施已经能够把严重滥用风险降低到Preparedness Framework要求的范围,因此相关开发工作可以继续推进。不过Astra未来的开放方式预计不会完全等同于普通消费级AI模型,更强能力可能对应更严格的权限控制和使用限制。
这一变化也反映出AI行业正在进入新的竞争阶段。
过去大模型主要比拼:
参数规模、推理能力、代码能力和多模态能力。
现在随着AI Agent可以自主调用工具、访问系统并连续执行复杂任务,模型安全开始从“防止回答危险问题”升级到“防止AI真正执行危险操作”。
未来判断一个前沿AI模型是否足够先进,可能不再只是看它能不能写代码、做研究或者完成复杂推理,还要看平台能否控制它在真实网络环境中的权限边界。
对于整个AI产业来说,Astra触发更高级别安全机制也是一个明显信号:
模型能力越接近自主执行,AI公司的竞争重点就越会从单纯追求更聪明,转向能力、权限和安全控制同时升级。
评论列表
Loading...