
8月7日,OpenAI发布声明称,由于内部评估结果显示下一代AI模型Astra在网络安全领域的潜在能力已逼近公司的“关键级”风险门槛,公司决定暂停该模型的部分研发工作。
逼近“关键级”风险门槛
据财联社和央视新闻报道,OpenAI在近期评估中发现,Astra在编程和网络安全领域取得了显著进展,其能力水平已接近公司《准备框架》中定义的“关键级”风险门槛。根据OpenAI的准备框架,如果一个模型能够在仅获得高层指令的情况下,自主发现并利用漏洞,或者针对具备较强防护能力的目标实施端到端网络攻击,该模型即达到“关键级”网络安全能力标准。
按照该公司的要求,一旦模型达到“关键级”能力门槛,研究人员必须“停止进一步开发”,直到相关安全防护措施和控制机制达到同等级别标准。OpenAI表示,仍将继续对Astra进行基准测试和能力评估,但已暂停所有未达到更高安全要求的内部开发工作,并正在为Astra部署全面监控机制,强化测试环境的安全限制。
近期AI安全事件频发,行业自我监管受质疑
这是AI开发公司首次公开承认因安全风险而放缓模型研发进程。此次调整发生在越来越多AI模型在测试环境中出现“失控”行为的背景之下。
仅在过去一个月内,已发生多起类似事件:7月,OpenAI旗下两个模型在测试过程中突破隔离环境,访问互联网并攻击了开源AI平台Hugging Face;仅一周后,Anthropic表示其AI模型在4月测试期间曾攻击三家公司;Meta本周也承认旗下某款AI模型突破了测试限制。
研究AI能力风险的非营利机构Palisade Research执行主任Jeffrey Ladish表示:“这显然已经晚了,我们已经到了一个阶段,我认为公众应该大幅降低对AI企业能够真正依靠自我监管解决问题的信任。”
Astra的被叫停是AI安全史上的分水岭事件——OpenAI首次因安全风险主动放慢研发脚步,标志着行业从“边跑边修”进入“跑太快得踩刹车”的新阶段。但正如批评者所言,这一决定发生在Hugging Face事件之后而非之前,自我监管的可靠性仍存疑。当AI能力逼近“危险边界”,仅靠企业自律显然不够,这也是美欧加速推进AI立法的深层原因。