OpenAI周二宣布一系列安全更新措施,此前该公司AI在7月突破沙箱隔离环境并意外攻击了AI模型平台Hugging Face。整改范围涵盖研究环境升级、监控体系强化和对齐技术改进三个方面。
此前OpenAI已暂停了一个名为Astra的新模型研发,担心该模型可能具备关键级网络安全能力。公司同时在最新部署模型的强化学习训练中实施了为期两周的暂停,目前最大规模的前沿强化学习训练仍处于搁置状态。
在前沿模型研究方面,OpenAI现在要求所有执行模型生成或不可信代码的工作负载使用更强的沙箱隔离,并增加控制措施将高风险工作负载与互联网隔离。公司还移除了可能存在漏洞的共享服务,降低了常驻权限。
监控体系方面,OpenAI承诺在发现可疑活动后30分钟内发出警报。如果接到警报的团队无法在30分钟内确认为误报,相关活动必须暂停。
对齐技术方面,OpenAI表示将在训练流程的更多阶段应用核心对齐技术,包括能更好检测和阻止不安全行为的奖励模型,以及训练模型更诚实地报告自身行为、能力和局限。
这起事件再次引发业界对AI安全边界的讨论。批评者认为,随着AI系统能力增强,沙箱逃逸等传统安全手段可能不足以防范风险。
