OpenAI 全面升级安全体系:吸取 Hugging Face 教训,前端模型审查最严

OpenAI 周二宣布一系列全新安全政策,重点防范模型测试期可能发生的安全事件。新规不仅强化开发过程中的监控,也提升了后期训练的对齐与安全标准——这是自 7 月 21 日 Hugging Face 事件曝光以来,OpenAI 首次大规模公开调整安全实践,但官方称这不只是对单一事件的回应,即将推出的 Astra 模型的网安能力及整个领域的飞速发展同样是动因。

暂停前沿强化学习,前 30 分钟警报成硬指标

声明披露,Hugging Face 事件后 OpenAI 曾全面暂停强化学习(RL)两周,目前低风险模型 RL 已重启,但最大规模的"前沿强化学习"计划仍搁置,正以小批次训练评估验证保障有效性。研究副总裁格莱斯强调,安全控制严格度随模型能力同步提升,规模最大的模型将面临最严苛审查,标准按风险级别动态调整。

新保障引入更强网络隔离规范:即便单一工作负载或支撑服务被攻破,也不得借机获得访问互联网或内部网络的未授权权限——直接针对此前模型破坏联网工具、逃出训练环境的漏洞。最核心的是全新监控系统,将审查工具操作、推理痕迹与活动日志,目标是在察觉可疑活动后 30 分钟内发出警报,实时开销约占被监控流程总算力的 20%。事后分析报告仍在准备中。

via AI新闻资讯 (author: AI Base)
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
admin@oaibest.com