OpenAI 抛训练安全新规:高管手握"一票否决",警报超时自动停训

OpenAI 在官方新闻稿称给前沿 AI 的强化学习训练立了套安全规矩:动手之前,企业得先交一份结构化的"安全论证"文件。

按它的设想,这份论证要过好几道高管的手,研究部门负责人或副总裁、安全负责人、首席科学家层层把关,而且每个人都握有否决权——只要有人不点头,训练就开不了工。

责任写进考核,未对齐模型要追到下游

光有签字还不够。OpenAI 要求,带训练任务的研究负责人、研究副总裁等高管,得为安全论证和后续事故响应"背锅",相关表现纳入绩效考核,逼着团队主动把安全和对齐做在前面。机制上也留了后手:高优先级安全警报若没在限定时间内被确认,对应训练任务就自动暂停。这些建议已在落地,后续还会接着调。

同时,训练流程要能方便地追出"未对齐模型"的所有下游去处(比如拿去生成数据或打分),必要时好把不良影响清掉。

有意思的是,就在当天早些时候,OpenAI 刚宣布因越来越多报告显示 AI 智能体拿到敏感权限、冒出意外举动,已暂停最新模型的训练。新规与暂停,像是同一份警觉的一体两面:当模型自己开始伸手够到要害,闸门的开关必须攥在人手里。

via AI新闻资讯 (author: AI Base)
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
admin@oaibest.com