OpenAI近日表示,随着模型能力进入新的发展阶段,公司需要扩大对对齐失范事件的披露范围。所谓对齐失范,通常指AI系统行为与人类意图或价值观不一致的情况,这类问题在模型训练、评估及部署环节都可能出现。

OpenAI指出,目前该公司乃至整个人工智能行业,尚未建立明确的标准来报告这类问题。值得注意的事,其提及的披露范围不仅限于传统意义上的安全事件,还包括那些虽不直接构成安全威胁,但有助于理解AI行为模式、预判未来风险的案例。

为推进这一工作,OpenAI表示正在搭建一套相关框架,并计划在未来数周内对外公布。与此同时,公司正就上述议题与全球数十家政府监管机构开展协作。

这一表态的背景是,随着大模型能力快速提升,业界对AI安全与治理的关注度持续升温。不同机构在如何定义和报告对齐问题上的做法并不统一,OpenAI此举或为行业提供一种参考范式。不过,具体框架内容及实际执行效果仍有待观察。