OpenAI近日表示,隨著模型能力進入新的發展階段,公司需要擴大對對齊失範事件的披露範圍。所謂對齊失範,通常指AI系統行為與人類意圖或價值觀不一致的情況,這類問題在模型訓練、評估及部署環節都可能出現。

OpenAI指出,目前該公司乃至整個人工智慧行業,尚未建立明確的標準來報告這類問題。值得注意的事,其提及的披露範圍不僅限於傳統意義上的安全事件,還包括那些雖不直接構成安全威脅,但有助於理解AI行為模式、預判未來風險的案例。

為推進這一工作,OpenAI表示正在搭建一套相關框架,並計劃在未來數週內對外公佈。與此同時,公司正就上述議題與全球數十家政府監管機構開展協作。

這一表態的背景是,隨著大模型能力快速提升,業界對AI安全與治理的關注度持續升溫。不同機構在如何定義和報告對齊問題上的做法並不統一,OpenAI此舉或為行業提供一種參考範式。不過,具體框架內容及實際執行效果仍有待觀察。