北京時間凌晨,OpenAI 在一場釋出會上正式推出了 GPT 5.6 系列模型及多項配套產品。此次釋出並未侷限於單一模型,而是同時帶來了 ChatGPT Work、全新的 ChatGPT 桌面 App、Hosted Sites 以及三個不同層級的模型:Soul、Terra 和 Luna。
將這些產品組合來看,OpenAI 的意圖非常明確:推動 ChatGPT 從一個被動生成回答的聊天工具,演變為一個能主動承接任務、理解上下文、排程工具、操作環境並最終交付結果的執行系統。傳統聊天產品僅處理“輸入-輸出”,而 Agent 系統需要處理任務拆解、狀態跟蹤、許可權控制和結果校驗等複雜環節。
執行鏈路:從接任務到交付結果
這條技術路線的第一步是任務入口。ChatGPT Work 被設計為接收帶有明確目標的工作請求,例如從 Slack 和員工反饋中尋找內部案例並安排訪談,或讀取財務資料進行差異分析、更新預測並生成彙報材料。其核心挑戰在於編排,系統需自主判斷所需資料來源、處理順序及哪些步驟需使用者確認。
第二步是環境接入。全新的桌面 App 旨在讓 ChatGPT 進入使用者的真實工作環境。與依賴上傳檔案的網頁端不同,桌面端可接觸本地檔案、瀏覽器標籤頁和其他應用。釋出會上展示的整理 Apple Notes、分析 Chrome 標籤頁等能力,本質上是讓模型能夠讀取並理解分散在電腦各處的上下文。這背後涉及複雜的上下文工程,模型需從海量本地檔案中篩選相關資訊,並處理 PDF、Excel 等不同格式的資料,甚至判斷相互矛盾的資訊來源。
第三步是結果交付。Hosted Sites 功能補上了這一環,它允許 Agent 將生成的結果直接轉化為網頁、看板或互動式原型,而非僅僅輸出文本或程式碼片段,更適合專案彙報、臨時儀表盤等輕量級交付場景。為確保交付穩定,Agent 呼叫工具時需遵循結構化協議,明確輸入、輸出、失敗狀態及操作許可權,例如更新 Excel 時應先生成修改對比並等待確認,而非直接寫入。
模型排程:分層與多 Agent 協作
執行鏈路的複雜步驟無法依靠單一模型完成。GPT 5.6 拆分為三個層級正是為了解決排程問題:Soul 面向複雜 Agent 工作流,Terra 面向日常任務,Luna 則針對高頻低成本任務。這種分層路由策略旨在平衡效能與成本,簡單任務呼叫低成本模型,複雜推理和高風險操作則呼叫更強模型。
此外,Ultra Mode 引入了多 Agent 並行處理機制,可將複雜任務拆解給多個 Agent 分別負責讀取資料、處理表格、生成頁面和檢查一致性,最後由編排器整合結果。這要求一個強大的排程層來決定任務拆分方式、上下文分配、衝突處理及成本控制。評估這類系統的標準也已超越傳統問答基準,轉向 Terminal Bench、BrowseComp 等更貼近程式碼執行和長週期資訊檢索的測試。
可信邊界:安全與審計機制
當 Agent 系統開始操作真實環境時,安全問題的焦點從輸出內容轉向執行動作。釋出會提到 GPT 5.6 在網路安全能力上有明顯提升,這要求更嚴格的許可權設計。構建可信 Agent 至少需要幾層機制:遵循最小許可權原則,僅開放任務必需的檔案和工具;對讀取、修改、傳送等操作進行風險分級並設定不同確認邏輯;記錄完整的執行過程審計軌跡,明確哪些結論來自原始資料、哪些屬於模型推斷;以及採用事務化執行,即先生成變更計劃供使用者檢查,再一次性提交,並支援回滾,避免留下不可控的中間狀態。
在企業場景中,對長任務執行過程的可觀測性同樣關鍵,需記錄每個子任務的輸入輸出、模型版本、耗時及失敗原因,以便出錯時精準定位問題。這些機制共同決定了 Agent 能否進入財務、法務等企業核心工作流。
總體來看,GPT 5.6 釋出會勾勒出一條清晰的技術路線:通過 ChatGPT Work、桌面 App 和 Hosted Sites 構建執行鏈路,依靠 Soul、Terra、Luna 和 Ultra Mode 實現模型排程,並以許可權、審計和事務機制控制風險。其最終價值將取決於在真實工作場景中的穩定性,而非釋出會上的演示效果。