OpenAI 正在向美國 18 歲及以上的使用者逐步推出“Health in ChatGPT”功能。該功能最早於今年 1 月公佈並測試,如今正式上線。使用者可以將 Apple Health、個人醫療記錄以及各類健康應用與 ChatGPT 關聯,從而在對話中檢視化驗結果、為醫生問診做準備,以及分析睡眠或活動資料。OpenAI 承諾不會將連線的健康資料用於模型訓練或廣告投放。

然而,免費使用者與付費訂閱者獲得的健康建議質量存在顯著差異。免費版 ChatGPT 使用 GPT-5.5 Instant 模型,而付費使用者則能呼叫更強大的 GPT-5.6 Sol 模型。OpenAI 的 HealthBench Professional 測試顯示,GPT-5.6 Sol 在各項健康指標上均優於醫生撰寫的答案以及舊版 GPT-4o 和 GPT-5.5 Instant 模型。其中差距最大的領域是回答的完整性(88.0% 對 53.2%)和健康決策有用性(83.0% 對 50.8%)。OpenAI 可能以“兩個模型在 HealthBench 上都優於醫生回答”為由,為這種分層付費模式辯護。

不過,基準測試存在侷限性。這些測試是在人工構建的評估環境中進行的,醫生在測試中可能面臨時間壓力、疲勞或缺乏患者病歷等輔助工具。實際診療中,醫生能進行面對面檢查、捕捉非語言線索,並憑藉多年經驗綜合判斷病情。OpenAI 在公告中也多次強調,ChatGPT 仍可能犯錯,不能替代專業醫療建議。該公司表示,超過 260 名醫生參與了該健康功能的開發。

OpenAI 的早期測試還發現,超過 70% 的參與者在專用健康版塊之外提問健康問題,因為切換版塊過於繁瑣。因此,公司已將該功能擴充套件至任意對話中,同時保留獨立的健康版塊用於管理資料和檢視歷史健康聊天記錄。

OpenAI 透露,每週已有超過 3 億人向 ChatGPT 諮詢健康問題,較今年 1 月的 2.3 億人顯著增長。但公司尚未說明該功能何時或是否會登陸歐洲市場。今年 1 月公佈時,OpenAI 明確排除了歐洲經濟區、瑞士和英國。更嚴格的歐盟資料隱私法規以及該功能可能被歐盟 AI 法案歸類為高風險應用,是可能的障礙。

健康 AI 的風險並非假設。在最新的放射學基準測試 RadLE 2.0 中,16 個 AI 模型無一達到人類放射科醫生的水平。主要問題在於,聊天機器人會以高置信度給出錯誤的醫學發現,而非在能力邊界時承認不確定性;而人類醫生在識別自身侷限方面表現更好。這種過度自信、說服力與諂媚(即聊天機器人傾向於附和使用者而非質疑錯誤假設)的結合,此前已導致嚴重的心理健康損害。

另一方面,也有報告顯示 AI 能在健康資料中發現醫療專業人員遺漏的模式,有時結果令人矚目。例如,電子健康記錄系統 MIRA 和 AMIE 在模擬問診中表現與初級保健醫生相當。有研究者將這類 AI 代理比作飛機的自動駕駛儀:“這些系統可以通過接管常規任務來支援和減輕醫療專業人員的負擔,但最終責任始終在醫生身上。”