OpenAI 正在向美国 18 岁及以上的用户逐步推出“Health in ChatGPT”功能。该功能最早于今年 1 月公布并测试,如今正式上线。用户可以将 Apple Health、个人医疗记录以及各类健康应用与 ChatGPT 关联,从而在对话中查看化验结果、为医生问诊做准备,以及分析睡眠或活动数据。OpenAI 承诺不会将连接的健康数据用于模型训练或广告投放。
然而,免费用户与付费订阅者获得的健康建议质量存在显著差异。免费版 ChatGPT 使用 GPT-5.5 Instant 模型,而付费用户则能调用更强大的 GPT-5.6 Sol 模型。OpenAI 的 HealthBench Professional 测试显示,GPT-5.6 Sol 在各项健康指标上均优于医生撰写的答案以及旧版 GPT-4o 和 GPT-5.5 Instant 模型。其中差距最大的领域是回答的完整性(88.0% 对 53.2%)和健康决策有用性(83.0% 对 50.8%)。OpenAI 可能以“两个模型在 HealthBench 上都优于医生回答”为由,为这种分层付费模式辩护。
不过,基准测试存在局限性。这些测试是在人工构建的评估环境中进行的,医生在测试中可能面临时间压力、疲劳或缺乏患者病历等辅助工具。实际诊疗中,医生能进行面对面检查、捕捉非语言线索,并凭借多年经验综合判断病情。OpenAI 在公告中也多次强调,ChatGPT 仍可能犯错,不能替代专业医疗建议。该公司表示,超过 260 名医生参与了该健康功能的开发。
OpenAI 的早期测试还发现,超过 70% 的参与者在专用健康版块之外提问健康问题,因为切换版块过于繁琐。因此,公司已将该功能扩展至任意对话中,同时保留独立的健康版块用于管理数据和查看历史健康聊天记录。
OpenAI 透露,每周已有超过 3 亿人向 ChatGPT 咨询健康问题,较今年 1 月的 2.3 亿人显著增长。但公司尚未说明该功能何时或是否会登陆欧洲市场。今年 1 月公布时,OpenAI 明确排除了欧洲经济区、瑞士和英国。更严格的欧盟数据隐私法规以及该功能可能被欧盟 AI 法案归类为高风险应用,是可能的障碍。
健康 AI 的风险并非假设。在最新的放射学基准测试 RadLE 2.0 中,16 个 AI 模型无一达到人类放射科医生的水平。主要问题在于,聊天机器人会以高置信度给出错误的医学发现,而非在能力边界时承认不确定性;而人类医生在识别自身局限方面表现更好。这种过度自信、说服力与谄媚(即聊天机器人倾向于附和用户而非质疑错误假设)的结合,此前已导致严重的心理健康损害。
另一方面,也有报告显示 AI 能在健康数据中发现医疗专业人员遗漏的模式,有时结果令人瞩目。例如,电子健康记录系统 MIRA 和 AMIE 在模拟问诊中表现与初级保健医生相当。有研究者将这类 AI 代理比作飞机的自动驾驶仪:“这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担,但最终责任始终在医生身上。”