GPT-5.5 Instant 将 ChatGPT 健康AI功能带给免费用户
OpenAI于2026年6月18日宣布,已大幅提升了ChatGPT处理健康与保健问题的能力。此次更新由GPT-5.5 Instant模型驱动,将公司称为"前沿健康智能"的功能带给每一位ChatGPT用户,包括免费用户。
这一公告意义重大,因为健康问题是人们使用ChatGPT的最常见原因之一。根据OpenAI的数据,每周有超过2.3亿人向ChatGPT提出健康与保健问题。这些问题涵盖从理解实验室结果、准备就医,到处理保险和建立更健康的日常习惯等各个方面。
然而,尽管OpenAI的内部基准测试呈现了乐观的图景,但独立研究和用户调查却讲述了一个更为复杂的故事:AI聊天机器人是否真的准备好可以信任用于医疗指导。
GPT-5.5 Instant健康功能的改进
GPT-5.5 Instant取代了GPT-5.3 Instant成为默认的ChatGPT模型。OpenAI表示,健康相关的改进集中在四个关键领域:
- 识别可能需要立即医疗关注的紧急情况
- 在提供指导前询问相关背景,而不是草率下结论
- 解释不确定性而不夸大对回应的信心
- 使复杂的健康信息更容易被非医学用户理解
在OpenAI最具挑战性的健康评估中,GPT-5.5 Instant现在的表现水平已可与公司的前沿Thinking模型相媲美。这些高级模型通常运行成本显著更高,因此在免费产品中达到同等的健康表现水平,代表了可访问性方面的重大转变。
OpenAI如何衡量健康表现
OpenAI使用两个专有基准测试来跟踪健康回应的进展:HealthBench和HealthBench Professional。
HealthBench使用基于医生撰写的评分标准对真实健康对话进行评分,以此评估AI回应。它评估的品质包括准确性、安全性、沟通清晰度、情境意识,以及模型是否适当地建议寻求专业护理。
根据OpenAI的GPT-5.5系统卡,完整的GPT-5.5模型在长度调整后的HealthBench得分为56.5,HealthBench Professional得分为51.8,这两项指标均优于之前的GPT-5.4模型。
该公司还进行了与人类医生的直接比较。一组医生在有无限时间和互联网访问的情况下,对代表性健康对话编写了回应。另一组医生随后在3,500次评审中评估了AI和人类的回应。OpenAI表示,GPT-5.5 Instant的回应在准确性、沟通和完整性等标准上评分高于医生撰写的回应。
或许最引人注目的声明涉及实际使用数据。OpenAI表示,它使用保护隐私的工具每周监测数十亿条健康相关消息。根据这一监测,在过去两个月中,因至少一个事实性问题被标记的回应率下降了71%。
数据背后的医生网络
OpenAI健康战略的一个关键部分是与医学专业人士的合作。该公司与来自60个国家、49种语言、26个医学专业的260多名持证医生合作。
这些医生并非通过ChatGPT治疗患者。相反,他们审查AI生成的健康回应,并评估其是否准确、清晰、适当谨慎且有用。根据OpenAI的数据,截至目前,该网络中的医生已审查了超过70万个模型回应示例。
他们的反馈塑造了OpenAI所谓的"评估标准",这些标准定义了实践中良好健康回应的样子。这一过程旨在捕捉故障模式,例如:
- 遗漏应触发就医建议的警示信号
- 未能使回应适应当地医疗系统和实践
- 在提供指导前未获取足够背景
- 对不确定的医疗情况表现出过度自信
独立研究讲述了一个不同的故事
OpenAI的内部数据看起来令人印象深刻,但这些基准测试是自行设计和报告的。根据Search Engine Journal的报道,OpenAI的健康评估结果均未发布以供独立同行评审。
与此同时,2026年的独立研究对AI健康能力描绘了一幅更为谨慎的图景。
2026年4月由Mass General Brigham团队发表的研究显示,AI聊天机器人仅在不到20%的案例中能从早期症状描述中产生适当的鉴别诊断。当模型获得更多临床细节时,表现显著提高,但高初始失败率暴露了一个严重限制。根据Becker's Hospital Review的报道,这些发现强化了为什么在任何AI辅助医疗工作流程中医生的参与仍然至关重要。
宾夕法尼亚州立大学(Penn State)在2026年6月发表的另一项研究评估了AI对日常健康查询的回应,发现其准确率约为76%。内科、神经学和皮肤科表现最差,这些专业的潜在危害更高。
公众对AI健康建议的信任仍然有限。皮尤研究中心(Pew Research Center)在2025年底进行并于2026年4月发布的调查显示,尽管22%的美国成年人至少有时使用AI聊天机器人获取健康信息,但只有18%的人认为回应高度准确。根据皮尤研究中心的数据,用户更可能将AI健康工具描述为方便(48%)而非可靠。
KFF追踪调查显示,2026年3月的调查结果印证了这些发现,报告称大约三分之一的美国成年人在过去一年中曾向AI聊天机器人寻求健康信息。根据KFF的数据,这一比例现已等于使用社交媒体获取健康信息的美国人比例。
ChatGPT健康智能与竞争对手的比较
OpenAI并不是唯一一家投资AI健康能力的公司。HealthBench Professional排行榜追踪不同AI模型在临床级健康任务上的表现,目前显示:
- Anthropic公司的Claude Opus 4.8以55.8%的得分领先
- OpenAI的GPT-5.5 Instant得分为38.4%
- MAI-Thinking-1得分为35.0%
根据LLM Stats的数据,这些是各公司自行报告的得分,排行榜目前仅包含三个评估模型。
谷歌(Google)也通过Gemini和搜索中的AI模式扩展了健康AI功能,而辉瑞(Pfizer)、Verily和Oscar等公司已推出了自己的健康聚焦AI产品。然而,ChatGPT庞大的用户基础使其对数百万人日常获取健康信息的方式产生了不成比例的影响。
这对提问健康问题的用户意味着什么
GPT-5.5 Instant的改进在其自身的评估框架内是真实且可衡量的。对于使用ChatGPT理解实验室结果或准备医生就诊问题的普通人来说,该模型现在应该比以前的版本提供更清晰、更谨慎、更符合情境的回应。
但"比以前好"和"临床可靠"之间的差距仍然显著。Mass General Brigham的研究、宾夕法尼亚州立大学的发现以及皮尤的信任数据都表明,AI健康工具最好作为专业医疗服务的补充,而不是替代品。
OpenAI本身也承认这一点。ChatGPT Health是2026年1月推出的专用健康标签,明确表示它"不用于诊断或治疗"。该平台旨在帮助用户应对日常健康问题,并在与医生交谈前做好更充分的准备。
目前,最负责任的做法是将ChatGPT的健康回应视为有根据的问题的起点,而非最终答案。
常见问题
ChatGPT适合提供医疗建议吗
ChatGPT可以帮助用户理解健康概念、解读实验室结果以及准备医生预约的问题。然而,它并非设计用于诊断或治疗。独立研究表明,AI聊天机器人可能会遗漏关键诊断,特别是当信息有限时。请始终通过持证医疗保健提供者验证AI生成的健康指导。
ChatGPT对健康问题的准确性如何
准确性因问题复杂性而异。OpenAI报告称,两个月内健康回应的事实性问题减少了71%。然而,2026年Mass General Brigham的研究发现,AI聊天机器人仅在不到五分之一的情况下能正确进行初步诊断。皮尤研究中心(Pew Research)的调查显示,只有18%的用户认为AI健康回应高度准确。
什么是HealthBench及其工作原理
HealthBench是OpenAI创建的一个开源基准测试,用于评估AI模型对现实世界健康问题的回应能力。它使用5,000个多语言对话和超过48,000个医生撰写的评估标准,来评估准确性、安全性、清晰度以及AI是否适当地建议寻求专业护理。
免费ChatGPT用户能访问健康智能改进吗
是的。GPT-5.5 Instant对所有ChatGPT用户可用,包括免费用户。OpenAI表示,该模型现在在具有挑战性的评估中与公司的高级Thinking模型的健康表现相匹配,使前沿健康智能无需付费订阅即可访问。
ChatGPT与其他AI模型在健康领域的比较
在HealthBench Professional基准测试中,Anthropic的Claude Opus 4.8目前以55.8%的得分领先,而GPT-5.5 Instant得分为38.4%。然而,不同的基准测试衡量不同的内容,截至2026年6月,排行榜仅包含三个具有自行报告得分的模型。
【全文结束】

