资讯中心

SymptomAI:面向日常症状评估的对话式AI智能体研究

📅 2026/7/24 14:45:05
SymptomAI:面向日常症状评估的对话式AI智能体研究
我们介绍了一项通过全国规模研究探索AI用于鉴别诊断与症状检查的开创性研究成果。大部分临床诊断可以仅通过语言访谈得出。这类诊断性访谈通常由临床医生通过线上或线下的医患互动来完成。尽管这类交互是症状评估的黄金标准但由于经济、地理及系统性障碍其可及性往往受到限制。当前的语言模型在经过精心整理的医学案例评估中已展现出较强的鉴别诊断能力这也凸显了其辅助诊断的潜力。然而现有评估大多依赖经过高度整理、信息详尽甚至人工合成的病例描述可能无法反映真实世界中患者的实际表现。这些评估并未捕捉到普通患者描述症状时的真实状态例如医学素养参差不齐、信息不完整以及自然对话中出现的各种复杂情况。这是一个关键缺口导致语言模型在真实场景中的表现存在较大不确定性。为填补这一缺口我们开展了一项现场对比研究测试了一组实验性对话AI智能体原型旨在探索对话式AI如何完成端到端的症状访谈与鉴别诊断评估以供研究基准测试使用。在我们最新发表的论文《SymptomAI面向日常症状评估的对话式AI智能体》中我们报告了一项全国规模随机研究n13,917的成果。在该研究中获得知情同意的参与者与五种基于Gemini Flash 2.0的SymptomAI智能体之一进行交互。研究过程中生成的所有诊断、标签和疾病关联仅用于研究分析不构成经临床确认的诊断或官方医疗评估。在与AI智能体交互两周后我们邀请参与者反馈其就医所获得的诊断结果。基于这些数据我们开展了临床专家标注研究将SymptomAI的诊断表现与真实临床医生的医疗评估进行了对比。在评估SymptomAI鉴别诊断准确性之后我们进一步将其诊断结果与参与者在与AI对话前一段时间内的Fitbit可穿戴设备生物信号进行比对。结果显示SymptomAI判断为感染性疾病病因的对话与可能指示免疫反应的生理趋势相吻合为SymptomAI的诊断性能提供了进一步佐证。研究设计与参与者互动方式本研究部署了一套对话AI智能体用于端到端的患者访谈与鉴别诊断评估。参与者可与智能体就其症状展开对话获得候选鉴别诊断列表并进入后续诊断环节。共有13,917名知情同意的研究参与者每人向五种随机分配的SymptomAI智能体之一描述自身症状各智能体在症状访谈方式上具有不同程度的灵活性。在对话过程中参与者描述症状SymptomAI则提出追问最终形成鉴别诊断结果即一份包含多个可能诊断的列表及后续建议。参与者随后可选择就医并被要求在两周后通过问卷分享就诊结果。为评估SymptomAI的表现我们还开展了临床专家标注研究由三名通过委员会认证的临床医生审阅对话记录并提供各自的评估意见即鉴别诊断。随后每位医生以盲审方式对SymptomAI和其他医生提供的鉴别诊断进行排名。研究结果显示在超过50%的案例中临床医生对SymptomAI生成的鉴别诊断的评价优于其他临床医生的诊断表明SymptomAI的诊断质量与临床医生相当甚至更优。SymptomAI生成的鉴别诊断被临床评估者评为最佳诊断的概率更高。在Top-5准确率即参与者就诊医生给出的真实诊断是否出现在鉴别诊断列表的前五项中方面临床医生判定SymptomAI生成的鉴别诊断准确的频率同样高于其他临床医生的诊断。SymptomAI生成的鉴别诊断更有可能涵盖就诊医生给出的真实诊断结果。不同访谈策略的效果比较本研究还评估了不同病史采集访谈方式的效果。参与者被随机分配至五个研究组每组采用不同的提示策略两组Dynamic Live和Dynamic Final具有完全的自由追问权限两组Fixed Canonical和Fixed Canonical的灵活版本采用医学院标准病史采集问题最后一组为无提示的基础大语言模型代表当前用户与大语言模型聊天机器人交互的默认状态。结果表明所有主动提问策略即SymptomAI主动向参与者提问的情形的表现均显著优于基础组验证了主动信息收集对提升鉴别诊断准确性的重要价值。此外研究发现SymptomAI在临床医生对自身诊断信心最低的案例中超越临床基准的幅度最为显著。生物信号分析的潜力鉴于SymptomAI相对于临床基准的准确性我们还可以探索其大规模应用潜力。目前临床标注的高昂成本限制了真实世界中人群规模数据集的分析。SymptomAI等准确的症状检查系统有望实现临床质量诊断的自动化参考标注从而为生理数据的大规模分析提供支撑——这在目前尚属不可能完成的任务。其中一个典型应用场景是将可穿戴设备的生物信号与不同类别的疾病进行关联分析。急性呼吸道感染在可穿戴生物信号中表现出最为显著的变化。为在人群规模上研究这一现象我们收集了参与者在与SymptomAI交互前最多30天内的每日生物特征数据。结果显示在用户报告症状的前几天生物信号出现了明显偏移提示症状发作的时间节点。值得注意的是组间差异是通过对SymptomAI首选候选诊断进行分类、并将呼吸道感染诊断归为一组来实现的该组排除了过敏性鼻炎或慢性阻塞性肺病等非感染性呼吸系统疾病。可穿戴生物信号偏移峰值与参与者报告症状日期的吻合为其所报告症状提供了可观测的生理学证据。基于AI的症状评估为新型研究打开了大门。通过SymptomAI分析大量症状报告并与实时Fitbit数据相结合我们可以探索多种疾病的数字生物信号表型。分析揭示了生理指标的明显变化包括心血管功能、呼吸、皮肤温度和睡眠质量这些变化发生在用户与SymptomAI对话前的数天内且与症状对话的时间高度吻合这为验证患者自报症状或提供被动数据、辅助鉴别诊断提供了可能的路径。此外实时可及性也凸显了AI症状检查的一项核心优势与可能因排班延误而推迟的传统门诊不同参与者可在症状出现时即时参与SymptomAI研究这有助于提高患者自报发病时间的准确性——这对人群规模的健康分析至关重要。局限性与未来展望SymptomAI是一项探索性研究代表了AI症状评估领域的重要研究进展展示了其为寻求症状解读的公众提供帮助的潜力。尽管人群规模的部署评估揭示了远程患者访谈的症状评估准确性但与临床医生评估进行比较时仍存在一定局限。首先鉴别诊断本身具有模糊性已报告的诊断也可能随时间推移发生变化和演进。症状评估是对某一时刻症状表现的快照由于研究规模较大我们无法对症状报告的频率和时间进行控制。部分参与者可能在更具代表性的体征尚未出现前便已报告症状而另一些患有慢性病的参与者则可能在已有多年经验的情况下在症状明显时才进行报告。未来研究可聚焦于疾病发展特定阶段的具体疾病如代谢综合征早期或呼吸道感染初期症状。研究过程中生成的所有诊断、标签和疾病关联均为AI生成仅供研究分析使用不构成经临床确认的诊断或官方医疗评估。其次在本次评估中临床医生审阅的是静态对话记录无权自行追问。若由临床医生主导症状访谈他们可能会直觉性地获取不同的信息。此外尽管近期研究表明对话式AI系统能够以媲美临床医生的细致程度和准确性采集临床数据但此类系统可能会错过肢体语言、视觉评估、病历记录等替代信号以及在基层医疗中医患之间已有的信任关系。总结本文介绍了SymptomAI——一种用于真实世界患者访谈与症状评估的实验性对话AI智能体。我们通过在人群样本上的鉴别诊断准确性展示了SymptomAI的端到端真实世界表现并阐明了SymptomAI的诊断如何支持可穿戴生物信号等人群规模信号的分析从而识别生理信号与所报告疾病之间的关联。本研究由Joe Breda、Jake Sunshine与Daniel McDuff共同主导完成。感谢来自Google Research和Google DeepMind的共同作者与合作者对本研究的贡献。QAQ1SymptomAI是什么它能诊断疾病吗ASymptomAI是谷歌研究团队开发的一种实验性对话AI智能体用于通过自然对话进行症状访谈和鉴别诊断评估。它能根据用户描述的症状提出追问并给出可能的诊断列表。但需要注意SymptomAI生成的所有诊断结果仅供研究分析使用不构成经临床确认的正式医疗诊断不能替代医生的专业判断。Q2SymptomAI的诊断准确率如何与真实医生相比怎么样A研究结果显示在超过50%的案例中临床医生对SymptomAI生成的鉴别诊断评价优于其他临床医生的诊断。在Top-5准确率方面SymptomAI生成的诊断列表包含患者就诊医生所给出真实诊断的比例也高于临床医生。尤其是在临床医生对自身诊断信心较低的案例中SymptomAI超越临床基准的幅度最为显著。Q3SymptomAI是基于哪个大语言模型开发的研究规模有多大ASymptomAI基于谷歌的Gemini Flash 2.0大语言模型开发共设计了五种不同提示策略的智能体变体。研究共招募了13,917名知情同意的参与者参与全国规模的随机对照研究是目前同类研究中规模最大的一次研究还结合了参与者的Fitbit可穿戴设备数据进行生理信号分析。