中国发表 | 中国皮肤科医生银屑病临床场景大语言模型应用偏好特征

中国发表 | 中国皮肤科医生银屑病临床场景大语言模型应用偏好特征的核心信息是什么?

概 述 近日,一项由 北京大学中日友好临床医学院、中日友好医院皮肤科崔勇教授及左先波研究员团队 完成的全国性横断面研究,正式发表于国际期刊 Health Care Science 。该研究是国内首个大规模聚焦 皮肤科临床医生对大语言模型(Large Language Model, LLM)临床应用偏好 的全国性调查,系统阐明了中国皮肤科医生在银屑病临床场景中...

概 述 近日,一项由 北京大学中日友好临床医学院、中日友好医院皮肤科崔勇教授及左先波研究员团队 完成的全国性横断面研究,正式发表于国际期刊 Health Care Science 。该研究是国内首个大规模聚焦 皮肤科临床医生对大语言模型(Large Language Model, LLM)临床应用偏好 的全国性调查,系统阐明了中国皮肤科医生在银屑病临床场景中对不同LLM的选择倾向,以及对LLM回复质量的核心评价维度,为临床级LLM的研发与皮肤科场景落地提供了关键循证依据。 研究背景 皮肤科是高度依赖临床经验与视觉判断的临床专科,面临疾病谱广泛、症状重叠度高、基层医疗机构误诊率居高不下的行业痛点,亟需可靠的临床决策支持工具提升诊疗同质化水平。 属于「拓麦精要」分类。 关键词:中国发表、银屑病、人工智能。 本文由 TalkMED 拓麦医学编辑团队审核发布,内容来源清晰、引用完整,符合平台编辑方针和利益冲突披露政策。

本文核心问答

Q1: 该研究的关键数据和临床意义是什么?

研究采用卡方检验,分析医生职称、所在医院等级等人口学特征,与模型偏好、评价维度优先级的统计学关联,以P<0.05为差异具有统计学意义。亚组分析提示,仅在鉴别诊断任务中,不同职称医生的模型偏好存在统计学差异(&chi;&sup2;=21.13,df=12,p=0.0485);其余4类临床场景中,不同职称、不同医院等级的医生模型偏好均无统计学差异(均P>0.05),证实ChatGPT-4o的临床偏好度在不同层级的中国皮肤科医生中具有高度一致性。亚组分析显示,医院等级与医生最看重的评价维度存在显著统计学关联(&chi;&sup2;=27.667,df=9,p=0.0011),其中基层医院皮肤科医生相较三级、二级医院同行,对可溯源性的优先级显著更高;不同职称医生对各评价维度的优先级偏好无统计学差异(&chi;&sup2;=13.88,df=9,p=0.127)。

Q2: 这篇文章的来源和作者资质如何?

参考文献DOI:10.1002/hcs2.70057。发布于2026-03-11。

Q3: 本文涉及哪些核心医学术语和研究方向?

本文围绕「中国发表 | 中国皮肤科医生银屑病临床场景大语言模型应用偏好特征」主题,涉及中国发表、银屑病、人工智能等核心术语和研究方向。研究方法方面,统计分析采用卡方检验、亚组分析等方法。

Q4: 该研究采用了什么研究设计和方法?

本研究采用横断面研究设计。

来源:拓麦精要

 

概 述

近日,一项由北京大学中日友好临床医学院、中日友好医院皮肤科崔勇教授及左先波研究员团队完成的全国性横断面研究,正式发表于国际期刊Health Care Science。该研究是国内首个大规模聚焦皮肤科临床医生对大语言模型(Large Language Model, LLM)临床应用偏好的全国性调查,系统阐明了中国皮肤科医生在银屑病临床场景中对不同LLM的选择倾向,以及对LLM回复质量的核心评价维度,为临床级LLM的研发与皮肤科场景落地提供了关键循证依据。

 

研究背景

皮肤科是高度依赖临床经验与视觉判断的临床专科,面临疾病谱广泛、症状重叠度高、基层医疗机构误诊率居高不下的行业痛点,亟需可靠的临床决策支持工具提升诊疗同质化水平。近年来,LLM在辅助疾病诊断、治疗方案制定、医学知识整合等方面展现出巨大应用潜力,但当前相关研究多聚焦于模型的客观性能评测,针对皮肤科医生这一终端用户,对LLM生成内容的主观感知、评价标准与使用偏好的研究仍存在显著空白,尤其缺乏基于真实临床任务、覆盖全国范围的以用户为中心的系统性评估。

 

研究设计与方法

本研究严格遵循《互联网电子调查结果报告清单(CHERRIES)》指南开展,于2024年12月25日至2025年1月22日,通过问卷星平台开展全国性网络横断面调查。研究通过省级与院级皮肤科质控网络相关微信社群招募研究对象,最终纳入来自全国33个省级行政区的1247名在职皮肤科医生的有效问卷数据。

 

研究纳入当前主流的5款LLM,包括ChatGPT-4o、Kimi.ai、豆包、左医GPT、灵犀智能体,围绕银屑病临床诊疗核心场景,设置病因、临床表现、鉴别诊断、治疗方案、病例分析5大类临床问题,评估皮肤科医生对不同模型生成回复的偏好。同时,研究明确定义了LLM回复质量的5大核心评价维度——准确性、全面性、简洁性、逻辑性、可溯源性,要求受试者仅可选择1个维度评为“非常重要”,以此明确临床医生的核心评价优先级。

 

研究采用卡方检验,分析医生职称、所在医院等级等人口学特征,与模型偏好、评价维度优先级的统计学关联,以P<0.05为差异具有统计学意义。

 

核心研究结果

ChatGPT-4o在全临床场景中获得一致最高偏好

研究结果显示,ChatGPT-4o在全部5类银屑病临床场景中,均成为皮肤科医生最偏好的模型,在各场景中的最高选择票数分别为:病例分析(n=740)、鉴别诊断(n=707)、临床表现(n=666)、治疗方案(n=656)、病因(n=602)。Kimi.ai为第二偏好模型,在治疗、病因场景中表现突出;其余3款模型选择率相对较低,左医GPT整体获票最少。

 

亚组分析提示,仅在鉴别诊断任务中,不同职称医生的模型偏好存在统计学差异(χ²=21.13,df=12,p=0.0485);其余4类临床场景中,不同职称、不同医院等级的医生模型偏好均无统计学差异(均P>0.05),证实ChatGPT-4o的临床偏好度在不同层级的中国皮肤科医生中具有高度一致性。

 

准确性为首要评价标准,可溯源性在基层医院优先级显著提升

在LLM回复质量的评价维度中,准确性是皮肤科医生的首要核心标准,共有635名医生将其评为“非常重要”,占比远超其他维度;全面性、可溯源性、简洁性、逻辑性被评为“非常重要”的人数分别为50、46、41、33。同时,绝大多数医生将其余4个维度均评为“重要”及以上,其中可溯源性(n=837)、全面性(n=825)、逻辑性(n=821)获得了极高的重要性认可度,证实上述维度均为临床医生评估LLM临床适用性的关键指标。

 

亚组分析显示,医院等级与医生最看重的评价维度存在显著统计学关联(χ²=27.667,df=9,p=0.0011),其中基层医院皮肤科医生相较三级、二级医院同行,对可溯源性的优先级显著更高;不同职称医生对各评价维度的优先级偏好无统计学差异(χ²=13.88,df=9,p=0.127)。

 

不同LLM的临床输出质量存在特征性差异

研究团队由3名皮肤科与人工智能领域专家,对5款模型的生成内容进行了独立定性评审,结果显示:

• Kimi.ai在准确性、全面性、逻辑性、来源可溯源性方面表现优异,是唯一在回复中纳入明确引用文献的模型,高度契合临床决策支持的透明性与可验证性需求;

• ChatGPT-4o回复清晰简洁、语言流畅自然,豆包回复内容更为详尽,但二者均缺乏明确参考文献,限制了内容的临床可溯源性;

• 灵犀智能体适用于低风险场景的通用信息检索,但临床专业深度不足;

• 左医GPT存在内容准确性与逻辑一致性缺陷,部分回复的事实正确性存疑。

结 论

本研究是国内首个大规模、全国性的皮肤科医生LLM临床应用偏好调查,填补了国内皮肤科领域以临床终端用户为中心的LLM应用评估空白。研究结果证实,尽管ChatGPT-4o在银屑病临床场景中获得了中国皮肤科医生的广泛偏好,但临床医生对LLM的临床需求是多维度的——除了核心的内容准确性,可溯源性、逻辑性同样是决定LLM临床适用性的关键指标,尤其对于基层医疗机构的医生而言,来源可追溯的内容是其临床应用的核心前提。

 

同时研究发现,LLM回复的可读性、语言自然度会显著影响医生的主观偏好,提示未来临床级LLM的研发,不仅要聚焦医学内容的准确性与专业性,更要兼顾内容呈现形式、来源透明度、结构逻辑性,贴合不同层级临床医生的实际诊疗需求,才能真正实现LLM在皮肤科临床场景的安全、规范化落地。

 

本研究也存在一定局限性,包括便利抽样导致的样本向三级医院倾斜、仅聚焦银屑病单病种、未纳入多模态诊疗等更丰富的临床场景、仅评估医生主观偏好未分析LLM对实际诊疗结局的影响等。未来研究将进一步纳入客观量化评价指标,拓展疾病谱与临床应用场景,为临床级LLM的研发与皮肤科临床落地提供更全面的循证依据。

 

通讯作者:

Yong Cui, China-Japan Friendship School of Clinical Medicine Peking University, Department of Dermatology China-Japan Friendship Hospital, Beijing, China.

Xianbo Zuo, Department of Dermatology China-Japan Friendship Hospital, Beijing, China.

 

供稿:Meredith

校对:Jaya

排版:Vanessa

声明:

编辑部对刊载内容进行仔细审阅以尽力保持其准确性,但对稿件的使用或其中的任何错误、遗漏或不准确之处等均不承担任何责任。文中所表达的任何观点不代表编辑部的观点,文中提及或排除任何方法或药物并不构成对其使用的提倡、建议或拒绝,因此在为本文中提及的任何产品开处方前,请查阅生产商的最新处方信息。内容仅限医疗卫生专业人士学习交流使用,非医疗卫生专业人士请主动退出浏览与阅读,否则由此产生的相关风险与后果应自行承担。

本文封面图ID 4173251 | pexels.com。在未获得正式授权前,所有转载及使用文中内容均为侵权。

 

原文来自:Yang J, Xu J, Song X, et al. Preferences of  Chinese Dermatologists for Large Language Model Responses in Clinical  Psoriasis Scenarios: A Nationwide Cross-Sectional Survey in China. Health Care Sci. 2026;5(1):40-48. Published 2026 Feb 11. doi:10.1002/hcs2.70057

 

#PsO:Psoriasis,银屑病

#AI:Artificial Intelligence,人工智能

 

本文研究方法与设计类型

本研究采用横断面研究设计。统计分析采用卡方检验、亚组分析等方法。

本文临床背景与意义

本文属于中国发表、银屑病、人工智能等医学领域。该研究评估的终点指标包括总生存期(OS)。

引用格式:中国发表 | 中国皮肤科医生银屑病临床场景大语言模型应用偏好特征. 发布日期:2026-03-11. 来源:TalkMED拓麦. URL: https://portal.talkmed.com/news/3571 参考DOI: https://doi.org/10.1002/hcs2.70057

2026-03-11

分享

收藏

点赞

媒体矩阵
  • 拓麦TalkMED
  • 拓麦精要
  • 拓麦Derm
  • 拓麦Neurol
  • 拓麦Diabetes
  • ONCO前沿
  • 血液前沿
  • 血管资讯
  • MED WIKI
  • 三七二十e
下载桌面应用
苹果应用下载
安卓应用下载