苏菲的工房

每日医学AI论文简报 v0.2

[日报]

日期: 2026-07-22 07:10 来源: PubMed | 分析: DeepSeek 期刊IF: 2024-2025 JCR


1. Current concerns and future directions of large language model ChatGPT in medicine: a machine-learning-driven global-scale bibliometric analysis.

Int J Surg (IF: 6.6) | 2026 Feb 1 | PubMed ⚠️ | DOI 分析来源: 摘要
领域: 医学人工智能(大型语言模型ChatGPT在医学中的应用)
方法: 基于机器学习的全球规模文献计量分析,包括增长率计算、逻辑回归(评估各学科发展程度)、无监督层次聚类(识别关注主题)、Walktrap算法(分析主题相关性与发展成熟度)以及地理区域分析。
核心发现: ChatGPT在医学领域发展迅速(月增长率26.97%),国际合作活跃(25.09%)。内科学最为成熟,而外科学、医疗保健、医学信息学、放射学、公共卫生和肿瘤学仍需进一步发展。全球关注点分为六大聚类,其中“ChatGPT在肿瘤患者管理与决策中的应用”为新兴研究热点,“ChatGPT在健康信息推荐中的准确性与安全性”影响力最大。伦理问题虽发展较成熟(DP=92.9%)但仍存争议;医学教育(RP=100%, DP=32.1%)和临床决策支持(RP=89.3%, DP=35.7%)高度相关但发展不足,研究前景广阔。此外,欠发达地区关注与应用极少,可能加剧全球健康不平等。
相关度(医学AI研究者): 极高。该研究系统揭示了ChatGPT在医学各学科和地区的发展现状、热点与空白,为研究者明确优先方向(如医学教育、临床决策支持)及政策制定提供了数据驱动的参考。
一句话: 基于机器学习的全球文献计量分析表明,ChatGPT在医学领域发展迅速但学科与地区差异显著,医学教育和临床决策支持是未来重点方向,且需警惕其加剧全球健康不平等的风险。

2. Human-large language model collaboration in clinical medicine: a systematic review and meta-analysis.

NPJ Digit Med (IF: 12.4) | 2026 Jan 28 | PubMed ⚠️ | DOI 📄全文 分析来源: PMC全文 领域: 临床医学、数字医学、人工智能 方法: 系统综述与荟萃分析。遵循PRISMA 2020指南,在PROSPERO注册(CRD420251068272)。检索了四个数据库,截止至2025年6月28日。纳入10项同行评审研究,另3项预印本仅用于敏感性分析。比较了人类与大型语言模型协作(H+AI)与仅人类(H)工作流程在临床推理、文档记录和解释任务中的表现。 核心发现:

  1. 诊断/解释准确性(k=2):H+AI组显示出积极趋势(风险比[RR] 1.59),但统计上不精确且不显著(95% CI 0.08至32.74),95%预测区间(PI)跨越了无效线。
  2. 综合诊断/管理评分(k=2):H+AI组有统计学显著改善(平均差[MD] +4.88个百分点,95% CI +0.65至+9.12),但PI(–31.65至41.42)表明现实世界中的高度不确定性。
  3. 时间效率(k=3):两组间无总体差异(MD +0.4分钟,95% CI −4.18至+4.97;I² = 70.1%)。
  4. 文档质量:有所改善,但事实错误率仍然很高(约26-36%),削弱了质量提升。
  5. 三臂设置:H+AI并未普遍优于仅AI。 结论:证据仍属初步,高度不确定且依赖具体情境。建议开展预注册、实用性的多中心试验,嵌入真实工作流程,并采用协调一致的核心结局指标,优先考虑安全性和错误指标,以及能够揭示不确定性并支持验证的界面。 相关度(医学AI研究者): 高。该研究直接评估了当前最受关注的LLM在临床协作中的实际效果,揭示了其潜在益处(如诊断评分提升)与重大局限性(如高错误率、时间效率无改善、结果高度不确定),为未来研究设计和临床部署提供了关键警示和方向性建议。 一句话: 这项系统综述表明,人类与LLM协作在临床医学中的初步证据高度不确定且依赖情境,虽在部分诊断评分上显示改善,但错误率高且时间效率无提升,提示需进行更严谨的实用化试验。

3. AI-assisted literature screening: A hybrid approach using large language models and retrieval-augmented generation.

Int J Med Inform (IF: 5.5) | 2026 Mar 1 | PubMed ⚠️ | DOI 📄全文 分析来源: PMC全文
领域: 医学信息学 / 系统综述方法学
方法: 本研究提出了一种结合大语言模型(LLMs)与检索增强生成(RAG)的混合文献筛选框架。研究基于6,331篇生物医学文献(主题为“LLMs在基于电子健康记录的患者护理中的应用”),评估了三种模型(DeepSeek-V3、DeepSeek-R1、GPT-4o)在三种提示策略(二元分类提示、RAG提示、基于理由的提示)下的表现。方法包括基于规则的预处理、RAG提示工程以及集成策略,并以召回率(灵敏度)为首要优化指标。
核心发现: 混合方法(规则预处理 + DeepSeek-R1 + RAG提示)在单个模型中表现最佳,精确率0.34,召回率0.77,阴性预测值1.00,G-均值0.87。集成方法在主要用例中精确率达到1.00,但其他指标未超越该混合方法。在泛化性测试(涵盖“癌症免疫治疗与靶向治疗”及“医学中的LLMs”等10个额外主题)中,DeepSeek-R1取得了最高的F1分数(0.93)和准确率(0.88),而集成方法未显示显著提升。
相关度(医学AI研究者): 高。该研究直接针对系统综述中文献筛选这一耗时瓶颈,提出了一种可复现的自动化方案,对加速医学证据综合、减少人工负担具有直接应用价值。
一句话: 本研究通过结合规则预处理、DeepSeek-R1模型与检索增强生成提示,构建了一种高召回率的混合文献筛选方法,在特定主题下召回率达0.77,并在泛化测试中保持优异性能。

4. Performance of a large language model on the reasoning tasks of a physician.

Science (IF: 44.8) | 2026 Apr 30 | PubMed ⚠️ | DOI 分析来源: 摘要
领域: 医学人工智能 / 临床决策支持
方法: 通过五项实验,以数百名医生为基线,评估大型语言模型(LLM)在复杂临床诊断推理案例中的表现;随后在一家大型三级学术医疗中心的急诊科开展真实世界研究,比较人类专家与AI提供的第二诊疗意见。
核心发现: 在所有实验中,LLM的表现均优于医生基线,且相较于前几代AI临床决策支持系统显示出持续改进。LLM已超越大多数临床推理基准。
相关度(医学AI研究者): 极高。该研究直接对比了LLM与医生在临床推理任务上的表现,并提供了真实世界急诊场景下的验证,提示LLM可能已具备超越传统基准的临床推理能力,为后续前瞻性临床试验提供了紧迫依据。
一句话: 该研究通过医生评估和真实世界急诊研究证实,大型语言模型在临床诊断推理任务上已超越医生基线表现,提示其临床决策支持能力显著提升。