苏菲的工房

每日医学AI论文简报 v0.3

[日报]

日期: 2026-08-11 来源: PubMed + arXiv | 分析: DeepSeek-v4-flash(PMC HTML解析,含表格+图注) 过滤: 近3天滚动窗口 | 期刊门槛(IF≥3/未收录放行) | 去重+状态追踪(PMID/DOI/标题) | 双层相关度(硬规则+LLM显式标准) | 研究设计识别 | PMC全文优先(不足摘要级补齐) | 复合排序


💡 今日学习推荐 CS231n 卷积神经网络(Stanford) — 一、卷积神经网络(CNN)架构(进度0%) ⏭ 下一步:CS229 机器学习讲义(Andrew Ng)


1. Intelligent Framework for Adverse Drug Event Identification Using Large Language Models and Retrieval-Augmented Generation: Development and Evaluation Study. 🆕

J Med Internet Res (IF: 5.8) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: PMC全文
领域: 药物警戒 / 不良药物事件识别,基于中文临床文本的大语言模型应用
方法: 构建中文临床ADE语料库和知识库,评估DeepSeek-V3、ERNIE 3.5-8K、GPT-4o三种大语言模型在无增强生成、静态增强生成和检索增强生成三种提示策略下的ADE识别性能,采用精确率、召回率和F1值进行多层次匹配评估,并通过真实临床进展笔记验证鲁棒性。
核心发现: 检索增强生成(RAG)整体优于非增强和静态增强策略;最佳配置DeepSeek-V3结合RAG实现L3级F1为0.9638(95% CI 0.9541-0.9727);RAG将GPT-4o召回率从0.6419提升至0.9241;在真实数据上特异性为0.9821,F2为0.8885,并有效减少遗漏和误报。
相关度(医学AI研究者): 高。研究提供了首个中文临床ADE开放基准语料库,并验证了RAG可缓解大语言模型幻觉,为医学AI在药物安全监测和临床决策支持中的落地提供了可复现的方法框架。
一句话: 将领域知识库与大语言模型通过RAG结合,可显著提升中文临床笔记中不良药物事件的识别准确性,为药物警戒提供可靠技术路径。

2. TrustEndo: A Conformal-Calibrated MLLM With Retrieval-Augmented Reasoning for Trustworthy Gastroscopic Diagnosis. 🆕

IEEE J Biomed Health Inform (IF: 7.5) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: 摘要
领域: 胃肠镜诊断,多模态大语言模型,可信人工智能
方法: 提出TrustEndo框架,包含概念锚定视觉-语言对齐器(CAVLA)、证据增强诊断记忆(EADM,多模态检索增强)、共形安全层(CSL,对多模态输出提供覆盖保证与语义级可靠性评估)、以及领域自适应细化(DAR)模块,基于Qwen-3.5和GLM-5.0构建
核心发现: 在LGLDD、Endo21和HyperKvasir数据集上,AP达40.9%(最佳MLLM基线为39.5%),幻觉率降至7.8%(基线15-20%),ECE为0.038(基线0.118以上),检测结果的经验覆盖率达95%
相关度(医学AI研究者): 高,直接解决MLLM在胃镜诊断中的幻觉与缺乏统计可靠性保证问题,并提供跨中心泛化方案
一句话: 通过概念锚定、检索增强与共形预测实现可信赖的胃镜诊断多模态大语言模型框架。

3. Using Natural Language Processing to Identify Adverse Drug Events Characterized by Medication Replacement in Primary Care Electronic Medical Records: Algorithm and Validation Study. 🆕

J Med Internet Res (IF: 5.8) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: PMC全文
领域: 药物不良事件检测,自然语言处理在医学中的应用
方法: 使用MaPCReN电子病历,人工标注临床笔记中的ADE;设计了两种标注波次(Wave 1和Wave 2);训练并评估多种NLP模型,包括BioBERT、BlueBERT、大型语言模型(LLM)分类器和LLM嵌入分类器;对原始笔记和经过SOAP结构重写的笔记进行比较;使用Mistral-7b-Instruct提取主诉和潜在病因列表;采用精确率、召回率和F1分数评估性能。
核心发现: 基于SOAP重写笔记训练的模型总体优于基于原始笔记训练的模型;SOAP Rewrite+ LLM Embeddings分类器达到最高平均F1分数(72.53%;95% CI 62.40%-81.82%);BioBERT-SOAP weighted达到最高平均召回率(76.34%;95% CI 62.69%-89.66%);在ADE阳性测试笔记上的端到端跨度级抽取(命名实体识别+关系抽取)平均松弛F1分数为0.455,关系抽取是瓶颈。
相关度(医学AI研究者): 高。该研究直接面向临床文本中的不良药物事件识别,对比了多种前沿NLP模型,并结合SOAP结构化重写和LLM嵌入方法,为医学AI研究者提供了可复现的技术路径和性能基准。
一句话: 本研究通过SOAP结构重写和LLM嵌入分类器提升了临床笔记中不良药物事件的检测性能,但关系抽取仍是关键瓶颈。

4. CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction. 🆕

J Imaging Inform Med (IF: N/A) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: 摘要 领域: 医学影像人工智能,放射学报告自动生成,不确定性量化 方法: 基于视觉语言模型(VLM)的自动化放射学报告起草(ARRD),开发CONRep框架,包含基于标签和基于句子两种流程。基于标签流程使用ChestX-Det10数据集(3001张胸片,10种胸部病理),评估两种VLM分类范式,并应用保形预测(CP)在三个显著性水平(α=0.05, 0.1, 0.2)将输出分为确定(高置信)与不确定(低置信)子组,比较AUROC。基于句子流程使用Open-I胸片数据集(3660例),以放射科医生撰写的印象部分为金标准,由decoder-only VLM生成印象文本,CP将输出分为确定、不确定或高度不确定子组,用对比VLM计算余弦相似度评估语义一致性,并用独立大语言模型(LLM)进行语义一致性和临床一致性评分。 核心发现: 两个流程中,被分类为确定的输出与金标准的一致性显著优于不确定输出。基于标签实验中,确定子组在多个发现上AUROC显著更高(P < 0.05)。基于句子实验中,确定病例的生成印象与参考印象语义相似性显著更高(P < 0.001),独立LLM评估也确认确定病例获得显著更高的一致性和匹配率(P < 0.001)。CONRep提供了一种模型无关的不确定性感知ARRD框架,可提升透明度、可靠性和临床可用性。 相关度(医学AI研究者): 高。该研究为VLM生成的放射学报告提供了实用的不确定性量化方法,有助于临床部署中的风险控制与质量评估,对医学AI可信度提升具有直接参考价值。 一句话: CONRep利用保形预测为视觉语言模型生成的放射学报告提供不确定性分层,确认高置信输出与临床金标准一致性显著更高,支持更安全的临床集成。

5. Artificial Intelligence for Diagnosis of Esophageal Manometry: A Narrative Review. 🆕

Curr Gastroenterol Rep (IF: N/A) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: Review 分析来源: PMC全文
领域: 消化内科/食管动力障碍人工智能诊断
方法: 叙述性综述,综合22项研究、涵盖5000余例患者,归纳为早期机器学习、深度学习、多模态与大语言模型三个发展阶段
核心发现: AI辅助食管高分辨率测压(HRM)诊断准确率为71%–97%;可自动化识别蠕动模式并可能发现超越芝加哥分类的压力表型;尚无研究证明可改善患者结局;AI在动力培训中的应用尚未充分探索
相关度(医学AI研究者): 高,系统梳理AI用于食管动力诊断的技术演进、性能水平与转化缺口,提示人机协作是临床应用的最可能路径
一句话: 这篇综述显示AI诊断食管动力障碍准确率达71%–97%,有望缩小基层与专家中心的诊断差距并加速培训,但尚缺乏对患者结局的验证。

6. Prompt Engineering of Large Language Models for Medication Dose Calculation. 🆕

Clin Pharmacol Ther (IF: N/A) | 2026 Aug 9 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: PMC全文
领域: 临床药理学 / 医学人工智能(大语言模型在电子健康档案药物剂量提取中的应用)
方法: 研究者对4295条药物记录进行人工剂量标注,覆盖9个治疗类别;测试5个公开可用的大语言模型(Mistral-small、Llama 3–70B、Nova lite、DeepSeek、Claude 3.5 Sonnet),通过迭代提示工程优化;使用R²和分类准确率评估人工剂量与模型输出之间的一致性,并计算组内相关系数。
核心发现: Claude表现最佳(R²=99.32%,准确率=92.36%),DeepSeek次之(R²=97.17%,准确率=90.31%);提示优化后所有模型均有改进(Claude R²=99.34%,准确率=92.78%;DeepSeek R²=98.89%,准确率=91.01%),其中Mistral-small改进最显著(ΔR²=39.03%)。模型间总体一致性中等(ICC=0.73)。在测试集中Claude和DeepSeek仍保持高指标。研究表明LLM可从EHR中高准确率地自动提取药物剂量信息,但性能差异与模型对提示策略的响应有关。
相关度(医学AI研究者): 高。该研究系统验证了LLM在真实世界临床数据中提取药物剂量的能力,提示工程优化可显著提升模型性能,为自动化药物核对、临床决策支持和药物流行病学研究提供了可行方法和基线结果。
一句话: 该研究通过提示工程优化,证明Claude和DeepSeek等大语言模型可从电子健康档案中高准确率自动提取药物剂量,有望辅助临床药物核对与研究工作。

7. Zero-shot segmentation and tumor diameter measurement of soft tissue sarcomas on MRI using a multimodal large language model. 🆕

Skeletal Radiol (IF: N/A) | 2026 Aug 10 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: 摘要
领域: 医学影像AI,软组织肉瘤(STS)MRI分割与测量
方法: 回顾性研究,使用TCIA公共数据集(51例STS患者),评估Gemini 3.0多模态大语言模型在脂肪抑制T2加权或STIR图像上的零样本分割和直接直径估计性能;以放射科医师手动分割及测量为参考,计算Dice相似系数(DSC)、组内相关系数(ICC)及Bland-Altman分析,并用Bootstrap比较两种自动测量方法。
核心发现: Gemini 3.0零样本分割平均DSC为0.935±0.082,接近放射科医师间一致性(0.949±0.037),重复性高(DSC 0.981±0.038);基于分割的肿瘤直径测量ICC为0.976,显著高于直接估计的0.922(p=0.027),且平均偏倚更小(-0.5 mm vs -5.0 mm)。
相关度(医学AI研究者): 高,证明多模态大语言模型可零样本完成医学图像分割并支持更可靠的定量测量,为无需任务特定训练的通用医学影像分析提供新思路。
一句话: Gemini 3.0对MRI软组织肉瘤零样本分割准确度高,且基于分割的肿瘤直径测量优于模型直接估计。


🔬 新增AI临床试验

近1日新增: 82 项 | 数据源: ClinicalTrials.gov

NCT07756541 POP SINGER Randomized Clinical Trial

状态: RECRUITING | 期: NA | 赞助: | 招募: 130 条件: Chronic Pain

NCT07756372 A Multicenter, Superiority Randomized Controlled Trial of Three Interventions for Patients With a Progressive Collapsing Foot Deformity

状态: NOT_YET_RECRUITING | 期: NA | 赞助: | 招募: 198 条件: Progressive Collapsing Foot Deformity

NCT07336446 A Trial to Learn How Safe AZD9750 is and How Well it Works in People With Metastatic Prostate Cancer When Given With or Without Other Anticancer Drugs

状态: RECRUITING | 期: PHASE1, PHASE2 | 赞助: | 招募: 300 条件: Prostate Cancer

NCT04289571 Virtual Reality Mobility Assessment of Functional Vision in Retinal Disease

状态: RECRUITING | 期: PHASE1 | 赞助: | 招募: 165 条件: Cone-Rod Degeneration; Rod-Cone Degeneration

NCT06136221 Testing LiverWatch, a Home-Based Remote-Monitoring Intervention for Advanced Liver Disease

状态: ACTIVE_NOT_RECRUITING | 期: NA | 赞助: | 招募: 110 条件: Cirrhosis, Liver; End Stage Liver DIsease; Symptoms and Signs