每日医学AI论文简报 v0.3
[日报]日期: 2026-08-15 来源: PubMed + arXiv | 分析: DeepSeek-v4-flash(PMC HTML解析,含表格+图注) 过滤: 近3天滚动窗口 | 期刊门槛(IF≥3/未收录放行) | 去重+状态追踪(PMID/DOI/标题) | 双层相关度(硬规则+LLM显式标准) | 研究设计识别 | PMC全文优先(不足摘要级补齐) | 复合排序
💡 今日学习推荐 CS231n 卷积神经网络(Stanford) — 一、卷积神经网络(CNN)架构(进度0%) ⏭ 下一步:CS229 机器学习讲义(Andrew Ng)
1. A large language model-driven multidisciplinary AI agent system predicts delirium in emergency critically ill patients. 🆕
Cell Rep Med (IF: 45.5) | 2026 Aug 13 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: Review
分析来源: 期刊全文(隧道下载)
领域: 医学人工智能,急诊危重症患者谵妄风险预测
方法: 开发了DeLiriuMAgents,一种大语言模型驱动的多智能体系统,整合基于机器学习的风险预测、急诊医学/神经病学/精神病学虚拟专科医师的LLM推理,以及基于检索增强生成(RAG)的医学证据,模拟多学科临床会诊以做出最终预测。使用MIMIC-IV进行模型开发和内部验证,使用北京大学(PKU)两家医院的多中心队列和eICU-CRD队列进行外部验证,并通过图表审查和临床医生评估验证报告的可解释性和实用性。
核心发现: 在MIMIC-IV、PKU和eICU-CRD验证集上分别达到准确率0.749/0.731/0.670,敏感性0.762/0.708/0.708,特异性0.747/0.736/0.665。多中心外部验证支持模型在不同队列间的可迁移性,临床医生评估确认了多智能体生成的风险报告的可解释性和有用性。
相关度(医学AI研究者): 高。该研究展示了LLM驱动的多智能体系统在急诊危重症场景下进行谵妄风险预测的可行性,通过整合数据驱动预测、专科推理和证据检索提升了模型的可解释性与交互性,为医学AI在时间敏感、数据有限的临床环境中的应用提供了新范式。
2. Diagnostic accuracy of electronic medical record retrieval methods and a large language model for identifying cardiovascular events: a multisite retrospective validation study in a medical system in the United States. 🆕
BMJ Open (IF: 93.6) | 2026 Aug 13 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别
分析来源: PMC全文
领域: 心血管事件识别、电子病历(EMR)检索方法、大语言模型(LLM)在医学中的应用
方法: 多站点回顾性诊断准确性研究,比较四种自动电子病历检索方法(ICD编码、主要诊断、问题列表、零样本LLM工作流)与临床医师人工图表判定作为参考标准,在免疫检查点抑制剂治疗队列(n=2258)和经导管主动脉瓣置换术队列(n=1426)中评估缺血性卒中/TIA、心肌梗死、心力衰竭恶化/住院及复合主要不良心血管事件(MACE)的识别性能,采用AUC、敏感性、特异性和净重分类改进等指标。
核心发现: LLM辅助工作流在两个队列中多数结局的AUC最高:队列1中卒中AUC 0.920、心肌梗死AUC 0.938、复合MACE AUC 0.880;队列2中所有结局AUC均最高(卒中0.915、心肌梗死0.928、心力衰竭0.844、复合MACE 0.862)。但ICD编码在队列1中对心力衰竭AUC更高(0.882 vs LLM 0.873),且队列1中LLM与ICD的AUC差异均无统计学意义;队列2中LLM对卒中和复合MACE的AUC显著更高。性能因结局和队列而异,ICD检索在某些情况下仍有竞争力。
相关度(医学AI研究者): 高。该研究直接评估LLM在真实多站点EMR中识别心血管事件的能力,为医学AI在表型识别、自动化结局判定和临床研究中的应用提供了验证证据,也提示需结合具体场景选择合适的检索方法。
一句话: LLM辅助工作流在识别心血管事件方面表现良好但具有情境依赖性,ICD编码在部分结局和队列中仍具竞争力,两者可互补使用。
3. Academic Medical Centers Partner with Industry for Co-Development of Clinical AI. 🆕
J Med Internet Res (IF: 5.8) | 2026 Aug 14 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别
分析来源: PMC全文
领域: 医学人工智能(临床AI)与学术医疗中心-产业合作
方法: 新闻与观点分析,基于对近期美国学术医疗中心(AMCs)与科技公司合作案例的报道与评论。
核心发现: 过去两年中,美国学术医疗中心与科技公司之间的合作步伐显著加快。文章报道了多项知名合作,并探讨了这些合作对临床AI未来发展的潜在影响,涉及领域包括环境临床文档、对话式AI和精准医疗等。
相关度(医学AI研究者): 中等。该文为新闻视角,无原始实验数据,但有助于研究者了解临床AI领域的产业合作趋势和商业化方向。
一句话: 美国学术医疗中心与科技公司联合开发临床AI的合作日益增多,可能重塑未来临床AI的落地模式。
4. Large Language Model Simplification of Open Access Pediatric Strabismus Literature: Cross-Sectional Validation of Readability and Clinical Fidelity. 🆕
JMIR Form Res (IF: 5.8) | 2026 Aug 14 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: Review
分析来源: PMC全文
领域: 医学人工智能与健康素养;LLM用于医学文献患者友好化简化;小儿斜视领域患者教育
方法: 横断面验证研究。纳入2022至2025年间85篇开放获取、同行评审的小儿斜视文献,按斜视亚型、手术相关性和出版类型分层。使用DeepSeek-V3通过结构化提示生成简化摘要,要求阅读水平不超过七年级、字数不超过800词,并严格保留具有医学意义的数据。主要结局为Flesch-Kincaid Grade Level(FKGL)和Simple Measure of Gobbledygook(SMOG)可读性评分;次要结局为临床保真度,由2名小儿斜视专科医师独立评估。
核心发现: 原始文献平均FKGL为15.79(SD 1.53),SMOG为14.41(SD 1.09)。LLM简化后FKGL降至7.84(SD 1.30),平均降低7.95(95% CI 7.52-8.38;P<.001);SMOG降至7.68(SD 0.94),平均降低6.73(95% CI 6.42-7.04;P<.001)。简化后不同斜视亚型及是否手术相关之间可读性无显著差异;但病例报告FKGL(8.35)略高于综述(7.89)和原始研究(7.48),调整后P=.003。临床保真度方面,81/85(95.29%)评为良好,4/85(4.71%)为中等,且均为综述类文献,0%为差。
相关度(医学AI研究者): 高度相关。该研究提示LLM可大规模降低医学文献阅读门槛,达到美国国立卫生研究院建议的八年级及以下阅读水平,同时较好保留临床核心信息;但LLM输出仍需专科医师监督,尤其是对综述类文献的简化可能需要更强的事实核查。
一句话: 使用DeepSeek-V3可将小儿斜视文献阅读难度降低约8个年级,并保持较高的临床保真度,是借助LLM提升患者健康素养和促进共享决策的可行工具。
5. Large Language Model-Based Identification of Acute Coronary Syndrome Management Delays. 🆕
Am J Cardiol (IF: N/A) | 2026 Aug 15 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: 摘要
领域: 心血管急症管理、自然语言处理与临床质量评估
方法: 基于大语言模型的提示词验证方法,纳入2022年7月至2025年6月NYU内科住院患者入院记录及心内科会诊记录,构建ground truth(n=161),由三名医生用验证工具审查不一致病例,比较有延迟与无延迟患者的临床特征和关键治疗时间。
核心发现: 大语言模型识别ACS管理延迟的阳性预测值为52%(35/67)。发生管理延迟的患者更可能是高龄、女性、首选语言非英语或西班牙语;延迟组接受肝素、阿司匹林和心导管检查的平均时间显著更长(肝素:56.91±56.78 vs 18.97±13.76小时;阿司匹林:13.94±16.64 vs 8.23±9.82小时;心导管:65.12±51.65 vs 39.51±44.19小时,p值均显著)。
相关度(医学AI研究者): 展示了大语言模型在医疗流程延迟自动识别中的可行性与局限,提示模型可扩展用于质量监测,但当前阳性预测值中等,需优化提示或结合更多上下文,且识别出的延迟人群差异有助于针对性干预。
一句话: 该研究开发并验证了一种基于大语言模型的ACS管理延迟识别系统,能规模化筛查延迟案例,并发现延迟患者具有特定人口学特征和更长的关键治疗时间。
🔬 新增AI临床试验
近1日新增: 64 项 | 数据源: ClinicalTrials.gov
NCT05372627 NHLBI-Emory Advanced Cardiac CT Reconstruction
状态: NOT_YET_RECRUITING | 期: N/A | 赞助: | 招募: 1000 条件: Structural Heart Disease
NCT06893939 Limited Versus Extended Trophic Feeding (LET-FEED) Trial
状态: RECRUITING | 期: PHASE2, PHASE3 | 赞助: | 招募: 350 条件: Sepsis; Length of Stay; Mortality
NCT07766252 CCHW-delivered CFH-based Cancer Prevention Program Among Chinese Americans
状态: COMPLETED | 期: NA | 赞助: | 招募: 1129 条件: Cancer
NCT07572136 Anti-CRLF2-R/TSLPR Chimeric Antigen Receptor T Cells (TSLPR-CART) in Participants With Recurrent or Refractory CRLF2-R/TSLPR-Overexpressing B-Cell Acute Lymphoblastic Leukemia (B-ALL)
状态: NOT_YET_RECRUITING | 期: PHASE1 | 赞助: | 招募: 57 条件: B-All; Acute Lymphoblastic Leukemia
NCT07766694 Evaluating the Preferences and Tradeoffs of AI-based Electronic Consultations for Older Adults in Primary Care
状态: NOT_YET_RECRUITING | 期: NA | 赞助: | 招募: 220 条件: Primary Care Patients; Primary Care Provider
📄 医学AI预印本速览(arXiv 近3天)
1. SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization Weihan Meng, Hongzhu Guo, Yi Jing et al. | 2026-08-13 | arXiv Sparse autoencoders (SAEs) are proposed to extract numerous features from large language model (LLM) representations, yet explaining these features still relies primarily on external observation. This reliance leads to superficial explanations inferred from observed model behavio…
2. Intervention-Aware Clinical World Model for Post-Op Outcome Forecasting in Cardiology Yunsung Chung, Yingshuo Liu, Abboud F. Hassan et al. | 2026-08-13 | arXiv Many clinical prediction models treat post-intervention outcomes as a one-step mapping from baseline measurements to a future endpoint. However, recovery after a procedure often unfolds as an irregular trajectory: clinical observations, medication changes, repeat interventions, a…
3. DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina et al. | 2026-08-13 | arXiv Current large language model development relies on massive, often non-permissible datasets, creating a high barrier for researchers committed to open-source and ethically sourced data. We introduce Mimir v1, a 1-billion-parameter language model based on the Hierarchical Reasoning…
4. MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination Saisha Shetty, Satvik Tripathi, Austin Lin et al. | 2026-08-13 | arXiv We present Multi-Agent Reasoning and Coordination (MARC), an open-source framework that replaces monolithic LLM prompting with deterministic multi-agent orchestration for clinical reasoning. MARC coordinates role-specialized agents for extraction, reasoning, answer generation, an…
5. AaLLM: An End-to-End Analog Circuit Design Framework from Topology Generation to Sizing Using Large Language Models Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi | 2026-08-13 | arXiv Analog circuit design is a time-consuming, iterative process in a nonlinear and high-dimensional design space that relies heavily on expert intuition. Among recent developments, LLMs have introduced a promising approach by bringing natural language reasoning to circuit design tas…
6. MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification Daniel Perkins, John Squires, Janou Milligan et al. | 2026-08-13 | arXiv Modern image classification models excel when trained on single task-specific datasets but often struggle to generalize across domains and difficulty levels. We propose ARMDIL, an Adaptive Router for Multi-Domain Image classification with LLMs. ARMDIL is an ensemble that uses a m…
7. CAPRI: Contract-Aware Proof Repair for Isabelle Jim Woodcock, Gabriel Leite, Augusto Sampaio et al. | 2026-08-13 | arXiv We address the use of large language models (LLMs) to help discover Isabelle proofs. An Isabelle build establishes that the submitted theory is accepted, but not that an LLM changed only what the developer authorised. We present CAPRI, a contract-aware repair workflow in which Is…
8. LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman et al. | 2026-08-13 | arXiv Autonomous vehicles depend on large safety-critical software stacks, where weaknesses reachable from adversarial inputs may affect steering, braking, or other control decisions. Static analysis can identify candidate sites, but dynamically confirming exploitability requires execu…