苏菲的工房

医学高质量论文简报(日报)

[日报]

日期: 2026-08-18 来源: PubMed | 分析: DeepSeek-v4-flash(全文分析) 准入: 期刊白名单(IF≥5, 130刊) | 类型(研究/综述/方案/指南) | 必须全文(≥3000字符) | 去重+状态追踪 | PubPeer排除 | 近7天滚动窗口 | 复合排序


💡 今日学习推荐 CS231n 卷积神经网络(Stanford) — 一、卷积神经网络(CNN)架构(进度0%) ⏭ 下一步:CS229 机器学习讲义(Andrew Ng)


1. Assessing the prognostic value of artificial intelligence for opportunistic prediction of coronary artery calcium score on routine non-gated computed tomography in patients treated with immune checkpoint inhibitors. 🆕

Digit Health (IF: 23.8) | 2026 Jan-Dec | PubMed ⚠️ | DOI | ✅ 高置信 | 研究设计: 未识别 分析来源: PMC全文
领域: 心血管肿瘤学、人工智能影像、免疫检查点抑制剂
方法: 回顾性多中心研究(Mayo Clinic三个院区),纳入2011–2022年间ICI治疗前3个月内行胸部非门控CT的1,873例患者,排除既往冠脉血运重建者。使用已公开验证的机器学习模型从非门控CT中自动计算AI-CAC评分,分为0、1–99、100–399、≥400四类。采用Cox回归分析AI-CAC与1年心肌梗死(MI)及全因死亡率的关联。
核心发现: 较高AI-CAC负担与1年MI风险增加相关(总体p=0.0032);AI-CAC与全因死亡率无显著关联(p=0.79),可能因癌症相关死亡率高(1年50.7%)。仅15%患者使用他汀,而三分之一患者CAC>100。结论认为机会性AI-CAC评估对ICI治疗患者的MI风险具有适度预后价值,可识别心血管预防优化机会,但不应影响ICI治疗决策。
相关度(医学AI研究者): 高——展示AI在常规非门控CT上自动量化冠脉钙化的临床应用价值,支持肿瘤患者心血管风险分层与预防决策,同时提示需前瞻性验证实施效果。

2. Large language model accuracy in inhaler technique counselling for asthma and COPD: A comparison of free and paid models across ten devices. 🆕

Digit Health (IF: 23.8) | 2026 Jan-Dec | PubMed ⚠️ | DOI | ✅ 高置信 | 研究设计: 未识别 分析来源: PMC全文 领域: 呼吸医学与人工智能患者教育(LLM在哮喘/COPD吸入器技术指导中的准确性评估) 方法: 横断面、盲法评估;纳入7家AI公司的10款LLM(免费与付费层级),于2026年3月10–17日通过官方网页接口提交50个标准化提示(10种装置×5类问题),每种提示在不同日期重复3次,共1500条输出;由2名肺科医生和1名过敏科医生依据GINA 2025、GOLD 2026、ERS/ISAM共识及制造商说明书制定的金标准,对7项指标(步骤完成率、关键/非关键错误数、步骤顺序准确性、安全警告评分、总体准确性Likert评分、患者可理解性)进行评分。 核心发现: 付费模型在7项指标中的5项优于免费模型(Mann–Whitney U,均p<0.001),关键错误减少24倍(0.48→0.02),安全警告覆盖率提高12.9个百分点(62.4%→75.3%);Google AI Pro总体准确性最高(4.98±0.13),Microsoft Copilot(3.23)和Perplexity AI(2.83)最低;Claude Free在安全警告方面优于Claude Pro(99.2% vs. 66.7%;r=0.86);仅2项指标的测试-再测试可靠性达到ICC≥0.75。 相关度(医学AI研究者): 该研究系统比较了免费与付费LLM在吸入器技术教育中的表现,揭示付费模型虽可减少关键错误并提升安全警告覆盖,但安全警告遗漏和结果变异性仍不支持其自主用于患者教育;对开发AI辅助临床教育工具、设计人机协同的teach-back模式具有直接参考价值,同时提示在医学AI应用中需重视输出可靠性和安全性的评估框架。

3. Probing relaxed myosin states in hypertrophic cardiomyopathy by second harmonic-generation microscopy. 🆕

Elife (IF: 6.4) | 2026 Aug 17 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: PMC全文

领域: 生理学 / 结构生物学与分子生物物理学(肌肉收缩机制、肥厚型心肌病)

方法: 采用偏振二次谐波(pSHG)显微镜探测肌球蛋白松弛态构象,结合物理和化学手段改变ON/OFF态平衡,并与X射线衍射测量进行交叉验证;同时使用ATPase活性测定评估静息ATP消耗;研究对象包括骨骼肌、心肌组织以及携带R403Q/MYH7突变的迷你猪心室组织,并施加肌球蛋白激活剂(2-脱氧ATP)和抑制剂(Mavacamten)进行干预。

核心发现: pSHG能够定量检测肌球蛋白松弛态中ON(可结合肌动蛋白、无序)与OFF(节能、有序)的比例;R403Q/MYH7突变心肌组织相比对照表现出更高的ON态比例,但在高浓度肌球蛋白激活剂或抑制剂处理后,突变与对照的结构差异消失;R403Q样本的静息ATPase活性升高,且在2-脱氧ATP存在下仍持续,提示其能量消耗增加既源于向ON态的群体偏移,也源于单个肌球蛋白头部的ATPase活性增强。

相关度(医学AI研究者): 该研究展示了pSHG作为一种可量化肌球蛋白构象状态的光学成像方法,结合突变模型和药物干预,为肥厚型心肌病的病理机制研究、药物筛选及功能评估提供了新的实验工具和生物标志物思路,对医学AI研究者而言,可用于开发基于成像数据的疾病状态分类或药物反应预测模型。

一句话: 本研究利用偏振二次谐波显微镜成功区分并量化肌球蛋白的ON/OFF态,揭示R403Q突变通过增加ON态比例和单头ATPase活性导致能量消耗升高,且该差异可被肌球蛋白调节剂消除。

4. Digital Screen Time and Mental Health Difficulties Among Preschool Children in Western China: Cross-Sectional Study. 🆕

J Med Internet Res (IF: 5.8) | 2026 Aug 17 | PubMed ⚠️ | DOI | ⚠️ 中置信 | 研究设计: 未识别 分析来源: PMC全文
领域: 数字屏幕时间与学龄前儿童心理健康(数字健康、儿童精神卫生)
方法: 横断面研究,纳入中国西部21,366对亲子;采用分层整群抽样,通过问卷收集屏幕时间(工作日/周末)及Strengths and Difficulties Questionnaire评估心理健康;使用广义加性模型、分段逻辑回归、中介分析、调节分析及多重敏感性分析(阈值二分、极端值排除、E值计算、多重插补、反向中介)
核心发现: 屏幕时间与学龄前儿童心理困难呈非线性饱和剂量-反应关系;约70分钟/天为临床风险升高的汇总阈值(95% CI 66-75)。低于该阈值时,每增加1小时屏幕时间,总困难风险增加65%(OR 1.65, 95% CI 1.46-1.85);高于阈值后关联显著减弱(OR 1.07, 95% CI 1.01-1.13)。广义加性模型拟合略优(ΔAIC=-6.78),提示为渐变饱和模式而非锐利断点。工作日屏幕时间的剂量-反应关系强于周末。亚组分析提示子女数和户籍可能有调节作用,但经FDR校正后不显著。父母管教方式中介了总困难关联的20.5%(95% CI 15.8%-26.2%),外化问题中介21.2%,内化问题中介23.6%。多项敏感性分析支持结果稳健性。
相关度(医学AI研究者): 高。该研究为数字健康干预和儿童心理风险预测提供了量化阈值(约70分钟/天)及可干预的中介因素(父母管教),可用于构建屏幕时间风险分层模型、个性化干预推荐或健康监测AI系统;非线性剂量-反应关系提示AI模型需避免线性假设。
一句话: 基于中国西部大规模横断面数据,学龄前儿童每日屏幕时间超过约70分钟后心理困难风险趋于饱和,且父母管教方式部分中介该关联,为屏幕时间指南和早期干预提供了循证依据。


🔬 新增AI临床试验

近1日新增: 95 项 | 数据源: ClinicalTrials.gov

NCT04747886 Inhibitory Control Adult Weight Management

状态: COMPLETED | 期: NA | 赞助: | 招募: 34 条件: Overweight and Obesity

NCT06754137 AI-Assisted Fracture Detection in Emergency Radiography

状态: COMPLETED | 期: NA | 赞助: | 招募: 1667 条件: Bone Fractures

NCT07768644 Nailfold Capillaroscopy in PH

状态: RECRUITING | 期: N/A | 赞助: | 招募: 60 条件: Pulmonary Arterial Hypertension (PAH) (WHO Group 1 PH); Pulmonary Hypertension (World Health Organization Group 3); Chronic Thromboembolic Pulmonary Hypertension

NCT03294460 Nicotinic Receptor Genetic Variation and Alcohol Reward

状态: RECRUITING | 期: PHASE1 | 赞助: | 招募: 128 条件: Alcohol Drinking

NCT07728123 Screen2Prevent (S2P)

状态: RECRUITING | 期: NA | 赞助: | 招募: 84000 条件: HIV Infections

5. Parkinson’s disease-associated PINK1 loss disrupts ensheathing glia and causes dopaminergic neuron synapse loss. 🆕

Elife (IF: 6.4) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 神经科学 / 神经退行性疾病 / 帕金森病
方法: 果蝇(Drosophila)Pink1突变模型;全脑单细胞RNA测序;细胞类型特异性转录组学分析;基因表达调控(RNAi);行为学与电生理功能评估。
核心发现: 在帕金森病(PD)相关的Pink1缺失果蝇模型中,研究发现Pink1缺失首先导致一类与少突胶质细胞功能相似的包裹胶质细胞(EG)出现基因表达紊乱和损伤反应样变化。EG中的特定囊泡运输因子(如Vps35和Vps13)下调,能够挽救因Pink1缺失导致的神经元功能障碍并保护多巴胺能神经元免受突触丢失。这揭示了神经元中的Pink1缺失可触发胶质细胞的应激反应,而胶质细胞自身Pink1功能的缺失则通过破坏囊泡运输等过程,反过来加剧神经元病变,突显了胶质细胞支持功能在PD发病机制中的关键作用。
相关度(医学AI研究者): 高。该研究通过单细胞测序揭示了PD早期新型细胞(包裹胶质细胞)的基因表达特征及病理作用,为理解PD的复杂细胞互作网络提供了新数据。其鉴定的关键基因(如Vps35, Vps13)和通路可作为AI驱动的药物靶点发现或疾病早期生物标志物研究的重点输入。
一句话: 本研究揭示帕金森病相关Pink1缺失通过破坏包裹胶质细胞的囊泡运输功能,间接导致多巴胺能神经元突触丢失,确立了胶质细胞在PD早期病程中的核心作用。

6. Advancing Evidence-Based Medicine for Population, Intervention, Comparison, and Outcome Element Recognition and Extraction in Medical Literature: Large Language Model Approach.

J Med Internet Res (IF: 5.8) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 医学信息学与自然语言处理
方法: 本研究构建了一个双阶段方法论框架,系统评估了两种互补的AI方法:1)提示工程优化,包括上下文学习、思维链和多路径推理策略;2)基于大语言模型(Llama 3.2-3B)的参数高效微调,具体技术包括低秩适应、量化低秩适应和冻结技术。评估使用了PubMed-PICO、NICTA-PIBOSO和EBM-NLP三个标准数据集。
核心发现: 两种方法均能有效自动化PICO元素识别与提取。对于提示工程,思维链策略在较小模型上表现最佳。参数高效微调方法进一步提升了性能,在识别任务中,低秩适应取得了最高F1分数;在提取任务中,量化低秩适应表现最优。微调模型在所有数据集上均表现出强大竞争力。
相关度(医学AI研究者): 高
一句话: 该研究提出并验证了提示工程与参数高效微调两种互补的AI方法,能够高效、准确地从医学文献中识别和提取循证医学核心的PICO元素。

7. Large Language Models for Mental Health Prediction: Scoping Review of Bias and Clinical Utility Documentation in 2019-2024.

JMIR AI (IF: 5.8) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 医学人工智能(具体为:利用大语言模型进行心理健康预测)
方法: 遵循PRISMA-ScR指南,系统检索5个科学数据库(2019-2024年),纳入使用大语言模型分析非合成文本数据以检测心理健康状况的201篇英文研究。提取研究的方法学信息及作者关于偏见与临床效用的自述,并基于LLM开发全流程框架进行统计描述和主题编码分析。
核心发现: 研究多集中于使用通用LLM(如BERT系模型)处理社交媒体文本以识别抑郁症;尽管81.6%的研究提及偏见或临床效用,但讨论主要局限于数据层面,仅20.4%的研究涉及开发流程中3个及以上环节,显示出对该领域关键挑战的反思深度不足。当前研究在方法学上可能损害系统的临床相关性与公平性。
相关度(医学AI研究者): 中高。该综述系统指出了当前LLM心理健康预测研究在方法设计上的普遍局限性(如偏数据集、特定病种、特定模型)及对偏见与临床效用讨论的表面化,对旨在开发可靠、公平且临床可用的AI工具的研究者具有重要警示和指导意义。
一句话: 该范围综述揭示了2019-2024年LLM心理健康预测研究普遍缺乏对偏见和临床效用的深入、全流程考量,亟需跨学科合作以确保技术的临床相关性与社会公平性。

8. Finite State Machine-Guided Retrieval-Augmented Generation Improves Expert-Rated Acceptability of a Peripherally Inserted Central Catheter Self-Management Chatbot: Single-Center Content Validation Stu

J Med Internet Res (IF: 5.8) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 医疗聊天机器人/人工智能辅助临床决策支持
方法: 盲法消融比较研究,三种共享相同微调GPT-4o-mini基础的聊天机器人架构(仅FT、FT+RAG、FT+RAG+FSM),由三名PICC管理专家对43个临床查询的回答进行偏好选择和八个维度的全局评分评估。
核心发现: 有限状态机引导的RAG模型(模型3)在79.1%的场景中被专家显著偏好,表明在微调和检索增强的基础上加入结构化的对话控制逻辑,能使聊天机器人的输出模式更接近专家主导的PICC咨询,从而提升临床可接受性。
相关度(医学AI研究者): 高。该研究直接针对大语言模型在医疗应用中的核心挑战(幻觉、流程合规性),并验证了一种结合微调、检索增强生成与形式化对话控制(FSM)的技术路径,对构建安全、可靠的临床对话系统有重要参考价值。
一句话: 在PICC自我管理聊天机器人中,增加有限状态机对话控制能显著提升专家对其回答可接受性的评级。

9. Application of Large Language Models in Chronic Disease Care: Mixed Methods Systematic Review and Thematic Synthesis.

J Med Internet Res (IF: 5.8) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 医疗人工智能(AI)在慢性病管理中的应用
方法: 混合方法系统综述(遵循PRISMA和SWiM指南),基于Orem自我护理理论构建的3D评估框架进行主题综合分析
核心发现: 1. 研究主要支持大语言模型在“自我护理赋能”层(如患者教育和临床决策支持)的潜力。2. 但在“基础安全、隐私与公平性”(如幻觉风险、数据隐私)和“设计与系统集成”(如可读性不匹配、工作流脱节)两个层面存在显著不足,限制了其现实世界就绪性。3. 技术增强手段(如RAG和微调)主要强化了赋能层,但未能充分解决安全与集成问题。
相关度(医学AI研究者): 高。本文首次将护理理论引入对大语言模型在慢性病护理中的结构化评估,为研究从单一技术性能转向关注安全性、健康素养适配性和实施科学提供了重要框架和方向。
一句话: 该综述运用护理理论框架,指出大语言模型在支持慢病患者自我管理方面有前景,但在安全性、公平性和临床工作流整合方面仍面临关键挑战。

10. Evaluating Retrieval-Augmented Large Language Models on Anesthesiology Board-Style Questions: Benchmark Study.

JMIR Form Res (IF: 5.8) | | PubMed ⚠️ | DOI | 期刊全文后补(15:00 隧道管线) 分析来源: 期刊全文(隧道下载)
领域: 医学AI、麻醉学教育、自然语言处理
方法: 基于RAG的LLM系统测试与基准研究。使用美国麻醉委员会风格的多项选择题,系统评估了多种检索增强生成配置(涉及不同参数规模、嵌入模型、分块策略、超参数设置)与独立LLM基线的性能差异。测试模型包括Llama-3/3.1/3.2/3.3系列和Qwen2.5/3系列,并评估了自反思RAG技术。使用Cochran Q和McNemar检验进行统计分析。
核心发现: 1) RAG框架可提升麻醉学考试题的正确答案数量,但标准RAG和自反思RAG的增益幅度有限(约5-6个百分点)。2) 性能高度依赖检索设计优化,包括选择高容量通用文本嵌入、采用保留语义的分块策略以及使用低温度、低Top-p的确定性采样配置。3) Qwen系列模型整体优于Llama系列。其中,参数量较小的推理模型Qwen3-32B在复杂干扰条件下正确率高达89%,在提供直接上下文时达到96%,显著优于参数量更大的常规模型Qwen2.5-72B。4) 较小的推理模型比更大的常规模型对噪声或次优检索文档表现出更强的鲁棒性。5) 在Llama系列中,将参数规模增至700亿并未在该基准上带来成比例的性能提升。
相关度(医学AI研究者): 高。该研究为在资源受限环境下(如本地部署)开发用于专业医学领域(麻醉学)的LLM系统提供了方法论基准和实用见解,明确评估了RAG关键组件的影响,并突出了推理模型在处理复杂医学知识任务中的潜力。
一句话: 该研究通过系统基准测试发现,检索增强生成技术能提升大语言模型在麻醉学考试中的表现,但其效果严重依赖于检索系统设计,且专注于多步推理的小型模型在某些复杂任务中可能比参数量更大的常规模型更具优势。