苏菲的工房

每日医学AI论文简报 v0.2

[日报]

日期: 2026-07-24 07:08 来源: PubMed | 分析: DeepSeek 期刊IF: 2024-2025 JCR


1. A context-augmented large language model for accurate precision oncology medicine recommendations.

Cancer Cell (IF: 31.7) | 2026 Mar 9 | PubMed ⚠️ | DOI 📄全文 分析来源: PubMed摘要(补录) 领域: 精准肿瘤学、大语言模型(LLM)、检索增强生成(RAG) 方法: 开发了基于RAG的LLM工作流,使用分子肿瘤学年鉴(MOAlmanac)作为知识库,并与仅用LLM的方法对比,评估其在生物标志物驱动的治疗推荐上的准确性;测试了合成查询和真实临床查询,并探索了多种提示与检索策略。 核心发现: RAG-LLM在合成查询上准确率达95%,在真实世界查询上准确率达93%,显著优于LLM-only方法;结合外部知识库可弥补LLM过时和领域知识不足的问题。 相关度(医学AI研究者): 高。展示了RAG-LLM在临床治疗决策支持中的可行性和优越性,为构建可更新的医学知识增强AI系统提供了实证,方法可推广至其他专科。 一句话: 结合MOAlmanac的RAG-LLM能高准确率提供精准肿瘤治疗推荐,优于仅用LLM的方法。

2. Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study.

J Med Internet Res (IF: 5.8) | 2026 Jan 8 | PubMed ⚠️ | DOI 📄全文 分析来源: PubMed摘要(补录)
领域: 辅助生殖技术、医学人工智能、大语言模型可解释性
方法: 盲法比较研究;由资深临床医生评价三种提示策略(零样本、随机少样本、选择性少样本)生成的临床推理链(CoT),并与GPT-4o自动评价对比
核心发现: 选择性少样本策略在逻辑清晰度、关键信息利用和临床准确性上显著优于其他策略(P<.001);随机少样本策略相比零样本无显著改进;GPT-4o无法识别这些关键性能差异
相关度(医学AI研究者): 高——提示设计决定LLM生成临床推理的可靠性,且AI自动评价不能替代临床专家评价,对可扩展生成高质量医学CoT有直接指导意义
一句话: 在辅助生殖中,用“高质量+多样性”示例的选择性少样本提示能显著提升LLM临床推理可靠性,而随机示例无效,且AI评价器无法察觉差异。