全部论文(38 篇)
HR3/RORα-mediated cholesterol sensing regulates TOR signaling.
领域:细胞信号转导 / 脂质代谢 / 肿瘤生物学 / 发育生物学
方法:本研究基于Drosophila组织模型,结合遗传筛选与功能分析鉴定胆固醇感应因子HR3;通过胆固醇结合实验验证HR3与胆固醇的直接结合;利用TOR通路下游效应检测和Rag GTPase相关遗传上位分析,定位HR3在TOR信号通路中的非基因组作用环节;并在人源细胞中通过RORα功能缺失实验验证跨物种保守性;同时结合基因组调控分析,区分HR3的快速非基因组效应与长期基因组调控功能。
核心发现:- 胆固醇可在Drosophila组织中快速激活TOR通路,从而促进细胞生长。
- 核受体HR3(哺乳动物RORα同源物)是胆固醇诱导TOR激活的关键感应因子,且能直接结合胆固醇。
- HR3通过非基因组机制作用于Rag GTPase上游,快速激活TOR;同时HR3通过基因组调控机制抑制/约束长期反应,形成快速与长期响应之间的平衡。
- 在人源细胞中,RORα同样是胆固醇介导TOR激活所必需,提示HR3/RORα介导的胆固醇感应机制在演化上保守。
- 该机制将胆固醇可用性与TOR通路活性直接联系起来,为胆固醇相关疾病和癌症中的异常生长信号提供新视角。
相关度:高。该研究揭示了一条全新的胆固醇→HR3/RORα→TOR信号轴,是疾病机制建模的重要知识;可用于构建代谢-生长信号调控网络、预测胆固醇相关疾病(如癌症、代谢综合征)中的TOR异常激活,也可为AI驱动的靶点发现和药物重定位提供生物学先验。
一句话:该论文发现核受体HR3/RORα作为胆固醇传感器,通过非基因组机制快速激活TOR信号通路,连接胆固醇感应与细胞生长调控,并在人类细胞中保守。
Evaluation of GPT-5, a Large Language Model, in Replicating German Clinical Practice Guideline Recommendations in Oral Oncology: A Cross-Sectional Concordance Study.
2026-08-04 ·
领域:口腔肿瘤学 / 医学人工智能(大语言模型与临床指南一致性评估)
方法:横断面分析比较研究。将两份德国口腔临床实践指南(S2k OPMD 15条 + S3 OC 96条,共111条推荐)逐字输入GPT-5(免费版,无联网),要求确认或拒绝;另测试反转陈述以检验方法学稳健性。以准确率(正确分类比例)和Cohen's κ评估一致性。
核心发现:GPT-5正确确认了所有原始推荐,并拒绝了所有反转陈述。原始推荐评估中κ=1.0(完全一致);原始+反转联合评估时κ=0.96(非常高)。指南引用文献>93%为英文,>77%来自德国以外。
相关度:高。提供了LLM在“识别已有指南推荐”任务上性能优异的直接证据,但明确区分了“识别”与“自主临床推理”,提示LLM作为教育/信息工具可行,不能替代临床判断;为后续LLM临床评估设计(含反转陈述对照组)提供了方法学参考。
一句话:GPT-5对德国口腔肿瘤指南原始推荐100%一致,但仅证明其能识别已有知识,而非独立临床推理能力。
Temporal trends in large language model (LLM) accuracy: A meta-analysis of multiple-choice question performance in dentistry and dental education.
2026-08-04 ·
领域:口腔医学教育 / 大语言模型(LLM)评估
方法:系统综述与Meta分析(遵循PRISMA指南,纳入2022年1月至2025年8月文献,PICO框架,双人筛选,比例Meta分析及Meta回归)
核心发现:LLM在牙科选择题作答中的准确率随时间显著提升(p<0.001);各LLM间异质性高(≥90%);OpenAI模型(ChatGPT-3.5, 4, 4o及更新)显著优于其他竞品(p<0.001);题目类型(仅题干 vs. 临床情境+题干)和题目来源(本地编写、商业产品、免费资源)对准确率无显著影响。
相关度:高——提供LLM版本迭代在医学教育测评中的量化性能趋势,提示模型进步可期,但异质性和评估场景需进一步标准化。
一句话:大语言模型在牙科选择题中的准确率随版本迭代显著提高,但跨模型差异仍大,目前更适合作为辅助教学工具而非唯一评估标准。
ChatGPT in urogynecology: Comparing large language model responses to human experts.
2026-08-04 ·
领域:妇科泌尿学 / 人工智能大语言模型(LLM)在患者教育中的应用
方法:横断面问卷调查。共纳入203名妇科泌尿科患者,患者分别对6个常见妇科泌尿问题的ChatGPT回答和一位顾问级妇科泌尿科医生回答进行盲法评分;另由第三方顾问医生验证临床准确性。评分采用5点Likert量表,涵盖三个维度:可理解性、帮助性和安慰性,每个回答最高15分。使用Wilcoxon符号秩检验进行比较。
核心发现:ChatGPT回答的总评分显著高于顾问医生回答(中位76分 vs 72分,p < 0.01),在可理解性、帮助性和安慰性三个维度均更优(均p < 0.01)。6个问题中,ChatGPT在4个问题上更受患者偏好,1个无差异,1个由顾问医生胜出。患者年龄、特征等亚组分析未显示显著差异。作者强调该结果为探索性发现,反映患者主观感知,LLM只能作为临床专业照护的辅助工具,需谨慎监督使用。
相关度:高。该研究直接评估了LLM在专科临床场景中的患者沟通潜力,提示ChatGPT可能改善患者信息获取体验,同时强调了“辅助而非替代”的边界,对医学AI教育应用、人机协同和临床安全监管具有参考价值。
一句话:这是一项探索性患者评分研究,显示ChatGPT对常见妇科泌尿问题的回答比单一顾问医生更清晰、更有帮助、更令人安心,但作者明确指出其仅可作为谨慎辅助工具,不能替代专业诊疗。
Reference-Free large language model agents for physician-guided radiotherapy treatment planning.
2026-08-04 ·
领域:放疗治疗计划 / AI智能体 / 大语言模型(LLM)在医学影像与放疗中的应用
方法:该研究回顾性收集了20例接受IMRT的头颈部(HN)癌症患者。研究者将未经微调、未见参考计划的商用LLM构建为智能体,直接与临床治疗计划系统(TPS)交互:智能体在迭代过程中提取中间计划状态,基于实时计划评估和先前优化结果,提出新的约束值以指导逆向优化。其核心能力包括理解临床计划目标、理解优化环境上下文以及进行定量推理的算术能力。LLM生成的计划与认证剂量师手工制定的临床已批准计划进行比较,采用Wilcoxon符号秩检验进行配对统计分析。
核心发现:LLM生成的计划在危及器官(OAR)保护方面与临床计划相当,同时显示出更好的热点控制和靶区适形性:
- 最大剂量(Dmax):106.5% vs. 108.8%,p < 0.05
- 加量PTV适形指数:1.18 vs. 1.39,p < 0.05
- 原发PTV适形指数:1.82 vs. 1.88,p = 0.47
该研究证明了在商业TPS中,无需参考计划和微调即可实现LLM驱动的自动化IMRT计划设计,展示了减少计划变异性并推广AI计划策略的潜力。
相关度:高。该研究直接面向放疗计划自动化这一临床痛点,验证了LLM智能体在无参考计划、无微调条件下与商用TPS交互优化的可行性,对医疗AI智能体在真实临床工作流中的落地具有重要参考价值。
一句话:本研究证明,无需参考计划和微调的大语言模型智能体可通过与商用TPS迭代交互生成与临床计划相当的IMRT计划,并在热点控制和适形性上表现更优。
Safety and diagnostic accuracy of large-language model application of PECARN head injury algorithm.
领域:儿科急诊医学 / 临床决策支持 / 大语言模型应用
方法:回顾性模型开发与验证研究;使用GPT模型在24例患者笔记上开发、122例患者笔记上测试;比较四种LLM模型提取PECARN算法特征的表现;以儿科急诊医师为金标准,评估负预测值(NPV)和准确率。
核心发现:所有LLM模型NPV均较高(最优模型NPV=0.98,准确率=0.89),接近临床医生表现(NPV=0.99,准确率=0.92);提示工程优化的“Optimized Features Model”表现最佳。
相关度:中等—展示LLM用于临床决策算法自动化的可行性,但样本量小、属预实施研究,尚需大规模与可行性验证。
一句话:LLM可较安全准确地将PECARN头部损伤算法应用于急诊临床笔记,但距离实际临床部署仍需进一步研究。
Evaluation Methods for Inference-Time Retrieval-Augmented and Graph Retrieval-Augmented Large Language Models in Health Care: Scoping Review.
领域:医学人工智能 / 大语言模型(LLM)在医疗中的检索增强生成(RAG)与图检索增强生成(GraphRAG)评估方法学
方法:遵循PRISMA-ScR的范畴综述,检索截至2026年5月14日,纳入157项研究;提取研究特征、系统设计、检索层评估、证据链接、安全相关及GraphRAG特定评估等,并构建证据-缺口图。
核心发现:临床问答(56.7%)和临床决策支持(44.6%)最常见;89.2%为离线评估;独立检索层评估占29.9%;接地/忠实性评估占26.1%;细粒度证据验证仅占14%;人工评估占59.9%但报告信度仅27.7%;LLM-as-judge占26.1%中仅36.6%报告偏倚控制;正式安全性评估占28.7%;GraphRAG研究中中间产物评估占40.7%、图构建评估占22.2%;工作流面向/前瞻性/部署级评估稀缺,且细粒度验证、矛盾处理、安全性、LLM-judge防护、GraphRAG构建与中间产物评估覆盖不足。
相关度:高——系统呈现当前医疗RAG/GraphRAG评估方法的异质性与关键缺口,为设计更严谨、可对照的评估框架提供直接依据,并警示临床就绪性判断的证据局限。
一句话:这项范畴综述显示,医疗RAG/GraphRAG的评估仍以离线为主,且安全、证据细粒度验证、人工评估信度及GraphRAG特有评估等关键环节报告不足。
Curated Retrieval-Augmented Generation for Dental Traumatology.
2026-08-04 ·
领域:牙科创伤学 / 临床决策支持
方法:构建基于5个权威来源(IADT 2020、ESE 2021、Krastl 2021、AAE 2013、Cochrane)的250个精选文本单元知识库,以Gemini 2.5 Flash为基础模型部署DT-RAG系统。研究1:对99个二元临床问题,将DT-RAG与8个商业LLM进行三轮比较,采用McNemar精确检验(Holm校正)比较模态准确率。研究2:7名盲法专家使用92点评分量表,在10个临床场景中比较DT-RAG与3个前沿LLM,使用线性混合效应回归估计差异。
核心发现:DT-RAG模态准确率96.0%(95% CI 90.1–98.4),显著超过所有商业LLM(最佳对比GPT-5.5为87.9%,配对差异+8.1个百分点,p_Holm=0.013)。精选知识库将基础模型的有效理由率从49.5%提升至98.0%,评估中消除幻觉(0 vs 21)。研究2中DT-RAG平均得分82.1/92(89.3%),显著超过Claude Opus 4.5(72.6,p=0.016)、Gemini 2.5 Pro(60.3)和GPT-4.1(50.4);7名评估者均将DT-RAG排第一(Kendall's W=0.97)。
相关度:高——展示精选检索增强生成(RAG)在专科临床决策支持中的可行性,显著优于通用大模型,并实现可溯源、无幻觉的响应;为其他有权威指南的临床领域提供方法论模板,但需前瞻性评估安全性。
一句话:精选RAG系统在牙科创伤学基准上超越前沿通用LLM,准确率高且消除幻觉,但临床安全性仍待前瞻验证。
Comparative Analysis of Large Language Model Performance in Appropriate Diagnostic Imaging Modality Selection.
2026-08-04 ·
领域:医学影像学 · 大语言模型临床决策支持
方法:对7种LLM(OpenEvidence、GPT-5 Thinking、GPT-5、Opus 4.1、Sonnet 4.5、Gemini 2.5 Pro、Gemini 2.5 Flash)进行50个临床 vignette 测试;基于ACR指南设计5类主诉×10种变体;采用3点Likert量表评估4项指标(影像适宜性、技术特异性、临床理由强度、引用质量),另测可读性与字数;双盲独立评审+共识裁决;Friedman检验及Wilcoxon符号秩检验(Holm校正)
核心发现:所有模型在影像适宜性和临床理由上均表现良好,无显著两两差异;引用质量差异最大,Gemini 2.5 Pro / 2.5 Flash 分别有80%和76%的提示出现幻觉引用,显著差于其他模型;技术特异性与临床理由无显著两两差异;可读性和字数变异较大
相关度:高——系统比较了多家前沿LLM在影像决策中的实际性能,揭示引用幻觉这一关键落地障碍,对影像AI辅助工具选型和评估设计有直接参考价值
一句话:各LLM均能给出合理的影像检查建议,但Gemini系列存在严重引用幻觉,提示临床落地前必须验证推理与引用的一致性。
When Useful Clinical AI Exceeds Meaningful Oversight.
2026-08-04 ·
领域:临床AI治理与监督
方法:概念性分析/观点论述(基于摘要,未报告实证研究或系统方法)
核心发现:提出认知监督与规范性监督的区分;指出当临床AI变得多模态、智能体化和认知上更具野心时,人类监督往往流于形式,临床医生虽对AI辅助决策负责,却无法有意义地审查AI输出依据。
相关度:高——提醒研究者不能仅将“人类监督”视为固定保障措施,需在AI系统设计与评估中同时考虑认知可审查性与规范性责任边界。
一句话:该文主张区分“认知监督”与“规范性监督”,并指出临床AI越强大,人类有意义的监督越可能失效,需重新审视AI评估与部署方式。
Test-Time Compute and Budget ("Reasoning Effort"): An Underrecognized Methodologic Variable in Medical Large Language Model Research.
2026-08-04 ·
领域:医学大语言模型(LLM)研究方法学,重点关注放射学/医学影像应用
方法:评论/社论性质;提出“测试时计算量/推理努力”(test-time compute / reasoning effort)作为医学LLM研究中未被充分认识的方法学变量;分析其对输出质量、稳定性和可重复性的影响,并呼吁在研究报告中记录与控制该参数
核心发现:模型推理阶段的计算资源投入与预算限制会显著影响LLM输出质量与稳定性;现有医学LLM研究普遍未将其作为独立变量报告或控制,可能损害结果的可重复性与可比性;作者建议在医学LLM研究中明确规范“推理努力”参数
相关度:高——直接关系LLM评估与临床应用的严谨性;若忽视该变量,可能导致模型性能结论失真,影响临床决策支持系统的验证与部署
一句话:医学LLM研究应把“测试时计算量/推理努力”作为关键方法学变量明确报告与控制,否则结果可重复性存疑。
Optimising clinical information extraction: a comparative study of retrieval-augmented generation techniques in clinical notes.
2026-08-04 ·
领域:临床信息抽取 / 医学自然语言处理(针对澳大利亚老年护理机构的非结构化临床笔记)
方法:在统一RAG流水线中系统比较6种检索策略(BM25、稠密检索、稠密检索+交叉编码器重排、稀疏/稠密动态线性融合、倒数排名融合RRF、混合粗到细重排);基于两个临床命名实体识别任务(痴呆激越症状提取、营养不良风险因素识别,各n=208)评估;采用重复测量方差分析及误差分析
核心发现:重排和混合集成策略显著优于单独稀疏(BM25)和稠密检索;激越提取中稠密重排最优(Answer F1=0.946,Context Diversity=0.895,Item-level Accuracy=0.963);营养不良任务中集成方法获得最佳Item-level Accuracy(0.944),稠密重排紧随其后;误差分析识别三类LLM错误(内在幻觉、外在幻觉、假阴性),并阐明RAG的缓解作用
相关度:高——为临床非结构化文本的自动化信息提取提供了可复现的RAG检索策略选择依据,有助于提升下游预测建模和临床决策支持系统的可靠性
一句话:基于真实老年护理临床笔记的系统比较显示,重排型检索能显著增强RAG在临床信息抽取中的准确性与可信度。
Decoding Algorithmic Inequity: Reversing the Generative AI Racial Divide in Healthcare.
2026-08-04 ·
领域:医疗人工智能公平性、算法偏见、健康差异
方法:观点性论文(Perspective);提出“数据差异管道”(Data Disparity Pipeline)概念,系统梳理偏见来源、现有证据及缓解策略局限,并给出多模态公平框架建议
核心发现:医疗AI通过数据差异管道继承并放大结构性偏见;偏见来源包括偏倚数据、代理变量、代表性不足和递归重训;现有缓解策略有限;需通过代表性数据基础设施、参与式监督、透明性和持续公平审计来促进健康公平
相关度:高——直接针对AI公平性核心问题,提供系统性偏见机制分析和可操作的治理框架,对模型开发、数据治理和临床部署具有重要参考价值
一句话:论文揭示医疗AI中的种族差异源于从数据到临床的全链条不平等,并呼吁通过多利益相关方协作的公平审计框架来逆转这一算法分水岭。
From Image to Pixels: Towards Fine-Grained Medical Vision-Language Models.
2026-08-04 ·
领域:医学视觉-语言模型(Biomedical Vision-Language Models),细粒度像素级理解
方法:构建跨8种医学影像模态的基准 MeCoVQA;提出 MedPLIB,一种端到端医学多模态大模型,支持VQA、点/区域查询、定位和分割;采用任务专用混合专家(MoE)架构进行统一微调;整合检索增强生成(RAG)与上下文学习(ICL)提升泛化能力。
核心发现:MedPLIB在多项生物医学视觉-语言基准上达到新SOTA;在零样本像素级定位上,超过现有最优小模型19.7 mDice、大模型15.6 mDice,展示了临床实用性与泛化优势。
相关度:高——该工作提供数据/基准(MeCoVQA)、统一模型(MedPLIB)及训练策略,可直接服务于医学影像的细粒度诊断、定位与分割任务,尤其对零样本泛化场景有重要参考价值。
一句话:通过数据、模型和训练创新,MedPLIB实现了医学图像从粗粒度理解到像素级推理的跨越,并在零样本定位分割上显著超越现有模型。
[Keeping track of things: large language models for patient synopses : Source-bound system for clinical information systems].
2026-08-04 ·
领域:临床信息学 / 放射学 / 大语言模型(LLM)在电子健康记录中的应用
方法:系统开发与架构描述。基于检索增强生成(RAG)、元数据标准化、向量检索、智能体检索(agentic retrieval),整合EHR、PACS等多个主要系统的临床文档,实现患者级查询、纵向摘要与来源可追溯的自动摘要生成;采用基于角色的访问控制、端到端来源归属、主权云处理且不持久化存储。
核心发现:该系统能够生成结构化纵向患者摘要,并为跨学科病例讨论提供准备支持;所有陈述可追溯至原始文档,但医学解释和决策仍由临床医生负责。实施前提包括互操作性信息系统、符合GDPR、德国SGB V及EU AI Act的数据保护框架。结论认为LLM患者摘要可用于文本密集型临床流程,但需受控检索、明确来源归属、医生审核及合规架构;常规临床使用前仍需前瞻性评估。
相关度:较高。展示了LLM+RAG在真实临床文档整合与摘要生成中的可行架构,强调透明度、溯源、权限控制和法规合规,可作为医学AI系统落地设计的参考;但尚无临床效果定量评价。
一句话:该研究基于摘要提出并描述了一种使用LLM与RAG构建可溯源、受控且合规的患者摘要系统,用于支持放射科及跨学科病例讨论,但常规应用前仍需前瞻性验证。
[Participatory processes in the development of AI systems in a clinical context: A qualitative secondary analysis].
2026-08-04 ·
领域:临床人工智能(AI)系统开发,护理/医疗决策支持(谵妄预测)
方法:定性二次分析(qualitative secondary analysis);对KIDELIR项目中参与式活动(包括工作坊的案例 vignettes、健康信息映射、小组讨论、参与式系统映射、变革理论建模、访谈等)的照片文档、观察记录和转录文本进行结构化质性内容分析。
核心发现:不同参与式格式能够显现不同类型知识:案例 vignettes揭示直觉化评估逻辑,映射方法暴露信息流结构,访谈阐明专业特定需求;除功能期望外,还使隐性工作惯例、数据断层和沟通问题变得可见。
相关度:高——提示参与式方法不仅是需求收集工具,更可揭示临床情境中的隐性专业知识和数据实践,为AI系统设计与实施提供关键语境信息,弥补当前实证证据不足。
一句话:该研究通过对KIDELIR项目的二次分析表明,临床AI开发中的参与式方法能有效展现职业特有的经验知识和数据相关实践,并支持协商过程。
Cognitive Workload and Mental Burden in Health Care Professionals Interacting With AI: Systematic Review and Meta-Analysis.
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Large Language Model-Based Clinical Decision Support for Antibiotic Selection and Dose Recommendation in Hospitalized Patients With Pneumonia: Multicenter Retrospective Study.
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Nurse-Led Large Language Model Chatbot for Predicting and Preventing Complications After Coronary Artery Bypass Grafting: Protocol for a Randomized Controlled Trial.
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Accuracy and Readability of Generative Artificial Intelligence for Vascular Surgery Patients: A Specialist Based Evaluation Highlighting the Current Landscape of Safety Risks and Accessibility Gaps.
2026-08-05 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
TrialTriage, a Semiautonomous Prescreening Workflow for Resolving Ambiguity in Phase I Oncology Trial Eligibility: Development and Proof-of-Concept Study Using Synthetic Cases.
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Designing clinical AI for patient-centered support beyond the visit: the PACT framework for health systems.
2026-08-06 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Accuracy, Usefulness, and Impact Variability of ChatGPT-4 for COPD Medication Management: A Modified Delphi Study.
2026-08-06 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Reconstructing delivered dose in real time: a beam physics-embedded, language-model-driven approach.
2026-08-07 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Large Language Model-Driven Throat-Wearable Sensing System for Real-Time Recognition and Evaluation of Swallowing Disorders.
2026-08-07 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Large language models can supplement the assessment of clinical high risk for psychosis.
2026-08-07 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Comparative evaluation of large language models and clinicians in real-world glaucoma clinical reasoning.
2026-08-07 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
AI as Core Infrastructure in Radiology: Moving Beyond Pilots to Operational Excellence.
2026-08-07 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis. 🆕
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Clinical Trial Source Document Verification Using a Large Language Model. 🆕
2026-08-08 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
A Bilingual Benchmark for Evaluating Diagnostic Performance of Multimodal Large Language Models in Radiology (RadM-Bench): Evaluation Development and Validation. 🆕
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Theoretical Exploration of Error Thresholds for Clinical AI Decision Support in Nursing: Exploratory Simulation Study Grounded in Human-AI Reliance Data. 🆕
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Development of SCOPE: Social and Clinical Opioid Use Disorder Predisposition Evaluation. 🆕
2026-08-08 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
Iterative Multidisciplinary Development and Evaluation of a Patient-Facing Social Determinants of Health Chatbot Using Synthetic Data Simulation: Mixed Methods Study. 🆕
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
CGX: OCR-enhanced knowledge graph retrieval for explainable heart failure analysis. 🆕
2026-08-09 ·
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
📄 论文动态
These 15 papers illustrate the expanding role of AI in healthcare, from clinical decision support and autonomous systems to large language models for patient education, communication, and research support. Key themes include the feasibility of AI in resource-limited settings (e.g., prehospital trauma triage), the rise of LLMs in patient-facing and team-based applications, explainability and privacy concerns, and the growing importance of AI in drug discovery and health workforce training. High-impact studies, such as the SAVE-O2 RCT and autonomous ophthalmic diagnosis, provide early clinical evidence, while foundational reviews in Lancet and Nature Reviews Drug Discovery highlight systemic challenges and future pathways. Non-AI cancer research papers complement the translational landscape.
### 🏭 行业动态
The industry news centers on regulatory evolution and market growth for AI in healthcare. The FDA is simplifying approval pathways for AI-enabled medical devices, issuing guidance for SaMD, and responding to stakeholder feedback (e.g., AHA letters). Market reports project substantial growth in AI healthcare solutions. Major tech players like Google DeepMind are advancing the concept of an 'AI co-clinician', signaling a shift toward AI-augmented care. These developments suggest a maturing ecosystem with clearer regulatory frameworks and increasing commercial investment.
### 📊 高频期刊 TOP10
| 期刊 | IF | 篇数 |
|:---|---:|---:|
| Int J Med Inform | 5.5 | 3 |
| Digit Health | 23.8 | 2 |
| Lancet | 98.4 | 1 |
| Artif Intell Med | 5.1 | 1 |
| Nat Rev Drug Discov | 120.1 | 1 |
| J Am Med Inform Assoc | 6.4 | 1 |
| Cell Rep Med | 45.5 | 1 |
| J Nucl Med Technol | 7.4 | 1 |
| JMIR AI | 5.8 | 1 |
| Cancer Res | 10.0 | 1 |
## 二、研究主题聚类
### Large Language Models in Healthcare(7篇)
领域:医学人工智能(涵盖临床决策支持、大语言模型、药物发现、医学教育与行业监管)
方法:对15篇论文及行业动态进行主题聚类与趋势分析,结合期刊影响因子与高频出处归纳研究热点
核心发现:大语言模型在医疗中的应用从患者教育扩展至团队协作、多智能体框架与研究支持,强调隐私、可解释性与文化适配;临床AI系统从辅助工具向自主智能体发展,随机对照试验和真实世界验证成为关键;AI加速药物靶点识别与开发,基础癌症研究持续提供新治疗思路;医学教育与劳动力培训亟需适应AI赋能实践。行业层面,FDA简化AI医疗器械审批路径,市场预期大幅增长,DeepMind等推动“AI协同临床医生”概念,监管框架与商业投资日趋成熟。
一句话:该报告显示医学AI正从辅助走向自主,大语言模型与药物发现是当前最活跃的领域,同时监管与教育生态加速成熟。
Global advances in health artificial intelligence: a workforce imperative.
领域:医学人工智能;急重症氧疗管理;AI闭环干预
方法:根据提供的 PMC 题录元数据,这是一项多中心随机临床试验(SAVE-O2 AI)。纳入急性患病成人,干预组采用 AI/自动化算法自主进行氧气滴定,以维持目标血氧正常范围(normoxemia);对照组为常规氧疗调整。主要结局可能为在目标 SpO₂ 范围内的时间比例,并关注低氧血症、过度氧疗等安全性事件。
核心发现:所提供片段仅包含文献元数据、作者机构和试验名称,未包含论文正文结果,因此无法报告确切的效应值、P 值或临床结论。如需核心发现,需阅读 PMC 全文(PMC13434968)的结果部分。
一句话:这项随机对照试验评估了 AI 自主氧滴定能否在急性患者中更稳定地维持正常血氧水平,是医学 AI 闭环干预研究的关键证据来源,但具体结果需核对 PMC 原文。
Performance Comparison Between Domestic and International Large Language Models in Patient Education for Chinese Patients with Lumbar Disc Herniation: A Cross-Sectional Study.
领域:医学人工智能(大语言模型在腰椎间盘突出症患者教育中的应用)
方法:构建覆盖诊断、治疗、手术风险、就医导航的标准化数据集,采用统一提示词测试8个大语言模型(4个国际模型:ChatGPT-4o、Gemini-3.0-Pro、Claude-4.0、Grok-4-auto;4个国内模型:DeepSeek、Doubao、Qwen-Max、Kimi),由资深脊柱外科医生盲法评估,使用Mika量表(准确性)、改良DISCERN(可靠性)、EQIP和GQS评分,并通过鲁东大学文本分级平台评估可读性。
核心发现:各模型间性能差异显著(P < 0.001)。DeepSeek和Doubao的中位准确性最高(2.00,IQR 2.00–2.00)。存在“能力分化”:国际模型在复杂推理中安全护栏和逻辑稳健性更强,国内模型在服务情境化和本地资源导航方面具有独特优势。目前没有单一模型能完美结合全球医学证据与本地服务场景。DeepSeek、Doubao和Gemini是中国LDH患者教育的优选模型,但总体“优秀”回答比例不足25%,提示LLM仍应作为辅助工具。
一句话:基于PMC全文,该研究对比国内外8种大语言模型在腰椎间盘突出症患者教育中的表现,发现DeepSeek、Doubao和Gemini较优,但所有模型的优秀率均低于25%,提示目前仅适合作为辅助工具。