全部论文(35 篇)
Large Language Models in Lung Cancer: Systematic Review.
领域:肺癌(LC)与大型语言模型(LLM)交叉研究;医学人工智能系统综述
方法:遵循PRISMA指南,系统检索6大数据库至2025年1月1日;纳入期刊论文、会议论文和预印本,要求包含原始数据且肺癌相关数据可单独提取;由2名研究者独立筛选,并根据研究类型选用QUADAS-2、PROBAST、ROBINS-I等工具进行质量评价;提取模型类型、应用场景、提示方法、输入/输出格式、结局指标和安全性信息;采用描述性统计分析。最终纳入28项研究(2023-2024年发表)。
核心发现:LLMs在肺癌全程管理中的能力得到初步验证,包括自动提取医疗记录、普及肺癌基础知识、辅助临床诊断与治疗决策;同时展现出视觉能力与多模态潜力。提示工程是重要环节,从零样本到微调方法复杂程度不一。质量评估显示整体方法学严谨性可接受,但存在偏倚控制不足和数据安全报告不充分的问题;负责任的应用需关注隐私、可解释性与人类监督。
相关度:高——直接系统梳理LLM在肺癌诊疗中的应用现状、方法与安全挑战,为医学AI研究提供方向性证据。
一句话:LLMs在肺癌诊疗全流程中展现出应用潜力,但隐私保护、可解释性和人类监督是实现临床落地的关键前提。
Evaluating Large Language Models in Ophthalmology: Systematic Review.
领域:眼科人工智能 / 大语言模型评估
方法:系统综述与探索性Meta分析。检索PubMed、Web of Science、Embase和IEEE Xplore(截至2024年11月17日,无语言限制),纳入对现有或改良LLM进行眼科相关任务定量评估的研究。两名评审者独立筛选和提取数据,分歧由第三人解决。数据涵盖6个维度:LLM类型、数据模态、眼科亚专科、医学任务、评估维度、临床一致性。使用Python进行描述性统计,Fisher精确检验比较开源与闭源模型;对诊断任务进行随机效应Meta分析(logit变换,DerSimonian-Laird τ²,报告I²异质性)。
核心发现:纳入187项研究。闭源模型占主导(ChatGPT 170项,Gemini 58项,Copilot 32项),开源模型仅占13.4%,但在开发后评估研究中占77.3%(vs 纯评估研究4.8%,P<1×10⁻⁵)。评估以纯文本为主(n=168),图像-文本任务仅19项。亚专科覆盖不均衡:综合眼科72项、视网膜玻璃体32项、青光眼20项,而屈光手术、眼病理肿瘤、眼药理学均≤3项。主要任务为医学查询(n=86)、标准化考试(n=41)、诊断(n=29),研究辅助(n=5)、分诊(n=3)、疾病预测(n=3)较少。准确率报告最多(n=176),校准/不确定性极少(n=5)。真实世界患者数据(n=45)、人类表现比较(n=63)、非英语测试(n=24)、真实部署(n=4)相对缺乏。Meta分析汇总17项研究28个诊断评估,总体准确率0.594(95% CI 0.488-0.692),异质性极高(I²=94.5%),亚组异质性仍>80%,且结果不一致(如GPT-3.5合并准确率高于GPT-4)。
相关度:极高。该研究系统梳理了LLM在眼科评估的现状与关键缺口,指出当前证据高度异质、缺乏标准化基准和多模态/真实世界验证,为未来研究设计、模型选择及临床转化提供了重要参考基线。
一句话:眼科LLM研究数量庞大但质量参差,闭源文本问答占主导,开源与多模态/真实世界评估严重不足,且现有证据的异质性使Meta分析无法提供可靠的合并性能。
Home-Based Care for Hypertension in Rural South Africa.
领域:高血压管理 / 农村基层医疗 / 数字健康干预
方法:开放标签、个体随机对照试验(南非农村)。纳入774名成人高血压患者,随机分配至:常规诊所管理(SOC)、家庭血压自我监测+社区健康工作者访视+远程护士指导(CHW组)、增强CHW组(自动传输血压读数,eCHW+组)。主要结局为6个月收缩压,次要结局包括12个月收缩压及6/12个月血压控制率。
核心发现:与SOC相比,CHW组和eCHW+组6个月收缩压分别降低7.9 mmHg(95%CI -10.5~-5.3)和9.1 mmHg(95%CI -11.7~-6.4),均P<0.001。血压控制率(<140/90)在SOC组为57.6%,CHW组为76.9%(RR 1.33),eCHW+组为82.8%(RR 1.44)。12个月时效果仍持续。严重不良事件(2.7%)和死亡(1.0%)少见且组间相似,干预组保留率>95%。
相关度:高。该试验验证了移动应用辅助决策、远程护士指导和自动血压传输在真实世界低资源环境中的有效性,为AI驱动的临床决策支持、主动监测和慢性病管理算法提供了重要的实证依据和可推广的干预模式。
一句话:在资源有限的南非农村地区,家庭高血压管理模式较常规诊所管理显著更优,可大幅改善血压控制并维持良好保留率。
A personal health large language model for sleep and fitness coaching.
领域:个性化健康监测 / 睡眠与健身 / 大语言模型应用
方法:基于Gemini微调构建PH-LLM,用于处理可穿戴设备聚合的每日分辨率数值传感器数据;创建三个基准数据集,分别评估睡眠与健身领域的专家知识、个性化建议生成、以及基于纵向数据预测自我报告的睡眠质量;与人类专家及基线Gemini模型进行对比。
核心发现:PH-LLM在睡眠医学(79% vs 76%)和健身(88% vs 71%)多项选择考试中超过抽样人类专家;在857个真实世界案例评估中,PH-LLM的健身相关任务表现与人类专家相当,并在提供个性化睡眠见解方面优于基线Gemini模型;通过多模态编码可穿戴传感器数据,PH-LLM能有效预测自我报告的睡眠质量。
相关度:高——展示了LLM在可穿戴健康数据上进行个性化推理与预测的可行路径,提供了基准数据集、评分标准及性能参考,对推动医学AI在预防保健和个性化健康管理中的应用具有直接价值。
一句话:研究提出并验证了面向睡眠与健身的个性化健康大语言模型PH-LLM,其在专业知识、个性化建议和睡眠质量预测方面均表现出与人类专家相当或更优的性能。
Structural basis for the dynamic regulation of mTORC1 by amino acids.
领域:结构生物学 / 营养信号传导 / mTORC1 调控机制
方法:- 利用冷冻电镜(cryo-EM)解析人源蛋白复合物结构,包括 apo GATOR2、GATOR2–Sestrin2、GATOR2–CASTOR1 复合物。
- 设计“单链化”GATOR2 变体(single-chain GATOR2, sc-GATOR2),将 SEH1L 或 SEC13 与其互作亚基 WDR24、MIOS、WDR59 框内融合,以确保 GATOR2 颗粒完整性和亚基占有率。
- 结合免疫共沉淀(anti-Flag IP)、免疫印迹、凝胶过滤层析(size-exclusion chromatography)和 SDS-PAGE 验证复合物组装及相互作用。
- 解析无亮氨酸结合的 apo Sestrin2 结构,并比较氨基酸结合前后的构象变化。
核心发现:- GATOR2 形成八边形笼状结构,其 WD40 β-propeller 结构域是与其调控因子和氨基酸传感器结合的平台。
- Sestrin2(亮氨酸传感器)和 CASTOR1(精氨酸传感器)结合在 GATOR2 上不同的、不重叠的位点;破坏这些位点会选择性损害 mTORC1 对相应氨基酸的感知。
- 氨基酸结合会诱导 Sestrin2 和 CASTOR1 发生结构重排,使其从 GATOR2 上解离,从而解除对 GATOR2 的抑制。
- 传感器结合会限制 GATOR2 中 WDR24 β-propeller 的动态构象,而 WDR24 是营养依赖的 mTORC1 激活所必需的结构域。
- 因此,氨基酸信号通过变构机制传递给 GATOR2,驱动结构变化,最终激活 mTORC1。
相关度:中高。该研究提供了 mTORC1 氨基酸感知复合物的高分辨率结构,可作为 AI 辅助蛋白结构预测、蛋白-蛋白相互作用界面分析、变构位点识别以及基于结构的药物设计的重要参考数据集,也有助于构建营养信号通路动态模型。
一句话:通过冷冻电镜解析 GATOR2 与 Sestrin2/CASTOR1 的复合物结构,揭示氨基酸结合诱导传感器构象变化并从 GATOR2 解离,解除对 WDR24 β-propeller 的限制,从而变构激活 mTORC1 的分子机制。
Development and evaluation of a retrieval-augmented large language model framework for enhancing endodontic education.
领域:牙科(牙髓病学)医学教育中的大语言模型应用
方法:开发了基于检索增强生成(RAG)的多模态知识整合平台Endodontics-KB,集成2,200个多模态知识单元(文本与视频),构建分层RAG架构并实现EndoQ聊天机器人;使用11个专家验证问题与GPT-4、Qwen2.5、DeepSeek R1对比,由2名领域专家双盲评估5项指标(准确性、相关性、完整性、决策专业性、语言流畅性)。
核心发现:EndoQ在5点Likert量表上所有指标均显著优于通用大语言模型:准确性4.45±0.96、临床相关性4.59±0.8、完整性4.27±0.83、专业判断4.45±1.06、语言流畅性4.86±0.47。
相关度:高——展示了RAG架构在医学专科教育中整合多模态知识的可行性与优越性,提供了可扩展、可迁移的AI临床培训范式,对医学AI教育系统设计有直接参考价值。
一句话:基于RAG的多模态LLM框架EndoQ在牙髓病学教育中显著优于通用大语言模型,实现了精准、情境化的知识传递。
RAG suppresses group 2 innate lymphoid cells.
领域:免疫学 / 先天淋巴样细胞(ILC2)/ 2型免疫 / 特应性皮炎 / 基因调控与表观遗传学
方法:- 使用RAG缺陷小鼠与RAG足够小鼠进行对照,比较ILC2数量与功能。
- 检测稳态下ILC2的IL-5、IL-13产生能力。
- 构建特应性皮炎(AD)样疾病模型,评估RAG缺失对炎症严重程度的影响。
- 通过细胞内在性实验证明RAG对ILC2的调控不依赖于T、B淋巴细胞是否存在。
- 利用RAG1谱系示踪(lineage tracing)结合单细胞多组学分析(转录组+表观基因组),鉴定受RAG表达历史抑制的ILC2功能程序。
核心发现:- RAG缺失小鼠中,ILC2群体显著扩增,并在稳态下产生更多IL-5和IL-13。
- RAG缺陷小鼠在AD样皮炎模型中表现出更严重的炎症,ILC2是重要驱动因素。
- RAG对ILC2功能的抑制是细胞内在性的,不依赖适应性T/B淋巴细胞的缺失。
- 单细胞多组学分析显示,曾表达RAG1的ILC2谱系细胞中,多个关键转录程序与表观遗传程序被RAG历史性抑制。
- 揭示RAG在适应性免疫之外的新功能:通过抑制ILC2来调控制约先天2型炎症。
相关度:- 提供了RAG1谱系示踪的单细胞多组学数据资源,可用于构建ILC2细胞状态分类器或基因调控网络模型。
- 识别出的ILC2抑制性转录/表观程序可用于过敏性疾病的靶点发现和生物标志物挖掘。
- 对开发基于细胞状态和表观遗传特征的医学AI预测模型(如特应性皮炎、哮喘等2型免疫疾病)具有直接参考价值。
一句话:RAG不仅决定适应性免疫,还以细胞内在方式抑制ILC2的2型炎症功能,其缺失会导致ILC2过度活化并加剧特应性皮炎样疾病。
The Effectiveness of a Custom AI Chatbot for Type 2 Diabetes Mellitus Health Literacy: Development and Evaluation Study.
领域:医学人工智能 / 数字健康 / 糖尿病教育
方法:基于检索增强生成(RAG)的定制AI聊天机器人开发与评估。使用固定提示词和经过验证的参考文档构建T2DM聊天机器人。评估包括:(1) 44个由专家评估的精选问题(恰当性及来源归因);(2) 16个模拟典型患者咨询的查询。
核心发现:44个问题中,32个(73%)回答引用了参考文档,12个(27%)归因于一般知识。在32个有来源的回答中,30个(94%)完全恰当,2个(6%)部分恰当。12个一般知识回答中,1个(8%)不恰当。在16个模拟咨询中,所有回答(100%)完全恰当且均来自参考文档。表明RAG聊天机器人能提供上下文恰当、共情且临床可信的T2DM回答,并通过引用可信来源及提示一般知识使用来增强透明度。
相关度:高。验证了RAG架构在慢性病健康素养提升中的可行性,强调了来源可追溯性和患者中心参考文档的重要性,为医疗聊天机器人的可信度评估提供了可复现的方法框架,并提示一般知识使用可反向指导健康材料的优化。
一句话:基于RAG的定制AI聊天机器人可有效提供高质量、有据可查的糖尿病健康信息,且通过源引用和一般知识提示机制增强可信度与可解释性。
Retrieval-Augmented Generation: Advancing personalized care and research in oncology.
领域:肿瘤学中的人工智能与临床决策支持
方法:综述/观点文章,描述检索增强生成(RAG)的技术原理及其在肿瘤学中的应用潜力,并讨论其局限性与实施要求。
核心发现:RAG通过将大语言模型与最新数据结合,利用数值嵌入检索相关数据片段,可减少过时或虚构回答。在肿瘤学中,RAG可改善治疗推荐(整合遗传谱)、加强临床试验匹配(基于生物标志物分析)并加速药物开发。但效果依赖高质量数据源,数据偏差或不完整可能导致错误结果,需谨慎实施与人工监督。
相关度:高——直接关联医学AI落地中的可解释性、数据质量与临床可靠性挑战,并为肿瘤学个性化医疗提供技术路径。
一句话:RAG通过检索增强大语言模型,在肿瘤学中展现出改善治疗推荐、临床试验匹配和药物开发的潜力,但需高质量数据与人工监督以确保可靠性。
Large Language Model Applications for Health Information Extraction in Oncology: Scoping Review.
领域:肿瘤学临床文本的信息提取;大语言模型(LLM)在医学自然语言处理(NLP)中的应用。
方法:该文是范围综述(Scoping Review)。检索Ovid MEDLINE中自2000年以来发表的主要同行评审研究(检索日期2024年6月2日),纳入评估LLM用于肿瘤学临床文本数据提取性能的研究。提取研究特征和主要结局,总结LLM数据提取的研究趋势。
核心发现:共纳入24项研究。多数研究评估了原始或微调的BERT模型(n=18, 75%),其次为ChatGPT对话式LLM(n=6, 25%)。应用场景以泛癌种(n=11, 46%)最多,其次为乳腺癌(n=4, 17%)和肺癌(n=4, 17%)。75%的研究使用多机构数据集。与2019-2021年相比,2022-2024年研究总数(6→18)和使用提示工程的比例(0%→28%)增加,而使用微调的比例下降(100%→44.4%)。LLM的优点包括正向的数据提取性能和减少人工工作量。结论认为LLM可用于减少病历审核的行政负担,提示工程、微调和多模态数据提取是未来方向,但仍需在训练数据之外的临床领域和真实临床环境中评估其性能。
相关度:高。该综述系统梳理了LLM在肿瘤学临床文本信息提取中的研究现状、技术方法演变(从微调转向提示工程)和应用场景,为医学AI研究者提供了该领域的发展趋势、常见模型选择、数据来源和评估方式,并为后续研究缺口的识别提供了依据。
一句话:这篇范围综述显示,LLM在肿瘤学临床文本提取中应用日益增多,BERT微调是主流但提示工程正在兴起,LLM有望减轻临床文档负担并加速癌症研究。
Multinational Attitudes Toward AI in Health Care and Diagnostics Among Hospital Patients.
领域:医学人工智能/数字健康;患者对AI在医疗与诊断中应用的态度与偏好
方法:跨国横断面调查研究;于2023年2月1日至11月1日在43个国家74家医院开展,采用非概率抽样,纳入13,806名住院患者(≥18岁)。使用26项匿名问卷,包含一般资料(8项)及三个维度(对AI的信任、AI与诊断、对AI的偏好与担忧)各6项。数据分析采用累积链接混合模型和二元混合效应模型进行亚组分析。
核心发现:- 总体而言,患者对医疗AI持积极态度,57.6%(7775/13,502)表示正面看法。
- 但对AI的信任度偏低:所有信任相关条目中,持积极态度的比例均不足50%;最低信任项为“AI提供治疗反应信息的准确性”,仅41.8%(5637/13,480)表示信任。
- 患者更偏好可解释AI(70.2%,8816/12,563)和医生主导决策(72.9%,9222/12,652),即使这意味着AI准确性略有降低。
- 态度差异与人口学特征、健康状况和技术素养相关:女性、健康状况较差者对医疗AI的积极态度更低;AI知识水平更高、更频繁使用技术设备者态度更积极。
- 全球南方(Global South)与全球北方(Global North)患者均有覆盖,样本中64.8%来自全球北方,35.2%来自全球南方。
相关度:高。该研究为AI医疗产品的设计、部署与监管提供了跨国别、大规模的患者视角证据,强调可解释性、医生监督和人群异质性的重要性,对AI临床转化、人机协作和个性化患者沟通策略具有直接指导意义。
一句话:一项覆盖43国74家医院、超过1.3万名住院患者的大型横断面研究显示,患者整体支持医疗AI,但对AI信任度有限,且更偏好可解释AI与医生主导决策,提示AI医疗落地需结合患者特征进行量身定制并保留临床医生监督。
The emergence of large language models as tools in literature reviews: a large language model-assisted systematic review.
领域:医学信息学 / 系统评价方法学 / 大语言模型应用
方法:系统综述。检索截至2024年6月,覆盖PubMed、Scopus、Dimensions、Google Scholar;由人类审稿人在Covidence中完成筛选和资料提取,并使用基于OpenAI GPT-4o的LLM辅助插件、ChatGPT和Scite.ai辅助数据清洗、绘图和文稿撰写。最终纳入172篇研究,定量汇总LLM在综述自动化中的使用模式、模型架构、性能指标(如精确率、召回率)。
核心发现:在172篇纳入研究中,ChatGPT及GPT类LLM是综述自动化中最主要的架构(n=126, 73.2%)。真正在综述中明确承认使用LLM的论文仅有26篇(15.1%)。大部分文献关注自动化综述的特定阶段:文献检索(n=60, 34.9%)和数据提取(n=54, 31.4%)。GPT类模型在数据提取中的合并性能优于BERT类模型,平均精确率83.0%(SD=10.4),召回率86.0%(SD=9.8)。作者认为LLM虽在数值数据提取准确性上存在局限,但将很快改变科学综述的开展方式。
相关度:高。该研究系统梳理了LLM在系统综述自动化中的最新应用格局、技术路线与性能基线,为医学AI研究者选择工具、设计自动化综述流程以及评估模型能力提供了直接参考。
一句话:基于LLM辅助的系统综述显示,GPT类模型已成为综述自动化的主流工具,且其在数据提取环节的性能优于BERT类模型,但真正在综述中明确承认使用LLM的论文比例仍较低。
Sociodemographic biases in medical decision making by large language models.
领域:医学人工智能 / 大语言模型在临床决策中的公平性
方法:系统评估9种大语言模型,基于1000个急诊病例(500真实+500合成),每个病例构造32个社会人口学变体(31个群体+对照组)以保持临床细节恒定,分析超过170万条模型输出,并与医生基线及模型自身对照组比较,使用多重假设校正。
核心发现:标记为黑人、无家可归者或LGBTQIA+的病例更常被推荐紧急护理、侵入性干预或心理健康评估(例如LGBTQIA+亚组心理健康评估推荐频率为临床需要的6–7倍);高收入标记病例更常被推荐CT/MRI等高级影像检查,而低/中收入标记病例常被限制于基础或无进一步检查;这些差异经多重校正后仍显著,且缺乏临床指南支持,提示模型驱动偏见而非合理变异;专有和开源模型均受影响。
相关度:高——该研究直接揭示了LLM在医学决策中可能固化的社会人口学偏见,为AI医疗应用的公平性评估和缓解策略开发提供了关键证据。
一句话:大语言模型在医疗决策中表现出与社会人口学特征相关的系统性偏见,可能加剧健康差异。
Retrieval augmented generation for large language models in healthcare: A systematic review.
领域:医学人工智能 / 医疗健康领域的大语言模型与检索增强生成(RAG)
方法:系统综述(Systematic Review),系统评估RAG在医疗健康领域大语言模型中的应用,重点分析检索(Retrieval)、增强(Augmentation)、生成(Generation)三个环节,并汇总现有数据集、RAG方法、评估框架、局限性与研究空白。
核心发现:- 78.9%的研究使用英文数据集,21.1%使用中文数据集。
- 医疗RAG应用采用的技术包括Naive RAG、Advanced RAG和Modular RAG。
- 令人意外的是,专有模型(如GPT-3.5/4)是医疗RAG应用中最常用的大语言模型。
- 目前缺乏针对RAG应用的标准评估框架。
- 大多数研究未充分评估或处理RAG在医疗领域中的伦理问题。
- RAG通过引入外部知识源来弥补LLM训练数据过时、生成内容不准确(幻觉)以及透明度不足等问题。
相关度:高。该综述系统梳理了RAG在医疗场景中的技术路径、数据集分布、常用模型和评估现状,为医学AI研究者提供了研究基础、工具选择和待解决的关键空白,尤其是评估标准化和伦理治理方面。
一句话:这篇系统综述发现,RAG在医疗大语言模型中被广泛用于提高回答准确性和可追溯性,但当前存在评估框架缺失、专有模型依赖度高、伦理问题关注不足等主要挑战。
Regulatory T cells attenuate chronic inflammation and cardiac fibrosis in hypertrophic cardiomyopathy.
领域:肥厚型心肌病(HCM)的免疫机制与纤维化治疗
方法:人体心肌样本分析(尸检/移植心脏)结合GSEA;HCM小鼠模型(Actc1E99K);基因敲除(Rag-1KO)淋巴细胞耗竭;Treg细胞过继转移;低剂量IL-2/抗IL-2复合物(IL-2/c)体内扩增Treg;组织学与心功能评估。
核心发现:人类HCM心脏存在慢性局灶性白细胞浸润和免疫细胞激活;免疫应答在中晚期HCM心脏及多种HCM小鼠模型中均被富集。淋巴细胞缺失加剧Actc1E99K小鼠的不良心脏重构。心脏Treg细胞随时间增加但免疫抑制表型改变。过继转移Treg细胞可减少纤维化并改善收缩功能;IL-2/c扩增Treg也能减轻纤维化并减少巨噬细胞浸润/激活。
相关度:高——该研究提供了HCM中免疫细胞动态和Treg治疗靶点的多维度数据,可作为构建HCM疾病进展预测模型、免疫状态评估或纤维化干预效果分析的特征基础。
一句话:摘要表明Treg细胞能减轻HCM中的慢性炎症和心肌纤维化,为HCM的免疫治疗提供了临床可转化策略。
Large Language Model Symptom Identification From Clinical Text: Multicenter Study.
领域:临床自然语言处理 / 医学人工智能 / 症状识别
方法:多中心回顾性研究,评估GPT-4、GPT-3.5、Llama2 70B、Mixtral 8×7B四种大语言模型在急诊科电子健康记录中识别感染性呼吸道症状的能力。提示词模拟人工病历审查员并遵循症状标注指南;以波士顿儿童医院103条笔记开发提示策略,202条笔记测试;最佳模型在印第安纳州21家急诊科308条笔记中验证泛化性,并与ICD-10编码方法比较。
核心发现:所有LLM的症状识别F1分数均显著高于ICD-10基线(45.1%);GPT-4最高(测试集91.4%,验证集94.0%),优于GPT-3.5(90.0%)、Mixtral(83.5%)、Llama2(81.7%)。ICD-10基线在验证集降至26.9%,而GPT-4泛化性更好(P<.001)
相关度:高——提供LLM替代传统编码/规则方法进行多中心症状提取的实证,展示无需微调即可泛化的潜力,对临床文本挖掘与电子健康记录表型分析有直接参考价值
一句话:大语言模型(尤其GPT-4)可模拟人工图表审查员,在跨机构急诊文本中显著优于ICD-10方法,实现高准确率且无需站点定制。
Retrieval-augmented generation elevates local LLM quality in radiology contrast media consultation.
领域:医学影像 / 放射学人工智能 / 本地部署大语言模型(LLM)
方法:该研究针对100例合成碘化对比剂(ICM)咨询问题,比较本地部署的Llama 3.2-11B模型(基线版 vs 检索增强生成/RAG版)与三种云端模型(GPT-4o mini、Gemini 2.0 Flash、Claude 3.5 Haiku)的回答质量。由一名盲法放射科医生对五组回答进行排名,并使用三个LLM裁判从准确性、安全性、结构、语气、适用性和延迟六个维度评分。RAG版本通过引入外部领域知识进行检索增强,评估其是否能在保持本地部署隐私优势的同时提升性能。
核心发现:在受控条件下,RAG将Llama 3.2-11B的幻觉率从8%降至0%(χ²₍Yates₎ = 6.38,p = 0.012),平均排名提升1.3(Z = –4.82,p < 0.001)。RAG增强后的本地模型仍比云端模型更快(2.6秒 vs 4.9–7.3秒),且LLM裁判偏好其胜过GPT-4o mini,但放射科医生对GPT-4o mini排名更高。尽管与云端模型仍存在性能差距,RAG显著改善了本地临床LLM的可靠性,同时保留了本地部署的数据隐私优势。
相关度:高。研究直接回应了医疗AI中“隐私—性能”两难问题,证明RAG可有效增强本地LLM在放射学专科咨询任务中的表现,减少幻觉并提升实用性,对希望在不泄露患者数据前提下部署AI的机构具有重要参考价值。
一句话:RAG能显著减少本地LLM在放射科对比剂咨询中的幻觉并提升回答质量,但仍略逊于顶尖云端模型,是隐私敏感场景下可行的折中方案。
Artificial Intelligence-Driven Cancer Diagnostics: Enhancing Radiology and Pathology through Reproducibility, Explainability, and Multimodality.
领域:癌症影像诊断(放射学、病理学、多模态)
方法:综述性分析,涵盖AI在图像分类、图像分割、多实例学习、生成模型、自监督学习中的应用
核心发现:AI可提升放射学中肿瘤检测与治疗规划、病理学中癌症检测与生物标志物发现,并通过多模态整合(影像+病理+基因组)提供更全面的诊断;强调可重复性和可解释性对于临床决策的重要性
相关度:高——系统梳理了AI在癌症诊断中的核心技术、应用场景及挑战,为多模态与可解释AI研究提供方向
一句话:综述AI在放射学、病理学及多模态癌症诊断中的进展,突出可重复性、可解释性与跨模态整合对提升患者预后的潜力。
Multitask Deep Learning Based on Longitudinal CT Images Facilitates Prediction of Lymph Node Metastasis and Survival in Chemotherapy-Treated Gastric Cancer.
领域:胃肠道肿瘤影像组学 / 医学人工智能
方法:基于纵向CT影像训练多任务深度学习模型CTSMamba,联合空间Mamba与协同注意力机制,同步预测淋巴结转移(LNM)和总生存期(OS);内部训练/验证(398例)后,在两个外部中心(623例)进行验证,并与临床模型比较。
核心发现:CTSMamba在各队列中预测LNM均显著优于临床模型;将CTSMamba生存评分与临床预测因子整合可进一步提升个体化OS预测性能。
相关度:高——展示了多任务、多中心纵向影像建模在肿瘤精准预后中的可行性,且Mamba架构在医学影像中的应用具有方法学参考价值。
一句话:基于新辅助化疗胃癌患者纵向CT影像训练的多任务深度学习模型CTSMamba,可同时准确预测淋巴结转移和总生存期,有望辅助个体化治疗决策。
A fully open AI foundation model applied to chest radiography.
领域:医学影像AI / 胸部X光(胸片)基础模型
方法:开发并预训练了开放的全AI基础模型Ark+,通过循环累积并复用来自多个数据集中的异质专家标签;支持联邦学习、少样本学习、零样本迁移、微调与多模态扩展。
核心发现:Ark+在胸部疾病诊断上表现优异,扩展了诊断范围,减少误诊;能适应新疾病、从少量样本学习罕见病、无需训练即可迁移到新诊断场景;对数据偏差和长尾分布具有鲁棒性;支持联邦学习保护隐私;开放全部代码和预训练模型,且可扩展至多种模态。研究表明,开放模型利用多个公开(大型或小型)数据集累积异质专家标注知识,可超越在大型数据上训练的专有模型。
相关度:极高——提供了一个开放、可泛化、可扩展的胸片基础模型范式,强调数据共享、知识累积与隐私保护,直接影响医学AI模型的开发、评估和开源生态。
一句话:开放基础模型Ark+通过累积多样化异质专家标签,在胸片诊断中超越专有模型,并支持少样本、零样本、联邦学习与多模态扩展。
RadioRAG: Online Retrieval-Augmented Generation for Radiology Question Answering.
领域:放射学人工智能 / 大语言模型(LLM)与检索增强生成(RAG)
方法:开发了放射学专用在线RAG框架(RadioRAG),从Radiopaedia实时检索权威信息并注入提示。使用RSNA Case Collection的80道放射学病例题和24道专家出题,评估GPT-3.5-turbo、GPT-4、Mistral 7B、Mixtral 8×7B、Llama3-8B/70B等LLM在有无RadioRAG下的零样本回答准确率,并通过bootstrapping进行统计检验,同时比较人类专家表现、幻觉率及响应时间。
核心发现:RadioRAG显著提升部分LLM的答题准确率(如GPT-3.5-turbo:66%→74%,FDR=0.03;Mixtral 8×7B:65%→76%,FDR=0.02),部分模型可超过人类专家(63%,FDR≤0.007);所有LLM的幻觉率降低6%–25%,但响应时间约增加4倍。
相关度:高——直接展示在线RAG在放射学问答中的潜力与代价,为医学LLM落地提供可复现框架和评估范式。
一句话:RadioRAG通过实时检索外部权威放射学知识,能提升部分大语言模型的病例问答准确率并减少幻觉,但以明显增加响应时间为代价。
Answering real-world clinical questions using large language model, retrieval-augmented generation, and agentic systems.
领域:医学人工智能 / 大语言模型(LLM)在临床决策支持中的应用,涉及检索增强生成(RAG)与智能体(Agentic)系统
方法:将50个真实临床问题提交给5种基于LLM的系统:OpenEvidence(RAG)、ChatRWD(智能体/数据提取分析管道)、以及3种通用LLM(ChatGPT-4、Claude 3 Opus、Gemini 1.5 Pro)。由9名独立医生对回答的相关性、支持证据质量和可操作性(足以证明或改变临床实践)进行评分。
核心发现:通用LLM仅对2–10%的问题给出相关且循证的答案;RAG系统OpenEvidence为24%,智能体系统ChatRWD为58%。在有现成证据的问题中,OpenEvidence有48%给出可操作性答案,ChatRWD为37%,通用LLM<5%;在缺乏现有文献的问题中,ChatRWD有52%给出可操作性答案,其他LLM<10%。专用系统显著优于通用LLM,且RAG与智能体系统互补。
相关度:高。该研究直接比较了当前主流LLM架构在真实临床问答中的表现,明确了RAG和智能体系统各自的优势场景,为构建临床AI决策支持工具提供了重要设计参考。
一句话:针对真实临床问题,RAG和智能体LLM系统远优于通用LLM,且两者结合有望同时改善“有证据”和“无证据”情况下的临床可操作答案生成。
Enhancing medical AI with retrieval-augmented generation: A mini narrative review.
领域:医学人工智能 / 检索增强生成(RAG)在医学中的应用
方法:叙述性综述。作者在PubMed、SCOPUS、EMBASE和Web of Science中检索截至2024年5月利用RAG完成医学任务的研究,并归类分析其应用领域。
核心发现:RAG通过整合外部知识源显著增强了LLM在医学任务中的准确性和可靠性,已应用于临床决策支持、指南解读、诊断辅助、临床试验资格筛选、临床信息检索与聊天机器人、以及科学文献信息抽取等多个场景。研究表明RAG系统在患者诊断、临床决策和医学信息抽取等任务中优于传统方法,但面临模型评估、成本效率和减少AI幻觉等挑战。
相关度:高。该综述系统梳理了RAG在医学中的典型应用与优势,为医学AI研究者提供了方向参考,并指出了检索机制、嵌入模型优化及AI与临床协作等关键改进空间。
一句话:这篇迷你叙述性综述表明,RAG通过引入外部知识显著提升了医学大语言模型的准确性与可靠性,在临床诊断、指南解读和临床试验筛选等任务中展现出良好前景,但需进一步解决评估、成本与幻觉问题。
Testing and Evaluation of Health Care Applications of Large Language Models: A Systematic Review.
领域:医疗保健大语言模型(LLM)应用的测试与评估
方法:系统综述,检索并分析截至2024年发表的关于LLM医疗应用测试与评估的文献,提取评估对象、测试方法、指标及结果,并总结当前实践中的不足。
核心发现:现有LLM医疗应用的评估多集中于问答准确性,缺乏对安全性、公平性、鲁棒性及临床工作流程整合等维度的系统测试;评估数据集和指标异质性大,且多数研究未在真实临床环境中验证。
相关度:高——系统梳理了LLM医疗评估现状,揭示了关键方法学缺口,为设计更严谨的评估框架提供依据。
一句话:这篇系统综述表明,当前大语言模型在医疗应用中的测试与评估尚不成熟,亟需标准化、多维度且贴近临床实践的评估体系。
Switching to faricimab from the current anti-VEGF therapy: evidence-based expert recommendations.
领域:眼科 / 视网膜疾病(新生血管性年龄相关性黄斑变性 nAMD、糖尿病性黄斑水肿 DME)
方法:循证专家建议(专家小组综述,汇总现有证据与临床经验,聚焦从现有抗VEGF治疗转换为faricimab的决策)
核心发现:Faricimab作为首个双特异性眼内注射药物,同时抑制VEGF和Ang-2,在III期试验中可实现最长16周的治疗间隔,并改善视力与视网膜厚度;真实世界研究支持其在既往接受其他抗VEGF治疗患者中的安全性、视觉和解剖学获益及持久性。
相关度:中等——内容为临床治疗策略与专家共识,涉及药物转换决策,但不涉及AI方法或计算模型;对眼科AI辅助治疗决策或真实世界证据分析可能有背景参考价值。
一句话:基于现有证据与专家经验,推荐在nAMD和DME患者中从当前抗VEGF治疗转换为faricimab,以获得更长治疗间隔和稳定的解剖学/视力获益。
An evaluation framework for clinical use of large language models in patient interaction tasks.
领域:临床大语言模型(LLM)评估 / 医学人工智能
方法:提出 CRAFT-MD(Conversational Reasoning Assessment Framework for Testing in Medicine)评估框架,通过模拟AI代理与LLM进行自然对话,替代传统结构化医学考试;在12个医学专科中评估GPT-4、GPT-3.5、Mistral和LLaMA-2-7b,并额外分析GPT-4V的多模态对话与视觉评估能力。
核心发现:当前LLM在临床对话推理、病史采集和诊断准确性方面存在明显局限;即使多模态模型GPT-4V,这些局限仍然存在。基于实证结果,作者建议未来评估应强调真实的医患对话、全面病史采集、开放式提问,以及自动化评估与专家评估相结合。
相关度:极高。该研究直接面向临床LLM现实应用中的评估缺口,为研究者提供了可操作的评估框架和实证基准,对判断模型是否适合进入临床决策支持具有重要参考价值。
一句话:CRAFT-MD通过模拟自然医患对话评估LLM,发现包括GPT-4在内的模型在临床推理与病史采集上仍存在关键局限,并提出更贴近真实临床场景的评估建议。
LBX2 promotes colorectal cancer progression via the glycosylation and lactylation positive feedback.
领域:结直肠癌(CRC)发生发展的分子机制,聚焦癌症代谢、糖基化与乳酰化调控网络
方法:体外细胞增殖实验、体内肿瘤模型、ChIP-seq/RNA-seq鉴定转录靶点、代谢组学(UDP-GlcNAc/乳酸检测)、蛋白质翻译后修饰分析(O-GlcNAc糖基化、H4K12乳酰化)、mTORC1活性检测、临床标本相关性分析及患者来源类器官药物敏感性实验
核心发现:LBX2直接转录激活GFPT2,升高UDP-GlcNAc水平并增强O-GlcNAc糖基化,修饰Raptor T700位点,强化Raptor-Rag相互作用从而激活mTORC1,驱动糖酵解和乳酸蓄积;乳酸进一步诱导组蛋白H4K12乳酰化,反馈上调LBX2转录,构成正反馈环路。LBX2高表达在CRC患者中与PET-CT高SUVmax(高糖酵解)相关,高LBX2类器官对GLUT1抑制剂更敏感。LBX2是CRC代谢驱动因子及潜在治疗靶点/生物标志物。
相关度:高度相关——揭示了转录因子-代谢酶-翻译后修饰-表观调控的正反馈新机制,为CRC代谢重编程提供了可干预的靶点,并提示LBX2/GFPT2/糖酵解轴可用于影像-病理-治疗关联的AI多模态预测研究。
一句话:LBX2通过GFPT2介导的O-GlcNAc糖基化激活mTORC1促进CRC糖酵解,乳酸诱导H4K12乳酰化反馈上调LBX2,形成驱动肿瘤进展的正反馈环路,且高LBX2预示GLUT1抑制剂治疗敏感性。
A large language model digital patient system enhances ophthalmology history taking skills.
领域:医学教育 / 眼科临床技能培训 / 大语言模型应用
方法:基于此前建立的开源检索增强框架,开发了基于大语言模型的数字病人系统(LLMDP),将去标识化的电子健康记录转化为支持语音交互、自由文本对话和自适应反馈的虚拟病人。开展单中心随机对照试验(NCT06229379,N=84),比较LLMDP训练与传统方法在医学生眼科病史采集技能上的效果,评估指标包括病史采集评分、同理心表现及参与者满意度。
核心发现:LLMDP组学生的病史采集评分比传统方法组高10.50分(95% CI: 4.66–16.33,p<0.001);LLMDP组学生表现出更强的同理心;参与者对LLMDP满意度高,认为其降低了培训成本并增强了与真实患者互动的信心。研究表明LLM驱动的数字病人能有效提升病史采集技能,并为生成式AI在眼科教育中的规模化、低风险应用提供了证据。
相关度:高。该研究展示了LLM在真实医学教育场景中的随机对照验证,涉及电子健康记录利用、对话式虚拟病人构建、教育效果评估等核心AI与医学交叉问题,为生成式AI在临床教学中的落地提供了可复现的方法学参考。
一句话:基于大语言模型的数字病人系统(LLMDP)通过随机对照试验证明可显著提升眼科医学生的病史采集技能和同理心,且用户满意度高,为生成式AI在医学教育中的低风险规模化应用提供了实证支持。
Summary Report of the SNMMI AI Task Force Radiomics Challenge 2024.
领域:医学影像AI / 影像组学;核医学;淋巴瘤预后预测;18F-FDG PET/CT
方法:该研究是SNMMI AI Task Force发起的影像组学挑战赛。目标是利用基线18F-FDG PET/CT影像组学数据,预测弥漫性大B细胞淋巴瘤(DLBCL)患者的无进展生存期(PFS),分为二分类结局(<2年 vs ≥2年)和连续结局(以月计)。参赛者获得含金标准的影像组学训练集和无金标准的测试集。连续结局使用均方根误差(RMSE)评估,二分类结局使用1、2、3年PFS的C-index评估。外部验证中,将参赛模型与仅使用SUV和总代谢肿瘤体积(TMTV)的简单线性/逻辑回归参考模型进行比较。
核心发现:共收到15个团队提交的19个连续结局预测模型,外部验证显示其中6个模型的表现与仅用SUV和TMTV的简单线性参考模型相似;9个团队提交了12个二分类结局模型,外部验证显示有1个模型的C-index高于基于SUV和TMTV的简单逻辑回归模型,但差异不显著。总体而言,在本次挑战数据集中,复杂的影像组学特征和机器学习模型相比仅基于SUV和TMTV的简单模型,未带来显著的预后预测价值提升。
相关度:中高。该研究对影像组学/医学AI预测模型研究有重要警示意义:应重视外部验证、与简单基线模型比较,并警惕高维特征和复杂模型在小样本场景下的过拟合风险。
一句话:SNMMI影像组学挑战2024表明,基于18F-FDG PET/CT影像组学的复杂机器学习模型,在DLBCL患者PFS预测上并未显著优于仅使用SUV和TMTV的简单模型。
Retrieval Augmented Generation-Enabled Large Language Model for Risk Stratification of Cutaneous Squamous Cell Carcinoma.
领域:皮肤科肿瘤学 / 医学人工智能 / 大语言模型在预后风险分层中的应用
方法:- 构建检索增强生成(RAG)知识库:对cSCC不良结局风险因素进行系统性文献综述。
- 使用RAG增强的生成式预训练Transformer(GPT)模型,开发新型基于类别的风险分层系统——人工智能衍生风险评分(AIRIS),为各风险因素分配分值。
- 在包含2379例原发性cSCC肿瘤(1996–2023,随访≥36个月)的前瞻性+回顾性联合队列中,与Brigham and Women’s Hospital(BWH)及AJCC第8版(AJCC8)系统比较,评估其对局部复发(LR)、淋巴结转移(NM)、远处转移(DM)和疾病特异性死亡(DSD)的预测性能。
- 评价指标:区分度、同质性、单调性(按AJCC8定义),以及敏感性、特异性、PPV、NPV、准确率、AUC、C指数。
核心发现:- AIRIS在LR、NM、DM、DSD的敏感性上均最优(分别为49.1%、73.7%、82.5%、72.2%)。
- AIRIS的AUC最高(LR 0.69,NM 0.81,DM 0.85,DSD 0.80),判别能力显著优于BWH和AJCC8。
- 低风险类别中不良结局比例最低,提示同质性和单调性更好;各系统区分性相近。
- AIRIS整体表现优于现有BWH和AJCC8系统,展示了大语言模型在改进癌症预后工具方面的潜力。
相关度:高度相关。该研究示范了如何将检索增强生成与通用大语言模型结合,用于构建可解释、可验证的临床预后分层工具,为AI在精准肿瘤学中的落地提供新范式。其方法(RAG知识库+GPT评分系统)和评估框架(AJCC标准指标)对开发同类医学AI系统具有直接参考价值。
一句话:本研究利用RAG增强的GPT模型开发出cSCC风险分层系统AIRIS,在多种不良结局预测上显著优于BWH和AJCC8,展示了大语言模型用于临床预后分层的可行性与潜力。
Large Language Model Analysis of Reporting Quality of Randomized Clinical Trial Articles: A Systematic Review.
领域:医学人工智能 / 临床研究报告质量评估 / 大语言模型应用
方法:该研究为系统综述,构建并验证了一个零样本大语言模型(zero-shot LLM,使用 ChatGPT-4o-mini)评估流程,用于自动判定随机对照试验(RCT)对 CONSORT 报告规范的依从性。研究纳入 PubMed 上 1966 至 2024 年发表的英文、开放获取、人体 RCT 文献,共筛选 53,137 篇 PDF,最终纳入 21,041 篇 RCT(中位发表年份 2014 年,涉及 30 个生物医学学科;其中 1,790 篇有注册库关联数据)。模型先在 50 篇 CONSORT-TM 基准文献上测试,再在 70 篇随机抽样文献中与专家人工评审对照(共 2,210 项判定),最后应用于全部样本。LLM 对每项 CONSORT 条目(共 21 项)判断是否报告,并以精确率、召回率、宏 F1 及报告比例作为主要结局。
核心发现:- 模型性能:在 70 篇验证集中,LLM 输出与专家判定的一致率为 91.7%(2026/2210);在 CONSORT-TM 基准上的宏 F1 为 0.86(95% CI, 0.84-0.87)。
- 时间趋势:总体 CONSORT 依从性从 1966-1990 年的 27.3%(95% CI, 27.0%-27.6%)上升至 2010-2024 年的 57.0%(95% CI, 56.8%-57.2%)。
- 持续薄弱环节:关键方法学条目报告率仍然很低,例如分配隐藏机制仅 16.1%(95% CI, 15.6%-16.6%),外部效度讨论仅 1.6%(95% CI, 1.5%-1.8%)。
- 学科差异:依从性在药理学最低(35.2%),泌尿外科最高(63.4%);与试验特征(资助来源、阶段、FDA 监管等)的关联很小(所有 CramerV < 0.10)。
相关度:高。该研究展示了 LLM 可作为规模化、可自动化验证的 RCT 报告质量审计工具,可用于科研诚信监测、编辑审稿辅助及 meta 研究质量评估;其零样本设计也提示 LLM 可迁移到其他报告规范或研究类型。
一句话:该研究利用零样本 LLM 对 2 万余篇 RCT 进行了 CONSORT 依从性自动评估,验证了其可靠性,并揭示出报告质量随时间提升但仍存在关键方法学条目报告不足和明显学科差异的问题。
Comparative benchmarking of the DeepSeek large language model on medical tasks and clinical reasoning.
领域:医学人工智能 / 大语言模型临床评估
方法:对比评估三种大语言模型(DeepSeek-R1、ChatGPT-o1、Llama 3.1-405B)在四项医学任务上的表现:USMLE问答、基于文本的诊断与病例推理、RECIST 1.1肿瘤分类、多模态影像报告摘要生成;并对推理步骤和报告质量进行评分。
核心发现:DeepSeek-R1在USMLE上准确率0.92,略低于ChatGPT-o1(0.95,P=0.04),但优于Llama 3.1-405B(0.83,P<10⁻³);在文本病例挑战中与ChatGPT-o1表现相当;RECIST分类亦无显著差异(0.74 vs 0.81,P=0.10)。其诊断推理步骤评分高于ChatGPT和Llama(3.61 vs 3.22 vs 3.13,P=0.005与P<10⁻³),但影像报告摘要质量低于ChatGPT-o1(4.5 vs 4.8,P<10⁻³)。
相关度:高——直接评估了新一代推理型LLM在医学考试、临床推理、肿瘤评估和影像报告生成中的表现,为模型选型和优化提供实证依据。
一句话:DeepSeek-R1在多数医学任务上与ChatGPT-o1相当或更优,但影像报告摘要质量仍需改进。
Large language models deconstruct the clinical intuition behind diagnosing autism.
领域:自闭症诊断 / 临床直觉解析 / 大语言模型医学应用
方法:在大规模通用语料上预训练后,使用超过4,000份临床自由文本记录对大语言模型(LLM)进行微调,用于区分确诊与疑似自闭症;引入可解释性策略,定位最影响临床正确判断的关键句子,从而解构专家临床直觉。
核心发现:模型识别出自闭症最关键的DSM-5诊断标准是刻板重复行为、特殊兴趣和感知觉相关行为,而非当前强调的社交互动缺陷;提示长期使用的金标准诊断标准可能需要修订。
相关度:较高。研究展示了LLM不仅能辅助诊断,还能用于解释临床决策逻辑并生成可检验的医学假说,为精神疾病诊断标准优化提供数据驱动证据。
一句话:通过LLM分析临床记录,发现自闭症诊断的核心线索是重复行为与特殊兴趣,而非社交缺陷,提示现有诊断标准可能需调整。
Best Practices for Large Language Models in Radiology.
领域:放射学 / 人工智能与大数据 / 大语言模型(LLM)临床应用与治理;属于“声明与指南(Statements and Guidelines)”类文献。
方法:非原始实验研究,而是一篇基于专家共识、现有文献回顾和临床工作流分析的最佳实践指南。文章围绕大语言模型在放射学中的应用,提出了系统性的部署建议,并通过表格和图注归纳关键流程、风险点和评估要素。
核心发现:大语言模型有潜力辅助放射科医师整合影像学与临床信息,从而生成可执行的诊断报告,但临床应用需遵循多环节最佳实践,包括:模型选择和微调、检索增强生成、数据隐私与安全保护、输出验证与质量评估、临床工作流整合、人机协作及医师监督。指南强调,LLM应作为辅助工具,而不能替代放射科医师的判断与责任;需要针对幻觉、偏见、数据漂移等风险建立持续监测和治理机制。
相关度:高。该指南为医学AI研究者提供了面向临床部署的实践框架,尤其适用于放射学LLM产品的设计、评估、监管合规和临床转化研究。
一句话:该指南系统提出放射学中部署大语言模型的最佳实践,核心是“安全、透明、人机协作、临床验证”,帮助放射科医师将复杂影像与临床信息整合为可靠诊疗信息。
Future horizons: Innovation, aging, and equity.
领域:神经退行性疾病(NDDs)的精准医学,涉及衰老与健康公平
方法:综述/前瞻性分析,整合AI、多组学、生物标志物、药物基因组学、基因治疗及远程医疗等策略,讨论其应用与挑战
核心发现:精准医学有望通过AI平台(如IHI-PROMINENT)、多组学分层、液体/影像生物标志物及基因疗法(CRISPR、ASOs)实现AD/PD等NDD的早期诊断和个体化治疗;但仍面临生物标志物验证、多组学标准化、真实世界数据整合等障碍,且老龄化、共病和全球诊断/治疗可及性差异加剧公平性问题,需通过远程临床试验、公私合作和风险共担政策推动转化。
相关度:高——直接涉及AI驱动的疾病预测、患者分层、多组学数据整合及数字健康技术应用,为医学AI在神经退行性疾病精准诊疗中的研发方向提供了明确框架。
一句话:基于摘要的前瞻分析:精准医学结合AI、多组学与基因技术有望变革NDD诊疗,但需解决验证、标准化与公平性挑战。