全部论文(20 篇)
A context-augmented large language model for accurate precision oncology medicine recommendations.
领域:精准肿瘤学、医学人工智能、大语言模型(LLM)
方法:开发了一个基于检索增强生成(RAG)的大语言模型工作流,以分子肿瘤学知识库(Molecular Oncology Almanac, MOAlmanac)作为上下文来源。在合成查询和来自执业肿瘤学家的真实世界查询上,对比了RAG-LLM与纯LLM方法的治疗推荐准确性,并探索了多种提示与检索策略以优化性能。
核心发现:RAG-LLM在合成查询上达到95%的准确率,在真实世界查询上达到93%的准确率,显著优于仅使用LLM的方法。结果表明,结合动态更新的专业知识库能有效提升LLM在精准肿瘤学治疗推荐中的准确性,为临床部署提供了可行框架。
相关度:高。研究直接针对临床决策支持中的LLM知识滞后与幻觉问题,提出了可复现的RAG解决方案,并验证了其在真实场景中的有效性,对推动医学AI落地具有重要参考价值。
一句话:通过检索增强生成(RAG)为LLM注入分子肿瘤学专业知识,该框架在精准肿瘤学治疗推荐中达到93%以上准确率,为临床LLM部署提供了可靠路径。
General-purpose large language models outperform specialized clinical AI tools on medical benchmarks.
领域:医学人工智能,临床决策支持系统
方法:定量评估两种专门的临床AI工具(OpenEvidence 和 UpToDate Expert AI)与通用大语言模型在多个医学基准测试上的性能比较。
核心发现:通用大语言模型在医学基准上的表现优于专门为临床场景设计的AI工具,提示通用模型可能更具泛化能力和准确性。
相关度:高。直接挑战了“专用临床AI工具优于通用模型”的普遍假设,为模型选型与临床部署提供关键证据。
一句话:通用大语言模型在医学基准测试中超越专用临床AI工具,提示通用模型在临床场景中的潜力被低估。
Large Language Model Performance and Clinical Reasoning Tasks.
领域:医学人工智能 / 临床推理
方法:横断面研究,选取21个前沿大型语言模型(LLMs),在29个标准化临床病例上测试其诊断推理表现。
核心发现:在未经微调的LLMs中,Grok 4及其他经过推理优化的模型在临床诊断任务上显示出相对较高的可靠性,但整体上所有模型在临床工作流的全环节中仍存在明显局限,尤其是在复杂推理和一致性方面。
相关度:高。该研究直接评估了当前主流LLMs在临床推理任务中的实际表现,为理解LLMs的临床适用性、局限性以及未来优化方向提供了重要实证依据。
一句话:这项研究通过对21个LLMs在29个标准化临床病例上的测试,揭示了当前前沿模型(如Grok 4)在临床诊断推理中虽有潜力,但仍无法可靠应用于完整临床工作流。
AI-assisted literature screening: A hybrid approach using large language models and retrieval-augmented generation.
领域:医学信息学 / 系统文献综述自动化
方法:提出一种混合框架,结合规则预处理、检索增强生成(RAG)提示与大型语言模型(LLM)分类策略。在6331篇生物医学文献数据集上评估DeepSeek-V3、DeepSeek-R1和GPT-4o三种模型,采用二元分类提示、RAG提示和基于理由的提示三种策略,优先考虑召回率,并测试了集成方法。
核心发现:结合规则预处理与DeepSeek-R1的RAG提示(rule+DeepSeek-reasoner@Prompt II)在个体模型中表现最佳(精确率0.34,召回率0.77,NPV 1.00,G均值0.87);集成方法在主用例中精确率达1.00,但其他指标未超越该混合方法。在10个额外主题的泛化测试中,DeepSeek-R1取得最高F1分数(0.93)和准确率(0.88)。
相关度:高——该方法能显著加速系统综述的文献筛选流程,尤其适用于需要高召回率的场景(如临床证据整合),且可推广至多种医学主题。
一句话:本研究提出了一种结合规则预处理、大语言模型与检索增强生成的混合文献筛选方法,在保证高召回率的同时提升了筛选效率,其中DeepSeek-R1+RAG策略表现最优。
Current concerns and future directions of large language model ChatGPT in medicine: a machine-learning-driven global-scale bibliometric analysis.
领域:医学与人工智能(大语言模型ChatGPT在医学中的应用)
方法:基于机器学习的全球文献计量分析,包括回顾性分析ChatGPT在不同医学学科和地理区域的关注度与发展模式,采用无监督层次聚类算法和Walktrap算法揭示当前关注热点与未来方向。
核心发现:ChatGPT在医学领域发展良好(月增长率26.97%,国际合作率25.09%),但学科与地区分布不均衡:内科学发展最佳,而外科学、医疗保健、医学信息学、放射学、公共卫生和肿瘤学仍需加强;聚类分析表明,“ChatGPT在肿瘤患者管理与决策中的应用”为新兴研究集群,“健康信息推荐的准确性与安全性”影响力最大;伦理问题虽发展成熟(相关度82.1%,发展度92.9%)但仍存争议,而医学教育(相关度100%,发展度32.1%)和临床决策支持(相关度89.3%,发展度35.7%)高度相关但发展不足,具有显著研究潜力;此外,欠发达和资源匮乏地区关注度极低,可能加剧全球健康不平等。
相关度:极高。该研究系统描绘了ChatGPT在医学领域的全球格局、关键热点与短板,为研究者提供了明确的优先方向(如医学教育、临床决策支持)和政策建议,同时揭示了资源不均带来的挑战。
一句话:该机器学习驱动的全球文献计量分析揭示了ChatGPT在医学中的发展现状、学科/区域差异、研究热点(如肿瘤管理与健康信息推荐)及未来方向(如医学教育与临床决策支持),并警示了欠发达地区关注不足可能加剧健康不平等。
Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study.
领域:辅助生殖技术(ART)中的临床推理与可解释医学人工智能
方法:盲法比较评估研究。在临床试验中心,由资深生殖医学专家对三种提示策略(零样本、随机少样本、选择性少样本)生成的大语言模型思维链(CoT)进行打分,并比较专家评分与GPT-4o模型自动评估的结果。
核心发现:选择性少样本策略(基于“金标准深度”与“代表性多样性”双重原则)在逻辑清晰度、关键信息使用和临床准确性上显著优于其他策略(P<.001);随机少样本策略与零样本基线无显著差异,表明低质量示例无效;AI评估者(GPT-4o)无法识别这些关键差异,凸显人类专家在评估生成临床数据中的不可替代性。
相关度:极高——直接回答了LLM生成临床思维链的可靠性问题,揭示了提示设计策略的关键性,并指出了当前AI自动评估的局限性,对构建可信、可解释的医学AI系统具有重要指导价值。
一句话:在辅助生殖技术中,采用“选择性少样本”(基于高质量、多样化示例)提示策略能显著提升LLM生成临床思维链的可靠性,而随机低质量示例或零样本策略效果不佳,且现有AI评估无法捕捉这种差异。
Current concerns and future directions of large language model ChatGPT in medicine: a machine-learning-driven global-scale bibliometric analysis.
领域:医学人工智能(大型语言模型ChatGPT在医学中的应用)
方法:基于机器学习的全球规模文献计量分析,包括增长率计算、逻辑回归(评估各学科发展程度)、无监督层次聚类(识别关注主题)、Walktrap算法(分析主题相关性与发展成熟度)以及地理区域分析。
核心发现:ChatGPT在医学领域发展迅速(月增长率26.97%),国际合作活跃(25.09%)。内科学最为成熟,而外科学、医疗保健、医学信息学、放射学、公共卫生和肿瘤学仍需进一步发展。全球关注点分为六大聚类,其中“ChatGPT在肿瘤患者管理与决策中的应用”为新兴研究热点,“ChatGPT在健康信息推荐中的准确性与安全性”影响力最大。伦理问题虽发展较成熟(DP=92.9%)但仍存争议;医学教育(RP=100%, DP=32.1%)和临床决策支持(RP=89.3%, DP=35.7%)高度相关但发展不足,研究前景广阔。此外,欠发达地区关注与应用极少,可能加剧全球健康不平等。
相关度:极高。该研究系统揭示了ChatGPT在医学各学科和地区的发展现状、热点与空白,为研究者明确优先方向(如医学教育、临床决策支持)及政策制定提供了数据驱动的参考。
一句话:基于机器学习的全球文献计量分析表明,ChatGPT在医学领域发展迅速但学科与地区差异显著,医学教育和临床决策支持是未来重点方向,且需警惕其加剧全球健康不平等的风险。
Human-large language model collaboration in clinical medicine: a systematic review and meta-analysis.
领域:临床医学、数字医学、人工智能
方法:系统综述与荟萃分析。遵循PRISMA 2020指南,在PROSPERO注册(CRD420251068272)。检索了四个数据库,截止至2025年6月28日。纳入10项同行评审研究,另3项预印本仅用于敏感性分析。比较了人类与大型语言模型协作(H+AI)与仅人类(H)工作流程在临床推理、文档记录和解释任务中的表现。
核心发现:1. **诊断/解释准确性**(k=2):H+AI组显示出积极趋势(风险比[RR] 1.59),但统计上不精确且不显著(95% CI 0.08至32.74),95%预测区间(PI)跨越了无效线。
2. **综合诊断/管理评分**(k=2):H+AI组有统计学显著改善(平均差[MD] +4.88个百分点,95% CI +0.65至+9.12),但PI(–31.65至41.42)表明现实世界中的高度不确定性。
3. **时间效率**(k=3):两组间无总体差异(MD +0.4分钟,95% CI −4.18至+4.97;I² = 70.1%)。
4. **文档质量**:有所改善,但事实错误率仍然很高(约26-36%),削弱了质量提升。
5. **三臂设置**:H+AI并未普遍优于仅AI。
**结论**:证据仍属初步,高度不确定且依赖具体情境。建议开展预注册、实用性的多中心试验,嵌入真实工作流程,并采用协调一致的核心结局指标,优先考虑安全性和错误指标,以及能够揭示不确定性并支持验证的界面。
相关度:高。该研究直接评估了当前最受关注的LLM在临床协作中的实际效果,揭示了其潜在益处(如诊断评分提升)与重大局限性(如高错误率、时间效率无改善、结果高度不确定),为未来研究设计和临床部署提供了关键警示和方向性建议。
一句话:这项系统综述表明,人类与LLM协作在临床医学中的初步证据高度不确定且依赖情境,虽在部分诊断评分上显示改善,但错误率高且时间效率无提升,提示需进行更严谨的实用化试验。
AI-assisted literature screening: A hybrid approach using large language models and retrieval-augmented generation.
领域:医学信息学 / 系统综述方法学
方法:本研究提出了一种结合大语言模型(LLMs)与检索增强生成(RAG)的混合文献筛选框架。研究基于6,331篇生物医学文献(主题为“LLMs在基于电子健康记录的患者护理中的应用”),评估了三种模型(DeepSeek-V3、DeepSeek-R1、GPT-4o)在三种提示策略(二元分类提示、RAG提示、基于理由的提示)下的表现。方法包括基于规则的预处理、RAG提示工程以及集成策略,并以召回率(灵敏度)为首要优化指标。
核心发现:混合方法(规则预处理 + DeepSeek-R1 + RAG提示)在单个模型中表现最佳,精确率0.34,召回率0.77,阴性预测值1.00,G-均值0.87。集成方法在主要用例中精确率达到1.00,但其他指标未超越该混合方法。在泛化性测试(涵盖“癌症免疫治疗与靶向治疗”及“医学中的LLMs”等10个额外主题)中,DeepSeek-R1取得了最高的F1分数(0.93)和准确率(0.88),而集成方法未显示显著提升。
相关度:高。该研究直接针对系统综述中文献筛选这一耗时瓶颈,提出了一种可复现的自动化方案,对加速医学证据综合、减少人工负担具有直接应用价值。
一句话:本研究通过结合规则预处理、DeepSeek-R1模型与检索增强生成提示,构建了一种高召回率的混合文献筛选方法,在特定主题下召回率达0.77,并在泛化测试中保持优异性能。
Performance of a large language model on the reasoning tasks of a physician.
领域:医学人工智能 / 临床决策支持
方法:通过五项实验,以数百名医生为基线,评估大型语言模型(LLM)在复杂临床诊断推理案例中的表现;随后在一家大型三级学术医疗中心的急诊科开展真实世界研究,比较人类专家与AI提供的第二诊疗意见。
核心发现:在所有实验中,LLM的表现均优于医生基线,且相较于前几代AI临床决策支持系统显示出持续改进。LLM已超越大多数临床推理基准。
相关度:极高。该研究直接对比了LLM与医生在临床推理任务上的表现,并提供了真实世界急诊场景下的验证,提示LLM可能已具备超越传统基准的临床推理能力,为后续前瞻性临床试验提供了紧迫依据。
一句话:该研究通过医生评估和真实世界急诊研究证实,大型语言模型在临床诊断推理任务上已超越医生基线表现,提示其临床决策支持能力显著提升。
Large Language Model Performance and Clinical Reasoning Tasks.
领域:临床诊断推理、大型语言模型(LLM)评估
方法:横断面研究。研究评估了21个前沿大型语言模型(LLMs)在29个标准化临床病例(来自MSD手册)上的表现。模型被测试了临床工作流程中的多个任务,包括诊断推理、鉴别诊断生成和最终诊断准确性。研究比较了不同模型(包括推理优化模型如Grok 4)的性能。
核心发现:尽管部分前沿模型(如Grok 4)在特定任务上表现出色,但整体上,现成的LLMs在临床诊断推理任务中未能展现出一致且可靠的性能。模型在不同病例和任务类型间的表现存在显著差异,表明当前LLMs在临床工作流程中的稳定应用仍面临挑战。
相关度:高。该研究直接评估了当前最先进LLMs在核心临床任务(诊断推理)中的实际能力与局限性,为医学AI研究者提供了关于模型选择、任务适配性以及当前技术瓶颈的关键实证数据。
一句话:该研究发现,尽管部分前沿LLM(如Grok 4)表现突出,但现成的LLMs在标准化临床诊断推理任务中整体性能仍不稳定,尚不足以可靠地支持完整的临床工作流程。
A context-augmented large language model for accurate precision oncology medicine recommendations.
领域:精准肿瘤学、大语言模型(LLM)、检索增强生成(RAG)
方法:开发了基于RAG的LLM工作流,使用分子肿瘤学年鉴(MOAlmanac)作为知识库,并与仅用LLM的方法对比,评估其在生物标志物驱动的治疗推荐上的准确性;测试了合成查询和真实临床查询,并探索了多种提示与检索策略。
核心发现:RAG-LLM在合成查询上准确率达95%,在真实世界查询上准确率达93%,显著优于LLM-only方法;结合外部知识库可弥补LLM过时和领域知识不足的问题。
相关度:高。展示了RAG-LLM在临床治疗决策支持中的可行性和优越性,为构建可更新的医学知识增强AI系统提供了实证,方法可推广至其他专科。
一句话:结合MOAlmanac的RAG-LLM能高准确率提供精准肿瘤治疗推荐,优于仅用LLM的方法。
Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study.
领域:辅助生殖技术、医学人工智能、大语言模型可解释性
方法:盲法比较研究;由资深临床医生评价三种提示策略(零样本、随机少样本、选择性少样本)生成的临床推理链(CoT),并与GPT-4o自动评价对比
核心发现:选择性少样本策略在逻辑清晰度、关键信息利用和临床准确性上显著优于其他策略(P<.001);随机少样本策略相比零样本无显著改进;GPT-4o无法识别这些关键性能差异
相关度:高——提示设计决定LLM生成临床推理的可靠性,且AI自动评价不能替代临床专家评价,对可扩展生成高质量医学CoT有直接指导意义
一句话:在辅助生殖中,用“高质量+多样性”示例的选择性少样本提示能显著提升LLM临床推理可靠性,而随机示例无效,且AI评价器无法察觉差异。
Human-large language model collaboration in clinical medicine: a systematic review and meta-analysis.
领域:临床医学、人工智能(大型语言模型)、人机协作
方法:遵循PRISMA 2020指南,PROSPERO注册(CRD420251068272),系统检索4个数据库至2025年6月28日,纳入10篇同行评议研究及3篇预印本(仅用于敏感性分析),对诊断准确性、复合评分、时间效率等结局进行Meta分析。
核心发现:- 诊断/解释准确性(k=2):H+AI较H有正向趋势(RR 1.59),但统计不精确(95% CI 0.08–32.74),95%预测区间跨越无效线。
- 复合诊断/管理评分(k=2):H+AI显著改善(MD +4.88个百分点,95% CI 0.65–9.12),但预测区间极宽(–31.65至41.42),提示真实世界高度不确定性。
- 时间效率(k=3):无显著差异(MD +0.4分钟,95% CI –4.18至4.97),异质性较高(I²=70.1%)。
- 文档质量改善,但事实错误率仍高达26%~36%,削弱质量收益。
- 在三臂设计中,H+AI并不普遍优于AI单独模式。
相关度:极高。该综述直接回应当前临床AI部署的核心争议——人机协作是否优于人类单独工作,提供了当前最严谨的证据整合,并明确指出证据的初步性、高度不确定性和情境依赖性,为后续研究方向(如多中心前瞻性试验、安全性/错误率核心结局)提供了明确指导。
一句话:该系统综述与Meta分析表明,大型语言模型辅助临床工作相比纯人类工作在某些任务上可能改善评分,但证据不足、不确定性大,且协作并非总是优于AI单独使用。
Human-AI co-design for clinical prediction models.
2026-07-26 ·
摘要:Developing safe, effective, and practically useful clinical prediction models (CPMs) traditionally requires extensive collaboration between clinical experts, data scientists, and informaticists to refine the many small but critical details of the model building process. When incorporating unstructured clinical notes, this challenge magnifies, as notes essentially contain an infinite number of concepts that can be used for modeling. We introduce HACHI, an iterative human-in-the-loop framework that uses AI agents to accelerate the development of fully interpretable CPMs from clinical notes, where CPMs are defined as linear models of yes-no questions. HACHI alternates between an AI agent that uses statistical tools and embedded knowledge to explore candidate concepts and domain experts who provide feedback to the AI agent. The framework optimizes for transparency, steerability, and reciproc
📄 论文动态
本周22篇论文涵盖AI在心血管疾病预测模型复用、儿童肥胖干预、肿瘤分子板解读、医学伦理、精神科培训、癌症对话系统、cfDNA语言模型等,以及传染病免疫调节、HIV治疗、抗生素使用、医院感染控制等临床研究。AI相关论文聚焦大语言模型(LLM)在医学中的应用,包括生成通俗报告、测试时扩展策略、伦理判断、模拟咨询等,显示LLM在临床辅助、教育、患者沟通中的潜力。
### 🏭 行业动态
28条行业新闻主要围绕FDA对AI/ML医疗器械的监管和批准现状,强调AI在放射学领域的领先应用,以及AI在医疗保健中的未来趋势,如共临床医生模式、Google DeepMind等。新闻显示FDA已批准超1000个临床AI应用,监管框架逐步完善,行业对AI赋能医疗充满期待。
### 📊 高频期刊 TOP10
| 期刊 | IF | 篇数 |
|:---|---:|---:|
| Clin Infect Dis | 8.2 | 4 |
| J Med Internet Res | 5.8 | 4 |
| Cell Rep Med | 45.5 | 3 |
| JMIR Med Educ | 5.8 | 2 |
| NPJ Digit Med | 12.4 | 2 |
| Eur J Cancer | 7.6 | 1 |
| JMIR Pediatr Parent | 5.8 | 1 |
| Gastroenterology | 25.7 | 1 |
| JMIR Cancer | 5.8 | 1 |
| Cell Genom | 45.5 | 1 |
## 二、研究主题聚类
### LLM在医学中的应用(8篇)
本期未做逐篇深度分析,当前为 PubMed 元数据;可后台补跑 DeepSeek 逐篇分析后自动补全。
AI and Chatbot-Supported Interventions for Physical Activity and Obesity-Related Lifestyle Behaviors: Scoping Review With Attention to Family Involvement.
领域:儿科身体活动、肥胖相关生活方式行为的AI与聊天机器人干预,重点关注家庭参与。
方法:基于PRISMA-ScR指南进行范围综述,检索7个数据库(截至2026年2月),双人独立完成标题/摘要及全文筛选,最终纳入14项研究,并进行叙述性综合。
核心发现:该领域快速兴起,85.7%的研究发表于2023年及以后,覆盖10个国家;64.3%通过移动App交付;AI技术涵盖规则型聊天机器人、混合个性化系统、生成式AI等。71.4%的研究包含父母/照护者或家庭组件;常见功能为个性化反馈(71.4%)、自我监控(64.3%)和教育(64.3%)。身体活动是最常见目标行为;在8项报告直接身体活动或体能结局的研究中,4项显示显著改善,2项无显著变化,2项为混合或间接发现。可行性、可接受性、可用性和参与度总体良好,但仅有1项研究报告了文化定制。
一句话:AI与聊天机器人支持的儿童身体活动和肥胖相关生活方式干预属于快速兴起但仍早期发展的领域,初步证据显示效果不一,且家庭参与需要更明确的定义与评估。
Immunomodulation in the Treatment of Disseminated Coccidioidomycosis.
领域:感染病学 / 真菌病学 / 免疫调节治疗
方法:回顾性病例系列研究,纳入18例接受最大剂量抗真菌治疗仍存在重症或持续性球孢子菌病患者,根据临床背景及细胞内细胞因子染色(检测产生干扰素γ或IL-4的T辅助细胞)选择免疫调节治疗:重症患者接受重组干扰素γ,存在2型免疫失调者接受度普利尤单抗(dupilumab),并评估临床转归及T细胞应答变化。
核心发现:接受度普利尤单抗的患者2型T细胞应答降低;18例患者中16例存活(88%),多数患者临床结局较基线改善。
一句话:该病例系列提示,在抗真菌治疗基础上联用免疫调节治疗(干扰素γ或度普利尤单抗)可能改善重症/播散性球孢子菌病患者预后。
A 48-Week, Randomized Controlled Trial of Doravirine for Individuals With HIV and Obesity on Integrase Inhibitors and Tenofovir Alafenamide: The Do IT Study (ACTG A5391).
领域:HIV感染与肥胖,抗逆转录病毒治疗方案的随机对照试验
方法:48周、三平行组、开放标签、多中心随机对照试验(NCT04636437),纳入BMI≥30且正在接受INSTI(BIC/DTG/RAL)联合TAF/FTC≥48周、病毒学抑制的HIV感染者,随机切换至DOR+TAF/FTC、DOR+TDF/FTC或继续原INSTI+TAF/FTC。主要终点为48周体重变化百分比,采用线性回归调整性别、种族和入组体重;次要结局包括血脂、胰岛素抵抗、脂肪量和骨密度。
核心发现:共147人随机化,145人开始治疗。入组时中位年龄49岁,BMI 34.9 kg/m²,INSTI+TAF/FTC使用时间3.4年,49%为女性,53%为黑人。48周后,DOR+TAF/FTC组体重平均变化为−0.47%(95%CI:−2.09,1.14),DOR+TDF/FTC组为−2.73%(95%CI:−4.22,−1.23),继续INSTI+TAF/FTC组为−1.84%(95%CI:−3.37,−0.30)。DOR+TAF/FTC与INSTI+TAF/FTC的差异为1.36个百分点(97.5%CI:−1.20,3.92),DOR+TDF/FTC与INSTI+TAF/FTC的差异为−0.89个百分点(97.5%CI:−3.34,1.57),均无统计学显著临床差异。未发现性别或种族间的效应异质性,也未观察到治疗对血脂、胰岛素抵抗、脂肪量或骨密度的显著影响。结论:在HIV合并肥胖患者中,从INSTI+TAF/FTC切换至DOR/FTC(联合TAF或TDF)未产生临床有意义的体重变化或代谢健康改善。
一句话:在HIV合并肥胖患者中,从INSTI+TAF/FTC切换至多拉韦林(联合TAF或TDF)不能显著减轻体重或改善代谢指标。
LLM-Generated Lay-Language Protocols for Molecular Tumor Board Patients: Evaluation of Quality and Clinical Usability.
领域:分子肿瘤委员会(MTB)患者沟通、大语言模型(LLM)医学应用、肿瘤学/医患共情
方法:研究在临床或接近临床的场景下,使用LLM将MTB高度技术性的推荐协议改写成面向患者的通俗语言(lay-language)版本,并评估其质量与临床可用性。基于作者团队包含肿瘤科医生和患者顾问委员会成员,评估可能涉及医生及患者参与的结构化评分、准确性/可读性核查,以及面向临床部署可行性的分析。
核心发现:从标题和可见背景推断,LLM生成的通俗语言协议在质量上可能达到可接受的临床沟通辅助水平,并具备提升患者对MTB建议理解度的潜力;但临床可用性在准确性、责任归属、个体化和部署约束下仍需人机协作或人工审核。具体评分数据与统计结果未在可见摘要中显示。
一句话:本研究探索用LLM将分子肿瘤委员会专业建议转化为患者通俗语言,并评估其质量与临床可用性。