全部论文(27 篇)
GPSM1 restricts CD73(+)CD103(+) T(reg) cells in adipose tissue, critical for promoting obesity-related metabolic deterioration.
领域:免疫代谢学 / 肥胖与2型糖尿病 / 调节性T细胞(Treg)生物学
方法:- 人类外周血及内脏脂肪CD4+ T细胞中GPSM1表达与肥胖、血糖紊乱的相关性分析
- 构建CD4+ T细胞或Treg细胞特异性GPSM1敲除小鼠及CD4+ T细胞特异性过表达小鼠,结合高脂饮食喂养
- 单核RNA测序(snRNA-seq)鉴定脂肪组织Treg亚群变化
- 过继转移GPSM1缺陷Treg至Rag1−/−小鼠,检测能量消耗及糖脂代谢
- 机制研究涉及RHOA-细胞刚度-TAZ信号轴
核心发现:- 人类肥胖和糖代谢紊乱时,外周血及内脏脂肪CD4+ T细胞中GPSM1表达上调
- Treg特异性敲除GPSM1增加脂肪组织Treg数量,抑制炎症,改善高脂饮食诱导的胰岛素抵抗和葡萄糖耐量
- 保护性代谢效应依赖于维持CD73+CD103+ Treg亚群
- CD4+ T细胞过表达GPSM1则减少Treg数量,加重脂肪组织功能障碍和代谢恶化
- 机制上,GPSM1通过RHOA-细胞刚度-TAZ轴限制Treg扩增
- 过继转移GPSM1缺陷Treg可促进能量消耗、改善Rag1−/−小鼠糖脂代谢
相关度:高。该研究揭示了GPSM1作为Treg代谢调控关键分子的机制,为肥胖相关代谢紊乱提供了新的免疫治疗靶点;其单核RNA-seq数据和基因表达特征可用于构建代谢疾病预后或治疗反应预测模型,也可作为AI挖掘免疫-代谢互作网络的生物学锚点。
一句话:GPSM1通过RHOA-细胞刚度-TAZ轴限制脂肪组织CD73+CD103+ Treg亚群,从而加剧肥胖相关代谢紊乱,靶向GPSM1或该Treg亚群有望改善代谢健康。
Large Language Models in Colorectal Cancer Care and Clinical Decision Support: Systematic Review.
领域:结直肠癌(CRC)全程照护与临床决策支持中的大语言模型(LLMs)应用
方法:遵循PRISMA指南的系统综述;检索6个数据库(PubMed、Embase、Web of Science、Scopus、CINAHL、Cochrane)至2026年4月1日;纳入37项同行评审原创研究(2023–2026);使用QUADAS-2、PROBAST和ROBINS-I评估偏倚风险;按SWiM指南进行叙述性综合。
核心发现:LLMs在CRC全程照护中展现出广泛潜力,包括临床文本数据自动提取、患者教育、诊断辅助、临床决策支持及新兴的多模态视觉解读能力;GPT系列最常被评估,领域专用和多模态模型在特定任务上优于通用模型;提示设计与微调显著影响性能。但整体证据质量较低:仅27.0%研究为低偏倚风险,16.2%为高/严重偏倚风险;存在结局测量、干预分类、患者选择及非盲法评估等问题;跨任务、模型、提示、参考标准和结局的异质性极大,报告的优势难以泛化;数据隐私和泛化性仍是挑战。
相关度:高——首次系统地比较通用、领域专用和多模态LLMs在CRC全流程中的应用,明确提示工程与异质性指标对结局的影响,为后续研究和临床转化提供了重要基线和方法学警示。
一句话:本综述表明LLMs在结直肠癌全程照护中具有广阔前景,但当前证据质量低、异质性高、偏倚风险普遍,需通过前瞻性多中心验证、隐私保护和人工监督来推进临床落地。
Clinical utility of large language models in metastatic prostate cancer: A multicenter expert validation for decision support.
领域:肿瘤学 / 人工智能辅助决策(大语言模型在转移性前列腺癌初始治疗决策中的应用)
方法:多中心回顾性评估(3个三级中心,2018–2025年,238例连续mPCa病例);测试5种当代大语言模型,使用锁定、零样本提示协议生成临床摘要、一线全身治疗建议及理由;两阶段评估:多学科团队(MDT)进行二元安全性判定(“一票否决”门控,预设关键错误分类),安全通过的输出再由3位资深肿瘤内科医生独立评分(5点Likert量表,评估摘要准确性、指南一致性与个体化程度、理由质量);使用Friedman检验、Holm校正post hoc比较、Cochran's Q和McNemar检验分析配对有序及二元安全性结局。
核心发现:安全性通过率79.0%–84.9%;安全通过的输出在5点Likert量表上平均效用评分处于4分低至中段(即良好)。模型间差异在摘要生成上最显著,治疗建议和理由的差异经多重性校正后较小。失败集中在记录不完整的困难病例,主要错误类型为缺失信息提取错误、疾病状态/通路错误、指南逻辑偏离以及安全检查遗漏。
相关度:高——针对高风险临床决策场景下的LLM安全性进行多中心专家验证,采用严格“一票否决”安全门控,量化了当前LLM在真实肿瘤数据上的失败率和错误类型,为LLM在临床落地前的安全评估提供了可复用的框架和基准。
一句话:当前大语言模型可作为转移性前列腺癌初始治疗决策的起草助手,但在严格安全门控下仍有约15%–21%的输出存在安全风险,不能无监督使用。
CRITIC-RAG: Knowledge-Augmented Large Language Models With Verified Retrieval for Improved Medical Reasoning.
领域:医学问答(Medical QA),知识密集型自然语言处理,大语言模型增强与可信推理。
方法:提出 CRITIC-RAG,一个基于验证增强的检索增强生成框架。在 RAG 流程中集成小型指令微调验证器,包含选择性检索、证据过滤、基于自一致性的结构化推理,以及接地性验证(groundedness verification),旨在减少虚假生成并提高外部知识的准确利用。
核心发现:在五个医学QA基准和多个LLM骨干上,CRITIC-RAG 展现出广泛的适用性和即插即用性。例如,在 MedQA 上准确率从 41.3% 提升至 48.8%;在 MedicationQA 上使用 LLaMA-3 时 BERTScore 从 68.1% 提升至 74.4%。消融实验表明证据过滤与结构化推理对稳健性能尤为关键。案例与检索分析显示各阶段验证共同提升生成回答的准确性和证据 groundedness。
相关度:高。该方法直接针对医学QA中的事实一致性与推理可靠性问题,对构建可信临床决策支持系统具有重要意义,且作为即插即用模块易于集成到现有LLM/RAG管道中。
一句话:CRITIC-RAG 通过在检索增强生成全流程中嵌入小型验证器,显著提升了医学问答的准确性与证据 groundedness,可作为增强医学大模型可信度的有效方案。
Integrating liquid biopsies and artificial intelligence for early cancer detection: A systematic review and meta-analysis.
领域:早期癌症检测(液体活检与人工智能结合)
方法:系统综述与荟萃分析;检索Medline、Embase、Cochrane、Web of Science(2025年7月);纳入将机器学习(ML)与循环游离DNA(cfDNA)特征(基因组、甲基化、片段组学)结合,区分I-III期癌症患者与非癌对照的研究;计算汇总诊断性能指标及95%置信区间。
核心发现:共纳入109篇文章,涵盖多种癌症类型;所有肿瘤类型和分期的特异性均高(94%-99%)。I-III期敏感度为72%-92%,I期为44%-91%,II期为71%-98%,III期为83%-99%。在汇总人群中,神经网络(90%)、随机森林(86%)和异构集成学习(85%)敏感度最高;按特征分层分析显示,片段组学特征敏感度最高(86%),甲基化为81%,特异性均为92%-96%。
相关度:高度相关——系统评估了ML算法与cfDNA多组学特征在早期癌症检测中的诊断性能,明确了最佳模型类型和最具潜力的生物标志物特征,为医学AI诊断模型的设计与优化提供直接证据。
一句话:机器学习结合cfDNA分析在早期癌症检测中具有良好潜力,其中神经网络、随机森林和集成学习表现最佳,片段组学特征提供最高敏感度。
Large Language Models and Their Applications in Mental Health: Scoping Review.
领域:精神病学/心理健康,大语言模型(LLM)临床应用
方法:范围综述(Scoping Review)。系统检索PubMed、Scopus和Web of Science(2023年1月至2025年10月),筛选3121篇论文,最终纳入41篇。2名研究者独立筛选,第3名解决分歧,提取模型、用例、数据集和适应方法等信息。
核心发现:GPT-4(24项,58.5%)和GPT-3.5(16项,39%)是最常评估的模型;诊断是最常见用例(31项,75.6%),抑郁症是最常见目标疾病(11项,26.8%)。所有研究最初均使用现成LLM,部分通过少样本学习或微调进行适应。仅少数研究(13项,31.7%)使用真实患者数据与临床医生评估进行验证,多数依赖临床案例、考试题或社交媒体帖子等代理结果。
相关度:高——系统梳理了LLM在心理健康领域的应用现状,揭示了验证不足和缺乏标准化等关键短板,为后续研究设计、模型评估和临床转化提供重要参考。
一句话:LLM在心理健康领域应用增长迅速,但大多数研究仍停留在探索阶段,只有少数使用真实临床数据验证,亟需标准化评估和临床对齐。
Disrupted molecular glue complex drives RAS inhibitor resistance.
领域:肿瘤学 / 靶向治疗 / RAS突变癌症耐药机制
方法:配对分析40例患者基线及治疗结束样本;结构生物学与功能实验;获得性突变鉴定及耐药机制解析;筛选新一代三复合抑制剂(TCI)及联合疗法。
核心发现:识别出18例RAS抑制剂daraxonrasib耐药相关复发性变异;耐药机制包括破坏药物结合界面的RAS Y64突变,以及增强RAS-RAF相互作用(RAS Y71或激酶死亡/低活性BRAF突变);开发出靶向RAS Y64突变体的TCI,并提出针对BRAF激酶死亡驱动的耐药联合治疗方案。
相关度:高——提供真实临床样本的耐药基因组图谱与机制解析,为AI驱动的耐药预测、药物组合策略及新一代分子胶设计提供关键数据集和生物学特征。
一句话:揭示RAS抑制剂耐药通过破坏分子胶复合物或增强RAS-RAF信号汇合,并提出针对性治疗策略。
CT Radiomics-based Machine Learning to Identify Intratumoral Fibrosis and Underlying Angiogenesis in Hepatocellular Carcinoma.
领域:肝癌影像组学、肿瘤微环境、介入治疗预后
方法:多中心回顾性+前瞻性研究,基于CT影像组学构建Rad-ITF评分模型,以组织病理(Sirius red、H&E染色)为金标准,训练/验证队列共1675例;另设TACE预后队列(n=427)及TCGA/基因组队列(n=39/12),结合RNA测序、单细胞RNA测序和空间转录组学评估血管生成。
核心发现:Rad-ITF评分对瘤内纤维化分级具有良好判别效能(AUC 0.82–0.86);高Rad-ITF评分患者TACE后肿瘤反应率更低、无进展生存期更短;高评分与血管生成相关。
相关度:★★★★★ 展示影像组学模型可无创预测组织病理特征并关联分子机制与治疗结局,具有较强的转化价值。
一句话:基于CT影像组学的Rad-ITF评分可有效识别肝癌瘤内纤维化程度及其相关血管生成状态,并预测TACE患者预后。
Linear RAG scanning mediates editing of Igκ variable region repertoires.
领域:免疫学 / V(D)J重组 / 染色体结构 / B细胞受体编辑
方法:基于小鼠前B细胞和iPS细胞模型,结合高 throughput 重组测序实验、RAG扫描分析、以及遗传学/细胞学方法研究Igκ位点次级重组的机制;文中包含对CTCF结合位点(Cer/Sis)删除或位移的调控功能分析,并整合了单环线性扫描模型与双环扩散模型的比较框架。
核心发现:该研究揭示Igκ轻链可变区次级V(D)J重组的分子机制:初级Vκ-Jκ1重组(缺失性或倒位性)会导致Cer/Sis CTCF结合元件被删除或移位,从而形成前B细胞群体中分布于Vκ基因座各处的次级RC(以已重排的VκJκ1为基础)。RAG从这些次级RC出发进行线性扫描,在基因座范围内依次捕获上游未重排的Vκ基因片段,并以缺失方向为主的Jκ2-5次级RC完成重组。强Vκ-RSS限制次级重组优先发生在RC紧邻上游的Vκ,同时支持较低水平的倒位性扫描重组。该工作提出Cer/Sis的缺失/位移是一个发育开关,将基于双环扩散的初级Igκ重组机制转换为基于单环线性扫描的次级重组机制,从而扩大Igκ库并介导中枢耐受中的受体编辑。
相关度:中高。该研究提供了V(D)J重组中RAG线性扫描的清晰机制模型,有助于理解B细胞受体库生成的顺序性和编辑规则;对于开发预测免疫组库重组/编辑模式的AI模型、分析scRNA-seq或VDJ-seq数据中的受体编辑事件、以及设计合成免疫受体库均有参考价值。但本文不直接涉及医疗AI应用或临床数据。
一句话:该论文阐明Igκ次级重组的生理机制——起始重排删除/移位Cer/Sis元件,使RAG从次级重组中心进行线性扫描,完成上游Vκ到Jκ2-5的受体编辑,从而将初级扩散机制切换为线性扫描机制。
Anticancer activity of RAS-GTP inhibition in cholangiocarcinoma.
领域:胆管癌(CCA)的靶向治疗,KRAS突变肿瘤的RAS-GTP抑制
方法:临床前模型(细胞系、患者来源异种移植、免疫活性同种移植模型)及2例晚期KRAS G12 CCA患者的临床观察;联合标准治疗方案;耐药机制分析
核心发现:RAS(ON)多选择性抑制剂(靶向GTP结合态RAS)在KRAS突变CCA模型中产生强效抗肿瘤反应;daraxonrasib在2例晚期KRAS G12 CCA患者中显示临床活性;与标准治疗联用延长生存;耐药主要源于RAS信号过度激活机制
相关度:中等——提供RAS(ON)抑制剂在KRAS突变胆管癌中的临床前与初步临床证据,有助于靶向治疗耐药研究及精准医学AI模型开发
一句话:KRAS突变胆管癌依赖RAS信号驱动增殖,RAS-GTP抑制在临床前模型和初步患者中显示抗肿瘤活性并增敏标准治疗
Antibody-drug conjugates in precision oncology.
领域:精准肿瘤学 / 抗体药物偶联物(ADC)治疗
方法:综述性分析(基于现有文献与临床证据,梳理ADC疗效、耐药、毒性机制,并讨论生物标志物、联合治疗、下一代平台及治愈性策略)
核心发现:ADC在部分肿瘤类型中取得突破性疗效,但整体临床应用仍受限于患者选择不当、生物标志物检测标准化不足、化学设计挑战及现有临床前模型预测价值有限等问题。ADC活性不仅取决于靶抗原表达,还受肿瘤内在特征和肿瘤微环境相关过程影响,因此应被视为“肿瘤生态系统靶向治疗”,而非单纯靶向治疗。未来需将多维生物学决定因素纳入精准肿瘤学框架,以改善疗效预测和耐药管理。
相关度:高——该文强调多维生物标志物(包括肿瘤内在特征和微环境因素)对ADC疗效的决定作用,提示医学AI研究者可利用多组学、病理图像和临床数据构建整合预测模型,以优化ADC患者分层、疗效预测与联合治疗策略。
一句话:本文基于摘要指出,ADC应被重新理解为“肿瘤生态系统靶向疗法”,其疗效由多维度生物学因素决定,精准肿瘤学框架需整合新型生物标志物与组合策略来突破当前局限。
CETP Inhibitors: Back With a New Target.
领域:脂质代谢与心血管疾病预防
方法:综述/机制分析与早期临床开发证据整合
核心发现:CETP活性低与心血管病、糖尿病及神经退行性疾病风险降低相关;早期CETP抑制剂因脱靶毒性或临床无效而失败,但后续研究表明其获益来自降低致动脉粥样硬化脂蛋白及改善血糖控制,而非升高HDL-C;新型高选择性抑制剂Obicetrapib在致动脉粥样硬化脂质、血糖及阿尔茨海默病beta-淀粉样生物标志物方面显示有益作用。
相关度:高——涉及药物靶点再定位、多疾病生物标志物分析、临床结局预测,可用于开发CETP抑制剂相关的疗效预测模型或生物标志物发现。
一句话:CETP抑制剂的治疗潜力已从升高HDL转向降低致动脉粥样硬化脂质和改善代谢,Obicetrapib代表这一新方向。
EyeRAG: graph retrieval-augmented generation for safe and accurate clinical dialogue in ophthalmology.
领域:眼科临床对话,AI辅助患者沟通
方法:构建基于临床指南的领域知识图谱OphthaKG,开发GraphRAG系统EyeRAG;在120个临床场景(青光眼、糖尿病视网膜病变、白内障各40)、6种LLM、4种RAG配置下评估;采用LLM-as-a-judge和眼科委员会认证医生验证。
核心发现:EyeRAG优于Vanilla LLM和标准RAG;LLM评估排名最高(内部1.61±1.04,外部1.72±1.18),专家平均排名1.0;幻觉率降至3.3%(基线30%)。
相关度:高,展示基于指南的GraphRAG能显著减少幻觉、提高临床对话安全性与可解释性,为眼科及其他专科的AI辅助患者沟通提供了可复用的技术范式。
一句话:EyeRAG通过融合临床指南知识图谱的检索增强生成,将眼科对话幻觉率从30%降至3.3%,并荣获专家排名第一。
Clinical decision support in hematological malignancies using a case-grounded AI agent.
领域:血液恶性肿瘤临床决策支持
方法:开发并评估HemaGuide——一种可本地部署的模块化大语言模型智能体,将非结构化临床文档转换为结构化病例表示,自动分诊至指南、高级及分子三种决策模式,并基于指南流程图和>2,000例真实肿瘤委员会病例的临床决策记忆给出建议。采用专家盲法基准测试(45例高复杂度病例,6个基础模型)、系统性消融研究(11层)、自动化变异分类、模拟实践研究、外部验证(555例独立病例)和前瞻性静默试验(64例连续病例)进行评估。
核心发现:HemaGuide在各测试中均显著提高与肿瘤委员会决策的一致性;消融研究表明性能增益依赖分诊类型,无单一组件足够应对所有病例类型;70个临床相关错义变异分类与专家标准高度一致,未将致癌变异降级为良性;整体工作流在商品硬件上实时完成(中位延迟39秒)。模拟实践中,智能体辅助住院医师达到接近高年资医师的一致性水平。外部验证一致性为81.8%(47种疾病类型),前瞻性试验一致性为82.8%;幻觉发生率0.3%(664例中2例)。
相关度:高——展示了在血液肿瘤中部署可审计、本地化LLM智能体进行实时临床决策支持的可行性,并提供了多层次验证证据,对医学AI的临床转化研究具有参考价值。
一句话:本地可部署的病例接地LLM智能体HemaGuide可实时、跨机构地提升血液肿瘤决策支持一致性,且幻觉率极低。
CAR T targets: AI takes the wheel.
领域:CAR T细胞疗法靶点发现
方法:大型语言模型(LLM)辅助的靶点评分框架
核心发现:识别并验证了GPNMB作为黑色素瘤、白血病和结直肠癌的CAR T候选靶点
相关度:高,展示了LLM在肿瘤免疫治疗靶点筛选中的实际应用与验证
一句话:用LLM辅助打分,找到了新的CAR T靶点GPNMB。
Agentic memory-augmented retrieval and evidence grounding for medical question-answering tasks.
领域:医学人工智能 / 大语言模型医学问答 / 检索增强生成
方法:开发了一个基于大语言模型的开源智能体系统,集成了文档检索、重排序、证据锚定和诊断生成模块;采用轻量级RAG流水线进行证据检索与重排,并引入“缓存-剪枝”记忆库来支持超长上下文推理;系统可自主调用工具,无需人工提示工程或多阶段模板。与独立LLM在五个医学问答基准上比较。
核心发现:该系统在多选和开放式医学问答任务上优于或接近现有专有及开源模型。具体在USMLE Step 1准确率82.98%(GPT-4为80.67%)、Step 2为86.24%(GPT-4为81.67%),Step 3为88.52%(接近GPT-4的89.78%)。表明工具增强与证据锚定推理可提升医学AI系统的可靠性和可扩展性。
相关度:高:提供了一种无需复杂提示工程的智能体式医学问答框架,结合检索、记忆和证据锚定,对构建可解释、可验证的临床决策支持系统具有直接参考价值。
一句话:基于LLM的工具使用智能体通过检索增强和证据锚定,在USMLE等医学问答基准上超过或媲美GPT-4。
Large Language Model Chatbot Conversations vs Public Health Materials and Parental HPV Vaccination Intentions: A Randomized Clinical Trial.
领域:医学人工智能 / 大语言模型(LLM)与公共卫生疫苗沟通
方法:随机临床试验(RCT),在线招募美国、加拿大、英国家长共1297人(平均年龄42.84岁,72.1%女性)。纳入标准为至少1名未接种HPV疫苗或接种状态未知的适龄儿童(美加11-17岁,英国12-17岁)。干预分组:(1) 无信息对照组;(2) 国家公共卫生材料组(至少暴露3分钟);(3) LLM聊天机器人组(OpenAI GPT-4o,提示鼓励HPV疫苗接种,分为默认对话风格和更简短对话风格,交互3分钟)。主要结局为干预后立即测量的“12个月内为孩子接种HPV疫苗的可能性”(0-100分)。预设随访终点包括15天和45天的接种意愿及自报接种行为。
核心发现:与无干预相比,公共卫生材料(Cohen d=0.53; 95% CI, 0.36-0.70)、默认聊天机器人(d=0.48; 95% CI, 0.30-0.65)和会话式聊天机器人(d=0.33; 95% CI, 0.17-0.49)均能显著提高即时HPV疫苗接种意愿。但LLM聊天机器人未优于公共卫生材料;45天时,聊天机器人组的接种意愿不再显著高于对照组,而公共卫生材料仍保持小幅效果。任何干预均未提高自报的实际HPV疫苗接种率。
相关度:高。该研究提供了首个较大规模RCT证据,表明LLM聊天机器人在疫苗沟通中的短期说服效果与现有关键公共卫生材料相当或更弱,且效应不持久;对医疗AI聊天机器人的临床转化、效果评估和长期结局设计具有直接参考价值。
一句话:简短LLM聊天对话可短期提升父母HPV疫苗接种意愿,但效果不优于公共卫生材料,且45天后消失,未能转化为实际接种行为。
A renaissance in targeting the PI3K/AKT/mTOR pathway.
领域:肿瘤学、免疫学、遗传病;靶向PI3K/AKT/mTOR通路的药物研发
方法:Perspective(观点/综述性文章),基于既有研究总结挑战、经验教训及新药理学方法
核心发现:PI3K/AKT/mTOR通路是可成药且重要的药物靶点,已有药物获批;但开发曾受耐受性问题和耐药机制等阻碍;新的药理学策略和临床前/临床理解的进步正在重燃对该通路治疗性干预的兴趣
相关度:中等偏高——该通路涉及癌症、免疫调节和耐药机制,为AI辅助药物靶点分析、耐药预测、生物标志物挖掘及合理联合用药设计提供了重要的生物学背景与未满足需求
一句话:该观点文章系统总结了PI3K/AKT/mTOR通路靶向治疗的既往障碍与当前新策略,强调新方法正推动该领域复兴。
Agentic AI in rheumatology.
领域:风湿病学 / 临床人工智能 / 智能体系统
方法:观点性评论(Viewpoint),批判性评估风湿病学中智能体AI的现状、应用与风险,并提出分层治理框架
核心发现:智能体AI(agentic AI)能自主规划、调用工具并执行多步临床决策链,不同于传统对话式AI;风湿病学因病程长、数据多模态、治疗需反复调整,既适合自动化,也易受其失败影响——自主链中的错误会无声累积,验证需求远超既往决策支持工具,且最宜自动化的基础任务恰是培训临床专业能力的关键环节。
相关度:高 —— 提示临床AI正从被动聊天转向主动智能体范式,并强调自主决策链的验证、安全与教育影响,为AI在慢性病管理中的治理设计提供重要参考
一句话:智能体AI在风湿病学中潜力与风险并存,需通过分层治理框架确保有意义的人类监督。
Structural basis of fungal β-1,3-glucan synthase inhibition by caspofungin.
领域:结构生物学 / 抗真菌药物机制
方法:- 冷冻电镜(cryo-EM)解析天然酿酒酵母 Fks1(ScFks1)在不同去污剂(CHAPS/CHS、GDN、LMNG/CHS)下的活性态结构
- 酶活性测定(放射性标记的 Glc 掺入不溶性葡聚糖的速率)
- 剂量-反应曲线测定 CFN 的半数抑制浓度(IC50)
- 结构比对与突变体(S643P)结构分析
核心发现:- CFN 与新生葡聚糖和 Fks1 在膜-蛋白界面形成三元复合物,提示其通过阻滞聚合物转运而非单纯竞争底物来抑制 GS 活性
- 棘白菌素耐药突变 S643P 通过变构扰动和直接位阻双重机制破坏 CFN 与葡聚糖的结合
- Rho1 结合诱导活性位点重排(包括"latch loop"的构象变化),为供体底物协调所必需
- 鉴定 YMR295C 为 GS 的辅助亚基
- 不同去污剂条件下结构差异显著,证实界面区螺旋在催化相关构象中发挥关键作用
相关度:高。提供了真菌必需酶 Fks1 的活性态高分辨率结构及其与抑制剂、底物、调节亚基的互作机制,为 AI 辅助抗真菌药物设计、耐药突变效应预测、蛋白质-配体互作建模等提供了宝贵的结构模板和训练数据。
一句话:该研究通过冷冻电镜解析了天然酵母 β-1,3-葡聚糖合酶 Fks1 在催化活性相关状态下的结构,揭示了 Caspofungin 通过与新生葡聚糖形成三元复合物阻滞聚合物转运的独特抑制机制,并阐明了 S643P 耐药突变通过变构扰动与位阻效应双重破坏药物结合的分子机理,为下一代棘白菌素类抗真菌药物的理性设计奠定了结构基础。
Concurrent genetic and non-genetic resistance mechanisms to KRAS inhibition in colorectal cancer.
领域:结直肠癌(CRC)KRAS抑制剂耐药机制;肿瘤基因组学与转录组学
方法:对接受KRAS G12C抑制剂联合EGFR抑制剂治疗后进展的患者配对活检组织进行靶向外显子测序和空间转录组分析;结合人源及鼠源类器官模型进行功能验证和机制研究。
核心发现:- 多数患者进展时存在获得性遗传事件,但通常为亚克隆,并与转录组适应性状态共存。
- 耐药肿瘤以间充质、YAP和胎样转录特征为主,炎症程序在治疗早期即被诱导。
- 单细胞空间分析显示肿瘤内异质性,不同区域存在不同的适应性状态。
- 药物诱导的炎症程序部分为癌细胞自主性,先于耐药出现。
- 鉴定出TBK1可作为靶点,消除炎症适应性阶段并增强KRAS抑制效果。
相关度:高——提供了KRAS抑制剂耐药中遗传与非遗传机制并存的综合空间转录组与基因组证据,有助于开发联合治疗策略和预测性生物标志物;空间转录组分析方法对AI建模具有直接参考价值。
一句话:本研究揭示结直肠癌对KRAS抑制剂的耐药由亚克隆遗传事件与非遗传转录适应性(尤其是TBK1介导的炎症程序)共同驱动,并提示联合靶向TBK1可增强KRAS/EGFR抑制剂疗效。
Towards autonomous medical artificial intelligence agents.
领域:医学人工智能 / 临床决策支持 / 大语言模型代理
方法:介绍MIRA(Medical Intelligence for Reasoning and Action),一种运行于沙盒电子健康记录(EHR)环境中的自主医学AI代理。MIRA通过FHIR架构调用工具,模拟完整临床工作流:获取病史、开立检查(实验室/影像/微生物)、解读结果、生成鉴别诊断、制定治疗计划(用药、手术、入院)等;并与基于真实病历中主诉(HPI)构建的患者代理进行对话交互。评估包括:与医生(混合经验医师和认证医师)对比诊断准确性、指南一致性、用药安全性和入院决策合理性;同时检验患者代理的应答稳定性、对病史的忠实性及抵抗对抗性提示泄漏诊断信息的能力。
核心发现:在覆盖多种诊断的真实患者病例模拟中,MIRA在诊断准确性上优于医生,并做出符合指南、用药安全且适当的入院决策。与以往仅处理孤立子任务或提供自由文本建议的LLM应用相比,MIRA能直接将临床意图转化为结构化、可执行的EHR操作,显示出作为医生决策支持伙伴的更大潜力。患者代理在语义等价问题下应答稳定,未出现提前泄漏诊断结论的情况(即使在对抗性提示下)。
相关度:极高——展示了LLM从聊天工具走向EHR集成自主代理的可行路径,提出了评估医学AI代理的新框架(沙盒模拟、患者代理稳健性、对抗性泄漏测试),对医学AI的安全治理、临床工作流整合及人机协同研究具有重要参考价值。
一句话:MIRA是首个在沙盒EHR中自主完成从病史采集到治疗计划的医学AI代理,在诊断准确性上超越医生,且坚持安全与指南规范。
A multi-agent system for automating scientific discovery.
领域:医学人工智能 / 自动化科学发现 / 老年性黄斑变性治疗靶点发现
方法:提出Robin多智能体系统,集成文献检索智能体(Crow/Falcon,基于PaperQA2)与数据分析智能体(Finch),在“实验室在环”(lab-in-the-loop)框架下自动完成假设生成、实验建议、实验结果解读与假设迭代更新。
核心发现:Robin自主提出增强视网膜色素上皮细胞吞噬作用作为干性年龄相关性黄斑变性(dAMD)的治疗策略,并识别出ripasudil(ROCK抑制剂)和KL001为候选药物,其中ripasudil此前未被提出用于dAMD。后续Robin自主设计的RNA-seq实验分析表明ABCA1(脂质外排泵)上调,提出其作为新靶点。Robin在30分钟内分析551篇论文,相比人工估计294小时,整体流程时间减少约200倍。
相关度:高。该研究展示了AI系统首次在真实生物医学场景中实现“假设-实验-分析-再假设”的闭环自动化,对医学AI在靶点发现、药物重定位和实验设计自动化方面具有重要范式意义。
一句话:Robin是首个能够自主生成假设、设计并分析实验、迭代更新治疗策略的多智能体系统,成功发现dAMD新候选药物及潜在新靶点ABCA1。
Performance of a large language model on the reasoning tasks of a physician.
领域:医学人工智能 / 临床推理
方法:医生评估大语言模型(LLM),在五个实验中使用复杂临床诊断推理案例,以数百名医生为基线;另开展真实世界研究,在大型三级学术医疗中心急诊科随机患者中比较人类专家与AI第二意见。
核心发现:在所有实验中,LLM均优于医生基线,并显示出相较于前代AI临床决策支持的持续改进;LLM已超越大多数临床推理基准,亟需开展前瞻性试验。
相关度:高——提供LLM在临床推理任务上超越人类医生的直接证据,提示现有基准可能已不适用,并强调前瞻性验证的紧迫性。
一句话:大语言模型在医生临床推理任务中表现优于医生基线,且较前代持续进步。
Hyper-RAG: combating LLM hallucinations using hypergraph-driven retrieval-augmented generation.
领域:医学人工智能 / 大语言模型(LLM)幻觉缓解 / 检索增强生成(RAG)
方法:提出Hyper-RAG,一种基于超图(hypergraph)驱动的检索增强生成方法。通过超图结构同时捕获领域知识中的成对关系与超越成对的高阶相关性,构建领域知识库并用于增强LLM生成,以减少幻觉。同时提供轻量级变体Hyper-RAG-Lite,用于提高检索速度。
核心发现:在NeurologyCrop数据集上,Hyper-RAG较直接使用LLM平均准确率提升12.3%,较GraphRAG提升6.3%,较LightRAG提升6.0%;在查询复杂度增加时仍保持稳定性能,而现有方法性能下降。在九个多样化数据集上,基于选择式评估较LightRAG性能提升35.5%;Hyper-RAG-Lite检索速度提升2倍,性能较LightRAG提升3.3%。结果表明Hyper-RAG能有效提升LLM可靠性并减少幻觉,适用于医疗诊断等高风险场景。
相关度:高。直接针对医学领域LLM幻觉问题,提供了可落地的RAG改进方案,并在神经病学数据集上验证,对医学AI研究和临床辅助决策系统开发具有较强参考价值。
一句话:Hyper-RAG通过超图建模高阶知识关联,显著降低LLM医学问答幻觉,并在准确性和鲁棒性上优于GraphRAG和LightRAG。
Large Language Model Performance and Clinical Reasoning Tasks.
领域:医学人工智能 / 临床推理评估
方法:横断面研究。使用2025年1月更新的MSD手册标准化临床病例(29个vignettes),评估21个现成大型语言模型(含GPT-5、Claude 4.5 Opus、Gemini 3.0 Flash/Pro、Grok 4等)。由医学评分者分三组对模型在标准临床工作流程各阶段(鉴别诊断、诊断检查、最终诊断、管理、其他临床推理问题)的表现进行评分。主要结局为PrIME-LLM评分(五域平衡准确率的归一化多边形面积),并采用方差分析、t检验和回归模型比较模型性能和人口学关联。
核心发现:PrIME-LLM评分范围0.64(Gemini 1.5 Flash)至0.78(Grok 4);推理优化模型优于非推理模型,GPT系列整体最高。鉴别诊断是所有环节中准确性最差的(所有模型失败率>0.80),而最终诊断准确性较好(失败率<0.40)。多模态模型在图像输入下准确性有所提升。现有LLM虽在最终诊断上表现接近临床可用,但在早期诊断推理和不确定性处理上仍存在显著短板,传统基准掩盖了这些关键差距。
相关度:极高。该研究提出了更接近临床实际的多维评估框架(PrIME-LLM),揭示了现成LLM在临床部署中的真实局限,对医学AI开发、评测和安全标准建立有直接指导意义。
一句话:现成LLM在最终诊断上看似强大,但在鉴别诊断和不确定性推理上系统性薄弱,距安全临床自主决策尚有明显差距。
Large Language Models and Otolaryngology: A Review.
领域:耳鼻咽喉科与大型语言模型(LLM)交叉应用
方法:综述性文章,基于现有文献总结耳鼻咽喉科与其他专科在LLM应用上的差异,并归纳LLM在医学中的潜在方法论框架(包括非结构化数据转换、自动表型分析、行政管理、决策支持、多模态整合等)。
核心发现:耳鼻咽喉科对LLM的研究集中在问答任务和可行性评估,缺乏临床整合;其他专科已展示更广泛的方法学应用。LLM所需标注数据少、适应性强,但耳鼻咽喉科多使用闭源模型,限制了翻译潜力和临床效用。需转向验证性研究和实施科学。
相关度:高——该文明确指出了LLM在医学应用中的常见局限与未来方向,提供了跨专科的方法学参考,为耳鼻咽喉科及其他专科的LLM研究提供路线图。
一句话:耳鼻咽喉科在LLM应用上仍落后于其他专科,需从可行性研究转向严格验证、开源模型与多机构协作,以发挥其多模态数据优势。