苏菲的工房

每日医学AI论文简报 v0.3

[日报]

日期: 2026-08-04 来源: PubMed + arXiv | 分析: DeepSeek-v4-flash(PMC HTML解析,含表格+图注) 过滤: 近3天滚动窗口 | 期刊门槛(IF≥3/未收录放行) | 双层相关度(硬规则+LLM显式标准) | PMC全文优先(不足摘要级补齐) | 复合排序


💡 今日学习推荐 CS231n 卷积神经网络(Stanford) — 一、卷积神经网络(CNN)架构(进度0%) ⏭ 下一步:CS229 机器学习讲义(Andrew Ng)


1. Evaluation of GPT-5, a Large Language Model, in Replicating German Clinical Practice Guideline Recommendations in Oral Oncology: A Cross-Sectional Concordance Study.

J Oral Pathol Med (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ✅ 高置信 分析来源: PMC全文(含表格+图注)

领域: 口腔肿瘤学 / 医学人工智能(大语言模型与临床指南一致性评估)

方法: 横断面分析比较研究。将两份德国口腔临床实践指南(S2k OPMD 15条 + S3 OC 96条,共111条推荐)逐字输入GPT-5(免费版,无联网),要求确认或拒绝;另测试反转陈述以检验方法学稳健性。以准确率(正确分类比例)和Cohen’s κ评估一致性。

核心发现: GPT-5正确确认了所有原始推荐,并拒绝了所有反转陈述。原始推荐评估中κ=1.0(完全一致);原始+反转联合评估时κ=0.96(非常高)。指南引用文献>93%为英文,>77%来自德国以外。

相关度(医学AI研究者): 高。提供了LLM在“识别已有指南推荐”任务上性能优异的直接证据,但明确区分了“识别”与“自主临床推理”,提示LLM作为教育/信息工具可行,不能替代临床判断;为后续LLM临床评估设计(含反转陈述对照组)提供了方法学参考。

一句话: GPT-5对德国口腔肿瘤指南原始推荐100%一致,但仅证明其能识别已有知识,而非独立临床推理能力。

J Dent (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 口腔医学教育 / 大语言模型(LLM)评估
方法: 系统综述与Meta分析(遵循PRISMA指南,纳入2022年1月至2025年8月文献,PICO框架,双人筛选,比例Meta分析及Meta回归)
核心发现: LLM在牙科选择题作答中的准确率随时间显著提升(p<0.001);各LLM间异质性高(≥90%);OpenAI模型(ChatGPT-3.5, 4, 4o及更新)显著优于其他竞品(p<0.001);题目类型(仅题干 vs. 临床情境+题干)和题目来源(本地编写、商业产品、免费资源)对准确率无显著影响。
相关度(医学AI研究者): 高——提供LLM版本迭代在医学教育测评中的量化性能趋势,提示模型进步可期,但异质性和评估场景需进一步标准化。
一句话: 大语言模型在牙科选择题中的准确率随版本迭代显著提高,但跨模型差异仍大,目前更适合作为辅助教学工具而非唯一评估标准。

3. ChatGPT in urogynecology: Comparing large language model responses to human experts.

Acta Obstet Gynecol Scand (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: PMC全文(含表格+图注)

领域: 妇科泌尿学 / 人工智能大语言模型(LLM)在患者教育中的应用

方法:
横断面问卷调查。共纳入203名妇科泌尿科患者,患者分别对6个常见妇科泌尿问题的ChatGPT回答和一位顾问级妇科泌尿科医生回答进行盲法评分;另由第三方顾问医生验证临床准确性。评分采用5点Likert量表,涵盖三个维度:可理解性、帮助性和安慰性,每个回答最高15分。使用Wilcoxon符号秩检验进行比较。

核心发现:
ChatGPT回答的总评分显著高于顾问医生回答(中位76分 vs 72分,p < 0.01),在可理解性、帮助性和安慰性三个维度均更优(均p < 0.01)。6个问题中,ChatGPT在4个问题上更受患者偏好,1个无差异,1个由顾问医生胜出。患者年龄、特征等亚组分析未显示显著差异。作者强调该结果为探索性发现,反映患者主观感知,LLM只能作为临床专业照护的辅助工具,需谨慎监督使用。

相关度(医学AI研究者):
高。该研究直接评估了LLM在专科临床场景中的患者沟通潜力,提示ChatGPT可能改善患者信息获取体验,同时强调了“辅助而非替代”的边界,对医学AI教育应用、人机协同和临床安全监管具有参考价值。

一句话:
这是一项探索性患者评分研究,显示ChatGPT对常见妇科泌尿问题的回答比单一顾问医生更清晰、更有帮助、更令人安心,但作者明确指出其仅可作为谨慎辅助工具,不能替代专业诊疗。

4. Reference-Free large language model agents for physician-guided radiotherapy treatment planning.

Med Phys (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: PMC全文(含表格+图注)

领域: 放疗治疗计划 / AI智能体 / 大语言模型(LLM)在医学影像与放疗中的应用

方法:
该研究回顾性收集了20例接受IMRT的头颈部(HN)癌症患者。研究者将未经微调、未见参考计划的商用LLM构建为智能体,直接与临床治疗计划系统(TPS)交互:智能体在迭代过程中提取中间计划状态,基于实时计划评估和先前优化结果,提出新的约束值以指导逆向优化。其核心能力包括理解临床计划目标、理解优化环境上下文以及进行定量推理的算术能力。LLM生成的计划与认证剂量师手工制定的临床已批准计划进行比较,采用Wilcoxon符号秩检验进行配对统计分析。

核心发现:
LLM生成的计划在危及器官(OAR)保护方面与临床计划相当,同时显示出更好的热点控制和靶区适形性:

该研究证明了在商业TPS中,无需参考计划和微调即可实现LLM驱动的自动化IMRT计划设计,展示了减少计划变异性并推广AI计划策略的潜力。

相关度(医学AI研究者): 高。该研究直接面向放疗计划自动化这一临床痛点,验证了LLM智能体在无参考计划、无微调条件下与商用TPS交互优化的可行性,对医疗AI智能体在真实临床工作流中的落地具有重要参考价值。

一句话: 本研究证明,无需参考计划和微调的大语言模型智能体可通过与商用TPS迭代交互生成与临床计划相当的IMRT计划,并在热点控制和适形性上表现更优。

5. Safety and diagnostic accuracy of large-language model application of PECARN head injury algorithm.

Int J Med Inform (IF: 5.5) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 儿科急诊医学 / 临床决策支持 / 大语言模型应用
方法: 回顾性模型开发与验证研究;使用GPT模型在24例患者笔记上开发、122例患者笔记上测试;比较四种LLM模型提取PECARN算法特征的表现;以儿科急诊医师为金标准,评估负预测值(NPV)和准确率。
核心发现: 所有LLM模型NPV均较高(最优模型NPV=0.98,准确率=0.89),接近临床医生表现(NPV=0.99,准确率=0.92);提示工程优化的“Optimized Features Model”表现最佳。
相关度(医学AI研究者): 中等—展示LLM用于临床决策算法自动化的可行性,但样本量小、属预实施研究,尚需大规模与可行性验证。
一句话: LLM可较安全准确地将PECARN头部损伤算法应用于急诊临床笔记,但距离实际临床部署仍需进一步研究。

6. Evaluation Methods for Inference-Time Retrieval-Augmented and Graph Retrieval-Augmented Large Language Models in Health Care: Scoping Review.

J Med Internet Res (IF: 5.8) | 2026 Aug 3 | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 医学人工智能 / 大语言模型(LLM)在医疗中的检索增强生成(RAG)与图检索增强生成(GraphRAG)评估方法学
方法: 遵循PRISMA-ScR的范畴综述,检索截至2026年5月14日,纳入157项研究;提取研究特征、系统设计、检索层评估、证据链接、安全相关及GraphRAG特定评估等,并构建证据-缺口图。
核心发现: 临床问答(56.7%)和临床决策支持(44.6%)最常见;89.2%为离线评估;独立检索层评估占29.9%;接地/忠实性评估占26.1%;细粒度证据验证仅占14%;人工评估占59.9%但报告信度仅27.7%;LLM-as-judge占26.1%中仅36.6%报告偏倚控制;正式安全性评估占28.7%;GraphRAG研究中中间产物评估占40.7%、图构建评估占22.2%;工作流面向/前瞻性/部署级评估稀缺,且细粒度验证、矛盾处理、安全性、LLM-judge防护、GraphRAG构建与中间产物评估覆盖不足。
相关度(医学AI研究者): 高——系统呈现当前医疗RAG/GraphRAG评估方法的异质性与关键缺口,为设计更严谨、可对照的评估框架提供直接依据,并警示临床就绪性判断的证据局限。
一句话: 这项范畴综述显示,医疗RAG/GraphRAG的评估仍以离线为主,且安全、证据细粒度验证、人工评估信度及GraphRAG特有评估等关键环节报告不足。

7. Curated Retrieval-Augmented Generation for Dental Traumatology.

J Dent (IF: N/A) | 2026 Aug 3 | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 牙科创伤学 / 临床决策支持
方法: 构建基于5个权威来源(IADT 2020、ESE 2021、Krastl 2021、AAE 2013、Cochrane)的250个精选文本单元知识库,以Gemini 2.5 Flash为基础模型部署DT-RAG系统。研究1:对99个二元临床问题,将DT-RAG与8个商业LLM进行三轮比较,采用McNemar精确检验(Holm校正)比较模态准确率。研究2:7名盲法专家使用92点评分量表,在10个临床场景中比较DT-RAG与3个前沿LLM,使用线性混合效应回归估计差异。
核心发现: DT-RAG模态准确率96.0%(95% CI 90.1–98.4),显著超过所有商业LLM(最佳对比GPT-5.5为87.9%,配对差异+8.1个百分点,p_Holm=0.013)。精选知识库将基础模型的有效理由率从49.5%提升至98.0%,评估中消除幻觉(0 vs 21)。研究2中DT-RAG平均得分82.1/92(89.3%),显著超过Claude Opus 4.5(72.6,p=0.016)、Gemini 2.5 Pro(60.3)和GPT-4.1(50.4);7名评估者均将DT-RAG排第一(Kendall’s W=0.97)。
相关度(医学AI研究者): 高——展示精选检索增强生成(RAG)在专科临床决策支持中的可行性,显著优于通用大模型,并实现可溯源、无幻觉的响应;为其他有权威指南的临床领域提供方法论模板,但需前瞻性评估安全性。
一句话: 精选RAG系统在牙科创伤学基准上超越前沿通用LLM,准确率高且消除幻觉,但临床安全性仍待前瞻验证。

8. Comparative Analysis of Large Language Model Performance in Appropriate Diagnostic Imaging Modality Selection.

J Am Coll Radiol (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 医学影像学 · 大语言模型临床决策支持
方法: 对7种LLM(OpenEvidence、GPT-5 Thinking、GPT-5、Opus 4.1、Sonnet 4.5、Gemini 2.5 Pro、Gemini 2.5 Flash)进行50个临床 vignette 测试;基于ACR指南设计5类主诉×10种变体;采用3点Likert量表评估4项指标(影像适宜性、技术特异性、临床理由强度、引用质量),另测可读性与字数;双盲独立评审+共识裁决;Friedman检验及Wilcoxon符号秩检验(Holm校正)
核心发现: 所有模型在影像适宜性和临床理由上均表现良好,无显著两两差异;引用质量差异最大,Gemini 2.5 Pro / 2.5 Flash 分别有80%和76%的提示出现幻觉引用,显著差于其他模型;技术特异性与临床理由无显著两两差异;可读性和字数变异较大
相关度(医学AI研究者): 高——系统比较了多家前沿LLM在影像决策中的实际性能,揭示引用幻觉这一关键落地障碍,对影像AI辅助工具选型和评估设计有直接参考价值
一句话: 各LLM均能给出合理的影像检查建议,但Gemini系列存在严重引用幻觉,提示临床落地前必须验证推理与引用的一致性。

9. When Useful Clinical AI Exceeds Meaningful Oversight.

J Med Syst (IF: N/A) | 2026 Aug 1 | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 临床AI治理与监督
方法: 概念性分析/观点论述(基于摘要,未报告实证研究或系统方法)
核心发现: 提出认知监督与规范性监督的区分;指出当临床AI变得多模态、智能体化和认知上更具野心时,人类监督往往流于形式,临床医生虽对AI辅助决策负责,却无法有意义地审查AI输出依据。
相关度(医学AI研究者): 高——提醒研究者不能仅将“人类监督”视为固定保障措施,需在AI系统设计与评估中同时考虑认知可审查性与规范性责任边界。
一句话: 该文主张区分“认知监督”与“规范性监督”,并指出临床AI越强大,人类有意义的监督越可能失效,需重新审视AI评估与部署方式。

10. Test-Time Compute and Budget (“Reasoning Effort”): An Underrecognized Methodologic Variable in Medical Large Language Model Research.

Korean J Radiol (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要(原文摘要未提供,基于现有信息推断)

领域: 医学大语言模型(LLM)研究方法学,重点关注放射学/医学影像应用

方法: 评论/社论性质;提出“测试时计算量/推理努力”(test-time compute / reasoning effort)作为医学LLM研究中未被充分认识的方法学变量;分析其对输出质量、稳定性和可重复性的影响,并呼吁在研究报告中记录与控制该参数

核心发现: 模型推理阶段的计算资源投入与预算限制会显著影响LLM输出质量与稳定性;现有医学LLM研究普遍未将其作为独立变量报告或控制,可能损害结果的可重复性与可比性;作者建议在医学LLM研究中明确规范“推理努力”参数

相关度(医学AI研究者): 高——直接关系LLM评估与临床应用的严谨性;若忽视该变量,可能导致模型性能结论失真,影响临床决策支持系统的验证与部署

一句话: 医学LLM研究应把“测试时计算量/推理努力”作为关键方法学变量明确报告与控制,否则结果可重复性存疑。

11. Optimising clinical information extraction: a comparative study of retrieval-augmented generation techniques in clinical notes.

J Biomed Inform (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 临床信息抽取 / 医学自然语言处理(针对澳大利亚老年护理机构的非结构化临床笔记)
方法: 在统一RAG流水线中系统比较6种检索策略(BM25、稠密检索、稠密检索+交叉编码器重排、稀疏/稠密动态线性融合、倒数排名融合RRF、混合粗到细重排);基于两个临床命名实体识别任务(痴呆激越症状提取、营养不良风险因素识别,各n=208)评估;采用重复测量方差分析及误差分析
核心发现: 重排和混合集成策略显著优于单独稀疏(BM25)和稠密检索;激越提取中稠密重排最优(Answer F1=0.946,Context Diversity=0.895,Item-level Accuracy=0.963);营养不良任务中集成方法获得最佳Item-level Accuracy(0.944),稠密重排紧随其后;误差分析识别三类LLM错误(内在幻觉、外在幻觉、假阴性),并阐明RAG的缓解作用
相关度(医学AI研究者): 高——为临床非结构化文本的自动化信息提取提供了可复现的RAG检索策略选择依据,有助于提升下游预测建模和临床决策支持系统的可靠性
一句话: 基于真实老年护理临床笔记的系统比较显示,重排型检索能显著增强RAG在临床信息抽取中的准确性与可信度。

12. Decoding Algorithmic Inequity: Reversing the Generative AI Racial Divide in Healthcare.

Clin Ther (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 医疗人工智能公平性、算法偏见、健康差异
方法: 观点性论文(Perspective);提出“数据差异管道”(Data Disparity Pipeline)概念,系统梳理偏见来源、现有证据及缓解策略局限,并给出多模态公平框架建议
核心发现: 医疗AI通过数据差异管道继承并放大结构性偏见;偏见来源包括偏倚数据、代理变量、代表性不足和递归重训;现有缓解策略有限;需通过代表性数据基础设施、参与式监督、透明性和持续公平审计来促进健康公平
相关度(医学AI研究者): 高——直接针对AI公平性核心问题,提供系统性偏见机制分析和可操作的治理框架,对模型开发、数据治理和临床部署具有重要参考价值
一句话: 论文揭示医疗AI中的种族差异源于从数据到临床的全链条不平等,并呼吁通过多利益相关方协作的公平审计框架来逆转这一算法分水岭。

13. From Image to Pixels: Towards Fine-Grained Medical Vision-Language Models.

IEEE Trans Pattern Anal Mach Intell (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 医学视觉-语言模型(Biomedical Vision-Language Models),细粒度像素级理解
方法: 构建跨8种医学影像模态的基准 MeCoVQA;提出 MedPLIB,一种端到端医学多模态大模型,支持VQA、点/区域查询、定位和分割;采用任务专用混合专家(MoE)架构进行统一微调;整合检索增强生成(RAG)与上下文学习(ICL)提升泛化能力。
核心发现: MedPLIB在多项生物医学视觉-语言基准上达到新SOTA;在零样本像素级定位上,超过现有最优小模型19.7 mDice、大模型15.6 mDice,展示了临床实用性与泛化优势。
相关度(医学AI研究者): 高——该工作提供数据/基准(MeCoVQA)、统一模型(MedPLIB)及训练策略,可直接服务于医学影像的细粒度诊断、定位与分割任务,尤其对零样本泛化场景有重要参考价值。
一句话: 通过数据、模型和训练创新,MedPLIB实现了医学图像从粗粒度理解到像素级推理的跨越,并在零样本定位分割上显著超越现有模型。

14. [Keeping track of things: large language models for patient synopses : Source-bound system for clinical information systems].

Radiologie (Heidelb) (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 临床信息学 / 放射学 / 大语言模型(LLM)在电子健康记录中的应用
方法: 系统开发与架构描述。基于检索增强生成(RAG)、元数据标准化、向量检索、智能体检索(agentic retrieval),整合EHR、PACS等多个主要系统的临床文档,实现患者级查询、纵向摘要与来源可追溯的自动摘要生成;采用基于角色的访问控制、端到端来源归属、主权云处理且不持久化存储。
核心发现: 该系统能够生成结构化纵向患者摘要,并为跨学科病例讨论提供准备支持;所有陈述可追溯至原始文档,但医学解释和决策仍由临床医生负责。实施前提包括互操作性信息系统、符合GDPR、德国SGB V及EU AI Act的数据保护框架。结论认为LLM患者摘要可用于文本密集型临床流程,但需受控检索、明确来源归属、医生审核及合规架构;常规临床使用前仍需前瞻性评估。
相关度(医学AI研究者): 较高。展示了LLM+RAG在真实临床文档整合与摘要生成中的可行架构,强调透明度、溯源、权限控制和法规合规,可作为医学AI系统落地设计的参考;但尚无临床效果定量评价。
一句话: 该研究基于摘要提出并描述了一种使用LLM与RAG构建可溯源、受控且合规的患者摘要系统,用于支持放射科及跨学科病例讨论,但常规应用前仍需前瞻性验证。

15. [Participatory processes in the development of AI systems in a clinical context: A qualitative secondary analysis].

Pflege (IF: N/A) | 2026 Aug | PubMed ⚠️ | DOI | ⚠️ 中置信 分析来源: 摘要
领域: 临床人工智能(AI)系统开发,护理/医疗决策支持(谵妄预测)
方法: 定性二次分析(qualitative secondary analysis);对KIDELIR项目中参与式活动(包括工作坊的案例 vignettes、健康信息映射、小组讨论、参与式系统映射、变革理论建模、访谈等)的照片文档、观察记录和转录文本进行结构化质性内容分析。
核心发现: 不同参与式格式能够显现不同类型知识:案例 vignettes揭示直觉化评估逻辑,映射方法暴露信息流结构,访谈阐明专业特定需求;除功能期望外,还使隐性工作惯例、数据断层和沟通问题变得可见。
相关度(医学AI研究者): 高——提示参与式方法不仅是需求收集工具,更可揭示临床情境中的隐性专业知识和数据实践,为AI系统设计与实施提供关键语境信息,弥补当前实证证据不足。
一句话: 该研究通过对KIDELIR项目的二次分析表明,临床AI开发中的参与式方法能有效展现职业特有的经验知识和数据相关实践,并支持协商过程。


🔬 新增AI临床试验

近1日新增: 74 项 | 数据源: ClinicalTrials.gov

NCT00001372 Study of Systemic Lupus Erythematosus

状态: RECRUITING | 期: N/A | 赞助: | 招募: 2000 条件: Systemic Lupus Erythematosus

NCT07742605 A Clinical Trial to Evaluate the Effects of a Supplement on Cognitive Performance

状态: COMPLETED | 期: NA | 赞助: | 招募: 35 条件: Cognitive Impairment; Brain Fog; Memory Difficulties

NCT07299019 A Study of Orelabrutinib in Patients With Secondary Progressive Multiple Sclerosis

状态: RECRUITING | 期: PHASE3 | 赞助: | 招募: 990 条件: Secondary Progressive Multiple Sclerosis

NCT03258554 Radiation Therapy With Durvalumab or Cetuximab in Treating Patients With Locoregionally Advanced Head and Neck Cancer Who Cannot Take Cisplatin

状态: COMPLETED | 期: PHASE2, PHASE3 | 赞助: | 招募: 196 条件: Clinical Stage III HPV-Mediated (p16-Positive) Oropharyngeal Carcinoma AJCC v8; Head and Neck Squamous Cell Carcinoma; Hypopharyngeal Squamous Cell Carcinoma

NCT04887077 Digital Intervention Promoting Physical Activity Among Obese People (DIPPAO)

状态: COMPLETED | 期: NA | 赞助: | 招募: 56 条件: Obesity; Diabete Type 2


📄 医学AI预印本速览(arXiv 近3天)

1. Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework Junjie Yin, Buxin She, Xinyu Feng et al. | 2026-08-03 | arXiv Artificial intelligence (AI) is increasingly central to power and energy systems, supporting modeling, forecasting, optimization, and control. Yet most existing works emphasize specialized applications and offer little reusable material for newcomers or interdisciplinary learners…

2. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning Zhaoxin Yu, Qi Shen, Hengli Li et al. | 2026-08-03 | arXiv Optimization-based latent reasoning improves large language model outputs by optimizing instance-specific continuous states at test time while keeping model parameters frozen. Existing methods, however, typically connect these states to the reasoning trajectory through decoded to…

3. MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs Saman Sarker Joy, Niloy Farhan | 2026-08-03 | arXiv Large language models (LLMs) are increasingly used for health-related advice. Existing research measures their safety with static questions rather than pressured patient-facing conversations. We introduce MedPRESS, a multi-turn benchmark for measuring patient-pressure-induced syc…

4. Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks Xuan Ren, Weiqi Zhai, Tianle Pu et al. | 2026-08-03 | arXiv Scientific reasoning benchmarks typically evaluate large language models (LLMs) using final-answer accuracy. However, a correct answer does not necessarily demonstrate the reasoning capability targeted by the problem. We identify Solution Hacking, a failure mode in which an LLM r…

5. Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning Yiran Gao, Tao Li, Kim Hammar | 2026-08-03 | arXiv Incident response is currently managed by security operators using predefined playbooks, resulting in slow, labor-intensive security decision-making processes. Consequently, there is a growing need for automated incident response planning. Decision-theoretic approaches based on c…

6. Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes Nan Chen, Zhouhao Yang, Soufiane Hayou | 2026-08-03 | arXiv Intent classification in Large Language Models (LLMs) involves categorizing user prompts into predefined classes. For instance, given a user prompt, the system must determine whether it primarily concerns mathematics, coding, or general text processing. Such classification enable…

7. Why Large Language Models Fail at Tabular Prediction Marta Garnelo, Wojciech M. Czarnecki | 2026-08-03 | arXiv Large language models (LLMs) have become the default tool for a remarkable range of tasks, yet they have had conspicuously little success at one of the most common machine learning workloads: predictive analytics over tabular data. This gap is the founding premise of the fast-gro…

8. MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian et al. | 2026-08-03 | arXiv Benchmark suites assess model capability on controlled tasks; large-scale conversation corpora capture naturalistic use without user feedback; and in-interface feedback mechanisms record satisfaction without task purpose. Together, they leave a critical gap in LLM evaluation: no …