arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-28 至 2026-07-28 共收录 118 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2607.22925 2026-07-28 cs.CL cs.AI cs.LG 新提交 89%

Not All LLM Reasoning is Visible in the Chain-of-Thought

并非所有大语言模型的推理都能在思维链中体现

Vatsal Baherwani, Tom Goldstein, Ashwinee Panda

机构 * New York University(纽约大学) University of Maryland(马里兰大学) TogetherAI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22629 2026-07-28 cs.AI cs.CL 新提交 84%

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

掩码蒸馏:将思维链内化到语言模型中

Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22837 2026-07-28 cs.LG cs.AI cs.CL 新提交 67%

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

通过对数偏差对语言模型进行极其简单的黑箱适应

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究院) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。

Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22554 2026-07-28 cs.AI cs.CL cs.LG 新提交 67%

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

相同问题,不同答案:超越准确率评估大语言模型的可靠性

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24555 2026-07-28 cs.LG cs.AI 新提交 62%

LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding

LOCKS:用于高效长上下文解码的页面局部紧凑键摘要

Junsung Hwang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对长上下文解码中KV缓存瓶颈问题,提出LOCKS方法,为页面提供局部紧凑键摘要,通过重建对数its、估计注意力质量等操作,仅关注顶部页面,在多种任务中表现出色,显著降低解码延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2607.23916 2026-07-28 math.NA cs.NA 新提交 80%

Recursive Governance: A Graph-Theoretic Framework for Risk Propagation and Drift Detection in Agentic AI Systems

递归治理:智能体人工智能系统中风险传播与漂移检测的图论框架

Sriram Nagaraj, Advaith Nila Narayanan

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 针对金融机构模型风险管理问题,提出动态IaC治理循环,贡献包括引入校准DoA得分、构建DAG定义算法、开发轨迹监测协议及解决版本变化等实际复杂性问题,用于智能体人工智能系统风险传播与漂移检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23806 2026-07-28 cs.CL cs.AI cs.IR cs.LG cs.PF 新提交 67%

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此

Sietse Schelpe

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。

Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22944 2026-07-28 cs.NI cs.AI cs.LG cs.SC 新提交 62%

Invariant Discovery for Networked Systems

网络系统的不变量发现

Hongyu Hè, Alexander Krentsel, Sylvia Ratnasamy, Maria Apostolaki

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究网络系统不变量发现问题,核心方法是将其分为人工智能驱动的语法“发现”与统计驱动的“搜索”问题,设计实现Autogram系统,贡献是能在多种数据上高覆盖率、低误报地恢复专家不变量并讨论开放问题。

Comments 8 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2607.23055 2026-07-28 cs.AI 新提交 90%

SymStep: Symbolic Step Verification for Logical Reasoning

SymStep:用于逻辑推理的符号步骤验证

Aida Usmanova, Rui Gao, Dilshod Azizov, Ricardo Usbeck, Zangir Iklassov

机构 * Leuphana University of Lüneburg(吕讷堡莱普芬纳大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对约束密集型逻辑推理任务中思维链提示的不足,提出SymStep方法,通过语言模型分步声明、约束传播器检查一致性等进行推理,在多个逻辑推理任务上表现优异,最小剩余值指导和一致性检查起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23019 2026-07-28 cs.AI cs.LO cs.SC 新提交 89%

Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming

合理地运用波普尔方法:用归纳逻辑编程修补上下文推理

Zirong Chen, Meiyi Ma

机构 * Vanderbilt University(范德堡大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);verifier(abstract)

AI总结 研究针对思维链提示中间步骤逻辑不合理问题,提出Reason Popper-ly框架,用归纳逻辑编程学习规则作在线验证器校正步骤,在CLUTRR基准测试中提升了模型准确率,还产生细粒度错误分类法,优于完全外部符号管道。

Comments Accepted at the 20th Conference on Neurosymbolic Learning and Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23058 2026-07-28 cs.CL cs.AI 新提交 88%

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

ADAGE:一种用于类比推理评估的语言无关管道

Ahmed Haj Ahmed, Alvin Grissom

机构 * Haverford College(哈弗福德学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对多语言推理评估依赖翻译基准的问题,提出ADAGE语言无关管道,结合母语者策划与大语言模型辅助生成构建基准,通过为多种语言构建基准并评估模型,发现文化推理差距,还发布了相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23513 2026-07-28 cs.CL cs.AI 新提交 84%

Do Diagrams Help Large Language Models Reason? Evidence from Syllogistic Reasoning

图表有助于大语言模型推理吗?来自三段论推理的证据

Risako Ando, Koji Mineshima

机构 * Keio University(庆应义塾大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究三段论推理中图表对大语言模型的影响,比较自然语言、逻辑符号、线性图表和欧拉图四种表示条件,利用285个问题评估两个模型,发现图表不能始终提升性能,模型在中性问题上表现不佳,从图表中获益有限。

Comments To appear in the Proceedings of the 15th International Conference on the Theory and Application of Diagrams (Diagrams 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22571 2026-07-28 cs.AI 新提交 83%

SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs

SCAIR:用于企业知识图谱的模式条件代理迭代推理

Prateek Chaturvedi, Yuqicheng Zhu, Hongkuan Zhou, Dongzhuoran Zhou, Yunjie He, Steffen Staab, Fei Du, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学) University of Southampton(南安普顿大学) BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 57%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24312 2026-07-28 cs.CL 新提交 57%

CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

CONSISTRE:用于文档级关系抽取的统一一致性感知框架及大语言模型

Mingxuan Sun

机构 * Université de Sherbrooke(舍布鲁克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对文档级关系抽取中,大语言模型预测易违反关系约束的问题,提出CONSISTRE统一框架。通过推理时的约束感知等及训练时的知识蒸馏强化学习两条路径解决,实验表明该框架有效提升性能,缩小开源与专有模型差距,增强可靠性。

Comments 13 pages, 2 figures. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22948 2026-07-28 cs.NI cs.AI 新提交 57%

Building AI That Works: ESnet's Pragmatic Approach to AI-Driven Operational Excellence

构建有效的人工智能:ESnet实现人工智能驱动卓越运营的务实方法

Bin Dong, Sukhada Gholba, Brooklin Gore, Shawn Kwang, David Mitchell, Samuel Oehlert, Garrett Stewart, Brendan White, Luke Baker, Ed Balas, Britt Gathright, Chin Guok, Jon-Paul Heron, John MacAuley, Scott Richmond, Chris Robb, Chris Tracy, Kesheng Wu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ORBIT项目针对ESnet运营痛点,将智能人工智能集成到ServiceNow平台,采用模块化分层架构,以版本化、测试的“技能”管理工具链,完成多项任务,减少步骤、消除错误模式,获广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22947 2026-07-28 cs.AI cs.MA cs.NI cs.SC 新提交 57%

Let AI Agents Translate Networks, Not Reason About Them

让人工智能代理翻译网络,而非对其进行推理

Hongyu Hè, Maria Apostolaki

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对生产网络缺乏形式模型的问题,提出将人工智能局限于网络工件到形式逻辑规则的翻译,依靠求解器推理,构建TypoNet验证模拟广域网符号模型,能快速可靠回答操作问题及促进故障定位。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22591 2026-07-28 cs.AI cs.MA 新提交 57%

Lexical discovery in unknown environments orchestrated by Large Language Models

由大语言模型编排的未知环境中的词汇发现

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对未知环境中智能体需开发共享词汇的问题,提出神经符号词汇发现框架,让基于大语言模型的智能体群体进行指称博弈自组织词汇表,通过语义锚定扩展人类词汇,模拟达成共识并表征收敛动态,为自主探索预部署规划迈出第一步。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 30 篇

2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 85%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 83%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24167 2026-07-28 cs.AI 新提交 79%

Falsifiable Commitment Planning for Self-Correcting Web Agents

用于自我纠正网络代理的可证伪承诺规划

Guangyi Liu, Huan Zhao, Quanming Yao

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究长期运行网络代理易偏离轨道问题,提出FCPAgent框架,将计划步骤表示为FCU,通过计划-测试-修复循环执行,经混合承诺测试模块和范围感知修复提高成功率,在WebArena上相比基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23734 2026-07-28 cs.NI cs.LG 新提交 79%

TRUAV: Distributed Multi-Agent Reinforcement Learning for Trajectory Planning and Routing Enhancement in UAV-Aided IoT-Enabled VANETs

TRUAV:无人机辅助的物联网支持的车联网中用于轨迹规划和路由增强的分布式多智能体强化学习

Muhammad Umar Farooq Qaisar, Lin Zhang, Zhen Chen, Wajdy Othman, Shehzad Ashraf Chaudhry, Chang Liu

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 研究无人机辅助车联网中轨迹规划与路由增强问题,提出基于独立表格Q学习的分布式多智能体强化学习框架TRUAV,其智能体依局部信息运行,奖励设计兼顾多种因素,模拟显示该框架在多方面表现良好,还讨论了相关挑战与方向。

Comments 7 pages, 3 figures, submitted to IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22621 2026-07-28 cs.AI 新提交 79%

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

Opti-Q:一种用于多语言模型问题规划的基于约束的优化框架

Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Portland State University(波特兰州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究针对多语言模型预算部署难题,提出OPTI-Q框架。该框架将模型调用建模为执行DAG操作符,利用PERFDB估计质量和成本,经帕累托前沿搜索选计划,在指定预算下于MMLU-Pro和SimpleQA上提升QoA,实现更好的质量-资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22574 2026-07-28 cs.AI cs.IR 新提交 79%

Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning

证据过多,时间过少:通过多目标证据推理从文本到可操作的建议

Adela Bara, Simona-Vasilica Oprea

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对临床决策中证据过多难审查的问题,提出SCEPTER框架,结合多种技术将临床病例描述转化为建议,经150个案例研究评估,能大幅压缩搜索空间,留存证据多样,基于帕累托的选择提升了证据多样性和建议效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22643 2026-07-28 cs.AI cs.CV 新提交 74%

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

检索前先思考:多模态检索增强生成的智能体规划

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

机构 * Bosch AI Research Center(博世人工智能研究中心) University of Notre Dame(圣母大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 研究多模态检索增强生成问题,提出MM-R2框架,通过建模检索内容和位置在检索前推理,构建意图基础检索状态,在结构化知识图谱检索,还构建相关数据集并采用两阶段后训练策略,实验证明其在答案准确性等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 70%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23678 2026-07-28 cs.AI 新提交 70%

Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems

你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排

Mingzhou Fan, Siyuan Xu, Mingxuan Yuan

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23045 2026-07-28 cs.AI cs.RO 新提交 70%

Stress-testing large language model agents in a robotic chemistry laboratory

在机器人化学实验室中对大型语言模型智能体进行压力测试

Lulu Guo, Yingkai Sun, Xiaobo Li, Luyao Ge, Ziming Wang, Haitao Zheng, Jingyu Li, Huijuan Zhang, Bingxu Chen, Daobin Liu, Yuebo Liu, Jie Li, Xiaohui Li, Linjiang Chen, Yi Luo, Jun Jiang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究以机器人化学实验室为测试平台,使科学智能可衡量,通过4608次试验发现工作流程执行率低、长期规划有挑战,反馈促使局部调整,提供了部署评估及改进诊断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交 70%

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏