arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-27 至 2026-04-27 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 13 篇

2604.22156 2026-04-27 cs.LG cs.CV 83%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22560 2026-04-27 cs.CV cs.AI 81%

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影

Gautam Kumar Jain, Carsten Markgraf, Julian Stähler

机构 * Technische Hochschule Augsburg(亚琛工业大学)

专题命中 规划推理 :reasoning(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。

Comments 16 pages, 8 figures, 8 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22266 2026-04-27 cs.CL 70%

Large Language Models Decide Early and Explain Later

大语言模型早决策晚解释

Ayan Datta, Zhixue Zhao, Bhuvanesh Verma, Radhika Mamidi, Mounika Marreddy, Alexander Mehler

机构 * University of Sheffield, UK(谢菲尔德大学,英国) Goethe University, Frankfurt am Main, Germany(法兰克福歌德大学,德国)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究发现大语言模型在生成过程中,只有32%的查询在中间阶段改变最终答案,且稳定后生成额外760个推理token。通过早停策略可减少500个token使用,仅导致2%的准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22256 2026-04-27 cs.SC cs.AI 70%

A Probabilistic Framework for Hierarchical Goal Recognition

基于概率的层次目标识别框架

Chenyuan Zhang, Katherine Ip, Hamid Rezatofighi, Buser Say, Mor Vered

机构 * Monash University(蒙纳士大学) The University of Melbourne(墨尔本大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于规划的概率框架,用于层次目标识别,结合层次任务网络结构与概率推理,提升目标识别性能。

Comments Accepted by KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22199 2026-04-27 cs.RO cs.AI 70%

An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments

基于大语言模型的闭环自主学习框架:面向机器人在开放环境中处理未覆盖任务

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息学院计算机学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的闭环自主学习框架,使机器人在开放环境中自主处理未覆盖任务,通过闭环学习减少对大语言模型的依赖,提升任务执行效率和本地知识库的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21375 2026-04-27 cs.CL cs.AI cs.SE 62%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00931 2026-04-27 cs.AI cs.HC cs.LG 62%

Explanation through Reward Model Reconciliation using POMDP Tree Search

通过POMDP树搜索实现奖励模型协调以进行解释

Benjamin D. Kraske, Anshu Saksena, Anna L. Buczak, Zachary N. Sunberg

机构 * Department of Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过POMDP树搜索协调算法与用户隐式奖励模型差异,以提升用户对AI系统的信任度。

Journal ref IEEE ICAA (2023), pg. 137-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22446 2026-04-27 cs.AI 57%

From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company

从技能到人才:将异构智能体组织成现实世界的企业

Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin Luo, Jun Wang

机构 * HUAWEI Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院) University Liverpool(利物浦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出OneManCompany框架,通过引入Talent市场和E²R树搜索,将多智能体系统提升至组织层面,实现动态招聘和自适应改进,提升任务完成效率。

Comments 33 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22428 2026-04-27 cs.AI 57%

CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease

CognitiveTwin: 用于预测阿尔茨海默病认知衰退的稳健多模态数字孪生

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial & Manufacturing Eng.(机械、工业与制造工程系) The University of Toledo(托莱多大学) Department of Industrial Eng. and Mngt. Systems(工业工程与管理系统系) University of Central Florida(中央佛罗里达大学) Department of Statistics and Data Science(统计与数据科学系) Department of Internal Medicine(内科医学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 CognitiveTwin通过融合多模态纵向数据预测个体认知轨迹,展现高准确性和公平性,对缺失数据具有鲁棒性,适用于临床试验和个性化医疗。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14287 2026-04-27 cs.LG 57%

Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents

链式记忆:轻量级记忆构建与动态演化用于大语言模型代理

Xiucheng Xu, Bingbing Xu, Xueyun Tian, Zihe Huang, Rongxin Chen, Yunfan Li, Huawei Shen

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CoM框架,通过轻量级记忆构建与动态演化机制,提升LLM代理的持久知识维护与长周期决策能力,实验显示在LongMemEval和LoCoMo基准上准确率提升7.5%-10.4%,计算开销降低2.7%-6.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03294 2026-04-27 cs.CR cs.AI 57%

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

AgentMark:用于代理的效用保持行为水印

Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huaqiao University(华侨大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。

Comments Accepted to ACL 2026 (Main, Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16853 2026-04-27 cs.CY cs.AI 57%

Agentic Inequality

代理不平等

Matthew Sharp, Omer Bilgin, Iason Gabriel, Lewis Hammond

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所) Access Partnership University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) Cooperative AI Foundation(协作人工智能基金会)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了AI代理在政治经济中的影响,定义了代理不平等的概念,并分析了其成因与治理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22715 2026-04-27 cs.RO 50%

ATRS: Adaptive Trajectory Re-splitting via a Shared Neural Policy for Parallel Optimization

ATRS: 一种通过共享神经策略实现的自适应轨迹重划分用于并行优化

Jiajun Yu, Guodong Liu, Li Wang, Pengxiang Zhou, Wentao Liu, Yin He, Chao Xu, Fei Gao, Yanjun Cao

机构 * IEEE Robotics and Automation Letters(IEEE机器人与自动化 letters)

专题命中 规划推理 :planning(abstract)

AI总结 ATRS通过共享深度强化学习策略改进并行ADMM循环,实现自适应调整,提升收敛速度和计算效率,适用于大规模离线全局规划和实时在线重规划。

Comments 8 pages, submitted to IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏