arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-01 至 2026-05-01 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2601.11908 2026-05-01 cs.CL 88%

PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning

PPA-Plan: 长上下文LLM推理中的前瞻性坑洞避免规划

Byeongjin Kim, Gyuwan Kim, Seo Yeon Park

机构 * Hanyang University(翰阳大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 针对长上下文推理中计划生成不可靠的问题,PPA-Plan通过前瞻性策略预防逻辑错误,提升计划执行效果。

Comments Accepted to the Main Conference of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27472 2026-05-01 cs.AI cs.LG cs.RO 84%

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS:通过对比表示实现的原始推理与任务系统

Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24329 2026-05-01 cs.CL 83%

World model inspired sarcasm reasoning with large language model agents

受世界模型启发的大型语言模型代理 sarcasm 推理

Keito Inoshita, Shinnosuke Mizuno

机构 * Faculty of Business and Commerce, Kansai University(大阪 kansai 大学 商业与文理学院) Faculty of Medicine, The University of Tokyo(东京大学 医学部)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出 WM-SAR 模型,通过分解语义不一致性和意图进行 sarcasm 推理,实现高可解释性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26988 2026-05-01 cs.RO 82%

Robot Planning and Situation Handling with Active Perception

具备主动感知的机器人规划与情境处理

Austine Oloo, Zainab Altaweel, Yohei Hayamizu, Peiqi Liu, Yan Ding, Saeid Amiri, Hao Yang, Andy Kaminski, Chad Esselink, Chris Paxton, Xiaohan Zhang, Shiqi Zhang

机构 * SUNY Binghamton(纽约州立大学布法罗分校) CMU(卡内基梅隆大学) Ford Research(福特研究) Agility Robotics(敏捷机器人)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出VAP-TAMP框架,通过主动感知和情境评估提升机器人在动态环境中执行任务的能力,结合场景图进行任务与运动规划,通过仿真和移动机械臂平台验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20969 2026-05-01 cs.AI 79%

The Epistemic Planning Domain Definition Language: Official Guideline

知识规划领域定义语言:官方指南

Alessandro Burigana, Francesco Fabiano

机构 * Free University of Bozen-Bolzano(博尔扎诺自由大学) University of Oxford(牛津大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出EPDDL语言,通过抽象事件模型统一描述知识规划任务,解决现有规划器碎片化问题,提升可比性与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02535 2026-05-01 cs.RO 78%

AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning

AID: 从扩散模型中获取代理意图用于多代理信息路径规划

Jeric Lew, Yuhong Cao, Derek Ming Siang Tan, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出AID框架,利用扩散模型生成非自回归长时轨迹,通过行为克隆和强化学习优化,提升多代理信息路径规划效率与信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 77%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27351 2026-05-01 cs.AI cs.CL cs.LG 75%

Heterogeneous Scientific Foundation Model Collaboration

异质科学基础模型协作

Zihao Li, Jiaru Zou, Feihao Fang, Xuying Ning, Mengting Ai, Tianxin Wei, Sirui Chen, Xiyuan Yang, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Eywa框架,通过将语言模型与领域特定基础模型结合,提升科学领域多模态任务的推理能力,实验显示其在结构化数据任务中表现更优。

Comments Preprint. 57 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27840 2026-05-01 cs.LG cs.AI 73%

CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting

CastFlow:学习用于时间序列预测的角色专用代理工作流

Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27167 2026-05-01 cs.GT cs.AI cs.LG 73%

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制

Paraskevas V. Lekeas, Giorgos Stamatopoulos

机构 * DreamWorks Animation(梦工厂动画) University of Crete(希腊克里特大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 62%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27414 2026-05-01 cs.CV cs.CR cs.LG 57%

Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Mert D. Pese

机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。

Comments 9 pages, 2 figures. Accepted at SAE WCX 2026

Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27410 2026-05-01 cs.IR cs.CL 57%

From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking

从无序到有序:LLM引导的属性图用于实体搜索与排序

Yilun Zhu, Nikhita Vedula, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结合LLM驱动的属性图构建与图感知LLM排序的两阶段方法,通过结构化属性提取和图构建提升电商中实体搜索的精度与效率,实验显示在零样本场景下平均精度提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27354 2026-05-01 cs.AI 57%

CoAX: Cognitive-Oriented Attribution eXplanation User Model of Human Understanding of AI Explanations

CoAX:面向认知的归因解释用户模型:人类对AI解释的理解

Louth Bin Rawshan, Zhuoyu Wang, Brian Y. Lim

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过认知建模分析不同XAI方法在结构化数据推理中的策略,发现模型能更准确拟合人类决策,为改进AI解释的可理解性提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27311 2026-05-01 cs.SE cs.AI 57%

Pragmos: A Process Agentic Modeling System

Pragmos:一个过程代理建模系统

Pedro-Aarón Hernández-Ávalos, Luciano García-Bañuelos

机构 * Tecnologico de Monterrey(墨西哥技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Pragmos系统,通过人机协作的交互流程,利用LLM与领域专家共同构建可解释的过程模型,解决复杂过程建模问题。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27267 2026-05-01 cs.CR cs.AI cs.RO 57%

From Prompt to Physical Actuation: Holistic Threat Modeling of LLM-Enabled Robotic Systems

从提示到物理执行:LLM赋能机器人系统的整体威胁建模

Neha Nagaraja, Hayretdin Bahsi, Carlo R. da Cunha

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。

Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27221 2026-05-01 cs.AI 57%

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

Web2BigTable: 一种用于互联网级信息搜索与提取的双层多智能体大语言模型系统

Yuxuan Huang, Yihang Chen, Zhiyuan He, Yuxiang Chen, Ka Yiu Lee, Huichi Zhou, Weilin Luo, Meng Fang, Jun Wang

机构 * University of Liverpool(利物浦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Web2BigTable通过双层架构实现互联网级信息搜索与提取,结合任务分解与并行执行,提升深度推理和结构化聚合能力,达到新的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20933 2026-05-01 cs.CV cs.AI 57%

Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation

焦点调制与双向特征融合网络用于医学图像分割

Moin Safdar, Shahzaib Iqbal, Mubeen Ghafoor, Tariq M. Khan, Imran Razzak, Thantrira Porntaveetus, Hamid Alinejad-Rokny

机构 * Department of Computing, Abasyn University Islamabad Campus (AUIC)(阿巴斯扬大学伊斯兰堡校区计算机系) School of Computer Science and Informatics, De Montfort University(德蒙福特大学计算机科学与信息学学院) Naif Arab University for Security Sciences(纳夫阿拉伯安全科学大学) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University(朱拉隆功大学精准医学与数字健康卓越中心) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学悉尼分校生物医学工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出FM-BFF-Net,结合卷积与Transformer,通过焦点调制注意力机制和双向特征融合模块提升医学图像分割的边界精度与鲁棒性,实验表明其在多项指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08332 2026-05-01 cs.AI 57%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 50%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏