arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 23 篇

2503.03556 2026-08-07 cs.CV cs.RO 版本更新 82%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 81%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05832 2026-08-07 cs.CL 新提交 79%

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

利用层级推理和话语级目标奖励增强大型语言模型的社交智能

Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.CL

AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18519 2026-08-07 cs.RO cs.AI 版本更新 79%

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture

如您所愿:利用LLM在精准农业中进行形式化验证的任务规划

Marcos Abel Zuzuárregui, Stefano Carpin

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。

Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26352 2026-08-07 cs.CL 版本更新 79%

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

RICE-PO:将检索交互转化为推理智能体的信用信号

Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Sunjae Kwon, Hamed Zamani, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Texas Tech University(得克萨斯科技大学) University of Connecticut(康涅狄格大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06113 2026-08-07 cs.SE 新提交 78%

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

DCAS:解耦CLI智能体脚手架以在脚手架间内化规划能力

Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan

专题命中 规划推理 :planning(title,abstract)

AI总结 本文针对CLI智能体微调后跨脚手架性能下降问题,提出DCAS框架,通过解耦脚手架与后端实现跨脚手架评估,微调规划感知轨迹后模型在非训练脚手架下性能一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 78%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 规划推理 :planning(title,abstract)

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 78%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05806 2026-08-07 cs.CL cs.AI 新提交 73%

Hierarchical Latent Prediction for Language Models

语言模型的分层隐式预测

Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05792 2026-08-07 cs.AI 新提交 70%

When Agentic AI Meets Integrated Sensing and Communication

当智能体AI遇上集成感知与通信

Kai Li, Conggai Li, Sarah Ali Siddiqui, Syed Sohail Ahmed, Xin Yuan, Shenghong Li, Wei Ni

机构 * University of Luxembourg(卢森堡大学) CSIRO(联邦科学与工业研究组织) Qassim University(卡西姆大学) Edith Cowan University(伊迪丝·考恩大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。

Comments 35 pages, 132 references, 10 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05171 2026-08-07 cs.CY cs.AI 新提交 70%

Beyond Information Retrieval: Generative AI as an Epistemic Arbiter to Enhance Collaborative Problem-Solving

超越信息检索:生成式AI作为认知仲裁者以增强协作问题解决

Jiaxin Zou, Xiaoming Zhai, Chunlei Gao

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过201名五年级学生的六周准实验,探究生成式AI对协作问题解决的影响,发现其会改变学生行为模式,可作为认知仲裁者促进建设性分歧解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06227 2026-08-07 cs.NI cs.AI cs.IT cs.SY eess.SY math.IT 新提交 70%

From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks

从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生

Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 70%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 62%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05375 2026-08-07 cs.AI cs.LG cs.MA 新提交 62%

DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data

DoctorAgents:用于针对小型临床时序数据迭代优化自动机器学习流水线的智能体框架

Ruilin Wang, Bo-Hong Wang, Elizabeth Kourbatski, Jun Bai, Hegang Chen, Ziyang Song, Gilles Boire, Marie Hudson, Yue Li

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) CIUSSSE-CHUS(谢布鲁克大学医学中心综合大学健康和社会服务中心) University of Sherbrooke(谢布鲁克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DoctorAgents是一种用于小型临床时序数据的智能体框架,通过LLM智能体以推理驱动方式迭代优化AutoML流水线,在多种临床任务上性能优于现有AutoML基线且可解释性更强。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05326 2026-08-07 cs.LG cs.CL 新提交 62%

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

QEvict:面向注意力漂移鲁棒长上下文解码的可恢复量化键值缓存驱逐机制

Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya, Abhishek Gupta, Sandeep Kumar, Manoj Kumar

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 QEvict是一种三层KV缓存管理方案,通过可恢复量化驱逐解决长上下文解码中的注意力漂移问题,在固定内存预算下提升了长上下文任务的信息保留效果。

Comments 24 pages, 6 figures. The first four authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16839 2026-08-07 cs.LG cs.AI 版本更新 62%

Trajectory-guided discharge stratification for heart failure using short-context electronic health record sequence modeling

利用序列建模预测心力衰竭患者一年临床不稳定性和死亡率

Falk Dippel, Yinan Yu, Annika Rosengren, Martin Lindgren, Christina E. Lundberg, Erik Aerts, Martin Adiels, Helen Sjöland

机构 * Sahlgrenska University Hospital(斯德哥尔摩大学医院) Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和乌普萨拉大学) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,斯德哥尔摩学院,乌普萨拉大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,斯德哥尔摩大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,乌普萨拉大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学系,医学院,乌普萨拉大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过序列模型预测心力衰竭患者一年内的临床不稳定性和死亡风险,发现Llama模型在有限数据下表现优异,为出院后风险分层提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05588 2026-08-07 cs.RO cs.AI cs.MA 新提交 57%

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations

用于带旋转的鲁棒终身多智能体路径规划的搜索辅助联合智能体-环境强化学习

He Jiang, Jingtian Yan, Yulun Zhang, Yimin Tang, Tanishq Duhan, Rishi Veerapaneni, Guillaume Sartoretti, Jiaoyang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对带旋转约束的鲁棒终身多智能体路径规划难题,提出搜索辅助联合强化学习方法,通过结合Causal PIBT与联合优化智能体-环境策略,在高密度地图及混合现实仓库环境中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05447 2026-08-07 cs.CL 新提交 57%

Example-Guided Prompting for Document-Level Text Simplification

示例引导提示用于文档级文本简化

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber

机构 * SCE(SCE(以色列SCE学院)) ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05367 2026-08-07 cs.AI q-fin.GN 新提交 57%

Counterfactual Analysis via Large Language Models

基于大语言模型的反事实分析

Zonghao Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究用GPT-3.5模型开展在线借贷反事实分析,经提示工程优化后其预测性能接近梯度提升回归,验证了LLMs用于反事实分析的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05212 2026-08-07 cs.AI 新提交 57%

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

SearchAuditor:长程搜索智能体失败的审计与归因

Zhixiang Liang, Yifei Liu, Yidan Huang, Haozhe Zhao, Beichen Huang, Jiaqi Wang, Nan Duan, Qiong Cao

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对长程搜索智能体的失败诊断难题,构建SearchAuditBench基准,提出多视角审计框架SearchAuditor,其端到端通过率达32.3%,优于基线模型,可助力智能体从错误中恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05207 2026-08-07 cs.LG 新提交 57%

When Do Corrective Features Help? An Agent for Corrective Feature Discovery on Black-Box Forecasters

纠正特征何时有用?面向黑盒预测器的纠正特征发现智能体

Fangxin Wang, Ziyi Zhang, Diyi Zhuang, Langzhou He, Shiyu Wang, Baichuan Mo, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Texas A&M University(德克萨斯农工大学) Massachusetts Institute of Technology(麻省理工学院) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CRAFTER智能体,挖掘黑盒冻结预测器的残差以生成纠正特征,在6个数据集和6个主干上优于现有系统,使改进翻倍、误差降27%,可归因特征来源。

Comments 23 pages, 14 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08892 2026-08-07 cs.GT cs.MA 版本更新 50%

Offline Nash Solvers Meet Online Tree Search in Multi-Agent Games on Graphs

离线纳什求解器与在线树搜索在图上多智能体博弈中的结合

Mukesh Kumar, Yue Guan, Panagiotis Tsiotras

专题命中 规划推理 :planning(abstract)

AI总结 多智能体追逃博弈计算纳什均衡策略有挑战,本文提出原始引导树搜索框架PGTS,结合离线精确纳什均衡计算与在线树搜索,实验表明其显著优于现有基线,在多种图拓扑上对对手保持稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏