arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-24 至 2026-07-24 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2603.01437 2026-07-24 cs.AI 版本更新 91%

Post-Hoc Reasoning in Chain of Thought: Decoding and Steering Pre-Committed Answers

在生成链式推理前解码答案:来自预CoT探测器和激活引导的证据

Kyle Cox, Darius Kianersi, Adrià Garriga-Alonso

专题命中 规划推理 :CoT(title_cn,summary_cn);reasoning(title,abstract);分类 cs.AI

AI总结 研究发现,模型在生成链式推理前已确定答案,通过激活引导实验揭示了预CoT过程中的因果关系及潜在错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19178 2026-07-24 cs.RO cs.AI 版本更新 83%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23340 2026-07-24 cs.AI cs.CL cs.HC 81%

Planning Ahead with RSA: Efficient Signalling in Dynamic Environments by Projecting User Awareness across Future Timesteps

基于RSA的前瞻性规划:通过跨未来时间步投影用户意识实现动态环境中的高效信号传递

Anwesha Das, John Duff, Jörg Hoffmann, Vera Demberg

机构 * Saarland University(萨尔兰大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RSA的前瞻性规划方法,通过跨未来时间步投影用户意识,优化动态环境中的人机协作效率。

Comments 11 pages, 3 figures

Journal ref Proc. of the 25th Int. Conf. on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 79%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08825 2026-07-24 cs.CL cs.IR 79%

Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs

图上搜索:面向知识图谱的大语言模型推理的迭代式知情导航

Jia Ao Sun, Hao Yu, Fabrizio Gotti, Fengran Mo, Yihong Wu, Yuchen Hui, Zhan Su, Lingfeng Xiao, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Digital Media, CBC(数字媒体,CBC) Halmstad University College(哈姆斯塔德大学学院) University of Waterloo(滑铁卢大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Search-on-Graph方法,通过让大语言模型自身基于知识图谱结构和完整推理历史选择关系路径,遵循观察-思考-导航范式,在六个KGQA基准上超越现有方法,无需任务特定微调。

Comments Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13621 2026-07-24 cs.LO cs.AI 79%

Decentralized Planning Using Probabilistic Hyperproperties

基于概率超属性的去中心化规划

Francesco Pontiggia, Filip Macák, Roman Andriushchenko, Michele Chiari, Milan Češka

机构 * Brno University of Technology(布拉格技术大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出利用概率超属性和MDP进行去中心化规划,扩展了规划技术的规范能力,并建立了与特定Dec-MDPs规划的联系。

Comments 11 pages, 1 figure, 2 tables. Accepted at AAMAS 2025: the 24th International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 74%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21125 2026-07-24 cs.CV 新提交 67%

Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents

因果智能体图像恢复:用于自适应图像恢复智能体的自进化因果记忆

Hu Gao, Yulong Chen, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 针对图像恢复智能体知识存储局限,提出Causal-AgentIR框架,通过构建结构化因果记忆图及协作系统,支持智能体进行因果推理,依质量变化和反馈调整恢复经验,有效提升图像恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交 67%

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 62%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新 62%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21503 2026-07-24 cs.AI cs.IR 新提交 57%

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

智能体上下文管理:将智能体内存和成本视为生命周期和架构问题来解决

Gaurav Dadhich

机构 * Maximem

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究生产型人工智能智能体因无法管理推理上下文而失败的问题,提出智能体上下文管理(ACM),分解为五个原语,经经济分析和参考实现验证,在特定配置下取得较好结果,还指出了现有基准未涵盖的维度及上下文前沿。

Comments 23 pages, 6 figures, 4 tables. Evaluation harness and study data: github.com/maximem-ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21217 2026-07-24 cs.AI 新提交 57%

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

ICAE-Bench:将编码智能体评估为交互式项目构建者

Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao, Shibo Hong, David Lo, Lin Qiu, Xuezhi Cao, Jiyuan He, Yixin Cao

机构 * Meituan(美团)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21156 2026-07-24 cs.AI cs.MA 新提交 57%

SafeStep: AI-powered Travel Assistance for Elderly People with Frailty or Dementia

SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助

Elderly People with Frailty or Dementia Azul Debenedetti, David Gamez, Franco Such, Nik Kairinos

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 57%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 57%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 57%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05385 2026-07-24 cs.IR cs.AI 版本更新 57%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 57%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21357 2026-07-24 cs.SE 新提交 50%

Toward Federated Cognitive Digital Twins over the Edge-to-Cloud Continuum

迈向边缘到云连续体上的联邦认知数字孪生

Alessandra Somma, Alessio Bucaioni

专题命中 规划推理 :reasoning(abstract)

AI总结 本文针对数字孪生在分布式环境中的问题,提出联邦认知数字孪生架构,结合联邦与认知,通过本地和全局孪生体在边缘到云连续体上分布智能,集成分布式自主性与认知推理,提升复杂分布式CPS的可扩展性、响应能力和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21058 2026-07-24 cs.RO 新提交 50%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19321 2026-07-24 cs.NE 版本更新 50%

Learning to Sample in Variable Neighborhood Search Algorithm for Urban Cable Routing Optimization

城市电缆路由优化的可变邻域搜索算法中的采样学习

Wei Liu, Rui Wang, Chenhui Lin, Kaiwen Li, Wenhua Li, Tao Zhang

专题命中 规划推理 :planning(abstract)

AI总结 针对城市电缆路由优化这一大规模双层组合优化问题,提出学习辅助可变邻域搜索(L-VNS)算法,该算法集成四个关键组件,经实验验证其相比其他方法有优越性,能有效降低建设成本,且具有有效性和鲁棒性。

Comments Accepted by Swarm and Evolutionary Computation

Journal ref Swarm and Evolutionary Computation; Volume 106, June 2026, 102432

详情

展开后加载摘要…

URL PDF HTML 收藏