arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-03 至 2026-07-03 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2607.00508 2026-07-03 cs.IR 新提交 88%

When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning Problems

当RAG遇见查询规划:用于解决探索性推理问题的逻辑查询树

Ganlin Xu, Linghao Zhang, Zhitao Yin, Hongda Xi, Chen Yang, Jiaqing Liang, Weijia Lu, Sihang Jiang, Yanghua Xiao, Deqing Yang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 针对检索增强生成在探索性推理问题中的检索噪声和错误累积问题,提出PlanRAG框架,将自然语言建模为逻辑查询树,通过动态规划和代价模型优化查询树,实现高效并行处理,在WikiWeb-ERP数据集上优于现有方法。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28589 2026-07-03 cs.AI 版本更新 83%

Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

从推理中寻找真理:一种用于引导LLM轨迹的动态表示编辑框架

Tianlong Wang, Yuhang Wang, Weibin Liao, Xin Gao, Xinyu Ma, Yang Lin, Yasha Wang, Liantao Ma

机构 * ByteDance Inc.(字节跳动公司) Huawei Technologies Co., Ltd(华为技术有限公司) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出DynaSteer动态表示编辑框架,通过模式聚类和Fisher-LDA提取纯净真理,并基于前瞻熵选择性引导轨迹,提升LLM推理真实性。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01942 2026-07-03 cs.AI 新提交 79%

Atomic Task Graph: A Unified Framework for Agentic Planning and Execution

原子任务图:智能体规划与执行的统一框架

Yue Zhang, Sihan Chen, Ziwen Huang, Hanyun Cui, Kangye Ji, Zhi Wang

机构 * South China University of Technology(华南理工大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出原子任务图(ATG)框架,通过显式图结构暴露子任务依赖、支持并行执行和局部错误修复,在三个交互基准上使用7B-8B模型显著提升成功率和执行效率。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01440 2026-07-03 cs.CL 新提交 79%

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

FaithMed: 训练大语言模型进行忠实于证据的医学推理

Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University School of Medicine(斯坦福大学医学院) Xlue

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出FaithMed框架,通过过程级奖励和优势分组强化学习,监督LLM在医学推理中忠实评估和应用检索证据,在7个基准上平均提升9%。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 79%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01631 2026-07-03 cs.RO 新提交 78%

Path planning for unmanned naval surface vehicles

无人水面航行器的路径规划

Daniel G. Schwartz

机构 * Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对无人水面航行器(USV)的固定和移动障碍物避碰问题,提出结合全局与局部路径规划器的新方法,全局规划器融合三种算法,局部规划器基于障碍物运动方向决策,仿真验证了有效性。

Journal ref AI Insights, Article 939, 1(1), 2025, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 78%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 73%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 73%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02811 2026-07-03 cs.NI cs.SY eess.SY 版本更新 67%

Tool Use as Action: Towards Agentic Control in Mobile Core Networks

工具使用作为行动:迈向移动核心网络中的智能体控制

Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi, Xueli An

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。

Comments Accepted for presentation at IEEE PIMRC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 67%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 62%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 62%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02387 2026-07-03 cs.IR cs.LG 新提交 57%

Bringing Agentic Search to Earth Observation Data Discovery

将智能搜索引入地球观测数据发现

Minghan Yu, Youran Sun, Chugang Yi, Yixin Wen, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一个基于智能搜索的系统,利用知识图谱和大型语言模型,从自然语言查询中返回匹配的地球科学数据集和工具,显著提升检索性能。

Comments 19 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01919 2026-07-03 cs.AI cs.CR 新提交 57%

ElephantAgent: Contextual State Continuity in Agentic Systems

ElephantAgent: 智能体系统中的上下文状态连续性

Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对工具和记忆投毒攻击,提出ElephantAgent协议,通过强制上下文状态连续性防御状态篡改,并利用历史可追溯性实现事后审计与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01639 2026-07-03 cs.AI 新提交 57%

Autonomous discovery of traffic laws with AI traffic scientists

AI交通科学家自主发现交通规律

Xingyuan Dai, Yue Liu, Xiaoyan Gong, Qinghai Miao, Junyou Shang, Yutong Wang, Chao Guo, Yonglin Tian, Yizhang Chai, Chao Xiang, Yisheng Lv, Fei-Yue Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) China Telecom Research Institute(中国电信研究院) Macau Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学澳门系统工程研究所) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出TrafficSci智能体系统,通过迭代工作流自主发现交通规律,在四个案例中重现已知规律并发现城市驾驶行为中的内在时间记忆尺度。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01387 2026-07-03 cs.IR cs.LG 新提交 57%

Bi-NAS: Towards Effective and Personalized Explanation for Recommender Systems via Bi-Level Neural Architecture Search

Bi-NAS:通过双层神经架构搜索实现推荐系统的有效和个性化解释

Longfeng Wu, Yao Zhou, Tong Zeng, Zhimin Peng, Bhanu Pratap Singh Rawat, Lecheng Zheng, Giovanni Seni, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Google(谷歌) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Bi-NAS框架,通过双层神经架构搜索优化推荐解释,结合大语言模型生成个性化理由,提升准确性和解释效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01252 2026-07-03 cs.CY cs.AI 新提交 57%

How Indian Dermatologists are Utilizing Artificial Intelligence for Clinical Practice and Workflow Management: A Nationwide Survey with a Special Focus on atopic dermatitis

印度皮肤科医生如何将人工智能用于临床实践和工作流程管理:一项以特应性皮炎为重点的全国性调查

Dipayan Sengupta, Saumya Panda, Sandipan Dhar, Dipankar De, Deepika Pandhi, Narayanan B

机构 * Charnock Hospital, Kolkata, India(科钦医院,加尔各答,印度) Department of Dermatology, Jagannath Gupta Institute of Medical Sciences and Hospital, Kolkata, India(皮肤科部,贾亚纳塔·古普塔医学科学与医院,加尔各答,印度) Department of Pediatric Dermatology, Institute of Child Health, Kolkata-700017, India(儿科皮肤科部,儿童健康研究所,加尔各答-700017,印度) Department of Dermatology, Venereology, and Leprology, Postgraduate Institute of Medical Education and Research, Chandigarh-160012, India(皮肤科、性病学和麻风病学部,医学教育与研究研究生院,昌迪加尔-160012,印度) Department of Dermatology and STD, University College of Medical Sciences & GTBH, University of Delhi, Delhi-110095, India(皮肤科和性传播疾病部,医学科学大学及GTBH,德里大学,德里-110095,印度) Department of DVL, Sree Balaji Medical College and Hospital, Chennai, India(DVL部,Sree Balaji医学院和医院,钦奈,印度)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 通过全国性调查,发现印度皮肤科医生主要使用通用大语言模型处理认知和行政任务,而临床需求集中于慢性病管理和特应性皮炎工作流支持,提示临床监督下的工作流工具可能比独立诊断应用更有用。

Comments 28 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01071 2026-07-03 cs.IR cs.AI 新提交 57%

MemSyco-Bench: Benchmarking Sycophancy in Agent Memory

MemSyco-Bench:智能体记忆中的谄媚基准测试

Zhishang Xiang, Zerui Chen, Yunbo Tang, Zhimin Wei, Ruqin Ning, Yujie Lin, Qinggang Zhang, Jinsong Su

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MemSyco-Bench基准,评估LLM智能体因记忆引发的谄媚问题,涵盖拒绝记忆、尊重适用范围、解决冲突、跟踪更新和个性化使用五个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 57%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交 50%

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01518 2026-07-03 cs.CR cs.RO 新提交 50%

Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems

基于LVLM的机器人系统中的过度思考触发慢速攻击

Qiang Han, Jie Wu, Bo Chen

专题命中 规划推理 :reasoning(abstract)

AI总结 研究利用LVLM的过度思考行为,通过嵌入场景文本触发推理延迟,提出三阶段框架发现可迁移触发词,实验显示最高6.96倍延迟放大。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01382 2026-07-03 cs.RO 新提交 50%

CommonRoad-Game: A Human-in-the-Loop Simulation Framework for Autonomous Driving

CommonRoad-Game:面向自动驾驶的人机协同仿真框架

Yunfei Bi, Youran Wang

专题命中 规划推理 :planning(abstract)

AI总结 提出CommonRoad-Game轻量级人机协同仿真框架,通过多线程同步机制实现确定性交互,支持运动规划器测试与人类驾驶行为分析。

Comments 15 pages, 18 figures, 2 tables. Source code: https://github.com/Yunfei-Bi8/CommonRoad-Game

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 50%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22048 2026-07-03 cs.SE 版本更新 50%

Dynamic analysis enhances issue resolution

动态分析增强问题解决

Mingwei Liu, Zihao Wang, Zhenxi Chen, Zheng Pei, Yanlin Wang, Zibin Zheng

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出DAIRA框架,通过动态分析提升代码缺陷修复效率,实现高准确率和低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22872 2026-07-03 cs.CV 版本更新 50%

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 规划推理 :reasoning(abstract)

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏