arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-25 至 2026-05-25 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2605.06840 2026-05-25 cs.AI 91%

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

从LLM推理轨迹中提取搜索树揭示短视规划

Sixing Chen, Ji-An Li, Saner Cakir, Sinan Akcali, Kayla Lee, Marcelo G. Mattar

机构 * Generality Inc.(Generality公司)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 通过从四子棋游戏推理轨迹中提取搜索树并拟合计算模型,发现LLM的规划是短视的,其决策主要由浅层节点驱动,而非深层搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 83%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23023 2026-05-25 cs.MA cs.HC 82%

How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

如何操控你的多智能体系统:人-大语言模型协作规划

Zeyu He, Hannah Kim, Dan Zhang, Estevam Hruschka

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文通过定义人-大语言模型协同规划的设计空间(模式、范围、层次),并实现原型AMBIPOM支持过程级监督,结合用户研究和基准测试揭示了混合工作流与权衡,为更透明、可控、有效的人机协同规划提供设计洞见。

Comments ACM Conference on AI and Agentic Systems (CAIS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23414 2026-05-25 cs.AI cs.LG 81%

When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

当计划正确执行却失败时:基于LLM的多智能体系统的认知校准

Zehao Wang, Shilong Jin, Zhao Cao, Lanjun Wang

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对基于LLM的多智能体系统中因认知误校准导致计划失败的问题,提出认知计划校准代理工作流(EPC-AW),通过信息一致性计划选择和一致性引导的认知状态细化,平均提升系统成功率9.75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23315 2026-05-25 cs.CL cs.AI 81%

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

没有理解的趋同:当语言模型在表示上一致但在推理上分歧时

Muhammad Usama, Dong Eui Chang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26383 2026-05-25 cs.CL cs.AI 73%

Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning

基于强化学习的高效可迁移智能知识图谱检索增强生成

Junhong Lin, Shicheng Liu, Jinyeop Song, Song Wang, Julian Shun, Yada Zhu

机构 * MIT CSAIL(麻省理工学院CSAIL) University of Virginia(弗吉尼亚大学) IBM Research(IBM研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出KG-R1框架,通过强化学习将单个智能体与知识图谱交互,统一检索、推理和生成过程,在KGQA基准上以更少生成token提升准确率,并展现跨图谱的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22905 2026-05-25 cs.AI cs.CL 62%

EVE-Agent: Evidence-Verifiable Self-Evolving Agents

EVE-Agent: 证据可验证的自我进化智能体

Yamato Arai, Yuma Ichikawa

机构 * Fujitsu Limited(富士通株式会社) The University of Tokyo(东京大学) RIKEN center for AIP(理化学研究所AIP研究中心)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出EVE-Agent,通过证据可验证机制确保自我进化智能体生成的训练实例包含可审计的证据片段,从而提升答案的可靠性和可解释性。

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23382 2026-05-25 cs.CL 57%

From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

从正确性到偏好:个性化智能体强化学习框架

Ranxu zhang, zeyang li, Jiacheng Huang, Rui Zhang, Xiaozhou Xu, sun zhe, Yanyong Zhang, Chao Wang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出PARPO框架,通过解耦通用任务奖励与个性化偏好奖励,结合偏好解耦奖励模型和偏好对齐技能演化图记忆,实现个性化智能体强化学习。

Comments 34 pages, 7 figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23204 2026-05-25 cs.AI 57%

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现

Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang Zhou, Daizong Liu, Pan Zhou, Yongchao Chen, Ran Xu, Lifang He, Qingsong Wen, Manling Li, Cong Lu, Shuai Li, Pengtao Xie, Yixuan Yuan, Rui Meng, Lei Xing, Lichao Sun, Caiming Xiong, Philip S. Yu, Jianfeng Gao

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Salesforce Research(Salesforce研究) Squirrel AI Learning(Squirrel AI学习) Northwestern University(西北大学) Independent(独立) Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Chinese University of Hong Kong(香港中文大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) Google Cloud AI Research(谷歌云AI研究) Recursive Superintelligence(递归超级智能) Microsoft Research(微软研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文综述了AI驱动的科研工作流自动化(AutoResearch)的发展,分析了从任务级AI到工作流级研究自动化的转变,并提出了五个评估维度(新颖性、有效性、影响力、可靠性和溯源),指出自主性受领域条件限制。

Comments 49 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23091 2026-05-25 cs.SE cs.AI cs.CR 57%

Security of LLM-generated Code: A Comparative Analysis

LLM生成代码的安全性:一项比较分析

Srivathsan G Morkonda, Mahmoud Selim, Hala Assal

机构 * Carleton University(卡尔顿大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究通过模拟开发者使用LLM生成代码的行为,评估了七种流行LLM生成代码的安全性,发现所有模型均生成包含漏洞的代码,且多数为严重或高危漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23058 2026-05-25 cs.SE cs.AI 57%

A measurement substrate for agentic Kubernetes operations: Methodology and a case study in retrieval-compounding falsification

面向代理化 Kubernetes 操作的测量基础:方法论与检索复合证伪案例研究

Joshua Odmark, Gideon Rubin, Deon van der Vyver

机构 * Independent(独立) LDE Cognyx

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一个闭环测量框架 agent-breakage,通过注入故障、评分响应并累积带标签元组,解决 Kubernetes 操作代理经验声明的不可证伪性问题,并在案例研究中发现检索复合能力被三个混杂因素(pgvector 索引错误、+19% 选择偏差、小样本夸大效应约 3 倍)所掩盖。

Comments 22 pages. Code at https://github.com/odmarkj/agent-breakage tag v0.1.0 (Apache 2.0). Source repo at https://github.com/odmarkj/agent-breakage-paper tag arxiv-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23040 2026-05-25 cs.LG 57%

Steered Generation via Gradient-Based Optimization on Sparse Query Features

基于稀疏查询特征的梯度优化引导生成

Sumanta Bhattacharyya, Pedram Rooshenas

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出基于稀疏自编码器和梯度优化的稀疏查询特征引导方法,实现对大型语言模型逻辑规划与风格细节的统一可解释控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04573 2026-05-25 cs.IR cs.CL 57%

Vector Retrieval with Similarity and Diversity: How Hard Is It?

向量检索中的相似性与多样性:难度有多大?

Hang Gao, Dong Deng, Yongfeng Zhang

机构 * Rutgers University(罗杰斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出向量检索相似性与多样性(VRSD)问题,证明其为NP完全问题,并设计无参数启发式算法,在多个数据集上优于MMR和k-DPP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22824 2026-05-25 cs.DC cs.AI 57%

An AI-Driven Framework for Energy-Efficient Environmental Monitoring in Smart Cities Using Edge Intelligence

基于边缘智能的智慧城市节能环境监测AI驱动框架

Yichen Liu, Imam Akintomiwa Akinlade, Xiaochong Jiang, Wenting Yang, Shiqi Yang

机构 * Independent Researcher(独立研究者) Harvard Business School(哈佛商学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出一种利用TinyML边缘设备和上下文感知自适应决策的AI驱动框架,通过效用函数动态激活传感器,减少能耗并延长寿命,在城市规模模拟中验证了其优于静态、周期和UCB自适应策略。

Comments 6 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23820 2026-05-25 cs.CY cs.SI 50%

Inferential Privacy Leakage in Anonymized Conversational AI Logs

匿名化对话式AI日志中的推断隐私泄露

S M Mehedi Zaman, Kiran Garimella

专题命中 规划推理 :reasoning(abstract)

AI总结 通过分析来自四个全球南方国家1000多名用户的ChatGPT对话历史,测量了显式披露和推断性隐私泄露,发现即使移除显式个人身份信息,大型语言模型仍能以高F1分数推断用户年龄、性别和国家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV 50%

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21880 2026-05-25 cs.RO 50%

Optimal Solutions for the Moving Target Vehicle Routing Problem with Obstacles via Lazy Branch and Price

带障碍物的移动目标车辆路径问题的最优解:懒惰分支定价法

Anoop Bhat, Geordan Gutow, Surya Singh, Zhongqiang Ren, Sivakumar Rathinam, Howie Choset

机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人学院) Mechanical and Aerospace Engineering at Michigan Technological University(密歇根理工大学机械与航空航天工程系) Robotics and AI Institute(机器人与人工智能研究所) UM-SJTU Joint Institute and Department of Automation at Shanghai Jiao Tong University(上海交通大学与美国密歇根大学联合研究所及自动化系) Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(德克萨斯农工大学机械工程系和计算机科学与工程系)

专题命中 规划推理 :planning(abstract)

AI总结 针对带障碍物的移动目标车辆路径问题(MT-VRP-O),提出懒惰分支定价法(Lazy BPRC),通过松弛连续性约束的延迟成本计算和凸集图搜索,实现最优解并显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 50%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 50%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 规划推理 :reasoning(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10743 2026-05-25 eess.SY cs.SY 50%

Scaling and Trade-offs in Multi-agent Autonomous Systems

多智能体自主系统中的规模与权衡

Abram H. Clark, Liraz Mudrik, Colton Kawamura, Nathan C. Redder, João P. Hespanha, Isaac Kaminer

专题命中 规划推理 :planning(abstract)

AI总结 通过大规模仿真和量纲分析,揭示自主无人机蜂群在三种典型场景中的标度律,量化智能体数量与平台参数间的权衡,并展示最优路径规划对结果标度律的改善。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00560 2026-05-25 cs.RO cs.CV 50%

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving

使用集成扩散估计端到端自动驾驶的不确定性

Florian Wintel, Sigmund H. Høeg, Gabriel Kiss, Frank Lindseth

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出EnDfuser系统,利用扩散模型作为轨迹规划器,通过集成扩散从单一感知帧生成候选轨迹分布,实现不确定性感知决策,在LAV基准上驾驶评分提升1.7%。

Comments Accepted at NLDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏