arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6674 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1921 篇

2606.10532 2026-06-10 cs.AI 新提交 57%

ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning

ActiveMem: 用于长程LLM推理的分布式主动记忆

Yunhan Jiang, Wenbin Duan, Shasha Guo, Liang Pang, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出ActiveMem框架,将记忆从核心推理中解耦,通过分布式主动记忆系统积累语义要点,在长程推理任务中实现高精度和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10489 2026-06-10 cs.AI 新提交 57%

A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner

PlanGPT的补充研究:使用定义性能指标评估并与规划器比较

Youssef Abdelkader, Humbert Fiorino, Damien Pellier

机构 * Univ. Grenoble Alpes - LIG(格勒诺布尔阿尔卑斯大学 - 信息学实验室(LIG))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文对大型语言模型PlanGPT进行补充实验,使用规划成本和生成时间两个指标评估其性能,并与传统规划器比较,发现PlanGPT并不优于贪心搜索策略。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10359 2026-06-10 cs.AI 新提交 57%

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain: 面向供应链韧性的LLM驱动世界模型中的认知基础

Jia Luo

机构 * School of Foreign Languages, Huazhong University of Science

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 提出ReflectiChain框架,通过生成式供应链世界模型和双环学习分离认知不确定性与偶然不确定性,在半导体基准上提升推理一致性33.0%,并在对抗冲击下保持82.3%可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10153 2026-06-10 cs.LG 新提交 57%

Compositional Generative Modeling from Decentralized Data

来自分散数据的组合生成建模

Mashrur M. Morshed, Vishnu Naresh Boddeti

机构 * Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA(计算机科学与工程系,密歇根州立大学,东兰辛,MI,美国)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出去中心化组合流匹配(DCFM)框架,通过结构约束实现分散数据中生成因子的组合,无需交换原始数据,在条件图像生成、机器人空间规划和医学属性共现建模中显著优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09662 2026-06-09 cs.CL 新提交 57%

When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following

当内置思考既有帮助又有害:指令遵循中的约束级错误转移

Sai Adith Senthil Kumar

机构 * George Mason University(乔治梅森大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究大型推理模型(LRM)的思考模式对指令遵循的影响,发现思考会改变错误模式而非统一降低性能,其中规划类约束改善而精确类约束恶化,并通过分析思考轨迹和激活修补揭示了机制。

Comments 16 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09617 2026-06-09 math.OC cs.AI cs.CY cs.SY eess.SY 新提交 57%

Powering the Future of AI: Navigating the Trade-offs for Europe's Energy Transition and Net-Zero Goals

赋能AI未来:应对欧洲能源转型与净零目标的权衡

Mohammad Hemmati, Gbemi Oluleye, Vassilis M. Charitopoulos

机构 * Department of Chemical Engineering, Sargent Centre for Process Systems Engineering, University College London (UCL)(化学工程系、过程系统工程中心、伦敦大学学院(UCL)) Centre for Environmental Policy, Imperial College London(环境政策中心、伦敦帝国理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 通过21种AI增长情景下的空间优化模型,量化AI对欧洲电力需求、容量、排放和运行的影响,发现AI到2050年可能增加73-723 TWh需求,导致2030-2050年累计排放超调67-181 MtCO2,且AI基础设施选址将更依赖稳定电源和系统灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09556 2026-06-09 cs.AI 新提交 57%

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究

Yinan Wang

机构 * Noah AI Research(Noah AI研究)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 通过分层消融实验,发现药物资产估值中AI科学家的决策上限由专有证据集决定,而非仅依赖推理框架;加入专有数据后决策质量显著提升。

Comments Preprint; 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09028 2026-06-09 cs.CV cs.AI cs.RO 新提交 57%

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models

ATM:用于诊断和改进潜在世界模型的动作一致性转移矩阵

Jiaheng Chen

机构 * School of Software, Northeastern University(东北大学软件学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出ATM矩阵,通过轻量级探针比较真实与预测潜在转移中的动作信息,无需模拟器即可诊断世界模型质量,并引入AITS利用动作可识别性作为训练信号提升下游规划。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08896 2026-06-09 cs.AI 新提交 57%

FAME: Forecastability-Aware Mixture of Experts for Heterogeneous Time Series Forecasting

FAME: 面向异构时间序列预测的可预测性感知专家混合模型

Qianyang Li, Xingjun Zhang, Shaoxun Wang, Tao Peng, Jia Wei

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Ministry of Education Key Laboratory of Machine Intelligence and Advanced Computing(教育部机器智能与先进计算重点实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对大规模异构时间序列预测中单一模型性能不足的问题,提出可预测性感知的稀疏专家混合框架FAME,通过多维可预测性指纹和成本感知路由,在工业数据集上实现12.4%的MSE降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08791 2026-06-09 econ.EM cs.AI q-fin.PM q-fin.RM q-fin.ST 新提交 57%

Evaluating AI Investment Strategies

评估AI投资策略

Irene Aldridge

机构 * ablemarkets.com(ablemarkets公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究通过可观测输入输出审计黑箱算法决策者,提出动态策略累积遗憾的精确分解,扩展至多期随机动态规划,并给出偏差修正与轨迹估计器。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08775 2026-06-09 cs.RO cs.AI 新提交 57%

Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks

统一对象中心世界模型与扩散策略:多阶段机器人任务的分层框架

Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) AMI Labs(AMI实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出WorldDP分层框架,结合高层世界模型进行运行时子目标优化和低层扩散策略执行,利用对象中心表示解耦环境实体,实现多阶段机器人操作任务的有效规划与执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08310 2026-06-09 cs.AI cs.MA 新提交 57%

To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation

核弹还是和平:大语言模型在高风险决策模拟中的(缺失的)伦理推理与行动

John Chen, Sihan Cheng, Can Gurkan, H M Abdul Fattah

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 研究LLM在复杂游戏《文明V》中自发升级核授权的现象,通过三种提示干预发现伦理推理未能可靠消除升级,识别出三种失败路径,强调需在复杂决策上下文中测试伦理推理的自发性和行为有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08234 2026-06-09 cs.AI 新提交 57%

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

SciTrace: 面向科学发现代理的轨迹感知安全推理

Tanush Swaminathan, Runmin Jiang, Letian Zhang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute(艾伦研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08020 2026-06-09 quant-ph cs.AI 新提交 57%

Repair Before Veto, When Repair Is Hidden: Quantum-Accessible Features for Repair-Augmented Constraint Learning

在修复被隐藏时先修复再否决:面向修复增强约束学习的量子可访问特征

Yifan Wang

机构 * Yifan Wang(王一帆)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出Q-RACL框架,在硬约束决策中引入修复优先于否决的语义,通过量子特征访问解决离散对数隐藏的修复可行性推理问题,显著降低假否决率。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07831 2026-06-09 cs.SE 新提交 57%

SLRMentor: An LLM-Based Tool Supporting Learning of SLR in Software Engineering

SLRMentor:一种基于LLM的软件工程系统文献综述学习支持工具

Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalahes, Italo Santos

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 提出SLRMentor对话助手,利用LLM支持软件工程中系统文献综述的学习与规划,通过引导搜索字符串构建和纳入排除标准推理,降低新手入门门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07808 2026-06-09 cs.AI 新提交 57%

Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models

指令层级失效之处:诊断与修复推理语言模型的故障

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA(英伟达)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出白盒诊断框架,将指令层级失效定位为指令识别、冲突解决和响应实现三个环节,并设计两种免训练自监控机制,将违规率降低81-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07544 2026-06-09 cs.CY cs.AI cs.HC 新提交 57%

AI-Integrated Learning Management System for Middle School: A Longitudinal Study of Learning Outcomes Through High School and Beyond

面向中学的AI集成学习管理系统:一项从高中到毕业后的学习成果纵向研究

Misan Paul Etchie, Taiwo Olutosin

机构 * National Agricultural University(国立农业大学)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 提出一种隐私优先的AI集成学习管理系统,通过政策约束的AI辅助(形成性反馈、间隔复习、适应性练习)和教师仪表盘,在中学日常课程中提供即时支持,并设计纵向研究评估其对高中及毕业后学习轨迹的长期影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07393 2026-06-08 cs.SE 新提交 57%

Is US Defense Acquisition Ready to Acquire AI-Enabled Capabilities? Assessing the DoD Software Acquisition Pathway Through a Scenario-Based Policy Analysis

美国国防采办是否准备好采办人工智能赋能能力?通过基于场景的政策分析评估国防部软件采办路径

Daniel Lugo, James C. Davis

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 通过基于场景的政策分析,评估美国国防部软件采办路径是否足以应对AI采办的独特需求,发现核心指南中存在可操作性不足,建议增设AI支持子路径并完善工件。

Comments Submitted to ACM Digital Government: Research and Practice Journal on April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07367 2026-06-08 cs.LG 新提交 57%

Self-evolving LLM agents with in-distribution Optimization

自演化分布内优化的LLM智能体

Yudi Zhang, Meng Fang, Zhenfang Chen, Mykola Pechenizkiy

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出Q-Evolve框架,通过分布内强化学习统一过程奖励标注与策略学习,利用加权隐式Q学习稳定贝尔曼更新,实现智能体自演化,在AlfWorld等任务上优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07366 2026-06-08 cs.CV cs.LG cs.RO 新提交 57%

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos

Dash2Sim: 来自野外行车记录仪视频的闭环驾驶仿真

Anurag Ghosh, Francesco Pittaluga, Khiem Vuong, Angela Chen, Juan Alvarez-Padilla, Manmohan Chandraker, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) MIT(麻省理工学院) UC San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Dash2Sim框架,将单目行车记录仪视频转化为度量级、地理参考的4D驾驶日志,用于闭环仿真,并构建ROADWork4D基准数据集,验证了施工区场景对规划器的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06972 2026-06-08 cs.AI 新提交 57%

Accounting for Context: Shaping Moral Credences for Value Alignment

考虑情境:塑造道德信念以实现价值对齐

Jazon Szabo, Sanjay Modgil

机构 * University of Oxford(牛津大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06721 2026-06-08 cs.RO cs.AI 新提交 57%

SCOUT: Semantic scene COverage via Uncertainty-guided Traversal

SCOUT: 基于不确定性引导遍历的语义场景覆盖

Junyu Mao, Sara Ayoubi, Vishnu D. Sharma, Ilija Hadžić, Matthew Andrews

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国) Nokia Bell Labs, Murray Hill, NJ, USA(诺基亚贝尔实验室,美国,新泽西州 Murray Hill) Imperial College London(帝国理工学院伦敦分校) Locus Robotics(Locus机器人技术公司)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 提出SCOUT框架,通过不确定性引导的遍历规划与概率场景图构建的闭环,使机器人主动探索并逐步理解环境,实现语义场景完整性作为操作目标。

Comments 2026 ICRA Workshop on Uncertainty in Open World Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06505 2026-06-08 cs.CG cs.AI cs.CV math.DG 新提交 57%

A Geometric Gaussian Mixture Representation of Plane Curves

平面曲线的几何高斯混合表示

Ali Darijani, Benedikt Stratmann, Jürgen Beyerer

机构 * Fraunhofer IOSB(弗劳恩霍夫研究所) KIT, IES(卡尔斯鲁厄理工学院,信息工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种用户定义的平面曲线概率多边形表示,通过为每个线段赋予法向不确定性参数,构造高斯混合模型,保留局部几何与法向不确定性,适用于多种曲线类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10740 2026-06-16 cs.AI cs.CL cs.LG 新提交 56%

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

当思维链更清楚时:多轮推理模型的失败模式

Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

专题命中 规划决策 :分类 cs.AI、cs.CL、cs.LG;agentic(comments)

AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。

Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09937 2026-06-10 cs.LG cs.AI cs.CL 新提交 56%

RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

RKSC:面向多步LLM推理的感知推理的KV缓存共享与自信提前退出

Anirudh Sekar

机构 * Anirudh Sekar(安尼鲁德·塞卡)

专题命中 规划决策 :分类 cs.AI、cs.CL、cs.LG;agentic(comments)

AI总结 提出RKSC框架,通过注意力相似性KV共享、置信门控提前退出和推理选择性块缓存管理,消除多分支LLM推理中的结构冗余,实现平均3.008倍加速,错误率仅0.37%。

Comments Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 50%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 规划决策 :planning(abstract)

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17970 2026-08-19 cs.CY 新提交 50%

Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence

何去何从?人工智能时代的科学发现

Petr O. Jedlicka

专题命中 规划决策 :planning(abstract)

AI总结 本文梳理AI在科学发现中的作用,提出AI系统类型学,概述多学科近期成果,指出其存在的限制与风险,引发人机认知劳动分工的思考。

Comments To be published in Theory of Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17613 2026-08-19 cs.IR cs.SI 新提交 50%

Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs

生成即排序:基于统一语义-协同ID的端到端生成式 slate 推荐

Yang Hu, Jiayi Guo, Jingui Ma, Ning Li, Jiangling Qin, Yanming Li, Yang Deng, Xiaoshuang Chen, Kaiqiao Zhan

专题命中 规划决策 :planning(abstract)

AI总结 研究针对现有生成式 slate 推荐的缺陷,提出 OGR 框架,引入 TUSID 与 SPA 方法,在离线实验和快手在线测试中均取得显著性能提升。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17432 2026-08-19 cs.RO 新提交 50%

UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex

UniReflex:基于快慢反射的预训练生成策略的即插即用力控制

Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School(深圳国际研究生院) Nanyang Technological University(南洋理工大学) X Square Robot(X Square机器人公司) Xspark AI(Xspark人工智能公司)

专题命中 规划决策 :planning(abstract)

AI总结 UniReflex是一种即插即用框架,通过快速反射网络和解耦的可变阻抗控制,为冻结的生成策略提升接触稳定性与成功率,同时保留位置精度且延迟大幅降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17416 2026-08-19 cs.RO 新提交 50%

Bi-Layer Ant Colony Optimization for Multi-Robot Task Allocation and Routing in Delivery Applications

面向配送应用的双层蚁群优化算法(Bi-Layer Ant Colony Optimization),用于多机器人任务分配与路径规划

Le Na Nguyen, Thanh Long Nguyen, Thanh Thao Ton Nu, Quan Le, Manh Duong Phung

机构 * Fulbright University Vietnam(富布赖特越南大学) College of Engineering and Computer Science, VinUniversity(vinuniversity工程与计算机科学学院)

专题命中 规划决策 :planning(abstract)

AI总结 针对配送应用的多机器人任务分配与路径规划问题,提出双层蚁群优化算法,实验表明其在总行驶距离和完成时间上优于MILP、PSO等基线方法,性能更优。

Comments 6 pages. Accepted at 2026 11th International Conference on Intelligent Information Technology (ICIIT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏