arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-30 至 2026-07-30 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 56 篇

2602.09472 2026-07-30 cs.RO cs.CV 版本更新 78%

LLM-Grounded Dynamic Task Planning with Hierarchical Temporal Logic for Human-Aware Multi-Robot Handover

基于分层时序逻辑的LLM引导动态任务规划用于人感知多机器人协作

Shuyuan Hu, Tao Lin, Kai Ye, Tianwei Zhang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于分层时序逻辑的神经符号框架,实现动态任务规划以提升多机器人协作的效率和鲁棒性。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00491 2026-07-30 cs.NI 版本更新 78%

Smart-TCP: An Agentic AI-based Autonomous and Adaptive TCP Protocol

Smart-TCP:基于智能体AI的自主自适应TCP协议

Yule Han, Kezhi Wang, Yizhe Zhao, Kun Yang

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 78%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 规划决策 :agent(title,abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新 76%

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :AI agent(title);分类 cs.AI、cs.SE

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 74%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 规划决策 :agentic(title);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 74%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20253 2026-07-30 cs.SD cs.AI eess.AS 版本更新 74%

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

推动全曲生成的前沿:分层自回归规划与流匹配渲染

Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu

机构 * Alibaba(阿里巴巴)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究提出统一歌曲生成框架,支持多项任务,由四个组件构成。通过特定编码、建模、匹配及模块实现歌曲生成,还研究多种后训练策略,实验表明该框架在评估中性能具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 73%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19321 2026-07-30 cs.AI cs.CR cs.LG 版本更新 73%

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

研究竞技场:评估自动化人工智能研发中的破坏行为与监控

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对自动化人工智能研发,用研究竞技场框架评估人工智能控制,通过四项长期任务及两类隐藏附带任务,评估前沿代理破坏与监控能力,发现训练数据中破坏行为难捕捉,发布框架用于评估自动化人工智能研发中的破坏与控制。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 70%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05682 2026-07-30 cs.AI 版本更新 70%

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

FirstResearch:用于大语言模型科学发现智能体的可审计问题形成

Yufeng Wang

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对大语言模型科学发现智能体首个研究问题难审计的问题,提出FirstResearch框架,核心是研究问题证书,记录多种要素使问题可检查。实验表明该框架在多个主题上优于基线,以证书为中心的核心组件作用显著,支持明确推导约束可提升问题可审计性。

Comments Withdraw for further improvement and work consolidation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13431 2026-07-30 cs.SD 版本更新 67%

Text2Score: Generating Sheet Music From Textual Prompts

Text2Score:从文本提示生成乐谱

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy, Francesca Ronchini, Emmanouil Benetos, Dorien Herremans, Simon Colton

机构 * Queen Mary University of London(伦敦女王学院) Singapore University of Technology and Design(新加坡科技设计大学) Politecnico di Milano(米兰理工大学) EmotionWave(情绪波)

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。

Comments 9 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20656 2026-07-30 cs.LG cs.AI 版本更新 62%

Adaptive Multi-Horizon Reinforcement Learning

自适应多时间尺度强化学习

Manoosh Samiei, Doina Precup, Paul Masset

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在复杂环境中强化学习的决策问题,提出自适应多时间尺度方法,能自适应选择和组合时间范围,无需手动调折扣因子,实验证明该方法可提高参数效率及增强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 62%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27106 2026-07-30 cs.LG 新提交 57%

Hierarchical Spatio-Temporal Transformer for Coherent Emergency Department Forecasting

用于连贯急诊科预测的分层时空Transformer

Filipa Lino, Bárbara Tavares, Carlos Santiago, Cláudia Soares, Manuel Marques

机构 * Institute for Systems and Robotics(系统与机器人研究所) LARSyS Instituto Superior Técnico(高等技术学院) NOVA School of Science and Technology(NOVA科学技术学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有急诊科预测方法忽略层级关联导致预测不连贯的问题,提出HierSTT分层时空Transformer框架,在葡萄牙ED数据集上实现多层面连贯预测,性能优于非分层基线及经典分层协调方法。

Comments Accepted at 11th Workshop on Data Science for Social Good - ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 57%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 57%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 规划决策 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26752 2026-07-30 cs.LG 新提交 57%

CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation

CalTwin:基于Fisher信息正则化的校准、分布偏移鲁棒医学世界模型研究

Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院) Gachon University(嘉泉大学) St. John’s University(圣约翰大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出CalTwin方法,结合Fisher信息偏移惩罚与置信度失配惩罚,应用于GRU医学世界模型,在PhysioNet脓毒症挑战赛上显著降低了分布外隐状态预测误差,同时改善了置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26345 2026-07-30 cs.LG cs.RO cs.SY eess.SY 新提交 57%

MetaKoopman: Bayesian Meta-Learning of Koopman Operators for Modeling Structured Dynamics under Distribution Shifts

MetaKoopman:用于分布偏移下结构化动力学建模的Koopman算子贝叶斯元学习框架

Mahmoud Selim, Sriharsha Bhat, Karl H. Johansson

机构 * TRATON(特拉顿集团) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 MetaKoopman作为贝叶斯元学习框架,通过学习Koopman算子先验实现分布偏移下非线性动力学的精准建模与预测,在卡车挂车系统的野外及模拟任务中表现优于现有方法,可用于鲁棒运动规划。

Journal ref Advances in Neural Information Processing Systems 38 (2025), 29551-29584

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26253 2026-07-30 cs.LG 新提交 57%

Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

早期判定与更优预算:面向计算高效RLVR的序贯自适应rollout分配

Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对RLVR中饱和组导致的rollout浪费问题,提出SARA方法,通过序贯分配规则减少rollout用量,在1.5B/3B模型上实现高效计算的同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26069 2026-07-30 cs.CY cs.AI cs.CR 新提交 57%

AI Security Priorities: A Field-Wide Agenda

AI安全优先级:全领域议程

Gil Gekker, Rachel Steratore, Everett Smith, Asher Brass-Gershovich, Varun Gandhi, Nicole Nichols, Vijay Bolina, Buck Shlegeris, Lisa Einstein, Dan Lahav, Omer Nevo, Sella Nevo

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文基于多领域专家访谈与研讨会,提出AI安全优先议程,涵盖四大主题,为AI安全领域的协调行动提供实践基础,服务从业者与新进入者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26219 2026-07-30 stat.ME cs.LG math.DG stat.AP 新提交 57%

Retrospective Orthogonal Design: Response-Surface Reconstruction from Observational Data

回顾性正交设计:基于观测数据的响应面重建

Lawrence Fulton, Christopher Fulton, Arvind Sharma, Aleksandar Tomic

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出回顾性正交设计(ROD),可从观测数据重建响应面,在多模拟场景及加权明瑟应用中表现优异,能生成与项顺序无关的平方和分配,为ROD规划提供样本量指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25337 2026-07-30 cs.CL cs.RO 版本更新 57%

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

时间距离联合嵌入预测架构:用于潜在世界模型预测控制的计划感知表示学习

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究提出时间距离联合嵌入预测架构(TD-JEPA),保留LeWM编码器-预测器主干,从无奖励轨迹挖掘有向时间成本。该方法缩小JEPA世界模型规划器训练-规划差距,在多个环境中表现优于LeWM及其他基线,通过挖掘成本提升成功率和分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25132 2026-07-30 cs.LG 版本更新 57%

Interpretable GOHR Agents via Sparse Autoencoders

通过稀疏自编码器实现可解释的隐藏规则游戏智能体

Shiwei Tan, Yusong Zhao, Weiyi Qin, Wentian Wang, Jacob Feldman, Lazaros K. Gallos, Paul B. Kantor, Vladimir Menkov, Hao Wang

机构 * Rutgers University(罗格斯大学) The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究针对隐藏规则游戏中Transformer智能体的可解释性,通过在其决策令牌嵌入上训练稀疏自编码器,在双规则任务中恢复结构,单个维度对应可解释策略,为解释智能体行为提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18600 2026-07-30 cs.LG 版本更新 57%

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

MapTab: MLLMs 是否已准备好在异构图中进行多标准路线规划?

Ziqiao Shang, Ling-Yue Ge, Zian Xu, Zi-Jian Cheng, Shi-Yu Tian, Zhenyu Huang, Wenbo Fu, Weiming Wu, Yang Chen, Xiangwen Zhang, Yulan Hu, Bin Liu, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出MapTab基准测试,用于评估多模态大语言模型在多标准路线规划任务中的综合推理能力,发现当前模型在多模态推理方面存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27100 2026-07-30 cs.CY 新提交 50%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 规划决策 :planning(abstract)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26809 2026-07-30 cs.RO 新提交 50%

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

熟能生巧:从零人类演示中引导与整合机器人能力

Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

专题命中 规划决策 :agent(abstract)

AI总结 本研究提出HERO自改进层级具身智能体,通过整合启发式推理等技术,实现机器人从零人类演示自主演进操作能力,减少数据收集人工干预并提升多样化任务操作稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26409 2026-07-30 cs.NI 新提交 50%

Can We Trust AI in 6G? Verifiable and Auditable AI-Driven Trustworthy Wireless Networks

我们能信任6G中的AI吗?可验证且可审计的AI驱动可信无线网络

Genze Jiang, Yizhou Huang, Kezhi Wang

专题命中 规划决策 :agent(abstract)

AI总结 针对6G中AI在无线网络应用的信任问题,提出基于3GPP规范的机械审计方法与原生审计网络架构,支持AI功能的部署前认证和运行时审计,为AI驱动的可信无线网络提供解决方案。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏