arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-30 至 2026-07-30 共收录 111 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 6 篇

2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 84%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26070 2026-07-30 cs.IR cs.AI 新提交 83%

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境

Guanming Xiong, Penghui Zhang

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27083 2026-07-30 cs.LG cs.AI 新提交 73%

Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

分数并非决策:大语言模型智能体工具获取的成本感知停止策略

Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26358 2026-07-30 cs.LG cs.AI cs.GT 新提交 62%

Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

可检测边界处的后训练:一种用于微调的博弈论方法

Keegan Harris, Brian W. Lee, Ian Waudby-Smith, Philip Amortila, Nika Haghtalab, Michael I. Jordan

机构 * University of California, Berkeley(加州大学伯克利分校) Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出博弈论框架解决RL微调中KL正则化系数设置问题,将均衡系数归约为KL正则化RL目标,在Qwen3-8B等模型实验中实现良好奖励-保留权衡,可用于审计开源模型API提供商。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26642 2026-07-30 cs.AI 新提交 57%

AlphaSchema: Exploring the Space of Trading Semantics for LLM-Based Alpha Mining

AlphaSchema:探索基于大语言模型(LLM)的阿尔法挖掘的交易语义空间

Jingyang Yi, Jian Yang, Yifei Jin, Yuqi Li, Jian Li

机构 * X-Tech Monash University(莫纳什大学) PandaAI(熊猫AI) IIIS, Tsinghua University(清华大学智能产业研究院(IIIS))

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 AlphaSchema构建并探索结构化交易语义空间,通过解耦探索与实施、结合代理模型平衡探索与利用,在中国股市挖掘出强预测与投资组合表现的因子池,且对LLM选择具鲁棒性。

Comments Initial Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26402 2026-07-30 cs.CY 新提交 50%

From Micro-Cognition to Self-Construction: A Four-Layer Integrative Review of Psychological Theories in HCI

从微观认知到自我建构:人机交互中心理学理论的四层整合综述

Xiaohe Bie, Bo Wang, Xinyu Long

专题命中 工具调用 :tool use(abstract)

AI总结 本文针对HCI从“工具使用”向“心智共生”的范式转变,提出四层整合心理学理论框架,明确其对生成式AI等场景的启示及核心挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 28 篇

2607.26977 2026-07-30 cs.CL 新提交 84%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27177 2026-07-30 cs.AI cs.HC cs.MA 新提交 81%

Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

面向临时团队中任务无关适应的伙伴能力估计

Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti

机构 * King’s College London(伦敦国王学院)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 该研究针对临时团队协作中伙伴能力隐藏与人类行为不可预测问题,提出CE-CM及CE-CM-Div方法,通过仿真采样与多样规划器rollout实现任务无关的能力估计,提升了团队协作的可行性与鲁棒性。

Comments 44 pages, 18 figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交 81%

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26533 2026-07-30 cs.LG cs.AI 新提交 81%

AgentGFM: A Graph Foundation Model with Node-Agent Information-Flow Control

AgentGFM:具备节点智能体信息流控制的图基础模型

Jingbo Cui, Jitao Zhao, Di Jin, Dongxiao He

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 针对现有图基础模型固定传播方案不适配节点多样结构模式的问题,提出AgentGFM,以节点为智能体通过预测-行动-观察-修正实现自适应信息流控制,实验验证其在多样图拓扑中的有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 79%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26588 2026-07-30 cs.AI 新提交 79%

Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models

Eco3S:基于智能体模型的复杂社会经济系统仿真

Shaopeng Wei, Yufei Cheng, Wenxi Sun, Yepeng Ding, Yu Zhao, Gang Kou

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 Eco3S是面向经济研究与政策分析的社会经济系统仿真框架,通过三种关键机制解决现有LLM-based ABM的挑战,经多场景实验验证其有效性、可扩展性与通用性。

Comments 18 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26181 2026-07-30 cs.AI 新提交 79%

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证

Xin Xin, Jincheng Lou, Junhui Li, Jinglin Yan, Panda Xiao, Di Wu, Haixiao Li, Weicong Lu, Weijian Fan, Xinyu Qu, Yuxiang Zhao, Min Yu, Zhixiong Di, Yibo Lin

机构 * Tencent(腾讯) School of Integrated Circuits, Peking University(北京大学集成电路学院) Southwest Jiaotong University(西南交通大学) Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。

Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26802 2026-07-30 cs.RO 新提交 78%

Risk-Aware Motion Planning with Learned Trajectory Primitives and Probabilistic Safety Assessment

结合学习轨迹基元与概率安全评估的风险感知运动规划

Marc Kaufeld, Dian Zhuang, Johannes Betz

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出由径向基函数网络指导的运动规划框架,结合RBFN候选轨迹生成、碰撞概率评估与轨迹优化,在城市驾驶场景中提升风险感知并减少车辆限制违规,确保安全与可解释性。

Comments 8 pages, submitted to IEEE ITSC 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26712 2026-07-30 cs.RO 新提交 78%

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

ActSWM:面向开放世界游戏长视界规划的动作敏感型世界模型

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

专题命中 规划决策 :planning(title,abstract)

AI总结 针对开放世界游戏长视界规划的上下文崩塌问题,提出动作敏感型世界模型ActSWM,通过约束隐式回滚保留动作依赖差异,提升了任务成功率与动作恢复能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26324 2026-07-30 eess.SY cs.SY 新提交 78%

Planning Waste-to-Energy-Coupled AI Data Centers Through Grade-Matched Cooling and Corridor Screening

通过品位匹配冷却与廊道筛选规划耦合垃圾发电的AI数据中心

Qi He, Chunyu Qu, Wenjie Zuo

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究针对AI数据中心发展受供电、互联及冷却制约的问题,开发耦合WtE的冷却廊道筛选框架,通过品位匹配提供冷却,经案例验证其可实现电力节省与规模适配,明确了WtE耦合冷却的可行性及约束条件。

Journal ref Thermo2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26217 2026-07-30 physics.soc-ph 新提交 78%

Mobility and Contact Networks Shape Epidemic Outcomes: A Large-Scale Agent-Based Modeling Study

流动与接触网络塑造疫情结果:一项大规模基于智能体的建模研究

Kuldip Singh Atwal, Emma Von Hoene, Hossein Amiri, Dieter Pfoser, Andreas Zufle, Taylor Anderson

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究通过含100万智能体的ABM,发现流动假设会显著改变接触网络结构与疫情轨迹,强调流动模型校准对疫情模拟及干预评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 74%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 规划决策 :agentic(title);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 74%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 70%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27106 2026-07-30 cs.LG 新提交 57%

Hierarchical Spatio-Temporal Transformer for Coherent Emergency Department Forecasting

用于连贯急诊科预测的分层时空Transformer

Filipa Lino, Bárbara Tavares, Carlos Santiago, Cláudia Soares, Manuel Marques

机构 * Institute for Systems and Robotics(系统与机器人研究所) LARSyS Instituto Superior Técnico(高等技术学院) NOVA School of Science and Technology(NOVA科学技术学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有急诊科预测方法忽略层级关联导致预测不连贯的问题,提出HierSTT分层时空Transformer框架,在葡萄牙ED数据集上实现多层面连贯预测,性能优于非分层基线及经典分层协调方法。

Comments Accepted at 11th Workshop on Data Science for Social Good - ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 57%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 57%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 规划决策 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26752 2026-07-30 cs.LG 新提交 57%

CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation

CalTwin:基于Fisher信息正则化的校准、分布偏移鲁棒医学世界模型研究

Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院) Gachon University(嘉泉大学) St. John’s University(圣约翰大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出CalTwin方法,结合Fisher信息偏移惩罚与置信度失配惩罚,应用于GRU医学世界模型,在PhysioNet脓毒症挑战赛上显著降低了分布外隐状态预测误差,同时改善了置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26345 2026-07-30 cs.LG cs.RO cs.SY eess.SY 新提交 57%

MetaKoopman: Bayesian Meta-Learning of Koopman Operators for Modeling Structured Dynamics under Distribution Shifts

MetaKoopman:用于分布偏移下结构化动力学建模的Koopman算子贝叶斯元学习框架

Mahmoud Selim, Sriharsha Bhat, Karl H. Johansson

机构 * TRATON(特拉顿集团) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 MetaKoopman作为贝叶斯元学习框架,通过学习Koopman算子先验实现分布偏移下非线性动力学的精准建模与预测,在卡车挂车系统的野外及模拟任务中表现优于现有方法,可用于鲁棒运动规划。

Journal ref Advances in Neural Information Processing Systems 38 (2025), 29551-29584

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26253 2026-07-30 cs.LG 新提交 57%

Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

早期判定与更优预算:面向计算高效RLVR的序贯自适应rollout分配

Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对RLVR中饱和组导致的rollout浪费问题,提出SARA方法,通过序贯分配规则减少rollout用量,在1.5B/3B模型上实现高效计算的同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26069 2026-07-30 cs.CY cs.AI cs.CR 新提交 57%

AI Security Priorities: A Field-Wide Agenda

AI安全优先级:全领域议程

Gil Gekker, Rachel Steratore, Everett Smith, Asher Brass-Gershovich, Varun Gandhi, Nicole Nichols, Vijay Bolina, Buck Shlegeris, Lisa Einstein, Dan Lahav, Omer Nevo, Sella Nevo

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文基于多领域专家访谈与研讨会,提出AI安全优先议程,涵盖四大主题,为AI安全领域的协调行动提供实践基础,服务从业者与新进入者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26219 2026-07-30 stat.ME cs.LG math.DG stat.AP 新提交 57%

Retrospective Orthogonal Design: Response-Surface Reconstruction from Observational Data

回顾性正交设计:基于观测数据的响应面重建

Lawrence Fulton, Christopher Fulton, Arvind Sharma, Aleksandar Tomic

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出回顾性正交设计(ROD),可从观测数据重建响应面,在多模拟场景及加权明瑟应用中表现优异,能生成与项顺序无关的平方和分配,为ROD规划提供样本量指导。

详情

展开后加载摘要…

URL PDF HTML 收藏