arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 136 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2607.27235 2026-07-31 cs.AI cs.CV 新提交 83%

RadHarmony: Radiological Data Handling in the Era of Agentic AI

RadHarmony:智能体AI时代的放射数据处理方案

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 RadHarmony是一款开源Python库,用于统一处理异构放射数据集,引入AI智能体技能简化数据集整合,可预训练视觉Transformer基线并提供相关代码与模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 80%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28459 2026-07-31 cs.AI cs.LO 新提交 70%

LeanCSP: A Framework for Certifying Constraint Reformulation and Solving in Lean

LeanCSP:Lean中用于验证约束重构与求解的框架

Pablo Manrique, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 工具调用 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 本研究在Lean定理证明器中提出LeanCSP框架,可验证约束重构的语义正确性与求解器结果,其已验证对称性破缺能大幅减少求解搜索工作量,且Lean内认证成本可承受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28618 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 67%

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

AskChem:面向化学文献综合的以主张为中心的基础设施

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

机构 * New York University(纽约大学) Matterstack, Inc.(Matterstack公司)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27726 2026-07-31 cs.AI cs.CL cs.LG 新提交 67%

Baikal: Structured Search for Deep Research over Data Lakes

Baikal:面向数据湖深度研究的结构化搜索框架

Dhruv Agarwal, Rishitha Guttapalle Mohan, Aarti Kumari, Ashi Sinha, Athulya Anil, Kavitha Srinivas, Horst Samulowitz, Andrew McCallum

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Baikal是面向数据湖深度研究的结构化搜索框架,通过聚类证据为语义区域并自适应搜索,在HybridQA和TAT-QA数据湖上较基线方法提升报告得分28%和36%,展现了结构化语义探索的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27258 2026-07-31 q-bio.GN cs.LG 新提交 57%

PlantBGC: Transformer for Plant BGC Discovery via Label-Free Domain Adaptation and Weak Supervision

PlantBGC:基于无标签领域自适应与弱监督的植物生物合成基因簇发现Transformer

Yuhan Zhao, Nidhi Grover, Zhishan Guo, Ning Sui

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 该研究针对植物BGC标签稀缺问题,提出PlantBGC模型,通过无标签领域自适应与弱监督实现植物BGC的精准发现,提升了已知BGC的恢复率并缩短了基因座长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28050 2026-07-31 cs.AI 新提交 57%

IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

IndustryForge-27B:面向工业CAD的领域增强多模态基础模型

Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究构建基于Qwen3.5-VL-27B的IndustryForge-27B多模态基础模型,整合6个工业CAD子语料库训练,在CAD基准测试中性能远超基础模型与GPT-5.4,可作为工业智能体的通用基础。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27686 2026-07-31 cs.AI 新提交 57%

Evaluating and Pricing Advertisements in AI-Generated Responses

评估和定价AI生成响应中的广告

John L. Turner-Smith, Zimeng Huang, Yuhan Fu, Yihang Zhang, Tonghan Wang

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 32 篇

2607.28595 2026-07-31 cs.CV 新提交 85%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 规划决策 :agentic(title,abstract);tool use(abstract);tool-use(abstract)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27435 2026-07-31 cs.DB 新提交 83%

AgenticER: the next frontier in Entity Resolution

AgenticER:实体解析的下一个前沿领域

George Papadakis, Panos Korovesis, Manolis Koubarakis, Themis Palpanas

专题命中 规划决策 :agentic(summary_cn,abstract);autonomous agent(abstract)

AI总结 针对现有实体解析被动范式无法适配异构流数据场景的问题,提出Agentic ER新范式,将其建模为自主智能体的序列决策过程,构建参考架构并明确研究挑战,开拓数据管理与智能体交叉的新研究方向。

Comments Vision paper submitted to VLDB, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 83%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27562 2026-07-31 cs.AI 新提交 83%

DeepResearch Agent System

DeepResearch 智能体系统

Yong Huang, Yulu Huang, for the team Collaboration

机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27636 2026-07-31 cs.AI cs.RO cs.SE 新提交 81%

HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution

HALO:基于局部义务的异构准入机制,用于安全智能体执行

Taewoo Park, Kyeonghyun Yoo, Kiseok Kim, Seunghyun Yoo, Hwangnam Kim

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 HALO是一种保障智能体执行安全的运行时协议,可保留有效组件、检查动作有效性并替换被阻止动作,在多组实验中均展现出优于整体响应策略的性能。

Comments 16 pages, 2 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27443 2026-07-31 cs.AI 新提交 79%

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

利用轨迹图实现智能体大语言模型系统的预执行错误诊断

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Arizona State University(亚利桑那州立大学) NEC Laboratories America(美国 NEC 实验室) Singapore Management University(新加坡管理大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出Trajectory Graph Copilot框架,以Graph Debugger为核心,通过预执行错误诊断提升LLM智能体完成长周期任务的能力,在多基准测试中平均提升14.69%通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 79%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27287 2026-07-31 cs.AI cs.LO 新提交 79%

PIE-APT: A Unified Framework for Temporal Planning and Contradiction Hunting via Incremental Direct-Derivation Abduction

PIE-APT:基于增量直接推导溯因的时态规划与矛盾检测统一框架

Amir Hossein Sharafi, Alireza Shahbazi

机构 * Najm(纳吉姆) Tafresh University(塔夫雷什大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出统一框架PIE-APT,含PIE-Abducer与PIE-APT模块,通过增量直接推导溯因解决动态知识图谱规划与矛盾检测问题,在OWL基准上优于经典规划器与MHS基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27564 2026-07-31 cs.CV 新提交 79%

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

专题命中 规划决策 :agentic(title,abstract)

AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。

Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28098 2026-07-31 cs.AI cs.CL 新提交 79%

SciDataSailor: Deep Scientific Data Exploring

SciDataSailor:深度科学数据探索

Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

专题命中 规划决策 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对科学数据仓库交互难题,提出SciDataSailor框架,以带特定机制的MCTS实现轨迹合成,构建了微调模型与含千余任务的评估基准,推动LLM智能体的科学数据探索能力。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28171 2026-07-31 math.OC 新提交 78%

The optimality of an (s, S) hiring policy on a workforce planning problem with fixed recruitment costs and binomial turnover

带有固定招聘成本和二项式人员流动的劳动力规划问题中(s, S)招聘策略的最优性

Zhen Chen, Roberto Rossi, Belen Martin-Barragan, S. Armagan Tarim

专题命中 规划决策 :planning(title,abstract)

AI总结 针对含固定招聘成本和二项式人员流动的有限期劳动力规划问题,研究人员通过建立离散凸性与K-凸性证明最优(s, S)招聘策略,并提出分段近似方法生成MILP公式求解,该方法计算快且最优性差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28367 2026-07-31 cs.AI 新提交 70%

How Benchmarks Mis-Score Computer-Use Agents

基准测试如何错误评估计算机使用智能体

Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

机构 * Georgia Institute of Technology(佐治亚理工学院) North Carolina State University(北卡罗来纳州立大学) Lenovo AI Technology Center(联想人工智能技术中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Marquette University(马凯特大学) Fudan University(复旦大学)

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究指出计算机使用智能体的基准测试分数存在可靠性问题,审计150条轨迹发现15.3%的“失败”判定错误,进而推导了CUA评估各阶段的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 70%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 70%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27283 2026-07-31 cs.LG cs.AI cs.SE 新提交 67%

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

评估残差:长时序评估在匹配短任务性能之外的补充作用

Chao Peng, Zhiheng Lyu, Peijie Dong, Hande Dong, Qiang Lin

机构 * Tencent(腾讯)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28488 2026-07-31 cs.AI cs.LG 新提交 62%

SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination

SCOPE:基于耦合策略的端到端协调供应链运营

Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen

机构 * Dingdong(叮咚)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 62%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交 62%

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28408 2026-07-31 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 62%

On-Policy and Off-Policy Learning for Large Action Spaces

面向大动作空间的在线策略与离线策略学习

Imad Aouali

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。

Comments PhD Thesis, 241 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28451 2026-07-31 cs.RO cs.AI 新提交 57%

Machines that know they are aging: a framework for hardware-aware autonomous intelligence

感知自身老化的机器:面向硬件感知自主智能的框架

Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar

机构 * Newcastle University Singapore(新加坡纽卡斯尔大学) Qingdao University of Technology(青岛理工大学) Amrita Vishwa Vidyapeetham(阿姆里塔维什瓦维迪亚皮塔姆大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对自主系统硬件老化引发的任务失败问题,提出将硬件健康融入决策的 AAAI 框架,通过三大支柱实现系统自适应,提升弹性并延长寿命,适用于太空、医疗等关键环境。

Comments 1 figure, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28410 2026-07-31 cs.CE cs.CL q-fin.TR 新提交 57%

Can Large Language Models Execute Parent Orders?

大型语言模型能否执行父订单?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28109 2026-07-31 cs.AI 新提交 57%

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

超越改写:书籍级组织提升训练中合成教科书数据的质量

Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。

Comments 31 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏