arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-22 至 2026-07-22 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2607.18548 2026-07-22 cs.AI cs.MA cs.SY eess.SY 新提交 87%

Engineering Trustworthy Agentic AI for Critical Systems

为关键系统设计可靠的智能体人工智能

Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat, Michael Mandulak, Jaewon Kim, Eman Hammad

机构 * Texas A&M University(德克萨斯A&M大学) Innovations in Systems Trust and Resilience (iSTAR) Laboratory(系统信任与弹性创新(iSTAR)实验室) Texas A&M Institute of Data Science - Security, Privacy and Resilience for Trusted AI (SPARTA) Thematic Lab.(德克萨斯A&M大学数据科学研究所 - 可信人工智能的安全、隐私与弹性(SPARTA)主题实验室) Texas A&M Global Cyber Research Institute (GCRI)(德克萨斯A&M大学全球网络研究所)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);workflow(abstract)

AI总结 研究针对关键工程领域智能体人工智能,将可靠性作为首要工程属性,采用围绕五个维度的可靠性模型及保证工作流程,综述相关架构、机制等,经多领域检验,指出其可靠性是单一问题并勾勒跨域保证框架路径。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 85%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 工具调用 :agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 83%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18816 2026-07-22 cs.DB cs.AI 新提交 83%

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails:迈向代理任务的信任与重用

Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

机构 * New York University(纽约大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 针对大语言模型驱动代理轨迹掩盖数据依赖限制开发人员理解等问题,提出AgentTrails系统,将原始轨迹转换为结构化溯源图,支持执行比较、模式提取等,能揭示隐藏依赖、对齐不同执行并展现重复工具使用模式。

Comments 4 pages, 4 figures. Short paper accepted at the Workshop on Systems for Data-centric Agents with Human-in-the-loop (DASHSys 2026), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05462 2026-07-22 cs.CR cs.AI 版本更新 83%

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment

评估两用生物学环境中的校准拒绝和安全有用性

Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

机构 * American Wetware(美国湿科公司) LatchBio

专题命中 工具调用 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18308 2026-07-22 cs.LG cs.AI 新提交 81%

Agentic Calibration of Grey-Box Simulation Models: An LLM-Driven Alternative

灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法

David Gómez-Guillén, Mireia Diaz, Josep Lluis Arcos, Jesús Cerquides

机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) Autonomous University of Barcelona(巴塞罗那自治大学) Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。

Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 78%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 工具调用 :tool use(title);tool-use(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17384 2026-07-22 cs.AI cs.LG cs.LO cs.MA 版本更新 73%

Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift

量化思维多样性:加权大语言模型集成提升的预测定律

Junade Ali

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究量化思维多样性在大语言模型集成中提升效果的预测定律,通过原理推导得出计算提升的启发式方法及相关指标,经多基准测试验证,该方法能有效预测集成性能,且准确性调整后的指标表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07055 2026-07-22 cs.AI 版本更新 70%

Dr. Zero: Self-Evolving Search Agents without Training Data

零博士:无需训练数据的自我进化搜索智能体

Zhenrui Yue, Kartikeya Upasani, Xianjun Yang, Suyu Ge, Shaoliang Nie, Yuning Mao, Zhe Liu, Dong Wang

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究在高质量数据难获取时智能体自我进化问题,提出零博士框架,通过自我进化反馈循环和HRPO方法,使搜索智能体无需训练数据自我进化,在问答基准测试中表现出色,证明可仅通过自我进化实现强大智能搜索和推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18476 2026-07-22 cs.CL cs.AI cs.LG 新提交 67%

Structured Output Collapses Answer Diversity Across 44 Language Models

结构化输出会削弱44种语言模型的答案多样性

Tapan Parikh

机构 * Cornell Tech(康奈尔理工学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。

Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18433 2026-07-22 cs.LG cs.AI nlin.AO 新提交 62%

Intelligence from Learnable Novelty

可学习新奇性中的智能

Yanbo Zhang, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学威斯生物启发工程研究所)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究表明可学习新奇性产生智能不同投影,基于廉价可微储层计算机给出闭式估计器。此估计器无监督可恢复复杂度分类,作目标能推动神经细胞自动机发展,作奖励可提升强化学习智能体表现,让智能相关研究有了共同定量基础。

Comments 24 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07473 2026-07-22 cs.CR cs.AI 版本更新 57%

Give Them an Inch and They Will Take a Mile:Understanding and Measuring Caller Identity Confusion in MCP-Based AI Systems

给予一寸,他们将索取一英里:理解和测量基于MCP的AI系统中的调用者身份混淆

Yuhang Huang, Boyang Ma, Biwei Yan, Xuelong Dai, Yechao Zhang, Minghui Xu, Kaidi Xu, Yue Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克Quantin 研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Shandong University(山东省大学) City University of Hong Kong(香港城市大学)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 研究发现基于MCP的AI系统因缺乏调用者身份验证和细粒度授权而存在安全风险,需改进认证机制以减少攻击面。

Comments Withdrawal due to some flaws in experimental methodology and unresolved ethical issues in data collection. We need to redesign the experiments and obtain proper ethical clearance before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18362 2026-07-22 cs.RO 新提交 50%

FARO: Feasibility-Aware Robot Motion Optimization

FARO:可行性感知机器人运动优化

Michal Ciebielski, Shafeef Omar, Aaron Johnson, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Advanced Study, Technical University of Munich(慕尼黑工业大学高级研究所) Carnegie Mellon University(卡内基梅隆大学) SIEMENS AG(西门子公司) Huawei-TUM joint laboratory(华为-慕尼黑工业大学联合实验室)

专题命中 工具调用 :planning(abstract)

AI总结 针对机器人在未知场景快速规划新行为的挑战,提出嵌套运动动力学框架,结合可行性引导树搜索和大语言模型采样策略,能改善搜索过程,生成的轨迹可用强化学习控制器跟踪,质量高可用于实际运动操作场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18404 2026-07-22 quant-ph 新提交 50%

Reducing entanglement with a Hamiltonian derived Clifford transformation

用哈密顿量导出的克利福德变换减少纠缠

James Brown, Erika Lloyd, Alexandre Fleury, Tarini S Hardikar, Kenny Heitritter

专题命中 工具调用 :tool use(abstract)

AI总结 研究利用Q-Cliff算法生成化学系统基态的高效近似,该算法精度在MP2和CISD之间,计算量为\(O(N^6)\)。通过DMRG计算减少量子比特纠缠,改进算法生成低深度且CNOT高效的电路,为经典和量子算法提供新工具。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏