arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-15 至 2026-07-15 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 12 篇

2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 工具调用 :agent(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11520 2026-07-15 cs.CL cs.AI cs.LG 版本更新 85%

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

ISE:一种基于执行的多轮操作系统代理轨迹合成方法

Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

机构 * University of Electronic Science and Technology of China(电子科技大学) SenseTime Research(商汤科技研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ISE三阶段范式,通过结构化意图构建、角色锁定用户模拟和真实执行环境,生成多轮代理轨迹,微调后显著提升代理工具使用性能。

Comments 13 pages, 6 figures. Dataset and code: https://github.com/Valiere01/ISE-Trace

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12650 2026-07-15 cs.LG cs.AI cs.CY cs.SE 新提交 82%

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

基于证据的可验证智能推理:通过工具验证内核证明消除经验推理中语言模型幻觉的途径

Junyu Ren

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究旨在消除语言模型经验推理中的幻觉,提出基于Lean 4的EG-VAR工具调用架构,通过工具验证公理等生成可验证声明,经实验在数值推理等测试中表现良好,定位为高风险经验声明的技术治理接口,可审计相关条件并转化错误为审计目标。

Comments Accepted at the ICML 2026 TAIGR workshop. System name: EG-VAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18939 2026-07-15 cs.CL 版本更新 79%

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search

迷失在迷宫中:克服长期智能体搜索中的上下文限制

Howard Yen, Yoonsang Lee, Ashwin Paranjape, Mengzhou Xia, Thejas Venkatesh, Jack Hessel, Danqi Chen, Yuhao Zhang

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 研究长期智能体搜索中因上下文限制难以扩展的问题,提出SLIM框架,该框架分离检索工具并定期总结轨迹,在多任务中以低成本和少调用实现可比性能,还减少幻觉,为未来长期智能体提供参考。

Comments COLM 2026; Code and data are available here: https://github.com/howard-yen/SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12412 2026-07-15 econ.TH 新提交 78%

Choice at Finite Capacity: The Bounded Agent as an Information Channel and the Recovery of Walrasian Demand

有限容量下的选择:作为信息通道的有限理性主体与瓦尔拉斯需求的恢复

Avishek Bhandari

专题命中 工具调用 :agent(title,abstract)

AI总结 研究将购物者建模为有限信息通道,其选择是概率分布。核心方法是分析购物者需求对价格变化的反应模式,主要贡献是揭示其反应模式的对称性及需求受预算和压缩影响,而非理性,还涵盖了有限容量策略的人工主体并给出两商品二次型消费者的封闭形式解。

Comments 27 pages, Keywords: bounded rationality, rational inattention, rate distortion, discrete choice, demand theory, Slutsky equation, information theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12575 2026-07-15 cs.CR cs.CY cs.SI 新提交 78%

How Agentic Is Agentic Commerce? A Population-Scale Measurement of x402 Adoption and Authenticity

代理式商业的代理程度如何?x402采用情况与真实性的大规模测量

Shengchen Ling, Yajin Zhou, Lei Wu, Cong Wang

专题命中 工具调用 :agentic(title);AI agent(abstract)

AI总结 研究x402协议在商业中的代理程度,通过链上事件识别结算并确定真正付款人,对Base上的x402进行大规模测量,发现诸多问题,指出结算数量衡量的是可制造性而非采用情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13021 2026-07-15 cs.SE 新提交 70%

Software Supply Chains are Dead: Use-Case-Oriented Regeneration

软件供应链已死:面向用例的再生

Tanmay Singla, James C. Davis

专题命中 工具调用 :workflow(abstract);agentic(abstract);分类 cs.SE

AI总结 研究现代软件开发中构建与复用权衡因软件供应链攻击及生成式人工智能而改变,提出面向用例的再生范式,评估智能工作流程,通过对180个存储库-依赖对测量,证明该方法可行,推动软件采购向可验证的特定于存储库的代码合成发展。

Comments [ESEM'26-ERVR] Proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026 Emerging Results, Vision, and Reflection Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12257 2026-07-15 cs.AI cs.CL cs.IR cs.LG 新提交 67%

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率

Vinay Kumar Chaganti

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。

Comments 13 pages, 2 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10001 2026-07-15 cs.SI cs.HC 版本更新 67%

Human-AI Synergy Supports Collective Creative Search

人类-人工智能协同支持集体创造性搜索

Chenyi Li, Raja Marjieh, Haoyu Hu, Mark Steyvers, Katherine M. Collins, Ilia Sucholutsky, Nori Jacoby

专题命中 工具调用 :agent(abstract);AI agent(abstract)

AI总结 本研究探讨了人类与人工智能协同在集体创造性搜索中的作用,发现混合团队在保持多样性的同时表现最佳,凸显了两者互补的协作优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11913 2026-07-15 cs.NE cs.AI 新提交 57%

Towards Self-Evolving Agents: A Human-Inspired Adaptive Exploration-Exploitation Framework for Genetic Network Programming

迈向自我进化智能体:一种受人类启发的遗传网络编程自适应探索-利用框架

Ali Kohan, Mohamad Roshanzamir, Roohallah Alizadehsani, Seyedali Mirjalili

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该研究受人类发育模式启发,提出人类启发的遗传网络编程(HGNP)框架,通过新型自适应交叉、变异算子及循环消除机制,动态调节遗传网络编程中探索与利用的平衡,提升了智能体策略性能,且可应用于多种GNP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14539 2026-07-15 cs.CR cs.HC cs.SE 57%

When Security Meets Usability: An Empirical Investigation of Post-Quantum Cryptography APIs

当安全性遇见可用性:后量子密码学API的实证研究

Marthin Toruan, R. D. N. Shakya, Samuel Tseitkin, Raymond K. Zhao, Nalin Arachchilage

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 通过实证评估开发者与后量子密码学API的交互,识别影响可用性的认知因素,并提出改进建议以促进PQC的采用。

Comments Accepted at the NDSS Symposium on Usable Security and Privacy (USEC) 2026

Journal ref Symposium on Usable Security and Privacy (USEC) 2026, San Diego, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12117 2026-07-15 cs.DL 新提交 50%

Measuring the Re-executability of Published Molecular Docking Claims

测量已发表分子对接声明的可重新执行性

Vincent Giap, Eric Wang, Cris Nguyen

专题命中 工具调用 :agent(abstract)

AI总结 研究探讨已发表分子对接声明的可重新执行性,引入MERS-Dock及可执行性阶梯,通过对236篇相关论文审核发现可执行性低,验证审核并分析结果,表明再现差距是几何效应,将E类作可执行性门,发布测量层助数字系统核查计算声明。

Comments 19 pages, 6 figures. Data, code, and the MERS-Dock reporting standard: https://github.com/giapha/mpro-dockexec

详情

展开后加载摘要…

URL PDF HTML 收藏