arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-19 至 2026-08-19 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 16 篇

2608.16620 2026-08-19 cs.CL cs.AI 版本更新 91%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 工具调用 :tool-use(title,abstract);agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17275 2026-08-19 cs.CR cs.AI 新提交 77%

When Agents Act on Web3: An Attack-Surface Survey of MCP, Skills, and Tool Calling

当智能体在Web3中行动:MCP、技能与工具调用的攻击面调查

Rabimba Karanjai, Yang Lu, Nour Diallo, Wujie Xiong, Lei Xu, Weidong (Larry)Shi

专题命中 工具调用 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本调查针对智能体通过MCP等在Web3区块链上行动的攻击面,构建风险映射矩阵,发现现有防护不足,推导了相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 74%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 工具调用 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: this https URL (https://github.com/SarveshVGharat/structural-gap-hypothesis-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03771 2026-08-19 cs.AR cs.MA 版本更新 67%

OneDSE: Metric-Conditioned Inverse Modeling and Active Search for Sample-Efficient DSE

OneDSE:面向样本高效设计空间探索的指标条件逆建模与主动搜索

Ritik Raj, Akshat Ramachandran, Danny Samuel, Jeff Nye, Shashank Nemawarkar, Tushar Krishna

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 OneDSE通过MIND与SAIL统一CPU设计的短视距预测和长视距优化,在TailBench等测试中大幅减少评估次数,性能优于ArchGym遗传算法等基线,还可扩展到其他硬件设计场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17381 2026-08-19 q-bio.QM cs.AI cs.LG q-bio.BM 新提交 62%

Leveraging generative hallucination and biophysics-informed modeling for unified biomolecular sequence-structure co-design

利用生成式幻觉和生物物理引导建模实现统一的生物分子序列-结构协同设计

Xuefeng Liu, Mingxuan Cao, Xiao Luo, Songhao Jiang, Tobin Sosnick, Jinbo Xu, Louis Maher, Rick Stevens

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DNA/RNA等生物分子设计难题,提出MCTH框架,通过蒙特卡洛树搜索实现序列-结构协同设计,在多模态设计任务中性能优于基线,且可跨模态泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-19 cs.CL cs.AI 版本更新 62%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Ruoxi Cheng, Haoxuan Ma, Hongyi Zhang, Junming Zhang, Ranjie Duan, Qiaolin Xia, Hao Wang, Yu Lu, Haibo Shi, Xingjun Ma

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18747 2026-08-19 cs.IR cs.AI cs.CC cs.CL cs.DB 版本更新 62%

The $\mathbf{P}$-Completeness of Inverted Index Traversal: On the Complexity of Evaluating Boolean Query DAGs

倒排索引遍历的$\mathbf{P}$-完备性:关于布尔查询DAG评估的复杂性

Amir Aavani

机构 * Apple Inc.(苹果公司)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文证明基于DAG的布尔查询评估问题是$\mathbf{P}$-完备的,并提出一种稀疏感知算法ComputePN,通过正负对偶表示和DAG记忆化,将评估时间严格限制在$O(|Q| \cdot |U_{\mathit{active}}|)$,避免指数爆炸和全量扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-19 cs.SE 新提交 57%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Submitted to ICSE 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17499 2026-08-19 cs.AI 新提交 57%

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

面向更好的多轮用户交互智能体:下一轮用户输入不止是上下文

Yiwen Zhao, Zhihao Wen, Yuchen Mao, Mingxuan Jiang, Yihao Hu, Pan Wang, Xin Zhang, Wei Wu

机构 * Fudan University(复旦大学) Ant International, Ant Group(蚂蚁集团蚂蚁国际)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 该研究针对多轮用户交互智能体的信用分配问题,提出FACA方法,在多领域测试中提升了8B和14B规模模型的性能,验证了下一轮用户反应可提供局部信用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26703 2026-08-19 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新 57%

Discovering physical mechanisms from experiment-simulation mismatches

可自我进化的代理用于DFT实验能带不匹配的可解释诊断

Yue Li, Penghui Yang, Yushan Xiao, Zhonghan Zhang, Jianguo Huang, Yuhao Lu, Cuntai Guan, Bo An, Bijun Tang, Zheng Liu

机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14656 2026-08-19 stat.ML cs.LG 版本更新 57%

Inverse Problems for Partial Differential Equations with Jump Discontinuities in Coefficients via Two-Stage Physics-Informed Deep Learning and Statistical Mixture Models

基于两阶段物理信息深度学习和统计混合模型的系数具有跳跃不连续性的偏微分方程反问题

Zhikun Zhang, Guanyu Pan, Xiangjun Wang, Yong Xu, Guangtao Zhang

机构 * School of Mathematics and Statistics(数学与统计学学院) Northwestern Polytechnical University(西北工业大学) Huazhong University of Science and Technology(华中科技大学) Xiangtan University(湘潭大学) Southern University of Science and Technology(南方科技大学) MOE Key Laboratory for Complexity Science in Aerospace(航空航天复杂科学教育部重点实验室) SandGold AI Research(SandGold AI研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出两阶段物理信息深度学习框架,结合神经网络采样与统计推断,解决系数具有跳跃不连续性的PDE反问题,实现参数识别与解重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17446 2026-08-19 econ.TH 新提交 50%

Searchable Menus

可搜索菜单

Frank Yang, Piotr Dworczak

专题命中 工具调用 :agent(abstract)

AI总结 本文研究代理人视角下受可处理性约束的最优筛选机制,提出可搜索菜单要求,在多产品垄断等不同场景推导最优可搜索菜单形式,得出多维筛选中可搜索性限制可实施结果集合的结论。

Comments 83 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17889 2026-08-19 cs.IR 新提交 50%

VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval

VisDocAgentBench:面向视觉丰富文档检索的智能体基准测试

Lexiang Hu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Yikang Li, Fuwei Zhang, Yisen Wang, Zhouchen Lin

专题命中 工具调用 :agentic(abstract)

AI总结 该研究提出VisDocAgentBench基准,对比静态与智能体检索,发现视觉检索优于OCR文本检索,智能体可改善双桥项检索性能,为检索智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16393 2026-08-19 cs.CR 版本更新 50%

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

基于A.I.G的DeepSeek Harness安全评估:对间接提示注入的抗性评估

Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 工具调用 :agent(abstract)

AI总结 本研究用A.I.G评估DSH的间接提示注入抗性,开展多场景实验,发现不同攻击的成功率,明确需在不可信内容与敏感动作间增设控制措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15465 2026-08-19 cs.DB 版本更新 50%

Succinct Structure Representations for Efficient Query Optimization

紧凑的结构表示用于高效的查询优化

Zhekai Jiang, Qichen Wang, Christoph Koch

专题命中 工具调用 :planning(abstract)

AI总结 本文提出了一种紧凑的元分解表示,用于高效查询优化,通过在多项式时间内构造并枚举所有可能的连接树,提升了查询优化效率。

Comments Full version for SIGMOD 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏