arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93044 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5059 篇

2608.17499 2026-08-19 cs.AI 新提交 57%

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

面向更好的多轮用户交互智能体:下一轮用户输入不止是上下文

Yiwen Zhao, Zhihao Wen, Yuchen Mao, Mingxuan Jiang, Yihao Hu, Pan Wang, Xin Zhang, Wei Wu

机构 * Fudan University(复旦大学) Ant International, Ant Group(蚂蚁集团蚂蚁国际)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 该研究针对多轮用户交互智能体的信用分配问题,提出FACA方法,在多领域测试中提升了8B和14B规模模型的性能,验证了下一轮用户反应可提供局部信用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26703 2026-08-19 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新 57%

Discovering physical mechanisms from experiment-simulation mismatches

可自我进化的代理用于DFT实验能带不匹配的可解释诊断

Yue Li, Penghui Yang, Yushan Xiao, Zhonghan Zhang, Jianguo Huang, Yuhao Lu, Cuntai Guan, Bo An, Bijun Tang, Zheng Liu

机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14656 2026-08-19 stat.ML cs.LG 版本更新 57%

Inverse Problems for Partial Differential Equations with Jump Discontinuities in Coefficients via Two-Stage Physics-Informed Deep Learning and Statistical Mixture Models

基于两阶段物理信息深度学习和统计混合模型的系数具有跳跃不连续性的偏微分方程反问题

Zhikun Zhang, Guanyu Pan, Xiangjun Wang, Yong Xu, Guangtao Zhang

机构 * School of Mathematics and Statistics(数学与统计学学院) Northwestern Polytechnical University(西北工业大学) Huazhong University of Science and Technology(华中科技大学) Xiangtan University(湘潭大学) Southern University of Science and Technology(南方科技大学) MOE Key Laboratory for Complexity Science in Aerospace(航空航天复杂科学教育部重点实验室) SandGold AI Research(SandGold AI研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出两阶段物理信息深度学习框架,结合神经网络采样与统计推断,解决系数具有跳跃不连续性的PDE反问题,实现参数识别与解重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16544 2026-08-18 cs.MA cs.AI 新提交 57%

VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience

VCE-Skill:利用版本变更经验增强技能自进化

Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 本文提出VCE-Skill,将公共技能变更提炼为结构化版本变更经验并与轨迹提议自适应融合,提升了技能自进化的平均分数,增强了跨模型迁移性能,拓展了技能自进化的先验知识来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16502 2026-08-18 cs.LG cs.IR 新提交 57%

When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval

当工具支持的技能检索失效时:可执行能力检索中的源风格崩溃

Yiqi Liu, Joseph James, Yang Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 该研究针对可执行能力检索中出现的源风格崩溃问题,提出源感知路由方法ToolScout,利用TF-IDF指纹提升检索覆盖率,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16391 2026-08-18 cs.CR cs.AI 新提交 57%

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

Ventor-QTest:威胁模型驱动的供应商托管大语言模型API验证

Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 Ventor-QTest是一种无需目标API概率信息的复合黑盒审计方法,通过AFL和EFL指标审计供应商托管LLM API质量,可反映长视野任务的极端保真度损失,开源实现可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15909 2026-08-18 cs.IR cs.CL 新提交 57%

Large language model-assisted discovery of cohorts from scientific literature

大语言模型辅助的科学文献队列发现

Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

专题命中 工具调用 :planning(abstract);分类 cs.CL

AI总结 该研究开发了问题驱动框架,通过PubMed API检索文献,用大语言模型提取队列名称,在青少年攻击行为遗传学用例中,补充了队列目录未覆盖的17个合格队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15432 2026-08-18 cs.AI 新提交 57%

Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs

证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化

Tadd Mao, Tianjun Zhong, Dhruva Arekar, Yuming Feng, One An, Jiani Huang, Xujie Si, Ziyang Li

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。

Comments Preprint. 18 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 57%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 57%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01926 2026-08-18 cs.CL 版本更新 57%

Mitigating Bias in Locally Constrained Decoding via Tractable Proposals

通过可处理提议缓解局部约束解码中的偏差

Meihua Dang, Linxin Song, Honghua Zhang, Jieyu Zhao, Guy Van den Broeck, Stefano Ermon

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :function calling(abstract);分类 cs.CL

AI总结 针对局部约束解码中因短视掩码导致的采样偏差,提出基于张量化有限自动机的全局约束解码提议和概率全局约束解码提议,结合序贯蒙特卡洛方法实现无偏采样,在函数调用、关键词生成和SQL生成任务中显著减少所需粒子数并加速收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23049 2026-08-18 cs.AI 版本更新 57%

MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration

MedMCP-Calc:通过MCP整合建立LLMs在真实医疗计算场景中的基准测试

Yakun Zhu, Yutong Huang, Shengqian Qin, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 MedMCP-Calc通过MCP整合建立首个LLMs在真实医疗计算场景的基准测试,揭示模型在多步骤计算和外部工具利用上的不足,并开发CalcMate实现开源模型的最佳性能。

Comments Accepted to the ACL 2026 Main Conference as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14114 2026-08-17 cs.LG 新提交 57%

Learning to Run Power Networks: Effective AlphaZero-inspired Topological Control

学习运行电力网络:受AlphaZero启发的有效拓扑控制方法

Lukas Zetto, Benjamin Schäfer, Qiong Huang

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 针对电网拓扑控制的组合空间与约束问题,研究受AlphaZero启发的模型方法,发现优化的AlphaZero达98.43%生存能力,需结合领域启发式、二元奖励与受限观测空间。

Comments 10 pages, 9 figures. Accepted for publication in ACM SIGENERGY Energy Informatics Review, Volume 6, Issue 3, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13959 2026-08-17 cs.CL 新提交 57%

Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention

修复,而非改进:分解工具调用弃权中的约束解码

Janghoon Lee

机构 * Redrob

专题命中 工具调用 :function calling(abstract);分类 cs.CL

AI总结 该研究针对工具调用弃权问题,分解约束解码的作用,发现修复格式约束的效果优于改进,且两项预注册语言声明不成立。

Comments 24 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13221 2026-08-14 cs.AI 新提交 57%

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。

Comments 23 pages, 12 figures, 20 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12610 2026-08-14 cs.AI 新提交 57%

@skills: Attention is all you have

@skills:你所需的全部注意力

Li Yin, Zhi Li, Zhan Shi, Haoran Zhang, Haebin Seong, Zhangyang, Wang

机构 * SylphAI(西尔菲人工智能公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。

Comments 7 pages main, 23 pages in total with appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10245 2026-08-12 cs.NE cs.LG 新提交 57%

A Graph Neural Network--Guided Genetic Algorithm for Physical Internet Supply Chain Optimization under Cost Uncertainty

成本不确定性下面向物理互联网供应链优化的图神经网络引导遗传算法

Faezeh Ardali, Gerald M. Knapp

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 针对成本不确定的物理互联网三级供应链优化问题,构建确定性与最小最大遗憾模型,提出GNN-GA算法,实验显示其在多实例上优于标准GA,学习到的初始化是主要改进来源。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09874 2026-08-11 cs.AI cs.AR 新提交 57%

ArchAgent v2: A Case Study with the Data Prefetching Championship

ArchAgent v2:数据预取锦标赛的案例研究

Abraham Gonzalez, Raghav Gupta, Akanksha Jain, Hanna Alam, Alexander Novikov, Po-Sen Huang, Matej Balog, Marvin Eisenberger, Sergey Shirobokov, Ngân Vũ, Hank Levy, Borivoje Nikolić, Sagar Karandikar, Martin Dixon, Parthasarathy Ranganathan

机构 * Google(谷歌公司) University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本研究提出ArchAgent v2框架,通过级联进化搜索和硬件可实现性反馈循环,在DPC4中自动设计出性能优于人工方案的三级预取器,为计算机架构师提供了自动化智能体发现的实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09537 2026-08-11 cs.AI 新提交 57%

verdi: retrieval is not transfer for continual world model optimization

VERDI:检索并非持续世界模型优化的迁移

Junyu Wu, Shiqin Nie, Youyi Kou, Baohua Yin, Guocai Yao, Qingyu Chen, Jingheng Ma, Shiji Zhou, Hongyong Song, Mingchen Zhuge, Sen Cui, Changshui Zhang

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文针对基础世界模型优化中策略难迁移的问题,提出VERDI框架,通过构建优化指纹、检索假设并经目标侧验证来实现持续优化,可降低搜索与GPU成本,减少负迁移并提升迁移结果预测准确率。

Comments 28pages, 13figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08791 2026-08-11 cs.CL 新提交 57%

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

不确定但确定:揭示扩散语言模型中的表示-置信度差距

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07855 2026-08-11 cs.LG 新提交 57%

CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

CommitKV:面向多轮智能体的、基于提交转换的生命周期感知KV缓存压缩

Weizhong Huang, Jinchao Zhang, Xiawu Zheng

机构 * Xiamen University(厦门大学) WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 CommitKV通过提交转换识别KV生命周期,区分休眠与可安全移除信息,在多轮智能体中降低内存占用、加速推理且准确率优于现有KV缓存压缩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00326 2026-08-11 cs.AI 版本更新 57%

Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体

Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 57%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10794 2026-08-11 cs.AI 版本更新 57%

READER: Dynamic LLM Provenance from Query-Varying Interactions

READER: 基于提取表示的鲁棒证据作者身份解码

Jiaxu Liu, Sunnan Mu, Dong Huang, Liuyin Wang, Jing Shao, Jie Zhang

机构 * National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07056 2026-08-10 cs.AI 新提交 57%

BONSAI: Evolvability-Guided Tree Search over Skills

BONSAI:基于可进化性的技能树搜索

Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究提出BONSAI技能优化框架,基于可进化性的蒙特卡洛树搜索优化冻结智能体的技能,在30B智能体和三个基准上,较无技能智能体及GEPA、SkillOpt基线显著提升保留集准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00152 2026-08-07 cs.CR cs.AI 版本更新 57%

PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say

PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou, Dongrui Liu, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Southeast University(东南大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04398 2026-08-06 cs.RO cs.AI 新提交 57%

Approximate Multi-Objective Search Under Rulebooks

规则手册下的近似多目标搜索

Omar Muhammetkulyyev, Oren Salzman, Tichakorn Wongpiromsarn

机构 * Iowa State University(爱荷华州立大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对机器人规划中规则手册下多目标最优解计算成本高的问题,提出RA*pex算法,结合降维与规则层次处理,大幅提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-06 cs.AI 新提交 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏