arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 145 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2607.20845 2026-07-24 math.OC 新提交 78%

Mean field and N-agent games for optimal relative consumption-investment with jump risk and common noise

具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈

Yiming Jiang, Fuxing Li, Yawei Wei, Zimeng Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-07-24 cs.AI 新提交 77%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 77%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20505 2026-07-24 cs.RO cs.LG 新提交 70%

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

HERMES:用于信号交叉口交通冲突预测的异构边缘关系多头嵌入式SSM注意力模型

Md Monzurul Islam, Subasish Das

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究针对交通冲突预测,提出HERMES异构边缘关系图神经网络,利用特定关系注意力等方法,在多指标上表现优异,优于基线模型,联合训练提升目标站点性能,为信号交叉口路边安全监测提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20645 2026-07-24 cs.CL cs.AI cs.LG 新提交 67%

Frontier Financial Judgement: Can agents tell what might move a stock?

前沿金融判断:智能体能否判断哪些因素会推动股票走势?

Joshua Harris

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究引入前沿金融判断基准,结合多种文章创建评估项目,让智能体区分金融信息。最强智能体匹配率仅52.4%,智能体在误报率等方面有显著差异,且在多方面存在权衡,阻碍新闻流过滤在实践中的可靠部署。

Comments 19 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21533 2026-07-24 quant-ph 新提交 67%

Benchmarking Agents for Proving Theorems in Quantum Algorithms and Quantum Information

量子算法和量子信息定理证明智能体的基准测试

Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang

专题命中 Agent评测 :AI agent(abstract);agentic(abstract)

AI总结 研究人工智能智能体在量子算法和信息定理证明的能力,引入两个Lean 4基准测试,在通用框架下评估四个模型,发现LAD可提升性能,揭示智能体证明弱点及模型成本差异,为开发更优证明智能体提供基线。

Comments 22 pages, including appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 62%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 57%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20916 2026-07-24 cs.AI cs.DL 新提交 57%

Traceable Scholarship: Page Anchors and Ariadne's Thread for Humanistic Inquiry in the Age of Generative AI

可追溯的学术研究:生成式人工智能时代人文探究的页面锚点与阿里阿德涅之线

Deyu Jing

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对生成式人工智能时代人文研究中解释缺乏明确依据的问题,提出可追溯学术研究,介绍页面锚点等方法及AIH-Infra参考实现,通过案例研究展示其作用,确保人文研究在该时代保持公开可反驳。

Comments 33 pages, 8 tables. This paper proposes a normative and infrastructural framework for traceable, AI-assisted humanistic research and presents an auditable Kant case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20872 2026-07-24 cs.CL 新提交 57%

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

LegalCiteTrust:评估中文长篇法律研究报告中引用可信度的基准

Yunhan Li, Mingjie Xie, Zeyang Shi, Gengshen Wu, Min Yang

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 研究旨在评估中文长篇法律研究报告引用可信度,引入LegalCiteTrust基准,含72个任务并从三个维度评估。通过实验发现不同系统表现各异,检索工具与基于E/F/A的修订效果不同,强调可靠法律研究生成需检索后的引用感知证据治理。

Comments 8 pages, 21 pages with appendix, 26 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20549 2026-07-24 cs.LG cs.RO cs.SY eess.SY 新提交 57%

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散

Eni Solomon Laughter

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20528 2026-07-24 cs.AI 新提交 57%

PromptPack: Scaling LLM Annotation Agents for Online Recommendation

PromptPack:扩展用于在线推荐的大语言模型注释代理

Sebastian Koralewski, Merwan Barlier, Yulia Stolin, Blaž Škrlj

机构 * Teads Inc.(缇德思公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在线推荐平台用LLMs提取广告素材特征时按创意提示成本高的问题,提出可扩展的PromptPack代理,通过上下文内批处理等实现扩展,经实验评估,相比基线,它大幅降低成本、提高吞吐量且保留AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 57%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19747 2026-07-24 cs.CL 版本更新 57%

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

超越以相关性为中心的检索:面向评分标准的文档集选择与排序

Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu, Baochen Fu, Bin Li, Vichwang, Yu Lu, Haibo Shi

机构 * University of Science and Technology of China(中国科学技术大学) Yuanbao Team, Tencent(腾讯元宝团队) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型和人工智能代理对搜索结果质量需求,提出评估-诊断-优化框架。设计SetwiseEvalKit评估基准,评估多种重排器。在此基础上提出Rubric4Setwise方法,无需训练,能以更少文档和搜索轮次实现最佳下游生成性能,验证了闭环有效性。

Comments Project Page: https://rubric4setwise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26856 2026-07-24 q-bio.NC cs.AI cs.RO 版本更新 57%

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

感觉调节网络:可停性作为对象导向现象学的架构基础

G. Nagarjuna, Durgaprasad Karnam

机构 * Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那) Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出感觉调节网络(SMN)作为具身认知的架构,通过对手动力学和可停性机制,将对象导向现象学(胡塞尔意义)的意向性建立在身体组织的结构特征上,从而调和认知主义与4E认知的争论。

Comments 51 pages, main body 39 pages + References 6 pages, Appendices 6 pages, Tables 3, and Figures 16

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16884 2026-07-24 cs.CL 57%

Do Large Language Models know who did what to whom?

大语言模型是否知道谁对谁做了什么?

Joseph M. Denning, Xiaohan Hannah Guo, Bryor Snefjella, Idan A. Blank

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究发现大语言模型能够提取句子中的主题角色,但这种信息对它们的表示影响较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04584 2026-07-24 cs.AI cs.SY eess.SY 57%

Navigating Assistance System for Quadcopter with Deep Reinforcement Learning

四旋翼避障导航辅助系统基于深度强化学习

Tung-Cheng Wu, Shau-Yin Tseng, Chin-Feng Lai, Chia-Yu Ho, Ying-Hsun Lai

机构 * National Cheng Kung University(国立成功大学) Research Laboratories(研究实验室) Industrial Technology Research Institute(工业技术研究 institutes) Department of Computer Science(计算机科学系) Information Engineering(信息工程系) National Taitung University(国立台东大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度强化学习的四旋翼避障导航辅助系统,通过两个功能模块分别实现路径导航和碰撞避障,实验表明该方法在500次飞行中碰撞率为14%。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20782 2026-07-24 q-bio.TO 新提交 50%

A Bayesian-optimization framework coupling a multiphase PDE tumor model to efficiently design combination therapy schedules

一种将多相偏微分方程肿瘤模型耦合的贝叶斯优化框架,以有效设计联合治疗方案

Ioannis Lampropoulos, Yorgos Psarellis, Michail Kavousanakis

专题命中 Agent评测 :agent(abstract)

AI总结 研究如何设计联合癌症治疗方案,提出将多相偏微分方程肿瘤模拟器与贝叶斯优化框架耦合的方法,可在少量昂贵模拟中找到最优治疗方案,应用于三个临床场景,提供了可转移的设计优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21471 2026-07-24 cs.CV 新提交 50%

Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window

未来渲染≠未来表面:超越观察窗口的动态表面重建基准和数据集

Yukun Shi, Minglun Gong

机构 * University of Guelph(圭尔夫大学)

专题命中 Agent评测 :planning(abstract)

AI总结 研究针对动态场景重建中未来表面重建缺乏标准基准的问题,引入FutureSurf基准和数据集,通过特定训练与评分方式评估方法,发现现有主干在受控运动及多个场景中有差距,且未来渲染质量与表面精度解耦。

Comments See https://github.com/Ricky-S/futuresurf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交 50%

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21046 2026-07-24 cs.GT 新提交 50%

Discrete Truthful Heterogeneous Two-Facility Location: The Line and Beyond

离散真实异构双设施选址:在线性图及其他图上的研究

Panagiotis Kanellopoulos, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 研究离散异构双设施选址的确定性防策略机制,针对线性图设计最优\(4/3\)近似机制填补比率差距,在线性图外为连通图设计\(2\)近似机制并证明\(K_{1,3}\)下界为\(3/2\)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21215 2026-07-24 quant-ph 新提交 50%

Quantum Circuit Fragments and Link Products in Continuous Variables

连续变量中的量子电路片段与链接积

Amalina Lai, Graeme D. Berk, Minjeong Song, Mile Gu

专题命中 Agent评测 :agent(abstract)

AI总结 研究连续变量中的量子电路片段,引入相关链接积构建框架,在高斯区域简化形式体系,可从模块化组件构建非马尔可夫过程等,扩展量子梳工具包,为相关量子信息任务提供系统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21029 2026-07-24 astro-ph.GA 新提交 50%

Dissecting the multiple-component outflow in NGC 5548 with absorption-line Variability

用吸收线变率剖析 NGC 5548 中的多成分外流

Yaqi Chen, Zhicheng He, Guilin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 研究利用吸收线变率方法结合多光谱数据估算 NGC 5548 中紫外外流成分径向距离,通过分析吸收线变率探测率曲线测量复合时标,确定各成分位置,结果与文献相符,展现新方法有效性。

Journal ref Yaqi Chen et al 2026 ApJ 997 245

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08202 2026-07-24 physics.soc-ph econ.GN q-fin.EC 版本更新 50%

Mean-Field Analytical Solution of the Mesa Boltzmann Wealth Model

梅萨玻尔兹曼财富模型的平均场解析解

Jiyuan Lyu

专题命中 Agent评测 :agent(abstract)

AI总结 研究梅萨玻尔兹曼财富模型的平均场版本,通过建立主方程和运用概率生成函数方法解析确定模型参数、推导稳态财富分布特性,数值模拟与理论吻合,为该模型提供解析基准供相关模拟参考。

详情

展开后加载摘要…

URL PDF HTML 收藏