arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-05 至 2026-05-05 共收录 108 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 23 篇

2605.01209 2026-05-05 cs.SE cs.FL 79%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 78%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agentic(title);planning(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 77%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01562 2026-05-05 cs.SE cs.AI 73%

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

神经符号代理用于无幻觉要求重用

Ahmed Ibrahim

机构 * Western University(西部大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出神经符号多代理系统,通过模型驱动 elicitation 过程实现无幻觉的要求重用,结合 LLM 和符号验证器确保结构有效性,实验显示 100% 覆盖率和 0.2% 违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16810 2026-05-05 cs.AI cs.CL cs.HC econ.GN q-fin.EC 73%

AI Realtor: Towards Grounded Persuasive Language Generation for Automated Copywriting

AI 房地产经纪人:迈向基于现实的说服性语言生成以实现自动化文案写作

Jibang Wu, Chenghao Yang, Yi Wu, Simon Mahns, Chaoqi Wang, Hao Zhu, Fei Fang, Haifeng Xu

机构 * Schmidt Sciences(施密特科学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于大语言模型的代理框架,用于房地产营销中的自动化文案写作中的基于现实的说服性语言生成。通过系统的人类受试者实验,证明了该方法在保持事实准确性的同时,生成的营销描述更受潜在购房者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 70%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02945 2026-05-05 cs.LG cs.AI 62%

Ergodic Risk Measures: Towards a Risk-Aware Foundation for Continual Reinforcement Learning

遍历风险度量:面向持续强化学习的风险感知基础

Juan Sebastian Rojas, Chi-Guhn Lee

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出遍历风险度量理论,用于持续强化学习,解决传统风险中性方法与持续学习不兼容的问题,通过新理论提升持续学习的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 62%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01358 2026-05-05 cs.LG 57%

PACE: Parameter Change for Unsupervised Environment Design

PACE:无监督环境设计的参数变化

Fang Yuan, Quanjun Yin, Siqi Shen, Yuxiang Xie, Junqiang Yang, Long Qin, Junjie Zeng, Qinglun Li

机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Test Center, National University of Defense Technology(国防科技大学测试中心) State Key Laboratory of Digital Intelligent Modeling(数字智能建模与仿真国家重点实验室) Fujian Key Laboratory of Urban Intelligent Sensing(福建城市智能感知重点实验室) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 PACE通过政策参数变化评估环境,提升强化学习泛化能力,实验显示在MiniGrid和Craftax上优于现有无监督环境设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01082 2026-05-05 cs.LG cs.GT econ.TH 57%

Networked Information Aggregation for Binary Classification

基于网络的信息聚合用于二分类

MohammadHossein Bateni, Zahra Hadizadeh, MohammadTaghi Hajiaghayi, Mahdi JafariRaviz, Shayan Taherijam

机构 * University of Maryland, College Park, MD, USA(马里兰大学学院市分校) Google Research, New York City, NY, USA(谷歌研究纽约市分校) University of California, Irvine, CA, USA(加州大学尔湾分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究网络二分类中信息聚合问题,通过序列分布式训练流程分析信息聚合效果,证明深度对信息聚合的限制。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01186 2026-05-05 cs.CR 50%

Trace: Unmasking AI Attack Agents Through Terminal Behavior Fingerprinting

Trace:通过终端行为指纹揭示AI攻击代理

Murali Ediga, Sudipta Chattopadhyay

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Trace框架,通过终端命令序列识别AI攻击代理模型家族,利用防御性提示注入策略提取系统提示,提升攻击意图分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01128 2026-05-05 cs.NI 50%

MORPH: Multi-Environment Orchestrated Reinforcement Learning for PRB Handling in O-RAN

MORPH:多环境协同强化学习用于O-RAN中PRB处理

Alireza Ebrahimi Dorcheh, Tolunay Seyfi, Ryan Barker, Fatemeh Afghah

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出MORPH,基于O-RAN中PRB级频谱分配的多环境协同强化学习框架,结合测量和仿真数据提升切片性能和SLA合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01094 2026-05-05 cs.DC cs.NI 50%

ncsim: A Lightweight Simulator for Networked Edge Computing with Wireless Interference Modeling

ncsim:一种用于网络边缘计算的轻量级模拟器,包含无线干扰建模

Bhaskar Krishnamachari, Maya Gutierrez, Jared Coleman

专题命中 Agent评测 :workflow(abstract)

AI总结 ncsim通过结合DAG工作流调度与物理基础的IEEE 802.11 CSMA/CA干扰建模,解决无线边缘计算中计算放置与干扰建模的耦合问题,实验显示干扰影响显著导致调度器排名反转。

Comments 13 pages, 9 figures. Code and experimental configurations available at https://github.com/ANRGUSC/ncsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00439 2026-05-05 cs.GT 50%

Strategyproof Facility Location with Prediction: Minimizing the Maximum Cost

具有预测的策略证明设施选址:最小化最大成本

Hau Chan, Jianan Lin, Chenhao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在学习增强框架下设施选址的机制设计问题,设计出策略证明机制以在预测误差下最小化最大成本,分析了MinMaxP机制在不同空间中的逼近保证。

Comments v1 as the conference version is published in ECAI 2025; v2 as the journal extension is published in JAAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08202 2026-05-05 math.PR 50%

The mean field stubborn voter model

均场顽固投票者模型

Lisa Hartung, Christian Mönch

专题命中 Agent评测 :agent(abstract)

AI总结 研究投票模型中代理依赖的厚尾等待时间对完全图的影响,推导新的标度极限并证明最慢更新站点的极限无限投票者模型存在性,明确计算共识概率。

Comments 31 pages; v2 contains some minor fixes as well as extension of the allowed weight distributions

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2604.00187 2026-05-05 cs.HC cs.AI cs.ET 83%

Explainable AI for Blind and Low-Vision Users: Navigating Trust, Modality, and Interpretability in the Agentic Era

可解释AI用于盲人和低视力用户:在智能体时代导航信任、模态和可解释性

Abu Noman Md Sakib, Protik Dey, Zijie Zhang, Taslima Akter

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 其他Agent :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文探讨了盲人和低视力用户在智能体时代对可解释AI的独特需求,指出需多模态界面和责任意识设计以提升可解释性与信任度。

Comments Proceedings of the CHI 2026 Workshop on Human-Centered Explainable AI (HCXAI), April 13-17, 2026, Barcelona, Spain

Journal ref Proceedings of the CHI 2026 Workshop on Human-Centered Explainable AI (HCXAI)

详情

展开后加载摘要…

URL PDF HTML 收藏