arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-22 至 2026-04-22 共收录 142 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2604.18658 2026-04-22 cs.CR cs.AI cs.CL 88%

Owner-Harm: A Missing Threat Model for AI Agent Safety

所有权危害:AI代理安全的缺失威胁模型

Dongcheng Zhang, Yiqing Jiang

机构 * BlueFocus Communication Group(蓝ocus通信集团) Tongji University(同济大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出Owner-Harm威胁模型,旨在解决AI代理对部署者造成伤害的问题,通过实验验证了现有防御体系的不足,并引入SSDG框架提升检测效果。

Comments 15 pages. Companion manuscript on per-decision proof-obligation synthesis (LSVJ-S) in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19657 2026-04-22 cs.CR cs.AI cs.OS 88%

An AI Agent Execution Environment to Safeguard User Data

一个保障用户数据安全的AI代理执行环境

Robert Stanley, Avi Verma, Lillian Tsai, Konstantinos Kallas, Sam Kumar

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Google(谷歌)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 GAAP通过动态用户提示收集权限规范,确保AI代理在共享用户隐私数据时符合规定,无需信任代理或模型,有效阻止数据泄露攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 83%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 Agent评测 :planning(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 82%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19181 2026-04-22 cs.DC 82%

YAIFS: Yet (not) Another Intelligent Fog Simulator: A Framework for Agent-Driven Computing Continuum Modeling & Simulation

YAIFS: 又一个智能雾模拟器:一种基于智能体驱动的计算连续性建模与仿真框架

Isaac Lera, Carlos Guerrero

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 本文提出YAIFS框架,通过引入模型上下文协议实现智能体与模拟的交互,展示了多智能体系统在动态负载下的自适应行为。

Comments under review,

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00451 2026-04-22 cs.LG cs.AI cs.DS cs.IT math.IT stat.ML 81%

Best Agent Identification for General Game Playing

多任务领域中最佳代理的识别

Matthew Stephenson, Alex Newcombe, Eric Piette, Dennis Soemers

机构 * College of Science and Engineering, Flinders University, Adelaide, South Australia, Australia(科学与工程学院,弗林德斯大学,阿德莱德,澳大利亚,南澳大利亚州) Information and Communication Technologies, Electronics, and Applied Mathematics Institute, UCLouvain, Louvain-la-Neuve, Belgium(信息与通信技术、电子学和应用数学研究所,UCLouvain,洛林-拉-纽夫,比利时) Department of Advanced Computing Sciences, Maastricht University, Maastricht, the Netherlands(高级计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效通用方法,通过多臂老虎机中的最佳臂识别问题,确定多任务领域中表现最佳的算法。在GVGAI和Ludii框架上验证,相比传统方法,显著降低简单遗憾和错误概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 79%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 70%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 70%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19354 2026-04-22 cs.AI cs.CR cs.SE 62%

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体是否梦想着根壳?在夺旗挑战中的LLM智能体部分分数评估

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出DeepRed基准,用于评估LLM智能体在真实夺旗挑战中的能力,通过部分分数评分和自动化标注流程,发现当前智能体在非标准发现和长周期适应任务中表现有限。

Comments Accepted to AIWare'26 Benchmark and Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04410 2026-04-22 cs.AI cs.HC cs.IR cs.LG 62%

User Simulation in the Era of Generative AI: User Modeling, Synthetic Data Generation, and System Evaluation

生成AI时代用户模拟:用户建模、合成数据生成与系统评估

Krisztian Balog, ChengXiang Zhai

机构 * University of Stavanger(斯塔万格大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨生成AI时代用户模拟的跨学科应用,提出从传统预测模型向生成方法转变,并强调伦理考量与AGI追求的理论联系,建立学术与产业的创新生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15832 2026-04-22 cs.CL cs.AI 62%

A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains

面向电商领域的功能导向基准评估Web代理

Xianren Zhang, Shreyas Prasad, Di Wang, Qiuhai Zeng, Suhang Wang, Wenbo Yan, Mat Hans

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Amazon-Bench基准,旨在评估电商领域Web代理的功能性和安全性,通过生成涵盖地址管理、心愿单管理等任务的用户查询,发现现有代理在复杂任务中表现不足且存在安全风险。

Comments 8 pages for main body and 8 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL 57%

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19556 2026-04-22 cs.CV 50%

Paparazzo: Active Mapping of Moving 3D Objects

Paparazzo:移动3D物体的主动映射

Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit

机构 * University of Padova(帕多瓦大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Paparazzo方法,通过学习-free方案实现移动3D物体的主动映射,提升3D重建的完整性和准确性,建立新基准测试。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13829 2026-04-22 cs.OH 50%

Use and usability: concepts of representation in philosophy, neuroscience, cognitive science, and computer science

使用性与可用性:哲学、神经科学、认知科学和计算机科学中的表示概念

Ben Baker, Richard D. Lange, Andrew Richmond, Nikolaus Kriegeskorte, Rosa Cao, Xaq Pitkow, Odelia Schwartz

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了表示的使用性和可用性在不同学科中的概念,梳理了神经表示的三个层次,帮助理解多样化的表示概念。

Comments Styled for publication in NBDT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16973 2026-04-22 econ.TH cs.GT 50%

Decomposition Envy-Freeness in Random Assignment

随机分配中的分解嫉妒公平性

Yasushi Kawase, Warut Suksompong, Hanna Sumita, Yu Yokoi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出分解嫉妒公平性(Dec-EF)概念,用于解决随机分配中SD-EF可能无法满足的情况,适用于最多三名代理人或偏好种类不超过两种的情形。

Journal ref Mathematical Social Sciences, 141:102532 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10251 2026-04-22 cs.SI 50%

Emergence of Stereotypes and Affective Polarization from Belief Network Dynamics

刻板印象与情感极化的涌现:信念网络动态

Ozgur Can Seckin, Rachith Aiyappa, Madalina Vlasceanu, Filippo Menczer, Alessandro Flammini, Yong-Yeol Ahn

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过信念网络模型探讨社会互动与内部一致性驱动如何导致刻板印象的产生,并展示刻板印象与群体认同如何引发情感极化。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12606 2026-04-22 cs.CV 50%

Pixels or Positions? Benchmarking Modalities in Group Activity Recognition

像素还是位置?群组活动识别中模态的基准测试

Drishya Karki, Merey Ramazanova, Anthony Cioppa, Silvio Giancola, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡布斯国王科技大学) University of Liège(利耶大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出SoccerNet-GAR数据集,通过2022年世界杯64场比赛的广播视频和玩家跟踪数据,评估视频和跟踪模态在群组活动识别中的性能,提出基于图神经网络的跟踪模型,取得更高准确率且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2604.19538 2026-04-22 cs.AI cs.HC cs.MA 79%

Integrating Anomaly Detection into Agentic AI for Proactive Risk Management in Human Activity

将异常检测整合到代理AI中以实现人类活动中的主动风险管理

Farbod Zorriassatine, Ahmad Lotfi

机构 * Department of Computer Science(计算机科学系) Nottingham Trent University(诺丁汉特伦特大学) Nottingham, UK(英国诺丁汉)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 本文提出将跌倒检测与预测作为异常检测问题,通过代理AI系统提升对复杂环境的适应能力,以实现更有效的风险管理工作。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18614 2026-04-22 cs.DC cs.CR cs.ET cs.MA 78%

HadAgent: Harness-Aware Decentralized Agentic AI Serving with Proof-of-Inference Blockchain Consensus

HadAgent:基于证明-推理区块链共识的去中心化代理AI服务

Landy Jimenez, Mariah Weatherspoon, Bingyu Shen, Yi Sheng, Jianming Liu, Boyang Li

专题命中 其他Agent :agentic(title,abstract)

AI总结 HadAgent通过引入证明-推理共识机制,替代传统工作量证明,实现去中心化代理AI服务,提升验证效率与安全性,实验显示高检测率与低误报率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09861 2026-04-22 cs.CV cs.AI 57%

A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends

基于MLLM的视觉丰富文档理解综述:方法、挑战与新兴趋势

Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun, Geoffrey Martin, Wei Liu, Yifan Peng

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Weill Cornell Medicine(韦尔·柯尔医学中心)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文综述了基于MLLM的视觉丰富文档理解最新进展,探讨了文本、视觉和布局特征的表示与整合技术,以及预训练、指令微调等训练方法,分析了数据稀缺、多页文档处理等挑战及新兴趋势。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10900 2026-04-22 cs.NI 50%

AI Infrastructure Sovereignty

AI 基础设施主权

Sergio Cruzes

专题命中 其他Agent :agentic(abstract)

AI总结 本文探讨了AI基础设施主权的概念,强调在能源、可持续性和网络覆盖等约束下,地区、运营商或国家维持AI系统运营控制的能力,通过数据中心、光传输网络和控制框架的联合设计实现主权。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏