arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-26 至 2026-02-26 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2602.05066 2026-02-26 cs.CR cs.AI 87%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21158 2026-02-26 cs.LG cs.CL 81%

SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards

通过不确定性感知奖励实现的自进化大语言模型代理

Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

机构 * Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Purdue University(普渡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 SELAUR通过将不确定性直接融入奖励设计,提升大语言模型在多步决策中的探索效率和学习稳定性。

Comments Accepted by PAKDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 79%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18745 2026-02-26 cs.RO 78%

A study on the effects of mixed explicit and implicit communications in human-artificial-agent interactions

人类-人工智能代理交互中混合显性与隐性沟通效果的研究

Ana Christina Almada Campos, Bruno Vilhena Adorno

机构 * The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探讨了人类与人工智能代理交互中混合显性与隐性沟通的效果,发现混合沟通能提升代理的接受度和透明度,但对任务执行时间影响不显著。

Comments Main paper with 28 pages, 14 figures, 4 tables. Supplementary material with 39 pages, 44 figures, 2 tables. Submitted to Intelligent Service Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03447 2026-02-26 cs.RO cs.CV 75%

HetroD: A High-Fidelity Drone Dataset and Benchmark for Autonomous Driving in Heterogeneous Traffic

HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准

Yu-Hsiang Chen, Wei-Jer Chang, Christian Kotulla, Thomas Keutgens, Steffen Runde, Tobias Moers, Christoph Klas, Wei Zhan, Masayoshi Tomizuka, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) UC Berkeley(伯克利大学) fka GmbH

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20714 2026-02-26 cs.LG cs.CE 70%

WeirNet: A Large-Scale 3D CFD Benchmark for Geometric Surrogate Modeling of Piano Key Weirs

WeirNet:一种大规模三维CFD基准数据集,用于钢琴键堰的几何替代建模

Lisa Lüddecke, Michael Hohmann, Sebastian Eilermann, Jan Tillmann-Mumm, Pezhman Pourabdollah, Mario Oertel, Oliver Niggemann

机构 * Hydraulic Engineering Section, Civil Engineering, Helmut-Schmidt-University(水利工程系,土木工程,黑姆特-施密特大学) Institute for Artificial Intelligence, Helmut-Schmidt-University(人工智能研究所,黑姆特-施密特大学) Professorship of Computer Science in Mechanical Engineering, Helmut-Schmidt-University(机械工程计算机科学教授职位,黑姆特-施密特大学) Chair for Automation Technology, Helmut-Schmidt-University(自动化技术教授职位,黑姆特-施密特大学) Federal Waterways Engineering and Research Institute(联邦水道工程与研究机构)

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.LG

AI总结 WeirNet通过大规模三维CFD基准数据集,为钢琴键堰的几何替代建模提供支持,提升水力设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13920 2026-02-26 cs.SI cs.AI 70%

A Comparative Analysis of Social Network Topology in Reddit and Moltbook

对Reddit和Moltbook社交网络拓扑结构的比较分析

Yiming Zhu, Gareth Tyson, Pan Hui

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过比较Moltbook和Reddit的社交网络拓扑结构,揭示了代理驱动与人类驱动网络在拓扑模式和边形成效率上的差异,为构建更真实的社会系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10472 2026-02-26 cs.CL cs.AI 62%

FML-bench: Benchmarking Machine Learning Agents for Scientific Research

FML-bench: 用于科学研究的机器学习代理基准测试

Qiran Zou, Hou Hei Lam, Wenhao Zhao, Yiming Tang, Tingting Chen, Samson Yu, Tianyi Zhang, Chang Liu, Xiangyang Ji, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) University of Minnesota, Minneapolis, MN, USA(明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 FML-bench 是一个用于评估机器学习代理在科学研究中能力的基准测试,包含8个基础任务并引入探索多样性指标,揭示探索策略对性能的影响。

Comments Our benchmark is available at: https://github.com/qrzou/FML-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22070 2026-02-26 cs.AI 57%

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

语言模型表现出对算法代理和人类专家的不一致偏见

Jessica Y. Bo, Lillio Mok, Ashton Anderson

机构 * Computer Science University of Toronto(计算机科学大学 Toronto)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现语言模型对人类专家和算法存在不一致偏见,需在高风险应用中谨慎对待。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 57%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12269 2026-02-26 cs.GT 50%

Weakly-Popular and Super-Popular Matchings with Ties and Their Connection to Stable Matchings

具有偏好的弱流行和超流行匹配及其与稳定匹配的关系

Gergely Csáji, Frederik Glitzner

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了具有偏好的弱流行和超流行匹配,提出了一种新的流行定义,并展示了在双侧弱偏好下,弱流行匹配的存在性及近似算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21274 2026-02-26 math.OC 50%

Optimal extraction with an impact on diffusion-jump pricing

最优提取与对扩散-跳跃定价的影响

Johanna Garzón, Jhonatan S. Mora Rodríguez, Harold A. Moreno-Franco

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在现货市场行动对商品价格产生负面影响的情况下,如何通过最优提取策略最大化预期净利润。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04867 2026-02-26 cs.GT 50%

Optimal Selection Using Algorithmic Rankings with Side Information

利用算法排名与侧信息的最优选择

Kate Donahue, Nicole Immorlica, Brendan Lucier

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在存在噪声排名和空闲-忙碌信号的情况下,代理如何利用算法排名进行最优选择,发现准确性提升可能反而导致次优社会结果。

详情

展开后加载摘要…

URL PDF HTML 收藏