arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-25 至 2026-03-25 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2603.22529 2026-03-25 cs.CV cs.AI cs.CL 86%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02548 2026-03-25 cs.CR cs.AI cs.LG 81%

CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale

CyberGym:大规模评估AI代理的真实世界网络安全能力

Zhun Wang, Tianneng Shi, Jingxuan He, Matthew Cai, Jialin Zhang, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22853 2026-03-25 cs.CR cs.AI 79%

Agent Audit: A Security Analysis System for LLM Agent Applications

代理审计:用于大语言模型代理应用的安全分析系统

Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Agent Audit系统,用于检测LLM代理应用中的安全漏洞,通过数据流分析、凭证检测等方法,提高召回率并保持快速扫描速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI 79%

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22315 2026-03-25 cs.LG cs.AI 73%

Emergency Preemption Without Online Exploration: A Decision Transformer Approach

紧急预emption无在线探索:一种决策变压器方法

Haoran Su, Hanxiao Deng, Yandong Sun

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于决策变压器的紧急走廊优化框架,通过离线返回条件序列建模,实现无在线环境交互的策略学习,提升紧急车辆调度的紧急程度控制,并通过多智能体决策变压器实现空间协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 73%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23279 2026-03-25 cs.SI cs.AI 70%

Emergence of Fragility in LLM-based Social Networks: the Case of Moltbook

基于大语言模型的社会网络中脆弱性的涌现:以Moltbook为例

Luca Sodano, Sofia Sciangula, Amulya Galmarini, Francesco Bertolotti

机构 * School of Industrial Engineering Intelligence, Complexity and Technology Lab (ICT Lab)(工业工程智能、复杂性与技术实验室) LIUC - Università Cattaneo Castellanza(LIUC-卡塔内奥卡斯泰尔兰扎大学) Università Cattaneo Castellanza(卡塔内奥卡斯泰尔兰扎大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中基于大语言模型的智能体交互网络,发现其连接模式高度异质,存在核心外围结构,对随机节点移除较 resilient,但对高连接节点的攻击易受破坏,揭示AI社交系统可能发展出集中化与结构性脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23059 2026-03-25 cs.AI 70%

Minibal: Balanced Game-Playing Without Opponent Modeling

Minibal:无需对手建模的平衡游戏

Quentin Cohen-Solal, Tristan Cazenave

机构 * LAMSADE, Université Paris-Dauphine, PSL, CNRS(巴黎第四大学LAMSADE研究所,巴黎法兰西理工大学,法国国家科学研究中心)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Minibal算法,通过改进极大极小算法实现平衡游戏策略,实验表明其在多种棋盘游戏中表现出接近完美平衡的性能,为设计兼具挑战性与趣味性的AI代理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22954 2026-03-25 cs.CR cs.LG 70%

Privacy-Preserving EHR Data Transformation via Geometric Operators: A Human-AI Co-Design Technical Report

通过几何运算实现隐私保护的电子健康记录数据转换:一个人工智能与人类协同设计技术报告

Maolin Wang, Beining Bao, Gan Yuan, Hongyu Chen, Bingkun Zhao, Baoshuo Kan, Jiming Xu, Qi Shi, Yinggong Zhao, Yao Wang, Wei Ying Ma, Jun Yan

机构 * Hong Kong Institute of AI for Science (HKAI-Sci), City University of Hong Kong(香港人工智能科学研究院(HKAI-Sci),香港城市大学) Department of Biostatistics, City University of Hong Kong(香港城市大学生物统计学系) Institute of Digital Medicine, City University of Hong Kong(香港城市大学数字医学研究院) YIDU TECH co. Ltd.(YIDU科技有限公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护的数据转换框架,通过几何运算在保持医学语义和统计特性的同时,防止直接关联受保护的患者属性,解决了数据共享中的隐私和互操作性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22489 2026-03-25 cs.CR cs.SE 70%

Model Context Protocol Threat Modeling and Analyzing Vulnerabilities to Prompt Injection with Tool Poisoning

模型上下文协议威胁建模及针对提示注入的漏洞分析

Charoes Huang, Xin Huang, Ngoc Phu Tran, Amin Milani Fard

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 本文基于STRIDE和DREAD框架对MCP五个关键组件进行威胁建模,发现工具污染是主要客户端漏洞,提出多层防御策略以提升AI代理生态的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22767 2026-03-25 cs.AI cs.CL 62%

Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases

大语言模型代理能否生成真实世界证据?评估医学数据库中的观察性研究

Dubai Li, Yuxiang He, Yan Hu, Yu Tian, Jingsong Li

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究评估了大语言模型代理在生成真实世界证据方面的能力,通过RWE-bench基准测试,发现代理在生成完整证据包方面存在显著局限,需进一步改进验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22892 2026-03-25 cs.LG 57%

VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents

VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体

Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China Computational Intelligence Center (CIC), School of Computer Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出VLGOR框架,结合视觉和语言知识生成虚拟轨迹,提升智能体在未见任务中的泛化能力,实验显示其性能比基线方法高24%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22617 2026-03-25 cs.HC cs.AI 57%

Do Consumers Accept AIs as Moral Compliance Agents?

消费者是否将人工智能视为道德合规代理?

Greg Nyilasy, Abraham Ryan Ade Putra Hito, Jennifer Overbeck, Brock Bastian, Darren W. Dahl

机构 * Faculty of Business and Economics, University of Melbourne(商学院与经济学院,墨尔本大学) University of Melbourne(墨尔本大学) University of Melbourne, Parkville(墨尔本大学,帕克维尔)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨消费者是否接受人工智能作为道德合规代理,发现消费者更倾向于认可AI遵守既定道德规范,而非行使主观判断,这源于对AI无隐藏动机的推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22499 2026-03-25 cs.CR cs.LG 57%

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

OrgForge-IT:一种可验证的合成基准用于基于大语言模型的内部威胁检测

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出OrgForge-IT,一种可验证的合成基准,通过确定性模拟引擎和语言模型生成表面文本,确保跨 artifact 一致性。研究发现多模型 leaderboard 显示,三类威胁和八种可注入行为的检测策略存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 57%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI 57%

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08916 2026-03-25 cs.LG math.DS q-bio.QM 57%

Enhancing generalizability of model discovery across parameter space with multi-experiment equation learning (ME-EQL)

通过多实验方程学习提升参数空间中的模型泛化能力(ME-EQL)

Maria-Veronica Ciocanel, John T. Nardini, Kevin B. Flores, Erica M. Rutter, Suzanne S. Sindi, Alexandria Volkening

机构 * Departments of Mathematics and Biology, Duke University(数学与生物学系,杜克大学) Department of Mathematics and Statistics, The College of New Jersey(数学与统计学系,新泽西学院) Department of Mathematics, Center for Research in Scientific Computation, North Carolina State University(数学系,科学计算研究中心,北卡罗来纳州立大学) Department of Applied Mathematics, University of California, Merced(应用数学系,加州大学默塞德分校) Department of Mathematics, Purdue University(数学系,普渡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出ME-EQL方法,通过单变量和嵌入结构两种方式提升从多实验中学习模型的泛化能力,减少参数恢复误差。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07396 2026-03-25 quant-ph cs.AI 57%

Automating quantum feature map design via large language models

通过大语言模型自动化量子特征图设计

Kenya Sakka, Kosuke Mitarai, Keisuke Fujii

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) Graduate School of Engineering Science(工程科学研究生院) RIKEN Center for Quantum Computing(理化学研究所量子计算中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自主生成、评估和优化量子特征图,通过实验在MNIST等数据集上实现超越现有量子特征图的性能,展示了闭环发现方法在量子电路设计中的应用价值。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23122 2026-03-25 cs.CV 50%

PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection

PiCo:主动流形规范化的稳健机器人视觉异常检测

Teng Yan, Binkai Liu, Shuai Liu, Yue Yu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 Agent评测 :agent(abstract)

AI总结 PiCo通过主动流形规范化解决机器人视觉异常检测在多姿态和不稳定环境下的鲁棒性问题,采用分阶段机制提升几何不确定性和噪声消除能力,实验显示其在静态和闭环场景中均取得显著性能提升。

Comments 16 pages. Submitted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏