arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-10 至 2026-04-10 共收录 25 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 25 篇

2604.07883 2026-04-10 cs.AI cs.CL cs.CY cs.MA 84%

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

用于教育教科书历史偏见检测的代理评估架构

Gabriel Stefan, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种代理评估架构,通过多模态筛查代理、异质陪审团和元代理,有效检测教育教科书中的隐性偏见,实验表明其在经济性和准确性上具有优势。

Comments Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR 84%

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07988 2026-04-10 cs.DC cs.AI 83%

LogAct: Enabling Agentic Reliability via Shared Logs

LogAct:通过共享日志实现代理可靠性

Mahesh Balakrishnan, Ashwin Bharambe, Davide Testuggine, David Geraghty, David Mao, Vidhya Venkat, Ilya Mironov, Rithesh Baradi, Gayathri Aiyer, Victoria Dudin

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 LogAct通过共享日志实现代理可靠性,允许代理通过LLM推理分析执行历史,实现故障恢复、健康检查和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 83%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI 81%

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 79%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 79%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 79%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 79%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07733 2026-04-10 cs.AI 77%

CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V

CivBench:基于进展的评估用于LLM在文明V中的战略决策

John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 CivBench通过训练模型在回合级游戏状态上估计胜利概率,评估LLM在文明V多玩家中的战略决策能力,揭示代理设置对模型的影响及不同战略特征。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 73%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 70%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07535 2026-04-10 cs.AI 70%

Trust the AI, Doubt Yourself: The Effect of Urgency on Self-Confidence in Human-AI Interaction

信任人工智能,怀疑自己:紧迫感对人机交互中自信心的影响

Baran Shajari, Xiaoran Liu, Kyanna Dagenais, Istvan David

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了紧迫感对人机交互中人类自信心的影响,发现尽管紧迫感不影响对AI的信任,但可能损害人类的自信心和自我效能感,进而影响性能和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 70%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07629 2026-04-10 cs.HC 67%

Behavior Latticing: Inferring User Motivations from Unstructured Interactions

行为编织:从无结构交互中推断用户动机

Dora Zhao, Michelle S. Lam, Diyi Yang, Michael S. Bernstein

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出行为编织架构,通过连接看似无关的行为,推断用户需求并发现隐含动机,验证其在理解用户需求方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07385 2026-04-10 cs.LG cs.AI 62%

Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control

用130万参数进行DOOM游戏:专用小型模型与大型语言模型在实时游戏控制中的对比

David Golchinfar, Daryoush Vaziri, Alexander Marquardt

机构 * VAGO Solutions University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用技术大学) Cybernetics and Reality Engineering (CARE) Laboratory, Nara Institute of Science and Technology(奈良先端科学技术大学院大学控制论与真实工程实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SauerkrautLM-Doom-MultiVec模型,通过31ms/决策的ASCII帧表示选择游戏动作,在实时DOOM游戏中超越了包括Nemotron-120B在内的大型语言模型,展示了专用小型模型在实时控制任务中的优势。

Comments 17 pages, 3 figures, 3 tables. Code and model weights available at https://github.com/VAGOsolutions/SauerkrautLM-Doom-MultiVec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07360 2026-04-10 cs.AR cs.AI cs.LG 62%

Position Paper: From Edge AI to Adaptive Edge AI

观点论文:从边缘AI到自适应边缘AI

Fabrizio Pittorino, Manuel Roveri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出边缘AI必须适应变化的环境,探讨了自适应边缘AI的理论保证、动态架构和系统分解等研究挑战。

Comments 8 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07355 2026-04-10 cs.LG cs.AI econ.GN q-fin.EC 62%

Prediction Arena: Benchmarking AI Models on Real-World Prediction Markets

预测竞技场:在真实世界预测市场中评估AI模型

Jaden Zhang, Gardenia Liu, Oliver Johansson, Hileamlak Yitayew, Kamryn Ohly, Grace Li

机构 * Arcada Labs Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预测竞技场,通过让AI模型在真实预测市场上自主交易来评估其预测准确性和决策能力。研究分析了不同模型在真实市场中的表现,揭示了预测准确性及正确预测的利用能力是关键因素,同时展示了平台设计对模型成功的影响。

Comments 18 pages, 10 figures, 3 tables. Evaluation period: January 12 - March 9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07551 2026-04-10 cs.CR cs.AI 57%

MCP-DPT: A Defense-Placement Taxonomy and Coverage Analysis for Model Context Protocol Security

MCP-DPT:模型上下文协议安全的防御放置分类与覆盖分析

Mehrdad Rostamzadeh, Sidhant Narula, Nahom Birhan, Mohammad Ghasemigol, Daniel Takabi

机构 * Old Dominion University(老道明大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出MCP-DPT框架,分析模型上下文协议的安全性,识别防御点并揭示架构不匹配导致的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07423 2026-04-10 cs.RO cs.LG 57%

OpenPRC: A Unified Open-Source Framework for Physics-to-Task Evaluation in Physical Reservoir Computing

OpenPRC: 一个用于物理共振计算中任务评估的统一开源框架

Yogesh Phalak, Wen Sin Lor, Apoorva Khairnar, Benjamin Jantzen, Noel Naughton, Suyi Li

机构 * Virginia Tech(弗吉尼亚理工大学) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) Department of Philosophy, Virginia Tech(弗吉尼亚理工大学哲学系) Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 OpenPRC通过统一的数据接口整合高保真模拟轨迹和实验测量,提供可重复的评估、分析和物理感知优化,支持多种物理子系统和数据源。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 57%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15512 2026-04-10 cs.LG 57%

SALSA-RL: Stability Analysis in the Latent Space of Actions for Reinforcement Learning

SALSA-RL:强化学习中动作潜空间的稳定性分析

Xuyang Li, Romit Maulik

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 SALSA-RL通过动作潜空间的局部稳定性分析,为强化学习提供可解释性,使在不损害性能的前提下评估预训练智能体的动作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08517 2026-04-10 cs.GT 50%

Learning vs. Optimizing Bidders in Budgeted Auctions

学习与优化投标人在预算拍卖中的博弈

Giannis Fikioris, Balasubramanian Sivan, Éva Tardos

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究预算拍卖中学习者与优化者在贝叶斯设定下的重复交互,提出预算Stackelberg均衡概念,证明在预算约束下优化策略需时间分层,并证明比例控制器在预算下具有战略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08443 2026-04-10 cs.RO cs.HC 50%

A Soft Robotic Interface for Chick-Robot Affective Interactions

一种柔软的机器人接口用于鸡-机器人情感互动

Jue Chen, Alexander Mielke, Kaspar Althoefer, Elisabetta Versace

机构 * Queen Mary University of London(伦敦玛丽女王大学) School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦玛丽女王大学生物与行为科学学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种以动物为中心的柔软机器人情感接口,用于新生鸡的机器人情感互动研究,通过温度、呼吸样变形和面孔状视觉刺激等安全可控的提示,评估鸡对接口的接受度及与机器人互动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08211 2026-04-10 cs.CV 50%

SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection

SciFigDetect:一种用于AI生成科学图表检测的基准测试

You Hu, Chenzhuo Zhao, Changfa Mo, Haotian Liu, Xiaobai Li

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究员) University of Oulu(奥卢大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出首个AI生成科学图表检测基准,通过多模态数据管道构建,涵盖多种图表类别和生成源,揭示现有方法在零样本迁移和对抗性攻击下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏