arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2504.10147 2025-04-15 cs.IR 85%

A Survey of Personalization: From RAG to Agent

Xiaopeng Li, Pengyue Jia, Derong Xu, Yi Wen, Yingyi Zhang, Wenlin Zhang, Wanyu Wang, Yichao Wang, Zhaocheng Du, Xiangyang Li, Yong Liu, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12058 2025-02-18 cs.MA cs.CY 85%

A survey about perceptions of mobility to inform an agent-based simulator of subjective modal choice

Carole Adam, Benoit Gaudou

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2406.02063

Journal ref JFSMA-JFMS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18002 2025-01-31 cs.HC 85%

Agentic Workflows for Conversational Human-AI Interaction Design

Arthur Caetano, Kavya Verma, Atieh Taheri, Radha Kumaran, Zichen Chen, Jiaao Chen, Tobias Höllerer, Misha Sra

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.04511 2018-05-15 cs.AI cs.LG cs.MA 84%

A Study of AI Population Dynamics with Million-agent Reinforcement Learning

Yaodong Yang, Lantao Yu, Yiwei Bai, Jun Wang, Weinan Zhang, Ying Wen, Yong Yu

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

Comments Full version of the paper presented at AAMAS 2018 (International Conference on Autonomous Agents and Multiagent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 84%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05201 2026-08-07 cs.CR cs.AI 新提交 84%

ASTELD: A Six-Axis Classification Framework for Autonomous AI Agents - Design, Evaluation, and an OpenClaw Case Study

ASTELD:自主AI智能体的六轴分类框架——设计、评估与OpenClaw案例研究

Siyuan Li, Peng Shu, Churan Yu, Peilong Wang, Ruidong Zhang, Bowen Guo, Xinliang Li, Ruiyu Yan, Arif Hassan Zidan, Yi Pan, Wei Ruan, Lifeng Chen, Junhao Chen, Zhaojun Ding, Yiwei Li, Zhengliang Liu, Haixing Dai, Lin Zhao, Yu Bao, Xiang Li, Wei Zhang, Tianming Liu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI

AI总结 该研究提出ASTELD六轴分类框架,用于比较自主AI智能体平台,通过案例研究验证其效用,揭示跨平台模式与创新方向,发现本地优先部署与企业级安全结合的空白区域。

Comments 40 pages, 4 figures, 6 tables. Introduces and empirically evaluates the ASTELD six-axis classification framework across eight autonomous AI agent platforms, with OpenClaw as an in-depth case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29677 2026-08-06 cs.AI 版本更新 84%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02171 2026-08-04 cs.AI 新提交 84%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 84%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31351 2026-06-01 cs.CL cs.CV 84%

A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 Agent评测 :agent(summary_cn,abstract);workflow(abstract);分类 cs.CL

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 84%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20281 2026-03-24 cs.GT cs.AI 84%

On the Fragility of AI Agent Collusion

AI代理合谋的脆弱性

Jussi Keppo, Yuze Li, Gerry Tsoukalas, Nuo Yuan

机构 * National University of Singapore(新加坡国立大学) Boston University(波士顿大学)

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI

AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。

Comments 48 pages, 7 figures, 8 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 84%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19738 2025-11-06 cs.AI 84%

Misalignment Bounty: Crowdsourcing AI Agent Misbehavior

Rustem Turtayev, Natalia Fedorova, Oleg Serikov, Sergey Koldyba, Lev Avagyan, Dmitrii Volkov

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI

Comments Add Limitations section

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22898 2025-08-01 cs.HC cs.CL 84%

Voice-guided Orchestrated Intelligence for Clinical Evaluation (VOICE): A Voice AI Agent System for Prehospital Stroke Assessment

Julian Acosta, Scott Adams, Julius Kernbach, Romain Hardy, Sung Eun Kim, Luyang Luo, Xiaoman Zhang, Shreya Johri, Mohammed Baharoon, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) University of Saskatchewan(萨斯喀彻温大学) University Hospital Heidelberg (UKHD)(海德堡大学医院(UKHD))

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08514 2025-02-14 cs.CL 84%

Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation

Mahnaz Koupaee, Jake W. Vincent, Saab Mansour, Igor Shalyminov, Han He, Hwanjun Song, Raphael Shu, Jianfeng He, Yi Nian, Amy Wing-mei Wong, Kyu J. Han, Hang Su

专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13608 2026-08-17 cs.AI cs.CR cs.LG 新提交 84%

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

基于缩放假设的无标签智能体学习控制器能力评估

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger

机构 * Georgian

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。

Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-14 cs.CL cs.AI cs.CY 新提交 84%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 Agent评测 :AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11469 2026-08-13 cs.CR cs.AI cs.SE 新提交 84%

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

智能体网络安全的下一个挑战:一个现实、无污染的逆向工程基准

Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对智能体逆向工程基准的缺陷,构建SRE-Bench基准,评估五款前沿LLMs的逆向工程能力,发现RE仍未解决,强调其为智能体网络安全重要前沿及SRE-Bench的测试价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11236 2026-08-13 cs.CL cs.AI 新提交 84%

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

TRACE Bench:任务驱动的角色扮演智能体清单评估基准

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

机构 * Kuaishou GameMind Lab(快手GameMind实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。

Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 84%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05266 2026-08-07 cs.AI cond-mat.mtrl-sci cs.LG 新提交 84%

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务

Nathan S Johnson, Ian Abshire

机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04761 2026-08-07 cs.CL cs.AI 版本更新 84%

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

InsightEmb:面向智能体洞察检索的动作-意图嵌入学习

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu

机构 * The Hong Kong University of Science and Technology(香港科技大学) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 84%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 84%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26490 2026-07-30 cs.AI cs.LG cs.NE 新提交 84%

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架

Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26313 2026-07-30 cs.SE cs.AI cs.CY 新提交 84%

SARC-DQ: Runtime Data-Quality Gating for Agentic AI: Silent Evidence Defects, the Incompetence Shield, and Downstream-Only Remediation

SARC-DQ:智能体AI的运行时数据质量门控:隐性证据缺陷、无能防护机制与仅下游修复

Gaston Besanson

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对智能体AI的元数据缺陷问题,提出SARC-DQ运行时数据质量门控机制,实验显示模型能力未提升怀疑能力,所提门控结合下游修复可恢复部分损失,无模型预言机能精准跟踪缺陷率。

Comments https://github.com/besanson/dqSarc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 84%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22321 2026-07-27 cs.CR cs.AI cs.SE 版本更新 84%

ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents

对时间、空间和语义规避的自主代理进行基准测试

Jianan Ma, Xiaohu Du, Ruixiao Lin, Yaoxiang Bian, Jialuo Chen, Yunhao Feng, Xiaofang Yang, Shiwen Cui, Changhua Meng, Xinhao Deng, Jingyi Wang, Zhen Wang

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。

Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 84%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏