arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-01 至 2026-04-01 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2603.21551 2026-04-01 cs.SE 85%

AI In Cybersecurity Education -- Scalable Agentic CTF Design Principles and Educational Outcomes

AI在网络安全教育中的应用:可扩展的智能体CTF设计原则与教育成效

Haoran Xi, Minghao Shao, Kimberly Milner, Venkata Sai Charan Putrevu, Nanda Rani, Meet Udeshi, Prashanth Krishnamurthy, Brendan Dolan-Gavitt, Siddharth Garg, Sandeep Kumar Shukla, Farshad Khorrami, Alon Hillel-Tuch, Muhammad Shafique, Ramesh Karri

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文研究了基于大语言模型的CTF竞赛设计,探讨了自主性水平和参与者知识背景对问题解决性能和学习行为的影响,提出自主性特定的评分标准和证据要求,以提升网络安全教育的可扩展性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 83%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI 79%

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28815 2026-04-01 cs.CR cs.AI 79%

SkillTester: Benchmarking Utility and Security of Agent Skills

SkillTester:智能体技能的评估与安全性的基准测试

Leye Wang, Zixing Wang, Anjie Xu

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education, Peking University(高可信软件技术教育部重点实验室(北京大学)) Northwestern Polytechnical University(西北工业大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 SkillTester通过对比原则和用户友好原则,评估智能体技能的实用性和安全性,提供标准化评分和安全状态标签,旨在提升智能体技能的质量保障。

Comments Technical report, 13 pages, 2 figures, 9 tables. Project page: https://skilltester.ai. Code: https://github.com/skilltester-ai/skilltester

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 78%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29322 2026-04-01 cs.HC 75%

VACP: Visual Analytics Context Protocol

VACP:视觉分析上下文协议

Tobias Stähle, Péter Ferenc Gyarmati, Thilo Spinner, Rita Sevastjanova, Dominik Moritz, Mennatallah El-Assady

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 本文提出VACP协议,旨在使视觉分析应用'agent友好',通过显式暴露应用状态和交互机制,提升AI代理在视觉分析任务中的执行效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29999 2026-04-01 cs.SE cs.AI cs.PL 73%

Phyelds: A Pythonic Framework for Aggregate Computing

Phyelds: 一个用于聚合计算的Pythonic框架

Gianluca Aguzzi, Davide Domini, Nicolas Farabegoli, Mirko Viroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Phyelds,一个针对数据科学实践者的Python库,旨在整合机器学习与聚合计算,提供轻量级的字段 calculus 模型实现,支持联邦学习和多智能体强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29020 2026-04-01 cs.AI 70%

Emergence WebVoyager: Toward Consistent and Transparent Evaluation of (Web) Agents in The Wild

WebVoyager的涌现:迈向Web代理在真实世界中一致和透明的评估

Deepak Akkil, Mowafak Allaham, Amal Raj, Tamer Abuelsaad, Ravi Kokku

机构 * Emergence AI Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Emergence WebVoyager,通过明确的任务实例化、失败处理、注释和报告指南,提高Web代理评估的一致性和透明度,并展示了OpenAI Operator在不同领域和任务类型中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18615 2026-04-01 cs.AI 68%

Improving Execution Concurrency in Partial-Order Plans via Block-Substitution

通过块替换改进部分序计划的执行并发性

Sabah Binte Noor, Fazlul Hasan Siddiqui

专题命中 Agent评测 :planning(abstract);分类 cs.AI;agent(journal_ref);autonomous agent(journal_ref)

AI总结 本文提出通过块替换优化部分序计划的并发性,通过引入非并发约束条件和资源优化算法,提升计划执行效率。

Comments arXiv admin note: text overlap with arXiv:2406.03091

Journal ref Autonomous Agents and Multi-Agent Systems, vol. 39, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 67%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29357 2026-04-01 cs.AI 57%

BenchScope: How Many Independent Signals Does Your Benchmark Provide?

BenchScope:你的基准测试提供了多少独立信号?

Tommy Sha, Stella Zhao

机构 * Stony Brook University(石溪大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出有效维度(ED)作为评估基准测量广度的快速诊断指标,揭示了现有基准测试中存在显著冗余问题,并提供了一种诊断流程以指导基准维护。

Comments Equal contribution; correspondence: tianming.sha@stonybrook.edu, zhao2052@umn.edu;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16081 2026-04-01 cs.HC cs.AI cs.MA 57%

Evaluation of Generative Models for Emotional 3D Animation Generation in VR

生成模型在VR中情感3D动画生成的评估

Kiran Chhatre, Renan Guarese, Andrii Matviienko, Christopher Peters

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过用户研究评估了三种先进的语音驱动3D动画方法,在快乐和中性情绪下的情感质量,发现显式建模情绪的方法更准确,但生成模型在面部表情质量和互动质量上仍需改进。

Comments 20 pages, 5 figures. Webpage: https://emotional3dhumans.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 57%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 50%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19123 2026-04-01 cs.CV 50%

StreetTree: A Large-Scale Global Benchmark for Fine-Grained Tree Species Classification

StreetTree: 一个大规模全球基准用于细粒度树种分类

Jiapeng Li, Yingjing Huang, Fan Zhang, Yu liu

机构 * Peking University(北京大学) University of Vienna(维也纳大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出StreetTree,首个大规模全球树种分类基准,包含1200万张图像,涵盖8300种常见树种,用于评估城市环境下的细粒度分类挑战与方法局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28551 2026-04-01 cs.CR cs.ET cs.HC cs.MA 50%

"What Did It Actually Do?": Understanding Risk Awareness and Traceability for Computer-Use Agents

它究竟做了什么?:理解计算机使用代理的风险意识与可追溯性

Zifan Peng, Mingchen Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了计算机使用代理的风险理解与事后审计问题,通过OpenClaw案例构建多源语料库并开展用户访谈,提出AgentTrace框架提升代理行为理解与信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏