arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-01 至 2026-04-01 共收录 115 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 4 篇

2603.29664 2026-04-01 cs.CV 82%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29847 2026-04-01 cs.GR cs.CV cs.HC 50%

CADReasoner: Iterative Program Editing for CAD Reverse Engineering

CADReasoner: 用于CAD逆向工程的迭代程序编辑

Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Gennadii Savrasov, Marina Barannikov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

机构 * Lomonosov Moscow State University(莫斯科国立大学) Université Paris Dauphine(巴黎多芬大学) Innopolis University(因诺波利斯大学) FusionBrain Lab(FusionBrain实验室)

专题命中 软件智能体 :agent(abstract)

AI总结 CADReasoner通过迭代优化几何差异,提升CAD逆向工程的精度与效率,实现多视角渲染与点云的融合,并在多个基准测试中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29834 2026-04-01 cs.SI 50%

Friends, Foes, and First Authors: A Game Theory Model of How Power Plays Rewrite Academic Co-Authorship Networks

朋友、敌人与第一作者:一种博弈论模型,说明权力博弈如何重写学术合著网络

Amit Bengal, Teddy Lazebnik

专题命中 软件智能体 :agent(abstract)

AI总结 本文通过博弈论模型研究权力博弈对学术合著网络的影响,发现战略型作者通过避免坚持后被拒绝,减少论文终止,提升合作效率和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2603.08533 2026-04-01 cs.CV 78%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 57%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29364 2026-04-01 eess.SP 50%

Intelligent Forensics in Next-Generation Mobile Networks: Evidence, Methods, and Applications

下一代移动网络中的智能取证:证据、方法与应用

Jiacheng Wang, Weihong Qin, Jialing He, Changyuan Zhao, Dusit Niyato, Tao Xiang

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本文探讨了下一代移动网络中的智能取证,提出以证据为中心的框架,系统化取证流程,并分析了传统方法与AI技术的互补作用,涵盖异常检测、溯源与时间线重建等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 1 篇

2603.28546 2026-04-01 cs.NI cs.CR 50%

Shy Guys: A Light-Weight Approach to Detecting Robots on Websites

Shy Guys: 一种轻量级的网站机器人检测方法

Rémi Van Boxem, Tom Barbette, Cristel Pelsser, Ramin Sadre

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种轻量级被动检测方法,结合用户代理分析与图标启发式,通过标准Web服务器日志检测机器人流量,准确率达67.7%,误报率3%,优于现有方法。

Comments 10 pages, 6 figures, submitted to IFIP TMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 17 篇

2603.21551 2026-04-01 cs.SE 85%

AI In Cybersecurity Education -- Scalable Agentic CTF Design Principles and Educational Outcomes

AI在网络安全教育中的应用:可扩展的智能体CTF设计原则与教育成效

Haoran Xi, Minghao Shao, Kimberly Milner, Venkata Sai Charan Putrevu, Nanda Rani, Meet Udeshi, Prashanth Krishnamurthy, Brendan Dolan-Gavitt, Siddharth Garg, Sandeep Kumar Shukla, Farshad Khorrami, Alon Hillel-Tuch, Muhammad Shafique, Ramesh Karri

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文研究了基于大语言模型的CTF竞赛设计,探讨了自主性水平和参与者知识背景对问题解决性能和学习行为的影响,提出自主性特定的评分标准和证据要求,以提升网络安全教育的可扩展性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 83%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI 79%

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28815 2026-04-01 cs.CR cs.AI 79%

SkillTester: Benchmarking Utility and Security of Agent Skills

SkillTester:智能体技能的评估与安全性的基准测试

Leye Wang, Zixing Wang, Anjie Xu

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education, Peking University(高可信软件技术教育部重点实验室(北京大学)) Northwestern Polytechnical University(西北工业大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 SkillTester通过对比原则和用户友好原则,评估智能体技能的实用性和安全性,提供标准化评分和安全状态标签,旨在提升智能体技能的质量保障。

Comments Technical report, 13 pages, 2 figures, 9 tables. Project page: https://skilltester.ai. Code: https://github.com/skilltester-ai/skilltester

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 78%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29322 2026-04-01 cs.HC 75%

VACP: Visual Analytics Context Protocol

VACP:视觉分析上下文协议

Tobias Stähle, Péter Ferenc Gyarmati, Thilo Spinner, Rita Sevastjanova, Dominik Moritz, Mennatallah El-Assady

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 本文提出VACP协议,旨在使视觉分析应用'agent友好',通过显式暴露应用状态和交互机制,提升AI代理在视觉分析任务中的执行效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29999 2026-04-01 cs.SE cs.AI cs.PL 73%

Phyelds: A Pythonic Framework for Aggregate Computing

Phyelds: 一个用于聚合计算的Pythonic框架

Gianluca Aguzzi, Davide Domini, Nicolas Farabegoli, Mirko Viroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Phyelds,一个针对数据科学实践者的Python库,旨在整合机器学习与聚合计算,提供轻量级的字段 calculus 模型实现,支持联邦学习和多智能体强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29020 2026-04-01 cs.AI 70%

Emergence WebVoyager: Toward Consistent and Transparent Evaluation of (Web) Agents in The Wild

WebVoyager的涌现:迈向Web代理在真实世界中一致和透明的评估

Deepak Akkil, Mowafak Allaham, Amal Raj, Tamer Abuelsaad, Ravi Kokku

机构 * Emergence AI Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Emergence WebVoyager,通过明确的任务实例化、失败处理、注释和报告指南,提高Web代理评估的一致性和透明度,并展示了OpenAI Operator在不同领域和任务类型中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18615 2026-04-01 cs.AI 68%

Improving Execution Concurrency in Partial-Order Plans via Block-Substitution

通过块替换改进部分序计划的执行并发性

Sabah Binte Noor, Fazlul Hasan Siddiqui

专题命中 Agent评测 :planning(abstract);分类 cs.AI;agent(journal_ref);autonomous agent(journal_ref)

AI总结 本文提出通过块替换优化部分序计划的并发性,通过引入非并发约束条件和资源优化算法,提升计划执行效率。

Comments arXiv admin note: text overlap with arXiv:2406.03091

Journal ref Autonomous Agents and Multi-Agent Systems, vol. 39, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 67%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29357 2026-04-01 cs.AI 57%

BenchScope: How Many Independent Signals Does Your Benchmark Provide?

BenchScope:你的基准测试提供了多少独立信号?

Tommy Sha, Stella Zhao

机构 * Stony Brook University(石溪大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出有效维度(ED)作为评估基准测量广度的快速诊断指标,揭示了现有基准测试中存在显著冗余问题,并提供了一种诊断流程以指导基准维护。

Comments Equal contribution; correspondence: tianming.sha@stonybrook.edu, zhao2052@umn.edu;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16081 2026-04-01 cs.HC cs.AI cs.MA 57%

Evaluation of Generative Models for Emotional 3D Animation Generation in VR

生成模型在VR中情感3D动画生成的评估

Kiran Chhatre, Renan Guarese, Andrii Matviienko, Christopher Peters

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过用户研究评估了三种先进的语音驱动3D动画方法,在快乐和中性情绪下的情感质量,发现显式建模情绪的方法更准确,但生成模型在面部表情质量和互动质量上仍需改进。

Comments 20 pages, 5 figures. Webpage: https://emotional3dhumans.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 57%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 50%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19123 2026-04-01 cs.CV 50%

StreetTree: A Large-Scale Global Benchmark for Fine-Grained Tree Species Classification

StreetTree: 一个大规模全球基准用于细粒度树种分类

Jiapeng Li, Yingjing Huang, Fan Zhang, Yu liu

机构 * Peking University(北京大学) University of Vienna(维也纳大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出StreetTree,首个大规模全球树种分类基准,包含1200万张图像,涵盖8300种常见树种,用于评估城市环境下的细粒度分类挑战与方法局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28551 2026-04-01 cs.CR cs.ET cs.HC cs.MA 50%

"What Did It Actually Do?": Understanding Risk Awareness and Traceability for Computer-Use Agents

它究竟做了什么?:理解计算机使用代理的风险意识与可追溯性

Zifan Peng, Mingchen Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了计算机使用代理的风险理解与事后审计问题,通过OpenClaw案例构建多源语料库并开展用户访谈,提出AgentTrace框架提升代理行为理解与信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他Agent 1 篇

2603.29149 2026-04-01 cs.AI cs.DB 70%

Knowledge database development by large language models for countermeasures against viruses and marine toxins

利用大语言模型开发知识库以应对病毒和海洋毒素的对策

Hung N. Do, Jessica Z. Kubicek-Sutherland, S. Gnanakaran

机构 * Physical Chemistry and Applied Spectroscopy Group, Chemistry Division, Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室物理化学与应用光谱学组,化学部)

专题命中 其他Agent :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文利用大语言模型构建病毒和海洋毒素的综合数据库,通过人工输入和模型交叉验证,设计交互式网页以提高决策效率。

Comments Clearance: 26-T-0967 (DOW)

详情

展开后加载摘要…

URL PDF HTML 收藏