arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-29 至 2026-04-29 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2604.24826 2026-04-29 cs.CR cs.AI 88%

A Comparative Evaluation of AI Agent Security Guardrails

AI代理安全防护的比较评估

Qi Li, Jiu Li, Pingtao Wei, Jianjun Xu, Xueyi Wei, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Lingquan Zhou

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24842 2026-04-29 cs.AI cs.MA cs.MM 88%

Co-Director: Agentic Generative Video Storytelling

Co-Director: 基于代理的生成视频叙事

Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine Leon, Khanh G. LeViet, Zack Chomyn, Joe Timmons, Brett Slatkin, Scott Penberthy, Tomas Pfister

机构 * Google(谷歌)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);multi-agent(abstract);分类 cs.AI

AI总结 本文提出Co-Director框架,通过分层多代理方法解决视频生成的语义一致性问题,引入分层参数化和多模态自优化循环,实现叙事策略探索与有效配置的平衡,通过GenAD-Bench验证其在个性化广告中的优越性。

Comments Project Page: https://co-director-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25083 2026-04-29 cs.AI cs.AR 87%

Agentic Architect: An Agentic AI Framework for Architecture Design Exploration and Optimization

代理架构:一种用于建筑设计探索和优化的代理AI框架

Alexander Blasberg, Vasilis Kypriotis, Dimitrios Skarlatos

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title,summary_cn);分类 cs.AI

AI总结 本文提出Agentic Architect框架,结合LLM驱动的代码进化与精确模拟,实现计算机架构设计的探索与优化,展示了在缓存替换、数据预取和分支预测等领域的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24929 2026-04-29 cs.CL cs.AI 86%

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

GAIA-v2-LILT:超越翻译的代理基准多语言适应

Yunsu Kim, Kaden Uhlig, Joern Wuebker

机构 * LILT

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出GAIA-v2-LILT,通过功能对齐、文化对齐和难度校准改进多语言代理基准,实验表明其性能提升达32.7%,接近英语表现,但仍有较大差距,揭示了多语言性能差距主要由基准测量误差引起。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00592 2026-04-29 cs.AI cs.SE 84%

DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder

DockSmith:通过代理Docker构建器实现可靠编码环境的扩展

Jiaran Zhang, Luck Ma, Fanqi Wan, Di Qi, Xu Zhao, Jieyi Hou, Zhe Xie, Mengqiang Ren, Xin Wu, Zhewei Huang, Liangyu Chen, Qi Han, Xiangyu Zhang

机构 * SWE-Factory Anthropic Comanici Guo Yang Zeng

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 DockSmith通过代理Docker构建器解决软件工程代理执行基础训练和评估中的可靠环境构建问题,其核心能力涵盖长期工具使用、依赖推理和故障恢复,提升了Docker构建的监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25109 2026-04-29 cs.CR cs.AI 83%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00931 2026-04-29 cs.AI 83%

PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor

PsychAgent: 一种基于经验的终身学习代理用于自我进化的心理辅导员

Yutao Yang, Junsong Li, Qianjun Pan, Jie Zhou, Kai Chen, Qin Chen, Jingyuan Zhao, Ningning Zhou, Xin Li, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出PsychAgent,通过长期多会话交互的内存增强规划引擎、技能进化引擎和强化内化引擎,实现心理辅导员的自我进化,提升多会话咨询的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24955 2026-04-29 cs.CL cs.AI cs.SE 82%

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

BenchGuard:谁守护着基准?对LLM代理基准的自动化审计

Xinming Tu, Tianze Wang, Yingzhou, Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

机构 * Allen School, University of Washington(华盛顿大学阿伦学院) Phylo, Inc.(Phylo公司) Genentech, Inc.(基因泰克公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 BenchGuard通过结构化LLM协议交叉验证所有基准制品,发现ScienceAgentBench中的12个问题,并在BIXBench Verified-50子集中准确识别83.3%的问题,证明自动化基准审计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07014 2026-04-29 physics.soc-ph cs.SI 78%

When cardinals strategize: An agent-based model of influence and ideology for the papal conclave

当基数策略化:一个关于影响力和意识形态的代理模型,用于教皇选举会议

Nuno Crokidakis

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出并分析了两个基于代理的模型,研究教皇选举会议的动力学,探讨社会影响、战略投票和意识形态一致如何影响选举教皇所需时间。模型引入了意识形态集团,通过模拟发现意识形态极化会延迟选举,但较高的战略响应性可提高效率。

Comments 15 pages, 5 figures, to appear in Chaos, Solitons & Fractals

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22597 2026-04-29 cs.SE cs.CL 73%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01553 2026-04-29 cs.IR 67%

IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data

IoDResearch:通过互联网的数据进行私有异构数据的深度研究

Zhuofan Shi, Zijie Guo, Xinjian Ma, Gang Huang, Yun Ma, Xiang Jing

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出IoDResearch框架,通过将异构资源转化为FAIR合规的数字对象,提升私有数据的检索效率和可重用性,实验表明其在检索、问答和报告生成任务中优于现有基线方法。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25614 2026-04-29 cs.AI 57%

HotComment: A Benchmark for Evaluating Popularity of Online Comments

HotComment: 一个评估在线评论流行度的基准

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出HotComment基准,通过内容质量、流行度预测和用户行为模拟三个维度评估在线评论的流行度,同时引入StyleCmt提升社交共振效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25152 2026-04-29 cs.CR cs.CL 57%

MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors

MGTEVAL:一种用于机器生成文本检测器系统性评估的交互平台

Yuanfan Li, Qi Zhou, Chengzhengxu Li, Zhaohan Zhang, Chenxu Zhao, Zepu Ruan, Chao Shen, Xiaoming Liu

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Queen Mary University of London(伦敦大学女王学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 MGTEVAL平台通过统一接口构建自定义基准、应用文本攻击测试集、训练检测器并评估性能,解决MGT检测评估碎片化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 57%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11443 2026-04-29 cs.CL cs.SI 57%

A Transformer-Based Cross-Platform Analysis of Public Discourse on the 15-Minute City Paradigm

基于Transformer的跨平台公共 discourse 对15分钟城市范式的分析

Gaurab Chhetri, Darrell Anderson, Boniphace Kutela, Subasish Das

机构 * 1 College of Science Engineering, Texas State University, San Marcos, Texas, USA Email 3 Texas A\&M Transportation Institute, Texas A\&M University, Houston, Texas, USA Email

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本研究首次跨平台分析15分钟城市概念的公共 discourse,采用压缩Transformer模型进行多平台情感分类,发现DistilRoBERTa表现最佳,MiniLM一致性最高,揭示平台特性差异及压缩模型的高效优势。

Comments This is the author's preprint version of a paper accepted for presentation at the 24th International Conference on Machine Learning and Applications (ICMLA 2025), December 3-5, 2025, Florida, USA. The final published version will appear in the official IEEE proceedings. Conference site: https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25761 2026-04-29 econ.TH 50%

The Core in a Distributional Economy

分布经济中的核心

Michael Greinecker, Konrad Podczeck

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出通过分布而非个体描述分析经济核心,证明分布论可直接识别阻塞联盟,推导出经典核心等价定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10842 2026-04-29 eess.SY cs.SY 50%

BOOST: Microgrid Sizing using Ordinal Optimization

BOOST:利用序优化进行微电网规模设计

Mohamad Chehade, Sami Karaki

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出BOOST方法,结合序优化与混合整数线性规划,通过筛选候选方案并重新评估最优方案,提高微电网设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25038 2026-04-29 q-bio.PE 50%

Equation Learning for multiscale models of infectious diseases

多尺度传染病模型中的方程学习

James W. G. Doran, Cameron A. Smith, Christian A. Yates, Ruth Bowness

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种性别分层多尺度框架,通过学习常微分方程捕捉宿主内模型的平均输出,并用于描述多尺度框架的宿主内尺度,同时利用ODEs演化种群人口动态并用随机耦合函数连接不同尺度,探讨性别对结核病动态的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24988 2026-04-29 astro-ph.EP astro-ph.IM 50%

RSCL Earth Lookback Simulator: A Real-Time Multi-Physics Framework for Relativistic Signal Propagation from Confirmed Milky Way Exoplanets

RSCL地球回溯模拟器:一个用于恒星系中相对论信号传播的实时多物理框架

Mohamed El-Hadedy

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出RSCL地球回溯模拟器,通过实时多物理方法,结合已确认的银河系系外行星参数,同时应用七种物理效应,填补了现有公开浏览器框架的空白。

Comments 13 pages, 4 figures (6 panels), open-source tool available at https://mealycpp.github.io/rscl-simulator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22842 2026-04-29 cond-mat.soft cond-mat.mes-hall cond-mat.stat-mech physics.bio-ph q-bio.BM 50%

Actively induced supercoiling can slow down plasmid solutions by trapping the threading entanglements

主动诱导超螺旋可减缓质粒溶液通过 trapping 线状缠结

Roman Staňo, Renáta Rusková, Dušan Račko, Jan Smrek

专题命中 Agent评测 :agent(abstract)

AI总结 研究通过分子模拟探讨非平衡条件下超螺旋剂对质粒拓扑结构的影响,发现其能锁住线状缠结,减缓松弛过程,为动态调控大分子系统提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏