arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-20 至 2026-04-20 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2604.05552 2026-04-20 cs.CL cs.AI 88%

Context-Agent: Dynamic Discourse Trees for Non-Linear Dialogue

上下文代理:非线性对话的动态 discourse 树

Junan Hu, Shudan Guo, Wenqi Liu, Jianhua Yin, Yinwei Wei

机构 * Shandong University(山东大学)

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI、cs.CL

AI总结 本文提出 Context-Agent 框架,通过动态树结构建模对话历史,解决非线性对话中的上下文管理问题,并引入 NTM 评估基准,提升多轮对话任务完成率和效率。

Comments 14 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI 86%

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 80%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL 79%

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI 79%

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24621 2026-04-20 cs.AI 79%

ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence

ARC-AGI-3:前沿代理智能的新挑战

ARC Prize Foundation

机构 * ARC Prize Foundation(ARC奖基金会)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARC-AGI-3基准测试,通过新颖的抽象回合制环境评估代理智能的适应效率,人类可完全解决环境,而前沿AI系统得分低于1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05808 2026-04-20 cs.CL cs.AI cs.LG 78%

EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis

EnvScaler:通过程序合成实现LLM代理的可扩展工具交互环境

Xiaoshuai Song, Haofei Chang, Guanting Dong, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EnvScaler框架,通过程序合成构建大量工具交互环境,用于LLM代理的监督微调和强化学习,提升其在复杂多轮多工具交互环境中的任务解决能力。

Comments Add some experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 70%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 70%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15461 2026-04-20 cs.LG cs.CL cs.CR 62%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 62%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15760 2026-04-20 cs.AI cs.GT 57%

KWBench: Measuring Unprompted Problem Recognition in Knowledge Work

KWBench:测量知识工作中无提示的问题识别

Ankit Maloo

机构 * Clio AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 KWBench是首个评估大语言模型无提示问题识别能力的基准,通过223个专业任务测试模型能否从原始输入中识别情境结构,揭示模型在问题识别与应用间的差异。

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 57%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27312 2026-04-20 cs.LG 57%

Scalable Maximum Entropy Population Synthesis via Persistent Contrastive Divergence

可扩展的最大熵人口合成 via 持续对比散度

Mirko Degli Esposti

机构 * Department of Physics and Astronomy, City Science Lab University of Bologna(物理与天文学系,城市科学实验室博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出GibbsPCDSolver方法,通过持续对比散度实现高效最大熵人口合成,解决了传统方法在计算效率和样本多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06355 2026-04-20 cs.LG 57%

An Information-Geometric Approach to Artificial Curiosity

基于信息几何的人工好奇心方法

Alexander Nedergaard, Pablo A. Morales

机构 * Institute of Neuroinformatics University of Zurich and ETH Zurich(神经信息学研究所 苏黎世大学和苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于信息几何的框架,通过信息单调性和环境交互不变性约束内在奖励为严格凹函数,从而实现探索与利用的平衡,整合了基础探索方法。

Comments Comments: 24 pages, 2 figures; version accepted for publication at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15933 2026-04-20 math.OC cs.DS 50%

Online Trading as a Secretary Problem Variant

在线交易作为秘书问题变种

Xujin Chen, Xiaodong Hu, Changjun Wang, Yuchun Xiong, Qingjie Ye

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在线交易中的秘书问题变种,提出了一种在线算法,实现强竞争比3.523,同时针对弱竞争比设计了简单算法,得出了零售价情况下的新结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15561 2026-04-20 eess.IV cs.CV 50%

CTSCAN: Evaluation Leakage in Chest CT Segmentation and a Reproducible Patient-Disjoint Benchmark

CTSCAN:评估泄漏在胸部CT分割中的影响及可重复的患者不重叠基准

Anton Ivchenko

机构 * Apple(苹果公司)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出CTSCAN基准,通过可重复的患者不重叠评估方法,揭示了训练与测试数据混合导致的性能虚高问题,并展示了去除患者重叠对分割指标的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00663 2026-04-20 cs.RO 50%

Optimal Solutions for the Moving Target Vehicle Routing Problem via Branch-and-Price with Relaxed Continuity

通过放松连续性进行分支定价求解移动目标车辆路径问题的最优解

Anoop Bhat, Geordan Gutow, Zhongqiang Ren, Sivakumar Rathinam, Howie Choset

机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人研究所) Mechanical and Aerospace Engineering at Michigan Technological University(密歇根技术大学机械与航空航天工程系) UM-SJTU Joint Institute and Department of Automation at Shanghai Jiao Tong University(上海交通大学与UM-SJTU联合研究所及自动化系) Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(德克萨斯大学阿姆斯特朗分校机械工程系和计算机科学与工程系)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种新的分支定价与放松连续性算法,用于求解移动目标车辆路径问题,通过改进的标签算法有效解决定价子问题,并在25个目标实例中展示出比现有方法快数倍的求解速度。

Comments Accepted to ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏