arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-15 至 2026-04-15 共收录 133 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2604.12162 2026-04-15 cs.CL 70%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11969 2026-04-15 cs.AI 70%

Narrative-Driven Paper-to-Slide Generation via ArcDeck

通过ArcDeck实现叙事驱动的论文到幻灯片生成

Tarik Can Ozden, Sachidanand VS, Furkan Horoz, Ozgur Kara, Junho Kim, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Middle East Technical University(中东技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。

Comments Project webpage: https://arcdeck.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12626 2026-04-15 cs.RO cs.CV 67%

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS:一种高保真导航仿真器与动态高斯点云

Ziyuan Xia, Jingyi Xu, Chong Cui, Yuanhong Yu, Jiazhao Zhang, Qingsong Yan, Tao Ni, Junbo Chen, Xiaowei Zhou, Hujun Bao, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Peking University(北京大学) XGRIDS UDeer AI Shenzhen University(深圳大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出Habitat-GS,通过整合3D高斯点云渲染和可驾驶高斯化身,提升导航仿真的视觉真实性和动态人类建模能力,实验表明其在跨领域泛化和人类感知导航中表现优异。

Comments Project page: https://zju3dv.github.io/habitat-gs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09443 2026-04-15 cs.CL cs.AI 62%

Many-Tier Instruction Hierarchy in LLM Agents

多层级指令层级在大语言模型代理中的应用

Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Many-Tier Instruction Hierarchy (ManyIH) 以解决多源指令冲突,通过12层级的测试任务验证模型在复杂冲突场景下的表现,揭示了细粒度可扩展指令冲突解决的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12040 2026-04-15 cs.CR cs.AI cs.SE 62%

SIR-Bench: Evaluating Investigation Depth in Security Incident Response Agents

SIR-Bench:评估安全事件响应代理的调查深度

Daniel Begimher, Cristian Leo, Jack Huang, Pat Gaw, Bonan Zheng

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SIR-Bench基准,通过794个测试用例评估自主安全事件响应代理的调查能力,包含三类指标:分诊准确率、新证据发现率和工具使用恰当性。

Comments 9 pages, 6 tables, 1 figure. Equal contribution by first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12857 2026-04-15 cs.AI cs.RO cs.SY eess.SY 57%

Artificial Intelligence for Modeling and Simulation of Mixed Automated and Human Traffic

人工智能在混合自动化与人类交通建模与模拟中的应用

Saeed Rahmani, Shiva Rasouli, Daphne Cornelisse, Eugene Vinitsky, Bart van Arem, Simeon C. Calvert

机构 * Department of Transport & Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Industrial and Systems Engineering, University of Michigan, Dearborn(密歇根大学迪尔伯恩分校工业与系统工程系) Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在混合自动化与人类交通模拟中的应用,提出了一种分类方法,涵盖行为模型、环境模拟和认知物理方法,旨在填补现有研究的空白。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 57%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA 57%

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 57%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12904 2026-04-15 cs.CV 50%

A Sanity Check on Composed Image Retrieval

对组合图像检索的检验

Yikun Liu, Jiangchao Yao, Weidi Xie, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院, 上海交通大学, 中国) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机信息中心, 上海交通大学, 中国)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出FISD基准和多轮代理评估框架,通过精确控制图像变量和交互场景,提升组合图像检索方法的评估准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12382 2026-04-15 cs.NI 50%

Traffic-Aware Domain Partitioning and Load-Balanced Inter-Domain Routing for LEO Satellite Networks

面向交通的领域划分与负载均衡的跨领域路由方法用于低轨卫星网络

Chen Zhou, Jiangtao Luo, Yongyi Ran

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出DTAR方法,通过多目标NSGA-II算法生成领域划分并结合图注意力网络和PPO代理,实现低轨卫星网络中跨领域路由的负载均衡和可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 50%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06793 2026-04-15 eess.SY cs.SY 50%

Differentially Private Gradient-Tracking-Based Distributed Stochastic Optimization over Directed Graphs

基于差分隐私的梯度跟踪分布式随机优化算法研究:有向图上

Jialong Chen, Jimin Wang, Ji-Feng Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种在有向图上基于差分隐私的梯度跟踪分布式随机优化算法,通过在每个节点状态和跟踪变量中引入隐私噪声以防止信息泄露,并设计了两种新的步长和采样数方案,确保有限的累积隐私预算,并在非凸目标下实现几乎确定性和均方收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏