arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-15 至 2026-04-15 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2604.09121 2026-04-15 cs.CL cs.AI cs.SD 84%

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

交互式语音识别:迈向人样交互和语义连贯性评估的代理语音识别

Peng Wang, Yanqiao Zhu, Zixuan Jiang, Qinyuan Chen, Xingjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里巴巴集团 Tongyi 团队)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM的代理框架,通过语义反馈提升语音识别的语义准确性和交互修正能力,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07674 2026-04-15 q-fin.GN 83%

The relationship between general equilibrium models with infinite-lived agents and overlapping generations models, and some applications

一般均衡模型中无限寿命 agent 与重叠世代模型的关系及其一些应用

Ngoc-Sang Pham

专题命中 Agent评测 :agent(title_cn,summary_cn)

AI总结 本文研究了无限寿命 agent 一般均衡模型与重叠世代模型的关系,证明了两者在均衡条件下的相互转化,并探讨了其在经济应用中的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 83%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12717 2026-04-15 cs.AI 83%

Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning

通过现实世界案例学习实现自主代理的可迁移专业技能

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Letian Yang, Xukai Jiang

机构 * National Glycoengineering Research Center, Shandong University(山东大学糖工程研究中心) State Key Laboratory of Microbial Technology, Shandong University(山东省微生物技术重点实验室)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于案例学习的框架,通过将过往任务经验转化为可重用的知识资产,使自主代理能迁移先前经验以执行更结构化的分析,在六个复杂任务类别基准测试中表现优异,尤其在复杂任务上优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09729 2026-04-15 cs.CV cs.AI 83%

LOLGORITHM: Funny Comment Generation Agent For Short Videos

LOLGORITHM:短视频 funny 评论生成代理

Xuan Ouyang, Bouzhou Wang, Senan Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出LOLGORITHM框架,通过视频摘要、分类和语义检索生成符合平台文化的短视频评论,实验显示其在YouTube和抖音上的人类偏好选择率高达80.46%和84.29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 81%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 79%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12513 2026-04-15 cs.LG 79%

Agentic Control in Variational Language Models

变分语言模型中的代理控制

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国立艺术与工艺学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文研究变分语言模型能否通过内部证据实现最小化的代理控制,提出结合局部变分隐藏计算、结构感知检查点保留和校准的不确定性控制器,实验证明其在语言建模任务中优于确定性模型,并展示了更丰富的不确定性特征。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 70%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11969 2026-04-15 cs.AI 70%

Narrative-Driven Paper-to-Slide Generation via ArcDeck

通过ArcDeck实现叙事驱动的论文到幻灯片生成

Tarik Can Ozden, Sachidanand VS, Furkan Horoz, Ozgur Kara, Junho Kim, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Middle East Technical University(中东技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。

Comments Project webpage: https://arcdeck.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12626 2026-04-15 cs.RO cs.CV 67%

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS:一种高保真导航仿真器与动态高斯点云

Ziyuan Xia, Jingyi Xu, Chong Cui, Yuanhong Yu, Jiazhao Zhang, Qingsong Yan, Tao Ni, Junbo Chen, Xiaowei Zhou, Hujun Bao, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Peking University(北京大学) XGRIDS UDeer AI Shenzhen University(深圳大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出Habitat-GS,通过整合3D高斯点云渲染和可驾驶高斯化身,提升导航仿真的视觉真实性和动态人类建模能力,实验表明其在跨领域泛化和人类感知导航中表现优异。

Comments Project page: https://zju3dv.github.io/habitat-gs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09443 2026-04-15 cs.CL cs.AI 62%

Many-Tier Instruction Hierarchy in LLM Agents

多层级指令层级在大语言模型代理中的应用

Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Many-Tier Instruction Hierarchy (ManyIH) 以解决多源指令冲突,通过12层级的测试任务验证模型在复杂冲突场景下的表现,揭示了细粒度可扩展指令冲突解决的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12040 2026-04-15 cs.CR cs.AI cs.SE 62%

SIR-Bench: Evaluating Investigation Depth in Security Incident Response Agents

SIR-Bench:评估安全事件响应代理的调查深度

Daniel Begimher, Cristian Leo, Jack Huang, Pat Gaw, Bonan Zheng

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SIR-Bench基准,通过794个测试用例评估自主安全事件响应代理的调查能力,包含三类指标:分诊准确率、新证据发现率和工具使用恰当性。

Comments 9 pages, 6 tables, 1 figure. Equal contribution by first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12857 2026-04-15 cs.AI cs.RO cs.SY eess.SY 57%

Artificial Intelligence for Modeling and Simulation of Mixed Automated and Human Traffic

人工智能在混合自动化与人类交通建模与模拟中的应用

Saeed Rahmani, Shiva Rasouli, Daphne Cornelisse, Eugene Vinitsky, Bart van Arem, Simeon C. Calvert

机构 * Department of Transport & Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Industrial and Systems Engineering, University of Michigan, Dearborn(密歇根大学迪尔伯恩分校工业与系统工程系) Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在混合自动化与人类交通模拟中的应用,提出了一种分类方法,涵盖行为模型、环境模拟和认知物理方法,旨在填补现有研究的空白。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 57%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA 57%

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 57%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12904 2026-04-15 cs.CV 50%

A Sanity Check on Composed Image Retrieval

对组合图像检索的检验

Yikun Liu, Jiangchao Yao, Weidi Xie, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院, 上海交通大学, 中国) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机信息中心, 上海交通大学, 中国)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出FISD基准和多轮代理评估框架,通过精确控制图像变量和交互场景,提升组合图像检索方法的评估准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12382 2026-04-15 cs.NI 50%

Traffic-Aware Domain Partitioning and Load-Balanced Inter-Domain Routing for LEO Satellite Networks

面向交通的领域划分与负载均衡的跨领域路由方法用于低轨卫星网络

Chen Zhou, Jiangtao Luo, Yongyi Ran

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出DTAR方法,通过多目标NSGA-II算法生成领域划分并结合图注意力网络和PPO代理,实现低轨卫星网络中跨领域路由的负载均衡和可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 50%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06793 2026-04-15 eess.SY cs.SY 50%

Differentially Private Gradient-Tracking-Based Distributed Stochastic Optimization over Directed Graphs

基于差分隐私的梯度跟踪分布式随机优化算法研究:有向图上

Jialong Chen, Jimin Wang, Ji-Feng Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种在有向图上基于差分隐私的梯度跟踪分布式随机优化算法,通过在每个节点状态和跟踪变量中引入隐私噪声以防止信息泄露,并设计了两种新的步长和采样数方案,确保有限的累积隐私预算,并在非凸目标下实现几乎确定性和均方收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏