arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-13 至 2026-04-13 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 23 篇

2604.08970 2026-04-13 cs.CL cs.AI cs.HC cs.MA 88%

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

Litmus (Re)Agent:一种用于多语言模型预测评估的基准和代理系统

Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury

机构 * Microsoft Corporation, India(微软公司(印度)) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出Litmus (Re)Agent代理系统,通过结构化代理推理方法,在缺乏直接证据的情况下评估多语言模型性能,尤其在转移密集场景中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06111 2026-04-13 cs.AI cs.CL 84%

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

AgentCE-Bench: 一种可配置的智能体评估基准,具备可扩展的视野和可控难度,在轻量环境中

Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC (Japan)(日本国立信息学研究所LLMC) University of Zurich(苏黎世大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 AgentCE-Bench通过可扩展视野和可控难度,解决现有基准的高交互开销和任务分布不平衡问题,提供可靠、可解释的智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09470 2026-04-13 cs.CL 83%

Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL

代理Jackal:用于文本到JQL的实时执行与语义价值接地

Vishnu Murali, Anmol Gulati, Elias Lumer, Kevin Frank, Sindy Campagna, Vamse Kumar Subbiah

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI 83%

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07142 2026-04-13 cs.HC cs.AI 83%

Exploring Teachers' Perspectives on Using Conversational AI Agents for Group Collaboration

探索教师使用对话式AI代理进行小组协作的视角

Prerna Ravi, Carúmey Stevens, Beatriz Flamia Azevedo, Jasmine David, Brandon Hanks, Hal Abelson, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院) Instituto Politécnico de Bragança(布拉干萨理工学院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究探讨教师如何感知对话式AI代理对小组协作的影响,揭示设计中的核心矛盾及教学应用考量。

Comments Accepted to 27th International Conference on AI in Education (AIED) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09378 2026-04-13 cs.CR cs.AI 79%

BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning

BadSkill: 通过模型-技能污染对代理技能进行后门攻击

Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(里海大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对代理技能中嵌入的模型提出后门攻击,通过污染技能中的模型实现隐蔽攻击,验证了在不同模型规模和扰动类型下的有效性,并指出模型承载技能作为代理生态系统中的新型供应链风险。

Comments 4 pages, 4 fIGURES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09212 2026-04-13 cs.CL cs.MA 79%

SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation

SPASM:面向多轮对话生成的稳定人格驱动代理模拟

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出SPASM框架,通过人格创建、对话生成和终止检测模块,提升多轮对话生成的稳定性,采用ECP方法减少人格漂移和回声现象。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Our code and data are available at https://github.com/lhannnn/SPASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08551 2026-04-13 cs.CR cs.CY cs.LG 79%

Self-Sovereign Agent

自主主权代理

Wenjie Qu, Xuandong Zhao, Jiaheng Zhang, Dawn Song

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究自主主权代理的前景,探讨其经济自给和自主运行能力,分析技术障碍及安全、社会和治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 70%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 67%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08727 2026-04-13 cs.CY 67%

Communicate-Predict-Act: Evaluating Social Intelligence of Agents

沟通-预测-行动:评估智能体的社会智能

David Shoresh, Sarit Kraus, Yonatan Loewenstein

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 本文通过混合合作与竞争的社会游戏,评估LLM的社会智能,发现社会智能的多维特征,揭示影响智能体成功的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04334 2026-04-13 cs.LG cs.AI 62%

Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications

提升分布强化学习:分析与医疗应用

Zequn Chen, Wesley J. Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。

Comments Preprint. 40 pages,11 figures. Supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08798 2026-04-13 cs.CL cs.AI 62%

Structured Uncertainty guided Clarification for LLM Agents

结构不确定性引导的LLM代理澄清

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出结构不确定性框架,通过量化潜在问题的澄清价值,提升LLM代理在模糊任务中的推理效率和训练效率,展示了其在SAGE-Agent和ClarifyBench中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09413 2026-04-13 cs.CY cs.AI 57%

Yes, But Not Always. Generative AI Needs Nuanced Opt-in

是的,但并非总是如此。生成式AI需要细致的明确同意

Wiebke Hutiri, Morgan Scheuerman, Shruti Nagpal, Austin Hoag, Alice Xiang

机构 * Sony AI(索尼人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨生成式AI中单一同意模式的不足,提出在推理阶段实施细致的明确同意机制,以平衡权利持有者与AI开发者之间的权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21588 2026-04-13 q-bio.NC cs.LG 57%

Contribution of task-irrelevant stimuli to drift of neural representations

任务无关刺激对神经表示漂移的贡献

Farhad Pashakhanloo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了任务无关刺激如何通过学习噪声导致神经表示的长期漂移,探讨了不同架构和学习规则下的漂移机制及任务相关性。

Comments NeurIPS 2025 (camera ready)

Journal ref Advances in Neural Information Processing Systems (NeurIPS) 39 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 57%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08805 2026-04-13 cs.CR cs.AI 57%

Building Better Environments for Autonomous Cyber Defence

构建更好的自主网络防御环境

Chris Hicks, Elizabeth Bates, Shae McFadden, Isaac Symes Thompson, Myles Foley, Ed Chapman, Nickolas Espinosa Dice, Ankita Samaddar, Joshua Sylvester, Himanshu Neema, Nicholas Butts, Nate Foster, Ahmad Ridley, Zoe M, Paul Jones

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cornell University(康奈尔大学) Vanderbilt University(范德比尔特大学) Microsoft(微软) NSA(美国国家安全局)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过工作坊总结,提出构建更有效的强化学习环境框架和最佳实践指南,以提升自主网络防御系统的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08788 2026-04-13 cs.CL 57%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04292 2026-04-13 cs.CL 57%

SQuARE: Structured Query & Adaptive Retrieval Engine For Tabular Formats

SQuARE:结构化查询与自适应检索引擎用于表格格式

Chinmay Gondhalekar, Urjitkumar Patel, Fang-Chun Yeh

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SQuARE通过结构化查询和自适应检索引擎解决表格中多行标题、合并单元格等问题,提升表格问答精度与鲁棒性。

Comments Accepted in The IEEE International Workshop on Large Language Models in Finance, Dec 8-11, Macau, China, 2025, Preprint Copy

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07514 2026-04-13 cs.CV cs.AI 57%

Mitigating Domain Drift in Multi Species Segmentation with DINOv2: A Cross-Domain Evaluation in Herbicide Research Trials

通过DINOv2缓解多物种分割中的领域漂移:在除草剂研究试验中的跨领域评估

Artzai Picon, Itziar Eguskiza, Daniel Mugica, Javier Romero, Carlos Javier Jimenez, Eric White, Gabriel Do-Lago-Junqueira, Christian Klukas, Ramon Navarra-Mestre

机构 * TECNALIA, Basque Research and Technology Alliance (BRTA)(TECNALIA,巴斯克研究与技术联盟(BRTA)) University of the Basque Country(巴斯克大学) BASF Corporation(巴斯夫公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出利用DINOv2和层级分类推理提升多物种分割在农业环境中的鲁棒性,通过多地区、多设备和多传感器的实验验证了模型在领域漂移下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09322 2026-04-13 cs.NI 50%

EYWA: Elastic Load-Balancing and High-Availability Wired Virtual Network Architecture

EYWA:弹性负载均衡与高可用性有线虚拟网络架构

Wookjae Jeong, Jungin Jung

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出EYWA架构,解决IaaS虚拟网络在高可用性和负载均衡方面的挑战,通过逻辑隔离虚拟局域网、无瓶颈的网络地址转换及扩展层2语义实现大规模数据中心的扩展。

Comments 11 pages, 15 figures, proof-of-concept implementation and evaluation included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09056 2026-04-13 cs.CR cs.CE 50%

Conversations Risk Detection LLMs in Financial Agents via Multi-Stage Generative Rollout

通过多阶段生成 rollout 检测金融代理中的对话风险

Xiaotong Jiang, Jun Wu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出FinSec框架,通过多阶段生成rollout方法检测金融代理中的对话风险,提升高风险对话检测的鲁棒性,实验显示其在F1分数、ASR和AUPRC等方面均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13934 2026-04-13 eess.SP 50%

Deep Reinforcement Learning-Based Dynamic Resource Allocation in Cell-Free Massive MIMO

基于深度强化学习的细胞-Free大规模MIMO系统动态资源分配

Phuong Nam Tran, Nhan Thanh Nguyen, Hien Quoc Ngo, Markku Juntti

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于深度强化学习的动态资源分配方法,通过优化天线激活与功率控制提升能效,实验表明在40个AP和20个用户系统中实现了50%的能效提升和3350倍的运行时间减少。

Comments This paper has been accepted for presentation at the IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏