arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-17 至 2026-03-17 共收录 41 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 41 篇

2603.14468 2026-03-17 cs.CV cs.IR 90%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 Agent评测 :planning(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 88%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 85%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04632 2026-03-17 cs.LG 85%

Risk-Sensitive Agent Compositions

风险敏感型代理组合

Guruprerana Shabadi, Rajeev Alur

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出一种风险最小化方法,用于在代理组合中平衡任务成功率与安全、公平和隐私要求,通过动态规划和联合界估算近优解。

Comments 19 pages, 6 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 85%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 Agent评测 :agentic(title);agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 81%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15401 2026-03-17 cs.SE cs.AI 81%

SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?

SWE-Skills-Bench:代理技能在真实软件工程中的实际帮助有多大?

Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu

机构 * MBZUAI(莫扎德人工智能大学) Nanjing University(南京大学) South China University of Technology(华南理工大学) The University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-Skills-Bench,首个基于需求的基准,评估代理技能在真实软件工程中的边际效用,发现多数技能无明显提升,仅少数专业技能有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15483 2026-03-17 cs.AI 80%

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15457 2026-03-17 cs.CR cs.AI 79%

Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents

逃避式智能:从恶意软件分析中汲取的AI评估教训

Simone Aonzo, Merve Sahin, Aurélien Francillon, Daniele Perito

机构 * Eurecom SAP Labs(SAP实验室) Depthfirst

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13424 2026-03-17 cs.CR cs.AI 79%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 78%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 77%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 73%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15297 2026-03-17 cs.AI 70%

Evolutionary Transfer Learning for Dragonchess

进化迁移学习用于龙棋

Jim O'Connor, Annika Hoag, Sarah Goyette, Gary B. Parker

机构 * Computer Science Department, Connecticut College, New London, United States(康奈尔学院计算机科学系,新伦敦,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出利用进化迁移学习在龙棋中适应启发式评估函数,通过CMA-ES优化提升AI性能,展示了在复杂游戏领域中迁移学习的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 70%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 70%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 70%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 67%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13919 2026-03-17 cs.CV 67%

OpenCOOD-Air: Prompting Heterogeneous Ground-Air Collaborative Perception with Spatial Conversion and Offset Prediction

OpenCOOD-Air: 通过空间转换和偏移预测提示异构地面-空域协作感知

Xianke Wu, Songlin Bai, Chengxiang Li, Zhiyao Luo, Yulin Tian, Fenghua Zhu, Yisheng Lv, Yonglin Tian

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出OpenCOOD-Air框架,通过引入无人机作为扩展平台,解决V2V协作感知中的地面遮挡和传感器视角限制问题,采用迁移学习和跨域空间转换器提升感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21201 2026-03-17 cs.AI cs.CL cs.LG 67%

Aletheia tackles FirstProof autonomously

Aletheia 自主解决首个 FirstProof 挑战

Tony Feng, Junehyuk Jung, Sang-hyun Kim, Carlo Pagano, Sergei Gukov, Chiang-Chiang Tsai, David Woodruff, Adel Javanmard, Aryan Mokhtari, Dawsen Hwang, Yuri Chervonyi, Jonathan N. Lee, Garrett Bingham, Trieu H. Trinh, Vahab Mirrokni, Quoc V. Le, Thang Luong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Aletheia 基于 Gemini 3 Deep Think 自主解决 FirstProof 挑战中的 6 个问题,专家评估显示其在 10 个问题中表现突出,但问题 8 存在争议。

Comments 41 pages. Project page: https://github.com/google-deepmind/superhuman/tree/main/aletheia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14769 2026-03-17 cs.LG cs.AI 62%

POLCA: Stochastic Generative Optimization with LLM

POLCA:基于LLM的随机生成优化

Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLCA框架,通过生成语言模型作为优化器,结合数值奖励和文本反馈,解决复杂系统的随机生成优化问题,实现高效探索与利用的平衡,实验表明其在多种基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07112 2026-03-17 cs.CL cs.AI 62%

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

更多代理提升数学问题解决能力但对抗鲁棒性差距依然存在

Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多个代理在数学问答中的表现,发现协作提升准确性但对抗鲁棒性差距持续存在,人类错误仍是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 62%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15185 2026-03-17 cs.RO cs.AI cs.CV 57%

What Matters for Scalable and Robust Learning in End-to-End Driving Planners?

在端到端驾驶规划器中,可扩展性和鲁棒性学习中什么重要?

David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Max-Planck-Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文研究了端到端驾驶规划器中可扩展性和鲁棒性学习的关键因素,提出BevAD架构在Bench2Drive基准上达到72.7%的成功率,展示了纯模仿学习的数据扩展能力。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 57%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13773 2026-03-17 cs.CL 57%

LiveWeb-IE: A Benchmark For Online Web Information Extraction

LiveWeb-IE:一个在线网页信息提取的基准测试

Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出LiveWeb-IE基准测试,用于评估在线网页信息提取系统,通过活体网站和多阶段代理框架VGS,提升信息提取的准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13744 2026-03-17 cond-mat.mtrl-sci cs.AI 57%

Research Paradigm of Materials Science Tetrahedra with Artificial Intelligence

材料科学四面体与人工智能的研究范式

Shiyun Zhang, Yibo Yao, Haoquan Long, Dingwen Tao, Guangming Tan, Wei-Hua Wang, Yuan-Chao Hu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了经典材料四面体研究范式,并提出两个新的AI增强研究范式,旨在推动数据驱动和AI辅助的材料科学研究。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏