arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2604.10286 2026-04-14 cs.AI 74%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27905 2026-04-07 cs.LG 74%

ATLAS-RTC: Closing the Loop on LLM Agent Output with Token-Level Runtime Control

ATLAS-RTC:通过令牌级运行时控制闭合LLM代理输出的循环

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 ATLAS-RTC通过实时监控和干预减少解码错误,提升任务成功率和效率,实现LLM系统中的运行时控制新层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00293 2026-04-02 cs.LG stat.ML 74%

SYNTHONY: A Stress-Aware, Intent-Conditioned Agent for Deep Tabular Generative Models Selection

SYNTHONY:一种考虑压力的、基于意图的深度表格生成模型选择代理

Hochan Son, Xiaofeng Lin, Jason Ni, Guang Cheng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本文提出SYNTHONY,一种基于意图的表格生成模型选择框架,通过压力分析选择最佳合成器,提升模型在不同数据分布下的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 74%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01023 2026-03-03 cs.RO cs.AI 74%

An Open-Source Modular Benchmark for Diffusion-Based Motion Planning in Closed-Loop Autonomous Driving

面向闭环自动驾驶的开源模块化扩散运动规划基准

Yun Li, Simon Thompson, Yidu Zhang, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(信息科学与技术研究生学校,东京大学) TIER IV, Inc.(TIER IV公司)

专题命中 Agent评测 :planning(title);分类 cs.AI

AI总结 本研究提出开源模块化扩散运动规划基准,通过分解单体规划器并实现原生C++去噪循环,实现实车部署中运行时可配置的求解器参数和去噪过程的可观测性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 74%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 Agent评测 :agentic(title);分类 cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13832 2026-02-17 cs.CL 74%

Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind

超越词语:通过心灵理论评估和弥合用户代理交互中的认知分歧

Minyuan Ruan, Ziyue Wang, Kaiming Liu, Yunghwei Lai, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出通过心灵理论评估和弥合用户代理交互中的认知分歧,通过强化学习提升模型对用户心理状态的推理能力,从而增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12544 2026-02-16 cs.AI 74%

Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation

通过自动数据生成和细粒度评估扩展网络代理训练

Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Creighton Glasscock, Honglak Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出了一种基于约束的评估框架,通过自动数据生成和细粒度评估扩展网络代理训练,提升了训练数据质量和模型性能。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18225 2026-01-27 cs.AI 74%

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants

ShopSimulator: 评估和探索基于强化学习的LLM代理用于购物助手

Pei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Ken Deng, Qi Liu, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, Xuefeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出ShopSimulator,一个大规模中文购物环境,用于评估和探索基于强化学习的LLM代理在购物助手中的性能和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 74%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 74%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00332 2026-01-21 cs.AI cs.CE 74%

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

当幻觉成本百万:在高风险对抗性金融市场中基准测试AI代理

Zeshi Dai, Zimo Peng, Zerui Cheng, Ryan Yihe Li

机构 * Surf AI, Cybertino Lab(Surf AI,Cybertino 实验室) Princeton University(普林斯顿大学)

专题命中 Agent评测 :AI agent(title);分类 cs.AI

AI总结 CAIA基准测试揭示了AI在对抗性金融市场中的能力缺口,指出当前模型在面对虚假信息和不可逆决策时表现不佳,强调对抗鲁棒性对可信AI的重要性。

Comments 15 pages, 5 figures, 4 tables; Accepted to AAAI 2026 (AI-4-Finance Workshop - Oral, top 10%); In submission to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04692 2026-01-09 cs.CL cs.CV 74%

See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation

见、解释与干预:一种少样本多模态代理框架用于仇恨表情包审查

Naquee Rizwan, Subhankar Swain, Paramananda Bhaskar, Gagan Aryan, Shehryaar Shah Khan, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)Khargpur分校) Simbian

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出了一种少样本多模态代理框架,用于在有限数据条件下实现通用仇恨表情包审查,通过检测、解释和干预三方面提升审查效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 74%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20118 2026-01-08 cs.CL cs.CR 74%

TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agent

TrojanStego: 你的语言模型可能 secretly 成为一个隐写术隐私泄露代理

Dominik Meier, Jan Philip Wahle, Paul Röttger, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州检察署) Bocconi University(博科尼大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 TrojanStego通过语言隐写术在LLM输出中隐秘泄露敏感信息,展示了一种新型被动且危险的LLM数据外泄攻击方式。

Comments 9 pages, 5 figures To be presented in the Conference on Empirical Methods in Natural Language Processing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17066 2025-12-22 cs.AI 74%

Realistic threat perception drives intergroup conflict: A causal, dynamic analysis using generative-agent simulations

现实威胁感知驱动群体冲突:基于生成代理模拟的因果动态分析

Suhaib Abdurahman, Farzan Karimi-Malekabadi, Chenxiao Yu, Nour S. Kteily, Morteza Dehghani

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文通过生成代理模拟研究现实威胁与象征威胁对群体冲突的因果影响,发现现实威胁直接提升敌意,而象征威胁的影响需通过群体内偏见中介,非敌对接触可缓解冲突升级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 74%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 Agent评测 :workflow(title);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03138 2025-11-18 cs.AI 74%

DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents

Qi Li, Jianjun Xu, Pingtao Wei, Jiu Li, Peiqiang Zhao, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Wenqin Shao

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 Agent评测 :AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21244 2025-11-17 cs.AI 74%

VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series

Pengyu Xu, Shijia Li, Ao Sun, Feng Zhang, Yahan Li, Bo Wu, Zhanyu Ma, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Rui Wang, Yang Liu, Xiaobo Hu, Fan Yang, Jia Zheng, Guanghua Yao

机构 * Meituan(美团) Xbench Agora Beijing Jiaotong University(北京交通大学) BUPT(北京邮电大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20930 2025-10-21 quant-ph cs.LG q-fin.CP 74%

Quantum Reinforcement Learning Trading Agent for Sector Rotation in the Taiwan Stock Market

Chi-Sheng Chen, Xinyu Zhang, Ya-Chuan Chen

机构 * Neuro Industry Research(神经产业研究) Neuro Industry, Inc.(神经产业公司) Department of Computer Science(计算机科学系) The University of Alabama(阿拉巴马大学) Industrial Technology Research Institute(工业技术研究 institutes)

专题命中 Agent评测 :agent(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12033 2025-10-15 cs.AI 74%

CausalTrace: A Neurosymbolic Causal Analysis Agent for Smart Manufacturing

Chathurangi Shyalika, Aryaman Sharma, Fadi El Kalach, Utkarshani Jaimini, Cory Henson, Ramy Harik, Amit Sheth

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 8 pages, 4 figures, 3 tables, Accepted at AAAI 2026: IAAI - Innovative Applications of AI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18405 2025-09-24 cs.CV cs.AI 74%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09321 2025-09-12 cs.AI 74%

Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization

Hangyi Jia, Yuxi Qian, Hanwen Tong, Xinhui Wu, Lin Chen, Feng Wei

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16609 2025-08-26 physics.soc-ph cs.AI cs.CY cs.HC cs.RO 74%

Social Identity in Human-Agent Interaction: A Primer

Katie Seaborn

机构 * Institute of Science Tokyo(东京科学研究所) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 28 pages

Journal ref ACM Transactions on Human-Robot Interaction (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12472 2025-08-19 cs.AI 74%

GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11286 2025-08-18 cs.RO cs.AI cs.CV 74%

Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent

Che Rin Yu, Daewon Chae, Dabin Seo, Sangwon Lee, Hyeongwoo Im, Jinkyu Kim

机构 * Korea University(韩国大学) KT (Korea Telecom) R&D Center(KT(韩国电信)研发中心)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22326 2025-07-31 cs.AI 74%

An Explainable Emotion Alignment Framework for LLM-Empowered Agent in Metaverse Service Ecosystem

Qun Ma, Xiao Xue, Ming Zhang, Yifan Shen, Zihan Zhao

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) Tianjin Key Laboratory of Healhy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems(复杂管理系统计算与分析实验室) Faculty of Environment, Science and Economy(环境、科学与经济学院)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18190 2025-07-29 cs.CL 74%

TN-AutoRCA: Benchmark Construction and Agentic Framework for Self-Improving Alarm-Based Root Cause Analysis in Telecommunication Networks

Keyu Wu, Qianjin Yu, Manlin Mei, Ruiting Liu, Jun Wang, Kailai Zhang, Yelun Bao

专题命中 Agent评测 :agentic(title);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16412 2025-07-10 cs.CL 74%

InfoTech Assistant: A Multimodal Conversational Agent for InfoTechnology Web Portal Queries

Sai Surya Gadiraju, Duoduo Liao, Akhila Kudupudi, Santosh Kasula, Charitha Chalasani

机构 * School of Computing(计算学院) George Mason University(乔治·马歇尔大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Accepted by IEEE Big Data 2024

Journal ref IEEE BigData, Year: 2024, Pages: 3264-3272

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05321 2025-07-09 cs.CY cs.AI 74%

AGACCI : Affiliated Grading Agents for Criteria-Centric Interface in Educational Coding Contexts

Kwangsuk Park, Jiwoong Yang

机构 * AA LAB, MODULABS(AA实验室,MODULABS) Aiffel, MODULABS(Aiffel,MODULABS) Department of Statistics, Inha university(统计系,Inha大学)

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI

Comments Accepted at ICML 2025 Workshop on Multi-Agent Systems in the Era of Foundation Models: Opportunities, Challenges and Futures (MAS)

详情

展开后加载摘要…

URL PDF HTML 收藏