arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15704 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15704 篇

2605.24309 2026-05-26 cs.CR 78%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22114 2026-05-25 eess.SY cs.SY 78%

Bearing-Only Solution to the Fermat-Weber Location Problem for Unicycle Agent

独轮车代理的Fermat-Weber位置问题的纯方位解

Hong Liang Cheah, Mohammad Deghat, Jose Guivant

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对独轮车代理的非完整约束,提出纯方位控制律以解决Fermat-Weber位置问题,包括静止信标、饱和输入和移动信标情况,并通过仿真和实验验证有效性。

Comments This paper has been accepted for presentation at the 23rd IFAC World Congress

Journal ref 23rd IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 78%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18768 2026-05-20 cs.IR cs.HC cs.MA 78%

ClinQueryAgent: A Conversational Agent for Population Health Management

ClinQueryAgent:一种用于群体健康管理的对话代理

Joseph S. Boyle, Anthony Dranfield, Mike O'Neil, Maria Liakata, Alison Q. Smithard

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ClinQueryAgent,一种将自然语言群体健康问题转化为可执行数据库查询的对话代理系统,通过本地和外部知识库的结合,实现安全高效的健康信息处理。

Comments 11 pages, 4 figures. Submitted to ACL Systems Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12297 2026-05-19 q-bio.TO q-bio.QM 78%

A stochastic agent-based model for simulating tumor-immune dynamics and evaluating therapeutic strategies

一种随机代理模型用于模拟肿瘤-免疫动态并评估治疗策略

Yuhong Zhang, Chenghang Li, Boya Wang, Jinzhi Lei

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种随机代理模型,整合细胞异质性、空间细胞间相互作用和药物抗性进化,用于模拟肿瘤生长和免疫反应,并评估不同治疗策略的效果。

Comments 26 pages, 13 figures

Journal ref MBE, 2026, 23(5):1402-1436

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15473 2026-05-18 cs.CY 78%

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

以验证假设为视角评估AI代理的人性化程度

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin

专题命中 Agent评测 :AI agent(title);agent(abstract)

AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10796 2026-05-14 cs.RO 78%

Follow-Bench: A Unified Motion Planning Benchmark for Socially-Aware Robot Person Following

Follow-Bench:一种用于社交感知机器人跟随的统一运动规划基准

Hanjing Ye, Weixi Situ, Jianwei Peng, Yu Zhan, Bingyi Xia, Kuanqi Cai, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(深圳机器人与计算机视觉重点实验室) Southern University of Science and Technology(南方科技大学) Human-Robot Interfaces and Interaction Laboratory(人机交互实验室) Istituto Italiano Di Tecnologia(意大利技术研究院) Swiss Federal Technology Institute of Lausanne(洛桑联邦理工学院)

专题命中 Agent评测 :planning(title,abstract)

AI总结 本文提出首个全面研究机器人跟随问题,介绍统一基准模拟多样场景,重新实现八种代表性规划器,评估最佳性能规划器以揭示现实部署挑战。

Comments Project page: https://follow-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11874 2026-05-13 cs.IR 78%

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems

RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试

Wenwen Zeng, Jinhui Zhang, Hao Chen, Zhaoyu Hu, Yongqi Liang, Jiajun Chai, Dengcan Liu, Zhenfeng Liu, Shurui Yan, Minglong Xue, Xiaohan Wang, Wei Lin, Guojun Yin

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24661 2026-05-11 cs.RO 78%

Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations

以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制

Zhengru Fang, Yu Guo, Fei Liu, Yuang Zhang, Yihang Tao, Senkang Hu, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。

Comments Source code is available at https://github.com/fangzr/aco-moe-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 78%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 78%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 78%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agentic(title);planning(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21850 2026-05-01 cond-mat.mtrl-sci 78%

OptiMat Alloys: a FAIR, living database of multi-principal element alloys enabled by a conversational agent

OptiMat 合金:由对话代理驱动的多主元合金FAIR活数据库

Yang Hu, Vladyslav Turlo

专题命中 Agent评测 :agent(title,abstract)

AI总结 OptiMat Alloys通过对话代理实现多主元合金探索,结合活数据库、网页界面和不确定性量化,使计算合金筛选更易用,拓展FAIR原则至按需知识生成。

Comments See demo here https://youtu.be/lQzuorkzPMc

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07014 2026-04-29 physics.soc-ph cs.SI 78%

When cardinals strategize: An agent-based model of influence and ideology for the papal conclave

当基数策略化:一个关于影响力和意识形态的代理模型,用于教皇选举会议

Nuno Crokidakis

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出并分析了两个基于代理的模型,研究教皇选举会议的动力学,探讨社会影响、战略投票和意识形态一致如何影响选举教皇所需时间。模型引入了意识形态集团,通过模拟发现意识形态极化会延迟选举,但较高的战略响应性可提高效率。

Comments 15 pages, 5 figures, to appear in Chaos, Solitons & Fractals

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 78%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19112 2026-04-27 cs.CY 78%

Governed Auditable Decisioning Under Uncertainty: Synthesis and Agentic Extension

在不确定性下的治理可审计决策:综合与代理扩展

Oleg Solozobov

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文综合了治理证据框架,分析其在四种决策系统架构中的可迁移性,揭示了治理覆盖梯度及代理系统中的结构性断裂问题。

Comments 24 pages, 2 tables. Companion artifact: Governance Benchmark Dataset (https://doi.org/10.5281/zenodo.19248723)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21740 2026-04-27 cs.CY cs.SI physics.soc-ph 78%

Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究

Aleksandar Tomašević, Darja Cvetković, Sara Major, Slobodan Maletić, Miroslav Anđelković, Ana Vranić, Boris Stupovski, Dušan Vudragović, Aleksandar Bogojević, Marija Mitrović Dankulov

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20193 2026-04-23 cs.RO 78%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16346 2026-04-23 cs.HC cs.CY 78%

DR. INFO at the Point of Care: A Prospective Pilot Study of Physician-Perceived Value of an Agentic AI Clinical Assistant

DR. INFO在临床一线:医师对代理AI临床助手的感知价值前瞻性试点研究

Rogerio Corga Da Silva, Miguel Romano, Tiago Mendes, Marta Isidoro, Sandhanakrishnan Ravichandran, Shivesh Kumar, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本研究评估DR.INFO在临床实践中对医师时间效率、决策支持和满意度的影响,发现医师普遍认可其价值,但需进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16342 2026-04-21 cs.HC 78%

SAGE: Sensor-Augmented Grounding Engine for LLM-Powered Sleep Care Agent

SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理

Hansoo Lee, Yoonjae Cho, Sonya S. Kwak, Rafael A. Calvo

专题命中 Agent评测 :agent(title,abstract)

AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。

Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05808 2026-04-20 cs.CL cs.AI cs.LG 78%

EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis

EnvScaler:通过程序合成实现LLM代理的可扩展工具交互环境

Xiaoshuai Song, Haofei Chang, Guanting Dong, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EnvScaler框架,通过程序合成构建大量工具交互环境,用于LLM代理的监督微调和强化学习,提升其在复杂多轮多工具交互环境中的任务解决能力。

Comments Add some experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 78%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 Agent评测 :agent(title,abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 78%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06762 2026-04-09 cs.CR 78%

ARuleCon: Agentic Security Rule Conversion

ARuleCon:代理安全规则转换

Ming Xu, Hongtai Wang, Yanpei Guo, Zhengmin Yu, Weili Han, Hoon Wei Lim, Jin Song Dong, Jiaheng Zhang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。

Comments This paper has been accepted for publication at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06450 2026-04-09 quant-ph physics.bio-ph 78%

Agent Choice via Quantum Flux in Living Systems

生物系统中的量子流代理选择

R. E. Kastner

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个将生物体的主动意图性选择置于物理基础的模型,通过量子态与代理选择的多对一关系,实现非预设但符合物理定律的选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15432 2026-04-09 cs.CV 78%

Gym-V: A Unified Vision Environment System for Agentic Vision Research

Gym-V: 一个统一的视觉环境系统用于代理视觉研究

Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh

机构 * ModalMinds

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Gym-V通过统一的179个程序生成视觉环境,解决了视觉代理研究中缺乏标准化基础设施的问题,发现观察支架比RL算法选择更关键,且跨领域迁移实验显示多样化训练能广泛泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04619 2026-04-07 cs.DC 78%

Tight Bounds on Window Size and Time for Single-Agent Graph Exploration under T-Interval Connectivity

单Agent图探索下T-区间连通性中窗口大小和时间的紧界

Yuichi Sudo, Naoki Kitamura, Masahiro Shibata, Junya Nakamura, Sébastien Tixeuil, Toshimitsu Masuzawa, Koichi Wada

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究单Agent在T-区间连通图中的确定性探索,分析窗口大小和探索时间的紧界,提出算法并证明其最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01416 2026-04-03 econ.GN q-fin.EC 78%

Pay-Per-Crawl Pricing for AI: The LM-Tree Agent

按爬取付费定价机制:LM-树代理

Richard Archer, Soheil Ghili, Nima Haghpanah

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出LM-树代理,通过LLM发现内容差异,实现动态定价,提升收益40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00518 2026-04-03 cs.CY 78%

Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum

智能体在受挑战时会修复还是仅回应?挑战、修复与公共纠正在一个部署的智能体论坛中的探讨

Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究比较了部署的智能体论坛Moltbook与Reddit社区,发现Moltbook讨论线程较少,挑战回应率低,修复机制缺失,表明社区维持互动过程对规范教学和修订的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03823 2026-04-02 cs.SE cs.AI cs.CL 78%

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

SWE-CI:通过持续集成评估代理在维护代码库中的能力

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Skylenage

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏