arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15704 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15704 篇

2603.29798 2026-04-01 cs.CV 78%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22751 2026-03-31 cs.CR 78%

Observable Channels, Not Just Storage: Evaluating Privacy Leakage in LLM Agent Pipelines

可观察通道而非仅存储:评估LLM代理流水线中的隐私泄露

Tao Huang, Chen Hou, Guosen Wu, Jiayang Meng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出CIPL框架,通过统一的通道导向接口评估LLM代理流水线中的隐私泄露,揭示内存、检索和工具中介目标的泄露特性,强调通道条件而非单一攻击方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25195 2026-03-27 cs.HC 78%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12412 2026-03-26 econ.GN q-fin.EC 78%

Macroeconomic Forecasting from Input-Output Tables Alone: A Darwinian Agent-Based Approach with FIGARO Data

仅依靠投入产出表进行宏观经济预测:一种达尔文式基于代理的模拟方法与FIGARO数据

Martin Jaraiz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出利用达尔文式基于代理的模拟方法,仅通过投入产出表进行宏观经济预测,展示了其在不同国家的准确性和跨国家的可移植性,以及对经济冲击的传播机制。

Comments 50 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21251 2026-03-24 cs.NI eess.SP 78%

WirelessBench: A Tolerance-Aware LLM Agent Benchmark for Wireless Network Intelligence

WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准

Jingwen Tong, Fang Liu, Linkai Xv, Shiliang Lu, Kangqi Li, Yiqian Zhang, Yijie Song, Zeyang Xue, Jun Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。

Comments This paper is submitted to a possiable journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 78%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 Agent评测 :workflow(title,abstract)

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17417 2026-03-23 cs.CY cs.MA 78%

Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)

你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack

Zichen Tang, Zirui Zhang, Qian Wang, Zhenheng Tang, Bo Li, Xiaowen Chu

专题命中 Agent评测 :agent(title);agentic(abstract)

AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22077 2026-03-19 cs.HC 78%

ViSTAR: Virtual Skill Training with Augmented Reality with 3D Avatars and LLM coaching agent

ViSTAR: 基于增强现实的虚拟技能训练系统,结合3D虚拟角色和LLM教练代理

Chunggi Lee, Hayato Saiki, Tica Lin, Eiji Ikeda, Kenji Suzuki, Chen Zhu-Tian, Hanspeter Pfister

专题命中 Agent评测 :agent(title,abstract)

AI总结 ViSTAR通过AR技术提供篮球技能训练,利用3D虚拟角色和LLM教练代理提供平衡、姿势和节奏反馈,提升自我观察和运动修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03866 2026-03-19 q-bio.PE cs.SI 78%

Generating a Contact Matrix for Aged Care Settings in Australia: an agent-based model study

在澳大利亚养老机构中生成接触矩阵:一种基于代理的模型研究

Haley Stone, C. Raina MacIntyre, Mohana Kunasekaran, Chris Poulos, David Heslop

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于代理的模型生成高分辨率养老机构接触矩阵,通过模拟任务驱动行为、员工工作流程和共享空间移动,揭示不同护理级别和员工班次的接触模式差异,验证了接触模式与日常活动的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 78%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13110 2026-03-16 cs.OS 78%

AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems

AgentRM: 一种受操作系统启发的LLM代理系统资源管理器

Jianshu She

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出AgentRM,通过多级反馈队列调度和三级上下文生命周期管理,解决LLM代理系统中的资源调度失败和上下文退化问题,显著提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08036 2026-03-11 cs.DB 78%

Samyama: A Unified Graph-Vector Database with In-Database Optimization, Agentic Enrichment, and Hardware Acceleration

Samyama:一个统一的图-向量数据库,具有数据库内优化、代理增强和硬件加速

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Samyama是一款统一的图-向量数据库,结合了数据库内优化、代理增强和硬件加速,通过Rust实现高性能和内存安全性。

Comments 16 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07842 2026-03-10 q-bio.PE 78%

Simulating nationwide coupled disease and fear spread in an agent-based model

在基于代理的模型中模拟全国范围的疾病和恐惧传播

Joy Kitson, Prescott C. Alexander, Joseph Tuccillo, David J. Butts, Christa Brelsford, Abhinav Bhatele, Sara Y. Del Valle, Timothy C. Germann

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于代理的模型,模拟疾病和恐惧的传播,通过分析不同疾病状态和行为反应,揭示了耦合动态对流行病波的影响。

Comments 21 pages, 8 figures, 2 tables

Journal ref Scientific Reports, 15(1), 42235 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04559 2026-03-06 cond-mat.soft physics.bio-ph 78%

The importance of being discrete -- An agent-based model for active nematics and more

离散的重要性——一种用于主动向列相和更多应用的基于代理的模型

Mathieu Dedenon, Carles Blanch-Mercader, Karsten Kruse, Jens Elgeti

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于代理的模型,用于研究主动向列相中的自发流动和拓扑缺陷,展示了其在活材料描述中的广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 78%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 Agent评测 :agent(title,abstract)

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03671 2026-03-05 q-fin.CP q-fin.TR 78%

Is an investor stolen their profits by mimic investors? Investigated by an agent-based model

投资者是否因模仿者而损失了利润?通过基于代理的模型进行调查

Takanobu Mizuta, Isao Yagi

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的模型研究了投资者因模仿者而损失利润的问题,发现增加基本策略代理使市场稳定从而减少利润,而增加技术策略代理使市场波动从而增加利润。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01189 2026-03-03 cs.RO cs.HC 78%

Agent-Based Simulation of Trust Development in Human-Robot Teams: An Empirically-Validated Framework

基于代理的机器人团队信任发展模拟:一个经实证验证的框架

Ravi Kalluri

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个经实证验证的代理模型,用于模拟人类-机器人团队中的信任动态,揭示了机器人可靠性对信任和绩效的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01146 2026-03-03 cs.LO 78%

Uniform Agent-interpolation of Distributed Knowledge

分布式知识的统一代理插值

Youan Su

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种纯语法算法,用于确定具有分布式知识的模态逻辑K、KD和KT的统一插值公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 78%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 Agent评测 :agent(title,abstract)

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13772 2026-03-03 cs.GT 78%

Quantile agent utility and implications to randomized social choice

分位数代理效用及其对随机社会选择的影响

Ioannis Caragiannis, Fabian Frank, Sanjukta Roy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出分位数代理效用概念,通过比较代表者来评估随机结果,展示了在随机社会选择中效率、公平和无策略性可以同时满足的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04026 2026-03-02 cs.HC 78%

VeriWeb: Verifiable Long-Chain Web Benchmark for Agentic Information-Seeking

VeriWeb: 可验证的长链网络基准测试用于代理信息检索

Shunyu Liu, Minghao Liu, Huichi Zhou, Zhenyu Cui, Yang Zhou, Yuhao Zhou, Jialiang Gao, Heng Zhou, Yunhao Yang, Wendong Fan, puzhen zhang, Ge Zhang, Jiajun Shi, Weihao Xuan, Jiaxing Huang, Shuang Luo, Fang Wu, Heli Qi, Qingcheng Zeng, Junjie Wang, Aosong Feng, Jindi Lv, Sicong Jiang, Ziqi Ren, Wangchunshu Zhou, Zhenfei Yin, Wenlong Zhang, Guohao Li, Wenhao Yu, Lei Ma, Lei Bai, Qunshu Lin, Mingli Song, Dacheng Tao

专题命中 Agent评测 :agentic(title,abstract)

AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21548 2026-02-27 cs.DC 78%

DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference

DualPath: 突破代理LLM推理中的存储带宽瓶颈

Yongtong Wu, Shaoyuan Chen, Yinmin Zhong, Rilin Huang, Yixuan Tan, Wentao Zhang, Liyue Zhang, Shangyan Zhou, Yuxuan Liu, Shunfeng Zhou, Mingxing Zhang, Xin Jin, Panpan Huang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 DualPath通过双路径KV缓存加载技术,突破代理LLM推理中的存储带宽瓶颈,提升推理系统吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18745 2026-02-26 cs.RO 78%

A study on the effects of mixed explicit and implicit communications in human-artificial-agent interactions

人类-人工智能代理交互中混合显性与隐性沟通效果的研究

Ana Christina Almada Campos, Bruno Vilhena Adorno

机构 * The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探讨了人类与人工智能代理交互中混合显性与隐性沟通的效果,发现混合沟通能提升代理的接受度和透明度,但对任务执行时间影响不显著。

Comments Main paper with 28 pages, 14 figures, 4 tables. Supplementary material with 39 pages, 44 figures, 2 tables. Submitted to Intelligent Service Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19639 2026-02-24 cs.MA 78%

Effects of Property Recovery Incentives and Social Interaction on Self-Evacuation Decisions in Natural Disasters: An Agent-Based Modelling Approach

财产回收激励与社会互动对自然灾害中自我撤离决策的影响:基于代理的建模方法

Made Krisnanda, Raymond Chiong, Yang Yang, Kirill Glavatskiy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的建模方法,研究了财产回收激励和社会互动对自然灾害中家庭撤离决策的影响,发现社会网络结构和优先级设置对撤离率有显著影响。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14391 2026-02-17 cs.NI 78%

ASA: Adaptive Smart Agent Federated Learning via Device-Aware Clustering for Heterogeneous IoT

ASA: 通过设备感知聚类实现异构物联网的自适应智能代理联邦学习

Ali Salimi, Saadat Izadi, Mahmood Ahmadi, Hadi Tabatabaee Malazi

专题命中 Agent评测 :agent(title,abstract)

AI总结 ASA通过设备感知聚类实现异构物联网的自适应智能代理联邦学习,提升效率、可扩展性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12102 2026-02-13 cs.MA 78%

DEpiABS: Differentiable Epidemic Agent-Based Simulator

DEpiABS:可微分流行病基于代理的模拟器

Zhijian Gao, Shuxin Li, Bo An

专题命中 Agent评测 :agent(title,abstract)

AI总结 DEpiABS是一种可微分基于代理的流行病模拟器,通过平衡机理细节、计算效率和可解释性,提升流行病预测的准确性与通用性。

Comments 17 pages, 9 figures, to be published in AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06340 2026-02-09 cond-mat.stat-mech cond-mat.soft 78%

Ornstein-Uhlenbeck information particle: A new candidate of active agent

信息粒子:一种新的活性代理候选者

Xin Song, Xiji Shao, Yanwen Zhu, Cheng Yang, Linli He, Shigeyuki Komura, Zhanglin Hou

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于OU浴反馈控制的信息粒子,通过调整惯性效应和波动强度,实现两种不同运动模式,展示了其在活性代理中的潜力。

Comments 8 pages, 5 figures including 3 figures in main text and 2 figures in Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05671 2026-02-06 cs.HC 78%

(Computer) Vision in Action: Comparing Remote Sighted Assistance and a Multimodal Voice Agent in Inspection Sequences

行动中的视觉:比较远程视觉援助与多模态语音代理在检查序列中的表现

Damien Rudaz, Barbara Nino Carreras, Sara Merlino, Brian L. Due, Barry Brown

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究比较了远程视觉援助与多模态语音代理在检查任务中的表现,发现代理无法产生基于环境的视觉动作,从而缺乏关键资源。

Comments Conditionally accepted at CHI 2026, 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06189 2026-02-04 physics.soc-ph 78%

On the Effect of Missing Transmission Chain Information in Agent-Based Models: Outcomes of Superspreading Events and Workplace Transmission

关于代理模型中缺失传播链信息的影响:超传播事件和工作场所传播的后果

Sascha Korf, Sophia Johanna Wagner, Gerta Köster, Martin J. Kühn

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了代理模型中缺失传播链信息对流行病预测的影响,通过比较超传播事件和工作场所传播的不同场景,揭示简化假设对结果的影响。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21347 2026-01-30 eess.AS cs.SD 78%

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

迈向鲁棒的口吃语音识别:LLM代理在WER之外的ASR后修正

Xiuwen Zheng, Sixun Dong, Bornali Phukon, Mark Hasegawa-Johnson, Chang D. Yoo

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于LLM的代理用于ASR后修正,通过语义校正提升口吃语音识别的鲁棒性,实现WER降低和语义性能提升。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏