arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-19 至 2026-03-19 共收录 142 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2603.15639 2026-03-19 cs.AI 83%

The Comprehension-Gated Agent Economy: A Robustness-First Architecture for AI Economic Agency

基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。

Comments v2: updated correspondence email

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17017 2026-03-19 cs.CL cs.AI 81%

LLM NL2SQL Robustness: Surface Noise vs. Linguistic Variation in Traditional and Agentic Settings

LLM NL2SQL鲁棒性:传统与智能设置中表面噪声与语言变异的比较

Lifu Tu, Rongguang Wang, Tao Sheng, Sujjith Ravi, Dan Roth

机构 * Oracle AI

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文评估了NL2SQL系统在表面噪声和语言变异下的鲁棒性,发现传统和智能设置中模型表现各异,揭示了实现鲁棒NL2SQL系统的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22077 2026-03-19 cs.HC 78%

ViSTAR: Virtual Skill Training with Augmented Reality with 3D Avatars and LLM coaching agent

ViSTAR: 基于增强现实的虚拟技能训练系统,结合3D虚拟角色和LLM教练代理

Chunggi Lee, Hayato Saiki, Tica Lin, Eiji Ikeda, Kenji Suzuki, Chen Zhu-Tian, Hanspeter Pfister

专题命中 Agent评测 :agent(title,abstract)

AI总结 ViSTAR通过AR技术提供篮球技能训练,利用3D虚拟角色和LLM教练代理提供平衡、姿势和节奏反馈,提升自我观察和运动修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03866 2026-03-19 q-bio.PE cs.SI 78%

Generating a Contact Matrix for Aged Care Settings in Australia: an agent-based model study

在澳大利亚养老机构中生成接触矩阵:一种基于代理的模型研究

Haley Stone, C. Raina MacIntyre, Mohana Kunasekaran, Chris Poulos, David Heslop

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于代理的模型生成高分辨率养老机构接触矩阵,通过模拟任务驱动行为、员工工作流程和共享空间移动,揭示不同护理级别和员工班次的接触模式差异,验证了接触模式与日常活动的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-03-19 cs.CR cs.AI cs.PL 77%

PAuth - Precise Task-Scoped Authorization For Agents

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Zhiqiang Lin, Shuo Chen

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 76%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17820 2026-03-19 cs.LG 70%

Federated Distributional Reinforcement Learning with Distributional Critic Regularization

联邦分布式强化学习与分布批评正则化

David Millard, Cecilia Alm, Rashid Ali, Pengcheng Shi, Ali Baheri

机构 * Dept. of Mechanical Engineering, Rochester Institute of Technology(机械工程系,罗切斯特理工学院) Dept. of Psychology and School of Information, Rochester Institute of Technology(心理学系和信息学院,罗切斯特理工学院) Department of Engineering Science, University West(工程科学系,西大学) Golisano College of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学学院,罗切斯特理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出FedDistRL和TR-FedDistRL,通过分布批评正则化提升安全性和稳定性,在多任务环境中表现出更低的均值模糊和更高的安全指标。

Comments 9 pages, 4 Figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17058 2026-03-19 cs.GT cs.MA cs.RO cs.SY eess.SY math.OC 67%

Asymmetric Nash Seeking via Best Response Maps: Global Linear Convergence and Robustness to Inexact Reaction Models

不对称纳什寻求 via 最佳反应映射:全局线性收敛性与对不精确反应模型的鲁棒性

Mahdis Rabbani, Navid Mojahed, Shima Nazari

机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文研究了不对称信息双玩家约束博弈的全局线性收敛性和对不精确反应模型的鲁棒性,提出了一种不对称投影梯度下降-最佳反应迭代方法,证明了在最佳反应映射精确时的全局线性收敛性,并分析了不精确情况下的误差界。

Comments 6 Pages, 2 Figures, Preprint submitted to IEEE L-CSS and CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17683 2026-03-19 cs.AI cs.LG 62%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17385 2026-03-19 cs.LG cs.AI cs.CV 62%

Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction

Den-TP:一种基于密度平衡的数据整理与评估框架用于轨迹预测

Ruining Yang, Yi Xu, Yun Fu, Lili Su

机构 * Northeastern University, USA(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Den-TP框架,通过密度感知的数据整理和评估方法,平衡轨迹预测数据集的密度分布,提升模型鲁棒性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17324 2026-03-19 cs.AI cs.LG 62%

ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling

ShuttleEnv:一种用于羽毛球策略建模的交互式数据驱动RL环境

Ang Li, Xinyang Gong, Bozhou Chen, Yunlong Lu, Jiaming Ji, Yongyi Wang, Yaodong Yang, Wenxin Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍ShuttleEnv,一种基于精英球员比赛数据的交互式数据驱动RL环境,通过显式概率模型模拟比赛动态,支持强化学习和战略行为分析,提供实时可视化以探索不同打法和策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 62%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO 57%

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17234 2026-03-19 cs.CY cs.AI 57%

Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients

一种集成电子健康记录的大型语言模型驱动工具在手术患者分诊中的部署与评估

Jane Wang, Timothy Keyes, April S Liang, Stephen P Ma, Jason Shen, Jerry Liu, Nerissa Ambers, Abby Pandya, Rita Pandya, Jason Hom, Natasha Steele, Jonathan H Chen, Kevin Schulman

机构 * Division of Hospital Medicine, Department of Medicine, Stanford University(斯坦福大学医院医学部,医学部) Stanford University School of Medicine(斯坦福大学医学院) Stanford Health Care, Technology and Digital Solutions(斯坦福健康,技术与数字解决方案) Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Stanford Health Care, Nursing Informatics(斯坦福健康,护理信息学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一种基于大型语言模型的工具,用于自动化手术患者分诊,通过电子健康记录实现,具有高灵敏度和中等特异性,展示了人工智能在医疗分诊中的应用价值。

Comments 35 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17446 2026-03-19 physics.pop-ph 50%

Why the Future Is Not Trading: Causally Inert Events as a Test for Time Travelers

为何未来并非交易:因果惰性事件作为时间旅行者的测试

David Awad

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过预测市场价格行为论证单时间线回溯时间旅行不存在,指出若理性代理人能回溯时间,二元预测合同价格会立即趋近0或1,但实际数据未显示此现象,从而提出可检验的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17153 2026-03-19 cs.GT 50%

Split-Merge Dynamics for Shapley-Fair Coalition Formation

联盟形成中的分裂-合并动态

Quanyan Zhu, Zhengye Han

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种动态分裂-合并框架,平衡个体公平与集体效率,通过拓扑操作信号实现公平和效率的动态平衡,证明算法在有限时间内收敛到Shapley-Fair且Merge-Stable的稳定状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16893 2026-03-19 eess.SY cs.SY econ.GN q-fin.EC 50%

Cleaner energy microgrids under market power and limited regulation in developing countries

发展中国家市场力量与有限监管下的清洁能源微电网

Elsa Bou Gebrael, Majd Olleik, Sebastian Zwickl-Bernhard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出双层博弈模型,研究发展中国家微电网中家庭光伏系统与柴油发电机公司间的电力交易问题,探讨价格上限和并网政策对家庭经济收益的影响。

Comments Submitted to a peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16873 2026-03-19 cs.HC cs.CV 50%

The Truth, the Whole Truth, and Nothing but the Truth: Automatic Visualization Evaluation from Reconstruction Quality

真相、全貌与仅有的真相:从重建质量自动可视化评估

Roxana Bujack, Li-Ta Lo, Ethan Stam, Ayan Biswas, David Rogers

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出一种无需大量人工标注数据的自动评估方法,通过评估可视化自身对原始数据的重建准确性来衡量可视化质量,从而提升AI驱动的可视化流程效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18098 2026-03-19 cs.GT 50%

Fair Orientations: Proportionality and Equitability

公平方向:比例性与公平性

Ankang Sun, Ruijie Wang, Bo Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究在相关性约束下不可分割物品的公平分配,探讨比例性和公平性等其他关键公平标准的可行性与计算复杂性。

Comments Accepted to AAMAS 2026. This is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19161 2026-03-19 cs.CV 50%

Benchmarking Endoscopic Surgical Image Restoration and Beyond

内窥手术图像修复与更广泛的评估

Jialun Pei, Diandian Guo, Donghui Yang, Zhixi Li, Yuxin Feng, Long Ma, Bo Du, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Southern Medical University(南方医科大学) Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出SurgClean数据集,用于评估内窥手术场景中的多种图像修复任务,揭示现有算法与临床需求间的差距,并从结构和语义角度分析手术与自然场景的退化差异。

Comments This work has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2511.17762 2026-03-19 cs.SE 83%

The Software Engineering Simulations Lab: Agentic AI for RE Quality Simulations

软件工程模拟实验室:面向RE质量的代理AI

Henning Femmer, Ivan Esau

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 本文提出利用代理AI进行RE质量模拟,通过标准化代理复制软件工程过程,为RE研究提供新工具和可行性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17902 2026-03-19 cs.CR cs.AI 79%

Differential Privacy in Generative AI Agents: Analysis and Optimal Tradeoffs

生成AI代理中的差分隐私:分析与最优权衡

Ya-Ting Yang, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 其他Agent :AI agent(title,abstract);分类 cs.AI

AI总结 本文从企业数据角度分析生成AI代理的隐私泄露问题,提出基于差分隐私的概率框架,推导隐私界限并优化温度参数选择。

详情

展开后加载摘要…

URL PDF HTML 收藏